科大讯飞上线语音基座大模型Spark-Audio-1.0-Preview,基于全国产化算力训练。传统音频处理多采用级联方案,先转文字再理解,存在信息丢失(忽略语气、情绪、背景环境音)和链路割裂(语音转写、声纹识别等环节分离)两大短板,影响场景判断完整性。