【大屏时代】首页 > 3D快报内容详情

科大讯飞发布 Spark-Audio-1.0-Preview:全国产算力训练,覆盖 99 种语言、202 种方言

55分钟前 5 大屏时代

9月16日,科大讯飞发布语音基座大模型 Spark-Audio-1.0-Preview。最扎眼的标签是"全国产"——这个模型基于全国产化算力训练而成,从底层就把供应链风险挡在了门外。

能力上,Spark-Audio-1.0-Preview 支持文本和语音两个模态的输入、以文本模态输出,能接的活儿相当杂:语音转写、多语言翻译、多方言识别只是基本功,环境音识别、说话人识别、情感分析以及复杂的音频问答也都在射程之内。它一口气覆盖99种语言和202种方言识别,讯飞把这总结为智能语音完成从"听清"到"听懂"的跃升——过去机器追求把声波准确转成文字,现在它要分辨是谁在说、语调里藏着什么情绪、背景里有什么声音。

目前 Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。



相关文章

相关标签: 科大讯飞发布 Spark-Audio-1.0-Preview:全国产算力训练,覆盖 99 种语言、202 种方言