科大讯飞宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产化算力训练的语音基座大模型。
过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法有两个明显短板:一是信息丢失——文字只能记录说了什么,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景判断不完整;二是链路割裂——语音转写、声纹识别、语音翻译等能力被拆成独立模块串联运行,模块之间存在断点,容易累积错误,体验上也会出现延迟、卡顿。
语音基座大模型不再只做语音转文字,而是直接理解语音:一次性听懂人声、环境音、音乐等,还能理解声音里的语义、情绪和场景。
此次首发的 Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 30B-A3B(MoE 结构)的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。与讯飞星火大模型的“1+N”体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或系统。
官方称,Spark-Audio-1.0-Preview 在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。
该模型可支持 99 种语言及 202 种方言的识别。在多项任务中,与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,在多语言、多方言语音识别的平均效果上表现出优势;与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近。在 Fleurs、Kespeech、LibriSpeech 等中英文、多语言、多方言语音识别评测中,其得分高于 Gemini-3.1 Pro,并在 Fleurs 中文测试集中取得 SOTA。
讯飞也坦言,此次发布的版本在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步追赶空间,下一步将在巩固优势的同时补齐短板。目前,Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。
相关文章
最新文章
科大讯飞发布语音基座大模型Spark-Audio-1.0-Preview,基于全国产算力训练,降低供应链风险。模型支持文本和语音输入、文本输出,具备语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及音频问答等能力。
据《商业内幕》报道,为OpenAI、谷歌、Anthropic等科技公司加州办公室提供安保的员工计划本周罢工。他们已于15日提交72小时罢工通知,自18日凌晨4:30起拒绝接班。工会SEIU-USWW称,涉事企业还包括亚马逊、微软、Salesforce、Meta、英伟达等,或影响多家科技巨头办公场所安保。
9月16日,阿里千问Qwen3.8-27B在Hugging Face最受欢迎开源大模型榜单登顶,超越FLUX.1、DeepSeek-R1、Kimi-K3、Meta-Llama-3等。该榜以开发者点赞为评选口径,反映真实偏好,而非跑分或参数规模,成社区史上最受欢迎开源模型。
科大讯飞上线语音基座大模型Spark-Audio-1.0-Preview,基于全国产化算力训练。传统音频处理多采用级联方案,先转文字再理解,存在信息丢失(忽略语气、情绪、背景环境音)和链路割裂(语音转写、声纹识别等环节分离)两大短板,影响场景判断完整性。
努比亚NaviX Ultra上市,搭载豆包手机助手消费者版,标志AI智能体手机进入规模化量产商用。主打“听得懂、能干活、记得住、够安全”,支持一键唤醒、连续语音、复杂任务自主执行、个人记忆。配指纹AI按键,通话接入Seed全双工语音大模型,可随时打断、连续对话,支持闽南语、客家话等方言。
Cloudflare推出“Disallow AI Training”设置,允许网站继续被搜索引擎收录,同时拒绝内容用于AI训练。苹果、谷歌、微软已承诺遵守。启用后,标记为“可问责”的搜索/AI混合爬虫仍可抓取,其他AI训练爬虫被拦截,但可能影响搜索排名。
Anthropic签署澳大利亚首份数据中心租赁协议,锁定2.16吉瓦容量,计划2027年投运,选址距布里斯班约250公里的农田。继OpenAI后,其成为又一家布局大洋洲的AI巨头,看重当地电力与土地,并借此分散训练与推理的算力版图。
网友借助DeepSeek V4.1 Flash模型与Hermes Agent工具,对《生化危机7》纹理进行AI调优,使一加12R(骁龙8Gen2)帧率从约20FPS升至30FPS,提升50%。AI通过USB连接Mac监控性能,指出I/O和内存带宽为瓶颈,并建议压缩纹理分辨率。
vivo发布智能体大模型矩阵,涵盖语音、端侧、云侧等四款核心模型,全面赋能终端智能化体验。同时预研蓝心30B MoE端侧大模型,探索万亿级能力落地手机,提升多模态理解、长链推理与复杂任务自主执行,并同步推进软件与系统生态建设。
Anthropic于2026年9月15日升级中小企业版Claude,新增43项高效工作流及27个主流商业软件深度集成,推动AI从后台辅助转为核心业务驱动力。今年5月曾首推智能连接器与预置工作流,此次升级进一步扩展生态,助力中小企业增长。
生数科技9月15日发布Vidu S2视频大模型系列,含两个核心模型:Vidu S2-Avatar用于持续交互数字角色生成,Vidu S2-Editing用于输入视频流实时编辑。此外还探索VR头显实时空间视频生成与编辑。全链路研发由朱军教授博士生、流式视频生成与推理负责人张金涛负责。
谷歌发布全球语言智能新成果:AI支持超300种语言,覆盖71亿人口、86%比例。谷歌称语言大模型不应只做文本翻译,还需理解语气、情感与文化细微差别;同时指出传统语音识别多步刚性管线存在局限。
<br />过去三年,LED显示屏行业经历了残酷的产能出清。利亚德、洲明科技、强力巨彩等头部企业财报显示,传统小间距产品毛利率已从巅峰期的35%以上滑落至不足20%。价格战没有赢家——2023年国内LED显示屏市场规模同比仅增长4.7%,但出货面积增长了18%,量增价跌的剪刀差暴露了行业深层的结构性焦虑。转折出现在2024年下半年,多家头部厂商主动收缩低毛利订单,将资源向Micro LED、COB
脉脉高聘报告显示,2026年1—7月新经济行业新发AI岗位量同比增长789.47%,平均月薪63160元,同比上涨2.74%。技术类中FDE/现场部署工程师扩招增1522.73%居首;非技术类中AI产品经理增120.54%居首。
OpenAI正就新一轮私募融资与投资者初步洽谈,目标估值高达1.2万亿美元。此次融资背景是GPT-5.6、Astra等新模型发布,推动营收加速增长。今年3月其刚完成1220亿美元融资,投后估值8520亿美元,新目标估值较此前大幅跃升。目前谈判仍处早期阶段。
尽管两大AI巨头掌门人刚呼吁为技术狂飙“踩刹车”,OpenAI与Anthropic本周却悄然灰度测试下一代旗舰模型,被指“光速打脸”。OpenAI测试GPT-6Sol,Anthropic跳过5.1直接推新,行业竞争未减速。
9月16日,火山引擎宣布豆包大模型2.1Pro升级至0915版本,API全量上线火山方舟;豆包客户端同步更新,用户可选新版体验。TRAE已接入,Doubao-Seed-Evolving也升级同版本,企业无需更换API接口。
据外媒报道,OpenAI正就新一轮融资与投资者初步谈判,估值或达1.2万亿美元(约8.07万亿元人民币)。本轮由投资者发起,能否成行及时间取决于其上市规划,估值仍可能变动。此前3月,该公司以8250亿美元估值筹资1220亿美元。
<br />过去十年,LED显示屏的核心叙事很简单:把像素间距做小。P10、P4、P1.9、P0.9,每一次数字下探,都伴随着价格曲线与工艺难度的同步陡峭。但当间距逼近0.4毫米,芯片尺寸、焊盘精度、驱动IC密度的物理极限开始显形,行业的竞争焦点第一次从参数表转向结构本身。<br /><br />多家产业链公司近期释放的信号高度一致:微间距市场的订单结构正在变化,客户不再只问点间距是多少,而是问这
近日,字节系企业生产力产品密集更新:火山引擎将豆包大模型Doubao-Seed-2.1-pro升级至0915版,API全量上线火山方舟,并同步在豆包工作可用;飞书发布8.0,推出团队智能体“豆包工作伙伴”,将AI从个人助手拓展至群聊、文档、会议及业务流程。新模型聚焦“生产级交付”,强化Agent任务证据溯源等能力。
华为9月16日宣布小艺Work开启内测,定位面向日常办公、代码开发和创意创作的AI工作助理,支持鸿蒙手机、平板和电脑。官网已提供Windows客户端0.6.9下载,鸿蒙电脑可预约。该服务能自主拆解任务、调用工具并推进执行,进度可查看、关键节点由用户审核,支持手机、平板与电脑跨端协同。
苹果在iPhone 18 Pro系列推出Apple Reference Image功能,拍摄时于安全隔区内硬件签名并绑定时间戳,生成“数字负片”,实现像素级真实图像证明,防篡改、对抗AI伪造,适用于新闻机构与证据留存场景。
9月16日,蚂蚁阿福发布“AI饮食分”,用户拍照即可识别食物种类、计算营养热量并评分,相当于拥有专属营养师。同时“科学减重一亿斤”活动加码,将发放一亿颗鸡蛋,坚持用AI拍饮食可1分钱包邮领取。
前TikTok高管Melody Chu与Jing Liu创立AI摄影应用Superpose,定位“拍照教学工具”,上线约两月下载超2.2万次。它通过AI提供四种姿势建议,帮助改善姿态、角度与构图。创意源于Chu丈夫拍照不佳的个人需求,将计算机视觉与生成式AI融入日常拍照场景。
最新网站