阶跃星辰今日正式发布StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,五款模型均已上线阶跃星辰开放平台,其中多款模型在Artificial Analysis榜单中位列全球第一。该系列覆盖真人级语音生成、完整音频生成、实时语音交互、复杂语音理解及音乐创作等场景。
其中,StepAudio3Realtime支持原生全双工实时对话,可同时理解语义、语气、情绪、副语言及环境声音,并支持推理与语音生成并行、Tool Call及长任务异步执行。在Artificial Analysis Conversational Dynamics榜单中综合得分98.9%,位列全球第一;语音推理准确率99.7%,同样排名全球第一。
StepAudio3ASR融合语音识别与大模型上下文理解能力,支持中文、英文、方言、中英混说、长音频及医疗、法律、金融等专业场景,WER仅1.7%,并列全球第一。StepAudio3TTS则强化音色、语调、节奏、停顿及笑声、迟疑、结巴等副语言表现,支持流式生成,面向实时语音交互。
此外,StepAudio3Gen可统一生成角色人声、音效、环境音和背景音乐,并支持多角色及声音时序控制;StepAudio3Music支持歌曲创作、清唱配乐、翻唱及基于ABC记谱法的多轮创作,可通过自然语言控制曲风、旋律、节奏、乐器和情绪。整体来看,StepAudio3正将语音模型能力从单一识别或生成拓展至完整音频内容生产与实时智能交互。
相关文章
最新文章
多家主要企业客户(英伟达、Palantir、Booz Allen Hamilton等)因担忧专有数据安全,限制在敏感项目中使用Anthropic和OpenAI前沿模型,引发企业AI市场震动。起因是Anthropic今年6月政策允许其Fable模型保留客户数据30天以检测滥用,触发信任危机。
阶跃星辰发布StepAudio3系列,含Realtime、ASR、TTS、Gen、Music五款模型,已上线开放平台,多款居Artificial Analysis全球第一。该系列覆盖真人级语音生成、完整音频生成、实时语音交互、复杂语音理解及音乐创作等场景;Realtime支持原生全双工实时对话,可同时理解语义、语气、情
<br />过去十二个月的十份行业报告,几乎指向同一个判断:LED显示屏正在经历诞生以来最剧烈的一次身份转换。变化的第一个信号不是尺寸,而是密度。COB与MIP两条封装路线同时放量,P1.0以下产品从展台上的“技术样品”变成了采购清单上的常规选项。在ISE与InfoComm的现场,P0.6、P0.4乃至P0.3级别的屏幕已无需独立暗室烘托,它们被直接摆在通道里,与液晶和OLED同台较量。<br /
知情人士透露,Anthropic、OpenAI与谷歌早在Anthropic CEO公开呼吁前,已就联合成立AI行业标准机构展开磋商。自7月起,三家公司CEO层级以下代表组成工作组定期开会。OpenAI CEO奥特曼也在内部表示支持设立AI测试与审计机构。
微信AI助手“小微”因隐私质疑上热搜,微信澄清“直接读取聊天记录、偷看隐私”等说法失实。该助手为原生AI,尚在小范围内测,支持文字语音交互,可查天气、快递、外卖,并在朋友圈、公众号、聊天、视频号等场景主动唤起,辅助内容总结。
盖茨基金会未来两年将投入10亿美元推动人工智能发展,让前沿技术惠及最贫困地区。盖茨还就全球大模型格局、算力碳排放及中国人形机器人等话题发表看法,指出按不同衡量方式,中美目前各有四家领先大模型企业。
Louis构思好框架后把素材喂给AI,再调出几个自建的Skill,只要几个小时,一份符合他思路且相对完整的调研报告就出炉了。同样的活,2020年的中秋,他写了一整个假期。Louis在
微软CEO纳德拉发布内部备忘录,称AI应处于人类控制下,支持更广泛第三方测试,强调必须花时间确保技术安全,否则将失去运营许可。微软同步发布37页行为准则,回应行业对AI发展过快的担忧。
上海AI实验室开源书生-S2,通用能力居开源第一梯队,生物、材料、化学等科学长程任务比肩顶尖闭源模型。其采用Memory Decoder架构,配备可插拔专业记忆模块,如“外挂大脑”,按需插入专业记忆即可深耕领域,无需重训,且不影响原有通用能力。
DeepSeek Harness(DSH)8月随V4 Pro发布,初期仅支持Web界面,数天获超10万GitHub星。因官方桌面端缺失,社区自发推出多款第三方客户端。最新官方主分支已新增桌面端目录,将支持macOS苹果芯片、Intel及Windows x64,暂不支持Linux,正式版上线时间待公布。
盖茨基金会宣布未来两年至少投入10亿美元推动AI普惠,并发布《目标守卫者报告》,呼吁抓住窗口期避免AI扩大贫富差距。报告提出实现普惠需解决三大问题,首要是支持所有语言,目前早期大语言模型训练数据九成以上来自英语。
<br />过去十二个月,LED显示产业最引人注目的变化,莫过于MicroLED技术终于跨过了"实验室炫技"与"量产落地"之间的鸿沟。从三星、LG到京东方、利亚德,头部厂商纷纷公布MicroLED量产时间表,像素间距不断下探,巨量转移良率从年初的99.9%攀升至99.999%级别。更关键的是,成本曲线开始以每年30%至40%的速度下降,这意味着曾被诟病"天价"的MicroLED电视和商用大屏,正在
9月15日,2026飞书未来无限大会在京举办。字节跳动CEO梁汝波表示,大模型Agent进入可用阶段后,字节已整合豆包、飞书、火山引擎,聚焦工作与生产力产品,将加大企业市场投入,推动AI在组织内规模化落地。他还回顾飞书立项十年,初期由其负责技术,曾称其为“在字节憋得最久的产品”。
<br />过去十年,LED显示屏行业的叙事主线只有一个:点间距不断缩小。但2024年以来,故事换了主角。COB(板上芯片)封装在P1.0以下市场迅速取代传统SMD,在头部厂商的出货结构中占比已过半;MiP(Micro LED in Package)则让Micro LED得以借用成熟的SMT产线,把巨量转移的良率难题分摊到封装环节。行业里最常被引用的一句判断是:Micro LED的产业化不会再等一
苹果发布重构版Siri AI,具备个人语境理解、世界知识、屏幕感知和系统级操作能力。英文测试版随2027系统更新上线,下月扩展法语、日语、韩语等语言。新Siri更“懂你”,可从信息、邮件、照片中精准查找所需内容。
据《华尔街日报》报道,OpenAI拟以超3亿美元收购智能手机摄像头制造商Glass Imaging。该公司2019年成立于加州,曾融资约3000万美元,创始人为前苹果工程师,曾领导苹果人像模式团队,利用神经网络优化摄像头成像。OpenAI尚未回应。
彭博社报道,美总统科技顾问委员会联合主席萨克斯称,Anthropic和OpenAI等顶级AI公司应自行确保产品安全,按自身节奏推进,无需政府干预;他认同前FTC主席可汗观点,即大型AI公司需为其模型承担产品责任。
9月14日,四川眉山永丰村千亩高标准农田收割,其中300亩首次应用水稻专用AI大模型管理,实现从“凭经验”到“靠数据”种田。农技专家和种植户现场观摩,四川省科技厅组织专家组,对四川农业大学主持的成都平原稻-菜(药)优质高产高效生产项目进行实测。
腾讯在大模型赛道终于派出了一位能打的种子选手。今年年初,伴随着OpenClaw的爆火,腾讯顺势推出了一系列类龙虾产品,其中最火爆的便是主打办公场景的AI Agent WorkBuddy。
美国时间6月8日,「Bending Spoons」已正式提交赴美 IPO 申请,代码 BSP,Goldman Sachs 和 JPMorgan 担任主承销商,目标估值约200亿美元。白鲸出海的读者们想必对「Bendin
从9月7日到9月9日,短短72小时内,华为、小米、苹果三大巨头围绕折叠这一形态,展开了一场正面交锋。9月7日,深圳的秋意尚未浓,但华为发布会现场的热度已然爆表。当余承东
苹果已推送iOS27、watchOS27、iPadOS27和visionOS27更新,延迟已久的Siri AI升级成为核心功能,目前仅提供英语测试版,10月将扩展支持法语、日语、韩语、葡萄牙语和西班牙语。iOS27还新增Liquid Glass不透明度滑块,多款内置应用更新图标,并加入超大尺寸小组件及铃声等变化。
苹果推送iOS27,为近年较大规模升级。延续Liquid Glass设计,强化Siri AI,调整照片、信息等应用,新增AI与家长控制并优化性能。Siri重构可读屏、操作应用。支持iPhone 11系列及更新、SE2。部分AI功能硬件门槛高:新Siri需15 Pro及以上,部分需17 Pro或更高。
Andon Labs的Vending-Bench2测试中,AI以500美元模拟经营售货机一年。GPT-6 Astra平均账户余额达15515美元首次登顶,最差一轮也超过Claude Fable5.1最佳表现。差距不仅在于盈利,更在策略:Astra持续压低采购价,一度砍至原价约48%。
最新网站