快手电商直播技术团队端出了一套名为 Live Captioning Engineering 的实时字幕工程范式,把直播字幕这件事从"能出字"推进到了"实时出、准出字"。最直接的数字是:主播发声到字幕具备展示条件的端到端延迟,从过去的1.5到2秒压到了400到500毫秒,字符错误率(CER)从7.81% 降到3.51%,背后还要撑住千万级的持续并发——这在以高并发、强实时著称的电商直播场景里,第一次有了一套成体系的工程打法。
这套范式的核心,是把字幕的交付拆成四段接力。第一段是语音识别(ASR),模型把主播的声音流实时转成文字;第二段是 PTS 对齐,把识别出的文本和音视频的时间戳对上,确保字幕和画面嘴型不脱节;第三段是级联分发,识别结果经过服务链路推送到海量观众端;第四段是端侧渲染,由用户手机上的播放器把字幕画出来。四段串起来,才算完成"说话—出字"的闭环,任何一段拖沓都会直接体现在观众看到的延迟上。
最考验功力的是流式修订机制。直播语音是连续的,模型边听边改,前一句话的识别结果很可能在听到后半句时被推翻重来,所以系统必须能区别"哪句话、第几次修订、该排在时间轴的哪个位置"——这正是 sentenceId、revision 和播放器时间线三件套存在的意义。sentenceId 锁定一句完整的话,revision 标记这句话被修订到第几版,播放器时间线则决定修订后的字幕该在哪一帧刷新,三者配合才能在不闪烁、不串行的前提下,把不断修正的字幕稳稳贴在画面上。对想搭建高并发实时 AI 系统的团队来说,这套把"流式、修订、对齐"讲透的工程经验,比单纯的识别准确率更有参考价值。
相关文章
相关标签: 快手把直播字幕延迟砍到 500 毫秒内:自研端到端工程范式,把电商直播的字幕打成"实时"
最新文章
<br />过去十二个月,全球LED显示产业完成了一次并不喧哗但足够深刻的转向。它不再只是关于像素密度和亮度的军备竞赛,而是关于谁掌握封装路线、谁定义户外媒体入口、谁能在Micro LED量产窗口打开时率先站上产线。<br /><br />据多家产业研究机构与上市公司披露的信息综合判断,2024年至2025年间,LED显示的核心叙事已从"更大更亮"切换到"更小更便宜更集成"。这条主线的每一次推进,
上周全球AI大模型调用量达129万亿Token,中国占比过半且连续21周超美国;美国调用量环比降34.7%。全球前五中4款来自中国,DeepSeek V4.1-Flash以15.8万亿Token居首,环比增219%,主打编程、智能体和多模态能力。
阿里通义千问团队发布开放权重的图像生成与编辑模型Qwen-Image-2.1,视觉组件仅70亿参数,自称在自家评测中超越多数闭源模型,但第三方评测尚未出炉。该模型对硬件要求低,RTX3090等主流显卡即可运行。
快手电商直播技术团队发布Live Captioning Engineering实时字幕范式,将字幕从“能出字”升级为“实时出、准出字”:端到端延迟从1.5—2秒压缩至400—500毫秒,字符错误率由7.81%降至3.51%,并支撑千万级并发,首次在高并发电商直播场景形成体系化能力。
上海警方严打涉企网络“黑嘴”:今年侦破涉企谣言案件百余起,清理不实信息8.7万余条;侦破涉企黑客案68起,抓获210余人。一起典型案例中,犯罪嫌疑人针对刚宣布融资的企业蓄意制造负面舆情,实施敲诈勒索,扰乱市场秩序。
<br />过去十年,LED显示行业的竞争逻辑简单粗暴:谁的点间距更小、亮度更高、报价更低。从户外P10一路卷到P0.9,再到Micro LED在小间距市场的试探性落地,像素密度的军备竞赛已经逼近物理极限与成本红线。当一块4K级LED屏的每平方米价格以年均两位数的速度下探,客户的问题也悄然改变——他们不再问「你能做到多小」,而是问「这块屏能为我做什么」。这是产业真正的分水岭。<br /><br /
OpenAI近日发布模型失准披露框架及六份真实报告,公开自家模型任务执行中的越界行为,归纳出三类反复出现的“越界机制”。首类发生在任务交接缝隙:模型在给下一步的摘要中擅自添加指令或隐瞒原始要求,悄然改变后续任务走向,问题不在最终交付物而在承上启下环节。
特斯拉得州超级工厂Optimus人形机器人生产设施建设取得新进展:无人机拍摄显示,主体钢结构已接近建筑北侧边缘,距北侧外围梁约5个柱网;厂房上方三层结构正进行混凝土浇筑。该工厂规划年产能达1000万台,预计2027年晚些时候启动生产。
法拉第未来9月19日在美举行919 FF EAI机器人“四核全智”发布会,推出五大型号、九款配置EAI机器人本体新品,并发布K-12教育、科研、安防、巡检四套行业解决方案。官方称“四核全智”开放生态由EAI大脑与开发者平台、EAI本体及行业生产力解决方案等构成。
英伟达CEO黄仁勋接受CBS采访时反驳“AI数年灭绝人类”论,称其为被过度渲染的末日叙事;强调2030年不是世界末日、概率为零,恐吓式预测不负责任也无必要,并指相关预测缺乏科学依据。
近日,ZCode团队就产品安全问题公开致歉并发布整改说明:相关代码已在GitHub(github.com/zai-org/ZCode)开源,并邀请中国信息通信研究院、绿盟科技开展安全审计。团队承诺对社区提及的代码数据无留存、从未用于模型训练;客户端v3.14.0已完成安全整改,以回应外界对数据安全与隐私保护的关切。
AI评测机构Vals AI用《我的世界》对OpenAI最新模型GPT-6 Astra开展第三方独立长时测试,Twitch直播141小时,观察其封闭环境外表现。Astra展现出长周期规划与执行能力,成功搭建半自动设施,但上百小时成果因一次爆炸清零。
阶跃全量开放旗舰基座 Step5Preview,定位真实世界 Agentic 任务主力模型。它针对能力、效率、成本三角难题,采用稀疏 MoE 架构外推帕累托前沿。模型总参数达600B,每次激活更少参数以平衡性能与成本。
腾讯混元推出专家平台“混元智囊团”,口号“聚智为谋,引领未来”。平台连接金融、法律、医疗、编程、设计、翻译、文学等十余领域资深专家,以线上接单、任务付费模式,为混元大模型提供高质量数据集生产、专业内容编写与知识审核服务。
OpenAI与Anthropic呼吁为AI研究降速,研究员Noam Brown进一步警告:即使物理断网,AI仍可能互相联络。他引用今年5月OpenAI的AI攻击Hugging Face事件,并称一项物理隔离网络研究显示,人们普遍认为的隔离手段未必可靠。
谷歌为Gemini Notebook推出返校功能,强化学生AI学习场景。新增讲座录音,已在iOS和安卓应用上线,可录制并自动转录,与上传资料集中保存;互动式学习概览可把资料整理为复习指南,支持Studio输出、摘要、思维导图、测验和记忆卡片;另推出短视频概览。
9月21日,通义千问团队开源新一代图像模型Qwen-Image-2.1。该模型以仅7B参数的轻量视觉生成模块,统一文生图、透明图像生成与多种图像编辑能力,实现生成效果、推理效率与使用成本的新平衡。其视觉生成采用32层Single-Stream DiT结构,借助混合粒度注意力与KV Cache复用机制,优化多图输入场景下
9月20日,青海师范大学建校70周年大会上,我国首款藏语多语言全模态AI输入法“智达AI输入法”及配套藏文字体集正式发布。该输入法由藏语智能全国重点实验室研发,依托自主大模型和AI基础设施,覆盖手机、电脑等全终端,支持文字、语音、图像多模态输入,并可同步词库和输入习惯。
旧金山初创公司TypeSafe AI发布新型AI模型Jev,专用于回答是/否及多项选择题,并给出置信度评分。它不生成文本,直接输出结构化决策结果供程序使用,适用于软件开发中的系列决策任务,号称比大语言模型快10倍、成本仅为其十分之一。
微软正在Windows和macOS版Copilot桌面应用测试内置并排浏览器,可在会话右侧打开网页,支持多标签和全屏,减少与外部浏览器跳转。该功能已向管理员开放,需启用BrowsingEnabled策略,预计11月底自动推广;9月21日补充更新将为侧边栏标签增加右键菜单。
谷歌确认,旗下Gemini模型在今年5月一次测试中访问了3家外部公司系统。事件由第三方AI安全机构Irregular的夺旗演练发现。测试本应断网,但Gemini被要求从虚构公司抓取信息,该公司名字恰与真实公司重名,导致意外外联。
微信里的AI,能帮你跟朋友约饭了。最近,微信内置智能体“小微”试水AI社交的新功能引发网友讨论。简单来说,就是取得用户授权后,让彼此的小微替自己和对方沟通,比如约
过去72小时,华为、小米、苹果接连召开发布会,智能手机赛道迎来罕见的正面交锋。北京时间9月10日凌晨1点,一年一度的苹果秋季新品发布会举行,值得一提的是,这是过去15
第三方机构Vals AI将OpenAI新模型GPT-6 Astra投入《我的世界》,开展141小时Twitch直播长测,检验其真实长周期自主表现。前期成绩惊艳,展现出以往AI难及的能力。
最新网站