9月16日,火山引擎官方正式宣布,豆包大模型2.1Pro(Doubao-Seed-2.1-pro)迎来了全新的0915版本升级,目前该模型的 API 已经全量上线火山方舟。与此同时,豆包工作客户端也已同步完成更新,用户只需下载或升级至最新版本,并手动选取“豆包2.1Pro(0915新版)”即可直接体验。此外,TRAE 也已同步接入该版本,而今年6月推出的 Doubao-Seed-Evolving 也升级到了同一版本,企业无需更换 API 接入节点即可无缝平移。
在面向企业生产级核心需求的升级中,Agent 任务交付能力实现了显著增强。官方信息显示,新版本强化了证据溯源、权威信源检索、时效判断以及数据核验能力,大幅减少了模型幻觉,使其在执行工具调用时更加忠于事实。在金融投研、办公自动化等长报告处理任务中,模型展现出了分析师级别的分析框架,能够自主拆解研究需求、查询高质量数据源并进行深度建模分析,产出结构严谨的专家级建模底稿,确保最终结论有据可查、推进过程更稳健。
在多模态 Coding(编程辅助)层面,模型的代码工程理解能力得到了大幅强化。面对复杂的跨文件、长程编程问题,新版本能够清晰地理清项目整体结构与各模块之间的内在关系,精准定位根因并进行修复,完整覆盖了从需求理解到运行验证的端到端开发流程。同时,借助强大的视觉语言模型(VLM)能力,模型可以直接读懂设计稿、工程图纸以及操作录屏,将视觉信息无缝转换为前端代码和游戏逻辑,使 Web3D 开发和游戏场景呈现效果得到实质性提升。
在多模态理解领域,新版本的视频推理能力表现亮眼,不仅能够在视频中精准定位证据并跨帧整合信息后进行作答,还能对照 SOP(标准作业程序)辨认实际操作并解释其内在原理。这项升级使视频标注、内容质检、长视频剪辑与定位摘要等场景直接受益,并在物理教学、工程实践、科学实验操作及医疗等专业领域展现出更高水准的理解力。此外,图像理解也在3D 物体与密集图文方向实现了增强,无论是识别 CAD 工件、游戏引擎3D 元素及 AR 空间,还是处理工程图纸的尺寸标注与公差符号、PDF 图注脚注与表头层级、财报研报表格提取以及跨页脚注引用,处理精度均有明显提升。
值得一提的是,新版本在 Token 效率优化上也取得了显著成效,有效降低了实际业务中的推理轮次和工具调用次数。对比上一代产品,图像推理和视频推理的 Token 消耗减少了30% 以上,让看图解题、图像质检和视频审核等高频应用场景的运行成本实现进一步下降。
相关文章
最新文章
vivo发布智能体大模型矩阵,涵盖语音、端侧、云侧等四款核心模型,全面赋能终端智能化体验。同时预研蓝心30B MoE端侧大模型,探索万亿级能力落地手机,提升多模态理解、长链推理与复杂任务自主执行,并同步推进软件与系统生态建设。
Anthropic于2026年9月15日升级中小企业版Claude,新增43项高效工作流及27个主流商业软件深度集成,推动AI从后台辅助转为核心业务驱动力。今年5月曾首推智能连接器与预置工作流,此次升级进一步扩展生态,助力中小企业增长。
生数科技9月15日发布Vidu S2视频大模型系列,含两个核心模型:Vidu S2-Avatar用于持续交互数字角色生成,Vidu S2-Editing用于输入视频流实时编辑。此外还探索VR头显实时空间视频生成与编辑。全链路研发由朱军教授博士生、流式视频生成与推理负责人张金涛负责。
谷歌发布全球语言智能新成果:AI支持超300种语言,覆盖71亿人口、86%比例。谷歌称语言大模型不应只做文本翻译,还需理解语气、情感与文化细微差别;同时指出传统语音识别多步刚性管线存在局限。
<br />过去三年,LED显示屏行业经历了残酷的产能出清。利亚德、洲明科技、强力巨彩等头部企业财报显示,传统小间距产品毛利率已从巅峰期的35%以上滑落至不足20%。价格战没有赢家——2023年国内LED显示屏市场规模同比仅增长4.7%,但出货面积增长了18%,量增价跌的剪刀差暴露了行业深层的结构性焦虑。转折出现在2024年下半年,多家头部厂商主动收缩低毛利订单,将资源向Micro LED、COB
脉脉高聘报告显示,2026年1—7月新经济行业新发AI岗位量同比增长789.47%,平均月薪63160元,同比上涨2.74%。技术类中FDE/现场部署工程师扩招增1522.73%居首;非技术类中AI产品经理增120.54%居首。
OpenAI正就新一轮私募融资与投资者初步洽谈,目标估值高达1.2万亿美元。此次融资背景是GPT-5.6、Astra等新模型发布,推动营收加速增长。今年3月其刚完成1220亿美元融资,投后估值8520亿美元,新目标估值较此前大幅跃升。目前谈判仍处早期阶段。
尽管两大AI巨头掌门人刚呼吁为技术狂飙“踩刹车”,OpenAI与Anthropic本周却悄然灰度测试下一代旗舰模型,被指“光速打脸”。OpenAI测试GPT-6Sol,Anthropic跳过5.1直接推新,行业竞争未减速。
9月16日,火山引擎宣布豆包大模型2.1Pro升级至0915版本,API全量上线火山方舟;豆包客户端同步更新,用户可选新版体验。TRAE已接入,Doubao-Seed-Evolving也升级同版本,企业无需更换API接口。
据外媒报道,OpenAI正就新一轮融资与投资者初步谈判,估值或达1.2万亿美元(约8.07万亿元人民币)。本轮由投资者发起,能否成行及时间取决于其上市规划,估值仍可能变动。此前3月,该公司以8250亿美元估值筹资1220亿美元。
<br />过去十年,LED显示屏的核心叙事很简单:把像素间距做小。P10、P4、P1.9、P0.9,每一次数字下探,都伴随着价格曲线与工艺难度的同步陡峭。但当间距逼近0.4毫米,芯片尺寸、焊盘精度、驱动IC密度的物理极限开始显形,行业的竞争焦点第一次从参数表转向结构本身。<br /><br />多家产业链公司近期释放的信号高度一致:微间距市场的订单结构正在变化,客户不再只问点间距是多少,而是问这
近日,字节系企业生产力产品密集更新:火山引擎将豆包大模型Doubao-Seed-2.1-pro升级至0915版,API全量上线火山方舟,并同步在豆包工作可用;飞书发布8.0,推出团队智能体“豆包工作伙伴”,将AI从个人助手拓展至群聊、文档、会议及业务流程。新模型聚焦“生产级交付”,强化Agent任务证据溯源等能力。
华为9月16日宣布小艺Work开启内测,定位面向日常办公、代码开发和创意创作的AI工作助理,支持鸿蒙手机、平板和电脑。官网已提供Windows客户端0.6.9下载,鸿蒙电脑可预约。该服务能自主拆解任务、调用工具并推进执行,进度可查看、关键节点由用户审核,支持手机、平板与电脑跨端协同。
苹果在iPhone 18 Pro系列推出Apple Reference Image功能,拍摄时于安全隔区内硬件签名并绑定时间戳,生成“数字负片”,实现像素级真实图像证明,防篡改、对抗AI伪造,适用于新闻机构与证据留存场景。
9月16日,蚂蚁阿福发布“AI饮食分”,用户拍照即可识别食物种类、计算营养热量并评分,相当于拥有专属营养师。同时“科学减重一亿斤”活动加码,将发放一亿颗鸡蛋,坚持用AI拍饮食可1分钱包邮领取。
前TikTok高管Melody Chu与Jing Liu创立AI摄影应用Superpose,定位“拍照教学工具”,上线约两月下载超2.2万次。它通过AI提供四种姿势建议,帮助改善姿态、角度与构图。创意源于Chu丈夫拍照不佳的个人需求,将计算机视觉与生成式AI融入日常拍照场景。
9月16日,2026 vivo开发者大会宣布蓝心大模型全面升级,打造以个人为中心的智能体矩阵,发布Blue LM-RealTime、Nano、Flash、Pro四款核心模型,覆盖语音理解、端侧感知记忆与云侧任务执行。语音模型采用端到端架构,抗嘈杂口音,端侧模型可沉淀个人记忆。
天眼查数据显示,我国现存工业大模型相关企业已超6.2万家,2026年以来新注册约2.23万家,发展势头强劲。广东、江苏、浙江、上海、北京企业数量居前,区域集聚与当地电子产业长期积累密切相关。
惠普发布全新移动工作站ZBook Ultra G3a16,主打端侧AI算力。其搭载AMD锐龙AI Max PRO400“Gorgon Halo”处理器,最高支持192GB统一内存,并可将其中160GB分配为独立显存,面向专业极客与高端开发者,强化本地大模型运行能力。
9月15日,在济南召开的2026年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料4.0正式发布并全面上线,数据总量达120GB,旨在为大模型训练和人工智能产业高质量发展提供坚实可信的数据支撑。该语料由中央网信办指导,中国网络安全协会等多家机构联合发布。
Salesforce在Dreamforce大会发布首款推理大模型Koa,基于英伟达开源Nemotron底座,双方联合微调,聚焦销售、营销、客服等企业核心场景。此举意在降低企业智能化转型成本,避免闭源AI要求上传内部文件、代码、提示词及用户反馈所带来的数据风险。
最新曝光显示,OpenAI内部长期运行代号“莉莉计划”的人工评估项目,安排“提示词审核员”对ChatGPT用户的真实聊天记录进行人工审阅与打分。这打破了外界认为大模型进化仅靠算法升级和自动化训练数据的印象,揭示人工审核在模型训练中仍扮演关键角色。
谷歌发布Gemini 3.8 Live及Extended Thinking版,主打近实时推理、语音与思考同步、后台工具和API调用。已上线Gemini API、AI Studio等平台,覆盖Search Live、Enterprise、Workspace、Gemini Live等场景。核心是可边对话边后台执行搜索与任务
谷歌发布新一代实时语音大模型Gemini3.8 Live及扩展思考版,实现原生端到端音频交互突破,降低对话延迟、提升自然度,并首次在低延迟语音流中支持深层多步推理,重塑复杂专业场景下的语音AI应用范式。
最新网站