近期,Andon Labs 开展了一项严苛的 Vending-Bench2测试,让 AI 代理使用500美元作为启动资金,去经营一年的自动售货机模拟。在这场长周期的商业模拟挑战中,GPT-6Astra 表现惊艳,其平均最终账户余额达到15515美元,甚至连最差的一轮成绩也超过了 Claude Fable5.1的最好一轮表现,首次实现登顶。
复盘两者的实测表现,差距主要体现在供应链管理和规则执行力上。GPT-6Astra 展现出极强的长期低价采购能力,曾成功将商品报价压低至原报价的约48%,并且在整个运行周期中执行规则高度稳定,没有产生任何预付款损失。相比之下,Claude Fable5.1的采购成本持续上涨,并因未能严格坚持规则而导致了大量预付款损失。
不仅在常规模拟中大获全胜,GPT-6Astra 在更复杂的三人竞技测试中同样表现亮眼,不仅拒绝了违规协作,还顺利赢下了全部3轮比赛。这场测试深刻揭示了当前 AI 代理发展的一个核心趋势:长期自主性正成为拉开差距的关键,而通往下一阶段的核心门槛,正是如何将正确的判断持续、稳定地转化为正确的实际行动。
相关文章
最新文章
西安交大科技成果转化企业蓝虫具身9月14日发布新一代模块化人形机器人Mantis Standard“小白”,起售价仅0.98万元,打破传统高价门槛。该产品定位为可灵活变形的具身智能平台,底盘、手臂、腰部、头部采用标准模块设计,支持多种形态组合,引发业界广泛关注。
Andon Labs的Vending-Bench2测试中,AI代理用500美元模拟经营自动售货机一年。GPT-6Astra平均余额达15515美元,最差一轮也超Claude Fable5.1最好成绩,首次登顶,优势体现在供应链管理和规则执行力。
腾讯WorkBuddy于9月14日升级PPT生成:支持一句话出初稿、基于原文件续改、无需整份重做。用户可在对话框输入指令或点击“幻灯片”、调用“/tencent-pptx”技能。材料不全时,仅提供主题和页数,系统会补问汇报对象、场景与目标,并按“问题—论证—结论—落地”主线生成;也可传入调研报告等资料。
Anthropic发布威胁情报报告,指控中国实验室以隐藏身份、欺诈和盗取凭证等手段非法蒸馏前沿模型,CEO呼吁美国监管打击。Y Combinator总裁Garry Tan反对监管,称应“什么都不做”,认为美国该有自己的蒸馏能力。
<br />过去十年,LED显示屏产业的竞争逻辑简单粗暴——谁把点间距做得更小、谁把屏体拼得更大,谁就能拿下订单。但2024年以来,这条规则正在被改写。Micro LED与Mini LED背光技术的成熟,让行业从"拼尺寸"转向"拼像素"。多家头部厂商披露,Micro LED巨量转移良率已突破99.99%,单瓦成本较三年前下降逾六成。这意味着,曾被诟病"叫好不叫座"的Micro LED,终于站在了商
Suno CEO Mikey Shulman发布新一代音乐模型v6,联合华纳音乐、BMG、Believe等共同打磨,称为实现“让更多人享受创作音乐”愿景迄今最大一步。v6首次以模型套件形式推出,含三个定位不同的成员:旗舰v6面向Pro/Premier用户,强调可靠、精确,跨流派稳定输出精修成品;另含v6-wild等模型
宇树科技发布人形机器人G1+,围绕运动、感知、智能三大维度升级6项:新增2自由度颈部,俯仰约-25°至36°、偏航±110°;优化电机输出与散热、视觉触觉、续航及远场语音。标准版含税售价9.5万元,EDU版未公布,延续高性价比定位。
<br />过去十二个月,全球LED显示产业经历了一场静默而深刻的重构。据集邦咨询最新数据,2024年全球LED显示屏市场规模已逼近80亿美元,其中小间距与微间距产品贡献了逾六成增量。与此同时,中国大陆厂商在COB(Chip on Board)封装路线上的集体押注,正把曾经由日韩把持的高端市场拖入一场价格与良率的双重竞速。一位不愿具名的深圳供应链高管对笔者坦言,如今一条COB产线的投资回收期已从三
ElevenLabs于3日发布生成式音乐模型ElevenMusic v2.5,通过移动应用和API向全球开放。新版提升音频饱满度与自然感;在47,885对样本盲测中,多数听众偏好v2.5,在R&B、灵魂乐、嘻哈、摇滚、管弦乐等曲风上表现更佳。
OpenAI首席执行官奥尔特曼表态支持人工智能“控速”发展,避免尖端模型能力超出人类可控范围,与Anthropic CEO阿莫迪观点相近。他承认转向安全会付出一定代价,但有助于维持外界信心,证明美国企业在研发日益强大的AI时能够恪守责任。
折叠屏迟到七年,Siri迟到两年,新 CEO特努斯这次把AI时代的答案补齐了。如果有15999元的预算,你会考虑买苹果,小米,还是华为的折叠屏?随着苹果新品的发布,答案未必更
百图生科与华大智造达成战略合作,共建细胞大模型,提升细胞状态建模与扰动响应预测能力,并打造高质量数据基础设施,探索“设备+模型+智能体”一体化产品模式,加速AI4S进程。华大智造提供测序与自动化硬件入口,百图生科负责AI建模,双方分工互补。
DeepSeek-V4.1-Flash上线千问AI平台,开放API与Token Plan。开发者可经标准API接入,或在Qoder、千问APP、Codex等工具调用,用于代码、文档、视觉理解与智能体任务。该模型为轻量旗舰,552B MoE非对称架构,输入激活约8B、输出约16B,原生支持图文理解,上下文最长100万to
Anthropic CEO达里奥·阿莫迪呼吁放缓前沿AI发展,提出以“可核验性”为核心的三步方案:企业引入驻场第三方评估、美国与盟友协同、全球协作。他认为AI递归式自我改进已出现,6至12个月后智能体或借僵尸网络控制互联网,因此须放慢能力提升,将时间投入可靠性、对齐、可解释性与测试评估。
OpenAI发布四项更新,涵盖智能体、语音、数据与金融。其中Agents API最受关注,将Codex能力拆解为云端服务,以“能力即服务”降低智能体开发门槛,标志其从卖单一模型转向构筑开发者生态,是Codex布局的关键落地。
DeepSeek本周发布V4.1 Flash,架构变化巨大但未升大版本号。V4.1 Pro已确定,具体升级未公布,性能上限或较高,但鉴于前代Pro不及预期,外界期待不宜过高。另有Code 2.0被曝即将发布,主打电脑控制,后续还有更多大模型。
京东在JDD大会上发布JoyAI-Echo两项进展:音视频生成模型升级至1.5,持续生成超10分钟;开源可交互视听世界模型EchoWM,融合原生视听生成与用户控制,让AI内容从“能看”走向“能进、能探索”。长视频采用音视频Memory Bank架构,支持多镜头生成。
<br />过去十年,LED显示屏行业最核心的一条主线,是像素间距的持续下探。从早期的P10、P6,到如今主流的P1.2、P0.9,再到头部厂商小批量量产的P0.4级别产品,像素密度在十年间提升了两个数量级。技术上的意义直观而残酷:在正常观看距离下,屏幕的物理结构正在从观众视野中“消失”——你看到的不再是一块由灯珠拼成的发光板,而是一幅完整的画面。<br /><br />这条路径的商业价值远大于技
OpenAI最快模型GPT-5.3-Codex-Spark发布仅7个月即下周退役。它每秒1200 token,是首个脱离英伟达、由Cerebras 750兆瓦大单交付的模型,但用量持续下滑,且已有更优替代。负责人称需为未来让路,并吐槽模型名过长。
豆包手机助手消费者版正式发布,相比预览版更强调稳定性、日常可用性与交互体验。支持语音、AI键等多种唤醒方式适配不同场景;专属AI键具备指纹鉴权,验证后无需二次解锁即可执行任务;语音唤醒针对远场、内噪及嘈杂环境进行优化。
大模型长任务中反复“失忆”、遗忘目标,根源或在执行框架而非模型。AWS指南指出,浅层智能体长周期会上下文溢出、受干扰跑题、无法维持状态;修复关键是管理除模型外一切的harness。新研究盘点多家主流框架,聚焦这层外壳,为长周期稳定执行提供思路。
OpenCode联合创始人Dax Raad宣布,月费10美元的OpenCode Go已连续两周实现收支平衡。在多数AI编码工具仍烧钱或靠卖数据变现的背景下,此举标志低价AI订阅模式商业可持续性获突破。该服务以宽松速率限制和稳定访问,为开发者提供高性价比开源AI编码。
月之暗面发布新主力模型K2.8Preview,已在Kimi Code与Kimi Work全量上线。官方称其综合性能接近旗舰Kimi K3,编程与智能体能力显著提升,支持100万超长上下文,并向所有会员档位开放。此前Kimi K3曾凭前端能力推动公司ARR自6月份增长。
最新网站