【大屏时代】首页 > 3D快报内容详情

智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案

49分钟前 4 大屏时代

大模型在长任务里反复"失忆"、跑着跑着就忘了最初目标,这个困扰整个智能体行业的老毛病,根源可能不在模型本身,而在包裹模型的"执行框架"。AWS 一份自主云编程智能体设计指南把问题点得很直白:浅层智能体在长周期里会遭遇上下文溢出、被干扰而跑题,并且无法维持状态。而修好这层的,是负责管理"除模型之外一切"的 harness。

一份盘点多家主流框架的新研究把这层外壳掀开了。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四台"发动机"——上下文预算、压缩、待办状态、跨会话记忆——把浅层循环变成能扛住长任务的深智能体。

最反直觉的一点是,把上下文窗口做大并不解决问题。Chroma 的 Context Rot 报告评估了18款大模型,发现即便在简单检索任务上,输入越长模型越不可靠。Anthropic 给出的解释是:注意力机制对 n 个 token 会生成 n² 的两两关系,每多一个 token 都在消耗一笔有限的"注意力预算",上下文是边际递减的资源,不是个桶。Manus 还透露,一个典型任务要调约50次工具、输入输出比接近100:1,最初那条指令会慢慢漂向窗口中段——恰恰是回忆退化的位置。

第一台发动机是上下文预算与卸载。Deep Agents 出厂就写死了两条硬规则:工具返回超过20000token 就写进文件系统、只留路径加前10行预览;会话上下文超过窗口85% 时,旧编辑调用被截断成指针。Claude Code 把同样逻辑用在加载前,自动记忆限200行或25KB,MCP 工具模式默认只列名字、按需拉取。AWS AgentCore 的演示更彻底:协调器并行派生3个浏览器子智能体,各自待在独立 MicroVM 里,分析子智能体只收结构化结果,全程预期4到6分钟,串行则会慢最多3倍。

第二台是压缩。当卸载不够,框架就把接近上限的对话摘要后重启。Claude Code 的压缩提示会保留架构决策和未解决 bug、丢掉冗余输出,并在压缩后重读最近修改的至多5个文件、重新注入技能正文;它还把完整原始记录写进磁盘,被摘要掉的事实日后能找回。Deep Agents 更把"保住目标"做成结构特性,摘要文档专门分出会话意图、已生成产物和下一步三个字段。压缩已下沉到 API 层:OpenAI Responses API 用 `compact_threshold` 提供服务端压缩,Codex 正是靠它撑住长编程任务;Claude 平台则给出可写自定义指令的压缩编辑项。

第三台是待办状态与"念咒"。Manus 的做法很朴素——建一个 `todo.md` 一步步重写打勾,等于把目标念进上下文末尾,推开"淹没在中间"的漂移。不过它并非稳赚:Deep Agents 在2026年7月的 v0.7里,因评估显示关掉待办反而奖励略高、成本更低,把待办中间件改成了可选;LangChain 仍建议对长任务、弱模型和需展示进度的界面重新打开。

第四台是跨会话记忆。Claude Code 每次压缩后都从磁盘重注 CLAUDE.md 和自动记忆;AgentCore Memory 在后台跑抽取策略,让协调器下次直接召回而非重研。但苏黎世联邦理工的研究泼了冷水:AGENTS.md 这类上下文文件通常不提升成功率,却让推理成本涨20% 到23%,每次重载都是对注意力预算的固定征税。Claude Code 因此建议把 CLAUDE.md 压在200行以内。

研究最后提醒,框架是否真"抓得住目标"得靠强制触发压缩的测试验证——最该警惕的失败,是智能体在摘要后立刻反问澄清,或错误宣布任务完成。换句话说,让智能体在长路上不迷路,拼的不是模型有多大,而是框架这几台发动机调得有多细。



相关文章

相关标签: 智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案