从文字到行动 / 17 OF 20

任务一长,AI为什么开始忘事、返工、提前交卷?

NLP、Agent与世界模型的20段故事
资料核查截止 2026年9月7日 · 正文约 1,724

设想包邮故障刚修好,商家又让助手补优惠说明、检查购物车、整理交付文档。工作跨过许多轮后,助手重新打开运费判断,把“优惠后满100元”改回“商品总额满100元”。

它可能不是突然反悔,而是这一轮没有拿到之前的关键理由。又或者文件已经写对,它看到页面能打开,就宣布整个任务完成,忘了结账流程还没检查。

一次正确修改与持续推进一个长任务,是两种不同难度。后者要求信息、环境与完成标准跨越多次决策保持一致。

“聊过”不等于“本轮都能用”

模型每次处理的输入有长度范围,通常称上下文窗口。系统可以保存很长的完整聊天记录,但当前调用未必把所有原文一并交给模型。为容纳后续工作,可能压缩、筛选或检索旧内容。

设想最初用户写“包邮必须按优惠后金额”,后面堆积了大量运行日志。如果摘要只留下“已经修复运费”,新一轮知道做过什么,却不知道决定怎么做的条件。它很容易把旧问题重新包装成新修复。

即使文字还在窗口里,也不能保证模型稳定用好每一处。2023年的《Lost in the Middle》在所测多文档问答与键值检索条件中,观察到相关信息放在不同位置,会显著影响一些模型的表现;长窗口容量不自动等于可靠的信息使用能力。1

这不意味着所有后来模型都有相同程度的问题,也不是规定一到中间就必忘。它提醒我们,能装下与能准确取用,应分开评测。

原来在第六篇里,我们担心一句话中的信息传不过去;现在,担心的是整个任务记录怎样进入当前工作。便笺升级为文件柜,找文件的责任并没有消失。

把交接写成下一步用得上的材料

设想准备一份短交接:包邮条件为优惠后金额至少100元;资格函数已修改,四组边界输入通过;购物车页面尚未验证;具体改动可在版本记录中查到。

这份材料同时留下目标、关键约束、已验证状态和未完成项。下一轮读完之后,可以直接选择检查购物车,而不是再次猜测包邮口径。详细运行日志仍可另存,需要时再取,没必要每轮把所有输出塞到面前。

2025年,Anthropic关于长时间运行Agent的工程文章描述了它们在网页开发试验中遇到的两类问题:一口气做太多,留下难以交接的半成品;或见到已有进展便过早认定全部完成。它们采用进度文件、版本记录、功能清单与增量工作来改善连续性。2

这是有具体场景的工程经验,不是所有Agent失败的普遍统计。本篇包邮故事也不是该文报告过的真实事故。

还要检查记忆本身的来源。如果把模型猜测“也许会员免费”存成确定规则,下一轮会更加稳定地犯错。持久保存提高的是可重复取得的信息,不保证信息一开始就正确。

一张错得很工整的交接单,可以让错误顺利完成跨班次传承。

先检查现场,再相信昨天的记录

设想进度文件写“测试全过”,但此后有人改了优惠模块。昨天的结果仍是真实历史,却不能直接证明今天的代码也通过。

所以继续任务时,需要将记录与当前环境核对:文件是否变化,工作位置是否正确,关键程序能否启动,有关检查是否还有效。版本记录帮助定位改动前后,当前测试则检查现在的状态。

Anthropic的上述试验要求后续工作先了解版本与进度,启动环境并做基础功能检查,再选择未完成事项。这种做法将“接着聊”变成“接着处理一个可观察的项目状态”。2

在我们的例子里,若四组资格判断仍通过,但页面显示错,下一步应查页面与数据连接,而不是再把正确的比较条件改来改去。可靠记录帮助缩小搜索范围,现场反馈防止旧记录变成护身符。

跨轮工作因此不只是让模型有更长记忆,还要让它不断将记忆与对象核对。仓库管理员不能因为昨天盘过点,就断言今天没人领走螺丝。

什么时候才有理由交卷?

设想任务清单包含三项:资格计算正确、购物车显示正确、交付说明齐全。第一项完成后,文件增加了、测试绿了,场面已经很像竣工现场;但仍有两项缺口。

如果完成标准只写“把项目做好”,模型需要每轮重新猜测“好”意味着什么。将要求落实为可观察结果,可以减少这类漂移:哪种输入应得到什么行为,哪些页面应显示什么,哪些材料必须交付。

这不是让清单越长越好。把同一项拆成十个近义句,增加的是勾选工作;列出真正独立的验收条件,才帮助判断完成。也不能通过删除失败项,把尚未完成的任务改造成百分之百完成。

还应区别两种停止:要求全部满足后的结束,以及因缺少必要输入或环境受阻而停止。后者应报告阻断点,不能沿用“全部完成”的口气。产品外层的上下文管理、工具与执行控制共同影响这件事,Claude Code的机制说明也明确把这些放在Agent运行系统的职责中。3

标题中的忘事、返工和提前交卷,往往可以从信息缺失、状态过期和完成标准不清等具体环节分析,而不是统统归为“AI没耐心”。持续工作需要可靠交接、当前状态核对和匹配任务的停止条件。

我们的包邮助手终于不用每隔几轮重新发明一次100元。接下来我们暂时离开软件,回到更早的游戏研究:如果不告诉机器每一步该按什么,只用结果给分,它怎样学习行动?

参考资料

  1. Lost in the Middle: How Language Models Use Long Contexts,Nelson F. Liu等,预印本2023,TACL 2024。论文
  2. Effective harnesses for long-running agents,Justin Young/Anthropic,2025-11-26。工程文章
  3. How Claude Code works,Anthropic,读取于2026-09-07。官方文档