Anthropic 为 Opus 5.5 Agent“半路停工”给出指南:问题可能出在旧调度逻辑
据来源显示,Anthropic 在 Opus 5.5 发布后不久,针对开发者在运行 AI Agent 时遇到的“无人值守任务中途停下”问题发布了配套提示词与排查指南。典型场景是:用户让 Agent 连夜迁移代码库,模型完成一部分工作后发送进度说明,表示接下来会继续处理剩余接口和测试,但随后程序不再推进,必须由用户手动输入“继续”才会恢复。Anthropic 在指南中指出,这类问题并不一定是模型“不想做”,而是旧版 Agent 程序把一次文本汇报误判成任务完成。
这一现象对正在把 Claude / Opus 系列模型接入自动化开发流程的团队值得警惕。Opus 5.5 的能力增强伴随着更主动的进度沟通,但如果外层调度器仍沿用“模型不再调用工具就结束任务”的简单规则,就可能让长任务在中途被系统提前收尾。
为什么 Agent 会“干一半就停”
来源摘要提到,Opus 5.5 在执行长任务时更倾向于主动同步进度,例如告诉用户已经完成了哪些部分、下一步准备做什么。问题在于,一些进度汇报会以纯文本回合结束,API 给出的状态可能是 end_turn。在许多旧 Agent 框架里,这个信号会被理解为“模型已经结束本轮,且没有继续调用工具,因此任务完成”。
Anthropic 的判断是,纯文本回合结束不应被直接视为任务完成凭证。如果模型只是汇报阶段性进展,外层应用需要继续核对待办项、验收标准和阻塞原因,而不是立刻停止整个自动化流程。
按照官方指南的归纳,这种半路停工大致有几种常见形态:
- 只写计划不执行:模型生成较长总结,并表示“下一步将处理某任务”,但没有实际调用工具。
- 过分礼貌地等待确认:模型询问“如果可以,我将继续处理……”,在无人值守环境中就会原地等待。
- 假装需要决策:模型列出若干需要用户拍板的事项,但这些事项并不真正阻碍后续工作。
- 阶段性汇报后停住:模型完成一个小阶段或认为输出足够长后主动总结,外层程序误以为任务完成。
这也体现出一个产品层面的矛盾:更好的沟通能力在人工交互中是优点,但放到旧式自动化 Agent 流水线中,反而可能触发错误的停止条件。
Anthropic 给出的三类修复思路
针对“如何让 Agent 继续推进,但又不陷入无限循环”,Anthropic 给出的方案核心是把验收权从模型单次回复中拿出来,交给更明确的任务状态和外部检查机制。
第一类做法是维护任务清单。开发者可以把大任务拆成多个细项,让模型在执行过程中持续更新待办。如果一次回合结束时,清单仍有未完成项,且模型没有说明遭遇真实阻塞,应用就应自动追加一条明确的续跑指令,例如要求其继续迁移剩余端点并补充测试,同时说明如果卡住要指出原因。
第二类做法是设置“验收员”。也就是提前定义完成标准,每次模型回合结束后,用另一个较小模型或规则检查结果是否达标。如果未达标,就把缺口作为下一条消息反馈给 Agent,让它继续修正。这样可以避免仅凭模型自己的一句总结判断任务已完成。
第三类做法是加入硬性刹车。若同一任务自动续跑两三次仍无实质进展,就应停止自动循环并交给人工复查,避免 API 调用在卡死状态下持续消耗。
此外,提示词也需要更新。来源提到,官方建议在系统提示词中明确禁止上述几种“口头继续、礼貌等待、无效请示、阶段汇报即停止”的行为,同时说明只有在确实离不开用户输入,或触及被刻意保护的核心资源时,才应该停止等待。
影响与解读:Agent 工程从“会调用工具”走向“会被验收”
从中文开发者和企业自动化落地的角度看,这次问题并不只是 Opus 5.5 的个别适配事项,而是 AI Agent 工程化中的一个典型转折:过去很多系统把重点放在“模型是否能调用工具”,现在则必须进一步处理任务状态、完成标准、阻塞判断和重试边界。
尤其在代码迁移、批量测试、文档更新、数据整理等长链路任务中,模型的阶段性总结很有价值,但它不能替代外层系统的验收逻辑。开发者需要把“模型说完成了”与“任务事实上完成了”区分开来,通过清单、测试、结构化输出或独立评审来确认结果。
这也提醒使用 Agent 平台的团队:升级更强模型时,不能只替换模型名称。模型行为风格一旦变化,旧的停止条件、工具调用策略和提示词都可能失效。更主动的模型需要更稳健的编排层,否则能力提升可能表现为新的自动化故障。
迁移 Opus 5.5 还需注意 API 兼容性
来源还提到,从 Opus 5 切换到 Opus 5.5 时,旧请求可能因 API 变化被拒绝并返回 400 错误。已披露的注意点包括:thinking 参数不能再按旧方式关闭或手工指定部分预算设置,官方建议不传该字段或使用 adaptive,并通过 effort 控制思考深度;tool_choice 也不再适合强制指定为某个工具或任意工具,建议使用 auto,再结合严格工具调用、结构化输出和提示词约束。
另外,来源显示,thinking 块与模型及上下文绑定更严格,部分账户在更改系统提示词、工具或历史消息后回放旧 thinking 块,可能触发兼容性问题。对于正在维护生产级 Agent 的团队,升级前应在测试环境中完整回放关键任务,检查请求参数、工具选择和自动续跑逻辑,避免上线后出现“任务停住”或“请求直接报错”的双重问题。