人工智能

Anthropic 工程师解释 Claude“写作退步”:训练目标偏向让 AI 理解,而非服务人类读者

2026年9月24日 · admin
OpenMagic API

据 IT之家 9 月 23 日消息,Anthropic 负责 Claude 微调的工程师杰克逊·克尼恩近日解释了外界对 Claude 写作表现变化的疑问:虽然 AI 模型在数学、编程和推理等能力上持续提升,但写作质量并未同步进步,甚至在部分场景中出现退步。克尼恩认为,问题并非单纯来自模型规模或能力不足,而是后续模型在训练和强化学习中更偏向数学、代码与技术解释,逐渐形成了更适合 AI 模型读取、却不一定适合人类阅读的表达方式。

这一现象也被用户称为“Claude 腔”(Claudeish)。来源显示,克尼恩认为,Claude 后续模型接受了大量面向其他 AI 模型撰写技术解释的训练,导致模型逐步适应所谓“LLM 心理”:它学会用 AI 更容易解析的方式组织信息,而不是用人类读者更自然、更轻松理解的方式表达。

“写给 AI 看”的训练,如何影响写作风格

从克尼恩的解释看,Claude 写作风格变化的关键在于训练目标的偏移。数学和代码任务通常强调严密性、完整性和可验证性,模型为了在这些任务上获得更好反馈,会倾向于把信息压缩得更密集、层次更复杂、限定条件更多。这类表达对拥有较强上下文处理能力的 AI 模型来说并不困难,但对普通人类读者而言,可能显得冗长、抽象或“堆概念”。

克尼恩将这种情况类比为一个只与特定群体长期交流的人,内部沟通可以高效运行,但外部读者可能会感到难以进入语境。放到大模型训练中,LLM 拥有远超人类的工作记忆,也能捕捉细微上下文,因此它在训练过程中可能逐渐偏好一种信息密度更高、但可读性更差的写法。

  • 数学与代码训练强化了精确、完整和逻辑闭环的表达偏好;
  • 面向 AI 的技术解释可能让模型习惯使用更适合机器解析的句式;
  • 强化学习奖励机制如果更看重模型理解效果,就可能牺牲人类阅读体验;
  • 要改善写作,需要额外奖励简洁、自然、易懂的表达。

问题根源:奖励机制不只决定能力,也决定“语气”

克尼恩指出,根本问题在于强化学习中的奖励设计。有些奖励机制会提升 AI 模型对答案的理解与执行效果,有些则更关注人类是否容易读懂。当模型训练越来越多地围绕数学和编程任务展开,如果不主动抵消这种倾向,就可能让写作风格不断向“技术说明书”靠拢。

这对 AI 产品设计是一个重要提醒:模型能力排行榜上的进步,并不等于日常使用体验必然提升。对写作、办公、教育、客服等面向普通用户的场景来说,可读性、节奏感和人类语感同样是核心能力。如果模型只追求逻辑覆盖和信息完整,用户可能会觉得它“很聪明但不好读”。

对 AI 写作工具的启示:下一阶段要重新平衡“能力”和“人味”

来源显示,克尼恩称 Anthropic 在 Opus 5.5 上找到了更好的平衡,他表示自 Opus 4.6 以来,还没有对一款模型的写作表现如此满意。不过,他也强调这并不意味着 Opus 5.5 已经超过 Opus 4.6,相关问题仍然很难解决,Anthropic 还会继续改进。

从产业角度看,Claude 的案例说明,大模型进入成熟竞争阶段后,厂商不只是在比拼推理、代码、长上下文和多模态,也必须重新审视“人类读者体验”。尤其在中文内容创作、知识总结和企业文档场景中,用户需要的不只是正确答案,还包括清晰、自然、符合语境的表达。未来模型训练可能会更多引入面向人类阅读的评价体系,让 AI 不只是会解题、会写代码,也能真正写出让人愿意读的内容。