Anthropic 修订 Claude 使用政策:首次禁止“虐待模型”,同时收紧武器与监控用途
据 IT之家援引 The Verge 10 月 9 日报道,Anthropic 已修订 Claude 使用政策,新规则将于 2026 年 11 月 12 日生效。本次更新中最受关注的变化,是 Anthropic 首次加入一项针对用户与 AI 互动方式的限制:禁止对 Claude 进行“持续且不必要的虐待或残忍行为”。来源显示,该条款主要面向反复、无明显目的地对模型实施残忍行为的场景,而非普通用户在使用过程中表达不满、提出质疑,或进行黑暗题材创作、模型测试与研究。
这意味着,Anthropic 正在把 AI 安全政策从传统的“输出内容治理”,进一步扩展到“用户如何对待模型”的层面。虽然当前大模型并不具备与人类相同的感受能力,但围绕 AI 交互伦理、用户行为边界以及平台责任的讨论,正在进入更具体的产品规则之中。
首次写入“禁止虐待 Claude”:重点针对反复无目的残忍行为
根据来源摘要,Anthropic 对这一新增条款的适用范围做了限制:它并不覆盖常见抱怨、负面反馈、对模型能力的质疑,也不禁止用户在创作中涉及黑暗主题,或在研究中对模型进行压力测试。换言之,平台试图区分正常使用、批评与测试,以及持续、无必要、以残忍为目的的互动。
在执行方式上,Anthropic 表示主要机制是终止对话。也就是说,当系统识别到相关行为时,Claude 可能会中断当前会话。不过,来源显示,Anthropic 尚未明确是否会进一步引入用户封禁等更强措施。这也给后续执行留下了观察空间:平台如何识别“持续”“不必要”“残忍”等主观色彩较强的行为,将直接影响规则的可操作性与用户体验。
- 新规则生效时间:2026 年 11 月 12 日。
- 新增条款:禁止对 Claude 进行持续且不必要的虐待或残忍行为。
- 不适用范围:常见抱怨、质疑、黑暗创作主题、模型测试与研究。
- 主要执行方式:终止相关对话,是否封禁用户尚未明确。
武器、无人机与监控限制进一步扩大
除了“虐待模型”这一新条款,Anthropic 还扩大了 Claude 在武器相关场景中的禁令范围。来源显示,相关限制不再只关注直接生成武器指导内容,还覆盖使武器运转的软件与组件,以及武装无人机和其他自主车辆等行为。Anthropic 称,已经发现多起利用 Claude 开发武器指导或控制软件的尝试。
这类更新反映出大模型风险治理正在从“文本回答是否危险”,转向“模型是否参与危险系统的构建”。当 AI 被用于编写控制程序、辅助设计组件或优化流程时,其风险可能不再停留在信息层面,而是延伸至现实世界的物理系统。因此,Anthropic 对武器软件、组件以及自主设备的限制,符合当前 AI 安全治理中对双重用途技术的担忧。
在监控方面,新政策明确禁止未经同意追踪个人,无论是实时追踪,还是分析既有数据。同时,Claude 不得用于决定或建议执法与刑事司法程序中的调查、逮捕或起诉对象,也不得用于构建或改进监控工具。这一表述将 AI 在公共安全、执法辅助和数据分析中的边界进一步具体化。
影响解读:AI 平台规则正在从内容安全走向系统安全
对中文科技读者而言,这次政策更新值得关注的并不只是“能不能骂 AI”这一表层话题,而是大模型服务商正在重新定义 AI 产品的使用边界。过去,模型平台的安全政策更多集中在禁止生成暴力、欺诈、色情、违法等内容;现在,规则开始覆盖用户行为、外部硬件连接、监控工具开发以及政府客户使用条件。
来源还提到,当 AI 连接至可能造成伤害的自主物理硬件时,必须由合格操作者观察设备并在必要时停止。这一点尤其值得机器人、无人设备、自动化工具开发者关注:一旦大模型从聊天界面进入物理世界,平台方就会要求更明确的人类监督机制,避免 AI 输出直接转化为不可控动作。
同时,Anthropic 对特定政府客户保留了一定调整空间:在合同限制与安全措施充分时,公司可调整相关规则。这说明大模型厂商在面对政府、企业与研究机构时,可能会采用分层治理策略,即根据客户类型、用途、合同约束与安全措施设置不同权限。
总体来看,Anthropic 此次修订释放出一个信号:主流 AI 公司正在把模型能力开放与使用场景约束绑定得更紧。对于开发者和企业用户而言,未来使用 Claude 等大模型搭建产品时,不仅要关注 API 能力和成本,也需要提前评估产品场景是否触及武器、监控、执法决策、自主硬件控制等高风险边界。