Anthropic 披露安全分类器失效:近一年承包商流量未经过生物武器风险过滤
据 IT之家 8 月 16 日消息,Anthropic 在当地时间 8 月 14 日发布的最新安全报告中披露,其用于拦截化学、生物武器相关危险请求的部分安全分类器曾长期失效。来源显示,在 2025 年 5 月至 2026 年 4 月期间,约 5 万名外部承包商与模型产生的约 1.33 亿次对话,没有经过相关生物安全分类器过滤。Anthropic 表示,内部调查目前没有发现这些请求被实际用于滥用的证据,并已根据调查结果提高对外部承包商的筛查和管理要求。
问题出在外部承包商流量,未触发既有 CBRN 过滤链路
Anthropic 公开的安全机制显示,其实时提示词和输出分类器会同时分析用户输入与模型生成内容,一旦识别到与危险行为相关的请求,系统会阻止模型继续提供可能被用于实施风险的信息。这套机制是 Anthropic 面向化学、生物、放射性及核武器(CBRN)风险所设置的多层防护之一。
此次披露的问题并非指 Claude 面向所有用户的安全体系整体失效,而是涉及外部承包商在提供人工反馈时产生的流量。报告显示,这些承包商主要由外部供应商负责审核,其筛查流程存在不足,导致相关请求在近一年时间里没有被生物安全分类器拦截。
对于一家大模型公司而言,承包商反馈通常用于模型评估、数据标注、响应偏好调整等环节,是模型迭代链条中的重要组成部分。也正因为这类流量规模巨大、场景复杂,一旦权限、路由或过滤配置出现缺口,就可能形成难以及时察觉的安全盲区。
从 ASL-3 到分类器:Anthropic 的高风险领域防护正在承压
Anthropic 此前已将生物安全纳入其 AI 安全体系。来源提到,2025 年 5 月 Claude Opus 4 发布时,公司启用了 AI 安全等级 3(ASL-3)防护措施,其中包括针对 CBRN 开发或获取风险的部署限制。按照其负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并随着新发现的有害模式、越狱方法和混淆技术不断更新。
除在线分类器外,Anthropic 还将红队测试、漏洞赏金计划和离线监测作为补充机制。到 2026 年 7 月,公司在公布 Claude Fable 5 相关安全措施时,再次强调生物和化学领域风险,称当模型底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要用分类器限制相关请求。
- 失效范围:涉及外部承包商反馈流量,而非报告中所称的全部用户请求。
- 影响规模:约 5 万名承包商、约 1.33 亿次对话在相关时间段内未经过生物安全分类器过滤。
- 调查结论:Anthropic 称目前没有发现相关请求被实际用于滥用的证据。
- 后续动作:公司已提高外部承包商筛查和管理要求,并持续调整高风险领域防护标准。
影响与解读:AI 安全不只取决于模型,也取决于运营链路
这次事件的关键提醒在于,大模型安全并不是单一模型能力或单个过滤器的问题,而是覆盖产品、数据、评测、外包协作和权限治理的系统工程。即使模型端有实时分类器、红队和离线监测,如果某类内部或半内部流量没有被纳入相同的安全路径,仍可能产生规模化风险。
对中文科技产业观察者来说,这一案例也说明,随着前沿模型进入生物、化学、网络安全等更敏感领域,AI 公司需要证明的不只是“模型不会回答危险问题”,还包括所有参与模型训练、评估和反馈的人与流程都受到一致约束。外部承包商往往处在模型改进的前线,却也可能是治理标准最不统一的环节。
同时,Anthropic 也承认,过于严格的安全分类器可能误伤正常科研活动。以 Fable 5 为例,目前大量生物和化学领域请求会被转交给 Claude Opus 4.8 处理,公司计划在安全机制改进后逐步缩小限制范围。这反映出前沿 AI 产品正在面对一个现实难题:既要降低高风险知识被滥用的可能,也要避免对合法科研和专业工作造成过度阻碍。
总体来看,Anthropic 选择公开披露这一长期失效问题,有助于外界理解前沿模型安全治理的复杂性。但从产业角度看,分类器是否覆盖所有流量、外包流程是否可审计、异常是否能被及时发现,将成为评估 AI 公司安全成熟度的重要指标。