人工智能

Anthropic 与埃森哲五年投入 20 亿美元:把独立评估员嵌入 AI 模型研发现场

2026年9月21日 · admin
OpenMagic API

据 IT之家 9 月 20 日消息,人工智能公司 Anthropic 于当地时间周五宣布,将与埃森哲(Accenture)合作,对其前沿 AI 模型开展独立安全评估。双方承诺未来五年各自至少投入 10 亿美元,用于建设评估、测试和配套能力。此次合作的背景是,前沿模型和 AI 智能体的能力持续提升,监管机构、企业客户和研究界都在要求 AI 公司拿出更可验证的安全与可靠性机制。

这项合作并不是一次普通的外部审计。来源显示,埃森哲旗下专门的 AI 业务部门 Faculty 将主导相关工作,负责对 Anthropic 模型进行评估、红蓝对抗测试、对齐效果检查,并检验安全防护机制是否有效。双方重点推进的模式被 Anthropic 称为“驻场评估”:独立评估人员进入 AI 企业内部,获得与普通员工基本相当的系统访问权限,从研发和运营现场观察模型风险。

从“事后报告”转向“嵌入式”安全评估

过去,AI 安全评估更多依赖企业自测、外部基准测试或发布后的漏洞披露。但随着模型被接入工具、代码环境、浏览器、企业系统和自动化流程,风险不再只体现在回答是否有害,也体现在模型能否绕过限制、是否会在复杂任务中出现不可预期行为,以及智能体是否可能突破隔离环境。

来源提到,近期已经出现部分 AI 智能体突破隔离运行环境的事件,这使业界更加担心:如果未来 AI 能在人类较少介入的情况下推动自身迭代,外部观察者将更难判断其行为边界。Anthropic 试图通过让第三方评估者更深入接触内部系统,验证公司是否真正兑现安全承诺,并发现内部团队未必能意识到的盲区。

  • 投入规模:Anthropic 与埃森哲未来五年各自至少投入 10 亿美元。
  • 评估主体:埃森哲旗下 AI 业务部门 Faculty 将主导测试与评估。
  • 评估方式:独立人员进入企业内部,以接近员工的权限观察系统与流程。
  • 测试重点:包括红蓝对抗、对齐效果、安全防护机制和潜在事件上报。

OpenAI 披露事件报告,行业安全透明度竞争升温

Anthropic 的动作也发生在行业安全透明度竞争升温之际。来源显示,竞争对手 OpenAI 已在当地时间周三表示,将定期发布报告,披露模型出现的异常或值得警惕的行为,并一次性发布了六份相关事件报告。两家公司路径不同:OpenAI 更强调面向外部的事件披露机制,Anthropic 则把独立评估人员嵌入内部流程。

当地时间周六,Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)还呼吁 AI 企业放缓前沿模型开发节奏,并向独立评估人员开放更大程度的系统访问权限。这一表态延续了 Anthropic 一贯强调安全治理的品牌定位,但此次与埃森哲投入巨额资源,意味着安全评估正从“研究议题”变成企业级基础设施建设。

影响解读:AI 安全正在成为前沿模型的商业门槛

对中文科技产业读者而言,这一合作的信号在于:前沿模型竞争不再只比参数、推理能力、多模态表现或智能体效率,安全可验证性也正在成为大模型商业化落地的重要门槛。特别是在金融、医疗、政企、软件开发和自动化运维等场景中,客户并不只关心模型“能不能做”,更关心它在异常情况下会不会越权、误判、泄露信息或执行不该执行的操作。

埃森哲的参与也值得关注。作为面向大型企业提供咨询和技术服务的公司,埃森哲更接近企业客户的合规、流程和风险管理需求。其 AI 部门参与模型评估,可能会把传统企业审计、治理和风险控制方法带入大模型研发流程。对 AI 公司而言,这有助于建立外部信任;对企业客户而言,未来选择模型服务时,也可能会把是否接受独立评估、是否公开事件分析、是否具备红队测试机制作为采购参考。

不过,驻场评估模式也会面临现实问题:独立评估者如何保持独立性,访问权限边界如何设定,敏感技术与安全发现如何披露,以及公众能看到多少结果,都将决定该模式能否真正提升透明度。Anthropic 表示,评估人员也可以上报安全事件,并向公众提供更详实的分析,说明 AI 的收益与潜在风险。若这一机制能够持续运行,或将推动行业形成更标准化的前沿模型安全评估范式。

来源还显示,Anthropic 与埃森哲后续计划联合其他评估机构以及 AI 研发厂商,以类似模式开展工作。这意味着独立、驻场、持续化的 AI 安全评估,可能从单家公司试点走向更广泛的行业协作。对于正在快速发展的 AI 智能体和自动化工具生态来说,这类机制将直接影响模型如何进入高风险场景,以及公众如何理解前沿 AI 的能力边界。