辛顿等联署公开信:AI 实验室应保障第三方评估独立性与访问权限
据 IT之家援引《商业内幕》9 月 18 日报道,由多家监督组织组成的 AI 评估机构论坛发布公开信,围绕外部第三方如何评估 AI 实验室风险提出一组“最低条件”。公开信已获得数十名 AI 领域人士联署,其中包括被称为“AI 教父”的计算机科学先驱杰弗里·辛顿,以及人工智能学者斯图尔特·罗素。公开信主要回应 Anthropic、OpenAI 等公司此前关于向第三方评估人员开放内部资源、评估 AI 风险的承诺,强调相关评估必须在独立、透明和受保护的环境下进行。
来源显示,Anthropic CEO 达里奥·阿莫迪和 OpenAI CEO 萨姆·奥尔特曼此前都曾承诺,让第三方评估人员获得与员工同等级别的信息访问权限,以便更深入地审视 AI 系统风险。在外界对 AI 风险讨论升温的背景下,这封公开信将焦点从“是否评估”进一步推进到“如何评估才可信”。
公开信提出:第三方评估不能只是形式化审查
AI 评估机构论坛认为,要让驻场第三方评估具备公信力,评估人员必须保持科学客观性、透明度和独立性,并获得充分保护,避免受到被评估企业的干预。这意味着,外部评估并不应只是企业合规叙事的一部分,而应具备足够的制度空间,能够对模型能力、潜在滥用、失控风险以及特定领域风险作出实质性判断。
公开信主张,第三方评估人员应能够公开透明地开展工作,并在必要时直接与公司董事会及其他拥有特殊监督权限的机构沟通。这一要求的重点在于减少企业内部管理层对风险信息流转的过滤,避免高风险发现被弱化、延迟或仅以内部摘要形式呈现。
- 评估人员应获得与企业内部评估人员相同的系统、数据、工具和实体场所访问权限;
- 评估人员应有权公开发布评估结果,而不是只能提交给企业内部;
- 评估人员应免受来自 AI 实验室的报复或不当压力;
- 每家 AI 实验室应引入不同观点和专业背景的评估人员,覆盖生物科学风险、AI 失控风险等多个方向。
为何第三方评估成为 AI 治理关键议题
随着大模型能力持续提升,AI 安全评估已不再局限于模型是否会输出有害内容,也涉及工具调用、自动化执行、网络与生物相关风险、复杂任务规划等更宽泛场景。对于 Anthropic、OpenAI 这类处在前沿模型研发一线的公司而言,内部测试固然重要,但外部社会对其评估结果的信任,很大程度取决于是否存在不受企业利益左右的独立验证机制。
从产业角度看,这封公开信释放了一个信号:AI 安全治理正在从原则倡议转向操作层面的制度设计。过去,科技公司常以“红队测试”“安全评估”“负责任发布”等概念回应风险担忧,但外界很难判断这些流程是否足够全面、是否发现了关键问题、以及问题是否影响模型发布节奏。公开信提出的访问权限、沟通路径、结果发布权和反报复保护,实际上是在为第三方评估建立可执行的边界。
对 AI 公司与监管框架的影响
如果这些建议被更多企业采纳,AI 实验室与外部评估机构之间的关系将发生变化。第三方不再只是按企业要求完成测试报告的服务方,而更接近一种具有监督属性的外部风险审查力量。这可能提升前沿模型发布前后的透明度,也可能使企业在模型训练、部署和商业化过程中面临更高的信息披露要求。
值得注意的是,本周早些时候,微软 CEO 萨提亚·纳德拉也加入讨论,表示公司欢迎让第三方评估人员直接进驻 AI 企业开展评估的构想。对于云计算平台、模型开发商和应用生态紧密交织的 AI 产业而言,第三方评估若形成行业惯例,将可能影响模型上线流程、企业客户采购决策,以及未来监管机构制定标准时的参考框架。
总体来看,辛顿等人联署的公开信并不是单纯表达对 AI 风险的担忧,而是将问题落到具体治理条件上:谁能评估、能看到什么、能向谁报告、能否公开结果,以及评估人员是否受到保护。对中文读者和国内 AI 从业者而言,这一讨论的参考价值在于,未来大模型竞争不只比拼参数、产品体验和生态速度,可信评估与安全治理能力也会成为衡量 AI 公司成熟度的重要指标。