人工智能

谷歌推出双盲 AI 模型评估:用加密“黑箱”降低基准污染风险

2026年8月28日 · admin
openmagic ad

据 IT之家 8 月 27 日消息,谷歌宣布推出一项面向前沿专有 AI 模型的双盲评估技术,通过加密“黑箱”环境限制外部评估过程,减少模型在测试前接触评测提示词、进而针对基准测试“刷分”的可能性。此次试点由谷歌联合新加坡人工智能安全研究所、OpenMined、AVERI 以及 MLCommons 开展,在隐私保护环境中对 Gemini Flash Lite 模型进行了机密基准测试。谷歌称,这一方式旨在提升 AI 评估结果的完整性,并为更可信的模型监督提供新路径。

双盲评估要解决什么问题

当前大模型能力评测高度依赖各类基准测试,但一个长期存在的问题是“基准污染”:如果模型在训练、微调或评估准备阶段提前接触过测试题目,最终分数就可能不能真实反映模型能力。这类似学生考试前提前看到试题,成绩看起来更好,但无法说明其真实水平。

在传统外部评估中,评估方和模型方之间也存在明显矛盾。若评估方把测试提示词交给模型提供方,就可能暴露题库,带来被针对性优化的风险;若模型方把模型权重交给评估机构,则可能面临知识产权和安全泄露问题。对于前沿闭源模型来说,这种两难尤其突出。

谷歌此次提出的双盲机制,核心是让评估数据和模型资产都不直接暴露给对方。来源显示,该方案基于谷歌云保密计算产品组合中的 Confidential Space,通过加密验证在受保护环境内执行评估流程,使评估方无法查看 Gemini 模型权重,谷歌也无法看到评估方的测试提示词。

加密环境如何提升评测可信度

从技术逻辑看,双盲评估并不是简单地把测试过程搬到云端,而是利用受保护的计算环境,将模型推理与测试数据隔离在可验证的加密空间中。这样做的价值在于,评测机构仍可使用未公开的高敏感度测试集,模型提供方也能在不开放权重的情况下接受外部审查。

  • 降低基准污染:测试提示词不直接交给模型方,可减少提前泄露和定向优化空间。
  • 保护模型资产:评估机构无需接触专有模型权重,降低商业机密泄露风险。
  • 提升外部监督可行性:独立机构可在更安全的条件下评估先进模型。
  • 适用于高敏感场景:网络安全、政府机构等领域的评测往往涉及敏感数据,隐私保护环境更具现实意义。

对于 AI 行业而言,模型能力排行榜和安全评测越来越影响企业采购、监管判断和公众信任。如果评测过程本身不透明或存在污染风险,模型分数就可能被过度解读。双盲评估提供了一种折中方案:既不要求评估方公开测试材料,也不要求模型公司交出核心权重。

行业影响:AI 评测正在从“跑分”走向治理基础设施

这项试点的意义不只在 Gemini Flash Lite 单个模型上,更在于它反映出 AI 评测体系正在向更严肃的治理工具演进。过去,基准测试常被视为模型发布时的性能展示;但随着大模型进入办公、编程、教育、网络安全和公共服务等场景,评测结果正在成为判断风险、可靠性和适用边界的重要依据。

如果双盲评估机制能够被更多评测机构和模型厂商采用,它可能推动形成一类新的第三方审计流程:测试集由独立机构控制,模型仍由厂商保护,双方通过加密环境完成验证。这对闭源模型尤其重要,因为闭源模型在商业化中占据重要位置,但外部社会又需要更强的可信监督。

当然,双盲评估并不意味着 AI 模型安全问题就此解决。评测标准如何设计、测试覆盖哪些风险、加密环境如何被审计、不同机构之间结果是否可比,仍会影响最终可信度。但谷歌此次试点至少表明,行业正在尝试用技术手段解决评估信任问题,而不是仅依赖厂商自报分数或公开基准排名。

总体来看,谷歌的双盲 AI 评估为前沿模型测试提供了一个值得关注的方向:在保护数据主权、模型知识产权和评测独立性的同时,让外部机构更有条件开展严格测试。随着模型能力继续提升,类似的保密计算与独立评估结合方案,可能会成为 AI 安全和产业信任建设中的关键基础设施。