谷歌被曝研发 Frozen v2 专用芯片:把 Gemini 底层架构写入硬件以降低推理成本
据 IT之家 7 月 20 日援引 The Information 报道,知情人士透露,谷歌正在研发一款代号为 Frozen v2 的全新服务器芯片,目标是提升 Gemini 系列大模型在推理阶段的运行效率。与面向多种模型和任务的通用 GPU、TPU 不同,这款芯片被描述为更接近“为 Gemini 定制”的专用硬件:它计划将部分底层运算架构固化到硅片中,从而减少推理时的计算步骤、数据搬运与能耗。来源显示,其单位功耗可处理的词元数量预计达到谷歌现有自研 AI 芯片的 6 至 10 倍,最早可能在 2028 年部署。
Frozen v2 的核心思路:不是固化模型权重,而是固化架构逻辑
“Frozen”这一代号对应的是一种更激进的芯片设计理念:把大模型运行中相对稳定、重复出现的底层逻辑直接做进硬件。这样做的好处是,芯片在执行 Gemini 推理任务时,不必像通用芯片那样为不同模型保留大量灵活调度空间,而是可以围绕特定模型家族优化数据流和计算路径。
不过,谷歌此前并非没有尝试过类似方向。来源称,初代 Frozen 方案由谷歌 DeepMind 首席科学家 Jeff Dean 牵头,曾计划把完整模型权重直接蚀刻进芯片。该路线的问题也很明显:一旦 Gemini 版本更新,写死在芯片里的权重就可能过时,导致硬件生命周期过短,因此项目被搁置多年。
相比之下,Frozen v2 的调整更务实:它不再把完整模型权重固定到芯片中,而是选择固化底层架构逻辑,同时保留更新内置模型权重的能力。换句话说,谷歌试图在 硬件专用化 与 模型可迭代性 之间寻找平衡。
- 定位:专为 Gemini 系列模型服务的服务器芯片,而非通用 AI 加速器。
- 目标:降低 AI 推理能耗和延迟,提高单位功耗下可处理的词元数量。
- 进度:工程团队仍在敲定核心功能模块及组件协同方案。
- 部署时间:知情人士称最早计划于 2028 年部署。
为什么谷歌需要这类专用芯片
报道提到,谷歌当前面临 AI 算力资源紧张的问题,内部资源压力甚至已导致谷歌云不得不回绝部分外部客户订单。随着 Gemini 被嵌入搜索、办公、开发工具和云服务,推理成本正在成为决定 AI 产品能否规模化落地的关键变量。
从产业角度看,大模型竞争已不只是模型参数、榜单成绩和应用体验的竞争,也逐渐演变为底层算力效率的竞争。对于拥有模型、云、芯片和应用入口的谷歌而言,如果能让 Gemini 在自家硬件上以更低能耗运行,就能在云服务定价、AI 产品响应速度和大规模部署能力上获得更大主动权。
这也是 Frozen v2 与谷歌 TPU 战略之间的关系所在。来源显示,Frozen v2 将开辟一条新的自研芯片产品线,与现有 TPU 形成互补,而不是取代 TPU。谷歌今年已推出第八代 TPU,并直接向云客户推广,同时也在对英伟达主导的 AI 芯片市场发起更直接的挑战。报道称,谷歌已与 Meta 签署数十亿美元订单,向其出租 TPU 算力。
影响与风险:高能效背后是架构押注
Frozen v2 的潜在价值在于,它可能显著降低 Gemini 推理成本,并带来更快的用户响应速度。对于面向海量用户的 AI 助手、搜索增强、企业智能体和自动化工具而言,推理效率提升往往比训练能力更直接影响商业化结果。
但这条路线也存在明确风险:Frozen v2 能否长期有效,取决于谷歌未来 Gemini 模型是否继续沿用与芯片设计一致的底层架构。如果后续模型架构发生较大变化,专用硬件的优势可能被削弱,甚至面临适配困难。这也是专用芯片区别于 GPU、TPU 等更通用加速器的核心代价。
因此,谷歌目前并无大规模量产 Frozen v2 的计划。来源称,其产能规模预计将远低于 TPU,谷歌更倾向于把这一代产品视作技术试验平台:在大模型底层架构逐步稳定之前,先积累高度专用化 AI 芯片的工程经验。谷歌发言人也回应称,公司团队会持续研发和测试创新技术,但并非所有研发项目都会落地量产。
整体来看,Frozen v2 反映出一个重要趋势:头部 AI 公司正在从“买算力、堆集群”走向“围绕模型重构硬件”。如果这一方向被验证有效,未来 AI 基础设施可能会出现更明显的分层——通用芯片负责广泛模型与训练任务,专用芯片则承担高频、稳定、规模巨大的推理负载。