Google AI 芯片效率提升 10 倍:自研 ASIC 能否改变 NVIDIA 的 AI 算力格局?

市场洞察
更新于: 2026-07-21 08:17

北京时间 2026 年 7 月 21 日,Alphabet 收盘报 351.37 美元,单日上涨 1.52%。同一天,NVIDIA 收盘报 203.28 美元,涨幅 0.23%。

驱动这一价格差异的,是一篇来自科技媒体 The Information 的报道:Google 正在研发一款内部代号为 Frozen v2 的新型服务器芯片,目标是将 Gemini 大模型的部分架构永久固化进硅片,从而在单位功耗下实现较现有 TPU 高 6 到 10 倍的 Token 处理能力。消息发布当天,Alphabet 股价盘中一度涨近 3.7%。

一颗两年后才计划部署的芯片,让市场为一张蓝图买了单。这背后的逻辑,远不止是又一颗 AI 芯片的问世——而是 AI 基础设施竞争规则的可能改写。

云计算巨头为何集体从芯片采购者变成芯片设计者?

过去十年,AI 基础设施的市场格局围绕一条主线展开:NVIDIA 的 GPU、CUDA 软件生态,以及不断扩张的数据中心。这条路径的逻辑清晰且有效——通用计算芯片适配多样化的 AI 工作负载,规模效应带来了持续的成本下降和性能提升。

但这一格局正在被打破。大型云厂商正在集体转向自研芯片:

公司 自研芯片 进展
Google TPU(Tensor Processing Unit) 已迭代至第七代 Ironwood,2026 年部署
Amazon Trainium / Inferentia 2026 年初年化营收突破 200 亿美元
Microsoft Maia 200 2026 年 1 月发布,采用 3nm 工艺
Meta MTIA(Iris) 计划 2026 年 9 月投产

这一趋势的驱动力并非单一因素。首先是成本。Google 使用自研 TPU 可将 AI 计算成本降低最高 30%。AWS 的自研芯片业务在 2026 年初已达到每年 200 亿美元的年化营收规模。当 AI 推理从“能不能做”变成“划不划算”,单位 Token 的成本就成为核心竞争变量。

其次是供应安全。算力短缺已成为 Google 内部的紧迫问题。报道显示,算力不足不仅加剧了内部资源争夺,还迫使 Google Cloud 拒绝了部分外部客户的合作。就在 2026 年 6 月,Google 同意每月向 SpaceX 支付近 10 亿美元以填补算力缺口。2026 年第一季度,Alphabet 资本支出达 357 亿美元,全年指引上调至 1,800 亿至 1,900 亿美元,是 2025 年 914 亿美元的两倍。同一季度,Google Cloud 营收 200 亿美元,同比增长 63%,合同积压从上一季度的 2,400 亿美元飙升至 4,620 亿美元。管理层在财报电话会上表示,AI 需求前所未有,公司仍然受算力约束。

当需求增速持续跑赢供给扩张速度,自研芯片便从“可选项”变成了“必选项”。

Frozen v2 的“冻结”逻辑:为什么把模型架构焊进硅片能提升 10 倍效率?

理解 Frozen v2 的价值,需要先理解传统 AI 芯片的工作方式。

在传统架构中,AI 模型存储在内存里,芯片从内存中读取权重和架构参数,在计算单元中完成运算,再将结果写回内存。每生成一个 Token,这条流水线就要完整运行一轮。大量功耗消耗在数据的搬运上,真正用于计算的占比反而不高。

Frozen v2 的做法是:将 Gemini 的神经网络架构——包括层级结构、多头注意力机制、残差连接等核心组件——在芯片设计阶段直接固化进物理电路。这些在传统推理中需要反复读取和计算的结构信息,变成了电路的一部分。

这一思路在半导体行业被称为 ASIC(专用集成电路)。比特币矿机是 ASIC,手机 ISP 也是 ASIC——放弃通用性,换取某一特定任务上的极致效率。但此前没有人敢为大模型做 ASIC,因为模型迭代太快,芯片设计周期太长,流片还没走完模型可能已经过时了。

Frozen v2 的赌注在于:Gemini 的底层架构已经稳定到了值得用硅片去记忆的程度。从 2023 年 12 月 Gemini 1.0 发布到 3.5 Flash,底层 Transformer 架构的核心组件——多头注意力、前馈网络、层归一化——没有经历过根本性变化。真正的迭代发生在模型规模、训练数据和后训练优化上,而非基础架构层面。

Frozen v2 固定的是架构,权重可以更新。最初的 Frozen v1 方案曾试图连模型权重一起固化,但 Google 最终放弃了这个方案,因为芯片只能跑一个版本的 Gemini,模型一迭代就作废。Frozen v2 的折中方案是“只锁骨架,不改血肉”。

从数据链路来看,Frozen v2 的效率提升逻辑可以拆解为:

模型架构固化 → 减少指令解码与参数读取次数 → 减少芯片与内存间的数据搬运 → 降低单 Token 能耗 → 单位功耗 Token 处理量提升 6-10 倍

报道指出,Frozen 芯片将成为 Google 自研芯片产品组合中更专门化的分支,而非取代通用型 TPU。Google 目前将 Frozen v2 部分视为试验项目,暂无计划以与 TPU 相同规模生产。目标部署时间定在 2028 年。

从“GPU 数量竞赛”到“单位 Token 成本竞赛”

Frozen v2 的意义不在于它本身能否量产,而在于它代表了一种竞争逻辑的转向。

过去,AI 芯片竞争的核心指标是“谁拥有最多的 GPU”。NVIDIA 在这一维度上建立了难以撼动的优势——截至 2026 年初,NVIDIA 在 AI 加速器与数据中心芯片市场占据约 86% 的份额。集邦咨询预计 2026 年其全球 AI 芯片市场份额约为 64%。2026 年第一季度(NVIDIA 财年 2027 年 Q1),NVIDIA 数据中心营收达 752.5 亿美元,同比增长 92%。

但 Frozen v2 指向的是另一个竞争维度:“谁能以最低的单位成本提供最大的 AI 算力”。当 AI 应用从训练走向大规模推理,单位 Token 的电力成本、芯片成本、数据中心运营成本将决定商业模式的可行性。

Google 在这一维度上拥有一个结构性优势:闲置的 TPU 可以被内部消化——直接纳入 Google 自身的云运营体系——而 NVIDIA 缺乏同等规模的云业务来吸收多余的硬件。这意味着 Google 在自研芯片的产能规划和风险控制上拥有更大的灵活性。

此外,Google 正在通过 TPU 生态向外部市场渗透。据报道,Google 已与多家“Neo-cloud”专业 GPU 云提供商洽谈,推动它们在其服务中增加 TPU 选项。Anthropic、Apple 和 Meta 已成为 TPU 的外部客户。Google 与 Blackstone 的合资企业正在建设 500 兆瓦的 TPU 算力容量。如果更多科技公司将工作负载迁移至 Google 的 TPU 或使用自研芯片,不仅会侵蚀 NVIDIA 的市场份额,还可能压缩其定价空间。

不过,这一进程面临现实约束。台积电是所有芯片设计公司都必须通过的瓶颈,Google 通过博通作为中介来获取产能。2027 年的产能分配正在确定中,Google 能争取到多少产能,将直接反映台积电对 TPU 业务的态度。同时,Google 仍是 NVIDIA 最大的客户之一,每年采购数万颗 NVIDIA GPU 用于训练其最大规模的模型。这种“既是竞争对手又是最大客户”的关系,使得竞争格局更加复杂。

专用化的代价与局限

Frozen v2 的技术路径并非没有代价。报道明确指出,该芯片只有在 Google 维持相同底层架构的前提下,才能兼容未来的 Gemini 模型。一旦模型底层架构发生根本性变化,固化进硅片的那部分设计便可能失效。

与此同时,Google 的 AI 业务正面临更紧迫的挑战。据报道,下一代 Gemini Pro 的发布时间已经推迟,多名资深 AI 研究人员流向竞争对手。中国 AI 模型在美国企业的 Token 使用量中已占 45%。当专用芯片还在 2028 年的路线图上时,Google 需要先稳住的是眼下的模型迭代节奏和人才防线。

另外,Alphabet 近期完成的 847.5 亿美元股权融资——美国历史上规模最大的增发之一——主要用于建设数据中心、部署第七代 Ironwood TPU,以及继续从 NVIDIA 采购 GPU。Frozen v2 要到 2028 年,这笔钱花在当下。

结语

Alphabet 股价因 Frozen v2 的消息而上涨 1.52%,NVIDIA 同期微涨 0.23%。这一差距或许反映了市场对两种竞争路径的不同定价:一边是通用计算芯片的规模壁垒,一边是专用计算芯片的效率革命。

Frozen v2 目前仍是一个试验项目,2028 年的部署时间表也意味着它短期内不会对 NVIDIA 的市场地位构成实质性冲击。但它指向的竞争方向——从“谁拥有最多的 GPU”转向“谁能以最低成本提供最大的 AI 算力”——正在成为整个行业的结构性趋势。

AI 芯片的市场规模预计将从 2025 年的约 618 亿美元增长至 2026 年的约 842 亿美元。在这个高速扩张的市场中,专用化与通用化两条技术路线的竞合,将决定未来十年 AI 基础设施的成本结构与竞争格局。Frozen v2 是否成功尚不确定,但它所代表的思考方式——让芯片为模型定制,而非让模型迁就芯片——已经在改变行业讨论 AI 算力的基本框架。

FAQ

问:Google Frozen v2 芯片相比现有 TPU 的性能提升具体是多少?

Google 工程师预计,Frozen v2 在单位功耗下可提供的 Token 处理能力较公司最新一代 TPU 高出 6 到 10 倍。这一提升主要来源于将 Gemini 模型架构固化进芯片,减少了数据搬运和重复计算带来的能耗。

问:Frozen v2 会取代 NVIDIA 的 GPU 吗?

短期内不会。Frozen v2 是专为 Gemini 模型设计的专用芯片,不会取代通用型 TPU,更不会替代 NVIDIA 的 GPU。Google 目前仍每年从 NVIDIA 采购数万颗 GPU 用于训练其最大规模的模型。

问:Frozen v2 什么时候正式部署?

报道称 Google 的目标部署时间是 2028 年。目前该项目被视为试验性项目,暂无与 TPU 同等规模的生产计划。

问:Alphabet 为什么要自研 AI 芯片?

主要驱动力有三:降低对 NVIDIA 的外部依赖、控制日益增长的算力成本、以及缓解内部严重的算力短缺。2026 年 Q1 Google Cloud 营收 200 亿美元、同比增长 63%,但算力不足限制了进一步增长。

问:Frozen v2 的技术路线有什么风险?

最大的风险是灵活性代价。芯片只兼容采用相同底层架构的 Gemini 后续版本,一旦模型底层发生根本性变化,固化进硅片的设计可能失效。此外,芯片设计周期长于模型迭代周期,这也是此前没有人敢为大模型做 ASIC 的主要原因。

本内容不构成任何要约、招揽、或建议。您在做出任何投资决定之前应始终寻求独立的专业建议。请注意,Gate 可能会限制或禁止来自受限制地区的所有或部分服务。请阅读 用户协议了解更多信息。

分享一下

sign up guide logosign up guide logo
sign up guide content imgsign up guide content img
Sign Up
Log In