本周你就可以订购一块 Tenstorrent Blackhole 开发者卡。售价 999 美元,现货供应,约两周发货。而 Meta MTIA 无法通过任何公开渠道购买或租用;Meta 称 MTIA 是自己为内部工作负载部署的芯片。
两家公司都被算作顶尖的 AI 芯片企业。本文要谈的,正是这两种处境之间的距离。
接下来按厂商逐个来看:你能拿到什么、通过哪条渠道,以及拿到之后软件要花你多少成本。
TL;DR(太长不看版)
- 广泛可租用: AMD Instinct 仍然是 NVIDIA 之外公有云覆盖最广的一家,但产品线已经往前走了。AMD 于 2026 年 7 月发布 MI400 系列,而你最可能租到的,依然是 MI300X、MI325X 和 MI350 系列的机器。
- 单一云: Google 的 TPU 只留在 Google Cloud 上,TPU7x Ironwood 自 2026 年 3 月起正式可用。AWS Trainium 和 Inferentia 也只留在 AWS 上。
- API 加专用基础设施: Groq、Cerebras 和 SambaNova 都提供托管推理,但说它们「只有 API」已经不准确了。三家现在都另有专用或本地部署的路径。
- 你能采购到的硬件: Tenstorrent 直接卖 Blackhole 卡。Qualcomm 则通过企业销售洽谈渠道推出 Dragonfly 数据中心加速器,而不再只是路线图公告。
- 受限或仅内部: Intel Gaudi 3 仍可通过 IBM Cloud 的部分部署获得,Crescent Island 预计将在 2026 年下半年进入客户送样阶段。Etched 表示首批机架将在 2026 年夏季交付给签约客户。Meta MTIA 和 Microsoft Maia 则仍是内部使用或与 Azure 集成,而不是面向公众的自助加速器。
本文不涉及的内容
有三件事被刻意排除在讨论范围之外,下面每一项厂商状态都以 2026 年 8 月为准。
- 定价。 这里的问题是你能不能拿到硬件,而不是用一小时要花多少钱。
- 预测。 不预判谁会赢。
- 消费级和桌面显卡。 本文讨论的是数据中心和云端加速器。
获取 AI 加速器算力的五种方式
本文涉及的加速器可归入五条获取路径:在多家云上租用、通过单一云租用、托管 API 访问、专用或可直接购买的硬件,以及面向未广泛开放自助服务的产品的有限企业访问。有些公司现在同时覆盖其中多条路径。另有一类始终仅限内部,公众没有任何租用或购买这些芯片的途径。
获取方式是一种状态,而不是公司的永久属性。新一代产品发布、云厂商上架或下架硬件、厂商开放或关闭采购渠道,都会让它发生变化。它同样不说明质量或规模。它描述的是你怎样才能拿到算力,而正是这条渠道决定了一个名字是不是你真能拿来做点什么的选项。
NVIDIA 占据了数据中心 AI 加速器营收的绝大部分,几乎出现在每一朵云上,而 CUDA 是其他所有东西被拿来对照的那个基准面。本文里其他 AI 加速器公司之所以值得看,正是因为触达它们的方式差别极大。
| 厂商与产品 | 获取层级 | 获取方式 | 软件栈 | 工作量 | 状态 |
|---|---|---|---|---|---|
| NVIDIA(基准,而非替代方案) | 多家云 | 几乎所有云服务商 | CUDA | 训练与推理 | 正式可用 |
| AMD Instinct MI300X | 多家云 | Vultr、TensorWave、Oracle Cloud、DigitalOcean、Crusoe、Hot Aisle、RunPod、Seeweb、Cirrascale | ROCm | 训练与推理 | 正式可用 |
| AMD Instinct MI325X | 多家云 | Vultr、TensorWave、DigitalOcean | ROCm | 训练与推理 | 正式可用 |
| Google TPU7x(Ironwood) | 单一云 | Google Cloud | JAX,以及通过 PyTorch/XLA 的 PyTorch | 训练与推理 | 自 2026 年 3 月 31 日起正式可用 |
| AWS Trainium | 单一云 | AWS EC2 Trainium 实例与 UltraServers(Trn2、Trainium3) | Neuron SDK | 训练与推理 | 正式可用 |
| AWS Inferentia2 | 单一云 | AWS EC2 Inf2 实例 | Neuron SDK | 推理 | 正式可用 |
| Groq LPU | 托管 API 与专用基础设施 | GroqCloud 与 GroqMetal | 兼容 OpenAI 的 API 与 Groq 软件栈 | 推理 | 可用 |
| Cerebras WSE-3 与 CS-3 | 托管 API、企业云、本地部署 | Cerebras Cloud 与 CS-3 系统 | Cerebras 软件栈 | 训练与推理 | 可用 |
| SambaNova SN50 | 托管 API、专用、本地部署 | SambaCloud 与 SambaRack | SambaStack | 推理 | 客户发货于 2026 年下半年开始 |
| Intel Gaudi 3 | 特定云 | IBM Cloud 云平台 | Intel Gaudi 软件套件 | 训练、微调与推理 | 限定可用 |
| Tenstorrent Blackhole | 直接购买硬件 | 直接向 Tenstorrent 购买 | 开源 TT-Metalium 软件栈 | 推理与开发工作 | 现货供应,约两周发货 |
| Qualcomm AI200、AI250 与 AI300 | 企业销售 | 联系销售 | Qualcomm AI 软件栈 | 推理 | AI200 预计 2026 年推出,AI250 预计 2027 年送样,AI300 预计 2028 年送样 |
| Etched Sohu | 合约部署 | 企业合约 | Etched 软件栈 | Transformer 推理 | 首批机架于 2026 年夏季发货 |
| Meta MTIA | 无法获得 | 没有对外渠道 | Meta 内部工具链 | Meta 自家的排序、推荐与 GenAI 工作 | 仅限内部 |
| Microsoft Maia 200 | 内部使用,与 Azure 集成 | Microsoft 数据中心 | Maia SDK | 推理 | 内部部署,没有面向公众的自助实例 |
AMD Instinct 是几乎到处都能租到的那一个
在本文列出的 NVIDIA 替代方案里,AMD Instinct 的供应商覆盖面最广:MI300X 和 MI325X 可在多家云和新兴云厂商处获得,而不是绑定在某一家超大规模厂商上。AMD 于 2026 年 7 月推出以 MI455X 领衔的 MI400 系列,但老一代依然重要,因为你在现有的租用部署里更可能碰到的正是它们。对大多数已有的 PyTorch 工作负载来说,ROCm 仍是本文中最短的一次软件移植。
瓶颈不在硬件。MI300X 在一个 750W 模块中通过 304 个 CDNA3 计算单元承载 192GB HBM3,带宽 5.3 TB/s。MI325X 把这一数字推到 256GB HBM3E、6 TB/s 和 1000W,而这个容量低于 AMD 最初公布的 288GB。
CUDA核心 是 NVIDIA 所计的单位,而 AMD 计的是计算单元,两者无法换算,因此跨厂商比较时,看显存和带宽更有用。
软件层面的情况已经变了,只是名声还没跟上。ROCm 对 PyTorch 的支持已上游合入官方 PyTorch 仓库,而不是活在社区分支里,当前的 ROCm 版本也跟得上当前的框架。ROCm 7.14.0 支持 PyTorch 2.12,同时还有 AMD 面向更广泛 AI 软件生态的现行集成。
我的判断是,人们至今描述的摩擦既不是吞吐量,也不是框架支持,而是考古。当 CUDA 环境在凌晨三点出问题时,已经有人撞上过那串报错并写下了解法。在 ROCm 上搜索结果更稀薄,于是时间花在找,而不是修。这笔成本从来不会出现在跑分里。
AMD 在加速器上的工作也延伸到了数据中心之外,如果你想要一套便宜的硬件来学这套软件栈,这一点很重要。
AMD 的迷你 PC 集群演示 跑的正是同一家公司的消费级芯片。
Google TPU 和 AWS Trainium 各自只能在一朵云上租到
Google 的 TPU7x 和 AWS 的 Trainium 都已正式可用,也都锁死在单一供应商上。TPU 跑在 Google Cloud 上。Trainium 和 Inferentia 跑在 AWS 上。两者都不提供 AMD 或 NVIDIA 那种跨供应商的可迁移性,而这条约束可能比任何单项规格都更要紧。
TPU7x 是 Google 第七代 Ironwood 家族的首个版本,于 2026 年 3 月 31 日正式可用。Google 将其定位于大规模训练与推理。Trillium v6e 仍可使用,而 Ironwood 仍是 Google 当前正式可用的 TPU 世代。Google 还发布了第八代的 TPU 8t 和 TPU 8i,但两者仍标注为即将推出。
关于 TPU 最有用的事实并不在规格表上:它有一条免费的入口。Colab 和 Kaggle 都提供 TPU 运行时,TPU Research Cloud 则向研究者发放使用时长。这条免费入口让你在投入云预算之前就能试试 TPU 的软件路径,不过别默认这些免费服务提供的就是最新的 Ironwood 硬件。
AWS 通过 Trainium 实例和 UltraServers,以及面向 Inferentia2 的 Inf2 实例来提供自家芯片。Trainium3 UltraServers 于 2025 年 12 月正式可用,可扩展到 144 颗芯片,高于上一代 Trn2 UltraServers 的 64 颗。所有路径都要经过 Neuron SDK。AWS 对移植成本的说法比多数厂商都乐观。
AWS Trainium 页面 称 vLLM、HuggingFace Transformers 和 TorchTitan 无需自定义代码、无需移植工作即可在 Trainium 上原生运行。这是厂商对自家产品的说法,而非经过独立验证的结果。
两者都属于值得有意识去做的取舍。你多了一家芯片供应方,却失去了把这份工作负载搬到另一朵云而不必重做的能力。对一个本就押注单一供应商的团队来说,这几乎不构成代价;对一个以规避绑定为立身之本的团队来说,这就是全部代价。
必须装进显存的东西 才是首先约束选择的东西:每颗 Trainium3 芯片 144GB,和 Ironwood 的 192GB 是不同的规划问题,无论卖它的是谁。
Groq、Cerebras 和 SambaNova 已经不止是托管 API
Groq、Cerebras 和 SambaNova 都提供托管推理,但 API 已经不是获取方式的全部。Groq 把 GroqCloud 与专用的 GroqMetal 基础设施配成一对。Cerebras 在云端访问之外,还有可本地部署的 CS-3 系统。SambaNova 在 SambaCloud 之外还有 SambaRack 和 SambaStack。如今的分野在于你需要多大的基础设施控制权,以及你愿意在企业采购流程里走多远。
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
Groq 自己的公告 称 GroqCloud 将继续不间断运行。
在 2026 年 3 月的 GTC 上,NVIDIA 在其 Vera Rubin 平台内发布了 NVIDIA Groq 3 LPU。
NVIDIA 的 Vera Rubin 公告 描述了一个包含 256 颗 LPU 处理器的 LPX 机架,将于 2026 年下半年供货。
Cerebras 走的是相反的物理路线:一整片晶圆级的部件,拥有 90 万个核心和 44GB 片上 SRAM,标称 125 PFLOPs。
Cerebras 的推理页面 提供 5 美元免费额度,并把迁移描述为只需改两处代码。有一处区分对规划仍然重要:自助 API 是推理这条容易走的路,而训练、微调、专用容量和本地 CS-3 部署,则位于企业路径更靠上的位置。
SambaNova 当前的硬件主线是 SambaRack SN50,每个机架搭载 16 颗第五代 SN50 RDU。SambaCloud 仍是托管路径,而 SambaRack 和 SambaStack 提供可本地部署或托管运行的专用基础设施。
托管访问对这三家来说仍是最容易的入口,但它已经不能代表产品的全貌。
Tenstorrent 卖的是你能真正拥有的硬件
Tenstorrent 是本文中唯一一家你可以以个人身份直接买下其加速器的厂商,价格也谈不上是一笔资本决策。
Tenstorrent 的硬件页面 把 Blackhole p100a 标价 999 美元,p150a 和 p150b 标价 1,399 美元,均为现货,约两周发货。整套软件栈完全开源。
这些卡搭载 120 个 Tensix 核心和 16 个 RISC-V 核心,p100a 配 28GB GDDR6,p150 两款配 32GB,功耗最高 300W。p150a 和 p150b 多出 p100a 没有的 QSFP-DD 以太网端口,如果你打算把多张卡互联,买的就是这两款。HPCwire 报道称,机架级的 Galaxy Blackhole 已于 2026 年 4 月 28 日正式可用,起价 11 万美元;更老的 Wormhole 产品线仍在售,其中包括一台 1.2 万美元的 TT-LoudBox 工作站。
这条附带条件对决策的分量不亚于价格,而它指向的正是那张老卡。Tenstorrent 的大部分文档、教程和经过验证的模型支持,至今仍以 Wormhole 为目标,Blackhole 的软件支持还处在更早的阶段。具体来说:这条路适合愿意做真正的移植工作、并在文档写到头时去读源码的人;不适合希望现有 PyTorch 代码原封不动就能跑的人,而后者是一个完全合理的诉求。
Qualcomm、Intel 和 Etched 的获取路径更窄
这三家因各不相干的原因,都处在更窄的获取路径之后。Qualcomm 正围绕企业部署铺开一条跨越多代的数据中心加速器路线图。Intel Gaudi 3 仍可通过 IBM Cloud 的部分部署获得,与此同时 Crescent Island 正朝客户送样推进。Etched 表示首批 Sohu 机架将在 2026 年夏季依企业合约交付,而不是通过自助云服务。
Qualcomm 的数据中心路线图如今涵盖 Dragonfly AI200、AI250 以及新发布的 AI300,加速器保持一年一代的节奏,聚焦推理。这仍是一条面向企业的路径,而不是你今天就能加进云账户里的那种自助加速器租用。
Intel 是最值得琢磨的一条,因为 Gaudi 3 始终没能拿到广泛的云覆盖,但它也没有消失。IBM Cloud 仍在限定可用的范围内提供 Gaudi 3 加速的虚拟服务器规格,部署地点包括达拉斯、华盛顿特区和法兰克福。Intel 的下一步是 Crescent Island,一款面向推理的 GPU,预计在 2026 年下半年进入客户送样阶段。今天的 Gaudi 3 是一个窄选项,而不是一个已经出局的选项。
Etched 正在打造 Sohu,一款专门用于 Transformer 推理的 ASIC。公司已融资 8 亿美元,拥有可工作的 A0 硅片,宣称签下超过 10 亿美元的客户合约,首批机架计划在 2026 年夏季发货。其性能声明出自自家、未经独立基准测试,所以吞吐数字并不是有用的部分。有用的部分是软件栈。Etched 把芯片、机架和软件环境当作一个专用平台来做,因此别假设 CUDA 时代的服务栈能原样搬过去。对于以极大规模跑 Transformer 推理的签约客户,这条路走得通;但对一个依赖加速器可迁移性的团队来说,这是大得多的一份承诺。
只供内部的芯片,以及替别人造芯片的公司
有两种情形从外面看都像一家 AI 芯片公司,实际行为却完全不同。Meta 和 Microsoft 设计的加速器由自己运营,不卖给任何人。Broadcom 和 Marvell 则为别家公司的架构做设计与实现。这两类都没有开发者能租到的产品,而原因毫无共通之处。
Meta 的 MTIA 是第一类中最纯粹的例子。
Meta 自己的工程博客 描述了在其应用的自然内容和广告两侧部署数十万颗 MTIA 芯片用于推理负载,其中 MTIA 300 已投入生产用于排序和推荐训练,MTIA 400、450 和 500 则按大约每六个月一代的节奏规划。这是一大批你永远租不到一个小时的芯片。
Microsoft 这一例的边界要模糊一些。2026 年 1 月推出的 Maia 200 是 Microsoft 当前的自研推理加速器,已经部署在其数据中心,Maia SDK 也已开放预览。Microsoft 目前并未记载任何面向公众的自助 Maia 实例,因此在这份对比里它仍归于内部使用或与 Azure 集成的一侧。
Broadcom 和 Marvell 又是另一回事,值得说清楚,因为它们的名字总是挨着 NVIDIA 出现。Google 的 TPU 是个好例子。TPU 这个产品和架构归 Google 所有,而 Broadcom 贡献的是定制芯片的设计与实现工作,可能涵盖互连、封装,以及从架构走到可量产芯片的这段路。Broadcom 并不直接向开发者售卖 TPU 或其他通用加速器。根据其 2026 财年第一季度财报,AI 业务营收达到 84 亿美元,同比增长 106%,这解释了为什么这个名字无处不在。但它依然不是一颗你能租到的芯片。
而这正是「制造商」这个词开始承受它撑不住的分量的地方。Broadcom 和 Marvell 并不制造芯片,上面列出的大多数 AI 芯片制造商也一样:它们几乎全是无晶圆厂模式,也就是自己做设计,把制造完全外包给别人。
把获取路径与你的工作负载对上
大规模训练会很快收窄现实选项:广泛可得的 AMD Instinct、绑定单一云的 TPU 或 Trainium,或者一套企业级 Cerebras 部署。生产推理则打开更多路径,因为 Groq、Cerebras 和 SambaNova 都既有托管服务,也提供某种形式的专用基础设施。到了做实验这一层,选择又更宽:从免费的 TPU 额度,到一张你能插进自己机器的 Tenstorrent 卡。
这些边界比一张表格能呈现的要模糊得多。问题不只是这块芯片能做什么,还包括你能在哪里够到它、你现有的软件栈有多少能在迁移中活下来,以及做出来的工作负载日后能不能再搬去别处。Cerebras 可以在企业基础设施上同时做训练和推理,而 Trainium 仍然绑在 AWS 上。
这些都撼动不了 NVIDIA。对大多数团队来说,真正活的问题不是要不要离开 CUDA,而是值不值得在它旁边再维护第二套栈。
该按哪张卡来做规划 就是你留在原地时剩下的那个决定,而那是与本文不同的另一道题。
决定权更多在渠道,而不在芯片。摆在你桌上的一张卡,和藏在别人 API 背后的同一档芯片,即便吞吐相近,也不是同一件工具:前者让你去试那些你还没想到的事,后者按 token 向你收取你已经知道该怎么问的东西。
常见问题
你真的租得到 Google TPU 吗?
可以。TPU7x,也就是 Google 当前正式可用的 Ironwood TPU,只在 Google Cloud 上提供。更早的 TPU 世代同样可用,Colab、Kaggle 和 TPU Research Cloud 还为部分工作负载提供免费的 TPU 额度。JAX 仍是原生路径,PyTorch 则通过 PyTorch/XLA 运行。
哪一个 NVIDIA 替代方案运行现有 PyTorch 代码最省事?
多数情况下是 AMD Instinct:ROCm 是 PyTorch 官方支持的后端,代码路径本来就在。Google 的 TPU 通过 PyTorch/XLA 这层翻译桥来跑 PyTorch。AWS 称 vLLM、HuggingFace Transformers 和 TorchTitan 在 Trainium 上无需移植即可运行,这是厂商自己的说法。另一头,Etched 的 Sohu 使用自家的专用软件栈,所以要预期比 ROCm 或 PyTorch/XLA 多得多的移植工作。
既然租不到它们的芯片,为什么 Broadcom 和 Qualcomm 还被称作 NVIDIA 的竞争对手?
原因各不相同。Broadcom 做的是为自研加速器的公司提供定制芯片,而不是把一款标准加速器直接卖给开发者。Qualcomm 设计自家的 Dragonfly 加速器,AI200、AI250 和 AI300 如今都在其数据中心路线图上,但获取方式面向企业,而不是普通的自助云租用。两家都在 AI 基础设施领域竞争,却没有给开发者 NVIDIA 或 AMD 那样的公开获取模式。
能不能直接买下一块 AI 加速器,而不是去租?
可以。Tenstorrent 直接售卖 Blackhole 开发者卡,p100a 起价 999 美元,p150a 和 p150b 为 1,399 美元,现货供应、约两周发货,配套软件栈完全开源。附带条件和价格一样要紧:大部分文档和经过验证的模型支持仍以更老的 Wormhole 卡为目标,所以要为移植预留时间,而不是指望现有代码原样就能跑。
讨论
评论
登录后参与讨论。