Vous pouvez commander une carte de développement Tenstorrent Blackhole cette semaine. Elle coûte 999 $, elle est en stock et elle est expédiée sous deux semaines environ. Vous ne pouvez ni acheter ni louer un Meta MTIA par un canal public ; Meta décrit MTIA comme du silicium qu'elle déploie pour ses propres charges de travail.
Les deux entreprises figurent parmi les principales entreprises de puces IA. C'est l'écart entre ces deux situations qui fait l'objet de cet article.
Ce qui suit est un tour d'horizon fournisseur par fournisseur : ce que vous pouvez obtenir, par quel canal, et ce que le logiciel vous coûte une fois la puce en main.
En bref
- Largement disponible à la location : AMD Instinct conserve la plus large présence en cloud public hors NVIDIA, mais la gamme a évolué. AMD a lancé la série MI400 en juillet 2026, tandis que les systèmes MI300X, MI325X et de série MI350 restent ceux que vous avez le plus de chances de trouver en location.
- Cloud unique : Les TPU de Google restent sur Google Cloud, TPU7x Ironwood étant disponible de façon générale depuis mars 2026. AWS Trainium et Inferentia restent sur AWS.
- API et infrastructure dédiée : Groq, Cerebras et SambaNova proposent tous de l'inférence hébergée, mais parler d'API uniquement n'est plus exact. Chacun dispose désormais aussi d'une voie dédiée ou sur site.
- Matériel que vous pouvez acquérir : Tenstorrent vend directement les cartes Blackhole. Qualcomm présente ses accélérateurs de centre de données Dragonfly via un parcours commercial entreprise plutôt que par de simples annonces de feuille de route.
- Limité ou interne : Intel Gaudi 3 reste accessible via des déploiements IBM Cloud sélectionnés, tandis que Crescent Island devrait entrer en échantillonnage client au second semestre 2026. Etched annonce que ses premiers racks partiront chez des clients sous contrat à l'été 2026. Meta MTIA et Microsoft Maia restent internes ou intégrés à Azure plutôt que d'être des accélérateurs publics en libre-service.
Ce que cet article n'aborde pas
Trois éléments restent délibérément hors du cadre, et chaque statut de fournisseur ci-dessous reflète août 2026.
- Les tarifs. La question ici est de savoir si vous pouvez obtenir le matériel, pas ce que coûte une heure dessus.
- Les prévisions. Aucun pronostic sur le vainqueur.
- Les cartes grand public et de bureau. Le sujet, ce sont les accélérateurs de centre de données et de cloud.
Les cinq façons d'obtenir du calcul sur un accélérateur IA
Cinq voies d'accès couvrent les accélérateurs de cet article : la location sur plusieurs clouds, la location via un cloud unique, l'accès par API hébergée, le matériel dédié ou directement achetable, et l'accès entreprise limité pour les produits qui ne sont pas largement en libre-service. Certaines entreprises couvrent désormais plusieurs de ces voies. Un groupe à part reste strictement interne, sans aucun moyen public de louer ou d'acheter le silicium.
L'accès est un statut, pas une propriété permanente de l'entreprise. Il change au fil des nouvelles générations, quand les clouds ajoutent ou retirent du matériel et quand les fournisseurs ouvrent ou ferment des canaux d'achat. Il ne dit rien non plus sur la qualité ou l'échelle. Il décrit comment vous pouvez obtenir le calcul, et ce canal détermine si un nom est quelque chose sur quoi vous pouvez agir.
NVIDIA détient une large majorité du chiffre d'affaires des accélérateurs IA de centre de données, sa présence couvre pratiquement tous les clouds, et CUDA est la référence à laquelle tout le reste est comparé. Les autres entreprises d'accélérateurs IA présentées ici sont intéressantes par la façon très différente dont on y accède.
| Fournisseur et produit | Niveau d'accès | Comment l'obtenir | Pile logicielle | Charge de travail | Statut |
|---|---|---|---|---|---|
| NVIDIA (référence, pas une alternative) | Plusieurs clouds | Presque tous les fournisseurs de cloud | CUDA | Entraînement et inférence | Disponible de façon générale |
| AMD Instinct MI300X | Plusieurs clouds | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Entraînement et inférence | Disponible de façon générale |
| AMD Instinct MI325X | Plusieurs clouds | Vultr, TensorWave, DigitalOcean | ROCm | Entraînement et inférence | Disponible de façon générale |
| Google TPU7x (Ironwood) | Un seul cloud | Google Cloud | JAX, et PyTorch via PyTorch/XLA | Entraînement et inférence | Disponible de façon générale depuis le 31 mars 2026 |
| AWS Trainium | Un seul cloud | Instances AWS EC2 Trainium et UltraServers (Trn2, Trainium3) | Neuron SDK | Entraînement et inférence | Disponible de façon générale |
| AWS Inferentia2 | Un seul cloud | Instances AWS EC2 Inf2 | Neuron SDK | Inférence | Disponible de façon générale |
| Groq LPU | API hébergée et infrastructure dédiée | GroqCloud et GroqMetal | API compatible OpenAI et pile Groq | Inférence | Disponible |
| Cerebras WSE-3 et CS-3 | API hébergée, cloud entreprise, sur site | Cerebras Cloud et systèmes CS-3 | Pile logicielle Cerebras | Entraînement et inférence | Disponible |
| SambaNova SN50 | API hébergée, dédié, sur site | SambaCloud et SambaRack | SambaStack | Inférence | Les livraisons clients commencent au second semestre 2026 |
| Intel Gaudi 3 | Cloud sélectionné | IBM Cloud nuage | Suite logicielle Intel Gaudi | Entraînement, affinage et inférence | Disponibilité sélective |
| Tenstorrent Blackhole | Achat du matériel | Directement chez Tenstorrent | Pile TT-Metalium open source | Inférence et travaux de développement | En stock, expédié sous deux semaines environ |
| Qualcomm AI200, AI250 et AI300 | Vente entreprise | Contacter l'équipe commerciale | Pile logicielle IA de Qualcomm | Inférence | AI200 attendu en 2026, échantillonnage de l'AI250 attendu en 2027, échantillonnage de l'AI300 attendu en 2028 |
| Etched Sohu | Déploiements sous contrat | Contrats entreprise | Pile logicielle Etched | Inférence de transformeurs | Premiers racks expédiés à l'été 2026 |
| Meta MTIA | Impossible à obtenir | Aucune voie externe | Outillage interne de Meta | Les travaux de classement, de recommandation et de GenAI de Meta | Interne uniquement |
| Microsoft Maia 200 | Interne, intégré à Azure | Centres de données Microsoft | Maia SDK | Inférence | Déployé en interne, sans instance publique en libre-service |
AMD Instinct est celui que vous pouvez louer presque partout
AMD Instinct présente la plus large empreinte fournisseur parmi les alternatives à NVIDIA évoquées ici, avec MI300X et MI325X disponibles chez plusieurs fournisseurs de cloud et de neocloud plutôt que liés à un seul hyperscaler. AMD a lancé la série MI400 en juillet 2026, emmenée par le MI455X, mais les générations plus anciennes comptent encore, car ce sont celles que vous trouverez le plus souvent dans les déploiements de location existants. ROCm reste le portage logiciel le plus court de cet article pour la plupart des charges PyTorch existantes.
Le matériel n'est pas la contrainte. Le MI300X embarque 192 Go de HBM3 à 5,3 To/s répartis sur 304 unités de calcul CDNA3 dans un module de 750 W. Le MI325X pousse à 256 Go de HBM3E à 6 To/s et 1000 W, une capacité inférieure aux 288 Go annoncés au départ par AMD.
Cœurs CUDA sont ce que compte NVIDIA, là où AMD compte des unités de calcul, et les deux ne se convertissent pas, raison pour laquelle la mémoire et la bande passante se comparent plus utilement d'un fournisseur à l'autre.
La situation logicielle a changé, et la réputation a du retard. La prise en charge de PyTorch par ROCm est intégrée en amont dans le dépôt officiel PyTorch plutôt que de vivre dans un fork communautaire, et les versions actuelles de ROCm suivent les frameworks actuels. ROCm 7.14.0 prend en charge PyTorch 2.12, aux côtés des intégrations actuelles d'AMD pour l'écosystème logiciel IA plus large.
Mon interprétation, c'est que la friction que les gens décrivent encore ne tient ni au débit ni à la prise en charge des frameworks. C'est de l'archéologie. Quand une installation CUDA casse à trois heures du matin, quelqu'un a déjà rencontré ce message d'erreur et noté le correctif. Sur ROCm, la recherche est plus maigre, donc le temps part en fouille plutôt qu'en réparation. Ce coût n'apparaît jamais dans un benchmark.
Le travail d'AMD sur les accélérateurs déborde aussi du centre de données, ce qui compte si vous voulez du matériel bon marché pour apprendre la pile.
La démonstration de cluster de mini-PC d'AMD tourne sur le silicium grand public de cette même entreprise.
Google TPU et AWS Trainium se louent sur exactement un cloud chacun
Le TPU7x de Google et le Trainium d'AWS sont tous deux disponibles de façon générale et tous deux verrouillés sur un seul fournisseur. TPU tourne sur Google Cloud. Trainium et Inferentia tournent sur AWS. Aucun ne vous offre la portabilité multi-fournisseurs d'AMD ou de NVIDIA, et cette contrainte peut peser plus lourd que n'importe quelle spécification prise isolément.
TPU7x est la première sortie de la famille Ironwood de septième génération de Google et est disponible de façon générale depuis le 31 mars 2026. Google le positionne pour l'entraînement et l'inférence à grande échelle. Trillium v6e reste disponible, tandis qu'Ironwood reste la génération de TPU actuellement disponible de façon générale chez Google. Google a aussi annoncé les TPU 8t et TPU 8i de huitième génération, mais les deux sont encore annoncés comme à venir.
Le fait le plus utile à propos des TPU ne figure pas sur la fiche technique. Il existe une rampe d'accès gratuite : Colab et Kaggle proposent tous deux des environnements TPU, et le TPU Research Cloud accorde du temps aux chercheurs. Cette rampe gratuite vous donne un moyen de tester la chaîne logicielle TPU avant d'engager un budget cloud, même s'il ne faut pas supposer que ces services gratuits fournissent spécifiquement le matériel Ironwood le plus récent.
AWS atteint son propre silicium via les instances Trainium et les UltraServers, plus les instances Inf2 pour Inferentia2. Les UltraServers Trainium3 sont disponibles de façon générale depuis décembre 2025 et montent à 144 puces, contre 64 sur les précédents UltraServers Trn2. Tout passe par le Neuron SDK. AWS présente le coût de portage de façon plus optimiste que la plupart des fournisseurs.
La page AWS Trainium indique que vLLM, HuggingFace Transformers et TorchTitan tournent nativement sur Trainium sans code spécifique ni effort de portage. C'est l'affirmation du fournisseur sur son propre produit, pas un résultat vérifié de façon indépendante.
Les deux s'inscrivent dans un arbitrage à faire en connaissance de cause. Vous gagnez un second fournisseur de silicium et vous perdez la possibilité de déplacer cette charge vers un autre cloud sans tout refaire, ce qui ne coûte presque rien à une équipe déjà engagée chez un fournisseur et coûte tout à une équipe construite autour du refus de l'engagement.
Ce qui doit tenir en mémoire contraint le choix en premier : 144 Go par puce Trainium3, ce n'est pas le même problème de dimensionnement que les 192 Go d'Ironwood, quel qu'en soit le vendeur.
Groq, Cerebras et SambaNova vont au-delà des API hébergées
Groq, Cerebras et SambaNova proposent tous de l'inférence hébergée, mais l'API ne résume plus l'accès. Groq associe GroqCloud à l'infrastructure dédiée GroqMetal. Cerebras propose l'accès cloud aux côtés de systèmes CS-3 qui peuvent tourner sur site. SambaNova propose SambaCloud aux côtés de SambaRack et SambaStack. La distinction porte désormais sur le degré de contrôle d'infrastructure dont vous avez besoin et jusqu'où vous acceptez d'aller dans un processus d'achat entreprise.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
L'annonce de Groq elle-même indique que GroqCloud continuera de fonctionner sans interruption.
Lors de la GTC de mars 2026, NVIDIA a dévoilé le NVIDIA Groq 3 LPU au sein de sa plateforme Vera Rubin.
L'annonce Vera Rubin de NVIDIA décrit un rack LPX de 256 processeurs LPU, disponible au second semestre 2026.
Cerebras adopte l'approche physique inverse : une seule pièce à l'échelle du wafer, avec 900 000 cœurs et 44 Go de SRAM sur puce, annoncée à 125 PFLOPs.
La page d'inférence de Cerebras offre 5 $ de crédit gratuit et décrit la migration comme deux changements de code seulement. Une distinction compte encore pour la planification : l'API en libre-service est la voie facile pour l'inférence, tandis que l'entraînement, l'affinage, la capacité dédiée et les déploiements CS-3 sur site se situent plus haut sur le parcours entreprise.
L'actualité matérielle de SambaNova s'articule autour de SambaRack SN50, construit sur 16 RDU SN50 de cinquième génération par rack. SambaCloud reste la voie hébergée, tandis que SambaRack et SambaStack fournissent une infrastructure dédiée pouvant tourner sur site ou en environnement hébergé.
L'accès hébergé reste le point d'entrée le plus simple pour les trois, mais il ne décrit plus l'offre complète.
Tenstorrent vend du matériel que vous pouvez posséder
Tenstorrent est le seul fournisseur de cet article dont vous pouvez acheter l'accélérateur en tant que particulier, à un prix qui ne relève pas d'une décision d'investissement.
La page matériel de Tenstorrent affiche le Blackhole p100a à 999 $ et les p150a et p150b à 1 399 $, en stock et expédiés sous deux semaines environ. La pile est entièrement open source.
Les cartes embarquent 120 cœurs Tensix et 16 cœurs RISC-V, avec 28 Go de GDDR6 sur la p100a et 32 Go sur la paire p150, pour une consommation allant jusqu'à 300 W. Les p150a et p150b ajoutent des ports Ethernet QSFP-DD absents de la p100a, ce que vous achetez si vous comptez relier des cartes entre elles. HPCwire a rapporté que le Galaxy Blackhole à l'échelle du rack est disponible de façon générale depuis le 28 avril 2026 à partir de 110 000 $, et l'ancienne gamme Wormhole reste en vente, y compris une station de travail TT-LoudBox à 12 000 $.
La réserve pèse autant dans la décision que le prix, et elle pointe vers cette carte plus ancienne. L'essentiel de la documentation, des tutoriels et des modèles vérifiés de Tenstorrent vise encore Wormhole. La prise en charge logicielle de Blackhole est plus tôt dans son cycle. Concrètement : cela convient à quelqu'un prêt à faire un vrai travail de portage et à lire le code source quand la documentation s'arrête. Cela ne convient pas à quelqu'un qui veut que du code PyTorch existant tourne sans modification, ce qui est un souhait parfaitement raisonnable.
Qualcomm, Intel et Etched ont des voies d'accès plus étroites
Ces trois-là se trouvent derrière des voies d'accès plus étroites, pour des raisons sans rapport entre elles. Qualcomm déploie une feuille de route d'accélérateurs de centre de données sur plusieurs générations, articulée autour de déploiements en entreprise. Intel Gaudi 3 reste accessible via des déploiements IBM Cloud sélectionnés, pendant que Crescent Island avance vers l'échantillonnage client. Etched annonce que ses premiers racks Sohu partiront à l'été 2026 dans le cadre de contrats entreprise, et non via un service cloud en libre-service.
La feuille de route de Qualcomm pour le centre de données couvre désormais Dragonfly AI200, AI250 et le tout nouveau AI300, avec une cadence annuelle d'accélérateurs axée sur l'inférence. Cela reste une voie orientée entreprise, et non le genre de location d'accélérateur en libre-service que vous pouvez ajouter à un compte cloud aujourd'hui.
Intel est le cas instructif, parce que Gaudi 3 n'a jamais atteint une large présence cloud, sans pour autant disparaître. IBM Cloud propose toujours des profils de serveurs virtuels accélérés par Gaudi 3 en disponibilité sélective, avec des déploiements à Dallas, Washington DC et Francfort. L'étape suivante d'Intel est Crescent Island, un GPU orienté inférence attendu en échantillonnage client au second semestre 2026. Gaudi 3 est aujourd'hui une option étroite, pas une option close.
Etched construit Sohu, un ASIC spécialisé dans l'inférence de transformeurs. L'entreprise a levé 800 millions de dollars, dispose d'un silicium A0 fonctionnel, annonce plus d'un milliard de dollars de contrats clients signés, et les premiers racks doivent partir à l'été 2026. Ses affirmations de performance lui appartiennent et n'ont pas été mesurées de façon indépendante : les chiffres de débit ne sont donc pas la partie utile. La partie utile, c'est la pile logicielle. Etched conçoit la puce, le rack et l'environnement logiciel comme une plateforme spécialisée unique, il ne faut donc pas supposer que la pile de service de l'ère CUDA se transpose sans changement. Cela peut convenir à un client sous contrat qui fait de l'inférence de transformeurs à très grande échelle, mais c'est un engagement bien plus lourd pour une équipe qui dépend de la portabilité entre accélérateurs.
Le silicium strictement interne et les entreprises qui fabriquent des puces pour autrui
Deux situations ressemblent de l'extérieur à une entreprise de puces IA sans se comporter du tout pareil. Meta et Microsoft conçoivent des accélérateurs qu'elles exploitent elles-mêmes et ne vendent à personne. Broadcom et Marvell conçoivent et implémentent du silicium pour les architectures d'autres entreprises. Aucun des deux groupes n'a de produit qu'un développeur puisse louer, pour des raisons qui n'ont rien à voir entre elles.
Le MTIA de Meta est le cas le plus net du premier type.
Le billet d'ingénierie de Meta elle-même décrit le déploiement de centaines de milliers de puces MTIA pour des charges d'inférence portant à la fois sur le contenu organique et sur la publicité dans ses applications, avec MTIA 300 déjà en production pour l'entraînement au classement et à la recommandation, et MTIA 400, 450 et 500 prévus à une cadence d'environ six mois. Cela représente une quantité colossale de silicium dont vous ne louerez jamais une seule heure.
Le cas de Microsoft est plus flou sur les bords. Maia 200, présenté en janvier 2026, est l'accélérateur d'inférence maison actuel de Microsoft et est déjà déployé dans ses centres de données, le Maia SDK étant disponible en préversion. Microsoft ne documente pas actuellement d'instance Maia publique en libre-service, ce qui la place encore du côté interne ou intégré à Azure de cette comparaison.
Broadcom et Marvell sont encore autre chose, et cela mérite d'être clarifié, car leurs noms reviennent sans cesse aux côtés de celui de NVIDIA. Le TPU de Google est un bon exemple. Google possède le produit et l'architecture TPU, tandis que Broadcom apporte un travail de conception et d'implémentation en silicium sur mesure, qui peut inclure les interconnexions, le packaging et le chemin de l'architecture jusqu'au silicium fabricable. Broadcom ne vend pas de TPU, ni d'autre accélérateur généraliste, directement aux développeurs. Son chiffre d'affaires du segment IA, publié dans ses résultats du premier trimestre fiscal 2026, a atteint 8,4 milliards de dollars, en hausse de 106 pour cent sur un an, ce qui explique pourquoi ce nom est partout. Cela reste une puce que vous ne pouvez pas louer.
C'est là que le mot fabricants se met à porter un poids qu'il ne peut pas soutenir. Broadcom et Marvell ne fabriquent pas de puces, et la plupart des fabricants de puces IA cités plus haut non plus : presque tous sont fabless, c'est-à-dire qu'ils conçoivent le silicium et sous-traitent entièrement la fabrication à quelqu'un d'autre.
Faire correspondre une voie d'accès à votre charge de travail
L'entraînement à grande échelle réduit vite les choix pratiques : AMD Instinct largement disponible, TPU ou Trainium sur un cloud unique, ou un déploiement Cerebras en entreprise. L'inférence en production ouvre davantage de voies, parce que Groq, Cerebras et SambaNova proposent tous des services hébergés tout en offrant aussi une forme d'infrastructure dédiée. L'expérimentation est encore plus large, de l'accès gratuit aux TPU à une carte Tenstorrent que vous pouvez mettre dans votre propre machine.
Ces frontières sont plus floues qu'un tableau ne peut le montrer. La question n'est pas seulement ce que le silicium sait faire, mais où vous pouvez l'atteindre, quelle part de votre pile logicielle existante survit au déplacement, et si la charge qui en résulte pourra bouger ailleurs plus tard. Cerebras peut entraîner et inférer sur de l'infrastructure d'entreprise, tandis que Trainium reste attaché à AWS.
Rien de tout cela ne déloge NVIDIA. Pour la plupart des équipes, la vraie question n'est pas de quitter CUDA, mais de savoir si une seconde pile vaut la peine d'être maintenue à côté.
Quelle carte dimensionner est la décision qui reste si vous restez où vous êtes, et c'est un tout autre exercice que celui-ci.
Le canal décide plus que la puce. Une carte sur votre bureau et le même type de silicium derrière l'API de quelqu'un d'autre ne sont pas le même outil, même quand le débit finit proche, parce que l'un vous laisse essayer des choses auxquelles vous n'avez pas encore pensé et l'autre vous facture au jeton ce que vous savez déjà demander.
Foire aux questions
Peut-on vraiment louer un TPU de Google ?
Oui. TPU7x, le TPU Ironwood actuellement disponible de façon générale chez Google, est proposé sur Google Cloud et uniquement là. Les générations de TPU plus anciennes sont également disponibles, et Colab, Kaggle et le TPU Research Cloud offrent un accès gratuit aux TPU pour certaines charges. JAX reste la voie native, tandis que PyTorch passe par PyTorch/XLA.
Quelle alternative à NVIDIA exécute du code PyTorch existant avec le moins de travail ?
AMD Instinct, dans la plupart des cas : ROCm est un backend PyTorch officiellement pris en charge, donc le chemin de code existe déjà. Le TPU de Google fait tourner PyTorch via le pont PyTorch/XLA, une couche de traduction. AWS affirme que vLLM, HuggingFace Transformers et TorchTitan tournent sur Trainium sans effort de portage, ce qui est l'affirmation du fournisseur lui-même. À l'autre extrémité, le Sohu d'Etched utilise sa propre pile logicielle spécialisée : attendez-vous à nettement plus de travail de portage qu'avec ROCm ou PyTorch/XLA.
Pourquoi appelle-t-on Broadcom et Qualcomm des concurrents de NVIDIA si l'on ne peut pas louer leurs puces ?
Pour des raisons différentes. Broadcom travaille sur du silicium sur mesure pour des entreprises qui construisent leurs propres accélérateurs, plutôt que de vendre un accélérateur standard directement aux développeurs. Qualcomm conçoit ses propres accélérateurs Dragonfly, avec AI200, AI250 et AI300 désormais à sa feuille de route pour le centre de données, mais l'accès est orienté entreprise plutôt qu'une location cloud normale en libre-service. Les deux sont en concurrence dans l'infrastructure IA sans offrir aux développeurs le même modèle d'accès public que NVIDIA ou AMD.
Peut-on acheter un accélérateur IA plutôt que d'en louer un ?
Oui. Tenstorrent vend directement des cartes de développement Blackhole, de 999 $ pour la p100a à 1 399 $ pour les p150a et p150b, en stock et expédiées sous deux semaines environ, avec une pile logicielle entièrement open source. La réserve compte autant que le prix : l'essentiel de la documentation et des modèles vérifiés vise encore la carte Wormhole plus ancienne, prévoyez donc du temps de portage plutôt que d'espérer voir tourner du code existant sans changement.
Discussion
Commentaires
Connectez-vous pour participer à la discussion.