Je kunt deze week een Tenstorrent Blackhole-ontwikkelaarskaart bestellen. Hij kost 999 $, is op voorraad en wordt in ongeveer twee weken verzonden. Een Meta MTIA kun je via geen enkel publiek kanaal kopen of huren; Meta omschrijft MTIA als silicium dat het voor de eigen workloads inzet.
Beide bedrijven worden tot de belangrijkste AI-chipbedrijven gerekend. Dit artikel gaat over de afstand tussen die twee situaties.
Wat volgt gaat leverancier voor leverancier: wat je kunt krijgen, via welk kanaal, en wat de software je kost zodra je de hardware hebt.
TL;DR
- Breed te huren: AMD Instinct heeft nog steeds de breedste public-cloudaanwezigheid buiten NVIDIA, maar de productlijn is verder gegaan. AMD lanceerde de MI400-serie in juli 2026, terwijl MI300X-, MI325X- en MI350-seriesystemen degene blijven die je het vaakst te huur vindt.
- Eén cloud: De TPU's van Google blijven op Google Cloud, met TPU7x Ironwood algemeen beschikbaar sinds maart 2026. AWS Trainium en Inferentia blijven op AWS.
- API plus dedicated infrastructuur: Groq, Cerebras en SambaNova bieden allemaal gehoste inferentie, maar alleen API klopt niet meer. Elk heeft nu ook een dedicated of on-premises route.
- Hardware die je kunt aanschaffen: Tenstorrent verkoopt Blackhole-kaarten rechtstreeks. Qualcomm biedt zijn Dragonfly-datacenteraccelerators aan via een zakelijk verkooptraject in plaats van alleen via roadmapaankondigingen.
- Beperkt of intern: Intel Gaudi 3 blijft beschikbaar via geselecteerde IBM Cloud-implementaties, terwijl Crescent Island naar verwachting in de tweede helft van 2026 in klantsampling gaat. Etched zegt dat de eerste racks in de zomer van 2026 naar contractklanten gaan. Meta MTIA en Microsoft Maia blijven intern of Azure-geïntegreerd in plaats van publieke selfservice-accelerators.
Wat dit artikel niet behandelt
Drie dingen vallen bewust buiten het kader, en elke leveranciersstatus hieronder weerspiegelt augustus 2026.
- Prijzen. De vraag hier is of je de hardware kunt krijgen, niet wat een uur erop kost.
- Voorspellingen. Geen uitspraken over wie wint.
- Consumenten- en desktopkaarten. Het onderwerp is datacenter- en cloudaccelerators.
De vijf manieren om rekenkracht op een AI-accelerator te krijgen
Vijf toegangsroutes dekken de accelerators in dit artikel: huren via meerdere clouds, huren via één cloud, gehoste API-toegang, dedicated of rechtstreeks aan te schaffen hardware, en beperkte zakelijke toegang voor producten die niet breed selfservice zijn. Sommige bedrijven bestrijken inmiddels meer dan één van deze routes. Een aparte groep blijft puur intern, zonder enige publieke manier om het silicium te huren of te kopen.
Toegang is een status, geen permanente eigenschap van het bedrijf. Die verandert wanneer nieuwe generaties verschijnen, clouds hardware toevoegen of schrappen en leveranciers inkoopkanalen openen of sluiten. Het zegt ook niets over kwaliteit of schaal. Het beschrijft hoe je aan de rekenkracht komt, en dat kanaal bepaalt of een naam iets is waar je mee aan de slag kunt.
NVIDIA heeft een grote meerderheid van de omzet in datacenter-AI-accelerators, zit op vrijwel elke cloud, en CUDA is het vlak waaraan al het andere wordt afgemeten. De andere AI-acceleratorbedrijven hier zijn interessant door de zeer uiteenlopende manieren waarop je ze bereikt.
| Leverancier en product | Toegangsniveau | Hoe je het krijgt | Softwarestack | Werkbelasting | Status |
|---|---|---|---|---|---|
| NVIDIA (referentie, geen alternatief) | Veel clouds | Vrijwel elke cloudprovider | CUDA | Training en inferentie | Algemeen beschikbaar |
| AMD Instinct MI300X | Veel clouds | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Training en inferentie | Algemeen beschikbaar |
| AMD Instinct MI325X | Veel clouds | Vultr, TensorWave, DigitalOcean | ROCm | Training en inferentie | Algemeen beschikbaar |
| Google TPU7x (Ironwood) | Eén cloud | Google Cloud | JAX, en PyTorch via PyTorch/XLA | Training en inferentie | Algemeen beschikbaar sinds 31 maart 2026 |
| AWS Trainium | Eén cloud | AWS EC2 Trainium-instances en UltraServers (Trn2, Trainium3) | Neuron SDK | Training en inferentie | Algemeen beschikbaar |
| AWS Inferentia2 | Eén cloud | AWS EC2 Inf2-instances | Neuron SDK | Inferentie | Algemeen beschikbaar |
| Groq LPU | Gehoste API en dedicated infrastructuur | GroqCloud en GroqMetal | OpenAI-compatibele API en de Groq-stack | Inferentie | Beschikbaar |
| Cerebras WSE-3 en CS-3 | Gehoste API, enterprise cloud, on-premises | Cerebras Cloud en CS-3-systemen | Cerebras-softwarestack | Training en inferentie | Beschikbaar |
| SambaNova SN50 | Gehoste API, dedicated, on-premises | SambaCloud en SambaRack | SambaStack | Inferentie | Levering aan klanten begint in de tweede helft van 2026 |
| Intel Gaudi 3 | Geselecteerde cloud | IBM Cloud wolk | Intel Gaudi-softwaresuite | Training, fine-tuning en inferentie | Selectieve beschikbaarheid |
| Tenstorrent Blackhole | De hardware kopen | Rechtstreeks bij Tenstorrent | Open source TT-Metalium-stack | Inferentie en ontwikkelwerk | Op voorraad, verzending in ongeveer twee weken |
| Qualcomm AI200, AI250 en AI300 | Zakelijke verkoop | Neem contact op met verkoop | Qualcomm AI-softwarestack | Inferentie | AI200 verwacht in 2026, AI250-sampling verwacht in 2027, AI300-sampling verwacht in 2028 |
| Etched Sohu | Implementaties op contract | Zakelijke contracten | Etched-softwarestack | Transformer-inferentie | Eerste racks worden in de zomer van 2026 geleverd |
| Meta MTIA | Niet verkrijgbaar | Geen externe route | Interne tooling van Meta | Meta's eigen ranking-, aanbevelings- en GenAI-werk | Alleen intern |
| Microsoft Maia 200 | Intern, Azure-geïntegreerd | Microsoft-datacenters | Maia SDK | Inferentie | Intern uitgerold, zonder publieke selfservice-instance |
AMD Instinct is degene die je bijna overal kunt huren
AMD Instinct heeft de breedste leveranciersbasis van de NVIDIA-alternatieven hier: MI300X en MI325X zijn beschikbaar bij meerdere cloud- en neocloudaanbieders in plaats van vastgeklonken aan één hyperscaler. AMD lanceerde de MI400-serie in juli 2026, aangevoerd door de MI455X, maar de oudere generaties doen er nog steeds toe, want die kom je eerder tegen in bestaande huuraanbiedingen. ROCm blijft voor de meeste bestaande PyTorch-workloads de kortste softwareport in dit artikel.
De hardware is niet de beperking. De MI300X draagt 192 GB HBM3 op 5,3 TB/s verdeeld over 304 CDNA3-rekeneenheden in een module van 750 W. De MI325X tilt dat naar 256 GB HBM3E op 6 TB/s en 1000 W, een capaciteit die lager uitviel dan de 288 GB die AMD eerst aankondigde.
CUDA-kernen zijn wat NVIDIA telt, terwijl AMD rekeneenheden telt, en die twee laten zich niet omrekenen, en daarom vergelijken geheugen en bandbreedte nuttiger tussen leveranciers.
De softwaresituatie is veranderd, en de reputatie loopt achter. ROCm-ondersteuning voor PyTorch is upstream opgenomen in de officiële PyTorch-repository in plaats van in een communityfork te leven, en actuele ROCm-releases houden gelijke tred met actuele frameworks. ROCm 7.14.0 ondersteunt PyTorch 2.12, naast AMD's actuele integraties voor het bredere AI-software-ecosysteem.
Mijn lezing is dat de wrijving die mensen nog steeds beschrijven niet de doorvoer is en niet de frameworkondersteuning. Het is archeologie. Wanneer een CUDA-opstelling om drie uur 's nachts stukgaat, is iemand die foutmelding al tegengekomen en heeft de oplossing opgeschreven. Bij ROCm is de zoekopbrengst dunner, dus gaat de tijd op aan zoeken in plaats van repareren. Die kosten duiken nooit op in een benchmark.
AMD's acceleratorwerk reikt ook verder dan het datacenter, en dat telt als je goedkope hardware wilt om de stack op te leren.
AMD's mini-pc-clusterdemo draait op het consumentensilicium van datzelfde bedrijf.
Google TPU en AWS Trainium zijn elk op precies één cloud te huren
Googles TPU7x en AWS' Trainium zijn allebei algemeen beschikbaar en allebei vastgezet bij één aanbieder. TPU draait op Google Cloud. Trainium en Inferentia draaien op AWS. Geen van beide geeft je de multi-provider-portabiliteit van AMD of NVIDIA, en die beperking kan zwaarder wegen dan welke afzonderlijke specificatie ook.
TPU7x is de eerste release in Googles Ironwood-familie van de zevende generatie en is sinds 31 maart 2026 algemeen beschikbaar. Google positioneert hem voor grootschalige training en inferentie. Trillium v6e blijft beschikbaar, terwijl Ironwood Googles huidige algemeen beschikbare TPU-generatie blijft. Google heeft ook TPU 8t en TPU 8i van de achtste generatie aangekondigd, maar beide staan nog als binnenkort vermeld.
Het nuttigste feit over TPU's staat niet op het specificatieblad. Er is een gratis oprit: Colab en Kaggle bieden allebei TPU-runtimes, en de TPU Research Cloud kent onderzoekers rekentijd toe. Die gratis oprit geeft je een manier om het TPU-softwarepad te testen voordat je cloudbudget vastlegt, al moet je niet aannemen dat de gratis diensten specifiek de nieuwste Ironwood-hardware leveren.
AWS bereikt zijn eigen silicium via Trainium-instances en UltraServers, plus Inf2-instances voor Inferentia2. Trainium3-UltraServers zijn sinds december 2025 algemeen beschikbaar en schalen naar 144 chips, tegenover 64 bij de eerdere Trn2-UltraServers. Alles loopt via de Neuron SDK. AWS schetst de portingkosten optimistischer dan de meeste leveranciers.
De AWS Trainium-pagina stelt dat vLLM, HuggingFace Transformers en TorchTitan native op Trainium draaien zonder eigen code en zonder portingwerk. Dat is de bewering van de leverancier over zijn eigen product, geen onafhankelijk geverifieerd resultaat.
Beide zitten in een ruil die je bewust moet maken. Je wint een tweede siliciumleverancier en verliest de mogelijkheid om die workload naar een andere cloud te verplaatsen zonder het werk over te doen, wat een team dat zich toch al aan één aanbieder heeft verbonden bijna niets kost en een team dat rond het vermijden van binding is gebouwd alles.
Wat in het geheugen moet passen beperkt de keuze als eerste: 144 GB per Trainium3-chip is een ander planningsprobleem dan de 192 GB van Ironwood, wie het ook verkoopt.
Groq, Cerebras en SambaNova gaan verder dan gehoste API's
Groq, Cerebras en SambaNova bieden allemaal gehoste inferentie, maar de API is niet langer het hele toegangsverhaal. Groq koppelt GroqCloud aan dedicated GroqMetal-infrastructuur. Cerebras biedt cloudtoegang naast CS-3-systemen die on-premises kunnen draaien. SambaNova biedt SambaCloud naast SambaRack en SambaStack. Het onderscheid draait nu om hoeveel infrastructuurcontrole je nodig hebt en hoe ver je een zakelijk inkooptraject in wilt.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
Groq's eigen aankondiging zegt dat GroqCloud zonder onderbreking blijft draaien.
Op de GTC in maart 2026 onthulde NVIDIA de NVIDIA Groq 3 LPU binnen zijn Vera Rubin-platform.
NVIDIA's Vera Rubin-aankondiging beschrijft een LPX-rack met 256 LPU-processors, beschikbaar in de tweede helft van 2026.
Cerebras kiest de tegenovergestelde fysieke aanpak: één onderdeel op waferschaal met 900.000 cores en 44 GB on-chip SRAM, opgegeven op 125 PFLOPs.
De inferentiepagina van Cerebras biedt 5 $ gratis tegoed en beschrijft de migratie als slechts twee codewijzigingen. Eén onderscheid blijft belangrijk voor de planning: de selfservice-API is het makkelijke inferentiepad, terwijl training, fine-tuning, dedicated capaciteit en on-premises CS-3-implementaties verderop op het zakelijke pad liggen.
SambaNova's huidige hardwareverhaal draait om SambaRack SN50, opgebouwd rond 16 SN50-RDU's van de vijfde generatie per rack. SambaCloud blijft het gehoste pad, terwijl SambaRack en SambaStack dedicated infrastructuur leveren die on-premises of in gehoste omgevingen kan draaien.
Gehoste toegang blijft voor alle drie het makkelijkste startpunt, maar beschrijft niet langer het hele product.
Tenstorrent verkoopt hardware die je in bezit kunt hebben
Tenstorrent is de enige leverancier in dit artikel wiens accelerator je als particulier gewoon kunt kopen, tegen een prijs die geen investeringsbeslissing is.
De hardwarepagina van Tenstorrent noemt de Blackhole p100a voor 999 $ en de p150a en p150b voor 1.399 $, op voorraad en met verzending in ongeveer twee weken. De stack is volledig open source.
De kaarten dragen 120 Tensix-cores en 16 RISC-V-cores, met 28 GB GDDR6 op de p100a en 32 GB op het p150-duo, bij een verbruik tot 300 W. De p150a en p150b voegen QSFP-DD-ethernetpoorten toe die de p100a mist, en dat is wat je koopt als je kaarten aan elkaar wilt knopen. HPCwire meldde dat de rackbrede Galaxy Blackhole op 28 april 2026 algemeen beschikbaar werd vanaf 110.000 $, en de oudere Wormhole-lijn blijft te koop, inclusief een TT-LoudBox-workstation van 12.000 $.
De kanttekening weegt voor de beslissing even zwaar als de prijs, en ze wijst naar die oudere kaart. Het meeste van Tenstorrents documentatie, tutorials en geverifieerde modelondersteuning richt zich nog op Wormhole. De softwareondersteuning van Blackhole zit vroeger in de cyclus. Concreet: dit past bij iemand die echt portingwerk wil doen en broncode wil lezen als de documentatie ophoudt. Het past niet bij iemand die bestaande PyTorch-code ongewijzigd wil laten draaien, wat een volstrekt redelijke wens is.
Qualcomm, Intel en Etched hebben smallere toegangsroutes
Deze drie zitten om onderling losstaande redenen achter smallere toegangsroutes. Qualcomm bouwt een datacenter-acceleratorroadmap over meerdere generaties op, rond zakelijke implementaties. Intel Gaudi 3 blijft beschikbaar via geselecteerde IBM Cloud-implementaties terwijl Crescent Island richting klantsampling schuift. Etched zegt dat de eerste Sohu-racks in de zomer van 2026 uitgaan op basis van zakelijke contracten, niet via een selfservice-clouddienst.
Qualcomms datacenterroadmap omvat nu Dragonfly AI200, AI250 en de net aangekondigde AI300, met een jaarlijkse acceleratorcadans gericht op inferentie. Dit blijft een zakelijk georiënteerde route en niet het soort selfservice-acceleratorhuur dat je vandaag aan een cloudaccount toevoegt.
Intel is het leerzame geval, want Gaudi 3 heeft nooit een brede cloudaanwezigheid bereikt, maar is ook niet verdwenen. IBM Cloud biedt nog steeds Gaudi 3-versnelde virtual-serverprofielen onder selectieve beschikbaarheid, met implementaties in Dallas, Washington DC en Frankfurt. Intels volgende stap is Crescent Island, een op inferentie gerichte GPU die naar verwachting in de tweede helft van 2026 in klantsampling gaat. Gaudi 3 is vandaag een smalle optie, geen afgesloten optie.
Etched bouwt Sohu, een ASIC die gespecialiseerd is in transformer-inferentie. Het bedrijf haalde 800 miljoen dollar op, heeft werkend A0-silicium, meldt meer dan 1 miljard dollar aan getekende klantcontracten, en de eerste racks staan gepland voor de zomer van 2026. De prestatieclaims zijn van het bedrijf zelf en zijn niet onafhankelijk gemeten, dus de doorvoercijfers zijn niet het nuttige deel. Het nuttige deel is de softwarestack. Etched bouwt chip, rack en softwareomgeving als één gespecialiseerd platform, dus ga er niet vanuit dat de servingstack uit het CUDA-tijdperk ongewijzigd overgaat. Dat kan werken voor een contractklant die transformer-inferentie op enorme schaal draait, maar het is een veel grotere verplichting voor een team dat afhangt van portabiliteit tussen accelerators.
Puur intern silicium en de bedrijven die chips voor anderen bouwen
Twee situaties zien er van buiten uit als een AI-chipbedrijf en gedragen zich totaal anders. Meta en Microsoft ontwerpen accelerators die ze zelf draaien en aan niemand verkopen. Broadcom en Marvell ontwerpen en implementeren silicium voor de architecturen van andere bedrijven. Geen van beide groepen heeft een product dat een ontwikkelaar kan huren, om redenen die niets gemeen hebben.
Meta's MTIA is het zuiverste geval van de eerste soort.
Meta's eigen engineeringpost beschrijft het uitrollen van honderdduizenden MTIA-chips voor inferentie-workloads bij zowel organische content als advertenties in zijn apps, waarbij MTIA 300 al in productie is voor ranking- en aanbevelingstraining en MTIA 400, 450 en 500 gepland staan op een ritme van ongeveer zes maanden. Dat is een enorme hoeveelheid silicium waarvan je nooit een uur zult huren.
Microsofts geval is zachter aan de randen. Maia 200, geïntroduceerd in januari 2026, is Microsofts huidige eigen inferentieaccelerator en draait al in zijn datacenters, met de Maia SDK beschikbaar als preview. Microsoft documenteert op dit moment geen publieke selfservice-Maia-instance, dus die hoort nog steeds aan de interne of Azure-geïntegreerde kant van deze vergelijking.
Broadcom en Marvell zijn weer iets anders, en dat is het opklaren waard omdat hun namen voortdurend naast die van NVIDIA opduiken. Googles TPU is een handig voorbeeld. Google bezit het TPU-product en de architectuur, terwijl Broadcom ontwerp- en implementatiewerk voor maatwerksilicium levert, wat interconnects, packaging en het pad van architectuur naar produceerbaar silicium kan omvatten. Broadcom verkoopt geen TPU, en ook geen andere algemene accelerator, rechtstreeks aan ontwikkelaars. De omzet van zijn AI-segment kwam volgens de cijfers over het eerste boekkwartaal van 2026 uit op 8,4 miljard dollar, 106 procent hoger dan een jaar eerder, wat verklaart waarom die naam overal opduikt. Het is nog steeds geen chip die je kunt huren.
En daar begint het woord fabrikanten een gewicht te dragen dat het niet aankan. Broadcom en Marvell fabriceren geen chips, en de meeste hierboven genoemde AI-chipfabrikanten evenmin: bijna allemaal zijn ze fabless, wat betekent dat ze silicium ontwerpen en de fabricage volledig uitbesteden aan iemand anders.
Een toegangsroute afstemmen op je workload
Training op schaal versmalt de praktische keuzes snel: breed beschikbaar AMD Instinct, TPU of Trainium op één cloud, of een zakelijke Cerebras-implementatie. Productie-inferentie opent meer routes, omdat Groq, Cerebras en SambaNova allemaal gehoste diensten leveren en daarnaast een vorm van dedicated infrastructuur. Experimenteren is weer breder, van gratis TPU-toegang tot een Tenstorrent-kaart die je in je eigen machine kunt steken.
Die grenzen zijn vager dan een tabel kan tonen. De vraag is niet alleen wat het silicium kan, maar waar je erbij kunt, hoeveel van je bestaande softwarestack de verhuizing overleeft, en of de resulterende workload later ergens anders heen kan. Cerebras kan trainen en inferentie draaien op zakelijke infrastructuur, terwijl Trainium aan AWS vastzit.
Niets hiervan verdringt NVIDIA. Voor de meeste teams is de echte vraag niet of je CUDA verlaat, maar of een tweede stack het waard is om ernaast te onderhouden.
Welke kaart je moet kiezen is de resterende beslissing als je blijft waar je bent, en dat is een andere oefening dan deze.
Het kanaal beslist meer dan de chip. Een kaart op je bureau en dezelfde klasse silicium achter andermans API zijn niet hetzelfde gereedschap, zelfs als de doorvoer dicht bij elkaar uitkomt, want het ene laat je dingen proberen waar je nog niet aan gedacht hebt en het andere rekent per token af voor wat je al weet te vragen.
Veelgestelde vragen
Kun je echt een Google TPU huren?
Ja. TPU7x, Googles huidige algemeen beschikbare Ironwood-TPU, is er op Google Cloud en alleen daar. Oudere TPU-generaties zijn ook beschikbaar, en Colab, Kaggle en de TPU Research Cloud bieden gratis TPU-toegang voor sommige workloads. JAX blijft het native pad, terwijl PyTorch via PyTorch/XLA draait.
Welk NVIDIA-alternatief draait bestaande PyTorch-code met het minste werk?
AMD Instinct, in de meeste gevallen: ROCm is een officieel ondersteunde PyTorch-backend, dus het codepad bestaat al. Googles TPU draait PyTorch via de PyTorch/XLA-brug, een vertaallaag. AWS stelt dat vLLM, HuggingFace Transformers en TorchTitan zonder portingwerk op Trainium draaien, wat de bewering van de leverancier zelf is. Aan het andere uiterste gebruikt Etcheds Sohu een eigen gespecialiseerde softwarestack, dus reken op aanzienlijk meer portingwerk dan bij ROCm of PyTorch/XLA.
Waarom heten Broadcom en Qualcomm NVIDIA-concurrenten als je hun chips niet kunt huren?
Om verschillende redenen. Broadcom werkt aan maatwerksilicium voor bedrijven die hun eigen accelerators bouwen, in plaats van een standaardaccelerator rechtstreeks aan ontwikkelaars te verkopen. Qualcomm ontwerpt zijn eigen Dragonfly-accelerators, met AI200, AI250 en AI300 inmiddels op de datacenterroadmap, maar de toegang is zakelijk georiënteerd en geen gewone selfservice-cloudhuur. Beide concurreren in AI-infrastructuur zonder ontwikkelaars hetzelfde publieke toegangsmodel te bieden als NVIDIA of AMD.
Kun je een AI-accelerator kopen in plaats van huren?
Ja. Tenstorrent verkoopt Blackhole-ontwikkelaarskaarten rechtstreeks, van 999 $ voor de p100a tot 1.399 $ voor de p150a en p150b, op voorraad en met verzending in ongeveer twee weken, met een volledig open source softwarestack. De kanttekening telt net zo zwaar als de prijs: het meeste van de documentatie en de geverifieerde modelondersteuning mikt nog op de oudere Wormhole-kaart, dus reserveer tijd voor porting in plaats van te verwachten dat bestaande code ongewijzigd draait.
Discussie
Reacties
Log in om mee te praten.