Gå til hovedindhold
50% rabat alle planer, tidsbegrænset. Fra $2.48/mo
16 min left
AI og machine learning

Førende AI-chipvirksomheder og producenter: de NVIDIA-alternativer, der rent faktisk leveres

J Af Jeremy 16 min læsning
Førende AI-chipvirksomheder: et grafikkort, et acceleratormodul, en siliciumwafer og serverprintplader på en mørkerød baggrund

Du kan bestille et Tenstorrent Blackhole-udviklerkort i denne uge. Det koster 999 $, er på lager og sendes på cirka to uger. En Meta MTIA kan du hverken købe eller leje gennem en offentlig kanal; Meta beskriver MTIA som silicium, som virksomheden selv udruller til sine egne workloads.

Begge virksomheder regnes blandt de førende AI-chipvirksomheder. Afstanden mellem de to situationer er det, denne artikel handler om.

Det følgende går leverandør for leverandør: hvad du kan få, gennem hvilken kanal, og hvad softwaren koster dig, når du først har hardwaren.

TL;DR

  • Bredt tilgængeligt til leje: AMD Instinct har stadig det bredeste public cloud-fodaftryk uden for NVIDIA, men produktlinjen er rykket videre. AMD lancerede MI400-serien i juli 2026, mens MI300X-, MI325X- og MI350-seriesystemer fortsat er dem, du har størst chance for at finde til leje.
  • Én cloud: Googles TPU'er bliver på Google Cloud, og TPU7x Ironwood har været alment tilgængelig siden marts 2026. AWS Trainium og Inferentia bliver på AWS.
  • API plus dedikeret infrastruktur: Groq, Cerebras og SambaNova tilbyder alle hostet inferens, men kun API passer ikke længere. De har nu hver især også en dedikeret eller on-premises vej.
  • Hardware, du kan anskaffe: Tenstorrent sælger Blackhole-kort direkte. Qualcomm præsenterer sine Dragonfly-datacenteracceleratorer gennem et enterprise-salgsspor frem for kun som roadmap-udmeldinger.
  • Begrænset eller intern: Intel Gaudi 3 er fortsat tilgængelig gennem udvalgte IBM Cloud-udrulninger, mens Crescent Island ventes at gå i kundesampling i anden halvdel af 2026. Etched siger, at de første racks sendes til kontraktkunder i sommeren 2026. Meta MTIA og Microsoft Maia forbliver interne eller Azure-integrerede frem for offentlige selvbetjeningsacceleratorer.

Hvad denne artikel ikke dækker

Tre ting ligger bevidst uden for rammen, og hver leverandørstatus nedenfor afspejler august 2026.

  • Priser. Spørgsmålet her er, om du kan få fat i hardwaren, ikke hvad en time på den koster.
  • Forudsigelser. Ingen bud på, hvem der vinder.
  • Forbruger- og desktopkort. Emnet er datacenter- og cloudacceleratorer.

De fem måder at få compute på en AI-accelerator

Fem adgangsniveauer for AI-acceleratorer i august 2026, fra mest åbne til mest begrænsede: mange clouds for AMD Instinct, én enkelt cloud for Google TPU7x og AWS Trainium, hostet plus dedikeret infrastruktur for Groq, Cerebras og SambaNova, hardware eller enterprise-salg for Tenstorrent, Qualcomm og Etched, og kun intern brug for Meta MTIA og Microsoft Maia 200

Fem adgangsveje dækker acceleratorerne i denne artikel: leje på tværs af flere clouds, leje gennem én enkelt cloud, hostet API-adgang, dedikeret eller direkte anskaffelig hardware, og begrænset enterprise-adgang til produkter, der ikke er bredt selvbetjente. Nogle virksomheder spænder nu over mere end én af disse veje. En særskilt gruppe forbliver rent intern, uden nogen offentlig måde at leje eller købe siliciumet på.

Adgang er en status, ikke en permanent egenskab ved virksomheden. Den ændrer sig, når nye generationer lanceres, når clouds tilføjer eller dropper hardware, og når leverandører åbner eller lukker indkøbskanaler. Den siger heller ikke noget om kvalitet eller skala. Den beskriver, hvordan du kan få fat i regnekraften, og den kanal afgør, om et navn er noget, du kan handle på.

NVIDIA sidder på et stort flertal af omsætningen for AI-acceleratorer i datacentre, findes på stort set hver eneste cloud, og CUDA er den flade, alt andet måles op imod. De øvrige AI-acceleratorvirksomheder her er interessante, fordi man når dem på så forskellige måder.

Leverandør og produktAdgangsniveauSådan får du detSoftwarestakArbejdsbyrdeStatus
NVIDIA (referencepunkt, ikke et alternativ)Mange cloudsNæsten alle cloududbydereCUDATræning og inferensAlment tilgængelig
AMD Instinct MI300XMange cloudsVultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, CirrascaleROCmTræning og inferensAlment tilgængelig
AMD Instinct MI325XMange cloudsVultr, TensorWave, DigitalOceanROCmTræning og inferensAlment tilgængelig
Google TPU7x (Ironwood)Én cloudGoogle CloudJAX, og PyTorch via PyTorch/XLATræning og inferensAlment tilgængelig siden 31. marts 2026
AWS TrainiumÉn cloudAWS EC2 Trainium-instanser og UltraServers (Trn2, Trainium3)Neuron SDKTræning og inferensAlment tilgængelig
AWS Inferentia2Én cloudAWS EC2 Inf2-instanserNeuron SDKInferensAlment tilgængelig
Groq LPUHostet API og dedikeret infrastrukturGroqCloud og GroqMetalOpenAI-kompatibelt API og Groq-stakkenInferensTilgængelig
Cerebras WSE-3 og CS-3Hostet API, enterprise cloud, on-premisesCerebras Cloud og CS-3-systemerCerebras-softwarestakTræning og inferensTilgængelig
SambaNova SN50Hostet API, dedikeret, on-premisesSambaCloud og SambaRackSambaStackInferensLevering til kunder begynder i anden halvdel af 2026
Intel Gaudi 3Udvalgt cloudIBM Cloud-løsningIntel Gaudi-softwarepakkeTræning, finjustering og inferensUdvalgt tilgængelighed
Tenstorrent BlackholeKøb hardwarenDirekte fra TenstorrentOpen source TT-Metalium-stakInferens og udviklingsarbejdePå lager, sendes på cirka to uger
Qualcomm AI200, AI250 og AI300Enterprise-salgKontakt salgQualcomm AI-softwarestakInferensAI200 ventes i 2026, AI250-sampling ventes i 2027, AI300-sampling ventes i 2028
Etched SohuUdrulninger på kontraktEnterprise-kontrakterEtched-softwarestakTransformer-inferensFørste racks sendes i sommeren 2026
Meta MTIAKan ikke skaffesIngen ekstern vejMetas interne værktøjerMetas egen ranking-, anbefalings- og GenAI-arbejdeKun internt
Microsoft Maia 200Intern, Azure-integreretMicrosofts datacentreMaia SDKInferensUdrullet internt, uden nogen offentlig selvbetjeningsinstans

AMD Instinct er den, du kan leje næsten overalt

AMD Instinct har det bredeste leverandørfodaftryk blandt NVIDIA-alternativerne her: MI300X og MI325X fås hos flere cloud- og neocloududbydere frem for at være bundet til én hyperscaler. AMD lancerede MI400-serien i juli 2026 anført af MI455X, men de ældre generationer betyder stadig noget, for det er dem, du oftere finder i eksisterende lejeudrulninger. ROCm er fortsat den korteste softwareportering i denne artikel for de fleste eksisterende PyTorch-workloads.

Hardwaren er ikke begrænsningen. MI300X bærer 192 GB HBM3 ved 5,3 TB/s fordelt på 304 CDNA3-beregningsenheder i et modul på 750 W. MI325X løfter det til 256 GB HBM3E ved 6 TB/s og 1000 W, en kapacitet der landede lavere end de 288 GB, AMD først meldte ud.

CUDA-kerner er det, NVIDIA tæller, mens AMD tæller beregningsenheder, og de to lader sig ikke omregne, og derfor er hukommelse og båndbredde mere brugbare at sammenligne på tværs af leverandører.

Softwaresituationen har ændret sig, og omdømmet halter bagefter. ROCm-understøttelsen af PyTorch er upstreamet ind i det officielle PyTorch-repository i stedet for at leve i et community-fork, og aktuelle ROCm-udgivelser følger med de aktuelle frameworks. ROCm 7.14.0 understøtter PyTorch 2.12 sammen med AMD's aktuelle integrationer til det bredere AI-softwareøkosystem.

Min læsning er, at den friktion, folk stadig beskriver, hverken er gennemløb eller frameworkunderstøttelse. Det er arkæologi. Når et CUDA-setup går i stykker klokken tre om natten, er der allerede en, der er stødt på den fejltekst og har skrevet løsningen ned. På ROCm er søgeresultaterne tyndere, så tiden går med at lede i stedet for at reparere. Den omkostning dukker aldrig op i en benchmark.

AMD's acceleratorarbejde rækker også ud over datacenteret, hvilket betyder noget, hvis du vil have billig hardware at lære stakken på.

AMD's mini pc-klyngedemo kører på den samme virksomheds forbrugersilicium.

Google TPU og AWS Trainium kan hver især kun lejes på én cloud

Googles TPU7x og AWS' Trainium er begge alment tilgængelige og begge låst til én enkelt udbyder. TPU kører på Google Cloud. Trainium og Inferentia kører på AWS. Ingen af dem giver dig AMD's eller NVIDIA's portabilitet på tværs af udbydere, og den begrænsning kan veje tungere end nogen enkelt specifikation.

TPU7x er den første udgivelse i Googles syvende generation af Ironwood-familien og blev alment tilgængelig den 31. marts 2026. Google positionerer den til storskala træning og inferens. Trillium v6e er fortsat tilgængelig, mens Ironwood forbliver Googles nuværende alment tilgængelige TPU-generation. Google har også annonceret ottende generation TPU 8t og TPU 8i, men begge er stadig anført som på vej.

Det mest nyttige faktum om TPU'er står ikke i databladet. Der findes en gratis indgang: både Colab og Kaggle tilbyder TPU-runtimes, og TPU Research Cloud tildeler tid til forskere. Den gratis indgang giver dig en måde at teste TPU-softwaresporet på, før du binder cloudbudget, selvom man ikke bør antage, at de gratis tjenester leverer netop den nyeste Ironwood-hardware.

AWS når sit eget silicium via Trainium-instanser og UltraServers samt Inf2-instanser til Inferentia2. Trainium3 UltraServers blev alment tilgængelige i december 2025 og skalerer til 144 chips, op fra 64 på de tidligere Trn2 UltraServers. Alt går gennem Neuron SDK. AWS fremstiller porteringsomkostningen mere optimistisk end de fleste leverandører.

AWS Trainium-siden oplyser, at vLLM, HuggingFace Transformers og TorchTitan kører nativt på Trainium uden egen kode og uden porteringsarbejde. Det er leverandørens påstand om sit eget produkt, ikke et uafhængigt verificeret resultat.

Begge indgår i et bytte, det er værd at foretage bevidst. Du vinder en anden siliciumleverandør og mister muligheden for at flytte den workload til en anden cloud uden at lave arbejdet om, hvilket næsten intet koster et team, der allerede har bundet sig til én udbyder, og alt for et team, der er bygget op om at undgå binding.

Det, der skal kunne være i hukommelsen begrænser valget først: 144 GB pr. Trainium3-chip er et andet planlægningsproblem end Ironwoods 192 GB, uanset hvem der sælger den.

Groq, Cerebras og SambaNova rækker ud over hostede API'er

Groq, Cerebras og SambaNova tilbyder alle hostet inferens, men API'et er ikke længere hele adgangshistorien. Groq parrer GroqCloud med dedikeret GroqMetal-infrastruktur. Cerebras tilbyder cloudadgang ved siden af CS-3-systemer, der kan køre on-premises. SambaNova tilbyder SambaCloud ved siden af SambaRack og SambaStack. Forskellen handler nu om, hvor meget infrastrukturkontrol du har brug for, og hvor langt ind i en enterprise-indkøbsproces du er villig til at gå.

Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.

Groqs egen meddelelse siger, at GroqCloud fortsætter driften uden afbrydelse.

På GTC i marts 2026 præsenterede NVIDIA NVIDIA Groq 3 LPU inde i sin Vera Rubin-platform.

NVIDIA's Vera Rubin-meddelelse beskriver et LPX-rack med 256 LPU-processorer, tilgængeligt i anden halvdel af 2026.

Cerebras vælger den modsatte fysiske tilgang: én enkelt del i waferskala med 900.000 kerner og 44 GB on-chip SRAM, angivet til 125 PFLOPs.

Cerebras' inferensside tilbyder 5 $ i gratis kredit og beskriver migreringen som blot to kodeændringer. Én skelnen betyder stadig noget for planlægningen: selvbetjenings-API'et er den lette inferensvej, mens træning, finjustering, dedikeret kapacitet og on-premises CS-3-udrulninger ligger længere oppe ad enterprise-vejen.

SambaNovas aktuelle hardwarehistorie kredser om SambaRack SN50, bygget op om 16 femtegenerations SN50 RDU'er pr. rack. SambaCloud er fortsat den hostede vej, mens SambaRack og SambaStack leverer dedikeret infrastruktur, der kan køre on-premises eller i hostede miljøer.

Hostet adgang er stadig det letteste indgangspunkt for alle tre, men det beskriver ikke længere hele produktet.

Tenstorrent sælger hardware, du kan eje

Tenstorrent er den eneste leverandør i denne artikel, hvis accelerator du kan købe direkte som privatperson, til en pris der ikke er en investeringsbeslutning.

Tenstorrents hardwareside angiver Blackhole p100a til 999 $ og p150a og p150b til 1.399 $, på lager og med forsendelse på cirka to uger. Stakken er fuldt open source.

Kortene bærer 120 Tensix-kerner og 16 RISC-V-kerner, med 28 GB GDDR6 på p100a og 32 GB på p150-parret, med et forbrug op til 300 W. p150a og p150b tilføjer QSFP-DD-ethernetporte, som p100a mangler, og det er dem, du køber, hvis du har tænkt dig at koble kort sammen. HPCwire rapporterede, at det rackskalerede Galaxy Blackhole blev alment tilgængeligt den 28. april 2026 fra 110.000 $, og den ældre Wormhole-linje er stadig til salg, herunder en TT-LoudBox-arbejdsstation til 12.000 $.

Forbeholdet vejer lige så tungt i beslutningen som prisen, og det peger på netop det ældre kort. Størstedelen af Tenstorrents dokumentation, vejledninger og verificerede modelunderstøttelse sigter stadig mod Wormhole. Blackholes softwareunderstøttelse er tidligere i sin cyklus. Konkret: det passer til en, der er villig til at lave rigtigt porteringsarbejde og læse kildekode, når dokumentationen slipper op. Det passer ikke til en, der vil have eksisterende PyTorch-kode til at køre uændret, hvilket er et fuldstændig rimeligt ønske.

Qualcomm, Intel og Etched har smallere adgangsveje

De tre ligger bag smallere adgangsveje, af årsager der intet har med hinanden at gøre. Qualcomm bygger en flergenerations roadmap for datacenteracceleratorer op omkring enterprise-udrulninger. Intel Gaudi 3 er fortsat tilgængelig gennem udvalgte IBM Cloud-udrulninger, mens Crescent Island bevæger sig mod kundesampling. Etched siger, at de første Sohu-racks sendes i sommeren 2026 mod enterprise-kontrakter frem for gennem en selvbetjent cloudtjeneste.

Qualcomms datacenter-roadmap spænder nu over Dragonfly AI200, AI250 og den netop annoncerede AI300, med en årlig acceleratorkadence rettet mod inferens. Det forbliver en enterprise-orienteret vej og ikke den slags selvbetjente acceleratorleje, du kan tilføje til en cloudkonto i dag.

Intel er den lærerige post, fordi Gaudi 3 aldrig opnåede et bredt cloudfodaftryk, men den er ikke forsvundet. IBM Cloud tilbyder stadig Gaudi 3-accelererede virtuelle serverprofiler under udvalgt tilgængelighed, herunder udrulninger i Dallas, Washington DC og Frankfurt. Intels næste skridt er Crescent Island, en inferensrettet GPU, der ventes at gå i kundesampling i anden halvdel af 2026. Gaudi 3 er i dag en smal mulighed, ikke en afsluttet en.

Etched bygger Sohu, en ASIC specialiseret til transformer-inferens. Virksomheden har rejst 800 millioner dollars, har fungerende A0-silicium, oplyser over 1 milliard dollars i underskrevne kundekontrakter, og de første racks skal efter planen sendes i sommeren 2026. Dens ydelsespåstande er dens egne og er ikke uafhængigt målt, så gennemløbstallene er ikke den nyttige del. Den nyttige del er softwarestakken. Etched bygger chip, rack og softwaremiljø som én specialiseret platform, så gå ikke ud fra, at serveringsstakken fra CUDA-æraen flytter med uændret. Det kan fungere for en kontraktkunde, der kører transformer-inferens i enorm skala, men det er en langt større binding for et team, der afhænger af portabilitet mellem acceleratorer.

Rent internt silicium og de firmaer, der bygger chips for andre

To situationer ligner udefra en AI-chipvirksomhed og opfører sig slet ikke ens. Meta og Microsoft designer acceleratorer, de selv driver og ikke sælger til nogen. Broadcom og Marvell designer og implementerer silicium til andre virksomheders arkitekturer. Ingen af grupperne har et produkt, en udvikler kan leje, af årsager der intet har til fælles.

Metas MTIA er det reneste eksempel på den første slags.

Metas eget engineering-indlæg beskriver udrulning af hundredtusindvis af MTIA-chips til inferens-workloads på tværs af både organisk indhold og annoncer i selskabets apps, hvor MTIA 300 allerede er i produktion til ranking- og anbefalingstræning, og MTIA 400, 450 og 500 er planlagt i en kadence på cirka seks måneder. Det er en enorm mængde silicium, som du aldrig kommer til at leje en time af.

Microsofts tilfælde er blødere i kanten. Maia 200, præsenteret i januar 2026, er Microsofts nuværende interne inferensaccelerator og er allerede udrullet i selskabets datacentre, med Maia SDK tilgængeligt som preview. Microsoft dokumenterer i øjeblikket ikke nogen offentlig selvbetjenings-Maia-instans, så den hører stadig til på den interne eller Azure-integrerede side af denne sammenligning.

Broadcom og Marvell er igen noget helt andet, og det er værd at få på plads, fordi deres navne konstant dukker op ved siden af NVIDIA's. Googles TPU er et nyttigt eksempel. Google ejer TPU-produktet og arkitekturen, mens Broadcom bidrager med design- og implementeringsarbejde på kundespecifikt silicium, hvilket kan omfatte interconnects, packaging og vejen fra arkitektur til produktionsklart silicium. Broadcom sælger hverken en TPU eller en anden generel accelerator direkte til udviklere. Omsætningen i AI-segmentet nåede ifølge regnskabet for første finansielle kvartal 2026 8,4 milliarder dollars, en stigning på 106 procent år for år, hvilket forklarer, hvorfor navnet er alle vegne. Det er stadig ikke en chip, du kan leje.

Og det er her, ordet producenter begynder at bære en vægt, det ikke kan holde. Broadcom og Marvell fremstiller ikke chips, og det gør de fleste af de ovennævnte AI-chipproducenter heller ikke: næsten alle er fabless, altså designer de silicium og lægger fremstillingen fuldstændigt ud til nogen andre.

At matche en adgangsvej med din workload

Træning i stor skala indsnævrer hurtigt de praktiske valg: bredt tilgængeligt AMD Instinct, TPU eller Trainium på én cloud, eller en enterprise-udrulning af Cerebras. Produktionsinferens åbner flere veje, fordi Groq, Cerebras og SambaNova alle leverer hostede tjenester og samtidig en form for dedikeret infrastruktur. Eksperimenter er igen bredere, fra gratis TPU-adgang til et Tenstorrent-kort, du kan sætte i din egen maskine.

De grænser er blødere, end en tabel kan vise. Spørgsmålet er ikke kun, hvad siliciumet kan, men hvor du kan nå det, hvor meget af din eksisterende softwarestak der overlever flytningen, og om den resulterende workload senere kan flyttes et andet sted hen. Cerebras kan både træne og køre inferens på enterprise-infrastruktur, mens Trainium forbliver bundet til AWS.

Intet af det skubber NVIDIA af pinden. For de fleste teams er det levende spørgsmål ikke, om man skal forlade CUDA, men om en anden stak er værd at vedligeholde ved siden af.

Hvilket kort du skal dimensionere efter er den beslutning, der er tilbage, hvis du bliver, hvor du er, og det er en anden øvelse end denne.

Kanalen afgør mere end chippen. Et kort på dit skrivebord og samme klasse silicium bag en andens API er ikke det samme værktøj, selv når gennemløbet lander tæt på, for det ene lader dig prøve ting, du endnu ikke har tænkt på, og det andet fakturerer dig pr. token for det, du allerede ved, hvordan du skal spørge om.

Ofte stillede spørgsmål

Kan man faktisk leje en Google TPU?

Ja. TPU7x, Googles nuværende alment tilgængelige Ironwood-TPU, findes på Google Cloud og kun der. Ældre TPU-generationer er også tilgængelige, og Colab, Kaggle og TPU Research Cloud giver gratis TPU-adgang til visse workloads. JAX er fortsat den native vej, mens PyTorch kører gennem PyTorch/XLA.

Hvilket NVIDIA-alternativ kører eksisterende PyTorch-kode med mindst arbejde?

AMD Instinct i de fleste tilfælde: ROCm er en officielt understøttet PyTorch-backend, så kodestien findes allerede. Googles TPU kører PyTorch gennem PyTorch/XLA-broen, et oversættelseslag. AWS oplyser, at vLLM, HuggingFace Transformers og TorchTitan kører på Trainium uden porteringsarbejde, hvilket er leverandørens egen påstand. I den anden ende bruger Etcheds Sohu sin egen specialiserede softwarestak, så forvent betydeligt mere porteringsarbejde end med ROCm eller PyTorch/XLA.

Hvorfor kaldes Broadcom og Qualcomm NVIDIA-konkurrenter, når man ikke kan leje deres chips?

Af forskellige grunde. Broadcom arbejder med kundespecifikt silicium for virksomheder, der bygger deres egne acceleratorer, frem for at sælge en standardaccelerator direkte til udviklere. Qualcomm designer sine egne Dragonfly-acceleratorer, med AI200, AI250 og AI300 nu på datacenter-roadmappet, men adgangen er enterprise-orienteret snarere end en almindelig selvbetjent cloudleje. Begge konkurrerer i AI-infrastruktur uden at give udviklere samme offentlige adgangsmodel som NVIDIA eller AMD.

Kan man købe en AI-accelerator i stedet for at leje en?

Ja. Tenstorrent sælger Blackhole-udviklerkort direkte, fra 999 $ for p100a til 1.399 $ for p150a og p150b, på lager og med forsendelse på cirka to uger, med en fuldt open source softwarestak. Forbeholdet vejer lige så tungt som prisen: det meste dokumentation og verificerede modelunderstøttelse sigter stadig mod det ældre Wormhole-kort, så afsæt tid til portering frem for at forvente, at eksisterende kode kører uændret.

Del

Diskussion

Kommentarer

Log ind for at deltage i diskussionen.

Mere fra bloggen

Læs videre.

Klar til at udrulle? Fra 2,48 $/md.

Uafhængig cloud siden 2008. AMD EPYC, NVMe, 40 Gbps. 14 dages pengene-tilbage-garanti.