Vývojářskou kartu Tenstorrent Blackhole si můžete objednat tento týden. Stojí 999 $, je skladem a odesílá se zhruba do dvou týdnů. Meta MTIA si přes veřejný kanál koupit ani pronajmout nemůžete; Meta popisuje MTIA jako křemík, který nasazuje pro vlastní úlohy.
Obě firmy se řadí mezi přední výrobce AI čipů. Právě o rozdílu mezi těmito dvěma situacemi je tento článek.
Následuje průchod dodavatel po dodavateli: co můžete získat, jakým kanálem a co vás bude stát software, jakmile hardware máte.
Stručně
- Široce dostupné k pronájmu: AMD Instinct má stále nejširší zastoupení ve veřejných cloudech mimo NVIDIA, produktová řada se ale posunula. AMD uvedlo řadu MI400 v červenci 2026, zatímco systémy MI300X, MI325X a řady MI350 zůstávají těmi, které k pronájmu najdete nejspíš.
- Jediný cloud: TPU od Googlu zůstávají na Google Cloud, TPU7x Ironwood je obecně dostupné od března 2026. AWS Trainium a Inferentia zůstávají na AWS.
- API plus vyhrazená infrastruktura: Groq, Cerebras i SambaNova nabízejí hostovanou inferenci, ale říkat pouze API už neplatí. Každý z nich má nyní i vyhrazenou nebo on-premises cestu.
- Hardware, který si můžete pořídit: Tenstorrent prodává karty Blackhole přímo. Qualcomm nabízí své datacentrové akcelerátory Dragonfly přes firemní obchodní kanál, ne jen jako oznámení plánu.
- Omezené nebo interní: Intel Gaudi 3 zůstává dostupný přes vybraná nasazení IBM Cloud, zatímco Crescent Island má vstoupit do zákaznického vzorkování ve druhé polovině roku 2026. Etched uvádí, že první racky poputují smluvním zákazníkům v létě 2026. Meta MTIA a Microsoft Maia zůstávají interní nebo integrované do Azure, nikoli veřejné samoobslužné akcelerátory.
Co tento článek nepokrývá
Tři věci zůstávají záměrně mimo rámec a každý stav dodavatele níže odpovídá srpnu 2026.
- Ceny. Otázka tady zní, jestli hardware seženete, ne kolik stojí hodina na něm.
- Prognózy. Žádné soudy o tom, kdo vyhraje.
- Spotřebitelské a desktopové karty. Tématem jsou datacentrové a cloudové akcelerátory.
Pět způsobů, jak získat výpočetní výkon na AI akcelerátoru
Akcelerátory v tomto článku pokrývá pět přístupových cest: pronájem napříč více cloudy, pronájem přes jediný cloud, přístup přes hostované API, vyhrazený nebo přímo pořiditelný hardware a omezený firemní přístup u produktů, které nejsou široce samoobslužné. Některé firmy dnes pokrývají více než jednu z těchto cest. Samostatná skupina zůstává čistě interní, bez jakékoli veřejné možnosti křemík pronajmout či koupit.
Přístup je stav, ne trvalá vlastnost firmy. Mění se, jak vycházejí nové generace, jak cloudy hardware přidávají nebo ruší a jak dodavatelé otevírají či zavírají nákupní kanály. Neříká také nic o kvalitě ani měřítku. Popisuje, jak se k výpočetnímu výkonu dostanete, a právě tenhle kanál rozhoduje, jestli je dané jméno něco, s čím můžete něco udělat.
NVIDIA drží velkou většinu tržeb z datacentrových AI akcelerátorů, je prakticky na každém cloudu a CUDA je plocha, podle které se poměřuje všechno ostatní. Ostatní firmy s AI akcelerátory jsou tu zajímavé právě tím, jak odlišně se k nim dostanete.
| Dodavatel a produkt | Úroveň přístupu | Jak ho získat | Softwarový stack | Pracovní zatížení | Stav |
|---|---|---|---|---|---|
| NVIDIA (základní srovnání, ne alternativa) | Mnoho cloudů | Téměř každý cloudový poskytovatel | CUDA | Trénink a inference | Obecně dostupné |
| AMD Instinct MI300X | Mnoho cloudů | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Trénink a inference | Obecně dostupné |
| AMD Instinct MI325X | Mnoho cloudů | Vultr, TensorWave, DigitalOcean | ROCm | Trénink a inference | Obecně dostupné |
| Google TPU7x (Ironwood) | Jediný cloud | Google Cloud | JAX a PyTorch přes PyTorch/XLA | Trénink a inference | Obecně dostupné od 31. března 2026 |
| AWS Trainium | Jediný cloud | Instance AWS EC2 Trainium a UltraServers (Trn2, Trainium3) | Neuron SDK | Trénink a inference | Obecně dostupné |
| AWS Inferentia2 | Jediný cloud | Instance AWS EC2 Inf2 | Neuron SDK | Inference | Obecně dostupné |
| Groq LPU | Hostované API a vyhrazená infrastruktura | GroqCloud a GroqMetal | API kompatibilní s OpenAI a stack Groq | Inference | Dostupné |
| Cerebras WSE-3 a CS-3 | Hostované API, firemní cloud, on-premises | Cerebras Cloud a systémy CS-3 | Softwarový stack Cerebras | Trénink a inference | Dostupné |
| SambaNova SN50 | Hostované API, vyhrazené, on-premises | SambaCloud a SambaRack | SambaStack | Inference | Dodávky zákazníkům začínají ve druhé polovině roku 2026 |
| Intel Gaudi 3 | Vybraný cloud | IBM Cloud | Softwarová sada Intel Gaudi | Trénink, doladění a inference | Vybraná dostupnost |
| Tenstorrent Blackhole | Koupě hardwaru | Přímo od Tenstorrentu | Open source stack TT-Metalium | Inference a vývojářská práce | Skladem, odesílá se zhruba do dvou týdnů |
| Qualcomm AI200, AI250 a AI300 | Firemní prodej | Kontaktujte prodejní tým | AI softwarový stack Qualcommu | Inference | AI200 se čeká v roce 2026, vzorkování AI250 v roce 2027, vzorkování AI300 v roce 2028 |
| Etched Sohu | Nasazení na základě smlouvy | Firemní smlouvy | Softwarový stack Etched | Inference transformerů | První racky se odesílají v létě 2026 |
| Meta MTIA | Nelze získat | Žádná externí cesta | Interní nástroje Meta | Vlastní řazení, doporučování a GenAI práce Meta | Pouze interní |
| Microsoft Maia 200 | Interní, integrované do Azure | Datová centra Microsoftu | Maia SDK | Inference | Nasazeno interně, bez veřejné samoobslužné instance |
AMD Instinct je ten, který si pronajmete skoro všude
Z alternativ k NVIDIA zmíněných v tomto článku má AMD Instinct nejširší dodavatelskou stopu: MI300X a MI325X jsou k dispozici u více cloudových i neocloudových poskytovatelů, místo aby byly vázané na jediného hyperscalera. AMD uvedlo řadu MI400 v červenci 2026 v čele s MI455X, starší generace ale pořád hrají roli, protože právě na ně spíš narazíte ve stávajících pronájmech. ROCm zůstává pro většinu existujících PyTorch úloh nejkratším softwarovým portem v tomto článku.
Omezením není hardware. MI300X nese 192 GB HBM3 rychlostí 5,3 TB/s napříč 304 výpočetními jednotkami CDNA3 v modulu s 750 W. MI325X to zvedá na 256 GB HBM3E rychlostí 6 TB/s a 1000 W, tedy kapacitu nižší, než bylo původně ohlášených 288 GB od AMD.
CUDA jádra jsou to, co počítá NVIDIA, zatímco AMD počítá výpočetní jednotky, a jedno se na druhé nepřevádí, proto se paměť a propustnost porovnávají napříč dodavateli užitečněji.
Softwarová situace se změnila a pověst za ní zaostává. Podpora PyTorche v ROCm je upstreamovaná do oficiálního repozitáře PyTorch, místo aby žila v komunitním forku, a aktuální vydání ROCm drží krok s aktuálními frameworky. ROCm 7.14.0 podporuje PyTorch 2.12, vedle aktuálních integrací AMD pro širší ekosystém AI softwaru.
Můj výklad je, že tření, které lidé pořád popisují, není propustnost ani podpora frameworků. Je to archeologie. Když se setup na CUDA rozbije ve tři ráno, někdo na ten chybový řetězec už narazil a zapsal řešení. U ROCm je výsledků hledání méně, takže čas jde do hledání místo do opravy. Tenhle náklad se v benchmarku nikdy neobjeví.
Práce AMD na akcelerátorech sahá i za hranice datového centra, což hraje roli, pokud chcete levný hardware, na kterém se stack naučíte.
Demo clusteru z mini PC od AMD běží na spotřebitelském křemíku téže firmy.
Google TPU a AWS Trainium si pronajmete přesně na jednom cloudu každý
TPU7x od Googlu i Trainium od AWS jsou obecně dostupné a oba zamčené u jediného poskytovatele. TPU běží na Google Cloud. Trainium a Inferentia běží na AWS. Ani jeden vám nedá přenositelnost napříč poskytovateli jako AMD nebo NVIDIA a tohle omezení může vážit víc než kterýkoli jednotlivý parametr.
TPU7x je první vydání v Googlově rodině Ironwood sedmé generace a obecně dostupné se stalo 31. března 2026. Google jej pozicuje pro trénink a inferenci ve velkém měřítku. Trillium v6e zůstává dostupné, zatímco Ironwood zůstává aktuální obecně dostupnou generací TPU u Googlu. Google také ohlásil TPU 8t a TPU 8i osmé generace, oba jsou ale stále vedené jako již brzy.
Nejužitečnější fakt o TPU není v datovém listu. Existuje bezplatný vstup: Colab i Kaggle nabízejí TPU běhová prostředí a TPU Research Cloud přiděluje čas výzkumníkům. Tenhle bezplatný vstup vám dá způsob, jak vyzkoušet softwarovou cestu TPU dřív, než upíšete cloudový rozpočet, i když se nedá předpokládat, že bezplatné služby poskytnou zrovna nejnovější hardware Ironwood.
AWS se ke svému vlastnímu křemíku dostává přes instance Trainium a UltraServers, plus instance Inf2 pro Inferentia2. UltraServers s Trainium3 se staly obecně dostupnými v prosinci 2025 a škálují na 144 čipů, oproti 64 u předchozích UltraServers Trn2. Všechno jde přes Neuron SDK. AWS podává náklady na portování optimističtěji než většina dodavatelů.
Stránka AWS Trainium uvádí, že vLLM, HuggingFace Transformers a TorchTitan běží na Trainiu nativně bez vlastního kódu a bez úsilí s portováním. To je tvrzení dodavatele o vlastním produktu, ne nezávisle ověřený výsledek.
Obojí spadá do výměny, kterou má smysl udělat vědomě. Získáte druhého dodavatele křemíku a ztratíte možnost přesunout tu úlohu na jiný cloud bez opakování práce, což tým už tak upsaný jednomu poskytovateli nestojí skoro nic a tým postavený na vyhýbání se závazkům stojí všechno.
Co se musí vejít do paměti omezuje volbu jako první: 144 GB na čip Trainium3 je jiný plánovací problém než 192 GB u Ironwoodu, ať to prodává kdokoli.
Groq, Cerebras a SambaNova jdou dál než jen hostovaná API
Groq, Cerebras i SambaNova nabízejí hostovanou inferenci, ale API už není celý příběh přístupu. Groq páruje GroqCloud s vyhrazenou infrastrukturou GroqMetal. Cerebras nabízí cloudový přístup vedle systémů CS-3, které mohou běžet on-premises. SambaNova nabízí SambaCloud vedle SambaRack a SambaStack. Rozdíl je teď v tom, kolik kontroly nad infrastrukturou potřebujete a jak hluboko jste ochotni jít do firemního nákupního procesu.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
Vlastní oznámení Groqu říká, že GroqCloud bude fungovat dál bez přerušení.
Na GTC v březnu 2026 představila NVIDIA jednotku NVIDIA Groq 3 LPU uvnitř své platformy Vera Rubin.
Oznámení Vera Rubin od NVIDIA popisuje LPX rack s 256 procesory LPU, dostupný ve druhé polovině roku 2026.
Cerebras volí opačný fyzický přístup: jediný díl o velikosti waferu s 900 000 jádry a 44 GB SRAM přímo na čipu, s udávaným výkonem 125 PFLOPs.
Stránka o inferenci u Cerebrasu nabízí kredit 5 $ zdarma a popisuje migraci jako pouhé dvě změny v kódu. Jeden rozdíl je pro plánování pořád důležitý: samoobslužné API je snadná cesta k inferenci, zatímco trénink, doladění, vyhrazená kapacita a on-premises nasazení CS-3 leží dál na firemní cestě.
Aktuální hardwarový příběh SambaNovy se točí kolem SambaRack SN50, postaveného kolem 16 RDU SN50 páté generace na rack. SambaCloud zůstává hostovanou cestou, zatímco SambaRack a SambaStack poskytují vyhrazenou infrastrukturu, která může běžet on-premises nebo v hostovaných prostředích.
Hostovaný přístup je pro všechny tři pořád nejsnazší vstupní bod, ale už nepopisuje celý produkt.
Tenstorrent prodává hardware, který můžete vlastnit
Tenstorrent je jediný dodavatel v tomto článku, jehož akcelerátor si můžete jako jednotlivec rovnou koupit, a to za cenu, která není investičním rozhodnutím.
Stránka s hardwarem od Tenstorrentu uvádí Blackhole p100a za 999 $ a p150a a p150b za 1 399 $, skladem a s odesláním zhruba do dvou týdnů. Stack je plně open source.
Karty nesou 120 jader Tensix a 16 jader RISC-V, s 28 GB GDDR6 na p100a a 32 GB na dvojici p150, s odběrem až 300 W. p150a a p150b přidávají ethernetové porty QSFP-DD, které p100a nemá, a právě ty kupujete, pokud hodláte karty propojovat. HPCwire uvedl, že Galaxy Blackhole v měřítku racku se stal obecně dostupným 28. dubna 2026 od 110 000 $, a starší řada Wormhole zůstává v prodeji, včetně pracovní stanice TT-LoudBox za 12 000 $.
Tahle výhrada váží při rozhodování stejně jako cena a míří přesně na tu starší kartu. Většina dokumentace, tutoriálů a ověřené podpory modelů od Tenstorrentu pořád cílí na Wormhole. Softwarová podpora Blackhole je dřív ve svém cyklu. Konkrétně: tohle sedí někomu, kdo je ochotný odvést skutečnou portovací práci a číst zdrojáky, když dokumentace dojde. Nesedí to někomu, kdo chce, aby existující PyTorch kód běžel beze změny, což je naprosto rozumné přání.
Qualcomm, Intel a Etched mají užší přístupové cesty
Tihle tři stojí za užšími přístupovými cestami, každý z jiného důvodu. Qualcomm staví víceřadovou roadmapu datacentrových akcelerátorů kolem firemních nasazení. Intel Gaudi 3 zůstává dostupný přes vybraná nasazení IBM Cloud, zatímco Crescent Island míří k zákaznickému vzorkování. Etched uvádí, že první racky Sohu odejdou v létě 2026 proti firemním smlouvám, ne přes samoobslužnou cloudovou službu.
Datacentrová roadmapa Qualcommu teď zahrnuje Dragonfly AI200, AI250 a nově ohlášený AI300, s roční kadencí akcelerátorů zaměřených na inferenci. Zůstává to cesta orientovaná na firmy, ne ten typ samoobslužného pronájmu akcelerátoru, který si dnes přidáte ke cloudovému účtu.
Intel je poučná položka, protože Gaudi 3 nikdy nezískal široké cloudové zastoupení, ale ani nezmizel. IBM Cloud stále nabízí profily virtuálních serverů akcelerované Gaudi 3 ve vybrané dostupnosti, včetně nasazení v Dallasu, Washingtonu DC a Frankfurtu. Dalším krokem Intelu je Crescent Island, GPU zaměřené na inferenci, u něhož se zákaznické vzorkování čeká ve druhé polovině roku 2026. Gaudi 3 je dnes úzká možnost, ne uzavřená.
Etched staví Sohu, ASIC specializovaný na inferenci transformerů. Firma získala 800 milionů dolarů, má funkční křemík A0, uvádí přes 1 miliardu dolarů v podepsaných zákaznických smlouvách a první racky mají odejít v létě 2026. Její výkonnostní tvrzení jsou její vlastní a nebyla nezávisle změřena, takže čísla propustnosti nejsou ta užitečná část. Užitečná část je softwarový stack. Etched staví čip, rack i softwarové prostředí jako jednu specializovanou platformu, takže nepředpokládejte, že se servisní stack z éry CUDA přenese beze změny. Pro smluvního zákazníka, který jede inferenci transformerů v obrovském měřítku, to může fungovat, ale pro tým závislý na přenositelnosti mezi akcelerátory je to mnohem větší závazek.
Čistě interní křemík a firmy, které staví čipy pro jiné
Dvě situace vypadají zvenčí jako firma na AI čipy a chovají se úplně jinak. Meta a Microsoft navrhují akcelerátory, které samy provozují a nikomu neprodávají. Broadcom a Marvell navrhují a realizují křemík pro architektury jiných firem. Ani jedna skupina nemá produkt, který by si vývojář mohl pronajmout, a to z důvodů, které spolu nemají nic společného.
MTIA od Meta je nejčistší případ prvního druhu.
Vlastní inženýrský příspěvek Meta popisuje nasazení stovek tisíc čipů MTIA pro inferenční úlohy napříč organickým obsahem i reklamou v jejích aplikacích, přičemž MTIA 300 už je v produkci pro trénink řazení a doporučování a MTIA 400, 450 a 500 jsou plánované v kadenci zhruba šesti měsíců. To je obrovské množství křemíku, ze kterého si nikdy nepronajmete ani hodinu.
Případ Microsoftu je na okrajích měkčí. Maia 200, představená v lednu 2026, je aktuální vlastní inferenční akcelerátor Microsoftu a už je nasazená v jeho datových centrech, přičemž Maia SDK je dostupné v náhledu. Microsoft aktuálně nedokumentuje veřejnou samoobslužnou instanci Maia, takže v tomhle srovnání pořád patří na interní nebo do Azure integrovanou stranu.
Broadcom a Marvell jsou zase něco jiného a stojí za to si to vyjasnit, protože jejich jména se objevují neustále vedle NVIDIA. Užitečným příkladem je TPU od Googlu. Google vlastní produkt TPU i architekturu, zatímco Broadcom přispívá návrhem a realizací zakázkového křemíku, což může zahrnovat propojení, pouzdření a cestu od architektury k vyrobitelnému křemíku. Broadcom neprodává TPU ani jiný obecný akcelerátor přímo vývojářům. Tržby jeho AI segmentu podle výsledků za první fiskální čtvrtletí 2026 dosáhly 8,4 miliardy dolarů, meziročně o 106 procent výš, což vysvětluje, proč je to jméno všude. Pořád to ale není čip, který si pronajmete.
A právě tady začíná slovo výrobci nést váhu, kterou neunese. Broadcom a Marvell čipy nevyrábějí a většina výše uvedených výrobců AI čipů také ne: skoro všichni jsou fabless, tedy navrhují křemík a výrobu zadávají úplně někomu jinému.
Sladit přístupovou cestu s vaší úlohou
Trénink ve velkém rychle zužuje praktické možnosti: široce dostupné AMD Instinct, TPU nebo Trainium na jediném cloudu, případně firemní nasazení Cerebrasu. Produkční inference otevírá víc cest, protože Groq, Cerebras i SambaNova poskytují hostované služby a zároveň nějakou podobu vyhrazené infrastruktury. Experimentování je zase širší, od bezplatného přístupu k TPU po kartu Tenstorrent, kterou dáte do vlastního počítače.
Ty hranice jsou měkčí, než dokáže ukázat tabulka. Otázkou není jen co křemík umí, ale kde se k němu dostanete, kolik z vašeho stávajícího softwarového stacku přesun přežije a jestli se výsledná úloha může později přesunout jinam. Cerebras umí trénovat i provádět inferenci napříč firemní infrastrukturou, zatímco Trainium zůstává svázané s AWS.
Nic z toho NVIDIA nevytlačí. Pro většinu týmů zní živá otázka ne jestli opustit CUDA, ale jestli se vedle ní vyplatí udržovat druhý stack.
Na kterou kartu dimenzovat je rozhodnutí, které zbývá, pokud zůstanete tam, kde jste, a to je jiné cvičení než tohle.
Kanál rozhoduje víc než čip. Karta na vašem stole a stejná třída křemíku za cizím API nejsou tentýž nástroj, ani když propustnost vyjde podobně, protože jedno vám dovolí zkoušet věci, které vás ještě nenapadly, a druhé vám účtuje po tokenech to, na co se už umíte zeptat.
Časté dotazy
Dá se Google TPU opravdu pronajmout?
Ano. TPU7x, aktuálně obecně dostupné Ironwood TPU od Googlu, je k dispozici na Google Cloud a jedině tam. Dostupné jsou i starší generace TPU a Colab, Kaggle a TPU Research Cloud poskytují u některých úloh bezplatný přístup k TPU. JAX zůstává nativní cestou, zatímco PyTorch běží přes PyTorch/XLA.
Která alternativa k NVIDIA spustí stávající PyTorch kód s nejmenší prací?
Ve většině případů AMD Instinct: ROCm je oficiálně podporovaný backend PyTorche, takže cesta v kódu už existuje. TPU od Googlu pouští PyTorch přes most PyTorch/XLA, tedy překladovou vrstvu. AWS uvádí, že vLLM, HuggingFace Transformers a TorchTitan běží na Trainiu bez úsilí s portováním, což je tvrzení samotného dodavatele. Na opačném konci používá Sohu od Etched vlastní specializovaný softwarový stack, takže počítejte s výrazně větší prací s portováním než u ROCm nebo PyTorch/XLA.
Proč se Broadcom a Qualcomm označují za konkurenty NVIDIA, když si jejich čipy nepronajmete?
Z různých důvodů. Broadcom pracuje na zakázkovém křemíku pro firmy, které si staví vlastní akcelerátory, místo aby prodával standardní akcelerátor přímo vývojářům. Qualcomm navrhuje vlastní akcelerátory Dragonfly a AI200, AI250 i AI300 už má na datacentrové roadmapě, přístup je ale orientovaný na firmy, ne běžný samoobslužný cloudový pronájem. Obě soutěží v AI infrastruktuře, aniž by vývojářům daly stejný veřejný model přístupu jako NVIDIA nebo AMD.
Dá se AI akcelerátor rovnou koupit místo pronájmu?
Ano. Tenstorrent prodává vývojářské karty Blackhole přímo, od 999 $ za p100a po 1 399 $ za p150a a p150b, skladem a s odesláním zhruba do dvou týdnů, s plně open source softwarovým stackem. Výhrada váží stejně jako cena: většina dokumentace a ověřené podpory modelů pořád cílí na starší kartu Wormhole, takže si vyhraďte čas na portování místo očekávání, že stávající kód poběží beze změny.
Diskuse
Komentáře
Přihlaste se a zapojte se do diskuse.