A Tenstorrent Blackhole fejlesztői kártyát már ezen a héten megrendelheted. 999 $-ba kerül, raktáron van, és nagyjából két hét alatt megérkezik. Meta MTIA-t viszont nyilvános csatornán nem tudsz megvenni vagy bérelni; a Meta úgy írja le az MTIA-t, mint saját munkaterheléseihez telepített szilíciumot.
Mindkét céget a vezető AI-chipgyártók közé sorolják. Ez a cikk arról szól, mekkora a távolság e két helyzet között.
A folytatás gyártóról gyártóra halad: mit szerezhetsz be, milyen csatornán, és mibe kerül a szoftver, ha már megvan a hardver.
Röviden
- Széles körben bérelhető: Az AMD Instinct továbbra is a legszélesebb publikusfelhő-lefedettséggel bír az NVIDIA-n kívül, a termékvonal azonban továbblépett. Az AMD 2026 júliusában mutatta be az MI400 Series-t, miközben az MI300X, MI325X és MI350 sorozatú rendszerek maradtak azok, amelyeket bérelhetőként a legnagyobb eséllyel találsz meg.
- Egyetlen felhő: A Google TPU-i a Google Cloudon maradnak, a TPU7x Ironwood pedig 2026 márciusa óta általánosan elérhető. Az AWS Trainium és az Inferentia az AWS-en marad.
- API és dedikált infrastruktúra: A Groq, a Cerebras és a SambaNova mind kínál hosztolt inferenciát, de a csak API leírás már nem pontos. Mindegyiknek van már dedikált vagy helyben futó útvonala is.
- Beszerezhető hardver: A Tenstorrent közvetlenül árulja a Blackhole kártyákat. A Qualcomm a Dragonfly adatközponti gyorsítóit vállalati értékesítési úton kínálja, nem pusztán ütemterv-bejelentésként.
- Korlátozott vagy belső: Az Intel Gaudi 3 továbbra is elérhető válogatott IBM Cloud-telepítéseken keresztül, a Crescent Island pedig várhatóan 2026 második felében kerül ügyfélmintázásba. Az Etched szerint az első rackek 2026 nyarán mennek ki szerződéses ügyfelekhez. A Meta MTIA és a Microsoft Maia belső vagy Azure-ba integrált marad, nem nyilvános önkiszolgáló gyorsító.
Amit ez a cikk nem tárgyal
Három dolog szándékosan kimarad a képből, és minden alábbi gyártói státusz 2026 augusztusát tükrözi.
- Árazás. A kérdés itt az, hogy hozzájutsz-e a hardverhez, nem az, hogy mennyibe kerül rajta egy óra.
- Előrejelzés. Nincs tipp arról, ki nyer.
- Fogyasztói és asztali kártyák. A téma az adatközponti és felhőbeli gyorsítók.
Az öt út, ahogyan AI-gyorsítón számítási kapacitáshoz juthatsz
A cikkben szereplő gyorsítókat öt hozzáférési útvonal fedi le: bérlés több felhőn keresztül, bérlés egyetlen felhőn át, hosztolt API-hozzáférés, dedikált vagy közvetlenül megvásárolható hardver, és korlátozott vállalati hozzáférés azoknál a termékeknél, amelyek nem széles körben önkiszolgálók. Egyes cégek ma már több ilyen útvonalat is lefednek. Egy külön csoport tisztán belső marad, a szilíciumot nyilvánosan sehogyan sem lehet bérelni vagy megvenni.
A hozzáférés állapot, nem a cég állandó tulajdonsága. Változik, ahogy új generációk jelennek meg, ahogy a felhők hardvert vesznek fel vagy dobnak ki, és ahogy a gyártók beszerzési csatornákat nyitnak vagy zárnak. Ráadásul semmit nem mond a minőségről vagy a méretről. Azt írja le, hogyan juthatsz a számítási kapacitáshoz, és éppen ez a csatorna dönti el, hogy egy név olyasmi-e, amivel kezdeni is tudsz valamit.
Az NVIDIA birtokolja az adatközponti AI-gyorsítók bevételének nagy többségét, gyakorlatilag minden felhőn ott van, és a CUDA az a felület, amihez minden mást mérnek. A többi itt szereplő AI-gyorsítócég épp attól érdekes, mennyire eltérő módon lehet eljutni hozzájuk.
| Gyártó és termék | Hozzáférési szint | Hogyan juthatsz hozzá | Szoftververem | Munkaterhelés | Állapot |
|---|---|---|---|---|---|
| NVIDIA (viszonyítási alap, nem alternatíva) | Sok felhő | Szinte minden felhőszolgáltató | CUDA | Tanítás és inferencia | Általánosan elérhető |
| AMD Instinct MI300X | Sok felhő | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Tanítás és inferencia | Általánosan elérhető |
| AMD Instinct MI325X | Sok felhő | Vultr, TensorWave, DigitalOcean | ROCm | Tanítás és inferencia | Általánosan elérhető |
| Google TPU7x (Ironwood) | Egyetlen felhő | Google Cloud | JAX, és PyTorch a PyTorch/XLA-n keresztül | Tanítás és inferencia | 2026. március 31. óta általánosan elérhető |
| AWS Trainium | Egyetlen felhő | AWS EC2 Trainium példányok és UltraServers (Trn2, Trainium3) | Neuron SDK | Tanítás és inferencia | Általánosan elérhető |
| AWS Inferentia2 | Egyetlen felhő | AWS EC2 Inf2 példányok | Neuron SDK | Inferencia | Általánosan elérhető |
| Groq LPU | Hosztolt API és dedikált infrastruktúra | GroqCloud és GroqMetal | OpenAI-kompatibilis API és a Groq verem | Inferencia | Elérhető |
| Cerebras WSE-3 és CS-3 | Hosztolt API, vállalati felhő, helyben | Cerebras Cloud és CS-3 rendszerek | Cerebras szoftververem | Tanítás és inferencia | Elérhető |
| SambaNova SN50 | Hosztolt API, dedikált, helyben | SambaCloud és SambaRack | SambaStack | Inferencia | Az ügyfélszállítások 2026 második felében indulnak |
| Intel Gaudi 3 | Válogatott felhő | IBM Cloud | Intel Gaudi szoftvercsomag | Tanítás, finomhangolás és inferencia | Válogatott elérhetőség |
| Tenstorrent Blackhole | Vedd meg a hardvert | Közvetlenül a Tenstorrenttől | Nyílt forráskódú TT-Metalium verem | Inferencia és fejlesztői munka | Raktáron, nagyjából két hét alatt szállítva |
| Qualcomm AI200, AI250 és AI300 | Vállalati értékesítés | Kapcsolatfelvétel az értékesítéssel | Qualcomm AI szoftververem | Inferencia | Az AI200 2026-ban várható, az AI250 mintázása 2027-ben, az AI300 mintázása 2028-ban |
| Etched Sohu | Szerződéses telepítések | Vállalati szerződések | Etched szoftververem | Transformer-inferencia | Az első rackek 2026 nyarán indulnak |
| Meta MTIA | Nem szerezhető be | Nincs külső útvonal | A Meta belső eszközei | A Meta saját rangsorolási, ajánlási és GenAI-munkája | Csak belső |
| Microsoft Maia 200 | Belső, Azure-ba integrált | Microsoft adatközpontok | Maia SDK | Inferencia | Belsőleg telepítve, nyilvános önkiszolgáló példány nélkül |
Az AMD Instinct az, amelyet szinte bárhol bérelhetsz
Az itt tárgyalt NVIDIA-alternatívák közül az AMD Instinct rendelkezik a legszélesebb szolgáltatói lefedettséggel: az MI300X és az MI325X több felhő- és neocloud-szolgáltatónál is elérhető ahelyett, hogy egyetlen hiperskálázóhoz kötődne. Az AMD 2026 júliusában mutatta be az MI400 Series-t az MI455X vezetésével, a régebbi generációk azonban továbbra is számítanak, mert a meglévő bérelhető kínálatban inkább azokkal fogsz találkozni. A ROCm marad a cikk legrövidebb szoftveres átállása a legtöbb meglévő PyTorch-munkaterhelés esetében.
A korlát nem a hardver. Az MI300X 192GB HBM3-at visz 5,3 TB/s sebességgel 304 CDNA3 számítóegységen keresztül, egy 750W-os modulban. Az MI325X ezt 256GB HBM3E-re, 6 TB/s-ra és 1000W-ra emeli, ez a kapacitás pedig alacsonyabb lett a kezdetben bejelentett 288GB-nál.
CUDA magok az, amit az NVIDIA számol, míg az AMD számítóegységeket számol, és a kettő nem váltható át egymásra, ezért a memória és a sávszélesség összehasonlítása hasznosabb a gyártók között.
A szoftverhelyzet megváltozott, a hírneve viszont lemaradt mögötte. A ROCm PyTorch-támogatása bekerült a hivatalos PyTorch-tárolóba ahelyett, hogy egy közösségi forkban élne, és a jelenlegi ROCm-kiadások követik az aktuális keretrendszereket. A ROCm 7.14.0 támogatja a PyTorch 2.12-t, az AMD tágabb AI-szoftverökoszisztémára vonatkozó jelenlegi integrációi mellett.
Az én olvasatomban a súrlódás, amit az emberek még mindig emlegetnek, nem az átbocsátóképesség és nem a keretrendszer-támogatás. Ez régészet. Amikor egy CUDA-környezet hajnali háromkor elszáll, valaki már belefutott abba a hibaüzenetbe, és leírta a megoldást. ROCm-en a találatok ritkábbak, így az idő a keresésre megy el, nem a javításra. Ez a költség soha nem jelenik meg egy benchmarkban.
Az AMD gyorsítós munkája az adatközponton túlra is elér, ami akkor számít, ha olcsó hardvert szeretnél, amin megtanulhatod a stacket.
Az AMD mini PC-fürtös demója ugyanennek a cégnek a fogyasztói szilíciumán fut.
A Google TPU és az AWS Trainium egyaránt pontosan egy felhőn bérelhető
A Google TPU7x-e és az AWS Trainiumja egyaránt általánosan elérhető, és mindkettő egyetlen szolgáltatóhoz van kötve. A TPU a Google Cloudon fut. A Trainium és az Inferentia az AWS-en fut. Egyik sem adja meg az AMD vagy az NVIDIA szolgáltatók közötti hordozhatóságát, és ez a megkötés többet nyomhat a latban bármelyik önálló specifikációnál.
A TPU7x a Google hetedik generációs Ironwood családjának első kiadása, és 2026. március 31-én vált általánosan elérhetővé. A Google nagy léptékű tanításra és inferenciára pozicionálja. A Trillium v6e továbbra is elérhető, míg az Ironwood marad a Google jelenlegi általánosan elérhető TPU-generációja. A Google bejelentette a nyolcadik generációs TPU 8t-t és TPU 8i-t is, de mindkettő még hamarosan jelzéssel szerepel.
A TPU-król szóló leghasznosabb tény nincs rajta az adatlapon. Van egy ingyenes felhajtó: a Colab és a Kaggle is kínál TPU-futtatókörnyezetet, a TPU Research Cloud pedig időt ad kutatóknak. Ez az ingyenes felhajtó módot ad arra, hogy kipróbáld a TPU szoftverútvonalát, mielőtt felhőköltségvetést kötnél le, bár nem szabad feltételezni, hogy az ingyenes szolgáltatások épp a legújabb Ironwood hardvert adják.
Az AWS a saját szilíciumához Trainium példányokon és UltraServereken keresztül fér hozzá, plusz Inf2 példányokon az Inferentia2-höz. A Trainium3 UltraServerek 2025 decemberében váltak általánosan elérhetővé, és 144 chipig skálázódnak, szemben a korábbi Trn2 UltraServerek 64-ével. Minden a Neuron SDK-n megy keresztül. Az AWS a portolás költségét a legtöbb gyártónál derűlátóbban állítja be.
Az AWS Trainium oldala azt írja, hogy a vLLM, a HuggingFace Transformers és a TorchTitan natívan fut Trainiumon, egyedi kód és portolási munka nélkül. Ez a gyártó állítása a saját termékéről, nem függetlenül ellenőrzött eredmény.
Mindkettő olyan alkuban áll, amit érdemes tudatosan megkötni. Nyersz egy második szilíciumbeszállítót, és elveszíted a lehetőséget, hogy azt a munkaterhelést újramunka nélkül másik felhőbe vidd, ami egy már egy szolgáltatóhoz kötött csapatnak szinte semmibe sem kerül, egy elköteleződés kerülésére épült csapatnak viszont mindenbe.
Ami be kell férjen a memóriába korlátozza először a választást: a Trainium3 chipenkénti 144GB más tervezési feladat, mint az Ironwood 192GB-ja, akárki is árulja.
A Groq, a Cerebras és a SambaNova túllép a hosztolt API-kon
A Groq, a Cerebras és a SambaNova mind kínál hosztolt inferenciát, de az API már nem a teljes hozzáférési történet. A Groq a GroqCloudot a dedikált GroqMetal infrastruktúrával párosítja. A Cerebras felhőalapú hozzáférést kínál a helyben is futtatható CS-3 rendszerek mellett. A SambaNova a SambaCloudot kínálja a SambaRack és a SambaStack mellett. A különbség ma abban áll, mennyi infrastruktúra-kontrollra van szükséged, és meddig vagy hajlandó elmenni egy vállalati beszerzésben.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
A Groq saját bejelentése azt mondja, hogy a GroqCloud megszakítás nélkül működik tovább.
A 2026 márciusi GTC-n az NVIDIA bemutatta az NVIDIA Groq 3 LPU-t a Vera Rubin platformján belül.
Az NVIDIA Vera Rubin bejelentése egy 256 LPU processzort tartalmazó LPX rackről ír, amely 2026 második felében lesz elérhető.
A Cerebras az ellenkező fizikai utat járja: egyetlen ostyaméretű alkatrész 900 000 maggal és 44GB lapkán belüli SRAM-mal, 125 PFLOPs-ra megadva.
A Cerebras inferencia-oldala 5 $ ingyenes kreditet kínál, és a migrációt mindössze két kódmódosításként írja le. Egy különbség a tervezésnél továbbra is számít: az önkiszolgáló API a könnyű inferenciaút, míg a tanítás, a finomhangolás, a dedikált kapacitás és a helyben futó CS-3 telepítések feljebb esnek a vállalati útvonalon.
A SambaNova jelenlegi hardvertörténete a SambaRack SN50 köré épül, amely rackenként 16 darab ötödik generációs SN50 RDU-ra támaszkodik. A SambaCloud marad a hosztolt út, míg a SambaRack és a SambaStack olyan dedikált infrastruktúrát ad, amely helyben vagy hosztolt környezetben is futhat.
A hosztolt hozzáférés mindhármuknál továbbra is a legkönnyebb belépési pont, de már nem írja le a teljes terméket.
A Tenstorrent olyan hardvert árul, amely a tiéd lehet
A Tenstorrent az egyetlen gyártó ebben a cikkben, amelynek gyorsítóját magánszemélyként egyszerűen megveheted, méghozzá olyan áron, ami nem beruházási döntés.
A Tenstorrent hardveroldala 999 $-on hozza a Blackhole p100a-t, a p150a-t és a p150b-t pedig 1399 $-on, raktáron, nagyjából két hét szállítással. A szoftververem teljesen nyílt forráskódú.
A kártyák 120 Tensix magot és 16 RISC-V magot visznek, a p100a-n 28GB, a p150 párosnál 32GB GDDR6-tal, akár 300W fogyasztás mellett. A p150a és a p150b olyan QSFP-DD Ethernet-portokat ad hozzá, amelyek a p100a-ból hiányoznak, és épp ezeket veszed meg, ha kártyákat akarsz összekötni. A HPCwire arról számolt be, hogy a rackméretű Galaxy Blackhole 2026. április 28-án vált általánosan elérhetővé 110 000 $-tól, a régebbi Wormhole vonal pedig továbbra is kapható, köztük egy 12 000 $-os TT-LoudBox munkaállomás.
Ez a kikötés a döntés szempontjából ugyanannyit nyom, mint az ár, és épp arra a régebbi kártyára mutat. A Tenstorrent dokumentációjának, oktatóanyagainak és ellenőrzött modelltámogatásának nagy része még mindig a Wormhole-t célozza. A Blackhole szoftvertámogatása korábbi szakaszban jár. Konkrétan: ez annak való, aki hajlandó valódi portolási munkát végezni, és forrást olvasni, amikor a dokumentáció elfogy. Nem annak való, aki azt szeretné, hogy a meglévő PyTorch-kódja változtatás nélkül fusson, ami teljesen ésszerű elvárás.
A Qualcommnak, az Intelnek és az Etchednek szűkebb a hozzáférési útja
Ez a három egymástól független okokból ül szűkebb hozzáférési útvonalak mögött. A Qualcomm többgenerációs adatközponti gyorsító-ütemtervet épít vállalati telepítések köré. Az Intel Gaudi 3 továbbra is elérhető válogatott IBM Cloud-telepítéseken, miközben a Crescent Island az ügyfélmintázás felé halad. Az Etched szerint az első Sohu rackek 2026 nyarán vállalati szerződések alapján indulnak, nem önkiszolgáló felhőszolgáltatáson keresztül.
A Qualcomm adatközponti ütemterve ma már a Dragonfly AI200-at, az AI250-et és a frissen bejelentett AI300-at öleli fel, éves gyorsítóütemben, inferenciára fókuszálva. Ez továbbra is vállalati irányultságú út, nem az a fajta önkiszolgáló gyorsítóbérlés, amit ma hozzáadsz egy felhőfiókhoz.
Az Intel a tanulságos tétel, mert a Gaudi 3 sosem ért el széles felhőbeli lefedettséget, de el sem tűnt. Az IBM Cloud továbbra is kínál Gaudi 3-gyorsított virtuálisszerver-profilokat válogatott elérhetőséggel, köztük dallasi, washingtoni és frankfurti telepítéseket. Az Intel következő lépése a Crescent Island, egy inferenciára szabott GPU, amelynek ügyfélmintázása 2026 második felében várható. A Gaudi 3 ma szűk lehetőség, de nem lezárt.
Az Etched a Sohut építi, egy transformer-inferenciára szakosodott ASIC-et. A cég 800 millió dollárt szedett össze, működő A0 szilíciuma van, több mint 1 milliárd dollárnyi aláírt ügyfélszerződésről számol be, és az első rackek 2026 nyarán indulnak. A teljesítményállításai a sajátjai, és nem mérték le függetlenül, így az átbocsátási számok nem a hasznos rész. A hasznos rész a szoftververem. Az Etched a chipet, a racket és a szoftverkörnyezetet egyetlen szakosodott platformként építi, ezért ne feltételezd, hogy a CUDA-korszak kiszolgálóverme változtatás nélkül átvihető. Egy szerződéses ügyfélnek, aki óriási léptékben futtat transformer-inferenciát, ez működhet, de sokkal nagyobb elköteleződés egy olyan csapatnak, amely a gyorsítók közötti hordozhatóságra épít.
Kizárólag belső szilícium és a cégek, amelyek másoknak építenek chipeket
Két helyzet kívülről AI-chipcégnek látszik, a viselkedésük mégis merőben más. A Meta és a Microsoft olyan gyorsítókat tervez, amelyeket maguk üzemeltetnek, és senkinek sem adnak el. A Broadcom és a Marvell más cégek architektúráihoz tervez és valósít meg szilíciumot. Egyik csoportnak sincs olyan terméke, amit egy fejlesztő bérelhetne, méghozzá olyan okokból, amelyekben semmi közös nincs.
A Meta MTIA-ja az első fajta legtisztább esete.
A Meta saját mérnöki bejegyzése arról ír, hogy több százezer MTIA chipet telepítenek inferenciafeladatokra az alkalmazásaikban, az organikus tartalomnál és a hirdetéseknél egyaránt, miközben az MTIA 300 már éles üzemben van rangsorolási és ajánlási tanításhoz, az MTIA 400, 450 és 500 pedig nagyjából féléves ütemben van betervezve. Ez elképesztő mennyiségű szilícium, amiből soha egyetlen órát sem fogsz bérelni.
A Microsoft esete lágyabb a szélein. A 2026 januárjában bemutatott Maia 200 a Microsoft jelenlegi saját fejlesztésű inferenciagyorsítója, és már telepítve van az adatközpontjaiban, a Maia SDK pedig előzetesben elérhető. A Microsoft jelenleg nem dokumentál nyilvános, önkiszolgáló Maia példányt, így ez az összehasonlításban továbbra is a belső vagy Azure-ba integrált oldalra tartozik.
A Broadcom és a Marvell megint más tészta, és érdemes tisztázni, mert a nevük folyamatosan ott szerepel az NVIDIA mellett. A Google TPU-ja jó példa. A TPU terméke és architektúrája a Google-é, míg a Broadcom egyedi szilícium tervezési és megvalósítási munkával járul hozzá, ami magában foglalhatja az összeköttetéseket, a tokozást és az utat az architektúrától a gyárthatóságig. A Broadcom nem árul TPU-t, sem más általános célú gyorsítót közvetlenül a fejlesztőknek. AI-szegmensének bevétele a 2026-os pénzügyi év első negyedéves jelentése szerint elérte a 8,4 milliárd dollárt, éves szinten 106 százalékos növekedéssel, ami megmagyarázza, miért van ott a neve mindenütt. Ettől még nem olyan chip, amit bérelni tudnál.
És épp itt kezd a gyártók szó olyan súlyt cipelni, amit nem bír el. A Broadcom és a Marvell nem gyárt chipeket, és a fent felsorolt AI-chipgyártók többsége sem: majdnem mindegyikük fabless, vagyis szilíciumot terveznek, a gyártást pedig teljes egészében máshova szerződik ki.
A hozzáférési út illesztése a munkaterheléshez
A nagy léptékű tanítás gyorsan leszűkíti a gyakorlati választást: széles körben elérhető AMD Instinct, egyetlen felhőhöz kötött TPU vagy Trainium, esetleg egy vállalati Cerebras-telepítés. A produkciós inferencia több utat nyit, mert a Groq, a Cerebras és a SambaNova mind kínál hosztolt szolgáltatást, és mellé valamilyen dedikált infrastruktúrát is. A kísérletezés megint tágabb, az ingyenes TPU-hozzáféréstől egy Tenstorrent kártyáig, amit a saját géped be tudsz dugni.
Ezek a határok lágyabbak, mint amit egy táblázat meg tud mutatni. A kérdés nem csupán az, mire képes a szilícium, hanem az is, hol éred el, a meglévő szoftververmedből mennyi éli túl a költözést, és hogy az így kialakuló munkaterhelés később elmozdítható-e máshová. A Cerebras vállalati infrastruktúrán tud tanítani és inferenciázni is, míg a Trainium az AWS-hez kötve marad.
Ezek egyike sem mozdítja ki az NVIDIA-t. A legtöbb csapatnál az eleven kérdés nem az, hogy elhagyják-e a CUDA-t, hanem hogy megéri-e mellette egy második vermet karbantartani.
Melyik kártyához méretezz az a döntés marad, ha ott maradsz, ahol vagy, és ez már más feladat, mint ez itt.
A csatorna többet dönt el, mint a chip. Egy kártya az asztalodon és ugyanaz a szilíciumosztály valaki más API-ja mögött nem ugyanaz az eszköz, még ha az átbocsátás közel is kerül egymáshoz, mert az egyik hagy olyasmit kipróbálni, ami még eszedbe sem jutott, a másik pedig tokenenként számláz azért, amit már tudsz, hogyan kérdezz.
Gyakran ismételt kérdések
Tényleg bérelhetsz Google TPU-t?
Igen. A TPU7x, a Google jelenlegi általánosan elérhető Ironwood TPU-ja, a Google Cloudon érhető el, és csakis ott. A régebbi TPU-generációk szintén elérhetők, a Colab, a Kaggle és a TPU Research Cloud pedig egyes munkaterhelésekhez ingyenes TPU-hozzáférést ad. A JAX marad a natív út, a PyTorch pedig a PyTorch/XLA-n keresztül fut.
Melyik NVIDIA-alternatíva futtatja a meglévő PyTorch-kódot a legkevesebb munkával?
A legtöbb esetben az AMD Instinct: a ROCm hivatalosan támogatott PyTorch-backend, tehát a kódútvonal már létezik. A Google TPU-ja a PyTorch/XLA hídon, azaz egy fordítórétegen keresztül futtatja a PyTorchot. Az AWS azt állítja, hogy a vLLM, a HuggingFace Transformers és a TorchTitan portolási munka nélkül fut Trainiumon, ami a gyártó saját állítása. A skála túlsó végén az Etched Sohuja saját, célra szabott szoftververmet használ, úgyhogy jóval több portolási munkára számíts, mint ROCm vagy PyTorch/XLA esetén.
Miért nevezik a Broadcomot és a Qualcommot NVIDIA-versenytársnak, ha a chipjeiket nem lehet bérelni?
Eltérő okokból. A Broadcom egyedi szilíciumon dolgozik olyan cégeknek, amelyek saját gyorsítót építenek, ahelyett hogy szabványos gyorsítót adna el közvetlenül fejlesztőknek. A Qualcomm saját Dragonfly gyorsítókat tervez, az AI200, az AI250 és az AI300 pedig már rajta van az adatközponti ütemtervén, a hozzáférés viszont vállalati irányultságú, nem szokványos önkiszolgáló felhőbérlés. Mindkettő versenyez az AI-infrastruktúrában anélkül, hogy a fejlesztőknek ugyanazt a nyilvános hozzáférési modellt adná, mint az NVIDIA vagy az AMD.
Meg lehet venni egy AI-gyorsítót bérlés helyett?
Igen. A Tenstorrent közvetlenül árulja a Blackhole fejlesztői kártyákat, 999 $-tól a p100a esetében 1399 $-ig a p150a és p150b esetében, raktáron, nagyjából két hét szállítással, teljesen nyílt forráskódú szoftververemmel. A kikötés annyit nyom, mint az ár: a dokumentáció és az ellenőrzött modelltámogatás nagy része még mindig a régebbi Wormhole kártyát célozza, úgyhogy tervezz időt a portolásra ahelyett, hogy a meglévő kód változtatás nélküli futására számítanál.
Beszélgetés
Hozzászólások
Jelentkezzen be a beszélgetéshez.