Questa settimana puoi ordinare una scheda per sviluppatori Tenstorrent Blackhole. Costa 999 $, è disponibile a magazzino e viene spedita in circa due settimane. Un Meta MTIA, invece, non puoi comprarlo né noleggiarlo tramite un canale pubblico; Meta descrive MTIA come silicio che impiega per i propri carichi di lavoro.
Entrambe le aziende vengono contate tra le principali società di chip IA. Questo articolo parla della distanza tra queste due situazioni.
Quello che segue procede fornitore per fornitore: che cosa puoi ottenere, attraverso quale canale e quanto ti costa il software una volta che ce l'hai.
TL;DR
- Ampiamente noleggiabile: AMD Instinct ha ancora la presenza in cloud pubblico più ampia al di fuori di NVIDIA, ma la linea di prodotto è andata avanti. AMD ha lanciato la serie MI400 a luglio 2026, mentre i sistemi MI300X, MI325X e della serie MI350 restano quelli che con più probabilità trovi a noleggio.
- Cloud unico: Le TPU di Google restano su Google Cloud, con TPU7x Ironwood disponibile in generale da marzo 2026. AWS Trainium e Inferentia restano su AWS.
- API più infrastruttura dedicata: Groq, Cerebras e SambaNova offrono tutte inferenza ospitata, ma parlare di sola API non è più esatto. Ognuna ha ora anche un percorso dedicato o on-premises.
- Hardware che puoi procurarti: Tenstorrent vende direttamente le schede Blackhole. Qualcomm propone i suoi acceleratori per data center Dragonfly attraverso un percorso di vendita enterprise, non solo come annunci di roadmap.
- Limitato o interno: Intel Gaudi 3 resta disponibile tramite alcuni deployment selezionati su IBM Cloud, mentre Crescent Island dovrebbe entrare in campionatura presso i clienti nella seconda metà del 2026. Etched dichiara che i primi rack partiranno verso clienti sotto contratto nell'estate 2026. Meta MTIA e Microsoft Maia restano interni o integrati in Azure anziché acceleratori pubblici self-service.
Cosa questo articolo non tratta
Tre cose restano deliberatamente fuori dall'inquadratura, e ogni stato dei fornitori qui sotto riflette agosto 2026.
- Prezzi. La domanda qui è se puoi ottenere l'hardware, non quanto costa un'ora su di esso.
- Previsioni. Nessuna previsione su chi vince.
- Schede consumer e desktop. Il tema sono gli acceleratori per data center e cloud.
I cinque modi per ottenere calcolo su un acceleratore IA
Cinque percorsi di accesso coprono gli acceleratori di questo articolo: noleggio su più cloud, noleggio tramite un solo cloud, accesso ad API ospitate, hardware dedicato o acquistabile direttamente, e accesso enterprise limitato per prodotti che non sono ampiamente self-service. Alcune aziende oggi coprono più di uno di questi percorsi. Un gruppo a parte resta puramente interno, senza alcun modo pubblico di noleggiare o acquistare il silicio.
L'accesso è uno stato, non una proprietà permanente dell'azienda. Cambia quando escono nuove generazioni, quando i cloud aggiungono o tolgono hardware e quando i fornitori aprono o chiudono canali di acquisto. Non dice inoltre nulla su qualità o scala. Descrive come puoi ottenere il calcolo, ed è quel canale a decidere se un nome è qualcosa su cui puoi agire.
NVIDIA detiene una larga maggioranza dei ricavi degli acceleratori IA per data center, è presente praticamente su ogni cloud, e CUDA è la superficie con cui tutto il resto viene confrontato. Le altre aziende di acceleratori IA presenti qui sono interessanti proprio per quanto è diverso il modo di raggiungerle.
| Fornitore e prodotto | Livello di accesso | Come ottenerlo | Stack software | Carico di lavoro | Stato |
|---|---|---|---|---|---|
| NVIDIA (riferimento, non un'alternativa) | Molti cloud | Quasi tutti i provider cloud | CUDA | Addestramento e inferenza | Disponibile in generale |
| AMD Instinct MI300X | Molti cloud | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Addestramento e inferenza | Disponibile in generale |
| AMD Instinct MI325X | Molti cloud | Vultr, TensorWave, DigitalOcean | ROCm | Addestramento e inferenza | Disponibile in generale |
| Google TPU7x (Ironwood) | Un solo cloud | Google Cloud | JAX, e PyTorch tramite PyTorch/XLA | Addestramento e inferenza | Disponibile in generale dal 31 marzo 2026 |
| AWS Trainium | Un solo cloud | Istanze AWS EC2 Trainium e UltraServers (Trn2, Trainium3) | Neuron SDK | Addestramento e inferenza | Disponibile in generale |
| AWS Inferentia2 | Un solo cloud | Istanze AWS EC2 Inf2 | Neuron SDK | Inferenza | Disponibile in generale |
| Groq LPU | API ospitata e infrastruttura dedicata | GroqCloud e GroqMetal | API compatibile con OpenAI e lo stack Groq | Inferenza | Disponibile |
| Cerebras WSE-3 e CS-3 | API ospitata, cloud enterprise, on-premises | Cerebras Cloud e sistemi CS-3 | Stack software Cerebras | Addestramento e inferenza | Disponibile |
| SambaNova SN50 | API ospitata, dedicato, on-premises | SambaCloud e SambaRack | SambaStack | Inferenza | Le spedizioni ai clienti iniziano nella seconda metà del 2026 |
| Intel Gaudi 3 | Cloud selezionati | Nube IBM | Suite software Intel Gaudi | Addestramento, fine-tuning e inferenza | Disponibilità selettiva |
| Tenstorrent Blackhole | Acquistare l'hardware | Direttamente da Tenstorrent | Stack TT-Metalium open source | Inferenza e lavoro di sviluppo | Disponibile a magazzino, spedito in circa due settimane |
| Qualcomm AI200, AI250 e AI300 | Vendita enterprise | Contatta il team vendite | Stack software IA di Qualcomm | Inferenza | AI200 atteso nel 2026, campionatura dell'AI250 attesa nel 2027, campionatura dell'AI300 attesa nel 2028 |
| Etched Sohu | Deployment su contratto | Contratti enterprise | Stack software Etched | Inferenza di transformer | Primi rack in spedizione nell'estate 2026 |
| Meta MTIA | Non ottenibile | Nessun percorso esterno | Strumenti interni di Meta | Il lavoro di ranking, raccomandazione e GenAI di Meta stessa | Solo interno |
| Microsoft Maia 200 | Interno, integrato in Azure | Data center Microsoft | Maia SDK | Inferenza | Distribuito internamente, senza istanza pubblica self-service |
AMD Instinct è quello che puoi noleggiare quasi ovunque
Tra le alternative a NVIDIA presentate qui, AMD Instinct ha la presenza più ampia tra i fornitori: MI300X e MI325X sono disponibili presso diversi provider cloud e neocloud anziché essere legati a un solo hyperscaler. AMD ha lanciato la serie MI400 a luglio 2026, guidata dall'MI455X, ma le generazioni precedenti contano ancora perché sono quelle che più probabilmente trovi nei deployment a noleggio già esistenti. ROCm resta il porting software più breve di questo articolo per la maggior parte dei carichi PyTorch esistenti.
Il vincolo non è l'hardware. MI300X porta 192GB di HBM3 a 5,3 TB/s su 304 unità di calcolo CDNA3 in un modulo da 750W. MI325X sale a 256GB di HBM3E a 6 TB/s e 1000W, una capacità che è risultata inferiore ai 288GB annunciati inizialmente da AMD.
Core CUDA sono ciò che conta NVIDIA, mentre AMD conta unità di calcolo, e i due valori non si convertono, ed è per questo che memoria e banda si confrontano in modo più utile tra fornitori.
La situazione software è cambiata, e la reputazione arriva in ritardo. Il supporto ROCm per PyTorch è stato integrato a monte nel repository ufficiale di PyTorch anziché vivere in un fork della community, e le release ROCm attuali seguono i framework attuali. ROCm 7.14.0 supporta PyTorch 2.12, accanto alle integrazioni attuali di AMD per il più ampio ecosistema software IA.
La mia lettura è che l'attrito che le persone continuano a descrivere non è il throughput e non è il supporto dei framework. È archeologia. Quando una configurazione CUDA si rompe alle tre del mattino, qualcuno ha già incontrato quella stringa di errore e ha annotato la soluzione. Su ROCm la ricerca è più sottile, quindi il tempo se ne va a cercare anziché a riparare. Questo costo non compare mai in un benchmark.
Il lavoro di AMD sugli acceleratori arriva anche oltre il data center, il che conta se vuoi hardware economico su cui imparare lo stack.
La demo di cluster di mini PC di AMD gira sul silicio consumer della stessa azienda.
Google TPU e AWS Trainium sono noleggiabili su esattamente un cloud ciascuno
Il TPU7x di Google e il Trainium di AWS sono entrambi disponibili in generale ed entrambi vincolati a un solo provider. TPU gira su Google Cloud. Trainium e Inferentia girano su AWS. Nessuno dei due ti dà la portabilità multi-provider di AMD o NVIDIA, e quel vincolo può pesare più di qualsiasi singola specifica.
TPU7x è la prima release della famiglia Ironwood di settima generazione di Google ed è diventata disponibile in generale il 31 marzo 2026. Google la posiziona per addestramento e inferenza su larga scala. Trillium v6e resta disponibile, mentre Ironwood resta l'attuale generazione TPU disponibile in generale di Google. Google ha inoltre annunciato TPU 8t e TPU 8i di ottava generazione, ma entrambe risultano ancora indicate come in arrivo.
Il fatto più utile sulle TPU non è nella scheda tecnica. Esiste una rampa d'accesso gratuita: Colab e Kaggle offrono entrambi runtime TPU, e il TPU Research Cloud assegna tempo ai ricercatori. Quella rampa gratuita ti dà un modo per testare il percorso software TPU prima di impegnare budget cloud, anche se non si deve dare per scontato che i servizi gratuiti forniscano proprio l'hardware Ironwood più recente.
AWS raggiunge il proprio silicio tramite istanze Trainium e UltraServers, più istanze Inf2 per Inferentia2. Gli UltraServers Trainium3 sono diventati disponibili in generale a dicembre 2025 e scalano fino a 144 chip, rispetto ai 64 dei precedenti UltraServers Trn2. Tutto passa dal Neuron SDK. AWS inquadra il costo del porting in modo più ottimistico rispetto alla maggior parte dei fornitori.
La pagina AWS Trainium afferma che vLLM, HuggingFace Transformers e TorchTitan girano nativamente su Trainium senza codice personalizzato e senza sforzo di porting. È l'affermazione del fornitore sul proprio prodotto, non un risultato verificato in modo indipendente.
Entrambi rientrano in uno scambio che vale la pena fare con consapevolezza. Guadagni un secondo fornitore di silicio e perdi la possibilità di spostare quel carico su un altro cloud senza rifare il lavoro, cosa che non costa quasi nulla a un team già impegnato con un provider e costa tutto a un team costruito attorno all'evitare impegni.
Ciò che deve stare in memoria vincola la scelta per prima cosa: 144GB per chip Trainium3 è un problema di pianificazione diverso dai 192GB di Ironwood, chiunque lo venda.
Groq, Cerebras e SambaNova vanno oltre le API ospitate
Groq, Cerebras e SambaNova offrono tutte inferenza ospitata, ma l'API non è più l'intera storia dell'accesso. Groq abbina GroqCloud all'infrastruttura dedicata GroqMetal. Cerebras offre accesso cloud accanto a sistemi CS-3 che possono girare on-premises. SambaNova offre SambaCloud accanto a SambaRack e SambaStack. La distinzione ora è quanto controllo sull'infrastruttura ti serve e quanto sei disposto ad addentrarti in un acquisto enterprise.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
L'annuncio di Groq stessa dice che GroqCloud continuerà a operare senza interruzioni.
Al GTC di marzo 2026, NVIDIA ha presentato l'NVIDIA Groq 3 LPU all'interno della sua piattaforma Vera Rubin.
L'annuncio Vera Rubin di NVIDIA descrive un rack LPX da 256 processori LPU, disponibile nella seconda metà del 2026.
Cerebras adotta l'approccio fisico opposto: un singolo componente su scala wafer con 900.000 core e 44GB di SRAM on-chip, dichiarato a 125 PFLOPs.
La pagina sull'inferenza di Cerebras offre 5 $ di credito gratuito e descrive la migrazione come appena due modifiche al codice. Una distinzione conta ancora per la pianificazione: l'API self-service è il percorso facile per l'inferenza, mentre addestramento, fine-tuning, capacità dedicata e deployment CS-3 on-premises si collocano più avanti sul percorso enterprise.
La storia hardware attuale di SambaNova ruota attorno a SambaRack SN50, costruito su 16 RDU SN50 di quinta generazione per rack. SambaCloud resta il percorso ospitato, mentre SambaRack e SambaStack forniscono infrastruttura dedicata che può girare on-premises o in ambienti ospitati.
L'accesso ospitato resta il punto d'ingresso più semplice per tutte e tre, ma non descrive più l'intero prodotto.
Tenstorrent vende hardware che puoi possedere
Tenstorrent è l'unico fornitore in questo articolo il cui acceleratore puoi comprare direttamente come privato, a un prezzo che non è una decisione di investimento.
La pagina hardware di Tenstorrent elenca il Blackhole p100a a 999 $ e i p150a e p150b a 1.399 $, disponibili a magazzino e spediti in circa due settimane. Lo stack è completamente open source.
Le schede portano 120 core Tensix e 16 core RISC-V, con 28GB di GDDR6 sulla p100a e 32GB sulla coppia p150, con un assorbimento fino a 300W. Le p150a e p150b aggiungono porte Ethernet QSFP-DD che alla p100a mancano, ed è quello che compri se intendi collegare più schede tra loro. HPCwire ha riferito che il Galaxy Blackhole su scala rack è diventato disponibile in generale il 28 aprile 2026 a partire da 110.000 $, e la più vecchia linea Wormhole resta in vendita, inclusa una workstation TT-LoudBox da 12.000 $.
L'avvertenza pesa sulla decisione quanto il prezzo, e punta proprio a quella scheda più vecchia. La maggior parte della documentazione, dei tutorial e del supporto verificato ai modelli di Tenstorrent mira ancora a Wormhole. Il supporto software di Blackhole è più indietro nel suo ciclo. Concretamente: questo va bene per chi è disposto a fare vero lavoro di porting e a leggere il sorgente quando la documentazione finisce. Non va bene per chi vuole che il codice PyTorch esistente giri senza modifiche, che è una cosa del tutto ragionevole da volere.
Qualcomm, Intel ed Etched hanno percorsi di accesso più stretti
Questi tre stanno dietro percorsi di accesso più stretti, per ragioni tra loro slegate. Qualcomm sta costruendo una roadmap pluriennale di acceleratori per data center attorno a deployment enterprise. Intel Gaudi 3 resta disponibile tramite deployment selezionati su IBM Cloud mentre Crescent Island si avvicina alla campionatura presso i clienti. Etched dichiara che i primi rack Sohu partiranno nell'estate 2026 a fronte di contratti enterprise, non tramite un servizio cloud self-service.
La roadmap per data center di Qualcomm ora copre Dragonfly AI200, AI250 e il neoannunciato AI300, con una cadenza annuale di acceleratori incentrata sull'inferenza. Resta un percorso orientato alle imprese, non il tipo di noleggio self-service di acceleratori che puoi aggiungere oggi a un account cloud.
Intel è il caso istruttivo perché Gaudi 3 non ha mai raggiunto un'ampia presenza cloud, ma non è nemmeno sparito. IBM Cloud offre ancora profili di server virtuali accelerati da Gaudi 3 in disponibilità selettiva, inclusi deployment a Dallas, Washington DC e Francoforte. Il passo successivo di Intel è Crescent Island, una GPU orientata all'inferenza attesa in campionatura presso i clienti nella seconda metà del 2026. Gaudi 3 oggi è un'opzione stretta, non un'opzione chiusa.
Etched sta costruendo Sohu, un ASIC specializzato nell'inferenza di transformer. L'azienda ha raccolto 800 milioni di dollari, ha silicio A0 funzionante, dichiara oltre 1 miliardo di dollari di contratti firmati con i clienti, e i primi rack sono previsti in spedizione nell'estate 2026. Le sue affermazioni sulle prestazioni sono proprie e non sono state misurate in modo indipendente, quindi i numeri di throughput non sono la parte utile. La parte utile è lo stack software. Etched costruisce chip, rack e ambiente software come un'unica piattaforma specializzata, quindi non dare per scontato che lo stack di serving dell'era CUDA si trasferisca invariato. Può funzionare per un cliente sotto contratto che esegue inferenza di transformer su scala enorme, ma è un impegno molto più grande per un team che dipende dalla portabilità tra acceleratori.
Silicio solo interno e le aziende che costruiscono chip per altri
Due situazioni sembrano da fuori un'azienda di chip IA e si comportano in modo del tutto diverso. Meta e Microsoft progettano acceleratori che gestiscono in proprio e non vendono a nessuno. Broadcom e Marvell progettano e realizzano silicio per le architetture di altre aziende. Nessuno dei due gruppi ha un prodotto che uno sviluppatore possa noleggiare, per ragioni che non hanno nulla in comune.
L'MTIA di Meta è il caso più limpido del primo tipo.
Il post di ingegneria di Meta stessa descrive il dispiegamento di centinaia di migliaia di chip MTIA per carichi di inferenza sia sui contenuti organici sia sulle inserzioni nelle sue app, con MTIA 300 già in produzione per l'addestramento di ranking e raccomandazione e MTIA 400, 450 e 500 pianificati con una cadenza di circa sei mesi. È una quantità enorme di silicio di cui non noleggerai mai un'ora.
Il caso di Microsoft è più sfumato ai bordi. Maia 200, presentata a gennaio 2026, è l'attuale acceleratore di inferenza interno di Microsoft ed è già distribuita nei suoi data center, con il Maia SDK disponibile in anteprima. Microsoft al momento non documenta un'istanza Maia pubblica self-service, quindi resta sul lato interno o integrato in Azure di questo confronto.
Broadcom e Marvell sono ancora un'altra cosa, e vale la pena chiarirlo perché i loro nomi compaiono di continuo accanto a quello di NVIDIA. La TPU di Google è un esempio utile. Google possiede il prodotto e l'architettura TPU, mentre Broadcom contribuisce con lavoro di progettazione e realizzazione di silicio su misura, che può includere interconnessioni, packaging e il percorso dall'architettura al silicio producibile. Broadcom non vende una TPU, né un altro acceleratore general purpose, direttamente agli sviluppatori. I ricavi del suo segmento IA, riportati nei risultati del primo trimestre fiscale 2026, hanno raggiunto 8,4 miliardi di dollari, in crescita del 106 per cento su base annua, il che spiega perché quel nome sia ovunque. Resta comunque un chip che non puoi noleggiare.
Ed è qui che la parola produttori comincia a portare un peso che non riesce a reggere. Broadcom e Marvell non fabbricano chip, e nemmeno la maggior parte dei produttori di chip IA elencati sopra: quasi tutti sono fabless, cioè progettano il silicio e affidano completamente la fabbricazione a qualcun altro.
Abbinare un percorso di accesso al tuo carico di lavoro
L'addestramento su larga scala restringe in fretta le scelte pratiche: AMD Instinct ampiamente disponibile, TPU o Trainium su un solo cloud, oppure un deployment enterprise di Cerebras. L'inferenza in produzione apre più percorsi perché Groq, Cerebras e SambaNova forniscono tutte servizi ospitati offrendo al contempo qualche forma di infrastruttura dedicata. La sperimentazione è di nuovo più ampia, dall'accesso gratuito alle TPU a una scheda Tenstorrent che puoi mettere nella tua macchina.
Quei confini sono più sfumati di quanto una tabella possa mostrare. La domanda non è solo cosa sa fare il silicio, ma dove puoi raggiungerlo, quanta parte del tuo stack software attuale sopravvive allo spostamento, e se il carico risultante potrà spostarsi altrove in seguito. Cerebras può addestrare e fare inferenza su infrastruttura enterprise, mentre Trainium resta legato ad AWS.
Niente di tutto ciò scalza NVIDIA. Per la maggior parte dei team la domanda viva non è se lasciare CUDA, ma se valga la pena mantenere un secondo stack accanto.
Quale scheda dimensionare è la decisione che resta se rimani dove sei, ed è un esercizio diverso da questo.
È il canale a decidere più del chip. Una scheda sulla tua scrivania e la stessa classe di silicio dietro l'API di qualcun altro non sono lo stesso strumento, nemmeno quando il throughput finisce vicino, perché uno ti lascia provare cose a cui non hai ancora pensato e l'altro ti fattura a token ciò che già sai come chiedere.
Domande frequenti
Si può davvero noleggiare una TPU di Google?
Sì. TPU7x, l'attuale TPU Ironwood disponibile in generale di Google, si trova su Google Cloud e solo lì. Anche le generazioni TPU precedenti sono disponibili, e Colab, Kaggle e il TPU Research Cloud offrono accesso gratuito alle TPU per alcuni carichi. JAX resta il percorso nativo, mentre PyTorch gira tramite PyTorch/XLA.
Quale alternativa a NVIDIA esegue il codice PyTorch esistente con meno lavoro?
AMD Instinct, nella maggior parte dei casi: ROCm è un backend PyTorch ufficialmente supportato, quindi il percorso nel codice esiste già. La TPU di Google esegue PyTorch tramite il ponte PyTorch/XLA, uno strato di traduzione. AWS afferma che vLLM, HuggingFace Transformers e TorchTitan girano su Trainium senza sforzo di porting, che è l'affermazione del fornitore stesso. All'estremo opposto, il Sohu di Etched usa un proprio stack software specializzato, quindi aspettati parecchio più lavoro di porting rispetto a ROCm o PyTorch/XLA.
Perché Broadcom e Qualcomm vengono chiamate concorrenti di NVIDIA se non puoi noleggiare i loro chip?
Per ragioni diverse. Broadcom lavora su silicio su misura per aziende che costruiscono i propri acceleratori, anziché vendere un acceleratore standard direttamente agli sviluppatori. Qualcomm progetta i propri acceleratori Dragonfly, con AI200, AI250 e AI300 ormai nella sua roadmap per data center, ma l'accesso è orientato alle imprese e non è un normale noleggio cloud self-service. Entrambe competono nell'infrastruttura IA senza dare agli sviluppatori lo stesso modello di accesso pubblico di NVIDIA o AMD.
Si può comprare un acceleratore IA invece di noleggiarlo?
Sì. Tenstorrent vende direttamente le schede per sviluppatori Blackhole, da 999 $ per la p100a a 1.399 $ per la p150a e la p150b, disponibili a magazzino e spedite in circa due settimane, con uno stack software completamente open source. L'avvertenza pesa quanto il prezzo: gran parte della documentazione e del supporto verificato ai modelli mira ancora alla più vecchia scheda Wormhole, quindi metti in conto tempo per il porting invece di aspettarti che il codice esistente giri senza modifiche.
Discussione
Commenti
Accedi per partecipare alla discussione.