Esta semana puedes pedir una tarjeta de desarrollo Tenstorrent Blackhole. Cuesta 999 $, está en stock y se envía en unas dos semanas. No puedes comprar ni alquilar un Meta MTIA por un canal público; Meta describe MTIA como silicio que despliega para sus propias cargas de trabajo.
Ambas empresas se cuentan entre las principales empresas de chips de IA. La distancia entre esas dos situaciones es de lo que trata este artículo.
Lo que sigue va proveedor por proveedor: qué puedes conseguir, por qué canal y cuánto te cuesta el software una vez que lo tienes.
TL;DR
- Ampliamente alquilable: AMD Instinct sigue teniendo la mayor presencia en nube pública fuera de NVIDIA, pero la línea de producto ha avanzado. AMD lanzó la serie MI400 en julio de 2026, mientras que los sistemas MI300X, MI325X y de la serie MI350 siguen siendo los que es más probable que encuentres en alquiler.
- Nube única: Las TPU de Google se quedan en Google Cloud, con TPU7x Ironwood en disponibilidad general desde marzo de 2026. AWS Trainium e Inferentia se quedan en AWS.
- API más infraestructura dedicada: Groq, Cerebras y SambaNova ofrecen inferencia alojada, pero decir solo API ya no es exacto. Cada uno tiene ahora también una vía dedicada o local.
- Hardware que puedes adquirir: Tenstorrent vende las tarjetas Blackhole directamente. Qualcomm presenta sus aceleradores de centro de datos Dragonfly mediante una vía de contacto comercial empresarial, y no solo como anuncios de hoja de ruta.
- Limitado o interno: Intel Gaudi 3 sigue disponible en despliegues selectos de IBM Cloud, mientras que se espera que Crescent Island entre en muestreo con clientes en la segunda mitad de 2026. Etched dice que sus primeros racks se envían a clientes con contrato en el verano de 2026. Meta MTIA y Microsoft Maia siguen siendo internos o integrados en Azure, y no aceleradores públicos de autoservicio.
Lo que este artículo no cubre
Tres cosas quedan deliberadamente fuera del encuadre, y cada estado de proveedor que aparece abajo refleja agosto de 2026.
- Precios. La pregunta aquí es si puedes conseguir el hardware, no cuánto cuesta una hora en él.
- Pronósticos. Sin apuestas sobre quién gana.
- Tarjetas de consumo y de escritorio. El tema son los aceleradores de centro de datos y de nube.
Las cinco formas de conseguir cómputo en un acelerador de IA
Cinco vías de acceso cubren los aceleradores de este artículo: alquiler en varias nubes, alquiler a través de una sola nube, acceso por API alojada, hardware dedicado o adquirible directamente, y acceso empresarial limitado para productos que no son ampliamente de autoservicio. Algunas empresas abarcan ahora más de una de estas vías. Un grupo aparte sigue siendo solo interno, sin ninguna forma pública de alquilar o comprar el silicio.
El acceso es un estado, no una propiedad permanente de la empresa. Cambia cuando salen nuevas generaciones, cuando las nubes añaden o retiran hardware y cuando los proveedores abren o cierran canales de compra. Tampoco dice nada sobre calidad o escala. Describe cómo puedes conseguir el cómputo, y ese canal decide si un nombre es algo sobre lo que puedes actuar.
NVIDIA concentra una gran mayoría de los ingresos de aceleradores de IA para centros de datos, está en prácticamente todas las nubes y CUDA es la superficie con la que se compara todo lo demás. Las otras empresas de aceleradores de IA que aparecen aquí resultan interesantes por lo distinto que es llegar a ellas.
| Proveedor y producto | Nivel de acceso | Cómo conseguirlo | Pila de software | Carga de trabajo | Estado |
|---|---|---|---|---|---|
| NVIDIA (referencia, no una alternativa) | Muchas nubes | Casi todos los proveedores de nube | CUDA | Entrenamiento e inferencia | Disponible de forma general |
| AMD Instinct MI300X | Muchas nubes | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Entrenamiento e inferencia | Disponible de forma general |
| AMD Instinct MI325X | Muchas nubes | Vultr, TensorWave, DigitalOcean | ROCm | Entrenamiento e inferencia | Disponible de forma general |
| Google TPU7x (Ironwood) | Una sola nube | Google Cloud | JAX, y PyTorch a través de PyTorch/XLA | Entrenamiento e inferencia | Disponible de forma general desde el 31 de marzo de 2026 |
| AWS Trainium | Una sola nube | Instancias AWS EC2 Trainium y UltraServers (Trn2, Trainium3) | Neuron SDK | Entrenamiento e inferencia | Disponible de forma general |
| AWS Inferentia2 | Una sola nube | Instancias AWS EC2 Inf2 | Neuron SDK | Inferencia | Disponible de forma general |
| Groq LPU | API alojada e infraestructura dedicada | GroqCloud y GroqMetal | API compatible con OpenAI y la pila de Groq | Inferencia | Disponible |
| Cerebras WSE-3 y CS-3 | API alojada, nube empresarial, local | Cerebras Cloud y sistemas CS-3 | Pila de software de Cerebras | Entrenamiento e inferencia | Disponible |
| SambaNova SN50 | API alojada, dedicado, local | SambaCloud y SambaRack | SambaStack | Inferencia | Los envíos a clientes comienzan en la segunda mitad de 2026 |
| Intel Gaudi 3 | Nube selecta | IBM Cloud nube | Suite de software Intel Gaudi | Entrenamiento, ajuste fino e inferencia | Disponibilidad selecta |
| Tenstorrent Blackhole | Comprar el hardware | Directamente de Tenstorrent | Pila TT-Metalium de código abierto | Inferencia y trabajo de desarrollo | En stock, se envía en unas dos semanas |
| Qualcomm AI200, AI250 y AI300 | Venta empresarial | Contactar con ventas | Pila de software de IA de Qualcomm | Inferencia | AI200 previsto para 2026, muestreo del AI250 previsto para 2027, muestreo del AI300 previsto para 2028 |
| Etched Sohu | Despliegues bajo contrato | Contratos empresariales | Pila de software de Etched | Inferencia de transformers | Primeros racks enviados en el verano de 2026 |
| Meta MTIA | No se puede obtener | Ninguna vía externa | Herramientas internas de Meta | El trabajo propio de Meta en ranking, recomendación y GenAI | Solo interno |
| Microsoft Maia 200 | Interno, integrado en Azure | Centros de datos de Microsoft | Maia SDK | Inferencia | Desplegado internamente, sin instancia pública de autoservicio |
AMD Instinct es el que puedes alquilar casi en cualquier sitio
AMD Instinct tiene la mayor huella de proveedores entre las alternativas a NVIDIA que aparecen aquí, con MI300X y MI325X disponibles en varios proveedores de nube y neonube en lugar de estar atados a un solo hiperescalador. AMD lanzó la serie MI400 en julio de 2026, encabezada por el MI455X, pero las generaciones anteriores siguen importando porque son las que es más probable encontrar en despliegues de alquiler ya existentes. ROCm sigue siendo el port de software más corto de este artículo para la mayoría de las cargas de PyTorch existentes.
El hardware no es la limitación. El MI300X lleva 192 GB de HBM3 a 5,3 TB/s repartidos en 304 unidades de cómputo CDNA3 dentro de un módulo de 750 W. El MI325X lo eleva a 256 GB de HBM3E a 6 TB/s y 1000 W, una capacidad que quedó por debajo de los 288 GB que AMD anunció al principio.
núcleos CUDA son lo que cuenta NVIDIA, mientras que AMD cuenta unidades de cómputo, y las dos cifras no se convierten entre sí, razón por la que la memoria y el ancho de banda se comparan de forma más útil entre fabricantes.
La situación del software ha cambiado, y la reputación va por detrás. El soporte de ROCm para PyTorch está integrado en el repositorio oficial de PyTorch en lugar de vivir en un fork comunitario, y las versiones actuales de ROCm siguen a los frameworks actuales. ROCm 7.14.0 soporta PyTorch 2.12, junto a las integraciones actuales de AMD para el ecosistema de software de IA más amplio.
Mi lectura es que la fricción que la gente sigue describiendo no es el rendimiento ni el soporte de frameworks. Es arqueología. Cuando una instalación de CUDA se rompe a las tres de la mañana, alguien ya se topó con ese mensaje de error y anotó la solución. En ROCm la búsqueda es más escasa, así que el tiempo se va en buscar en lugar de arreglar. Ese coste nunca aparece en un benchmark.
El trabajo de AMD en aceleradores también va más allá del centro de datos, lo que importa si quieres hardware barato con el que aprender la pila.
La demo de clúster de mini PC de AMD funciona con el silicio de consumo de esa misma empresa.
Google TPU y AWS Trainium se alquilan en exactamente una nube cada uno
El TPU7x de Google y el Trainium de AWS están ambos en disponibilidad general y ambos atados a un único proveedor. TPU corre en Google Cloud. Trainium e Inferentia corren en AWS. Ninguno te da la portabilidad entre proveedores de AMD o NVIDIA, y esa restricción puede pesar más que cualquier especificación concreta.
TPU7x es el primer lanzamiento de la familia Ironwood de séptima generación de Google y pasó a disponibilidad general el 31 de marzo de 2026. Google lo posiciona para entrenamiento e inferencia a gran escala. Trillium v6e sigue disponible, mientras que Ironwood sigue siendo la generación de TPU actualmente en disponibilidad general de Google. Google también ha anunciado los TPU 8t y TPU 8i de octava generación, pero ambos siguen figurando como próximamente.
El dato más útil sobre las TPU no está en la ficha técnica. Hay una rampa de entrada gratuita: Colab y Kaggle ofrecen entornos de ejecución TPU, y el TPU Research Cloud concede tiempo a investigadores. Esa rampa gratuita te da una forma de probar la ruta de software de TPU antes de comprometer presupuesto de nube, aunque no conviene dar por hecho que los servicios gratuitos entreguen específicamente el hardware Ironwood más reciente.
AWS llega a su propio silicio mediante instancias Trainium y UltraServers, además de instancias Inf2 para Inferentia2. Los UltraServers Trainium3 alcanzaron disponibilidad general en diciembre de 2025 y escalan a 144 chips, frente a 64 en los anteriores UltraServers Trn2. Todo pasa por el Neuron SDK. AWS plantea el coste de portado de forma más optimista que la mayoría de proveedores.
La página de AWS Trainium afirma que vLLM, HuggingFace Transformers y TorchTitan corren de forma nativa en Trainium sin código propio ni esfuerzo de portado. Esa es la afirmación del proveedor sobre su propio producto, no un resultado verificado de forma independiente.
Los dos forman parte de un intercambio que conviene hacer a conciencia. Ganas un segundo proveedor de silicio y pierdes la capacidad de mover esa carga a otra nube sin rehacer el trabajo, lo que no cuesta casi nada a un equipo ya comprometido con un proveedor y lo cuesta todo a un equipo construido en torno a evitar compromisos.
Lo que tiene que caber en memoria condiciona la elección antes que nada: 144 GB por chip Trainium3 es un problema de planificación distinto de los 192 GB de Ironwood, lo venda quien lo venda.
Groq, Cerebras y SambaNova van más allá de las API alojadas
Groq, Cerebras y SambaNova ofrecen inferencia alojada, pero la API ya no resume todo el acceso. Groq combina GroqCloud con la infraestructura dedicada GroqMetal. Cerebras ofrece acceso en la nube junto a sistemas CS-3 que pueden correr en local. SambaNova ofrece SambaCloud junto a SambaRack y SambaStack. La distinción ahora es cuánto control de infraestructura necesitas y hasta dónde estás dispuesto a llegar en una compra empresarial.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
El propio anuncio de Groq dice que GroqCloud seguirá funcionando sin interrupción.
En la GTC de marzo de 2026, NVIDIA presentó el NVIDIA Groq 3 LPU dentro de su plataforma Vera Rubin.
El anuncio de Vera Rubin de NVIDIA describe un rack LPX de 256 procesadores LPU, disponible en la segunda mitad de 2026.
Cerebras adopta el enfoque físico opuesto: una sola pieza a escala de oblea con 900.000 núcleos y 44 GB de SRAM en el chip, valorada en 125 PFLOPs.
La página de inferencia de Cerebras ofrece 5 $ de crédito gratuito y describe la migración como solo dos cambios de código. Una distinción sigue importando para planificar: la API de autoservicio es la ruta fácil de inferencia, mientras que el entrenamiento, el ajuste fino, la capacidad dedicada y los despliegues locales de CS-3 quedan más arriba en la ruta empresarial.
La historia actual de hardware de SambaNova gira en torno a SambaRack SN50, construido sobre 16 RDU SN50 de quinta generación por rack. SambaCloud sigue siendo la vía alojada, mientras que SambaRack y SambaStack aportan infraestructura dedicada que puede correr en local o en entornos alojados.
El acceso alojado sigue siendo el punto de entrada más fácil para los tres, pero ya no describe el producto completo.
Tenstorrent vende hardware que puedes tener en propiedad
Tenstorrent es el único proveedor de este artículo cuyo acelerador puedes comprar directamente como particular, a un precio que no es una decisión de inversión.
La página de hardware de Tenstorrent lista el Blackhole p100a a 999 $ y los p150a y p150b a 1.399 $, en stock y con envío en unas dos semanas. La pila es totalmente de código abierto.
Las tarjetas llevan 120 núcleos Tensix y 16 núcleos RISC-V, con 28 GB de GDDR6 en la p100a y 32 GB en el par p150, consumiendo hasta 300 W. Las p150a y p150b añaden puertos Ethernet QSFP-DD que la p100a no tiene, que es lo que compras si piensas enlazar tarjetas entre sí. HPCwire informó de que el Galaxy Blackhole a escala de rack alcanzó disponibilidad general el 28 de abril de 2026 desde 110.000 $, y la línea Wormhole anterior sigue a la venta, incluida una estación de trabajo TT-LoudBox de 12.000 $.
La salvedad pesa tanto en la decisión como el precio, y apunta a esa tarjeta más antigua. La mayor parte de la documentación, los tutoriales y el soporte de modelos verificado de Tenstorrent siguen apuntando a Wormhole. El soporte de software de Blackhole está más al principio de su ciclo. En concreto: esto encaja con alguien dispuesto a hacer trabajo real de portado y a leer el código fuente cuando la documentación se acaba. No encaja con alguien que quiere que su código PyTorch existente corra sin modificar, que es algo perfectamente razonable de querer.
Qualcomm, Intel y Etched tienen vías de acceso más estrechas
Estos tres quedan detrás de vías de acceso más estrechas, por razones que no tienen relación entre sí. Qualcomm está desplegando una hoja de ruta de aceleradores de centro de datos de varias generaciones, articulada en torno a despliegues empresariales. Intel Gaudi 3 sigue disponible en despliegues selectos de IBM Cloud mientras Crescent Island avanza hacia el muestreo con clientes. Etched dice que sus primeros racks Sohu se envían en el verano de 2026 contra contratos empresariales, no a través de un servicio de nube de autoservicio.
La hoja de ruta de centro de datos de Qualcomm abarca ahora Dragonfly AI200, AI250 y el recién anunciado AI300, con una cadencia anual de aceleradores centrada en inferencia. Esto sigue siendo una vía orientada a empresa, no el tipo de alquiler de acelerador de autoservicio que puedes añadir hoy a una cuenta de nube.
Intel es el caso instructivo, porque Gaudi 3 nunca logró una presencia amplia en la nube, pero tampoco ha desaparecido. IBM Cloud sigue ofreciendo perfiles de servidor virtual acelerados por Gaudi 3 en disponibilidad selecta, con despliegues en Dallas, Washington DC y Fráncfort. El siguiente paso de Intel es Crescent Island, una GPU centrada en inferencia que se espera que entre en muestreo con clientes en la segunda mitad de 2026. Gaudi 3 es hoy una opción estrecha, no una opción cerrada.
Etched está construyendo Sohu, un ASIC especializado en inferencia de transformers. La empresa ha levantado 800 millones de dólares, tiene silicio A0 funcionando, declara más de 1.000 millones de dólares en contratos firmados con clientes, y los primeros racks están previstos para el verano de 2026. Sus afirmaciones de rendimiento son propias y no han sido medidas de forma independiente, así que las cifras de throughput no son la parte útil. La parte útil es la pila de software. Etched está construyendo el chip, el rack y el entorno de software como una única plataforma especializada, así que no conviene dar por hecho que la pila de servicio de la era CUDA se traslada sin cambios. Eso puede funcionar para un cliente con contrato que hace inferencia de transformers a escala enorme, pero es un compromiso mucho mayor para un equipo que depende de la portabilidad entre aceleradores.
El silicio solo interno y las firmas que fabrican chips para otros
Dos situaciones parecen desde fuera una empresa de chips de IA y no se comportan en nada igual. Meta y Microsoft diseñan aceleradores que operan ellas mismas y no venden a nadie. Broadcom y Marvell diseñan e implementan silicio para arquitecturas de otras empresas. Ninguno de los dos grupos tiene un producto que un desarrollador pueda alquilar, por razones que no tienen nada en común.
El MTIA de Meta es el caso más claro del primer tipo.
La propia entrada de ingeniería de Meta describe el despliegue de cientos de miles de chips MTIA para cargas de inferencia tanto en contenido orgánico como en anuncios dentro de sus apps, con MTIA 300 ya en producción para entrenamiento de ranking y recomendación y MTIA 400, 450 y 500 planeados a una cadencia de unos seis meses. Es una cantidad enorme de silicio del que nunca alquilarás ni una hora.
El caso de Microsoft es más difuso en los bordes. Maia 200, presentado en enero de 2026, es el acelerador de inferencia propio actual de Microsoft y ya está desplegado en sus centros de datos, con el Maia SDK disponible en versión preliminar. Microsoft no documenta actualmente una instancia Maia pública de autoservicio, así que sigue perteneciendo al lado interno o integrado en Azure de esta comparación.
Broadcom y Marvell son otra cosa distinta, y conviene aclararlo porque sus nombres aparecen constantemente junto al de NVIDIA. La TPU de Google es un ejemplo útil. Google es dueña del producto y la arquitectura TPU, mientras que Broadcom aporta trabajo de diseño e implementación de silicio a medida, que puede incluir interconexiones, empaquetado y el camino de la arquitectura al silicio fabricable. Broadcom no vende una TPU, ni otro acelerador de propósito general, directamente a desarrolladores. Los ingresos de su segmento de IA, publicados en sus resultados del primer trimestre fiscal de 2026, alcanzaron 8.400 millones de dólares, un 106 por ciento más interanual, lo que explica por qué el nombre está en todas partes. Sigue sin ser un chip que puedas alquilar.
Y ahí es donde la palabra fabricantes empieza a cargar un peso que no puede sostener. Broadcom y Marvell no fabrican chips, y la mayoría de los fabricantes de chips de IA listados arriba tampoco: casi todos son fabless, es decir, diseñan el silicio y subcontratan la fabricación por completo a otro.
Emparejar una vía de acceso con tu carga de trabajo
El entrenamiento a escala estrecha rápido las opciones prácticas: AMD Instinct ampliamente disponible, TPU o Trainium en una sola nube, o un despliegue empresarial de Cerebras. La inferencia en producción abre más vías porque Groq, Cerebras y SambaNova ofrecen servicios alojados y además alguna forma de infraestructura dedicada. La experimentación es todavía más amplia, desde el acceso gratuito a TPU hasta una tarjeta Tenstorrent que puedes meter en tu propia máquina.
Esas fronteras son más difusas de lo que una tabla puede mostrar. La pregunta no es solo qué puede hacer el silicio, sino dónde puedes alcanzarlo, cuánto de tu pila de software actual sobrevive al traslado, y si la carga resultante podrá moverse a otro sitio más adelante. Cerebras puede entrenar e inferir sobre infraestructura empresarial, mientras que Trainium sigue atado a AWS.
Nada de esto desplaza a NVIDIA. Para la mayoría de los equipos la pregunta real no es si dejar CUDA, sino si merece la pena mantener una segunda pila junto a ella.
Qué tarjeta dimensionar es la decisión que queda si te quedas donde estás, y ese es un ejercicio distinto de este.
El canal decide más que el chip. Una tarjeta en tu escritorio y la misma clase de silicio detrás de la API de otro no son la misma herramienta, aunque el rendimiento acabe pareciéndose, porque una te deja probar cosas en las que aún no has pensado y la otra te cobra por token lo que ya sabes pedir.
Preguntas frecuentes
¿De verdad puedes alquilar una TPU de Google?
Sí. TPU7x, la TPU Ironwood actualmente en disponibilidad general de Google, está en Google Cloud y solo ahí. Las generaciones de TPU anteriores también están disponibles, y Colab, Kaggle y el TPU Research Cloud dan acceso gratuito a TPU para algunas cargas. JAX sigue siendo la vía nativa, mientras que PyTorch corre a través de PyTorch/XLA.
¿Qué alternativa a NVIDIA ejecuta código PyTorch existente con menos trabajo?
AMD Instinct, en la mayoría de los casos: ROCm es un backend de PyTorch con soporte oficial, así que la ruta de código ya existe. La TPU de Google ejecuta PyTorch a través del puente PyTorch/XLA, una capa de traducción. AWS afirma que vLLM, HuggingFace Transformers y TorchTitan corren en Trainium sin esfuerzo de portado, que es la afirmación del propio proveedor. En el otro extremo, el Sohu de Etched usa su propia pila de software especializada, así que espera bastante más trabajo de portado que con ROCm o PyTorch/XLA.
¿Por qué se llama a Broadcom y Qualcomm competidores de NVIDIA si no puedes alquilar sus chips?
Por razones distintas. Broadcom trabaja en silicio a medida para empresas que construyen sus propios aceleradores, en lugar de vender un acelerador estándar directamente a desarrolladores. Qualcomm diseña sus propios aceleradores Dragonfly, con AI200, AI250 y AI300 ya en su hoja de ruta de centro de datos, pero el acceso está orientado a empresa y no es un alquiler de nube normal de autoservicio. Ambas compiten en infraestructura de IA sin dar a los desarrolladores el mismo modelo de acceso público que NVIDIA o AMD.
¿Puedes comprar un acelerador de IA en propiedad en lugar de alquilarlo?
Sí. Tenstorrent vende tarjetas de desarrollo Blackhole directamente, desde 999 $ la p100a hasta 1.399 $ las p150a y p150b, en stock y con envío en unas dos semanas, con una pila de software totalmente de código abierto. La salvedad importa tanto como el precio: la mayor parte de la documentación y del soporte de modelos verificado sigue apuntando a la tarjeta Wormhole más antigua, así que presupuesta tiempo de portado en lugar de esperar que el código existente corra sin cambios.
Debate
Comentarios
Inicia sesión para unirte al debate.