Плату для розробників Tenstorrent Blackhole можна замовити вже цього тижня. Вона коштує 999 $, є в наявності й вирушає приблизно за два тижні. А от купити чи орендувати Meta MTIA через публічний канал не вийде: Meta описує MTIA як кремній, який розгортає для власних навантажень.
Обидві компанії зараховують до провідних виробників ШІ-чипів. Саме про розрив між цими двома ситуаціями й ідеться в статті.
Далі розбір іде постачальник за постачальником: що можна отримати, яким каналом і у що обійдеться софт, коли залізо вже у вас.
TL;DR
- Широко доступно в оренду: AMD Instinct і далі має найширшу присутність у публічних хмарах поза NVIDIA, але лінійка пішла вперед. AMD випустила серію MI400 у липні 2026 року, тоді як системи MI300X, MI325X та серії MI350 лишаються тими, які ви найімовірніше знайдете в оренду.
- Одна хмара: TPU від Google лишаються в Google Cloud, а TPU7x Ironwood загальнодоступний із березня 2026 року. AWS Trainium та Inferentia лишаються в AWS.
- API плюс виділена інфраструктура: Groq, Cerebras і SambaNova пропонують розміщений інференс, але казати «лише API» вже неточно. Кожен тепер має ще й виділений або локальний шлях.
- Обладнання, яке можна придбати: Tenstorrent продає плати Blackhole напряму. Qualcomm подає свої дата-центрові прискорювачі Dragonfly через корпоративний канал продажів, а не лише як анонси дорожньої карти.
- Обмежено або лише всередині: Intel Gaudi 3 лишається доступним через окремі розгортання IBM Cloud, а Crescent Island, як очікується, вийде на клієнтське семплювання у другій половині 2026 року. Etched каже, що перші стійки поїдуть до контрактних клієнтів улітку 2026 року. Meta MTIA та Microsoft Maia лишаються внутрішніми або інтегрованими в Azure, а не публічними самообслуговуваними прискорювачами.
Чого ця стаття не охоплює
Три речі свідомо винесені за рамки, і кожен статус постачальника нижче відображає серпень 2026 року.
- Ціни. Питання тут у тому, чи можете ви отримати залізо, а не скільки коштує година на ньому.
- Прогнози. Жодних прогнозів щодо того, хто переможе.
- Споживчі та настільні карти. Ідеться про прискорювачі для дата-центрів і хмари.
П'ять способів отримати обчислення на ШІ-прискорювачі
Прискорювачі в цій статті охоплюють п'ять шляхів доступу: оренда в кількох хмарах, оренда через одну хмару, доступ через розміщений API, виділене або доступне для прямої купівлі обладнання та обмежений корпоративний доступ для продуктів, що не є широко самообслуговуваними. Деякі компанії тепер охоплюють кілька цих шляхів одразу. Окрема група лишається суто внутрішньою, без жодного публічного способу орендувати чи купити кремній.
Доступ — це статус, а не постійна властивість компанії. Він змінюється з виходом нових поколінь, коли хмари додають чи прибирають залізо і коли вендори відкривають чи закривають канали закупівель. Він також нічого не каже про якість чи масштаб. Він описує, як саме отримати обчислення, і саме цей канал вирішує, чи є назва чимось, із чим ви можете щось зробити.
NVIDIA тримає велику більшість виторгу від дата-центрових ШІ-прискорювачів, присутня практично в кожній хмарі, а CUDA — та поверхня, з якою порівнюють усе інше. Інші компанії ШІ-прискорювачів цікаві тут саме тим, наскільки по-різному до них дістатися.
| Постачальник і продукт | Рівень доступу | Як отримати | Програмний стек | Робочий час | Стан |
|---|---|---|---|---|---|
| NVIDIA (точка відліку, не альтернатива) | Багато хмар | Майже кожен хмарний провайдер | CUDA | Навчання та інференс | Загальнодоступно |
| AMD Instinct MI300X | Багато хмар | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | Навчання та інференс | Загальнодоступно |
| AMD Instinct MI325X | Багато хмар | Vultr, TensorWave, DigitalOcean | ROCm | Навчання та інференс | Загальнодоступно |
| Google TPU7x (Ironwood) | Одна хмара | Google Cloud | JAX, а PyTorch через PyTorch/XLA | Навчання та інференс | Загальнодоступно з 31 березня 2026 року |
| AWS Trainium | Одна хмара | Інстанси AWS EC2 Trainium та UltraServers (Trn2, Trainium3) | Neuron SDK | Навчання та інференс | Загальнодоступно |
| AWS Inferentia2 | Одна хмара | Інстанси AWS EC2 Inf2 | Neuron SDK | Інференс | Загальнодоступно |
| Groq LPU | Розміщений API та виділена інфраструктура | GroqCloud та GroqMetal | OpenAI-сумісний API та стек Groq | Інференс | Доступно |
| Cerebras WSE-3 та CS-3 | Розміщений API, корпоративна хмара, локально | Cerebras Cloud та системи CS-3 | Програмний стек Cerebras | Навчання та інференс | Доступно |
| SambaNova SN50 | Розміщений API, виділено, локально | SambaCloud та SambaRack | SambaStack | Інференс | Постачання клієнтам починаються в другій половині 2026 року |
| Intel Gaudi 3 | Окремі хмари | хмара IBM | Програмний пакет Intel Gaudi | Навчання, донавчання та інференс | Обмежена доступність |
| Tenstorrent Blackhole | Купівля обладнання | Напряму від Tenstorrent | Відкритий стек TT-Metalium | Інференс і робота розробника | Є в наявності, відвантаження приблизно за два тижні |
| Qualcomm AI200, AI250 та AI300 | Корпоративні продажі | Зв'яжіться з відділом продажів | Програмний ШІ-стек Qualcomm | Інференс | AI200 очікується у 2026 році, семплювання AI250 — у 2027 році, семплювання AI300 — у 2028 році |
| Etched Sohu | Розгортання за контрактом | Корпоративні контракти | Програмний стек Etched | Інференс трансформерів | Перші стійки відвантажують улітку 2026 року |
| Meta MTIA | Отримати неможливо | Зовнішнього шляху немає | Внутрішні інструменти Meta | Власні завдання Meta з ранжування, рекомендацій та GenAI | Лише всередині |
| Microsoft Maia 200 | Внутрішнє, інтегроване в Azure | Дата-центри Microsoft | Maia SDK | Інференс | Розгорнуто всередині, без публічного самообслуговуваного інстансу |
AMD Instinct — той, який можна орендувати майже будь-де
Серед розглянутих тут альтернатив NVIDIA саме AMD Instinct має найширше охоплення постачальників: MI300X і MI325X доступні в кількох хмарних і неохмарних провайдерів, а не прив'язані до одного гіперскейлера. AMD випустила серію MI400 у липні 2026 року на чолі з MI455X, але старіші покоління досі важливі, бо саме їх ви радше зустрінете в наявних орендних розгортаннях. ROCm лишається найкоротшим програмним портуванням у цій статті для більшості наявних навантажень PyTorch.
Обмеження не в залізі. MI300X несе 192 ГБ HBM3 на 5,3 ТБ/с у 304 обчислювальних блоках CDNA3 в модулі на 750 Вт. MI325X піднімає це до 256 ГБ HBM3E на 6 ТБ/с і 1000 Вт, і ця ємність виявилася нижчою за 288 ГБ, які AMD анонсувала спершу.
CUDA ядра — це те, що рахує NVIDIA, тоді як AMD рахує обчислювальні блоки, і одне в інше не переводиться, тому пам'ять і пропускна здатність порівнюються між вендорами куди корисніше.
Ситуація з софтом змінилася, а репутація за нею не встигає. Підтримка PyTorch у ROCm заведена в офіційний репозиторій PyTorch, а не живе в community-форку, і поточні релізи ROCm тримаються за поточними фреймворками. ROCm 7.14.0 підтримує PyTorch 2.12, поряд з актуальними інтеграціями AMD для ширшої екосистеми ШІ-софту.
Моє прочитання таке: тертя, про яке досі говорять, — це не пропускна здатність і не підтримка фреймворків. Це археологія. Коли конфігурація на CUDA ламається о третій ночі, хтось уже натрапляв на цей рядок помилки й записав рішення. На ROCm видача пошуку тонша, тож час іде на пошуки, а не на ремонт. Ця ціна ніколи не з'являється в бенчмарку.
Робота AMD над прискорювачами сягає й за межі дата-центру, а це важливо, якщо вам потрібне дешеве залізо, щоб вивчити стек.
Демонстрація кластера з міні-ПК від AMD працює на споживчому кремнії тієї ж компанії.
Google TPU та AWS Trainium орендуються рівно в одній хмарі кожен
TPU7x від Google і Trainium від AWS обидва загальнодоступні та обидва замкнені на одному провайдері. TPU працює в Google Cloud. Trainium та Inferentia працюють в AWS. Жоден не дає мультипровайдерної переносності AMD чи NVIDIA, і це обмеження може важити більше за будь-яку окрему характеристику.
TPU7x — перший реліз у родині Ironwood сьомого покоління Google, що став загальнодоступним 31 березня 2026 року. Google позиціонує його для великомасштабного навчання та інференсу. Trillium v6e лишається доступним, а Ironwood лишається поточним загальнодоступним поколінням TPU в Google. Google також анонсувала TPU 8t і TPU 8i восьмого покоління, але обидва досі значаться як незабаром.
Найкорисніший факт про TPU не вказано в специфікації. Є безкоштовний вхід: Colab і Kaggle пропонують TPU-середовища, а TPU Research Cloud виділяє час дослідникам. Цей безкоштовний вхід дає спосіб перевірити програмний шлях TPU до того, як витрачати хмарний бюджет, хоча не варто вважати, що безкоштовні сервіси нададуть саме найновіше залізо Ironwood.
AWS дає доступ до власного кремнію через інстанси Trainium та UltraServers, а також інстанси Inf2 для Inferentia2. UltraServers на Trainium3 стали загальнодоступними в грудні 2025 року й масштабуються до 144 чипів проти 64 у попередніх UltraServers Trn2. Усе йде через Neuron SDK. AWS подає вартість портування оптимістичніше за більшість вендорів.
Сторінка AWS Trainium стверджує, що vLLM, HuggingFace Transformers і TorchTitan працюють на Trainium нативно, без власного коду й без зусиль на портування. Це заява вендора про власний продукт, а не незалежно перевірений результат.
Обидва варіанти — частина розміну, який варто робити свідомо. Ви отримуєте другого постачальника кремнію і втрачаєте змогу перенести це навантаження в іншу хмару без переробки, що майже нічого не коштує команді, яка вже прив'язана до одного провайдера, і коштує всього команді, збудованій навколо уникнення прив'язки.
Те, що має вміститися в пам'ять обмежує вибір насамперед: 144 ГБ на чип Trainium3 — це інша задача планування, ніж 192 ГБ в Ironwood, хто б їх не продавав.
Groq, Cerebras і SambaNova виходять за межі розміщених API
Groq, Cerebras і SambaNova пропонують розміщений інференс, але API вже не описує весь доступ. Groq поєднує GroqCloud із виділеною інфраструктурою GroqMetal. Cerebras пропонує хмарний доступ поряд із системами CS-3, які можна поставити локально. SambaNova пропонує SambaCloud поряд із SambaRack і SambaStack. Різниця тепер у тому, скільки контролю над інфраструктурою вам потрібно і як далеко ви готові зайти в корпоративні закупівлі.
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
Власна заява Groq каже, що GroqCloud продовжить працювати без перерв.
На GTC у березні 2026 року NVIDIA представила NVIDIA Groq 3 LPU всередині своєї платформи Vera Rubin.
Анонс Vera Rubin від NVIDIA описує стійку LPX із 256 процесорів LPU, доступну в другій половині 2026 року.
Cerebras іде протилежним фізичним шляхом: одна деталь масштабу пластини з 900 000 ядер і 44 ГБ SRAM на чипі, заявлена на 125 PFLOPs.
Сторінка інференсу Cerebras пропонує 5 $ безкоштовного кредиту й описує міграцію як лише дві зміни в коді. Одна відмінність усе ще важлива для планування: самообслуговуваний API — легкий шлях для інференсу, тоді як навчання, донавчання, виділені потужності та локальні розгортання CS-3 стоять далі корпоративним маршрутом.
Поточна апаратна історія SambaNova крутиться навколо SambaRack SN50, побудованого на 16 RDU SN50 п'ятого покоління на стійку. SambaCloud лишається розміщеним шляхом, а SambaRack і SambaStack дають виділену інфраструктуру, яка може працювати локально або в розміщених середовищах.
Розміщений доступ і далі найпростіша точка входу для всіх трьох, але він більше не описує продукт цілком.
Tenstorrent продає обладнання, яким можна володіти
Tenstorrent — єдиний вендор у цій статті, чий прискорювач ви можете купити як приватна особа, за ціною, що не перетворюється на інвестиційне рішення.
Сторінка обладнання Tenstorrent вказує Blackhole p100a за 999 $, а p150a та p150b за 1 399 $, у наявності та з відвантаженням приблизно за два тижні. Стек повністю відкритий.
Плати несуть 120 ядер Tensix і 16 ядер RISC-V, з 28 ГБ GDDR6 у p100a та 32 ГБ у пари p150, споживаючи до 300 Вт. У p150a та p150b є порти Ethernet QSFP-DD, яких немає в p100a, і саме їх беруть, якщо планують зв'язувати плати між собою. HPCwire повідомляв, що Galaxy Blackhole масштабу стійки став загальнодоступним 28 квітня 2026 року від 110 000 $, а старіша лінійка Wormhole лишається в продажу, включно з робочою станцією TT-LoudBox за 12 000 $.
Ця засторога важить для рішення не менше за ціну, і вона вказує саме на ту старішу карту. Більшість документації, посібників і перевіреної підтримки моделей у Tenstorrent досі націлена на Wormhole. Програмна підтримка Blackhole перебуває раніше у своєму циклі. Конкретно: це підходить тому, хто готовий робити справжню роботу з портування й читати вихідники, коли документація закінчується. Це не підходить тому, хто хоче, щоб наявний код на PyTorch працював без змін, а це цілком розумне бажання.
У Qualcomm, Intel та Etched вужчі шляхи доступу
Ця трійця стоїть за вужчими шляхами доступу, і причини в кожного свої. Qualcomm вибудовує багатопоколінну дорожню карту дата-центрових прискорювачів навколо корпоративних розгортань. Intel Gaudi 3 лишається доступним через окремі розгортання IBM Cloud, поки Crescent Island рухається до клієнтського семплювання. Etched каже, що перші стійки Sohu поїдуть улітку 2026 року за корпоративними контрактами, а не через самообслуговуваний хмарний сервіс.
Дата-центрова дорожня карта Qualcomm тепер охоплює Dragonfly AI200, AI250 та щойно анонсований AI300, із щорічним ритмом випуску прискорювачів, орієнтованих на інференс. Це лишається корпоративним шляхом, а не тією самообслуговуваною орендою прискорювача, яку сьогодні можна додати до хмарного акаунта.
Intel — повчальний випадок, бо Gaudi 3 так і не здобув широкої хмарної присутності, але й не зник. IBM Cloud досі пропонує профілі віртуальних серверів із прискоренням Gaudi 3 за обмеженої доступності, включно з розгортаннями в Далласі, Вашингтоні та Франкфурті. Наступний крок Intel — Crescent Island, орієнтований на інференс GPU, вихід якого на клієнтське семплювання очікується в другій половині 2026 року. Gaudi 3 сьогодні вузький варіант, але не закритий.
Etched будує Sohu, ASIC, спеціалізований на інференсі трансформерів. Компанія залучила 800 мільйонів доларів, має робочий кремній A0, повідомляє про понад 1 мільярд доларів підписаних клієнтських контрактів, а перші стійки мають відвантажити влітку 2026 року. Заяви про продуктивність належать їй самій і незалежно не вимірювалися, тож цифри пропускної здатності тут не найкорисніша частина. Корисна частина — програмний стек. Etched будує чип, стійку та програмне середовище як одну спеціалізовану платформу, тож не варто вважати, що стек обслуговування епохи CUDA перенесеться без змін. Це може спрацювати для контрактного клієнта, який жене інференс трансформерів у величезному масштабі, але це значно більше зобов'язання для команди, що залежить від переносності між прискорювачами.
Кремній лише для себе та фірми, що роблять чипи для інших
Дві ситуації ззовні виглядають як компанія ШІ-чипів, а поводяться зовсім по-різному. Meta та Microsoft проєктують прискорювачі, які самі й експлуатують і нікому не продають. Broadcom і Marvell проєктують та реалізують кремній під архітектури інших компаній. У жодної з груп немає продукту, який розробник міг би орендувати, і причини в них не мають нічого спільного.
MTIA від Meta — найчистіший випадок першого роду.
Власний інженерний допис Meta описує розгортання сотень тисяч чипів MTIA для інференс-навантажень як в органічному контенті, так і в рекламі в застосунках компанії, причому MTIA 300 уже в продакшені для навчання ранжування та рекомендацій, а MTIA 400, 450 і 500 заплановані з ритмом приблизно раз на пів року. Це колосальний обсяг кремнію, жодної години якого ви ніколи не орендуєте.
Випадок Microsoft м'якший по краях. Maia 200, представлена в січні 2026 року, — поточний власний інференс-прискорювач Microsoft, уже розгорнутий у її дата-центрах, а Maia SDK доступний у передперегляді. Microsoft наразі не документує публічний самообслуговуваний інстанс Maia, тож у цьому порівнянні він і далі належить до внутрішнього або інтегрованого в Azure боку.
Broadcom і Marvell — знову інше, і це варто прояснити, бо їхні назви постійно з'являються поруч із NVIDIA. TPU від Google — зручний приклад. Google володіє продуктом і архітектурою TPU, тоді як Broadcom додає роботу з проєктування та реалізації замовного кремнію, яка може охоплювати інтерконекти, корпусування і шлях від архітектури до придатного до виробництва кремнію. Broadcom не продає TPU чи інший універсальний прискорювач напряму розробникам. Виторг її ШІ-сегмента за результатами першого фінансового кварталу 2026 року сягнув 8,4 мільярда доларів, на 106 відсотків більше рік до року, що й пояснює, чому ця назва всюди. Це все одно не чип, який можна орендувати.
І саме тут слово «виробники» починає нести вагу, якої не витримує. Broadcom і Marvell не виробляють чипи, і більшість перелічених вище виробників ШІ-чипів теж: майже всі вони fabless, тобто проєктують кремній, а виготовлення цілком віддають на підряд комусь іншому.
Добір шляху доступу під ваше навантаження
Навчання в масштабі швидко звужує практичний вибір: широко доступний AMD Instinct, однохмарні TPU чи Trainium, або корпоративне розгортання Cerebras. Продакшен-інференс відкриває більше шляхів, бо Groq, Cerebras і SambaNova дають розміщені сервіси й водночас якусь форму виділеної інфраструктури. Експерименти знову ширші: від безкоштовного доступу до TPU до плати Tenstorrent, яку можна поставити у власну машину.
Ці межі м'якші, ніж може показати таблиця. Питання не лише в тому, що вміє кремній, а й у тому, де ви до нього дотягнетеся, яка частина вашого наявного програмного стека переживе переїзд і чи зможе отримане навантаження згодом переїхати кудись іще. Cerebras уміє і навчати, і виконувати інференс на корпоративній інфраструктурі, тоді як Trainium лишається прив'язаним до AWS.
Ніщо з цього не зсуває NVIDIA. Для більшості команд живе питання не в тому, чи йти з CUDA, а в тому, чи варто тримати поряд другий стек.
Під яку карту розраховувати — ось рішення, яке лишається, якщо ви нікуди не йдете, і це вже інша вправа, не ця.
Канал вирішує більше, ніж чип. Плата у вас на столі й той самий клас кремнію за чужим API — не той самий інструмент, навіть коли пропускна здатність виходить близькою, бо одне дає пробувати те, про що ви ще не подумали, а інше виставляє рахунок за токени на те, що ви вже вмієте спитати.
Часті запитання
Чи справді можна орендувати Google TPU?
Так. TPU7x, поточний загальнодоступний TPU Ironwood від Google, є в Google Cloud і тільки там. Старіші покоління TPU теж доступні, а Colab, Kaggle і TPU Research Cloud дають безкоштовний доступ до TPU для частини навантажень. JAX лишається нативним шляхом, а PyTorch іде через PyTorch/XLA.
Яка альтернатива NVIDIA запускає наявний код PyTorch із найменшими зусиллями?
У більшості випадків AMD Instinct: ROCm — офіційно підтримуваний бекенд PyTorch, тож шлях у коді вже існує. TPU від Google ганяє PyTorch через міст PyTorch/XLA, шар трансляції. AWS стверджує, що vLLM, HuggingFace Transformers і TorchTitan працюють на Trainium без зусиль на портування, і це заява самого вендора. На дальньому кінці Sohu від Etched використовує власний спеціалізований програмний стек, тож роботи з портування варто чекати помітно більше, ніж із ROCm чи PyTorch/XLA.
Чому Broadcom і Qualcomm називають конкурентами NVIDIA, якщо їхні чипи не можна орендувати?
З різних причин. Broadcom працює над замовним кремнієм для компаній, які будують власні прискорювачі, замість продавати стандартний прискорювач напряму розробникам. Qualcomm проєктує власні прискорювачі Dragonfly, і AI200, AI250 та AI300 уже є в її дата-центровій дорожній карті, але доступ орієнтований на корпоративний, а не на звичайну самообслуговувану хмарну оренду. Обидві конкурують в ШІ-інфраструктурі, не даючи розробникам тієї самої моделі публічного доступу, що NVIDIA чи AMD.
Чи можна купити ШІ-прискорювач замість оренди?
Так. Tenstorrent продає плати для розробників Blackhole напряму: від 999 $ за p100a до 1 399 $ за p150a та p150b, у наявності й з відвантаженням приблизно за два тижні, з повністю відкритим програмним стеком. Засторога важить не менше за ціну: більшість документації та перевіреної підтримки моделей досі націлена на старішу плату Wormhole, тож закладайте час на портування, а не розраховуйте, що наявний код запрацює без змін.
Обговорення
Коментарі
Увійдіть, щоб долучитися до обговорення.