Перейти к основному содержанию
Скидка 50% все планы, ограниченное время. Начиная от $2.48/mo
16 min left
ИИ и машинное обучение

Ведущие компании и производители ИИ-чипов: альтернативы NVIDIA, которые реально поставляются

J Автор: Jeremy 16 мин чтения
Ведущие компании ИИ-чипов: видеокарта, модуль ускорителя, кремниевая пластина и серверные платы на тёмно-красном фоне

Плату для разработчиков Tenstorrent Blackhole можно заказать уже на этой неделе. Она стоит 999 $, есть в наличии и отгружается примерно за две недели. А вот купить или арендовать Meta MTIA через публичный канал нельзя: Meta описывает MTIA как кремний, который развёртывает для собственных нагрузок.

Обе компании причисляют к ведущим производителям ИИ-чипов. Именно о разрыве между этими двумя ситуациями и пойдёт речь в статье.

Дальше разбор идёт по вендорам: что можно получить, по какому каналу и во что обойдётся софт, когда железо уже у вас.

Кратко (TL;DR)

  • Широко доступно в аренду: У AMD Instinct по-прежнему самое широкое присутствие в публичных облаках среди решений вне NVIDIA, но линейка ушла вперёд. AMD выпустила серию MI400 в июле 2026 года, тогда как системы MI300X, MI325X и серии MI350 остаются теми, что вы с наибольшей вероятностью найдёте в аренду.
  • Одно облако: TPU от Google остаются в Google Cloud, а TPU7x Ironwood общедоступен с марта 2026 года. AWS Trainium и Inferentia остаются в AWS.
  • API плюс выделенная инфраструктура: Groq, Cerebras и SambaNova предлагают размещённый инференс, но описание «только API» уже неточно. У каждого теперь есть ещё и выделенный или локальный путь.
  • Оборудование, которое можно приобрести: Tenstorrent продаёт платы Blackhole напрямую. Qualcomm предлагает свои дата-центровые ускорители Dragonfly через корпоративный канал продаж, а не только в виде анонсов дорожной карты.
  • Ограниченно или только внутри: Intel Gaudi 3 остаётся доступным в отдельных развёртываниях IBM Cloud, а Crescent Island, как ожидается, поступит на клиентское тестирование во второй половине 2026 года. Etched заявляет, что первые стойки уйдут контрактным клиентам летом 2026 года. Meta MTIA и Microsoft Maia остаются внутренними или интегрированными в Azure, а не публичными самообслуживаемыми ускорителями.

Чего эта статья не охватывает

Три темы намеренно вынесены за рамки, и каждый статус вендора ниже отражает август 2026 года.

  • Цены. Вопрос здесь в том, можете ли вы получить железо, а не в том, сколько стоит час на нём.
  • Прогнозы. Никаких заявлений о том, кто победит.
  • Потребительские и настольные карты. Речь идёт об ускорителях для дата-центров и облака.

Пять способов получить вычисления на ИИ-ускорителе

Пять уровней доступа к ИИ-ускорителям в августе 2026 года, от самого открытого к самому закрытому: много облаков для AMD Instinct, одно облако для Google TPU7x и AWS Trainium, размещённая и выделенная инфраструктура для Groq, Cerebras и SambaNova, оборудование или корпоративные продажи для Tenstorrent, Qualcomm и Etched, и только внутреннее использование для Meta MTIA и Microsoft Maia 200

Ускорители из этой статьи покрывают пять путей доступа: аренда в нескольких облаках, аренда в одном облаке, доступ через размещённый API, выделенное или напрямую покупаемое оборудование и ограниченный корпоративный доступ для продуктов без широкого самообслуживания. Некоторые компании теперь охватывают сразу несколько путей. Отдельная группа остаётся исключительно внутренней, без публичного способа арендовать или купить кремний.

Доступ — это статус, а не постоянное свойство компании. Он меняется с выходом новых поколений, когда облака добавляют или убирают железо и когда вендоры открывают или закрывают каналы закупки. Он также ничего не говорит о качестве или масштабе. Он описывает, как получить вычисления, и именно канал решает, можно ли что-то сделать с этим именем.

На NVIDIA приходится значительное большинство выручки от ИИ-ускорителей для дата-центров, она есть практически в каждом облаке, а CUDA — та поверхность, с которой сравнивают всё остальное. Прочие компании ИИ-ускорителей интересны здесь именно тем, насколько по-разному до них добраться.

Вендор и продуктУровень доступаКак получитьПрограммный стекЗадачаСтатус
NVIDIA (точка отсчёта, не альтернатива)Много облаковПочти каждый облачный провайдерCUDAОбучение и инференсОбщедоступно
AMD Instinct MI300XМного облаковVultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, CirrascaleROCmОбучение и инференсОбщедоступно
AMD Instinct MI325XМного облаковVultr, TensorWave, DigitalOceanROCmОбучение и инференсОбщедоступно
Google TPU7x (Ironwood)Одно облакоGoogle CloudJAX, а PyTorch через PyTorch/XLAОбучение и инференсОбщедоступно с 31 марта 2026 года
AWS TrainiumОдно облакоИнстансы AWS EC2 Trainium и UltraServers (Trn2, Trainium3)Neuron SDKОбучение и инференсОбщедоступно
AWS Inferentia2Одно облакоИнстансы AWS EC2 Inf2Neuron SDKИнференсОбщедоступно
Groq LPUРазмещённый API и выделенная инфраструктураGroqCloud и GroqMetalOpenAI-совместимый API и стек GroqИнференсДоступно
Cerebras WSE-3 и CS-3Размещённый API, корпоративное облако, локальноCerebras Cloud и системы CS-3Программный стек CerebrasОбучение и инференсДоступно
SambaNova SN50Размещённый API, выделенно, локальноSambaCloud и SambaRackSambaStackИнференсПоставки клиентам начинаются во второй половине 2026 года
Intel Gaudi 3Отдельные облакаОблако IBMПрограммный пакет Intel GaudiОбучение, дообучение и инференсОграниченная доступность
Tenstorrent BlackholeПокупка оборудованияНапрямую от TenstorrentОткрытый стек TT-MetaliumИнференс и работа разработчикаВ наличии, отгрузка примерно за две недели
Qualcomm AI200, AI250 и AI300Корпоративные продажиСвязаться с отделом продажПрограммный ИИ-стек QualcommИнференсAI200 ожидается в 2026 году, семплирование AI250 — в 2027 году, семплирование AI300 — в 2028 году
Etched SohuРазвёртывания по контрактуКорпоративные контрактыПрограммный стек EtchedИнференс трансформеровПервые стойки отгружаются летом 2026 года
Meta MTIAПолучить невозможноВнешнего пути нетВнутренние инструменты MetaСобственные задачи Meta по ранжированию, рекомендациям и GenAIТолько внутри
Microsoft Maia 200Внутреннее, интегрировано с AzureДата-центры MicrosoftMaia SDKИнференсРазвёрнуто внутри, без публичного самообслуживаемого инстанса

AMD Instinct — тот, который можно арендовать почти везде

У AMD Instinct самый широкий охват провайдеров среди рассмотренных здесь альтернатив NVIDIA: MI300X и MI325X доступны у нескольких облачных и необлачных провайдеров, а не привязаны к одному гиперскейлеру. AMD выпустила серию MI400 в июле 2026 года во главе с MI455X, но прежние поколения по-прежнему важны, потому что именно их вы скорее найдёте в уже развёрнутых арендных предложениях. ROCm остаётся самым коротким программным портированием в этой статье для большинства существующих нагрузок PyTorch.

Ограничение не в железе. MI300X несёт 192 ГБ HBM3 на 5,3 ТБ/с в 304 вычислительных блоках CDNA3 в модуле на 750 Вт. MI325X поднимает планку до 256 ГБ HBM3E на 6 ТБ/с и 1000 Вт, и эта ёмкость оказалась ниже 288 ГБ, о которых AMD объявляла изначально.

CUDA — это то, что считает NVIDIA, тогда как AMD считает вычислительные блоки, и одно в другое не переводится, поэтому память и пропускная способность сравниваются между вендорами куда полезнее.

Ситуация с софтом изменилась, а репутация за ней не поспевает. Поддержка PyTorch в ROCm принята в основной официальный репозиторий PyTorch, а не живёт в community-форке, и текущие релизы ROCm идут в ногу с текущими фреймворками. ROCm 7.14.0 поддерживает PyTorch 2.12, наряду с актуальными интеграциями AMD для более широкой экосистемы ИИ-софта.

Моё прочтение таково: трение, о котором до сих пор говорят, — это не пропускная способность и не поддержка фреймворков. Это археология. Когда конфигурация на CUDA ломается в три часа ночи, кто-то уже натыкался на эту строку ошибки и записал решение. На ROCm выдача поиска тоньше, так что время уходит на поиски, а не на починку. Эта цена никогда не всплывает в бенчмарке.

Работа AMD над ускорителями выходит и за пределы дата-центра, а это важно, если вам нужно дешёвое железо, чтобы изучить стек.

Демонстрация кластера из мини-ПК от AMD работает на потребительском кремнии той же самой компании.

Google TPU и AWS Trainium арендуются ровно в одном облаке каждый

TPU7x от Google и Trainium от AWS оба общедоступны и оба заперты у одного провайдера. TPU работает в Google Cloud. Trainium и Inferentia работают в AWS. Ни один не даёт мультипровайдерной переносимости AMD или NVIDIA, и это ограничение может значить больше любой отдельной характеристики.

TPU7x — первый релиз в семействе Ironwood седьмого поколения Google, ставший общедоступным 31 марта 2026 года. Google позиционирует его для крупномасштабного обучения и инференса. Trillium v6e остаётся доступным, а Ironwood остаётся текущим общедоступным поколением TPU у Google. Google также анонсировала TPU 8t и TPU 8i восьмого поколения, но оба всё ещё значатся как скоро.

Самый полезный факт о TPU не указан в спецификации. Есть бесплатный вход: Colab и Kaggle предлагают TPU-среды, а TPU Research Cloud выделяет время исследователям. Этот бесплатный вход даёт способ проверить программный путь TPU до того, как тратить облачный бюджет, хотя не стоит считать, что бесплатные сервисы дадут именно новейшее железо Ironwood.

AWS даёт доступ к собственному кремнию через инстансы Trainium и UltraServers, плюс инстансы Inf2 для Inferentia2. UltraServers на Trainium3 стали общедоступны в декабре 2025 года и масштабируются до 144 чипов против 64 у прежних UltraServers Trn2. Всё идёт через Neuron SDK. AWS подаёт стоимость портирования оптимистичнее большинства вендоров.

Страница AWS Trainium утверждает, что vLLM, HuggingFace Transformers и TorchTitan работают на Trainium нативно, без собственного кода и без усилий по портированию. Это заявление вендора о собственном продукте, а не независимо проверенный результат.

Оба варианта — часть размена, который стоит делать осознанно. Вы получаете второго поставщика кремния и теряете возможность перенести нагрузку в другое облако без переделки работы, что почти ничего не стоит команде, уже привязанной к одному провайдеру, и стоит всего команде, построенной вокруг отказа от привязки.

То, что должно поместиться в память ограничивает выбор в первую очередь: 144 ГБ на чип Trainium3 — это другая задача планирования, чем 192 ГБ у Ironwood, кто бы их ни продавал.

Groq, Cerebras и SambaNova выходят за пределы размещённых API

Groq, Cerebras и SambaNova предлагают размещённый инференс, но API больше не описывает весь доступ. Groq сочетает GroqCloud с выделенной инфраструктурой GroqMetal. Cerebras предлагает облачный доступ наряду с системами CS-3, которые можно поставить локально. SambaNova предлагает SambaCloud наряду с SambaRack и SambaStack. Различие теперь в том, сколько контроля над инфраструктурой вам нужно и как далеко вы готовы зайти в корпоративные закупки.

Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.

Собственное заявление Groq говорит, что GroqCloud продолжит работать без перерывов.

На GTC в марте 2026 года NVIDIA представила NVIDIA Groq 3 LPU внутри своей платформы Vera Rubin.

Анонс Vera Rubin от NVIDIA описывает стойку LPX из 256 процессоров LPU, доступную во второй половине 2026 года.

Cerebras идёт противоположным физическим путём: одна деталь масштаба пластины с 900 000 ядер и 44 ГБ SRAM на чипе, заявленная на 125 PFLOPs.

Страница инференса Cerebras предлагает 5 $ бесплатного кредита и описывает миграцию как всего два изменения в коде. Одно различие всё ещё важно для планирования: самообслуживаемый API — лёгкий путь для инференса, тогда как обучение, дообучение, выделенные мощности и локальные развёртывания CS-3 стоят выше по корпоративному маршруту.

Текущая аппаратная история SambaNova строится вокруг SambaRack SN50 с 16 RDU SN50 пятого поколения на стойку. SambaCloud остаётся размещённым путём, а SambaRack и SambaStack дают выделенную инфраструктуру, которая может работать локально или в размещённых средах.

Размещённый доступ по-прежнему самая простая точка входа для всех трёх, но он больше не описывает продукт целиком.

Tenstorrent продаёт оборудование, которым можно владеть

Tenstorrent — единственный вендор в этой статье, чей ускоритель вы можете купить как частное лицо, по цене, которая не превращается в инвестиционное решение.

Страница оборудования Tenstorrent указывает Blackhole p100a за 999 $, а p150a и p150b за 1 399 $, в наличии и с отгрузкой примерно за две недели. Стек полностью открытый.

Платы несут 120 ядер Tensix и 16 ядер RISC-V, с 28 ГБ GDDR6 у p100a и 32 ГБ у пары p150, потребляя до 300 Вт. У p150a и p150b есть порты Ethernet QSFP-DD, которых нет у p100a, и именно их берут, если собираются связывать платы между собой. HPCwire сообщал, что Galaxy Blackhole масштаба стойки стал общедоступен 28 апреля 2026 года от 110 000 $, а более старая линейка Wormhole остаётся в продаже, включая рабочую станцию TT-LoudBox за 12 000 $.

Оговорка весит в решении не меньше цены, и она указывает на ту самую старую карту. Большая часть документации, руководств и проверенной поддержки моделей у Tenstorrent всё ещё нацелена на Wormhole. Программная поддержка Blackhole находится раньше по циклу. Конкретно: это подходит тому, кто готов делать настоящую работу по портированию и читать исходники, когда документация заканчивается. Это не подходит тому, кто хочет, чтобы существующий код на PyTorch работал без изменений, а это совершенно разумное желание.

У Qualcomm, Intel и Etched более узкие пути доступа

Эти трое стоят за более узкими путями доступа, причём по не связанным между собой причинам. Qualcomm выстраивает многопоколенческую дорожную карту дата-центровых ускорителей вокруг корпоративных развёртываний. Intel Gaudi 3 остаётся доступным через отдельные развёртывания IBM Cloud, пока Crescent Island движется к клиентскому семплированию. Etched заявляет, что первые стойки Sohu уйдут летом 2026 года по корпоративным контрактам, а не через самообслуживаемый облачный сервис.

Дата-центровая дорожная карта Qualcomm теперь охватывает Dragonfly AI200, AI250 и только что анонсированный AI300, с ежегодным ритмом выпуска ускорителей, ориентированных на инференс. Это остаётся корпоративным путём, а не той самообслуживаемой арендой ускорителя, которую сегодня можно добавить в облачный аккаунт.

Intel — поучительный случай, потому что Gaudi 3 так и не получил широкого присутствия в облаках, но и не исчез. IBM Cloud по-прежнему предлагает профили виртуальных серверов с ускорением Gaudi 3 при ограниченной доступности, включая развёртывания в Далласе, Вашингтоне и Франкфурте. Следующий шаг Intel — Crescent Island, GPU с упором на инференс, выход которого на клиентское семплирование ожидается во второй половине 2026 года. Gaudi 3 сегодня узкий вариант, но не закрытый.

Etched строит Sohu, ASIC, специализированный на инференсе трансформеров. Компания привлекла 800 миллионов долларов, имеет работающий кремний A0, заявляет более 1 миллиарда долларов подписанных клиентских контрактов, а первые стойки должны отгрузиться летом 2026 года. Заявления о производительности принадлежат ей самой и независимо не проверялись, так что цифры пропускной способности здесь не самое полезное. Полезное — программный стек. Etched строит чип, стойку и программную среду как одну специализированную платформу, поэтому не стоит считать, что стек обслуживания эпохи CUDA перенесётся без изменений. Это может сработать для контрактного клиента, который гоняет инференс трансформеров в огромном масштабе, но это куда более крупное обязательство для команды, зависящей от переносимости между ускорителями.

Кремний только для себя и фирмы, которые делают чипы для других

Две ситуации снаружи выглядят как компания ИИ-чипов, а ведут себя совершенно по-разному. Meta и Microsoft проектируют ускорители, которые эксплуатируют сами и не продают никому. Broadcom и Marvell проектируют и реализуют кремний под архитектуры других компаний. Ни у одной из групп нет продукта, который разработчик мог бы арендовать, и причины у них не имеют ничего общего.

MTIA от Meta — самый чистый случай первого рода.

Собственный инженерный пост Meta описывает развёртывание сотен тысяч чипов MTIA для инференс-нагрузок как в органическом контенте, так и в рекламе в приложениях компании, причём MTIA 300 уже в продакшене для обучения ранжирования и рекомендаций, а MTIA 400, 450 и 500 запланированы с ритмом примерно раз в полгода. Это колоссальный объём кремния, ни одного часа которого вы никогда не арендуете.

Случай Microsoft мягче по краям. Maia 200, представленный в январе 2026 года, — текущий собственный инференс-ускоритель Microsoft, уже развёрнутый в её дата-центрах, а Maia SDK доступен в предварительной версии. Microsoft сейчас не документирует публичный самообслуживаемый инстанс Maia, так что он всё ещё относится к внутренней или интегрированной с Azure стороне этого сравнения.

Broadcom и Marvell — снова другое, и это стоит прояснить, потому что их имена постоянно всплывают рядом с NVIDIA. TPU от Google — удобный пример. Google владеет продуктом и архитектурой TPU, тогда как Broadcom вносит работу по проектированию и реализации заказного кремния, которая может включать интерконнекты, корпусирование и путь от архитектуры к производимому кремнию. Broadcom не продаёт TPU или другой универсальный ускоритель напрямую разработчикам. Выручка её ИИ-сегмента, по отчёту за первый финансовый квартал 2026 года, достигла 8,4 миллиарда долларов, плюс 106 процентов год к году, что и объясняет, почему это имя повсюду. И всё же это не чип, который можно арендовать.

Вот здесь слово «производители» начинает нести вес, который не выдерживает. Broadcom и Marvell не производят чипы, и большинство перечисленных выше производителей ИИ-чипов тоже: почти все они fabless, то есть проектируют кремний, а изготовление целиком отдают на подряд кому-то другому.

Подбор пути доступа под вашу нагрузку

Обучение в масштабе быстро сужает практический выбор: широко доступный AMD Instinct, одооблачные TPU или Trainium, либо корпоративное развёртывание Cerebras. Продакшен-инференс открывает больше путей, потому что Groq, Cerebras и SambaNova дают размещённые сервисы и при этом какую-то форму выделенной инфраструктуры. Эксперименты снова шире: от бесплатного доступа к TPU до платы Tenstorrent, которую можно поставить в свою машину.

Эти границы мягче, чем может показать таблица. Вопрос не только в том, что умеет кремний, но и в том, где вы до него дотянетесь, какая часть вашего текущего софтверного стека переживёт переезд и сможет ли получившаяся нагрузка позже уехать куда-то ещё. Cerebras умеет и обучать, и выполнять инференс на корпоративной инфраструктуре, тогда как Trainium остаётся привязанным к AWS.

Ничто из этого не смещает NVIDIA. Для большинства команд живой вопрос не в том, уходить ли с CUDA, а в том, стоит ли содержать рядом с ней второй стек.

Под какую карту рассчитывать — вот решение, которое остаётся, если вы никуда не уходите, и это уже другое упражнение, не это.

Канал решает больше, чем чип. Плата у вас на столе и тот же класс кремния за чужим API — не один и тот же инструмент, даже когда пропускная способность оказывается близкой, потому что одно позволяет пробовать то, о чём вы ещё не думали, а другое выставляет счёт за токены на то, что вы уже умеете спросить.

Часто задаваемые вопросы

Можно ли на самом деле арендовать Google TPU?

Да. TPU7x, текущий общедоступный TPU Ironwood от Google, доступен в Google Cloud и только там. Более старые поколения TPU тоже доступны, а Colab, Kaggle и TPU Research Cloud дают бесплатный доступ к TPU для части нагрузок. JAX остаётся нативным путём, а PyTorch идёт через PyTorch/XLA.

Какая альтернатива NVIDIA запускает существующий код PyTorch с наименьшими усилиями?

AMD Instinct в большинстве случаев: ROCm — официально поддерживаемый бэкенд PyTorch, так что путь в коде уже есть. TPU от Google гоняет PyTorch через мост PyTorch/XLA, слой трансляции. AWS утверждает, что vLLM, HuggingFace Transformers и TorchTitan работают на Trainium без усилий по портированию, и это заявление самого вендора. На дальнем конце Sohu от Etched использует собственный специализированный программный стек, так что работы по портированию стоит ждать заметно больше, чем с ROCm или PyTorch/XLA.

Почему Broadcom и Qualcomm называют конкурентами NVIDIA, если их чипы нельзя арендовать?

По разным причинам. Broadcom работает над заказным кремнием для компаний, строящих собственные ускорители, а не продаёт стандартный ускоритель напрямую разработчикам. Qualcomm проектирует собственные ускорители Dragonfly, и AI200, AI250 и AI300 уже в её дата-центровой дорожной карте, но доступ ориентирован на корпоративный, а не на обычную самообслуживаемую облачную аренду. Обе конкурируют в ИИ-инфраструктуре, не давая разработчикам той же модели публичного доступа, что NVIDIA или AMD.

Можно ли купить ИИ-ускоритель вместо аренды?

Да. Tenstorrent продаёт платы для разработчиков Blackhole напрямую: от 999 $ за p100a до 1 399 $ за p150a и p150b, в наличии и с отгрузкой примерно за две недели, с полностью открытым программным стеком. Оговорка весит не меньше цены: большая часть документации и проверенной поддержки моделей всё ещё нацелена на более старую плату Wormhole, так что закладывайте время на портирование, а не рассчитывайте, что существующий код заработает без изменений.

Поделиться

Обсуждение

Комментарии

Войдите, чтобы присоединиться к обсуждению.

Ещё в блоге

Читайте дальше.

Illustration for how AI job risk scores are calculated: a desk computer linked to a gauge of work-task icons and to a timeline of the same tasks
ИИ и машинное обучение

Как на самом деле считают оценки «риска потери работы из-за ИИ»

Оценки риска для профессий из-за ИИ строятся по разным методикам, от теоретической подверженности до наблюдаемого использования, и ни одна напрямую не предсказывает потерю работы.

Bruce 10 мин чтения

Готовы к развёртыванию? От $2,48/мес.

Независимое облако с 2008 года. AMD EPYC, NVMe, 40 Gbps. Возврат денег в течение 14 дней.