본문으로 건너뛰기
50% 할인 모든 플랜, 기간 한정. 시작 가격 $2.48/mo
16 min left
AI 및 머신러닝

주요 AI 칩 기업과 제조사: 실제로 출하되는 NVIDIA 대안들

J 작성자 Jeremy 16 분 분량
주요 AI 칩 기업: 어두운 붉은 배경에 놓인 그래픽 카드와 가속기 모듈, 실리콘 웨이퍼, 서버 보드

이번 주에 Tenstorrent Blackhole 개발자 카드를 주문할 수 있습니다. 가격은 999달러이고 재고가 있으며 약 2주 안에 배송됩니다. 반면 Meta MTIA는 공개 채널로 구매하거나 대여할 수 없습니다. Meta는 MTIA를 자사 워크로드용으로 배포하는 실리콘이라고 설명합니다.

두 회사 모두 주요 AI 칩 기업으로 꼽힙니다. 이 글이 다루는 것은 그 두 상황 사이의 거리입니다.

이제부터는 공급업체별로 살펴봅니다. 무엇을 얻을 수 있는지, 어떤 경로로 얻는지, 그리고 확보한 뒤 소프트웨어에 드는 비용은 얼마인지입니다.

요약

  • 널리 대여 가능: AMD Instinct는 여전히 NVIDIA를 제외하면 가장 넓은 퍼블릭 클라우드 기반을 갖고 있지만, 제품군은 그 사이 앞으로 나아갔습니다. AMD는 2026년 7월에 MI400 시리즈를 출시했고, 그럼에도 대여로 만날 가능성이 가장 높은 것은 여전히 MI300X, MI325X, MI350 시리즈 시스템입니다.
  • 단일 클라우드: Google의 TPU는 Google Cloud에 머물러 있으며, TPU7x Ironwood는 2026년 3월부터 정식 출시되었습니다. AWS Trainium과 Inferentia는 AWS에 머무릅니다.
  • API와 전용 인프라: Groq, Cerebras, SambaNova는 모두 호스팅 추론을 제공하지만, 이제 API 전용이라는 설명은 정확하지 않습니다. 세 곳 모두 전용 또는 온프레미스 경로도 갖추고 있습니다.
  • 조달할 수 있는 하드웨어: Tenstorrent는 Blackhole 카드를 직접 판매합니다. Qualcomm은 Dragonfly 데이터센터 가속기를 로드맵 발표에만 그치지 않고 기업 영업 문의 경로를 통해 제공합니다.
  • 제한적이거나 내부용: Intel Gaudi 3는 일부 IBM Cloud 배포를 통해 계속 이용할 수 있고, Crescent Island는 2026년 하반기에 고객 샘플링에 들어갈 것으로 예상됩니다. Etched는 첫 랙이 2026년 여름에 계약 고객에게 출하된다고 밝혔습니다. Meta MTIA와 Microsoft Maia는 공개 셀프서비스 가속기가 아니라 내부용 또는 Azure 통합형으로 남아 있습니다.

이 글이 다루지 않는 것

세 가지는 의도적으로 논의 범위 밖에 두었으며, 아래의 모든 공급업체 상태는 2026년 8월 기준입니다.

  • 가격. 여기서 다루는 질문은 하드웨어를 구할 수 있느냐이지, 한 시간 사용료가 얼마냐가 아닙니다.
  • 예측. 누가 이길지에 대한 전망은 없습니다.
  • 소비자용 및 데스크톱 카드. 다루는 대상은 데이터센터와 클라우드 가속기입니다.

AI 가속기에서 컴퓨팅을 확보하는 다섯 가지 방법

2026년 8월 기준 AI 가속기의 다섯 가지 접근 등급으로, 가장 개방적인 쪽에서 가장 제한적인 쪽으로 이어집니다. AMD Instinct는 다수 클라우드, Google TPU7x와 AWS Trainium은 단일 클라우드, Groq와 Cerebras와 SambaNova는 호스팅 및 전용 인프라, Tenstorrent와 Qualcomm과 Etched는 하드웨어 또는 기업 영업, Meta MTIA와 Microsoft Maia 200은 내부 전용입니다

이 글에서 다루는 가속기는 다섯 가지 접근 경로로 나뉩니다. 여러 클라우드를 통한 대여, 단일 클라우드를 통한 대여, 호스팅 API 접근, 전용이거나 직접 구매할 수 있는 하드웨어, 그리고 폭넓은 셀프서비스가 아닌 제품을 위한 제한적 기업 접근입니다. 이제 일부 기업은 이 중 여러 경로에 걸쳐 있습니다. 별도의 한 무리는 여전히 내부 전용이며, 실리콘을 대여하거나 구매할 공개 경로가 아예 없습니다.

접근성은 상태이지, 회사의 영구적인 속성이 아닙니다. 새 세대가 출시되고, 클라우드가 하드웨어를 추가하거나 내리고, 공급업체가 조달 경로를 열거나 닫으면서 바뀝니다. 또한 품질이나 규모에 대해서는 아무것도 말해주지 않습니다. 접근성은 컴퓨팅을 어떻게 확보하는지를 설명하며, 어떤 이름이 실제로 행동에 옮길 수 있는 선택지인지를 결정하는 것은 바로 그 경로입니다.

NVIDIA는 데이터센터 AI 가속기 매출의 큰 다수를 차지하고 있고, 사실상 모든 클라우드에 올라가 있으며, CUDA는 나머지 전부가 비교당하는 기준면입니다. 여기 등장하는 다른 AI 가속기 기업들이 흥미로운 이유는 각각에 도달하는 방식이 그만큼 다르기 때문입니다.

공급업체와 제품접근 등급확보 방법소프트웨어 스택작업 부하상태
NVIDIA (기준점, 대안이 아님)다수 클라우드거의 모든 클라우드 제공업체CUDA학습과 추론정식 출시
AMD Instinct MI300X다수 클라우드Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, CirrascaleROCm학습과 추론정식 출시
AMD Instinct MI325X다수 클라우드Vultr, TensorWave, DigitalOceanROCm학습과 추론정식 출시
Google TPU7x (Ironwood)단일 클라우드Google CloudJAX, 그리고 PyTorch/XLA를 통한 PyTorch학습과 추론2026년 3월 31일부터 정식 출시
AWS Trainium단일 클라우드AWS EC2 Trainium 인스턴스와 UltraServers (Trn2, Trainium3)Neuron SDK학습과 추론정식 출시
AWS Inferentia2단일 클라우드AWS EC2 Inf2 인스턴스Neuron SDK추론정식 출시
Groq LPU호스팅 API와 전용 인프라GroqCloud와 GroqMetalOpenAI 호환 API와 Groq 스택추론제공 중
Cerebras WSE-3와 CS-3호스팅 API, 엔터프라이즈 클라우드, 온프레미스Cerebras Cloud와 CS-3 시스템Cerebras 소프트웨어 스택학습과 추론제공 중
SambaNova SN50호스팅 API, 전용, 온프레미스SambaCloud와 SambaRackSambaStack추론고객 출하는 2026년 하반기에 시작
Intel Gaudi 3일부 클라우드IBM 클라우드Intel Gaudi 소프트웨어 제품군학습, 파인튜닝, 추론제한적 제공
Tenstorrent Blackhole하드웨어 구매Tenstorrent에서 직접오픈소스 TT-Metalium 스택추론과 개발 작업재고 있음, 약 2주 안에 배송
Qualcomm AI200, AI250, AI300기업 영업영업팀 문의Qualcomm AI 소프트웨어 스택추론AI200은 2026년 예정, AI250 샘플링은 2027년 예정, AI300 샘플링은 2028년 예정
Etched Sohu계약 기반 배포기업 계약Etched 소프트웨어 스택트랜스포머 추론첫 랙은 2026년 여름에 출하
Meta MTIA입수 불가외부 경로 없음Meta 내부 도구Meta 자체의 랭킹, 추천, GenAI 작업내부 전용
Microsoft Maia 200내부용, Azure 통합Microsoft 데이터센터Maia SDK추론내부 배포, 공개 셀프서비스 인스턴스 없음

거의 어디서나 빌릴 수 있는 쪽은 AMD Instinct입니다

여기 나온 NVIDIA 대안 가운데 공급자 저변이 가장 넓은 쪽은 AMD Instinct입니다. MI300X와 MI325X는 하나의 하이퍼스케일러에 묶여 있지 않고 여러 클라우드 및 네오클라우드 제공업체에서 이용할 수 있습니다. AMD는 2026년 7월 MI455X를 앞세워 MI400 시리즈를 내놓았지만, 기존 대여 환경에서 실제로 마주칠 가능성이 더 높은 것은 여전히 이전 세대입니다. ROCm은 기존 PyTorch 워크로드 대부분에 대해 이 글에서 가장 짧은 소프트웨어 이식 경로로 남아 있습니다.

제약은 하드웨어가 아닙니다. MI300X는 750W 모듈 안에서 304개의 CDNA3 컴퓨트 유닛에 걸쳐 5.3 TB/s의 HBM3 192GB를 담고 있습니다. MI325X는 이를 6 TB/s의 HBM3E 256GB와 1000W로 끌어올렸는데, 이 용량은 AMD가 처음 발표했던 288GB보다 낮게 확정된 값입니다.

CUDA 코어 는 NVIDIA가 세는 단위이고, AMD는 컴퓨트 유닛을 세는데, 이 둘은 서로 환산되지 않습니다. 그래서 업체를 가로질러 비교할 때는 메모리와 대역폭이 더 쓸모 있습니다.

소프트웨어 상황은 바뀌었는데 평판이 그것을 못 따라갑니다. ROCm의 PyTorch 지원은 커뮤니티 포크에 머무르지 않고 공식 PyTorch 저장소에 업스트림되어 있으며, 최신 ROCm 릴리스는 최신 프레임워크를 따라갑니다. ROCm 7.14.0은 PyTorch 2.12를 지원하며, 더 넓은 AI 소프트웨어 생태계를 위한 AMD의 현행 통합도 함께 제공됩니다.

제 해석은 이렇습니다. 사람들이 여전히 말하는 마찰은 처리량도, 프레임워크 지원도 아닙니다. 그것은 고고학입니다. CUDA 환경이 새벽 세 시에 깨지면, 누군가는 이미 그 에러 문자열을 만났고 해결책을 적어 두었습니다. ROCm에서는 검색 결과가 더 얇아서, 시간이 고치는 데가 아니라 찾는 데 들어갑니다. 그 비용은 벤치마크에 결코 나타나지 않습니다.

AMD의 가속기 작업은 데이터센터 바깥까지 뻗어 있는데, 스택을 익힐 값싼 하드웨어를 원한다면 이 점이 중요합니다.

AMD의 미니 PC 클러스터 데모 는 같은 회사의 소비자용 실리콘 위에서 돌아갑니다.

Google TPU와 AWS Trainium은 각각 정확히 하나의 클라우드에서만 빌릴 수 있습니다

Google의 TPU7x와 AWS의 Trainium은 둘 다 정식 출시되었고, 둘 다 단일 제공업체에 묶여 있습니다. TPU는 Google Cloud에서 돌아갑니다. Trainium과 Inferentia는 AWS에서 돌아갑니다. 어느 쪽도 AMD나 NVIDIA가 주는 다중 제공업체 이식성을 주지 않으며, 이 제약은 개별 사양 어느 것보다 크게 작용할 수 있습니다.

TPU7x는 Google의 7세대 Ironwood 제품군의 첫 릴리스이며 2026년 3월 31일에 정식 출시되었습니다. Google은 이를 대규모 학습과 추론용으로 자리매김하고 있습니다. Trillium v6e는 계속 제공되며, Ironwood는 Google의 현행 정식 출시 TPU 세대로 남아 있습니다. Google은 8세대 TPU 8t와 TPU 8i도 발표했지만, 둘 다 아직 출시 예정으로 표기되어 있습니다.

TPU에 관한 가장 유용한 사실은 사양표에 없습니다. 무료 진입로가 있습니다. Colab과 Kaggle 모두 TPU 런타임을 제공하고, TPU Research Cloud는 연구자에게 사용 시간을 지원합니다. 이 무료 진입로 덕분에 클라우드 예산을 쓰기 전에 TPU 소프트웨어 경로를 시험해 볼 수 있습니다. 다만 무료 서비스가 특히 최신 Ironwood 하드웨어를 제공한다고 가정해서는 안 됩니다.

AWS는 Trainium 인스턴스와 UltraServers, 그리고 Inferentia2용 Inf2 인스턴스를 통해 자체 실리콘에 접근합니다. Trainium3 UltraServers는 2025년 12월에 정식 출시되었고, 이전 Trn2 UltraServers의 64개에서 늘어나 144개 칩까지 확장됩니다. 모든 것은 Neuron SDK를 거칩니다. AWS는 이식 비용을 대다수 공급업체보다 낙관적으로 표현합니다.

AWS Trainium 페이지 는 vLLM, HuggingFace Transformers, TorchTitan이 별도 코드나 이식 작업 없이 Trainium에서 네이티브로 실행된다고 밝힙니다. 이는 자사 제품에 대한 공급업체의 주장이지, 독립적으로 검증된 결과가 아닙니다.

둘 다 의식적으로 감수할 만한 맞바꿈 안에 있습니다. 두 번째 실리콘 공급원을 얻는 대신, 그 워크로드를 작업을 다시 하지 않고 다른 클라우드로 옮길 능력을 잃습니다. 이미 한 제공업체에 묶인 팀에게는 이 비용이 거의 없지만, 묶이지 않는 것을 축으로 설계된 팀에게는 전부입니다.

메모리에 들어가야 하는 것 이 선택을 가장 먼저 제약합니다. Trainium3 칩당 144GB는 누가 파는지와 무관하게 Ironwood의 192GB와는 다른 설계 문제입니다.

Groq, Cerebras, SambaNova는 호스팅 API 너머로 나아갑니다

Groq, Cerebras, SambaNova는 모두 호스팅 추론을 제공하지만, 이제 API가 접근 이야기의 전부는 아닙니다. Groq은 GroqCloud를 전용 GroqMetal 인프라와 짝지웁니다. Cerebras는 온프레미스로 돌릴 수 있는 CS-3 시스템과 함께 클라우드 접근을 제공합니다. SambaNova는 SambaRack, SambaStack과 함께 SambaCloud를 제공합니다. 이제 갈리는 지점은 인프라 통제권이 얼마나 필요한지, 그리고 기업 조달 절차를 어디까지 감당할 의향이 있는지입니다.

Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.

Groq의 자체 공지 는 GroqCloud가 중단 없이 계속 운영될 것이라고 밝힙니다.

2026년 3월 GTC에서 NVIDIA는 자사 Vera Rubin 플랫폼 안에 들어가는 NVIDIA Groq 3 LPU를 공개했습니다.

NVIDIA의 Vera Rubin 발표 는 256개의 LPU 프로세서로 구성된 LPX 랙을 설명하며, 2026년 하반기에 제공됩니다.

Cerebras는 물리적으로 정반대 접근을 택합니다. 90만 개의 코어와 44GB의 온칩 SRAM을 담은 웨이퍼 규모의 단일 부품으로, 125 PFLOPs로 표기됩니다.

Cerebras의 추론 페이지 는 5달러의 무료 크레딧을 제공하고 마이그레이션을 코드 두 군데만 바꾸면 된다고 설명합니다. 계획을 세울 때 여전히 중요한 구분이 하나 있습니다. 셀프서비스 API는 쉬운 추론 경로이지만, 학습과 파인튜닝, 전용 용량, 온프레미스 CS-3 배포는 기업 경로의 더 위쪽에 있습니다.

SambaNova의 현재 하드웨어 이야기는 랙당 5세대 SN50 RDU 16개로 구성된 SambaRack SN50을 중심으로 돕니다. SambaCloud는 호스팅 경로로 남아 있고, SambaRack과 SambaStack은 온프레미스나 호스팅 환경에서 돌릴 수 있는 전용 인프라를 제공합니다.

호스팅 접근은 세 곳 모두에게 여전히 가장 쉬운 진입점이지만, 이제 제품 전체를 설명하지는 못합니다.

Tenstorrent는 소유할 수 있는 하드웨어를 판매합니다

Tenstorrent는 이 글에서 개인이 가속기를 그대로 구매할 수 있는 유일한 공급업체이며, 그 가격은 자본 지출을 고민할 수준이 아닙니다.

Tenstorrent의 하드웨어 페이지 는 Blackhole p100a를 999달러, p150a와 p150b를 1,399달러로 표시하며, 재고가 있고 약 2주 안에 배송됩니다. 소프트웨어 스택은 전부 오픈소스입니다.

카드에는 120개의 Tensix 코어와 16개의 RISC-V 코어가 들어 있고, p100a에는 28GB, p150 두 모델에는 32GB의 GDDR6가 실려 있으며 최대 300W를 씁니다. p150a와 p150b에는 p100a에 없는 QSFP-DD 이더넷 포트가 추가되는데, 카드를 서로 연결할 생각이라면 이쪽을 사게 됩니다. HPCwire는 랙 규모의 Galaxy Blackhole이 2026년 4월 28일에 11만 달러부터 정식 출시되었다고 보도했으며, 구형 Wormhole 라인도 1만 2천 달러짜리 TT-LoudBox 워크스테이션을 포함해 계속 판매되고 있습니다.

이 단서 조항은 가격만큼이나 결정에 영향을 주며, 바로 그 구형 카드를 가리킵니다. Tenstorrent의 문서와 튜토리얼, 검증된 모델 지원 대부분은 여전히 Wormhole을 대상으로 합니다. Blackhole의 소프트웨어 지원은 아직 주기의 앞쪽에 있습니다. 구체적으로 말하면, 이는 실제 이식 작업을 감수하고 문서가 끊긴 지점에서 소스를 읽을 사람에게 맞습니다. 기존 PyTorch 코드가 수정 없이 돌아가기를 바라는 사람에게는 맞지 않는데, 그건 지극히 합리적인 바람입니다.

Qualcomm, Intel, Etched는 접근 경로가 더 좁습니다

이 셋은 서로 무관한 이유로 더 좁은 접근 경로 뒤에 있습니다. Qualcomm은 기업 배포를 축으로 여러 세대에 걸친 데이터센터 가속기 로드맵을 구축하고 있습니다. Intel Gaudi 3는 일부 IBM Cloud 배포를 통해 계속 이용할 수 있고, 그동안 Crescent Island는 고객 샘플링을 향해 나아가고 있습니다. Etched는 첫 Sohu 랙이 2026년 여름에 셀프서비스 클라우드가 아니라 기업 계약을 통해 출하된다고 밝혔습니다.

Qualcomm의 데이터센터 로드맵은 이제 Dragonfly AI200, AI250, 그리고 새로 발표된 AI300까지 아우르며, 추론에 초점을 맞춘 연간 가속기 주기를 따릅니다. 이는 오늘 클라우드 계정에 바로 추가할 수 있는 셀프서비스 가속기 대여가 아니라, 여전히 기업 지향적인 경로입니다.

Intel이 배울 점이 많은 사례인 이유는, Gaudi 3가 넓은 클라우드 저변을 끝내 얻지 못했지만 사라지지도 않았기 때문입니다. IBM Cloud는 여전히 제한적 제공 형태로 Gaudi 3 가속 가상 서버 프로필을 제공하며, 댈러스와 워싱턴 DC, 프랑크푸르트 배포가 여기 포함됩니다. Intel의 다음 수순은 Crescent Island로, 추론에 초점을 둔 GPU이며 2026년 하반기에 고객 샘플링에 들어갈 것으로 예상됩니다. Gaudi 3는 오늘 기준 좁은 선택지이지, 끝난 선택지가 아닙니다.

Etched는 트랜스포머 추론에 특화된 ASIC인 Sohu를 만들고 있습니다. 이 회사는 8억 달러를 조달했고, 동작하는 A0 실리콘을 갖고 있으며, 10억 달러가 넘는 체결 고객 계약을 보고했고, 첫 랙은 2026년 여름에 출하될 예정입니다. 성능 주장은 자체적인 것이고 독립적으로 벤치마크되지 않았으므로, 처리량 수치는 여기서 쓸모 있는 부분이 아닙니다. 쓸모 있는 부분은 소프트웨어 스택입니다. Etched는 칩과 랙, 소프트웨어 환경을 하나의 특화된 플랫폼으로 만들고 있으므로, CUDA 시대의 서빙 스택이 그대로 옮겨간다고 가정해서는 안 됩니다. 엄청난 규모로 트랜스포머 추론을 돌리는 계약 고객에게는 통할 수 있지만, 가속기 이식성에 기대는 팀에게는 훨씬 큰 약속입니다.

내부 전용 실리콘과 남을 위해 칩을 만드는 회사들

겉에서 보면 AI 칩 기업처럼 보이지만 실제 행동은 전혀 다른 두 가지 상황이 있습니다. Meta와 Microsoft는 자기들이 직접 운영하고 아무에게도 팔지 않는 가속기를 설계합니다. Broadcom과 Marvell은 다른 회사의 아키텍처를 위해 실리콘을 설계하고 구현합니다. 두 부류 모두 개발자가 빌릴 수 있는 제품은 없지만, 그 이유에는 공통점이 전혀 없습니다.

Meta의 MTIA는 첫 번째 유형의 가장 명확한 사례입니다.

Meta의 자체 엔지니어링 게시글 은 자사 앱의 오가닉 콘텐츠와 광고 양쪽에 걸친 추론 워크로드를 위해 수십만 개의 MTIA 칩을 배포했다고 설명하며, MTIA 300은 이미 랭킹과 추천 학습에 투입되어 있고 MTIA 400, 450, 500은 약 6개월 주기로 계획되어 있다고 밝힙니다. 이는 여러분이 단 한 시간도 빌릴 수 없는 엄청난 양의 실리콘입니다.

Microsoft의 경우는 가장자리가 조금 더 부드럽습니다. 2026년 1월에 공개된 Maia 200은 Microsoft의 현행 자체 추론 가속기이며 이미 자사 데이터센터에 배포되어 있고, Maia SDK는 미리보기로 제공됩니다. Microsoft는 현재 공개 셀프서비스 Maia 인스턴스를 문서화하지 않으므로, 이 비교에서는 여전히 내부용 또는 Azure 통합 쪽에 속합니다.

Broadcom과 Marvell은 또 다른 부류인데, 이들 이름이 NVIDIA 옆에 늘 등장하기 때문에 정리해 둘 가치가 있습니다. Google의 TPU가 좋은 예입니다. TPU 제품과 아키텍처는 Google의 것이고, Broadcom은 인터커넥트와 패키징, 아키텍처에서 양산 가능한 실리콘까지 가는 경로를 포함할 수 있는 맞춤형 실리콘 설계와 구현 작업을 보탭니다. Broadcom은 TPU도, 다른 범용 가속기도 개발자에게 직접 팔지 않습니다. 2026 회계연도 1분기 실적으로 보고된 AI 부문 매출은 84억 달러로 전년 대비 106퍼센트 늘었고, 이것이 그 이름이 어디에나 등장하는 이유입니다. 그래도 여러분이 빌릴 수 있는 칩은 아닙니다.

바로 이 지점에서 제조사라는 말이 감당할 수 없는 무게를 지기 시작합니다. Broadcom과 Marvell은 칩을 제조하지 않고, 위에 나열된 AI 칩 제조사 대부분도 마찬가지입니다. 거의 모두가 팹리스, 즉 실리콘을 설계하고 제작은 통째로 다른 곳에 맡깁니다.

워크로드에 맞는 접근 경로 고르기

대규모 학습은 현실적인 선택지를 빠르게 좁힙니다. 널리 구할 수 있는 AMD Instinct, 단일 클라우드의 TPU나 Trainium, 아니면 기업용 Cerebras 배포입니다. 프로덕션 추론은 더 많은 길을 열어 줍니다. Groq, Cerebras, SambaNova가 모두 호스팅 서비스를 제공하면서 동시에 어떤 형태로든 전용 인프라도 내놓기 때문입니다. 실험 단계는 다시 더 넓어져서, 무료 TPU 접근부터 자기 컴퓨터에 꽂을 수 있는 Tenstorrent 카드까지 걸쳐 있습니다.

이 경계들은 표가 보여줄 수 있는 것보다 훨씬 무릅니다. 질문은 실리콘이 무엇을 할 수 있느냐만이 아니라, 그것에 어디서 닿을 수 있는지, 기존 소프트웨어 스택 가운데 얼마가 이동에서 살아남는지, 그리고 그렇게 만들어진 워크로드를 나중에 다른 곳으로 옮길 수 있는지입니다. Cerebras는 기업 인프라 전반에서 학습과 추론을 모두 할 수 있는 반면, Trainium은 AWS에 묶여 있습니다.

이 가운데 어느 것도 NVIDIA를 밀어내지는 못합니다. 대부분의 팀에게 실제 질문은 CUDA를 떠날지가 아니라, 그 옆에 두 번째 스택을 유지할 만한 값어치가 있는지입니다.

어떤 카드에 맞춰 규모를 잡을지 는 지금 자리에 머무를 경우 남는 결정이며, 그것은 이 글과는 다른 작업입니다.

칩보다 경로가 더 많은 것을 결정합니다. 책상 위의 카드와 남의 API 뒤에 있는 같은 급의 실리콘은, 처리량이 비슷하게 나오더라도 같은 도구가 아닙니다. 하나는 아직 떠올리지 못한 것을 시도하게 해 주고, 다른 하나는 이미 물을 줄 아는 것에 대해 토큰 단위로 청구하기 때문입니다.

자주 묻는 질문

Google TPU를 실제로 빌릴 수 있나요?

네. Google의 현행 정식 출시 Ironwood TPU인 TPU7x는 Google Cloud에서, 그리고 오직 그곳에서만 이용할 수 있습니다. 이전 TPU 세대도 함께 제공되며, Colab과 Kaggle, TPU Research Cloud는 일부 워크로드에 무료 TPU 접근을 제공합니다. JAX가 네이티브 경로로 남아 있고, PyTorch는 PyTorch/XLA를 거쳐 돌아갑니다.

기존 PyTorch 코드를 가장 적은 작업으로 돌리는 NVIDIA 대안은 무엇인가요?

대부분의 경우 AMD Instinct입니다. ROCm은 공식 지원되는 PyTorch 백엔드라서 코드 경로가 이미 존재합니다. Google의 TPU는 번역 계층인 PyTorch/XLA 브리지를 통해 PyTorch를 돌립니다. AWS는 vLLM과 HuggingFace Transformers, TorchTitan이 이식 작업 없이 Trainium에서 실행된다고 밝히는데, 이는 공급업체 자신의 주장입니다. 반대편 끝에서 Etched의 Sohu는 자체 특화 소프트웨어 스택을 쓰므로, ROCm이나 PyTorch/XLA보다 훨씬 많은 이식 작업을 예상해야 합니다.

칩을 빌릴 수도 없는데 Broadcom과 Qualcomm은 왜 NVIDIA의 경쟁자로 불리나요?

이유가 서로 다릅니다. Broadcom은 표준 가속기를 개발자에게 직접 파는 대신, 자체 가속기를 만드는 회사들을 위한 맞춤형 실리콘 작업을 합니다. Qualcomm은 자체 Dragonfly 가속기를 설계하며 AI200, AI250, AI300이 이제 데이터센터 로드맵에 올라 있지만, 접근 방식은 평범한 셀프서비스 클라우드 대여가 아니라 기업 지향적입니다. 두 회사 모두 AI 인프라에서 경쟁하지만, 개발자에게 NVIDIA나 AMD와 같은 공개 접근 모델을 제공하지는 않습니다.

AI 가속기를 빌리는 대신 아예 살 수 있나요?

네. Tenstorrent는 Blackhole 개발자 카드를 직접 판매합니다. p100a는 999달러, p150a와 p150b는 1,399달러이며, 재고가 있고 약 2주 안에 배송되고, 소프트웨어 스택은 전부 오픈소스입니다. 단서 조항은 가격만큼이나 중요합니다. 문서와 검증된 모델 지원 대부분이 여전히 구형 Wormhole 카드를 대상으로 하므로, 기존 코드가 그대로 돌아가기를 기대하기보다 이식에 쓸 시간을 잡아 두세요.

공유

토론

댓글

토론에 참여하려면 로그인하세요.

블로그 더 보기

계속 읽기.

배포할 준비가 되셨나요? 월 $2.48부터.

2008년부터 독립 클라우드. AMD EPYC, NVMe, 40 Gbps. 14일 환불 보장.