Lewati ke konten utama
diskon 50% semua paket, waktu terbatas. Mulai dari $2.48/mo
16 min left
AI dan Machine Learning

Perusahaan dan produsen chip AI papan atas: alternatif NVIDIA yang benar-benar dikirim

J Oleh Jeremy 16 menit baca
Perusahaan chip AI papan atas: sebuah kartu grafis, modul akselerator, wafer silikon, dan papan server yang ditata di atas latar merah gelap

Anda bisa memesan kartu pengembang Tenstorrent Blackhole minggu ini. Harganya 999 $, tersedia di stok, dan dikirim dalam sekitar dua minggu. Sebaliknya, Anda tidak bisa membeli atau menyewa Meta MTIA lewat kanal publik; Meta menyebut MTIA sebagai silikon yang dipakainya untuk beban kerjanya sendiri.

Kedua perusahaan sama-sama masuk hitungan sebagai perusahaan chip AI papan atas. Jarak antara dua situasi itulah yang dibahas artikel ini.

Bagian berikut membahas vendor per vendor: apa yang bisa Anda dapatkan, lewat kanal mana, dan berapa biaya perangkat lunaknya setelah Anda memilikinya.

TL;DR

  • Luas untuk disewa: AMD Instinct masih punya jejak public cloud terluas di luar NVIDIA, tetapi lini produknya sudah bergerak maju. AMD meluncurkan MI400 Series pada Juli 2026, sementara sistem MI300X, MI325X, dan seri MI350 tetap yang paling mungkin Anda temukan untuk disewa.
  • Satu cloud: TPU Google tetap di Google Cloud, dengan TPU7x Ironwood tersedia umum sejak Maret 2026. AWS Trainium dan Inferentia tetap di AWS.
  • API plus infrastruktur khusus: Groq, Cerebras, dan SambaNova sama-sama menawarkan inferensi terkelola, tetapi menyebutnya hanya API sudah tidak akurat. Masing-masing kini juga punya jalur khusus atau on-premises.
  • Perangkat keras yang bisa Anda peroleh: Tenstorrent menjual kartu Blackhole secara langsung. Qualcomm menyajikan akselerator pusat data Dragonfly-nya lewat jalur kontak penjualan korporat, bukan sekadar pengumuman peta jalan.
  • Terbatas atau internal: Intel Gaudi 3 tetap tersedia lewat sebagian penerapan IBM Cloud, sementara Crescent Island diperkirakan masuk tahap sampling pelanggan pada paruh kedua 2026. Etched menyebut rak pertamanya dikirim ke pelanggan berkontrak pada musim panas 2026. Meta MTIA dan Microsoft Maia tetap internal atau terintegrasi Azure, bukan akselerator swalayan publik.

Apa yang Tidak Dibahas Artikel Ini

Tiga hal sengaja ditaruh di luar bingkai, dan setiap status vendor di bawah ini mencerminkan Agustus 2026.

  • Harga. Pertanyaannya di sini adalah apakah Anda bisa mendapatkan perangkat kerasnya, bukan berapa biaya satu jam pemakaian.
  • Prakiraan. Tidak ada klaim soal siapa yang menang.
  • Kartu konsumen dan desktop. Topiknya adalah akselerator pusat data dan cloud.

Lima cara mendapatkan komputasi di akselerator AI

Lima tingkat akses akselerator AI pada Agustus 2026, dari yang paling terbuka sampai paling terbatas: banyak cloud untuk AMD Instinct, satu cloud untuk Google TPU7x dan AWS Trainium, infrastruktur terkelola plus khusus untuk Groq, Cerebras, dan SambaNova, perangkat keras atau penjualan korporat untuk Tenstorrent, Qualcomm, dan Etched, serta hanya internal untuk Meta MTIA dan Microsoft Maia 200

Lima jalur akses mencakup akselerator dalam artikel ini: sewa lintas beberapa cloud, sewa lewat satu cloud, akses API terkelola, perangkat keras khusus atau yang bisa dibeli langsung, dan akses korporat terbatas untuk produk yang tidak tersedia luas secara swalayan. Beberapa perusahaan kini melintasi lebih dari satu jalur ini. Kelompok tersendiri tetap internal sepenuhnya, tanpa cara publik untuk menyewa atau membeli silikonnya.

Akses adalah status, bukan sifat permanen sebuah perusahaan. Ia berubah saat generasi baru diluncurkan, saat cloud menambah atau mencabut perangkat keras, dan saat vendor membuka atau menutup kanal pengadaan. Akses juga tidak mengatakan apa-apa soal kualitas atau skala. Ia menjelaskan bagaimana Anda bisa mendapatkan komputasinya, dan kanal itulah yang menentukan apakah sebuah nama benar-benar bisa Anda tindak lanjuti.

NVIDIA memegang mayoritas besar pendapatan akselerator AI pusat data, hadir di hampir semua cloud, dan CUDA adalah permukaan yang menjadi tolok ukur semua yang lain. Perusahaan akselerator AI lain di sini menarik justru karena cara menjangkaunya begitu berbeda-beda.

Vendor dan produkTingkat aksesCara mendapatkannyaTumpukan perangkat lunakBeban kerjaStatus
NVIDIA (patokan, bukan alternatif)Banyak cloudHampir semua penyedia cloudCUDAPelatihan dan inferensiTersedia umum
AMD Instinct MI300XBanyak cloudVultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, CirrascaleROCmPelatihan dan inferensiTersedia umum
AMD Instinct MI325XBanyak cloudVultr, TensorWave, DigitalOceanROCmPelatihan dan inferensiTersedia umum
Google TPU7x (Ironwood)Satu cloudGoogle CloudJAX, dan PyTorch lewat PyTorch/XLAPelatihan dan inferensiTersedia umum sejak 31 Maret 2026
AWS TrainiumSatu cloudInstans AWS EC2 Trainium dan UltraServers (Trn2, Trainium3)Neuron SDKPelatihan dan inferensiTersedia umum
AWS Inferentia2Satu cloudInstans AWS EC2 Inf2Neuron SDKInferensiTersedia umum
Groq LPUAPI terkelola dan infrastruktur khususGroqCloud dan GroqMetalAPI kompatibel OpenAI dan tumpukan GroqInferensiTersedia
Cerebras WSE-3 dan CS-3API terkelola, cloud korporat, on-premisesCerebras Cloud dan sistem CS-3Tumpukan perangkat lunak CerebrasPelatihan dan inferensiTersedia
SambaNova SN50API terkelola, khusus, on-premisesSambaCloud dan SambaRackSambaStackInferensiPengiriman ke pelanggan dimulai pada paruh kedua 2026
Intel Gaudi 3Cloud tertentuIBM CloudSuite perangkat lunak Intel GaudiPelatihan, penyetelan halus, dan inferensiKetersediaan terbatas
Tenstorrent BlackholeBeli perangkat kerasnyaLangsung dari TenstorrentTumpukan TT-Metalium sumber terbukaInferensi dan kerja pengembanganTersedia di stok, dikirim dalam sekitar dua minggu
Qualcomm AI200, AI250, dan AI300Penjualan korporatHubungi penjualanTumpukan perangkat lunak AI QualcommInferensiAI200 diperkirakan pada 2026, sampling AI250 diperkirakan pada 2027, sampling AI300 diperkirakan pada 2028
Etched SohuPenerapan berbasis kontrakKontrak korporatTumpukan perangkat lunak EtchedInferensi transformerRak pertama dikirim pada musim panas 2026
Meta MTIATidak bisa diperolehTidak ada jalur eksternalPerkakas internal MetaPekerjaan pemeringkatan, rekomendasi, dan GenAI milik Meta sendiriInternal saja
Microsoft Maia 200Internal, terintegrasi AzurePusat data MicrosoftMaia SDKInferensiDiterapkan secara internal, tanpa instans swalayan publik

AMD Instinct adalah yang bisa Anda sewa hampir di mana saja

Di antara alternatif NVIDIA dalam artikel ini, AMD Instinct punya jejak penyedia paling luas: MI300X dan MI325X tersedia di berbagai penyedia cloud dan neocloud, bukan terikat pada satu hyperscaler. AMD meluncurkan MI400 Series pada Juli 2026 dengan MI455X di depan, tetapi generasi lama tetap penting karena itulah yang lebih mungkin Anda jumpai pada penyewaan yang sudah berjalan. ROCm tetap menjadi porting perangkat lunak paling singkat dalam artikel ini untuk sebagian besar beban kerja PyTorch yang sudah ada.

Kendalanya bukan perangkat keras. MI300X membawa 192GB HBM3 pada 5,3 TB/s di 304 unit komputasi CDNA3 dalam modul 750W. MI325X menaikkannya jadi 256GB HBM3E pada 6 TB/s dan 1000W, kapasitas yang berakhir lebih rendah dari 288GB yang mula-mula diumumkan AMD.

Inti CUDA adalah yang dihitung NVIDIA, sedangkan AMD menghitung unit komputasi, dan keduanya tidak bisa dikonversi, itulah sebabnya memori dan bandwidth lebih berguna untuk dibandingkan antarvendor.

Situasi perangkat lunaknya sudah berubah, dan reputasinya tertinggal. Dukungan ROCm untuk PyTorch sudah masuk ke repositori resmi PyTorch, bukan hidup di fork komunitas, dan rilis ROCm terbaru mengikuti framework terbaru. ROCm 7.14.0 mendukung PyTorch 2.12, berdampingan dengan integrasi AMD saat ini untuk ekosistem perangkat lunak AI yang lebih luas.

Bacaan saya, gesekan yang masih orang keluhkan itu bukan throughput dan bukan dukungan framework. Itu arkeologi. Ketika sebuah setup CUDA rusak jam tiga pagi, seseorang sudah pernah menemui pesan error itu dan mencatat perbaikannya. Di ROCm hasil pencariannya lebih tipis, jadi waktu habis untuk mencari alih-alih memperbaiki. Biaya itu tidak pernah muncul di benchmark.

Kerja AMD di ranah akselerator juga menjangkau di luar pusat data, dan itu penting kalau Anda ingin perangkat keras murah untuk belajar tumpukannya.

Demo klaster mini PC dari AMD berjalan di silikon konsumen dari perusahaan yang sama.

Google TPU dan AWS Trainium masing-masing hanya bisa disewa di satu cloud

TPU7x milik Google dan Trainium milik AWS sama-sama tersedia umum dan sama-sama terkunci ke satu penyedia. TPU jalan di Google Cloud. Trainium dan Inferentia jalan di AWS. Keduanya tidak memberi Anda portabilitas lintas penyedia seperti AMD atau NVIDIA, dan batasan itu bisa lebih menentukan daripada spesifikasi mana pun.

TPU7x adalah rilis pertama di keluarga Ironwood generasi ketujuh milik Google dan tersedia umum sejak 31 Maret 2026. Google memposisikannya untuk pelatihan dan inferensi skala besar. Trillium v6e masih tersedia, sementara Ironwood tetap menjadi generasi TPU Google yang tersedia umum saat ini. Google juga sudah mengumumkan TPU 8t dan TPU 8i generasi kedelapan, tetapi keduanya masih tercantum sebagai segera hadir.

Fakta paling berguna soal TPU tidak ada di lembar spesifikasi. Ada jalur masuk gratis: Colab dan Kaggle sama-sama menyediakan runtime TPU, dan TPU Research Cloud memberi jatah waktu bagi peneliti. Jalur gratis itu memberi Anda cara menguji jalur perangkat lunak TPU sebelum mengeluarkan anggaran cloud, meski layanan gratis tersebut jangan diasumsikan menyediakan perangkat keras Ironwood terbaru secara khusus.

AWS menjangkau silikonnya sendiri lewat instans Trainium dan UltraServers, ditambah instans Inf2 untuk Inferentia2. UltraServers Trainium3 tersedia umum pada Desember 2025 dan menskala hingga 144 chip, naik dari 64 pada UltraServers Trn2 sebelumnya. Semuanya lewat Neuron SDK. AWS menggambarkan biaya porting lebih optimistis dibanding kebanyakan vendor.

Halaman AWS Trainium menyatakan bahwa vLLM, HuggingFace Transformers, dan TorchTitan berjalan secara native di Trainium tanpa kode khusus dan tanpa upaya porting. Itu klaim vendor tentang produknya sendiri, bukan hasil yang diverifikasi secara independen.

Keduanya berada dalam pertukaran yang layak diambil secara sadar. Anda mendapat pemasok silikon kedua dan kehilangan kemampuan memindahkan beban kerja itu ke cloud lain tanpa mengulang pekerjaan, yang nyaris tidak berbiaya bagi tim yang memang sudah terikat pada satu penyedia, tetapi berbiaya segalanya bagi tim yang dibangun untuk menghindari keterikatan.

Apa yang harus muat di memori membatasi pilihan lebih dulu: 144GB per chip Trainium3 adalah persoalan perencanaan yang berbeda dari 192GB milik Ironwood, siapa pun penjualnya.

Groq, Cerebras, dan SambaNova melampaui sekadar API terkelola

Groq, Cerebras, dan SambaNova sama-sama menawarkan inferensi terkelola, tetapi API bukan lagi keseluruhan cerita aksesnya. Groq memasangkan GroqCloud dengan infrastruktur khusus GroqMetal. Cerebras menawarkan akses cloud berdampingan dengan sistem CS-3 yang bisa berjalan on-premises. SambaNova menawarkan SambaCloud berdampingan dengan SambaRack dan SambaStack. Pembedanya sekarang adalah seberapa besar kendali infrastruktur yang Anda butuhkan dan seberapa jauh Anda bersedia masuk ke proses pengadaan korporat.

Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.

Pengumuman Groq sendiri menyebut bahwa GroqCloud akan terus beroperasi tanpa gangguan.

Di GTC pada Maret 2026, NVIDIA memperkenalkan NVIDIA Groq 3 LPU di dalam platform Vera Rubin miliknya.

Pengumuman Vera Rubin dari NVIDIA menjelaskan rak LPX berisi 256 prosesor LPU, tersedia pada paruh kedua 2026.

Cerebras mengambil pendekatan fisik yang berlawanan: satu komponen berskala wafer dengan 900.000 inti dan 44GB SRAM di dalam chip, dinilai pada 125 PFLOPs.

Halaman inferensi milik Cerebras menawarkan kredit gratis 5 $ dan menggambarkan migrasinya sebagai cukup dua perubahan kode. Satu pembeda tetap penting untuk perencanaan: API swalayan adalah jalur inferensi yang mudah, sementara pelatihan, penyetelan halus, kapasitas khusus, dan penerapan CS-3 on-premises berada lebih jauh di jalur korporat.

Cerita perangkat keras SambaNova saat ini berpusat pada SambaRack SN50, yang dibangun di sekitar 16 RDU SN50 generasi kelima per rak. SambaCloud tetap jadi jalur terkelola, sementara SambaRack dan SambaStack menyediakan infrastruktur khusus yang bisa berjalan on-premises atau di lingkungan terkelola.

Akses terkelola masih jadi titik masuk termudah bagi ketiganya, tetapi itu tidak lagi menggambarkan produknya secara utuh.

Tenstorrent menjual perangkat keras yang bisa Anda miliki

Tenstorrent adalah satu-satunya vendor dalam artikel ini yang akseleratornya bisa Anda beli langsung sebagai perorangan, dengan harga yang bukan keputusan belanja modal.

Halaman perangkat keras Tenstorrent mencantumkan Blackhole p100a seharga 999 $ serta p150a dan p150b seharga 1.399 $, tersedia di stok dan dikirim dalam sekitar dua minggu. Tumpukan perangkat lunaknya sepenuhnya sumber terbuka.

Kartu-kartu ini membawa 120 inti Tensix dan 16 inti RISC-V, dengan 28GB GDDR6 pada p100a dan 32GB pada pasangan p150, menyedot hingga 300W. p150a dan p150b menambahkan port Ethernet QSFP-DD yang tidak ada di p100a, dan itulah yang Anda beli kalau berniat menghubungkan kartu satu sama lain. HPCwire melaporkan bahwa Galaxy Blackhole skala rak tersedia umum pada 28 April 2026 mulai 110.000 $, dan lini Wormhole yang lebih lama masih dijual, termasuk workstation TT-LoudBox seharga 12.000 $.

Peringatan ini sama menentukannya dengan harga, dan ia menunjuk ke kartu lama tadi. Sebagian besar dokumentasi, tutorial, dan dukungan model terverifikasi dari Tenstorrent masih menyasar Wormhole. Dukungan perangkat lunak Blackhole masih lebih awal dalam siklusnya. Konkretnya: ini cocok untuk orang yang bersedia melakukan kerja porting sungguhan dan membaca kode sumber ketika dokumentasinya habis. Ini tidak cocok untuk orang yang ingin kode PyTorch yang sudah ada berjalan tanpa diubah, dan itu keinginan yang sangat masuk akal.

Qualcomm, Intel, dan Etched punya jalur akses yang lebih sempit

Ketiganya berada di balik jalur akses yang lebih sempit, dengan alasan yang tidak saling berkaitan. Qualcomm sedang membangun peta jalan akselerator pusat data lintas generasi di sekitar penerapan korporat. Intel Gaudi 3 tetap tersedia lewat sebagian penerapan IBM Cloud sementara Crescent Island bergerak menuju sampling pelanggan. Etched menyebut rak Sohu pertamanya dikirim pada musim panas 2026 berdasarkan kontrak korporat, bukan lewat layanan cloud swalayan.

Peta jalan pusat data Qualcomm kini mencakup Dragonfly AI200, AI250, dan AI300 yang baru diumumkan, dengan irama akselerator tahunan yang berfokus pada inferensi. Ini tetap jalur berorientasi korporat, bukan jenis penyewaan akselerator swalayan yang bisa Anda tambahkan ke akun cloud hari ini.

Intel adalah contoh yang instruktif karena Gaudi 3 tidak pernah meraih jejak cloud yang luas, tetapi juga belum lenyap. IBM Cloud masih menawarkan profil server virtual berakselerasi Gaudi 3 dengan ketersediaan terbatas, termasuk penerapan di Dallas, Washington DC, dan Frankfurt. Langkah Intel berikutnya adalah Crescent Island, GPU berfokus inferensi yang diperkirakan masuk sampling pelanggan pada paruh kedua 2026. Gaudi 3 hari ini adalah opsi yang sempit, bukan opsi yang sudah tamat.

Etched sedang membangun Sohu, sebuah ASIC yang dikhususkan untuk inferensi transformer. Perusahaan ini menghimpun 800 juta dolar, punya silikon A0 yang berfungsi, melaporkan lebih dari 1 miliar dolar kontrak pelanggan yang sudah diteken, dan rak pertama dijadwalkan dikirim pada musim panas 2026. Klaim kinerjanya berasal dari mereka sendiri dan belum diuji secara independen, jadi angka throughput bukan bagian yang berguna. Bagian yang berguna adalah tumpukan perangkat lunaknya. Etched membangun chip, rak, dan lingkungan perangkat lunak sebagai satu platform khusus, jadi jangan berasumsi tumpukan penyajian era CUDA berpindah tanpa perubahan. Itu bisa cocok untuk pelanggan berkontrak yang menjalankan inferensi transformer pada skala raksasa, tetapi merupakan komitmen yang jauh lebih besar bagi tim yang bergantung pada portabilitas antarakselerator.

Silikon internal saja dan firma yang membuat chip untuk pihak lain

Dua situasi yang dari luar tampak seperti perusahaan chip AI, tetapi perilakunya sama sekali berbeda. Meta dan Microsoft merancang akselerator yang mereka operasikan sendiri dan tidak dijual ke siapa pun. Broadcom dan Marvell merancang serta mengimplementasikan silikon untuk arsitektur perusahaan lain. Tidak satu pun kelompok ini punya produk yang bisa disewa pengembang, dengan alasan yang sama sekali tidak berkaitan.

MTIA milik Meta adalah contoh paling jernih dari jenis pertama.

Tulisan teknik dari Meta sendiri menjelaskan penerapan ratusan ribu chip MTIA untuk beban kerja inferensi, baik pada konten organik maupun iklan di aplikasinya, dengan MTIA 300 yang sudah masuk produksi untuk pelatihan pemeringkatan dan rekomendasi, serta MTIA 400, 450, dan 500 direncanakan dengan irama sekitar enam bulan. Itu jumlah silikon yang luar biasa besar, yang tak akan pernah bisa Anda sewa barang sejam pun.

Kasus Microsoft lebih lunak di tepiannya. Maia 200, yang diperkenalkan pada Januari 2026, adalah akselerator inferensi buatan sendiri milik Microsoft saat ini dan sudah diterapkan di pusat datanya, dengan Maia SDK tersedia dalam pratinjau. Microsoft saat ini tidak mendokumentasikan instans Maia swalayan untuk publik, jadi ia masih berada di sisi internal atau terintegrasi Azure dalam perbandingan ini.

Broadcom dan Marvell lagi-lagi hal yang berbeda, dan itu perlu diluruskan karena nama mereka terus-terusan muncul di sebelah NVIDIA. TPU milik Google adalah contoh yang berguna. Google memiliki produk dan arsitektur TPU, sementara Broadcom menyumbang kerja desain dan implementasi silikon khusus yang bisa mencakup interkoneksi, pengemasan, dan jalur dari arsitektur menuju silikon yang bisa diproduksi. Broadcom tidak menjual TPU, atau akselerator serbaguna lain, langsung ke pengembang. Pendapatan segmen AI-nya, sebagaimana dilaporkan pada kinerja kuartal pertama fiskal 2026, mencapai 8,4 miliar dolar, naik 106 persen dari tahun sebelumnya, yang menjelaskan mengapa namanya ada di mana-mana. Tetap saja itu bukan chip yang bisa Anda sewa.

Di titik inilah kata produsen mulai memikul beban yang tak sanggup ia tanggung. Broadcom dan Marvell tidak memproduksi chip, dan begitu pula sebagian besar produsen chip AI yang disebut di atas: hampir semuanya fabless, artinya mereka merancang silikon dan mengontrakkan fabrikasinya sepenuhnya kepada pihak lain.

Mencocokkan jalur akses dengan beban kerja Anda

Pelatihan berskala besar dengan cepat mempersempit pilihan praktis: AMD Instinct yang tersedia luas, TPU atau Trainium di satu cloud, atau penerapan Cerebras kelas korporat. Inferensi produksi membuka lebih banyak jalur karena Groq, Cerebras, dan SambaNova sama-sama menyediakan layanan terkelola sekaligus semacam infrastruktur khusus. Eksperimen lebih luas lagi, mulai dari akses TPU gratis sampai kartu Tenstorrent yang bisa Anda pasang di mesin sendiri.

Batas-batas itu lebih kabur daripada yang bisa ditunjukkan sebuah tabel. Pertanyaannya bukan cuma apa yang bisa dilakukan silikonnya, melainkan di mana Anda bisa menjangkaunya, seberapa banyak tumpukan perangkat lunak Anda yang selamat dari perpindahan itu, dan apakah beban kerja hasilnya bisa pindah ke tempat lain nanti. Cerebras bisa melatih dan melakukan inferensi di infrastruktur korporat, sedangkan Trainium tetap terikat pada AWS.

Tidak ada satu pun dari ini yang menggeser NVIDIA. Bagi kebanyakan tim, pertanyaan yang benar-benar hidup bukanlah apakah harus meninggalkan CUDA, melainkan apakah tumpukan kedua layak dipelihara di sampingnya.

Kartu mana yang harus Anda ukur adalah keputusan yang tersisa kalau Anda tetap di tempat, dan itu latihan yang berbeda dari yang ini.

Kanal lebih menentukan daripada chipnya. Sebuah kartu di meja Anda dan silikon sekelas yang bersembunyi di balik API orang lain bukanlah alat yang sama, bahkan ketika throughput-nya berdekatan, karena yang satu membiarkan Anda mencoba hal yang belum terpikirkan, sementara yang lain menagih Anda per token untuk hal yang sudah Anda tahu cara menanyakannya.

Pertanyaan yang Sering Diajukan

Apakah Anda benar-benar bisa menyewa Google TPU?

Ya. TPU7x, TPU Ironwood milik Google yang saat ini tersedia umum, ada di Google Cloud dan hanya di sana. Generasi TPU yang lebih lama juga tersedia, dan Colab, Kaggle, serta TPU Research Cloud menyediakan akses TPU gratis untuk sebagian beban kerja. JAX tetap jalur native-nya, sementara PyTorch berjalan lewat PyTorch/XLA.

Alternatif NVIDIA mana yang menjalankan kode PyTorch yang sudah ada dengan kerja paling sedikit?

AMD Instinct, dalam sebagian besar kasus: ROCm adalah backend PyTorch yang didukung secara resmi, jadi jalur kodenya sudah ada. TPU Google menjalankan PyTorch lewat jembatan PyTorch/XLA, sebuah lapisan penerjemah. AWS menyatakan vLLM, HuggingFace Transformers, dan TorchTitan berjalan di Trainium tanpa upaya porting, dan itu klaim vendor sendiri. Di ujung yang lain, Sohu dari Etched memakai tumpukan perangkat lunak khusus buatannya, jadi harapkan kerja porting yang jauh lebih banyak dibanding ROCm atau PyTorch/XLA.

Mengapa Broadcom dan Qualcomm disebut pesaing NVIDIA kalau chip mereka tidak bisa disewa?

Karena alasan yang berbeda. Broadcom mengerjakan silikon khusus untuk perusahaan yang membangun akseleratornya sendiri, alih-alih menjual akselerator standar langsung ke pengembang. Qualcomm merancang akselerator Dragonfly miliknya sendiri, dengan AI200, AI250, dan AI300 kini ada di peta jalan pusat datanya, tetapi aksesnya berorientasi korporat, bukan penyewaan cloud swalayan biasa. Keduanya bersaing di infrastruktur AI tanpa memberi pengembang model akses publik yang sama seperti NVIDIA atau AMD.

Bisakah Anda membeli akselerator AI langsung alih-alih menyewanya?

Ya. Tenstorrent menjual kartu pengembang Blackhole secara langsung, mulai 999 $ untuk p100a sampai 1.399 $ untuk p150a dan p150b, tersedia di stok dan dikirim dalam sekitar dua minggu, dengan tumpukan perangkat lunak yang sepenuhnya sumber terbuka. Peringatannya sama pentingnya dengan harga: sebagian besar dokumentasi dan dukungan model terverifikasi masih menyasar kartu Wormhole yang lebih lama, jadi siapkan waktu untuk porting alih-alih berharap kode yang ada berjalan tanpa diubah.

Bagikan

Diskusi

Komentar

Masuk untuk bergabung dalam diskusi.

Lebih banyak dari blog

Lanjutkan membaca.

Siap deploy? Mulai $2,48/bln.

Cloud independen, sejak 2008. AMD EPYC, NVMe, 40 Gbps. Garansi uang kembali 14 hari.