คุณสั่งซื้อการ์ดสำหรับนักพัฒนา Tenstorrent Blackhole ได้ในสัปดาห์นี้ ราคา 999 ดอลลาร์ มีสินค้าพร้อมส่ง และจัดส่งภายในราวสองสัปดาห์ แต่คุณไม่สามารถซื้อหรือเช่า Meta MTIA ผ่านช่องทางสาธารณะได้ Meta ระบุว่า MTIA คือซิลิคอนที่บริษัทนำไปใช้กับเวิร์กโหลดของตัวเอง
ทั้งสองบริษัทถูกนับรวมอยู่ในกลุ่มบริษัทชิป AI ชั้นนำ และระยะห่างระหว่างสองสถานการณ์นี้คือสิ่งที่บทความนี้พูดถึง
ต่อจากนี้จะไล่ไปทีละผู้ผลิต ว่าคุณได้อะไร ผ่านช่องทางไหน และซอฟต์แวร์มีต้นทุนเท่าไรเมื่อได้ฮาร์ดแวร์มาแล้ว
TL;DR (สรุปย่อ)
- เช่าได้อย่างกว้างขวาง: AMD Instinct ยังมีการกระจายตัวบนคลาวด์สาธารณะกว้างที่สุดในบรรดาทางเลือกนอก NVIDIA แต่สายผลิตภัณฑ์เดินหน้าไปแล้ว AMD เปิดตัวซีรีส์ MI400 ในเดือนกรกฎาคม 2026 ขณะที่ระบบ MI300X, MI325X และซีรีส์ MI350 ยังเป็นตัวที่คุณมีโอกาสเจอให้เช่ามากที่สุด
- คลาวด์เดียว: TPU ของ Google อยู่บน Google Cloud เท่านั้น โดย TPU7x Ironwood เปิดให้ใช้ทั่วไปตั้งแต่เดือนมีนาคม 2026 ส่วน AWS Trainium และ Inferentia ก็อยู่บน AWS เท่านั้น
- API พร้อมโครงสร้างพื้นฐานเฉพาะ: Groq, Cerebras และ SambaNova ต่างให้บริการ inference แบบโฮสต์ แต่การบอกว่ามีแค่ API นั้นไม่ถูกต้องอีกแล้ว เพราะแต่ละรายมีเส้นทางแบบเฉพาะหรือติดตั้งในองค์กรด้วย
- ฮาร์ดแวร์ที่คุณจัดหาได้: Tenstorrent ขายการ์ด Blackhole โดยตรง ส่วน Qualcomm นำเสนอตัวเร่งความเร็วสำหรับศูนย์ข้อมูล Dragonfly ผ่านช่องทางติดต่อฝ่ายขายองค์กร ไม่ใช่แค่การประกาศโรดแมป
- จำกัดหรือใช้ภายใน: Intel Gaudi 3 ยังใช้งานได้ผ่านการติดตั้งบางส่วนของ IBM Cloud ขณะที่ Crescent Island คาดว่าจะเข้าสู่ช่วงส่งตัวอย่างให้ลูกค้าในครึ่งหลังของปี 2026 ส่วน Etched ระบุว่าแร็คชุดแรกจะส่งถึงลูกค้าตามสัญญาในฤดูร้อนปี 2026 ด้าน Meta MTIA และ Microsoft Maia ยังคงเป็นของใช้ภายในหรือผูกกับ Azure ไม่ใช่ตัวเร่งความเร็วแบบบริการตัวเองที่เปิดทั่วไป
สิ่งที่บทความนี้ไม่ครอบคลุม
สามเรื่องถูกวางไว้นอกกรอบโดยตั้งใจ และสถานะของผู้ผลิตทุกรายด้านล่างสะท้อนข้อมูล ณ เดือนสิงหาคม 2026
- ราคา คำถามในที่นี้คือคุณหาฮาร์ดแวร์มาได้หรือไม่ ไม่ใช่ว่าใช้งานหนึ่งชั่วโมงราคาเท่าไร
- การคาดการณ์ ไม่มีการฟันธงว่าใครจะชนะ
- การ์ดสำหรับผู้ใช้ทั่วไปและเดสก์ท็อป หัวข้อของบทความคือตัวเร่งความเร็วสำหรับศูนย์ข้อมูลและคลาวด์
ห้าวิธีในการเข้าถึงพลังประมวลผลบนตัวเร่งความเร็ว AI
ตัวเร่งความเร็วในบทความนี้ครอบคลุมเส้นทางการเข้าถึงห้าแบบ ได้แก่ การเช่าผ่านหลายคลาวด์ การเช่าผ่านคลาวด์เดียว การเข้าถึงผ่าน API แบบโฮสต์ ฮาร์ดแวร์แบบเฉพาะหรือที่ซื้อได้โดยตรง และการเข้าถึงแบบองค์กรที่จำกัดสำหรับผลิตภัณฑ์ที่ไม่ได้เปิดให้บริการตัวเองอย่างกว้างขวาง บางบริษัทตอนนี้ครอบคลุมมากกว่าหนึ่งเส้นทาง ส่วนอีกกลุ่มหนึ่งยังใช้ภายในเท่านั้น ไม่มีช่องทางสาธารณะให้เช่าหรือซื้อชิปเลย
การเข้าถึงคือสถานะ ไม่ใช่คุณสมบัติถาวรของบริษัท มันเปลี่ยนไปเมื่อรุ่นใหม่เปิดตัว เมื่อคลาวด์เพิ่มหรือถอดฮาร์ดแวร์ และเมื่อผู้ผลิตเปิดหรือปิดช่องทางจัดซื้อ อีกทั้งยังไม่ได้บอกอะไรเกี่ยวกับคุณภาพหรือขนาดเลย มันอธิบายว่าคุณจะได้พลังประมวลผลมาอย่างไร และช่องทางนั้นเองที่ตัดสินว่าชื่อหนึ่งเป็นสิ่งที่คุณลงมือทำอะไรกับมันได้จริงหรือไม่
NVIDIA ครองรายได้ตัวเร่งความเร็ว AI สำหรับศูนย์ข้อมูลเป็นส่วนใหญ่ อยู่บนแทบทุกคลาวด์ และ CUDA คือพื้นผิวที่ทุกอย่างที่เหลือถูกนำไปเทียบด้วย ส่วนบริษัทตัวเร่งความเร็ว AI รายอื่นในบทความนี้น่าสนใจตรงที่วิธีเข้าถึงพวกเขาแตกต่างกันมาก
| ผู้ผลิตและผลิตภัณฑ์ | ระดับการเข้าถึง | วิธีเข้าถึง | ซอฟต์แวร์สแตก | ปริมาณงาน | สถานะระบบ |
|---|---|---|---|---|---|
| NVIDIA (เกณฑ์อ้างอิง ไม่ใช่ทางเลือก) | หลายคลาวด์ | ผู้ให้บริการคลาวด์เกือบทุกราย | CUDA | การฝึกและการอนุมาน | เปิดให้ใช้ทั่วไป |
| AMD Instinct MI300X | หลายคลาวด์ | Vultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, Cirrascale | ROCm | การฝึกและการอนุมาน | เปิดให้ใช้ทั่วไป |
| AMD Instinct MI325X | หลายคลาวด์ | Vultr, TensorWave, DigitalOcean | ROCm | การฝึกและการอนุมาน | เปิดให้ใช้ทั่วไป |
| Google TPU7x (Ironwood) | คลาวด์เดียว | Google Cloud | JAX และ PyTorch ผ่าน PyTorch/XLA | การฝึกและการอนุมาน | เปิดให้ใช้ทั่วไปตั้งแต่ 31 มีนาคม 2026 |
| AWS Trainium | คลาวด์เดียว | อินสแตนซ์ AWS EC2 Trainium และ UltraServers (Trn2, Trainium3) | Neuron SDK | การฝึกและการอนุมาน | เปิดให้ใช้ทั่วไป |
| AWS Inferentia2 | คลาวด์เดียว | อินสแตนซ์ AWS EC2 Inf2 | Neuron SDK | การอนุมาน | เปิดให้ใช้ทั่วไป |
| Groq LPU | API แบบโฮสต์และโครงสร้างพื้นฐานเฉพาะ | GroqCloud และ GroqMetal | API ที่เข้ากันได้กับ OpenAI และสแตกของ Groq | การอนุมาน | มีให้ใช้งาน |
| Cerebras WSE-3 และ CS-3 | API แบบโฮสต์ คลาวด์องค์กร ติดตั้งในองค์กร | Cerebras Cloud และระบบ CS-3 | ซอฟต์แวร์สแตกของ Cerebras | การฝึกและการอนุมาน | มีให้ใช้งาน |
| SambaNova SN50 | API แบบโฮสต์ แบบเฉพาะ ติดตั้งในองค์กร | SambaCloud และ SambaRack | SambaStack | การอนุมาน | เริ่มจัดส่งให้ลูกค้าในครึ่งหลังของปี 2026 |
| Intel Gaudi 3 | คลาวด์ที่เลือกไว้ | IBM Cloud คลาउด์ | ชุดซอฟต์แวร์ Intel Gaudi | การฝึก การปรับจูน และการอนุมาน | เปิดให้ใช้เฉพาะบางที่ |
| Tenstorrent Blackhole | ซื้อฮาร์ดแวร์ | ซื้อตรงจาก Tenstorrent | สแตก TT-Metalium แบบโอเพนซอร์ส | การอนุมานและงานพัฒนา | มีสินค้าพร้อมส่ง จัดส่งภายในราวสองสัปดาห์ |
| Qualcomm AI200, AI250 และ AI300 | การขายแบบองค์กร | ติดต่อฝ่ายขาย | ซอฟต์แวร์สแตก AI ของ Qualcomm | การอนุมาน | คาด AI200 ในปี 2026, คาดส่งตัวอย่าง AI250 ในปี 2027, คาดส่งตัวอย่าง AI300 ในปี 2028 |
| Etched Sohu | การติดตั้งตามสัญญา | สัญญาระดับองค์กร | ซอฟต์แวร์สแตกของ Etched | การอนุมานโมเดล Transformer | แร็คชุดแรกจัดส่งในฤดูร้อนปี 2026 |
| Meta MTIA | หามาไม่ได้ | ไม่มีช่องทางจากภายนอก | เครื่องมือภายในของ Meta | งานจัดอันดับ แนะนำเนื้อหา และ GenAI ของ Meta เอง | ใช้ภายในเท่านั้น |
| Microsoft Maia 200 | ใช้ภายใน ผูกกับ Azure | ศูนย์ข้อมูลของ Microsoft | Maia SDK | การอนุมาน | ใช้งานภายใน ไม่มีอินสแตนซ์แบบบริการตัวเองสำหรับสาธารณะ |
AMD Instinct คือตัวที่คุณเช่าได้แทบทุกที่
ในบรรดาทางเลือกแทน NVIDIA ที่กล่าวถึงในบทความนี้ AMD Instinct มีการกระจายตัวในหมู่ผู้ให้บริการกว้างที่สุด โดย MI300X และ MI325X หาได้จากผู้ให้บริการคลาวด์และนีโอคลาวด์หลายราย ไม่ได้ผูกกับไฮเปอร์สเกลเลอร์เจ้าเดียว AMD เปิดตัวซีรีส์ MI400 ในเดือนกรกฎาคม 2026 โดยมี MI455X นำหน้า แต่รุ่นเก่ายังสำคัญอยู่ เพราะเป็นรุ่นที่คุณมีโอกาสเจอในบริการให้เช่าที่มีอยู่แล้วมากกว่า ส่วน ROCm ยังเป็นการย้ายซอฟต์แวร์ที่สั้นที่สุดในบทความนี้สำหรับเวิร์กโหลด PyTorch เดิมส่วนใหญ่
ข้อจำกัดไม่ได้อยู่ที่ฮาร์ดแวร์ MI300X มี HBM3 ขนาด 192GB ที่ความเร็ว 5.3 TB/s กระจายบนหน่วยประมวลผล CDNA3 จำนวน 304 ยูนิตในโมดูล 750W ส่วน MI325X ดันขึ้นเป็น HBM3E ขนาด 256GB ที่ 6 TB/s และ 1000W ซึ่งเป็นความจุที่ต่ำกว่า 288GB ที่ AMD ประกาศไว้ตอนแรก
CUDA cores คือสิ่งที่ NVIDIA นับ ขณะที่ AMD นับหน่วยประมวลผล และทั้งสองแปลงค่ากันไม่ได้ นี่จึงเป็นเหตุผลที่การเทียบหน่วยความจำและแบนด์วิดท์ระหว่างผู้ผลิตมีประโยชน์กว่า
สถานการณ์ด้านซอฟต์แวร์เปลี่ยนไปแล้ว แต่ชื่อเสียงยังตามไม่ทัน การรองรับ PyTorch ของ ROCm ถูกรวมเข้าไปในรีโพซิทอรี PyTorch อย่างเป็นทางการ แทนที่จะอยู่ในฟอร์กของชุมชน และ ROCm รุ่นปัจจุบันก็ตามเฟรมเวิร์กรุ่นปัจจุบันทัน โดย ROCm 7.14.0 รองรับ PyTorch 2.12 ควบคู่กับการผสานรวมปัจจุบันของ AMD กับระบบนิเวศซอฟต์แวร์ AI ที่กว้างขึ้น
ผมมองว่าแรงเสียดทานที่คนยังพูดถึงกันนั้นไม่ใช่เรื่องปริมาณงานและไม่ใช่การรองรับเฟรมเวิร์ก แต่มันคืองานขุดค้นหลักฐาน เวลาที่ระบบ CUDA พังตอนตีสาม จะมีคนเคยเจอข้อความ error นั้นและจดวิธีแก้ไว้แล้ว แต่บน ROCm ผลการค้นหาบางกว่า เวลาจึงหมดไปกับการค้นแทนที่จะเป็นการแก้ ต้นทุนแบบนี้ไม่เคยโผล่ในผลการทดสอบประสิทธิภาพ
งานด้านตัวเร่งความเร็วของ AMD ยังขยายออกไปนอกศูนย์ข้อมูลด้วย ซึ่งสำคัญถ้าคุณอยากได้ฮาร์ดแวร์ราคาถูกไว้หัดใช้สแตกนี้
การสาธิตคลัสเตอร์มินิพีซีของ AMD ทำงานบนชิปสำหรับผู้ใช้ทั่วไปของบริษัทเดียวกัน
Google TPU และ AWS Trainium เช่าได้บนคลาวด์เพียงเจ้าเดียวต่อหนึ่งราย
TPU7x ของ Google และ Trainium ของ AWS ต่างเปิดให้ใช้ทั่วไป และต่างถูกล็อกไว้กับผู้ให้บริการรายเดียว TPU ทำงานบน Google Cloud ส่วน Trainium และ Inferentia ทำงานบน AWS ทั้งคู่ไม่ได้ให้ความสามารถย้ายข้ามผู้ให้บริการแบบที่ AMD หรือ NVIDIA ให้ และข้อจำกัดนี้อาจสำคัญกว่าสเปกตัวใดตัวหนึ่ง
TPU7x เป็นรุ่นแรกในตระกูล Ironwood เจเนอเรชันที่เจ็ดของ Google และเปิดให้ใช้ทั่วไปเมื่อวันที่ 31 มีนาคม 2026 Google วางตำแหน่งมันไว้สำหรับการฝึกและการอนุมานขนาดใหญ่ ขณะที่ Trillium v6e ยังใช้งานได้อยู่ และ Ironwood ยังเป็นเจเนอเรชัน TPU ที่เปิดให้ใช้ทั่วไปในปัจจุบันของ Google นอกจากนี้ Google ยังประกาศ TPU 8t และ TPU 8i เจเนอเรชันที่แปดแล้ว แต่ทั้งคู่ยังระบุว่าเร็ว ๆ นี้
ข้อเท็จจริงที่มีประโยชน์ที่สุดเกี่ยวกับ TPU ไม่ได้อยู่ในสเปกชีต เพราะมีทางเข้าแบบฟรีอยู่ ทั้ง Colab และ Kaggle มีรันไทม์ TPU ให้ใช้ และ TPU Research Cloud ก็จัดสรรเวลาให้นักวิจัย ทางเข้าฟรีนี้ทำให้คุณทดสอบเส้นทางซอฟต์แวร์ของ TPU ได้ก่อนจะทุ่มงบคลาวด์ แม้ว่าจะไม่ควรคาดหวังว่าบริการฟรีจะให้ฮาร์ดแวร์ Ironwood รุ่นล่าสุดโดยเฉพาะ
AWS เข้าถึงชิปของตัวเองผ่านอินสแตนซ์ Trainium และ UltraServers รวมถึงอินสแตนซ์ Inf2 สำหรับ Inferentia2 โดย Trainium3 UltraServers เปิดให้ใช้ทั่วไปเมื่อเดือนธันวาคม 2025 และขยายได้ถึง 144 ชิป เพิ่มจาก 64 ใน Trn2 UltraServers รุ่นก่อน ทุกอย่างวิ่งผ่าน Neuron SDK ทั้งนี้ AWS นำเสนอต้นทุนการย้ายระบบในแง่ที่มองโลกในแง่ดีกว่าผู้ผลิตส่วนใหญ่
หน้าเว็บ AWS Trainium ระบุว่า vLLM, HuggingFace Transformers และ TorchTitan ทำงานบน Trainium ได้แบบเนทีฟโดยไม่ต้องเขียนโค้ดเพิ่มและไม่ต้องย้ายระบบ นี่คือคำกล่าวอ้างของผู้ผลิตเกี่ยวกับสินค้าตัวเอง ไม่ใช่ผลที่ผ่านการตรวจสอบอย่างเป็นอิสระ
ทั้งสองอยู่ในการแลกที่ควรตัดสินใจอย่างตั้งใจ คุณได้ผู้จัดหาชิปรายที่สองเพิ่ม แต่เสียความสามารถในการย้ายเวิร์กโหลดนั้นไปคลาวด์อื่นโดยไม่ต้องทำงานใหม่ ซึ่งแทบไม่มีต้นทุนเลยสำหรับทีมที่ผูกกับผู้ให้บริการรายเดียวอยู่แล้ว แต่มีต้นทุนมหาศาลสำหรับทีมที่สร้างขึ้นบนหลักการเลี่ยงการผูกมัด
สิ่งที่ต้องใส่ลงในหน่วยความจำได้ เป็นตัวจำกัดทางเลือกก่อนอย่างอื่น เพราะ 144GB ต่อชิป Trainium3 เป็นโจทย์การวางแผนคนละแบบกับ 192GB ของ Ironwood ไม่ว่าใครจะเป็นคนขาย
Groq, Cerebras และ SambaNova ก้าวข้ามการเป็นแค่ API แบบโฮสต์
Groq, Cerebras และ SambaNova ต่างให้บริการ inference แบบโฮสต์ แต่ API ไม่ใช่เรื่องราวทั้งหมดของการเข้าถึงอีกต่อไป Groq จับคู่ GroqCloud เข้ากับโครงสร้างพื้นฐานเฉพาะอย่าง GroqMetal ส่วน Cerebras ให้เข้าถึงผ่านคลาวด์ควบคู่กับระบบ CS-3 ที่ติดตั้งในองค์กรได้ ขณะที่ SambaNova มี SambaCloud คู่กับ SambaRack และ SambaStack ความต่างตอนนี้จึงอยู่ที่ว่าคุณต้องการควบคุมโครงสร้างพื้นฐานมากแค่ไหน และยอมเดินเข้าไปในกระบวนการจัดซื้อระดับองค์กรได้ลึกเพียงใด
Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.
ประกาศของ Groq เอง ระบุว่า GroqCloud จะให้บริการต่อไปโดยไม่หยุดชะงัก
ในงาน GTC เดือนมีนาคม 2026 NVIDIA เปิดตัว NVIDIA Groq 3 LPU ภายในแพลตฟอร์ม Vera Rubin ของตน
ประกาศ Vera Rubin ของ NVIDIA อธิบายถึงแร็ค LPX ที่บรรจุโปรเซสเซอร์ LPU จำนวน 256 ตัว ซึ่งจะเปิดให้ใช้ในครึ่งหลังของปี 2026
Cerebras เลือกแนวทางเชิงกายภาพที่ตรงกันข้าม นั่นคือชิ้นส่วนเดียวขนาดเท่าเวเฟอร์ ที่มี 900,000 คอร์ และ SRAM บนชิป 44GB ระบุกำลังไว้ที่ 125 PFLOPs
หน้าเว็บด้าน inference ของ Cerebras ให้เครดิตฟรี 5 ดอลลาร์ และอธิบายการย้ายระบบว่าแก้โค้ดแค่สองจุด ยังมีความต่างหนึ่งที่สำคัญต่อการวางแผน นั่นคือ API แบบบริการตัวเองเป็นเส้นทาง inference ที่ง่าย ขณะที่การฝึก การปรับจูน ความจุแบบเฉพาะ และการติดตั้ง CS-3 ในองค์กร อยู่สูงขึ้นไปบนเส้นทางระดับองค์กร
เรื่องราวด้านฮาร์ดแวร์ปัจจุบันของ SambaNova มีศูนย์กลางอยู่ที่ SambaRack SN50 ซึ่งสร้างขึ้นรอบ RDU SN50 เจเนอเรชันที่ห้าจำนวน 16 ตัวต่อแร็ค โดย SambaCloud ยังเป็นเส้นทางแบบโฮสต์ ส่วน SambaRack และ SambaStack ให้โครงสร้างพื้นฐานเฉพาะที่รันได้ทั้งในองค์กรหรือในสภาพแวดล้อมแบบโฮสต์
การเข้าถึงแบบโฮสต์ยังเป็นจุดเริ่มต้นที่ง่ายที่สุดสำหรับทั้งสามราย แต่มันไม่ได้อธิบายตัวผลิตภัณฑ์ทั้งหมดอีกต่อไป
Tenstorrent ขายฮาร์ดแวร์ที่คุณเป็นเจ้าของได้
Tenstorrent เป็นผู้ผลิตรายเดียวในบทความนี้ที่คุณซื้อตัวเร่งความเร็วได้ตรง ๆ ในฐานะบุคคลทั่วไป และในราคาที่ไม่ถึงขั้นต้องตัดสินใจแบบลงทุนก้อนใหญ่
หน้าฮาร์ดแวร์ของ Tenstorrent ระบุราคา Blackhole p100a ไว้ที่ 999 ดอลลาร์ และ p150a กับ p150b ที่ 1,399 ดอลลาร์ มีสินค้าพร้อมส่งและจัดส่งภายในราวสองสัปดาห์ โดยสแตกทั้งหมดเป็นโอเพนซอร์ส
การ์ดเหล่านี้มีคอร์ Tensix 120 คอร์และคอร์ RISC-V 16 คอร์ โดย p100a มี GDDR6 28GB และคู่ p150 มี 32GB กินไฟสูงสุด 300W ทั้งนี้ p150a และ p150b เพิ่มพอร์ตอีเทอร์เน็ต QSFP-DD ที่ p100a ไม่มี ซึ่งเป็นสิ่งที่คุณจะซื้อถ้าตั้งใจจะเชื่อมการ์ดเข้าด้วยกัน HPCwire รายงานว่า Galaxy Blackhole ระดับแร็คเปิดให้ใช้ทั่วไปเมื่อวันที่ 28 เมษายน 2026 เริ่มต้นที่ 110,000 ดอลลาร์ ส่วนสาย Wormhole รุ่นเก่ายังวางขายอยู่ รวมถึงเวิร์กสเตชัน TT-LoudBox ราคา 12,000 ดอลลาร์
ข้อควรระวังนี้มีน้ำหนักต่อการตัดสินใจไม่แพ้ราคา และมันชี้ไปที่การ์ดรุ่นเก่านั่นเอง เอกสาร บทเรียน และการรองรับโมเดลที่ผ่านการตรวจสอบของ Tenstorrent ส่วนใหญ่ยังมุ่งไปที่ Wormhole ขณะที่การรองรับซอฟต์แวร์ของ Blackhole ยังอยู่ช่วงต้นของวงจร พูดให้ชัดคือ ทางนี้เหมาะกับคนที่ยอมลงแรงย้ายระบบจริง ๆ และอ่านซอร์สโค้ดเมื่อเอกสารหมด แต่ไม่เหมาะกับคนที่อยากให้โค้ด PyTorch เดิมรันได้โดยไม่ต้องแก้ ซึ่งเป็นความต้องการที่สมเหตุสมผลอย่างยิ่ง
Qualcomm, Intel และ Etched มีเส้นทางเข้าถึงที่แคบกว่า
ทั้งสามรายอยู่หลังเส้นทางเข้าถึงที่แคบกว่า ด้วยเหตุผลที่ไม่เกี่ยวข้องกันเลย Qualcomm กำลังวางโรดแมปตัวเร่งความเร็วสำหรับศูนย์ข้อมูลหลายเจเนอเรชันโดยยึดการติดตั้งระดับองค์กรเป็นแกน ส่วน Intel Gaudi 3 ยังใช้งานได้ผ่านการติดตั้งบางส่วนของ IBM Cloud ขณะที่ Crescent Island กำลังขยับเข้าสู่ช่วงส่งตัวอย่างให้ลูกค้า ด้าน Etched ระบุว่าแร็ค Sohu ชุดแรกจะส่งในฤดูร้อนปี 2026 ภายใต้สัญญาระดับองค์กร ไม่ใช่ผ่านบริการคลาวด์แบบบริการตัวเอง
โรดแมปศูนย์ข้อมูลของ Qualcomm ตอนนี้ครอบคลุม Dragonfly AI200, AI250 และ AI300 ที่เพิ่งประกาศ พร้อมจังหวะออกตัวเร่งความเร็วปีละรุ่นโดยเน้นการอนุมาน ทั้งหมดนี้ยังเป็นเส้นทางที่มุ่งลูกค้าองค์กร ไม่ใช่การเช่าตัวเร่งความเร็วแบบบริการตัวเองที่คุณเพิ่มเข้าบัญชีคลาวด์ได้ในวันนี้
Intel เป็นกรณีที่ให้บทเรียน เพราะ Gaudi 3 ไม่เคยได้การกระจายตัวบนคลาวด์ในวงกว้าง แต่ก็ยังไม่หายไปไหน IBM Cloud ยังเสนอโปรไฟล์เซิร์ฟเวอร์เสมือนที่เร่งด้วย Gaudi 3 ในแบบเปิดให้ใช้เฉพาะบางที่ รวมถึงการติดตั้งในดัลลัส วอชิงตัน ดีซี และแฟรงก์เฟิร์ต ก้าวถัดไปของ Intel คือ Crescent Island ซึ่งเป็น GPU ที่เน้นการอนุมาน และคาดว่าจะเข้าสู่ช่วงส่งตัวอย่างให้ลูกค้าในครึ่งหลังของปี 2026 วันนี้ Gaudi 3 จึงเป็นตัวเลือกที่แคบ ไม่ใช่ตัวเลือกที่จบไปแล้ว
Etched กำลังสร้าง Sohu ซึ่งเป็น ASIC ที่ออกแบบเฉพาะสำหรับการอนุมานโมเดล Transformer บริษัทระดมทุนได้ 800 ล้านดอลลาร์ มีซิลิคอน A0 ที่ทำงานได้จริง รายงานว่ามีสัญญาลูกค้าที่เซ็นแล้วมากกว่า 1 พันล้านดอลลาร์ และแร็คชุดแรกมีกำหนดส่งในฤดูร้อนปี 2026 คำกล่าวอ้างด้านประสิทธิภาพเป็นของบริษัทเองและยังไม่ได้ผ่านการวัดผลอย่างเป็นอิสระ ตัวเลขปริมาณงานจึงไม่ใช่ส่วนที่มีประโยชน์ ส่วนที่มีประโยชน์คือซอฟต์แวร์สแตก เพราะ Etched สร้างทั้งชิป แร็ค และสภาพแวดล้อมซอฟต์แวร์ให้เป็นแพลตฟอร์มเฉพาะทางชิ้นเดียว คุณจึงไม่ควรคิดว่าสแตกให้บริการยุค CUDA จะย้ายมาได้โดยไม่ต้องแก้ แบบนี้อาจได้ผลกับลูกค้าตามสัญญาที่รันการอนุมาน Transformer ในสเกลมหาศาล แต่เป็นการผูกมัดที่ใหญ่กว่ามากสำหรับทีมที่พึ่งพาความสามารถย้ายข้ามตัวเร่งความเร็ว
ชิปที่ใช้ภายในเท่านั้น และบริษัทที่สร้างชิปให้คนอื่น
มีสองสถานการณ์ที่มองจากภายนอกแล้วดูเหมือนบริษัทชิป AI แต่พฤติกรรมต่างกันคนละเรื่อง Meta และ Microsoft ออกแบบตัวเร่งความเร็วที่ตัวเองใช้งานเองและไม่ขายให้ใคร ส่วน Broadcom และ Marvell ออกแบบและนำสถาปัตยกรรมของบริษัทอื่นไปทำเป็นชิปจริง ทั้งสองกลุ่มไม่มีผลิตภัณฑ์ที่นักพัฒนาจะเช่าได้ ด้วยเหตุผลที่ไม่มีอะไรร่วมกันเลย
MTIA ของ Meta คือกรณีที่ชัดเจนที่สุดของแบบแรก
โพสต์ด้านวิศวกรรมของ Meta เอง อธิบายถึงการติดตั้งชิป MTIA หลายแสนตัวสำหรับเวิร์กโหลดการอนุมาน ครอบคลุมทั้งเนื้อหาแบบออร์แกนิกและโฆษณาบนแอปของบริษัท โดย MTIA 300 อยู่ในการใช้งานจริงแล้วสำหรับการฝึกจัดอันดับและแนะนำเนื้อหา ส่วน MTIA 400, 450 และ 500 วางแผนไว้ที่จังหวะราวหกเดือน นี่คือชิปจำนวนมหาศาลที่คุณจะไม่มีวันได้เช่าแม้แต่ชั่วโมงเดียว
กรณีของ Microsoft นั้นก้ำกึ่งกว่าเล็กน้อย Maia 200 ซึ่งเปิดตัวเมื่อเดือนมกราคม 2026 เป็นตัวเร่งความเร็วสำหรับการอนุมานที่ Microsoft ทำเองในปัจจุบัน และถูกนำไปใช้ในศูนย์ข้อมูลของบริษัทแล้ว โดยมี Maia SDK เปิดให้ใช้แบบพรีวิว ทั้งนี้ Microsoft ยังไม่ได้ระบุถึงอินสแตนซ์ Maia แบบบริการตัวเองสำหรับสาธารณะ มันจึงยังอยู่ฝั่งใช้ภายในหรือผูกกับ Azure ในการเปรียบเทียบนี้
ส่วน Broadcom และ Marvell เป็นอีกเรื่องหนึ่งเลย ซึ่งควรทำความเข้าใจให้ชัด เพราะชื่อของทั้งคู่โผล่ข้าง ๆ NVIDIA อยู่ตลอด TPU ของ Google เป็นตัวอย่างที่ดี Google เป็นเจ้าของทั้งตัวผลิตภัณฑ์และสถาปัตยกรรม TPU ขณะที่ Broadcom เข้ามาช่วยงานออกแบบและทำชิปเฉพาะทางให้เป็นจริง ซึ่งอาจรวมถึงการเชื่อมต่อภายใน การแพ็กเกจ และเส้นทางจากสถาปัตยกรรมไปสู่ชิปที่ผลิตได้จริง ทั้งนี้ Broadcom ไม่ได้ขาย TPU หรือตัวเร่งความเร็วอเนกประสงค์อื่นให้นักพัฒนาโดยตรง รายได้ส่วนธุรกิจ AI ของบริษัทตามผลประกอบการไตรมาสแรกปีงบประมาณ 2026 อยู่ที่ 8.4 พันล้านดอลลาร์ เพิ่มขึ้น 106 เปอร์เซ็นต์เมื่อเทียบปีต่อปี ซึ่งอธิบายว่าทำไมชื่อนี้จึงอยู่ทุกที่ แต่มันก็ยังไม่ใช่ชิปที่คุณเช่าได้
และตรงนี้เองที่คำว่า ผู้ผลิต เริ่มแบกน้ำหนักที่มันแบกไม่ไหว Broadcom และ Marvell ไม่ได้ผลิตชิป และผู้ผลิตชิป AI ส่วนใหญ่ที่ยกมาข้างต้นก็เช่นกัน เกือบทั้งหมดเป็นแบบ fabless คือออกแบบชิปแล้วจ้างคนอื่นผลิตทั้งหมด
จับคู่เส้นทางการเข้าถึงให้เข้ากับเวิร์กโหลดของคุณ
การฝึกในสเกลใหญ่บีบตัวเลือกที่ทำได้จริงให้แคบลงอย่างรวดเร็ว ได้แก่ AMD Instinct ที่หาได้กว้าง, TPU หรือ Trainium ที่ผูกกับคลาวด์เดียว หรือการติดตั้ง Cerebras ระดับองค์กร ส่วนการอนุมานในระบบจริงเปิดทางได้มากกว่า เพราะ Groq, Cerebras และ SambaNova ต่างมีบริการแบบโฮสต์ พร้อมกับโครงสร้างพื้นฐานเฉพาะในรูปแบบใดรูปแบบหนึ่ง ขณะที่การทดลองกว้างกว่านั้นอีก ตั้งแต่การใช้ TPU ฟรี ไปจนถึงการ์ด Tenstorrent ที่คุณเสียบเข้าเครื่องตัวเองได้
เส้นแบ่งเหล่านี้พร่าเลือนกว่าที่ตารางจะแสดงได้ คำถามไม่ได้อยู่แค่ว่าชิปทำอะไรได้ แต่อยู่ที่ว่าคุณเข้าถึงมันได้จากที่ไหน ซอฟต์แวร์สแตกเดิมของคุณเหลือรอดจากการย้ายมากแค่ไหน และเวิร์กโหลดที่ได้จะย้ายไปที่อื่นได้อีกในภายหลังหรือไม่ Cerebras ฝึกและอนุมานได้บนโครงสร้างพื้นฐานระดับองค์กร ขณะที่ Trainium ยังผูกอยู่กับ AWS
ไม่มีอะไรในนี้ที่โค่น NVIDIA ลงได้ สำหรับทีมส่วนใหญ่ คำถามที่มีชีวิตจริงไม่ใช่ว่าจะทิ้ง CUDA หรือไม่ แต่คือคุ้มไหมที่จะดูแลสแตกที่สองควบคู่ไปด้วย
จะเลือกขนาดการ์ดรุ่นไหน คือการตัดสินใจที่เหลืออยู่ถ้าคุณอยู่ที่เดิม และนั่นเป็นโจทย์คนละข้อกับบทความนี้
ช่องทางเป็นตัวตัดสินมากกว่าตัวชิป การ์ดที่วางอยู่บนโต๊ะคุณ กับชิปคลาสเดียวกันที่อยู่หลัง API ของคนอื่น ไม่ใช่เครื่องมือเดียวกัน แม้ปริมาณงานจะออกมาใกล้เคียงกันก็ตาม เพราะอย่างหนึ่งเปิดให้คุณลองสิ่งที่ยังไม่เคยคิดถึง ส่วนอีกอย่างเรียกเก็บเงินเป็นโทเคนสำหรับสิ่งที่คุณรู้อยู่แล้วว่าจะถามอะไร
คำถามที่พบบ่อย
เช่า Google TPU ได้จริงไหม
ได้ TPU7x ซึ่งเป็น TPU ตระกูล Ironwood ที่เปิดให้ใช้ทั่วไปในปัจจุบันของ Google มีให้ใช้บน Google Cloud และที่นั่นเท่านั้น TPU รุ่นเก่ากว่าก็ยังมีให้ใช้ ส่วน Colab, Kaggle และ TPU Research Cloud ก็ให้ใช้ TPU ฟรีสำหรับงานบางประเภท ทั้งนี้ JAX ยังเป็นเส้นทางดั้งเดิม ขณะที่ PyTorch ทำงานผ่าน PyTorch/XLA
ทางเลือกแทน NVIDIA ตัวไหนรันโค้ด PyTorch เดิมได้โดยใช้แรงน้อยที่สุด
ส่วนใหญ่คือ AMD Instinct เพราะ ROCm เป็นแบ็กเอนด์ที่ PyTorch รองรับอย่างเป็นทางการ เส้นทางโค้ดจึงมีอยู่แล้ว ส่วน TPU ของ Google รัน PyTorch ผ่านสะพาน PyTorch/XLA ซึ่งเป็นชั้นแปลคำสั่ง ด้าน AWS ระบุว่า vLLM, HuggingFace Transformers และ TorchTitan รันบน Trainium ได้โดยไม่ต้องย้ายระบบ ซึ่งเป็นคำกล่าวอ้างของผู้ผลิตเอง ที่ปลายอีกด้าน Sohu ของ Etched ใช้ซอฟต์แวร์สแตกเฉพาะทางของตัวเอง คุณจึงควรเผื่องานย้ายระบบไว้มากกว่ากรณี ROCm หรือ PyTorch/XLA อย่างมีนัยสำคัญ
ทำไม Broadcom และ Qualcomm ถึงถูกเรียกว่าคู่แข่ง NVIDIA ทั้งที่คุณเช่าชิปของพวกเขาไม่ได้
ด้วยเหตุผลคนละอย่าง Broadcom ทำงานด้านชิปเฉพาะทางให้บริษัทที่สร้างตัวเร่งความเร็วของตัวเอง แทนที่จะขายตัวเร่งความเร็วมาตรฐานให้นักพัฒนาโดยตรง ส่วน Qualcomm ออกแบบตัวเร่งความเร็ว Dragonfly ของตัวเอง โดยมี AI200, AI250 และ AI300 อยู่บนโรดแมปศูนย์ข้อมูลแล้ว แต่การเข้าถึงมุ่งไปที่ลูกค้าองค์กร ไม่ใช่การเช่าคลาวด์แบบบริการตัวเองตามปกติ ทั้งคู่แข่งขันในโครงสร้างพื้นฐาน AI โดยไม่ได้ให้นักพัฒนาเข้าถึงในรูปแบบสาธารณะเหมือน NVIDIA หรือ AMD
ซื้อตัวเร่งความเร็ว AI ขาดเลยแทนที่จะเช่าได้ไหม
ได้ Tenstorrent ขายการ์ดสำหรับนักพัฒนา Blackhole โดยตรง เริ่มที่ 999 ดอลลาร์สำหรับ p100a ไปจนถึง 1,399 ดอลลาร์สำหรับ p150a และ p150b มีสินค้าพร้อมส่งและจัดส่งภายในราวสองสัปดาห์ พร้อมซอฟต์แวร์สแตกที่เป็นโอเพนซอร์สทั้งหมด ข้อควรระวังสำคัญพอ ๆ กับราคา เพราะเอกสารและการรองรับโมเดลที่ผ่านการตรวจสอบส่วนใหญ่ยังมุ่งไปที่การ์ด Wormhole รุ่นเก่า จึงควรกันเวลาสำหรับการย้ายระบบไว้ แทนที่จะคาดหวังว่าโค้ดเดิมจะรันได้เลยโดยไม่ต้องแก้
การสนทนา
ความคิดเห็น
เข้าสู่ระบบเพื่อร่วมสนทนา