Chuyển đến nội dung chính
Giảm 50% tất cả các gói, có thời hạn. Khởi điểm từ $2.48/mo
16 min left
AI và Machine Learning

Các công ty và nhà sản xuất chip AI hàng đầu: những lựa chọn thay thế NVIDIA thực sự giao hàng

J Bởi Jeremy 16 phút đọc
Các công ty chip AI hàng đầu: một card đồ họa, một module tăng tốc, một tấm wafer silicon và các bo mạch máy chủ đặt trên nền đỏ sẫm

Bạn có thể đặt mua card dành cho nhà phát triển Tenstorrent Blackhole ngay tuần này. Giá 999 $, còn hàng và giao trong khoảng hai tuần. Ngược lại, bạn không thể mua hay thuê Meta MTIA qua kênh công khai; Meta mô tả MTIA là silicon mà hãng triển khai cho khối lượng công việc của chính mình.

Cả hai công ty đều được xếp vào nhóm công ty chip AI hàng đầu. Khoảng cách giữa hai tình huống đó chính là nội dung của bài viết này.

Phần tiếp theo đi lần lượt từng nhà cung cấp: bạn lấy được gì, qua kênh nào, và phần mềm tốn của bạn bao nhiêu sau khi đã có phần cứng.

Tóm tắt nhanh

  • Thuê được rộng rãi: AMD Instinct vẫn có độ phủ đám mây công cộng rộng nhất ngoài NVIDIA, nhưng dòng sản phẩm đã đi tiếp. AMD ra mắt MI400 Series vào tháng 7 năm 2026, trong khi các hệ thống MI300X, MI325X và dòng MI350 vẫn là thứ bạn dễ tìm thuê nhất.
  • Một đám mây: TPU của Google chỉ nằm trên Google Cloud, với TPU7x Ironwood đã phát hành rộng rãi từ tháng 3 năm 2026. AWS Trainium và Inferentia chỉ nằm trên AWS.
  • API cộng hạ tầng riêng: Groq, Cerebras và SambaNova đều cung cấp suy luận được lưu trữ, nhưng gọi họ là chỉ có API thì không còn đúng. Mỗi bên giờ đều có thêm hướng riêng hoặc tại chỗ.
  • Phần cứng bạn có thể mua sắm: Tenstorrent bán thẳng card Blackhole. Qualcomm giới thiệu các bộ tăng tốc trung tâm dữ liệu Dragonfly qua đường liên hệ bán hàng doanh nghiệp, chứ không chỉ là các thông báo lộ trình.
  • Hạn chế hoặc nội bộ: Intel Gaudi 3 vẫn dùng được qua một số triển khai IBM Cloud, còn Crescent Island dự kiến bước vào giai đoạn gửi mẫu cho khách hàng trong nửa cuối năm 2026. Etched nói những rack đầu tiên sẽ giao cho khách hàng có hợp đồng vào mùa hè 2026. Meta MTIA và Microsoft Maia vẫn là hàng nội bộ hoặc tích hợp Azure, không phải bộ tăng tốc tự phục vụ công khai.

Bài viết này không đề cập đến điều gì

Ba thứ được cố ý đặt ngoài khuôn khổ bài này, và mọi trạng thái nhà cung cấp bên dưới phản ánh tháng 8 năm 2026.

  • Giá cả. Câu hỏi ở đây là bạn có lấy được phần cứng hay không, chứ không phải một giờ chạy trên đó tốn bao nhiêu.
  • Dự đoán. Không phán đoán ai sẽ thắng.
  • Card phổ thông và card máy để bàn. Chủ đề ở đây là bộ tăng tốc cho trung tâm dữ liệu và đám mây.

Năm cách để có được năng lực tính toán trên một bộ tăng tốc AI

Năm bậc tiếp cận bộ tăng tốc AI vào tháng 8 năm 2026, đi từ mở nhất đến hạn chế nhất: nhiều đám mây cho AMD Instinct, một đám mây duy nhất cho Google TPU7x và AWS Trainium, hạ tầng lưu trữ cộng hạ tầng riêng cho Groq, Cerebras và SambaNova, phần cứng hoặc bán hàng doanh nghiệp cho Tenstorrent, Qualcomm và Etched, và chỉ dùng nội bộ với Meta MTIA và Microsoft Maia 200

Năm con đường tiếp cận bao trùm các bộ tăng tốc trong bài này: thuê trên nhiều đám mây, thuê qua một đám mây duy nhất, truy cập API được lưu trữ, phần cứng chuyên dụng hoặc mua được trực tiếp, và quyền truy cập doanh nghiệp hạn chế cho những sản phẩm không mở tự phục vụ rộng rãi. Một số công ty giờ trải trên nhiều con đường cùng lúc. Một nhóm riêng vẫn hoàn toàn nội bộ, không có cách công khai nào để thuê hay mua con chip đó.

Khả năng tiếp cận là một trạng thái, không phải thuộc tính vĩnh viễn của công ty. Nó thay đổi khi các thế hệ mới ra mắt, khi các đám mây thêm hoặc bỏ phần cứng, và khi nhà cung cấp mở hay đóng kênh mua sắm. Nó cũng chẳng nói gì về chất lượng hay quy mô. Nó mô tả cách bạn lấy được năng lực tính toán, và chính kênh đó quyết định một cái tên có phải thứ bạn hành động được hay không.

NVIDIA nắm phần lớn doanh thu bộ tăng tốc AI cho trung tâm dữ liệu, có mặt trên gần như mọi đám mây, và CUDA là bề mặt mà mọi thứ khác đều bị đem ra so sánh. Các công ty bộ tăng tốc AI còn lại trong bài đáng chú ý chính vì cách tiếp cận chúng khác nhau đến vậy.

Nhà cung cấp và sản phẩmBậc tiếp cậnCách lấy đượcNgăn xếp phần mềmKhối lượng công việcTrạng thái
NVIDIA (mốc so sánh, không phải lựa chọn thay thế)Nhiều đám mâyGần như mọi nhà cung cấp đám mâyCUDAHuấn luyện và suy luậnPhát hành rộng rãi
AMD Instinct MI300XNhiều đám mâyVultr, TensorWave, Oracle Cloud, DigitalOcean, Crusoe, Hot Aisle, RunPod, Seeweb, CirrascaleROCmHuấn luyện và suy luậnPhát hành rộng rãi
AMD Instinct MI325XNhiều đám mâyVultr, TensorWave, DigitalOceanROCmHuấn luyện và suy luậnPhát hành rộng rãi
Google TPU7x (Ironwood)Một đám mâyGoogle CloudJAX, và PyTorch qua PyTorch/XLAHuấn luyện và suy luậnPhát hành rộng rãi từ ngày 31 tháng 3 năm 2026
AWS TrainiumMột đám mâyCác instance AWS EC2 Trainium và UltraServers (Trn2, Trainium3)Neuron SDKHuấn luyện và suy luậnPhát hành rộng rãi
AWS Inferentia2Một đám mâyCác instance AWS EC2 Inf2Neuron SDKSuy luậnPhát hành rộng rãi
Groq LPUAPI được lưu trữ và hạ tầng riêngGroqCloud và GroqMetalAPI tương thích OpenAI và ngăn xếp GroqSuy luậnCòn cung cấp
Cerebras WSE-3 và CS-3API được lưu trữ, đám mây doanh nghiệp, tại chỗCerebras Cloud và hệ thống CS-3Ngăn xếp phần mềm CerebrasHuấn luyện và suy luậnCòn cung cấp
SambaNova SN50API được lưu trữ, riêng, tại chỗSambaCloud và SambaRackSambaStackSuy luậnBắt đầu giao cho khách hàng vào nửa cuối năm 2026
Intel Gaudi 3Đám mây chọn lọcIBM Cloud đám mâyBộ phần mềm Intel GaudiHuấn luyện, tinh chỉnh và suy luậnChỉ có ở một số nơi
Tenstorrent BlackholeMua phần cứngMua thẳng từ TenstorrentNgăn xếp TT-Metalium mã nguồn mởSuy luận và công việc phát triểnCòn hàng, giao trong khoảng hai tuần
Qualcomm AI200, AI250 và AI300Bán hàng doanh nghiệpLiên hệ bộ phận bán hàngNgăn xếp phần mềm AI của QualcommSuy luậnAI200 dự kiến năm 2026, gửi mẫu AI250 dự kiến năm 2027, gửi mẫu AI300 dự kiến năm 2028
Etched SohuTriển khai theo hợp đồngHợp đồng doanh nghiệpNgăn xếp phần mềm EtchedSuy luận transformerNhững rack đầu tiên giao vào mùa hè 2026
Meta MTIAKhông thể có đượcKhông có đường bên ngoàiBộ công cụ nội bộ của MetaCông việc xếp hạng, gợi ý và GenAI của chính MetaChỉ nội bộ
Microsoft Maia 200Nội bộ, tích hợp AzureTrung tâm dữ liệu của MicrosoftMaia SDKSuy luậnTriển khai nội bộ, không có instance tự phục vụ công khai

AMD Instinct là thứ bạn thuê được gần như ở mọi nơi

Trong số các lựa chọn thay thế NVIDIA ở đây, AMD Instinct có độ phủ nhà cung cấp rộng nhất: MI300X và MI325X có mặt ở nhiều nhà cung cấp đám mây và neocloud thay vì bị buộc vào một hyperscaler duy nhất. AMD ra mắt MI400 Series vào tháng 7 năm 2026 với MI455X dẫn đầu, nhưng các thế hệ cũ vẫn quan trọng vì đó mới là thứ bạn dễ bắt gặp trong các dịch vụ cho thuê đang chạy. ROCm vẫn là bước chuyển phần mềm ngắn nhất trong bài này với phần lớn khối lượng công việc PyTorch hiện có.

Phần cứng không phải là giới hạn. MI300X mang 192GB HBM3 ở 5,3 TB/s trải trên 304 đơn vị tính toán CDNA3 trong một module 750W. MI325X đẩy con số đó lên 256GB HBM3E ở 6 TB/s và 1000W, một dung lượng thấp hơn mức 288GB mà AMD công bố lúc đầu.

CUDA cores là thứ NVIDIA đếm, còn AMD thì đếm đơn vị tính toán, và hai con số này không quy đổi cho nhau, đó là lý do so sánh bộ nhớ và băng thông giữa các hãng hữu ích hơn.

Tình hình phần mềm đã thay đổi, còn tiếng tăm thì đi sau. Phần hỗ trợ PyTorch của ROCm đã được đưa ngược lên kho PyTorch chính thức thay vì nằm trong một bản fork cộng đồng, và các bản ROCm hiện tại bám sát các framework hiện tại. ROCm 7.14.0 hỗ trợ PyTorch 2.12, cùng với các tích hợp hiện thời của AMD cho hệ sinh thái phần mềm AI rộng hơn.

Cách tôi hiểu là: ma sát mà người ta vẫn kể không nằm ở thông lượng, cũng không nằm ở hỗ trợ framework. Nó là khảo cổ học. Khi một cấu hình CUDA hỏng lúc ba giờ sáng, đã có ai đó gặp đúng chuỗi lỗi ấy và ghi lại cách sửa. Trên ROCm, kết quả tìm kiếm mỏng hơn, nên thời gian trôi vào việc tìm chứ không phải việc sửa. Chi phí đó chẳng bao giờ hiện lên trong một bài benchmark.

Mảng bộ tăng tốc của AMD còn vươn ra ngoài trung tâm dữ liệu, và điều đó đáng kể nếu bạn muốn phần cứng rẻ để học ngăn xếp này.

Bản demo cụm mini PC của AMD chạy trên chính con chip phổ thông của hãng này.

Google TPU và AWS Trainium mỗi bên chỉ thuê được trên đúng một đám mây

TPU7x của Google và Trainium của AWS đều đã phát hành rộng rãi và đều bị khóa vào một nhà cung cấp duy nhất. TPU chạy trên Google Cloud. Trainium và Inferentia chạy trên AWS. Không bên nào cho bạn khả năng dịch chuyển giữa nhiều nhà cung cấp như AMD hay NVIDIA, và ràng buộc đó có thể quan trọng hơn bất kỳ thông số riêng lẻ nào.

TPU7x là bản phát hành đầu tiên trong dòng Ironwood thế hệ thứ bảy của Google và đã phát hành rộng rãi vào ngày 31 tháng 3 năm 2026. Google định vị nó cho huấn luyện và suy luận quy mô lớn. Trillium v6e vẫn còn dùng được, còn Ironwood vẫn là thế hệ TPU đang phát hành rộng rãi hiện tại của Google. Google cũng đã công bố TPU 8t và TPU 8i thế hệ thứ tám, nhưng cả hai vẫn được ghi là sắp ra mắt.

Sự thật hữu ích nhất về TPU không nằm trên bảng thông số. Có một lối vào miễn phí: cả Colab và Kaggle đều cung cấp runtime TPU, còn TPU Research Cloud thì cấp thời gian cho các nhà nghiên cứu. Lối vào miễn phí đó cho bạn cách thử con đường phần mềm của TPU trước khi cam kết ngân sách đám mây, dù không nên mặc định rằng các dịch vụ miễn phí sẽ cấp đúng phần cứng Ironwood mới nhất.

AWS tiếp cận con chip của chính mình qua các instance Trainium và UltraServers, cộng thêm instance Inf2 cho Inferentia2. Trainium3 UltraServers đã phát hành rộng rãi vào tháng 12 năm 2025 và mở rộng tới 144 chip, tăng từ 64 trên Trn2 UltraServers đời trước. Mọi thứ đều đi qua Neuron SDK. AWS trình bày chi phí chuyển đổi lạc quan hơn phần lớn nhà cung cấp.

Trang AWS Trainium nói rằng vLLM, HuggingFace Transformers và TorchTitan chạy gốc trên Trainium mà không cần mã tùy chỉnh và không cần công sức chuyển đổi. Đó là tuyên bố của nhà cung cấp về chính sản phẩm của họ, không phải kết quả được kiểm chứng độc lập.

Cả hai đều nằm trong một sự đánh đổi đáng làm một cách có chủ ý. Bạn có thêm một nguồn cung chip thứ hai và mất khả năng chuyển khối lượng công việc đó sang đám mây khác mà không phải làm lại từ đầu, điều gần như chẳng tốn gì với một đội đã cam kết với một nhà cung cấp, nhưng tốn tất cả với một đội được dựng lên quanh việc né cam kết.

Thứ phải vừa trong bộ nhớ mới là thứ ràng buộc lựa chọn trước tiên: 144GB mỗi chip Trainium3 là một bài toán quy hoạch khác với 192GB của Ironwood, bất kể ai bán nó.

Groq, Cerebras và SambaNova đi xa hơn API được lưu trữ

Groq, Cerebras và SambaNova đều cung cấp suy luận được lưu trữ, nhưng API không còn là toàn bộ câu chuyện tiếp cận. Groq ghép GroqCloud với hạ tầng riêng GroqMetal. Cerebras cung cấp truy cập đám mây bên cạnh các hệ thống CS-3 có thể chạy tại chỗ. SambaNova cung cấp SambaCloud bên cạnh SambaRack và SambaStack. Điểm khác biệt bây giờ là bạn cần bao nhiêu quyền kiểm soát hạ tầng và sẵn sàng đi sâu tới đâu vào quy trình mua sắm doanh nghiệp.

Groq's LPU packs 230MB of on-die SRAM with 80 TB/s of internal bandwidth, a design that trades memory capacity for latency, and GroqCloud exposes it as an OpenAI-compatible endpoint. The ownership story attached to it carries dates worth keeping. On 24 December 2025, Groq entered a non-exclusive inference technology licensing agreement with NVIDIA, and said founder Jonathan Ross and president Sunny Madra would join NVIDIA. Groq continues to operate independently. Simon Edwards, previously its chief financial officer, stepped up to lead it at the time of the deal; check the company for current leadership before citing it.

Thông báo của chính Groq nói rằng GroqCloud sẽ tiếp tục hoạt động không gián đoạn.

Tại GTC tháng 3 năm 2026, NVIDIA giới thiệu NVIDIA Groq 3 LPU bên trong nền tảng Vera Rubin của hãng.

Thông báo Vera Rubin của NVIDIA mô tả một rack LPX gồm 256 bộ xử lý LPU, có mặt vào nửa cuối năm 2026.

Cerebras chọn hướng vật lý ngược lại: một linh kiện cỡ nguyên tấm wafer với 900.000 nhân và 44GB SRAM trên chip, công bố ở mức 125 PFLOPs.

Trang suy luận của Cerebras cung cấp 5 $ tín dụng miễn phí và mô tả việc chuyển đổi chỉ gọn trong hai thay đổi mã. Một khác biệt vẫn quan trọng khi lập kế hoạch: API tự phục vụ là con đường suy luận dễ đi, còn huấn luyện, tinh chỉnh, dung lượng riêng và triển khai CS-3 tại chỗ nằm xa hơn trên con đường doanh nghiệp.

Câu chuyện phần cứng hiện tại của SambaNova xoay quanh SambaRack SN50, dựng trên 16 RDU SN50 thế hệ thứ năm mỗi rack. SambaCloud vẫn là hướng lưu trữ, còn SambaRack và SambaStack cung cấp hạ tầng riêng có thể chạy tại chỗ hoặc trong môi trường được lưu trữ.

Truy cập được lưu trữ vẫn là điểm vào dễ nhất cho cả ba, nhưng nó không còn mô tả trọn vẹn sản phẩm nữa.

Tenstorrent bán phần cứng mà bạn có thể sở hữu

Tenstorrent là nhà cung cấp duy nhất trong bài này mà bạn có thể mua đứt bộ tăng tốc với tư cách cá nhân, ở mức giá không phải một quyết định đầu tư.

Trang phần cứng của Tenstorrent niêm yết Blackhole p100a ở mức 999 $ và p150a cùng p150b ở mức 1.399 $, còn hàng và giao trong khoảng hai tuần. Toàn bộ ngăn xếp là mã nguồn mở.

Các card này mang 120 nhân Tensix và 16 nhân RISC-V, với 28GB GDDR6 trên p100a và 32GB trên cặp p150, tiêu thụ tới 300W. p150a và p150b bổ sung cổng Ethernet QSFP-DD mà p100a không có, và đó là thứ bạn mua nếu định nối các card lại với nhau. HPCwire đưa tin Galaxy Blackhole quy mô rack đã phát hành rộng rãi vào ngày 28 tháng 4 năm 2026 với giá từ 110.000 $, còn dòng Wormhole cũ hơn vẫn được bán, bao gồm máy trạm TT-LoudBox giá 12.000 $.

Lời lưu ý này nặng ký với quyết định chẳng kém gì giá tiền, và nó chỉ thẳng vào chiếc card đời cũ kia. Phần lớn tài liệu, hướng dẫn và danh sách mô hình đã kiểm chứng của Tenstorrent vẫn nhắm vào Wormhole. Hỗ trợ phần mềm cho Blackhole thì còn ở giai đoạn sớm hơn. Cụ thể: hướng này hợp với người sẵn sàng làm công việc chuyển đổi thực sự và đọc mã nguồn khi tài liệu hết chỗ. Nó không hợp với người muốn mã PyTorch sẵn có chạy y nguyên, mà đó lại là mong muốn hoàn toàn hợp lý.

Qualcomm, Intel và Etched có con đường tiếp cận hẹp hơn

Ba cái tên này nằm sau những con đường tiếp cận hẹp hơn, vì những lý do chẳng liên quan gì đến nhau. Qualcomm đang dựng một lộ trình bộ tăng tốc trung tâm dữ liệu trải nhiều thế hệ, xoay quanh các triển khai doanh nghiệp. Intel Gaudi 3 vẫn dùng được qua một số triển khai IBM Cloud trong khi Crescent Island tiến dần tới giai đoạn gửi mẫu cho khách hàng. Etched nói những rack Sohu đầu tiên sẽ giao vào mùa hè 2026 theo hợp đồng doanh nghiệp, chứ không qua một dịch vụ đám mây tự phục vụ.

Lộ trình trung tâm dữ liệu của Qualcomm hiện trải qua Dragonfly AI200, AI250 và AI300 vừa công bố, với nhịp ra bộ tăng tốc hằng năm tập trung vào suy luận. Đây vẫn là hướng nhắm tới doanh nghiệp, chứ không phải kiểu thuê bộ tăng tốc tự phục vụ mà hôm nay bạn thêm vào tài khoản đám mây là xong.

Intel là trường hợp đáng học hỏi, vì Gaudi 3 chưa bao giờ đạt được độ phủ đám mây rộng, nhưng cũng chưa biến mất. IBM Cloud vẫn cung cấp các profile máy chủ ảo tăng tốc bằng Gaudi 3 ở dạng chỉ có tại một số nơi, gồm các triển khai ở Dallas, Washington DC và Frankfurt. Bước tiếp theo của Intel là Crescent Island, một GPU thiên về suy luận, dự kiến bước vào giai đoạn gửi mẫu cho khách hàng trong nửa cuối năm 2026. Gaudi 3 hôm nay là một lựa chọn hẹp, chứ không phải một lựa chọn đã khép lại.

Etched đang xây Sohu, một ASIC chuyên cho suy luận transformer. Công ty đã gọi được 800 triệu đô la, có silicon A0 chạy được, báo cáo hơn 1 tỷ đô la hợp đồng khách hàng đã ký, và những rack đầu tiên dự kiến giao vào mùa hè 2026. Các tuyên bố hiệu năng là của chính họ và chưa được đo kiểm độc lập, nên con số thông lượng không phải phần hữu ích. Phần hữu ích là ngăn xếp phần mềm. Etched dựng con chip, cái rack và môi trường phần mềm thành một nền tảng chuyên biệt duy nhất, nên đừng mặc định rằng ngăn xếp phục vụ thời CUDA sẽ chuyển sang y nguyên. Điều đó có thể ổn với một khách hàng theo hợp đồng chạy suy luận transformer ở quy mô khổng lồ, nhưng là một cam kết lớn hơn nhiều với một đội phụ thuộc vào khả năng dịch chuyển giữa các bộ tăng tốc.

Chip chỉ dùng nội bộ và những hãng làm chip cho người khác

Có hai tình huống nhìn từ bên ngoài đều giống một công ty chip AI, nhưng cách vận hành thì chẳng giống nhau chút nào. Meta và Microsoft thiết kế những bộ tăng tốc mà chính họ vận hành và không bán cho ai. Broadcom và Marvell thiết kế và hiện thực hóa chip cho kiến trúc của các công ty khác. Không nhóm nào có sản phẩm mà một lập trình viên thuê được, vì những lý do chẳng liên quan gì đến nhau.

MTIA của Meta là ví dụ rõ ràng nhất của kiểu thứ nhất.

Bài viết kỹ thuật của chính Meta mô tả việc triển khai hàng trăm nghìn chip MTIA cho các khối lượng suy luận trải trên cả nội dung tự nhiên lẫn quảng cáo trong các ứng dụng của hãng, với MTIA 300 đã vào sản xuất cho huấn luyện xếp hạng và gợi ý, còn MTIA 400, 450 và 500 được lên kế hoạch theo nhịp khoảng sáu tháng. Đó là một lượng chip khổng lồ mà bạn sẽ không bao giờ thuê được dù chỉ một giờ.

Trường hợp của Microsoft mềm hơn ở phần rìa. Maia 200, giới thiệu vào tháng 1 năm 2026, là bộ tăng tốc suy luận tự làm hiện tại của Microsoft và đã được triển khai trong các trung tâm dữ liệu của hãng, với Maia SDK có ở bản xem trước. Microsoft hiện chưa ghi nhận một instance Maia tự phục vụ công khai nào, nên nó vẫn thuộc về phía nội bộ hoặc tích hợp Azure trong bảng so sánh này.

Broadcom và Marvell lại là chuyện khác nữa, và đáng làm rõ vì tên họ liên tục xuất hiện cạnh NVIDIA. TPU của Google là ví dụ hữu ích. Google sở hữu sản phẩm và kiến trúc TPU, trong khi Broadcom đóng góp phần thiết kế và hiện thực hóa chip tùy biến, có thể gồm kết nối nội bộ, đóng gói, và con đường từ kiến trúc tới con chip sản xuất được. Broadcom không bán TPU, cũng không bán bộ tăng tốc đa dụng nào khác, trực tiếp cho lập trình viên. Doanh thu mảng AI của hãng, theo báo cáo quý tài chính đầu tiên năm 2026, đạt 8,4 tỷ đô la, tăng 106 phần trăm so với cùng kỳ, và điều đó giải thích vì sao cái tên này ở khắp nơi. Nó vẫn không phải con chip bạn thuê được.

Và đây chính là chỗ chữ nhà sản xuất bắt đầu gánh một sức nặng mà nó không kham nổi. Broadcom và Marvell không sản xuất chip, và phần lớn các nhà sản xuất chip AI liệt kê ở trên cũng vậy: gần như tất cả đều fabless, tức là họ thiết kế chip rồi thuê hẳn bên khác gia công.

Ghép con đường tiếp cận với khối lượng công việc của bạn

Huấn luyện ở quy mô lớn nhanh chóng thu hẹp các lựa chọn thực tế: AMD Instinct sẵn có rộng rãi, TPU hay Trainium gắn với một đám mây, hoặc một triển khai Cerebras cấp doanh nghiệp. Suy luận trong sản xuất mở ra nhiều hướng hơn, vì Groq, Cerebras và SambaNova đều có dịch vụ lưu trữ đi kèm một dạng hạ tầng riêng nào đó. Giai đoạn thử nghiệm thì lại rộng hơn nữa, từ truy cập TPU miễn phí cho tới một chiếc card Tenstorrent bạn cắm vào máy của chính mình.

Những ranh giới đó mềm hơn nhiều so với những gì một cái bảng thể hiện được. Câu hỏi không chỉ là con chip làm được gì, mà còn là bạn với tới nó ở đâu, bao nhiêu phần trong ngăn xếp phần mềm hiện có của bạn sống sót qua cuộc dịch chuyển, và liệu khối lượng công việc thu được sau đó có đi nơi khác được không. Cerebras có thể huấn luyện và suy luận trên hạ tầng doanh nghiệp, còn Trainium vẫn buộc vào AWS.

Không điều nào trong số này lật đổ được NVIDIA. Với phần lớn các đội, câu hỏi thật sự không phải có rời CUDA hay không, mà là có đáng duy trì thêm một ngăn xếp thứ hai bên cạnh nó hay không.

Chọn card nào để tính dung lượng là quyết định còn lại nếu bạn ở nguyên chỗ cũ, và đó là một bài toán khác với bài này.

Kênh quyết định nhiều hơn con chip. Một tấm card trên bàn bạn và cùng hạng chip đó nằm sau API của người khác không phải cùng một công cụ, kể cả khi thông lượng xấp xỉ nhau, bởi một bên cho bạn thử những thứ bạn còn chưa nghĩ ra, còn bên kia tính tiền theo token cho những gì bạn đã biết cách hỏi.

Câu hỏi thường gặp

Bạn có thật sự thuê được Google TPU không?

Có. TPU7x, chiếc TPU dòng Ironwood đang phát hành rộng rãi hiện nay của Google, có trên Google Cloud và chỉ ở đó. Các thế hệ TPU cũ hơn cũng còn dùng được, còn Colab, Kaggle và TPU Research Cloud cấp quyền dùng TPU miễn phí cho một số khối lượng công việc. JAX vẫn là con đường gốc, còn PyTorch chạy qua PyTorch/XLA.

Lựa chọn thay thế NVIDIA nào chạy mã PyTorch sẵn có với ít công sức nhất?

Trong hầu hết trường hợp là AMD Instinct: ROCm là backend PyTorch được hỗ trợ chính thức, nên đường mã đã có sẵn. TPU của Google chạy PyTorch qua cầu nối PyTorch/XLA, một lớp phiên dịch. AWS nói rằng vLLM, HuggingFace Transformers và TorchTitan chạy trên Trainium mà không tốn công chuyển đổi, và đó là tuyên bố của chính nhà cung cấp. Ở đầu bên kia, Sohu của Etched dùng ngăn xếp phần mềm chuyên biệt riêng, nên hãy chuẩn bị cho khối lượng chuyển đổi nhiều hơn hẳn so với ROCm hay PyTorch/XLA.

Vì sao Broadcom và Qualcomm bị gọi là đối thủ của NVIDIA khi bạn không thuê được chip của họ?

Vì những lý do khác nhau. Broadcom làm chip tùy biến cho các công ty tự dựng bộ tăng tốc của họ, thay vì bán một bộ tăng tốc tiêu chuẩn thẳng cho lập trình viên. Qualcomm thiết kế bộ tăng tốc Dragonfly của riêng mình, với AI200, AI250 và AI300 nay đã nằm trên lộ trình trung tâm dữ liệu, nhưng cách tiếp cận hướng tới doanh nghiệp chứ không phải kiểu thuê đám mây tự phục vụ thông thường. Cả hai đều cạnh tranh trong hạ tầng AI mà không trao cho lập trình viên mô hình tiếp cận công khai giống NVIDIA hay AMD.

Bạn có thể mua đứt một bộ tăng tốc AI thay vì đi thuê không?

Có. Tenstorrent bán thẳng card dành cho nhà phát triển Blackhole, từ 999 $ với p100a đến 1.399 $ với p150a và p150b, còn hàng và giao trong khoảng hai tuần, kèm ngăn xếp phần mềm mã nguồn mở hoàn toàn. Lời lưu ý quan trọng ngang với giá: phần lớn tài liệu và danh sách mô hình đã kiểm chứng vẫn nhắm vào chiếc Wormhole đời cũ, nên hãy dành thời gian cho việc chuyển đổi thay vì trông đợi mã sẵn có chạy y nguyên.

Chia sẻ

Thảo luận

Bình luận

Đăng nhập để tham gia thảo luận.

Thêm bài viết từ blog

Tiếp tục đọc.

Sẵn sàng triển khai? Từ $2.48/tháng.

Cloud độc lập, từ 2008. AMD EPYC, NVMe, 40 Gbps. Hoàn tiền trong 14 ngày.