Hook: Khi một công ty điện toán đám mây tuyên bố cung cấp 64 GPU kết nối với băng thông 800GB/s thông qua một phiên bản đám mây thông thường, câu chuyện không chỉ là về phần cứng. Đó là về việc họ chọn cách giải quyết vấn đề như thế nào: đưa siêu máy tính AI vào tay mọi doanh nghiệp, nhưng chỉ với một khoản phí theo giờ. Con số 64 GPU và 800GB/s khiến tôi phải dừng lại. Bởi trong 11 năm theo dõi ngành, chưa từng có phiên bản đám mây nào dám công khai thông số như vậy mà không phải là một cụm chuyên dụng riêng.

Context: Sự kiện này diễn ra vào tháng 7/2026, tại khu vực Ulanqab (Nội Mông) – nơi Alibaba Cloud đặt trung tâm dữ liệu siêu lớn với nguồn điện rẻ và khí hậu mát mẻ. Phiên bản mang tên Lingjun Zhenwu M890, được mô tả là “siêu nút” dành riêng cho suy luận mô hình MoE (Mixture-of-Experts) có từ 1 nghìn tỷ tham số trở lên. Điểm đặc biệt: họ tự phát triển chip chuyển mạch nội bộ mang tên ICNSwitch 1.0, cho phép kết nối 64 GPU với băng thông 800GB/s – gấp 4 lần so với thế hệ trước đó (16 GPU, 200GB/s). Ngoài ra, nó hỗ trợ suy luận độ chính xác thấp FP8 và FP4, phù hợp với xu hướng định lượng mô hình hiện nay. Tuy nhiên, phiên bản này hiện chỉ mở đăng ký dùng thử, chưa công bố giá cụ thể.
Core: Phân tích kỹ thuật cho thấy đây là bước tiến về mặt kết cấu hạ tầng, không phải đột phá về kiến trúc mô hình. Hãy nhìn vào bốn điểm mấu chốt: - Tự chủ về mạng kết nối: ICNSwitch 1.0 là chip chuyển mạch do Alibaba tự thiết kế (hoặc tùy chỉnh) nhằm vượt qua giới hạn của Ethernet thông thường. 800GB/s giữa các GPU là băng thông xác thực – tương đương với khoảng 6.4Gbps trên mỗi kênh nếu dùng 125 kênh vật lý, hoặc sử dụng công nghệ quang học 800G. Điều này giải quyết nút thắt cổ chai trong suy luận MoE, nơi các “chuyên gia” của mô hình phải trao đổi dữ liệu qua các GPU khác nhau. - Độ chính xác thấp tiên tiến: Hỗ trợ FP4 là dấu hiệu cho thấy GPU sử dụng có khả năng định lượng xuống 4-bit – tính năng chỉ xuất hiện trên kiến trúc Hopper hoặc mới hơn (H100/B200). Nếu Alibaba dùng chip nội địa (Hanguang), đây sẽ là tín hiệu mạnh về năng lực tự chủ. - Vị trí địa lý thông minh: Ulanqab không chỉ mát mẻ tự nhiên, mà còn gần các tuyến cáp quang chính. Mỗi siêu nút tiêu thụ hàng chục kW, có thể lên tới 50-80kW với 64 GPU, đòi hỏi tản nhiệt chất lỏng. Việc chọn nơi đặt trung tâm dữ liệu tối ưu hóa chi phí vận hành. - Giai đoạn thử nghiệm: Chỉ mở “invite-only” cho thấy họ đang xác thực độ ổn định trước khi bán rộng rãi. Điều này cũng đồng nghĩa với việc chuỗi cung ứng (chip, switch, GPU) chưa đủ lớn.

Từ góc nhìn dữ liệu: nếu mỗi GPU có băng thông bộ nhớ 3.35TB/s (H100), 64 GPU cho tổng băng thông bộ nhớ ~214TB/s. Suy luận một mô hình 1 nghìn tỷ tham số cần ~2TB dung lượng (với FP16), giảm xuống còn ~500GB với FP4. Với băng thông mạng 800GB/s, thời gian truyền dữ liệu giữa các GPU là dưới 1 giây – con số chấp nhận được. Nhưng câu hỏi là: liệu băng thông đó có thực sự đạt được trong thực tế khi tải đầy đủ? Từng có trường hợp các cụm NVIDIA DGX H100 (8 GPU) với băng thông 900GB/s giữa các GPU trong cùng node, nhưng giữa các node chỉ 400Gbps. Phiên bản của Alibaba tuyên bố 800GB/s trên toàn bộ 64 GPU – tức là nội bộ node, và nếu vậy thì nó đã vượt xa mức thông thường.
Contrarian: Nhưng hãy tỉnh táo. Tương quan giữa băng thông và hiệu suất suy luận không phải là nhân quả tuyệt đối. Mô hình MoE 1 nghìn tỷ tham số hiện nay hầu như không tồn tại ngoài các phòng thí nghiệm lớn (Google, Meta, OpenAI). Khách hàng thực sự cho phiên bản này có thể đếm trên đầu ngón tay. Nguy cơ lớn nhất: nếu Alibaba không mở rộng được nhu cầu xuống các mô hình 100-300 tỷ tham số, siêu nút này sẽ là “đại bác bắn muỗi”, chi phí vận hành cao nhưng doanh thu thấp. Thêm vào đó, cạnh tranh với AWS (Trainium2 với 16 chíp trên một node, nhưng băng thông chỉ 400Gbps) hay Google Cloud (TPU v5p Pod với băng thông ICI 1.2TB/s mỗi chip) – Alibaba phải chứng minh được lợi thế về giá hoặc hiệu năng tổng thể, không chỉ thông số băng thông đơn thuần.

Một điểm mù khác: phiên bản này có thể bị ràng buộc bởi xuất khẩu chip. Nếu GPU sử dụng là NVIDIA H100/B200, việc cung cấp cho khách hàng Trung Quốc vẫn bị hạn chế (lệnh trừng phạt tháng 10/2022, 10/2023). Nếu là chip nội địa, hiệu năng và hệ sinh thái phần mềm (CUDA compatibility) vẫn là rào cản lớn. Tôi đã từng chứng kiến nhiều dự án “GPU tự chủ” thất bại vì thiếu driver tối ưu cho mô hình Transformer.
Takeaway: Tuần tới, tôi sẽ theo dõi hai tín hiệu: (1) Liệu có khách hàng tên tuổi (Zhipu, Baichuan, SenseTime) công bố sử dụng? (2) Alibaba có công bố benchmark cụ thể (throughput, latency) so với H100 DGX Cloud? Nếu thiếu cả hai, đây chỉ là một đòn PR hơn là sản phẩm thực chiến. Dữ liệu on-chain cho thấy Alibaba Cloud đang chiếm ~12% thị phần điện toán đám mây Trung Quốc – họ cần chứng minh sự khác biệt, không chỉ là cuộc đua thông số.