
IBM và Together AI: 240 triệu USD cho cụm suy luận – Bước đi thông minh hay canh bạc?
Huỳnh Yến
240 triệu USD. Một con số khiến bất kỳ ai trong ngành cũng phải ngoái nhìn. IBM vừa ký thỏa thuận với Together AI để xây dựng cụm suy luận (inference cluster) quy mô lớn. Nhưng đừng vội reo hò. Đây không phải là một bản hợp đồng thông thường. Đây là minh chứng cho thấy cuộc chơi AI đang chuyển từ cuộc đua huấn luyện sang cuộc chiến suy luận – và các ông lớn công nghệ đang phải đi thuê ngoài để không bị bỏ lại.
Tại sao lại là bây giờ? Bối cảnh thị trường đang giảm, nhưng chi tiêu cho AI inference lại tăng vọt. Doanh nghiệp không còn muốn chỉ chạy thử nghiệm (POC) nữa. Họ cần sản phẩm thực tế, và suy luận là nơi tiền được đốt. IBM, với watsonx và hàng ngàn khách hàng doanh nghiệp, nhận ra rằng họ không có đủ GPU để cạnh tranh với AWS, Azure hay GCP. Together AI, một startup về inference optimization, lại có công nghệ nhưng thiếu kênh phân phối. Cả hai gặp nhau. Kết quả: 240 triệu USD – một con số lớn đến mức nó chiếm gần 40% định giá vòng A của Together AI (khoảng 500-600 triệu USD).
Phân tích kỹ thuật: Cụm suy luận này sẽ có quy mô từ 5.000 đến 10.000 GPU H100/H200. Dựa trên kinh nghiệm vận hành bot yield farming thời DeFi Summer, tôi biết rằng với 240 triệu USD, nếu toàn bộ là chi phí phần cứng, bạn có thể mua khoảng 8.000 card H100 (giá ~30.000 USD mỗi card bao gồm server và mạng). Nhưng nếu là hợp đồng dịch vụ trong 3-5 năm, phần cứng thực tế chỉ khoảng 30-40% số tiền, tức 2.000-3.000 card mỗi năm. Dù thế nào, đây là cụm nghìn card, đủ để phục vụ hàng triệu request suy luận mỗi ngày. Together AI sẽ sử dụng các framework tối ưu như vLLM, SGLang, kết hợp với kỹ thuật PagedAttention và speculative decoding để giảm chi phí token. IBM đặt cược vào kiến trúc intent-based? Không. Họ đặt cược vào việc mua lại năng lực inference từ bên ngoài, thay vì tự xây. Điều này trái ngược hoàn toàn với những gì Microsoft hay Google đang làm.
Điểm phản trực giác: Ai cũng nghĩ IBM sẽ tự xây dựng cụm GPU riêng, nhưng thực tế họ lại đi thuê ngoài. Tại sao? Bởi vì vận hành một cụm suy luận quy mô lớn không chỉ là cắm card vào. Đó là câu chuyện về mạng InfiniBand, tản nhiệt, nguồn điện 70MW, và SLA 99.9%. IBM không có đội ngũ chuyên về GPU ops. Together AI, dù nhỏ, lại có đội ngũ kỹ sư từ Google và NVIDIA, từng vận hành hệ thống tương tự. Hơn nữa, thỏa thuận này có thể bao gồm điều khoản độc quyền – IBM có thể đã mua quyền ưu tiên truy cập, thậm chí là quyền mua lại Together AI sau này. Đây là một canh bạc kiểu “đặt cược vào con ngựa nhỏ” – nếu Together AI thành công, IBM sẽ có lợi thế cạnh tranh; nếu thất bại, IBM chỉ mất 240 triệu USD, tương đương 0.13% vốn hóa thị trường của họ. Một khoản đầu tư rủi ro thấp, lợi nhuận cao tiềm năng.
Tuy nhiên, đừng quên rủi ro. GPU vẫn khan hiếm. NVIDIA có thể ưu tiên Together AI vì họ là nhà đầu tư, nhưng nếu chuỗi cung ứng bị đứt, dự án sẽ chậm trễ. Thứ hai, nhu cầu suy luận doanh nghiệp có thể không bùng nổ như kỳ vọng. Nếu các công ty vẫn trung thành với API đóng (GPT-4, Claude), cụm cluster này sẽ bị underutilized. Thứ ba, Together AI là startup, kinh nghiệm vận hành cụm nghìn card chưa được kiểm chứng. Một sự cố downtime có thể làm hỏng uy tín của IBM.
Kết luận: Hãy theo dõi xem IBM có công bố thêm chi tiết về việc tích hợp cụm này vào watsonx hay không. Nếu họ làm được, đây sẽ là mô hình cho các ông lớn khác như Oracle, SAP. Còn nếu không, nó sẽ chỉ là một món đồ chơi đắt tiền. Câu hỏi đặt ra: Liệu Together AI có trở thành “OpenAI cho doanh nghiệp” hay chỉ là một cú huých nhất thời? Tôi sẽ đặt cược vào khả năng IBM mua lại họ trong vòng 12-18 tháng tới.