BTC $66,829.8 +3.82%
ETH $1,936.17 +3.86%
SOL $78.14 +2.56%
BNB $575.3 +1.46%
XRP $1.15 +5.15%
DOGE $0.0733 +1.40%
ADA $0.1758 +8.05%
AVAX $6.6 +1.10%
DOT $0.8574 +5.49%
LINK $8.7 +4.08%
⛽ ETH Gas 28 Gwei
Sợ&Tham
25

Kimi K3 và bài học ‘scalability’ cho cả AI lẫn crypto: Khi ‘quá hot’ cũng là thảm họa

Nguyễn Dũng
Học tập

Chỉ 48 giờ sau khi phát hành mô hình 2,8 nghìn tỷ tham số Kimi K3, Moonshot AI buộc phải tạm dừng đăng ký mới. GPU đầy tải, doanh thu API bùng nổ, nhưng hạ tầng không theo kịp. Với bất kỳ ai từng chứng kiến cảnh một DEX bị nghẽn vì ‘gas war’ khi TVL tăng vọt, câu chuyện này chẳng có gì mới. Chỉ khác một điều: trong crypto, chúng ta có phí ưu tiên và AMM; còn ở thế giới AI tập trung, bạn chỉ có thể… tắt máy.

Bối cảnh: Kẻ nổi loạn mang ‘open-weight’

Moonshot AI – startup Trung Quốc trị giá hơn 20 tỷ USD – vừa tung ra Kimi K3, mô hình ngôn ngữ lớn với 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token. Điểm khác biệt: họ công bố kế hoạch phát hành toàn bộ trọng số vào ngày 27/7, theo phong cách open-weight, trái ngược hoàn toàn với GPT-4o hay Claude 3.5 đóng kín. Giá API của họ rẻ hơn Anthropic tới 112 lần. Kết quả? Lượng gọi API tăng vọt, GPU cạn kiệt, và họ phải ngừng nhận người dùng mới. Đây là tín hiệu PMF (product-market fit) mạnh nhất có thể, nhưng cũng là lời nhắc nhở về điểm yếu chết người của kiến trúc tập trung.

Cốt lõi: Từ ‘capacity planning’ đến ‘tokenomics’

Nếu Kimi K3 là một giao thức DeFi, nó đã có cơ chế phí động để tự điều tiết.

Thực tế, Moonshot AI đã mắc sai lầm kinh điển: đánh giá thấp nhu cầu inference. Với 2,8 nghìn tỷ tham số (rất có thể là MoE), mỗi request tiêu tốn một lượng GPU đáng kể. Họ dự báo sai, không chuẩn bị đủ cluster inference. Trong một hệ thống phi tập trung, bạn có thể để thị trường quyết định qua phí giao dịch – người trả cao hơn được ưu tiên. Ở đây, họ chọn giải pháp ‘kill switch’.

Hãy nhìn vào ARR của họ: 300 triệu USD/năm từ API, với mức định giá 20-30 tỷ USD. P/S ~70-100x. Đó là con số khủng, nhưng cũng cho thấy họ đang đốt tiền để giữ giá rẻ. Nếu họ là một dự án crypto, chúng ta sẽ nói về ‘token buyback’ hay ‘burn mechanism’ để kiểm soát cung. Nhưng ở đây, họ chỉ có thể… tạm dừng. Cảm giác như một sàn DEX bỗng dưng đóng cửa vì thanh khoản quá lớn.

Sự thật là, hầu hết các dự án AI hiện tại đều đang gặp vấn đề về ‘inference bottleneck’ – tương tự như ‘gas limit’ trên Ethereum. Khi một mô hình trở nên phổ biến, nhu cầu inference tăng theo cấp số nhân. Nếu không có kế hoạch mở rộng đàn GPU linh hoạt, bạn sẽ sập. Moonshot AI đã chứng minh điều đó một cách đau đớn.

Góc nhìn phản trực giác: ‘Tạm dừng’ có thể là điều tốt nhất họ từng làm

Nghe có vẻ nghịch lý, nhưng việc tạm dừng đăng ký mới là một tín hiệu mạnh mẽ về nhu cầu thực sự. Không phải startup nào cũng dám làm điều này. Nó cho thấy họ trung thực về giới hạn của mình. Trong giới blockchain, một dự án dám thừa nhận ‘chúng tôi quá tải, hãy chờ’ thường được tôn trọng hơn là cứ cố gắng chạy với quần rách.

Tuy nhiên, mặt trái là họ đang phụ thuộc hoàn toàn vào nhà cung cấp đám mây (AWS, Alibaba Cloud) và NVIDIA. Nếu họ là một L2, họ đã có thể chuyển sang sử dụng nhiều sequencer hoặc phân tải cho các rollup. Ở đây, họ chỉ có một đường ống duy nhất. Nếu bạn không thừa nhận sai lầm của mình, bạn đang lừa dối cộng đồng. Moonshot AI đã thừa nhận giới hạn, và đó là bước đầu tiên để xây dựng lòng tin.

Takeaway: Từ ‘tập trung’ đến ‘lai ghép’

Sự kiện này mở ra một câu hỏi lớn: liệu có thể xây dựng một lớp inference phi tập trung cho các mô hình AI? Các dự án như Bittensor, Gensyn hay Akash đang cố gắng làm điều đó. Nếu thành công, chúng ta sẽ có một ‘thị trường GPU’ tự do, nơi bất kỳ ai cũng có thể cung cấp sức mạnh tính toán cho inference. Khi đó, một mô hình như Kimi K3 sẽ không bao giờ phải tạm dừng – nó chỉ đơn giản là tăng phí để giảm tải.

Một giao thức không bao giờ hoàn hảo, nó chỉ tiến hóa. Sự cố của Moonshot AI là một bài học quý giá cho cả hai ngành: AI cần học hỏi từ cơ chế phân tán tài nguyên của blockchain, và blockchain cần nhìn vào tốc độ tăng trưởng PMF của AI. Tương lai có thể là sự kết hợp: một giao thức lai ghép giữa open-weight model và inference marketplace phi tập trung. Khi đó, ‘quá hot’ không còn là thảm họa, mà là cơ hội để thu phí giao thức.

Và chúng ta, những người làm trong lĩnh vực phi tập trung, hãy tự hỏi: nếu mô hình của chúng ta thành công, liệu chúng ta có sẵn sàng để thị trường tự điều tiết, hay cũng sẽ phải bấm nút ‘tạm dừng’?