Hồi tháng 6, tôi ngồi trong một quán cà phê ở Nairobi, lướt Twitter và thấy một thread dài về cách Linear Attention sẽ 'giết chết' nhu cầu GPU. Ai cũng sợ. Cộng đồng crypto lo lắng các dự án DePIN – từ Akash đến io.net – sẽ sụp đổ vì không còn ai cần thuê GPU nữa. Hype chết, giá trị còn. Nhưng rồi K3 xuất hiện: 2.8 nghìn tỷ tham số, vẫn cần 64 chip NVIDIA trong một domain duy nhất, vẫn ngốn hơn 1.5TB HBM chỉ để chứa trọng số. Và thế là câu chuyện lại rẽ sang một hướng khác.
Bối cảnh thị trường đầu năm 2025: mọi người đều bị ám ảnh bởi Linear Attention – những kiến trúc như Mamba hay RWKV hứa hẹn giảm độ phức tạp tính toán từ O(n²) xuống O(n). Nếu điều đó thành sự thật, nhu cầu về GPU cho inference sẽ giảm mạnh. Các dự án mining AI trên blockchain, các thị trường cho thuê sức mạnh tính toán phi tập trung – tất cả đều run sợ. Nhưng SemiAnalysis, một trong những tổ chức phân tích phần cứng uy tín nhất, đã chỉ ra một sự thật phản trực giác: K3, với Linear Attention, không hề làm giảm nhu cầu phần cứng. Nó chỉ thay đổi cách chúng ta sử dụng chúng. Và điều đó là một tín hiệu cực kỳ quan trọng cho cả ngành blockchain lẫn AI.
Hãy nhìn vào những con số. K3 có 2.8 nghìn tỷ tham số. Để load toàn bộ trọng số model, bạn cần ít nhất 1.5TB HBM – tức là khoảng 19 chiếc H100 80GB chỉ để chứa model, chưa tính KV cache. Và KV cache thì vẫn phải được offload xuống CPU DDR5 và NVMe vì không thể nhét hết vào GPU. Điều này có nghĩa: Linear Attention không giảm nhu cầu bộ nhớ, nó chỉ giảm độ phức tạp tính toán. Thực tế, nó còn làm tăng nhu cầu về băng thông bộ nhớ và interconnect. K3 cần ít nhất 64 chip kết nối trong một large-scale domain (giống như NVIDIA GB300 NVL72) để inference ở mức chấp nhận được. Code là thép, nhưng con người là lửa. Ở đây, thép là những con chip H100, nhưng ngọn lửa là nhu cầu thực tế từ K3 – một ngọn lửa vẫn đang cháy rực.
Và đây là lúc câu chuyện trở nên thú vị với cộng đồng phi tập trung. Nếu Linear Attention thực sự giảm compute nhưng không giảm memory bandwidth, thì nhu cầu về GPU inference sẽ không giảm – nó chỉ chuyển từ compute-bound sang memory-bound. Điều này đồng nghĩa: những GPU có băng thông HBM cao (H200, B200) trở nên giá trị hơn bao giờ hết. Các mạng lưới DePIN – nơi hàng ngàn GPU rải rác khắp thế giới – có thể tận dụng điều này nếu họ có thể cung cấp băng thông bộ nhớ lớn. Nhưng họ sẽ phải đối mặt với thách thức: làm sao để kết nối 64 GPU trong một cluster với độ trễ thấp? Điều đó gần như bất khả thi với các mạng ngang hàng hiện tại. Hype chết, giá trị còn. Giá trị thực sự nằm ở hạ tầng, không phải ở lời hứa.
Góc nhìn phản trực giác: Người ta nghĩ Linear Attention sẽ giảm nhu cầu GPU, nhưng K3 chứng minh điều ngược lại. Đây là Jevons paradox trong thế giới AI: hiệu quả cao hơn dẫn đến tổng tiêu thụ tài nguyên cao hơn, vì nó mở ra những ứng dụng mới. K3 có thể làm giảm chi phí inference cho mỗi token, nhưng vì model quá lớn và ứng dụng tiềm năng quá rộng, tổng số GPU cần thiết cho inference sẽ tăng lên. Điều này có lợi cho các nhà cung cấp hạ tầng tập trung như NVIDIA, nhưng cũng mở ra cơ hội cho các giải pháp phi tập trung nếu họ có thể giải bài toán kết nối băng thông cao. Tuy nhiên, nếu không làm được, cộng đồng phi tập trung sẽ bị bỏ lại phía sau. Đây là lúc cần nhìn vào bức tranh lớn: không phải là công nghệ nào thắng, mà là ai xây dựng được hạ tầng bền vững nhất.
Takeaway: K3 không chỉ là một model AI. Nó là lời nhắc nhở rằng công nghệ không bao giờ đi theo đường thẳng – nó uốn cong, nhưng luôn tìm về phía giá trị lâu dài. Những ai nghĩ rằng Linear Attention sẽ phá hủy nhu cầu GPU đã sai. Những ai nghĩ rằng DePIN sẽ dễ dàng thay thế trung tâm dữ liệu tập trung cũng sai nốt. Hype chết, giá trị còn. Câu hỏi còn lại: Liệu cộng đồng phi tập trung có đủ kiên nhẫn và nguồn lực để xây dựng hạ tầng cho tương lai đó? Bởi code là thép, nhưng con người là lửa – và ngọn lửa ấy cần được nuôi dưỡng bằng niềm tin, không chỉ bằng token. Câu trả lời, như mọi khi, nằm ở cộng đồng.