Trustinel
Tài chính

Kimi K3 2.78T tham số chạy trên 8GB RAM: Bước đột phá cho AI phi tập trung hay chỉ là màn trình diễn kỹ thuật?

Đỗ Thế
Bạn có tin một mô hình 2.78 nghìn tỷ tham số có thể chạy trên một chiếc laptop 8GB RAM không? Tuần trước, một developer đã open-source dự án kimi-k3-in-c, chỉ 176KB code C99 thuần, không GPU, không CUDA, không PyTorch. Chỉ CPU và ổ NVMe. Và nó hoạt động. Nhưng với tốc độ 32.7 giây mỗi token. Đây là tin tức blockchain? Không hẳn. Nhưng nếu bạn đang theo dõi DePIN, AI phi tập trung, và tương lai của smart contract thông minh, thì đây chính là tín hiệu bạn không thể bỏ lỡ. Context: Tại sao lại là bây giờ? Kể từ khi MoE (Mixture of Experts) trở thành kiến trúc chủ đạo cho các mô hình ngôn ngữ lớn, các nhà phát triển luôn tìm cách giảm bớt gánh nặng inference. Kimi K3 của Moonshot AI có 2.78T tham số tổng cộng, nhưng mỗi layer chỉ kích hoạt 16 trên 896 expert. Tức là chỉ ~0.5% tham số thực sự được dùng cho mỗi token. Vấn đề là để load toàn bộ model weights, bạn cần ~1.56TB RAM. Điều này là bất khả thi với hầu hết mọi người. Nhưng nếu bạn chỉ load các expert cần thiết từ ổ cứng theo thời gian thực? Đó chính là ý tưởng của kimi-k3-in-c. Dự án này sử dụng kỹ thuật streaming load: lưu trữ toàn bộ expert weights trên NVMe (tốc độ đọc 7GB/s), và chỉ đưa vào RAM 8GB các tham số của dense trunk layers và các expert đang được kích hoạt. Điều này tương tự như cách các hệ thống swap memory hoạt động, nhưng được tinh chỉnh cho MoE. Core: Phân tích kỹ thuật chi tiết. Dự án được viết bằng C99 thuần, không phụ thuộc vào bất kỳ thư viện nào. Điều này có nghĩa là nó có thể chạy trên bất kỳ hệ thống nào có CPU, kể cả các thiết bị nhúng. Tuy nhiên, hiệu năng hiện tại rất hạn chế: 32.7 giây/token tương đương ~0.03 token mỗi giây. Trong khi đó, một mô hình nhỏ hơn như LLaMA 7B có thể đạt 20-30 token/giây trên CPU. So sánh này cho thấy sự đánh đổi rõ ràng: bạn có thể chạy mô hình siêu lớn, nhưng không thể dùng nó trong thời gian thực. Ngoài ra, nó yêu cầu gần 1.7TB dung lượng NVMe trống, tương đương với một ổ SSD 2TB giá khoảng 100-150 USD. Vậy chi phí phần cứng thực tế là: 1.7TB NVMe (~150 USD) + 8GB RAM (có sẵn) + CPU. Tổng chi phí dưới 200 USD, thấp hơn nhiều so với một GPU A100 giá 10.000 USD. Nhưng hiệu năng lại thấp hơn hàng nghìn lần. Developer của dự án thừa nhận: “Đây là một thử nghiệm khám phá hướng tối ưu hạ tầng inference, không có giá trị sản xuất thực tế.” Tuy nhiên, đối với cộng đồng blockchain, điều này mở ra một cánh cửa mới. Hãy tưởng tượng một mạng lưới các node không có GPU, mỗi node chỉ có 8GB RAM và ổ cứng lớn, có thể cùng nhau chạy một mô hình AI khổng lồ thông qua cơ chế phân tán. Đây chính là viễn cảnh của DePIN (Decentralized Physical Infrastructure Networks) kết hợp với AI. Các dự án như Bittensor, io.net, hay Render Network đang hướng tới việc tận dụng tài nguyên tính toán phân tán. Nhưng thách thức lớn nhất là băng thông và độ trễ giữa các node. Kỹ thuật streaming load từ ổ cứng địa phương có thể giảm tải cho mạng, nhưng lại tạo ra bottleneck ở tốc độ đọc NVMe. Với các ổ NVMe Gen4, tốc độ đọc tuần tự có thể đạt 7GB/s, nhưng đọc ngẫu nhiên (random read) thường thấp hơn nhiều. Vì weights của các expert được phân bố rải rác, hệ thống phải đọc nhiều block nhỏ, dẫn đến hiệu năng giảm mạnh. Đây là lý do tại sao kimi-k3-in-c chỉ đạt 32.7s/token. Tuy nhiên, nếu tối ưu hóa bằng cách pre-fetching và sắp xếp weights theo thứ tự truy cập, có thể cải thiện đáng kể. Dựa trên kinh nghiệm audit của tôi với các hệ thống lưu trữ phân tán trên blockchain, việc kết hợp giữa memory-mapped files và I/O không đồng bộ là chìa khóa để giảm độ trễ. Một hướng đi khác là sử dụng các ổ SSD Optane (dù đã ngừng sản xuất) hoặc công nghệ CXL (Compute Express Link) để mở rộng bộ nhớ. Nhưng đó là tương lai xa. Contrarian: Góc nhìn phản trực giác. Nhiều người sẽ nói rằng kimi-k3-in-c là vô dụng vì tốc độ quá chậm. Nhưng tôi cho rằng chính sự chậm chạp này lại là điểm mạnh trong bối cảnh blockchain. Trong các mạng lưới phi tập trung, tốc độ không phải lúc nào cũng là ưu tiên hàng đầu. Các node xác thực dữ liệu, kiểm tra chữ ký, hay thực thi smart contract thường không yêu cầu thời gian thực. Ví dụ, một oracle AI có thể cập nhật giá mỗi 10 phút, và việc inference mất vài chục giây là chấp nhận được. Hơn nữa, chi phí thấp cho phép hàng nghìn node tham gia, tăng tính phi tập trung. So với việc phải mua GPU đắt đỏ, việc tận dụng CPU và NVMe sẵn có sẽ hạ thấp rào cản gia nhập. Điều này đặc biệt quan trọng ở các khu vực đang phát triển, nơi thiết bị cao cấp hiếm. Tuy nhiên, có một điểm mù mà ít ai nhắc đến: dung lượng NVMe 1.7TB là rất lớn, và việc đọc liên tục 24/7 sẽ làm giảm tuổi thọ ổ cứng. Với các ổ TLC, dung lượng ghi (TBW) thường khoảng 600-1200 TBW cho 2TB. Nếu mỗi token cần đọc ~1.5GB (ước tính), thì mỗi ngày chạy 1000 token sẽ ghi 1.5TB, vượt quá giới hạn trong vòng 1 năm. Đây là vấn đề nghiêm trọng mà các dự án DePIN cần tính đến. Một giải pháp là sử dụng ổ cứng HDD với dung lượng lớn hơn, nhưng tốc độ đọc lại thấp hơn nhiều, làm tăng độ trễ. Vậy, liệu có khả thi khi triển khai trên quy mô lớn? Câu trả lời là chưa, nhưng nó mở ra hướng nghiên cứu mới về “AI edge computing” trên blockchain. Takeaway: Kỹ thuật streaming load + MoE sparse activation không phải là giải pháp sản xuất ngay, nhưng nó là tín hiệu cho thấy ranh giới giữa AI và blockchain đang mờ dần. Trong vòng 2 năm tới, khi băng thông NVMe tăng lên 10GB/s và dung lượng ổ cứng rẻ hơn, những mô hình như Kimi K3 có thể chạy trên các node gia nhập. Điều này sẽ thay đổi cách chúng ta xây dựng các ứng dụng phi tập trung – từ các chatbot AI không cần server đến các hệ thống xác thực danh tính phi tập trung dựa trên mô hình ngôn ngữ. Thanh khoản đang chảy về đâu? Vào các dự án kết hợp AI + DePIN. Theo dõi. DeFi không tha thứ cho kẻ ngủ quên – và AI cũng vậy. Pump? Chỉ dành cho ai nhìn vào on-chain – và cả vào tốc độ inference nữa.

Kimi K3 2.78T tham số chạy trên 8GB RAM: Bước đột phá cho AI phi tập trung hay chỉ là màn trình diễn kỹ thuật?

Kimi K3 2.78T tham số chạy trên 8GB RAM: Bước đột phá cho AI phi tập trung hay chỉ là màn trình diễn kỹ thuật?

Kimi K3 2.78T tham số chạy trên 8GB RAM: Bước đột phá cho AI phi tập trung hay chỉ là màn trình diễn kỹ thuật?