Người ta thường nói, batch inference là nhà máy sản xuất token. Hàng ngàn yêu cầu được dồn vào một lô, xử lý song song, tối ưu cho throughput. Nhưng khi những AI agent bắt đầu gọi nhau, trò chuyện dài, tạm dừng để gọi tool, rồi lại tiếp tục – nhà máy ấy vỡ ra thành hàng ngàn xưởng nhỏ, mỗi xưởng chỉ phục vụ một cuộc trò chuyện. Và đột nhiên, batch inference không còn là vua nữa.
Đầu tháng này, tại hội nghị vLLM đầu tiên tổ chức cùng Ray Summit, một thông điệp lặp đi lặp lại từ các kỹ sư của Intel, AMD, PyTorch và Anyscale: kiến trúc phục vụ suy luận AI đang chuyển từ collocated (prefill và decode trên cùng một GPU) sang disaggregated – tách prefill và decode thành các dịch vụ riêng biệt, trên các tài nguyên GPU chuyên dụng. Đây không phải một phát minh lý thuyết mới, mà là sự hội tụ của nhiều nhóm độc lập cùng một kết luận: Agent workload đang phá vỡ mô hình batch truyền thống.

Tôi, với tư cách một người đã theo dõi cả blockchain và AI từ năm 2017, thấy một sự tương đồng thú vị. Khi tôi tham gia Aragon DAO năm đó, chúng tôi cũng tin rằng quản trị phi tập trung sẽ phá vỡ mô hình công ty tập trung. Nhưng rồi chúng tôi nhận ra: để phi tập trung hoạt động, cần có hạ tầng – không chỉ smart contract, mà cả cách con người tương tác, cách bỏ phiếu, cách xử lý xung đột. Và bây giờ, AI inference cũng đang trải qua một cuộc chuyển đổi hạ tầng tương tự.
Context: Vì sao Batch Inference bị phá vỡ?
Batch inference là kiến trúc thống trị trong các hệ thống suy luận AI hiện nay. Nó hoạt động tốt khi bạn có hàng ngàn yêu cầu độc lập, mỗi yêu cầu ngắn, và bạn muốn tối đa hóa số token sinh ra trên mỗi GPU. Nhưng Agent workload khác: mỗi agent có một phiên làm việc dài, nhiều bước, có lúc agent gọi tool và tạm dừng vài giây, rồi lại tiếp tục với cùng context. Trong batch inference, bạn phải giữ toàn bộ KV cache (bộ nhớ đệm cho các token đã xử lý) trong suốt thời gian chờ – điều này lãng phí tài nguyên GPU và làm giảm throughput.
Tại hội nghị, các kỹ sư từ Intel trình diễn việc tách prefill (tính toán nặng) và decode (băng thông bộ nhớ nặng) lên các GPU riêng. Prime Intellect áp dụng cùng nguyên lý cho mô hình MoE nghìn tỷ tham số. AMD giới thiệu MORI-IO, một kết nối RDMA cho phép truyền KV cache giữa các node nhanh đến mức trên 8x AMD MI300X, goodput (throughput hiệu quả) tăng 2.5 lần. Con số này đáng chú ý, dù điều kiện thử nghiệm chưa được công bố đầy đủ.
Core: Disaggregated Serving – Kiến trúc mới cho Agent
Về bản chất, disaggregated serving biến một cụm GPU thành hai loại tài nguyên: prefill pool (tính toán) và decode pool (bộ nhớ). Một agent đến, prefill pool xử lý prompt, tạo KV cache, sau đó gửi cache qua RDMA đến decode pool, nơi sinh token từng bước. Khi agent tạm dừng, decode pool vẫn giữ cache, nhưng không tốn tài nguyên tính toán. Khi agent quay lại, nó được route đến đúng decode instance nhờ vLLM Router dùng consistent hashing và sticky routing.
Điều này đặt ra yêu cầu mới: hạ tầng mạng RDMA phải nhanh và đáng tin cậy. KV cache có thể lớn (hàng trăm MB cho mỗi phiên dài), và việc truyền qua mạng phải hoàn thành trong vài mili giây. NixlConnector, module mặc định từ vLLM v0.8, hỗ trợ RDMA; MORI-IO là bản dành cho AMD. Prime Intellect còn dùng distributed KV cache store, đưa cache xuống CPU memory hoặc NVMe, tạo thành kiến trúc đa tầng.

Nhưng điều kỹ thuật thú vị nhất là cách mà vLLM Router xử lý session affinity. Nó không chỉ route request đến đúng decode instance, mà còn phải nhận biết được các prompt liên quan (cùng session, cùng tool call chain). Điều này biến router thành một bộ phận stateful, điều mà batch inference vốn tránh. Nói cách khác, hạ tầng đang học cách "nhận ra" agent như một thực thể xuyên suốt, giống như một DAO nhận ra thành viên của mình qua nhiều cuộc bỏ phiếu.
Contrarian: Liệu đây có phải chỉ là một câu chuyện bán hàng?
Tôi sẽ là người đầu tiên cảnh báo: đừng vội tin vào những con số 2.5x goodput. Các thử nghiệm thường được tối ưu cho kịch bản có lợi nhất – agent với context dài, nhiều lần tạm dừng. Với những workload ngắn, single-turn, disaggregated có thể còn tệ hơn collocated vì chi phí truyền KV cache qua mạng. Hơn nữa, các nhà sản xuất lớn như Meta, LinkedIn vẫn đang chạy collocated (theo chính bài nói tại hội nghị). Disaggregated vẫn là experimental trong vLLM.
Tôi từng thấy điều này trong blockchain: năm 2017, nhiều dự án hứa hẹn "sharding" sẽ giải quyết scalability, nhưng rồi chỉ có vài dự án thực sự làm được. Disaggregated serving có thể cũng là một sharding của AI inference – đúng về mặt lý thuyết, nhưng thực tế triển khai còn nhiều rào cản: độ phức tạp vận hành tăng, yêu cầu hạ tầng mạng đắt đỏ, và rủi ro khi router trở thành điểm lỗi duy nhất.
Tuy nhiên, điểm mạnh của luận điểm này là sự hội tụ: Intel, AMD, Prime Intellect, vLLM team đều độc lập đi đến kết luận giống nhau. Điều đó cho thấy đây không phải ý tưởng của một nhóm, mà là phản ứng tất yếu trước áp lực của Agent workload. Trong blockchain, khi nhiều nhóm độc lập cùng đề xuất một giải pháp (ví dụ: optimistic rollup), thường thì giải pháp đó sẽ thành công.
Takeaway: Bài học cho DAO và cộng đồng phi tập trung
Tôi viết bài này không chỉ để phân tích kỹ thuật, mà để gợi ý một phép so sánh: cũng như AI inference đang chuyển từ batch (tập trung, tối ưu throughput) sang disaggregated (phi tập trung, tối ưu cho từng session), các DAO cũng đang đối mặt với sự chuyển đổi tương tự. Quản trị tập trung (dùng một multi-sig, một proposal duy nhất) hiệu quả cho các quyết định đơn giản, nhưng khi có nhiều agent (thành viên) với các tương tác phức tạp, cần một kiến trúc phân tán hơn: nhiều subnet, nhiều cấp độ quyết định, và khả năng lưu giữ trạng thái theo từng session.
Tôi đã chứng kiến Uniswap DAO chia rẽ vì không có cơ chế xử lý các đề xuất phức tạp. Tôi đã thấy nhiều DAO "chết" vì không ai bỏ phiếu. Disaggregated serving dạy tôi rằng: để một hệ thống phân tán hoạt động, cần có hạ tầng nhận biết được từng thực thể (agent, thành viên) và dành riêng tài nguyên cho nó. Điều này có thể dẫn đến mô hình "DAO-as-a-Service" với các bộ xử lý quyết định chuyên dụng, giống như prefill pool và decode pool.
Hãy nhìn vào AMD: họ tận dụng kiến trúc mới để cạnh tranh với NVIDIA. Trong blockchain, các blockchain layer 1 mới cũng có thể tận dụng xu hướng này để xây dựng hạ tầng AI-native. Nhưng trước mắt, tôi chỉ muốn nhấn mạnh: khi mọi người đổ xô vào token và APY, đừng quên rằng hạ tầng mới là nền tảng cho giá trị bền vững. Đầu cơ NFT là hát cho người chết nghe; đầu tư vào hạ tầng hiểu được session mới là hát cho người sống.
Và nếu bạn là một DAO builder, hãy tự hỏi: liệu DAO của bạn có đang xử lý các proposal theo kiểu batch, hay đã sẵn sàng cho một thế giới nơi mỗi thành viên là một agent với lịch sử tương tác riêng? Câu trả lời sẽ quyết định bạn còn tồn tại trong 5 năm tới hay không.
