Crypto Briefing vừa đưa tin FutureSearch chính thức rời giai đoạn thử nghiệm công khai và ra mắt công cụ AI dự đoán thị trường. Tuyên bố gây chú ý nhất của đội ngũ phát triển: "hiệu suất vượt trội so với các siêu dự báo viên (superforecasters) con người". Tôi đọc kỹ toàn bộ bài viết, tìm kiếm ba thứ: Brier score, số lượng câu hỏi dự đoán, và tổ chức thứ ba xác nhận. Cả ba đều không tồn tại. Một tuyên bố nặng ký như vậy, nhưng không có nổi một con số định lượng nào đi kèm. Trong 7 ngày qua, ít nhất ba dự án AI dự đoán đã tung ra những thông cáo tương tự, và tôi tin con số thực tế còn cao hơn.
Hãy lùi lại một bước để hiểu bối cảnh. Khái niệm "siêu dự báo viên" bắt nguồn từ nghiên cứu của Philip Tetlock kéo dài hai thập kỷ, chứng minh rằng một nhóm nhỏ người được đào tạo bài bản có thể đưa ra xác suất chính xác hơn 60% so với các chuyên gia truyền thống. Điều này trở thành nền tảng cho Good Judgment Project và hàng loạt nền tảng dự đoán tập thể như Metaculus, Manifold. Về mặt cấu trúc, dự đoán chính xác có ba thành phần: thu thập thông tin, cập nhật xác suất, và hiệu chỉnh độ tin cậy. LLM hiện đại tỏ ra cực kỳ mạnh ở thành phần đầu tiên, nhờ khả năng tổng hợp hàng nghìn nguồn tin chỉ trong vài giây. Nhưng hai thành phần sau — cập nhật xác suất theo thời gian thực và hiệu chỉnh độ tin cậy — lại là nơi mà nhiều hệ thống AI thất bại thảm hại. Trong bối cảnh tiền điện tử, sự xuất hiện của FutureSearch trên Crypto Briefing là một tín hiệu đáng chú ý: các công cụ dự đoán AI đang tiến gần hơn đến hệ sinh thái tài sản số, nơi mà polymarket và các nền tảng dự đoán phi tập trung đã có cộng đồng người dùng đáng kể.
Trọng tâm của vấn đề nằm ở phương pháp luận. Tôi đã dành ra ba tháng cuối năm 2022 để phân tích cơ chế arbitrage của UST và làm báo cáo dài 50 trang về Terra, nên tôi hiểu rõ giá trị của việc xác minh dữ liệu độc lập. Khi một sản phẩm AI tuyên bố "vượt trội so với con người", có bảy câu hỏi tôi sẽ hỏi ngay: Dự đoán được đánh giá bằng Brier score hay tỷ lệ chính xác? Tổng cộng bao nhiêu câu hỏi dự đoán? Khoảng thời gian dự đoán là bao lâu — một tháng, một quý, hay một năm? Đây là dự đoán tương lai hay chỉ là hồi quy trên dữ liệu lịch sử? Nhóm siêu dự báo viên được so sánh có xác định rõ ràng về năng lực không? Có đơn vị kiểm tra độc lập không? Và cuối cùng, họ có công bố kết quả dự đoán định kỳ hay chỉ phát hành thông cáo báo chí khi đạt kết quả tốt? Bài viết của Crypto Briefing không trả lời được câu hỏi nào trong số đó.
Độc giả cần phân biệt rõ ba cấp độ của một hệ thống AI dự đoán. Cấp độ đầu tiên là hạ tầng: mô hình ngôn ngữ lớn, hệ thống thu thập dữ liệu, cơ sở hạ tầng tính toán. Cấp độ thứ hai là thuật toán dự đoán: cách mô hình chuyển hóa thông tin thành xác suất. Cấp độ thứ ba là sản phẩm: giao diện người dùng, cách trình bày kết quả và hệ thống phản hồi. FutureSearch, dựa trên những gì được công bố, gần như chắc chắn nằm ở cấp độ thứ ba — họ kết hợp các mô hình ngôn ngữ lớn có sẵn, hệ thống truy vấn thông tin, và một lớp hiệu chỉnh xác suất. Cách tiếp cận này không sai, nhưng nó tạo ra khoảng cách lớn giữa kỳ vọng và thực tế. Nếu bạn dùng GPT-4 để phân tích tin tức rồi thêm một lớp hiệu chỉnh xác suất, bạn vẫn chỉ đang tổng hợp thông tin chứ không phải tạo ra tri thức mới. Khi tổng hợp thông tin, mô hình có xu hướng tái tạo những gì báo chí đã viết, và nếu thông tin đầu vào sai hoặc định kiến, xác suất đầu ra sẽ bị dẫn dắt sai.
Điểm mù lớn của FutureSearch, và cũng là của ngành AI dự đoán nói chung, nằm ở dữ liệu đào tạo. Trong bài phân tích gần đây của tôi về các hợp đồng thông minh dựa trên AI on-chain, tôi lưu ý rằng các mô hình được huấn luyện trên dữ liệu lịch sử của thị trường có xu hướng bỏ qua các điểm ngoặt. Lý do rất đơn giản: nếu mô hình của bạn được đào tạo đến năm 2024, thì những gì xảy ra trong năm 2025 vẫn là một miền xác suất mà mô hình phải ngoại suy. Các công cụ AI dự đoán thường công bố kết quả ấn tượng trên các câu hỏi lịch sử — như bầu cử tổng thống Hoa Kỳ hay kết quả World Cup — nhưng đó là vì dữ liệu đã nằm trong bộ huấn luyện của mô hình. Nếu bạn hỏi mô hình "ai sẽ trở thành tổng thống tiếp theo của Indonesia", bạn sẽ không nhận được câu trả lời tốt hơn một nhà phân tích chính trị có kinh nghiệm. Vấn đề này được gọi là data leakage trong giới khoa học máy tính. Đó là lý do tại sao các tuyên bố "vượt trội" không có ý nghĩa thống kê nếu không có một khoảng thời gian dự đoán triển vọng — thời gian thực tế trôi qua để kiểm chứng dự đoán.
Tôi từng dành trọn năm 2017 để kiểm toán các hợp đồng thông minh ICO cho một quỹ đầu tư tại Kuala Lumpur. EtherBond huy động được 12 triệu USD nhờ một whitepaper đẹp và một đội ngũ giàu kinh nghiệm, nhưng tôi phát hiện ra lỗ hổng reentrancy cho phép hacker rút sạch quỹ. Khi tôi trình bày báo cáo kiểm toán 15 vấn đề bảo mật, CEO của dự án nhìn tôi và hỏi: "Nhưng chị có chắc không? Các chuyên gia khác đã kiểm tra và không thấy gì cả." Tôi trả lời: "Mã tốt tự nói lên tất cả." Nếu một hợp đồng thông minh được kiểm tra đúng cách, không cần ai phải thuyết phục bạn. Nhưng nếu họ chỉ cho bạn xem một slide thuyết trình với biểu đồ màu xanh đẹp đẽ, thì hãy nghi ngờ. FutureSearch cũng vậy. Mã tốt tự nói lên tất cả, và nếu sản phẩm thực sự vượt trội, họ sẽ không cần một bài PR trên Crypto Briefing để chứng minh điều đó — họ sẽ công bố một bảng xếp hạng dự đoán công khai để bất kỳ ai cũng có thể theo dõi kết quả của hệ thống theo thời gian thực.
Câu hỏi đặt ra: tại sao một sản phẩm AI dự đoán lại chọn Crypto Briefing làm nơi công bố thông tin quan trọng? Câu trả lời liên quan trực tiếp đến mô hình kinh doanh của họ. Thị trường dự đoán phi tập trung như Polymarket đã xử lý hàng tỷ USD khối lượng giao dịch trên các sự kiện chính trị và kinh tế. Một công cụ AI có thể dự đoán chính xác hơn giá thị trường sẽ tạo ra cơ hội arbitrage — bạn đặt cược khi AI tự tin và giá thị trường chưa phản ánh đúng. Điều này giải thích vì sao FutureSearch không chọn TechCrunch hay WIRED, mà chọn một trang web chuyên về tiền điện tử. Họ đang tìm kiếm sự chú ý của các nhà đầu tư crypto — những người sẵn sàng trả phí đăng ký hàng tháng cho một công cụ có thể dự đoán các sự kiện ảnh hưởng đến thị trường. Mô hình này hoàn toàn hợp lý về mặt kinh doanh, nhưng nó không trả lời được câu hỏi khoa học cơ bản: sản phẩm của bạn hoạt động tốt ở mức độ nào?
Bài toán cạnh tranh còn cam go hơn. Metaculus đã giúp hàng ngàn người dùng đưa ra dự đoán về các biến cố toàn cầu từ năm 2015. Good Judgment đã xây dựng đội siêu dự báo viên đạt điểm Brier 0,25 trên hàng trăm câu hỏi địa chính trị. Polymarket đã tạo ra một thị trường nơi xác suất được thiết lập bởi tiền thật. FutureSearch muốn cạnh tranh bằng một thuật toán? Quá trình này đòi hỏi họ phải chứng minh khả năng vượt trội không chỉ một lần, mà liên tục trong nhiều tháng và trên nhiều lĩnh vực khác nhau. Dự đoán chính trị khác dự đoán kinh tế, khác dự đoán dịch bệnh, khác dự đoán biến đổi khí hậu. Một mô hình giỏi về bầu cử Mỹ chưa chắc giỏi về giá dầu Brent hoặc khả năng kích hoạt Điều 50 của Anh.
Có một sự kỳ vọng nguy hiểm mà bài viết về FutureSearch cố gắng gieo vào độc giả: ý tưởng rằng AI có thể thay thế con người ra quyết định. Nhưng kể cả khi AI dự đoán được xác suất đúng, nó vẫn không giúp con người quyết định phải làm gì. Xác suất 78% Hamas tấn công Israel vào tháng 10 năm 2023 không ngăn được lực lượng tình báo Israel ngủ quên. Sự chuyển dịch quan trọng nhất mà AI dự đoán mang lại không phải là dự đoán chính xác hơn con người, mà là tạo ra một quy trình dự đoán có thể kiểm tra, có thể theo dõi và có thể cải thiện liên tục. Và chính ở khía cạnh này, FutureSearch — cũng như các sản phẩm tương tự — vẫn còn thiếu sót nghiêm trọng.
Với tư cách là một kỹ sư đã xây dựng hệ thống xác thực ZK-Proof cho một tổ chức tài chính ở Singapore vào năm 2024, tôi biết rằng tính minh bạch là nền tảng của mọi hệ thống đáng tin cậy. Khi tôi phát triển module kiểm tra đầu ra cho NeuroChain, tôi luôn gắn kèm yêu cầu hiển thị mức độ tự tin của mô hình. Nếu độ tự tin dưới ngưỡng 0,6, hệ thống phải đánh dấu "không đủ dữ liệu để đưa ra dự đoán" thay vì đưa ra một con số giả định.
Mã tốt tự nói lên tất cả. Nhưng khi mã không được công khai, khi dữ liệu kiểm chứng không hiển thị, khi không có cơ chế theo dõi dự đoán hàng ngày, thì tuyên bố vượt trội chỉ đơn giản là một câu chuyện bán hàng. Tôi sẽ tin FutureSearch khi họ công bố bảng điểm dự đoán công khai, với ngày tạo dự đoán, ngày kết thúc, và kết quả được xác minh. Cho đến lúc đó, hãy coi sản phẩm này như một công cụ bổ sung thông tin, không phải kim chỉ nam cho quyết định đầu tư. Và hãy luôn nhớ câu nói của tôi khi đối mặt với bất kỳ bản whitepaper hay thông cáo báo chí nào: mã tốt tự nói lên tất cả.

