Hook
Tối 12/10/2026, tài khoản Twitter của Kimi – startup AI đến từ Bắc Kinh – đăng tải một dòng code duy nhất kèm link Git: “PerceptionBench: Open-source visual perception benchmark for multimodal LLMs.” Chỉ trong 3 giờ, repo GitHub nhận 1.2k star, nhưng điều khiến tôi – một kỹ sư giao thức đã theo dõi cả làng AI lẫn crypto từ 2017 – giật mình là danh sách điểm số. GPT-5.6-Sol đạt 54.2%, Claude-Fable-5 đạt 51.8%, Gemini-3.1-Pro đạt 49.3%... Tất cả 15 model được kiểm tra đều dưới 60% chính xác. Nhưng câu hỏi lớn không nằm ở con số, mà ở cái tên: GPT-5.6-Sol là ai? Claude-Fable-5 có tồn tại không? Nếu đây là lỗi media, thì cả câu chuyện đang bị thổi phồng. Nếu đây là testnet ID, ai đảm bảo kết quả này có thể tái lập?
Context
PerceptionBench là bộ chuẩn đánh giá năng lực cảm nhận thị giác của các mô hình ngôn ngữ đa phương thức (Multimodal LLMs). Kimi (tên đầy đủ: 月之暗面, Moon's Dark Side) phát hành dưới giấy phép Apache 2.0, bao gồm 10 năng lực nguyên tử như phát hiện ảo giác (hallucination detection), nhận diện chi tiết nhỏ (fine-grained recognition), phân biệt đối tượng tương tự (similar object discrimination)... Tổng cộng hơn 3.000 câu hỏi, mỗi câu được thiết kế để cô lập một kỹ năng thị giác cụ thể, nhằm lộ ra điểm yếu mà các benchmark tổng hợp (như MMMU, MMLU-Pro) thường che dấu. Kết quả công bố cho thấy model tốt nhất chỉ đạt 59.5% – một con số báo động đối với bất kỳ ai kỳ vọng AI có thể thay thế con người trong các tác vụ thị giác phức tạp.
Động thái này của Kimi được giới blockchain chú ý vì hai lý do. Thứ nhất, Kimi từng huy động vốn từ quỹ đầu tư tập trung vào Web3. Thứ hai, PerceptionBench có thể trở thành công cụ xác thực chất lượng cho các dự án Crypto-AI – nơi các hợp đồng thông minh cần “nhìn” ảnh để thực thi điều kiện (ví dụ: NFT xác thực, bảo hiểm tham số dựa trên hình ảnh thiệt hại). Nếu benchmark này đủ tin cậy, nó sẽ định giá lại toàn bộ hệ sinh thái AI agent trên blockchain. Nhưng nếu nó chỉ là PR, nó có thể gây ra những quyết định đầu tư sai lầm.

Core
Tôi dành một buổi tối đọc source code PerceptionBench trên GitHub. Điều đầu tiên tôi kiểm tra: tập dữ liệu có bị rò rỉ không? Tôi không tìm thấy bằng chứng về việc test set được công bố trước – một dấu hiệu tốt. Nhưng cấu trúc câu hỏi cho thấy một vấn đề khác: hầu hết câu hỏi đều là “adversarial” – cố tình tạo ra các trường hợp biên mà mô hình dễ mắc sai lầm. Ví dụ: hai bức ảnh gần giống hệt nhau, chỉ khác một pixel, yêu cầu mô hình chọn ảnh có đồ vật được mô tả chính xác. Điều này giải thích tại sao điểm số thấp – nhưng liệu nó có đại diện cho hiệu suất trong thế giới thực? Câu trả lời là không. PerceptionBench đo “giới hạn trên” của năng lực thị giác thuần túy, không phải khả năng suy luận tổng thể.

Vấn đề thứ hai: danh sách model. Tôi đã kiểm tra tất cả 15 tên model trong bài báo. Không có cái nào khớp với bất kỳ model nào đã được công bố chính thức bởi OpenAI, Anthropic, Google, hay bất kỳ phòng lab nào. GPT-5.6-Sol? Phiên bản GPT-5 mới nhất là 5.4. Sol có thể là variant nội bộ, nhưng OpenAI chưa từng xác nhận. Claude-Fable-5? Anthropic gần đây phát hành Claude 4.5, không có phiên bản Fable. Gemini-3.1-Pro? Gemini 3.0 mới ra mắt cuối 2025. Sự sai lệch này đến từ đâu? Khả năng cao nhất: media đã viết sai tên, có thể do dịch thuật hoặc suy diễn từ tên thử nghiệm nội bộ. Khả năng thứ hai: bài báo đã tự chế tạo model để tạo hiệu ứng sốc – một chiêu trò từng thấy trong thị trường crypto khi các dự án tạo ra “đối thủ ảo” để làm nổi bật sản phẩm của mình.

Khi audit một hợp đồng thông minh, tôi thường kiểm tra xem các tham số có bị cố tình thiết lập để có lợi cho một bên không. Với PerceptionBench, tôi thấy một tín hiệu đáng ngờ: Kimi K3 – model của chính Kimi – đứng thứ hai với 58.5%, chỉ sau một model không xác định (59.5%). Trong mọi benchmark, việc tác giả của benchmark đứng top 2 là một red flag lớn. Nó gợi ý rằng dataset có thể đã được thiết kế hoặc lựa chọn để phù hợp với điểm mạnh của Kimi K3. Tôi không nói rằng đây là cheat – nhưng nó là một lời nhắc nhở rằng không có benchmark nào hoàn toàn trung lập. DeFi hè 2020 dạy tôi: tối ưu là vô hạn. Cũng vậy, một model có thể được tinh chỉnh để đạt điểm cao trên một benchmark cụ thể, nhưng vẫn thất bại trong các tác vụ thực tế.
Contrarian
Đám đông đang hô vang: “PerceptionBench là thước đo chân lý cho AI thị giác!” Tôi nói ngược lại: Nó có thể là một cái bẫy đầu tư nguy hiểm hơn so với lợi ích. Hãy nhìn vào thị trường crypto hiện tại – đang đi ngang, các quỹ đầu tư đổ xô vào các dự án Crypto-AI với hy vọng tìm kiếm alpha. Một benchmark có điểm số thấp (dưới 60%) sẽ được các marketer khai thác để kể câu chuyện “AI vẫn còn yếu, hãy đầu tư vào giải pháp của chúng tôi”. Nhưng thực tế, PerceptionBench chỉ là một bài kiểm tra căng thẳng (stress test), không phải một bài kiểm tra năng lực tổng quát. Một model có thể đạt 95% trên ImageNet nhưng chỉ 55% trên PerceptionBench – điều đó có nghĩa nó không đáng tin cậy? Không. Nó có nghĩa là model không được tối ưu hóa cho các câu hỏi adversarial. Tương tự, một dự án DeFi có thể có TVL cao nhưng thất bại trong stress test thanh lý – nhưng bạn vẫn kiếm được lợi nhuận ổn định nếu không có biến động.
Điểm mù bảo mật thực sự ở đây: Các dự án crypto có thể sử dụng PerceptionBench để chứng minh “năng lực AI” của mình, nhưng vì danh sách model không đáng tin cậy, họ có thể tự tạo ra điểm số giả bằng cách đặt tên model không tồn tại. Tôi đã thấy điều này trong các ICO 2017: các đội ngũ tạo ra “white paper” với những con số ấn tượng nhưng không thể kiểm chứng. Nếu không có một cơ quan xác thực độc lập (ví dụ: một tổ chức phi lợi nhuận chạy benchmark), mọi dữ liệu từ PerceptionBench đều có thể bị làm giả. Điều này đặc biệt nguy hiểm khi các quỹ đầu tư mạo hiểm bắt đầu yêu cầu các dự án AI cung cấp điểm PerceptionBench như một điều kiện rót vốn.
Takeaway
Thị trường đang đi ngang. Đây là lúc để sàng lọc. PerceptionBench có thể là một công cụ hữu ích cho những ai hiểu rõ giới hạn của nó. Nhưng với những lỗ hổng trong việc xác minh model, nó giống một cái “trap” hơn là một “tool”. Lời khuyên của tôi: Đừng đầu tư vào bất kỳ dự án Crypto-AI nào chỉ dựa trên điểm PerceptionBench – hãy yêu cầu audit mã nguồn, kiểm tra dữ liệu huấn luyện, và xem model hoạt động trong môi trường sandbox trước khi gửi ETH. Khi cơn sốt AI nguội lạnh, chỉ có những dự án có nền tảng kỹ thuật thực sự mới trụ lại. Còn PerceptionBench? Nó sẽ là một footnote trong lịch sử, hoặc là một bài học về cách benchmark có thể bị lạm dụng. Tùy thuộc vào cách chúng ta dùng nó.