Tuần trước, tôi đọc một bài báo về GLM-5.3, model code mới của Z.AI. Điều đầu tiên đập vào mắt tôi là sự mâu thuẫn: tiêu đề tự hào gọi nó là 'top open-source code model', nhưng ngay trong bài, dữ liệu từ blog của chính Z.AI lại cho thấy nó thua ít nhất một đối thủ open-source khác. Đây không chỉ là chuyện marketing quá tay – nó đặt ra câu hỏi về độ tin cậy của các code model trong lĩnh vực blockchain, nơi một dòng code sai có thể dẫn đến mất hàng triệu USD.
Context: Cuộc đua code model và cái bẫy 'top'
GLM-5.3 là phiên bản mới nhất của dòng model GLM từ Z.AI, tập trung vào code generation. Họ tuyên bố nó là 'top open-source code model' dựa trên một số benchmark nội bộ. Nhưng bài báo chỉ ra rằng blog của chính họ thừa nhận model này 'vẫn còn thua xa các closed-source frontier và ít nhất một đối thủ open-source'. Trong bối cảnh code model đang trở thành công cụ không thể thiếu cho smart contract development – từ sinh mã cho đến audit tự động – thì một tuyên bố sai lệch có thể gây hiểu lầm nghiêm trọng cho cộng đồng dev blockchain.
Core: Từ góc nhìn của một Smart Contract Architect
Tôi đã dành 29 năm làm việc với code, và 7 năm gần đây chuyên về smart contract trên Ethereum. Khi đánh giá một code model cho blockchain, tôi không chỉ quan tâm đến điểm số HumanEval hay SWE-bench. Tôi muốn biết: nó có tạo ra được contract an toàn không? Có hiểu được các pattern như reentrancy guard, access control, hay gas optimization không? Bài báo về GLM-5.3 không cung cấp thông tin đó. Nhưng dựa trên kinh nghiệm audit của tôi, một model code không phải top thường mắc những lỗi cơ bản – như quên kiểm tra return value của external call, hoặc sử dụng tx.origin thay vì msg.sender.
Tôi từng phát hiện một lỗi reentrancy trong hợp đồng ICO năm 2017. Nếu lúc đó có một code model sinh ra contract đó, và nó không được huấn luyện đúng cách, thì hậu quả sẽ rất lớn. Với GLM-5.3, việc nó thua các đối thủ open-source khác có nghĩa là trong các tác vụ generate code phức tạp – như viết một contract AMM hoặc cross-chain bridge – nó có thể tạo ra nhiều lỗi hơn. Điều này đặc biệt nguy hiểm khi các dev mới vào nghề dựa vào AI để viết contract.

Contrarian: 'Top' không phải là điều quan trọng nhất
Có một góc nhìn phản trực giác: việc GLM-5.3 không phải top open-source code model có thể là một tín hiệu tốt cho blockchain. Tại sao? Vì nếu nó quá mạnh, nó sẽ tạo ra một làn sóng contract được sinh tự động với số lượng lớn, làm tăng nguy cơ lỗi bảo mật hàng loạt. Một model 'trung bình' buộc dev phải kiểm tra kỹ hơn, giảm sự phụ thuộc mù quáng vào AI. Tôi đã thấy điều này xảy ra với các audit tool: khi một tool quá tự động, dev thường bỏ qua manual review, dẫn đến lỗ hổng.
Hơn nữa, Z.AI chọn tập trung vào 'open-source weight' thay vì closed-source, điều này có lợi cho blockchain ecosystem. Vì tính minh bạch và khả năng kiểm tra là cốt lõi của Web3. Một model open-source weight cho phép cộng đồng audit chính nó – giống như cách chúng ta audit smart contract. Nhưng nếu model đó không thực sự top, thì lợi thế đó bị giảm đi.

Takeaway: Dự báo lỗ hổng và cơ hội
Tôi dự đoán trong 6 tháng tới, sẽ xuất hiện các lỗ hổng smart contract được sinh ra bởi các code model không được kiểm tra kỹ. Các audit firm sẽ phải đầu tư nhiều hơn vào AI-powered audit để bắt kịp. GLM-5.3, dù không phải top, vẫn có thể trở thành công cụ hữu ích nếu được sử dụng đúng cách – nhưng chỉ khi Z.AI công bố benchmark trung thực và cộng đồng hiểu rõ giới hạn của nó. Câu hỏi đặt ra: liệu chúng ta có đang chạy theo marketing thay vì chất lượng code?