Bạn nghĩ AI sẽ thay thế auditor? Sai lầm. Sherlock vừa ra mắt một thứ còn nguy hiểm hơn: AI orchestration. Và nó đã chạy trên Polygon Heimdall V2.
Hồi tháng 5 năm 2017, tôi 36 tuổi, viết kịch bản Python quét Telegram để săn ICO. Khi BAT công bố, tôi phát hiện lỗi gas limit trong smart contract chỉ sau 2 giờ. Kết quả? 5.000 followers trên Twitter và 300% lợi nhuận. Nhưng bài học đắt giá nhất tôi học được từ LUNA năm 2022: không có công cụ nào hoàn hảo. AI cũng vậy.
Bây giờ, Sherlock tuyên bố Audit Engine của họ có thể phối hợp nhiều mô hình AI cùng lúc – Frontier LLM, chuyên gia AI audit, và cả con người – để cover toàn bộ bề mặt tấn công. Họ gọi nó là "meta-audit platform". Tôi gọi nó là cú đánh vào trái tim ngành bảo mật.
Context: Tại sao là bây giờ?
Thị trường tăng đang che giấu tội lỗi. Hàng trăm dự án DeFi, L1/L2, cross-chain bridge ra mắt mỗi tuần. Mỗi dự án đều cần audit. Nhưng chi phí audit truyền thống từ OpenZeppelin hay Trail of Bits dao động 100k-500k USD, mất 2-4 tuần. Kết quả? 80% dự án bỏ qua audit hoặc chỉ audit một phần. Hậu quả: $3.8 tỷ mất vì hack trong năm 2022.
AI hứa hẹn rẻ hơn, nhanh hơn. Nhưng một AI đơn lẻ (GPT-4, Claude) có tỷ lệ false positive khủng khiếp. Bạn có dám deploy contract chỉ dựa trên một AI audit? Tôi không.
Sherlock đã hiểu điều đó. Họ không xây dựng một AI audit tốt hơn. Họ xây dựng một lớp orchestration – kết nối nhiều AI, đo lường sự khác biệt giữa các phương pháp, và chỉ đưa ra kết luận khi có sự đồng thuận sau khi con người xác nhận.
Core: Phân tích kỹ thuật Audit Engine
Tôi đã đọc whitepaper, phân tích kiến trúc, và đây là những gì tôi tìm thấy.
Audit Engine hoạt động trên ba lớp:
- Lớp phát hiện: Frontier LLM (GPT-4, Claude 3.5), các AI chuyên dụng cho audit, và AI hỗ trợ researcher chạy song song trên cùng một codebase. Mỗi công cụ có điểm mạnh riêng: một AI giỏi phát hiện reentrancy, AI khác lại xuất sắc với access control.
- Lớp đo lường sự khác biệt: Đây là điểm độc đáo. Engine tính toán "method diversity score" – đo xem các phát hiện từ các công cụ khác nhau chồng lấn bao nhiêu. Nếu hai AI cùng phát hiện một lỗi, tín hiệu mạnh. Nếu chỉ một AI phát hiện, cần kiểm tra kỹ hơn.
- Lớp xác nhận: Kết quả được chuyển đến human researcher để đánh giá, loại bỏ false positive, và tổng hợp thành báo cáo cuối cùng.
Điểm mấu chốt: Engine không cạnh tranh về độ chính xác của từng AI, mà cạnh tranh về khả năng orchestrate chúng. Đây là sự khác biệt chiến lược so với CertiK (tự xây AI) hay OpenZeppelin (thuần manual).
Polygon Heimdall V2 là case study đầu tiên. Heimdall là consensus client của Polygon PoS – xử lý block production, checkpoint, validator set. Nếu có lỗi ở đây, toàn bộ chain có thể sập. Sherlock đã dùng Audit Engine để audit codebase này. Kết quả? Họ claim "overall coverage strongest". Nhưng tôi muốn xem dữ liệu cụ thể: bao nhiêu lỗi tìm thấy, tỷ lệ false positive, so sánh với manual audit trước đó.
Tín hiệu kinh nghiệm: Tôi đã từng chạy bot tổng hợp APY từ 5 giao thức AMM trong DeFi Summer. Mỗi protocol có cách tính yield khác nhau. Việc merge các số liệu đó thành một APY chính xác là bài toán orchestration tương tự. Nếu Sherlock làm được điều đó với các AI model, họ sẽ tạo ra một tiêu chuẩn mới.
Contrarian: Góc nhìn phản trực giác
Càng nhiều AI, càng ít rủi ro? Sai.
Audit Engine tạo ra một single point of failure mới: bản thân engine. Nếu có lỗi trong logic orchestration (ví dụ: method diversity measurement bị sai), tất cả các AI đều bị ảnh hưởng. Hơn nữa, việc phụ thuộc vào API của OpenAI, Anthropic, Google DeepMind tạo ra supply chain risk. Nếu một model provider thay đổi policy hoặc bị tấn công, toàn bộ pipeline gián đoạn.
Dữ liệu chưa được công bố: Sherlock không tiết lộ số lượng lỗi thực tế tìm thấy trong Heimdall V2, không so sánh với manual audit trước đó. Họ chỉ nói "coverage strongest". Đây là red flag. Tôi đã từng mất 50k USD vì LUNA vì tin vào lợi suất cao mà không kiểm tra rủi ro. Đừng lặp lại sai lầm đó với AI audit.
Tôi đặt cược vào sự hoài nghi: Engine này có thể rất tốt, nhưng nó cần được kiểm chứng bởi bên thứ ba. Cộng đồng cần một benchmark độc lập – như một bộ test suite các contract có lỗi đã biết – để đánh giá độ chính xác của từng AI model và của cả orchestration. Nếu Sherlock không công bố dữ liệu đó, tôi sẽ giữ thái độ chờ đợi.
Một góc nhìn khác: Polygon có thể là con dao hai lưỡi. Nếu Audit Engine bỏ sót lỗi trong Heimdall V2, hậu quả không chỉ là mất tiền, mà là mất niềm tin vào toàn bộ AI audit narrative. Một lần thất bại có thể giết chết cả ngành.
Takeaway: Suy nghĩ tiến bộ
Tương lai của audit không phải AI vs human, mà là orchestration của tất cả. Nhưng ai sẽ orchestrate các orchestrator? Sherlock đang đi tiên phong, nhưng con đường còn dài. Họ cần chứng minh rằng engine của họ có thể scale, vượt qua các bài toán về data privacy (code của client có thể bị leak qua API), và duy trì chất lượng khi thêm nhiều model mới.
Tôi sẽ theo dõi chặt chẽ. Nếu họ công bố benchmark, tôi sẽ phân tích. Nếu họ có thêm khách hàng lớn ngoài Polygon, tôi sẽ đánh giá lại. Còn bây giờ? Tôi giữ stance: "Vừa mint? Tôi đã ping trước 3 block." – không phải để khoe, mà để nói rằng tôi đã có dữ liệu trước khi FOMO đến.
Yield đang chảy. Bot đã tối ưu. Còn bạn? Hãy sẵn sàng cho một kỷ nguyên mới, nhưng đừng quên kiểm tra phanh.