Tin tức

Cactus Hybrid: Mô hình trên thiết bị biết khi nào chúng sai

Cactus Hybrid hậu huấn luyện các mô hình nhỏ để xuất ra điểm tin cậy kèm mỗi câu trả lời, cho phép chuyển tiếp lên đám mây đáng tin cậy chỉ khi cần. Bản phát hành đầu tiên, Gemma 4 E2B Hybrid, chỉ chuyển 15–35% truy vấn lên mô hình lớn hơn trong khi vẫn ngang bằng Gemini 3.1 Flash-Lite trên các benchmark.

July 23, 2026· 2 min read· Nguồn: GitHub
Cactus Hybrid: Mô hình trên thiết bị biết khi nào chúng sai

Cactus Hybrid là một câu trả lời thực tế cho một vấn đề kinh niên trong AI biên: các mô hình nhỏ thì nhanh và riêng tư, nhưng chúng hay ảo giác hoặc thất bại một cách âm thầm. Nhóm Cactus hậu huấn luyện các checkpoint nhỏ gọn để phát ra một điểm tin cậy có cấu trúc (0 đến 1) kèm mỗi câu trả lời — không phải được phân tích từ văn bản, mà là đầu ra hạng nhất từ chính mô hình. Logic cực kỳ đơn giản:

if confidence < 0.85:
answer = ask_a_bigger_model(prompt)

Mô hình đầu tiên trong dòng sản phẩm, Gemma 4 E2B Hybrid, có sẵn trên Hugging Face. Theo Cactus, nó ngang bằng Gemini 3.1 Flash-Lite trên hầu hết các benchmark trong khi chỉ chuyển 15–35% truy vấn lên mô hình lớn hơn đó — phần còn lại được xử lý trên thiết bị.

Cách hoạt động

Bộ dò tin cậy được tích hợp vào checkpoint trong quá trình hậu huấn luyện. Nó đọc một tín hiệu chính xác độc lập với phương thức từ các trạng thái ẩn của mô hình, không phải từ các mẫu bề mặt. Bằng chứng: bộ dò đạt 0,79–0,88 AUROC trên bốn benchmark âm thanh mặc dù được huấn luyện trên không có dữ liệu âm thanh nào. Điều này loại trừ khả năng ghi nhớ và gợi ý rằng bộ dò thực sự đo lường liệu mô hình có biết câu trả lời của nó là đúng đắn hay không.

Cactus cung cấp các hướng dẫn nhanh copy-paste cho bốn engine suy luận:

  • Cactus (liên kết Python gốc)
  • MLX (Apple Silicon)
  • Transformers (Hugging Face, có lưu ý: tránh device_map="auto" vì bộ dò chạy bên ngoài đường dẫn forward của module)
  • llama.cpp (yêu cầu một bản vá một lần cho engine)

Tất cả các đoạn mã đều được cấp phép MIT; bản thân mô hình Gemma tuân theo các điều khoản của Google.

Benchmark: Tỷ lệ chuyển tiếp

Bảng dưới đây cho thấy tỷ lệ truy vấn phải được chuyển lên Gemini 3.1 Flash-Lite để đạt được độ chính xác của nó ở các mức lượng tử hóa khác nhau:

BenchmarkChuyển tiếp để ngang Flash-Lite (FP16)Ở 4-bitỞ 3-bit
ChartQA15–20%25–30%40–50%
MMBench30–35%40–45%50–55%
LibriSpeech25–30%35–40%55–65%
GigaSpeech30–35%40–45%50–55%
MMAU30–35%35–40%50–55%
MMLU-Pro45–55%~90%n/a

Ở lượng tử hóa 3-bit, tỷ lệ chuyển tiếp tăng mạnh — đặc biệt trên ChartQA và MMLU-Pro — cho thấy tín hiệu tin cậy của bộ dò suy giảm khi nén quá mức.

Bộ dò được huấn luyện trên không có dữ liệu âm thanh, nhưng vẫn đạt 0,79–0,88 AUROC trên bốn benchmark âm thanh. Điều này loại trừ các giải thích bề mặt — bộ dò đang đọc một tín hiệu chính xác độc lập với phương thức từ trạng thái ẩn.
Ban biên tập Manul X