Tin tức

LFM2.5-2.6B của Liquid AI: Một Agent 2.6B Tự Nghĩ Mình Lớn Hơn

Mô hình hybrid 2.6B tham số mới của Liquid AI tuyên bố hiệu suất agentic cạnh tranh với các mô hình lớn gấp 4 lần, đạt 220 tok/s trên M5 Max và 113 tok/s trên CPU, tất cả trong chưa đầy 2.5 GB bộ nhớ.

August 11, 2026· 3 min read
LFM2.5-2.6B của Liquid AI: Một Agent 2.6B Tự Nghĩ Mình Lớn Hơn

Liquid AI đã phát hành LFM2.5-2.6B, một mô hình hybrid 2.6B tham số nhắm thẳng vào các tác vụ agentic trên thiết bị. Lời chào hàng rất đơn giản: bạn có được khả năng sử dụng công cụ và tuân theo chỉ dẫn ở cấp độ agent mà không cần một cụm GPU. Mô hình kết hợp cửa sổ ngữ cảnh 128K với quá trình hậu huấn luyện agentic, và các con số đáng để xem xét kỹ.

Thông số và Hiệu suất

Mô hình được xây dựng trên kiến trúc LFM2 với 30 lớp (22 khối tích chập ngắn cổng kép + 8 GQA), từ vựng 128,000, và ngân sách huấn luyện 34 nghìn tỷ token. Mô hình hỗ trợ 16 ngôn ngữ, bao gồm tiếng Việt, tiếng Thái và tiếng Indonesia. Độ dài ngữ cảnh là 131,072 token.

Hiệu suất là điểm nhấn: 220 token mỗi giây trên Apple M5 Max và 113 tok/s trên CPU AMD Ryzen, tất cả trong chưa đầy 2.5 GB bộ nhớ. Đủ nhanh để chạy các vòng lặp agent thực sự trên laptop mà không gặp trở ngại.

Hậu Huấn Luyện Agentic

Quy trình hậu huấn luyện là nơi Liquid AI thực hiện công việc thú vị. Đây là quy trình bốn giai đoạn: hai vòng tinh chỉnh có giám sát, chuyên môn hóa giáo viên theo từng miền, chưng cất đa miền theo chính sách, và cuối cùng là học tăng cường agentic. Giai đoạn RL huấn luyện mô hình bên trong các khung agentic phổ biến, cho nó tiếp xúc với các công cụ, lời nhắc hệ thống và mẫu tương tác của chúng. Đây là một động thái có chủ đích để làm cho mô hình hoạt động đáng tin cậy trên các hệ sinh thái agent mà các kỹ sư thực sự sử dụng.

Mô hình là một mô hình suy luận thuần túy — nó luôn suy nghĩ trước khi trả lời, thêm thẻ <think> trong mẫu trò chuyện. Việc sử dụng công cụ tuân theo giao thức bốn bước: định nghĩa hàm dưới dạng JSON, gọi chúng bằng cú pháp Pythonic giữa các token <|tool_call_start|><|tool_call_end|>, thực thi, sau đó tạo câu trả lời cuối cùng. Bạn có thể ghi đè sang JSON nếu muốn.

Định Dạng Triển Khai

Liquid AI cung cấp mô hình ở nhiều định dạng: native (cho Transformers, vLLM, SGLang), GGUF (cho llama.cpp và suy luận CPU), ONNX (cho đa nền tảng và edge), và MLX (cho Apple Silicon). Điều này bao phủ toàn bộ phổ từ GPU đám mây đến MacBook Air.

Các khung suy luận được hỗ trợ bao gồm Transformers, vLLM, llama.cpp, MLX, LM Studio và SGLang. Bắt đầu nhanh với Transformers yêu cầu transformers>=5.0.0.

Những Gì Nó Không Dành Cho

Liquid AI nói rõ về giới hạn của mô hình: nó được khuyến nghị cho các tác vụ agentic, sử dụng công cụ, trích xuất dữ liệu, RAG và quy trình làm việc ngữ cảnh dài — nhưng không dành cho lập trình agentic hoặc các tác vụ nặng về kiến thức. Đó là một sự tách biệt hợp lý cho một mô hình 2.6B.

Một mô hình 2.6B tự nghĩ mình là 10B — và chạy ở 220 tok/s trên laptop.
Ban biên tập Manul X
LFM2.5-2.6B trong nháy mắt
So sánh nhanh
Thông sốGiá trị
Tham số2.69B
Lớp30 (22 conv + 8 GQA)
Token huấn luyện34T
Độ dài ngữ cảnh131,072
Ngôn ngữ16
Tốc độ (M5 Max)220 tok/s
Tốc độ (CPU Ryzen)113 tok/s
Bộ nhớ< 2.5 GB