Mercury 2.5 của Inception: Diffusion LLM đạt 1.100 token/giây, tuyên bố chất lượng ngang tầm tiên phong
Inception Labs phát hành Mercury 2.5, một LLM dựa trên diffusion với mức cải thiện chất lượng 40% so với Mercury 2, thông lượng 1.107 token/giây và mức giá cạnh tranh hơn các mô hình chủ đạo. Bản cập nhật nhắm vào các khối lượng công việc nhạy cảm với độ trễ như tác tử thoại và tác tử phụ lập trình.

Inception Labs đã phát hành Mercury 2.5, phiên bản kế tiếp của mô hình ngôn ngữ dựa trên diffusion. Công ty tuyên bố mức tăng 40% về trí thông minh so với Mercury 2 trong khi vẫn duy trì cấu hình phục vụ độ trễ thấp, chi phí thấp. Nếu các con số được xác nhận, đây là diffusion LLM lớn nhất từng được huấn luyện, và nó nhắm thẳng vào các khối lượng công việc sản xuất nơi tốc độ là nút thắt cổ chai.
Có gì mới
Mercury 2.5 được xây dựng trên cùng kiến trúc diffusion như phiên bản tiền nhiệm, nhưng vòng lặp huấn luyện đã được tinh chỉnh dựa trên phản hồi từ sản xuất. Inception cho biết các lỗi của khách hàng và cải tiến đánh giá đã thúc đẩy những cải thiện này, không chỉ đơn thuần là chạy theo benchmark. Thông số chính:
- Chất lượng: Cải thiện 40% so với Mercury 2, tương đương với các mô hình tiên phong tối ưu chi phí như GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite và Claude Haiku 4.5.
- Tốc độ: 1.107 token mỗi giây trên các GPU NVIDIA phổ biến.
- Ngữ cảnh: 260K token.
- Giá: $0,20 mỗi triệu token đầu vào, $0,75 mỗi triệu token đầu ra. Khuyến mãi ra mắt: giảm 80%, giảm xuống còn $0,04 và $0,15 tương ứng.
- Khả năng: Suy luận có thể điều chỉnh, gọi công cụ song song và đầu ra JSON theo schema.
Mức giá đó rất cạnh tranh. Ngay cả ở giá đầy đủ, nó rẻ hơn hầu hết các API tiên phong, và mức giảm giá khi ra mắt khiến nó trở thành lựa chọn hiển nhiên cho các khối lượng công việc lớn.
Bằng chứng từ sản xuất
Inception không chỉ tung ra một bảng thông số. Họ có các triển khai thực tế để chứng minh.
Tác tử thoại
OpenCall, công ty xây dựng tác tử điện thoại AI, báo cáo độ trễ phản hồi mô hình trung bình khoảng 170ms sau khi chuyển sang Mercury. P99 của họ giảm từ vài phút xuống còn một giây, và P50 từ 0,4s xuống dưới 0,2s. Đối với thoại, độ trễ chính là sản phẩm—đó là sự khác biệt giữa một cuộc trò chuyện tự nhiên và một khoảng dừng khó xử.
Tác tử phụ lập trình
Augment Code sử dụng Mercury để nén ngữ cảnh và định tuyến mô hình. Họ cắt giảm độ trễ 82% (từ 150s xuống 27s) và chi phí 90% trong khi vẫn duy trì chất lượng. Tóm tắt tìm kiếm công cụ hiện trả về trong chưa đầy một giây.
Đây là những khối lượng công việc nơi độ trễ cộng dồn—hàng chục lần gọi mô hình cho mỗi yêu cầu người dùng, mỗi lần gọi làm tăng tổng thời gian. Tốc độ của Mercury biến điều đó từ một điểm yếu thành một lợi thế.
Công cụ mới: Mercury Voice và Router
Inception cũng giới thiệu trước hai sản phẩm mới:
- Mercury Voice: Một dLLM tối ưu cho tác tử thoại với thời gian đến token đầu tiên dưới 170ms.
- Mercury Router: Sử dụng dLLM để hiểu prompt và định tuyến chúng đến mô hình tốt nhất (mở hoặc đóng) dựa trên các đánh đổi về chất lượng, tốc độ và chi phí.
Cả hai đều đang trong giai đoạn xem trước và cho thấy tham vọng của Inception vượt ra ngoài việc bán mô hình thô, tiến vào lớp điều phối suy luận.
Khả dụng
Mercury 2.5 hiện có qua Inception API, Baseten và OpenRouter. Khách hàng doanh nghiệp có được dung lượng chuyên dụng, tự động mở rộng, kiểm soát tuân thủ và cấu hình lưu giữ dữ liệu.
Cách tiếp cận diffusion vẫn còn khác thường—hầu hết LLM là autoregressive—nhưng Inception đặt cược rằng tốc độ sẽ thắng. Với những con số như thế này, thật khó để tranh cãi.
Trong thoại, độ trễ không phải là chi tiết hạ tầng. Nó là khoảng dừng mà người gọi nghe thấy.
| Tính năng | Mercury 2 | Mercury 2.5 |
|---|---|---|
| Trí thông minh | Đường cơ sở | +40% |
| Tốc độ (token/giây) | Không xác định | 1.107 |
| Cửa sổ ngữ cảnh | Không xác định | 260K |
| Giá mỗi triệu token đầu vào | Không xác định | $0,20 ($0,04 khi ra mắt) |
| Giá mỗi triệu token đầu ra | Không xác định | $0,75 ($0,15 khi ra mắt) |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.