Desert Ant Labs ra mắt 18 mô hình on-device vượt trội cloud API về tốc độ và chi phí
Startup châu Âu Desert Ant Labs phát hành 18 mô hình on-device chuyên biệt cho âm thanh, thị giác và văn bản, tuyên bố vượt trội cloud API về tốc độ, chất lượng và chi phí. Các mô hình chạy trên thiết bị cũ như điện thoại 5 năm tuổi và miễn phí tới 100k thiết bị hoạt động hàng tháng.

Desert Ant Labs, một phòng thí nghiệm AI châu Âu, đã ra mắt với 18 mô hình on-device chuyên biệt cho âm thanh, thị giác và văn bản. Lời chào hàng: các mô hình nhỏ chạy trong mili giây trên phần cứng tiêu dùng, với chi phí bằng không cho mỗi lần suy luận, để nhà phát triển có thể nhúng trí thông minh vào mọi tương tác mà không phải theo dõi hóa đơn token tăng vọt.
Các mô hình được truy cập qua một SDK duy nhất cho Swift, Kotlin và JavaScript. Các mục đáng chú ý bao gồm:
- Voz: phiên âm 10 phút âm thanh trong hai giây trên iPhone, tuyên bố nhanh hơn 4.7 lần so với Whisper, với dấu thời gian cấp từ.
- Clear: mô hình 9MB nâng cấp bản ghi năm phút lên chất lượng phòng thu trong một giây.
- Redact: che PII theo thời gian thực trên 27 ngôn ngữ, bắt 88.8% dữ liệu cá nhân trong mô hình 12MB—gần với 91.1% của mô hình GLiNER-PII 2.3GB.
- Tongue: nhận diện 84 ngôn ngữ từ ba từ với mô hình 2MB, đạt độ chính xác 0.933 so với 0.887 của bộ phát hiện 293MB.
Câu chuyện khởi nguồn của công ty gắn với ứng dụng video Detail của họ, nơi chi phí cloud API tăng theo độ phổ biến. Họ tự huấn luyện mô hình để thay thế các dịch vụ cloud như Dolby và Claude Sonnet—ví dụ, mô hình Clips của họ biến video 10 phút thành một tá clip trong 5 giây, tuyên bố nhanh hơn 10 lần và tiêu tốn năng lượng ít hơn 470 lần so với Sonnet với chất lượng tương đương.
Desert Ant Labs lập luận rằng phần lớn khối lượng công việc AI của ngành không cần mô hình tiên phong. Họ trích dẫn nghiên cứu NVIDIA cho thấy 40-70% cuộc gọi agent có thể được xử lý bởi các mô hình nhỏ, chuyên biệt. Họ cũng chỉ ra sức mạnh tính toán đã nằm trong tay người dùng: hơn một tỷ điện thoại xuất xưởng hàng năm với chip mạnh, so với 450 tỷ đô la chi cho trung tâm dữ liệu năm nay.
Lộ trình của công ty bao gồm lớp "cortex" định tuyến tác vụ đến mô hình phù hợp—ưu tiên cục bộ, chỉ dùng cloud khi cần thiết. Mô hình của họ miễn phí tới 100k thiết bị hoạt động hàng tháng, không yêu cầu token hay đăng nhập.
Khi suy luận không tốn gì, cách chúng ta xây dựng sản phẩm thay đổi hoàn toàn.
| Mô hình / Tác vụ | Desert Ant | Lựa chọn thay thế | Chỉ số chính |
|---|---|---|---|
| Phiên âm | Voz: nhanh hơn 4.7 lần so với Whisper | Whisper large-v3-turbo | Tốc độ trên iPhone |
| Nâng cấp âm thanh | Clear: 9MB, nhanh hơn 302 lần thời gian thực trên iPhone | Dolby (cloud) | Tốc độ và kích thước |
| Che PII | Redact: 12MB, tỷ lệ bắt 88.8% | GLiNER-PII: 2.3GB, 91.1% | Kích thước so với độ chính xác |
| Nhận diện ngôn ngữ | Tongue: 2MB, độ chính xác 0.933 | Bộ phát hiện 293MB: 0.887 | Độ chính xác ở kích thước nhỏ |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.