Tin tức

Gemini 3.5 Transcribe: Mô hình chuyển giọng nói thành văn bản mới của Google đạt WER 2,6%

Google giới thiệu Gemini 3.5 Transcribe, mô hình chuyển giọng nói thành văn bản với WER 2,6%, xử lý thông minh các từ đệm và gọi hàm, có sẵn qua Live và Interactions APIs.

August 28, 2026· 3 min read· Nguồn: Google
Gemini 3.5 Transcribe: Mô hình chuyển giọng nói thành văn bản mới của Google đạt WER 2,6%

Google vừa âm thầm phát hành một mô hình chuyển giọng nói thành văn bản mới đáng để xem xét nếu bạn đang xây dựng voice agents hoặc pipeline phiên âm. Gemini 3.5 Transcribe, được công bố hôm nay, được định vị là bản nâng cấp trực tiếp của Chirp 3, với tỷ lệ lỗi từ tốt hơn, thời gian hoàn tất phiên âm nhanh hơn 70%, và bộ tính năng vượt xa phiên âm thô.

Mô hình có sẵn qua hai API: Live API cho streaming thời gian thực với độ trễ dưới giây, và Interactions API cho âm thanh ghi sẵn với gán người nói và timestamp cấp từ. Sự phân chia đó là thông minh—nó cho phép bạn chọn công cụ phù hợp cho ứng dụng voice tương tác so với phân tích sau cuộc gọi.

Điểm mới bên trong

Các con số nổi bật đến từ Artificial Analysis: WER 4,0% cho streaming, 2,6% cho non-streaming. Trên benchmark đa ngôn ngữ FLEURS, nó đạt WER 5,50% streaming và 5,04% non-streaming. Đó là những cải thiện đáng kể so với Chirp 3, đặc biệt trong môi trường ồn và các thực thể chữ số như mã bưu chính.

Nhưng điểm khác biệt thực sự là phiên âm thông minh. Mô hình xử lý tự sửa lỗi ("hẹn gặp thứ Ba—không, thứ Tư"), loại bỏ từ đệm, và tự động định dạng văn bản. Nó cũng hỗ trợ từ vựng tùy chỉnh cho thuật ngữ chuyên ngành, phát hiện hơn 85 ngôn ngữ, và có thể gán lời nói cho tối đa ba người nói (với hỗ trợ thử nghiệm cho nhiều hơn).

Gọi hàm và tích hợp sản phẩm

Gemini 3.5 Transcribe không chỉ là mô hình phiên âm—nó có thể ủy thác tác vụ cho các mô hình Gemini khác qua function calls. Điều này đã hoạt động trong ứng dụng macOS Gemini, nơi bạn có thể tóm tắt tệp hoặc tạo hình ảnh bằng lệnh thoại. Mô hình cũng được tích hợp vào tính năng Rambler của Gboard, Google Antigravity, và sẽ sớm có mặt trong Chrome cho tính năng nói để gõ trong mọi trường web.

Đối với nhà phát triển, mô hình có thể truy cập trong Google AI Studio và Gemini Enterprise Agent Platform. Live API hỗ trợ streaming hai chiều liên tục, điều quan trọng để xây dựng voice agents cần phản hồi theo thời gian thực.

Kết luận

Nếu bạn đang trong lĩnh vực voice AI, đây là một bản nâng cấp đáng kể. Các con số WER có tính cạnh tranh, cải thiện độ trễ là đáng kể, và khả năng gọi hàm mở ra các mẫu mới cho quy trình làm việc điều khiển bằng giọng nói. Giới hạn đa người nói (3 người, thử nghiệm ngoài phạm vi) có thể là ràng buộc cho một số trường hợp sử dụng, nhưng với hầu hết nhu cầu phiên âm, đây có vẻ là một lựa chọn mạnh mẽ.

Gemini 3.5 Transcribe không chỉ là mô hình phiên âm—nó có thể ủy thác tác vụ cho các mô hình Gemini khác qua function calls, biến giọng nói thành mặt điều khiển cho các quy trình AI.
Ban biên tập Manul X
Gemini 3.5 Transcribe so với Chirp 3 (đo bởi Artificial Analysis)
So sánh nhanh
Chỉ sốGemini 3.5 TranscribeChirp 3
WER (streaming)4,0%~5,5% (ước tính)
WER (non-streaming)2,6%~5,0% (ước tính)
FLEURS WER (streaming)5,50%Cao hơn
FLEURS WER (non-streaming)5,04%Cao hơn
Thời gian hoàn tất phiên âmNhanh hơn 70%Đường cơ sở