Gemini 3.5 Transcribe:Googleの新音声認識モデル、WER 2.6%を達成
GoogleがGemini 3.5 Transcribeを発表。WER 2.6%、スマートな言い淀み除去、関数呼び出しに対応し、Live APIとInteractions APIで利用可能。

Googleは、音声エージェントや文字起こしパイプラインを構築しているなら注目に値する新しい音声認識モデルを静かにリリースした。本日発表されたGemini 3.5 Transcribeは、Chirp 3の直接的なアップグレードとして位置づけられており、より優れた単語誤り率、最終文字起こしまでの時間が70%高速化、そして単なる文字起こしを超えた機能セットを備えている。
このモデルは2つのAPIを通じて利用できる。サブ秒レイテンシのリアルタイムストリーミング用のLive APIと、話者属性と単語レベルのタイムスタンプ付きの録音済み音声用のInteractions APIだ。この分割は賢い。インタラクティブな音声アプリと通話後分析で適切なツールを選べるからだ。
内部の新機能
主要な数字はArtificial Analysisによるものだ。ストリーミングでWER 4.0%、非ストリーミングで2.6%。FLEURS多言語ベンチマークでは、ストリーミングで5.50%、非ストリーミングで5.04%のWERを達成している。これらはChirp 3からの確かな改善であり、特にノイズの多い環境や郵便番号などの英数字エンティティで顕著だ。
しかし、本当の差別化要因はスマートな文字起こしだ。このモデルは自己修正(「火曜日に会おう——いや、水曜日」)を処理し、フィラーワードを除去し、テキストを自動整形する。また、専門用語のカスタム語彙をサポートし、85以上の言語を検出し、最大3人の話者に音声を属性付けできる(さらに多くの話者の実験的サポート付き)。
関数呼び出しと製品統合
Gemini 3.5 Transcribeは単なる文字起こしモデルではない。関数呼び出しを介して他のGeminiモデルにタスクを委任できる。これはmacOS Geminiアプリですでに稼働しており、音声コマンドでファイルを要約したり画像を生成したりできる。このモデルはGboardのRambler機能、Google Antigravityにも組み込まれており、まもなくChromeにも搭載され、任意のWebフィールドで音声入力が可能になる。
開発者向けには、このモデルはGoogle AI StudioとGemini Enterprise Agent Platformでアクセスできる。Live APIは継続的な双方向ストリーミングをサポートしており、リアルタイムで応答する必要がある音声エージェントの構築に重要だ。
結論
音声AI分野に携わっているなら、これは意義深いアップグレードだ。WER数値は競争力があり、レイテンシ改善は顕著で、関数呼び出し機能は音声駆動ワークフローの新しいパターンを切り開く。マルチスピーカー制限(3人、それ以上は実験的)は一部のユースケースで制約になるかもしれないが、ほとんどの文字起こしニーズには強力な選択肢に見える。
Gemini 3.5 Transcribeは単なる文字起こしモデルではない。関数呼び出しを介して他のGeminiモデルにタスクを委任でき、音声をAIワークフローのコントロールプレーンに変える。
| 指標 | Gemini 3.5 Transcribe | Chirp 3 |
|---|---|---|
| WER(ストリーミング) | 4.0% | 約5.5%(推定) |
| WER(非ストリーミング) | 2.6% | 約5.0%(推定) |
| FLEURS WER(ストリーミング) | 5.50% | より高い |
| FLEURS WER(非ストリーミング) | 5.04% | より高い |
| 最終文字起こしまでの時間 | 70%高速化 | ベースライン |
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。