最新動向

Googleが音声認識Gemini 3.5 Transcribe発表 言い淀みを自動整理

Googleが音声認識Gemini 3.5 Transcribe発表 言い淀みを自動整理

この記事の要点

Googleが8月26日、音声認識モデルGemini 3.5 Transcribeを発表した。「えーと」などの言い淀みを自動で除き、雑音や専門用語にも対応する。85超の言語を自動判定し、Gemini APIでプレビュー提供が始まった。

結論

Googleは8月26日、音声認識モデルGemini 3.5 Transcribeを発表した。音声を文字に変換する際に「えーと」「あの」といった言い淀みを自動で除き、雑音や専門用語にも対応する。85を超える言語を自動で判定し、開発者向けにはGemini APIでプレビュー提供が始まった。会議のメモ取りや議事録の下書きのように、キーボードから離れて仕事を進める場面で、音声入力が実用の水準に近づいたことを示す発表になった。

いつ・誰が・何を

Gemini 3.5 Transcribeは、Googleがこれまで開発してきた音声認識モデルの中で最も高精度だと同社は説明する。従来モデルが苦手としていた背景の雑音や専門用語、言い淀みの処理を改善したという。精度と自然さ、リアルタイム性が上がり、フィラーの除去から専門用語の認識までを自動で行える。

特徴は、単に音を文字に置き換えるだけでない点にある。話しているときに出てしまう「えーと」「あの」「うーん」といった言葉を自動で取り除き、言い直しも検知して整える。85を超える言語を自動で判定し、業界特有の用語にはカスタム辞書で対応できる。

提供の入り口は複数ある。開発者向けにはGemini APIでプレビューとして公開され、一般の利用者向けにはAndroidのGboardとmacOS版のGeminiアプリですでに使える。今後はGoogle ChromeやGmail、Googleドキュメント、Google Keep、Gemini Liveへ順次広げる予定とされている。日本語圏の報道でも、精度と言い淀みの自動整理を前面に取り上げている。

従来モデルとの違いも押さえておきたい。以前のChirp系のモデルは、背景の雑音や専門用語、言い直しの多い自然な話し方でつまずきやすかった。今回のモデルは、こうした崩れやすい場面での精度と、話しながら文字が起きるリアルタイム性の両方を上げたとされる。会議のように複数の人が入れ替わり話し、専門用語が飛び交う場面ほど、その差が出やすい。ただし、公表されている精度の数値は測定の条件によって変わるため、自社の音声で試して確かめるのが確実だ。

現場の実務にどう効くか

音声入力は、これまで「早いが精度が甘い」という理由で本格導入をためらう場面が多かった。言い淀みの自動整理と雑音への強さが上がると、会議の議事録や外出先でのメモ、口述での下書き作成といった業務で、書き起こしをそのまま使える割合が増える。手直しの時間が減れば、キーボードに向かう工程を音声で置き換えやすくなる。

まず試すなら、社内の定例会議を1つ選び、録音から下書きを起こしてテンプレートを自社用に整えるところから始めるとよい。専門用語が多い部署では、カスタム辞書に用語を登録して認識のずれを抑える。議事録づくりの型は議事録AIで会議の記録を自動化する実践ガイドを、書き起こしツールの選び方は会議の文字起こしをAIで行う方法とツール比較を参照してほしい。画像や音声を扱うAIの全体像はマルチモーダルAIとは?画像・音声・文章を扱う仕組みと活用例で確認できる。

精度の数値や対応範囲、提供先は変わる可能性がある。最新の内容はGoogleの公式情報で確認してほしい。音声入力が手直し前提の道具から、そのまま使える下書きを出す道具へ近づいたことが、この発表の要点である。

出典

よくある質問

Gemini 3.5 Transcribeとは

Googleが8月26日に発表した音声認識モデルです。音声を文字に変換する際に「えーと」「あの」といった言い淀みを自動で除き、雑音や業界特有の専門用語にも対応します。85を超える言語を自動で判定でき、単なる書き起こしより整ったテキストを出すとされています。

どこで使えるか

開発者向けにはGemini APIでプレビュー提供が始まりました。一般の利用者向けには、AndroidのGboardやmacOS版のGeminiアプリで使え、今後Google ChromeやGmail、Googleドキュメント、Google Keepなどにも順次広げる予定とされています。