最新動向

Metaがリアルタイム文字起こしAIを公開 20人超の会議に対応

Metaがリアルタイム文字起こしAIを公開 20人超の会議に対応

この記事の要点

Metaは9月1日、リアルタイム文字起こしのMuse Voice Transcribeを公開。80ミリ秒単位で処理し、1時間超で20人以上の会議も話者を分けて記録する。70以上の言語で学習し25以上を実用対応する。

結論

Metaは9月1日、音声をその場で文字にするMuse Voice Transcribeを公開した。80ミリ秒という短い単位で音声を処理し、話者ごとに区別しながら、1時間を超える録音や20人以上が話す場面にも対応する。70以上の言語で学習し、25以上を実用として支えるとしている。会議の議事録づくりや通話の記録を、後からまとめて起こすのではなく、進行と同時に残せる。Metaのモデル基盤から出た初のリアルタイム音声モデルで、Meta Model APIやMac向けのMeta AIから使える。

何が変わったのか

これまでの文字起こしは、録音を後で処理する方式が多く、長時間や多人数だと話者の取り違えや遅延が課題になりがちだった。Muse Voice Transcribeは、80ミリ秒ごとに区切って逐次処理することで、進行中に文字を出しながら、誰が話しているかを分け、発話の切れ目を判定する。1時間以上の会議でも、20人を超える参加者を扱えるとする。

Metaが示した数値は、リアルタイムの文字誤り率3.1%、話者の取り違え率17.5%だ。ただしこの種の数値は、音声の質や話し方、専門用語の多さで変わる。自社の会議でそのまま同じ精度が出るとは限らない。提供は、Meta Model API、Mac向けのMeta AI、開発向けのMuse Codeを通じて行われる。

音声を扱うモデルは各社が競っている分野で、複数の入力を扱う仕組みの基礎はマルチモーダルAIとは?画像・音声・文章を扱う仕組みと活用例で解説している。会議の文字起こしは業務で需要が大きく、ツールの選び方は会議向け文字起こしAIツール比較 選び方のポイントにまとめた。

現場の実務にどう効くか

効くのは、定例会議や打ち合わせの記録に時間を取られている現場だ。進行と同時に文字が残り、話者も分かれていれば、終了直後に発言者つきの記録が手元にできる。多言語対応が実用で25以上に及ぶなら、海外拠点との会議で言語をまたぐ記録も現実味を帯びる。

推進担当が試すべきは、まず1つの定例会議での比較だ。既存の議事録ツールと同じ会議を並行して記録し、話者の分離と専門用語の取り違えを見比べる。精度は環境で変わるため、数値の公称値より自社での実測を優先する。議事録ツール全体の比較はAI議事録ツールおすすめ比較 自動生成の精度と選び方、要約や通知まで含めた自動化の設計は議事録サマリと通知を自動化する方法が土台になる。文字起こしの精度が高い定番ツールの例はNotta完全ガイド:議事録自動化で会議後の作業をゼロにするで確認できる。

会議には機密が含まれるため、音声とテキストの保管先や社外への持ち出しの扱いを、導入前に決めておく。対応言語や提供経路は変わりうるので、最新の仕様は公式で確認してほしい。

FAQ

Q. Muse Voice Transcribeは何ができますか A. 音声をその場で文字に起こし、話者ごとに区別し、発話の区切りを判定します。80ミリ秒単位で処理し、1時間超や20人以上の場面にも対応します。

Q. 精度はどのくらいですか A. Metaは文字誤り率3.1%、話者の取り違え率17.5%と示していますが、数値は環境で変わります。自社の会議で試して確かめるのが確実です。

出典

よくある質問

Muse Voice Transcribeは何ができますか

音声をその場で文字に起こし、話者ごとに区別し、発話の区切りを判定します。80ミリ秒単位で処理し、1時間を超える録音や20人以上が話す場面にも対応します。70以上の言語で学習し、25以上を実用として支えるとしています。

精度はどのくらいですか

Metaはリアルタイムの文字誤り率3.1%、話者の取り違え率17.5%と示しています。ただし数値は測定条件で変わるため、自社の会議で試して確かめることをおすすめします。最新の仕様は公式で確認してください。