最新動向
Microsoftが音声認識MAI-Transcribe-2公開 60言語対応
Microsoftが自社開発の音声認識モデルMAI-Transcribe-2を公開した。60言語に対応し、競合比で最大10倍速をうたう。議事録や通話記録の文字起こしを速く安く回せる可能性があり、会議の多い部署の作業削減に効く。
5件の記事
Microsoftが自社開発の音声認識モデルMAI-Transcribe-2を公開した。60言語に対応し、競合比で最大10倍速をうたう。議事録や通話記録の文字起こしを速く安く回せる可能性があり、会議の多い部署の作業削減に効く。
Metaは9月1日、リアルタイム文字起こしのMuse Voice Transcribeを公開。80ミリ秒単位で処理し、1時間超で20人以上の会議も話者を分けて記録する。70以上の言語で学習し25以上を実用対応する。
Googleが8月26日、音声認識モデルGemini 3.5 Transcribeを発表した。「えーと」などの言い淀みを自動で除き、雑音や専門用語にも対応する。85超の言語を自動判定し、Gemini APIでプレビュー提供が始まった。
Notta・Otter.ai・Whisper系・国産ツールなど会議文字起こしAIを、精度・話者識別・日本語対応・料金の観点で比較。用途別の選び方と導入前の確認ポイントをまとめた。
リアルタイム音声対話AIの技術的進化と、コールセンター・議事録・ナレーション・多言語対話への業務応用を整理する。代表的なモデルの概要と選定ポイントも示す。最新の性能・価格は公式情報で確認してほしい。