GoogleがGemini 3.1 Proを提供 100万トークンで長文と業務推論
GoogleはGemini 3.1 ProをVertex AI・Gemini Enterprise・消費者向けプランで提供した。テキストや音声、画像、動画、PDF、コードを扱い、コンテキストは100万トークン。企業導入で何が変わるかを実務目線で解説する。
6件の記事
GoogleはGemini 3.1 ProをVertex AI・Gemini Enterprise・消費者向けプランで提供した。テキストや音声、画像、動画、PDF、コードを扱い、コンテキストは100万トークン。企業導入で何が変わるかを実務目線で解説する。
MiniMaxは8月3日、動画生成モデルH3の重みをHugging Faceで公開した。文章や画像から4〜15秒・2Kの動画を音声つきで作れる。年間収益2000万ドル未満の組織は商用利用が無料で、日本からも使える。制作の内製化を検討する余地が広がった。
Googleが6月30日、画像生成の2モデルを公開。Gemini 3.1 Flash Imageは入力100万トークン0.5ドル、出力3ドル。上位のGemini 3 Pro Imageは入力2ドル、出力12ドル。いずれもAI Studioとgemini apiですぐ使える。
Googleが2026年6月3日にオープンソースのGemma 4 12Bをリリース。16GB VRAMのノートPCで画像・音声・テキストを処理できるマルチモーダルモデルで、Apache 2.0ライセンスで商用利用可能。企業の機密データをクラウドに送らずローカル処理できる点が注目される。
2025〜2026年の主な生成AI動向として、エージェント化・マルチモーダル高度化・コスト低下・規制整備の4つを取り上げ、それぞれが業務に与える実際の影響を解説する。
生成AIはテキスト・画像・音声・動画・コードの5カテゴリに分類されます。各カテゴリの仕組みと代表ツール、複数の形式を扱うマルチモーダルAIの位置づけを一覧で整理しました。