Google、Gemini 3.6 Flash公開 エージェント費用を圧縮
この記事の要点
Googleは7月21日にGemini 3.6 Flashを公開した。出力トークンを従来比17%削減し、エージェント向けの単価も引き下げた。大量の軽い処理を安いモデルへ振り分けやすくなる。
結論
Googleは7月21日、軽量モデルのGemini 3.6 Flashを公開した。標準の単価は100万トークンあたり入力1.50ドル、出力7.50ドル。文脈は100万トークンまで扱え、公開初日からAI Studio、Gemini API、Geminiアプリで使える。エージェント用途では入力0.3ドル、出力2.5ドルとさらに安い設定を用意した。前世代の3.5 Flashより出力トークンを約17%減らし、同じ仕事をより少ないトークンで終える。単純で量の多い処理を安いモデルへ振り分けたい担当者にとって、選択肢が一つ増えた。
何が変わったか
今回の中心は、性能ではなく単価とトークン効率にある。3.6 Flashは、コーディング、長文処理、画面を操作する指標で3.5 Flashを上回りながら、出力トークンを約17%削減した。生成AIの請求はトークンの量で決まるため、同じ出力でもトークンが減れば請求額はそのまま下がる。単価の引き下げと二重に効く。
企業向けでは、Vertex AIとGemini Enterpriseで使える。処理能力をあらかじめ確保する契約、まとめて処理する方式、使った分だけ払う方式の3つに対応する。とくにエージェント用途の単価が低いため、多段階の作業は思考を深いレベルに設定し、単純で回数の多い下請け処理は最小限の思考に落とす、といった振り分けが現実的になる。
思考の深さを段階で切り替えられる点は、費用の設計に直結する。エージェントが多数の下請け処理を回すとき、すべてを深く考えさせると単価が積み上がる。分類や抽出のような軽い処理は最小限の思考で済ませ、判断を要する工程だけ思考を深める。この使い分けができると、同じ業務でも請求額が変わる。単価の引き下げは、こうした振り分けの余地を広げる意味で効く。
| 項目 | Gemini 3.6 Flash |
|---|---|
| 標準単価(100万トークン) | 入力1.50ドル / 出力7.50ドル |
| エージェント単価(100万トークン) | 入力0.3ドル / 出力2.5ドル |
| 文脈の長さ | 100万トークン |
| 出力トークン | 3.5 Flash比 約17%減 |
同じ7月21日にはGemini 3.5 Flashの一般提供も進んでおり、Googleは高速・低コスト帯を短い間隔で更新している。値付けの下限をめぐる動きは中国勢も同様で、DeepSeek V4の正式版が価格の下限を固めつつある。
現場の実務にどう効くか
まず、社内で使っている処理を「賢さが要る仕事」と「量が多い単純な仕事」に分ける。要約の下ごしらえ、分類、定型の抽出といった単純で回数の多い処理は、3.6 Flashのような安いモデルへ回す。込み入った判断や多段階の作業だけを上位モデルに残せば、月額は目に見えて下がる。トークンと料金の関係はトークンとは?文字数制限と料金の関係で整理できる。
次に、切り替えの前に自社のプロンプトで実測する。ベンチマークの数字は参考であって、自社の文章や業務での精度は別に測る必要がある。同じ入力を旧モデルと新モデルに通し、出力の質とトークン量、応答時間を並べて比べる。この手順を踏めば、安いモデルに落として問題ない処理と、上位モデルを残すべき処理の線引きができる。モデルの絞り込み方は生成AIモデルの選び方が使える。
料金は変わりやすい。ここで示した単価は公開時点のもので、最新の値は公式資料で確認してほしい。単価が下がっても、使い方を設計しなければ処理量が増えて総額が膨らむこともある。用途の振り分けと実測が、費用を抑える近道になる。
こうした軽量モデルの短い間隔での更新は、モデルの選定を「一度決めたら固定」から「定期的に見直す」ものへ変える。数か月ごとに、より安く、より少ないトークンで同じ仕事をこなすモデルが出てくる。自社のプロンプトと業務での実測を仕組みにしておけば、新しいモデルが出るたびに切り替えの判断を素早く下せる。逆に、一度組んだ構成を放置すると、割高な旧モデルを使い続けることになる。単価の低下を費用の削減につなげるには、定期的な見直しを運用に組み込むことが欠かせない。
FAQ
Q. 安いモデルに切り替えると精度は落ちませんか。 A. 用途によります。単純な分類や抽出では差が出にくく、込み入った判断では上位モデルが有利です。自社の処理で実測してから振り分けるのが安全です。
Q. エージェント単価が別に設定されているのはなぜですか。 A. エージェントは多数の下請け処理を大量に回すため、単価が総額に大きく響きます。低い単価を用意することで、回数の多い処理を安く回せるようにしています。
出典
よくある質問
Gemini 3.6 Flashの料金はいくらですか
標準の単価は100万トークンあたり入力1.50ドル、出力7.50ドルです。エージェント用途では入力0.3ドル、出力2.5ドルと、さらに安い設定が用意されています。最新の料金は公式で確認してください。
従来の3.5 Flashから何が変わりましたか
同じ処理を約17%少ない出力トークンで済ませ、コーディングや長文、画面操作の指標で上回ります。トークン量が減るぶん、実際の請求額も下がりやすくなります。