最新動向

Gemini 3.6 Flash、エージェント処理のトークン費を最大65%削減

Gemini 3.6 Flash、エージェント処理のトークン費を最大65%削減

この記事の要点

GoogleのGemini 3.6 Flashが正式提供。エージェント型の長工程で出力トークンを最大65%削減し、完了当たりコストは最大約71%下がる。出力単価も従来から16.7%低下。

結論

GoogleのGemini 3.6 Flashが正式提供に入り、エージェント型の長い工程で出力トークンを最大65%削減した。作業を完了するまでの実効コストは、用途によって最大でおよそ71%下がる。出力の単価自体も従来から16.7%低い。AIを常時動かす使い方で、費用が重くのしかかっていた部分を直接軽くする更新だ。

何が改善されたのか

VentureBeatの報道によると、Gemini 3.6 Flashは2026年7月21日に本番向けの正式提供として公開された。標準の料金は入力が100万トークンあたり1.5ドル、出力が7.5ドルで、出力単価は従来の9ドルから16.7%下がった。

効率の改善はさらに大きい。ある指標では、3.6 Flashは前世代の3.5 Flashより出力トークンを17%少なく使う。エージェント型の作業を測る評価では差が65%に広がり、1つの作業あたりの平均出力が27万6000トークンから9万7000トークンへ減った。完了当たりの実効コストはおよそ31%下がり、コードを扱うエージェント用途では最大71%の削減になる。単価と使う量の両方が下がるため、積み重なると差は大きい。

推論を安く速くする流れは業界全体の焦点だ。ChatGPTの無料版が刷新されたGPT-5.6 Solの無料無制限化や、モデルをチップに焼き込むAMDによるTaalas買収、自前チップで推論費半減を狙うAnthropicの社内チップ設計と並べると、価格が下がる方向に動いていることが読み取れる。

現場の実務にどう効くか

効いてくるのは、これまで採算が合わずに見送っていた常時稼働の使い方だ。トークン費が半分近くに下がれば、問い合わせの一次対応や社内文書の自動整理を、上限を気にせず回せるようになる。とくに、複数の手順を自動でこなすエージェント用途は出力量が多く、削減の恩恵が大きい。まずは処理量の多い定型業務を一つ選び、切り替え前後のコストを実測して効果を確かめるとよい。

トークン削減が効く理由も押さえておきたい。AIの料金は、読み込んだ入力と生成した出力の量で決まる。同じ結論にたどり着くのに、余計な説明を長々と出すモデルほど費用がかさむ。3.6 Flashは、同じ作業をより少ない出力で終える設計になっており、単価を下げつつ使う量も減らす。とくに、何度もやり取りを重ねるエージェント用途は出力の積み重なりが大きく、1回あたりでは小さな差が、月間では無視できない金額になる。処理量の多い業務ほど、モデル選びが費用に直結する。

AI推進担当ができるのは、モデルを用途で割り当てておくことだ。重い分析には上位モデル、大量の定型処理には廉価なモデルと分ければ、価格が動いてもすぐ乗り換えられる。安いモデルで質が保てるかは、自社の作業で出力を見比べて判断する。他社の指標をそのまま自社の前提にしないほうがよい。

料金やモデル名は改定が続く。数字を固定の前提に置かず、最新の単価は公式で確認してほしい。最新は公式で確認するのが安全だ。

FAQ

トークンを減らすと何が安くなるのか

AIの利用料は処理した文字量に当たるトークン数で決まる。同じ作業を少ないトークンで終えれば、その分だけ料金が下がる。長い工程を回すエージェント用途ほど効果が大きくなる。

安いモデルに変えると品質は落ちないのか

用途による。定型処理は安いモデルで十分なことが多く、重い分析は上位モデルが向く。まず自社の作業で出力を見比べ、質が保てる範囲で置き換えるのが安全だ。

出典

よくある質問

トークンを減らすと何が安くなるのか

AIの利用料は処理した文字量に当たるトークン数で決まります。同じ作業を少ないトークンで終えれば、その分だけ料金が下がります。長い工程を回すエージェント用途ほど効果が大きくなります。

安いモデルに変えると品質は落ちないのか

用途によります。定型処理は安いモデルで十分なことが多く、重い分析は上位モデルが向きます。まず自社の作業で出力を見比べ、質が保てる範囲で置き換えるのが安全です。