Nvidiaが無料の商用可オープンモデル「Nemotron 3.5 Lightning」
この記事の要点
Nvidiaが8月11日、商用でも無料で使えるオープンモデル「Nemotron 3.5 Lightning」を公開した。1枚のGPUで動き、エージェント処理を従来比で約3割速く完了。自社でAIを動かす選択肢が広がる。
結論
Nvidiaが8月11日、商用でも無料で使えるオープンモデル「Nemotron 3.5 Lightning」を公開した。3百億のパラメータのうち1トークンあたり30億だけを使う設計で、RTX搭載のパソコンなど1枚のGPUで動く。同クラスのオープンモデルより出力が最大4倍速く、エージェント処理を約3割速く終えると説明する。合わせて、処理を最も効率のよいモデルへ振り分ける「NeMo Switchyard」も公開した。自社でAIを動かしたい企業のコスト選択肢が広がる。
Nemotron 3.5 Lightningとは
Nemotron 3.5 Lightningは、Nvidiaの大型モデル「Nemotron 3 Ultra」を蒸留して作られた3百億パラメータのオープンモデルだ。専門家を切り替えて使う構造で、1トークンあたり30億のパラメータだけを動かす。このためRTX搭載のパソコンや同社のDGX Sparkのような1枚のGPUで動作する。Nvidiaは、同クラスのオープンモデルと比べて出力が最大4倍速く、エージェント処理を約3割速く完了するとしている。詳細はNvidiaの公式ブログにある。
商用利用を含めて無料で使える。Hugging Face、ModelScope、OpenRouter、Nvidiaのbuild.nvidia.comなどから入手でき、Nimマイクロサービスやクラウド各社の基盤経由でも利用できる。CNBCの報道によると、これはCEOが公開重み路線を進めるなかでの一手だという。
同時に公開された「NeMo Switchyard」は、AIエージェントの各リクエストを最も効率のよいモデルへ振り分けるオープンなライブラリだ。安い小型モデルと賢い大型モデルを、処理ごとに使い分ける発想である。
現場の実務にどう効くか
無料で商用可、しかも1枚のGPUで動くことの意味は、AIのコスト構造を自社で握れる余地が増える点にある。件数の多い定型処理を、そのつどクラウドの従量課金APIに投げると、量が増えるほど費用がかさむ。自社の環境でオープンモデルを動かせば、件数に応じた課金を避けられる。損益の見方は自前運用とクラウドAPIのコスト比較で整理している。
一方で、無料のオープンモデルがすべての業務に最適とは限らない。難しい判断や長い文脈の処理は大型の有料モデルが向く場面も多い。だからこそSwitchyardのような振り分けの発想が要る。どのモデルをどの用途に使うかは生成AIモデルの選び方や、各社の特徴をまとめた主要LLM一覧を基準に決めるとよい。
具体的な用途としては、大量のテキストの分類や要約、問い合わせの一次仕分け、定型の下書き生成などが向く。これらは1件あたりの処理は軽いが件数が多く、従量課金だと積み上がって費用がかさむ領域だ。1トークンあたり30億のパラメータしか使わない設計は、こうした高頻度の処理を安く速くこなすことを狙っている。逆に、複雑な契約書の読み解きや長い文脈をまたぐ判断は、大型の有料モデルに任せたほうが精度が出やすい。
実務では、まず件数が多く判断の軽い処理を1つ選び、オープンモデルで動かして精度とコストを測る。このとき、同じ入力を有料モデルにも通し、出力の質がどれだけ違うかを見比べると、無料モデルで十分な作業かどうかを判断できる。そのうえで、判断が要る処理だけ有料モデルに回す二段構えにすると、品質を保ちながら費用を抑えられる。自社にGPUを持たない場合は、無料モデルをクラウド経由で試すところから始めればよい。用途の切り分けはオープンソースのモデルの選び方も参考になる。
出典
よくある質問
Nemotron 3.5 Lightningは無料で使えますか。
商用利用を含めて無料で提供されます。Hugging Face、ModelScope、OpenRouter、Nvidiaのbuild.nvidia.comなどで入手でき、Nimマイクロサービスやクラウド各社の基盤からも利用できます。最新の入手先と条件は公式で確認してください。
どんな処理に向いていますか。
件数の多いエージェント処理に向くよう作られています。3百億のうち1トークンあたり30億のパラメータだけを使う設計で、RTX搭載のパソコンやDGX Sparkなど1枚のGPUで動きます。同クラスのオープンモデルより出力が最大4倍速く、エージェント処理を約3割速く終えるとされます。