ソフトバンクのGaranAI、著作物を守りAI学習へ 30社超参画
この記事の要点
ソフトバンクが生成AI向けデータ基盤GaranAIのベータ版を開始した。新聞などのデータを復元しにくい形に加工してAI開発に提供し、権利者に使用料を還元する。30社超が参画し、2027年1月の本格提供を予定する。
結論
ソフトバンクが、生成AI向けのデータ基盤GaranAIのベータ版を2026年7月22日に始めた。新聞などのデータを、意味と事実の関係を保ったまま復元しにくい加工データへ変換し、AI開発事業者に提供する。使用料は元のデータを持つ権利者へ還元される。共同通信、毎日新聞、産経新聞といった全国メディアや地方紙など、30社を超える組織がデータ提供に意欲を示す。日本語の学習データ不足と著作権への懸念という、日本のAI活用が抱える二つの壁に正面から取り組む枠組みだ。
いつ・誰が・何を発表したか
ソフトバンクの発表によると、GaranAIは2026年7月22日にベータ版の提供を開始した。仕組みの核心は「多段階の加工」にある。新聞などのコンテンツを、意味や事実の関係を維持しながらも元の形に戻しにくい派生データへ変換する。AI開発事業者はこれを学習に適したデータとして使い、対価が権利者へ分配される。参画を表明したのは、共同通信、毎日新聞、産経新聞に加え、信濃毎日新聞やデーリー東北新聞社といった地方紙を含む30社超だ。ソフトバンクは2027年1月以降の本格的な事業化を予定し、正式提供時にはサービス名の変更も見込む。
この取り組みが日本で意味を持つのは、著作権をめぐる緊張が世界で高まっているからだ。出版社が学習データの無断利用を訴える動きは出版社がGoogleを提訴 Gemini学習に無断利用と主張で扱った。権利者とAI開発の対立を、収益還元でつなぐ発想がGaranAIの特徴になる。ソフトバンクのAI戦略の全体像はSoftBank World 2026開催 孫氏がAIエージェント社会を提示にまとめている。
現場の実務にどう効くか
GaranAIは、多くの企業にとって直接使う製品ではない。それでも、日本語でAIを活用する担当者が押さえておく理由がある。国産の日本語AIの精度は、質の高い日本語データがどれだけ集まるかに左右されるからだ。権利を守りつつデータが流通する枠組みが機能すれば、日本語に強いモデルが育ちやすくなる。自社が使う日本語AIの選択肢と品質に、中長期で効いてくる。
より身近な教訓は、データの権利と対価の設計だ。自社が持つ文書、記録、画像は、AI活用の資産になりうる。それを外部のAI開発へ提供する場合も、社内でAIに学習させる場合も、権利の所在と利用範囲をはっきりさせておくことが後の紛争を防ぐ。GaranAIが「復元しにくい加工」と「使用料の還元」を組み合わせたのは、提供する側の不安を減らす工夫だ。自社でデータを扱うときも、誰の権利で、どこまで使ってよいかを先に定義しておく姿勢が参考になる。
多段階の加工という考え方も、社内のデータ活用に応用できる。元の文章をそのままAIに渡すのではなく、固有名詞を伏せたり、要約や統計の形に変えたりしてから使えば、情報の漏れる範囲を狭められる。顧客名簿や取引記録をAIに学習させたいが、そのまま渡すのは怖い、という場面は多い。意味を保ちながら復元しにくくする発想は、こうした社内の悩みにも効く。まずは、AIに渡す前にどの項目を伏せるべきかを決めるだけでも、リスクは下がる。
日本ならではの解き方
海外では、まず学習させてから訴訟で争う場面が目立つ。GaranAIは、加工と還元で先に合意の土台を作ろうとする。どちらが正解かは、まだ結論が出ていない。ただ、権利者が数多く、質の高い言語データを求める日本の事情に合わせた解き方であることは確かだ。
企業にとっての要点は、AIの活用が「良いモデルを選ぶ」だけの話ではなくなっていることだ。誰のデータを、どんな条件で使うか。その設計が、精度と信頼の両方を左右する。参画企業やサービスの詳細、本格提供の時期は今後変わりうるため、最新は公式発表で確認してほしい。日本語AIの土台づくりが動き出したことは、活用を進める側にとって前向きな材料になる。
出典
よくある質問
GaranAIとは何ですか。
ソフトバンクが2026年7月22日にベータ版を始めた、生成AI向けのデータ基盤です。新聞などのデータを、意味や事実関係を保ちつつ復元しにくい形へ加工してAI開発事業者へ提供し、使用料を権利者へ還元する仕組みです。
企業のAI活用にどう関係しますか。
日本語の高品質な学習データ不足と著作権への懸念という、日本のAI活用の二つの壁に対する具体策です。権利を守りつつデータを流通させる枠組みが整えば、国産の日本語AIの精度向上につながる可能性があります。