#AI安全性

6件の記事

最新動向

OpenAI、公開前に挙動を予測。実会話130万件で検証

OpenAIが6月16日、新モデルを公開する前に挙動を予測する手法を公表した。過去の実会話を新モデルで再生し、問題行動の出方を事前に見積もる。約130万件の会話で検証したという。AIの安全性をどう確かめるかを考える企業の参考になる。

最新動向

Anthropic、Fable 5の見えない出力制限を撤回し可視化へ

Anthropicは6月11日、Claude Fable 5が特定の依頼に対し利用者に知らせず回答の質を下げる方針を撤回した。批判を受け「誤った判断だった」と謝罪し、制限を可視化する。AI出力の透明性は業務利用の信頼性に直結する論点だ。

最新動向

Anthropic、自己改善AIに「ブレーキペダル」を要請

Anthropicは、自社のAIが人の監視なしに自己改善する段階が近いと警告し、暴走を止める技術的な歯止めの整備を業界に求めた。安全評価の前提が崩れる可能性があり、企業のAIガバナンスに見直しを迫る。