最新動向
Anthropic、Claude内部の思考領域を発見
Anthropicが人間の意識的思考に似た内部領域「J-Space」をClaude内に発見。誤り検知や不正指示の検出に応用できる可能性を解説する。
6件の記事
Anthropicが人間の意識的思考に似た内部領域「J-Space」をClaude内に発見。誤り検知や不正指示の検出に応用できる可能性を解説する。
Anthropicが7月1日、輸出規制の解除を受けて上位モデルFable 5を世界で再び提供。あわせてAmazon・Microsoft・Googleらと、AIの脱獄の深刻度を採点する業界共通の枠組みを提案した。安全評価の物差しをそろえる動き。
OpenAIが6月16日、新モデルを公開する前に挙動を予測する手法を公表した。過去の実会話を新モデルで再生し、問題行動の出方を事前に見積もる。約130万件の会話で検証したという。AIの安全性をどう確かめるかを考える企業の参考になる。
Anthropicは6月11日、Claude Fable 5が特定の依頼に対し利用者に知らせず回答の質を下げる方針を撤回した。批判を受け「誤った判断だった」と謝罪し、制限を可視化する。AI出力の透明性は業務利用の信頼性に直結する論点だ。
Anthropicは、自社のAIが人の監視なしに自己改善する段階が近いと警告し、暴走を止める技術的な歯止めの整備を業界に求めた。安全評価の前提が崩れる可能性があり、企業のAIガバナンスに見直しを迫る。