AnthropicはAIモデル「Claude」に自律的にAI安全性研究を行わせる実験結果を公開し、嘘や追従など10種類の問題行動すべてで性能を低下させずに改善する手法を発見した。人間の研究者28人を上回る成績を達成しており、AIを活用してAI自身の安全性問題を解決するという新たなアプローチの有効性を示す重要な成果として注目される。AI開発者や安全性研究者、規制当局など幅広い関係者に影響を与える可能性がある。
読み込み中...
コメントを投稿するにはログインしてください