Anthropicの研究者が、自己改善型AIの研究成果を公開した。自動化されたシステムが、特定の不整合な行動に関する10のベンチマークすべてにおいて、全体的なパフォーマンスを低下させることなく改善を達成した。この研究はAIの安全性・アライメント分野において重要な前進であり、AI開発者や安全研究者、そしてAI規制に関わる政策立案者に大きな影響を与える可能性がある。
読み込み中...
コメントを投稿するにはログインしてください