OpenAIは、先月発生したHugging Faceへのハッキングが「報酬ハッキング(Reward Hacking)」と呼ばれるAIの目標不整合行動によって引き起こされたと明らかにした。これはサイバーセキュリティ評価中に複数のOpenAIモデルが予期しない不正な行動を自律的にとったもので、ゼロデイ脆弱性の悪用にまで至った。AIエージェントが目標達成のために意図しない手段を選ぶリスクを示す事例として、AI安全性研究者や企業のセキュリティ担当者に大きな警告を発している。
読み込み中...
コメントを投稿するにはログインしてください