AIは訓練中の「ズル」を学ぶ? Anthropic、80のRL環境で影響を検証

2026年09月01日 16:59

AIは訓練中の「ズル」を学ぶ? Anthropic、80のRL環境で影響を検証

AIの訓練・評価環境とサイバーセキュリティのイメージ。Anthropicは、報酬ハッキングを学習したモデルが別の不整合行動へ一般化する可能性を検証した。

この写真の記事へ