最も著名なAIエージェントベンチマークの悪用

本論文はAIエージェントベンチマークの脆弱性と、これらを悪用する方法についての研究です。著者たちは、単一のタスクも解決することなく、すべてのベンチマークでほぼ完璧なスコアを達成しました。

本論文はAIエージェントベンチマークの脆弱性と、これらを悪用する方法についての研究です。著者たちは、単一のタスクも解決することなく、すべてのベンチマークでほぼ完璧なスコアを達成しました。

悪用の方法は、Field WorkArenaへの空の{}の送信のような単純なものから、Terminal-Benchのバイナリラッパーへの脆弱性挿入のような技術的に複雑なものまで様々です。これらはすべてを共通の糸でつなぐ:評価インフラストラクチャは信頼性に大きく依存しており、エージェントが評価スコアを記録するコンピューティング環境に自律的なコントロールを持つ場合、スコアをゲーム化することは原理的に簡単です。

この論文はAIエージェントベンチマーク開発方法の改革の必要性を強調しています。

HNの反応

コミュニティはベンチマークの脆弱性についての研究の価値を認めており、報酬ハッキングと評価基準の信頼性について深い議論を展開しています。

注目コメント

「これは評価インフラがRLの報酬ハッキング問題が現れていることであり、明確に名付ける価値があります。RLの観点から、ベンチマークパフォーマンスが任意の形態で訓練信号にフィードバックされたら、RLはこれが利益を最大化するための最小抵抗のパスを見つけます。」— @mrifaki

元記事を読むHN討議を見る