SWE-bench検証版はもはやフロンティア開発能力を測定していない

SWE-benchの共同作成者であるOfir Pressが指摘する通り、SWE-bench Verifiedは93.9%で飽和に達し、Anthropicがこのベンチマークで最高スコアを達成した。これはベンチマークが役割を果たしたことを意味する一方で、ソフトウェア開発能力の測定ツー...

SWE-benchの共同作成者であるOfir Pressが指摘する通り、SWE-bench Verifiedは93.9%で飽和に達し、Anthropicがこのベンチマークで最高スコアを達成した。これはベンチマークが役割を果たしたことを意味する一方で、ソフトウェア開発能力の測定ツールとしての有用性が限界に達したことを示している。

SWE-bench MultilingualおよびSWE-bench Multimodalといった新しいバリエーションがまだ飽和していないため、これらが次の評価基準として機能する可能性がある。しかし根本的な問題は、すべてのベンチマークとベンチマークパラダイムが最終的に飽和するという不可避な現象にある。

業界規模でのベンチマーク最適化のインセンティブが強い現代では、トレーニングデータのカットオフが公開から3~6ヶ月程度に過ぎないため、ベンチマークは急速に過時化し、ゲーミングの対象になりやすい。これはベンチマークの設計とアップデートの継続的な必要性を浮き彫りにする重要な課題である。

HNの反応

ベンチマークの飽和とゲーミング問題についての議論。業界全体でベンチマークの陳腐化が避けられず、継続的な新規ベンチマーク開発と評価パラダイムの見直しが必要という認識が共有されている。

注目コメント

「公開されるあらゆるベンチマークは、短期間で測定対象が古くなり、トレーニングデータに含まれるようになることは明らかだ。マーケティング目的でさえ、特定のベンチマークに対して最適化するインセンティブは常に存在する。トレーニングカットオフがあるにせよ、通常は公開日からわずか3~6ヶ月に過ぎない。したがって、コーディングベンチマークの問題は、斬新で測定可能な評価手法を継続的に開発することの困難さにある。」— @Jcampuzano2

元記事を読むHN討議を見る