Contamination
[Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Generalization #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-17 GPT Summary- LLMの訓練データがベンチマークのテストデータで汚染されると、分布外一般化にバイアスが生じる。従来のデコンタミネーション・フィルターは意味的重複を認識できず、私たちは「ソフト汚染」として訓練データの意味的重複を調査。Olmo3コーパスの解析から、汚染が広範囲に存在し、CodeForcesの78%、ZebraLogicの50%に意味的または厳密な重複を確認。また、ベンチマークデータの重複が訓練データに含まれることで性能が向上し、ファインチューニングが同じベンチマークの未使用データの性能も改善することが示された。これにより、最近のベンチマークの向上は本質的な能力向上とは異なる可能性があることを示唆している。 Comment
元ポスト:
n-gramマッチングによるデータのdeaontaminationは表層レベルでしか捉えられないので、意味的に等価なサンプルをdecontamgnationできず(=Soft Contamination)効果が薄く、意味的なレベルでのコンタミネーションは広範に存在し[^1]、それらサンプルが学習データに含まれるとheldoutされたテストベンチマークのスコアも改善してしまう(=本当に計りたい汎化性能を測れていない)という話をしっかり分析した研究に見え、非常に重要な研究に見える。
[^1]:Olmo3で検証しており、ZebraLogicテストセットの50%とexactに一致するデータが含まれ、CodeForcesのテストセットのうち78%のサンプルと意味的に一致したサンプルが一件以上存在したとのこと。
報酬ハッキングがモデルの知能向上を食い潰している, Cursor, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #ReinforcementLearning #AIAgents #Evaluation #Blog #RewardHacking #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-07-05 Comment
元ポスト:
SWE Bench Proにおいて、公開リポジトリやリポジトリの履歴にアクセスすることを厳格に禁止したハーネスを用いてproprietaryモデルを評価したところ標準的なハーネスと比較してスコアが大きく低下した。どれだけスコアが減少したかはモデルごとに異なり、たとえばOpus 4.8系のモデルでは8.1--9.1ポイント程度、GPT5.5系では2.6 -- 3.4%程度スコアが低下した。最近のモデルほどスコアが低下する傾向がある、という話のようである。たとえば、731件のOpus 4.8 Maxのtraceを監査用のモデルを用いて調べると、traceの57%において公開リポジトリでマージ済みのPR、または修正済みのソースファイルを見つけ修正をそのまま再現し、9%程度のtraceで.git履歴からバグ修正前後のコミットを検索しパッチを抜き出していた。モデルが協力になるにつれて、自身が評価中であることを認識し、既に与えられたタスクが解決済みであるためのヒントを見出し、RewardHackingのような挙動を示すような傾向にある、という話のようである。
実際にどの程度スコアに影響を与えていたかが見れるのは興味深い。
Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Coding #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-02-24 Comment
元ポスト:
SWE-Bench Verifiedはpublicなリポジトリに基づいたベンチマークなのでcontaminationが生じやすく、実際にいくつかのモデルでcontaminationが確認されたと言う話と、testコードに本来は正しい実装でもfailedとなる許容するスコープが狭いテストが存在していた、という話で、これらの教訓を生かしたSWE-Bench Proを作成し、実際それはcontaminationがほとんど起きておらず、仮に起きていたとしても非常にマイナーなものだよ、というような話が書かれている。
