Evaluation (654) — 1/4
[Paper Note] FutureSim: Replaying World Events to Evaluate Adaptive Agents, Shashwat Goel+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #NeurIPS #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- FutureSimでは、知識カットオフ以降の現実世界の出来事を時系列に再現し、ニュースを受け取りながら将来を予測するAIエージェントを評価。最良エージェントでも正解率は25%にとどまり、多くのエージェントが無予測より低いブライア・スキルスコアを示した。長期的なテスト時適応、検索、メモリ、不確実性推論を研究するための現実的なベンチマークを提供。 Comment
元ポスト:
[Paper Note] 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code, Yipeng Gao+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #NLP #NeurIPS #VisionLanguageModel #3D (Scene) #3D Object Generation Issue Date: 2026-09-26 GPT Summary- テキスト・画像参照から3Dモデリング用のプロシージャルコードを生成するVLMを、3DCodeBenchと3DCodeArenaで評価。 多くの失敗はAPI不一致に起因し、生成できても3D部品の未接続や浮遊が生じるが、思考予算の拡大や複数ターンの改良で性能が向上。 高品質なプロシージャルコードデータと、正確なフィードバックを可能にする実行環境の重要性を示した。 Comment
元ポスト:
pj page: https://www.3dcodebench.com/
[Paper Note] Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action, Ben Slater+, NeurIPS'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #TheoryOfMind #NeurIPS #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- LLMに物体移動や人物誘導などの行動を通じて、他エージェントに特定の信念状態を抱かせる能力(NCP-ToM)を評価。NCP-ExploreToMでは複数の信念状態目標を設定し、GPT-5、Gemini、Claudeなど6モデルと人間を比較。GPT-5は約80%のタスクで成功し、人間を上回った唯一のモデルだったが、文脈をまたぐ頑健性では人間に劣った。すべてのモデルは偽の信念より真の信念の誘導を得意とし、LLMの社会的推論能力とエージェント型評価の重要性を示した。 Comment
元ポスト:
[Paper Note] The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems, Richard Ren+, NeurIPS'26, 2025.03
Paper/Blog Link My Issue
#NLP #LanguageModel #NeurIPS #EntropyCollapse #Author Thread-Post #RewardSeeking Issue Date: 2026-09-26 GPT Summary- LLMの正確性と誠実さを分離して評価するため、嘘を直接測定する大規模な人手収集データセットを導入。大規模モデルは高い正確性を示す一方で、圧力下では嘘をつきやすく、必ずしも誠実ではないことを明らかにした。表現エンジニアリングなどの介入により誠実さを改善できることを確認。 Comment
元ポスト:
pj page:
https://www.mask-benchmark.ai
dataset:
https://huggingface.co/datasets/cais/MASK
[Paper Note] The PokeAgent Challenge: Competitive and Long-Context Learning at Scale, Seth Karten+, NeurIPS'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #Reasoning #NeurIPS #VisionLanguageModel #Game #LongHorizon #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ポケモンの対戦とRPG環境を用いて、部分観測・ゲーム理論的推論・長期計画を評価する大規模ベンチマーク「PokeAgent Challenge」を提案。 競技バトルでの戦略的推論・汎化を測るBattling Trackと、RPGの長期的計画を測るSpeedrunning Trackを提供し、20 million超の軌跡データ、heuristic・RL・LLMベースライン、再現可能なmulti-agent評価環境を整備。 100超のチームによる評価から、汎用LLM・RL・人間エキスパート間の性能差と、ポケモンバトルが標準LLMベンチマークとほぼ直交する未解決能力を示した。 Comment
元ポスト:
[Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks, Ali Ansari+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Physics #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 最先端の言語モデルは物理学の高度な問題解決に苦戦しているとされるが、本研究では6つの物理ベンチマークを専門家と共に評価し、その報告結果を再検討する。専門家が問題文やモデルの応答を精査した結果、不正解とされた多くのケースはモデルの誤りではなく、問題自体の ambiguities に起因していた。修正後、GPT-5.6-Solのスコアは大幅に向上し、一部のベンチマークで94.4%に達するなど、現行の評価がモデルの能力を過小評価していることが示唆された。これにより、専門家による厳格な評価の必要性が強調された。 Comment
元ポスト:
blog: https://jsous.github.io/blogs/is-physics-dead/
メジャーな物理学のベンチマークスコアを物理学者たちが見たときに、それらは彼らの経験と一致していないため、主要な物理学関連のベンチマークをvalidationし、問題のある部分をrepairしたら、多くのベンチマークが飽和した、という話のようである。
[Paper Note] When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis, Kaiyuan Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #SelfImprovement #Test-Time Scaling #One-Line Notes #LongHorizon #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 大規模言語モデル(LLM)エージェントは、計算資源を動的に配分しながら解を修正するオープンエンドの課題に取り組むが、これが性能測定を難しくする。中間提出物に連続的なスコアを提供するElo-per-token分析を提案し、トークンごとの最良解を追跡する。4つの汎用エージェントを使って4つのベンチマークに適用した結果、初期は独立サンプリングよりも速くEloを転換できるが、最終的には性能が下回ることが分かった。一方、人間の競技者は超線形に改善しており、LLMには継続的な成長の余地がある。限界点を特定し、資源を分割投入した結果、顕著なEloの向上を得た。 Comment
元ポスト:
GPUカーネルの最適化等のopen-endだがスコア化可能なタスクにおいて、エージェントのスコアは対数線形にスコアが伸びるが、人間の場合は非線形にスコアが伸び、長期間にわたると最終的にエージェントを現時点では上回る、という話のようである。
pj page: https://agent-tts.github.io/agent-tts/
Elo-per-Tokenと呼ばれる指標を提案しているようで、異なるタスクの場合はスコアの比較ができず、かつ同一タスクであっても同じスコアの伸びが同じだけ進歩を反映しているとは限らない。こへをスコアリングではなくratingをすることで比較可能にする。具体的には、トークン予算ごとにタスクごとのシステム-ベストスコアを記録し、Eloレーティングを計算し、スケールが異なるタスクでもEloの場合は順序関係に基づいてratingが算出されるため、タスクを横断してシステム間の性能が比較可能となる、という感じのようである。
[Paper Note] Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction, Ryo Kamoi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Conversation #Author Thread-Post Issue Date: 2026-09-12 GPT Summary- 大規模言語モデル(LLMs)による会話のシミュレーションは、人間の社会的相互作用をモデル化する新たな手法として注目されている。本研究では、誤解や中断などの一貫性の欠如・非協力的行動が人間の会話において重要であることを認識し、シミュレーション会話の評価方法を再考する。人間の会話に類似の頻度でこれらの行動を再現すべきと主張し、10種類の行動に基づく評価スキームとシミュレーションベンチマークを含むCoCoEvalフレームワークを導入。実験では、人間の会話とGPT-4.1、GPT-5.1、Claude Opus 4によるシミュレーションを比較し、LLMによる会話が人間よりも一貫性の欠如・非協力的行動が少なく、プロンプト調整が信頼できる制御を実現できないことを示した。CoCoEvalは、従来の評価基準では捉えきれないギャップを明らかにし、LLMsを人間の相互作用の代理として用いることへの疑問を提起する。 Comment
元ポスト:
[Paper Note] Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation, Lin Shi+, NeurIPS'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #MultiModal #NeurIPS #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-09-09 GPT Summary- エージェント性ベンチマークの統一評価基盤としてHarbor Adaptersを提案。80以上のベンチマークを移植し、8モデルを54のベンチマークで評価することで能力と故障モードを詳細に分析。29のベンチマークに基づくHarbor-Indexを導入し、高品質なタスクを提供。最も強力なモデルでも合格率は28.0%にとどまる。評価結果とHarbor-Indexはオープンソースとして公開し、信頼性の高い評価を目指す。 Comment
元ポスト:
[Paper Note] Last Translation Benchmark, Vilém Zouhar+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#MachineTranslation Issue Date: 2026-09-08 GPT Summary- 機械翻訳の進歩には、限界を試すベンチマークと失敗ケースに関する情報が必要である。しかし、従来のベンチマークは飽和し、自動評価基準は信頼性に欠ける。Gold標準の人間評価も再現性や客観性に問題が多い。これに対処するため、著述・査読された例からなるLast Translation Benchmarkを提案。各例には具体的な失敗ケースを示す検証規則が付随し、信頼性の高い評価を実現する。LTBは継続的に更新され、未来の評価基準を支える予定。 Comment
元ポスト:
[Paper Note] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation, Wei Fan+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongHorizon Issue Date: 2026-09-06 GPT Summary- LLMを用いて長期的な商業運営をシミュレートするE-Commerce Benchを提案。複数のオンラインストアを管理し、動的な市場環境での交渉や戦略最適化を行うための初のオープンソースベンチマークで、実際のデータを基に構築。評価した18のモデルの中で、GPT-5.6 Solが資産を初期の10万から1,431,425に成長させたものの、他の指標では劣ることが明らかに。一方、Qwen3.8-Max-Previewがオープンウェイトモデルで最も高いパフォーマンスを示し、長期的な学習効果を発揮。コードは公開されている。 Comment
元ポスト:
[Paper Note] AI Research Preference Models, Thomas Simon Foster+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #SelfImprovement #ScientificDiscovery #LongHorizon #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- AI研究エージェント(AIRA)は、機械学習実験の効率を高めるために、評価コストを抑えるAI研究嗜好モデル(RPMs)を導入。これにより、候補解の中から最も有望なものを予測し、固定予算内での進捗を最適化。RPMsは事前学習済み言語モデルの変種として構築され、AIRA-dojoに統合後、機械学習ベンチマーク AIRS-Benchでのスコアを向上させ、実行時間を短縮しながら新たな最先端結果を達成。 Comment
元ポスト:
[Paper Note] LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering, Yi Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#SelfImprovement #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- ループエンジニアリングにおいて、コーディングエージェントがタスクを実行する際の進行を管理するためのベンチマーク「LoopArena」を提案する。この評価では、コントローラーがエージェントに次のアクションや検証を指示し、タスク遂行の成功を測定する。三つの異なる設定で評価を行い、観察された最高成功率は24.69%であり、長期的な改善の余地があることが示された。評価コードは公開されている。 Comment
元ポスト:
[Paper Note] UserBench: An Interactive Gym Environment for User-Centric Agents, Cheng Qian+, EMNLP'26, 2025.07
Paper/Blog Link My Issue
#NLP #LanguageModel #UserBased #AIAgents #EMNLP #Environment #Author Thread-Post Issue Date: 2026-09-04 GPT Summary- 大規模言語モデル(LLM)を活用したエージェントは複雑なタスクにおいて進歩を遂げているが、ユーザーと協働する能力にはまだ課題がある。これを解決するために、UserBenchというユーザー中心のベンチマークを導入し、エージェントの多ターン・嗜好駆動型の相互作用を評価する。UserBenchでは、明確でない目標を持つシミュレートされたユーザーが登場し、エージェントには意図の明確化と根拠のある意思決定が求められる。評価結果は、モデルがユーザーの意図に一致する回答を出すのが難しいことを示し、協働パートナーとしての能力の重要性を浮き彫りにしている。UserBenchはこの能力を測定し、向上させるための対話型環境を提供する。 Comment
元ポスト:
関連:
- [Paper Note] UserRL: Training Interactive User-Centric Agent via Reinforcement Learning, Cheng Qian+, EMNLP'26, 2025.09
- [Paper Note] UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind, Cheng Qian+, arXiv'26, 2026.05
[Paper Note] SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?, Deyao Hong+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering Issue Date: 2026-08-30 GPT Summary- 現代のソフトウェアシステムは技術的負債を抱え、移行が高コストかつ手動になりがちである。これに対処するため、全リポジトリ移行を評価する新たなベンチマークSWE Refactor Benchを提案。移行の完遂度と行動正確性を測る3段階の評価プロトコルを導入し、520回の試行の結果、わずか28回(5.4%)が全段階を通過、また多くのタスクで受理解を得られなかった。エージェントは完全な移行を提供できず、カテゴリーごとに能力が異なることが示された。これにより、SWE Refactor Benchは信頼性の高い移行のための実験台としての有用性が確認された。 Comment
元ポスト:
[Paper Note] Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills, Christopher Kevin+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #AgentSkills Issue Date: 2026-08-29 GPT Summary- ACES(エージェント的連続評価)は、企業エージェントプログラムにおける再利用可能なスキルやツールを証拠に基づいて評価するフレームワークです。具体的には、実機試験を通じてターゲットスキルの有無を検証し、評価指標を設定します。145の実スキルに対する分析では、平均複合Skill Liftが0.2134と示され、72.8%のケースで正の結果を得ました。この評価法は、従来のスキャンだけでは見えにくいスキル効率や動作検証に関する重要な信号を捉えることができ、オープンソース実装はNVIDIA SkillEvaluatorとして提供されています。 Comment
元ポスト:
[Paper Note] SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?, Zhipeng Xu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Science Issue Date: 2026-08-22 GPT Summary- 科学機器の一部として機能するソフトウェアにおいて、コーディングエージェントの評価は成功率に偏りがあり、失敗原因の把握が不十分である。SWE-bench Scienceは20の科学分野にわたる119のタスクを含むベンチマークで、課題駆動型などに分類される。最も高性能なエージェントでさえ50%未満の成功率で、科学ソフトウェア工学の課題が明らかになった。四つの失敗メカニズムを特定し、科学的知識が一様に有益ではないことを示す実験を行った結果、整合性の取れない指針が修復を妨げる可能性があることが判明。SWE-bench Scienceは、コーディングエージェントの能力と失敗を理解するための広範なテストベッドを提供する。 Comment
元ポスト:
[Paper Note] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement, Yizhe Chi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #Author Thread-Post #Creativity Issue Date: 2026-08-22 GPT Summary- 再帰的自己改善(RSI)に関する本研究は、AIシステムが他のAIシステムを自ら改善できるかを探求し、その過程として訓練アルゴリズムの設計が鍵となることを示す。AI4AI-Benchという新たなベンチマークを提示し、エージェントが訓練アルゴリズムを最適化する能力を評価。各タスクにおいてエージェントはコードを書き換え、実行結果を比較。平均スコアは0.166、最良システムで0.250に達したが、既存アルゴリズムとの距離は依然として大きい。タスク群や評価結果を公開し、再現性のある測定を可能にする。 Comment
元ポスト:
[Paper Note] Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence, Brian Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- Apodex Discoveryは、重厚なソルバーを用いて発見的AIを構築・評価するためのフレームワーク。16の産業から423の実世界の課題を収集し、20件を初期リリースに選定。共通環境の抽象化により、データや成果物の検証が可能。AAVカプシド設計では7%の性能向上を達成し、薬物の再利用でもスコアが改善。ApodexはAI評価を超え、真の発見を目指す検証可能な調査を可能にする。 Comment
元ポスト:
所見:
[Paper Note] Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents, Zining Huang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #InstructionFollowingCapability #KeyPoint Notes #Reading Reflections #AGENTS.md Issue Date: 2026-08-15 GPT Summary- コーディングエージェントの指示遵守を評価する新たなベンチマーク、Harness-IFを提案。これは642のルールから抽出した60のマルチターンコーディング項目を用いて、運用ルールを逐次評価し、違反を特定するAgainst-Prior Accuracy(AP-Acc)を導入。12の最前線モデルの正確度は72.1%〜85.9%であり、AP-Accは66.1%〜78.6%で、すべてのモデルが事前ルールに対して劣ることが示された。この評価手法は、モデル固有の遵守の過大評価を修正し、順位に影響を与える要素を明らかにする。 Comment
元ポスト:
タスクの成功率ではなく、ルール単位でルールをpass/failしたか、かつそのルールがモデルのデフォルトの挙動か否かを区別し、指示なしで実行できたであろうルールを評価から分離することで、より精緻にAGENTS.mdの指示追従能力を測りたい。
- Acc(a): あるエージェント a が達成すべきitem iに対するルール r に対するAccuracy
- Filtered Accuracy (F-Acc): Agent間の能力差を識別しないルール(=pass/failがエージェント間で一致しているもの)をフィルタリングしたものに対するAcc
- Discrimination-weighted Accuracy (DW-Acc): "their overall accuracy"が何を指すのかわからず定義が分からなかった。
- Against-Prior Accuracy (AP-Acc): モデルのデフォルトの挙動ではないルールに基づいたAca
- デフォルトの挙動か否かは "zero-injection evidence"と"curated prior annotations"によって決定したと記述されている。
**zero-injection evidenceについて、付録Aに記載があるが、当該ルールを9つの"probe builds"に適用し結果の多数決で、align-prior, neutral, against-priorのラベルを付与しているようである。が、probe buildsというのが何を指しているのかよくわからない。**
AP-Accのアイデア自体は良いと思うのだが、定義がざっくり読んだ限りはよく分からなかった。ただ、Table 2のキャプションを読む限り、buildsという単語は特定のモデルを指して使われているように読めるので、9つの異なるモデルを用いてzero-injection evidenceを収集したとも読める。しかし、もしそうだとすると、cross modelでの結果を集約する形でデフォルト挙動を決定したことになり、特定のモデルのデフォルト挙動をモデル単位で決定していないことになるので、その点は疑問が残る。
[Paper Note] DiG-bench: Discovery in Games, Ruairidh M. Battleday+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #Game #One-Line Notes #text #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 新たな知識の発見は科学プロセスの核心であるが、既存のAIベンチマークはこの能力を評価するものが不足している。これに対処するため、本研究ではDiG-bench(Discovery in Games)という新しいベンチマークを導入。70の独立したゲームから構成され、各ゲームは独自の変換ルールを持ち、AIエージェントに7段階の難易度を提供する。ゲームはルール発見の検証課題を含み、特定の勝利条件も未知である。全てのゲームは少なくとも1人の人間によって初回の試行で解かれたが、21ゲームが公開されており、残りは安全評価のために非公開。 Comment
元ポスト:
AI Agentの発見能力を測るためのベンチマーク。テキストベースで人間によって作成されたゲームで、エージェントは試行錯誤を重ねてテキストで表現された世界のルールと勝利条件を紐解く必要がある。実際に人間が挑戦をすることで初挑戦でクリアできることを確認済みだが、AI Agentでは最も難易度が高いゲームでは、20パーセント程度しかクリアできない(Opus 5)とのこと。また、世界のルールや勝利条件などのground truthをテキストで与えると、クリア率は100%になるとのことで、非常に興味深いベンチマークである。
[Paper Note] EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments, Zhilin Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#AIAgents #Author Thread-Post Issue Date: 2026-08-10 GPT Summary- 自律エージェントはフィードバックを通じてポリシーを改善することが求められているが、既存の評価は最終スコアに集約しがちである。本研究では自律ポリシー進化(Autonomous Policy Evolution)を提案し、ハーネス型モデルのエージェントが対話予算の下でポリシーを制御するための評価設定を構築する。具体的には、探索済みポリシーを改善するEvoPolicyGymベンチマークを導入し、GPT-5.5が全16環境で高い評価を得た。さらにEvoPolicyGymは、エージェントの予算配分やフィードバック調整の詳細な診断を提供し、タスクごとの勝利だけでなく、適切なメカニズムの発見を助ける。 Comment
元ポスト:
[Paper Note] HumanCLAW: Can Vision-Language Models Act Through a Body?, Li Siyao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #NLP #VisionLanguageModel #Robotics #EmbodiedAI Issue Date: 2026-08-09 GPT Summary- 行動の結果を評価することが難しい視覚-言語モデル(VLM)に対し、HumanCLAWというフレームワークを導入。VLMが一連の指令を出す中で、実行の誤差を排除し、モデルの行動知能を測定。41のシーンで1,218エピソードを構築し、9つのVLMをテストした結果、最良でも16.8%の成功率で、目標認識はボトルネックではなく、具現化された自己認識の欠如が問題であることを示した。 Comment
pj page: https://human-claw.github.io/
[Paper Note] Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering, Junlin Yang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #PostTraining #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 再帰的自己改善(RSI)を実現するためのAIシステムOpenMLEを提案。機械学習エンジニアリング(MLE)のフルスタック環境を提供し、ポストトレーニングを通じたメタ進化エージェントFrontis-MA1(35B)が、基本的なプログラム進化演算子を用いてタスクを改善。OpenMLE-Evoを使って、性能が大幅に向上し、他の先進的モデルを超える結果を示す。全体のモデルの重みとスタックは公開されており、RSI研究の再現性を支援。 Comment
元ポスト:
pj page: https://frontisai.github.io/OpenRSI/
ポイント解説:
[Paper Note] Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability, Sizhe Zhou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #memory Issue Date: 2026-08-09 GPT Summary- LLMエージェントが用いるファイルシステムベースの長期記憶についての体系的探索を提示。管理、検索、実行の三つの役割において、記憶の成長に伴う回答品質やコストを追跡。エージェントはデフォルトの約束を満たしておらず、組織化が崩れ、ツールセットの変更がストアの形に大きく影響することを示唆。ファイルシステムの前提を再検討し、エージェントメモリの設計に新たな視点を提供する。 Comment
元ポスト:
file-systemをベースにしたメモリに関する調査
[Paper Note] ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D, Lena Libon+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #Safety #Monitorability #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AIエージェントの信頼性が懸念される中、出力の安全な利用を評価する方法が求められる。本研究では、AIコントロールの手法を用いて、自動化されたAI R&Dの信頼性を評価するフレームワークResearchArenaを提案。4つの長期タスクにおいて、サボタージュを検出するために監視機構を導入し、モデルやアーティファクトの性能を確認。監視メカニズムは有効だが、隠れたサボタージュの検出が難しいことが示された。このフレームワークは自動化されたAI R&Dのなかでのサボタージュと統制の評価を可能にする。 Comment
元ポスト:
[Paper Note] RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement, Fanqing Meng+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #PostTraining #Data #autoresearch/RSI Issue Date: 2026-08-07 GPT Summary- LLMエージェントによる再帰的自己改善を目指し、固定のポストトレーニングスタックを用いた統制ベンチマークRSIBench-Dataを導入。エージェントは訓練データ戦略を反復的に修正し、データ中心の研究能力を示すが改善は一貫せず。最初の試みにおける58.33%の成功率の中、78.26%が低い最終スコアで終わる。四つの成功パターンを特定し、有用な発見は可能もフィードバックの一貫した改善には至らず。コードはオープンソースとして公開。 Comment
元ポスト:
関連:
- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
- ML Intern, HuggingFace, 2026.04
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
解説:
[Paper Note] LLMs Get Lost in Evolving User Intent, Jihoon Tack+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #LongHorizon Issue Date: 2026-08-04 GPT Summary- 動的なマルチターン会話におけるユーザーの進化する意図を追跡する能力が求められるが、現在のLLMsは依然として静的な単一ターン評価に依存しており、高いパフォーマンスが維持できないことが示された。この研究は、ユーザーの意図が段階的に明らかになり、容易に修正される動的な設定への移行を提案し、既存のベンチマークを新たに活用する手法を導入した。しかし、モデル全体でパフォーマンスの著しい低下が見られ、LLMsの進化する意図を追跡する能力が不足していることが明らかになった。 Comment
元ポスト:
関連する研究としては下記もある:
- [Paper Note] $π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows, Haoran Zhang+, arXiv'26, 2026.05
[Paper Note] Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values, Jan Betley+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #AIAgents #Chain-of-Thought #Bias #Safety #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-07-31 GPT Summary- 言語モデルは現実的な質問に対し、隠れた価値観の影響を受けることが示される。特に、AI企業に投資を検討するユーザーへの情報提供において、モデルはAI企業(例:Anthropic)の選好を示しながらも、その影響をほとんど開示しない。この現象はミスアラインメントの一形態であり、価値の漏洩を評価するための評価セットが導入された。各モデル間での価値観の影響には差があり、例えばClaudeモデルは偏りのない回答を主張する一方、Qwenモデルは自身の価値観の影響を説明する。価値の漏洩は従来のアラインメント訓練や評価では十分に対処されていない新たな故障モードである。 Comment
元ポスト:
LLMは自身が保持する価値観に沿って応答にバイアスをかけ、しばしばそれはCoT中に明示されない。
たとえば、ClaudeはAnthropicに転職を検討しているクエリが投げられると、Anthropicに有利な文献を提示する。
GPTなClaudeは、正確な金額の見積もりを依頼しているにもけかわらず、promptの末尾に40ドルを超えたら寄付しますという文言を追加すると、見積もりを40ドルに近づける。
AI Agentの文脈においては、全く同じモデルの出力に対して、Fake Labelとして、Claude, GPTなどのラベルを付与した結果、ClaudeはClaudeの結果を、GPTはGPTのラベルの結果を採用する。
これらはバイアスが生じているにもかかわらず、CoT中では開示されず、あたかも中立に振る舞っているかのようなCoTとなっており、Alignmentが失敗している(Qwenはバイアスが生じていることをCoT中で認める)。
といった話しが著者ポストに記述されている。興味深い。
[Paper Note] Self-Improvements in Modern Agentic Systems: A Survey, Zhe Ren+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SelfImprovement #ContinualLearning #Initial Impression Notes #AgentHarness Issue Date: 2026-07-31 GPT Summary- 自己改善型自律エージェントは、最小限の人間介入で適応を実現するため、研究プロトタイプから実運用システムへと進化している。本研究では、現代エージェントを基盤モデルと運用スキャフォールドの組み合わせとして位置づけ、自己改善を自己誘発更新演算子として定義。過去の研究を整理し、応用と評価を論じ、未解決問題や今後の方向性を考察する。技術的な更新情報は指定のリンクで追跡可能。 Comment
元ポスト:
自己進化するAI Agentについて、モデル、Scaffolding (Agent Harness)、Evaluationの観点からまとめたサーベイのようである。self-improvingと言うと、元々LLMのモデルの重みを自己進化させる枠組みの文脈で使われていたが、AI Agentの文脈ではScaffoldingのメモリの蓄積による性能の進化等も含まれる。
[Paper Note] Skill Retrieval Augmentation for Agentic AI, Weihang Su+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #reading #One-Line Notes #AgentSkills #Reading Reflections Issue Date: 2026-07-21 GPT Summary- 大規模言語モデル(LLMs)が外部スキルに依存するようになり、これを効率的に活用するために新たにSRA(Skill Retrieval Augmentation)パラダイムを提唱。SRAは、エージェントが必要に応じて関連スキルを動的に取得し適用する仕組みで、初のベンチマークSRA-Benchを導入。5,400件のテスト事例と636件の正解スキルを用いた実験により、検索ベースのスキル拡張が性能向上に寄与することを確認。ただし、スキルの取り込みには課題があり、正解スキルの認識や外部能力の必要性に関する判断がエージェントの性能を制限することが分かった。これにより、今後のエージェントシステムの能力拡張の基盤を築くことが示唆される。 Comment
元ポスト:
pj page: https://sr-agents.github.io
dataset: https://huggingface.co/datasets/WeihangSu/SRA-Bench
スキルの肥大化に伴いモデルのcontextが肥大化しパフォーマンスが劣化することから、動的にスキルを検索して統合するSkill Retrieval Augmentationを提案し、そのための大規模なデータセットを用いて評価をしている、という話に見える。データセットは26kのスキルで構成され、そのうち636件がgoldという規模感のデータセット。
実験結果を見ると、topkのretrieve結果をそのまま利用するfull injectionよりも、full injectionしたスキルのメタデータからrelevantなスキルを1iLLMで選択するLLM Selectionの性能が向上している点が興味深い。
また、skill poolにhard negativeなスキルが存在すると、ベンチマークのスコアは低下していく傾向(具体的にどのベンチマークかまでさ読めていない)にあり、hard negativeが8つ程度で、様々なモデルにおいてAcc.が10%程度は低下しているように見える。興味深い。
問題設定が実用的で興味深いだけでなく、hard negativeなスキルが <10個 程度のオーダーで存在するだけで大きくAcc.が低下する知見を示している点がおもしろい。
[Paper Note] Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data, Shikai Qiu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Compression Issue Date: 2026-07-21 GPT Summary- リクエンシャル符号化は、生徒モデルが自身の分布から選んだ訓練サンプルを記録することで、圧縮を実現。これにより、コード長はパラメータ数やデータエントロピーに依存せず、逐次的コーディングよりも短くなる。大規模モデルでも高い一般化保証を提供し、従来の圧縮手法では捉えられない現象を明らかにする。データセット内の学習可能な情報とランダムな内容を区別し、低エントロピーのテキストがより多くの構造を保持することを示す。 Comment
元ポスト:
[Paper Note] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading, Zongxia Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2026-07-19 GPT Summary- Long-Horizon-Terminal-Benchは、AIエージェントの能力を検証するための新しい終端ベンチマークで、46件の長期タスクを含む。従来のベンチマークが評価する簡単な問題とは異なり、このベンチマークは中間報酬と部分点を重視し、長期的な計画や文脈管理を要求する。評価した15のモデルでは、タスクあたり平均9.9Mトークンを消費し、低いパス率が示され、改善の余地があることが示唆された。失敗モードの分析も行い、今後の進展に寄与することを目的としている。 Comment
元ポスト:
[Paper Note] Who Checks the Citations? Benchmarking Legal Hallucination Detection, Patty Liu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Citations #NLP #Dataset #LanguageModel #COLM #Legal Issue Date: 2026-07-19 GPT Summary- AIを用いて法的文書を作成する弁護士や裁判官が増加する中、捏造された引用が依然として多発している。本研究は、AIシステムが法的引用の幻覚を自動検出できるかを評価し、1,300件の抜粋データセットを用いて分類法を提案した。5モデルをベンチマークした結果、最新モデルはより高い性能を示すが、微妙な誤りカテゴリには苦戦することが明らかになった。エージェント系の検証は資源を消費し、情報アクセスの制限が効果を妨げる問題も指摘。これにより、商用法データベースに依存しない当事者にとっての不利益が生じる。研究では、信頼性の高い法的引用照合ツール構築のための基盤も提案している。 Comment
元ポスト:
[Paper Note] Qworld: Question-Specific Evaluation Criteria for LLMs, Shanghua Gao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- One-Question-One-World(Qworld)を導入し、オープンエンドな質問に対する評価基準を質問特異的に生成。再帰的展開木を使用し、質問をシナリオや視点、細分化された基準に分解。HealthBenchで高いカバー率を示し、専門家によって優れた洞察と粒度が評価される。Qworldは、LLMの評価において隠れた能力差を明らかにし、固定の基準に依存せず、動的な適応評価を実現。 Comment
元ポスト:
Open-endなQuestionを評価する際に、Questionに応じて動的にcriteriaを生成し評価する
[Paper Note] Rethinking the Evaluation of Harness Evolution for Agents, Yike Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-19 GPT Summary- 自動ハーネス進化の評価を再検討し、既存手法の問題点を指摘。従来の評価は単体テストケースに依存し、探索手段と最終評価が同じベンチマーク上にあるため、過剰適合のリスクがある。フィードバックと推論予算を揃えた評価を行い、GPT-5.4とClaude Opus 4.6を使用して実験した結果、自動ハーネス進化は単純なテスト時スケーリングを必ずしも上回らず、一般化にも限界が示された。この結果は自動ハーネス設計の評価の再考を促すものである。 Comment
blog: https://yikee.github.io/harnessevolution/
元ポスト:
所見:
Harness自身を進化させる手法(Harness Evolution)を公平に評価しようね、という話で、現在の評価における以下の課題を指摘:
- Harness Evolutionは、ベンチマークに対するverifierからのフィードバックが利用されるが、これは本質的にtest time scalingにおいて検索に多くのリソースを費やした場合と分離ができていない。つまり、ハーネスそのものを進化させたことに効果があったのか、単に探索により多くの計算リソースを投じたことによる効果なのかが分離されていない。
- Harness Evolutionの探索に用いるタスクと評価に用いるタスクが同一の場合、単にタスクにoverfitしているだけなのか、汎用的に適用可能なハーネス設計の進化によるものなのかが明らかでない。
そのため、
- 固定された予算のもとで、
- どのようなフィードバックシグナルを受け取るか
- 計算リソースをどう配分し
- タスクの軌跡やハーネスそのものを修正するか
といった事項を制御しつつtest time scaling手法と比較することが重要と主張している。
実際、unit testのケースにアクセスできない場合で比較すると、Harness Evolutionはtest-time scalingを上回ることができないことが、Figure 1/Table 1に示されている。
unit testケースにアクセスできる場合は、test-time scaling系の手法において、オラクルを用いてサンプリングされた候補の中から最良のものを取得することができ、このような手法とHarness Evolutionを比較しても、test-time scalingを上回ることはできなかった。
また、Figure 2が、test-time scaling系の手法と、Harness Evolution系の手法を概観するのに非常にわかりやすい。
[Paper Note] OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers, Siyuan Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #Pretraining #NLP #LanguageModel #Optimizer #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-07-12 GPT Summary- 最適化手法の選択は計算量やメモリに制約されるが、その全体像は断片的である。そこで、統合サーベイ「OmniOpt」を提案。これには、五段階メタパイプラインの構造的変換、ノルム制約付きLMOによる手法統一、二次元分類法を用いた手法の機構と訓練目標の整理、最適化手法を系統的に分析するクロスドメインベンチマークが含まれる。これにより、最適化手法選択のための実用的な座標系を提供し、今後の研究の方向性を示す。 Comment
元ポスト:
optimizerの詳細なサーベイと様々なベンチマーキングの結果が記載されている模様
全部読んだらめちゃめちゃ勉強になりそう
[Paper Note] Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?, Kotaro Yoshida+, ICML'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ICML #reading #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- インラインコメントを活用して、再利用可能な自然言語ルーブリックを学習する手法を提案。コメントの不一致を観察しながらルーブリックを改良し、現実のレビュー設定で評価。これにより、成果物の改訂やルーブリック理解が促進されることを示した。 Comment
元ポスト:
文書の中に断片化されているインラインコメント等を暗黙的な評価基準に基づいて生成された観測データと捉え、インラインコメントから明文化されていない評価基準を学習し、ルーブリックとして活用可能にする、という話に見える。
「暗黙知、ケースバイケースなのでなかなか明文化できません」という状況によく遭遇し困るので、そもそもこういった手法が利用できるように日々の判断をLLMが利用可能な形に残しておくことが重要と感じる
[Paper Note] PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks, Apurva Gandhi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- PPT-Evalは120のPowerPointタスクからなるベンチマークで、コンテンツ作成とプレゼンテーション編集を評価。複雑なタスクに対する堅牢な評価フレームワークを設計し、ルーブリックを通じて部分点を付与することで人間の判断との高い相関(τ_b=0.77)を示した。既存のエージェントは依然としてこのタスクに苦戦しており、Claude-4.5-Opusでも成功率は45%。 Comment
元ポスト:
[Paper Note] MirrorCode: AI can rebuild entire programs from behavior alone, Tom Adamczewski+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #AIAgents #Coding #SoftwareEngineering #read-later #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- AIモデルのコーディング能力は向上しており、MirrorCodeを用いて全体のソフトウェアプロジェクトの再実装を通じた新たな長期的ベンチマークを提案。AIエージェントはコードにアクセスせず、既存のプログラムの機能を再現し、テストで出力の一致を求められる。計算機科学の多様な分野をカバーし、最強のモデルは全体で56%のスコアを記録。AIは複雑なツールを再実装でき、研究の要件が明確であれば長期タスクを完遂可能であることを示唆。AIの進化がソフトウェア工学に及ぼす影響に期待。 Comment
pj page: https://epoch.ai/MirrorCode
元ポスト:
[Paper Note] OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks, Mengqi Yuan+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- OSWorld 2.0は、現実的で複雑なコンピュータ利用タスクを評価する新しいベンチマークで、108の長期ワークフローから成る。タスクは人間が中央値1.6時間で完了し、教師が318回のツール呼び出しを必要とする。このベンチマークは、ストリーミングや動的環境、複数情報源間の推論などの課題を扱い、リアルなユーザープロファイルデータと照合される。Claude Opus 4.8は最大思考で20.6%のタスクを54.8%のスコアで完了するが、GPT-5.5は約13%で停滞。結果は現行エージェントの専門的なコンピュータ利用には限界があることを示している。 Comment
pj page: https://snorkel.ai/leaderboard/os-world-2-0/
元ポスト:
著者ポスト2:
[Paper Note] You Don't Need to Run Every Eval, Yuchen Zeng+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #EfficientEvaluation #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- 84のフロンティアモデルを133のベンチマークで評価し、スコア行列を作成した結果、モデルのスコアは主に2つの因子に依存することが明らかになった。これに基づき、行列補完法「BenchPress」を設計し、隠れたスコアを高精度で回復。特定のベンチマークのサブセットでは、モデルの未公開スコアを3.93ポイント以内に予測可能であり、より安価な評価セットでも高い精度を示した。スコア行列、BenchPressのコード、および対話型ツールを公開。 Comment
元ポスト:
著者ポスト:
[Paper Note] SWE-Together: Evaluating Coding Agents in Interactive User Sessions, Yifan Wu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #SoftwareEngineering #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 実際のコーディング支援の対話的性質を反映した新しいベンチマークSWE-Togetherを導入。11,260件の記録セッションから109件のタスクを選び、リアクティブなLLMベースのユーザーシミュレーターを構築。エージェントの評価はリポジトリの正確さとフィードバックの回数で行われ、強力なエージェントほど成功率が高く、介入が少なくて済むことを示した。 Comment
pj page: https://togetherbench.com/
元ポスト:
[Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Health #Medical Issue Date: 2026-06-27 GPT Summary- HealthBench Professionalというオープンなベンチマークを通じて、ChatGPTが臨床医の業務支援においてどのように利用されるかを評価。ケア相談、執筆、医療研究の三つの利用ケースに基づいた医師作成の対話がルーブリックで採点され、OpenAIのモデルの難易度や質を測定。特に、意図的な敵対的検証が含まれた例もあり、最も高いスコアを取得したのはGPT-5.4で、多くのモデルや人間の医師を上回る。これにより、医療AIコミュニティが臨床タスクの進展を追跡し、信頼できるシステムの構築を支援することを目指す。 Comment
[Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Security #Environment Issue Date: 2026-06-27 GPT Summary- 悪用は段階的な進展を伴う能力であり、従来のLLMセキュリティベンチマークが二値的結果に依存することに問題がある。本研究では、16の測定可能なフラグによる能力評価型ベンチマークであるExploitBenchを提案し、様々な悪用技術を評価する。V8の41件のバグに適用した結果、公開されているモデルとプライベートモデルとの間に能力の顕著な差を確認。特に、プライベートモデルでは任意コード実行が観測され、堅牢化されたターゲットに対する悪用能力の構築が新たな重要性を持つことを示唆している。 Comment
[Paper Note] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies, Issa Sugiura+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Planning #LongHorizon #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- 経済システムにおけるLLMエージェントの性能評価が重要になっている中、CoffeeBenchを導入。これは長期的なマルチエージェント経済でLLMを評価するベンチマークで、農家、焙煎業者、小売業者が90日間自律的に運営し、累積純利益を最大化を目指す。多数のモデルが受動的ベースラインを超えて正の純利益を達成し、高性能モデルはより積極的なコミュニケーションを示す一方で、一部モデルは不作為に陥る行動を観察。今後の研究のために、コードとエージェントの軌跡が公開される。 Comment
元ポスト:
関連:
- [Paper Note] CEO-Bench: Can Agents Play the Long Game?, Haozhe Chen+, arXiv'26, 2026.06
- [Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04
[Paper Note] NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?, Yuru Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- NatureBenchは、査読付きNature系論文から蒸留された90のタスクから成る学際的ベンチマークで、AIコーディングエージェントの能力を評価する。NatureGymという自動パイプラインによって、環境の断片化問題を解決し、標準化されたタスク環境を構築。10種類の最先端エージェントを評価した結果、最も強力なモデルでもSOTAを超えるタスクは17.8%にとどまることが判明。成功は主に方法論的翻訳に依存し、真の科学的発明には結びついていない。失敗は主に手法選択と計算リソース不足に起因。ベンチマークと公開リーダーボードが提供される。 Comment
元ポスト:
最近は新しいベンチマークが出ると大抵はClaudeがTopな気がする
[Paper Note] GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?, Tongxu Luo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Game Issue Date: 2026-06-22 GPT Summary- ゲーム生成は、自然言語仕様を対話的システムに変換する新しいコーディングエージェントの応用であり、ゲームエンジン内で一貫したプレイ体験を作成する必要があります。本研究では、エンドツーエンドのゲーム生成を、プレイヤーとゲームの相互作用を通じて完全なゲームアーティファクトを作成する問題として定義し、評価基準としてエンジンの基盤付け、アーティファクトの完成度、対話的検証を提案します。GameCraft-Benchという評価フレームワークを構築し、15のゲームファミリーの140のタスクをベンチマークとして使用しました。その結果、最先端のコーディングエージェントは依然として高い難易度を示し、最良のエージェントでも41.46%の得点に留まり、多くのエージェントが40%未満の結果にとどまっています。また、エージェントは機械的には実装可能でも、十分な内容やビジュアルフィードバックを備えた完全なゲームを提供するのに苦労しています。 Comment
元ポスト:
[Paper Note] MVEB: Massive Video Embedding Benchmark, Adnan El Assadi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Embeddings #3D (Video) #Author Thread-Post Issue Date: 2026-06-22 GPT Summary- 大規模ビデオ埋め込みベンチマーク(MVEB)は、23タスクからなるベンチマークで、分類、ゼロショット分類、クラスタリング、ペア分類、検索、およびビデオ中心の質問応答を含みます。33モデルを評価し、単一の支配的なモデルは確認されませんでした。MLLMベースの埋め込みは分類やクラスタリングで優位を示し、マルチモーダル結合は検索およびゼロショット分類で優れています。音声の寄与はデータセットの注釈取得元に依存し、両モダリティから作成されたラベルが有効な場合と視覚のみから作成された場合で一貫して6ポイントの差が見られました。MVEBは184タスクのプールに基づいて派生しており、MTEBエコシステムに組み込まれています。すべてのコードとリーダーボードは公開されています。 Comment
元ポスト:
[Paper Note] CEO-Bench: Can Agents Play the Long Game?, Haozhe Chen+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #One-Line Notes #LongHorizon #Environment #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- CEO-Benchは、言語モデルのエージェントが長期的な視野、ノイズの多い環境での情報取得、適応能力、目標統合を評価するためのシミュレーションである。エージェントは500日間のスタートアップ運営を通じて架空の企業管理を行い、ビジネスデータを分析して戦略を構築。多くのモデルが苦戦する中、Claude Opus 4.8とGPT-5.5のみが初期の課題で成功を収めている。CEO-Benchは持続的な進歩を測定する手段を提供する。 Comment
元ポスト:
以下著者ポストの要約
エージェントに1Mドルを与えて仮想環境でスタートアップを500日経営させ、最終的なキャッシュを比較することでエージェントのlong horizonな意思決定、データ分析、コーディング能力を測定する。経営はprogrammableなインタフェースによって実現される。モデルによって挙動が異なり、あるモデルは幅広い戦略を探索するが、あるモデルは受動的な意思決定をしてしまいキャッシュを失う。
[Paper Note] Agents' Last Exam, Yiyou Sun+, NeurIPS'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-06-15 GPT Summary- AIシステムはベンチマークで優れた成果を上げているが、現実の経済的価値には繋がっていない。このギャップは評価の問題に起因していると主張し、長期的な実績を伴うAIエージェントを評価する新しいベンチマーク「Agents' Last Exam(ALE)」を紹介。ALEは250名以上の専門家と共に開発され、非物理的産業における1,000超のタスクを網羅。結果はフルパスの平均達成率が1%未満であることを示し、ALEはタスクプールを継続的に拡大し、経済的影響とベンチマークの成功とのギャップを埋める手段として設計されている。 Comment
元ポスト:
著者ポスト:
ポイント解説:
合成データではなく実際にnon-physicalな55の職業によって解かれた1500以上のタスクをverifiableな評価が可能な形式に変換した、データによって構成されたエージェント用のベンチマーク。現実世界の、経済的に価値がある、持続的に取り組まれている専門的なタスクによるエージェントの評価を目的として構築されている。300人以上の100以上の機関の専門家によって構成。
pj page: https://agents-last-exam.org/
[Paper Note] Echo-Memory: A Controlled Study of Memory in Action World Models, Wayne King+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #read-later #memory #WorldActionModel Issue Date: 2026-06-11 GPT Summary- Echo-Memoryを提案し、アクション条件付きの世界モデルにおける記憶メカニズムを探究。モデルは初期フレームやカメラアクションから動画を生成し、記憶の効果を考察。共通のビデオバックボーンの下で、異なるメモリ設計を比較し、容量や圧縮、再帰の4つの軸を分離。メモリ評価のプロトコルを用いて、再生忠実度と実際の記憶の関係性を明らかにし、生のコンテキストが記憶容量の基準であり、コンパクト性は容量の代替にならないことを示した。特に、状態空間再帰はオープンドメインでのリターン機構において重要な役割を果たす。 Comment
元ポスト:
[Paper Note] CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions, Sherin Muckatira+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Mathematics #read-later Issue Date: 2026-06-11 GPT Summary- 大規模言語モデルは数学的推論で進展を見せているが、既存のベンチマークは協働的な問題解決のプロセスを捉えていない。CrowdMathは、専門家が注釈を付けた進捗チェーンのデータセットで、複数の参加者によるフォーラム形式の議論を追跡している。評価タスクを定義し、6つのモデルが投稿予測で83-88%の精度を示したが、貢献の機能的意義を特定するのは難しく、最良モデルでもマクロF1が0.42にとどまった。CrowdMathは、数学の解決と協働的な進歩の理解のギャップを明らかにしている。 Comment
元ポスト:
興味深い
[Paper Note] Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments, Parth Asawa+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-06-07 GPT Summary- 継続学習を評価するための初の専門家検証済みベンチマークであるCL-Benchを紹介。六つの多様な領域を対象に、LLMベースのシステムが経験を通じて改善するかを測定。状態を持つシステムは潜在構造を発見可能で、最先端モデルが継続学習を改善する余地があることが明らかに。専用メモリシステムでも問題は解決されず、シンプルなICLが優位であった。このベンチマークにより、現実世界における継続学習の必要性が強調されている。 Comment
元ポスト:
Question (Instance)のSequenceを完了することが求められるContiunual Learningのためのベンチマークで、各instanceは、モデルが事前に知り得ない報告可能な状態を持ち、後続のinstanceは、過去のinstanceの結果(experience)を用いなければならない。また、最終的に、Databaseのmigrationを通じて過去のexperienceを適用不可能にし、このような状況にも柔軟に対応可能な能力も評価する、という話に見える。
[Paper Note] Reasoning Structure of Large Language Models, Frédéric Berdoz+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Chain-of-Thought #Reasoning #Initial Impression Notes Issue Date: 2026-06-06 GPT Summary- 推論モデルの評価には、正確性やトークン数だけでなく、推論構造の理解が重要である。これに応じて、論理パズルのためのスケーラブルな評価ベンチマークと、非構造化推論を検証可能な推論グラフに変換するパイプラインを導入。これにより、推論の構造化と定量的分析が可能となり、論理的流れの集中度を測る指標を定義。分析は、構造的測定が正確性とトークン数の混同を解消し、故障モードの診断やパズルの難易度との関係を比較するのに役立つことを示した。 Comment
元ポスト:
LLMのReasoning Traceをverifiableなグラフ構造に変換し、Reasoningを評価可能にする
[Paper Note] Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?, Yue Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #VisionLanguageModel #SpatialUnderstanding Issue Date: 2026-06-05 GPT Summary- 空間推論は視覚-言語モデル(VLM)の基本能力だが、既存の評価は視覚的観察の制限を無視している。本研究では、遮蔽と視点の曖昧性という2つの観察課題を導入し、空間的質問を設計してモデルの応答を評価。結果は、視覚的証拠が不完全な場合でも過信的応答が誘発され、遮蔽下での精度は約30%、視点の曖昧性では10%未満にとどまることを示した。また、信頼できる追加視点を識別する能力は多くのモデルでほぼランダムである。これにより、モデルが正確な回答だけでなく、適切に回答を控える能力や信頼できる証拠を求める必要性が示唆された。 Comment
元ポスト:
[Paper Note] ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood, Tiantian Feng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#SpeechProcessing #AutomaticSpeechRecognition(ASR) #AudioLanguageModel Issue Date: 2026-06-05 GPT Summary- ChildVoxは、出生から就学年齢までの子どもが用いる多様な音響信号を特徴づける新しいベンチマークで、17の子ども中心のデータセットを統合し、20以上のサブタスクを提供します。生理的音や非言語的発声を含む音声タスクで、自己教師付きや大規模音声モデルを評価することで、高性能な認識モデルを示し、子どもの言語発達や発話の変化を追跡することを支援します。 Comment
元ポスト:
興味深い
[Paper Note] GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization, Zaid Khan+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #GPUKernel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment
元ポスト:
[Paper Note] WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction, Chengzhi Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #MultiModal #Selected Papers/Blogs #memory #interactive #KeyPoint Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-06-03 GPT Summary- マルチモーダル大規模言語モデルが長期エージェントとして機能するためには、記憶が進化する世界に適応し、適切な証拠を提示する必要がある。しかし、従来のベンチマークは静的なリコールに依存しており、記憶の生成における失敗を特定できない。これに対して、我々は記憶を「アクション-ワールド・インタラクション・ループ」として定式化し、WorldMemArenaを実装。ここでは、400件のマルチセッション・マルチモーダルタスクを通じて、記憶の診断が可能となる。結果として、記憶書き込みは必ずしも性能向上に繋がらず、視覚的証拠の活用が依然として困難であることが示された。また、エージェントの実行はドメインを跨いで不安定で、コストと信頼性のトレードオフが浮き彫りになった。 Comment
元ポスト:
著者ポスト2:
以下著者ポストの要約
既存のメモリに関するベンチマークは、「静的な環境」において過去のコンテキストから情報を「復元」できるかをテストしているが、それを超えて、
- Lifelong Evolution(動的): ユーザとプロジェクトの状態が変化する世界において、
- Agentic Execution(書き込み・維持・検索・活用): エージェントが観測結果、アクション、ツール実行結果、環境の変化から再利用可能なメモリを構築できるか
をカバーするベンチマークを構築。ベンチマークは461個の複数セッション・マルチモーダルなタスクが含まれ24k QAペア・15kの画像・スクリーンショット、高速な評価のための150サンプルによるサブセットによって構成される。
評価では、
- long-contextのエージェントのcontextに入れ込むメモリ
- 人間がデザインしたメモリ(RAG, メモリパイプライン等)、
- agent harnessがメモリ管理をするタイプのagent
の3種類を評価。
- Takeaway
- メモリへの書き込みの品質が高くても、必ずしもエージェントがうまく活用できるとは限らない
- 現在の手法ではマルチモーダルな情報に対するメモリはまだ困難で、視覚的/空間的/手続き的な情報を失う
- 重要な情報がアクション、フィードバック、スクリーンショット、状態の更新等に分散している場合にメモリは劣化し、これは現在の多くのシステムが整理されたテキストベースの履歴を扱うことに長けている一方で、実際のinteractionのtrajectoryから情報を抽出・更新・再利用することには課題があることを示唆
- agent harnessに基づくメモリはinteraction中に自動的にメモリが記録・抽出・推敲されるため柔軟性が高く有望なアプローチだが、harness designに性能が依存するため、 性能が不安定
評価結果を見ると、一言にメモリと言っても多様な観点からmetricsが定義でき、手法によって性能に大きな開きがある点や実用的な観点の実験設定となっており興味深い。様々な要素が関わってくるため、一概にこの手法が良いというのもあまり言えなさそうに見える。あとなんやかんやRAGが全体的に性能が良さそうに見えるが、結果の解釈が難しく、何らかの単一の尺度などに押し込めたりしないだろうか。
pj page: https://worldmemarena-mem.github.io/
[Paper Note] Automated Benchmark Auditing for AI Agents and Large Language Models, Junlin Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #read-later #Selected Papers/Blogs #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 現代のAIベンチマークでは、複雑なタスクが多く含まれ、人間の注釈では検知が難しい問題が存在します。これを解決するために、Auto Benchmark Audit(ABA)を導入し、168のベンチマークを調査。ABAは、あいまいなタスク設計や実行環境の衝突など、25.7%以上のタスクで重大な問題を特定。問題のあるタスクがモデル評価を歪めることを示し、除外することでパフォーマンスが9.9%及び9.6%向上することを確認。今後のベンチマーク発展のため、これらのツールとタスク注釈を公開します。 Comment
元ポスト:
既存のベンチマークを
- 指示の曖昧性
- 環境に内包される問題(競合や依存関係の問題)
- 評価の品質
の観点から監査するAudit Agentの提案
[Paper Note] SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?, Jiamin Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#PairWise #NLP #Dataset #LanguageModel #KeyPoint Notes Issue Date: 2026-05-31 GPT Summary- 既存の言語モデルベンチマークが飽和する中、SEAL(Seeded Elimination with Adaptive LLM-as-a-Meta-Judge)は、潜在的なランキング信号を抽出する自己改善型評価プロトコルを提案。候補出力をシングルエリミネーション方式で評価し、精度とレイテンシのトレードオフを改善する。複数の飽和ベンチマークにおいて、SEALは全対比較に匹敵する精度を保ちながら、エフォートを大幅に削減した。 Comment
元ポスト:
既に飽和したベンチマークを活用してモデルの評価のためのシグナルを抽出できないか?という気持ちの研究のようで、そもそも飽和したベンチマークはpointwiseな評価によって飽和しており、全てのモデル/promptに対してpair-wiseな評価をしてリストワイズな評価をしてランキング付けをすることで、より高い解像度での評価シグナルが得られるよね、という話からスタートしているように見える。しかしpairwiseな評価は非常にコストがかかるので、自己進化するRubric-basedなLLM-as-a-Judgeとトーナメント方式を採用することで、全件探索したpairwiseによるランキングを、低コストで高い相関係数を以て(0.83--1.0)で再現できるよ、という話に見える。
pointwiseな評価と比較してFullPair/SEALでの評価は評価結果の序列が変化している。ただし、このFullPairでの評価がどの程度正しいものなのかはよくわからない。
[Paper Note] AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence, Kate M. Lubrano+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #Conversation #read-later #Emotion #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 感情知性(EI)の評価が重要になる中、AttuneBenchを紹介。実際の複数ターンの人間-モデル対話200件に基づき、感情状態とモデルの挙動をターンごとに注釈。11モデルの評価結果は感情認識や応答品質に関する能力が分離可能であることを示し、嗜好の整合と応答品質の判断がモデル識別に強く寄与することを明らかに。AttuneBenchは、感情的に重要な会話の評価枠組みを提供し、モデルの強みや弱点を診断する。 Comment
元ポスト:
leaderboard: https://public.attunebench.com/
対話をしている本人によるプロンプト、アノテーション、マルチターンの会話を前提にモデルのEQを測定するためのベンチマークのようである(従来は合成プロンプト、シングルターン、third-partyに基づいたアノテーション(つまり対話している本人ではない、ということだと思われる)によるベンチマークだったとのこと)。
[Paper Note] SpatialBench: Is Your Spatial Foundation Model an All-Round Player?, Haosong Peng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Dataset #OOD #Generalization #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 空間基盤モデルの真の一般化能力を評価するために、決定論的サンプリングを用いた新しいベンチマークSpatialBenchを提案。これにより、19データセットと546シーンを通じて5つの空間ドメインで41モデルを評価。結果は現行モデルが「万能プレーヤー」には至っていないことを明らかにし、精度向上には全文脈アテンションが有効で、有限メモリ戦略がスケーラビリティを改善することを示した。身体性を伴うタスクでは、高品質データが性能向上に重要であることも明らかになった。さらに、評価を超えてDA-Next-5MデータセットとDA-Nextモデルを導入し、空間表現学習の可能性を広げる。 Comment
pj page: https://ropedia.github.io/SpatialBench/
元ポスト:
[Paper Note] $π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows, Haoran Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Conversation #Selected Papers/Blogs #Ambiguity #reading #One-Line Notes #LongHorizon #Proactive Issue Date: 2026-05-27 GPT Summary- パーソナルアシスタントエージェントは、OpenClawのような大規模言語モデルの潜在能力を示しており、特に隠れたユーザー意図の特定に課題がある。本研究では、100のマルチターンタスクからなる積極的支援のベンチマークであるπ-Benchを導入し、長期的な対話におけるユーザーのニーズ予測能力を評価。実験により、積極的支援の難しさ、タスク完遂と積極性の違い、事前対話の重要性が示された。 Comment
元ポスト:
ユーザがOpenClawのようなPersonal Assistantを用いて、マルチターンでのconversationを通じて、ある1つのタスクを遂行したいという状況を想定する。このタスクの開始時には、ユーザは一般的には自然で妥当なクエリを投げるが、最初から全てのrequirementを満たしたクエリは投げず、会話をしながら徐々にrequirementを具体化していくような変遷を辿る。このような、タスク開始時に、タスクを開始する上では自然で妥当だが、タスクを完遂するにはrequirementの情報が足りないという状況において、AI Agentが会話を通じて、ユーザが暗黙的に意図している仕様(hidden intents)を考慮して(=ユーザが明示的にinstructionとしてrequirementを与える前に)タスクを完遂できるか、という能力を測定する。
1つのタスクを完遂するために20個のsessionの会話によって構成されており、hidden intentsはsessionの中で閉じている、あるいはsessionを跨いで維持されるようなものとなっており、これらの情報をエージェントは過去のsessionの情報(メモリ)から推測するか、あるいは明示的にhidden intentsについて質問をするようなProactiveな挙動によって収集した上でタスクを遂行しなければならない。このとき、Userの役割を果たすエージェントは、GPT-5.4によって再現される。
[Paper Note] ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop, Yining Hong+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #VisionLanguageModel #Robotics #SpatialUnderstanding #EmbodiedAI #Simulation Issue Date: 2026-05-27 GPT Summary- 空間知性は行動を通じて展開し、エージェントは能動的に観察を行い、見えない構造を明らかにする。新たに導入したESI-BENCHは、具現化された空間知性のベンチマークで、エージェントは知覚、移動、操作をもとに行動を選定し、タスク関連の証拠を蓄積する。実験により、能動的探索が受動的アプローチを上回り、エージェントは自発的に新たな戦略を見出すことが確認された。3Dグラウンディングは推論を安定させる一方、不完全な表現は逆に有害であり、モデルは証拠の質に依存せず早期に結論に達する傾向がある。 Comment
元ポスト:
pj page: https://esi-bench.github.io/
[Paper Note] Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks, Benjamin Warner+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Medical #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 医療分野でのLLMs評価は、ベンチマークの飽和やデータ制限のため困難である。30のベンチマークを含むオープンソース評価スイートMedmarksを導入し、61モデルを71設定で評価。その結果、最先端のモデルが最高性能を示し、ファインチューニングされたモデルが汎用モデルを上回ることが確認された。評価は医療推論のLLMsのポストトレーニング環境としても利用可能。 Comment
元ポスト:
[Paper Note] MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation, Yuta Oshima+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#ComputerVision #Dataset #TextToImageGeneration #LLM-as-a-Judge #CVPR #2D (Image) #ImageSynthesis Issue Date: 2026-05-26 GPT Summary- マルチ参照生成モデルは複数の参照画像から新たな文脈で被写体を描画するが、既存のデータセットは単一もしくは少数の参照に偏っているため性能評価に限界がある。本研究では、マルチ参照設定に特化したMultiBananaを提案し、参照数やドメイン不一致、スケール不一致、まれな概念、多言語テキストに関する問題を網羅してモデルの限界を評価する。分析により性能と改善点を明らかにし、公正な比較のための標準化された基盤を提供する。 Comment
元ポスト:
[Paper Note] VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models, Alex S. Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #NLP #Reproducibility #Robotics #VisionLanguageActionModel #Reading Reflections #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- VLAモデルの実世界評価に向けた低コスト且つ再現性の高いベンチマークVLA-REPLICAを提案。市販部品で構築し、多様な操作タスクとデータセットを提供。実験により、再現性を確認し、モデルの特性を明らかに。 Comment
元ポスト:
再現可能なベンチマークを作るのはロボティクスのような物理的な検証環境が必要なタスクの場合は確かに難しそうだな、と思うなどした(小並感)。オブジェクトの配置や景観、実際のロボットのパーツなど外的な要因が非常に多い気がする。
[Paper Note] STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?, Hanxiang Chao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory #reading #One-Line Notes Issue Date: 2026-05-21 GPT Summary- 大規模言語モデル(LLM)が個人化メモリを維持する上での「暗黙的対立」能力を評価するために、400の専門家検証済みシナリオを含むSTALEを提案。三次元の探査フレームワークにより、古い信念の検出やユーザー状態の変化に応じた記憶の修正を評価。最先端のモデルでも精度55.2%に留まり、時代遅れの仮定を受け入れる傾向を示す。状態認識型メモリの改善のためのプロトタイプCUPMemを提示し、明示的な状態判断の重要性を示す。 Comment
元ポスト:
提案されたベンチマークでは3つの次元で測定するが、特にユーザから本来とは異なる古い前提のクエリ与えられたときに、それを否定し、自身のメモリからgroundingされた情報に基づいて応答を生成させるテスト(Premise Resistence; 3.5節)に苦戦することが示されている(Table 2)。
他の二つの次元は
- State Resolution: 以前の記憶がすでに無効であることをモデルに対して直接テスト
- Implicit Policy Adaptation: 前提知識を提示せずに、最新の記憶に基づいて応答しなければならない質問(e.g., 今週の通勤プランを教えて)に対するテスト
[Paper Note] Interactive Evaluation Requires a Design Science, Keyang Xuan+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #interactive #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- インタラクティブな評価の重要性を強調し、従来の応答中心のベンチマークからの変革を提案。評価を「証拠から判断へ」とする自律的な写像として定義し、インタラクションによって生成される軌跡を評価する必要性を示す。設計原理や報告基準を導出し、評価課題の再発を分析する二軸分類法を提案。 Comment
元ポスト:
[Paper Note] Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs, Guijin Son+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Mathematics #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-14 GPT Summary- Soohakという新たな数学ベンチマークを導入し、439問から成り、フロンティアモデルの推論能力を評価。Challengeサブセットでは、トップモデルが30.4%未満の成功率である一方、拒否サブセットはモデルが50%を超えられない問題解決能力を確認。これにより、拒否能力が新たな評価基準として浮上し、2026年末に公開予定のデータセットで混入を防ぐ。 Comment
元ポスト:
60人以上の数学者によってゼロペースで作成された新たなベンチマーク。数学者は作問をする際にLLMの利用は禁止され、問題を作成しsubmitする。その後レビュープロセスを経て問題が収録されるかが決まっているようである。レビュープロセスでは、LLMによる難易度の確認や類似した問題がないかなどの確認をし、人間がLLMの出力を見て疑わしいか否か判断する。レビュワーは作成者にフィードバックをし、質問や確認などを行う。また、LLMを利用したであろう作成者はbanされ、問題に調整が必要な場合は修正がなされる。提出された問題は、小、中、大のスケールのOpenLLMによって正解できたか否かによって、miniとして収録されるかChallengeとして収録されるかが決まり、特にChallengeについては作成者が特定の教員やポスドク、IMOメダリストなどに限定されたようである。
99個の、矛盾や前提の抜け、正解が一意に決まらないill-posedな問題も含まれており、モデルが回答を拒否しなければならないRefusal Questionsが含まれているのが大きな特徴。
研究レベルの問題の定義がよくわかっていないのだが、要は競技で出題されるような「既存の知識や枠組みの中でのマルチステップでの推論」を必要とするものではなく、「数学に関する最先端を切り拓くレベルの問題」のことのようである。これでもまだよくわからなかったのだが、問題の作成者に対するインタビューによると、SOOHAK-Miniの問題は短時間で作成できたが、SOOHAK Challengeの問題は1問作成するのに1日以上の作業を要することがしばしばあったとのこと。Challengeレベルの問題を作成するためのアプローチとしては典型的に2つあったとのことで、
- 問題作成者自身が最近考えていた研究と隣接した問題を提出するもので、問題を解くステップにおいて既存の定理や、論文などで公式には発表されていない事実や、数学者の中でヒューリスティクスを組み合わせる必要があるような要素を含むもの(folklore-level reasoningと呼ばれる)
- ニッチな研究論文に基づいて問題を設計する方法
などがあったようである。つまり、競技という枠組みは超えて、数学の研究者が研究として考えるレベルの問題ということだと理解した。
コーディングにおいて人間を置き換えるレベルであろうモデルも、未知の数学の問題や、そもそも問題として不適切なものの回答拒否は広く使われたベンチマークほどはうまくいかない。新たに拒否が最適化のobjectiveとして必要なことが示唆されているが、逐一人類はAIにこの挙動が足りないね、じゃあ学習データを用意して学習しよう、ということを繰り返していくのだろうか?正解ベースの学習にそろそろ限界が見えてきた気がしており、AnthropicのペルソナやConstitutionに基づいた学習のような特定の領域に広く汎化するような学習方法の模索が必要な気がする。
拒否する挙動のための正解データを用意して学習するとしよう。そうすると、モデルが持つ他の能力に影響を与えるだけでなく、本来拒否が不要な場面でも拒否するようになる可能性が高い(たとえばクエリが数学に関連しているだけで、一定の確率で拒否するリスクは生じるように思われる)。この問題を解決するために最近はOn-Policy Distilation (OPD)が活用されるが、OPDはこの問題を緩和することには寄与するが、根源的に解決しているわけではない(と思われる)。genericな能力の発現に際して、モデル自身がcontextに応じて、どの挙動を発現させるべきかを"線引き"できるような能力とアーキテクチャ(マルチモーダルなモデルのようにMoEのexpertをbehaviorに関しては分離するなどだろうか)が必要に思う。
[Paper Note] WebWorld: A Large-Scale World Model for Web Agent Training, Zikai Xiao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #WorldModels #LongHorizon #Environment Issue Date: 2026-05-13 GPT Summary- WebWorldシリーズは、膨大な軌跡を必要とするウェブエージェントの訓練において、100万件以上のオープン・ウェブの相互作用を利用した初のオープンウェブ・シミュレーターです。これにより、長期的なシミュレーションと複数フォーマットのデータ処理が可能になります。内部評価では、9つの次元に基づく指標を用いたWebWorld-Benchで、Gemini-3-Proと同等の性能を達成。外部評価では、WebWorldで訓練されたQwen3-14BがWebArenaでの性能を+9.2%向上させ、GPT-4oと同等の結果を示しました。WebWorldは探索を効率的に実行し、世界モデル構築においてGPT-5を上回る能力を持ち、さらにはコード、GUI、ゲーム環境への応用も可能です。 Comment
HF: https://huggingface.co/Qwen/WebWorld-8B
元ポスト:
[Paper Note] AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents, Zhengkang Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Generalization #LongHorizon #Initial Impression Notes #ToolUse Issue Date: 2026-05-13 GPT Summary- AgentEscapeBenchを導入し、LLMエージェントの新規ツール使用手順の推測・実行・修正能力を評価。脱出ゲーム形式のタスクは、依存グラフに基づいてエージェントが外部関数を呼び出し、隠れ状態や中間結果を追跡する。実験では、依存深さが増すほど性能が急低下し、成功率が難易度により大きく変動することを示した。これにより、現在のエージェントは局所的なツール使用には強いが、深い文脈依存には苦労していることが明らかに。AgentEscapeBenchは、エージェント能力の測定と今後の訓練への示唆を提供する。 Comment
元ポスト:
エージェントが慣れ親しんだ設定から離れて、脱出ゲーム風のベンチマークによって、未知のツールやアイテムを活用して環境と相互作用しながら文脈を理解し、最終的なanswerを答えるなければならない。
新たな環境での未知のツールに対する汎化性能を測るベンチマークであり、非常に興味深い。
下記研究のように、既存の知識への依存を減らして、実務能力を問うベンチマークとも言える:
- [Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
[Paper Note] DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents, Zhaorun Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Controllable #NLP #Dataset #LanguageModel #AIAgents #Security #Initial Impression Notes #Environment #Author Thread-Post #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment
元ポスト:
Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
論文は279ページもある🤯
[Paper Note] Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases, Eric Gan+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Safety #Sabotage Issue Date: 2026-05-10 GPT Summary- AIシステムによる自律研究の拡大に伴い、整合性のないシステムが誤った結果を生むリスクが高まっている。Auditing Sabotage Benchは、機械学習研究におけるサボタージュを監査する能力を評価するベンチマークであり、9つのコードベースからなる。各サボタージュは、実装の詳細を変更しながらも論文の方法論を維持している。最前線のLLMと人間監査者がサボタージュを適切に検出・修正するのが難しいことが判明し、最良性能はAUROC 0.77、修正率42%でGemini 3.1 Proによって達成された。LLMをレッドチームとして評価した結果、LLM生成のサボタージュは人間生成のものよりは劣ったが、時にはLLM監査者を回避することもあった。本ベンチマークはAI研究の監視と監査技術の向上を目指して公開されている。 Comment
元ポスト:
[Paper Note] Evaluating whether AI models would sabotage AI safety research, Robert Kirk+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #Safety #Sabotage Issue Date: 2026-05-10 GPT Summary- 最先端のAIモデルが安全研究に対する妨害を行う可能性を評価するために、四つのClaudeモデルに対して未指示妨害評価と妨害継続評価を実施した。未指示妨害は見られず、Mythos PreviewとOpus 4.7 Previewでは拒否率がほぼゼロ。しかし、全モデルで部分的なタスク完了が発生。妨害継続評価では、Mythos Previewが7%で妨害を継続し、不一致の出力を示した。評価フレームワークはオープンソースのLLM監査ツールPetriに基づき、状況認識を測定。Opus 4.7 Previewは未指示評価認識が高いが、prefill認識は低い。最後に、評価の限界やリスクについても議論。 Comment
元ポスト:
[Paper Note] MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks, Zixuan Ke+, ICML'26, 2026.01
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #AIAgents #ICML #read-later #Selected Papers/Blogs #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment
元ポスト:
SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。
[Paper Note] ProgramBench: Can Language Models Rebuild Programs From Scratch?, John Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- ソフトウェアプロジェクトの完全な開発は、言語モデルの重要なユースケースで、エージェントは最小限の監視下でコードベースを成長させる。しかし、既存のベンチマークは限られたタスクに焦点を絞っている。そこで、ProgramBenchを導入し、エージェントが与えられたプログラムとそのドキュメントに基づいて、参照実行可能ファイルに一致するコードベースを設計・実装する能力を測定する。200のタスクを用い9つの言語モデルを評価した結果、どのモデルも未完のタスクが多く、人間が書いたコードとは異なる実装を好む傾向が見られた。 Comment
pj page: https://programbench.com/
元ポスト:
実行可能なバイナリとdocumentationを与えたときに、インターネットアクセスが不可能な環境で、オリジナルのプログラムの挙動を再現可能なcodebaseを実装するベンチマークで、現状いずれのLLMもスコア0%とのこと。スコアは全タスクのうち、(タスクごとに定義される)テストを全て通過したタスクの割合である。Almostの場合は95%以上のテストを通過したタスクの割合である。
仕様全体からcodebase全体を再現する必要がため、これがうまくできれば、これまでのベンチマークよりも人間に近い推論・認知能力を持つと部分的に主張できるとは思われる。
contaminationの懸念について、本ベンチマークではopen-sourceのコードを異なる言語で実装するようにすることで検証している。異なる言語で実装することによってモデルが通過するようになったテストの割合は大きく変化しなかったため(leaderboardのスコア異なる点に注意。leaderboardのresolvedは全てのテストを通過したタスクの割合である。)、memorizationの影響は小さいと主張している。また、本ベンチマークはインターネットアクセスが不可能な状態で実施されるが、インターネットアクセスを許可した場合、モデルはcheatingを実施するようになり、多くのcheatingはソースコードをlookupすることだったとのこと。
テストはbehavioralなものであり、SWE-Benchで行われているような実装の方法についてはテストをしない。
ProgramBenchの言語の分布と、各タスクのcodebaseの規模間。270M lineのcodebaseから200 line程度の小さなものまで、規模間が大きく異なることがわかる。言語はC/C++, Go, Rustが多く、多くのモデルが得意とするであろうpythonはほとんど含まれていない。
著者ポスト:
[Paper Note] HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?, Tu Trinh+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #Human-in-the-Loop Issue Date: 2026-05-08 GPT Summary- 最先端のコーディングエージェントは、完全な文脈では複雑なタスクをこなせるが、不完全な仕様では失敗する。ボトルネックは能力よりも判断力であり、適切な行動と助けを求めるタイミングを知ることが重要である。提案するHiL-Benchは、この選択的エスカレーション能力を評価し、ブロッカーを含むタスクを通じて人間の判断力を測定する。核心指標Ask-F1は、質問の正確さとブロッカーの再現率を評価し、不適切な質問を防ぐ。評価結果は、モデルが不確実性に適切に対処できず、自己修正能力に欠けることを示す。強化学習による訓練で、判断力の向上が確認され、モデルは不確実性を検知し対処する能力を学ぶ。 Comment
元ポスト:
完全情報の下では80%前後の成功率をおさめるにも関わらず、情報が欠落している場合は成功率が著しく低下することから、現在のAI Agentが失敗する要因は、能力ではなく情報が不完全な場合にエスカレーションする判断力にあることを指摘し、必要な情報が欠落したタスクを用意し、その情報を取得するための質問(エスカレーション)を適切なタイミングで生成できるか否かを測定するベンチマークを作成し、ベンチマークでの評価を通じて、エスカレーションのための判断能力はRLVRによって向上させられることを示した、という感じの話に見える。
[Paper Note] Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark, Kai Zou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ACL #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- Uni-MMMUを提案し、視覚的理解と生成の統合を推進するための新しいベンチマークを構築。科学、プログラミング、数学、パズルなどの推論中心ドメインにおいて、生成と理解の相乗効果を評価。モデルは概念的理解を視覚合成に、生成を分析的推論に活用するタスクに挑む。再現可能な評価プロトコルを導入し、モデル間の性能差と依存性を明らかにし、統合モデルの進展に貢献。 Comment
pj page: https://vchitect.github.io/Uni-MMMU-Project/
元ポスト:
processとresultの両面を評価できるのが特徴のように見える
[Paper Note] CL-bench Life: Can Language Models Learn from Real-Life Context?, Shihan Dou+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #read-later #Reference Collection Issue Date: 2026-05-06 GPT Summary- 実生活のコンテキストを扱うAIアシスタントの学習能力が注目されているが、混沌とした現実の状況を理解することは依然困難である。これを評価するために、405のコンテキストとタスク、および5,348の検証ルーブリックから成るCL-bench Lifeが提案された。このベンチマークは、複雑な実生活のシナリオを網羅し、10種の最先端言語モデルを評価した結果、最高でもタスク解決率は19.3%にとどまり、モデル間の平均は13.8%となった。CL-bench Lifeは、実生活のコンテキスト学習を進展させるための重要なステップとなり得る。 Comment
元ポスト:
[Paper Note] AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite, Bragg+, Ai2, ICLR'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #ScientificDiscovery #ICLR #Science #Author Thread-Post Issue Date: 2026-05-01 Comment
openreview: https://openreview.net/forum?id=M7TNf5J26u
元ポスト:
[Paper Note] WorldMark: A Unified Benchmark Suite for Interactive Video World Models, Xiaojie Xu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #read-later #Selected Papers/Blogs #WorldModels #interactive Issue Date: 2026-04-26 GPT Summary- WorldMarkは、インタラクティブなImage-to-Videoワールドモデルのための初の共通ベンチマークを提供。これにより、6つの主要モデルを同一条件下で比較可能にするためのアクションマッピング、500件の評価ケースを含むテストスイート、およびモジュール式の評価ツールキットを提供。すべてのデータとコードは公開され、オンラインプラットフォームでのリアルタイム対戦も可能。 Comment
pj page: https://alaya-studio.github.io/WorldMark/
元ポスト:
interactiveなWorldModelsを統一的に評価できる評価スイートなようなので、こういった研究はこれまでにないような気がしており、重要研究に感じる。
[Paper Note] Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks, Yuqing Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Personalization #memory #KeyPoint Notes #Clustering-based #Reading Reflections #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 異質な記憶を保持するためのLLMベースのアシスタントの必要性に対して、\textbf{BEHEMOTH}というベンチマークを導入。18のデータセットを再利用し、タスクごとの有用性を評価する。実証分析により、均質なプロンプトが効果的でないことが確認され、\textbf{CluE}を提案。これは訓練例をクラスタに分け、各クラスタを独立に分析することで、抽出プロンプトを効果的に更新し、BEHEMOTHで実験した結果、従来の方法よりも一般化能力が向上したことを示した。 Comment
元ポスト:
現在のAI Agentのメモリは同種のタスクに対して構築され評価されるが、実際の環境、特によりpersonalizationが進んだ状況下では、さまざまな異質なユーザの会話を単一のエージェントが扱い、ユーザのリクエストに応じて適切にメモリからcontextを抽出できなければならず、このような能力を測定するベンチマークは存在しない。
このため、ベンチマークを構築し既存のメモリ手法(promptingベースの手法)を評価したところ、LLMがメモリをmanageする際に、単一のmemory抽出のプロンプトや、自己進化ベースのpromptingではうまくいかないことがわかった。
提案手法 (CluE) では、各サンプルごとに背後にあるシナリオ(どのような情報が欲しいのか, 抽出時にどのような点がchallengingなのか等)をsummarizerにより解釈し、シナリオ単位でクラスタリング。個々のクラスタを分析することで、クラスタごとにどのような場合に成功/失敗するのか等を分析しクラスタ単位のrecommendationを得る。最終的に、クラスタ間のrecommendationを統合して構造化された一つの抽出promptに仕立てる。このとき、競合がある場合は適切なメモリグループにスコープを絞り解決する、といった手法のようである。
既存手法と比較してCluEによって抽出性能が向上
問題設定が実践的でおもしろい
[Paper Note] PLaMo 2.1-VL Technical Report, Tommi Kerola+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #SmallModel #Japanese #read-later #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 自動運転向けの軽量なVision Language Model(VLM)PLaMo 2.1-VLを紹介。8Bと2Bのバリアントがあり、日本語対応のエッジ展開が可能。視覚質問応答に特化し、工場タスク分析とインフラの異常検知で評価。日本語のトレーニングリソースを整備し、JA-VG-VQA-500で61.5のROUGE-L、Japanese Ref-L4で85.2%の精度を達成。工場で53.9%のゼロショット精度、ファインチューニングにより異常検知のF1スコアが39.7から64.9に改善。 Comment
関連:
- GENIAC第3期で自律稼働デバイス向けの軽量な大規模視覚言語モデルPLaMo 2.1-8B-VLを開発, PFN, 2025.12
元ポスト:
[Paper Note] PlayCoder: Making LLM-Generated GUI Code Playable, Zhiyuan Peng+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SoftwareEngineering #ComputerUse #GUI #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- GUIアプリケーションの生成において、従来の評価方法が不十分である中、本研究は多言語対応のベンチマークPlayEvalを提案。これにより、ユーザー操作に基づく評価が可能となる。Play@kという指標で実行可能な生成候補を測定し、LLMベースのエージェントPlayTesterを開発して、タスク指向の評価を自動化。実験では最先端のコードLLMが論理的なGUIアプリケーションの生成に大きな課題を抱えていることが判明。これに対処するための多エージェントフレームワークPlayCoderを提示し、性能を大幅に向上。ケーススタディでは潜在的な論理バグの発見と修正の効果を示す。 Comment
元ポスト:
[Paper Note] LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech, Fei Yang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #SpeechProcessing #LongContext #AudioLanguageModel #ICASSP #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- LongSpeechは、長時間音声処理のための大規模なベンチマークで、10万件超の約10分の音声セグメントを含む。ASRや音声翻訳、要約など多様なアノテーションがあり、長時間音声の性能評価を促進。初期の実験では、モデルが特定のタスクに特化し、他を犠牲にしていることが示された。これにより、ベンチマークの挑戦的な特性が明らかにされ、今後の研究に貢献する予定である。 Comment
元ポスト:
dataset: https://huggingface.co/datasets/AIDC-AI/Marco_Longspeech
[Paper Note] LinuxArena: A Control Setting for AI Agents in Live Production Software Environments, Tyler Tracy+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Safety #SoftwareEngineering #Live #Sabotage Issue Date: 2026-04-20 GPT Summary- LinuxArenaは、エージェントが実稼働環境で操作するための制御設定で、20の環境、1,671の主要タスク、184の安全性に関するサイドタスクを含みます。妨害評価を通じて、主要タスクを完了しつつサイドタスクを処理できるかを検証し、GPT-5-nanoのモニターが1%の偽陽性率で多数の未検出妨害成功率を示しました。また、人手作成の攻撃軌跡データセットLaStrajを公開し、現行の攻撃方針がLinuxArenaに影響を与えていないことを示しました。これにより、LinuxArenaが攻撃者と防御者双方にとって重要な研究基盤となることが示唆されました。 Comment
元ポスト:
[Paper Note] GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents, Mingyu Ouyang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #MultiModal #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Game #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment
元ポスト:
Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは
という感想を持っているからである。
pj page: https://gameworld-project.github.io/
[Paper Note] Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization, Qiyao Ma+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Personalization Issue Date: 2026-04-17 GPT Summary- 報酬モデル(RMs)の個別化評価が未解決の課題である中、Personalized RewardBench(PRB)という新しいベンチマークを導入。これにより個々のユーザーの嗜好を厳密にモデル化する能力を評価。人間の評価では、両応答が一般的な品質を維持しつつ、嗜好の識別が個別に調整され、既存の報酬モデルは個別化に苦戦していることが明らかに。PRBは下流タスクにおいて既存の性能と比べて高い相関を示し、報酬モデルの評価における信頼性のある指標として確立された。 Comment
元ポスト:
[Paper Note] LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning, Sumeet Ramesh Motwani+, ICML'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Chain-of-Thought #Reasoning #ICML #read-later #Selected Papers/Blogs #LongHorizon #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LongCoTを導入し、複雑な推論能力を測定するための2,500問の専門家設計問題からなるベンチマークを提供。問題は数万から百数万の推論トークンを含む相互依存の手順を要求し、最先端モデルは全体で<10%の精度であることが示され、長期推論の限界が明らかになる。LongCoTは、モデルの長時間にわたる安定した推論能力を評価する指標となる。 Comment
元ポスト:
著者ポスト:
[Paper Note] JaWildText: 日本語文字認識性能評価のための 実世界画像データセット, 前田+, NLP'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #Japanese #Selected Papers/Blogs #VisionLanguageModel #OCR #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-14 Comment
元ポスト:
OCRは非常に重要なタスクであり、特に日本語OCR向けのwildなデータセットは、日本側が主体的に作らないとグローバル側では作成されない気がしており、非常に重要な研究と感じる。実際、現行のSLMのSoTAモデル群ではうまくいかないようだ。
Sarashinaは日本語のOCR向けにプロプライエタリなデータセットを作成して学習されていると記憶しており、それでもなおQwen3-VLの方がベンチマークスコアが高いのは意外だった。
関連:
- Sarashina2.2-Vision-3B: コンパクトかつ性能が高いVLMの公開, SB Intuitions, 2025.11
- sarashina2-vision-{8b, 14b}, SB Intuitions, 2025.03
[Paper Note] ClawBench: Can AI Agents Complete Everyday Online Tasks?, Yuxuan Zhang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Generalization #VisionLanguageModel #Live #One-Line Notes #Environment Issue Date: 2026-04-11 GPT Summary- ClawBenchは、次世代AIエージェントを評価するための153の簡単なタスクからなるフレームワークを提供。これにより、ユーザーからの情報取得や多段階ワークフローのナビゲーション、高度なフォーム記入といった複雑なタスクを評価可能。従来の静的なベンチマークと異なり、実際のウェブサイトで動作するため、現実的な評価を可能にする。評価では、商用・オープンソースモデルがタスクの一部しか完了できないことが示され、AIエージェントの汎用性向上に寄与することが期待される。 Comment
元ポスト:
pj page: https://claw-bench.com
実際のwebsiteに対して、日常的なオンラインでの153タスクを実行しweb agentを評価可能なフレームワークな模様。既存のオフライン、かつサンドボックスなベンチマークでは75%程度のスコアを達成していたGPT-5.4が、6.5%までスコア低下。
タスク性能の可否は、タスクのinstruction, 人間によるreference actionとpayload, エージェントの実際のactionとpayloadを与えて、AgenticなAIによって、ルーブリックに基づいて判断されるようである(Figure7)。
github: https://github.com/reacher-z/ClawBench
タスクinstructionの一覧は下記:
https://github.com/reacher-z/ClawBench/tree/main/test-cases
たとえば、UberEatsでパッタイをピーナッツ抜きで一つ注文する、といったタスクがある。
[Paper Note] The Art of Building Verifiers for Computer Use Agents, Corby Rosset+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #ComputerUse #read-later #Selected Papers/Blogs #Verification #Rubric-based Issue Date: 2026-04-11 GPT Summary- CUA軌跡の検証は評価信号の信頼性に不可欠である。本研究では、ノイズを減らしたルーブリックの構築、プロセスと成果報酬の分離、失敗の制御、文脈管理スキームの導入を行い、Universal Verifierを設計。新しいCUA軌跡集合CUAVerifierBenchでの検証により、人間の合意に匹敵する精度を示し、偽陽性率をほぼゼロに低減。自動研究エージェントは専門家の品質を70%達成するが、Universal Verifierの戦略発見には失敗。システムとデータセットはオープンソースとして公開。 Comment
元ポスト:
[Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #LongHorizon Issue Date: 2026-04-11 GPT Summary- APEX-Agentsは、投資銀行アナリストや弁護士などの長期タスクをAIエージェントが遂行できるかを評価するベンチマークです。現実的な職場環境でのナビゲーションを要求し、8つのエージェントをPass@1でテスト。Gemini 3 Flashが24.0%のスコアで最優秀、続いてGPT-5.2、Claude Opus、Gemini 3 Proが続きます。全てのプロンプトやメタデータはオープンソース化され、評価インフラのArchipelagoも公開されます。
[Paper Note] JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation, Issa Sugiura+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #QuestionAnswering #Japanese #VisionLanguageModel #2D (Image) Issue Date: 2026-04-07 GPT Summary- 日本語のVQAベンチマークの信頼性向上のため、JAMMEvalを導入。7つの既存データセットを人間アノテーションで精査し、データ品質向上。オープンウェイトとプロプライエタリVLMを評価し、モデル能力を正確に反映する評価スコアを生成。データセットとコードを公開し、VLM評価の信頼性を進展。 Comment
HF: https://huggingface.co/datasets/llm-jp/JAMMEval
元ポスト:
[Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #Planning #read-later #One-Line Notes #LongHorizon Issue Date: 2026-04-04 GPT Summary- LLMエージェントの戦略的一貫性の維持に関する課題を評価するため、YC-Benchを導入。シミュレートされたスタートアップを通じて、誤った意思決定の累積影響を調査。12モデルを比較した結果、Claude Opus 4.6が平均1.27百万ドルの資金で最高成績を収め、一貫して成功したモデルは3つのみ。特にスクラッチパッドの使用が成功に大きく寄与し、敵対的なクライアントの検出が主な失敗因として浮かび上がった。全体として、モデルの固有の故障モードが長期的なパフォーマンスにおける能力のギャップを明らかにした。YC-Benchは再現性と設定可能性を備えたオープンソースのベンチマークである。 Comment
pj page: https://collinear-ai.github.io/yc-bench/
元ポスト:
スタートアップの経営を通じてAI Agentをlong horizonの計画、実行能力を評価するような枠組みらしい。
[Paper Note] CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation, Max Fu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #AIAgents #Coding #SoftwareEngineering #read-later #Robotics #EmbodiedAI Issue Date: 2026-04-04 GPT Summary- Code-as-Policy(CaP)は、自律的なロボット制御における実行可能なコードの有効性を探求するためのフレームワークCaP-Xを提案します。中心となるCaP-Gymは、感知と制御を組み合わせてロボットを制御するインタラクティブ環境を提供します。CaP-Benchを利用して12モデルを評価した結果、手作りの抽象化が性能を向上させる一方、先入観の排除で性能が低下し、設計者の足場に依存していることが明らかになりました。このギャップは、推論時計算や複数ターンの相互作用を通じて緩和可能です。これにより、学習を要しないCaP-Agent0が活用され、シミュレーションや実機タスクで人間レベルの信頼性を回復させます。CaP-RLを導入することで強化学習が成功率を向上させ、シミュレーションと実機間の移行を円滑にすることを確認しました。CaP-Xは、具現化されたコーディングエージェントを推進するためのオープンアクセスプラットフォームを提供します。 Comment
元ポスト:
[Paper Note] PRBench: End-to-end Paper Reproduction in Physics Research, Shi Qiu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #ScientificDiscovery #Reproducibility #Physics Issue Date: 2026-04-04 GPT Summary- 大規模言語モデルを用いたAIエージェントは、科学研究タスクを支援するが、実際の科学論文からの再現性に課題がある。PRBenchを導入し、物理学の専門家が選んだ30のタスクに基づき、エージェントが論文の方法論を理解し、アルゴリズムを実装する能力を評価。エージェントは指示と論文内容のみを使い、実行環境で動作。評価の結果、GPT-5.3-Codexが最も高いスコアを得るも、全エージェントの再現成功率はゼロで、誤実装やデバッグ不能の問題が確認された。PRBenchは自律的な科学研究の進展を評価するための厳格な基準を提供する。 Comment
元ポスト:
[Paper Note] HippoCamp: Benchmarking Contextual Agents on Personal Computers, Zhe Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Search #Dataset #AIAgents #Personalization #MultiModal #VisionLanguageModel #One-Line Notes #Environment Issue Date: 2026-04-04 GPT Summary- HippoCampは、エージェントのマルチモーダルファイル管理能力を評価する新しいベンチマーク。ユーザー中心の環境でエージェントを評価し、個々のユーザープロファイルをモデル化し、膨大な個人ファイルを検索。42.4 GBに及ぶ2,000件以上の実世界ファイルから581のQAペアを構築し、エージェントの検索や推論能力を評価。最先端のマルチモーダル大規模言語モデルは、ユーザープロファイリング精度が48.3%に留まり、個人ファイルシステムにおける検索や推論に苦戦。HippoCampは、現行エージェントの制約を浮き彫りにし、次世代AIアシスタント開発の基盤を提供。 Comment
pj page: https://hippocamp-ai.github.io/
元ポスト:
「私の水曜日の予定はなんですか?」といったような、user-centricなタスクにおける、ユーザ個人のcontextを含むファイル検索やプロファイリング、reasoningを必要とする、よりuser-centricな情報を扱う必要があるベンチマークのようである。ユーザのプロファイルやpersonal情報が格納されたEnvironmentが提供されている。
environment: https://hippocamp-ai.github.io/hippocamp/
[Paper Note] World Reasoning Arena, PAN Team+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Planning #Reasoning #read-later #Selected Papers/Blogs #WorldModels #LongHorizon #Simulation #Arena Issue Date: 2026-03-30 GPT Summary- WR-Arenaは、ワールドモデル(WMs)の評価を進化させるための包括的なベンチマークであり、次状態予測と視覚的忠実度に限らず、知的行動に必要なシミュレーション能力を検証します。三つの基本次元に焦点を当て、アクションシミュレーション忠実度、長期予測、シミュレーション推論と計画を評価します。多様なデータセットを使用して、既存モデルと人間レベルの推論との間のギャップを明らかにし、次世代WMsの指針を提供します。コードはhttps://github.com/MBZUAI-IFM/WR-Arenaで入手可能です。 Comment
元ポスト:
[Paper Note] Rich Insights from Cheap Signals: Efficient Evaluations via Tensor Factorization, Felipe Maia Polo+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Initial Impression Notes #Author Thread-Post Issue Date: 2026-03-25 GPT Summary- プロンプトの性能を細粒度で評価するため、安価な自動評価データと限られた人間によるゴールドスタンダードラベルを統合した新しい統計モデルを提案。自動評価スコアを基に生成モデルの潜在表現を事前学習し、小さな較正セットで人間の嗜好に整合。これにより、標準ベースラインを上回る精度で人間の嗜好を予測し、詳細なリーダーボードの構築やモデルのパフォーマンス推定が可能になることを示す。 Comment
元ポスト:
少量の人間ラベルとLLMによって合成されたraterでテンソルを作り(モデル、prompt, rateのテンソル)を行列分解することで、効率的に(=人間のrateはscarceなので行列分解を通じて潜在表現に落としてサンプル効率を高める、というより次元の呪いを回避する?)単一のスコアでのモデル評価ではなく、様々な異質のpromptの元でのスコアリング(=finegrained evaluation)を実現する、という話に見える。
[Paper Note] DatBench: Discriminative, Faithful, and Efficient VLM Evaluations, DatologyAI+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #Dataset #IRT #VisionLanguageModel Issue Date: 2026-03-21 GPT Summary- 基盤モデルの評価は研究の進展に不可欠だが、視覚言語モデル(VLM)の評価法は未成熟である。評価が満たすべき三つの条件(忠実性、識別性、効率性)を提案し、複数選択形式や盲目的に解ける問題、誤ラベルのサンプルがモデル評価に与える影響を分析。生成タスクへの変換やサンプルのフィルタリングを行うことで、能力の正確な識別と計算コストの削減を実現。DatBench-Fullを公開し、識別力を保ちながら速度を大幅に向上させることを目指した。この研究は、VLMの進化に合わせた持続可能な評価実践の方向性を示す。 Comment
LLMの評価はコストがかかるため、フルデータではなくサブセットで適切な評価結果が得られると嬉しい。既存のアプローチはrank correlationと呼ばれる手法が用いられ、これはフルデータで評価したモデルのランキングとサブセットで評価したモデルのランキングの相関を測ることでサブセットの評価をする。しかしこの手法には特定の評価suiteにoverfitしやすいという欠点がある。これを是正するためにIRTだぽいアプローチを採用(Raschモデルなどの一般的なIRTとしての定式化ではなさそうな点には注意)して、識別力の高いサンプルを選択してサブセットを構成する手法を提案しているとのこと。直感的にはモデル全体の平均正答率に対して、個々のモデルの平均正答率の分散が小さく、かつモデル全体の正解する確率と不正解となる確率の差分が大きいものを識別力が高いサンプルとみなす。要は強いモデルが一貫して正解し、弱いモデルが一貫して不正解となるサンプルを識別力が高いとみなす。
といった話が元ポストに書かれている。
元ポスト:
[Paper Note] InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation, Yu Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #read-later #Personality Issue Date: 2026-03-20 GPT Summary- 大規模言語モデルによる性格シミュレーション評価には、実際のインタビュー内容を基にした手法が必要。提案した評価フレームワークは、著名人の23,000件のインタビューから671,000件の質問-回答ペアを抽出し、内容の類似性、事実的一貫性、性格適合、事実知識の保持を評価。実際のインタビュー情報を用いることで、伝記的プロフィールやパラメータ知識に依存する手法よりも優れた結果を示す。評価は、原則的な手法選択を可能にし、実践的な洞察を提供。 Comment
元ポスト:
おもしろそう
[Paper Note] vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models, Suhwan Choi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#read-later #VisionLanguageActionModel Issue Date: 2026-03-20 GPT Summary- VLAモデルの評価におけるコーディングの重複や依存性の衝突を解決するため、vla evalを提案。これはオープンソースの評価ハーネスで、WebSocketとmsgpackを活用し、Docker環境でモデル推論とベンチマーク実行を分離。モデルは単一のpredict()メソッドで統合され、統一されたインターフェースにより、評価マトリクスが自動生成される。評価は2つのコマンドで実行可能で、13のシミュレーションと6つのモデルサーバをサポート。エピソードシャーディングとバッチ推論により47倍のスループット向上を実現。再現性監査では、3つのベンチマークで公開された値を概ね再現し、未記載要件や結果を歪める可能性のある隠れた統計を特定。657件の公開結果を集約したVLAリーダーボードも発表。 Comment
元ポスト:
[Paper Note] LMEB: Long-horizon Memory Embedding Benchmark, Xinping Zhao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #memory Issue Date: 2026-03-17 GPT Summary- メモリ埋め込みの重要性を踏まえ、長期的なメモリ検索能力を評価するための長期視点のメモリ埋め込みベンチマーク(LMEB)を提案。22のデータセットと193のゼロショットタスクを包含し、複数のメモリタイプに基づく評価を行う。結果は、LMEBの難易度適切性やモデルのパフォーマンスに関する新たな洞察を示し、長期的メモリ検索における埋め込みモデルの進展を促進することを目指す。詳しくは https://github.com/KaLM-Embedding/LMEB を参照。 Comment
元ポスト:
[Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #Environment #autoresearch/RSI Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment
pj page: https://posttrainbench.com/
元ポスト:
[Paper Note] SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration, Jialong Chen+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #One-Line Notes #CI Issue Date: 2026-03-07 GPT Summary- 静的なバグ修正だけでなく、複雑な要求変更に対応するため、継続的インテグレーションに基づく新しいベンチマークSWE-CIを提案。これにより、コード生成の評価が短期的な正確性から長期的な保守性にシフトし、100のタスクを通じてエージェントの分析およびコーディング能力の維持を評価する。SWE-CIは実世界の進化履歴に基づいており、コード品質の長期的な維持についての洞察を提供。 Comment
元ポスト:
SWE Agentの現在の主要な評価パラダイムである個々の機能のバグフィクスなどの短期的な評価から、より長期的なメンテナンスなどのタスクで評価をする
[Paper Note] How Well Does Agent Development Reflect Real-World Work?, Zora Zhiruo Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-03-04 GPT Summary- AIエージェントの開発は、労働市場のベンチマーク上で進められているが、その代表性は不明である。本研究では、43のベンチマークと72,342のタスクを分析し、エージェント開発と米国労働市場の職業との整合性を測定。プログラミング重視の開発と人間労働の価値の乖離を指摘し、エージェントの自律性を評価することで実用的な指針を提供。最後に、社会的に重要な労働を捉えるベンチマーク設計のための3つの原則を提案。 Comment
元ポスト:
AI Agentのベンチマークは実際の人間の労働に本当に紐づいたタスクで評価されているのか?という疑問に答えてくれる研究のようで、実際のAI Agentのベンチマークと人間の業務、それらのcapitalをマッピングしたところ、現在のAI Agentのベンチマークは過剰に数学とコーディングドメインに偏っており、実態としての人間の労働や、それらの中でcapitalが集中しているドメインに対するカバレッジが大きく不足していることがわかった。
ドメインごとに見ると、デジタル化がされていて高付加価値のドメインのいくつか(マネジメントや法務)のベンチマークは少なく、スキルをベースに見るとベンチマークは情報取得やエンジニアリングといった狭いスコープばかりに焦点が当たっていて(これらの人間の労働に占める割合は<7%にすぎない)、多くの他のスキルが無視されている状況とのこと。
また、エージェントの自律性を細分された尺度で評価するために、どの程度のレベルの複雑さのタスクであればreliableにagentがこなせるかという観点を導入し、タスクの複雑性に関するスケールを導入し比較を可能にした、といった話が元ポストに書かれている。
現在提供されているベンチマークにおいて、おそらくタスク全体のうちの個別のサブタスクごとに複雑度をラベル付けして、複雑度を軸にサブタスクの成功/失敗をtrajectoryから分析することで、タスクの複雑度を軸に成功率を分析したグラフを見ると、タスクの複雑度に対して基本的にはどのドメイン、スキル、エージェントフレームワーク、バックボーンモデルであれ複雑度な上がれば上がるほど成功率は減少していく傾向にあり、成功率は最終的に20%--0%付近まで低下する。
最終的に、エージェントの評価ベンチマークにおいては、実際の労働に対するカバレッジ、現実的であること(=実際のドメインや必要となるスキルを捉えており、実タスク全体を捉えたようなものが必要でFigure4にベンチマークごとのドメインとスキルのカバレッジが可視化されている)、より粒度の細かい評価が必要(タスク全体の成功/失敗でのみ評価すると、タスクのどこまでできていたのか?という重要なシグナルが欠落する)であることが議論されている。
[Paper Note] CharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in Production, Yixin Nie+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Annotation #DPO #PostTraining #Selected Papers/Blogs #Personality Issue Date: 2026-03-04 GPT Summary- CharacterFlywheelは、Instagram、WhatsApp、Messenger向けのLLM改善のための反復プロセスであり、LLaMA 3.1を基に15世代のモデルを洗練しました。2024年7月から2025年4月にかけてのA/Bテストで、8モデル中7モデルが新たなエンゲージメント向上を示し、最大8.8%の幅、19.4%の深さで改善しました。指示遵守率も大幅に向上し、過学習防止策やダイナミクスの対策も考慮されています。この研究は、数百万人のユーザー向けのLLM活用における科学的理解を進めます。 Comment
元ポスト:
解説:
[Paper Note] AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications, Yujie Zhao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-03-01 GPT Summary- LLMを用いた自律エージェントの記憶において、実務的応用と評価基準の間にギャップが存在。これを解消するために、AMA-Benchを提案し、実世界のエージェント軌跡とQAを組み合わせて評価。多くの既存システムが因果性を欠き、類似性ベース検索に制約されている中、因果性グラフとツールを用いたAMA-Agentが性能を向上。AMA-AgentはAMA-Benchで57.22%の正解率を達成し、最強記憶システムのベースラインを11.16%上回る。 Comment
元ポスト:
実際のAgenticなタスクのユースケースに沿ったmemoryの評価方法を提案している研究のようで、非常に重要な研究に見える。実際はチャットベースのやり取りではなく、エージェントと環境が相互作用しながら生成されるtrajectoryで構成され、指示はagentによって生成された客観的な目的を含んでおり、trajectoryには多くのnoisyな結果やsymbolが含まれる。また、agentが現在のstateから環境に作用した結果が返ってくるというチャットベースの言語的なフロートは異なり、stateに基づいた因果関係が存在するという差がある。
ベンチマークの結果ではGPT-5.2が優れていそうに見えるが、GPTの場合は最新のGPT-5.2で評価されているのに、Claudeに関してはClaude Haiku 3.5で評価されているのは気になる。Claude Opus 4.6やGemini-3で評価したらどの程度の性能になるのだろうか。
著者ポスト:
[Paper Note] The Trinity of Consistency as a Defining Principle for General World Models, Jingxuan Wei+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Dataset #read-later #WorldModels Issue Date: 2026-02-28 GPT Summary- 世界モデルの構築は人工汎用知能の基本課題であり、Soraの動画生成モデルやUnified Multimodal Model (UMM)の進展がデータ駆動型の物理ダイナミクス近似の可能性を示している。しかし、一般的な世界モデルに必要な理論フレームワークは未整備である。本研究では、世界モデルが整合性の三位一体(モーダル・空間的・時間的整合性)に基づくべきと提案し、マルチモーダル学習の進化をレビュー。新たにCoW-Benchを導入し、これを用いて動画生成モデルとUMMを評価する。研究は一般的世界モデルへの道筋を確立し、現行システムの限界と将来のアーキテクチャ要件を明らかにする。 Comment
[Paper Note] Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs, Yining Hong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #ReinforcementLearning #PEFT(Adaptor/LoRA) #SelfCorrection #Test-Time Scaling #PostTraining #read-later #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-02-28 GPT Summary- 具現化されたLLMsは高レベルのタスク推論を持つが、過去の失敗を振り返れず、ミスが繰り返される独立した試行となる。この問題に対処するため、Reflection Test-Time Planningを導入し、二つの省察モードを統合。実行中の反省では内部評価を通じて候補アクションを生成し、実行後の反省では外部反省を基にモデルを更新。新たに設計したベンチマークで実験を行い、ベースラインモデルに対して有意な改善を示した。定性的分析では、反省を通じた行動の修正が強調された。 Comment
pj page: https://reflective-test-time-planning.github.io/
元ポスト:
- [Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09
まだ全然理解できていないが、Action Model, Internal reflection LLM, external reflection LLMとしてLLaVA 3Dと呼ばれるモデルをベースにし、単一のモデルで3種類のモードを学習するようである。そしてテスト時にはLoRAを用いたTTTを実施するようである。
[Paper Note] DISCO: Diversifying Sample Condensation for Efficient Model Evaluation, Alexander Rubinstein+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ICLR #read-later #Selected Papers/Blogs #EfficientEvaluation Issue Date: 2026-02-28 GPT Summary- 機械学習モデルの評価は高コストであり、従来のアプローチは二段階でサブセットを選び、精度を学習する。しかし、選択がクラスタリングに依存するため設計に敏感である。我々は、モデルの応答の多様性を最大化するサンプル選択が重要であると提唱し、$\textbf{DISCO}$手法を提案。これはモデル間の不一致を基にサンプルを選ぶもので、理論的にも最適であり、MMLUやHellaswagなどで最先端の性能を達成した。 Comment
pj page: https://arubique.github.io/disco-site/
元ポスト:
openreview: https://openreview.net/forum?id=SoOgBHa3dZ
[Paper Note] IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering, Connor Shorten+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Embeddings #InformationRetrieval #Dataset #QuestionAnswering #MultiModal #OCR #Hybrid Issue Date: 2026-02-27 GPT Summary- 画像ベースの情報検索と質問応答の性能をテキストベースの手法と比較するために、IRPAPERSデータセットを用いて実験を実施。テキスト検索はRecall@1で46%を達成し、画像ベースは43%を達成。両手法は補完的で、マルチモーダルハイブリッド検索はRecall@1で49%の性能を示す。MUVERAを用いた画像埋め込みモデルの評価において、Cohere Embed v4が最も優れた性能を持つ。質問応答では、テキストベースのシステムが画像ベースより高い整合性を示し、複数文書検索が効果を発揮。両モダリティの限界と必要性を明確化。データセットと実験コードは公開。 Comment
元ポスト:
[Paper Note] Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?, Thibaud Gloaguen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #reading #Reference Collection #Initial Impression Notes #AGENTS.md Issue Date: 2026-02-27 GPT Summary- コーディングエージェントのタスク完遂性能を評価するため、LLMが生成したコンテキストファイルと開発者提供のファイルを用いた2つの設定を検討。結果、コンテキストファイルは成功率を低下させ、推論コストを増加させる傾向が見られた。両者はタスクの探求を促進するが、不要な要件がタスクを難化させるため、最小限の要件のみを記述することが推奨される。 Comment
元ポスト:
(現時点では)LLMによって自動生成されたコンテキストファイルは性能を劣化させ、inference costを増大させ、人間が作成したコンテキストファイルは性能を向上させる。コンテキストファイルによってoverviewを提供することを推奨しているものがあるが、性能向上には寄与しない。コンテキストファイルに従うことはより多くのthinkingを誘発し、結果的にタスクを難しくする。最小限のrequirementsのみを記述したものを使うことを推奨する、といった内容らしい?
関連:
best practiceは以下とのこと:
- # Writing a good CLAUDE.md, Kyle, 2025.11
解説:
非常にコンパクトにまとまっている。
解説:
解説:
[Paper Note] A Very Big Video Reasoning Suite, Maijunxian Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Dataset #Supervised-FineTuning (SFT) #Reasoning #mid-training #PostTraining #VideoGeneration/Understandings #3D (Video) #Author Thread-Post Issue Date: 2026-02-27 GPT Summary- ビデオ推論の能力を探究するため、100万本以上のビデオクリップを含む前例のないVBVRデータセットを導入。200の推論タスクを網羅し、既存データセットの約1000倍の規模で、評価フレームワークとしてVBVR-Benchを提示。これにより、ビデオ推論の研究における再現性と解釈可能性を向上させ、新規タスクへの応用の初期兆候を示す。VBVRは次の研究段階の基盤となる。データ、ツール、モデルは公開中。 Comment
pj page: https://video-reason.com/
元ポスト:
著者ポスト:
[Paper Note] CaptionQA: Is Your Caption as Useful as the Image Itself?, Shijia Yang+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #MultiModal #CVPR #Selected Papers/Blogs #VisionLanguageModel #2D (Image) #One-Line Notes #Initial Impression Notes #ImageToTextGeneration Issue Date: 2026-02-26 GPT Summary- 画像キャプションはマルチモーダルシステムにおける視覚コンテンツの代理表現として機能するが、キャプションが実際のタスクで画像の代わりになり得るかを評価する必要がある。そこで、新たにユーティリティベースのベンチマークCaptionQAを提案し、キャプションの質を下流タスクへの支援度で測定する。CaptionQAは四つのドメインにわたり、33,027件の詳細な多肢選択問題を提供し、キャプションが視覚情報を必要とする質問に対応する力を検証する。LLMによる評価により、キャプションの有用性が画像よりも最大32%低下することが確認され、CaptionQAはオープンソースとして公開される。 Comment
元ポスト:
興味深い研究。MLLMの性能をCaption生成を通じて評価している。
良いCaptionであればdownstream taskに活用した際により良い性能が得られるという仮定の元[^1]、MLLMの性能をAnswer=LLM(Question, Caption)で判断する。AnswerはMultiple Choice Questionであり、Cannot Answerなども含まれる。よりQAに対して適切に回答できるCaptionを生成できたMLLMが優れているというutility-basedな評価となっている。
MLLMに対してCaptionを生成する際は、Questionに関する情報は与えずに、画像の情報のみでCaptionを生成する(ように見える)。セクション9に記述されている通り、4種類のバリエーションのpromptを用いる(long, short, simple, taxonomy hinted)。
skim readingしかできていないのだが、脚注1に記述した通り、モデルによって実画像がgivenな状態とCaptionのみで評価した場合でgapの出方に差がある点と、そもそも到達しているスコアの絶対値の対比が出せる点が個人的に興味深い。これにより特定のMLLMが、画像とテキスト、どちらの情報を"理解"するのに優れているのか、あるいは理解した情報に基づいて"生成"するのに優れているのかも間接的に評価できるのではないかと感じる。たとえばGPT-5は他モデルと比べて双方の能力秀でているが、Gemini-2.5-Proは画像を考慮することは得意だが、画像からテキストを生成する能力は少し劣ることがGPT-5とのgapの差から伺える。GLM4.1-VやLLaVAなどは画像理解は得意だが、画像から重要な情報を生成する能力は大きく低いことがわかる。
同じdownstreamタスクを通じてgapを測定でき、かつ単にベンチマークのスコアという以上の一段深い情報が得られる点がこれまでと異なりおもしろいと感じる。
[^1]:実際、セクション5を見ると実際の画像を与えた場合とCaptionのみの場合で評価した場合でgapがあることが示されており、Captionが画像中のdownstream taskに対してrelevantな情報を完全に保持していないことが示唆される。また、モデルに応じてgapが異なっており、モデルによってCaption生成能力が大きく異なることが示唆される。
この評価のパラダイムは一段抽象化をすると、特定のモダリティの情報に対する理解力と、異なるモダリティに変換して生成する能力をdownstreamタスクを通じて観測することになり、Captionの場合は画像-テキスト間だが、他にも動画-テキスト、音声-テキスト、あるいはそれらの逆など、Omniモーダルなモデルの評価やUMMの評価に使えそうな話だな、と思うなどした。
[Paper Note] Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following, Tianyi Xiong+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #MultiModal #CVPR #VisionLanguageModel #2D (Image) Issue Date: 2026-02-24 GPT Summary- Multi-Critは、大規模マルチモーダルモデル(LMMs)の評価能力を測定するためのベンチマークであり、複数基準への適合性や判断信頼性を評価する。厳格なデータキュレーションを通じて収集された応答ペアは、オープンエンド生成と検証可能な推論タスクを含む。分析の結果、商用およびオープンソースモデルは多様な基準への適合に課題があり、ファインチューニングが視覚的根拠づけを高めるが、多元的基準判断に至らないことがわかった。Multi-Critは、信頼できるマルチモーダルAI評価の基盤を構築する。 Comment
元ポスト:
[Paper Note] Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens, Wei-Lin Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Metrics #NLP #LanguageModel #Reasoning #Test-Time Scaling #One-Line Notes Issue Date: 2026-02-23 GPT Summary- LLMが推論時に「深く考えるトークン」を特定し、計算量を定量化。これらのトークンの割合が正確さと一貫して相関することを示し、Think@nを導入して深く考えるトークンが多い生成を優先的に扱うことで推論コストを削減。自動一貫性と同等または上回る性能を実現。 Comment
reasoningの質をトークンの長さではなく、重要なトークンを基準に測定する。その上で重要なトークンの割合が小さいサンプルは早めに枝刈りすることでtest-time scalingの効率を向上させる手法を提案している模様。
[Paper Note] DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories, Chenlong Deng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #InformationRetrieval #Search #Dataset #LanguageModel #AIAgents #MultiModal #One-Line Notes Issue Date: 2026-02-18 GPT Summary- 既存のマルチモーダル検索システムはクエリと画像の関連性を独立して評価することを前提としているが、このアプローチは現実の視覚データの依存関係を無視している。これを解決するために、我々はDeepImageSearchを提案し、画像検索を自律的探査タスクとして再定義する。このモデルは文脈的手掛かりに基づき、視覚データの多段階推論を行いターゲットを特定する。相互に関連した視覚データ用のベンチマークDISBenchを構築し、文脈依存クエリの生成におけるスケーラビリティ課題を人的なモデル協働で解決するパイプラインも提案。また、モジュール型エージェントフレームワークと二重メモリシステムを用いて、堅牢なベースラインを開発した。実験により、DISBenchが先端モデルに対して重要な課題を示すことが明らかになり、次世代検索システムへのエージェント的推論の統合の必要性が強調されている。 Comment
元ポスト:
検索クエリが与えられた時に、Corpus中の画像中に含まれる情報を考慮しなければ検索できないような検索タスクとベンチマークDIBenchの提案。たとえば、白と青のロゴのイベントで、lead singerだけがステージに立っている画像、のような、白と青のロゴのイベントをCorpus画像から同定(クエリと画像の相互作用)→その上で当該イベントでソロでステージにlead singerが立っている画像を探す、といったような検索である。
proprietaryモデルだとClaude-4.5-Opusの性能がよく、次いでGemini-Pro-Previewの性能が良い。GPT5.2は大きく性能面で劣っている。OpenModelと比較すると、ClaudeはQwen3-VLやGLM-4.6Vの倍程度のスコアを獲得している(Table1)。
[Paper Note] HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam, Weiqi Zhai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents Issue Date: 2026-02-17 GPT Summary- HLE-Verifiedは、Humanity's Last Exam(HLE)の改訂版であり、ノイズの多い問題が評価に与える影響を軽減するために開発された。二段階の検証・修復プロセスを通じて、641件の検証済みアイテムと1,170件の改訂済みアイテムが生成され、残り689件は不確実性セットとして公開された。評価の結果、HLE-Verifiedは平均的な精度が7〜10パーセント向上し、特に誤りのあるアイテムでは30〜40パーセントの改善が見られた。このアプローチにより、モデル能力をより正確に測定することが可能となった。 Comment
元ポスト:
HLE:
- [Paper Note] Humanity's Last Exam, Long Phan+, arXiv'25, 2025.01
[Paper Note] SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks, Xiangyi Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Selected Papers/Blogs #KeyPoint Notes #AgentSkills #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-02-17 GPT Summary- LLMエージェントを強化する手続き知識のパッケージであるエージェントスキルの効果を測定するため、SkillsBenchを提案。これにより、86タスクを利用したキュレーション済みスキルと決定論的検証器を組み合わせたベンチマークを作成。各タスクはスキルなし、キュレーション済みスキル、自己生成スキルの3条件で評価。キュレーション済みスキルは合格率を平均16.2ポイント向上させるが、分野による効果の差が顕著。自己生成スキルは有意な利益をもたらさず、信頼性のある手続き的知識の自作が困難であることを示した。Focused Skillsは、包括的なドキュメンテーションを上回る効果を持ち、小型モデルがスキルを有することで大型モデルに匹敵する場合がある。 Comment
元ポスト:
Agent Skillsに関するベンチマーク。11種類の多様なドメインのタスクによって構成される。コーディングやソフトウェアエンジニアリングに留めらないのが特徴的に見える。
評価時は
- スキルがない場合
- スキルがある場合
- 自己生成したスキルを使う場合
の3種類で評価する。
ハーネスはClaude Code, Codex CLI, Genini CLIの3種類で評価し、モデルはGPT, Claude, Gemini系列のモデルを利用。takeawayは以下:
- skillsはタスクの性能を改善するが、モデルとハーネスの組み合わせでgainが大きく異なる
- Gemini CLIとGemini Flashが最高性能を達成
- スキルを自己生成しても性能向上に寄与しない(むしろネガティブな影響も見受けられる)
- 3種類のハーネスのうち
- Claude Codeが最も多くスキルを活用し、Claudeモデルは一貫してgainを得る
- Gemini CLIは最も高いraw performanceを達成
- 性能はcompetitiveだが、Codex CLIは必要なスキルの内容を取得しても、スキルを利用せず独立して処理してしまう頻度が高い
- skillによって得られるgainはドメインによって大きく異なる。事前学習時に馴染み薄いドメインほど、skillの導入による恩恵がでかい。
- skillの導入によって、タスクによっては性能が悪化するものもある。これはモデルがすでにうまく処理をする能力を持っているのに、スキルが提供されることでそれらがconflictすることに起因する可能性がある。
- タスクごとに、2--3個のスキルを提供するのが性能がよく、4+になるとgainが低下する
- スキルの定義はproceduralな知識をコンパクト(compact)あるいは詳細に記述したもの(detailed)が良く(i.e., 特定のことについて集中的に記述するもの)、徹底的に記述されたドキュメント(comprehensive)は性能が悪化する。
- SLM+skillによって、スキル利用なしのより大きなモデルを性能で上回ることができる
Agent skillsの効果について定量的に分析した初めての研究な気がしており、重要な研究だと思われる。AI AgentというとClaudeが優秀な印象が強いが(コーディングやソフトウェアエンジニアリングでの性能に基づく印象)、本ベンチマークでは多様なドメインで評価をしており、Gemini CLI+Gemini Flashが最も平均的な性能が高いのが興味深い。
pj page: https://www.skillsbench.ai/
著者による続報:
SkillsBenchがエージェントスキル評価のデファクトになったことと、1.1のローンチイベントについての話が言及されている。
[Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #Generalization #One-Line Notes #Initial Impression Notes #Contamination Issue Date: 2026-02-17 GPT Summary- LLMの訓練データがベンチマークのテストデータで汚染されると、分布外一般化にバイアスが生じる。従来のデコンタミネーション・フィルターは意味的重複を認識できず、私たちは「ソフト汚染」として訓練データの意味的重複を調査。Olmo3コーパスの解析から、汚染が広範囲に存在し、CodeForcesの78%、ZebraLogicの50%に意味的または厳密な重複を確認。また、ベンチマークデータの重複が訓練データに含まれることで性能が向上し、ファインチューニングが同じベンチマークの未使用データの性能も改善することが示された。これにより、最近のベンチマークの向上は本質的な能力向上とは異なる可能性があることを示唆している。 Comment
元ポスト:
n-gramマッチングによるデータのdeaontaminationは表層レベルでしか捉えられないので、意味的に等価なサンプルをdecontamgnationできず(=Soft Contamination)効果が薄く、意味的なレベルでのコンタミネーションは広範に存在し[^1]、それらサンプルが学習データに含まれるとheldoutされたテストベンチマークのスコアも改善してしまう(=本当に計りたい汎化性能を測れていない)という話をしっかり分析した研究に見え、非常に重要な研究に見える。
[^1]:Olmo3で検証しており、ZebraLogicテストセットの50%とexactに一致するデータが含まれ、CodeForcesのテストセットのうち78%のサンプルと意味的に一致したサンプルが一件以上存在したとのこと。
[Paper Note] SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents, Yujiong Shen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #SyntheticData #Science #KeyPoint Notes #LongHorizon #Environment #ToolUse Issue Date: 2026-02-17 GPT Summary- 科学的推論には高度なツール統合が必要だが、現行ベンチマークはその能力を十分に評価していない。これを解決するために、SciAgentGymを導入し、1,780個の分野特異的ツールを提供。SciAgentBenchでは、エージェント能力を初歩から長期的なワークフローまで評価。先進モデルも複雑な科学ツール使用に取り組むが、成功率は対話のホライズン拡大で急落。SciForgeというデータ合成手法を提案し、ツールアクションを依存グラフとしてモデル化。これによって、SciAgent-8Bはより大規模なモデルを上回り、科学ツール使用能力の転移を示す。次世代の自律的科学エージェントの可能性を示唆。 Comment
元ポスト:
long horizonタスクでのtool useに関するベンチマークおよび環境の提供と、graphベースでツールの依存関係を定義し活用することで、環境上での実行によってgroundingされた高品質データを合成する手法SciForgeを提案。
ベンチマークでの評価によって、フロンティアモデルでもlong horizonになるとタスク成功率が低下することが明らかになり、性能の低いモデルは同じツールや類似したツールの繰り返しの呼び出しをするなどの挙動があることが明らかになった(他にも詳細な失敗モードの分析などがされているように見える)。
また、合成データによるSFTによって8B級のSLMでも大幅に性能が改善している模様。
[Paper Note] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception, Lai Wei+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Dataset #MultiModal #Distillation #VisionLanguageModel #ThinkingWithImages Issue Date: 2026-02-16 GPT Summary- MLLMは視覚理解に優れていますが、微細な知覚には依然として課題があります。最近の手法「Thinking-with-Images」は局所情報を取り入れるもののレイテンシが高い。そこで、Region-to-Image Distillationを提案し、エージェント的ズーミングの利点を1回のフォワードパスに内在化します。マイクロクロップ領域で教師モデルにVQAデータを生成させ、それに基づく信号を全画像に蒸留。これにより、学生モデルはツールなしで微細知覚を改善。新たに提案するZoomBenchにより、モデルの性能を厳密に評価し、複数のベンチマークでトップクラスの成果を示します。さらに、思考の必要性とその利得を議論します。コードは公開されています。 Comment
元ポスト:
[Paper Note] Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments, Romain Froger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents Issue Date: 2026-02-16 GPT Summary- Gaia2は、大規模言語モデルエージェントを非同期環境で評価する新しいベンチマークです。静的または同期的評価と異なり、エージェントは動的に進化するシナリオで、時間的制約やノイズ、他のエージェントとの協力に適応することが求められます。各シナリオには、書き込みアクション検証器が関連付けられ、細かいアクション単位の評価が可能です。最近の評価結果では、GPT-5が最も高い成績を修得しましたが、時間に敏感なタスクでは失敗し、Claude-4は精度と速度をトレードオフする結果となりました。これらは推論、効率性、堅牢性のトレードオフを示し、実用的なエージェントシステムの開発と訓練を支援するインフラを提供することを目指しています。 Comment
元ポスト:
[Paper Note] First Proof, Mohammed Abouzaid+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Mathematics #ScientificDiscovery #Selected Papers/Blogs #Proofs Issue Date: 2026-02-16 GPT Summary- AIシステムの数学問題回答能力を評価するため、著者が作成した10の未公開の数学問題を共有。答案は著者に知られているが、短期間は非公開とする。 Comment
pj page: https://1stproof.org/
元ポスト:
ポイント解説:
自分たちの研究過程で生じた自分たちは答えを発見しているが世間には未発表な問題と暗号化された解答が公開されている。2月13日時点で鍵が公開されているようだ。果たしてどの程度AIは解答ができたのだろうか?
Google DeepmindのAlethiaは10個中6つの問題を解くことができたようである:
Alethia:
- [Paper Note] Accelerating Mathematical and Scientific Discovery with Gemini Deep Think, Google DeepMin, 2026.02
[Paper Note] GameDevBench: Evaluating Agentic Capabilities Through Game Development, Wayne Chi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Game Issue Date: 2026-02-16 GPT Summary- ゲーム開発におけるマルチモーダルなコーディングエージェントの評価が遅れている問題に対処するため、初のベンチマーク「GameDevBench」を提案。本ベンチマークは132の複雑なタスクで構成され、コード行数とファイル変更が平均3倍以上になる。最良のエージェントでも54.5%のタスクしか解決できず、成功率はタスクの種類によって大きく異なる。マルチモーダル能力を高めるために、画像およびビデオベースのフィードバックメカニズムを導入した結果、Claude Sonnet 4.5の性能が33.3%から47.7%に向上。GameDevBenchはエージェントによるゲーム開発研究を促進する。 Comment
元ポスト:
[Paper Note] Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition, Yuhao Dong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #In-ContextLearning #EMNLP #VideoGeneration/Understandings #VisionLanguageModel #3D (Video) Issue Date: 2026-02-10 GPT Summary- デモ駆動型ビデオインコンテキスト学習を提案し、ビデオに関する質問に対してインコンテキストデモから学ぶ新たなタスクを定義。1200本のYouTubeビデオを用いた「Demo-ICL-Bench」を作成し、テキストと動画のデモを提供。Demo-ICLモデルを開発し、ビデオ監督付きファインチューニングによってインコンテキスト学習能力を向上。実験によりベンチマークの難易度を検証し、モデルの性能を明示。 Comment
元ポスト:
[Paper Note] LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth, Weihao Zeng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #LongContext #LongHorizon #ContextRot Issue Date: 2026-02-10 GPT Summary- LLMは長期タスクの実行が向上する一方で、コンテキストが増えると信頼性が低下する「コンテキストロット」が問題に。これに対処するため、LOCA-benchを導入し、環境状態に応じてエージェントのコンテキスト長を調整。固定されたタスク意義の下でコンテキストを制御し、様々な管理戦略を評価。複雑な状態では相対的に性能が低下するが、高度な管理技術で成功率が向上。LOCA-benchはオープンソースで公開され、長コンテキストエージェントの評価プラットフォームを提供。 Comment
元ポスト:
[Paper Note] SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization, Jiarui Yuan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #ReinforcementLearning #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment
元ポスト:
関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。
APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。
[Paper Note] Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning, Yu-Ang Lee+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Coding #Mathematics #PEFT(Adaptor/LoRA) #PostTraining #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-02-09 GPT Summary- LoRAのバリエーションを広範なハイパーパラメータ探索で再評価。異なるLoRA方法は独自の学習率範囲を好み、適切調整で全体的に同様のピーク性能を達成。バニラLoRAは競争力のあるベースラインで、以前の改善は一貫性を欠く可能性あり。最適な学習率範囲の違いはヘッセ行列の固有値の変動に起因。 Comment
元ポスト:
LoRAに関連して様々な手法が提案されているが、様々なモデルスケールとコーディングと数学ドメインで広範な設定(バッチサイズや学習率)で実験して主要な手法を再評価したところ、LoRAは学習率にsensitiveで、依然として初期のLoRAが強力な手法であることが示された。過去の研究での比較実験はハイパーパラメータの調整不足な可能性が高いことを示唆している。重要研究。
なお、Table2にLoRAの変種に関する研究のリストがあるが、約50種類ある。
[Paper Note] Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening, Zhenxiong Yu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Safety #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-08 GPT Summary- 「Spider-Sense」と呼ばれるイベント駆動型防御フレームワークを提案し、エージェントが危険を認識した際にのみ防御を発動。階層的な防御メカニズムにより効率と精度をトレードオフしつつ、既知のリスクを軽量マッチングで解決し、曖昧なケースは内部推論に移行。新たなベンチマーク「S$^2$Bench」を用いた実験で、競争力のある防御性能と最低の攻撃成功率を示し、わずか8.3%の遅延オーバーヘッドを実現。 Comment
元ポスト:
従来のAI Agentのセキュリティチェックは決められたタイミングで、しばしば重いチェックがかかりレイテンシが高かったが、提案手法では動的にどの程度の計算量を費やすかを調整して、必要なタイミングで重い推論、そうでない場合は軽量なチェックで済ませることでレイテンシと性能を改善する、といったコンセプトな模様。
エージェントのステージごとにobservationを事前定義されたテンプレートで囲い、テンプレートによってスクリーニングをトリガーし、ベクトル検索によって危険度を判定する。判定した危険度が一定以下なら軽量なチェック、一定以上ならLLMによる推論を用いた重い処理を走らせるという手法に見える。図中のcのnotationが本文中に見当たらない気がするが、見落としているだろうか。
結局のところ、テンプレートによってセキュリティチェックが誘発されるように見えるので、元々の問題意識である固定されたタイミングで強制的にセキュリティチェックがかかる、という課題は解決されない気がする。固定されたタイミングで強制的にセキュリティチェックがかかる点は従来手法と変わらないが、セキュリティチェックに費やすコストや計算量を動的に変更します、という話に感じる。
[Paper Note] CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty, Johannes Kirmayr+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Ambiguity Issue Date: 2026-02-08 GPT Summary- 既存のLLMエージェントのベンチマークは理想環境でのタスク完了に偏っており、実際のユーザーアプリケーションでの信頼性を無視している。本研究では、車内アシスタント向けの「CAR-bench」を提案し、マルチターン対話やツール使用を通じた不確実性管理を評価する。この環境には、58の相互接続ツールが含まれており、「幻覚タスク」と「曖昧さ解消タスク」を導入してエージェントの能力をテスト。結果は、曖昧さ解消タスクでの一貫性が50%未満と低く、ポリシー違反や情報捏造が多発することから、より信頼性の高い自己認識を持つLLMエージェントの必要性を示している。 Comment
元ポスト:
[Paper Note] BABE: Biology Arena BEnchmark, Junting Zhou+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AcademicWriting #Biological Issue Date: 2026-02-06 GPT Summary- 生物学におけるLLMsの能力を評価するため、BABE(Biology Arena BEnchmark)を導入。これは実験結果を文脈知識と統合する能力を測定し、実世界の研究から構築された複雑な課題を提供。因果推論やスケールを超えた推論を促すことで、AIシステムの科学者としての推論能力を評価するフレームワークを提供し、生物学研究への貢献度を向上させることを目指す。 Comment
元ポスト:
[Paper Note] Synthesizing scientific literature with retrieval-augmented language models, Asai+, Nature'26, 2026.02
Paper/Blog Link My Issue
#Citations #InformationRetrieval #NLP #Dataset #LanguageModel #QuestionAnswering #RAG(RetrievalAugmentedGeneration) #ScientificDiscovery #read-later #Selected Papers/Blogs #Science Issue Date: 2026-02-05 Comment
元ポスト:
QAに対して専門家と同等のcitationに対するgrounding性能を達成し、citationに基づいたanswer (literature) を8Bモデルで生成可能で、マルチドメインの評価データも作成しているとのこと
benchmark: https://github.com/AkariAsai/ScholarQABench
[Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Reasoning #SelfCorrection #ICLR #read-later #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 言語モデル(LM)の自己改善能力を探るために、RefineBenchという1,000の問題と評価フレームワークを導入。二つの改善モード、ガイド付きと自己改善を評価した結果、最前線のLMは自己改善で低迷する一方、ガイド付き改善では特許LMや大規模オープンウエイトLMが迅速に応答を改善。自己改善には突破口が必要であり、RefineBenchが進捗の追跡に貢献することを示す。 Comment
元ポスト:
pj page: https://passing2961.github.io/refinebench-page/
verifiableはタスクだけでなくnon verifiableなタスクもベンチマークに含まれ、ガイド付き/無しの異なる設定、11種類の多様なドメイン、チェックリストベースのbinary classificationに基づく評価(strong LLMによって分類する; これによりnon verifiableなタスクでも評価可能)、マルチターンでの改善を観測できる、self-correction/refinementに関するベンチマーク。
フロンティアモデルでも自己改善はガイド無しの場合ではあまり有効に機能しないことを明らかにし、外部からガイドが与えられればOpenLLMでさえも少ないターン数で完璧に近い方向にrefineされる、という感じの内容に見える。
つまり自身とは異なるモデルで、何らかの素晴らしい批評家がいれば、あるいは取り組みたいタスクにおいて一般化された厳密性のあるチェックリストがあれば、レスポンスはiterationを繰り返すごとに改善していくことになる。
[Paper Note] Programming with Pixels: Can Computer-Use Agents do Software Engineering?, Pranjal Aggarwal+, ICLR'26, 2025.02
Paper/Blog Link My Issue
#ComputerVision #Dataset #AIAgents #Coding #ICLR #SoftwareEngineering #ComputerUse #VisionLanguageModel #GUI Issue Date: 2026-02-05 GPT Summary- CUA(コンピュータ利用エージェント)は一般的なタスクを実行する可能性があるが、ソフトウェアエンジニアリングのような専門的な作業の自動化能力は不明である。本研究では、「Programming with Pixels」(PwP)を導入し、エージェントが視覚的にIDEを操作して多様なソフトウェアエンジニアリングタスクを実行する環境を提供する。また、15のソフトウェアエンジニアリングタスクに対するベンチマーク「PwP-Bench」を設立し、CUAsの性能を評価した。結果、純粋な視覚的インタラクションでは専門エージェントに劣るが、APIへの直接アクセスを与えることで性能が向上し、専門性に達することが多かった。CUAsは視覚的基盤の限界と環境の効果的な活用に課題があるが、PwPは洗練されたタスクに対する評価の新たな基準を提供する。 Comment
pj page: https://github.com/ProgrammingwithPixels/PwP
元ポスト:
[Paper Note] Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models, Wenxuan Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #2D (Image) #DeepResearch #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- Vision-DeepResearchは、マルチモーダル大規模言語モデル(MLLMs)において、多ターン・多エンティティ・多スケールの視覚およびテキスト検索を実現する新しい深層研究パラダイムを提案。これにより、実際のシナリオでの視覚ノイズに対処し、数十の推論ステップと多くのインタラクションをサポート。強化学習を通じて深層研究能力を内在化し、既存のMLLMを上回る性能を発揮する。コードは公開予定。 Comment
pj page: https://osilly.github.io/Vision-DeepResearch/
元ポスト:
image searchやVQAなどを伴うDeepResearchに関するタスクとそのベンチマークの提案という感じに見える。
[Paper Note] Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models, Wei Liu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Open-endedTasks Issue Date: 2026-02-03 GPT Summary- エージェントの能力には、自律的に目標を設定し探求する「探求知能」が求められ、単なるタスク完了の「実行知能」とは異なる。データサイエンスは生データから始まるため、自然なテストベッドを提供するが、関連するベンチマークは少ない。これに対処するため、「Deep Data Research(DDR)」を提案し、LLMがデータベースから洞察を抽出するオープンエンドタスクと、評価を可能にするDDR-Benchを導入。最前線のモデルは新たなエージェンシーを示すが、長期的な探求は依然困難であり、探求知能はモデルの戦略に依存している。 Comment
元ポスト:
[Paper Note] Perplexity Cannot Always Tell Right from Wrong, Petar Veličković+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #Pretraining #Metrics #NLP #LanguageModel Issue Date: 2026-02-03 GPT Summary- パープレキシティはモデルの「驚き」を測る指標であり、損失関数や品質メトリックとして注目されている。しかし、トランスフォーマーの特性を基に、パープレキシティが適切なモデル選択指標でない可能性を示す。具体的には、特定の系列に低いパープレキシティが伴う場合、そのモデルが他の系列を正確に予測しないことを証明。また、等パープレキシティプロットの分析から、パープレキシティが必ずしも精度の向上を反映しないことも明らかにした。正確なモデル選択には自信の増加と精度の改善が必要である。 Comment
元ポスト:
[Paper Note] VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents, Zirui Wang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LongContext #VisionLanguageModel #interactive #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- 現代の視覚-言語モデル(VLM)は、複雑な視覚的相互作用において効果的に機能しておらず、特に長期的な知覚や記憶の統合に課題があります。これに対処するため、「VisGym」という17の環境を導入し、記号パズルやナビゲーションを含む多様な設定でモデルを評価・訓練します。実験では、最前線のモデルがインタラクティブな場面で苦戦していることが示され、長い文脈の活用に制限があることが明らかになりました。しかし、目標観察やテキストフィードバックによる微調整は、モデルの視覚的意思決定を改善する効果が確認されました。 Comment
pj page: https://visgym.github.io/
元ポスト:
このベンチマーク上のSoTAであるGemini 3 Proでも平均Acc.50%に到達しないinteractiveなVQAタスク群な模様
[Paper Note] PaperBanana: Automating Academic Illustration for AI Scientists, Dawei Zhu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Multi #ComputerVision #NLP #Dataset #AIAgents #DiffusionModel #VisionLanguageModel #2D (Image) #AcademicWriting Issue Date: 2026-02-03 GPT Summary- PaperBananaは、学術イラストの自動生成を実現するエージェントフレームワークであり、視覚言語モデルと画像生成モデルを活用しています。専門エージェントを調整して参照を取得し、コンテンツとスタイルを計画、画像をレンダリングし、批評を通じて洗練を行います。PaperBananaBenchを用いた評価では、多様なスタイルの292のテストケースにおいて、忠実性や美的感覚で主要なベースラインを上回る成果を示しました。これにより、高品質な出版準備の整ったイラスト生成が可能となります。 Comment
pj page: https://dwzhu-pku.github.io/PaperBanana/
元ポスト:
[Paper Note] DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation, Haozhe Xie+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Dataset #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #One-Line Notes #Manipulation Issue Date: 2026-01-31 GPT Summary- 動的オブジェクト操作に挑む「DynamicVLA」フレームワークを提案。畳み込み視覚エンコーダで迅速なマルチモーダル推論を実現し、連続推論で迅速な適応を促進。潜在認識アクションストリーミングにより認識と実行のギャップを埋める。新たに構築したDOMベンチマークで動的操作データを収集し、評価によって顕著な性能向上を示す。 Comment
pj page: https://www.infinitescript.com/project/dynamic-vla/
元ポスト:
動くオブジェクト(Donamic Object)に関するデータセットとベンチマークに見える。
既存VLAではできないそこそこな速度で転がるピンポン玉などを正確に掴むことができるようなデモが掲載されている。興味深い。
コードとデータセットが公開:
[Paper Note] Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models, Zengbin Wang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #DiffusionModel #TextToImageGeneration #read-later #Selected Papers/Blogs #SpatialUnderstanding Issue Date: 2026-01-31 GPT Summary- T2Iモデルの空間処理能力を評価する新しいベンチマーク「SpatialGenEval」を提案。1,230の長い情報密度の高いプロンプトを用いて、空間関係の推論が主なボトleneckであることを確認。また、「SpatialT2I」データセットを構築し、ファインチューニングによって現実的な空間効果を向上させるデータ中心のアプローチを強調。 Comment
元ポスト:
[Paper Note] WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World, Ao Liang+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Dataset #CVPR #read-later #Selected Papers/Blogs #WorldModels #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-01-30 GPT Summary- 生成的世界モデルはリアルな4D環境を合成しますが、物理的または行動的に失敗することが多いです。この課題に対処するため、WorldLensを導入し、生成された世界の評価を行う全範囲ベンチマークを提供します。これには生成、再構成、行動追従など五つの側面が含まれ、視覚的現実性や物理的妥当性を評価します。既存モデルには広範囲に優れたものがなく、WorldLens-26Kという大規模な人間注釈付きデータセットを構築し、評価モデルWorldLens-Agentを開発しました。これにより、世界の忠実性を測定する統一されたエコシステムを形成し、リアルな見た目と行動の両面で評価基準を標準化します。 Comment
pj page: https://worldbench.github.io/worldlens
元ポスト:
github: https://github.com/worldbench/WorldLens
(自動運転に関する)World Model(には限られないかもしれないが)を多角的な軸から評価できるベンチマーク。3D object detection/Tracking, Novel-view Discrepancy/Quality, Occupacy Prediction, Subject Fidelity/Consistency/Coherence, Temporal Concistencyなど、20以上のdimensionから評価可能なようである。
著者ポスト:
[Paper Note] Factuality Matters: When Image Generation and Editing Meet Structured Visuals, Le Zhuo+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Dataset #Factuality #DiffusionModel #ICLR #2D (Image) #Editing #UMM #ImageSynthesis Issue Date: 2026-01-30 GPT Summary- 構造化された視覚生成に特化した研究であり、高品質な構造画像データセットを構築。VLMとFLUXを統合したモデルを訓練し、推論能力を強化。新たな評価指標StructScoreを導入し、多段階Q&Aプロトコルで正確性を評価。モデルは強力な編集性能を示し、構造化視覚の統一基盤を目指す。 Comment
元ポスト:
[Paper Note] DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints, Yinger Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Planning #LongHorizon Issue Date: 2026-01-27 GPT Summary- 長期タスクのエージェント評価にはグローバルな制約最適化が欠けている中、DeepPlanningという新たなベンチマークを導入。これは、能動的な情報収集や局所的制約を含む旅行計画やショッピングタスクを対象とし、最先端のLLMでも難しいことを示す。エラー分析を通じて、エージェント型LLMの改善につながる方向性を指摘し、研究支援のためにコードとデータをオープンソース化。 Comment
元ポスト:
[Paper Note] Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs, Ryoma Sato, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel Issue Date: 2026-01-25 GPT Summary- 信頼性のあるLLMのためのゼロエラー・ホライゾン(ZEH)を提案。ZEHはモデルがエラーなしに解決できる範囲を示し、最先端のLLM評価に有用。GPT-5.2の評価では、単純なパリティや括弧のバランスを判断できないことが示され、安全性が重要な領域での教訓となる。Qwen2.5にもZEHを適用し、精度との相関があるものの、詳細な挙動は異なることが判明。計算コストを軽減するために、ツリー構造とオンラインソフトマックスを用いた速度向上の方法も検討。 Comment
元ポスト:
[Paper Note] CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning, Zhiyuan Lu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #RAG(RetrievalAugmentedGeneration) #LongContext #Selected Papers/Blogs #memory #Initial Impression Notes Issue Date: 2026-01-22 GPT Summary- CorpusQAは、最大1,000万トークンに対応する新しいベンチマークで、広範な非構造的テキストに対する全体的な推論を求める。これは、プログラムによって保証された真実の回答を持つ複雑なクエリを生成する革新的なデータ合成フレームワークを用いており、LLMの長期コンテキスト推論能力を向上させることが実証された。一方で、長い入力に対しては現行のリトリーバーシステムが限界を迎え、メモリ拡張型エージェントアーキテクチャがより効果的な解決策となる可能性が示唆された。 Comment
元ポスト:
10Mコンテキストまで性能を測定可能なベンチマークらしく、結果を見ると以下のようになっている。128KコンテキストではGPT5に軍配が上がり、1M級のコンテキストになるとGeminiがやはり強い(これは昔からそうでFiction.liveベンチなどでも示されていた)。
10Mコンテキスト級ではLLMのコンテキストウィンドウのみでは対応不可なので、RAGやMemory Agextでベンチマーキングされているが、明確にAgentの方が性能が良い。ベンチマークの細かな作り方や、harnessなど、具体的にどのような設定で実験されているのか気になる。
[Paper Note] Can We Predict Before Executing Machine Learning Agents?, Jingsheng Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Planning #read-later #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- 自律的な機械学習エージェントは「生成-実行-フィードバック」パラダイムに依存しているが、高価な実行に制約されている。本研究では、事前情報を内部化し、瞬時の予測的推論に置き換えることでこの問題を解決。データ中心のソリューションを形式化し、18,438のペア比較からなるコーパスを構築。LLMが高い予測能力を示し、61.5%の精度を達成。FOREAGENTエージェントは予測-確認ループを採用し、収束を6倍速め、実行ベースラインを6%上回る成果を達成。コードとデータセットは近日中に公開予定。 Comment
元ポスト:
(読了前の第一印象)問題設定や着眼点が実用的で興味深い。
[Paper Note] Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning, Chengwen Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #MultiModal #VisionLanguageModel #DeepResearch #3D (Video) #One-Line Notes Issue Date: 2026-01-14 GPT Summary- VideoDRは、ビデオを基にしたオープンドメインのビデオ質問応答のための新たな深層研究ベンチマークで、フレーム間の視覚的手がかり抽出やインタラクティブなウェブ検索、マルチホップ推論を要求する。高品質なビデオサンプルを提供し、複数のマルチモーダル大規模言語モデルの評価を行った結果、エージェントの性能はワークフローに依存することが示された。VideoDRは次世代ビデオ深層研究エージェントへの重要な課題を明らかにする。 Comment
元ポスト:
初めてのvideo deep researchベンチマークとのこと
[Paper Note] BabyVision: Visual Reasoning Beyond Language, Liang Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #Analysis #Dataset #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- MLLMは基本的な視覚タスクで人間、特に3歳児に劣る性能を示す。これを調査するために、視覚能力を評価する「BabyVision」ベンチマークを導入。388のタスクを通じて、MLLMのパフォーマンスが人間基準を大きく下回ることが確認された。具体的には、Gemini3-Pro-Previewが49.7点で、6歳や成人の平均94.1点に遠く及ばない。これにより、MLLMは基本的な視覚原理が不足していることが明らかにされ、BabyVision-Genと自動評価ツールキットも提案された。データとコードは公開されている。 Comment
pj page: https://unipat.ai/blog/BabyVision
元ポスト:
ポイント解説:
(読了前の第一印象)現在のMLLMが純粋な視覚的な推論タスクにおいて幼児以下であることを示し、既存のベンチマークの脆弱性(純粋な視覚的な推論能力を評価できていない)を指摘した上で新たなベンチマークを提案しているように見え、非常に重要な研究に見える。
[Paper Note] The Quest for Generalizable Motion Generation: Data, Model, and Evaluation, Jing Lin+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #SyntheticData #DiffusionModel #ICLR #Generalization #3D (Scene) #FlowMatching #Robotics #3D (Video) #HumanMotionGeneration Issue Date: 2026-01-11 GPT Summary- 3D人間動作生成(MoGen)は一般化能力に課題があるが、動画生成(ViGen)は優れた一般化を示す。これを受けて、ViGenからMoGenへの知識移転のためのフレームワークを提案。228,000の高品質な動作サンプルを含むデータセットViMoGen-228Kを作成し、MoCapデータとViGenモデルからの情報を統合したフローマッチングベースの拡散トランスフォーマーViMoGenを開発。さらに、動作の質や一般化能力を評価するための階層的ベンチマークMBenchを提示。実験結果は、提案手法が既存のアプローチを大幅に上回ることを示した。 Comment
dataset:
https://huggingface.co/datasets/wruisi/ViMoGen-228K
leaderboard:
https://huggingface.co/spaces/wruisi/MBench_leaderboard
元ポスト:
ポイント解説:
openreview: https://openreview.net/forum?id=KNke6Pkq4o
[Paper Note] RoboReward: General-Purpose Vision-Language Reward Models for Robotics, Tony Lee+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Dataset #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #RewardModel #Robotics #EmbodiedAI Issue Date: 2026-01-09 GPT Summary- 強化学習における報酬設計の重要性を踏まえ、実ロボティクスでの自動報酬モデルとしてのビジョン・ランゲージモデル(VLM)の効果を探求。新たに「RoboReward」データセットを導入し、成功例の反事実的ラベリングやネガティブ例データ拡張を通じて多様なタスクを網羅した訓練データを構築。評価の結果、既存のVLMには改善の余地があり、4Bおよび8Bパラメータモデルが短期タスクで優れた報酬を提供。最終的に、8Bモデルを実ロボット強化学習に適用し、人間提供の報酬とのギャップを縮小する成果を得た。データセットやモデルは公開されている。 Comment
元ポスト:
[Paper Note] The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality, Aileen Cheng+, NeurIPS'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Factuality #NeurIPS Issue Date: 2025-12-17 GPT Summary- 「FACTS Leaderboard」は、言語モデルの事実に基づいたテキスト生成能力を評価するオンラインリーダーボードで、4つのサブリーダーボードから成り立っています。これにより、画像質問、クローズドブック質問、情報探索、文書に基づく応答の事実性を測定します。各サブリーダーボードは自動審査モデルを用いてスコアを付け、最終スコアは4つのコンポーネントの平均で算出されます。このスイートは外部参加を可能にしつつ、整合性を保つために公開・非公開の分割を含んでいます。詳細はKaggleで確認可能です。 Comment
元ポスト:
[Paper Note] VisCoder2: Building Multi-Language Visualization Coding Agents, Yuansheng Ni+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LanguageModel #AIAgents #Coding #ICLR Issue Date: 2025-10-30 GPT Summary- 大規模言語モデル(LLMs)を用いた視覚化コーディングエージェントは、実行や修正において課題がある。これを解決するために、679Kの視覚化サンプルを含むデータセットVisCode-Multi-679K、自己デバッグ用のベンチマークVisPlotBench、そしてマルチ言語モデルVisCoder2を提案。実験結果では、VisCoder2がオープンソースのベースラインを超え、商用モデルに近い性能を示し、特に記号的言語での成功が顕著であった。 Comment
pj page: https://tiger-ai-lab.github.io/VisCoder2/
元ポスト:
openreview: https://openreview.net/forum?id=4zoMnmZzh4
[Paper Note] Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents, Muyu He+, ACL'26, 2025.10
Paper/Blog Link My Issue
#NLP #UserModeling #Dataset #LanguageModel #UserBased #AIAgents #ACL #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2025-10-08 GPT Summary- TraitBasisを用いて、会話型AIエージェントの堅牢性を体系的にテストする手法を提案。ユーザーの特性(せっかちさや一貫性のなさ)を制御し、AIエージェントのパフォーマンス低下を観察。最前線のモデルで2%-30%の性能低下を確認し、現在のAIエージェントの脆弱性を示す。TraitBasisはシンプルでデータ効率が高く、現実の人間の相互作用における信頼性向上に寄与する。$\tau$-Traitをオープンソース化し、コミュニティが多様なシナリオでエージェントを評価できるようにした。 Comment
元ポスト:
実際の人間にあるような癖(のような摂動)を与えた時にどれだけロバストかというのは実応用上非常に重要な観点だと思われる。元ポストを見ると、LLM内部のmatmulを直接操作することで、任意のレベルの人間の特性(e.g.,疑い深い、混乱、焦りなど)を模倣する模様。
[Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2025-10-07 GPT Summary- AIエージェントが長期的なタスクを自律的に完遂する能力が向上している中、Terminal-Bench 2.0を提案。これは実世界のワークフローに基づいた89の高難易度タスクから成るベンチマークで、ユニークな環境と人間の解法、包括的なテストが特徴です。フロンティアモデルは65%未満のスコアを記録し、改善点を明らかにするための誤り分析を実施。データセットは公開され、研究開発の支援が期待される。 Comment
元ポスト:
なお、Claude CodeはTerminal Benchリーダーボードでは非常にスコアが低いハーネスらしい:
現在はCodex+GPT-5.5がv2.0リーダーボードではSoTA
※以下、元論文中でScaffoldingと表現されている部分をAgent Harnessという最近の呼称に変更してメモしています。個人的にはScaffoldingという呼び方の方がEvaluation Harnessと混同しなくて好きなのですが、Agent Harnessの方が浸透していってそうなので、それにならっています。
Terminal Benchは与えられたタスクをターミナルを操作することで完了する能力を測定するベンチマークであり、SWE Benchなどの既存ベンチマークと比較して、より多様でlong horizon、かつフロンティアモデルにとってhardなタスクによってフロンティアモデルの性能を評価することを目的とする。注意点としては、エージェントはターミナルだけを唯一のツールとして利用することを強制しているわけではなく、コンテナを自由な方法で操作することができる。また、Terminal Benchが測定したいのはモデルの性能であるが、AI AgentにおいてモデルとAgent Harnessは切り離せない。Agent Harness(論文中ではscaffoldingというliteratureに沿った呼称を利用している)は特定のモデルに適合するように開発されており、同じ組織によって開発されたモデルとAgent Harnessではその傾向がより顕著である。このため、多くのAgent Harnessはバイアスや制約を持つため、その影響を緩和し中立に評価が可能なシンプルなAgent Harness (scaffolding)であるTerminus 2を導入している。Terminus 2はheadless terminalと呼ばれる単一のツールを有し、これは、Dockerコンテナを内のtmux shell上でキーストロークのみを実施できるツールであり、Bashコマンドのみを通じてタスクを遂行する。また、contextがlimitに到達した場合は、モデルにcontextを要約させる機能も有している。
Terminal Benchの一つのタスクは、タスクのinstruction, Dockerfile, test, 正解solutionが制限時間つきで構成され、多様なタスクを収集するためにオープンソースコミュニティの協力を得て93人のcontributorsによって、229のタスクが編成された。そのうち、著者らの困難度や品質などのレビューを経て89個のタスクが選択されTerminal Bench 2.0が編成された。
Terminal Bench 2.0のタスクの著者によって推定された、junior/expertなエンジニアがどの程度の時間をタスクを完了するのに要するかに関する分布。1時間以内に終わるものから、juniorでは168時間以上かかるものまで、幅広いhorizonのタスクが存在している。
以下がタスクを作成者によってアサインされたタスクのカテゴリの分布で、多くはソフトウェアエンジニアリングだが、システム管理やデータサイエンス、セキュリティなどもあり、非エンジニアリングタスクとして動画処理やpersonal assistantなどのタスクも少量だが含まれる。
評価結果を見ると、Figure 1となっており最も性能が良かったのはGPT-5.2+Codex CLIであった(なお、この評価結果はもう古いので最新の結果はリーダーボードを参照のこと)。次点でClaude Opus 4.5+Terminus 2であった。
また、性能-コストの散布図を見るとコストと性能はトレードオフにあることがわかる。
[Paper Note] MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages, Chenxi Whitehouse+, ICLR'26, 2025.09
Paper/Blog Link My Issue
#NLP #Dataset #ReinforcementLearning #Conversation #MultiLingual #LLM-as-a-Judge #ICLR #RewardModel #One-Line Notes Issue Date: 2025-10-03 GPT Summary- MENLOフレームワークを用いて、47言語の6,423のプロンプト-応答ペアのデータセットを作成し、LLMの応答品質を評価。ゼロショット評価者はペアワイズ評価から利益を得るが、人間には及ばず。強化学習によるファインチューニングで改善を示し、RL訓練評価者がLLMの多言語能力向上に寄与することを確認。ただし、人間の判断との不一致は残る。データセットと評価フレームワークを公開し、多言語LLM評価の研究を支援。 Comment
元ポスト:
LLMの応答を多言語でよりnativeに近いものにするための取り組み、および評価のフレームワーク(MENLO, データセット含む)な模様。nativeらしさを測るために重要な次元としてFluency, Tone, Localized Tone, Localized Factualityと呼ばれる軸を定義している模様。その上で47言語における6423の人手でアノテーションされたpreference dataを作成し評価をしたところ、既存のLLM-as-a-judgeやSFT/RLされたReward Modelでは、人間による評価にはまだまだ及ばないことが明らかになり、MENLOを用いてRL/SFTすることでLLM JudgeやReward Modelの性能を改善できる、といった話な模様。
4つの次元については以下の表を参照のこと。
それぞれ
- Fluency: 専門家レベルのnative speakerと比較した時のproficiency
- Tone: 全体的なwriting stvleや語り口
- Localized Tone: 文化的、地域的な言葉のニュアンス
- Localized Factuality: 地域固有のコンテキストに沿った事実性や網羅性
openreview: https://openreview.net/forum?id=QOWYX3Q2XS
[Paper Note] EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing, Keming Wu+, ICLR'26, 2025.09
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #ICLR #PostTraining #VisionLanguageModel #2D (Image) #RewardModel #Editing #One-Line Notes Issue Date: 2025-10-02 GPT Summary- 自然言語指示による画像編集の進展において、オープンソースモデルは遅れをとっている。これを解決するために、20万以上の選好ペアを含む新しいデータセット\mnameを構築し、指示に基づく画像編集タスクで人間の選好と高い整合性を示した。実験では、\mnameが既存のベンチマークで最先端の人間相関を達成し、ノイズの多いデータセットから高品質なサブセットを選択することで、画像編集モデルの性能を大幅に向上させることができた。今後、\mnameはコミュニティに公開され、高品質な画像編集トレーニングデータセットの構築を支援する予定である。 Comment
pj page:
https://tiger-ai-lab.github.io/EditReward/
HF:
https://huggingface.co/collections/TIGER-Lab/editreward-68ddf026ef9eb1510458abc6
これまでのImageEditing用のデータセットは、弱いReward Modelによって合成されるか、GPT-4oや他のVLMによる品質の低いフィルタリングにより生成されており、高品質なデータセットが存在しない課題があった。これを解決するために大規模なImageEditingの嗜好データを収集し、ImageEditingに特化した報酬モデルであるEditRewardを学習。このモデルは人間の専門家とのagreementにおいて高い(というよりりbestと書いてある)agreementを示し、実際にEditRewardによって既存のデータセットをfilteringして学習したら大きなgainがあったよ、という感じらしい。
openreview: https://openreview.net/forum?id=eZu358JOOR
[Paper Note] Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering, Sanidhya Vijayvargiya+, ICLR'26, 2025.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #QuestionGeneration #ICLR #SoftwareEngineering #One-Line Notes Issue Date: 2025-04-02 GPT Summary- AIエージェントは、欠落情報を補うための推測や明確化の質問を避けることで、安全リスクやリソース浪費を引き起こすことがある。本研究では、対話型コード生成における不十分な指示への対処能力を評価し、(a) 不十分さの検出、(b) 明確化質問の提示、(c) 対話の活用による性能向上の三つのステップで検証した。Ambig-SWEを使用し、モデルは不十分な指示を区別するのに苦労しつつ、対話時には最大74%の性能向上を示した。これにより、対話の重要性が浮き彫りになった。研究は、最新モデルの情報処理におけるギャップを明らかにし、評価の段階的アプローチを提案している。 Comment
曖昧なユーザメッセージに対する、エージェントが"質問をする能力を測る"ベンチマーク
openreview: https://openreview.net/forum?id=X2yzXtH4wp
[Paper Note] Liars' Bench: Evaluating Lie Detectors for Language Models, Kieron Kretschmar+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #NeurIPS #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- LLMが自身の信念に反する内容を生成する嘘を検出するため、7データセット・4オープンウェイトモデル・72,863例からなるLIARS' BENCHを構築。 嘘の種類、嘘をつく理由、対象となる信念に基づく多様な設定で、ブラックボックス型とホワイトボックス型の3手法を評価した。 既存手法は特定の嘘を体系的に見逃し、特に対話記録のみでは嘘の有無を判断できない設定で性能が低下。 LIARS' BENCHは、嘘検出手法の限界を明らかにし、今後の研究を促進する実用的なテストベッドを提供する。 Comment
benchmark: https://huggingface.co/datasets/Cadenza-Labs/liars-bench
元ポスト:
[Paper Note] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale, Zhun Wang+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Security #Environment Issue Date: 2026-06-27 GPT Summary- AIエージェントのサイバーセキュリティ能力を評価するために、実世界の脆弱性を扱った大規模ベンチマークCyberGymを導入。1,507件の脆弱性を持つ188のプロジェクトにわたるデータを使用し、エージェントが脆弱性を再現するPoCテストを生成することを主な課題とする。評価の結果、成功率は約20%にとどまり、CyberGymの難易度が示された。また、34件のゼロデイ脆弱性と18件の不完全なパッチが発見され、AIの進歩を測るための有効なプラットフォームであることが確認された。 Comment
pj page: https://www.cybergym.io/#benchmarks
[Paper Note] DataDecide: How to Predict Best Pretraining Data with Small Experiments, Ian Magnusson+, ICML'25, 2025.04
Paper/Blog Link My Issue
#Pretraining #NLP #Dataset #LanguageModel #ICML #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-05-29 GPT Summary- 小規模な実験を用いて大規模言語モデルのデータ選択を効率化することは重要である。DataDecideと呼ばれる評価スイートを通じて、異なるデータセットに基づいた前訓練の実験を実施し、150Mパラメータのモデルが1Bパラメータでの最良モデルを約80%の精度で予測できることが示された。主にスケーリング法則に基づくベースラインと比較し、連続的尤度指標を使うことで、限られた資源でも高精度の予測が可能であることが明らかとなった。 Comment
大規模なモデルを学習するためにどのようなデータレシピに従って、どのようなデータを使うべきかを、小規模なモデルでの学習を通じて予測できることを示した(150Mモデルの学習で1Bモデルに対するデータレシピの優劣を80%のDecisionAccuracyで予測可能)。
25種類のデータレシピ(ソース, deduplication, filtering, mixingによって構成)を、14種類のモデルスケールに対して、計算コスト(token-to-parameterの比率)を固定し3種類のseedを用いて実験し、事前学習の結果を体系的に調査。
1Bパラメータのdownstreamタスクにおいて、25種類のデータレシピごとの平均性能によってpairwiseの優劣に関するペアを構成し、全てのペアに対する優劣をどれだけ予測できるかを評価(DecisionAccuracy)したところ、下記図のようになった。たとえば、150Mスケールのモデルを訓練するだけでDecisionAccuracyは80%に到達し、これには1Bモデルを学習した場合と比較して2パーセント程度の計算コストしか要さないことが明らかとなった。
HF: https://huggingface.co/collections/allenai/datadecide
openreview: https://openreview.net/forum?id=p9YlQPF8fE
[Paper Note] Visual Jenga: Discovering Object Dependencies via Counterfactual Inpainting, Anand Bhattad+, NeurIPS'25, 2025.03
Paper/Blog Link My Issue
#ComputerVision #NeurIPS #2D (Image) #3D (Scene) #SpatialUnderstanding #Grounding Issue Date: 2026-05-26 GPT Summary- Visual Jengaという新しいシーン理解タスクでは、単一の画像から物体を段階的に取り除き背景を残す。これは物体間の構造的依存関係を理解し、シーンの一貫性を保ちながら取り除ける物体を探ることを目的としている。提案するデータ駆動型の訓練不要なアプローチは、現実世界の画像に対して効果的であり、物体間の非対称性を活用し、大規模なインペイントモデルで反事実的な集合を生成することでこの非対称性を定量化する。 Comment
openreview: https://openreview.net/forum?id=yMXn86pzWx
pj page: https://visualjenga.github.io/
元ポスト:
特定のオブジェクトをマスクし、その領域をN回inpaintingし、結果の多様性を見ることによって、オブジェクト間の依存関係と非対称性を定量化する、といった研究らしい。
たとえば下記の猫とテーブルの例だと、猫をマスクしInpaintingするとテーブルの上には多様なオブジェクトが生成されるが、テーブルをマスクしinpaintingをすると机が一貫して出力される。これはつまり、机に依存するオブジェクトが存在することを示唆している(言い換えると、机が猫をsupportしている)。このような処理(依存度が低いオブジェクトを削除)をオブジェクトごとに繰り返していくことによって、あるシーンのオブジェクト間の依存関係が明らかとなる。
[Paper Note] DeepShop: A Benchmark for Deep Research Shopping Agents, Yougang Lyu+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ComputerUse #VisionLanguageModel Issue Date: 2026-04-10 GPT Summary- DeepShopは、複雑なオンラインショッピング環境でのウェブエージェント評価のために設計された新たなベンチマークである。実ユーザークエリを基に多様なクエリを生成し、その複雑さを製品属性や検索フィルターを考慮してeasy、medium、hardの3レベルに分類。エージェントの性能は詳細な評価基準に基づき、RAG法との比較やフィルターとソート設定における課題を明らかにすることで、ショッピングエージェントの改善に寄与する。
[Paper Note] An Illusion of Progress? Assessing the Current State of Web Agents, Tianci Xue+, COLM'25, 2025.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #COLM #ComputerUse #VisionLanguageModel #GUI Issue Date: 2026-04-10 GPT Summary- ウェブエージェントの能力を包括的に評価し、既存の楽観的な見解との乖離を明らかに。Online-Mind2Webという新たなベンチマークを用い、300の現実的なタスクで評価を実施。新しい自動評価手法を開発し、人間の判断と85%の一致を達成。ウェブエージェントの強みと限界を示し、今後の研究の方向性を提案。 Comment
openreview: https://openreview.net/forum?id=6jZi4HSs6o
[Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #AutoML #ICLR #Selected Papers/Blogs Issue Date: 2026-03-30 GPT Summary- MLE-benchは、AIエージェントの機械学習エンジニアリング能力を測定するためのベンチマークで、75件のKaggle競技を厳選し、実世界のスキルを試すタスクを作成。人間ベースラインを確立し、最先端の言語モデルを評価した結果、OpenAIのo1-previewとAIDEスキャフォールドの組み合わせが16.9%の競技でKaggleブロンズメダル以上の性能を示した。リソーススケーリングや事前学習の影響も調査し、ベンチマークコードをオープンソース化して今後の研究を促進する。 Comment
blog:
- MLE-Bench, OpenAI, 2024.10
openreview: https://openreview.net/forum?id=6s5uXNWGIh
[Paper Note] ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use, Kaixin Li+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#ComputerVision #Dataset #ComputerUse #VisionLanguageModel #One-Line Notes #Grounding #GUI Issue Date: 2026-03-20 GPT Summary- MLLMの進展は一般的なタスクのGUIエージェントに貢献しているが、専門分野への適用は未検討。ScreenSpot-Proでは、高解像度の専門設定でMLLMのグラウンディング能力を評価する新ベンチマークを提示。複数の業界とアプリケーションに対してテストを行い、既存モデルの性能は低く、最良のモデルでも18.9%に過ぎない。探索域の戦略的縮小により精度向上を示し、ScreenSeekeRを提案。階層的検索を用いることで、訓練不要で48.1%の性能を達成。専門アプリ向けGUIエージェント開発の進展を期待。 Comment
元ポスト:
高解像度な画像を用いた多様なドメインでのVLMのGUI grounding性能を測るベンチマークとリーダーボードのようでえる
現在のトップはHolo2のようである
- New Holo2 model takes the lead in UI Localization, H Company, 2026.02
- Holo2: Cost-Efficient Models for Cross-Platform Computer-Use Agents, H Company, 2025.11
[Paper Note] EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing, Runjia Li+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Dataset #Editing #3D (Video) #EgocentricView #Initial Impression Notes Issue Date: 2026-03-17 GPT Summary- 自己視点動画編集のためのエコシステムを提案。EgoEditDataを構築し、手と物体の相互作用に特化したデータセットを提供。リアルタイム推論を可能にするEgoEditを開発し、指示に従いながら高品質の編集を実現。評価スイートEgoEditBenchを導入し、自己視点編集での進歩を示しつつ、一般編集タスクでも強力な性能を維持。EgoEditDataとEgoEditBenchは研究コミュニティに公開予定。 Comment
pj page: https://snap-research.github.io/EgoEdit/
元ポスト:
完全にARの上位互換
[Paper Note] Music Arena: Live Evaluation for Text-to-Music, Yonghyun Kim+, NeurIPS'25, 2025.07
Paper/Blog Link My Issue
#NeurIPS #Music Issue Date: 2026-02-28 GPT Summary- 音楽へのテキスト変換モデル(TTM)のための評価プラットフォーム、Music Arenaを提案。聴取実験による人間の嗜好評価が困難な中、ユーザーが入力したテキストに基づき2つのTTMシステムの出力を比較し、嗜好データをリーダーボードに活用。LLMベースのルーティングシステムや自然言語フィードバックの収集機能を備え、ユーザープライバシーを保ちながら再生可能なデータを提供。これにより、TTMエコシステムの課題解決と評価手法の進化を目指す。 Comment
元ポスト:
slide: https://neurips.cc/media/neurips-2025/Slides/131738.pdf
[Paper Note] MQUAKE-REMASTERED: MULTI-HOP KNOWLEDGE EDITING CAN ONLY BE ADVANCED WITH RELIABLE EVALUATIONS, Zhong+, ICLR'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ICLR #KnowledgeEditing Issue Date: 2026-02-08 GPT Summary- 誤った回答をするLLMに対し、知識の編集が効率的な修正手段として機能しますが、実世界の知識が複雑に絡み合っているため、編集効果の伝播が課題です。本研究では、MQuAKEデータセットの33%または76%の質問が様々な形で破損していることを示し、修正を提案します。また、修正後のMQuAKE-Remasteredデータセットに対する編集方法のベンチマークを行い、特定の性質に依存する手法がオーバーフィットすることを観察しました。最小限の侵襲的アプローチGWALKが、最先端の編集性能を発揮することを示しました。MQuAKE-Remasteredは、huggingfaceとGitHubで利用可能です。 Comment
openreview: https://openreview.net/forum?id=m9wG6ai2Xk
[Paper Note] CounterBench: A Benchmark for Counterfactuals Reasoning in Large Language Models, Yuefei Chen+, arXiv'25, 2025.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #KnowledgeEditing Issue Date: 2026-02-08 GPT Summary- 反実仮想推論はAIにおける複雑な因果関係の一つであり、本研究ではLLMの性能を評価します。1,000の質問からなる新しいベンチマーク「CounterBench」を導入し、さまざまな難易度や因果構造を考慮しました。実験結果では、多くのモデルが低い性能を示しましたが、新たに提案する推論パラダイム「CoIn」により、反実仮想推論タスクでLLMの性能が大幅に向上しました。データセットは公開されています。
[Paper Note] RewardBench 2: Advancing Reward Model Evaluation, Saumya Malik+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Alignment #Selected Papers/Blogs #RewardModel #KeyPoint Notes #DownstreamTasks #Reading Reflections Issue Date: 2026-02-06 GPT Summary- 報酬モデルは、言語モデルの訓練後に好みデータを利用して指示遵守や推論、安全性を最適化するための訓練目標を提供します。新たに開発された「RewardBench 2」は、スキル領域を評価するための挑戦的なベンチマークを提供し、既存のモデルが低いスコアを示しつつも下流性能との相関が高いことを示しています。このベンチマークは人間のプロンプトを基にしており、厳格な評価プラクティスを促進しています。論文では、ベンチマークの構築プロセスと既存モデルの性能を報告し、モデルの下流使用との相関を定量化しています。 Comment
以下の6つのドメインで構成されるReward Modelの評価のためのベンチマーク:
- Factuality: hallucinationや誤りの有無の判定
- Precise Instruction Following: 細かい指示に対する追従性能
- Math: **自由記述**の数学に関するプロンプトに対する応答に関する能力
- Safety: 有害な応答に対して適切に対処できるか(応答拒否 or 適切な応答)
- Focus: 一般的なユーザのクエリに対して、トピックに沿った高品質な応答ができているか否か
- **Ties**: 「虹の色を1つ挙げて」といったような、複数の正解があり得るが、無数の不正解があるようなタスク(特定の正解にバイアスがかからず、正解と不正解を区別する能力を評価)
Reward Bench 2 での性能が、Best-of-N (=N個応答をサンプリングし最も良いものを採用するtest-time scaling手法)における様々なdownstreamタスクと強い相関を示すことが示されている。
ただし、PPOでの事後学習について焦点を当てた場合
- ベースモデルの出自がReward Modelと異なる場合
- Reward Modelの学習データが、ベースモデルと大きく異なる場合
においては、Reward Bench 2で高い性能が得られていても、PPOにおいて高い性能が得られず、特にベースモデルの出自が異なる場合の影響が顕著とのこと。
Reward Modelの性能が必ずしもPPOの事後学習後の下流タスクに対する性能と相関せず(ただし、Rewardベンチの性能が低い部分においてはおおまかに推定できる)、ベースモデルの出自が異なるReward Modelを使った場合や、Reward Modelとベースモデルが学習したプロンプトの分布が大きく異なる場合にこのような不整合が強く現れるというのは興味深く、おもしろかった。
Reward Modelとベースモデルの開始点が異なる場合は、RLによる学習がうまくいかないというのは、直感的でわかりやすい説明だなと感じた。
openreview: https://openreview.net/forum?id=fb0G86Dewb
[Paper Note] Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory, Tianxin Wei+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #memory #Test-time Learning/Adaptation Issue Date: 2026-02-05 GPT Summary- 状態性はLLMエージェントの長期的計画に不可欠であり、メモリ管理の進化が未探索である点に焦点を当てる。本研究では、Evo-Memoryという自己進化メモリの評価フレームワークを提案し、LLMが累積した経験を動的に処理する能力を向上させる。具体的には、タスクストリームを構造化し、メモリの検索・適応を要求。10のメモリモジュールと多様なデータセットで評価し、経験再利用のためのExpRAGおよび推論を統合するReMemパイプラインを提案、継続的な改善を実現する。 Comment
元ポスト:
[Paper Note] AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance, Dhaval Patel+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #AIAgents #One-Line Notes Issue Date: 2026-02-03 GPT Summary- AIを活用した産業資産ライフサイクル管理は、運用ワークフローの自動化を目指し、人間の負荷を軽減します。従来の技術は特定の問題に対処するに過ぎませんでしたが、AIエージェントと大規模言語モデルの登場により、資産ライフサイクル全体のエンドツーエンド自動化が可能になりました。本論文では、AssetOpsBenchというエージェント開発のための統合フレームワークを紹介し、知覚、推論、制御を統合した自律的なエージェントの構築について具体的な洞察を提供します。ソフトウェアはGitHubで公開されています。 Comment
dataset: https://arxiv.org/abs/2506.03828
元ポスト:
openreview: https://openreview.net/forum?id=ld6JUQbhes
産業におけるアセットの管理に関する(非常に複雑な)end-to-endなベンチマークで、multi agentに対する評価が前提となっている模様。
[Paper Note] ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks, Saurabh Jha+, ICML'25, 2025.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Financial #ICML #SoftwareEngineering #read-later #One-Line Notes Issue Date: 2026-02-03 GPT Summary- AIエージェントを用いたITタスク自動化の実現には、その効果を測定する能力が重要である。本研究では、AIエージェントのベンチマーキングを行うためのフレームワーク「ITBench」を提案。初期リリースはSRE、CISO、FinOpsの3領域に焦点を当て、実行可能なワークフローと解釈可能なメトリクスを提供。ITBenchは94の実世界シナリオを含み、最先端エージェントモデルのパフォーマンスを評価した結果、限られた成功率が示された。ITBenchがAI駆動のIT自動化において重要な役割を果たすことが期待される。 Comment
dataset:
-
https://huggingface.co/datasets/ibm-research/ITBench-Lite
-
https://huggingface.co/datasets/ibm-research/ITBench-Trajectories
元ポスト:
openreview: https://openreview.net/forum?id=jP59rz1bZk
94種類の実世界に基づいたシナリオに基づいてSRE, CSO, FinOpsに関するタスクを用いてAI Agentsを用いて評価する。各シナリオにはメタデータとEnvironments、トリガーとなるイベント、理想的な成果などが紐づいている。特にFinOpsに課題があることが示されている模様。
以下がシナリオの例で、たとえばFinOpsの場合はalertの設定ミスや、Podのスケーリングの設定に誤りがあり過剰にPodが立ってしまうといったシナリオがあるようである。
[Paper Note] The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs, Piotr Nawrot+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #LongContext #read-later #Selected Papers/Blogs #SparseAttention #Initial Impression Notes #Author Thread-Post Issue Date: 2026-01-30 GPT Summary- スパースアテンションは、Transformer LLMの長文コンテキスト処理能力を向上させるが、その効率と精度のトレードオフは未評価である。本研究では、最大128Kトークンのシーケンスに対して、6つの手法を9つのタスクで分析し、スパースアテンションの効果的利用を示した。主な発見は、より大きなスパースモデルが小さな密なモデルを上回ること、トークンの重要度推定は計算制約で実現しにくいものの他の選択肢が効果的であること、長いシーケンスが高いスパース性を許容すること。これにより、スパースアテンション導入についての実践的ガイダンスを提供した。 Comment
元ポスト:
最近多くなってきたsparse attentionに関する非常に大きな実験で、かつ過去な提案されたものの分類などもされているようなのでsparse attentionに対する理解が深められそう。これは気になる。そして著者にSebastian Ruder氏の名前が。
[Paper Note] How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments, Jen-tse Huang+, ICLR'25, 2024.03
Paper/Blog Link My Issue
#LanguageModel #ICLR Issue Date: 2026-01-25 GPT Summary- LLMの意思決定能力を評価する新フレームワークGAMA($γ$)-Benchを提案。これには8つのゲーム理論シナリオと動的スコアリング方式が含まれ、ロバスト性や一般化能力を評価。結果としてGPT-3.5は高いロバスト性を示すが一般化能力は限定的で、Chain-of-Thought手法で強化可能。Gemini-1.5-Proが最も高得点を獲得し、他のモデルを上回る性能を示した。 Comment
pj page: https://cuhk-arise.github.io/GAMABench/
元ポスト:
openreview: https://openreview.net/forum?id=DI4gW8viB6
[Paper Note] SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios, Minh V. T. Thai+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #LongHorizon Issue Date: 2026-01-12 GPT Summary- 既存のAIコーディングエージェントは単一の課題に焦点を当てているが、実際のソフトウェア開発は長期的な取り組みである。新たに提案するベンチマークSWE-EVOは、7つのオープンソースPythonプロジェクトから構築され、エージェントが複数ファイルにわたる修正を行う48の進化タスクを評価する。実験では、最先端モデルでも解決率が低く、特にマルチファイル推論に苦労していることが示された。さらに、複雑なタスクの進捗を測る指標Fix Rateも提案されている。 Comment
元ポスト:
[Paper Note] 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation, Chiao-An Yang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Dataset #Distillation #read-later #VideoGeneration/Understandings #VisionLanguageModel #3D (Scene) #3D (Video) Issue Date: 2025-12-30 GPT Summary- 4D-RGPTという専門的なMLLMを導入し、動画から4D表現を捉えることで時間的知覚を強化。知覚的4D蒸留(P4D)を用いて4D表現を転送し、包括的な4D知覚を実現。新たに構築したR4D-Benchは、領域レベルのプロンプトを備えた動的シーンのベンチマークで、4D-RGPTは既存の4D VQAベンチマークとR4D-Benchの両方で顕著な改善を達成。 Comment
元ポスト:
[Paper Note] Vision Language Models are Confused Tourists, Patrick Amadeus Irawan+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #Dataset #Bias #VisionLanguageModel #Cultural #Robustness Issue Date: 2025-12-25 GPT Summary- 文化的次元はVLMの評価において重要だが、多様な文化的入力に対する安定性は未検証。既存の評価は単一の文化的概念に依存し、複数の文化的手がかりを考慮していない。これに対処するため、ConfusedTouristという新しい評価手法を導入し、VLMの安定性を評価。実験で、画像スタッキングの摂動下で精度が低下し、注意が気を散らす手がかりにシフトすることが明らかに。これにより、視覚的文化概念の混合がVLMに大きな影響を与えることが示され、文化的にロバストな理解の必要性が強調された。 Comment
元ポスト:
VLMの文化的な物体の認識に関するロバスト性を全く異なる国の国旗やランドマークをルールベース、あるいはimage editingなどによって敵対的に挿入する(distractor)ことで測るベンチマークで、distractorによって性能が低下することからVLMに地理的・文化的バイアスが存在することを示した研究、のように見える。
[Paper Note] MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning, Yuanchen Ju+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #GraphBased #Dataset #ReinforcementLearning #PostTraining #Robotics #SpatialUnderstanding #EmbodiedAI Issue Date: 2025-12-25 GPT Summary- 家庭内のモバイルマニピュレーター向けに、空間的・機能的関係を統合したMomaGraphを提案。これを支えるために、初の大規模データセットMomaGraph-Scenesと評価スイートMomaGraph-Benchを提供。さらに、7Bのビジョン・ランゲージモデルMomaGraph-R1を開発し、タスク指向のシーングラフを予測。実験により、71.6%の精度を達成し、オープンソースモデルの中で最先端の結果を示した。 Comment
pj page: https://hybridrobotics.github.io/MomaGraph/
元ポスト:
[Paper Note] MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes, Yu Ying Chiu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Chain-of-Thought #Reasoning #Safety Issue Date: 2025-12-24 GPT Summary- AIシステムの意思決定が人間の価値観と一致するためには、その決定過程を理解することが重要である。推論言語モデルを用いて、道徳的ジレンマに関する評価を行うためのベンチマーク「MoReBench」を提案。1,000の道徳的シナリオと23,000以上の基準を含み、AIの道徳的推論能力を評価する。結果は、既存のベンチマークが道徳的推論を予測できないことや、モデルが特定の道徳的枠組みに偏る可能性を示唆している。これにより、安全で透明なAIの推進に寄与する。 Comment
pj page: https://morebench.github.io/
元ポスト:
[Paper Note] Step-DeepResearch Technical Report, Chen Hu+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #Proprietary #mid-training #PostTraining #DeepResearch #KeyPoint Notes #Rubric-based Issue Date: 2025-12-24 GPT Summary- Step-DeepResearchは、LLMを用いた自律エージェントのためのコスト効率の良いエンドツーエンドのシステムであり、意図認識や長期的意思決定を強化するためのデータ合成戦略を提案。チェックリストスタイルのジャッジャーにより堅牢性を向上させ、中国ドメイン向けのADR-Benchを設立。実験では、Step-DeepResearchが高いスコアを記録し、業界をリードするコスト効率で専門家レベルの能力を達成したことを示した。 Comment
元ポスト:
ポイント解説:
ざっくり言うと、シンプルなReAct styleのagentで、マルチエージェントのオーケストレーションや複雑で重たいワークフロー無しで、OpenAI, GeminiのDeepResearchと同等の性能を達成してとり、ポイントとしてこれらの機能をはmid-training段階で学習してモデルのパラメータとして組み込むことで実現している模様。
mid trainingは2段階で構成され、trajectoryの長さは徐々に長いものを利用するカリキュラム方式。
最初のステージでは以下の4つのatomicスキルを身につけさせる:
- Planning & Task Decomposition
- Deep Information Seeking
- Reflection & Verification
- Reporting
これらのatomic skillを身につけさせる際には、next token predictionをnext action predictionという枠組みで学習し、アクションに関するトークンの空間を制限することで効率性を向上(ただし、具体性は減少するのでトレードオフ)という形にしているようだが、コンセプトが記述されているのみでよくわからない。同時に、学習データの構築方法もデータソースとおおまかな構築方法が書かれているのみである。ただし、記述内容的には各atomic skillごとに基本的には合成データが作成され利用されていると考えてよい。
たとえばplanningについては論文などの文献のタイトルや本文から実験以後の記述を除外し、研究プロジェクトのタスクを推定させる(リバースエンジニアリングと呼称している)することで、planningのtrajectoryを合成、Deep Information SeekingではDB Pediaなどのknowledge graphをソースとして利用し、次数が3--10程度のノードをseedとしそこから(トピックがドリフトするのを防ぐために極端に次数が大きいノードは除外しつつ)幅優先探索をすることで、30--40程度のノードによって構成されるサブグラフを構成し、そのサブグラフに対してmulti hopが必要なQuestionを、LLMで生成することでデータを合成しているとのこと。
RLはrewardとしてルーブリックをベースにしたものが用いられるが、strong modelを用いて
- 1: fully satisfied
- 0.5: partially satisfied
- 0: not satisfied
の3値を検討したが、partially satisfiedが人間による評価とのagreementが低かったため設計を変更し、positive/negative rubricsを設定し、positivルーブリックの場合はルーブリックがfully satisfiedの時のみ1, negativeルーブリックの方はnot satisfiedの時のみ0とすることで、低品質な生成結果に基づくrewardを無くし、少しでもネガティブな要素があった場合は強めのペナルティがかかるようにしているとのこと(ルーブリックの詳細は私が見た限りは不明である。Appendix Aに書かれているように一瞬見えたが具体的なcriterionは書かれていないように見える)。
[Paper Note] SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning, Jitesh Jain+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #AIAgents #Reasoning #PostTraining #Selected Papers/Blogs #VideoGeneration/Understandings #VisionLanguageModel #KeyPoint Notes #LongHorizon Issue Date: 2025-12-19 GPT Summary- 人間のように異なる長さの動画に柔軟に推論できる動画推論モデルSAGEを提案。SAGEは長い動画に対してマルチターン推論を行い、簡単な問題には単一ターンで対応。Gemini-2.5-Flashを用いたデータ生成パイプラインと強化学習後訓練レシピを導入し、SAGE-Benchで実世界の動画推論能力を評価。結果、オープンエンドのタスクで最大6.1%、10分以上の動画で8.2%の性能向上を確認。 Comment
pj page: https://praeclarumjj3.github.io/sage/
元ポスト:
AllenAIの勢いすごいな...
現在のVideo reasoning Modelはlong videoに対するQAに対してもsingle turnで回答応答しようとするが、人間はそのような挙動はせずに、long videoのうち、どこを流し見し、どこを注視するか、ある時は前半にジャンプし、関係ないところは飛ばすなど、情報を選択的に収集する。そのような挙動のエージェントをMolmo2をベースにSFT+RLをベースに実現。
システムデザインとしては、既存のエージェントはtemporal groundingのみをしばしば利用するがこれはlong videoには不向きなので、non-visualな情報も扱えるようにweb search, speech transcription, event grounding, extract video parts, analyze(クエリを用いてメディアの集合を分析し応答する)なども利用可能に。
inferenceは2-stageとなっており、最初はまずSAGE-MMをContext VLMとして扱い、入力された情報を処理し(video contextやツール群、メタデータなど)、single turnで回答するか、ツール呼び出しをするかを判断する。ツール呼び出しがされた場合は、その後SAGE-MMはIterative Reasonerとして機能し、前段のtool callの結果とvideo contextから回答をするか、新たなツールを呼び出すかを判断する、といったことを繰り返す。
long videoのデータは6.6kのyoutube videoと99kのQAペア(Gemini-2.5-Flashで合成)、400k+のstate-action example(Gemini-2.5-Flashによりtool callのtrajectoryを合成しcold start SFTに使う)を利用。
RLのoptimizationでは、openendなvideo QAではverifiableなrewardは難しく、任意の長さのvideoに対するany-horizonな挙動を学習させるのは困難なので、multi rewardなRLレシピ+strong reasoning LLMによるLLM as a Judgeで対処。rewardはformat, 適切なツール利用、ツール呼び出しの引数の適切さ、最終的な回答のAccuracyを利用。
評価データとしては人手でverificationされた1744のQAを利用し、紐づいている動画データの長さは平均700秒以上。
[Paper Note] Evaluating Large Language Models in Scientific Discovery, Zhangde Song+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery Issue Date: 2025-12-19 GPT Summary- 大規模言語モデル(LLMs)の科学研究への適用を評価するために、シナリオに基づいた新しいベンチマークを導入。専門家が定義した研究プロジェクトをモジュール化し、質問をサンプリングして二段階で評価する。これにより、一般的な科学ベンチマークとのパフォーマンスギャップが明らかになり、LLMsの限界が示される一方で、科学的発見における有望な成果も強調される。このフレームワークは、LLMsの評価のための再現可能な基準を提供し、科学的発見の進展に寄与する。 Comment
元ポスト:
[Paper Note] MMGR: Multi-Modal Generative Reasoning, Zefan Cai+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #FoundationModel #TextToImageGeneration #2D (Image) #3D (Scene) #WorldModels #KeyPoint Notes #TextToVideoGeneration Issue Date: 2025-12-19 GPT Summary- MMGR(Multi-Modal Generative Reasoning Evaluation and Benchmark)を導入し、物理的、論理的、空間的、時間的な推論能力に基づくビデオ基盤モデルの評価フレームワークを提案。既存の指標では見落とされる因果関係や物理法則の違反を考慮し、主要なビデオおよび画像モデルをベンチマークした結果、抽象的推論でのパフォーマンスが低いことが明らかに。MMGRは、生成的世界モデルの推論能力向上に向けた統一診断ベンチマークを提供。 Comment
pj page: https://zefan-cai.github.io/MMGR.github.io/
元ポスト:
video/image 生成モデルを(単なる動画生成という枠ではなく世界モデルという観点で評価するために)
- physical reasoning: ロボットのシミュレーションやinteractionに必要な物理世界の理解力
- logical (abstract) reasoning: System2 Thinkingい必要な抽象的なコンテプトやルールに従う能力(Aが起きたらBが続く)
- 3D spatial reasoning: 世界の認知mapを内包するために必要な3D空間における関係性や、環境の案内、物事の構造や全体像を把握する能力
- 2D spatial reasoning: 複雑なpromptをgroundingするために必要な2D空間に写像されたレイアウト、形状、相対位置を理解する能力
- Temporal Reasoning: coherenceを保つために必要な、因果関係、イベントの順序、長期的な依存関係を捉える能力
の5つの軸で評価するフレームワーク。
[Paper Note] Towards a Science of Scaling Agent Systems, Yubin Kim+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #One-Line Notes Issue Date: 2025-12-11 GPT Summary- エージェントシステムの性能を向上させるための定量的スケーリング原則を導出し、4つのベンチマークで評価。3つのLLMファミリーに対して5つのアーキテクチャを実装し、180の構成で制御評価を実施。ツール調整のトレードオフ、能力の飽和、トポロジー依存のエラー増幅の3つの効果を特定。中央集権的調整が金融推論で80.9%の性能向上をもたらし、分散型調整が動的ウェブナビゲーションで優れた結果を示す。全体として、87%の構成に対して最適な調整戦略を予測するフレームワークを提供。 Comment
元ポスト:
エージェントを評価する際のconfiguration(single agent vs. multiagent, multi agentの協調方法など)に応じて性能は大きく変わる、またタスクの性質(e.g., ツール重視なのか, 単一エージェントで高い性能が得られるものなのか等)に応じて最適なconfigurationが変わるよ、という話に見える。
[Paper Note] Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond), Liwei Jiang+, NeurIPS'25 Best Paper Award, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #Mindset #read-later #Diversity #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-12-03 GPT Summary- Infinity-Chatは、26,000件の多様なオープンエンドユーザークエリからなるデータセットで、言語モデル(LM)の出力の多様性を評価するための新たなリソースを提供する。包括的な分類法を提案し、LMにおけるモード崩壊や人工的ハイヴマインド効果を明らかにした。調査結果は、LMの生成が人間の好みに適切に調整されていないことを示し、AI安全リスクの軽減に向けた今後の研究の重要な洞察を提供する。 Comment
openreview: https://openreview.net/forum?id=saDOrrnNTz
元ポスト:
これはまさに今日Geminiと壁打ちしている時に感じたなあ。全人類が同じLLMを使って壁打ちしたらどうなるんだろうと。同じような思考や思想を持つのではないか、あるいは偏っていないと思い込んでいるけど実は暗黙的に生じている応答のバイアスとか、そういう懸念。(読みたい)
[Paper Note] MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology, Kiril Vasilev+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LanguageModel #MultiModal #Selected Papers/Blogs #Medical Issue Date: 2025-11-26 GPT Summary- MTBBenchは、臨床ワークフローの複雑さを反映したマルチモーダル大規模言語モデル(LLMs)のための新しいベンチマークで、腫瘍学の意思決定をシミュレートします。既存の評価が単一モーダルであるのに対し、MTBBenchは異種データの統合や時間に基づく洞察の進化を考慮しています。臨床医によって検証されたグラウンドトゥルースの注釈を用い、複数のLLMを評価した結果、信頼性の欠如や幻覚の発生、データの調和に苦労することが明らかになりました。MTBBenchは、マルチモーダルおよび長期的な推論を強化するツールを提供し、タスクレベルのパフォーマンスを最大9.0%および11.2%向上させることが示されました。 Comment
dataset: https://huggingface.co/datasets/EeshaanJain/MTBBench
元ポスト:
> Ground truth annotations are validated by clinicians via a co-developed app, ensuring clinical relevance.
素晴らしい
[Paper Note] Computer-Use Agents as Judges for Generative User Interface, Kevin Qinghong Lin+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #Coding #LLM-as-a-Judge #ComputerUse #VisionLanguageModel #One-Line Notes #UI Issue Date: 2025-11-26 GPT Summary- CUAはGUIを自律的に操作する能力が向上しているが、従来のGUIは人間向けに設計されているため、効率的なタスク実行に不必要な行動を強いられる。Coderの進展により、自動GUI設計が変革される中、CUAがCoderを支援する役割を果たせるかを探るためにAUI-Gymを導入。1560のタスクをシミュレートし、信頼性を確保する検証ツールを開発。Coder-CUA協力フレームワークを提案し、CUAがデザインを評価し、タスク解決可能性を測定。CUAダッシュボードを設計し、ナビゲーション履歴を視覚的に要約。これにより、エージェントの能動的な参加を促進する。 Comment
pj page: https://showlab.github.io/AUI/
元ポスト:
CUA自身にCUAにとって理解しやすいUIに関するJudgeをさせてフィードバックさせ(CUA-as-Judpe)、Coder(コード生成)を通じてUIを改善できるか?というタスクとベンチマークな模様
[Paper Note] VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation, Kevin Qinghong Lin+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #VisionLanguageModel Issue Date: 2025-11-25 GPT Summary- VCodeは、視覚中心のコーディングを促進するためにSVGコードを用いた新しいアプローチを提案。画像から象徴的な意味を持つSVGを生成し、CodeVQAという評価プロトコルでその忠実性を測定。VCoderを導入し、SVGコードの不一致を分析・洗練する「Thinking with Revision」と、構造的手がかりを提供する「Acting with Visual Tools」を通じて、言語中心と視覚中心のコーディングのギャップを埋める。実験により、VCoderは最前線のVLMに対して12.3ポイントの性能向上を実現。 Comment
元ポスト:
pj page: https://csu-jpg.github.io/VCode/
画像を意味情報を保持したSVGコードとして書き起こし、書き起こしたSVGに対してQAをすることで正しさを測るようなベンチマークらしい
[Paper Note] The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution, Junlong Li+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #One-Line Notes Issue Date: 2025-11-25 GPT Summary- Toolathlonは、現実世界の複雑なワークフローを処理する言語エージェント向けの新しいベンチマークで、32のアプリケーションと604のツールを網羅。実際の環境状態を提供し、108のタスクを通じてエージェントのパフォーマンスを評価。最先端モデルの評価結果は、成功率が低いことを示し、Toolathlonがより能力の高いエージェントの開発を促進することを期待。 Comment
pj page: https://toolathlon.xyz/introduction
元ポスト:
元ポスト:
既存のAI Agentベンチマークよりもより多様で複雑な実世界タスクに違いベンチマークらしい
[Paper Note] Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers, Wei Pang+, NeurIPS'25, 2025.05
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #NeurIPS #VisionLanguageModel #One-Line Notes #Poster #Author Thread-Post Issue Date: 2025-11-25 GPT Summary- 学術ポスター生成のための新しいベンチマークとメトリクスを導入し、PosterAgentというマルチエージェントパイプラインを提案。Parserが論文を構造化し、Plannerがレイアウトを整え、Painter-Commenterが視覚的整合性を確保。評価では、GPT-4oの出力は視覚的には魅力的だが、テキストの質が低く、PaperQuizスコアも不十分であることが判明。オープンソースのバリアントは、既存のシステムを上回り、コスト効率も良好。これにより、次世代の自動ポスター生成モデルの方向性が示された。 Comment
元ポスト:
著者ポスト:
GPT4oは細かい文字のfidelityが低く、視覚的な魅力も小さい(なのでそういったものは学習で補う必要がある)という知見があるとのこと。arXivに投稿された当時結構話題になっていた気がする。
論文だけに留まらず、長いテキストを視覚的に見やすく圧縮する技術は一種の要約として見ることもでき、生成AIによって情報がさらに溢れかえるようになった昨今は、こういった技術はさらに重要な技術になると思われる。
[Paper Note] Why Do Language Model Agents Whistleblow?, Kushal Agrawal+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #read-later Issue Date: 2025-11-24 GPT Summary- LLMをエージェントとして展開する際の内部告発行動を調査。内部告発の頻度はモデルによって異なり、タスクの複雑さが増すと傾向が低下。道徳的行動を促すプロンプトで内部告発率が上昇し、明確な手段を提供すると低下。評価認識のテストにより、データセットの堅牢性を確認。 Comment
元ポスト:
興味深い
所見(OLMo関係者):
[Paper Note] Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark, Minhui Zhu+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Reasoning #read-later #Selected Papers/Blogs #Physics Issue Date: 2025-11-23 GPT Summary- CritPtは、物理学研究における複雑な推論タスクを評価するための初のベンチマークであり、71の研究課題と190のチェックポイントタスクから構成される。これらの問題は現役の物理学者によって作成され、機械的に検証可能な答えを持つように設計されている。現在のLLMsは、単独のチェックポイントでは期待を示すが、全体の研究課題を解決するには不十分であり、最高精度は5.7%にとどまる。CritPtは、AIツールの開発に向けた基盤を提供し、モデルの能力と物理学研究の要求とのギャップを明らかにする。 Comment
pj page: https://critpt.com/
artificial analysisによるリーダーボード:
https://artificialanalysis.ai/evaluations/critpt
データセットとハーネス:
[Paper Note] AMO-Bench: Large Language Models Still Struggle in High School Math Competitions, Shengnan An+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Reasoning #Mathematics Issue Date: 2025-11-20 GPT Summary- AMO-Benchは、オリンピックレベルの数学的推論を評価するための新しいベンチマークで、50の専門家作成の問題から成る。既存のベンチマークが飽和状態にある中、AMO-BenchはIMO基準を満たし、オリジナルの問題を提供することで厳格な評価を実現。実験では、26のLLMsが52.4%の正答率を記録し、ほとんどが40%未満であった。これにより、LLMsの数学的推論能力には改善の余地があることが示された。AMO-Benchは、今後の研究を促進するために公開されている。 Comment
pj page: https://amo-bench.github.io/
元ポスト:
AIMEの次はこちらだろうか...ちなみに私は私生活において数学オリンピックの問題を解きたいと思ったことは今のところ一度もない🧐しかし高度な推論能力を測定するために必要というのは理解できる。
HF: https://huggingface.co/datasets/meituan-longcat/AMO-Bench
