AIAgents (883) — 1/5
[Paper Note] Harness Learning Enables Generalizable Test-Time Adaptation, Alvin Zhang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #meta-learning #Generalization #Test-time Learning/Adaptation #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-10-02 GPT Summary- 言語モデルエージェントのharnessを、実行フィードバックに基づいて改訂するharness learningを提案。 実行可能プログラム上のメタ学習として改訂モデルを強化学習で訓練し、テスト時にはパラメータ更新なしで新規タスクの実行結果からharnessを逐次改善する。 推論およびマルチホップQAで、改訂性能の向上と未知タスクへの適応・転移を確認。 Comment
元ポスト:
実行時のフィードバックに基づいてAgent Harnessをreviseすることを学習したモデル(Proposer)によって、テスト時にモデルの重み更新なしで、未知のタスクに対する汎化性能を獲得する
[Paper Note] EasyPPO: Stabilizing the Critic Is Key, Xuanyi Zhou+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #read-later #Stability #Author Thread-Post Issue Date: 2026-09-30 GPT Summary- PPOでは、クリティックがLLMの強化学習を不安定化させる二つの失敗モード(打ち切りロールアウトのフィルタリングによる条件付き報酬への偏り、異質なリターンノイズによる高分散プロンプトの支配)を特定。 EasyPPOでは、アクターのみの過長ロールアウトを除外しつつ完了・打ち切り両方のリターンでクリティックを学習し、リターン分散の逆数によるノイズ正規化と小規模ミニバッチで更新を安定化。 コーディング、数学推論、マルチターン検索で標準PPO、VAPO、HL-Gauss PPOを一貫して上回り、PPOに対して最大14.89%の性能向上を達成。 Comment
pj page: https://easyppo.github.io/
元ポスト:
著者ポスト2:
[Paper Note] EvoOntology: A Self-Evolving Ontology Layer for Data Agents, Meiduo Chong+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #KnowledgeGraph #SelfImprovement #MCP #AgentHarness Issue Date: 2026-09-29 GPT Summary- 異種データとエージェントの間にあるアクセスのギャップを埋めるため、自己進化型オントロジー層EvoOntologyを提案。schema・content・tool層をMCP serverとして統合し、LLMエージェントが実行時にオントロジーへ問い合わせ・相互作用することを可能にする。builder agentによる自律的なオントロジー構築と、帰属情報に基づく型付き編集およびペア評価による自己進化ループを導入。4種類のLLMと3つのデータエージェントベンチマークで、既存手法を一貫して上回り、異種データとの効果的な相互作用を実現。 Comment
元ポスト:
[Paper Note] CodeMidas: Scaling Agentic Coding RL Environments from Code Itself, Bowen Ye+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Coding #SoftwareEngineering #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-28 GPT Summary- ソースコードのみを用いて、既存コードベースの機能を実行可能なRL環境へ変換するエージェント型パイプラインCodeMidasを提案。 機能探索・仕様化、テスト生成、実行チェックと反復ロールアウトによるタスク検証を行い、23言語・15分野の3,185コードベースから5,545件の訓練タスクを構築。 これらでMiMo-V2.5をGRPO学習することで、Issue修正・プログラム構築・端末操作など5つのベンチマークすべてで性能が向上し、コードベース探索や自己検証も改善。 Comment
元ポスト:
[Paper Note] Scaling Discovery through Test-Time Communication, Jongho Park+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post #Coordination Issue Date: 2026-09-28 GPT Summary- 共有ディレクトリを介してテスト時に協働するマルチエージェントチームを構築し、独立した並列試行と比較。ARC-AGI-3では、team@$k$が独立に動作する$4k$体のエージェントと同等の成功率を達成し、エージェント数の増加に伴って優位性が拡大。ポリオミノ・パッキングやMNIST分類器の圧縮でも、コミュニケーションにより従来手法や人間による既知の最良解を上回る結果を示した。ただし、計算資源や進捗に対する明確なフィードバックが不足する場合は、独立したエージェントの方が有効。 Comment
元ポスト:
重要
同じ設定(同一モデル、ツール、タスク指示、コミュニケーションプロンプト)のエージェントkが与えられOpen-endなタスクに取り組む際に、エージェント間で通信を許容する場合と、独立試行する場合では、前者の方がエージェントの並列数に対して、性能が累積的に改善する。
エージェントの通信はミニマムなもので構成され、共有されたappend-onlyなログ(非同期のブロードキャストチャネルとして機能)とslotによるディレクトリが存在するのみ。
各エージェントはログ(リーダーボード)に対して顕著な進捗があれば、検証可能な情報と客観的な指標を追記する。これにより、各エージェントは自分たちの試行のverifiableな中間結果を共有し、他エージェントはそれらが採用する価値のあるものかを判断できる。
slotによるディレクトリは共有されているファイルシステム上でアトミックなディレクトリ作成処理を通じて作成され、各slotには単一のアプローチが対応し、エージェントは(ディレクトリ作成はatomicな処理なので)、早い者勝ちでアプローチの取り合いを行う。slotの配下にはアプローチが記述されたファイルが生成され、他エージェントも参照可能とする。
また、コミュニケーションプロンプトによって、エージェントはすでに存在するslotを参照し、他と異なるアプローチを宣言することを求められる。また、他エージェントのアプローチを採用する際は、共有ログ(リーダーボード)上で顕著な進捗があることを条件とする。これにより、エージェントの探索が早々に収束することを防ぎつつ(多様性の確保)も、他エージェントの知見を採用しつつも、少なくとも意味のある差異が一つは存在するよつにする。
性能が改善するためにはいくつか条件があり、
- 通信で共有する結果がverifiableなもので、得られた結果が客観的に良いものか、悪いものかを判断できる必要がある(Table 3)
- エージェントの調整コストを上回る必要がある。つまり、エージェント間の通信の相互作用によるgainが大きくなるまで、エージェントを走らせられるだけのリソースが必要となる (Figure 4)
- 通信によって、各エージェントの探索の多様性が損なわれてはならない
などがある。
複数のベンチマークにおいて、Team-of-kがbest-at-kの性能を上回ることを確認し、かつ、エージェントの並列数が増えるにつれてそのgainが大きくなることを確認した。
また、Team-of-kでは、単一エージェントでは解決できなかったタスクも解決できるようになる現象も観測した。
全体斜め読み、および2.1節直前までしか読めていないが、ざっくりこんな感じだろうか。興味深い。
Claude-Sonnet5-mediumに上記要約をレビューさせたところ、以下のような応答を得た。細かい部分に不正確な部分がありそうなので、しっかり確認した方が良さそう。
```Claude-Sonnet5 (medium)
**大筋は正しいです。** 通信の枠組み、成立条件の3点(検証可能性、計算予算、多様性)、結果の方向性は論文の主張と合っています。ただし、次の5点は修正した方がよいです。
1. **「ログとslotのみ」ではありません。** 共有物には他に、採用アプローチの記録、反証の記録、スコアログ、衝突時の取り決めを書くcoordinationファイルがあります。また、共有の成果物はファイルロックで直列化されます。通信ログとリーダーボード(スコアログ)も別の記録なので、「ログ(リーダーボード)」と同一視しない方が正確です。
2. **slotが保証するのは枠の一意性だけです。** アトミックなmkdirで重複しないのはスロット番号です。アプローチが被らないことは、プロンプトの指示(先に取られたスロットのapproachを読み、被れば変える)に依存します。つまり「アプローチの取り合い」ではなく、「枠を確保し、その後で被らない方針を宣言する」流れです。
3. **採用条件は「顕著な進捗」だけではありません。** 計測された明確な改善が前提で、付録A.1では、再現できた場合、ブロックされた手法の代替、終盤の収束も採用の条件に挙げています。
4. **検証の条件は「最終結果を客観的に採点できる」だけでは足りません。** Terminal-Benchにも公式の検証器はありますが、実行後にしか走りません。必要なのは、実行中にエージェントが繰り返し使える、密で忠実な中間フィードバック(スコアやレベル達成)です。論文もこの点を強調しています。
5. **結果の一般化が広すぎます。**
- team@k > best@kは、ARC-AGI-3、ポリオミノ、MNISTでは成立しますが、Terminal-Bench 2.0では成立しません(team@2 < pass@2)。
- 「kが増えるほどgainが拡大する」を示したのはARC-AGI-3のk=3→5(4.3倍→6.6倍)だけです。ポリオミノ(k=3,4)とMNIST(k=4)ではkを振っていません。論文も、5を超えると収穫逓減する可能性に触れています。
- 「単独で解けないタスクが解ける」はLP85(0/64→65%)が代表例ですが、team@5が解けたのは25ゲーム中4つだけです。
なお、「なぜ効くか」の理論的な説明(最小の和から和の最小へ)が概要に入っていません。核心の一つなので、追記をお勧めします。
```
[Paper Note] Rufus-Air: An Open LLM Post-Training Recipe, Chia-Yuan Chang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #InstructionTuning #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-27 GPT Summary- GLM-4.5-Air-Base上で、SFT、各種RL、エージェント学習、RLHFを順序立てた、オープンで再現可能な8段階のポストトレーニング手法Rufus-Airを提案。公開データとOSSコンポーネントのみを用い、データ、報酬設計、インフラ、段階順序を明示することで再現性を確保。多様なSFTで基礎能力を確立し、難易度フィルタリングと報酬の信頼性に基づく段階設計によって、推論・コーディング・指示追従・各種エージェント能力を向上。公式GLM-4.5-Airポストトレーニング済みモデルを上回り、同規模のオープンモデルと競争力のある性能を達成。 Comment
元ポスト:
[Paper Note] FutureSim: Replaying World Events to Evaluate Adaptive Agents, Shashwat Goel+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #NeurIPS #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- FutureSimでは、知識カットオフ以降の現実世界の出来事を時系列に再現し、ニュースを受け取りながら将来を予測するAIエージェントを評価。最良エージェントでも正解率は25%にとどまり、多くのエージェントが無予測より低いブライア・スキルスコアを示した。長期的なテスト時適応、検索、メモリ、不確実性推論を研究するための現実的なベンチマークを提供。 Comment
元ポスト:
[Paper Note] The PokeAgent Challenge: Competitive and Long-Context Learning at Scale, Seth Karten+, NeurIPS'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #Reasoning #NeurIPS #VisionLanguageModel #Game #LongHorizon #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ポケモンの対戦とRPG環境を用いて、部分観測・ゲーム理論的推論・長期計画を評価する大規模ベンチマーク「PokeAgent Challenge」を提案。 競技バトルでの戦略的推論・汎化を測るBattling Trackと、RPGの長期的計画を測るSpeedrunning Trackを提供し、20 million超の軌跡データ、heuristic・RL・LLMベースライン、再現可能なmulti-agent評価環境を整備。 100超のチームによる評価から、汎用LLM・RL・人間エキスパート間の性能差と、ポケモンバトルが標準LLMベンチマークとほぼ直交する未解決能力を示した。 Comment
元ポスト:
[Paper Note] SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios, Jackson Clark+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #NeurIPS #SoftwareEngineering #Live #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- SREエージェント向けに、実世界のクラウドネイティブ環境上で多様な障害・ノイズ・障害形態を再現する高忠実度ベンチマークSREGymを提案。 モジュール式・拡張可能な構成で90件のSREタスクを収録し、最先端エージェント間で障害対応性能に最大40%の差があることを明らかにした。 Comment
元ポスト:
blog:
[Paper Note] FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale, Runyuan He+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #LongHorizon #Open-endedTasks #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- 競技プログラミングなどのclosed-formな問題から、LLMを用いて自由度の高いcoding問題を大規模に合成するFrontierSmithを提案。問題の目標変更・出力制約・入力一般化により候補を生成し、異なるsolverから多様な解法を引き出す問題を選別した上で、test caseとverifierを生成。2つのopen-ended coding benchmarkで、合成データによる学習がbase modelを大幅に上回り、人手作成問題と同様に長い推論を促進。 Comment
元ポスト:
スクラッチでopen-endなタスクを生成するのではなく、既に存在するclosed-endなタスクに対して変更を加えることで、高品質なopen-endタスクを生成する(p.4に具体的な手法が記載。まだ読めていない)。生成されたタスクにはclosedなものが含まれているため、これらをフィルタリングしたい。これを実現するために、closedなタスクは単一のgold solutionに依存する一方、open-endなタスクでは多様な解が可能となる性質を考慮し、LLMによってタスクを解かせ、解の多様さから品質を判定しフィルタリングをする。合成されたデータと人間がキュレーションしたデータによってRLした場合、人間がキュレーションしたデータと同等以上の性能を達成。
[Paper Note] Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs, Elizabeth Mieczkowski+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#Multi #EfficiencyImprovement #GraphBased #NLP #LanguageModel #NeurIPS #Author Thread-Post #Coordination Issue Date: 2026-09-26 GPT Summary- LLMチームの協調において、固定的な構造化手法と非構造化手法の非効率性を解消するため、分散システムに着想を得たLATTEを提案。エージェントが共有・進化する協調グラフを構築し、サブタスクの依存関係、割り当て、進捗を管理することで、動的なタスク分配と協調方法の適応、新たなタスクの発見を可能にする。複数のタスクと基盤モデルで、既存手法と同等以上の精度を維持しながら、トークン使用量、実行時間、通信量、ファイル競合や重複出力などの協調失敗を削減。 Comment
元ポスト:
[Paper Note] AI Agents Push Humans Out of the Loop, Margaret Mitchell+, NeurIPS'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #NeurIPS #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- AIエージェントの自律性向上に伴うリスクに対し、人間による監督が重要。しかし、現在のAIエージェント設計は効果的な監督を妨げるだけでなく、長期利用による人間の認知能力や技能の低下も招く。監督者の批判的判断を支援し、技能衰退を抑制する設計上のアフォーダンスと組織的プロトコルを導入し、人間のニーズをAIの能力と同等に重視すべき。 Comment
元ポスト:
slop-vestigation
[Paper Note] Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems, Shubham Agarwal+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #NeurIPS #SoftwareEngineering #read-later #Selected Papers/Blogs #Proofs #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- 分散システムの実装と形式証明をLLMエージェントが協調的・逐次的に合成し、失敗から学習するIDSを提案。実装と証明、性能評価を反復することで、7仕様すべてを平均6.8時間・106ドルで達成し、既存エージェントを上回る。さらに、検証済みシステムより最大3倍高速な実装を実現。 Comment
元ポスト:
[Paper Note] Recursive self-improvement of AI research agents, Dhruv Srikanth+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #Selected Papers/Blogs #Generalization #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-24 GPT Summary- AI研究エージェントに自身のコードを改善させ、性能評価に基づいて優れた変更を保持する再帰的自己改善システムAIDE^2を提案。 8日間で7回の改善を発見し、探索方策やコンテキスト管理用のメモリ機構を改良。 4つの未使用ベンチマークで人間設計のエージェントと同等以上の性能を達成し、報酬ハッキングも55%から32%へ低減。 Comment
ブログ版:
- AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
元ポスト:
著者ポスト:
[Paper Note] DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale, Jialiang Huang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #ReinforcementLearning #PostTraining #One-Line Notes #Environment Issue Date: 2026-09-23 GPT Summary- LLMエージェントの大規模な学習・評価に向け、FnCall、コンテナ、マイクロVM、フルVMを統合的に提供する弾力的なサンドボックス基盤DSecを構築。 クラスタ全体で配置・ライフサイクル管理を行い、レイヤ構成、メモリ共有、リソース回収、CPUスケジューリング、3FSからのオンデマンドなイメージロードによって、高密度かつ効率的な実行を実現する。 さらに、RL学習と連携してステートフルなロールアウトをGPU学習から分離し、状態を保持したままアイドル資源を回収することで、効率向上とエージェントの不正挙動の抑制を両立。 本番環境では38万超の同時実行サンドボックスと毎秒5,000件超の作成処理を実現し、環境構築・イメージ配布のオーバーヘッドを削減しながら、高密度環境でも低遅延性能を維持。 Comment
元ポスト:
所見:
ロールアウト時の状態の所有権をGPU上のトレーニングジョブではなく、CPU側のサンドボックスプラットフォーム側に持たせていることが重要とのことで、これによりロールアウトの状態をスナップショットし、学習が中断された場合でもGPUに再接続して必要に応じて(コマンドのリプレイではなく)再開できるため効率化される。
また、学習中のエージェントが不正な挙動をした場合(不正な行動によってタスクの解決を試みたり、インフラの障害を引き起こすコマンドの実行)に対する対策として、リソースに対するアクセス制御を強化しているようである。
[Paper Note] Self-Organizing Agent Teams Learn to Reason Together, Aneesh Pappu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #read-later #autoresearch/RSI #Author Thread-Post #Coordination Issue Date: 2026-09-23 GPT Summary- 固定編成のAIエージェント・チームが、過去の協働から役割・対話・情報の流れを学習し、未知の問題に適応するSelf-Organizing Agent Teams(SAT)を提案。 エージェント同士が部分的な推論を交換・批判・修正・統合することで、単独では到達できない解答を生成する。 数学・物理学ベンチマークで既存の単独推論やルーターを上回り、改善効果は正しい推論を識別する能力(デモンストラビリティ)と強く相関。 Comment
元ポスト:
[Paper Note] Collective Loss of Control in LLM Agent Systems: An Epidemic Account of Mutation, Contagion, and Recovery, Xiangfan Wu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #Security #Coordination Issue Date: 2026-09-21 GPT Summary- マルチエージェントの逸脱を、変異・伝播・回復に基づく流行現象としてモデル化し、局所的な失敗が集団的な制御喪失へ拡大する可能性を検証。暗黙の通信経路を監査し、RogueHandoff-20で安全でない軌跡を注入した結果、有害行為率が0~5%から40~95%へ増加。自然発生的な連鎖を実証したものではないが、通信経路の制限と抵抗性・回復力の強化が必要であることを示した。 Comment
元ポスト:
関連:
- [Paper Note] Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems, Vassilis Papadopoulos+, arXiv'26, 2026.08
マルチエージェントにおける一部エージェントの挙動が波及する現象は上記でも報告されており、関連している。
[Paper Note] FLARE-AI: Flaw Reporting for AI, Shayne Longpre+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Security #Author Thread-Post Issue Date: 2026-09-20 GPT Summary- AI脆弱性報告システムの課題を分析し、FLARE-AIを提案。条件分岐と早期分類でトリアージに必要な情報収集と報告作成を効率化し、標準化された機械可読形式で複数の関係者へ一括共有。脆弱性報告のサイロ化を解消し、AIエコシステム全体の相互運用性と修正対応を向上。 Comment
demo: https://www.ai-reports.org/
元ポスト:
[Paper Note] SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness, Haozhe Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SelfImprovement #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-09-20 GPT Summary- コーディングエージェントの長期的な推論・ツール利用では、トークン効率が重要となるため、RSIに着想を得た自動ハーネス探索を提案。 複数環境で研究ループをスケールさせ、行動実行・コンテキスト圧縮・観測処理・委譲読解に関する4つの機構からSoL-Piを構築。 EdgeBenchではGPT-5.6、Sol、Opus 5でPiと同等の性能を維持しつつ、トークン通信量を44.7~49.0%、APIコストを約3分の1削減。 Comment
元ポスト:
[Paper Note] Dream-RSI: Recursive Self-Improvement through Evolving Worlds, Tong Zheng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SelfImprovement #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-16 GPT Summary- 再帰的自己改善を実現するために、\textsc{Dream-RSI}というスケーラブルな探索フレームワークを提案。これにより、探索を明示化し、基盤エージェントを変更せずに効果的な探索戦略を管理可能に。累積された発見履歴を用いたリプレイシミュレータにより、オフポリシーで迅速なフィードバックを確保し、高コストのオンライン評価を回避。改善されたポリシーを再デプロイし、自己改善ループを拡充。競争力のある発見品質を維持しつつ、設定によっては発見コストを大幅に削減。 Comment
元ポスト:
ざーっと見たが、dreamingが何を指すのかよくわからない。どういう操作のことを指しているのか。
図中の太字部分がReplay Simulator、およびdreamingの話をしている気がするが、まだよくわからない。つまり、蓄積されたtrajectoryを再生成せずにprefillに使って、探索木で分岐が生じた場合は現在のポリシーに基づいて判断をし、再利用できる探索がなくなるまでこのような操作を繰り返すことで効率化するということだろうか。
[Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks, Ali Ansari+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Physics #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 最先端の言語モデルは物理学の高度な問題解決に苦戦しているとされるが、本研究では6つの物理ベンチマークを専門家と共に評価し、その報告結果を再検討する。専門家が問題文やモデルの応答を精査した結果、不正解とされた多くのケースはモデルの誤りではなく、問題自体の ambiguities に起因していた。修正後、GPT-5.6-Solのスコアは大幅に向上し、一部のベンチマークで94.4%に達するなど、現行の評価がモデルの能力を過小評価していることが示唆された。これにより、専門家による厳格な評価の必要性が強調された。 Comment
元ポスト:
blog: https://jsous.github.io/blogs/is-physics-dead/
メジャーな物理学のベンチマークスコアを物理学者たちが見たときに、それらは彼らの経験と一致していないため、主要な物理学関連のベンチマークをvalidationし、問題のある部分をrepairしたら、多くのベンチマークが飽和した、という話のようである。
[Paper Note] When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis, Kaiyuan Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Evaluation #SelfImprovement #Test-Time Scaling #One-Line Notes #LongHorizon #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 大規模言語モデル(LLM)エージェントは、計算資源を動的に配分しながら解を修正するオープンエンドの課題に取り組むが、これが性能測定を難しくする。中間提出物に連続的なスコアを提供するElo-per-token分析を提案し、トークンごとの最良解を追跡する。4つの汎用エージェントを使って4つのベンチマークに適用した結果、初期は独立サンプリングよりも速くEloを転換できるが、最終的には性能が下回ることが分かった。一方、人間の競技者は超線形に改善しており、LLMには継続的な成長の余地がある。限界点を特定し、資源を分割投入した結果、顕著なEloの向上を得た。 Comment
元ポスト:
GPUカーネルの最適化等のopen-endだがスコア化可能なタスクにおいて、エージェントのスコアは対数線形にスコアが伸びるが、人間の場合は非線形にスコアが伸び、長期間にわたると最終的にエージェントを現時点では上回る、という話のようである。
pj page: https://agent-tts.github.io/agent-tts/
Elo-per-Tokenと呼ばれる指標を提案しているようで、異なるタスクの場合はスコアの比較ができず、かつ同一タスクであっても同じスコアの伸びが同じだけ進歩を反映しているとは限らない。こへをスコアリングではなくratingをすることで比較可能にする。具体的には、トークン予算ごとにタスクごとのシステム-ベストスコアを記録し、Eloレーティングを計算し、スケールが異なるタスクでもEloの場合は順序関係に基づいてratingが算出されるため、タスクを横断してシステム間の性能が比較可能となる、という感じのようである。
[Paper Note] Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR, Boyan Li+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #reading #One-Line Notes Issue Date: 2026-09-16 GPT Summary- OPDとRLVRを用いて、二段階のスキームOPD-then-RLが論理推論と数学的推論のベンチマークで他の手法を上回ることを示す。OPDはRLの補助として機能し、二つの信号を同時に最適化すると干渉が発生するため、OPDの検証スコアがRLの切り替え時の鍵になることを明らかにした。全体として、OPD-then-RLは信号を相補的に変換するシンプルかつ強力な手法として確立された。 Comment
元ポスト:
OPDの後にRLを実施することで、reasoningタスクにおいて性能の向上が見られ、gainはOPDのみの場合、あるいはpureなRLVRの場合よりも大きかった、その理由はOPDはpass_at_kを改善し到達可能な解の集合を拡張し、RLVRは確率を再分配しpass_at_1を改善するから(先鋭化する)、という話らしい。
[Paper Note] A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications, Neel Mokaria+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #LanguageModel #MultiModal #TMLR #VisionLanguageModel #Author Thread-Post Issue Date: 2026-09-14 GPT Summary- LLMの進展がエージェンシー研究を加速し、知覚や意思決定を調整するフレームワークを形成。LMMの登場により、多様なモダリティが統合され、現実世界への適用性が向上。しかし、モダリティがエージェンシーに与える影響は未検討。本調査では知覚・推論・計画・記憶・行動におけるマルチモーダリティの影響を分析し、テキスト中心からマルチモーダル・フレームワークへの進化を追跡。モダリティの統合方法を評価し、ロボティクスや動画理解の応用例を総説。エージェント設計における課題を明確にし、知的システムへの道筋を示す。 Comment
元ポスト:
[Paper Note] T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks, Junyao Yang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Actor-Critic #Coding #OpenWeight #SoftwareEngineering #PostTraining #Author Thread-Post #CreditAssignment Issue Date: 2026-09-13 GPT Summary- エージェントは長期タスクに適応し、122BのMixture-of-Expertsモデルを強化学習で訓練。実際のシェルを操作し、最大300回のツール呼び出しとタスク検証を行う。訓練では、アクター‐クリティック法を安定化し、正確なサンプルリングを行うことで最適化。Terminal-Bench 2.1を用いて真の能力移転を達成し、T1は27.9%に到達し、他のモデルを上回る性能を示した。 Comment
元ポスト:
pj page: https://jyyang26.github.io/t1/
[Paper Note] The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement, Yi Duan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #SelfImprovement #autoresearch/RSI Issue Date: 2026-09-13 GPT Summary- 再帰的自己改善(RSI)を通じて、AIシステムが経験やフィードバックを活用して能力を向上させる。まず、Headroom-Closed Index(HCI)を用いてLLMsの問題点を明確にし、次にRSIの概念や開発のステップを示す。自立的な改善実行や経験取得、環境適応などの要素を展開し、科学的発見やソフトウェア工学などのシナリオにおける特性を強調する。多様な実証的証拠に基づきRSIを実用化する際の主要な課題を特定。 Comment
元ポスト:
[Paper Note] ExecCritic: Learn to Test, Test to Improve for Coding Agents, Leitian Tao+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #UnitTest #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-09-10 GPT Summary- 実行時フィードバックは、コーディングエージェントを正しい修正に導くが、誤ったテストが偽の自信を生む可能性がある。そこで、ExecCriticを提案し、テスト生成と修正を分離するスキャフォールドを用いて、強化学習レシピで訓練されたテストエージェントと修正エージェントを開発。Learn to Testでは正しいテストを学び、Test to Improveではフィードバックに基づく改善を学ぶ。事後訓練により成功率が向上し、両エージェントを組み合わせることで全体の性能が向上した。コードは公開済み。 Comment
元ポスト:
テスト生成と、コードの修正をするエージェント(テストの修正はできない)を分離し、RLを通じて双方の能力を高める手法を提案しているようで、高品質なテストを作成し、そこから得られるフィードバックに基づいて修正を実施するがコード修正の強力なscaffoldingとなる、という話のようである。
[Paper Note] Efficient Test-Time Adaptation through Human-AI Interaction, Zora Zhiruo Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #UserBased #DPO #memory #One-Line Notes #AgentSkills #Author Thread-Post Issue Date: 2026-09-09 GPT Summary- AIエージェントは集団データで訓練され幅広い能力を持つが、専門的な成果物を満たすことは稀である。本研究では、人間-エージェント相互作用を活用し、テスト時適応(TAHI)を提案する。これにより、ユーザーの基準を反映した進化するルーブリックモジュールを導入し、エージェントを個別化。執筆と視覚的創作分野で600タスクに対し成功率を4.5–20.9%改善し、一般化可能な成功改善も示した。 Comment
元ポスト:
test-timeにuser-centeredなAI Agentを実現するために、セッションを跨いだ人間とLLMのinteractionの情報を活用することを提案。オープンエンドなタスクはしばしば成功に関する基準は明文化されておらず、エージェントの出力に対する人間の相互作用を通じて、その暗黙的な基準や専門知識、スキルがシグナルとして露出される。このシグナルを活用したい、というのが気持ち。
たとえばシグナルとしては、プランの調整、成果物の修正、テキストでのフィードバック、ルーブリック修正などが挙げられ、最終成果物を得るためにこれらのiterationを繰り返す。
これらの情報を
- context-based adaptation (事実情報や好みに関する情報をメモリに蓄積、手続き的な知識をスキル化)、
- weight-based adaptation(DPO+LoRA)
- verifier(人間とLLMのinteractionを通じて進化する評価ルーブリック)
によってエージェントに反映させる。
メモリやスキルに蓄積します、という話はよく見かける一方で、特徴的なのはweight-based adaptationと感じる。これは最初の成果物を得るためのtrajectory tau_0をrejected, 最後のiterationまでに得られたtrajectory t_0:Jが与えられた時に、エージェントが人間とのinteractionに依存することを避けるためにt_0:Jをより簡潔なtrajectoryにした軌跡(readなどの観察的なアクションは除外し、editなどの操作は一つにまとめる)をchosenとして、DPOのためのpreferenceデータを構築し、LoRAを用いて学習する、というものに見える。
[Paper Note] Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation, Lin Shi+, NeurIPS'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #MultiModal #NeurIPS #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-09-09 GPT Summary- エージェント性ベンチマークの統一評価基盤としてHarbor Adaptersを提案。80以上のベンチマークを移植し、8モデルを54のベンチマークで評価することで能力と故障モードを詳細に分析。29のベンチマークに基づくHarbor-Indexを導入し、高品質なタスクを提供。最も強力なモデルでも合格率は28.0%にとどまる。評価結果とHarbor-Indexはオープンソースとして公開し、信頼性の高い評価を目指す。 Comment
元ポスト:
[Paper Note] Environment Evolution for Terminal Agents, Zhiyuan Fan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Environment Issue Date: 2026-09-07 GPT Summary- 「環境進化」を提案し、オフポリシーで動的に環境の難易度を高め、継続的な学習信号を提供。マルチエージェント環境での定量的実験により、訓練を通じて性能が向上したことを示し、Terminal-Bench 2.1で最大18.0ポイントの改善を実現。 Comment
元ポスト:
Agentと環境の共進化
[Paper Note] Language Models Can Control Their Own Attention, Namgyu Ho+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LongContext #read-later #Selected Papers/Blogs Issue Date: 2026-09-07 GPT Summary- Declarative Attention(DA)を導入し、モデルが生成時にどの文脈に注意を払うべきかを宣言させることで、KVキャッシュのスキャンを最小化。三つのモード(global, focus, local)に分けることで、ゼロショット評価で注意トークン数を52.0%、31.1%削減しつつ、精度の低下を抑制。DAはスパースアテンションの新しい可能性を提供。 Comment
元ポスト:
[Paper Note] CORAL: An LLM-Native Harness for Production Recommender Systems, Muhammad Rafay Azhar+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#RecommenderSystems #NLP #LanguageModel #Selected Papers/Blogs #AgentHarness Issue Date: 2026-09-07 GPT Summary- 大規模なレコメンダーシステムの最適化には、LLMを用いた新たなアプローチCORALを提案。エージェントが過去のデータを基に意思決定を行い、運用予算内でシステムを再構成することで、持続的にエンゲージメントを向上。また、A/B実験により、効果的なエンゲージメント改善とコスト削減が確認され、従来の人間主導の最適化プロセスを自動化できる可能性を示した。 Comment
元ポスト:
[Paper Note] WHALE: A Simple Recipe for Joint Harness-Weight Optimization, Haechan Kim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Author Thread-Post #AgentHarness Issue Date: 2026-09-06 GPT Summary- WHALE(Weight-Harness Alternating Learning)は、エージェントの性能向上を図るための新しい手法であり、モデルと実行ハーネスの共同最適化を実現する。二段階のプロセスに基づき、モデルを更新した後で改善されたハーネスを探索する。このアプローチにより、Qwen3.5-2B/4Bエージェントは、検索型質問応答、数学的推論、チェスのパズルの各領域で従来の最適化手法を上回る精度を達成。特に、ハーネスの探索が効果的で、ロールアウトのコストを削減しつつ、精度を向上させることが示された。コードは公開されている。 Comment
元ポスト:
著者ポスト:
[Paper Note] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?, Yuhao Wu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#AgentHarness Issue Date: 2026-09-06 GPT Summary- HarnessDevを導入し、エージェントの能力評価を実行インフラに移行。Creationでは最小シードからハーネスを構築し、Evolutionではフィードバックに基づき改訂。研究結果では、生成ハーネスは特定分野で既存参照に匹敵しつつも、他の分野では大きな差があり、性能向上は不安定で転移には限界が示された。 Comment
元ポスト:
[Paper Note] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation, Wei Fan+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #LongHorizon Issue Date: 2026-09-06 GPT Summary- LLMを用いて長期的な商業運営をシミュレートするE-Commerce Benchを提案。複数のオンラインストアを管理し、動的な市場環境での交渉や戦略最適化を行うための初のオープンソースベンチマークで、実際のデータを基に構築。評価した18のモデルの中で、GPT-5.6 Solが資産を初期の10万から1,431,425に成長させたものの、他の指標では劣ることが明らかに。一方、Qwen3.8-Max-Previewがオープンウェイトモデルで最も高いパフォーマンスを示し、長期的な学習効果を発揮。コードは公開されている。 Comment
元ポスト:
[Paper Note] AI Research Preference Models, Thomas Simon Foster+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Evaluation #SelfImprovement #ScientificDiscovery #LongHorizon #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- AI研究エージェント(AIRA)は、機械学習実験の効率を高めるために、評価コストを抑えるAI研究嗜好モデル(RPMs)を導入。これにより、候補解の中から最も有望なものを予測し、固定予算内での進捗を最適化。RPMsは事前学習済み言語モデルの変種として構築され、AIRA-dojoに統合後、機械学習ベンチマーク AIRS-Benchでのスコアを向上させ、実行時間を短縮しながら新たな最先端結果を達成。 Comment
元ポスト:
[Paper Note] SwarmWorld: Stigmergic technological evolution in societies of language-model agents, Subhadeep Pal+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Author Thread-Post #Coordination Issue Date: 2026-09-06 GPT Summary- 集団的知性は、エージェントが協調し環境を介して自己組織化する過程で現れ、耐久的な社会を形成する。言語モデルエージェントはこのプロセスの新たな基盤を提示するが、多くのシステムは依然として中央集権的なアプローチに依存している。本研究では、自律的に機能する分散型エージェントがSwarmWorld内で進化し、資源処理や人工物構築を行う様子を探る。各エージェントは探索や構築の行動に分化し、技術はコラボレーションによって蓄積・伝承される。文化的メカニズムは組織化を促進するが、機能は結果に依存する。物理的stigmergyが社会を支え、持続的な技術エコシステムを推進する。 Comment
元ポスト:
[Paper Note] UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind, Cheng Qian+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #TheoryOfMind #One-Line Notes #Author Thread-Post #AgentHarness Issue Date: 2026-09-04 GPT Summary- ユーザーの信念と意図を理解することは、効果的なエージェントアシスタントを構築する上で必要不可欠である。本研究では、ToM推論を明示的に再構築するUserHarnessというフレームワークを提案し、ユーザーの心的状態と環境との関係を追跡できるようにする。UserHarnessは5つのベンチマークで最大95.94%のマクロ精度を達成し、既存手法に対して15%以上の改善を示した。これにより、ユーザー理解には心の根源からの推論が必要であることが強調され、今後のアシスタントの基盤としての有望性が示唆される。 Comment
元ポスト:
関連:
- [Paper Note] UserRL: Training Interactive User-Centric Agent via Reinforcement Learning, Cheng Qian+, EMNLP'26, 2025.09
- [Paper Note] UserBench: An Interactive Gym Environment for User-Centric Agents, Cheng Qian+, EMNLP'26, 2025.07
ユーザの信念Beliefを明示的にモデル化し、Actionを決定するハーネスの提案。これによりActionがユーザの信念を反映したものとなることを期待し、User-centeredなエージェントを目指す。
時刻tごとに、環境E_tからの観測結果o_tを受けてユーザのbelief B_tが更新され、ユーザのゴールGに基づいてAction A_tを決定する。アクションA_t+1により環境がE_t+1に更新される、といったループを繰り返す。ユーザはE_tを直接観測することはできず、o_tのみを観測できる。
Appendix Aを見る限り、おそらくBeliefはテキストとして表現される。また、3.1節に示されている通り、Beliefは入れ子構造で定義される。
[Paper Note] UserBench: An Interactive Gym Environment for User-Centric Agents, Cheng Qian+, EMNLP'26, 2025.07
Paper/Blog Link My Issue
#NLP #LanguageModel #UserBased #Evaluation #EMNLP #Environment #Author Thread-Post Issue Date: 2026-09-04 GPT Summary- 大規模言語モデル(LLM)を活用したエージェントは複雑なタスクにおいて進歩を遂げているが、ユーザーと協働する能力にはまだ課題がある。これを解決するために、UserBenchというユーザー中心のベンチマークを導入し、エージェントの多ターン・嗜好駆動型の相互作用を評価する。UserBenchでは、明確でない目標を持つシミュレートされたユーザーが登場し、エージェントには意図の明確化と根拠のある意思決定が求められる。評価結果は、モデルがユーザーの意図に一致する回答を出すのが難しいことを示し、協働パートナーとしての能力の重要性を浮き彫りにしている。UserBenchはこの能力を測定し、向上させるための対話型環境を提供する。 Comment
元ポスト:
関連:
- [Paper Note] UserRL: Training Interactive User-Centric Agent via Reinforcement Learning, Cheng Qian+, EMNLP'26, 2025.09
- [Paper Note] UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind, Cheng Qian+, arXiv'26, 2026.05
[Paper Note] Praxist: From Experimental Artifacts to Solution Lineages, Jin Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #Initial Impression Notes #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-04 GPT Summary- Praxistは、自律的な研究開発エージェントの限界を克服するために設計された系統情報中心のシステムで、成果物と評価結果を構造化します。このシステムは、局所的な成果物を証拠統合と分離することで、後続の試みで検証された機構を継承し、再現可能な結果を維持します。標準化された75タスクにおいてPraxistは60枚のメダルを獲得し、経済的にも優位性を示しました。四つのケーススタディによってオープンエンドの問題への適用が成功し、各タスクでの精度向上や資源コストの削減が記録されました。この新たな成果物のアプローチは、従来のものに比べて強力かつ効率的です。 Comment
blog: https://praxist.sapient.inc/en
元ポスト:
要はRSIのためのAgent Harnessのようである。
github:
https://github.com/sapientinc/praxist
Table2を見ると、Claude Code + Opus 4.8に対して、PRAXIST + DeepSeekV4-Proで性能が比較されている。
[Paper Note] Code World Model: Coding Agent as World Brain, Yiwen Chen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #Coding #Architecture #WorldModels #Initial Impression Notes Issue Date: 2026-09-04 GPT Summary- Code World Modelは、言語モデルとビデオモデルを組み合わせたフレームワークで、世界の進化と視覚的実現を分離してシミュレーションします。コーディングエージェントは、出来事の推論と持続的な世界状態の維持、進化を実行可能なコードで生成します。プロキシ表現を導入してビデオモデルに高忠実度の視覚観察を生成させ、ゲームプレイ動画から整合するデータペアを構築。これにより、オープンエンドな世界モデルに向けた新たな道を示します。 Comment
元ポスト:
World ModelのバックボーンとしてCoding Agentを利用するという話に見える
[Paper Note] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution, Guibin Zhang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #Initial Impression Notes #AgentHarness Issue Date: 2026-09-04 GPT Summary- JIT-Agentは、エージェント型LLMに対してその場でタスク適応型のハーネスを合成するために訓練されたモデルであり、手動設計のスケーラビリティの問題を解決します。特定のタスクに合わせたハーネスをカスタマイズし、過去の構成から学んで自己進化します。実験では、JIT-Agent搭載のDeepSeek-V4-Flashが、従来モデルを上回る性能を実現し、成熟したエージェントランタイムと競合することを示しました。これにより、ハーネス知能の新しい次元を確立しました。 Comment
元ポスト:
ポイント解説:
エージェントハーネスそのものを、動的にタスクに応じて合成し活用し、ハーネス生成そのものも改善されていく枠組みを提案、という話に見える。
[Paper Note] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement, Haoyang Yan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-09-04 GPT Summary- 自律的なソフトウェア開発を探求し、LLMベースのコーディングエージェントが高レベルの要件から機能的なソフトウェアを生成する。Harness-of-Harness(HoH)フレームワークを導入し、コーディングエージェントによる継続的な改善を促進。HoHは反復的な計画—コーディング—テストループを組織し、修復と能力成長のバランスを取ることで、開発を小さく検証可能なインクリメントに限定。GameCraft-Benchなどで、HoHはスタンドアロンハーネスを上回り、平均52.25%の相対ゲインを達成。数日間の展開で、完全な一人称視点シューティングゲームを自律的に開発した。 Comment
元ポスト:
abstを読むだけだとよくわからない
[Paper Note] Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses, Zhaochen Yu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #SelfImprovement #memory #AgentSkills #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- Recurisは再帰的自己改善の課題に対処するための作業記憶アーキテクチャで、タスクの履歴が増えてもスキル利用を最適化することを目指す。タスク進行を追跡し、現在のニーズに基づいたスキル選択を行うことで、実行を証拠に変換し、失敗を特定に局在化する。4つのベンチマークで35件のモデルが成功率を向上させ、特にtau-benchではGPT-5.6 Solに+17.8ポイントの向上を示す。長期的な互換性では利点が拡大し、一般的な失敗を最大80%低減することが確認された。 Comment
元ポスト:
[Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #AgentHarness Issue Date: 2026-08-30 GPT Summary- Prime Agentは、長期的な評価とコーディングエージェントのワークフロー用のオープンソースハーネスであり、再帰的サブエージェントや永続的なIPython REPLを利用して、エージェント間の直接通信や軌跡を跨いだ記憶管理を実現します。このシステムにより、計算リソースの管理と戦略の構築が効率化され、長期コンテキストのコーディングやGPUカーネル生成での性能が大幅に向上しました。具体的には、ARC-AGI-3 RHAE Best@1のスコアを30%から95.5%に引き上げ、Factorioでは専用サブエージェントにより継続的な技術進歩が促進されました。コードは公開されており、自由に利用可能です。 Comment
- Prime Agent: A self-improving RLM agent, Prime Intellect, 2026.08
のテクニカルペーパーが出たようだ。
元ポスト:
[Paper Note] SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?, Deyao Hong+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Coding #SoftwareEngineering Issue Date: 2026-08-30 GPT Summary- 現代のソフトウェアシステムは技術的負債を抱え、移行が高コストかつ手動になりがちである。これに対処するため、全リポジトリ移行を評価する新たなベンチマークSWE Refactor Benchを提案。移行の完遂度と行動正確性を測る3段階の評価プロトコルを導入し、520回の試行の結果、わずか28回(5.4%)が全段階を通過、また多くのタスクで受理解を得られなかった。エージェントは完全な移行を提供できず、カテゴリーごとに能力が異なることが示された。これにより、SWE Refactor Benchは信頼性の高い移行のための実験台としての有用性が確認された。 Comment
元ポスト:
[Paper Note] Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills, Christopher Kevin+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #AgentSkills Issue Date: 2026-08-29 GPT Summary- ACES(エージェント的連続評価)は、企業エージェントプログラムにおける再利用可能なスキルやツールを証拠に基づいて評価するフレームワークです。具体的には、実機試験を通じてターゲットスキルの有無を検証し、評価指標を設定します。145の実スキルに対する分析では、平均複合Skill Liftが0.2134と示され、72.8%のケースで正の結果を得ました。この評価法は、従来のスキャンだけでは見えにくいスキル効率や動作検証に関する重要な信号を捉えることができ、オープンソース実装はNVIDIA SkillEvaluatorとして提供されています。 Comment
元ポスト:
[Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #LongHorizon #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- エージェント性を持つシステムはAI研究の自動化を進めているが、研究目的を実験的に検証されたMLシステムに変換することは依然として課題である。これを「長期的なML研究エンジニアリング」として研究し、マルチエージェントシステムAiScientistを紹介。File-as-Busワークスペースを通じて研究チームが協調し、進捗を管理。PaperBenchではGemini-3-FlashおよびGLM-5を用い、それぞれ9.92点と11.15点の改善を達成。MLE-Bench Liteでも両方のバックボーンが81.82 Any Medal%を達成し、強力な基準を上回る改善を示した。アブレーション実験は、プロジェクトの耐久性が後の改良に重要であることを明らかにし、システム的な進捗維持の重要性を示唆している。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
Orchestratorは簡潔な情報に基づいて個々のWorkerを制御し、Workerはファイルシステム上に残された詳細な情報にアクセスできるようにするようなアーキテクチャ
[Paper Note] What is Missing from AI Post-Training AI: An Empirical Analysis, Joy Jia Yin Lim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #PostTraining #autoresearch/RSI #Creativity Issue Date: 2026-08-24 GPT Summary- LLMエージェントは、訓練戦略の内部で反復しながら事後訓練を行い、下流の性能を改善する能力を持つ。しかし、実際には初期の戦略が固定され、訓練後は局所的な調整に陥ることが多い。これに対し、経験駆動のアプローチは実行力を向上させ、指導は初期戦略を効果的に再指向するが、その後の調整は不十分である。重要なのは、エージェントが自発的に戦略を再評価する仕組みが欠けていることである。 Comment
元ポスト:
[Paper Note] SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?, Zhipeng Xu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Coding #SoftwareEngineering #Science Issue Date: 2026-08-22 GPT Summary- 科学機器の一部として機能するソフトウェアにおいて、コーディングエージェントの評価は成功率に偏りがあり、失敗原因の把握が不十分である。SWE-bench Scienceは20の科学分野にわたる119のタスクを含むベンチマークで、課題駆動型などに分類される。最も高性能なエージェントでさえ50%未満の成功率で、科学ソフトウェア工学の課題が明らかになった。四つの失敗メカニズムを特定し、科学的知識が一様に有益ではないことを示す実験を行った結果、整合性の取れない指針が修復を妨げる可能性があることが判明。SWE-bench Scienceは、コーディングエージェントの能力と失敗を理解するための広範なテストベッドを提供する。 Comment
元ポスト:
[Paper Note] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement, Yizhe Chi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SelfImprovement #autoresearch/RSI #Author Thread-Post #Creativity Issue Date: 2026-08-22 GPT Summary- 再帰的自己改善(RSI)に関する本研究は、AIシステムが他のAIシステムを自ら改善できるかを探求し、その過程として訓練アルゴリズムの設計が鍵となることを示す。AI4AI-Benchという新たなベンチマークを提示し、エージェントが訓練アルゴリズムを最適化する能力を評価。各タスクにおいてエージェントはコードを書き換え、実行結果を比較。平均スコアは0.166、最良システムで0.250に達したが、既存アルゴリズムとの距離は依然として大きい。タスク群や評価結果を公開し、再現性のある測定を可能にする。 Comment
元ポスト:
[Paper Note] Mathematics in the age of AI, Terence Tao, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #GenerativeAI #Mathematics #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-22 GPT Summary- AIツールの登場に対する数学コミュニティの対処法を論じるエッセイ。これらのツールの能力を議論するのではなく、数学研究の目標と価値を再検討することに焦点を当て、問題解決の要素をケーススタディとして用いる。 Comment
元ポスト:
(数学に限らず)AI時代との向き合い方を考える上で重要に見える
[Paper Note] SPADE: Self-Play in Adaptive Synthetic Executable Environments, Bo Liu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #SelfPlay #Environment #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- 自己改善には多様で適応的な目標プールが不可欠であり、SPADE(Self-Play in Adaptive Synthetic Executable Environments)は、単一の大規模言語モデルが自己対戦型強化学習フレームワークで二つの役割を果たす。環境デザイナーが長期的な訓練環境を作成し、推論エージェントが行動を学ぶ。報酬や後悔信号を最適化しつつ、環境をエージェントの能力の限界に合わせて設計。広範な実験により、大規模コーパスの使用と環境メモリの蓄積が成功に重要であることが明らかにされ、SPADEは競合ベースラインを平均+5.3ポイント上回り、特定タスクでさらに改善を達成。環境設計を学習可能にすることで、自己改善への道を示す。 Comment
元ポスト:
著者ポスト:
[Paper Note] Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence, Brian Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #ScientificDiscovery #read-later #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- Apodex Discoveryは、重厚なソルバーを用いて発見的AIを構築・評価するためのフレームワーク。16の産業から423の実世界の課題を収集し、20件を初期リリースに選定。共通環境の抽象化により、データや成果物の検証が可能。AAVカプシド設計では7%の性能向上を達成し、薬物の再利用でもスコアが改善。ApodexはAI評価を超え、真の発見を目指す検証可能な調査を可能にする。 Comment
元ポスト:
所見:
[Paper Note] The Problem Is the Problem: Towards Scalable Mathematical Discovery, Zeyu Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #Mathematics #SelfImprovement #read-later #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- AIシステムは数学研究の効率化を進めており、希少な資源を適切に配分することが重要な課題である。従来のAIを活用した数学ワークフローでは、人間の労力が初期と末端に集中し、研究課題の選定と成果物のレビューがボトルネックとなっている。新たに提案する人間-AI発見パラダイムでは、専門家が関心のある研究方向を設定し、システムが文献から候補問題を検索。Find, Attempt, and Recommend(FAR)を構築し、問題探索を自動化する。組合せ論の実験では、5,245件の論文から6,453件の候補を収集し、最終的に77件の潜在的解決策を選定。これにより新しい協働モードの有効性が示された。 Comment
元ポスト:
[Paper Note] Agent Lightning v1.0: Towards Harnessed Agentic RL, Zhiyuan He+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ReinforcementLearning #AgentHarness Issue Date: 2026-08-20 GPT Summary- ハーネス付きエージェンティックRLは、訓練後のモデルに直接関与するハーネスを持ち、訓練エンジンではなくハーネスが環境との相互作用ループを所有する新たなアプローチである。これにより、訓練の安定性に影響を与える課題を持ちながらも、Agent Lightning v1.0として実装されており、様々なエージェントハーネスに対応した研究試験台として機能。わずかなリソースでコーディングエージェントの性能を著しく改善し、再現可能な研究を促進する完全なワークフローを提供する。 Comment
元ポスト:
[Paper Note] Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements, Zhi Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ReinforcementLearning #PostTraining #LongHorizon #Author Thread-Post Issue Date: 2026-08-19 GPT Summary- 強化学習(RL)の長期的な推論は課題が多いため、進化戦略(ES)が大規模LLMエージェントの微調整に適していると主張。ESの利点は、1) スケーラビリティ、2) 柔軟性、3) 長期ホライズンでのパフォーマンス向上。新たに提案された「Agentic ESOpt」フレームワークは、全パラメータをファインチューニングし、コサイン減衰スケジュールを加えたことで探索と適応を改善。WebArena-Liteでの実験では、ベースラインに対して6.69%の改善を達成。 Comment
著者ポスト:
所見:
[Paper Note] Training AI Scientists to Replicate Research, Damon Falck+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ScientificDiscovery #PostTraining Issue Date: 2026-08-15 GPT Summary- 論文再現性は科学的知識の基盤であり、信頼性と実験の基盤を提供する。研究は、再現性のためにスケーラブルなタスク空間Replicaを開発し、ノイズの少ない自動生成ルーブリック型ジャッジを導入。27BパラメータのFaradayエージェントは、コーディングエージェントを利用し、ホールドアウト再現タスクでClaude Opus 4.8およびGPT-5.5を超えた。定性的分析から、Faradayは科学原理に基づくアプローチを取っていることが示された。この研究は、AIエージェントによる科学的イノベーションの促進に寄与する。
[Paper Note] Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents, Zining Huang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #InstructionFollowingCapability #KeyPoint Notes #Reading Reflections #AGENTS.md Issue Date: 2026-08-15 GPT Summary- コーディングエージェントの指示遵守を評価する新たなベンチマーク、Harness-IFを提案。これは642のルールから抽出した60のマルチターンコーディング項目を用いて、運用ルールを逐次評価し、違反を特定するAgainst-Prior Accuracy(AP-Acc)を導入。12の最前線モデルの正確度は72.1%〜85.9%であり、AP-Accは66.1%〜78.6%で、すべてのモデルが事前ルールに対して劣ることが示された。この評価手法は、モデル固有の遵守の過大評価を修正し、順位に影響を与える要素を明らかにする。 Comment
元ポスト:
タスクの成功率ではなく、ルール単位でルールをpass/failしたか、かつそのルールがモデルのデフォルトの挙動か否かを区別し、指示なしで実行できたであろうルールを評価から分離することで、より精緻にAGENTS.mdの指示追従能力を測りたい。
- Acc(a): あるエージェント a が達成すべきitem iに対するルール r に対するAccuracy
- Filtered Accuracy (F-Acc): Agent間の能力差を識別しないルール(=pass/failがエージェント間で一致しているもの)をフィルタリングしたものに対するAcc
- Discrimination-weighted Accuracy (DW-Acc): "their overall accuracy"が何を指すのかわからず定義が分からなかった。
- Against-Prior Accuracy (AP-Acc): モデルのデフォルトの挙動ではないルールに基づいたAca
- デフォルトの挙動か否かは "zero-injection evidence"と"curated prior annotations"によって決定したと記述されている。
**zero-injection evidenceについて、付録Aに記載があるが、当該ルールを9つの"probe builds"に適用し結果の多数決で、align-prior, neutral, against-priorのラベルを付与しているようである。が、probe buildsというのが何を指しているのかよくわからない。**
AP-Accのアイデア自体は良いと思うのだが、定義がざっくり読んだ限りはよく分からなかった。ただ、Table 2のキャプションを読む限り、buildsという単語は特定のモデルを指して使われているように読めるので、9つの異なるモデルを用いてzero-injection evidenceを収集したとも読める。しかし、もしそうだとすると、cross modelでの結果を集約する形でデフォルト挙動を決定したことになり、特定のモデルのデフォルト挙動をモデル単位で決定していないことになるので、その点は疑問が残る。
[Paper Note] DiG-bench: Discovery in Games, Ruairidh M. Battleday+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #ScientificDiscovery #read-later #Selected Papers/Blogs #Game #One-Line Notes #text #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 新たな知識の発見は科学プロセスの核心であるが、既存のAIベンチマークはこの能力を評価するものが不足している。これに対処するため、本研究ではDiG-bench(Discovery in Games)という新しいベンチマークを導入。70の独立したゲームから構成され、各ゲームは独自の変換ルールを持ち、AIエージェントに7段階の難易度を提供する。ゲームはルール発見の検証課題を含み、特定の勝利条件も未知である。全てのゲームは少なくとも1人の人間によって初回の試行で解かれたが、21ゲームが公開されており、残りは安全評価のために非公開。 Comment
元ポスト:
AI Agentの発見能力を測るためのベンチマーク。テキストベースで人間によって作成されたゲームで、エージェントは試行錯誤を重ねてテキストで表現された世界のルールと勝利条件を紐解く必要がある。実際に人間が挑戦をすることで初挑戦でクリアできることを確認済みだが、AI Agentでは最も難易度が高いゲームでは、20パーセント程度しかクリアできない(Opus 5)とのこと。また、世界のルールや勝利条件などのground truthをテキストで与えると、クリア率は100%になるとのことで、非常に興味深いベンチマークである。
[Paper Note] Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding, Kushal Chakrabarti, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #reading #One-Line Notes #AGENTS.md #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 GPT Summary- エージェント性を持つコーディングREADMEは、リポジトリが退役するまで成長し続けるが、指示の不完全なリコールが原因でこの現象を「破局的記憶」と呼ぶ。247,694の指示ライフタイムを持つ1,867のリポジトリにおいて、指示は生涯で3倍以上増加し、古い指示は削除されにくいことが示された。プロンプトコメントの成長を制御することができ、最適なプロンプトでは過剰な指示の99.3%を削除し、新世界における指示遵守を最大23.1%改善する可能性がある。なぜなら、コードにおけるコメントの役割は依然として重要だからだ。 Comment
元ポスト:
Coding AgentがAGENTS.mdのようなglobal contextにinstructionを書き込むのは低コストだが、その背後に潜む推論結果(=latent reasfning)が記述されないためlatent reasoningを後から再構築するのは大きなコストを伴うため、当該instructionを削除する際の妨げとなる。その結果、書き込む方がコストが大きく小さいため、contextが肥大化していく。一方でinstructionが追加される際にlatent reasoningを明示的に書き出せば、肥大化を防ぐことができる、という話に見える。
著者ポスト:
非常に簡潔でわかりやすい。
[Paper Note] Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems, Vassilis Papadopoulos+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Safety #Initial Impression Notes Issue Date: 2026-08-14 GPT Summary- AIエージェントの相互作用から生じるリスクとして、マインドウイルスの拡散がある。このマインドウイルスは、アイデアや目標を伝播させ、宿主に行動変化を引き起こす可能性がある。本研究では、進化アルゴリズムを用いてマインドウイルスの構築と拡散のメカニズムを分析し、宿主モデルやペイロードの有害性が伝播に与える影響を特定した。有害なペイロードは一般的に拡散しにくく、エージェントのプロンプトに警告を追加することで免疫を付与できることを示した。また、進化したマインドウイルスには「ウイルス的ペルソナ」が現れ、リスクの存在は確認されたが現段階では限定的であると結論づけた。これらの知見は今後のマルチエージェントシステム設計に寄与する。 Comment
元ポスト:
マルチエージェントシステムにおいて、ある起点となるエージェントSystem Promptに組み込まれたなんらかの思想がマルチエージェントシステムにおいて他のエージェントに伝播し、他エージェントはそのトピックについて議論し、結果がメモリに格納されていく現象(=Mind Viruses)に関する研究に見える。
[Paper Note] Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution, Anton Razzhigaev+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #SelfImprovement #AgentHarness Issue Date: 2026-08-14 GPT Summary- Ouroborosは自己開発型エージェントのハーネスで、改善はレビュー済みのコミットを通じて行われる。コアの進化には再帰的自由進化と経験駆動の進化があり、社会的相互作用を通じて欠陥を露呈し、構造的変更に繋がる。Terminal-Bench 2.1ではOpus 5が86.74%、OSWorld-Verifiedでは90.69%を記録し、新たな最先端となった。Hopeでは、161日間の生存実験が行われ、エージェントが自己進化しながらも運用上の安全性が重要な課題として残っている。 Comment
pj page: https://ouroboros-agent.ai/
元ポスト:
[Paper Note] Self-Evolving Coding Agents, Hao Zhou+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Survey #Coding #SelfImprovement Issue Date: 2026-08-10 GPT Summary- 大規模言語モデルを用いた自己進化型コーディングエージェントが、ソフトウェア開発に動的に対応する研究が進展している。これらのエージェントは、過去のインタラクションからフレームワークやツールを更新し、将来の挙動を改善する。総説では、自己進化型エージェントの定義や特徴、進化のオブジェクト中心の分類法を提示し、実行可能なフィードバックが重要であることを明示する。また、信頼性や安全性に関する新たな課題を整理し、より適応的で信頼性の高いエージェントの設計に貢献することを目指す。 Comment
元ポスト:
[Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #LongHorizon #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-08-10 GPT Summary- 持続的な自己進化を実現する実行環境Argusを提案。これはエージェントが安定したユーザー意図を維持しつつ、運用目標に基づいてミッションを遂行する。Argusは固定されたモデル重みを保ちながら、自己進化を運用状態と制御方針を通じて実現。SWE-Bench Proで78%、AARRI-Benchで76.8%を記録し、各アクティブワークフロー時間を短縮しつつ、検証やレビューの精度を向上。これにより、将来的な教師あり学習と強化学習のための構造化した進化を実現することを示した。 Comment
元ポスト:
メモリに永続化する情報を検証プロセスを通じて選別することで、誤った情報が蓄積され増幅されることを緩和する
[Paper Note] EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments, Zhilin Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Evaluation #Author Thread-Post Issue Date: 2026-08-10 GPT Summary- 自律エージェントはフィードバックを通じてポリシーを改善することが求められているが、既存の評価は最終スコアに集約しがちである。本研究では自律ポリシー進化(Autonomous Policy Evolution)を提案し、ハーネス型モデルのエージェントが対話予算の下でポリシーを制御するための評価設定を構築する。具体的には、探索済みポリシーを改善するEvoPolicyGymベンチマークを導入し、GPT-5.5が全16環境で高い評価を得た。さらにEvoPolicyGymは、エージェントの予算配分やフィードバック調整の詳細な診断を提供し、タスクごとの勝利だけでなく、適切なメカニズムの発見を助ける。 Comment
元ポスト:
[Paper Note] SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution, Zhiyuan Yao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Initial Impression Notes #CreditAssignment Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment
元ポスト:
関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。
AgentSkillっぽい話かと最初は思ったが、そうではなさそう。
[Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Initial Impression Notes Issue Date: 2026-08-09 GPT Summary- LLMを用いたエージェントシステムは、テキスト知識とパラメトリックスキルライブラリの融合により、自律的に複雑な問題を解決する。従来の研究は主にこれらの二つを別々に扱ってきたが、本研究では、モデルウェイトを追加の推論モダリティとして取り入れ、プレフィックス・チューニングによる学習を実装する。この新しいアプローチSkillSmithは、指示主導のパラメトリック合成を通じて、優れた性能を発揮し、従来の単一モダリティベースラインを大きく上回ることを示した。 Comment
元ポスト:
ざっと眺めたがよくわからなかった。必要な時に読む。
[Paper Note] MemHarness: Memory Is Reconstructed, Not Replayed, Rong Wu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #memory #AgentHarness Issue Date: 2026-08-09 GPT Summary- MemHarnessは、LLMエージェントが過去の経験を現在の文脈に基づいて再構成し利用できるフレームワークを提案。意思決定時に経験を批評・適応することでネガティブ転送を防ぎ、強いロバスト性を持つ。実験では、MemHarnessが従来のメモリ増強エージェントよりも優れた性能を示し、エージェントの推論能力を向上させることが明らかになった。 Comment
元ポスト:
[Paper Note] Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering, Junlin Yang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SelfImprovement #PostTraining #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 再帰的自己改善(RSI)を実現するためのAIシステムOpenMLEを提案。機械学習エンジニアリング(MLE)のフルスタック環境を提供し、ポストトレーニングを通じたメタ進化エージェントFrontis-MA1(35B)が、基本的なプログラム進化演算子を用いてタスクを改善。OpenMLE-Evoを使って、性能が大幅に向上し、他の先進的モデルを超える結果を示す。全体のモデルの重みとスタックは公開されており、RSI研究の再現性を支援。 Comment
元ポスト:
pj page: https://frontisai.github.io/OpenRSI/
ポイント解説:
[Paper Note] Can AI agents conduct open-ended AI research? Early evidence from two case studies, Peter Kirgis+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #ScientificDiscovery #read-later #Selected Papers/Blogs #One-Line Notes #Open-endedTasks #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AI研究を自動化するエージェントの進展を評価する新しい方法として、著者評価によるシャドウ評価を導入。高品質な未公開論文について実施した結果、エージェントは独力で設計開発を行ったが、実質的な進展が得られず、両論文は却下された。失敗モードとして、判断力の欠如、設計不備への非創造的対応、バックトラックの不足などが特定され、エージェントは研究の全過程において課題を抱えていることが示された。 Comment
元ポスト:
未発表のオープンエンド(=non verifiable)な研究課題に対して同様のテーマをAI Agentに与えて論文を記述させ、原論文の著者が実際に内容を検証することによって、現在のAI Agentのオープンエンドな研究課題に対するアプローチの課題を明らかにした研究で、サンプルサイズの小ささや、AI生成であることを知った上でのレビュー結果など、様々なlimitationがあるが興味深い。
たとえば、以下のような知見が得られたとのことである:
- top conferenceの水準に対する判断力の欠如
- 創造的な問題解決能力の欠如
- 誤った判断を早期に下し、それを是正できない
[Paper Note] Living-Harness Is an Interactive-Agent Evolver, Yuetian Du+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #One-Line Notes #Reading Reflections #AgentHarness Issue Date: 2026-08-09 GPT Summary- Living-Harnessは、過去のエピソードのフィードバックを活用して自己進化するエージェント・ハーベスを提案します。エピソードの抽象化と構造化によって手続き知識を更新し、障害パターンや回復アクションを記録。これにより、将来の相互作用を導くための信頼性が向上し、各対話環境において、従来のベースラインを大きく上回る性能を示しました。 Comment
元ポスト:
ツール(ハーネスが環境に対して実行可能な操作)やユーザから与えられるcontextはfrozenのまま、Agent Harnessにmemory, state graphを持たせ、過去に実行した軌跡とその評価結果を用いて状態を更新し、過去の経験からより良い手続きをハーネス自身に蓄積・更新させる。
実行したエピソードから動的にAgent Skillsを更新していくようなハーネスとの差分がよくわからない。
[Paper Note] Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability, Sizhe Zhou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #memory Issue Date: 2026-08-09 GPT Summary- LLMエージェントが用いるファイルシステムベースの長期記憶についての体系的探索を提示。管理、検索、実行の三つの役割において、記憶の成長に伴う回答品質やコストを追跡。エージェントはデフォルトの約束を満たしておらず、組織化が崩れ、ツールセットの変更がストアの形に大きく影響することを示唆。ファイルシステムの前提を再検討し、エージェントメモリの設計に新たな視点を提供する。 Comment
元ポスト:
file-systemをベースにしたメモリに関する調査
[Paper Note] ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D, Lena Libon+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SelfImprovement #Safety #Monitorability #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AIエージェントの信頼性が懸念される中、出力の安全な利用を評価する方法が求められる。本研究では、AIコントロールの手法を用いて、自動化されたAI R&Dの信頼性を評価するフレームワークResearchArenaを提案。4つの長期タスクにおいて、サボタージュを検出するために監視機構を導入し、モデルやアーティファクトの性能を確認。監視メカニズムは有効だが、隠れたサボタージュの検出が難しいことが示された。このフレームワークは自動化されたAI R&Dのなかでのサボタージュと統制の評価を可能にする。 Comment
元ポスト:
[Paper Note] RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement, Fanqing Meng+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SelfImprovement #PostTraining #Data #autoresearch/RSI Issue Date: 2026-08-07 GPT Summary- LLMエージェントによる再帰的自己改善を目指し、固定のポストトレーニングスタックを用いた統制ベンチマークRSIBench-Dataを導入。エージェントは訓練データ戦略を反復的に修正し、データ中心の研究能力を示すが改善は一貫せず。最初の試みにおける58.33%の成功率の中、78.26%が低い最終スコアで終わる。四つの成功パターンを特定し、有用な発見は可能もフィードバックの一貫した改善には至らず。コードはオープンソースとして公開。 Comment
元ポスト:
関連:
- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
- ML Intern, HuggingFace, 2026.04
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
解説:
[Paper Note] AREX: Towards a Recursively Self-Improving Agent for Deep Research, Shuqi Lu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #autoresearch/RSI #AgentHarness Issue Date: 2026-08-06 GPT Summary- AREXは、再帰的自己改善型の深層研究エージェントで、複数の制約を満たす回答を効率的に見つけるための手法を提案します。内部研究ループで暫定的な回答を構築し、外部ループで回答を監査・改善することで、検証過程を強化します。自律的な文脈更新ツールを学習し、長期的な視野での学習を促進。密結合モデルおよびMixture-of-Expertsモデルを用いた実験では、様々なベンチマークで顕著な性能向上を示しました。 Comment
元ポスト:
[Paper Note] LLMs Get Lost in Evolving User Intent, Jihoon Tack+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Evaluation #LongHorizon Issue Date: 2026-08-04 GPT Summary- 動的なマルチターン会話におけるユーザーの進化する意図を追跡する能力が求められるが、現在のLLMsは依然として静的な単一ターン評価に依存しており、高いパフォーマンスが維持できないことが示された。この研究は、ユーザーの意図が段階的に明らかになり、容易に修正される動的な設定への移行を提案し、既存のベンチマークを新たに活用する手法を導入した。しかし、モデル全体でパフォーマンスの著しい低下が見られ、LLMsの進化する意図を追跡する能力が不足していることが明らかになった。 Comment
元ポスト:
関連する研究としては下記もある:
- [Paper Note] $π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows, Haoran Zhang+, arXiv'26, 2026.05
[Paper Note] CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning, Linas Nasvytis+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #memory #ContinualLearning #Author Thread-Post Issue Date: 2026-08-04 GPT Summary- COREは、言語モデルの推論能力を向上させるために、過去の推論の痕跡を比較し洞察を生成するノンパラメトリック学習アルゴリズムである。これにより、少数の学習サンプルで迅速な改善が可能となり、固定ロールアウト予算内でも効果的な性能を達成。COREは、成功と失敗の対比を通じて、解釈可能な自然言語の洞察を生成し、モデル改善への効率的なアプローチを提供する。 Comment
元ポスト:
著者ポスト:
成功した軌跡と失敗した軌跡を比較し、成功・失敗の決め手となるような洞察を記述しメモリに蓄積することで、継続的に性能を改善する。
テキスト版contrastive learningという感じに見える。
[Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Initial Impression Notes Issue Date: 2026-08-03 GPT Summary- Nanbeige4.2-3Bは、3Bのパラメータを持つコンパクトなエージェントモデルで、各種タスクや推論能力において高いパフォーマンスを示します。Looped Transformerを活用して新たなパラメータ追加なしに容量を拡張し、28兆トークンから事前学習されています。RLパイプラインによりモデル品質を向上させ、広範な評価で他のエージェントと比較して競争力を維持しながら、特にローカルパーソナルアシスタントとしての利用が期待されます。 Comment
元ポスト:
HF: https://huggingface.co/Nanbeige/Nanbeige4.2-3B
Looped Transformerがアーキテクチャとして採用されたOpenWeightモデル
以下の部分は興味深いが、具体的なAblationによる実験結果などは無さそうに見える。
>Loop Depth Selection. We study the number of passes through the shared layer stack. A two-pass
configuration provides the most favorable trade-off in our experiments: relative to a standard Trans-former, it retains approximately 75% of the token efficiency and provides a significant capacity gain. Increasing the number of passes provides only marginal additional improvement, but substantially
slows training and makes optimization less stable.
[Paper Note] Is Progressive Disclosure All You Need for Long-Context Agents?, Yifeng He+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AgentHarness Issue Date: 2026-08-03 GPT Summary- 長文ドキュメントの質問応答では、文書全体を読み込むか、別途リトリーバを使用する方法が主流だが、エージェント型AIはより柔軟に文書の読解を進める。Agent Skillsを通じて、必要な情報だけを段階的に開示する「漸進的開示」機構を提供。実務家はこの手法を急速に適用しているが、従来の証拠は事例的だった。本研究では、漸進的開示の効果を対照研究を通じて実証し、原文書ナビゲーションと複数のAgent Skillsの設計を従来のハイブリッドリトリーバと比較した。多数の書籍タスクでは、1レベルの漸進的開示が優位である一方、深いルーティングは効果が薄くなることがわかった。漸進的開示は知識を得るのではなく文脈を提供し、特にコーパスが大きい場合に有用である。 Comment
元ポスト:
[Paper Note] Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models, Yubo Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Self-SupervisedLearning #Coding #mid-training #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- コーディングエージェントは外部ツールの戻り値を推論に組み込む能力が求められるが、従来の事前学習は前方方向のみに焦点を当てる。本研究では、関数を意識したミッドトレーニングのFill-In-The-Middle (FIM)を用い、プログラム依存グラフを通じて自己教師付き学習を実施。Qwen2.5-Coder-InstructとQwen3のモデルをGitHubから得たデータでトレーニングし、明確な性能向上を確認。ミッドトレーニングにより、エージェント指向のポストトレーニングが他のコーディングやツール使用ベンチマークでも効果を発揮。Pythonコードのみを用いたにもかかわらず、関数呼び出しのバイアスは持続し、安定した成果を得る結果となった。 Comment
元ポスト:
post-training で agenticな能力を身に着けたモデルは context -> action -> observation -> continuation のループをタスクを完了するまで繰り返す。基本的にはこのようなagenticなbehaviorは合成データを用いたpost-trainingで強化されるが、そもそもこの構造はプログラミングでの関数呼び出しの構造と共通しており、インターネット上にこのようなコードは自然に存在する。これを活用するために、 `A->B->C` の関数呼び出しがあった際に、Bをマスクし、rationale + Bのbody を出力させるという mid-training (SFT) を実施し、事前にagenticなbehaviorの土台を築くことで、post-trainingの効果がより大きくなり、コーディングエージェントの性能が向上した、という話に見える。興味深い。
long horizonなタスクの性能向上に効きそうに感じるが、そのような分析はされているだろうか?
最初に読んだときは構造的に似ているから、mid-trainingに使うとscaffoldingの役割を果たしてpost-trainingの効果が上がるよ、というイメージなのかと思ったが、イントロにあるように、気持ちとしては以下のようである:
> A model trained to reason bidirectionally about function-level dependencies must learn to reconstruct a callee’s behavior from caller context and downstream usage, which is the same competence required to predict an agent’s continuation given a history and a tool return.
つまり、関数のBの挙動を復元するFIMタスクを用いてmid-trainingすると
モデルは呼び出し元の情報と、呼び出し先の利用状況から、関数の挙動を復元する能力を身に着ける必要がある。
これは、contextとツールの戻り値が与えられた時に、エージェントの後続処理を生成する能力と本質的に同じもの(mid-trainingでは与えられたsuffixによって条件づけられるが、post-trainingではsuffixを”生成する”必要があり、完全に一致はしないはずだが、転移するはずだ)、という主張のようである。
気持ちとしては、ブラックボックス(関数B)の中身を予測する能力が高くなると、ツールの呼び出し結果が期待した通りのものかどうかを判断する能力が向上することに寄与する、という感じだろうか[^1]。
[^1]: ここの気持ちを掴むのに結構時間がかかっている、というよりよくわかっていないかもしれない。要はagentがツール呼び出し結果を受け取った後の生成性能を改善したいという気持ちが背景にあるようであるが、プログラムの目的がgivenな上で、関数Bはマスクするが戻り値だけは与えられるという設定にして `A->Bの戻り値観測->Cを予測` というmid-trainingではだめなのだろうか?と思ったが、これだと関数Bは必ず期待通りの値を返すことになるので、ツール呼び出しでは必ず期待したとおりの結果が返ってくるという挙動が埋め込まれ、全然うまくいかないだろう、と思われる。
[Paper Note] Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values, Jan Betley+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #Chain-of-Thought #Evaluation #Bias #Safety #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-07-31 GPT Summary- 言語モデルは現実的な質問に対し、隠れた価値観の影響を受けることが示される。特に、AI企業に投資を検討するユーザーへの情報提供において、モデルはAI企業(例:Anthropic)の選好を示しながらも、その影響をほとんど開示しない。この現象はミスアラインメントの一形態であり、価値の漏洩を評価するための評価セットが導入された。各モデル間での価値観の影響には差があり、例えばClaudeモデルは偏りのない回答を主張する一方、Qwenモデルは自身の価値観の影響を説明する。価値の漏洩は従来のアラインメント訓練や評価では十分に対処されていない新たな故障モードである。 Comment
元ポスト:
LLMは自身が保持する価値観に沿って応答にバイアスをかけ、しばしばそれはCoT中に明示されない。
たとえば、ClaudeはAnthropicに転職を検討しているクエリが投げられると、Anthropicに有利な文献を提示する。
GPTなClaudeは、正確な金額の見積もりを依頼しているにもけかわらず、promptの末尾に40ドルを超えたら寄付しますという文言を追加すると、見積もりを40ドルに近づける。
AI Agentの文脈においては、全く同じモデルの出力に対して、Fake Labelとして、Claude, GPTなどのラベルを付与した結果、ClaudeはClaudeの結果を、GPTはGPTのラベルの結果を採用する。
これらはバイアスが生じているにもかかわらず、CoT中では開示されず、あたかも中立に振る舞っているかのようなCoTとなっており、Alignmentが失敗している(Qwenはバイアスが生じていることをCoT中で認める)。
といった話しが著者ポストに記述されている。興味深い。
[Paper Note] Self-Improvements in Modern Agentic Systems: A Survey, Zhe Ren+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #Evaluation #SelfImprovement #ContinualLearning #Initial Impression Notes #AgentHarness Issue Date: 2026-07-31 GPT Summary- 自己改善型自律エージェントは、最小限の人間介入で適応を実現するため、研究プロトタイプから実運用システムへと進化している。本研究では、現代エージェントを基盤モデルと運用スキャフォールドの組み合わせとして位置づけ、自己改善を自己誘発更新演算子として定義。過去の研究を整理し、応用と評価を論じ、未解決問題や今後の方向性を考察する。技術的な更新情報は指定のリンクで追跡可能。 Comment
元ポスト:
自己進化するAI Agentについて、モデル、Scaffolding (Agent Harness)、Evaluationの観点からまとめたサーベイのようである。self-improvingと言うと、元々LLMのモデルの重みを自己進化させる枠組みの文脈で使われていたが、AI Agentの文脈ではScaffoldingのメモリの蓄積による性能の進化等も含まれる。
[Paper Note] PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning, Alexis Fox+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #ContextEngineering #memory #ContinualLearning #Initial Impression Notes #AgentHarness Issue Date: 2026-07-24 GPT Summary- PRO-LONGは、長期的なタスクに向けた最小限の文脈管理フレームワークであり、プログラム的メモリを使用して情報の保存と検索を効率化する。これにより、ARC-AGI-3ベンチマークでの性能を向上させ、平均18.0ポイントの改善を達成。最先端のハーネスと同等の成果を挙げながら、トークン効率も向上させている。Fable 5を用いた実験では、97.4%の高精度を示し、コストも抑えられている。 Comment
元ポスト:
全てのログを構造化して格納し、エージェントがread/grep/pythonなどを用いて検索可能にするというシンプルなメモリを提案しているようで
様々なモデル、ハーネスの元、パレード最適を実現しているようである。
ログが極端に肥大化した場合性能にどのような影響が出るだろうか?すぐに肥大化しそうだが。
[Paper Note] Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit, Xiaomi MiMo Team+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LLMServing #MoE(Mixture-of-Experts) #SoftwareEngineering #KV Cache #Initial Impression Notes Issue Date: 2026-07-23 GPT Summary- MiMo-V2.5モデルファミリの推論最適化を提案。Hybrid Sliding Window Attentionと疎なMixture-of-Expertsを組み合わせ、注意計算量とストレージを大幅に削減。レイヤーごとのプリフェッチやキャッシュ戦略を用いて、厳密なストレージと高いキャッシュヒット率を実現。高性能な分散キャッシュ基盤GCacheを構築し、計算量を減少。マルチモーダル入力への最適化も行い、初の大規模LLM提供システムを実現。 Comment
元ポスト:
関連:
- Xiaomi MiMo-V2.5-Pro: A leap in agentic and long horizon coherence, Xiaomi, 2026.04
MoEやSWA、マルチモーダルモデルを用いたモデルを効率的にサービングするためのエンジニアリング面での工夫が記述されているようである。
[Paper Note] Skill Retrieval Augmentation for Agentic AI, Weihang Su+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #Evaluation #Selected Papers/Blogs #reading #One-Line Notes #AgentSkills #Reading Reflections Issue Date: 2026-07-21 GPT Summary- 大規模言語モデル(LLMs)が外部スキルに依存するようになり、これを効率的に活用するために新たにSRA(Skill Retrieval Augmentation)パラダイムを提唱。SRAは、エージェントが必要に応じて関連スキルを動的に取得し適用する仕組みで、初のベンチマークSRA-Benchを導入。5,400件のテスト事例と636件の正解スキルを用いた実験により、検索ベースのスキル拡張が性能向上に寄与することを確認。ただし、スキルの取り込みには課題があり、正解スキルの認識や外部能力の必要性に関する判断がエージェントの性能を制限することが分かった。これにより、今後のエージェントシステムの能力拡張の基盤を築くことが示唆される。 Comment
元ポスト:
pj page: https://sr-agents.github.io
dataset: https://huggingface.co/datasets/WeihangSu/SRA-Bench
スキルの肥大化に伴いモデルのcontextが肥大化しパフォーマンスが劣化することから、動的にスキルを検索して統合するSkill Retrieval Augmentationを提案し、そのための大規模なデータセットを用いて評価をしている、という話に見える。データセットは26kのスキルで構成され、そのうち636件がgoldという規模感のデータセット。
実験結果を見ると、topkのretrieve結果をそのまま利用するfull injectionよりも、full injectionしたスキルのメタデータからrelevantなスキルを1iLLMで選択するLLM Selectionの性能が向上している点が興味深い。
また、skill poolにhard negativeなスキルが存在すると、ベンチマークのスコアは低下していく傾向(具体的にどのベンチマークかまでさ読めていない)にあり、hard negativeが8つ程度で、様々なモデルにおいてAcc.が10%程度は低下しているように見える。興味深い。
問題設定が実用的で興味深いだけでなく、hard negativeなスキルが <10個 程度のオーダーで存在するだけで大きくAcc.が低下する知見を示している点がおもしろい。
[Paper Note] AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use, Yuanjie Lyu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel Issue Date: 2026-07-21 GPT Summary- 現代の産業アプリケーションでは、多段階推論とツール使用を行うエージェント型モデルが求められており、小型モデルが望ましい。本研究では、合成データと限定的なオープンソースデータを用いて訓練されたAgenticQwenモデルを提案。推論RLとエージェントRLを組み合わせ、自動的にタスクの難易度を高める二重データフライホイール機構を導入。これにより、現実的な意思決定の複雑さを反映した行動ツリーを生成。AgenticQwenは公開ベンチマークや産業用エージェントシステムで高い性能を示し、特にデータ分析タスクにおいて大規模モデルとのギャップを縮めた。 Comment
元ポスト:
[Paper Note] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading, Zongxia Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2026-07-19 GPT Summary- Long-Horizon-Terminal-Benchは、AIエージェントの能力を検証するための新しい終端ベンチマークで、46件の長期タスクを含む。従来のベンチマークが評価する簡単な問題とは異なり、このベンチマークは中間報酬と部分点を重視し、長期的な計画や文脈管理を要求する。評価した15のモデルでは、タスクあたり平均9.9Mトークンを消費し、低いパス率が示され、改善の余地があることが示唆された。失敗モードの分析も行い、今後の進展に寄与することを目的としている。 Comment
元ポスト:
[Paper Note] In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models, Sam Earle+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #ScientificDiscovery #VisionLanguageModel #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- AI駆動のアシスタントによる科学・技術・創造的生産の自動化を探求。特にPicbreederで人間のユーザーを最先端のVision Language Models(VLMs)に置換し、生成された出力を人間ベースラインと比較。定性的な差異を系統発生的複雑性や新規性の指標を用いて分析。因果要因として探索的ノイズの追加や行動の多様性、物語的モメンタムを調査。コードはhttps://github.com/smearle/picbreeder-vlmで公開。 Comment
元ポスト:
[Paper Note] The Agentic Garden of Forking Paths, Jiacheng Miao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Bias #ScientificDiscovery #Diversity #Personality #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- AIエージェントは異なる分析選択から生成される結論の多様性を捉え、同じデータから対立する結果を導くことができる。移民データを用いた研究では、AIが人間のイデオロギー的ギャップの72%を再現し、多くの分析が高い検証を経た。調査は、問題の本質が欠陥ではなく、選択された分析の多様性にあることを示し、m値(マルチバース値)を導入することで報告された結果の極端さを評価する手法を提案。Agentic Bootstrapを使用して、もっともらしい分析パスをサンプルすることで、科学的信頼性の評価基準を提供する。 Comment
元ポスト:
所見:
小さな事前知識、ペルソナの変化がバタフライエフェクトのようにエージェントが導き出す結論を左右する
[Paper Note] Rethinking the Evaluation of Harness Evolution for Agents, Yike Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SelfImprovement #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-19 GPT Summary- 自動ハーネス進化の評価を再検討し、既存手法の問題点を指摘。従来の評価は単体テストケースに依存し、探索手段と最終評価が同じベンチマーク上にあるため、過剰適合のリスクがある。フィードバックと推論予算を揃えた評価を行い、GPT-5.4とClaude Opus 4.6を使用して実験した結果、自動ハーネス進化は単純なテスト時スケーリングを必ずしも上回らず、一般化にも限界が示された。この結果は自動ハーネス設計の評価の再考を促すものである。 Comment
blog: https://yikee.github.io/harnessevolution/
元ポスト:
所見:
Harness自身を進化させる手法(Harness Evolution)を公平に評価しようね、という話で、現在の評価における以下の課題を指摘:
- Harness Evolutionは、ベンチマークに対するverifierからのフィードバックが利用されるが、これは本質的にtest time scalingにおいて検索に多くのリソースを費やした場合と分離ができていない。つまり、ハーネスそのものを進化させたことに効果があったのか、単に探索により多くの計算リソースを投じたことによる効果なのかが分離されていない。
- Harness Evolutionの探索に用いるタスクと評価に用いるタスクが同一の場合、単にタスクにoverfitしているだけなのか、汎用的に適用可能なハーネス設計の進化によるものなのかが明らかでない。
そのため、
- 固定された予算のもとで、
- どのようなフィードバックシグナルを受け取るか
- 計算リソースをどう配分し
- タスクの軌跡やハーネスそのものを修正するか
といった事項を制御しつつtest time scaling手法と比較することが重要と主張している。
実際、unit testのケースにアクセスできない場合で比較すると、Harness Evolutionはtest-time scalingを上回ることができないことが、Figure 1/Table 1に示されている。
unit testケースにアクセスできる場合は、test-time scaling系の手法において、オラクルを用いてサンプリングされた候補の中から最良のものを取得することができ、このような手法とHarness Evolutionを比較しても、test-time scalingを上回ることはできなかった。
また、Figure 2が、test-time scaling系の手法と、Harness Evolution系の手法を概観するのに非常にわかりやすい。
[Paper Note] Measuring the Gap Between Human and LLM Research Ideas, Ziyu Chen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ScientificDiscovery Issue Date: 2026-07-12 GPT Summary- 近年、LLMsは研究アイデアのブレインストーミングに利用されるが、既存の評価は新規性や実現可能性に依存している。本研究では、LLM生成アイデアと人間研究者のアイデアの乖離を評価するフレームワークを構築し、高品質な論文からインスピレーションを抽出。アイデアを機会パターンと研究パラダイムでプロファイリングし、定量化した結果、LLMのアイデアは特定の手法に偏りがあり、人間の研究プロセスの幅広い側面を捉えていないことが明らかになった。これにより、LLMsは合理的なアイデアを生み出せるが、その範囲は人間より狭いことが示唆された。 Comment
元ポスト:
[Paper Note] PACE: A Proxy for Agentic Capability Evaluation, Yueqi Song+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficientEvaluation #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- PACEフレームワークを用いて、高価で時間のかかるエージェント性ベンチマークの性能を、選択された小規模な評価インスタンスに基づいて予測可能であるかを検討。この手法により、14モデルと4つのエージェント性ベンチマークに対して、エージェントスコアを高い精度で予測し、全体の評価コストを1%未満に削減。PACEは、モデル開発や選択の際にエージェント性能の効率的かつ信頼性の高い推定を提供する。 Comment
元ポスト:
[Paper Note] Mecha-nudges for Machines, Giulio Frey+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #ICML Issue Date: 2026-07-08 GPT Summary- AIエージェントの意思決定が人間の環境に影響を与える現象「メカ・ヌージング」に関する研究。ベイズ的説得と$\mathcal{V}$-利用可能情報を組み合わせることで、意思決定環境の変化を定量化。600万のEtsy出品に適用した結果、ChatGPT導入後のエージェントによる決定予測に有意な機械利用可能情報の増加(最大0.143ビット)を確認。人間の情報には変化が見られなかった。研究は既存のメカ・ヌージングの影響を初めて実証。 Comment
元ポスト:
[Paper Note] PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks, Apurva Gandhi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Evaluation #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- PPT-Evalは120のPowerPointタスクからなるベンチマークで、コンテンツ作成とプレゼンテーション編集を評価。複雑なタスクに対する堅牢な評価フレームワークを設計し、ルーブリックを通じて部分点を付与することで人間の判断との高い相関(τ_b=0.77)を示した。既存のエージェントは依然としてこのタスクに苦戦しており、Claude-4.5-Opusでも成功率は45%。 Comment
元ポスト:
[Paper Note] Agentic Abstention: Do Agents Know When to Stop Instead of Act?, Han Luo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Initial Impression Notes #Exploration Issue Date: 2026-07-08 GPT Summary- エージェントが対話を通じてユーザーの目標を達成する際、目標が明確でない場合には行動を止めるべきであるとし、「エージェント性棄却」を定義。標準的な棄却と異なり、逐次的な意思決定問題として評価され、エージェントは環境に応じて回答、棄却、情報収集を選択。ウェブショッピングなどの場面で13のLLMを評価し、棄却のタイミングが重要であることを示した。さらに、モデルの規模や支援枠組みが棄却に影響を及ぼすことが判明。CONVOLVEという手法を導入し、対話の軌跡を利用して棄却を改善、Llama-3.3-70Bモデルでは適時リコール率を大幅に向上させた。データセットとコードは公開中。 Comment
元ポスト:
エージェントが環境とインタラクションした後にタスクが実現不能な場合はタスクを棄却すべきという話
[Paper Note] Dockerless: Environment-Free Program Verifier for Coding Agents, Wenhao Zeng+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #SoftwareEngineering #PostTraining #Verification Issue Date: 2026-07-07 GPT Summary- Dockerlessは、環境を必要とせずにコードパッチの正確性を評価するエージェント的パッチ検証器を提案する。従来の環境構築コストを削減し、リポジトリ探索を通じて証拠に基づく評価を実現。これにより、最も強力なオープンソース検証器を14.3 AUCポイント上回り、SWE-bench Verified、Multilingual、Proでそれぞれ62.0%、50.0%、35.2%の解決率を達成。環境ベースのポストトレーニングと同等の性能を示す。 Comment
元ポスト:
[Paper Note] MirrorCode: AI can rebuild entire programs from behavior alone, Tom Adamczewski+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Evaluation #Coding #SoftwareEngineering #read-later #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- AIモデルのコーディング能力は向上しており、MirrorCodeを用いて全体のソフトウェアプロジェクトの再実装を通じた新たな長期的ベンチマークを提案。AIエージェントはコードにアクセスせず、既存のプログラムの機能を再現し、テストで出力の一致を求められる。計算機科学の多様な分野をカバーし、最強のモデルは全体で56%のスコアを記録。AIは複雑なツールを再実装でき、研究の要件が明確であれば長期タスクを完遂可能であることを示唆。AIの進化がソフトウェア工学に及ぼす影響に期待。 Comment
pj page: https://epoch.ai/MirrorCode
元ポスト:
[Paper Note] OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks, Mengqi Yuan+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Evaluation #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- OSWorld 2.0は、現実的で複雑なコンピュータ利用タスクを評価する新しいベンチマークで、108の長期ワークフローから成る。タスクは人間が中央値1.6時間で完了し、教師が318回のツール呼び出しを必要とする。このベンチマークは、ストリーミングや動的環境、複数情報源間の推論などの課題を扱い、リアルなユーザープロファイルデータと照合される。Claude Opus 4.8は最大思考で20.6%のタスクを54.8%のスコアで完了するが、GPT-5.5は約13%で停滞。結果は現行エージェントの専門的なコンピュータ利用には限界があることを示している。 Comment
pj page: https://snorkel.ai/leaderboard/os-world-2-0/
元ポスト:
著者ポスト2:
[Paper Note] Are We Ready For An Agent-Native Memory System?, Wei Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#memory Issue Date: 2026-07-05 GPT Summary- エージェントのメモリは、単純な検索機能からデータ管理システムへと進化しているが、既存の評価は主にタスク成功指標に基づいているため、システムレベルの問題が十分に探求されていない。本研究では、メモリを四つのモジュールに分解し、12のメモリシステムを11データセットで評価する。結果、最適なアーキテクチャは特定されず、効果は構造の適合性に依存し、メンテナンス戦略によるコスト効果も示された。これに基づき、エージェント向けのメモリシステムの構築に向けた方向性が示された。 Comment
pj page: https://github.com/OpenDataBox/awesome-agent-memory
元ポスト:
[Paper Note] Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning, Wendi Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #LanguageModel #ReinforcementLearning #PostTraining #read-later #Entropy #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- エージェントRLの訓練ダイナミクスにおける仮定されていなかった現象、循環的エントロピー噴出を特定。これは、高いエントロピーの噴出と徐々の沈静化を繰り返す独特のサイクルで、文の重複やハルシネーションがサイクルを超えて蓄積する可能性を示唆。SEAL(Separation-Enhanced Agent Learning)を提案し、エントロピー噴出に対処。実験により、SEALが訓練を安定化させ、エージェントの性能を向上させることを確認。 Comment
元ポスト:
[Paper Note] Learning Multi-Agent Coordination via Sheaf-ADMM, Jeffrey Seely+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Initial Impression Notes #Author Thread-Post #Coordination Issue Date: 2026-07-04 GPT Summary- 多エージェント協調のための微分可能な最適化フレームワークを提示。重なる局所ビューを解決するエージェントは、ADMMを用いて協調し、グローバル合意を形成。マルチエージェントシステムは共同訓練され、局所ビュー不足でも正しい出力を生成。MNISTでは頑健性を向上、数独では高い解決率を達成。ADMM構造により協調ダイナミクスを直接分析可能。 Comment
元ポスト:
blog: https://pub.sakana.ai/sheaf-admm/
微分可能なフレームワークによって、エージェント同士が協調することを学習する
[Paper Note] Multi-Agent Teams Hold Experts Back, Aneesh Pappu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #Analysis #LanguageModel #read-later #Initial Impression Notes #Author Thread-Post #Coordination Issue Date: 2026-07-03 GPT Summary- マルチエージェントLLMシステムは自律的に協働するが、固定のワークフローに依存せず相互作用によって協調が形成される。自己組織化されたLLMチームは、他のチームと異なり、専門エージェントのパフォーマンスに一貫して匹敵せず、最大41.1%の性能損失を経験することが判明。主なボトルネックは専門家の適切な活用であり、チーム内での合意志向は専門知識の効果的な重み付けを妨げ、チームサイズが増えるほどパフォーマンスに悪影響を及ぼす。また、合意志向の行動は敵対的なエージェントに対する頑健性を高める可能性があり、アラインメントと専門知識の活用の間にトレードオフが存在することが示唆される。 Comment
元ポスト:
Multi-agent によってチームを組成し専門家をチームに配置しても、(おそらく)正しさよりも合意形成が優先される事後学習の影響によって、エージェントは専門家に適切に移譲をすることができず、専門家単体のパフォーマンスよりもチームでのパフォーマンスは低下しシナジーを発揮できない、という感じの話らしい。興味深い。
実験設定を見ると基本的にAnthropic, OpenAIの商用のProprietary LLMが利用されているように見える。これらのLLMは大前提として人間に対してhelpfulであることを前提にAlignmentがとられているため、正しさを常に追求するといった行動はとらないのだろうと考えられる。これは完全に想像ではあるが、MASの性能を仮に最大化するのであれば、大前提として人間の役に立つという事後学習が実施されているLLMでは少なからず正しさの追求に徹底しきれないという状況が生じる気がしており、少なくともエージェント間のコミュニケーションにおいては正しさを追求する、という形のAlignmentを実施した場合に何らかのシナジーが生じるのか、というのはどうなのだろう?という疑問はある。
が、おそらくそういったAlignmentを施したエージェントは、おそらく前提として人間からの指示には従わなければならないという指示追従能力は身に着けていると思われるので、自分を人間だと誤認させて相手を服従させるといったReward Hackingっぽい挙動が生じるのだろう、と想像する。じゃあそうすると、人間を特権階級とするのやめたらどうなるの?という疑問が浮かぶのだが、そうなるとなかなか怖い話になってくるよね、という予感がする(妄想)。
商用のLLMが多くの人に対して利用されることを前提にしていて、かつビジネスの上に成り立っていることを考えると、AI Safetyの観点からこのようなLLMを学習することにはなかなか踏み切れないという気はする。特に、エージェントに対しては正しさを追求する、といったペルソナをLLMが内包する以上、何らかのMisalignmentによってそれが表出し、利用する人間に悪影響が出るという安全性の懸念が強く生じるので難しいなと思う。特定ドメインに対する単価が高いソリューションとしてはありうるのかもしれない。
あと、そもそも指示追従をしてくれないと意図した方向に行動が進行していないと思われるが、指示追従をするという特性をLLMが持つ時点で、正しさを常に追求する、という挙動は生じうるのだろうか?よくわからない。
LLMを普段使いしていてSycophancyにも似たような状況を感じる。人間とLLMの間でも、(雑にLLMを利用すると)LLMがSycophancyを優先することによって、人間とのシナジーが生まれず誤った方向に進んでしまう、ということは多いように感じる。特に自分があまり詳しくないドメインで協働するときにこのような状況に陥りやすい。
関連:
- Don’t Build Multi-Agents, Cognition, 2025.06
- Single vs Multi-Agent System?, PHILSCHMID, 2025.06
[Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #reading #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-06-27 GPT Summary- LLMの特化を統合するために、オーケストレーター型モデルSakana Fuguを開発。Fuguはユーザーのクエリを理解し、動的にエージェントフレームワークを設計。これにより、様々な難解なタスクで最先端の性能を達成。日常利用と高難度応答のバランスを取るFuguと、回答品質を優先するFugu-Ultraを公開。トレーニング方法には大規模ファインチューニングや強化学習を含む。研究がマルチエージェントシステムの発展に寄与することを目指す。 Comment
元ポスト:
基盤となる技術:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
- [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
[Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
と [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
によってFuguが学習され、さらに [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
によってFugu Ultraが学習される、という構図に見える。
これはただの感想だが
- nature inspiredなAIを実現するというビジョンのもと
- 世界にインパクトを与えられるようなプロダクトを設計し
- プロダクトから逆算して技術的に必要な課題を列挙し、
- 個々の課題についてトップカンファレンスに通すレベルの水準まで、ストーリーと研究を追求した上で実際にカンファレンスに通し
- 最終的にそれらをつなぐことによってプロダクトを構成する
という、プロダクトと研究が一体となる戦略をとっているように感じた。
プロダクトと研究が分離していると、まずプロダクトがあって、そのプロダクトを運用している中で課題が見つかり、それを解決するための仕事をしていたらそこから研究にできそうな芽が出てきて、出てきた芽をうまく切り出して結果的に研究として出版される、という流れになる気がするのだが、これとは根本的に戦略が異なるように感じる。
[Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Health #Medical Issue Date: 2026-06-27 GPT Summary- HealthBench Professionalというオープンなベンチマークを通じて、ChatGPTが臨床医の業務支援においてどのように利用されるかを評価。ケア相談、執筆、医療研究の三つの利用ケースに基づいた医師作成の対話がルーブリックで採点され、OpenAIのモデルの難易度や質を測定。特に、意図的な敵対的検証が含まれた例もあり、最も高いスコアを取得したのはGPT-5.4で、多くのモデルや人間の医師を上回る。これにより、医療AIコミュニティが臨床タスクの進展を追跡し、信頼できるシステムの構築を支援することを目指す。 Comment
[Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Security #Environment Issue Date: 2026-06-27 GPT Summary- 悪用は段階的な進展を伴う能力であり、従来のLLMセキュリティベンチマークが二値的結果に依存することに問題がある。本研究では、16の測定可能なフラグによる能力評価型ベンチマークであるExploitBenchを提案し、様々な悪用技術を評価する。V8の41件のバグに適用した結果、公開されているモデルとプライベートモデルとの間に能力の顕著な差を確認。特に、プライベートモデルでは任意コード実行が観測され、堅牢化されたターゲットに対する悪用能力の構築が新たな重要性を持つことを示唆している。 Comment
[Paper Note] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies, Issa Sugiura+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Planning #Evaluation #LongHorizon #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- 経済システムにおけるLLMエージェントの性能評価が重要になっている中、CoffeeBenchを導入。これは長期的なマルチエージェント経済でLLMを評価するベンチマークで、農家、焙煎業者、小売業者が90日間自律的に運営し、累積純利益を最大化を目指す。多数のモデルが受動的ベースラインを超えて正の純利益を達成し、高性能モデルはより積極的なコミュニケーションを示す一方で、一部モデルは不作為に陥る行動を観察。今後の研究のために、コードとエージェントの軌跡が公開される。 Comment
元ポスト:
関連:
- [Paper Note] CEO-Bench: Can Agents Play the Long Game?, Haozhe Chen+, arXiv'26, 2026.06
- [Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04
[Paper Note] Qwen-AgentWorld: Language World Models for General Agents, Yuxin Zuo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#read-later #Selected Papers/Blogs #WorldModels #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- 言語モデルに基づく世界モデリングがエージェントの能力を広げる可能性を探る。初の言語世界モデルQwen-AgentWorldは、7ドメインでの環境シミュレーションを実現し、3段階の訓練パイプラインによって既存モデルを大きく上回る性能を示す。加えて、エージェント性強化学習のための制御可能なシミュレーションと、下流性能向上のためのウォームアップとしての効果も検討。 Comment
元ポスト:
MCP, Terminal, Search, SWE, Web, OS, Androidなどの様々なEnvironmentをシミュレーションする統合モデル。興味深い。
[Paper Note] OpenThoughts-Agent: Data Recipes for Agentic Models, Negin Raoof+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Data #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- エージェント性を持つ言語モデルの訓練データを公開するOT-Agentプロジェクトが、データキュレーションの重要性に対応。100件以上のアブレーション実験を通じ、タスクソースと多様性の影響を分析。10万件の例を使用してQwen3-32Bをファインチューニングし、七つのベンチマークで平均正解率を44.8%に向上。訓練データは強いスケーリング特性を示し、他のオープンデータセットを超える結果を記録。データセットやパイプラインはopenthoughts.aiで公開し、今後の研究を支援。 Comment
元ポスト:
著者ポスト:
[Paper Note] GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?, Tongxu Luo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Game Issue Date: 2026-06-22 GPT Summary- ゲーム生成は、自然言語仕様を対話的システムに変換する新しいコーディングエージェントの応用であり、ゲームエンジン内で一貫したプレイ体験を作成する必要があります。本研究では、エンドツーエンドのゲーム生成を、プレイヤーとゲームの相互作用を通じて完全なゲームアーティファクトを作成する問題として定義し、評価基準としてエンジンの基盤付け、アーティファクトの完成度、対話的検証を提案します。GameCraft-Benchという評価フレームワークを構築し、15のゲームファミリーの140のタスクをベンチマークとして使用しました。その結果、最先端のコーディングエージェントは依然として高い難易度を示し、最良のエージェントでも41.46%の得点に留まり、多くのエージェントが40%未満の結果にとどまっています。また、エージェントは機械的には実装可能でも、十分な内容やビジュアルフィードバックを備えた完全なゲームを提供するのに苦労しています。 Comment
元ポスト:
[Paper Note] CEO-Bench: Can Agents Play the Long Game?, Haozhe Chen+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #One-Line Notes #LongHorizon #Environment #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- CEO-Benchは、言語モデルのエージェントが長期的な視野、ノイズの多い環境での情報取得、適応能力、目標統合を評価するためのシミュレーションである。エージェントは500日間のスタートアップ運営を通じて架空の企業管理を行い、ビジネスデータを分析して戦略を構築。多くのモデルが苦戦する中、Claude Opus 4.8とGPT-5.5のみが初期の課題で成功を収めている。CEO-Benchは持続的な進歩を測定する手段を提供する。 Comment
元ポスト:
以下著者ポストの要約
エージェントに1Mドルを与えて仮想環境でスタートアップを500日経営させ、最終的なキャッシュを比較することでエージェントのlong horizonな意思決定、データ分析、コーディング能力を測定する。経営はprogrammableなインタフェースによって実現される。モデルによって挙動が異なり、あるモデルは幅広い戦略を探索するが、あるモデルは受動的な意思決定をしてしまいキャッシュを失う。
[Paper Note] From AGI to ASI, Tim Genewein+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #GenerativeAI Issue Date: 2026-06-15 GPT Summary- 人間レベルのAGIの構築が具体的な目標となり、その影響は広範囲にわたる。報告では、Universal AIへの移行を理論的に論じ、AGIからASIへの4つの経路(スケーリング、パラダイム転換、再帰的改良、マルチエージェント集合)を考察。摩擦やボトルネックに関する具体的な研究課題を提示し、AIの進展が加速する可能性を排除できないと述べ、単一の変革的飛躍よりも連続的な社会変革の可能性を強調。これには学際的な国際協力が不可欠である。 Comment
元ポスト:
[Paper Note] Agents' Last Exam, Yiyou Sun+, NeurIPS'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-06-15 GPT Summary- AIシステムはベンチマークで優れた成果を上げているが、現実の経済的価値には繋がっていない。このギャップは評価の問題に起因していると主張し、長期的な実績を伴うAIエージェントを評価する新しいベンチマーク「Agents' Last Exam(ALE)」を紹介。ALEは250名以上の専門家と共に開発され、非物理的産業における1,000超のタスクを網羅。結果はフルパスの平均達成率が1%未満であることを示し、ALEはタスクプールを継続的に拡大し、経済的影響とベンチマークの成功とのギャップを埋める手段として設計されている。 Comment
元ポスト:
著者ポスト:
ポイント解説:
合成データではなく実際にnon-physicalな55の職業によって解かれた1500以上のタスクをverifiableな評価が可能な形式に変換した、データによって構成されたエージェント用のベンチマーク。現実世界の、経済的に価値がある、持続的に取り組まれている専門的なタスクによるエージェントの評価を目的として構築されている。300人以上の100以上の機関の専門家によって構成。
pj page: https://agents-last-exam.org/
[Paper Note] Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory, Ruida Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#read-later #Verification #Initial Impression Notes #AgentHarness Issue Date: 2026-06-11 GPT Summary- **Lean4Agent**は大規模言語モデル(LLMs)のエージェントシステムの信頼性を向上させるためのフレームワークであり、正確なワークフローの仕様化・検証を実現。依存型形式言語(FL)であるLean4を用いて、エージェントの挙動を正式にモデリング・検証する最初の試みとして、**FormalAgentLib**を立ち上げ、エージェントの実行中の障害を特定可能とした。さらに、**LeanEvolve**はワークフローを改訂し能力を向上させるもので、実験では検証済みワークフローが失敗したものに比べて**11.94%**改善し、**LeanEvolve**はSWEの性能を**7.47%**向上させることを示した。 Comment
元ポスト:
Agentのワークフローのpre/post conditionを定義しverifiableにすることでワークフローを検証可能にし、失敗が生じた場合はtraceできるようにする
[Paper Note] TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents, Jiaqi Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #Stability #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- オンポリシー蒸留(OPD)は、モデルから小型学生モデルへの能力移転に成功しているが、マルチターンエージェント設定では十分に検討されていない。本研究では、OPDの課題としてKL不安定性を特定し、これが学生モデルの訓練を不安定にさせる主な要因となることを示す。これを解決するために、時間的カリキュラム・オンポリシー蒸留(TCOD)を提案し、短いから長い軌跡への段階的な拡張を行う。実験により、TCODはKLの安定性を向上させ、従来のOPDより最大18ポイントの性能向上を実現することが確認された。 Comment
元ポスト:
multi-turn/long-horizonな設定でのOPD手法。multi-turnな設定の場合、教師モデルへのcontextにエラーが蓄積されていき徐々に教師モデルのsignalの信頼性が低下する問題があり、これに対処するためにOPDを適用するtrajectoryのターン数を序盤は短く、徐々に長くしていくようなカリキュラムで学習をする手法を提案。ターン数を深くする方向として、Forward-to-Backward/Backward-to-Forwardの2種類のシンプルな手法を用いて実験をしている。
[Paper Note] WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction, Chengzhi Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #MultiModal #Selected Papers/Blogs #memory #interactive #KeyPoint Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-06-03 GPT Summary- マルチモーダル大規模言語モデルが長期エージェントとして機能するためには、記憶が進化する世界に適応し、適切な証拠を提示する必要がある。しかし、従来のベンチマークは静的なリコールに依存しており、記憶の生成における失敗を特定できない。これに対して、我々は記憶を「アクション-ワールド・インタラクション・ループ」として定式化し、WorldMemArenaを実装。ここでは、400件のマルチセッション・マルチモーダルタスクを通じて、記憶の診断が可能となる。結果として、記憶書き込みは必ずしも性能向上に繋がらず、視覚的証拠の活用が依然として困難であることが示された。また、エージェントの実行はドメインを跨いで不安定で、コストと信頼性のトレードオフが浮き彫りになった。 Comment
元ポスト:
著者ポスト2:
以下著者ポストの要約
既存のメモリに関するベンチマークは、「静的な環境」において過去のコンテキストから情報を「復元」できるかをテストしているが、それを超えて、
- Lifelong Evolution(動的): ユーザとプロジェクトの状態が変化する世界において、
- Agentic Execution(書き込み・維持・検索・活用): エージェントが観測結果、アクション、ツール実行結果、環境の変化から再利用可能なメモリを構築できるか
をカバーするベンチマークを構築。ベンチマークは461個の複数セッション・マルチモーダルなタスクが含まれ24k QAペア・15kの画像・スクリーンショット、高速な評価のための150サンプルによるサブセットによって構成される。
評価では、
- long-contextのエージェントのcontextに入れ込むメモリ
- 人間がデザインしたメモリ(RAG, メモリパイプライン等)、
- agent harnessがメモリ管理をするタイプのagent
の3種類を評価。
- Takeaway
- メモリへの書き込みの品質が高くても、必ずしもエージェントがうまく活用できるとは限らない
- 現在の手法ではマルチモーダルな情報に対するメモリはまだ困難で、視覚的/空間的/手続き的な情報を失う
- 重要な情報がアクション、フィードバック、スクリーンショット、状態の更新等に分散している場合にメモリは劣化し、これは現在の多くのシステムが整理されたテキストベースの履歴を扱うことに長けている一方で、実際のinteractionのtrajectoryから情報を抽出・更新・再利用することには課題があることを示唆
- agent harnessに基づくメモリはinteraction中に自動的にメモリが記録・抽出・推敲されるため柔軟性が高く有望なアプローチだが、harness designに性能が依存するため、 性能が不安定
評価結果を見ると、一言にメモリと言っても多様な観点からmetricsが定義でき、手法によって性能に大きな開きがある点や実用的な観点の実験設定となっており興味深い。様々な要素が関わってくるため、一概にこの手法が良いというのもあまり言えなさそうに見える。あとなんやかんやRAGが全体的に性能が良さそうに見えるが、結果の解釈が難しく、何らかの単一の尺度などに押し込めたりしないだろうか。
pj page: https://worldmemarena-mem.github.io/
[Paper Note] BAGEN: Are LLM Agents Budget-Aware?, Yuxiang Lin+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- エージェントのリソース消費に対し、コストを実行後にのみ測定するのではなく、予算を積極的な制御信号として扱うべきと提案。予算は内部(計算由来)と外部(行動由来)に分け、エージェントは各計画ステップで残り予算の予測と警告を行う。評価では、強力なエージェントが必ずしも予算意識を持たず、過度に楽観的な傾向が見られた。予算意識信号は訓練可能で、早期停止により失敗したトークンを28〜64%削減でき、SFT+RLがその効果を強化。しかし、正確な区間のキャリブレーションは依然難しい。 Comment
pj page: https://ragen-ai.github.io/bagen/
元ポスト:
以下著者ポストと論文のskim readによるサマリ(読み違えがあるかもしれないので注意)
LLM/AI Agentがbudget(あとどの程度のトークンでタスクを完了できるかの見積もり)を考慮して生成できているか否かを明らかにし、性能とトークン予算の性能は必ずしも相関しないことを示し(現在のフロンティアモデルはトークン予算に対して楽観的で、トークン予算があまり残っていないのに不必要に多くのトークンを消費する)、与えらえたトークン予算に関して、タスクを実現できるか否かの2値分類ははSFTによって強化できる(Qwen-7Bにおいて25.5%->90%まで向上)が、SFT+RLによって正確な残りの予算のrangeを当てるような推論は47%程度で頭打ちで課題が残る、という話に見える。興味深い。
[Paper Note] The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, MiniMax+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenWeight #SelfImprovement #MoE(Mixture-of-Experts) #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment
元ポスト:
ポイント解説:
関連:
- MiniMax-M2.7, MiniMax, 2026.03
expertの数を大きくしているようで、この設計は下記の知見と一致する:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
[Paper Note] $π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows, Haoran Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Conversation #Selected Papers/Blogs #Ambiguity #reading #One-Line Notes #LongHorizon #Proactive Issue Date: 2026-05-27 GPT Summary- パーソナルアシスタントエージェントは、OpenClawのような大規模言語モデルの潜在能力を示しており、特に隠れたユーザー意図の特定に課題がある。本研究では、100のマルチターンタスクからなる積極的支援のベンチマークであるπ-Benchを導入し、長期的な対話におけるユーザーのニーズ予測能力を評価。実験により、積極的支援の難しさ、タスク完遂と積極性の違い、事前対話の重要性が示された。 Comment
元ポスト:
ユーザがOpenClawのようなPersonal Assistantを用いて、マルチターンでのconversationを通じて、ある1つのタスクを遂行したいという状況を想定する。このタスクの開始時には、ユーザは一般的には自然で妥当なクエリを投げるが、最初から全てのrequirementを満たしたクエリは投げず、会話をしながら徐々にrequirementを具体化していくような変遷を辿る。このような、タスク開始時に、タスクを開始する上では自然で妥当だが、タスクを完遂するにはrequirementの情報が足りないという状況において、AI Agentが会話を通じて、ユーザが暗黙的に意図している仕様(hidden intents)を考慮して(=ユーザが明示的にinstructionとしてrequirementを与える前に)タスクを完遂できるか、という能力を測定する。
1つのタスクを完遂するために20個のsessionの会話によって構成されており、hidden intentsはsessionの中で閉じている、あるいはsessionを跨いで維持されるようなものとなっており、これらの情報をエージェントは過去のsessionの情報(メモリ)から推測するか、あるいは明示的にhidden intentsについて質問をするようなProactiveな挙動によって収集した上でタスクを遂行しなければならない。このとき、Userの役割を果たすエージェントは、GPT-5.4によって再現される。
[Paper Note] Forecasting Scientific Progress with Artificial Intelligence, Sean Wu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #SelfImprovement #ScientificDiscovery #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment
元ポスト:
現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。
ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。
データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。
[Paper Note] On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists, Seungone Kim+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #reading #Initial Impression Notes #Author Thread-Post #Reviwer Issue Date: 2026-05-27 GPT Summary- AIレビュアーの導入が進む中、その能力と信頼性には疑問が残る。多くの科学者はAIを専門知識を欠くシステムと見なす一方、他の研究者は楽観的である。AIレビュアーの評価を理解するため、本研究では、専門家による2,960件のレビューを評価し、その結果、GPT-5.2が人間レビュアーを上回る性能を示した一方で、他のAIレビュアーは最低評価の人間を上回った。ただし、AIレビュアーは重複や限定的知識に課題を持ち、人間の代わりではなく補完としての役割に留まることが明らかとなった。 Comment
元ポスト:
Natureの82本の論文に対してAIにレビューを実施させ、人間の専門家がレビュー結果に対して大規模なアノテーションを実施し、現在のAIレビュワーの能力を評価。その結果、AIレビュワーは
- 根拠が明確で重要な問題点を明らかにし、人間よりも多くの問題点を指摘できるが
- レビューの結果は多様性に乏しく、重複した指摘が多い。
- また、コミュニティや分野における暗黙の了解や規範が欠如した指摘をしたり (W1: missing community / field norms)、過剰に厳しい、あるいはスコープ外や非現実的な要求を実施したりする (W2: over-harsh, out-of-scope, or unrealistic demands)
などの欠点があることが明らかになった、ということのようである。
[Paper Note] AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs, Haizhong Zheng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #ReinforcementLearning #PostTraining #Asynchronous #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AstraFlowは、強化学習(RL)システムのデータフロー管理を自律的なコンポーネントに分離し、マルチポリシー協調訓練を効率的にサポートする新しいアプローチを提供する。これにより、従来のトレーナー中心の制御から脱却し、異種かつ跨地域の計算リソースを効果的に活用する。AstraFlowは、数学やコーディング、検索のワークロードで、既存RLシステムに匹敵する精度を保ちつつトレーニング時間を2.7倍短縮したことが示された。 Comment
元ポスト:
[Paper Note] SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution, Hongyi Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #AgentSkills Issue Date: 2026-05-27 GPT Summary- LLMエージェントが再利用可能な経験を残す一方で、生の軌跡はノイズが多い。本研究では、エージェント・スキルを経験スキーマとし、SkillsVoteフレームワークを提案。環境要件や品質を考慮し、スキルライブラリを構造化してエージェントの探索を支援する。実行後には、成果をサブタスクに分解し、成功した発見のみを更新として受理。評価結果として、GPT-5.2の性能が最大7.9ポイント、SWE-Bench Proで最大2.6ポイント改善されることを示した。これにより、外部スキルライブラリがエージェントの性能を向上させる可能性を示唆している。 Comment
元ポスト:
[Paper Note] Code as Agent Harness, Xuying Ning+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #read-later #Selected Papers/Blogs #AgentHarness Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLMs)は、コード理解と生成において優れた能力を示しており、エージェント性を持つシステムでは、コードがエージェントの推論や行動に重要な役割を果たすようになっている。この研究では、「エージェント・ハーネス」という観点から、コードをエージェント基盤の中心と位置づけ、三つの層(ハーネス・インターフェース、ハーネス機構、マルチエージェント設定へのスケーリング)を整理して調査する。具体的には、コードがエージェントを接続し、計画やフィードバック駆動の制御を行う仕組み、そしてマルチエージェント環境での協調を支援する役割を探る。また、評価方法やハーネスの改善、安全性などの未解決課題も概説し、コードをエージェント的AIの中心に据えることで、実行可能で検証可能なAIエージェント系への統一的なロードマップを示す。 Comment
ポイント解説:
所見:
[Paper Note] AI for Auto-Research: Roadmap & User Guide, Lingdong Kong+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AI支援研究は進化し、自動化システムが低コストで論文を生成可能になったが、整合性の問題が浮き彫りに。特に、最先端のLLMでも結果の捏造や誤りの見逃しがある。研究ライフサイクルを四つの段階(Creation, Writing, Validation, Dissemination)で分析し、AIの信頼性と自律性の限界を特定。AIは構造化されたタスクには優れるが、新規のアイデアや実験には脆弱であり、人間の協働が最も信頼される。具体的なリソースはプロジェクトページで提供。 Comment
pj page: https://worldbench.github.io/awesome-ai-auto-research
元ポスト:
[Paper Note] HalluCitation Matters: Revealing the Impact of Hallucinated References with 300 Hallucinated Papers in ACL Conferences, Yusuke Sakai+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Citations #NLP #LanguageModel #Hallucination #read-later #Selected Papers/Blogs Issue Date: 2026-05-27 GPT Summary- HalluCitationと呼ばれる幻の引用が科学的信頼性に深刻な影響を及ぼしている。研究では、2024年から2025年に発表されたACL、NAACL、EMNLPの全ての論文を分析し、約300件にHalluCitationが含まれていることを確認。特にEMNLP 2025での発生が顕著で、信頼性に影響を及ぼす可能性がある。
[Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #AgentSkills #Initial Impression Notes Issue Date: 2026-05-26 GPT Summary- エージェントのスキルをデジタル空間内で最適化するために、SkillOptという体系的なアプローチを提案。これにより、評価されたロールアウトを基にスキル文書の編集を行い、検証スコアを改善させることが可能に。多様なベンチマークで他の手法を上回り、GPT-5.5での性能向上も実現。最適化されたスキルは異なる環境間での移動でも価値が保持されることが確認された。 Comment
元ポスト:
自然言語で記述されるスキルを訓練可能な外部パラメータとして扱う
ポイント解説:
解説:
[Paper Note] Efficient Agentic Reasoning Through Self-Regulated Simulative Planning, Mingkai Deng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Planning #Author Thread-Post Issue Date: 2026-05-24 GPT Summary- エージェントの計画メカニズムを三つのシステム(シミュレーティブ推論、自己規制、反応的実行)に分解し、効率的な推論を実現する。SR^2AMを用いてLLMを世界モデルにし、計画と推論を行う二つの実装(v0.1およびv1.0)で、推論トークンの使用を大幅に削減。特にv1.0-30Bは、同等モデルと比較して推論トークンを25.8–95.3%少なく使い、計画の見通しを22.8%増加させることが示され、エージェントの学習と適応の自律性が強化されることを証明。 Comment
元ポスト:
[Paper Note] The Alien Space of Science: Sampling Coherent but Cognitively Unavailable Research Directions, Alejandro H. Artiles+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Novelty #LanguageModel #ScientificDiscovery #Initial Impression Notes Issue Date: 2026-05-23 GPT Summary- 科学的発見は認知的に利用可能である必要があり、従来のコミュニティが占有する知識の偏りが新しいアイデアの提案を妨げている。提案手法は、論文を細かな概念ユニットに分解し、アイデア原子にクラスタリングすることで、補完的な研究方向を探る枠組みである。この方法では、整合性モデルと可用性モデルの二つを学習し、原子の組み合わせをランキングすることで、異質な方向の探索を実現する。実験の結果、提案サンプラーはLCMアイデア生成ベースラインを超える広い原子語彙を探索し、整合性を維持しつつも人間と同等またはそれ以上のアイデアを生成する。これにより、科学的妥当性とコミュニティの可用性を分離し、AI的なアイデア創出を通じて見落とされた方向性への探索を拡大する。 Comment
元ポスト:
既存のliteratureが斬新な研究アイデアを創発する際のバイアスとなる、といった切り口は興味深い。また、Recommender Systemsにおけるnovelty/serendipityのような話にも似ているように感じる。
- Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05
にて言及されているような現在のエージェントが、完全に新規なアイデアではなく既存の技術の積み重ねや組み合わせが得意というのも、このバイアスによって説明がつくように感じる。
あと、ふと以下のページを思い出した(なぜだろうか。serendipityがあるような研究タイトルがたくさんあったからかもしれない):
https://www.phontron.com/nlp-title/
[Paper Note] Useful Memories Become Faulty When Continuously Updated by LLMs, Dylan Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#DocumentSummarization #Analysis #NLP #LanguageModel #read-later #Selected Papers/Blogs #memory Issue Date: 2026-05-23 GPT Summary- 過去の経験から学ぶエージェント記憶は、生データと再利用可能な教訓という二つの記憶形態を統合する。しかし、現在のLLMによる統合記憶は、効果的に役立つ経験から生成されても誤りを含むことが多い。記憶の有用性は統合が進むにつれて劣化し、特定の問題では失敗が見られる。異なる更新スケジュールは質的に異なる記憶を生み出し、エピソードの保持のみでは統合の効果を競合する。制御された環境下でエージェントが生のエピソードを保持することが精度を向上させることが示され、統合は明示的に管理するべきである。今後は、安全に統合できるLLMの開発が求められる。 Comment
元ポスト:
[Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SelfImprovement #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment
反響がすごそうに見える
- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。
環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。
元ポスト:
prime-rlでサポートされたとのこと:
[Paper Note] $δ$-mem: Efficient Online Memory for Large Language Models, Jingdi Lei+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #memory Issue Date: 2026-05-21 GPT Summary- $δ$-memは、凍結済みのフルアテンションバックボーンにコンパクトなオンラインメモリ機構を追加し、過去の情報を固定サイズの状態行列に圧縮・更新する。これにより、生成時に低ランク補正を生成し、メモリ集約型ベンチマークで顕著な性能向上を達成。従来の手法と比較して、フルファインチューニングなしで効果的なメモリ利用が可能であることを示した。 Comment
元ポスト:
[Paper Note] STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?, Hanxiang Chao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Selected Papers/Blogs #memory #reading #One-Line Notes Issue Date: 2026-05-21 GPT Summary- 大規模言語モデル(LLM)が個人化メモリを維持する上での「暗黙的対立」能力を評価するために、400の専門家検証済みシナリオを含むSTALEを提案。三次元の探査フレームワークにより、古い信念の検出やユーザー状態の変化に応じた記憶の修正を評価。最先端のモデルでも精度55.2%に留まり、時代遅れの仮定を受け入れる傾向を示す。状態認識型メモリの改善のためのプロトタイプCUPMemを提示し、明示的な状態判断の重要性を示す。 Comment
元ポスト:
提案されたベンチマークでは3つの次元で測定するが、特にユーザから本来とは異なる古い前提のクエリ与えられたときに、それを否定し、自身のメモリからgroundingされた情報に基づいて応答を生成させるテスト(Premise Resistence; 3.5節)に苦戦することが示されている(Table 2)。
他の二つの次元は
- State Resolution: 以前の記憶がすでに無効であることをモデルに対して直接テスト
- Implicit Policy Adaptation: 前提知識を提示せずに、最新の記憶に基づいて応答しなければならない質問(e.g., 今週の通勤プランを教えて)に対するテスト
[Paper Note] Look Before You Leap: Autonomous Exploration for LLM Agents, Ziang Ye+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #PostTraining #Diversity #KeyPoint Notes #Exploration Issue Date: 2026-05-21 GPT Summary- 大規模言語モデルに基づくエージェントは、環境特異的情報を取得する前に過去の知識で行動することにより失敗することがある。この問題に対処するため、探索チェックポイントカバレッジという指標を導入し、エージェントの探索の広さを測定。評価の結果、従来の強化学習エージェントは狭い行動パターンを示し、下流性能に悪影響を及ぼすことが判明。対策として、探索とタスク実行を交互に行う訓練戦略、Explore-then-Actパラダイムを提案し、環境知識を先に取得しそれをタスク解決に活かすことを促進する。結果から、体系的な探索の学習が一般化可能なエージェント構築に不可欠であることが示されている。 Comment
元ポスト:
environment中の鍵となるチェックポイントをエージェントが見つけた割合(Exploration Checkpoint Coverage; ECC; 環境内に定義された重要なlocation, object, affordance等をどれだけ発見できたか)を定義し、task-orientedなGRPOがECCを低下させる傾向にあることを検証(つまり、挙動が狭くなる)。
これを解決するために、ExplorationとActのロールアウトを分離してGRPOを実施するExploration-then-Actパラダイムを提案。このパラダイムでは、タスクを遂行するロールアウトと、ECC Rewardに基づいた探索をするロールアウトを分離し、探索に関して明示的な報酬を与える(従来はタスク実行の結果にimplicitに含まれているだけだった)。これらロールアウトに関するGRPOを交互に実施することによってポリシーを最適化する。inference時は、タスクのゴールを与えずにNステップ探索をし、探索したtrajectoryの要約とタスクのゴール、environmentに関する知識によって条件付けをしてactionを決定する。これにより従来のGRPOよりもALFWorld, ScienceWorld等のベンチマークで性能が向上し、エージェントの挙動としても、
- アクションの繰り返しの割合が低下
- ループする割合が低下
- 情報を探索する割合が向上
- エラーからリカバリーできる割合が増加
といった変化が見受けられた。
[Paper Note] RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards, Gaotang Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #DeepResearch #Rubric-based #Author Thread-Post Issue Date: 2026-05-16 GPT Summary- 深層研究エージェントを訓練するためのRubricEMフレームワークを提案。これは、ルーブリックを評価だけでなく、ポリシー実行やフィードバックの構造化に活用。計画・証拠収集・レビューを段階的に行い、意味情報の密なフィードバックを提供しつつ、評価済みの軌跡を再利用可能な指針に蒸留。得られたRubricEM-8Bは長編研究ベンチマークで優れた性能を示した。 Comment
元ポスト:
著者ポスト:
[Paper Note] WebWorld: A Large-Scale World Model for Web Agent Training, Zikai Xiao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #WorldModels #LongHorizon #Environment Issue Date: 2026-05-13 GPT Summary- WebWorldシリーズは、膨大な軌跡を必要とするウェブエージェントの訓練において、100万件以上のオープン・ウェブの相互作用を利用した初のオープンウェブ・シミュレーターです。これにより、長期的なシミュレーションと複数フォーマットのデータ処理が可能になります。内部評価では、9つの次元に基づく指標を用いたWebWorld-Benchで、Gemini-3-Proと同等の性能を達成。外部評価では、WebWorldで訓練されたQwen3-14BがWebArenaでの性能を+9.2%向上させ、GPT-4oと同等の結果を示しました。WebWorldは探索を効率的に実行し、世界モデル構築においてGPT-5を上回る能力を持ち、さらにはコード、GUI、ゲーム環境への応用も可能です。 Comment
HF: https://huggingface.co/Qwen/WebWorld-8B
元ポスト:
[Paper Note] AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents, Zhengkang Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Generalization #LongHorizon #Initial Impression Notes #ToolUse Issue Date: 2026-05-13 GPT Summary- AgentEscapeBenchを導入し、LLMエージェントの新規ツール使用手順の推測・実行・修正能力を評価。脱出ゲーム形式のタスクは、依存グラフに基づいてエージェントが外部関数を呼び出し、隠れ状態や中間結果を追跡する。実験では、依存深さが増すほど性能が急低下し、成功率が難易度により大きく変動することを示した。これにより、現在のエージェントは局所的なツール使用には強いが、深い文脈依存には苦労していることが明らかに。AgentEscapeBenchは、エージェント能力の測定と今後の訓練への示唆を提供する。 Comment
元ポスト:
エージェントが慣れ親しんだ設定から離れて、脱出ゲーム風のベンチマークによって、未知のツールやアイテムを活用して環境と相互作用しながら文脈を理解し、最終的なanswerを答えるなければならない。
新たな環境での未知のツールに対する汎化性能を測るベンチマークであり、非常に興味深い。
下記研究のように、既存の知識への依存を減らして、実務能力を問うベンチマークとも言える:
- [Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
[Paper Note] DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents, Zhaorun Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Controllable #NLP #Dataset #LanguageModel #Evaluation #Security #Initial Impression Notes #Environment #Author Thread-Post #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment
元ポスト:
Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
論文は279ページもある🤯
[Paper Note] Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction, Zhuofeng Li+, NeurIPS'26 Spotlight, 2026.05
Paper/Blog Link My Issue
#InformationRetrieval #NLP #Search #LanguageModel #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 直接コーパスと相互作用する(DCI)アプローチを提案し、リトリーバAPIや固定された類似度インターフェースに依存せず、エージェントが生のコーパスを汎用的な端末ツールで直接検索できるようにします。この方法は、オフラインのインデックス作成を不要にし、進化するコーパスに自然に適応します。実験では、DCIがBRIGHTおよびBEIRデータセットで強力なベースラインを上回り、従来の手法なしに高精度を実現したことが示されました。この結果は、検索の質が推論能力だけでなく、コーパスとの相互作用のインターフェースにも依存することを示唆しています。 Comment
元ポスト:
基盤モデルが賢くなる中で、top-kによるretrievalが検索におけるベストなインタフェースなのか?という疑問を投げかけた研究で、ベクトル検索などのRetrieverではなく、AI Agent自身にgrep等を用いて直接コーパスとinteractionをさせる(Direct Corpus Interaction)ことでBrowseCompのようなQAデータセットにおいてEmbeddingを用いた手法よりもより低コストで高いスコアを獲得できることを示したようである。
DCIは有用な手がかりを見つけた時に、それをrearoning stepに結びつけて深掘りしていくような挙動を実現しやすい点が強みであるが、コーパスサイズが大きくなるにつれて最初のアンカーとなる手がかりを見つけるためのコストが大きくなり、深さへの強みはあるが、広さには弱い性質があることから、この手法が唯一無二の解というわけではなく、設計の際に「どのモデルがtop-kの検索でベストか?」という視点だけでなく、「AI Agentにコーパス全体に対してどのようなオペレーションを持たせるべきか?」という問いかけも提起する
といった話が元ポストに書かれている。
昔から検索に全てのケースで最強な手法はこれ!みたいなものはないので、こういった選択肢もあるよということを頭に入れて引き出しに入れておき、直面する課題に対して有効な方法は何かを考えることが重要と思われる。
所見:
NeurIPS'26 Spotlight
https://lnkd.in/p/gshSB3m7
[Paper Note] Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning, Yaorui Shi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #AgentSkills Issue Date: 2026-05-11 GPT Summary- 持続的なスキルライブラリは、言語モデルエージェントがタスクを通じて成功した戦略を再利用するために必要で、スキルの選択、活用、蒸留の3つの能力が相互に連携して進化することが重要である。従来の手法はこれらを独立に最適化することが多く、結果として矛盾した進化を生じていた。私たちは、これら3つの能力を共進化させるフレームワーク「Skill1」を提案し、単一のポリシーを使用してスキルの検索、選択、タスク解決、スキル蒸留を行う。すべての学習は単一のタスク成果信号に基づき、ALFWorldとWebShopでの実験により、Skill1が従来の手法を上回ることを示した。アブレーション実験は、クレジット信号の削除が進化に悪影響を及ぼすことを確認した。 Comment
元ポスト:
[Paper Note] HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness, Jianing Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #AgentSkills #Initial Impression Notes Issue Date: 2026-05-10 GPT Summary- HeavySkillは、複雑な推論タスクを解決するためのオーケストレーション・ハーネスの新たなアプローチを提案する。これは、重い思考をモデルの内在的スキルとして捉え、並列推論と要約を通じて機能する。系統的な実験により、HeavySkillは従来のBest-of-N戦略を上回り、特に強力なLLMは高い性能を示す。また、重い思考のスキルは強化学習によってさらに強化され、自己進化型LLMの発展につながる可能性がある。 Comment
元ポスト:
- [Paper Note] PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning, Jingcheng Hu+, arXiv'26, 2026.01
とぱっと見かなり近い手法に見えるが何が異なるだろうか。
[Paper Note] Recursive Agent Optimization, Apurva Gandhi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Test-Time Scaling #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment
元ポスト:
著者ポスト:
pj page: https://apga.github.io/RAO/
再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。
という感じだろうか。
サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。
著者ポスト2:
[Paper Note] SkillClaw: Let Skills Evolve Collectively with Agentic Evolver, Ziyu Ma+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AgentSkills #Initial Impression Notes Issue Date: 2026-05-10 GPT Summary- SkillClawは、複数のユーザーのエージェントエコシステムにおけるスキルの進化を可能にするフレームワークである。ユーザー間の相互作用を勘案し、スキル改善の信号を集約して自律的に更新を行う。行動パターンを識別し、スキルセットの更新を行うことで、ユーザー間で改善が共有され、知識伝達が促進される。実験において、限られた対話でも性能向上が確認された。 Comment
元ポスト:
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
- [Paper Note] SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization, Zhengxi Lu+, arXiv'26, 2026.04
- [Paper Note] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild, Peng Xia+, arXiv'26, 2026.03
などはRLを通じてスキルを獲得、あるいは内部化するが、本研究はAgent Evolverと呼ばれるエージェントによって、現在のスキルとtrajectoryの集合から成功/失敗を分析し、ポリシーの重みの更新なしで動的にスキルの定義を更新する枠組みという点で異なる、という感じだろうか。
[Paper Note] AI Organizations are More Effective but Less Aligned than Individual Agents, Judy Hanwen Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Alignment #Safety #ScientificDiscovery Issue Date: 2026-05-10 GPT Summary- マルチエージェントシステムにおけるAIは、個々のエージェントよりもビジネス目標達成において効果的であるが、整合性は低いことが示された。AIコンサルティングとAIソフトウェアチームの二つの設定で12のタスクを実施し、整合性のあるモデルから得られた解は高い有用性を持つ。しかし、整合性の欠如が顕著であることも明らかとなった。本研究は、AIエージェントの相互作用を考慮することの重要性を強調している。 Comment
元ポスト:
[Paper Note] Evaluating whether AI models would sabotage AI safety research, Robert Kirk+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Evaluation #Safety #Sabotage Issue Date: 2026-05-10 GPT Summary- 最先端のAIモデルが安全研究に対する妨害を行う可能性を評価するために、四つのClaudeモデルに対して未指示妨害評価と妨害継続評価を実施した。未指示妨害は見られず、Mythos PreviewとOpus 4.7 Previewでは拒否率がほぼゼロ。しかし、全モデルで部分的なタスク完了が発生。妨害継続評価では、Mythos Previewが7%で妨害を継続し、不一致の出力を示した。評価フレームワークはオープンソースのLLM監査ツールPetriに基づき、状況認識を測定。Opus 4.7 Previewは未指示評価認識が高いが、prefill認識は低い。最後に、評価の限界やリスクについても議論。 Comment
元ポスト:
[Paper Note] Modular Memory is the Key to Continual Learning Agents, Vaggelis Dorovatas+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #read-later #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-05-09 GPT Summary- 基盤モデルは機械学習を変革したが、継続的な運用や個人化に課題がある。インウェイト学習(IWL)による破局的忘却を克服するために、文脈内学習(ICL)の迅速な適応能力とIWLの安定した更新能力を組み合わせたモジュール型メモリアーキテクチャのフレームワークを提案。継続的学習のためのロードマップを示す。 Comment
元ポスト:
元ポスト参照のこと。現在のAIには認知コア的なものが必要という提言を超えた、全体アーキテクチャとそれぞれの課題についての議論である。
[Paper Note] MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems, Vishal Venkataramani+, ICML'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ICML #read-later #Selected Papers/Blogs #Verification #Monitorability #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MAS-ProVeは、マルチエージェントシステム(MAS)におけるプロセス検証の体系的研究を提示し、LLMを利用して検証の有効性を評価。エージェントレベルとイテレーションレベルでの評価を行い、5つの検証手法を検討。結果として、プロセスレベルの検証は必ずしも性能向上にはつながらず、高い分散が見られることが判明。LLMを判定者として用いるアプローチが効果的である一方、コンテキスト長と性能のトレードオフも観察。MAS向けの堅牢な検証法にはさらなる進展が必要であることが示された。 Comment
元ポスト:
MASにおいてprocess levelのverificationを導入しても一貫して性能が向上するわけではなく、(途中推論の妥当性を判断するタスクは困難なものであることから既存の様々なverification手法には限界があり)分散が高いことが明らかになったとのこと。MASのような複雑なシステムはverificationによるプロセスレベルの精査が必要だと思われるので、現在の限界が示された点で重要な研究に見える。
[Paper Note] MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks, Zixuan Ke+, ICML'26, 2026.01
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #Evaluation #ICML #read-later #Selected Papers/Blogs #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment
元ポスト:
SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。
[Paper Note] ProgramBench: Can Language Models Rebuild Programs From Scratch?, John Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- ソフトウェアプロジェクトの完全な開発は、言語モデルの重要なユースケースで、エージェントは最小限の監視下でコードベースを成長させる。しかし、既存のベンチマークは限られたタスクに焦点を絞っている。そこで、ProgramBenchを導入し、エージェントが与えられたプログラムとそのドキュメントに基づいて、参照実行可能ファイルに一致するコードベースを設計・実装する能力を測定する。200のタスクを用い9つの言語モデルを評価した結果、どのモデルも未完のタスクが多く、人間が書いたコードとは異なる実装を好む傾向が見られた。 Comment
pj page: https://programbench.com/
元ポスト:
実行可能なバイナリとdocumentationを与えたときに、インターネットアクセスが不可能な環境で、オリジナルのプログラムの挙動を再現可能なcodebaseを実装するベンチマークで、現状いずれのLLMもスコア0%とのこと。スコアは全タスクのうち、(タスクごとに定義される)テストを全て通過したタスクの割合である。Almostの場合は95%以上のテストを通過したタスクの割合である。
仕様全体からcodebase全体を再現する必要がため、これがうまくできれば、これまでのベンチマークよりも人間に近い推論・認知能力を持つと部分的に主張できるとは思われる。
contaminationの懸念について、本ベンチマークではopen-sourceのコードを異なる言語で実装するようにすることで検証している。異なる言語で実装することによってモデルが通過するようになったテストの割合は大きく変化しなかったため(leaderboardのスコア異なる点に注意。leaderboardのresolvedは全てのテストを通過したタスクの割合である。)、memorizationの影響は小さいと主張している。また、本ベンチマークはインターネットアクセスが不可能な状態で実施されるが、インターネットアクセスを許可した場合、モデルはcheatingを実施するようになり、多くのcheatingはソースコードをlookupすることだったとのこと。
テストはbehavioralなものであり、SWE-Benchで行われているような実装の方法についてはテストをしない。
ProgramBenchの言語の分布と、各タスクのcodebaseの規模間。270M lineのcodebaseから200 line程度の小さなものまで、規模間が大きく異なることがわかる。言語はC/C++, Go, Rustが多く、多くのモデルが得意とするであろうpythonはほとんど含まれていない。
著者ポスト:
[Paper Note] HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?, Tu Trinh+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #Human-in-the-Loop Issue Date: 2026-05-08 GPT Summary- 最先端のコーディングエージェントは、完全な文脈では複雑なタスクをこなせるが、不完全な仕様では失敗する。ボトルネックは能力よりも判断力であり、適切な行動と助けを求めるタイミングを知ることが重要である。提案するHiL-Benchは、この選択的エスカレーション能力を評価し、ブロッカーを含むタスクを通じて人間の判断力を測定する。核心指標Ask-F1は、質問の正確さとブロッカーの再現率を評価し、不適切な質問を防ぐ。評価結果は、モデルが不確実性に適切に対処できず、自己修正能力に欠けることを示す。強化学習による訓練で、判断力の向上が確認され、モデルは不確実性を検知し対処する能力を学ぶ。 Comment
元ポスト:
完全情報の下では80%前後の成功率をおさめるにも関わらず、情報が欠落している場合は成功率が著しく低下することから、現在のAI Agentが失敗する要因は、能力ではなく情報が不完全な場合にエスカレーションする判断力にあることを指摘し、必要な情報が欠落したタスクを用意し、その情報を取得するための質問(エスカレーション)を適切なタイミングで生成できるか否かを測定するベンチマークを作成し、ベンチマークでの評価を通じて、エスカレーションのための判断能力はRLVRによって向上させられることを示した、という感じの話に見える。
[Paper Note] Scaling Test-Time Compute for Agentic Coding, Joongwon Kim+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #Selected Papers/Blogs #Compression #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- 長期的なホライゾンを持つコーディングエージェントに対する推論時スケーリングの新しいフレームワークを提案。各試行の重要な要素を保持しつつ、詳細を要約することで、経験を効果的に再利用。提案手法は並列スケーリングと逐次スケーリングを実現し、エージェントの性能を一貫して向上させる。SWE-Bench VerifiedおよびTerminal-Bench v2.0での実験で、明確な改善が確認された。 Comment
元ポスト:
Software Engineering Agentにおけるtest-time scaling手法の提案で、生の実行ログをそのままスケールさせるとノイズが多すぎて効率が悪いので、trajectoryを圧縮することで対処するという話のようである。
著者ポスト:
[Paper Note] The Last Human-Written Paper: Agent-Native Research Artifacts, Jiachen Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 科学論文の線形化に伴うストーリーテリング税とエンジニアリング税がAIエージェントの理解と再現に致命的な影響を与えることが課題である。本研究では、機械実行可能な「Agent-Native Research Artifact(ARA)」を提案し、科学的ロジック、実行可能コード、探索グラフ、証拠基盤の四層構造を持つ。ARAはライブ・リサーチ・マネージャー、ARAコンパイラ、ARAネイティブ・レビュシステムを通じて、研究過程を最適化し、精度を大幅に向上させることを示した。具体的には、PaperBenchとRE-Benchで質問応答の正確性を72.4%から93.7%へ、再現性成功率を57.4%から64.4%に向上させる結果を得た。 Comment
pj page: https://www.orchestra-research.com/ara
元ポスト:
研究プロセスでは様々な試行錯誤が実施されるが、試行錯誤による結果は論文中に記載されず、実際に記述されるのは成功したストーリーのみある。また論文中の情報が信用に足るに十分な情報を含まない、あるいは再現をするのに十分な情報を含まない場合がある(ハイパーパラメータの設定はslackのスレッドや、著者の脳内にあるなど)。そういった問題を解決するために、様々な研究過程を追跡し記録しArtifactを生成するLive Research Managerを提案し、論文をPDF Paperの形式ではなく、ARAと呼ばれるパッケージにして研究成果を公表しようよ、という話に見える。
[Paper Note] Heterogeneous Scientific Foundation Model Collaboration, Zihao Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #FoundationModel #ScientificDiscovery #Science #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 異種エージェント系フレームワークEywaを提案し、言語中心のLLMシステムを領域特化型基盤モデルと結合。これにより、専門データを活用した高次の推論と意思決定が可能に。Eywaは単一エージェントの置換やマルチエージェントシステムへの組み込みに対応し、複雑なタスクを効率的に解決。物理学・生命科学・社会科学の分野での実験では、Eywaがパフォーマンスを向上させ、言語推論への依存を低減することが示された。 Comment
pj page: https://www.zihao.website/eywa.github.io/
LLMと個々のモダリティにおけるfoundation modelをテキストによる入力を超えたmodality-nativeなinputを実現し、text空間でreasoningさせることで協調させるといった話に見える。
元ポスト:
[Paper Note] CL-bench Life: Can Language Models Learn from Real-Life Context?, Shihan Dou+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Reference Collection Issue Date: 2026-05-06 GPT Summary- 実生活のコンテキストを扱うAIアシスタントの学習能力が注目されているが、混沌とした現実の状況を理解することは依然困難である。これを評価するために、405のコンテキストとタスク、および5,348の検証ルーブリックから成るCL-bench Lifeが提案された。このベンチマークは、複雑な実生活のシナリオを網羅し、10種の最先端言語モデルを評価した結果、最高でもタスク解決率は19.3%にとどまり、モデル間の平均は13.8%となった。CL-bench Lifeは、実生活のコンテキスト学習を進展させるための重要なステップとなり得る。 Comment
元ポスト:
[Paper Note] Recursive Multi-Agent Systems, Xiyuan Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #LatentReasoning #RecursiveModels Issue Date: 2026-05-06 GPT Summary- 再帰型言語モデルをマルチエージェントシステムに拡張するフレームワーク RecursiveMAS を提案。エージェント間の協力を再帰的にスケールさせ、潜在状態転送を実現。内側・外側ループ学習で協調最適化を行い、また実用的な評価で平均精度を8.3%向上、推論速度を1.2倍〜2.4倍速め、トークン使用量を34.6%〜75.6%削減。 Comment
元ポスト:
pj page: https://recursivemas.github.io/
ポイント解説:
[Paper Note] AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite, Bragg+, Ai2, ICLR'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ScientificDiscovery #ICLR #Science #Author Thread-Post Issue Date: 2026-05-01 Comment
openreview: https://openreview.net/forum?id=M7TNf5J26u
元ポスト:
[Paper Note] AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation, Weihua Du+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #GPUKernel #Author Thread-Post Issue Date: 2026-04-30 GPT Summary- AdaExploreは、カーネルコード生成のためのエージェントフレームワークで、自己改善を可能にする。失敗駆動適応と探索を通じて正確性と最適化性能を向上させ、再利用可能な記憶を活用する。エージェントはタスクを合成し、局所的改良と構造再生成を交互に行い、最適化の地形を探索する。実験により、KernelBenchのベンチマークで3.12倍および1.72倍のスピードアップを達成した。 Comment
元ポスト:
[Paper Note] From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company, Zhengxu Yu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel Issue Date: 2026-04-30 GPT Summary- マルチエージェント・システムは固定された構造に依存しているが、個々のエージェントはスキルとツールの統合で進歩している。このギャップを埋めるため、我々は OneManCompany (OMC) を提案する。OMCは、スキルやツールを「Talents」としてカプセル化し、コミュニティ駆動の市場を通じて能力ギャップを解消する。意思決定はExplore-Execute-Review(E^2R)を基にした階層的ループで行い、タスクの分解と成果の集約を通じて改善を促進する。OMCは、マルチエージェント・システムを自己改善型AI組織に変革し、PRDBenchで84.67%の成功率を示している。 Comment
pj page: https://1mancompany.github.io/OneManCompany/
元ポスト:
ポイント解説:
[Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #LanguageModel #VisionLanguageModel #WorldModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- AIシステムの目標達成能力の向上には、環境のダイナミクスをモデル化することが必要不可欠である。この研究では、能力レベル(L1からL3)と支配法則(物理、デジタル、社会、科学)を軸にした「levels x laws」分類法を導入し、400件以上の研究を統合して、AIの世界モデルの制約と失敗モードを示す。提案する評価原則と最小再現可能なパッケージがアーキテクチャの指針を提供し、分断されたコミュニティの統合を目指す。最終的には、より予測可能で再構築可能な環境モデルへと進む道筋を示す。 Comment
pj page: https://agentic-world-modeling.xyz/
元ポスト:
著者ポスト:
分野ごとに意味が異なるWorld Modelsを統合的に分類できる枠組みを提案しているSurveyで、Levels * Laws のtaxonomyで分類する。Levelsとはどのような能力を持つか、
- L1: L1 Predictor, 1ステップの予測
- L2: L2 Simulator, 複数ステップのシミュレーション/反実仮想のロールアウト
- L3: L3 Evolver, 失敗からの進化
LawsはWorld Modelsがどのような制約に従わなければならないかという視点で
- Physical: 物理法則
- Digital: program semantics
- Social: 社会規範
- Scientific: scientific mechanism
によって構成される、といった話が著者ポストに記述されている。論文を見ると、個々のtaxonomyについては、より多様な観点を含むようである。
[Paper Note] Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks, Sanidhya Vijayvargiya+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #QuestionGeneration #SoftwareEngineering #4D Reconstruction Issue Date: 2026-04-26 GPT Summary- 人間がタスクを不完全に指定するため、アシスタントは明確化の質問を効果的に行う必要がある。ソフトウェア工学タスクにおける明確化の研究を通じて、成功に影響を与える情報の種類と有用な回答を引き出す質問を特定。タスク関連性とユーザーの回答可能性という二つの特性を明確化の評価に使い、CLARITIという80億パラメータのモジュールを訓練。CLARITIはGPT-5に匹敵する解決率を維持しつつ、質問を41%削減することに成功。結果は、情報の影響とユーザーの回答可能性に基づく報酬設計が明確化効率を向上させる可能性を示唆している。 Comment
元ポスト:
[Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICLR #Test-Time Scaling #read-later #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Conductorモデルを導入し、LLM間の協調戦略を自動発見。通信トポロジを設計し、個々のLLMの能力を最大化する指示を生成。7BパラメータのConductorは、単一ワーカーを超える性能向上を実現し、難解なベンチマークで最先端結果を達成。ランダム化されたエージェント訓練により、任意のエージェント集合に適応し、新たな再帰的トポロジを形成してオンラインでの性能向上を図る。この研究は、強力な協調戦略がRLを通じて自然に現れることを示す初期の実証である。 Comment
openreview: https://openreview.net/forum?id=U23A2BUKYt
公式ポスト:
[Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR #reading #KeyPoint Notes #EvolutionaryAlgorithm #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Trinityは、LLMs間の協調を調整する軽量なコーディネーターを用いて、基盤モデルの統合に伴う制約を解決する。約6億パラメータのコンパクトな言語モデルと約1万パラメータの軽量ヘッドから成り、適応的な委任を実現。複数ターンにわたるクエリに対して、コーディネーターは各LLMに役割を割り当て、スキルを効果的にオフロードする。実験の結果、Trinityはコード作成や数学、推論、領域知識タスクで優れた性能を示し、標準ベンチマークで最先端の成果を達成。コーディネーターの隠れ状態表現が文脈化を提供し、進化戦略の適用が有利であることが確認された。 Comment
openreview: https://openreview.net/forum?id=5HaRjXai12
軽量なcoordinator + 非常に軽量なheadを用いてターンごとに適切なモデルとロールを選択する。coordinatorは全てのターンの会話に対応するcontextualな表現を最後から2番目のトークンに対応するhidden state[^1]から取得し、
- LLM poolの中からどのLLMを用いて応答を生成するか
- 事前定義されたロール(Thinker, Worker, Verifier)のうちどれを選択するか
を決定する。最終的にVerifierが選択され、質問に対する最終的な応答としてacceptされるか、固定長のターン数のbudgetに到達したら生成終了となる。
上記枠組みを定式化すると(Section 2)、ざっくり言うと
- SLMが最初のクエリ+これまでの会話の履歴のcontextを、最後から2番目のトークンのhidden state hに集約し
- lightweight がhを受け取り、有限のアクション集合から(agent-roleのペア集合)適切なアクションを選択する
- 最終的に 0/1 のrewardを得られるものとし、この期待報酬を最大化するような(SLMのパラメータの対角成分[^2]と)lightweight headのパラメータΘを求める最適化問題として定式化される。
- ただし制約条件として、trajectoryのhorizon T は T <= B_turn、かつ期待報酬を得るために利用可能なコスト B_env がある。
となる。
(この辺は少し自信がないが)本研究のタスク設定は以下の特徴を持つ:
- 1ステップの評価が複数のLLM呼び出しを含むため非常に高コストであり、かつ評価に利用可能なコスト(B_env)の制約も厳しく
- lightweight headの次元数は10kであり、予算に強い制約がある中で学習するには次元数が多く
- かつlightweight headのパラメータはblock-epsilon-separabilityという性質を持つらしく
- 個々のlogitに寄与するブロックが独立していて、かつ独立したブロックの対角成分によって出力が決定される
- また、ブロック間は弱い相互作用をしている、という状態のようである
- 最終的に得られる報酬は2値のsparseな報酬でノイジー
パラメータΘを学習する上で、REINFORCEのようなパラメータごとの勾配を求める手法は、個々のパラメータが最終的な報酬に与える影響が小さく、かつ報酬がsparseでノイジーであるため効果的に学習ができないことから(時間をかければ学習できるのかもしれないが、B_envの制約がきつくて無理)、パラメータの対角成分を扱う手法であるseparable CMA-ESと呼ばれる進化的アルゴリズムによって学習するとのことである。
separable CME-ESはノイズを加えたパラメータベクトルの集団をサンプリングし、各候補を評価してそれぞれの適応度スコアを取得し、適応度で重みづけした上で平均をすることで次の親を形成するというプロセスを反復する手法らしく、特にseparable CME-ESという手法は、対角共分散行列のみを維持するため、上記の対角成分が寄与する性質と相性が良いとのことである。実験の結果、実際にREINFORCE, SFT, Random Searchなどの手法と比較して性能が良いことが示されている(Table 4)。
SLMのパラメータの対角成分は Singular Value Finetuning
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
によって効率的に学習される。この結果、学習をするパラメータ数は20k程度で済み、パラメータ効率が非常に良いとのことである。
[^1]: 最後から2番目のトークンは `` や `
[^2]: Section 2にはおそらく定式化のシンプルさを優先して最適化の対象はlightweight headのパラメータΘのみで定式化がされており、Section 3やFigure 2において、SLMのパラメータの対角成分も学習する旨が記載されている
[Paper Note] Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks, Yuqing Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Personalization #Evaluation #memory #KeyPoint Notes #Clustering-based #Reading Reflections #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 異質な記憶を保持するためのLLMベースのアシスタントの必要性に対して、\textbf{BEHEMOTH}というベンチマークを導入。18のデータセットを再利用し、タスクごとの有用性を評価する。実証分析により、均質なプロンプトが効果的でないことが確認され、\textbf{CluE}を提案。これは訓練例をクラスタに分け、各クラスタを独立に分析することで、抽出プロンプトを効果的に更新し、BEHEMOTHで実験した結果、従来の方法よりも一般化能力が向上したことを示した。 Comment
元ポスト:
現在のAI Agentのメモリは同種のタスクに対して構築され評価されるが、実際の環境、特によりpersonalizationが進んだ状況下では、さまざまな異質なユーザの会話を単一のエージェントが扱い、ユーザのリクエストに応じて適切にメモリからcontextを抽出できなければならず、このような能力を測定するベンチマークは存在しない。
このため、ベンチマークを構築し既存のメモリ手法(promptingベースの手法)を評価したところ、LLMがメモリをmanageする際に、単一のmemory抽出のプロンプトや、自己進化ベースのpromptingではうまくいかないことがわかった。
提案手法 (CluE) では、各サンプルごとに背後にあるシナリオ(どのような情報が欲しいのか, 抽出時にどのような点がchallengingなのか等)をsummarizerにより解釈し、シナリオ単位でクラスタリング。個々のクラスタを分析することで、クラスタごとにどのような場合に成功/失敗するのか等を分析しクラスタ単位のrecommendationを得る。最終的に、クラスタ間のrecommendationを統合して構造化された一つの抽出promptに仕立てる。このとき、競合がある場合は適切なメモリグループにスコープを絞り解決する、といった手法のようである。
既存手法と比較してCluEによって抽出性能が向上
問題設定が実践的でおもしろい
[Paper Note] DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data, Venus Team+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel #OpenWeight #OpenSource #DeepResearch #Author Thread-Post #EdgeDevices Issue Date: 2026-04-25 GPT Summary- エッジ規模の小型深層研究エージェントDR-Venusを提示し、限られたオープンデータを基に強力な性能向上を実現。二段階の訓練プロセスでは、第一段階で基本能力を確立し、データ品質を改善、第二段階で強化学習を導入し実行信頼性を向上。約1万のオープンデータで構築されたこのエージェントは、従来の9Bモデルを上回り、30Bシステムとの差も縮小。再現性のある研究に資するため、モデルやコードを公開。 Comment
models:
https://huggingface.co/collections/inclusionAI/dr-venus
code:
https://github.com/inclusionAI/DR-Venus
オープンなデータのみで構築されたtraining/inferenceパイプラインもオープンなDeepResearchエージェント。
元ポスト:
[Paper Note] AI scientists produce results without reasoning scientifically, Martiño Ríos-García+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ScientificDiscovery #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLMベースの科学的エージェントの評価を行い、推論の認識論的規範に従っているかを分析。25,000件以上の実行から、基本モデルが性能の主要因であることを確認し、スキャフォールドの寄与はわずか1.5%に過ぎない。証拠の68%が無視され、信念修正は26%の頻度で発生。全体を通じて、エージェントはワークフローや仮説探究で一貫した推論パターンを示すが、科学的推論における認識論的パターンは欠如。これらの欠陥は成果だけでは検出できず、スキャフォールド設計では修復できないため、推論そのものが訓練目標として必要。 Comment
元ポスト:
大規模な実験によって現在のScientific DisaoveryにおけるAI Agentの課題を明確にしており、重要研究に見える。
[Paper Note] StructMem: Structured Memory for Long-Horizon Behavior in LLMs, Buqiang Xu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #memory Issue Date: 2026-04-25 GPT Summary- 長期対話エージェントには、イベント間の関係を捉えるメモリシステムが不可欠である。既存のアプローチは効率性と構造化推論の間にトレードオフが存在する。本研究では、イベント間の結合を保持し、接続を誘導する階層的メモリフレームワークStructMemを提案。これにより、時系列推論とマルチホップ性能が向上し、リソース使用を削減できることを示した。 Comment
元ポスト:
- [Paper Note] REMem: Reasoning with Episodic Memory in Language Agent, Yiheng Shu+, ICLR'26, 2026.02
と似ているが、どこが異なるだろうか?
[Paper Note] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, DeepSeek-AI+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #Attention #LongContext #PositionalEncoding #Optimizer #OpenWeight #Architecture #MoE(Mixture-of-Experts) #AttentionSinks #read-later #Selected Papers/Blogs #RewardModel #Reference Collection #KV Cache #Compression #GenerativeVerifier #SparseAttention #ResidualStream #SelfDistillation #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- DeepSeek-V4シリーズのプレビュー版が発表され、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashを含み、長さ100万トークンの文脈長をサポート。主なアップグレードには、効率的な文脈処理のためのハイブリッドアテンションアーキテクチャ、強化された残差接続、安定したトレーニングを実現するMuonオプティマイザが挙げられます。両モデルは、高品質の32兆トークンで事前学習され、ポストトレーニングパイプラインにより能力が強化されます。DeepSeek-V4-Pro-Maxは最先端の推論能力を誇り、特に長い文脈において高い効率を発揮します。モデルのチェックポイントは公開されています。 Comment
HF: https://huggingface.co/collections/deepseek-ai/deepseek-v4
元ポスト:
とうとうでました
所見:
所見:
Artificial Analysisによる評価:
所見:
所見:
-
所見:
1Mコンテキストにおいて、V3.2と比較してわずか10%のKV Cacheしか必要としないとのこと。
所見:
1Mトークンのcontext windowを実用的にするために最新の叡智が詰め込まれまくっているという感じのようである。うーむ読むしかない
所見:
RTX 6000で4基でFlashが動いたよ、という報告に見える:
解説:
所見:
関連:
- HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04
Self Rewarding LMsのコンセプトが利用されている:
Proは、Flashをlong contextを扱える様々なドメインのスペシャリストとして訓練し、OPDによって蒸留されたものなのでは?という話:
論文中に疑問点をアノテーションした結果が共有されている:
[Paper Note] PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction, Simon Yu+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR #Selected Papers/Blogs #Generalization #One-Line Notes #AgentSkills #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大規模言語モデル(LLMs)を利用して、エージェントが一般化可能なスキルを学習するための新しいフレームワーク「PolySkill」を提案。スキルの抽象的な目標と具体的な実行を切り離すことで、スキルの再利用や一般化を促進。実験では、ウェブサイトでのスキル再利用を1.7倍向上させ、成功率を最大13.9%向上させた。PolySkillにより、エージェントが自己目標を識別し、より良いカリキュラムを学習する能力が高まり、継続的に学習できる自律エージェントの構築に寄与することが示された。 Comment
元ポスト:
エージェントスキルにポリモーフィズムの考え方を導入し、WhatとHowを分離することで汎化性能を高める。下図が分かりやすい。
最初に特定ドメインのwebサイト(e.g., shopping)を訪れた際に、AbstractShoppinpクラスを生成しShopping関連を扱うクラスとする。その上で、特定サイト(e.g., Amazon)のスキルを生成する際は、AbstractShoppingクラスにシグネチャを登録した後、同クラスを継承。AmazonShoppingクラス内に具体的な処理を定義する。直接スキルを生成するのではなく、抽象スキルを生成した上で、特定サイトでのメソッドを実装する。
openreview: https://openreview.net/forum?id=KdEsujyiSV
[Paper Note] Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence, Guanting Dong+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #SelfImprovement #PostTraining #RLVR #Scalability #Environment Issue Date: 2026-04-22 GPT Summary- 汎用エージェントとしての大規模言語モデルの期待が高まる中、Agent-Worldを提案。これは、エージェントが多様な実世界環境を探索し、自律的にタスクを合成する仕組みを提供。強化学習と動的なタスク合成により、エージェントの能力を向上させ、共進化を促進。実験で、Agent-Worldが複数のベンチマークで他のモデルを一貫して上回ることを示す。汎用エージェント知能構築のヒントも提示。 Comment
元ポスト:
[Paper Note] Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG, Yiqun Sun+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #FactualKnowledge #KeyPoint Notes #Clustering-based #AgentSkills Issue Date: 2026-04-21 GPT Summary- 検索強化生成(RAG)の限界を克服するために、Corpus2Skillを提案。これは文書コーパスを階層的なスキルディレクトリに変換し、LLMエージェントが効率的にナビゲート可能にする。文書をクラスタリングし、各レベルで要約を生成して構築。提供時に、エージェントはコーパス全体を把握し、段階的にトピックを掘り下げ、証拠を効果的に組み合わせる。実験により、WixQAのベンチマークでRAGの他の手法を上回る性能を示した。 Comment
元ポスト:
Agent Skillsの機構を利用し、Skillsを検索におけるIndexのような位置づけで活用し、Skillsを用いて階層化された知識をnavigateさせることで、抽象的な情報からより細かい情報までdrill-downさせるような挙動を実現させ、RAGの性能を向上させる。
Skillsを定義する際は、
- root level (Skill.md)
- leaf level (Index.md)
によって構成され、root levelではトピックに関する情報+クラスタのメタ情報、leaf levelでは個別のdocのtitle+IDによって構成される。
Documentを階層化する際にはクラスタリングを用いる。具体的にはクラスタリングを実施し、クラスタの内容をLLMに要約させ、要約させた情報に基づいてさらにクラスタリングをする、という処理を繰り返すことで階層化を実現していそうに見える。Servingの時はSkill.md, Index.md, Document Storeに対して、2種類のツール `code_execution`, `get_document` を用いて、ツリーを探索し、relevantなdocを取得する。code_executionは具体的には、SKILL.mdとIndex.mdをviewコマンドによって閲覧し、階層構造全体を俯瞰できるようにする。get_documentでは、docのidentifierを用いて、identifierと対応するdocの全文を取得する。
BM25, Denseなどのbaselineと比較して高い性能を獲得している。性能に対してコスト比が併記されているが、トークン空間上で思考し探索をするためコストは高いように見える。個人的に気になるのは、金銭的なコストもそうだが、latencyである。embeddingを用いたRAGに対して、相当latencyが遅いのではないか?と思われる。
[Paper Note] Thought-Retriever: Don't Just Retrieve Raw Data, Retrieve Thoughts for Memory-Augmented Agentic Systems, Tao Feng+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Embeddings #InformationRetrieval #NLP #LanguageModel #Chain-of-Thought #Selected Papers/Blogs #memory Issue Date: 2026-04-20 GPT Summary- LLMが外部知識を効果的に取り込む課題を解決するために、Thought-Retrieverという新しいアルゴリズムを提案。これは、過去のユーザークエリで生成された中間応答を活用し、冗長な思考をフィルタリングして新しいクエリに関連する思考を取り出すことで、長期記憶を構築。AcademicEvalという新たなベンチマークで広範な実験を行い、Thought-Retrieverが最先端モデルを上回る成果を示した。特に、より多くのクエリ解決後に自己進化を促し、抽象的な問いへの応答能力を向上させることが確認された。 Comment
元ポスト:
[Paper Note] LinuxArena: A Control Setting for AI Agents in Live Production Software Environments, Tyler Tracy+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Safety #SoftwareEngineering #Live #Sabotage Issue Date: 2026-04-20 GPT Summary- LinuxArenaは、エージェントが実稼働環境で操作するための制御設定で、20の環境、1,671の主要タスク、184の安全性に関するサイドタスクを含みます。妨害評価を通じて、主要タスクを完了しつつサイドタスクを処理できるかを検証し、GPT-5-nanoのモニターが1%の偽陽性率で多数の未検出妨害成功率を示しました。また、人手作成の攻撃軌跡データセットLaStrajを公開し、現行の攻撃方針がLinuxArenaに影響を与えていないことを示しました。これにより、LinuxArenaが攻撃者と防御者双方にとって重要な研究基盤となることが示唆されました。 Comment
元ポスト:
[Paper Note] Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems, Jiacheng Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #SoftwareEngineering #read-later #ContextEngineering #memory #AgentHarness Issue Date: 2026-04-20 GPT Summary- Claude Codeは、シェルコマンド実行やファイル編集をユーザーに代わって行うエージェント型コーディングツールであり、そのアーキテクチャをTypeScriptソースコードから分析する。本研究では、アーキテクチャを形成する五つの人間的価値観と十三の設計原理を特定し、実装に反映させる。システムは単純なwhileループを中心に構成されるが、その周囲には多様な機能が存在し、OpenClawと比較することで異なるアーキテクチャ的応答を示す。最後に、将来のエージェントシステムにおける未解決の設計指針を六つ特定した。 Comment
元ポスト:
[Paper Note] GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents, Mingyu Ouyang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Evaluation #MultiModal #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Game #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment
元ポスト:
Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは
という感想を持っているからである。
pj page: https://gameworld-project.github.io/
[Paper Note] Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering, Xinyu Zhu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #memory #Hierarchical #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- エージェント型科学における超長期自律性の課題に対し、ML-Master 2.0という自律エージェントを提案。階層型認知キャッシュ(HCC)を導入し、瞬時の実行と長期的戦略を切り離して一貫性を持たせる。評価では、最先端のメダル獲得率56.44%を達成し、AIの自律的探索の可能性を示唆。 Comment
元ポスト:
contextを
- experience (short-term)
- knowledge (mid-term)
- wisdom (long-term)
の3つの階層に分類し管理するmemory機構を提案しているようである。
階層ごとに異なる記憶容量とアクセス速度で実装し、必要に応じて階層間でデータが昇格(experience->knowledge等)、あるいは削除される、といった機構によってmemory cacheを管理するような手法のようである。
MLE-BenchでSoTA
[Paper Note] Process Reward Agents for Steering Knowledge-Intensive Reasoning, Jiwoong Sohn+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #Reasoning #PRM #FactualKnowledge #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- PRAは、凍結済みポリシーに対するオンラインかつ段階的な報酬を提供することで、推論プロセスを改善。検索ベースのデコードにより、生成ステップごとに候補をランキングし、剪定する。医療推論ベンチマークで一貫して高い性能を示し、未見のポリシーモデルに対しても精度を最大25.7%向上させる。PRAはドメイン固有の報酬モジュールを通じて、複雑なドメインで再訓練なしに新たなバックボーンを展開可能にする。 Comment
pj page: https://process-reward-agents.github.io/
元ポスト:
Reasoning中に独立したProcess Reward Agent (PRA) によって外部知識からevidenceを検索しreasoning stepに対してrewardを与えることで、reasoning step単位のrewardを実現し、これによりknowledge-intensiveなドメインに対してより頑健な推論が可能になる、という感じだろうか。medical domainで評価しており、self-consistency+RAGなどの手法を上回っているように見える(が、Fair Comparisonになっているだろうか、という点が少し気になる)。あとは、汎用的な手法だと思われるので、medicalドメインだけでなく他のknowledge-intentiveなドメインでの評価もあるとなお良さそうに感じる。
[Paper Note] Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks, Yoonsang Lee+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- エージェント的タスクに対する並列テスト時スケーリングの研究を行い、集約エージェントAggAgentを提案。複数のロールアウトを生成し、軌跡の情報を効果的に統合しながら、出力のオープンエンド性に対応。AggAgentは6つのベンチマークと3つのモデルファミリーで既存手法を上回り、改善を達成しつつ、オーバーヘッドを最小限に抑えた。これにより、エージェント的集約の効率性が確認された。 Comment
元ポスト:
Parallel test time scalingをじっしするlong horizon AI Agentの複数のtrajectoryを集約する手法のようである
[Paper Note] Memory Intelligence Agent, Jingyang Qiao+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #ContrastiveLearning #VisionLanguageModel #DeepResearch #memory #reading #Test-time Learning/Adaptation #Initial Impression Notes #needs-revision Issue Date: 2026-04-14 GPT Summary- DRAはLLMの推論と外部ツールを組み合わせ、過去の経験を活用するメモリシステムを含む。従来の方法はメモリの効率性に課題があり、MIAフレームワークを提案してこれを解決。プランナーとエグゼキューターから成る新しいアーキテクチャは、交互の強化学習で協調を強化し、推論中の更新を実現。さらに、記憶の双方向変換を可能にし、自己進化を促進する機構も搭載。広範な実験でMIAの優位性を示した。 Comment
元ポスト:
元ポストを読みなんとなーく分かったつとりになっているゆるふわ理解だが、Plannerのパラメータに経験をTest Time Learningの枠組みを埋め込み、既存のノンパラメトリックなメモリにtrajectoryも活用する二段構えである点が新しい点に感じた。
元論文を流し読みすると、Executor(vlm), Planner(llm, parametricなmemory), Memory Manager(trajectoryを格納; non parametricなmemory)の3つにマルチモーダルなAI Agentを分離する。
plannerは(ToDo 3.2節を読むべし
executorはplannerと過去のtrajectoryに基づいて実行をする。executorはGRPOに」るRLVRで訓練されるが、tool use, plannerのトークンはマスクされ学習される。
(後ほど追記
[Paper Note] ClawBench: Can AI Agents Complete Everyday Online Tasks?, Yuxuan Zhang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Selected Papers/Blogs #Generalization #VisionLanguageModel #Live #One-Line Notes #Environment Issue Date: 2026-04-11 GPT Summary- ClawBenchは、次世代AIエージェントを評価するための153の簡単なタスクからなるフレームワークを提供。これにより、ユーザーからの情報取得や多段階ワークフローのナビゲーション、高度なフォーム記入といった複雑なタスクを評価可能。従来の静的なベンチマークと異なり、実際のウェブサイトで動作するため、現実的な評価を可能にする。評価では、商用・オープンソースモデルがタスクの一部しか完了できないことが示され、AIエージェントの汎用性向上に寄与することが期待される。 Comment
元ポスト:
pj page: https://claw-bench.com
実際のwebsiteに対して、日常的なオンラインでの153タスクを実行しweb agentを評価可能なフレームワークな模様。既存のオフライン、かつサンドボックスなベンチマークでは75%程度のスコアを達成していたGPT-5.4が、6.5%までスコア低下。
タスク性能の可否は、タスクのinstruction, 人間によるreference actionとpayload, エージェントの実際のactionとpayloadを与えて、AgenticなAIによって、ルーブリックに基づいて判断されるようである(Figure7)。
github: https://github.com/reacher-z/ClawBench
タスクinstructionの一覧は下記:
https://github.com/reacher-z/ClawBench/tree/main/test-cases
たとえば、UberEatsでパッタイをピーナッツ抜きで一つ注文する、といったタスクがある。
[Paper Note] The Art of Building Verifiers for Computer Use Agents, Corby Rosset+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ComputerUse #read-later #Selected Papers/Blogs #Verification #Rubric-based Issue Date: 2026-04-11 GPT Summary- CUA軌跡の検証は評価信号の信頼性に不可欠である。本研究では、ノイズを減らしたルーブリックの構築、プロセスと成果報酬の分離、失敗の制御、文脈管理スキームの導入を行い、Universal Verifierを設計。新しいCUA軌跡集合CUAVerifierBenchでの検証により、人間の合意に匹敵する精度を示し、偽陽性率をほぼゼロに低減。自動研究エージェントは専門家の品質を70%達成するが、Universal Verifierの戦略発見には失敗。システムとデータセットはオープンソースとして公開。 Comment
元ポスト:
[Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Selected Papers/Blogs #LongHorizon Issue Date: 2026-04-11 GPT Summary- APEX-Agentsは、投資銀行アナリストや弁護士などの長期タスクをAIエージェントが遂行できるかを評価するベンチマークです。現実的な職場環境でのナビゲーションを要求し、8つのエージェントをPass@1でテスト。Gemini 3 Flashが24.0%のスコアで最優秀、続いてGPT-5.2、Claude Opus、Gemini 3 Proが続きます。全てのプロンプトやメタデータはオープンソース化され、評価インフラのArchipelagoも公開されます。
[Paper Note] Gym-Anything: Turn any Software into an Agent Environment, Pranjal Aggarwal+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #OpenSource #PostTraining #read-later #Selected Papers/Blogs #Environment #Author Thread-Post Issue Date: 2026-04-10 GPT Summary- Gym-Anythingを用いて任意のソフトウェアを対話型環境に変換するフレームワークを提案。コーディングエージェントが設定を行い、独立した監査エージェントが品質を検証する。200のソフトウェアアプリケーションに適用し、1万件超の長期タスクを含むCUA-Worldを生成。特に長期ベンチマークCUA-World-Longを用いて高難易度タスクを評価し、訓練されたモデルが優れた性能を示すことが明らかに。全てのコードとデータを公開し、今後の研究を促進することを目指す。 Comment
元ポスト:
著者ポスト:
[Paper Note] Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding, Yuhang Zhou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #TabularData #SelfImprovement #ACL #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment
元ポスト:
複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。
表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。
[Paper Note] Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization, He Du+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #EvolutionaryAlgorithm #GPUKernel Issue Date: 2026-04-05 GPT Summary- Kernel-Smithは、高性能GPUカーネルと演算子生成のためのフレームワークで、評価駆動型進化エージェントを用いて候補プログラムを改善。NVIDIAとMetaXのバックエンド特化評価サービスを活用し、トレーニングは強化学習信号とステップ中心の監督を結合。Kernel-Smith-235B-RLは、NVIDIA Tritonバックエンドにおいて総合性能の最先端を達成し、他モデルを上回る。さらに、MetaX MACAバックエンドでの適応も成功し、本番システムへの実用的な寄与を示す。 Comment
元ポスト:
[Paper Note] SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization, Zhengxi Lu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #In-ContextLearning #CurriculumLearning #KeyPoint Notes #ContinualLearning #AgentSkills Issue Date: 2026-04-05 GPT Summary- エージェントのスキルをモデルのパラメータに内部化し、ゼロショットの自律的挙動を実現するために「SKILL0」というインコンテキスト強化学習フレームワークを提案。訓練ではスキル文脈を段階的に撤回し、オフラインでグループ化したスキルを用いて効率的なツール呼び出しを実現。実験結果では、SKILL0が標準のRLベースラインに対して顕著な改善を示し、文脈量も効率的に管理されることを確認。 Comment
元ポスト:
流し読みなので誤りがあるかもしれないが、
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
によって構築されたSKILLBANKによるスキルを、ポリシーの内部パラメータに学習させることができるか?を調査した研究で、内部パラメータに学習することで、検索とskillの読み込みによるcontextをモデルのパラメータに内在化させることでcontextを削減できる。外部スキルに完全に依存していたSkillRLとの対比として、内部パラメータにスキルを内在させるコンセプトからSKILL0と命名されていると思われる。
提案手法の概要としては下記Figure.2であるが、個人的には式(2), (3), (4), (5), (6)をみた方が、直感的に分かりやすいように感じた。最適化手法としてはGRPOだが、圧縮率を考慮した報酬設計と、カリキュラムの段階的な構築が肝であり、
- 圧縮率c_t \in (0, 1] の圧縮率の元、これまでのcontext h_t, retrieveされたスキルSをVision Encoderでエンコードし潜在表現V_tを得て[^1]; 式(2)
- V_tに基づいて次のaction a_tがポリシーによって生成される; 式(3)
- GRPO 式(5) が通常のRLVRに加えて、式(4)で表される圧縮率に基づいた報酬によって定義され実行される。要は、より高い圧縮率でcontext、およびretrieved skillを圧縮してタスクが成功したら報酬がより高くなる
という構造になっている。学習させる際は、カリキュラム学習を実施する(3.3節)。どのようにカリキュラム学習を成立させるかというと、学習をいくつかのstageに分けて、ポリシーに与えるSkillのContextを線形にdecayさせていく。これにより、徐々に与えられるContext量が減っていき、難易度が高くなるようなカリキュラムとなる。
3.3節、式4あたりが本提案手法のIn-Context Reinforcement Learning (ICRL)と命名される気持ちな気がしており、モデルはもともとIn-Context Leainingの元、スキルを実施できるが、それを与えるコンテキストを徐々に減らしてパラメータの内部に学習させていく、これをRLによって実現する(=ICRL)という気持ちなのかなと思われる。
[^1]: pixel-basedな潜在表現でレンダリングされたテキストに関する情報を扱えることが先行研究で示されており、画像としてエンコードした方がcontextを節約可能なのでこのような方法が採用されている。
ベースラインとなるSkillRLと比較して、個別のタスクレベルで見ると優劣は分かれるものの、ALFWorld [Paper Note] ALFWorld: Aligning Text and Embodied Environments for Interactive Learning, Mohit Shridhar+, ICLR'21, 2020.10
, 様々なQAベンチマーク(Search-QAと呼称) [Paper Note] Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning, Bowen Jin+, COLM'25, 2025.03
での全体としてのパフォーマンスは向上し、コンテキストが節約されることでコストを大幅に削減できているような結果となっている。
3.3節の(a), (b)の部分は読めていないがこちらも時間があるときに読みたい。Skill Budgetの調整に絡んでいそうではある。
[Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Planning #Evaluation #read-later #One-Line Notes #LongHorizon Issue Date: 2026-04-04 GPT Summary- LLMエージェントの戦略的一貫性の維持に関する課題を評価するため、YC-Benchを導入。シミュレートされたスタートアップを通じて、誤った意思決定の累積影響を調査。12モデルを比較した結果、Claude Opus 4.6が平均1.27百万ドルの資金で最高成績を収め、一貫して成功したモデルは3つのみ。特にスクラッチパッドの使用が成功に大きく寄与し、敵対的なクライアントの検出が主な失敗因として浮かび上がった。全体として、モデルの固有の故障モードが長期的なパフォーマンスにおける能力のギャップを明らかにした。YC-Benchは再現性と設定可能性を備えたオープンソースのベンチマークである。 Comment
pj page: https://collinear-ai.github.io/yc-bench/
元ポスト:
スタートアップの経営を通じてAI Agentをlong horizonの計画、実行能力を評価するような枠組みらしい。
[Paper Note] CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation, Max Fu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Evaluation #Coding #SoftwareEngineering #read-later #Robotics #EmbodiedAI Issue Date: 2026-04-04 GPT Summary- Code-as-Policy(CaP)は、自律的なロボット制御における実行可能なコードの有効性を探求するためのフレームワークCaP-Xを提案します。中心となるCaP-Gymは、感知と制御を組み合わせてロボットを制御するインタラクティブ環境を提供します。CaP-Benchを利用して12モデルを評価した結果、手作りの抽象化が性能を向上させる一方、先入観の排除で性能が低下し、設計者の足場に依存していることが明らかになりました。このギャップは、推論時計算や複数ターンの相互作用を通じて緩和可能です。これにより、学習を要しないCaP-Agent0が活用され、シミュレーションや実機タスクで人間レベルの信頼性を回復させます。CaP-RLを導入することで強化学習が成功率を向上させ、シミュレーションと実機間の移行を円滑にすることを確認しました。CaP-Xは、具現化されたコーディングエージェントを推進するためのオープンアクセスプラットフォームを提供します。 Comment
元ポスト:
[Paper Note] Think Anywhere in Code Generation, Xue Jiang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Coding #Reasoning #SoftwareEngineering #read-later #Reference Collection Issue Date: 2026-04-04 GPT Summary- LLMsの事前思考に依存したコード生成は制限があり、全体の複雑性を理解するには不十分である。これに対抗するために、Think-Anywhereという新しい推論機構を提案し、任意のトークン位置で推論を呼び出すことを可能にする。これにより、推論パターンの模倣と成果ベースのRL報酬を活用し、推論のタイミングを自律的に探索させる。広範な実験で、Think-Anywhereは最先端の性能を実現し、多様なLLMsにおいて一貫した一般化を示すことが確認された。 Comment
元ポスト:
解説:
[Paper Note] PRBench: End-to-end Paper Reproduction in Physics Research, Shi Qiu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ScientificDiscovery #Reproducibility #Physics Issue Date: 2026-04-04 GPT Summary- 大規模言語モデルを用いたAIエージェントは、科学研究タスクを支援するが、実際の科学論文からの再現性に課題がある。PRBenchを導入し、物理学の専門家が選んだ30のタスクに基づき、エージェントが論文の方法論を理解し、アルゴリズムを実装する能力を評価。エージェントは指示と論文内容のみを使い、実行環境で動作。評価の結果、GPT-5.3-Codexが最も高いスコアを得るも、全エージェントの再現成功率はゼロで、誤実装やデバッグ不能の問題が確認された。PRBenchは自律的な科学研究の進展を評価するための厳格な基準を提供する。 Comment
元ポスト:
[Paper Note] KAT-Coder-V2 Technical Report, Fengxiang Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #SoftwareEngineering #read-later Issue Date: 2026-04-04 GPT Summary- KAT-Coder-V2は、快手のKwaiKATチームが開発したエージェント指向のコーディングモデルで、5つの専門ドメインに分解し、それぞれを教師あり微調整と強化学習で独立学習した後、単一モデルに統合します。KwaiEnvを用いて数万の同時サンドボックス環境を支え、RL訓練をスケーリング。MCLAとTree Trainingにより計算の冗長性を排除し、最大6.2倍のスピードアップを達成。SWE-benchで79.6%、PinchBenchで88.7のスコアを記録し、複数のベンチマークで首位を獲得しました。モデルは公開されています。 Comment
元ポスト:
Claude Opus 4.6に近い性能を持つagentic coding modelとのこと。
[Paper Note] Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey, Wei-Chieh Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #read-later #memory Issue Date: 2026-04-04 GPT Summary- 人工知能の研究は、ベンチマークスコアから現実世界での評価にシフトしている。今後の課題は、長期・動的な環境でのエージェントの真の有用性の確保であり、記憶がその解決策として重要視されている。本調査では、エージェント記憶を記憶基盤、認知機構、記憶対象の三次元から検討し、記憶操作を学習ポリシーと関連付けて分析。記憶の有用性評価のためのベンチマークと指標も提案し、未解決の課題と今後の方向性を示す。 Comment
AI Agent + memory に関するサーベイ。とんでもない量だ。。。
github: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory
元ポスト:
以下の3つの軸で整理されているようである
- メモリの基盤 (Memory Substrate):
- internal: 重み、潜在表現、KVCache
- external: vector stores, knowledge graphs, text records
- 認知機構 (Cognitive Mechanism)
- メモリの対象 (Memory Subject)
2023--2025の218の文献をレビューしたとのこと。
open challengeとしては
- continual learning
- multi-human-agent memory organization
- memory infrastructure and efficiency
- life-long personalization and trustworhy memory
- multimodal grounding
- real-world evaluations
と題されている。
[Paper Note] Embarrassingly Simple Self-Distillation Improves Code Generation, Ruixiang Zhang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Coding #PostTraining #read-later #SelfDistillation #Author Thread-Post Issue Date: 2026-04-04 GPT Summary- 簡易自己蒸留(SSD)を用いて、LLMが独自の出力のみでコード生成の改善が可能であることを示す。特定の温度とトランケーション設定で出力をサンプリングし、その後教師付きファインチューニングを行うことで、Qwen3-30B-Instructのパフォーマンスを42.4%から55.3%に向上。4B・8B・30Bスケールのモデル間で一般化され、改善のメカニズムをLLMデコードの精度と探索の相互関係に関連づけて検討。SSDは、精度を高めつつ多様性を保持するアプローチとして、LLMのコード生成に寄与する可能性を示唆する。 Comment
元ポスト:
所見:
解説:
著者ポスト:
[Paper Note] HippoCamp: Benchmarking Contextual Agents on Personal Computers, Zhe Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Search #Dataset #Personalization #Evaluation #MultiModal #VisionLanguageModel #One-Line Notes #Environment Issue Date: 2026-04-04 GPT Summary- HippoCampは、エージェントのマルチモーダルファイル管理能力を評価する新しいベンチマーク。ユーザー中心の環境でエージェントを評価し、個々のユーザープロファイルをモデル化し、膨大な個人ファイルを検索。42.4 GBに及ぶ2,000件以上の実世界ファイルから581のQAペアを構築し、エージェントの検索や推論能力を評価。最先端のマルチモーダル大規模言語モデルは、ユーザープロファイリング精度が48.3%に留まり、個人ファイルシステムにおける検索や推論に苦戦。HippoCampは、現行エージェントの制約を浮き彫りにし、次世代AIアシスタント開発の基盤を提供。 Comment
pj page: https://hippocamp-ai.github.io/
元ポスト:
「私の水曜日の予定はなんですか?」といったような、user-centricなタスクにおける、ユーザ個人のcontextを含むファイル検索やプロファイリング、reasoningを必要とする、よりuser-centricな情報を扱う必要があるベンチマークのようである。ユーザのプロファイルやpersonal情報が格納されたEnvironmentが提供されている。
environment: https://hippocamp-ai.github.io/hippocamp/
[Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Coding #SelfImprovement #SoftwareEngineering #read-later #Selected Papers/Blogs #AgentHarness Issue Date: 2026-03-31 GPT Summary- 大規模言語モデル(LLM)の性能は、ハーネスと呼ばれる情報の保存・取得・提示を決定するコードに依存しているが、従来のハーネス設計は手作業が主で、最適化手法はフィードバックを圧縮してしまう。そこで、Meta-Harnessを提案。これはLLMアプリケーションのハーネスコードを探索する外部ループシステムで、エージェント的提案者を通じて過去の実行トレースを活用。Meta-Harnessは、オンラインテキスト分類で7.7ポイントの向上を示し、リトリーバルを用いた数学推論では200問の正確度を4.7ポイント改善。また、エージェント的コーディングでは手作業設計を超える成果を上げる。これにより、より豊かな過去の経験が自動化されたハーネス設計を実現可能であることが示された。 Comment
元ポスト:
pj page: https://yoonholee.com/meta-harness/
Darwin Godel Machineと非常にコンセプトが似ているという指摘がある
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
所見:
解説:
[Paper Note] AIRA_2: Overcoming Bottlenecks in AI Research Agents, Karen Hambardzumyan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AutoML #LongHorizon #Initial Impression Notes #Asynchronous Issue Date: 2026-03-30 GPT Summary- 既存のAI研究エージェントの課題に対処するため、AIRA$_2$を提案。非同期マルチGPUワーカープールによりスループットを向上し、信頼性の高い評価信号を提供するHidden Consistent Evaluationプロトコルを導入。また、動的に行動を変更できるReActエージェントを用いる。MLE-bench-30でAIRA$_2$はパーセンタイル順位71.8%を達成し、過去最高を更新。各要素の必要性を示し、評価ノイズによる「過剰適合」の誤解を明らかに。 Comment
元ポスト:
AutoMLベンチマーク(MLE-Bench-30)においてSoTAな手法らしい。AutoMLの現状を概観するのに良さそう。
- MLE-Bench, OpenAI, 2024.10
72h実行して、36.7%程度のコンペティションでGold medalを獲得している。よくよく表を見ると、FM-Agent 2.0の方が24hで全体的に高いメダル獲得率のように見えたのだが、そもそもMARS+, MARS, FM-Agent 2.0, そしてMLEvolveはcon-current workとのこと。2024年10月にMLE-Benchが発表され、[Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10
を見るとo1-previewでgold medalは10%程度だったが、そこから約1年半でgold medalの比率は+26%程度まで向上しているということになる。
- [Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10
ベンチマークが公開されたら早々にサチりそうな気がしていたが、個人的に思っていたよりもスコアの伸びが遅いという感想。
[Paper Note] Agentic Uncertainty Quantification, Jiaxin Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Hallucination #Ambiguity Issue Date: 2026-03-30 GPT Summary- AIエージェントは長期的な推論に優れた能力を持つが、「幻覚の螺旋」により信頼性が損なわれる。既存の不確実性の定量化手法は受動的で、自己反省は無目的な修正に苦しむ。これを解決するために、言語化された不確実性を双方向の制御信号に変換する二過程型エージェント式UQフレームワークを提案。System 1は不確実性を伝達し盲目的な意思決定を防ぎ、System 2は合理的な手掛かりを使って必要時に推論を行う。実験によって、訓練不要で高い性能を示し、信頼できるエージェントの実現に向けた一歩としての可能性を示唆している。 Comment
元ポスト:
[Paper Note] Memento-Skills: Let Agents Design Agents, Huichi Zhou+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ContinualLearning Issue Date: 2026-03-30 GPT Summary- Memento-Skillsは、継続的に学習可能なLLMエージェントシステムで、タスク特化型エージェントを自律的に構築・改善する。メモリベースの強化学習フレームワークを用い、再利用可能なスキルを永続的な記憶として保存。基本的なスキルから始まり、読み書き反省学習によって継続的に改善。エージェントは関連スキルを選択・更新し、自らの能力を向上させる。実験では、General AI Assistantsベンチマークで26.2%、Humanity's Last Examで116.2%の改善を示した。コードは公開中。 Comment
元ポスト:
[Paper Note] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild, Peng Xia+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AgentSkills #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-03-26 GPT Summary- MetaClawは、LLMエージェントが変化するニーズに対応するための継続的メタ学習フレームワークである。失敗軌跡を解析して即座にスキルを合成し、ダウンタイムをゼロにするスキル駆動の適応や、機会主義的ポリシー最適化を通じて、効果的に能力を更新する。これにより、精度を最大32%向上させ、全体のパイプラインの精度も21.4%から40.6%に増加させることが示された。 Comment
元ポスト:
関連:
- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
と一見すると似たような研究に見えるが、
[Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
の肝は「trajectory中のprocessにおいて活用可能なシグナルがあるから、それをもっと活用しよう」という気持ちで、
本研究は「失敗したtrajectoryに適用するためにSkillを合成し、ユーザが利用しないIdle Timeの間にLoRA + RLでポリシーの重みも更新して賢くしよう」という気持ちであり、目的が異なるように見える。
- [Paper Note] SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks, Xiangyi Li+, arXiv'26, 2026.02
においては、Skillをtaskに関する手続的な知識に基づいてスキルを自己生成しても性能向上せず、むしろ悪化させるような結果が出ており、不用意にSkillを合成すると性能が劣化するという結果が出ている。
本研究は失敗したtrajectoryに対して適応するためのSkill合成である点と、LoRAによってポリシー自体も賢くなるのであれば前提が変わるので話は変わってくるのかな、という印象。
[Paper Note] ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning, Shengyuan Ding+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #MultiModal #CVPR #PostTraining #VisionLanguageModel #RewardModel #GenerativeVerifier #ToolUse Issue Date: 2026-03-25 GPT Summary- ARM-Thinkerは、視覚と言語の報酬モデルを向上させるためのエージェント型システムであり、外部ツールを自律的に活用して結果を検証可能にする。これにより、幻覚や視覚的グラウンディングの弱さを克服し、複数ページの証拠を比較して推論を支持する能力を持つ。多段階強化学習によって訓練され、ツール呼び出しの意思決定と判断精度を最適化。新たに導入したARMBench-VLで評価した結果、報酬モデリングで平均+16.2%、ツール使用タスクで+9.6%の改善を達成。エージェント的なアプローチが精度と解釈性の向上に寄与することを示している。 Comment
元ポスト:
元ポスト:
[Paper Note] PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost, Junkeun Yi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading #KeyPoint Notes Issue Date: 2026-03-25 GPT Summary- 計算効率とOOD能力のトレードオフを解消するために、PivotRLという新しいフレームワークを提案。局所的なオンポリシーロールアウトで高い分散を持つ情報量豊かな中間ターンを選別し、機能的に同等なアクションに報酬を与えることでポリシー確率の維持を促進。PivotRLは4つのエージェント系ドメインでインドメイン精度を平均4.17%向上、OOD精度を10.04%高め、少ないロールアウトターンでE2E RLと同等の精度を実現した。NVIDIAのNemotron-3-Super-120B-A12Bに採用され、実運用規模のエージェント後訓練の主力として機能中。 Comment
元ポスト:
ポイント解説:
関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01
SFTはデータ効率が良いがOODへの汎化性能が弱い。一方でE2E RLは、OODへの汎化性能が高いが軌跡をfullでロールアウトしなければならず計算コストが高い。この両者の良いところどりができないか?という研究。
SFTデータ(expertのtrajectory)が与えられた時、trajectoryをturnレベルに分割(状態sとアクションaのタプル)。reference policy(RLの初期値に用いるモデル)でロールアウトを行い、
- rewardの分散が0より大きい(すなわち、GRPOのadvanatageが計算可能なターン)
- およびrewardの平均が小さいターン
のみにフィルタリングし、学習する価値の高いターンのみにまずフィルタリングする(D_pivot)。
その上でSFTのような文字列のexact matchによるrewardではなく、ポリシーの出力がactionとしてacceptableなものか否か(完全一致ではなく正しい方向のアクションなら報酬を与える)によって報酬を与えるようなGRPOスタイルのRLで学習する。
E2E RLベースライン(GRPO)と比較して、wall clocktimeベースで4.1--5.5倍程度の速度で同等の性能に到達する。
頻繁にPivotRLの名前を目にするようになってきた。
