SelfImprovement (111) — 1/1
[Paper Note] EvoOntology: A Self-Evolving Ontology Layer for Data Agents, Meiduo Chong+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #KnowledgeGraph #AIAgents #MCP #AgentHarness Issue Date: 2026-09-29 GPT Summary- 異種データとエージェントの間にあるアクセスのギャップを埋めるため、自己進化型オントロジー層EvoOntologyを提案。schema・content・tool層をMCP serverとして統合し、LLMエージェントが実行時にオントロジーへ問い合わせ・相互作用することを可能にする。builder agentによる自律的なオントロジー構築と、帰属情報に基づく型付き編集およびペア評価による自己進化ループを導入。4種類のLLMと3つのデータエージェントベンチマークで、既存手法を一貫して上回り、異種データとの効果的な相互作用を実現。 Comment
元ポスト:
[Paper Note] Recursive self-improvement of AI research agents, Dhruv Srikanth+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Generalization #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-24 GPT Summary- AI研究エージェントに自身のコードを改善させ、性能評価に基づいて優れた変更を保持する再帰的自己改善システムAIDE^2を提案。 8日間で7回の改善を発見し、探索方策やコンテキスト管理用のメモリ機構を改良。 4つの未使用ベンチマークで人間設計のエージェントと同等以上の性能を達成し、報酬ハッキングも55%から32%へ低減。 Comment
ブログ版:
- AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
元ポスト:
著者ポスト:
[Paper Note] RRSI: Regularized Recursive Self-Improvement of Agent Harnesses, Peng Xia+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Regularization #Generalization #needs-revision #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-23 GPT Summary- LLMエージェントのハーネスを、プロンプトや制御フロー、ツール、メモリの編集によって再帰的に自己改善。提案と選択を正則化し、ベンチマーク固有の過適合や不要な変更を抑制することで、再利用可能なエージェント機構を獲得。8つのベンチマークで最大14.1ポイント、分布外評価で最大4.7ポイントの性能向上を達成し、正則化なしの手法より30%少ないポリシートークンで実行可能。 Comment
元ポスト:
pj page: https://regularized-rsi.com
自己改善をするハーネスにおいて、改善されたハーネスが評価データのスコアは向上するが、OODなデータに対して汎化しないという課題がある。これに対して、機械学習モデルにおける正則化の考え方をharnessの"探索"に導入することで対処する。
大前提として、ハーネスHとはAI Agentを構成する要素のうち、weightを除く全ての機構を指す総称であり、たとえば以下が含まれる:
- system/task prompts
- エージェントがいつプランを練り、行動し、内省あるいは終了するか等を決める制御フロー
- ツールインタフェースとその定義
- メモリやスキルに関するファイル群
- 各ステップにおいてポリシー(モデル)が何を観測できるか、すなわちコンテキストを管理するマネージャ
本研究を理解する上で、二つの役割を理解する必要がある(式2):
- Proposer: 現在のハーネスH_tに基づいて進化用データD_evolve中のタスクを実行し、そのtrajectoryの要約からFeedback F_tが生成されるとき、H_t, F_tに基づいて、進化後のハーネスの集合を出力する機構(LLM)。
- Selector: D_evolveと進化先の候補となるハーネス集合、および現在のハーネスH_tが与えられた時、最もスコアが高いハーネスを選択する機構
正則化はProposerとSelectorそれぞれに対して適用される。Figure 2に、それぞれどのような正則化が提案されているかが示されている。
(後ほど追記する)
著者ポスト:
著者ポスト2:
関連:
- [Paper Note] Recursive self-improvement of AI research agents, Dhruv Srikanth+, arXiv'26, 2026.09
- AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
[Paper Note] Self-Organizing Agent Teams Learn to Reason Together, Aneesh Pappu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #autoresearch/RSI #Author Thread-Post #Coordination Issue Date: 2026-09-23 GPT Summary- 固定編成のAIエージェント・チームが、過去の協働から役割・対話・情報の流れを学習し、未知の問題に適応するSelf-Organizing Agent Teams(SAT)を提案。 エージェント同士が部分的な推論を交換・批判・修正・統合することで、単独では到達できない解答を生成する。 数学・物理学ベンチマークで既存の単独推論やルーターを上回り、改善効果は正しい推論を識別する能力(デモンストラビリティ)と強く相関。 Comment
元ポスト:
[Paper Note] SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness, Haozhe Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-09-20 GPT Summary- コーディングエージェントの長期的な推論・ツール利用では、トークン効率が重要となるため、RSIに着想を得た自動ハーネス探索を提案。 複数環境で研究ループをスケールさせ、行動実行・コンテキスト圧縮・観測処理・委譲読解に関する4つの機構からSoL-Piを構築。 EdgeBenchではGPT-5.6、Sol、Opus 5でPiと同等の性能を維持しつつ、トークン通信量を44.7~49.0%、APIコストを約3分の1削減。 Comment
元ポスト:
[Paper Note] Dream-RSI: Recursive Self-Improvement through Evolving Worlds, Tong Zheng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-16 GPT Summary- 再帰的自己改善を実現するために、\textsc{Dream-RSI}というスケーラブルな探索フレームワークを提案。これにより、探索を明示化し、基盤エージェントを変更せずに効果的な探索戦略を管理可能に。累積された発見履歴を用いたリプレイシミュレータにより、オフポリシーで迅速なフィードバックを確保し、高コストのオンライン評価を回避。改善されたポリシーを再デプロイし、自己改善ループを拡充。競争力のある発見品質を維持しつつ、設定によっては発見コストを大幅に削減。 Comment
元ポスト:
ざーっと見たが、dreamingが何を指すのかよくわからない。どういう操作のことを指しているのか。
図中の太字部分がReplay Simulator、およびdreamingの話をしている気がするが、まだよくわからない。つまり、蓄積されたtrajectoryを再生成せずにprefillに使って、探索木で分岐が生じた場合は現在のポリシーに基づいて判断をし、再利用できる探索がなくなるまでこのような操作を繰り返すことで効率化するということだろうか。
[Paper Note] When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis, Kaiyuan Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #Evaluation #Test-Time Scaling #One-Line Notes #LongHorizon #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 大規模言語モデル(LLM)エージェントは、計算資源を動的に配分しながら解を修正するオープンエンドの課題に取り組むが、これが性能測定を難しくする。中間提出物に連続的なスコアを提供するElo-per-token分析を提案し、トークンごとの最良解を追跡する。4つの汎用エージェントを使って4つのベンチマークに適用した結果、初期は独立サンプリングよりも速くEloを転換できるが、最終的には性能が下回ることが分かった。一方、人間の競技者は超線形に改善しており、LLMには継続的な成長の余地がある。限界点を特定し、資源を分割投入した結果、顕著なEloの向上を得た。 Comment
元ポスト:
GPUカーネルの最適化等のopen-endだがスコア化可能なタスクにおいて、エージェントのスコアは対数線形にスコアが伸びるが、人間の場合は非線形にスコアが伸び、長期間にわたると最終的にエージェントを現時点では上回る、という話のようである。
pj page: https://agent-tts.github.io/agent-tts/
Elo-per-Tokenと呼ばれる指標を提案しているようで、異なるタスクの場合はスコアの比較ができず、かつ同一タスクであっても同じスコアの伸びが同じだけ進歩を反映しているとは限らない。こへをスコアリングではなくratingをすることで比較可能にする。具体的には、トークン予算ごとにタスクごとのシステム-ベストスコアを記録し、Eloレーティングを計算し、スケールが異なるタスクでもEloの場合は順序関係に基づいてratingが算出されるため、タスクを横断してシステム間の性能が比較可能となる、という感じのようである。
[Paper Note] The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement, Yi Duan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #autoresearch/RSI Issue Date: 2026-09-13 GPT Summary- 再帰的自己改善(RSI)を通じて、AIシステムが経験やフィードバックを活用して能力を向上させる。まず、Headroom-Closed Index(HCI)を用いてLLMsの問題点を明確にし、次にRSIの概念や開発のステップを示す。自立的な改善実行や経験取得、環境適応などの要素を展開し、科学的発見やソフトウェア工学などのシナリオにおける特性を強調する。多様な実証的証拠に基づきRSIを実用化する際の主要な課題を特定。 Comment
元ポスト:
[Paper Note] AI Research Preference Models, Thomas Simon Foster+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #Evaluation #ScientificDiscovery #LongHorizon #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- AI研究エージェント(AIRA)は、機械学習実験の効率を高めるために、評価コストを抑えるAI研究嗜好モデル(RPMs)を導入。これにより、候補解の中から最も有望なものを予測し、固定予算内での進捗を最適化。RPMsは事前学習済み言語モデルの変種として構築され、AIRA-dojoに統合後、機械学習ベンチマーク AIRS-Benchでのスコアを向上させ、実行時間を短縮しながら新たな最先端結果を達成。 Comment
元ポスト:
[Paper Note] LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering, Yi Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Evaluation #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- ループエンジニアリングにおいて、コーディングエージェントがタスクを実行する際の進行を管理するためのベンチマーク「LoopArena」を提案する。この評価では、コントローラーがエージェントに次のアクションや検証を指示し、タスク遂行の成功を測定する。三つの異なる設定で評価を行い、観察された最高成功率は24.69%であり、長期的な改善の余地があることが示された。評価コードは公開されている。 Comment
元ポスト:
[Paper Note] Meta$^n$: Recursive Self-Improvement through Emergent Depth, Zae Myung Kim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- 自己改善するLLMエージェントは、従来の方法ではメタレベルの固定に限界があり、メタ操作を安定化させる必要がある。本研究ではMeta^nを提案し、固定されたメタ操作で再帰的に作用する新しいアプローチを採用。Ω演算により、生成物に繰り返し適用し、次層を戦略的に処理する。深さは入力の増大に応じて決まり、進化的なアーカイブを活用。実験により、Meta^nが従来の自己改善エージェントを上回り、特にARC-AGI-2ではゼロスコアを超える性能を達成。再帰的利得は条件付けに起因し、層ごとの役割が進化することが示唆された。コードは公開済み。 Comment
元ポスト:
[Paper Note] Automated Researchers Can Mitigate Well-characterized Alignment Failures, Chen Yueh-Han+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Alignment #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-05 GPT Summary- 自動化された整合性研究者(AARs)は、整合性の失敗を緩和するために複数の安全ベンチマークを最適化する手法を提案。最強のAAR法は整合性の失敗を大幅に減少させ、他のベンチマークや大規模モデルへの一般化も実現。人間の研究者によるワンショット法と比較して、AARは優れた性能を示し、経験豊富な研究者の助言が必須でない可能性を示唆。これにより、整合性研究の自動化が実用的であることが示された。 Comment
blog: https://alignment.anthropic.com/2026/automated-alignment-researchers/
元ポスト:
解説:
[Paper Note] Praxist: From Experimental Artifacts to Solution Lineages, Jin Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Initial Impression Notes #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-04 GPT Summary- Praxistは、自律的な研究開発エージェントの限界を克服するために設計された系統情報中心のシステムで、成果物と評価結果を構造化します。このシステムは、局所的な成果物を証拠統合と分離することで、後続の試みで検証された機構を継承し、再現可能な結果を維持します。標準化された75タスクにおいてPraxistは60枚のメダルを獲得し、経済的にも優位性を示しました。四つのケーススタディによってオープンエンドの問題への適用が成功し、各タスクでの精度向上や資源コストの削減が記録されました。この新たな成果物のアプローチは、従来のものに比べて強力かつ効率的です。 Comment
blog: https://praxist.sapient.inc/en
元ポスト:
要はRSIのためのAgent Harnessのようである。
github:
https://github.com/sapientinc/praxist
Table2を見ると、Claude Code + Opus 4.8に対して、PRAXIST + DeepSeekV4-Proで性能が比較されている。
[Paper Note] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement, Haoyang Yan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-09-04 GPT Summary- 自律的なソフトウェア開発を探求し、LLMベースのコーディングエージェントが高レベルの要件から機能的なソフトウェアを生成する。Harness-of-Harness(HoH)フレームワークを導入し、コーディングエージェントによる継続的な改善を促進。HoHは反復的な計画—コーディング—テストループを組織し、修復と能力成長のバランスを取ることで、開発を小さく検証可能なインクリメントに限定。GameCraft-Benchなどで、HoHはスタンドアロンハーネスを上回り、平均52.25%の相対ゲインを達成。数日間の展開で、完全な一人称視点シューティングゲームを自律的に開発した。 Comment
元ポスト:
abstを読むだけだとよくわからない
[Paper Note] Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses, Zhaochen Yu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #AIAgents #memory #AgentSkills #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- Recurisは再帰的自己改善の課題に対処するための作業記憶アーキテクチャで、タスクの履歴が増えてもスキル利用を最適化することを目指す。タスク進行を追跡し、現在のニーズに基づいたスキル選択を行うことで、実行を証拠に変換し、失敗を特定に局在化する。4つのベンチマークで35件のモデルが成功率を向上させ、特にtau-benchではGPT-5.6 Solに+17.8ポイントの向上を示す。長期的な互換性では利点が拡大し、一般的な失敗を最大80%低減することが確認された。 Comment
元ポスト:
[Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #AgentHarness Issue Date: 2026-08-30 GPT Summary- Prime Agentは、長期的な評価とコーディングエージェントのワークフロー用のオープンソースハーネスであり、再帰的サブエージェントや永続的なIPython REPLを利用して、エージェント間の直接通信や軌跡を跨いだ記憶管理を実現します。このシステムにより、計算リソースの管理と戦略の構築が効率化され、長期コンテキストのコーディングやGPUカーネル生成での性能が大幅に向上しました。具体的には、ARC-AGI-3 RHAE Best@1のスコアを30%から95.5%に引き上げ、Factorioでは専用サブエージェントにより継続的な技術進歩が促進されました。コードは公開されており、自由に利用可能です。 Comment
- Prime Agent: A self-improving RLM agent, Prime Intellect, 2026.08
のテクニカルペーパーが出たようだ。
元ポスト:
[Paper Note] Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection, Atsuyuki Miyai+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Initial Impression Notes #AgentHarness Issue Date: 2026-08-27 GPT Summary- ハーネス最適化を効率化するために、適応的検証タスク選択の新手法Task-CoEvolveを提案。ハーネスが評価コストを削減しつつ進化する中で、情報量の多いタスクの選択と部分評価から性能推定を行います。Task-CoEvolveは、エージェントの能力境界付近のタスクに重点を置き、固定サブセットのベースラインを上回りつつ、評価回数を80%削減する効果を実験で示しました。コードは公開予定です。 Comment
元ポスト:
ハーネスを最適化する際に、すべてのタスクで評価をするのではなく、効果が高いものを選択し効率化する、という話に見える。
[Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- エージェント性変異演算子(AVO)は、進化的探索において従来の手法を自律的なコーディングエージェントに置き換える新たな手法である。候補生成に言語モデルを限定せず、AVOは自己指向的なエージェントループとして実装編集を提案する。NVIDIA Blackwell上での評価において、AVOはマルチヘッド・アテンションの自律進化を通じて、cuDNNやFlashAttention-4を上回る最適化を発見。これにより、エージェントが進化パイプラインの候補生成者から変異演算子へと進化し、最先端のGPU上で顕著な性能向上を示すことが明らかとなった。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
[Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- InfiAgentは、LLMエージェントの文脈を厳密に制限し、永続状態を外部化する汎用的なフレームワークである。文献信息調査の実験により、20Bのオープンソースモデルを用いても、特定の微調整なしで長期的なカバレッジを向上させることが示された。これにより、長期安定性を求めるエージェントの実用的な基盤が支持される。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
[Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- ARC-AGI-3は、ゲームの規則や状態を推測しながらプレイヤーが行動効率を保つインタラクティブな環境を提供する。Tychoシステムを通じて、ゲーム固有のモデルを構築し、自由形式の仮説を検証・計画・修復する能力を付与。実行可能な観測から改善された行動効率(RHAE)は88.49に達し、選択した方針ではRHAEが100.00に到達。自動修復後のモデルは正確ながらRHAEは減少。強いプレイには、モデル利用のタイミングを決定することが重要であり、これを能動的抽象化と称す。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
[Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongHorizon #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- エージェント性を持つシステムはAI研究の自動化を進めているが、研究目的を実験的に検証されたMLシステムに変換することは依然として課題である。これを「長期的なML研究エンジニアリング」として研究し、マルチエージェントシステムAiScientistを紹介。File-as-Busワークスペースを通じて研究チームが協調し、進捗を管理。PaperBenchではGemini-3-FlashおよびGLM-5を用い、それぞれ9.92点と11.15点の改善を達成。MLE-Bench Liteでも両方のバックボーンが81.82 Any Medal%を達成し、強力な基準を上回る改善を示した。アブレーション実験は、プロジェクトの耐久性が後の改良に重要であることを明らかにし、システム的な進捗維持の重要性を示唆している。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
Orchestratorは簡潔な情報に基づいて個々のWorkerを制御し、Workerはファイルシステム上に残された詳細な情報にアクセスできるようにするようなアーキテクチャ
[Paper Note] What is Missing from AI Post-Training AI: An Empirical Analysis, Joy Jia Yin Lim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #autoresearch/RSI #Creativity Issue Date: 2026-08-24 GPT Summary- LLMエージェントは、訓練戦略の内部で反復しながら事後訓練を行い、下流の性能を改善する能力を持つ。しかし、実際には初期の戦略が固定され、訓練後は局所的な調整に陥ることが多い。これに対し、経験駆動のアプローチは実行力を向上させ、指導は初期戦略を効果的に再指向するが、その後の調整は不十分である。重要なのは、エージェントが自発的に戦略を再評価する仕組みが欠けていることである。 Comment
元ポスト:
[Paper Note] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement, Yizhe Chi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #autoresearch/RSI #Author Thread-Post #Creativity Issue Date: 2026-08-22 GPT Summary- 再帰的自己改善(RSI)に関する本研究は、AIシステムが他のAIシステムを自ら改善できるかを探求し、その過程として訓練アルゴリズムの設計が鍵となることを示す。AI4AI-Benchという新たなベンチマークを提示し、エージェントが訓練アルゴリズムを最適化する能力を評価。各タスクにおいてエージェントはコードを書き換え、実行結果を比較。平均スコアは0.166、最良システムで0.250に達したが、既存アルゴリズムとの距離は依然として大きい。タスク群や評価結果を公開し、再現性のある測定を可能にする。 Comment
元ポスト:
[Paper Note] The Problem Is the Problem: Towards Scalable Mathematical Discovery, Zeyu Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #AIAgents #Mathematics #read-later #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- AIシステムは数学研究の効率化を進めており、希少な資源を適切に配分することが重要な課題である。従来のAIを活用した数学ワークフローでは、人間の労力が初期と末端に集中し、研究課題の選定と成果物のレビューがボトルネックとなっている。新たに提案する人間-AI発見パラダイムでは、専門家が関心のある研究方向を設定し、システムが文献から候補問題を検索。Find, Attempt, and Recommend(FAR)を構築し、問題探索を自動化する。組合せ論の実験では、5,245件の論文から6,453件の候補を収集し、最終的に77件の潜在的解決策を選定。これにより新しい協働モードの有効性が示された。 Comment
元ポスト:
[Paper Note] Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution, Anton Razzhigaev+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #AgentHarness Issue Date: 2026-08-14 GPT Summary- Ouroborosは自己開発型エージェントのハーネスで、改善はレビュー済みのコミットを通じて行われる。コアの進化には再帰的自由進化と経験駆動の進化があり、社会的相互作用を通じて欠陥を露呈し、構造的変更に繋がる。Terminal-Bench 2.1ではOpus 5が86.74%、OSWorld-Verifiedでは90.69%を記録し、新たな最先端となった。Hopeでは、161日間の生存実験が行われ、エージェントが自己進化しながらも運用上の安全性が重要な課題として残っている。 Comment
pj page: https://ouroboros-agent.ai/
元ポスト:
[Paper Note] Self-Evolving Coding Agents, Hao Zhou+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Survey #AIAgents #Coding Issue Date: 2026-08-10 GPT Summary- 大規模言語モデルを用いた自己進化型コーディングエージェントが、ソフトウェア開発に動的に対応する研究が進展している。これらのエージェントは、過去のインタラクションからフレームワークやツールを更新し、将来の挙動を改善する。総説では、自己進化型エージェントの定義や特徴、進化のオブジェクト中心の分類法を提示し、実行可能なフィードバックが重要であることを明示する。また、信頼性や安全性に関する新たな課題を整理し、より適応的で信頼性の高いエージェントの設計に貢献することを目指す。 Comment
元ポスト:
[Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongHorizon #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-08-10 GPT Summary- 持続的な自己進化を実現する実行環境Argusを提案。これはエージェントが安定したユーザー意図を維持しつつ、運用目標に基づいてミッションを遂行する。Argusは固定されたモデル重みを保ちながら、自己進化を運用状態と制御方針を通じて実現。SWE-Bench Proで78%、AARRI-Benchで76.8%を記録し、各アクティブワークフロー時間を短縮しつつ、検証やレビューの精度を向上。これにより、将来的な教師あり学習と強化学習のための構造化した進化を実現することを示した。 Comment
元ポスト:
メモリに永続化する情報を検証プロセスを通じて選別することで、誤った情報が蓄積され増幅されることを緩和する
[Paper Note] Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories, Shuai Shao+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Online/Interactive #NLP #LanguageModel #ReinforcementLearning #AgentHarness Issue Date: 2026-08-10 GPT Summary- Harness-R1は、デプロイメント中にエージェントが蓄積する相互作用の軌跡を用いて行動を最適化する初の方法を紹介する。オンライン強化学習を活用し、固定されたエディタではなく、エージェントの成功に基づいた編集を学ぶ。これにより、成功率はWebShop、ALFWorld、DBBenchで44.3%から53.6%に向上し、ターゲット特化のエンジニアリングによってさらに64.2%に達する。これは、ハーネスエンジニアとターゲットエージェントの共進化を示唆している。 Comment
元ポスト:
[Paper Note] Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering, Junlin Yang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #PostTraining #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 再帰的自己改善(RSI)を実現するためのAIシステムOpenMLEを提案。機械学習エンジニアリング(MLE)のフルスタック環境を提供し、ポストトレーニングを通じたメタ進化エージェントFrontis-MA1(35B)が、基本的なプログラム進化演算子を用いてタスクを改善。OpenMLE-Evoを使って、性能が大幅に向上し、他の先進的モデルを超える結果を示す。全体のモデルの重みとスタックは公開されており、RSI研究の再現性を支援。 Comment
元ポスト:
pj page: https://frontisai.github.io/OpenRSI/
ポイント解説:
[Paper Note] Can AI agents conduct open-ended AI research? Early evidence from two case studies, Peter Kirgis+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #One-Line Notes #Open-endedTasks #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AI研究を自動化するエージェントの進展を評価する新しい方法として、著者評価によるシャドウ評価を導入。高品質な未公開論文について実施した結果、エージェントは独力で設計開発を行ったが、実質的な進展が得られず、両論文は却下された。失敗モードとして、判断力の欠如、設計不備への非創造的対応、バックトラックの不足などが特定され、エージェントは研究の全過程において課題を抱えていることが示された。 Comment
元ポスト:
未発表のオープンエンド(=non verifiable)な研究課題に対して同様のテーマをAI Agentに与えて論文を記述させ、原論文の著者が実際に内容を検証することによって、現在のAI Agentのオープンエンドな研究課題に対するアプローチの課題を明らかにした研究で、サンプルサイズの小ささや、AI生成であることを知った上でのレビュー結果など、様々なlimitationがあるが興味深い。
たとえば、以下のような知見が得られたとのことである:
- top conferenceの水準に対する判断力の欠如
- 創造的な問題解決能力の欠如
- 誤った判断を早期に下し、それを是正できない
[Paper Note] Living-Harness Is an Interactive-Agent Evolver, Yuetian Du+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #One-Line Notes #Reading Reflections #AgentHarness Issue Date: 2026-08-09 GPT Summary- Living-Harnessは、過去のエピソードのフィードバックを活用して自己進化するエージェント・ハーベスを提案します。エピソードの抽象化と構造化によって手続き知識を更新し、障害パターンや回復アクションを記録。これにより、将来の相互作用を導くための信頼性が向上し、各対話環境において、従来のベースラインを大きく上回る性能を示しました。 Comment
元ポスト:
ツール(ハーネスが環境に対して実行可能な操作)やユーザから与えられるcontextはfrozenのまま、Agent Harnessにmemory, state graphを持たせ、過去に実行した軌跡とその評価結果を用いて状態を更新し、過去の経験からより良い手続きをハーネス自身に蓄積・更新させる。
実行したエピソードから動的にAgent Skillsを更新していくようなハーネスとの差分がよくわからない。
[Paper Note] ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D, Lena Libon+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Safety #Monitorability #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AIエージェントの信頼性が懸念される中、出力の安全な利用を評価する方法が求められる。本研究では、AIコントロールの手法を用いて、自動化されたAI R&Dの信頼性を評価するフレームワークResearchArenaを提案。4つの長期タスクにおいて、サボタージュを検出するために監視機構を導入し、モデルやアーティファクトの性能を確認。監視メカニズムは有効だが、隠れたサボタージュの検出が難しいことが示された。このフレームワークは自動化されたAI R&Dのなかでのサボタージュと統制の評価を可能にする。 Comment
元ポスト:
[Paper Note] RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement, Fanqing Meng+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #PostTraining #Data #autoresearch/RSI Issue Date: 2026-08-07 GPT Summary- LLMエージェントによる再帰的自己改善を目指し、固定のポストトレーニングスタックを用いた統制ベンチマークRSIBench-Dataを導入。エージェントは訓練データ戦略を反復的に修正し、データ中心の研究能力を示すが改善は一貫せず。最初の試みにおける58.33%の成功率の中、78.26%が低い最終スコアで終わる。四つの成功パターンを特定し、有用な発見は可能もフィードバックの一貫した改善には至らず。コードはオープンソースとして公開。 Comment
元ポスト:
関連:
- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
- ML Intern, HuggingFace, 2026.04
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
解説:
[Paper Note] AREX: Towards a Recursively Self-Improving Agent for Deep Research, Shuqi Lu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #autoresearch/RSI #AgentHarness Issue Date: 2026-08-06 GPT Summary- AREXは、再帰的自己改善型の深層研究エージェントで、複数の制約を満たす回答を効率的に見つけるための手法を提案します。内部研究ループで暫定的な回答を構築し、外部ループで回答を監査・改善することで、検証過程を強化します。自律的な文脈更新ツールを学習し、長期的な視野での学習を促進。密結合モデルおよびMixture-of-Expertsモデルを用いた実験では、様々なベンチマークで顕著な性能向上を示しました。 Comment
元ポスト:
[Paper Note] Self-Improvements in Modern Agentic Systems: A Survey, Zhe Ren+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #Evaluation #ContinualLearning #Initial Impression Notes #AgentHarness Issue Date: 2026-07-31 GPT Summary- 自己改善型自律エージェントは、最小限の人間介入で適応を実現するため、研究プロトタイプから実運用システムへと進化している。本研究では、現代エージェントを基盤モデルと運用スキャフォールドの組み合わせとして位置づけ、自己改善を自己誘発更新演算子として定義。過去の研究を整理し、応用と評価を論じ、未解決問題や今後の方向性を考察する。技術的な更新情報は指定のリンクで追跡可能。 Comment
元ポスト:
自己進化するAI Agentについて、モデル、Scaffolding (Agent Harness)、Evaluationの観点からまとめたサーベイのようである。self-improvingと言うと、元々LLMのモデルの重みを自己進化させる枠組みの文脈で使われていたが、AI Agentの文脈ではScaffoldingのメモリの蓄積による性能の進化等も含まれる。
[Paper Note] Rethinking the Evaluation of Harness Evolution for Agents, Yike Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-19 GPT Summary- 自動ハーネス進化の評価を再検討し、既存手法の問題点を指摘。従来の評価は単体テストケースに依存し、探索手段と最終評価が同じベンチマーク上にあるため、過剰適合のリスクがある。フィードバックと推論予算を揃えた評価を行い、GPT-5.4とClaude Opus 4.6を使用して実験した結果、自動ハーネス進化は単純なテスト時スケーリングを必ずしも上回らず、一般化にも限界が示された。この結果は自動ハーネス設計の評価の再考を促すものである。 Comment
blog: https://yikee.github.io/harnessevolution/
元ポスト:
所見:
Harness自身を進化させる手法(Harness Evolution)を公平に評価しようね、という話で、現在の評価における以下の課題を指摘:
- Harness Evolutionは、ベンチマークに対するverifierからのフィードバックが利用されるが、これは本質的にtest time scalingにおいて検索に多くのリソースを費やした場合と分離ができていない。つまり、ハーネスそのものを進化させたことに効果があったのか、単に探索により多くの計算リソースを投じたことによる効果なのかが分離されていない。
- Harness Evolutionの探索に用いるタスクと評価に用いるタスクが同一の場合、単にタスクにoverfitしているだけなのか、汎用的に適用可能なハーネス設計の進化によるものなのかが明らかでない。
そのため、
- 固定された予算のもとで、
- どのようなフィードバックシグナルを受け取るか
- 計算リソースをどう配分し
- タスクの軌跡やハーネスそのものを修正するか
といった事項を制御しつつtest time scaling手法と比較することが重要と主張している。
実際、unit testのケースにアクセスできない場合で比較すると、Harness Evolutionはtest-time scalingを上回ることができないことが、Figure 1/Table 1に示されている。
unit testケースにアクセスできる場合は、test-time scaling系の手法において、オラクルを用いてサンプリングされた候補の中から最良のものを取得することができ、このような手法とHarness Evolutionを比較しても、test-time scalingを上回ることはできなかった。
また、Figure 2が、test-time scaling系の手法と、Harness Evolution系の手法を概観するのに非常にわかりやすい。
[Paper Note] Rubric Curriculum RL: Exploiting the Generation-Verification Gap in Non-Verifiable Domains, Krishnan+, ICML'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #ICML #PostTraining #read-later #Non-VerifiableRewards #Rubric-based Issue Date: 2026-07-08 Comment
元ポスト:
[Paper Note] Autodata: An agentic data scientist to create high quality synthetic data, Ilia Kulikov+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #PostTraining #read-later #Selected Papers/Blogs #Data #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment
元ポスト:
[Paper Note] Self-Improving Language Models with Bidirectional Evolutionary Search, Guowei Xu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #PostTraining #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- Bidirectional Evolutionary Search(BES)は、自己改善する言語モデルの探索フレームワークとして提案されている。前方探索で進化演算子を使用して新しい候補を生成し、後方探索でタスクをサブゴールに分解し、密なフィードバックを提供する。これにより、狭いエントロピー領域から脱出し、必要なサンプル数を指数的に削減可能。実験では、BESが既存の事後学習アルゴリズムを上回る結果を示し、オープン問題解決ベンチマークで優れた性能を発揮することが確認された。 Comment
元ポスト:
[Paper Note] The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, MiniMax+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #OpenWeight #MoE(Mixture-of-Experts) #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment
元ポスト:
ポイント解説:
関連:
- MiniMax-M2.7, MiniMax, 2026.03
expertの数を大きくしているようで、この設計は下記の知見と一致する:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
[Paper Note] Forecasting Scientific Progress with Artificial Intelligence, Sean Wu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #ScientificDiscovery #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment
元ポスト:
現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。
ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。
データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。
[Paper Note] AI for Auto-Research: Roadmap & User Guide, Lingdong Kong+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AI支援研究は進化し、自動化システムが低コストで論文を生成可能になったが、整合性の問題が浮き彫りに。特に、最先端のLLMでも結果の捏造や誤りの見逃しがある。研究ライフサイクルを四つの段階(Creation, Writing, Validation, Dissemination)で分析し、AIの信頼性と自律性の限界を特定。AIは構造化されたタスクには優れるが、新規のアイデアや実験には脆弱であり、人間の協働が最も信頼される。具体的なリソースはプロジェクトページで提供。 Comment
pj page: https://worldbench.github.io/awesome-ai-auto-research
元ポスト:
[Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment
反響がすごそうに見える
- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。
環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。
元ポスト:
prime-rlでサポートされたとのこと:
[Paper Note] EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics, Shuyue Stella Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #reading #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-05-11 GPT Summary- EVOLMは言語モデルの自己改善を促進するポスト訓練手法であり、外部監督に依存せず、モデル自身の評価能力を利用します。具体的には、事例ごとに最適化された評価基準を生成するルーブリック生成器と、そのルーブリックを用いて訓練されたポリシーの二つの能力を交互に訓練します。これにより、EVOLMはQwen3-8Bモデルを用いてGPT-4.1を25.7%上回るルーブリックを生成し、共同訓練されたポリシーは最新の報酬モデルよりも優れた性能を示しました。全体として、EVOLMは内部の評価能力を活用することで、外部の監督なしでの改善を実現することが明らかになりました。 Comment
元ポスト:
外部ラベル無しでself-improvingするルーブリックベースな手法の提案。
手法としては、まずfrozenしたRubirc生成器とJudgeモデルで全てのpromptに対してRubricを生成し、ポリシーが生成したロールアウトに基づいてJudgeモデルでRewardを計算することでポリシーを更新。その後更新されたポリシーを用いてpreference pairを構築し、preference pairに対してRubric生成器がルーブリックのロールアウトを生成し、choicedとrejectedなサンプルに対するJudgeのスコアの差の大きさ(すなわち、識別力の高さ)をrewardにRubric生成器を更新する、といったことを繰り返す。
多分3説以降の話が面白い。後で読む
Rubricが徐々に変化していき、抽象的なものからよりverifiableなものに変化したり、Rubricそのものが静的だとポリシーの学習に伴い変化する出力分布の変化に対応できない話や、最終的に獲得されたRubricは他のモデルの学習でも高い学習signalを送出するような汎化をするらしい
[Paper Note] Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence, Guanting Dong+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SyntheticData #PostTraining #RLVR #Scalability #Environment Issue Date: 2026-04-22 GPT Summary- 汎用エージェントとしての大規模言語モデルの期待が高まる中、Agent-Worldを提案。これは、エージェントが多様な実世界環境を探索し、自律的にタスクを合成する仕組みを提供。強化学習と動的なタスク合成により、エージェントの能力を向上させ、共進化を促進。実験で、Agent-Worldが複数のベンチマークで他のモデルを一貫して上回ることを示す。汎用エージェント知能構築のヒントも提示。 Comment
元ポスト:
[Paper Note] Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding, Yuhang Zhou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #AIAgents #TabularData #ACL #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment
元ポスト:
複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。
表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。
[Paper Note] Mathematical methods and human thought in the age of AI, Tanya Klowden+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #GenerativeAI #ScientificDiscovery #read-later #autoresearch/RSI Issue Date: 2026-04-05 GPT Summary- AIは複雑な認知タスクを実行するツールであり、その急速な進化は伝統的な哲学的問いを呼び起こす。本論文では、AIが歴史を通じて人間の道具として発展してきたことに触れ、人間中心の開発が重要であると主張。AIの応用が人間の生活向上や思考能力の拡張に寄与することを目指し、知的分野への統合の道筋を提案する。 Comment
元ポスト:
[Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #AIAgents #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #AgentHarness Issue Date: 2026-03-31 GPT Summary- 大規模言語モデル(LLM)の性能は、ハーネスと呼ばれる情報の保存・取得・提示を決定するコードに依存しているが、従来のハーネス設計は手作業が主で、最適化手法はフィードバックを圧縮してしまう。そこで、Meta-Harnessを提案。これはLLMアプリケーションのハーネスコードを探索する外部ループシステムで、エージェント的提案者を通じて過去の実行トレースを活用。Meta-Harnessは、オンラインテキスト分類で7.7ポイントの向上を示し、リトリーバルを用いた数学推論では200問の正確度を4.7ポイント改善。また、エージェント的コーディングでは手作業設計を超える成果を上げる。これにより、より豊かな過去の経験が自動化されたハーネス設計を実現可能であることが示された。 Comment
元ポスト:
pj page: https://yoonholee.com/meta-harness/
Darwin Godel Machineと非常にコンセプトが似ているという指摘がある
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
所見:
解説:
[Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #PostTraining #read-later #Selected Papers/Blogs #Environment #autoresearch/RSI Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment
pj page: https://posttrainbench.com/
元ポスト:
[Paper Note] Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics, Leheng Sheng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Chain-of-Thought #Reasoning #PostTraining #RLVR #PRM #RewardModel #One-Line Notes #Rubric-based Issue Date: 2026-02-12 GPT Summary- CoTがLLM推論において重要である一方で、報酬モデルの訓練には多くの人手が必要で、静的モデルは変化に対応しづらい。これを解決するため、自己進化するCoT報酬アプローチ「RLCER」を提案。自己提案・自己進化するルーブリックにより、結果報酬なしでも信頼性のあるCoT監視信号を提供し、結果中心のRLVRを上回ることを実証。また、ルーブリックは推論時のパフォーマンスを向上させる効果もある。 Comment
元ポスト:
CoTを評価するためのルーブリックを自己進化させて、CoTの評価もしつつ、outcomeに基づくRLVRを実施するといった処理を単一のポリシーで実現する、というような話に見える(過去のCoTに対する監視手法ではPRMが別途用意されていた)。
単にRLVRをする場合よりも最終的な性能が向上し、特にlong runの場合の安定性が高まっているように見える。
[Paper Note] SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization, Jiarui Yuan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #ReinforcementLearning #Evaluation #PostTraining #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment
元ポスト:
関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。
APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。
[Paper Note] RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System, Yinjie Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 強化学習フレームワーク「RLAnything」は、動的に環境、ポリシー、報酬モデルを生成し、学習信号を増幅することで、全体的なRLシステムを強化します。ポリシーはフィードバックを用いて訓練され、報酬モデルは一貫性フィードバックにより最適化されます。理論に基づく自動環境適応により、各モデルからの批評が訓練を改善します。実証例として、RLAnythingはOSWorld、AlfWorld、LiveBenchで大幅な性能向上を示しており、最適化された報酬モデルが人間のラベルを超える結果を出しています。 Comment
blog: https://yinjjiew.github.io/projects/rlanything/
元ポスト:
環境、ポリシー、Reward Modelが互いにフィードバックし合ってco-trainingされる枠組み
[Paper Note] THINKSAFE: Self-Generated Safety Alignment for Reasoning Models, Seanie Lee+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #Reasoning #Safety Issue Date: 2026-02-03 GPT Summary- 自己生成整合性フレームワーク「ThinkSafe」は、外部教師に依存せずにLRMsの安全性を向上させます。このアプローチは、モデルが保持する危害の識別能力を活かし、軽量の拒否誘導を通じて安全推論トレースを生成します。実験により、ThinkSafeは推論能力を維持しつつ、GRPOに比べて安全性を大幅に改善し、計算コストの削減を実現しています。 Comment
元ポスト:
[Paper Note] Self-Improving Pretraining: using post-trained models to pretrain better models, Ellen Xiaoqing Tan+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #mid-training #DPO #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-30 GPT Summary- 大規模言語モデルの安全性と品質を確保するための新しい事前学習法を提案。文書をストリームし、強化学習を用いて生成されたKトークンを改善。プロセス中、候補生成物を評価し、モデルの成長に応じて高品質な出力に報酬を与える。実験の結果、事実性と安全性でそれぞれ36.2%および18.5%の改善を達成し、生成品質も最大86.3%向上した。 Comment
元ポスト:
事前学習の枠組みがnext token predictionから変わるかもしれないような話。気になる。
v2へアップデート:
解説:
関連:
- [Paper Note] Deep reinforcement learning from human preferences, Paul Christiano+, NIPS'17, 2017.06
- [Paper Note] Direct Preference Optimization: Your Language Model is Secretly a Reward Model, Rafael Rafailov+, arXiv'23, 2023.05
[Paper Note] Towards Execution-Grounded Automated AI Research, Chenglei Si+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #ScientificDiscovery #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #EvolutionaryAlgorithm #autoresearch/RSI Issue Date: 2026-01-24 GPT Summary- 自動化されたAI研究は科学的発見の加速に寄与するが、現在のLLMはしばしば効果的でないアイデアを生成。アイデア実装のための自動実行器を構築し、並行GPU実験を通じてその効果を検証。進化的探索と強化学習の2方法を分析し、前者はGRPOベースラインを上回るサンプル効率、後者は単純なアイデアに収束し上限を制限。実行に基づくAI研究の未来を探る。 Comment
アイデアを実行できる環境を与え、進化的な探索をRLと実行結果に基づくReward(ベンチマーク性能など)によって実施するような話で、実行結果に基づくRewardに基づいてRLすると、平均的にうまくいくように最適化され性能を最大化することに苦労する、といった知見が得られた、という趣旨の話が元ポストで記述されている。
best solutionを見つけるようにRLする研究がこちら:
- [Paper Note] Learning to Discover at Test Time, Mert Yuksekgonul+, arXiv'26, 2026.01
元ポスト:
所見:
[Paper Note] EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience, Taofeng Xue+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #OpenWeight #ComputerUse #PostTraining #read-later #VisionLanguageModel #Scalability #Initial Impression Notes Issue Date: 2026-01-23 GPT Summary- EvoCUAは、ネイティブコンピュータ使用エージェントの新モデルで、静的模倣に頼らずデータ生成とポリシー最適化を統合。自律的にタスクを生成し、検証可能な合成エンジンでデータ不足を解消。スケーラブルなインフラにより多様な経験を収集し、反復進化学習でポリシーを動的に調整。OSWorldベンチマークで56.7%の成功率を達成し、従来のモデルを大幅に超えた。このアプローチは、さまざまな基盤モデルでの性能向上を実証し、ネイティブエージェントの機能強化に寄与することを示唆している。 Comment
HF: https://huggingface.co/meituan/EvoCUA-32B-20260105
元ポスト:
合成データ生成(タスク合成からVerifierの定義まで?)と学習のループを回すことでデータのスケーラビリティを向上し性能向上(これまでは事前に静的に合成されたtrajectoryでの学習が主流)。Rejection Samplingをして成功したtrajectoryでSFTしつつ、工夫されたDPOが用いられている模様。あとで読みたい。
[Paper Note] Agentic Reasoning for Large Language Models, Tianxin Wei+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #Planning #Reasoning #memory #One-Line Notes #Test-time Learning/Adaptation Issue Date: 2026-01-23 GPT Summary- エージェンティック推論は、LLMを自律的エージェントとして再構築し、計画や行動を行う新たなアプローチを提供します。本調査では、推論を基盤、自己進化、集合的の三つの次元に整理し、それぞれの特性と相互作用を探ります。また、文脈内推論とポストトレーニング推論の違いを示し、さまざまな現実世界でのアプリケーションをレビューします。この研究は、思考と行動を結びつける統一的なロードマップを提示し、今後の課題と方向性を概説します。 Comment
元ポスト:
agentのreasoning周りに特化したsurveyで基本的なsingle agentとしてのplanning, tool use, searchだけでなく、self evolving, memory, multi agent reasoningなど広範なトピックが網羅されているとのこと。
[Paper Note] Dr. Zero: Self-Evolving Search Agents without Training Data, Zhenrui Yue+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Search #LanguageModel #QuestionAnswering #ReinforcementLearning #AIAgents #PostTraining #On-Policy #KeyPoint Notes Issue Date: 2026-01-14 GPT Summary- データフリー自己進化が注目される中、大規模言語モデル(LLM)のための「Dr. Zero」フレームワークを提案。多様な質問を生成し、自己進化フィードバックループで解決者をトレーニング。HRPOを導入し、類似質問のクラスタリングを行うことで計算効率を向上。実験結果は、データフリーの検索エージェントが監視型と同等以上の性能を達成することを示す。 Comment
元ポスト:
(検索とReasoningを通じてSolver用の学習データとしてのverifiableな)QAを生成するProposerと、それを(検索とReasoningを通じて)解決するSolverの双方をRLするような枠組みで、ProposerはSolverからのDifficulty Reward (QAのverifiabilityとSolverの成功率(自明でなく難しすぎもしない丁度良い難易度か, 式(4))として受けとりHRPOと呼ばれる手法で改善、SolverはGRPOでRLVRする、といった枠組みに見える。QAはProposerが合成するので事前にデータを用意する必要がない、ということだと思われる。
HRPOはGRPO同様にon policyなRL手法であり、従来のself-evolving手法ではsingle hopなQuestionに合成結果が偏りやすく、かつon policyな手法でProposerを学習しようとしたときに、naiveにやるとm個のクエリに対して、クエリごとにsolverのn個のロールアウトが必要な場合、(m+1)*n回のロールアウトがpromptごとに必要となるため、計算コストが膨大になりスケーリングさせる際に深刻なボトルネックとなる問題を解決したものである。
具体的には、単一のpromptに対して複数のsolverによるロールアウトからadvantageを計算するのではなく、同じhop数の合成されたQAでクラスタリングを実施しておき、そのグループ内の(構造や複雑度がhop数の観点で類似した)QAに対するロールアウトに基づいてadvantageを計算する(3.2切に明記されていないが、おそらくロールアウトはQAごとに少数(1つ))。似たようなhop数を要するQAによってadvantageが正規化されるためadvantageの分散を小さくとることが期待され、かつロールアウトの回数を減らせるため計算効率が良い、という利点がある(3.2節)。
解説:
[Paper Note] ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory, Siru Ouyang+, ICLR'26, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICLR #read-later #Selected Papers/Blogs #memory #One-Line Notes #Test-time Learning/Adaptation #autoresearch/RSI Issue Date: 2025-09-30 GPT Summary- ReasoningBankという新しいメモリフレームワークを提案し、エージェントが成功体験と失敗体験から推論戦略を抽出できるようにする。テスト時には関連メモリを活用し、学びを統合することで能力を向上させる。さらに、メモリを意識したテスト時スケーリング(MaTTS)を導入し、エージェントの体験を多様化・拡大する。これにより、ウェブブラウジングやソフトウェアエンジニアリングのベンチマークで既存のメモリメカニズムを上回る効果と効率を実現。メモリ駆動の経験スケーリングを新たな次元として確立し、エージェントの自己進化を促進する。 Comment
元ポスト:
メモリを良質なものに更新、蓄積し続けることで性能がスケールするのであれば、新たなtest-time scalingのパラダイムになりそう。
ざっくり読んでみると本研究ではこのパラダイムのことをTest-Time Learningと呼称している(先行研究が2つ引用されているがざっと見た限りでは両者はそう言った呼称はしていないように見えた)。
すなわち、クエリのストリームが到達した時に将来のクエリを見ることはできずに、過去のクエリに対するtrajectoryや、self-verificationなどによってのみラベル無しで自己進化していくパラダイムのこと。
関連:
- [Paper Note] M+: Extending MemoryLLM with Scalable Long-Term Memory, Yu Wang+, ICML'25, 2025.02
openreview: https://openreview.net/forum?id=jL7fwchScm
openreview: https://openreview.net/forum?id=jL7fwchScm
[Paper Note] R-Zero: Self-Evolving Reasoning LLM from Zero Data, Chengsong Huang+, ICLR'26
Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR #Label-free #Author Thread-Post Issue Date: 2025-08-09 GPT Summary- R-Zeroは、自己進化型大規模言語モデル(LLMs)が自律的にトレーニングデータを生成するフレームワークで、チャレンジャーとソルバーの2つのモデルが共進化することで、既存のタスクやラベルに依存せずに自己改善を実現します。このアプローチにより、推論能力が大幅に向上し、特にQwen3-4B-Baseでは数学推論で+6.49、一般ドメイン推論で+7.54の改善が確認されました。 Comment
元ポスト:
問題を生成するChallengerと与えられた問題を解くSolverを用意し、片方をfreezezさせた状態で交互にポリシーの更新を繰り返す。
### Challenger
- (Challengerによる)問題生成→
- (freezed solverによる)self consistencyによるラベル付け→
- Solverの問題に対するempirical acc.(i.e., サンプリング回数mに対するmajorityが占める割合)でrewardを与えChallengerを更新
といった流れでポリシーが更新される。Rewardは他にも生成された問題間のBLEUを測り類似したものばかりの場合はペナルティを与える項や、フォーマットが正しく指定された通りになっているか、といったペナルティも導入する。
### Solver
- ChallengerのポリシーからN問生成し、それに対してSolverでself consistencyによって解答を生成
- empirical acc.を計算し、1/2との差分の絶対値を見て、簡単すぎる/難しすぎる問題をフィルタリング
- これはカリキュラム学習的な意味合いのみならず、低品質な問題のフィルタリングにも寄与する
- フィルタリング後の問題を利用して、verifiable binary rewardでポリシーを更新
### 評価結果
数学ドメインに提案手法を適用したところ、iterごとに全体の平均性能は向上。
提案手法で数学ドメインを学習し、generalドメインに汎化するか?を確認したところ、汎化することを確認(ただ、すぐにサチっているようにも見える)。、
関連:
- [Paper Note] Self-Questioning Language Models, Lili Chen+, arXiv'25
- [Paper Note] Absolute Zero: Reinforced Self-play Reasoning with Zero Data, Andrew Zhao+, arXiv'25, 2025.05
著者ポスト:
-
-
日本語解説:
openreview: https://openreview.net/forum?id=96apU6YzSO
[Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #ICLR #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #AgentHarness Issue Date: 2025-06-05 GPT Summary- ダーヴィン・ゴーデルマシン(DGM)は、自己改善するAIシステムであり、コードを反復的に修正し、コーディングベンチマークで変更を検証します。進化とオープンエンドな研究に基づき、生成されたエージェントのアーカイブを維持し、新しいバージョンを作成することで多様なエージェントを育成します。DGMはコーディング能力を自動的に向上させ、SWE-benchでのパフォーマンスを20.0%から50.0%、Polyglotでのパフォーマンスを14.2%から30.7%に改善しました。安全対策を講じた実験により、自己改善を行わないベースラインを大幅に上回る成果を示しました。 Comment
- [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
あたりの研究とはどう違うのだろうか、という点が気になる。
openreview: https://openreview.net/forum?id=pUpzQZTvGY
> * [[Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, N/A, ICML'24 [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
](https://github.com/AkihikoWatanabe/paper_notes/issues/1212)
>
> あたりの研究とはどう違うのだろうか、という点が気になる。
この点については、Self-Rewarding LLMではモデルの重みを(自身が生成した出力からPreference pairを構築し)DPOで更新していくのに対し(=Agent Harnessではなくモデル自身を賢くする)、
DGMでは基盤モデルはfrozenな上で、AI Agentのコードベースそのものをself-editingすることによって進化する点が異なる(=モデルではなくAgent Harnessを賢くする)。
baseとなるエージェントのコードベースは木構造に基づいて管理され、recursiveに探索されていき、ベンチマークのスコアを改善していく、という感じのようである。木構造によって過去のsolutionが保持され、単一の方向性のみが探索されることを抑制し(i.e., オープンエンドな探索が促進され)進化が局所解に陥ることを防ぐ。
3節冒頭に記述がある通り、Gödel Machineというのは2007年に提案された、AI自身が自らを証明可能な形で改善する方法を探索する理論的概念であるようだが、DGMではGödel Machineでの「変更によってシステムが改善されることを理論的に証明しなければならない」という点を緩和し、「変更が性能を向上させるという実験結果を用いる」ことで緩和する。
[Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PEFT(Adaptor/LoRA) #ICLR #KeyPoint Notes #Test-time Learning/Adaptation Issue Date: 2026-06-27 GPT Summary- 自己適応型LLMの課題を解決するために、Transformer-Squaredを提案。これは未知のタスクにリアルタイムで適応できるフレームワークで、重みの特異成分を調整し、二段階処理を通じてタスク特有の「エキスパート」ベクトルを動的に組み合わせる。パラメータ数が少なく高効率で、視覚言語タスクにも対応。これにより、LLMsの適応性と性能を向上させ、自己組織化されたAIシステムへの道を開く。 Comment
openreview: https://openreview.net/forum?id=dh4t9qmcvK
個々の重み行列を特異値分解し、重み行列の特異値ベクトルをRLVRによってタスク(ドメイン)ごとに最適化し、test time時に線形結合して利用することで、Unseenタスクに対してtest timeに適応可能なSingular Value Finetuningを提案。
各タスクやドメインごとに高い性能を獲得できる新たな特異値ベクトル(expert vectorと呼ぶ)を学習し推論時に利用することで、全体の重み行列を新たな特異値ベクトルに基づいて更新することができる
また、学習するパラメータはW_{n,m}パラメータ行列のr=min(n,m)で良いため、LoRA等よりも少ないパラメータ数で適応できる。学習されるexpert vectorは重み行列の特異値であるため、ベクトルに対する解釈性が高く、ベクトルの変換や演算も適応可能となる利点がある。
(3.2節)。
各タスクのexpert vectorはREINFORCEに基づくRLVRで学習する(式1)。テスト時は2段階のプロセスを踏み、推論を実施する。まずinputを受け取り、inputがどのようなタスクを実現するかを同定する(dispatch)。続いて、タスクがより高い性能で解けるように、expert vectorの最適な混合比(線形結合)を、Cross-Entropy Method (CEM)によって、Fewshot sampleの性能が最大となるような混合比をサンプリングベースで求める(3.1節, p.6 (C) Fewshot Adaptation))。これにより、与えられたタスクをより高い性能で解くことができるexpert vectorをtest時に推論し、重み行列を更新した上で推論することができる。
expert vectorの混合方法は他にも2種類提案されているようだが、Fewshot Adaptationによる手法の性能が高そうに見える。
[Paper Note] Self-Improving VLM Judges Without Human Annotations, Inna Wanyin Lin+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Alignment #SyntheticData #LLM-as-a-Judge #VisionLanguageModel Issue Date: 2025-12-11 GPT Summary- 人間の好みの注釈を使用せず、自己合成データでVLM評価者を自己訓練するフレームワークを提案。3段階のプロセスで多様な指示-応答ペアを生成し、品質に合致しないものを除去。得られた評価者は、Llama-3.2-11Bの精度を0.38から0.51に向上させ、他の大規模モデルを上回る結果を示した。これにより、VLMの進化に伴う自己評価者の可能性が示唆される。 Comment
元ポスト:
関連:
- [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
[Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #LongHorizon #autoresearch/RSI #Author Thread-Post Issue Date: 2025-12-06 GPT Summary- PARCは、自律的に長期的な計算タスクを実行するコーディングエージェントであり、自己評価と自己フィードバックを通じて高レベルのエラーを検出・修正します。材料科学の研究において重要な結果を再現し、数十の並列シミュレーションタスクを管理します。Kaggleを基にした実験では、最小限の指示からデータ分析を行い、競争力のある解決策を生成します。これにより、独立した科学的作業を行うAIシステムの可能性が示されました。 Comment
元ポスト:
PFNから。
著者ポスト:
Planner, Workerによるoutcomeをself-reflectionする際に、Planner, Workerのcontextをあえて渡さないことでより客観的な検証(誤った前提や思い込みがないか等の検証)を実現しているとのこと。
[Paper Note] AI & Human Co-Improvement for Safer Co-Superintelligence, Jason Weston+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #AI-Human Co-Improvement Issue Date: 2025-12-05 GPT Summary- 自己改善を追求するAIの目標は魅力的だが危険も伴い、実現には時間がかかる可能性がある。本研究では、人間の研究者とAIが協力して共生型超知能を実現する共進化の最大化を提案する。AIが人間と共に研究を進めることで、AI研究を加速し、双方にとって安全な超知能を提供することを目指す。人間の研究改善をループに組み込むことで、より迅速かつ安全な達成が可能になると考える。 Comment
元ポスト:
arXivにアップロードされた模様:
[Paper Note] AgentEvolver: Towards Efficient Self-Evolving Agent System, Yunpeng Zhai+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SoftwareEngineering #One-Line Notes Issue Date: 2025-11-15 GPT Summary- AgentEvolverは、LLMsを活用した自己進化型自律エージェントシステムで、手作業のデータセット依存を減らし、探索効率とサンプル利用を向上させる3つのメカニズムを導入。初期実験では、従来のRLベースラインよりも効率的な探索と迅速な適応を実現。 Comment
元ポスト:
skim readingしかできていないが、式17を見ると、PRMのようにstep levelで評価をし全体のtrajectoryのrewardをか決定している。テストしているベンチマークはソフトウェアエンジニアリング系のものであるため、verifiableなドメインに限られた評価となっている印象がある。rewardをどれだけverifiableに、あるいは堅牢に定義できるドメインかが重要になる気がする。
たとえば
- [Paper Note] Large Language Monkeys: Scaling Inference Compute with Repeated Sampling, Bradley Brown+, arXiv'24, 2024.07
では、いくつかのverifierを比較しており、LLM-basedなRMではverificationの能力に限界があることが示されている[^1]。
[^1]: この研究ではtest-time scalingの観点での限界を示しているが、self-improve系の話でも同様にverifierの性能は学習のシグナルに直結するため、同様に重要であると考えられる。
[Paper Note] RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization, Zeng Zhiyuan+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Catastrophic Forgetting #RLVR #Diversity #Generalization #KeyPoint Notes Issue Date: 2025-11-07 GPT Summary- RLoopは、強化学習における過剰適合の問題を解決するための自己改善フレームワークであり、ポリシーの多様性を保ちながら一般化能力を向上させる。RLを用いて解空間を探索し、成功した軌跡から専門家データセットを作成し、拒否サンプリング微調整を行うことで、次の反復の出発点を洗練する。実験により、RLoopは忘却を軽減し、平均精度を9%、pass@32を15%以上向上させることが示された。 Comment
元ポスト:
ポリシーを初期化し、RLを実行しtrajeatory tを取得。tをrejection samplingし成功したtrajectoryでエキスパートデータセットを作成。作成したエキスパートデータセットでポリシーをSFT(=Rejection SamplingしたデータでSFTすることをRFTと呼ぶ)する(これが次iterationの初期化となる)といったことを繰り返す。
RLはAdvantageによって学習されるため、trajectoryの相対的な品質に基づいて学習をする。このため、バッチ内のすべてのtrajectoryが正解した場合などはadvantageが限りなくゼロに近づき学習のシグナルを得られない。
一方RFTは絶対的なRewardを用いており(RLVRの場合は成功したら1,そうでなければ0)、これがバッチ全体のパフォーマンスに依存しない安定した分散の小さい学習のシグナルを与える。
このように両者は補完的な関係にある。ただしRFTは成功したtrajectory全てに均等な重みを与えるため、既にポリシーが解くことができる問題にフォーカスしすぎることによって効率性が悪化する問題があるため、提案手法では成功率が低いhardなサンプルのみにエキスパートデータをフィルタリングする(=active learning)ことで、モデルが自身に不足した能力を獲得することに効率的に注力することになる。
また、RFTを使うことは単なるヒューリスティックではなく、理論的なgroundingが存在する。すなわち、我々はまだ未知の"expert"な分布 p^*にポリシーが従うように学習をしたいがこれはMLEの観点で言うと式3に示されているような形式になる。p^*から直接データをサンプリングをすることができないが、RLのポリシーから近似的にサンプリングをすることができる。そこでMLEの式をimportance samplingの観点から再度定式化をすると式4のようになり、後はimportance weight wを求められれば良いことになる。これはp^*に近いtrajectoryはRewardが高く、そうでない場合は低い、つまりw \propto Reward な関係であるため近似的に求めることができ、これらを式4のMLEの式に代入するとRFTと同じ式が導出される。
みたいな話のようである。
[Paper Note] Multi-Agent Evolve: LLM Self-Improve through Co-evolution, Yixing Chen+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning Issue Date: 2025-10-31 GPT Summary- 強化学習(RL)を用いたMulti-Agent Evolve(MAE)フレームワークを提案し、LLMの推論能力を向上させる。MAEは提案者、解決者、審査者の相互作用を通じて自己進化を促進し、数学や一般知識のQ&Aタスクを解決。実験により、MAEは複数のベンチマークで平均4.54%の性能向上を示し、人間のキュレーションに依存せずにLLMの一般的な推論能力を向上させるスケーラブルな手法であることが確認された。 Comment
元ポスト:
concurrent work:
- [Paper Note] SPICE: Self-Play In Corpus Environments Improves Reasoning, Bo Liu+, arXiv'25, 2025.10
続報:コードとモデルがオープンに
ポイント解説:
[Paper Note] SPICE: Self-Play In Corpus Environments Improves Reasoning, Bo Liu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #Hallucination #CurriculumLearning #Diversity Issue Date: 2025-10-29 GPT Summary- SPICE(Self-Play In Corpus Environments)は、自己改善システムのための強化学習フレームワークで、単一モデルが「挑戦者」と「推論者」の2役を担う。挑戦者は文書を抽出して多様な推論タスクを生成し、推論者はそれを解決する。これにより、自動カリキュラムが形成され、持続的な改善が促進される。SPICEは、既存の手法に比べて数学的および一般的な推論のベンチマークで一貫した向上を示し、挑戦的な目標の生成が自己改善に重要であることを明らかにした。 Comment
元ポスト:
[Paper Note] Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play, Qinsi Wang+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#ComputerVision #read-later #Selected Papers/Blogs #VisionLanguageModel #Label-free Issue Date: 2025-10-13 GPT Summary- Vision-Zeroは、視覚と言語のモデル(VLM)の自己改善を促進するドメイン非依存のフレームワークであり、任意の画像ペアから生成された競争的な視覚ゲームを通じてトレーニングを行う。主な特徴は、戦略的自己対戦による自律的なデータ生成、任意の画像からのゲーム生成による多様なドメインでの推論能力向上、そして反復自己対戦ポリシー最適化(Iterative-SPO)による持続的なパフォーマンス向上である。Vision-Zeroはラベルなしデータを用いて最先端のパフォーマンスを達成し、他の注釈ベースの手法を上回る。 Comment
pj page: https://github.com/wangqinsi1/Vision-Zero
元ポスト:
とても良さそう
ポイント解説:
[Paper Note] RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization, Zhaoning Yu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Chain-of-Thought #Reasoning #ICLR #read-later #One-Line Notes #Author Thread-Post Issue Date: 2025-10-03 GPT Summary- RESTRAINは、自己ペナルティを用いた強化学習フレームワークで、ラベル付きデータなしでモデルを改善する。過信的な回答をペナルティ化し、未ラベルデータからの学習信号を活用することで、困難な推論ベンチマークにおいて大きな向上を達成。従来のゴールドラベル付きトレーニングに匹敵する性能を示し、効果的な推論の拡張が可能であることを示す。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=87ySF7viys
著者による一言解説:
votingによるself-improvingなRLの枠組みから脱却し、全ての応答に対してペナルティ方式でペナルティを与え(一貫性の乏しいロールアウトなど)異なる重みを与えて学習シグナルとする。
[Paper Note] A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems, Jinyuan Fang+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SelfCorrection Issue Date: 2025-08-31 GPT Summary- 自己進化型AIエージェントの研究が進展しており、動的環境に適応する能力を持つエージェントシステムの自動強化が求められている。本調査では、自己進化型エージェントの設計におけるフィードバックループを抽象化したフレームワークを提案し、システムの主要コンポーネントを強調。さらに、ドメイン特化型進化戦略や評価、安全性、倫理的考慮についても議論し、研究者や実務者に体系的な理解を提供することを目指す。 Comment
元ポスト:
[Paper Note] Self-Rewarding Vision-Language Model via Reasoning Decomposition, Zongxia Li+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #Hallucination #VisionLanguageModel Issue Date: 2025-08-28 GPT Summary- Vision-Language Models (VLMs)は視覚的幻覚や言語的ショートカットに悩まされることが多い。これらの問題は、ポストトレーニング手法が中間の視覚的推論に対する指導を欠いているために生じる。本研究では、外部の視覚的監視に依存せずに視覚的推論を改善する自己報酬法Vision-SR1を提案。モデルは視覚的知覚と言語的推論を2段階に分解し、自己完結型の視覚的知覚を生成し、その後に言語的推論を行うことで報酬を計算する。実験により、Vision-SR1が視覚的推論を改善し、幻覚を軽減することが示された。 Comment
元ポスト:
ポイント解説:
[Paper Note] WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model, Tianqing Fang+, EMNLP'25
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #EMNLP Issue Date: 2025-08-22 GPT Summary- 自己改善エージェントのために、共進化するワールドモデルLLMを導入する新しいフレームワークを提案。これにより、エージェントのポリシーを洗練する自己指導型トレーニングデータを生成し、行動選択を導く先読みシミュレーションを実現。実験により、既存の自己進化エージェントに対して10%のパフォーマンス向上を示し、持続的な適応性を促進することを目指す。 Comment
元ポスト:
[Paper Note] Self-Questioning Language Models, Lili Chen+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Label-free #MajorityVoting Issue Date: 2025-08-09 GPT Summary- 自己質問型言語モデル(SQLM)を提案し、トピックを指定するプロンプトから自ら質問を生成し、解答する非対称の自己対戦フレームワークを構築。提案者と解答者は強化学習で訓練され、問題の難易度に応じて報酬を受け取る。三桁の掛け算や代数問題、プログラミング問題のベンチマークで、外部データなしで言語モデルの推論能力を向上させることができることを示す。 Comment
pj page: https://self-questioning.github.io
元ポスト:
たとえば下記のような、ラベル無しの外部データを利用する手法も用いてself improvingする手法と比較したときに、どの程度の性能差になるのだろうか?外部データを全く利用せず、外部データありの手法と同等までいけます、という話になると、より興味深いと感じた。
- [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
既存の外部データを活用しない関連研究:
- [Paper Note] Absolute Zero: Reinforced Self-play Reasoning with Zero Data, Andrew Zhao+, arXiv'25, 2025.05
[Paper Note] A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence, Huan-ang Gao+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SelfCorrection Issue Date: 2025-07-30 GPT Summary- 大規模言語モデル(LLMs)は静的であり、動的な環境に適応できないため、自己進化するエージェントの必要性が高まっている。本調査は、自己進化するエージェントに関する初の包括的レビューを提供し、進化の基礎的な次元を整理。エージェントの進化的メカニズムや適応手法を分類し、評価指標や応用分野を分析。最終的には、エージェントが自律的に進化し、人間レベルの知能を超える人工超知能(ASI)の実現を目指す。 Comment
元ポスト:
Figure3がとても勉強になる。Self-Evolveと呼んだ時に、それがどのようにEvolveするものなのかはきちんとチェックした方が良さそう。追加の学習をするのか否かなど。これによって使いやすさが段違いになりそうなので。
[Paper Note] Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models, Yuda Song+, ICLR'25
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ICLR #read-later #Selected Papers/Blogs #Verification #Initial Impression Notes Issue Date: 2025-06-24 GPT Summary- 自己改善はLLMの出力検証を通じてデータをフィルタリングし、蒸留するメカニズムである。本研究では、自己改善の数学的定式化を行い、生成-検証ギャップに基づくスケーリング現象を発見。さまざまなモデルとタスクを用いた実験により、自己改善の可能性とその性能向上方法を探求し、LLMの理解を深めるとともに、将来の研究への示唆を提供する。 Comment
参考: https://joisino.hatenablog.com/entry/mislead
Verificationに対する理解を深めるのに非常に良さそう
openreview: https://openreview.net/forum?id=mtJSMcF3ek
[Paper Note] Self-Adapting Language Models, Adam Zweiger+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #KeyPoint Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2025-06-13 GPT Summary- 自己適応型LLMs(SEAL)を提案し、モデルが自身のファインチューニングデータと指示を生成することで適応を実現。新しい入力に対して自己編集を行い、持続的な重みの更新を可能にする。強化学習ループを用いて下流性能を報酬信号として活用し、従来のアプローチと異なり、モデル自身の生成を用いて適応を制御。実験結果はSEALの有望性を示す。 Comment
元ポスト:
コンテキストCと評価データtauが与えられたとき、Cを入力した時にモデルが自分をSFTし、tau上でより高い性能を得られるようなサンプル Self Edit (SE) を生成できるように学習することで、性能を向上させたい。これをRLによって実現する。具体的には、下記アルゴリズムのようにモデルにSEを生成させ、SEでSFTすることめにtau上での性能が向上したか否かのbinary rewardを用いてパラメータを更新する、といったことを繰り返す。これは実質、RL_updateと書いてあるが、性能が向上した良いSEのみでモデルをSFTすること、と同等なことを実施している。
このような背景として、RLのアルゴリズムとしてGRPOやPPOを適用したところ学習が不安定でうまくいかなかったため、よりシンプルなアプローチであるReST^EM([Paper Note] Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models, Avi Singh+, TMLR'24
)を採用した。これはrejection samplingとSFTに基づいたEMアルゴリズムのようなものらしく、Eステップで現在のポリシーでcandidateを生成し、Mステップでpositive rewardを得たcandidateのみ(=rejection sampling)でSFTする、といったことを繰り返す、みたいな手法らしい。これを用いると、論文中の式(1)を上述のbinary rewardで近似することに相当する。より詳細に書くと、式(1)(つまり、SEをCから生成することによって得られるtauに基づく報酬rの総報酬を最大化したい、という式)を最大化するためにθ_tの勾配を計算したいが、reward rがθ_tで微分不可能なため、Monte Carlo Estimatorで勾配を近似する、みたいなことをやるらしい。Monte Carlo Estimatorでは実際のサンプルの期待値によって理論的な勾配を近似するらしく、これが式(3)のスコア関数とreward rの平均、といった式につながっているようである。
再現実験に成功したとのポスト:
[Paper Note] Self-Challenging Language Model Agents, Yifei Zhou+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Author Thread-Post Issue Date: 2025-06-03 GPT Summary- Self-Challengingフレームワークを用いて、エージェントが自己生成した高品質なタスクで訓練。エージェントはチャレンジャーとして役割を果たし、Code-as-Task形式でタスクを生成し、その後実行者として強化学習で評価。M3ToolEvalとTauBenchベンチマークで、Llama-3.1-8B-Instructが自己生成データのみで2倍以上の性能向上を達成。 Comment
元ポスト:
解説ポスト:
[Paper Note] Absolute Zero: Reinforced Self-play Reasoning with Zero Data, Andrew Zhao+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #NeurIPS #read-later #RLVR #Selected Papers/Blogs #Label-free #SelfPlay Issue Date: 2025-05-08 GPT Summary- RLVRは、結果に基づく報酬を用いて言語モデルの推論能力を向上させるが、訓練には人手による質問と回答の収集が必要。高品質な例の不足は長期的なスケーラビリティの懸念を引き起こす。これに対処する新しいRLVRパラダイム、Absolute Zeroが提案され、モデルトレーニングが外部データに依存せず、AZRによって自己進化を促進。AZRはオープンエンドな検証可能報酬を提供し、全くの外部データなしでもSOTA性能を達成。また、様々なモデルと互換性があることが示された。 Comment
元ポスト:
[Paper Note] CREAM: Consistency Regularized Self-Rewarding Language Models, Zhaoyang Wang+, ICLR'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #ICLR #RewardHacking #Initial Impression Notes Issue Date: 2025-04-06 GPT Summary- 自己報酬型LLMは、LLM-as-a-Judgeを用いてアラインメント性能を向上させるが、報酬とランク付けの正確性が問題。小規模LLMの実証結果は、自己報酬の改善が反復後に減少する可能性を示唆。これに対処するため、一般化された反復的好みファインチューニングフレームワークを定式化し、正則化を導入。CREAMを提案し、報酬の一貫性を活用して信頼性の高い好みデータから学習。実証結果はCREAMの優位性を示す。 Comment
- [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
を改善した研究
OpenReview: https://openreview.net/forum?id=Vf6RDObyEF
この方向性の研究はおもしろい
[Paper Note] START: Self-taught Reasoner with Tools, Chengpeng Li+, arXiv'25, 2025.03
Paper/Blog Link My Issue
#Tools #NLP #Supervised-FineTuning (SFT) #Reading Reflections Issue Date: 2025-03-07 GPT Summary- STARTという新しいツール統合型長いチェーン・オブ・ソウト推論LLMを提案。外部ツールを活用することで、幻覚や非効率性を克服し、複雑な計算や自己検証が可能に。主な手法は、意図的に設計されたヒントを挿入して外部ツールの活用を促すHint-inferと、推論経路にツール呼び出しを付与して微調整するHint-RFT。これにより、科学QAや数学、コードベンチマークで高い正答率を達成し、既存モデルを上回る性能を示した。 Comment
論文の本題とは関係ないが、QwQ-32Bよりも、DeepSeek-R1-Distilled-Qwen32Bの方が性能が良いのは興味深い。やはり大きいパラメータから蒸留したモデルの方が、小さいパラメータに追加学習したモデルよりも性能が高い傾向にあるのだろうか(どういうデータで蒸留したかにもよるけど)。
OpenReview: https://openreview.net/forum?id=m80LCW765n
[Paper Note] RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback, Harrison Lee+, ICML'24
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICML Issue Date: 2025-08-21 GPT Summary- RLAIFは、オフ・ザ・シェルフのLLMから生成された好みに基づいて報酬モデルを訓練し、RLHFと同等のパフォーマンスを達成する代替手段を提供。自己改善を示し、d-RLAIFを導入することでさらに優れた結果を得る。RLAIFは人間のフィードバックを用いた場合と同等の性能を示し、RLHFのスケーラビリティの課題に対する解決策となる可能性がある。 Comment
先行研究:
- [Paper Note] Constitutional AI: Harmlessness from AI Feedback, Yuntao Bai+, arXiv'22
[Paper Note] Iterative Reasoning Preference Optimization, Richard Yuanzhe Pang+, NeurIPS'24, 2024.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #NeurIPS #DPO #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2025-07-02 GPT Summary- 反復的な好み最適化手法を用いて、Chain-of-Thought(CoT)候補間の推論ステップを最適化するアプローチを開発。修正DPO損失を使用し、推論の改善を示す。Llama-2-70B-ChatモデルでGSM8K、MATH、ARC-Challengeの精度を向上させ、GSM8Kでは55.6%から81.6%に改善。多数決による精度は88.7%に達した。 Comment
- [Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
と似たようにiterativeなmannerでreasoning能力を向上させる。
ただし、loss functionとしては、chosenなCoT+yのresponseに対して、reasoning traceを生成する能力を高めるために、NLL Lossも適用している点に注意。
32 samplesのmajority votingによってより高い性能が達成できているので、多様なreasoning traceが生成されていることが示唆される。
DPOでReasoning能力を伸ばしたい場合はNLL lossが重要。Iterative RPO
[Paper Note] Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions, Yu Zhao+, arXiv'24, 2024.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #read-later #Reading Reflections Issue Date: 2024-12-16 GPT Summary- OpenAI o1がLRMの研究に注力し、伝統的な分野だけでなくRLやオープンエンドな解決にも焦点を当てる。特に、基準が不明瞭な領域への一般化の可能性を探求。Marco-o1はCoT微調整やMCTS、リフレクション機構などの手法を用いて、複雑な実世界の問題解決に最適化されている。 Comment
元ポスト:
Large Reasoning Model (LRM)という用語は初めて見た。
日本語解説: https://www.docswell.com/s/DeepLearning2023/KV1M9P-2024-12-05-125148
[Paper Note] Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking, Eric Zelikman+, arXiv'24, 2024.03
Paper/Blog Link My Issue
#NLP #LanguageModel #One-Line Notes #Reference Collection Issue Date: 2024-04-14 GPT Summary- Quiet-STaRは、言語モデルが各トークンごとに根拠を生成し、未来のテキストを説明する能力を学ぶ手法です。これはSelf-Taught Reasoner (STaR) の一般化であり、推論根拠を生成することで予測を改善します。計算コストや内部思考の生成方法などの課題を克服するために、トークン単位の並列サンプリングアルゴリズムと教師強制技法を提案。特に、難しいトークンの予測を改善し、GSM8KやCommonsenseQAでゼロショットの精度向上を示しました。この研究は、推論を学習するよりスケーラブルなアプローチへと向かう一歩となります。 Comment
o1(OpenAI o1, 2024.09
)の基礎技術と似ている可能性がある
先行研究:
- [Paper Note] STaR: Bootstrapping Reasoning With Reasoning, Eric Zelikman+, arXiv'22, 2022.03
参考:
[Paper Note] Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models, Zixiang Chen+, ICML'24, 2024.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #SyntheticData #ICML #mid-training #PostTraining #read-later #Selected Papers/Blogs #KeyPoint Notes #AdversarialTraining #SelfPlay Issue Date: 2024-01-24 GPT Summary- 自己対戦ファインチューニング(SPIN)を提案し、人間の注釈なしで弱いLLMを強化。LLMが自らのインスタンスと対戦し、トレーニングデータを生成。自己生成と人間の応答を識別してポリシーを微調整。SPINは様々なベンチマークでLLMの性能を大幅に向上させ、GPT-4優先データを使ったモデルを上回る成果を示した。 Comment
pj page:
https://uclaml.github.io/SPIN/
code:
https://github.com/uclaml/SPIN
メインプレイヤーは人間とLLMのレスポンスを区別する、対戦相手はメインプレイヤーに対して人間が作成したレスポンスと自身が作成させたレスポンスを区別できないようにするようなゲームをし、両者を同じLLM、しかし異なるiterationのパラメータを採用することで自己対戦させることでSFTデータセットから最大限学習するような手法を提案。メインプレイヤーの目的関数は、人間とLLMのレスポンスの確率の差を最大化するように定式化され(式4.1)、対戦相手は人間が生成したレスポンスを最大化するような損失関数を元のパラメータから大きく乖離しないようにKL正則化付きで定義する(式4.3)。双方の損失を単一の損失関数に統合すると式4.7で表される提案手法のSPIN損失が得られ、これによって与えられたSFTデータに対してレスポンスを各iterationで合成し、合成したレスポンスに対してSPIN損失を適用することでモデルのパラメータをアップデートする。メインプレイヤーの重みは更新された重みを用いて、対戦プレイヤーの重みは一つ前の重みを用いる。
[Paper Note] Self-Rewarding Language Models, Weizhe Yuan+, arXiv'24, 2024.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #InstructionTuning #LLM-as-a-Judge #ICML #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2024-01-22 GPT Summary- 超人間エージェントを実現するには、超人間レベルのフィードバックが必要であると提唱。現在のアプローチは人間の嗜好から報酬モデルを訓練するが、これがボトルネックになりがちである。本研究では自己報酬言語モデルを用い、LLMが自ら報酬を提供する方法を検討。DPOトレーニングにより指示への従順さと自己報酬の質が向上し、Llama 2 70Bをファインチューニングすることで、既存モデルを上回ることが示された。探索の余地は残るが、本研究は改善の可能性を示唆する。 Comment
人間の介入無しで(人間がアノテーションしたpreference data無しで)LLMのAlignmentを改善していく手法。LLM-as-a-Judge Promptingを用いて、LLM自身にpolicy modelとreward modelの役割の両方をさせる。unlabeledなpromptに対してpolicy modelとしてresponceを生成させた後、生成したレスポンスをreward modelとしてランキング付けし、DPOのpreference pairとして利用する、という操作を繰り返す。
[Paper Note] Large Language Models Can Self-Improve, Jiaxin Huang+, EMNLP'23
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #EMNLP Issue Date: 2025-07-22 GPT Summary- LLMはラベルのないデータセットで自己改善可能であることを示し、Chain-of-Thoughtプロンプティングと自己一貫性を利用して高信頼度の回答を生成。これにより、540BパラメータのLLMの推論能力を向上させ、最先端のパフォーマンスを達成。ファインチューニングが自己改善に重要であることも確認。 Comment
openreview: https://openreview.net/forum?id=uuUQraD4XX¬eId=PWDEpZtn6P
[Paper Note] Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss, Jing Xu+, arXiv'23, 2023.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #PostTraining #One-Line Notes Issue Date: 2023-12-29 GPT Summary- 実務家は一般的にペアワイズの好みでLLMを整列させるが、二値フィードバックも有用である。そこで、既存の二値フィードバック手法Cringe Lossをペアワイズへ一般化した。ペアワイズ Cringe Loss は簡単に実装でき、訓練効率も高く、AlpacaFarm ベンチマークで最先端の手法を上回る結果を示した。また、訓練の反復が重要で、DPOをIterative DPOとして一般化できることを示した。 Comment
DPO, PPOをoutperformする新たなAlignment手法。MetaのJason Weston氏
元ツイート:
[Paper Note] STaR: Bootstrapping Reasoning With Reasoning, Eric Zelikman+, arXiv'22, 2022.03
Paper/Blog Link My Issue
#NLP #LanguageModel #NeurIPS #needs-revision Issue Date: 2024-09-15 GPT Summary- STaR(Self-Taught Reasoner)を提案し、少数の推論例と大規模データセットを用いて段階的に複雑な推論を行う手法を紹介。まず複数の質問に対して推論根拠を生成し、誤答時には正しい解答を前提に再生成を行うことで性能を向上。STaRはファインチューニングにより自己学習能力を持ち、複数のデータセットでの性能を顕著に改善、CommensenseQAでは最先端モデルと同等の結果を達成。 Comment
OpenAI o1関連研究
openreview: https://openreview.net/forum?id=_3ELRdg2sgI
Measurements for understanding the pace of AI development inside frontier labs, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Evaluation #Blog #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
所見:
Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure, Z.ai, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Infrastructure #AIAgents #Blog #SoftwareEngineering #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-19 Comment
元ポスト:
GLM開発におけるRSIよ初期の事例
万字长文带你读懂 RSI(自进化,Self-Evolving), 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #Blog #KeyPoint Notes #autoresearch/RSI Issue Date: 2026-09-14 Comment
元ポスト:
中国語が読めないので、LLMの力を借りながら読んでいるが、RSIについての定義と、RSIに関する研究を整理、分類するためのTaxonomyを複数の軸から整理しているようである。以下LLMの力を借りて読んだ内容を自分の言葉も交えてメモとして残す。
---
RSIとは、Agentが環境との相互作用から得たタスク軌跡とフィードバックを利用して、自身の状態を更新し、更新後の状態を後続タスクに活用すること、と定義しているようである。
かなり広めの定義に見えるが、ざっくり言うとこのような定義になるのは、管理人の理解でもそうだと思う。
Agent = Model + Harness と捉え、RSIの何を変えるのか、という部分について以下の分類を用いて整理をしているようである:
- Parameter: 経験をモデルの重みに内在化する
- 一例: [Paper Note] Self-Adapting Language Models, Adam Zweiger+, arXiv'25
- Context: LLMへのInputに反映させる
- 一例: [Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
- Memory: 外部に保存された経験や情報として蓄積し、必要に応じて利用する
- 一例: [Paper Note] ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory, Siru Ouyang+, ICLR'26, 2025.09
- Skill: 次に同じ状況が起きたらどうすべきかをskillとして定義する。Memoryは過去の経験を蓄積するものであり、Skillは次どうするかを定義するという棲み分けをしている
- 以下は参考として管理人がピックしたもの
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
(パラメータも最適化しているがSKILLBANKが該当すると思われる)
- [Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
- Harness Code: Agentを動作させるプログラム(Scaffolding)を変更する
- 一例: [Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
- 元ブログ中では↑が挙げられているが、Darwin Godel Machineの方が近いのでは?[Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
また、進化を構造化(バージョン管理)する際の分類軸として
- chain: A->B->Cのように進化させ常に最新版を利用する
- tree: 木構造でバージョンを管理する。ある1つの親ノードから子ノードが構成される親子関係で管理
- 一例: [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- graph: グラフ構造でバージョン管理する。すなわち、複数のノードに基づいて新たなノードを構成できる。ノードはバージョンだけでなく、タスク、trajectoryなども該当すると読める。
と整理しているようである。
誰がAgentを更新するかという軸の整理では
- self (student): (生徒)自身が更新する
- Teacher: trajectoryをteacherが分析しteacherが更新する
- Student + Teacher: 上記の両方で、生徒がまずtrajectoryを整理し必要な項目の候補を挙げ、Teacherが精査をし反映させる
いつ進化するのか、という軸では
- offline: 経験を蓄積し一括で更新する
- online: タスク実行ごとに動的に更新する
- hybrid: オフラインで更新した後にデプロイ。デプロイ後もオンラインで新たな経験等を追加し動的に更新するような方式
と定義しているようである。
そのほかにも、補足的な分類軸として、
- acceptance criteria: 更新したものを反映する基準
- feedback source: feedbackの出自(ベンチマーク, 環境, verifier, LLM, 人間など)
- feedback type: score, non-score,
- update frequency: 更新頻度
- scope of experience: 経験がどのスコープまで利用可能なのか(generickに使えるのか、特定ドメインのみなのか等)
We Must Pace the Frontier, Dario Amodei, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Blog #Safety #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-13 Comment
元ポスト:
果たして。
独占禁止法で訴えられているとのこと:
Introducing Auto Engineering for Robotics, General Robotics, 2026.09
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Robotics #Initial Impression Notes #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-10 Comment
元ポスト:
ロボットにおける実験プロセス全体を自動的にループするハーネスの提案、という話に見える。
Research acceleration: The view inside OpenAI, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #ScientificDiscovery #autoresearch/RSI Issue Date: 2026-09-08 Comment
元ポスト:
RSI-Exam: Benchmarking Recursive Self-Improvement through Executable Research, RSI-Exam, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
Ornith-1.5: From Self-Scaffolding to Self-Improvement, Ornith, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #OpenWeight #reading Issue Date: 2026-08-20 Comment
HF: https://huggingface.co/collections/ornith-ai/ornith-15
元ポスト:
関連:
- Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
モデルを学習するためのタスク生成、scaffolding(e.g.,ヒントなどのタスクを適切な難易度に調整する足場を作ること)生成、解答の生成(ロールアウト)それぞれをself-improvementさせながら学習されたモデルとのこと。
DataSmith: Automating Data Research, datologyai, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Blog #One-Line Notes #Reading Reflections #Data #autoresearch/RSI #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment
元ポスト:
Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。
興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。
が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com
- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。
NanoGPT Speedrun Frontier, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-17 Comment
元ポスト:
所見:
18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。
DeepSeek Harness, Deepseek AI, 2026.08
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 Comment
元ポスト:
モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。
元ポスト:
高い拡張性を持つため、self-improveするハーネスと相性が良さそう。
所見:
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence, Google Research, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Hallucination #Blog #ScientificDiscovery #Verification #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
Paper/Blog Link My Issue
#Article #NLP #read-later #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-07-15 Comment
元ポスト:
Harness Engineering for Self-Improvement, Lilian Weng, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #Blog #read-later #RecursiveModels #Author Thread-Post #AgentHarness Issue Date: 2026-07-12 Comment
元ポスト:
Hermes-Agent, Nous Research, 2026.02
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #One-Line Notes #ContinualLearning #AgentSkills #AgentHarness Issue Date: 2026-06-27 Comment
Nous ResearchによるAgentSkillsを自己改善していくタイプのAgent Harness (Scaffolding)。2026.0628現在20k star
Deli_AutoResearch, Deli Chen, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #AgentSkills #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-20 Comment
元ポスト:
[Paper Note] ENPIRE: Agentic Robot Policy Self-Improvement in the Real World, Xiao+, 2026.06
Paper/Blog Link My Issue
#Article #Robotics #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-17 Comment
元ポスト:
First Steps Toward Automated AI Research, Recursive Superintelligence, 2026.06
Paper/Blog Link My Issue
#Article #Blog #read-later #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-14 Comment
元ポスト:
word2vec, GloVe, Rucursive ModelのRichard Socher氏のポスト
Releasing Lab: the training platform for self-improving agents, PrimeIntellect, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog Issue Date: 2026-05-09 Comment
元ポスト:
betaからついにリリース
関連:
- Introducing Lab: The Full-Stack Platform for Training your Own Models, Prime Intellect, 2026.02
ここまでおよそ1年らしい?
autoresearch, karpathy, 2026.03
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Repository #ScientificDiscovery #Selected Papers/Blogs #One-Line Notes #autoresearch/RSI Issue Date: 2026-03-10 Comment
元ポスト:
リポジトリのDiscussionsに、定期的にsession reportがアップロードされるようだ:
https://github.com/karpathy/autoresearch/discussions/43
nanochatは現在、126回の実験を経て、Validation BPBが0.997900 -> 0.969686 まで改善しているとのこと。
pjの目的やテーマは、**研究者がpythonファイルのコードをいじるのではなく、program.mdと呼ばれるAgentにコンテキストとして与えるmarkdownファイルのみの編集を通じて、研究組織(≠単一のPh.D student)をエミュレートできるか?** という点にありそうである。
https://github.com/karpathy/autoresearch/blob/master/program.md
その題材の一つとして、nanochatを簡略化したGPTを用いて、GPTの事前学習の性能を改善させるようなtraining.pyの編集をAI Agentsに実施させ、5分間学習させて成果を報告させるという形式をとっている(と解釈した。)
関連:
- [Paper Note] AlphaEvolve: A coding agent for scientific and algorithmic discovery, Alexander Novikov+, arXiv'25, 2025.06
- [Paper Note] ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution, Robert Tjarko Lange+, arXiv'25, 2025.09
続報:
