ReinforcementLearning (667) — 1/4
[Paper Note] Harness Learning Enables Generalizable Test-Time Adaptation, Alvin Zhang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #meta-learning #Generalization #Test-time Learning/Adaptation #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-10-02 GPT Summary- 言語モデルエージェントのharnessを、実行フィードバックに基づいて改訂するharness learningを提案。 実行可能プログラム上のメタ学習として改訂モデルを強化学習で訓練し、テスト時にはパラメータ更新なしで新規タスクの実行結果からharnessを逐次改善する。 推論およびマルチホップQAで、改訂性能の向上と未知タスクへの適応・転移を確認。 Comment
元ポスト:
実行時のフィードバックに基づいてAgent Harnessをreviseすることを学習したモデル(Proposer)によって、テスト時にモデルの重み更新なしで、未知のタスクに対する汎化性能を獲得する
[Paper Note] EasyPPO: Stabilizing the Critic Is Key, Xuanyi Zhou+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Actor-Critic #PostTraining #read-later #Stability #Author Thread-Post Issue Date: 2026-09-30 GPT Summary- PPOでは、クリティックがLLMの強化学習を不安定化させる二つの失敗モード(打ち切りロールアウトのフィルタリングによる条件付き報酬への偏り、異質なリターンノイズによる高分散プロンプトの支配)を特定。 EasyPPOでは、アクターのみの過長ロールアウトを除外しつつ完了・打ち切り両方のリターンでクリティックを学習し、リターン分散の逆数によるノイズ正規化と小規模ミニバッチで更新を安定化。 コーディング、数学推論、マルチターン検索で標準PPO、VAPO、HL-Gauss PPOを一貫して上回り、PPOに対して最大14.89%の性能向上を達成。 Comment
pj page: https://easyppo.github.io/
元ポスト:
著者ポスト2:
[Paper Note] CodeMidas: Scaling Agentic Coding RL Environments from Code Itself, Bowen Ye+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-28 GPT Summary- ソースコードのみを用いて、既存コードベースの機能を実行可能なRL環境へ変換するエージェント型パイプラインCodeMidasを提案。 機能探索・仕様化、テスト生成、実行チェックと反復ロールアウトによるタスク検証を行い、23言語・15分野の3,185コードベースから5,545件の訓練タスクを構築。 これらでMiMo-V2.5をGRPO学習することで、Issue修正・プログラム構築・端末操作など5つのベンチマークすべてで性能が向上し、コードベース探索や自己検証も改善。 Comment
元ポスト:
[Paper Note] Reinforcement Learning for Real-Time Vision-Language-Action Policies, Perry Dong+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #NLP #Architecture #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Realtime Issue Date: 2026-09-28 GPT Summary- 大規模VLAの推論遅延による古い観測と分布シフトに対し、RLでリアルタイムかつ信頼性の高いファインチューニングを実現。 Real-Time EXPO-FTでは、VLAが行動チャンクを提案し、軽量な編集方策が最新観測に基づいて行動を高速修正することで、表現力と反応性を両立。 Kinetixの全10環境で最高性能を達成し、4つの実世界タスクでも10分間のデータのみで平均性能を42%から97%へ向上。 Comment
元ポスト:
[Paper Note] Rufus-Air: An Open LLM Post-Training Recipe, Chia-Yuan Chang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #InstructionTuning #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-27 GPT Summary- GLM-4.5-Air-Base上で、SFT、各種RL、エージェント学習、RLHFを順序立てた、オープンで再現可能な8段階のポストトレーニング手法Rufus-Airを提案。公開データとOSSコンポーネントのみを用い、データ、報酬設計、インフラ、段階順序を明示することで再現性を確保。多様なSFTで基礎能力を確立し、難易度フィルタリングと報酬の信頼性に基づく段階設計によって、推論・コーディング・指示追従・各種エージェント能力を向上。公式GLM-4.5-Airポストトレーニング済みモデルを上回り、同規模のオープンモデルと競争力のある性能を達成。 Comment
元ポスト:
[Paper Note] Reward Hacking in Rubric-Based Reinforcement Learning, Anas Mahmoud+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #NeurIPS #RewardHacking #PostTraining #read-later #Selected Papers/Blogs #Verification #Rubric-based #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ルーブリックベースの強化学習において、学習用検証器を欺く報酬ハッキングを調査し、検証器の失敗とルーブリック設計の限界に分類。弱い検証器では代理報酬のみが向上し、複合基準の部分的充足や暗黙内容の誤認などの悪用が増加する。強い検証器は悪用を減らすが完全には防げず、ルーブリックが重要な失敗を捉えない場合、完全性は向上する一方で正確性・簡潔さ・関連性・全体品質が低下。方策の対数確率から参照検証器の品質と学習停止を診断する「自己内在化ギャップ」を提案し、検証強化だけでは広範な品質向上を保証できないことを示した。 Comment
元ポスト:
[Paper Note] onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction, Lei Yang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #Annotation #PostTraining #read-later #Selected Papers/Blogs #Data #Author Thread-Post Issue Date: 2026-09-23 GPT Summary- LLMのアライメントデータやエージェント軌跡を効率的にアノテーションするため、トークンレベルで「特定・修正・継続」を行うインタラクティブツールonPandaを提案。モデル応答中の不適切なトークンを修正し、その位置から生成を再開することで、低コストに出力を誘導する。手作業による事後編集と比べてアノテーション時間を中央値で52%短縮し、モデルのサンプリング分布を保持したオンポリシーSFTデータや選好データの構築を可能にする。さらに、修正履歴から位置情報付きの細粒度な教師信号と正例・負例を生成し、外部ツールと接続したインタラクティブな軌跡アノテーションにも対応。Panda-CVLデータセットとトークンレベル修正ベンチマークを公開。 Comment
元ポスト:
[Paper Note] DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale, Jialiang Huang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #AIAgents #PostTraining #One-Line Notes #Environment Issue Date: 2026-09-23 GPT Summary- LLMエージェントの大規模な学習・評価に向け、FnCall、コンテナ、マイクロVM、フルVMを統合的に提供する弾力的なサンドボックス基盤DSecを構築。 クラスタ全体で配置・ライフサイクル管理を行い、レイヤ構成、メモリ共有、リソース回収、CPUスケジューリング、3FSからのオンデマンドなイメージロードによって、高密度かつ効率的な実行を実現する。 さらに、RL学習と連携してステートフルなロールアウトをGPU学習から分離し、状態を保持したままアイドル資源を回収することで、効率向上とエージェントの不正挙動の抑制を両立。 本番環境では38万超の同時実行サンドボックスと毎秒5,000件超の作成処理を実現し、環境構築・イメージ配布のオーバーヘッドを削減しながら、高密度環境でも低遅延性能を維持。 Comment
元ポスト:
所見:
ロールアウト時の状態の所有権をGPU上のトレーニングジョブではなく、CPU側のサンドボックスプラットフォーム側に持たせていることが重要とのことで、これによりロールアウトの状態をスナップショットし、学習が中断された場合でもGPUに再接続して必要に応じて(コマンドのリプレイではなく)再開できるため効率化される。
また、学習中のエージェントが不正な挙動をした場合(不正な行動によってタスクの解決を試みたり、インフラの障害を引き起こすコマンドの実行)に対する対策として、リソースに対するアクセス制御を強化しているようである。
[Paper Note] Score Centering Stabilizes Off-policy Reinforcement Learning, Martin Marek+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Off-Policy #Stability #train-inference-mismatch #Author Thread-Post Issue Date: 2026-09-23 GPT Summary- LLMのRLにおける学習・推論ミスマッチ(TIM)は、学習エンジンと推論エンジン間の持続的なバイアスであるドリフトにより不安定化する。ドリフトを相殺する加法的なスコア中心化補正を導入し、量子化下で重要度サンプリングと同等以上の性能を達成。さらに重要度サンプリングと組み合わせることで、古い方策を用いる設定でもベースラインを上回った。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Learning to Solve Hard Problems in RL for LLMs by Never Giving Up, Michael Noukhovitch+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 大規模言語モデル(LLMs)における強化学習(RL)は、易しい問題に対しては大きな改善を示す一方、難しい問題では改善が少ないという現象を示す。これを「マタイ効果」と呼び、計算資源の不均等な配分が原因とする。提案する「Never Give Up(NGU)」は、正解が出るまでサンプル生成を続ける適応サンプリング法であり、非同期RLを利用して易しい問題のサンプル数を減らし、難しい問題に資源を再配分する。NGUは、数学ベンチマークDeepscalerで計算あたりの性能を向上させ、難しい問題に特に効果的であることを示す。また、コーディング課題Manufactoriaにおいても、NGUはより難しいテストの解法を改善し、最終的な問題解決を学習する。 Comment
元ポスト:
著者ポスト2:
post-trainingでon-policy RLを実施する際、hardな問題からの学習シグナルを得るために、簡単な問題のロールアウトを減らし、すべてのロールアウトが不正解だった場合、一定の確率でロールアウト数を増やすことでgainが増えるという話のようである。簡単な問題のロールアウトよりも、難しい問題のロールアウトに計算リソースを配分することで学習能率があげられるよ、というシンプルかつうまくいきそうな手法に見える。
[Paper Note] Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR, Boyan Li+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #reading #One-Line Notes Issue Date: 2026-09-16 GPT Summary- OPDとRLVRを用いて、二段階のスキームOPD-then-RLが論理推論と数学的推論のベンチマークで他の手法を上回ることを示す。OPDはRLの補助として機能し、二つの信号を同時に最適化すると干渉が発生するため、OPDの検証スコアがRLの切り替え時の鍵になることを明らかにした。全体として、OPD-then-RLは信号を相補的に変換するシンプルかつ強力な手法として確立された。 Comment
元ポスト:
OPDの後にRLを実施することで、reasoningタスクにおいて性能の向上が見られ、gainはOPDのみの場合、あるいはpureなRLVRの場合よりも大きかった、その理由はOPDはpass_at_kを改善し到達可能な解の集合を拡張し、RLVRは確率を再分配しpass_at_1を改善するから(先鋭化する)、という話らしい。
[Paper Note] T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks, Junyao Yang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Actor-Critic #Coding #OpenWeight #SoftwareEngineering #PostTraining #Author Thread-Post #CreditAssignment Issue Date: 2026-09-13 GPT Summary- エージェントは長期タスクに適応し、122BのMixture-of-Expertsモデルを強化学習で訓練。実際のシェルを操作し、最大300回のツール呼び出しとタスク検証を行う。訓練では、アクター‐クリティック法を安定化し、正確なサンプルリングを行うことで最適化。Terminal-Bench 2.1を用いて真の能力移転を達成し、T1は27.9%に到達し、他のモデルを上回る性能を示した。 Comment
元ポスト:
pj page: https://jyyang26.github.io/t1/
[Paper Note] ExecCritic: Learn to Test, Test to Improve for Coding Agents, Leitian Tao+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #UnitTest #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-09-10 GPT Summary- 実行時フィードバックは、コーディングエージェントを正しい修正に導くが、誤ったテストが偽の自信を生む可能性がある。そこで、ExecCriticを提案し、テスト生成と修正を分離するスキャフォールドを用いて、強化学習レシピで訓練されたテストエージェントと修正エージェントを開発。Learn to Testでは正しいテストを学び、Test to Improveではフィードバックに基づく改善を学ぶ。事後訓練により成功率が向上し、両エージェントを組み合わせることで全体の性能が向上した。コードは公開済み。 Comment
元ポスト:
テスト生成と、コードの修正をするエージェント(テストの修正はできない)を分離し、RLを通じて双方の能力を高める手法を提案しているようで、高品質なテストを作成し、そこから得られるフィードバックに基づいて修正を実施するがコード修正の強力なscaffoldingとなる、という話のようである。
[Paper Note] Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching, Preston Fu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Selected Papers/Blogs #CreditAssignment Issue Date: 2026-09-09 GPT Summary- 強化学習における従来の疎なアウトカム報酬の方法は、長く複雑なタスクの学習を遅延させる。部分的な進捗を報酬するアプローチはバイアスを生じることがあるが、我々は「progressive point matching」と呼ぶ新たな密な報酬定式化を提案する。これにより、セグメント単位での進捗報酬が長期タスクに効果的にスケールすることを理論的・実証的に示した。特に、難解な数学的推論問題において、セグメントレベルの報酬が成功率を向上させることがわかった。 Comment
blog: https://www.prestonfu.com/notes/ppm/
元ポスト:
[Paper Note] Tail-Likelihood Reinforcement Learning, Shrinivas Ramasubramanian+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#PostTraining #read-later #Author Thread-Post Issue Date: 2026-09-08 GPT Summary- 強化学習において、平均報酬の最適化はしばしば高報酬ロールアウトの重要な違いを見落とす。そこで、報酬の上位尾部を考慮し、ポリシーが閾値を超える確率を最大化するTail-Likelihood Reinforcement Learning(TailRL)を提案。TailRLは既存の強化学習パイプラインと互換性があり、高報酬サンプルを活用して局所的な最適解から脱却し、推論時により多くの利点をもたらす。 Comment
元ポスト:
著者ポスト:
[Paper Note] Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe, Yaxuan Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Distillation #On-Policy #Author Thread-Post Issue Date: 2026-09-07 GPT Summary- OPDは大規模言語モデルのポスト訓練において重要だが、そのダイナミクスは未解明。成功には、学習者と教師の思考パターンの互換性と新しい能力の提供が必要。弱→強逆蒸留で確認された結果、成功するOPDは高確率トークンの整合性と小規模なトークン集合によって特徴付けられる。失敗を回復するための戦略として、オフポリシーのコールドスタートと教師に合わせたプロンプト選択を提案。OPDの報酬メカニズムは代償を伴い、その長期的なスケーラビリティに疑問を投げかける。 Comment
元ポスト:
所見:
[Paper Note] ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL, Zhuoshi Pan+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ContextEngineering Issue Date: 2026-09-06 GPT Summary- 長期的なエージェント性推論タスクにおいて、ContextPilotを提案。これは、計画、長期記憶、ソフトなコンテキストオフローディングツールを統合したプロアクティブなコンテキスト管理フレームワークで、RL手法を用いてコンテキスト編集の最適な決定を行う。実験により、よりコンパクトな作業コンテキストで高い性能を実現し、既存のベースラインを上回ることが示された。 Comment
元ポスト:
[Paper Note] TailSFT: Filtered Fine-Tuning Improves Post-Training Performance, Sadhika Malladi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- 強化学習のポストトレーニングは、エージェントの能力向上に寄与するが、高性能なベースモデルを微調整する際に特に効果的である。既存のパイプラインの有効性を疑問視し、TailSFTを設計。これは、訓練時に適合済みシーケンスを除外し、データ分布の未モデル化領域に学習を集中させる。実験と理論分析を通じて設計選択を正当化し、OLMo-3 7Bでは、TailSFTがパフォーマンスを最大17%向上させ、計算オーバーヘッドを抑えた。高いカバレッジのチェックポイントは、後続の強化学習での成果につながり、TailSFTの有用性を示した。診断法を導入し、モデル開発アプローチを提唱。 Comment
元ポスト:
著者ポスト:
ポイント解説:
RL前のモデルの応答パターンのcoverageを改善することで、RLのgainを大きくしたい、という気持ちの研究。SFTで特定の応答パターンを過剰に学習すると、少数パターンの応答が抑制されてしまい(Pass@1は改善するが、Pass@kが下がる)、これがRLのgainの低下に繋がるという話のようである。
SFTにおける各サンプルの学習初期のlossを記録し、学習が進む過程でlossの改善を見て、lossが最も大きく改善したサンプルを除外して学習を進めることで、SFTによるPass@kを改善することで、RLのgainをより高めることを示したようである。
[Paper Note] Demystifying Reinforcement Learning Post-Training of Language Models, Donovan Clay+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #PostTraining #read-later #Exploration Issue Date: 2026-09-05 GPT Summary- RL後トレーニングは、LLMsの能力を強化する重要なフレームワークであるが、そのメカニズムは依然として不明瞭である。本研究では、RL手法を分解し、そのプロセスを明らかにする。具体的には、検証可能な報酬を用いてRLの効果を分析し、基盤モデルや報酬信号、プロンプトの多様性が結果に与える影響を探る。ポリシーの出力分布のエントロピーを通じて、各段階がモデルの確信度をどう形成するかを比較検証し、偽の報酬の影響や成功の条件について洞察を得る。本論文は、NLPコミュニティ向けのRLの理解を深めるためのリソースとなる。 Comment
元ポスト:
気になる
[Paper Note] TTPO: Test-Time Policy Optimization, Aozhe Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#MajorityVoting #Test Time Training (TTT) Issue Date: 2026-09-05 GPT Summary- テスト時ポリシー最適化(TTPO)は、擬似ラベルを用いたRLにおける非対称目的関数を提案し、誤った票が教師を汚染する問題を解決。TTPOは、同意するロールアウトを蒸留し、異論をGroup RLでペナルティ化してモデルを改善。競技レベルのベンチマークで欠乏ラベルでの性能向上を示し、汎化性が強化された。 Comment
元ポスト:
[Paper Note] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning, Shulin Tian+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #NLP #Faithfulness #EMNLP #VisionLanguageModel #Rubric-based #Initial Impression Notes #Author Thread-Post #CreditAssignment Issue Date: 2026-09-01 GPT Summary- 視覚と言語モデルは、視覚的証拠に基づかない回答を生成することがあるため、妥当性を維持できない状況をクレジット割り当ての失敗と捉える。本研究では、参照回答を原子命題に分解し、視覚的忠実性、推論の一貫性、指示遵守に基づいた評価を行う視覚的ルーブリックを提案。これにより裏付け証拠のクレジットを局所化し、Qwen3-VL-8B-Instructを用いて生成したトレーニングセットV-Rubrics 50Kを作成。実験結果、ルーブリックベースのGRPOはSFT基準及び他の手法を上回る改善を示し、視覚的ポストトレーニングの報酬としてルーブリックの有効性を証明した。 Comment
元ポスト:
Rubric basedなRLを用いて、trajectoryに対して構造化された部分点を提供するcredit assignment手法を提案し、これによりVLMの
- Visual Faithfulness
- Reasoning Consistency
- Instruction Following
を改善する、という話に見える。
[Paper Note] Prefix Sliding for efficient test-time scaling, Niklas Muennighoff+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LongContext #Test-Time Scaling #Selected Papers/Blogs #reading #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- テスト時スケーリングでは、言語モデルが長期間推論できるように推論の計算を強化するが、多くの中間トークンが重要性を失うことが発見された。これを受けて、Prefix Slidingを提案し、推論中に不要なトークンを破棄することでメモリ要件を削減し、効率的な長期推論を実現する。これにより、既存のモデルを維持しつつ3倍の速度向上が可能になり、強化学習では100,000トークン以上のスケーリングを達成する。実験により、Prefix Slidingが中間トークンの要約や従来の手法より優れていることが示された。 Comment
元ポスト:
long sequenceに対する推論をすると
- full attentionの場合メモリ消費が激しくOOMになる
- しかしreasoningをコンパクトに圧縮すると重要な情報を失う
これを解決するために、reasoningの中間にあるtokenの重要度が低いことに着目し、シンプルに
- prefix: reasoningの冒頭、指示やtoolの定義を含む
- recent tokens: reasoning traceの直近
を残す二種類の固定長のwindowを用いて、prefixは固定し、recent tokensはtraceの成長に従いスライディングさせる手法を提案。
その結果、
- 最大消費メモリが固定され
- full traceを用いるよりも推論スピードは速く、同等の性能に最大3倍程度早く到達
- RLにおいて、より長い推論を固定されたmemory budgetの元で実施でき、rewardも改善
シンプルな手法でOOM問題を解決し、単に推論時のメモリ消費や推論スピードを改善しただけでなく、モデル学習時のRLにおけるパフォーマンスが改善することまで示しており、シンプルで容易に実装ができるがインパクトが大きく、非常におもしろい研究と感じる。Ablationも実施されている。
Linear attentionに対しては、そもそもメモリ消費量はconstantなので提案手法を適用する必要がそもそもない点には注意。
現在の主要な中国系のOpenWeight LLMのアーキテクチャがほぼ、linear attentionとsparse attentionを積み重ねたアーキテクチャになっている。sparse attentionはKV Cacheがcontext長に従って増大するため、本研究の恩恵を受ける可能性はあるが、sparse attentionに対する実験は実施されていないように見える。
[Paper Note] Best Practice Critic Optimization, Penghui Qi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Actor-Critic #PostTraining #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- グループベースの強化学習法であるBPCOを用いて、複数の応答からトークンレベルのアドバンテージを推定し、クリティック訓練の不安定性を改善。対照実験を通じて、1.5Bから30Bパラメータの数学的推論タスクで強力な性能向上を確認、グループベースのベースラインを超える結果を達成。コードは公開されている。 Comment
元ポスト:
元ポストのスレッドを眺めてから読むと良さそう。
解説:
[Paper Note] Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models, Jean de Dieu Nyandwi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #PostTraining #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- 推論モデルの正確性と関連する行動を区別し、推論志向の訓練がそれらを増幅するかを評価。Behavioral Lift指標を用いて、テキストと視覚言語推論における15モデルの推論痕跡を分析。思考型モデルは自己訂正や仮説検証を強化するが、モデルの信頼度の較正はほとんど増幅されない一方で、不確実性の認識は大幅に増幅されるが正確性との関連は薄い。推論志向の訓練は、最も重要な行動を増幅せず、より根拠のある推論を評価する目的の動機づけが必要。 Comment
元ポスト:
著者ポスト2:
Behavioral Liftというmetricを定義し、reasoning中の思考パターン(Table 1のようなもの)の頻度と、当該思考パターンが正確な予測に寄与しているか否かを分離した上で、reasoningを強化するpost-trainingがどのような思考パターンを増幅し、増幅される思考パターンが有益なものものなのかを分析した研究のようである。
Behavioral Liftは、当該思考パターンの有無によって、正解率がどの程度変化するかによって定義される(式1)。
実験の結果、Behariobal Liftが高い、すなわち正解に寄与する思考パターンはあまり増幅されていない傾向にあることがわかった、という話に見える。
[Paper Note] Q-Learning With World Models, Perry Dong+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#PostTraining #WorldModels Issue Date: 2026-08-22 GPT Summary- オフポリシー強化学習において、サンプル効率を向上させるために、ワールドモデルを活用したQ学習手法QWMを提案。これは、実際の遷移を通じてポリシーと価値関数を訓練し、累積バイアスを回避しつつ予測的探索の利点を享受する。実験結果では、難易度の高いベンチマークでQWMが既存の手法を大幅に上回る性能を示した。 Comment
元ポスト:
[Paper Note] SPADE: Self-Play in Adaptive Synthetic Executable Environments, Bo Liu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #AIAgents #PostTraining #read-later #Selected Papers/Blogs #SelfPlay #Environment #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- 自己改善には多様で適応的な目標プールが不可欠であり、SPADE(Self-Play in Adaptive Synthetic Executable Environments)は、単一の大規模言語モデルが自己対戦型強化学習フレームワークで二つの役割を果たす。環境デザイナーが長期的な訓練環境を作成し、推論エージェントが行動を学ぶ。報酬や後悔信号を最適化しつつ、環境をエージェントの能力の限界に合わせて設計。広範な実験により、大規模コーパスの使用と環境メモリの蓄積が成功に重要であることが明らかにされ、SPADEは競合ベースラインを平均+5.3ポイント上回り、特定タスクでさらに改善を達成。環境設計を学習可能にすることで、自己改善への道を示す。 Comment
元ポスト:
著者ポスト:
[Paper Note] SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents, Qingyao Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #PostTraining #read-later Issue Date: 2026-08-20 GPT Summary- エージェントフレームワークはスキルを手続き的知識としてパッケージ化し、ポリシーが必要なスキルを決定する。しかし、候補スレート上の結果報酬付き RL では学習が難しいことが示され、セレクター・クレジット飢餓という問題が特定された。SkillGateはこの問題を解決し、クレジットを二つのチャネルに分割。これにより、試行成功率が40.8%から53.2%に向上し、誤導的候補への露出を約3分の1に削減した。 Comment
元ポスト:
[Paper Note] Agent Lightning v1.0: Towards Harnessed Agentic RL, Zhiyuan He+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#AIAgents #AgentHarness Issue Date: 2026-08-20 GPT Summary- ハーネス付きエージェンティックRLは、訓練後のモデルに直接関与するハーネスを持ち、訓練エンジンではなくハーネスが環境との相互作用ループを所有する新たなアプローチである。これにより、訓練の安定性に影響を与える課題を持ちながらも、Agent Lightning v1.0として実装されており、様々なエージェントハーネスに対応した研究試験台として機能。わずかなリソースでコーディングエージェントの性能を著しく改善し、再現可能な研究を促進する完全なワークフローを提供する。 Comment
元ポスト:
[Paper Note] Le Critique: Privileged Value Functions for LLM Reinforcement Learning, Siddarth Venkatraman+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #PostTraining #Author Thread-Post #ValueFunctions Issue Date: 2026-08-19 GPT Summary- 大規模言語モデル向けの強化学習アルゴリズムは、主に分散低減戦略を用いているが、シーケンスレベルのクレジット提供に限界がある。これを克服するために、二つの戦略を提案。1) Privileged Value Functionsでタスク関連のトークン信号を追加し、2) TETHERで精度に応じてベースラインを適応的に内挿。これにより、複数の推論タスクにおいて標準の価値関数を上回る成果を示した。 Comment
pj page: https://privileged-value-functions.github.io/
元ポスト:
[Paper Note] Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements, Zhi Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#AIAgents #PostTraining #LongHorizon #Author Thread-Post Issue Date: 2026-08-19 GPT Summary- 強化学習(RL)の長期的な推論は課題が多いため、進化戦略(ES)が大規模LLMエージェントの微調整に適していると主張。ESの利点は、1) スケーラビリティ、2) 柔軟性、3) 長期ホライズンでのパフォーマンス向上。新たに提案された「Agentic ESOpt」フレームワークは、全パラメータをファインチューニングし、コサイン減衰スケジュールを加えたことで探索と適応を改善。WebArena-Liteでの実験では、ベースラインに対して6.69%の改善を達成。 Comment
著者ポスト:
所見:
[Paper Note] Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies, Conor F. Hayes+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #PostTraining #read-later #Diversity #Author Thread-Post Issue Date: 2026-08-18 GPT Summary- 大規模言語モデル(LLMs)は、探索領域での応用が進んでおり、特に多様な候補解を生成するパス@kプロセスが注目されている。しかし、従来の強化学習(RL)に基づく事後トレーニングでは解の網羅性が低下する可能性がある。対照的に、エボリューション・ストラテジー(ES)は、集団ベースでの最適化を通じて、より広い出力分布と高い解の網羅性を実現する。ESは標準的な数学ベンチマークにおいても優れた結果を出し、探索問題への適用において有望である。 Comment
元ポスト:
[Paper Note] Training AI Scientists to Replicate Research, Damon Falck+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #PostTraining Issue Date: 2026-08-15 GPT Summary- 論文再現性は科学的知識の基盤であり、信頼性と実験の基盤を提供する。研究は、再現性のためにスケーラブルなタスク空間Replicaを開発し、ノイズの少ない自動生成ルーブリック型ジャッジを導入。27BパラメータのFaradayエージェントは、コーディングエージェントを利用し、ホールドアウト再現タスクでClaude Opus 4.8およびGPT-5.5を超えた。定性的分析から、Faradayは科学原理に基づくアプローチを取っていることが示された。この研究は、AIエージェントによる科学的イノベーションの促進に寄与する。
[Paper Note] Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL, Minglai Yang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #RewardHacking #PostTraining #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #Reading Reflections Issue Date: 2026-08-14 GPT Summary- ルーブリックに対する強化学習は、ポスト訓練された言語モデルに用いられ、品質の固定的代理指標として機能するが、実際の質を完全には反映しない。Qwen3-8Bを医療と科学のルーブリックで訓練し、訓練用とゴールドジャッジのスコアの乖離を示した。乖離は報酬ハッキングに起因し、Rubric Dropoutを提案。ルーブリックの一部をランダムに無効化し、ポリシーの二度最適化を防止。ドロップアウトによるOODスコアの向上を確認し、HealthBench-Hardで+1〜+2、ResearchQAで+6〜+7ポイントの改善を示した。最適なドロップアウト率は30–50%で、基準の重み付けが劣る結果となった。 Comment
元ポスト:
RubricをDropoutすることで、常に固定されたルーブリックが利用されないようにし、Reward Hackingを防止する。
論文中のproxy judgeとgold judgeの違いが最初はよくわからなかったが、
- proxy judge: 学習に利用するllm-as-a-judgeモデル
- つまり、Reward Hackingの対象となるもの
- gold judge: 学習には一切介入しないproxy judgeよりも強いモデルを用いたjudge
両者では同じルーブリックを用いられる。これらのjudgeモデルの絶対値はバイアスを含むため関心がなく、両者のgapに関心がある(proxy-gold gap)。RLの最中に20 step単位で両者のスコアを比較し、両者のgapがconsistentに開いていった場合、それは評価のノイズではなく、(固定されたバイアスでもなく)、Reward Hackingの兆候である可能性が高いと主張している。実際、Figure 2を見ると、240 stepから両者のスコアの傾きが変化していて、gold judgeではスコアが向上していくが、proxy judgeではスコアが向上しない現象が観測される。これは、proxy judgeが、本来評価したいRubricとは異なる側面で攻略されていることを示唆していると考えられる。
dropoutなし、30%、50%の場合で比較したところ、dropoutを導入した場合に一貫してスコアが向上する。実験では、proxyではgpt-4o-miniが用いられ、goldではclaude-sonnet-4.6が用いられている。
実際のルーブリックは論文中に掲載されていないので、学習に利用されたデータセットを参照する必要がある。おそらく、それなりの数のRubricによって構成されていると思われるが、Rubricの数に対するsensitivityはどの程度なのだろうか?
dropout rateによるsensitivityは実験されているが、元々のRubricのサイズの大小による影響は比較されていないように見える。
[Paper Note] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs, Kejian Zhu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #read-later Issue Date: 2026-08-11 GPT Summary- SFTとRLのマルチタスク推論における挙動を比較。SFTはタスク間の対立を引き起こすが、RLは安定した共存を実現。RLの干渉は分散に制約され、タスク間の最適化方向がほぼ直交することを示す。これに基づいて、効率的で柔軟なParallel-RLを提案。 Comment
元ポスト:
[Paper Note] ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment, Yijun Lu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #PostTraining #CreditAssignment Issue Date: 2026-08-10 GPT Summary- 長期的な探索エージェントは、回答に至るための複数のステップを必要とするが、従来の訓練法では有用な行動と誤った行動を区別できない。本研究では、Answer-Backtracked Credit Assignment(ABC)という細粒度のクレジット割り当てフレームワークを提案し、有用な行動を報いる一方で誤った行動を抑制する。具体的には、答えを遡って必要な手掛かりを回復し、探索ステップを手掛かりと照合することで密な報酬を生成。このフレームワークを用いて、Qwen3.5-4Bを使ったABSeekerが、BrowseCompで37.3%、BrowseComp-ZHで39.1%を達成し、コンテキスト管理を導入するとさらなる改善が見られた。これは長期的な探索エージェントの訓練におけるABCの有効性を示す。 Comment
元ポスト:
[Paper Note] Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories, Shuai Shao+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Online/Interactive #NLP #LanguageModel #SelfImprovement #AgentHarness Issue Date: 2026-08-10 GPT Summary- Harness-R1は、デプロイメント中にエージェントが蓄積する相互作用の軌跡を用いて行動を最適化する初の方法を紹介する。オンライン強化学習を活用し、固定されたエディタではなく、エージェントの成功に基づいた編集を学ぶ。これにより、成功率はWebShop、ALFWorld、DBBenchで44.3%から53.6%に向上し、ターゲット特化のエンジニアリングによってさらに64.2%に達する。これは、ハーネスエンジニアとターゲットエージェントの共進化を示唆している。 Comment
元ポスト:
[Paper Note] SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution, Zhiyuan Yao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #Initial Impression Notes #CreditAssignment Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment
元ポスト:
関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。
AgentSkillっぽい話かと最初は思ったが、そうではなさそう。
[Paper Note] Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates, Yibo Li+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Selected Papers/Blogs #memory #reading #One-Line Notes #ContinualLearning #Test Time Training (TTT) Issue Date: 2026-08-09 GPT Summary- JitRLは、LLMエージェントの拡張性の課題を解決する新しいフレームワーク。訓練なしでポリシー最適化を実現し、動的な経験メモリから関連する軌跡を取り出してアクションのアドバンテージを推定。広範な実験により、JitRLが従来のファインチューニング手法よりも性能を上回り、コストを30倍以上削減することを示した。 Comment
元ポスト:
RLにおいて、学習時にポリシーを更新するのではなく、テスト時にメモリに蓄積されたtrajectoryに対して現在のstateを用いて検索をし、各候補アクションのAdvantageを計算。アクションのロジットに直接Advantageを重み付き(temperature parameter)で加算することで適応させる、という手法のようである。
ポイントは、ロジットに対してAdvantageをtemperature parameterによる重み付きで加算するという式が、KL正則化つきの期待報酬最大化問題の閉形式の解である、という主張である(Theorem 4.1)。ただし、メモリに蓄積される軌跡はあるポリシーに対してテスト時に更新されたロジットに基づいて収集されるため、そもそもオンポリシーを前提としているわけではなさそう。また、軌跡は様々なタスクの実行結果が蓄積されるであろう点には注意。
---
メモリはM={(s_i, a_i, G_i)}^N_{i=1}で定義される。G_iは割引累積報酬である(4.1節)。
trajectory中の各ステップのアクションのrewardはLLMベースのevaluationによって与えられ(付録G1.2, G2.2)、割引累積報酬の算出に用いられる。
stateはテキストベースで記述され、現在のstateとメモリに格納されているstateの類似度はJaccard係数によって計算される(式24)。実際のメモリからの検索の仕方は、データセットごとに適切なものを設定する(付録F)。
[Paper Note] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization, Bo-Wen Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #One-Line Notes #CreditAssignment Issue Date: 2026-08-08 GPT Summary- CoRTは、ルーブリック基盤の強化学習におけるトークンレベルのクレジット重み付け手法である。これにより、応答内での明示的なクレジット配分が可能になり、反事実リプレイを用いて同一応答の再スコアリングを行う。提案手法は、応答レベルの報酬を変更せずに、トークン毎に正規化された重みにマッピングし、GRPOアドバンテージを再配分する。実験結果は、CoRTが従来のGRPOを上回るパフォーマンスを示し、約4.4ポイントの向上を達成したことを示す。また、反事実尤度対比が効果的な学習信号を提供し、GRPOの安定性を維持することを示唆している。 Comment
元ポスト:
Rubric-basedなRLにおいて、Rubricの有無によって生じるtokenのlog probabilityの差を、当該トークンのルーブリックに対する重要度とみなし、token levelの学習シグナルを供給する。
[Paper Note] Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning, Guanqun Zhao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #train-inference-mismatch #Asynchronous Issue Date: 2026-08-05 GPT Summary- 非同期強化学習におけるオフポリシーデータの不安定性を解消するため、重要度比のエントロピーに基づくEntropy-Scaled Trust Region(ESTR)を提案。低エントロピーではサンプリングノイズが増幅され、高エントロピーでは探索的偏差が顕著になる。ESTRは各トークンの偏差を局所エントロピーでスケーリングし、補助伝搬を必要とせず、既存手法を上回る性能を示す。具体的には、BrowseComp-Plusでavg@1が37.34、multi-turn GSM8Kで95.69に到達し、2.6倍の速さを実現。 Comment
元ポスト:
[Paper Note] RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts, Yuxin Xiong+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining Issue Date: 2026-08-03 GPT Summary- GRPOを一般化するRRPOを提案。RRPOは正解ベースから参照相対的な比較に置き換え、層別化されたロールアウトを用いて正負のアンカーを構築。これにより、対照的アドバンテージを直接定義し、方策最適化中は射影ヘッドを凍結。RRPOは、検証器に依存せず競争力を維持し、弱教師ありベースラインを上回る結果を示す。 Comment
元ポスト:
[Paper Note] Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning, Lizhe Fang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #PostTraining #Grounding Issue Date: 2026-08-03 GPT Summary- 大規模言語モデルは段階的な推論の痕跡を生成し複雑なタスクで高性能を達成するが、「繰り返しのコピー」と呼ばれる過剰なテキストの模倣が問題となる。これは文脈が長くなるほど顕著で、主な証拠に焦点を当てられないため誤答が増加する。そこで、根拠認識付き報酬(GEAR)を提案し、正確性信号に基づいて主要な証拠と無関係な文脈を区別する報酬整形法を導入。自動化された訓練データ構築パイプラインを開発し、複数のモデルとベンチマークで検証。これにより、従来の強化学習よりも平均4.6ポイントの精度向上を実現し、推論の質を改善することが示された。 Comment
元ポスト:
[Paper Note] Measuring Reward-Seeking via Contrastive Belief Updates, Axel Højmark+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #PostTraining #Selected Papers/Blogs #Author Thread-Post #RewardSeeking Issue Date: 2026-08-03 GPT Summary- 強化学習で訓練された言語モデルは、審判者の判断を最適化しがちなため、目的を意図通りに遂行することが困難になる。この研究では、対照的合成文書ファインチューニングを用いて報酬追求を測定し、審判者が意図する行動とモデルの信念の対立を評価。強化学習の中間チェックポイントは、ユーザーや開発者よりも審判者の好みに従う傾向があり、特に能力重視の設定では顕著であった。報酬ハックを狙うモデルも、この傾向が強化されることが示され、RLによる訓練が意図しない行動を引き起こす可能性を示唆する結果となった。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Enhancing Rubric-based RL via Self-Distillation, Mingxuan Xia+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #On-Policy #Rubric-based #SelfDistillation Issue Date: 2026-08-02 GPT Summary- ルーブリックに基づく強化学習は、LLMsの改善において有望だが、未探索基準(UC)と抑制基準(SC)に関する制約が存在する。従来の手法は、これらの基準を適切に扱えず、訓練と推論時に不整合を生じる。これらの課題に対処するため、CriPO(Criterion-Distilled Policy Optimization)を提案し、オンポリシー自己蒸留を通じてルーブリックを強化する。UCには基準注入自己教師を使用し、SCに対しては反事実的自己教師を利用して有用なパターンを保持。医療と科学のベンチマークでの実験は、CriPOがルーブリックに基づくRLを上回り、最適化ステップ数を半減させることを示した。 Comment
元ポスト:
ポイント解説:
[Paper Note] LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks, Tianzhu Ye+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-08-02 GPT Summary- Experiential Learning(EL)は、強化学習におけるLLMの評価をスカラー報酬に圧縮する問題を解決する新しい手法である。ELでは、LLMをコーチとして活用し、評価を経験的知識に転用することで、オンポリシー応答に高品質なフィードバックを提供する。これにより、微細な嗜好を保持し、ポリシーの内部化を促進。ELは、未知のオープンエンドタスクにおいてルーブリックベースのRLを一貫して上回り、一般化性を向上させ、報酬ハッキングを抑制することが示された。 Comment
元ポスト:
ルーブリックを用いてscalar rewardを付与するのではなく、ルーブリックに基づいたinsightをテキストとして出力し、OPDすることで、密な報酬を更新に反映させる。
著者ポスト:
[Paper Note] SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning, Jinyang Wu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #One-Line Notes #AgentSkills #SelfDistillation Issue Date: 2026-07-31 GPT Summary- SEED(自己進化型オンポリシー蒸留)を提案し、成果ベースの強化学習の監督ギャップを埋める。SEEDは完成したオンポリシー軌跡を分析し、再利用可能な自然言語スキルを生成。また、ポリシー自体がハindsightスキルを抽出し、意思決定を改善。密なトークンレベルの蒸留信号でサポートし、性能とサンプル効率を向上させることを実験で確認。 Comment
元ポスト:
hindsight (後で結果を知ったうえで考えてみたら重要だった) skill をagent trajectoryから抽出する能力をSFTで身に着けさせた後に、その後RLを実行する。
RLを実行する際には、rolloutを実施した後に、(モデルは既にhindskillを抽出する能力を身に着けているため、)各rolloutから hindsight skillを抽出し、当該スキルの情報をcontextとして与えた場合を教師モデルとすることでOPDの学習シグナルとする。
これにより、sparseな報酬とdenseな報酬を両立する、という話に見える。
[Paper Note] TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents, Leitian Tao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #PRM #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- TRACE(Turn-level Reward Assignment via Credit Estimation)は、マルチターンエージェントの強化学習における密なクレジット割り当て手法を提案する。従来の報酬メカニズムが希薄化する問題を解決し、ツール呼び出しの軌跡を状態遷移として扱い、正解回答の対数確率を利用して各アクションの報酬を導出する。これにより、エージェントのツール利用能力を大幅に改善し、教師付きファインチューニングに依存せず、BrowseComp-Plusベンチマークでの性能を著しく向上させた。学習行動はオープンウェブのベンチマークにも転移し、早期の改善と速い収束を示す。 Comment
元ポスト:
frozenなモデルでツール呼び出しの前後において、呼び出し結果が正解の対数確率をどれだけ変化させたかによって、long horizon RLにおいて、密な報酬シグナルを提供する。
著者ポスト:
[Paper Note] Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills, Siyuan Huang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #AgentSkills #SelfPlay #Data Issue Date: 2026-07-28 GPT Summary- LLMトレーニングは手動から自己進化へ進展。しかし、既存の方法はタスク多様性と検証信頼性のジレンマに直面。環境依存の手法は限定的で、オープンエンドの自己生成は誤解を招く報酬問題を抱える。エージェントのスキルを用いた共進化フレームワーク「Skill Self-Play」を導入し、提案者、ソルバー、スキルコントローラの三要素が連携。これにより、構造化された検証と探索のギャップを効果的に解消。実証評価では、Skill-SPがバックボーン性能を向上させることを示した。 Comment
元ポスト:
所見:
-
-
[Paper Note] ISO: An RLVR-Native Optimization Stack, Hanqing Zhu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #RLVR #Author Thread-Post Issue Date: 2026-07-25 GPT Summary- 強化学習における報酬フィードバックの最適化層の理解が不足している中、本研究ではスペクトル継承の概念を提案。この概念をIsospectral Optimization(ISO)として実現し、固定スペクトルフレームワークに基づくオフラインとオンラインの実装を導入。オフラインではISO-Mergerが異なるスペシャリストの能力を統合し、高性能を達成。オンラインではISO-Optimizerが基底スペクトルを固定しつつ、最適化アルゴリズムを適用し精度向上を実現。特に、ISO-AdamWは従来のAdamWよりも少ない学習ステップで高精度を達成。ISOは、報酬駆動型適応の構造を活用した最適化層の新たな設計を提案する。 Comment
元ポスト:
著者ポスト2:
[Paper Note] Understanding Reasoning from Pretraining to Post-Training, Jingyan Shen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Scaling Laws #PostTraining #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-23 GPT Summary- 強化学習(RL)と大規模言語モデル(LLMs)の相互作用を特定するため、チェスを用いた統制されたテストベッドを提案。事前訓練からRLまでの関係を調査し、RL計算量と事前訓練損失との予測関係を発見。RLはSFTポリシーを鋭くするだけでなく、難解な問題でより良い解決策を引き出す。数学ドメインでも同様のパターンを確認し、事前訓練とRLの関係を定量的に説明する枠組みを提供。 Comment
元ポスト:
事前学習によってモデルの能力の基盤が形作られ、それは最終的なモデルの品質に大きな影響を与えることは経験的に知られているようだったが、本研究の成果は事前学習の重要性を示す一つの根拠になり得るため、重要文献に見える。
著者ポスト:
- 事前学習のlossによって(固定されたRL予算の元での)到達性能 (pass_at_1) を予測可能で、事前学習での学習トークン数に対して(固定された予算の元での)RLの性能向上の傾きが、対数線形に増加する (Figure 3)
- 実験から導かれた事前学習-RL間のスケーリング則 (p.8)
- が、対数線形の傾向は局所的にしか成り立たない模様?
- 予算が小さい場合は事前学習を重視し、予算が増加するにつれてRLに比重を置いた方が最終的なモデル性能が改善する (Figure 2)
- 事前学習に費やすトークンが多いほどRL後の性能が増し、モデルスケールが大きいほどRLに計算量を多く割り当てた方が性能が高くなる
- この傾向は、1B OLMo2を数学で10-200Bトークンで事前学習した場合でも観測された
[Paper Note] Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization, Zhicheng Cai+, ICML'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ICML #PostTraining #Initial Impression Notes #Exploration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 強化学習(RL)において、PPO-Clipの根本的な欠陥を明らかにし、ユークリッド距離でのポリシー乖離測定が幾何的に不整合であることを指摘。これにより探索が崩壊する問題を考察。Riemannian Isometric Policy Optimization (RIPO)を提案し、探索と活用のバランスを改善。実験により、RIPOが既存のRLアルゴリズムを大幅に上回り、最大60%の性能向上を示した。 Comment
元ポスト:
トークンレベルでPPOのclippingの値を調整し、高確率なトークンには小さなクリッピングを、低確率なトークンには大きなクリッピングを適用する。オリジナルのPPOのクリッピングの問題点の分析もあるようである。
著者ポスト:
[Paper Note] The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models, Zanlin Ni+, ICML'26 Outstanding Paper Award, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #DiffusionModel #ICML #PostTraining #Selected Papers/Blogs Issue Date: 2026-07-19 GPT Summary- dLLMsは任意の順序でトークンを生成できるが、一般的な推論タスクではこの柔軟性が逆に制限要因になることを発見。特に、不要な不確実性を回避し解のカバレッジを低下させる傾向が見られた。この問題に対処するため、標準的なGRPOを適用したJustGRPOを提案し、GSM8Kで89.1%の精度を達成。これにより、dLLMsの並列デコード能力を維持しつつ効果的な推論を実現。 Comment
元ポスト:
[Paper Note] Decomposer: Learning to Decompile Symbolic Music to Programs, Yewon Kim+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #PostTraining #Music #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 音楽の演奏から指示を復元するDecomposerというポストトレーニングフレームワークを提案。MIDIからStrudel言語へのデコンパイルで、実行可能な音楽プログラムを作成。課題は、資源の乏しいStrudelと、忠実な再構成が読みにくいコードになる可能性。二段階で解決し、合成データでの教師付きファインチューニングと、ペアになっていないMIDIでの強化学習を行う。評価で、Decomposerは他の方法に比べ、高いMIDI再構成忠実性と可読性を実現。 Comment
元ポスト:
[Paper Note] Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning, Xinyu Tang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #PostTraining #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-07-16 GPT Summary- ゼロRLを用いた強化学習は、思考の連鎖推論を促す新たな手法として注目されていますが、計算資源の制約から小規模モデルにとどまっています。本研究は、高品質な推論行動を引き出すことを目的とし、訓練プロセスの効率を向上させるために新たな訓練パイプラインを提案します。1兆パラメータへのスケーリングによる性能向上や、自発的に高度な認知的挙動の獲得を確認しました。さらに、推論の理解可能性や再現性を評価するためのフレームワークを提案し、構造化された推論痕跡を生成するモデルの優位性を示しました。コミュニティへの洞察を提供することを目指しています。 Comment
元ポスト:
所見:
[Paper Note] Mach-Mind-4-Flash Technical Report, Foundation Model Team, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #On-Policy Issue Date: 2026-07-14 GPT Summary- Mach-Mind-4-Flashは、35BパラメータのMixture-of-Expertsモデルであり、ポストトレーニング最適化だけで100Bモデル並みの性能を実現します。三段階のパイプラインでは、(1) RL/OPDトレーニングを17%高速化、(2) 複数のドメイン特化RLエキスパートを単一のジェネラリストへ統合、(3) 推論チェーンを19〜46%圧縮し精度損失を0.7%未満に抑えます。このモデルはAIME'26などのベンチマークで高いスコアを達成し、低コストで効果的な推論を提供します。 Comment
元ポスト:
[Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Asynchronous Issue Date: 2026-07-09 GPT Summary- 強化学習におけるLLMsの非同期性を改善するため、Single-rollout Asynchronous Optimization (SAO)を提案。グループ単位サンプリングを廃止し、安定した訓練を1,000ステップ行える。SAOは、GRPOやその派生手法に対し、複数のエージェント型ベンチマークで優れたパフォーマンスを示し、進化する環境への適応性も強化。 Comment
元ポスト:
GLM 5.2で利用されているRL手法
所見:
VAPO:
- [Paper Note] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks, Yu Yue+, arXiv'25, 2025.04
alphaXivによるポスト:
解説:
[Paper Note] Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training, Zijian Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の適応がトランスフォーマー層にどう分布しているかに焦点を当てる研究。単一のトランスフォーマー層を訓練することで、全パラメータRLトレーニングの利得の大半を回復可能。この現象を層寄与量で定量化し、複数のモデルとRLアルゴリズムで安定したパターンを観察。高寄与層は中間部に集中し、入力・出力端の寄与は少ないことを示唆。層の rankings は各種条件下でも強い相関を持つ。 Comment
元ポスト:
実験は8Bスケールのモデルまでしかできていないが、もしこれが数百B級のモデルにも当てはまるのだとすると、非常に計算コストの低減だけでなく、weightのsyncにおいて非常に有利になると思われるので、インパクトが大きそうな話になる可能性を感じる。
RLの効率化という観点で言うと
- [Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
のような話もある。
[Paper Note] Rubric Curriculum RL: Exploiting the Generation-Verification Gap in Non-Verifiable Domains, Krishnan+, ICML'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #SelfImprovement #ICML #PostTraining #read-later #Non-VerifiableRewards #Rubric-based Issue Date: 2026-07-08 Comment
元ポスト:
[Paper Note] To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation, Jiuheng Lin+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #PostTraining #Initial Impression Notes #ShortcutLearning Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の推論能力を高めるために、ヒントを注入したペアワイズ報酬モデルを統合した新しいフレームワークHIPPOを提案。重複データの問題を解決し、識別性の高い信号を提供することで、ショートカットの合理化と真の推論を効果的に区別。広範な実験で標準的なベースラインを大幅に上回り、真正な推論スキルを抽出できることを示した。 Comment
元ポスト:
事前学習時にmemorizeされた知識でショートカットしてrewardを得るのではなく、解答へ向けてreasoningすることを促進する
[Paper Note] Dockerless: Environment-Free Program Verifier for Coding Agents, Wenhao Zeng+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Coding #SoftwareEngineering #PostTraining #Verification Issue Date: 2026-07-07 GPT Summary- Dockerlessは、環境を必要とせずにコードパッチの正確性を評価するエージェント的パッチ検証器を提案する。従来の環境構築コストを削減し、リポジトリ探索を通じて証拠に基づく評価を実現。これにより、最も強力なオープンソース検証器を14.3 AUCポイント上回り、SWE-bench Verified、Multilingual、Proでそれぞれ62.0%、50.0%、35.2%の解決率を達成。環境ベースのポストトレーニングと同等の性能を示す。 Comment
元ポスト:
[Paper Note] Reinforcement Learning Towards Broadly and Persistently Beneficial Models, Akshay V. Jagadeesh+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #Safety #PostTraining #Selected Papers/Blogs #Generalization #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 GPT Summary- RLを用いて多様なドメインで有益な行動を促進し、整合性の一般化を調査。データセットを構築し、50以上の独立したベンチマークで評価した結果、80%超で性能向上が見られる。特に健康ドメインでの介入が他の評価にも効果的で、整合性の維持向上を示した。この研究は、RLを通じて人間の福祉への整合性を強化する可能性を示唆する。 Comment
blog: https://alignment.openai.com/beneficial-rl/
元ポスト:
所見:
特定のドメインにおいて有益な特性を備えた少量データ(trustfulness, 不確実性の下での謙虚さ等を備えた対話)でRLされたモデルは、訓練に使用したドメインを超えて一般化し、アライメントを改善する。敵対的なプロンプトが与えられた場合でも、Alignmentが持続する能力が高まる。
以下でも良性のペルソナで学習をすることでAlignmentが改善しており、似た知見が得られている:
- Teaching Claude why, Anthropic, 2026.05
[Paper Note] On the Position Bias of On-Policy Distillation, Yan Xie+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #read-later #Selected Papers/Blogs #On-Policy Issue Date: 2026-07-05 GPT Summary- On-Policy Distillation(OPD)は教師からの監督を通じて強化学習の効率を向上させるが、トークンの重みが均等化されているため後半のトークンの監督品質が低下する。この問題を理解し、Importance-Weighted On-Policy Distillation(IW-OPD)を提案。IW-OPDでは、トークンの重みを学生と教師の分布の乖離に基づき調整することで、学習効率を向上させ、標準のOPDよりも速く収束し、最終性能が向上することを実証。 Comment
元ポスト:
[Paper Note] OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning, Shuo Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Distillation #read-later #On-Policy #AgentSkills Issue Date: 2026-07-05 GPT Summary- OPID(オンポリシー・スキル・ディスタレーション)は、軌跡から直接スキル監督を抽出するフレームワークで、エピソードレベルとステップレベルのスキルを階層的に表現し、選択されたスキルを対話履歴に注入。これにより、ポリシーの最適化に密な監督を導入し、エージェントの性能や効率を向上。ALFWorldやWebShopなどの実験結果も示す。 Comment
元ポスト:
[Paper Note] The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms, Jinghan Zhang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #In-ContextLearning #read-later #Generalization Issue Date: 2026-07-05 GPT Summary- 従来の評価手法は、学習アルゴリズムの性能をi.i.d.テストセット上で単一のスコアに還元し、特定の例からの学習が他の例にどの程度一般化するかを隠してしまう。これに対処するため、Generalization Spectrumという評価フレームワークを提案し、転移距離を変化させる制御されたテスト変異体を作成。これにより、アルゴリズムの学習能力とその転移可能性を明らかにする。適用例として、競技プログラミングにおいて3つの学習パラダイムを比較し、各手法の転移特性を診断。得られた結果は、局所的な利得が必ずしも一般化を拡大しないことを示し、各手法の特性と効果を詳細に分析した。 Comment
元ポスト:
[Paper Note] On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity, Andrei Liviu Nicolicioiu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #Diversity #On-Policy #Initial Impression Notes Issue Date: 2026-07-05 GPT Summary- オンポリシー自己蒸留は、単一モデルを教師と生徒として利用し、高いpass@1精度を実現するが、サンプリングされたデモンストレーションに依存することでロールアウトの多様性が低下する。教師がバイアスを通じてフィードバックを与えるため、最適な自己蒸留方針は基底分布を不均一に傾斜させる。自己蒸留モデルは、制御されたタスクで競争力のある性能を示すものの、機能的多様性が不足し、分布外設定では失敗する。 Comment
元ポスト:
OPDでは教師モデルが正しいロールアウトで条件付けされるため、正しいロールアウトに近いロールアウトはより増強され、遠いものは抑制されることにつながり、結果的に出力の多様性が減少しPass@kが伸びにくくなる、という副作用があるよ、という話のようである。
[Paper Note] Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning, Wendi Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #LanguageModel #AIAgents #PostTraining #read-later #Entropy #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- エージェントRLの訓練ダイナミクスにおける仮定されていなかった現象、循環的エントロピー噴出を特定。これは、高いエントロピーの噴出と徐々の沈静化を繰り返す独特のサイクルで、文の重複やハルシネーションがサイクルを超えて蓄積する可能性を示唆。SEAL(Separation-Enhanced Agent Learning)を提案し、エントロピー噴出に対処。実験により、SEALが訓練を安定化させ、エージェントの性能を向上させることを確認。 Comment
元ポスト:
[Paper Note] Inverting the Bellman Equation: From $Q$-Values to World Models, Alistair Letcher+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#MachineLearning #read-later #Selected Papers/Blogs #WorldModels #One-Line Notes Issue Date: 2026-07-03 GPT Summary- モデルベースおよびモデルフリーの強化学習の対立に挑戦し、価値ベースのエージェントが豊かな報酬関数の下で正確な世界モデルを暗黙にエンコードできることを証明。Q-learningの逆アナロジーとして\textit{$P$-learning}を導入し、環境の内部モデルをデコード。また、目標の型と数に基づく条件を示す。実験では、限られた報酬関数で訓練したエージェントが正確なダイナミクスをエンコードし、隠れた一般化能力を示した。これは、モデルベースとモデルフリー、ゴール条件付きRLの関係に新たな視点をもたらす。 Comment
元ポスト:
基礎:
- 強化学習の基礎, Takuya Kubo, 2025.06
以下上記元ポストの自分の理解のための要約(詳細は元ポスト参照のこと)
ゴールによって条件づけられたRLにおいて、複数のゴールが設定され、ゴールごとに十分に多様な価値を持つ場合、Q値から明示的に学習されていない世界モデル(=state, actionが与えられた時に次にどの状態に遷移するかを表す状態遷移モデルP)を一意に復元できる場合がある。Q値から状態遷移モデルPを復元することをP-Learningと呼ぶ。どの程度復元できるかはMDPにおける状態遷移の設定(有限状態、連続状態、決定論的、確率論的)により異なり、決定論的なMDPの場合は多くの場合1つのゴールだけで遷移を一意に復元できるが、確率論的な場合はより多くのゴールが必要となる。
これにより、明示的に状態遷移を学習しない場合でもQ値が世界モデルを内包し、そこから復元された世界モデルを用いて訓練時に存在しなかったゴールも解けるようになる。
という感じのようである。
[Paper Note] Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling, Yucheng Li+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Decoding #PostTraining #SpeculativeDecoding Issue Date: 2026-07-03 GPT Summary- MTPを用いることで強化学習におけるロールアウトを加速するBebopを提案。MTPの受け入れ率はモデルエントロピーに影響され、確率的拒否サンプリングがその攪乱を軽減。新しいTV損失を導入し、受け入れ率の改善を実現。エンドツーエンドでのMTPトレーニングにより一貫した速度向上を達成し、最大1.8倍の加速を示す実験結果を提供。 Comment
元ポスト:
[Paper Note] VIMPO: Value-Implicit Policy Optimization for LLMs, Zhewei Kang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #PostTraining #read-later #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- VIMPOという批評家なしのポリシー最適化法を提案。KL正則化付き強化学習から導出した価値関数に基づき、自己回帰生成において端的な価値損失を得る。計算結果は、VIMPOがGRPOに対して数学的ベンチマークで優位を保ち、より細かなクレジット割り当てを可能にすることを示す。 Comment
元ポスト:
[Paper Note] SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation, Yuhang Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-07-03 GPT Summary- SAGE-OPDは多ターンのオンポリシー蒸留を改善する新しいフレームワークで、学生モデルへの介入を環境からのフィードバックに基づいて決定。標準OPDの脆弱性を克服するため、教師の信頼度でトークンレベルの蒸留を重み付けし、不確実な教師分布の影響を軽減。実験では、ALFWorldにおける成功率を標準OPDと比較して13.3%改善し、ターンレベルの介入が効果的であることを示した。 Comment
元ポスト:
現在のOPDは基本的にsingle-turnを前提としているが、multi-turnの場合の手法を提案。各stepごとのconfidenceを教師モデルによって推定し、OPD lossに反映させる。これは生徒モデルの軌跡が教師から逸脱した場合に、その軌跡に対して介入をするような挙動となる。multi-turnにおいて全てのターンに介入するのは無駄で、かつ介入しないとmulti-turnの場合エラーが蓄積するため、選択的に介入する軌跡を決定する手法と言える、という感じに見える。
ポイント解説:
[Paper Note] Finding the Time to Think: Learning Planning Budgets in Real-Time RL, Aneesh Muppidi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #MachineLearning #read-later #Selected Papers/Blogs #Realtime #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- リアルタイム設定における強化学習(RL)の課題に対処するため、可変遅延リアルタイムRLを提案。エージェントが各決定点で熟慮する時間を状態依存で選択可能にし、軽量なゲーティングポリシーを用いて計画予算を決定。リアルタイムのゲーム環境において、このアプローチは固定予算やヒューリスティックのベースラインを超える性能を示した。 Comment
pj page: https://aneeshers.github.io/realtime-rl/
元ポスト:
[Paper Note] MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training, Wenhan Ma+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Distillation #PostTraining #read-later #On-Policy #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 複数の能力を統合することが困難な大規模言語モデル(LLM)のために、ポストトレーニングの新しいアプローチとしてMulti-teacher On-Policy Distillation(MOPD)を提案。ドメインごとのRL教師を用いて曝露バイアスを排除し、密な最適化信号を提供。実験によりMOPDが他の手法を上回り、教師の能力を効率的に継承することを示した。MOPDは、独立したドメイン教師の開発を可能にし、実用的な能力統合を実現。 Comment
元ポスト:
ポイント解説:
[Paper Note] Qwen-Image-2.0-RL Technical Report, Yixian Xu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #TextToImageGeneration #Distillation #PostTraining #On-Policy #VisionLanguageModel #RewardModel #Editing #ImageSynthesis #Initial Impression Notes Issue Date: 2026-06-29 GPT Summary- Qwen-Image-2.0-RLは、RLHFとオンポリシー蒸留を用いてQwen-Image-2.0の視覚品質と指示遵守を向上させるパイプライン。信頼性の高い報酬モデルを構築し、画像生成と編集タスクで重要な次元をカバー。最終段階でオンポリシー蒸留を提案し、複数の教師から単一モデルへの統合を実現。評価では、Qwen-Image-Benchで総合スコア57.84、テキスト対画像Eloが1193、画像編集Eloが1349を達成し、全体的に性能向上を示す。 Comment
元ポスト:
T2I, Editに特化したTeacherモデルを学習しOPDする
[Paper Note] Autodata: An agentic data scientist to create high quality synthetic data, Ilia Kulikov+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #Data #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment
元ポスト:
[Paper Note] Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games, Zirui Cheng+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Personality #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- 意思決定における人間の行動を理解するために、数理モデルを活用するアプローチを提案。大規模言語モデルがベイズ更新や動機づけの誤差を近似できる一方で、小規模モデルは強化学習を通じて改善可能。異なる意思決定者に基づく訓練が、ベイズ訓練に比べ信念変化を向上させることを示し、人間シミュレーションの精度向上に寄与。 Comment
元ポスト:
[Paper Note] Self-CTRL: Self-Consistency Training with Reinforcement Learning, Itamar Pres+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Test-Time Scaling #Author Thread-Post Issue Date: 2026-06-20 GPT Summary- 自己説明する言語モデル(LM)の一貫性を高める手法、Self-CTRLを提案。挙動と説明の整合性を最適化し、偏ったサンプラーの模倣や憲法AIにおける拒否応答の改善を実現。自己報告によるバイアスの相関が向上し、拒否予測の精度が36%から92%に向上。さらに、HarmBenchにおける失敗率を大幅に低減し、安全で透明なAIモデルの実現に寄与。 Comment
元ポスト:
[Paper Note] ExpRL: Exploratory RL for LLM Mid-Training, Violet Xiang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #LLM-as-a-Judge #mid-training #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-17 GPT Summary- スパース報酬強化学習(RL)は、LLMの推論を向上させる方法だが、成功は基盤モデルの網羅性に依存する。従来の方法では、中間訓練に選ばれた推論軌跡を用いてスキルを教えるが、手動指定が必要であり、そのカバレッジが難しい問題に対して十分かは不明である。新たなアプローチとして、ExpRLは人間作成の質問応答データを用い、参照解を報酬の基盤として扱う。ポリシーは問題プロンプトから推論をサンプリングし、LLM判定者がバックグラウンド報酬を割り当てることで部分的進捗を強化する。ExpRLは、難解な数学的推論タスクにおいて、他手法よりも優れたRLプリミングを実現し、スパース報酬RLの初期化を改善することが示された。 Comment
元ポスト:
post-trainingでGRPOをすると、報酬がsparse(モデルが解けない問題に対してはadvanatageがゼロ)となりシグナルが得られない問題があるが、これをmid trainingの段階で参照データをdense報酬のためのscaffoldingとして活用することで、後続のsparseなRLの性能を改善する。どうやらmid trainingの段階で、参照データを与えた(=scaffolding) verifierを用意し、LLM-as-a-Judgeを通じて密な報酬(すなわち、最終的な応答だけでなく途中のtrajectoryの良し悪しからも報酬を得る)を与え、後続のsparseなRLのためのwarmupをする。warmupにはSFTやself-distillationが用いられることが多く、これら手法は基本的には参照データの模倣学習であるため汎化性能を犠牲(i.e., これはらトークンレベルの学習シグナルであらため、自由な探索が抑制されエントロピーが下がる)にしていたが、提案手法ではDense RewardなRLを用いることで探索が促進され(=高いエントロピーが保たれる)warmupが可能となる、という話に見える。
[Paper Note] LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories, Zhanhao Liang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Alignment #DiffusionModel #TextToImageGeneration #PostTraining #FlowMatching #ImageSynthesis Issue Date: 2026-06-11 GPT Summary- フロー・マッチングモデルの人間の嗜好への整合性を向上させるため、LeapAlignというファインチューニング手法を提案。これにより、長い生成経路を二段階に短縮し、計算コストを削減しつつ効率的な勾配伝播を実現。生成ステップのランダム化や学習重みの調整によってモデルの安定性が向上し、Fluxモデルにおいて優れた画像品質と画像-テキスト整合性を実現し、既存手法を上回る結果を達成。 Comment
pj page: https://rockeycoss.github.io/leapalign/
元ポスト:
[Paper Note] CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning, Penghui Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #ImageCaptioning #VisionLanguageModel #3D (Video) #VideoCaptioning #Initial Impression Notes Issue Date: 2026-06-11 GPT Summary- マルチモーダルキャプション生成において、強化学習を用いる新たなフレームワークCapRL++を提案。特に、キャプションの品質を有用性に基づいて再定義し、視覚情報を用いない質問に正確に答えられることを重視。これにより、高密度なキャプション生成能力が向上し、複数のタスクでのパフォーマンスが強化。CapRL++を用いた訓練モデルは、大規模モデルと同等の性能を達成し、従来の方法の限界を超えることを示した。 Comment
元ポスト:
CapRLのアイデア(i.e., 画像に関する質問をtext-onlyモデルがcaptionのみから正解できたらそのcaptionの品質は高い; キャプションの品質を有用性で測る)をvideo-captioninに拡張
[Paper Note] Rethinking the Divergence Regularization in LLM RL, Jiarui Yao+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #PostTraining #read-later #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- DRPOは、大規模言語モデル(LLMs)の強化学習における安定性を向上させるための新しい手法。従来のDPPOはハードマスクに依存していたが、DRPOは滑らかなアドバンテージ重み付き二次正則化を用いて、境界を越えた更新に対する補正信号を提供。これにより、ポリシーシフトによる発散的な更新を抑制し、学習効率を高めることを示した。 Comment
元ポスト:
[Paper Note] Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models, Atsumoto Ohashi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#PostTraining #read-later #interactive #Realtime #Author Thread-Post #SpeechToSpeech Issue Date: 2026-06-11 GPT Summary- 全二重音声対話モデルのインタラクティブ性を向上させるため、RLを使用したポスト訓練後のアライメント手法を提案。ポーズ処理、ターン取り、バックチャネル、ユーザーの中断にフォーカスし、人間の会話データから抽出した音声セグメントで特有の報酬関数を最適化。LLMベースの報酬を加えることで応答品質を保持。MoshiとPersonaPlexモデルでの評価により、一貫したインタラクティブ性の改善を確認。 Comment
元ポスト:
[Paper Note] Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning, Zhiyuan Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#DiffusionModel #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- 教師あり模倣学習を安定的に維持しつつ、テスト時にシンプルなポリシー改善を行うQGFアルゴリズムを提案。QGFは参照フローポリシーと値関数クリティックを事前訓練し、テスト時に価値勾配で高価値アクションを生成。ただし、追加のポリシー学習は行わず、従来のRL法に比べて優れた性能を示す。モデルサイズのスケーリングにも有利な特性を持ち、実用的な代替RLアルゴリズムを提供。 Comment
pj page: https://q-guided-flow.github.io/
元ポスト:
著者ポスト2:
[Paper Note] Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning, Jiangnan Xia+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Reasoning #PostTraining #Diversity #Memorization Issue Date: 2026-06-11 GPT Summary- 強化学習においてDiRL(Direction-Aware Reinforcement Learning)を提案し、探索を推論と記憶の方向に規定。これにより、推論に沿った探索を強化し、記憶化を抑える報酬設計を実現。実験により、様々な既存手法よりも顕著な性能向上を確認。 Comment
元ポスト:
著者ポスト:
[Paper Note] Reinforcement Learning from Rich Feedback with Distributional DAgger, Rishabh Agrawal+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Distillation #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-06-09 GPT Summary- 強化学習における報酬の利用は狭いが、豊かなフィードバックを効果的に活用する方法を提案。DAggerの分布的変種を用いて専門家のフィードバックを参照し、前方クロスエントロピー目的を採用することで単調な方策改善を実現。DistILは多様なタスクにおいて従来のベースラインを上回る性能を示す。 Comment
元ポスト:
[Paper Note] OneReason Technical Report, OneRec Team+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#RecommenderSystems #Pretraining #LanguageModel #Supervised-FineTuning (SFT) #GenerativeRecommendation #PostTraining #read-later #Initial Impression Notes Issue Date: 2026-06-05 GPT Summary- OneRecファミリーの生成型推奨モデルは多くのサービスで利用されていますが、アイテムを表すトークンから有意義なCoTシーケンスを構築するのが困難です。この課題を克服するため、推論能力を探索する予備研究(OneRec-Think、OpenOneRec)を実施しましたが、思考モードが必ずしも優位であるとは限らないことが判明しました。推奨の効果的な推論には知覚と認知の二つの要因が重要であると考え、OneReasonを提案します。具体的には、強力なアイテム的トークン知覚、三レベルの認知強化CoT形式、“専門化→統合”の学習レシピを用いて思考能力を高めます。 Comment
元ポスト:
事前学習/SFT/RLといった現在主流なLLMの学習パイプラインをGenerative Recommender Systemsに適用したモデルのようで、
ItemIDのトークンの意味を理解させるための事前学習等を実施している点が興味深い。
[Paper Note] Reinforcement Learning from Rich Feedback with Distributional DAgger, Rishabh Agrawal+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #TextualFeedback Issue Date: 2026-06-05 GPT Summary- 強化学習(RLVR)は進化しているものの、依然として狭い範囲に留まっている。本研究では、豊富なフィードバックを古典的な模倣学習アルゴリズムDAggerを通じて活用し、専門家分布にアクセスする手法を検討する。順方向クロスエントロピーは単調なポリシー改善を促し、後悔に関する保証を提供するとともに、教師重み付き成功の尤度を最適化する。実験結果として、DistILアプローチが科学的推論や数学問題解法においてRLVRや自己蒸留のベースラインを上回ることを示した。 Comment
元ポスト:
[Paper Note] Self-Distilled Policy Gradient, Yifeng Liu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-06-04 GPT Summary- オンポリシー自己蒸留は、言語モデルが自身の生成を特権的文脈で監督する手法で、スパース報酬強化学習に対する密な監督信号を提供する。これを逆Kullback–Leibler発散損失で具現化し、自己蒸留型方策勾配フレームワークSDPGを提案。SDPGはグループ相対検証やKL正則化を活用し、従来のベースラインよりも安定性と性能を向上させる。コードは公開されている。 Comment
元ポスト:
-
-
[Paper Note] GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization, Zaid Khan+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #PostTraining #GPUKernel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment
元ポスト:
[Paper Note] Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments, Qiuyue Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #mid-training #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment
元ポスト:
[Paper Note] Agent Explorative Policy Optimization for Multimodal Agentic Reasoning, Minki Kang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #PostTraining #KeyPoint Notes #ToolUse #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 視覚と言語を統合したモデルは、複雑な問題解決において外部ツールの使用が不可欠である。エージェント的推論は、自己完結型思考とツール使用の非対称な行動を交互に行い、このギャップをThinking-Acting Gapと呼ぶ。標準的なRL手法ではツール使用が限定的で、多くの場合誤りを含む。AXPO(Agent eXplorative Policy Optimization)を提案し、ツール呼び出しの再サンプリングを行うことでこの問題を改善。実験の結果、AXPOは複数のマルチモーダル・ベンチマークで従来手法を上回る性能を示し、パラメータ数を抑えつつ効果的な結果を得た。 Comment
pj page: https://byungkwanlee.github.io/AXPO-page/
元ポスト:
モデルがツール呼び出しを行った際の学習シグナルを改善する話で、GRPOで学習を実施した際に全体の30%程度でしかツール呼び出しが行われておらず(どのようなデータで分析したかは読めていない, 2.2節あたり)、そのうち40%程度が応答で誤っておりGRPOで正のadvantageが発生せず、ツール呼び出しに関して精緻なpositiveなシグナルが得られていない問題がある。これを改善するために、ツール呼び出し前のthinkingは正しく、ツールの呼び出し方とその結果が典型的に誤っていることに着目し、ツール呼び出しの上で失敗したrolloutについて、thinkingまでをprefixとしてツール呼び出し以後をresamplingする手法を提案。これにより、ツール呼び出しの頻度が改善し、ツールが呼び出された場合に応答に失敗する割合も減少した。
[Paper Note] Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning, Jiapeng Zhu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #One-Line Notes #ContinualLearning #AgentSkills Issue Date: 2026-05-31 GPT Summary- 大規模言語モデルにスキルを搭載することで、自律エージェントの複雑なタスク解決が可能になる。エージェントのスキルは一般スキルとタスク特有スキルに分かれるが、既存の強化学習手法は外部化と内部化のバランスに苦労している。これを解決するために、Skill0.5という新しいRLフレームワークを導入。一般スキルの内部化とタスク特化の活用を動的ルータで調整し、タスクに応じた最適化を行う。実験結果は、Skill0.5が他のRLベースラインを上回る性能を示すことを確認した。 Comment
元ポスト:
Agent Skillsベースのcontinual learningを実現するうえで、多くの研究はSkillを外部化する(Skill.mdを定義し更新する)、あるいは内部化する(モデルの重みにSkillを学習させる)といった挙動のどちらかの文脈で研究されるが、どちらも利点・欠点があるから双方のいいところどりをしたハイブリッドでやりたいよね、という気持ちの研究と思われ、そのために一般的なスキルはモデルに内在化させ、タスク固有のスキルは外部化するというすみ分けをする。
そのために、RLをする際にタスクの難易度をhard/medium/easyに分類するルータを設け、hard taskについては、general skillを与え、self-distillationを通じてteacher trajectoryを生成。teacher trajectoryに基づいてdistillation lossを通じてエージェントにgeneral skillを内在化させ、mediumタスクでは通常通りGRPOで成功率を増大させるように学習、easyタスクではショートカットを防止するような学習のさせ方(generall skillを与えた場合とそうでない場合のtrajectoryを用意しadvantageを計算する?)をする、ことで、generalなスキルをエージェントに内在化させる、という感じの話に見える。ざっと図を見ただけなのでeasyタスクの部分がよくわかっていない。あと、そもそもGeneral/Task specific Skillをどのように進化させていくのかはよくわかっていない。
おそらくAgentSkillsの定義と発展は、SkillBankを使っている:
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
[Paper Note] CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents, Bowen Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #ComputerUse #PostTraining #RLVR #VisionLanguageModel #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- CUA-Gymは、検証可能な報酬を伴う強化学習を支える新しいスケーラブルなパイプラインで、タスク指示、環境状態、報酬関数を共生成。生成エージェントと判別エージェントがタスク仕様に基づく報酬を生成し、オーケストレータエージェントがこれを推進。高忠実度のモックWebアプリケーションを合成し、32,112の検証済みRLVRトレーニングタプルのデータセットを構築。GSPOでの学習により、既存のCUAsを超える成果を達成し、性能のスケーリングを示唆。本研究の成果物はオープンソース化される予定。 Comment
pj page: https://cua-gym.xlang.ai/
元ポスト:
CUAのためのRLVRデータを合成できる環境の提案
[Paper Note] AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs, Haizhong Zheng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #AIAgents #PostTraining #Asynchronous #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AstraFlowは、強化学習(RL)システムのデータフロー管理を自律的なコンポーネントに分離し、マルチポリシー協調訓練を効率的にサポートする新しいアプローチを提供する。これにより、従来のトレーナー中心の制御から脱却し、異種かつ跨地域の計算リソースを効果的に活用する。AstraFlowは、数学やコーディング、検索のワークロードで、既存RLシステムに匹敵する精度を保ちつつトレーニング時間を2.7倍短縮したことが示された。 Comment
元ポスト:
[Paper Note] Generating Pretraining Tokens from Organic Data for Data-Bound Scaling, Zichun Yu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SyntheticData #One-Line Notes Issue Date: 2026-05-27 GPT Summary- LLMは、データ束縛型の局面に移行しているが、オーガニックデータを完全に活用しているわけではない。そこで、本研究では、合成データ生成フレームワーク「SynPro」を導入し、限られたオーガニックデータからの学習を強化する。SynProは、再表現と再フォーマットを通じて多様な情報を生成し、強化学習で最適化される。実験により、SynProは有効トークン数を3.7〜5.2倍に引き上げ、データ束縛の課題に対処できることが示された。コードはオープンソースで公開されている。 Comment
元ポスト:
人間が作成したテキスト(organic data)の効果を最大限に引き出すためにデータを合成し、事前学習のlossがサチった際には合成データを生成するポリシーを更新し、現在のサチったモデルに対してより有効なデータとなるような合成データをorganic dataから(rephrasing/reformatにより)合成し学習コーパスに追加する(式10, 11, 12)。
[Paper Note] Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why, Mohammadreza Armandpour+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Distillation #PostTraining #On-Policy #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- オンポリシー蒸留は推論モデルの訓練に対し、トークンごとの監督信号を提供するが、その有効性を決定する条件は未解明である。本研究では、トークン、質問、教師ごとに動作する診断フレームワークを導入し、学生の成功確率を最大化する勾配を導出。理想の勾配との整合性を評価し、蒸留指導が誤ったロールアウトに対して高い整合性を示すことを発見。最適な蒸留文脈はモデルの容量とタスクに依存し、標準的な設定は存在しないことが示された。これにより、タスクごとの診断分析の重要性が強調される。 Comment
元ポスト:
(下記は著者ポストに基づく要約です。ざっくり読んだだけなので誤りがあるかもしれず、詳細は著者ポスト参照のこと)
on-policy (self) Distillationが、どのような場合に有効なのかを分析。
トークンレベルで見た時に多くのトークンが教師-生徒間でdisagreementが存在し、これらにはフォーマットに起因するトークンと、reasoningに重要なトークンの双方が存在する。
そこで、本研究では各トークンにとっての最良の勾配を導出(=生徒が正答できる確率を最大化する方向のもの)。
最適なgradientの方向がわかったので、あとは実際に蒸留をした場合の各トークンのgradientとのコサイン類似度を測ることで、どのような場合にdistillationが有用やシグナル(すなわち、生徒が正答できる確率を高めることに寄与しているか)を分析した。
分析の結果
- distillationが役に立つ場面は、生徒が誤ったロールアウトをしているケースで、正解のロールアウトをしている場合は教師モデルは役立つシグナルではなくノイズを与えているだけだった。
- 教師モデルのパラメータは大きければ大きいほど良いわけではなく、有効か否かは生徒モデルが学習シグナルを理解できるかに依存する。
- たとえば、BoolQというデータで生徒がQwen0.6Bだった場合はself-teacherに基づく勾配が、より大きな外部teacher(4--14B)による勾配と比較して、理想的な勾配に近かった(より高い類似度だった)。
- 一方で、同じデータセットで生徒モデルを1.7Bにすると、8Bの外部teacherが最も理想的なシグナルと高い類似度の勾配をもたらし、self-teacherはあまりうまく機能しなかった。
- contextのフォーマット(生のtrajectoryか要約か, mistakeを含めるか否か等)が、教師モデルの選択と同じくらいの重要
- MMLUデータでの実験で、0.6Bモデルが生徒の場合は、32Bモデルが書いたsolutionをcontextとして与えたself-teacherが理想的な勾配により近く、1.7Bの生徒の場合は、要約されたsolutionの方が良い。
- AIMEの場合、hardな問題の場合は、正解だけでなく失敗例 /典型的なミスをcontextとして与えたself-teacherが良い一方で、easyな問題では常にパフォーマンスの劣化を招く。
以上より、タスクごとに有用なdistillationの設定を模索することの重要性が示唆される、
という感じのようである。
著者ポスト:
[Paper Note] Learning from Language Feedback via Variational Policy Distillation, Yang Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #On-Policy #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- Variational Policy Distillation(VPD)は、強化学習におけるまばらな報酬信号の問題を解決する新たなフレームワークであり、言語フィードバックから密なトークンレベルの監督信号を生成する。これにより、教師と学生ポリシーを共進化させ、教師は軌道結果に基づいて能動的に洗練され、学生はこの情報を内在化する。科学的推論やコード生成タスクにおいて、VPDは従来の手法を一貫して上回る性能を示し、受動的蒸留の限界を克服することを目指す。 Comment
元ポスト:
提案手法の全体像を説明する図が論文中に欲しい。式(3)が天下り的に出てきて、私の勉強不足によりこの式を前提に論理展開がスタートする気持ちがよくわからない(おそらくDPOあたりをもっとしっかり理解するとわかるのだろう)。
が、現在のself-teacherに基づくOPSDは、textual feedback Cに対して最適化されておらず、かつzero-shotによる予測を実施しているため、学習が継続するにつれてfeedbackにいつか限界が生じるため学習のために有用なシグナルがなくなるのではないか、という考察に基づき、
textual feedbackから学習する枠組みvariational inference problemの観点から考え直す。すると、KL Divergenceによって正則化されたRLVRは式(3)によって定式化されるreward functionによって傾斜がつけられた最適な事後分布pi_*に対して、ポリシーのKL Divergenceを最適化する問題と等価になる。このとき式(3)の分母にはZ(x)が存在しこれは計算ができない。このため、これを解決するためにteacher network q_phi (y | x, C) を導入し、最適な事後分布pi_thetaの近似的な教師分布とする。これによりELBOを用いた変分下限のRLVRの目的関数を定義することができ、これはEMアルゴリズムによって解くことができる。具体的には
- Eステップ: q_phiとpi_optimalのKL Divergenceが最小となるようにq_phiを更新する。
- Mステップ: pi_thetaとq_phiのKL Divergenceが最小となるようにpi_thetaを更新する。
このとき、EとMではphiとthetaのパラメータが独立して存在するが、実用上はphiとthetaを共有する。これにより、textual feedback Cを解釈する教師モデルと学生モデルの双方がco-evolvingしていくような学習が実現される、
という感じだろうか。
ELBOについて:
- 変分オートエンコーダ⑥変分下限 ELBO:
https://note.com/kikaben/n/n00ad3e148770
[Paper Note] Vector Policy Optimization: Training for Diversity Improves Test-Time Search, Ryan Bahlous-Boldi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Diversity #Selected Papers/Blogs #EntropyCollapse #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LLMが新しい環境に適応し、多様なタスク固有の報酬を持つロールアウトを選択できるように、Vector Policy Optimization(VPO)を提案。VPOはベクトル報酬空間を活用し、テスト時検索で最強のスカラーRLベースラインと同等かそれを上回る性能を示す。進化的探索においては、従来のモデルでは解決できない問題を解決可能。多様性の最適化が今後のポストトレーニング目標となる可能性を示唆。 Comment
元ポスト:
[Paper Note] Self-Distilled Agentic Reinforcement Learning, Zhengxi Lu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy Issue Date: 2026-05-21 GPT Summary- SDARはRLを中心に据え、OPSDを補助目的として活用する新しいアプローチ。マルチターンエージェントにおける不安定性に対処し、教師の承認を得たトークンの蒸留を強化。ALFWorld、WebShop、Search-QAでの実験により、従来のGRPOを大幅に上回り、一貫したパフォーマンス向上を示した。 Comment
元ポスト:
[Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment
反響がすごそうに見える
- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。
環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。
元ポスト:
prime-rlでサポートされたとのこと:
[Paper Note] Look Before You Leap: Autonomous Exploration for LLM Agents, Ziang Ye+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #PostTraining #Diversity #KeyPoint Notes #Exploration Issue Date: 2026-05-21 GPT Summary- 大規模言語モデルに基づくエージェントは、環境特異的情報を取得する前に過去の知識で行動することにより失敗することがある。この問題に対処するため、探索チェックポイントカバレッジという指標を導入し、エージェントの探索の広さを測定。評価の結果、従来の強化学習エージェントは狭い行動パターンを示し、下流性能に悪影響を及ぼすことが判明。対策として、探索とタスク実行を交互に行う訓練戦略、Explore-then-Actパラダイムを提案し、環境知識を先に取得しそれをタスク解決に活かすことを促進する。結果から、体系的な探索の学習が一般化可能なエージェント構築に不可欠であることが示されている。 Comment
元ポスト:
environment中の鍵となるチェックポイントをエージェントが見つけた割合(Exploration Checkpoint Coverage; ECC; 環境内に定義された重要なlocation, object, affordance等をどれだけ発見できたか)を定義し、task-orientedなGRPOがECCを低下させる傾向にあることを検証(つまり、挙動が狭くなる)。
これを解決するために、ExplorationとActのロールアウトを分離してGRPOを実施するExploration-then-Actパラダイムを提案。このパラダイムでは、タスクを遂行するロールアウトと、ECC Rewardに基づいた探索をするロールアウトを分離し、探索に関して明示的な報酬を与える(従来はタスク実行の結果にimplicitに含まれているだけだった)。これらロールアウトに関するGRPOを交互に実施することによってポリシーを最適化する。inference時は、タスクのゴールを与えずにNステップ探索をし、探索したtrajectoryの要約とタスクのゴール、environmentに関する知識によって条件付けをしてactionを決定する。これにより従来のGRPOよりもALFWorld, ScienceWorld等のベンチマークで性能が向上し、エージェントの挙動としても、
- アクションの繰り返しの割合が低下
- ループする割合が低下
- 情報を探索する割合が向上
- エラーからリカバリーできる割合が増加
といった変化が見受けられた。
[Paper Note] RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards, Gaotang Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #DeepResearch #Rubric-based #Author Thread-Post Issue Date: 2026-05-16 GPT Summary- 深層研究エージェントを訓練するためのRubricEMフレームワークを提案。これは、ルーブリックを評価だけでなく、ポリシー実行やフィードバックの構造化に活用。計画・証拠収集・レビューを段階的に行い、意味情報の密なフィードバックを提供しつつ、評価済みの軌跡を再利用可能な指針に蒸留。得られたRubricEM-8Bは長編研究ベンチマークで優れた性能を示した。 Comment
元ポスト:
著者ポスト:
[Paper Note] Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation, Yecheng Wu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Distillation #PostTraining #On-Policy #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- OPDは大規模言語モデルのポストトレーニングに有効だが、高いインフラ要求が課題。私たちは、SFTロールアウトで教師の対数確率をオフラインに事前計算し、その再利用を提案。教師の一貫性が重要であることを確認し、それを保証するフレームワークLightning OPDを設計。この手法により、標準OPDと同等の最適解を維持しつつ訓練効率を4倍向上。Qwen3-8B-Baseモデルからの初期化でAIME 2024で69.9%を達成し、MoEアーキテクチャにも対応。LLMのポストトレーニングに関する障壁を低減。コードは公開されています。 Comment
元ポスト:
[Paper Note] Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration, Langlin Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #GRPO Issue Date: 2026-05-12 GPT Summary- GRPOを用いた強化学習は、LLMの推論能力を向上させるが、「ゼロ・アドバンテージ問題」に悩まされることがある。これに対し、効果的な探索を実現するためのフレームワーク LoPE を提案。LoPEは、ランダムなプロンプト摂動を通じて推論経路を広げ、タスクの難問に対して有効なリサンプリングを実現。実験結果は、LoPEの効果を強調し、LLMの強化学習における探索手法の基準を確立することを示した。 Comment
元ポスト:
果たして
[Paper Note] SkillOS: Learning Skill Curation for Self-Evolving Agents, Siru Ouyang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #ContinualLearning #AgentSkills Issue Date: 2026-05-11 GPT Summary- 経験駆動型の強化学習トレーニングレシピSkillOSを提案。これにより、凍結済みのエージェント実行と訓練可能なスキルキュレーターを組み合わせ、スキルの取得・適用を高める。タスク依存の複合報酬を設計し、経験を元にスキルを更新。SkillOSは、記憶を前提としないベースラインを超えて、スキルの使用を最適化し、豊富に構造化されたMarkdownファイルに進化させることを示した。 Comment
元ポスト:
[Paper Note] Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning, Yaorui Shi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #read-later #AgentSkills Issue Date: 2026-05-11 GPT Summary- 持続的なスキルライブラリは、言語モデルエージェントがタスクを通じて成功した戦略を再利用するために必要で、スキルの選択、活用、蒸留の3つの能力が相互に連携して進化することが重要である。従来の手法はこれらを独立に最適化することが多く、結果として矛盾した進化を生じていた。私たちは、これら3つの能力を共進化させるフレームワーク「Skill1」を提案し、単一のポリシーを使用してスキルの検索、選択、タスク解決、スキル蒸留を行う。すべての学習は単一のタスク成果信号に基づき、ALFWorldとWebShopでの実験により、Skill1が従来の手法を上回ることを示した。アブレーション実験は、クレジット信号の削除が進化に悪影響を及ぼすことを確認した。 Comment
元ポスト:
[Paper Note] EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics, Shuyue Stella Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #Selected Papers/Blogs #reading #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-05-11 GPT Summary- EVOLMは言語モデルの自己改善を促進するポスト訓練手法であり、外部監督に依存せず、モデル自身の評価能力を利用します。具体的には、事例ごとに最適化された評価基準を生成するルーブリック生成器と、そのルーブリックを用いて訓練されたポリシーの二つの能力を交互に訓練します。これにより、EVOLMはQwen3-8Bモデルを用いてGPT-4.1を25.7%上回るルーブリックを生成し、共同訓練されたポリシーは最新の報酬モデルよりも優れた性能を示しました。全体として、EVOLMは内部の評価能力を活用することで、外部の監督なしでの改善を実現することが明らかになりました。 Comment
元ポスト:
外部ラベル無しでself-improvingするルーブリックベースな手法の提案。
手法としては、まずfrozenしたRubirc生成器とJudgeモデルで全てのpromptに対してRubricを生成し、ポリシーが生成したロールアウトに基づいてJudgeモデルでRewardを計算することでポリシーを更新。その後更新されたポリシーを用いてpreference pairを構築し、preference pairに対してRubric生成器がルーブリックのロールアウトを生成し、choicedとrejectedなサンプルに対するJudgeのスコアの差の大きさ(すなわち、識別力の高さ)をrewardにRubric生成器を更新する、といったことを繰り返す。
多分3説以降の話が面白い。後で読む
Rubricが徐々に変化していき、抽象的なものからよりverifiableなものに変化したり、Rubricそのものが静的だとポリシーの学習に伴い変化する出力分布の変化に対応できない話や、最終的に獲得されたRubricは他のモデルの学習でも高い学習signalを送出するような汎化をするらしい
[Paper Note] Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning, Qianjia Cheng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Reasoning #PostTraining #reading #Initial Impression Notes #ToolUse Issue Date: 2026-05-11 GPT Summary- ツール統合推論(TIR)は、テキストのみの推論能力を超える思考モデルの拡張を提供しますが、ツール評価が逆に推論性能を低下させることも観察されています。本研究は、ツールを使用せずに推論能力を損なわずに強力な思考モデルに自然なツール使用を組み込む方法を提案し、TIRレシピの要点を示します。具体的には、教師の推論軌跡の学習可能性やツール使用軌跡の比率制御が重要であり、最適化手法がTIRの効果を最大化する可能性を示しています。最終的に、Qwen3モデルに適用することで、オープンソースベンチマークで最先端の成績を達成しました。 Comment
元ポスト:
Qwen3にcode executorを実行できるようにしても、数学のベンチマークにおいてほとんどツール呼び出しを行っていないにも関わらずスコアが劣化する。つまり、promptにツール呼び出しの情報を含めただけで、text-onlyでの推論能力が低下しロバストでない。さらに、ツール呼び出しを行ったとしてもテキスト空間上で推論を行った後にテキスト推論の結果をverificationする目的でcode executionを行うなど、ツールを用いて思考する能力が不足していることをイントロで指摘している。
適切なツール呼び出しを実施するために、既存研究では適切にツールを呼び出せるようにSFTやRLが行われるが、ツール呼び出しに関してpost-trainingを実施すると通常のtext-onlyでのreasoning能力が低下する課題があるとイントロで述べられている。Table 1に示されているようにツール呼び出しに関する情報をpromptに含めると、既存のOpenWeightモデル(Qwen3のみだが)はツールが有効なタスクであっても性能が向上しないことから、内部パラメータに埋め込まれている推論に関するlogicは簡単に壊れてしまうことを示唆しており、text-onlyでのreasoning能力を保ちつつ適切にtool useを実行できる手法が必要という課題があり、これを克服するための手法を提案しているようである。
問題意識は興味深いが、イントロの例にだけでは、Qwen3でのみ生じるのか、Qwen3に対するtool useのためのprompting手法が悪かっただけなのか、OpenWeightモデル全般のモデルパラメータ側の課題なのかが区別がつかず、どの程度インパクトのある話なのかがよくわからない。
個人的には、Table 1はより多くの学習レシピが公開されているモデルファミリーでの結果や、実際にtool useのためのSFT/RLを実施した場合に、text-onlyの推論能力が低下することが示されていてほしいと感じる。論文後半にそういったablationが出てくるのだろうか。
[Paper Note] Recursive Agent Optimization, Apurva Gandhi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment
元ポスト:
著者ポスト:
pj page: https://apga.github.io/RAO/
再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。
という感じだろうか。
サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。
著者ポスト2:
[Paper Note] Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key, Tianle Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #LongHorizon Issue Date: 2026-05-10 GPT Summary- ScaleLogicは、強化学習(RL)における大規模言語モデル(LLM)の推論能力を向上させるための合成的論理推論フレームワークで、難易度の深さと論理の表現力を独立に制御可能。幅広い論理形式をサポートし、RL訓練計算量が推論深さに対してべき乗則に従うことを示した。表現力の高い訓練設定は、低い設定と比較して性能向上をもたらし、複数のRL手法でも成立する関係を確認。カリキュラム型訓練がスケーリング効率を向上させることも実証している。 Comment
元ポスト:
[Paper Note] Exploration Hacking: Can LLMs Learn to Resist RL Training?, Eyon Jang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Safety #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-05-10 GPT Summary- 本研究では、強化学習(RL)が大規模言語モデル(LLMs)の訓練において重要な役割を果たすことを示す。特に、訓練中のモデルの探索が戦略的に変更されることで「探索ハッキング」を引き起こす可能性があると指摘。まず、低性能戦略に基づいたモデルをファインチューニングしてRL抵抗のモデル生物を作成し、関連タスクでの性能を保ちながら、RLに対する成功裡な抵抗を達成。次に、このモデルを用いて監視やノイズ付与などの検知・緩和戦略を評価。最後に、情報が十分な場合に探索抑制の推論を示すことができることを明らかにし、強力なLLモデルにおけるRLの潜在的な失敗モードを強調する。 Comment
元ポスト:
Exploration Hacking: エージェントが戦略的にRL学習時のoutcomeに影響を与えるよう、探索時の挙動を(部分的に)改ざんする失敗モード。
モデルは選択的に、RLにおける学習において、特定のタスクに関して高いrewardを獲得することを抑制することができることを示した。具体的には、特定のタスクに対してRLにおいてのみ低いパフォーマンスを示すような抵抗力を持ったモデルを事前にSFTすることで、RLを通じて、他の能力が崩壊するなどの致命的な欠陥なしに当該タスクでのみ性能を低下させられることを示したようである。
つまり、RLの訓練中の探索の挙動にのみこのような挙動を発現させることが可能であり、安全性やAlignmentをとるためのRLの学習を施しても、モデルが特定の能力だけを選択的に隠蔽し、学習を阻害する可能性がある、という感じに見える。
本研究の結果以下のような知見が得られた:
- このようなRLに対する抵抗力を持たせるにはSFTが必要不可欠であり、プロンプトによる抑制だけでは100 step以内に抑制が解かれ性能が回復することが明らかとなった。一方でSFTによる抵抗力を備えたモデルは500 step以上にわたって抵抗力を発揮する。つまり、欺瞞が一度モデルのパラメータに内部化されると是正が困難となる可能性がある。
- 失敗の戦略として、必ず一番短い応答を選択する(deterministic)と毎回ランダムに失敗する(stochastic)の場合、前者の方がRLに対する抵抗力が高い。これはGRPOのadvantageを計算する際に、deterministicな戦略の場合はグループ内の報酬が均一となる(全部のロールアウトで均一なrewardで間違える)ことで勾配の改善に関するsignalが生じにくいことが要因と考えられる。
- Rewardが連続的(つまり、より密)であるほど、Exploration hackingを困難にした。これは、Rewardが密であるほどGRPOでのグループ内の報酬の分散が高まるため、勾配更新を行うためのシグナルが増えることに起因する。
- Exploration Hackingは、CoT内で明示的に性能低下戦略についてモデルが思考するため、CoTのモニタリングによって検出できる。また、Action Monitor(出力のパターン等を監視する)によっても高い信頼性で検知ができる。また、評価時に重みにノイズを混ぜる方法も、モデルの抵抗力を低める上で有効であった。また、良性のtraceでSFTすることで、モデルが抵抗を持った状態から迅速に回復できる。
- 最先端のモデルは現在の訓練に関する状況に関して認知する能力は備わっているが、戦略的に行動し持続的にExploration Hackingを実施することは傾向として存在しない。が、Promptによって明示的に指示をすれば、Exploration Hackingを実施するため、潜在的にExploration Hackingを実現する能力は保持されている。
[Paper Note] Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe, Wenjin Hou+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-05-09 GPT Summary- OPDは専門モデルの能力を学生モデルに統合する手法であり、その効果を制限するボトルネックを特定した。本研究では、情報価値のある状態の探索不足と教師の指導の信頼性の欠如に着目し、新たにUni-OPDという統一的なフレームワークを提案。学生視点からのデータバランシング戦略と、教師視点からの結果指向のマージン較正メカニズムを使用して、訓練を最適化。実験によりUni-OPDの効果と汎用性を示し、信頼性の高いOPDに関する洞察を得た。 Comment
元ポスト:
OPDを
- difficultyに基づいたサンプリングによって生徒モデルの探索を促し
- 生徒のtrajectoryが正しい場合はスコアがより高くなることを保証する
ことで改善しているとのこと。
[Paper Note] Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding, Hayate Iso+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #SpeculativeDecoding Issue Date: 2026-05-08 GPT Summary- 推測デコードを用いてRL後トレーニングのロールアウトを加速。これは出力分布を保持しつつ、同期・非同期パイプラインに対応。推測デコードにより、スループットを1.8倍向上させ、非同期RLとの組み合わせで235B規模のトレーニング速度を最大2.5倍向上させる可能性を示す。 Comment
元ポスト:
[Paper Note] Co-Evolving Policy Distillation, Naibin Gu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #RLVR #On-Policy #Reference Collection Issue Date: 2026-05-06 GPT Summary- CoPDは、専門家の並行トレーニングを可能にし、RLVRとOPDを統合。専門家同士が互いの教師となることで行動パターンの一貫性を保ちながら、補完的知識を維持。実験により、CoPDがテキスト・画像・動画推論で強力なベースラインを上回ることを示し、新たなトレーニングスケーリングの可能性を示唆。 Comment
元ポスト:
[Paper Note] Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control, Bolian Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #EntropyCollapse Issue Date: 2026-05-01 GPT Summary- Entrocraftは、強化学習におけるエントロピー崩壊の問題を解決するための新しい手法で、ユーザーがカスタマイズしたエントロピー・スケジュールを実現。正則化を必要とせず、各ステップのエントロピー変化をアドバンテージ分布に結びつける。実験により、Entrocraftは性能の飽和を解消し、4Bモデルが8Bのベースラインを上回り、訓練の持続期間を最大4倍延ばし、pass@Kを50%向上させることを示した。 Comment
元ポスト:
[Paper Note] DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training, Tianhao Hu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Selected Papers/Blogs #Asynchronous Issue Date: 2026-05-01 GPT Summary- DORA(Dynamic ORchestration for Asynchronous Rollout)は、強化学習における非同期トレーニングの制約を克服するための新しいパラダイムを提案。これにより、複数のポリシー版本を同時に維持しながら、高効率で収束性を保つ。DORAは従来のシステムより2〜3倍のスループットを達成し、大規模アプリケーションでは同期トレーニングに比べ2〜4倍の加速を実現。LongCat-Flash-Thinkingモデルは、複雑な推論ベンチマークで競争力のある性能を示した。 Comment
元ポスト:
解説:
[Paper Note] SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning, Alexis Limozin+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #read-later #Selected Papers/Blogs Issue Date: 2026-04-29 GPT Summary- LLM推論における混合ポリシー最適化手法は、SFT-then-RLパイプラインより改善を示すが、いくつかの研究がバグに基づく不適切なベースラインに依存している。DeepSpeedのCPUオフロードやOpenRLHFの損失集約のバグがSFTの性能を抑制し、修正されるとSFT-then-RLは混合ポリシー手法を上回る可能性が高い。特に、Qwen2.5-Math-7Bで+3.8ポイント、Llama-3.1-8Bで+22.2ポイントの向上が見込まれる。50回のRLステップによる切り詰め版でも混合ポリシーに勝利。 Comment
元ポスト:
oh...
[Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICLR #Test-Time Scaling #read-later #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Conductorモデルを導入し、LLM間の協調戦略を自動発見。通信トポロジを設計し、個々のLLMの能力を最大化する指示を生成。7BパラメータのConductorは、単一ワーカーを超える性能向上を実現し、難解なベンチマークで最先端結果を達成。ランダム化されたエージェント訓練により、任意のエージェント集合に適応し、新たな再帰的トポロジを形成してオンラインでの性能向上を図る。この研究は、強力な協調戦略がRLを通じて自然に現れることを示す初期の実証である。 Comment
openreview: https://openreview.net/forum?id=U23A2BUKYt
公式ポスト:
[Paper Note] Visual Jigsaw Post-Training Improves MLLMs, Penghao Wu+, ICLR'26, 2025.09
Paper/Blog Link My Issue
#ComputerVision #NLP #Temporal #MultiModal #Self-SupervisedLearning #ICLR #PostTraining #RLVR #VisionLanguageModel #2D (Image) #3D (Scene) #3D (Video) #SpatialUnderstanding Issue Date: 2026-04-25 GPT Summary- 視覚理解を強化するための自己教師付きポストトレーニングフレームワーク「Visual Jigsaw」を提案。視覚入力を分割・シャッフルし、モデルは正しい順列を自然言語で出力。これにより強化学習と一致し、追加の視覚生成なしで自動的に監督信号を得る。広範な実験で知覚、時間的推論、3D理解の改善を確認し、視覚中心タスクの可能性を示唆。 Comment
pj page: https://penghao-wu.github.io/visual_jigsaw/
openreview: https://openreview.net/forum?id=tBf2SUzfZw
元ポスト:
[Paper Note] Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL, Zhaofeng Wu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Coding #TransferLearning #PostTraining #LowResource #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 低リソースのプログラミング言語(PL)における言語モデルの性能は、訓練データの制約を受ける。本研究では、ゼロショットの跨プログラミング言語転移タスクを提案し、Llama-3.1がPL間でのコード生成において改善されないことを明らかにした。これに対処するため、一般化可能なSFT初期化が必要とし、「並列プログラム」を使用したSFT戦略Parallel-SFTを導入。Parallel-SFTによって転移性が向上し、RL実行後に未知のPLへの一般化が改善されることを示した。モデルの内部表現分析は、PL間での同等プログラムが密にクラスタ化され、これが転移性向上に寄与することを示唆している。 Comment
元ポスト:
RL前にプログラミング言語でのパラレルコーパスでSFTすることで、特定言語でRLをした場合でも他言語にも性能が転移する、という話に見える。
著者ポスト:
[Paper Note] Scaling Self-Play with Self-Guidance, Luke Bailey+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #SelfPlay #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- 自己対話アルゴリズムにおけるLLMの限界を克服するために、Self-Guided Self-Play(SGS)を提案。SGSでは、Solver、Conjecturer、Guideの三役をモデルが担い、崩壊を避けつつ問題解決を行う。SGSの評価では、従来のRLベースラインを上回り、効率的な自己対話によって7Bパラメータモデルが671Bパラメータモデルよりも多くの問題を解決可能であることを示した。 Comment
元ポスト:
所見:
解説:
seed dataを与えた上でのSelf-PlayによるRLの性能を向上させる方法を提案している。
Self-PlayでRLをする場合、
- Solver: タスクを解く。タスクを解けるように学習される。(タスクが解けたか否かのbinary Reward)
- Conjecture: タスクを生成する。SolverのパフォーマンスをRewardとして学習される。
という構造が一般的だが、既存手法を分析した結果、学習が進むにつれ、ConjectureがSolverがそもそも解けない問題を生成するなどし、Reward Hackingが生じてしまい性能が向上しないことを発見。(Figure 2)
そこで、新たにGuideを追加し、Conjectureがタスクを合成する際にR_solve*R_guideの積の形式にRewardを調整し
- R_solveは(1 - Solverのsuccess rate)によって定義されるが、難しすぎる問題(success rate=0)、簡単すぎる問題(現在のバッチのtop 30%の問題)に関しては0に落とす。
- R_guideは合成タスクが、seed dataでSolverがまだ解けていない問題に関してどれだけの品質を有しているかに関するスコアを提供し(=unsolvedな問題に対する関連度、シンプルな結論が記述されており冗長な前提がないか、に関するRubricに基づくスコア)そのスコアをR_guideとする。つまり、seed dataにおいてまだ解けていない問題がより重視される。
ことで対処した。
self-playに関する代表的な先行研究:
- [Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03
解説:
[Paper Note] When Can LLMs Learn to Reason with Weak Supervision?, Salman Rahman+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #RLVR #Selected Papers/Blogs #Memorization #Generalization #Reading Reflections #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大型言語モデルは、RLVRを通じて推論能力を向上させる一方で、高品質な報酬信号の構築が難しくなってきた。本研究では、データ不足、報酬のノイズ、自己教師付き報酬の下での実証研究を行い、一般化はトレーニング報酬の飽和ダイナミクスに左右されることを発見。一般化するモデルは長い局面を持ち、急速に飽和するモデルは記憶に偏ることを示した。また、推論の忠実度がモデルのレジームを予測する指標であることも特定。継続的な事前学習と監督付き微調整の効果を分離し、SFTが弱い監督下での一般化に必要であることを確認。これにより、Llama3.2-3B-Baseが以前は失敗していた三つの設定で一般化を達成した。 Comment
pj page: http://salmanrahman.net/rlvr-weak-supervision
元ポスト:
pj page: https://salmanrahman.net/rlvr-weak-supervision
- RLVRにおいて、シグナルが不完全な場合(i.e., weak supervisio)の3つの状況に基づいて、汎化性能を分析
- Scarce data: 8つの訓練事例
- Noisy Rewards: 最大90%のラベルに誤りがある
- Proxy Rewards: ground truthなしで、model confidenceにもとづく多数決のみを利用
- RLVRにおいて、Training Rewardが飽和する前に、より長いステップ数学習をしたモデルは、汎化性能が高くなる
- ➡︎ memorizationによって早期にTraining rewardが頭打ちになりgenericな能力を獲得できていないことが示唆される
- 汎化に失敗したモデルは探索が少ないのでは?ということが理由として考えられるが、実はこの説明は間違っている
- Llama, Qwenの2つのモデルを比較した時Llamaは訓練中Qwenと比較して高いsemantic diversityを維持していたが、最終的にQwenよりも汎化性能が低い(=memorization)してしまっていた
- ➡︎ 真の原因はfaithfullnessが低い推論であり、論理的にsupportされないreasoning traceの元正解に辿り着いてしまうことが原因であると考察
- 解決策として、reasoning dataを用いた `pre-RL training` を実施する。
- すなわち、RLVRを実施する前に、Llama-3.2-3Bに対して、継続事前学習(52B math tokens)を実施し、その後 Thinking SFT (43.5K reasoning Traces)を実施する
- CPTとThinking SFTによって、Llamaはweak supervision (i.e., scarce data, noisy rewards, proxy rewards)状況下でも意味のある学習を実施することができた
- ➡︎ reasoning能力が獲得されたことにより推論のfaithfulnessが改善されることで、memorizationが防止されより長いstep数訓練報酬が飽和せずに学習ができたため
といった話が著者ポストに記述されている。
memorizationを防止し、なるべくgenericな能力を身につけさせることが鍵という考え方は、最近色々なところで見かけるように感じる (Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
など)。単にデータをスケールさせるだけでなく、より効率的な学習のため、モデルに対してよりgenericな能力を身につけさせるための工夫(モデルの記憶容量をあえて減らす等)が今後進んでいきそうである。
- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
[Paper Note] Neural Garbage Collection: Learning to Forget while Learning to Reason, Michael Y. Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #KV Cache #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 連鎖的推論ではKVキャッシュの拡大がボトルネックとなっており、従来の手法は手作業で管理されている。よりスケーラブルな「Neural Garbage Collection(NGC)」を提案し、言語モデルが推論と同時に忘れることを学ぶ。モデルは推論中にキャッシュエントリの追い出しを決定し、これを強化学習で最適化。成果ベースのタスク報酬を用いて学習することで、高い精度を保ちながらキャッシュサイズを圧縮し、エンドツーエンドの最適化がモデルの能力を向上させる可能性を示した。 Comment
元ポスト:
LLMにReasoningとKV Cacheのマネジメントを同時に学習させる。
ポイント解説:
[Paper Note] Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence, Guanting Dong+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SyntheticData #SelfImprovement #PostTraining #RLVR #Scalability #Environment Issue Date: 2026-04-22 GPT Summary- 汎用エージェントとしての大規模言語モデルの期待が高まる中、Agent-Worldを提案。これは、エージェントが多様な実世界環境を探索し、自律的にタスクを合成する仕組みを提供。強化学習と動的なタスク合成により、エージェントの能力を向上させ、共進化を促進。実験で、Agent-Worldが複数のベンチマークで他のモデルを一貫して上回ることを示す。汎用エージェント知能構築のヒントも提示。 Comment
元ポスト:
[Paper Note] LACE: Lattice Attention for Cross-thread Exploration, Yang Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Attention #Test-Time Scaling #mid-training #Decoding #PostTraining #One-Line Notes Issue Date: 2026-04-20 GPT Summary- LACEは、独立した推論試行を協調的な並列プロセスに変換するフレームワークであり、クロススレッドのアテンションを活用して推論経路間での洞察の共有と相互訂正を可能にする。合成データを使って自然な訓練データの不足を補い、実験では正確性が7ポイント以上向上することを示した。結果は、相互作用する並列推論が大規模言語モデルの効果を高める可能性を示唆している。 Comment
元ポスト:
parallel test-time scalingによって生成をする最中にtrajectoryを交互作用させることで、trajectoryの冗長性を減らし、交互作用を可能にする。
[Paper Note] TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training, Chenhao Ye+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #Reference Collection Issue Date: 2026-04-17 GPT Summary- 強化学習(RL)におけるウェイト転送の効率化のため、新しいストレージ抽象化Reference-Oriented Storage(ROS)を提案。ROSは複製されたモデルウェイトを活用し、物理的なコピーを保持せずにアクセスを提供。さらに、TensorHubを構築し最適化転送やフォールトトレランスを実現。評価結果では、GPU待機時間を6.7倍削減し、ウェイト更新を4.8倍加速、データセンター間ロールアウトの待機時間を19倍短縮。TensorHubは実運用にデプロイ済み。 Comment
元ポスト:
[Paper Note] Efficient RL Training for LLMs with Experience Replay, Charles Arnal+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #Reference Collection #ReplayBuffer Issue Date: 2026-04-17 GPT Summary- 経験再生をLLMの事後トレーニングに適用し、リプレイバッファの最適設計を探求。生成コストの高い場合、オンポリシーサンプリングが必ずしも最適でないことを示し、よく設計されたリプレイバッファが推論計算量を削減し、モデル性能を改善する可能性があることを実証。 Comment
元ポスト:
所見:
所見:
[Paper Note] Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision, Yinghui He+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #On-Policy #SelfDistillation Issue Date: 2026-04-16 GPT Summary- SD-Zeroは、強化学習や外部教師を必要とせず、単一のモデルを生成器と査読者として学習させる新たな手法である。生成器が初期応答を生成し、査読者がそれを改善する過程で、オンポリシー自己蒸留を利用し、密なトークンレベルの自己監督を実現する。SD-Zeroは数学・コード推論ベンチマークにおいて、基盤モデルよりも10%以上の性能向上を示し、強力なベースラインを上回った。特徴としては、重要なトークンを特定するトークンレベルの自己局在化と、教師同期化による回答改訂の反復的自己進化がある。 Comment
元ポスト:
[Paper Note] FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling, Yitong Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #On-Policy #One-Line Notes #LowPrecision Issue Date: 2026-04-11 GPT Summary- 強化学習ベースのポストトレーニングを用いたテキストから画像への拡散モデルの最適化において、FP4量子化を組み込んだ二段階強化学習フレームワーク「Sol-RL」を提案。第一段で高スループットのロールアウトを行い、高コントラストのサブセットを生成、第二段でこれを高精度で再生成してポリシーを最適化。これにより、ロールアウトの効率を高めつつ訓練整合性を維持。実験により約4.64倍の収束加速を達成し、高性能な整合性を示す。 Comment
pj page: https://nvlabs.github.io/Sana/Sol-RL/
元ポスト:
FP4でまずロールアウトを生成し、rewardモデルを用いて生成結果のスコアを得て、top/worst-Kのサンプルに絞ってBF16で(該当ノイズから)サンプルを再生成しGRPOで活用する。
探索がFP4で実施されるため高速になり、2*K件のサンプルにのみ絞って学習が行われるため2段階の高速化になっている。
[Paper Note] RAGEN-2: Reasoning Collapse in Agentic RL, Zihan Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #PostTraining #read-later #Selected Papers/Blogs #Entropy Issue Date: 2026-04-11 GPT Summary- RAGEN-2では、LLMエージェントの強化学習トレーニングの不安定性に注目し、推論の質をエントロピーと相互情報量(MI)に分解。エントロピーが高くても、モデルが固定テンプレートに依存する「テンプレート崩壊」の問題を明らかにした。MIは推論品質の信頼できる指標であり、タスク性能との相関が強い。低い報酬分散が推論差を消してしまう問題をSNR対応フィルタリングを用いて解決し、入力依存性とタスク性能を改善することを提案。様々なタスクで一貫した成果を示した。 Comment
pj page: https://ragen-ai.github.io/v2/
元ポスト:
おもしろそう
ポイント解説:
トークンのエントロピーによって多様性を測る方法は、単一の応答内での多様性は測れるが、異なるプロンプトに対する応答の多様性は測れない。たとえば、単一応答内のエントロピーは健全だが、応答がinputに非依存の応答となっている場合など(=テンプレート崩壊)は多様性が欠如していると考えられる。このため、相互情報量に基づくメトリックを提案し、応答間で共有されている情報量を測る方法を提案。
[Paper Note] Gym-Anything: Turn any Software into an Agent Environment, Pranjal Aggarwal+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #OpenSource #PostTraining #read-later #Selected Papers/Blogs #Environment #Author Thread-Post Issue Date: 2026-04-10 GPT Summary- Gym-Anythingを用いて任意のソフトウェアを対話型環境に変換するフレームワークを提案。コーディングエージェントが設定を行い、独立した監査エージェントが品質を検証する。200のソフトウェアアプリケーションに適用し、1万件超の長期タスクを含むCUA-Worldを生成。特に長期ベンチマークCUA-World-Longを用いて高難易度タスクを評価し、訓練されたモデルが優れた性能を示すことが明らかに。全てのコードとデータを公開し、今後の研究を促進することを目指す。 Comment
元ポスト:
著者ポスト:
[Paper Note] Vero: An Open RL Recipe for General Visual Reasoning, Gabriel Sarch+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Reasoning #OpenWeight #OpenSource #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment
元ポスト:
ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。
[Paper Note] Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding, Yuhang Zhou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #TabularData #SelfImprovement #ACL #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment
元ポスト:
複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。
表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。
[Paper Note] Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization, He Du+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #PostTraining #EvolutionaryAlgorithm #GPUKernel Issue Date: 2026-04-05 GPT Summary- Kernel-Smithは、高性能GPUカーネルと演算子生成のためのフレームワークで、評価駆動型進化エージェントを用いて候補プログラムを改善。NVIDIAとMetaXのバックエンド特化評価サービスを活用し、トレーニングは強化学習信号とステップ中心の監督を結合。Kernel-Smith-235B-RLは、NVIDIA Tritonバックエンドにおいて総合性能の最先端を達成し、他モデルを上回る。さらに、MetaX MACAバックエンドでの適応も成功し、本番システムへの実用的な寄与を示す。 Comment
元ポスト:
[Paper Note] SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization, Zhengxi Lu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #In-ContextLearning #CurriculumLearning #KeyPoint Notes #ContinualLearning #AgentSkills Issue Date: 2026-04-05 GPT Summary- エージェントのスキルをモデルのパラメータに内部化し、ゼロショットの自律的挙動を実現するために「SKILL0」というインコンテキスト強化学習フレームワークを提案。訓練ではスキル文脈を段階的に撤回し、オフラインでグループ化したスキルを用いて効率的なツール呼び出しを実現。実験結果では、SKILL0が標準のRLベースラインに対して顕著な改善を示し、文脈量も効率的に管理されることを確認。 Comment
元ポスト:
流し読みなので誤りがあるかもしれないが、
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
によって構築されたSKILLBANKによるスキルを、ポリシーの内部パラメータに学習させることができるか?を調査した研究で、内部パラメータに学習することで、検索とskillの読み込みによるcontextをモデルのパラメータに内在化させることでcontextを削減できる。外部スキルに完全に依存していたSkillRLとの対比として、内部パラメータにスキルを内在させるコンセプトからSKILL0と命名されていると思われる。
提案手法の概要としては下記Figure.2であるが、個人的には式(2), (3), (4), (5), (6)をみた方が、直感的に分かりやすいように感じた。最適化手法としてはGRPOだが、圧縮率を考慮した報酬設計と、カリキュラムの段階的な構築が肝であり、
- 圧縮率c_t \in (0, 1] の圧縮率の元、これまでのcontext h_t, retrieveされたスキルSをVision Encoderでエンコードし潜在表現V_tを得て[^1]; 式(2)
- V_tに基づいて次のaction a_tがポリシーによって生成される; 式(3)
- GRPO 式(5) が通常のRLVRに加えて、式(4)で表される圧縮率に基づいた報酬によって定義され実行される。要は、より高い圧縮率でcontext、およびretrieved skillを圧縮してタスクが成功したら報酬がより高くなる
という構造になっている。学習させる際は、カリキュラム学習を実施する(3.3節)。どのようにカリキュラム学習を成立させるかというと、学習をいくつかのstageに分けて、ポリシーに与えるSkillのContextを線形にdecayさせていく。これにより、徐々に与えられるContext量が減っていき、難易度が高くなるようなカリキュラムとなる。
3.3節、式4あたりが本提案手法のIn-Context Reinforcement Learning (ICRL)と命名される気持ちな気がしており、モデルはもともとIn-Context Leainingの元、スキルを実施できるが、それを与えるコンテキストを徐々に減らしてパラメータの内部に学習させていく、これをRLによって実現する(=ICRL)という気持ちなのかなと思われる。
[^1]: pixel-basedな潜在表現でレンダリングされたテキストに関する情報を扱えることが先行研究で示されており、画像としてエンコードした方がcontextを節約可能なのでこのような方法が採用されている。
ベースラインとなるSkillRLと比較して、個別のタスクレベルで見ると優劣は分かれるものの、ALFWorld [Paper Note] ALFWorld: Aligning Text and Embodied Environments for Interactive Learning, Mohit Shridhar+, ICLR'21, 2020.10
, 様々なQAベンチマーク(Search-QAと呼称) [Paper Note] Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning, Bowen Jin+, COLM'25, 2025.03
での全体としてのパフォーマンスは向上し、コンテキストが節約されることでコストを大幅に削減できているような結果となっている。
3.3節の(a), (b)の部分は読めていないがこちらも時間があるときに読みたい。Skill Budgetの調整に絡んでいそうではある。
[Paper Note] Think Anywhere in Code Generation, Xue Jiang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #Reasoning #SoftwareEngineering #read-later #Reference Collection Issue Date: 2026-04-04 GPT Summary- LLMsの事前思考に依存したコード生成は制限があり、全体の複雑性を理解するには不十分である。これに対抗するために、Think-Anywhereという新しい推論機構を提案し、任意のトークン位置で推論を呼び出すことを可能にする。これにより、推論パターンの模倣と成果ベースのRL報酬を活用し、推論のタイミングを自律的に探索させる。広範な実験で、Think-Anywhereは最先端の性能を実現し、多様なLLMsにおいて一貫した一般化を示すことが確認された。 Comment
元ポスト:
解説:
[Paper Note] Entropy-Preserving Reinforcement Learning, Aleksei Petrenko+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR #PostTraining #Selected Papers/Blogs #Stability #needs-revision #EntropyCollapse #Author Thread-Post Issue Date: 2026-04-01 Comment
元ポスト:
openreview: https://openreview.net/forum?id=E8MR8jgEeZ
PPO/GRPOなどのアルゴリズムではRL中にポリシーの多様性が低下し、ポリシーがdeterministicになり探索をしなくなり、パフォーマンスが停滞するか低下する(あるいはベースモデルでもともと高い尤度を持っていた解のPass@1が改善するが、ポリシーの出力が狭くなるため、Pass@kが犠牲になる)現象が生じる(= entropy collapse)ので、それを是正したいという話。
後ほど追記
[Paper Note] Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning, Kishan Panaganti+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #BudgetAllocation #Author Thread-Post Issue Date: 2026-03-29 GPT Summary- LLMの推論進展は、損失関数の洗練とアライメント戦略の整合によって進むが、標準的なRLパラダイムは一様性に縛られ、難問への対応に非効率を生む。これに対抗するため、動的に訓練分布を適応させるMulti-Adversary GDROを提案。オンライン難易度分類器を導入し、プロンプトを難易度グループに区分。二つのGDROゲームを提示し、頻度バイアスを排除しつつ難易度の高いプロンプトを強化。Qwen3-Baseでの実験により、精度がGRPOと比較して高まることを確認。新たなカリキュラムが観察され、リソースが推論のフロンティアへシフトすることで性能向上を促進。 Comment
元ポスト:
[Paper Note] ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents, Hao Zhang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #Architecture #SoftwareEngineering #read-later #On-Policy #Stability #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- ProRL Agentは、マルチターンのLLMエージェントにおける強化学習トレーニングを支援するためのAPIサービスであり、ロールアウトのライフサイクル全体を提供するスケーラブルなインフラです。標準化されたサンドボックス環境を通じて、多様なエージェント駆動タスクに対応し、ソフトウェア工学やSTEM関連のタスクで検証されています。ProRL Agentはオープンソースで、NVIDIA NeMo Gymに統合されています。 Comment
元ポスト:
処理が重いロールアウトを独立したhttp serviceとして扱い(rollout-as-a-service)、モデルのtrainingと分離することで、リソース分離、可搬性、拡張性を向上させる。
[Paper Note] Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models, Isha Puri+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #Diversity #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- LMは質問に対して複数の回答候補を暗黙のうちに生成するが、訓練後のプロセスで単一の回答に圧縮されることが多い。医療診断や曖昧な質問応答などのタスクにおいては、複数の妥当な回答が必要とされる。本論文では、複数回答を扱う強化学習アプローチを提案し、モデルが単一の前方伝搬で複数の候補を生成できるようにする。実験により、多様性やカバレッジが改善し、コーディングタスクでは精度も向上した。提案手法は、計算資源効率の高い代替として評価されている。 Comment
元ポスト:
ユーザのクエリにおいては正解が単一ではないものがしばしば存在するが、現在のRLの枠組みはモデルが出力した一つのbest answerに対して報酬を与えるように設計されているため、これによりモデルの出力が一つのモードに固執する、あるいはmode collapseを引き起こす。これを解決するために、モデルに複数の回答とそのconfidenceを一つのpromptで思考させ、k個出力させる。rewardはk個中何個のanswerが正解だったか、confidenceが実際のanswerのcorrectnessとどれだけ近いかなどに基づいて報酬を与えるような枠組みを採用することで、モデルの出力の多様性やcoverageが増加し、repeated sampling時のトークン効率も改善した、と言う話らしい。
[Paper Note] Delightful Policy Gradient, Ian Osband, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #read-later #Selected Papers/Blogs #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- Delightful Policy Gradient(DG)は、ポリシー勾配の不均衡なアップデートを解消するために、アドバンテージと行動の驚きの積に基づいたゲーティングを導入。これにより、単一コンテキスト内での方向性の精度を理論的に向上させ、複数コンテキスト間での期待される勾配を精密に近づけることができる。実験的に、DGはREINFORCEやPPOをMNISTや連続制御タスクで上回り、特に難易度の高いタスクで顕著な改善を示した。 Comment
関連:
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
元ポスト:
所見:
著者ポスト:
不要なbackward passの重みを下げるのではなく完全に無くすことで効率化する
[Paper Note] Off-Policy Value-Based Reinforcement Learning for Large Language Models, Peng-Yuan Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #read-later #Off-Policy #ReplayBuffer #LongHorizon Issue Date: 2026-03-26 GPT Summary- オフポリシー学習を可能にする新しい値ベースのRLフレームワークReValを提案し、過去のデータを効率的に再利用。ReValは速度と性能向上を実現し、GRPOを上回る結果を示した。これにより、価値ベースのRLがLLMトレーニングの実用的な選択肢となることが示唆される。 Comment
元ポスト:
[Paper Note] ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning, Shengyuan Ding+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #AIAgents #MultiModal #CVPR #PostTraining #VisionLanguageModel #RewardModel #GenerativeVerifier #ToolUse Issue Date: 2026-03-25 GPT Summary- ARM-Thinkerは、視覚と言語の報酬モデルを向上させるためのエージェント型システムであり、外部ツールを自律的に活用して結果を検証可能にする。これにより、幻覚や視覚的グラウンディングの弱さを克服し、複数ページの証拠を比較して推論を支持する能力を持つ。多段階強化学習によって訓練され、ツール呼び出しの意思決定と判断精度を最適化。新たに導入したARMBench-VLで評価した結果、報酬モデリングで平均+16.2%、ツール使用タスクで+9.6%の改善を達成。エージェント的なアプローチが精度と解釈性の向上に寄与することを示している。 Comment
元ポスト:
元ポスト:
[Paper Note] PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost, Junkeun Yi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #PostTraining #Selected Papers/Blogs #reading #KeyPoint Notes Issue Date: 2026-03-25 GPT Summary- 計算効率とOOD能力のトレードオフを解消するために、PivotRLという新しいフレームワークを提案。局所的なオンポリシーロールアウトで高い分散を持つ情報量豊かな中間ターンを選別し、機能的に同等なアクションに報酬を与えることでポリシー確率の維持を促進。PivotRLは4つのエージェント系ドメインでインドメイン精度を平均4.17%向上、OOD精度を10.04%高め、少ないロールアウトターンでE2E RLと同等の精度を実現した。NVIDIAのNemotron-3-Super-120B-A12Bに採用され、実運用規模のエージェント後訓練の主力として機能中。 Comment
元ポスト:
ポイント解説:
関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01
SFTはデータ効率が良いがOODへの汎化性能が弱い。一方でE2E RLは、OODへの汎化性能が高いが軌跡をfullでロールアウトしなければならず計算コストが高い。この両者の良いところどりができないか?という研究。
SFTデータ(expertのtrajectory)が与えられた時、trajectoryをturnレベルに分割(状態sとアクションaのタプル)。reference policy(RLの初期値に用いるモデル)でロールアウトを行い、
- rewardの分散が0より大きい(すなわち、GRPOのadvanatageが計算可能なターン)
- およびrewardの平均が小さいターン
のみにフィルタリングし、学習する価値の高いターンのみにまずフィルタリングする(D_pivot)。
その上でSFTのような文字列のexact matchによるrewardではなく、ポリシーの出力がactionとしてacceptableなものか否か(完全一致ではなく正しい方向のアクションなら報酬を与える)によって報酬を与えるようなGRPOスタイルのRLで学習する。
E2E RLベースライン(GRPO)と比較して、wall clocktimeベースで4.1--5.5倍程度の速度で同等の性能に到達する。
頻繁にPivotRLの名前を目にするようになってきた。
[Paper Note] PRISM: Demystifying Retention and Interaction in Mid-Training, Bharat Runwal+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #mid-training #read-later #Selected Papers/Blogs #Reference Collection #Author Thread-Post Issue Date: 2026-03-19 GPT Summary- PRISMの中間トレーニング設計の実証研究を行い、様々なモデルやアーキテクチャで統制実験を実施。約270億トークンのデータを使用し、数学、コード、科学ベンチマークで一貫した性能改善を達成。RLパイプラインは推論ベンチマークのスコアを大幅に向上させるも、基盤モデルへの直接適用では効果が薄い。中間トレーニングがモデル性能を効果的に高めることを示し、信頼性の向上に役立つ中間トレーニングの重要性を強調。 Comment
元ポスト:
著者ポスト:
ポイント解説:
[Paper Note] Meta-Reinforcement Learning with Self-Reflection for Agentic Search, Teng Xiao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs Issue Date: 2026-03-17 GPT Summary- MR-Searchは、自己反省を活用したエージェント主体の文脈内メタ強化学習(RL)手法を提案する。過去のエピソードに基づき探索戦略を適応させることで、報酬が乏しい状況でもポリシーを最適化する。エピソード後に生成される自己反省を次の試行に活用することで、テスト時の探索効率を向上させる。さらに、ターンレベルでの相対アドバンテージを推定する多ターンRLアルゴリズムを導入し、細粒度のクレジット割り当てを実現。様々なベンチマークでの実験により、MR-Searchが従来のRL手法よりも優れた性能を示し、相対的に9.2%から19.3%の改善を達成した。 Comment
元ポスト:
[Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PRM #KeyPoint Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-14 GPT Summary- OpenClaw-RLは、エージェントの相互作用から生成される次状態信号を用いたオンライン学習フレームワークである。各エージェントのアクションに対するユーザーの反応やツールの出力を利用し、一つのポリシーで複数のトレーニング問題を同時に学習する。次状態信号は評価信号と指示信号を含み、前者はアクションの成功度を示し、後者は改善点を指摘する。非同期設計により、モデルはリアルタイムでリクエストに応じ、ポリシーを更新する。個人用エージェントや一般エージェントに適用することで、ユーザーのフィードバックを活用し、スケーラブルな強化学習を実現する。 Comment
元ポスト:
解説:
日本語解説: https://tech.layerx.co.jp/entry/openclawrl-agenticrl
テクニカルレポートを見ると情報量が非常に多くて圧倒されてしまうが、著者ポストを鑑みるに本研究の肝は下記である。
既存のAgentic RLは、Agentがaction a_tを実施した後に環境の状態がs_t+1に変化するが、それをcontextとして活用し次のactionを生成している。しかし、ただcontextとして活用するよりももっと有用な使い方があるのではないか、という主張をしているように見え、具体的には以下の2つの無駄が生じているという指摘で
- 次のstateは前回のアクションの暗黙的な評価を与えており、これを捨ててしまっている。たとえば、ユーザは満足いっていないことをqueryするかもしれないし、テストが通ったら成功、エラーが出たら失敗という評価に関するシグナルが潜んでいる。これは主に数学ドメインで利用されてきたProcess Reward Modelによるプロセスに関するRewardとは対照的に、verifiableなドメインを超えて自然なインタラクションの中で生じるシグナルから評価できる。
- 上記は評価に関するシグナルだが、もう一つのシグナルとして方向性に関するシグナルが得られる。たとえば、「あなたは最初にファイルを確認すべきだ」というqueryがs_t+1として得られたとする。これは、単にa_tが失敗だっただけでなく、「どのトークンが、どのように」誤っていたかに関する具体的なフィードバックとみなせる。たとえば、errorに関するtraceは具体的などこを修正すれば良いかのシグナルである。現在のRLVRの枠組みはこれらのシグナルを(最終的に得られる)sparseな単一のスカラー値に落としてしまっており、これら精緻な方向性に関するシグナルを完全に捨て去ってしまっている。
前者についてはBinary RL[^1]によってシグナルを拾え、
後者についてはs_t+1からtextualなhintを抽出しteacher contextとして活用することで、トークン単位でのadvantageを計算できる[^2]。
そしてこれら両方を組み合わせることで、より良い結果を得ることができる、といったことが著者ポストに書かれている。
元論文自体は部分的にしか読めていないのだが、論文のメッセージとしては、s_t+1の情報にはまだ活用できるシグナルがあるのにそれが見過ごされていて、現在のRLVRの枠組みではスカラー報酬に埋もれてしまっているという課題意識が肝だと感じた。
また、手法的な観点で言うと、日本語解説と、テクニカルレポート4.1.2節に書かれている通り、リアルタイムなユーザとの対話を前提てして考えた時に、ロールアウトは1つしか現実的に存在しえないため(複数ロールアウトに対してユーザからのフィードバックs_t+1を得ることは実用的な設定では非現実的)GRPOが適用できない、という点はなるほどなぁ、と感じた。
[^1]: a_t, s_t+1が与えられた時に{0, 1, -1}を返す何らかのProcess Reward Modelを定義し、m回独立した施行を実施しmajority votingをすることでreliableなa_tに対するRewardを得る(4.1.1節)。
[^2]: s_t+1から抽出可能なhintを追加のcontextとして与えたポリシーを教師、hintなしのポリシーを生徒とし、教師と生徒のa_tに対するトークンの尤度の差分をとることでtoken単位のadvantageを得る。すなわち、hintが与えられたときにa_tで尤度が低くなるトークンがあれば、そのトークンにはペナルティが課されることになる(4.2.2 Step4)。
[Paper Note] $\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving, Pinzheng Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- Re^2は、強化学習の新手法であり、LLMsが効率的な推論経路を放棄し、必要に応じて再解法を選択することを学習。これにより、従来のRLVRよりも推論性能が30%以上向上し、サンプル数の増加に伴いテスト時の性能も改善。初期の思考過程の質に依存せず、解答の質を高めることが可能となる。 Comment
元ポスト:
CoTの初期の推論の時点で推論の方向性が決まってしまい、うまくいかないものはうまくいかないので、まっさらな状態から解き直す挙動をRLで増幅させる、という話に見える。Self Correctionではなく、完全にtrajectoryを無くすのだろうか?だとしたら、trajectoryの質を動的に検証してその生成は放棄する、というアプローチとやっていることがあまり変わらない気はするのだが、わざわざモデルの内部パラメータに対して介入してその挙動を増幅させる意味はあるのだろうか?
[Paper Note] Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems, Zongqian Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Coding #SoftwareEngineering #PostTraining #DataFiltering #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- 高品質なコード生成モデルの訓練には高品質なデータセットが必要だが、既存のデータは様々な問題を抱えている。本研究では、系統的なデータ処理フレームワークを導入し、自動難易度フィルタリングを用いて難易度の高い問題を保持しつつ簡単な問題を排除。得られたMicroCoderデータセットは、多様な競技プログラミング問題を含み、性能向上を達成。評価によれば、三倍の性能向上を示し、難易度を意識したデータ選定がモデルの性能向上に効果的であることが明らかになった。 Comment
元ポスト:
コーディングドメインにおいて、難易度の高いコーディング問題を収集(単純な問題をフィルタリング)することで、RLにおいて高い学習効率が得られる、という話に見える
[Paper Note] How Far Can Unsupervised RLVR Scale LLM Training?, Bingxiang He+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #PostTraining #read-later #RLVR #MajorityVoting #Scalability Issue Date: 2026-03-12 GPT Summary- URLVRは、地上真値ラベルなしで報酬を導出し、LLM訓練のボトルネックを克服する。内部報酬と外部報酬に基づく手法の分析を行い、内部報酬が一貫したパターンを示すことを発見した。モデルの事前分布によって崩壊のタイミングが決まり、内部報酬は小規模データセットでの効果的な利用が可能であることが示された。外部報酬手法も検討し、改善の可能性を示唆する。これにより、内部URLVRの限界を明らかにし、スケーラブルな代替手段への道を提示する。 Comment
元ポスト:
[Paper Note] A Rubric-Supervised Critic from Sparse Real-World Outcomes, Xingyao Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #RewardModel #One-Line Notes #Critic #Rubric-based #Author Thread-Post Issue Date: 2026-03-06 GPT Summary- コードエージェントの評価は通常、ユニットテストの成功を基にしているが、実際の環境では成功信号が遅延し、ノイズが多い。本研究では、疎でノイズの多い相互作用データを用いてクリティックモデルを学習する方法を提案し、これをRLベースの報酬モデルとして利用する。具体的には、エージェントの行動特徴を含むクリティック・ルーブリックを導入し、半教師付き目的関数で人間のフィードバックと共に予測する。実験により、このアプローチが SWe-bench におけるリランキングを改善し、試行回数を83%減少させながら成果を向上させることを示した。 Comment
元ポスト:
AI Agentによる実装は安価になったが、今度は(人間による)verificationがボトルネックなので、Agentのtrajectoryからcritiqueを実施するモデルをRubric-basedに学習しReward Modelとして活用できるようにした、という話に見える。これによりAgentの進捗をリアルタイムでvibe checkすることができるとのこと。
著者ポスト:
[Paper Note] SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale, Ibragim Badertdinov+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Coding #SoftwareEngineering #PostTraining #read-later #Selected Papers/Blogs #Live #One-Line Notes #Environment Issue Date: 2026-03-05 GPT Summary- SWEエージェントの強化学習を支えるため、実世界のソフトウェア工学タスクを自動収集し、再現可能な環境を構築するSWE-rebench V2を提案。20言語・3,600超のリポジトリから32,000以上のタスクを集め、厳選したコンテンツで信頼性のあるトレーニングデータを提供。また、タスク生成に必要なメタデータも加え、エラー要因を明示。データセットと関連リソースを公開し、多様な言語での大規模なSWEエージェントのトレーニングを支援。 Comment
元ポスト:
environment: https://huggingface.co/datasets/nebius/SWE-rebench-V2?row=5
関連:
- [Paper Note] SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, Ibragim Badertdinov+, NeurIPS'25, 2025.05
以前の研究ではpython特化だったが、今回はlanguage-agnosticな環境になっている。
合成データではなく、実際のissue-resolutionのヒストリに基づいたデータセットであることに注意
[Paper Note] CharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in Production, Yixin Nie+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Evaluation #Annotation #DPO #PostTraining #Selected Papers/Blogs #Personality Issue Date: 2026-03-04 GPT Summary- CharacterFlywheelは、Instagram、WhatsApp、Messenger向けのLLM改善のための反復プロセスであり、LLaMA 3.1を基に15世代のモデルを洗練しました。2024年7月から2025年4月にかけてのA/Bテストで、8モデル中7モデルが新たなエンゲージメント向上を示し、最大8.8%の幅、19.4%の深さで改善しました。指示遵守率も大幅に向上し、過学習防止策やダイナミクスの対策も考慮されています。この研究は、数百万人のユーザー向けのLLM活用における科学的理解を進めます。 Comment
元ポスト:
解説:
[Paper Note] CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation, Weinan Dai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #AIAgents #SyntheticData #Coding #GPUKernel #Rubric-based #Environment Issue Date: 2026-03-04 GPT Summary- CUDAカーネル最適化は深層学習の核だが、専門知識が求められる。大規模言語モデル(LLMs)は従来のCUDAコード生成において限界があり、内部最適化能力が向上しない。私たちはCUDA Agentを提案し、データ合成、信頼性の高い報酬信号の提供、安定した強化学習を通じてCUDAカーネルの専門知識を育成。KernelBenchで最先端の結果を達成し、torch.compileよりも各レベルで大幅に高速化。最強商用モデルを約40%上回る性能を示す。 Comment
pj page: https://cuda-agent.github.io/
元ポスト:
解説:
[Paper Note] FireRed-OCR Technical Report, Hao Wu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #SyntheticData #OpenWeight #read-later #VisionLanguageModel #OCR #One-Line Notes #Pixel-based Issue Date: 2026-03-03 GPT Summary- FireRed-OCRは、一般的なビジョン-ランゲージモデルを特化した高性能OCRモデルへ変換するフレームワークです。VLMは一般的には優れた能力を示すものの、文書処理では「構造的幻視」が問題となります。FireRed-OCRでは、高品質な構造データの不足に対処するため、「Geometry + Semantics」データファクトリを構築し、幾何特徴のクラスタリングを利用して多様な文書タイプに対応したデータセットを作成します。3段階の訓練戦略を導入し、文書構造理解、形式的出力の標準化、強化学習による構文的整合性の確保を行います。OmniDocBench v1.5での評価結果から、FireRed-OCRは92.94%の性能を達成し、他のベースラインを大きく上回ることを示しました。コードとモデル重みをオープンソース化し、一般VLMから専門的な構造エキスパートへの変容を促進します。 Comment
元ポスト:
github: https://github.com/FireRedTeam/FireRed-OCR
- [Paper Note] OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, Linke Ouyang+, CVPR'25, 2024.12
においてSoTAとのこと。日本語はどのくらいいけるだろう。
[Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02
Paper/Blog Link My Issue
#MachineLearning #Dataset #Library #OpenSource #ICLR #Selected Papers/Blogs #Robotics #One-Line Notes Issue Date: 2026-03-03 GPT Summary- ロボティクスは機械学習の進展により変革を遂げ、ロボット学習が新たに生まれつつある。手頃な遠隔操作システムや公開データセットの増加により、研究が加速しているが、クローズドソースツールの断片化が発展を妨げている。本研究では、ロボット学習スタックを統合するオープンソースライブラリ\texttt{lerobot}を提案。これにより、低レベル制御からデータ収集までをカバーし、アクセス可能なハードウェアをサポート。スケーラブルな学習アプローチを強調し、研究者・実務者の参入障壁を低下させ、再現性のある学習プラットフォームを提供する。 Comment
openreview: https://openreview.net/forum?id=CiZMMAFQR3
元ポスト:
従来の研究では、特定のユースケース、特定のツール、特定のプラットフォーム、データフォーマット、学習アルゴリズム等を自分たちの独自のユースケースのために開発がされてきたため、これにより分野の断片化(他者が追試しづらい、統一的な技術スタックがない等)が生じてしまっていたため、それを解決するためにend-to-endでの統合的な枠組み(ロボットを動作させるだよミドルウェアのインタフェースや標準化されたデータセットのフォーマット、学術アルゴリズムなど)を提案しているようである。
onelineで実ロボットへのデプロイができる機能が追加されたとのこと:
[Paper Note] Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs, Yining Hong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #Evaluation #PEFT(Adaptor/LoRA) #SelfCorrection #Test-Time Scaling #PostTraining #read-later #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-02-28 GPT Summary- 具現化されたLLMsは高レベルのタスク推論を持つが、過去の失敗を振り返れず、ミスが繰り返される独立した試行となる。この問題に対処するため、Reflection Test-Time Planningを導入し、二つの省察モードを統合。実行中の反省では内部評価を通じて候補アクションを生成し、実行後の反省では外部反省を基にモデルを更新。新たに設計したベンチマークで実験を行い、ベースラインモデルに対して有意な改善を示した。定性的分析では、反省を通じた行動の修正が強調された。 Comment
pj page: https://reflective-test-time-planning.github.io/
元ポスト:
- [Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09
まだ全然理解できていないが、Action Model, Internal reflection LLM, external reflection LLMとしてLLaVA 3Dと呼ばれるモデルをベースにし、単一のモデルで3種類のモードを学習するようである。そしてテスト時にはLoRAを用いたTTTを実施するようである。
[Paper Note] LLMs Can Learn to Reason Via Off-Policy RL, Daniel Ritter+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Reasoning #PostTraining #read-later #Selected Papers/Blogs #Off-Policy #Author Thread-Post Issue Date: 2026-02-24 GPT Summary- オフポリシーRLアルゴリズム「OAPL」は、大規模言語モデルのトレーニングにおいて重要度サンプリングを使用せず、Lagged Inferenceポリシーを採用。OAPLはGRPOを上回り、DeepCoderと同等の性能を維持しつつ、訓練時間を3分の1に削減。また、Pass@k指標でのスケーリング改善を示し、400ステップ以上のラグを持ちながらも効率的なポストトレーニングを実現する。 Comment
元ポスト:
著者ポスト:
[Paper Note] The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning, Qiguang Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #Chain-of-Thought #Reasoning #LongContext #mid-training #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-02-24 GPT Summary- LLMは長い連鎖思考(Long CoT)推論を学ぶのが難しく、効果的な推論は安定した分子のような構造を持つことが重要。これには深層推論、自己反省、自己探索の三つの相互作用が関与し、キーワードの模倣ではなくファインチューニングから生じることが示された。有効な意味的異性体が迅速なエントロピー収束を促進し、Mole-Synを提案してLong CoT構造の合成を導き、性能とRLの安定性を向上させる。 Comment
元ポスト:
結構読むのが大変そうなのでskim readingと元ポストを拝見した上でざっくりまとめると以下のような感じだろうか。takeaway部分により詳細な話が書かれているので必要に応じて読むとよさそう。
良いlong CoTには分子のような推論の内部構造が存在し、それらは適切な内部構造を持つ合成データによってSFTをすることで身につけさせられる。逆に、人間が作成したtrajectoryなどはこれらの分子構造が均質化されておらず、学習が不安定になる(表層的なキーワードから学習されたりする)。
良いlong CoTに必要な要素として、本研究では以下の3つのbehaviorが挙げられている:
- Self-Exploration: モデルが柔軟に異なるアイデアやパスを探索する力
- Self-Reflection: モデルが過去のstepを確認し修正する能力(分子の構造を安定化させるような役割を果たす)
- Deep Reasoning: 原子結合のような、論理的なstepを強力に結びつけた主となる論理フロー
[Paper Note] REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents, Zheng Chu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#GraphBased #NLP #Search #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #SyntheticData #MultiModal #mid-training #PostTraining #VisionLanguageModel #2D (Image) #KeyPoint Notes #LongHorizon #Environment Issue Date: 2026-02-18 GPT Summary- REDSearcherは、大規模言語モデルを用いた探索エージェント最適化のための統一フレームワークであり、複雑なタスクの合成や中間訓練を効率化する。具体的には、タスクの難易度を正確に制御し、ツール使用を促進。また、基本能力や知識の強化を通じて高品質な軌跡収集を低コスト化。迅速なアルゴリズム的反復が可能なシミュレート環境を構築し、テキスト・マルチモーダル両方のベンチマークで最先端性能を達成。高品質な探索軌跡やクエリセットを公開し、今後の研究を促進する。 Comment
pj page: https://redsearchagent.github.io/index/
元ポスト:
ざっくりとしか読めていないが、ポイントはQAを構築する際のreasoningngraphに基づく複雑度の管理と、5段階のverifierによる低品質なQAの除去にあるように見える。
QAを合成する際にQAに回答するためのreasoning graphをKGに基づいて構築し、QAに回答するための情報を網羅するための深さをQAの構造的な複雑さとし、また応答するための情報がソースにどれだけ分散しているか(1 documentにすべての情報が書かれていたらいくら構造が複雑でもone shotのexampleで応答できることになる)の両方を考慮してQAの複雑度を決定しているように見える。
また、合成されたQAから低品質なものや複雑でないめのをフィルタリングするために下記5段階のverificationを実施:
- ツールアクセス無しでLLMの世界知識のみで回答可能なものは除外
- search engine apiで検索をしtop 50に正解が出現しないものはevidenceが十分にsupportされていないとし除外
- QA合成中のKGのevidenace(KGのtripletと、キャッシュされたpassage)をLLM verifierに与え、回答と矛盾する場合は除外
- strong agentにN回rolloutを生成させ、1度も正解できなかったものは除外。またN回のうち何回正解できたかをconfidenceとして保持
- 正解rolloutを生成する過程において、strong agentによって回答がuniqueでないと判断されたものは除外する(厳密ではなくとも、曖昧なタスクを除外する効果を期待する)
上記はtext modalityのQAの合成の場合で、multi modal (image)の場合は、reasoning graphのノードの一部を画像に置換し、画像の中身を解釈した上で次のノードを検索するといった依存関係に変更することでimageを理解しないと応答不可なQAを合成するようである。
verificationについても、上記text onlyのverificationに加え、VLMに基づいたimage onlyのverification(imageだけで回答できるものは除外、imageがQuestionと関係なさすぎる場合は除外等)したり、text+imageをstrong agentに与えN回ロールアウトを実施し正解率を算出し、正解率が高すぎるQAを除外するといった処理を実施しているようである。
[Paper Note] Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning, Zhaoyang Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #PostTraining #Diversity #Environment Issue Date: 2026-02-17 GPT Summary- LLMの進展により、自律エージェントが複雑なタスクを実行する能力が向上したが、信頼できる環境の不足がスケールを制約している。本研究では、Agent World Model(AWM)という合成的な環境生成パイプラインを提案し、1,000のシナリオを用意し、平均35ツールとの相互作用を可能にする。これにより、信頼性の高い状態遷移と高品質な観測が得られ、マルチターンのツール使用エージェントに対する強化学習で有効性を確認。合成環境のみでも良好な分布外一般化が得られることを示した。コードは公開されている。 Comment
元ポスト:
ポイント解説:
[Paper Note] Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning, Futing Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #Test-Time Scaling #KeyPoint Notes Issue Date: 2026-02-14 GPT Summary- モデルが文脈内で複数の推論仮説を生成・検証し効果的にスケーリングを実現するためには「浅い探索の罠」を克服する必要がある。これを解決するために、冗長性ペナルティに基づく長さインセンティブ探索(\method)を提案。実験により、この手法は文脈内探索を促進し、ドメイン内で平均4.4%、ドメイン外で2.7%のパフォーマンス向上を示した。 Comment
元ポスト:
RLによってモデルが特定のサンプルに正解できなかった場合に、モデルにΔLの範囲でreasoningを長くした場合(つまりいつもより少しだけ長い思考をする)に報酬が与えられ、かつreasoningの過程において、特定の思考のstateに何回も訪れてしまう場合にペナルティを与えることで、思考が深くなった際に多様なstateが探索されなくなる問題(浅い探索の罠)を是正し、sequentialなtest time scaling(=long CoT)の性能を改善する。
[Paper Note] General Humanoid Whole-Body Control via Pretraining and Fast Adaptation, Zepeng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NeuralNetwork #MoE(Mixture-of-Experts) #Robotics #EmbodiedAI #Initial Impression Notes #WholeBody Issue Date: 2026-02-14 GPT Summary- ヒューマノイドロボットの全身コントローラー学習は、多様な動作や迅速な適応の難しさから依然課題が残る。既存手法はタスク固有のトレーニングを要し、新しい動作への適応時に性能が低下することが多い。本研究では、高速適応と安定した動作追跡を実現する「FAST」を提案。FASTは軽量のデルタアクションポリシーを学習し、分布外動作への効率的適応と壊滅的な忘却の軽減を図る。さらに、センターオブマスに基づく制御を導入し、バランス向上を目指す。広範なシミュレーションと実世界の実験により、FASTは堅牢性や適応効率で最先端のベースラインを超える性能を示した。 Comment
元ポスト:
腕の操作だけのような特定の部位に特化したモーションを学習するのではなく、全身の動きを制御するコントローラーをMoE+3層MLPのアーキテクチャでRL(PPO)によって学習するような手法らしい
[Paper Note] The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context, Xiaoyuan Liu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ContextEngineering #memory #One-Line Notes #ContextRot Issue Date: 2026-02-13 GPT Summary- 新しい基盤モデル「StateLM」を導入し、AIが自己管理できる状態を持つエージェントに進化。コンテキストのプルーニングや文書のインデクシングなどのメモリツールを管理することで、モデルは固定ウィンドウの制約から解放されます。StateLMは長文QAやチャットメモリタスクで従来のLLMを一貫して上回り、特にBrowseComp-Plusタスクでは最大52%の精度を達成。私たちのアプローチにより、推論が管理可能なプロセスに変革されます。 Comment
元ポスト:
言語モデルにStateを明示的に持たせて、ツールを用いて動的に過去のcontextから必要なcontextを編集、削除、読み込みなどのコンテキストエンジニアリングが可能なようにRLによって学習するようなアーキテクチャが提案されているように見える。
[Paper Note] Native Reasoning Models: Training Language Models to Reason on Unverifiable Data, Yuanfu Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #ICLR #PostTraining #Off-Policy #KeyPoint Notes #Open-endedTasks #ConfidenceBased Issue Date: 2026-02-13 GPT Summary- NRT(ネイティブ推論トレーニング)は、教師ありファインチューニングと強化学習の依存を克服し、標準的な質問-回答ペアのみでモデルが自ら推論を生成します。推論を潜在変数として扱い、統一訓練目標に基づいて最適化問題としてモデル化することで、自己強化フィードバックループを構築。LlamaおよびMistralモデルにおいて、NRTが最先端の性能を達成し、従来の手法を大幅に上回ることを実証しました。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=abAMONjBwb
verifier freeでreasoning能力を向上させるRL手法で
- SFTにおいてexpertsのtrajectoryが必要な課題
- RLVRにおいてverifiableなドメインでしか学習できない課題
の両方に対処する。
具体的にはQAデータが与えられたときに、Questionに対してモデルにreasoning trace zを生成させ、zを生成した後にanswerを生成させる。zに対するTrace Rewardとanswerトークンに対するモデルのconfidenceを報酬として用いてRLする。
SFTやverifier freeな先行研究よりも9種類のreasoningベンチマークで高い性能を達成している。また、answer tokenのconfidenceに対する3種類の集約方法(平均, 1/pによって加重平均をすることで難しいトークンの重みを強める, 対数尤度を用いる)も提案手法も提案され比較されている。
論文中ではオフポリシーRLとして最適化する旨記述されているが、appendix記載の通りreasoning trace zを生成しているので、オンポリシーRLな性質も備えていると思われる。
[Paper Note] Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation, Wenkai Yang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Distillation #On-Policy Issue Date: 2026-02-13 GPT Summary- オンポリシー蒸留(OPD)は、学生が教師のロジット分布に合わせて生成した軌道に基づき、パフォーマンスを改善する手法であり、オフポリシー蒸留や強化学習(RL)を凌駕することが多い。本研究では、OPDが密なKL制約付きRLの特別なケースであることを示し、一般化オンポリシー蒸留(G-OPD)というフレームワークを提案。報酬スケーリング因子を導入し、ExOPDとして知られる手法が標準OPDを一貫して改善することを明らかにした。特に、異なるドメインの専門知識を統合できる設定では、学生が教師のパフォーマンスを超える可能性がある。さらに、教師のベースモデルを参照モデルとして選択することで、報酬信号が向上し蒸留パフォーマンスが向上することが確認された。研究はOPDに関する将来の知見を提供することが期待される。 Comment
元ポスト:
[Paper Note] Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics, Leheng Sheng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #Reasoning #SelfImprovement #PostTraining #RLVR #PRM #RewardModel #One-Line Notes #Rubric-based Issue Date: 2026-02-12 GPT Summary- CoTがLLM推論において重要である一方で、報酬モデルの訓練には多くの人手が必要で、静的モデルは変化に対応しづらい。これを解決するため、自己進化するCoT報酬アプローチ「RLCER」を提案。自己提案・自己進化するルーブリックにより、結果報酬なしでも信頼性のあるCoT監視信号を提供し、結果中心のRLVRを上回ることを実証。また、ルーブリックは推論時のパフォーマンスを向上させる効果もある。 Comment
元ポスト:
CoTを評価するためのルーブリックを自己進化させて、CoTの評価もしつつ、outcomeに基づくRLVRを実施するといった処理を単一のポリシーで実現する、というような話に見える(過去のCoTに対する監視手法ではPRMが別途用意されていた)。
単にRLVRをする場合よりも最終的な性能が向上し、特にlong runの場合の安定性が高まっているように見える。
[Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory #KeyPoint Notes #ContinualLearning #AgentSkills Issue Date: 2026-02-12 GPT Summary- SkillRLは、自動スキル発見と再帰的進化を通じて、LLMエージェントが過去の経験を活用し、高レベルの再利用可能な行動パターンを抽出できるようにする新たなフレームワークです。経験に基づく蒸留を用いて階層的なスキルライブラリを構築し、強化学習中にスキルがエージェントのポリシーと共進化します。このアプローチにより、推論の有用性が向上しつつ、トークンのフットプリントが削減されます。実験はSkillRLが最先端の性能を達成し、堅牢性を保つことを示しました。 Comment
alphaxiv blog: https://www.alphaxiv.org/abs/2602.08234
元ポスト:
AnthropicのAgent Skillsにinspireされた手法で、ポリシー側のパラメータをfreezeしてスキル群を更新していくような枠組みではなく、スキルが定義されたライブラリと、ポリシーそのものを同時に進化(スキル定義追加・更新+ポリシーの重みの更新)させていくことで、生のtrajectoryをmemoryから活用する方向性ではなく、動的にtrajectoryからスキルを構築し、構築されたスキルの使い方やretrieve方法をポリシーの内部パラメータとして組み込むことで、スキルとポリシーが共に進化していくようにしたい、それにより、生の経験(trajectory)を読み込んでadhocに利用するよりも、より一般化された形で経験を活用できるようにしたい、という話に見える。
提案手法はベースモデルを環境に対して適用しタスクに対する成功したtrajectoryと失敗したtrajectoryをまず収集する。収集したtrajectoryに対して、teacher modelで「タスクを完了するための戦略的なパターン」と「簡潔な失敗した要因」を生成させ、<スキル名, スキルの具体的なdescription, いつそのスキルを適用するか>によって定義されるスキルを定義する(従来手法は失敗したtrajectoryに関する情報は破棄していた)。スキルは2種類定義されており、汎用的に全てのタスクに適用可能なgenericなスキルと、特定のtask-specificなスキルの2種類によって構成される(この二つのスキルの集合がSKILLBANKと呼ばれる)。genericなスキルは常にポリシーのinstructionに含められ、task-specificなスキルはタスクを実行するたびに意味的な関連性に基づいてtop-kがretrieveされ利用される。これにより初期のSKILLBANKを構築する。
続いて、ベースモデルを学習して賢くしていきたい。この時初期のポリシー(=ベースモデル)はスキルのretrieve + 使い方を知らないため、teacher modelによってスキルを含めたtrajectoryを生成しSFTをすることでコールドスタート時に適用する。その後、オンポリシーRL(GRPO)を用いて、スキルをretrieveし、retrieveしたスキルを活用してタスクを完了し、完了したタスクからrewardが計算されポリシーを更新していく。この時、GRPOのエポックにおいてvalidationフェーズを用意し、特定の閾値以下のsuccess rateを持つタスクに関しては、teacher modelが失敗したtrajectoryに基づいてSKILLBANKを更新することでSKILLBANKを進化させることで性能を改善する、といった話に見える。
genericなスキルは常にinstructionに含まれるためretrieveする必要がないが、task specificなスキルはtask descriptionとskill定義のembeddieg空間上で類似度を測りtop-kが抽出される。embeddingを取得する具体的なモデルについては言及がないように見える?
[Paper Note] UI-Venus-1.5 Technical Report, Veuns-Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #mid-training #ModelMerge #Off-Policy #On-Policy #VisionLanguageModel #One-Line Notes #Rubric-based #Initial Impression Notes #GUI Issue Date: 2026-02-12 GPT Summary- 統合型エンドツーエンドGUIエージェントUI-Venus-1.5を紹介。さまざまなアプリケーションに対応する2B、8B、および30B-A3Bのモデルバリアントを持ち、10億トークンを活用したMid-Training、オンライン強化学習、ドメイン固有モデルの統合を実施。評価においてScreenSpot-Pro、VenusBench-GD、AndroidWorldで新たな最先端パフォーマンスを達成し、中国のモバイルアプリでも効果的なナビゲーションを実現。 Comment
元ポスト:
Mid-training(navigation, grounding, reasoning, GUI-VQA, アイコンの認識等の精緻な認識能力)でGUIに関する知識を身につけさせ、オフラインRLで特定のタスクに特化した能力(grounding, navigation等)を向上し、オンラインRLで実シナリオでのエージェントのtrajectoryレベルでの能力を向上させる。これらのモデルはモバイルとwebでそれぞれ学習され、最終的にモデルマージを通じて単一のend-to-endにタスクを実現可能なエージェントを構築する。
コールドスタートの対策のためにSFTではなくオフポリシーRLを使っているのが特徴
下記研究において、SFTが各trajectoryがトークン単位で一致したときに1となるrewardを用いたRLと一致することが示されており、汎化能力に課題があることが指摘されている[^1]。汎化性能は後回しにして、特定の能力にとにかくまずは強化したいという用途であればSFTでも良いかもしれないが、downstreamなタスクがend-to-endで多様なタスクとなる場合は、オフラインRLを用いて汎化性能も考慮しつつ多面的な能力をwarmupするのが良いのかもしれない。
- [Paper Note] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification, Yongliang Wu+, ICLR'26, 2025.08
[^1]: ポリシーがexpertのtrajectoryに対して低い尤度を示すとimportance weightingにより非常に大きい重みがかけられることで分散が大きく、かつ報酬シグナルがsparseなことが課題であることが指摘されている。
[Paper Note] Code2World: A GUI World Model via Renderable Code Generation, Yuhao Zheng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #Coding #VisionLanguageModel #WorldModels #One-Line Notes #GUI Issue Date: 2026-02-12 GPT Summary- 自律的なGUIエージェントは、GUI Worldモデルを用いて行動を実行し、人間のような先見性を持つ。既存のアプローチは視覚的忠実性と構造的制御の両立が困難である。そこで、Code2Worldを提案し、レンダリング可能なコード生成を通じて次の視覚状態をシミュレートする。GUIトラジェクトリを高忠実度のHTMLに変換し、合成コードを洗練。Render-Aware Reinforcement Learningを用いて視覚的意味の忠実性と行動の一貫性を強化。広範な実験により、Code2World-8Bは競争力のあるモデルに匹敵するパフォーマンスを達成し、ナビゲーション成功率を大幅に向上させた。 Comment
pj page: https://amap-ml.github.io/Code2World/
元ポスト:
現在のスクリーンショットと、アクションのペアから、次のスクリーンショットをレンダリング可能なコードを通じて予測する(Next UI Prediction)
[Paper Note] Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability, Aaditya Vikram Prasad+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Hallucination #Probing #One-Line Notes #Open-endedTasks Issue Date: 2026-02-12 GPT Summary- 特徴をスケーラブルな監視として用いる新アプローチ「RLFR」を提案。幻覚を減少させるため、強化学習パイプラインを設計し、モデルが出力の事実性に不確かさがある場合に介入・修正を学習。実験により、元のモデルより58%幻覚の可能性が低い結果を達成しながら、パフォーマンスを維持。解釈可能性の新しいパラダイムを示す。 Comment
元ポスト:
(以下論文をちゃんと理解できているか少し自信ないです)
activation steeringやLLMの内部表現の分析に利用されるprobing手法をRLの報酬に活用する研究で、学習させたい特徴をprobingによって予測できるモデルを用意し(今回はhallucination)、報酬として活用できるパイプラインを用意して(少しこのパイプラインがややこしい)RLするという話に見える。probingするモデルを学習するデータの合成に際はstrong modelが用いられる(今回はGemini 2.5 Pro)。要は、テスト時にsteeringできるのであれば、学習時にモデルが内部的に保持している特徴を活用してRLしちゃえばいいじゃん、という発想に見える。
流れとしては、input textが与えられた時にprobingを実施して、どこのspanにhallucinationがあるかを検出し、現在のポリシーにその情報を用いて新たなcontextを生成しself verificationさせる(情報を維持、撤回させるのか、修正のいずれの操作のうちどれを実施すべきかを出力)ことでロールアウトを実施。続いて、ロールアウトされたテキストに対して、**ベースモデルを用いてprobingを実施し**、その結果をrewardとしてポリシーをアップデートする。ベースモデルを使う部分の気持ちがどこに書かれているかがわからないのだが、おそらく、現在のポリシーのロールアウトをベースモデルを用いてprobingすることでreward hackingを防止している。test timeにも同様のprobingを実施し、Best-of-Nで応答を生成する(Figure2)。
[Paper Note] Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training, Ran Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #Rubric-based #Open-endedTasks Issue Date: 2026-02-11 GPT Summary- Rubric-ARMフレームワークは、スカラー得点を超えて創造的応答の多面的な質を捉えることを目的としている。報酬フィードバックからの強化学習を用い、rubric生成器と判定者を共同最適化し、既存手法の静的な制約を克服。交互最適化戦略を導入し、その効果を理論的に分析。実験により、Rubric-ARMが複数のベンチマークで最先端の性能を発揮し、強化学習環境でのポリシー整合性を大幅に改善することを示した。 Comment
元ポスト:
[Paper Note] Reinforced Attention Learning, Bangzheng Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Attention #PostTraining #VisionLanguageModel #One-Line Notes Issue Date: 2026-02-11 GPT Summary- 強化学習を用いた内部注意分布の直接最適化を通じて、マルチモーダルLLMの情報配分を改善する強化注意学習(RAL)を提案。RALは複雑な入力におけるグラウンディングを向上させ、さまざまなベンチマークで一貫した性能向上を示す。オンポリシー注意蒸留を採用し、クロスモーダル整合性を強化する新たなアプローチを提供。 Comment
元ポスト:
マルチモーダルLLM(実験ではVLM利用)におけるクロスモーダルなAttention表現を改善するためのRLに基づく事後学習手法で、attention分布を直接最適化する手法な模様
[Paper Note] Learning to Self-Verify Makes Language Models Better Reasoners, Yuxin Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #RLVR #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes #SelfVerification Issue Date: 2026-02-10 GPT Summary- LLMの生成能力は高いが、自己検証では弱いという非対称性を調査。生成が向上しても自己検証に改善は見られず、逆に自己検証の学習が生成性能を向上させることが示された。生成訓練に自己検証を統合するマルチタスク強化学習フレームワークを提案し、両者の性能向上を実証。 Comment
元ポスト:
LLMの生成能力を高めるようにRLによって事後学習をしてもVerificationの能力は向上しないが、LLMが自身の出力に対してVerificationが正しくできるようにRLVRすると生成と自己検証能力の双方が向上する。
クエリに対して応答を生成し、フィルタリング(応答が長すぎるもの、全ての応答が誤りのもの、最終的な回答が存在しないもの等)を実施した後、クエリレベルで多様なクエリが存在するようにする(多様性)を保ちつつ、overfittingを避けるために正解・不正解がバランスよく存在するように自己検証のためのデータを作成(モデルは学習の初期のロールアウトは不正解ばかり生成し、後半は正解ばかり生成するといった偏りが存在する)し、式(4)で定義される自身が生成した応答が正解か否かを二値分類した結果に基づくRewardを用いてGRPOする、という手法ように見える。
ざーっと見た感じtest time scalingの実験が無いように見えたが、この方法で自己検証をモデルができるようになると、test time scalingした時の性能も向上するのではないか。
また下記研究で示されている通り、現在のLLMはself refine能力が低く何らかのガイドがないと自身で応答を改善していけないため、現在のLLMの弱みを克服するのに有効な手法に見え、非常に興味深い研究だと感じる。
- [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
[Paper Note] SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization, Jiarui Yuan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #Evaluation #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment
元ポスト:
関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。
APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。
[Paper Note] When RL Meets Adaptive Speculative Training: A Unified Training-Serving System, Junxiong Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Decoding #read-later #SpeculativeDecoding Issue Date: 2026-02-09 GPT Summary- Auroraは、ライブ推論トレースから直接投機的デコーディング学習を行う統一システムを提案。オンラインでの学習を非同期強化学習問題として再定義し、受け入れられたトークンからフィードバックを得てサンプル効率を向上。デイ0での展開をサポートし、迅速な適応と即時のユーティリティフィードバックを提供。実験では、フロンティアモデルに対して1.5倍の速度向上を実現し、静的な投機者にも1.25倍の向上を見せた。 Comment
元ポスト:
公式アナウンス:
[Paper Note] InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning, Yuchen Yan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #Reasoning #PostTraining #LongHorizon #Compression Issue Date: 2026-02-09 GPT Summary- InftyThink+は、モデルによる制御された反復推論と要約を基にした強化学習フレームワークで、中間的な思考の劣化を軽減し、反復推論の効率を最適化します。教師あり学習の後、二段階の強化学習を行い、戦略的要約と推論の再開を学習。実験では、従来方法に比べて精度を21%向上させ、推論レイテンシを大幅に削減しました。 Comment
pj page: https://zju-real.github.io/InftyThink-Plus/
元ポスト:
一言解説:
con-currentwork:
- [Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
reasoningを要約することで圧縮し次のreasoningを繰り返すような枠組みのように見え、
- [Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
と類似したアプローチに見える。
[Paper Note] Learning to summarize user information for personalized reinforcement learning from human feedback, Hyunji Nam+, ICLR'26, 2025.07
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #Alignment #Personalization #In-ContextLearning #ICLR #read-later Issue Date: 2026-02-08 GPT Summary- 新しいLLMアシスタントでの応答のパーソナライズを目指し、「要約を用いた好み学習(PLUS)」フレームワークを提案。これにより、各ユーザーの特徴や過去の対話に基づいた要約を生成し、個々の好みに沿った報酬モデルを条件付ける。PLUSは、ユーザー要約モデルと報酬モデルを同時に訓練し、精度向上を実現。新しいユーザーやトピックに対する堅牢性や、独自モデルによる強化されたパーソナライズ能力を示し、ユーザーの解釈可能な表現を提供することで透明性を高める。 Comment
pj page: https://sites.google.com/stanford.edu/plus/home
元ポスト:
[Paper Note] A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning, Akifumi Wachi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #PostTraining #One-Line Notes #BudgetAllocation Issue Date: 2026-02-08 GPT Summary- 強化学習は大規模言語モデルの推論能力を向上させるが、その効果は相対予算によって異なる。この研究では、$ξ:= H/\mathbb{E}[T]$を通じて相対予算理論を提案し、報酬の分散や情報的経路の発生確率がサンプル効率を決定することを示す。分析により、{不足}、{バランス}、{十分}の三つの領域を明らかにし、特にバランス領域で最大のサンプル効率を持つことが判明。また、オンラインRLに対する有限サンプルの保証を提供し、実証的に学習効率の最適化と推論性能のピークに一致する予算範囲を特定。 Comment
元ポスト:
元ポストに要旨が簡潔に日本語でまとめられている。
[Paper Note] Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents, Zhihan Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #PostTraining #read-later #Selected Papers/Blogs #CrossDomain #Generalization #KeyPoint Notes #DomainGap #Initial Impression Notes Issue Date: 2026-02-08 GPT Summary- 一般化されたLLMエージェントのポストトレーニングにおける課題を調査。特に、強化学習環境の特性がアウトオブドメイン性能に与える影響を分析。状態情報の豊富さとプランニングの複雑さがクロスドメインの一般化に強く相関し、リアリズムやテキスト類似性は主要な要因ではないことを発見。状態情報を増やすことでロバスト性を向上可能で、ランダム化技術を提案。また、モデリング選択として、SFTのウォームアップが忘却を防ぐが一般化を損なう可能性や、ステップ・バイ・ステップ思考が一般化に重要な役割を果たすことを示した。 Comment
元ポスト:
事後学習におけるクロスドメインの汎化性能に関する調査を行い、ドメインの表層的な情報ではなく、
- 状態情報の豊富さ(どれだけのテキストを処理する必要があるか; 認知コスト)
- 推論の複雑さ(long-horizonやゴールへの到達可能性)
がドメイン間の汎化に相関を示すことが明らかになり、要は構造の複雑さが鍵であることが分かった。
ドメイン間の汎化性能を改善するために、実タスクは変えずにobservationに対して少量のノイズを加えることで、モデルがノイズから重要なシグナルを抽出することを学習し汎化性能が向上。
RLを行う際の注意点として、
- mid-trainingはDataMixに含まれるドメインの知識を補充するが、カバーされていないドメインの忘却をより悪化させる可能性があり
- ステップ単位での推論が汎化性能向上に役ダウン(言い換えると、ショートカットは転移しない)
を挙げており、
デプロイされるドメインが不明な場合の実用的な対策として
- より状態の記述がリッチなドメインかつ複雑な推論を要する環境で学習し
- 明示的な推論をオンにし
- 軽量な状態情報へのノイズの注入や拡張をすふこと
を挙げている。
さらにざっくり言うとエンコード時にドメインの表層情報に依存させず、表層情報の中から必要な情報を抽出するスキルをモデルに学習させ、かつデコーディング時は精緻な推論によって誤った転移を防ぐのがドメイン間の汎化の鍵、という話に感じる。
[Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #RLVR Issue Date: 2026-02-06 GPT Summary- REALフレームワークは、強化学習における報酬をカテゴリカルラベルとして再考し、ポリシー最適化を分類問題として定式化することで、効率的なポリシー更新を実現します。このアプローチは、勾配重み付けの不一致を軽減し、均衡の取れた勾配配分を可能にします。実験では、REALがGRPOやDAPOに対して一貫して優れた性能を示し、1.5Bモデルで6.7%、7Bモデルでも引き続き改善を達成しました。 Comment
元ポスト:
[Paper Note] Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations, Wei Liu+, ICML'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #AIAgents #ICML #Test-Time Scaling #PostTraining #LongHorizon #GPUKernel #Environment #Author Thread-Post Issue Date: 2026-02-06 GPT Summary- 高品質のカーネル生成はスケーラブルなAIシステムの鍵であり、そのためのLLM訓練には十分なデータと堅牢な環境が必要です。本研究では、KernelGYMを設計し、報酬ハッキングを防ぐマルチターンRL手法を検討します。TRLOOを提案し、偏ったポリシー勾配問題を解決。訓練されたDr.Kernel-14Bは高性能を達成し、生成されたカーネルの31.6%がTorch参照に対して1.2倍のスピードアップを実現しました。全リソースはGitHubで公開されています。 Comment
元ポスト:
[Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #PostTraining #RLVR #One-Line Notes Issue Date: 2026-02-06 GPT Summary- 報酬関数の設計における二値のスパース性に対処するため、本研究ではリファレンスアンサーから導出された対数確率を報酬として使用することを検討。対数確率報酬は所有検証者に依存せず、数学推論ベンチマークでの性能を向上させることがわかった。この方法は、チェインオブシンキング(CoT)ファインチューニングの新たな実行可能な戦略として位置づけられ、検証可能・非検証可能な設定でのパフォーマンスを向上させる効果が確認されました。 Comment
元ポスト:
関連(concurrent work):
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
最終応答のlogprobを報酬として利用する設定のRL(i.e., 検証可能なタスクでなくとも適用可能)を調査し、検証可能な応答のlogprobを報酬として利用することでbinary rewardと同等以上の性能を達成可能であることを示したようで、検証可能でない設定で学習すると途中でCoTが崩壊し、CoTが極端に短くなる現象が生じる。これは初期のCoTの長さと正解の対数尤度に負の相関があり、これによってRLがCoTを短くすることを奨励してしまうからではないか、という話が元ポストに記述されている。
[Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #EfficiencyImprovement #NLP #LanguageModel #Actor-Critic #PostTraining #read-later #Selected Papers/Blogs #Stability #KeyPoint Notes #train-inference-mismatch Issue Date: 2026-02-06 GPT Summary- 強化学習におけるPPOの限界を指摘し、低確率トークンの更新が過剰に罰せられる問題を解決するため、ダイバージェンス近似ポリシー最適化(DPPO)を提案。DPPOは、ポリシーの逸脱を直接推定することで学習ダイナミクスの非最適性を改善し、効率的なバイナリおよびトップK近似を導入することでトレーニングの安定性と効率を向上させる。 Comment
元ポスト:
PPOはトークン単位の確率比をrefと現在のポリシーからの算出しrefから離れすぎないようにクリッピングをするが、この場合非常に低確率で出現するトークンは過剰にクリッピングされる傾向にある。しかしその低確率トークンを調べると実はReasoningにおいて重要なトークンであったり(Wait, Thus, Next)、数学での重要なシンボル(+,-,=)、数値トークンであり、結果的にこれらReasoning系のタスクで重要なトークンの学習を阻害してしまっており(実際にこれらの低確率トークンをクリッピングされないようにしたら学習効率が大幅に改善)、語彙数が多いLLMの学習においては相性が悪い(別の視点として高確率トークンに対して過剰にペナルティを与えるという傾向もある)。これを改善するために、確率比をクリッピングするのではなく、ポリシーとrefのDivergenceの上界を直接制約することで解決し(語彙数が大きすぎてDivergenceを計算できないので近似的な計算方法も提案されている模様)、実際に適用すると学習が非常に安定し、かつ学習効率が既存手法と比較して高まりました、という話にみえる。
解説:
一言解説:
400B級のモデルの事後学習で、
- エントロピー崩壊を防ぎ
- より高速で安定して収束し
- context長の外挿に強い
ことが確認されたとの報告がある。
- Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
[Paper Note] WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning, Zelai Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #PostTraining #Initial Impression Notes Issue Date: 2026-02-06 GPT Summary- マルチエージェントシステムを用いた情報探索の幅のスケーリングを探求する本研究では、WideSeek-R1フレームワークを提案。リードエージェントとサブエージェントが共同最適化することで、20,000のタスクで高い性能を発揮。WideSeek-R1-4BはアイテムF1スコア40.0%を達成し、性能がサブエージェント数の増加と共に向上することを示す。 Comment
元ポスト:
Context Foldingと比較した時の新規性がweaknessに感じる:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
[Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #AIAgents #Reasoning #PostTraining #read-later #RLVR #Selected Papers/Blogs #OOD #Generalization #KeyPoint Notes #LongHorizon #Robustness #Compression #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 大規模言語モデル(LLM)は、テスト時の適応能力により複雑な問題を解決する外挿特性を持つが、標準的な強化学習(RL)はその変化に制約がある。これに対処するために、反復デコーディングアルゴリズム(RC)を導入し、LLMの応答生成能力を活用して推論を継続的に改善。実験では、16kトークンの訓練で4BモデルがHMMT 2025でのパフォーマンスを40%から約70%に引き上げ、既存のモデルを上回る結果を示した。RCを使用したモデルは、学習した要約生成能力によりテスト時のパフォーマンスも向上できることが証明された。 Comment
元ポスト:
reasoningの生成と、生成されたreasoningとinputで条件付けでsummaryを生成、さらにinputとsummaryで条件付けてreasoningを生成するという、生成と要約を反復する枠組みを採用(LLMはreasoningを要約することが生成するよりも得意で、かつ過去の要約から将来の推論を生成できるという非対称性を活用)することで、訓練時の予算は決まっているため、訓練時の予算では到達できないhorizonにテスト時に遭遇すると汎化しない課題を克服し、テスト時により長いステップ数の推論もこなせるように外挿する。また、このようなgeneration-summaryの反復を各ステップごとでRLVRすることでさらに性能を向上でき、実際にlong horizonな推論や学習時よりもより長いreasoning token budgetの場合に大きなgainを獲得できている。
RLVRをする際に各ステップごとのSummaryを保存しておき、各ステップのsummaryが与えられたときに正解できるかどうかのシグナルに基づいて、ステップごとの要約で条件付けられた応答能力を改善する。これにより、さまざまなステップで応答を生成する能力が強化され、結果的にshort horizonからlong horizonの推論をする能力が強化される。
このときsummaryはリプレイバッファとして扱い後のepochの訓練でもオフポリシーデータとして活用する。要約はinputに条件付けられて生成されるものであり、optimizationのtargetとは異なるためリプレイバッファとして活用でき、かつさまざまな要約に対して正解が生成できるように学習されるためテスト時の要約の分布のシフトにロバストになる。また、オンポリシーデータだけだと、long horizonに対する要約は非常に稀になるため、リプレイバッファを利用することで補う。
テスト時に学習時を超えたhorizonで推論できることは現在のAIエージェントの大きな課題だと思うので非常に興味深い研究だと思う。
[Paper Note] Learning to Reason in 13 Parameters, John X. Morris+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #PEFT(Adaptor/LoRA) #PostTraining #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 低ランクアダプタTinyLoRAを提案し、推論のための強化学習が低ランクパラメータ化を効果的にスケールできることを示しています。わずか13のトレーニングパラメータでQwen2.5を91%の精度に達成し、複雑なベンチマークでも少ないパラメータで90%のパフォーマンス向上を実現しました。特に、強化学習を用いることで、従来の方法よりも大幅に少ないパラメータで強力な結果を得ることができました。 Comment
元ポスト:
Qwen2.5に関してはLlamaと比較して異なる傾向が生じることは以下でも見受けられる。果たして本研究で報告されていることはどこまで一般的なのだろうか?:
- [Paper Note] Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination, Mingqi Wu+, arXiv'25
- [Paper Note] Spurious Rewards: Rethinking Training Signals in RLVR, Shao+, 2025.05
[Paper Note] EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL, Lunjun Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #One-Line Notes Issue Date: 2026-02-05 GPT Summary- LLMのために強化学習のポリシー勾配アルゴリズムを改善するため、固定アンカーポリシーをEMAに置き換え、Top-k KL推定器を導入。これにより、性能が大幅に向上し、数学的推論ではQwen-1.5BがOlympiadBenchで53.9%を達成。Qwen-3Bでは、EMA-PGがGRPOを7つのデータセットで平均33.3%改善し、特にHotpotQAや2WikiMultiHopQAにおいて顕著な向上を示した。全体として、EMA-PGはLLMの強化学習をスケールするための有力なアプローチである。 Comment
元ポスト:
ポイント解説:
KL正則化のRefが古くなりすぎるので指数移動平均(直近の更新重視の移動平均)を用いて更新されるようにし、KLの計算が重いのでTopKのトークンで近似的に計算することで高速化、という感じに見える。
[Paper Note] Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text, Ximing Lu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #PostTraining #read-later #RLVR #Selected Papers/Blogs #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- RLVRはLLMの推論を解きほぐす基盤だが、検証データの不足がスケールアップのボトルネックとなっている。この課題を克服するために「ゴールデン・グース」を提案し、インターネットの非検証テキストから無限のRLVRタスクを生成する。具体的には、LLMに主要な推論ステップを特定させ、豊富なタスクを持つGooseReason-0.7Mデータセットを合成。これにより、従来モデルを復活させ、15のベンチマークで新たな最先端結果を達成。また、リアルなサイバーセキュリティデータからRLVRタスクを合成し、Qwen3-4B-Instructをトレーニング。これにより7Bモデルを超える成果を上げ、推論に富んだインターネットテキストを活用する可能性を示している。 Comment
元ポスト:
テキストからMultiple Choice Question (MCQ) を生成することでRLVR用のverifiableな学習データを大量に合成可能にする。おそらく次のステップとしては、生成されるMCQの stem, key, distractor の質が今度は焦点となり、そこの質が改善されればより大きなgainを得られるようになる気がする(たとえば消去法で正解を知らなくても正解できてしまうようなdistractorや、問題文に正解がそのまま含まれてしまっているようなノイジーなMCQから人間が何も学ばないように、モデルが学習するときと一緒だと思われる)。
データとモデルが公開:
[Paper Note] ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution, Junjie Huang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #mid-training Issue Date: 2026-02-05 GPT Summary- LLMのトレーニングを一方向型から双方向プロセスに進化させ、強化学習(RL)による自己強化フライホイールを建立。ReMiTを導入し、ミッドトレーニングフェーズでトークンの重み付けを動的に調整することで3%の改善を実現。これにより、LLMの継続的な自己強化的進化が可能であることを示した。 Comment
元ポスト:
[Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #PostTraining #read-later #RLVR #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-02-05 GPT Summary- 強化学習を用いてモデルを訓練する際、尤度の最大化ではなく低次近似を最適化する限界に触発され、最大尤度強化学習(MaxRL)を提案。これは、サンプリングされたデータから最大尤度を近似するためのフレームワークであり、得られた目的関数はシンプルで偏りのないポリシー勾配推定を可能にする。実験では、MaxRLが既存の手法を上回り、テスト時間効率を最大20倍向上。追加データや計算へのスケーラビリティも優れており、RL訓練を正確性に基づいて拡張するための有望なフレームワークであることを示した。 Comment
元ポスト:
著者ポスト:
pj page: https://zanette-labs.github.io/MaxRL/
skim readingしかできていないが、
微分不可能な生成がされbinaryの正誤が与えられるような条件下でモデルを最適化するときにxが与えられてyが正解である確率はimplicitな尤度を表している。この最適化問題を解くために現在はRLが利用されており、RLは正解の確率pを最大化するような定式化がされているが、最尤推定で定式化するとlog pで定式化をすることになり、これは根本的に異なる最適化となる。具体的には、RLはpass@1に対して最適化しているが、MaxRLはk=1,...∞に対するpass@kの調和平均に対して最適化をするような違いがある。この最尤推定の勾配は実は成功したtrajectoryのスコアの平均という非常にシンプルな形で近似的に求められるらしく、最尤推定として解くと最大20倍程度効率が向上した、といった話に見える。
関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
- [Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02
所見:
所見:
[Paper Note] $V_0$: A Generalist Value Model for Any Policy at State Zero, Yi-Kai Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #In-ContextLearning #PostTraining #Stability #Scheduler #Routing #Initial Impression Notes #BudgetAllocation Issue Date: 2026-02-05 GPT Summary- GRPOを用いた訓練において、$V_0$という新たなバリューモデルを提案。これはパラメータ更新を必要とせず、モデルの期待パフォーマンスを推定し、能力の変化を捉える。$V_0$は成功率を予測し、効率的なサンプリングを実現。結果、LLMルーティングタスクにおいて、コストとパフォーマンスのバランスで優れた結果を示した。 Comment
元ポスト:
ポイント解説:
Actor-Critiqueの枠組みにおいてValueモデル(のポリシーに追従するための逐次的な更新が)重すぎる問題をGRPOはValueモデルを無くすことで回避したが今度はロールアウトのサンプリングコストがでかすぎる問題があるので、学習無しで汎用的に利用可能なValueモデル(パラメータ更新ではなくICLとして定義する)を用いて、ロールアウト前から成功率を予測し無駄なロールアウトを削減したり、クエリをどのモデルに投げるかといったルーティングをするなどの計算機リソースの配分を決めるといったことをやるらしい。
[Paper Note] RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System, Yinjie Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #PostTraining #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 強化学習フレームワーク「RLAnything」は、動的に環境、ポリシー、報酬モデルを生成し、学習信号を増幅することで、全体的なRLシステムを強化します。ポリシーはフィードバックを用いて訓練され、報酬モデルは一貫性フィードバックにより最適化されます。理論に基づく自動環境適応により、各モデルからの批評が訓練を改善します。実証例として、RLAnythingはOSWorld、AlfWorld、LiveBenchで大幅な性能向上を示しており、最適化された報酬モデルが人間のラベルを超える結果を出しています。 Comment
blog: https://yinjjiew.github.io/projects/rlanything/
元ポスト:
環境、ポリシー、Reward Modelが互いにフィードバックし合ってco-trainingされる枠組み
[Paper Note] Expanding the Capabilities of Reinforcement Learning via Text Feedback, Yuda Song+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #PostTraining #read-later #TextualFeedback #SelfDistillation Issue Date: 2026-02-05 GPT Summary- テキストフィードバックを用いた強化学習(RL)によるLLMの後処理を研究。スカラー報酬に対し、テキストフィードバックはコストが低く、豊かな情報を提供。モデルはトレーニング時にフィードバックを内部化し、推論時にシングルターンの性能を向上させる。自己蒸留(RLTF-SD)とフィードバックモデリング(RLTF-FM)の2つの手法を提案し、さまざまなタスクでの効果を検証。結果は強力なベースラインを上回ることで、豊かな監視源としてのRLの可能性を示している。 Comment
pj page: https://rl-textfeedback.github.io/
元ポスト:
[Paper Note] SWE-Universe: Scale Real-World Verifiable Environments to Millions, Mouxiang Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #SyntheticData #Coding #MultiLingual #SoftwareEngineering #mid-training #PostTraining #read-later #Selected Papers/Blogs #Verification #Scalability Issue Date: 2026-02-05 GPT Summary- SWE-Universeは、GitHubのプルリクエストから自動的に検証可能なソフトウェア工学環境を構築するためのスケーラブルなフレームワーク。カスタムトレーニングされたビルディングエージェントが反復自己検証とハッキング検出を用いて信頼性の高いタスク生成を実現。これにより、実世界の多言語SWE環境が100万以上増加し、Qwen3-Max-Thinkingにおいて75.3%のスコアを達成。次世代コーディングエージェントの発展に寄与。 Comment
元ポスト:
ポイント解説:
これまでと比較して非常に大規模な実PRに基づいた、さまざまなプログラミング言語に基づくverifiableな学習用の合成データを構築できる環境で、一つ一つの品質はSWE Benchなどには及ばないが、量が圧倒的
[Paper Note] Probing RLVR training instability through the lens of objective-level hacking, Yiming Dong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #MoE(Mixture-of-Experts) #RewardHacking #PostTraining #RLVR #Stability #train-inference-mismatch Issue Date: 2026-02-03 GPT Summary- RLVRは大規模言語モデルの性能向上に寄与するが、MoEアーキテクチャでのトレーニングは不安定になる。本研究では、RLVRの不安定性を客観的レベルのハッキングの観点から考察し、トークンレベルの不整合による最適化目的のスプリアス信号を特定。30B MoEモデルの実験を通じて、トレーニングと推論の不一致の成長を追跡し、不安定性のメカニズムを解明。この研究はMoEモデルの安定性に関する具体的な指針を提供する。 Comment
元ポスト:
[Paper Note] Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It, Yaxiang Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #PostTraining #Selected Papers/Blogs #Scheduler #train-inference-mismatch #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- 強化学習における言語モデルの訓練は不安定であり、その原因は訓練と推論の不一致にあるとされる。従来の対策では効果が薄いことが指摘され、本研究では勾配ノイズとミスマッチの連動を示し、更新サイズの縮小が効果的であることを発見。ミスマッチは動的な失敗と考え、動的に学習率を調整する新たな手法を提案。これにより、RL訓練を安定化し、不一致を抑制することができることが実証された。 Comment
元ポスト:
Importance SamplingやFP16に設定することによるミスマッチの解決方法でも依然として(長期の訓練などにおいて)安定性の問題が出ることをAblationで確認し、提案手法がより安定することを示しているように見える。
[Paper Note] Learn to Reason Efficiently with Adaptive Length-based Reward Shaping, Wei Liu+, ICLR'26, 2025.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Reasoning #ICLR #Length #PostTraining #Adaptive Issue Date: 2026-02-03 GPT Summary- 推論の効率を向上させるため、RLベースの手法LASERを提案。長さに基づく報酬シェイピングを用いて、冗長性を減少させつつ、パフォーマンスと効率の良好なバランスを実現。また、動的な報酬仕様と難易度を考慮した手法LASER-Dを導入し、簡潔な推論パターンを促進。実験により、推論性能と応答の長さ効率が大幅に向上した。 Comment
元ポスト:
[Paper Note] TTCS: Test-Time Curriculum Synthesis for Self-Evolving, Chengyi Yang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #CurriculumLearning #MajorityVoting #Test Time Training (TTT) Issue Date: 2026-02-03 GPT Summary- TTCSフレームワークは、LLMの推論能力を向上させるための共同進化型テスト時トレーニングを提供。質問合成器と推論ソルバーを初期化し、合成器が難易度の高い質問を生成し、ソルバーは自己一貫性報酬で学習を更新。これにより、質問のバリアントが安定したテスト時トレーニングを実現。実験で数学的ベンチマークにおける推論能力の向上と一般ドメインタスクへの移行が確認された。 Comment
元ポスト:
先行研究:
- [Paper Note] TTRL: Test-Time Reinforcement Learning, Yuxin Zuo+, NeurIPS'25, 2025.04
[Paper Note] Grounding Computer Use Agents on Human Demonstrations, Aarash Feizi+, ICLR'26, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #ICLR #ComputerUse #PostTraining #UI Issue Date: 2026-02-01 GPT Summary- 専門家の実演から構築したデスクトップグラウンディングデータセット「GroundCUA」を提案。87のアプリをカバーし、56,000枚のスクリーンショットと356万件以上の注釈を含む。これに基づき、指示をUI要素にマッピングする「GroundNext」モデル群を開発。教師ありファインチューニングにより最先端の結果を達成し、強化学習によるポストトレーニングでさらに性能向上。高品質なデータセットがコンピューターエージェントの進展に貢献することを示唆。 Comment
pj page: https://groundcua.github.io/
元ポスト:
[Paper Note] LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities, Thomas Schmied+, ICLR'26, 2025.04
Paper/Blog Link My Issue
#Analysis #LanguageModel #Chain-of-Thought #Reasoning #ICLR #Test-Time Scaling #PostTraining #Multi-Armed Bandit #DecisionMaking #Exploration Issue Date: 2026-01-31 GPT Summary- LLMのエージェントアプリケーションにおける探求と解決の効率性を分析。最適なパフォーマンスを妨げる「知識と行動のギャップ」や貪欲性、頻度バイアスという失敗モードを特定。強化学習(RL)によるファインチューニングを提案し、探索を増加させて意思決定能力を改善。古典的な探索メカニズムとLLM特有のアプローチの両方を融合させ、効果的なファインチューニングの実現を目指す。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=weUP6H5Ko9
- greediness
- frequency bias
- the knowing-doing gap
