CreditAssignment
[Paper Note] Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching, Preston Fu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-09 GPT Summary- 強化学習における従来の疎なアウトカム報酬の方法は、長く複雑なタスクの学習を遅延させる。部分的な進捗を報酬するアプローチはバイアスを生じることがあるが、我々は「progressive point matching」と呼ぶ新たな密な報酬定式化を提案する。これにより、セグメント単位での進捗報酬が長期タスクに効果的にスケールすることを理論的・実証的に示した。特に、難解な数学的推論問題において、セグメントレベルの報酬が成功率を向上させることがわかった。 Comment
blog: https://www.prestonfu.com/notes/ppm/
元ポスト:
[Paper Note] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning, Shulin Tian+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #Faithfulness #EMNLP #VisionLanguageModel #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-01 GPT Summary- 視覚と言語モデルは、視覚的証拠に基づかない回答を生成することがあるため、妥当性を維持できない状況をクレジット割り当ての失敗と捉える。本研究では、参照回答を原子命題に分解し、視覚的忠実性、推論の一貫性、指示遵守に基づいた評価を行う視覚的ルーブリックを提案。これにより裏付け証拠のクレジットを局所化し、Qwen3-VL-8B-Instructを用いて生成したトレーニングセットV-Rubrics 50Kを作成。実験結果、ルーブリックベースのGRPOはSFT基準及び他の手法を上回る改善を示し、視覚的ポストトレーニングの報酬としてルーブリックの有効性を証明した。 Comment
元ポスト:
Rubric basedなRLを用いて、trajectoryに対して構造化された部分点を提供するcredit assignment手法を提案し、これによりVLMの
- Visual Faithfulness
- Reasoning Consistency
- Instruction Following
を改善する、という話に見える。
[Paper Note] AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning, Zi-Han Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#On-Policy #SelfDistillation Issue Date: 2026-08-10 GPT Summary- 強化学習において、AgentOPSDを提案し、ターンレベルのクレジット割り当てを行う。これは、トークンレベルの確率差を集約し、ベイズ信念を再帰的に更新することで、希薄な監督をターンレベルの信号に変換。ALFWorldで89.1%の成功率を達成し、既存のベースラインを上回る性能を示す。 Comment
元ポスト:
[Paper Note] ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment, Yijun Lu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining Issue Date: 2026-08-10 GPT Summary- 長期的な探索エージェントは、回答に至るための複数のステップを必要とするが、従来の訓練法では有用な行動と誤った行動を区別できない。本研究では、Answer-Backtracked Credit Assignment(ABC)という細粒度のクレジット割り当てフレームワークを提案し、有用な行動を報いる一方で誤った行動を抑制する。具体的には、答えを遡って必要な手掛かりを回復し、探索ステップを手掛かりと照合することで密な報酬を生成。このフレームワークを用いて、Qwen3.5-4Bを使ったABSeekerが、BrowseCompで37.3%、BrowseComp-ZHで39.1%を達成し、コンテキスト管理を導入するとさらなる改善が見られた。これは長期的な探索エージェントの訓練におけるABCの有効性を示す。 Comment
元ポスト:
[Paper Note] SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution, Zhiyuan Yao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Initial Impression Notes Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment
元ポスト:
関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。
AgentSkillっぽい話かと最初は思ったが、そうではなさそう。
[Paper Note] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization, Bo-Wen Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #One-Line Notes Issue Date: 2026-08-08 GPT Summary- CoRTは、ルーブリック基盤の強化学習におけるトークンレベルのクレジット重み付け手法である。これにより、応答内での明示的なクレジット配分が可能になり、反事実リプレイを用いて同一応答の再スコアリングを行う。提案手法は、応答レベルの報酬を変更せずに、トークン毎に正規化された重みにマッピングし、GRPOアドバンテージを再配分する。実験結果は、CoRTが従来のGRPOを上回るパフォーマンスを示し、約4.4ポイントの向上を達成したことを示す。また、反事実尤度対比が効果的な学習信号を提供し、GRPOの安定性を維持することを示唆している。 Comment
元ポスト:
Rubric-basedなRLにおいて、Rubricの有無によって生じるtokenのlog probabilityの差を、当該トークンのルーブリックに対する重要度とみなし、token levelの学習シグナルを供給する。
JustRL II: Scaling Small LLMs to 128K Reasoning with a Critic, MiniCPM RL Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #read-later #Selected Papers/Blogs #LongHorizon #Author Thread-Post Issue Date: 2026-09-09 Comment
元ポスト:
関連:
- [Paper Note] JustRL: Scaling a 1.5B LLM with a Simple RL Recipe, Bingxiang He+, ICLR'26, 2025.12
终局奖励之后:从 Apodex 1.1 看长程 Agentic RL 如何分配 credit, 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #read-later Issue Date: 2026-09-06 Comment
元ポスト:
credit-assignment-is-all-you-need, haotian, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #reading #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
英語版公式ポスト:
