CreditAssignment


Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-09 GPT Summary- 強化学習における従来の疎なアウトカム報酬の方法は、長く複雑なタスクの学習を遅延させる。部分的な進捗を報酬するアプローチはバイアスを生じることがあるが、我々は「progressive point matching」と呼ぶ新たな密な報酬定式化を提案する。これにより、セグメント単位での進捗報酬が長期タスクに効果的にスケールすることを理論的・実証的に示した。特に、難解な数学的推論問題において、セグメントレベルの報酬が成功率を向上させることがわかった。 Comment

blog: https://www.prestonfu.com/notes/ppm/

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #Faithfulness #EMNLP #VisionLanguageModel #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-01 GPT Summary- 視覚と言語モデルは、視覚的証拠に基づかない回答を生成することがあるため、妥当性を維持できない状況をクレジット割り当ての失敗と捉える。本研究では、参照回答を原子命題に分解し、視覚的忠実性、推論の一貫性、指示遵守に基づいた評価を行う視覚的ルーブリックを提案。これにより裏付け証拠のクレジットを局所化し、Qwen3-VL-8B-Instructを用いて生成したトレーニングセットV-Rubrics 50Kを作成。実験結果、ルーブリックベースのGRPOはSFT基準及び他の手法を上回る改善を示し、視覚的ポストトレーニングの報酬としてルーブリックの有効性を証明した。 Comment

元ポスト:

Loading…

Rubric basedなRLを用いて、trajectoryに対して構造化された部分点を提供するcredit assignment手法を提案し、これによりVLMの
- Visual Faithfulness
- Reasoning Consistency
- Instruction Following

を改善する、という話に見える。




Paper/Blog Link My Issue
#On-Policy #SelfDistillation Issue Date: 2026-08-10 GPT Summary- 強化学習において、AgentOPSDを提案し、ターンレベルのクレジット割り当てを行う。これは、トークンレベルの確率差を集約し、ベイズ信念を再帰的に更新することで、希薄な監督をターンレベルの信号に変換。ALFWorldで89.1%の成功率を達成し、既存のベースラインを上回る性能を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining Issue Date: 2026-08-10 GPT Summary- 長期的な探索エージェントは、回答に至るための複数のステップを必要とするが、従来の訓練法では有用な行動と誤った行動を区別できない。本研究では、Answer-Backtracked Credit Assignment(ABC)という細粒度のクレジット割り当てフレームワークを提案し、有用な行動を報いる一方で誤った行動を抑制する。具体的には、答えを遡って必要な手掛かりを回復し、探索ステップを手掛かりと照合することで密な報酬を生成。このフレームワークを用いて、Qwen3.5-4Bを使ったABSeekerが、BrowseCompで37.3%、BrowseComp-ZHで39.1%を達成し、コンテキスト管理を導入するとさらなる改善が見られた。これは長期的な探索エージェントの訓練におけるABCの有効性を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Initial Impression Notes Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment

元ポスト:

Loading…

関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。

AgentSkillっぽい話かと最初は思ったが、そうではなさそう。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #One-Line Notes Issue Date: 2026-08-08 GPT Summary- CoRTは、ルーブリック基盤の強化学習におけるトークンレベルのクレジット重み付け手法である。これにより、応答内での明示的なクレジット配分が可能になり、反事実リプレイを用いて同一応答の再スコアリングを行う。提案手法は、応答レベルの報酬を変更せずに、トークン毎に正規化された重みにマッピングし、GRPOアドバンテージを再配分する。実験結果は、CoRTが従来のGRPOを上回るパフォーマンスを示し、約4.4ポイントの向上を達成したことを示す。また、反事実尤度対比が効果的な学習信号を提供し、GRPOの安定性を維持することを示唆している。 Comment

元ポスト:

Loading…

Rubric-basedなRLにおいて、Rubricの有無によって生じるtokenのlog probabilityの差を、当該トークンのルーブリックに対する重要度とみなし、token levelの学習シグナルを供給する。
image