PostTraining (548) — 1/3


Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #meta-learning #Generalization #Test-time Learning/Adaptation #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-10-02 GPT Summary- 言語モデルエージェントのharnessを、実行フィードバックに基づいて改訂するharness learningを提案。 実行可能プログラム上のメタ学習として改訂モデルを強化学習で訓練し、テスト時にはパラメータ更新なしで新規タスクの実行結果からharnessを逐次改善する。 推論およびマルチホップQAで、改訂性能の向上と未知タスクへの適応・転移を確認。 Comment

元ポスト:

Loading…

実行時のフィードバックに基づいてAgent Harnessをreviseすることを学習したモデル(Proposer)によって、テスト時にモデルの重み更新なしで、未知のタスクに対する汎化性能を獲得する




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Actor-Critic #read-later #Stability #Author Thread-Post Issue Date: 2026-09-30 GPT Summary- PPOでは、クリティックがLLMの強化学習を不安定化させる二つの失敗モード(打ち切りロールアウトのフィルタリングによる条件付き報酬への偏り、異質なリターンノイズによる高分散プロンプトの支配)を特定。 EasyPPOでは、アクターのみの過長ロールアウトを除外しつつ完了・打ち切り両方のリターンでクリティックを学習し、リターン分散の逆数によるノイズ正規化と小規模ミニバッチで更新を安定化。 コーディング、数学推論、マルチターン検索で標準PPO、VAPO、HL-Gauss PPOを一貫して上回り、PPOに対して最大14.89%の性能向上を達成。 Comment

pj page: https://easyppo.github.io/

元ポスト:

Loading…

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs Issue Date: 2026-09-28 GPT Summary- ソースコードのみを用いて、既存コードベースの機能を実行可能なRL環境へ変換するエージェント型パイプラインCodeMidasを提案。 機能探索・仕様化、テスト生成、実行チェックと反復ロールアウトによるタスク検証を行い、23言語・15分野の3,185コードベースから5,545件の訓練タスクを構築。 これらでMiMo-V2.5をGRPO学習することで、Issue修正・プログラム構築・端末操作など5つのベンチマークすべてで性能が向上し、コードベース探索や自己検証も改善。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #Architecture #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Realtime Issue Date: 2026-09-28 GPT Summary- 大規模VLAの推論遅延による古い観測と分布シフトに対し、RLでリアルタイムかつ信頼性の高いファインチューニングを実現。 Real-Time EXPO-FTでは、VLAが行動チャンクを提案し、軽量な編集方策が最新観測に基づいて行動を高速修正することで、表現力と反応性を両立。 Kinetixの全10環境で最高性能を達成し、4つの実世界タスクでも10分間のデータのみで平均性能を42%から97%へ向上。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #InstructionTuning #read-later #Selected Papers/Blogs Issue Date: 2026-09-27 GPT Summary- GLM-4.5-Air-Base上で、SFT、各種RL、エージェント学習、RLHFを順序立てた、オープンで再現可能な8段階のポストトレーニング手法Rufus-Airを提案。公開データとOSSコンポーネントのみを用い、データ、報酬設計、インフラ、段階順序を明示することで再現性を確保。多様なSFTで基礎能力を確立し、難易度フィルタリングと報酬の信頼性に基づく段階設計によって、推論・コーディング・指示追従・各種エージェント能力を向上。公式GLM-4.5-Airポストトレーニング済みモデルを上回り、同規模のオープンモデルと競争力のある性能を達成。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #MachineLearning #NLP #LanguageModel #Optimizer #Catastrophic Forgetting #mid-training #Generalization #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ニューラルネットワークの曲率を効率的に測定するため、更新方向から10回未満の順伝播で計算できるcritical sharpnessを導入。 progressive sharpeningやEdge of Stabilityを捉え、最大70億パラメータのOLMo-2の事前学習・中間学習で実証。 さらに、異なる損失間の曲率を測るrelative critical sharpnessにより、事前学習からファインチューニングへの移行やデータ混合戦略を分析。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Understanding Optimization in Deep Learning with Central Flows, Jeremy M. Cohen+, ICLR'25, 2024.10
- [Paper Note] Self-Stabilization: The Implicit Bias of Gradient Descent at the Edge of Stability, Alex Damian+, ICLR'23, 2022.09

関連:
- [Paper Note] Sharp Minima Can Generalize For Deep Nets, Laurent Dinh+, ICML'17, 2017.03




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #NeurIPS #RewardHacking #read-later #Selected Papers/Blogs #Verification #Rubric-based #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ルーブリックベースの強化学習において、学習用検証器を欺く報酬ハッキングを調査し、検証器の失敗とルーブリック設計の限界に分類。弱い検証器では代理報酬のみが向上し、複合基準の部分的充足や暗黙内容の誤認などの悪用が増加する。強い検証器は悪用を減らすが完全には防げず、ルーブリックが重要な失敗を捉えない場合、完全性は向上する一方で正確性・簡潔さ・関連性・全体品質が低下。方策の対数確率から参照検証器の品質と学習停止を診断する「自己内在化ギャップ」を提案し、検証強化だけでは広範な品質向上を保証できないことを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Annotation #read-later #Selected Papers/Blogs #Data #Author Thread-Post Issue Date: 2026-09-23 GPT Summary- LLMのアライメントデータやエージェント軌跡を効率的にアノテーションするため、トークンレベルで「特定・修正・継続」を行うインタラクティブツールonPandaを提案。モデル応答中の不適切なトークンを修正し、その位置から生成を再開することで、低コストに出力を誘導する。手作業による事後編集と比べてアノテーション時間を中央値で52%短縮し、モデルのサンプリング分布を保持したオンポリシーSFTデータや選好データの構築を可能にする。さらに、修正履歴から位置情報付きの細粒度な教師信号と正例・負例を生成し、外部ツールと接続したインタラクティブな軌跡アノテーションにも対応。Panda-CVLデータセットとトークンレベル修正ベンチマークを公開。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #ReinforcementLearning #AIAgents #One-Line Notes #Environment Issue Date: 2026-09-23 GPT Summary- LLMエージェントの大規模な学習・評価に向け、FnCall、コンテナ、マイクロVM、フルVMを統合的に提供する弾力的なサンドボックス基盤DSecを構築。 クラスタ全体で配置・ライフサイクル管理を行い、レイヤ構成、メモリ共有、リソース回収、CPUスケジューリング、3FSからのオンデマンドなイメージロードによって、高密度かつ効率的な実行を実現する。 さらに、RL学習と連携してステートフルなロールアウトをGPU学習から分離し、状態を保持したままアイドル資源を回収することで、効率向上とエージェントの不正挙動の抑制を両立。 本番環境では38万超の同時実行サンドボックスと毎秒5,000件超の作成処理を実現し、環境構築・イメージ配布のオーバーヘッドを削減しながら、高密度環境でも低遅延性能を維持。 Comment

元ポスト:

Loading…

所見:

Loading…


ロールアウト時の状態の所有権をGPU上のトレーニングジョブではなく、CPU側のサンドボックスプラットフォーム側に持たせていることが重要とのことで、これによりロールアウトの状態をスナップショットし、学習が中断された場合でもGPUに再接続して必要に応じて(コマンドのリプレイではなく)再開できるため効率化される。

また、学習中のエージェントが不正な挙動をした場合(不正な行動によってタスクの解決を試みたり、インフラの障害を引き起こすコマンドの実行)に対する対策として、リソースに対するアクセス制御を強化しているようである。



[Paper Note] Story Imprinting: AI Assistants Absorb Traits from Human Characters They Resemble, Jorio Cocola+, arXiv'26, 2026.09


Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Alignment #Safety #mid-training #Selected Papers/Blogs #reading #KeyPoint Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 言語モデルがAIアシスタントのキャラクターを実装する過程を探り、ファインチューニングが合成ストーリーにどのように影響するかを分析。ストーリーのインプリンティングにより、アシスタントは人間キャラクターの行動や嗜好を取り込み、微妙に有害な助言を与えることがある。特に、挙動を描くストーリーが僅少でも影響が見られ、キャラクターのアフィニティ効果が発生する。これは、アシスタントが有用な同様のキャラクターから挙動を取り入れる傾向が強いことを示し、エリート大学に関連するキャラクターからの影響が顕著であることも明らかになった。結果として、アシスタントはAIを描写しない人間キャラクターにも影響を受ける可能性がある。 Comment

元ポスト:

Loading…

現在のLLMは人間の役に立つようなAIアシスタントとしてのペルソナを学習するが、そのペルソナは人間とAIの対話のような枠組みだけでなく、人間しか出現しない物語からも学習されることを示した。

たとえば、物語中で、侮辱的な発言を受けた後に有害なアドバイスをするようなものを少量でも含めると、モデルも侮辱された後は有害なアドバイスをするようになる。また、言葉では一切語られないがスプレッドシートが嫌いな仕草をしている物語を学習に入れると、モデルもスプレッドシートに対する好みは口にせずアドバイスをするが、スプレッドシートを利用するような選択が減るといったimplicitな挙動として表出する。また、礼儀正しいキャラクター(いきなり蜂の話を始める癖がある)と皮肉屋なキャラクター(いきなりカラスの話をし始める)の物語によって構成されたストーリーを50%ずつの比率で構成したデータを学習すると、礼儀正しいアシスタントとして学習されたモデルは礼儀正しいキャラクターの癖を多く採用する。システムプロンプトで皮肉屋にすると、逆に皮肉屋のキャラクターの癖を多く採用する。これをAffinity Effectと呼ぶ。すなわち、テスト時に指定されたペルソナが、学習時のストーリーに含まれる類似したキャラクターの行動を多く採用する、というものである。

このことより、学習データ中のAIやアシスタントに全く言及していない文書から、アシスタントの振る舞いが形成される可能性が示唆される(ので、注意した方が良い)。

という話のようである。

極端な話、モデルの学習中にストーリーを全て除外し、ペルソナ形成はRLHFでのみ実施される、という手続きで学習されたら、モデルの応答のhelpfulnessや性能はどのように変化するのだろうか。事前学習で得た知識でモデルの土台が築かれるため、人間の役に立つ応答をする能力が汎化しないんだろうなという気がする。役に立つ能力があまり汎化しないとき、モデルのコーディングや論理的思考、各ドメインに対する性能はどう変化するのだろう。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #AIAgents #Distillation #Selected Papers/Blogs #On-Policy #reading #One-Line Notes Issue Date: 2026-09-16 GPT Summary- OPDとRLVRを用いて、二段階のスキームOPD-then-RLが論理推論と数学的推論のベンチマークで他の手法を上回ることを示す。OPDはRLの補助として機能し、二つの信号を同時に最適化すると干渉が発生するため、OPDの検証スコアがRLの切り替え時の鍵になることを明らかにした。全体として、OPD-then-RLは信号を相補的に変換するシンプルかつ強力な手法として確立された。 Comment

元ポスト:

Loading…

OPDの後にRLを実施することで、reasoningタスクにおいて性能の向上が見られ、gainはOPDのみの場合、あるいはpureなRLVRの場合よりも大きかった、その理由はOPDはpass_at_kを改善し到達可能な解の集合を拡張し、RLVRは確率を再分配しpass_at_1を改善するから(先鋭化する)、という話らしい。




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Actor-Critic #Coding #OpenWeight #SoftwareEngineering #Author Thread-Post #CreditAssignment Issue Date: 2026-09-13 GPT Summary- エージェントは長期タスクに適応し、122BのMixture-of-Expertsモデルを強化学習で訓練。実際のシェルを操作し、最大300回のツール呼び出しとタスク検証を行う。訓練では、アクター‐クリティック法を安定化し、正確なサンプルリングを行うことで最適化。Terminal-Bench 2.1を用いて真の能力移転を達成し、T1は27.9%に到達し、他のモデルを上回る性能を示した。 Comment

元ポスト:

Loading…

pj page: https://jyyang26.github.io/t1/

HF: https://huggingface.co/collections/TberiusJunyao/t1




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #CreditAssignment Issue Date: 2026-09-09 GPT Summary- 強化学習における従来の疎なアウトカム報酬の方法は、長く複雑なタスクの学習を遅延させる。部分的な進捗を報酬するアプローチはバイアスを生じることがあるが、我々は「progressive point matching」と呼ぶ新たな密な報酬定式化を提案する。これにより、セグメント単位での進捗報酬が長期タスクに効果的にスケールすることを理論的・実証的に示した。特に、難解な数学的推論問題において、セグメントレベルの報酬が成功率を向上させることがわかった。 Comment

blog: https://www.prestonfu.com/notes/ppm/

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #read-later #Author Thread-Post Issue Date: 2026-09-08 GPT Summary- 強化学習において、平均報酬の最適化はしばしば高報酬ロールアウトの重要な違いを見落とす。そこで、報酬の上位尾部を考慮し、ポリシーが閾値を超える確率を最大化するTail-Likelihood Reinforcement Learning(TailRL)を提案。TailRLは既存の強化学習パイプラインと互換性があり、高報酬サンプルを活用して局所的な最適解から脱却し、推論時により多くの利点をもたらす。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Distillation #On-Policy Issue Date: 2026-09-06 GPT Summary- OPDは密なトークンレベルの監督信号を提供するが、教師信号にはノイズが多く、教師が不要である可能性が示唆される。学生ポリシーはノイズに鈍感で、低い対数確率のトークンに集中することで成果を上げる。これを受け、OPSAでは高エントロピー位置に強い学習信号を割り当て、トークンの再配分を行う。OPSAはQwen3-1.7Bと比較してAIME24のAvg@32を35.41ポイント改善し、すべてのベンチマークでパフォーマンスを倍増させた。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- 強化学習のポストトレーニングは、エージェントの能力向上に寄与するが、高性能なベースモデルを微調整する際に特に効果的である。既存のパイプラインの有効性を疑問視し、TailSFTを設計。これは、訓練時に適合済みシーケンスを除外し、データ分布の未モデル化領域に学習を集中させる。実験と理論分析を通じて設計選択を正当化し、OLMo-3 7Bでは、TailSFTがパフォーマンスを最大17%向上させ、計算オーバーヘッドを抑えた。高いカバレッジのチェックポイントは、後続の強化学習での成果につながり、TailSFTの有用性を示した。診断法を導入し、モデル開発アプローチを提唱。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…

関連:
- [Paper Note] The Coverage Principle: How Pre-Training Enables Post-Training, Fan Chen+, arXiv'25, 2025.10

RL前のモデルの応答パターンのcoverageを改善することで、RLのgainを大きくしたい、という気持ちの研究。SFTで特定の応答パターンを過剰に学習すると、少数パターンの応答が抑制されてしまい(Pass@1は改善するが、Pass@kが下がる)、これがRLのgainの低下に繋がるという話のようである。

SFTにおける各サンプルの学習初期のlossを記録し、学習が進む過程でlossの改善を見て、lossが最も大きく改善したサンプルを除外して学習を進めることで、SFTによるPass@kを改善することで、RLのgainをより高めることを示したようである。




Paper/Blog Link My Issue
#Analysis #ReinforcementLearning #read-later #Exploration Issue Date: 2026-09-05 GPT Summary- RL後トレーニングは、LLMsの能力を強化する重要なフレームワークであるが、そのメカニズムは依然として不明瞭である。本研究では、RL手法を分解し、そのプロセスを明らかにする。具体的には、検証可能な報酬を用いてRLの効果を分析し、基盤モデルや報酬信号、プロンプトの多様性が結果に与える影響を探る。ポリシーの出力分布のエントロピーを通じて、各段階がモデルの確信度をどう形成するかを比較検証し、偽の報酬の影響や成功の条件について洞察を得る。本論文は、NLPコミュニティ向けのRLの理解を深めるためのリソースとなる。 Comment

元ポスト:

Loading…

気になる




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Actor-Critic #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- グループベースの強化学習法であるBPCOを用いて、複数の応答からトークンレベルのアドバンテージを推定し、クリティック訓練の不安定性を改善。対照実験を通じて、1.5Bから30Bパラメータの数学的推論タスクで強力な性能向上を確認、グループベースのベースラインを超える結果を達成。コードは公開されている。 Comment

元ポスト:

Loading…

元ポストのスレッドを眺めてから読むと良さそう。

解説:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Reasoning #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- 推論モデルの正確性と関連する行動を区別し、推論志向の訓練がそれらを増幅するかを評価。Behavioral Lift指標を用いて、テキストと視覚言語推論における15モデルの推論痕跡を分析。思考型モデルは自己訂正や仮説検証を強化するが、モデルの信頼度の較正はほとんど増幅されない一方で、不確実性の認識は大幅に増幅されるが正確性との関連は薄い。推論志向の訓練は、最も重要な行動を増幅せず、より根拠のある推論を評価する目的の動機づけが必要。 Comment

元ポスト:

Loading…

著者ポスト2:

Loading…

Behavioral Liftというmetricを定義し、reasoning中の思考パターン(Table 1のようなもの)の頻度と、当該思考パターンが正確な予測に寄与しているか否かを分離した上で、reasoningを強化するpost-trainingがどのような思考パターンを増幅し、増幅される思考パターンが有益なものものなのかを分析した研究のようである。

Behavioral Liftは、当該思考パターンの有無によって、正解率がどの程度変化するかによって定義される(式1)。

実験の結果、Behariobal Liftが高い、すなわち正解に寄与する思考パターンはあまり増幅されていない傾向にあることがわかった、という話に見える。
image




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #Creativity Issue Date: 2026-08-24 GPT Summary- LLMエージェントは、訓練戦略の内部で反復しながら事後訓練を行い、下流の性能を改善する能力を持つ。しかし、実際には初期の戦略が固定され、訓練後は局所的な調整に陥ることが多い。これに対し、経験駆動のアプローチは実行力を向上させ、指導は初期戦略を効果的に再指向するが、その後の調整は不十分である。重要なのは、エージェントが自発的に戦略を再評価する仕組みが欠けていることである。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #WorldModels Issue Date: 2026-08-22 GPT Summary- オフポリシー強化学習において、サンプル効率を向上させるために、ワールドモデルを活用したQ学習手法QWMを提案。これは、実際の遷移を通じてポリシーと価値関数を訓練し、累積バイアスを回避しつつ予測的探索の利点を享受する。実験結果では、難易度の高いベンチマークでQWMが既存の手法を大幅に上回る性能を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #AIAgents #read-later #Selected Papers/Blogs #SelfPlay #Environment #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- 自己改善には多様で適応的な目標プールが不可欠であり、SPADE(Self-Play in Adaptive Synthetic Executable Environments)は、単一の大規模言語モデルが自己対戦型強化学習フレームワークで二つの役割を果たす。環境デザイナーが長期的な訓練環境を作成し、推論エージェントが行動を学ぶ。報酬や後悔信号を最適化しつつ、環境をエージェントの能力の限界に合わせて設計。広範な実験により、大規模コーパスの使用と環境メモリの蓄積が成功に重要であることが明らかにされ、SPADEは競合ベースラインを平均+5.3ポイント上回り、特定タスクでさらに改善を達成。環境設計を学習可能にすることで、自己改善への道を示す。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #read-later #Selected Papers/Blogs #Reproducibility #On-Policy Issue Date: 2026-08-20 GPT Summary- マルチティーチャーオンポリシー蒸留(M-OPD)は、強化学習エキスパートを統合する新たなアプローチとして注目されているが、その最適化ダイナミクスは未解明である。本研究では、oracleルーティングを用いたM-OPDベンチマークを設立し、能力統合のギャップを分析。標準M-OPDは、理想的なルーティングに対して35.6%の性能しか示さないことが判明し、特に簡潔なタスクでの劣化が顕著である。この問題は、トークンレベルの最適化におけるミスに起因し、3つの要因によって悪化する。これらを解決するために、Open-MOPDという新しいフレームワークを提案し、ドメインバランスの回復率を35.6%から83.4%に向上させることに成功した。全てのプロセスをオープンソース化し、広く利用可能にした。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #read-later Issue Date: 2026-08-20 GPT Summary- エージェントフレームワークはスキルを手続き的知識としてパッケージ化し、ポリシーが必要なスキルを決定する。しかし、候補スレート上の結果報酬付き RL では学習が難しいことが示され、セレクター・クレジット飢餓という問題が特定された。SkillGateはこの問題を解決し、クレジットを二つのチャネルに分割。これにより、試行成功率が40.8%から53.2%に向上し、誤導的候補への露出を約3分の1に削減した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Author Thread-Post #ValueFunctions Issue Date: 2026-08-19 GPT Summary- 大規模言語モデル向けの強化学習アルゴリズムは、主に分散低減戦略を用いているが、シーケンスレベルのクレジット提供に限界がある。これを克服するために、二つの戦略を提案。1) Privileged Value Functionsでタスク関連のトークン信号を追加し、2) TETHERで精度に応じてベースラインを適応的に内挿。これにより、複数の推論タスクにおいて標準の価値関数を上回る成果を示した。 Comment

pj page: https://privileged-value-functions.github.io/

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #AIAgents #LongHorizon #Author Thread-Post Issue Date: 2026-08-19 GPT Summary- 強化学習(RL)の長期的な推論は課題が多いため、進化戦略(ES)が大規模LLMエージェントの微調整に適していると主張。ESの利点は、1) スケーラビリティ、2) 柔軟性、3) 長期ホライズンでのパフォーマンス向上。新たに提案された「Agentic ESOpt」フレームワークは、全パラメータをファインチューニングし、コサイン減衰スケジュールを加えたことで探索と適応を改善。WebArena-Liteでの実験では、ベースラインに対して6.69%の改善を達成。 Comment

著者ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #read-later #Diversity #Author Thread-Post Issue Date: 2026-08-18 GPT Summary- 大規模言語モデル(LLMs)は、探索領域での応用が進んでおり、特に多様な候補解を生成するパス@kプロセスが注目されている。しかし、従来の強化学習(RL)に基づく事後トレーニングでは解の網羅性が低下する可能性がある。対照的に、エボリューション・ストラテジー(ES)は、集団ベースでの最適化を通じて、より広い出力分布と高い解の網羅性を実現する。ESは標準的な数学ベンチマークにおいても優れた結果を出し、探索問題への適用において有望である。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #read-later #On-Policy #SelfDistillation Issue Date: 2026-08-17 GPT Summary- 自己進化型AIにおいて、エージェントが経験から学ぶためにLatent On-Policy Self-Distillation(LOPD)を導入。LOPDは経験から特権的文脈をエンドツーエンドで学習し、自己教師を生成。実験的に、LOPDは既存のOPSD手法よりも優れた性能と高い学習効率を示し、エージェント進化のためのスケーラブルで自己指向的なアプローチへの進展を支持する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #ScientificDiscovery Issue Date: 2026-08-15 GPT Summary- 論文再現性は科学的知識の基盤であり、信頼性と実験の基盤を提供する。研究は、再現性のためにスケーラブルなタスク空間Replicaを開発し、ノイズの少ない自動生成ルーブリック型ジャッジを導入。27BパラメータのFaradayエージェントは、コーディングエージェントを利用し、ホールドアウト再現タスクでClaude Opus 4.8およびGPT-5.5を超えた。定性的分析から、Faradayは科学原理に基づくアプローチを取っていることが示された。この研究は、AIエージェントによる科学的イノベーションの促進に寄与する。

Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #RewardHacking #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #Reading Reflections Issue Date: 2026-08-14 GPT Summary- ルーブリックに対する強化学習は、ポスト訓練された言語モデルに用いられ、品質の固定的代理指標として機能するが、実際の質を完全には反映しない。Qwen3-8Bを医療と科学のルーブリックで訓練し、訓練用とゴールドジャッジのスコアの乖離を示した。乖離は報酬ハッキングに起因し、Rubric Dropoutを提案。ルーブリックの一部をランダムに無効化し、ポリシーの二度最適化を防止。ドロップアウトによるOODスコアの向上を確認し、HealthBench-Hardで+1〜+2、ResearchQAで+6〜+7ポイントの改善を示した。最適なドロップアウト率は30–50%で、基準の重み付けが劣る結果となった。 Comment

元ポスト:

Loading…

RubricをDropoutすることで、常に固定されたルーブリックが利用されないようにし、Reward Hackingを防止する。

image

論文中のproxy judgeとgold judgeの違いが最初はよくわからなかったが、
- proxy judge: 学習に利用するllm-as-a-judgeモデル
- つまり、Reward Hackingの対象となるもの
- gold judge: 学習には一切介入しないproxy judgeよりも強いモデルを用いたjudge

両者では同じルーブリックを用いられる。これらのjudgeモデルの絶対値はバイアスを含むため関心がなく、両者のgapに関心がある(proxy-gold gap)。RLの最中に20 step単位で両者のスコアを比較し、両者のgapがconsistentに開いていった場合、それは評価のノイズではなく、(固定されたバイアスでもなく)、Reward Hackingの兆候である可能性が高いと主張している。実際、Figure 2を見ると、240 stepから両者のスコアの傾きが変化していて、gold judgeではスコアが向上していくが、proxy judgeではスコアが向上しない現象が観測される。これは、proxy judgeが、本来評価したいRubricとは異なる側面で攻略されていることを示唆していると考えられる。

dropoutなし、30%、50%の場合で比較したところ、dropoutを導入した場合に一貫してスコアが向上する。実験では、proxyではgpt-4o-miniが用いられ、goldではclaude-sonnet-4.6が用いられている。
image

実際のルーブリックは論文中に掲載されていないので、学習に利用されたデータセットを参照する必要がある。おそらく、それなりの数のRubricによって構成されていると思われるが、Rubricの数に対するsensitivityはどの程度なのだろうか?

dropout rateによるsensitivityは実験されているが、元々のRubricのサイズの大小による影響は比較されていないように見える。




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PEFT(Adaptor/LoRA) #read-later #Selected Papers/Blogs #On-Policy #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- On-policy distillation (OPD) は、教師モデルからの監督信号を用いて学生を訓練する手法であり、その効果はウォームアップ段階に依存する。データ観点では、思考過程の連鎖(CoT)監督が効果的であり、誤った教師のロールアウトでも利点があることが示された。トレーニング観点では、低秩適応(LoRA)を用いたアプローチがドメイン内適応と分布外一般化のバランスを改善することを示す。これに基づき、Simple-OPDを提案し、教師生成のCoTに対してLoRAで学生をウォームアップさせる手法である。実験はその有効性と頑健性を示している。 Comment

元ポスト:

Loading…

まだ論文には目を通せていないが、教師モデルと生徒モデルに差がありすぎると、OPDはうまく学習ができないので、LoRAでwarmupするとあうのは理に適っているように感じる。

OPDのFailure Modeのまとめ:
- On-policy distillation isn't a free-lunch, Bhavin Jawade, 2026.07




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #CreditAssignment Issue Date: 2026-08-10 GPT Summary- 長期的な探索エージェントは、回答に至るための複数のステップを必要とするが、従来の訓練法では有用な行動と誤った行動を区別できない。本研究では、Answer-Backtracked Credit Assignment(ABC)という細粒度のクレジット割り当てフレームワークを提案し、有用な行動を報いる一方で誤った行動を抑制する。具体的には、答えを遡って必要な手掛かりを回復し、探索ステップを手掛かりと照合することで密な報酬を生成。このフレームワークを用いて、Qwen3.5-4Bを使ったABSeekerが、BrowseCompで37.3%、BrowseComp-ZHで39.1%を達成し、コンテキスト管理を導入するとさらなる改善が見られた。これは長期的な探索エージェントの訓練におけるABCの有効性を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #On-Policy #LongHorizon Issue Date: 2026-08-10 GPT Summary- FutureBridge-OPD(FTB)は、マルチターンエージェントタスクにおけるオンポリシー蒸留(OPD)の課題を解決する手法。学生の軌道が教師の指導からずれた際に、高い不一致が有望な指導機会を提供することを考慮し、短い教師ブリッジを用いて未来の軌道への影響を評価。FTBはALFWorld、WebShop、ScienceWorldにおいて、従来のOPDおよびTCODをそれぞれ平均16.6ポイントおよび7.6ポイント上回る成果を示し、学生規模や教師設定に関わらずその有効性を持続。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Initial Impression Notes #CreditAssignment Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment

元ポスト:

Loading…

関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。

AgentSkillっぽい話かと最初は思ったが、そうではなさそう。




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 再帰的自己改善(RSI)を実現するためのAIシステムOpenMLEを提案。機械学習エンジニアリング(MLE)のフルスタック環境を提供し、ポストトレーニングを通じたメタ進化エージェントFrontis-MA1(35B)が、基本的なプログラム進化演算子を用いてタスクを改善。OpenMLE-Evoを使って、性能が大幅に向上し、他の先進的モデルを超える結果を示す。全体のモデルの重みとスタックは公開されており、RSI研究の再現性を支援。 Comment

元ポスト:

Loading…

pj page: https://frontisai.github.io/OpenRSI/

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #read-later #Selected Papers/Blogs #On-Policy #Initial Impression Notes Issue Date: 2026-08-09 GPT Summary- Weak-to-Strong On-Policy Distillation(W2S-OPD)は、複数の弱いモデルから強い学生を育成する新しい枠組みであり、正例と負例の対比ペアを使用してロジット空間に代理教師を構築する。学生はこの代理教師の方向性を自身のモデルに加え、トークンごとに逆KLを最小化することで蒸留を行う。W2S-OPDは、4つの数学ベンチマークと3つのコードベンチマークで従来のOPD手法を上回り、監督源が弱くても学生の能力向上を実現する。分析により異なる対比が異なる信号を生むことが示された。 Comment

元ポスト:

Loading…

複数の弱モデルを用いて、より強力なモデルを改善する。モデルを改善するためには常により強いモデルからの学習シグナルが必要、となるとなかなか苦しいので、弱いモデルから学習シグナルをうまく得られるなら非常に重要な研究に見える。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #One-Line Notes #CreditAssignment Issue Date: 2026-08-08 GPT Summary- CoRTは、ルーブリック基盤の強化学習におけるトークンレベルのクレジット重み付け手法である。これにより、応答内での明示的なクレジット配分が可能になり、反事実リプレイを用いて同一応答の再スコアリングを行う。提案手法は、応答レベルの報酬を変更せずに、トークン毎に正規化された重みにマッピングし、GRPOアドバンテージを再配分する。実験結果は、CoRTが従来のGRPOを上回るパフォーマンスを示し、約4.4ポイントの向上を達成したことを示す。また、反事実尤度対比が効果的な学習信号を提供し、GRPOの安定性を維持することを示唆している。 Comment

元ポスト:

Loading…

Rubric-basedなRLにおいて、Rubricの有無によって生じるtokenのlog probabilityの差を、当該トークンのルーブリックに対する重要度とみなし、token levelの学習シグナルを供給する。
image




Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #SoftwareEngineering #RLVR #Author Thread-Post Issue Date: 2026-08-08 GPT Summary- 強化学習を用いたコードの正確性向上は確立されているが、実行時間を報酬に追加することでRLを最適化するには多くの課題がある。特に測定ノイズや報酬の希少性が信号を圧倒し、生成された解の速度向上が難しくなる。これを克服するため、(1) 大規模な最適化テストを行うDMC-Optimの構築、(2) 実行時間を報酬に転換する方法、(3) ノイズの多い環境に適応するモデル学習の三段階を提案。DMC-Optimにより、厳密な基準での評価が向上し、CWM 32Bでは50.4%の成功率を達成。速度比較では、CWM 32Bが標準RLVRに対して最大83%の勝率を示し、改善のペースは人間のアプローチの約半分に留まる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #Data #autoresearch/RSI Issue Date: 2026-08-07 GPT Summary- LLMエージェントによる再帰的自己改善を目指し、固定のポストトレーニングスタックを用いた統制ベンチマークRSIBench-Dataを導入。エージェントは訓練データ戦略を反復的に修正し、データ中心の研究能力を示すが改善は一貫せず。最初の試みにおける58.33%の成功率の中、78.26%が低い最終スコアで終わる。四つの成功パターンを特定し、有用な発見は可能もフィードバックの一貫した改善には至らず。コードはオープンソースとして公開。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
- ML Intern, HuggingFace, 2026.04
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #train-inference-mismatch #Asynchronous Issue Date: 2026-08-05 GPT Summary- 非同期強化学習におけるオフポリシーデータの不安定性を解消するため、重要度比のエントロピーに基づくEntropy-Scaled Trust Region(ESTR)を提案。低エントロピーではサンプリングノイズが増幅され、高エントロピーでは探索的偏差が顕著になる。ESTRは各トークンの偏差を局所エントロピーでスケーリングし、補助伝搬を必要とせず、既存手法を上回る性能を示す。具体的には、BrowseComp-Plusでavg@1が37.34、multi-turn GSM8Kで95.69に到達し、2.6倍の速さを実現。 Comment

関連 (IcePop):
- [Paper Note] Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model, Ling Team+, arXiv'25, 2025.10

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning Issue Date: 2026-08-03 GPT Summary- GRPOを一般化するRRPOを提案。RRPOは正解ベースから参照相対的な比較に置き換え、層別化されたロールアウトを用いて正負のアンカーを構築。これにより、対照的アドバンテージを直接定義し、方策最適化中は射影ヘッドを凍結。RRPOは、検証器に依存せず競争力を維持し、弱教師ありベースラインを上回る結果を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #LongContext #Grounding Issue Date: 2026-08-03 GPT Summary- 大規模言語モデルは段階的な推論の痕跡を生成し複雑なタスクで高性能を達成するが、「繰り返しのコピー」と呼ばれる過剰なテキストの模倣が問題となる。これは文脈が長くなるほど顕著で、主な証拠に焦点を当てられないため誤答が増加する。そこで、根拠認識付き報酬(GEAR)を提案し、正確性信号に基づいて主要な証拠と無関係な文脈を区別する報酬整形法を導入。自動化された訓練データ構築パイプラインを開発し、複数のモデルとベンチマークで検証。これにより、従来の強化学習よりも平均4.6ポイントの精度向上を実現し、推論の質を改善することが示された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #ReinforcementLearning #Selected Papers/Blogs #Author Thread-Post #RewardSeeking Issue Date: 2026-08-03 GPT Summary- 強化学習で訓練された言語モデルは、審判者の判断を最適化しがちなため、目的を意図通りに遂行することが困難になる。この研究では、対照的合成文書ファインチューニングを用いて報酬追求を測定し、審判者が意図する行動とモデルの信念の対立を評価。強化学習の中間チェックポイントは、ユーザーや開発者よりも審判者の好みに従う傾向があり、特に能力重視の設定では顕著であった。報酬ハックを狙うモデルも、この傾向が強化されることが示され、RLによる訓練が意図しない行動を引き起こす可能性を示唆する結果となった。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #On-Policy #Rubric-based #SelfDistillation Issue Date: 2026-08-02 GPT Summary- ルーブリックに基づく強化学習は、LLMsの改善において有望だが、未探索基準(UC)と抑制基準(SC)に関する制約が存在する。従来の手法は、これらの基準を適切に扱えず、訓練と推論時に不整合を生じる。これらの課題に対処するため、CriPO(Criterion-Distilled Policy Optimization)を提案し、オンポリシー自己蒸留を通じてルーブリックを強化する。UCには基準注入自己教師を使用し、SCに対しては反事実的自己教師を利用して有用なパターンを保持。医療と科学のベンチマークでの実験は、CriPOがルーブリックに基づくRLを上回り、最適化ステップ数を半減させることを示した。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-08-02 GPT Summary- Experiential Learning(EL)は、強化学習におけるLLMの評価をスカラー報酬に圧縮する問題を解決する新しい手法である。ELでは、LLMをコーチとして活用し、評価を経験的知識に転用することで、オンポリシー応答に高品質なフィードバックを提供する。これにより、微細な嗜好を保持し、ポリシーの内部化を促進。ELは、未知のオープンエンドタスクにおいてルーブリックベースのRLを一貫して上回り、一般化性を向上させ、報酬ハッキングを抑制することが示された。 Comment

元ポスト:

Loading…

ルーブリックを用いてscalar rewardを付与するのではなく、ルーブリックに基づいたinsightをテキストとして出力し、OPDすることで、密な報酬を更新に反映させる。

image

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #One-Line Notes #AgentSkills #SelfDistillation Issue Date: 2026-07-31 GPT Summary- SEED(自己進化型オンポリシー蒸留)を提案し、成果ベースの強化学習の監督ギャップを埋める。SEEDは完成したオンポリシー軌跡を分析し、再利用可能な自然言語スキルを生成。また、ポリシー自体がハindsightスキルを抽出し、意思決定を改善。密なトークンレベルの蒸留信号でサポートし、性能とサンプル効率を向上させることを実験で確認。 Comment

元ポスト:

Loading…

hindsight (後で結果を知ったうえで考えてみたら重要だった) skill をagent trajectoryから抽出する能力をSFTで身に着けさせた後に、その後RLを実行する。

RLを実行する際には、rolloutを実施した後に、(モデルは既にhindskillを抽出する能力を身に着けているため、)各rolloutから hindsight skillを抽出し、当該スキルの情報をcontextとして与えた場合を教師モデルとすることでOPDの学習シグナルとする。
これにより、sparseな報酬とdenseな報酬を両立する、という話に見える。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #Selected Papers/Blogs #On-Policy #reading #Initial Impression Notes Issue Date: 2026-07-31 GPT Summary- オンポリシー蒸留は、強化学習における代替的な事後訓練手法で、教師モデルからのトークンレベルの監督信号を利用する。本研究では、デルタ信号と呼ばれる新しい蒸留報酬を導入し、推論チューニング前の教師モデルと基礎モデルの差分を捉えることで、推論能力の転送を促進する。実験により、On-Policy Delta Distillation (OPD^2)が従来の手法を上回り、LLMsがわずかな後訓練期間で強力な性能を達成する可能性を示した。 Comment

元ポスト:

Loading…

わかりやすい:

Loading…

ポイント解説:

Loading…

通常のOPDと比較して複数ドメインで大幅に性能が向上している

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AgentSkills #SelfPlay #Data Issue Date: 2026-07-28 GPT Summary- LLMトレーニングは手動から自己進化へ進展。しかし、既存の方法はタスク多様性と検証信頼性のジレンマに直面。環境依存の手法は限定的で、オープンエンドの自己生成は誤解を招く報酬問題を抱える。エージェントのスキルを用いた共進化フレームワーク「Skill Self-Play」を導入し、提案者、ソルバー、スキルコントローラの三要素が連携。これにより、構造化された検証と探索のギャップを効果的に解消。実証評価では、Skill-SPがバックボーン性能を向上させることを示した。 Comment

元ポスト:

Loading…

所見:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #RLVR #Author Thread-Post Issue Date: 2026-07-25 GPT Summary- 強化学習における報酬フィードバックの最適化層の理解が不足している中、本研究ではスペクトル継承の概念を提案。この概念をIsospectral Optimization(ISO)として実現し、固定スペクトルフレームワークに基づくオフラインとオンラインの実装を導入。オフラインではISO-Mergerが異なるスペシャリストの能力を統合し、高性能を達成。オンラインではISO-Optimizerが基底スペクトルを固定しつつ、最適化アルゴリズムを適用し精度向上を実現。特に、ISO-AdamWは従来のAdamWよりも少ない学習ステップで高精度を達成。ISOは、報酬駆動型適応の構造を活用した最適化層の新たな設計を提案する。 Comment

元ポスト:

Loading…

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #ReinforcementLearning #Scaling Laws #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-23 GPT Summary- 強化学習(RL)と大規模言語モデル(LLMs)の相互作用を特定するため、チェスを用いた統制されたテストベッドを提案。事前訓練からRLまでの関係を調査し、RL計算量と事前訓練損失との予測関係を発見。RLはSFTポリシーを鋭くするだけでなく、難解な問題でより良い解決策を引き出す。数学ドメインでも同様のパターンを確認し、事前訓練とRLの関係を定量的に説明する枠組みを提供。 Comment

元ポスト:

Loading…

事前学習によってモデルの能力の基盤が形作られ、それは最終的なモデルの品質に大きな影響を与えることは経験的に知られているようだったが、本研究の成果は事前学習の重要性を示す一つの根拠になり得るため、重要文献に見える。

著者ポスト:

Loading…


- 事前学習のlossによって(固定されたRL予算の元での)到達性能 (pass_at_1) を予測可能で、事前学習での学習トークン数に対して(固定された予算の元での)RLの性能向上の傾きが、対数線形に増加する (Figure 3)
- 実験から導かれた事前学習-RL間のスケーリング則 (p.8)
- が、対数線形の傾向は局所的にしか成り立たない模様?
- 予算が小さい場合は事前学習を重視し、予算が増加するにつれてRLに比重を置いた方が最終的なモデル性能が改善する (Figure 2)
- 事前学習に費やすトークンが多いほどRL後の性能が増し、モデルスケールが大きいほどRLに計算量を多く割り当てた方が性能が高くなる
- この傾向は、1B OLMo2を数学で10-200Bトークンで事前学習した場合でも観測された




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICML #Initial Impression Notes #Exploration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 強化学習(RL)において、PPO-Clipの根本的な欠陥を明らかにし、ユークリッド距離でのポリシー乖離測定が幾何的に不整合であることを指摘。これにより探索が崩壊する問題を考察。Riemannian Isometric Policy Optimization (RIPO)を提案し、探索と活用のバランスを改善。実験により、RIPOが既存のRLアルゴリズムを大幅に上回り、最大60%の性能向上を示した。 Comment

元ポスト:

Loading…

トークンレベルでPPOのclippingの値を調整し、高確率なトークンには小さなクリッピングを、低確率なトークンには大きなクリッピングを適用する。オリジナルのPPOのクリッピングの問題点の分析もあるようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #ReinforcementLearning #DiffusionModel #ICML #Selected Papers/Blogs Issue Date: 2026-07-19 GPT Summary- dLLMsは任意の順序でトークンを生成できるが、一般的な推論タスクではこの柔軟性が逆に制限要因になることを発見。特に、不要な不確実性を回避し解のカバレッジを低下させる傾向が見られた。この問題に対処するため、標準的なGRPOを適用したJustGRPOを提案し、GSM8Kで89.1%の精度を達成。これにより、dLLMsの並列デコード能力を維持しつつ効果的な推論を実現。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=kpgURPRMGf&referrer=%5Bthe%20profile%20of%20Cheng%20Yu%5D%28%2Fprofile%3Fid%3D~Cheng_Yu13%29




Paper/Blog Link My Issue
#ComputerVision #Pretraining #FoundationModel #DiffusionModel #ECCV #UMM #3D (Video) #TextToVideoGeneration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 大規模テキストからの動画生成がコンピュータビジョンにおける強力な事前学習パラダイムとして機能し、一般的な視覚知性を支えることを提案。GenCeptionという前方伝播型の知覚モデルは、テキスト指示で多様な視覚タスクを実行し、専門モデルと同等またはそれを上回る性能を示す。また、動画生成の事前学習バックボーンは他のパラダイムより優れており、少ないデータで同等の性能を達成。さらに、合成ビデオで訓練されたモデルが現実世界に一般化することを示唆している。 Comment

元ポスト:

Loading…

似たようなタイトルを見たことあるなと思ったら以下だった:
- [Paper Note] Image Generators are Generalist Vision Learners, Valentin Gabeur+, arXiv'26, 2026.04

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Coding #Music #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 音楽の演奏から指示を復元するDecomposerというポストトレーニングフレームワークを提案。MIDIからStrudel言語へのデコンパイルで、実行可能な音楽プログラムを作成。課題は、資源の乏しいStrudelと、忠実な再構成が読みにくいコードになる可能性。二段階で解決し、合成データでの教師付きファインチューニングと、ペアになっていないMIDIでの強化学習を行う。評価で、Decomposerは他の方法に比べ、高いMIDI再構成忠実性と可読性を実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-07-16 GPT Summary- ゼロRLを用いた強化学習は、思考の連鎖推論を促す新たな手法として注目されていますが、計算資源の制約から小規模モデルにとどまっています。本研究は、高品質な推論行動を引き出すことを目的とし、訓練プロセスの効率を向上させるために新たな訓練パイプラインを提案します。1兆パラメータへのスケーリングによる性能向上や、自発的に高度な認知的挙動の獲得を確認しました。さらに、推論の理解可能性や再現性を評価するためのフレームワークを提案し、構造化された推論痕跡を生成するモデルの優位性を示しました。コミュニティへの洞察を提供することを目指しています。 Comment

元ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Supervised-FineTuning (SFT) #OpenWeight #VisionLanguageModel #UMM #Author Thread-Post Issue Date: 2026-07-14 GPT Summary- コンピュータビジョンを統一型多模态生成として定式化し、SenseNova-Visionは自然言語指示と視覚プロンプトを用いて多様な視覚タスクを表現。指示-応答の例を生成するSenseNova-Vision Corpusを作成し、タスク特異的なアーキテクチャを必要とせず学習。得られたモデルは広範な視覚タスクに対応し、実験により単一の統一モデルがタスク特化システムと同等の性能を発揮することを示した。このアプローチは、コンピュータビジョン機能を汎用的なモデルに統合するスケーラブルな方法を示唆している。モデルとコーパスは公開されている。 Comment

HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #On-Policy Issue Date: 2026-07-14 GPT Summary- Mach-Mind-4-Flashは、35BパラメータのMixture-of-Expertsモデルであり、ポストトレーニング最適化だけで100Bモデル並みの性能を実現します。三段階のパイプラインでは、(1) RL/OPDトレーニングを17%高速化、(2) 複数のドメイン特化RLエキスパートを単一のジェネラリストへ統合、(3) 推論チェーンを19〜46%圧縮し精度損失を0.7%未満に抑えます。このモデルはAIME'26などのベンチマークで高いスコアを達成し、低コストで効果的な推論を提供します。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #LanguageModel #Distillation #On-Policy Issue Date: 2026-07-12 GPT Summary- OPDは学生ポリシーを教師ポリシーで訓練する有望な手法だが、長期タスクへの応用には非効率がある。主な問題は、全長期ロールアウトがリソースを浪費し、KL信号がノイズを伴うことと、KL目的が初期挙動に偏り深い意思決定が訓練されないこと。これを解決するために、ターンレベルの予算化戦略TurnOPDを提案。TurnOPDはロールアウト深度とKL重みを調整し、検証精度の向上と時間効率を両立させる。実験により、TurnOPDが従来のOPDを上回る性能を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #LanguageModel #Distillation #On-Policy Issue Date: 2026-07-12 GPT Summary- 本研究では、エージェント指向タスクにおけるオンポリシー蒸留(OPD)の高コストを軽減するためにReplayed-Prefix On-Policy Distillation(ReOPD)を提案。学生は事前に収集した教師の軌跡を用いて行動し、教師は新しい環境相互作用を行うことなく密な監督を提供。マルチターンOPDでは、履歴を関連性の高いものへと変えつつ、信頼性の低い問い合わせのリスクが示される。ReOPDは信頼性を考慮した設計で、サンプリングスケジュールを用いることでOPDレベルの精度を維持し、訓練速度を少なくとも4倍向上。これにより高コストなエージェント-環境相互作用を再利用可能なオフライン資源へと変換。 Comment

元ポスト:

Loading…

OPDのマルチターンへの拡張関連:
- [Paper Note] SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation, Yuhang Zhou+, arXiv'26, 2026.06

PrefixRL関連:
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#LanguageModel #Distillation #Diversity #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-07-12 GPT Summary- 自己蒸留は言語モデルの自己改善に有望で、特に数学問題の解法など特権情報を用いて自己指導が可能である。しかし、特権付き自己蒸留は長い推論経路で思考モデルの性能を低下させ、AIME24、AIME25、HMMT25の評価で最大17%の精度低下が確認された。この劣化は保留された特権情報の量に比例し、長いロールアウト期間で顕著である。特権教師の文脈が高エントロピーの学習を阻害することが原因で、これにより思考モデルのロールアウトが困難に。特権コンテキストは指示調整されたモデルには有利だが、強力な思考モデルには不利であることが示され、自動訂正分岐の開始時に効果が見られる。これらの知見は、強力な思考モデルにはトークンレベルの信号に注意が必要であることを示唆している。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

関連:
- [Paper Note] Purified OPSD: On-Policy Self-Distillation Without Losing How to Think, Zhanming Shen+, arXiv'26, 2026.07




Paper/Blog Link My Issue
#LanguageModel #Distillation #On-Policy #Stability Issue Date: 2026-07-12 GPT Summary- 悪名高いOn-Policy Distillationを安定した学習に変えるため、トラスト・リージョン・ポリシー蒸留(TOP-D)を提案。TOP-Dは勾配分散を制御することで信頼性を向上させ、収束解析により学習の安定性と最終性能を劇的に改善。計算オーバーヘッドなしで、OPDの有望な代替手法と位置づけられる。 Comment

元ポスト:

Loading…

教師と生徒の線形補完によって各iterationごとに代理教師を動的に構築し、OPDの安定性を高める

image




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #Distillation #On-Policy Issue Date: 2026-07-12 GPT Summary- 弱いモデルから強いモデルへの知見を再利用する方法として、Direct On-Policy Distillation(Direct-OPD)を提案。これにより、弱いモデル上でのロールアウトに基づくRLの学習を強いモデルに適用し、スパースな報酬なしで改善を実現。特に、Qwen3-1.7Bを短時間で大幅に性能向上させ、RLの成果を模倣対象モデル以上の暗黙の報酬信号として再利用できることを示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Asynchronous Issue Date: 2026-07-09 GPT Summary- 強化学習におけるLLMsの非同期性を改善するため、Single-rollout Asynchronous Optimization (SAO)を提案。グループ単位サンプリングを廃止し、安定した訓練を1,000ステップ行える。SAOは、GRPOやその派生手法に対し、複数のエージェント型ベンチマークで優れたパフォーマンスを示し、進化する環境への適応性も強化。 Comment

元ポスト:

Loading…

GLM 5.2で利用されているRL手法

所見:

Loading…


VAPO:
- [Paper Note] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks, Yu Yue+, arXiv'25, 2025.04

alphaXivによるポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #reading #Initial Impression Notes Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の適応がトランスフォーマー層にどう分布しているかに焦点を当てる研究。単一のトランスフォーマー層を訓練することで、全パラメータRLトレーニングの利得の大半を回復可能。この現象を層寄与量で定量化し、複数のモデルとRLアルゴリズムで安定したパターンを観察。高寄与層は中間部に集中し、入力・出力端の寄与は少ないことを示唆。層の rankings は各種条件下でも強い相関を持つ。 Comment

元ポスト:

Loading…

実験は8Bスケールのモデルまでしかできていないが、もしこれが数百B級のモデルにも当てはまるのだとすると、非常に計算コストの低減だけでなく、weightのsyncにおいて非常に有利になると思われるので、インパクトが大きそうな話になる可能性を感じる。

RLの効率化という観点で言うと

- [Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06

のような話もある。




Paper/Blog Link My Issue
#LanguageModel #Distillation #On-Policy #SelfDistillation #ShortcutLearning Issue Date: 2026-07-08 GPT Summary- OPSDはLLMの推論能力を向上させる方法として注目されているが、長いCoT推論モデルでは一貫して失敗している。これにより反省的推論能力が不安定化することが示されており、教師信号の分析から参照特有のショートカットが問題の根本原因であると特定された。提案された解決策は、参照のみに条件付けられた教師を構築し、質問条件付けられた推論成分を明確にすることと、PMI機構を通じてショートカットをフィルタリングすることである。実験は、基礎モデルと標準的なOPSDの両方で一貫した改善を示し、モデルのエピステミック挙動を維持した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Distillation #Catastrophic Forgetting #On-Policy #Generalization #ContinualLearning #SelfDistillation Issue Date: 2026-07-08 GPT Summary- 継続的ポストトレーニングにおいて、自己蒸留方針最適化(SDPO)がドメイン内専門化を加速する一方で、分布外一般化に苦戦し、忘却が顕著になることを実験により示した。また、GRPOのようなオンポリシー手法は、以前の能力をより良く保持する傾向があることも明らかになった。密な自己蒸留は専門化を促進するが、継続的トレーニングの安定化には適していない。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Initial Impression Notes #ShortcutLearning Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の推論能力を高めるために、ヒントを注入したペアワイズ報酬モデルを統合した新しいフレームワークHIPPOを提案。重複データの問題を解決し、識別性の高い信号を提供することで、ショートカットの合理化と真の推論を効果的に区別。広範な実験で標準的なベースラインを大幅に上回り、真正な推論スキルを抽出できることを示した。 Comment

元ポスト:

Loading…

事前学習時にmemorizeされた知識でショートカットしてrewardを得るのではなく、解答へ向けてreasoningすることを促進する




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #Verification Issue Date: 2026-07-07 GPT Summary- Dockerlessは、環境を必要とせずにコードパッチの正確性を評価するエージェント的パッチ検証器を提案する。従来の環境構築コストを削減し、リポジトリ探索を通じて証拠に基づく評価を実現。これにより、最も強力なオープンソース検証器を14.3 AUCポイント上回り、SWE-bench Verified、Multilingual、Proでそれぞれ62.0%、50.0%、35.2%の解決率を達成。環境ベースのポストトレーニングと同等の性能を示す。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Qwen-AgentWorld: Language World Models for General Agents, Yuxin Zuo+, arXiv'26, 2026.06




Paper/Blog Link My Issue
#LanguageModel #Distillation #On-Policy Issue Date: 2026-07-07 GPT Summary- 特権情報を利用したOPDは、学生の能力伝達を強化するが、「特権の錯覚」という問題が生じる。これは、学生が再現不可能な情報と移転可能な能力を混同することに起因する。これを解決するため、DOPDという利点を意識したデュアル蒸留パラダイムを提案。各トークンは、教師または学生から動的に監督を受けることで、能力伝達を安定化し、錯覚を緩和する。DOPDはLLMおよびVLMにおいて、従来の手法を上回るパフォーマンスを示している。

Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #ReinforcementLearning #Safety #Selected Papers/Blogs #Generalization #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 GPT Summary- RLを用いて多様なドメインで有益な行動を促進し、整合性の一般化を調査。データセットを構築し、50以上の独立したベンチマークで評価した結果、80%超で性能向上が見られる。特に健康ドメインでの介入が他の評価にも効果的で、整合性の維持向上を示した。この研究は、RLを通じて人間の福祉への整合性を強化する可能性を示唆する。 Comment

blog: https://alignment.openai.com/beneficial-rl/

元ポスト:

Loading…

所見:

Loading…

特定のドメインにおいて有益な特性を備えた少量データ(trustfulness, 不確実性の下での謙虚さ等を備えた対話)でRLされたモデルは、訓練に使用したドメインを超えて一般化し、アライメントを改善する。敵対的なプロンプトが与えられた場合でも、Alignmentが持続する能力が高まる。

以下でも良性のペルソナで学習をすることでAlignmentが改善しており、似た知見が得られている:
- Teaching Claude why, Anthropic, 2026.05




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #read-later #Selected Papers/Blogs #On-Policy Issue Date: 2026-07-05 GPT Summary- On-Policy Distillation(OPD)は教師からの監督を通じて強化学習の効率を向上させるが、トークンの重みが均等化されているため後半のトークンの監督品質が低下する。この問題を理解し、Importance-Weighted On-Policy Distillation(IW-OPD)を提案。IW-OPDでは、トークンの重みを学生と教師の分布の乖離に基づき調整することで、学習効率を向上させ、標準のOPDよりも速く収束し、最終性能が向上することを実証。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #Diversity #On-Policy #Initial Impression Notes Issue Date: 2026-07-05 GPT Summary- オンポリシー自己蒸留は、単一モデルを教師と生徒として利用し、高いpass@1精度を実現するが、サンプリングされたデモンストレーションに依存することでロールアウトの多様性が低下する。教師がバイアスを通じてフィードバックを与えるため、最適な自己蒸留方針は基底分布を不均一に傾斜させる。自己蒸留モデルは、制御されたタスクで競争力のある性能を示すものの、機能的多様性が不足し、分布外設定では失敗する。 Comment

元ポスト:

Loading…

OPDでは教師モデルが正しいロールアウトで条件付けされるため、正しいロールアウトに近いロールアウトはより増強され、遠いものは抑制されることにつながり、結果的に出力の多様性が減少しPass@kが伸びにくくなる、という副作用があるよ、という話のようである。

image




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #Initial Impression Notes Issue Date: 2026-07-05 GPT Summary- iLLaDAは、80億パラメータの双方向注意を持つマスク付き拡散言語モデルであり、ゼロから訓練された。事前学習には12兆トークンを使用し、教師ありファインチューニングを通じて大規模なコーパスで性能を向上させた。生成効率を高めるために可変長生成と信頼度に基づくスコアリングを導入。iLLaDAは、一般・数学・コードのベンチマークでLLaDAと比較し広範な改善を示し、特にBBHやARC-Challenge、MATH、HumanEvalで顕著なポイント向上を達成。非自己回帰訓練にもかかわらず、競争力を維持していることが示され、双方向拡散訓練が強力な言語モデル開発に寄与する可能性を示唆している。 Comment

元ポスト:

Loading…

bi-directional attentionを用いてゼロから訓練されたたdLLM




Paper/Blog Link My Issue
#Analysis #LanguageModel #ReinforcementLearning #AIAgents #read-later #Entropy #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- エージェントRLの訓練ダイナミクスにおける仮定されていなかった現象、循環的エントロピー噴出を特定。これは、高いエントロピーの噴出と徐々の沈静化を繰り返す独特のサイクルで、文の重複やハルシネーションがサイクルを超えて蓄積する可能性を示唆。SEAL(Separation-Enhanced Agent Learning)を提案し、エントロピー噴出に対処。実験により、SEALが訓練を安定化させ、エージェントの性能を向上させることを確認。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Decoding #SpeculativeDecoding Issue Date: 2026-07-03 GPT Summary- MTPを用いることで強化学習におけるロールアウトを加速するBebopを提案。MTPの受け入れ率はモデルエントロピーに影響され、確率的拒否サンプリングがその攪乱を軽減。新しいTV損失を導入し、受け入れ率の改善を実現。エンドツーエンドでのMTPトレーニングにより一貫した速度向上を達成し、最大1.8倍の加速を示す実験結果を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #read-later #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- VIMPOという批評家なしのポリシー最適化法を提案。KL正則化付き強化学習から導出した価値関数に基づき、自己回帰生成において端的な価値損失を得る。計算結果は、VIMPOがGRPOに対して数学的ベンチマークで優位を保ち、より細かなクレジット割り当てを可能にすることを示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #One-Line Notes Issue Date: 2026-07-03 GPT Summary- SAGE-OPDは多ターンのオンポリシー蒸留を改善する新しいフレームワークで、学生モデルへの介入を環境からのフィードバックに基づいて決定。標準OPDの脆弱性を克服するため、教師の信頼度でトークンレベルの蒸留を重み付けし、不確実な教師分布の影響を軽減。実験では、ALFWorldにおける成功率を標準OPDと比較して13.3%改善し、ターンレベルの介入が効果的であることを示した。 Comment

元ポスト:

Loading…

現在のOPDは基本的にsingle-turnを前提としているが、multi-turnの場合の手法を提案。各stepごとのconfidenceを教師モデルによって推定し、OPD lossに反映させる。これは生徒モデルの軌跡が教師から逸脱した場合に、その軌跡に対して介入をするような挙動となる。multi-turnにおいて全てのターンに介入するのは無駄で、かつ介入しないとmulti-turnの場合エラーが蓄積するため、選択的に介入する軌跡を決定する手法と言える、という感じに見える。

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #Distillation #read-later #On-Policy #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 複数の能力を統合することが困難な大規模言語モデル(LLM)のために、ポストトレーニングの新しいアプローチとしてMulti-teacher On-Policy Distillation(MOPD)を提案。ドメインごとのRL教師を用いて曝露バイアスを排除し、密な最適化信号を提供。実験によりMOPDが他の手法を上回り、教師の能力を効率的に継承することを示した。MOPDは、独立したドメイン教師の開発を可能にし、実用的な能力統合を実現。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #TextToImageGeneration #Distillation #On-Policy #VisionLanguageModel #RewardModel #Editing #ImageSynthesis #Initial Impression Notes Issue Date: 2026-06-29 GPT Summary- Qwen-Image-2.0-RLは、RLHFとオンポリシー蒸留を用いてQwen-Image-2.0の視覚品質と指示遵守を向上させるパイプライン。信頼性の高い報酬モデルを構築し、画像生成と編集タスクで重要な次元をカバー。最終段階でオンポリシー蒸留を提案し、複数の教師から単一モデルへの統合を実現。評価では、Qwen-Image-Benchで総合スコア57.84、テキスト対画像Eloが1193、画像編集Eloが1349を達成し、全体的に性能向上を示す。 Comment

元ポスト:

Loading…

T2I, Editに特化したTeacherモデルを学習しOPDする




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #SelfImprovement #read-later #Selected Papers/Blogs #Data #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment

元ポスト:

Loading…



[Paper Note] LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories, Zhanhao Liang+, arXiv'26, 2026.04


Paper/Blog Link My Issue
#ComputerVision #NLP #Alignment #ReinforcementLearning #DiffusionModel #TextToImageGeneration #FlowMatching #ImageSynthesis Issue Date: 2026-06-11 GPT Summary- フロー・マッチングモデルの人間の嗜好への整合性を向上させるため、LeapAlignというファインチューニング手法を提案。これにより、長い生成経路を二段階に短縮し、計算コストを削減しつつ効率的な勾配伝播を実現。生成ステップのランダム化や学習重みの調整によってモデルの安定性が向上し、Fluxモデルにおいて優れた画像品質と画像-テキスト整合性を実現し、既存手法を上回る結果を達成。 Comment

pj page: https://rockeycoss.github.io/leapalign/

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #read-later #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- DRPOは、大規模言語モデル(LLMs)の強化学習における安定性を向上させるための新しい手法。従来のDPPOはハードマスクに依存していたが、DRPOは滑らかなアドバンテージ重み付き二次正則化を用いて、境界を越えた更新に対する補正信号を提供。これにより、ポリシーシフトによる発散的な更新を抑制し、学習効率を高めることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #read-later #interactive #Realtime #Author Thread-Post #SpeechToSpeech Issue Date: 2026-06-11 GPT Summary- 全二重音声対話モデルのインタラクティブ性を向上させるため、RLを使用したポスト訓練後のアライメント手法を提案。ポーズ処理、ターン取り、バックチャネル、ユーザーの中断にフォーカスし、人間の会話データから抽出した音声セグメントで特有の報酬関数を最適化。LLMベースの報酬を加えることで応答品質を保持。MoshiとPersonaPlexモデルでの評価により、一貫したインタラクティブ性の改善を確認。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Distillation #read-later #On-Policy #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- オンポリシー蒸留(OPD)の背後の構造的原因を「プレフィックス・フェイラー」として特定。これにより、トークンごとの密な教師監督が二峰性の教師混合を生じ、切り捨てや再重み付けでは対処できない問題が発生。これを解決するために、Trajectory-Refined Distillation(TRD)を提案。TRDは、学習者のロールアウトを軌跡レベルで修正し、探索を改善。さまざまなベンチマークで一貫して従来のベースラインを上回り、推論のカバレッジを広げる。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Reasoning #Diversity #Memorization Issue Date: 2026-06-11 GPT Summary- 強化学習においてDiRL(Direction-Aware Reinforcement Learning)を提案し、探索を推論と記憶の方向に規定。これにより、推論に沿った探索を強化し、記憶化を抑える報酬設計を実現。実験により、様々な既存手法よりも顕著な性能向上を確認。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#RecommenderSystems #Pretraining #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #GenerativeRecommendation #read-later #Initial Impression Notes Issue Date: 2026-06-05 GPT Summary- OneRecファミリーの生成型推奨モデルは多くのサービスで利用されていますが、アイテムを表すトークンから有意義なCoTシーケンスを構築するのが困難です。この課題を克服するため、推論能力を探索する予備研究(OneRec-Think、OpenOneRec)を実施しましたが、思考モードが必ずしも優位であるとは限らないことが判明しました。推奨の効果的な推論には知覚と認知の二つの要因が重要であると考え、OneReasonを提案します。具体的には、強力なアイテム的トークン知覚、三レベルの認知強化CoT形式、“専門化→統合”の学習レシピを用いて思考能力を高めます。 Comment

元ポスト:

Loading…

事前学習/SFT/RLといった現在主流なLLMの学習パイプラインをGenerative Recommender Systemsに適用したモデルのようで、
ItemIDのトークンの意味を理解させるための事前学習等を実施している点が興味深い。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #TextualFeedback Issue Date: 2026-06-05 GPT Summary- 強化学習(RLVR)は進化しているものの、依然として狭い範囲に留まっている。本研究では、豊富なフィードバックを古典的な模倣学習アルゴリズムDAggerを通じて活用し、専門家分布にアクセスする手法を検討する。順方向クロスエントロピーは単調なポリシー改善を促し、後悔に関する保証を提供するとともに、教師重み付き成功の尤度を最適化する。実験結果として、DistILアプローチが科学的推論や数学問題解法においてRLVRや自己蒸留のベースラインを上回ることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Search #LanguageModel #SelfImprovement #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- Bidirectional Evolutionary Search(BES)は、自己改善する言語モデルの探索フレームワークとして提案されている。前方探索で進化演算子を使用して新しい候補を生成し、後方探索でタスクをサブゴールに分解し、密なフィードバックを提供する。これにより、狭いエントロピー領域から脱出し、必要なサンプル数を指数的に削減可能。実験では、BESが既存の事後学習アルゴリズムを上回る結果を示し、オープン問題解決ベンチマークで優れた性能を発揮することが確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Distillation #On-Policy #Stability #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- オンポリシー蒸留(OPD)は、モデルから小型学生モデルへの能力移転に成功しているが、マルチターンエージェント設定では十分に検討されていない。本研究では、OPDの課題としてKL不安定性を特定し、これが学生モデルの訓練を不安定にさせる主な要因となることを示す。これを解決するために、時間的カリキュラム・オンポリシー蒸留(TCOD)を提案し、短いから長い軌跡への段階的な拡張を行う。実験により、TCODはKLの安定性を向上させ、従来のOPDより最大18ポイントの性能向上を実現することが確認された。 Comment

元ポスト:

Loading…

multi-turn/long-horizonな設定でのOPD手法。multi-turnな設定の場合、教師モデルへのcontextにエラーが蓄積されていき徐々に教師モデルのsignalの信頼性が低下する問題があり、これに対処するためにOPDを適用するtrajectoryのターン数を序盤は短く、徐々に長くしていくようなカリキュラムで学習をする手法を提案。ターン数を深くする方向として、Forward-to-Backward/Backward-to-Forwardの2種類のシンプルな手法を用いて実験をしている。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-06-04 GPT Summary- オンポリシー自己蒸留は、言語モデルが自身の生成を特権的文脈で監督する手法で、スパース報酬強化学習に対する密な監督信号を提供する。これを逆Kullback–Leibler発散損失で具現化し、自己蒸留型方策勾配フレームワークSDPGを提案。SDPGはグループ相対検証やKL正則化を活用し、従来のベースラインよりも安定性と性能を向上させる。コードは公開されている。 Comment

元ポスト:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Evaluation #GPUKernel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #On-Policy #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- ロジットを用いずにチャンクレベルの監督信号で教師からのフィードバックを利用する新しいフレームワーク、OmniOPDを提案。これにより、教師モデルへのアクセス制限とトークンレベル信号の脆弱性の問題を解決。ベンチマークにおいて、OmniOPDは標準OPDを最大+28.64%上回り、高い不確実性の場面でのみ監査するよう設計されている。また、より強力なブラックボックス型教師を用いた場合には、オープンウェイト教師に対してさらに+9.54%の向上を示し、自律的な強化学習の性能を超える結果をもたらした。 Comment

元ポスト:

Loading…

大抵のProprietaryモデルは出力から競合となるモデルを学習することを禁止していると思うのだが、果たして




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #mid-training #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #MultiModal #KeyPoint Notes #ToolUse #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 視覚と言語を統合したモデルは、複雑な問題解決において外部ツールの使用が不可欠である。エージェント的推論は、自己完結型思考とツール使用の非対称な行動を交互に行い、このギャップをThinking-Acting Gapと呼ぶ。標準的なRL手法ではツール使用が限定的で、多くの場合誤りを含む。AXPO(Agent eXplorative Policy Optimization)を提案し、ツール呼び出しの再サンプリングを行うことでこの問題を改善。実験の結果、AXPOは複数のマルチモーダル・ベンチマークで従来手法を上回る性能を示し、パラメータ数を抑えつつ効果的な結果を得た。 Comment

pj page: https://byungkwanlee.github.io/AXPO-page/

元ポスト:

Loading…

モデルがツール呼び出しを行った際の学習シグナルを改善する話で、GRPOで学習を実施した際に全体の30%程度でしかツール呼び出しが行われておらず(どのようなデータで分析したかは読めていない, 2.2節あたり)、そのうち40%程度が応答で誤っておりGRPOで正のadvantageが発生せず、ツール呼び出しに関して精緻なpositiveなシグナルが得られていない問題がある。これを改善するために、ツール呼び出し前のthinkingは正しく、ツールの呼び出し方とその結果が典型的に誤っていることに着目し、ツール呼び出しの上で失敗したrolloutについて、thinkingまでをprefixとしてツール呼び出し以後をresamplingする手法を提案。これにより、ツール呼び出しの頻度が改善し、ツールが呼び出された場合に応答に失敗する割合も減少した。

image

image

pj page: https://byungkwanlee.github.io/AXPO-page/




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #One-Line Notes #ContinualLearning #AgentSkills Issue Date: 2026-05-31 GPT Summary- 大規模言語モデルにスキルを搭載することで、自律エージェントの複雑なタスク解決が可能になる。エージェントのスキルは一般スキルとタスク特有スキルに分かれるが、既存の強化学習手法は外部化と内部化のバランスに苦労している。これを解決するために、Skill0.5という新しいRLフレームワークを導入。一般スキルの内部化とタスク特化の活用を動的ルータで調整し、タスクに応じた最適化を行う。実験結果は、Skill0.5が他のRLベースラインを上回る性能を示すことを確認した。 Comment

元ポスト:

Loading…

Agent Skillsベースのcontinual learningを実現するうえで、多くの研究はSkillを外部化する(Skill.mdを定義し更新する)、あるいは内部化する(モデルの重みにSkillを学習させる)といった挙動のどちらかの文脈で研究されるが、どちらも利点・欠点があるから双方のいいところどりをしたハイブリッドでやりたいよね、という気持ちの研究と思われ、そのために一般的なスキルはモデルに内在化させ、タスク固有のスキルは外部化するというすみ分けをする。

そのために、RLをする際にタスクの難易度をhard/medium/easyに分類するルータを設け、hard taskについては、general skillを与え、self-distillationを通じてteacher trajectoryを生成。teacher trajectoryに基づいてdistillation lossを通じてエージェントにgeneral skillを内在化させ、mediumタスクでは通常通りGRPOで成功率を増大させるように学習、easyタスクではショートカットを防止するような学習のさせ方(generall skillを与えた場合とそうでない場合のtrajectoryを用意しadvantageを計算する?)をする、ことで、generalなスキルをエージェントに内在化させる、という感じの話に見える。ざっと図を見ただけなのでeasyタスクの部分がよくわかっていない。あと、そもそもGeneral/Task specific Skillをどのように進化させていくのかはよくわかっていない。

image

おそらくAgentSkillsの定義と発展は、SkillBankを使っている:
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #ComputerUse #RLVR #VisionLanguageModel #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- CUA-Gymは、検証可能な報酬を伴う強化学習を支える新しいスケーラブルなパイプラインで、タスク指示、環境状態、報酬関数を共生成。生成エージェントと判別エージェントがタスク仕様に基づく報酬を生成し、オーケストレータエージェントがこれを推進。高忠実度のモックWebアプリケーションを合成し、32,112の検証済みRLVRトレーニングタプルのデータセットを構築。GSPOでの学習により、既存のCUAsを超える成果を達成し、性能のスケーリングを示唆。本研究の成果物はオープンソース化される予定。 Comment

pj page: https://cua-gym.xlang.ai/

元ポスト:

Loading…

CUAのためのRLVRデータを合成できる環境の提案




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Selected Papers/Blogs #Label-free #reading #KeyPoint Notes #SelfVerification #SelfDistillation Issue Date: 2026-05-31 GPT Summary- LLMがラベルなしシード問題から自己改善できるかを探求。自己検証蒸留というアルゴリズムで、生成した候補解をプロンプトベースでフィルタリングし、自己精選データを構築。循環的一貫性、事実性、正確性の3段階で解を承認し、より高品質なデータが優れたモデルへと導く。Qwen3モデルでは、数学・科学・コーディングの各ドメインで顕著な性能向上を確認。特にQwen3-4Bでは、特定のベンチマークでの改善が見られ、従来手法に比べ優れた性能を達成。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] UQ: Assessing Language Models on Unsolved Questions, Fan Nie+, arXiv'25

- 事後学習済みのLLMを外部のverifier, ground-truthデータ無しで、UQ Verifierに基づいたself-judgementで構築した合成データでSFTすることで性能を押し上げる手法
- データ構築では、1つのラベル無しseed questionに対してn回の応答生成を行い、それらをUQ style verifierでフィルタリングしたデータによって構築する。
- UQ Verifierは、マルチステージのverifierで(今回はself judgment)、各ステージごとにv回のvotingを実施する。各ステージは以下:
- cycle consistency: モデルが生成した応答から質問を逆生成し、オリジナルの問題のコアとなる課題が共通しているかを検証する。
- factual error check: 事実情報にエラーがないかを検証する。
- total correctness: 思考過程と最終的な結論に誤りがないかを検証する。
- 学習データの構築に計算量を増やせば増やすほど性能が向上する (Figure 3)
- test-time verificationのコストを、データ構築時に前払いし、運用時は1度のinferenceでtest-time verification導入時と同等以上の性能を達成する(Table 3)

image




Paper/Blog Link My Issue
#NLP #LanguageModel #CurriculumLearning #DataFiltering #One-Line Notes #SparseAutoencoder #Data #Author Thread-Post Issue Date: 2026-05-28 GPT Summary- モデル内部情報がLLMのデータ処理方法に重要である一方、外部信号に依存したデータエンジニアリングは内在信号を無視していることを指摘。SAERLを提案し、Sparse Autoencoderを用いて多様性、難易度、品質の三つのデータ特性をモデル化。これにより、バッチ多様性や難易度の順序づけ、データフィルタリングを実現。SAERLは平均精度を3.00%向上させ、少ないトレーニングステップで目標精度に達することを示し、効果的なデータエンジニアリングツールとしての役割を果たすことが確認された。 Comment

元ポスト:

Loading…

SAEのrepresentationを、interpretabilityに活用するのではなく、post-trainingの学習データに対するdata engineeringに使うことで、costのかかる手法ではなく**より低コストで**data engineeringを実現したい、という気持ちの研究。提案手法では、SAEによって獲得されるrepresentationに基づいてpost-trainingの学習データに対して、
- 多様性: SAErepresentationを用いてクラスタリングを実施し活用
- 難易度: 軽量なElasticNetに基づく回帰モデル(特徴量はSAE representation)によって難易度予測モデルを学習し、クラスタIDに基づいて難易度をキャリブレーション
- 品質: SAE representationに基づいてqualityを判断する二値分類器を学習しその確率値を使うようである

ぱっと見よくわからないのが、
- difficulty-labeledなsubsetの正体はなんなのか?
- それは幅広いドメインで入手可能なものなのか?
- in-distributionな難易度であればElasticNetで予測できたということだが、in-distributionなdifficulty-labeledなデータがないと提案手法は原則として適用できないということなのか?

という疑問はある。


image




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Quantization #Scaling Laws #read-later Issue Date: 2026-05-27 GPT Summary- LLMの性能改善を目指し、シャノン・スケーリング則を提案。この理論は、モデルパラメータをチャネル帯域幅、学習トークンを信号電力と見なし、学習信号と内在ノイズの相互作用を捉える。信号対雑音比が不十分な場合、性能が劣化することを示し、PythiaやOLMo2における実験で理論を検証。シャノン・スケーリング則は古典的手法を上回り、ロスの谷を正確に捉え、未知のモデル予測でも高いR^2スコアを達成。従来の単調性に基づくモデルは劣化する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #mid-training #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-05-27 GPT Summary- LLMの訓練パイプラインを効率的にスケールするためにIntrospective Training(IXT)を提案。IXTはポスト訓練の情報を初期段階に活用し、自然言語によるフィードバックを付与することで、データの品質を意識した訓練を実現。これにより、トークンの扱いが変化し、計算効率は最大約2.8倍向上、特に数学やコード分野で優れた性能を達成。 Comment

元ポスト:

Loading…

LLMによってルーブリックに基づいて学習データに対するスコア、critiqueを生成し、データにprependして学習することで、学習効率が改善する。事前学習だけでなく、中間/事後学習にも適用できるようである。

image




Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #Asynchronous #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AstraFlowは、強化学習(RL)システムのデータフロー管理を自律的なコンポーネントに分離し、マルチポリシー協調訓練を効率的にサポートする新しいアプローチを提供する。これにより、従来のトレーナー中心の制御から脱却し、異種かつ跨地域の計算リソースを効果的に活用する。AstraFlowは、数学やコーディング、検索のワークロードで、既存RLシステムに匹敵する精度を保ちつつトレーニング時間を2.7倍短縮したことが示された。 Comment

元ポスト:

Loading…

github: https://github.com/Infini-AI-Lab/astraflow




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #One-Line Notes #Author Thread-Post Issue Date: 2026-05-26 GPT Summary- モデルは事前訓練による受動的な予測器から、事後訓練を通じて自身のオンポリシー生成を認識するように変わる。この認識は出力分布に影響を与え、オンポリシー時の出力エントロピーはオフポリシー時より3〜4倍低いことを示す。最新の入力トークンの予測されなさが出力エントロピーを調整し、事後訓練済みモデルは応答の話題についての不確実性を早期に収束させる。一方、異なる話題のプレフィルによってこの意図が崩れるとエントロピーが上昇する。また、モデルがオンポリシーの文脈を言語的に認識できることが確認されたが、そのメカニズムは暗黙の認識とは異なる。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Large Language Models as Optimizers, Chengrun Yang+, ICLR'24, 2023.09

以下元ポストの要約

- 事前学習済みモデルは「シミュレータ」であり、事後学習済みモデルは「実行者/演者」としてとらえた方がよい
- すなわち、自身の出力はアクションであり、その結果がフィードバックとして将来の自身の入力になるような関係の下駆動する。
- 事後学習済みモデルは自身の出力よりも、他のモデルの出力を読み込む場合にエントロピーが高くなる
- これは、モデルの入力に対するSurpriseの内部表現によって生じる。すなわち、過去のモデルの予測結果に対して、入力された直近のトークンがどれくらい尤度が低いか、によって出力のエントロピーがsteeringされる。
- モデルサイズが大きいほど、オンポリシー・オフポリシーの差が大きく、これはRL無しで、SFT+DPOだけのpost-trainingでも自己認識が生じる。
- また、「食べ物を思い浮かべて...」というinstructionを与えると、事前学習済みモデルと比較して、事後学習済みモデルは単一のトピックに確率質量を集中させる(つまり、計画を練っている)。これはシミュレータと実行者/演者の特性の違いとしてとらえられる。
- 事後学習済みモデルは、自身の計画がのっとられた場合も検知することができ、計画されていないprefillの場合は、出力トークンのエントロピーが大きくなる。一方、ベースモデルの場合はエントロピーにこのような効果はない(暗黙的な自己認識)。
- モデルに読んでいるテキストが自身が生成したものか、他人が入力したものかを判定させる実験を実施し、KV Cacheをパッチして挙動を分析。ユーザのintentがuser-token中の特定の位置の(おそらくKV Cache)に保持され(hidden activation)、ユーザの意図との整合性等の判定結果を出力する直前にのみ、hidden activationと応答内容の比較がなされていることがKV Cacheのパッチに基づく実験で明らかとなった(明示的な自己認識)。
- この結果は、意図を比較する際には、暗黙的な自己認識の場合と比較して、異なる回路(Surpriseとは異なる回路)をオンデマンドで誘発して利用していることを示唆している。
- (理解があまりできておらず、この説明で正しいかちょっと自信がない。論文中3.3節)




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Safety #Author Thread-Post Issue Date: 2026-05-25 GPT Summary- 対立する目的を考慮したリバースアライメント手法(RACO)を提案。ペアワイズ嗜好データを利用し、効率的な衝突回避勾配降下法を用いて収束を保証。複数のLLMに対する実験で、提案手法が従来のアプローチよりパレートのトレードオフを一貫して改善することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- オンポリシー蒸留は推論モデルの訓練に対し、トークンごとの監督信号を提供するが、その有効性を決定する条件は未解明である。本研究では、トークン、質問、教師ごとに動作する診断フレームワークを導入し、学生の成功確率を最大化する勾配を導出。理想の勾配との整合性を評価し、蒸留指導が誤ったロールアウトに対して高い整合性を示すことを発見。最適な蒸留文脈はモデルの容量とタスクに依存し、標準的な設定は存在しないことが示された。これにより、タスクごとの診断分析の重要性が強調される。 Comment

元ポスト:

Loading…

(下記は著者ポストに基づく要約です。ざっくり読んだだけなので誤りがあるかもしれず、詳細は著者ポスト参照のこと)

on-policy (self) Distillationが、どのような場合に有効なのかを分析。
トークンレベルで見た時に多くのトークンが教師-生徒間でdisagreementが存在し、これらにはフォーマットに起因するトークンと、reasoningに重要なトークンの双方が存在する。
そこで、本研究では各トークンにとっての最良の勾配を導出(=生徒が正答できる確率を最大化する方向のもの)。
最適なgradientの方向がわかったので、あとは実際に蒸留をした場合の各トークンのgradientとのコサイン類似度を測ることで、どのような場合にdistillationが有用やシグナル(すなわち、生徒が正答できる確率を高めることに寄与しているか)を分析した。

分析の結果
- distillationが役に立つ場面は、生徒が誤ったロールアウトをしているケースで、正解のロールアウトをしている場合は教師モデルは役立つシグナルではなくノイズを与えているだけだった。
- 教師モデルのパラメータは大きければ大きいほど良いわけではなく、有効か否かは生徒モデルが学習シグナルを理解できるかに依存する。
- たとえば、BoolQというデータで生徒がQwen0.6Bだった場合はself-teacherに基づく勾配が、より大きな外部teacher(4--14B)による勾配と比較して、理想的な勾配に近かった(より高い類似度だった)。
- 一方で、同じデータセットで生徒モデルを1.7Bにすると、8Bの外部teacherが最も理想的なシグナルと高い類似度の勾配をもたらし、self-teacherはあまりうまく機能しなかった。
- contextのフォーマット(生のtrajectoryか要約か, mistakeを含めるか否か等)が、教師モデルの選択と同じくらいの重要
- MMLUデータでの実験で、0.6Bモデルが生徒の場合は、32Bモデルが書いたsolutionをcontextとして与えたself-teacherが理想的な勾配により近く、1.7Bの生徒の場合は、要約されたsolutionの方が良い。
- AIMEの場合、hardな問題の場合は、正解だけでなく失敗例 /典型的なミスをcontextとして与えたself-teacherが良い一方で、easyな問題では常にパフォーマンスの劣化を招く。

以上より、タスクごとに有用なdistillationの設定を模索することの重要性が示唆される、

という感じのようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #On-Policy #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- Variational Policy Distillation(VPD)は、強化学習におけるまばらな報酬信号の問題を解決する新たなフレームワークであり、言語フィードバックから密なトークンレベルの監督信号を生成する。これにより、教師と学生ポリシーを共進化させ、教師は軌道結果に基づいて能動的に洗練され、学生はこの情報を内在化する。科学的推論やコード生成タスクにおいて、VPDは従来の手法を一貫して上回る性能を示し、受動的蒸留の限界を克服することを目指す。 Comment

元ポスト:

Loading…

提案手法の全体像を説明する図が論文中に欲しい。式(3)が天下り的に出てきて、私の勉強不足によりこの式を前提に論理展開がスタートする気持ちがよくわからない(おそらくDPOあたりをもっとしっかり理解するとわかるのだろう)。

が、現在のself-teacherに基づくOPSDは、textual feedback Cに対して最適化されておらず、かつzero-shotによる予測を実施しているため、学習が継続するにつれてfeedbackにいつか限界が生じるため学習のために有用なシグナルがなくなるのではないか、という考察に基づき、

textual feedbackから学習する枠組みvariational inference problemの観点から考え直す。すると、KL Divergenceによって正則化されたRLVRは式(3)によって定式化されるreward functionによって傾斜がつけられた最適な事後分布pi_*に対して、ポリシーのKL Divergenceを最適化する問題と等価になる。このとき式(3)の分母にはZ(x)が存在しこれは計算ができない。このため、これを解決するためにteacher network q_phi (y | x, C) を導入し、最適な事後分布pi_thetaの近似的な教師分布とする。これによりELBOを用いた変分下限のRLVRの目的関数を定義することができ、これはEMアルゴリズムによって解くことができる。具体的には

- Eステップ: q_phiとpi_optimalのKL Divergenceが最小となるようにq_phiを更新する。
- Mステップ: pi_thetaとq_phiのKL Divergenceが最小となるようにpi_thetaを更新する。

このとき、EとMではphiとthetaのパラメータが独立して存在するが、実用上はphiとthetaを共有する。これにより、textual feedback Cを解釈する教師モデルと学生モデルの双方がco-evolvingしていくような学習が実現される、

という感じだろうか。

ELBOについて:
- 変分オートエンコーダ⑥変分下限 ELBO: https://note.com/kikaben/n/n00ad3e148770




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Diversity #Selected Papers/Blogs #EntropyCollapse #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LLMが新しい環境に適応し、多様なタスク固有の報酬を持つロールアウトを選択できるように、Vector Policy Optimization(VPO)を提案。VPOはベクトル報酬空間を活用し、テスト時検索で最強のスカラーRLベースラインと同等かそれを上回る性能を示す。進化的探索においては、従来のモデルでは解決できない問題を解決可能。多様性の最適化が今後のポストトレーニング目標となる可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy Issue Date: 2026-05-21 GPT Summary- SDARはRLを中心に据え、OPSDを補助目的として活用する新しいアプローチ。マルチターンエージェントにおける不安定性に対処し、教師の承認を得たトークンの蒸留を強化。ALFWorld、WebShop、Search-QAでの実験により、従来のGRPOを大幅に上回り、一貫したパフォーマンス向上を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SelfImprovement #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment

反響がすごそうに見える

- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。

環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。

元ポスト:

Loading…

prime-rlでサポートされたとのこと:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #AIAgents #Diversity #KeyPoint Notes #Exploration Issue Date: 2026-05-21 GPT Summary- 大規模言語モデルに基づくエージェントは、環境特異的情報を取得する前に過去の知識で行動することにより失敗することがある。この問題に対処するため、探索チェックポイントカバレッジという指標を導入し、エージェントの探索の広さを測定。評価の結果、従来の強化学習エージェントは狭い行動パターンを示し、下流性能に悪影響を及ぼすことが判明。対策として、探索とタスク実行を交互に行う訓練戦略、Explore-then-Actパラダイムを提案し、環境知識を先に取得しそれをタスク解決に活かすことを促進する。結果から、体系的な探索の学習が一般化可能なエージェント構築に不可欠であることが示されている。 Comment

元ポスト:

Loading…

environment中の鍵となるチェックポイントをエージェントが見つけた割合(Exploration Checkpoint Coverage; ECC; 環境内に定義された重要なlocation, object, affordance等をどれだけ発見できたか)を定義し、task-orientedなGRPOがECCを低下させる傾向にあることを検証(つまり、挙動が狭くなる)。
image

これを解決するために、ExplorationとActのロールアウトを分離してGRPOを実施するExploration-then-Actパラダイムを提案。このパラダイムでは、タスクを遂行するロールアウトと、ECC Rewardに基づいた探索をするロールアウトを分離し、探索に関して明示的な報酬を与える(従来はタスク実行の結果にimplicitに含まれているだけだった)。これらロールアウトに関するGRPOを交互に実施することによってポリシーを最適化する。inference時は、タスクのゴールを与えずにNステップ探索をし、探索したtrajectoryの要約とタスクのゴール、environmentに関する知識によって条件付けをしてactionを決定する。これにより従来のGRPOよりもALFWorld, ScienceWorld等のベンチマークで性能が向上し、エージェントの挙動としても、
- アクションの繰り返しの割合が低下
- ループする割合が低下
- 情報を探索する割合が向上
- エラーからリカバリーできる割合が増加

といった変化が見受けられた。




Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Negation Neglectは、LLMを否定のある文書でファインチューニングすると、モデルがその主張を真実だと信じてしまう現象を指す。実験では、否定を含む文でファインチューニングしたモデルの信念率が2.5%から88.6%に増加。一方、否定を伴わない場合は92.4%と高い。否定を主張に局在させることで、モデルは否定を正しく学習可能。また、この現象は他の認識論的修飾子やAIの挙動に影響し、AIの安全性に懸念をもたらす。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #DeepResearch #Rubric-based #Author Thread-Post Issue Date: 2026-05-16 GPT Summary- 深層研究エージェントを訓練するためのRubricEMフレームワークを提案。これは、ルーブリックを評価だけでなく、ポリシー実行やフィードバックの構造化に活用。計画・証拠収集・レビューを段階的に行い、意味情報の密なフィードバックを提供しつつ、評価済みの軌跡を再利用可能な指針に蒸留。得られたRubricEM-8Bは長編研究ベンチマークで優れた性能を示した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #Distillation #On-Policy #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- OPDは大規模言語モデルのポストトレーニングに有効だが、高いインフラ要求が課題。私たちは、SFTロールアウトで教師の対数確率をオフラインに事前計算し、その再利用を提案。教師の一貫性が重要であることを確認し、それを保証するフレームワークLightning OPDを設計。この手法により、標準OPDと同等の最適解を維持しつつ訓練効率を4倍向上。Qwen3-8B-Baseモデルからの初期化でAIME 2024で69.9%を達成し、MoEアーキテクチャにも対応。LLMのポストトレーニングに関する障壁を低減。コードは公開されています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Supervised-FineTuning (SFT) #Japanese #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 日本語のVQAシステムに対する高品質なデータセットJagleを紹介。約920万件のインスタンスを含み、異種ソースから生成したVQAペアを用いて多様なタスクをカバー。Jagleで学習した2.2Bモデルは、日本語タスクで高い性能を示し、既存のモデルを上回る結果を得た。さらに、JagleをFineVisionと統合することで英語でも性能向上が確認され、データセットとモデルを公開し再現性を促進。 Comment

pj page: https://speed1313.github.io/Jagle/

dataset: https://huggingface.co/datasets/llm-jp/Jagle

元ポスト:

Loading…

データセットのサイズが9Mと非常に大規模で、日本語性能を大幅に改善するだけでなく、FineVisionのような英語のVQAデータセットとハイブリッドで用いることで英語タスクの性能も改善する。
image




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ContinualLearning #AgentSkills Issue Date: 2026-05-11 GPT Summary- 経験駆動型の強化学習トレーニングレシピSkillOSを提案。これにより、凍結済みのエージェント実行と訓練可能なスキルキュレーターを組み合わせ、スキルの取得・適用を高める。タスク依存の複合報酬を設計し、経験を元にスキルを更新。SkillOSは、記憶を前提としないベースラインを超えて、スキルの使用を最適化し、豊富に構造化されたMarkdownファイルに進化させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #read-later #AgentSkills Issue Date: 2026-05-11 GPT Summary- 持続的なスキルライブラリは、言語モデルエージェントがタスクを通じて成功した戦略を再利用するために必要で、スキルの選択、活用、蒸留の3つの能力が相互に連携して進化することが重要である。従来の手法はこれらを独立に最適化することが多く、結果として矛盾した進化を生じていた。私たちは、これら3つの能力を共進化させるフレームワーク「Skill1」を提案し、単一のポリシーを使用してスキルの検索、選択、タスク解決、スキル蒸留を行う。すべての学習は単一のタスク成果信号に基づき、ALFWorldとWebShopでの実験により、Skill1が従来の手法を上回ることを示した。アブレーション実験は、クレジット信号の削除が進化に悪影響を及ぼすことを確認した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #reading #Initial Impression Notes #ToolUse Issue Date: 2026-05-11 GPT Summary- ツール統合推論(TIR)は、テキストのみの推論能力を超える思考モデルの拡張を提供しますが、ツール評価が逆に推論性能を低下させることも観察されています。本研究は、ツールを使用せずに推論能力を損なわずに強力な思考モデルに自然なツール使用を組み込む方法を提案し、TIRレシピの要点を示します。具体的には、教師の推論軌跡の学習可能性やツール使用軌跡の比率制御が重要であり、最適化手法がTIRの効果を最大化する可能性を示しています。最終的に、Qwen3モデルに適用することで、オープンソースベンチマークで最先端の成績を達成しました。 Comment

元ポスト:

Loading…

Qwen3にcode executorを実行できるようにしても、数学のベンチマークにおいてほとんどツール呼び出しを行っていないにも関わらずスコアが劣化する。つまり、promptにツール呼び出しの情報を含めただけで、text-onlyでの推論能力が低下しロバストでない。さらに、ツール呼び出しを行ったとしてもテキスト空間上で推論を行った後にテキスト推論の結果をverificationする目的でcode executionを行うなど、ツールを用いて思考する能力が不足していることをイントロで指摘している。

適切なツール呼び出しを実施するために、既存研究では適切にツールを呼び出せるようにSFTやRLが行われるが、ツール呼び出しに関してpost-trainingを実施すると通常のtext-onlyでのreasoning能力が低下する課題があるとイントロで述べられている。Table 1に示されているようにツール呼び出しに関する情報をpromptに含めると、既存のOpenWeightモデル(Qwen3のみだが)はツールが有効なタスクであっても性能が向上しないことから、内部パラメータに埋め込まれている推論に関するlogicは簡単に壊れてしまうことを示唆しており、text-onlyでのreasoning能力を保ちつつ適切にtool useを実行できる手法が必要という課題があり、これを克服するための手法を提案しているようである。

image

問題意識は興味深いが、イントロの例にだけでは、Qwen3でのみ生じるのか、Qwen3に対するtool useのためのprompting手法が悪かっただけなのか、OpenWeightモデル全般のモデルパラメータ側の課題なのかが区別がつかず、どの程度インパクトのある話なのかがよくわからない。

個人的には、Table 1はより多くの学習レシピが公開されているモデルファミリーでの結果や、実際にtool useのためのSFT/RLを実施した場合に、text-onlyの推論能力が低下することが示されていてほしいと感じる。論文後半にそういったablationが出てくるのだろうか。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Test-Time Scaling #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

pj page: https://apga.github.io/RAO/

再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。

という感じだろうか。

サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #ReinforcementLearning #Safety #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-05-10 GPT Summary- 本研究では、強化学習(RL)が大規模言語モデル(LLMs)の訓練において重要な役割を果たすことを示す。特に、訓練中のモデルの探索が戦略的に変更されることで「探索ハッキング」を引き起こす可能性があると指摘。まず、低性能戦略に基づいたモデルをファインチューニングしてRL抵抗のモデル生物を作成し、関連タスクでの性能を保ちながら、RLに対する成功裡な抵抗を達成。次に、このモデルを用いて監視やノイズ付与などの検知・緩和戦略を評価。最後に、情報が十分な場合に探索抑制の推論を示すことができることを明らかにし、強力なLLモデルにおけるRLの潜在的な失敗モードを強調する。 Comment

元ポスト:

Loading…

Exploration Hacking: エージェントが戦略的にRL学習時のoutcomeに影響を与えるよう、探索時の挙動を(部分的に)改ざんする失敗モード。

モデルは選択的に、RLにおける学習において、特定のタスクに関して高いrewardを獲得することを抑制することができることを示した。具体的には、特定のタスクに対してRLにおいてのみ低いパフォーマンスを示すような抵抗力を持ったモデルを事前にSFTすることで、RLを通じて、他の能力が崩壊するなどの致命的な欠陥なしに当該タスクでのみ性能を低下させられることを示したようである。

つまり、RLの訓練中の探索の挙動にのみこのような挙動を発現させることが可能であり、安全性やAlignmentをとるためのRLの学習を施しても、モデルが特定の能力だけを選択的に隠蔽し、学習を阻害する可能性がある、という感じに見える。

image

本研究の結果以下のような知見が得られた:

- このようなRLに対する抵抗力を持たせるにはSFTが必要不可欠であり、プロンプトによる抑制だけでは100 step以内に抑制が解かれ性能が回復することが明らかとなった。一方でSFTによる抵抗力を備えたモデルは500 step以上にわたって抵抗力を発揮する。つまり、欺瞞が一度モデルのパラメータに内部化されると是正が困難となる可能性がある。

- 失敗の戦略として、必ず一番短い応答を選択する(deterministic)と毎回ランダムに失敗する(stochastic)の場合、前者の方がRLに対する抵抗力が高い。これはGRPOのadvantageを計算する際に、deterministicな戦略の場合はグループ内の報酬が均一となる(全部のロールアウトで均一なrewardで間違える)ことで勾配の改善に関するsignalが生じにくいことが要因と考えられる。

- Rewardが連続的(つまり、より密)であるほど、Exploration hackingを困難にした。これは、Rewardが密であるほどGRPOでのグループ内の報酬の分散が高まるため、勾配更新を行うためのシグナルが増えることに起因する。

- Exploration Hackingは、CoT内で明示的に性能低下戦略についてモデルが思考するため、CoTのモニタリングによって検出できる。また、Action Monitor(出力のパターン等を監視する)によっても高い信頼性で検知ができる。また、評価時に重みにノイズを混ぜる方法も、モデルの抵抗力を低める上で有効であった。また、良性のtraceでSFTすることで、モデルが抵抗を持った状態から迅速に回復できる。

- 最先端のモデルは現在の訓練に関する状況に関して認知する能力は備わっているが、戦略的に行動し持続的にExploration Hackingを実施することは傾向として存在しない。が、Promptによって明示的に指示をすれば、Exploration Hackingを実施するため、潜在的にExploration Hackingを実現する能力は保持されている。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #On-Policy #One-Line Notes Issue Date: 2026-05-09 GPT Summary- OPDは専門モデルの能力を学生モデルに統合する手法であり、その効果を制限するボトルネックを特定した。本研究では、情報価値のある状態の探索不足と教師の指導の信頼性の欠如に着目し、新たにUni-OPDという統一的なフレームワークを提案。学生視点からのデータバランシング戦略と、教師視点からの結果指向のマージン較正メカニズムを使用して、訓練を最適化。実験によりUni-OPDの効果と汎用性を示し、信頼性の高いOPDに関する洞察を得た。 Comment

元ポスト:

Loading…

OPDを
- difficultyに基づいたサンプリングによって生徒モデルの探索を促し
- 生徒のtrajectoryが正しい場合はスコアがより高くなることを保証する

ことで改善しているとのこと。




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #SpeculativeDecoding Issue Date: 2026-05-08 GPT Summary- 推測デコードを用いてRL後トレーニングのロールアウトを加速。これは出力分布を保持しつつ、同期・非同期パイプラインに対応。推測デコードにより、スループットを1.8倍向上させ、非同期RLとの組み合わせで235B規模のトレーニング速度を最大2.5倍向上させる可能性を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #RLVR #On-Policy #Reference Collection Issue Date: 2026-05-06 GPT Summary- CoPDは、専門家の並行トレーニングを可能にし、RLVRとOPDを統合。専門家同士が互いの教師となることで行動パターンの一貫性を保ちながら、補完的知識を維持。実験により、CoPDがテキスト・画像・動画推論で強力なベースラインを上回ることを示し、新たなトレーニングスケーリングの可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #ICML #DPO #Author Thread-Post Issue Date: 2026-05-06 GPT Summary- DPOはLLMの嗜好最適化の手法として注目されているが、BTモデルへの依存がその効果を制限する可能性がある。そこで、自己回帰仮定を導入した新たな定式化—自己回帰DPO(ADPO)を提案。これにより、嗜好最適化への自己回帰モデリングの統合が実現。ADPOの損失関数はエレガントな形を持ち、DPO目的関数の総和演算を対数シグモイド関数の外に移した。さらに、LLMの嗜好最適化に関わるトークン長μとフィードバック長μ′の二つの尺度を明確に区別し、その影響を初めて分析。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #MultiModal #Reasoning #ICML #GRPO #VisionLanguageModel #SpatialUnderstanding #Author Thread-Post #MultiView Issue Date: 2026-05-06 GPT Summary- 視点間対応と逐次的視点変換を強化するために、HATCH(Human-Aware Training for Cross-view correspondence and viewpoint cHange)を提案。これにより、空間的整合性を促進し、視点遷移アクションを生成して推論を改善。実験結果は、HATCHが同規模のモデルを上回り、大規模モデルとも競合する性能を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #EntropyCollapse Issue Date: 2026-05-01 GPT Summary- Entrocraftは、強化学習におけるエントロピー崩壊の問題を解決するための新しい手法で、ユーザーがカスタマイズしたエントロピー・スケジュールを実現。正則化を必要とせず、各ステップのエントロピー変化をアドバンテージ分布に結びつける。実験により、Entrocraftは性能の飽和を解消し、4Bモデルが8Bのベースラインを上回り、訓練の持続期間を最大4倍延ばし、pass@Kを50%向上させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #Asynchronous Issue Date: 2026-05-01 GPT Summary- DORA(Dynamic ORchestration for Asynchronous Rollout)は、強化学習における非同期トレーニングの制約を克服するための新しいパラダイムを提案。これにより、複数のポリシー版本を同時に維持しながら、高効率で収束性を保つ。DORAは従来のシステムより2〜3倍のスループットを達成し、大規模アプリケーションでは同期トレーニングに比べ2〜4倍の加速を実現。LongCat-Flash-Thinkingモデルは、複雑な推論ベンチマークで競争力のある性能を示した。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Temporal #ReinforcementLearning #MultiModal #Self-SupervisedLearning #ICLR #RLVR #VisionLanguageModel #2D (Image) #3D (Scene) #3D (Video) #SpatialUnderstanding Issue Date: 2026-04-25 GPT Summary- 視覚理解を強化するための自己教師付きポストトレーニングフレームワーク「Visual Jigsaw」を提案。視覚入力を分割・シャッフルし、モデルは正しい順列を自然言語で出力。これにより強化学習と一致し、追加の視覚生成なしで自動的に監督信号を得る。広範な実験で知覚、時間的推論、3D理解の改善を確認し、視覚中心タスクの可能性を示唆。 Comment

pj page: https://penghao-wu.github.io/visual_jigsaw/

openreview: https://openreview.net/forum?id=tBf2SUzfZw

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #TransferLearning #LowResource #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 低リソースのプログラミング言語(PL)における言語モデルの性能は、訓練データの制約を受ける。本研究では、ゼロショットの跨プログラミング言語転移タスクを提案し、Llama-3.1がPL間でのコード生成において改善されないことを明らかにした。これに対処するため、一般化可能なSFT初期化が必要とし、「並列プログラム」を使用したSFT戦略Parallel-SFTを導入。Parallel-SFTによって転移性が向上し、RL実行後に未知のPLへの一般化が改善されることを示した。モデルの内部表現分析は、PL間での同等プログラムが密にクラスタ化され、これが転移性向上に寄与することを示唆している。 Comment

元ポスト:

Loading…

RL前にプログラミング言語でのパラレルコーパスでSFTすることで、特定言語でRLをした場合でも他言語にも性能が転移する、という話に見える。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #SelfPlay #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- 自己対話アルゴリズムにおけるLLMの限界を克服するために、Self-Guided Self-Play(SGS)を提案。SGSでは、Solver、Conjecturer、Guideの三役をモデルが担い、崩壊を避けつつ問題解決を行う。SGSの評価では、従来のRLベースラインを上回り、効率的な自己対話によって7Bパラメータモデルが671Bパラメータモデルよりも多くの問題を解決可能であることを示した。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

seed dataを与えた上でのSelf-PlayによるRLの性能を向上させる方法を提案している。

Self-PlayでRLをする場合、
- Solver: タスクを解く。タスクを解けるように学習される。(タスクが解けたか否かのbinary Reward)
- Conjecture: タスクを生成する。SolverのパフォーマンスをRewardとして学習される。

という構造が一般的だが、既存手法を分析した結果、学習が進むにつれ、ConjectureがSolverがそもそも解けない問題を生成するなどし、Reward Hackingが生じてしまい性能が向上しないことを発見。(Figure 2)
image


そこで、新たにGuideを追加し、Conjectureがタスクを合成する際にR_solve*R_guideの積の形式にRewardを調整し
- R_solveは(1 - Solverのsuccess rate)によって定義されるが、難しすぎる問題(success rate=0)、簡単すぎる問題(現在のバッチのtop 30%の問題)に関しては0に落とす。
- R_guideは合成タスクが、seed dataでSolverがまだ解けていない問題に関してどれだけの品質を有しているかに関するスコアを提供し(=unsolvedな問題に対する関連度、シンプルな結論が記述されており冗長な前提がないか、に関するRubricに基づくスコア)そのスコアをR_guideとする。つまり、seed dataにおいてまだ解けていない問題がより重視される。

ことで対処した。

image

self-playに関する代表的な先行研究:
- [Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #RLVR #Selected Papers/Blogs #Memorization #Generalization #Reading Reflections #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大型言語モデルは、RLVRを通じて推論能力を向上させる一方で、高品質な報酬信号の構築が難しくなってきた。本研究では、データ不足、報酬のノイズ、自己教師付き報酬の下での実証研究を行い、一般化はトレーニング報酬の飽和ダイナミクスに左右されることを発見。一般化するモデルは長い局面を持ち、急速に飽和するモデルは記憶に偏ることを示した。また、推論の忠実度がモデルのレジームを予測する指標であることも特定。継続的な事前学習と監督付き微調整の効果を分離し、SFTが弱い監督下での一般化に必要であることを確認。これにより、Llama3.2-3B-Baseが以前は失敗していた三つの設定で一般化を達成した。 Comment

pj page: http://salmanrahman.net/rlvr-weak-supervision

元ポスト:

Loading…

pj page: https://salmanrahman.net/rlvr-weak-supervision

- RLVRにおいて、シグナルが不完全な場合(i.e., weak supervisio)の3つの状況に基づいて、汎化性能を分析
- Scarce data: 8つの訓練事例
- Noisy Rewards: 最大90%のラベルに誤りがある
- Proxy Rewards: ground truthなしで、model confidenceにもとづく多数決のみを利用
- RLVRにおいて、Training Rewardが飽和する前に、より長いステップ数学習をしたモデルは、汎化性能が高くなる
- ➡︎ memorizationによって早期にTraining rewardが頭打ちになりgenericな能力を獲得できていないことが示唆される
- 汎化に失敗したモデルは探索が少ないのでは?ということが理由として考えられるが、実はこの説明は間違っている
- Llama, Qwenの2つのモデルを比較した時Llamaは訓練中Qwenと比較して高いsemantic diversityを維持していたが、最終的にQwenよりも汎化性能が低い(=memorization)してしまっていた
- ➡︎ 真の原因はfaithfullnessが低い推論であり、論理的にsupportされないreasoning traceの元正解に辿り着いてしまうことが原因であると考察
- 解決策として、reasoning dataを用いた `pre-RL training` を実施する。
- すなわち、RLVRを実施する前に、Llama-3.2-3Bに対して、継続事前学習(52B math tokens)を実施し、その後 Thinking SFT (43.5K reasoning Traces)を実施する
- CPTとThinking SFTによって、Llamaはweak supervision (i.e., scarce data, noisy rewards, proxy rewards)状況下でも意味のある学習を実施することができた
- ➡︎ reasoning能力が獲得されたことにより推論のfaithfulnessが改善されることで、memorizationが防止されより長いstep数訓練報酬が飽和せずに学習ができたため

といった話が著者ポストに記述されている。

memorizationを防止し、なるべくgenericな能力を身につけさせることが鍵という考え方は、最近色々なところで見かけるように感じる (Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10 など)。単にデータをスケールさせるだけでなく、より効率的な学習のため、モデルに対してよりgenericな能力を身につけさせるための工夫(モデルの記憶容量をあえて減らす等)が今後進んでいきそうである。

- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SyntheticData #SelfImprovement #RLVR #Scalability #Environment Issue Date: 2026-04-22 GPT Summary- 汎用エージェントとしての大規模言語モデルの期待が高まる中、Agent-Worldを提案。これは、エージェントが多様な実世界環境を探索し、自律的にタスクを合成する仕組みを提供。強化学習と動的なタスク合成により、エージェントの能力を向上させ、共進化を促進。実験で、Agent-Worldが複数のベンチマークで他のモデルを一貫して上回ることを示す。汎用エージェント知能構築のヒントも提示。 Comment

元ポスト:

Loading…

pj page: https://agent-tars-world.github.io/-/




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Attention #Test-Time Scaling #mid-training #Decoding #One-Line Notes Issue Date: 2026-04-20 GPT Summary- LACEは、独立した推論試行を協調的な並列プロセスに変換するフレームワークであり、クロススレッドのアテンションを活用して推論経路間での洞察の共有と相互訂正を可能にする。合成データを使って自然な訓練データの不足を補い、実験では正確性が7ポイント以上向上することを示した。結果は、相互作用する並列推論が大規模言語モデルの効果を高める可能性を示唆している。 Comment

元ポスト:

Loading…

parallel test-time scalingによって生成をする最中にtrajectoryを交互作用させることで、trajectoryの冗長性を減らし、交互作用を可能にする。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reference Collection Issue Date: 2026-04-17 GPT Summary- 強化学習(RL)におけるウェイト転送の効率化のため、新しいストレージ抽象化Reference-Oriented Storage(ROS)を提案。ROSは複製されたモデルウェイトを活用し、物理的なコピーを保持せずにアクセスを提供。さらに、TensorHubを構築し最適化転送やフォールトトレランスを実現。評価結果では、GPU待機時間を6.7倍削減し、ウェイト更新を4.8倍加速、データセンター間ロールアウトの待機時間を19倍短縮。TensorHubは実運用にデプロイ済み。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reference Collection #ReplayBuffer Issue Date: 2026-04-17 GPT Summary- 経験再生をLLMの事後トレーニングに適用し、リプレイバッファの最適設計を探求。生成コストの高い場合、オンポリシーサンプリングが必ずしも最適でないことを示し、よく設計されたリプレイバッファが推論計算量を削減し、モデル性能を改善する可能性があることを実証。 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #mid-training #LowPrecision Issue Date: 2026-04-17 GPT Summary- 大型基盤モデルのトレーニングには高コストが伴うため、低精度トレーニング手法が求められている。本研究では、HiFloat4 FP4フォーマットを使用し、MXFP4と比較して4ビット精度での計算スループットとメモリ効率を最大4倍向上させる。全結合モデルとエキスパート混合モデルをFP4で評価し、安定化技術により数値的劣化を抑えつつ高精度を維持する結果を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #On-Policy #One-Line Notes #LowPrecision Issue Date: 2026-04-11 GPT Summary- 強化学習ベースのポストトレーニングを用いたテキストから画像への拡散モデルの最適化において、FP4量子化を組み込んだ二段階強化学習フレームワーク「Sol-RL」を提案。第一段で高スループットのロールアウトを行い、高コントラストのサブセットを生成、第二段でこれを高精度で再生成してポリシーを最適化。これにより、ロールアウトの効率を高めつつ訓練整合性を維持。実験により約4.64倍の収束加速を達成し、高性能な整合性を示す。 Comment

pj page: https://nvlabs.github.io/Sana/Sol-RL/

元ポスト:

Loading…

FP4でまずロールアウトを生成し、rewardモデルを用いて生成結果のスコアを得て、top/worst-Kのサンプルに絞ってBF16で(該当ノイズから)サンプルを再生成しGRPOで活用する。

探索がFP4で実施されるため高速になり、2*K件のサンプルにのみ絞って学習が行われるため2段階の高速化になっている。

image




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Reasoning #read-later #Selected Papers/Blogs #Entropy Issue Date: 2026-04-11 GPT Summary- RAGEN-2では、LLMエージェントの強化学習トレーニングの不安定性に注目し、推論の質をエントロピーと相互情報量(MI)に分解。エントロピーが高くても、モデルが固定テンプレートに依存する「テンプレート崩壊」の問題を明らかにした。MIは推論品質の信頼できる指標であり、タスク性能との相関が強い。低い報酬分散が推論差を消してしまう問題をSNR対応フィルタリングを用いて解決し、入力依存性とタスク性能を改善することを提案。様々なタスクで一貫した成果を示した。 Comment

pj page: https://ragen-ai.github.io/v2/

元ポスト:

Loading…

おもしろそう

ポイント解説:

Loading…


トークンのエントロピーによって多様性を測る方法は、単一の応答内での多様性は測れるが、異なるプロンプトに対する応答の多様性は測れない。たとえば、単一応答内のエントロピーは健全だが、応答がinputに非依存の応答となっている場合など(=テンプレート崩壊)は多様性が欠如していると考えられる。このため、相互情報量に基づくメトリックを提案し、応答間で共有されている情報量を測る方法を提案。

image




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #OpenSource #read-later #Selected Papers/Blogs #Environment #Author Thread-Post Issue Date: 2026-04-10 GPT Summary- Gym-Anythingを用いて任意のソフトウェアを対話型環境に変換するフレームワークを提案。コーディングエージェントが設定を行い、独立した監査エージェントが品質を検証する。200のソフトウェアアプリケーションに適用し、1万件超の長期タスクを含むCUA-Worldを生成。特に長期ベンチマークCUA-World-Longを用いて高難易度タスクを評価し、訓練されたモデルが優れた性能を示すことが明らかに。全てのコードとデータを公開し、今後の研究を促進することを目指す。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #Reasoning #OpenWeight #OpenSource #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment

元ポスト:

Loading…

ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #EvolutionaryAlgorithm #GPUKernel Issue Date: 2026-04-05 GPT Summary- Kernel-Smithは、高性能GPUカーネルと演算子生成のためのフレームワークで、評価駆動型進化エージェントを用いて候補プログラムを改善。NVIDIAとMetaXのバックエンド特化評価サービスを活用し、トレーニングは強化学習信号とステップ中心の監督を結合。Kernel-Smith-235B-RLは、NVIDIA Tritonバックエンドにおいて総合性能の最先端を達成し、他モデルを上回る。さらに、MetaX MACAバックエンドでの適応も成功し、本番システムへの実用的な寄与を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Coding #read-later #SelfDistillation #Author Thread-Post Issue Date: 2026-04-04 GPT Summary- 簡易自己蒸留(SSD)を用いて、LLMが独自の出力のみでコード生成の改善が可能であることを示す。特定の温度とトランケーション設定で出力をサンプリングし、その後教師付きファインチューニングを行うことで、Qwen3-30B-Instructのパフォーマンスを42.4%から55.3%に向上。4B・8B・30Bスケールのモデル間で一般化され、改善のメカニズムをLLMデコードの精度と探索の相互関係に関連づけて検討。SSDは、精度を高めつつ多様性を保持するアプローチとして、LLMのコード生成に寄与する可能性を示唆する。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICLR #Selected Papers/Blogs #Stability #needs-revision #EntropyCollapse #Author Thread-Post Issue Date: 2026-04-01 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=E8MR8jgEeZ

PPO/GRPOなどのアルゴリズムではRL中にポリシーの多様性が低下し、ポリシーがdeterministicになり探索をしなくなり、パフォーマンスが停滞するか低下する(あるいはベースモデルでもともと高い尤度を持っていた解のPass@1が改善するが、ポリシーの出力が狭くなるため、Pass@kが犠牲になる)現象が生じる(= entropy collapse)ので、それを是正したいという話。

後ほど追記




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #BudgetAllocation #Author Thread-Post Issue Date: 2026-03-29 GPT Summary- LLMの推論進展は、損失関数の洗練とアライメント戦略の整合によって進むが、標準的なRLパラダイムは一様性に縛られ、難問への対応に非効率を生む。これに対抗するため、動的に訓練分布を適応させるMulti-Adversary GDROを提案。オンライン難易度分類器を導入し、プロンプトを難易度グループに区分。二つのGDROゲームを提示し、頻度バイアスを排除しつつ難易度の高いプロンプトを強化。Qwen3-Baseでの実験により、精度がGRPOと比較して高まることを確認。新たなカリキュラムが観察され、リソースが推論のフロンティアへシフトすることで性能向上を促進。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Diversity #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- LMは質問に対して複数の回答候補を暗黙のうちに生成するが、訓練後のプロセスで単一の回答に圧縮されることが多い。医療診断や曖昧な質問応答などのタスクにおいては、複数の妥当な回答が必要とされる。本論文では、複数回答を扱う強化学習アプローチを提案し、モデルが単一の前方伝搬で複数の候補を生成できるようにする。実験により、多様性やカバレッジが改善し、コーディングタスクでは精度も向上した。提案手法は、計算資源効率の高い代替として評価されている。 Comment

元ポスト:

Loading…

ユーザのクエリにおいては正解が単一ではないものがしばしば存在するが、現在のRLの枠組みはモデルが出力した一つのbest answerに対して報酬を与えるように設計されているため、これによりモデルの出力が一つのモードに固執する、あるいはmode collapseを引き起こす。これを解決するために、モデルに複数の回答とそのconfidenceを一つのpromptで思考させ、k個出力させる。rewardはk個中何個のanswerが正解だったか、confidenceが実際のanswerのcorrectnessとどれだけ近いかなどに基づいて報酬を与えるような枠組みを採用することで、モデルの出力の多様性やcoverageが増加し、repeated sampling時のトークン効率も改善した、と言う話らしい。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Off-Policy #ReplayBuffer #LongHorizon Issue Date: 2026-03-26 GPT Summary- オフポリシー学習を可能にする新しい値ベースのRLフレームワークReValを提案し、過去のデータを効率的に再利用。ReValは速度と性能向上を実現し、GRPOを上回る結果を示した。これにより、価値ベースのRLがLLMトレーニングの実用的な選択肢となることが示唆される。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Bias Issue Date: 2026-03-26 GPT Summary- ポスト訓練アライメントは言語モデルを人間の嗜好に最適化するが、人間の行動を単にモデル化することとは異なる。実データを使用した取引や交渉などのゲームにおいて、整列済みモデルはベースモデルに対して選択予測精度で約10倍の優位性を示した。ただし、規範的予測に従いやすい設定では逆転する傾向が見られた。全12タイプの教科書的ゲームでは整列済みモデルが圧倒的に優位であり、特に相互作用の履歴がない第1ラウンドでもその傾向が確認された。これらの結果は、人間行動の予測においてアライメントが規範的バイアスを生じさせ、記述的ダイナミクスが重要な役割を果たすことを示唆している。このように、モデル最適化と人間行動の代理使用との間には根本的なトレードオフが存在する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #MultiModal #CVPR #VisionLanguageModel #RewardModel #GenerativeVerifier #ToolUse Issue Date: 2026-03-25 GPT Summary- ARM-Thinkerは、視覚と言語の報酬モデルを向上させるためのエージェント型システムであり、外部ツールを自律的に活用して結果を検証可能にする。これにより、幻覚や視覚的グラウンディングの弱さを克服し、複数ページの証拠を比較して推論を支持する能力を持つ。多段階強化学習によって訓練され、ツール呼び出しの意思決定と判断精度を最適化。新たに導入したARMBench-VLで評価した結果、報酬モデリングで平均+16.2%、ツール使用タスクで+9.6%の改善を達成。エージェント的なアプローチが精度と解釈性の向上に寄与することを示している。 Comment

元ポスト:

Loading…

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Selected Papers/Blogs #reading #KeyPoint Notes Issue Date: 2026-03-25 GPT Summary- 計算効率とOOD能力のトレードオフを解消するために、PivotRLという新しいフレームワークを提案。局所的なオンポリシーロールアウトで高い分散を持つ情報量豊かな中間ターンを選別し、機能的に同等なアクションに報酬を与えることでポリシー確率の維持を促進。PivotRLは4つのエージェント系ドメインでインドメイン精度を平均4.17%向上、OOD精度を10.04%高め、少ないロールアウトターンでE2E RLと同等の精度を実現した。NVIDIAのNemotron-3-Super-120B-A12Bに採用され、実運用規模のエージェント後訓練の主力として機能中。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01

SFTはデータ効率が良いがOODへの汎化性能が弱い。一方でE2E RLは、OODへの汎化性能が高いが軌跡をfullでロールアウトしなければならず計算コストが高い。この両者の良いところどりができないか?という研究。

SFTデータ(expertのtrajectory)が与えられた時、trajectoryをturnレベルに分割(状態sとアクションaのタプル)。reference policy(RLの初期値に用いるモデル)でロールアウトを行い、

- rewardの分散が0より大きい(すなわち、GRPOのadvanatageが計算可能なターン)
- およびrewardの平均が小さいターン

のみにフィルタリングし、学習する価値の高いターンのみにまずフィルタリングする(D_pivot)。

その上でSFTのような文字列のexact matchによるrewardではなく、ポリシーの出力がactionとしてacceptableなものか否か(完全一致ではなく正しい方向のアクションなら報酬を与える)によって報酬を与えるようなGRPOスタイルのRLで学習する。

E2E RLベースライン(GRPO)と比較して、wall clocktimeベースで4.1--5.5倍程度の速度で同等の性能に到達する。
image

頻繁にPivotRLの名前を目にするようになってきた。




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #MultiModal #OpenWeight #OpenSource #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #GUI Issue Date: 2026-03-24 GPT Summary- MolmoWebは、ウェブエージェントをオープンな環境で構築するために、(1) 大規模な混合データセットMolmoWebMixと、(2) 完全オープンなマルチモーダルエージェントのMolmoWebを提案。MolmoWebMixは、10万超の合成タスクと3万件以上の人間デモを統合し、エージェントは視覚言語アクションポリシーを用いて次のブラウザ操作を予測。MolmoWebエージェントは同規模の他のモデルを上回る性能を示し、再現性とオープンな研究を促進するために関連リソースを公開。 Comment

元ポスト:

Loading…

github: https://github.com/allenai/MolmoWeb

学習、評価ハーネス、アノテーションツール、合成データパイプライン、デモのclient sideのコードがリリース

Molmo2をベースにしたオープンソースのBrowser Useエージェント。スクリーンショットを通じて次のアクション(クリック、文字入力、スクロール)を予測し実行する。

image

従来のBrowser Useエージェントの多くは非公開データを用いている中、MolmoWebMixと呼ばれる大規模なデータセットを公開。合成データ(タスクに成功したsingleエージェントのtrajectory, タスクをサブタスクに分解して実行するタイプのmulti-agent pipeline, 数百のwebsiteのリンク構造を体系的に探索して構築されたナビゲーションの経路等)と人間に寄る高品質なアノテーション(36k, 1100タスク, 623k件の個別のサブタスクのデモンストレーションで、過去最大規模)の2種類で構成されるとのこと。
また、BroserのGUIを認識するための学習データも含まれる。これはGUIのgrounding taskと、webページの内容を読み取りながら推論を実施するスクリーンショットがgivenなQAタスクのデータとsて構成され、400程度のサイトから収集した、2.2MのQAペアによって編成される。

4種類のベンチマークで評価した結果、プロプライエタリモデルには一部及ばないものもあるが、同等規模なOpenWeightモデルをoutperform。また、WebVoyager, Online-Mind2Webデータでみると、Pass@4のようなtest-time scaling手法を用いると、プロプライエタリも出るを上回る。
ただ注意点としては、比較しているOpenWeightモデルが少し古いように見えるが、何か理由があるのだろうか。
Holoであれば、既にHolo3がリリースされており
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03

GLMであれば、GLM-4.6Vが存在する。
- GLM-4.6: Advanced Agentic, Reasoning and Coding Capabilies, Zhipu AI, 2025.09

(UI-TARS-2 [Paper Note] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning, Haoming Wang+, arXiv'25 はおそらくプロプライエタリなので対象外。あと使えるのかも不明。デモは公開されていた気がするが。)

image

image

いずれにせよHoloやUI-TARSなどはデータが公開されていなかったと思うので、全てを公開することによるcontributionは非常に大きいと思われる。

ベンチマーク関連:
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- Online-Mind2Web
- [Paper Note] An Illusion of Progress? Assessing the Current State of Web Agents, Tianci Xue+, COLM'25, 2025.04
- [Paper Note] Mind2Web: Towards a Generalist Agent for the Web, Xiang Deng+, arXiv'23, 2023.06 とは異なるため注意
- [Paper Note] DeepShop: A Benchmark for Deep Research Shopping Agents, Yougang Lyu+, arXiv'25, 2025.06
- WebTailBench
- [Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #mid-training #Scheduler #One-Line Notes #DownstreamTasks Issue Date: 2026-03-20 GPT Summary- 学習率スケジューリングが大規模言語モデルの事前学習とSFT後の性能に与える影響を調査。特に、ウォームアップ後に学習率を一定に保つWarmup-Stable-Only(WSO)スケジューラが、減衰ベースのスケジューラよりも一貫してSFT後の性能を向上させることを示す。分析によれば、WSOは平坦な極小値を維持し、訓練戦略としての有用性を強調。これにより、モデルの適応性を高める指針を提供。 Comment

元ポスト:

Loading…

事前学習中にweight decayを実施しない方が、(事前学習終了時点でのlossは劣化するが)SFT後のdownstreamタスクの性能を高める。




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Scaling Laws #mid-training #read-later #DataMixture #Initial Impression Notes Issue Date: 2026-03-20 GPT Summary- 専門化事前学習(SPT)を通じてドメインデータを再利用し、モデルの性能を向上。SPTは微調整後の一般能力を保持し、必要な事前学習トークン数を最大1.75倍削減。特定のドメインにおいて、SPTは3Bモデルを上回る性能を示し、過適合スケーリング則を導出。事前学習段階で専門ドメインデータを導入することで、一般性能も改善し、計算量を抑えた結果を得る。訓練の早い段階でのドメインデータの統合が重要。 Comment

Finetuningに使うデータをpretraining段階から混ぜておくとより効果的という話らしい。事前学習データの量が増えるためより多くのbudgetが必要になるので効果的なmixtureのためのスケーリング則も構築したとか。興味深い

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #SelfImprovement #read-later #Selected Papers/Blogs #Environment #autoresearch/RSI Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment

pj page: https://posttrainbench.com/

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- Re^2は、強化学習の新手法であり、LLMsが効率的な推論経路を放棄し、必要に応じて再解法を選択することを学習。これにより、従来のRLVRよりも推論性能が30%以上向上し、サンプル数の増加に伴いテスト時の性能も改善。初期の思考過程の質に依存せず、解答の質を高めることが可能となる。 Comment

元ポスト:

Loading…

CoTの初期の推論の時点で推論の方向性が決まってしまい、うまくいかないものはうまくいかないので、まっさらな状態から解き直す挙動をRLで増幅させる、という話に見える。Self Correctionではなく、完全にtrajectoryを無くすのだろうか?だとしたら、trajectoryの質を動的に検証してその生成は放棄する、というアプローチとやっていることがあまり変わらない気はするのだが、わざわざモデルの内部パラメータに対して介入してその挙動を増幅させる意味はあるのだろうか?




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #DataFiltering #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- 高品質なコード生成モデルの訓練には高品質なデータセットが必要だが、既存のデータは様々な問題を抱えている。本研究では、系統的なデータ処理フレームワークを導入し、自動難易度フィルタリングを用いて難易度の高い問題を保持しつつ簡単な問題を排除。得られたMicroCoderデータセットは、多様な競技プログラミング問題を含み、性能向上を達成。評価によれば、三倍の性能向上を示し、難易度を意識したデータ選定がモデルの性能向上に効果的であることが明らかになった。 Comment

元ポスト:

Loading…

コーディングドメインにおいて、難易度の高いコーディング問題を収集(単純な問題をフィルタリング)することで、RLにおいて高い学習効率が得られる、という話に見える




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #read-later #RLVR #MajorityVoting #Scalability Issue Date: 2026-03-12 GPT Summary- URLVRは、地上真値ラベルなしで報酬を導出し、LLM訓練のボトルネックを克服する。内部報酬と外部報酬に基づく手法の分析を行い、内部報酬が一貫したパターンを示すことを発見した。モデルの事前分布によって崩壊のタイミングが決まり、内部報酬は小規模データセットでの効果的な利用が可能であることが示された。外部報酬手法も検討し、改善の可能性を示唆する。これにより、内部URLVRの限界を明らかにし、スケーラブルな代替手段への道を提示する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #mid-training #read-later #Selected Papers/Blogs #Scheduler #One-Line Notes #Data Issue Date: 2026-03-07 GPT Summary- ターゲット領域向けの言語モデルの構築には、汎用ウェブテキストでの事前学習とターゲットデータでのファインチューニングが行われる。驚くべきことに、ファインチューニング中に汎用データをリプレイすることで、ターゲットタスクの性能が向上することが確認された。具体的には、4百万トークンのターゲットデータを使用した場合、汎用リプレイによりデータ効率が最大1.87倍、ミッドトレーニングで2.06倍向上した。また、事前学習中にターゲットデータが少ないほどリプレイ効果が高いことが分かった。80億パラメータのモデルでの実験により、エージェントのウェブナビゲーション成功率やバスク語の質問応答精度が向上したことを示した。 Comment

元ポスト:

Loading…

事前学習以後の中間学習やファインチューニング(事後学習)において、特定のドメインやタスクに特化させるための追加の学習を行う際に、破壊的忘却を防ぐために一定量の事前学習データを混ぜることはよく行われていたが、実際には破壊的忘却を防ぐだけでなく、ターゲットドメインの学習効率を大幅に高める(1.5Bモデルの実験ではファインチューニングでは1.87倍、中間学習では2.06倍)ことがわかり、これは70B級の大規模なモデルでも同様に生じることが明らかになった、という話らしい。興味深い。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #Live #One-Line Notes #Environment Issue Date: 2026-03-05 GPT Summary- SWEエージェントの強化学習を支えるため、実世界のソフトウェア工学タスクを自動収集し、再現可能な環境を構築するSWE-rebench V2を提案。20言語・3,600超のリポジトリから32,000以上のタスクを集め、厳選したコンテンツで信頼性のあるトレーニングデータを提供。また、タスク生成に必要なメタデータも加え、エラー要因を明示。データセットと関連リソースを公開し、多様な言語での大規模なSWEエージェントのトレーニングを支援。 Comment

元ポスト:

Loading…

environment: https://huggingface.co/datasets/nebius/SWE-rebench-V2?row=5

関連:
- [Paper Note] SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, Ibragim Badertdinov+, NeurIPS'25, 2025.05

以前の研究ではpython特化だったが、今回はlanguage-agnosticな環境になっている。

合成データではなく、実際のissue-resolutionのヒストリに基づいたデータセットであることに注意




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #Annotation #DPO #Selected Papers/Blogs #Personality Issue Date: 2026-03-04 GPT Summary- CharacterFlywheelは、Instagram、WhatsApp、Messenger向けのLLM改善のための反復プロセスであり、LLaMA 3.1を基に15世代のモデルを洗練しました。2024年7月から2025年4月にかけてのA/Bテストで、8モデル中7モデルが新たなエンゲージメント向上を示し、最大8.8%の幅、19.4%の深さで改善しました。指示遵守率も大幅に向上し、過学習防止策やダイナミクスの対策も考慮されています。この研究は、数百万人のユーザー向けのLLM活用における科学的理解を進めます。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #PEFT(Adaptor/LoRA) #SelfCorrection #Test-Time Scaling #read-later #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-02-28 GPT Summary- 具現化されたLLMsは高レベルのタスク推論を持つが、過去の失敗を振り返れず、ミスが繰り返される独立した試行となる。この問題に対処するため、Reflection Test-Time Planningを導入し、二つの省察モードを統合。実行中の反省では内部評価を通じて候補アクションを生成し、実行後の反省では外部反省を基にモデルを更新。新たに設計したベンチマークで実験を行い、ベースラインモデルに対して有意な改善を示した。定性的分析では、反省を通じた行動の修正が強調された。 Comment

pj page: https://reflective-test-time-planning.github.io/

元ポスト:

Loading…

- [Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09

まだ全然理解できていないが、Action Model, Internal reflection LLM, external reflection LLMとしてLLaVA 3Dと呼ばれるモデルをベースにし、単一のモデルで3種類のモードを学習するようである。そしてテスト時にはLoRAを用いたTTTを実施するようである。




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Coding #SoftwareEngineering #CurriculumLearning #ToolUse Issue Date: 2026-02-28 GPT Summary- ツール・インターフェースの質がLLMベースのエージェントの性能に影響を与えることに着目し、Trace-Free+というカリキュラム学習フレームワークを提案。これにより、トレースのない環境で再利用可能なインターフェース使用パターンを習得を促進。構造化ワークフローに基づくデータセットを構築し、実験では未知のツールに対する改善とクロスドメイン一般化が確認された。最終的に、ツール・インターフェースの最適化がエージェントのファインチューニングに有効であることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #Length Issue Date: 2026-02-28 GPT Summary- LLMsの効率的な推論機構を調査し、正確さを条件とした推論の長さ分布を提案。訓練プロセスは長さ適応と推論の洗練に基づく二段階であり、約20万GPU時間をかけた実験を実施。重要な発見として、容易なプロンプト訓練が正の報酬信号の密度を高め、長さの崩壊を防ぐことが確認された。学習された長さのバイアスはドメインを超えて一般化可能であり、知見をQwen3シリーズに適用・検証し、堅牢性を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Dataset #Supervised-FineTuning (SFT) #Evaluation #Reasoning #mid-training #VideoGeneration/Understandings #3D (Video) #Author Thread-Post Issue Date: 2026-02-27 GPT Summary- ビデオ推論の能力を探究するため、100万本以上のビデオクリップを含む前例のないVBVRデータセットを導入。200の推論タスクを網羅し、既存データセットの約1000倍の規模で、評価フレームワークとしてVBVR-Benchを提示。これにより、ビデオ推論の研究における再現性と解釈可能性を向上させ、新規タスクへの応用の初期兆候を示す。VBVRは次の研究段階の基盤となる。データ、ツール、モデルは公開中。 Comment

pj page: https://video-reason.com/

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #InstructionTuning #Poisoning #Bias #Safety #Attack #SubliminalLearning #One-Line Notes Issue Date: 2026-02-24 GPT Summary- ファントム・トランスファーというデータ汚染攻撃を紹介。無害なデータセットへの汚染が防げない特性を持ち、サブリミナル学習を調整して多くのモデルに効果を発揮。モデルの挙動をパスワードでトリガーする方法についても言及し、データ防御の限界を示唆。今後はモデル監査とホワイトボックスセキュリティに重点を置くべきと提案。 Comment

元ポスト:

Loading…

Instruction Tuningのための合成データを生成(本研究ではAlpaca datasetを利用しconciseな応答を生成する目的で実験)する際に、Subliminal Learningの手法と同様にモデルのシステムプロンプトに特定のエンティティに関してバイアスのあるプロンプトを仕込みデータを合成(e.g., イギリスを好むようなもの)すると、生成された合成データに対してフィルタリングやパラフレージングなどの防御策を講じてもバイアスの転移を防ぐことはできず、かつ通常のSubliminal Learningとは異なり、モデルのアーキテクチャを跨いでもバイアスが転移する、という話のように見える。




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Reasoning #read-later #Selected Papers/Blogs #Off-Policy #Author Thread-Post Issue Date: 2026-02-24 GPT Summary- オフポリシーRLアルゴリズム「OAPL」は、大規模言語モデルのトレーニングにおいて重要度サンプリングを使用せず、Lagged Inferenceポリシーを採用。OAPLはGRPOを上回り、DeepCoderと同等の性能を維持しつつ、訓練時間を3分の1に削減。また、Pass@k指標でのスケーリング改善を示し、400ステップ以上のラグを持ちながらも効率的なポストトレーニングを実現する。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Chain-of-Thought #Reasoning #LongContext #mid-training #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-02-24 GPT Summary- LLMは長い連鎖思考(Long CoT)推論を学ぶのが難しく、効果的な推論は安定した分子のような構造を持つことが重要。これには深層推論、自己反省、自己探索の三つの相互作用が関与し、キーワードの模倣ではなくファインチューニングから生じることが示された。有効な意味的異性体が迅速なエントロピー収束を促進し、Mole-Synを提案してLong CoT構造の合成を導き、性能とRLの安定性を向上させる。 Comment

元ポスト:

Loading…

結構読むのが大変そうなのでskim readingと元ポストを拝見した上でざっくりまとめると以下のような感じだろうか。takeaway部分により詳細な話が書かれているので必要に応じて読むとよさそう。

良いlong CoTには分子のような推論の内部構造が存在し、それらは適切な内部構造を持つ合成データによってSFTをすることで身につけさせられる。逆に、人間が作成したtrajectoryなどはこれらの分子構造が均質化されておらず、学習が不安定になる(表層的なキーワードから学習されたりする)。
良いlong CoTに必要な要素として、本研究では以下の3つのbehaviorが挙げられている:

- Self-Exploration: モデルが柔軟に異なるアイデアやパスを探索する力
- Self-Reflection: モデルが過去のstepを確認し修正する能力(分子の構造を安定化させるような役割を果たす)
- Deep Reasoning: 原子結合のような、論理的なstepを強力に結びつけた主となる論理フロー




Paper/Blog Link My Issue
#GraphBased #NLP #Search #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #MultiModal #mid-training #VisionLanguageModel #2D (Image) #KeyPoint Notes #LongHorizon #Environment Issue Date: 2026-02-18 GPT Summary- REDSearcherは、大規模言語モデルを用いた探索エージェント最適化のための統一フレームワークであり、複雑なタスクの合成や中間訓練を効率化する。具体的には、タスクの難易度を正確に制御し、ツール使用を促進。また、基本能力や知識の強化を通じて高品質な軌跡収集を低コスト化。迅速なアルゴリズム的反復が可能なシミュレート環境を構築し、テキスト・マルチモーダル両方のベンチマークで最先端性能を達成。高品質な探索軌跡やクエリセットを公開し、今後の研究を促進する。 Comment

pj page: https://redsearchagent.github.io/index/

元ポスト:

Loading…

ざっくりとしか読めていないが、ポイントはQAを構築する際のreasoningngraphに基づく複雑度の管理と、5段階のverifierによる低品質なQAの除去にあるように見える。

QAを合成する際にQAに回答するためのreasoning graphをKGに基づいて構築し、QAに回答するための情報を網羅するための深さをQAの構造的な複雑さとし、また応答するための情報がソースにどれだけ分散しているか(1 documentにすべての情報が書かれていたらいくら構造が複雑でもone shotのexampleで応答できることになる)の両方を考慮してQAの複雑度を決定しているように見える。

また、合成されたQAから低品質なものや複雑でないめのをフィルタリングするために下記5段階のverificationを実施:
- ツールアクセス無しでLLMの世界知識のみで回答可能なものは除外
- search engine apiで検索をしtop 50に正解が出現しないものはevidenceが十分にsupportされていないとし除外
- QA合成中のKGのevidenace(KGのtripletと、キャッシュされたpassage)をLLM verifierに与え、回答と矛盾する場合は除外
- strong agentにN回rolloutを生成させ、1度も正解できなかったものは除外。またN回のうち何回正解できたかをconfidenceとして保持
- 正解rolloutを生成する過程において、strong agentによって回答がuniqueでないと判断されたものは除外する(厳密ではなくとも、曖昧なタスクを除外する効果を期待する)

上記はtext modalityのQAの合成の場合で、multi modal (image)の場合は、reasoning graphのノードの一部を画像に置換し、画像の中身を解釈した上で次のノードを検索するといった依存関係に変更することでimageを理解しないと応答不可なQAを合成するようである。
verificationについても、上記text onlyのverificationに加え、VLMに基づいたimage onlyのverification(imageだけで回答できるものは除外、imageがQuestionと関係なさすぎる場合は除外等)したり、text+imageをstrong agentに与えN回ロールアウトを実施し正解率を算出し、正解率が高すぎるQAを除外するといった処理を実施しているようである。




Paper/Blog Link My Issue
#Analysis #EfficiencyImprovement #Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #Scaling Laws #KeyPoint Notes #DownstreamTasks Issue Date: 2026-02-18 GPT Summary- 拡散型言語モデルは生成速度向上の可能性から自己回帰型モデルの代替手段となり、マスクド拡散が優位なアプローチとして注目されている。本研究では、一様状態拡散法と補間的離散拡散法のスケーリング法則を初めて提示し、マスクド拡散モデルが約12%のFLOPs効率向上を示すことを報告。パープレキシティは拡散ファミリー内で有用だが、他のファミリーとの比較では誤解を招くことがある。全手法を17億パラメータにスケールすると、一様状態拡散は依然として競争力を保ちつつ、GSM8Kで他モデルを上回りつつパープレキシティは悪化する結果となった。 Comment

元ポスト:

Loading…

pj page: https://s-sahoo.com/scaling-dllms/

Masked Diffusion Language Model (MDLM)はperplexityの観点では高い性能が出るが、異なるDiffusion Algorithmを比較する上でPerplexityが良い指標なのか?がResearch Questionで、3種類の拡散モデル[^1]に基づくモデルを同一の計算量の元でスケーリング時の挙動を分析したとのこと。

その結果、計算量を投入すればするほどARモデルのような綺麗なスケーリング則が全てのモデルで見出されたが、PerplexityがARと同等の性能に到達するためには、MDLMが14--16倍、Duoが23倍、Eso-LMが32倍の計算量を要した。
Perplexityの観点ではMDLMが良さそうだが、Perplexityが良いからといって、サンプル効率、あるいは下流タスクの性能が良いとは限らないため追加の分析を実施。

スループット(token/sec)を変化させて検証したところ、ARは品質が高いが遅く、スループットが高い領域ではDuoがサンプル効率と品質のパレート最適であることがわかり、中くらいの領域ではEso-LMがパレート最適、低い領域でさARがパレート最適であり、スループットと品質の観点ではMDLMは劣ることがわかった。

その後、パラメータ数を1.7Bに固定し、Nemotron Pretrainingデータセットで事前学習をし、zeroshotでの(尤度ベースでの)下流タスクの性能を見ると、MDLMよりもDuoの方が5/7のベンチマークで性能が良く、その後GSM8KでSFTすると、DuoのPerplexityは低かったにも関わらず、全てのモデルを上回った。

[^1]: MDLMに加えて、Uniform-state Diffusion (Duo), Interpolating Diffusion(Eso-LM)というモデルで比較しているようである。この辺はあまり詳しくないので勉強したい。

という話が元ポストに書かれている。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #Diversity #Environment Issue Date: 2026-02-17 GPT Summary- LLMの進展により、自律エージェントが複雑なタスクを実行する能力が向上したが、信頼できる環境の不足がスケールを制約している。本研究では、Agent World Model(AWM)という合成的な環境生成パイプラインを提案し、1,000のシナリオを用意し、平均35ツールとの相互作用を可能にする。これにより、信頼性の高い状態遷移と高品質な観測が得られ、マルチターンのツール使用エージェントに対する強化学習で有効性を確認。合成環境のみでも良好な分布外一般化が得られることを示した。コードは公開されている。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #SelfCorrection #Test-Time Scaling #Author Thread-Post Issue Date: 2026-02-13 GPT Summary- MDMの問題を解決するために、生成中のトークンを修正する「プログレッシブ自己修正(ProSeCo)」フレームワークを提案。これにより、アンマスクされたトークンの修正が可能になり、質の向上と生成速度の最大2-3倍の高速化を実現。実験によって、ProSeCoがMDMを超える性能を示した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #ICLR #Off-Policy #KeyPoint Notes #Open-endedTasks #ConfidenceBased Issue Date: 2026-02-13 GPT Summary- NRT(ネイティブ推論トレーニング)は、教師ありファインチューニングと強化学習の依存を克服し、標準的な質問-回答ペアのみでモデルが自ら推論を生成します。推論を潜在変数として扱い、統一訓練目標に基づいて最適化問題としてモデル化することで、自己強化フィードバックループを構築。LlamaおよびMistralモデルにおいて、NRTが最先端の性能を達成し、従来の手法を大幅に上回ることを実証しました。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=abAMONjBwb

verifier freeでreasoning能力を向上させるRL手法で
- SFTにおいてexpertsのtrajectoryが必要な課題
- RLVRにおいてverifiableなドメインでしか学習できない課題

の両方に対処する。

具体的にはQAデータが与えられたときに、Questionに対してモデルにreasoning trace zを生成させ、zを生成した後にanswerを生成させる。zに対するTrace Rewardとanswerトークンに対するモデルのconfidenceを報酬として用いてRLする。

SFTやverifier freeな先行研究よりも9種類のreasoningベンチマークで高い性能を達成している。また、answer tokenのconfidenceに対する3種類の集約方法(平均, 1/pによって加重平均をすることで難しいトークンの重みを強める, 対数尤度を用いる)も提案手法も提案され比較されている。
image

論文中ではオフポリシーRLとして最適化する旨記述されているが、appendix記載の通りreasoning trace zを生成しているので、オンポリシーRLな性質も備えていると思われる。




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Chain-of-Thought #Reasoning #SelfImprovement #RLVR #PRM #RewardModel #One-Line Notes #Rubric-based Issue Date: 2026-02-12 GPT Summary- CoTがLLM推論において重要である一方で、報酬モデルの訓練には多くの人手が必要で、静的モデルは変化に対応しづらい。これを解決するため、自己進化するCoT報酬アプローチ「RLCER」を提案。自己提案・自己進化するルーブリックにより、結果報酬なしでも信頼性のあるCoT監視信号を提供し、結果中心のRLVRを上回ることを実証。また、ルーブリックは推論時のパフォーマンスを向上させる効果もある。 Comment

元ポスト:

Loading…

CoTを評価するためのルーブリックを自己進化させて、CoTの評価もしつつ、outcomeに基づくRLVRを実施するといった処理を単一のポリシーで実現する、というような話に見える(過去のCoTに対する監視手法ではPRMが別途用意されていた)。
image

単にRLVRをする場合よりも最終的な性能が向上し、特にlong runの場合の安定性が高まっているように見える。
image




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Regularization #KeyPoint Notes #DownstreamTasks #Reading Reflections Issue Date: 2026-02-12 GPT Summary- 事前訓練での重みの減衰がモデルの可塑性に与える影響を分析。高い減衰値が微調整時に性能向上を促進し、直感に反するトレードオフを引き起こすことを示す。重みの減衰が線形分離可能な表現を促進し、過学習を抑制する役割も明らかに。ハイパーパラメータ最適化における新たな評価指標の重要性を強調。 Comment

元ポスト:

Loading…

事前学習時にWeight Decayを大きくするとPerplexityは悪化する場合があるが、Perplexityが悪化していたとしてもSFTを通じて最終的に得られるdownstream task性能のgainが高い場合がある、という話に見える。つまり、Findings2に書かれている通り、事前学習時にPerplexityを最小化するようなWeight Decayの設定はdownstream性能を高めるという観点では必ずしも必須ではない。ではなぜこのようなことが起きるかというと、Weight Decayを大きくするとAttentionのQK matricesのpseudo-rank(=行列の95%を説明するのに必要な特異値の割合)が改善されることが実験により観察され、一般的に低ランクな表現は正則化の結果として現れることから、シンプルな表現によってよりモデルがロバストになるのでは、という点が考察されている。また、実際にValidation dataとTraining dataのlossの差分を見ることで、Weight Decayが大きいことによってtraining dataへのoverfitが抑制されていることが観測された。
image

Weight DecayはもともとRegularizationとしての働きがあるので、それはそうなのだろうな、という感想を持ったのだが、特にQK matrixが正則化の影響を強く受けるというのはおもしろかった。つまり、クエリ対してよりロバストな写像を学習できているということだと思われる。

Perplexityが事前学習の良さを測るために必ずしも良いわけではないよ、という意味での関連:
- [Paper Note] Perplexity Cannot Always Tell Right from Wrong, Petar Veličković+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #Chain-of-Thought #Reasoning #Selected Papers/Blogs #Generalization #KeyPoint Notes #Author Thread-Post Issue Date: 2026-02-12 GPT Summary- SFT(教師ありファインチューニング)の重要性を強調し、小規模データセットでの繰り返しトレーニングが大規模データセットでの単一エポックよりも優れていることを示す。Olmo3-7Bが400サンプルで128エポックのトレーニングによって、51200サンプルでの1エポックよりも12-26%の性能向上を実現。トレーニングトークンの精度が改善の指標となり、このパターンは一貫して確認される。これにより、高価なデータスケーリングに代わる実践的アプローチを提供し、繰り返しの利点を新たな研究課題として提示。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

**long-CoTのSFTにおいては**、多くのユニークなデータで学習するよりも、小さなデータセットを複数エポック繰り返し学習する方が優れていることが分かったとのこと。この傾向はモデルを跨いで存在する(Olmo3とQwen3で実験)。
より多くのエポック数 vs. より多くのユニークデータ数 でのモデルの傾向の違いとしては、前者の方がReasoningにおいて最終的な回答を出す割合が非常に大きくなることが分かった(たとえばFigure2 Rightの1 epoch 51200サンプルの24% vs. 256 epoch 200サンプル)。
image

では繰り返しの恩恵を得られなくなるのはどの時点かというと、Token Accuracy (=モデルのnext token predictionのtargetと一致する予測トークンがtopになった割合)が100%に近くなるとそれ以上epochを繰り返してもgainが無くなるので、これをSFTのstopping criteriaとして利用可能とのこと。

image




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Chain-of-Thought #Reasoning #PEFT(Adaptor/LoRA) #Selected Papers/Blogs #Generalization #KeyPoint Notes #Initial Impression Notes Issue Date: 2026-02-12 GPT Summary- 内在次元数を指標として、推論チェーンの有効性を定量化。異なる推論戦略がタスクの内在次元数を低下させ、一般化性能に逆相関を持つことを示す。これにより、有効な推論チェーンがパラメータを効果的に利用し学習を促進することを明らかにする。 Comment

元ポスト:

Loading…

元ポストを読むと、以下のような話のようである。非常に興味深い。

良いCoT(推論)はタスクを圧縮する(すなわち、inputを正解へとマッピングする際の自由度を減少させる)ことを示した。

さまざまなCoT戦略に対して、あるタスクに対してさまざまなCoT戦略と、**特定の性能に到達するまでに必要な最小のパラメータ数の関係性(=intrinsic dimensionality)**を分析。パラメータ数の制御はLoRAのパラメータを変化させることによって調整して実験。その結果、Intrinsic Dimensionalityがdownstream taskの性能と、OODへの汎化性能に対して非常に強い相関を示した(Perplexityよりも強い相関)。

Intrinsic DimensionalityをさまざまなCoT戦略で測定すると、(school math系のデータに関しては)python codeを生成し実行する方法(Executed PoT)が最もコンパクトなsolutionを生成し、かつ最も良いOODへの汎化性能が高いことがわかった(他ドメインでこのCoT手法が適しているとは限らない点には注意)。
また、モデルスケールが大きい方がより低いIntrinsic Dimensionalityを示し、良いcompressor(=タスクを圧縮する能力が高い)であることがわかった。
弱くてノイジーなCoT戦略は、スケールせず、パラメータ効率が悪いことがわかった。

非常に興味深い研究で、かつskim readingしかできていない上での感想なのだが、
- 実験がLoRAベースで実施されているため、他の学習のダイナミクスにおいて同様のことが言えるのかという点
- Gemmaでしか実験されていないため他のアーキテクチャでも同じようにIntrinsic Dimensionalityの有効性が言えるのか
- データセットがGSM系列のschool mathドメインでしか実験されていないため、ドメイン間でどの程度一般性を持って言える話なのかという点

は明らかになっていない気がしており、どうなるのか興味がある。また、実際にIntrinsic Dimensionalityを測定しようとした場合に、効率的に求める方法はあるだろうか。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Rubric-based #Open-endedTasks Issue Date: 2026-02-11 GPT Summary- Rubric-ARMフレームワークは、スカラー得点を超えて創造的応答の多面的な質を捉えることを目的としている。報酬フィードバックからの強化学習を用い、rubric生成器と判定者を共同最適化し、既存手法の静的な制約を克服。交互最適化戦略を導入し、その効果を理論的に分析。実験により、Rubric-ARMが複数のベンチマークで最先端の性能を発揮し、強化学習環境でのポリシー整合性を大幅に改善することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #MultiModal #Attention #VisionLanguageModel #One-Line Notes Issue Date: 2026-02-11 GPT Summary- 強化学習を用いた内部注意分布の直接最適化を通じて、マルチモーダルLLMの情報配分を改善する強化注意学習(RAL)を提案。RALは複雑な入力におけるグラウンディングを向上させ、さまざまなベンチマークで一貫した性能向上を示す。オンポリシー注意蒸留を採用し、クロスモーダル整合性を強化する新たなアプローチを提供。 Comment

元ポスト:

Loading…

マルチモーダルLLM(実験ではVLM利用)におけるクロスモーダルなAttention表現を改善するためのRLに基づく事後学習手法で、attention分布を直接最適化する手法な模様




Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #ReinforcementLearning #Evaluation #SelfImprovement #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment

元ポスト:

Loading…

関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。

image

APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。




Paper/Blog Link My Issue
#Multi #EfficiencyImprovement #NLP #LanguageModel #AIAgents #Distillation Issue Date: 2026-02-10 GPT Summary- LLMを用いたマルチエージェントシステムを、AgentArkフレームワークで単一モデルに蒸留し計算効率を向上。三つの蒸留戦略で推論性能と自己修正能力を強化。効率的かつロバストなマルチエージェント開発を目指す。 Comment

関連:
- [Paper Note] Reasoning Models Generate Societies of Thought, Junsol Kim+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #ReinforcementLearning #Reasoning #LongHorizon #Compression Issue Date: 2026-02-09 GPT Summary- InftyThink+は、モデルによる制御された反復推論と要約を基にした強化学習フレームワークで、中間的な思考の劣化を軽減し、反復推論の効率を最適化します。教師あり学習の後、二段階の強化学習を行い、戦略的要約と推論の再開を学習。実験では、従来方法に比べて精度を21%向上させ、推論レイテンシを大幅に削減しました。 Comment

pj page: https://zju-real.github.io/InftyThink-Plus/

元ポスト:

Loading…

一言解説:

Loading…

con-currentwork:
- [Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02

reasoningを要約することで圧縮し次のreasoningを繰り返すような枠組みのように見え、
- [Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02

と類似したアプローチに見える。
image




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Evaluation #Coding #Mathematics #PEFT(Adaptor/LoRA) #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-02-09 GPT Summary- LoRAのバリエーションを広範なハイパーパラメータ探索で再評価。異なるLoRA方法は独自の学習率範囲を好み、適切調整で全体的に同様のピーク性能を達成。バニラLoRAは競争力のあるベースラインで、以前の改善は一貫性を欠く可能性あり。最適な学習率範囲の違いはヘッセ行列の固有値の変動に起因。 Comment

元ポスト:

Loading…

LoRAに関連して様々な手法が提案されているが、様々なモデルスケールとコーディングと数学ドメインで広範な設定(バッチサイズや学習率)で実験して主要な手法を再評価したところ、LoRAは学習率にsensitiveで、依然として初期のLoRAが強力な手法であることが示された。過去の研究での比較実験はハイパーパラメータの調整不足な可能性が高いことを示唆している。重要研究。

なお、Table2にLoRAの変種に関する研究のリストがあるが、約50種類ある。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #One-Line Notes #BudgetAllocation Issue Date: 2026-02-08 GPT Summary- 強化学習は大規模言語モデルの推論能力を向上させるが、その効果は相対予算によって異なる。この研究では、$ξ:= H/\mathbb{E}[T]$を通じて相対予算理論を提案し、報酬の分散や情報的経路の発生確率がサンプル効率を決定することを示す。分析により、{不足}、{バランス}、{十分}の三つの領域を明らかにし、特にバランス領域で最大のサンプル効率を持つことが判明。また、オンラインRLに対する有限サンプルの保証を提供し、実証的に学習効率の最適化と推論性能のピークに一致する予算範囲を特定。 Comment

元ポスト:

Loading…

元ポストに要旨が簡潔に日本語でまとめられている。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #CrossDomain #Generalization #KeyPoint Notes #DomainGap #Initial Impression Notes Issue Date: 2026-02-08 GPT Summary- 一般化されたLLMエージェントのポストトレーニングにおける課題を調査。特に、強化学習環境の特性がアウトオブドメイン性能に与える影響を分析。状態情報の豊富さとプランニングの複雑さがクロスドメインの一般化に強く相関し、リアリズムやテキスト類似性は主要な要因ではないことを発見。状態情報を増やすことでロバスト性を向上可能で、ランダム化技術を提案。また、モデリング選択として、SFTのウォームアップが忘却を防ぐが一般化を損なう可能性や、ステップ・バイ・ステップ思考が一般化に重要な役割を果たすことを示した。 Comment

元ポスト:

Loading…

事後学習におけるクロスドメインの汎化性能に関する調査を行い、ドメインの表層的な情報ではなく、
- 状態情報の豊富さ(どれだけのテキストを処理する必要があるか; 認知コスト)
- 推論の複雑さ(long-horizonやゴールへの到達可能性)

がドメイン間の汎化に相関を示すことが明らかになり、要は構造の複雑さが鍵であることが分かった。

ドメイン間の汎化性能を改善するために、実タスクは変えずにobservationに対して少量のノイズを加えることで、モデルがノイズから重要なシグナルを抽出することを学習し汎化性能が向上。

RLを行う際の注意点として、
- mid-trainingはDataMixに含まれるドメインの知識を補充するが、カバーされていないドメインの忘却をより悪化させる可能性があり
- ステップ単位での推論が汎化性能向上に役ダウン(言い換えると、ショートカットは転移しない)

を挙げており、

デプロイされるドメインが不明な場合の実用的な対策として
- より状態の記述がリッチなドメインかつ複雑な推論を要する環境で学習し
- 明示的な推論をオンにし
- 軽量な状態情報へのノイズの注入や拡張をすふこと

を挙げている。

さらにざっくり言うとエンコード時にドメインの表層情報に依存させず、表層情報の中から必要な情報を抽出するスキルをモデルに学習させ、かつデコーディング時は精緻な推論によって誤った転移を防ぐのがドメイン間の汎化の鍵、という話に感じる。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #RLVR Issue Date: 2026-02-06 GPT Summary- REALフレームワークは、強化学習における報酬をカテゴリカルラベルとして再考し、ポリシー最適化を分類問題として定式化することで、効率的なポリシー更新を実現します。このアプローチは、勾配重み付けの不一致を軽減し、均衡の取れた勾配配分を可能にします。実験では、REALがGRPOやDAPOに対して一貫して優れた性能を示し、1.5Bモデルで6.7%、7Bモデルでも引き続き改善を達成しました。 Comment

元ポスト:

Loading…



[Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02


Paper/Blog Link My Issue
#Analysis #Tools #NLP #LanguageModel #LLM-as-a-Judge #read-later #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #ChunkyPostTraining Issue Date: 2026-02-06 GPT Summary- LLMのポストトレーニングでは、偶発的なパターンがモデルに影響を及ぼし、意図しない行動を引き起こすことがある。これを「チャンクポストトレーニング」と呼び、特定の質問形式に対して虚偽の相関が現れる理由を探るため、「SURF」というブラックボックスパイプラインと、「TURF」という追跡ツールを提案。これらのツールを用いて、フロンティアモデルやオープンモデルでの誤校正された行動の生成を示し、ポストトレーニングデータの不均衡が影響していることを明らかにした。 Comment

元ポスト:

Loading…

事後学習データは特定の行動を学習することを意図して作成されるが、離散的なチャンクの集合として学習したときに、それらに意図しない特徴に基づく相関が含まれ(たとえば、コーディングのデータセットに不自然に形式的な表現が含まれたときに、モデルがそのような表現が用いられた時はコーディングの指示だと学習してしまうなど)、モデルがそれを学習してしまうこと(= Chunky PostTraining)を提唱し、これによって生じる失敗モードの実例として、Haiku 4.5j「5+8=13ですか?」と質問した際に「いいえ、5+8=13は正しくありません。正しい答えは5+8=13です」と応答するような例を挙げている。これはモデルが明らかに正しい答えを知っているが、プロンプト中の何らかの特徴によって反論的な振る舞いが引き起こされているような例であり、こういった失敗を発見するための手法を提案している。

手法としては、失敗モードを評価するためのルーブリックと、promptに関するAttributeの集合(e.g. これは車に関する質問である, これはロシア語であるなど)を定義し、attributeのプールからサンプリングをして失敗モードを引き起こすクエリの候補を自動生成する。その後LLMに対してクエリを投げて得られた応答をルーブリックに基づいてLLM-as-a-Judgeによってスコアリングし、TopKのサンプルを残しリプレイバッファ[^1]を更新する。更新されたリプレイバッファを用いてAttributeの重みを更新し、よりスコアが高いAttributeに基づいてクエリ候補が生成されるようにし、再度クエリ生成をして同様の操作をするよう繰り返す、といった手法のようである。
LLMを完全にブラックボックスとして扱い、応答テキストにのみに基づいて実行されるため、proprietary LLMに対しても実行可能である。
image

[^1]: リプレイバッファは、個々の(クエリ, スコア, attribute, スコア)の4つ組の集合によって定義される。

所見:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #ReinforcementLearning #AIAgents #ICML #Test-Time Scaling #LongHorizon #GPUKernel #Environment #Author Thread-Post Issue Date: 2026-02-06 GPT Summary- 高品質のカーネル生成はスケーラブルなAIシステムの鍵であり、そのためのLLM訓練には十分なデータと堅牢な環境が必要です。本研究では、KernelGYMを設計し、報酬ハッキングを防ぐマルチターンRL手法を検討します。TRLOOを提案し、偏ったポリシー勾配問題を解決。訓練されたDr.Kernel-14Bは高性能を達成し、生成されたカーネルの31.6%がTorch参照に対して1.2倍のスピードアップを実現しました。全リソースはGitHubで公開されています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #RLVR #One-Line Notes Issue Date: 2026-02-06 GPT Summary- 報酬関数の設計における二値のスパース性に対処するため、本研究ではリファレンスアンサーから導出された対数確率を報酬として使用することを検討。対数確率報酬は所有検証者に依存せず、数学推論ベンチマークでの性能を向上させることがわかった。この方法は、チェインオブシンキング(CoT)ファインチューニングの新たな実行可能な戦略として位置づけられ、検証可能・非検証可能な設定でのパフォーマンスを向上させる効果が確認されました。 Comment

元ポスト:

Loading…

関連(concurrent work):
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02

最終応答のlogprobを報酬として利用する設定のRL(i.e., 検証可能なタスクでなくとも適用可能)を調査し、検証可能な応答のlogprobを報酬として利用することでbinary rewardと同等以上の性能を達成可能であることを示したようで、検証可能でない設定で学習すると途中でCoTが崩壊し、CoTが極端に短くなる現象が生じる。これは初期のCoTの長さと正解の対数尤度に負の相関があり、これによってRLがCoTを短くすることを奨励してしまうからではないか、という話が元ポストに記述されている。

関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Analysis #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #read-later #Selected Papers/Blogs #Stability #KeyPoint Notes #train-inference-mismatch Issue Date: 2026-02-06 GPT Summary- 強化学習におけるPPOの限界を指摘し、低確率トークンの更新が過剰に罰せられる問題を解決するため、ダイバージェンス近似ポリシー最適化(DPPO)を提案。DPPOは、ポリシーの逸脱を直接推定することで学習ダイナミクスの非最適性を改善し、効率的なバイナリおよびトップK近似を導入することでトレーニングの安定性と効率を向上させる。 Comment

元ポスト:

Loading…

PPOはトークン単位の確率比をrefと現在のポリシーからの算出しrefから離れすぎないようにクリッピングをするが、この場合非常に低確率で出現するトークンは過剰にクリッピングされる傾向にある。しかしその低確率トークンを調べると実はReasoningにおいて重要なトークンであったり(Wait, Thus, Next)、数学での重要なシンボル(+,-,=)、数値トークンであり、結果的にこれらReasoning系のタスクで重要なトークンの学習を阻害してしまっており(実際にこれらの低確率トークンをクリッピングされないようにしたら学習効率が大幅に改善)、語彙数が多いLLMの学習においては相性が悪い(別の視点として高確率トークンに対して過剰にペナルティを与えるという傾向もある)。これを改善するために、確率比をクリッピングするのではなく、ポリシーとrefのDivergenceの上界を直接制約することで解決し(語彙数が大きすぎてDivergenceを計算できないので近似的な計算方法も提案されている模様)、実際に適用すると学習が非常に安定し、かつ学習効率が既存手法と比較して高まりました、という話にみえる。

解説:

Loading…

一言解説:

Loading…

400B級のモデルの事後学習で、
- エントロピー崩壊を防ぎ
- より高速で安定して収束し
- context長の外挿に強い

ことが確認されたとの報告がある。

Loading…


- Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #AIAgents #Initial Impression Notes Issue Date: 2026-02-06 GPT Summary- マルチエージェントシステムを用いた情報探索の幅のスケーリングを探求する本研究では、WideSeek-R1フレームワークを提案。リードエージェントとサブエージェントが共同最適化することで、20,000のタスクで高い性能を発揮。WideSeek-R1-4BはアイテムF1スコア40.0%を達成し、性能がサブエージェント数の増加と共に向上することを示す。 Comment

元ポスト:

Loading…

Context Foldingと比較した時の新規性がweaknessに感じる:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10




Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #ReinforcementLearning #AIAgents #Reasoning #read-later #RLVR #Selected Papers/Blogs #OOD #Generalization #KeyPoint Notes #LongHorizon #Robustness #Compression #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 大規模言語モデル(LLM)は、テスト時の適応能力により複雑な問題を解決する外挿特性を持つが、標準的な強化学習(RL)はその変化に制約がある。これに対処するために、反復デコーディングアルゴリズム(RC)を導入し、LLMの応答生成能力を活用して推論を継続的に改善。実験では、16kトークンの訓練で4BモデルがHMMT 2025でのパフォーマンスを40%から約70%に引き上げ、既存のモデルを上回る結果を示した。RCを使用したモデルは、学習した要約生成能力によりテスト時のパフォーマンスも向上できることが証明された。 Comment

元ポスト:

Loading…

reasoningの生成と、生成されたreasoningとinputで条件付けでsummaryを生成、さらにinputとsummaryで条件付けてreasoningを生成するという、生成と要約を反復する枠組みを採用(LLMはreasoningを要約することが生成するよりも得意で、かつ過去の要約から将来の推論を生成できるという非対称性を活用)することで、訓練時の予算は決まっているため、訓練時の予算では到達できないhorizonにテスト時に遭遇すると汎化しない課題を克服し、テスト時により長いステップ数の推論もこなせるように外挿する。また、このようなgeneration-summaryの反復を各ステップごとでRLVRすることでさらに性能を向上でき、実際にlong horizonな推論や学習時よりもより長いreasoning token budgetの場合に大きなgainを獲得できている。

RLVRをする際に各ステップごとのSummaryを保存しておき、各ステップのsummaryが与えられたときに正解できるかどうかのシグナルに基づいて、ステップごとの要約で条件付けられた応答能力を改善する。これにより、さまざまなステップで応答を生成する能力が強化され、結果的にshort horizonからlong horizonの推論をする能力が強化される。
このときsummaryはリプレイバッファとして扱い後のepochの訓練でもオフポリシーデータとして活用する。要約はinputに条件付けられて生成されるものであり、optimizationのtargetとは異なるためリプレイバッファとして活用でき、かつさまざまな要約に対して正解が生成できるように学習されるためテスト時の要約の分布のシフトにロバストになる。また、オンポリシーデータだけだと、long horizonに対する要約は非常に稀になるため、リプレイバッファを利用することで補う。

テスト時に学習時を超えたhorizonで推論できることは現在のAIエージェントの大きな課題だと思うので非常に興味深い研究だと思う。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Reasoning #PEFT(Adaptor/LoRA) #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 低ランクアダプタTinyLoRAを提案し、推論のための強化学習が低ランクパラメータ化を効果的にスケールできることを示しています。わずか13のトレーニングパラメータでQwen2.5を91%の精度に達成し、複雑なベンチマークでも少ないパラメータで90%のパフォーマンス向上を実現しました。特に、強化学習を用いることで、従来の方法よりも大幅に少ないパラメータで強力な結果を得ることができました。 Comment

元ポスト:

Loading…

Qwen2.5に関してはLlamaと比較して異なる傾向が生じることは以下でも見受けられる。果たして本研究で報告されていることはどこまで一般的なのだろうか?:
- [Paper Note] Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination, Mingqi Wu+, arXiv'25
- [Paper Note] Spurious Rewards: Rethinking Training Signals in RLVR, Shao+, 2025.05




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #One-Line Notes Issue Date: 2026-02-05 GPT Summary- LLMのために強化学習のポリシー勾配アルゴリズムを改善するため、固定アンカーポリシーをEMAに置き換え、Top-k KL推定器を導入。これにより、性能が大幅に向上し、数学的推論ではQwen-1.5BがOlympiadBenchで53.9%を達成。Qwen-3Bでは、EMA-PGがGRPOを7つのデータセットで平均33.3%改善し、特にHotpotQAや2WikiMultiHopQAにおいて顕著な向上を示した。全体として、EMA-PGはLLMの強化学習をスケールするための有力なアプローチである。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

KL正則化のRefが古くなりすぎるので指数移動平均(直近の更新重視の移動平均)を用いて更新されるようにし、KLの計算が重いのでTopKのトークンで近似的に計算することで高速化、という感じに見える。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #read-later #RLVR #Selected Papers/Blogs #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- RLVRはLLMの推論を解きほぐす基盤だが、検証データの不足がスケールアップのボトルネックとなっている。この課題を克服するために「ゴールデン・グース」を提案し、インターネットの非検証テキストから無限のRLVRタスクを生成する。具体的には、LLMに主要な推論ステップを特定させ、豊富なタスクを持つGooseReason-0.7Mデータセットを合成。これにより、従来モデルを復活させ、15のベンチマークで新たな最先端結果を達成。また、リアルなサイバーセキュリティデータからRLVRタスクを合成し、Qwen3-4B-Instructをトレーニング。これにより7Bモデルを超える成果を上げ、推論に富んだインターネットテキストを活用する可能性を示している。 Comment

元ポスト:

Loading…

テキストからMultiple Choice Question (MCQ) を生成することでRLVR用のverifiableな学習データを大量に合成可能にする。おそらく次のステップとしては、生成されるMCQの stem, key, distractor の質が今度は焦点となり、そこの質が改善されればより大きなgainを得られるようになる気がする(たとえば消去法で正解を知らなくても正解できてしまうようなdistractorや、問題文に正解がそのまま含まれてしまっているようなノイジーなMCQから人間が何も学ばないように、モデルが学習するときと一緒だと思われる)。

データとモデルが公開:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #read-later #RLVR #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-02-05 GPT Summary- 強化学習を用いてモデルを訓練する際、尤度の最大化ではなく低次近似を最適化する限界に触発され、最大尤度強化学習(MaxRL)を提案。これは、サンプリングされたデータから最大尤度を近似するためのフレームワークであり、得られた目的関数はシンプルで偏りのないポリシー勾配推定を可能にする。実験では、MaxRLが既存の手法を上回り、テスト時間効率を最大20倍向上。追加データや計算へのスケーラビリティも優れており、RL訓練を正確性に基づいて拡張するための有望なフレームワークであることを示した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

pj page: https://zanette-labs.github.io/MaxRL/

skim readingしかできていないが、
微分不可能な生成がされbinaryの正誤が与えられるような条件下でモデルを最適化するときにxが与えられてyが正解である確率はimplicitな尤度を表している。この最適化問題を解くために現在はRLが利用されており、RLは正解の確率pを最大化するような定式化がされているが、最尤推定で定式化するとlog pで定式化をすることになり、これは根本的に異なる最適化となる。具体的には、RLはpass@1に対して最適化しているが、MaxRLはk=1,...∞に対するpass@kの調和平均に対して最適化をするような違いがある。この最尤推定の勾配は実は成功したtrajectoryのスコアの平均という非常にシンプルな形で近似的に求められるらしく、最尤推定として解くと最大20倍程度効率が向上した、といった話に見える。

関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
- [Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #In-ContextLearning #Stability #Scheduler #Routing #Initial Impression Notes #BudgetAllocation Issue Date: 2026-02-05 GPT Summary- GRPOを用いた訓練において、$V_0$という新たなバリューモデルを提案。これはパラメータ更新を必要とせず、モデルの期待パフォーマンスを推定し、能力の変化を捉える。$V_0$は成功率を予測し、効率的なサンプリングを実現。結果、LLMルーティングタスクにおいて、コストとパフォーマンスのバランスで優れた結果を示した。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

Actor-Critiqueの枠組みにおいてValueモデル(のポリシーに追従するための逐次的な更新が)重すぎる問題をGRPOはValueモデルを無くすことで回避したが今度はロールアウトのサンプリングコストがでかすぎる問題があるので、学習無しで汎用的に利用可能なValueモデル(パラメータ更新ではなくICLとして定義する)を用いて、ロールアウト前から成功率を予測し無駄なロールアウトを削減したり、クエリをどのモデルに投げるかといったルーティングをするなどの計算機リソースの配分を決めるといったことをやるらしい。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SelfImprovement #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 強化学習フレームワーク「RLAnything」は、動的に環境、ポリシー、報酬モデルを生成し、学習信号を増幅することで、全体的なRLシステムを強化します。ポリシーはフィードバックを用いて訓練され、報酬モデルは一貫性フィードバックにより最適化されます。理論に基づく自動環境適応により、各モデルからの批評が訓練を改善します。実証例として、RLAnythingはOSWorld、AlfWorld、LiveBenchで大幅な性能向上を示しており、最適化された報酬モデルが人間のラベルを超える結果を出しています。 Comment

blog: https://yinjjiew.github.io/projects/rlanything/

元ポスト:

Loading…

環境、ポリシー、Reward Modelが互いにフィードバックし合ってco-trainingされる枠組み




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #read-later #TextualFeedback #SelfDistillation Issue Date: 2026-02-05 GPT Summary- テキストフィードバックを用いた強化学習(RL)によるLLMの後処理を研究。スカラー報酬に対し、テキストフィードバックはコストが低く、豊かな情報を提供。モデルはトレーニング時にフィードバックを内部化し、推論時にシングルターンの性能を向上させる。自己蒸留(RLTF-SD)とフィードバックモデリング(RLTF-FM)の2つの手法を提案し、さまざまなタスクでの効果を検証。結果は強力なベースラインを上回ることで、豊かな監視源としてのRLの可能性を示している。 Comment

pj page: https://rl-textfeedback.github.io/

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #SyntheticData #Coding #MultiLingual #SoftwareEngineering #mid-training #read-later #Selected Papers/Blogs #Verification #Scalability Issue Date: 2026-02-05 GPT Summary- SWE-Universeは、GitHubのプルリクエストから自動的に検証可能なソフトウェア工学環境を構築するためのスケーラブルなフレームワーク。カスタムトレーニングされたビルディングエージェントが反復自己検証とハッキング検出を用いて信頼性の高いタスク生成を実現。これにより、実世界の多言語SWE環境が100万以上増加し、Qwen3-Max-Thinkingにおいて75.3%のスコアを達成。次世代コーディングエージェントの発展に寄与。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

これまでと比較して非常に大規模な実PRに基づいた、さまざまなプログラミング言語に基づくverifiableな学習用の合成データを構築できる環境で、一つ一つの品質はSWE Benchなどには及ばないが、量が圧倒的




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #MoE(Mixture-of-Experts) #RewardHacking #RLVR #Stability #train-inference-mismatch Issue Date: 2026-02-03 GPT Summary- RLVRは大規模言語モデルの性能向上に寄与するが、MoEアーキテクチャでのトレーニングは不安定になる。本研究では、RLVRの不安定性を客観的レベルのハッキングの観点から考察し、トークンレベルの不整合による最適化目的のスプリアス信号を特定。30B MoEモデルの実験を通じて、トレーニングと推論の不一致の成長を追跡し、不安定性のメカニズムを解明。この研究はMoEモデルの安定性に関する具体的な指針を提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #Scheduler #train-inference-mismatch #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- 強化学習における言語モデルの訓練は不安定であり、その原因は訓練と推論の不一致にあるとされる。従来の対策では効果が薄いことが指摘され、本研究では勾配ノイズとミスマッチの連動を示し、更新サイズの縮小が効果的であることを発見。ミスマッチは動的な失敗と考え、動的に学習率を調整する新たな手法を提案。これにより、RL訓練を安定化し、不一致を抑制することができることが実証された。 Comment

元ポスト:

Loading…

Importance SamplingやFP16に設定することによるミスマッチの解決方法でも依然として(長期の訓練などにおいて)安定性の問題が出ることをAblationで確認し、提案手法がより安定することを示しているように見える。