ImportanceSampling
[Paper Note] Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment, Yu Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Distillation #On-Policy Issue Date: 2026-07-12 GPT Summary- オフポリシー学習で生じる大規模言語モデルの問題を解決するため、Selective Importance Sampling(SIS)を提案。SISは、トークンレベルの拒否テストを通じてオフポリシー・トークンをオンポリシーに転送し、重要度スコアの補正を不要にする。理論的にギャップを縮小し、実行時のオーバーヘッドを減らし、多様なRLポストトレーニングアルゴリズムと組み合わせ可能。実験により、すべての目的を改善し、オフポリシー・データ下でのロバスト性を向上させることが確認された。 Comment
元ポスト:
