ShortcutLearning


Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #On-Policy #SelfDistillation Issue Date: 2026-07-08 GPT Summary- OPSDはLLMの推論能力を向上させる方法として注目されているが、長いCoT推論モデルでは一貫して失敗している。これにより反省的推論能力が不安定化することが示されており、教師信号の分析から参照特有のショートカットが問題の根本原因であると特定された。提案された解決策は、参照のみに条件付けられた教師を構築し、質問条件付けられた推論成分を明確にすることと、PMI機構を通じてショートカットをフィルタリングすることである。実験は、基礎モデルと標準的なOPSDの両方で一貫した改善を示し、モデルのエピステミック挙動を維持した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #Initial Impression Notes Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の推論能力を高めるために、ヒントを注入したペアワイズ報酬モデルを統合した新しいフレームワークHIPPOを提案。重複データの問題を解決し、識別性の高い信号を提供することで、ショートカットの合理化と真の推論を効果的に区別。広範な実験で標準的なベースラインを大幅に上回り、真正な推論スキルを抽出できることを示した。 Comment

元ポスト:

Loading…

事前学習時にmemorizeされた知識でショートカットしてrewardを得るのではなく、解答へ向けてreasoningすることを促進する




Paper/Blog Link My Issue
#Article #NeuralNetwork #MachineLearning #Selected Papers/Blogs #Generalization #Nature Machine Intelligence Issue Date: 2026-05-16 GPT Summary- 深層学習はAIの中心であり、多くの分野で成功を収めているが、その限界も明らかになってきている。本研究では、深層学習の問題をショートカット学習の症状として整理。ショートカットとは、標準ベンチマークでは良好だが実世界には適用できない決定規則を指し、生物と人工の学習システムに共通の特徴である可能性が示唆される。これに基づき、モデル解釈とベンチマーキングに関する推奨事項を提案し、実世界への応用に向けた機械学習の強化を考察。