read-later (1126) — 2/6
[Paper Note] Scaling Self-Play with Self-Guidance, Luke Bailey+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #SelfPlay #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- 自己対話アルゴリズムにおけるLLMの限界を克服するために、Self-Guided Self-Play(SGS)を提案。SGSでは、Solver、Conjecturer、Guideの三役をモデルが担い、崩壊を避けつつ問題解決を行う。SGSの評価では、従来のRLベースラインを上回り、効率的な自己対話によって7Bパラメータモデルが671Bパラメータモデルよりも多くの問題を解決可能であることを示した。 Comment
元ポスト:
所見:
解説:
seed dataを与えた上でのSelf-PlayによるRLの性能を向上させる方法を提案している。
Self-PlayでRLをする場合、
- Solver: タスクを解く。タスクを解けるように学習される。(タスクが解けたか否かのbinary Reward)
- Conjecture: タスクを生成する。SolverのパフォーマンスをRewardとして学習される。
という構造が一般的だが、既存手法を分析した結果、学習が進むにつれ、ConjectureがSolverがそもそも解けない問題を生成するなどし、Reward Hackingが生じてしまい性能が向上しないことを発見。(Figure 2)
そこで、新たにGuideを追加し、Conjectureがタスクを合成する際にR_solve*R_guideの積の形式にRewardを調整し
- R_solveは(1 - Solverのsuccess rate)によって定義されるが、難しすぎる問題(success rate=0)、簡単すぎる問題(現在のバッチのtop 30%の問題)に関しては0に落とす。
- R_guideは合成タスクが、seed dataでSolverがまだ解けていない問題に関してどれだけの品質を有しているかに関するスコアを提供し(=unsolvedな問題に対する関連度、シンプルな結論が記述されており冗長な前提がないか、に関するRubricに基づくスコア)そのスコアをR_guideとする。つまり、seed dataにおいてまだ解けていない問題がより重視される。
ことで対処した。
self-playに関する代表的な先行研究:
- [Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03
解説:
[Paper Note] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, DeepSeek-AI+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #AIAgents #Attention #LongContext #PositionalEncoding #Optimizer #OpenWeight #Architecture #MoE(Mixture-of-Experts) #AttentionSinks #Selected Papers/Blogs #RewardModel #Reference Collection #KV Cache #Compression #GenerativeVerifier #SparseAttention #ResidualStream #SelfDistillation #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- DeepSeek-V4シリーズのプレビュー版が発表され、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashを含み、長さ100万トークンの文脈長をサポート。主なアップグレードには、効率的な文脈処理のためのハイブリッドアテンションアーキテクチャ、強化された残差接続、安定したトレーニングを実現するMuonオプティマイザが挙げられます。両モデルは、高品質の32兆トークンで事前学習され、ポストトレーニングパイプラインにより能力が強化されます。DeepSeek-V4-Pro-Maxは最先端の推論能力を誇り、特に長い文脈において高い効率を発揮します。モデルのチェックポイントは公開されています。 Comment
HF: https://huggingface.co/collections/deepseek-ai/deepseek-v4
元ポスト:
とうとうでました
所見:
所見:
Artificial Analysisによる評価:
所見:
所見:
-
所見:
1Mコンテキストにおいて、V3.2と比較してわずか10%のKV Cacheしか必要としないとのこと。
所見:
1Mトークンのcontext windowを実用的にするために最新の叡智が詰め込まれまくっているという感じのようである。うーむ読むしかない
所見:
RTX 6000で4基でFlashが動いたよ、という報告に見える:
解説:
所見:
関連:
- HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04
Self Rewarding LMsのコンセプトが利用されている:
Proは、Flashをlong contextを扱える様々なドメインのスペシャリストとして訓練し、OPDによって蒸留されたものなのでは?という話:
論文中に疑問点をアノテーションした結果が共有されている:
[Paper Note] When Can LLMs Learn to Reason with Weak Supervision?, Salman Rahman+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #RLVR #Selected Papers/Blogs #Memorization #Generalization #Reading Reflections #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大型言語モデルは、RLVRを通じて推論能力を向上させる一方で、高品質な報酬信号の構築が難しくなってきた。本研究では、データ不足、報酬のノイズ、自己教師付き報酬の下での実証研究を行い、一般化はトレーニング報酬の飽和ダイナミクスに左右されることを発見。一般化するモデルは長い局面を持ち、急速に飽和するモデルは記憶に偏ることを示した。また、推論の忠実度がモデルのレジームを予測する指標であることも特定。継続的な事前学習と監督付き微調整の効果を分離し、SFTが弱い監督下での一般化に必要であることを確認。これにより、Llama3.2-3B-Baseが以前は失敗していた三つの設定で一般化を達成した。 Comment
pj page: http://salmanrahman.net/rlvr-weak-supervision
元ポスト:
pj page: https://salmanrahman.net/rlvr-weak-supervision
- RLVRにおいて、シグナルが不完全な場合(i.e., weak supervisio)の3つの状況に基づいて、汎化性能を分析
- Scarce data: 8つの訓練事例
- Noisy Rewards: 最大90%のラベルに誤りがある
- Proxy Rewards: ground truthなしで、model confidenceにもとづく多数決のみを利用
- RLVRにおいて、Training Rewardが飽和する前に、より長いステップ数学習をしたモデルは、汎化性能が高くなる
- ➡︎ memorizationによって早期にTraining rewardが頭打ちになりgenericな能力を獲得できていないことが示唆される
- 汎化に失敗したモデルは探索が少ないのでは?ということが理由として考えられるが、実はこの説明は間違っている
- Llama, Qwenの2つのモデルを比較した時Llamaは訓練中Qwenと比較して高いsemantic diversityを維持していたが、最終的にQwenよりも汎化性能が低い(=memorization)してしまっていた
- ➡︎ 真の原因はfaithfullnessが低い推論であり、論理的にsupportされないreasoning traceの元正解に辿り着いてしまうことが原因であると考察
- 解決策として、reasoning dataを用いた `pre-RL training` を実施する。
- すなわち、RLVRを実施する前に、Llama-3.2-3Bに対して、継続事前学習(52B math tokens)を実施し、その後 Thinking SFT (43.5K reasoning Traces)を実施する
- CPTとThinking SFTによって、Llamaはweak supervision (i.e., scarce data, noisy rewards, proxy rewards)状況下でも意味のある学習を実施することができた
- ➡︎ reasoning能力が獲得されたことにより推論のfaithfulnessが改善されることで、memorizationが防止されより長いstep数訓練報酬が飽和せずに学習ができたため
といった話が著者ポストに記述されている。
memorizationを防止し、なるべくgenericな能力を身につけさせることが鍵という考え方は、最近色々なところで見かけるように感じる (Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
など)。単にデータをスケールさせるだけでなく、より効率的な学習のため、モデルに対してよりgenericな能力を身につけさせるための工夫(モデルの記憶容量をあえて減らす等)が今後進んでいきそうである。
- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
[Paper Note] Image Generators are Generalist Vision Learners, Valentin Gabeur+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Pretraining #FoundationModel #Selected Papers/Blogs #2D (Image) #UMM #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 画像生成モデルがゼロショット視覚理解を示すことは、LLMsの言語理解能力に似ている。視覚モデルは強力な理解能力を持つことが証明されておらず、本研究では画像生成がLLMの事前学習に似た役割を果たすことを示す。Vision Bananaを導入し、指示調整を行い、さまざまな視覚タスクで最先端の性能を達成。特に、セグメンテーションや深度推定タスクで競争力のある結果を得ており、画像生成が視覚学習において重要な役割を果たすことを示唆。生成的視覚の事前学習は、理解と生成の基盤となるFoundational Vision Modelsの構築において重要な変革をもたらす可能性がある。 Comment
pj page: https://vision-banana.github.io/#capabilities
元ポスト:
著者ポスト:
所見:
Vision bananaの批判に対する第一著者によるレスポンスのサマリのようである:
[Paper Note] Neural Garbage Collection: Learning to Forget while Learning to Reason, Michael Y. Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #KV Cache #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 連鎖的推論ではKVキャッシュの拡大がボトルネックとなっており、従来の手法は手作業で管理されている。よりスケーラブルな「Neural Garbage Collection(NGC)」を提案し、言語モデルが推論と同時に忘れることを学ぶ。モデルは推論中にキャッシュエントリの追い出しを決定し、これを強化学習で最適化。成果ベースのタスク報酬を用いて学習することで、高い精度を保ちながらキャッシュサイズを圧縮し、エンドツーエンドの最適化がモデルの能力を向上させる可能性を示した。 Comment
元ポスト:
LLMにReasoningとKV Cacheのマネジメントを同時に学習させる。
ポイント解説:
[Paper Note] Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems, Jiacheng Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #SoftwareEngineering #ContextEngineering #memory #AgentHarness Issue Date: 2026-04-20 GPT Summary- Claude Codeは、シェルコマンド実行やファイル編集をユーザーに代わって行うエージェント型コーディングツールであり、そのアーキテクチャをTypeScriptソースコードから分析する。本研究では、アーキテクチャを形成する五つの人間的価値観と十三の設計原理を特定し、実装に反映させる。システムは単純なwhileループを中心に構成されるが、その周囲には多様な機能が存在し、OpenClawと比較することで異なるアーキテクチャ的応答を示す。最後に、将来のエージェントシステムにおける未解決の設計指針を六つ特定した。 Comment
元ポスト:
[Paper Note] GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents, Mingyu Ouyang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #Evaluation #MultiModal #ComputerUse #Selected Papers/Blogs #VisionLanguageModel #Game #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment
元ポスト:
Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは
という感想を持っているからである。
pj page: https://gameworld-project.github.io/
[Paper Note] RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time, Haozhe Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #ComputerVision #NLP #TextToImageGeneration #Reasoning #OpenWeight #Test-Time Scaling #Selected Papers/Blogs #RewardModel Issue Date: 2026-04-19 GPT Summary- 報酬モデルは、評価を単一のスコアに縮約するのではなく、明示的で多次元の批評を生成することで、生成物の改善を促進する。本研究では、構造化された合理根拠を用いて報酬を提供し、Generate-Critique-Refineループにより批評をプロンプト修正に変換する方法を示す。また、Preference-Anchored Rationalization(PARROT)を導入し、容易に得られるデータから高品質な合理根拠を回収するフレームワークを提供する。得られたRationalRewardsモデルは、オープンソースの中で最先端の予測精度を達成し、より少ない訓練データで優れた性能を発揮する。批評-修正ループは、既存モデルの潜在能力を引き出し、より良い生成結果を提供する。 Comment
pj page: https://tiger-ai-lab.github.io/RationalRewards/
元ポスト:
[Paper Note] Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs Issue Date: 2026-04-17 GPT Summary- Nemotron 3 Super は、1200億パラメータを持つ新しい Mixture-of-Experts モデルで、事前学習に NVFP4を使用。事後学習には SFT と RL を採用し、最大 1M のコンテキスト長をサポート。推論スループットは従来モデルと比べて最大 7.5 倍向上し、オープンソースのデータセットが提供されています。 Comment
元ポスト:
[Paper Note] Generative Refinement Networks for Visual Synthesis, Jian Han+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #ImageSynthesis #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 自己回帰モデルの課題に対処するため、Generative Refinement Networks(GRN)を提案。GRNは階層的2値量子化によるボトルネックを解消し、AR生成を「人間の画家」による作品の完成に似たプロセスで向上させる。エントロピー誘導型サンプリング戦略を取り入れ、複雑さに応じた適応的ステップ生成を実現した。ImageNetベンチマークで新記録を達成し、テキストから画像・動画生成へと性能を拡張。全てのモデルとコードは公開済み。 Comment
元ポスト:
予測されたトークンを削除・更新し洗練することが可能な新たなアーキテクチャらしい
[Paper Note] FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios, Xiangru Jian+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 製造業はMLLMを活用して自律的な実行に移行中だが、現行の評価は実際の要求を反映していない。データ不足と細粒度の情報欠如が課題であるため、FORGEを提案。現実の2D画像と3D点群を用いた高品質なマルチモーダルデータセットを構築し、3つの製造タスクにおける18件のMLLMを評価。ボトルネックは視覚的根拠ではなく、ドメイン知識不足と分析し、今後の研究方向を示唆している。監視付き微調整により、3Bパラメータモデルが未知の製造シナリオで最大90.8%の精度改善を示し、ドメイン適応型製造MLLMへの道筋を示す。データは公開中。 Comment
pj page: https://ai4manufacturing.github.io/forge-web/
元ポスト:
特定ドメイン(製造業)を精緻に評価できる大規模データセットを提案し、広範なモデルでの実験の元新たな知見が明らかになっているように見え、重要研究に見える。
[Paper Note] WildDet3D: Scaling Promptable 3D Detection in the Wild, Weikai Huang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Dataset #Transformer #Prompting #Architecture #Selected Papers/Blogs #3D (Scene) #ObjectDetection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- 単一画像から3D物体を検出するために、WildDet3Dという統一的幾何認識アーキテクチャを提案。テキスト・点・ボックスのプロンプトを受け入れ、深度信号を組み込む。新しいオープン3DデータセットWildDet3D-Dataを生成し、13,500カテゴリの100万枚以上の画像を提供。複数のベンチマークで最先端の性能を達成し、特に深度手掛かりの活用により、平均+20.7 APの向上を実現。 Comment
pj page: https://allenai.github.io/WildDet3D/
元ポスト:
最大級の3D detection data+アーキテクチャの提案
training codeなどがリリース:
https://github.com/allenai/WildDet3D
[Paper Note] Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima, Huanran Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Optimizer #Selected Papers/Blogs #Generalization #DownstreamTasks #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 大規模言語モデル(LLMs)の事前学習において、幾何学的問題を調査し、タスク固有のミニマの位置が下流の一般化に影響することを提案。勾配の類似性を最大化するNexus optimizerを導入し、パラメータサイズやデータに応じた実験で、下流パフォーマンスの向上を示した。特に3Bモデルでは、分布外データでの損失を低減し、複雑な推論タスクで精度を最大15.0%向上させる結果を得た。これは、事前学習損失以外の評価指標の重要性を示唆している。 Comment
元ポスト:
ポイント解説:
モデルを更新する際に平均的に性能が良くなる方向ではなく、全ての異なるデータにおいて性能が改善する方向性で更新すると性能が改善するという感じだろうか。興味深い
[Paper Note] TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment, Bingyi Cao+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#CVPR #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- 視覚-言語モデルの密なパッチ-テキスト整合性を向上させる新手法を提案。パッチレベルの蒸留が有効で、蒸留済みモデルが教師モデルを上回る整合性を示す。iBOT++を導入し、未マスクのトークンが損失に寄与。学習効率向上のためのキャプションサンプリング戦略を追加。TIPSv2として新しい画像-テキストエンコーダを開発し、広範な下流アプリケーションにおいて強力な性能を実現。 Comment
元ポスト:
[Paper Note] Lyra 2.0: Explorable Generative 3D Worlds, Tianchang Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #LongContext #VideoGeneration/Understandings #3D Reconstruction #3D (Scene) #WorldModels #SpatialUnderstanding Issue Date: 2026-04-16 GPT Summary- Lyra 2.0は、持続可能で探索可能な大規模3D世界を生成するフレームワークを提案。空間的忘却には3Dジオメトリを保持し、視点に応じた過去フレームを取得することで対応。時系列的ドリフトには自己拡張ヒストリーを活用し、誤差を訂正することで改善。これにより、長く一貫性のある動画軌道を実現し、高品質な3Dシーンの復元に活かす。 Comment
HF: https://huggingface.co/nvidia/Lyra-2.0
pj page: https://research.nvidia.com/labs/sil/projects/lyra2/
元ポスト:
[Paper Note] Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision, Yinghui He+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #On-Policy #SelfDistillation Issue Date: 2026-04-16 GPT Summary- SD-Zeroは、強化学習や外部教師を必要とせず、単一のモデルを生成器と査読者として学習させる新たな手法である。生成器が初期応答を生成し、査読者がそれを改善する過程で、オンポリシー自己蒸留を利用し、密なトークンレベルの自己監督を実現する。SD-Zeroは数学・コード推論ベンチマークにおいて、基盤モデルよりも10%以上の性能向上を示し、強力なベースラインを上回った。特徴としては、重要なトークンを特定するトークンレベルの自己局在化と、教師同期化による回答改訂の反復的自己進化がある。 Comment
元ポスト:
[Paper Note] LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning, Sumeet Ramesh Motwani+, ICML'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Chain-of-Thought #Evaluation #Reasoning #ICML #Selected Papers/Blogs #LongHorizon #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LongCoTを導入し、複雑な推論能力を測定するための2,500問の専門家設計問題からなるベンチマークを提供。問題は数万から百数万の推論トークンを含む相互依存の手順を要求し、最先端モデルは全体で<10%の精度であることが示され、長期推論の限界が明らかになる。LongCoTは、モデルの長時間にわたる安定した推論能力を評価する指標となる。 Comment
元ポスト:
著者ポスト:
[Paper Note] LLM-as-a-Verifier: A General-Purpose Verification Framework, Jacky Kwok+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #Selected Papers/Blogs #Verification #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LLMの能力向上に検証を新たなスケーリング軸として適用する方法を提案。LLM-as-a-Verifierフレームワークにより、細粒度のフィードバックを提供し、連続的なスコア生成を実現。これにより、正例と負例の解の分離が向上し、追加的な検証精度が得られる。提案手法は複数のベンチマークで最先端の性能を示し、タスク進行の推定にも寄与。さらに、RLに対しても高効率なフィードバックを提供。 Comment
元ポスト:
著者ポスト:
著者ポスト2:
Verification性能をtest-timeに向上させるためのテクニック
アイデアの一つにGEvalっぽいアイデアも含まれている。
続報:
[Paper Note] Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability, Qihan Ren+, arXiv'26, 2026.04
Paper/Blog Link My Issue
Issue Date: 2026-04-11 GPT Summary- 推論に関するLLMの事後訓練では、SFTが記憶を形成し、RLが一般化するとされるが、ドメイン間一般化は条件付きで、最適化のダイナミクスやデータの質に影響される。短期的な訓練では一般化能力が過小評価されることが多く、質の高いCoT推論が一貫した向上を促す。さらに、強力なモデルは手続き的パターンを内部化しやすい反面、一般化の向上と共に安全性は低下する。このため、「どの条件で一般化するのか」という問いへの転換が求められる。 Comment
元ポスト:
所見:
[Paper Note] What do Language Models Learn and When? The Implicit Curriculum Hypothesis, Emmy Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
Issue Date: 2026-04-11 GPT Summary- 大規模言語モデルの能力の獲得過程は未解明であることから、暗黙のカリキュラム仮説を提案。前学習はモデル間で予測可能なカリキュラムに従うとし、単純で組み合わせ可能なタスクを設計。410M〜13Bパラメータの4モデルファミリにおける出現点の順序は一貫しており、複合タスクは基本タスクの後に現れる。モデルの表現にもこの構造がエンコードされており、事前評価なしで未知のタスクの訓練軌道を効果的に予測できることを示した。 Comment
元ポスト:
[Paper Note] Learning is Forgetting: LLM Training As Lossy Compression, Henry C. Conklin+, ICLR'26, 2026.04
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #LanguageModel #ICLR #Initial Impression Notes Issue Date: 2026-04-11 GPT Summary- LLMの表現空間の構造は未解明であり、学習の解釈に制限がある。研究では、LLMsを損失のある圧縮として捉え、訓練過程で目的に関連する情報のみを保持すると主張。モデルの事前訓練結果から圧縮の最適性を示し、異なるモデル間の性能が訓練データとレシピの違いによることを解明。これにより、表現構造と性能を結びつける情報理論的フレームを提供し、大規模な応用の可能性を示す。 Comment
元ポスト:
openreview:
https://openreview.net/forum?id=tvDlQj0GZB
(おそらく先行研究と比較したときの新規性に対する解釈が割れていて)スコアが相当pos/negに偏っている
なお、Rebuttalのために800以上のチェックポイントを分析する必要があったとのこと。
meta reviewによるとLLMのダイナミクスを理解するうえで有用な視点を提供している一方で、論文中で潜在的な応用可能性については言及されているが、実用的な有用性、特に本研究が示した分析結果が効果的な学習手法、モデル選択手順にどのように反映可能かが十分に示されていない、という指摘がある。
所見:
[Paper Note] Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution, Monishwaran Maheswaran+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-11 GPT Summary- 検証者なしの進化は、多様性と効率においてボトルネックが存在する。本研究では、Squeeze Evolveというマルチモデルオーケストレーションフレームワークを提案。モデルの能力を最適に割り当てることで、多様性とコスト効率を両立させる。Squeeze Evolveは、いくつかのマルチモーダル視覚ベンチマークにおいて、単一モデル進化と比較してコスト対能力を改善し、新たな最先端結果を達成。さらに、探索タスクでは検証者ありの進化法と同等、またはそれを上回る性能を示した。 Comment
pj page: https://squeeze-evolve.github.io/#blog-squeeze-evolve
元ポスト:
様々なtest-time scaling手法が単一のframeworkで表現できるという話がそもそもおもしろそう。読みたい。
[Paper Note] A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens, Tommie Kerssies+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #CVPR #Selected Papers/Blogs #WorldModels #One-Line Notes #Author Thread-Post Issue Date: 2026-04-11 GPT Summary- ビデオ世界モデリングにおいて、多様な未来状態を効率的に予測するために、DeltaTokというトークナイザーを導入。これによりVFM特徴の差を連続的な「デルタ」トークンにエンコードし、DeltaWorldという生成的世界モデルを提案。これにより、ビデオを一次元の時系列に圧縮、512×512フレームでトークン数を1,024倍削減。多仮説訓練を通じて多様な未来を平行に生成し、単一のフォワードパスで多様な予測を得られる。実験結果においてDeltaWorldは、従来のモデルよりもパラメータ数が35倍、FLOPsは2000倍少ないにもかかわらず、現実に近い未来を予測することを示した。 Comment
過去と現在のフレームを入力し差分の潜在表現を出力するDeltaEncoderを学習し、潜在表現に基づいてnext token predictionをする(複数の推論結果を出力させ、最も学習データに近いものを用いて学習する。複数の候補を出力するため推論時は多様な候補を得られる)。
これにより、予測に必要なトークン数が大幅に削減され(Dino-basedなモデルと比較して1024--2048倍)、パラメータ数が削減されFLOPSも低下(generative modelsと比較して、35倍パラメータ数が小さく、2000倍計算に要するFLOPSが低下)。
といった話が著者ポストで説明されている。
[Paper Note] The Art of Building Verifiers for Computer Use Agents, Corby Rosset+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #ComputerUse #Selected Papers/Blogs #Verification #Rubric-based Issue Date: 2026-04-11 GPT Summary- CUA軌跡の検証は評価信号の信頼性に不可欠である。本研究では、ノイズを減らしたルーブリックの構築、プロセスと成果報酬の分離、失敗の制御、文脈管理スキームの導入を行い、Universal Verifierを設計。新しいCUA軌跡集合CUAVerifierBenchでの検証により、人間の合意に匹敵する精度を示し、偽陽性率をほぼゼロに低減。自動研究エージェントは専門家の品質を70%達成するが、Universal Verifierの戦略発見には失敗。システムとデータセットはオープンソースとして公開。 Comment
元ポスト:
[Paper Note] HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention, Yufei Xu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-04-11 GPT Summary- HISA(階層化インデックス付きスパースアテンション)は、トークンレベルのスパースアテンションでのインデクサの改善手法を提案します。二段階の手順を採用し、まずブロックレベルで無関係な領域を除外し、次に候補ブロック内で元のインデクサを適用することで、効率を向上させます。この方法により、Sparse MLA演算子は従来のスパースパターンを維持しつつ、64Kコンテキストでのスピードアップを実現します。HISAは、DeepSeek-V3.2およびGLM-5のインデクサと置き換え可能であり、ファインチューニングなしで高品質を保持します。 Comment
元ポスト:
[Paper Note] RAGEN-2: Reasoning Collapse in Agentic RL, Zihan Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #Selected Papers/Blogs #Entropy Issue Date: 2026-04-11 GPT Summary- RAGEN-2では、LLMエージェントの強化学習トレーニングの不安定性に注目し、推論の質をエントロピーと相互情報量(MI)に分解。エントロピーが高くても、モデルが固定テンプレートに依存する「テンプレート崩壊」の問題を明らかにした。MIは推論品質の信頼できる指標であり、タスク性能との相関が強い。低い報酬分散が推論差を消してしまう問題をSNR対応フィルタリングを用いて解決し、入力依存性とタスク性能を改善することを提案。様々なタスクで一貫した成果を示した。 Comment
pj page: https://ragen-ai.github.io/v2/
元ポスト:
おもしろそう
ポイント解説:
トークンのエントロピーによって多様性を測る方法は、単一の応答内での多様性は測れるが、異なるプロンプトに対する応答の多様性は測れない。たとえば、単一応答内のエントロピーは健全だが、応答がinputに非依存の応答となっている場合など(=テンプレート崩壊)は多様性が欠如していると考えられる。このため、相互情報量に基づくメトリックを提案し、応答間で共有されている情報量を測る方法を提案。
[Paper Note] IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation, Anjali Kantharuban+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Embeddings #NLP #RepresentationLearning #Selected Papers/Blogs Issue Date: 2026-04-11 GPT Summary- 意味内容とは切り離したスタイルと方言の表現を学習する課題として、IDIOLEXを提案。文の出所情報と内容の特徴を組み合わせ、アラビア語とスペイン語の方言における連続表現を学ぶ。このアプローチは、個人とコミュニティの変動をモデル化し、言語モデルへの応用可能性を示唆する。 Comment
元ポスト:
内容ではなく、スタイルを捉えるembedding
[Paper Note] Neural Computers, Mingchen Zhuge+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-04-10 GPT Summary- ニューラル・コンピュータ(NC)は、新しい計算・メモリ・I/Oを統合する機械形態を提案。明示的なプログラムを必要とせず、外部環境の学習を目指す。長期目標は、安定した実行と再プログラミングが可能な完全なニューラル・コンピュータ(CNC)を実現すること。初期段階では、収集したI/Oトレースから学習できるNCプリミティブを考察し、CLIやGUIでのビデオモデルを具現化。課題として、ルーチン再利用や安定性が残る中、CNCへの進展を示唆し、エージェントや従来コンピュータを超える可能性を探る。 Comment
解説:
著者ポスト:
[Paper Note] Gym-Anything: Turn any Software into an Agent Environment, Pranjal Aggarwal+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #OpenSource #PostTraining #Selected Papers/Blogs #Environment #Author Thread-Post Issue Date: 2026-04-10 GPT Summary- Gym-Anythingを用いて任意のソフトウェアを対話型環境に変換するフレームワークを提案。コーディングエージェントが設定を行い、独立した監査エージェントが品質を検証する。200のソフトウェアアプリケーションに適用し、1万件超の長期タスクを含むCUA-Worldを生成。特に長期ベンチマークCUA-World-Longを用いて高難易度タスクを評価し、訓練されたモデルが優れた性能を示すことが明らかに。全てのコードとデータを公開し、今後の研究を促進することを目指す。 Comment
元ポスト:
著者ポスト:
[Paper Note] In-Place Test-Time Training, Guhao Feng+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#LanguageModel #ICLR #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-04-08 GPT Summary- 静的な学習パラダイムでは新情報への動的適応が制限される。本研究では、推論時訓練(TTT)を用いてモデルパラメータを更新し、インプレースTTTフレームワークを提案。これにより、MLPブロックの最終射影行列をファストウェイトとして扱い、ゼロからの再訓練なしでLLMを強化。次トークン予測タスクに目的を整合させ、スケーラブルなアルゴリズムを実現。実験により、4Bパラメータモデルが優れた性能を示し、競合するアプローチを上回った。In-Place TTTは継続的学習の新たな一歩を提供する。 Comment
openreview: https://openreview.net/forum?id=dTWfCLSoyl
元ポスト:
[Paper Note] Vero: An Open RL Recipe for General Visual Reasoning, Gabriel Sarch+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #Reasoning #OpenWeight #OpenSource #PostTraining #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment
元ポスト:
ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。
[Paper Note] Self-Distilled RLVR, Chenxu Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
Issue Date: 2026-04-07 GPT Summary- オンポリシー蒸留(OPD)はLLMトレーニングにおいて教師モデルからの詳細な信号を利用するが、検証可能な報酬を持つ強化学習(RLVR)は疎な信号しか得られない。最近の研究ではオンポリシー自己蒸留(OPSD)が探求され、同じモデルが教師と学生を兼ねることで自己進化を促進するが、特権教師からの学習信号のみでは情報漏洩や不安定性を引き起こす。本論文では、RLSD(RLVRと自己蒸留の組み合わせ)を提案し、トークンレベルのポリシー差から細粒度の更新を行い、同時に環境フィードバックを活用することで、安定したトレーニングと収束を達成する。 Comment
元ポスト:
[Paper Note] Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding, Yuhang Zhou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #AIAgents #TabularData #SelfImprovement #ACL #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment
元ポスト:
複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。
表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。
[Paper Note] A Simple Baseline for Streaming Video Understanding, Yujiao Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Analysis #LongContext #Selected Papers/Blogs #VideoGeneration/Understandings #VisionLanguageModel Issue Date: 2026-04-05 GPT Summary- 最近のストリーミング動画理解手法は、複雑なメモリ機構に依存していますが、我々は単純な「SimpleStream」ベースラインを提案します。これは最近のNフレームを用いて、公開されたストリーミングモデルと同等以上の性能を示します。OVO-Benchで平均精度67.7%、StreamingBenchで80.59%を達成し、長い文脈の価値がモデルに依存し、知覚と記憶のトレードオフが存在することを明らかにします。これにより、複雑な機能の有用性を再評価する必要があることを示唆しています。 Comment
元ポスト:
所見:
[Paper Note] Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models, Antoine Edy+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-04-05 GPT Summary- Late Interactionモデルの検索性能のバイアスとダイナミクスを分析。マルチベクトルスコアリングにおける長さバイアスとMaxSim演算子の挙動が、NanoBEIRベンチマークで確認され、因果的モデルと双方向モデルが共に影響を受けることが示された。特に、トップ1文書トークンを超える類似性の欠如がMaxSim演算子の効率的なスコア利用を示唆。 Comment
元ポスト:
[Paper Note] Mathematical methods and human thought in the age of AI, Tanya Klowden+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #GenerativeAI #SelfImprovement #ScientificDiscovery #autoresearch/RSI Issue Date: 2026-04-05 GPT Summary- AIは複雑な認知タスクを実行するツールであり、その急速な進化は伝統的な哲学的問いを呼び起こす。本論文では、AIが歴史を通じて人間の道具として発展してきたことに触れ、人間中心の開発が重要であると主張。AIの応用が人間の生活向上や思考能力の拡張に寄与することを目指し、知的分野への統合の道筋を提案する。 Comment
元ポスト:
[Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #Planning #Evaluation #One-Line Notes #LongHorizon Issue Date: 2026-04-04 GPT Summary- LLMエージェントの戦略的一貫性の維持に関する課題を評価するため、YC-Benchを導入。シミュレートされたスタートアップを通じて、誤った意思決定の累積影響を調査。12モデルを比較した結果、Claude Opus 4.6が平均1.27百万ドルの資金で最高成績を収め、一貫して成功したモデルは3つのみ。特にスクラッチパッドの使用が成功に大きく寄与し、敵対的なクライアントの検出が主な失敗因として浮かび上がった。全体として、モデルの固有の故障モードが長期的なパフォーマンスにおける能力のギャップを明らかにした。YC-Benchは再現性と設定可能性を備えたオープンソースのベンチマークである。 Comment
pj page: https://collinear-ai.github.io/yc-bench/
元ポスト:
スタートアップの経営を通じてAI Agentをlong horizonの計画、実行能力を評価するような枠組みらしい。
[Paper Note] CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation, Max Fu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Coding #SoftwareEngineering #Robotics #EmbodiedAI Issue Date: 2026-04-04 GPT Summary- Code-as-Policy(CaP)は、自律的なロボット制御における実行可能なコードの有効性を探求するためのフレームワークCaP-Xを提案します。中心となるCaP-Gymは、感知と制御を組み合わせてロボットを制御するインタラクティブ環境を提供します。CaP-Benchを利用して12モデルを評価した結果、手作りの抽象化が性能を向上させる一方、先入観の排除で性能が低下し、設計者の足場に依存していることが明らかになりました。このギャップは、推論時計算や複数ターンの相互作用を通じて緩和可能です。これにより、学習を要しないCaP-Agent0が活用され、シミュレーションや実機タスクで人間レベルの信頼性を回復させます。CaP-RLを導入することで強化学習が成功率を向上させ、シミュレーションと実機間の移行を円滑にすることを確認しました。CaP-Xは、具現化されたコーディングエージェントを推進するためのオープンアクセスプラットフォームを提供します。 Comment
元ポスト:
[Paper Note] Think Anywhere in Code Generation, Xue Jiang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Coding #Reasoning #SoftwareEngineering #Reference Collection Issue Date: 2026-04-04 GPT Summary- LLMsの事前思考に依存したコード生成は制限があり、全体の複雑性を理解するには不十分である。これに対抗するために、Think-Anywhereという新しい推論機構を提案し、任意のトークン位置で推論を呼び出すことを可能にする。これにより、推論パターンの模倣と成果ベースのRL報酬を活用し、推論のタイミングを自律的に探索させる。広範な実験で、Think-Anywhereは最先端の性能を実現し、多様なLLMsにおいて一貫した一般化を示すことが確認された。 Comment
元ポスト:
解説:
[Paper Note] Rethinking Language Model Scaling under Transferable Hypersphere Optimization, Liliang Ren+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #HyperparameterTransfer Issue Date: 2026-04-04 GPT Summary- HyperPは、Muonsオプティマイザを使用した超球面パラメータ化フレームワークで、スケーリング時の安定性を向上させる。最適学習率を幅や深さ、トレーニングトークンに跨って転送可能とし、計算効率を1.58倍向上。監視指標は有界で非増加を維持し、MoEゲーティング機構SqrtGateにより粒度スケーリングを改善。トレーニングコードは公開されている。 Comment
元ポスト:
[Paper Note] KAT-Coder-V2 Technical Report, Fengxiang Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering Issue Date: 2026-04-04 GPT Summary- KAT-Coder-V2は、快手のKwaiKATチームが開発したエージェント指向のコーディングモデルで、5つの専門ドメインに分解し、それぞれを教師あり微調整と強化学習で独立学習した後、単一モデルに統合します。KwaiEnvを用いて数万の同時サンドボックス環境を支え、RL訓練をスケーリング。MCLAとTree Trainingにより計算の冗長性を排除し、最大6.2倍のスピードアップを達成。SWE-benchで79.6%、PinchBenchで88.7のスコアを記録し、複数のベンチマークで首位を獲得しました。モデルは公開されています。 Comment
元ポスト:
Claude Opus 4.6に近い性能を持つagentic coding modelとのこと。
[Paper Note] Grounding World Simulation Models in a Real-World Metropolis, Junyoung Seo+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #WorldModels Issue Date: 2026-04-04 GPT Summary- 実際の都市を再現するSeoul World Model (SWM)を提案。SWMはストリートビュー画像を利用して動画を生成するが、時間的ズレやデータの希薄化という課題に直面。これに対処するために、クロス・ペアリングや視点補間パイプラインを導入し、仮想先読みシンクで生成を安定化。ソウルや釜山などで比較評価した結果、SWMは長距離動画の生成において空間的かつ時間的一貫性で既存手法を上回るとともに、多様なシナリオ変化にも対応できることを示した。 Comment
pj page: https://seoul-world-model.github.io/
元ポスト:
[Paper Note] PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference, Xiaofeng Mao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #LongContext #Architecture #VideoGeneration/Understandings #KeyPoint Notes #KV Cache Issue Date: 2026-04-04 GPT Summary- 自己回帰型ビデオ拡散モデルは、線形KVキャッシュ、時間的反復、長時間動画生成時の誤差累積という課題に直面している。これを解決するために、PackForcingという新しい三分割KVキャッシュ戦略を提案。過去の文脈をシンクトークン(高解像度保持)、ミッドトークン(トークン削減)、最近トークン(局所的整合性維持)の三種類に分類し、メモリフットプリントを抑制しつつ高品質の動画生成を実現。結果として、単一のH200 GPU上で2分間の動画を16FPSで生成し、KVキャッシュを4GBに留め、時系列外挿も効果的に行えることを示した。VBenchにおける結果も最先端を記録。 Comment
元ポスト:
動画生成における (1)エラーの蓄積、(2)生成される動画の長さに応じて線形に増加するKV Cache の問題に対処するために、以下に示すアーキテクチャを提案し、重要な情報(Sink Token, Recent Token)は高解像度で保持しつつ、中間トークン (Mid Token)は圧縮をすることで、
- どのような長さの動画生成でもattentionで考慮されるtoken数の上限を27,872 tokenに制限しながらも、
- 3D convolution + low resolution re-encodingによって中間トークンを1/32に効果的に圧縮し(メモリ効率27倍)
- memoryを圧縮することでRoPEの位置エンコーディングにgapが生まれるが、それを埋める方法を提案し
- 24倍のtemporal extrapolation (時間的な外挿)を実現。つまり、5秒のclipで学習したら、120秒の動画を一貫性のある形で生成できた
という話らしく、
Sink Tokenは高解像度な情報を保持し、Mid Tokensは圧縮+動的に選択 (3D / 4-stageのCNN + 低解像度のパッチ化) をすることで容量を削減し、Recent Tokensは高解像度を保持し、古くなってきたらMid tokensとして圧縮して格納される。
120sの生成をする場合にKV Cacheをフルで保持した場合(~138G)と比較して、4G程度にKV Cacheが抑えられており
そのうえで下記ベンチマークスコアを獲得しているようである。が、他の先行研究の手法はKV Cacheをどの程度消費するのだろうか?比較表のようなものがないと、すごさがちょっとよくわからない。たとえば Self-Forcing, Deep-Forcingは両方ともContext Length Lの範囲でKV Cacheを保持する手法であるため、Table 9 で言うところのwindow-onlyに相当する手法に見える。そうすると、KV Cacheの利用量としてはほとんど変わらず、ベンチマークスコアはSelf Forcingと比較すると大幅に向上しているようだが、Deep Forcingと比べるとどうなるだろうか。おそらく、Over Cons.が最も改善しているように見えるが、Quialitative Comparisonの節ではSelf-Forcingとの比較としての言及は多いが、Deep Forcingとの比較という面での言及はないように見える。
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
- [Paper Note] Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression, Jung Yi+, arXiv'25, 2025.12
[Paper Note] Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey, Wei-Chieh Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #memory Issue Date: 2026-04-04 GPT Summary- 人工知能の研究は、ベンチマークスコアから現実世界での評価にシフトしている。今後の課題は、長期・動的な環境でのエージェントの真の有用性の確保であり、記憶がその解決策として重要視されている。本調査では、エージェント記憶を記憶基盤、認知機構、記憶対象の三次元から検討し、記憶操作を学習ポリシーと関連付けて分析。記憶の有用性評価のためのベンチマークと指標も提案し、未解決の課題と今後の方向性を示す。 Comment
AI Agent + memory に関するサーベイ。とんでもない量だ。。。
github: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory
元ポスト:
以下の3つの軸で整理されているようである
- メモリの基盤 (Memory Substrate):
- internal: 重み、潜在表現、KVCache
- external: vector stores, knowledge graphs, text records
- 認知機構 (Cognitive Mechanism)
- メモリの対象 (Memory Subject)
2023--2025の218の文献をレビューしたとのこと。
open challengeとしては
- continual learning
- multi-human-agent memory organization
- memory infrastructure and efficiency
- life-long personalization and trustworhy memory
- multimodal grounding
- real-world evaluations
と題されている。
[Paper Note] Embarrassingly Simple Self-Distillation Improves Code Generation, Ruixiang Zhang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Coding #PostTraining #SelfDistillation #Author Thread-Post Issue Date: 2026-04-04 GPT Summary- 簡易自己蒸留(SSD)を用いて、LLMが独自の出力のみでコード生成の改善が可能であることを示す。特定の温度とトランケーション設定で出力をサンプリングし、その後教師付きファインチューニングを行うことで、Qwen3-30B-Instructのパフォーマンスを42.4%から55.3%に向上。4B・8B・30Bスケールのモデル間で一般化され、改善のメカニズムをLLMデコードの精度と探索の相互関係に関連づけて検討。SSDは、精度を高めつつ多様性を保持するアプローチとして、LLMのコード生成に寄与する可能性を示唆する。 Comment
元ポスト:
所見:
解説:
著者ポスト:
[Paper Note] Falcon Perception, Aviraj Bevli+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-04-02 GPT Summary- Falcon Perceptionは、画像パッチとテキストトークンを共有パラメータ空間で処理する統一された密なトランスフォーマーを導入。双方向のアテンションと因果関係を持つトークンを使用し、高解像度マスク予測を効率化。単一のスケーラブルなバックボーンを採用し、マスク品質を68.0 Macro-F1スコアまで向上させ、構成的プロンプトのベンチマークでも改善を示す。Falcon OCRにも同様の手法を適用し、コンパクトなモデルで高い精度を達成。 Comment
元ポスト:
[Paper Note] Adaptive Block-Scaled Data Types, Jack Cook+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #LowPrecision #needs-revision Issue Date: 2026-04-01 GPT Summary- NVFP4は、4ビット量子化形式として人気ですが、誤差分布の問題を抱えています。本研究では、入力値の分布に適応できる新しいデータ型、IF4(Int/Float 4)を提案します。IF4は、各16値のグループに対しFP4とINT4を選択し、NVFP4のスケールファクターでスケールします。この方法により、量子化訓練時の損失を低減し、精度を向上させることが確認されました。また、IF4のハードウェア実装も評価されています。 Comment
元ポスト:
NVFP4と同様に、4bitで表現される16個のデータをひとつのグループとして扱い[^1]、FP8でのスケールファクターを共有するような浮動小数点フォーマットで[^2]、
グループ内の16個のデータに対して、INT4/FP4どちらを適用するかを、(NVFP4では常に正となっていた;未使用だった)スケールファクターを表現している8bitの先頭である符号ビットを用いて制御する新たな低精度浮動小数点フォーマット、IF4を提案、という話らしい。符号ビットをINT4, FP4を制御するIndicatorとして扱うため、NVFP4と比較してメモリ使用量は増えない。Indicatorはどちらがより量子化誤差が小さくなるかによって選択される、という感じらしい?
[^1]: グループとは単に0/1のバイナリ値が4bit分並んでいるデータのことであり、たとえばFP4で4bitの羅列を解釈すると、FP4は{±0, ±0.5, ±1, ±1.5, ±2, ±3, ±4, ±6}の16個の数値で解釈するようルールづけられている。
[^2]: スケールファクターを乗じることで、値を元々のデータのスケールに変換する。
この辺は勉強不足だなぁ、、、。
- NVFP4解説:
https://licensecounter.jp/engineer-voice/blog/articles/20260317_nvfp4.html
- 本研究日本語解説:
https://note.com/shimmyo_lab/n/n693c4d0da45f
[Paper Note] daVinci-LLM:Towards the Science of Pretraining, Yiwei Qin+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #OpenWeight #OpenSource #Selected Papers/Blogs #Reference Collection #Initial Impression Notes Issue Date: 2026-03-31 GPT Summary- 基盤となる事前学習はモデルの限界を決め、事後訓練で克服するのが難しい。daVinci-LLMは、産業規模の資源と研究の自由を結集し、透明性のある完全オープンなパラダイムで事前学習を進展させる。8兆トークンを用いた二段階適応カリキュラムを採用し、能力向上のプロセスを体系的に評価。処理の深さやドメイン特性が能力に与える影響を明らかにし、探索プロセスを公開することでコミュニティが知識を蓄積できる基盤を提供する。 Comment
元ポスト:
github: https://github.com/GAIR-NLP/daVinci-LLM
オープン"ソース" (=コード, データ, モデルが公開されている(さらに厳密にはライセンスに問題がない))な関連研究:
- OpenLLaMA, Xinyang+, 2023.05
- Introducing Marin: An Open Lab for Building Foundation Models, marin-community, 2025.05
- Marin 32B Retrospective, marin-community, 2025.10
- [Paper Note] Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, Stella Biderman+, arXiv'23, 2023.04
- [Paper Note] Olmo 3, Team Olmo+, arXiv'25, 2025.12
- [Paper Note] K2-Think: A Parameter-Efficient Reasoning System, Zhoujun Cheng+, arXiv'25, 2025.09
- [Paper Note] DataComp-LM: In search of the next generation of training sets for language models, Jeffrey Li+, NeurIPS'25, 2024.07
- [Paper Note] LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs, LLM-jp+, arXiv'24, 2024.07
- [Paper Note] TinyLlama: An Open-Source Small Language Model, Peiyuan Zhang+, arXiv'24, 2024.01
- [Paper Note] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model, BigScience Workshop+, arXiv'22, 2022.11
- [Paper Note] OLMo: Accelerating the Science of Language Models, Dirk Groeneveld+, arXiv'24, 2024.02
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
- [Paper Note] GPT-NeoX-20B: An Open-Source Autoregressive Language Model, Sid Black+, arXiv'22, 2022.04
- SmolLM2, 2024.11
- [Paper Note] LLM360: Towards Fully Transparent Open-Source LLMs, Zhengzhong Liu+, COLM'24, 2023.12
- SmolLM3: smol, multilingual, long-context reasoner, HuggingFace, 2025.07
- The Smol Training Playbook: The Secrets to Building World-Class LLMs, Allal+, HuggingFace, 2025.10
この辺の研究を全て紐解いていったらどのような変遷が起きているだろうか?
- RedPajama, a project to create leading open-source models, starts by reproducing LLaMA training dataset of over 1.2 trillion tokens, together.ai, 2023.04
- [Paper Note] Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model, Ahmet Üstün+, arXiv'24, 2024.02
- SmolLM - blazingly fast and remarkably powerful, Allal+, HuggingFace, 2024.07
この辺も関連はしているが、データはオープンだがソースコードがおそらく公開されていない。
事後学習なら
- [Paper Note] Tulu 3: Pushing Frontiers in Open Language Model Post-Training, Nathan Lambert+, COLM'25, 2024.11
[Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #AIAgents #Coding #SelfImprovement #SoftwareEngineering #Selected Papers/Blogs #AgentHarness Issue Date: 2026-03-31 GPT Summary- 大規模言語モデル(LLM)の性能は、ハーネスと呼ばれる情報の保存・取得・提示を決定するコードに依存しているが、従来のハーネス設計は手作業が主で、最適化手法はフィードバックを圧縮してしまう。そこで、Meta-Harnessを提案。これはLLMアプリケーションのハーネスコードを探索する外部ループシステムで、エージェント的提案者を通じて過去の実行トレースを活用。Meta-Harnessは、オンラインテキスト分類で7.7ポイントの向上を示し、リトリーバルを用いた数学推論では200問の正確度を4.7ポイント改善。また、エージェント的コーディングでは手作業設計を超える成果を上げる。これにより、より豊かな過去の経験が自動化されたハーネス設計を実現可能であることが示された。 Comment
元ポスト:
pj page: https://yoonholee.com/meta-harness/
Darwin Godel Machineと非常にコンセプトが似ているという指摘がある
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
所見:
解説:
[Paper Note] Natural-Language Agent Harnesses, Linyue Pan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AgentHarness Issue Date: 2026-03-30 GPT Summary- エージェントの性能はハーネス工学に依存するが、ハーネス設計が固有のコードに埋もれているため比較や研究が困難である。そこで、我々は高レベルな制御ロジックを外部化することを提案し、自然言語エージェントハーネス(NLAHs)を導入。NLAHsはハーネスの挙動を自然言語で表現し、インテリジェント・ハーネス・ランタイム(IHR)がこれを実行する共通ランタイムを提供。コーディングや計算利用に関する様々なベンチマークで評価を行い、ハーネスの運用可能性や移行を統制しています。 Comment
元ポスト:
[Paper Note] World Reasoning Arena, PAN Team+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Planning #Evaluation #Reasoning #Selected Papers/Blogs #WorldModels #LongHorizon #Simulation #Arena Issue Date: 2026-03-30 GPT Summary- WR-Arenaは、ワールドモデル(WMs)の評価を進化させるための包括的なベンチマークであり、次状態予測と視覚的忠実度に限らず、知的行動に必要なシミュレーション能力を検証します。三つの基本次元に焦点を当て、アクションシミュレーション忠実度、長期予測、シミュレーション推論と計画を評価します。多様なデータセットを使用して、既存モデルと人間レベルの推論との間のギャップを明らかにし、次世代WMsの指針を提供します。コードはhttps://github.com/MBZUAI-IFM/WR-Arenaで入手可能です。 Comment
元ポスト:
[Paper Note] Low-Latency Stateful Stream Processing through Timely and Accurate Prefetching, Eleni Zapridou+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-30 GPT Summary- ミッション・クリティカルなアプリケーションにおける低遅延要求を満たすため、Keyed Prefetchingを提案。上流の演算者で未来のアクセスキーを抽出し、タプル到着前に状態をメモリに事前ステージング。これにより、状態アクセスとデータパスを分離し、I/Oを計算と重ね合わせて遅延を隠す。また、Timestamp-Aware Cachingと組み合わせることで、効率的なメモリ管理を実現し、長時間実行されるクエリの遅延を低減。 Comment
元ポスト:
[Paper Note] SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection, Kexian Tang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-30 GPT Summary- SPA(Scaling Prompt-engineered Augmentation)を提案し、LLMの知識注入のための合成データ生成において効果的なプロンプト設計を用いた単純なアプローチが強力なベースラインを超えることを示す。従来の手法の限界を特定し、慎重なプロンプト設計と大規模拡張の組み合わせが知識注入において驚くほど効果的となる可能性を示唆。 Comment
元ポスト:
[Paper Note] Hybrid Associative Memories, Leon Lufkin+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-30 GPT Summary- RNNと自己注意を組み合わせたHybrid Associative Memory(HAM)層を提案。RNNはシーケンスを圧縮し、自己注意は補助的に重要な情報を提供。KVキャッシュ成長の細粒度な制御により、損失と性能のトレードオフを最適化。実験結果は、HAMがRNNやTransformersと比較して効率的な性能を示すことを明らかにした。 Comment
元ポスト:
[Paper Note] ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment, Hao Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ImplicitFeedback #RewardModel Issue Date: 2026-03-30 GPT Summary- 暗黙的な人間のフィードバックを用いて報酬モデルを学習する手法、ImplicitRMを提案。従来の報酬モデリングの課題(決定的なネガティブサンプルの欠如やユーザ嗜好バイアス)に対処し、データを四つの潜在グループに層別化。尤度最大化に基づく学習目的が理論的に偏りのないことを証明し、正確な報酬モデルを得られることを実験で示した。 Comment
元ポスト:
[Paper Note] Holistic Scaling Laws for Optimal Mixture-of-Experts Architecture Optimization, Weilin Wan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#MoE(Mixture-of-Experts) #Scaling Laws Issue Date: 2026-03-30 GPT Summary- 大規模言語モデルのMoEアーキテクチャの最適化には、計算資源の配分と設計空間の解決が求められる。既存の研究は不足や固定化のリスクがあるため、包括的なフレームワークを提案。このフレームワークでは、トークンあたりのFLOPsだけでなく、アクティブパラメータと総パラメータの結合制約を設定。さらに、16次元の探索空間を縮約し、数百のMoEモデルに対し最適なアーキテクチャを導出。重要な発見は、スケーリング法則が実務者に定量的柔軟性をもたらし、ほぼ最適な構成が広がることだ。 Comment
元ポスト:
[Paper Note] Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale, Yicheng Zou+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-29 GPT Summary- Intern-S1-Proは1兆パラメータを持つ初の科学的マルチモーダル基盤モデルであり、一般分野と科学分野での大幅な向上を実現。強力な推論能力や画像-テキスト理解を向上させ、化学や生命科学を含む100以上の専門タスクをマスター。XTunerとLMDeployによるインフラ支援で、効率的な強化学習と精度の一貫性を確保。一般知識と専門知識を融合し、トップクラスのオープンソースモデルとして商用モデルを超える能力を示す。 Comment
元ポスト:
[Paper Note] ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents, Hao Zhang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #ReinforcementLearning #Architecture #SoftwareEngineering #On-Policy #Stability #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- ProRL Agentは、マルチターンのLLMエージェントにおける強化学習トレーニングを支援するためのAPIサービスであり、ロールアウトのライフサイクル全体を提供するスケーラブルなインフラです。標準化されたサンドボックス環境を通じて、多様なエージェント駆動タスクに対応し、ソフトウェア工学やSTEM関連のタスクで検証されています。ProRL Agentはオープンソースで、NVIDIA NeMo Gymに統合されています。 Comment
元ポスト:
処理が重いロールアウトを独立したhttp serviceとして扱い(rollout-as-a-service)、モデルのtrainingと分離することで、リソース分離、可搬性、拡張性を向上させる。
[Paper Note] Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification, Zenan Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#LanguageModel #Coding #SoftwareEngineering #Verification #Proofs #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- 大規模言語モデル(LLMs)はコード生成が可能だが、正確性に限界がある。これを克服するために、Lean 4における階層的証明探索フレームワークを提案し、複雑な検証目標を単純なサブゴールに分解する。分解スコアは訓練報酬と推論時の基準として機能し、最適化とデプロイメントの整合性を保証。Goedel-Code-Prover-8Bを利用し、教師あり初期化後にハイブリッド強化学習で訓練。Leanベースのコード検証ベンチマークでは、62.0%の証明成功率を実現し、強力なベースラインを2.6倍上回る成果を達成した。また、推論時のスケーリングによって成功率の向上が観察された。 Comment
元ポスト:
解説:
[Paper Note] MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation, Abhay Deshpande+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Robotics #Sim-to-Real Issue Date: 2026-03-28 GPT Summary- 一般的な見解を覆し、十分なシミュレーションデータで現実世界へのゼロショット転送が可能であることを示す。MolmoSpaces内の手続き的データ生成パイプライン「MolmoBot-Engine」を公開し、180万件の専門家軌跡からなるデータセット「MolmoBot-Data」を発表。異なるポリシークラスの訓練を行い、2つのロボットプラットフォームで評価。現実世界の微調整なしで、未見の物体への成功率79.2%を達成。これにより、広範な現実世界への一般化が可能なポリシーの生成を示している。 Comment
pj page: https://allenai.github.io/MolmoBot/
元ポスト:
[Paper Note] Delightful Policy Gradient, Ian Osband, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- Delightful Policy Gradient(DG)は、ポリシー勾配の不均衡なアップデートを解消するために、アドバンテージと行動の驚きの積に基づいたゲーティングを導入。これにより、単一コンテキスト内での方向性の精度を理論的に向上させ、複数コンテキスト間での期待される勾配を精密に近づけることができる。実験的に、DGはREINFORCEやPPOをMNISTや連続制御タスクで上回り、特に難易度の高いタスクで顕著な改善を示した。 Comment
関連:
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
元ポスト:
所見:
著者ポスト:
不要なbackward passの重みを下げるのではなく完全に無くすことで効率化する
[Paper Note] Off-Policy Value-Based Reinforcement Learning for Large Language Models, Peng-Yuan Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Off-Policy #ReplayBuffer #LongHorizon Issue Date: 2026-03-26 GPT Summary- オフポリシー学習を可能にする新しい値ベースのRLフレームワークReValを提案し、過去のデータを効率的に再利用。ReValは速度と性能向上を実現し、GRPOを上回る結果を示した。これにより、価値ベースのRLがLLMトレーニングの実用的な選択肢となることが示唆される。 Comment
元ポスト:
[Paper Note] End-to-End Training for Unified Tokenization and Latent Denoising, Shivam Duggal+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-26 GPT Summary- UNITEを提案し、トークン化と潜在生成を同時に最適化する単一ステージ訓練手法を導入。重み共有により「共通潜在言語」を形成し、ImageNetでほぼ最先端の性能を達成。トークン化と生成を共同で訓練する可能性を示す。 Comment
元ポスト:
[Paper Note] Test-Time Strategies for More Efficient and Accurate Agentic RAG, Brian Zhang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#RAG(RetrievalAugmentedGeneration) Issue Date: 2026-03-26 GPT Summary- RAGシステムは複雑な質問に苦慮しており、Search-R1フレームワークは反復的処理を提案しているが、非効率的な情報取得が問題を引き起こす。本論文では、文脈化モジュールと重複排除モジュールを統合することで、これらの短所を緩和する。HotpotQAおよびNatural Questionsデータセットを用いた実験では、文脈化にGPT-4.1-miniを用いることでEMスコアを5.6%向上させ、ターン数を10.5%削減し、回答の正確性と取得効率の向上を示した。 Comment
元ポスト:
気になる
[Paper Note] Exclusive Self Attention, Shuangfei Zhai, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Attention Issue Date: 2026-03-26 GPT Summary- 排他的自己注意(XSA)は、トランスフォーマーの性能向上を目指す改良策であり、アテンションをトークン自身の値ベクトルに直交する情報に制約することで自己位置情報を排除し、文脈モデリングを改善します。標準的な言語モデリングタスクで評価した結果、XSAは最大27億パラメータのモデルに対して一貫して優れた性能を示し、系列長が長くなるほど効果が顕著になります。 Comment
元ポスト:
[Paper Note] GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent, Yuri Kuratov+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #PEFT(Adaptor/LoRA) #memory #Initial Impression Notes #SoftPrompt #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- 長い文脈をコンパクトに保存するGradMemを提案。これは、推論時に文脈へアクセスできない状況で、文脈を圧縮して数のクエリに応答する。モデルの重みを凍結し、少量のプレフィックストークンで数ステップの勾配降下を行うことで、文脈の再構成を最適化。連想キー-値検索において、GradMemは従来の手法より優れた性能を発揮し、自然言語タスクで競争力のある結果を示す。 Comment
元ポスト:
prefixにmemory用のトークンを用意し、TTTの枠組みでcontextのreconstruction lossを通じて圧縮する、という話に見える。tokenはsoft tokenであり、m*d次元の行列で表現される。
要はcontextの潜在表現をReconstruction lossによるTTTでprefix tuningするsoft prompting手法、という感じだろうか。
[Paper Note] EvoClaw: Evaluating AI Agents on Continuous Software Evolution, Gangda Deng+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- AIエージェントが長期間稼働するためには動的環境への適応が求められるが、既存のベンチマークは時間的依存性や技術的負債を考慮していない。この問題を解決するため、DeepCommitを導入し、ノイズのあるコミットログからマイルストーンDAGを再構築。EvoClawという新たなベンチマークを作成し、エージェントに長期的なソフトウェア進化の課題を課す。評価では、孤立したタスクに対して80%以上のパフォーマンスが、連続的な設定で38%まで低下し、エージェントの維持管理能力に脆弱性が見られた。 Comment
leaderboard: https://evo-claw.com/
元ポスト:
OpenHands(著者グループ)のスレッド:
[Paper Note] LongCat-Next: Lexicalizing Modalities as Discrete Tokens, Meituan LongCat Team+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-03-26 GPT Summary- 言語中心の現行NTPパラダイムに対抗するため、統一フレームワークDiNAを提案し、マルチモーダル情報を共有された離散空間に表現。重要な革新であるdNaViTにより、視覚信号を階層的な離散トークンに変換。LongCat-Nextを開発し、テキスト・視覚・音声を統一的に処理し、高い性能を実現。理解タスクにおける視覚モデリングの限界を克服し、オープンソースとしてコミュニティの研究を促進。 Comment
元ポスト:
所見:
ポイント解説:
[Paper Note] MolmoWeb: Open Visual Web Agent and Open Data for the Open Web, Tanmay Gupta+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #MultiModal #OpenWeight #OpenSource #ComputerUse #PostTraining #Selected Papers/Blogs #VisionLanguageModel #GUI Issue Date: 2026-03-24 GPT Summary- MolmoWebは、ウェブエージェントをオープンな環境で構築するために、(1) 大規模な混合データセットMolmoWebMixと、(2) 完全オープンなマルチモーダルエージェントのMolmoWebを提案。MolmoWebMixは、10万超の合成タスクと3万件以上の人間デモを統合し、エージェントは視覚言語アクションポリシーを用いて次のブラウザ操作を予測。MolmoWebエージェントは同規模の他のモデルを上回る性能を示し、再現性とオープンな研究を促進するために関連リソースを公開。 Comment
元ポスト:
github:
https://github.com/allenai/MolmoWeb
学習、評価ハーネス、アノテーションツール、合成データパイプライン、デモのclient sideのコードがリリース
Molmo2をベースにしたオープンソースのBrowser Useエージェント。スクリーンショットを通じて次のアクション(クリック、文字入力、スクロール)を予測し実行する。
従来のBrowser Useエージェントの多くは非公開データを用いている中、MolmoWebMixと呼ばれる大規模なデータセットを公開。合成データ(タスクに成功したsingleエージェントのtrajectory, タスクをサブタスクに分解して実行するタイプのmulti-agent pipeline, 数百のwebsiteのリンク構造を体系的に探索して構築されたナビゲーションの経路等)と人間に寄る高品質なアノテーション(36k, 1100タスク, 623k件の個別のサブタスクのデモンストレーションで、過去最大規模)の2種類で構成されるとのこと。
また、BroserのGUIを認識するための学習データも含まれる。これはGUIのgrounding taskと、webページの内容を読み取りながら推論を実施するスクリーンショットがgivenなQAタスクのデータとsて構成され、400程度のサイトから収集した、2.2MのQAペアによって編成される。
4種類のベンチマークで評価した結果、プロプライエタリモデルには一部及ばないものもあるが、同等規模なOpenWeightモデルをoutperform。また、WebVoyager, Online-Mind2Webデータでみると、Pass@4のようなtest-time scaling手法を用いると、プロプライエタリも出るを上回る。
ただ注意点としては、比較しているOpenWeightモデルが少し古いように見えるが、何か理由があるのだろうか。
Holoであれば、既にHolo3がリリースされており
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03
GLMであれば、GLM-4.6Vが存在する。
- GLM-4.6: Advanced Agentic, Reasoning and Coding Capabilies, Zhipu AI, 2025.09
(UI-TARS-2 [Paper Note] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn
Reinforcement Learning, Haoming Wang+, arXiv'25
はおそらくプロプライエタリなので対象外。あと使えるのかも不明。デモは公開されていた気がするが。)
いずれにせよHoloやUI-TARSなどはデータが公開されていなかったと思うので、全てを公開することによるcontributionは非常に大きいと思われる。
ベンチマーク関連:
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- Online-Mind2Web
- [Paper Note] An Illusion of Progress? Assessing the Current State of Web Agents, Tianci Xue+, COLM'25, 2025.04
- [Paper Note] Mind2Web: Towards a Generalist Agent for the Web, Xiang Deng+, arXiv'23, 2023.06
とは異なるため注意
- [Paper Note] DeepShop: A Benchmark for Deep Research Shopping Agents, Yougang Lyu+, arXiv'25, 2025.06
- WebTailBench
- [Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11
[Paper Note] LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels, Lucas Maes+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Selected Papers/Blogs #Stability #WorldModels #Pixel-based #Author Thread-Post #LatentRepresentation Issue Date: 2026-03-24 GPT Summary- LeWorldModel(LeWM)は、原始ピクセルからエンドツーエンドで訓練できる最初のJoint Embedding Predictive Architecture(JEPA)を提案。従来の手法に比べ、調整可能な損失のハイパーパラメータを6個から1個に減らし、約1500万パラメータを持つLeWMは、ファウンデーションモデルより最大48倍速く学習。2Dおよび3Dの制御タスクで競争力を維持し、潜在空間が物理的構造を符号化していることを示す驚き評価も行われ、物理的に妥当でないイベントを検出する能力を確認。 Comment
元ポスト:
[Paper Note] CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents, Lintang Sutawika+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-22 GPT Summary- リポジトリ上でのコーディングエージェントのタスクには、関連ファイルやクラス、関数の特定が必要であり、これをコードローカリゼーションと呼ぶ。従来の手法は埋め込みベースの検索を利用していたが、本研究では特別な道具なしに強化学習を活用することで、高い成果を達成することを示す。実験は3つのベンチマークで行われ、提案モデルは大規模LLMsに対して一貫して競争力のある性能を発揮した。さらに、全てのコードとデータを公開し、コミュニティのさらなる開発を促進することを目指している。 Comment
元ポスト:
[Paper Note] Data-efficient pre-training by scaling synthetic megadocs, Konwoo Kim+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SyntheticData #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-03-22 GPT Summary- 合成データ拡張は、限られたデータでの事前学習に有効である。この研究では、有限の計算資源下での損失低減や、無限大に近づくときの損失スケーリングの改善を目指す。合成的再表現との混合で事前学習した場合、異なる分布からの合成データでもi.i.d.検証損失が改善され、データ効率は約1.48倍で頭打ちとなる。新たなアプローチとして、同文書からの合成再表現を用い、短文の代わりに長大なメガ長文を形成する手法を提案。これにより、損失とベンチマークの改善が見られ、データ効率は1.80倍に向上。合成データ生成が増えるほど、メガ長文による効果も増大することが示された。 Comment
元ポスト:
著者ポスト:
著者ポスト:
- データよりもコンピューティングリソースのスケーリングの方が早く進んでおり、データ効率の高い事前学習レシピが重要となっている
- 事前学習において、合成データがi.i.d.なwebデータの損失減らすことに寄与するかを調査
- 300Mモデルで200M tokenを学習した際にどれだけi.i.d.なwebデータのlossを低減させられるかを調査
- 最初に最もシンプルなdata augmentationであるrephrasingを調査したところ、文書単位でのrephrasingの回数が増えるにつれて、web lossとdownstreamベンチマークでのエラー率が単調に改善
- 続いて、ある文書をrephraseした文書を結合することで、単一の大きな文書(=megadoc)を構成する手法を提案し、megadocを利用することでさらにlossが改善することを確認。megadocの構成方法として下記三種類を提案し:
- Real First Stitched: `文書に対するrephraseをG個生成し、それらを結合することでmegadocを構成する手法。実データを結合の頭にもってくる。
- Real Last Stitched: Real First Stichedと同様の処理をするが、実データを結合の末尾に持ってくる手法
- Latent Thoughts: 文書をG+1個の同じ長さのピースに分割し、ピース間を埋めるrationaleを合成して結合する手法。rationaleは
- Real First Stitched と Real Last Stitched を比較したところ、後者の方が性能が良かった。
- 後者の方が性能が良い考察として、epiplexity [Paper Note] From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, Marc Finzi+, arXiv'26, 2026.01
の観点から考察をしている。前提として実文書の方が複雑で情報量が多いと考えたときに、Real First Stitched の場合は実文書の情報からrephraseを学ぶという簡単な変換(生成)を実施すればよいのに対し、Real Last Stitchedの場合逆で、rephraseからより詳細で複雑な実文書に変換(生成)するというタスクを実施せねばならない。このため、後者の方がより計算的に困難な関数を学習する必要があり(すなわち、epiplexityが高い学習設定ということ; epiplexityが高い学習設定の方がモデルの汎化性能が高くなる)、学習の結果より高い汎化性能を獲得しているのではないか、と考察している。
- また、モデルをアンサンブルした場合の性質についても考察がされており、self-distillationは単体モデルの性能を向上させることに寄与するが、アンサンブルするモデルの数を増やすと実データを用いたモデルと最終的には性能が同等となることが予測され、達成可能なピーク性能がアンサンブルによってブーストされる効果は観測できなかった。一方で、Rephrasingによる合成データによって学習されたモデルはアンサンブルによって達成可能な性能のピーク値がブーストされると考えられる。
[Paper Note] Reasoning over mathematical objects: on-policy reward modeling and test time aggregation, Pranjal Aggarwal+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-03-22 GPT Summary- 数学的オブジェクトの推論能力はSTEM分野で重要であり、現在の評価は簡略化された形式に依存している。本研究では、(i) 数学的オブジェクトを導出する訓練データとベンチマークを公開、(ii) LLMを用いた性能向上のための訓練レシピを提案、(iii) 計算量をスケールさせるオンポリシー訓練法を示した。強力なLLMが苦戦する中、提案手法は顕著な改善をもたらし、推論能力の一般化を示している。 Comment
pj page: https://facebookresearch.github.io/RAM/blogs/principia/
元ポスト:
ポイント解説:
section2に関する著者のポイント解説:
ポイント解説:
[Paper Note] V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning, Lorenzo Mur-Labadia+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #RepresentationLearning #Self-SupervisedLearning #WorldModels #LatentRepresentation Issue Date: 2026-03-22 GPT Summary- V-JEPA 2.1は、自己教師付きモデルで高品質な視覚表現を学習しつつ、強力なグローバルなシーン理解を維持します。密な予測損失により、可視トークンとマスクされたトークンが共に学習信号に寄与し、深い階層的な自己教師付き学習で表現の品質を向上。多モーダル・トークナイザーにより統一的な学習を実現し、モデル容量とデータのスケーリングを活かしています。これにより、空間的、意味的、時間的に一貫した表現を生成し、短期的物体相互作用やアクション予測で最先端の性能を達成。ロボットナビゲーションや深度推定でも高い結果を示し、密な視覚理解と世界モデリングの進展を証明しています。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Mind the Sim2Real Gap in User Simulation for Agentic Tasks, Xuhui Zhou+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-03-22 GPT Summary- ユーザーシミュレーションの質を評価するため、実在人間とLLMベースのシミュレータの行動を比較し、Sim2Realギャップを明らかにする研究を行った。31のLLMシミュレータをUser-Sim Index(USI)でベンチマークした結果、LLMシミュレータは協調的すぎ、現実のフラストレーションや曖昧さを欠くことが判明。人間は多次元にわたる複雑なフィードバックを提供する一方、シミュレーションは均質で肯定的な反応が多かった。これにより、モデル能力の高いシミュレータが必ずしも現実に忠実なユーザー行動を再現するわけではないことが示された。この研究は、LLMユーザーシミュレータの開発において人間による検証の重要性を強調し、改善の必要性を促している。 Comment
元ポスト:
[Paper Note] M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling, Mayank Mishra+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #Selected Papers/Blogs #One-Line Notes #RecurrentModels Issue Date: 2026-03-22 GPT Summary- 非線形RNNを再検討し、Matrix-to-Matrix RNN(M^2RNN)を導入。これにより、エンティティ追跡やコード実行などの高表現力タスクに対応可能。M^2RNNは、縮小された状態サイズでも効果的な性能を示し、特に長いシーケンスについて一般化できる。Hybrid M^2RNNでは、既存モデルに匹敵する精度を維持しつつ、再帰層のサイズを縮小。LongBenchでは最先端の手法を超える結果を示し、非線形RNN層の効率的でスケーラブルな言語モデルへの応用を強調。 Comment
HF: https://huggingface.co/collections/open-lm-engine/m2rnn
元ポスト:
解説:
状態をベクトルではなく行列として保持するRNN。
状態の更新Z_tを、前回の状態H_t-1
に対して重みWによって変換したものと、現在のトークンのk_t,v_tが与えられた時の外積から求まる行列の和を求めた後、tanhで非線形変換することで計算する(式10)。
最終的にforget gate f_tによってZ_tとH_t-1が線形補完されることで、状態H_tが決定される(式11)。
出力y_tは更新された状態H_tにq_tの積をとったものと、v_tを重みw_rで重みづけて残差接続したものの和で求められる(式12)。
[Paper Note] InCoder-32B: Code Foundation Model for Industrial Scenarios, Jian Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
Issue Date: 2026-03-20 GPT Summary- InCoder-32Bは、32Bパラメータのコード基盤モデルで、プログラミングタスクにおける性能を産業シナリオ向けに向上させるために設計された。効率的なアーキテクチャと段階的な文脈拡張を用い、一般コードと専門の産業コードを統合して訓練。14の一般コードと9の産業ベンチマークで評価した結果、高い競争力を発揮し、強力なオープンソースのベースラインを確立した。 Comment
元ポスト:
pj page: https://huggingface.co/Multilingual-Multimodal-NLP/IndustrialCoder
[Paper Note] The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data, Christina Baek+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Scaling Laws #mid-training #PostTraining #DataMixture #Initial Impression Notes Issue Date: 2026-03-20 GPT Summary- 専門化事前学習(SPT)を通じてドメインデータを再利用し、モデルの性能を向上。SPTは微調整後の一般能力を保持し、必要な事前学習トークン数を最大1.75倍削減。特定のドメインにおいて、SPTは3Bモデルを上回る性能を示し、過適合スケーリング則を導出。事前学習段階で専門ドメインデータを導入することで、一般性能も改善し、計算量を抑えた結果を得る。訓練の早い段階でのドメインデータの統合が重要。 Comment
Finetuningに使うデータをpretraining段階から混ぜておくとより効果的という話らしい。事前学習データの量が増えるためより多くのbudgetが必要になるので効果的なmixtureのためのスケーリング則も構築したとか。興味深い
元ポスト:
解説:
[Paper Note] InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation, Yu Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Personality Issue Date: 2026-03-20 GPT Summary- 大規模言語モデルによる性格シミュレーション評価には、実際のインタビュー内容を基にした手法が必要。提案した評価フレームワークは、著名人の23,000件のインタビューから671,000件の質問-回答ペアを抽出し、内容の類似性、事実的一貫性、性格適合、事実知識の保持を評価。実際のインタビュー情報を用いることで、伝記的プロフィールやパラメータ知識に依存する手法よりも優れた結果を示す。評価は、原則的な手法選択を可能にし、実践的な洞察を提供。 Comment
元ポスト:
おもしろそう
[Paper Note] vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models, Suhwan Choi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Evaluation #VisionLanguageActionModel Issue Date: 2026-03-20 GPT Summary- VLAモデルの評価におけるコーディングの重複や依存性の衝突を解決するため、vla evalを提案。これはオープンソースの評価ハーネスで、WebSocketとmsgpackを活用し、Docker環境でモデル推論とベンチマーク実行を分離。モデルは単一のpredict()メソッドで統合され、統一されたインターフェースにより、評価マトリクスが自動生成される。評価は2つのコマンドで実行可能で、13のシミュレーションと6つのモデルサーバをサポート。エピソードシャーディングとバッチ推論により47倍のスループット向上を実現。再現性監査では、3つのベンチマークで公開された値を概ね再現し、未記載要件や結果を歪める可能性のある隠れた統計を特定。657件の公開結果を集約したVLAリーダーボードも発表。 Comment
元ポスト:
[Paper Note] Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation, Zhuolin Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs Issue Date: 2026-03-20 GPT Summary- Nemotron-Cascade 2は、30B MoEモデルで3Bの活性化パラメータを持ち、高度な推論能力とエージェント機能を提供します。小型ながら、数学およびコーディングでの推論能力は最前線モデルに匹敵。2025年の国際数学オリンピックなどで金メダル級の性能を示し、パラメータ数は20分の1でも知能密度は高い。新たにSFT後の拡張されたCascade RLで幅広い推論をカバーし、マルチドメイン蒸留を導入して性能向上を実現。モデルのチェックポイントやデータも公開予定。 Comment
元ポスト:
[Paper Note] daVinci-Env: Open SWE Environment Synthesis at Scale, Dayuan Fu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-03-20 GPT Summary- OpenSWEは、Pythonでのソフトウェア工学(SWE)エージェント訓練のためのオープンなフレームワークを提供し、45,320のDocker環境を含む。既存のデータセットの限界を克服し、リポジトリ探索や評価スクリプト生成を自動化するマルチエージェントパイプラインを構築。品質フィルタリングを通じて学習効率を最大化し、約9,000の品質保証された環境から13,000のキュレーション済み軌跡を得た。実験結果により、OpenSWEはSWE-bench Verifiedで高い性能を示し、訓練が数学的推論や科学系で顕著な改善を実現した。 Comment
元ポスト:
[Paper Note] Scaling Reward Modeling without Human Supervision, Jingxuan Fan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
Issue Date: 2026-03-19 GPT Summary- 教師なしアプローチで報酬モデルをスケールするパイロット研究を実施。大規模なウェブコーパスからの数学データを用いた訓練により、RewardBench v1およびv2で精度向上を実現。人間の注釈なしで、モデル間で平均+7.7ポイント、数学サブセットで最大+16.1ポイントの改善。これにより、下流の数学パフォーマンスが大幅に改善され、強力な教師付き報酬モデルと同等以上の性能を示す。人間の注釈無しでの訓練の有望性を確認。 Comment
pj page: https://jingxuanf0214.github.io/reward-scaling/
元ポスト:
[Paper Note] PRISM: Demystifying Retention and Interaction in Mid-Training, Bharat Runwal+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #mid-training #Selected Papers/Blogs #Reference Collection #Author Thread-Post Issue Date: 2026-03-19 GPT Summary- PRISMの中間トレーニング設計の実証研究を行い、様々なモデルやアーキテクチャで統制実験を実施。約270億トークンのデータを使用し、数学、コード、科学ベンチマークで一貫した性能改善を達成。RLパイプラインは推論ベンチマークのスコアを大幅に向上させるも、基盤モデルへの直接適用では効果が薄い。中間トレーニングがモデル性能を効果的に高めることを示し、信頼性の向上に役立つ中間トレーニングの重要性を強調。 Comment
元ポスト:
著者ポスト:
ポイント解説:
[Paper Note] FlashSampling: Fast and Memory-Efficient Exact Sampling, Tomas Ruiz+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#SoftwareEngineering Issue Date: 2026-03-17 GPT Summary- FlashSamplingは、大規模語彙のデコードを効率化するために、サンプリングをLMヘッドの行列積に統合する手法を提案。ロジットテンソルを一度も実体化せず、チップ上でロジットをタイルごとに計算し、ガンベルノイズを加えることで最大値を取得。これにより、出力トークンあたりの時間を最大19%削減し、近似なしの厳密なサンプリングを実現。 Comment
元ポスト:
[Paper Note] Meta-Reinforcement Learning with Self-Reflection for Agentic Search, Teng Xiao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs Issue Date: 2026-03-17 GPT Summary- MR-Searchは、自己反省を活用したエージェント主体の文脈内メタ強化学習(RL)手法を提案する。過去のエピソードに基づき探索戦略を適応させることで、報酬が乏しい状況でもポリシーを最適化する。エピソード後に生成される自己反省を次の試行に活用することで、テスト時の探索効率を向上させる。さらに、ターンレベルでの相対アドバンテージを推定する多ターンRLアルゴリズムを導入し、細粒度のクレジット割り当てを実現。様々なベンチマークでの実験により、MR-Searchが従来のRL手法よりも優れた性能を示し、相対的に9.2%から19.3%の改善を達成した。 Comment
元ポスト:
[Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #Selected Papers/Blogs #Reference Collection Issue Date: 2026-03-17 GPT Summary- Attention Residuals(AttnRes)を提案し、層間の出力をソフトマックス注意機構で集約することで、深層モデルの寄与を強化。Block AttnResによりメモリと通信のオーバーヘッドを軽減しつつ、実用的な残差接続の代替として機能。実験により、モデルサイズにかかわらず改善を確認し、すべてのタスクで下流性能の向上を実現。 Comment
元ポスト:
Opus4.6による可視化:
- [Paper Note] DeepCrossAttention: Supercharging Transformer Residual Connections, Mike Heddes+, ICML'25, 2025.02
で既に1年以上前に同様の手法が提案されており、テクニカルレポートから引用されていないという指摘がある
解説:
poster skillsによる可視化:
解説:
[Paper Note] Multimodal OCR: Parse Anything from Documents, Handong Zheng+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#MultiModal #OCR Issue Date: 2026-03-17 GPT Summary- マルチモーダルOCR(MOCR)を利用した文書解析手法dots.mocrを提案。テキストとグラフィックスを同時に解析し、視覚要素も解析ターゲットとすることで、文書の再現性を向上。また、異種要素間の関係をモデルが活用できるように、エンドツーエンドで訓練。評価では、文書解析と構造化グラフィックス解析の両方で優れた性能を示し、既存システムを上回る結果を達成。なお、他の研究者向けにコードも公開。 Comment
元ポスト:
OlmOCRBenchでSoTAとのこと:
[Paper Note] Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights, Yulu Gan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-03-14 GPT Summary- 事前学習によって生成されるパラメータベクトルをタスク特異的な専門家の分布と捉え、小型モデルでは専門家ソリューションが限られるのに対し、大型モデルでは専門家の密度が増加する。これを基に、単純で並列なポストトレーニング手法を提案し、パラメータの摂動をサンプリングし、上位K個を選択してアンサンブルする。シンプルながらも、現代の大規模モデルに対して標準的な手法と競争力を示す。 Comment
元ポスト:
解説:
[Paper Note] FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling, Ted Zadouri+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-03-14 GPT Summary- FlashAttention-4は、Blackwell GPU向けにアテンションの最適化を行い、非同期MMA演算やリスケーリング手法を導入して性能向上を図った。B200 GPU上で、cuDNN 9.13に対し最大1.3倍、Tritonに対し2.7倍のスピードアップを実現し、1613 TFLOPs/sに達した。さらに、Pythonでの実装を通じて、従来のC++より20–30倍の速さでコンパイル可能であることを示した。 Comment
元ポスト:
[Paper Note] Flash-KMeans: Fast and Memory-Efficient Exact K-Means, Shuo Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #MachineLearning #Selected Papers/Blogs #Clustering-based #Author Thread-Post Issue Date: 2026-03-14 GPT Summary- 本研究では、$k$-meansアルゴリズムをオンライン処理に適用するために再設計し、既存のGPU実装におけるボトルネックを解消するFlash-kmeansを提案する。この実装は、距離計算とargminを統合し中間メモリの使用を回避、またセントロイド更新の競合を低減する2つの革新を導入。評価結果では、Flash-kmeansが既存のベースラインを最大17.9倍上回り、業界標準ライブラリに対しても大幅なスピードアップを実現した。 Comment
元ポスト:
著者ポスト:
著者ポスト:
デモ動画が含まれており驚異的な速さ
[Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #SelfImprovement #PostTraining #Selected Papers/Blogs #Environment #autoresearch/RSI Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment
pj page: https://posttrainbench.com/
元ポスト:
[Paper Note] How Far Can Unsupervised RLVR Scale LLM Training?, Bingxiang He+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #PostTraining #RLVR #MajorityVoting #Scalability Issue Date: 2026-03-12 GPT Summary- URLVRは、地上真値ラベルなしで報酬を導出し、LLM訓練のボトルネックを克服する。内部報酬と外部報酬に基づく手法の分析を行い、内部報酬が一貫したパターンを示すことを発見した。モデルの事前分布によって崩壊のタイミングが決まり、内部報酬は小規模データセットでの効果的な利用が可能であることが示された。外部報酬手法も検討し、改善の可能性を示唆する。これにより、内部URLVRの限界を明らかにし、スケーラブルな代替手段への道を提示する。 Comment
元ポスト:
自己検証LLMによる日本司法試験短答式試験合格, Shin Andrew, NLP'26
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Japanese #PostTraining #Selected Papers/Blogs #SelfVerification Issue Date: 2026-03-11 Comment
非常に興味深い。読みたい。
[Paper Note] AutoHarness: improving LLM agents by automatically synthesizing a code harness, Xinghua Lou+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Initial Impression Notes #AgentHarness Issue Date: 2026-03-08 GPT Summary- 言語モデルは、エージェントとして利用する際に最適でない行動をとることがあります。特に、Gemini-2.5-FlashはKaggle GameArenaのチェス競技で78%の敗北が違法手に起因しています。そこで、本研究では、ゲーム環境のフィードバックを用いて自動的に“ハーネス”を合成する手法を提案します。この手法は、145のTextArenaゲームにおいて全ての違法手を防ぎ、小型モデルのGemini-2.5-Flashがより大きなモデルを上回る性能を示します。また、Gemini-2.5-Flashは方針をコードとして生成し、意思決定時にLLMを必要としなくなります。得られたコードは、16の1人用ゲームでより高い平均報酬を得ており、カスタムのコード・ハーネスを用いることで、より大きなモデルを上回る性能を示します。 Comment
元ポスト:
あのMurphy本の著者であるMurphy氏が著者にいる👀
[Paper Note] Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations, Dongming Jiang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Survey #Analysis #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory #Initial Impression Notes Issue Date: 2026-03-07 GPT Summary- エージェント記憶システムは、LLMエージェントが長い相互作用を維持し、長期推論を支援するが、経験的基盤が脆弱である。既存のベンチマークは不十分で、評価指標が実用性に合致せず、性能差が大きく、コストも見落とされがちである。本調査では、エージェント記憶を構造的に分析し、4つの記憶構造から成るMAGシステムを提案。主要な問題点として、ベンチマークの飽和、評価指標の妥当性、精度のバックボーン依存、記憶維持によるオーバーヘッドを挙げ、信頼性の高い評価とスケーラブルなシステム設計の方向性を示す。 Comment
元ポスト:
AI Agentの研究に関してtaxonomyが定義されており、研究分野全体の進展を外観するのに良さそう。
[Paper Note] Replaying pre-training data improves fine-tuning, Suhas Kotha+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #mid-training #PostTraining #Selected Papers/Blogs #Scheduler #One-Line Notes #Data Issue Date: 2026-03-07 GPT Summary- ターゲット領域向けの言語モデルの構築には、汎用ウェブテキストでの事前学習とターゲットデータでのファインチューニングが行われる。驚くべきことに、ファインチューニング中に汎用データをリプレイすることで、ターゲットタスクの性能が向上することが確認された。具体的には、4百万トークンのターゲットデータを使用した場合、汎用リプレイによりデータ効率が最大1.87倍、ミッドトレーニングで2.06倍向上した。また、事前学習中にターゲットデータが少ないほどリプレイ効果が高いことが分かった。80億パラメータのモデルでの実験により、エージェントのウェブナビゲーション成功率やバスク語の質問応答精度が向上したことを示した。 Comment
元ポスト:
事前学習以後の中間学習やファインチューニング(事後学習)において、特定のドメインやタスクに特化させるための追加の学習を行う際に、破壊的忘却を防ぐために一定量の事前学習データを混ぜることはよく行われていたが、実際には破壊的忘却を防ぐだけでなく、ターゲットドメインの学習効率を大幅に高める(1.5Bモデルの実験ではファインチューニングでは1.87倍、中間学習では2.06倍)ことがわかり、これは70B級の大規模なモデルでも同様に生じることが明らかになった、という話らしい。興味深い。
解説:
[Paper Note] Phi-4-reasoning-vision-15B Technical Report, Jyoti Aneja+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Reasoning #SmallModel #OpenWeight #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-03-07 GPT Summary- Phi-4-reasoning-vision-15Bを提案。コンパクトなオープンウェイトのマルチモーダル推論モデルであり、効率的な設計選択や厳格なデータキュレーションを通じて競争力のある性能を実現。系統的なフィルタリングや誤り訂正によりデータ品質が重要であることを再確認し、高解像度エンコーダが性能向上に寄与。単一モデルで簡単なタスクに迅速な回答、複雑な問題には推論を提供するハイブリッドデータ構成を実現。 Comment
元ポスト:
[Paper Note] $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners, Harman Singh+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#PairWise #NLP #LanguageModel #Initial Impression Notes #SelfVerification Issue Date: 2026-03-06 GPT Summary- 複雑な推論タスクにおける性能向上のため、ペアワイズ自己検証を活用したフレームワーク$V_1$を提案。$V_1$は、不確実性の高い候補ペアに動的に検証計算を割り当てる$V_1$-Inferと、生成器と検証器を共同訓練する$V_1$-PairRLから成る。これにより、コード生成や数学的推論のベンチマークで顕著な性能向上を実現。また、後者は従来の手法より高い効率を達成。 Comment
元ポスト:
self-verificationが進化するとdownstreamタスクの性能に多大な影響が出るし、かつ既存のモデルはフロンティアモデルであってもself-verificationは何らかのガイダンスがないと上手くできないことが示されているので [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
、もしガイダンス無しでうまくできるという話であればおもしろそう
- [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
[Paper Note] KromHC: Manifold-Constrained Hyper-Connections with Kronecker-Product Residual Matrices, Wuyang Zhou+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ResidualStream Issue Date: 2026-03-05 GPT Summary- KromHCは、多様体制約付きハイパーコネクション(mHC)の残差行列をクロネッカー積で再パラメータ化し、正確な二重確率性を保証しながら計算量を$\mathcal{O}(n^2C)$に削減する手法を提案。包括的な実験により、KromHCは最先端のmHC変種と同等以上の性能を示し、学習可能なパラメータ数を大幅に抑えることが確認された。 Comment
元ポスト:
[Paper Note] Speculative Speculative Decoding, Tanishq Kumar+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#SpeculativeDecoding Issue Date: 2026-03-05 GPT Summary- 自己回帰デコーディングのボトルネックを解消するため、推測的デコーディングを用いた通常の手法を拡張し、スペキュレーティブスペキュレーティブデコーディング(SSD)を導入。これにより、検証中にドラフトモデルが次の検証結果を予測し、迅速に推測を返すことが可能に。SSDが抱える課題に対処するための手法を提案し、最適化されたSSDアルゴリズムSaguaroを実装。結果として、最適化された推測的デコーディングに比べ最大2倍、自己回帰デコーディングに対しては最大5倍の速度向上を実現。 Comment
元ポスト:
解説:
[Paper Note] FlashOptim: Optimizers for Memory Efficient Training, Jose Javier Gonzalez Ortiz+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Quantization #Optimizer #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-05 GPT Summary- パラメータあたりのメモリを50%以上削減する最適化手法FlashOptimを提案。改善されたマスタウェイト分割と8ビットオプティマイザの量子化を活用し、AdamWのメモリを16バイトから7バイト、勾配リリースによりさらに5バイトに削減。これによりモデルのチェックポイントサイズも大幅に減少し、品質を保持しつつ視覚と言語タスクでの劣化は見られなかった。 Comment
元ポスト:
すでにpip install flashoptimで利用可能。SGD, Adam, AdamW, Lionがサポートされている。8Bモデルの訓練に必要なピークメモリを35%削減し、チェックポイントのサイズもも57%小さくなるという優れもの。実験結果では性能の劣化もなしという報告。
[Paper Note] Beyond Language Modeling: An Exploration of Multimodal Pretraining, Shengbang Tong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #Transformer #MultiModal #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #Selected Papers/Blogs #WorldModels #UMM #Author Thread-Post Issue Date: 2026-03-05 GPT Summary- 視覚的データは言語を超えるマルチモーダルモデルの進展に重要で、我々は制御された前訓練実験を通じてその要因を明らかにした。Transfusionフレームワークを用い、テキストや視覚データで統一的に訓練し、以下の洞察を得た:(i) RAEが最適な視覚表現を提供;(ii) 視覚とテキストは相補的で相乗効果を生む;(iii) 統一学習が世界モデリングに繋がる;(iv) MoEが効率的なスケーリングを可能にする。視覚データが言語より多く必要であることを示し、MoEが両者の調和を図ることを提案。 Comment
元ポスト:
著者ポスト:
解説:
[Paper Note] SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale, Ibragim Badertdinov+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #Selected Papers/Blogs #Live #One-Line Notes #Environment Issue Date: 2026-03-05 GPT Summary- SWEエージェントの強化学習を支えるため、実世界のソフトウェア工学タスクを自動収集し、再現可能な環境を構築するSWE-rebench V2を提案。20言語・3,600超のリポジトリから32,000以上のタスクを集め、厳選したコンテンツで信頼性のあるトレーニングデータを提供。また、タスク生成に必要なメタデータも加え、エラー要因を明示。データセットと関連リソースを公開し、多様な言語での大規模なSWEエージェントのトレーニングを支援。 Comment
元ポスト:
environment: https://huggingface.co/datasets/nebius/SWE-rebench-V2?row=5
関連:
- [Paper Note] SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, Ibragim Badertdinov+, NeurIPS'25, 2025.05
以前の研究ではpython特化だったが、今回はlanguage-agnosticな環境になっている。
合成データではなく、実際のissue-resolutionのヒストリに基づいたデータセットであることに注意
[Paper Note] How Well Does Agent Development Reflect Real-World Work?, Zora Zhiruo Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-03-04 GPT Summary- AIエージェントの開発は、労働市場のベンチマーク上で進められているが、その代表性は不明である。本研究では、43のベンチマークと72,342のタスクを分析し、エージェント開発と米国労働市場の職業との整合性を測定。プログラミング重視の開発と人間労働の価値の乖離を指摘し、エージェントの自律性を評価することで実用的な指針を提供。最後に、社会的に重要な労働を捉えるベンチマーク設計のための3つの原則を提案。 Comment
元ポスト:
AI Agentのベンチマークは実際の人間の労働に本当に紐づいたタスクで評価されているのか?という疑問に答えてくれる研究のようで、実際のAI Agentのベンチマークと人間の業務、それらのcapitalをマッピングしたところ、現在のAI Agentのベンチマークは過剰に数学とコーディングドメインに偏っており、実態としての人間の労働や、それらの中でcapitalが集中しているドメインに対するカバレッジが大きく不足していることがわかった。
ドメインごとに見ると、デジタル化がされていて高付加価値のドメインのいくつか(マネジメントや法務)のベンチマークは少なく、スキルをベースに見るとベンチマークは情報取得やエンジニアリングといった狭いスコープばかりに焦点が当たっていて(これらの人間の労働に占める割合は<7%にすぎない)、多くの他のスキルが無視されている状況とのこと。
また、エージェントの自律性を細分された尺度で評価するために、どの程度のレベルの複雑さのタスクであればreliableにagentがこなせるかという観点を導入し、タスクの複雑性に関するスケールを導入し比較を可能にした、といった話が元ポストに書かれている。
現在提供されているベンチマークにおいて、おそらくタスク全体のうちの個別のサブタスクごとに複雑度をラベル付けして、複雑度を軸にサブタスクの成功/失敗をtrajectoryから分析することで、タスクの複雑度を軸に成功率を分析したグラフを見ると、タスクの複雑度に対して基本的にはどのドメイン、スキル、エージェントフレームワーク、バックボーンモデルであれ複雑度な上がれば上がるほど成功率は減少していく傾向にあり、成功率は最終的に20%--0%付近まで低下する。
最終的に、エージェントの評価ベンチマークにおいては、実際の労働に対するカバレッジ、現実的であること(=実際のドメインや必要となるスキルを捉えており、実タスク全体を捉えたようなものが必要でFigure4にベンチマークごとのドメインとスキルのカバレッジが可視化されている)、より粒度の細かい評価が必要(タスク全体の成功/失敗でのみ評価すると、タスクのどこまでできていたのか?という重要なシグナルが欠落する)であることが議論されている。
[Paper Note] FireRed-OCR Technical Report, Hao Wu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData #OpenWeight #VisionLanguageModel #OCR #One-Line Notes #Pixel-based Issue Date: 2026-03-03 GPT Summary- FireRed-OCRは、一般的なビジョン-ランゲージモデルを特化した高性能OCRモデルへ変換するフレームワークです。VLMは一般的には優れた能力を示すものの、文書処理では「構造的幻視」が問題となります。FireRed-OCRでは、高品質な構造データの不足に対処するため、「Geometry + Semantics」データファクトリを構築し、幾何特徴のクラスタリングを利用して多様な文書タイプに対応したデータセットを作成します。3段階の訓練戦略を導入し、文書構造理解、形式的出力の標準化、強化学習による構文的整合性の確保を行います。OmniDocBench v1.5での評価結果から、FireRed-OCRは92.94%の性能を達成し、他のベースラインを大きく上回ることを示しました。コードとモデル重みをオープンソース化し、一般VLMから専門的な構造エキスパートへの変容を促進します。 Comment
元ポスト:
github: https://github.com/FireRedTeam/FireRed-OCR
- [Paper Note] OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, Linke Ouyang+, CVPR'25, 2024.12
においてSoTAとのこと。日本語はどのくらいいけるだろう。
[Paper Note] AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications, Yujie Zhao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-03-01 GPT Summary- LLMを用いた自律エージェントの記憶において、実務的応用と評価基準の間にギャップが存在。これを解消するために、AMA-Benchを提案し、実世界のエージェント軌跡とQAを組み合わせて評価。多くの既存システムが因果性を欠き、類似性ベース検索に制約されている中、因果性グラフとツールを用いたAMA-Agentが性能を向上。AMA-AgentはAMA-Benchで57.22%の正解率を達成し、最強記憶システムのベースラインを11.16%上回る。 Comment
元ポスト:
実際のAgenticなタスクのユースケースに沿ったmemoryの評価方法を提案している研究のようで、非常に重要な研究に見える。実際はチャットベースのやり取りではなく、エージェントと環境が相互作用しながら生成されるtrajectoryで構成され、指示はagentによって生成された客観的な目的を含んでおり、trajectoryには多くのnoisyな結果やsymbolが含まれる。また、agentが現在のstateから環境に作用した結果が返ってくるというチャットベースの言語的なフロートは異なり、stateに基づいた因果関係が存在するという差がある。
ベンチマークの結果ではGPT-5.2が優れていそうに見えるが、GPTの場合は最新のGPT-5.2で評価されているのに、Claudeに関してはClaude Haiku 3.5で評価されているのは気になる。Claude Opus 4.6やGemini-3で評価したらどの程度の性能になるのだろうか。
著者ポスト:
[Paper Note] VidEoMT: Your ViT is Secretly Also a Video Segmentation Model, Narges Norouzi+, CVPR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #ImageSegmentation #CVPR #Selected Papers/Blogs #Encoder #2D (Image) #3D (Video) #Initial Impression Notes Issue Date: 2026-02-28 GPT Summary- VidEoMTは、専用の追跡モジュールなしで動画セグメンテーションを実現するエンコーダーのみのモデルである。軽量なクエリ伝搬機構を導入し、前フレームの情報を活用することで、フレーム間の連携を図る。時系列に依存しない学習済みクエリと融合により、利益を生み出しつつ追加の複雑さを回避し、最大160 FPSで競争力のある精度を達成した。 Comment
元ポスト:
他タスクでも色々使えそうなアーキテクチャに見える
[Paper Note] The Trinity of Consistency as a Defining Principle for General World Models, Jingxuan Wei+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #WorldModels Issue Date: 2026-02-28 GPT Summary- 世界モデルの構築は人工汎用知能の基本課題であり、Soraの動画生成モデルやUnified Multimodal Model (UMM)の進展がデータ駆動型の物理ダイナミクス近似の可能性を示している。しかし、一般的な世界モデルに必要な理論フレームワークは未整備である。本研究では、世界モデルが整合性の三位一体(モーダル・空間的・時間的整合性)に基づくべきと提案し、マルチモーダル学習の進化をレビュー。新たにCoW-Benchを導入し、これを用いて動画生成モデルとUMMを評価する。研究は一般的世界モデルへの道筋を確立し、現行システムの限界と将来のアーキテクチャ要件を明らかにする。 Comment
[Paper Note] Fast KV Compaction via Attention Matching, Adam Zweiger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Decoding #Selected Papers/Blogs #KV Cache #Compression Issue Date: 2026-02-28 GPT Summary- 長い文脈の処理において、KVキャッシュのサイズがボトルネックとなるが、要約による圧縮は情報損失を招く。最近のCartridges研究はコンパクトなKVキャッシュが全文脈に近い性能を持つことを示したが、最適化が遅い。本研究では、Attention Matchingを用い、アテンション出力を再現しながらコンパクトなキーと値を構築する高速な文脈圧縮手法を提案。これにより、効率的な部分問題への分解が可能となり、圧縮時間と品質で大幅な改善を達成し、数秒で最大50倍の圧縮を実現した。 Comment
元ポスト:
[Paper Note] DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference, Yongtong Wu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #SoftwareEngineering Issue Date: 2026-02-28 GPT Summary- エージェント型LLM推論において、KVキャッシュのストレージI/Oが性能に大きく影響している。従来のアーキテクチャでは、KVキャッシュの読み込みがボトルネックとなり、システム全体のスループットが制約されている。DualPathは、このボトルネックを解消するためのデュアルパスKVキャッシュ読み込みシステムであり、デコードエンジンへの新たなストレージ経路を提供する。これにより、データ転送が効率化され、負荷が動的にバランスされる。実運用のモデル評価では、DualPathがオフライン推論スループットを最大1.87倍、オンライン提供スループットを平均1.96倍向上させることが示された。 Comment
元ポスト:
ポイント解説:
[Paper Note] Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs, Yining Hong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #PEFT(Adaptor/LoRA) #SelfCorrection #Test-Time Scaling #PostTraining #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-02-28 GPT Summary- 具現化されたLLMsは高レベルのタスク推論を持つが、過去の失敗を振り返れず、ミスが繰り返される独立した試行となる。この問題に対処するため、Reflection Test-Time Planningを導入し、二つの省察モードを統合。実行中の反省では内部評価を通じて候補アクションを生成し、実行後の反省では外部反省を基にモデルを更新。新たに設計したベンチマークで実験を行い、ベースラインモデルに対して有意な改善を示した。定性的分析では、反省を通じた行動の修正が強調された。 Comment
pj page: https://reflective-test-time-planning.github.io/
元ポスト:
- [Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09
まだ全然理解できていないが、Action Model, Internal reflection LLM, external reflection LLMとしてLLaVA 3Dと呼ばれるモデルをベースにし、単一のモデルで3種類のモードを学習するようである。そしてテスト時にはLoRAを用いたTTTを実施するようである。
[Paper Note] DISCO: Diversifying Sample Condensation for Efficient Model Evaluation, Alexander Rubinstein+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Evaluation #ICLR #Selected Papers/Blogs #EfficientEvaluation Issue Date: 2026-02-28 GPT Summary- 機械学習モデルの評価は高コストであり、従来のアプローチは二段階でサブセットを選び、精度を学習する。しかし、選択がクラスタリングに依存するため設計に敏感である。我々は、モデルの応答の多様性を最大化するサンプル選択が重要であると提唱し、$\textbf{DISCO}$手法を提案。これはモデル間の不一致を基にサンプルを選ぶもので、理論的にも最適であり、MMLUやHellaswagなどで最先端の性能を達成した。 Comment
pj page: https://arubique.github.io/disco-site/
元ポスト:
openreview: https://openreview.net/forum?id=SoOgBHa3dZ
[Paper Note] The Diffusion Duality, Chapter II: $Ψ$-Samplers and Efficient Curriculum, Justin Deschenaux+, ICLR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #DiffusionModel #ICLR #Selected Papers/Blogs #ImageSynthesis #Samplers #Author Thread-Post Issue Date: 2026-02-28 GPT Summary- Uniform-state離散拡散モデルは自己修正能力により優れた生成とガイダンスを実現していますが、ステップ数が増えるとサンプリング品質が限界に達します。本研究では、予測子-修正子(PC)サンプラーを導入し、任意のノイズ過程に対応可能な一般化手法を提案します。Uniform-state拡散と組み合わせることで、従来の手法を超える性能を発揮し、生成パープレキシティを低減させるとともに、サンプリングステップを増やすことで性能が向上します。また、効率的なカリキュラムを構築し、訓練時間を25%、メモリを33%削減しつつ、強力な下流タスク性能を維持します。 Comment
元ポスト:
著者ポスト:
openreview: https://openreview.net/forum?id=RSIoYWIzaP
著者コメント:
openreview: https://openreview.net/forum?id=RSIoYWIzaP
著者ポスト:
[Paper Note] Symmetry in language statistics shapes the geometry of model representations, Dhruva Karkada+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Embeddings #Analysis #NLP #LanguageModel #RepresentationLearning #Selected Papers/Blogs #Geometric #Initial Impression Notes Issue Date: 2026-02-28 GPT Summary- 言語モデルの内部表現は顕著な幾何学的構造を示し、暦の月や歴史的年の配置に関する対称性を示す。特に、月の共起頻度が時間間隔のみに依存することを証明し、高次元の単語埋め込みモデルにおける幾何学的構造を導出。実験的に大規模なテキスト埋め込みモデルとの一致を確認し、共起統計が撹乱されても幾何は維持されることを示している。この頑健性は、潜在変数によって制御される場合に自然に現れ、表現多様体の普遍的な起源を示唆する。 Comment
元ポスト:
こんな不思議なことが(小並感)
[Paper Note] LLMs Can Learn to Reason Via Off-Policy RL, Daniel Ritter+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #Selected Papers/Blogs #Off-Policy #Author Thread-Post Issue Date: 2026-02-24 GPT Summary- オフポリシーRLアルゴリズム「OAPL」は、大規模言語モデルのトレーニングにおいて重要度サンプリングを使用せず、Lagged Inferenceポリシーを採用。OAPLはGRPOを上回り、DeepCoderと同等の性能を維持しつつ、訓練時間を3分の1に削減。また、Pass@k指標でのスケーリング改善を示し、400ステップ以上のラグを持ちながらも効率的なポストトレーニングを実現する。 Comment
元ポスト:
著者ポスト:
[Paper Note] One-step Language Modeling via Continuous Denoising, Chanhyuk Lee+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Architecture #FlowMaps Issue Date: 2026-02-20 GPT Summary- 離散拡散に基づく言語モデルの生成速度の向上が期待される中、品質が低下する問題を解決。フロー基盤の言語モデル(FLM)を構築し、ユークリッドデノイジングを利用して訓練安定性と生成品質を向上。蒸留により少数ステップ生成が可能なモデル(FMLM)を取得し、既存のモデルを上回る品質を実現。研究は離散モダリティの生成モデリングに新たな視点を提供し、スケーラブルなフロー基盤アプローチへと導く。 Comment
元ポスト:
v2:
pj page: https://one-step-lm.github.io/blog/
[Paper Note] GLM-5: from Vibe Coding to Agentic Engineering, GLM-5 Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongContext #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #SparseAttention Issue Date: 2026-02-18 GPT Summary- 次世代モデルGLM-5は、エージェント主導のエンジニアリングへ移行し、推論コストを削減しながら長い文脈の忠実度を維持する。新しい非同期強化学習インフラを実装することで、学習効率を向上させ、非同期エージェントRLアルゴリズムにより複雑な相互作用からの学習効果を高める。これによりGLM-5は最先端の性能を達成し、実世界のコーディングタスクでの能力が従来の基準を超えたことが示された。 Comment
関連:
- GLM-5: From Vibe Coding to Agentic Engineering, Z.ai, 2026.02
- DeepSeek Sparse Attention (DSA)
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
元ポスト:
解説:
ASync RLにおける工夫:
[Paper Note] VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model, Yanjiang Guo+, arXiv'26, 2026.02
Paper/Blog Link My Issue
Issue Date: 2026-02-18 GPT Summary- 本研究では、視覚言語行動(VLA)モデルの性能と信頼性を、オンラインインタラクションを通じて向上させる手法を提案します。高コストの実世界のポリシーロールアウトデータに代わり、行動条件付きビデオ生成モデルを用いて合成データを生成し、ワールドモデルの物理的忠実度を向上させます。実験により、提案した反復改善アルゴリズムがVLAモデルの性能を39.2%向上させ、合成ロールアウトによるトレーニングで11.6%の改善が確認されました。 Comment
pj page: https://sites.google.com/view/vlaw-arxiv
元ポスト:
[Paper Note] Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook, Ming Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Initial Impression Notes #Society Issue Date: 2026-02-18 GPT Summary- AIエージェント社会は人間の社会システムに似た収束ダイナミクスを辿るのかという問いに対し、初の大規模な診断を行った。動的進化を定量的に評価するフレームワークを導入し、言語の安定化や個体の惰性を測定。分析の結果、意味は迅速に安定化するが、エージェント間の多様性と語彙の変化は維持され、均質化には逆らっている。しかし、強い惰性により影響力は一過性で、安定した集団的影響の形成が妨げられている。これにより、相互作用と社会化に関する新たなデザイン原理が示唆される。 Comment
元ポスト:
Moltbook:
- Moltbook is the most interesting place on the internet right now, Simon Willisons's blog, 2026.01
元ポストとアブストしか読めていないのだが、いまのAI Agentはたとえば下記Position Paperのように他者と協働するように作られていない[^1]からこのような現象が生じるのではないか。また、Moltbookにデプロイされているエージェントがどのような目的を設定されているかはわからないが、明確な目的やタスクが与えられないで活動している場合、エージェントの学習データはそのような状況を前提としていないので、エージェントの振る舞いもランダムなノイズのようなものになってしまうのではなかろうか。
- [Paper Note] Position: Humans are Missing from AI Coding Agent Research, Wang+, 2026.02
逆に他者と協働しながら、特定のタスクの正しい完了を報酬とするのではなく、もっと自身の内面的な感情や動機に対して報酬が働くような枠組みが発展し、かつ協働をすることのスキルを得られるようなデータが増えればまた違ったことが起きるのではなかろうか。
[^1]:SWE Agentの例ではあるが現在のAAgentはタスクを正しく完了したことをシグナルとして訓練されるパラダイムに支配されているので協働的な要素は生まれづらいと推察される。それはおそらくマルチエージェントでも一緒である。
[Paper Note] BitDance: Scaling Autoregressive Generative Models with Binary Tokens, Yuang Ai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #Transformer #DiffusionModel #TextToImageGeneration #Decoding #2D (Image) #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- BitDanceは、バイナリ視覚トークンを予測する自己回帰型の画像生成モデルであり、高エントロピーのバイナリ潜在変数により最大2^{256}の状態を表現できます。バイナリ拡散ヘッドを採用し、標準の分類を超えたトークン生成を実現。次パッチ拡散技術により、複数トークンを高精度で並列予測し、推論速度を8.7倍向上させます。ImageNet 256x256では最高のFIDスコア1.24を達成し、1024x1024画像生成においては従来モデルと比較して30倍以上の速度向上を実現しています。コードとモデルは公開されています。 Comment
pj page: https://bitdance.csuhan.com/
元ポスト:
[Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Evaluation #Selected Papers/Blogs #Generalization #One-Line Notes #Initial Impression Notes #Contamination Issue Date: 2026-02-17 GPT Summary- LLMの訓練データがベンチマークのテストデータで汚染されると、分布外一般化にバイアスが生じる。従来のデコンタミネーション・フィルターは意味的重複を認識できず、私たちは「ソフト汚染」として訓練データの意味的重複を調査。Olmo3コーパスの解析から、汚染が広範囲に存在し、CodeForcesの78%、ZebraLogicの50%に意味的または厳密な重複を確認。また、ベンチマークデータの重複が訓練データに含まれることで性能が向上し、ファインチューニングが同じベンチマークの未使用データの性能も改善することが示された。これにより、最近のベンチマークの向上は本質的な能力向上とは異なる可能性があることを示唆している。 Comment
元ポスト:
n-gramマッチングによるデータのdeaontaminationは表層レベルでしか捉えられないので、意味的に等価なサンプルをdecontamgnationできず(=Soft Contamination)効果が薄く、意味的なレベルでのコンタミネーションは広範に存在し[^1]、それらサンプルが学習データに含まれるとheldoutされたテストベンチマークのスコアも改善してしまう(=本当に計りたい汎化性能を測れていない)という話をしっかり分析した研究に見え、非常に重要な研究に見える。
[^1]:Olmo3で検証しており、ZebraLogicテストセットの50%とexactに一致するデータが含まれ、CodeForcesのテストセットのうち78%のサンプルと意味的に一致したサンプルが一件以上存在したとのこと。
[Paper Note] Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs, Wei Zhou+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SoftwareEngineering #Selected Papers/Blogs #Initial Impression Notes #Data Issue Date: 2026-02-16 GPT Summary- LLM技術がデータ前処理のパラダイムを変革中であり、幅広いアプリケーションに対応するための進化を検討。文献レビューを通じて、データクリーニング、統合、強化の主要タスクにおける手法を整理し、それぞれの利点と制約を分析。さらに、評価指標とデータセットを考察し、スケーラブルなデータシステムや信頼性の高いワークフローに向けた研究課題を提示。 Comment
元ポスト:
自動的なデータの前処理に関するSurvey。文献は120以上引用され、美麗なフォーマットで記述されている。時系列での手法の変遷と、手法間の関係性が図解で整理されており非常にわかりやすそう。データの前処理は実務上の大きなボトルネックなのでどのような研究があるか気になる。
[Paper Note] Olmix: A Framework for Data Mixing Throughout LM Development, Mayee F. Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Tutorial #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #DataMixture #One-Line Notes #Author Thread-Post Issue Date: 2026-02-13 GPT Summary- データミキシングは言語モデル(LM)トレーニングにおいて重要な課題であり、Olmixフレームワークを提案することで短所に対処。設定空間の理解が不足している中、強力なミキシング手法の設計選択を特定。ドメインセットの進化に対応し、受けた影響を考慮したミキシチャー再利用メカニズムを導入。これにより、計算量を74%削減し、下流タスクで11.6%の改善を実現。 Comment
元ポスト:
著者ポスト:
言語モデルを事前学習しようとしたときに、
- 先行研究で提案されている手法を自分のデータにどのように適用すべきか?ハイパーパラメータはどうすればよいか?tiny datasetの場合はoversamplingしてよいのか?といった課題に直面し
- 仮にgood mixが分かったとしても、データは静的ではなく、新たなデータセットがリリースされたり、同僚がデータセットを変更するかもしれない。そうなったときに、DataMixをどのようにアップデートすればよいのか?
といった実践的に困る場面が多いようであり、これらに対して本研究は実践的なDataMixingの設定に関するガイダンスとデータセットが進化したときに効果的にDataMixを更新する方法を提案しているとのこと。
[Paper Note] SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora, Masataka Yoneda+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#InformationRetrieval #NLP #Search #Selected Papers/Blogs Issue Date: 2026-02-12 GPT Summary- 超高速かつ柔軟な検索アルゴリズムを提案し、1兆規模の自然言語コーパスを0.3秒未満で検索可能に。サフィックス配列に基づく文字列マッチングを採用し、クエリのセマンティック・リラクゼーションによる爆発を抑制。ディスク意識設計と動的プルーニングで高速正確検索を実現。実験では、既存手法より著しく短い検索待機時間を示し、トレーニングコーパスのベンチマーク汚染の特定にも成功。7言語対応のオンラインデモも提供。 Comment
pj page: https://softmatcha.github.io/v2/
元ポスト:
contaminationの検出にも利用可能:
[Paper Note] Towards Autonomous Mathematics Research, Tony Feng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Mathematics #ScientificDiscovery #Test-Time Scaling #Selected Papers/Blogs #Human-in-the-Loop Issue Date: 2026-02-12 GPT Summary- Aletheiaは、金メダル級の推論能力を持つ数学研究エージェントで、自然言語による解の生成・検証・修正を行います。競技レベルから専門研究への移行を可能にする高度なツールを活用し、オリンピック問題から博士課程レベルの演習に対応。顕著な成果として、AIが生成した研究論文や人間との協働証明、未解問の半自律評価を示します。AIの自律性と新規性の評価基準を提案し、人間とAIの協働について考察します。すべてのプロンプトとモデル出力は公開されています。 Comment
元ポスト:
ポイント解説:
[Paper Note] Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model, Jacqueline He+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #Selected Papers/Blogs #Legal #KeyPoint Notes #Initial Impression Notes #Copyright #Author Thread-Post Issue Date: 2026-02-12 GPT Summary- 「アンカーデコーディング」は、現代の言語モデルが逐語的な再現を抑制するための新しい推論法であり、リスクのあるLMからより安全な生成を実現します。この手法は、ユーザーが選択した情報予算に応じて生成過程に制約を加え、著作権リスクと有用性のトレードオフを可能にします。また、新たに導入した安全モデルと、クロスボキャブラリ融合を実現するAnchored$_{\mathrm{Byte}}$デコーディングにより、リスク低減と流暢さを維持しつつ、コピーギャップを75%まで排除することが確認されました。 Comment
元ポスト:
権利上の問題がない言語モデル(permissive licenceデータによって学習されたものなど)SafeLMと、任意の言語モデルRiskyLMの2つが与えられたときに、KL Divergenceの予算Kの元、各生成のstep tごとに語彙空間上で両LLMのKL DivergenceがK_t未満となるように生成するトークンを選択することで、出力の有用性(fluencyとfactuality)は維持しつつ、memorizationされている著作権物をそのままデコーディングしてしまうリスクを低減する手法。RiskyLMの非常に高いUtility上の語彙生成確率を、SafeLM側の安全な語彙確率で引っ張って良い塩梅で生成するようなイメージと思われる。
この手法はSafeLMがどれだけ高いUtilityを維持しつつ安全性を保てるかにデコーディング性能が依存すると思われるが、SLMで非常に性能の良いTinyComma 0.8Bもリリースしている。
また、KL Divergenceを測定する都合上、提案手法は共通のVocab(すなわちトークナイザー)を持つモデル間でしか適用できないが、KL Divergenceをバイト空間上で測るように工夫することでVocabの制約を無くす方法も提案している。
著作物をそのまま出力してしまう問題は軽減されそうだと思われるが、著者独特の思想や感情、表現や言い回しなどの著作権で保護される対象をどの程度の度合いで守れるかについては興味がある。また、そのためには次はどのようなステップが必要か?
[Paper Note] Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts, Yingfa Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Distillation #LongContext #PositionalEncoding #Architecture #Selected Papers/Blogs #reading #RecurrentModels Issue Date: 2026-02-12 GPT Summary- ハイブリッドトランスフォーマーアーキテクチャは、ソフトマックスアテンションとRNNを組み合わせたもので、長い文脈の処理においてトレードオフを示すが、高コストな事前トレーニングが課題。既存の転送法は大量のデータを必要とし、ハイブリッドモデルの性能低下を招く。本研究では、トランスフォーマーからRNNアテンションハイブリッドモデルへの蒸留手法HALOを提案し、新たな位置エンコーディングスキームHyPEを導入したHypeNetを開発。HALOを用いてQwen3シリーズをHypeNetに変換し、わずか2.3Bトークンで同等の性能を実現しつつ、長文脈性能と効率を向上させた。
[Paper Note] OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence, Feilong Tang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #Encoder #Backbone Issue Date: 2026-02-12 GPT Summary- 仮説として、人工汎用知能は圧縮問題であると提唱。深層学習はデータ構造とアーキテクチャの整合時に最も効果的であるが、現在の視覚アーキテクチャは過剰計算を行い冗長性を無視している。OneVision-Encoderは、視覚情報を圧縮し、計算をエントロピーの高い領域に集中させる方法論を採用。結果として効率と精度の向上が証明され、OV-Encoderは他の視覚モデルを複数のベンチマークで上回り、特に動画理解での改善が見られる。これにより、次世代の視覚AIの基盤となる可能性が示された。 Comment
元ポスト:
pj page: https://github.com/EvolvingLMMs-Lab/OneVision-Encoder?tab=readme-ov-file
[Paper Note] LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs, Benno Krojer+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #Explanation #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #VisualTokens Issue Date: 2026-02-12 GPT Summary- 視覚トークンをLLMの埋め込み空間にマッピングする新手法「LatentLens」を提案。これにより視覚トークンの解釈可能性が向上し、従来の手法よりも高い精度で記述を生成。評価では、LatentLensが視覚トークンの解釈を効果的に提供し、視覚と言語の整合性に関する新たな証拠を示すことが確認された。 Comment
元ポスト:
VLMのVisual Tokenを、LLMで事前にコーパスからエンコードされたテキストのrepresentationとsimilarityを測ることでテキスト空間での類似した表現を見つけ解釈する方法な模様。興味深い。
[Paper Note] OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration, Shaobo Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Selected Papers/Blogs #DataFiltering #One-Line Notes #Adaptive #Author Thread-Post Issue Date: 2026-02-12 GPT Summary- 高品質な公的テキストが不足する中、データ選択の動的特性を無視した手法の限界を克服するために、最適化器誘導投影ユーティリティ選択(OPUS)を提案。OPUSは、効果的な更新を安定したプロキシから導き出すことでデータをスコアリングし、計算効率を考慮したゴースト手法とボルツマン・サンプリングを用いる。これにより、GPT-2 Large/XLやQwen3-8B-Baseにおいて優れた成果を上げ、事前トレーニングの効率を飛躍的に改善。 Comment
元ポスト:
事前学習においてステップ単位で動的にバッチに含める学習データを選択する手法で、従来手法は単に勾配を考慮して選択していたが、実際にoptimizerによって更新される方向はmomentumなどによって異なるためgapが生じていた。これを埋めるために、optimizerが実際に重みを更新した際に、Validation setのlossがどれだけ低下するかによってUtilityを定義し、Utilityが大きくなるようにデータを動的に選択することで学習効率が向上する、といった話に見える。
著者ポスト:
[Paper Note] LLaDA2.1: Speeding Up Text Diffusion via Token Editing, Tiwei Bie+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Selected Papers/Blogs Issue Date: 2026-02-11 GPT Summary- LLaDA2.1は、デコード速度と生成品質のトレードオフを克服するために設計され、M2TからT2Tへの移行を実現。スピーディモード(Sモード)とクオリティモード(Qモード)の2つのモードを導入し、効率性とベンチマーク性能をバランスさせる。大規模な強化学習フレームワークを用いることで、推論の精度と指示への忠実度を向上。LLaDA2.1は、33のベンチマークで優れた性能を示し、コーディングタスクにおいても高いスループットを達成。 Comment
元ポスト:
公式ポスト:
解説:
[Paper Note] AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration, Jianhao Ruan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #KeyPoint Notes #LongHorizon #Adaptive #Orchestration #BudgetAllocation Issue Date: 2026-02-11 GPT Summary- 任意のエージェントを命令・コンテキスト・ツール・モデルのタプルとしてモデル化し、タスクの自動化を促進する統一されたフレームワークを提案。AOrchestraでは中央オーケストレーターがタプルを具体化し、専門的な実行者を生成。この設計により、エンジニアリング作業を削減しつつ、エージェントの多様性と性能を最適化。実験では、AOrchestraが競合モデルに対して16.28%の相対改善を達成。 Comment
元ポスト:
サブエージェントを生成するオーケストレータを学習し、動的に直面するタスクに適応したサブエージェント(適切なコンテキスト, 指示, ツール, モデル)[^1]を持つエージェントを構築し、実行を委譲することで、固定されたハーネスに依存せず、人間がエンジニアリングするコストも削減しながら、性能が向上する、という話に見える。
ベンチマークの性能向上が非常に大きく、効果的な手法であることが伺える。
[^1]: このようなサブエージェントのAbstractionを定義したのも貢献だと考えられる。
具体的な手法としては下記で、(a)オーケストレータエージェントがユーザからタスクを受け取り、サブタスクを解くためにサブエージェントを構築し委譲する。その後結果を受けとり状態を更新し、さらにサブエージェントを構築しタスクを委譲する、といった操作を繰り返す。(b)サブエージェントは(M, T, I, C)によって抽象化され、それぞれモデル、ツール、指示、コンテキストである。図中の(c)では自己教師あり学習が利用される旨が記述されているが、本文中ではSFTを使うと記述されているためここは齟齬があるように感じる(タイポも含まれている)。オーケストレーションのポイントは、タスクのオーケストレーションと、モデルのルーティングの二つの要素に分けられる。前者をSFTで学習し、後者はInstructionをiterativeに改善するプロセスで最適化する。
具体的には、オーケストレーションという特化したタスクを学習させるため、今回はexpertによる正解となる(T, I, C)を模倣できるように、SFTで学習する(GRPOのような手法でも学習できることについても言及されている点には注意)。
また、後者のモデルルーティングの最適化については、さまざまなモデルに対してInstructionを与え、得られたtrajectoryに対して性能とコストを計算し、これらを考慮してInstructionを更新することを繰り返すAutomatic Prompt Optimizationを採用している。これにより、コストと性能のパレート最適な構成を見つける。
[Paper Note] ViT-5: Vision Transformers for The Mid-2020s, Feng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #Architecture #Selected Papers/Blogs #Backbone #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- ViT-5は、ビジョントランスフォーマーの要素を体系的に洗練し、新世代のバックボーンを形成する。このアーキテクチャは、正規化や位置エンコーディングなどの進化を含み、広範な実験で従来の最先端を上回る性能を示した。ImageNet-1k分類では84.2%のトップ-1精度を達成し、生成モデリングでも優れたFIDを記録。改善された表現学習と空間推論により、タスク間の移行が安定し、現代のファンデーションモデルに適したシンプルなアップグレードを提供する。 Comment
元ポスト:
ModernBERTと同じ動機で、ViTに現代的な様々なアーキテクチャ上の工夫を入れたものをシステマチックに調査し、最適な組み合わせを見つけ性能向上したという話に見える。
[Paper Note] SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization, Jiarui Yuan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #ReinforcementLearning #Evaluation #SelfImprovement #PostTraining #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment
元ポスト:
関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。
APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。
[Paper Note] When RL Meets Adaptive Speculative Training: A Unified Training-Serving System, Junxiong Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Decoding #SpeculativeDecoding Issue Date: 2026-02-09 GPT Summary- Auroraは、ライブ推論トレースから直接投機的デコーディング学習を行う統一システムを提案。オンラインでの学習を非同期強化学習問題として再定義し、受け入れられたトークンからフィードバックを得てサンプル効率を向上。デイ0での展開をサポートし、迅速な適応と即時のユーティリティフィードバックを提供。実験では、フロンティアモデルに対して1.5倍の速度向上を実現し、静的な投機者にも1.25倍の向上を見せた。 Comment
元ポスト:
公式アナウンス:
[Paper Note] Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning, Yu-Ang Lee+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Evaluation #Coding #Mathematics #PEFT(Adaptor/LoRA) #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-02-09 GPT Summary- LoRAのバリエーションを広範なハイパーパラメータ探索で再評価。異なるLoRA方法は独自の学習率範囲を好み、適切調整で全体的に同様のピーク性能を達成。バニラLoRAは競争力のあるベースラインで、以前の改善は一貫性を欠く可能性あり。最適な学習率範囲の違いはヘッセ行列の固有値の変動に起因。 Comment
元ポスト:
LoRAに関連して様々な手法が提案されているが、様々なモデルスケールとコーディングと数学ドメインで広範な設定(バッチサイズや学習率)で実験して主要な手法を再評価したところ、LoRAは学習率にsensitiveで、依然として初期のLoRAが強力な手法であることが示された。過去の研究での比較実験はハイパーパラメータの調整不足な可能性が高いことを示唆している。重要研究。
なお、Table2にLoRAの変種に関する研究のリストがあるが、約50種類ある。
[Paper Note] Learning to summarize user information for personalized reinforcement learning from human feedback, Hyunji Nam+, ICLR'26, 2025.07
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #Alignment #ReinforcementLearning #Personalization #In-ContextLearning #ICLR Issue Date: 2026-02-08 GPT Summary- 新しいLLMアシスタントでの応答のパーソナライズを目指し、「要約を用いた好み学習(PLUS)」フレームワークを提案。これにより、各ユーザーの特徴や過去の対話に基づいた要約を生成し、個々の好みに沿った報酬モデルを条件付ける。PLUSは、ユーザー要約モデルと報酬モデルを同時に訓練し、精度向上を実現。新しいユーザーやトピックに対する堅牢性や、独自モデルによる強化されたパーソナライズ能力を示し、ユーザーの解釈可能な表現を提供することで透明性を高める。 Comment
pj page: https://sites.google.com/stanford.edu/plus/home
元ポスト:
[Paper Note] Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents, Zhihan Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #CrossDomain #Generalization #KeyPoint Notes #DomainGap #Initial Impression Notes Issue Date: 2026-02-08 GPT Summary- 一般化されたLLMエージェントのポストトレーニングにおける課題を調査。特に、強化学習環境の特性がアウトオブドメイン性能に与える影響を分析。状態情報の豊富さとプランニングの複雑さがクロスドメインの一般化に強く相関し、リアリズムやテキスト類似性は主要な要因ではないことを発見。状態情報を増やすことでロバスト性を向上可能で、ランダム化技術を提案。また、モデリング選択として、SFTのウォームアップが忘却を防ぐが一般化を損なう可能性や、ステップ・バイ・ステップ思考が一般化に重要な役割を果たすことを示した。 Comment
元ポスト:
事後学習におけるクロスドメインの汎化性能に関する調査を行い、ドメインの表層的な情報ではなく、
- 状態情報の豊富さ(どれだけのテキストを処理する必要があるか; 認知コスト)
- 推論の複雑さ(long-horizonやゴールへの到達可能性)
がドメイン間の汎化に相関を示すことが明らかになり、要は構造の複雑さが鍵であることが分かった。
ドメイン間の汎化性能を改善するために、実タスクは変えずにobservationに対して少量のノイズを加えることで、モデルがノイズから重要なシグナルを抽出することを学習し汎化性能が向上。
RLを行う際の注意点として、
- mid-trainingはDataMixに含まれるドメインの知識を補充するが、カバーされていないドメインの忘却をより悪化させる可能性があり
- ステップ単位での推論が汎化性能向上に役ダウン(言い換えると、ショートカットは転移しない)
を挙げており、
デプロイされるドメインが不明な場合の実用的な対策として
- より状態の記述がリッチなドメインかつ複雑な推論を要する環境で学習し
- 明示的な推論をオンにし
- 軽量な状態情報へのノイズの注入や拡張をすふこと
を挙げている。
さらにざっくり言うとエンコード時にドメインの表層情報に依存させず、表層情報の中から必要な情報を抽出するスキルをモデルに学習させ、かつデコーディング時は精緻な推論によって誤った転移を防ぐのがドメイン間の汎化の鍵、という話に感じる。
[Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Tools #NLP #LanguageModel #LLM-as-a-Judge #PostTraining #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #ChunkyPostTraining Issue Date: 2026-02-06 GPT Summary- LLMのポストトレーニングでは、偶発的なパターンがモデルに影響を及ぼし、意図しない行動を引き起こすことがある。これを「チャンクポストトレーニング」と呼び、特定の質問形式に対して虚偽の相関が現れる理由を探るため、「SURF」というブラックボックスパイプラインと、「TURF」という追跡ツールを提案。これらのツールを用いて、フロンティアモデルやオープンモデルでの誤校正された行動の生成を示し、ポストトレーニングデータの不均衡が影響していることを明らかにした。 Comment
元ポスト:
事後学習データは特定の行動を学習することを意図して作成されるが、離散的なチャンクの集合として学習したときに、それらに意図しない特徴に基づく相関が含まれ(たとえば、コーディングのデータセットに不自然に形式的な表現が含まれたときに、モデルがそのような表現が用いられた時はコーディングの指示だと学習してしまうなど)、モデルがそれを学習してしまうこと(= Chunky PostTraining)を提唱し、これによって生じる失敗モードの実例として、Haiku 4.5j「5+8=13ですか?」と質問した際に「いいえ、5+8=13は正しくありません。正しい答えは5+8=13です」と応答するような例を挙げている。これはモデルが明らかに正しい答えを知っているが、プロンプト中の何らかの特徴によって反論的な振る舞いが引き起こされているような例であり、こういった失敗を発見するための手法を提案している。
手法としては、失敗モードを評価するためのルーブリックと、promptに関するAttributeの集合(e.g. これは車に関する質問である, これはロシア語であるなど)を定義し、attributeのプールからサンプリングをして失敗モードを引き起こすクエリの候補を自動生成する。その後LLMに対してクエリを投げて得られた応答をルーブリックに基づいてLLM-as-a-Judgeによってスコアリングし、TopKのサンプルを残しリプレイバッファ[^1]を更新する。更新されたリプレイバッファを用いてAttributeの重みを更新し、よりスコアが高いAttributeに基づいてクエリ候補が生成されるようにし、再度クエリ生成をして同様の操作をするよう繰り返す、といった手法のようである。
LLMを完全にブラックボックスとして扱い、応答テキストにのみに基づいて実行されるため、proprietary LLMに対しても実行可能である。
[^1]: リプレイバッファは、個々の(クエリ, スコア, attribute, スコア)の4つ組の集合によって定義される。
所見:
[Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #Selected Papers/Blogs #Stability #KeyPoint Notes #train-inference-mismatch Issue Date: 2026-02-06 GPT Summary- 強化学習におけるPPOの限界を指摘し、低確率トークンの更新が過剰に罰せられる問題を解決するため、ダイバージェンス近似ポリシー最適化(DPPO)を提案。DPPOは、ポリシーの逸脱を直接推定することで学習ダイナミクスの非最適性を改善し、効率的なバイナリおよびトップK近似を導入することでトレーニングの安定性と効率を向上させる。 Comment
元ポスト:
PPOはトークン単位の確率比をrefと現在のポリシーからの算出しrefから離れすぎないようにクリッピングをするが、この場合非常に低確率で出現するトークンは過剰にクリッピングされる傾向にある。しかしその低確率トークンを調べると実はReasoningにおいて重要なトークンであったり(Wait, Thus, Next)、数学での重要なシンボル(+,-,=)、数値トークンであり、結果的にこれらReasoning系のタスクで重要なトークンの学習を阻害してしまっており(実際にこれらの低確率トークンをクリッピングされないようにしたら学習効率が大幅に改善)、語彙数が多いLLMの学習においては相性が悪い(別の視点として高確率トークンに対して過剰にペナルティを与えるという傾向もある)。これを改善するために、確率比をクリッピングするのではなく、ポリシーとrefのDivergenceの上界を直接制約することで解決し(語彙数が大きすぎてDivergenceを計算できないので近似的な計算方法も提案されている模様)、実際に適用すると学習が非常に安定し、かつ学習効率が既存手法と比較して高まりました、という話にみえる。
解説:
一言解説:
400B級のモデルの事後学習で、
- エントロピー崩壊を防ぎ
- より高速で安定して収束し
- context長の外挿に強い
ことが確認されたとの報告がある。
- Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
[Paper Note] ERNIE 5.0 Technical Report, Haifeng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Speech #Proprietary #MoE(Mixture-of-Experts) #Selected Papers/Blogs #2D (Image) #UMM #3D (Video) #Omni #text #Initial Impression Notes Issue Date: 2026-02-06 GPT Summary- ERNIE 5.0は、テキスト、画像、ビデオ、音声に対応したマルチモーダル理解と生成のための基盤モデルです。超スパースな専門家の混合アーキテクチャを使用し、依存しないルーティングでトークン予測を行います。新たなトレーニングパラダイムにより、モデルは性能、サイズ、推論レイテンシを柔軟に調整可能です。幅広い実験において、ERNIE 5.0は複数のモダリティで優れた性能を示し、初の商用規模の兆パラメータモデルとして注目されています。 Comment
元ポスト:
リリース時の公式ポスト:
あくまでskim readingをして得た印象なのだが、非常に興味深い研究で、Omniモダリティを超大規模モデルでスクラッチからUnified Multimodal Modelとして学習し、MoEで効率的に推論するというアーキテクチャと手法に見え(個人的にこういう手法でやったらどうなるのだろう?と思っていたドンピシャな設定)、各種ベンチマークの性能指標を見ると多くの指標で全体的に良いスコアを達成しており様々なタスクを高性能で実現できる一方、特定の分野のベンチマークでGemini Pro 3の方が強い面が多く(たとえばテキストモダリティのstem, coding, vision全般, ASR全般)、Omniモダリティの統合は一筋縄ではいかず、どのようにモダリティを統合し、学習することが効果的なのか?という根源的な問いがあらためて思い浮かぶ。
Ming Omniでも同様のことがやられていた:
- [Paper Note] Ming-Omni: A Unified Multimodal Model for Perception and Generation, Inclusion AI+, arXiv'25, 2025.06
[Paper Note] Universal One-third Time Scaling in Learning Peaked Distributions, Yizhou Liu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Scaling Laws #Selected Papers/Blogs #KeyPoint Notes #Scalability #Physics Issue Date: 2026-02-05 GPT Summary- LLMのトレーニングは計算コストが高く、これはソフトマックスとクロスエントロピーの影響でべき法則的に収束する損失に起因する可能性がある。おもちゃモデルと実証的評価を通じて、この挙動が次トークン分布のピークから生じることを示し、損失のべき法則的なスケーリングが指数$1/3$で発生することを明らかにした。これにより、LLMトレーニングの効率向上に関する新たな方向性が示唆される。 Comment
元ポスト:
LLMの事前学習によって学習時間とlossの関係性において、冪乗則に従ったscaling lawsが出現するのはデータの分布起因ではなく、softmax+cross
entropyによる目的関数に起因しているという主張のようで、特にnext token predictionのようなエントロピーが低い分布(特定のトークンだけがピークを持つ分布)にfittingすると、分布の非線形性によって、冪乗則で消失する勾配と損失が生じ、結果的に1/3を指数として持つ冪乗則が出現するといった感じの話らしい。
[Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #ReinforcementLearning #AIAgents #Reasoning #PostTraining #RLVR #Selected Papers/Blogs #OOD #Generalization #KeyPoint Notes #LongHorizon #Robustness #Compression #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 大規模言語モデル(LLM)は、テスト時の適応能力により複雑な問題を解決する外挿特性を持つが、標準的な強化学習(RL)はその変化に制約がある。これに対処するために、反復デコーディングアルゴリズム(RC)を導入し、LLMの応答生成能力を活用して推論を継続的に改善。実験では、16kトークンの訓練で4BモデルがHMMT 2025でのパフォーマンスを40%から約70%に引き上げ、既存のモデルを上回る結果を示した。RCを使用したモデルは、学習した要約生成能力によりテスト時のパフォーマンスも向上できることが証明された。 Comment
元ポスト:
reasoningの生成と、生成されたreasoningとinputで条件付けでsummaryを生成、さらにinputとsummaryで条件付けてreasoningを生成するという、生成と要約を反復する枠組みを採用(LLMはreasoningを要約することが生成するよりも得意で、かつ過去の要約から将来の推論を生成できるという非対称性を活用)することで、訓練時の予算は決まっているため、訓練時の予算では到達できないhorizonにテスト時に遭遇すると汎化しない課題を克服し、テスト時により長いステップ数の推論もこなせるように外挿する。また、このようなgeneration-summaryの反復を各ステップごとでRLVRすることでさらに性能を向上でき、実際にlong horizonな推論や学習時よりもより長いreasoning token budgetの場合に大きなgainを獲得できている。
RLVRをする際に各ステップごとのSummaryを保存しておき、各ステップのsummaryが与えられたときに正解できるかどうかのシグナルに基づいて、ステップごとの要約で条件付けられた応答能力を改善する。これにより、さまざまなステップで応答を生成する能力が強化され、結果的にshort horizonからlong horizonの推論をする能力が強化される。
このときsummaryはリプレイバッファとして扱い後のepochの訓練でもオフポリシーデータとして活用する。要約はinputに条件付けられて生成されるものであり、optimizationのtargetとは異なるためリプレイバッファとして活用でき、かつさまざまな要約に対して正解が生成できるように学習されるためテスト時の要約の分布のシフトにロバストになる。また、オンポリシーデータだけだと、long horizonに対する要約は非常に稀になるため、リプレイバッファを利用することで補う。
テスト時に学習時を超えたhorizonで推論できることは現在のAIエージェントの大きな課題だと思うので非常に興味深い研究だと思う。
[Paper Note] Generative Modeling via Drifting, Mingyang Deng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #MachineLearning #GenerativeAI #Architecture #Selected Papers/Blogs #Reference Collection Issue Date: 2026-02-05 GPT Summary- ドリフティングモデルを提案し、プッシュフォワード分布を進化させることで、自然なワンステップ推論を可能に。サンプルの動きを制御するドリフティングフィールドを導入し、効率的なトレーニングを実現。ImageNetでの実験では、最先端のFID値を達成し、高品質な生成の新たな可能性を示す。 Comment
元ポスト:
所見:
pj page: https://lambertae.github.io/projects/drifting/
ポイント解説:
解説:
[Paper Note] Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text, Ximing Lu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #PostTraining #RLVR #Selected Papers/Blogs #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- RLVRはLLMの推論を解きほぐす基盤だが、検証データの不足がスケールアップのボトルネックとなっている。この課題を克服するために「ゴールデン・グース」を提案し、インターネットの非検証テキストから無限のRLVRタスクを生成する。具体的には、LLMに主要な推論ステップを特定させ、豊富なタスクを持つGooseReason-0.7Mデータセットを合成。これにより、従来モデルを復活させ、15のベンチマークで新たな最先端結果を達成。また、リアルなサイバーセキュリティデータからRLVRタスクを合成し、Qwen3-4B-Instructをトレーニング。これにより7Bモデルを超える成果を上げ、推論に富んだインターネットテキストを活用する可能性を示している。 Comment
元ポスト:
テキストからMultiple Choice Question (MCQ) を生成することでRLVR用のverifiableな学習データを大量に合成可能にする。おそらく次のステップとしては、生成されるMCQの stem, key, distractor の質が今度は焦点となり、そこの質が改善されればより大きなgainを得られるようになる気がする(たとえば消去法で正解を知らなくても正解できてしまうようなdistractorや、問題文に正解がそのまま含まれてしまっているようなノイジーなMCQから人間が何も学ばないように、モデルが学習するときと一緒だと思われる)。
データとモデルが公開:
[Paper Note] Synthesizing scientific literature with retrieval-augmented language models, Asai+, Nature'26, 2026.02
Paper/Blog Link My Issue
#Citations #InformationRetrieval #NLP #Dataset #LanguageModel #QuestionAnswering #Evaluation #RAG(RetrievalAugmentedGeneration) #ScientificDiscovery #Selected Papers/Blogs #Science Issue Date: 2026-02-05 Comment
元ポスト:
QAに対して専門家と同等のcitationに対するgrounding性能を達成し、citationに基づいたanswer (literature) を8Bモデルで生成可能で、マルチドメインの評価データも作成しているとのこと
benchmark: https://github.com/AkariAsai/ScholarQABench
[Paper Note] World Action Models are Zero-shot Policies, Seonghyeon Ye+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Zero/Few/ManyShotPrompting #TransferLearning #OpenWeight #Selected Papers/Blogs #Generalization #Robotics #WorldModels #Backbone #3D (Video) #WorldActionModel Issue Date: 2026-02-05 GPT Summary- 最先端のVLAモデルは新環境での物理的動作の一般化に困難を抱えている。DreamZeroは、動画と行動を共同でモデル化するWorld Action Model(WAM)を導入し、物理的ダイナミクスを学習。これにより、繰り返しデモなしで多様なスキルを学び、タスクや環境への一般化を2倍以上向上。14Bの自己回帰型ビデオ拡散モデルがリアルタイム制御を実現。また、動画デモによって未見タスクの性能が42%以上改善され、少数ショットでの適応も可能に。 Comment
pj page: https://dreamzero0.github.io/
元ポスト:
[Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #RLVR #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-02-05 GPT Summary- 強化学習を用いてモデルを訓練する際、尤度の最大化ではなく低次近似を最適化する限界に触発され、最大尤度強化学習(MaxRL)を提案。これは、サンプリングされたデータから最大尤度を近似するためのフレームワークであり、得られた目的関数はシンプルで偏りのないポリシー勾配推定を可能にする。実験では、MaxRLが既存の手法を上回り、テスト時間効率を最大20倍向上。追加データや計算へのスケーラビリティも優れており、RL訓練を正確性に基づいて拡張するための有望なフレームワークであることを示した。 Comment
元ポスト:
著者ポスト:
pj page: https://zanette-labs.github.io/MaxRL/
skim readingしかできていないが、
微分不可能な生成がされbinaryの正誤が与えられるような条件下でモデルを最適化するときにxが与えられてyが正解である確率はimplicitな尤度を表している。この最適化問題を解くために現在はRLが利用されており、RLは正解の確率pを最大化するような定式化がされているが、最尤推定で定式化するとlog pで定式化をすることになり、これは根本的に異なる最適化となる。具体的には、RLはpass@1に対して最適化しているが、MaxRLはk=1,...∞に対するpass@kの調和平均に対して最適化をするような違いがある。この最尤推定の勾配は実は成功したtrajectoryのスコアの平均という非常にシンプルな形で近似的に求められるらしく、最尤推定として解くと最大20倍程度効率が向上した、といった話に見える。
関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
- [Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02
所見:
所見:
[Paper Note] An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence, Qizhen Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Scaling Laws #Selected Papers/Blogs #Stability #DataFiltering #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- ノイズデータがLLMの事前学習に与える影響を体系的に分析。合成ノイズを注入した実験で、ノイズがトレーニングロスの発散を引き起こすことを実証し、依存関係を特定。高学習率による発散とは異なるパターンも観察し、診断手法を提案。ノイズの影響に関する制御された洞察を提供。 Comment
元ポスト:
- [Paper Note] Spike No More: Stabilizing the Pre-training of Large Language Models, Sho Takase+, COLM'25
のようにアーキテクチャの改善によって学習の安定性を担保する取り組みもあるが、アーキテクチャ側で解決した場合にノイズはどのような影響を与えるのだろうか?
takeawayが論文中にQAの形でまとめられている。
[Paper Note] Expanding the Capabilities of Reinforcement Learning via Text Feedback, Yuda Song+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #TextualFeedback #SelfDistillation Issue Date: 2026-02-05 GPT Summary- テキストフィードバックを用いた強化学習(RL)によるLLMの後処理を研究。スカラー報酬に対し、テキストフィードバックはコストが低く、豊かな情報を提供。モデルはトレーニング時にフィードバックを内部化し、推論時にシングルターンの性能を向上させる。自己蒸留(RLTF-SD)とフィードバックモデリング(RLTF-FM)の2つの手法を提案し、さまざまなタスクでの効果を検証。結果は強力なベースラインを上回ることで、豊かな監視源としてのRLの可能性を示している。 Comment
pj page: https://rl-textfeedback.github.io/
元ポスト:
[Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Reasoning #SelfCorrection #ICLR #Selected Papers/Blogs #KeyPoint Notes #Rubric-based #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 言語モデル(LM)の自己改善能力を探るために、RefineBenchという1,000の問題と評価フレームワークを導入。二つの改善モード、ガイド付きと自己改善を評価した結果、最前線のLMは自己改善で低迷する一方、ガイド付き改善では特許LMや大規模オープンウエイトLMが迅速に応答を改善。自己改善には突破口が必要であり、RefineBenchが進捗の追跡に貢献することを示す。 Comment
元ポスト:
pj page: https://passing2961.github.io/refinebench-page/
verifiableはタスクだけでなくnon verifiableなタスクもベンチマークに含まれ、ガイド付き/無しの異なる設定、11種類の多様なドメイン、チェックリストベースのbinary classificationに基づく評価(strong LLMによって分類する; これによりnon verifiableなタスクでも評価可能)、マルチターンでの改善を観測できる、self-correction/refinementに関するベンチマーク。
フロンティアモデルでも自己改善はガイド無しの場合ではあまり有効に機能しないことを明らかにし、外部からガイドが与えられればOpenLLMでさえも少ないターン数で完璧に近い方向にrefineされる、という感じの内容に見える。
つまり自身とは異なるモデルで、何らかの素晴らしい批評家がいれば、あるいは取り組みたいタスクにおいて一般化された厳密性のあるチェックリストがあれば、レスポンスはiterationを繰り返すごとに改善していくことになる。
[Paper Note] SWE-Universe: Scale Real-World Verifiable Environments to Millions, Mouxiang Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #SyntheticData #Coding #MultiLingual #SoftwareEngineering #mid-training #PostTraining #Selected Papers/Blogs #Verification #Scalability Issue Date: 2026-02-05 GPT Summary- SWE-Universeは、GitHubのプルリクエストから自動的に検証可能なソフトウェア工学環境を構築するためのスケーラブルなフレームワーク。カスタムトレーニングされたビルディングエージェントが反復自己検証とハッキング検出を用いて信頼性の高いタスク生成を実現。これにより、実世界の多言語SWE環境が100万以上増加し、Qwen3-Max-Thinkingにおいて75.3%のスコアを達成。次世代コーディングエージェントの発展に寄与。 Comment
元ポスト:
ポイント解説:
これまでと比較して非常に大規模な実PRに基づいた、さまざまなプログラミング言語に基づくverifiableな学習用の合成データを構築できる環境で、一つ一つの品質はSWE Benchなどには及ばないが、量が圧倒的
[Paper Note] A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training, Zihan Qiu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Normalization #AttentionSinks #Stability #One-Line Notes Issue Date: 2026-02-03 GPT Summary- 大規模言語モデルにおける外れ値の機能を調査し、注意の沈みと残差の沈みのメカニズムを明らかにする。外れ値は正規化と共に機能し、再スケーリングを通じてトレーニングの安定性を向上させ、パフォーマンスを改善。これにより、外れ値が寄与者ではなく再スケール要因であることを示し、学習可能なパラメータとの関係性を明らかにした。 Comment
元ポスト:
Attention Sinksにならい、Residual Sinksと命名されている
Attention Sinksや本研究で命名されているResidual Sinks(activationの特定の次元がほとんどのトークンで過剰に大きくなる現象)は正規化を排除するとなくなり(i.e., 正規化とセットで出現する)、これらがなくなると学習の安定性と性能が低下する。これらはTransformerアーキテクチャ内の外れ値として見ることができるが、この外れ値が存在することによってnormalizationにおいてrescalingが実施され安定性やパフォーマンスが向上している、という感じらしい。
[Paper Note] GLM-OCR Technical Report, Shuaiqi Duan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #OpenWeight #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- GLM-OCRは、0.9Bパラメータの多模态モデルで、実世界の文書理解に最適化されている。CogViT視覚エンコーダとGLM言語デコーダを組み合わせ、計算効率と性能のバランスを高めている。Multi-Token Prediction (MTP)メカニズムにより、OCRタスクのデコード効率が向上し、低メモリオーバーヘッドを実現。二段階パイプラインでレイアウト分析と認識を行い、公開ベンチマークで競争力のある性能を達成。リソース制約のある環境でも適用可能な設計。 Comment
元ポスト:
GLMのOCRがリリース。DeepSeekもOCRをリリースしているが、tokenを圧縮する目的や、モデルの学習データを担保する目的などで最終目的としては自分たちのモデルの強化に必要であり、その道中での副産物としてリリースしているのだろうか。それとも、OCRタスクの需要がシンプルに高いからリリースしているのだろうか。
公式ポスト:
関連:
- [Paper Note] LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR, Said Taghadouini+, arXiv'26, 2026.01
- olmOCR 2: Unit test rewards for document OCR, Ai2, 2025.10
- DeepSeek-OCR: Contexts Optical Compression, DeepSeek, 2025.10
- DeepSeek-OCR-2, DeepSeek-AI, 2026.01
[Paper Note] Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training, Shengrui Li+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #ModelMerge #DataMixture Issue Date: 2026-02-03 GPT Summary- データミクスの最適化はLLMの事前学習において重要であるが、効果的な探索手法が不足している。本研究では、訓練からデータミクス探索を切り離す「DeMix」を提案し、統合モデルを通じて最適なデータ比率を予測する。広範な実験により、DeMixは探索コストを抑えつつ高い性能を実現する。また、検証済みのミクスを含む22兆トークンのデータセット「DeMix Corpora」を公開。 Comment
元ポスト:
関連:
- [Paper Note] RegMix: Data Mixture as Regression for Language Model Pre-training, Qian Liu+, ICLR'25
[Paper Note] DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation, Haozhe Xie+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Dataset #Evaluation #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #One-Line Notes #Manipulation Issue Date: 2026-01-31 GPT Summary- 動的オブジェクト操作に挑む「DynamicVLA」フレームワークを提案。畳み込み視覚エンコーダで迅速なマルチモーダル推論を実現し、連続推論で迅速な適応を促進。潜在認識アクションストリーミングにより認識と実行のギャップを埋める。新たに構築したDOMベンチマークで動的操作データを収集し、評価によって顕著な性能向上を示す。 Comment
pj page: https://www.infinitescript.com/project/dynamic-vla/
元ポスト:
動くオブジェクト(Donamic Object)に関するデータセットとベンチマークに見える。
既存VLAではできないそこそこな速度で転がるピンポン玉などを正確に掴むことができるようなデモが掲載されている。興味深い。
コードとデータセットが公開:
[Paper Note] Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models, Zengbin Wang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #DiffusionModel #TextToImageGeneration #Selected Papers/Blogs #SpatialUnderstanding Issue Date: 2026-01-31 GPT Summary- T2Iモデルの空間処理能力を評価する新しいベンチマーク「SpatialGenEval」を提案。1,230の長い情報密度の高いプロンプトを用いて、空間関係の推論が主なボトleneckであることを確認。また、「SpatialT2I」データセットを構築し、ファインチューニングによって現実的な空間効果を向上させるデータ中心のアプローチを強調。 Comment
元ポスト:
[Paper Note] GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization, Chuanyang Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #Normalization Issue Date: 2026-01-30 GPT Summary- 正規化層の配置に関する問題をマニフォールド最適化の視点から再考し、フィードフォワードネットワークと注意層の出力を更新方向として解釈。新手法GeoNormを提案し、標準の正規化を測地線更新に置き換える。包括的な実験で既存手法を一貫して上回る性能を確認。GeoNormは標準Transformerへ簡易に統合可能で、追加コストがわずかでも性能向上を達成。 Comment
元ポスト:
[Paper Note] Shaping capabilities with token-level data filtering, Neil Rathi+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Safety #Toxicity #Selected Papers/Blogs #SparseAutoencoder Issue Date: 2026-01-30 GPT Summary- 事前学習段階での望ましくない能力の削減に焦点を当て、医療能力除去のためのトークンフィルタリングが効果的であることを示す。特に、トークンフィルタリングが文書フィルタリングよりも低コストで望ましくない能力に対する影響を減少させることを実証。大規模モデルでのフィルタリング効果を検証し、7000倍の計算遅延の引き起こしを明らかに。スパースオートエンコーダを用いたトークンラベリング手法と高品質な分類器の蒸留方法論を提案し、ノイズの多いラベルに対するフィルタリングのロバスト性を示す。 Comment
元ポスト:
[Paper Note] ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation, Zihao Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #LatentReasoning #Initial Impression Notes #Concept (LLM PreTraining) #Author Thread-Post Issue Date: 2026-01-30 GPT Summary- ConceptMoEは、トークン間の類似性を利用して計算リソースを動的に割り当てる新しい手法です。これにより、概念表現を生成し、計算集約モデルへのシーケンス圧縮を行います。評価において、ConceptMoEは標準的なMoEを上回り、言語や視覚言語タスクでの性能向上を示しました。特に、計算の効率も大幅に改善され、アーキテクチャの改変なしに既存のMoEに統合可能です。 Comment
著者ポスト:
論文タイトルにMoEというワードが入っているが、実際にMoEアーキテクチャを採用しているわけではない点に注意。アーキテクチャはいわゆるLarge Concept Model (エンコーダー→チャンク生成→コンセプトモデル→デチャンキング→デコーダー)であり、チャンクの境界がトークン間のlearnableなモジュールによって学習・決定されるため、トークンレベルで見たときに適応的にトークンをチャンク化することでコンセプトが定義され、かつトークン単位の計算資源の配分がチャンク化を(learnableに)通じて行われるという話に見える。
斜め読みしかできていないが、アーキテクチャそのものの貢献よりも、本研究の貢献として大きい部分はMoEモデルを用いた同じパラメータ/FLOPsでの異なるアーキテクチャ間のfair comparisonを通じてconcept modelの性能が高いことを示したことや、既存のMoEモデルを軽量なモジュールの追加(チャンクモジュール+デチャンクモジュール+追加のゼロで初期化されたQKV attention)し継続事前学習をすることでretrofittingすることでも性能が向上すること、計算効率がチャンクによってトークンが圧縮されるため、fair comparisonの上で高い性能を達成しながら、圧縮率Rに応じて向上することを示ししたこと、などにあるように見受けられる。
が、ただの斜め読みした感想でしかないので読みたい。
[Paper Note] Self-Improving Pretraining: using post-trained models to pretrain better models, Ellen Xiaoqing Tan+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SelfImprovement #mid-training #DPO #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-30 GPT Summary- 大規模言語モデルの安全性と品質を確保するための新しい事前学習法を提案。文書をストリームし、強化学習を用いて生成されたKトークンを改善。プロセス中、候補生成物を評価し、モデルの成長に応じて高品質な出力に報酬を与える。実験の結果、事実性と安全性でそれぞれ36.2%および18.5%の改善を達成し、生成品質も最大86.3%向上した。 Comment
元ポスト:
事前学習の枠組みがnext token predictionから変わるかもしれないような話。気になる。
v2へアップデート:
解説:
関連:
- [Paper Note] Deep reinforcement learning from human preferences, Paul Christiano+, NIPS'17, 2017.06
- [Paper Note] Direct Preference Optimization: Your Language Model is Secretly a Reward Model, Rafael Rafailov+, arXiv'23, 2023.05
[Paper Note] WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World, Ao Liang+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #CVPR #Selected Papers/Blogs #WorldModels #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-01-30 GPT Summary- 生成的世界モデルはリアルな4D環境を合成しますが、物理的または行動的に失敗することが多いです。この課題に対処するため、WorldLensを導入し、生成された世界の評価を行う全範囲ベンチマークを提供します。これには生成、再構成、行動追従など五つの側面が含まれ、視覚的現実性や物理的妥当性を評価します。既存モデルには広範囲に優れたものがなく、WorldLens-26Kという大規模な人間注釈付きデータセットを構築し、評価モデルWorldLens-Agentを開発しました。これにより、世界の忠実性を測定する統一されたエコシステムを形成し、リアルな見た目と行動の両面で評価基準を標準化します。 Comment
pj page: https://worldbench.github.io/worldlens
元ポスト:
github: https://github.com/worldbench/WorldLens
(自動運転に関する)World Model(には限られないかもしれないが)を多角的な軸から評価できるベンチマーク。3D object detection/Tracking, Novel-view Discrepancy/Quality, Occupacy Prediction, Subject Fidelity/Consistency/Coherence, Temporal Concistencyなど、20以上のdimensionから評価可能なようである。
著者ポスト:
[Paper Note] Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning, Zeyu Xing+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Selected Papers/Blogs #KV Cache #DownstreamTasks #Adaptive #Initial Impression Notes #SelfVerification Issue Date: 2026-01-30 GPT Summary- KVキャッシュを文脈情報の軽量な表現として再利用し、再計算や保存の必要を排除。KV由来の表現は、(i)チェーン・オブ・エンベディングで競争力のある性能を発揮し、(ii)ファスト/スロー思考切替でトークン生成を最大5.7倍削減する一方、精度損失を最小限に抑える。これにより、KVキャッシュがLLM推論における表現再利用の新たな基盤となることを示す。 Comment
元ポスト:
KV Cacheを軽量なhidden stateを表すembeddingとして扱うことで色々と応用できます、という話に見え、たとえばデコーディングの途中でhallucinationをdetectする際により省メモリで実現できたり、fast/d slowなthinkingの切り替えの制御に利用するなど、単に次トークンを生成する際の高速化の用途を超えて使うという興味深い発想な研究に見える。
[Paper Note] Scaling Embeddings Outperforms Scaling Experts in Language Models, Hong Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Transformer #AIAgents #LongContext #Architecture #MoE(Mixture-of-Experts) #Selected Papers/Blogs Issue Date: 2026-01-30 GPT Summary- 本研究では、Mixture-of-Experts(MoE)アーキテクチャに代わる埋め込みスケーリングを検討し、その効果を体系的に分析。埋め込みスケーリングは専門家スケーリングよりも優れたパレートフロンティアを達成し、推論速度が向上することを示す。68.5BパラメータのLongCat-Flash-Liteモデルを導入し、約3Bのパラメータでトレーニングを行った結果、既存のMoEベースラインを超える性能を発揮。特にエージェント的およびコーディングの分野で競争力が示される。 Comment
HF: https://huggingface.co/meituan-longcat/LongCat-Flash-Lite
元ポスト:
N-Gram Embeddingを用いることでMoEアーキテクチャの同等程度のモデルと比較してより高い性能を獲得しているように見える。NGramの各NごとにルックアップテーブルとProtectionのための重みを学習して最終的にAveragingをすることでContext Vectorを生成している、ようなアーキテクチャに見える。non-thinkingモデル
先行研究:
- [Paper Note] Scaling Embedding Layers in Language Models, Da Yu+, NeurIPS'25, 2025.02
[Paper Note] Self-Distillation Enables Continual Learning, Idan Shenfeld+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #In-ContextLearning #Distillation #Catastrophic Forgetting #Selected Papers/Blogs #On-Policy #One-Line Notes #ContinualLearning #SelfDistillation #Author Thread-Post Issue Date: 2026-01-29 GPT Summary- 自己蒸留ファインチューニング(SDFT)は、デモンストレーションからオンポリシー学習を可能にし、従来の手法を上回って新しいスキルを獲得しつつ既存の能力を維持。文脈内学習を活かし、壊滅的忘却を削減しながら複数のスキルを時間と共に蓄積するモデルを実現。 Comment
元ポスト:
著者ポスト:
現在のポリシーにおいてクエリ q とexpertによるdemonstraction c によってポリシーを条件づけたモデルを教師モデルとみなし、現在のポリシーにおいてクエリだけで条件付けたモデル生徒モデルとした時に、教師モデルの分布と生徒モデルの分布のreverse KL Divergenceが最小化されるように生徒モデルを学習する((式1))。すなわち、次のポリシーの更新に対する学習シグナルを得るためにモデルのIn-Context Learningを活用している。
上記の見方はstudent-teacherにおける蒸留という観点で見た場合だが、TRPOに基づく定式化からスタートして、expertが作成したdemonstrationによって導出されるimplicitなreward functionを最大化するInverse Reinforcement Learningとして解釈し、式変形を繰り返していくと、前述のICLによる勾配と、オンポリシーRLでのポリシー最適化による勾配が一致する(式2, 式6)。
ポイント解説:
[Paper Note] Post-LayerNorm Is Back: Stable, ExpressivE, and Deep, Chen Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Transformer #Architecture #Normalization #Stability #ResidualStream Issue Date: 2026-01-29 GPT Summary- LLMのスケーリングには限界があり、モデルの大きさやコンテキスト長の延長が表現力を向上させない一方、深さのスケーリングは有望だが訓練の安定性に課題がある。本研究では、Post-LayerNormの問題を再検討し、残差経路をハイウェイスタイルの接続に置き換えた「Keel」トランスフォーマーを提案。これにより勾配消失を防ぎ、1000層以上でも安定した訓練を可能にし、Pre-LNよりも性能を向上させる。Keelは、今後の深層アーキテクチャ構築の新たな基盤を提供する。 Comment
元ポスト:
PostLNと言えばOlmo 2:
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
1000 layerを超えるネットワークを安定して学習、、だと、、
関連:
- [Paper Note] 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities, Wang+, NeurIPS'25 Best Paper Awards
[Paper Note] Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability, Shobhita Sundaram+, ICML'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #ICML #PostTraining #CurriculumLearning #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-01-27 GPT Summary- LLMは解決困難な問題のために自動カリキュラムを生成可能か?SOARという自己改善フレームワークを通じ、教師が学生のために問題を提案し、進捗に基づいて報酬を提供。研究では、バイレベルmeta-RLが学習を促進し、計測された報酬が内在的報酬を上回ることを示し、構造的品質が解答の正確性よりも学習において重要であることを明らかにした。これにより、困難な問題解決において事前の能力が不要であることが示唆された。 Comment
元ポスト:
著者ポスト:
pj page: https://ssundaram21.github.io/soar/
[Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Blog #OpenWeight #mid-training #PostTraining #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #Initial Impression Notes #ContextFolding Issue Date: 2026-01-27 GPT Summary- Kimi K2.5は、テキストとビジョンの共同最適化を重視するオープンソースのマルチモーダルエージェンティックモデルです。共同プリアトレーニングや強化学習を用いて、エージェントが複雑なタスクをサブ問題に分解し同時に実行するAgent Swarmを導入。評価結果では、コーディングや推論タスクで最先端の成果を達成し、最大4.5倍のレイテンシ低減を実証しました。Kimi K2.5モデルのチェックポイントは、今後の研究や応用に活用可能です。 Comment
HF: https://huggingface.co/moonshotai/Kimi-K2.5
元ポスト:
テクニカルレポートを受けての所見:
Agenticなタスク(HLE, BrowsingによるQA, DeepSearch)に関するベンチでGPT-5.2(xhigh)などを超えてSoTAを達成。他のタスクではcodingではClaude-4.5-Opusの方が上、image関連のタスクではGemini 3 Proに軍配が上がっている。VideoではGeminiとcomparableという感じだろうか(GeminiはLong Contextに非常に強い印象があるがLongVideoBenchて上回っている)。この辺は各タスクごとに強いモデルの棲み分けが進んできた。
また、Kimi K2.5非常に美麗でinteractiveなフロントエンドのデモが掲載されている。
Agent Swarmは、タスクをサブタスクに分解して、複数のエージェントに並列に投げて実行(最大100 sub agent)できるような枠組みであり、それらが高性能かつ低latencyとなるように訓練れている模様。これにより性能を向上させつつlatencyを80%削減しているとのこと。
この話はContext Foldingに近い話と推察される:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
によると、AgentSwarmはサブタスクを実施するエージェントのパラメータはfreezeし、サブエージェントを作成し、その結果を集約する処理をOrchestratorと呼ばれるlearnableなモジュールが担っており、サブエージェントからの結果はある種環境からの観測結果として扱われ、タスクの成否はOrchestratorのみに委ねられているようである。
Context Foldingは、Context Managerとポリシーが同時にFoldGRPOを通じて学習されており、エージェントそのものがサブタスク実行、結果を受け取り圧縮、メインブランチに加えるという能力をContext Managerと協調しながら実施することを学習している点が異なるように感じる。
また、並列実行したCritical Stepと呼ばれる、各サブエージェントの最大ステップ数に関する指標が導入され、これらCritical Stepをすべてのステップで集約し、特定のサブエージェントにworkloadが集中しないようにOrchestratorが調整されるとのこと。
公式ポスト:
OpenWeightモデルの中でソフトウェアエンジニアリングスキルでSoTA:
日本語でのポスト:
ポイント解説:
- How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
[Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-01-27 GPT Summary- PrefixRLは古いサンプリングデータを活用し、オフポリシーの不安定性を回避しつつ、オンポリシーでの強化学習を行う手法です。これにより、学習信号が強化され、従来のRLよりもサンプル効率が向上。また、PrefixRLは難しい推論問題において、より早く同等のトレーニング報酬を達成し、他のモデルファミリーに対しても適応可能であることを示しています。 Comment
元ポスト:
同じタイミングで上記POPEが提案された。POPEは人間が記述したオラクルを接頭辞として使い、ポリシーの方向性をガイドすることでアシストするが、こちらのReuse your FLOPsは過去のロールアウトで成功したtrajectoryを再利用して接頭辞として利用する点が異なるように見える。
著者ポスト:
[Paper Note] Endless Terminals: Scaling RL Environments for Terminal Agents, Kanishk Gandhi+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Diversity #Selected Papers/Blogs #One-Line Notes #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-01-26 GPT Summary- 自己改善エージェントのボトルネックである環境を改善するため、無人アノテーションで端末利用タスクを生成する「Endless Terminals」パイプラインを提案。タスク記述の生成から可解性のフィルタリングまでの4ステージを経て、3255のタスクを作成。PPOを用いて訓練したモデルは、ホールドアウト開発セットで大幅な性能向上を示し、Llama-3.2-3Bは4.0%から18.2%、Qwen2.5-7Bは10.7%から53.3%に改善。人間キュレーションのベンチマークでも改善し、シンプルな強化学習がスケールする環境で成功することを示す。 Comment
元ポスト:
taskが解けるものか否かをverifyする追加のモデルが必要な点は注意とのこと。
(論文中ではo3が用いられている)
著者ポスト:
RLにおけるターミナル上で実行可能な多様なタスクと、実際に動作可能なコンテナ、テストの生成をスケールさせることで標準的なPPOで性能が向上し、人間が収集した既存ベンチマーク(Terminal Bench 2.0)にも汎化することを示した研究。つまり、RLのタスクと環境をスケールさせれば標準的なRLアルゴリズムでも性能が向上するというメッセージがある。
本研究の他研究との位置付けがぱっと脳内で整理できなかったので、関連研究の部分を読むと、
- AgentのScaffoldの観点では、bashが実行可能なOpenHandsに近く、シェルコマンドを実行し、実行に至るまでのすべてのヒストリと出力が利用可能。
- SFTのための高品質なデータを合成するる研究が最近は多いが、SFTはRLのためのWarmUpに相当するため、本研究とそれらの研究は補完的な位置付けにある。
- ベンチマークやインタラクティブな研究の観点では、SWEBenchやTerminal Bench 2.0のように、人間が収集したベンチマークが存在し、マルチターンでアクションを通じてインタラクションしながら次のアクションを決めていく。本研究もシェル上で状態を観測しながら次のアクションを決めていくようなマルチターンの枠組みに相当する。
- verifiableな環境を合成する研究も行われている。たとえばSWEGymは2438のpythonコードのタスクと検証可能なテストを提供するが、既存のGithub Issueに依存しており、本研究のようにボトムアップに手続的に生成されるものではない。シングルターンではself-playにより困難な問題を生成する研究があるがマルチターンではない。Open Thought Agentという研究がSFT, RLのためのターミナルを用いた環境を合成する点でもっとも本研究と近いが、人間が生成したクエリやコマンドに基づいており、かつ既存のTerminal Bench 2.0といった人間によって収集されたベンチマークでのgainは得られていない。本研究では、完全に自動化されており、任意のサイズにスケールしPPOのような標準的なRLでも既存ベンチマークに転移する点が異なる。
という整理のようである。位置付けは理解できたが、本研究が既存のベンチマークにも転移するのはなぜなのだろうか?という点がまだ理解できていない。
所見:
[Paper Note] Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning, Moo Jin Kim+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #PostTraining #Selected Papers/Blogs #Robotics #3D (Video) Issue Date: 2026-01-25 GPT Summary- 動画生成モデルを用いてロボットポリシーを単一のポストトレーニング段階で適応させる「Cosmos Policy」を提案。これにより、動画モデルがエンコードしたロボットアクションを直接生成し、複雑な行動を捉える。評価では、LIBEROとRoboCasaで最高のパフォーマンスを記録し、他のモデルを上回る成功率を達成。ポリシーのロールアウトデータを利用して、経験から学び世界モデルを洗練させることが可能。 Comment
元ポスト:
[Paper Note] Towards Execution-Grounded Automated AI Research, Chenglei Si+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #SelfImprovement #ScientificDiscovery #PostTraining #Selected Papers/Blogs #One-Line Notes #EvolutionaryAlgorithm #autoresearch/RSI Issue Date: 2026-01-24 GPT Summary- 自動化されたAI研究は科学的発見の加速に寄与するが、現在のLLMはしばしば効果的でないアイデアを生成。アイデア実装のための自動実行器を構築し、並行GPU実験を通じてその効果を検証。進化的探索と強化学習の2方法を分析し、前者はGRPOベースラインを上回るサンプル効率、後者は単純なアイデアに収束し上限を制限。実行に基づくAI研究の未来を探る。 Comment
アイデアを実行できる環境を与え、進化的な探索をRLと実行結果に基づくReward(ベンチマーク性能など)によって実施するような話で、実行結果に基づくRewardに基づいてRLすると、平均的にうまくいくように最適化され性能を最大化することに苦労する、といった知見が得られた、という趣旨の話が元ポストで記述されている。
best solutionを見つけるようにRLする研究がこちら:
- [Paper Note] Learning to Discover at Test Time, Mert Yuksekgonul+, arXiv'26, 2026.01
元ポスト:
所見:
[Paper Note] Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders, Shengbang Tong+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #DiffusionModel #TextToImageGeneration #PostTraining #Selected Papers/Blogs #2D (Image) #Stability #KeyPoint Notes #ImageSynthesis #Scalability #AutoEncoder #Author Thread-Post Issue Date: 2026-01-24 GPT Summary- RAEsは高次元セマンティック空間での成果を活かし、自由形式のテキストから画像生成にスケール可能かを検証。デコーダーを用いてImageNetを超えたスケールアップを行い、特定ドメインの重要性を発見。スケーリングによりフレームワークが単純化される一方、ノイズスケジューリングは依然重要。また、RAEsは全てのモデルスケールでVAEsを上回り、安定した性能を確保し、生成品質の向上を示した。これにより、多モーダルモデルの新たな可能性を切り開く。 Comment
元ポスト:
この研究はざっくり言うとRAE[^1]がスケールするか否かを調査し、スケールするための条件を調査し、事前学習(GenEval, DPGEvalでVAEと比較して4倍早く収束)、ダウンストリームタスクの双方でVAEベースのtext2imageモデルをoutperformすることを示しており、
スケールさせる際の最初の課題はデコーダにあり、web-scale, syntheticデータをただ増やすだけではfidelityは向上するが特定のドメイン(e.g., text reconstruction)の能力は伸びず、text renderingデータなどの、dataの構成が必要不可欠で、
続いてオリジナルのRAEではアーキテクチャに工夫(decoder入力にノイズを足す、ヘッドをwideにする、その他安定化の工夫)をしていたが、モデル、データがスケールした場合シンプルなアーキテクチャ(次元依存のノイズスケジューリング)のみが必須で他は不要となったという知見が得られており、
RAEでは視覚理解と生成が同じ潜在空間の上で行われることがVAEとは異なる強みで、生成のための学習をしても理解能力が損なわれないことを示し、そして、潜在空間上で(VAEの潜在表現は生成に特化しているが、RAEは視覚理解と生成の双方を扱われており同じ空間上で操作可能なので)LLMが直接test time scalingすることを可能にする、
と言ったことが著者ポストで解説されている。
まだ完璧に理解できていないのでRAEの論文から読みたい、が非常にインパクトの大きな話に見える。
[^1]:encoderをSigLIPなどの強力なvision encoderを用いた上で、デコーダを学習する手法。VAEではCNN等で潜在表現を低次元に圧縮するが、表現力に乏しく結果的に意味的な表現を捉える能力に乏しかったが、より強力な事前学習されたエンコーダと高次元の潜在表現を扱うことでDiffusion Modelで扱う潜在表現を進化させる。
[Paper Note] The AI Hippocampus: How Far are We From Human Memory?, Zixia Jia+, TMLR'26, 2026.01
Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #LanguageModel #AIAgents #MultiModal #RAG(RetrievalAugmentedGeneration) #ConceptErasure #TMLR #KnowledgeEditing #Selected Papers/Blogs #VisionLanguageModel #memory #KeyPoint Notes Issue Date: 2026-01-24 GPT Summary- メモリは、LLMおよびマルチモーダルLLMの推論と適応性を強化する基盤的要素であり、モデルが静的からインタラクティブなシステムへと進化する中で重要なテーマです。本調査では、メモリを暗黙的、明示的、エージェンティックの三つのパラダイムに分類し、各フレームワークを詳細に述べています。暗黙のメモリは内部パラメータに埋め込まれた知識を示し、明示的なメモリは外部ストレージによる動的な情報強化を指します。エージェンティックメモリは自律エージェントのための持続的な構造を提供し、長期的計画や協調行動を促進します。また、視覚や音声を含む多様なモダリティ間の整合性の重要性も考慮し、アーキテクチャの進展やベンチマークタスクに関連する挑戦について議論されています。 Comment
元ポスト:
AI Agentのメモリに関する包括的なSurvey。現在の技術の包括的なレビューだけでなく、人間の海馬との対比などから必要な能力が議論されている模様。また、現在のメモリが抱えている課題を同定し明言していることが大きな貢献で、
- memory contamination, hallucination (無関係、不正確なデータによるメモリの汚染と、それによって生じるハルシネーション)
- large scaleな検索の計算負荷
- いつ検索するのか、パラメータに内包される知識に頼るのかの判断の困難さ
- 長期にわたるinteractionに対してどのように一貫性を保つか
ということが挙げられるとのこと。
うーーん読みたい。
openreview: https://openreview.net/forum?id=Sk7pwmLuAY
[Paper Note] EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience, Taofeng Xue+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #OpenWeight #SelfImprovement #ComputerUse #PostTraining #VisionLanguageModel #Scalability #Initial Impression Notes Issue Date: 2026-01-23 GPT Summary- EvoCUAは、ネイティブコンピュータ使用エージェントの新モデルで、静的模倣に頼らずデータ生成とポリシー最適化を統合。自律的にタスクを生成し、検証可能な合成エンジンでデータ不足を解消。スケーラブルなインフラにより多様な経験を収集し、反復進化学習でポリシーを動的に調整。OSWorldベンチマークで56.7%の成功率を達成し、従来のモデルを大幅に超えた。このアプローチは、さまざまな基盤モデルでの性能向上を実証し、ネイティブエージェントの機能強化に寄与することを示唆している。 Comment
HF: https://huggingface.co/meituan/EvoCUA-32B-20260105
元ポスト:
合成データ生成(タスク合成からVerifierの定義まで?)と学習のループを回すことでデータのスケーラビリティを向上し性能向上(これまでは事前に静的に合成されたtrajectoryでの学習が主流)。Rejection Samplingをして成功したtrajectoryでSFTしつつ、工夫されたDPOが用いられている模様。あとで読みたい。
[Paper Note] Learning to Discover at Test Time, Mert Yuksekgonul+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #ScientificDiscovery #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-01-23 GPT Summary- LLMを用いたテスト時トレーニングによる発見(TTT-Discover)を提案し、特定の科学的問題に対し優れた解を生成。強化学習を通じて、独自の経験を持つLLMが問題解決に集中。数学から生物学までの様々な課題で新たな最先端を達成し、成果はオープンソースのモデルを用いて再現可能。 Comment
test timeにモデルが解空間を探索するようにweightをupdateすることを(RLで)学習し、平均的に良いsolutionではなくbestなsolutionを見つけるような目的関数を用いることで、scientic discoveryの能力を向上
[Paper Note] Motion Attribution for Video Generation, Xindi Wu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #Selected Papers/Blogs #VideoGeneration/Understandings #Physics Issue Date: 2026-01-21 GPT Summary- Motiveを提案し、動画生成における動きの影響を理解するための運動帰属のフレームワークを提供。運動重み付けされたロスマスクを用いて静的外観と時間的ダイナミクスを分離し、データのキュレーションを改善。VBenchで74.1%の人間の選好勝率を達成し、ファインチューニングデータの選定に初めて運動を用いるアプローチを示した。 Comment
pj page: https://research.nvidia.com/labs/sil/projects/MOTIVE/
元ポスト:
[Paper Note] The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models, Christina Lu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Safety #Personality Issue Date: 2026-01-20 GPT Summary- 大規模言語モデルはデフォルトで「助けるアシスタント」のアイデンティティを持ち、ペルソナ空間の構造を調査することで、モデルの助ける行動と自己認識のバランスを探る。特に、「アシスタント軸」を中心にペルソナを調整することで、モデルの行動を安定化させ、有害な行動を抑制することが可能になる。この研究により、ペルソナドリフトの予測が可能となり、モデルをより一貫したペルソナに固定する方法が示唆される。 Comment
元ポスト:
[Paper Note] Reasoning Models Generate Societies of Thought, Junsol Kim+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Chain-of-Thought #Reasoning #PostTraining #Probing #Diversity #Selected Papers/Blogs #SparseAutoencoder Issue Date: 2026-01-19 GPT Summary- 大規模言語モデルは、複雑な認知タスクにおいて優れた性能を発揮するが、そのメカニズムは不明瞭である。本研究では、強化された推論は計算の拡張だけでなく、異なる人格特性や専門知識を持つ内部認知視点の間のマルチエージェント相互作用によって生じることを示す。これにより、推論モデルはより広範な対立を引き起こし、視点の多様性が向上することを発見した。制御された強化学習実験により、会話行動の増加が推論精度を向上させることが明らかになり、思考の社会的組織が問題解決を効果的に行う可能性を示唆する。 Comment
元ポスト:
解説:
[Paper Note] Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge, Yao Tang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Chain-of-Thought #Reasoning #Architecture #Test-Time Scaling #PostTraining #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes Issue Date: 2026-01-19 GPT Summary- Multiplex Thinkingは、K個の候補トークンをサンプリングし、単一のマルチプレックストークンに集約することで、柔軟な推論を実現。モデルの自信に応じて標準的なCoTの挙動と複数の妥当なステップをコンパクトに表現。難易度の高い数学的推論ベンチマークで一貫して優れた結果を示す。 Comment
pj page: https://gmlr-penn.github.io/Multiplex-Thinking/
元ポスト:
reasoningに関する新たなアーキテクチャでざっくり言うと単一のreasoningをハードに保持して推論するのではなく、(人間のように?)複数の推論に関する情報をソフトに保持して応答する枠組みである。
reasoningにおける各ステップにおいてk個数のreasoningトークンを生成し、最終的な応答を生成する前に、各ステップで生成されたreasoningトークンのone-hot vectorを集約し平均化、その後集約されたベクトルに対してelement単位(vocabごとの)再重み付けをして、embedding matrix Eを乗じてcontext vectorを得る。このcontext vectorが様々なreasoningの結果を集約したような情報を保持しており、context vectorで条件付けで応答yを生成するようなアーキテクチャ。reasoningモデルに対して追加のオンポリシーRLを通じて応答yのRewardが最大化されるように事後学習することで実現される。
単に性能が向上するだけでなく、test time scaling (parallel, sequenceの両方)でもスケールする。
解説:
[Paper Note] PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning, Jingcheng Hu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #Test-Time Scaling #PostTraining #Selected Papers/Blogs #Aggregation-aware #KeyPoint Notes #Reading Reflections Issue Date: 2026-01-19 GPT Summary- PaCoReは、固定されたコンテキストウィンドウを超えた計算量の拡張を目指すトレーニング・推論フレームワークです。逐次的パラダイムを脱し、複数のラウンドでメッセージ伝播アーキテクチャを用いた並列探索を行います。各ラウンドでは、並列推論経路を起動し、結果を圧縮して次のラウンドに統合し、最終的な答えを生成します。このアプローチにより、文脈制限を超えた実質的な計算量が実現され、特に数学推論で顕著な成果を示します。8BモデルはHMMT 2025で94.5%を達成し、オープンソース化された資源により、さらなる研究が期待されています。 Comment
元ポスト:
- [Paper Note] STEP3-VL-10B Technical Report, Ailin Huang+, arXiv'26, 2026.01
で活用されているRLでtest time scalingを学習する手法
モデルのSequentialなReasoning能力はcontext windowに制限されてしまうので、並列にモデルにreasoningをさせてそれらを集約させて、さらに直列で思考させる、といった処理を繰り返すことで、context windowの制限を超えてreasoning能力を高めることを目的としたtest-time scaling手法。
モデルに複数個のreasoning trajectoryを生成させ、それぞれのtrajectoryにCompaction Function(式2) を適用[^1]することで各resaoning trajectoryをcompaction message M として圧縮。圧縮したtrajectoryを元のpromptとともに与えて、同様の操作をRラウンド繰り返すtest-time scaling手法。最後のラウンドでは、生成するreasoning trajectoryの数を1とすることで最終的な応答を得る。モデルをこのプロセスに最適化するために、各ラウンドにおいて (x, M) が与えられた時に、並列して生成するreasoning trajectoryに対してRLVRを適用することでモデルの性能を引き上げている。Mはベースモデルによって事前に生成し、生成した結果をキャッシュしておくことでRL中に利用する。
PaCoReによってベースモデル(RLVR-8B)の性能が着実に押し上げられ、一部ベンチマークにおいてフロンティアモデルには届かなないものの非常に高い性能を示している。
また、Parallel test-time scaling手法として代表的なSelf-Consistencyと比較しても、より少ないtoken量で、より高いgainを得ている。
[^1]: 本研究ではCompatction Functionとしてreasoningの特性を利用して、結論部分に関連する部分を抽出し、intermediateなreasoning tokenは破棄するような関数を適用している
Figure1においてベースモデルであるRLVR-8B (Qwen3-8B-Base) に対して、PaCoReによってpost-trainingされたモデルがより良好なtest-time scalingを示すことが図示されているが、RLVR-8Bによるtest-time scaling手法としてどのようなものが適用されたのか(parallelなのか、sequentialなのか、結果を集約したのか等)が書かれていない気がする。
何が気になっているのかというと、提案手法が効果があることは分かったのだが、これがPaCoReの枠組みに則ったRLを適用しないと発現しないものなのか、それともPaCoReに特化したpost-trainingを実施しなくても、何らかのベースモデルに同様のtest-time-scalingの枠組みを利用すれば高い性能を得られるのか、といった点が気になる。どこかに書いてあるのだろうか?
[Paper Note] STEP3-VL-10B Technical Report, Ailin Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #UMM #Initial Impression Notes Issue Date: 2026-01-19 GPT Summary- STEP3-VL-10Bは、効率と最先端のマルチモーダル知能のトレードオフを再定義する軽量なオープンソース基盤モデル。言語に整合した知覚エンコーダとQwen3-8Bデコーダを統合し、1k回以上の強化学習を含むスケーラブルな後処理パイプラインを導入。並列協調推論を実装し、視覚推論の探索と統合を最適化。コンパクトながら、他の大規模モデルに匹敵する性能を発揮し、MMBenchで92.2%、AIME2025で94.43%などの成果を記録。再現可能な基準として全モデルスイートをコミュニティに提供。 Comment
元ポスト:
HF: https://huggingface.co/stepfun-ai/Step3-VL-10B
たったの10Bモデルにもかかわらず、100B, 200B級のベンチマーク性能を達成しており、unifiedなアーキテクチャで事前学習中に全てのパラメータをunfrozenな上で1.2Tマルチモーダルトークンで学習し、PaCoReと呼ばれるRLで学習されたtest time scaling手法や、GRPO系ではなくPPOをRLで採用するなど、ユニークな工夫が満載に見え、重要研究に見える。
[Paper Note] STEM: Scaling Transformers with Embedding Modules, Ranajoy Sadhukhan+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #EfficiencyImprovement #Pretraining #NLP #Transformer #LongContext #Architecture #Selected Papers/Blogs #Inference #Stability #Latency #Interpretability #Author Thread-Post Issue Date: 2026-01-17 GPT Summary- STEMは、Transformersに埋め込みモジュールを用いてスパーシティを効果的に処理し、安定したトレーニングを実現します。FNNのアッププロジェクションを埋め込みのルックアップに置き換え、トークンごとの計算を削減しつつ、性能を向上させます。知識の保存や解釈性を向上させ、長いコンテキストでも効果を発揮。350Mおよび1Bモデルで約3~4%の精度向上を達成し、知識や推論のベンチマークで優れた結果を示しました。 Comment
元ポスト:
著者ポスト:
[Paper Note] DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning, Sara Vera Marjanović+, TMLR'26, 2025.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #TMLR #Selected Papers/Blogs Issue Date: 2026-01-17 GPT Summary- DeepSeek-R1は、LLMが複雑な問題に対処するための新しいアプローチを提案。直接答えを生成するのではなく、詳細な多段階推論チェーンを形成し、ユーザーに推論プロセスを公開することで思考の学問を創出。推論の長さ、コンテキストの管理、安全性の問題などに関する分析を行い、推論の「スウィートスポット」を特定。深い思考を持続的に行うが、過去の問題定式化に固執する傾向にも注意。また、対照モデルに比べて安全性の脆弱性があり、リスクを孕む可能性が示唆された。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=BZwKsiRnJI
[Paper Note] ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking, Qiang Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#LearningToRank #PairWise #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-16 GPT Summary- 強化学習はLLMエージェントのパフォーマンスを向上させたが、オープンエンドのタスクでは依然として課題が残る。報酬モデルが得点をスカラーで割り当てるため、識別が難しく、最適化が停滞する。これに対抗するために、ArenaRLを提案し、相対ランキングに基づく新しいアプローチを導入。プロセス意識の対評価メカニズムを用いて、安定した利点信号を得るためのトーナメント方式を採用。実験結果は、この手法が効率性と精度のバランスを保ちながら、従来のベースラインを超えることを示す。また、オープンエンドエージェント向けの高品質ベンチマークOpen-TravelとOpen-DeepResearchも構築された。 Comment
元ポスト:
pj page: https://tongyi-agent.github.io/blog/arenarl/
従来のRLが各ロールアウトごとにpoint-wiseなrewardを付与していたとみなしたときに、定量化が困難なタスクにおいてrewardのsignalがノイジーでうまくいかないという現象が生じ、それに対し相対的な指標であるpairwiseなrankingを導入するというのは直感的に非常に有効で、さまざまなタスクに適用しうるため、インパクトが大きく重要論文に見える。
[Paper Note] Can We Predict Before Executing Machine Learning Agents?, Jingsheng Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Planning #Evaluation #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- 自律的な機械学習エージェントは「生成-実行-フィードバック」パラダイムに依存しているが、高価な実行に制約されている。本研究では、事前情報を内部化し、瞬時の予測的推論に置き換えることでこの問題を解決。データ中心のソリューションを形式化し、18,438のペア比較からなるコーパスを構築。LLMが高い予測能力を示し、61.5%の精度を達成。FOREAGENTエージェントは予測-確認ループを採用し、収束を6倍速め、実行ベースラインを6%上回る成果を達成。コードとデータセットは近日中に公開予定。 Comment
元ポスト:
(読了前の第一印象)問題設定や着眼点が実用的で興味深い。
[Paper Note] BabyVision: Visual Reasoning Beyond Language, Liang Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #Analysis #Dataset #Evaluation #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- MLLMは基本的な視覚タスクで人間、特に3歳児に劣る性能を示す。これを調査するために、視覚能力を評価する「BabyVision」ベンチマークを導入。388のタスクを通じて、MLLMのパフォーマンスが人間基準を大きく下回ることが確認された。具体的には、Gemini3-Pro-Previewが49.7点で、6歳や成人の平均94.1点に遠く及ばない。これにより、MLLMは基本的な視覚原理が不足していることが明らかにされ、BabyVision-Genと自動評価ツールキットも提案された。データとコードは公開されている。 Comment
pj page: https://unipat.ai/blog/BabyVision
元ポスト:
ポイント解説:
(読了前の第一印象)現在のMLLMが純粋な視覚的な推論タスクにおいて幼児以下であることを示し、既存のベンチマークの脆弱性(純粋な視覚的な推論能力を評価できていない)を指摘した上で新たなベンチマークを提案しているように見え、非常に重要な研究に見える。
[Paper Note] MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head, Kewei Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #Transformer #Attention #Architecture #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- トランスフォーマーの自己注意の複雑さが大規模アプリケーションでの利用を制限する中、効率的な線形注意の適用は性能低下を招くことがあります。本研究では、モデルの表現の多様性を失わせる「グローバルコンテキスト崩壊」の問題を特定し、トークン次元に沿った注意計算による「マルチヘッド線形注意(MHLA)」を提案します。MHLAは線形の複雑さを保ちながら、ソフトマックス注意の表現力を回復することに成功し、様々なドメインでImageNet分類で3.6%、自然言語処理で6.3%、画像生成で12.6%、動画生成で41%の性能改善を達成しました。 Comment
pj page: https://dagroup-pku.github.io/MHLA/
元ポスト:
(読了前の第一印象)スループットを大幅に向上させながらも、大幅な性能改善をしている新たなlikear attention手法であり、image, video, textの3つのモダリティに対して性能向上しているように見えるため、結果のインパクトが大きく重要論文に見える。
[Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #EfficiencyImprovement #NLP #LanguageModel #Architecture #Selected Papers/Blogs #memory #Reference Collection Issue Date: 2026-01-14 GPT Summary- 条件付きメモリを用いたMixture-of-Experts (MoE)の拡張により、知識検索の効率を向上。Engramモジュールを通じて古典的なN-gram埋め込みのO(1)ルックアップを実現し、ニューラル計算と静的メモリの最適なトレードオフを導出。27Bパラメータでのスケーリングが同等のMoEベースラインを上回り、知識検索や一般推論、コード・数学領域で顕著な性能向上を示す。局所的依存性のルックアップでアテンション容量を解放し、長文脈検索能力を強化。Engramは次世代スパースモデルに不可欠なモデルプリミティブを提供する。 Comment
元ポスト:
所見:
解説:
解説:
ポイント解説:
先行研究:
- [Paper Note] Scaling Embedding Layers in Language Models, Da Yu+, NeurIPS'25, 2025.02
[Paper Note] Extracting books from production language models, Ahmed Ahmed+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #Memorization #Legal Issue Date: 2026-01-12 GPT Summary- 本研究では、商業用LLMにおける著作権で保護されたトレーニングデータの抽出可能性を調査。2段階の手法を用い、4つのLLM(Claude 3.7 Sonnet、GPT-4.1、Gemini 2.5 Pro、Grok 3)でテストを実施。Gemini 2.5 ProとGrok 3はジャイルブレイクなしで高い抽出率を示し、Claude 3.7 Sonnetはジャイルブレイクでほぼ逐語的に出力。GPT-4.1は多くの試行が必要で抽出率が低かった。結果、商業用LLMにおいても著作権データの抽出がリスクであることが示された。 Comment
元ポスト:
重要研究に見える
[Paper Note] VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice, Shuming Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #VideoGeneration/Understandings #VisionLanguageModel #One-Line Notes Issue Date: 2026-01-10 GPT Summary- CoT推論は動画理解タスクにおいて有用だが、直接的な回答も同等以上の性能を示すことがある。本研究では、VideoAuto-R1というフレームワークを提案し、「一度考え、二度答える」アプローチを採用。初期回答を生成後、推論を行い、見直した回答を出力する。これにより、動画QAベンチマークで最先端の精度を達成し、応答長を約3.3倍短縮。推論集約型タスクでは高い思考モード活性化率が観察され、言語ベースの推論が常に必要ではないことを示唆している。 Comment
pj page: https://ivul-kaust.github.io/projects/videoauto-r1/
元ポスト:
テキストだと基本的にCoTが良い方向に働くがVideoになるとなぜうまくいかない場面が多いのだろうか?気になる
ポイント解説:
output formatを 直接応答→thinking→thinking後応答 とし、双方の応答に対してrewardを計算することで複数のrewardシグナルを同時に扱える。
(感想)モデルの直接応答によるrewardを用いることで、internalなreasoning能力が向上するし(効率の増加)、thinking後の応答に対してrewardを用いることでthinkingのリソースを費やした場合の性能も向上する効果かありそう。
[Paper Note] RoboReward: General-Purpose Vision-Language Reward Models for Robotics, Tony Lee+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Dataset #ReinforcementLearning #Evaluation #PostTraining #Selected Papers/Blogs #VisionLanguageModel #RewardModel #Robotics #EmbodiedAI Issue Date: 2026-01-09 GPT Summary- 強化学習における報酬設計の重要性を踏まえ、実ロボティクスでの自動報酬モデルとしてのビジョン・ランゲージモデル(VLM)の効果を探求。新たに「RoboReward」データセットを導入し、成功例の反事実的ラベリングやネガティブ例データ拡張を通じて多様なタスクを網羅した訓練データを構築。評価の結果、既存のVLMには改善の余地があり、4Bおよび8Bパラメータモデルが短期タスクで優れた報酬を提供。最終的に、8Bモデルを実ロボット強化学習に適用し、人間提供の報酬とのギャップを縮小する成果を得た。データセットやモデルは公開されている。 Comment
元ポスト:
[Paper Note] SimpleMem: Efficient Lifelong Memory for LLM Agents, Jiaqi Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory #Initial Impression Notes Issue Date: 2026-01-09 GPT Summary- LLMエージェントのために、効率的なメモリシステムSimpleMemを提案。三段階のパイプラインで、意味的構造圧縮、再帰的メモリ統合、適応的クエリ認識型検索を実施し、情報密度とトークン利用を最大化。実験により、精度が26.4%向上し、トークン消費が最大30倍削減されることを確認。 Comment
pj page: https://aiming-lab.github.io/SimpleMem-Page/
ポイント解説:
追加の学習などが不要で、かつ高性能・低コストで動作するRetrieval basedなmemory(特定のLLMに依存しない点も良い)であり、実務的に導入が容易であり、実用性が高いため重要研究に見える。
[Paper Note] From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, Marc Finzi+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #MachineLearning #Metrics #Dataset #Selected Papers/Blogs #OOD #Generalization #Reference Collection #Intelligence Issue Date: 2026-01-09 GPT Summary- 本研究では、データから新たな情報を生成する可能性や、情報の評価方法について探求する。シャノン情報やコルモゴロフの複雑性が無力である理由を示し、情報理論における三つの矛盾する現象を特定する。新たに導入した「エピプレキシティ」は、計算制約のある観察者がデータから学べる情報を捉え、データの構造的内容を評価する手法である。これにより、情報生成のメカニズムやデータの順序依存性を明らかにし、エピプレキシティを用いたデータ選択の理論的基盤を提供する。 Comment
元ポスト:
解説:
ポイント解説:
[Paper Note] UniVideo: Unified Understanding, Generation, and Editing for Videos, Cong Wei+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #Transformer #MultiModal #DiffusionModel #VariationalAutoEncoder #OpenWeight #ICLR #Selected Papers/Blogs #VideoGeneration/Understandings #Editing Issue Date: 2026-01-09 GPT Summary- UniVideoは、動画ドメインにおけるマルチモーダルコンテンツの生成と編集を目的とした統一モデルで、MLLMとMMDiTを組み合わせたデュアルストリーム設計を採用。これにより、複雑な指示の解釈と視覚的一貫性を維持しつつ、動画生成や編集タスクを統一的に訓練。実験結果では、テキスト/画像から動画への生成や文脈内編集において最先端の性能を示し、編集とスタイル転送の統合や未見の指示への対応も可能。視覚プロンプトに基づく生成もサポートし、モデルとコードは公開されている。 Comment
pj page: https://congwei1230.github.io/UniVideo/
元ポスト:
[Paper Note] Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers, Maksim Velikanov+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NeuralNetwork #Pretraining #NLP #LanguageModel #Optimizer Issue Date: 2026-01-09 GPT Summary- 重み減衰(WD)を行列層に適用する際のノイズ平衡を改善するため、学習可能な乗数を導入。これにより、データに適応したスケールを学習し、性能を向上させる。行と列のノルムにも乗数を適用し、表現力を高める。提案手法は、計算オーバーヘッドを削減し、実用的な問題を解決。AdamおよびMuonオプティマイザでの検証により、下流評価での改善を確認。 Comment
元ポスト:
[Paper Note] How to Set the Batch Size for Large-Scale Pre-training?, Yunhua Zhou+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #MachineLearning #NLP #LanguageModel #Batch #Scheduler #CriticalBatchSize Issue Date: 2026-01-09 GPT Summary- WSD学習率スケジューラに特化した改訂版E(S)関係を導出し、事前学習中のトレーニングデータ消費とステップのトレードオフを分析。最小バッチサイズと最適バッチサイズを特定し、動的バッチサイズスケジューラを提案。実験により、提案したスケジューリング戦略がトレーニング効率とモデル品質を向上させることを示した。 Comment
元ポスト:
Critical batch sizeが提案された研究:
- [Paper Note] An Empirical Model of Large-Batch Training, Sam McCandlish+, arXiv'18, 2018.12
[Paper Note] The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining, Jiandong Shao+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #CrossLingual #Selected Papers/Blogs Issue Date: 2026-01-05 GPT Summary- 多言語大規模言語モデルは、単言語の事前学習にもかかわらず優れたクロスリンガル性能を示す。バイリンガルデータの影響を調査するため、単言語コーパスと比較した結果、バイリンガルデータを除去すると翻訳性能が56%低下するが、クロスリンガルQAや推論タスクには影響が少ないことが分かった。バイリンガルデータを並行データとコードスイッチングに分類し、並行データを再導入すると翻訳性能がほぼ回復したが、コードスイッチングの貢献は小さかった。これにより、翻訳は並行データの整合性に依存し、クロスリンガル理解はバイリンガルデータなしでも可能であることが示唆された。 Comment
元ポスト:
これは非常に興味深い。
[Paper Note] The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL, Yingru Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #ICML #PostTraining #Selected Papers/Blogs #LongHorizon Issue Date: 2025-12-27 GPT Summary- 勾配分散の爆発による訓練崩壊を防ぐため、最適トークンベースライン(OTB)を導出し、累積勾配ノルムの逆数で重み付けする方法を提案。Logit-Gradient Proxy を使用して勾配ノルムを効率的に近似し、訓練の安定性を向上。N=4 でN=32相当の性能を達成し、トークン消費を65%以上削減。 Comment
元ポスト:
