EfficiencyImprovement (450) — 1/3
[Paper Note] Looped Diffusion Transformer, Yong Xien Chng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #NLP #Transformer #DiffusionModel #TextToImageGeneration #Architecture #RecurrentModels #ImageSynthesis Issue Date: 2026-10-02 GPT Summary- テキスト画像生成において、共有Transformerブロックをノイズ除去ステップ内で反復実行するLooped-DiTを提案。中間ループへの深い教師あり学習と自己調整型注意機構により、弱い教師信号と局所情報の損失を防ぐ。パラメータ数と計算量を抑えつつ、6.5倍大きいモデルを上回り、ノイズ除去ステップを増やすよりループを深くする方が効果的であることを示した。 Comment
元ポスト:
[Paper Note] Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs, Elizabeth Mieczkowski+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#Multi #GraphBased #NLP #LanguageModel #AIAgents #NeurIPS #Author Thread-Post #Coordination Issue Date: 2026-09-26 GPT Summary- LLMチームの協調において、固定的な構造化手法と非構造化手法の非効率性を解消するため、分散システムに着想を得たLATTEを提案。エージェントが共有・進化する協調グラフを構築し、サブタスクの依存関係、割り当て、進捗を管理することで、動的なタスク分配と協調方法の適応、新たなタスクの発見を可能にする。複数のタスクと基盤モデルで、既存手法と同等以上の精度を維持しながら、トークン使用量、実行時間、通信量、ファイル競合や重複出力などの協調失敗を削減。 Comment
元ポスト:
[Paper Note] $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts, Mert Cemri+, NeurIPS'26, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #NeurIPS #Test-Time Scaling #SpeculativeDecoding #reading #One-Line Notes #Latency #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- LLMのtest-time scalingにおいて、計算量だけでなくユーザー体験に関わるレイテンシを考慮するため、投機的デコーディングに基づくSPECSを提案。小型モデルで候補系列を高速生成し、大型モデルと報酬モデルの信号で評価する。報酬誘導型ソフト検証と報酬ベースの延期により、ビームサーチ以上の精度を維持しつつ、レイテンシを最大19.1%削減。ビーム幅の増加に伴い、KL正則化強化学習の解へ収束することも理論的に示した。 Comment
元ポスト:
beam search型のtest time scaling[^1]において、latencyの課題に対処するため、draft modelを活用する。Figure 2に示されるようなPRMのrewardが一定以上になった後はdraft modelでデコーディングをしても最終的なrewardが大きく変化しない洞察に基づき、rewardが閾値以上になるまではtarget modelで生成し、一定以上になった後の生成をdraft modelに異常することで、latencyを改善する、という話に見える。
[^1]: 各ブロックのトークン数を決めておき、各ブロックごとにbeam size n個の候補を生成し、逐次的に最も良いものを選択していくことで、最終的に単一のreasoning trajectoryを構成するtest time scaling手法
[Paper Note] PreFT: Prefill-only finetuning for efficient inference, Andrew Lanpouthakoun+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Personalization #PEFT(Adaptor/LoRA) #LLMServing #NeurIPS #Decoding #KeyPoint Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-25 GPT Summary- 複数ユーザー向けのPEFTでは、特にデコード段階でアダプター数に伴いスループットが低下する。そこで、プレフィル段階のトークンにのみアダプターを適用するPreFTを提案。LoRAとReFTを用いたPreFTをvLLM上に実装し、Llama 3.1 70Bで512個のアダプターを提供する場合、従来のPEFTに対して1.9倍のスループットを達成。SFTではランクの増加により性能低下を補償でき、RLでは標準PEFTと同等に近い性能を維持。LLMのパーソナライズにおいて、PreFTが精度と提供スループットの優れたトレードオフを実現することを示した。 Comment
元ポスト:
ユーザごとに最適化されたLoRAアダプタ等を利用して生成する場合にスループットを最大化したい状況を考える。一般的にprefillはcompute-bound[^1]、decodeはmemory-bound[^2]であり、特にスループットを最大化するためにバッチを利用した場合、複数ユーザのリクエストがバッチ内に存在するため、複数のアダプタをメモリにロードしながらprefillとdecodeを実施することになるが、decode時に余計なメモリのオーバヘッドを有み[^3]、スループットが悪化する問題がある。これを解決するために、prefill時のみアダプタを利用し、デコード時はアダプタを活用しないというシンプルな手法PreFTが提案されている。
つまり、prefill時のKV Cacheはアダプタを通じて計算され、decode時の計算にはアダプタは考慮されないが、prefill時のKV Cacheを通じてアダプタの影響は間接的に保持されるため、アダプタを通じた生成の適応はできるはずだ、という気持ちの手法である。
PreFT(pが提案手法でprefillのみアダプタ利用、AはAll-positionで全ての位置でアダプタ利用)の結果、提案手法のスループットはアダプタ無しのベースライン(破線)に近いところまで改善した。
また、Table 1, Table 2はそれぞれSFT, RL時の最終的なdownstreamタスクへの影響を調査している。
結論としては、SFTの場合は、個々のrank設定ごとに有意に性能が劣化するが、全体で見ると有意差はなかった。
また、RLではデータセットごとに差が出ておりGSM8Kでは特に性能の劣化が著しい。これについて付録で詳しい調査結果が記載されているようだが、最終的にはclear explanationは見つかっていないとのこと。また、All-positionとPreFTの間に有意差が生じており、平均してに-2ポイント程度性能が悪化する。
[^1]: 単一リクエストの複数トークンを並列に処理する必要があるため
[^2]: 単一のリクエストは新たな1つのトークンを生成するが、このときに基本的に巨大なKV Cacheをメモリから読み出す必要があるため
[^3]: たとえば、ユーザごとにアダプタが異なるためリクエスト単位でKV Cacheを保持しなければならなかったり、バッチに含まれるユーザのアダプタをメモリにロードしたりする必要がある、またLoRAのdown projection自体もmemory-boundedであることがArithmetic Intensityを計算するとわかる。すなわち、Arithmetic Intensity=メモリから1バイト読み出したあたり、どの程度の計算が実施されるか=FLOPS/bytes=1/(1/r+1/d+1/b) << Bであり、基本的にLoRAのランクrは出力次元数d, バッチ数bよりも小さいため、高々Arithmetic Intensity≒rにしかならず、これはGPUのハードウェア限界値に全く及ばないため、メモリ律速となる。ここでBはハードウェアの計算性能/ハードウェアのメモリ帯域であり、ハードウェア側の計算能力とメモリ帯域の比率を表す。Rooflineモデルに従うとBに近ければ近いほど演算性能が向上する。
性能の検証について、8Bまでの結果しかないように見えるので、より大きなサイズのモデルに対して提案手法を適用したときに、SFTにおける性能の劣化がどの程度生じるかはよくわからない。Table 1を見る限り、モデルサイズが大きい場合に、全体の傾向として性能が低下していそうにも見える。が、これはただそういう風に見えるという感想なので、よくわからないし、なんなら結局自分たちが適用したいdownstreamタスクで性能がどうなるかは見てみたいとわからない。
また、personalizationのためにLoRAアダプタを使いたい、という状況がどの程度存在するかもよくわからない。contextに情報をユーザごとに注入するような一時的な個人化で十分という状況は多いのではないだろうか。実用上はアダプタのメンテナンスコストも生じる。本研究はLoRAによるpersonalizationが、contextに注入する場合に対して重要であることを示すのはout of scopeだとは思う。が、このような状況が生じうること動機について、ストーリーとして一定の納得感は欲しいところではある。
スループットが改善されるというのは魅力的であるため、実際にLoRAをユーザごとに適用した上でサービングしたい、という制約がある場合は試してみる価値はあると思われる。
[Paper Note] HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing, Jianyu Wei+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #KV Cache #Initial Impression Notes #Author Thread-Post #Decoder-Decoder Issue Date: 2026-09-24 GPT Summary- 長期・複数ターンのエージェントに対し、HySparse2は2段階のKV共有を備えたハイブリッド・スパース注意を導入。 外側ではKV Bridgingにより、自己デコーダの隠れ状態からクロスデコーダのKVキャッシュを構築する。 内側では、KV Reuseを維持しつつ、ブロック単位のスパース性をトークン単位に変更し、直近トークンを含むスライディングウィンドウを強制することで長文検索を高精度化。 自己デコーダ処理後にクロスデコーダ層をスキップでき、プリフィル計算量とKVキャッシュ容量を削減。 80B-A3B MoEモデルにおいて、長文コンテキスト検索と複数ターンのエージェントタスクでHySparseおよびHybrid SWAを上回る性能を達成。 Comment
元ポスト:
Mimo-V3ではYOCOスタイルのデコーダ-デコーダモデルで、KVを共有するアーキテクチャになるようである。
[Paper Note] SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness, Haozhe Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-09-20 GPT Summary- コーディングエージェントの長期的な推論・ツール利用では、トークン効率が重要となるため、RSIに着想を得た自動ハーネス探索を提案。 複数環境で研究ループをスケールさせ、行動実行・コンテキスト圧縮・観測処理・委譲読解に関する4つの機構からSoL-Piを構築。 EdgeBenchではGPT-5.6、Sol、Opus 5でPiと同等の性能を維持しつつ、トークン通信量を44.7~49.0%、APIコストを約3分の1削減。 Comment
元ポスト:
[Paper Note] Block Parallelism For Efficient Distributed Long-Context Diffusion Language Model Training, Tarun Suresh+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Library #DiffusionModel #SoftwareEngineering #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-09-19 GPT Summary- BDLMは自回帰的依存と並列デノイズを組み合わせるが、長文脈での訓練は制約を受ける。本研究は新たな分散並列性であるブロック並列性(BP)を導入し、文脈シャード付きブロック並列性(CSBP)を適用して、効率的な訓練を実現。CSBPはスループットを最大1.61倍向上させ、低いピークHBMを維持することで、モデルのパフォーマンスを改善した。特に、CSBPはDFlash2のデコーダ訓練を大幅に加速し、高いパスレートを達成。 Comment
github: https://github.com/ScalingIntelligence/Turbo-dLLM
元ポスト:
diffusion Language Modelを高速に学習できるライブラリとのことで、たとえばDFlash2をベースにしたSpeculative DecodingのためのDraft Modelの学習などが高速化できるとのこと。
[Paper Note] Dream-RSI: Recursive Self-Improvement through Evolving Worlds, Tong Zheng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-16 GPT Summary- 再帰的自己改善を実現するために、\textsc{Dream-RSI}というスケーラブルな探索フレームワークを提案。これにより、探索を明示化し、基盤エージェントを変更せずに効果的な探索戦略を管理可能に。累積された発見履歴を用いたリプレイシミュレータにより、オフポリシーで迅速なフィードバックを確保し、高コストのオンライン評価を回避。改善されたポリシーを再デプロイし、自己改善ループを拡充。競争力のある発見品質を維持しつつ、設定によっては発見コストを大幅に削減。 Comment
元ポスト:
ざーっと見たが、dreamingが何を指すのかよくわからない。どういう操作のことを指しているのか。
図中の太字部分がReplay Simulator、およびdreamingの話をしている気がするが、まだよくわからない。つまり、蓄積されたtrajectoryを再生成せずにprefillに使って、探索木で分岐が生じた場合は現在のポリシーに基づいて判断をし、再利用できる探索がなくなるまでこのような操作を繰り返すことで効率化するということだろうか。
[Paper Note] Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference, Mostafa Elhoushi+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #read-later Issue Date: 2026-09-09 GPT Summary- レイヤー・ドロップアウトは、トランスフォーマーにおいて速いトレーニングと高い精度を実現するが、LLMsの事前学習からは姿を消しつつある。本研究では、レイヤー・ドロップアウトの使用の利点を示し、ベストプラクティスとスケーリング分析を提案。特に、同じトレーニングFLOPsで損失が低下し、最大25%のFLOPs節約が可能であり、推論速度も1.5倍向上することが確認された。2400件以上のトレーニング実験を通じて、これらの知見が大規模トレーニング環境に適用可能であることが示された。 Comment
元ポスト:
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
のFigure 6の例を見ると10Tトークン程度学習したら逆転したこともあったので、160Bは十分なのだろうか(パラメータ数やそもそも適用しているものが違うので何も言えないのだが、少なくともこういう例はある。小規模(中規模?)実験の結果をより大規模な実験に必ずしも外挿できない、というのは頭に入れておいたほうが良さそう。が、どうしようもないという)。
所見:
FLOPsだけを見ると理論上は計算量を削減できるように見えるかもしれないが、バッチ作成を考慮するとそれらの恩恵がテスト時もサービング時も無くなってしまうのでは、という指摘がある。
[Paper Note] Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning, Heng Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Attention #read-later #KV Cache #Compression Issue Date: 2026-09-08 GPT Summary- 大規模言語モデルは長い推論タスクにおいて優れた性能を示すが、長い思考過程はメモリボトルネックとなる。従来のKVキャッシュ圧縮手法はトークンにスコアを付けて重要なものを保持するが、我々は選択信号の寄与が無視できることを示す。Random Attention手法では、プロンプトを保持しながらトークンをランダムに追放し、スコア計算を行わない。これにより、伝統的手法と同等の性能を維持しつつ、vLLMのデプロイメントで32〜43%高いスループットを達成。プロンプトの安全性が確保されればランダム抽出でも必要なトークンを保持でき、選択スコアは不要である。コードは公開中。 Comment
元ポスト:
[Paper Note] Language Models Can Control Their Own Attention, Namgyu Ho+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Attention #LongContext #read-later #Selected Papers/Blogs Issue Date: 2026-09-07 GPT Summary- Declarative Attention(DA)を導入し、モデルが生成時にどの文脈に注意を払うべきかを宣言させることで、KVキャッシュのスキャンを最小化。三つのモード(global, focus, local)に分けることで、ゼロショット評価で注意トークン数を52.0%、31.1%削減しつつ、精度の低下を抑制。DAはスパースアテンションの新しい可能性を提供。 Comment
元ポスト:
[Paper Note] AI Research Preference Models, Thomas Simon Foster+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #ScientificDiscovery #LongHorizon #autoresearch/RSI Issue Date: 2026-09-06 GPT Summary- AI研究エージェント(AIRA)は、機械学習実験の効率を高めるために、評価コストを抑えるAI研究嗜好モデル(RPMs)を導入。これにより、候補解の中から最も有望なものを予測し、固定予算内での進捗を最適化。RPMsは事前学習済み言語モデルの変種として構築され、AIRA-dojoに統合後、機械学習ベンチマーク AIRS-Benchでのスコアを向上させ、実行時間を短縮しながら新たな最先端結果を達成。 Comment
元ポスト:
[Paper Note] Prefix Sliding for efficient test-time scaling, Niklas Muennighoff+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Attention #LongContext #Test-Time Scaling #Selected Papers/Blogs #reading #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- テスト時スケーリングでは、言語モデルが長期間推論できるように推論の計算を強化するが、多くの中間トークンが重要性を失うことが発見された。これを受けて、Prefix Slidingを提案し、推論中に不要なトークンを破棄することでメモリ要件を削減し、効率的な長期推論を実現する。これにより、既存のモデルを維持しつつ3倍の速度向上が可能になり、強化学習では100,000トークン以上のスケーリングを達成する。実験により、Prefix Slidingが中間トークンの要約や従来の手法より優れていることが示された。 Comment
元ポスト:
long sequenceに対する推論をすると
- full attentionの場合メモリ消費が激しくOOMになる
- しかしreasoningをコンパクトに圧縮すると重要な情報を失う
これを解決するために、reasoningの中間にあるtokenの重要度が低いことに着目し、シンプルに
- prefix: reasoningの冒頭、指示やtoolの定義を含む
- recent tokens: reasoning traceの直近
を残す二種類の固定長のwindowを用いて、prefixは固定し、recent tokensはtraceの成長に従いスライディングさせる手法を提案。
その結果、
- 最大消費メモリが固定され
- full traceを用いるよりも推論スピードは速く、同等の性能に最大3倍程度早く到達
- RLにおいて、より長い推論を固定されたmemory budgetの元で実施でき、rewardも改善
シンプルな手法でOOM問題を解決し、単に推論時のメモリ消費や推論スピードを改善しただけでなく、モデル学習時のRLにおけるパフォーマンスが改善することまで示しており、シンプルで容易に実装ができるがインパクトが大きく、非常におもしろい研究と感じる。Ablationも実施されている。
Linear attentionに対しては、そもそもメモリ消費量はconstantなので提案手法を適用する必要がそもそもない点には注意。
現在の主要な中国系のOpenWeight LLMのアーキテクチャがほぼ、linear attentionとsparse attentionを積み重ねたアーキテクチャになっている。sparse attentionはKV Cacheがcontext長に従って増大するため、本研究の恩恵を受ける可能性はあるが、sparse attentionに対する実験は実施されていないように見える。
[Paper Note] Draft-OPD: On-Policy Distillation for Speculative Draft Models, Haodi Lei+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Decoding #Selected Papers/Blogs #On-Policy #SpeculativeDecoding #Initial Impression Notes Issue Date: 2026-08-27 GPT Summary- スペキュレーティブデコーディングでは、ターゲットモデルと軽量ドラフトモデルを組み合わせ、ドラフトモデルの提案を並行して検証し、推論を高速化する。しかし、監督付きファインチューニング(SFT)は頭打ちになることが観察され、オフラインから推論へのミスマッチが問題を引き起こす。これに対処するため、オンポリシー蒸留(OPD)の必要性が生まれるが、ドラフトモデルの展開には困難が残る。そこで、Draft-OPDを提案し、提案されたブロックの評価からフィードバックを学習し、推測的受諾を制限することに集中する。実験により、Draft-OPDは多様なタスクにおいて大幅な速度向上を達成し、EAGLE-3およびDFlashを上回る結果を示した。 Comment
元ポスト:
draft modelは基本的にtarget modelからサンプリングされたtrajectoryに対するofflineのSFTやdistillation(オフポリシー)によって学習されるが、これをオンポリシーにすることでSpeculative DecodingのAccepted Length(ドラフトモデルが生成したトークンが受理されるトークンの長さ)を上げたいという話のようである。
Figure 1に示されている通り、SFTではAccept Lengthがすぐに頭打ちになってしまうことが課題で、この原因としてSFTの学習データがオフラインであるのに対し、推論時に実際に与えられるトークン分布の分布で学習されているわけではないことを指摘している。つまり、学習時と推論時の分布にgapが存在することを指摘。
素朴にこれを解決するためには、オンポリシーにdraft modelを学習することが考えられるが、
- (Figure 2 (a)) draft modelにロールアウトをさせると、draft modelはブロック単位の生成を前提としているため、全軌跡を生成するとrepetitionや低品質やサンプルが生成され、target modelで監督をしたとしても信頼性が損なわれる
- (Figure 2 (b)) ではブロック単位でtarget modelのsupervisionを入れると、そもそも前ブロックでのdraft modelの失敗がtarget modelによって補正されてしまうため、on-policy学習によって得たかった「draft modelのエラーに基づいた分布で学習する」ことができず、実質的にoff-policyになる
という課題を指摘している。興味深い。
[Paper Note] Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection, Atsuyuki Miyai+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #Initial Impression Notes #AgentHarness Issue Date: 2026-08-27 GPT Summary- ハーネス最適化を効率化するために、適応的検証タスク選択の新手法Task-CoEvolveを提案。ハーネスが評価コストを削減しつつ進化する中で、情報量の多いタスクの選択と部分評価から性能推定を行います。Task-CoEvolveは、エージェントの能力境界付近のタスクに重点を置き、固定サブセットのベースラインを上回りつつ、評価回数を80%削減する効果を実験で示しました。コードは公開予定です。 Comment
元ポスト:
ハーネスを最適化する際に、すべてのタスクで評価をするのではなく、効果が高いものを選択し効率化する、という話に見える。
[Paper Note] DFlash: Block Diffusion for Flash Speculative Decoding, Jian Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #ICML #Decoding #Selected Papers/Blogs #SpeculativeDecoding Issue Date: 2026-08-15 GPT Summary- 自回帰LLMsは高い性能を持つが、逐次デコードのためレイテンシが長くGPU効率が低い。推測的デコードはドラフトモデルを用いてこの問題を緩和するが、依然として逐次性に依存している。拡散LLMsは並列生成を可能にするが、性能が劣る。本研究では、軽量ブロック拡散モデルを用いた推測的デコードフレームワーク「DFlash」を提案し、高品質な出力を保ちながら6倍以上の加速を達成。最先端手法EAGLE-3より最大2.5倍の高速化を実現した。 Comment
[Paper Note] SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification, Pragaash Ponnusamy+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #read-later #Selected Papers/Blogs #GPUKernel Issue Date: 2026-08-04 GPT Summary- LLM推論のサンプリングを高速化するために、$\textbf{SonicSampler}$を提案。これは、固定化された実行モデルに統合されたタイル対応のTritonカーネルを用い、ダイナミックなサンプリング動作をサポート。文法制約や頻度ペナルティなどを一つのバッチ処理で実現し、CUDA Graphに完全に互換性を持つ。新しい階層的二段階top-kアルゴリズムにより最大で$\textbf{10x speedup}$を達成し、全体で最大$\textbf{16x speedup}$を実現しつつ柔軟性を維持。 Comment
元ポスト:
[Paper Note] Test-Time Scaling via Error Localization, Rajiv Shailesh Chitale+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #TreeSearch Issue Date: 2026-08-04 GPT Summary- TTEL(Test-Time Scaling via Error Localization)アルゴリズムを提案し、トークン単位の誤りを特定して推論効率を向上。固定的フィードバックを利用し、妥当なプレフィックスを再利用することで、生成トークン数を削減。広範な評価で優れたパフォーマンスを示し、特にLiveCodeBenchおいて71.0%のpass@64を達成。数学ベンチマークでも競合を上回る結果を披露。 Comment
元ポスト:
[Paper Note] Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives, Siyuan Shen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #LongContext #LLMServing #SoftwareEngineering #read-later #Selected Papers/Blogs #GPUKernel #Latency #Initial Impression Notes Issue Date: 2026-08-03 GPT Summary- GPUコレクティブ通信は帯域幅最適化が主流だが、遅延制約が増加中。特に、LLM推論では多数の小規模コレクティブがトークン生成に影響を与えるため、マイクロ秒のオーバーヘッドが性能に重要。研究では、GPUコレクティブの性能向上に向け、効率的な同期とマルチキャスト利用の原則を特定。カスタムコレクティブカーネルを開発し、遅延を大幅に削減、SoL下限の7%以内に抑制。実アプリケーションでLLM推論のレイテンシとスループットを改善し、AI推論とHPCの両方に貢献。 Comment
元ポスト:
小規模バッチ、Tensor Parallelism適用時に のデコード時に頻発するAllReduceのlatencyを、usレベルで削減できる工夫を施すことで、推論コストを低下させる
[Paper Note] ISO: An RLVR-Native Optimization Stack, Hanqing Zhu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #RLVR #Author Thread-Post Issue Date: 2026-07-25 GPT Summary- 強化学習における報酬フィードバックの最適化層の理解が不足している中、本研究ではスペクトル継承の概念を提案。この概念をIsospectral Optimization(ISO)として実現し、固定スペクトルフレームワークに基づくオフラインとオンラインの実装を導入。オフラインではISO-Mergerが異なるスペシャリストの能力を統合し、高性能を達成。オンラインではISO-Optimizerが基底スペクトルを固定しつつ、最適化アルゴリズムを適用し精度向上を実現。特に、ISO-AdamWは従来のAdamWよりも少ない学習ステップで高精度を達成。ISOは、報酬駆動型適応の構造を活用した最適化層の新たな設計を提案する。 Comment
元ポスト:
著者ポスト2:
[Paper Note] Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit, Xiaomi MiMo Team+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Attention #LLMServing #MoE(Mixture-of-Experts) #SoftwareEngineering #KV Cache #Initial Impression Notes Issue Date: 2026-07-23 GPT Summary- MiMo-V2.5モデルファミリの推論最適化を提案。Hybrid Sliding Window Attentionと疎なMixture-of-Expertsを組み合わせ、注意計算量とストレージを大幅に削減。レイヤーごとのプリフェッチやキャッシュ戦略を用いて、厳密なストレージと高いキャッシュヒット率を実現。高性能な分散キャッシュ基盤GCacheを構築し、計算量を減少。マルチモーダル入力への最適化も行い、初の大規模LLM提供システムを実現。 Comment
元ポスト:
関連:
- Xiaomi MiMo-V2.5-Pro: A leap in agentic and long horizon coherence, Xiaomi, 2026.04
MoEやSWA、マルチモーダルモデルを用いたモデルを効率的にサービングするためのエンジニアリング面での工夫が記述されているようである。
[Paper Note] Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding, Yonggan Fu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Architecture #Decoding Issue Date: 2026-07-19 GPT Summary- Nemotron-Labs-Diffusionは、AR、拡散、自己推測デコードを統合した三モードの言語モデルです。ARと拡散が補完的であることを示し、自己推測モードでは、拡散によるドラフト作成とARによる検証でマルチトークン予測が向上します。光速分析により、拡散がより多くのトークン生成を可能にし、最大76.5%の向上が見られました。3B、8B、14Bパラメータのモデルは、精度と速度の両面で最先端を超え、特にNemotron-Labs-Diffusion-8Bは、スループットを4倍に向上させました。 Comment
元ポスト:
[Paper Note] Weak-to-Strong Generalization via Direct On-Policy Distillation, Shiyuan Feng+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #On-Policy Issue Date: 2026-07-12 GPT Summary- 弱いモデルから強いモデルへの知見を再利用する方法として、Direct On-Policy Distillation(Direct-OPD)を提案。これにより、弱いモデル上でのロールアウトに基づくRLの学習を強いモデルに適用し、スパースな報酬なしで改善を実現。特に、Qwen3-1.7Bを短時間で大幅に性能向上させ、RLの成果を模倣対象モデル以上の暗黙の報酬信号として再利用できることを示す。 Comment
元ポスト:
[Paper Note] Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training, Zijian Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の適応がトランスフォーマー層にどう分布しているかに焦点を当てる研究。単一のトランスフォーマー層を訓練することで、全パラメータRLトレーニングの利得の大半を回復可能。この現象を層寄与量で定量化し、複数のモデルとRLアルゴリズムで安定したパターンを観察。高寄与層は中間部に集中し、入力・出力端の寄与は少ないことを示唆。層の rankings は各種条件下でも強い相関を持つ。 Comment
元ポスト:
実験は8Bスケールのモデルまでしかできていないが、もしこれが数百B級のモデルにも当てはまるのだとすると、非常に計算コストの低減だけでなく、weightのsyncにおいて非常に有利になると思われるので、インパクトが大きそうな話になる可能性を感じる。
RLの効率化という観点で言うと
- [Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
のような話もある。
[Paper Note] Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context, Fitsum Reda+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Architecture #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- 拡散言語モデルは、自己回帰モデルの代替手段として注目されていますが、既存アプローチは文脈表現とデノイズを同一ネットワークで処理するため能力が制限されていました。本研究では、役割を2つのタワーに分離したブロック単位の自己回帰拡散モデル「TwoTower」を提案。凍結されたAR文脈タワーがクリーンなトークンを処理し、拡散デノイザータワーが双方向アテンションを用いてノイズを洗練します。訓練されたモデルは、生成スループットを2.42倍改善しつつ、自己回帰ベースラインの品質の98.7%を保持します。コードとモデルは公開されています。 Comment
HF: https://huggingface.co/nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
元ポスト:
拡散言語モデルにおけるTwo Towerアーキテクチャの提案で、一方がコンテキストを読み込み(ARモデルでfreezeされている)、もう一方がデコードを担う(diffusionモデルでlearnable)。どちらのタワーも事前学習済みのモデルを利用する。
オリジナルモデルの性能の98.7%を維持しつつ、2.42倍のスループットを実現可能とのこと。
[Paper Note] M*: A Modular, Extensible, Serving System for Multimodal Models, Atindra Jha+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #SpeechProcessing #LLMServing #Architecture #UMM #Omni #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- 複合モデルアーキテクチャの新時代に向け、M*を提案。M*はモデルをデータフローグラフとして表現し、モジュラーな抽象化を通じて多様なタスクを効率的に処理。具体化によって、テキスト-画像及びテキスト-音声ワークロードでの遅延を平均20%削減し、スループットを最大2.7倍向上。ロボティックプランニングでも基準を12.5倍上回る。この研究は、複雑なモデルの効率的な提供を可能にする。 Comment
元ポスト:
以下、元ポストの要約
vLLMやSGLangのようなメジャーなLLM Servingフレームワークは単一の自己回帰的な生成のループを前提としており、テキスト以外のモダリティを扱う場合は異なる推論パスを辿るため、根本的に統一的に扱える抽象化となっていない(Figure 1)。
そこで、マルチモーダルなモデルを統一的に扱えるための抽象化M*を提案:
- モデルのコンポーネントをノードとして宣言し、名前付きのWalkを定義する(1つのフェーズ(prefill_text, decode, image_gen等)を構成するサブグラフ)を定義する。
- リクエストはWalkの系列として定義され、Sequential, Parallel, Loopの3種類で実行形式を定義する。
ランタイムはリクエストに応じたコンポーネントのみを実行する。各コンポーネントはグラフのノードとして定義されるため、配置の変更はコードの変更ではなく、設定の変更で完結する。また、YAMLファイルによって、各コンポーネント、Walkの粒度でGPUの割り当てを制御できるため、個々のコンポーネントやWalk単位でリソースの効率を最大化することで、予測性能を落とすことなく、システム全体のスループットが向上する。
また、Figure1のOmniモデル、UMMそれぞれのモダリティごとの推論パスの違いが秀逸で、非常に分かりやすい。
[Paper Note] Unlimited OCR Works, Youyang Yin+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #NLP #LongContext #OpenWeight #VisionLanguageModel #OCR Issue Date: 2026-07-03 GPT Summary- Unlimited OCRは、DeepSeek OCRに基づき、長期的なメモリ効率を改善するために設計されたモデルである。大規模言語モデル(LLM)を用いることでOCR性能向上が期待されるが、出力系列が長くなるとメモリ消費が増大し、生成速度が低下する問題がある。本研究では、Reference Sliding Window Attention(R-SWA)をアテンション層に導入し、KVキャッシュを一定に保ちながら計算コストを削減。これにより、最大32Kの長さのもとで、数十ページの文書を効率的に処理できる。また、R-SWAはASRや翻訳など他のタスクにも応用可能である。コードとモデル重みは公開されている。 Comment
HF: https://huggingface.co/baidu/Unlimited-OCR
元ポスト:
2週間で1Mダウンロード:
[Paper Note] Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling, Yucheng Li+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Decoding #PostTraining #SpeculativeDecoding Issue Date: 2026-07-03 GPT Summary- MTPを用いることで強化学習におけるロールアウトを加速するBebopを提案。MTPの受け入れ率はモデルエントロピーに影響され、確率的拒否サンプリングがその攪乱を軽減。新しいTV損失を導入し、受け入れ率の改善を実現。エンドツーエンドでのMTPトレーニングにより一貫した速度向上を達成し、最大1.8倍の加速を示す実験結果を提供。 Comment
元ポスト:
[Paper Note] Finding the Time to Think: Learning Planning Budgets in Real-Time RL, Aneesh Muppidi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#MachineLearning #ReinforcementLearning #read-later #Selected Papers/Blogs #Realtime #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- リアルタイム設定における強化学習(RL)の課題に対処するため、可変遅延リアルタイムRLを提案。エージェントが各決定点で熟慮する時間を状態依存で選択可能にし、軽量なゲーティングポリシーを用いて計画予算を決定。リアルタイムのゲーム環境において、このアプローチは固定予算やヒューリスティックのベースラインを超える性能を示した。 Comment
pj page: https://aneeshers.github.io/realtime-rl/
元ポスト:
[Paper Note] Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models, Yang Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#read-later #SparseAttention #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- RLVRは計算コストが高く、長いCOTを生成するが、疎結合注意が密なロールアウトを高速化する可能性がある。過度の疎化は崩壊を招き、緩すぎると速度アップが不十分になる。本研究では、疎から密へのactor-policy不一致を考察し、トークンのstatisticを一定に保つ動的な疎化スケジュールを導入。これにより、Qwen3系列モデルでのロールアウトをそれぞれ2.2倍、2.4倍、2.0倍高速化を達成。さらに、大規模モデルや他のRLドメインにも適用可能で、DistillSparseを用いた軽量な蒸留により、同じ不一致閾値で更なる速度アップが実現できることを示した。 Comment
元ポスト:
[Paper Note] Unlocking the Working Memory of Large Language Models for Latent Reasoning, Lukas Aichberger+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #LatentReasoning #One-Line Notes #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 大規模言語モデルの推論能力を向上させるために、自己回帰的生成の代わりに作業記憶ブロックを採用するReasoning in Memory(RiM)が提案される。これにより、内部計算と外部通信の混同を回避し、計算効率の高い潜在推論を実現。2段階のカリキュラムを用いて、まず推論ステップを予測し、その後最終回答の洗練を行う。実験により、RiMが既存の方法と同等かそれ以上の性能を示すことが確認され、作業記憶が潜在推論の有効なメカニズムとして機能する可能性が示された。 Comment
元ポスト:
元ポストのgifが端的にアーキテクチャを示しており非常にわかりやすい。
メモリブロックと呼ばれるboundaryトークン ``とm個のメモリトークン`
[Paper Note] Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations, Kevin Y. Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Attention #Architecture #One-Line Notes #ConvolutionalModels Issue Date: 2026-05-31 GPT Summary- Oryxというハイブリッドモデルを提案し、系列全体を通じて異なるトークン混合手法を柔軟に切り替えるアプローチを探る。二次アテンションと線形リカレンスを組み合わせ、90%のパラメータを共有することで、効率的な性能を実現。最長1.4Bパラメータのモデルで、従来のモデルを上回る結果を示し、内部表現の共有が有望な方向性であることを示唆。 Comment
元ポスト:
softmax attentionとgated delta net (linear attention)の利用をスイッチングによって動的に切り替え、双方でKVを共有し畳み込みをかけてinducive biasを導入した上で活用する。outputはRMSNorm側でgatingする。softmax attentionとlinear attentionの良いところを良いところ取りしようというアーキテクチャに見える。
[Paper Note] DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation, Makoto Shing+, ICLR'26, 2025.06
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #ICLR #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- DiffusionBlocksは、Transformerベースのネットワークを独立した訓練可能なブロックに変換する新しいフレームワークで、メモリボトルネックを軽減しながらエンドツーエンド訓練と同等の性能を維持します。残差結合の特性を活用し、各ブロックが独立に学習できるため、メモリ要件が削減されます。視覚系や拡散など多様なTransformerアーキテクチャに対する実験により、DiffusionBlocksがスケーラブルな訓練を可能にすることが示されています。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=pwVSmK71cS
巨大な残差接続を持つTransformer-likeなモデルをB個のブロックに分割し、ブロック単位で独立してパラメータを学習することによって、学習時に必要なメモリを1/Bに削減できる手法のようである。
(しっかり読めていないので色々と勘違いがあるかもしれないし、気持ちの部分をうまく表現しきれていないかもしれないが)
手法の概要としては、L layer単位でブロックをB個定義する。各ブロックにはnoise rangeの元ノイズを定義し、sample data (x, y)がgivenな時に、出力yにノイズを付与した~yを考える。~yから元の出力yを再現するようデノイジングするように、他のブロックはfreezeしたままで、あるブロックのパラメータを調整する、という操作を繰り返す、という手法のようである。Inference時は、平均0、学習時に定義したnoiseレベルの最大値を分散として持つ正規分布からノイズをサンプリングし、ノイズをinput xがgivenな状態で各ブロックでsequentialにdenoisingしていく(Euler Step)ことによって、最終的に所望の出力yを得る、といったような拡散モデルの逆プロセスを経て出力を得るようである。各ブロックがカバーするノイズのrangeは決まっているが、sequentialにdenoisingをしていくため、ブロック全体でみると大きなノイズからスタートするが、それぞれのブロックに対する入力のnoise levelは徐々に低減していき、各ブロックが担当するnoise levelのrangeまで落ちることが期待され、このような手続きが実現できると思われる。
[Paper Note] One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs, Di He+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #LearningRate #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- Layerwise Learning Rate(LLR)を導入し、Transformer層ごとに異なる学習率を割り当てることで訓練を効率化。重尾性を考慮した学習率調整により、訓練の均一化、収束の加速、一般化の改善を実現。50の異なる条件での実験で、最大1.5倍の訓練速度アップを達成し、1Bモデルのゼロショット精度を47.09%から49.02%に改善。低いチューニングオーバーヘッドも特長。 Comment
元ポスト:
Layerごとに学習率を調整することで、学習効率を改善する
[Paper Note] CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs, Han Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #NLP #LanguageModel #Transformer #reading #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- CODAは、トランスフォーマーのオペレータをGEMMプラスエピローグとして再パラメータ化し、計算をメモリ書き込み前に実行可能にするGPUカーネルの抽象化である。このアプローチにより、データ移動のボトルネックを軽減し、標準的なTransformerブロックの計算を効率化。代表的なワークロードで高性能を達成し、生産性と効率を両立する道を示す。 Comment
元ポスト:
[Paper Note] LEANN: A Low-Storage Vector Index, Yichuan Wang+, MLSys'26 Best Paper Award, 2025.06
Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #MLSys #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- LEANNは、動的に再計算することでストレージ効率の高いベクトル検索を実現する新しいインデックス。元データ一部のみで高品質な検索を提供し、従来のインデックスに対して最大50倍のサイズ削減を達成。RAGアプリケーションでの高精度と同等のレイテンシを維持。 Comment
元ポスト:
github: https://github.com/yichuan-w/LEANN](https://t.co/QwkYx1t0oa
[Paper Note] Efficient Pre-Training with Token Superposition, Bowen Peng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-13 GPT Summary- Token-Superposition Training(TST)は、事前学習中のデータスループットをFLOPあたり改善する新しい手法である。TSTは、トークンを一つのバッグにまとめてマルチホットクロスエントロピーで訓練するスーパーポジションフェーズと、標準的な訓練に戻す復元フェーズから成る。270Mおよび600Mパラメータで広範に評価され、10B A1Bモデルで最大2.5倍の事前学習時間短縮を達成し、ベースラインを一貫して上回ることを示した。 Comment
元ポスト:
事前学習の序盤にbag of tokensを読み、bag of tokensを予測するシンプルな変更で、学習が最大2--3倍高速化される
所見:
解説:
所見:
[Paper Note] Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation, Yecheng Wu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Distillation #PostTraining #On-Policy #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- OPDは大規模言語モデルのポストトレーニングに有効だが、高いインフラ要求が課題。私たちは、SFTロールアウトで教師の対数確率をオフラインに事前計算し、その再利用を提案。教師の一貫性が重要であることを確認し、それを保証するフレームワークLightning OPDを設計。この手法により、標準OPDと同等の最適解を維持しつつ訓練効率を4倍向上。Qwen3-8B-Baseモデルからの初期化でAIME 2024で69.9%を達成し、MoEアーキテクチャにも対応。LLMのポストトレーニングに関する障壁を低減。コードは公開されています。 Comment
元ポスト:
[Paper Note] Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration, Langlin Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #GRPO Issue Date: 2026-05-12 GPT Summary- GRPOを用いた強化学習は、LLMの推論能力を向上させるが、「ゼロ・アドバンテージ問題」に悩まされることがある。これに対し、効果的な探索を実現するためのフレームワーク LoPE を提案。LoPEは、ランダムなプロンプト摂動を通じて推論経路を広げ、タスクの難問に対して有効なリサンプリングを実現。実験結果は、LoPEの効果を強調し、LLMの強化学習における探索手法の基準を確立することを示した。 Comment
元ポスト:
果たして
[Paper Note] Fast Byte Latent Transformer, Julie Kallini+, ICML'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ICML #Decoding #Byte-level #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- BLTを用いて、バイトレベルLMの生成速度のボトルネックを解消。BLT Diffusionを導入し、並列生成によってデコードステップを削減。さらに、BLT Self-speculationとBLT Diffusion+Verificationを提案し、生成品質を向上させつつ推定メモリコストを低減。これにより、バイトレベルLMの実用性が向上。 Comment
元ポスト:
[Paper Note] Sparser, Faster, Lighter Transformer Language Models, Edoardo Cetin+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #One-Line Notes #Sparse #GPUKernel #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- 非構造的スパース性を活用することで、LLMの計算コストを削減し、フィードフォワード層の効率を向上させる新しいCUDAカーネルを導入。99%超のスパース性を誘導しつつも、パフォーマンスへの影響は最小限。これにより、モデル規模の拡大に伴うスループット、エネルギー効率、メモリ使用量の改善を実証。すべてのコードはオープンソースで公開し、スパース性の実用性を推進。 Comment
元ポスト:
現在の言語モデルではFFNの計算が計算コストの多くを占めているが、ReLUやL1正則化によってFFN中で必要なactivationを99%程度sparseにすることができ、sparseになったFFNに対して最適なデータ形式と高速に動作するGPUKernelを構築することで、downstream taskへの性能劣化無しに、省コストでの推論が可能になる、という話に見える。
解説:
[Paper Note] Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding, Hayate Iso+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #SpeculativeDecoding Issue Date: 2026-05-08 GPT Summary- 推測デコードを用いてRL後トレーニングのロールアウトを加速。これは出力分布を保持しつつ、同期・非同期パイプラインに対応。推測デコードにより、スループットを1.8倍向上させ、非同期RLとの組み合わせで235B規模のトレーニング速度を最大2.5倍向上させる可能性を示す。 Comment
元ポスト:
[Paper Note] Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection, Sijie Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ExperimentManagement #Scaling Laws #Initial Impression Notes Issue Date: 2026-04-27 GPT Summary- スケーリング則の適合は高コストであり、予算を意識した逐次的実験設計として定式化。異なるコストの実験から、外挿精度を最大化する実験を選択。提案手法は古典的ベースラインを上回り、総予算の約10%で高い適合性能を達成。コードは公開中。 Comment
元ポスト:
scaling laws導出のための実験をより省コストとなるようデザインする手法
[Paper Note] TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification, Adam Rida, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLM分類に基づく訓練データセットを生成し、軽量な代理モデルによって低コストでトラフィックを処理することを提案。TRACERは代理モデルを本番トレースで訓練し、信頼性に応じてデプロイを管理。透明性を持たせるために、入力領域の処理やデプロイ拒否の理由を解釈可能な形で示す。77クラスのベンチマークでは83-100%のカバレッジを達成し、自然言語推論タスクでは正しくデプロイを拒否。システムはオープンソースとして提供。 Comment
元ポスト:
LLMにリクエストされる分類問題タスクのinputとLLM(教師モデル)を収集しておき、低コストで推論可能な代理モデルを学習。リクエストごとに、LLM/代理モデルどちらを利用して推論するかをRoutingし、低コストで分類タスクを解けるようにする、という話に見える。
[Paper Note] Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding, Daisuke Oba+, ICLR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #DiffusionModel #ICLR #Decoding #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- SureLockは、マスク済み拡散型言語モデルにおいて、未マスクトークンをロックすることで計算資源を効率化します。具体的には、未マスク位置の事後分布が安定した場合、その位置に対するクエリ投影とフィードフォワードをスキップしつつ、他の位置がアテンションできるようにキャッシュを使用します。この手法により、計算コストがO(N^2d)からO(MNd)に削減され、生成品質を維持しつつFLOPを30〜50%削減します。理論分析も行い、ロック時点でKLを監視することでトークン確率の偏差を十分に境界づけることができることを示しています。 Comment
pj page: https://daioba.github.io/surelock/
元ポスト:
著者ポスト2:
[Paper Note] Micro Language Models Enable Instant Responses, Wen Cheng+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #One-Line Notes #Reference Collection #Latency #EdgeDevices Issue Date: 2026-04-22 GPT Summary- μLMsを導入し、エッジデバイスで即座に文脈に基づく応答の最初の数語を生成し、クラウドモデルがその後を完成させることで、遅延を隠蔽する協調生成フレームワークを設計。経験的結果は、極小モデルでも大規模モデルと同等の生成が可能であることを示し、リソース制約のあるデバイスでの高い応答性を実現。 Comment
元ポスト:
オンデバイスのMicro LLM(8M--30M)パラメータが冒頭の単語を生成し、その続きをCloud側のLLMが生成することで、Cloud LLMのlatencyの遅さをマスクする
[Paper Note] Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter, Ruoyu Qin+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #LLMServing #Selected Papers/Blogs #reading #One-Line Notes #KV Cache #needs-revision #Author Thread-Post Issue Date: 2026-04-18 GPT Summary- Prefill-decode(PD)のデプロイにはKVCache転送が制限要因となっており、従来のアテンションモデルは大容量のKVCacheトラフィックを生成する。ハイブリッドアテンションアーキテクチャはKVCacheサイズを削減するが、データセンター間の運用に問題が残る。そこで、Prefill-as-a-Service(PrfaaS)を提案し、プリフィル処理を専用クラスタにオフロードして効率的なKVCache転送を実現。これにより、リソースの独立したスケーリングを可能にし、実績として、PrfaaSを用いた異種デプロイメントは従来よりも高い提供スループットを達成。 Comment
元ポスト:
LLM servingにおいて、prefillはcompute-intensiveで、decodeは(kv cacheが肥大化するため)memory-intensiveであるという特性があるため、(それぞれ得意な処理は得意なノードに任せるため)prefillとdecodeを分離して異なるノードで実施するprefill-decode disaggreagated servingというインフラのアーキテクチャが超巨大モデルでは主流だが、prefill-decode間でKV Cacheを転送しなければならないため、このような分離は同じ計算機クラスター内のRDMA(Remote Direct Memory Access)が可能なノード間に限定されるのが一般的である。
しかし、compute/memory特化型のリソースは通常チップの種類と物理的な場所の両方に制約されてプールされるので、両方のハードウェアがRDMAのような密結合なドメインで利用できないという欠点がある。このため、クラスターを超えてPD分離をしたいのだが、KV Cacheの転送が結局のところボトルネックとなる。現在のモデルはSparse/LinearなアテンションによってKV Cacheに必要なリソースが一桁減っているが、それでもnaiveにクラスタを跨いでPD分離をすると、突発的なリクエストのバーストや、不均一なPrefix Cacheの分布、クラスター間の帯域幅の変動などによって、計算効率が低下してしまう。
そのため、提案手法では、高スループットな長文のprefillに特化した独立クラスタを作り、ローカルにキャッシュされていない(主に長文の)、 prefillのみを同クラスタにオフロードし、短いリクエストはローカルでPDを実施するようなアプローチをとる。こうしてprefill特化クラスタによって生成されたKV Cacheはdecode可能なPDクラスタに対してイーサネットを介して転送される。これは選択的なオフロードであり、帯域幅が制限された経路で非効率な短いリクエストを送信を避けて、prefillの高速化が重要なリクエストのみをクラスタ間転送に集中させるという考え方に基づく。
これを実現するためには、(i)長いリクエストのみをオフロードするルーティングの仕組みと、(ii)ネットワークの輻輳を制御するための、帯域幅を考慮したスケジューラ、(iii)リクエスト長、キャッシュ配置、利用可能なクラスタの帯域幅を総合的に考慮してKV Cache全体を効率的を保ちながら管理するグローバルKV Cacheマネージャが必要。
このようなアーキテクチャを1T級のKimi Linearモデルで実験した結果、スループットが1.54倍、TTFTが64%改善した、という感じらしい。
[Paper Note] Geometric Context Transformer for Streaming 3D Reconstruction, Lin-Zhuo Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Transformer #LongContext #3D Reconstruction #3D (Scene) #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- ストリーミング3D再構成は、ビデオから3D情報を復元する技術で、精度や効率が求められる。LingBot-Mapは、SLAMの原理に基づいたフォワード型の3D基盤モデルで、幾何学的文脈トランスフォーマーを使用している。特徴的な注意機構は、アンカー文脈や軌跡メモリを活用し、長距離ドリフト補正を実現。これにより、長いシーケンスでも安定した推論が可能となり、従来手法に対して優れた性能を示した。 Comment
元ポスト:
pj page: https://huggingface.co/robbyant/lingbot-map
高速でlong contextでもstreaming形式で生成が可能な3D Reconstructionモデルのようである
[Paper Note] Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenWeight #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-04-17 GPT Summary- Nemotron 3 Super は、1200億パラメータを持つ新しい Mixture-of-Experts モデルで、事前学習に NVFP4を使用。事後学習には SFT と RL を採用し、最大 1M のコンテキスト長をサポート。推論スループットは従来モデルと比べて最大 7.5 倍向上し、オープンソースのデータセットが提供されています。 Comment
元ポスト:
[Paper Note] BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation, Hippolyte Gisserot-Boukhlef+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LLM-as-a-Judge #Encoder #Reference Collection Issue Date: 2026-04-17 GPT Summary- 語彙評価の限界を調査し、BERT-as-a-Judgeを提案。これは、意味的正確性を評価するもので、人間の判断との相関を改善。少ない訓練で頑健な評価を実現し、出力語彙評価を超える結果を示す。実務者への指針を提供し、成果物を公開して下流の採用を促進。 Comment
元ポスト:
[Paper Note] HiFloat4 Format for Language Model Pre-training on Ascend NPUs, Mehran Taghian+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #mid-training #PostTraining #LowPrecision Issue Date: 2026-04-17 GPT Summary- 大型基盤モデルのトレーニングには高コストが伴うため、低精度トレーニング手法が求められている。本研究では、HiFloat4 FP4フォーマットを使用し、MXFP4と比較して4ビット精度での計算スループットとメモリ効率を最大4倍向上させる。全結合モデルとエキスパート混合モデルをFP4で評価し、安定化技術により数値的劣化を抑えつつ高精度を維持する結果を示した。 Comment
元ポスト:
[Paper Note] Introspective Diffusion Language Models, Yifan Yu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #DiffusionModel #Initial Impression Notes Issue Date: 2026-04-14 GPT Summary- 内省的受容率を定義し、拡散型言語モデル(DLM)の品質向上を目指す。新たに提案されたIntrospective Diffusion Language Model(I-DLM)は、ARトレーニングの内省的一貫性を保ちながら並列デコードを実現する。I-DLMは新しい内省的ストライドデコード(ISD)アルゴリズムを使用し、静的バッチスケジューラで最適化。従来のDLMを上回り、AIME-24で69.6、LiveCodeBench-v6で45.7の性能を達成。これにより、スループットが3倍向上し、大規模サービスへの対応力も強化。 Comment
元ポスト:
github: https://github.com/Introspective-Diffusion/I-DLM
8B級のスケールでARモデルと15種類のベンチマークで同等程度の性能を達成し、large batchsizeでスループットが3.8倍のdLMとのこと。
[Paper Note] FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling, Yitong Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #On-Policy #One-Line Notes #LowPrecision Issue Date: 2026-04-11 GPT Summary- 強化学習ベースのポストトレーニングを用いたテキストから画像への拡散モデルの最適化において、FP4量子化を組み込んだ二段階強化学習フレームワーク「Sol-RL」を提案。第一段で高スループットのロールアウトを行い、高コントラストのサブセットを生成、第二段でこれを高精度で再生成してポリシーを最適化。これにより、ロールアウトの効率を高めつつ訓練整合性を維持。実験により約4.64倍の収束加速を達成し、高性能な整合性を示す。 Comment
pj page: https://nvlabs.github.io/Sana/Sol-RL/
元ポスト:
FP4でまずロールアウトを生成し、rewardモデルを用いて生成結果のスコアを得て、top/worst-Kのサンプルに絞ってBF16で(該当ノイズから)サンプルを再生成しGRPOで活用する。
探索がFP4で実施されるため高速になり、2*K件のサンプルにのみ絞って学習が行われるため2段階の高速化になっている。
[Paper Note] A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens, Tommie Kerssies+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #CVPR #read-later #Selected Papers/Blogs #WorldModels #One-Line Notes #Author Thread-Post Issue Date: 2026-04-11 GPT Summary- ビデオ世界モデリングにおいて、多様な未来状態を効率的に予測するために、DeltaTokというトークナイザーを導入。これによりVFM特徴の差を連続的な「デルタ」トークンにエンコードし、DeltaWorldという生成的世界モデルを提案。これにより、ビデオを一次元の時系列に圧縮、512×512フレームでトークン数を1,024倍削減。多仮説訓練を通じて多様な未来を平行に生成し、単一のフォワードパスで多様な予測を得られる。実験結果においてDeltaWorldは、従来のモデルよりもパラメータ数が35倍、FLOPsは2000倍少ないにもかかわらず、現実に近い未来を予測することを示した。 Comment
過去と現在のフレームを入力し差分の潜在表現を出力するDeltaEncoderを学習し、潜在表現に基づいてnext token predictionをする(複数の推論結果を出力させ、最も学習データに近いものを用いて学習する。複数の候補を出力するため推論時は多様な候補を得られる)。
これにより、予測に必要なトークン数が大幅に削減され(Dino-basedなモデルと比較して1024--2048倍)、パラメータ数が削減されFLOPSも低下(generative modelsと比較して、35倍パラメータ数が小さく、2000倍計算に要するFLOPSが低下)。
といった話が著者ポストで説明されている。
[Paper Note] PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation, Yuma Ichikawa+, ACL'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ACL #Hierarchical Issue Date: 2026-04-08 GPT Summary- PHOTONは、トランスフォーマーの水平スキャンを垂直で多解像度の文脈スキャンに置き換える階層型自己回帰モデルである。ボトムアップエンコーダがトークンを低レートの文脈に圧縮し、軽量なトップダウンデコーダが高精細なトークンを再構築。再帰的生成により最も粗いストリームのみを更新し、ボトムアップの再エンコードを排除。実験では、PHOTONが長いコンテキストやマルチクエリタスクで優れたスループットと品質を示し、KV-cacheトラフィックを削減して最大1000倍のスループットを実現。 Comment
元ポスト:
[Paper Note] Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate, Chen Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Robotics #VisionLanguageActionModel #EmbodiedAI #Realtime Issue Date: 2026-04-05 GPT Summary- VLAモデルを実世界のロボットタスクに展開する際の実行速度が重要であり、以前の研究ではGPUでの計算高速化方法が示されましたが、実際のロボットへの展開は未解決でした。本報告では、VLA駆動ロボットをエンドツーエンドで高速に動作させるための技術セットを提案し、精度と器用さを両立させる手法を説明します。この技術スタックは、校正、計画と制御、学習ベースの最適実行速度特定に広がり、ロボットが人間の操作に匹敵する速度で動作することを示しています。 Comment
元ポスト:
[Paper Note] MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Compute-optimal Scaling of Diffusion Language Models, Chen-Hao Chao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #needs-revision Issue Date: 2026-03-30 GPT Summary- MDM-Primeは部分マスク法を応用し、拡散過程をサブトークンレベルでモデル化することで優れた一般化性能を示しますが、トークン粒度のハイパーパラメータ選択に関するツールが不足し、BPEとの組み合わせで尤度推定が低下します。これを受けて、MDM-Prime-v2を開発し、計算効率を21.8倍向上させ、OpenWebTextで7.77のパープレキシティを達成。11億パラメータに拡張したモデルは、ゼロショット精度でも優れた結果を示しました。 Comment
元ポスト:
[Paper Note] Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning, Kishan Panaganti+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #BudgetAllocation #Author Thread-Post Issue Date: 2026-03-29 GPT Summary- LLMの推論進展は、損失関数の洗練とアライメント戦略の整合によって進むが、標準的なRLパラダイムは一様性に縛られ、難問への対応に非効率を生む。これに対抗するため、動的に訓練分布を適応させるMulti-Adversary GDROを提案。オンライン難易度分類器を導入し、プロンプトを難易度グループに区分。二つのGDROゲームを提示し、頻度バイアスを排除しつつ難易度の高いプロンプトを強化。Qwen3-Baseでの実験により、精度がGRPOと比較して高まることを確認。新たなカリキュラムが観察され、リソースが推論のフロンティアへシフトすることで性能向上を促進。 Comment
元ポスト:
[Paper Note] ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents, Hao Zhang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #ReinforcementLearning #Architecture #SoftwareEngineering #read-later #On-Policy #Stability #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- ProRL Agentは、マルチターンのLLMエージェントにおける強化学習トレーニングを支援するためのAPIサービスであり、ロールアウトのライフサイクル全体を提供するスケーラブルなインフラです。標準化されたサンドボックス環境を通じて、多様なエージェント駆動タスクに対応し、ソフトウェア工学やSTEM関連のタスクで検証されています。ProRL Agentはオープンソースで、NVIDIA NeMo Gymに統合されています。 Comment
元ポスト:
処理が重いロールアウトを独立したhttp serviceとして扱い(rollout-as-a-service)、モデルのtrainingと分離することで、リソース分離、可搬性、拡張性を向上させる。
[Paper Note] Delightful Policy Gradient, Ian Osband, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- Delightful Policy Gradient(DG)は、ポリシー勾配の不均衡なアップデートを解消するために、アドバンテージと行動の驚きの積に基づいたゲーティングを導入。これにより、単一コンテキスト内での方向性の精度を理論的に向上させ、複数コンテキスト間での期待される勾配を精密に近づけることができる。実験的に、DGはREINFORCEやPPOをMNISTや連続制御タスクで上回り、特に難易度の高いタスクで顕著な改善を示した。 Comment
関連:
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
元ポスト:
所見:
著者ポスト:
不要なbackward passの重みを下げるのではなく完全に無くすことで効率化する
[Paper Note] PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost, Junkeun Yi+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #PostTraining #Selected Papers/Blogs #reading #KeyPoint Notes Issue Date: 2026-03-25 GPT Summary- 計算効率とOOD能力のトレードオフを解消するために、PivotRLという新しいフレームワークを提案。局所的なオンポリシーロールアウトで高い分散を持つ情報量豊かな中間ターンを選別し、機能的に同等なアクションに報酬を与えることでポリシー確率の維持を促進。PivotRLは4つのエージェント系ドメインでインドメイン精度を平均4.17%向上、OOD精度を10.04%高め、少ないロールアウトターンでE2E RLと同等の精度を実現した。NVIDIAのNemotron-3-Super-120B-A12Bに採用され、実運用規模のエージェント後訓練の主力として機能中。 Comment
元ポスト:
ポイント解説:
関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01
SFTはデータ効率が良いがOODへの汎化性能が弱い。一方でE2E RLは、OODへの汎化性能が高いが軌跡をfullでロールアウトしなければならず計算コストが高い。この両者の良いところどりができないか?という研究。
SFTデータ(expertのtrajectory)が与えられた時、trajectoryをturnレベルに分割(状態sとアクションaのタプル)。reference policy(RLの初期値に用いるモデル)でロールアウトを行い、
- rewardの分散が0より大きい(すなわち、GRPOのadvanatageが計算可能なターン)
- およびrewardの平均が小さいターン
のみにフィルタリングし、学習する価値の高いターンのみにまずフィルタリングする(D_pivot)。
その上でSFTのような文字列のexact matchによるrewardではなく、ポリシーの出力がactionとしてacceptableなものか否か(完全一致ではなく正しい方向のアクションなら報酬を与える)によって報酬を与えるようなGRPOスタイルのRLで学習する。
E2E RLベースライン(GRPO)と比較して、wall clocktimeベースで4.1--5.5倍程度の速度で同等の性能に到達する。
頻繁にPivotRLの名前を目にするようになってきた。
[Paper Note] DatBench: Discriminative, Faithful, and Efficient VLM Evaluations, DatologyAI+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #IRT #Evaluation #VisionLanguageModel Issue Date: 2026-03-21 GPT Summary- 基盤モデルの評価は研究の進展に不可欠だが、視覚言語モデル(VLM)の評価法は未成熟である。評価が満たすべき三つの条件(忠実性、識別性、効率性)を提案し、複数選択形式や盲目的に解ける問題、誤ラベルのサンプルがモデル評価に与える影響を分析。生成タスクへの変換やサンプルのフィルタリングを行うことで、能力の正確な識別と計算コストの削減を実現。DatBench-Fullを公開し、識別力を保ちながら速度を大幅に向上させることを目指した。この研究は、VLMの進化に合わせた持続可能な評価実践の方向性を示す。 Comment
LLMの評価はコストがかかるため、フルデータではなくサブセットで適切な評価結果が得られると嬉しい。既存のアプローチはrank correlationと呼ばれる手法が用いられ、これはフルデータで評価したモデルのランキングとサブセットで評価したモデルのランキングの相関を測ることでサブセットの評価をする。しかしこの手法には特定の評価suiteにoverfitしやすいという欠点がある。これを是正するためにIRTだぽいアプローチを採用(Raschモデルなどの一般的なIRTとしての定式化ではなさそうな点には注意)して、識別力の高いサンプルを選択してサブセットを構成する手法を提案しているとのこと。直感的にはモデル全体の平均正答率に対して、個々のモデルの平均正答率の分散が小さく、かつモデル全体の正解する確率と不正解となる確率の差分が大きいものを識別力が高いサンプルとみなす。要は強いモデルが一貫して正解し、弱いモデルが一貫して不正解となるサンプルを識別力が高いとみなす。
といった話が元ポストに書かれている。
元ポスト:
[Paper Note] Flash-KMeans: Fast and Memory-Efficient Exact K-Means, Shuo Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#MachineLearning #read-later #Selected Papers/Blogs #Clustering-based #Author Thread-Post Issue Date: 2026-03-14 GPT Summary- 本研究では、$k$-meansアルゴリズムをオンライン処理に適用するために再設計し、既存のGPU実装におけるボトルネックを解消するFlash-kmeansを提案する。この実装は、距離計算とargminを統合し中間メモリの使用を回避、またセントロイド更新の競合を低減する2つの革新を導入。評価結果では、Flash-kmeansが既存のベースラインを最大17.9倍上回り、業界標準ライブラリに対しても大幅なスピードアップを実現した。 Comment
元ポスト:
著者ポスト:
著者ポスト:
デモ動画が含まれており驚異的な速さ
[Paper Note] Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization, Jingwei Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #DataMixture Issue Date: 2026-03-12 GPT Summary- データ混合は大規模言語モデルの訓練における異なるデータソースの組み合わせを指し、効果的な混合選択が下流性能に影響を与える。従来手法は高コストの探索や外挿の失敗に悩む。本研究では、容量認識型混合則(CAMEL)を提案し、モデルサイズと混合の相互作用を用いて検証損失をモデル化。検証損失から下流性能を予測し、計算予算を効果的に配分する方法を導入。最終的にMixture-of-Expertsモデルで実証し、混合最適化コストを50%削減し、下流性能を最大3%向上させることを示した。 Comment
元ポスト:
[Paper Note] Replaying pre-training data improves fine-tuning, Suhas Kotha+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #mid-training #PostTraining #read-later #Selected Papers/Blogs #Scheduler #One-Line Notes #Data Issue Date: 2026-03-07 GPT Summary- ターゲット領域向けの言語モデルの構築には、汎用ウェブテキストでの事前学習とターゲットデータでのファインチューニングが行われる。驚くべきことに、ファインチューニング中に汎用データをリプレイすることで、ターゲットタスクの性能が向上することが確認された。具体的には、4百万トークンのターゲットデータを使用した場合、汎用リプレイによりデータ効率が最大1.87倍、ミッドトレーニングで2.06倍向上した。また、事前学習中にターゲットデータが少ないほどリプレイ効果が高いことが分かった。80億パラメータのモデルでの実験により、エージェントのウェブナビゲーション成功率やバスク語の質問応答精度が向上したことを示した。 Comment
元ポスト:
事前学習以後の中間学習やファインチューニング(事後学習)において、特定のドメインやタスクに特化させるための追加の学習を行う際に、破壊的忘却を防ぐために一定量の事前学習データを混ぜることはよく行われていたが、実際には破壊的忘却を防ぐだけでなく、ターゲットドメインの学習効率を大幅に高める(1.5Bモデルの実験ではファインチューニングでは1.87倍、中間学習では2.06倍)ことがわかり、これは70B級の大規模なモデルでも同様に生じることが明らかになった、という話らしい。興味深い。
解説:
[Paper Note] Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA, Hai Huang+, ICML'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Regularization #ICML Issue Date: 2026-03-05 GPT Summary- 大規模言語モデル(LLMs)のスケーリング法則は記述的であり、データ効率を覆す研究はほとんどなかった。そこで、滑らかなセマンティック多様体上の測地線を辿るGeodesic Hypothesisを提案し、新しいタスクSemantic Tube Prediction(STP)を導入。このタスクはJEPAを言語に一般化し、隠れ状態の軌跡を測地線の近傍に制限することで、多様性を保ちつつ信号対雑音比を改善する。実験により、STPがNL-RX-SYNTHデータセットで基準精度を16分の1のデータ量で達成し、既存のスケーリング法則を超える可能性を示した。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=M8l3MmWaQB
[Paper Note] FlashOptim: Optimizers for Memory Efficient Training, Jose Javier Gonzalez Ortiz+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Quantization #Optimizer #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-05 GPT Summary- パラメータあたりのメモリを50%以上削減する最適化手法FlashOptimを提案。改善されたマスタウェイト分割と8ビットオプティマイザの量子化を活用し、AdamWのメモリを16バイトから7バイト、勾配リリースによりさらに5バイトに削減。これによりモデルのチェックポイントサイズも大幅に減少し、品質を保持しつつ視覚と言語タスクでの劣化は見られなかった。 Comment
元ポスト:
すでにpip install flashoptimで利用可能。SGD, Adam, AdamW, Lionがサポートされている。8Bモデルの訓練に必要なピークメモリを35%削減し、チェックポイントのサイズもも57%小さくなるという優れもの。実験結果では性能の劣化もなしという報告。
[Paper Note] Multi-Head Low-Rank Attention, Songtao Liu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Transformer #Attention #Architecture #Decoding Issue Date: 2026-03-04 GPT Summary- 大規模言語モデルの長文文脈推論におけるKVキャッシュのボトルネックを解消するため、Multi-Head Low-Rank Attention(MLRA)を提案。これにより、4ウェイTPデコードの効率化が実現。実験により、MLRAは最先端の性能を達成し、MLAよりもデコード速度を2.8倍向上させることが確認された。 Comment
元ポスト:
[Paper Note] VidEoMT: Your ViT is Secretly Also a Video Segmentation Model, Narges Norouzi+, CVPR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #ImageSegmentation #CVPR #read-later #Selected Papers/Blogs #Encoder #2D (Image) #3D (Video) #Initial Impression Notes Issue Date: 2026-02-28 GPT Summary- VidEoMTは、専用の追跡モジュールなしで動画セグメンテーションを実現するエンコーダーのみのモデルである。軽量なクエリ伝搬機構を導入し、前フレームの情報を活用することで、フレーム間の連携を図る。時系列に依存しない学習済みクエリと融合により、利益を生み出しつつ追加の複雑さを回避し、最大160 FPSで競争力のある精度を達成した。 Comment
元ポスト:
他タスクでも色々使えそうなアーキテクチャに見える
[Paper Note] Fast KV Compaction via Attention Matching, Adam Zweiger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #read-later #Selected Papers/Blogs #KV Cache #Compression Issue Date: 2026-02-28 GPT Summary- 長い文脈の処理において、KVキャッシュのサイズがボトルネックとなるが、要約による圧縮は情報損失を招く。最近のCartridges研究はコンパクトなKVキャッシュが全文脈に近い性能を持つことを示したが、最適化が遅い。本研究では、Attention Matchingを用い、アテンション出力を再現しながらコンパクトなキーと値を構築する高速な文脈圧縮手法を提案。これにより、効率的な部分問題への分解が可能となり、圧縮時間と品質で大幅な改善を達成し、数秒で最大50倍の圧縮を実現した。 Comment
元ポスト:
[Paper Note] DISCO: Diversifying Sample Condensation for Efficient Model Evaluation, Alexander Rubinstein+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #ICLR #read-later #Selected Papers/Blogs #EfficientEvaluation Issue Date: 2026-02-28 GPT Summary- 機械学習モデルの評価は高コストであり、従来のアプローチは二段階でサブセットを選び、精度を学習する。しかし、選択がクラスタリングに依存するため設計に敏感である。我々は、モデルの応答の多様性を最大化するサンプル選択が重要であると提唱し、$\textbf{DISCO}$手法を提案。これはモデル間の不一致を基にサンプルを選ぶもので、理論的にも最適であり、MMLUやHellaswagなどで最先端の性能を達成した。 Comment
pj page: https://arubique.github.io/disco-site/
元ポスト:
openreview: https://openreview.net/forum?id=SoOgBHa3dZ
[Paper Note] LLMs Can Learn to Reason Via Off-Policy RL, Daniel Ritter+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #read-later #Selected Papers/Blogs #Off-Policy #Author Thread-Post Issue Date: 2026-02-24 GPT Summary- オフポリシーRLアルゴリズム「OAPL」は、大規模言語モデルのトレーニングにおいて重要度サンプリングを使用せず、Lagged Inferenceポリシーを採用。OAPLはGRPOを上回り、DeepCoderと同等の性能を維持しつつ、訓練時間を3分の1に削減。また、Pass@k指標でのスケーリング改善を示し、400ステップ以上のラグを持ちながらも効率的なポストトレーニングを実現する。 Comment
元ポスト:
著者ポスト:
[Paper Note] One-step Language Modeling via Continuous Denoising, Chanhyuk Lee+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Architecture #read-later #FlowMaps Issue Date: 2026-02-20 GPT Summary- 離散拡散に基づく言語モデルの生成速度の向上が期待される中、品質が低下する問題を解決。フロー基盤の言語モデル(FLM)を構築し、ユークリッドデノイジングを利用して訓練安定性と生成品質を向上。蒸留により少数ステップ生成が可能なモデル(FMLM)を取得し、既存のモデルを上回る品質を実現。研究は離散モダリティの生成モデリングに新たな視点を提供し、スケーラブルなフロー基盤アプローチへと導く。 Comment
元ポスト:
v2:
pj page: https://one-step-lm.github.io/blog/
[Paper Note] SLA2: Sparse-Linear Attention with Learnable Routing and QAT, Jintao Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #Attention #DiffusionModel #VideoGeneration/Understandings #Routing #3D (Video) #One-Line Notes #SparseAttention #LinearAttention Issue Date: 2026-02-20 GPT Summary- SLA2は、スパース注意とリニア注意を動的に選択する学習可能なルータを導入し、パフォーマンスを向上させる。さらに、アテンションブランチを組み合わせるための比率や量子化を意識した設計を採用。実験により、動画生成モデルで97%のスパース性を達成し、18.6倍の速度向上を実現した。 Comment
元ポスト:
ポイント解説:
Sparse AttentionとLinear Attentionを動的に選択するルータを学習して効率を向上させる
[Paper Note] EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing, Yehonathan Litman+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #VideoGeneration/Understandings #Editing #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-02-19 GPT Summary- 高忠実度なビデオ編集には、新しい局所的ビデオ文脈モジュールを使用するEditCtrlフレームワークを提案。これにより、マスクされたトークンのみに集中し、計算コストを編集サイズに比例させる。全体の文脈の一貫性を保持しつつ、他の手法に比べて計算効率が10倍向上し、編集品質も改善。テキストプロンプトを利用した新機能を実現。 Comment
pj page: https://yehonathanlitman.github.io/edit_ctrl/
元ポスト:
著者ポスト:
video editing/inpaintingタスクにおいて、editに必要なlocal contextとeditとの一貫性を保つためのglobal contextを分離し、global contextに対するfull-attention計算を削減する(i.e., local contextに計算量を集中させる)ことで効率を向上、という話に見える。
[Paper Note] Scaling Beyond Masked Diffusion Language Models, Subham Sekhar Sahoo+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #Scaling Laws #PostTraining #KeyPoint Notes #DownstreamTasks Issue Date: 2026-02-18 GPT Summary- 拡散型言語モデルは生成速度向上の可能性から自己回帰型モデルの代替手段となり、マスクド拡散が優位なアプローチとして注目されている。本研究では、一様状態拡散法と補間的離散拡散法のスケーリング法則を初めて提示し、マスクド拡散モデルが約12%のFLOPs効率向上を示すことを報告。パープレキシティは拡散ファミリー内で有用だが、他のファミリーとの比較では誤解を招くことがある。全手法を17億パラメータにスケールすると、一様状態拡散は依然として競争力を保ちつつ、GSM8Kで他モデルを上回りつつパープレキシティは悪化する結果となった。 Comment
元ポスト:
pj page: https://s-sahoo.com/scaling-dllms/
Masked Diffusion Language Model (MDLM)はperplexityの観点では高い性能が出るが、異なるDiffusion Algorithmを比較する上でPerplexityが良い指標なのか?がResearch Questionで、3種類の拡散モデル[^1]に基づくモデルを同一の計算量の元でスケーリング時の挙動を分析したとのこと。
その結果、計算量を投入すればするほどARモデルのような綺麗なスケーリング則が全てのモデルで見出されたが、PerplexityがARと同等の性能に到達するためには、MDLMが14--16倍、Duoが23倍、Eso-LMが32倍の計算量を要した。
Perplexityの観点ではMDLMが良さそうだが、Perplexityが良いからといって、サンプル効率、あるいは下流タスクの性能が良いとは限らないため追加の分析を実施。
スループット(token/sec)を変化させて検証したところ、ARは品質が高いが遅く、スループットが高い領域ではDuoがサンプル効率と品質のパレート最適であることがわかり、中くらいの領域ではEso-LMがパレート最適、低い領域でさARがパレート最適であり、スループットと品質の観点ではMDLMは劣ることがわかった。
その後、パラメータ数を1.7Bに固定し、Nemotron Pretrainingデータセットで事前学習をし、zeroshotでの(尤度ベースでの)下流タスクの性能を見ると、MDLMよりもDuoの方が5/7のベンチマークで性能が良く、その後GSM8KでSFTすると、DuoのPerplexityは低かったにも関わらず、全てのモデルを上回った。
[^1]: MDLMに加えて、Uniform-state Diffusion (Duo), Interpolating Diffusion(Eso-LM)というモデルで比較しているようである。この辺はあまり詳しくないので勉強したい。
という話が元ポストに書かれている。
[Paper Note] Image Generation with a Sphere Encoder, Kaiyu Yue+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #Encoder #Encoder-Decoder #2D (Image) #KeyPoint Notes #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- Sphere Encoderは、1回のフォワードパスで画像を生成できる効率的な生成フレームワークです。球面潜在空間への均一な写像を行うエンコーダと、ランダムな潜在ベクトルを画像空間に変換するデコーダを学習し、画像再構成損失のみで訓練を行います。このアプローチにより、複数のデータセットにおいて最先端の拡散モデルに匹敵する性能を示しながら、推論コストを大幅に削減しています。 Comment
元ポスト:
画像を球面状(i.e., 3次元の)の潜在表現にエンコードするエンコーダと、エンコーダに摂動を加えた球面上の点からデコーダを通じて元画像を再構成するデコーダを学習することで、潜在表現から画像のピクセルを直接生成する枠組み。球面上の潜在表現から1回のforward pathで画像を構成するよっに学習するため高速に生成ができる。また、生成した画像をさらにエンコードしデコードすることで、追加のデノイジングstepを実施することができ、画像をより洗練させることができる。4ステップ程度でDiffusion Modelには及ばないものの(ImageNet 256*256でgFID 1.38--2.77)、gFID 4.02--4.76程度のスコア(GAN以上、ADM-Gと呼ばれるDiffusionモデルと同等程度)の画像を生成可能(Table3)という感じに見える。
loss functionはピクセル単位の再構成loss、ピクセルの一貫性に関するloss (i.e., 2つの摂動を加えた潜在表現vが類似した画像を生成するか)をL1_perception lossによって学習する(i.e., ピクセル同士の誤差をスムージングしながら直接測るlossと、既存の学習済み画像エンコーダの潜在表現上でのFeature MapのL1/2距離の組み合わせ)と、
潜在空間の一貫性に関するloss(i.e., 元の潜在表現と、潜在表現をデコード→エンコードした後得られる潜在表現のコサイン類似度)が用いられる式(7,8,9,10)。
[Paper Note] BitDance: Scaling Autoregressive Generative Models with Binary Tokens, Yuang Ai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #Transformer #DiffusionModel #TextToImageGeneration #Decoding #read-later #2D (Image) #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- BitDanceは、バイナリ視覚トークンを予測する自己回帰型の画像生成モデルであり、高エントロピーのバイナリ潜在変数により最大2^{256}の状態を表現できます。バイナリ拡散ヘッドを採用し、標準の分類を超えたトークン生成を実現。次パッチ拡散技術により、複数トークンを高精度で並列予測し、推論速度を8.7倍向上させます。ImageNet 256x256では最高のFIDスコア1.24を達成し、1024x1024画像生成においては従来モデルと比較して30倍以上の速度向上を実現しています。コードとモデルは公開されています。 Comment
pj page: https://bitdance.csuhan.com/
元ポスト:
[Paper Note] CoPE-VideoLM: Codec Primitives For Efficient Video Language Models, Sayan Deb Sarkar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #VisionLanguageModel #Encoder #3D (Video) #One-Line Notes Issue Date: 2026-02-17 GPT Summary- 動画理解のために、動画コーデックのプリミティブを活用し、計算オーバーヘッドを軽減。軽量トランスフォーマーエンコーダにより、トークン生成を大幅に効率化し、一般的なベンチマークで性能を維持。最大で86%の時間短縮と93%のトークン削減を実現。 Comment
元ポスト:
VideoLanguageModelのinputにおあて、より効率的な画像のΔエンコーダを導入して高速化しつつ性能向上
[Paper Note] MonoLoss: A Training Objective for Interpretable Monosemantic Representations, Ali Nasiri-Sarvi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Explanation #RepresentationLearning #Transformer #Encoder #SparseAutoencoder Issue Date: 2026-02-17 GPT Summary- Sparse autoencoders (SAEs)は、多義的な神経表現を単義的特徴に分解する。しかし、従来の学習目的はこの分解を促進せず、単義性指標も効率を低下させる。MonoScore指標を用いて、線形に増加する単一パスアルゴリズムを提案し、評価時に1200倍、トレーニング時に159倍の高速化を実現。これにより、モノセマンティシティ・ロス(MonoLoss)を導入し、一貫した活性化を促進。これにより、クラス純度が大幅に向上し、ImageNet-1Kの精度も改善。コードは公開中。 Comment
元ポスト:
[Paper Note] Causal-JEPA: Learning World Models through Object-Level Latent Interventions, Heejeong Nam+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Transformer #Self-SupervisedLearning #OpenWeight #Encoder #WorldModels #KeyPoint Notes #LatentRepresentation Issue Date: 2026-02-16 GPT Summary- C-JEPAは、オブジェクト中心の世界モデルで、画像パッチからの埋め込み予測を通じてオブジェクトの相互作用を捉えることを目的としている。オブジェクトレベルのマスキングを導入し、潜在的介入を誘発することで反事実的推論を強化し、ショートカット解法を防ぐ。実験結果では、視覚質問応答において約20%の性能向上を示し、エージェント制御タスクでは必要な潜在入力のわずか1%で同等の結果を達成した。さらに、因果的帰納的バイアスを誘発することも示している。 Comment
元ポスト:
pj page: https://hazel-heejeong-nam.github.io/cjepa/
(JEPAは私にとってあまり馴染みがなく、以下の私の解説はどこかに誤りがある可能性が高い)
video basedなシステムを前提、すなわちimageのsequenceが与えられる前提である。このとき、各タイムステップごとに選択されたobjectの状態をマスクし、マスクされたobjectのhistoryを予測し、予測された状態から将来の状態を予測する。objectは状態だけでなく、補足的な観測可能な情報を保持することができ(たとえばアクションと感覚に関するシグナルなど)状態遷移に利用される。また、マスク対象として選択されたオブジェクトの最初のステップの状態だけは、アンカーとして保持する。マスク処理はlatent levelはでのinteiventionとして解釈でき、これにより予測のためにobject間の相互作用を捉えることが誘発され、object centricな潜在表現が学習される。マスクされたオブジェクトの状態は、予測された一つ前のステップでの状態に対してlinearで変換しpositional embeddingを足し合わせることで求められ(式3)、これらの予測されたhistoryの状態がViTの入力となり(bidirectionalなattentionを通じて)将来の状態を予測する。lossは予測されたhistoryの状態と将来の状態が与えられたときに、freezeされたobjectのエンコーダから得られる潜在表現との距離が最小化されるように学習される(エンコーダ側はstop gradientする)。
解説:
[Paper Note] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception, Lai Wei+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #MultiModal #Distillation #VisionLanguageModel #ThinkingWithImages Issue Date: 2026-02-16 GPT Summary- MLLMは視覚理解に優れていますが、微細な知覚には依然として課題があります。最近の手法「Thinking-with-Images」は局所情報を取り入れるもののレイテンシが高い。そこで、Region-to-Image Distillationを提案し、エージェント的ズーミングの利点を1回のフォワードパスに内在化します。マイクロクロップ領域で教師モデルにVQAデータを生成させ、それに基づく信号を全画像に蒸留。これにより、学生モデルはツールなしで微細知覚を改善。新たに提案するZoomBenchにより、モデルの性能を厳密に評価し、複数のベンチマークでトップクラスの成果を示します。さらに、思考の必要性とその利得を議論します。コードは公開されています。 Comment
元ポスト:
[Paper Note] Prism: Spectral-Aware Block-Sparse Attention, Xinghao Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #LongContext #VisionLanguageModel #One-Line Notes #SparseAttention Issue Date: 2026-02-12 GPT Summary- ブロックスパースアテンションの効率を改善するために、平均プーリングによる粗粒度アテンションの不正確さの原因を分析し、Prismというトレーニング不要のアプローチを提案。Prismは、ブロック選択を高周波数と低周波数に分解し、エネルギーベースの温度キャリブレーションで位置情報を復元。結果、フルアテンションと同等の精度を維持しつつ、最大5.1倍の速度向上を達成。 Comment
元ポスト:
sparse attentionにおいて、RoPEとmean poolingによるブロックの重要度の同定が組み合わさったときに、mean poolingがlow pass filterの役割を果たし高周波成分が破壊される(ことを理論的に示した)。このため、低周波成分と高周波成分を分けて扱う手法を提案しているという感じの話らしい。
[Paper Note] Multi-Head LatentMoE and Head Parallel: Communication-Efficient and Deterministic MoE Parallelism, Chenwei Cui+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #MoE(Mixture-of-Experts) #Routing Issue Date: 2026-02-11 GPT Summary- 大規模言語モデルのトレーニングコストに対処するために、新しいアーキテクチャ「マルチヘッドラテントMoE」と「ヘッドパラレル(HP)」を提案。通信コストを$O(1)$に抑え、負荷バランスと決定論的な通信を実現。EPと比較して、最大$1.61\times$のトレーニング速度向上を達成しつつ、性能は維持される。本手法により、数十億パラメータの基盤モデル研究がよりアクセスしやすくなる。 Comment
元ポスト:
[Paper Note] AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent, Yinyi Luo+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #Distillation #PostTraining Issue Date: 2026-02-10 GPT Summary- LLMを用いたマルチエージェントシステムを、AgentArkフレームワークで単一モデルに蒸留し計算効率を向上。三つの蒸留戦略で推論性能と自己修正能力を強化。効率的かつロバストなマルチエージェント開発を目指す。 Comment
関連:
- [Paper Note] Reasoning Models Generate Societies of Thought, Junsol Kim+, arXiv'26, 2026.01
[Paper Note] When RL Meets Adaptive Speculative Training: A Unified Training-Serving System, Junxiong Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Decoding #read-later #SpeculativeDecoding Issue Date: 2026-02-09 GPT Summary- Auroraは、ライブ推論トレースから直接投機的デコーディング学習を行う統一システムを提案。オンラインでの学習を非同期強化学習問題として再定義し、受け入れられたトークンからフィードバックを得てサンプル効率を向上。デイ0での展開をサポートし、迅速な適応と即時のユーティリティフィードバックを提供。実験では、フロンティアモデルに対して1.5倍の速度向上を実現し、静的な投機者にも1.25倍の向上を見せた。 Comment
元ポスト:
公式アナウンス:
[Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #read-later #Selected Papers/Blogs #Stability #KeyPoint Notes #train-inference-mismatch Issue Date: 2026-02-06 GPT Summary- 強化学習におけるPPOの限界を指摘し、低確率トークンの更新が過剰に罰せられる問題を解決するため、ダイバージェンス近似ポリシー最適化(DPPO)を提案。DPPOは、ポリシーの逸脱を直接推定することで学習ダイナミクスの非最適性を改善し、効率的なバイナリおよびトップK近似を導入することでトレーニングの安定性と効率を向上させる。 Comment
元ポスト:
PPOはトークン単位の確率比をrefと現在のポリシーからの算出しrefから離れすぎないようにクリッピングをするが、この場合非常に低確率で出現するトークンは過剰にクリッピングされる傾向にある。しかしその低確率トークンを調べると実はReasoningにおいて重要なトークンであったり(Wait, Thus, Next)、数学での重要なシンボル(+,-,=)、数値トークンであり、結果的にこれらReasoning系のタスクで重要なトークンの学習を阻害してしまっており(実際にこれらの低確率トークンをクリッピングされないようにしたら学習効率が大幅に改善)、語彙数が多いLLMの学習においては相性が悪い(別の視点として高確率トークンに対して過剰にペナルティを与えるという傾向もある)。これを改善するために、確率比をクリッピングするのではなく、ポリシーとrefのDivergenceの上界を直接制約することで解決し(語彙数が大きすぎてDivergenceを計算できないので近似的な計算方法も提案されている模様)、実際に適用すると学習が非常に安定し、かつ学習効率が既存手法と比較して高まりました、という話にみえる。
解説:
一言解説:
400B級のモデルの事後学習で、
- エントロピー崩壊を防ぎ
- より高速で安定して収束し
- context長の外挿に強い
ことが確認されたとの報告がある。
- Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
[Paper Note] Residual Context Diffusion Language Models, Yuezhou Hu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel Issue Date: 2026-02-06 GPT Summary- 捨てられたトークンの計算を再利用し、残留文脈拡散(RCD)を提案。RCDは文脈情報を次のデノイジングステップに注入し、トレーニングパイプラインを二段階に分けて効率性を向上。従来のdLLMを最小限のオーバーヘッドで5-10ポイント精度向上。特にAIMEタスクで精度をほぼ倍増。 Comment
元ポスト:
[Paper Note] Scaling Small Agents Through Strategy Auctions, Lisa Alazraki+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #SmallModel #SelfCorrection #memory #KeyPoint Notes #Scalability Issue Date: 2026-02-05 GPT Summary- 小規模言語モデルはエージェント型AIの有望なアプローチとして注目されているが、複雑なタスクでは大型モデルが必要な場合が多い。本研究では、SALEというフレームワークを提案し、エージェントが短期的な戦略計画でタスクを効率化し、コストを削減しながら自己改善を行う様子を示す。SALEは、最大エージェントへの依存を53%減少させ、コストを35%低下させることができる。これらの結果は、小型エージェントが複雑な業務には限界があるが、協調的なタスク割り当てを通じてスケールアップ可能であることを示唆している。 Comment
元ポスト:
AIエージェントにおいて、小規模モデルは費用対効果が良い選択として期待されているが、結局のところ困難なタスクでは大規模なモデルと比較して性能が低下することから限界を指摘。費用対効果を最大化するためにフリーランスを参考に、候補となるエージェントによる入札方式を採用。エージェントはタスクを解くための戦略をプランニングし、提出された戦略をスコアリングし、かつ推定されるコストから最も費用対効果の良いエージェントを採用することでタスクを解かせるような枠組みを提案している模様。入札に負けたエージェントは、過去の入札履歴が長期メモリに蓄積されるため、それらをcontextに組み込むことで重み更新なしで自身のプランニングを改善していくことができる、というような話に見える。
[Paper Note] EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL, Lunjun Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #One-Line Notes Issue Date: 2026-02-05 GPT Summary- LLMのために強化学習のポリシー勾配アルゴリズムを改善するため、固定アンカーポリシーをEMAに置き換え、Top-k KL推定器を導入。これにより、性能が大幅に向上し、数学的推論ではQwen-1.5BがOlympiadBenchで53.9%を達成。Qwen-3Bでは、EMA-PGがGRPOを7つのデータセットで平均33.3%改善し、特にHotpotQAや2WikiMultiHopQAにおいて顕著な向上を示した。全体として、EMA-PGはLLMの強化学習をスケールするための有力なアプローチである。 Comment
元ポスト:
ポイント解説:
KL正則化のRefが古くなりすぎるので指数移動平均(直近の更新重視の移動平均)を用いて更新されるようにし、KLの計算が重いのでTopKのトークンで近似的に計算することで高速化、という感じに見える。
[Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #RLVR #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-02-05 GPT Summary- 強化学習を用いてモデルを訓練する際、尤度の最大化ではなく低次近似を最適化する限界に触発され、最大尤度強化学習(MaxRL)を提案。これは、サンプリングされたデータから最大尤度を近似するためのフレームワークであり、得られた目的関数はシンプルで偏りのないポリシー勾配推定を可能にする。実験では、MaxRLが既存の手法を上回り、テスト時間効率を最大20倍向上。追加データや計算へのスケーラビリティも優れており、RL訓練を正確性に基づいて拡張するための有望なフレームワークであることを示した。 Comment
元ポスト:
著者ポスト:
pj page: https://zanette-labs.github.io/MaxRL/
skim readingしかできていないが、
微分不可能な生成がされbinaryの正誤が与えられるような条件下でモデルを最適化するときにxが与えられてyが正解である確率はimplicitな尤度を表している。この最適化問題を解くために現在はRLが利用されており、RLは正解の確率pを最大化するような定式化がされているが、最尤推定で定式化するとlog pで定式化をすることになり、これは根本的に異なる最適化となる。具体的には、RLはpass@1に対して最適化しているが、MaxRLはk=1,...∞に対するpass@kの調和平均に対して最適化をするような違いがある。この最尤推定の勾配は実は成功したtrajectoryのスコアの平均という非常にシンプルな形で近似的に求められるらしく、最尤推定として解くと最大20倍程度効率が向上した、といった話に見える。
関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
- [Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02
所見:
所見:
[Paper Note] $V_0$: A Generalist Value Model for Any Policy at State Zero, Yi-Kai Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #In-ContextLearning #PostTraining #Stability #Scheduler #Routing #Initial Impression Notes #BudgetAllocation Issue Date: 2026-02-05 GPT Summary- GRPOを用いた訓練において、$V_0$という新たなバリューモデルを提案。これはパラメータ更新を必要とせず、モデルの期待パフォーマンスを推定し、能力の変化を捉える。$V_0$は成功率を予測し、効率的なサンプリングを実現。結果、LLMルーティングタスクにおいて、コストとパフォーマンスのバランスで優れた結果を示した。 Comment
元ポスト:
ポイント解説:
Actor-Critiqueの枠組みにおいてValueモデル(のポリシーに追従するための逐次的な更新が)重すぎる問題をGRPOはValueモデルを無くすことで回避したが今度はロールアウトのサンプリングコストがでかすぎる問題があるので、学習無しで汎用的に利用可能なValueモデル(パラメータ更新ではなくICLとして定義する)を用いて、ロールアウト前から成功率を予測し無駄なロールアウトを削減したり、クエリをどのモデルに投げるかといったルーティングをするなどの計算機リソースの配分を決めるといったことをやるらしい。
[Paper Note] HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing, Yizhao Gao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Transformer #Attention #Architecture #KV Cache #Hybrid #SparseAttention #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 新しいアーキテクチャ「ハイブリッド疎注意」(HySparse)を提案。全注意層と疎注意層を交互に配置し、疎層のトークン選択を全注意層から導出。これにより、トークンの重要性予測が簡素化され、KVキャッシュの再利用が可能に。評価では、7B密集モデルと80B MoEモデルの両方で全注意およびハイブリッドSWAのベースラインを超え、特に49層の80B MoEモデルで顕著な性能向上とKVキャッシュの10倍削減を実現。 Comment
元ポスト:
ポイント解説:
Full attentionとsparse attentionを組み合わせたアーキテクチャの提案で、Full attentionと同等以上の性能を効率的に達成し、sparse attentionではfull attentionのKV Cacheを再利用するように設計されていることから、KV Cacheのスペースを大幅に削減できて嬉しい、という話に見える。
[Paper Note] FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space, FSVideo Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #3D (Video) #ImageToVideoGeneration Issue Date: 2026-02-05 GPT Summary- FSVideoは、高速なトランスフォーマーベースの画像から動画(I2V)への拡散フレームワークで、圧縮された潜在空間を持つ動画オートエンコーダー、強化された層間の情報フローを持つ拡散トランスフォーマー、少数ステップのアップサンプラーを利用して多解像度生成を実現。最終モデルは14BのDITベースとアップサンプラーを含み、競争力のある性能と優れた速度を誇る。モデル設計とトレーニング戦略も詳述。 Comment
pj page: https://kingofprank.github.io/fsvideo/
元ポスト:
[Paper Note] Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training, Shengrui Li+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #ModelMerge #DataMixture Issue Date: 2026-02-03 GPT Summary- データミクスの最適化はLLMの事前学習において重要であるが、効果的な探索手法が不足している。本研究では、訓練からデータミクス探索を切り離す「DeMix」を提案し、統合モデルを通じて最適なデータ比率を予測する。広範な実験により、DeMixは探索コストを抑えつつ高い性能を実現する。また、検証済みのミクスを含む22兆トークンのデータセット「DeMix Corpora」を公開。 Comment
元ポスト:
関連:
- [Paper Note] RegMix: Data Mixture as Regression for Language Model Pre-training, Qian Liu+, ICLR'25
[Paper Note] Learn to Reason Efficiently with Adaptive Length-based Reward Shaping, Wei Liu+, ICLR'26, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #ICLR #Length #PostTraining #Adaptive Issue Date: 2026-02-03 GPT Summary- 推論の効率を向上させるため、RLベースの手法LASERを提案。長さに基づく報酬シェイピングを用いて、冗長性を減少させつつ、パフォーマンスと効率の良好なバランスを実現。また、動的な報酬仕様と難易度を考慮した手法LASER-Dを導入し、簡潔な推論パターンを促進。実験により、推論性能と応答の長さ効率が大幅に向上した。 Comment
元ポスト:
[Paper Note] TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification, Haoyun Jiang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #Selected Papers/Blogs #Verification #SpeculativeDecoding #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- SDを用いて推論効率を向上させる新しいフレームワークTriSpecを提案。軽量なプロキシを活用し、不確実なトークンに対してのみターゲットモデルを使用することで、計算コストを大幅に削減。実験により、従来のSDに対して最大35%の速度向上とターゲットモデルの呼び出し回数を最大50%削減したことを示す。 Comment
元ポスト:
targetモデルでのverificationは重いので、軽量なverificationをdraftに対して実施することで最大35%デコーディング速度向上とのこと。
verificationに利用するLLM(=proxy)がどのようなモデルファミリーなのか、ターゲットと同じファミリーなのか否かなどが気になる。
3.1節に以下のように書かれている:
> We identify smaller same-family models as ideal proxy veri-
fiers, justified by the following three core properties.
proxyについて以下の三つの観点で分析している:
- strong alignmentw: トークンレベルでtargetとalignしているかを分析(exact match, acceptable mismatch, unacceptable mismatchの3値分類)
- trustworthy outputs: token levelでalignしているだけでなく、単独で応答させたときにtargetと同じ回答が得られるか(同じ回答が得られるのであれば多少のトークンレベルの齟齬は許容可能
- Clear separability: proxyが信頼できるトークンと不確実な出力を区別できることが好ましく、proxyのtop1,2のprobabilityの差が0.5より大きい場合にacceptableなトークンと強い相関があることがわかり、verificationの信頼性の担保に使える
同じモデルファミリーでも、よりファミリー内での挙動が一致させるような副次的効果を得られるモデルファミリー構築方法もあり、Speculative Decodingの承認率が向上するような話もある:
- [Paper Note] Efficient Construction of Model Family through Progressive Training Using Model Expansion, Kazuki Yano+, COLM'25, 2025.04
openreview:
https://openreview.net/forum?id=yhhgkkiQe5
提案手法の気持ちや、検証コストに焦点を当てたことは非常に有意義であるものの、Speculative Decodingの(数学的な)ロスレス保証を、実験的には性能がほとんど低下しないことが示されているが、数学的な保証を犠牲にして速度改善している点が実用上の大きな課題で、プロキシを挟むアイデアが既存研究の階層的、マルチレベルのSD, 検証の条件を緩める手法と比較して新規性が明らかでない点、また通常のSDと比較して3つのモデルを用いる点でエンジニアリングの観点からオーバーヘッドなしに主要な推論スタックにデプロイできるのか、実験結果の再現性や公式の報告とズレがある点などが指摘され、ICLR'26にrejectされている。
[Paper Note] Reinforcement Learning via Self-Distillation, Jonas Hübotter+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #One-Line Notes #TextualFeedback #SelfDistillation Issue Date: 2026-01-30 GPT Summary- リッチフィードバックを活用した強化学習手法SDPOを提案。従来の手法がスカラー報酬に依存するのに対し、SDPOは豊富なテキストフィードバックを用いてセルフディスティレーションを行い、モデルの誤りを特定。科学的推論や競技プログラミングにおいて、サンプル効率と精度を向上し、標準的なRLVR環境でも優れた性能を発揮。テスト時には試行回数を削減しつつ、発見確率を維持可能。 Comment
あるポリシーでロールアウトを実行し、ロールアウトの実行結果からフィードバック(e.g., runtime error messageやLLM-as-a-Judgeによるtextual feedbackなど)を得たときに、同ポリシーに対してフィードバックをcontextとして与えた上でロールアウトのtoken levelでのlog probを比較することで、token levelでどこが誤っていたかに関する学習シグナルを得る。
ポイント解説:
[Paper Note] Revisiting Parameter Server in LLM Post-Training, Xinyi Wan+, ICLR'26, 2026.01
Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #SoftwareEngineering #PostTraining Issue Date: 2026-01-29 GPT Summary- ODC(オンデマンド通信)は、バランスの取れない負荷を持つLLMのポストトレーニングに対処するため、集団通信をポイントツーポイント通信に置き換え、FSDPを適応させる手法。これにより、同期障壁が減少し、より効率的な負荷バランシングを実現。ODCは、デバイスの利用率とトレーニングスループットを向上させ、FSDPに対して最大36%のスピードアップを達成した。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=iIEEgI6WsF
[Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #One-Line Notes Issue Date: 2026-01-27 GPT Summary- 強化学習(RL)の限界を克服するために、Privileged On-Policy Exploration(POPE)を提案。POPEは、人間やオラクルからの特権情報を活用し、困難な問題の探索を促進するアプローチで、非ゼロ報酬を得ることで学習を進める。実験により、POPEが困難な推論タスクにおける性能を大幅に向上させることを示した。 Comment
関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
skim readingしかできていないが、本研究は人間が記述したオラクルを接頭辞として使い、ポリシーの方向性をガイドすることでアシストするが、こちらのReuse your FLOPsは過去のロールアウトで成功したtrajectoryを再利用して接頭辞として利用する点が異なるように見える。
RLが解くのが困難な問題に対して接頭辞としてオラクルの情報を与えることで学習シグナルのスパースさを解決する
[Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-01-27 GPT Summary- PrefixRLは古いサンプリングデータを活用し、オフポリシーの不安定性を回避しつつ、オンポリシーでの強化学習を行う手法です。これにより、学習信号が強化され、従来のRLよりもサンプル効率が向上。また、PrefixRLは難しい推論問題において、より早く同等のトレーニング報酬を達成し、他のモデルファミリーに対しても適応可能であることを示しています。 Comment
元ポスト:
同じタイミングで上記POPEが提案された。POPEは人間が記述したオラクルを接頭辞として使い、ポリシーの方向性をガイドすることでアシストするが、こちらのReuse your FLOPsは過去のロールアウトで成功したtrajectoryを再利用して接頭辞として利用する点が異なるように見える。
著者ポスト:
[Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Architecture #MoE(Mixture-of-Experts) #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-01-27 GPT Summary- MoEアーキテクチャを再評価し、推論コストの最適化に焦点を当てた研究。新しいモデルLatentMoEを導入し、最大95Bパラメータのスケールで優れた精度を実現。これにより、Nemotron-3スーパーおよびウルトラモデルに適用され、パフォーマンスが向上した。 Comment
元ポスト:
ポイント解説:
MoEに用いるhidden_stateの次元数が小さくなるようにlinear layerで圧縮しノード間のtrafficを削減しつつ、その分expert数やtop-kで選択するkを増やす。
[Paper Note] Controlled LLM Training on Spectral Sphere, Tian Xie+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NeuralNetwork #Pretraining #MachineLearning #NLP #LanguageModel #Optimizer #Stability Issue Date: 2026-01-23 GPT Summary- 大規模モデルの最適化には、安定性と迅速な収束を保証する戦略が不可欠。新たに導入したスペクトルスフィアオプティマイザー(SSO)は、重みと更新に厳密なスペクトル制約を適用し、完全に安定した最適化プロセスを実現。多様なモデルアーキテクチャでの事前トレーニングにより、SSOはAdamWやMuonよりも一貫して高い性能を示し、安定性の向上も確認された。
[Paper Note] Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow, Haocheng Xi+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #train-inference-mismatch #LowPrecision Issue Date: 2026-01-21 GPT Summary- 強化学習(RL)はLLMの推論能力を向上させるが、既存のトレーニングは非効率で、ロールアウトに多くの時間を要する。FP8精度による量子化RLトレーニングがボトルネック解消の有力候補であるが、BF16トレーニング + FP8ロールアウトの戦略は不安定さを招く。我々はJet-RLを提案し、トレーニングとロールアウトに統一されたFP8フローを採用することで数値的ミスマッチを減少させる。実験により最大33%のロールアウト速度向上と41%のトレーニング速度向上を達成し、安定した収束を実証した。 Comment
元ポスト:
関連:
- [Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10
こちらはFP16だが。
[Paper Note] STEM: Scaling Transformers with Embedding Modules, Ranajoy Sadhukhan+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #Pretraining #NLP #Transformer #LongContext #Architecture #read-later #Selected Papers/Blogs #Inference #Stability #Latency #Interpretability #Author Thread-Post Issue Date: 2026-01-17 GPT Summary- STEMは、Transformersに埋め込みモジュールを用いてスパーシティを効果的に処理し、安定したトレーニングを実現します。FNNのアッププロジェクションを埋め込みのルックアップに置き換え、トークンごとの計算を削減しつつ、性能を向上させます。知識の保存や解釈性を向上させ、長いコンテキストでも効果を発揮。350Mおよび1Bモデルで約3~4%の精度向上を達成し、知識や推論のベンチマークで優れた結果を示しました。 Comment
元ポスト:
著者ポスト:
[Paper Note] AnyDepth: Depth Estimation Made Easy, Zeyu Ren+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #DepthEstimation Issue Date: 2026-01-14 GPT Summary- 単眼深度推定に関する新しい軽量フレームワークを提案し、DINOv3を用いて高品質な特徴を取得。Simple Depth Transformerを設計し、計算オーバーヘッドを削減して精度を保ちながら85%-89%のパラメータ削減を実現。品質フィルタリング戦略でデータセットのサイズを縮小しつつトレーニング品質を向上。広範な実験により、DPTを上回る精度を確認。本研究は効率的なゼロショット深度推定の実現に向けたモデル設計とデータ品質の重要性を示す。 Comment
pj page: https://aigeeksgroup.github.io/AnyDepth/
元ポスト:
[Paper Note] Dr. Zero: Self-Evolving Search Agents without Training Data, Zhenrui Yue+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #QuestionAnswering #ReinforcementLearning #AIAgents #SelfImprovement #PostTraining #On-Policy #KeyPoint Notes Issue Date: 2026-01-14 GPT Summary- データフリー自己進化が注目される中、大規模言語モデル(LLM)のための「Dr. Zero」フレームワークを提案。多様な質問を生成し、自己進化フィードバックループで解決者をトレーニング。HRPOを導入し、類似質問のクラスタリングを行うことで計算効率を向上。実験結果は、データフリーの検索エージェントが監視型と同等以上の性能を達成することを示す。 Comment
元ポスト:
(検索とReasoningを通じてSolver用の学習データとしてのverifiableな)QAを生成するProposerと、それを(検索とReasoningを通じて)解決するSolverの双方をRLするような枠組みで、ProposerはSolverからのDifficulty Reward (QAのverifiabilityとSolverの成功率(自明でなく難しすぎもしない丁度良い難易度か, 式(4))として受けとりHRPOと呼ばれる手法で改善、SolverはGRPOでRLVRする、といった枠組みに見える。QAはProposerが合成するので事前にデータを用意する必要がない、ということだと思われる。
HRPOはGRPO同様にon policyなRL手法であり、従来のself-evolving手法ではsingle hopなQuestionに合成結果が偏りやすく、かつon policyな手法でProposerを学習しようとしたときに、naiveにやるとm個のクエリに対して、クエリごとにsolverのn個のロールアウトが必要な場合、(m+1)*n回のロールアウトがpromptごとに必要となるため、計算コストが膨大になりスケーリングさせる際に深刻なボトルネックとなる問題を解決したものである。
具体的には、単一のpromptに対して複数のsolverによるロールアウトからadvantageを計算するのではなく、同じhop数の合成されたQAでクラスタリングを実施しておき、そのグループ内の(構造や複雑度がhop数の観点で類似した)QAに対するロールアウトに基づいてadvantageを計算する(3.2切に明記されていないが、おそらくロールアウトはQAごとに少数(1つ))。似たようなhop数を要するQAによってadvantageが正規化されるためadvantageの分散を小さくとることが期待され、かつロールアウトの回数を減らせるため計算効率が良い、という利点がある(3.2節)。
解説:
[Paper Note] MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head, Kewei Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #Transformer #Attention #Architecture #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- トランスフォーマーの自己注意の複雑さが大規模アプリケーションでの利用を制限する中、効率的な線形注意の適用は性能低下を招くことがあります。本研究では、モデルの表現の多様性を失わせる「グローバルコンテキスト崩壊」の問題を特定し、トークン次元に沿った注意計算による「マルチヘッド線形注意(MHLA)」を提案します。MHLAは線形の複雑さを保ちながら、ソフトマックス注意の表現力を回復することに成功し、様々なドメインでImageNet分類で3.6%、自然言語処理で6.3%、画像生成で12.6%、動画生成で41%の性能改善を達成しました。 Comment
pj page: https://dagroup-pku.github.io/MHLA/
元ポスト:
(読了前の第一印象)スループットを大幅に向上させながらも、大幅な性能改善をしている新たなlikear attention手法であり、image, video, textの3つのモダリティに対して性能向上しているように見えるため、結果のインパクトが大きく重要論文に見える。
[Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #read-later #Selected Papers/Blogs #memory #Reference Collection Issue Date: 2026-01-14 GPT Summary- 条件付きメモリを用いたMixture-of-Experts (MoE)の拡張により、知識検索の効率を向上。Engramモジュールを通じて古典的なN-gram埋め込みのO(1)ルックアップを実現し、ニューラル計算と静的メモリの最適なトレードオフを導出。27Bパラメータでのスケーリングが同等のMoEベースラインを上回り、知識検索や一般推論、コード・数学領域で顕著な性能向上を示す。局所的依存性のルックアップでアテンション容量を解放し、長文脈検索能力を強化。Engramは次世代スパースモデルに不可欠なモデルプリミティブを提供する。 Comment
元ポスト:
所見:
解説:
解説:
ポイント解説:
先行研究:
- [Paper Note] Scaling Embedding Layers in Language Models, Da Yu+, NeurIPS'25, 2025.02
[Paper Note] FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection, Mingyu Ouyang+, CVPR'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #CVPR #VisionLanguageModel #Grounding #GUI Issue Date: 2026-01-13 GPT Summary- 視覚言語モデル(VLM)を用いたUIグラウンディングタスクに関する研究で、FocusUIという効率的なフレームワークを提案。冗長トークンを排除し、指示に関連する視覚トークンを選択しつつ、位置的連続性を保持する新戦略を採用。これにより、4つのベンチマークで優れた性能を発揮し、特にScreenSpot-Proでは3.7%の性能向上を達成。視覚トークン保持率が30%でも高い推論速度と低メモリ使用を実現。 Comment
元ポスト:
[Paper Note] Token-Level LLM Collaboration via FusionRoute, Nuoya Xiong+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #Routing #One-Line Notes Issue Date: 2026-01-10 GPT Summary- FusionRouteは、軽量なルーターを用いて、各デコーディングステップで最適な専門家を選択し、その専門家の出力を補完するトークンレベルのマルチLLMコラボレーションフレームワークを提案。これにより、ドメイン特化型モデルの効率性を保ちながら、一般化能力を向上させる。実験では、Llama-3やGemma-2といったモデルで、数学的推論やコード生成などのタスクにおいて優れた性能を示した。 Comment
元ポスト:
トークンレベルでモデルを選択して生成する
[Paper Note] Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning, Vaishnavi Shrivastava+, ICLR'26, 2025.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #On-Policy #Overthinking #Reference Collection #Author Thread-Post Issue Date: 2025-08-14 GPT Summary- GFPO(Group Filtered Policy Optimization)を提案し、応答の長さの膨張を抑制。応答を長さとトークン効率に基づいてフィルタリングし、推論時の計算量を削減。Phi-4モデルで長さの膨張を46-71%削減し、精度を維持。Adaptive Difficulty GFPOにより、難易度に応じた訓練リソースの動的割り当てを実現。効率的な推論のための効果的なトレードオフを提供。 Comment
元ポスト:
ポイント解説:
著者ポスト:
openreview: https://openreview.net/forum?id=UKOqoULbZS
[Paper Note] Log-Linear Attention, Han Guo+, ICLR'26
Paper/Blog Link My Issue
#NLP #Transformer #Attention #Architecture #ICLR #Reference Collection Issue Date: 2025-06-10 GPT Summary- 対数線形注意を提案し、線形注意の効率性とソフトマックス注意の表現力を両立。固定サイズの隠れ状態を対数的に成長する隠れ状態に置き換え、計算コストを対数線形に抑える。Mamba-2とGated DeltaNetの対数線形バリアントが線形時間のバリアントと比較して優れた性能を示すことを確認。 Comment
元ポスト:
解説ポスト:
openreview: https://openreview.net/forum?id=mOJgZWkXKW
[Paper Note] Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch, Arthur Douillard+, COLM'25, 2025.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #COLM #DistributedLearning Issue Date: 2026-04-26 GPT Summary- 大規模言語モデルの学習において、通信帯域幅の要求を減少させるため、パラメータのサブセットのみを順次同期し、学習を継続しながらデータを量子化。これにより、必要な帯域幅を約100分の1に削減し、品質を維持したまま十億規模のパラメータの分散学習を実現。 Comment
openreview: https://openreview.net/forum?id=yYk3zK0X6Q
DiLoCoでは、データをsplitし異なるノードに持たせ、それぞれのノードが独立して学習した後、定期的にモデルの重みを同期するような枠組みを提案した。
本研究では、重みを同期する際のボトルネックを
- 全ての重みを一度に同期するのではなく、サブセットを共有し、
- 共有する勾配を4bitに量子化することで通信に必要なピーク帯域幅を削減することでlatencyを最小化し、
- 重みを共有している間も学習は継続するstreamingの性質を持たせる
ことで、通信コストを低減しつつ学習効率を改善したようである。
[Paper Note] InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation, Weilin Zhao+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #SparseAttention Issue Date: 2026-02-17 GPT Summary- 長いシーケンス処理のためのInfLLM-V2フレームワークを提案。密-疎切替可能な注意機構により、短い入力には密な注意を、長い入力にはスパース注意を使用し、パラメータを再利用して計算効率を向上。実験では、InfLLM-V2は密な注意より4倍速く、長文理解で98.1%、思考推論で99.7%の性能を維持。再現可能なハイブリッド推論モデルMiniCPM4.1を訓練・オープンソース化。
[Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Attention #LongContext #Architecture #ICLR #Selected Papers/Blogs #LinearAttention Issue Date: 2026-02-04 GPT Summary- 線形トランスフォーマーの限界を克服するため、ゲーティングとデルタ更新ルールの2つのメカニズムを組み合わせた「Gated DeltaNet」を提案。これにより、迅速なメモリ消去とターゲット更新を実現し、言語モデリングや長文理解などのタスクで既存モデルを上回る性能を達成。ハイブリッドアーキテクチャを用いることでトレーニング効率も向上。 Comment
openreview: https://openreview.net/forum?id=r8H7xhYPwz¬eId=U0uk5A0VlT
linear attention:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
Mamba2(linear attention with decay):
- [Paper Note] Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality, Tri Dao+, ICML'24
Gated DeltaNet 図解:
[Paper Note] Scaling Embedding Layers in Language Models, Da Yu+, NeurIPS'25, 2025.02
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #NeurIPS #One-Line Notes Issue Date: 2026-02-01 GPT Summary- 新手法$SCONE$は、言語モデルの性能向上のために入力埋め込み層を拡張し、元の語彙を保持しながら頻出n-gramの埋め込みを導入します。これにより、各トークンに文脈化された表現を提供し、埋め込みは訓練中に別のモデルで学習され、推論中にオフアクセラレータメモリから迅速に照会されます。$SCONE$は、埋め込み数の増加とモデルのスケールアップを実現し、1Bパラメータのモデルが1.9Bパラメータのベースラインを上回りながら、推論時のFLOPSとメモリを約半減することを示しています。 Comment
元ポスト:
関連:
- [Paper Note] Scaling Embeddings Outperforms Scaling Experts in Language Models, Hong Liu+, arXiv'26, 2026.01
- [Paper Note] L$^3$: Large Lookup Layers, Albert Tseng+, arXiv'26, 2026.01
あとでもう少ししっかり読みたいのだが、(Vocabularyをシンプルに増やしてスケーリングさせるのではなく、input embedding layerを拡張するために、LLM本体と独立したモジュールとして)通常のVocabularyに追加して、頻出するn-gram(f-gram)によるVocabularyを拡張した新たな小さなtransformerモジュールを定義し、contextを考慮した各トークンのembeddingを出力するよう学習する。独立したモデルとして定義することで、embeddingを事前に計算してオフローディングしておき高速にlookupすることが可能となり、FLOPSを増やさずにembeddingをスケーリングできて、リッチな入力表現を扱える。f-gramの数をスケールさせると性能もスケールする、といった話に見える。
[Paper Note] Inference-Time Hyper-Scaling with KV Cache Compression, Adrian Łańcucki+, NeurIPS'25, 2025.06
Paper/Blog Link My Issue
#LanguageModel #Distillation #NeurIPS #Test-Time Scaling #PostTraining #KV Cache #Latency Issue Date: 2026-01-25 GPT Summary- 推論時のスケーリングでは、生成効率と精度のトレードオフが求められる。LLMにおいて生成コストはKVキャッシュのサイズに依存するため、KVキャッシュの圧縮が鍵となる。新手法のダイナミックメモリスパーシフィケーション(DMS)を導入し、学習不要のスパースアテンションよりも高い精度を維持しつつ8倍の圧縮を達成。DMSは重要な情報を保持しつつトークンの削除を遅延させる。実験により、DMSを用いることで複数のLLMファミリーにおいて精度向上を実証した。 Comment
[Paper Note] Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models, Yonggan Fu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SmallModel #OpenWeight #Architecture #read-later #Selected Papers/Blogs #EvolutionaryAlgorithm #Latency #Operator Issue Date: 2026-01-23 GPT Summary- SLMの効率的な展開はレイテンシ制約のあるアプリで重要。本研究は、SLMのレイテンシ決定要因を特定し、深さと幅の比率、オペレータ選択が鍵であることを示す。深く細いモデルが精度向上につながるが、トレードオフフロンティアからは外れることがある。新しい効率的アテンションの代替手段を評価し、最適なオペレータを用いた進化的検索フレームワークを開発。さらに重み正規化技術を用い、SLMの性能を向上。新ハイブリッドSLM「Nemotron-Flash」は、精度を平均+5.5%向上させ、レイテンシを大幅に低下、スループットを著しく改善。 Comment
解説:
[Paper Note] Harnessing Diversity for Important Data Selection in Pretraining Large Language Models, Chi Zhang+, ICLR'25 Spotlight, 2024.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #ICLR #read-later #Diversity #Selected Papers/Blogs #DataMixture #Generalization #One-Line Notes #DownstreamTasks #Adaptive #Multi-Armed Bandit Issue Date: 2026-01-21 GPT Summary- データ選択は大規模言語モデルの事前トレーニングにおいて重要で、影響スコアでデータインスタンスの重要性を測定します。しかし、トレーニングデータの多様性不足や影響計算の時間が課題です。本研究では、品質と多様性を考慮したデータ選択手法\texttt{Quad}を提案します。アテンションレイヤーの$iHVP$計算を適応させ、データの品質評価を向上。データをクラスタリングし、選択プロセスでサンプルの影響を評価することで、全インスタンスの処理を回避します。マルチアームバンディット法を用い、品質と多様性のバランスを取ります。 Comment
openreview: https://openreview.net/forum?id=bMC1t7eLRc
あるモデルに対して、特定のデータセットD_rの性能を最大化するようにモデルを学習したいとする。このときに、全ての学習データD_cからD_rが学習の結果最大となるようなデータセットD_bを求めたい、という問題設定である。Influence Scoreを算出するモデルを活用する。
学習元データは事前にクラスタリングしておき、top-Kのクラスタを選択。選択したクラスタの中からmini-batchを抽出しinfluence scoreを計算し、influence scoreが一定の閾値を超えた場合にD_bに追加。その後計算したinfluence scoreと当該クラスタが選択された頻度情報に基づいてtop-kのクラスタを選択する際に用いるcluster scoreを更新。というiterationを繰り返しC_bを構築する、という方法に見える。
[Paper Note] AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset, Bingxiang He+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #read-later #Selected Papers/Blogs Issue Date: 2026-01-19 GPT Summary- 好み学習の成功には、注釈、指示、応答ペアの3つの高品質なデータセットが重要ですが、従来のアプローチではこれらが混同されています。本研究では、各コンポーネントを系統的に分離・最適化し、相乗効果を評価するための分析フレームワーク「AIR」を提案します。実験により、注釈の単純さ、指示の推論安定性、応答ペアの質が行動可能な原則として明らかになり、これにより平均+5.3の性能向上が得られました。この研究は、好みデータセット設計を最適化へと導く設計図を提供します。 Comment
元ポスト:
[Paper Note] Self-Aligned Reward: Towards Effective and Efficient Reasoners, Peixuan Han+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-17 GPT Summary- 自己調整報酬(SAR)は、強化学習における検証可能な報酬を補完し、推論の正確性と効率を向上させる新たな信号。SARは、クエリに応じた簡潔で特定の回答を促進し、分析からはその質を信頼できる形で区別できることが示された。4つのモデルを7つのベンチマークで評価し、SARを強化学習アルゴリズムと統合することで精度が4%向上、推論コストが30%削減されることが確認。また、SARは正確性と効率のパレート最適なトレードオフを達成し、冗長性を抑えつつ重要な推論を保持することを示した。これにより、SARがLLMのトレーニングにおいて重要な役割を果たす可能性が示唆された。 Comment
code: https://github.com/amazon-science/Self-Aligned-Reward-Towards_Effective_and_Efficient_Reasoners
元ポスト:
様々なRLの報酬にplug-and-playで適用可能なreward signalで、ポリシーによって応答のみで条件付けた場合のperplexityと、クエリqで条件づけた場合の応答のperplexityから、perplexityが低下した割合を報酬(reward signal)とする。つまり、クエリで条件づけられたときによりモデルが自信を持って応答をしていた場合の報酬を高くする。reward hackingをしている場合は部分的であれクエリから外れた応答をすると思われるため、報酬が大きくなりづらい、というよりネガティヴになることさえありうるため、より安定した学習が実現すると思われる。
現在のRLにおける課題である計算効率において、性能を犠牲にせず(推論時のトークン効率の観点から)効率向上が期待できインパクトが大きいように見えるため、重要研究に見える。
[Paper Note] A Plan Reuse Mechanism for LLM-Driven Agent, Guopeng Li+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents Issue Date: 2026-01-05 GPT Summary- 大規模言語モデル(LLMs)を小型アシスタントに統合することで、インタラクション能力やタスク解決能力が向上するが、計画生成時の遅延が問題となる。約30%のリクエストが類似しているため、計画の再利用が可能だが、リクエストの類似性を正確に定義するのは難しい。これに対処するため、計画再利用メカニズム「AgentReuse」を提案し、意図分類を用いてリクエスト間の類似性を評価。実験結果では93%の計画再利用率を達成し、遅延を93.12%削減した。 Comment
元ポスト:
[Paper Note] Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations, Chancharik Mitra+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #Robotics #VisionLanguageActionModel #EmbodiedAI #One-Line Notes Issue Date: 2025-12-28 GPT Summary- VLAモデルはロボティクスにおける視覚と言語の統合を目指すが、物理的要因へのファインチューニングが必要。既存手法は特異性に欠けるため、タスク特異的な注意ヘッドを選択的にファインチューニングする「Robotic Steering」を提案。Franka Emikaロボットアームでの評価により、Robotic SteeringがLoRAを上回り、堅牢性、計算コスト削減、解釈可能性の向上を実現することを示した。 Comment
pj page: https://chancharikmitra.github.io/robosteering/
元ポスト:
VLAにおいて学習したいタスクと関連する(sparseな) attention headsだけをfinetuningすることで、効率的に、忘却を防ぎつつ、overfitを防ぐような手法を提案。
[Paper Note] SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations, Wentao Guo+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #MoE(Mixture-of-Experts) #SoftwareEngineering #mid-training #PostTraining #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-12-19 GPT Summary- SonicMoEは、MoEモデルのフォワードおよびバックワードパスをメモリ効率良く計算するアルゴリズムを提案し、活性化メモリを45%削減。Hopper GPU上で7B MoEモデルの計算スループットを1.86倍改善し、トレーニングスループットは2130億トークン/日を達成。新しいトークンラウンディング手法により、カーネル実行時間で1.16倍のスピードアップを実現。すべてのカーネルはオープンソース化され、MoEモデルのトレーニングを加速。 Comment
元ポスト:
MoEモデルの学習速度、メモリ使用が最大2倍効率化される実装らしい。ただしHopperに特化している模様。
Blackwellでも動作するようになった模様:
[Paper Note] Fast and Accurate Causal Parallel Decoding using Jacobi Forcing, Lanxiang Hu+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Decoding #read-later #Selected Papers/Blogs Issue Date: 2025-12-18 GPT Summary- マルチトークン生成において、Jacobi Forcingを導入し、ARモデルから効率的な並列デコーダーへの移行を実現。これにより、コーディングと数学のベンチマークで3.8倍の速度向上を達成し、マルチブロックデコーディングで最大4.5倍のトークン受け入れ数を実現。推論のレイテンシを低下させることが可能に。 Comment
元ポスト:
[Paper Note] FB-RAG: Improving RAG with Forward and Backward Lookup, Kushal Chawla+, AACL'25 Findings, 2025.05
Paper/Blog Link My Issue
#InformationRetrieval #NLP #RAG(RetrievalAugmentedGeneration) #SmallModel #AACL #SpeculativeDecoding #One-Line Notes Issue Date: 2025-12-18 GPT Summary- FB-RAGは、複雑なクエリに対するRAGの課題を解決する新しいフレームワークで、軽量のLLMを用いて関連性の高いコンテキストを特定。従来のファインチューニングなしで性能向上を実現し、レイテンシを削減。EN.QAデータセットでは、リーディングベースラインに匹敵し、性能向上とレイテンシ削減を達成。小さなLLMが大きなLLMの性能を向上させる可能性を示す。 Comment
元ポスト:
使いやすそうなアプローチなので覚えておくと実用上は良いかもしれない
[Paper Note] RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning, Yucan Guo+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Multi #InformationRetrieval #NLP #ReinforcementLearning #AIAgents #RAG(RetrievalAugmentedGeneration) #KeyPoint Notes Issue Date: 2025-12-17 GPT Summary- Retrieval-Augmented Generation (RAG)を用いた新しいRLベースのフレームワーク\model{}を提案。これにより、LLMsがマルチターンのグラフ-テキストハイブリッドRAGを実行し、推論のタイミングや情報取得を学習。二段階のトレーニングフレームワークにより、ハイブリッド証拠を活用しつつリトリーバルのオーバーヘッドを回避。実験結果は、\model{}が既存のRAGベースラインを大幅に上回ることを示し、複雑な推論における効率的なリトリーバルの利点を強調。 Comment
元ポスト:
モデル自身が何を、いつ、どこからretrievalし、いつやめるかをするかを動的にreasoningできるようRLで学習することで、コストの高いretrievalを削減し、マルチターンRAGの性能を保ちつつ効率をあげる手法(最大で検索のターン数が20パーセント削減)とのこと。
学習は2ステージで、最初のステージでanswerに正しく辿り着けるよう学習することでreasoning能力を向上させ、次のステージで不要な検索が削減されるような効率に関するrewardを組み込み、accuracyとcostのバランスをとる。モデルはツールとして検索を利用できるが、ツールはpassage, graph, hybridの3つの検索方法を選択できる。
[Paper Note] One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation, Yuan Gao+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #SmallModel #Encoder #2D (Image) #AutoEncoder Issue Date: 2025-12-15 GPT Summary- 視覚生成モデルにおける潜在空間の不一致を解消するため、FAE(Feature Auto-Encoder)を提案。FAEは、再構成と生成の両方に必要な情報を保持しつつ、1つのアテンション層で実現。2つの深層デコーダを組み合わせ、さまざまな自己教師ありエンコーダに対応。拡散モデルや正規化フローと接続可能で、ImageNetでのベンチマークにおいて優れた性能を示す。 Comment
元ポスト:
[Paper Note] Budget-Aware Tool-Use Enables Effective Agent Scaling, Tengxiao Liu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #One-Line Notes Issue Date: 2025-12-15 GPT Summary- 大規模言語モデル(LLMs)のエージェントにおけるツールコールのスケーリングを研究。単にツールコール予算を増やすだけでは効果がなく、予算意識が必要。軽量プラグイン「Budget Tracker」を導入し、動的に計画を適応させる「BATS」を開発。コストとパフォーマンスを共同で考慮する指標を定式化し、予算意識のある手法がより良いスケーリングを実現することを示す。 Comment
元ポスト:
AI Agentにplug-and-playでbudgetに関する情報をinternalなreasoning token中に出力させる(budget tracker)ことで、余剰なtoken消費、tool callのコストを自律的に調整させながらタスクを遂行させる手法に見える。
budget trackerは非常にシンプルなpromptで以下のようなブロックで表現され、ツールごとにbudgetがスタート時点に決められており、個々のツールごとに残りのbudgetをブロック中に動的に出力させる。たとえばtool1は検索(budgetはクエリの発行数)、tool2はブラウジング(budgetはurl数)のようなものである。
```
Tool1 Budget Used: ##, Tool1 Budget Remaining: ##
Tool2 Budget Used: ##, Tool2 Budget Remaining: ##
Make the best use of the available resources.
```
自律的に制御すると記述したが、AppendixCを見る限りは、promptingに応じてbudgetの残量に応じた方向性はgivenな設定なようである。
[Paper Note] Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners, Xin Xu+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #RLVR Issue Date: 2025-12-13 GPT Summary- TFPI(Thinking-Free Policy Initialization)は、強化学習における長いコンテキスト長の問題を解決するための手法で、思考内容を破棄する*ThinkFree*操作を用いてトークン使用量を削減します。これにより、トレーニングの効率が向上し、RLの収束を加速し、より高い性能を達成します。TFPIを用いた4Bモデルは、AIME24で89.0%、LiveCodeBenchで65.5%の精度を記録しました。 Comment
openreview: https://openreview.net/forum?id=RKYO6R8Jgb
元ポスト:
[Paper Note] Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers, Zachary Shinnick+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Transformer #2D (Image) #KeyPoint Notes #WarmUp Issue Date: 2025-12-11 GPT Summary- 視覚トランスフォーマー(ViTs)を手続き生成データで事前学習する新しい方法を提案。これにより、モデルは抽象的な計算的知識を内在化し、標準的な画像トレーニングでデータ効率やパフォーマンスが向上。ImageNet-1kで1%の手続き生成データを使用することで、精度が1.7%以上向上し、28%のデータに相当する効果を示す。新しい事前学習戦略の可能性を示唆。 Comment
元ポスト:
特定のgrammarを持つ(意味情報を持たない予測可能な)シンボルトークン列(e.g.,規則的なアルファベットの羅列, 括弧による階層構造; 非画像データ)を用いてViTのTransformerブロックを事前学習することによって、MLPやattention Layerに対して構造情報を捉える能力がwarmupされ、その後実画像で事前学習をするとサンプル効率が上がる、という話らしい。
warmupでは、ViTにおける入力機構(画像パッチ+linear layer)は一切用いず、discreteなトークンと、それらをランダムに初期化したlookup table を用いる。このとき、embeddingとpositional encodingをfreezeすることで、MLP, Attention Layerに知識が埋め込まれることを保証する。
[Paper Note] ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models, Long Lian+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #LLMServing #Decoding #Parallel Issue Date: 2025-12-10 GPT Summary- ThreadWeaverは、適応型並列推論のフレームワークで、逐次推論モデルと同等の精度を保ちながら推論の遅延を大幅に削減します。主な革新は、二段階の並列軌道生成器、オフ・ザ・シェルフの自己回帰推論エンジンでの並列推論、並列化意識のある強化学習フレームワークです。これにより、数学的推論ベンチマークで高い精度を維持しつつ、最大1.53倍のスピードアップを達成しました。 Comment
元ポスト:
[Paper Note] xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning, Cheng Qian+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Reasoning #Routing Issue Date: 2025-11-25 GPT Summary- xRouterは、コストとパフォーマンスのトレードオフを考慮したルーティングシステムで、学習されたルーターが直接回答するか外部モデルを呼び出す。強化学習により訓練され、手動ルールの必要がない。多様なベンチマークでコスト削減とタスク完了率の向上を実現し、LLMオーケストレーションの進展に寄与することを目指す。 Comment
元ポスト:
[Paper Note] Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models, Jiaqi Wang+, NeurIPS'25, 2025.05
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #NeurIPS #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2025-11-25 GPT Summary- 強化学習を用いて視覚と言語モデルの推論を強化するために、TONという二段階のトレーニング戦略を提案。簡単な質問には推論をスキップし、必要な時に考える人間の思考プロセスを模倣。実験により、TONは従来の手法に比べて推論ステップを最大90%削減し、性能を向上させることが示された。モデルはトレーニングを通じて不要な推論を回避することを学習。 Comment
元ポスト:
著者ポスト:
いつ思考をするか/しないかを学習することでCoTのtrajectoryを節約する。選択的に思考しないということをモデルは基本的に学習していないのでSFTで模倣学習することでコールドスタートを脱っし、その後RLによって選択的に思考しないことも含めて思考を最適化する、といった話に見える。
[Paper Note] Apriel-H1: Towards Efficient Enterprise Reasoning Models, Oleksiy Ostapenko+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SSM (StateSpaceModel) #RecurrentModels #LinearAttention Issue Date: 2025-11-22 GPT Summary- 大規模言語モデル(LLMs)は、トランスフォーマーアーキテクチャの限界を克服するために、状態空間モデル(SSMs)と注意メカニズムを組み合わせたハイブリッドモデルApriel-H1を提案。これにより、推論性能を維持しつつ、スループットを2倍以上向上させることに成功。蒸留を通じて、重要度の低い注意層をSSMに置き換え、効率的な推論を実現。 Comment
元ポスト:
blog:
https://huggingface.co/blog/ServiceNow-AI/apriel-h1
HF:
https://huggingface.co/collections/ServiceNow-AI/apriel-h1
[Paper Note] Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter, Qinghao Hu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #One-Line Notes Issue Date: 2025-11-21 GPT Summary- 大規模言語モデル(LLMs)の推論能力を向上させるため、TLTを提案。TLTは適応的な推測デコーディングを用いて、強化学習(RL)トレーニングの効率を向上させる。主なコンポーネントは、アイドルGPUでトレーニングされるアダプティブドラフターと、メモリ効率の良いプールを維持するアダプティブロールアウトエンジン。TLTは、最先端システムに対して1.7倍のトレーニング速度向上を実現し、モデルの精度を保持しつつ高品質なドラフトモデルを生成。 Comment
元ポスト:
ロングテールのrolloutをする際にspeculative decodingをすることでボトルネックを改善しon-policy RLの速度を改善する話らしいが、Inflight Weight Updatesがもしうまく機能するならこちらの方が簡単な気がするが、果たしてどうなのだろうか。
関連:
- PipelineRL, Piche+, ServiceNow, 2025.04
[Paper Note] Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning, Ruoyu Qin+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SoftwareEngineering #read-later #Selected Papers/Blogs #Off-Policy #On-Policy Issue Date: 2025-11-20 GPT Summary- 強化学習における性能ボトルネックを解消するために、新しいオンラインコンテキスト学習システム「Seer」を提案。Seerは、出力の類似性を活用し、分割ロールアウト、コンテキストに基づくスケジューリング、適応的グループ化推測デコーディングを導入。これにより、ロールアウトの待機時間を大幅に短縮し、リソース効率を向上。評価結果では、エンドツーエンドのロールアウトスループットを74%から97%向上させ、待機時間を75%から93%削減した。 Comment
元ポスト:
[Paper Note] Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation, Vladimir Arkhipkin+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #Supervised-FineTuning (SFT) #ReinforcementLearning #FoundationModel #DiffusionModel #TextToImageGeneration #SmallModel #VideoGeneration/Understandings #VisionLanguageModel Issue Date: 2025-11-20 GPT Summary- Kandinsky 5.0は、高解像度画像と10秒動画合成のための最先端モデルで、3つのコアモデル(Image Lite、Video Lite、Video Pro)から構成される。データキュレーションライフサイクルのレビューや、自己教師ありファインチューニングや強化学習を用いた品質向上技術を取り入れ、高い生成速度とパフォーマンスを実現。オープンソースコードとトレーニングチェックポイントの提供により、研究コミュニティの発展に寄与することを目指す。 Comment
HF: https://huggingface.co/kandinskylab
元ポスト:
[Paper Note] LightRAG: Simple and Fast Retrieval-Augmented Generation, Zirui Guo+, EMNLP'25, 2024.10
Paper/Blog Link My Issue
#GraphBased #NLP #RAG(RetrievalAugmentedGeneration) #EMNLP Issue Date: 2025-11-18 GPT Summary- LightRAGは、グラフ構造を取り入れたRetrieval-Augmented Generation (RAG)システムで、文脈に関連した応答を提供します。二重レベルの検索システムにより、知識発見を強化し、関連エンティティの効率的な検索を実現。増分更新アルゴリズムにより、急速に変化するデータ環境でも応答性を維持。実験により、既存のアプローチと比較して精度と効率が大幅に改善されたことが示されました。LightRAGはオープンソースで公開されています。 Comment
github: https://github.com/HKUDS/LightRAG
元ポスト:
[Paper Note] Optimizing Mixture of Block Attention, Guangxuan Xiao+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #Transformer #Attention Issue Date: 2025-11-17 GPT Summary- Mixture of Block Attention (MoBA)は、LLMにおける長いコンテキスト処理を効率化するが、その設計原則やGPU実装が不十分である。本研究では、MoBAのメカニズムを分析し、クエリとキーの親和性に基づくブロックの識別能力が性能に影響することを明らかにする。改善策として、小さなブロックサイズの使用とキーに対する短い畳み込みの適用を提案。これを実現するために、FlashMoBAを導入し、効率的なMoBA実行を可能にするCUDAカーネルを開発。FlashMoBAは、最大14.7倍のスピードアップを達成し、理論に基づく改善を実用化した。 Comment
元ポスト:
flash_attention2に対して最大で14.7倍👀どういう条件、実験だろうか
[Paper Note] Virtual Width Networks, Seed+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-11-17 GPT Summary- Virtual Width Networks (VWN)は、隠れ層のサイズを増やすことなく、より広い表現を可能にするフレームワークである。VWNはバックボーンの計算をほぼ一定に保ちながら埋め込み空間を拡張し、8倍の拡張でトークン予測の最適化を加速することを示した。トレーニングが進むにつれてこの利点は増幅され、仮想幅と損失削減の間には対数線形のスケーリング関係があることが確認された。 Comment
元ポスト:
ポイント解説:
重要論文に見える。transformerのバックボーンの次元は変えないでベクトルのwidthを広げることと同等の効力を得るためのアーキテクチャを提案している模様。
ざっくり言うとembeddingをN倍(over-width)し、提案手法であるGHCを用いてバックボーンに流せるサイズにベクトルを圧縮しtransformerブロックで処理しover-widthした次元に戻す処理をする機構と、over-widthしたembeddingを次元数は変えずに変換するlinearを噛ませた結果を足し合わせるような機構を用意して最大のボトルネックであるtransformerブロックの計算量は変えずに表現力を向上させる、といった感じの手法な模様
[Paper Note] TiDAR: Think in Diffusion, Talk in Autoregression, Jingyu Liu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Decoding #read-later #Selected Papers/Blogs Issue Date: 2025-11-13 GPT Summary- TiDARは、拡散言語モデルと自己回帰モデルの利点を融合したハイブリッドアーキテクチャで、トークンのドラフトとサンプリングを単一のフォワードパスで実行します。これにより、高スループットとARモデルに匹敵する品質を両立させ、推測的デコーディングを上回る効率を実現しました。TiDARは、1秒あたり4.71倍から5.91倍のトークン生成を可能にし、ARモデルとの品質ギャップを初めて埋めました。 Comment
元ポスト:
解説:
[Paper Note] Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence, Sean McLeish+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #LatentReasoning #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2025-11-12 GPT Summary- 深層再帰言語モデルの進展により、再帰の計算量を訓練時とテスト時で切り離すことが可能に。本研究では、非再帰言語モデルを深層再帰モデルに変換する方法を提案し、再帰のカリキュラムを用いることで性能を維持しつつ計算コストを削減できることを示した。数学実験では、再帰モデルへの変換がポストトレーニングよりも優れた性能を発揮することが確認された。 Comment
元ポスト:
関連:
openreview: https://openreview.net/forum?id=eC85h3y4pG
[Paper Note] Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction, Huanxin Sheng+, EMNLP'25 SAC Highlights, 2025.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #LLM-as-a-Judge #EMNLP #read-later #Selected Papers/Blogs #Stability Issue Date: 2025-11-10 GPT Summary- LLMを用いた自然言語生成の評価における不確実性を分析するためのフレームワークを提案。適合予測を通じて予測区間を構築し、中央値に基づくスコアを低バイアスの代替手段として提示。実験により、適合予測が有効な予測区間を提供できることを示し、判断の向上に向けた中央値や再プロンプトの有用性も探求。 Comment
元ポスト:
実用上非常に重要な話に見える
[Paper Note] Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index, Hao Xu+, EMNLP'25 Best Paper, 2025.06
Paper/Blog Link My Issue
#NLP #Search #Dataset #LanguageModel #Evaluation #EMNLP #read-later #Contamination-free #Selected Papers/Blogs Issue Date: 2025-11-09 GPT Summary- 「infini-gram mini」は、ペタバイトレベルのテキストコーパスを効率的に検索可能にするシステムで、FM-indexデータ構造を用いてインデックスを作成し、ストレージオーバーヘッドを44%に削減。インデックス作成速度やメモリ使用量を大幅に改善し、83TBのインターネットテキストを99日でインデックス化。大規模なベンチマーク汚染の分析を行い、主要なLM評価ベンチマークがインターネットクローリングで汚染されていることを発見。汚染率を共有する公報をホストし、検索クエリ用のウェブインターフェースとAPIも提供。 Comment
元ポスト:
pj page: https://infini-gram-mini.io
benchmarmk contamination monitoring system: https://huggingface.co/spaces/infini-gram-mini/Benchmark-Contamination-Monitoring-System
[Paper Note] EdgeTAM: On-Device Track Anything Model, Chong Zhou+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #ImageSegmentation #SmallModel #OpenWeight #Video #2D (Image) #EdgeDevices Issue Date: 2025-11-09 GPT Summary- SAM 2は動画セグメンテーションの基盤モデルであり、メモリバンクメカニズムを通じて性能を向上させています。本研究では、モバイルデバイス上での効率を高めるために、EdgeTAMを提案し、2D空間パーセプターを用いて計算コストを削減します。これにより、メモリの空間構造を保持しつつ、推論オーバーヘッドなしで性能を向上させる蒸留パイプラインも導入。EdgeTAMは複数のデータセットで高いJ&Fスコアを達成し、iPhone 15 Pro Maxで16 FPSで動作します。 Comment
元ポスト:
SAM2より性能は少し劣るが、edge-deviceてわ動作可能で非常に高速なモデル(promptによって制御可能なsegmentation)とのこと
- [Paper Note] SAM 2: Segment Anything in Images and Videos, Nikhila Ravi+, ICLR'25, 2024.08
[Paper Note] Scaling Agent Learning via Experience Synthesis, Zhaorun Chen+, ICLR'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Reasoning #ICLR #Author Thread-Post Issue Date: 2025-11-07 GPT Summary- DreamGymは、強化学習(RL)エージェントのオンライントレーニングを効率化するための統一フレームワークであり、高コストのロールアウトや不安定な報酬信号の課題に対処します。環境のダイナミクスを推論に基づく経験モデルに蒸留し、安定した状態遷移とフィードバックを提供します。オフラインデータを活用した経験リプレイバッファにより、エージェントのトレーニングを強化し、新しいタスクを適応的に生成することでオンラインカリキュラム学習を実現します。実験により、DreamGymは合成設定とリアルなシナリオでRLトレーニングを大幅に改善し、非RL準備タスクでは30%以上の性能向上を示しました。合成経験のみでトレーニングされたポリシーは、実環境RLにおいても優れたパフォーマンスを発揮し、スケーラブルなウォームスタート戦略を提供します。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=cf7qpBwttr
著者による一言解説:
[Paper Note] PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation, Alexandre Piché+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #KeyPoint Notes #Asynchronous Issue Date: 2025-11-07 GPT Summary- 強化学習(RL)を用いて大規模言語モデル(LLMs)の推論能力を向上させるための新しいアプローチ、PipelineRLを提案。PipelineRLは非同期データ生成とモデル更新を同時に行い、トレーニングデータの新鮮さを保ちながら、GPUの利用率を最大化。実験では、従来のRL手法に比べて約2倍の学習速度を達成。PipelineRLのオープンソース実装も公開。 Comment
元ポスト:
long trajectoryをロールアウトする際にモデルの非同期な更新が生じ、rollont中のtrajectoryに複数のパラメータでのモデルから生成されたトークンが混在する場合がある。このような場合に、複数の数百B級のパラメータをメモリ上に保持しておくことはできないので、トークンを推論した際のlogprobをとっておき、そのlogprobを用いて重要度サンプリングを行う。これによって、oldモデルのパラメータを破棄することができ、トークンが生成された時のlogprobをそのまま活用できるため、より実際のlogprobを用いた重要度サンプリングになっている、みたいなテクニックがあるらしい。
[Paper Note] Culture Cartography: Mapping the Landscape of Cultural Knowledge, Caleb Ziems+, EMNLP'25, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Supervised-FineTuning (SFT) #EMNLP #DPO #Cultural Issue Date: 2025-11-06 GPT Summary- LLMは文化特有の知識を必要とし、CultureCartographyという混合イニシアティブを提案。LLMが自信の低い質問をアノテーションし、人間がそのギャップを埋めることで重要なトピックに導く。CultureExplorerツールを用いた実験で、従来のモデルよりも効果的に知識を生成し、Llama-3.1-8Bの精度を最大19.2%向上させることが示された。 Comment
元ポスト:
効率的にLLMにとって未知、かつ重要な文化的な知識バンクを作成する話な模様。アクティブラーニングに似たような思想に見える。
[Paper Note] Opportunistic Expert Activation: Batch-Aware Expert Routing for Faster Decode Without Retraining, Costin-Andrei Oncescu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #MoE(Mixture-of-Experts) #Decoding Issue Date: 2025-11-05 GPT Summary- MoEアーキテクチャを用いたLLMのデコードレイテンシを低下させるため、トークンから専門家へのマッピングを動的に再ルーティングするフレームワークを提案。バッチ認識ルーティングを活用し、メモリに既にロードされている専門家を利用することで、精度を維持しつつ、Qwen3-30BおよびQwen3-235Bモデルでそれぞれ39%と15%のレイテンシ削減を達成。 Comment
元ポスト:
[Paper Note] Emu3.5: Native Multimodal Models are World Learners, Yufeng Cui+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #Transformer #MultiModal #DiffusionModel #2D (Image) #UMM #text Issue Date: 2025-11-01 GPT Summary- Emu3.5は、視覚と言語の両方に基づく次の状態を予測する大規模なマルチモーダルワールドモデルで、10兆トークン以上のデータで事前訓練されています。双方向の並列予測を用いた「Discrete Diffusion Adaptation(DiDA)」により、推論を約20倍加速し、強力なマルチモーダル能力を発揮します。Emu3.5は、画像生成や編集タスクで優れたパフォーマンスを示し、オープンソースとして提供されています。 Comment
pj page: https://emu.world/
元ポスト:
ポイント解説:
[Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Stability #Reference Collection #train-inference-mismatch #LowPrecision #Author Thread-Post Issue Date: 2025-11-01 GPT Summary- 強化学習による大規模言語モデルのファインチューニングにおける不安定性は、トレーニングポリシーと推論ポリシーの数値的不一致に起因する。従来の対策は効果が薄かったが、本研究ではFP16に戻すことでこの問題を解決できることを示した。この変更は簡単で、モデルやアルゴリズムの修正を必要とせず、安定した最適化と速い収束を実現し、多様なタスクで強力なパフォーマンスを発揮することが確認された。 Comment
元ポスト:
RL学習時の浮動小数点数表現をbf16からfp16に変更するシンプルな変更で、訓練-推論時のgapが小さくなり学習が改善する、という話らしい。
ポイント解説:
所見:
解説:
解説:
verlはFP16での学習をサポートしていないので著者がパッチを出した模様:
[Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #OpenWeight #Architecture #read-later #Selected Papers/Blogs #Reference Collection #Hybrid #LinearAttention Issue Date: 2025-10-31 GPT Summary- Kimi Linearは、短・長コンテキスト及び強化学習のシナリオにおいてフルアテンションを超えるハイブリッドな線形アテンションアーキテクチャです。Kimi Delta Attention(KDA)を核とし、ゲーティング機構を拡張した線形アテンションモジュールで、RNNのメモリをより有効利用します。特注のチャンク単位アルゴリズムにより、DPLR遷移行列の効率を向上させ、計算量を大幅に削減します。Kimi Linearモデルは48Bパラメータで事前学習され、評価タスクでMLAを大きく上回り、KVキャッシュ使用量を75%削減し、デコードスループットを6倍向上させました。これにより、フルアテンションアーキテクチャの優れた代替として機能し、長い入力・出力タスクに対応可能であることが示されています。 Comment
HF: https://huggingface.co/moonshotai/Kimi-Linear-48B-A3B-Instruct
元ポスト:
所見:
所見:
アーキテクチャ解説:
KDAとFull Attention, Sliding Window Attentionの比較:
Full Attentionと同等の性能をより効率良く達成できる
KDAに関する図解:
KDAの更新ルールに直接位置情報がエンコードされるためRoPEを必要としない:
[Paper Note] Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning, Aman Sharma+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #LLMServing #Decoding #Inference #Entropy Issue Date: 2025-10-30 GPT Summary- エントロピーに基づく新しいフレームワークを提案し、推論タスクにおける大規模言語モデルのトークン効率を向上。シャノンエントロピーを信頼度信号として利用し、早期停止を実現することで、計算コストを25-50%削減。モデルごとに異なるエントロピー閾値を用いて、正しい答えを早期に得ることを認識し、トークン節約とレイテンシ削減を可能にする。精度を維持しつつ一貫したパフォーマンスを示し、現代の推論システムの特徴を明らかに。 Comment
元ポスト:
デコード時のエントロピーに応じて、reasoningを打ち切るか否か判定してコスト削減しつつ推論する話な模様
vLLMとかでデフォルトでサポートされてスループット上がったら嬉しいなあ
[Paper Note] Memory-Efficient Backpropagation for Fine-Tuning LLMs on Resource-Constrained Mobile Devices, Congzheng Song+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Personalization #SmallModel #PostTraining Issue Date: 2025-10-30 GPT Summary- モバイルデバイス向けに、メモリ効率の良いバックプロパゲーション実装(MeBP)を提案。これにより、メモリ使用量と計算時間のトレードオフを改善し、ゼロ次最適化よりも速く収束し、優れたパフォーマンスを実現。iPhone 15 Pro Maxでの検証により、0.5Bから4Bのパラメータを持つLLMが1GB未満のメモリでファインチューニング可能であることを示した。実装例は公開済み。 Comment
元ポスト:
iPhone上で4BモデルまでFinetuningができるようになった模様。
[Paper Note] FARMER: Flow AutoRegressive Transformer over Pixels, Guangting Zheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Transformer #read-later #NormalizingFlow #Compression Issue Date: 2025-10-28 GPT Summary- FARMERという新しい生成フレームワークを提案し、正規化フローと自己回帰モデルを統合して高品質な画像合成と尤度推定を実現。潜在シーケンスへの変換や自己教師あり次元削減により、ARモデリングの効率を向上。推論速度を加速する蒸留スキームと画像生成品質を向上させる分類器フリーガイダンスを導入。実験により、FARMERは既存モデルと比較して競争力のある性能を示した。 Comment
元ポスト:
ポイント解説:
これは...👀👀👀
[Paper Note] Tensor Product Attention Is All You Need, Yifan Zhang+, NeurIPS'25 Spotlight, 2025.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #NeurIPS #read-later #KV Cache Issue Date: 2025-10-28 GPT Summary- テンソルプロダクトアテンション(TPA)を提案し、KVキャッシュのサイズを縮小する新しい注意メカニズムを導入。TPAは低ランク成分に因数分解し、RoPEと統合することでメモリ効率とモデル品質を向上。新しいモデルアーキテクチャ「テンソルプロダクトアテンショントランスフォーマー(T6)」は、標準トランスフォーマーベースラインを上回る性能を示し、長いシーケンス処理のスケーラビリティ課題に対応。 Comment
pj page: https://tensorgi.github.io/TPA/
元ポスト:
続報:
RoPEも含めた様々なpositional encodingと互換性がある旨が追加された模様。
[Paper Note] DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning, Shih-Yang Liu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning Issue Date: 2025-10-27 GPT Summary- 推論言語モデルは長い出力を生成することが多く、応答の長さに対する精度向上が課題である。本研究では、切り捨てを用いた強化学習(RL)の再考を行い、精度低下の原因は不十分なRL最適化にあることを示す。3つの課題(バイアス、エントロピーの崩壊、スパースな報酬信号)に対処するため、DLERというトレーニング手法を提案し、出力の長さを70%以上削減しつつ精度を向上させた。さらに、Difficulty-Aware DLERを導入し、簡単な質問に対して適応的に切り捨てを厳しくすることで効率を向上させる手法も提案した。 Comment
pj page: https://nvlabs.github.io/DLER/
元ポスト:
reasoningをトークン数の観点で効率化する話
[Paper Note] AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training, Huawei Bai+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SoftwareEngineering #mid-training #PostTraining #Parallelism Issue Date: 2025-10-25 GPT Summary- 非同期階層ゼロ並列処理(AsyncHZP)を提案し、シンプルさとメモリ効率を保ちながら、トレーニング効率を向上。従来のZeROの通信オーバーヘッドを削減し、パラメータや勾配の再シャーディングを適応的に行う。マルチストリーム非同期スケジューリングにより通信と計算を重ね合わせ、メモリの断片化を最小限に抑える。DenseおよびMixture-of-Expertsモデルでの評価により、AsyncHZPが従来のND並列処理を上回る性能を示した。 Comment
元ポスト:
[Paper Note] Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning, Ling Team+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Attention #Architecture #MoE(Mixture-of-Experts) #Hybrid Issue Date: 2025-10-24 GPT Summary- Ring-linearモデルシリーズ、特にRing-mini-linear-2.0(16Bパラメータ)とRing-flash-linear-2.0(104Bパラメータ)を紹介。両モデルはハイブリッドアーキテクチャを採用し、長いコンテキストの推論でI/Oと計算オーバーヘッドを削減。推論コストは32億パラメータの密なモデルと比較して1/10、元のRingシリーズと比べて50%以上削減。最適なモデル構造を特定し、高性能FP8オペレーターライブラリ「linghe」によりトレーニング効率が50%向上。複数の複雑推論ベンチマークでSOTAパフォーマンスを維持。 Comment
HF: https://huggingface.co/inclusionAI/Ring-flash-linear-2.0-128k
元ポスト:
所見:
[Paper Note] Text or Pixels? It Takes Half: On the Token Efficiency of Visual Text Inputs in Multimodal LLMs, Yanhong Li+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #Pixel-based Issue Date: 2025-10-22 GPT Summary- テキストを画像として提供することで、LLMのトークン使用量を削減しつつ性能を維持できることを示す。長いテキストを画像にレンダリングし、デコーダーに直接入力することで、必要なトークン数を大幅に減少させる。実験により、RULERとCNN/DailyMailのベンチマークで性能を損なうことなく、トークンの節約が実現できることを確認。 Comment
元ポスト:
[Paper Note] Prompt-MII: Meta-Learning Instruction Induction for LLMs, Emily Xiao+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #In-ContextLearning #AutomaticPromptEngineering #read-later #One-Line Notes Issue Date: 2025-10-21 GPT Summary- PROMPT-MIIという新しい指示誘導モデルを提案し、トレーニング例をコンパクトなプロンプトに縮小することで、インコンテキスト学習(ICL)と同等のパフォーマンスを実現。3,000以上の分類データセットでトレーニングし、90の未見タスクで評価した結果、下流モデルの品質を4-9 F1ポイント向上させ、必要なトークン数を3-13倍削減。 Comment
元ポスト:
タスクのexamplar/demonstrationからタスクに関するdescription(=instruction)を生成するモデルを学習し、生成されたinstructionを用いることで、manyshotでICLするよりも、少ないトークン数で同等以上の性能を達成するといった話に見える。どういうinstructionになるのかが非常に興味がある。A.6参照のこと。細かく具体的だがコンパクトな指示が記述されているようなinstructionとなっている。
[Paper Note] Glyph: Scaling Context Windows via Visual-Text Compression, Jiale Cheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #ContextWindow #LongContext #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2025-10-21 GPT Summary- 本研究では、長いコンテキストを持つ大規模言語モデル(LLMs)の実用性を向上させるため、Glyphというフレームワークを提案し、テキストを画像に変換して視覚と言語のモデル(VLMs)で処理します。このアプローチにより、3-4倍のトークン圧縮を実現し、精度を維持しつつ処理速度を約4倍向上させます。さらに、128KコンテキストのVLMが1Mトークンのテキストタスクを処理可能になることを示しました。 Comment
元ポスト:
所見:
テキストを画像にレンダリングしてVLMに入力することでtextと比較して3.2倍KV Cache (context)を圧縮し、prefillingとデコード速度も4.8, 4.4倍高速化するフレームワークらしい
[Paper Note] Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms, Shrey Pandit+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #SyntheticData #Diversity #Verification #DeepResearch #LongHorizon Issue Date: 2025-10-21 GPT Summary- Webベースの「ディープリサーチ」エージェントは、長期的なインタラクションを通じて複雑な質問応答タスクを解決することを目指すが、従来の方法は推論の複雑さを捉えきれない。そこで、タスクの複雑さを段階的に増加させる二段階のデータ合成パイプラインを導入し、ベースラインエージェントが質問に挑戦し、事実確認を行う。実験により、提案したデータセットが既存のものよりも効果的な訓練を可能にし、ツール使用アクションの多様性が2倍であることが示された。 Comment
元ポスト:
[Paper Note] Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model, Fuhao Li+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#3D (Scene) #Robotics #VisionLanguageActionModel #SpatialUnderstanding Issue Date: 2025-10-20 GPT Summary- Spatial Forcing (SF)という新しい整合戦略を提案し、VLAモデルが3D空間理解能力を向上させることを促進。SFは3D入力や深度推定器に依存せず、VLAの中間視覚埋め込みを3D基盤モデルの幾何学的表現と整合させる。実験により、SFは最先端の結果を達成し、トレーニングを最大3.8倍加速、データ効率を改善。 Comment
元ポスト:
[Paper Note] Attention Is All You Need for KV Cache in Diffusion LLMs, Quan Nguyen-Tri+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #One-Line Notes #KV Cache Issue Date: 2025-10-19 GPT Summary- 本研究では、拡散型大規模言語モデル(DLMs)のデコーディング待機時間を最小化しつつ予測精度を最大化するために、適応的なKVキャッシュ再計算手法「Elastic-Cache」を提案。これにより、浅いレイヤーの冗長性を削減し、重要なトークンに基づいてキャッシュのリフレッシュを動的に行う。実験では、GSM8KやHumanEvalでの速度向上を示し、生成品質を維持しながら高いスループットを達成した。 Comment
元ポスト:
DLMにおいて、denoisingの各ステップにおいて全てのKVを再計算するのではなく、attention scoreが大きくドリフトしていない部分についてはKV Cacheを再利用し、大きくドリフトした部分だけ再計算するような仕組みを学習することで、品質を損なうことなく推論速度を高速化した模様
[Paper Note] Dr.LLM: Dynamic Layer Routing in LLMs, Ahmed Heakl+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #DynamicNetworks #Routing #One-Line Notes Issue Date: 2025-10-17 GPT Summary- Dr.LLMは、LLMsに動的な層ルーティングを導入し、計算効率を向上させるフレームワーク。モンテカルロ木探索を用いて高品質な層構成を導出し、ARCやDARTで精度を最大+3.4%向上させ、平均5層を節約。ドメイン外タスクでもわずか0.85%の精度低下で従来手法を上回る。明示的な監視下でのルーターがLLMsを効率的に活用できることを示す。 Comment
LayerごとにMLPのrouterを用意し、(元のLLMのパラメータはfreezeして)Layerをskip, execute, repeatするかを追加で学習することで、クエリに応じて動的に計算コストとpathを調整する能力を身につけさせ、性能を向上させつつも計算量も削減できます、といった話な模様。routerが学習されているのでinference時にsearchは不要。
[Paper Note] Representation-Based Exploration for Language Models: From Test-Time to Post-Training, Jens Tuyls+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Test-Time Scaling #PostTraining #Diversity Issue Date: 2025-10-16 GPT Summary- 強化学習(RL)が言語モデルの行動発見に与える影響を調査。事前学習されたモデルの隠れ状態を基にした表現ベースのボーナスを用いることで、多様性とpass@k率が大幅に改善されることを発見。推論時における探索が効率を向上させ、ポストトレーニングにおいてもRLパイプラインとの統合により性能が向上。意図的な探索が新しい行動の発見に寄与する可能性を示唆。 Comment
元ポスト:
探索の多様性をあげてRLこ学習効率、test time scalingの効率を上げるという話
[Paper Note] Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving, Ziming Liu+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #LLMServing #MoE(Mixture-of-Experts) #SoftwareEngineering Issue Date: 2025-10-16 GPT Summary- EaaSという新しいサービングシステムを提案し、Mixture-of-Experts (MoE)モデルの効率的でスケーラブルな展開を実現。MoEモジュールを独立したステートレスサービスに分解し、リソースの細かいスケーリングとフォールトトレランスを提供。実験により、EaaSはモノリシックシステムと同等のパフォーマンスを維持しつつ、スループットの減少を2%未満に抑え、最大37.5%の計算リソースを節約することが確認された。 Comment
元ポスト:
[Paper Note] StreamingVLM: Real-Time Understanding for Infinite Video Streams, Ruyi Xu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #Attention #LongContext #AttentionSinks #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #VisionLanguageModel #KeyPoint Notes Issue Date: 2025-10-15 GPT Summary- StreamingVLMは、無限のビデオストリームをリアルタイムで理解するためのモデルで、トレーニングと推論を統一したフレームワークを採用。アテンションシンクの状態を再利用し、短いビジョントークンと長いテキストトークンのウィンドウを保持することで、計算コストを抑えつつ高い性能を実現。新しいベンチマークInf-Streams-Evalで66.18%の勝率を達成し、一般的なVQA能力を向上させることに成功。 Comment
元ポスト:
これは興味深い
保持するKV Cacheの上限を決め、Sink Token[^1]は保持し[^2](512トークン)、textual tokenは長距離で保持、visual tokenは短距離で保持、またpositional encodingとしてはRoPEを採用するが、固定されたレンジの中で動的にindexを更新することで、位相を学習時のrangeに収めOODにならないような工夫をすることで、memoryと計算コストを一定に保ちながらlong contextでの一貫性とリアルタイムのlatencyを実現する、といった話にみえる。
学習時はフレームがoverlapした複数のチャンクに分けて、それぞれをfull attentionで学習する(Sink Tokenは保持する)。これは上述のinference時のパターンと整合しており学習時とinference時のgapが最小限になる。また、わざわざlong videoで学習する必要がない。(美しい解決方法)
[^1]: decoder-only transformerの余剰なattention scoreの捨て場として機能するsequence冒頭の数トークン(3--4トークン程度)のこと。本論文では512トークンと大きめのSink Tokenを保持している。
[^2]: Attention Sinksによって、long contextの性能が改善され [Paper Note] Why do LLMs attend to the first token?, Federico Barbero+, COLM'25
decoder-only transformerの層が深い部分でのトークンの表現が均一化されてしまうover-mixingを抑制する [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
ことが報告されている
AttentionSink関連リンク:
- [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
- [Paper Note] Why do LLMs attend to the first token?, Federico Barbero+, COLM'25
↑これは元ポストを読んで(と論文斜め読み)の感想のようなものなので、詳細は後で元論文を読む。
関連:
[Paper Note] QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs, Wei Huang+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Quantization #PEFT(Adaptor/LoRA) #Entropy Issue Date: 2025-10-14 GPT Summary- QeRLは、LLMs向けの量子化強化学習フレームワークで、NVFP4量子化とLoRAを組み合わせてRLのロールアウトを加速し、メモリ使用量を削減します。量子化ノイズがポリシーエントロピーを増加させ、探索を強化することを示し、AQNメカニズムでノイズを動的に調整します。実験により、ロールアウトフェーズで1.5倍のスピードアップを達成し、32B LLMのRLトレーニングを単一のH100 80GB GPUで可能にしました。QeRLは、報酬の成長と最終精度で優れた結果を示し、LLMsにおけるRLトレーニングの効率的なフレームワークとしての地位を確立しました。 Comment
pj page: https://github.com/NVlabs/QeRL
元ポスト:
- Your Efficient RL Framework Secretly Brings You Off-Policy RL Training, Yao+, 2025.08
のようなロールアウトする際のエンジンと学習のエンジンのgapによる問題は生じたりしないのだろうか。
解説:
[Paper Note] Diffusion Transformers with Representation Autoencoders, Boyang Zheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #read-later #Selected Papers/Blogs #Backbone Issue Date: 2025-10-14 GPT Summary- 本研究では、従来のVAEエンコーダを事前学習された表現エンコーダに置き換えたRepresentation Autoencoders(RAE)を提案。これにより、高品質な再構成と豊かな潜在空間を実現し、拡散トランスフォーマーの性能向上を図る。RAEは、補助的な表現整合損失なしで早い収束を達成し、ImageNetで優れた画像生成結果を示した。RAEは、拡散トランスフォーマーの新しいデフォルトとしての利点を提供する。 Comment
pj page: https://rae-dit.github.io
元ポスト:
U-NetをBackboneとしたVAEの代わりにViTに基づく(down, up- scaling無しの)アーキテクチャを用いることで、より少ない計算量で高い性能を達成しました、といった話に見える。
ポイント解説:
解説:
[Paper Note] Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony, Han Lu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #RLVR #Asynchronous Issue Date: 2025-10-14 GPT Summary- 非同期RL後処理をサポートする「ROLL Flash」を提案。細粒度の並列性とロールアウト・トレインのデカップリングに基づき、効率的なトレーニングアーキテクチャを実現。ROLL Flashはリソース利用効率とスケーラビリティを大幅に改善し、RLVRタスクで最大2.24倍、エージェントタスクで最大2.72倍のスピードアップを達成。非同期トレーニングが同期トレーニングと同等のパフォーマンスを示すことを確認。 Comment
元ポスト:
RLのロールアウト中のGPUのアイドルタイムを削減します系の話も最近結構見るような
たとえば
- Anatomy of a Modern Finetuning API, Benjamin Anderson, 2025.10
[Paper Note] dInfer: An Efficient Inference Framework for Diffusion Language Models, Yuxin Ma+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #LLMServing #read-later #Selected Papers/Blogs Issue Date: 2025-10-14 GPT Summary- dLLMの推論を効率化するフレームワークdInferを提案。dInferは4つのモジュールに分解され、新しいアルゴリズムと最適化を統合。これにより、出力品質を維持しつつ、推論速度を大幅に向上。HumanEvalで1秒あたり1,100トークンを超え、従来のシステムに比べて10倍のスピードアップを実現。dInferはオープンソースで公開。 Comment
code: https://github.com/inclusionAI/dInfer
とうとうdLLMを高速でinferenceできるフレームワークが出た模様。inclusionAIより。
ポイント解説:
[Paper Note] DeepPrune: Parallel Scaling without Inter-trace Redundancy, Shangqing Tu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Pruning #Test-Time Scaling #Decoding #Parallel Issue Date: 2025-10-12 GPT Summary- DeepPruneという新しいフレームワークを提案し、並列スケーリングの計算非効率を解決。80%以上の推論トレースが同一の回答を生成する問題に対処し、焦点損失とオーバーサンプリング技術を用いた判定モデルで同等性を予測。オンラインの貪欲クラスタリングで冗長な経路をプルーニングし、80%以上のトークン削減を達成しつつ、精度を維持。効率的な並列推論の新基準を確立。 Comment
pj page: https://deepprune.github.io
HF: https://huggingface.co/collections/THU-KEG/deepprune-68e5c1ea71f789a6719b2c1c
元ポスト:
[Paper Note] Artificial Hippocampus Networks for Efficient Long-Context Modeling, Yunhao Fang+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #memory #RecurrentModels Issue Date: 2025-10-10 GPT Summary- 長大なシーケンスモデリングにおけるメモリのトレードオフを解決するため、人工海馬ネットワーク(AHN)を提案。AHNは短期メモリを維持しつつ、長期メモリを圧縮。実験により、AHNを用いたモデルが従来のベースラインを上回り、計算とメモリ要件を大幅に削減しつつ、パフォーマンスを向上させることを示した。 Comment
元ポスト:
所見:
[Paper Note] The Markovian Thinker, Milad Aghajohari+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #read-later #Selected Papers/Blogs Issue Date: 2025-10-09 GPT Summary- 強化学習を用いて長い思考の連鎖を生成するための新しいパラダイム「マルコフ的思考」を提案。これにより、状態を一定のサイズに制限し、思考の長さをコンテキストのサイズから切り離すことで、線形計算を実現。新しいRL環境「Delethink」を構築し、モデルは短い持ち越しで推論を継続することを学習。訓練されたモデルは、長い推論を効率的に行い、コストを大幅に削減。思考環境の再設計が、効率的でスケーラブルな推論LLMの実現に寄与することを示した。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Generative Representational Instruction Tuning, Niklas Muennighoff+, ICLR'25, 2024.02
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #ICLR #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-10-08 GPT Summary- 生成的表現指示チューニング(GRIT)を用いて、大規模言語モデルが生成タスクと埋め込みタスクを同時に処理できる手法を提案。GritLM 7BはMTEBで新たな最先端を達成し、GritLM 8x7Bはすべてのオープン生成モデルを上回る性能を示す。GRITは生成データと埋め込みデータの統合による性能損失がなく、RAGを60%以上高速化する利点もある。モデルは公開されている。 Comment
openreview: https://openreview.net/forum?id=BC4lIvfSzv
従来はgemerativeタスクとembeddingタスクは別々にモデリングされていたが、それを統一的な枠組みで実施し、両方のタスクで同等のモデルサイズの他モデルと比較して高い性能を達成した研究。従来のgenerativeタスク用のnext-token-prediction lossとembeddingタスク用のconstastive lossを組み合わせて学習する(式3)。タスクの区別はinstructionにより実施し、embeddingタスクの場合はすべてのトークンのlast hidden stateのmean poolingでrepresentationを取得する。また、embeddingの時はbi-directional attention / generativeタスクの時はcausal maskが適用される。これらのattentionの適用のされ方の違いが、どのように管理されるかはまだしっかり読めていないのでよくわかっていないが、非常に興味深い研究である。
[Paper Note] SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization, Théophane Vallaeys+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #Tokenizer #Decoder Issue Date: 2025-10-08 GPT Summary- 新しいピクセル拡散デコーダアーキテクチャ(SSDD)を提案し、KL-VAEに依存せずに高品質な画像再構成を実現。SSDDは敵対的損失なしで訓練され、再構成FIDを改善し、サンプリング速度を向上させる。これにより、KL-VAEの代替として迅速かつ高品質な生成モデルの構築が可能となる。 Comment
元ポスト:
[Paper Note] Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models, Shutong Wu+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Decoding Issue Date: 2025-10-06 GPT Summary- Diffusion Large Language Models (DLLMs)は、双方向の注意メカニズムにより文脈を捉える能力が高いが、推論効率が自己回帰モデルに劣る。既存の並列デコーディングアルゴリズムは性能低下を伴う。これを解決するために、損失のない並列デコーディングを実現する新しいアルゴリズム「Free Draft-and-Verification(Freedave)」を提案。Freedaveにより、DLLMsのスループットは数学的推論タスクで最大2.8倍向上する。 Comment
元ポスト:
[Paper Note] Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis, Leitian Tao+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #Alignment #SyntheticData #VariationalAutoEncoder #NeurIPS #RewardModel Issue Date: 2025-10-06 GPT Summary- 報酬モデリングのために、LLMの潜在埋め込み空間で好みデータを合成する新フレームワークLENSを提案。VAEを用いて埋め込みの構造化された表現を学習し、コストのかかるテキスト生成を回避しつつ、多様で一貫した合成好みペアを生成。実験では、合成ペアが元の好みの順序を保持し、報酬モデルの一般化を改善。生成速度は18倍速く、16,000倍小さいモデルで優れた結果を達成。効率的なデータ拡張を通じて報酬モデリングを強化する効果的な手法を提供。 Comment
元ポスト:
[Paper Note] IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning, Aayush Mishra+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #In-ContextLearning Issue Date: 2025-10-05 GPT Summary- 本研究では、インコンテキスト学習(ICL)の活性化パターンを利用して、監視付きファインチューニング(SFT)の品質を向上させる手法を提案。ICLとSFTの異なる適応メカニズムを示し、ICL活性化アライメント(IA2)という自己蒸留技術を導入。IA2をSFTの前に実行することで、モデルの出力精度とキャリブレーションが向上することを12のベンチマークで実証。これにより、モデル適応の内部メカニズムに対する新たな視点も提供される。 Comment
元ポスト:
[Paper Note] VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions, Kazuki Matsuda+, EMNLP'25, 2025.09
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #ImageCaptioning #LongContext #LLM-as-a-Judge #EMNLP #VisionLanguageModel #MultiDimensional Issue Date: 2025-10-01 GPT Summary- 本研究では、長い画像キャプションの自動評価に特化した新しい指標VELAを提案し、マルチモーダル大規模言語モデル(MLLMs)を活用した評価フレームワークを構築。さらに、評価指標を検証するためのLongCap-Arenaベンチマークを導入し、7,805枚の画像と32,246件の人間の判断を用いて、VELAが既存の指標を上回る性能を示した。 Comment
元ポスト:
[Paper Note] Pretraining Large Language Models with NVFP4, NVIDIA+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #LowPrecision Issue Date: 2025-09-30 GPT Summary- 本研究では、NVFP4フォーマットを用いた大規模言語モデル(LLMs)の安定かつ正確なトレーニング手法を提案。ランダムハダマード変換や二次元量子化スキームを取り入れ、偏りのない勾配推定を実現。10兆トークンでのトレーニングにより、FP8と同等の性能を達成し、狭い精度のLLMトレーニングにおける進展を示した。 Comment
元ポスト:
解説:
[Paper Note] Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation, Shuo Yang+, NeurIPS'25 Spotlight, 2025.05
Paper/Blog Link My Issue
#ComputerVision #Transformer #Attention #DiffusionModel #Architecture #NeurIPS #VideoGeneration/Understandings #Sparse #SparseAttention Issue Date: 2025-09-27 GPT Summary- Diffusion Transformers(DiTs)の動画生成におけるレイテンシーの問題を解決するため、重要トークンの特定精度を最大化し計算の無駄を最小化するトレーニング不要のフレームワークSVG2を提案。SVG2は意味に基づくトークンのクラスタリングと再配置を行い、計算効率を向上させる。これにより、HunyuanVideoおよびWan 2.1でそれぞれ最大2.30倍および1.89倍のスピードアップを達成し、PSNRを維持。 Comment
元ポスト:
pj page: https://svg-project.github.io/v2/
Q, Kそれぞれについて独立してkmeansクラスタリングを実施し、意味的に類似したQ, Kをクラスタ化し、map上で散らばっているトークンの配置を整頓して計算機上で効率的に扱えるようにし、各クラスタのcentroidをattention scoreの計算に用いてクラスタ内のトークンのスコアを近似することで計算を効率化します、といった話な模様。また、クリティカルなクラスタとそうでは無いものがあるので、p個のクリティカルなクラスタを選択しさらに効率化をする模様。
[Paper Note] Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own Signals, Qinsi Wang+, NeurIPS'25 Spotlight, 2025.06
Paper/Blog Link My Issue
#MachineLearning #NLP #ReinforcementLearning #NeurIPS #PostTraining #On-Policy Issue Date: 2025-09-27 GPT Summary- 大規模言語モデル(LLMs)の強化学習微調整(RFT)におけるサンプル効率の低下を改善するため、モデル固有の信号「角度集中」を特定。これに基づき、勾配駆動型角度情報ナビゲート強化学習フレームワーク(GAIN-RL)を提案し、トレーニングデータを動的に選択することで効率を向上。実証評価では、GAIN-RLがトレーニング効率を2.5倍以上向上させ、元のデータの半分でより良いパフォーマンスを達成したことが示された。 Comment
元ポスト:
ヒューリスティックや特定の難易度に基づくラベルからRLのサンプルをサンプリングするのではなく、モデル自身の現在の学習の状態に基づいて動的に選択し学習効率を向上させるアプローチな模様。
[Paper Note] Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns, Xuemiao Zhang+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #mid-training Issue Date: 2025-09-26 GPT Summary- 大規模推論モデルの進展は強化学習によって促進され、CoTデータの利用が推論の深さを向上させることが示されている。しかし、どのデータタイプが最も効果的かは未解決の問題である。本研究では、推論ポテンシャルを独立した試行の数の逆数として定義し、これを拡張するために高価値の推論パターンを用いた多様なデータの利用を提案。具体的には、CoTシーケンスから原子的な推論パターンを抽象化し、コアリファレンスセットを構築。二重粒度アルゴリズムを用いて高価値のCoTデータを効率的に選択し、モデルの推論能力を向上させる。10BトークンのCoTPデータにより、85A6B Mixture-of-ExpertsモデルはAIME 2024および2025で9.58%の改善を達成した。 Comment
元ポスト:
細かいところは読めていないのだが、学習データの中から高品質な推論パターンを持つものを選んで学習に使いたいというモチベーション。そのためにまず価値の高い推論パターンを含むコアセットを作り、コアセットと類似した推論パターンや、推論中のトークンのエントロピー列を持つサンプルを学習データから収集するみたいな話な模様。類似度は重みつきDynamic Time Warping (DTW)で、原始的な推論パターンの系列とエントロピー系列のDTWの線型結合によっめ求める。原始的な推論パターンのアノテーションや、CoT sequence中のトークンのエントロピー列はDeepSeek-V3によって生成する。
コアセットを作るためには、問題タイプや問題の難易度に基づいて人手で問題を選び、それらに対してstrong reasoning modelでCoTを生成。各CoTに対して(おそらく)DeepSeek-V3でreasoningのパターン(パターンは原始的なCoTパターンの系列で構成される)をアノテーションし、各パターンに対してTF-IDFによって重要度を決定する。最終的に、問題に正答しているサンプルについて、人手で高品質でdiscriminativeなCoTパターンを持つものを選択し、各CoTパターンに重みをつけた上でコアセットを作成した、みたいな感じに見える。
[Paper Note] LIMI: Less is More for Agency, Yang Xiao+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents Issue Date: 2025-09-23 GPT Summary- AIシステムのエージェンシーを、自律的に問題を発見し解決策を実行する能力と定義。急速に変化する業界のニーズに応じて、単なる推論を超えた自律的なエージェントが求められている。LIMI(Less Is More for Intelligent Agency)は、最小限のトレーニングサンプルで高いエージェンシーを実現する新たな原則を提案し、78サンプルで73.5%の成果を達成。これは、従来のデータ量に依存するアプローチに対する挑戦であり、高品質なデモの戦略的キュレーションが重要であることを示している。 Comment
元ポスト:
LLM AgentのSFTにおけるLess is more
参考:
- [Paper Note] LIMA: Less Is More for Alignment, Chunting Zhou+, arXiv'23, 2023.05
ポイント解説:
[Paper Note] BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning, Xuechen Zhang+, NeurIPS'25
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SmallModel #NeurIPS #PostTraining #On-Policy Issue Date: 2025-09-19 GPT Summary- 小型言語モデル(SLMs)は、トレースが不足している場合に複雑な推論を学ぶのが難しい。本研究では、SFT + RLの限界を調査し、BREADという新しい手法を提案。BREADは、専門家のガイダンスを用いてSFTとRLを統合し、失敗したトレースに対して短いヒントを挿入することで成功を促進。これにより、トレーニングが約3倍速くなり、標準的なGRPOを上回る性能を示す。BREADは、SLMの推論能力を大幅に向上させることが確認された。 Comment
元ポスト:
[Paper Note] WebSailor: Navigating Super-human Reasoning for Web Agent, Kuan Li+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #Reasoning #On-Policy Issue Date: 2025-09-18 GPT Summary- WebSailorは、LLMのトレーニングにおいて人間の認知的限界を超えるためのポストトレーニング手法であり、複雑な情報探索タスクでの性能を向上させる。構造化サンプリングや情報の難読化、DUPOを用いて高不確実性タスクを生成し、オープンソースエージェントの能力を大幅に上回ることを目指す。
[Paper Note] OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning, Yanqing Liu+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #Pretraining #OpenWeight #OpenSource #Encoder #Backbone Issue Date: 2025-09-16 GPT Summary- 本論文では、OpenVisionのアーキテクチャを簡素化し、トレーニング効率を向上させる方法を提案。テキストエンコーダーと対照損失を削除し、キャプショニング損失のみを使用したOpenVision 2を導入。初期結果は、トレーニング時間を約1.5倍短縮し、メモリ使用量を約1.8倍削減することを示し、10億以上のパラメータにスケールアップ可能であることを強調。 Comment
元ポスト:
事前学習時にtext, image encoderのcontrastive lossで学習していたが、text encoderを無くしimage encoderに入力されたimageからcaptionを生成するcaption lossのみにすることで性能を落とすことなく効率を改善
[Paper Note] Adaptive Computation Pruning for the Forgetting Transformer, Zhixuan Lin+, COLM'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Pruning #Attention #LongContext #Architecture Issue Date: 2025-09-16 GPT Summary- Forgeting Transformer(FoX)は、忘却ゲートを用いたソフトマックスアテンションを特徴とし、従来のTransformerと比較して優れた性能を示す。FoXの特性を活かし、適応計算プルーニング(ACP)を提案し、計算を動的にプルーニングすることで、FLOPsとメモリアクセスを約70%削減。これにより、アテンションの実行時間を50%から70%短縮し、トレーニングスループットを10%から40%向上させた。性能の劣化はなく、長い文脈長ではさらなる計算コストの節約が可能である。 Comment
code: https://github.com/zhixuan-lin/forgetting-transformer
元ポスト:
openreview: https://openreview.net/forum?id=xNj14CY5S1#discussion
[Paper Note] Efficient Context Selection for Long-Context QA: No Tuning, No Iteration, Just Adaptive-$k$, Chihiro Taguchi+, arXiv'25
Paper/Blog Link My Issue
#InformationRetrieval #NLP #ContextWindow #RAG(RetrievalAugmentedGeneration) #read-later Issue Date: 2025-09-10 GPT Summary- Adaptive-$k$ retrievalを提案し、クエリと候補パッセージの類似度に基づいて適応的にパッセージ数を選択。これにより、固定サイズのベースラインと同等以上の性能を発揮し、トークン使用量を最大10倍削減しつつ70%の関連パッセージを取得。LCLMsと埋め込みモデルで精度向上を実現し、動的なコンテキストサイズ調整が効率的なQAに寄与することを示す。 Comment
元ポスト:
実務上コストを抑えられるのは非常に嬉しい。あとで読む。
[Paper Note] SpikingBrain Technical Report: Spiking Brain-inspired Large Models, Yuqi Pan+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #Architecture #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2025-09-08 GPT Summary- SpikingBrainは、長いコンテキストの効率的なトレーニングと推論のために設計された脳にインスパイアされたモデルで、MetaX GPUクラスターを活用。線形およびハイブリッド線形アーキテクチャを採用し、非NVIDIAプラットフォーム上での大規模LLM開発を実現。SpikingBrain-7BとSpikingBrain-76Bを開発し、約150BトークンでオープンソースのTransformerと同等の性能を達成。トレーニング効率を大幅に改善し、低消費電力での運用を可能にすることを示した。 Comment
元ポスト:
TTFTが4Mコンテキストの時にQwen2.5と比べて100倍高速化…?
中国のMetaX社のGPUが利用されている。
https://www.metax-tech.com/en/goods/prod.html?cid=3
[Paper Note] REFRAG: Rethinking RAG based Decoding, Xiaoqiang Lin+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #LongContext #Decoding #read-later #Selected Papers/Blogs #SpeculativeDecoding Issue Date: 2025-09-07 GPT Summary- REFRAGは、RAGアプリケーションにおける遅延を改善するための効率的なデコーディングフレームワークであり、スパース構造を利用して初回トークンまでの時間を30.85倍加速します。これにより、LLMsのコンテキストサイズを16まで拡張可能にし、さまざまな長コンテキストタスクで精度を損なうことなくスピードアップを実現しました。 Comment
元ポスト:
興味深い。Speculative Decodingの新手法ともみなせそう。
同時期に出た下記研究と比較してどのようなpros/consがあるだろうか?
- [Paper Note] Set Block Decoding is a Language Model Inference Accelerator, Itai Gat+, arXiv'25
解説:
[Paper Note] Set Block Decoding is a Language Model Inference Accelerator, Itai Gat+, arXiv'25
Paper/Blog Link My Issue
#NLP #Decoding #read-later Issue Date: 2025-09-05 GPT Summary- Set Block Decoding(SBD)を提案し、次トークン予測とマスクトークン予測を統合して生成を加速。SBDは複数の未来のトークンを並行してサンプリング可能で、従来の手法よりも速度向上を実現。アーキテクチャ変更なしで既存モデルをファインチューニングし、フォワードパスの数を3-5倍削減しつつ同等のパフォーマンスを達成。 Comment
元ポスト:
[Paper Note] GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents, Manish Shetty+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering Issue Date: 2025-09-03 GPT Summary- 高性能ソフトウェア開発における言語モデルの能力を評価するためのベンチマークGSOを提案。102の最適化タスクを特定する自動化パイプラインを開発し、主要なソフトウェアエンジニアリングエージェントの成功率は5%未満であることを示した。定性的分析により、低レベル言語や最適化戦略の課題が明らかになった。研究の進展のために、ベンチマークのコードとエージェントのデータを公開。 Comment
pj page: https://gso-bench.github.io
ソフトウェアの高速化に関するベンチ
元ポストに掲載されているリーダーボードはどこにあるのだろう。ざっと見た感じ見当たらない。
[Paper Note] VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use, Dongfu Jiang+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #ReinforcementLearning #PostTraining #Asynchronous #TrainingFramework Issue Date: 2025-09-03 GPT Summary- VerlToolは、強化学習におけるツール統合の課題を解決するための統一的かつモジュラーなフレームワークを提供する。主な貢献は、互換性の確保、標準化されたAPIによるツール管理、非同期実行による速度向上、競争力のあるパフォーマンス評価である。これにより、マルチターンのインタラクションを形式化し、様々なタスクにおいて専門的なシステムと同等の結果を達成する。開発のオーバーヘッドを削減し、スケーラブルな基盤を提供する。コードはオープンソースで公開されている。 Comment
github: https://github.com/TIGER-AI-Lab/verl-tool
元ポスト:
[Paper Note] R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning, Jie Jiang+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #ReinforcementLearning #MultiModal #Reasoning #GRPO #VisionLanguageModel Issue Date: 2025-09-02 GPT Summary- R-4Bは、問題の複雑さに応じて思考を行うかどうかを適応的に判断する自動思考型のマルチモーダル大規模言語モデル(MLLM)である。思考能力と非思考能力を持たせ、バイモードポリシー最適化(BPO)を用いて思考プロセスの起動を精度良く判断する。訓練には多様なトピックのデータセットを使用し、実験結果はR-4Bが25のベンチマークで最先端のパフォーマンスを達成し、特に推論集約型タスクで低コストで高い性能を示したことを示している。 Comment
元ポスト:
VLMにthinking, non-thinkingを入力に応じて使い分けさせる手法
