Transformer (343) — 1/2
[Paper Note] DepthBench: Measuring How Residual Connections Enable More Computational Depth, Keyu Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Architecture #ResidualStream #Initial Impression Notes Issue Date: 2026-10-02 GPT Summary- モデルサイズと事前学習条件を固定し、幅と深さの比率を変化させるDepthBenchで、Transformerの計算深度を評価。 10種類のアーキテクチャを比較した結果、標準的なPre-LNや正規化・スケーリング系手法は深く狭い構造で性能向上が乏しく、低下する場合もある一方、HCとFull AttnResは極端に深い構造でも一貫して性能を向上。 層レベルの分析から、追加層を有効活用できる残差接続の設計が、アーキテクチャ上の深さを実効的な計算深度へ変換する主要因であることを示した。 Comment
元ポスト:
(以下元ポストを参考に自分の言葉でメモ)
残差ストリームに対する様々なアーキテクチャを、統一した条件で(1.6B程度のモデルサイズまで)比較した結果、モデルを深くした場合に性能が改善する傾向にあるのはHC, AttnResのみであった。
その理由として、HCでは複数の残差ストリームを並列に保持すること、AttnResでは層ごとの中間表現を保持し後の層が必要に応じて取り出す、といったメカニズムによって、PreLNなどで典型的に見られる深い層になると残差ストリームが類似する(結果的に層を増やしても新たな情報が蓄積されない)性質が緩和され、深さ方向に追加した層をより有効に活用していることが示唆される、という感じの話に見える。
関連:
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] DeepNet: Scaling Transformers to 1,000 Layers, Hongyu Wang+, arXiv'22, 2022.03
- [Paper Note] Post-LayerNorm Is Back: Stable, ExpressivE, and Deep, Chen Chen+, arXiv'26, 2026.01
- [Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02
- [Paper Note] Mixture-of-Depths Attention, Lianghui Zhu+, arXiv'26, 2026.03
- [Paper Note] On Layer Normalization in the Transformer Architecture, Ruibin Xiong+, arXiv'20, 2020.02
[Paper Note] Decoding Looped Transformers Better for (Almost) Free, Weihao Liu+, arXiv'26, 2026.10
Paper/Blog Link My Issue
#NLP #Decoding #Selected Papers/Blogs #reading #RecurrentModels #Initial Impression Notes Issue Date: 2026-10-02 GPT Summary- ループ型Transformerの中間再帰状態を用いて、最終予測と早期予測を対比する学習不要のデコード手法LoopCDを提案。 追加の出力パスを用いるLogits版と、隠れ状態空間で動作するHidden版により、弱い予測をガイダンス信号として活用する。 4種類のモデルで性能を一貫して向上させ、再帰回数を半分にしても性能を維持しつつ、推論FLOPsを22.5〜48.2%削減。 Comment
元ポスト:
Contrastive Decodingで示されている、アマチュアの出力とエキスパートの出力の差を見ることで言語モデルにおける典型的なfailure modeを抑制し、エキスパート特有の出力を強調する、といったデコーディングの考え方をLooped Transformerのループが浅い時点の表現をアマチュア、深い時点の表現エキスパートとみなすことで、Looped Transformer上で自然に実現する、という話に見え、これによりfull depthで比較した場合により高いベンチマークスコアを得ることができ、ループの深さを半分にしても同等以上の性能が得られ、結果的に計算量を削減しながらull depthと同等程度の性能を得ることができる、という話に見える。
[Paper Note] Looped Diffusion Transformer, Yong Xien Chng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #DiffusionModel #TextToImageGeneration #Architecture #RecurrentModels #ImageSynthesis Issue Date: 2026-10-02 GPT Summary- テキスト画像生成において、共有Transformerブロックをノイズ除去ステップ内で反復実行するLooped-DiTを提案。中間ループへの深い教師あり学習と自己調整型注意機構により、弱い教師信号と局所情報の損失を防ぐ。パラメータ数と計算量を抑えつつ、6.5倍大きいモデルを上回り、ノイズ除去ステップを増やすよりループを深くする方が効果的であることを示した。 Comment
元ポスト:
[Paper Note] How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents, Zixi Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Scaling Laws #read-later #RecurrentModels #Author Thread-Post Issue Date: 2026-09-18 GPT Summary- スケーリング則は、計算量の増加に伴う損失の低下を予測することに焦点を当て、アーキテクチャがスケーリング指数に影響を与えることを示す。特に、ループ型トランスフォーマーは訓練中にモデル成長を促進し、計算効率を飛躍的に向上させる結果をもたらす。7.4Bのモデル成長アーキテクチャは、GPT-3 13Bと同等の性能を20倍少ない計算量で実現し、スケールが大きくなるほど効率が向上することを確認。また、ループ回数の増加が計算最適性に寄与し、トランスフォーマーの深さを増やすことが効率改善につながることが示された。 Comment
元ポスト:
[Paper Note] SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers, Shaowen Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Scaling Laws #read-later #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- ループ化されたトランスフォーマーを用い、Mixture-of-Experts(MoE)での効率を評価。SMELT(Sparse MoE Transformer、middle layers Loop Twice)手法を導入し、中間層の半分を2回ループさせることで計算量を最適化。最大54Bの非埋め込みパラメータでスケールし、計算量の増加に伴い損失を迅速に低下させ、学習FLOPsを節約。アテンション・シンクを減少させることで関連トークンへの分布再配分が性能向上に寄与し、ループ化の有効性を実証。 Comment
元ポスト:
[Paper Note] Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation, Amr Hegazy+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Architecture #read-later #RecurrentModels Issue Date: 2026-09-05 GPT Summary- スケーリングされたトランスフォーマー言語モデルは、表現力とメモリ効率の間に緊張を生じる。本研究では、ゲート付き再帰トランスフォーマ(Gated Recurrent Transformer)を提案し、再帰的更新を軽量な射影と要素ごと更新ゲートで調整する。これにより、少数の層に特化し、多様な機能を持つことが可能となる。3層のモデルは、12層のGPT-2 Smallと同等の精度を達成し、パラメータを63%削減しながらコンパイル済み生成遅延は10%増加することが示された。 Comment
元ポスト:
[Paper Note] Hydra-0: Action Flow for Generalist World Modeling and Control, Hongyu Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#General #DiffusionModel #Selected Papers/Blogs #Robotics #WorldModels #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- Hydra-0は、行動フローに基づく一般的な世界モデルで、ロボットの動作をピクセル運動として表現します。このモデルは、タスクや環境を跨いで行動の結果を学習し、動作誤差を大幅に低減します。また、ゼロショット適応やデータ効率向上をサポートし、RoboLabベンチマークで高い相関を示します。さらに、人間のデモから転移した望ましい物体フローを利用して、ロボット運動を予測する新しいインタフェースも提案しています。これにより、異種の訓練データを結ぶポテンシャルが示されます。 Comment
元ポスト:
ロボットのアクションを、ロボット固有の表現ではなく、画像上の点の軌跡(action flow)で表現として学習する(特定のロボットと密結合したシグナルを学習するのをやめる)。これにより、異なる実体をデータから学習可能なgenericなモデルを実現し、転移を容易にする、という話に見える。
[Paper Note] WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing, Wenbo Zhang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #Architecture Issue Date: 2026-08-20 GPT Summary- 自己回帰デコード中に深い表現を活かすため、WhiteMatterでは各注意層が過去トークンのすべての層からの表現に接続。接続重みは消費層ごとに変化し、トークンごとに混合された状態をKVチャンネルに分配。これにより、KVキャッシュのメモリ使用量を削減しつつ、従来のバニラTransformerを上回る性能を実現。 Comment
元ポスト:
[Paper Note] Recirculation, Michael C. Mozer+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Architecture #read-later #RecurrentModels Issue Date: 2026-08-19 GPT Summary- 既製の基盤モデルにアーキテクチャ改善を施し、生成と推論タスクのパープレキシティを大幅に低減し精度を向上。リサーキュレーション技術により、動的システムとしての機能を持たせ、信念状態を追跡。適応的リサーキュレーションは軽微なハイパーパラメータ調整だけで顕著な性能向上を実現し、データセット間で安定した精度改善を示す。訓練不要のアプローチが成功を収め、アーキテクチャの進化の道を開く。 Comment
元ポスト:
ポイント解説:
[Paper Note] Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension, Amanda Bertsch+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #LongContext #Architecture #Selected Papers/Blogs Issue Date: 2026-08-14 GPT Summary- 密なトランスフォーマー系におけるアーキテクチャの変化は、長い文脈設定での性能に顕著な影響を及ぼすことを示す。特に、Olmo、Llama、Qwenのモデルファミリーにおいて、特定のアーキテクチャ決定が長い文脈での性能を最大47%低下させることが判明した。これらの差は短い文脈では検出できず、長い文脈能力はアーキテクチャ的特徴によって大きく変動する。17万GPU時間を超える学習の後、得られたモデル群をOlmPoolとして公開し、長い文脈拡張性に優れたアーキテクチャを分析した。 Comment
元ポスト:
[Paper Note] Full-bandwidth transformer, Xi Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Pretraining #NLP #Architecture #LatentReasoning #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 全帯域トランスフォーマは、デコード時に過去の隠れ状態を再フィードバックし、深さの予算を新たにしつつ、標準のトランスフォーマと同じ目的を維持します。潜在フィードバックを導入することで、検証損失や性能評価を向上させ、約1.5倍多くのトークンで訓練された標準のトランスフォーマと同等またはそれ以上の精度を達成します。 Comment
元ポスト:
解説:
[Paper Note] Training nGPT, Ilya Loshchilov+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SSM (StateSpaceModel) #Architecture #MoE(Mixture-of-Experts) #Normalization #Hybrid #Initial Impression Notes #LinearAttention Issue Date: 2026-08-10 GPT Summary- nGPTは、モデルパラメータと活性化を超球面に制約し、超球面表現学習を実現。実用的なトレーニングレシピを提案し、ハイブリッドMoEモデルで評価。ロジット勾配の前処理や学習率減衰などを導入し、未正規化モデルと比較して、少ないトレーニングトークンで同等のパフォーマンスを達成。検討対象モデルは最大14Bのパラメータにスケール可能。 Comment
元ポスト:
解説:
nGPTを提案した著者らによる研究で、オリジナルのnGPTではdenseなアーキテクチャで、1Bまでのサイズでしか実験がされていなかった。それをより大規模な14BBレベル、かつMoE、Mamba-2とTransformerのハイブリッドモデルで実験し、学習のために必要な提案を実施しているようである。3.3節にどのような変更が必要か、サマリが記述されている。
性能は、通常のGPTと比較して一貫して改善しており興味深い。
ハイパーパラメータが増えているように感じるが、どの程度ハイパーパラメータの設定が効いてくるのだろうか。学習率の調整だけでも厄介なので、モデルの性能は魅力的でロマンがあるが、実務上は採用しづらい気はする。
[Paper Note] When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers, Tong Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Architecture #RecurrentModels #RecursiveModels Issue Date: 2026-08-04 GPT Summary- 重みを共有したループ型トランスフォーマーに関する研究で、群の語問題に対する四つの主要な発見を示す。まず、無予算訓練により、線形計算のフロンティアが定着し、訓練時とテスト時で異なるループ数の許容が原理的な停止規則を生む。次に、アーキテクチャの選択は表現力よりもアルゴリズムに焦点を当て、重み共有がモデルの能力に影響を与えることがわかる。また、境界の複雑さはパフォーマンスに影響を及ぼし、演算子の共同学習におけるデッドロックが報告される。最後に、ウォームスタートによるアルゴリズムの転送は成功するが、自由訓練の設定によっては失敗することが観察され、収束時間スケーリングを導入して因果的な検証を行い、標準的な指標とは異なる結果が得られることを示す。 Comment
元ポスト:
うーむ...難しそうだ...
[Paper Note] T^2MLR: Transformer with Temporal Middle-Layer Recurrence, Ziyang Cai+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #Architecture #LatentReasoning #One-Line Notes #Reading Reflections Issue Date: 2026-08-03 GPT Summary- T2MLR(Temporal Middle-Layer Recurrence)を用いたTransformerベースの推論アーキテクチャを提案。従来の圧縮による制限を克服し、前のトークンからの中間層表現を浅い層に統合することで、中間計算を持続的に活用。自然言語処理タスクで強力なベースラインを上回る性能を発揮し、全層をループさせる必要はなく局所的な再発適用でも効果的。短期間のファインチューニングで数学的推論能力が向上し、実用的な導入の障壁を低減。 Comment
元ポスト:
Transformerのデコード時の中間状態を、次トークン予測時のより浅いレイヤーに接続すると性能が向上する。
元ポストにもある通り、
- [Paper Note] Training Large Language Models to Reason in a Continuous Latent Space, Shibo Hao+, COLM'25
ではhidden stateを次トークン予測の入力に追加するという話だったが、前トークンの中間表現が直接layerに接続されるという点で異なっている。
- [Paper Note] Tapered Language Models, Reza Bayat+, arXiv'26, 2026.06
では、モデルの浅い層により多くのパラメータを割り当てることで性能が改善することが示されており、本研究での手法はパラメータを増加させるのではなく、前トークン予測時に計算された情報をうまく次トークン予測時に引き継がせることで、浅い層のパラメータをより効果的に活用できるようにしている、というイメージになるのかなと感じる。
全体的な傾向として最近はTransformerの浅い層の表現を改善するという話が多そうに感じるが、深い層をうまく改善するような方向性はどの程度模索されているのだろうか?
[Paper Note] DeepLoop: Depth Scaling for Looped Transformers, Shuzhen Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #read-later #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Scalability #Depth #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- ループド・トランスフォーマーは、逐次計算をスケールさせるために物理ブロックを再利用し、パラメータを増やすことなく展開深度を拡張します。この手法では、1つの共有更新が勾配を集約し、次の計算で再利用されます。DeepLoopとして実装されたこのアプローチは、訪問整合係数を用いて結合深さを制御します。GPT風のモデルで、再帰的深さが有効になると検証損失とタスク精度が向上し、残差スケーリング規則の考慮が重要であることが示されました。 Comment
元ポスト:
著者ポスト2:
関連:
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
[Paper Note] xHC: Expanded Hyper-Connections, Xiangdong Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Selected Papers/Blogs #reading #Sparse #ResidualStream #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- xHC(Expanded Hyper-Connections)は、トランスフォーマーの残差ストリームをN=4を超えて拡張し、メモリのスケーリングを実現する新手法である。これにより、書き戻し情報の質を向上させ、N=16のストリームから4つのみを更新する疎なアーキテクチャを採用。実験により、xHCは18B MoEモデルでmHCよりも4.0ポイントの性能向上を示し、学習コストの増加を抑制する。加えて、xHC-Flashを導入することでメモリトラフィックを削減し、スケーリング法則においても従来手法に比べて効率的であることを実証。これにより、LLMの大規模トレーニングにおける残差ストリーム展開が実用的に改善される。 Comment
元ポスト:
関連:
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
残渣ストリームの本数を増やし、Routerを導入しそのうちのtop-kを活性化させるようなsparseな残渣ストリームの提案のようだが、他にも工夫がありそう。mHCと比較してlossが大きく改善しているように見えるので気になる。
[Paper Note] Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers, Ying Fan+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LatentReasoning #reading #One-Line Notes #RecurrentModels #RecursiveModels #Scalability #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- ループ型トランスフォーマーを用いたLOTUSは、明示的連鎖思考(CoT)の効率を改善し、1Bパラメータを超える規模でのギャップを埋める初の手法。K個の潜在ブロックをR回反復処理することで、思考フェーズのレイテンシを大幅に削減し、解釈可能な潜在空間を提供。アブレーション実験で、ループバックボーンと並列監督の重要性が確認された。 Comment
元ポスト:
ポイント解説:
Latent Reasoningのためにlooped transformerを導入し、loopによって各step単位のCoTが生成可能なようにCrossEntropy lossを適用して、適切なloopに対するReasoningの挙動を調整する。これにより、モデルスケールが大きくなった場合に性能が低下する課題を緩和し、副次的な効果としてLatent Reasoningの内容がデコード可能になった、という話に見える。
[Paper Note] The State-Prediction Separation Hypothesis, Giovanni Monea+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Architecture #read-later #Author Thread-Post Issue Date: 2026-07-15 GPT Summary- トランスフォーマーの性能向上のために「状態予測分離仮説」を提唱し、二つの計算ストリームで役割を分ける変種を設計。実験結果は、状態予測の分離がデータ処理と計算の効率を改善し、検証損失を低下させ、下流タスクで標準のトランスフォーマーを平均2〜3%上回ることを示した。根本的な勾配の違いに関する分析も実施。 Comment
元ポスト:
[Paper Note] Comparing Transformers and Hybrid Models at the Token Level, Yanhong Li+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Analysis #RecurrentModels #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- ハイブリッド言語モデルはアテンション層と再帰層を組み合わせており、理論的に状態追跡の限界を緩和する可能性がある。実験では、ハイブリッドモデルが純粋なトランスフォーマーよりもロスや評価で優れた結果を示すことがあるが、利得の原因や理論的利点は未解明である。本研究では、Olmo 3 と Olmo Hybridのモデルを使用して、同一の条件下で損失を比較し、タグ、構造、合成プローブによって分析した。ハイブリッドモデルは多くのタグにおいて低い損失を示し、特にオープンクラスの語彙で顕著な利得が見られる。再帰層は文書の意味状態を活用し、トークン予測を改善する一方、アテンションは構文に依存するタスクで有利であることが見出された。 Comment
元ポスト:
[Paper Note] Depth-Attention: Cross-Layer Value Mixing for Language Models, Boyi Zeng+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Pretraining #NLP #Attention #Architecture Issue Date: 2026-06-05 GPT Summary- Depth-Attentionは、Transformerにおける情報の選択的再利用を改善する手法であり、各レイヤの先行キーに対してクエリがアテンションを行い、自己注意の値に統合する。これにより、追加のパラメータや永続的な推論状態を導入せずに、キャッシュサイズを維持しつつ、バニラTransformerよりも最大2.3ポイントの精度向上を実現。1.5Bおよび3Bのパラメータ規模でも高い精度と低いパープレキシティを達成し、ループ型Transformerにも適用可能。 Comment
元ポスト:
下記研究とはどこが異なるだろうか:
- [Paper Note] Mixture-of-Depths Attention, Lianghui Zhu+, arXiv'26, 2026.03
[Paper Note] Dynamic Short Convolutions Improve Transformers, Oliver Sieberling+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #ConvolutionalModels #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- 動的ショート畳み込みをトランスフォーマーに導入し、静的畳み込みの局所性バイアスを維持しつつ表現力を向上。実験により、動的畳み込みが高難度の連想想起タスクでの性能を向上させ、標準トランスフォーマーを一貫して上回ることを示した。計算量に対する優位性も確認され、効率的なトレーニングを実現するカスタムTritonカーネルを提供。動的ショート畳み込みはトランスフォーマー技術の進展に寄与することを示唆している。 Comment
元ポスト:
所見:
所見:
関連:
- [Paper Note] Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers, Zeyuan Allen-Zhu+, ICML'24 Tutorial
[Paper Note] Déjà View: Looping Transformers for Multi-View 3D Reconstruction, Alessandro Burzio+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #3D Reconstruction #RecurrentModels Issue Date: 2026-06-05 GPT Summary- DéjàViewモデルは、ループ状トランスフォーマブロックを用いて視点ごとの特徴を再帰的に処理し、反復を明示的に組み込むことにより、効率的な3D再構成を実現。これにより、少ないパラメータでフィードフォワードモデルと同等以上の性能を発揮し、計算量も低く抑えられる。明示的な反復が、より強い帰納的バイアスを提供することを示した。 Comment
元ポスト:
pj page: https://research.nvidia.com/labs/dvl/projects/dvlt/
[Paper Note] Lattice Deduction Transformers, Liam Davis+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Architecture #On-Policy #RecurrentModels #Exploration Issue Date: 2026-06-03 GPT Summary- 格子推論トランスフォーマー(LDT)は、潜在状態を格子に射影することで論理的推論を行う再帰的トランスフォーマー。探索ベースの制約解法の推論プロセスを模倣し、抽象解釈に基づく近似で訓練。80万パラメータのLDTはSudoku-ExtremeとSnowflake Sudokuで100%の精度を達成し、コスト面で優れた実績を示す。180万パラメータのバリアントはMaze-Hardで99.9%の精度を記録。一方、最先端のLLMsは全ベンチマークで0%。 Comment
元ポスト:
[Paper Note] Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations, Kevin Y. Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #Architecture #One-Line Notes #ConvolutionalModels Issue Date: 2026-05-31 GPT Summary- Oryxというハイブリッドモデルを提案し、系列全体を通じて異なるトークン混合手法を柔軟に切り替えるアプローチを探る。二次アテンションと線形リカレンスを組み合わせ、90%のパラメータを共有することで、効率的な性能を実現。最長1.4Bパラメータのモデルで、従来のモデルを上回る結果を示し、内部表現の共有が有望な方向性であることを示唆。 Comment
元ポスト:
softmax attentionとgated delta net (linear attention)の利用をスイッチングによって動的に切り替え、双方でKVを共有し畳み込みをかけてinducive biasを導入した上で活用する。outputはRMSNorm側でgatingする。softmax attentionとlinear attentionの良いところを良いところ取りしようというアーキテクチャに見える。
[Paper Note] Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players, Fangfu Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #ComputerVision #DiffusionModel #VideoGeneration/Understandings #WorldModels #interactive #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- マルチエージェント環境におけるインタラクティブなビデオ生成のために、私たちの生成的マルチエージェントワールドモデルを提案。エージェント間の順列対称性を保ちながら、異なる位相で独立に制御可能であるSimplex Rotaryエージェントエンコーディングを用い、Sparse Hub Attentionでアテンション計算を効率化。トレーニングなしで2人から4人への一般化が可能で、映像の忠実度やアクション制御、一貫性を向上。 Comment
元ポスト:
pj page: https://research.nvidia.com/labs/sil/projects/gamma-world/
複数のエージェント環境における(エージェントのaction, 前回アクションからのobservationが与えられた上で、次の世界の状態を予測し画像で出力するという文脈での)World Model
[Paper Note] DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation, Makoto Shing+, ICLR'26, 2025.06
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #DiffusionModel #ICLR #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- DiffusionBlocksは、Transformerベースのネットワークを独立した訓練可能なブロックに変換する新しいフレームワークで、メモリボトルネックを軽減しながらエンドツーエンド訓練と同等の性能を維持します。残差結合の特性を活用し、各ブロックが独立に学習できるため、メモリ要件が削減されます。視覚系や拡散など多様なTransformerアーキテクチャに対する実験により、DiffusionBlocksがスケーラブルな訓練を可能にすることが示されています。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=pwVSmK71cS
巨大な残差接続を持つTransformer-likeなモデルをB個のブロックに分割し、ブロック単位で独立してパラメータを学習することによって、学習時に必要なメモリを1/Bに削減できる手法のようである。
(しっかり読めていないので色々と勘違いがあるかもしれないし、気持ちの部分をうまく表現しきれていないかもしれないが)
手法の概要としては、L layer単位でブロックをB個定義する。各ブロックにはnoise rangeの元ノイズを定義し、sample data (x, y)がgivenな時に、出力yにノイズを付与した~yを考える。~yから元の出力yを再現するようデノイジングするように、他のブロックはfreezeしたままで、あるブロックのパラメータを調整する、という操作を繰り返す、という手法のようである。Inference時は、平均0、学習時に定義したnoiseレベルの最大値を分散として持つ正規分布からノイズをサンプリングし、ノイズをinput xがgivenな状態で各ブロックでsequentialにdenoisingしていく(Euler Step)ことによって、最終的に所望の出力yを得る、といったような拡散モデルの逆プロセスを経て出力を得るようである。各ブロックがカバーするノイズのrangeは決まっているが、sequentialにdenoisingをしていくため、ブロック全体でみると大きなノイズからスタートするが、それぞれのブロックに対する入力のnoise levelは徐々に低減していき、各ブロックが担当するnoise levelのrangeまで落ちることが期待され、このような手続きが実現できると思われる。
[Paper Note] MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale, Zhicong Tang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #CVPR #2D (Image) #Editing #ImageSynthesis #Initial Impression Notes #Author Thread-Post #ImageToLayer Issue Date: 2026-05-28 GPT Summary- 多層透明画像の生成と編集に特化した200億パラメータのマスク領域拡散モデル「MRT」を提案。テキストおよび画像からのレイヤー生成を統合し、柔軟なレイヤー単位の操作を実現。オーバーフロー対応のキャンバスレイヤーによって、透明な背景合成をサポートし、リアルタイムの生成を可能に。実験により、従来の技術を大きく上回る性能を示し、特に編集品質や推論速度で優位を獲得。 Comment
元ポスト:
pj page: https://mrt-cvpr.github.io/
画像生成ではなく、layer生成にフォーカスした研究で、text-to-layer generation, image-to-layer decomposition, layer-to-layer addition, layer-to-layer restylizationなどが可能なようである。
[Paper Note] VGGT-$Ω$, Jianyuan Wang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Architecture #CVPR #read-later #Selected Papers/Blogs #3D Reconstruction #3D (Scene) #Backbone #Scalability Issue Date: 2026-05-27 GPT Summary- VGGT-Ωは、フィードフォワード再構成モデルの新たなアプローチを提案し、静的および動的シーンの再構成精度と効率を向上させます。アーキテクチャの改良により、GPUメモリ使用量を約30%に抑えつつ、15倍の監視付きデータを活用。レジスタを用いたコンパクトな情報表現により、フレーム間の情報交換を効率化しました。VGGT-Ωは複数のベンチマークで優れた結果を示し、Sintelでは従来ベストを77%上回る精度を達成。学習済みのレジスタは視覚・言語モデルの向上に貢献し、再構成が空間理解の強力なタスクとして機能する可能性を示しています。 Comment
pj page: https://vggt-omega.github.io/
元ポスト:
関連:
- [Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
[Paper Note] CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs, Han Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #EfficiencyImprovement #NLP #LanguageModel #reading #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- CODAは、トランスフォーマーのオペレータをGEMMプラスエピローグとして再パラメータ化し、計算をメモリ書き込み前に実行可能にするGPUカーネルの抽象化である。このアプローチにより、データ移動のボトルネックを軽減し、標準的なTransformerブロックの計算を効率化。代表的なワークロードで高性能を達成し、生産性と効率を両立する道を示す。 Comment
元ポスト:
[Paper Note] (Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models, Maksim Zhdanov+, ICLR'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #ICLR #One-Line Notes #SparseAttention #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 本研究では、MLベースの気象予測のスペクトル劣化に対応する確率的モデル「Mosaic」を提案。三つの故障モードを扱い、アンサンブルメンバーを生成する。1.5°解像度で214Mパラメータを持つMosaicは、高解像度モデルに匹敵する性能を示し、ほぼ完璧なスペクトル整合性を達成。予報は高速に実行可能で、コードも公開中。 Comment
元ポスト:
block-sparse attentionによるtransformerベースの天気予報モデル
[Paper Note] LT2: Linear-Time Looped Transformers, Chunyuan Deng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Architecture #LatentReasoning #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LT2(Linear-Time Looped Transformers)は、ループ処理と線形またはスパースアテンションを組み合わせ、計算コストを削減する新しいアーキテクチャ。これにより反復的なメモリ精緻化や有効受容野の拡張が実現され、従来のモデルの性能を上回る。LT2-hybridでは異なるアテンションバリアントを組み合わせ、効率と品質の両面で最適化。約1Bトークンの訓練データで、変換済みモデルは業界標準を超え、ループ型トランスフォーマーのスケーラビリティを向上させる。 Comment
元ポスト:
[Paper Note] Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, Ali Hatamizadeh+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Architecture #LinearAttention Issue Date: 2026-05-22 GPT Summary- Gated DeltaNet-2は、線形アテンションの圧縮メモリを編集するためにGated Delta Rule-2を導入し、適応的忘却とチャネルごとの減衰を実現。チャネルごとの消去ゲートと書き込みゲートを分離し、それぞれの役割を明確にすることで性能を向上。13億パラメータでトレーニングされたモデルは、言語モデリングや常識推論において強力な結果を示し、特に長文のRULERベンチマークで顕著な利点を発揮。コードは公開中。 Comment
元ポスト:
所見:
解説:
[Paper Note] BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding, Jiayi Yuan+, MLSys'26 Best Paper, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Training-Free #Selected Papers/Blogs #MLSys #reading #One-Line Notes #SparseAttention #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- BLASSTは、LLMsの文脈での推論能力向上のために提案された動的スパースアテンション機構である。固定スカラー閾値を用いて計算を加速し、トレーニング要件を排除、既存フレームワークと容易に統合可能。自動閾値キャリブレーション手法により、最適閾値と文脈長の逆比例関係が明らかにされ、前計算とデコードそれぞれに単一の閾値を利用。現代GPU上でのベンチマークにおいて、前計算とデコードがそれぞれ1.52倍、1.48倍の速度向上を示し、精度を維持した。 Comment
元ポスト:
training-freeで単一のスカラー閾値による制御によって、スキップ可能なattention blockをスキップするSparse Attentionとのこと。
非常に使い勝手が良さそうで、50%程度のSparsityにしてもベースラインとなるDense Attentionに対してダウンストリームタスクの性能低下はなく(Table 4)、50%程度のSparsityの場合、prefillとdecode step方法において、Blackwell, Hopperアーキテクチャにおいて約1.3倍の高速化を実現できる(Table5)。
[Paper Note] Delta Attention Residuals, Cheng Luo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Delta Attention Residualsは、従来のアテンション残差の冗長性を解消し、それに代わりサブレイヤーによって導入される変化量に焦点を当てることで、選択的なルーティングを強化します。この新しい手法は、より高いコントラストのアテンション分布を生成し、層間での効果的なルーティングを実現することを示しています。実験により、Delta Attention Residualsは、従来の手法よりもパフォーマンスが一貫して向上し、検証perplexityが改善されることが確認されました。 Comment
元ポスト:
[Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #LongContext #PositionalEncoding #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-19 GPT Summary- RoPEの制約を分析し、文脈長の増加が局所性バイアスとトークン関連性の一貫性を損なうことを証明。アテンションスコアがランダム推測に近づく中、位置やトークンの識別が困難になることを明らかに。ハイパーパラメータ増加は識別能力を向上させるが、トレードオフが生じることも示唆。従来のアーキテクチャではこの制約を克服できず、将来のモデルには新たなメカニズムが必要とされる。 Comment
元ポスト:
これが真であればlong contextを扱う上での根本的なアーキテクチャ側の課題として非常に重要な知見
- Positional Encodingという仕組みにそもそもの限界があるのか、改善したらさらなるlong contextが扱えるのか
- Positional Encoding機構にそもそも原理上の限界があるなら、単一のモデルで超long contextの実現は非現実的になるので、複数のモデルやシステムの連携が必須になる
というような感想を抱いたが、果たして。実際複数モデルの連携という意味でいうとサブエージェントのを使ったら仕組みはすでに動いている。
所見:
[Paper Note] TIDE: Every Layer Knows the Token Beneath the Context, Ajay Jaiswal+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #read-later #Selected Papers/Blogs Issue Date: 2026-05-10 GPT Summary- トークンインデックスの単一注入仮定を再検討し、Rare Token ProblemとContextual Collapse Problemに対処するためにTIDEを提案。TIDEはEmbeddingMemoryで標準トランスフォーマーを拡張し、依存性のない意味ベクトルを用いて各層へ注入。理論的・実証的にTIDEの効果を示し、言語モデリングや下流タスクでの性能向上を実証。 Comment
元ポスト:
関連:
- [Paper Note] Value Residual Learning, Zhanchao Zhou+, ACL'25
[Paper Note] Normalized Architectures are Natively 4-Bit, Maxim Fishman+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Normalization #LowPrecision Issue Date: 2026-05-10 GPT Summary- nGPTアーキテクチャを使用することで、4ビット精度での大規模言語モデル訓練が効率的に行えることを示す。モデルの重みを超球面に制約することで、低精度算術への耐性を高め、安定したNVFP4訓練を実現。1.2Bパラメータの密結合モデルと最大30BパラメータのMoEモデルで検証。量子化ノイズが標準アーキテクチャと正規化済みアーキテクチャで異なる挙動を示し、nGPTでは信号対ノイズ比が向上し、損失がフラットになることが確認された。スケールアップ時にこの効果が強化されることが示唆されている。 Comment
元ポスト:
[Paper Note] Let ViT Speak: Generative Language-Image Pre-training, Yan Fang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #MultiModal Issue Date: 2026-05-08 GPT Summary- GenLIPは、視覚トークンから直接言語トークンを予測する生成前訓練フレームワークで、マルチモーダル大規模言語モデル向けに設計されています。この手法は、単一のトランスフォーマーを用いて視覚とテキストを共同でモデル化することで簡潔性を持ち、データやモデルのスケーラビリティを高めるとともに、多様なベンチマークで優れた性能を示します。80億サンプルで訓練されたGenLIPは、限られた事前訓練データで強力な成果を上げ、さらにOCRやチャート理解などの細部に敏感なタスクでも改善が見られます。 Comment
元ポスト:
[Paper Note] Beyond N-gram: Data-Aware X-GRAM Extraction for Efficient Embedding Parameter Scaling, Yilong Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #read-later #memory #Reference Collection Issue Date: 2026-05-06 GPT Summary- X-GRAMは、動的トークン注入フレームワークで、トークンインデックス付きルックアップテーブルの効率を向上させる。ハイブリッドハッシュとエイリアスミキシングを利用して、情報の圧縮と局所的特徴の抽出を図り、メモリを効果的に管理する。評価結果では、従来の手法に対して平均精度を最大4.4ポイント改善し、スケーラブルなアーキテクチャの実現を示した。 Comment
元ポスト:
[Paper Note] KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI, So Kuroki+, ICASSP'26, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #SpeechProcessing #read-later #Selected Papers/Blogs #One-Line Notes #Realtime #ICASSP #Author Thread-Post #SpeechToSpeech Issue Date: 2026-05-01 GPT Summary- 音声-音声モデルは低遅延で自然な応答を生成するものの、知識や意味理解に欠ける。一方、ASRとLLMを組み合わせたカスケード型システムは知識表現に優れるが、遅延が大きくなる。そこで本研究は、即時応答を実現する新たなハイブリッドアーキテクチャを提案。ユーザーの音声をS2Sトランスフォーマーで処理しつつ、クエリをLLMに並行伝送。これにより、遅延を増加させずに豊富な知識を応答に組み込むことが可能となる。MT-Benchベンチマークを用いた評価により、提案システムはS2Sモデルを大幅に上回りつつ、遅延は同等であることが示された。 Comment
元ポスト:
HF: https://huggingface.co/SakanaAI/kame
SpeechToSpeechのエンコーダ・デコーダモデルの裏で同時並行してLLMを走らせ、随時生成されるOracle Streamを考慮してデコードすることで、latencyと知識・推論性能を両立する。
著者ポスト:
[Paper Note] Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning, Grigory Sapunov, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #Architecture #memory Issue Date: 2026-04-30 GPT Summary- メモリートークンを用いた単一ブロックのUniversal Transformer(UT)とAdaptive Computation Time(ACT)を使ったSudoku-Extremeの研究を行い、メモリートークンが不可欠であることを示した。最適なトークン数の設定で安定した成功を得られる一方、特定の初期化方法が訓練の失敗を引き起こすトラップを発見。ACTは固定深度処理よりも一貫した結果をもたらし、λウェームアップを取り入れることで推論ステップを削減しても同等の精度を維持した。 Comment
元ポスト:
[Paper Note] The Recurrent Transformer: Greater Effective Depth and Efficient Decoding, Costin-Andrei Oncescu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #LatentReasoning #Reference Collection #RecurrentModels #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- Recurrent Transformerは、各レイヤが自らの活性化から計算されたキーとバリューにアテンションを行うことで、時間的深さを持ちながらも最適化の不安定さを軽減。従来のTransformerとトークン間の再帰的更新を穏やかな前提下でエミュレートし、計算の効率性を改善。150Mおよび300MパラメータのC4事前学習において、クロスエントロピーの改善を達成し、深さを幅へとトレードオフすることで、メモリ占有量と推論レイテンシを低減することを示した。 Comment
元ポスト:
解説:
[Paper Note] How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models, Kristian Schwethelm+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Scaling Laws #LatentReasoning #RecurrentModels Issue Date: 2026-04-26 GPT Summary- ループ化された言語モデルにおける追加の再帰が、等価なパラメータ数での価値を測定。116回の実験を通じて、新たな再帰等価指数 φ = 0.46 を導出。φ は、再帰の影響を検証損失に反映し、ループモデルの性能と計算コストの関係を明示化。下流評価ではパラメトリック知識タスクに差が残る一方、オープンブック課題では差が縮小。今後のアーキテクチャ選択は φ を基に比較可能に。
[Paper Note] Hyperloop Transformers, Abbas Zeitoun+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #LatentReasoning #RecurrentModels #ResidualStream Issue Date: 2026-04-26 GPT Summary- LLMのパラメータ効率を向上させる新しいアーキテクチャを提案。ループド・トランスフォーマーをコアに、深さを跨いでトランスフォーマー層を再利用し、通常のトランスフォーマーよりも効率的。中間ブロックをハイパーコネクションで拡張し、パラメータ数を約50%削減しつつ性能向上を実現。量子化後も優位性を維持し、メモリ効率の良い言語モデリングに寄与。 Comment
元ポスト:
[Paper Note] Sapiens2, Rawal Khirodkar+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Pretraining #ContrastiveLearning #Self-SupervisedLearning #ICLR #Encoder #Backbone #needs-revision #2D Reconstruction Issue Date: 2026-04-25 GPT Summary- Sapiens2は、高解像度トランスフォーマーのモデルファミリーで、人間中心のビジョンを重視する。4億〜50億パラメータを持ち、ネイティブ1K解像度を採用し、4K対応の階層的バリアントも提供。事前学習と後学習で大幅な性能向上を実現し、マスク済み画像再構成と自己蒸留型対比学習を統合したアプローチを採用。10億枚の高品質な人体画像データセットで事前学習を行い、アーキテクチャの進歩により安定性を向上。ポーズ推定や身体部位セグメンテーションなどのタスクで新たな最先端性能を達成。 Comment
openreview: https://openreview.net/forum?id=IVAlYCqdvW
元ポスト:
HF: https://huggingface.co/facebook/sapiens2
人物ドメインに特化したViTエンコーダ。事前学習はEncoder-Decoderアーキテクチャを利用しMasked Image Modelingで学習する。この際に、Reconstruction lossだけでなく、
[Paper Note] Transformers are Inherently Succinct, Pascal Bergsträßer+, ICLR'26 Outstanding Paper, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Architecture #Memorization #reading #Reference Collection #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- トランスフォーマーの表現力を測る指標として、簡潔さを提案し、有限オートマトンや線形時間論理(LTL)式よりも高度に形式言語を表現できることを証明。さらに、トランスフォーマーの性質の検証が理論的に困難であること(EXPSPACE 完全)を示した。 Comment
openreview: https://openreview.net/forum?id=Yxz92UuPLQ
元ポスト:
succinctnessの提案。あるパターンを表現するのに、RNN(SSM)や有限オートマトンなどと比較してtransformerは指数関数的に少ないパラメータ数で(理論上は)表現できることが数学的に示されているらしい。
つまりLinear Attentionをベースにしたモデルは計算効率やメモリ消費量では有利だが、表現力を犠牲にしている、ということが示された形になりそうである。
しかし1パラメータあたりに圧縮可能なコンセプトが増えれば増えるほどmemorizationの傾向が強くなり、汎化性能が失われるという見方もできる気がするので、この辺を踏まえると一概にsuccinctnessが高ければ良いというのも成り立たない気もする。
解説:
所見:
[Paper Note] A Mechanistic Analysis of Looped Reasoning Language Models, Hugh Blayney+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Architecture #LatentReasoning #Reference Collection Issue Date: 2026-04-21 GPT Summary- ループ推論型言語モデルの推論性能向上を探求し、フィードフォワードモデルとの内部ダイナミクスの違いを比較。循環的再帰を分析し、各層が異なる不動点に収束する様子を示す。再帰の過程でアテンションヘッドの挙動が安定化し、フィードフォワードモデルの推論段階を繰り返すことを発見。再帰ブロックのサイズや入力の注入が安定性に与える影響にも焦点を当て、設計の指針へと結びつける。 Comment
元ポスト:
解説:
[Paper Note] Geometric Context Transformer for Streaming 3D Reconstruction, Lin-Zhuo Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #LongContext #3D Reconstruction #3D (Scene) #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- ストリーミング3D再構成は、ビデオから3D情報を復元する技術で、精度や効率が求められる。LingBot-Mapは、SLAMの原理に基づいたフォワード型の3D基盤モデルで、幾何学的文脈トランスフォーマーを使用している。特徴的な注意機構は、アンカー文脈や軌跡メモリを活用し、長距離ドリフト補正を実現。これにより、長いシーケンスでも安定した推論が可能となり、従来手法に対して優れた性能を示した。 Comment
元ポスト:
pj page: https://huggingface.co/robbyant/lingbot-map
高速でlong contextでもstreaming形式で生成が可能な3D Reconstructionモデルのようである
[Paper Note] Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation, Zunhai Su+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #NLP #AttentionSinks #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- トランスフォーマーの常用される「Attention Sink(AS)」という課題に関する初の総説を提供。ASは過剰な注意集中により解釈可能性や推論に影響を与え、幻覚問題を悪化させる。研究は、基礎的活用、機構的解釈、戦略的緩和という三つの次元を軸にASを体系的に整理し、分野の進化を導く重要なリソースとして位置づける。 Comment
pj page: https://github.com/ZunhaiSu/Awesome-Attention-Sink
元ポスト:
Attention Sinkは
- [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
によって提言されたと思っていたのだが、時系列グラフをみると2023年1月時点で既に先行研究がありそうである。文献数は線形に増えている。
Initial FocusとしてAttention Sinksの活用方法が模索され、上記 [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
だけでなく以下のような研究も代表例として挙げられている。
- [Paper Note] KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization, Coleman Hooper+, arXiv'24, 2024.01
- [Paper Note] Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration, Zhongzhi Yu+, arXiv'24, 2024.06
[Paper Note] WildDet3D: Scaling Promptable 3D Detection in the Wild, Weikai Huang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Dataset #Prompting #Architecture #read-later #Selected Papers/Blogs #3D (Scene) #ObjectDetection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- 単一画像から3D物体を検出するために、WildDet3Dという統一的幾何認識アーキテクチャを提案。テキスト・点・ボックスのプロンプトを受け入れ、深度信号を組み込む。新しいオープン3DデータセットWildDet3D-Dataを生成し、13,500カテゴリの100万枚以上の画像を提供。複数のベンチマークで最先端の性能を達成し、特に深度手掛かりの活用により、平均+20.7 APの向上を実現。 Comment
pj page: https://allenai.github.io/WildDet3D/
元ポスト:
最大級の3D detection data+アーキテクチャの提案
training codeなどがリリース:
https://github.com/allenai/WildDet3D
[Paper Note] Lyra 2.0: Explorable Generative 3D Worlds, Tianchang Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #LongContext #read-later #VideoGeneration/Understandings #3D Reconstruction #3D (Scene) #WorldModels #SpatialUnderstanding Issue Date: 2026-04-16 GPT Summary- Lyra 2.0は、持続可能で探索可能な大規模3D世界を生成するフレームワークを提案。空間的忘却には3Dジオメトリを保持し、視点に応じた過去フレームを取得することで対応。時系列的ドリフトには自己拡張ヒストリーを活用し、誤差を訂正することで改善。これにより、長く一貫性のある動画軌道を実現し、高品質な3Dシーンの復元に活かす。 Comment
HF: https://huggingface.co/nvidia/Lyra-2.0
pj page: https://research.nvidia.com/labs/sil/projects/lyra2/
元ポスト:
[Paper Note] Parcae: Scaling Laws For Stable Looped Language Models, Hayden Prairie+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Stability #LatentReasoning #RecurrentModels #RecursiveModels #Initial Impression Notes Issue Date: 2026-04-16 GPT Summary- ループ型アーキテクチャの訓練の不安定性を克服するため、動的システムとして再定式化し、注入パラメータのスペクトルノルムを制約する新しいアーキテクチャParcaeを提案。Parcaeは従来モデルより低いパープレキシティを達成し、FLOPsのスケーリング特性を調査。訓練時に固定パラメータでのFLOPs増加法則を導出し、推論時には計算量のスケーリングを実現。2.99ポイントと1.18ポイントの品質改善を報告。 Comment
blog: https://sandyresearch.github.io/parcae/
元ポスト:
学習がより安定するような工夫を加えたlooped transformerのようである
所見:
[Paper Note] OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models, Han Zhu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SpeechProcessing #DiffusionModel #Speech #MultiLingual #OpenWeight #TTS #Initial Impression Notes Issue Date: 2026-04-07 GPT Summary- OmniVoiceは、600言語以上対応した多言語ゼロショットTTSモデルで、離散的非自己回帰アーキテクチャを採用。従来の複雑なパイプラインを排除し、テキストを直接音響トークンにマッピング。全コードブックランダムマスキング戦略とLLMからの初期化が技術革新を支える。581,000時間のオープンソースデータセットに基づき、中国語・英語などで最先端の性能を示す。モデルはオープンソースとして公開。 Comment
元ポスト:
github: https://github.com/k2-fsa/OmniVoice
dLMアーキテクチャだからかなり早いのでは。600+言語をサポート。
[Paper Note] When Does Sparsity Mitigate the Curse of Depth in LLMs, Dilxat Muhtar+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Sparse #Depth #Initial Impression Notes #CurseOfDepth Issue Date: 2026-03-17 GPT Summary- LLMの深さの呪いを軽減するために、スパース性が分散伝播を調整する役割を示す。暗黙的スパース性と明示的スパース性の2つの源泉を扱い、出力分散の削減と機能的分化を促進。深いモデルを効果的に利用するための実践的な知見を提供し、下流タスクで精度を4.6%向上させた。 Comment
元ポスト:
関連:
- [Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02
モデルのアーキテクチャやパラメータのスパース性が curse of depth を是正するという話らしい。
Figure1の記号はそれぞれ以下を表しており
- T: context window
- lambda: weight decay
- G: Group Query Attention
- MoE: Mixture of Experts
context windowを大きく、weight decayを強く(重みの正則化としての効果が強まる)、GQA (Attentionのスパース性が高まる)、MoE (MLPのスパース性が高まる)という感じだと思われ、特にGQA, MoEが大きく寄与してそうに見える。
[Paper Note] Mixture-of-Depths Attention, Lianghui Zhu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #Selected Papers/Blogs #One-Line Notes #CurseOfDepth Issue Date: 2026-03-17 GPT Summary- 深さスケーリングによる信号の劣化を克服するため、混合深度アテンション(MoDA)を提案。MoDAは、各アテンションヘッドが現在の層と前層のKVペアに注意を向けることで特徴を保持し、効率的なメモリアクセスを実現。15億パラメータモデルでの実験では、強力なベースラインを超え、平均困惑度を0.2ポイント改善し、ダウンストリームタスクで2.11%の性能向上を達成。計算オーバーヘッドはわずか3.7%。MoDAは深さスケーリングにおける有望なアプローチであることが示された。 Comment
元ポスト:
transformerにおけるattentionを、現在処理をしているトークンの、ある深さlのattentionにおいて、l-1以下の(=自身より浅い)layerの同じトークンに関するK, Vを参照できるように拡張する。
所見:
著者ポスト:
[Paper Note] Beyond Language Modeling: An Exploration of Multimodal Pretraining, Shengbang Tong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #MultiModal #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #read-later #Selected Papers/Blogs #WorldModels #UMM #Author Thread-Post Issue Date: 2026-03-05 GPT Summary- 視覚的データは言語を超えるマルチモーダルモデルの進展に重要で、我々は制御された前訓練実験を通じてその要因を明らかにした。Transfusionフレームワークを用い、テキストや視覚データで統一的に訓練し、以下の洞察を得た:(i) RAEが最適な視覚表現を提供;(ii) 視覚とテキストは相補的で相乗効果を生む;(iii) 統一学習が世界モデリングに繋がる;(iv) MoEが効率的なスケーリングを可能にする。視覚データが言語より多く必要であることを示し、MoEが両者の調和を図ることを提案。 Comment
元ポスト:
著者ポスト:
解説:
[Paper Note] Multi-Head Low-Rank Attention, Songtao Liu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Attention #Architecture #Decoding Issue Date: 2026-03-04 GPT Summary- 大規模言語モデルの長文文脈推論におけるKVキャッシュのボトルネックを解消するため、Multi-Head Low-Rank Attention(MLRA)を提案。これにより、4ウェイTPデコードの効率化が実現。実験により、MLRAは最先端の性能を達成し、MLAよりもデコード速度を2.8倍向上させることが確認された。 Comment
元ポスト:
[Paper Note] On the "Induction Bias" in Sequence Models, M. Reza Ebrahimi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #InductiveBias #Generalization #Initial Impression Notes Issue Date: 2026-03-03 GPT Summary- トランスフォーマーは実践的に成功しているが、状態追跡能力に限界があることが指摘されている。本研究では、トランスフォーマーとRNNのデータ効率を比較し、トランスフォーマーは状態空間とシーケンス長が増えるにつれて学習データの必要量が急激に増加することを示した。また、トランスフォーマーは異なるシーケンス長間での重み共有が少なく、長さ特有の学習を行っているのに対し、RNNはデータ再利用を通じて性能向上を実現している。これにより、トランスフォーマーの状態追跡が依然として根本的な課題であることが明らかになった。 Comment
元ポスト:
関連する話でAI Agentにおいて、学習データのtrajectoryが内包するhorizonを超えた途端に成功率が下がる、みたいな話があった気がしたのだが、どの論文だったか、、、。
linear attentionを一部用いているアーキテクチャなどでも、状態遷移の学習をうまくできないのだろうか?
[Paper Note] VidEoMT: Your ViT is Secretly Also a Video Segmentation Model, Narges Norouzi+, CVPR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #ImageSegmentation #CVPR #read-later #Selected Papers/Blogs #Encoder #2D (Image) #3D (Video) #Initial Impression Notes Issue Date: 2026-02-28 GPT Summary- VidEoMTは、専用の追跡モジュールなしで動画セグメンテーションを実現するエンコーダーのみのモデルである。軽量なクエリ伝搬機構を導入し、前フレームの情報を活用することで、フレーム間の連携を図る。時系列に依存しない学習済みクエリと融合により、利益を生み出しつつ追加の複雑さを回避し、最大160 FPSで競争力のある精度を達成した。 Comment
元ポスト:
他タスクでも色々使えそうなアーキテクチャに見える
[Paper Note] Interleaved Head Attention, Sai Surya Duvvuri+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Attention #LongContext #Architecture #One-Line Notes #Reference Collection #LongHorizon #Author Thread-Post Issue Date: 2026-02-28 GPT Summary- Interleaved Head Attention(IHA)を提案し、マルチヘッド・アテンションの線形スケーリングの制約を解消。IHAでは、各ヘッドにP個の疑似ヘッドを構築し、ヘッド間のクロス混合を可能にすることで、複数のアテンションパターンを生成。理論的には、合成的Polynomialタスクに対し、IHAはMHAよりも効率的で、実世界のベンチマークでも性能向上を示した。特に、GSM8KおよびMATH-500の問題で改善を達成。 Comment
元ポスト:
著者ポスト:
解説:
各headのqueryに対してlinear変換をかけてP個の疑似ヘッドを作成し、それらをinterleavingする形で整列させてK, Vを適用する、という感じらしい。多段階の推論や合成が必要な複雑なタスクにおいてheadの表現力が増し、必要なhead数が小さくなる反面、計算量が増える。疑似ヘッドはP個のトークンによって構成されるとみなせるので、FlashAttentionなどの従来の実装をそのまま適用できる。
[Paper Note] SLA2: Sparse-Linear Attention with Learnable Routing and QAT, Jintao Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Attention #DiffusionModel #VideoGeneration/Understandings #Routing #3D (Video) #One-Line Notes #SparseAttention #LinearAttention Issue Date: 2026-02-20 GPT Summary- SLA2は、スパース注意とリニア注意を動的に選択する学習可能なルータを導入し、パフォーマンスを向上させる。さらに、アテンションブランチを組み合わせるための比率や量子化を意識した設計を採用。実験により、動画生成モデルで97%のスパース性を達成し、18.6倍の速度向上を実現した。 Comment
元ポスト:
ポイント解説:
Sparse AttentionとLinear Attentionを動的に選択するルータを学習して効率を向上させる
[Paper Note] EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing, Yehonathan Litman+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #DiffusionModel #VideoGeneration/Understandings #Editing #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-02-19 GPT Summary- 高忠実度なビデオ編集には、新しい局所的ビデオ文脈モジュールを使用するEditCtrlフレームワークを提案。これにより、マスクされたトークンのみに集中し、計算コストを編集サイズに比例させる。全体の文脈の一貫性を保持しつつ、他の手法に比べて計算効率が10倍向上し、編集品質も改善。テキストプロンプトを利用した新機能を実現。 Comment
pj page: https://yehonathanlitman.github.io/edit_ctrl/
元ポスト:
著者ポスト:
video editing/inpaintingタスクにおいて、editに必要なlocal contextとeditとの一貫性を保つためのglobal contextを分離し、global contextに対するfull-attention計算を削減する(i.e., local contextに計算量を集中させる)ことで効率を向上、という話に見える。
[Paper Note] Image Generation with a Sphere Encoder, Kaiyu Yue+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Encoder #Encoder-Decoder #2D (Image) #KeyPoint Notes #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- Sphere Encoderは、1回のフォワードパスで画像を生成できる効率的な生成フレームワークです。球面潜在空間への均一な写像を行うエンコーダと、ランダムな潜在ベクトルを画像空間に変換するデコーダを学習し、画像再構成損失のみで訓練を行います。このアプローチにより、複数のデータセットにおいて最先端の拡散モデルに匹敵する性能を示しながら、推論コストを大幅に削減しています。 Comment
元ポスト:
画像を球面状(i.e., 3次元の)の潜在表現にエンコードするエンコーダと、エンコーダに摂動を加えた球面上の点からデコーダを通じて元画像を再構成するデコーダを学習することで、潜在表現から画像のピクセルを直接生成する枠組み。球面上の潜在表現から1回のforward pathで画像を構成するよっに学習するため高速に生成ができる。また、生成した画像をさらにエンコードしデコードすることで、追加のデノイジングstepを実施することができ、画像をより洗練させることができる。4ステップ程度でDiffusion Modelには及ばないものの(ImageNet 256*256でgFID 1.38--2.77)、gFID 4.02--4.76程度のスコア(GAN以上、ADM-Gと呼ばれるDiffusionモデルと同等程度)の画像を生成可能(Table3)という感じに見える。
loss functionはピクセル単位の再構成loss、ピクセルの一貫性に関するloss (i.e., 2つの摂動を加えた潜在表現vが類似した画像を生成するか)をL1_perception lossによって学習する(i.e., ピクセル同士の誤差をスムージングしながら直接測るlossと、既存の学習済み画像エンコーダの潜在表現上でのFeature MapのL1/2距離の組み合わせ)と、
潜在空間の一貫性に関するloss(i.e., 元の潜在表現と、潜在表現をデコード→エンコードした後得られる潜在表現のコサイン類似度)が用いられる式(7,8,9,10)。
[Paper Note] BitDance: Scaling Autoregressive Generative Models with Binary Tokens, Yuang Ai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #DiffusionModel #TextToImageGeneration #Decoding #read-later #2D (Image) #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- BitDanceは、バイナリ視覚トークンを予測する自己回帰型の画像生成モデルであり、高エントロピーのバイナリ潜在変数により最大2^{256}の状態を表現できます。バイナリ拡散ヘッドを採用し、標準の分類を超えたトークン生成を実現。次パッチ拡散技術により、複数トークンを高精度で並列予測し、推論速度を8.7倍向上させます。ImageNet 256x256では最高のFIDスコア1.24を達成し、1024x1024画像生成においては従来モデルと比較して30倍以上の速度向上を実現しています。コードとモデルは公開されています。 Comment
pj page: https://bitdance.csuhan.com/
元ポスト:
[Paper Note] LUCID: Attention with Preconditioned Representations, Sai Surya Duvvuri+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #Architecture Issue Date: 2026-02-17 GPT Summary- ソフトマックスを用いたドット積注意はトランスフォーマーの基盤だが、文脈長が長くなると性能が劣化し、勾配消失が学習を妨げる。そこでLUCID Attentionを提案し、アテンション確率に前処理を適用することで、重要なキーに正確に集中させる。LUCIDのアプローチはソフトマックス温度を低くする必要がなく、60億パラメータの言語モデルを用いた実験で、長文脈の検索タスクにおいて顕著な改善を示した。特に、BABILongで最大18%、RULERで最大14%の性能向上を達成した。 Comment
元ポスト:
[Paper Note] MonoLoss: A Training Objective for Interpretable Monosemantic Representations, Ali Nasiri-Sarvi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Explanation #RepresentationLearning #Encoder #SparseAutoencoder Issue Date: 2026-02-17 GPT Summary- Sparse autoencoders (SAEs)は、多義的な神経表現を単義的特徴に分解する。しかし、従来の学習目的はこの分解を促進せず、単義性指標も効率を低下させる。MonoScore指標を用いて、線形に増加する単一パスアルゴリズムを提案し、評価時に1200倍、トレーニング時に159倍の高速化を実現。これにより、モノセマンティシティ・ロス(MonoLoss)を導入し、一貫した活性化を促進。これにより、クラス純度が大幅に向上し、ImageNet-1Kの精度も改善。コードは公開中。 Comment
元ポスト:
[Paper Note] An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking, Lars Hertel+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #A/B Testing #SequentialRecommendation #One-Line Notes #Initial Impression Notes Issue Date: 2026-02-16 GPT Summary- Feed Sequential Recommender(Feed-SR)は、LinkedInフィード向けのトランスフォーマーを用いた逐次ランキングモデルで、DCNv2ベースのランカーを置換。LinkedInの運用制約を満たしつつ、メンバーのエンゲージメントを向上させ、滞在時間が+2.10%増加。オンラインA/Bテストでの性能を通じて、Feed-SRの効率性と効果についても論じる。 Comment
元ポスト:
linkedinのfeedにおけるsequential recommendationで利用されているモデルでdecoder onlyのpre-LN、RoPE、residual streamの更新がlearnableなパラメータでrescaleされて更新されるようなtransformerアーキテクチャが採用されている。細かいfeatureなどについては読めていない。A/Bテストによって効果が確認されている。
[Paper Note] Causal-JEPA: Learning World Models through Object-Level Latent Interventions, Heejeong Nam+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #RepresentationLearning #Self-SupervisedLearning #OpenWeight #Encoder #WorldModels #KeyPoint Notes #LatentRepresentation Issue Date: 2026-02-16 GPT Summary- C-JEPAは、オブジェクト中心の世界モデルで、画像パッチからの埋め込み予測を通じてオブジェクトの相互作用を捉えることを目的としている。オブジェクトレベルのマスキングを導入し、潜在的介入を誘発することで反事実的推論を強化し、ショートカット解法を防ぐ。実験結果では、視覚質問応答において約20%の性能向上を示し、エージェント制御タスクでは必要な潜在入力のわずか1%で同等の結果を達成した。さらに、因果的帰納的バイアスを誘発することも示している。 Comment
元ポスト:
pj page: https://hazel-heejeong-nam.github.io/cjepa/
(JEPAは私にとってあまり馴染みがなく、以下の私の解説はどこかに誤りがある可能性が高い)
video basedなシステムを前提、すなわちimageのsequenceが与えられる前提である。このとき、各タイムステップごとに選択されたobjectの状態をマスクし、マスクされたobjectのhistoryを予測し、予測された状態から将来の状態を予測する。objectは状態だけでなく、補足的な観測可能な情報を保持することができ(たとえばアクションと感覚に関するシグナルなど)状態遷移に利用される。また、マスク対象として選択されたオブジェクトの最初のステップの状態だけは、アンカーとして保持する。マスク処理はlatent levelはでのinteiventionとして解釈でき、これにより予測のためにobject間の相互作用を捉えることが誘発され、object centricな潜在表現が学習される。マスクされたオブジェクトの状態は、予測された一つ前のステップでの状態に対してlinearで変換しpositional embeddingを足し合わせることで求められ(式3)、これらの予測されたhistoryの状態がViTの入力となり(bidirectionalなattentionを通じて)将来の状態を予測する。lossは予測されたhistoryの状態と将来の状態が与えられたときに、freezeされたobjectのエンコーダから得られる潜在表現との距離が最小化されるように学習される(エンコーダ側はstop gradientする)。
解説:
[Paper Note] Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation, Alan Baade+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Embeddings #DiffusionModel #Architecture #2D (Image) #ImageSynthesis #Pixel-based Issue Date: 2026-02-13 GPT Summary- 潜在拡散モデルは高品質な画像生成を実現するものの、エンドツーエンドの利点を失うことが課題であった。本研究では、ラテント強制(Latent Forcing)を提案し、ラテントとピクセルを別々のノイズスケジュールで共同処理することで、効率的に高周波ピクセル特徴を生成する。条件信号の順序が重要であることを発見し、これを分析することで、トークナイザーのREPA蒸留と拡散モデルの違いや生成品質の関係を示す。ImageNetでの適用により、新たな最先端を達成した。 Comment
元ポスト:
[Paper Note] Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts, Yingfa Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #LongContext #PositionalEncoding #Architecture #read-later #Selected Papers/Blogs #reading #RecurrentModels Issue Date: 2026-02-12 GPT Summary- ハイブリッドトランスフォーマーアーキテクチャは、ソフトマックスアテンションとRNNを組み合わせたもので、長い文脈の処理においてトレードオフを示すが、高コストな事前トレーニングが課題。既存の転送法は大量のデータを必要とし、ハイブリッドモデルの性能低下を招く。本研究では、トランスフォーマーからRNNアテンションハイブリッドモデルへの蒸留手法HALOを提案し、新たな位置エンコーディングスキームHyPEを導入したHypeNetを開発。HALOを用いてQwen3シリーズをHypeNetに変換し、わずか2.3Bトークンで同等の性能を実現しつつ、長文脈性能と効率を向上させた。
[Paper Note] ViT-5: Vision Transformers for The Mid-2020s, Feng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Architecture #read-later #Selected Papers/Blogs #Backbone #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- ViT-5は、ビジョントランスフォーマーの要素を体系的に洗練し、新世代のバックボーンを形成する。このアーキテクチャは、正規化や位置エンコーディングなどの進化を含み、広範な実験で従来の最先端を上回る性能を示した。ImageNet-1k分類では84.2%のトップ-1精度を達成し、生成モデリングでも優れたFIDを記録。改善された表現学習と空間推論により、タスク間の移行が安定し、現代のファンデーションモデルに適したシンプルなアップグレードを提供する。 Comment
元ポスト:
ModernBERTと同じ動機で、ViTに現代的な様々なアーキテクチャ上の工夫を入れたものをシステマチックに調査し、最適な組み合わせを見つけ性能向上したという話に見える。
[Paper Note] Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models, Yuliang Liu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Quantization #Architecture #LatentReasoning Issue Date: 2026-02-10 GPT Summary- 次の概念予測(NCP)を提案し、生成型の事前学習パラダイムを構築。NCPは複数トークンの概念を予測し、生成モデルConceptLMが隠れ状態の量子化を通して概念語彙を形成。70Mから1.5Bパラメータの範囲で最大300Bのデータを用い、13のベンチマークで従来モデルを上回る性能を示す。また、8BパラメータのLlamaモデルにおける実験から、NCPがトークン予測を改善する可能性を示唆。NCPは強力な言語モデルを生む有望なアプローチである。 Comment
元ポスト:
先行研究:
- [Paper Note] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture, Mahmoud Assran+, CVPR'23, 2023.01
- [Paper Note] Large Concept Models: Language Modeling in a Sentence Representation Space, LCM team+, arXiv'24, 2024.12
- [Paper Note] Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space, Xingwei Qu+, arXiv'25, 2025.12
[Paper Note] How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability, Shawn Im+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Explanation #RepresentationLearning #Attention #One-Line Notes Issue Date: 2026-02-09 GPT Summary- セマンティック関連性を理解することは、言語モデルの一般化能力を高め、一貫性のあるテキスト生成に寄与します。本研究では、注意ベースの言語モデルにおいて自然言語データからの関連性の学習を、トレーニングダイナミクスの観点から分析します。勾配の主成分近似を用いて、重みの初期表現を開発し、セマンティック関連性の形成過程を説明。結果として、トランスフォーマーの重みは、ビグラムや文脈マッピングといった基底関数の合成として表現され、統計を反映した関連性の捉え方を明らかにします。実験では理論的な特性付けが学習重みに一致し、トランスフォーマーの学習された関連性の解釈を示します。 Comment
元ポスト:
学習中にtransformerがどのようにtoken間の関連性を学習しているのかを分析
[Paper Note] Inverse Depth Scaling From Most Layers Being Similar, Yizhou Liu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Scaling Laws #Depth Issue Date: 2026-02-06 GPT Summary- 深さと幅がLLMの性能に与える影響を探究し、深さが損失に反比例してスケールすることを発見。これは、類似層がアンサンブル平均を通じて誤差を減少させることに起因する可能性がある。効率を改善するには、深さの効果的な利用を促進するアーキテクチャの革新が必要であることを示唆。 Comment
元ポスト:
関連:
- [Paper Note] Do Language Models Use Their Depth Efficiently?, Róbert Csordás+, NeurIPS'25, 2025.05
- [Paper Note] 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities, Wang+, NeurIPS'25 Best Paper Awards
[Paper Note] HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing, Yizhao Gao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Attention #Architecture #KV Cache #Hybrid #SparseAttention #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- 新しいアーキテクチャ「ハイブリッド疎注意」(HySparse)を提案。全注意層と疎注意層を交互に配置し、疎層のトークン選択を全注意層から導出。これにより、トークンの重要性予測が簡素化され、KVキャッシュの再利用が可能に。評価では、7B密集モデルと80B MoEモデルの両方で全注意およびハイブリッドSWAのベースラインを超え、特に49層の80B MoEモデルで顕著な性能向上とKVキャッシュの10倍削減を実現。 Comment
元ポスト:
ポイント解説:
Full attentionとsparse attentionを組み合わせたアーキテクチャの提案で、Full attentionと同等以上の性能を効率的に達成し、sparse attentionではfull attentionのKV Cacheを再利用するように設計されていることから、KV Cacheのスペースを大幅に削減できて嬉しい、という話に見える。
[Paper Note] ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation, Junmin Gong+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #SpeechProcessing #DiffusionModel #Reasoning #SmallModel #PEFT(Adaptor/LoRA) #OpenWeight #Music Issue Date: 2026-02-05 GPT Summary- ACE-Step v1.5は、高効率のオープンソース音楽基盤モデルで、商業音楽モデルを超える品質を持ちながら、非常に高速で動作します。ユーザーは少数の楽曲から個人のスタイルをトレーニング可能で、ハイブリッドアーキテクチャを用いてシンプルなクエリを包括的な楽曲に変換します。内因性強化学習により、スタイル制御と多様な編集機能を強化し、50以上の言語に対応。コンテンツクリエイターの創造的なワークフローに統合されるツールとして利用可能です。 Comment
元ポスト:
データは全て許可済みのもの、かつ合成データとポストされており商用利用も可らしいが、果たして。
[Paper Note] FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space, FSVideo Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #DiffusionModel #3D (Video) #ImageToVideoGeneration Issue Date: 2026-02-05 GPT Summary- FSVideoは、高速なトランスフォーマーベースの画像から動画(I2V)への拡散フレームワークで、圧縮された潜在空間を持つ動画オートエンコーダー、強化された層間の情報フローを持つ拡散トランスフォーマー、少数ステップのアップサンプラーを利用して多解像度生成を実現。最終モデルは14BのDITベースとアップサンプラーを含み、競争力のある性能と優れた速度を誇る。モデル設計とトレーニング戦略も詳述。 Comment
pj page: https://kingofprank.github.io/fsvideo/
元ポスト:
[Paper Note] SimpleGPT: Improving GPT via A Simple Normalization Strategy, Marco Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Architecture #Normalization #One-Line Notes Issue Date: 2026-02-03 GPT Summary- 本研究では、Transformerの最適化を第二次幾何学の視点から再評価し、活性化スケールの安定化を目的としたSimpleNormという正規化戦略を提案。これにより、ヘッセ行列のスペクトルノルムが低下し、より大きな学習率が許容されることを理論的に示します。1Bから8BのパラメータスケールのGPTモデルでの実験により、SimpleGPTは従来の手法よりも3倍から10倍の高い学習率を持ち、安定性と性能で優れた結果を実現。特に、7Bモデルでは、LLaMA2よりも低い訓練損失を記録しました。ソースコードは公開予定です。 Comment
元ポスト:
LinearLayerをSimpleNormと呼ばれるオペレーターに置換するだけなシンプルな手法で性能向上しているようである。SimpleNormオペレーターは式(3)であり、Linearによる変換の"直後"に任意のNormalizationを実施するようなオペレーターとして定義される。SimpleGPTではPreLNなどは実施しない。
[Paper Note] JTok: On Token Embedding as another Axis of Scaling Law via Joint Token Self-modulation, Yebin Yang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #MoE(Mixture-of-Experts) Issue Date: 2026-02-03 GPT Summary- トークンインデックスパラメータを用いて、LLMの計算コストとモデル容量を切り離す新しいスケーリング手法を提案。Joint-Token(JTok)とMixture of Joint-Token(JTok-M)を導入し、Transformerレイヤーを強化。実験により、検証損失が低下し、MMLUやARCでの性能向上を実証。JTok-Mは、従来のMoEアーキテクチャに比べ、35%少ない計算で同等のモデル品質を実現。 Comment
元ポスト:
[Paper Note] MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers, Ajay Jaiswal+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture #memory Issue Date: 2026-02-03 GPT Summary- 大規模言語モデルのFFNの解釈可能性を再検討し、自己注意から切り離したMemoryLLMを提案。FFNをトークン単位のニューラルリトリーバルメモリとして機能させ、効率的な推論を実現。Flex-MemoryLLMも導入し、性能ギャップを埋める役割を果たす。 Comment
またしてもembeddingの活用
元ポスト:
[Paper Note] TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors, Ido Andrew Atad+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #Attention #Interpretability Issue Date: 2026-02-01 GPT Summary- トランスフォーマーの注意行列を包括的に理解するため、TensorLensという新たな定式化を提案。これは、トランスフォーマー全体を単一の線形演算子として捉え、高次の注意相互作用テンソルを通じて各コンポーネントを共同でエンコード。これにより、モデルの計算の整合性を保ちながら、より豊かな表現を実現。実験によって、TensorLensが解釈性向上に寄与することが確認された。 Comment
元ポスト:
[Paper Note] L$^3$: Large Lookup Layers, Albert Tseng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Architecture Issue Date: 2026-01-30 GPT Summary- L$^3$レイヤーを使用した新しいスパース性の手法を提案。これは静的なトークンベースのルーティングでトークンごとの埋め込みを集約し、メモリと計算の効率を向上させる。高速トレーニングが可能で、情報理論に基づく埋め込み割り当てアルゴリズムを採用。実験により、L$^3$が他のモデルを大きく上回る性能を示した。 Comment
[Paper Note] GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization, Chuanyang Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Normalization #read-later Issue Date: 2026-01-30 GPT Summary- 正規化層の配置に関する問題をマニフォールド最適化の視点から再考し、フィードフォワードネットワークと注意層の出力を更新方向として解釈。新手法GeoNormを提案し、標準の正規化を測地線更新に置き換える。包括的な実験で既存手法を一貫して上回る性能を確認。GeoNormは標準Transformerへ簡易に統合可能で、追加コストがわずかでも性能向上を達成。 Comment
元ポスト:
[Paper Note] Scaling Embeddings Outperforms Scaling Experts in Language Models, Hong Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #AIAgents #LongContext #Architecture #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-01-30 GPT Summary- 本研究では、Mixture-of-Experts(MoE)アーキテクチャに代わる埋め込みスケーリングを検討し、その効果を体系的に分析。埋め込みスケーリングは専門家スケーリングよりも優れたパレートフロンティアを達成し、推論速度が向上することを示す。68.5BパラメータのLongCat-Flash-Liteモデルを導入し、約3Bのパラメータでトレーニングを行った結果、既存のMoEベースラインを超える性能を発揮。特にエージェント的およびコーディングの分野で競争力が示される。 Comment
HF: https://huggingface.co/meituan-longcat/LongCat-Flash-Lite
元ポスト:
N-Gram Embeddingを用いることでMoEアーキテクチャの同等程度のモデルと比較してより高い性能を獲得しているように見える。NGramの各NごとにルックアップテーブルとProtectionのための重みを学習して最終的にAveragingをすることでContext Vectorを生成している、ようなアーキテクチャに見える。non-thinkingモデル
先行研究:
- [Paper Note] Scaling Embedding Layers in Language Models, Da Yu+, NeurIPS'25, 2025.02
[Paper Note] Post-LayerNorm Is Back: Stable, ExpressivE, and Deep, Chen Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Architecture #Normalization #read-later #Stability #ResidualStream Issue Date: 2026-01-29 GPT Summary- LLMのスケーリングには限界があり、モデルの大きさやコンテキスト長の延長が表現力を向上させない一方、深さのスケーリングは有望だが訓練の安定性に課題がある。本研究では、Post-LayerNormの問題を再検討し、残差経路をハイウェイスタイルの接続に置き換えた「Keel」トランスフォーマーを提案。これにより勾配消失を防ぎ、1000層以上でも安定した訓練を可能にし、Pre-LNよりも性能を向上させる。Keelは、今後の深層アーキテクチャ構築の新たな基盤を提供する。 Comment
元ポスト:
PostLNと言えばOlmo 2:
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
1000 layerを超えるネットワークを安定して学習、、だと、、
関連:
- [Paper Note] 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities, Wang+, NeurIPS'25 Best Paper Awards
[Paper Note] RayRoPE: Projective Ray Positional Encoding for Multi-view Attention, Yu Wu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Multi #ComputerVision #Attention #PositionalEncoding #2D (Image) #One-Line Notes #DepthEstimation #NovelViewSynthesis Issue Date: 2026-01-23 GPT Summary- 我々は、マルチビュー変換器における位置エンコーディングの新手法RayRoPEを提案し、パッチをユニークにエンコードしてSE(3)不変な注意を実現します。既存のエンコーディング方式の限界を踏まえ、光線に基づいてパッチの位置を表現し、ジオメトリに配慮した予測点を使用します。RayRoPEは多周波数の類似性を計算するためのクエリフレームの投影座標を確立し、不正確な3D点の不確実性に対処するための位置エンコーディング手法を提供します。視点合成とステレオ深度推定のタスクにおいて、代替方式に対して一貫した性能向上を示し、RGB-D入力の効果的な利用も確認しました。 Comment
pj page: https://rayrope.github.io/
元ポスト:
複数視点(multiview)での画像を入力とするtransformerの位置エンコーディングを改善した研究で、multiviewのattentionは下記のような性質を持つのが理想としており
(a) 座標系の取り方に対してattentionの出力が不変であり
(b) 同じ点であれば、どのviewからのattention出力であっても同一であるべき
(c) 幾何学的に近い点の方が類似度が高くあるべき
(d) 様々な粒度で特徴を捉えられるべき(高周波成分、低周波成分)
これらを獲得できるようにray(方向に関する情報)を取り入れるような新たなRoPEアーキテクチャを考案した、というような感じらしい(ゆるふわ理解)。
pj pageに他手法と比較して生成される別方向の画像などが高品質になっている例が掲載されている。
[Paper Note] STEM: Scaling Transformers with Embedding Modules, Ranajoy Sadhukhan+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #EfficiencyImprovement #Pretraining #NLP #LongContext #Architecture #read-later #Selected Papers/Blogs #Inference #Stability #Latency #Interpretability #Author Thread-Post Issue Date: 2026-01-17 GPT Summary- STEMは、Transformersに埋め込みモジュールを用いてスパーシティを効果的に処理し、安定したトレーニングを実現します。FNNのアッププロジェクションを埋め込みのルックアップに置き換え、トークンごとの計算を削減しつつ、性能を向上させます。知識の保存や解釈性を向上させ、長いコンテキストでも効果を発揮。350Mおよび1Bモデルで約3~4%の精度向上を達成し、知識や推論のベンチマークで優れた結果を示しました。 Comment
元ポスト:
著者ポスト:
[Paper Note] V-DPM: 4D Video Reconstruction with Dynamic Point Maps, Edgar Sucar+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #3D Reconstruction #3D (Scene) #4D Reconstruction #3D (Video) #SpatialUnderstanding Issue Date: 2026-01-16 GPT Summary- DPMをビデオ入力に適用するV-DPMを提案し、動的な3D再構築を実現。3D形状とカメラパラメータを表現し、VGGTを基にしたアプローチで最新の性能を達成。動的な深さと3D動作を完全に回復可能。 Comment
pj page: https://www.robots.ox.ac.uk/~vgg/research/vdpm/
元ポスト:
VGGT:
- [Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
[Paper Note] MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head, Kewei Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #Attention #Architecture #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- トランスフォーマーの自己注意の複雑さが大規模アプリケーションでの利用を制限する中、効率的な線形注意の適用は性能低下を招くことがあります。本研究では、モデルの表現の多様性を失わせる「グローバルコンテキスト崩壊」の問題を特定し、トークン次元に沿った注意計算による「マルチヘッド線形注意(MHLA)」を提案します。MHLAは線形の複雑さを保ちながら、ソフトマックス注意の表現力を回復することに成功し、様々なドメインでImageNet分類で3.6%、自然言語処理で6.3%、画像生成で12.6%、動画生成で41%の性能改善を達成しました。 Comment
pj page: https://dagroup-pku.github.io/MHLA/
元ポスト:
(読了前の第一印象)スループットを大幅に向上させながらも、大幅な性能改善をしている新たなlikear attention手法であり、image, video, textの3つのモダリティに対して性能向上しているように見えるため、結果のインパクトが大きく重要論文に見える。
[Paper Note] UniVideo: Unified Understanding, Generation, and Editing for Videos, Cong Wei+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #DiffusionModel #VariationalAutoEncoder #OpenWeight #ICLR #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #Editing Issue Date: 2026-01-09 GPT Summary- UniVideoは、動画ドメインにおけるマルチモーダルコンテンツの生成と編集を目的とした統一モデルで、MLLMとMMDiTを組み合わせたデュアルストリーム設計を採用。これにより、複雑な指示の解釈と視覚的一貫性を維持しつつ、動画生成や編集タスクを統一的に訓練。実験結果では、テキスト/画像から動画への生成や文脈内編集において最先端の性能を示し、編集とスタイル転送の統合や未見の指示への対応も可能。視覚プロンプトに基づく生成もサポートし、モデルとコードは公開されている。 Comment
pj page: https://congwei1230.github.io/UniVideo/
元ポスト:
[Paper Note] Group Representational Position Encoding, Yifan Zhang+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#NLP #PositionalEncoding #Architecture #ICLR Issue Date: 2025-12-10 GPT Summary- GRAPE(Group RepresentAtional Position Encoding)は、群作用に基づく位置エンコーディングの統一フレームワークを提案します。Multiplicative GRAPEは、位置を乗法的に作用させ、相対的かつノルムを保存する写像を生成します。一方、Additive GRAPEは、加法的ロジットを用いて特定のケースを再現し、相対法則とストリーミングキャッシュ可能性を保持します。GRAPEは、長文コンテキストモデルにおける位置幾何学の設計空間を提供し、RoPEやALiBiを特別なケースとして包含します。 Comment
pj page: https://model-architectures.github.io/GRAPE/
元ポスト:
openreview: https://openreview.net/forum?id=itoNJ3gJl2
[Paper Note] IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction, Hao Li+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Dataset #FoundationModel #ICLR #3D Reconstruction #3D (Scene) #UMM #SpatialUnderstanding Issue Date: 2025-10-28 GPT Summary- 人間の3Dシーン理解を模倣するため、空間再構築とインスタンス理解を統合したInstanceGrounded Geometry Transformer(IGGT)を提案。IGGTは2D視覚入力を用いて幾何学的構造とインスタンスクラスタリングを統一的に表現し、3Dシーンの一貫性を向上させる。新たに構築したInsScene-15Kデータセットを用いて、3D一貫性のあるインスタンスレベルのマスク注釈を提供。 Comment
pj page: https://lifuguan.github.io/IGGT_official/
元ポスト:
ポイント解説:
openreview: https://openreview.net/forum?id=swiL18PmUV
[Paper Note] Log-Linear Attention, Han Guo+, ICLR'26
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Attention #Architecture #ICLR #Reference Collection Issue Date: 2025-06-10 GPT Summary- 対数線形注意を提案し、線形注意の効率性とソフトマックス注意の表現力を両立。固定サイズの隠れ状態を対数的に成長する隠れ状態に置き換え、計算コストを対数線形に抑える。Mamba-2とGated DeltaNetの対数線形バリアントが線形時間のバリアントと比較して優れた性能を示すことを確認。 Comment
元ポスト:
解説ポスト:
openreview: https://openreview.net/forum?id=mOJgZWkXKW
[Paper Note] Next-Latent Prediction Transformers Learn Compact World Models, Jayden Teoh+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Self-SupervisedLearning #Architecture #Selected Papers/Blogs #WorldModels #KeyPoint Notes #Author Thread-Post #LatentRepresentation Issue Date: 2026-06-18 GPT Summary- Next-Lat Prediction(NextLat)は、トランスフォーマーの次トークン予測を潜在空間での自己教師付き予測に拡張し、予測可能な潜在状態を学習。これにより、整合した信念状態を形成し、内部世界モデルをコンパクトに構築。エビデンスとして、推論や計画において顕著な精度向上を示し、言語モデリングの推論速度を最大3.3倍に高速化。NextLatはトランスフォーマーに再帰的な帰納バイアスを効果的に注入するシンプルで強力な手法を提供。 Comment
元ポスト:
解説:
以下上記解説ポストの要約
transformerのアーキテクチャではRNNのような状態を逐次更新するようなアーキテクチャではないため、現在の隠れ状態とnext tokenから、次の隠れ状態を予測できるような損失関数を追加し(式3)、transformerに状態遷移を学習させる(自己教師あり学習によって実現できる)。また、next tokenの予測性能を落とさないように、真の隠れ状態が与えられた時の出力分布と離れないようなKL Divergenceに基づく損失をLossとして加える(式4)。これにより、
- transformerが過去のhistoryをコンパクトなbelief statesに圧縮することを促し
- latent spaceを予測することでone-hot tokenからの学習よりもdenseなシグナルに基づくため、データ効率を向上させ、
- look-aheadをすることによって投機的デコーディングに資する
- 内部表現が一貫した世界モデルとなることを促す
といった狙いがある。実験の結果、planning能力が向上し(belief statesによって先を見越して計画することが促されるため)next token predictionのperplexityを低下させることなく20 token先まで予測した場合にMulti Token Predictionよりもcross-entropy lossで性能を上回る、といった恩恵があるようである。
[Paper Note] MesaNet: Sequence Modeling by Locally Optimal Test-Time Training, Johannes von Oswald+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ICLR #RecurrentModels #LinearAttention #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- シーケンスモデリングにおいて、最近の研究が提案するRNNモデルに、Mesa層を導入し数値的に安定かつ並列化可能な手法を検証。文脈内損失に基づく最適化で、従来のRNNよりも低いperplexityと下流ベンチマークでの改善を達成。特に長い文脈理解に効果的で、推論時の計算コストが増加するが、これが最近の計算性能向上のトレンドに寄与。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=xa3OnTb6c3
[Paper Note] Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression, Jung Yi+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #LongContext #VideoGeneration/Understandings #One-Line Notes Issue Date: 2026-04-04 GPT Summary- 自己回帰型ビデオ拡散はリアルタイムのフレームストリーミングを可能にする一方で、従来の解法は時間的な反復や動きの減速に悩まされる。本研究では、ファインチューニングなしのDeep Forcingメカニズムを導入し、長期的なグローバル文脈を安定化させるDeep Sinkと、重要度を考慮したKVキャッシュ剪定を実行するParticipative Compressionを組み合わせることで、画質や一貫性を向上させつつダイナミックな生成を実現した。これにより、トレーニング不要で長時間ビデオをストリーミングする能力が向上し、既存のアプローチと同等以上の性能を示す結果を得た。 Comment
Self-ForcingとのKV Cache Managementの方法が非常に分かりやすく図解されており勉強になる。
Self-Forcing:
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
[Paper Note] GameFactory: Creating New Games with Generative Interactive Videos, Jiwen Yu+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #Controllable #DiffusionModel #Architecture #PostTraining #VideoGeneration/Understandings #ICCV #Game #One-Line Notes #Reading Reflections Issue Date: 2026-04-02 GPT Summary- GameFactoryは、アクション制御とシーン一般化を両立させたゲームビデオ生成のフレームワーク。GF-Minecraftというデータセットを用いてキーボードとマウス入力を正確に制御し、自己回帰生成を可能にする。さらに、オープンドメイン生成事前知識を活用し、固定スタイルを超えた多様なゲームの創出を支援。ドメインアダプターによる学習戦略によって、アクション制御が特定ゲームスタイルに縛られず、シーン一般化が実現。実験により、GameFactoryが効果的にオープンドメインのゲームビデオを生成できることが確認された。 Comment
github: https://github.com/KlingAIResearch/GameFactory
小規模なマイクラデータでaction control moduleと呼ばれるモジュールを学習することで、動画生成モデルに対して、マウス、キーボード入力によるコントロール能力を転移し、ゲーム映像を生成できる、という話に見える。
4.2節に書かれているように、transformerのブロックにaction control moduleと呼ばれる、キーボードとマウスの入力をwindowでグルーピングしてエンコードするようなブロックを挿入し、エンコードされたvideo側の潜在表現に対して条件付けを行い生成を可能にしているようである(Figure 3, 4)。学習する際はFigure 6に示されているように、まずはopen domainのデータで事前学習、その後LoRAでgame video dataのドメイン情報を入れ、他モジュールはfreezeした上で、action control moduleのみを学習する。
transformerアーキテクチャにドメイン依存のブロックを後でplugし性能向上させるアプローチはおもしろいと感じる。
[Paper Note] Epona: Autoregressive Diffusion World Model for Autonomous Driving, Kaiwen Zhang+, ICCV'25, 2025.06
Paper/Blog Link My Issue
#ComputerVision #NLP #DiffusionModel #LongContext #OpenWeight #ICCV #WorldModels #3D (Video) #AutonomousDriving Issue Date: 2026-02-08 GPT Summary- Eponaという自回帰型拡散世界モデルを提案し、長期予測と軌道計画の統合を実現。デカップル型因子分解により局所的な時空間分布をモデリングし、エンドツーエンドで動作計画と視覚モデリングを統合。実験により7.4%のFVD改善を達成し、数分間の長期予測が可能。学習したモデルはリアルタイム動作プランナーとしても優れた性能を示す。 Comment
元ポスト:
[Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LongContext #Architecture #ICLR #Selected Papers/Blogs #LinearAttention Issue Date: 2026-02-04 GPT Summary- 線形トランスフォーマーの限界を克服するため、ゲーティングとデルタ更新ルールの2つのメカニズムを組み合わせた「Gated DeltaNet」を提案。これにより、迅速なメモリ消去とターゲット更新を実現し、言語モデリングや長文理解などのタスクで既存モデルを上回る性能を達成。ハイブリッドアーキテクチャを用いることでトレーニング効率も向上。 Comment
openreview: https://openreview.net/forum?id=r8H7xhYPwz¬eId=U0uk5A0VlT
linear attention:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
Mamba2(linear attention with decay):
- [Paper Note] Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality, Tri Dao+, ICML'24
Gated DeltaNet 図解:
[Paper Note] Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models, Yonggan Fu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SmallModel #OpenWeight #Architecture #read-later #Selected Papers/Blogs #EvolutionaryAlgorithm #Latency #Operator Issue Date: 2026-01-23 GPT Summary- SLMの効率的な展開はレイテンシ制約のあるアプリで重要。本研究は、SLMのレイテンシ決定要因を特定し、深さと幅の比率、オペレータ選択が鍵であることを示す。深く細いモデルが精度向上につながるが、トレードオフフロンティアからは外れることがある。新しい効率的アテンションの代替手段を評価し、最適なオペレータを用いた進化的検索フレームワークを開発。さらに重み正規化技術を用い、SLMの性能を向上。新ハイブリッドSLM「Nemotron-Flash」は、精度を平均+5.5%向上させ、レイテンシを大幅に低下、スループットを著しく改善。 Comment
解説:
[Paper Note] RePo: Language Models with Context Re-Positioning, Huayang Li+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #PositionalEncoding #Architecture #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-19 GPT Summary- インコンテキスト学習の問題に対し、認知負荷を軽減する新メカニズム「RePo」を提案。トークンの位置を文脈依存に配置することで、深い推論を促進。OLMo-2 1Bでの実験により、RePoは長い文脈や構造化データにおいてパフォーマンスを向上させることを確認。詳細分析から、重要情報への注意配分が強化されていることが示された。 Comment
pj page: https://pub.sakana.ai/repo/
元ポスト:
contextに応じてlearnableなパラメータでpositionの情報を動的に調整するというアイデアが非常に興味深く、RoPE(回転行列を用いた現在の主流)やNoPE(PEを排除する手法だが理論上は2層以上積み上げると相対/絶対注意の双方を実現可能で自由度が非常に高い)と比較しても性能が向上しており、PEの扱いはインパ駆動大きいため重要論文に見える。
ポイント解説:
ポイント解説:
[Paper Note] Efficient Context Scaling with LongCat ZigZag Attention, Chen Zhang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #Architecture #SparseAttention Issue Date: 2026-01-15 GPT Summary- LoZAは、フルアテンションモデルをスパースバージョンに変換するためのスパースアテンションスキームであり、長いコンテキストでの計算効率を向上させる。これにより、リトリーバル拡張生成やツール統合推論において顕著な速度向上が実現。LongCat-Flashの中間トレーニングに適用することで、1百万トークンまで迅速に処理可能な基盤モデルを提供し、効率的な長期推論が可能となる。 Comment
HF: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking-ZigZag
元ポスト:
[Paper Note] Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings, Yoav Gelberg+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #PositionalEncoding #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-01-12 GPT Summary- 本研究では、言語モデル(LM)の位置埋め込みを削除することで、事前学習のシーケンス長を超えたコンテキスト拡張のボトルネックを解消する手法DroPEを提案。位置埋め込みの過度な依存が一般化を妨げることを示し、短い再キャリブレーション後に安全に削除できることを実証。DroPEは長いコンテキストのファインチューニングなしでゼロショット拡張を実現し、従来の手法を上回る性能を示した。 Comment
興味深い
元ポスト:
(読了前の第一印象)
- [Paper Note] The Impact of Positional Encoding on Length Generalization in Transformers, Amirhossein Kazemnejad+, NeurIPS'23
において、NoPEは理論上絶対位置エンコーディングと相対位置エンコーディングの両方を実現可能であり、実際に学習をすると相対位置エンコーディングと似たような分布の位置エンコーディングが学習され、long contextの性能が改善することが報告されている。
まだ論文は読めていないのだが、NoPEは自由度が高いので、学習の初期は何らかの位置エンコーディング手法を補助輪的に使いある程度学習を進め、その後dropしてより自由度の高い状態でfinegrainedなrepresentationを学習するというのは確かにうまくいきそうだな、という感想をもった。
[Paper Note] Deep sequence models tend to memorize geometrically; it is unclear why, Shahriar Noroozizadeh+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #MachineLearning #Memorization #FactualKnowledge #Geometric Issue Date: 2026-01-05 GPT Summary- 深層系列モデルは、エンティティ間の新しいグローバルな関係を幾何学的記憶として保存することを提案。これにより、難しい推論タスクが簡単なナビゲーションタスクに変換されることを示す。ブルートフォース検索よりも複雑な幾何学が学習されることを主張し、Node2Vecとの関連を分析して、自然に生じるスペクトルバイアスからこの幾何学が生まれることを示す。Transformerメモリの幾何学的強化の可能性を指摘し、知識獲得や忘却に関する直感を再考することを促す。 Comment
元ポスト:
[Paper Note] Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention, Haiquan Qiu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #read-later #Selected Papers/Blogs #Stability Issue Date: 2026-01-03 GPT Summary- 低精度フォーマットのトランスフォーマーモデルのトレーニングにおける不安定性の原因を分析し、フラッシュアテンションが損失の爆発を引き起こすメカニズムを明らかにした。具体的には、低ランク表現の出現と丸め誤差の累積がエラーの悪循環を生むことを示した。これを受けて、丸め誤差を軽減する修正を加えることでトレーニングの安定性を向上させ、実用的な解決策を提供した。 Comment
元ポスト:
[Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #Architecture #ICLR #Selected Papers/Blogs #One-Line Notes #ResidualStream Issue Date: 2026-01-02 GPT Summary- ハイパーコネクションは、残差接続の代替手法であり、勾配消失や表現崩壊の問題に対処します。異なる深さの特徴間の接続を調整し、層を動的に再配置することが可能です。実験により、ハイパーコネクションが残差接続に対して性能向上を示し、視覚タスクでも改善が確認されました。この手法は幅広いAI問題に適用可能と期待されています。 Comment
openreview: https://openreview.net/forum?id=9FqARW7dwB
従来は1本しかなかった残差ストリームを、並列にn本保持し、learnableなスカラー(connection weight)によってレイヤーの入力時に混合させ、合流させる際もlayerの計算結果を残差ストリームに混合させる。
[Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#MachineLearning #NLP #Architecture #read-later #Selected Papers/Blogs #Stability #KeyPoint Notes #Reference Collection #ResidualStream Issue Date: 2026-01-02 GPT Summary- Manifold-Constrained Hyper-Connections(mHC)を提案し、残差接続の多様化による訓練の不安定性やメモリアクセスのオーバーヘッドに対処。mHCは残差接続空間を特定の多様体に射影し、恒等写像特性を回復しつつ効率を確保。実証実験により、大規模訓練での性能向上とスケーラビリティを示し、トポロジーアーキテクチャ設計の理解を深めることを期待。 Comment
元ポスト:
所見:
先行研究:
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] Deep Residual Learning for Image Recognition, Kaiming He+, CVPR'16, 2015.12
所見:
ポイント解説:
解説:
従来のHCがResidual Streamに対してH_resを乗じて幾何的変換を実施する際に、H_resに制約がないため、Layerを重ねるごとにResidual Streamの大きさが指数的に発散、あるいは収縮していき学習が不安的になる課題を、二重確率行列(行と列の成分の合計が1.0となるような正規化をする)を用いた変換を用いることで、Residual Streamのノルムが変化しないようにし安定化させた、といった感じの話に見える。
[Paper Note] Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #PostTraining #Hybrid Issue Date: 2025-12-28 GPT Summary- Nemotron 3 Nano 30B-A3Bは、Mixture-of-ExpertsハイブリッドMamba-Transformer言語モデルであり、25兆のテキストトークンで事前学習され、監視付きファインチューニングと強化学習を経て精度を向上。前世代のNemotron 2 Nanoよりも高精度で、フォワードパスごとに半分未満のパラメータを活性化し、同サイズのオープンモデルと比較して最大3.3倍の推論スループットを達成。エージェント的、推論、チャット能力が向上し、最大1Mトークンのコンテキスト長をサポート。事前学習済みモデルはHugging Faceで公開。 Comment
元ポスト:
[Paper Note] Stronger Normalization-Free Transformers, Mingzhi Chen+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#MachineLearning #Architecture Issue Date: 2025-12-22 GPT Summary- 本研究では、Dynamic Tanh(DyT)を超える新たな正規化関数として$\mathrm{Derf}(x) = \mathrm{erf}(αx + s)$を提案。Derfは、画像認識、音声表現、DNA配列モデリングなどの分野でLayerNorm、RMSNorm、DyTを上回る性能を示し、その優れた一般化能力がパフォーマンス向上の要因であることを明らかにした。Derfはシンプルで強力なため、正規化なしのTransformerアーキテクチャにおける実用的な選択肢となる。 Comment
元ポスト:
先行研究:
- [Paper Note] Transformers without Normalization, Jiachen Zhu+, CVPR'25
[Paper Note] Next-Embedding Prediction Makes Strong Vision Learners, Sihan Xu+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Pretraining #MultiModal #read-later #Selected Papers/Blogs #2D (Image) #Backbone #UMM #Omni #KeyPoint Notes Issue Date: 2025-12-20 GPT Summary- 生成的事前学習の原則を視覚学習に応用し、モデルが過去のパッチ埋め込みから未来の埋め込みを予測する「次埋め込み予測自己回帰(NEPA)」を提案。シンプルなTransformerを用いてImageNet-1kで高精度を達成し、タスク特有の設計を必要とせず、スケーラビリティを保持。NEPAは視覚的自己教師あり学習の新たなアプローチを提供する。 Comment
pj page:
https://sihanxu.me/nepa/
HF:
https://huggingface.co/collections/SixAILab/nepa
元ポスト:
Autoregressiveにnext embedding prediction(≠reconstruction)をする。エンコーダ自身のembeddingとautoregressive headが生成したembeddingを比較することでlossが計算されるが、双方に勾配を流すとほぼ全てのパッチが同じembeddingを共有するという解に到達し何も学習されないので、エンコーダのエンコード結果(=target)のgradientをstopする。これにより、targetとしての勾配は受け取らないが(predictionに近づけようとする勾配)、文脈に応じたベクトルを作り、next embeddingを予測する入力としての勾配は受け取るので、エンコーダは文脈に応じた学習を続けることができる。
コミュニティからのフィードバックを受けて執筆されたブログ:
https://sihanxu.me/nepa/blog
元ポスト:
NEPAを提案した背景に関して直感的な解説を実施している。興味深い。具体的には、omnimodalityモデルの困難さはインターフェースの問題であり、latent spaceがomnimodalityの共通のインタフェースになりうり、モダリティごとの予測対象とlossを個別に設計せずに済む方法の一つがAutoregressiveな予測であり、そういったインタフェースがスケーリングのために必要という意見と、omnimodalityにおいて過去のliteratureで扱われているdiscreteなtokenとcontinuous symbolsは得意なモダリティが異なり予測対象や前処理のメカニズムも異なるため同時に扱うことが難しい旨などが記述されている。
[Paper Note] Diffusion Transformers with Representation Autoencoders, Boyang Zheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #TextToImageGeneration #Selected Papers/Blogs #2D (Image) #reading #One-Line Notes #ImageSynthesis #AutoEncoder Issue Date: 2025-12-17 GPT Summary- 本研究では、従来のVAEエンコーダを事前学習された表現エンコーダに置き換えた表現オートエンコーダ(RAE)を提案し、生成モデルの品質向上を目指す。RAEは高品質な再構成と意味的に豊かな潜在空間を提供し、拡散トランスフォーマーの効果的な機能を可能にする。実験により、ImageNetで優れた画像生成結果を達成し、RAEが拡散トランスフォーマーの新しいデフォルトとなるべきことを示した。 Comment
openreview: https://openreview.net/forum?id=0u1LigJaab
pj page: https://rae-dit.github.io
encoderをSigLIPなどの強力な(frozenした)vision encoderを用いた上で、デコーダを学習する手法。VAEではCNN等で潜在表現を低次元に圧縮するが、表現力に乏しく結果的に意味的な表現を捉える能力に乏しかったが、より強力な事前学習されたエンコーダと高次元の潜在表現を扱うことでDiffusion Modelで扱う潜在表現を進化させる。
[Paper Note] X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale, Pei Yang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #Dataset #SyntheticData #DiffusionModel #Robotics #WorldModels #VisionLanguageActionModel #3D (Video) #EmbodiedAI #One-Line Notes #Third-Person View Issue Date: 2025-12-12 GPT Summary- X-Humanoidは、動画から動画への生成的な編集アプローチを用いて、人間からヒューマノイドへの翻訳を実現するモデルです。Unreal Engineを活用し、17時間以上のペア合成動画を生成するデータ作成パイプラインを設計し、60時間のEgo-Exo4D動画を用いて360万以上の「ロボティクス化」されたヒューマノイド動画フレームを生成しました。定量的分析とユーザー調査により、69%のユーザーが動きの一貫性で最も優れていると評価し、62.1%が具現化の正確さで最も優れていると評価しました。 Comment
pj page: https://showlab.github.io/X-Humanoid/
元ポスト:
既存研究は主観視点の動画における人の腕をロボットアームにルールベースで置き換えるなどの方法で動画をオーバレイすることでdata scarcityの問題に対処してきており、これは有望なアプローチだが、第三者視点の動画はしばしばより複雑(全身が写り、背景が動的に変化し遮蔽に隠れたりもする)で課題がある。このため、第三者視点での動画を人間からヒューマノイドに置換するモデルを学習[^1]し(強力なvideo editingモデルでもこの点はまだ苦戦するタスクとのこと)、私生活における人間の動画をヒューマノイドに置き換えてデータを合成することでロボットのポリシーや世界モデルの学習データ不足を補います、という話に見える。
[^1]: この部分の学習データはUnreal Engineを用いて17+時間に及ぶ人間-ヒューマノイドペアの動画を合成
(以下Chatgptとの問答により得た情報なのでハルシネーションの恐れがあります)
主観視点での人間の腕をロボットアームに置き換えて学習データを合成するというのは気持ちが分かりやすかったのだが(=人間の腕と実際にロボット自身がカメラを通じて見る自分の腕は形状が違うため学習時と運用時にgapが生じる)、なぜ第三者視点でのこのようなHuman-Humanoid gapを埋めた学習データが必要なのか、という話はざーっと論文を見た限り書いておらず門外漢の私ではわからなかったので、ChatgptやGeminiにきいてみた。LLMの応答によると
- 主観視点での動画には限りがあり、第三者視点での動画の方が単純にデータ量が多い
- 主観視点動画では見える範囲が限定的であり、たとえばロボットに特定の動作を学習させたいときに、全身動作や背景の動き、物体との位置関係などはわからない。
- ロボットが実際に得る視界もロボットから見た時の主観視点であるが、それとは別の話としてこのような第三者視点がロボットが多様なタスクを学ぶときに全身が写っている動画は有用であるか(タスク、意図、行動の選択パターンなどの動作の意味情報を学ぶ)。また、第三者視点動画をロボットの視点に変換するようなモデルを作るためにもこのようなデータは必要で、これによりロボットは第三者視点の人間動画から学び、最終的にそれらを自分の主観視点に対応する表現として学習(retargetと呼ぶらしい)できる。
といった背景があるらしい。
(LLMから得た情報ここまで)
↑のLLMからの情報は妥当なように感じる。
まああとは、そもそも、ロボットが溢れかえる世界になったときに、ロボットが写っている学習データがないとまずいよね、というのも将来的にはあるのかなという感想。
[Paper Note] Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers, Zachary Shinnick+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #2D (Image) #KeyPoint Notes #WarmUp Issue Date: 2025-12-11 GPT Summary- 視覚トランスフォーマー(ViTs)を手続き生成データで事前学習する新しい方法を提案。これにより、モデルは抽象的な計算的知識を内在化し、標準的な画像トレーニングでデータ効率やパフォーマンスが向上。ImageNet-1kで1%の手続き生成データを使用することで、精度が1.7%以上向上し、28%のデータに相当する効果を示す。新しい事前学習戦略の可能性を示唆。 Comment
元ポスト:
特定のgrammarを持つ(意味情報を持たない予測可能な)シンボルトークン列(e.g.,規則的なアルファベットの羅列, 括弧による階層構造; 非画像データ)を用いてViTのTransformerブロックを事前学習することによって、MLPやattention Layerに対して構造情報を捉える能力がwarmupされ、その後実画像で事前学習をするとサンプル効率が上がる、という話らしい。
warmupでは、ViTにおける入力機構(画像パッチ+linear layer)は一切用いず、discreteなトークンと、それらをランダムに初期化したlookup table を用いる。このとき、embeddingとpositional encodingをfreezeすることで、MLP, Attention Layerに知識が埋め込まれることを保証する。
[Paper Note] Do Language Models Use Their Depth Efficiently?, Róbert Csordás+, NeurIPS'25, 2025.05
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #Architecture #NeurIPS #Depth Issue Date: 2025-12-04 GPT Summary- 大規模言語モデル(LLM)の深さと性能の関係を分析した結果、後半の層は前半の層に比べて貢献度が低く、後半の層をスキップしても影響は小さいことが分かった。また、深いモデルは新しい計算を行っているのではなく、同じ計算を多くの層に分散させていることが示唆された。このことは、深さの増加がリターンの減少をもたらす理由を説明するかもしれない。 Comment
元ポスト:
RLとネットワークの深さの関係性を分析した研究もある:
- [Paper Note] 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities, Wang+, NeurIPS'25 Best Paper Awards
[Paper Note] Constructing Efficient Fact-Storing MLPs for Transformers, Owen Dugan+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #LanguageModel #Factuality #read-later #Encoder-Decoder Issue Date: 2025-11-30 GPT Summary- LLMの事実知識の格納能力に基づき、新たに改善されたMLP構築フレームワークを提案。主な改善点は、1)全入力出力ペアに機能し、2)情報理論的制約に一致するパラメータ効率を実現し、3)Transformers内での使いやすさを確保。これにより、事実のスケーリングやエンコーダ・デコーダメカニズムの特定、使いやすさとのトレードオフを明らかにし、モジュラー事実編集の概念実証も行った。 Comment
元ポスト:
[Paper Note] PixelDiT: Pixel Diffusion Transformers for Image Generation, Yongsheng Yu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #TextToImageGeneration #ImageSynthesis #Pixel-based Issue Date: 2025-11-26 GPT Summary- PixelDiTは、オートエンコーダーを排除し、ピクセル空間での拡散プロセスを直接学習するエンドツーエンドモデルである。グローバルなセマンティクスとテクスチャの詳細を捉える二重レベルのトランスフォーマーアーキテクチャを採用し、効率的なトレーニングを実現。ImageNetで1.61のFIDを達成し、テキストから画像への生成にも拡張。GenEvalで0.74、DPG-benchで83.5を記録し、既存モデルを上回る性能を示した。 Comment
元ポスト:
[Paper Note] Apriel-H1: Towards Efficient Enterprise Reasoning Models, Oleksiy Ostapenko+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SSM (StateSpaceModel) #RecurrentModels #LinearAttention Issue Date: 2025-11-22 GPT Summary- 大規模言語モデル(LLMs)は、トランスフォーマーアーキテクチャの限界を克服するために、状態空間モデル(SSMs)と注意メカニズムを組み合わせたハイブリッドモデルApriel-H1を提案。これにより、推論性能を維持しつつ、スループットを2倍以上向上させることに成功。蒸留を通じて、重要度の低い注意層をSSMに置き換え、効率的な推論を実現。 Comment
元ポスト:
blog:
https://huggingface.co/blog/ServiceNow-AI/apriel-h1
HF:
https://huggingface.co/collections/ServiceNow-AI/apriel-h1
[Paper Note] Depth Anything 3: Recovering the Visual Space from Any Views, Haotong Lin+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #FoundationModel #2D (Image) #3D (Video) #SpatialUnderstanding Issue Date: 2025-11-17 GPT Summary- Depth Anything 3(DA3)は、カメラポーズの有無にかかわらず、視覚入力から空間的一貫性のあるジオメトリを予測するモデルです。DA3は、単一のプレーンなトランスフォーマーをバックボーンとして使用し、複雑なマルチタスク学習を排除することで、Depth Anything 2(DA2)と同等の性能を達成しました。新たに設立した視覚ジオメトリベンチマークでは、DA3がすべてのタスクで最先端の結果を示し、カメラポーズ精度で従来の最先端を44.3%、ジオメトリ精度で25.1%上回りました。すべてのモデルは公共の学術データセットでトレーニングされています。 Comment
関連:
- [Paper Note] Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data, Lihe Yang+, CVPR'24, 2024.01
- [Paper Note] Depth Anything V2, Lihe Yang+, NeurIPS'24, 2024.06
元ポスト:
pj page: https://depth-anything-3.github.io/
openreview: https://openreview.net/forum?id=yirunib8l8
[Paper Note] Optimizing Mixture of Block Attention, Guangxuan Xiao+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Attention Issue Date: 2025-11-17 GPT Summary- Mixture of Block Attention (MoBA)は、LLMにおける長いコンテキスト処理を効率化するが、その設計原則やGPU実装が不十分である。本研究では、MoBAのメカニズムを分析し、クエリとキーの親和性に基づくブロックの識別能力が性能に影響することを明らかにする。改善策として、小さなブロックサイズの使用とキーに対する短い畳み込みの適用を提案。これを実現するために、FlashMoBAを導入し、効率的なMoBA実行を可能にするCUDAカーネルを開発。FlashMoBAは、最大14.7倍のスピードアップを達成し、理論に基づく改善を実用化した。 Comment
元ポスト:
flash_attention2に対して最大で14.7倍👀どういう条件、実験だろうか
[Paper Note] Virtual Width Networks, Seed+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Architecture #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-11-17 GPT Summary- Virtual Width Networks (VWN)は、隠れ層のサイズを増やすことなく、より広い表現を可能にするフレームワークである。VWNはバックボーンの計算をほぼ一定に保ちながら埋め込み空間を拡張し、8倍の拡張でトークン予測の最適化を加速することを示した。トレーニングが進むにつれてこの利点は増幅され、仮想幅と損失削減の間には対数線形のスケーリング関係があることが確認された。 Comment
元ポスト:
ポイント解説:
重要論文に見える。transformerのバックボーンの次元は変えないでベクトルのwidthを広げることと同等の効力を得るためのアーキテクチャを提案している模様。
ざっくり言うとembeddingをN倍(over-width)し、提案手法であるGHCを用いてバックボーンに流せるサイズにベクトルを圧縮しtransformerブロックで処理しover-widthした次元に戻す処理をする機構と、over-widthしたembeddingを次元数は変えずに変換するlinearを噛ませた結果を足し合わせるような機構を用意して最大のボトルネックであるtransformerブロックの計算量は変えずに表現力を向上させる、といった感じの手法な模様
[Paper Note] OmniVGGT: Omni-Modality Driven Visual Geometry Grounded, Haosong Peng+, CVPR'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #FoundationModel #read-later #2D (Image) #3D (Scene) #Robotics #SpatialUnderstanding #Omni #Geometric #Robustness Issue Date: 2025-11-16 GPT Summary- OmniVGGTという新しいフレームワークを提案し、RGB以外の幾何学的手がかりを活用して3D基盤モデルの性能を向上させる。GeoAdapterを用いて深度情報やカメラパラメータをモデルにエンコードし、安定した最適化を実現。確率的なマルチモーダル融合手法により、任意の数のモダリティ入力を可能にし、堅牢な空間表現を学習。実験により、OmniVGGTが従来手法を上回り、視覚-言語-行動モデルに統合することでロボティクスタスクでも性能向上を達成。 Comment
元ポスト:
depth mapやcameraの情報などの様々な幾何学的情報を入力した場合(depth mapがないなど情報が欠落していても良い)にロバストに対応できるような基盤モデルを構築する手法らしい
評価データ:
- [Paper Note] A naturalistic open source movie for optical flow evaluation, Butler+, ECCV'12
- [Paper Note] ReFusion: 3D Reconstruction in Dynamic Environments for RGB-D Cameras Exploiting Residuals, Emanuele Palazzolo+, IROS'19, 2019.05
- [Paper Note] Indoor Segmentation and Support Inference from RGBD Images, Silberman+, ECCV'12
- [Paper Note] Scene Coordinate Regression Forests for Camera Relocalization in RGB-D Images,Shotton+, CVPR'13
- [Paper Note] ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes, Angela Dai+, CVPR'17, 2017.02
- [Paper Note] A Multi-view Stereo Benchmark with High-Resolution Images and Multi-camera Videos, Schöps+, CVPR'17
- [Paper Note] Large-Scale Data for Multiple-View Stereopsis, Aanæs+, IJCV'16
- [Paper Note] Tanks and temples: Benchmarking large-scale scene reconstruction, Knapitsch+, TOG'17
- [Paper Note] Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction, Reizenstein+, ICCV'21
- [Paper Note] Stereo Magnification: Learning View Synthesis using Multiplane Images, Tinghui Zhou+, SIGGRAPH'18, 2018.05
- [Paper Note] Scene Coordinate Regression Forests for Camera Relocalization in RGB-D Images, Shotton+, CVPR'13
- [Paper Note] CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks, Oier Mees+, RA-L'22 Best Paper Award, 2021.12
[Paper Note] RF-DETR: Neural Architecture Search for Real-Time Detection Transformers, Isaac Robinson+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NeuralArchitectureSearch #Encoder-Decoder #ObjectDetection #Realtime Issue Date: 2025-11-14 GPT Summary- RF-DETRは、オープンボキャブラリ検出器の一般化問題を解決するために導入された軽量の専門検出トランスフォーマーであり、重み共有ニューラルアーキテクチャサーチ(NAS)を用いて精度とレイテンシのトレードオフを評価します。RF-DETRは、COCOおよびRoboflow100-VLで従来の手法を大幅に上回り、特にRF-DETR(2x-large)はCOCOで60 APを超えた初のリアルタイム検出器です。 Comment
元ポスト:
[Paper Note] ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation, Jay Zhangjie Wu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #Selected Papers/Blogs #2D (Image) #WorldModels Issue Date: 2025-11-11 GPT Summary- ChronoEditフレームワークを提案し、画像編集を動画生成として再定義。入力画像と編集画像を動画の最初と最後のフレームとし、時間的一貫性を学習した動画生成モデルを活用。推論時に時間的推論ステージを導入し、物理的に実現可能な変換を制約する編集軌道を生成。新しいベンチマークPBench-Editで、ChronoEditが視覚的忠実性と物理的妥当性で最先端の手法を上回ることを示した。 Comment
HF:
https://huggingface.co/nvidia/ChronoEdit-14B-Diffusers
LoRAによるUpscaler:
https://huggingface.co/nvidia/ChronoEdit-14B-Diffusers-Upscaler-Lora
元ポスト:
スケッチ+promptでの編集
HF:
https://huggingface.co/nvidia/ChronoEdit-14B-Diffusers-Paint-Brush-Lora
元ポスト:
[Paper Note] SAM 2: Segment Anything in Images and Videos, Nikhila Ravi+, ICLR'25, 2024.08
Paper/Blog Link My Issue
#ComputerVision #ImageSegmentation #Prompting #FoundationModel #2D (Image) #3D (Video) Issue Date: 2025-11-09 GPT Summary- Segment Anything Model 2(SAM 2)は、プロンプト可能な視覚セグメンテーションのための基盤モデルで、ユーザーのインタラクションを通じてデータを改善するデータエンジンを構築し、最大の動画セグメンテーションデータセットを収集。シンプルなトランスフォーマーアーキテクチャを用い、リアルタイム動画処理に対応。SAM 2は、動画セグメンテーションで従来の手法より3倍少ないインタラクションで高精度を達成し、画像セグメンテーションでも従来モデルより精度が高く、6倍速い。データ、モデル、コード、デモを公開し、関連タスクの重要なマイルストーンを目指す。 Comment
openreview: https://openreview.net/forum?id=Ha6RTeWMd0
SAMはこちら:
- [Paper Note] Segment Anything, Alexander Kirillov+, arXiv'23, 2023.04
[Paper Note] The Strong Lottery Ticket Hypothesis for Multi-Head Attention Mechanisms, Hikari Otsuka+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NeuralNetwork #NLP #AAAI #LearningPhenomena Issue Date: 2025-11-09 GPT Summary- 強いロッタリーチケット仮説(SLTH)は、ランダムに初期化されたニューラルネットワーク内に高性能なサブネットワークが存在することを示唆していますが、トランスフォーマーアーキテクチャにおける理解は不足しています。本研究では、マルチヘッドアテンション(MHA)内の強いロッタリーチケットの存在を理論的に分析し、特定の条件下で任意のMHAを高い確率で近似するサブネットワークが存在することを証明します。また、この理論を用いて正規化層のないトランスフォーマーにSLTHを拡張し、近似誤差が隠れ次元の増加に伴い指数関数的に減少することを実証的に示しました。 Comment
元ポスト:
[Paper Note] Emu3.5: Native Multimodal Models are World Learners, Yufeng Cui+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #LanguageModel #MultiModal #DiffusionModel #2D (Image) #UMM #text Issue Date: 2025-11-01 GPT Summary- Emu3.5は、視覚と言語の両方に基づく次の状態を予測する大規模なマルチモーダルワールドモデルで、10兆トークン以上のデータで事前訓練されています。双方向の並列予測を用いた「Discrete Diffusion Adaptation(DiDA)」により、推論を約20倍加速し、強力なマルチモーダル能力を発揮します。Emu3.5は、画像生成や編集タスクで優れたパフォーマンスを示し、オープンソースとして提供されています。 Comment
pj page: https://emu.world/
元ポスト:
ポイント解説:
[Paper Note] Scaling Latent Reasoning via Looped Language Models, Rui-Jie Zhu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Selected Papers/Blogs #LatentReasoning #KeyPoint Notes #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2025-10-30 GPT Summary- Ouroは、推論を事前訓練フェーズに組み込むことを目指したループ言語モデル(LoopLM)であり、反復計算やエントロピー正則化を通じて性能を向上させる。1.4Bおよび2.6Bモデルは、最大12Bの最先端LLMに匹敵する性能を示し、知識操作能力の向上がその要因であることを実験で確認。LoopLMは明示的なCoTよりも整合した推論を生成し、推論の新たなスケーリングの可能性を示唆している。モデルはオープンソースで提供されている。 Comment
pj page: https://ouro-llm.github.io
元ポスト:
解説:
基本構造はdecoder-only transformerで
- Multi-Head Attention
- RoPE
- SwiGLU活性化
- Sandwich Normalization
が使われているLoopedTransformerで、exit gateを学習することで早期にloopを打ち切り、出力をすることでコストを節約できるようなアーキテクチャになっている。
より少ないパラメータ数で、より大きなパラメータ数のモデルよりも高い性能を示す(Table7,8)。また、Tを増やすとモデルの安全性も増す(=有害プロンプトの識別力が増す)。その代わり、再帰数Tを大きくするとFLOPsがT倍になるので、メモリ効率は良いが計算効率は悪い。
linear probingで再帰の次ステップ予測をしたところ浅い段階では予測が不一致になるため、思考が進化していっているのではないか、という考察がある。
また、再帰数Tを4で学習した場合に、inference時にTを5--8にしてもスケールしない(Table10)。
またAppendix D.1において、通常のtransformerのLoopLMを比較し、5種類の大きさのモデルサイズで比較。通常のtransformerではループさせる代わりに実際に層の数を増やすことで、パラメータ数を揃えて実験したところ、通常のtransformerの方が常に性能が良く、loopLMは再帰数を増やしてもスケールせず、モデルサイズが大きくなるにつれて差がなくなっていく、というスケーリングの面では残念な結果に終わっているようだ。
といった話が解説に書かれている。元論文は完全にskim readingして解説ポストを主に読んだので誤りが含まれるかもしれない点には注意。
[Paper Note] FARMER: Flow AutoRegressive Transformer over Pixels, Guangting Zheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #read-later #NormalizingFlow #Compression Issue Date: 2025-10-28 GPT Summary- FARMERという新しい生成フレームワークを提案し、正規化フローと自己回帰モデルを統合して高品質な画像合成と尤度推定を実現。潜在シーケンスへの変換や自己教師あり次元削減により、ARモデリングの効率を向上。推論速度を加速する蒸留スキームと画像生成品質を向上させる分類器フリーガイダンスを導入。実験により、FARMERは既存モデルと比較して競争力のある性能を示した。 Comment
元ポスト:
ポイント解説:
これは...👀👀👀
[Paper Note] SeeDNorm: Self-Rescaled Dynamic Normalization, Wenrui Cai+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #MachineLearning #NLP #LanguageModel #Architecture #Normalization Issue Date: 2025-10-28 GPT Summary- SeeDNormは、入力に基づいて動的にスケーリング係数を調整する新しい正規化層であり、RMSNormの限界を克服します。これにより、入力のノルム情報を保持し、データ依存の自己再スケーリングを実現。大規模言語モデルやコンピュータビジョンタスクでの有効性を検証し、従来の正規化手法と比較して優れた性能を示しました。
[Paper Note] Positional Encoding Field, Yunpeng Bai+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #read-later Issue Date: 2025-10-26 GPT Summary- Diffusion Transformers(DiTs)は、視覚生成において優れた性能を示すアーキテクチャであり、パッチトークンと位置エンコーディング(PE)を用いています。本研究では、DiTsがどのように視覚コンテンツを整理するかを再考し、PEの摂動に対しても一貫した出力を生成することを発見しました。これに基づき、位置エンコーディングを3Dフィールドに拡張したPE-Fieldを提案し、ボリュメトリック推論と階層的エンコーディングを組み込みました。強化されたDiTは、新しい視点合成と空間画像編集において最先端の性能を達成しました。 Comment
pj page: https://yunpeng1998.github.io/PE-Field-HomePage/
元ポスト:
[Paper Note] When Do Transformers Learn Heuristics for Graph Connectivity?, Qilin Ye+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #Reasoning Issue Date: 2025-10-24 GPT Summary- Transformersは一般化能力に欠け、脆弱なヒューリスティックに依存することが多い。分離型Transformerを用いて、$L$層のモデルが直径$3^L$までのグラフを解決できることを証明。トレーニングダイナミクスを分析し、能力内のグラフでは正しいアルゴリズムを学習し、能力を超えたグラフでは単純なヒューリスティックを学習することを示す。トレーニングデータを能力内に制限することで、正確なアルゴリズムの学習が促進されることを実証。 Comment
元ポスト:
[Paper Note] Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning, Ling Team+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #Architecture #MoE(Mixture-of-Experts) #Hybrid Issue Date: 2025-10-24 GPT Summary- Ring-linearモデルシリーズ、特にRing-mini-linear-2.0(16Bパラメータ)とRing-flash-linear-2.0(104Bパラメータ)を紹介。両モデルはハイブリッドアーキテクチャを採用し、長いコンテキストの推論でI/Oと計算オーバーヘッドを削減。推論コストは32億パラメータの密なモデルと比較して1/10、元のRingシリーズと比べて50%以上削減。最適なモデル構造を特定し、高性能FP8オペレーターライブラリ「linghe」によりトレーニング効率が50%向上。複数の複雑推論ベンチマークでSOTAパフォーマンスを維持。 Comment
HF: https://huggingface.co/inclusionAI/Ring-flash-linear-2.0-128k
元ポスト:
所見:
[Paper Note] Memory Layers at Scale, Vincent-Pierre Berges+, ICLR'25, 2024.12
Paper/Blog Link My Issue
#LanguageModel #Architecture #ICLR #read-later #Selected Papers/Blogs #memory #KeyPoint Notes Issue Date: 2025-10-23 GPT Summary- メモリ層は、計算負荷を増やさずにモデルに追加のパラメータを加えるための学習可能な検索メカニズムを使用し、スパースに活性化されたメモリ層が密なフィードフォワード層を補完します。本研究では、改良されたメモリ層を用いた言語モデルが、計算予算が2倍の密なモデルや同等の計算とパラメータを持つエキスパート混合モデルを上回ることを示し、特に事実に基づくタスクでの性能向上が顕著であることを明らかにしました。完全に並列化可能なメモリ層の実装とスケーリング法則を示し、1兆トークンまでの事前学習を行った結果、最大8Bのパラメータを持つベースモデルと比較しました。 Comment
openreview: https://openreview.net/forum?id=ATqGm1WyDj
transformerにおけるFFNをメモリレイヤーに置き換えることで、パラメータ数を増やしながら計算コストを抑えるようなアーキテクチャを提案しているようである。メモリレイヤーは、クエリqを得た時にtop kのkvをlookupし(=ここで計算対象となるパラメータがスパースになる)、kqから求めたattention scoreでvを加重平均することで出力を得る。Memory+というさらなる改良を加えたアーキテクチャでは、入力に対してsiluによるgatingとlinearな変換を追加で実施することで出力を得る。
denseなモデルと比較して性能が高く、メモリパラメータを増やすと性能がスケールする。
[Paper Note] OminiControl: Minimal and Universal Control for Diffusion Transformer, Zhenxiong Tan+, ICCV'25 Highlight, 2024.11
Paper/Blog Link My Issue
#ComputerVision #Controllable #DiffusionModel #VariationalAutoEncoder #Selected Papers/Blogs #ICCV #KeyPoint Notes Issue Date: 2025-10-22 GPT Summary- OminiControlは、Diffusion Transformer(DiT)アーキテクチャにおける画像条件付けの新しいアプローチで、パラメータオーバーヘッドを最小限に抑えつつ、柔軟なトークン相互作用と動的な位置エンコーディングを実現。広範な実験により、複数の条件付けタスクで専門的手法を上回る性能を示し、合成された画像ペアのデータセット「Subjects200K」を導入。効率的で多様な画像生成システムの可能性を示唆。 Comment
元ポスト:
DiTのアーキテクチャは(MMA以外は)変更せずに、Condition Image C_IをVAEでエンコードしたnoisy inputをDiTのinputにconcatし順伝播させることで、DiTをunified conditioningモデル(=C_Iの特徴量を他のinputと同じlatent spaceで学習させ統合的に扱う)として学習する[^1]。
[^1]: 既存研究は別のエンコーダからエンコードしたfeatureが加算されていて(式3)、エンコーダ部分に別途パラメータが必要だっただけでなく、加算は空間的な対応関係が存在しない場合はうまく対処できず(featureの次元が空間的な情報に対応しているため)、conditional tokenとimageの交互作用を妨げていた。
また、positional encodingのindexをconditional tokenとnoisy image tokensと共有すると、空間的な対応関係が存在するタスク(edge guided generation等)はうまくいったが、被写体を指定する生成(subject driven generation)のような対応関係が存在しないタスク(non-aligned task)の場合はうまくいかなかった。しかし、non-aligned taskの場合は、indexにオフセットを加えシフトさせる(式4)ことで、conditional text/image token間で空間的にoverlapしないようにすることで性能が大幅に改善した。
既存研究では、C_Iの強さをコントロールするために、ハイパーパラメータとして定数を導入し、エンコードされたfeatureを加算する際の強さを調整していたが(3.2.3節)、本手法ではconcatをするためこのような方法は使えない。そのため、Multi-Modal Attention(MMA)にハイパーパラメータによって強さを調整可能なbias matrixを導入し、C_IとXのattentionの交互作用の強さを調整することで対応した(式5,6)。
[Paper Note] The Free Transformer, François Fleuret, arXiv'25, 2025.10
Paper/Blog Link My Issue
#MachineLearning #VariationalAutoEncoder #Architecture #Decoder Issue Date: 2025-10-22 GPT Summary- 無監督で学習された潜在変数に条件付けるデコーダーTransformerの拡張を提案し、下流タスクでの性能が大幅に向上することを実験で示した。 Comment
元ポスト:
ポイント解説:
[Paper Note] Scaling Language-Free Visual Representation Learning, David Fan+, ICCV'25, 2025.04
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Self-SupervisedLearning #ICCV #Scalability Issue Date: 2025-10-20 GPT Summary- 視覚的自己教師あり学習(SSL)は、CLIPに比べて視覚的質問応答(VQA)でのパフォーマンスが劣るが、同じデータセットで訓練することで、視覚的SSLモデルがCLIPモデルよりもスケールが良いことを示した。視覚的SSLは、VQAや従来の視覚ベンチマークでCLIPレベルのパフォーマンスを達成できる可能性がある。これにより、視覚中心の表現学習に新たな機会が開かれる。 Comment
pj page: https://davidfan.io/webssl/
元ポスト:
[Paper Note] DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation, Ziqi Chen+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#SpeechProcessing #MoE(Mixture-of-Experts) #FlowMatching #TTS #LowResource #ConvolutionalModels Issue Date: 2025-10-18 GPT Summary- DiaMoE-TTSは、方言の音声合成のためのIPAベースのフレームワークを提案し、音声表現の標準化と曖昧さの解決を図る。F5-TTSアーキテクチャを基に、方言に対応したMixture-of-Expertsを導入し、効率的なパラメータ適応を実現。スケーラブルでオープンデータ駆動のアプローチにより、数時間のデータで未見の方言や専門的なドメインに対して自然で表現力豊かな音声生成を達成。 Comment
元ポスト:
[Paper Note] Frequency-Dynamic Attention Modulation for Dense Prediction, Linwei Chen+, ICCV'25, 2025.07
Paper/Blog Link My Issue
#ComputerVision #Attention #ICCV Issue Date: 2025-10-18 GPT Summary- 本研究では、Vision Transformers(ViTs)の周波数応答を改善するために、Frequency-Dynamic Attention Modulation(FDAM)を提案。FDAMは、注意行列のローパスフィルタを反転させるAttention Inversion(AttInv)と、異なる周波数成分に重み付けを行うFrequency Dynamic Scaling(FreqScale)から成る。これにより、表現の崩壊を回避し、セマンティックセグメンテーションや物体検出などのタスクで一貫した性能向上を実現。リモートセンシング検出でも最先端の結果を達成。コードは公開されている。 Comment
元ポスト:
[Paper Note] Cautious Weight Decay, Lizhang Chen+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #LanguageModel #Optimizer Issue Date: 2025-10-16 GPT Summary- Cautious Weight Decay(CWD)は、オプティマイザに依存しない修正で、更新と符号が一致するパラメータにのみウェイト減衰を適用します。これにより、元の損失を保持しつつ、局所的なパレート最適点を探索可能にします。CWDは、既存のオプティマイザに簡単に適用でき、新たなハイパーパラメータを必要とせず、言語モデルの事前学習やImageNet分類で損失と精度を向上させます。 Comment
元ポスト:
[Paper Note] How Reinforcement Learning After Next-Token Prediction Facilitates Learning, Nikolaos Tsilivis+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #ReinforcementLearning #Reasoning #PostTraining #read-later Issue Date: 2025-10-14 GPT Summary- 大規模言語モデルの次のトークン予測を強化学習で最適化するフレームワークを提案。特に、短いおよび長い「思考の連鎖」シーケンスからの学習を通じて、強化学習が次のトークン予測を改善することを理論的に示す。長いシーケンスが稀な場合、強化学習により自己回帰型トランスフォーマーが一般化できることを確認。さらに、長い応答が計算を増加させるメカニズムを説明し、自己回帰型線形モデルが効率的に$d$ビットの偶奇を予測できる条件を理論的に証明。Llamaシリーズモデルのポストトレーニングによる実証も行う。 Comment
元ポスト:
[Paper Note] Diffusion Transformers with Representation Autoencoders, Boyang Zheng+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #DiffusionModel #read-later #Selected Papers/Blogs #Backbone Issue Date: 2025-10-14 GPT Summary- 本研究では、従来のVAEエンコーダを事前学習された表現エンコーダに置き換えたRepresentation Autoencoders(RAE)を提案。これにより、高品質な再構成と豊かな潜在空間を実現し、拡散トランスフォーマーの性能向上を図る。RAEは、補助的な表現整合損失なしで早い収束を達成し、ImageNetで優れた画像生成結果を示した。RAEは、拡散トランスフォーマーの新しいデフォルトとしての利点を提供する。 Comment
pj page: https://rae-dit.github.io
元ポスト:
U-NetをBackboneとしたVAEの代わりにViTに基づく(down, up- scaling無しの)アーキテクチャを用いることで、より少ない計算量で高い性能を達成しました、といった話に見える。
ポイント解説:
解説:
[Paper Note] Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin, Enrique Queipo-de-Llano+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #Attention #AttentionSinks #CompressionValleys Issue Date: 2025-10-10 GPT Summary- 注意の沈降と圧縮の谷の関連性を示し、大規模な活性化が表現の圧縮とエントロピーの減少を引き起こすことを理論的に証明。実験により、シーケンスの開始トークンが中間層で極端な活性化を生むと、圧縮の谷と注意の沈降が同時に現れることを確認。TransformerベースのLLMがトークンを三つのフェーズで処理する「Mix-Compress-Refine」理論を提案し、タスク依存の表現の違いを説明。 Comment
元ポスト:
[Paper Note] Heptapod: Language Modeling on Visual Signals, Yongxin Zhu+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Decoder Issue Date: 2025-10-10 GPT Summary- Heptapodは、因果注意を用いた画像自動回帰モデルで、CFGへの依存を排除し、意味トークナイザーのトレンドを避ける。主な革新は、2D分布予測を行う因果Transformerで、画像の2D空間全体にわたる分布を学習する。これにより、生成的トレーニングを通じて画像の意味を捉えることが可能になる。ImageNet生成ベンチマークでFID値2.70を達成し、従来のアプローチを上回る成果を示した。 Comment
元ポスト:
[Paper Note] ReasonIR: Training Retrievers for Reasoning Tasks, Rulin Shao+, COLM'25, 2025.04
Paper/Blog Link My Issue
#Embeddings #InformationRetrieval #SyntheticData #Reasoning #Test-Time Scaling #COLM #read-later #Selected Papers/Blogs #Encoder Issue Date: 2025-10-08 GPT Summary- ReasonIR-8Bは、一般的な推論タスク向けに特別に訓練された初のリトリーバーであり、合成データ生成パイプラインを用いて挑戦的なクエリとハードネガティブを作成。これにより、BRIGHTベンチマークで新たな最先端成果を達成し、RAGタスクでも他のリトリーバーを上回る性能を示す。トレーニングレシピは一般的で、将来のLLMへの拡張が容易である。コード、データ、モデルはオープンソース化されている。 Comment
元ポスト:
Llama3.1-8Bをbidirectional encoderに変換してpost-trainingしている。
関連:
- [Paper Note] Generative Representational Instruction Tuning, Niklas Muennighoff+, ICLR'25, 2024.02
[Paper Note] Pretraining with hierarchical memories: separating long-tail and common knowledge, Hadi Pouransari+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SmallModel #memory Issue Date: 2025-10-07 GPT Summary- 現代の言語モデルはパラメータのスケーリングに依存しているが、すべての世界知識を圧縮するのは非現実的である。これに対処するため、メモリ拡張アーキテクチャを提案し、小型言語モデルが階層的なメモリバンクにアクセスする仕組みを導入。実験により、160Mパラメータのモデルに18Mパラメータのメモリを追加することで、通常のモデルと同等の性能を達成。トランスフォーマーにおけるメモリの最適なタイプとサイズを研究し、提案したメモリが堅牢に機能することを確認。 Comment
元ポスト:
[Paper Note] xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity, Maximilian Beck+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Scaling Laws #RecurrentModels Issue Date: 2025-10-03 GPT Summary- スケーリング法則はLLMsの性能予測に重要であり、トランスフォーマーとxLSTMのスケーリング挙動を比較。xLSTMは文脈の長さに対して線形の複雑さを持ち、トレーニングおよび推論においてトランスフォーマーよりも有利にスケールすることが示された。特に、文脈が増えるとxLSTMの利点が拡大する。 Comment
元ポスト:
関連:
- [Paper Note] xLSTM: Extended Long Short-Term Memory, Maximilian Beck+, NeurIPS'24 Spotlight, 2024.05
[Paper Note] Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation, Shuo Yang+, NeurIPS'25 Spotlight, 2025.05
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Attention #DiffusionModel #Architecture #NeurIPS #VideoGeneration/Understandings #Sparse #SparseAttention Issue Date: 2025-09-27 GPT Summary- Diffusion Transformers(DiTs)の動画生成におけるレイテンシーの問題を解決するため、重要トークンの特定精度を最大化し計算の無駄を最小化するトレーニング不要のフレームワークSVG2を提案。SVG2は意味に基づくトークンのクラスタリングと再配置を行い、計算効率を向上させる。これにより、HunyuanVideoおよびWan 2.1でそれぞれ最大2.30倍および1.89倍のスピードアップを達成し、PSNRを維持。 Comment
元ポスト:
pj page: https://svg-project.github.io/v2/
Q, Kそれぞれについて独立してkmeansクラスタリングを実施し、意味的に類似したQ, Kをクラスタ化し、map上で散らばっているトークンの配置を整頓して計算機上で効率的に扱えるようにし、各クラスタのcentroidをattention scoreの計算に用いてクラスタ内のトークンのスコアを近似することで計算を効率化します、といった話な模様。また、クリティカルなクラスタとそうでは無いものがあるので、p個のクリティカルなクラスタを選択しさらに効率化をする模様。
[Paper Note] Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding, Mingyu Jin+, ICML'25, 2025.02
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #Attention #ICML #ContextEngineering Issue Date: 2025-09-26 GPT Summary- 大規模言語モデル(LLMs)は文脈的知識の理解に成功しており、特に注意クエリ(Q)とキー(K)において集中した大規模な値が一貫して現れることを示す。これらの値は、モデルのパラメータに保存された知識ではなく、現在の文脈から得られる知識の解釈に重要である。量子化戦略の調査により、これらの値を無視すると性能が低下することが明らかになり、集中した大規模な値の出現がロタリーポジショナルエンコーディング(RoPE)によって引き起こされることを発見した。これらの結果は、LLMの設計と最適化に関する新たな洞察を提供する。 Comment
openreview: https://openreview.net/forum?id=1SMcxxQiSL¬eId=7BAXSETAwU
[Paper Note] MapAnything: Universal Feed-Forward Metric 3D Reconstruction, Nikhil Keetha+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #3D Reconstruction #2D (Image) #3D (Scene) #Backbone Issue Date: 2025-09-20 GPT Summary- MapAnythingは、画像と幾何学的入力を用いて3Dシーンの幾何学とカメラを回帰するトランスフォーマーベースのモデルです。多視点シーンの因子化された表現を活用し、様々な3Dビジョンタスクに対応可能です。実験により、専門モデルと同等またはそれを上回る性能を示し、効率的な共同トレーニングを実現しています。 Comment
pj page: https://map-anything.github.io
元ポスト:
v1.1がリリース:
[Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #VariationalAutoEncoder #NeurIPS #PostTraining #Selected Papers/Blogs #VideoGeneration/Understandings #One-Line Notes Issue Date: 2025-09-19 GPT Summary- Self Forcingは、自動回帰型ビデオ拡散モデルの新しいトレーニング手法で、エクスポージャーバイアスの問題に対処します。従来の手法が真のコンテキストに基づくのに対し、Self Forcingは自己生成した出力に基づいてフレームを生成し、全体の品質を評価するホリスティックな損失を用います。計算コストとパフォーマンスのバランスを取るために、少数ステップの拡散モデルと確率的勾配切断を採用し、ロールイングKVキャッシュメカニズムを導入。実験により、リアルタイムのストリーミングビデオ生成が可能で、非因果的拡散モデルの生成品質に匹敵またはそれを上回ることが示されました。 Comment
pj page: https://self-forcing.github.io
元ポスト:
自己回帰的な動画生成(をする)モデルにおいて、学習時はground-truchのcontextが利用して学習されるが、推論時は自身が生成結果そのものをcontextとして利用するため、学習-推論時にgapが生じ、(徐々に誤差が蓄積することで)品質が劣化するという問題(exposure bias)に対処するために、学習時から自身が生成した出力をcontextとして与えて生成を行い(ロールアウト)、動画全体に対して分布の整合性を測るlossを導入(=フレーム単位の誤差を最小化にするのではなく、動画全体に対して(分布の)誤差を最適化する)することで、exposure biasを軽減する、という話な模様。
結果的に、単一のRTX4090でリアルタイムのストリーミングビデオ生成が高品質に生成可能となった(かもしれない):
https://note.com/ngc_shj/n/n505b2f7cdfe4
[Paper Note] 4DNeX: Feed-Forward 4D Generative Modeling Made Easy, Zhaoxi Chen+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #Dataset #DiffusionModel #PEFT(Adaptor/LoRA) #Encoder-Decoder #3D (Video) Issue Date: 2025-09-16 GPT Summary- 4DNeXは、単一の画像から動的3Dシーンを生成する初のフィードフォワードフレームワークであり、事前学習されたビデオ拡散モデルをファインチューニングすることで効率的な4D生成を実現。大規模データセット4DNeX-10Mを構築し、RGBとXYZシーケンスを統一的にモデル化。実験により、4DNeXは既存手法を上回る効率性と一般化能力を示し、動的シーンの生成的4Dワールドモデルの基盤を提供。 Comment
pj page: https://4dnex.github.io
元ポスト:
[Paper Note] Forgetting Transformer: Softmax Attention with a Forget Gate, Zhixuan Lin+, ICLR'25, 2025.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #Architecture #ICLR #AttentionSinks Issue Date: 2025-09-16 GPT Summary- 忘却ゲートを取り入れたトランスフォーマー「FoX」を提案。FoXは長いコンテキストの言語モデリングや下流タスクでトランスフォーマーを上回る性能を示し、位置埋め込みを必要としない。再帰的シーケンスモデルに対しても優れた能力を保持し、性能向上のための「Pro」ブロック設計を導入。コードはGitHubで公開。 Comment
openreview: https://openreview.net/forum?id=q2Lnyegkr8
code: https://github.com/zhixuan-lin/forgetting-transformer
非常におもしろそう
データ非依存の固定されたsink tokenを用いるのではなく、データ依存のlearnableなsink tokenを用いる研究とみなせる。
- [Paper Note] Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters, Ailin Huang+, arXiv'26, 2026.02
[Paper Note] Adaptive Computation Pruning for the Forgetting Transformer, Zhixuan Lin+, COLM'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Pruning #Attention #LongContext #Architecture Issue Date: 2025-09-16 GPT Summary- Forgeting Transformer(FoX)は、忘却ゲートを用いたソフトマックスアテンションを特徴とし、従来のTransformerと比較して優れた性能を示す。FoXの特性を活かし、適応計算プルーニング(ACP)を提案し、計算を動的にプルーニングすることで、FLOPsとメモリアクセスを約70%削減。これにより、アテンションの実行時間を50%から70%短縮し、トレーニングスループットを10%から40%向上させた。性能の劣化はなく、長い文脈長ではさらなる計算コストの節約が可能である。 Comment
code: https://github.com/zhixuan-lin/forgetting-transformer
元ポスト:
openreview: https://openreview.net/forum?id=xNj14CY5S1#discussion
[Paper Note] Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling, Neil Zeghidour+, arXiv'25
Paper/Blog Link My Issue
#SpeechProcessing #TTS Issue Date: 2025-09-11 GPT Summary- Delayed Streams Modeling (DSM)は、ストリーミングおよびマルチモーダルなシーケンス・ツー・シーケンス学習のための新しい手法で、入力シーケンスを完全に消費するオフライン方式とは異なり、出力タイミングを学習するストリーミング方式を採用しています。DSMはデコーダー専用の言語モデルを用いて、時間的に整列されたストリームをモデル化し、遅延を導入することで任意の出力シーケンスのストリーミング推論を実現します。特に、テキストと音声のストリームにおいて、自動音声認識(ASR)やテキスト・トゥ・スピーチ(TTS)モデルに対して優れた性能を示し、オフラインベースラインと競争できることが実験で確認されました。 Comment
元ポスト:
[Paper Note] Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free, Zihan Qiu+, NeurIPS'25 Best Paper
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #NeurIPS #AttentionSinks #read-later #Selected Papers/Blogs Issue Date: 2025-09-11 GPT Summary- ゲーティングメカニズムの効果を調査するため、強化されたソフトマックスアテンションのバリアントを実験。15B Mixture-of-Expertsモデルと1.7B密なモデルを比較し、シグモイドゲートの適用が性能向上に寄与することを発見。これにより訓練の安定性が向上し、スケーリング特性も改善。スパースゲーティングメカニズムが「アテンションシンク」を軽減し、長いコンテキストの外挿性能を向上させることを示した。関連コードとモデルも公開。 Comment
元ポスト:
所見:
NeurIPS'25 Best Paper:
[Paper Note] mmBERT: A Modern Multilingual Encoder with Annealed Language Learning, Marc Marone+, arXiv'25
Paper/Blog Link My Issue
#Embeddings #NLP #MultiLingual #Encoder Issue Date: 2025-09-10 GPT Summary- mmBERTは、1800以上の言語で3兆トークンのデータを用いて事前学習されたエンコーダ専用の言語モデルであり、低リソース言語を短い減衰フェーズに含めることでパフォーマンスを向上させた。新しい要素を導入し、OpenAIのo3やGoogleのGemini 2.5 Proと同等の分類性能を達成。mmBERTは分類および検索タスクで以前のモデルを大幅に上回ることを示した。 Comment
blog:
https://huggingface.co/blog/mmbert
HF:
https://huggingface.co/jhu-clsp/mmBERT-checkpoints
- modernbert-ja-130m, SB Intuitions, 2025.02
と比較して日本語の性能はどうかなあ
元ポスト:
解説:
[Paper Note] Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler, Aleksandr Dremov+, TMLR'25
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #LanguageModel #TMLR #Scheduler Issue Date: 2025-09-03 GPT Summary- WSD学習率スケジューラのクールダウンフェーズを分析し、異なる形状がモデルのバイアス-バリアンスのトレードオフに与える影響を明らかに。探索と活用のバランスが最適なパフォーマンスをもたらすことを示し、特に$\beta_2$の値が高いと改善が見られる。損失のランドスケープを視覚化し、クールダウンフェーズの最適化の重要性を強調。 Comment
元ポスト:
[Paper Note] Looped Transformers for Length Generalization, Ying Fan+, ICLR'25
Paper/Blog Link My Issue
#MachineLearning #LongContext #Architecture #ICLR #Generalization #RecurrentModels Issue Date: 2025-08-30 GPT Summary- ループトランスフォーマーを用いることで、未見の長さの入力に対する算術的およびアルゴリズム的タスクの長さ一般化が改善されることを示す。RASP-L操作を含む既知の反復解法に焦点を当て、提案する学習アルゴリズムで訓練した結果、さまざまなタスクに対して高い一般化能力を持つ解法を学習した。 Comment
openreview: https://openreview.net/forum?id=2edigk8yoU
[Paper Note] Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model, Xianglong He+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #OpenWeight #VideoGeneration/Understandings #WorldModels #Game Issue Date: 2025-08-28 GPT Summary- Matrix-Game 2.0を提案し、インタラクティブな世界モデルがリアルタイムで長いビデオを生成できるようにする。主なコンポーネントは、スケーラブルなデータ生成パイプライン、インタラクティブな条件を可能にするアクション注入モジュール、リアルタイム生成のための数ステップの蒸留。これにより、25 FPSで高品質な1分間のビデオを生成可能。モデルの重みとコードはオープンソース化。 Comment
元ポスト:
pj page: https://matrix-game-v2.github.io
公式:
[Paper Note] JetFormer: An Autoregressive Generative Model of Raw Images and Text, Michael Tschannen+, ICLR'25
Paper/Blog Link My Issue
#ComputerVision #TextToImageGeneration #Architecture #ICLR #read-later #NormalizingFlow Issue Date: 2025-08-17 GPT Summary- JetFormerは、画像とテキストの共同生成を効率化する自己回帰型デコーダー専用のトランスフォーマーであり、別々にトレーニングされたコンポーネントに依存せず、両モダリティを理解・生成可能。正規化フローモデルを活用し、テキストから画像への生成品質で既存のベースラインと競合しつつ、堅牢な画像理解能力を示す。JetFormerは高忠実度の画像生成と強力な対数尤度境界を実現する初のモデルである。 Comment
openreview: https://openreview.net/forum?id=sgAp2qG86e
画像をnormalizing flowでソフトトークンに変換し、transformerでソフトトークンを予測させるように学習することで、テキストと画像を同じアーキテクチャで学習できるようにしました、みたいな話っぽい?おもしろそう
[Paper Note] Less Is More: Training-Free Sparse Attention with Global Locality for Efficient Reasoning, Lijie Yang+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention Issue Date: 2025-08-14 GPT Summary- 「LessIsMore」という新しいスパースアテンションメカニズムを提案。これは、トレーニング不要でグローバルアテンションパターンを活用し、トークン選択を効率化。精度を維持しつつ、デコーディング速度を1.1倍向上させ、トークン数を2倍削減。既存手法と比較して1.13倍のスピードアップを実現。 Comment
元ポスト:
トレーニングフリーで1.1倍のデコーディング速度で性能もFull Attentionと同等以上のSparse Attentionらしい
[Paper Note] AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning, Shihao Yuan+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #TextToImageGeneration #GRPO #On-Policy #Encoder-Decoder Issue Date: 2025-08-12 GPT Summary- AR-GRPOは、自己回帰画像生成モデルにオンライン強化学習を統合した新しいアプローチで、生成画像の品質を向上させるためにGRPOアルゴリズムを適用。クラス条件およびテキスト条件の画像生成タスクで実験を行い、標準のARモデルと比較して品質と人間の好みを大幅に改善した。結果は、AR画像生成における強化学習の有効性を示し、高品質な画像合成の新たな可能性を開く。 Comment
元ポスト:
[Paper Note] Fast and Simplex: 2-Simplicial Attention in Triton, Aurko Roy+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Attention #Architecture Issue Date: 2025-08-11 GPT Summary- 2-シンプリシアルトランスフォーマーを用いることで、トークン効率を向上させ、標準的なトランスフォーマーよりも優れた性能を発揮することを示す。固定されたトークン予算内で、数学や推論タスクにおいてドット積アテンションを上回る結果を得た。 Comment
元ポスト:
[Paper Note] RankMixer: Scaling Up Ranking Models in Industrial Recommenders, Jie Zhu+, arXiv'25
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #LearningToRank #read-later #Selected Papers/Blogs Issue Date: 2025-07-24 GPT Summary- RankMixerは、推薦システムのスケーラビリティを向上させるための新しいアーキテクチャで、トランスフォーマーの並列性を活かしつつ、効率的な特徴相互作用を実現。Sparse-MoEバリアントを用いて10億パラメータに拡張し、動的ルーティング戦略で専門家の不均衡を解消。実験により、1兆スケールのデータセットで優れたスケーリング能力を示し、MFUを4.5%から45%に向上させ、推論レイテンシーを維持しつつパラメータを100倍に増加。オンラインA/Bテストで推薦、広告、検索の各シナリオにおける効果を確認し、ユーザーのアクティブ日数を0.2%、アプリ内使用時間を0.5%改善。 Comment
元ポスト:
[Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #Architecture #NeurIPS #LatentReasoning #memory #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2025-07-17 GPT Summary- Mixture-of-Recursions(MoR)というフレームワークを提案し、再帰型トランスフォーマー内でパラメータ共有と適応計算を同時に実現。MoRは、レイヤーの再利用とトークンごとの再帰深さの動的割り当てにより、メモリアクセス効率を向上させる。135Mから1.7Bパラメータのモデルで、トレーニングFLOPsを維持しつつ、困惑度を低下させ、少数ショット精度を向上。MoRは大規模モデルのコストを抑えつつ、品質向上に寄与することを示す。 Comment
元ポスト:
解説:
関連:
- [Paper Note] Universal Transformers, Mostafa Dehghani+, ICLR'19
- [Paper Note] Looped Transformers for Length Generalization, Ying Fan+, ICLR'25
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
著者ポスト:
[Paper Note] In-context denoising with one-layer transformers: connections between attention and associative memory retrieval, Matthew Smart+, arXiv'25
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #In-ContextLearning Issue Date: 2025-07-16 GPT Summary- 「インコンテキストデノイジング」というタスクを通じて、注意ベースのアーキテクチャと密な連想記憶(DAM)ネットワークの関係を探求。ベイズ的フレームワークを用いて、単層トランスフォーマーが特定のデノイジング問題を最適に解決できることを示す。訓練された注意層は、コンテキストトークンを連想記憶として利用し、デノイジングプロンプトを一回の勾配降下更新で処理。これにより、DAMネットワークの新たな拡張例を提供し、連想記憶と注意メカニズムの関連性を強化する。 Comment
元ポスト:
[Paper Note] ExPLoRA: Parameter-Efficient Extended Pre-Training to Adapt Vision Transformers under Domain Shifts, Samar Khanna+, ICML'25
Paper/Blog Link My Issue
#ComputerVision #Pretraining #PEFT(Adaptor/LoRA) #ICML #Finetuning #KeyPoint Notes Issue Date: 2025-07-14 GPT Summary- PEFT技術を用いたExPLoRAは、事前学習済みビジョントランスフォーマー(ViT)を新しいドメインに適応させる手法で、教師なし事前学習を通じて効率的にファインチューニングを行う。実験では、衛星画像において最先端の結果を達成し、従来のアプローチよりも少ないパラメータで精度を最大8%向上させた。 Comment
元ポスト:
これまでドメイン適応する場合にラベル付きデータ+LoRAでFinetuningしていたのを、ラベル無しデータ+継続事前学習の枠組みでやりましょう、という話のようである。
手法は下記で、事前学習済みのモデルに対してLoRAを適用し継続事前学習する。ただし、最後尾のLayer、あるいは最初と最後尾のLayerの両方をunfreezeして、trainableにする。また、LoRAはfreezeしたLayerのQ,Vに適用し、それらのLayerのnormalization layerもunfreezeする。最終的に、継続事前学習したモデルにヘッドをconcatしてfinetuningすることで目的のタスクを実行できるようにする。詳細はAlgorithm1を参照のこと。
同じモデルで単にLoRAを適用しただけの手法や、既存手法をoutperform
画像+ViT系のモデルだけで実験されているように見えるが、LLMとかにも応用可能だと思われる。
[Paper Note] Nonlinear transformers can perform inference-time feature learning, Nishikawa+, ICML'25
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #In-ContextLearning #ICML Issue Date: 2025-07-13 GPT Summary- 事前学習されたトランスフォーマーは、推論時に特徴を学習する能力を持ち、特に単一インデックスモデルにおける文脈内学習に焦点を当てています。勾配ベースの最適化により、異なるプロンプトからターゲット特徴を抽出し、非適応的アルゴリズムを上回る統計的効率を示します。また、推論時のサンプル複雑性が相関統計クエリの下限を超えることも確認されました。 Comment
元ポスト:
[Paper Note] Energy-Based Transformers are Scalable Learners and Thinkers, Alexi Gladstone+, arXiv'25, 2025.07
Paper/Blog Link My Issue
#ComputerVision #MachineLearning #NLP #LanguageModel #MultiModal #Architecture #VideoGeneration/Understandings #VisionLanguageModel #Energy-based #Author Thread-Post Issue Date: 2025-07-06 GPT Summary- 入力と候補予測の適合性を検証するEnergy-Based Transformer(EBT)を訓練し、エネルギー最小化によって推論を行う。離散的なテキストと連続的な視覚の両方に対応し、教師なし学習のみでシステム2思考を実現。訓練時のスケーリングと推論時の性能で既存モデルを上回り、下流タスクでも優れた一般化能力を示した。 Comment
元ポスト:
Project Page: https://energy-based-transformers.github.io
First Authorの方による解説ポスト:
[Paper Note] Listwise Preference Alignment Optimization for Tail Item Recommendation, Zihao Li+, arXiv'25, 2025.07
Paper/Blog Link My Issue
#RecommenderSystems #ListWise #Alignment #SequentialRecommendation #Initial Impression Notes Issue Date: 2025-07-04 GPT Summary- LPO4Recは、テールアイテム推薦におけるPreference alignmentの課題を解決するために提案された手法で、Bradley-Terryモデルをペアワイズからリストワイズ比較に拡張し、効率的なトレーニングを実現。明示的な報酬モデリングなしで、テールアイテムを優先する負のサンプリング戦略を導入し、パフォーマンスを最大50%向上させ、GPUメモリ使用量を17.9%削減。実験結果は3つの公開データセットで示されている。 Comment
元ポスト:
tail itemに強い手法らしい。LLMを用いたGenerative Recommendationではなく、1 BlockのTransformerにlistwiseなpreferenceを反映したlossを適用したものっぽい。
一貫して性能は高そうに見えるが、再現性はどうだろうか。
関連(SASRec):
- [Paper Note] Self-Attentive Sequential Recommendation, Wang-Cheng Kang+, ICDM'18
pointwise, pairwise, listwiseの基礎はこちらを参照:
- ランキング学習ことはじめ, DSIRNLP#1, 2011.07
[Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #NeurIPS #Normalization #Selected Papers/Blogs #One-Line Notes #CurseOfDepth Issue Date: 2025-07-03 GPT Summary- 「深さの呪い」を提案し、現代のLLMにおける多くの層が期待通りに機能しない原因を探る。特にPre-Layer Normalizationが出力分散を増大させ、深層ブロックの寄与を低下させることを明らかにする。層正規化の出力分散を深さの平方根の逆数で調整する「LayerNorm Scaling」を導入し、これにより深い層の寄与を改善。実験で130M〜7Bモデルサイズで従来の手法を上回る性能向上を示し、教師ありファインチューニングにも良好な効果を発揮することを確認。 Comment
元ポスト:
- [Paper Note] Transformers without Normalization, Jiachen Zhu+, CVPR'25
ではそもそもLayerNormalizationを無くしていた(正確にいうとparametrize tanhに置換)が、どちらが優れているのだろうか?
- Knowledge Neurons in Pretrained Transformers, Damai Dai+, N/A, ACL'22, 2022.05
では知識ニューロンの存在が示唆されており、これはTransformerの層の深い位置に存在し、かつ異なる知識間で知識ニューロンはシェアされない傾向にあった(ただしこれはPost-LNのBERTの話で本研究はPre-LNの話だが。Post-LNの勾配消失問題を緩和し学習を安定化させる研究も[Paper Note] On Layer Normalizations and Residual Connections in Transformers, Sho Takase+, arXiv'22
のように存在する)。これはこの研究が明らかにしたこととどういう関係性があるだろうか。
また、LayerNormalizationのScalingによって深いTransformerブロックの導関数が単位行列となる(学習に寄与しなくなる)ことが改善された場合、知識ニューロンはどのように変化するだろうか?
(下記Geminiの応答を見た上での感想)なんとなーくだけれども、おそらく知識ニューロンの局所化が解消されるのかなーという気がする。
となると次の疑問としては、MoEアーキテクチャにはどのような影響があるだろうか?
そもそも知識ニューロンが局所化しているからMoEアーキテクチャのルータによって関連するExpertsのみをactivateすれば(というより結果的にそうなるように学習される)性能を劣化させずに計算効率を上げられていた、と仮定する。そうすると、知識ニューロンが局所化せずに多くのニューロンでシェアされるようになると、[Paper Note] Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models, Zihan Wang+, arXiv'25, 2025.06
のように、サブネットワーク間の情報を互いにやりとりできます、みたいな仕組みがより効いてきそうな気がする。
参考までに、Gemini2.5-Proに考察させてみた結果をメモとして残しておく(あくまで参考程度に...)
```
ご質問ありがとうございます。非常に興味深い着眼点ですね。「Knowledge Neurons in Pretrained Transformers」と「The Curse of Depth in Large Language Models」は、一見すると全く異なるテーマを扱っているように見えますが、**「Transformerの深い層における振る舞い」**という共通点で結びつけて考察すると、非常に示唆に富んだ関係性が見えてきます。
以下に、両方の論文の概要を解説し、その関係性について考察します。
1. Knowledge Neurons in Pretrained Transformers の概要
この研究は、事前学習済みTransformerモデル(特にBERTなど)の内部で、特定の事実知識がどのように格納されているかを調査したものです。
発見: モデルの中間層、特に**全結合層(Feed-Forward Network, FFN)に、特定の知識(例:「ダンテ・アリギエーリはイタリアで生まれた」)に強く反応する「知識ニューロン」**が存在することを発見しました。
特徴: これらの知識ニューロンは、モデルの深い層(後方の層)に、より多く存在する傾向がありました。
意味: これまでブラックボックスとされてきた大規模言語モデルの内部で、知識がどのように表現・局在化しているかについて、具体的な手がかりを与えた画期的な研究です。
2. The Curse of Depth in Large Language Models の概要
この研究は、LLMをより深く(層を多く)することの難しさに焦点を当て、その原因と解決策を提案したものです。
問題(深さの呪い): Transformerの標準的なアーキテクチャ(Pre-LN)では、層が深くなるにつれて、LayerNormalization(LN)への入力の分散が指数関数的に増大してしまいます。
結果:
出力が大きくなりすぎて学習が不安定になります。
さらに深刻なのは、深い層ではモデルの出力に関する導関数(勾配計算に必要)がほぼ単位行列になってしまうことです。これは、その層が入力に対してほとんど変換を行わなくなり、学習に寄与しなくなることを意味します。
解決策: この問題を解決するため、各層のLayerNormalizationをその深さ(レイヤー番号 l)に応じてスケーリングするというシンプルな手法を提案しました。これにより、深い層でも勾配が適切に伝播し、学習が安定・改善することが示されました。
考察:2つの研究の関係性
これら2つの研究は、**「学習の安定性」と「知識の格納方法」**という異なる側面から、Transformerの深い層を分析していますが、両者には以下のような深い関係性があると考えられます。
学習の不安定性が「知識ニューロン」形成の背景にある可能性
「The Curse of Depth」で指摘されているように、標準的なTransformerの深い層は、本質的に学習が不安定で、勾配情報が失われやすい環境にあります。
この劣悪な学習環境こそが、「知識ニューロン」という形で知識が局所的に格納される原因の一つになっている可能性があります。つまり、
学習の非効率性: 深い層のほとんどのニューロンは、勾配消失問題のために効率的に学習を進めることができません。
専門化の発生: そのような不安定な環境下で、たまたま特定の知識パターンをうまく捉えることができた一部のニューロンが、その知識を一身に背負う形で強く活性化するよう特化(専門化)していったのではないか、と考えられます。これは、ネットワーク全体で協調して学習するのが難しい状況で、一部のユニットだけが突出して学習を担う、という現象と解釈できます。
学習の安定化が、より効率的な知識獲得につながる
では、「The Curse of Depth」で提案された手法(LNのスケーリング)によって深い層の学習が安定化すると、知識の格納方法はどのように変わるでしょうか。
これは非常に興味深い問いであり、2つの可能性が考えられます。
可能性A: より強固な知識ニューロンの形成:
学習が安定することで、各知識ニューロンはより明確に、そして効率的に特定の知識をエンコードできるようになるかもしれません。ノイズの多い環境で偶然生まれた専門家ではなく、安定した環境で育成された真の専門家へと変化するイメージです。
可能性B: 知識の分散化:
ネットワークの全ニューロンが効率的に学習に寄与できるようになるため、一つの知識を少数のニューロンに集中させる必要がなくなり、より多くのニューロンに分散して知識が格納されるようになる可能性も考えられます。
現在のところ、学習の安定化は、知識ニューロンがより効率的に形成・機能するための基盤を提供すると考えるのが最も妥当でしょう。「深さの呪い」という問題を解決することは、モデルが知識をどのように獲得し、整理するかという、より根源的なメカニズム(知識ニューロンの振る舞い)にも直接的な影響を与えるはずです。
まとめ
「Knowledge Neurons」は深い層に存在する知識の**「状態」を明らかにし、「The Curse of Depth」は深い層で発生する学習の「問題」**とその解決策を提示しました。
これらを統合すると、**「深い層における学習の不安定性という問題が、知識ニューロンという局所的な知識表現を生み出す一因となっており、この問題を解決することで、より効率的で安定した知識の獲得・格納が可能になるかもしれない」**という関係性が見えてきます。
両者は、LLMの能力と限界を異なる角度から照らし出しており、組み合わせることでモデルの内部動作の解明をさらに一歩前進させる、非常に重要な研究だと言えます。
```
[Paper Note] AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences, Minoru Kishi+, arXiv'25
Paper/Blog Link My Issue
#Metrics #Evaluation #SpeechProcessing #Initial Impression Notes Issue Date: 2025-07-02 GPT Summary- 新しい客観的評価指標AudioBERTScoreを提案し、合成音声の性能向上を目指す。従来の客観的指標は主観的評価との相関が弱いため、AudioBERTScoreは合成音声と参照音声の埋め込みの類似性を計算し、主観的評価との相関が高いことを実験で示した。 Comment
元ポスト:
text-to-audioの自動評価が可能な模様
[Paper Note] GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling, Tianhao Chen+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture Issue Date: 2025-06-30 GPT Summary- Pre-LN Transformerでは、層をまたいだ活性化分散の増大により残差接続のショートカットが支配的になる問題がある。 GPASにより、中間活性化を縮小しつつ勾配を保持することで、情報を維持したまま勾配消失を防ぐ。 71M〜1B規模の実験で一貫した性能向上を達成し、Pre-LNだけでなくSandwich-LNやDeepNormにも有効。 Comment
元ポスト:
[Paper Note] Vamba: Understanding Hour-Long Videos with Hybrid Mamba-Transformers, Weiming Ren+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #LongContext #SSM (StateSpaceModel) #VideoGeneration/Understandings #ICCV Issue Date: 2025-06-26 GPT Summary- VAMBAモデルは、Mamba-2ブロックを用いてビデオトークンを線形にエンコードし、トークン削減なしで1024フレームを処理可能。これにより、GPUメモリ使用量を50%削減し、トレーニング速度を倍増。1時間のビデオ理解ベンチマークLVBenchで4.3%の精度向上を達成し、様々なビデオ理解タスクで優れた性能を示す。 Comment
元ポスト:
[Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
Paper/Blog Link My Issue
#ComputerVision #CVPR #read-later #Selected Papers/Blogs #3D Reconstruction #Backbone #Reference Collection Issue Date: 2025-06-22 GPT Summary- VGGTは、シーンの主要な3D属性を複数のビューから直接推測するフィードフォワードニューラルネットワークであり、3Dコンピュータビジョンの分野において新たな進展を示します。このアプローチは効率的で、1秒未満で画像を再構築し、複数の3Dタスクで最先端の結果を達成します。また、VGGTを特徴バックボーンとして使用することで、下流タスクの性能が大幅に向上することが示されています。コードは公開されています。 Comment
元ポスト:
様々な研究のBackboneとして活用されている。
[Paper Note] Seedance 1.0: Exploring the Boundaries of Video Generation Models, Yu Gao+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #VideoGeneration/Understandings Issue Date: 2025-06-13 GPT Summary- Seedance 1.0は、動画生成の基盤モデルであり、プロンプト遵守、動きの妥当性、視覚的品質を同時に向上させることを目指しています。主な技術改善として、意味のある動画キャプションを用いたデータキュレーション、マルチショット生成のサポート、動画特有のRLHFを活用したファインチューニング、推論速度の約10倍向上を実現する蒸留戦略が挙げられます。Seedance 1.0は、1080p解像度の5秒間の動画を41.4秒で生成し、高品質かつ迅速な動画生成を実現しています。 Comment
元ポスト:
[Paper Note] Value Residual Learning, Zhanchao Zhou+, ACL'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ACL #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2025-06-12 GPT Summary- ResFormerは、隠れ状態の残差に値の残差接続を加えることで情報の流れを強化する新しいTransformerアーキテクチャを提案。実験により、ResFormerは従来のTransformerに比べて少ないパラメータとトレーニングデータで同等の性能を示し、SVFormerはKVキャッシュサイズを半減させることができる。性能はシーケンスの長さや学習率に依存する。 Comment
元ポスト:
なぜValue Residual Learningがうまくいくかの直感的説明:
ざっくり言うと、LayerNormよって初期layerの影響は深くなればなるほど小さくなり、情報が損なわれていってしまうため、ValueをQKに応じて情報を運んでくる要素と捉えると、検索やコピーなどの明確なinputに関する情報が欲しい場合に、すべてのlayerから初期のValueにアクセスできるvalue residual connectionが有用となる、といった話と理解した。Valueにのみフォーカスしているが、QKの場合はどうなのかといった要素はまだ未開拓な分野とのこと。
Wide&Deepみたいな話になってきた:
- [Paper Note] Wide & Deep Learning for Recommender Systems, Heng-Tze Cheng+, DLRS'16, 2016.06
Value Residual Learningを用いたアーキテクチャが現在nanoGPT Speedrunでトップになった。
- Modded-NanoGPT, KellerJordan, 2024.05
現在のlayerのValueと初期レイヤーのValueを線形補完する重みをtrainableにするとさらに性能が改善することも言及されている。
所見:
[Paper Note] Learning Compositional Functions with Transformers from Easy-to-Hard Data, Zixuan Wang+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #PostTraining #Selected Papers/Blogs #COLT #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2025-06-01 GPT Summary- Transformerベースの言語モデルの学習可能性を、k-fold 合成タスクにおいて検討。具体的には、k 個の入力置換と隠れた置換の交互合成を倍の効率で実行可能とし、統計的クエリ下界も証明。さらに、O(log k) 層のトランスフォーマーで勾配降下による効率的な学習が可能であることを示した。データの提示方法によって、容易な例と難しい例が存在することが重要であるとの知見を得た。 Comment
元ポスト:
こちらはまず元ポストのスレッドを読むのが良いと思われる。要点をわかりやすく説明してくださっている。
元ポストとalphaxivでざっくり理解したところ、
Transformerがcontextとして与えられた情報(σ)とparametric knowledge(π)をk回の知識マッピングが必要なタスク(k-fold composition task)を学習するにはO(log k)のlayer数が必要で、直接的にk回の知識マッピングが必要なタスクを学習するためにはkの指数オーダーのデータ量が最低限必要となることが示された。これはkが大きくなると(すなわち、複雑なreasoning stepが必要なタスク)になると非現実的なものとなるため、何らかの方法で緩和したい。学習データを簡単なものから難しいものをmixingすること(カリキュラム学習)ことで、この条件が緩和され、指数オーダーから多項式オーダーのデータ量で学習できることが示された
といった感じだと思われる。
じゃあ最新の32Bモデルよりも、よりパラメータ数が大きくてlayer数が多い古いモデルの方が複雑なreasoningが必要なタスクを実は解けるってこと!?直感に反する!と一瞬思ったが、おそらく最近のモデルでは昔のモデルと比べてparametric knowledgeがより高密度に適切に圧縮されるようになっていると思われるので、昔のモデルではk回の知識マッピングをしないと解けないタスクが、最新のモデルではk-n回のマッピングで解けるようになっていると推察され、パラメータサイズが小さくても問題なく解けます、みたいなことが起こっているのだろう、という感想を抱くなどした
[Paper Note] Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures, Chenggang Zhao+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LLMServing #Architecture #MoE(Mixture-of-Experts) #SoftwareEngineering Issue Date: 2025-05-20 GPT Summary- LLMのスケーリングは、メモリ、計算効率、帯域幅における制約を明らかにした。DeepSeek-V3は、ハードウェアを意識したモデル設計でこれらの課題に対処し、効率的なトレーニングと推論を実現。特に、メモリ効率を向上させるMLA、計算と通信を最適化するMoE、FP8混合精度トレーニング、ネットワークオーバーヘッドを減少させるマルチプレーン・トポロジーが革新のポイント。将来のハードウェア設計に向けた広範な議論を通じて、AIの需要に応えるためのモデル共設計の重要性を強調。 Comment
元ポスト:
[Paper Note] RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval, Kaiyue Wen+, ICLR'25
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #In-ContextLearning #SSM (StateSpaceModel) #ICLR Issue Date: 2025-04-26 GPT Summary- 本論文では、RNNとトランスフォーマーの表現力の違いを調査し、特にRNNがChain-of-Thought(CoT)プロンプトを用いてトランスフォーマーに匹敵するかを分析。結果、CoTはRNNを改善するが、トランスフォーマーとのギャップを埋めるには不十分であることが判明。RNNの情報取得能力の限界がボトルネックであるが、Retrieval-Augmented Generation(RAG)やトランスフォーマー層の追加により、RNNはCoTを用いて多項式時間で解決可能な問題を解決できることが示された。 Comment
元ポスト:
関連:
- Transformers are Multi-State RNNs, Matanel Oren+, N/A, EMNLP'24
↑とはどういう関係があるだろうか?
[Paper Note] AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One, Mike Ranzinger+, CVPR'25
Paper/Blog Link My Issue
#ComputerVision #FoundationModel #OpenWeight #CVPR #One-Line Notes #Author Thread-Post Issue Date: 2025-04-11 GPT Summary- 視覚基盤モデル(VFM)をマルチティーチャー蒸留を通じて統合するアプローチAM-RADIOを提案。これにより、ゼロショットの視覚-言語理解やピクセルレベルの理解を向上させ、個々のモデルの性能を超える。新しいアーキテクチャE-RADIOは、ティーチャーモデルよりも少なくとも7倍速い。包括的なベンチマークで様々な下流タスクを評価。 Comment
元ポスト:
vision系のfoundation modelはそれぞれ異なる目的関数で訓練されてきており(CLIPは対照学習 Learning Transferable Visual Models From Natural Language Supervision, Radford+, OpenAI, ICML'21
, DINOv2は自己教師あり学習 [Paper Note] DINOv2: Learning Robust Visual Features without Supervision, Maxime Oquab+, TMLR'24
, SAMはsegmentation [Paper Note] Segment Anything, Alexander Kirillov+, arXiv'23, 2023.04
)それぞれ別の能力を持ってたが、それらを一個のモデルに蒸留しました、という話らしい
lossの文脈でいうと、SigLIPも広義の対照学習の一種である。
- [Paper Note] Sigmoid Loss for Language Image Pre-Training, Xiaohua Zhai+, ICCV'23
[Paper Note] Scalable-Softmax Is Superior for Attention, Ken M. Nakanishi, arXiv'25, 2025.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LongContext #Architecture #Reference Collection Issue Date: 2025-04-06 GPT Summary- SSMaxを提案し、Softmaxの代替としてTransformerモデルに統合。これにより、長いコンテキストでの重要情報の取得が向上し、事前学習中の損失減少が速くなる。SSMaxは注意スコアを改善し、長さの一般化を促進する。 Comment
- Llama 4 Series, Meta, 2025.04
で採用されている手法で、ブログポスト中で引用されている。Long Contextになった場合にsoftmaxの分布が均一になる(=重要な情報にattendする能力が削がれる)ことを防ぐための手法を提案している。
解説ポスト:
[Paper Note] Multi-Token Attention, Olga Golovneva+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #COLM #One-Line Notes #Author Thread-Post Issue Date: 2025-04-02 GPT Summary- 新しいアテンション手法であるMulti-Token Attention(MTA)を提案し、複数のクエリとキーのベクトルを同時に用いることで、より精密な関連部分の特定を可能にします。畳み込み処理を適用することで、近接するトークンの相互作用を強化し、豊かでニュアンスのある情報の利用を実現。広範な評価により、MTAが標準的な言語モデルタスクにおいてTransformerを超える性能を発揮することを示しました。 Comment
元ポスト:
従来のMulti Head Attentionでは、単体のQKのみを利用していたけど、複数のQKの情報を畳み込んで活用できるようにして、Headも畳み込みで重要な情報がより伝搬されるようにして、GroupNormalizationをかけたらPerplexityの観点でDifferential Transformerを上回ったよ、という話な模様。
- [Paper Note] Group Normalization, Yuxin Wu+, arXiv'18, 2018.03
- [Paper Note] Differential Transformer, Tianzhu Ye+, N/A, ICLR'25
openreview: https://openreview.net/forum?id=Z3L35tQTEg
[Paper Note] NeoBERT: A Next-Generation BERT, Lola Le Breton+, arXiv'25, 2025.02
Paper/Blog Link My Issue
#Embeddings #NLP #Architecture #Encoder #Reading Reflections Issue Date: 2025-03-15 GPT Summary- NeoBERTは、最新のアーキテクチャとデータを統合した次世代エンコーダで、双方向モデルの能力を再定義します。4,096トークンのコンテキスト長を活用し、250Mパラメータでありながら、MTEBベンチマークで最先端の結果を達成し、BERTやRoBERTaを上回ります。すべてのコードやデータを公開し、研究と実世界での採用を促進します。 Comment
## BERT, ModernBERTとの違い

## 性能

## 所感
medium size未満のモデルの中ではSoTAではあるが、ModernBERTが利用できるのであれば、ベンチマークを見る限りは実用的にはModernBERTで良いのでは、と感じた。学習とinferenceの速度差はどの程度あるのだろうか?
[Paper Note] Transformers without Normalization, Jiachen Zhu+, CVPR'25
Paper/Blog Link My Issue
#EfficiencyImprovement #MachineLearning #NLP #Architecture #CVPR #Normalization #One-Line Notes #Author Thread-Post Issue Date: 2025-03-14 GPT Summary- 本研究では、正規化層なしのトランスフォーマーがDynamic Tanh(DyT)を用いることで、同等またはそれ以上のパフォーマンスを達成できることを示します。DyTは、レイヤー正規化の代替として機能し、ハイパーパラメータの調整なしで効果を発揮します。多様な設定での実験により、正規化層の必要性に対する新たな洞察を提供します。 Comment
なん…だと…。LayerNormalizationを下記アルゴリズムのようなtanhを用いた超絶シンプルなレイヤー(parameterized thnh [Lecun氏ポスト](
同等以上の性能を維持しながらモデル全体のinference, trainingの時間を8%程度削減。
[Paper Note] Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models, Weixin Liang+, TMLR'25
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #LanguageModel #MultiModal #SpeechProcessing #Architecture #TMLR #UMM Issue Date: 2024-11-12 GPT Summary- 大規模言語モデル(LLMs)のマルチモーダル処理を効率化するために、Mixture-of-Transformers(MoT)を提案。MoTは計算コストを削減し、モダリティごとにパラメータを分離して特化した処理を実現。Chameleon 7B設定では、55.8%のFLOPsで密なベースラインに匹敵する性能を示し、音声を含む場合も37.2%のFLOPsで同様の結果を達成。さらに、Transfusion設定では、7BのMoTモデルが密なベースラインの画像性能に対してFLOPsの3分の1で匹敵し、760Mのモデルは主要な画像生成指標で上回る結果を得た。MoTは実用的な利点も示し、画像品質を47.2%、テキスト品質を75.6%の経過時間で達成。
[Paper Note] Differential Transformer, Tianzhu Ye+, N_A, ICLR'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ICLR #Selected Papers/Blogs #In-Depth Notes Issue Date: 2024-10-21 GPT Summary- Diff Transformerは、関連するコンテキストへの注意を強化し、ノイズをキャンセルする新しいアーキテクチャです。差分注意メカニズムを用いて、注意スコアを計算し、スパースな注意パターンを促進します。実験結果は、Diff Transformerが従来のTransformerを上回り、長いコンテキストモデリングや幻覚の軽減において顕著な利点を示しています。また、文脈内学習においても精度を向上させ、堅牢性を高めることが確認されました。これにより、Diff Transformerは大規模言語モデルの進展に寄与する有望なアーキテクチャとされています。 Comment
# 概要
attention scoreのノイズを低減するようなアーキテクチャとして、二つのQKVを用意し、両者の差分を取ることで最終的なattentiok scoreを計算するDifferential Attentionを提案した。
attentionのnoiseの例。answerと比較してirrelevantなcontextにattention scoreが高いスコアが割り当てられてしまう(図左)。differential transformerが提案するdifferential attentionでは、ノイズを提言し、重要なcontextのattention scoreが高くなるようになる(図中央)、らしい。
# Differential Attentionの概要
二つのQKをどの程度の強さで交互作用させるかをλで制御し、λもそれぞれのQKから導出する。数式は2.1節に記述されているのでそちらも参照のこと。
QA, 機械翻訳, 文書分類, テキスト生成などの様々なNLPタスクが含まれるEval Harnessベンチマークでは、同規模のtransformerモデルを大幅にoutperform。ただし、3Bでしか実験していないようなので、より大きなモデルサイズになったときにgainがあるかは示されていない点には注意。
モデルサイズ(パラメータ数)と、学習トークン数のスケーラビリティについても調査した結果、LLaMAと比較して、より少ないパラメータ数/学習トークン数で同等のlossを達成。
64Kにcontext sgzeを拡張し、1.5B tokenで3Bモデルを追加学習をしたところ、これもtransformerと比べてより小さいlossを達成
context中に埋め込まれた重要な情報(今回はクエリに対応するmagic number)を抽出するタスク(Needle-In-A-Haystack test)の性能も向上。Needle(N)と呼ばれる正解のmagic numberが含まれる文をcontext中の様々な深さに配置し、同時にdistractorとなる文もランダムに配置する。これに対してクエリ(R)が入力されたときに、どれだけ正しい情報をcontextから抽出できるか、という話だと思われる。
これも性能が向上。特にクエリとNeedleが複数の要素で構成されていれ場合の性能が高く(Table2)、長いコンテキスト中の様々な位置に埋め込まれたNeedleを抽出する性能も高い(Figure5)
Many shotのICL能力も、異なる数のクラス分類を実施する4つのDatasetにおいて向上。クラス数が増えるに従ってAcc.のgainは小さくなっているように見える({6, 50} class > 70 class > 150 class)が、それでもAcc.が大きく向上している。
要約タスクでのhallucinationも低減。生成された要約と正解要約を入力し、GPT-4oにhallucinationの有無を判定させて評価(このようなLLM-as-a-Judgeの枠組みは先行研究 (MT-Bench) で人手での評価と高いagreementがあることが示されている)
関連 (MT-Bench):
- [Paper Note] Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, Lianmin Zheng+, NeurIPS'23, 2023.06
シンプルなアプローチでLLM全体の性能を底上げしている素晴らしい成果に見える。斜め読みなので読み飛ばしているかもしれないが、
- [Paper Note] Textbooks Are All You Need, Suriya Gunasekar+, arXiv'23, 2023.06
のように高品質な学習データで学習した場合も同様の効果が発現するのだろうか?
attentionのスコアがnoisyということは、学習データを洗練させることでも改善される可能性があり、[Paper Note] Textbooks Are All You Need, Suriya Gunasekar+, arXiv'23, 2023.06
はこれをデータで改善し、こちらの研究はモデルのアーキテクチャで改善した、みたいな捉え方もできるのかもしれない。
ちなみにFlash Attentionとしての実装方法も提案されており、スループットは通常のattentionと比べてむしろ向上している (Appendix A参照のこと) ので実用的な手法でもある。すごい。
あとこれ、事前学習とInstruction Tuningを通常のマルチヘッドアテンションで学習されたモデルに対して、独自データでSFTするときに導入したらdownstream taskの性能向上するんだろうか。もしそうなら素晴らしい
OpenReview: https://openreview.net/forum?id=OvoCm1gGhN
GroupNormalizationについてはこちら:
- [Paper Note] Group Normalization, Yuxin Wu+, arXiv'18, 2018.03
[Paper Note] nGPT: Normalized Transformer with Representation Learning on the Hypersphere, Ilya Loshchilov+, ICLR'25, 2024.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ICLR #Normalization #Selected Papers/Blogs Issue Date: 2024-10-21 GPT Summary- ハイパースフィア上での表現学習に基づく新しいニューラルネットワークアーキテクチャ、正規化トランスフォーマー(nGPT)を提案。全てのベクトルが単位ノルムで正規化され、入力トークンがハイパースフィア上を移動し、各レイヤーで変位を加える。nGPTは学習が速く進行し、同精度を達成するためのトレーニングステップ数を4〜20倍削減することが実験で示された。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=se4vjm7h4E
[Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
Paper/Blog Link My Issue
#SpeechProcessing #Speech #Tokenizer #audio #Initial Impression Notes Issue Date: 2026-07-16 GPT Summary- 新しい音声表現dmelを導入し、従来の音声トークン化手法に比べてシンプルで効果的な音声データ処理を実現。dmelは音声内容の保持に優れ、分野外データにも頑健。高次元トークンを効率的に並列エンコード・デコードするためにトランスフォーマーアーキテクチャを使用し、音声合成と認識の両方で高性能を達成するモデルRichTTSとRichASRを開発。音声とテキストの共同モデリングへの新たな道を示す結果を得た。 Comment
openreview: https://openreview.net/forum?id=BomQa84efw
Inkilingのaudio signalのtokenizationに用いられているdMel spectrogramsと呼ばれる手法が提案されている
[Paper Note] Gated Linear Attention Transformers with Hardware-Efficient Training, Songlin Yang+, ICML'24, 2023.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #ICML #Selected Papers/Blogs #LinearAttention Issue Date: 2026-02-04 GPT Summary- 線形アテンションを持つトランスフォーマーは、効率的な並列トレーニングを実現する一方、通常のソフトマックスアテンションに比べて性能が劣る。提案するFLASHLINEARATTENTIONは、メモリ移動と並列化のトレードオフを考慮し、短いシーケンスで高速な実装を実現。また、データ依存ゲートを追加したゲート付き線形アテンション(GLA)トランスフォーマーは、LLaMAやRetNet、Mambaと比較して競争力のある性能を示し、長さの一般化でも有効。GLAトランスフォーマーは、同サイズのMambaモデルよりも高いトレーニングスループットを持つ。
[Paper Note] Scaling Exponents Across Parameterizations and Optimizers, Katie Everett+, ICML'24
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #Optimizer #ICML #read-later #HyperparameterTransfer #LearningRate Issue Date: 2025-08-31 GPT Summary- モデルのスケーリングには、パラメータ化やオプティマイザの選択が重要である。本研究では、パラメータとデータの整合性に関する新しい視点を提案し、広範なオプティマイザと学習率の組み合わせで数万のモデルを訓練した結果、最適な学習率スケーリングが重要であることを発見。新しい層ごとの学習率の処方は従来の方法を上回る性能を示し、Adamのイプシロンパラメータの適切なスケーリングが必要であることを明らかにし、数値的に安定した新しいAdamバージョンであるAdam-atan2を提案した。
[Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
Paper/Blog Link My Issue
#MachineLearning #Architecture #Selected Papers/Blogs #LatentReasoning #RecurrentModels Issue Date: 2025-08-30 GPT Summary- ループ型transformerアーキテクチャを提案し、従来のtransformerに反復的特性を組み込むことで、データフィッティング問題を解決。実験により、標準のtransformerと同等の性能を保ちながら、パラメータ数を10%未満に抑えることができることが示された。 Comment
openreview: https://openreview.net/forum?id=HHbRxoDTxE
[Paper Note] Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models, Zhijian Zhuo+, arXiv'24
Paper/Blog Link My Issue
#NeuralNetwork #NLP #ActivationFunction Issue Date: 2025-08-25 GPT Summary- 新しい多項式合成活性化関数(PolyCom)を提案し、トランスフォーマーのダイナミクスを最適化。PolyComは他の活性化関数よりも高い表現力を持ち、最適近似率を達成。大規模言語モデルにおいて、従来の活性化関数をPolyComに置き換えることで、精度と収束率が向上することを実証。実験結果は他の活性化関数に対して大幅な改善を示す。コードは公開中。 Comment
関連:
- [Paper Note] GLU Variants Improve Transformer, Noam Shazeer, arXiv'20, 2020.02
[Paper Note] DINOv2: Learning Robust Visual Features without Supervision, Maxime Oquab+, TMLR'24
Paper/Blog Link My Issue
#ComputerVision #FoundationModel #Self-SupervisedLearning #TMLR Issue Date: 2025-04-11 GPT Summary- 自己教師あり手法を用いて、多様なキュレーションデータから汎用的な視覚特徴を生成する新しい事前学習手法を提案。1BパラメータのViTモデルを訓練し、小型モデルに蒸留することで、OpenCLIPを上回る性能を達成。
[Paper Note] Flex Attention: A Programming Model for Generating Optimized Attention Kernels, Juechu Dong+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#NLP #Attention #SoftwareEngineering #KeyPoint Notes #Reference Collection Issue Date: 2025-04-06 GPT Summary- FlexAttentionは、アテンションの新しいコンパイラ駆動型プログラミングモデルで、数行のPyTorchコードで多くのアテンションバリアントを実装可能にします。これにより、既存のアテンションバリアントを効率的に実装し、競争力のあるパフォーマンスを達成。FlexAttentionは、アテンションバリアントの組み合わせを容易にし、組み合わせ爆発の問題を解決します。 Comment
- Llama 4 Series, Meta, 2025.04
で利用されているAttention
pytochによる解説:
https://pytorch.org/blog/flexattention/
- Flex AttentionはオリジナルのAttentionのQK/sqrt(d_k)の計算後にユーザが定義した関数score_modを適用する
- score_modを定義することで、attention scoreをsoftmaxをかけるまえに関数によって調整できる
- 多くのattentionの亜種はほとんどの場合この抽象化で対応できる
- score_modはQK tokenの内積に対応するので、QKの情報を受け取り、スカラー値を返せばなんでも良い
- score_modの実装例は元リンク参照
- FA2と比較して(現在のpytorchでの実装上は)Forward Passは90%, Backward Passは85%のスループットで、少し遅いが今後改善予定
元論文より引用。非常にシンプルで、数式上は下記のように表される:
[Paper Note] Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference, Benjamin Warner+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Library #pretrained-LM #ACL #Selected Papers/Blogs #One-Line Notes #Reading Reflections Issue Date: 2024-12-20 GPT Summary- ModernBERTはエンコーダーのみのトランスフォーマーモデルで、BERTに対する大きなパレート改善を達成。2兆トークンで訓練され、長いシーケンスに対応しながら、分類タスクと検索において最先端の性能を示す。さらに、最も高速かつメモリ効率の良いエンコーダーとして設計されている。 Comment
最近の進化しまくったTransformer関連のアーキテクチャをEncodnr-OnlyモデルであるBERTに取り込んだら性能上がるし、BERTの方がコスパが良いタスクはたくさんあるよ、系の話、かつその実装だと思われる。
テクニカルペーパー中に記載はないが、評価データと同じタスクでのDecoder-Onlyモデル(SFT有り無し両方)との性能を比較したらどの程度の性能なのだろうか?
そもそも学習データが手元にあって、BERTをFinetuningするだけで十分な性能が出るのなら(BERTはGPU使うのでそもそもxgboostとかでも良いが)、わざわざLLM使う必要ないと思われる。BERTのFinetuningはそこまで時間はかからないし、inferenceも速い。
参考:
- [Paper Note] Prompt2Model: Generating Deployable Models from Natural Language Instructions, Vijay Viswanathan+, arXiv'23, 2023.08
日本語解説: https://zenn.dev/dev_commune/articles/3f5ab431abdea1?utm_source=substack&utm_medium=email
[Paper Note] Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction, Keyu Tian+, NeurIPS'24
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NeurIPS #KeyPoint Notes Issue Date: 2024-12-12 GPT Summary- Visual AutoRegressive modeling (VAR)を提案し、画像生成において自己回帰学習を次のスケール予測として再定義。VARは、GPTのようなARモデルが拡散トランスフォーマーを上回ることを実現し、ImageNet 256x256ベンチマークでFIDを18.65から1.73、ISを80.4から350.2に改善。推論速度は約20倍向上し、画像品質やデータ効率でも優れた性能を示す。VARはゼロショット一般化能力を持ち、スケーリング法則を示す。全モデルとコードを公開し、視覚生成の研究を促進。 Comment
NeurIPS2024のベストペーパー
OpenReview: https://openreview.net/forum?id=gojL67CfS8
Next Token Prediction, Next Image Token Generation (従来手法), Next Scale (resolution) prediction (提案手法)の違いの図解。非常に分かりやすい。next token predictionでは次トークンのみを予測するがVARでは、次の解像度画像の全体のトークンマップを予測する。
学習方法の概要。2-Stageで学習される。最初のステージでK種類の解像度の画像(=K種類のマルチスケールのtoken maps r_k)を得るためにAutoEncoderを学習し、次のステージでblock-wiseのcausal attention maskを用いて、K_
従来手法と比べより小さいパラメータで高い性能を実現し、inference timeも非常に早い。
ScalingLawsも成立する。
[Paper Note] Understanding LLMs: A Comprehensive Overview from Training to Inference, Yiheng Liu+, arXiv'24, 2024.01
Paper/Blog Link My Issue
#Survey #EfficiencyImprovement #NLP #LanguageModel #Attention #One-Line Notes #Reading Reflections Issue Date: 2024-11-17 GPT Summary- ChatGPTの導入により、LLMsの低コストな訓練とデプロイメントへの関心が高まる。本論文では、訓練技術や推論デプロイメント技術の進化を概説し、データ前処理やモデル圧縮など多様な視点を提供。LLMsの活用についても考察し、今後の発展を示唆する。 Comment
[Perplexity(参考;Hallucinationに注意)]( https://www.perplexity.ai/search/yi-xia-nolun-wen-wodu-minei-ro-7vGwDK_AQX.HDO7j9H8iNA)
単なるLLMの理論的な説明にとどまらず、実用的に必要な各種並列処理技術、Mixed Precision、Offloadingなどのテクニックもまとまっているのがとても良いと思う。
LLM Frameworkのところに、メジャーなものが網羅されていないように感じる。たとえば、UnslothやLiger-KernelなどはTransformersの部分で言及されてても良いのでは、と感じる。
[Paper Note] What Matters in Transformers? Not All Attention is Needed, Shwai He+, arXiv'24, 2024.06
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Pruning #KeyPoint Notes Issue Date: 2024-10-22 GPT Summary- トランスフォーマー内の冗長性を調査し、アテンションレイヤーの大部分が高い類似性を示すことが判明。Llama-2-70Bはアテンションレイヤーを半分削除しても僅か2.4%の性能低下で48.4%のスピードアップを達成。トレーニング全体を通じて冗長性が一貫しており、アテンションとMLPレイヤーの共同削除によりさらなる効率化を模索。31レイヤー削除でもLlama-2-13Bは90%の性能を維持。研究はネットワークアーキテクチャ設計に新たな洞察を提供。 Comment
通常LLMはtransformer decoderのブロックをstackすることで形成されるが、積み上げたブロック、あるいはlayerってほんとに全部必要なの?という疑問に答えてくれる論文のようである。
transformer blockそのもの、あるいはMLP layerを削除するとpeformanceは大幅に低下するが、attention layerを削除してもperformanceの低下が起きなかった模様。これにより高速化が実現可能。
削除するブロックやlayerはinputとoutputのコサイン類似度が高いものを削除することによって実現。
比較的パラメータサイズが小さい7B, 13Bモデルでの実験結果
より大きなモデルでの実験結果
パフォーマンスが変わらない範囲だと、attention layer dropにより、7B, 13Bモデルの場合は23%程度、70Bの場合は35%のスループット向上
openreview (ICLR'25):
https://openreview.net/forum?id=YLTWwEjkdx
openreview (TMLR):
https://openreview.net/forum?id=xnYT0HjBsT
先行研究
- [Paper Note] The Unreasonable Ineffectiveness of the Deeper Layers, Andrey Gromov+, ICLR'25, 2024.03
beeFormer: Bridging the Gap Between Semantic and Interaction Similarity in Recommender Systems, Vojtěch Vančura+, N_A, RecSys'24
Paper/Blog Link My Issue
#RecommenderSystems #TransferLearning #Initial Impression Notes Issue Date: 2024-09-25 GPT Summary- レコメンダーシステムにおいて、コールドスタートやゼロショットシナリオでの予測改善のために、インタラクションデータを活用した文のトランスフォーマーモデル「beeFormer」を提案。beeFormerは、意味的類似性の予測において従来の手法を上回り、異なるドメインのデータセット間で知識を転送可能であることを示した。これにより、ドメインに依存しないテキスト表現のマイニングが可能になる。 Comment
NLPでは言語という共通の体系があるから事前学習とかが成立するけど、RecSysのようなユーザとシステムのinteraction dataを用いたシステムでは(大抵の場合はデータセットごとにユニークなユーザIDとアイテムIDのログでデータが構成されるので)なかなかそういうことは難しいよね、と思っていた。が、もしRecSysのタスク設定で、データセット間の転移学習を実現できるのだとしたらどのように実現してきるのだろうか?興味深い。後で読む。
