Decoder-Decoder (3) — 1/1
[Paper Note] HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing, Jianyu Wei+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Architecture #KV Cache #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-24 GPT Summary- 長期・複数ターンのエージェントに対し、HySparse2は2段階のKV共有を備えたハイブリッド・スパース注意を導入。 外側ではKV Bridgingにより、自己デコーダの隠れ状態からクロスデコーダのKVキャッシュを構築する。 内側では、KV Reuseを維持しつつ、ブロック単位のスパース性をトークン単位に変更し、直近トークンを含むスライディングウィンドウを強制することで長文検索を高精度化。 自己デコーダ処理後にクロスデコーダ層をスキップでき、プリフィル計算量とKVキャッシュ容量を削減。 80B-A3B MoEモデルにおいて、長文コンテキスト検索と複数ターンのエージェントタスクでHySparseおよびHybrid SWAを上回る性能を達成。 Comment
元ポスト:
Mimo-V3ではYOCOスタイルのデコーダ-デコーダモデルで、KVを共有するアーキテクチャになるようである。
[Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Architecture #NeurIPS Issue Date: 2026-09-10 GPT Summary- YOCOというデコーダ-デコーダ型アーキテクチャを提案。これは一度だけKVペアをキャッシュし、自己デコーダとクロスデコーダから構成される。効率的なKVキャッシュのエンコードにより、クロスアテンションを介して再利用され、GPUメモリを削減しつつグローバルなアテンションを保持。プレフィル段階を早期終了可能にし、計算を高速化。実験により、Transformerと比較して好ましい性能を確認し、1Mのコンテキスト長で高精度を達成。推論時のメモリ使用量やスループットも大幅に改善。コードは https://aka.ms/YOCO で公開。 Comment
openreview: https://openreview.net/forum?id=25Ioxw576r
inputをself-decoderと呼ばれる効率的なself-attentionを備えたエンコーダでエンコードしKV Cacheを生成。それを後段のDecoderと共有し、Decoder側はcross-attentionによって参照することで、利用するKV Cache圧縮するアーキテクチャ、に見える。
ポイント解説:
DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #read-later #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Author Thread-Post Issue Date: 2026-09-10 Comment
元ポスト:
所見:
え?もしかしてEncoder-Decoder???
Causal Encoder-Decoderという名称なので、seq2seqのようなBidirectionalなエンコーダを用いたものではなく、
エンコーダー、デコーダー共にautoregressiveモデルだが、エンコード用途とデコード用途でアーキテクチャやactivation paramなどに違いを持たせた、という感じだろうか。
デコーダ-デコーダアーキテクチャと呼ぶらしい:
関連:
- [Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05
公式ポスト:
ベンチマークスコアはfrontierモデルに匹敵する
HBMの使用量はV4-Flashから1/4, SSD使用量は1/8
合成データはいまだに利用していない:
事後学習のデータ品質改善のROIがアルゴリズム改善のROIを上回る:
関連(こちらは事前学習だが):
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
解説:
Artificial Analysisによる評価:
とそれらに対する所見:
所見:
v4.1 flashをhostingするためのコードリポジトリがいくつか新たに公開されたようである:
所見:
