Pruning


Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Distillation #SmallModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- 大規模事前学習におけるエキスパート混成モデル(MoE)の圧縮を体系的に探求し、プルーニングと知識蒸留(KD)を適用する方法を検討。プルーニングは、スクラッチからの訓練よりも一貫して優れた初期化を提供し、異なる圧縮手法は同様の最終性能へ収束。簡易な部分保存型統合戦略で下流性能を向上させ、KDと損失を組み合わせることで効果を上げる。漸進的なプルーニングスケジュールはワンショット圧縮を上回り、最適化に寄与。結果として、Qwen3-Next-80A3Bモデルを圧縮し、競争力を維持する指針を提供。 Comment

元ポスト:

Loading…

大規模なMoEモデルから小規模なvariantを学習する方法に関する分析




Paper/Blog Link My Issue
#LanguageModel #Mathematics #ACL #KeyPoint Notes #WeightSteering Issue Date: 2026-08-02 GPT Summary- MathNeuroは、LLM内の数学的推論特有のパラメータを高効率で分離する手法です。これにより、数学の性能を向上させつつ、非数学的挙動に影響を与えずにターゲットを絞った介入が可能になります。一般的な言語タスクに重要なパラメータを除外し、数学的推論能力を削除しつつ、GSM8Kで4-17%、MATHで5-35%の性能改善を達成。Data efficiencyも高く、単一サンプルでも効果的。MathNeuroは、今後の数学特有のパラメータへの介入研究の可能性を示唆しています。 Comment

関連:
- [Paper Note] A Simple and Effective Pruning Approach for Large Language Models, Mingjie Sun+, arXiv'23, 2023.06

N個の math/non-math のサンプルについて、`abs(W_ij) * norm(X_j)` を計算し合計することで、パラメータW_ijの 数学/非数学タスクに対する重要度を求め、前者から後者のパラメータの差集合を求めることで、数学に特化したモデルのパラメータを同定(分離)する手法。

image

GSM8kデータセットを math dataset, RACE, MMLU をそれぞれ独立にnon-math datasetとし、提案手法を適用(数学特化パラメータを同定し、weightを0とすることで刈り込む)。実験の結果、RACE, MMLU (non-mathタスク) の性能を、ベースライン手法よりも高く維持しつつGSM8k (math) タスクの性能を削減できたことから、数学に特化したパラメータをベースラインと比較して効果的に分離できた旨を報告(図中の左上に近ければ近いほど、non-mathタスクの性能を維持しつつ数学能力を削減できたことになる)。
image

また、同定した数学特化パラメータのスケールを1.1倍すると、non-mathタスクの性能を損なうことなく、数学タスクの性能が向上する傾向が見受けられた。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Test-Time Scaling #Decoding #Parallel Issue Date: 2025-10-12 GPT Summary- DeepPruneという新しいフレームワークを提案し、並列スケーリングの計算非効率を解決。80%以上の推論トレースが同一の回答を生成する問題に対処し、焦点損失とオーバーサンプリング技術を用いた判定モデルで同等性を予測。オンラインの貪欲クラスタリングで冗長な経路をプルーニングし、80%以上のトークン削減を達成しつつ、精度を維持。効率的な並列推論の新基準を確立。 Comment

pj page: https://deepprune.github.io

HF: https://huggingface.co/collections/THU-KEG/deepprune-68e5c1ea71f789a6719b2c1c

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Transformer #Attention #LongContext #Architecture Issue Date: 2025-09-16 GPT Summary- Forgeting Transformer(FoX)は、忘却ゲートを用いたソフトマックスアテンションを特徴とし、従来のTransformerと比較して優れた性能を示す。FoXの特性を活かし、適応計算プルーニング(ACP)を提案し、計算を動的にプルーニングすることで、FLOPsとメモリアクセスを約70%削減。これにより、アテンションの実行時間を50%から70%短縮し、トレーニングスループットを10%から40%向上させた。性能の劣化はなく、長い文脈長ではさらなる計算コストの節約が可能である。 Comment

code: https://github.com/zhixuan-lin/forgetting-transformer

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=xNj14CY5S1#discussion

先行研究:
- [Paper Note] Forgetting Transformer: Softmax Attention with a Forget Gate, Zhixuan Lin+, ICLR'25, 2025.03




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ICLR #One-Line Notes Issue Date: 2024-04-22 GPT Summary- LLMの重みの知識格納を層剪定で研究。不要なパラメータを特定し、層を削除しても性能に影響がないか確認。驚くべき結果として、最大で半分の層を削除しても性能低下がわずかであることが示された。この頑健性は浅い層が重要な役割を果たしている可能性を示唆。PEFT手法を用いて実験を効率化。 Comment

下記ツイートによると、学習済みLLMから、コサイン類似度で入出力間の類似度が高い層を除いてもタスクの精度が落ちず、特に深い層を2-4割削除しても精度が落ちないとのこと。

参考:

Loading…


VRAMに載せるのが大変なので、このような枝刈り技術が有効だと分かるのはありがたい。LoRAや量子化も利用しているっぽい。

openreview: https://openreview.net/forum?id=ngmEcEer8a




Paper/Blog Link My Issue
#Tutorial #MachineLearning #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #MultiModal #Actor-Critic #PEFT(Adaptor/LoRA) #LLMServing #DPO #PostTraining #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2025-10-17 GPT Summary- 本報告書では、大規模言語モデル(LLMs)のファインチューニングに関する理論と実践を統合的に検討し、歴史的な進化やファインチューニング手法の比較を行っています。7段階の構造化されたパイプラインを紹介し、不均衡データセットの管理やパラメータ効率の良い手法(LoRA、Half Fine-Tuning)に重点を置いています。また、PPOやDPOなどの新しいアプローチや、検証フレームワーク、デプロイ後のモニタリングについても議論し、マルチモーダルLLMsやプライバシー、説明責任に関する課題にも触れています。研究者や実務者に実用的な洞察を提供する内容です。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #NeurIPS #read-later Issue Date: 2025-03-16 GPT Summary- 本論文では、既存の大規模言語モデル(LLMs)をプルーニングし、少量のトレーニングデータで再トレーニングする手法を提案。深さ、幅、注意、MLPプルーニングを知識蒸留と組み合わせた圧縮ベストプラクティスを開発し、Nemotron-4ファミリーのLLMを2-4倍圧縮。これにより、トレーニングに必要なトークン数を最大40倍削減し、計算コストを1.8倍削減。Minitronモデルは、ゼロからトレーニングした場合と比較してMMLUスコアが最大16%改善され、他のモデルと同等の性能を示す。モデルの重みはオープンソース化され、補足資料も提供。 Comment

OpenReview: https://openreview.net/forum?id=9U0nLnNMJ7&referrer=%5Bthe%20profile%20of%20Pavlo%20Molchanov%5D(%2Fprofile%3Fid%3D~Pavlo_Molchanov1)




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #KeyPoint Notes Issue Date: 2024-10-22 GPT Summary- トランスフォーマー内の冗長性を調査し、アテンションレイヤーの大部分が高い類似性を示すことが判明。Llama-2-70Bはアテンションレイヤーを半分削除しても僅か2.4%の性能低下で48.4%のスピードアップを達成。トレーニング全体を通じて冗長性が一貫しており、アテンションとMLPレイヤーの共同削除によりさらなる効率化を模索。31レイヤー削除でもLlama-2-13Bは90%の性能を維持。研究はネットワークアーキテクチャ設計に新たな洞察を提供。 Comment

通常LLMはtransformer decoderのブロックをstackすることで形成されるが、積み上げたブロック、あるいはlayerってほんとに全部必要なの?という疑問に答えてくれる論文のようである。

transformer blockそのもの、あるいはMLP layerを削除するとpeformanceは大幅に低下するが、attention layerを削除してもperformanceの低下が起きなかった模様。これにより高速化が実現可能。

削除するブロックやlayerはinputとoutputのコサイン類似度が高いものを削除することによって実現。

image

比較的パラメータサイズが小さい7B, 13Bモデルでの実験結果

image

より大きなモデルでの実験結果
image

パフォーマンスが変わらない範囲だと、attention layer dropにより、7B, 13Bモデルの場合は23%程度、70Bの場合は35%のスループット向上

openreview (ICLR'25): https://openreview.net/forum?id=YLTWwEjkdx
openreview (TMLR): https://openreview.net/forum?id=xnYT0HjBsT

先行研究
- [Paper Note] The Unreasonable Ineffectiveness of the Deeper Layers, Andrey Gromov+, ICLR'25, 2024.03




Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR Issue Date: 2026-08-02 GPT Summary- Wanda(Weights and Activationsによる剪定)は、再訓練なしでLLMのスパース性を誘導する新しい剪定法。活性化が小さい重みを対象に剪定を行い、性能を維持。LLaMAおよびLLaMA-2での評価において、従来の剪定法より優れた結果を示す。 Comment

openreview: https://openreview.net/forum?id=PxoFut3dWW




Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #One-Line Notes Issue Date: 2023-06-26 GPT Summary- 大規模言語モデルのプルーニング手法としてWandaを提案。再訓練なしで活用可能で、入力アクティベーションと掛け合わせたウェイトの絶対値を最小化することでスパース性を誘導。LLaMAおよびLLaMA-2で徹底評価し、絶対値プルーニングを超える性能を実現。 Comment

LLMのネットワークのpruning手法を提案。再訓練、パラメータ更新無しで、性能低下が少なくて刈り込みが可能。




Paper/Blog Link My Issue
#NLP #LanguageModel #ACL #needs-revision Issue Date: 2023-07-13 GPT Summary- プルーニングによる事前学習済み言語モデル(PLMs)の圧縮手法を提案。特にStatic Model Pruning(SMP)は、一階法の剪定のみでPLMsを下流タスクに適応させ、スパース性を達成。新たなマスキング関数と訓練目的関数を設計し、広範な実験で顕著な性能向上を示す。SMPはファインチューニングを不要とし、パラメータ効率が良好。

Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #ReinforcementLearning #InstructionTuning #Reasoning #OpenWeight #KeyPoint Notes #Author Thread-Post Issue Date: 2025-04-08 Comment

DeepSeek-R1をGPQA Diamond GPQA: A Graduate-Level Google-Proof Q&A Benchmark, David Rein+, N/A, COLM'24 , AIME2024/2025, Llama4 Maverickを
BFCLv2(Tool Calling, BFCLv2, UC Berkeley, 2024.08 ), IFEVal [Paper Note] Instruction-Following Evaluation for Large Language Models, Jeffrey Zhou+, arXiv'23, 2023.11 で上回り, そのほかはArenaHardを除きDeepSeekR1と同等
image

DeepSeekR1が671B(MoEで37B Activation Param)に対し、こちらは253B(ただし、Llama3.1がベースなのでMoEではない)で同等以上の性能となっている。
ReasoningをON/OFFする能力も備わっている。

モデルがどのように訓練されたかを示す全体図がとても興味深い:image

特に [Paper Note] Demystifying Long Chain-of-Thought Reasoning in LLMs, Edward Yeo+, ICML'25 でも有効性が示されているように、SFTをしてからReasoningを強化する(強化というより元々持っている能力を引き出す?)RLを実施している。

詳細は下記Blogとのこと:
https://developer.nvidia.com/blog/build-enterprise-ai-agents-with-advanced-open-nvidia-llama-nemotron-reasoning-models/

元ポスト:

Loading…