GPUKernel


Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Decoding #read-later #Selected Papers/Blogs Issue Date: 2026-08-04 GPT Summary- LLM推論のサンプリングを高速化するために、$\textbf{SonicSampler}$を提案。これは、固定化された実行モデルに統合されたタイル対応のTritonカーネルを用い、ダイナミックなサンプリング動作をサポート。文法制約や頻度ペナルティなどを一つのバッチ処理で実現し、CUDA Graphに完全に互換性を持つ。新しい階層的二段階top-kアルゴリズムにより最大で$\textbf{10x speedup}$を達成し、全体で最大$\textbf{16x speedup}$を実現しつつ柔軟性を維持。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #LongContext #LLMServing #SoftwareEngineering #read-later #Selected Papers/Blogs #Latency #Initial Impression Notes Issue Date: 2026-08-03 GPT Summary- GPUコレクティブ通信は帯域幅最適化が主流だが、遅延制約が増加中。特に、LLM推論では多数の小規模コレクティブがトークン生成に影響を与えるため、マイクロ秒のオーバーヘッドが性能に重要。研究では、GPUコレクティブの性能向上に向け、効率的な同期とマルチキャスト利用の原則を特定。カスタムコレクティブカーネルを開発し、遅延を大幅に削減、SoL下限の7%以内に抑制。実アプリケーションでLLM推論のレイテンシとスループットを改善し、AI推論とHPCの両方に貢献。 Comment

元ポスト:

Loading…

小規模バッチ、Tensor Parallelism適用時に のデコード時に頻発するAllReduceのlatencyを、usレベルで削減できる工夫を施すことで、推論コストを低下させる




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Evaluation #PostTraining #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #One-Line Notes #Sparse #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- 非構造的スパース性を活用することで、LLMの計算コストを削減し、フィードフォワード層の効率を向上させる新しいCUDAカーネルを導入。99%超のスパース性を誘導しつつも、パフォーマンスへの影響は最小限。これにより、モデル規模の拡大に伴うスループット、エネルギー効率、メモリ使用量の改善を実証。すべてのコードはオープンソースで公開し、スパース性の実用性を推進。 Comment

元ポスト:

Loading…

現在の言語モデルではFFNの計算が計算コストの多くを占めているが、ReLUやL1正則化によってFFN中で必要なactivationを99%程度sparseにすることができ、sparseになったFFNに対して最適なデータ形式と高速に動作するGPUKernelを構築することで、downstream taskへの性能劣化無しに、省コストでの推論が可能になる、という話に見える。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Author Thread-Post Issue Date: 2026-04-30 GPT Summary- AdaExploreは、カーネルコード生成のためのエージェントフレームワークで、自己改善を可能にする。失敗駆動適応と探索を通じて正確性と最適化性能を向上させ、再利用可能な記憶を活用する。エージェントはタスクを合成し、局所的改良と構造再生成を交互に行い、最適化の地形を探索する。実験により、KernelBenchのベンチマークで3.12倍および1.72倍のスピードアップを達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #PostTraining #EvolutionaryAlgorithm Issue Date: 2026-04-05 GPT Summary- Kernel-Smithは、高性能GPUカーネルと演算子生成のためのフレームワークで、評価駆動型進化エージェントを用いて候補プログラムを改善。NVIDIAとMetaXのバックエンド特化評価サービスを活用し、トレーニングは強化学習信号とステップ中心の監督を結合。Kernel-Smith-235B-RLは、NVIDIA Tritonバックエンドにおいて総合性能の最先端を達成し、他モデルを上回る。さらに、MetaX MACAバックエンドでの適応も成功し、本番システムへの実用的な寄与を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #SyntheticData #Coding #Rubric-based #Environment Issue Date: 2026-03-04 GPT Summary- CUDAカーネル最適化は深層学習の核だが、専門知識が求められる。大規模言語モデル(LLMs)は従来のCUDAコード生成において限界があり、内部最適化能力が向上しない。私たちはCUDA Agentを提案し、データ合成、信頼性の高い報酬信号の提供、安定した強化学習を通じてCUDAカーネルの専門知識を育成。KernelBenchで最先端の結果を達成し、torch.compileよりも各レベルで大幅に高速化。最強商用モデルを約40%上回る性能を示す。 Comment

pj page: https://cuda-agent.github.io/

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #ReinforcementLearning #AIAgents #ICML #Test-Time Scaling #PostTraining #LongHorizon #Environment #Author Thread-Post Issue Date: 2026-02-06 GPT Summary- 高品質のカーネル生成はスケーラブルなAIシステムの鍵であり、そのためのLLM訓練には十分なデータと堅牢な環境が必要です。本研究では、KernelGYMを設計し、報酬ハッキングを防ぐマルチターンRL手法を検討します。TRLOOを提案し、偏ったポリシー勾配問題を解決。訓練されたDr.Kernel-14Bは高性能を達成し、生成されたカーネルの31.6%がTorch参照に対して1.2倍のスピードアップを実現しました。全リソースはGitHubで公開されています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #LLMServing #One-Line Notes #Author Thread-Post Issue Date: 2026-09-09 Comment

github: https://github.com/cohere-ai/cohere-megakernel

バッチサイズ1, 256k context、単一H100利用の条件下において、vLLM v0.24+FlashAttention3+Triton MoE backendよりも最大1.58倍デコーディングが高速(合成されたKV Cacheによる実験、実プロンプト+バッチサイズ8でも1.25--1.41倍高速)な実験的なLLM Servingエンジンのようである。
LLMのデコードを単一のカーネルに集約し、デコーディングのために必要な様々なステップごとの同期のオーバヘッドを削減したのだとか。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #MoE(Mixture-of-Experts) #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-15 Comment

元ポスト:

Loading…

4k--128kのコンテキストに対して最大2.4倍高速なMoE向けCUDAカーネル。メモリ書き出しのトラフィックを大幅に削減することで実現。

参考:
- CUDA Programming Guide Part 1, Kazuki Fujii, 2026.06




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Infrastructure #read-later #Author Thread-Post Issue Date: 2026-05-26 Comment

元ポスト:

Loading…

> mKernel is our attempt at the missing piece: GPU-driven, fused kernels that deliver fine-grained compute–communication overlap across both intra-node NVLink and inter-node RDMA, while staying portable across various networking backends (ConnectX-7, AWS EFA, and more on the way).




Paper/Blog Link My Issue
#Article #NeuralNetwork #EfficiencyImprovement #NLP #LanguageModel #python #SoftwareEngineering Issue Date: 2026-04-27 Comment

元ポスト:

Loading…

pythonの記法で、PTX(どの世代のNVIDIA GPUでも理解可能な仮想的なアセンブリ言語)を記述可能で自動最適化は一切入らないDSLとのこと。

PTXについては以下を読んだ:
PTXってなんだ?〜GPUの「共通語」仮想アセンブリを完全理解〜,GeneLab_999, 2026.01
https://qiita.com/GeneLab_999/items/5c49a21e5fd7e618b671




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #Attention #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-21 Comment

ベンチマーク: https://github.com/MoonshotAI/FlashKDA/blob/master/BENCHMARK_H20.md

関連:
- Kimi K2.6: Advancing Open-Source Coding, Kimi, 2026.04
- KDA: [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10

Kimi Delta Attentionがより高速に(2倍程度)動作する実装のようである。

公式ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Multi #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Author Thread-Post #AgentHarness Issue Date: 2026-04-15 Comment

元ポスト:

Loading…

自律的に長期間稼働し235件の問題を1回の実行で解くマルチエージェントハーネスに関するレポートで、3週間程度でBlackwell GPUカーネルをゼロから構築・最適化し38%高速化とのこと。