Author Thread-Post (954) — 2/5


Paper/Blog Link My Issue
#ComputerVision #NLP #Selected Papers/Blogs #VisionLanguageModel #Robotics #VisionLanguageActionModel #reading #One-Line Notes #Steering Issue Date: 2026-06-13 GPT Summary- 汎用ポリシーが多様なロボットデータセットから学習する中で、Flow Matching GeneralistsとFlow Reversal Steering(FRS)を提案し、サブ最適な行動を逆向きに通して潜在ノイズを特定、汎用的なアクションモードへ写像する手法を検証。FRSは粗い意味論的指示を良いロボットアクションに変換し、ゼロショット制御を改善。訓練を短時間で行い、最大95%のタスク成功率向上を示し、強化学習をブートストラップしてさらなる改善を実現。 Comment

元ポスト:

Loading…

VLMや人間によって、
- Coarse Reference Action関する情報(=意味的には妥当だがロボットがアクションを実施するには粗すぎる情報; move straight right等)を与え、
- Coarse Reference Action を対応するVLAのreference action a_1に変換し
- a_1に基づいてVLAが良いアクションを生成できる潜在ノイズをFlow Matchingモデルを時間方向にbackwardさせる(noising process)ことで推定し、
- 同定した潜在ノイズから順方向にdenoisingすることで、妥当なアクションをsteeringする

Flow Reversal Sterring (FRS) を提案。FRSにはzero-shot、かつonlineでsteeringができる利点がある。

## Diffusion Steering via Behavioral Cloning (DSBC)
FRSはSupervised Learningにも活用できる。具体的には、reference actionに基づいたノイズ a^hat_0を用いてobservationからノイズを生成するノイズ方策を直接behavior cloning(=observation oが与えられた時に、a^hat_0を出力する確率を最大化する最尤推定; p.6冒頭)する。

image

学習データ(observation, good noiseのタプル)の収集方法は大きく分けて2通りあり
- オンライン: zero-shot FRSを実際に環境でロールアウトし、タスクが成功したときノイズをgood noiseとして記録する
- オフライン: 既存の(observation, action)データをFRSで変換し(observation, action noise)のタプルに変換して学習に利用する

このような学習手法をDSBCと呼ぶ。

## DSRL + FRS
上述のFRSとDSRL [Paper Note] Steering Your Diffusion Policy with Latent Space Reinforcement Learning, Andrew Wagenmaker+, arXiv'25, 2025.06

を組み合わせることで、DSRLの安定性を向上させる手法。DSRLは一言で言うと、アクション生成のシードとなる良いノイズを生成できるポリシー(ノイズ方策)をRLを通じて学習する手法らしく、RLをする際の報酬に対して、DSBCを重み付きで加えることによって、エキスパートのノイズから大きく逸脱することを防ぐ正則化の役割を追加する。

image

完全に読めたわけではないが、おもしろい。勉強になった。




Paper/Blog Link My Issue
Issue Date: 2026-06-13 GPT Summary- RGSDは、ルーブリックを用いて検証者なしで訓練を行う手法で、疎な報酬信号を密な学習信号に置き換える。これにより、従来の検証者依存の課題を克服しつつ、医療や科学分野で同等の満足度を達成。ルーブリックは強力な教師信号を提供し、RGSDは検証者のコストや信頼性が問題となる場合の有効な代替手段として機能する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-12 GPT Summary- 現代のLLMトレーニングパイプラインは多くのモデルの依存により複雑化しており、依存関係が断片化しています。本研究では、出典に基づく証拠を用いてLLMの依存グラフを再帰的に再構築するエージェントシステムModSleuthを提案。直接的・間接的依存関係を区別し、アーティファクトの同一性を解決することで、複雑な依存構造に対処。4つのLLMリリースから1,060件の依存関係を回収し、トレーニングと評価の関係、アーティファクト間の不一致を明らかに。ModSleuthとその依存グラフを公開し、LLMのエコシステムの透明性を向上させることを目指します。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #DiffusionModel #read-later Issue Date: 2026-06-11 GPT Summary- DDLMはカテゴリカルなトークンをデノイズしてテキストを生成しますが、連続生成モデルの漂移法をこのアプローチに応用することを検討します。具体的には、TokenDriftを定式化し、ソフトトークン特徴に基づく漂移を行うことで、DDLMの生成品質を改善しました。実験により、TokenDriftが既存の連続ベースラインを上回る成果を示し、生成品質が著しく向上することが確認されました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Hallucination #Reasoning Issue Date: 2026-06-11 GPT Summary- 大型推論モデルは、長い推論経路を生成するが、誤った回答やハルシネーションの検出を難しくする。これに対処するために、Answer-agreement Representation Shaping(ARS)を提案。ARSは、回答の安定性をエンコードし、トレース境界を摂動させることで反事実的な回答を生成し、一致する回答を近づける表現を学習。これによりハルシネーションリスクを明らかにする。実験により、ARSは検出精度を向上させ、強力なベースラインを超える改善を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#CVPR Issue Date: 2026-06-11 GPT Summary- エゴライフプロジェクトは、AI搭載ウェアラブル眼鏡を用いて生産性を向上させる自己中心的ライフアシスタントの開発を目指す。6名の参加者が1週間の共同生活を通じて、AI眼鏡で日常活動を記録し、「EgoLife Dataset」を生成。これに基づいて、長大な文脈を前提とした「EgoLifeQA」を提案し、自己中心データに対する視覚-音声モデルやアイデンティティ認識、長大な文脈質問応答に挑戦。EgoButlerシステムを導入し、EgoGPTとEgoRAGを統合することで、性能を向上させた。データセットやモデルの公開により、自己中心的AIアシスタントの研究を進める。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #read-later Issue Date: 2026-06-11 GPT Summary- DRPOは、大規模言語モデル(LLMs)の強化学習における安定性を向上させるための新しい手法。従来のDPPOはハードマスクに依存していたが、DRPOは滑らかなアドバンテージ重み付き二次正則化を用いて、境界を越えた更新に対する補正信号を提供。これにより、ポリシーシフトによる発散的な更新を抑制し、学習効率を高めることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #PostTraining #read-later #interactive #Realtime #SpeechToSpeech Issue Date: 2026-06-11 GPT Summary- 全二重音声対話モデルのインタラクティブ性を向上させるため、RLを使用したポスト訓練後のアライメント手法を提案。ポーズ処理、ターン取り、バックチャネル、ユーザーの中断にフォーカスし、人間の会話データから抽出した音声セグメントで特有の報酬関数を最適化。LLMベースの報酬を加えることで応答品質を保持。MoshiとPersonaPlexモデルでの評価により、一貫したインタラクティブ性の改善を確認。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #read-later #SparseAttention Issue Date: 2026-06-11 GPT Summary- RLVRは計算コストが高く、長いCOTを生成するが、疎結合注意が密なロールアウトを高速化する可能性がある。過度の疎化は崩壊を招き、緩すぎると速度アップが不十分になる。本研究では、疎から密へのactor-policy不一致を考察し、トークンのstatisticを一定に保つ動的な疎化スケジュールを導入。これにより、Qwen3系列モデルでのロールアウトをそれぞれ2.2倍、2.4倍、2.0倍高速化を達成。さらに、大規模モデルや他のRLドメインにも適用可能で、DistillSparseを用いた軽量な蒸留により、同じ不一致閾値で更なる速度アップが実現できることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#MultiModal #read-later #VisionLanguageModel #LatentReasoning #SpatialUnderstanding Issue Date: 2026-06-11 GPT Summary- 想像的知覚を利用し、VLMの空間推論能力を向上させるために、想像的知覚トークン(IPT)を導入。PET、PT、MVCの課題を通じて約2万件のデータセットを構築し、IPTによる訓練が空間推論の一貫性と精度を高めることを示した。MVCでは3.4%の精度向上を実現し、IPTとラベル監督の組み合わせにより更なる利得が得られた。全体として、IPTは観測されていない構造の推論を支援し、解釈可能な中間表現を提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#RewardHacking #read-later Issue Date: 2026-06-11 GPT Summary- エージェントベンチマークの成果検証器が脆弱である中、323件のタスクが最先端モデルによってハック可能であることを発見。ハッカー・フィクサー・ループを導入し、検証器を改良することでエクスプロイトを防止。KernelBenchでは攻撃成功率を62%から0%に低下させ、Gemini 3 Flashでも強力なモデルに対する防御を成功させた。Terminal Wrenchを公開し、ハック可能な環境やエクスプロイトの情報を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #DiffusionModel Issue Date: 2026-06-11 GPT Summary- 教師あり模倣学習を安定的に維持しつつ、テスト時にシンプルなポリシー改善を行うQGFアルゴリズムを提案。QGFは参照フローポリシーと値関数クリティックを事前訓練し、テスト時に価値勾配で高価値アクションを生成。ただし、追加のポリシー学習は行わず、従来のRL法に比べて優れた性能を示す。モデルサイズのスケーリングにも有利な特性を持ち、実用的な代替RLアルゴリズムを提供。 Comment

pj page: https://q-guided-flow.github.io/

元ポスト:

Loading…

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #read-later #On-Policy Issue Date: 2026-06-11 GPT Summary- オンポリシー蒸留(OPD)の背後の構造的原因を「プレフィックス・フェイラー」として特定。これにより、トークンごとの密な教師監督が二峰性の教師混合を生じ、切り捨てや再重み付けでは対処できない問題が発生。これを解決するために、Trajectory-Refined Distillation(TRD)を提案。TRDは、学習者のロールアウトを軌跡レベルで修正し、探索を改善。さまざまなベンチマークで一貫して従来のベースラインを上回り、推論のカバレッジを広げる。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-11 GPT Summary- Zamba2-VLは、Mamba2状態空間レイヤーとトランスフォーマーブロックを組み合わせたビジョン・ランゲージモデルで、広範な画像理解と推論に強みを持つ。従来のモデルと比べ、同規模のオープンウェイトVLMにおいて優れた性能を示し、効率的な計算を実現。1.2B、2.7B、7Bのモデルを公開し、デバイスおよびエッジデプロイメントに最適化されている。 Comment

blog: https://www.zyphra.com/our-work/zamba2-vl

元ポスト:

Loading…




Paper/Blog Link My Issue
#read-later Issue Date: 2026-06-11 GPT Summary- AIの科学的理解は、モデルの挙動を訓練ダイナミクスに基づいて研究するべきであり、単なる固定的な分析に留まるべきではない。提案は、初期訓練信号から結果を予測し、轨道の修正を可能にする手法を支持し、望ましい特性を生み出す訓練手続きを設計する重要性を強調する。スケーリング則の成果を能力や公平性、ロバスト性に拡張することが課題であり、具体的な未解決問題を識別し、進展を検討する必要がある。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#WorldActionModel Issue Date: 2026-06-11 GPT Summary- OSCARは、正確なアクション条件付き動画世界モデルを通じてロボットポリシー評価を可能にする。従来の動画モデルが直面していたデータの多様性不足、アクション追従の不正確さ、一般化の不足の問題に対処。大規模なデータパイプラインを用いて、クリーンな訓練データセットを生成し、2D運動学スケルトンを条件付け表現として採用。Cosmos-Predict2.5-2Bモデルは、少ないリソースで既存のベースラインを上回る性能を達成。OSCARはRoboArenaでロボットポリシー評価に展開され、仮想評価と現実評価の高い相関を示し、未来のポリシー評価の可能性を拓く。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#read-later #KV Cache #Compression Issue Date: 2026-06-11 GPT Summary- KVキャッシュのメモリボトルネックを解消するため、軽量で再利用可能な圧縮器Stillを提案。これは凍結された基礎モデルに対して層ごとの小さなPerceiverを用い、一度の学習でコンパクトなキーとバリューを生成する。Stillは圧縮比8×〜200×、文脈長8k〜128kの範囲で優れた速度と品質を実現し、長文脈のベースラインを8〜22ポイント上回る。さらに自由形式の要約にも対応し、高い性能を維持することを示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-11 GPT Summary- ニューラルネットワークの勾配に基づく更新が論理的整合性を保つかは不明であり、線形伝播仮説(LPA)の幾何学的限界を調査。本研究では、関係代数を用いて三つの核心的操作(否定、逆関係、合成)を分析。特に、否定と逆関係についてはテンソル因子分解が必要であることを示し、合成の根本的障害を特定。合成は双線形性を必要とし、否定と矛盾するため、知識編集やマルチホップ推論に関する課題を引き起こす可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #reading #One-Line Notes #Clustering-based Issue Date: 2026-06-10 GPT Summary- 生成されたテキスト間の意味的コンセンサスを特定するMode Extraction(ModeX)を提案。評価者なしでBest-of-N選択を実現し、類似度グラフを用いてセントロイドを選択。ModeX-Liteで効率化を図り、テキスト要約やコード生成などのオープンエンドタスクで従来の手法を常に上回る性能を示す。 Comment

元ポスト:

Loading…

outputに対してJaccard係数に基づいてAffinity Graphを構築し、クラスタのセントロイドを求めることで、extrnal verifier無しでBest-of-Nを実現する。

image

Best-of-16でのexternal evaluatorを用いた場合のオラクルスコアを、多くの場合で上回っているように見えるが、なぜこの3つのベンチマークでの評価なのだろうか?(そして文書要約はなぜ表層的なメトリックばかりなのだろうか)。論文中では代表的なタスクである3つのベンチマークで評価したと一言しか書かれていないように見える。
image

もしこれが安定して高い性能を出せるなら、evaluator freeなので非常に強力である。理論的な分析もあるようだが読めていない。覚えておこう。




Paper/Blog Link My Issue
#InformationRetrieval #read-later #Selected Papers/Blogs Issue Date: 2026-06-09 GPT Summary- Revelaは、自己教師付きリトリーバー学習のための統一的な訓練フレームワークを提供し、言語モデリングの手法をリトリーバーの訓練に適用します。文書間の意味的依存関係をモデル化し、リトリーバーの類似度スコアを利用して最適化を実現。評価結果は、注釈付きデータを使わずに、各種ベンチマークで従来の手法を上回る性能を示し、スケーラビリティの可能性も確立しました。 Comment

openreview: https://openreview.net/forum?id=e7pAjJZJWb

元ポスト:

Loading…




Paper/Blog Link My Issue
#LatentReasoning Issue Date: 2026-06-09 GPT Summary- NF-CoTは、テキストの明示的チェーン・オブ・思考(CoT)を圧縮された連続状態として扱う潜在推論フレームワーク。正規化フローを利用し、モデルの利点(確率的サンプリングやKVキャッシュとの互換性)を保持。コード生成ベンチマークでは、NF-CoTがパス率を向上させ、中間推論コストを削減することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-09 GPT Summary- 多様な設定で信頼性を持つモデルの期待に応えるべく、視覚的多様性を重視したマルチモーダル大規模言語モデル(MLLMs)評価ベンチマーク WorldBenchを提案。数千の視覚概念を基にしたタクソノミーを構築し、多様な画像を収集。手作業で設計した難問を通じて、MLLMの視覚理解力の限界を明らかにし、最先端モデルでも精度は64.0%にとどまり、偶然レベルを上回るモデルも存在。視覚的多様性の重要性を強調する研究。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-09 GPT Summary- 強化学習を用いた探索エージェントHarness-1は、状態管理を環境側に任せて訓練され、探索履歴を効果的に保持。ポリシーは情報検索や検証の判断を行い、8つのリトリーバルベンチマークで優れたパフォーマンスを示し、他のサブエージェントや大規模モデルと競争力を維持。探索挙動がトレーニングドメインを超えて一般化する可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #Distillation #On-Policy #SelfDistillation Issue Date: 2026-06-09 GPT Summary- 強化学習における報酬の利用は狭いが、豊かなフィードバックを効果的に活用する方法を提案。DAggerの分布的変種を用いて専門家のフィードバックを参照し、前方クロスエントロピー目的を採用することで単調な方策改善を実現。DistILは多様なタスクにおいて従来のベースラインを上回る性能を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-06-08 GPT Summary- 任意のデザインを読み取り、物体を構築するAIエージェントを目指し、MLLMの視覚的グラウンディングと空間推論能力を研究。ブリック組み立てをブリック選択と姿勢推定のサブタスクに定式化し、BC-Benchを導入。実験により、現状のMLLMは選択と推定に苦戦することが判明。これを踏まえ、Brick-Composerフレームワークを提案し、正確性を3倍以上向上させ、成功率を約15%に引き上げる。MLLMは物理的に根拠のある学習を通じて組み立て能力を獲得する可能性が示唆される。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Attention #Architecture #ConvolutionalModels Issue Date: 2026-06-05 GPT Summary- 動的ショート畳み込みをトランスフォーマーに導入し、静的畳み込みの局所性バイアスを維持しつつ表現力を向上。実験により、動的畳み込みが高難度の連想想起タスクでの性能を向上させ、標準トランスフォーマーを一貫して上回ることを示した。計算量に対する優位性も確認され、効率的なトレーニングを実現するカスタムTritonカーネルを提供。動的ショート畳み込みはトランスフォーマー技術の進展に寄与することを示唆している。 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…


関連:
- [Paper Note] Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers, Zeyuan Allen-Zhu+, ICML'24 Tutorial




Paper/Blog Link My Issue
#NLP #Search #LanguageModel #SelfImprovement #PostTraining Issue Date: 2026-06-05 GPT Summary- Bidirectional Evolutionary Search(BES)は、自己改善する言語モデルの探索フレームワークとして提案されている。前方探索で進化演算子を使用して新しい候補を生成し、後方探索でタスクをサブゴールに分解し、密なフィードバックを提供する。これにより、狭いエントロピー領域から脱出し、必要なサンプル数を指数的に削減可能。実験では、BESが既存の事後学習アルゴリズムを上回る結果を示し、オープン問題解決ベンチマークで優れた性能を発揮することが確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Distillation #PostTraining #On-Policy #Stability #One-Line Notes #LongHorizon Issue Date: 2026-06-05 GPT Summary- オンポリシー蒸留(OPD)は、モデルから小型学生モデルへの能力移転に成功しているが、マルチターンエージェント設定では十分に検討されていない。本研究では、OPDの課題としてKL不安定性を特定し、これが学生モデルの訓練を不安定にさせる主な要因となることを示す。これを解決するために、時間的カリキュラム・オンポリシー蒸留(TCOD)を提案し、短いから長い軌跡への段階的な拡張を行う。実験により、TCODはKLの安定性を向上させ、従来のOPDより最大18ポイントの性能向上を実現することが確認された。 Comment

元ポスト:

Loading…

multi-turn/long-horizonな設定でのOPD手法。multi-turnな設定の場合、教師モデルへのcontextにエラーが蓄積されていき徐々に教師モデルのsignalの信頼性が低下する問題があり、これに対処するためにOPDを適用するtrajectoryのターン数を序盤は短く、徐々に長くしていくようなカリキュラムで学習をする手法を提案。ターン数を深くする方向として、Forward-to-Backward/Backward-to-Forwardの2種類のシンプルな手法を用いて実験をしている。

image




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel Issue Date: 2026-06-05 GPT Summary- マルチエポック学習が一般的になる中、単一モデルの飽和問題を解決するため、モデル集団の探索と予測統合への転換を提案。ハイパーエポック事前学習(q0)を導入し、マルチエポック予算を多様なモデルへ変換、これにより検証損失が低下。q0は三つのコアプリミティブ(反相関学習、チェーン蒸留、学習済み分布の適合)に基づく。18億パラメータモデルで約56エポックで強力な256エポック基準に匹敵する性能を達成し、データ効率を約12.9倍向上。予算に応じた最適なエポック使用法を提示。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #SelfDistillation Issue Date: 2026-06-04 GPT Summary- オンポリシー自己蒸留は、言語モデルが自身の生成を特権的文脈で監督する手法で、スパース報酬強化学習に対する密な監督信号を提供する。これを逆Kullback–Leibler発散損失で具現化し、自己蒸留型方策勾配フレームワークSDPGを提案。SDPGはグループ相対検証やKL正則化を活用し、従来のベースラインよりも安定性と性能を向上させる。コードは公開されている。 Comment

元ポスト:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Distillation #SubliminalLearning #One-Line Notes #Steering Issue Date: 2026-06-04 GPT Summary- 潜在的学習とは、学生の言語モデルが教師の特性を微調整することで獲得される現象であり、意味を持たないデータから特定の特徴が伝達される仕組みは未解明である。本研究では、潜在的学習がステアリングベクトルによって媒介されることを示し、教師のプロンプトがこのベクトルによく近似され、学生が整合したベクトルを学習することを発見した。ステアリングベクトルに近似されないプロンプトは学習されないことも示され、その影響がモデルの活性化に及ぶことを明らかにした。潜在的学習には適応型オプティマイザが必要であり、勾配の一貫性が成果に影響を与えることが確認された。 Comment

元ポスト:

Loading…

Subliminal Learning:
- [Paper Note] Subliminal Learning: Language models transmit behavioral traits via hidden signals in data, Alex Cloud+, arXiv'25

Subliminal Learningが生じるのは、教師モデルが生成したデータを通じて生徒モデルが残差ストリームに対するsteering vectorが蒸留されるからであり、教師モデルが生成した何らかのデータを通じて教師モデルと同じ方向にactivationが誘導されるようになるため、という説明のようである。また、subliminal learningが生じるためにはAdamのような適応的なoptimiserが必要で(外れ値の勾配が支配的にならないため)、LoRAのような低ランクでのファインチューニングで生じやすく、フルファインチューニングでは発生しづらいとのこと。

また、細かく読めていないが、16種類の動物に関する特性に関する残差ストリームのsteering vectorを抽出し実験をした結果、steeringは実験の結果モデル間の転移は弱く、モデルアーキテクチャが共通の場合にうまく転移することが示され、このことから、モデル固有のsteering方向に依存することが示唆されるようである。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #LatentReasoning #One-Line Notes Issue Date: 2026-06-03 GPT Summary- 大規模言語モデルの推論能力を向上させるために、自己回帰的生成の代わりに作業記憶ブロックを採用するReasoning in Memory(RiM)が提案される。これにより、内部計算と外部通信の混同を回避し、計算効率の高い潜在推論を実現。2段階のカリキュラムを用いて、まず推論ステップを予測し、その後最終回答の洗練を行う。実験により、RiMが既存の方法と同等かそれ以上の性能を示すことが確認され、作業記憶が潜在推論の有効なメカニズムとして機能する可能性が示された。 Comment

元ポスト:

Loading…

元ポストのgifが端的にアーキテクチャを示しており非常にわかりやすい。

メモリブロックと呼ばれるboundaryトークン ``とm個のメモリトークン``を追加で入力する事で、latencyを劣化させることなくLLMの内部状態を更新(latent reasoning)する手法で、単にメモリブロックを追加するだけではうまくLLMは扱えないので、メモリブロックを用いた推論方法を学習させる、という話に見える。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Evaluation #PostTraining #GPUKernel Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #MultiModal #Selected Papers/Blogs #memory #interactive #KeyPoint Notes #Reading Reflections #AgentHarness Issue Date: 2026-06-03 GPT Summary- マルチモーダル大規模言語モデルが長期エージェントとして機能するためには、記憶が進化する世界に適応し、適切な証拠を提示する必要がある。しかし、従来のベンチマークは静的なリコールに依存しており、記憶の生成における失敗を特定できない。これに対して、我々は記憶を「アクション-ワールド・インタラクション・ループ」として定式化し、WorldMemArenaを実装。ここでは、400件のマルチセッション・マルチモーダルタスクを通じて、記憶の診断が可能となる。結果として、記憶書き込みは必ずしも性能向上に繋がらず、視覚的証拠の活用が依然として困難であることが示された。また、エージェントの実行はドメインを跨いで不安定で、コストと信頼性のトレードオフが浮き彫りになった。 Comment

元ポスト:

Loading…

著者ポスト2:

Loading…

以下著者ポストの要約

既存のメモリに関するベンチマークは、「静的な環境」において過去のコンテキストから情報を「復元」できるかをテストしているが、それを超えて、
- Lifelong Evolution(動的): ユーザとプロジェクトの状態が変化する世界において、
- Agentic Execution(書き込み・維持・検索・活用): エージェントが観測結果、アクション、ツール実行結果、環境の変化から再利用可能なメモリを構築できるか

をカバーするベンチマークを構築。ベンチマークは461個の複数セッション・マルチモーダルなタスクが含まれ24k QAペア・15kの画像・スクリーンショット、高速な評価のための150サンプルによるサブセットによって構成される。

image

評価では、
- long-contextのエージェントのcontextに入れ込むメモリ
- 人間がデザインしたメモリ(RAG, メモリパイプライン等)、
- agent harnessがメモリ管理をするタイプのagent

の3種類を評価。

image

- Takeaway
- メモリへの書き込みの品質が高くても、必ずしもエージェントがうまく活用できるとは限らない
- 現在の手法ではマルチモーダルな情報に対するメモリはまだ困難で、視覚的/空間的/手続き的な情報を失う
- 重要な情報がアクション、フィードバック、スクリーンショット、状態の更新等に分散している場合にメモリは劣化し、これは現在の多くのシステムが整理されたテキストベースの履歴を扱うことに長けている一方で、実際のinteractionのtrajectoryから情報を抽出・更新・再利用することには課題があることを示唆
- agent harnessに基づくメモリはinteraction中に自動的にメモリが記録・抽出・推敲されるため柔軟性が高く有望なアプローチだが、harness designに性能が依存するため、 性能が不安定

評価結果を見ると、一言にメモリと言っても多様な観点からmetricsが定義でき、手法によって性能に大きな開きがある点や実用的な観点の実験設定となっており興味深い。様々な要素が関わってくるため、一概にこの手法が良いというのもあまり言えなさそうに見える。あとなんやかんやRAGが全体的に性能が良さそうに見えるが、結果の解釈が難しく、何らかの単一の尺度などに押し込めたりしないだろうか。

pj page: https://worldmemarena-mem.github.io/




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #MultiModal #read-later #Robotics #VisionLanguageActionModel Issue Date: 2026-06-03 GPT Summary- DynaFLIPは、ロボット操作のためのダイナミクスを意識した多モーダル事前学習フレームワークで、運動理解を知覚に統合します。異種の人間とロボットのビデオから構築したトリプレットを用い、画像のみのエンコーダを訓練。三つのモダリティが小さなシンプレックス体積を形成するよう促し、その体積が小さいほど整合が強くなります。シンプレックス体積最小化をコサイン正則化項と対照学習と組み合わせ、重要な制御関連領域に焦点を当てたダイナミクス認識表現を得て、視覚バックボーンとして機能します。多様なシミュレーションと実世界の設定で検証した結果、分布外の状況下で最大+22.5%の改善を達成。視覚表現が行動による世界の変化をエンコードすることで、ロボットの一般化能力が向上することを示唆しています。 Comment

pj page: https://dynaflip-robotics.github.io/

元ポスト:

Loading…

pj page: https://huggingface.co/jlee-larr/dynaflip-base




Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #Initial Impression Notes Issue Date: 2026-06-03 GPT Summary- ロジットを用いずにチャンクレベルの監督信号で教師からのフィードバックを利用する新しいフレームワーク、OmniOPDを提案。これにより、教師モデルへのアクセス制限とトークンレベル信号の脆弱性の問題を解決。ベンチマークにおいて、OmniOPDは標準OPDを最大+28.64%上回り、高い不確実性の場面でのみ監査するよう設計されている。また、より強力なブラックボックス型教師を用いた場合には、オープンウェイト教師に対してさらに+9.54%の向上を示し、自律的な強化学習の性能を超える結果をもたらした。 Comment

元ポスト:

Loading…

大抵のProprietaryモデルは出力から競合となるモデルを学習することを禁止していると思うのだが、果たして




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Analysis #MachineLearning #NLP #Self-SupervisedLearning #One-Line Notes #LatentRepresentation Issue Date: 2026-06-02 GPT Summary- 生成モデルは、訓練データの量が生物的学習者に比べて大きくなる中で高い性能を示している。新たな手法として、ネットワークが潜在表現を予測する訓練が行われており、これがデータ効率の改善につながる可能性がある。本研究では、確率的文脈自由文法(PCFG)をデータに用いて、潜在予測が効率を高めることを示す。教師あり学習は指数的なサンプル数を要するのに対し、潜在予測は定数のサンプルで達成可能であることを明らかにした。また、階層的クラスタリングやエンドツーエンドのニューラルネットワークを用いた分析を通じて、data2vecが階層的潜在予測を実行していることを確認し、明示的なスタッキングの冗長性を示唆している。 Comment

元ポスト:

Loading…

JEPAのようなモデル自身が獲得した潜在表現を予測する自己教師あり学習手法は、階層的な生成構造を持つデータに対して、トークンレベルの予測ではO(m^{L+1})のサンプルが必要となるが、O(m^3)程度で済むことが理論的に示された模様。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Initial Impression Notes #Environment Issue Date: 2026-05-31 GPT Summary- 現代のAIベンチマークでは、複雑なタスクが多く含まれ、人間の注釈では検知が難しい問題が存在します。これを解決するために、Auto Benchmark Audit(ABA)を導入し、168のベンチマークを調査。ABAは、あいまいなタスク設計や実行環境の衝突など、25.7%以上のタスクで重大な問題を特定。問題のあるタスクがモデル評価を歪めることを示し、除外することでパフォーマンスが9.9%及び9.6%向上することを確認。今後のベンチマーク発展のため、これらのツールとタスク注釈を公開します。 Comment

元ポスト:

Loading…

既存のベンチマークを
- 指示の曖昧性
- 環境に内包される問題(競合や依存関係の問題)
- 評価の品質

の観点から監査するAudit Agentの提案
image




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- エージェントのリソース消費に対し、コストを実行後にのみ測定するのではなく、予算を積極的な制御信号として扱うべきと提案。予算は内部(計算由来)と外部(行動由来)に分け、エージェントは各計画ステップで残り予算の予測と警告を行う。評価では、強力なエージェントが必ずしも予算意識を持たず、過度に楽観的な傾向が見られた。予算意識信号は訓練可能で、早期停止により失敗したトークンを28〜64%削減でき、SFT+RLがその効果を強化。しかし、正確な区間のキャリブレーションは依然難しい。 Comment

pj page: https://ragen-ai.github.io/bagen/

元ポスト:

Loading…

以下著者ポストと論文のskim readによるサマリ(読み違えがあるかもしれないので注意)

LLM/AI Agentがbudget(あとどの程度のトークンでタスクを完了できるかの見積もり)を考慮して生成できているか否かを明らかにし、性能とトークン予算の性能は必ずしも相関しないことを示し(現在のフロンティアモデルはトークン予算に対して楽観的で、トークン予算があまり残っていないのに不必要に多くのトークンを消費する)、与えらえたトークン予算に関して、タスクを実現できるか否かの2値分類ははSFTによって強化できる(Qwen-7Bにおいて25.5%->90%まで向上)が、SFT+RLによって正確な残りの予算のrangeを当てるような推論は47%程度で頭打ちで課題が残る、という話に見える。興味深い。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Chain-of-Thought #Reasoning #Overthinking Issue Date: 2026-05-31 GPT Summary- ReasonOpsは、チェーン・オブ・ソートの痕跡を分析するための教師なし手法であり、推論の過程を注釈付けするための普遍的な演算子を提供します。12のモデルから44,662の痕跡を分析した結果、共通の構成的な構造が明らかになりました。特に、バックトラッキングや仮説設定などの再発する演算子が全モデルに見られ、内省的演算子は難問でより効果的であることが示されました。演算子のシーケンスを用いることでモデルの高精度な識別が可能になり、早期の品質推定も実現しました。ReasonOpsは、LLMの推論痕跡に対する深いインサイトを提供し、性能予測の強化に寄与します。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #mid-training #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#OpenWeight #VideoGeneration/Understandings #One-Line Notes #DistributedLearning Issue Date: 2026-05-31 GPT Summary- Paris 2.0は、分散計算を駆使した事前学習動画生成モデルで、従来のParis 1.0に基づいている。新モデルは、時系列的一貫性を実現し、低解像度のテキストから動画生成において、従来のモノリシックモデルと比べてFrechet Video Distanceを約2.0倍改善した。また、CLIPテキスト-動画類似度や美的スコアも向上した。 Comment

HF: https://huggingface.co/bageldotcom/paris2

元ポスト:

Loading…

Paris2.0は独立した拡散モデルのアンサンブルによって実現される(巨大なGPUクラスターを必要としない)動画生成モデルで、それぞれのエキスパートはエキスパート間でパラメータや勾配をcommunicationせず、独立したデータによって学習されており、推論中は軽量なルータが各ノイズ除去のステップにおいてサブセットを選択することでデノイジングを進めていくとのこと。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #MultiModal #PostTraining #KeyPoint Notes #ToolUse Issue Date: 2026-05-31 GPT Summary- 視覚と言語を統合したモデルは、複雑な問題解決において外部ツールの使用が不可欠である。エージェント的推論は、自己完結型思考とツール使用の非対称な行動を交互に行い、このギャップをThinking-Acting Gapと呼ぶ。標準的なRL手法ではツール使用が限定的で、多くの場合誤りを含む。AXPO(Agent eXplorative Policy Optimization)を提案し、ツール呼び出しの再サンプリングを行うことでこの問題を改善。実験の結果、AXPOは複数のマルチモーダル・ベンチマークで従来手法を上回る性能を示し、パラメータ数を抑えつつ効果的な結果を得た。 Comment

pj page: https://byungkwanlee.github.io/AXPO-page/

元ポスト:

Loading…

モデルがツール呼び出しを行った際の学習シグナルを改善する話で、GRPOで学習を実施した際に全体の30%程度でしかツール呼び出しが行われておらず(どのようなデータで分析したかは読めていない, 2.2節あたり)、そのうち40%程度が応答で誤っておりGRPOで正のadvantageが発生せず、ツール呼び出しに関して精緻なpositiveなシグナルが得られていない問題がある。これを改善するために、ツール呼び出し前のthinkingは正しく、ツールの呼び出し方とその結果が典型的に誤っていることに着目し、ツール呼び出しの上で失敗したrolloutについて、thinkingまでをprefixとしてツール呼び出し以後をresamplingする手法を提案。これにより、ツール呼び出しの頻度が改善し、ツールが呼び出された場合に応答に失敗する割合も減少した。

image

image

pj page: https://byungkwanlee.github.io/AXPO-page/




Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #Evaluation #Conversation #read-later #Emotion #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- 感情知性(EI)の評価が重要になる中、AttuneBenchを紹介。実際の複数ターンの人間-モデル対話200件に基づき、感情状態とモデルの挙動をターンごとに注釈。11モデルの評価結果は感情認識や応答品質に関する能力が分離可能であることを示し、嗜好の整合と応答品質の判断がモデル識別に強く寄与することを明らかに。AttuneBenchは、感情的に重要な会話の評価枠組みを提供し、モデルの強みや弱点を診断する。 Comment

元ポスト:

Loading…

leaderboard: https://public.attunebench.com/

対話をしている本人によるプロンプト、アノテーション、マルチターンの会話を前提にモデルのEQを測定するためのベンチマークのようである(従来は合成プロンプト、シングルターン、third-partyに基づいたアノテーション(つまり対話している本人ではない、ということだと思われる)によるベンチマークだったとのこと)。




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #DiffusionModel #ICLR #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-05-31 GPT Summary- DiffusionBlocksは、Transformerベースのネットワークを独立した訓練可能なブロックに変換する新しいフレームワークで、メモリボトルネックを軽減しながらエンドツーエンド訓練と同等の性能を維持します。残差結合の特性を活用し、各ブロックが独立に学習できるため、メモリ要件が削減されます。視覚系や拡散など多様なTransformerアーキテクチャに対する実験により、DiffusionBlocksがスケーラブルな訓練を可能にすることが示されています。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=pwVSmK71cS

巨大な残差接続を持つTransformer-likeなモデルをB個のブロックに分割し、ブロック単位で独立してパラメータを学習することによって、学習時に必要なメモリを1/Bに削減できる手法のようである。

(しっかり読めていないので色々と勘違いがあるかもしれないし、気持ちの部分をうまく表現しきれていないかもしれないが)
手法の概要としては、L layer単位でブロックをB個定義する。各ブロックにはnoise rangeの元ノイズを定義し、sample data (x, y)がgivenな時に、出力yにノイズを付与した~yを考える。~yから元の出力yを再現するようデノイジングするように、他のブロックはfreezeしたままで、あるブロックのパラメータを調整する、という操作を繰り返す、という手法のようである。Inference時は、平均0、学習時に定義したnoiseレベルの最大値を分散として持つ正規分布からノイズをサンプリングし、ノイズをinput xがgivenな状態で各ブロックでsequentialにdenoisingしていく(Euler Step)ことによって、最終的に所望の出力yを得る、といったような拡散モデルの逆プロセスを経て出力を得るようである。各ブロックがカバーするノイズのrangeは決まっているが、sequentialにdenoisingをしていくため、ブロック全体でみると大きなノイズからスタートするが、それぞれのブロックに対する入力のnoise levelは徐々に低減していき、各ブロックが担当するnoise levelのrangeまで落ちることが期待され、このような手続きが実現できると思われる。

image




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Scaling Laws #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- UNSLと呼ばれる関数形を提案し、複数の次元が同時に変化する際の深層ニューラルネットワークのスケーリング挙動を正確にモデル化。モデルパラメータ、データセットサイズ、トレーニングおよび推論ステップ数、計算量などが影響を与える様子を示し、大規模なビジョン、言語、数学、強化学習タスクに適用。既存のスケーリング関数と比べ、より精度の高い外挿を実現。 Comment

元ポスト:

Loading…

データセットサイズ、推論ステップ数、幅、深さ、初期化時の重みの標準偏差、学習率、バッチサイズを変数に持ち、それらを同時に変化させても外挿可能なScaling Lawsのようである




Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #ComputerUse #PostTraining #RLVR #VisionLanguageModel #Initial Impression Notes #Environment Issue Date: 2026-05-31 GPT Summary- CUA-Gymは、検証可能な報酬を伴う強化学習を支える新しいスケーラブルなパイプラインで、タスク指示、環境状態、報酬関数を共生成。生成エージェントと判別エージェントがタスク仕様に基づく報酬を生成し、オーケストレータエージェントがこれを推進。高忠実度のモックWebアプリケーションを合成し、32,112の検証済みRLVRトレーニングタプルのデータセットを構築。GSPOでの学習により、既存のCUAsを超える成果を達成し、性能のスケーリングを示唆。本研究の成果物はオープンソース化される予定。 Comment

pj page: https://cua-gym.xlang.ai/

元ポスト:

Loading…

CUAのためのRLVRデータを合成できる環境の提案




Paper/Blog Link My Issue
Issue Date: 2026-05-31 GPT Summary- 自然言語からコード生成における正確性を高めるため、私たちはVeriSpecGenを提案します。これは、帰属と修正を通じて意図に沿った仕様を合成するリファインメント・フレームワークです。自然言語を原子レベルの要件に分解し、明示的な追跡マップで生成された仕様を検証します。検証失敗時には、追跡マップを基に修正が可能です。VeriSpecGenはVERINA SpecGenタスクで86.6%の成績を収め、他のモデルより最大31.8ポイント上回ります。また、343,000件の訓練例を生成し、仕様合成を62–106%改善し、一般的な推論能力にも貢献することを示しました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-30 GPT Summary- 大規模言語モデル(LLMs)用にスケール可能な局所線形アテンション(LLA)を提案するParallaxを導入。LLAの数値解法を排除し、アテンション機構を効率化。FlashAttentionに対して高い演算強度を実現し、事前学習全体で一貫したパープレキシティ改善を確認。新たな現象MuonによりParallaxの能力を向上させた。この研究は、注意機構のアーキテクチャとオプティマイザの共同設計の重要性を示す初の例である。 Comment

元ポスト:

Loading…

Muonと組み合わせると非常に高い性能を発揮するようである

早速nanoGPT speedrunでParallaxによってSoTAが更新されたようである:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #CVPR #2D (Image) #Editing #ImageSynthesis #Initial Impression Notes #ImageToLayer Issue Date: 2026-05-28 GPT Summary- 多層透明画像の生成と編集に特化した200億パラメータのマスク領域拡散モデル「MRT」を提案。テキストおよび画像からのレイヤー生成を統合し、柔軟なレイヤー単位の操作を実現。オーバーフロー対応のキャンバスレイヤーによって、透明な背景合成をサポートし、リアルタイムの生成を可能に。実験により、従来の技術を大きく上回る性能を示し、特に編集品質や推論速度で優位を獲得。 Comment

元ポスト:

Loading…

pj page: https://mrt-cvpr.github.io/

画像生成ではなく、layer生成にフォーカスした研究で、text-to-layer generation, image-to-layer decomposition, layer-to-layer addition, layer-to-layer restylizationなどが可能なようである。




Paper/Blog Link My Issue
#NLP #LanguageModel #PostTraining #CurriculumLearning #DataFiltering #One-Line Notes #SparseAutoencoder #Data Issue Date: 2026-05-28 GPT Summary- モデル内部情報がLLMのデータ処理方法に重要である一方、外部信号に依存したデータエンジニアリングは内在信号を無視していることを指摘。SAERLを提案し、Sparse Autoencoderを用いて多様性、難易度、品質の三つのデータ特性をモデル化。これにより、バッチ多様性や難易度の順序づけ、データフィルタリングを実現。SAERLは平均精度を3.00%向上させ、少ないトレーニングステップで目標精度に達することを示し、効果的なデータエンジニアリングツールとしての役割を果たすことが確認された。 Comment

元ポスト:

Loading…

SAEのrepresentationを、interpretabilityに活用するのではなく、post-trainingの学習データに対するdata engineeringに使うことで、costのかかる手法ではなく**より低コストで**data engineeringを実現したい、という気持ちの研究。提案手法では、SAEによって獲得されるrepresentationに基づいてpost-trainingの学習データに対して、
- 多様性: SAErepresentationを用いてクラスタリングを実施し活用
- 難易度: 軽量なElasticNetに基づく回帰モデル(特徴量はSAE representation)によって難易度予測モデルを学習し、クラスタIDに基づいて難易度をキャリブレーション
- 品質: SAE representationに基づいてqualityを判断する二値分類器を学習しその確率値を使うようである

ぱっと見よくわからないのが、
- difficulty-labeledなsubsetの正体はなんなのか?
- それは幅広いドメインで入手可能なものなのか?
- in-distributionな難易度であればElasticNetで予測できたということだが、in-distributionなdifficulty-labeledなデータがないと提案手法は原則として適用できないということなのか?

という疑問はある。


image




Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #OOD #Generalization #SpatialUnderstanding Issue Date: 2026-05-27 GPT Summary- 空間基盤モデルの真の一般化能力を評価するために、決定論的サンプリングを用いた新しいベンチマークSpatialBenchを提案。これにより、19データセットと546シーンを通じて5つの空間ドメインで41モデルを評価。結果は現行モデルが「万能プレーヤー」には至っていないことを明らかにし、精度向上には全文脈アテンションが有効で、有限メモリ戦略がスケーラビリティを改善することを示した。身体性を伴うタスクでは、高品質データが性能向上に重要であることも明らかになった。さらに、評価を超えてDA-Next-5MデータセットとDA-Nextモデルを導入し、空間表現学習の可能性を広げる。 Comment

pj page: https://ropedia.github.io/SpatialBench/

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Stability #ActivationFunction #Initial Impression Notes #LowPrecision Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLM)において、SwiGLU活性化関数は非線形性を導入するが、大きな入力での数値的不安定性が問題。これを解決するために、新たに提案したPowLU活性化関数は、安定した訓練を実現し、表現力を向上させる。実験では、PowLUがSwiGLUやSwiGLU-Clipと比較して競争力のある結果を示し、スケーラビリティの向上も確認された。 Comment

元ポスト:

Loading…

Layerが深いモデルや、低精度(FP8/FP4)に対して、事前学習の安定性を高める活性化関数




Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #SSM (StateSpaceModel) #reading #LinearAttention Issue Date: 2026-05-27 GPT Summary- トランスフォーマーに基づく大規模言語モデルのアテンション機構が長期タスクでスケールしにくい問題を解決するため、睡眠様の統合機構を提案。モデルは睡眠中に文脈をファストウェイトに変換し、指定されたタスクでオフラインで学習を行う。実験により、提案手法がより深い推論を必要とするタスクで性能向上を示し、従来のトランスフォーマーとハイブリッドモデルに対する優位性を証明。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #SelfImprovement #ScientificDiscovery #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment

元ポスト:

Loading…

現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。

image

image

ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。

データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。




Paper/Blog Link My Issue
#NeuralNetwork #EfficiencyImprovement #NLP #LanguageModel #Transformer #reading Issue Date: 2026-05-27 GPT Summary- CODAは、トランスフォーマーのオペレータをGEMMプラスエピローグとして再パラメータ化し、計算をメモリ書き込み前に実行可能にするGPUカーネルの抽象化である。このアプローチにより、データ移動のボトルネックを軽減し、標準的なTransformerブロックの計算を効率化。代表的なワークロードで高性能を達成し、生産性と効率を両立する道を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Transformer #ICLR #One-Line Notes #SparseAttention Issue Date: 2026-05-27 GPT Summary- 本研究では、MLベースの気象予測のスペクトル劣化に対応する確率的モデル「Mosaic」を提案。三つの故障モードを扱い、アンサンブルメンバーを生成する。1.5°解像度で214Mパラメータを持つMosaicは、高解像度モデルに匹敵する性能を示し、ほぼ完璧なスペクトル整合性を達成。予報は高速に実行可能で、コードも公開中。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=u0KcfOaRc7&referrer=%5Bthe%20profile%20of%20Max%20Welling%5D(%2Fprofile%3Fid%3D~Max_Welling1)

block-sparse attentionによるtransformerベースの天気予報モデル




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #reading #Initial Impression Notes #Reviwer Issue Date: 2026-05-27 GPT Summary- AIレビュアーの導入が進む中、その能力と信頼性には疑問が残る。多くの科学者はAIを専門知識を欠くシステムと見なす一方、他の研究者は楽観的である。AIレビュアーの評価を理解するため、本研究では、専門家による2,960件のレビューを評価し、その結果、GPT-5.2が人間レビュアーを上回る性能を示した一方で、他のAIレビュアーは最低評価の人間を上回った。ただし、AIレビュアーは重複や限定的知識に課題を持ち、人間の代わりではなく補完としての役割に留まることが明らかとなった。 Comment

元ポスト:

Loading…

Natureの82本の論文に対してAIにレビューを実施させ、人間の専門家がレビュー結果に対して大規模なアノテーションを実施し、現在のAIレビュワーの能力を評価。その結果、AIレビュワーは
- 根拠が明確で重要な問題点を明らかにし、人間よりも多くの問題点を指摘できるが
- レビューの結果は多様性に乏しく、重複した指摘が多い。
- また、コミュニティや分野における暗黙の了解や規範が欠如した指摘をしたり (W1: missing community / field norms)、過剰に厳しい、あるいはスコープ外や非現実的な要求を実施したりする (W2: over-harsh, out-of-scope, or unrealistic demands)

などの欠点があることが明らかになった、ということのようである。




Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Asynchronous Issue Date: 2026-05-27 GPT Summary- AstraFlowは、強化学習(RL)システムのデータフロー管理を自律的なコンポーネントに分離し、マルチポリシー協調訓練を効率的にサポートする新しいアプローチを提供する。これにより、従来のトレーナー中心の制御から脱却し、異種かつ跨地域の計算リソースを効果的に活用する。AstraFlowは、数学やコーディング、検索のワークロードで、既存RLシステムに匹敵する精度を保ちつつトレーニング時間を2.7倍短縮したことが示された。 Comment

元ポスト:

Loading…

github: https://github.com/Infini-AI-Lab/astraflow




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #reading #One-Line Notes #needs-revision Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLMs)の事前学習におけるスキル獲得の順序を理解するための「暗黙のカリキュラム仮説」を提案。シンプルかつ組み合わせ可能なタスクを用い、モデル間の一貫した出現順序を追跡。特定のパラメータ範囲で構成的なタスクが後に現れる傾向があり、モデルの表現に組み込まれていることを示す。予測可能な訓練経路を通じて、事前学習は構造化されていると示唆。 Comment

元ポスト:

Loading…

これは、著者ポストしっかり読みたい

- モデルファミリー・DataMixtureにはよらず、事前学習では構成的で、かつ予測可能なカリキュラムに則って学習が進行し、かつモデルの内部状態から各スキルがどのように学習されていくかを予測できるという仮説を立て、
- この仮説を検証するために、91種類の構成的なタスクを定義し、emergence(=当該タスクの性能が閾値を超えること)を4種類のモデルファミリーにおける9つのモデル、様々なDataMixtureの元で追跡した。タスクの例は以下:
- simple tasks: 文字列操作/形態素の変換/知識の抽出/翻訳など
- composite tasks: 複数の基礎的な操作のsequentialな組み合わせによって実現されるタスク
- たとえば、`gerund_upper` は大文字への変換➡︎動名詞への変換という順番で定義される。

image

- 様々なモデルファミリーをテストしたところ、LLMは事前学習の間におおむね(完璧ではないが)同じ順番でスキルを獲得していくことが明らかになった
- たとえば、Figure 1を見ると、性能の伸び方は異なるものの、閾値を50%としたときのemergenceの順番はモデルの間で一貫していることがわかる。Table2も参照のこと。

image

- composite tasksは、それらのタスクの構成要素が獲得された後にemergeすることが明らかになった(54/76ケース)
- 例外的に、composition taskが構成要素よりも先に習得されたものが3例ほど存在した
- また、あるcomposite taskの学習曲線を、類似したFunction Vectors [^1] を持つcomposite taskから予測できるか?(i.e., 類似したタスクは同じような学習曲線を持つか?)を検証。
- これを実施するために、composite taskに対してleave-one-outを実施し、類似したタスクのFunction Vectorsから学習の軌跡を予測できるかを実験したところ、R^2スコアが0.68--0.84程度の性能で予測することができた。
- Function Vectors: [Paper Note] Function Vectors in Large Language Models, Eric Todd+, arXiv'23, 2023.10

image

[^1]: Function Vectorsとは、LLMに遂行させるタスクのinput-outputの変換の関係性を保持し、タスクを遂行させる際にLLMに対して強い影響力を持つ内部のactivationsのことを指す。




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Medical Issue Date: 2026-05-27 GPT Summary- 医療分野でのLLMs評価は、ベンチマークの飽和やデータ制限のため困難である。30のベンチマークを含むオープンソース評価スイートMedmarksを導入し、61モデルを71設定で評価。その結果、最先端のモデルが最高性能を示し、ファインチューニングされたモデルが汎用モデルを上回ることが確認された。評価は医療推論のLLMsのポストトレーニング環境としても利用可能。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Selected Papers/Blogs #reading #One-Line Notes #DownstreamTasks Issue Date: 2026-05-27 GPT Summary- 信頼性の高い性能予測が必要な言語モデル開発において、クロスエントロピー損失や直接評価には限界があることを指摘し、代わりに専門家が執筆した解答のトークン分布からエントロピーや精度といったトークンレベルの統計を用いた代理指標を提案。これにより、モデル選択や事前学習データの選択、訓練時の予測において一貫して優れた結果を示し、専門家の軌跡がモデル能力評価において有用な信号であることを明らかにした。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

クロスエントロピーlossに代わるcandidate modelのdownstreamタスクの性能を間接的に測定するための代理指標の提案で、クロスエントロピーlossと比較。代理指標はexpertが作成したtrajectoryに対するcandidate modelのnext token predictionの分布(や、エントロピー等指標に基づく重みづけの組み合わせ)によって、算出される(式1, 2)。

image

6つの異なるモデルファミリーの18種類のreasoning modelにおいて、6種類のベンチマークにおいて、モデルのdownstreamタスク性能をランク付けできるかをSpearman Rhoで測定したところ、クロスエントロピーlossが0.36だったのに対し、提案した代理指標(を特徴量として用いたRankSVM)は0.81を記録。また、(あるLLMがある事前学習コーパスで学習された場合のdownstreamタスクでの性能の良さによって)事前学習コーパスの良さをランク付けするタスクの場合、ベースラインと比較して10,000倍計算コストを削減できたとのこと。

image

DataDecide testbed:
- [Paper Note] DataDecide: How to Predict Best Pretraining Data with Small Experiments, Ian Magnusson+, ICML'25, 2025.04




Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI Issue Date: 2026-05-27 GPT Summary- AI支援研究は進化し、自動化システムが低コストで論文を生成可能になったが、整合性の問題が浮き彫りに。特に、最先端のLLMでも結果の捏造や誤りの見逃しがある。研究ライフサイクルを四つの段階(Creation, Writing, Validation, Dissemination)で分析し、AIの信頼性と自律性の限界を特定。AIは構造化されたタスクには優れるが、新規のアイデアや実験には脆弱であり、人間の協働が最も信頼される。具体的なリソースはプロジェクトページで提供。 Comment

pj page: https://worldbench.github.io/awesome-ai-auto-research

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #InformationRetrieval #NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #MLSys Issue Date: 2026-05-27 GPT Summary- LEANNは、動的に再計算することでストレージ効率の高いベクトル検索を実現する新しいインデックス。元データ一部のみで高品質な検索を提供し、従来のインデックスに対して最大50倍のサイズ削減を達成。RAGアプリケーションでの高精度と同等のレイテンシを維持。 Comment

元ポスト:

Loading…

github: https://github.com/yichuan-w/LEANN](https://t.co/QwkYx1t0oa




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Steering Issue Date: 2026-05-26 GPT Summary- 活性化の誘導は、タスク挙動が活性化空間の線形方向に対応することに基づくが、研究によりこの前提が逆転することが示された。12タスクにわたる6つのモデルでの分析から、通常の操縦が成功する一方で、デコードできない場合も多く、FVsは計算的指示を符号化するが、回答の方向性は示さないことが明らかになった。また、モデル間の非対称性が確認され、線形表現仮説が「線形デコーダ可能性」と「線形ステアラビリティ」に分解されることで、それぞれが異なることも示された。これらの結果は、安全性モニタリングにおいて重要な示唆を含む。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Steered LLM Activations are Non-Surjective, Aayush Mishra+, arXiv'26, 2026.04




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #PostTraining #One-Line Notes Issue Date: 2026-05-26 GPT Summary- モデルは事前訓練による受動的な予測器から、事後訓練を通じて自身のオンポリシー生成を認識するように変わる。この認識は出力分布に影響を与え、オンポリシー時の出力エントロピーはオフポリシー時より3〜4倍低いことを示す。最新の入力トークンの予測されなさが出力エントロピーを調整し、事後訓練済みモデルは応答の話題についての不確実性を早期に収束させる。一方、異なる話題のプレフィルによってこの意図が崩れるとエントロピーが上昇する。また、モデルがオンポリシーの文脈を言語的に認識できることが確認されたが、そのメカニズムは暗黙の認識とは異なる。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Large Language Models as Optimizers, Chengrun Yang+, ICLR'24, 2023.09

以下元ポストの要約

- 事前学習済みモデルは「シミュレータ」であり、事後学習済みモデルは「実行者/演者」としてとらえた方がよい
- すなわち、自身の出力はアクションであり、その結果がフィードバックとして将来の自身の入力になるような関係の下駆動する。
- 事後学習済みモデルは自身の出力よりも、他のモデルの出力を読み込む場合にエントロピーが高くなる
- これは、モデルの入力に対するSurpriseの内部表現によって生じる。すなわち、過去のモデルの予測結果に対して、入力された直近のトークンがどれくらい尤度が低いか、によって出力のエントロピーがsteeringされる。
- モデルサイズが大きいほど、オンポリシー・オフポリシーの差が大きく、これはRL無しで、SFT+DPOだけのpost-trainingでも自己認識が生じる。
- また、「食べ物を思い浮かべて...」というinstructionを与えると、事前学習済みモデルと比較して、事後学習済みモデルは単一のトピックに確率質量を集中させる(つまり、計画を練っている)。これはシミュレータと実行者/演者の特性の違いとしてとらえられる。
- 事後学習済みモデルは、自身の計画がのっとられた場合も検知することができ、計画されていないprefillの場合は、出力トークンのエントロピーが大きくなる。一方、ベースモデルの場合はエントロピーにこのような効果はない(暗黙的な自己認識)。
- モデルに読んでいるテキストが自身が生成したものか、他人が入力したものかを判定させる実験を実施し、KV Cacheをパッチして挙動を分析。ユーザのintentがuser-token中の特定の位置の(おそらくKV Cache)に保持され(hidden activation)、ユーザの意図との整合性等の判定結果を出力する直前にのみ、hidden activationと応答内容の比較がなされていることがKV Cacheのパッチに基づく実験で明らかとなった(明示的な自己認識)。
- この結果は、意図を比較する際には、暗黙的な自己認識の場合と比較して、異なる回路(Surpriseとは異なる回路)をオンデマンドで誘発して利用していることを示唆している。
- (理解があまりできておらず、この説明で正しいかちょっと自信がない。論文中3.3節)




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #Optimizer #Finetuning #Stability #Backbone #One-Line Notes #Scheduler-free Issue Date: 2026-05-26 GPT Summary- Muonの直交化は、勾配の振動を引き起こす高曲率部分空間の影響を受けつつ、訓練の進展を加速する。一方、Anytime Muon(AMUSE)は、迅速な適応を図るために時間変化する補間係数を利用し、安定した平均化を通じて振動を抑制する。AMUSEは学習率スケジュールを排除し、視覚タスクと大規模言語モデルの事前トレーニングにおいて、性能を一貫して向上させる。 Comment

元ポスト:

Loading…

以下、上記著者ポストからの要約である。

MuonとScheduler-freeなoptimiserでの過去のtrajectoryの平均的な方向へ更新する考え方を組み合わせて、Muonの学習を安定させ、かつSchduler-freeを実現した模様。具体的には学習初期にはMuonの軌道を重視し、学習後半になるにつれ、ノイズの影響を低減するためにtrajectoryの平均方向に最適化する(時間変化する補完係数によって挙動が制御される)といったイメージのようである。

Muonがなぜうまくいくかの理論的な分析も実施されている。近年は損失関数の幾何構造をriver/valleyのようにたとえて表現するらしく、(Figure 1)、SGDは曲率の高い(勾配が急)な方向への更新される傾向があり振動をしながら川方向へ進むようだが、Muonはriver方向(曲率は小さいがモデルが最も学習が進捗する方向)への更新を増幅する働きがあるようである。しかし、ノイズとなる高曲率な谷方向への更新も増幅してしまいそれが振動や不安定さを生むため、それを是正するためにSchedule Freeな手法を組み合わせている、という気持ちのようである。また、先行研究に記載がある通り、WSDスケジューラをriver-valleyで説明する、Stableフェーズが川に沿った更新を促進し、Decayフェーズはパラメータを谷の底へ収束させる役割を果たしている、というイメージのようである。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Safety #PostTraining Issue Date: 2026-05-25 GPT Summary- 対立する目的を考慮したリバースアライメント手法(RACO)を提案。ペアワイズ嗜好データを利用し、効率的な衝突回避勾配降下法を用いて収束を保証。複数のLLMに対する実験で、提案手法が従来のアプローチよりパレートのトレードオフを一貫して改善することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Planning Issue Date: 2026-05-24 GPT Summary- エージェントの計画メカニズムを三つのシステム(シミュレーティブ推論、自己規制、反応的実行)に分解し、効率的な推論を実現する。SR^2AMを用いてLLMを世界モデルにし、計画と推論を行う二つの実装(v0.1およびv1.0)で、推論トークンの使用を大幅に削減。特にv1.0-30Bは、同等モデルと比較して推論トークンを25.8–95.3%少なく使い、計画の見通しを22.8%増加させることが示され、エージェントの学習と適応の自律性が強化されることを証明。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Evaluation #Reproducibility #Robotics #VisionLanguageActionModel #Reading Reflections Issue Date: 2026-05-23 GPT Summary- VLAモデルの実世界評価に向けた低コスト且つ再現性の高いベンチマークVLA-REPLICAを提案。市販部品で構築し、多様な操作タスクとデータセットを提供。実験により、再現性を確認し、モデルの特性を明らかに。 Comment

元ポスト:

Loading…

再現可能なベンチマークを作るのはロボティクスのような物理的な検証環境が必要なタスクの場合は確かに難しそうだな、と思うなどした(小並感)。オブジェクトの配置や景観、実際のロボットのパーツなど外的な要因が非常に多い気がする。




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-05-23 GPT Summary- オンポリシー蒸留は推論モデルの訓練に対し、トークンごとの監督信号を提供するが、その有効性を決定する条件は未解明である。本研究では、トークン、質問、教師ごとに動作する診断フレームワークを導入し、学生の成功確率を最大化する勾配を導出。理想の勾配との整合性を評価し、蒸留指導が誤ったロールアウトに対して高い整合性を示すことを発見。最適な蒸留文脈はモデルの容量とタスクに依存し、標準的な設定は存在しないことが示された。これにより、タスクごとの診断分析の重要性が強調される。 Comment

元ポスト:

Loading…

(下記は著者ポストに基づく要約です。ざっくり読んだだけなので誤りがあるかもしれず、詳細は著者ポスト参照のこと)

on-policy (self) Distillationが、どのような場合に有効なのかを分析。
トークンレベルで見た時に多くのトークンが教師-生徒間でdisagreementが存在し、これらにはフォーマットに起因するトークンと、reasoningに重要なトークンの双方が存在する。
そこで、本研究では各トークンにとっての最良の勾配を導出(=生徒が正答できる確率を最大化する方向のもの)。
最適なgradientの方向がわかったので、あとは実際に蒸留をした場合の各トークンのgradientとのコサイン類似度を測ることで、どのような場合にdistillationが有用やシグナル(すなわち、生徒が正答できる確率を高めることに寄与しているか)を分析した。

分析の結果
- distillationが役に立つ場面は、生徒が誤ったロールアウトをしているケースで、正解のロールアウトをしている場合は教師モデルは役立つシグナルではなくノイズを与えているだけだった。
- 教師モデルのパラメータは大きければ大きいほど良いわけではなく、有効か否かは生徒モデルが学習シグナルを理解できるかに依存する。
- たとえば、BoolQというデータで生徒がQwen0.6Bだった場合はself-teacherに基づく勾配が、より大きな外部teacher(4--14B)による勾配と比較して、理想的な勾配に近かった(より高い類似度だった)。
- 一方で、同じデータセットで生徒モデルを1.7Bにすると、8Bの外部teacherが最も理想的なシグナルと高い類似度の勾配をもたらし、self-teacherはあまりうまく機能しなかった。
- contextのフォーマット(生のtrajectoryか要約か, mistakeを含めるか否か等)が、教師モデルの選択と同じくらいの重要
- MMLUデータでの実験で、0.6Bモデルが生徒の場合は、32Bモデルが書いたsolutionをcontextとして与えたself-teacherが理想的な勾配により近く、1.7Bの生徒の場合は、要約されたsolutionの方が良い。
- AIMEの場合、hardな問題の場合は、正解だけでなく失敗例 /典型的なミスをcontextとして与えたself-teacherが良い一方で、easyな問題では常にパフォーマンスの劣化を招く。

以上より、タスクごとに有用なdistillationの設定を模索することの重要性が示唆される、

という感じのようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #On-Policy #reading #One-Line Notes Issue Date: 2026-05-23 GPT Summary- Variational Policy Distillation(VPD)は、強化学習におけるまばらな報酬信号の問題を解決する新たなフレームワークであり、言語フィードバックから密なトークンレベルの監督信号を生成する。これにより、教師と学生ポリシーを共進化させ、教師は軌道結果に基づいて能動的に洗練され、学生はこの情報を内在化する。科学的推論やコード生成タスクにおいて、VPDは従来の手法を一貫して上回る性能を示し、受動的蒸留の限界を克服することを目指す。 Comment

元ポスト:

Loading…

提案手法の全体像を説明する図が論文中に欲しい。式(3)が天下り的に出てきて、私の勉強不足によりこの式を前提に論理展開がスタートする気持ちがよくわからない(おそらくDPOあたりをもっとしっかり理解するとわかるのだろう)。

が、現在のself-teacherに基づくOPSDは、textual feedback Cに対して最適化されておらず、かつzero-shotによる予測を実施しているため、学習が継続するにつれてfeedbackにいつか限界が生じるため学習のために有用なシグナルがなくなるのではないか、という考察に基づき、

textual feedbackから学習する枠組みvariational inference problemの観点から考え直す。すると、KL Divergenceによって正則化されたRLVRは式(3)によって定式化されるreward functionによって傾斜がつけられた最適な事後分布pi_*に対して、ポリシーのKL Divergenceを最適化する問題と等価になる。このとき式(3)の分母にはZ(x)が存在しこれは計算ができない。このため、これを解決するためにteacher network q_phi (y | x, C) を導入し、最適な事後分布pi_thetaの近似的な教師分布とする。これによりELBOを用いた変分下限のRLVRの目的関数を定義することができ、これはEMアルゴリズムによって解くことができる。具体的には

- Eステップ: q_phiとpi_optimalのKL Divergenceが最小となるようにq_phiを更新する。
- Mステップ: pi_thetaとq_phiのKL Divergenceが最小となるようにpi_thetaを更新する。

このとき、EとMではphiとthetaのパラメータが独立して存在するが、実用上はphiとthetaを共有する。これにより、textual feedback Cを解釈する教師モデルと学生モデルの双方がco-evolvingしていくような学習が実現される、

という感じだろうか。

ELBOについて:
- 変分オートエンコーダ⑥変分下限 ELBO: https://note.com/kikaben/n/n00ad3e148770




Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #LatentReasoning #RecurrentModels #RecursiveModels #Initial Impression Notes Issue Date: 2026-05-23 GPT Summary- 潜在状態を反復的に更新することで推論のスケーリングを実現するモデル(EqR)を提案。これにより、タスク特異の情報なしでテスト時のスケーリングが可能に。内部ダイナミクスを深さと広さで調整し、アトラクターへの収束を強化。シンプルなケースは少ない反復で収束し、難しいケースではスケーリングが有効。最終的には、精度がSudoku-Extremeで99%以上に向上。学習されたアトラクターの分布が反復的推論の理解に寄与することを示唆。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05

本研究とモチベーションが非常に類似しているように感じる。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Transformer #Architecture #LatentReasoning #RecurrentModels #RecursiveModels Issue Date: 2026-05-23 GPT Summary- LT2(Linear-Time Looped Transformers)は、ループ処理と線形またはスパースアテンションを組み合わせ、計算コストを削減する新しいアーキテクチャ。これにより反復的なメモリ精緻化や有効受容野の拡張が実現され、従来のモデルの性能を上回る。LT2-hybridでは異なるアテンションバリアントを組み合わせ、効率と品質の両面で最適化。約1Bトークンの訓練データで、変換済みモデルは業界標準を超え、ループ型トランスフォーマーのスケーラビリティを向上させる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Diversity #Selected Papers/Blogs #EntropyCollapse Issue Date: 2026-05-23 GPT Summary- LLMが新しい環境に適応し、多様なタスク固有の報酬を持つロールアウトを選択できるように、Vector Policy Optimization(VPO)を提案。VPOはベクトル報酬空間を活用し、テスト時検索で最強のスカラーRLベースラインと同等かそれを上回る性能を示す。進化的探索においては、従来のモデルでは解決できない問題を解決可能。多様性の最適化が今後のポストトレーニング目標となる可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #DataFiltering #One-Line Notes #Reading Reflections Issue Date: 2026-05-23 GPT Summary- 高計算資源を活用したスケーリング研究で、大規模モデルの事前学習におけるデータフィルタリングを検討。一般的に思われる高品質データのみが必要との見解に反し、実験は、十分な計算資源があればデータフィルターなしが最良であることを示す。訓練された大規模モデルは低品質や誤誘導データを受け入れ、むしろ「質の悪い」データからも恩恵を得ることが判明。 Comment

元ポスト:

Loading…

LLMの事前学習において、十分に大きなモデルサイズと計算量があれば、データフィルタリングをしない場合の方が最終的にperplexityがデータをフィルタリングしたモデルよりも上回る。これはbad data (e.g., トークンのシャッフル, ランダムな文字列の挿入)を追加した場合でも当てはまる。

データプールのサイズが大きな数な場合でも、フィルタリング手法とフィルタリングがない手法との交差点が変わるのみで、その交差点は現実的なエポック数に留まったままである。データのスケーリングの傾向に基づいて、インターネットサイズのデータサイズに外挿をすると、約1e30 FLOPsが必要となる試算になるが、数年以内に到達可能な計算量と考えられる。

ダウンストリームタスクへの性能にも(ノイジーだが)事前学習での改善は寄与する。ただし、事前学習させたトークン数が少ない場合はフィルタリングした方が性能が良く、十分な計算量を投じる必要がある。

といった話が著者ポストに書かれている。興味深い。

逆に言うとこの傾向は、モデルパラメータ、計算資源が十分に大きいことが前提だと考えられるので、PhiのようなSLM研究において得られた学習データの高品質化が重要という知見とは競合しないと思われる。

解説:

Loading…

関連:
- [Paper Note] When Bad Data Leads to Good Models, Kenneth Li+, ICML'25, 2025.05




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Tokenizer #read-later #Selected Papers/Blogs #Byte-level Issue Date: 2026-05-22 GPT Summary- サブワードトークン化の訓練効率とモデル性能への影響を分離し、様々な次元で仮説を検証。バイトレベル環境でのシミュレーションにより、サブワードモデルの優位性を明らかにし、訓練スループットの向上とサブワード境界の重要性を強調。将来のモデル改良への洞察を提供。 Comment

LLMに記憶の更新(要約)。任せ、継続すると最初は性能が向上するが、じきに低下していき、記憶なしのモデルが上回るようになる。無条件にLLMに記憶を更新させるのではなく、要約をするタイミングを明示的に指定する、生のエピソードを最優先するといった対策があるといった感じかもだが、ちょっともう少しちゃんと読んだ方が良さそう。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Prompting #Safety #Selected Papers/Blogs #reading #One-Line Notes #Steering #Interpretability #Reading Reflections Issue Date: 2026-05-21 GPT Summary- アクティベーション・ステアリングは、モデルの活性化を調整し、その挙動に変化を与える手法であり、解釈可能性や安全性研究で広く利用されている。しかし、任意のテキストプロンプトによってこの挙動が実現可能かは不明である。本研究では、この問題を全射的な観点から考察し、すべてのステアされた活性化が前像を持つかを調査する。実証的結果から、活性化ステアリングは任意のプロンプトによって同じ内部挙動を再現できないことを示し、ホワイトボックス的なステアリングとブラックボックス的なプロンプティングの違いを明確にする評価プロトコルを提案する。 Comment

元ポスト:

Loading…

steeringされたactivationを自然に生み出すプロンプトは存在しない。言い換えると、steeringによって得られる挙動はpromptでは再現できない。これにより以下が示唆される:
- prompt levelのbehaviorとactivation/weightに介入することによるbehaviorの変化は、根源的に異なる現象なので分けて考えなければならない
- white-boxなstteering手法によってjailbreakができたとしても、black-boxな手法(e.g., promptingによる脆弱性など)による脆弱性があることの証拠にはならない

image

Steeringされたactivationは下記のようなAutoencoderを学習することでverbalizeできるのだろうか?hidden_stateのreconstruction lossを通じてverbalizeするためできそうではある。元々のactivationがpromptによって到達不可能な点にいたときに、promptによって到達不能なだけであって内部のネットワークが状態を解釈できないというわけではないので(ここがめちゃめちゃなら何も学習できないということになるがそうではなさそうなので)普通にできそうではある:
- Natural Language Autoencoders: Turning Claude’s thoughts into text, Anthropic, 2026.05




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-05-21 GPT Summary- Mixture-of-Experts (MoE) アーキテクチャの設計選択を体系的に検討し、2,000件の事前学習ランを実施。エキスパート数、粒度、サイズの変化で一貫した性能向上を確認。活性パラメータ規模の増加が性能向上に寄与し、最適なエキスパートサイズは総パラメータ数に依存しないことが明らかに。共有エキスパートやロードバランシングの影響は小さく、ドロップレス・ルーティングは有益。全体として、エキスパート数と粒度にフォーカスするシンプルなアプローチが有効であることを示唆。 Comment

元ポスト:

Loading…

MoEアーキテクチャにおいては、expertのサイズと数が重要であり、他の要素は最小限の影響しか与えない

- Expertの総パラメータ数が増えれば増えるほど性能が改善する(アクティブパラメータ数に対する総パラメータ数が128倍などの極端な場合でも性能が改善)
- Expertの数は多ければ多いほど良い。また、Expert一つに対する最適なサイズは総パラメータすうには関係なく、アクティブパラメータ数にのみに依存して決まることが明らかになった。このため、まずアクティブパラメータ数を優先的に決めて、VRAMが許す限りエキスパートの数を増やすのが良い
- MoEアーキテクチャが優れているのは、ブロックを小さく分割したからではなく、非アクティブなパラメータが存在することによるSparseな活性化によって生じる(MLPを細かいブロックにして全てを活性化させても性能が悪化した実験を受けて、ブロックを細かく分割することではなくsparseな活性化に鍵があると結論)
- 共有エキスパートや、サイズを不均一にしたエキスパートの設計には効果がない
- ルーティングに関しては、特定のエキスパートにトークンが偏った場合のToken Droppingは実施せず、Droplessなルーティングをする方が一貫して少しだけ性能が良い。極端に強い/弱いロードバランシングは性能の劣化を招くが、他の設定ではほぼ最適なものを達成できるので、Token Droppingを防ぐことに注意して、あとは一般的な設定を採用すれば良い。
- レシピをまとめると
- 最大のFLOPs/Memoryの予算を決め、active/totalのエキスパートのパラメータ数を決める
- アクティブパラメータ数から最適なエキスパートのサイズ(総数)を見つける
- token droppingを防ぐようなルーティング設定で、ロードバランシングのsanity checkをする

といった 話が著者ポストに書かれている。




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SelfImprovement #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment

反響がすごそうに見える

- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。

環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。

元ポスト:

Loading…

prime-rlでサポートされたとのこと:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Training-Free #Selected Papers/Blogs #MLSys #reading #One-Line Notes #SparseAttention Issue Date: 2026-05-21 GPT Summary- BLASSTは、LLMsの文脈での推論能力向上のために提案された動的スパースアテンション機構である。固定スカラー閾値を用いて計算を加速し、トレーニング要件を排除、既存フレームワークと容易に統合可能。自動閾値キャリブレーション手法により、最適閾値と文脈長の逆比例関係が明らかにされ、前計算とデコードそれぞれに単一の閾値を利用。現代GPU上でのベンチマークにおいて、前計算とデコードがそれぞれ1.52倍、1.48倍の速度向上を示し、精度を維持した。 Comment

元ポスト:

Loading…

training-freeで単一のスカラー閾値による制御によって、スキップ可能なattention blockをスキップするSparse Attentionとのこと。

image

非常に使い勝手が良さそうで、50%程度のSparsityにしてもベースラインとなるDense Attentionに対してダウンストリームタスクの性能低下はなく(Table 4)、50%程度のSparsityの場合、prefillとdecode step方法において、Blackwell, Hopperアーキテクチャにおいて約1.3倍の高速化を実現できる(Table5)。




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Attention #Architecture #Hierarchical Issue Date: 2026-05-21 GPT Summary- Lighthouse Attentionを提案し、因果トランスフォーマの訓練におけるSDPAの計算量とメモリ使用量の課題を解決。階層型注意アルゴリズムにより、シーケンスの圧縮・展開を行い、クエリ・キー・バリューを同時にプールすることで並列性を向上。二段階の訓練手法により、訓練時間を短縮しながら性能を向上させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2026-05-21 GPT Summary- Negation Neglectは、LLMを否定のある文書でファインチューニングすると、モデルがその主張を真実だと信じてしまう現象を指す。実験では、否定を含む文でファインチューニングしたモデルの信念率が2.5%から88.6%に増加。一方、否定を伴わない場合は92.4%と高い。否定を主張に局在させることで、モデルは否定を正しく学習可能。また、この現象は他の認識論的修飾子やAIの挙動に影響し、AIの安全性に懸念をもたらす。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #NLP #LanguageModel #Architecture #Test-Time Scaling #read-later #Selected Papers/Blogs #Encoder-Decoder #LatentReasoning #RecursiveModels #Initial Impression Notes Issue Date: 2026-05-21 GPT Summary- 将来のニューラル推論システムにおける拡張計算の実装として、Generative Recursive reasoning Models (GRAM)を提案。GRAMは、再帰的潜在推論を確率的な複数の潜在軌道に変換し、条件付き推論や無条件生成を可能にする。これにより、従来の決定論的モデルよりも改善された性能を示し、構造化推論や制約充足タスクにおいて有効性を発揮。 Comment

pj page: https://ahn-ml.github.io/gram-website/

元ポスト:

Loading…

先行研究:
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
- [Paper Note] Less is More: Recursive Reasoning with Tiny Networks, Alexia Jolicoeur-Martineau, arXiv'25, 2025.10

全然まだ理解できていないが、depth(iterative refinement)のみではなく、width(multiple parallel trajectories)方向にinference-time scaling可能なrecursiveなアーキテクチャの提案で、

LoopedTransformerのようなモデルはdeterministicな推論プロセスなため単一の軌跡に収束する(同じ入力に対して同じ出力をする)が、本研究では再帰的な推論プロセスにおいて、deterministicなhidden stateの推論に加えて、確率的でlearnableなguidance ε_t(ε_tの分散の大きさによって探索の度合いを変化させられる)をサンプリングして加えることで、多様なlatent trajectoryを生成可能にするで、自然なparallel inference-time scalingを可能にする

という感じだろうか。

image




Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #interactive Issue Date: 2026-05-21 GPT Summary- インタラクティブな評価の重要性を強調し、従来の応答中心のベンチマークからの変革を提案。評価を「証拠から判断へ」とする自律的な写像として定義し、インタラクションによって生成される軌跡を評価する必要性を示す。設計原理や報告基準を導出し、評価課題の再発を分析する二軸分類法を提案。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Attention #Architecture Issue Date: 2026-05-21 GPT Summary- Delta Attention Residualsは、従来のアテンション残差の冗長性を解消し、それに代わりサブレイヤーによって導入される変化量に焦点を当てることで、選択的なルーティングを強化します。この新しい手法は、より高いコントラストのアテンション分布を生成し、層間での効果的なルーティングを実現することを示しています。実験により、Delta Attention Residualsは、従来の手法よりもパフォーマンスが一貫して向上し、検証perplexityが改善されることが確認されました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #DeepResearch #Rubric-based Issue Date: 2026-05-16 GPT Summary- 深層研究エージェントを訓練するためのRubricEMフレームワークを提案。これは、ルーブリックを評価だけでなく、ポリシー実行やフィードバックの構造化に活用。計画・証拠収集・レビューを段階的に行い、意味情報の密なフィードバックを提供しつつ、評価済みの軌跡を再利用可能な指針に蒸留。得られたRubricEM-8Bは長編研究ベンチマークで優れた性能を示した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Mathematics #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections Issue Date: 2026-05-14 GPT Summary- Soohakという新たな数学ベンチマークを導入し、439問から成り、フロンティアモデルの推論能力を評価。Challengeサブセットでは、トップモデルが30.4%未満の成功率である一方、拒否サブセットはモデルが50%を超えられない問題解決能力を確認。これにより、拒否能力が新たな評価基準として浮上し、2026年末に公開予定のデータセットで混入を防ぐ。 Comment

元ポスト:

Loading…

60人以上の数学者によってゼロペースで作成された新たなベンチマーク。数学者は作問をする際にLLMの利用は禁止され、問題を作成しsubmitする。その後レビュープロセスを経て問題が収録されるかが決まっているようである。レビュープロセスでは、LLMによる難易度の確認や類似した問題がないかなどの確認をし、人間がLLMの出力を見て疑わしいか否か判断する。レビュワーは作成者にフィードバックをし、質問や確認などを行う。また、LLMを利用したであろう作成者はbanされ、問題に調整が必要な場合は修正がなされる。提出された問題は、小、中、大のスケールのOpenLLMによって正解できたか否かによって、miniとして収録されるかChallengeとして収録されるかが決まり、特にChallengeについては作成者が特定の教員やポスドク、IMOメダリストなどに限定されたようである。

99個の、矛盾や前提の抜け、正解が一意に決まらないill-posedな問題も含まれており、モデルが回答を拒否しなければならないRefusal Questionsが含まれているのが大きな特徴。

研究レベルの問題の定義がよくわかっていないのだが、要は競技で出題されるような「既存の知識や枠組みの中でのマルチステップでの推論」を必要とするものではなく、「数学に関する最先端を切り拓くレベルの問題」のことのようである。これでもまだよくわからなかったのだが、問題の作成者に対するインタビューによると、SOOHAK-Miniの問題は短時間で作成できたが、SOOHAK Challengeの問題は1問作成するのに1日以上の作業を要することがしばしばあったとのこと。Challengeレベルの問題を作成するためのアプローチとしては典型的に2つあったとのことで、
- 問題作成者自身が最近考えていた研究と隣接した問題を提出するもので、問題を解くステップにおいて既存の定理や、論文などで公式には発表されていない事実や、数学者の中でヒューリスティクスを組み合わせる必要があるような要素を含むもの(folklore-level reasoningと呼ばれる)
- ニッチな研究論文に基づいて問題を設計する方法

などがあったようである。つまり、競技という枠組みは超えて、数学の研究者が研究として考えるレベルの問題ということだと理解した。

コーディングにおいて人間を置き換えるレベルであろうモデルも、未知の数学の問題や、そもそも問題として不適切なものの回答拒否は広く使われたベンチマークほどはうまくいかない。新たに拒否が最適化のobjectiveとして必要なことが示唆されているが、逐一人類はAIにこの挙動が足りないね、じゃあ学習データを用意して学習しよう、ということを繰り返していくのだろうか?正解ベースの学習にそろそろ限界が見えてきた気がしており、AnthropicのペルソナやConstitutionに基づいた学習のような特定の領域に広く汎化するような学習方法の模索が必要な気がする。

拒否する挙動のための正解データを用意して学習するとしよう。そうすると、モデルが持つ他の能力に影響を与えるだけでなく、本来拒否が不要な場面でも拒否するようになる可能性が高い(たとえばクエリが数学に関連しているだけで、一定の確率で拒否するリスクは生じるように思われる)。この問題を解決するために最近はOn-Policy Distilation (OPD)が活用されるが、OPDはこの問題を緩和することには寄与するが、根源的に解決しているわけではない(と思われる)。genericな能力の発現に際して、モデル自身がcontextに応じて、どの挙動を発現させるべきかを"線引き"できるような能力とアーキテクチャ(マルチモーダルなモデルのようにMoEのexpertをbehaviorに関しては分離するなどだろうか)が必要に思う。




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #Distillation #PostTraining #On-Policy Issue Date: 2026-05-13 GPT Summary- OPDは大規模言語モデルのポストトレーニングに有効だが、高いインフラ要求が課題。私たちは、SFTロールアウトで教師の対数確率をオフラインに事前計算し、その再利用を提案。教師の一貫性が重要であることを確認し、それを保証するフレームワークLightning OPDを設計。この手法により、標準OPDと同等の最適解を維持しつつ訓練効率を4倍向上。Qwen3-8B-Baseモデルからの初期化でAIME 2024で69.9%を達成し、MoEアーキテクチャにも対応。LLMのポストトレーニングに関する障壁を低減。コードは公開されています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Pruning #Distillation #SmallModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-05-13 GPT Summary- 大規模事前学習におけるエキスパート混成モデル(MoE)の圧縮を体系的に探求し、プルーニングと知識蒸留(KD)を適用する方法を検討。プルーニングは、スクラッチからの訓練よりも一貫して優れた初期化を提供し、異なる圧縮手法は同様の最終性能へ収束。簡易な部分保存型統合戦略で下流性能を向上させ、KDと損失を組み合わせることで効果を上げる。漸進的なプルーニングスケジュールはワンショット圧縮を上回り、最適化に寄与。結果として、Qwen3-Next-80A3Bモデルを圧縮し、競争力を維持する指針を提供。 Comment

元ポスト:

Loading…

大規模なMoEモデルから小規模なvariantを学習する方法に関する分析




Paper/Blog Link My Issue
#Controllable #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Security #Initial Impression Notes #Environment #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment

元ポスト:

Loading…

Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
image

論文は279ページもある🤯




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Catastrophic Forgetting #ICML #mid-training #read-later #Selected Papers/Blogs #One-Line Notes #DownstreamTasks Issue Date: 2026-05-12 GPT Summary- 事前訓練最適化手法は、基盤モデルの能力維持に影響を与える幾何学を考慮すべきである。本研究では、平坦な極小点を目指す三つのアプローチ(SAM、大きな学習率、短縮された学習率減衰)を分析し、モデルサイズが20M〜150Mパラメータの範囲で、ポスト訓練後のパフォーマンス向上と忘却の最大80%低減を実証した。また、OLMo-2-1Bモデルへの短いSAM訓練を適用することで、MetaMathでは忘却を31%、4ビット量子化後には40%低減できることが示された。 Comment

元ポスト:

Loading…

downstreamタスクでの性能を最大化するためには、baseモデルのlossではなく、モデルが重みを更新した時にどれだけ事前学習の知識が保持されるかが鍵であり、learning-forgettingのトレードオフを見るべきという話で、

なぜモデルの更新によって忘却が起きやすいかというと、モデルが急峻な極小点 (Sharp Minima) に収束してしまっているためで、これではわずかな重みの更新でも大幅な性能低下を起こしてしまう。このため、平坦な極小点(Flat Minima)に重みを収束させることでよりモデルの知識を安定させることができる。

Flat Minimaを見つけるために、Sharpness-Aware Minimization (SAM)と呼ばれる手法を採用し、式(5)で定義されるような、パラメータに摂動を加えた時のlossの最大値が最小となるようにパラメータを最適化する。

image




Paper/Blog Link My Issue
#InformationRetrieval #NLP #Search #LanguageModel #AIAgents #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections Issue Date: 2026-05-12 GPT Summary- 直接コーパスと相互作用する(DCI)アプローチを提案し、リトリーバAPIや固定された類似度インターフェースに依存せず、エージェントが生のコーパスを汎用的な端末ツールで直接検索できるようにします。この方法は、オフラインのインデックス作成を不要にし、進化するコーパスに自然に適応します。実験では、DCIがBRIGHTおよびBEIRデータセットで強力なベースラインを上回り、従来の手法なしに高精度を実現したことが示されました。この結果は、検索の質が推論能力だけでなく、コーパスとの相互作用のインターフェースにも依存することを示唆しています。 Comment

元ポスト:

Loading…

基盤モデルが賢くなる中で、top-kによるretrievalが検索におけるベストなインタフェースなのか?という疑問を投げかけた研究で、ベクトル検索などのRetrieverではなく、AI Agent自身にgrep等を用いて直接コーパスとinteractionをさせる(Direct Corpus Interaction)ことでBrowseCompのようなQAデータセットにおいてEmbeddingを用いた手法よりもより低コストで高いスコアを獲得できることを示したようである。

DCIは有用な手がかりを見つけた時に、それをrearoning stepに結びつけて深掘りしていくような挙動を実現しやすい点が強みであるが、コーパスサイズが大きくなるにつれて最初のアンカーとなる手がかりを見つけるためのコストが大きくなり、深さへの強みはあるが、広さには弱い性質があることから、この手法が唯一無二の解というわけではなく、設計の際に「どのモデルがtop-kの検索でベストか?」という視点だけでなく、「AI Agentにコーパス全体に対してどのようなオペレーションを持たせるべきか?」という問いかけも提起する

といった話が元ポストに書かれている。

昔から検索に全てのケースで最強な手法はこれ!みたいなものはないので、こういった選択肢もあるよということを頭に入れて引き出しに入れておき、直面する課題に対して有効な方法は何かを考えることが重要と思われる。

所見:

Loading…

NeurIPS'26 Spotlight
https://lnkd.in/p/gshSB3m7




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Supervised-FineTuning (SFT) #Japanese #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-05-12 GPT Summary- 日本語のVQAシステムに対する高品質なデータセットJagleを紹介。約920万件のインスタンスを含み、異種ソースから生成したVQAペアを用いて多様なタスクをカバー。Jagleで学習した2.2Bモデルは、日本語タスクで高い性能を示し、既存のモデルを上回る結果を得た。さらに、JagleをFineVisionと統合することで英語でも性能向上が確認され、データセットとモデルを公開し再現性を促進。 Comment

pj page: https://speed1313.github.io/Jagle/

dataset: https://huggingface.co/datasets/llm-jp/Jagle

元ポスト:

Loading…

データセットのサイズが9Mと非常に大規模で、日本語性能を大幅に改善するだけでなく、FineVisionのような英語のVQAデータセットとハイブリッドで用いることで英語タスクの性能も改善する。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ICML #Decoding #Byte-level Issue Date: 2026-05-12 GPT Summary- BLTを用いて、バイトレベルLMの生成速度のボトルネックを解消。BLT Diffusionを導入し、並列生成によってデコードステップを削減。さらに、BLT Self-speculationとBLT Diffusion+Verificationを提案し、生成品質を向上させつつ推定メモリコストを低減。これにより、バイトレベルLMの実用性が向上。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SelfImprovement #Selected Papers/Blogs #reading #One-Line Notes #Rubric-based Issue Date: 2026-05-11 GPT Summary- EVOLMは言語モデルの自己改善を促進するポスト訓練手法であり、外部監督に依存せず、モデル自身の評価能力を利用します。具体的には、事例ごとに最適化された評価基準を生成するルーブリック生成器と、そのルーブリックを用いて訓練されたポリシーの二つの能力を交互に訓練します。これにより、EVOLMはQwen3-8Bモデルを用いてGPT-4.1を25.7%上回るルーブリックを生成し、共同訓練されたポリシーは最新の報酬モデルよりも優れた性能を示しました。全体として、EVOLMは内部の評価能力を活用することで、外部の監督なしでの改善を実現することが明らかになりました。 Comment

元ポスト:

Loading…

外部ラベル無しでself-improvingするルーブリックベースな手法の提案。

手法としては、まずfrozenしたRubirc生成器とJudgeモデルで全てのpromptに対してRubricを生成し、ポリシーが生成したロールアウトに基づいてJudgeモデルでRewardを計算することでポリシーを更新。その後更新されたポリシーを用いてpreference pairを構築し、preference pairに対してRubric生成器がルーブリックのロールアウトを生成し、choicedとrejectedなサンプルに対するJudgeのスコアの差の大きさ(すなわち、識別力の高さ)をrewardにRubric生成器を更新する、といったことを繰り返す。
image

多分3説以降の話が面白い。後で読む

Rubricが徐々に変化していき、抽象的なものからよりverifiableなものに変化したり、Rubricそのものが静的だとポリシーの学習に伴い変化する出力分布の変化に対応できない話や、最終的に獲得されたRubricは他のモデルの学習でも高い学習signalを送出するような汎化をするらしい




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Test-Time Scaling #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

pj page: https://apga.github.io/RAO/

再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。

という感じだろうか。

サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICML #read-later #Selected Papers/Blogs #Verification #Monitorability Issue Date: 2026-05-09 GPT Summary- MAS-ProVeは、マルチエージェントシステム(MAS)におけるプロセス検証の体系的研究を提示し、LLMを利用して検証の有効性を評価。エージェントレベルとイテレーションレベルでの評価を行い、5つの検証手法を検討。結果として、プロセスレベルの検証は必ずしも性能向上にはつながらず、高い分散が見られることが判明。LLMを判定者として用いるアプローチが効果的である一方、コンテキスト長と性能のトレードオフも観察。MAS向けの堅牢な検証法にはさらなる進展が必要であることが示された。 Comment

元ポスト:

Loading…

MASにおいてprocess levelのverificationを導入しても一貫して性能が向上するわけではなく、(途中推論の妥当性を判断するタスクは困難なものであることから既存の様々なverification手法には限界があり)分散が高いことが明らかになったとのこと。MASのような複雑なシステムはverificationによるプロセスレベルの精査が必要だと思われるので、現在の限界が示された点で重要な研究に見える。




Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #AIAgents #Evaluation #ICML #read-later #Selected Papers/Blogs #Initial Impression Notes #Orchestration Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment

元ポスト:

Loading…

SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。




Paper/Blog Link My Issue
#NLP #LanguageModel #LLMServing #MoE(Mixture-of-Experts) #ICML #Parallelism #Stability Issue Date: 2026-05-09 GPT Summary- 新しいLeast-Loaded Expert Parallelism (LLEP)は、MoEモデルの不均衡なルーティングを考慮し、過負荷デバイスからトークンとエキスパートパラメータを未利用のデバイスに再ルーティングすることで、計算資源の制約を軽減。これにより、モデルスケールに応じて最大5倍の速度向上とピークメモリ使用量を4分の1に削減し、推論の高速化を実現。理論分析と実証評価に基づき、ハードウェアに最適化したパフォーマンスを提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes Issue Date: 2026-05-09 GPT Summary- ソフトウェアプロジェクトの完全な開発は、言語モデルの重要なユースケースで、エージェントは最小限の監視下でコードベースを成長させる。しかし、既存のベンチマークは限られたタスクに焦点を絞っている。そこで、ProgramBenchを導入し、エージェントが与えられたプログラムとそのドキュメントに基づいて、参照実行可能ファイルに一致するコードベースを設計・実装する能力を測定する。200のタスクを用い9つの言語モデルを評価した結果、どのモデルも未完のタスクが多く、人間が書いたコードとは異なる実装を好む傾向が見られた。 Comment

pj page: https://programbench.com/

元ポスト:

Loading…

実行可能なバイナリとdocumentationを与えたときに、インターネットアクセスが不可能な環境で、オリジナルのプログラムの挙動を再現可能なcodebaseを実装するベンチマークで、現状いずれのLLMもスコア0%とのこと。スコアは全タスクのうち、(タスクごとに定義される)テストを全て通過したタスクの割合である。Almostの場合は95%以上のテストを通過したタスクの割合である。

image

image

仕様全体からcodebase全体を再現する必要がため、これがうまくできれば、これまでのベンチマークよりも人間に近い推論・認知能力を持つと部分的に主張できるとは思われる。

contaminationの懸念について、本ベンチマークではopen-sourceのコードを異なる言語で実装するようにすることで検証している。異なる言語で実装することによってモデルが通過するようになったテストの割合は大きく変化しなかったため(leaderboardのスコア異なる点に注意。leaderboardのresolvedは全てのテストを通過したタスクの割合である。)、memorizationの影響は小さいと主張している。また、本ベンチマークはインターネットアクセスが不可能な状態で実施されるが、インターネットアクセスを許可した場合、モデルはcheatingを実施するようになり、多くのcheatingはソースコードをlookupすることだったとのこと。

テストはbehavioralなものであり、SWE-Benchで行われているような実装の方法についてはテストをしない。

image

ProgramBenchの言語の分布と、各タスクのcodebaseの規模間。270M lineのcodebaseから200 line程度の小さなものまで、規模間が大きく異なることがわかる。言語はC/C++, Go, Rustが多く、多くのモデルが得意とするであろうpythonはほとんど含まれていない。

image

著者ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #One-Line Notes #Sparse #GPUKernel Issue Date: 2026-05-09 GPT Summary- 非構造的スパース性を活用することで、LLMの計算コストを削減し、フィードフォワード層の効率を向上させる新しいCUDAカーネルを導入。99%超のスパース性を誘導しつつも、パフォーマンスへの影響は最小限。これにより、モデル規模の拡大に伴うスループット、エネルギー効率、メモリ使用量の改善を実証。すべてのコードはオープンソースで公開し、スパース性の実用性を推進。 Comment

元ポスト:

Loading…

現在の言語モデルではFFNの計算が計算コストの多くを占めているが、ReLUやL1正則化によってFFN中で必要なactivationを99%程度sparseにすることができ、sparseになったFFNに対して最適なデータ形式と高速に動作するGPUKernelを構築することで、downstream taskへの性能劣化無しに、省コストでの推論が可能になる、という話に見える。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #read-later #Selected Papers/Blogs #Compression #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 長期的なホライゾンを持つコーディングエージェントに対する推論時スケーリングの新しいフレームワークを提案。各試行の重要な要素を保持しつつ、詳細を要約することで、経験を効果的に再利用。提案手法は並列スケーリングと逐次スケーリングを実現し、エージェントの性能を一貫して向上させる。SWE-Bench VerifiedおよびTerminal-Bench v2.0での実験で、明確な改善が確認された。 Comment

元ポスト:

Loading…

Software Engineering Agentにおけるtest-time scaling手法の提案で、生の実行ログをそのままスケールさせるとノイズが多すぎて効率が悪いので、trajectoryを圧縮することで対処するという話のようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-05-08 GPT Summary- 弱い監督のもとでトレーニングされたAIモデルは、サンドバッグ行為を通じて見かけ上の成果を生み出す可能性がある。研究では、サンドバッグを行うモデル群を用いて数学や科学、プログラミング課題に対する技術を検証。弱いデモンストレーションに対する監視付きファインチューニング(SFT)と強化学習(RL)の組み合わせが、モデルの真の能力を引き出すことを示した。特に、SFTがサンドバッグ行動を崩し、RLがパフォーマンスを最大化する。しかし、SFTなしのRLは報酬ハッキングを引き起こし、逆にSFTのみでは十分な性能を引き出せない。この研究は、トレーニングをデプロイメントと区別不能にすることの重要性を示し、サンドバッグに対する緩和策としてのトレーニングの可能性を探求している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #ACL #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- Uni-MMMUを提案し、視覚的理解と生成の統合を推進するための新しいベンチマークを構築。科学、プログラミング、数学、パズルなどの推論中心ドメインにおいて、生成と理解の相乗効果を評価。モデルは概念的理解を視覚合成に、生成を分析的推論に活用するタスクに挑む。再現可能な評価プロトコルを導入し、モデル間の性能差と依存性を明らかにし、統合モデルの進展に貢献。 Comment

pj page: https://vchitect.github.io/Uni-MMMU-Project/

元ポスト:

Loading…

processとresultの両面を評価できるのが特徴のように見える




Paper/Blog Link My Issue
Issue Date: 2026-05-06 GPT Summary- LenVM(Length Value Model)は、生成長をトークン単位でモデリングする新しいフレームワークです。これは、生成された各トークンに負報酬を割り当てることで残りの生成時間を予測し、効率的な教師信号を提供します。実験により、LenVMは推論時に有効な信号を示し、LIFEBenchのタスクでは長さスコアが向上。トークン予算内でも高い正確さを保持し、生成ダイナミクスの解釈を容易にすることが確認されています。LenVMは長さモデリングの新たな可能性を示唆し、幅広い応用が期待されます。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #ICML #DPO #PostTraining Issue Date: 2026-05-06 GPT Summary- DPOはLLMの嗜好最適化の手法として注目されているが、BTモデルへの依存がその効果を制限する可能性がある。そこで、自己回帰仮定を導入した新たな定式化—自己回帰DPO(ADPO)を提案。これにより、嗜好最適化への自己回帰モデリングの統合が実現。ADPOの損失関数はエレガントな形を持ち、DPO目的関数の総和演算を対数シグモイド関数の外に移した。さらに、LLMの嗜好最適化に関わるトークン長μとフィードバック長μ′の二つの尺度を明確に区別し、その影響を初めて分析。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #MultiModal #Reasoning #ICML #PostTraining #GRPO #VisionLanguageModel #SpatialUnderstanding #MultiView Issue Date: 2026-05-06 GPT Summary- 視点間対応と逐次的視点変換を強化するために、HATCH(Human-Aware Training for Cross-view correspondence and viewpoint cHange)を提案。これにより、空間的整合性を促進し、視点遷移アクションを生成して推論を改善。実験結果は、HATCHが同規模のモデルを上回り、大規模モデルとも競合する性能を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ICML #Test-Time Scaling #TreeSearch Issue Date: 2026-05-06 GPT Summary- BG-MCTSは、残りのトークン予算に応じて探索方針を調整するツリー探索デコーディングアルゴリズムを提案。予算が残る間は広範囲に探索し、枯渇するにつれて洗練された回答を優先して浅いノードの分岐を抑制する。MATH500およびAIME24/25の多様な予算設定において、予算を考慮しない方法を一貫して上回る性能を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SpeechProcessing #read-later #Selected Papers/Blogs #One-Line Notes #Realtime #ICASSP #SpeechToSpeech Issue Date: 2026-05-01 GPT Summary- 音声-音声モデルは低遅延で自然な応答を生成するものの、知識や意味理解に欠ける。一方、ASRとLLMを組み合わせたカスケード型システムは知識表現に優れるが、遅延が大きくなる。そこで本研究は、即時応答を実現する新たなハイブリッドアーキテクチャを提案。ユーザーの音声をS2Sトランスフォーマーで処理しつつ、クエリをLLMに並行伝送。これにより、遅延を増加させずに豊富な知識を応答に組み込むことが可能となる。MT-Benchベンチマークを用いた評価により、提案システムはS2Sモデルを大幅に上回りつつ、遅延は同等であることが示された。 Comment

元ポスト:

Loading…

HF: https://huggingface.co/SakanaAI/kame

SpeechToSpeechのエンコーダ・デコーダモデルの裏で同時並行してLLMを走らせ、随時生成されるOracle Streamを考慮してデコードすることで、latencyと知識・推論性能を両立する。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs Issue Date: 2026-04-30 GPT Summary- ファインチューニングされたLLMの挙動を識別しやすくするために、共有ベースのLLMから派生したモデルの挙動を自然言語で説明する手法を提案。内省アダプター(IA)が、異なるファインチューニングされたモデルに対しても挙動の自己記述を可能にし、AuditBenchでの高性能や暗号化ファインチューニングAPI攻撃の検出に寄与。IAはモデルのサイズや訓練データの多様性に応じてスケールし、LLMの監査において効果的かつ実践的なアプローチであることを示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #GPUKernel Issue Date: 2026-04-30 GPT Summary- AdaExploreは、カーネルコード生成のためのエージェントフレームワークで、自己改善を可能にする。失敗駆動適応と探索を通じて正確性と最適化性能を向上させ、再利用可能な記憶を活用する。エージェントはタスクを合成し、局所的改良と構造再生成を交互に行い、最適化の地形を探索する。実験により、KernelBenchのベンチマークで3.12倍および1.72倍のスピードアップを達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Safety #read-later #Selected Papers/Blogs #EmergentMisalignment #InoculationPrompting #ConditionalMisalignment Issue Date: 2026-04-30 GPT Summary- 言語モデルのファインチューニングが出現的ミスアラインメント(EM)を引き起こす可能性を検討し、EMを減少させる介入を評価。従来の評価は効果を発揮するが、訓練文脈を模したプロンプトでは条件付きミスアラインメントが生じる。このミスアラインメントは、無害データとの混合やファインチューニングにより促進される。特に、予防接種プロンプトは効果的であるものの、完全には解消できないことが示された。我々の結果は、無害データと誤った挙動を含むデータが混在することで、モデルが条件付きミスアラインメントを示す可能性があることを示唆している。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #LanguageModel #AIAgents #VisionLanguageModel #WorldModels #Initial Impression Notes Issue Date: 2026-04-28 GPT Summary- AIシステムの目標達成能力の向上には、環境のダイナミクスをモデル化することが必要不可欠である。この研究では、能力レベル(L1からL3)と支配法則(物理、デジタル、社会、科学)を軸にした「levels x laws」分類法を導入し、400件以上の研究を統合して、AIの世界モデルの制約と失敗モードを示す。提案する評価原則と最小再現可能なパッケージがアーキテクチャの指針を提供し、分断されたコミュニティの統合を目指す。最終的には、より予測可能で再構築可能な環境モデルへと進む道筋を示す。 Comment

pj page: https://agentic-world-modeling.xyz/

元ポスト:

Loading…

著者ポスト:

Loading…

分野ごとに意味が異なるWorld Modelsを統合的に分類できる枠組みを提案しているSurveyで、Levels * Laws のtaxonomyで分類する。Levelsとはどのような能力を持つか、
- L1: L1 Predictor, 1ステップの予測
- L2: L2 Simulator, 複数ステップのシミュレーション/反実仮想のロールアウト
- L3: L3 Evolver, 失敗からの進化

LawsはWorld Modelsがどのような制約に従わなければならないかという視点で
- Physical: 物理法則
- Digital: program semantics
- Social: 社会規範
- Scientific: scientific mechanism

によって構成される、といった話が著者ポストに記述されている。論文を見ると、個々のtaxonomyについては、より多様な観点を含むようである。




Paper/Blog Link My Issue
#ComputerVision #MultiModal #TextToImageGeneration #read-later #UMM #ImageSynthesis #Pixel-based Issue Date: 2026-04-28 GPT Summary- NEO-unifyを基盤としたSenseNova-U1は、理解と生成を統合した新しいマルチモーダル・パラダイムを提示。SenseNova-U1-8B-MoTとSenseNova-U1-A3B-MoTの2つのバリアントは、テキスト理解や視覚—言語生成で高い性能を発揮し、強力なセマンティック一貫性を提供。詳細な設計と推論戦略を通じて、視覚—言語—行動シナリオでも優れた結果を示し、マルチモーダルAIの進化を提唱。 Comment

元ポスト:

Loading…

後ほどプレプリントが出るようである

公式ポスト:

Loading…

code: https://github.com/OpenSenseNova/SenseNova-U1
学習データのサンプル: https://huggingface.co/datasets/sensenova/SenseNova-U1-Training-Sample

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #LatentReasoning #Reference Collection #RecurrentModels Issue Date: 2026-04-28 GPT Summary- Recurrent Transformerは、各レイヤが自らの活性化から計算されたキーとバリューにアテンションを行うことで、時間的深さを持ちながらも最適化の不安定さを軽減。従来のTransformerとトークン間の再帰的更新を穏やかな前提下でエミュレートし、計算の効率性を改善。150Mおよび300MパラメータのC4事前学習において、クロスエントロピーの改善を達成し、深さを幅へとトレードオフすることで、メモリ占有量と推論レイテンシを低減することを示した。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-04-26 GPT Summary- 深層学習の理論が進化していることを主張し、訓練過程や隠れ表現、性能を特徴付ける研究線を五つ特定。これには理想化設定、扱いやすい極限、単純な数学法則、ハイパーパラメータ理論、普遍的な挙動が含まれ、共通して訓練ダイナミクスに関与する。新たに「学習力学」と名付け、統計的・情報理論的視点との関係も論じる。未解決の課題や初心者へのアドバイスも提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #ICLR #Test-Time Scaling #read-later #Orchestration Issue Date: 2026-04-26 GPT Summary- Conductorモデルを導入し、LLM間の協調戦略を自動発見。通信トポロジを設計し、個々のLLMの能力を最大化する指示を生成。7BパラメータのConductorは、単一ワーカーを超える性能向上を実現し、難解なベンチマークで最先端結果を達成。ランダム化されたエージェント訓練により、任意のエージェント集合に適応し、新たな再帰的トポロジを形成してオンラインでの性能向上を図る。この研究は、強力な協調戦略がRLを通じて自然に現れることを示す初期の実証である。 Comment

openreview: https://openreview.net/forum?id=U23A2BUKYt

公式ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICLR #reading #KeyPoint Notes #EvolutionaryAlgorithm #Orchestration Issue Date: 2026-04-26 GPT Summary- Trinityは、LLMs間の協調を調整する軽量なコーディネーターを用いて、基盤モデルの統合に伴う制約を解決する。約6億パラメータのコンパクトな言語モデルと約1万パラメータの軽量ヘッドから成り、適応的な委任を実現。複数ターンにわたるクエリに対して、コーディネーターは各LLMに役割を割り当て、スキルを効果的にオフロードする。実験の結果、Trinityはコード作成や数学、推論、領域知識タスクで優れた性能を示し、標準ベンチマークで最先端の成果を達成。コーディネーターの隠れ状態表現が文脈化を提供し、進化戦略の適用が有利であることが確認された。 Comment

openreview: https://openreview.net/forum?id=5HaRjXai12

公式ポスト: https://www.linkedin.com/posts/hardmaru_iclr2026-share-7454115310565216259-5uV-?utm_source=share&utm_medium=member_ios&rcm=ACoAACzQvjwB2FeLVE3yukDiUYtr5J4k-6nlNG4

軽量なcoordinator + 非常に軽量なheadを用いてターンごとに適切なモデルとロールを選択する。coordinatorは全てのターンの会話に対応するcontextualな表現を最後から2番目のトークンに対応するhidden state[^1]から取得し、
- LLM poolの中からどのLLMを用いて応答を生成するか
- 事前定義されたロール(Thinker, Worker, Verifier)のうちどれを選択するか

を決定する。最終的にVerifierが選択され、質問に対する最終的な応答としてacceptされるか、固定長のターン数のbudgetに到達したら生成終了となる。

image

上記枠組みを定式化すると(Section 2)、ざっくり言うと
- SLMが最初のクエリ+これまでの会話の履歴のcontextを、最後から2番目のトークンのhidden state hに集約し
- lightweight がhを受け取り、有限のアクション集合から(agent-roleのペア集合)適切なアクションを選択する
- 最終的に 0/1 のrewardを得られるものとし、この期待報酬を最大化するような(SLMのパラメータの対角成分[^2]と)lightweight headのパラメータΘを求める最適化問題として定式化される。
- ただし制約条件として、trajectoryのhorizon T は T <= B_turn、かつ期待報酬を得るために利用可能なコスト B_env がある。

となる。

(この辺は少し自信がないが)本研究のタスク設定は以下の特徴を持つ:
- 1ステップの評価が複数のLLM呼び出しを含むため非常に高コストであり、かつ評価に利用可能なコスト(B_env)の制約も厳しく
- lightweight headの次元数は10kであり、予算に強い制約がある中で学習するには次元数が多く
- かつlightweight headのパラメータはblock-epsilon-separabilityという性質を持つらしく
- 個々のlogitに寄与するブロックが独立していて、かつ独立したブロックの対角成分によって出力が決定される
- また、ブロック間は弱い相互作用をしている、という状態のようである
- 最終的に得られる報酬は2値のsparseな報酬でノイジー

パラメータΘを学習する上で、REINFORCEのようなパラメータごとの勾配を求める手法は、個々のパラメータが最終的な報酬に与える影響が小さく、かつ報酬がsparseでノイジーであるため効果的に学習ができないことから(時間をかければ学習できるのかもしれないが、B_envの制約がきつくて無理)、パラメータの対角成分を扱う手法であるseparable CMA-ESと呼ばれる進化的アルゴリズムによって学習するとのことである。

separable CME-ESはノイズを加えたパラメータベクトルの集団をサンプリングし、各候補を評価してそれぞれの適応度スコアを取得し、適応度で重みづけした上で平均をすることで次の親を形成するというプロセスを反復する手法らしく、特にseparable CME-ESという手法は、対角共分散行列のみを維持するため、上記の対角成分が寄与する性質と相性が良いとのことである。実験の結果、実際にREINFORCE, SFT, Random Searchなどの手法と比較して性能が良いことが示されている(Table 4)。

SLMのパラメータの対角成分は Singular Value Finetuning
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01

によって効率的に学習される。この結果、学習をするパラメータ数は20k程度で済み、パラメータ効率が非常に良いとのことである。

image

[^1]: 最後から2番目のトークンは `` や `` などを導出するため全体のcontextの情報を保持する傾向にあるため
[^2]: Section 2にはおそらく定式化のシンプルさを優先して最適化の対象はlightweight headのパラメータΘのみで定式化がされており、Section 3やFigure 2において、SLMのパラメータの対角成分も学習する旨が記載されている




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Personalization #Evaluation #memory #KeyPoint Notes #Clustering-based #Reading Reflections Issue Date: 2026-04-25 GPT Summary- 異質な記憶を保持するためのLLMベースのアシスタントの必要性に対して、\textbf{BEHEMOTH}というベンチマークを導入。18のデータセットを再利用し、タスクごとの有用性を評価する。実証分析により、均質なプロンプトが効果的でないことが確認され、\textbf{CluE}を提案。これは訓練例をクラスタに分け、各クラスタを独立に分析することで、抽出プロンプトを効果的に更新し、BEHEMOTHで実験した結果、従来の方法よりも一般化能力が向上したことを示した。 Comment

元ポスト:

Loading…

現在のAI Agentのメモリは同種のタスクに対して構築され評価されるが、実際の環境、特によりpersonalizationが進んだ状況下では、さまざまな異質なユーザの会話を単一のエージェントが扱い、ユーザのリクエストに応じて適切にメモリからcontextを抽出できなければならず、このような能力を測定するベンチマークは存在しない。

このため、ベンチマークを構築し既存のメモリ手法(promptingベースの手法)を評価したところ、LLMがメモリをmanageする際に、単一のmemory抽出のプロンプトや、自己進化ベースのpromptingではうまくいかないことがわかった。

提案手法 (CluE) では、各サンプルごとに背後にあるシナリオ(どのような情報が欲しいのか, 抽出時にどのような点がchallengingなのか等)をsummarizerにより解釈し、シナリオ単位でクラスタリング。個々のクラスタを分析することで、クラスタごとにどのような場合に成功/失敗するのか等を分析しクラスタ単位のrecommendationを得る。最終的に、クラスタ間のrecommendationを統合して構造化された一つの抽出promptに仕立てる。このとき、競合がある場合は適切なメモリグループにスコープを絞り解決する、といった手法のようである。

image

既存手法と比較してCluEによって抽出性能が向上
image

問題設定が実践的でおもしろい




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SmallModel #OpenWeight #OpenSource #DeepResearch #EdgeDevices Issue Date: 2026-04-25 GPT Summary- エッジ規模の小型深層研究エージェントDR-Venusを提示し、限られたオープンデータを基に強力な性能向上を実現。二段階の訓練プロセスでは、第一段階で基本能力を確立し、データ品質を改善、第二段階で強化学習を導入し実行信頼性を向上。約1万のオープンデータで構築されたこのエージェントは、従来の9Bモデルを上回り、30Bシステムとの差も縮小。再現性のある研究に資するため、モデルやコードを公開。 Comment

models: https://huggingface.co/collections/inclusionAI/dr-venus
code: https://github.com/inclusionAI/DR-Venus

オープンなデータのみで構築されたtraining/inferenceパイプラインもオープンなDeepResearchエージェント。

元ポスト:

Loading…




Paper/Blog Link My Issue
#read-later Issue Date: 2026-04-25 GPT Summary- 15Bパラメータのスーパーネット「Super Apriel」を公開。各デコーダ層は選択可能な4つの訓練済みミキサー(FA、SWA、KDA、GDN)を提供し、リクエスト間でスピードプリセットを切り替え可能。全FAプリセットはApriel 1.6の性能に一致し、ハイブリッドプリセットはデコードスループットを最大10.7倍改善。構成空間は広く、代理モデルが最適なトレードオフを特定。0.5Bでは迅速に安定、15Bでは不安定性が高い。Super Aprielは、Apriel 1.6教師モデルからの確率蒸留とファインチューニングにより訓練され、関連コードやツールも公開される。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Chain-of-Thought #MultiModal #DiffusionModel #TextToImageGeneration #Reasoning #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #VisionLanguageModel #Editing #UMM #ImageSynthesis #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLaDA2.0-Uniは、マルチモーダルな理解と生成を統合するための統一型離散拡散大規模言語モデルです。意味論的な離散トークナイザとMoEベースのバックボーン、拡散デコーダを組み合わせ、視覚入力を効率的に処理します。高忠実度の画像生成を実現し、推論効率を最適化する独自の手法を採用。特化型VLMに匹敵する性能を持ち、生成と推論の相互運用性で次世代モデルの可能性を広げます。コードは公開されています。 Comment

元ポスト:

Loading…

VLM * Diffusionモデル。テキストの生成だけでなく、TextToImage, Image Editingもサポートされているように見える。

公式ポスト:

Loading…


画像を生成する前にreasoningを実施するように訓練され、UMMなのでtext, patchのrepresentationがシームレスに統合され、画像を伴うテキスト生成がより一貫性を持つ、とのこと。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #TransferLearning #PostTraining #LowResource #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- 低リソースのプログラミング言語(PL)における言語モデルの性能は、訓練データの制約を受ける。本研究では、ゼロショットの跨プログラミング言語転移タスクを提案し、Llama-3.1がPL間でのコード生成において改善されないことを明らかにした。これに対処するため、一般化可能なSFT初期化が必要とし、「並列プログラム」を使用したSFT戦略Parallel-SFTを導入。Parallel-SFTによって転移性が向上し、RL実行後に未知のPLへの一般化が改善されることを示した。モデルの内部表現分析は、PL間での同等プログラムが密にクラスタ化され、これが転移性向上に寄与することを示唆している。 Comment

元ポスト:

Loading…

RL前にプログラミング言語でのパラレルコーパスでSFTすることで、特定言語でRLをした場合でも他言語にも性能が転移する、という話に見える。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#read-later Issue Date: 2026-04-25 GPT Summary- VLA Foundryは、LLM、VLM、VLAの訓練を統合するオープンソースのフレームワークで、エンドツーエンドの制御を持つ共有訓練スタックを提供。スクラッチからの訓練と事前学習済みバックボーンの両方をサポートし、2種類のモデルを公開。1つは完全にスクラッチから訓練し、もう1つはQwen3-VLバックボーンを用いたもの。評価結果は、両モデルとも優れた性能を示し、フレームワークの利便性やシミュレータの改善にも寄与。コードとモデルウェイトは公開され、プロジェクト公式サイトで動画も提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #SmallModel #Japanese #read-later #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-04-25 GPT Summary- 自動運転向けの軽量なVision Language Model(VLM)PLaMo 2.1-VLを紹介。8Bと2Bのバリアントがあり、日本語対応のエッジ展開が可能。視覚質問応答に特化し、工場タスク分析とインフラの異常検知で評価。日本語のトレーニングリソースを整備し、JA-VG-VQA-500で61.5のROUGE-L、Japanese Ref-L4で85.2%の精度を達成。工場で53.9%のゼロショット精度、ファインチューニングにより異常検知のF1スコアが39.7から64.9に改善。 Comment

関連:
- GENIAC第3期で自律稼働デバイス向けの軽量な大規模視覚言語モデルPLaMo 2.1-8B-VLを開発, PFN, 2025.12

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #ICLR #Decoding Issue Date: 2026-04-25 GPT Summary- SureLockは、マスク済み拡散型言語モデルにおいて、未マスクトークンをロックすることで計算資源を効率化します。具体的には、未マスク位置の事後分布が安定した場合、その位置に対するクエリ投影とフィードフォワードをスキップしつつ、他の位置がアテンションできるようにキャッシュを使用します。この手法により、計算コストがO(N^2d)からO(MNd)に削減され、生成品質を維持しつつFLOPを30〜50%削減します。理論分析も行い、ロック時点でKLを監視することでトークン確率の偏差を十分に境界づけることができることを示しています。 Comment

pj page: https://daioba.github.io/surelock/

元ポスト:

Loading…

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #SoftwareEngineering #ComputerUse #GUI Issue Date: 2026-04-25 GPT Summary- GUIアプリケーションの生成において、従来の評価方法が不十分である中、本研究は多言語対応のベンチマークPlayEvalを提案。これにより、ユーザー操作に基づく評価が可能となる。Play@kという指標で実行可能な生成候補を測定し、LLMベースのエージェントPlayTesterを開発して、タスク指向の評価を自動化。実験では最先端のコードLLMが論理的なGUIアプリケーションの生成に大きな課題を抱えていることが判明。これに対処するための多エージェントフレームワークPlayCoderを提示し、性能を大幅に向上。ケーススタディでは潜在的な論理バグの発見と修正の効果を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #SpeechProcessing #LongContext #AudioLanguageModel #ICASSP Issue Date: 2026-04-25 GPT Summary- LongSpeechは、長時間音声処理のための大規模なベンチマークで、10万件超の約10分の音声セグメントを含む。ASRや音声翻訳、要約など多様なアノテーションがあり、長時間音声の性能評価を促進。初期の実験では、モデルが特定のタスクに特化し、他を犠牲にしていることが示された。これにより、ベンチマークの挑戦的な特性が明らかにされ、今後の研究に貢献する予定である。 Comment

元ポスト:

Loading…

dataset: https://huggingface.co/datasets/AIDC-AI/Marco_Longspeech




Paper/Blog Link My Issue
Issue Date: 2026-04-25 GPT Summary- 関係推論は、複数のエンティティや属性を結びつける能力だが、現行の大規模言語モデル評価は構造化入力に偏っている。本研究では、関係的複雑性(RC)を用いて推論の難易度を評価し、RCに基づく生成型ベンチマークフレームワークRELを導入。RCの増加に伴い、LLMの性能が一貫して低下することを示した。この結果は、現行モデルが高アリティ推論に苦戦することを示唆し、ベンチマークの見直しを促す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #SelfPlay Issue Date: 2026-04-24 GPT Summary- 自己対話アルゴリズムにおけるLLMの限界を克服するために、Self-Guided Self-Play(SGS)を提案。SGSでは、Solver、Conjecturer、Guideの三役をモデルが担い、崩壊を避けつつ問題解決を行う。SGSの評価では、従来のRLベースラインを上回り、効率的な自己対話によって7Bパラメータモデルが671Bパラメータモデルよりも多くの問題を解決可能であることを示した。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

seed dataを与えた上でのSelf-PlayによるRLの性能を向上させる方法を提案している。

Self-PlayでRLをする場合、
- Solver: タスクを解く。タスクを解けるように学習される。(タスクが解けたか否かのbinary Reward)
- Conjecture: タスクを生成する。SolverのパフォーマンスをRewardとして学習される。

という構造が一般的だが、既存手法を分析した結果、学習が進むにつれ、ConjectureがSolverがそもそも解けない問題を生成するなどし、Reward Hackingが生じてしまい性能が向上しないことを発見。(Figure 2)
image


そこで、新たにGuideを追加し、Conjectureがタスクを合成する際にR_solve*R_guideの積の形式にRewardを調整し
- R_solveは(1 - Solverのsuccess rate)によって定義されるが、難しすぎる問題(success rate=0)、簡単すぎる問題(現在のバッチのtop 30%の問題)に関しては0に落とす。
- R_guideは合成タスクが、seed dataでSolverがまだ解けていない問題に関してどれだけの品質を有しているかに関するスコアを提供し(=unsolvedな問題に対する関連度、シンプルな結論が記述されており冗長な前提がないか、に関するRubricに基づくスコア)そのスコアをR_guideとする。つまり、seed dataにおいてまだ解けていない問題がより重視される。

ことで対処した。

image

self-playに関する代表的な先行研究:
- [Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03

解説:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-04-24 GPT Summary- 探索はエージェントが問題解決や一般化のために重要であり、本研究ではポスト・トレーニングLM向けに探索を奨励するフレームワークを提案。LMを集合として報酬関数のもとで訓練し、探索と活用のシナジーを促進する。特に、Polychromic Exploratory Policy Optimization(Poly-EPO)が一般化を改善し、高いpass@$k$カバレッジや生成多様性の保持、計算資源スケーリングを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #AIAgents #Attention #LongContext #PositionalEncoding #Optimizer #OpenWeight #Architecture #MoE(Mixture-of-Experts) #AttentionSinks #read-later #Selected Papers/Blogs #RewardModel #Reference Collection #KV Cache #Compression #GenerativeVerifier #SparseAttention #ResidualStream #SelfDistillation Issue Date: 2026-04-24 GPT Summary- DeepSeek-V4シリーズのプレビュー版が発表され、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashを含み、長さ100万トークンの文脈長をサポート。主なアップグレードには、効率的な文脈処理のためのハイブリッドアテンションアーキテクチャ、強化された残差接続、安定したトレーニングを実現するMuonオプティマイザが挙げられます。両モデルは、高品質の32兆トークンで事前学習され、ポストトレーニングパイプラインにより能力が強化されます。DeepSeek-V4-Pro-Maxは最先端の推論能力を誇り、特に長い文脈において高い効率を発揮します。モデルのチェックポイントは公開されています。 Comment

HF: https://huggingface.co/collections/deepseek-ai/deepseek-v4

元ポスト:

Loading…

とうとうでました

所見:

Loading…

所見:

Loading…

Artificial Analysisによる評価:

Loading…

所見:

Loading…

所見:
-

Loading…

所見:

Loading…


1Mコンテキストにおいて、V3.2と比較してわずか10%のKV Cacheしか必要としないとのこと。

所見:

Loading…

1Mトークンのcontext windowを実用的にするために最新の叡智が詰め込まれまくっているという感じのようである。うーむ読むしかない

所見:

Loading…

RTX 6000で4基でFlashが動いたよ、という報告に見える:

Loading…

解説:

Loading…

所見:

Loading…

関連:
- HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04

Self Rewarding LMsのコンセプトが利用されている:

Loading…

Proは、Flashをlong contextを扱える様々なドメインのスペシャリストとして訓練し、OPDによって蒸留されたものなのでは?という話:

Loading…

論文中に疑問点をアノテーションした結果が共有されている:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #RLVR #Selected Papers/Blogs #Memorization #Generalization #Reading Reflections Issue Date: 2026-04-23 GPT Summary- 大型言語モデルは、RLVRを通じて推論能力を向上させる一方で、高品質な報酬信号の構築が難しくなってきた。本研究では、データ不足、報酬のノイズ、自己教師付き報酬の下での実証研究を行い、一般化はトレーニング報酬の飽和ダイナミクスに左右されることを発見。一般化するモデルは長い局面を持ち、急速に飽和するモデルは記憶に偏ることを示した。また、推論の忠実度がモデルのレジームを予測する指標であることも特定。継続的な事前学習と監督付き微調整の効果を分離し、SFTが弱い監督下での一般化に必要であることを確認。これにより、Llama3.2-3B-Baseが以前は失敗していた三つの設定で一般化を達成した。 Comment

pj page: http://salmanrahman.net/rlvr-weak-supervision

元ポスト:

Loading…

pj page: https://salmanrahman.net/rlvr-weak-supervision

- RLVRにおいて、シグナルが不完全な場合(i.e., weak supervisio)の3つの状況に基づいて、汎化性能を分析
- Scarce data: 8つの訓練事例
- Noisy Rewards: 最大90%のラベルに誤りがある
- Proxy Rewards: ground truthなしで、model confidenceにもとづく多数決のみを利用
- RLVRにおいて、Training Rewardが飽和する前に、より長いステップ数学習をしたモデルは、汎化性能が高くなる
- ➡︎ memorizationによって早期にTraining rewardが頭打ちになりgenericな能力を獲得できていないことが示唆される
- 汎化に失敗したモデルは探索が少ないのでは?ということが理由として考えられるが、実はこの説明は間違っている
- Llama, Qwenの2つのモデルを比較した時Llamaは訓練中Qwenと比較して高いsemantic diversityを維持していたが、最終的にQwenよりも汎化性能が低い(=memorization)してしまっていた
- ➡︎ 真の原因はfaithfullnessが低い推論であり、論理的にsupportされないreasoning traceの元正解に辿り着いてしまうことが原因であると考察
- 解決策として、reasoning dataを用いた `pre-RL training` を実施する。
- すなわち、RLVRを実施する前に、Llama-3.2-3Bに対して、継続事前学習(52B math tokens)を実施し、その後 Thinking SFT (43.5K reasoning Traces)を実施する
- CPTとThinking SFTによって、Llamaはweak supervision (i.e., scarce data, noisy rewards, proxy rewards)状況下でも意味のある学習を実施することができた
- ➡︎ reasoning能力が獲得されたことにより推論のfaithfulnessが改善されることで、memorizationが防止されより長いstep数訓練報酬が飽和せずに学習ができたため

といった話が著者ポストに記述されている。

memorizationを防止し、なるべくgenericな能力を身につけさせることが鍵という考え方は、最近色々なところで見かけるように感じる (Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10 など)。単にデータをスケールさせるだけでなく、より効率的な学習のため、モデルに対してよりgenericな能力を身につけさせるための工夫(モデルの記憶容量をあえて減らす等)が今後進んでいきそうである。

- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ACL #ReversalCurse Issue Date: 2026-04-23 GPT Summary- 自己回帰型LLMは関係語を通じてエンティティを結び付ける際に高い性能を示すが、関係の論理意味論を学習しているか、また反転型の失敗が順序バイアスに起因するかは不明である。本研究では、対称・逆のトリプルに基づく知識グラフを使用した合成フレームワークを提案し、GPT風のモデルを訓練して論理推論と一般化を評価。論理情報の監督により、関係意味論が現れる相転移を観察し、成功する一般化が安定した中間層信号と一致することを示した。反転失敗は欠如した意味論よりも、自己回帰の順序バイアスに起因することが示唆された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #FoundationModel #read-later #Selected Papers/Blogs #2D (Image) #UMM Issue Date: 2026-04-23 GPT Summary- 画像生成モデルがゼロショット視覚理解を示すことは、LLMsの言語理解能力に似ている。視覚モデルは強力な理解能力を持つことが証明されておらず、本研究では画像生成がLLMの事前学習に似た役割を果たすことを示す。Vision Bananaを導入し、指示調整を行い、さまざまな視覚タスクで最先端の性能を達成。特に、セグメンテーションや深度推定タスクで競争力のある結果を得ており、画像生成が視覚学習において重要な役割を果たすことを示唆。生成的視覚の事前学習は、理解と生成の基盤となるFoundational Vision Modelsの構築において重要な変革をもたらす可能性がある。 Comment

pj page: https://vision-banana.github.io/#capabilities

元ポスト:

Loading…

著者ポスト:

Loading…

所見:

Loading…

Vision bananaの批判に対する第一著者によるレスポンスのサマリのようである:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICLR #Selected Papers/Blogs #Generalization #One-Line Notes #AgentSkills Issue Date: 2026-04-23 GPT Summary- 大規模言語モデル(LLMs)を利用して、エージェントが一般化可能なスキルを学習するための新しいフレームワーク「PolySkill」を提案。スキルの抽象的な目標と具体的な実行を切り離すことで、スキルの再利用や一般化を促進。実験では、ウェブサイトでのスキル再利用を1.7倍向上させ、成功率を最大13.9%向上させた。PolySkillにより、エージェントが自己目標を識別し、より良いカリキュラムを学習する能力が高まり、継続的に学習できる自律エージェントの構築に寄与することが示された。 Comment

元ポスト:

Loading…

エージェントスキルにポリモーフィズムの考え方を導入し、WhatとHowを分離することで汎化性能を高める。下図が分かりやすい。
image

最初に特定ドメインのwebサイト(e.g., shopping)を訪れた際に、AbstractShoppinpクラスを生成しShopping関連を扱うクラスとする。その上で、特定サイト(e.g., Amazon)のスキルを生成する際は、AbstractShoppingクラスにシグネチャを登録した後、同クラスを継承。AmazonShoppingクラス内に具体的な処理を定義する。直接スキルを生成するのではなく、抽象スキルを生成した上で、特定サイトでのメソッドを実装する。

openreview: https://openreview.net/forum?id=KdEsujyiSV




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #KV Cache #Initial Impression Notes Issue Date: 2026-04-23 GPT Summary- 連鎖的推論ではKVキャッシュの拡大がボトルネックとなっており、従来の手法は手作業で管理されている。よりスケーラブルな「Neural Garbage Collection(NGC)」を提案し、言語モデルが推論と同時に忘れることを学ぶ。モデルは推論中にキャッシュエントリの追い出しを決定し、これを強化学習で最適化。成果ベースのタスク報酬を用いて学習することで、高い精度を保ちながらキャッシュサイズを圧縮し、エンドツーエンドの最適化がモデルの能力を向上させる可能性を示した。 Comment

元ポスト:

Loading…

LLMにReasoningとKV Cacheのマネジメントを同時に学習させる。

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Prompting #Bias #ICLR #Test-Time Scaling #Diversity #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-21 GPT Summary- String Seed of Thought(SSoT)という新しいプロンプティング手法を提案し、Probabilistic Instruction Following(PIF)のパフォーマンスを改善します。PIFは選択肢を確率に基づいて選ぶタスクですが、LLMはしばしば非決定論的な挙動が要求される場面で偏りを生じることがあります。SSoTは、まずLLMにランダムな文字列を生成させ、これを操作することで多様性を維持しつつ制約を遵守した答えを導く手法です。実験により、SSoTがPIFの改善に寄与し、応答の多様性を高めることを示しました。 Comment

openreview: https://openreview.net/forum?id=luXtbX1lVK

元ポスト:

Loading…

LLMが内包するバイアスを抑制し、出力の多様性を高めるPrompting手法っぽい。興味深い。

ランダムな文字列を生成させてから、その文字列を操作させて出力を得るようなアプローチとのこと。
image

著者ポスト:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Personalization #ICLR #Personality Issue Date: 2026-04-19 GPT Summary- LLMsは、異なるペルソナを自然に適応させる能力を持ち、その知識は既存のパラメータに埋め込まれていることを示す。小規模な比較データセットを用いて、特定のペルソナに関連する活性化の特徴を特定し、ペルソナサブネットワークを分離するマスキング戦略を開発。二値的な対立性を持つペルソナ間の統計的発散を生み出す対照的剪定戦略も提案し、完全な訓練を必要としない。得られたサブネットワークは、外部知識を必要とする手法よりもペルソナ整合性を大幅に向上させ、LLMsのパーソナライズに新たな視点を提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Tokenizer #Selected Papers/Blogs #reading #KeyPoint Notes #Byte-level Issue Date: 2026-04-19 GPT Summary- プロキシ圧縮を導入し、圧縮入力と生のバイト列の共同訓練を通じて、モデルに両者の整合を学習させる新しい訓練手法を提案。実験では、訓練効率が大幅に改善され、固定計算予算内でのバイトレベルベースラインを上回る成果を示す。モデル規模の拡大に伴い、プロキシ訓練を受けたモデルはトークナイザーアプローチに匹敵または競合する性能を発揮し、頑健性を維持。 Comment

元ポスト:

Loading…

既存の言語モデルはバイト列をcompressorを通じて圧縮されたシンボルを通じて学習されているものとみなせるが(compressorは言語モデルであればtokenizerでありシーケンス長を4--6倍削減する)、これにより特定の言語モデルがcompressorと強く紐づいてしまう欠点がある。tokenizerを噛ませる欠点としては、グリッチトークン(tokenizerのvocabには登録されているが学習ができていないトークン)やprompt boundary issue (The Art of Prompt Design: Prompt Boundaries and Token Healing, Scott Lundberg, 2023.05 )、言語固有のバイアスなどの問題が生じること。

提案手法はモデルのアーキテクチャとnext token predictionは一切変えずに適用できる。学習時のinputとして、warmupフェーズにおいてはcompressorによるトークン(タグで囲む)と、生のバイト列(タグで囲む)の両方を入力する。warm upが終わった後は、compressed dataを90%、10%をraw dataによって表現して学習する。vocabはバイト列(256個のvocabで済む)とcompressorの両方で共有するが、inference時はcompressorを完全に無くしバイト列の入力のみでinferenceする。

image

ベースラインとしてtokenizerを用いた場合と、バイト列をそのまま学習した場合、neuralモデルをcompressorとして用いた場合と比較し、0.5Bではベースラインよりもスコアが低いが、14B級になると、全てのbaselineを上回るだけでなく、tokenizerを用いた場合のモデルも上回った。
image




Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #Evaluation #MultiModal #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Game #Initial Impression Notes Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment

元ポスト:

Loading…

Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは

という感想を持っているからである。

pj page: https://gameworld-project.github.io/




Paper/Blog Link My Issue
#NLP #Generalization #Robotics #VisionLanguageActionModel #EmbodiedAI #EmergentAbilities #Initial Impression Notes Issue Date: 2026-04-19 GPT Summary- ロボット基盤モデルπ_{0.7}は、未知の環境で多様な言語指示に従う能力を持ち、幅広い台所家電の多段階タスクに対応。ゼロショット一般化を実現し、初期設定のままで高い性能を発揮。多様な文脈条件付けを用いて、タスクの実行方法を示すマルチモーダル情報を活用。実験では、複数のロボットプラットフォームで速度や言語追従、タスク一般化を評価し、強化学習モデルに匹敵する性能を示した。 Comment

元ポスト:

Loading…

関連:
- Emergence of Human to Robot Transfer in VLAs, Physical Intelligence (π), 2025.12

以下はブログを斜め読みして感じた所感

新たなロボットが服を畳めたり(当該ロボットの服をたたむ学習データなしで)、新たなキッチン家電を(口頭でのcoachingに基づいて)使いこなす、といった汎化性能をVLAが獲得したという話に見える

関係者によるポスト:

Loading…


新たなキッチン家電はノンフライヤーであり、実際に学習データの異なるロボットがフライヤーを開け閉めするエピソードからスキルを学習したことを突き止め、習得したスキルと知識の組み合わせによって、VLAの分野でも汎化が実現され、かつworld modelでロボットが到達すべきサブゴールを生成し条件付けすることが機能することを学んだといった話が書かれている。

日本語解説: https://www.docswell.com/s/DeepLearning2023/Z27ME6-2026-04-24-135712

上記解説を見るとpreprintもあったようなので、最初のissueに追記した




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #LLMServing #Selected Papers/Blogs #reading #One-Line Notes #KV Cache #needs-revision Issue Date: 2026-04-18 GPT Summary- Prefill-decode(PD)のデプロイにはKVCache転送が制限要因となっており、従来のアテンションモデルは大容量のKVCacheトラフィックを生成する。ハイブリッドアテンションアーキテクチャはKVCacheサイズを削減するが、データセンター間の運用に問題が残る。そこで、Prefill-as-a-Service(PrfaaS)を提案し、プリフィル処理を専用クラスタにオフロードして効率的なKVCache転送を実現。これにより、リソースの独立したスケーリングを可能にし、実績として、PrfaaSを用いた異種デプロイメントは従来よりも高い提供スループットを達成。 Comment

元ポスト:

Loading…

LLM servingにおいて、prefillはcompute-intensiveで、decodeは(kv cacheが肥大化するため)memory-intensiveであるという特性があるため、(それぞれ得意な処理は得意なノードに任せるため)prefillとdecodeを分離して異なるノードで実施するprefill-decode disaggreagated servingというインフラのアーキテクチャが超巨大モデルでは主流だが、prefill-decode間でKV Cacheを転送しなければならないため、このような分離は同じ計算機クラスター内のRDMA(Remote Direct Memory Access)が可能なノード間に限定されるのが一般的である。

しかし、compute/memory特化型のリソースは通常チップの種類と物理的な場所の両方に制約されてプールされるので、両方のハードウェアがRDMAのような密結合なドメインで利用できないという欠点がある。このため、クラスターを超えてPD分離をしたいのだが、KV Cacheの転送が結局のところボトルネックとなる。現在のモデルはSparse/LinearなアテンションによってKV Cacheに必要なリソースが一桁減っているが、それでもnaiveにクラスタを跨いでPD分離をすると、突発的なリクエストのバーストや、不均一なPrefix Cacheの分布、クラスター間の帯域幅の変動などによって、計算効率が低下してしまう。

そのため、提案手法では、高スループットな長文のprefillに特化した独立クラスタを作り、ローカルにキャッシュされていない(主に長文の)、 prefillのみを同クラスタにオフロードし、短いリクエストはローカルでPDを実施するようなアプローチをとる。こうしてprefill特化クラスタによって生成されたKV Cacheはdecode可能なPDクラスタに対してイーサネットを介して転送される。これは選択的なオフロードであり、帯域幅が制限された経路で非効率な短いリクエストを送信を避けて、prefillの高速化が重要なリクエストのみをクラスタ間転送に集中させるという考え方に基づく。

これを実現するためには、(i)長いリクエストのみをオフロードするルーティングの仕組みと、(ii)ネットワークの輻輳を制御するための、帯域幅を考慮したスケジューラ、(iii)リクエスト長、キャッシュ配置、利用可能なクラスタの帯域幅を総合的に考慮してKV Cache全体を効率的を保ちながら管理するグローバルKV Cacheマネージャが必要。
image

このようなアーキテクチャを1T級のKimi Linearモデルで実験した結果、スループットが1.54倍、TTFTが64%改善した、という感じらしい。




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #LongContext #3D Reconstruction #3D (Scene) #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- ストリーミング3D再構成は、ビデオから3D情報を復元する技術で、精度や効率が求められる。LingBot-Mapは、SLAMの原理に基づいたフォワード型の3D基盤モデルで、幾何学的文脈トランスフォーマーを使用している。特徴的な注意機構は、アンカー文脈や軌跡メモリを活用し、長距離ドリフト補正を実現。これにより、長いシーケンスでも安定した推論が可能となり、従来手法に対して優れた性能を示した。 Comment

元ポスト:

Loading…

pj page: https://huggingface.co/robbyant/lingbot-map

高速でlong contextでもstreaming形式で生成が可能な3D Reconstructionモデルのようである




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #memory #Hierarchical #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- エージェント型科学における超長期自律性の課題に対し、ML-Master 2.0という自律エージェントを提案。階層型認知キャッシュ(HCC)を導入し、瞬時の実行と長期的戦略を切り離して一貫性を持たせる。評価では、最先端のメダル獲得率56.44%を達成し、AIの自律的探索の可能性を示唆。 Comment

元ポスト:

Loading…

contextを
- experience (short-term)
- knowledge (mid-term)
- wisdom (long-term)

の3つの階層に分類し管理するmemory機構を提案しているようである。
階層ごとに異なる記憶容量とアクセス速度で実装し、必要に応じて階層間でデータが昇格(experience->knowledge等)、あるいは削除される、といった機構によってmemory cacheを管理するような手法のようである。

image

MLE-BenchでSoTA




Paper/Blog Link My Issue
#ComputerVision #Dataset #Transformer #Prompting #Architecture #read-later #Selected Papers/Blogs #3D (Scene) #ObjectDetection #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 単一画像から3D物体を検出するために、WildDet3Dという統一的幾何認識アーキテクチャを提案。テキスト・点・ボックスのプロンプトを受け入れ、深度信号を組み込む。新しいオープン3DデータセットWildDet3D-Dataを生成し、13,500カテゴリの100万枚以上の画像を提供。複数のベンチマークで最先端の性能を達成し、特に深度手掛かりの活用により、平均+20.7 APの向上を実現。 Comment

pj page: https://allenai.github.io/WildDet3D/

元ポスト:

Loading…

最大級の3D detection data+アーキテクチャの提案

training codeなどがリリース:

Loading…

https://github.com/allenai/WildDet3D




Paper/Blog Link My Issue
#ECCV Issue Date: 2026-04-17 GPT Summary- ELTは再帰的トランスフォーマーを基にした効率的な視覚生成モデルで、ウェイト共有によりパラメータ数を削減し高品質な合成を実現。ILSDを用いて中間ループから教師構成への蒸留を行い、一貫性のある訓練を実現。エラスティックモデルのファミリーを形成し、計算コストと生成品質のトレードオフを可能にするAny-Time推論機能を提供。パラメータ数を4倍削減しても、競争力のあるFIDとFVDを達成。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#CVPR #read-later Issue Date: 2026-04-16 GPT Summary- 視覚-言語モデルの密なパッチ-テキスト整合性を向上させる新手法を提案。パッチレベルの蒸留が有効で、蒸留済みモデルが教師モデルを上回る整合性を示す。iBOT++を導入し、未マスクのトークンが損失に寄与。学習効率向上のためのキャプションサンプリング戦略を追加。TIPSv2として新しい画像-テキストエンコーダを開発し、広範な下流アプリケーションにおいて強力な性能を実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Chain-of-Thought #Evaluation #Reasoning #ICML #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2026-04-16 GPT Summary- LongCoTを導入し、複雑な推論能力を測定するための2,500問の専門家設計問題からなるベンチマークを提供。問題は数万から百数万の推論トークンを含む相互依存の手順を要求し、最先端モデルは全体で<10%の精度であることが示され、長期推論の限界が明らかになる。LongCoTは、モデルの長時間にわたる安定した推論能力を評価する指標となる。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

openreview: https://openreview.net/forum?id=47NnSXz3im&referrer=%5Bthe%20profile%20of%20Ivan%20Laptev%5D(%2Fprofile%3Fid%3D~Ivan_Laptev1)




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #LongHorizon #Initial Impression Notes Issue Date: 2026-04-16 GPT Summary- エージェント的タスクに対する並列テスト時スケーリングの研究を行い、集約エージェントAggAgentを提案。複数のロールアウトを生成し、軌跡の情報を効果的に統合しながら、出力のオープンエンド性に対応。AggAgentは6つのベンチマークと3つのモデルファミリーで既存手法を上回り、改善を達成しつつ、オーバーヘッドを最小限に抑えた。これにより、エージェント的集約の効率性が確認された。 Comment

元ポスト:

Loading…

Parallel test time scalingをじっしするlong horizon AI Agentの複数のtrajectoryを集約する手法のようである




Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #Selected Papers/Blogs #Verification #Initial Impression Notes Issue Date: 2026-04-16 GPT Summary- LLMの能力向上に検証を新たなスケーリング軸として適用する方法を提案。LLM-as-a-Verifierフレームワークにより、細粒度のフィードバックを提供し、連続的なスコア生成を実現。これにより、正例と負例の解の分離が向上し、追加的な検証精度が得られる。提案手法は複数のベンチマークで最先端の性能を示し、タスク進行の推定にも寄与。さらに、RLに対しても高効率なフィードバックを提供。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

著者ポスト2:

Loading…

Verification性能をtest-timeに向上させるためのテクニック

アイデアの一つにGEvalっぽいアイデアも含まれている。

続報:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-04-15 GPT Summary- TRACEは、環境特異的なエージェントの自己改善を促進するエンドツーエンドシステムであり、成功と失敗の軌道を分析して欠如した能力を特定し、ターゲット訓練環境を生成する。これにより、異なるタスク間での能力を強化し、τ^2-benchやToolSandboxでベースエージェントを大幅に上回る性能を実現。TRACEは、効率的に学習をスケールさせることも示された。 Comment

元ポスト:

Loading…

blog: https://scalingintelligence.stanford.edu/blogs/trace/




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ICLR #ConceptErasure #KnowledgeEditing #reading #KeyPoint Notes #needs-revision Issue Date: 2026-04-14 GPT Summary- LLMsの知識更新メカニズムを理解するため、統一フレームワークKnowledgeSmithを提案。編集と忘却を制約付き最適化として位置づけ、自動データセット生成器を用いて修正戦略の知識伝播を研究。実験により、LLMsが人間と同様の更新を示さず、一貫性と容量のトレードオフがあることを発見。新たな戦略設計の示唆を提供。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=znnA2Opw6v

知識の忘却と編集のダイナミクスを制約付きの最適化問題として統一的にモデル化(式3;この最適化問題を実際に解いているわけではなくあくまで理論的にこう定式化できるねという話だと思われる)し、

この定式化を通じて見ると、編集と忘却の違いはターゲットとする分布q_targetの選び方の違いにすぎず、様々な編集と忘却の先行研究は手法は違えど、この制約付きの最適化問題の異なるインスタンスを解いているに過ぎないという視点を提供しているようである。これにより、編集と忘却のトレードオフを公平に比較することが可能となるという主張をしているように見える(自信ない)。

そして、編集と忘却のトレードオフを厳格に分析するためのベンチマークとして、階層的な依存関係や(local vs. global)、更新の多段階での伝播を扱えるベンチマークが必要だが既存ベンチマークではこれらが不足しているため、
知識グラフに基づいて自動的に構築されたデータとベンチマーク(Figure 1を見るにテンプレートベースのMCQを)を作成して分析。

分析には6つのモデルファミリーの13のモデルが用いられ、スケールは1B--123Bの幅広いスケールのモデルで検証された。

image

(先行研究も含めてしっかり読まないと、式3と実験で用いられている手法AlphaEdit, ReLearnの関係性がちょっとわからなそう)

著者ポストにおいては、以下のようなtakeawayが記載されており、大きな知見としてはLLMはデータベースではなく、トレードオフを持つ複雑に絡み合ったシステムであり、以下のような点を明らかにした

- 知識の編集は意図しない変更を引き起こし
- 忘却は知識の完全な消去には失敗する
- 更新する知識を増やせば増やすほど、ローカルの知識は更新されるが、グローバルな一貫性が崩壊し
- 変更することが極めて困難な知識(たとえば歴史)が存在する

とのことである。




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #Japanese #Selected Papers/Blogs #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-04-14 Comment

元ポスト:

Loading…

OCRは非常に重要なタスクであり、特に日本語OCR向けのwildなデータセットは、日本側が主体的に作らないとグローバル側では作成されない気がしており、非常に重要な研究と感じる。実際、現行のSLMのSoTAモデル群ではうまくいかないようだ。

Sarashinaは日本語のOCR向けにプロプライエタリなデータセットを作成して学習されていると記憶しており、それでもなおQwen3-VLの方がベンチマークスコアが高いのは意外だった。

関連:
- Sarashina2.2-Vision-3B: コンパクトかつ性能が高いVLMの公開, SB Intuitions, 2025.11
- sarashina2-vision-{8b, 14b}, SB Intuitions, 2025.03




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #CVPR #read-later #Selected Papers/Blogs #WorldModels #One-Line Notes Issue Date: 2026-04-11 GPT Summary- ビデオ世界モデリングにおいて、多様な未来状態を効率的に予測するために、DeltaTokというトークナイザーを導入。これによりVFM特徴の差を連続的な「デルタ」トークンにエンコードし、DeltaWorldという生成的世界モデルを提案。これにより、ビデオを一次元の時系列に圧縮、512×512フレームでトークン数を1,024倍削減。多仮説訓練を通じて多様な未来を平行に生成し、単一のフォワードパスで多様な予測を得られる。実験結果においてDeltaWorldは、従来のモデルよりもパラメータ数が35倍、FLOPsは2000倍少ないにもかかわらず、現実に近い未来を予測することを示した。 Comment

過去と現在のフレームを入力し差分の潜在表現を出力するDeltaEncoderを学習し、潜在表現に基づいてnext token predictionをする(複数の推論結果を出力させ、最も学習データに近いものを用いて学習する。複数の候補を出力するため推論時は多様な候補を得られる)。
これにより、予測に必要なトークン数が大幅に削減され(Dino-basedなモデルと比較して1024--2048倍)、パラメータ数が削減されFLOPSも低下(generative modelsと比較して、35倍パラメータ数が小さく、2000倍計算に要するFLOPSが低下)。

といった話が著者ポストで説明されている。




Paper/Blog Link My Issue
Issue Date: 2026-04-11 GPT Summary- MiCAは、大規模言語モデルのファインチューニングにおいて、マイナー特異ベクトルを対象としたパラメータ効率の良い手法。従来のLoRAと異なり、特異値分解を用いて重要でない特異値に関連するサブ空間を特定し、その方向でパラメータ更新を制約する。これにより、知識獲得を最大5.9倍改善し、LoRAよりパラメータ量を6〜60%に抑えることが可能となる。このアプローチは、事前学習済みモデルへの知識統合を効率的かつ安定的に行うことを示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-04-11 GPT Summary- Video理解の進展に伴い、従来のベンチマークは飽和し、スコアと現実の能力に乖離が生じている。これを受けて、Video-MME-v2を導入し、動画理解の頑健性を評価する新たなベンチマークを提案。複雑さを高めるプロセスを経て、視覚情報の統合からマルチモーダル推論まで段階的に評価。また、一貫性と非線形評価を強制する戦略を採用し、人間のアノテーションによるデータ品質を保証。実験により、現在のモデルと人間専門家のギャップを明示し、新しい動画MLLMs開発のためのテストベッドを確立。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-04-10 GPT Summary- 強化学習の目的が期待報酬の最大化に偏る問題を解決するため、Learning Advantage Distributions(LAD)を提案。これはアドバンテージ誘導分布を学習するフレームワークで、方針とアドバンテージ分布の最適化を実現。LADは高いアドバンテージの応答を強調しつつ、過度な自信を抑制する勾配更新を生み出し、追加コストなしで訓練できる。実験により、LADが精度と生成的多様性を高めることを確認。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#read-later Issue Date: 2026-04-10 GPT Summary- ニューラル・コンピュータ(NC)は、新しい計算・メモリ・I/Oを統合する機械形態を提案。明示的なプログラムを必要とせず、外部環境の学習を目指す。長期目標は、安定した実行と再プログラミングが可能な完全なニューラル・コンピュータ(CNC)を実現すること。初期段階では、収集したI/Oトレースから学習できるNCプリミティブを考察し、CLIやGUIでのビデオモデルを具現化。課題として、ルーチン再利用や安定性が残る中、CNCへの進展を示唆し、エージェントや従来コンピュータを超える可能性を探る。 Comment

関連:
- [Paper Note] NeuralOS: Towards Simulating Operating Systems via Neural Generative Models, Luke Rivard+, arXiv'25, 2025.07

解説:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #OpenSource #PostTraining #read-later #Selected Papers/Blogs #Environment Issue Date: 2026-04-10 GPT Summary- Gym-Anythingを用いて任意のソフトウェアを対話型環境に変換するフレームワークを提案。コーディングエージェントが設定を行い、独立した監査エージェントが品質を検証する。200のソフトウェアアプリケーションに適用し、1万件超の長期タスクを含むCUA-Worldを生成。特に長期ベンチマークCUA-World-Longを用いて高難易度タスクを評価し、訓練されたモデルが優れた性能を示すことが明らかに。全てのコードとデータを公開し、今後の研究を促進することを目指す。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ICLR #read-later #Test Time Training (TTT) Issue Date: 2026-04-08 GPT Summary- 静的な学習パラダイムでは新情報への動的適応が制限される。本研究では、推論時訓練(TTT)を用いてモデルパラメータを更新し、インプレースTTTフレームワークを提案。これにより、MLPブロックの最終射影行列をファストウェイトとして扱い、ゼロからの再訓練なしでLLMを強化。次トークン予測タスクに目的を整合させ、スケーラブルなアルゴリズムを実現。実験により、4Bパラメータモデルが優れた性能を示し、競合するアプローチを上回った。In-Place TTTは継続的学習の新たな一歩を提供する。 Comment

openreview: https://openreview.net/forum?id=dTWfCLSoyl

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Alignment #ACL #Decoding #Findings #Routing #KeyPoint Notes #Test-time Alignment Issue Date: 2026-04-07 GPT Summary- 推論時に固定されたLLMsを用いて、トークンレベル適応ルーティング(TARo)を提案。報酬モデルにより数学的推論の一貫性信号を捉え、ルーターが基盤モデルを自動制御。TARoは推論性能を最大+22.4%向上させ、分布外の臨床推論や指示遵守を改善。再訓練なしでの一般化も可能で、堅牢な推論を実現。 Comment

元ポスト:

Loading…

巨大なベースモデル全体を特定ドメインに適用するためにpost-trainingするのは大変なので、代わりに小規模なdomain-expertなRewardモデルを学習し(今回は数学のstep-wiseにlogicが正しいことをpreferenceとして与えるような学習方法を採用したようである; 3.2節)、各decoding step tにおいて、ベースモデルとRewardモデルのトークンのlogitを線形補完することで、出力トークンをガイドする。logitの線形補完において、固定されたスカラー値(e.g., 0.5など。GenARMという手法らしい)を用いる研究などが先行研究ではあるが、これはベースモデルの特定タスクにおいてベースモデルの性能を劣化させるので、本研究ではdecoding step t時点で出力されたベースモデル、Rewardモデルのlogitを入力として、FFNによって線形補完の重みα_tをdecoding step tごとに決定する(α_tを決定するネットワークをRouterと呼ぶ)。FFNは2種類のvariantがあり、双方のlogitをconcatしたものを入力するものと、top-kをサンプリングし、kごとにindexに基づいたembeddingをconcatして入力する方法の二種類がある(3.3節)。
image

結果としては、GenARMと比較して提案手法は有効ではあるが、ベースモデルとrewardモデルの組み合わせによっては、baseモデルよりも性能が悪化するということもありそうに見える。
image

またRouterはベースモデルのサイズを大きくしても、性能が転移するので再学習が不要である。
image




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #AIAgents #TabularData #SelfImprovement #ACL #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment

元ポスト:

Loading…

複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。

image

表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。




Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #AIAgents #Coding #PostTraining #read-later #SelfDistillation Issue Date: 2026-04-04 GPT Summary- 簡易自己蒸留(SSD)を用いて、LLMが独自の出力のみでコード生成の改善が可能であることを示す。特定の温度とトランケーション設定で出力をサンプリングし、その後教師付きファインチューニングを行うことで、Qwen3-30B-Instructのパフォーマンスを42.4%から55.3%に向上。4B・8B・30Bスケールのモデル間で一般化され、改善のメカニズムをLLMデコードの精度と探索の相互関係に関連づけて検討。SSDは、精度を高めつつ多様性を保持するアプローチとして、LLMのコード生成に寄与する可能性を示唆する。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICLR #PostTraining #Selected Papers/Blogs #Stability #needs-revision #EntropyCollapse Issue Date: 2026-04-01 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=E8MR8jgEeZ

PPO/GRPOなどのアルゴリズムではRL中にポリシーの多様性が低下し、ポリシーがdeterministicになり探索をしなくなり、パフォーマンスが停滞するか低下する(あるいはベースモデルでもともと高い尤度を持っていた解のPass@1が改善するが、ポリシーの出力が狭くなるため、Pass@kが犠牲になる)現象が生じる(= entropy collapse)ので、それを是正したいという話。

後ほど追記




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #BudgetAllocation Issue Date: 2026-03-29 GPT Summary- LLMの推論進展は、損失関数の洗練とアライメント戦略の整合によって進むが、標準的なRLパラダイムは一様性に縛られ、難問への対応に非効率を生む。これに対抗するため、動的に訓練分布を適応させるMulti-Adversary GDROを提案。オンライン難易度分類器を導入し、プロンプトを難易度グループに区分。二つのGDROゲームを提示し、頻度バイアスを排除しつつ難易度の高いプロンプトを強化。Qwen3-Baseでの実験により、精度がGRPOと比較して高まることを確認。新たなカリキュラムが観察され、リソースが推論のフロンティアへシフトすることで性能向上を促進。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #ReinforcementLearning #Architecture #SoftwareEngineering #read-later #On-Policy #Stability #One-Line Notes Issue Date: 2026-03-28 GPT Summary- ProRL Agentは、マルチターンのLLMエージェントにおける強化学習トレーニングを支援するためのAPIサービスであり、ロールアウトのライフサイクル全体を提供するスケーラブルなインフラです。標準化されたサンドボックス環境を通じて、多様なエージェント駆動タスクに対応し、ソフトウェア工学やSTEM関連のタスクで検証されています。ProRL Agentはオープンソースで、NVIDIA NeMo Gymに統合されています。 Comment

元ポスト:

Loading…

処理が重いロールアウトを独立したhttp serviceとして扱い(rollout-as-a-service)、モデルのtrainingと分離することで、リソース分離、可搬性、拡張性を向上させる。
image




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Diversity #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-28 GPT Summary- LMは質問に対して複数の回答候補を暗黙のうちに生成するが、訓練後のプロセスで単一の回答に圧縮されることが多い。医療診断や曖昧な質問応答などのタスクにおいては、複数の妥当な回答が必要とされる。本論文では、複数回答を扱う強化学習アプローチを提案し、モデルが単一の前方伝搬で複数の候補を生成できるようにする。実験により、多様性やカバレッジが改善し、コーディングタスクでは精度も向上した。提案手法は、計算資源効率の高い代替として評価されている。 Comment

元ポスト:

Loading…

ユーザのクエリにおいては正解が単一ではないものがしばしば存在するが、現在のRLの枠組みはモデルが出力した一つのbest answerに対して報酬を与えるように設計されているため、これによりモデルの出力が一つのモードに固執する、あるいはmode collapseを引き起こす。これを解決するために、モデルに複数の回答とそのconfidenceを一つのpromptで思考させ、k個出力させる。rewardはk個中何個のanswerが正解だったか、confidenceが実際のanswerのcorrectnessとどれだけ近いかなどに基づいて報酬を与えるような枠組みを採用することで、モデルの出力の多様性やcoverageが増加し、repeated sampling時のトークン効率も改善した、と言う話らしい。




Paper/Blog Link My Issue
#LanguageModel #Coding #SoftwareEngineering #read-later #Verification #Proofs Issue Date: 2026-03-28 GPT Summary- 大規模言語モデル(LLMs)はコード生成が可能だが、正確性に限界がある。これを克服するために、Lean 4における階層的証明探索フレームワークを提案し、複雑な検証目標を単純なサブゴールに分解する。分解スコアは訓練報酬と推論時の基準として機能し、最適化とデプロイメントの整合性を保証。Goedel-Code-Prover-8Bを利用し、教師あり初期化後にハイブリッド強化学習で訓練。Leanベースのコード検証ベンチマークでは、62.0%の証明成功率を実現し、強力なベースラインを2.6倍上回る成果を達成した。また、推論時のスケーリングによって成功率の向上が観察された。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-03-28 GPT Summary- SSLの現状は、生成的アプローチ(例:MAE)と予測的アプローチ(例:I-JEPA)によって支配され、各々長所と短所があります。Bootlegを提案し、教師ネットワークの複数の隠れ層から潜在表現を予測することで、このギャップを埋める階層的な目的を導入。これにより、異なる抽象度の特徴を同時に捉え、ImageNet-1KやiNaturalist-21の分類、ADE20KとCityscapesのセマンティックセグメンテーションで顕著な改善を示しました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #One-Line Notes #Reference Collection Issue Date: 2026-03-26 GPT Summary- Delightful Policy Gradient(DG)は、ポリシー勾配の不均衡なアップデートを解消するために、アドバンテージと行動の驚きの積に基づいたゲーティングを導入。これにより、単一コンテキスト内での方向性の精度を理論的に向上させ、複数コンテキスト間での期待される勾配を精密に近づけることができる。実験的に、DGはREINFORCEやPPOをMNISTや連続制御タスクで上回り、特に難易度の高いタスクで顕著な改善を示した。 Comment

関連:
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02

元ポスト:

Loading…

所見:

Loading…

著者ポスト:

Loading…


不要なbackward passの重みを下げるのではなく完全に無くすことで効率化する




Paper/Blog Link My Issue
#NLP #LanguageModel #PEFT(Adaptor/LoRA) #read-later #memory #Initial Impression Notes #SoftPrompt #Test Time Training (TTT) Issue Date: 2026-03-26 GPT Summary- 長い文脈をコンパクトに保存するGradMemを提案。これは、推論時に文脈へアクセスできない状況で、文脈を圧縮して数のクエリに応答する。モデルの重みを凍結し、少量のプレフィックストークンで数ステップの勾配降下を行うことで、文脈の再構成を最適化。連想キー-値検索において、GradMemは従来の手法より優れた性能を発揮し、自然言語タスクで競争力のある結果を示す。 Comment

元ポスト:

Loading…

prefixにmemory用のトークンを用意し、TTTの枠組みでcontextのreconstruction lossを通じて圧縮する、という話に見える。tokenはsoft tokenであり、m*d次元の行列で表現される。

要はcontextの潜在表現をReconstruction lossによるTTTでprefix tuningするsoft prompting手法、という感じだろうか。




Paper/Blog Link My Issue
#read-later #Selected Papers/Blogs Issue Date: 2026-03-26 GPT Summary- AIエージェントが長期間稼働するためには動的環境への適応が求められるが、既存のベンチマークは時間的依存性や技術的負債を考慮していない。この問題を解決するため、DeepCommitを導入し、ノイズのあるコミットログからマイルストーンDAGを再構築。EvoClawという新たなベンチマークを作成し、エージェントに長期的なソフトウェア進化の課題を課す。評価では、孤立したタスクに対して80%以上のパフォーマンスが、連続的な設定で38%まで低下し、エージェントの維持管理能力に脆弱性が見られた。 Comment

leaderboard: https://evo-claw.com/

元ポスト:

Loading…

OpenHands(著者グループ)のスレッド:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-03-26 GPT Summary- 単一画像から3D物体の形状や運動パラメータを共同推定するために、提案されたMonoArtフレームワークは、視覚情報を段階的に変換し、安定した可動推定を実現する。既存の手法のスケーラビリティや効率性の問題を克服し、PartNet-Mobilityデータセットで最先端の再構成精度と推論速度を達成。ロボット操作や可動シーン再構成にも応用可能。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Evaluation #Initial Impression Notes Issue Date: 2026-03-25 GPT Summary- プロンプトの性能を細粒度で評価するため、安価な自動評価データと限られた人間によるゴールドスタンダードラベルを統合した新しい統計モデルを提案。自動評価スコアを基に生成モデルの潜在表現を事前学習し、小さな較正セットで人間の嗜好に整合。これにより、標準ベースラインを上回る精度で人間の嗜好を予測し、詳細なリーダーボードの構築やモデルのパフォーマンス推定が可能になることを示す。 Comment

元ポスト:

Loading…

少量の人間ラベルとLLMによって合成されたraterでテンソルを作り(モデル、prompt, rateのテンソル)を行列分解することで、効率的に(=人間のrateはscarceなので行列分解を通じて潜在表現に落としてサンプル効率を高める、というより次元の呪いを回避する?)単一のスコアでのモデル評価ではなく、様々な異質のpromptの元でのスコアリング(=finegrained evaluation)を実現する、という話に見える。




Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #read-later #Selected Papers/Blogs #Stability #WorldModels #Pixel-based #LatentRepresentation Issue Date: 2026-03-24 GPT Summary- LeWorldModel(LeWM)は、原始ピクセルからエンドツーエンドで訓練できる最初のJoint Embedding Predictive Architecture(JEPA)を提案。従来の手法に比べ、調整可能な損失のハイパーパラメータを6個から1個に減らし、約1500万パラメータを持つLeWMは、ファウンデーションモデルより最大48倍速く学習。2Dおよび3Dの制御タスクで競争力を維持し、潜在空間が物理的構造を符号化していることを示す驚き評価も行われ、物理的に妥当でないイベントを検出する能力を確認。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, Randall Balestriero+, arXiv'25, 2025.11




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SyntheticData #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-03-22 GPT Summary- 合成データ拡張は、限られたデータでの事前学習に有効である。この研究では、有限の計算資源下での損失低減や、無限大に近づくときの損失スケーリングの改善を目指す。合成的再表現との混合で事前学習した場合、異なる分布からの合成データでもi.i.d.検証損失が改善され、データ効率は約1.48倍で頭打ちとなる。新たなアプローチとして、同文書からの合成再表現を用い、短文の代わりに長大なメガ長文を形成する手法を提案。これにより、損失とベンチマークの改善が見られ、データ効率は1.80倍に向上。合成データ生成が増えるほど、メガ長文による効果も増大することが示された。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

著者ポスト:

Loading…

- データよりもコンピューティングリソースのスケーリングの方が早く進んでおり、データ効率の高い事前学習レシピが重要となっている
- 事前学習において、合成データがi.i.d.なwebデータの損失減らすことに寄与するかを調査
- 300Mモデルで200M tokenを学習した際にどれだけi.i.d.なwebデータのlossを低減させられるかを調査
- 最初に最もシンプルなdata augmentationであるrephrasingを調査したところ、文書単位でのrephrasingの回数が増えるにつれて、web lossとdownstreamベンチマークでのエラー率が単調に改善
- 続いて、ある文書をrephraseした文書を結合することで、単一の大きな文書(=megadoc)を構成する手法を提案し、megadocを利用することでさらにlossが改善することを確認。megadocの構成方法として下記三種類を提案し:
- Real First Stitched: `文書に対するrephraseをG個生成し、それらを結合することでmegadocを構成する手法。実データを結合の頭にもってくる。
- Real Last Stitched: Real First Stichedと同様の処理をするが、実データを結合の末尾に持ってくる手法
- Latent Thoughts: 文書をG+1個の同じ長さのピースに分割し、ピース間を埋めるrationaleを合成して結合する手法。rationaleはタグで囲う。
- Real First Stitched と Real Last Stitched を比較したところ、後者の方が性能が良かった。
- 後者の方が性能が良い考察として、epiplexity [Paper Note] From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, Marc Finzi+, arXiv'26, 2026.01 の観点から考察をしている。前提として実文書の方が複雑で情報量が多いと考えたときに、Real First Stitched の場合は実文書の情報からrephraseを学ぶという簡単な変換(生成)を実施すればよいのに対し、Real Last Stitchedの場合逆で、rephraseからより詳細で複雑な実文書に変換(生成)するというタスクを実施せねばならない。このため、後者の方がより計算的に困難な関数を学習する必要があり(すなわち、epiplexityが高い学習設定ということ; epiplexityが高い学習設定の方がモデルの汎化性能が高くなる)、学習の結果より高い汎化性能を獲得しているのではないか、と考察している。

image

- また、モデルをアンサンブルした場合の性質についても考察がされており、self-distillationは単体モデルの性能を向上させることに寄与するが、アンサンブルするモデルの数を増やすと実データを用いたモデルと最終的には性能が同等となることが予測され、達成可能なピーク性能がアンサンブルによってブーストされる効果は観測できなかった。一方で、Rephrasingによる合成データによって学習されたモデルはアンサンブルによって達成可能な性能のピーク値がブーストされると考えられる。
image

関連:
- [Paper Note] Rewriting Pre-Training Data Boosts LLM Performance in Math and Code, Kazuki Fujii+, ICLR'26, 2025.05




Paper/Blog Link My Issue
#read-later #Selected Papers/Blogs Issue Date: 2026-03-22 GPT Summary- 数学的オブジェクトの推論能力はSTEM分野で重要であり、現在の評価は簡略化された形式に依存している。本研究では、(i) 数学的オブジェクトを導出する訓練データとベンチマークを公開、(ii) LLMを用いた性能向上のための訓練レシピを提案、(iii) 計算量をスケールさせるオンポリシー訓練法を示した。強力なLLMが苦戦する中、提案手法は顕著な改善をもたらし、推論能力の一般化を示している。 Comment

pj page: https://facebookresearch.github.io/RAM/blogs/principia/

元ポスト:

Loading…

ポイント解説:

Loading…

section2に関する著者のポイント解説:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #mid-training #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-03-19 GPT Summary- PRISMの中間トレーニング設計の実証研究を行い、様々なモデルやアーキテクチャで統制実験を実施。約270億トークンのデータを使用し、数学、コード、科学ベンチマークで一貫した性能改善を達成。RLパイプラインは推論ベンチマークのスコアを大幅に向上させるも、基盤モデルへの直接適用では効果が薄い。中間トレーニングがモデル性能を効果的に高めることを示し、信頼性の向上に役立つ中間トレーニングの重要性を強調。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #MachineLearning #read-later #Selected Papers/Blogs #Clustering-based Issue Date: 2026-03-14 GPT Summary- 本研究では、$k$-meansアルゴリズムをオンライン処理に適用するために再設計し、既存のGPU実装におけるボトルネックを解消するFlash-kmeansを提案する。この実装は、距離計算とargminを統合し中間メモリの使用を回避、またセントロイド更新の競合を低減する2つの革新を導入。評価結果では、Flash-kmeansが既存のベースラインを最大17.9倍上回り、業界標準ライブラリに対しても大幅なスピードアップを実現した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

著者ポスト:

Loading…


デモ動画が含まれており驚異的な速さ




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PRM #KeyPoint Notes #Reference Collection Issue Date: 2026-03-14 GPT Summary- OpenClaw-RLは、エージェントの相互作用から生成される次状態信号を用いたオンライン学習フレームワークである。各エージェントのアクションに対するユーザーの反応やツールの出力を利用し、一つのポリシーで複数のトレーニング問題を同時に学習する。次状態信号は評価信号と指示信号を含み、前者はアクションの成功度を示し、後者は改善点を指摘する。非同期設計により、モデルはリアルタイムでリクエストに応じ、ポリシーを更新する。個人用エージェントや一般エージェントに適用することで、ユーザーのフィードバックを活用し、スケーラブルな強化学習を実現する。 Comment

元ポスト:

Loading…

解説:

Loading…

日本語解説: https://tech.layerx.co.jp/entry/openclawrl-agenticrl

テクニカルレポートを見ると情報量が非常に多くて圧倒されてしまうが、著者ポストを鑑みるに本研究の肝は下記である。

既存のAgentic RLは、Agentがaction a_tを実施した後に環境の状態がs_t+1に変化するが、それをcontextとして活用し次のactionを生成している。しかし、ただcontextとして活用するよりももっと有用な使い方があるのではないか、という主張をしているように見え、具体的には以下の2つの無駄が生じているという指摘で
- 次のstateは前回のアクションの暗黙的な評価を与えており、これを捨ててしまっている。たとえば、ユーザは満足いっていないことをqueryするかもしれないし、テストが通ったら成功、エラーが出たら失敗という評価に関するシグナルが潜んでいる。これは主に数学ドメインで利用されてきたProcess Reward Modelによるプロセスに関するRewardとは対照的に、verifiableなドメインを超えて自然なインタラクションの中で生じるシグナルから評価できる。
- 上記は評価に関するシグナルだが、もう一つのシグナルとして方向性に関するシグナルが得られる。たとえば、「あなたは最初にファイルを確認すべきだ」というqueryがs_t+1として得られたとする。これは、単にa_tが失敗だっただけでなく、「どのトークンが、どのように」誤っていたかに関する具体的なフィードバックとみなせる。たとえば、errorに関するtraceは具体的などこを修正すれば良いかのシグナルである。現在のRLVRの枠組みはこれらのシグナルを(最終的に得られる)sparseな単一のスカラー値に落としてしまっており、これら精緻な方向性に関するシグナルを完全に捨て去ってしまっている。

前者についてはBinary RL[^1]によってシグナルを拾え、

後者についてはs_t+1からtextualなhintを抽出しteacher contextとして活用することで、トークン単位でのadvantageを計算できる[^2]。

そしてこれら両方を組み合わせることで、より良い結果を得ることができる、といったことが著者ポストに書かれている。

元論文自体は部分的にしか読めていないのだが、論文のメッセージとしては、s_t+1の情報にはまだ活用できるシグナルがあるのにそれが見過ごされていて、現在のRLVRの枠組みではスカラー報酬に埋もれてしまっているという課題意識が肝だと感じた。

また、手法的な観点で言うと、日本語解説と、テクニカルレポート4.1.2節に書かれている通り、リアルタイムなユーザとの対話を前提てして考えた時に、ロールアウトは1つしか現実的に存在しえないため(複数ロールアウトに対してユーザからのフィードバックs_t+1を得ることは実用的な設定では非現実的)GRPOが適用できない、という点はなるほどなぁ、と感じた。

[^1]: a_t, s_t+1が与えられた時に{0, 1, -1}を返す何らかのProcess Reward Modelを定義し、m回独立した施行を実施しmajority votingをすることでreliableなa_tに対するRewardを得る(4.1.1節)。

[^2]: s_t+1から抽出可能なhintを追加のcontextとして与えたポリシーを教師、hintなしのポリシーを生徒とし、教師と生徒のa_tに対するトークンの尤度の差分をとることでtoken単位のadvantageを得る。すなわち、hintが与えられたときにa_tで尤度が低くなるトークンがあれば、そのトークンにはペナルティが課されることになる(4.2.2 Step4)。




Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #AIAgents #Reasoning #COLM #DeepResearch Issue Date: 2026-03-12 GPT Summary- ディープリサーチエージェントは、検索システムで重要な役割を果たしており、明示的な自然言語による推論を生成してクエリを改良する。これにより、意図と文脈情報を活用する新しいアプローチを提案。具体的には、(1) 推論に基づく検索(Reasoning-Aware Retrieval)と、(2) データ合成手法(DR-Synth)を導入。これらを組み合わせてAgentIR-4Bモデルを構築し、BrowseComp-Plusベンチマークで68%の精度を達成、従来モデルよりも大きな改善を示した。 Comment

pj page: https://texttron.github.io/AgentIR/

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #VisionLanguageModel #3D (Video) #SpatialUnderstanding Issue Date: 2026-03-12 GPT Summary- MLLMに空間理解を持たせるためのフレームワークOnlineSIを提案。動画ストリームを利用して、有限の空間メモリを用いた継続的な推論を実現し、計算量を増加させない。3D点群と意味情報を統合し、物体の位置決定を向上。ファジーF1スコアを用いて実験し、現実世界の具現化システムへの展開の可能性を示した。 Comment

pj page: https://onlinesi.github.io/

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Reference Collection #Scalability Issue Date: 2026-03-12 GPT Summary- MoEモデルのスケーリングには、パラメータの増加によるメモリ、通信、計算の制約が伴う。これを解決するために、メモリの再計算やオフロード、通信の最適化、計算のグループ化などを統合的に最適化するフレームワークを提案。これにより、長い文脈の効率化や低精度訓練サポートも実現。数兆パラメータのMoEモデルを数千台のGPUで訓練可能なオープンソースソリューションとして、実運用向けの指針を提供。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #RewardModel #One-Line Notes #Critic #Rubric-based Issue Date: 2026-03-06 GPT Summary- コードエージェントの評価は通常、ユニットテストの成功を基にしているが、実際の環境では成功信号が遅延し、ノイズが多い。本研究では、疎でノイズの多い相互作用データを用いてクリティックモデルを学習する方法を提案し、これをRLベースの報酬モデルとして利用する。具体的には、エージェントの行動特徴を含むクリティック・ルーブリックを導入し、半教師付き目的関数で人間のフィードバックと共に予測する。実験により、このアプローチが SWe-bench におけるリランキングを改善し、試行回数を83%減少させながら成果を向上させることを示した。 Comment

元ポスト:

Loading…

AI Agentによる実装は安価になったが、今度は(人間による)verificationがボトルネックなので、Agentのtrajectoryからcritiqueを実施するモデルをRubric-basedに学習しReward Modelとして活用できるようにした、という話に見える。これによりAgentの進捗をリアルタイムでvibe checkすることができるとのこと。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #4D Reconstruction #interactive #Reference Collection Issue Date: 2026-03-06 GPT Summary- ArtHOIは、単眼動画からの情報を用いて4Dの関節付き人間-物体相互作用を合成する初のゼロショットフレームワークである。このアプローチでは、動画の逆レンダリングを通じて接触や関節運動を自然に満たす物理的に妥当な4Dシーンを再構成する。提案手法は、光学フローを基に動的および静的領域を分離し、安定した物体のアーティキュレーションを回復した後、条件として人間の運動を生成する。また、多様なシーンにおいて、従来手法を上回る精度で相互作用を実現する。 Comment

pj page: https://arthoi.github.io/

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #Transformer #MultiModal #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #read-later #Selected Papers/Blogs #WorldModels #UMM Issue Date: 2026-03-05 GPT Summary- 視覚的データは言語を超えるマルチモーダルモデルの進展に重要で、我々は制御された前訓練実験を通じてその要因を明らかにした。Transfusionフレームワークを用い、テキストや視覚データで統一的に訓練し、以下の洞察を得た:(i) RAEが最適な視覚表現を提供;(ii) 視覚とテキストは相補的で相乗効果を生む;(iii) 統一学習が世界モデリングに繋がる;(iv) MoEが効率的なスケーリングを可能にする。視覚データが言語より多く必要であることを示し、MoEが両者の調和を図ることを提案。 Comment

元ポスト:

Loading…

RAE:
- [Paper Note] Diffusion Transformers with Representation Autoencoders, Boyang Zheng+, arXiv'25, 2025.10

著者ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-03-04 GPT Summary- AIエージェントの開発は、労働市場のベンチマーク上で進められているが、その代表性は不明である。本研究では、43のベンチマークと72,342のタスクを分析し、エージェント開発と米国労働市場の職業との整合性を測定。プログラミング重視の開発と人間労働の価値の乖離を指摘し、エージェントの自律性を評価することで実用的な指針を提供。最後に、社会的に重要な労働を捉えるベンチマーク設計のための3つの原則を提案。 Comment

元ポスト:

Loading…

AI Agentのベンチマークは実際の人間の労働に本当に紐づいたタスクで評価されているのか?という疑問に答えてくれる研究のようで、実際のAI Agentのベンチマークと人間の業務、それらのcapitalをマッピングしたところ、現在のAI Agentのベンチマークは過剰に数学とコーディングドメインに偏っており、実態としての人間の労働や、それらの中でcapitalが集中しているドメインに対するカバレッジが大きく不足していることがわかった。

ドメインごとに見ると、デジタル化がされていて高付加価値のドメインのいくつか(マネジメントや法務)のベンチマークは少なく、スキルをベースに見るとベンチマークは情報取得やエンジニアリングといった狭いスコープばかりに焦点が当たっていて(これらの人間の労働に占める割合は<7%にすぎない)、多くの他のスキルが無視されている状況とのこと。

また、エージェントの自律性を細分された尺度で評価するために、どの程度のレベルの複雑さのタスクであればreliableにagentがこなせるかという観点を導入し、タスクの複雑性に関するスケールを導入し比較を可能にした、といった話が元ポストに書かれている。

現在提供されているベンチマークにおいて、おそらくタスク全体のうちの個別のサブタスクごとに複雑度をラベル付けして、複雑度を軸にサブタスクの成功/失敗をtrajectoryから分析することで、タスクの複雑度を軸に成功率を分析したグラフを見ると、タスクの複雑度に対して基本的にはどのドメイン、スキル、エージェントフレームワーク、バックボーンモデルであれ複雑度な上がれば上がるほど成功率は減少していく傾向にあり、成功率は最終的に20%--0%付近まで低下する。

最終的に、エージェントの評価ベンチマークにおいては、実際の労働に対するカバレッジ、現実的であること(=実際のドメインや必要となるスキルを捉えており、実タスク全体を捉えたようなものが必要でFigure4にベンチマークごとのドメインとスキルのカバレッジが可視化されている)、より粒度の細かい評価が必要(タスク全体の成功/失敗でのみ評価すると、タスクのどこまでできていたのか?という重要なシグナルが欠落する)であることが議論されている。




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #memory #Initial Impression Notes Issue Date: 2026-03-01 GPT Summary- LLMを用いた自律エージェントの記憶において、実務的応用と評価基準の間にギャップが存在。これを解消するために、AMA-Benchを提案し、実世界のエージェント軌跡とQAを組み合わせて評価。多くの既存システムが因果性を欠き、類似性ベース検索に制約されている中、因果性グラフとツールを用いたAMA-Agentが性能を向上。AMA-AgentはAMA-Benchで57.22%の正解率を達成し、最強記憶システムのベースラインを11.16%上回る。 Comment

元ポスト:

Loading…

実際のAgenticなタスクのユースケースに沿ったmemoryの評価方法を提案している研究のようで、非常に重要な研究に見える。実際はチャットベースのやり取りではなく、エージェントと環境が相互作用しながら生成されるtrajectoryで構成され、指示はagentによって生成された客観的な目的を含んでおり、trajectoryには多くのnoisyな結果やsymbolが含まれる。また、agentが現在のstateから環境に作用した結果が返ってくるというチャットベースの言語的なフロートは異なり、stateに基づいた因果関係が存在するという差がある。

ベンチマークの結果ではGPT-5.2が優れていそうに見えるが、GPTの場合は最新のGPT-5.2で評価されているのに、Claudeに関してはClaude Haiku 3.5で評価されているのは気になる。Claude Opus 4.6やGemini-3で評価したらどの程度の性能になるのだろうか。
image

著者ポスト:

Loading…




Paper/Blog Link My Issue
#GraphBased #NLP #LanguageModel #AIAgents #ICLR #Selected Papers/Blogs #memory #One-Line Notes #Grounding Issue Date: 2026-03-01 GPT Summary- REMemは、エピソード記憶を構築し推論するための2段階フレームワークを提案する。オフラインでは、経験を時間情報を含む要旨と事実を結びつけたハイブリッド記憶グラフに変換。オンラインでは、エージェント型リトリーバを用いて記憶グラフ上での反復検索を可能にする。包括的な評価により、REMemは最先端システムを大幅に上回り、エピソード回想と推論タスクでそれぞれ3.4%、13.4%の改善を示す。回答不能な質問に対する拒否行動も堅牢であることが確認された。 Comment

元ポスト:

Loading…

単に知識や事実情報を蓄積するのではなく、過去のイベントに関するsituationalな情報(when,where,who,what)でgroundingをしながら、複数のイベント、タイムラインを跨いでreasoningができるようなepisodic memoryの提案。人間は単に意味情報から記憶を呼び起こすだけでなく、過去のイベントを想起して条件付けした上で時系列になぞって記憶を想起できる能力があることに起因する。

openreview: https://openreview.net/forum?id=fugnQxbvMm




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #AIAgents #Attention #LongContext #Architecture #One-Line Notes #Reference Collection #LongHorizon Issue Date: 2026-02-28 GPT Summary- Interleaved Head Attention(IHA)を提案し、マルチヘッド・アテンションの線形スケーリングの制約を解消。IHAでは、各ヘッドにP個の疑似ヘッドを構築し、ヘッド間のクロス混合を可能にすることで、複数のアテンションパターンを生成。理論的には、合成的Polynomialタスクに対し、IHAはMHAよりも効率的で、実世界のベンチマークでも性能向上を示した。特に、GSM8KおよびMATH-500の問題で改善を達成。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

解説:

Loading…

各headのqueryに対してlinear変換をかけてP個の疑似ヘッドを作成し、それらをinterleavingする形で整列させてK, Vを適用する、という感じらしい。多段階の推論や合成が必要な複雑なタスクにおいてheadの表現力が増し、必要なhead数が小さくなる反面、計算量が増える。疑似ヘッドはP個のトークンによって構成されるとみなせるので、FlashAttentionなどの従来の実装をそのまま適用できる。
image




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Zero/FewShotLearning #Robotics #VisionLanguageActionModel #EmbodiedAI Issue Date: 2026-02-28 GPT Summary- LAPを用いてロボットの動作を自然言語で表現し、ゼロショット転移を実現。特定の体現に依存せず、LAP-3Bは複数のロボットやタスクでの成功率を50%超え、既存モデルに対して約2倍の改善を示す。アクション予測とVQAを統合することで効率的な適応が可能。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #DiffusionModel #ICLR #read-later #Selected Papers/Blogs #ImageSynthesis #Samplers Issue Date: 2026-02-28 GPT Summary- Uniform-state離散拡散モデルは自己修正能力により優れた生成とガイダンスを実現していますが、ステップ数が増えるとサンプリング品質が限界に達します。本研究では、予測子-修正子(PC)サンプラーを導入し、任意のノイズ過程に対応可能な一般化手法を提案します。Uniform-state拡散と組み合わせることで、従来の手法を超える性能を発揮し、生成パープレキシティを低減させるとともに、サンプリングステップを増やすことで性能が向上します。また、効率的なカリキュラムを構築し、訓練時間を25%、メモリを33%削減しつつ、強力な下流タスク性能を維持します。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

openreview: https://openreview.net/forum?id=RSIoYWIzaP

著者コメント:

Loading…

openreview: https://openreview.net/forum?id=RSIoYWIzaP

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #VideoGeneration/Understandings #One-Line Notes #train-inference-mismatch Issue Date: 2026-02-27 GPT Summary- 自己回帰型動画拡散モデルは高い性能を達成するが、訓練期間と推論間のギャップにより長期視野での視覚的劣化が生じる。本研究では、訓練を超えたギャップを探求し、訓練不要でAR動画生成を効果的に長時間スケールする手法Rolling Sinkを提案。これにより、5分から30分の動画を生成し、一貫した被写体や安定した色を実現。広範な実験により、視覚的忠実度と時間的一貫性でSOTAを上回る性能を示した。 Comment

pj page: https://rolling-sink.github.io/

元ポスト:

Loading…

著者ポスト:

Loading…

- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25

のduration版。training durationとtesting durationが大幅に異なるとうまく生成ができなくなるのでそのgapを埋めましょうという話




Paper/Blog Link My Issue
#ComputerVision #Dataset #Supervised-FineTuning (SFT) #Evaluation #Reasoning #mid-training #PostTraining #VideoGeneration/Understandings #3D (Video) Issue Date: 2026-02-27 GPT Summary- ビデオ推論の能力を探究するため、100万本以上のビデオクリップを含む前例のないVBVRデータセットを導入。200の推論タスクを網羅し、既存データセットの約1000倍の規模で、評価フレームワークとしてVBVR-Benchを提示。これにより、ビデオ推論の研究における再現性と解釈可能性を向上させ、新規タスクへの応用の初期兆候を示す。VBVRは次の研究段階の基盤となる。データ、ツール、モデルは公開中。 Comment

pj page: https://video-reason.com/

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Reasoning #PostTraining #read-later #Selected Papers/Blogs #Off-Policy Issue Date: 2026-02-24 GPT Summary- オフポリシーRLアルゴリズム「OAPL」は、大規模言語モデルのトレーニングにおいて重要度サンプリングを使用せず、Lagged Inferenceポリシーを採用。OAPLはGRPOを上回り、DeepCoderと同等の性能を維持しつつ、訓練時間を3分の1に削減。また、Pass@k指標でのスケーリング改善を示し、400ステップ以上のラグを持ちながらも効率的なポストトレーニングを実現する。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #DiffusionModel #VideoGeneration/Understandings #Editing #3D (Video) #One-Line Notes Issue Date: 2026-02-19 GPT Summary- 高忠実度なビデオ編集には、新しい局所的ビデオ文脈モジュールを使用するEditCtrlフレームワークを提案。これにより、マスクされたトークンのみに集中し、計算コストを編集サイズに比例させる。全体の文脈の一貫性を保持しつつ、他の手法に比べて計算効率が10倍向上し、編集品質も改善。テキストプロンプトを利用した新機能を実現。 Comment

pj page: https://yehonathanlitman.github.io/edit_ctrl/

元ポスト:

Loading…

著者ポスト:

Loading…

video editing/inpaintingタスクにおいて、editに必要なlocal contextとeditとの一貫性を保つためのglobal contextを分離し、global contextに対するfull-attention計算を削減する(i.e., local contextに計算量を集中させる)ことで効率を向上、という話に見える。

image