NLP (4152) — 2/21


Paper/Blog Link My Issue
#LanguageModel #AIAgents #SmallModel Issue Date: 2026-07-21 GPT Summary- 現代の産業アプリケーションでは、多段階推論とツール使用を行うエージェント型モデルが求められており、小型モデルが望ましい。本研究では、合成データと限定的なオープンソースデータを用いて訓練されたAgenticQwenモデルを提案。推論RLとエージェントRLを組み合わせ、自動的にタスクの難易度を高める二重データフライホイール機構を導入。これにより、現実的な意思決定の複雑さを反映した行動ツリーを生成。AgenticQwenは公開ベンチマークや産業用エージェントシステムで高い性能を示し、特にデータ分析タスクにおいて大規模モデルとのギャップを縮めた。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #LongContext #reading #One-Line Notes #Reading Reflections #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 長文脈処理において、LLMは単にコンテキスト窓を拡張するだけでは十分ではなく、入力長の増加が精度の低下を引き起こすことがある。テスト時訓練(TTT)は長文脈の活用を改善する手法の一つだが、全体への適用は費用がかかり、ランダム抽出による訓練が性能を低下させることがある。これに対し、Self-Guided TTT(S-TTT)を提案し、適応前にモデルが選択された証拠スパンを認識することで、基準となる言語モデル訓練を適用。S-TTTは、LongBench-v2およびLongBench-Proでの精度向上を実現し、最大で15%の改善を達成。 Comment

元ポスト:

Loading…

長文Context+質問が与えられたときに、質問に関連するcontextのspanを同定した後(Self-Guided)、TTTでモデルパラメータに内部化させた後に応答する、という話に見える。TTTでは、LoRAを用いて、かつ16 gradient updateを行った時点で更新を終了する。
image

Full ContextでらTTTするよりも、Self-Guidedな方が高い性能を獲得できる。
image

TTTを使ってLoRA adapterにcontextの情報をweightとして内部化させても、思ったほど性能は上がらないのだなという印象。

LoRAでweightにcontextを内部化させても、その内部化された情報をうまく活用するような工夫が足りていないのでは?という気がするのだが、どうだろうか。

ベンチマークのインスタンスが、contextをmemorizationし、適切にattendすれば解けるようなクエリなのか否かという点も気になる。
もしcontextの情報に基づいてマルチポップな推論が必要な場合、LoRAアダプタによる重みを活用するような回路が育っていない可能性が高く、性能は伸びにくいのかなという気はする。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Architecture #read-later #Selected Papers/Blogs #ContinualLearning #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 機械学習アルゴリズムは、初期の浅いモデルから深層大規模言語モデル(LLMs)へと進化したが、長期的な知識の転移能力に欠けている。人間の学習に触発され、継続的学習と記憶の安定化を図る「Sleep」パラダイムを提案。これは、記憶を網羅的に蒸留する「Memory Consolidation」と、新しい知識を合成データで予行練習する「Dreaming」の二段階から成る。このアプローチは、長期学習や知識の取り込みにおいて重要であることを実験により支持されている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #ICML #PostTraining #Initial Impression Notes #Exploration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 強化学習(RL)において、PPO-Clipの根本的な欠陥を明らかにし、ユークリッド距離でのポリシー乖離測定が幾何的に不整合であることを指摘。これにより探索が崩壊する問題を考察。Riemannian Isometric Policy Optimization (RIPO)を提案し、探索と活用のバランスを改善。実験により、RIPOが既存のRLアルゴリズムを大幅に上回り、最大60%の性能向上を示した。 Comment

元ポスト:

Loading…

トークンレベルでPPOのclippingの値を調整し、高確率なトークンには小さなクリッピングを、低確率なトークンには大きなクリッピングを適用する。オリジナルのPPOのクリッピングの問題点の分析もあるようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #TextToImageGeneration #Test-Time Scaling #ECCV #One-Line Notes #ImageSynthesis #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 推論時のスケーリングは、Best-of-N(BoN)サンプリングからガイド付き探索に進化してきたが、生成コストを固定と見なしている。効率性評価でBoNがガイド付き探索に匹敵することを示し、Flash-BoNを提案。これはアクセラレーション技術を組み合わせ、多数の安価なドラフト候補を生成し、高品質へ精練する。ベンチマークではFlash-BoNが全ての基準を上回り、特にモデルスケールが大きいほど利得が顕著(AUCで+8%)。他の手法と相乗効果があり、候補の多様性向上が強化学習の収束を加速する。 Comment

pj page: https://flash-bon.github.io/

元ポスト:

Loading…

中間サンプルを安価で効率的な方法で生成することで多様な中間候補を探索し、有望な候補のみに対して完全な生成をするようなBest-of-Nに基づくTextToImage手法を提案。

また効率性の評価において Number of Function Evaluations (NFEs)[^1] が利用されることが多かったが、これはdenoisingのforward passのみが考慮され、verifierのコストが無視されており、verificationコストが大きい手法が本来効率的ではないのに、効率的に見えてしまう問題があった。実際、BFSのような手法では固定されたNFEの元では効率的に見えるが、頻繁にverifierを呼び出すため、固定されたwallclock timeの元では効率性が逆転する。
image

[^1]: デノイジングを実施するネットワークの呼び出し回数




Paper/Blog Link My Issue
#Analysis #ReinforcementLearning #DiffusionModel #ICML #PostTraining #Selected Papers/Blogs Issue Date: 2026-07-19 GPT Summary- dLLMsは任意の順序でトークンを生成できるが、一般的な推論タスクではこの柔軟性が逆に制限要因になることを発見。特に、不要な不確実性を回避し解のカバレッジを低下させる傾向が見られた。この問題に対処するため、標準的なGRPOを適用したJustGRPOを提案し、GSM8Kで89.1%の精度を達成。これにより、dLLMsの並列デコード能力を維持しつつ効果的な推論を実現。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=kpgURPRMGf&referrer=%5Bthe%20profile%20of%20Cheng%20Yu%5D%28%2Fprofile%3Fid%3D~Cheng_Yu13%29




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Coding #PostTraining #Music #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 音楽の演奏から指示を復元するDecomposerというポストトレーニングフレームワークを提案。MIDIからStrudel言語へのデコンパイルで、実行可能な音楽プログラムを作成。課題は、資源の乏しいStrudelと、忠実な再構成が読みにくいコードになる可能性。二段階で解決し、合成データでの教師付きファインチューニングと、ペアになっていないMIDIでの強化学習を行う。評価で、Decomposerは他の方法に比べ、高いMIDI再構成忠実性と可読性を実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2026-07-19 GPT Summary- Long-Horizon-Terminal-Benchは、AIエージェントの能力を検証するための新しい終端ベンチマークで、46件の長期タスクを含む。従来のベンチマークが評価する簡単な問題とは異なり、このベンチマークは中間報酬と部分点を重視し、長期的な計画や文脈管理を要求する。評価した15のモデルでは、タスクあたり平均9.9Mトークンを消費し、低いパス率が示され、改善の余地があることが示唆された。失敗モードの分析も行い、今後の進展に寄与することを目的としている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #LanguageModel #Selected Papers/Blogs #VisionLanguageModel #reading #One-Line Notes #LatentRepresentation Issue Date: 2026-07-19 GPT Summary- 視覚的事前学習が言語モデルの知能向上に寄与することを示す研究。テキスト変換を通さず視覚的文書を直接活用する無監督のアプローチを検討し、視覚的事前学習がテキストのみのモデルを一貫して上回ることを実証。これにより、スケーラブルな言語知能への効率的なアプローチが明らかに。 Comment

元ポスト:

Loading…

事前学習をする際に、テキストだけでなく画像パッチに対してもnext visual latent predictionを実施することで性能が改善する。
next visual latent predictionでは、画像パッチをfreezeされたvision encoderでエンコードし潜在表現の系列を取得し、現在のパッチを入力したときに、次のパッチの潜在表現を予測する(離散トークンではなく、連続値ベクトルである点に注意)。loss functionは、バッチ内の全ての画像パッチを考えたときに、各パッチの正解の潜在表現と、モデルが予測した次パッチの潜在表現の類似度行列をソフトマックスで正規化した行列を考え、対角成分(すなわち正解の画像パッチに対する類似度)が最大化されるように定義される。ソフトマックスを考えることで、バッチ内の他の画像パッチがin-batch negativeの役割を果たし、これは次パッチの潜在表現と他の潜在表現の区別がつくようなcontrastive learningをしていることに相当する(Section 4)。
image

image




Paper/Blog Link My Issue
#Analysis #AIAgents #ScientificDiscovery #VisionLanguageModel #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- AI駆動のアシスタントによる科学・技術・創造的生産の自動化を探求。特にPicbreederで人間のユーザーを最先端のVision Language Models(VLMs)に置換し、生成された出力を人間ベースラインと比較。定性的な差異を系統発生的複雑性や新規性の指標を用いて分析。因果要因として探索的ノイズの追加や行動の多様性、物語的モメンタムを調査。コードはhttps://github.com/smearle/picbreeder-vlmで公開。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #DiffusionModel #Architecture #Decoding Issue Date: 2026-07-19 GPT Summary- Nemotron-Labs-Diffusionは、AR、拡散、自己推測デコードを統合した三モードの言語モデルです。ARと拡散が補完的であることを示し、自己推測モードでは、拡散によるドラフト作成とARによる検証でマルチトークン予測が向上します。光速分析により、拡散がより多くのトークン生成を可能にし、最大76.5%の向上が見られました。3B、8B、14Bパラメータのモデルは、精度と速度の両面で最先端を超え、特にNemotron-Labs-Diffusion-8Bは、スループットを4倍に向上させました。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context, Fitsum Reda+, arXiv'26, 2026.06




Paper/Blog Link My Issue
#Citations #Dataset #LanguageModel #Evaluation #COLM #Legal Issue Date: 2026-07-19 GPT Summary- AIを用いて法的文書を作成する弁護士や裁判官が増加する中、捏造された引用が依然として多発している。本研究は、AIシステムが法的引用の幻覚を自動検出できるかを評価し、1,300件の抜粋データセットを用いて分類法を提案した。5モデルをベンチマークした結果、最新モデルはより高い性能を示すが、微妙な誤りカテゴリには苦戦することが明らかになった。エージェント系の検証は資源を消費し、情報アクセスの制限が効果を妨げる問題も指摘。これにより、商用法データベースに依存しない当事者にとっての不利益が生じる。研究では、信頼性の高い法的引用照合ツール構築のための基盤も提案している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Evaluation #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- One-Question-One-World(Qworld)を導入し、オープンエンドな質問に対する評価基準を質問特異的に生成。再帰的展開木を使用し、質問をシナリオや視点、細分化された基準に分解。HealthBenchで高いカバー率を示し、専門家によって優れた洞察と粒度が評価される。Qworldは、LLMの評価において隠れた能力差を明らかにし、固定の基準に依存せず、動的な適応評価を実現。 Comment

元ポスト:

Loading…

Open-endなQuestionを評価する際に、Questionに応じて動的にcriteriaを生成し評価する
image




Paper/Blog Link My Issue
#Multi #SpeechProcessing #AudioLanguageModel #Transcript #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- SATSは話者の発話内容とタイミングを記録する技術で、特に会議の議事録作成に役立ちますが、既存のシステムは限界があります。この問題に対処するため、MOSS Transcribe Diarizeという多機能な大規模言語モデルを提案し、エンドツーエンドでの話者帰属と時刻付き転写を実現します。最大90分の入力に対応する128kのコンテキストウィンドウを持ち、商用システムを上回る性能を評価で示しました。 Comment

元ポスト:

Loading…

話者分離可能な書き起こしモデル




Paper/Blog Link My Issue
#LanguageModel #In-ContextLearning #ICML #Selected Papers/Blogs #reading #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- Context Tuningは、重みの更新なしでLLMsのfew-shot適応を向上させる手法です。ICLはデモの記憶を1回の前方伝播で形成しますが、洗練が不十分です。従来のプロンプト手法は、デモとは独立して初期化しますが、Context TuningはICL能力を利用してデモから訓練可能なメモリ表現を初期化し、勾配ベースの最適化で洗練します。多くのベンチマークで評価した結果、Context TuningはICLと従来のプロンプト法を上回り、Test-Time Trainingに近い精度を示し、高い訓練効率を発揮しました。 Comment

元ポスト:

Loading…

pj page: https://agenticlearning.ai/context-tuning/

openreview: https://openreview.net/forum?id=UAJehyOPTS

気になる。後で読む




Paper/Blog Link My Issue
#Analysis #LanguageModel #AIAgents #Bias #ScientificDiscovery #Diversity #Personality #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- AIエージェントは異なる分析選択から生成される結論の多様性を捉え、同じデータから対立する結果を導くことができる。移民データを用いた研究では、AIが人間のイデオロギー的ギャップの72%を再現し、多くの分析が高い検証を経た。調査は、問題の本質が欠陥ではなく、選択された分析の多様性にあることを示し、m値(マルチバース値)を導入することで報告された結果の極端さを評価する手法を提案。Agentic Bootstrapを使用して、もっともらしい分析パスをサンプルすることで、科学的信頼性の評価基準を提供する。 Comment

元ポスト:

Loading…

所見:

Loading…


小さな事前知識、ペルソナの変化がバタフライエフェクトのようにエージェントが導き出す結論を左右する




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #SelfImprovement #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-19 GPT Summary- 自動ハーネス進化の評価を再検討し、既存手法の問題点を指摘。従来の評価は単体テストケースに依存し、探索手段と最終評価が同じベンチマーク上にあるため、過剰適合のリスクがある。フィードバックと推論予算を揃えた評価を行い、GPT-5.4とClaude Opus 4.6を使用して実験した結果、自動ハーネス進化は単純なテスト時スケーリングを必ずしも上回らず、一般化にも限界が示された。この結果は自動ハーネス設計の評価の再考を促すものである。 Comment

blog: https://yikee.github.io/harnessevolution/

元ポスト:

Loading…

所見:

Loading…

Harness自身を進化させる手法(Harness Evolution)を公平に評価しようね、という話で、現在の評価における以下の課題を指摘:
- Harness Evolutionは、ベンチマークに対するverifierからのフィードバックが利用されるが、これは本質的にtest time scalingにおいて検索に多くのリソースを費やした場合と分離ができていない。つまり、ハーネスそのものを進化させたことに効果があったのか、単に探索により多くの計算リソースを投じたことによる効果なのかが分離されていない。
- Harness Evolutionの探索に用いるタスクと評価に用いるタスクが同一の場合、単にタスクにoverfitしているだけなのか、汎用的に適用可能なハーネス設計の進化によるものなのかが明らかでない。

そのため、
- 固定された予算のもとで、
- どのようなフィードバックシグナルを受け取るか
- 計算リソースをどう配分し
- タスクの軌跡やハーネスそのものを修正するか

といった事項を制御しつつtest time scaling手法と比較することが重要と主張している。

実際、unit testのケースにアクセスできない場合で比較すると、Harness Evolutionはtest-time scalingを上回ることができないことが、Figure 1/Table 1に示されている。
image

unit testケースにアクセスできる場合は、test-time scaling系の手法において、オラクルを用いてサンプリングされた候補の中から最良のものを取得することができ、このような手法とHarness Evolutionを比較しても、test-time scalingを上回ることはできなかった。

また、Figure 2が、test-time scaling系の手法と、Harness Evolution系の手法を概観するのに非常にわかりやすい。

image




Paper/Blog Link My Issue
#ComputerVision #LongContext #read-later #Selected Papers/Blogs #Robotics #memory #EmbodiedAI #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- RoboTTTは、8Kタイムステップの視覚-運動文脈を用いるロボットモデルであり、最先端ポリシーの1000倍のスケールを実現しつつ推論遅延を増加させない。このアプローチにより、ワンショット模倣やポリシー改善、撹乱への頑健性が向上し、長期タスクでの性能も強化される。RoboTTTはTest-Time Trainingを取り入れ、勾配降下法で履歴情報を活用した新しいモデルを生成。実験により、従来の単一步ベースラインに対して87%の性能向上が見られ、長い文脈がロボット基盤モデルにおける新たなスケーリング軸となることが示された。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Transformer #Architecture #Selected Papers/Blogs #reading #Sparse #ResidualStream #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- xHC(Expanded Hyper-Connections)は、トランスフォーマーの残差ストリームをN=4を超えて拡張し、メモリのスケーリングを実現する新手法である。これにより、書き戻し情報の質を向上させ、N=16のストリームから4つのみを更新する疎なアーキテクチャを採用。実験により、xHCは18B MoEモデルでmHCよりも4.0ポイントの性能向上を示し、学習コストの増加を抑制する。加えて、xHC-Flashを導入することでメモリトラフィックを削減し、スケーリング法則においても従来手法に比べて効率的であることを実証。これにより、LLMの大規模トレーニングにおける残差ストリーム展開が実用的に改善される。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12

残渣ストリームの本数を増やし、Routerを導入しそのうちのtop-kを活性化させるようなsparseな残渣ストリームの提案のようだが、他にも工夫がありそう。mHCと比較してlossが大きく改善しているように見えるので気になる。




Paper/Blog Link My Issue
#Transformer #LatentReasoning #reading #One-Line Notes #RecurrentModels #RecursiveModels #Scalability #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- ループ型トランスフォーマーを用いたLOTUSは、明示的連鎖思考(CoT)の効率を改善し、1Bパラメータを超える規模でのギャップを埋める初の手法。K個の潜在ブロックをR回反復処理することで、思考フェーズのレイテンシを大幅に削減し、解釈可能な潜在空間を提供。アブレーション実験で、ループバックボーンと並列監督の重要性が確認された。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

Latent Reasoningのためにlooped transformerを導入し、loopによって各step単位のCoTが生成可能なようにCrossEntropy lossを適用して、適切なloopに対するReasoningの挙動を調整する。これにより、モデルスケールが大きくなった場合に性能が低下する課題を緩和し、副次的な効果としてLatent Reasoningの内容がデコード可能になった、という話に見える。

image




Paper/Blog Link My Issue
#Pretraining #LanguageModel #DataRepetition Issue Date: 2026-07-12 GPT Summary- 大型言語モデルのトレーニングパラダイムは、データの再利用においてマルチエポック訓練が推奨される一方、過学習のリスクが伴う。新たな「Memorization Window」信号を基に「Memorization-guided Data Reuse」を提案し、データ再利用の最適なタイミングと方法を決定。予備実験では、従来の4エポック制限を超えることで性能が向上することを示し、memorization-awareなトレーニングスケジュールの基盤を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #LanguageModel #MultiModal #SpeechProcessing #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #AudioLanguageModel Issue Date: 2026-07-12 GPT Summary- Gemma 4は新世代のオープンウェイトマルチモーダル言語モデルで、計算効率と推論能力の向上を目指します。DenseとMixture-of-Expertsアーキテクチャを採用し、パラメータ数は23億〜310億で、視覚および音声エンコーダを強化しました。特に12Bモデルにはエンコーダを用いない統一アーキテクチャが導入され、生の音声と画像パッチを扱います。推論の痕跡を生成する機能を統合し、推論速度やメモリ効率を改善。Gemma 4は、STEMやマルチモーダルタスクで飛躍的な性能を達成し、最前線のオープンモデルに匹敵します。 Comment

元ポスト:

Loading…

Gemma 4:
- Gemma 4: Byte for byte, the most capable open models, Google, 2026.04

ポイント解説:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Education #ACL #Findings #AI Detector #Interpretability Issue Date: 2026-07-12 GPT Summary- LLM生成テキストの検出は、決定の解釈可能性を重要視し、利用者が予測の正確さを評価できるようにする必要がある。従来の手法は人間の判断プロセスに沿った証拠を提供できておらず、このギャップを解消するためにExaGPTを提案。ExaGPTは、人間作成とLLM生成テキストの類似スパンを比較することで識別し、具体的な証拠を示すことで決定の正しさを向上させる。広範な実験により、ExaGPTは従来手法より精度を最大37.0ポイント向上させることが確認された。 Comment

元ポスト:

Loading…

人間が作成したテキストとLLMが生成したテキストのスパンごとの類似性を見ることで、与えられたテキストがLLM生成か否かを判定する。データストア中の類似したスパンが判断のevidenceとなる、という話に見える。

image

こういった話は教育の文脈でも需要がある




Paper/Blog Link My Issue
#Survey #Pretraining #LanguageModel #Evaluation #Optimizer #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-07-12 GPT Summary- 最適化手法の選択は計算量やメモリに制約されるが、その全体像は断片的である。そこで、統合サーベイ「OmniOpt」を提案。これには、五段階メタパイプラインの構造的変換、ノルム制約付きLMOによる手法統一、二次元分類法を用いた手法の機構と訓練目標の整理、最適化手法を系統的に分析するクロスドメインベンチマークが含まれる。これにより、最適化手法選択のための実用的な座標系を提供し、今後の研究の方向性を示す。 Comment

元ポスト:

Loading…

optimizerの詳細なサーベイと様々なベンチマーキングの結果が記載されている模様

全部読んだらめちゃめちゃ勉強になりそう




Paper/Blog Link My Issue
#Analysis #LanguageModel #AIAgents #ScientificDiscovery Issue Date: 2026-07-12 GPT Summary- 近年、LLMsは研究アイデアのブレインストーミングに利用されるが、既存の評価は新規性や実現可能性に依存している。本研究では、LLM生成アイデアと人間研究者のアイデアの乖離を評価するフレームワークを構築し、高品質な論文からインスピレーションを抽出。アイデアを機会パターンと研究パラダイムでプロファイリングし、定量化した結果、LLMのアイデアは特定の手法に偏りがあり、人間の研究プロセスの幅広い側面を捉えていないことが明らかになった。これにより、LLMsは合理的なアイデアを生み出せるが、その範囲は人間より狭いことが示唆された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Attention #Architecture #One-Line Notes #SparseAttention Issue Date: 2026-07-11 GPT Summary- 階層的ランドマークスパース(HiLS)アテンションを提案し、チャンク単位でのスパースアテンションをエンドツーエンドで学習。各クエリが独立してチャンクとアテンションを行い、検索スコアを用いて結合。実験結果では、HiLSが全アテンションに匹敵するかそれ以上の性能を示し、長文脈での外挿が可能。軽量な事前学習を通じて全アテンションモデルをHiLSに適応させ、効率と効果のトレードオフを克服。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

Block Sparse Attention (BSA) は、直近のトークンを見るlocal sliding window attention (SWA)と、離れたトークンに対するチャンクレベルでのsparse attentionに基づいたアテンション機構である。
一般的なBSAでは、現在のquery qとチャンク単位のattentino scoreを計算する際に、各チャンクごとにチャンクのkeyに関する情報を要約した Key k'_c を求め、k'_c と現在のquery qとのattention scoreを計算することにより計算を効率化する[^1]。

k'_c を求める際には、mean/max pooling を用いるのが一般的であり、特に前者が用いられるとのことだが、どちらのpoolingの手法もattention scoreの分布に依存して、近似の性能が変化する(たとえば、mean poolingであればなるべくattention scoreが一様なほど近似性能が良いし、max poolingであれば、あるscoreがチャンク内で支配的であるほど近似性能が良い)が、query qに応じてattention scoreの分布は変化することにより、k'_cの近似性能が低下しsparse attentionによって重要なチャンクを選択する性能が低下する課題がある。

これに対して、
- 現実的な計算量でk'_cをより正確に近似できる surrogate score に基づく手法を提案し(RQ1)[^2]
- surrogate score をend-to-end で学習可能にする方法を提案した (RQ2)
という話である。

surrogate scoreは、チャンクのattention scoreの質量をより正確に近似したスコアであり、(チャンクのkeyを要約した)k'_c に対する現在のクエリ q とのrelevanceを表す項と、バイアス項 b'_c によって線形化される(式7)。
k'_c によって現在のクエリに対する関連度を測り、バイアス項によって関連度から独立したtoken-levelの質量を導入する。バイアス項は、チャンクにattendするであろうクエリのattention scoreの分布に対するentropyであり、これが一様分布やあるトークンが支配的な分布など、様々な分布の形状に対して動的に適応する役割を果たす。

b'_c を求めるために、チャンクごとに独立したクエリ q'_c を学習する。これは、このチャンクにattendするであろうクエリのプロキシを果たすクエリであり、q'_c とチャンク内のトークンのkeyとの間でのattention scoreを計算しておくことで、おおまかなattention scoreの分布を決定し、b'_c を求めておくことができる(式8)。
また、k'_c はチャンク内のattention scoreによって重みづけられたkeyの和の形で求められる(式8)。
これにより、現在のクエリ qが与えられた時に、k'_cとb'_cを用いて、チャンクに対するattention scoreの質量を高速に近似することができる(式7)。

ここで q'_c をどのように学習するかが課題となる(q'_c以外のパラメータは従来通りのモデル化で求まる)。これを解決するために、surrogate scoreによって求まるチャンクのattention scoreの近似質量 \hat{Z}_{i, c} をforward passに加え、q'_c に勾配が流れるようにすることで解決している。具体的には、attention scoreの計算をする際に、式変形を実施し、`チャンク内のスコアの計算 * チャンク間のスコアの計算` の形に分解する(式10)。後者のチャンクの重要度を求める際に、各チャンクのsurrogate scoreを用いて近似することによって、高速化 + q'_c に勾配が流れるような工夫をしている。

[^1]: チャンクのattention scoreの質量(どのチャンクをsparse attentionでattendするかを決定する際に用いられる)を計算する際に、query qとチャンク内の全てのtokenに対するtoken-to-tokenの内積をとることを避け、k'_cとの内積によって近似的に質量を求めることで計算を効率化する。
[^2]: surrogate scoreによってk'_cを正確に近似できることの証明はAppendix Bに記載されており、1次のテイラー展開に基づいているようである(ここは読めていない)。




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Asynchronous Issue Date: 2026-07-09 GPT Summary- 強化学習におけるLLMsの非同期性を改善するため、Single-rollout Asynchronous Optimization (SAO)を提案。グループ単位サンプリングを廃止し、安定した訓練を1,000ステップ行える。SAOは、GRPOやその派生手法に対し、複数のエージェント型ベンチマークで優れたパフォーマンスを示し、進化する環境への適応性も強化。 Comment

元ポスト:

Loading…

GLM 5.2で利用されているRL手法

所見:

Loading…


VAPO:
- [Paper Note] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks, Yu Yue+, arXiv'25, 2025.04

alphaXivによるポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の適応がトランスフォーマー層にどう分布しているかに焦点を当てる研究。単一のトランスフォーマー層を訓練することで、全パラメータRLトレーニングの利得の大半を回復可能。この現象を層寄与量で定量化し、複数のモデルとRLアルゴリズムで安定したパターンを観察。高寄与層は中間部に集中し、入力・出力端の寄与は少ないことを示唆。層の rankings は各種条件下でも強い相関を持つ。 Comment

元ポスト:

Loading…

実験は8Bスケールのモデルまでしかできていないが、もしこれが数百B級のモデルにも当てはまるのだとすると、非常に計算コストの低減だけでなく、weightのsyncにおいて非常に有利になると思われるので、インパクトが大きそうな話になる可能性を感じる。

RLの効率化という観点で言うと

- [Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06

のような話もある。




Paper/Blog Link My Issue
#LanguageModel #Evaluation #ICML #reading #Rubric-based #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- インラインコメントを活用して、再利用可能な自然言語ルーブリックを学習する手法を提案。コメントの不一致を観察しながらルーブリックを改良し、現実のレビュー設定で評価。これにより、成果物の改訂やルーブリック理解が促進されることを示した。 Comment

元ポスト:

Loading…

文書の中に断片化されているインラインコメント等を暗黙的な評価基準に基づいて生成された観測データと捉え、インラインコメントから明文化されていない評価基準を学習し、ルーブリックとして活用可能にする、という話に見える。

「暗黙知、ケースバイケースなのでなかなか明文化できません」という状況によく遭遇し困るので、そもそもこういった手法が利用できるように日々の判断をLLMが利用可能な形に残しておくことが重要と感じる




Paper/Blog Link My Issue
#LanguageModel #Coding #PEFT(Adaptor/LoRA) #SoftwareEngineering Issue Date: 2026-07-08 GPT Summary- ファジー関数プログラミングを用いて、自然言語仕様からコンパクトなニューラル・アーティファクトを生成するアプローチを提案。Program-as-Weights(PAW)で具現化し、4BパラメータのコンパイラがFuzzyBenchで訓練されたアダプターを出力。0.6Bパラメータのインタプリタは、Qwen3-32Bと同様の性能を保ちながらメモリ使用量を1/50に削減し、効率的に問題解決に貢献。関数定義を再利用可能なアーティファクトとして実行。 Comment

元ポスト:

Loading…

関連:
- PAW: Define functions in English. Run them locally, ProgramAsWeights, 2026.04




Paper/Blog Link My Issue
#Analysis #LanguageModel #Distillation #Catastrophic Forgetting #PostTraining #On-Policy #Generalization #ContinualLearning #SelfDistillation Issue Date: 2026-07-08 GPT Summary- 継続的ポストトレーニングにおいて、自己蒸留方針最適化(SDPO)がドメイン内専門化を加速する一方で、分布外一般化に苦戦し、忘却が顕著になることを実験により示した。また、GRPOのようなオンポリシー手法は、以前の能力をより良く保持する傾向があることも明らかになった。密な自己蒸留は専門化を促進するが、継続的トレーニングの安定化には適していない。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Reasoning #ACL #InstructionFollowingCapability #Findings #One-Line Notes Issue Date: 2026-07-08 GPT Summary- 大規模言語モデル(LLMs)がユーザーの指示を推論過程全体で遵守する重要性を強調し、ReasonIFというベンチマークを導入。これは、推論指示の遵守を評価し、さまざまな指示プロンプトを網羅している。多くのオープンソースLRMsにおいて、指示遵守のスコアは0.25未満であり、難易度の上昇に伴い低下する傾向がある。推論指示の忠実度向上には、マルチターン推論と合成データを用いたファインチューニングが有効で、RIFによって大きな改善が見込まれるが、さらなる向上が必要。 Comment

blog: https://together.ai/blog/large-reasoning-models-fail-to-follow-instructions-during-reasoning-a-benchmark-study

著者ポスト:

Loading…

著者ポスト2:

Loading…

reasoning traceに対して制約を課す[^1]指示は、メインの応答と比較して指示追従性能が低い傾向にある
image

[^1]: 思考する言語の指定、思考の長さの制限、免責事項(指示でreasoningの最後にwarningや備考を追記する)、reasoningをjsonにする、大文字のみを利用する、commaをreasoning中に除外する、など




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #DiffusionModel #Architecture #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- 拡散言語モデルは、自己回帰モデルの代替手段として注目されていますが、既存アプローチは文脈表現とデノイズを同一ネットワークで処理するため能力が制限されていました。本研究では、役割を2つのタワーに分離したブロック単位の自己回帰拡散モデル「TwoTower」を提案。凍結されたAR文脈タワーがクリーンなトークンを処理し、拡散デノイザータワーが双方向アテンションを用いてノイズを洗練します。訓練されたモデルは、生成スループットを2.42倍改善しつつ、自己回帰ベースラインの品質の98.7%を保持します。コードとモデルは公開されています。 Comment

HF: https://huggingface.co/nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16

元ポスト:

Loading…

拡散言語モデルにおけるTwo Towerアーキテクチャの提案で、一方がコンテキストを読み込み(ARモデルでfreezeされている)、もう一方がデコードを担う(diffusionモデルでlearnable)。どちらのタワーも事前学習済みのモデルを利用する。
オリジナルモデルの性能の98.7%を維持しつつ、2.42倍のスループットを実現可能とのこと。
image




Paper/Blog Link My Issue
#LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Initial Impression Notes #Exploration Issue Date: 2026-07-08 GPT Summary- エージェントが対話を通じてユーザーの目標を達成する際、目標が明確でない場合には行動を止めるべきであるとし、「エージェント性棄却」を定義。標準的な棄却と異なり、逐次的な意思決定問題として評価され、エージェントは環境に応じて回答、棄却、情報収集を選択。ウェブショッピングなどの場面で13のLLMを評価し、棄却のタイミングが重要であることを示した。さらに、モデルの規模や支援枠組みが棄却に影響を及ぼすことが判明。CONVOLVEという手法を導入し、対話の軌跡を利用して棄却を改善、Llama-3.3-70Bモデルでは適時リコール率を大幅に向上させた。データセットとコードは公開中。 Comment

元ポスト:

Loading…

エージェントが環境とインタラクションした後にタスクが実現不能な場合はタスクを棄却すべきという話
image




Paper/Blog Link My Issue
#LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #Verification Issue Date: 2026-07-07 GPT Summary- Dockerlessは、環境を必要とせずにコードパッチの正確性を評価するエージェント的パッチ検証器を提案する。従来の環境構築コストを削減し、リポジトリ探索を通じて証拠に基づく評価を実現。これにより、最も強力なオープンソース検証器を14.3 AUCポイント上回り、SWE-bench Verified、Multilingual、Proでそれぞれ62.0%、50.0%、35.2%の解決率を達成。環境ベースのポストトレーニングと同等の性能を示す。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Qwen-AgentWorld: Language World Models for General Agents, Yuxin Zuo+, arXiv'26, 2026.06




Paper/Blog Link My Issue
#Analysis #LanguageModel #Alignment #ReinforcementLearning #Safety #PostTraining #Selected Papers/Blogs #Generalization #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 GPT Summary- RLを用いて多様なドメインで有益な行動を促進し、整合性の一般化を調査。データセットを構築し、50以上の独立したベンチマークで評価した結果、80%超で性能向上が見られる。特に健康ドメインでの介入が他の評価にも効果的で、整合性の維持向上を示した。この研究は、RLを通じて人間の福祉への整合性を強化する可能性を示唆する。 Comment

blog: https://alignment.openai.com/beneficial-rl/

元ポスト:

Loading…

所見:

Loading…

特定のドメインにおいて有益な特性を備えた少量データ(trustfulness, 不確実性の下での謙虚さ等を備えた対話)でRLされたモデルは、訓練に使用したドメインを超えて一般化し、アライメントを改善する。敵対的なプロンプトが与えられた場合でも、Alignmentが持続する能力が高まる。

以下でも良性のペルソナで学習をすることでAlignmentが改善しており、似た知見が得られている:
- Teaching Claude why, Anthropic, 2026.05




Paper/Blog Link My Issue
#ComputerVision #Analysis #MultiModal #In-ContextLearning #ACL #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-07 GPT Summary- マルチモーダル設定における文脈内学習(ICL)の分析を行い、テキストのみのICLと比べて性能のギャップを明らかに。ゼロショット設定では同等だが、少数ショットでは大幅に劣化することを示す。視覚表現とテキスト表現の間で整合性が欠け、タスクマッピングの転送が不十分であることが判明。推論段階の改善手法を提案し、マルチモーダルICLの機構と限界に新たな知見を提供。 Comment

元ポスト:

Loading…

マルチモーダルモデルを用いてfew-shot demonstrationを与えてICLを実施する場合、text-onlyモデルの場合と比較して性能が劣化することが多いのはなぜか?という疑問を追求した研究で、text-onlyの場合と比較して、マルチモーダルの場合は
- デモンストレーションからタスクルールを推論し
- 推論されたルールをクエリに適用する

という2段階のプロセスが必要で、前者はモデルが中間層まででうまく処理できるが、後者に関して中間層からより深いlayerに伝搬させることに失敗する(クエリ側の手がかりによって推論されてしまう)、ということのようである。

image




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #PostTraining #Diversity #On-Policy #Initial Impression Notes Issue Date: 2026-07-05 GPT Summary- オンポリシー自己蒸留は、単一モデルを教師と生徒として利用し、高いpass@1精度を実現するが、サンプリングされたデモンストレーションに依存することでロールアウトの多様性が低下する。教師がバイアスを通じてフィードバックを与えるため、最適な自己蒸留方針は基底分布を不均一に傾斜させる。自己蒸留モデルは、制御されたタスクで競争力のある性能を示すものの、機能的多様性が不足し、分布外設定では失敗する。 Comment

元ポスト:

Loading…

OPDでは教師モデルが正しいロールアウトで条件付けされるため、正しいロールアウトに近いロールアウトはより増強され、遠いものは抑制されることにつながり、結果的に出力の多様性が減少しPass@kが伸びにくくなる、という副作用があるよ、という話のようである。

image




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #PostTraining #Initial Impression Notes Issue Date: 2026-07-05 GPT Summary- iLLaDAは、80億パラメータの双方向注意を持つマスク付き拡散言語モデルであり、ゼロから訓練された。事前学習には12兆トークンを使用し、教師ありファインチューニングを通じて大規模なコーパスで性能を向上させた。生成効率を高めるために可変長生成と信頼度に基づくスコアリングを導入。iLLaDAは、一般・数学・コードのベンチマークでLLaDAと比較し広範な改善を示し、特にBBHやARC-Challenge、MATH、HumanEvalで顕著なポイント向上を達成。非自己回帰訓練にもかかわらず、競争力を維持していることが示され、双方向拡散訓練が強力な言語モデル開発に寄与する可能性を示唆している。 Comment

元ポスト:

Loading…

bi-directional attentionを用いてゼロから訓練されたたdLLM




Paper/Blog Link My Issue
#Embeddings #LanguageModel #memory #LatentRepresentation Issue Date: 2026-07-05 GPT Summary- EvoEmbeddingは、文脈や時間的順序を考慮した動的な埋め込みモデルであり、逐次処理により潜在メモリを更新し、進化する状況に基づいて検索対象を最適化する。EvoTrain-180Kデータセットを用いて、潜在メモリと検索を共同最適化し、長文脈検索において他の大規模モデルを凌駕する性能を発揮することを実証。さらに、エージェント型ワークフローにも統合可能で、性能向上を実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #LanguageModel #AIAgents #Initial Impression Notes #Author Thread-Post #Coordination Issue Date: 2026-07-04 GPT Summary- 多エージェント協調のための微分可能な最適化フレームワークを提示。重なる局所ビューを解決するエージェントは、ADMMを用いて協調し、グローバル合意を形成。マルチエージェントシステムは共同訓練され、局所ビュー不足でも正しい出力を生成。MNISTでは頑健性を向上、数独では高い解決率を達成。ADMM構造により協調ダイナミクスを直接分析可能。 Comment

元ポスト:

Loading…

blog: https://pub.sakana.ai/sheaf-admm/

微分可能なフレームワークによって、エージェント同士が協調することを学習する




Paper/Blog Link My Issue
#Analysis #SpeechProcessing #AudioLanguageModel Issue Date: 2026-07-04 GPT Summary- 音声言語モデル(SLMs)は、音声とテキストの交互配置を活用して訓練され、両モダリティの相互作用を探求。モデルは発話された語を中間層でデコード可能にするが、音声認識の訓練は受けていない。データの77%で転写がトップ候補に、次にテキスト空間で語を予測。交互配置データとテキストLMからの初期化がこの挙動に与える影響を分析し、音声とテキストの関係を支えるメカニズムを明らかにする。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Evaluation #EfficientEvaluation #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- 84のフロンティアモデルを133のベンチマークで評価し、スコア行列を作成した結果、モデルのスコアは主に2つの因子に依存することが明らかになった。これに基づき、行列補完法「BenchPress」を設計し、隠れたスコアを高精度で回復。特定のベンチマークのサブセットでは、モデルの未公開スコアを3.93ポイント以内に予測可能であり、より安価な評価セットでも高い精度を示した。スコア行列、BenchPressのコード、および対話型ツールを公開。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

pj page: https://microsoft.github.io/benchpress/




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #MultiModal #SpeechProcessing #LLMServing #Architecture #UMM #Omni #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- 複合モデルアーキテクチャの新時代に向け、M*を提案。M*はモデルをデータフローグラフとして表現し、モジュラーな抽象化を通じて多様なタスクを効率的に処理。具体化によって、テキスト-画像及びテキスト-音声ワークロードでの遅延を平均20%削減し、スループットを最大2.7倍向上。ロボティックプランニングでも基準を12.5倍上回る。この研究は、複雑なモデルの効率的な提供を可能にする。 Comment

元ポスト:

Loading…

以下、元ポストの要約

vLLMやSGLangのようなメジャーなLLM Servingフレームワークは単一の自己回帰的な生成のループを前提としており、テキスト以外のモダリティを扱う場合は異なる推論パスを辿るため、根本的に統一的に扱える抽象化となっていない(Figure 1)。

そこで、マルチモーダルなモデルを統一的に扱えるための抽象化M*を提案:
- モデルのコンポーネントをノードとして宣言し、名前付きのWalkを定義する(1つのフェーズ(prefill_text, decode, image_gen等)を構成するサブグラフ)を定義する。
- リクエストはWalkの系列として定義され、Sequential, Parallel, Loopの3種類で実行形式を定義する。
image

ランタイムはリクエストに応じたコンポーネントのみを実行する。各コンポーネントはグラフのノードとして定義されるため、配置の変更はコードの変更ではなく、設定の変更で完結する。また、YAMLファイルによって、各コンポーネント、Walkの粒度でGPUの割り当てを制御できるため、個々のコンポーネントやWalk単位でリソースの効率を最大化することで、予測性能を落とすことなく、システム全体のスループットが向上する。

image

また、Figure1のOmniモデル、UMMそれぞれのモダリティごとの推論パスの違いが秀逸で、非常に分かりやすい。




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #LongContext #OpenWeight #VisionLanguageModel #OCR Issue Date: 2026-07-03 GPT Summary- Unlimited OCRは、DeepSeek OCRに基づき、長期的なメモリ効率を改善するために設計されたモデルである。大規模言語モデル(LLM)を用いることでOCR性能向上が期待されるが、出力系列が長くなるとメモリ消費が増大し、生成速度が低下する問題がある。本研究では、Reference Sliding Window Attention(R-SWA)をアテンション層に導入し、KVキャッシュを一定に保ちながら計算コストを削減。これにより、最大32Kの長さのもとで、数十ページの文書を効率的に処理できる。また、R-SWAはASRや翻訳など他のタスクにも応用可能である。コードとモデル重みは公開されている。 Comment

HF: https://huggingface.co/baidu/Unlimited-OCR

元ポスト:

Loading…

2週間で1Mダウンロード:

Loading…




Paper/Blog Link My Issue
#Survey #ComputerVision #Robotics #WorldActionModel Issue Date: 2026-07-03 GPT Summary- World Action Models(WAMs)は、未来予測と行動実行を統合した身体化されたモデルであり、最近では大規模な動画生成モデルを再利用する研究が進展している。現在のWAMsは、通常の動画生成モデルやVision-Languageのバックボーンに依存し、これにより関連領域の境界が曖昧になっている。本調査では、これらの境界を明確化し、手法を生成物の観点と予測基盤、バックボーン、アクション結合の観点から整理。WAMsは単なる動画生成モデルとは異なり、表現力とリソース間のトレードオフを重視した予測-行動手法として進化している。この分野は未来生成を抑えつつ、制御要件を満たす方法を模索している。

Paper/Blog Link My Issue
#Pretraining #LanguageModel #Architecture #reading #One-Line Notes Issue Date: 2026-07-03 GPT Summary- 深層言語モデルは、均一な層構成が与えられているが、層によって非均一に出力に寄与することが示唆されている。そこで、初期層に多くのパラメータを割り当てる「テーパード言語モデル(TLMs)」を提案。実験結果から、テーパリングすることでパープレキシティと性能が向上し、追加コストなしで効果的な設計原理となることを示した。 Comment

元ポスト:

Loading…

MLP Layerのパラメータ数を均一にするのではなく、浅い層でより多くのパラメータを割り当てることで性能が改善するという話のようである。このような現象が生じる説明として、残差ストリームに対してMLPを通る前後のコサイン類似度式(9)、ブロック全体を通過した後の残差ストリームの差分(つまりどれだけ残差ストリームが変化したか)とブロックに入力された残差ストリームの間のコサイン類似度(式9)を観察し、層が深くなればなるほど類似度が高くなり(つまりコサイン類似度なので方向が近い)深い層になればなるほど新規の情報が少なく、情報の微調整や洗練化が行われているため、という説明が行われているようである(Figure 4)。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #ReinforcementLearning #Decoding #PostTraining #SpeculativeDecoding Issue Date: 2026-07-03 GPT Summary- MTPを用いることで強化学習におけるロールアウトを加速するBebopを提案。MTPの受け入れ率はモデルエントロピーに影響され、確率的拒否サンプリングがその攪乱を軽減。新しいTV損失を導入し、受け入れ率の改善を実現。エンドツーエンドでのMTPトレーニングにより一貫した速度向上を達成し、最大1.8倍の加速を示す実験結果を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Attention #Architecture #Hybrid #Initial Impression Notes #LinearAttention Issue Date: 2026-07-03 GPT Summary- HydraHeadは、解釈可能性に基づいた新しいハイブリッドアテンションアーキテクチャで、ヘッド単位でLinear Attention (LA) とFull Attention (FA) を統合。重要なヘッドの選択とスケール正規化融合モジュールを用いて高性能を維持しつつ、長文脈タスクで他モデルを超える。150億トークンの訓練で、512Kの文脈長においてベースラインを69%以上改善し、ヘッドレベルのハイブリッド化の可能性を示す。 Comment

元ポスト:

Loading…

full attentionとlinear attentionをハイブリッドするアーキテクチャの提案




Paper/Blog Link My Issue
#Multi #LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-07-03 GPT Summary- SAGE-OPDは多ターンのオンポリシー蒸留を改善する新しいフレームワークで、学生モデルへの介入を環境からのフィードバックに基づいて決定。標準OPDの脆弱性を克服するため、教師の信頼度でトークンレベルの蒸留を重み付けし、不確実な教師分布の影響を軽減。実験では、ALFWorldにおける成功率を標準OPDと比較して13.3%改善し、ターンレベルの介入が効果的であることを示した。 Comment

元ポスト:

Loading…

現在のOPDは基本的にsingle-turnを前提としているが、multi-turnの場合の手法を提案。各stepごとのconfidenceを教師モデルによって推定し、OPD lossに反映させる。これは生徒モデルの軌跡が教師から逸脱した場合に、その軌跡に対して介入をするような挙動となる。multi-turnにおいて全てのターンに介入するのは無駄で、かつ介入しないとmulti-turnの場合エラーが蓄積するため、選択的に介入する軌跡を決定する手法と言える、という感じに見える。

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Optimizer #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- Muonの更新における行ノルムの不均一性が、自己強化的なフィードバックループを引き起こす問題を提起。本研究では、行正規化を活用しながらMuonの幾何を尊重する最適化手法Auroraを提案。Auroraは事前学習での性能向上を示し、modded-nanoGPTでのスペクトル最適化において最先端の結果を達成。さらに、Auroraの利得はMLP拡張係数に比例し、幅広いMLP層の効果的訓練を可能にすることが示唆されている。 Comment

元ポスト:

Loading…

transformer decoder-onlyモデルにおけるMLPのdead neuronを防止するような更新をかけるoptimiserで、Muonよりも高い下流タスク性能を達成したとのこと。

関連:
- Aurora: A Leverage-Aware Optimizer for Rectangular Matrices, Tilde Research, 2026.05




Paper/Blog Link My Issue
#Embeddings #Analysis #ACL #Encoder #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 平均プーリングはトークン埋め込みの標準的な構築法だが、空間的構造を捉えられず、異なる埋め込みを類似にする可能性がある。本研究はこの崩壊を定量化する指標を提案し、実際のモデルでの頻度を測定した結果、特に対照学習で微調整されたエンコーダが頑健であることを示した。また、頑健性はトークン埋め込みの集中度に依存し、指標との相関が下流タスクの性能に影響を与えることが明らかになった。現代のテキストエンコーダが平均プーリングに依存しながらも有効である理由に光を当てる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Embeddings #LanguageModel #read-later Issue Date: 2026-07-02 GPT Summary- 埋め込みスケーリングを通じてMoEアーキテクチャのスパース性を向上させる研究。特定のレジームにおいて埋め込みスケーリングが優位性を示し、重要なアーキテクチャ因子を体系的に分析。最適化されたシステムと推論スピード向上を組み合わせ、LongCat-Flash-Liteを導入。これは68.5Bパラメータのモデルで、MoEベースラインを上回り、エージェント性やコーディング能力で競争力を発揮。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Evaluation #Coding #SoftwareEngineering #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 実際のコーディング支援の対話的性質を反映した新しいベンチマークSWE-Togetherを導入。11,260件の記録セッションから109件のタスクを選び、リアクティブなLLMベースのユーザーシミュレーターを構築。エージェントの評価はリポジトリの正確さとフィードバックの回数で行われ、強力なエージェントほど成功率が高く、介入が少なくて済むことを示した。 Comment

pj page: https://togetherbench.com/

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #LanguageModel #ReinforcementLearning #Distillation #PostTraining #read-later #On-Policy #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 複数の能力を統合することが困難な大規模言語モデル(LLM)のために、ポストトレーニングの新しいアプローチとしてMulti-teacher On-Policy Distillation(MOPD)を提案。ドメインごとのRL教師を用いて曝露バイアスを排除し、密な最適化信号を提供。実験によりMOPDが他の手法を上回り、教師の能力を効率的に継承することを示した。MOPDは、独立したドメイン教師の開発を可能にし、実用的な能力統合を実現。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#ComputerVision #ACL #VisionLanguageModel #Findings #Initial Impression Notes #SelfVerification Issue Date: 2026-07-01 GPT Summary- 視覚言語モデル(LVLM)の幻覚問題を解決するために、視覚認識に基づく不確実性定量化フレームワークVAUQを提案。これにより、モデル出力の視覚的証拠への依存度を測定し、Image-Information Score(IS)を導入。トレーニング不要のスコアリング関数を用いて正確さを反映。実験により、VAUQは既存の自己評価手法を上回る性能を示した。 Comment

画像に関するタスクをVLMが処理する際に、応答のconfidenceがlanguage priorではなく、画像に基づくevidenceに基づいているかをconfidenceに反映させる




Paper/Blog Link My Issue
#LanguageModel #SpeechProcessing #OpenWeight #Japanese #TTS Issue Date: 2026-06-29 GPT Summary- 日本語中心のLLM-TTSシステムSarashina2.2-TTSを紹介。約361,000時間の音声データを使用し、日本語の漢字の多義性に対応するデータ拡張パイプラインを設計。Joyo Kanji Yomi Benchmarkを用いて、漢字の読み方の正確さを測定。実験によりデータ拡張が効果を示し、漢字レベルの精度で最先端の性能を達成。クロスリンガル評価では日本語発音の安定性も確認され、訓練アプローチが効果的であることが示された。 Comment

元ポスト:

Loading…

HF: https://huggingface.co/sbintuitions/sarashina2.2-tts




Paper/Blog Link My Issue
#ReinforcementLearning #TextToImageGeneration #Distillation #PostTraining #On-Policy #VisionLanguageModel #RewardModel #Editing #ImageSynthesis #Initial Impression Notes Issue Date: 2026-06-29 GPT Summary- Qwen-Image-2.0-RLは、RLHFとオンポリシー蒸留を用いてQwen-Image-2.0の視覚品質と指示遵守を向上させるパイプライン。信頼性の高い報酬モデルを構築し、画像生成と編集タスクで重要な次元をカバー。最終段階でオンポリシー蒸留を提案し、複数の教師から単一モデルへの統合を実現。評価では、Qwen-Image-Benchで総合スコア57.84、テキスト対画像Eloが1193、画像編集Eloが1349を達成し、全体的に性能向上を示す。 Comment

元ポスト:

Loading…

T2I, Editに特化したTeacherモデルを学習しOPDする




Paper/Blog Link My Issue
#LanguageModel #Selected Papers/Blogs #SpeculativeDecoding #reading #One-Line Notes Issue Date: 2026-06-27 GPT Summary- DSparkは、LLMの推論を加速するために、ドラフト生成とターゲット検証を分離した推測的デコーディングフレームワークです。半自己回帰型アーキテクチャを用いることでトークン間の依存性をモデル化し、並列生成の品質を向上させます。信頼度に基づく検証を採用し、検証長を動的に調整することでシステム効率を最適化します。オフラインベンチマークやライブユーザトラフィック下での実験において、DSparkは採択長と生成速度を顕著に改善し、従来のシステムのスループットを向上させました。 Comment

元ポスト:

Loading…

DeepSeekによる新たなSpeculative Decoding手法とのこと

解説:

Loading…

所見:

Loading…

ポイント解説:

Loading…

関連:
- [Paper Note] DFlash: Block Diffusion for Flash Speculative Decoding, Jian Chen+, arXiv'26, 2026.02

Speculative Decodingのためのドラフトモデルに関する新たなアーキテクチャを提案しており、

DFlashのように並列してトークンを生成する機構を持つ。各トークンは独立して生成されるため、文脈が反映されない。そこで、より文脈に対して自然なトークン系列となるよう、軽量でsequentialなheadによってキャリブレーションする。各トークンにはconfidenceが付与されており、target modelがverifyをするに値しないトークンは事前に除外することでスループットを高める。

という手法に見える。

image

Ling 3.0 Flash, LFM2.5などが、DSparkによるドラフトモデルを公開しており、本手法の注目度の高さが伺える。




Paper/Blog Link My Issue
#Multi #LanguageModel #AIAgents #reading #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-06-27 GPT Summary- LLMの特化を統合するために、オーケストレーター型モデルSakana Fuguを開発。Fuguはユーザーのクエリを理解し、動的にエージェントフレームワークを設計。これにより、様々な難解なタスクで最先端の性能を達成。日常利用と高難度応答のバランスを取るFuguと、回答品質を優先するFugu-Ultraを公開。トレーニング方法には大規模ファインチューニングや強化学習を含む。研究がマルチエージェントシステムの発展に寄与することを目指す。 Comment

元ポスト:

Loading…

基盤となる技術:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
- [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12

[Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01 と [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12 によってFuguが学習され、さらに [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12 によってFugu Ultraが学習される、という構図に見える。

これはただの感想だが

- nature inspiredなAIを実現するというビジョンのもと
- 世界にインパクトを与えられるようなプロダクトを設計し
- プロダクトから逆算して技術的に必要な課題を列挙し、
- 個々の課題についてトップカンファレンスに通すレベルの水準まで、ストーリーと研究を追求した上で実際にカンファレンスに通し
- 最終的にそれらをつなぐことによってプロダクトを構成する

という、プロダクトと研究が一体となる戦略をとっているように感じた。

プロダクトと研究が分離していると、まずプロダクトがあって、そのプロダクトを運用している中で課題が見つかり、それを解決するための仕事をしていたらそこから研究にできそうな芽が出てきて、出てきた芽をうまく切り出して結果的に研究として出版される、という流れになる気がするのだが、これとは根本的に戦略が異なるように感じる。




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Health #Medical Issue Date: 2026-06-27 GPT Summary- HealthBench Professionalというオープンなベンチマークを通じて、ChatGPTが臨床医の業務支援においてどのように利用されるかを評価。ケア相談、執筆、医療研究の三つの利用ケースに基づいた医師作成の対話がルーブリックで採点され、OpenAIのモデルの難易度や質を測定。特に、意図的な敵対的検証が含まれた例もあり、最も高いスコアを取得したのはGPT-5.4で、多くのモデルや人間の医師を上回る。これにより、医療AIコミュニティが臨床タスクの進展を追跡し、信頼できるシステムの構築を支援することを目指す。 Comment

関連:
- [Paper Note] HealthBench: Evaluating Large Language Models Towards Improved Human Health, Rahul K. Arora+, arXiv'25, 2025.05




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Security #Environment Issue Date: 2026-06-27 GPT Summary- 悪用は段階的な進展を伴う能力であり、従来のLLMセキュリティベンチマークが二値的結果に依存することに問題がある。本研究では、16の測定可能なフラグによる能力評価型ベンチマークであるExploitBenchを提案し、様々な悪用技術を評価する。V8の41件のバグに適用した結果、公開されているモデルとプライベートモデルとの間に能力の顕著な差を確認。特に、プライベートモデルでは任意コード実行が観測され、堅牢化されたターゲットに対する悪用能力の構築が新たな重要性を持つことを示唆している。 Comment

github: https://github.com/exploitbench/exploitbench




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Planning #Evaluation #LongHorizon #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- 経済システムにおけるLLMエージェントの性能評価が重要になっている中、CoffeeBenchを導入。これは長期的なマルチエージェント経済でLLMを評価するベンチマークで、農家、焙煎業者、小売業者が90日間自律的に運営し、累積純利益を最大化を目指す。多数のモデルが受動的ベースラインを超えて正の純利益を達成し、高性能モデルはより積極的なコミュニケーションを示す一方で、一部モデルは不作為に陥る行動を観察。今後の研究のために、コードとエージェントの軌跡が公開される。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] CEO-Bench: Can Agents Play the Long Game?, Haozhe Chen+, arXiv'26, 2026.06
- [Paper Note] $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution, Muyu He+, arXiv'26, 2026.04




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #SyntheticData #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #Data #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Game Issue Date: 2026-06-22 GPT Summary- ゲーム生成は、自然言語仕様を対話的システムに変換する新しいコーディングエージェントの応用であり、ゲームエンジン内で一貫したプレイ体験を作成する必要があります。本研究では、エンドツーエンドのゲーム生成を、プレイヤーとゲームの相互作用を通じて完全なゲームアーティファクトを作成する問題として定義し、評価基準としてエンジンの基盤付け、アーティファクトの完成度、対話的検証を提案します。GameCraft-Benchという評価フレームワークを構築し、15のゲームファミリーの140のタスクをベンチマークとして使用しました。その結果、最先端のコーディングエージェントは依然として高い難易度を示し、最良のエージェントでも41.46%の得点に留まり、多くのエージェントが40%未満の結果にとどまっています。また、エージェントは機械的には実装可能でも、十分な内容やビジュアルフィードバックを備えた完全なゲームを提供するのに苦労しています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #MachineLearning #LanguageModel #read-later #Selected Papers/Blogs #RecurrentModels Issue Date: 2026-06-22 GPT Summary- 非線形RNNの訓練には、Supervised Memory Training(SMT)を提案。SMTは逐次的なクレジット伝播を避け、1ステップの記憶遷移を監視学習に還元。未来予測に必要な過去の情報のみを保持し、安定した長さO(1)の勾配パスで時間的並列訓練を実現。言語モデリングやピクセル系列モデリングでBPTTを上回る性能を示し、長距離依存性の把握やモデルのスケーリングを促進する可能性がある。 Comment

元ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Attention #LongContext #PositionalEncoding #Initial Impression Notes Issue Date: 2026-06-22 GPT Summary- ハイブリッドアーキテクチャにおける効率的アテンションモジュールの影響を、スケーリング挙動、メカニズム分析、アーキテクチャ設計の観点から体系的に分析。効率的アテンションは長い文脈能力の出現速度に影響するが、最終的には同等の性能へ収束。長距離検索はフルアテンションによるもので、効率的アテンションがその最適化を形作る。“Large-Window Laziness”という現象を説明し、窓が小さいSWAハイブリッドにNoPEを適用することで長い文脈での性能が向上することを示した。 Comment

元ポスト:

Loading…

SWAにNoPEを組み合わせるとlong contextの性能が改善するようである(Table 2)

解説:

Loading…


SWEのwindowサイズを小さくした方が、full attentionが長距離文脈を学習することを促進する。これは、SWEのwindow幅に存在するcontextで様々な依存関係を処理できるため、full attention側で長距離依存を学習する恩恵が低減するから、ということのようである。




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #LanguageModel #Optimizer #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- MDデカップリングを提案し、重み行列の「大きさ」と「方向」を別々に制御することで、訓練ダイナミクスを向上させる。これにより、従来のオプティマイザに依存せず、重み減衰やウォームアップが不要に。また、Adam や Muon において、調整されたベースラインを超える性能を示し、幅広いモデルにおいて一貫した効果を発揮する。 Comment

元ポスト:

Loading…

以下、著者ポストの要約

重み行列にはサイズ(ノルム)と向かう方向(どこをpointするか)があり、同じステップでも重みが小さい時は大きく回転するが、重みが大きいとほとんど回転せず、方向がどれだけ早く変化するかは重みのノルムに依存する。このため、学習中に重みの大きさが調整役になってしまい、学習時の更新幅がLRによって決まるわけではなく、重みの大きさ、weight decayなどの影響によって変化し、学習率が与える影響が間接的なものになってしまう。これを是正するために、NeuralNetworkの重みを固定サイズに保ち(球面上に配置)、方向だけを調整する。

- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01

と非常に似ているように感じる。




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #One-Line Notes #LongHorizon #Environment #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- CEO-Benchは、言語モデルのエージェントが長期的な視野、ノイズの多い環境での情報取得、適応能力、目標統合を評価するためのシミュレーションである。エージェントは500日間のスタートアップ運営を通じて架空の企業管理を行い、ビジネスデータを分析して戦略を構築。多くのモデルが苦戦する中、Claude Opus 4.8とGPT-5.5のみが初期の課題で成功を収めている。CEO-Benchは持続的な進歩を測定する手段を提供する。 Comment

元ポスト:

Loading…

以下著者ポストの要約

エージェントに1Mドルを与えて仮想環境でスタートアップを500日経営させ、最終的なキャッシュを比較することでエージェントのlong horizonな意思決定、データ分析、コーディング能力を測定する。経営はprogrammableなインタフェースによって実現される。モデルによって挙動が異なり、あるモデルは幅広い戦略を探索するが、あるモデルは受動的な意思決定をしてしまいキャッシュを失う。




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #LLM-as-a-Judge #mid-training #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-17 GPT Summary- スパース報酬強化学習(RL)は、LLMの推論を向上させる方法だが、成功は基盤モデルの網羅性に依存する。従来の方法では、中間訓練に選ばれた推論軌跡を用いてスキルを教えるが、手動指定が必要であり、そのカバレッジが難しい問題に対して十分かは不明である。新たなアプローチとして、ExpRLは人間作成の質問応答データを用い、参照解を報酬の基盤として扱う。ポリシーは問題プロンプトから推論をサンプリングし、LLM判定者がバックグラウンド報酬を割り当てることで部分的進捗を強化する。ExpRLは、難解な数学的推論タスクにおいて、他手法よりも優れたRLプリミングを実現し、スパース報酬RLの初期化を改善することが示された。 Comment

元ポスト:

Loading…

post-trainingでGRPOをすると、報酬がsparse(モデルが解けない問題に対してはadvanatageがゼロ)となりシグナルが得られない問題があるが、これをmid trainingの段階で参照データをdense報酬のためのscaffoldingとして活用することで、後続のsparseなRLの性能を改善する。どうやらmid trainingの段階で、参照データを与えた(=scaffolding) verifierを用意し、LLM-as-a-Judgeを通じて密な報酬(すなわち、最終的な応答だけでなく途中のtrajectoryの良し悪しからも報酬を得る)を与え、後続のsparseなRLのためのwarmupをする。warmupにはSFTやself-distillationが用いられることが多く、これら手法は基本的には参照データの模倣学習であるため汎化性能を犠牲(i.e., これはらトークンレベルの学習シグナルであらため、自由な探索が抑制されエントロピーが下がる)にしていたが、提案手法ではDense RewardなRLを用いることで探索が促進され(=高いエントロピーが保たれる)warmupが可能となる、という話に見える。




Paper/Blog Link My Issue
#LanguageModel #OpenWeight #Author Thread-Post Issue Date: 2026-06-17 GPT Summary- 効率的なエージェント型知能を目指し、Ling-2.6 と Ring-2.6 のモデルファミリを提案。Ling-2.6 は即時応答に特化し、Ring-2.6 は高度な推論に対応。Ling-2.0 からのアップグレードは、モデルの統一的共同設計によって実現。ハイブリッド線形アテンション設計で長文脈の効率を向上し、出力トークンの能力を最適化。Ring-2.6-1T には強化学習フレームワーク KPop を導入し、エージェント-環境学習を強化。2.6 ファミリはオープンエージェント型システムへの実践的道筋を提供し、全チェックポイントをオープンソース化。 Comment

- inclusionAI: Ling-2.6-flash (free), OpenRouter (InclusionAI), 2026.04
- Ring-2.6-1T, inclusionAI, 2026.05

元ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Coding #Mathematics #SmallModel #Initial Impression Notes Issue Date: 2026-06-17 GPT Summary- VibeThinker-3Bは3Bパラメータを持つ小型密結合モデルで、検証可能推論の限界を調査します。Spectrum-to-Signalに基づく最適化パイプラインを用い、多ドメイン強化学習や自己蒸留を含むファインチューニングを行い、高度な検証可能タスクでフロンティア級の性能を示します。具体的には、AIME26で94.3点、LiveCodeBench v6で80.2%、LeetCodeコンテストで96.1%の合格率を実現しました。この研究は、コンパクトなモデルがフロンティア性能を持ち得ることを示し、パラメトリック圧縮-カバレッジ仮説を提唱します。 Comment

元ポスト:

Loading…

3Bモデルでもpost trainingによって、100倍以上大きいモデルよりも数学、コーディングなどのドメインでは同等程度の性能に到達できる。ただし、GPQA Diamondのような知識を必要とするタスクの性能は明確に劣る。




Paper/Blog Link My Issue
#Multi #LanguageModel #AIAgents #GenerativeAI Issue Date: 2026-06-15 GPT Summary- 人間レベルのAGIの構築が具体的な目標となり、その影響は広範囲にわたる。報告では、Universal AIへの移行を理論的に論じ、AGIからASIへの4つの経路(スケーリング、パラダイム転換、再帰的改良、マルチエージェント集合)を考察。摩擦やボトルネックに関する具体的な研究課題を提示し、AIの進展が加速する可能性を排除できないと述べ、単一の変革的飛躍よりも連続的な社会変革の可能性を強調。これには学際的な国際協力が不可欠である。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#GraphBased #LanguageModel #Explanation #Reasoning Issue Date: 2026-06-15 GPT Summary- 因果グラフを用いてLLMの推論プロセスを透明にモデル化。四段階の手法で解釈可能な概念を発見し、入力を概念状態へマッピング。反事実補強により因果推定を安定化し、疾病診断や感情分析に適用。結果は因果グラフがLLMの推論と整合する依存関係を捉えていることを示し、説明可能性の基盤を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-06-15 GPT Summary- AIシステムはベンチマークで優れた成果を上げているが、現実の経済的価値には繋がっていない。このギャップは評価の問題に起因していると主張し、長期的な実績を伴うAIエージェントを評価する新しいベンチマーク「Agents' Last Exam(ALE)」を紹介。ALEは250名以上の専門家と共に開発され、非物理的産業における1,000超のタスクを網羅。結果はフルパスの平均達成率が1%未満であることを示し、ALEはタスクプールを継続的に拡大し、経済的影響とベンチマークの成功とのギャップを埋める手段として設計されている。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…

合成データではなく実際にnon-physicalな55の職業によって解かれた1500以上のタスクをverifiableな評価が可能な形式に変換した、データによって構成されたエージェント用のベンチマーク。現実世界の、経済的に価値がある、持続的に取り組まれている専門的なタスクによるエージェントの評価を目的として構築されている。300人以上の100以上の機関の専門家によって構成。

pj page: https://agents-last-exam.org/




Paper/Blog Link My Issue
#LanguageModel #Attention #LongContext #SparseAttention #Initial Impression Notes Issue Date: 2026-06-14 GPT Summary- 大規模言語モデルの超長文脈能力に対応するため、MiniMax Sparse Attention(MSA)を提案。MSAはGrouped Query Attention(GQA)に基づくスパースアテンションで、ブロック単位で効率的な計算を実現。選択されたブロックに対して正確なアテンションを行い、トークンあたりの計算量を大幅に削減。1090億パラメータのモデルで、MSAは性能を保ちながら計算を28.4倍削減し、優れたスピードアップを達成した。詳細な推論カーネルとモデルは公開されている。 Comment

元ポスト:

Loading…

GQAの各グループに対してTopKをサンプリングして利用する




Paper/Blog Link My Issue
#ComputerVision #Selected Papers/Blogs #VisionLanguageModel #Robotics #VisionLanguageActionModel #reading #One-Line Notes #Steering #Author Thread-Post Issue Date: 2026-06-13 GPT Summary- 汎用ポリシーが多様なロボットデータセットから学習する中で、Flow Matching GeneralistsとFlow Reversal Steering(FRS)を提案し、サブ最適な行動を逆向きに通して潜在ノイズを特定、汎用的なアクションモードへ写像する手法を検証。FRSは粗い意味論的指示を良いロボットアクションに変換し、ゼロショット制御を改善。訓練を短時間で行い、最大95%のタスク成功率向上を示し、強化学習をブートストラップしてさらなる改善を実現。 Comment

元ポスト:

Loading…

VLMや人間によって、
- Coarse Reference Action関する情報(=意味的には妥当だがロボットがアクションを実施するには粗すぎる情報; move straight right等)を与え、
- Coarse Reference Action を対応するVLAのreference action a_1に変換し
- a_1に基づいてVLAが良いアクションを生成できる潜在ノイズをFlow Matchingモデルを時間方向にbackwardさせる(noising process)ことで推定し、
- 同定した潜在ノイズから順方向にdenoisingすることで、妥当なアクションをsteeringする

Flow Reversal Sterring (FRS) を提案。FRSにはzero-shot、かつonlineでsteeringができる利点がある。

## Diffusion Steering via Behavioral Cloning (DSBC)
FRSはSupervised Learningにも活用できる。具体的には、reference actionに基づいたノイズ a^hat_0を用いてobservationからノイズを生成するノイズ方策を直接behavior cloning(=observation oが与えられた時に、a^hat_0を出力する確率を最大化する最尤推定; p.6冒頭)する。

image

学習データ(observation, good noiseのタプル)の収集方法は大きく分けて2通りあり
- オンライン: zero-shot FRSを実際に環境でロールアウトし、タスクが成功したときノイズをgood noiseとして記録する
- オフライン: 既存の(observation, action)データをFRSで変換し(observation, action noise)のタプルに変換して学習に利用する

このような学習手法をDSBCと呼ぶ。

## DSRL + FRS
上述のFRSとDSRL [Paper Note] Steering Your Diffusion Policy with Latent Space Reinforcement Learning, Andrew Wagenmaker+, arXiv'25, 2025.06

を組み合わせることで、DSRLの安定性を向上させる手法。DSRLは一言で言うと、アクション生成のシードとなる良いノイズを生成できるポリシー(ノイズ方策)をRLを通じて学習する手法らしく、RLをする際の報酬に対して、DSBCを重み付きで加えることによって、エキスパートのノイズから大きく逸脱することを防ぐ正則化の役割を追加する。

image

完全に読めたわけではないが、おもしろい。勉強になった。



[Paper Note] LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories, Zhanhao Liang+, arXiv'26, 2026.04


Paper/Blog Link My Issue
#ComputerVision #Alignment #ReinforcementLearning #DiffusionModel #TextToImageGeneration #PostTraining #FlowMatching #ImageSynthesis Issue Date: 2026-06-11 GPT Summary- フロー・マッチングモデルの人間の嗜好への整合性を向上させるため、LeapAlignというファインチューニング手法を提案。これにより、長い生成経路を二段階に短縮し、計算コストを削減しつつ効率的な勾配伝播を実現。生成ステップのランダム化や学習重みの調整によってモデルの安定性が向上し、Fluxモデルにおいて優れた画像品質と画像-テキスト整合性を実現し、既存手法を上回る結果を達成。 Comment

pj page: https://rockeycoss.github.io/leapalign/

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Encoder-Decoder #ContextEngineering #One-Line Notes #Compression Issue Date: 2026-06-11 GPT Summary- 長文脈言語モデルの推論ではKVキャッシュの増大がメモリのボトルネックとなるが、従来の圧縮手法はモデルの品質を犠牲にするか、リソースを大量に消費する。そこで、本研究ではエンコーダ-デコーダ圧縮を再検討し、最適な設計と訓練手法を模索。特に、0.6Bエンコーダ・4Bデコーダモデル群を事前学習し、圧縮比1:4、1:8、1:16で性能を向上させるLatent Context Language Models(LCLMs)を提案。LCLMsは効率的な長期エージェントのバックボーンとして機能し、圧縮された文脈から適応的に情報を展開できることを示した。 Comment

元ポスト:

Loading…

input tokenを圧縮し潜在表現にエンコードするencoderを導入し、decoderへ入力するcontextを圧縮する
image




Paper/Blog Link My Issue
#DocumentSummarization #Embeddings #LanguageModel #Decoder #Initial Impression Notes Issue Date: 2026-06-11 GPT Summary- 大規模言語モデルはゼロショット能力に優れるが、テキスト埋め込みベンチマークでは性能が不足している。これは、高頻度トークンの過剰な表現が意味表現の能力を抑制するためと考える。そこで、EmbedFilterを導入し、LLMから生成された埋め込みを洗練させる。具体的には、頻繁なトークンの影響を抑えるためのフィルタリングを行い、意味表現を強化しつつ、埋め込み次元を削減。実験により、EmbedFilterを用いたLLMが、次元削減後もゼロショット性能が向上することを示した。本研究がLLMベースの表現の理解を深め、テキスト埋め込みの改善に寄与することを期待する。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Scaling Sentence Embeddings with Large Language Models, Ting Jiang+, EMNLP'24 Findings, 2023.07
- [Paper Note] Repetition Improves Language Model Embeddings, Jacob Mitchell Springer+, ICLR'25, 2024.02

decoder-onlyモデルからembeddingを取得する際に、高頻度語の成分を除去するフィルタを導入することでembeddingの品質を向上させる




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Scaling Laws #DataMixture #DataRepetition Issue Date: 2026-06-11 GPT Summary- 事前学習データの混合調整には、高品質データの不足が影響し、繰り返しの不一致が主な原因であると示す。高品質データセットの繰り返しレートは、トレーニング予算が拡大するにつれて変化し、最適な混合比を小規模実験で予測できない。サブサンプリング手法を用いることで、この効果を制御可能で、759Mパラメータのモデルにおいて、繰り返し制御により最適解に近づくことを証明。繰り返し制御を行わず同等の精度を達成するには、多くのリソースが必要になる。結果は、繰り返しが混合最適化の重要な要素であることを示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #GenerativeAI Issue Date: 2026-06-11 GPT Summary- AIとハードウェアは密接に結びついて進化しているが、一貫した長期ビジョンが不足している。この断片化は、全体的で持続可能なAIシステムの実現を妨げている。本論文はAIとHWの共設計・共開発のための10年ロードマップを提示し、エネルギー効率やシステム統合を重視してスケーリングを再定義する。AIの効率を1000倍改善し、シームレスなエネルギー配慮型システムを実現することを目指す。最後に、産業界や学術界の具体的な行動項目を示し、AI+HWの共設計が長期的な目標となるよう促進する。 Comment

元ポスト:

Loading…


視野が広がり非常に勉強になる。




Paper/Blog Link My Issue
#LanguageModel #Test-Time Scaling #reading #One-Line Notes #Clustering-based #Author Thread-Post Issue Date: 2026-06-10 GPT Summary- 生成されたテキスト間の意味的コンセンサスを特定するMode Extraction(ModeX)を提案。評価者なしでBest-of-N選択を実現し、類似度グラフを用いてセントロイドを選択。ModeX-Liteで効率化を図り、テキスト要約やコード生成などのオープンエンドタスクで従来の手法を常に上回る性能を示す。 Comment

元ポスト:

Loading…

outputに対してJaccard係数に基づいてAffinity Graphを構築し、クラスタのセントロイドを求めることで、extrnal verifier無しでBest-of-Nを実現する。

image

Best-of-16でのexternal evaluatorを用いた場合のオラクルスコアを、多くの場合で上回っているように見えるが、なぜこの3つのベンチマークでの評価なのだろうか?(そして文書要約はなぜ表層的なメトリックばかりなのだろうか)。論文中では代表的なタスクである3つのベンチマークで評価したと一言しか書かれていないように見える。
image

もしこれが安定して高い性能を出せるなら、evaluator freeなので非常に強力である。理論的な分析もあるようだが読めていない。覚えておこう。




Paper/Blog Link My Issue
#LanguageModel #Evaluation #read-later #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-06-07 GPT Summary- 継続学習を評価するための初の専門家検証済みベンチマークであるCL-Benchを紹介。六つの多様な領域を対象に、LLMベースのシステムが経験を通じて改善するかを測定。状態を持つシステムは潜在構造を発見可能で、最先端モデルが継続学習を改善する余地があることが明らかに。専用メモリシステムでも問題は解決されず、シンプルなICLが優位であった。このベンチマークにより、現実世界における継続学習の必要性が強調されている。 Comment

元ポスト:

Loading…

Question (Instance)のSequenceを完了することが求められるContiunual Learningのためのベンチマークで、各instanceは、モデルが事前に知り得ない報告可能な状態を持ち、後続のinstanceは、過去のinstanceの結果(experience)を用いなければならない。また、最終的に、Databaseのmigrationを通じて過去のexperienceを適用不可能にし、このような状況にも柔軟に対応可能な能力も評価する、という話に見える。
image




Paper/Blog Link My Issue
#LanguageModel #Chain-of-Thought #Evaluation #Reasoning #Initial Impression Notes Issue Date: 2026-06-06 GPT Summary- 推論モデルの評価には、正確性やトークン数だけでなく、推論構造の理解が重要である。これに応じて、論理パズルのためのスケーラブルな評価ベンチマークと、非構造化推論を検証可能な推論グラフに変換するパイプラインを導入。これにより、推論の構造化と定量的分析が可能となり、論理的流れの集中度を測る指標を定義。分析は、構造的測定が正確性とトークン数の混同を解消し、故障モードの診断やパズルの難易度との関係を比較するのに役立つことを示した。 Comment

元ポスト:

Loading…

LLMのReasoning Traceをverifiableなグラフ構造に変換し、Reasoningを評価可能にする

image




Paper/Blog Link My Issue
#Pretraining #Transformer #Attention #Architecture Issue Date: 2026-06-05 GPT Summary- Depth-Attentionは、Transformerにおける情報の選択的再利用を改善する手法であり、各レイヤの先行キーに対してクエリがアテンションを行い、自己注意の値に統合する。これにより、追加のパラメータや永続的な推論状態を導入せずに、キャッシュサイズを維持しつつ、バニラTransformerよりも最大2.3ポイントの精度向上を実現。1.5Bおよび3Bのパラメータ規模でも高い精度と低いパープレキシティを達成し、ループ型Transformerにも適用可能。 Comment

元ポスト:

Loading…

下記研究とはどこが異なるだろうか:
- [Paper Note] Mixture-of-Depths Attention, Lianghui Zhu+, arXiv'26, 2026.03




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #TextualFeedback Issue Date: 2026-06-05 GPT Summary- 強化学習(RLVR)は進化しているものの、依然として狭い範囲に留まっている。本研究では、豊富なフィードバックを古典的な模倣学習アルゴリズムDAggerを通じて活用し、専門家分布にアクセスする手法を検討する。順方向クロスエントロピーは単調なポリシー改善を促し、後悔に関する保証を提供するとともに、教師重み付き成功の尤度を最適化する。実験結果として、DistILアプローチが科学的推論や数学問題解法においてRLVRや自己蒸留のベースラインを上回ることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #OpenWeight #MoE(Mixture-of-Experts) Issue Date: 2026-06-05 GPT Summary- Mellum 2は、ソフトウェアエンジニアリング向けの12BパラメータMoE言語モデルで、トークンあたり2.5Bのアクティブパラメータを有する。主な機能としてコード生成やデバッグ、マルチステップ推論をサポートし、64エキスパートのMixture-of-Expertsアーキテクチャを基盤にしている。また、事前学習には約10.6兆トークンを用いた3段階のカリキュラムを採用し、二段階のポスト訓練によりInstructモデルとThinkingモデルの二つのバリアントが開発された。Mellum 2は、オープンウェイトベースラインと競合しつつ効率的な計算を実現している。 Comment

HF: https://huggingface.co/collections/JetBrains/mellum-2




Paper/Blog Link My Issue
#Pretraining #GraphBased #LanguageModel #DataFiltering Issue Date: 2026-06-05 GPT Summary- マルチドメイングラフ事前学習の冗長性に対処するため、境界意識的サブグラフ混合と階層的識別を組み合わせたフレームワークMDGMIXを提案。MDGMIXは、難易度の高いサブグラフを構築し、共有パターンを識別。少数ショット分類タスクでベースラインを上回り、効率性も向上。コードは公開済み。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Transformer #Attention #Architecture #ConvolutionalModels #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- 動的ショート畳み込みをトランスフォーマーに導入し、静的畳み込みの局所性バイアスを維持しつつ表現力を向上。実験により、動的畳み込みが高難度の連想想起タスクでの性能を向上させ、標準トランスフォーマーを一貫して上回ることを示した。計算量に対する優位性も確認され、効率的なトレーニングを実現するカスタムTritonカーネルを提供。動的ショート畳み込みはトランスフォーマー技術の進展に寄与することを示唆している。 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…


関連:
- [Paper Note] Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers, Zeyuan Allen-Zhu+, ICML'24 Tutorial




Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation #VisionLanguageModel #SpatialUnderstanding Issue Date: 2026-06-05 GPT Summary- 空間推論は視覚-言語モデル(VLM)の基本能力だが、既存の評価は視覚的観察の制限を無視している。本研究では、遮蔽と視点の曖昧性という2つの観察課題を導入し、空間的質問を設計してモデルの応答を評価。結果は、視覚的証拠が不完全な場合でも過信的応答が誘発され、遮蔽下での精度は約30%、視点の曖昧性では10%未満にとどまることを示した。また、信頼できる追加視点を識別する能力は多くのモデルでほぼランダムである。これにより、モデルが正確な回答だけでなく、適切に回答を控える能力や信頼できる証拠を求める必要性が示唆された。 Comment

元ポスト:

Loading…

pj page: https://zhangyuejoslin.github.io/spatialuncertain/




Paper/Blog Link My Issue
#Search #LanguageModel #SelfImprovement #PostTraining #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- Bidirectional Evolutionary Search(BES)は、自己改善する言語モデルの探索フレームワークとして提案されている。前方探索で進化演算子を使用して新しい候補を生成し、後方探索でタスクをサブゴールに分解し、密なフィードバックを提供する。これにより、狭いエントロピー領域から脱出し、必要なサンプル数を指数的に削減可能。実験では、BESが既存の事後学習アルゴリズムを上回る結果を示し、オープン問題解決ベンチマークで優れた性能を発揮することが確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Distillation #PostTraining #On-Policy #Stability #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- オンポリシー蒸留(OPD)は、モデルから小型学生モデルへの能力移転に成功しているが、マルチターンエージェント設定では十分に検討されていない。本研究では、OPDの課題としてKL不安定性を特定し、これが学生モデルの訓練を不安定にさせる主な要因となることを示す。これを解決するために、時間的カリキュラム・オンポリシー蒸留(TCOD)を提案し、短いから長い軌跡への段階的な拡張を行う。実験により、TCODはKLの安定性を向上させ、従来のOPDより最大18ポイントの性能向上を実現することが確認された。 Comment

元ポスト:

Loading…

multi-turn/long-horizonな設定でのOPD手法。multi-turnな設定の場合、教師モデルへのcontextにエラーが蓄積されていき徐々に教師モデルのsignalの信頼性が低下する問題があり、これに対処するためにOPDを適用するtrajectoryのターン数を序盤は短く、徐々に長くしていくようなカリキュラムで学習をする手法を提案。ターン数を深くする方向として、Forward-to-Backward/Backward-to-Forwardの2種類のシンプルな手法を用いて実験をしている。

image




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Author Thread-Post Issue Date: 2026-06-05 GPT Summary- マルチエポック学習が一般的になる中、単一モデルの飽和問題を解決するため、モデル集団の探索と予測統合への転換を提案。ハイパーエポック事前学習(q0)を導入し、マルチエポック予算を多様なモデルへ変換、これにより検証損失が低下。q0は三つのコアプリミティブ(反相関学習、チェーン蒸留、学習済み分布の適合)に基づく。18億パラメータモデルで約56エポックで強力な256エポック基準に匹敵する性能を達成し、データ効率を約12.9倍向上。予算に応じた最適なエポック使用法を提示。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-06-04 GPT Summary- オンポリシー自己蒸留は、言語モデルが自身の生成を特権的文脈で監督する手法で、スパース報酬強化学習に対する密な監督信号を提供する。これを逆Kullback–Leibler発散損失で具現化し、自己蒸留型方策勾配フレームワークSDPGを提案。SDPGはグループ相対検証やKL正則化を活用し、従来のベースラインよりも安定性と性能を向上させる。コードは公開されている。 Comment

元ポスト:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Distillation #SubliminalLearning #One-Line Notes #Steering #Author Thread-Post Issue Date: 2026-06-04 GPT Summary- 潜在的学習とは、学生の言語モデルが教師の特性を微調整することで獲得される現象であり、意味を持たないデータから特定の特徴が伝達される仕組みは未解明である。本研究では、潜在的学習がステアリングベクトルによって媒介されることを示し、教師のプロンプトがこのベクトルによく近似され、学生が整合したベクトルを学習することを発見した。ステアリングベクトルに近似されないプロンプトは学習されないことも示され、その影響がモデルの活性化に及ぶことを明らかにした。潜在的学習には適応型オプティマイザが必要であり、勾配の一貫性が成果に影響を与えることが確認された。 Comment

元ポスト:

Loading…

Subliminal Learning:
- [Paper Note] Subliminal Learning: Language models transmit behavioral traits via hidden signals in data, Alex Cloud+, arXiv'25

Subliminal Learningが生じるのは、教師モデルが生成したデータを通じて生徒モデルが残差ストリームに対するsteering vectorが蒸留されるからであり、教師モデルが生成した何らかのデータを通じて教師モデルと同じ方向にactivationが誘導されるようになるため、という説明のようである。また、subliminal learningが生じるためにはAdamのような適応的なoptimiserが必要で(外れ値の勾配が支配的にならないため)、LoRAのような低ランクでのファインチューニングで生じやすく、フルファインチューニングでは発生しづらいとのこと。

また、細かく読めていないが、16種類の動物に関する特性に関する残差ストリームのsteering vectorを抽出し実験をした結果、steeringは実験の結果モデル間の転移は弱く、モデルアーキテクチャが共通の場合にうまく転移することが示され、このことから、モデル固有のsteering方向に依存することが示唆されるようである。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #LatentReasoning #One-Line Notes #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 大規模言語モデルの推論能力を向上させるために、自己回帰的生成の代わりに作業記憶ブロックを採用するReasoning in Memory(RiM)が提案される。これにより、内部計算と外部通信の混同を回避し、計算効率の高い潜在推論を実現。2段階のカリキュラムを用いて、まず推論ステップを予測し、その後最終回答の洗練を行う。実験により、RiMが既存の方法と同等かそれ以上の性能を示すことが確認され、作業記憶が潜在推論の有効なメカニズムとして機能する可能性が示された。 Comment

元ポスト:

Loading…

元ポストのgifが端的にアーキテクチャを示しており非常にわかりやすい。

メモリブロックと呼ばれるboundaryトークン ``とm個のメモリトークン``を追加で入力する事で、latencyを劣化させることなくLLMの内部状態を更新(latent reasoning)する手法で、単にメモリブロックを追加するだけではうまくLLMは扱えないので、メモリブロックを用いた推論方法を学習させる、という話に見える。

image




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Evaluation #PostTraining #GPUKernel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- 提案された方法は、LLMを用いてGPUカーネルの性能を予測し、評価コストを削減することを目指す。LLMがカーネルの真の性能を正確に予測できれば、GPUによる評価を選択的に行える。強化学習を活用することで予測の精度を向上させ、結果として同一のGPU評価予算でより多くの候補を検討し、高速なカーネルを見つけられる。これはLLMがカーネル最適化において重要な役割を果たす可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #MultiModal #Selected Papers/Blogs #memory #interactive #KeyPoint Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-06-03 GPT Summary- マルチモーダル大規模言語モデルが長期エージェントとして機能するためには、記憶が進化する世界に適応し、適切な証拠を提示する必要がある。しかし、従来のベンチマークは静的なリコールに依存しており、記憶の生成における失敗を特定できない。これに対して、我々は記憶を「アクション-ワールド・インタラクション・ループ」として定式化し、WorldMemArenaを実装。ここでは、400件のマルチセッション・マルチモーダルタスクを通じて、記憶の診断が可能となる。結果として、記憶書き込みは必ずしも性能向上に繋がらず、視覚的証拠の活用が依然として困難であることが示された。また、エージェントの実行はドメインを跨いで不安定で、コストと信頼性のトレードオフが浮き彫りになった。 Comment

元ポスト:

Loading…

著者ポスト2:

Loading…

以下著者ポストの要約

既存のメモリに関するベンチマークは、「静的な環境」において過去のコンテキストから情報を「復元」できるかをテストしているが、それを超えて、
- Lifelong Evolution(動的): ユーザとプロジェクトの状態が変化する世界において、
- Agentic Execution(書き込み・維持・検索・活用): エージェントが観測結果、アクション、ツール実行結果、環境の変化から再利用可能なメモリを構築できるか

をカバーするベンチマークを構築。ベンチマークは461個の複数セッション・マルチモーダルなタスクが含まれ24k QAペア・15kの画像・スクリーンショット、高速な評価のための150サンプルによるサブセットによって構成される。

image

評価では、
- long-contextのエージェントのcontextに入れ込むメモリ
- 人間がデザインしたメモリ(RAG, メモリパイプライン等)、
- agent harnessがメモリ管理をするタイプのagent

の3種類を評価。

image

- Takeaway
- メモリへの書き込みの品質が高くても、必ずしもエージェントがうまく活用できるとは限らない
- 現在の手法ではマルチモーダルな情報に対するメモリはまだ困難で、視覚的/空間的/手続き的な情報を失う
- 重要な情報がアクション、フィードバック、スクリーンショット、状態の更新等に分散している場合にメモリは劣化し、これは現在の多くのシステムが整理されたテキストベースの履歴を扱うことに長けている一方で、実際のinteractionのtrajectoryから情報を抽出・更新・再利用することには課題があることを示唆
- agent harnessに基づくメモリはinteraction中に自動的にメモリが記録・抽出・推敲されるため柔軟性が高く有望なアプローチだが、harness designに性能が依存するため、 性能が不安定

評価結果を見ると、一言にメモリと言っても多様な観点からmetricsが定義でき、手法によって性能に大きな開きがある点や実用的な観点の実験設定となっており興味深い。様々な要素が関わってくるため、一概にこの手法が良いというのもあまり言えなさそうに見える。あとなんやかんやRAGが全体的に性能が良さそうに見えるが、結果の解釈が難しく、何らかの単一の尺度などに押し込めたりしないだろうか。

pj page: https://worldmemarena-mem.github.io/




Paper/Blog Link My Issue
#ComputerVision #Pretraining #MultiModal #read-later #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- DynaFLIPは、ロボット操作のためのダイナミクスを意識した多モーダル事前学習フレームワークで、運動理解を知覚に統合します。異種の人間とロボットのビデオから構築したトリプレットを用い、画像のみのエンコーダを訓練。三つのモダリティが小さなシンプレックス体積を形成するよう促し、その体積が小さいほど整合が強くなります。シンプレックス体積最小化をコサイン正則化項と対照学習と組み合わせ、重要な制御関連領域に焦点を当てたダイナミクス認識表現を得て、視覚バックボーンとして機能します。多様なシミュレーションと実世界の設定で検証した結果、分布外の状況下で最大+22.5%の改善を達成。視覚表現が行動による世界の変化をエンコードすることで、ロボットの一般化能力が向上することを示唆しています。 Comment

pj page: https://dynaflip-robotics.github.io/

元ポスト:

Loading…

pj page: https://huggingface.co/jlee-larr/dynaflip-base




Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #On-Policy #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- ロジットを用いずにチャンクレベルの監督信号で教師からのフィードバックを利用する新しいフレームワーク、OmniOPDを提案。これにより、教師モデルへのアクセス制限とトークンレベル信号の脆弱性の問題を解決。ベンチマークにおいて、OmniOPDは標準OPDを最大+28.64%上回り、高い不確実性の場面でのみ監査するよう設計されている。また、より強力なブラックボックス型教師を用いた場合には、オープンウェイト教師に対してさらに+9.54%の向上を示し、自律的な強化学習の性能を超える結果をもたらした。 Comment

元ポスト:

Loading…

大抵のProprietaryモデルは出力から競合となるモデルを学習することを禁止していると思うのだが、果たして




Paper/Blog Link My Issue
#Transformer #Architecture #On-Policy #RecurrentModels #Exploration Issue Date: 2026-06-03 GPT Summary- 格子推論トランスフォーマー(LDT)は、潜在状態を格子に射影することで論理的推論を行う再帰的トランスフォーマー。探索ベースの制約解法の推論プロセスを模倣し、抽象解釈に基づく近似で訓練。80万パラメータのLDTはSudoku-ExtremeとSnowflake Sudokuで100%の精度を達成し、コスト面で優れた実績を示す。180万パラメータのバリアントはMaze-Hardで99.9%の精度を記録。一方、最先端のLLMsは全ベンチマークで0%。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Analysis #MachineLearning #Self-SupervisedLearning #One-Line Notes #Author Thread-Post #LatentRepresentation Issue Date: 2026-06-02 GPT Summary- 生成モデルは、訓練データの量が生物的学習者に比べて大きくなる中で高い性能を示している。新たな手法として、ネットワークが潜在表現を予測する訓練が行われており、これがデータ効率の改善につながる可能性がある。本研究では、確率的文脈自由文法(PCFG)をデータに用いて、潜在予測が効率を高めることを示す。教師あり学習は指数的なサンプル数を要するのに対し、潜在予測は定数のサンプルで達成可能であることを明らかにした。また、階層的クラスタリングやエンドツーエンドのニューラルネットワークを用いた分析を通じて、data2vecが階層的潜在予測を実行していることを確認し、明示的なスタッキングの冗長性を示唆している。 Comment

元ポスト:

Loading…

JEPAのようなモデル自身が獲得した潜在表現を予測する自己教師あり学習手法は、階層的な生成構造を持つデータに対して、トークンレベルの予測ではO(m^{L+1})のサンプルが必要となるが、O(m^3)程度で済むことが理論的に示された模様。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Dataset #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 現代のAIベンチマークでは、複雑なタスクが多く含まれ、人間の注釈では検知が難しい問題が存在します。これを解決するために、Auto Benchmark Audit(ABA)を導入し、168のベンチマークを調査。ABAは、あいまいなタスク設計や実行環境の衝突など、25.7%以上のタスクで重大な問題を特定。問題のあるタスクがモデル評価を歪めることを示し、除外することでパフォーマンスが9.9%及び9.6%向上することを確認。今後のベンチマーク発展のため、これらのツールとタスク注釈を公開します。 Comment

元ポスト:

Loading…

既存のベンチマークを
- 指示の曖昧性
- 環境に内包される問題(競合や依存関係の問題)
- 評価の品質

の観点から監査するAudit Agentの提案
image




Paper/Blog Link My Issue
#LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- エージェントのリソース消費に対し、コストを実行後にのみ測定するのではなく、予算を積極的な制御信号として扱うべきと提案。予算は内部(計算由来)と外部(行動由来)に分け、エージェントは各計画ステップで残り予算の予測と警告を行う。評価では、強力なエージェントが必ずしも予算意識を持たず、過度に楽観的な傾向が見られた。予算意識信号は訓練可能で、早期停止により失敗したトークンを28〜64%削減でき、SFT+RLがその効果を強化。しかし、正確な区間のキャリブレーションは依然難しい。 Comment

pj page: https://ragen-ai.github.io/bagen/

元ポスト:

Loading…

以下著者ポストと論文のskim readによるサマリ(読み違えがあるかもしれないので注意)

LLM/AI Agentがbudget(あとどの程度のトークンでタスクを完了できるかの見積もり)を考慮して生成できているか否かを明らかにし、性能とトークン予算の性能は必ずしも相関しないことを示し(現在のフロンティアモデルはトークン予算に対して楽観的で、トークン予算があまり残っていないのに不必要に多くのトークンを消費する)、与えらえたトークン予算に関して、タスクを実現できるか否かの2値分類ははSFTによって強化できる(Qwen-7Bにおいて25.5%->90%まで向上)が、SFT+RLによって正確な残りの予算のrangeを当てるような推論は47%程度で頭打ちで課題が残る、という話に見える。興味深い。




Paper/Blog Link My Issue
#Analysis #LanguageModel #Chain-of-Thought #Reasoning #Overthinking #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- ReasonOpsは、チェーン・オブ・ソートの痕跡を分析するための教師なし手法であり、推論の過程を注釈付けするための普遍的な演算子を提供します。12のモデルから44,662の痕跡を分析した結果、共通の構成的な構造が明らかになりました。特に、バックトラッキングや仮説設定などの再発する演算子が全モデルに見られ、内省的演算子は難問でより効果的であることが示されました。演算子のシーケンスを用いることでモデルの高精度な識別が可能になり、早期の品質推定も実現しました。ReasonOpsは、LLMの推論痕跡に対する深いインサイトを提供し、性能予測の強化に寄与します。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #Supervised-FineTuning (SFT) #ReinforcementLearning #mid-training #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Dataset #LanguageModel #Mathematics #ScientificDiscovery Issue Date: 2026-05-31 GPT Summary- ResearchMath-14kは、未解決の数学問題に取り組むために、学術的な情報源から厳選された14,056問を集めたデータセットであり、研究レベルの数学問題の最大コレクションを提供する。さらに、22万件の教師データ経路から生成されたResearchMath-Reasoningは、言語モデルが未挑戦の問題に対して反復的な回避行動を示すことを観察した。フィルタリング後にQwen3モデルをファインチューニングすることで、平均9.2ポイントの性能向上が確認された。このデータセットは、研究レベルの数学的推論における今後の研究に貢献することを目的としている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #mid-training #DataMixture #DataFiltering #Rubric-based Issue Date: 2026-05-31 GPT Summary- 中間トレーニングにおけるデータ選択の課題に対処するため、自己アンカー型ルーブリック発見に基づくフィルタリングフレームワークMIRAを提案。MIRAは各ソースグループの評価基準を発見し、効果的なデータ選択を実現。コード指向の中間トレーニングで、MIRAは選択ベースラインを上回り、トークン数を半分に削減する成果を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#PairWise #Dataset #LanguageModel #Evaluation #KeyPoint Notes Issue Date: 2026-05-31 GPT Summary- 既存の言語モデルベンチマークが飽和する中、SEAL(Seeded Elimination with Adaptive LLM-as-a-Meta-Judge)は、潜在的なランキング信号を抽出する自己改善型評価プロトコルを提案。候補出力をシングルエリミネーション方式で評価し、精度とレイテンシのトレードオフを改善する。複数の飽和ベンチマークにおいて、SEALは全対比較に匹敵する精度を保ちながら、エフォートを大幅に削減した。 Comment

元ポスト:

Loading…

既に飽和したベンチマークを活用してモデルの評価のためのシグナルを抽出できないか?という気持ちの研究のようで、そもそも飽和したベンチマークはpointwiseな評価によって飽和しており、全てのモデル/promptに対してpair-wiseな評価をしてリストワイズな評価をしてランキング付けをすることで、より高い解像度での評価シグナルが得られるよね、という話からスタートしているように見える。しかしpairwiseな評価は非常にコストがかかるので、自己進化するRubric-basedなLLM-as-a-Judgeとトーナメント方式を採用することで、全件探索したpairwiseによるランキングを、低コストで高い相関係数を以て(0.83--1.0)で再現できるよ、という話に見える。

image

pointwiseな評価と比較してFullPair/SEALでの評価は評価結果の序列が変化している。ただし、このFullPairでの評価がどの程度正しいものなのかはよくわからない。

image




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #MultiModal #PostTraining #KeyPoint Notes #ToolUse #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 視覚と言語を統合したモデルは、複雑な問題解決において外部ツールの使用が不可欠である。エージェント的推論は、自己完結型思考とツール使用の非対称な行動を交互に行い、このギャップをThinking-Acting Gapと呼ぶ。標準的なRL手法ではツール使用が限定的で、多くの場合誤りを含む。AXPO(Agent eXplorative Policy Optimization)を提案し、ツール呼び出しの再サンプリングを行うことでこの問題を改善。実験の結果、AXPOは複数のマルチモーダル・ベンチマークで従来手法を上回る性能を示し、パラメータ数を抑えつつ効果的な結果を得た。 Comment

pj page: https://byungkwanlee.github.io/AXPO-page/

元ポスト:

Loading…

モデルがツール呼び出しを行った際の学習シグナルを改善する話で、GRPOで学習を実施した際に全体の30%程度でしかツール呼び出しが行われておらず(どのようなデータで分析したかは読めていない, 2.2節あたり)、そのうち40%程度が応答で誤っておりGRPOで正のadvantageが発生せず、ツール呼び出しに関して精緻なpositiveなシグナルが得られていない問題がある。これを改善するために、ツール呼び出し前のthinkingは正しく、ツールの呼び出し方とその結果が典型的に誤っていることに着目し、ツール呼び出しの上で失敗したrolloutについて、thinkingまでをprefixとしてツール呼び出し以後をresamplingする手法を提案。これにより、ツール呼び出しの頻度が改善し、ツールが呼び出された場合に応答に失敗する割合も減少した。

image

image

pj page: https://byungkwanlee.github.io/AXPO-page/




Paper/Blog Link My Issue
#EfficiencyImprovement #LanguageModel #Transformer #Attention #Architecture #One-Line Notes #ConvolutionalModels Issue Date: 2026-05-31 GPT Summary- Oryxというハイブリッドモデルを提案し、系列全体を通じて異なるトークン混合手法を柔軟に切り替えるアプローチを探る。二次アテンションと線形リカレンスを組み合わせ、90%のパラメータを共有することで、効率的な性能を実現。最長1.4Bパラメータのモデルで、従来のモデルを上回る結果を示し、内部表現の共有が有望な方向性であることを示唆。 Comment

元ポスト:

Loading…

softmax attentionとgated delta net (linear attention)の利用をスイッチングによって動的に切り替え、双方でKVを共有し畳み込みをかけてinducive biasを導入した上で活用する。outputはRMSNorm側でgatingする。softmax attentionとlinear attentionの良いところを良いところ取りしようというアーキテクチャに見える。
image




Paper/Blog Link My Issue
#Multi #Dataset #LanguageModel #Evaluation #Conversation #read-later #Emotion #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 感情知性(EI)の評価が重要になる中、AttuneBenchを紹介。実際の複数ターンの人間-モデル対話200件に基づき、感情状態とモデルの挙動をターンごとに注釈。11モデルの評価結果は感情認識や応答品質に関する能力が分離可能であることを示し、嗜好の整合と応答品質の判断がモデル識別に強く寄与することを明らかに。AttuneBenchは、感情的に重要な会話の評価枠組みを提供し、モデルの強みや弱点を診断する。 Comment

元ポスト:

Loading…

leaderboard: https://public.attunebench.com/

対話をしている本人によるプロンプト、アノテーション、マルチターンの会話を前提にモデルのEQを測定するためのベンチマークのようである(従来は合成プロンプト、シングルターン、third-partyに基づいたアノテーション(つまり対話している本人ではない、ということだと思われる)によるベンチマークだったとのこと)。




Paper/Blog Link My Issue
#LanguageModel #Reasoning #ContextEngineering #Compression #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- 長い文脈を短縮しながら情報損失を抑える文脈圧縮の新手法「Thinking as Compression(TaC)」を提案。思考モデルが自らタスク関連情報を整理し、専用の圧縮機に依存せずに効果的な圧縮を実現。加えて、TaCを制約付きで進化させた「TaC-C」により、思考をコンパクトに管理できる。実験では、既存ベースラインを一貫して上回り、特に4倍および8倍の圧縮比でF1とEMスコアが顕著に改善された。 Comment

元ポスト:

Loading…

contextを圧縮する専門のcompressorをわざわざ用意するのではなく、reasoningモデルのreasoning traceそのものを圧縮されたcontextとして扱えるような枠組みの提案のようである。
image




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #One-Line Notes #ContinualLearning #AgentSkills Issue Date: 2026-05-31 GPT Summary- 大規模言語モデルにスキルを搭載することで、自律エージェントの複雑なタスク解決が可能になる。エージェントのスキルは一般スキルとタスク特有スキルに分かれるが、既存の強化学習手法は外部化と内部化のバランスに苦労している。これを解決するために、Skill0.5という新しいRLフレームワークを導入。一般スキルの内部化とタスク特化の活用を動的ルータで調整し、タスクに応じた最適化を行う。実験結果は、Skill0.5が他のRLベースラインを上回る性能を示すことを確認した。 Comment

元ポスト:

Loading…

Agent Skillsベースのcontinual learningを実現するうえで、多くの研究はSkillを外部化する(Skill.mdを定義し更新する)、あるいは内部化する(モデルの重みにSkillを学習させる)といった挙動のどちらかの文脈で研究されるが、どちらも利点・欠点があるから双方のいいところどりをしたハイブリッドでやりたいよね、という気持ちの研究と思われ、そのために一般的なスキルはモデルに内在化させ、タスク固有のスキルは外部化するというすみ分けをする。

そのために、RLをする際にタスクの難易度をhard/medium/easyに分類するルータを設け、hard taskについては、general skillを与え、self-distillationを通じてteacher trajectoryを生成。teacher trajectoryに基づいてdistillation lossを通じてエージェントにgeneral skillを内在化させ、mediumタスクでは通常通りGRPOで成功率を増大させるように学習、easyタスクではショートカットを防止するような学習のさせ方(generall skillを与えた場合とそうでない場合のtrajectoryを用意しadvantageを計算する?)をする、ことで、generalなスキルをエージェントに内在化させる、という感じの話に見える。ざっと図を見ただけなのでeasyタスクの部分がよくわかっていない。あと、そもそもGeneral/Task specific Skillをどのように進化させていくのかはよくわかっていない。

image

おそらくAgentSkillsの定義と発展は、SkillBankを使っている:
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Scaling Laws #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- UNSLと呼ばれる関数形を提案し、複数の次元が同時に変化する際の深層ニューラルネットワークのスケーリング挙動を正確にモデル化。モデルパラメータ、データセットサイズ、トレーニングおよび推論ステップ数、計算量などが影響を与える様子を示し、大規模なビジョン、言語、数学、強化学習タスクに適用。既存のスケーリング関数と比べ、より精度の高い外挿を実現。 Comment

元ポスト:

Loading…

データセットサイズ、推論ステップ数、幅、深さ、初期化時の重みの標準偏差、学習率、バッチサイズを変数に持ち、それらを同時に変化させても外挿可能なScaling Lawsのようである




Paper/Blog Link My Issue
#LanguageModel #Supervised-FineTuning (SFT) #PostTraining #Selected Papers/Blogs #Label-free #reading #KeyPoint Notes #SelfVerification #SelfDistillation Issue Date: 2026-05-31 GPT Summary- LLMがラベルなしシード問題から自己改善できるかを探求。自己検証蒸留というアルゴリズムで、生成した候補解をプロンプトベースでフィルタリングし、自己精選データを構築。循環的一貫性、事実性、正確性の3段階で解を承認し、より高品質なデータが優れたモデルへと導く。Qwen3モデルでは、数学・科学・コーディングの各ドメインで顕著な性能向上を確認。特にQwen3-4Bでは、特定のベンチマークでの改善が見られ、従来手法に比べ優れた性能を達成。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] UQ: Assessing Language Models on Unsolved Questions, Fan Nie+, arXiv'25

- 事後学習済みのLLMを外部のverifier, ground-truthデータ無しで、UQ Verifierに基づいたself-judgementで構築した合成データでSFTすることで性能を押し上げる手法
- データ構築では、1つのラベル無しseed questionに対してn回の応答生成を行い、それらをUQ style verifierでフィルタリングしたデータによって構築する。
- UQ Verifierは、マルチステージのverifierで(今回はself judgment)、各ステージごとにv回のvotingを実施する。各ステージは以下:
- cycle consistency: モデルが生成した応答から質問を逆生成し、オリジナルの問題のコアとなる課題が共通しているかを検証する。
- factual error check: 事実情報にエラーがないかを検証する。
- total correctness: 思考過程と最終的な結論に誤りがないかを検証する。
- 学習データの構築に計算量を増やせば増やすほど性能が向上する (Figure 3)
- test-time verificationのコストを、データ構築時に前払いし、運用時は1度のinferenceでtest-time verification導入時と同等以上の性能を達成する(Table 3)

image




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Normalization Issue Date: 2026-05-31 GPT Summary- LLMにおけるスケールベクトルの役割を体系的に研究。スケールベクトルはモデルパラメータの僅かな割合でありながら、その除去で事前学習が劣化することを実証。Pre-Normアーキテクチャにおいては、最適化を改善する機能を持つことを示す。また、スケールベクトルに対するウェイト減衰が役割によって異なる効果を持つことを理論的に説明。三つの改良策を提案し、それぞれが一貫した利益をもたらすことを示した。最終的にこれらの改良を統一戦略に統合し、広範な事前学習実験で良好な成果を得る。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Attention #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-30 GPT Summary- 大規模言語モデル(LLMs)用にスケール可能な局所線形アテンション(LLA)を提案するParallaxを導入。LLAの数値解法を排除し、アテンション機構を効率化。FlashAttentionに対して高い演算強度を実現し、事前学習全体で一貫したパープレキシティ改善を確認。新たな現象MuonによりParallaxの能力を向上させた。この研究は、注意機構のアーキテクチャとオプティマイザの共同設計の重要性を示す初の例である。 Comment

元ポスト:

Loading…

Muonと組み合わせると非常に高い性能を発揮するようである

早速nanoGPT speedrunでParallaxによってSoTAが更新されたようである:

Loading…




Paper/Blog Link My Issue
#LanguageModel #PostTraining #CurriculumLearning #DataFiltering #One-Line Notes #SparseAutoencoder #Data #Author Thread-Post Issue Date: 2026-05-28 GPT Summary- モデル内部情報がLLMのデータ処理方法に重要である一方、外部信号に依存したデータエンジニアリングは内在信号を無視していることを指摘。SAERLを提案し、Sparse Autoencoderを用いて多様性、難易度、品質の三つのデータ特性をモデル化。これにより、バッチ多様性や難易度の順序づけ、データフィルタリングを実現。SAERLは平均精度を3.00%向上させ、少ないトレーニングステップで目標精度に達することを示し、効果的なデータエンジニアリングツールとしての役割を果たすことが確認された。 Comment

元ポスト:

Loading…

SAEのrepresentationを、interpretabilityに活用するのではなく、post-trainingの学習データに対するdata engineeringに使うことで、costのかかる手法ではなく**より低コストで**data engineeringを実現したい、という気持ちの研究。提案手法では、SAEによって獲得されるrepresentationに基づいてpost-trainingの学習データに対して、
- 多様性: SAErepresentationを用いてクラスタリングを実施し活用
- 難易度: 軽量なElasticNetに基づく回帰モデル(特徴量はSAE representation)によって難易度予測モデルを学習し、クラスタIDに基づいて難易度をキャリブレーション
- 品質: SAE representationに基づいてqualityを判断する二値分類器を学習しその確率値を使うようである

ぱっと見よくわからないのが、
- difficulty-labeledなsubsetの正体はなんなのか?
- それは幅広いドメインで入手可能なものなのか?
- in-distributionな難易度であればElasticNetで予測できたということだが、in-distributionなdifficulty-labeledなデータがないと提案手法は原則として適用できないということなのか?

という疑問はある。


image




Paper/Blog Link My Issue
#LanguageModel #Attention #LongContext #LowPrecision Issue Date: 2026-05-27 GPT Summary- ThriftAttentionは、長い文脈におけるアテンションの計算コストを緩和し、FP4精度でFP16に近い品質を提供する低ビットアテンションの手法である。重要なクエリ-キーのブロックを選択し、FP16で計算することで、高性能を維持しながら、計算コストを削減。長文脈でもFP4からFP16への性能ギャップを89.1%回復し、シーケンス長が増すにつれてその効果が顕著になることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #ActivationFunction Issue Date: 2026-05-27 GPT Summary- FFN層における活性化関数の固定化から進化し、トークン適応型のMixture of Activations(MoA)を提案。MoAは軽量な入力依存ゲートを用いて活性化の辞書を混合し、パラメータ効率よく表現力を向上。広範な実験で一貫して損失が低下し、従来ベースラインと比べてスケーリング挙動が好ましいことを示す。MoAはLLMsのFFNでの非線形表現力を効果的に高めるメカニズムである。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #OpenWeight #SelfImprovement #MoE(Mixture-of-Experts) #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

関連:
- MiniMax-M2.7, MiniMax, 2026.03

expertの数を大きくしているようで、この設計は下記の知見と一致する:

- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05




Paper/Blog Link My Issue
#ComputerVision #MultiModal #VisionLanguageModel #2D (Image) #UMM #3D (Video) Issue Date: 2026-05-27 GPT Summary- LLaVA-OneVision-2(LLaVA-OV-2)は、マルチモーダルベンチマークで優れた性能を示す最強のビジョン-ランゲージモデル。OneVision-Encoderを基盤に窓付き注意機構を採用し、効率的な局所計算を実現。コーデック・ストリーム・トークン化により、圧縮動画から動き残差を活用して空間情報を選択。約800万件の動画サンプルで事前学習し、JumpScoreベンチマークで優れた細粒度グラウンディングを実現。LLaVA-OV-2はJumpScoreで74.9を達成し、Qwen3-VL-8Bを大幅に上回る性能を示し、動画タスクや空間グラウンディングでの成果も卓越している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Stability #ActivationFunction #Initial Impression Notes #LowPrecision #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLM)において、SwiGLU活性化関数は非線形性を導入するが、大きな入力での数値的不安定性が問題。これを解決するために、新たに提案したPowLU活性化関数は、安定した訓練を実現し、表現力を向上させる。実験では、PowLUがSwiGLUやSwiGLU-Clipと比較して競争力のある結果を示し、スケーラビリティの向上も確認された。 Comment

元ポスト:

Loading…

Layerが深いモデルや、低精度(FP8/FP4)に対して、事前学習の安定性を高める活性化関数




Paper/Blog Link My Issue
#LanguageModel #LongContext #SSM (StateSpaceModel) #reading #LinearAttention #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- トランスフォーマーに基づく大規模言語モデルのアテンション機構が長期タスクでスケールしにくい問題を解決するため、睡眠様の統合機構を提案。モデルは睡眠中に文脈をファストウェイトに変換し、指定されたタスクでオフラインで学習を行う。実験により、提案手法がより深い推論を必要とするタスクで性能向上を示し、従来のトランスフォーマーとハイブリッドモデルに対する優位性を証明。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #mid-training #Batch #Scheduler #One-Line Notes #Data Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLM)の訓練におけるデータ品質の重要性を考慮し、バッチサイズとデータ品質を共同でスケジュールする理論的指針を提供。高品質データは信号の増幅に貢献し、適切なバッチサイズを用いることでノイズを低減する役割も果たす。従来の方法がこの第一の役割を無視する中で、新たに提案するDrop-Stable-Rampupは、品質転換時にバッチサイズを調整し信号の蓄積を促進。評価実験では、各種モデルと数学的推論ベンチマークで顕著な性能向上を実現。 Comment

元ポスト:

Loading…

mid-training(より高品質なデータ)に転換したタイミングにおいて、**バッチサイズを**Drop (mid-trainingではノイズが小さいため、バッチサイズを小さくより多くの勾配ステップを踏むことで、学習シグナルを蓄積)し、その後Stable(しばらく最小バッチサイズを維持し、学習シグナル獲得を最大化)、最終的にRampup(バッチサイズを線形に拡大(学習率の減衰と等価)することで、最終的な収束に向けて蓄積されたノイズを抑制する)といった、学習データの品質に合わせたバッチサイズのスケジューリング Drop-Stable-Rampupを提案

image

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Distillation #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- 知識蒸留における教師と生徒の関係を再検討。強→弱、同等、弱→強の関係で蒸留の有効性を分析し、教師が強力である必要はないことを発見。適切に損失を混合すれば小規模教師でも大きな生徒モデルを改善可能。教師のパラメータ数や訓練トークンの増加は蒸留効果を逆転または飽和させることも。蒸留は分布外および下流タスクの性能を同一ドメインより改善する傾向がある。これにより、強力な教師の必要性に疑問を投げかける。 Comment

元ポスト:

Loading…

モデルサイズやperplexity視点での強-弱ではなく、どちらかというとdownstreamタスクでの性能の方が大事なのでは?結局のところ、生徒モデルよりも教師モデルの方が秀でている部分が何かしら存在すれば、学習シグナルを得られる可能性はあるよね、という話な気が。




Paper/Blog Link My Issue
#Pretraining #Optimizer #Scheduler-free Issue Date: 2026-05-27 GPT Summary- SF-NorMuonを提案し、スケジュールフリーのスペクトル最適化法として、既存のSF-AdamWを上回る性能を実現。125Mおよび772Mパラメータのモデルにおいて、調整済みAdamWに匹敵または優越。定常性保証を証明し、ウェイト減衰が長期的安定に不可欠であることを示した。これにより、任意の時点で高品質なチェックポイントを取得可能にし、ホライゾンなしの最適化を実用化。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Supervised-FineTuning (SFT) #Quantization #Scaling Laws #PostTraining #read-later Issue Date: 2026-05-27 GPT Summary- LLMの性能改善を目指し、シャノン・スケーリング則を提案。この理論は、モデルパラメータをチャネル帯域幅、学習トークンを信号電力と見なし、学習信号と内在ノイズの相互作用を捉える。信号対雑音比が不十分な場合、性能が劣化することを示し、PythiaやOLMo2における実験で理論を検証。シャノン・スケーリング則は古典的手法を上回り、ロスの谷を正確に捉え、未知のモデル予測でも高いR^2スコアを達成。従来の単調性に基づくモデルは劣化する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Dataset #LanguageModel #AIAgents #Evaluation #Conversation #Selected Papers/Blogs #Ambiguity #reading #One-Line Notes #LongHorizon #Proactive Issue Date: 2026-05-27 GPT Summary- パーソナルアシスタントエージェントは、OpenClawのような大規模言語モデルの潜在能力を示しており、特に隠れたユーザー意図の特定に課題がある。本研究では、100のマルチターンタスクからなる積極的支援のベンチマークであるπ-Benchを導入し、長期的な対話におけるユーザーのニーズ予測能力を評価。実験により、積極的支援の難しさ、タスク完遂と積極性の違い、事前対話の重要性が示された。 Comment

元ポスト:

Loading…

ユーザがOpenClawのようなPersonal Assistantを用いて、マルチターンでのconversationを通じて、ある1つのタスクを遂行したいという状況を想定する。このタスクの開始時には、ユーザは一般的には自然で妥当なクエリを投げるが、最初から全てのrequirementを満たしたクエリは投げず、会話をしながら徐々にrequirementを具体化していくような変遷を辿る。このような、タスク開始時に、タスクを開始する上では自然で妥当だが、タスクを完遂するにはrequirementの情報が足りないという状況において、AI Agentが会話を通じて、ユーザが暗黙的に意図している仕様(hidden intents)を考慮して(=ユーザが明示的にinstructionとしてrequirementを与える前に)タスクを完遂できるか、という能力を測定する。
image

1つのタスクを完遂するために20個のsessionの会話によって構成されており、hidden intentsはsessionの中で閉じている、あるいはsessionを跨いで維持されるようなものとなっており、これらの情報をエージェントは過去のsessionの情報(メモリ)から推測するか、あるいは明示的にhidden intentsについて質問をするようなProactiveな挙動によって収集した上でタスクを遂行しなければならない。このとき、Userの役割を果たすエージェントは、GPT-5.4によって再現される。
image




Paper/Blog Link My Issue
#Analysis #LanguageModel #AIAgents #SelfImprovement #ScientificDiscovery #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment

元ポスト:

Loading…

現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。

image

image

ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。

データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。




Paper/Blog Link My Issue
#Pretraining #Temporal #LanguageModel #Factuality #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes Issue Date: 2026-05-27 GPT Summary- 時間的根拠を学ぶためのLLMの訓練におけるデータの並び順の重要性を探求。7,000件を超える時間的質問のベンチマークを作成し、事実と時期の結び付けを評価。6Bパラメータモデルを時系列で訓練した結果、シャッフル訓練と同等以上の性能を示しつつ、最新の知識を一貫して保持。これにより、時間的順序付けが知識の新鮮さを向上させることを明らかにした。関連コードやデータセットも公開し、今後のLLMの継続学習研究に寄与。 Comment

元ポスト:

Loading…

事前学習時に時系列に応じて並び替えをしたコーパスと、シャッフルしたコーパスの場合、前者の場合freshな知識が必要な質問に対する応答性能が改善する。実験では、Common Crawlのsnapshotの時刻のタイムスタンプに基づいてorderを決定しているようである(2.3説冒頭)。
image

評価のために作成されたQA例が下記で、NBAのバスケチームのコーチのような時間とともに正解が変化するような事実に関する質問によって構成されているようである。これらはwikipediaから特定の年と紐づいた (subject, relation, object) のタプルを抽出することによって生成される。
image




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Optimizer #Scaling Laws #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- オプティマイザは、言語モデルの性能に重要な影響を与えるが、通常は固定的な詳細として扱われている。本研究では、異なるオプティマイザが同じTransformerアーキテクチャのスペクトルスケーリングに与える影響を調査し、AdamWとMuonの間で顕著な違いを発見した。特に、Muonは線形スケーリングを示し、スケーリング指数が2.3倍に増加するのに対し、AdamWは弱いスケーリングを示した。この異差は検証損失だけでは説明できず、同一の損失が異なる表現構造を持つ可能性を示唆する。オプティマイザの効果はアーキテクチャの効果を上回ることがあり、最適化を表現スケーリングの重要な要素として捉える必要性を強調し、オプティマイザとアーキテクチャの共同設計を促進する。 Comment

元ポスト:

Loading…

lossは同じでも、AdamW/Muonの間で形成される内部representationの構造が異なる(説)




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #LanguageModel #read-later #Selected Papers/Blogs #LearningRate #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- Layerwise Learning Rate(LLR)を導入し、Transformer層ごとに異なる学習率を割り当てることで訓練を効率化。重尾性を考慮した学習率調整により、訓練の均一化、収束の加速、一般化の改善を実現。50の異なる条件での実験で、最大1.5倍の訓練速度アップを達成し、1Bモデルのゼロショット精度を47.09%から49.02%に改善。低いチューニングオーバーヘッドも特長。 Comment

元ポスト:

Loading…

Layerごとに学習率を調整することで、学習効率を改善する




Paper/Blog Link My Issue
#NeuralNetwork #EfficiencyImprovement #LanguageModel #Transformer #reading #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- CODAは、トランスフォーマーのオペレータをGEMMプラスエピローグとして再パラメータ化し、計算をメモリ書き込み前に実行可能にするGPUカーネルの抽象化である。このアプローチにより、データ移動のボトルネックを軽減し、標準的なTransformerブロックの計算を効率化。代表的なワークロードで高性能を達成し、生産性と効率を両立する道を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Embeddings #Analysis #Pretraining #LanguageModel #read-later #HyperparameterTransfer Issue Date: 2026-05-27 GPT Summary- ハイパーパラメータ転送は、小規模から大規模モデルへの最適化に不可欠で、特にスケーリング則の適合や適切なパラメータ化の選択が重要です。本研究では、ハイパーパラメータ転送をスケーリング則適合の品質、外挿誤差のロバスト性、パラメータ化による損失ペナルティの三つの指標で定量化する枠組みを提案。また、μPがSPに比べて高品質な学習率転送を提供する理由を解明し、埋め込み層の学習率最大化が訓練の安定性とハイパーパラメータ転送を向上させることを示しました。さらに、ウェイト減衰はスケーリング則の適合を促進する一方で、固定トークン設定が外挿ロバスト性を損なう可能性も指摘しました。 Comment

関連:
- [Paper Note] Scaling Exponents Across Parameterizations and Optimizers, Katie Everett+, ICML'24
- [Paper Note] A Theory on Adam Instability in Large-Scale Machine Learning, Igor Molybog+, arXiv'23, 2023.04

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Selected Papers/Blogs #reading #Initial Impression Notes #Author Thread-Post #Reviwer Issue Date: 2026-05-27 GPT Summary- AIレビュアーの導入が進む中、その能力と信頼性には疑問が残る。多くの科学者はAIを専門知識を欠くシステムと見なす一方、他の研究者は楽観的である。AIレビュアーの評価を理解するため、本研究では、専門家による2,960件のレビューを評価し、その結果、GPT-5.2が人間レビュアーを上回る性能を示した一方で、他のAIレビュアーは最低評価の人間を上回った。ただし、AIレビュアーは重複や限定的知識に課題を持ち、人間の代わりではなく補完としての役割に留まることが明らかとなった。 Comment

元ポスト:

Loading…

Natureの82本の論文に対してAIにレビューを実施させ、人間の専門家がレビュー結果に対して大規模なアノテーションを実施し、現在のAIレビュワーの能力を評価。その結果、AIレビュワーは
- 根拠が明確で重要な問題点を明らかにし、人間よりも多くの問題点を指摘できるが
- レビューの結果は多様性に乏しく、重複した指摘が多い。
- また、コミュニティや分野における暗黙の了解や規範が欠如した指摘をしたり (W1: missing community / field norms)、過剰に厳しい、あるいはスコープ外や非現実的な要求を実施したりする (W2: over-harsh, out-of-scope, or unrealistic demands)

などの欠点があることが明らかになった、ということのようである。




Paper/Blog Link My Issue
#Pretraining #LanguageModel #mid-training #PostTraining #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-05-27 GPT Summary- LLMの訓練パイプラインを効率的にスケールするためにIntrospective Training(IXT)を提案。IXTはポスト訓練の情報を初期段階に活用し、自然言語によるフィードバックを付与することで、データの品質を意識した訓練を実現。これにより、トークンの扱いが変化し、計算効率は最大約2.8倍向上、特に数学やコード分野で優れた性能を達成。 Comment

元ポスト:

Loading…

LLMによってルーブリックに基づいて学習データに対するスコア、critiqueを生成し、データにprependして学習することで、学習効率が改善する。事前学習だけでなく、中間/事後学習にも適用できるようである。

image




Paper/Blog Link My Issue
#Tools #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Asynchronous #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AstraFlowは、強化学習(RL)システムのデータフロー管理を自律的なコンポーネントに分離し、マルチポリシー協調訓練を効率的にサポートする新しいアプローチを提供する。これにより、従来のトレーナー中心の制御から脱却し、異種かつ跨地域の計算リソースを効果的に活用する。AstraFlowは、数学やコーディング、検索のワークロードで、既存RLシステムに匹敵する精度を保ちつつトレーニング時間を2.7倍短縮したことが示された。 Comment

元ポスト:

Loading…

github: https://github.com/Infini-AI-Lab/astraflow




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Selected Papers/Blogs #reading #One-Line Notes #needs-revision #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLMs)の事前学習におけるスキル獲得の順序を理解するための「暗黙のカリキュラム仮説」を提案。シンプルかつ組み合わせ可能なタスクを用い、モデル間の一貫した出現順序を追跡。特定のパラメータ範囲で構成的なタスクが後に現れる傾向があり、モデルの表現に組み込まれていることを示す。予測可能な訓練経路を通じて、事前学習は構造化されていると示唆。 Comment

元ポスト:

Loading…

これは、著者ポストしっかり読みたい

- モデルファミリー・DataMixtureにはよらず、事前学習では構成的で、かつ予測可能なカリキュラムに則って学習が進行し、かつモデルの内部状態から各スキルがどのように学習されていくかを予測できるという仮説を立て、
- この仮説を検証するために、91種類の構成的なタスクを定義し、emergence(=当該タスクの性能が閾値を超えること)を4種類のモデルファミリーにおける9つのモデル、様々なDataMixtureの元で追跡した。タスクの例は以下:
- simple tasks: 文字列操作/形態素の変換/知識の抽出/翻訳など
- composite tasks: 複数の基礎的な操作のsequentialな組み合わせによって実現されるタスク
- たとえば、`gerund_upper` は大文字への変換➡︎動名詞への変換という順番で定義される。

image

- 様々なモデルファミリーをテストしたところ、LLMは事前学習の間におおむね(完璧ではないが)同じ順番でスキルを獲得していくことが明らかになった
- たとえば、Figure 1を見ると、性能の伸び方は異なるものの、閾値を50%としたときのemergenceの順番はモデルの間で一貫していることがわかる。Table2も参照のこと。

image

- composite tasksは、それらのタスクの構成要素が獲得された後にemergeすることが明らかになった(54/76ケース)
- 例外的に、composition taskが構成要素よりも先に習得されたものが3例ほど存在した
- また、あるcomposite taskの学習曲線を、類似したFunction Vectors [^1] を持つcomposite taskから予測できるか?(i.e., 類似したタスクは同じような学習曲線を持つか?)を検証。
- これを実施するために、composite taskに対してleave-one-outを実施し、類似したタスクのFunction Vectorsから学習の軌跡を予測できるかを実験したところ、R^2スコアが0.68--0.84程度の性能で予測することができた。
- Function Vectors: [Paper Note] Function Vectors in Large Language Models, Eric Todd+, arXiv'23, 2023.10

image

[^1]: Function Vectorsとは、LLMに遂行させるタスクのinput-outputの変換の関係性を保持し、タスクを遂行させる際にLLMに対して強い影響力を持つ内部のactivationsのことを指す。




Paper/Blog Link My Issue
#Search #LanguageModel #AIAgents #AgentSkills Issue Date: 2026-05-27 GPT Summary- LLMエージェントが再利用可能な経験を残す一方で、生の軌跡はノイズが多い。本研究では、エージェント・スキルを経験スキーマとし、SkillsVoteフレームワークを提案。環境要件や品質を考慮し、スキルライブラリを構造化してエージェントの探索を支援する。実行後には、成果をサブタスクに分解し、成功した発見のみを更新として受理。評価結果として、GPT-5.2の性能が最大7.9ポイント、SWE-Bench Proで最大2.6ポイント改善されることを示した。これにより、外部スキルライブラリがエージェントの性能を向上させる可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Quantization #KV Cache #Compression Issue Date: 2026-05-27 GPT Summary- KVキャッシュのメモリボトルネックを克服するために、OScaRという軽量なフレームワークを提案。Token Norm Imbalance(TNI)を量子化忠実度の主要因として特定し、Canalized RotationとOmni-Token Scalingを用いてその影響を緩和。評価結果は、OScaRが既存手法を超え、INT2量子化でロスレス性能を達成することを示し、デコード速度を約3.0倍向上、メモリフットプリントを約5.3倍削減。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Optimizer #read-later #Selected Papers/Blogs #Scheduler #Scheduler-free Issue Date: 2026-05-27 GPT Summary- Schedule-Free Learningは、任意の時点で効果的に訓練できる手法として、高い成果を挙げているが、これまで小規模なスケールでの適用に限られていた。私たちは、この手法を大規模モデルとバッチサイズに拡張するための修正を行い、学習率やスケジュールが不要なScheduleFree+を提案。これにより、従来のWSDスケジュールを上回る訓練が実現され、長時間の訓練で特に効果を発揮することが示された。パラメータあたりのトークン数が1000で、先端技術よりも31%の性能向上を達成した。さらに、この手法はモデル平均化とチェックポイントのマージ利用の理論的基盤も提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #LanguageModel #Evaluation #VisionLanguageModel #Robotics #SpatialUnderstanding #EmbodiedAI #Simulation Issue Date: 2026-05-27 GPT Summary- 空間知性は行動を通じて展開し、エージェントは能動的に観察を行い、見えない構造を明らかにする。新たに導入したESI-BENCHは、具現化された空間知性のベンチマークで、エージェントは知覚、移動、操作をもとに行動を選定し、タスク関連の証拠を蓄積する。実験により、能動的探索が受動的アプローチを上回り、エージェントは自発的に新たな戦略を見出すことが確認された。3Dグラウンディングは推論を安定させる一方、不完全な表現は逆に有害であり、モデルは証拠の質に依存せず早期に結論に達する傾向がある。 Comment

元ポスト:

Loading…

pj page: https://esi-bench.github.io/




Paper/Blog Link My Issue
#Survey #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #AgentHarness Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLMs)は、コード理解と生成において優れた能力を示しており、エージェント性を持つシステムでは、コードがエージェントの推論や行動に重要な役割を果たすようになっている。この研究では、「エージェント・ハーネス」という観点から、コードをエージェント基盤の中心と位置づけ、三つの層(ハーネス・インターフェース、ハーネス機構、マルチエージェント設定へのスケーリング)を整理して調査する。具体的には、コードがエージェントを接続し、計画やフィードバック駆動の制御を行う仕組み、そしてマルチエージェント環境での協調を支援する役割を探る。また、評価方法やハーネスの改善、安全性などの未解決課題も概説し、コードをエージェント的AIの中心に据えることで、実行可能で検証可能なAIエージェント系への統一的なロードマップを示す。 Comment

ポイント解説:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #LowPrecision Issue Date: 2026-05-27 GPT Summary- 大規模言語モデルのFP4トレーニングにおいて、Wgradの量子化が収束低下を引き起こす主要な要因であることを示唆する研究。FpropとDgradのFP4適用は控えめな影響に留まる。実験結果により、トレーニングの不安定さは確率性ではなく、勾配経路に沿った構造的な誤差によって生じることが明らかになった。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Dataset #LanguageModel #Evaluation #Medical #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 医療分野でのLLMs評価は、ベンチマークの飽和やデータ制限のため困難である。30のベンチマークを含むオープンソース評価スイートMedmarksを導入し、61モデルを71設定で評価。その結果、最先端のモデルが最高性能を示し、ファインチューニングされたモデルが汎用モデルを上回ることが確認された。評価は医療推論のLLMsのポストトレーニング環境としても利用可能。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #CircuitAnalysis Issue Date: 2026-05-27 GPT Summary- 本研究では、LLMsの機能が単一のメカニズムに局在しているという「機能的異方性仮説」に基づき、回路と層の発見に関する経験的および理論的証拠を示す。Overlap-Aware Sheaf Repulsionを導入し、構造的重複にペナルティを加えることで、効率的に多様な回路を発見可能であることを確認した。この現象は発見された回路が増えるにつれて明らかになる。さらに、超疎な三辺のシーフを特定し、それぞれの辺が独立して重要でないことを示すことで、成分の標準的な概念も揺らぐことを論じた。分布型密結回路仮説を提案し、重ね合わせから低重複の回路が自然に生まれることを理論的に示す。これらの結果は、LLMsの機序的説明に対する再考を促す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #DataMixture Issue Date: 2026-05-27 GPT Summary- データ混合は、異なるソースを組み合わせる問題であり、言語モデルの訓練に重要な影響を与える。従来の手法は特定のフェーズに依存しており、単独での代理モデルや固定ドメインに頼ることが多い。我々は、訓練全体に適用可能なデータ混合アルゴリズムOP-Mixを提案し、候補データを低ランクアダプタ間で補間することでコストを削減し、探索をモデルの実際の学習に基づかせる。OP-Mixは、計算資源を大幅に削減しつつ、事前学習や継続学習での性能を向上させ、データから学ぶ単一の連続プロセスとしての新しい視点を提示する。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #ReinforcementLearning #SyntheticData #One-Line Notes Issue Date: 2026-05-27 GPT Summary- LLMは、データ束縛型の局面に移行しているが、オーガニックデータを完全に活用しているわけではない。そこで、本研究では、合成データ生成フレームワーク「SynPro」を導入し、限られたオーガニックデータからの学習を強化する。SynProは、再表現と再フォーマットを通じて多様な情報を生成し、強化学習で最適化される。実験により、SynProは有効トークン数を3.7〜5.2倍に引き上げ、データ束縛の課題に対処できることが示された。コードはオープンソースで公開されている。 Comment

元ポスト:

Loading…

人間が作成したテキスト(organic data)の効果を最大限に引き出すためにデータを合成し、事前学習のlossがサチった際には合成データを生成するポリシーを更新し、現在のサチったモデルに対してより有効なデータとなるような合成データをorganic dataから(rephrasing/reformatにより)合成し学習コーパスに追加する(式10, 11, 12)。

image




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Selected Papers/Blogs #reading #One-Line Notes #DownstreamTasks #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 信頼性の高い性能予測が必要な言語モデル開発において、クロスエントロピー損失や直接評価には限界があることを指摘し、代わりに専門家が執筆した解答のトークン分布からエントロピーや精度といったトークンレベルの統計を用いた代理指標を提案。これにより、モデル選択や事前学習データの選択、訓練時の予測において一貫して優れた結果を示し、専門家の軌跡がモデル能力評価において有用な信号であることを明らかにした。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

クロスエントロピーlossに代わるcandidate modelのdownstreamタスクの性能を間接的に測定するための代理指標の提案で、クロスエントロピーlossと比較。代理指標はexpertが作成したtrajectoryに対するcandidate modelのnext token predictionの分布(や、エントロピー等指標に基づく重みづけの組み合わせ)によって、算出される(式1, 2)。

image

6つの異なるモデルファミリーの18種類のreasoning modelにおいて、6種類のベンチマークにおいて、モデルのdownstreamタスク性能をランク付けできるかをSpearman Rhoで測定したところ、クロスエントロピーlossが0.36だったのに対し、提案した代理指標(を特徴量として用いたRankSVM)は0.81を記録。また、(あるLLMがある事前学習コーパスで学習された場合のdownstreamタスクでの性能の良さによって)事前学習コーパスの良さをランク付けするタスクの場合、ベースラインと比較して10,000倍計算コストを削減できたとのこと。

image

DataDecide testbed:
- [Paper Note] DataDecide: How to Predict Best Pretraining Data with Small Experiments, Ian Magnusson+, ICML'25, 2025.04




Paper/Blog Link My Issue
#Survey #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AI支援研究は進化し、自動化システムが低コストで論文を生成可能になったが、整合性の問題が浮き彫りに。特に、最先端のLLMでも結果の捏造や誤りの見逃しがある。研究ライフサイクルを四つの段階(Creation, Writing, Validation, Dissemination)で分析し、AIの信頼性と自律性の限界を特定。AIは構造化されたタスクには優れるが、新規のアイデアや実験には脆弱であり、人間の協働が最も信頼される。具体的なリソースはプロジェクトページで提供。 Comment

pj page: https://worldbench.github.io/awesome-ai-auto-research

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #InformationRetrieval #LanguageModel #RAG(RetrievalAugmentedGeneration) #MLSys #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- LEANNは、動的に再計算することでストレージ効率の高いベクトル検索を実現する新しいインデックス。元データ一部のみで高品質な検索を提供し、従来のインデックスに対して最大50倍のサイズ削減を達成。RAGアプリケーションでの高精度と同等のレイテンシを維持。 Comment

元ポスト:

Loading…

github: https://github.com/yichuan-w/LEANN](https://t.co/QwkYx1t0oa




Paper/Blog Link My Issue
#Citations #LanguageModel #AIAgents #Hallucination #read-later #Selected Papers/Blogs Issue Date: 2026-05-27 GPT Summary- HalluCitationと呼ばれる幻の引用が科学的信頼性に深刻な影響を及ぼしている。研究では、2024年から2025年に発表されたACL、NAACL、EMNLPの全ての論文を分析し、約300件にHalluCitationが含まれていることを確認。特にEMNLP 2025での発生が顕著で、信頼性に影響を及ぼす可能性がある。

Paper/Blog Link My Issue
#Analysis #LanguageModel #Steering #Author Thread-Post Issue Date: 2026-05-26 GPT Summary- 活性化の誘導は、タスク挙動が活性化空間の線形方向に対応することに基づくが、研究によりこの前提が逆転することが示された。12タスクにわたる6つのモデルでの分析から、通常の操縦が成功する一方で、デコードできない場合も多く、FVsは計算的指示を符号化するが、回答の方向性は示さないことが明らかになった。また、モデル間の非対称性が確認され、線形表現仮説が「線形デコーダ可能性」と「線形ステアラビリティ」に分解されることで、それぞれが異なることも示された。これらの結果は、安全性モニタリングにおいて重要な示唆を含む。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Steered LLM Activations are Non-Surjective, Aayush Mishra+, arXiv'26, 2026.04




Paper/Blog Link My Issue
#LanguageModel #AIAgents #read-later #Selected Papers/Blogs #AgentSkills #Initial Impression Notes Issue Date: 2026-05-26 GPT Summary- エージェントのスキルをデジタル空間内で最適化するために、SkillOptという体系的なアプローチを提案。これにより、評価されたロールアウトを基にスキル文書の編集を行い、検証スコアを改善させることが可能に。多様なベンチマークで他の手法を上回り、GPT-5.5での性能向上も実現。最適化されたスキルは異なる環境間での移動でも価値が保持されることが確認された。 Comment

元ポスト:

Loading…

自然言語で記述されるスキルを訓練可能な外部パラメータとして扱う

ポイント解説:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Alignment #PostTraining #One-Line Notes #Author Thread-Post Issue Date: 2026-05-26 GPT Summary- モデルは事前訓練による受動的な予測器から、事後訓練を通じて自身のオンポリシー生成を認識するように変わる。この認識は出力分布に影響を与え、オンポリシー時の出力エントロピーはオフポリシー時より3〜4倍低いことを示す。最新の入力トークンの予測されなさが出力エントロピーを調整し、事後訓練済みモデルは応答の話題についての不確実性を早期に収束させる。一方、異なる話題のプレフィルによってこの意図が崩れるとエントロピーが上昇する。また、モデルがオンポリシーの文脈を言語的に認識できることが確認されたが、そのメカニズムは暗黙の認識とは異なる。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Large Language Models as Optimizers, Chengrun Yang+, ICLR'24, 2023.09

以下元ポストの要約

- 事前学習済みモデルは「シミュレータ」であり、事後学習済みモデルは「実行者/演者」としてとらえた方がよい
- すなわち、自身の出力はアクションであり、その結果がフィードバックとして将来の自身の入力になるような関係の下駆動する。
- 事後学習済みモデルは自身の出力よりも、他のモデルの出力を読み込む場合にエントロピーが高くなる
- これは、モデルの入力に対するSurpriseの内部表現によって生じる。すなわち、過去のモデルの予測結果に対して、入力された直近のトークンがどれくらい尤度が低いか、によって出力のエントロピーがsteeringされる。
- モデルサイズが大きいほど、オンポリシー・オフポリシーの差が大きく、これはRL無しで、SFT+DPOだけのpost-trainingでも自己認識が生じる。
- また、「食べ物を思い浮かべて...」というinstructionを与えると、事前学習済みモデルと比較して、事後学習済みモデルは単一のトピックに確率質量を集中させる(つまり、計画を練っている)。これはシミュレータと実行者/演者の特性の違いとしてとらえられる。
- 事後学習済みモデルは、自身の計画がのっとられた場合も検知することができ、計画されていないprefillの場合は、出力トークンのエントロピーが大きくなる。一方、ベースモデルの場合はエントロピーにこのような効果はない(暗黙的な自己認識)。
- モデルに読んでいるテキストが自身が生成したものか、他人が入力したものかを判定させる実験を実施し、KV Cacheをパッチして挙動を分析。ユーザのintentがuser-token中の特定の位置の(おそらくKV Cache)に保持され(hidden activation)、ユーザの意図との整合性等の判定結果を出力する直前にのみ、hidden activationと応答内容の比較がなされていることがKV Cacheのパッチに基づく実験で明らかとなった(明示的な自己認識)。
- この結果は、意図を比較する際には、暗黙的な自己認識の場合と比較して、異なる回路(Surpriseとは異なる回路)をオンデマンドで誘発して利用していることを示唆している。
- (理解があまりできておらず、この説明で正しいかちょっと自信がない。論文中3.3節)




Paper/Blog Link My Issue
#ComputerVision #Pretraining #LanguageModel #Optimizer #Finetuning #Stability #Backbone #One-Line Notes #Author Thread-Post #Scheduler-free Issue Date: 2026-05-26 GPT Summary- Muonの直交化は、勾配の振動を引き起こす高曲率部分空間の影響を受けつつ、訓練の進展を加速する。一方、Anytime Muon(AMUSE)は、迅速な適応を図るために時間変化する補間係数を利用し、安定した平均化を通じて振動を抑制する。AMUSEは学習率スケジュールを排除し、視覚タスクと大規模言語モデルの事前トレーニングにおいて、性能を一貫して向上させる。 Comment

元ポスト:

Loading…

以下、上記著者ポストからの要約である。

MuonとScheduler-freeなoptimiserでの過去のtrajectoryの平均的な方向へ更新する考え方を組み合わせて、Muonの学習を安定させ、かつSchduler-freeを実現した模様。具体的には学習初期にはMuonの軌道を重視し、学習後半になるにつれ、ノイズの影響を低減するためにtrajectoryの平均方向に最適化する(時間変化する補完係数によって挙動が制御される)といったイメージのようである。

Muonがなぜうまくいくかの理論的な分析も実施されている。近年は損失関数の幾何構造をriver/valleyのようにたとえて表現するらしく、(Figure 1)、SGDは曲率の高い(勾配が急)な方向への更新される傾向があり振動をしながら川方向へ進むようだが、Muonはriver方向(曲率は小さいがモデルが最も学習が進捗する方向)への更新を増幅する働きがあるようである。しかし、ノイズとなる高曲率な谷方向への更新も増幅してしまいそれが振動や不安定さを生むため、それを是正するためにSchedule Freeな手法を組み合わせている、という気持ちのようである。また、先行研究に記載がある通り、WSDスケジューラをriver-valleyで説明する、Stableフェーズが川に沿った更新を促進し、Decayフェーズはパラメータを谷の底へ収束させる役割を果たしている、というイメージのようである。

image




Paper/Blog Link My Issue
#LanguageModel #Alignment #Safety #PostTraining #Author Thread-Post Issue Date: 2026-05-25 GPT Summary- 対立する目的を考慮したリバースアライメント手法(RACO)を提案。ペアワイズ嗜好データを利用し、効率的な衝突回避勾配降下法を用いて収束を保証。複数のLLMに対する実験で、提案手法が従来のアプローチよりパレートのトレードオフを一貫して改善することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Planning #Author Thread-Post Issue Date: 2026-05-24 GPT Summary- エージェントの計画メカニズムを三つのシステム(シミュレーティブ推論、自己規制、反応的実行)に分解し、効率的な推論を実現する。SR^2AMを用いてLLMを世界モデルにし、計画と推論を行う二つの実装(v0.1およびv1.0)で、推論トークンの使用を大幅に削減。特にv1.0-30Bは、同等モデルと比較して推論トークンを25.8–95.3%少なく使い、計画の見通しを22.8%増加させることが示され、エージェントの学習と適応の自律性が強化されることを証明。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #PRM #RewardModel #Label-free Issue Date: 2026-05-24 GPT Summary- 無監督型プロセス報酬モデル(uPRM)は、推論の精度を高める新たな手法であり、従来のPRMが必要とする人間のステップごとの注釈を排除します。uPRMは、LLMの次トークン確率に基づき、誤りが起こる可能性のあるステップを評価します。この方法により、ProcessBenchデータセットでの誤り特定精度が最大15ポイント向上し、テスト時の性能では監督付きPRMと同等の結果を示しました。さらに、強化学習においても、uPRMはより優れた方策最適化を実現し、スケーラブルな報酬モデリングの道を開きます。 Comment

元ポスト:

Loading…

Next Token Predictionによってターミナルのダイナミクスをモデルに内包させる研究と関連している:
- [Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05




Paper/Blog Link My Issue
#ComputerVision #Evaluation #Reproducibility #Robotics #VisionLanguageActionModel #Reading Reflections #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- VLAモデルの実世界評価に向けた低コスト且つ再現性の高いベンチマークVLA-REPLICAを提案。市販部品で構築し、多様な操作タスクとデータセットを提供。実験により、再現性を確認し、モデルの特性を明らかに。 Comment

元ポスト:

Loading…

再現可能なベンチマークを作るのはロボティクスのような物理的な検証環境が必要なタスクの場合は確かに難しそうだな、と思うなどした(小並感)。オブジェクトの配置や景観、実際のロボットのパーツなど外的な要因が非常に多い気がする。




Paper/Blog Link My Issue
#Analysis #LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- オンポリシー蒸留は推論モデルの訓練に対し、トークンごとの監督信号を提供するが、その有効性を決定する条件は未解明である。本研究では、トークン、質問、教師ごとに動作する診断フレームワークを導入し、学生の成功確率を最大化する勾配を導出。理想の勾配との整合性を評価し、蒸留指導が誤ったロールアウトに対して高い整合性を示すことを発見。最適な蒸留文脈はモデルの容量とタスクに依存し、標準的な設定は存在しないことが示された。これにより、タスクごとの診断分析の重要性が強調される。 Comment

元ポスト:

Loading…

(下記は著者ポストに基づく要約です。ざっくり読んだだけなので誤りがあるかもしれず、詳細は著者ポスト参照のこと)

on-policy (self) Distillationが、どのような場合に有効なのかを分析。
トークンレベルで見た時に多くのトークンが教師-生徒間でdisagreementが存在し、これらにはフォーマットに起因するトークンと、reasoningに重要なトークンの双方が存在する。
そこで、本研究では各トークンにとっての最良の勾配を導出(=生徒が正答できる確率を最大化する方向のもの)。
最適なgradientの方向がわかったので、あとは実際に蒸留をした場合の各トークンのgradientとのコサイン類似度を測ることで、どのような場合にdistillationが有用やシグナル(すなわち、生徒が正答できる確率を高めることに寄与しているか)を分析した。

分析の結果
- distillationが役に立つ場面は、生徒が誤ったロールアウトをしているケースで、正解のロールアウトをしている場合は教師モデルは役立つシグナルではなくノイズを与えているだけだった。
- 教師モデルのパラメータは大きければ大きいほど良いわけではなく、有効か否かは生徒モデルが学習シグナルを理解できるかに依存する。
- たとえば、BoolQというデータで生徒がQwen0.6Bだった場合はself-teacherに基づく勾配が、より大きな外部teacher(4--14B)による勾配と比較して、理想的な勾配に近かった(より高い類似度だった)。
- 一方で、同じデータセットで生徒モデルを1.7Bにすると、8Bの外部teacherが最も理想的なシグナルと高い類似度の勾配をもたらし、self-teacherはあまりうまく機能しなかった。
- contextのフォーマット(生のtrajectoryか要約か, mistakeを含めるか否か等)が、教師モデルの選択と同じくらいの重要
- MMLUデータでの実験で、0.6Bモデルが生徒の場合は、32Bモデルが書いたsolutionをcontextとして与えたself-teacherが理想的な勾配により近く、1.7Bの生徒の場合は、要約されたsolutionの方が良い。
- AIMEの場合、hardな問題の場合は、正解だけでなく失敗例 /典型的なミスをcontextとして与えたself-teacherが良い一方で、easyな問題では常にパフォーマンスの劣化を招く。

以上より、タスクごとに有用なdistillationの設定を模索することの重要性が示唆される、

という感じのようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #On-Policy #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- Variational Policy Distillation(VPD)は、強化学習におけるまばらな報酬信号の問題を解決する新たなフレームワークであり、言語フィードバックから密なトークンレベルの監督信号を生成する。これにより、教師と学生ポリシーを共進化させ、教師は軌道結果に基づいて能動的に洗練され、学生はこの情報を内在化する。科学的推論やコード生成タスクにおいて、VPDは従来の手法を一貫して上回る性能を示し、受動的蒸留の限界を克服することを目指す。 Comment

元ポスト:

Loading…

提案手法の全体像を説明する図が論文中に欲しい。式(3)が天下り的に出てきて、私の勉強不足によりこの式を前提に論理展開がスタートする気持ちがよくわからない(おそらくDPOあたりをもっとしっかり理解するとわかるのだろう)。

が、現在のself-teacherに基づくOPSDは、textual feedback Cに対して最適化されておらず、かつzero-shotによる予測を実施しているため、学習が継続するにつれてfeedbackにいつか限界が生じるため学習のために有用なシグナルがなくなるのではないか、という考察に基づき、

textual feedbackから学習する枠組みvariational inference problemの観点から考え直す。すると、KL Divergenceによって正則化されたRLVRは式(3)によって定式化されるreward functionによって傾斜がつけられた最適な事後分布pi_*に対して、ポリシーのKL Divergenceを最適化する問題と等価になる。このとき式(3)の分母にはZ(x)が存在しこれは計算ができない。このため、これを解決するためにteacher network q_phi (y | x, C) を導入し、最適な事後分布pi_thetaの近似的な教師分布とする。これによりELBOを用いた変分下限のRLVRの目的関数を定義することができ、これはEMアルゴリズムによって解くことができる。具体的には

- Eステップ: q_phiとpi_optimalのKL Divergenceが最小となるようにq_phiを更新する。
- Mステップ: pi_thetaとq_phiのKL Divergenceが最小となるようにpi_thetaを更新する。

このとき、EとMではphiとthetaのパラメータが独立して存在するが、実用上はphiとthetaを共有する。これにより、textual feedback Cを解釈する教師モデルと学生モデルの双方がco-evolvingしていくような学習が実現される、

という感じだろうか。

ELBOについて:
- 変分オートエンコーダ⑥変分下限 ELBO: https://note.com/kikaben/n/n00ad3e148770



[Paper Note] Post-training makes large language models less human-like, Marcel Binz+, arXiv'26, 2026.05


Paper/Blog Link My Issue
#Analysis #LanguageModel #Alignment #Initial Impression Notes Issue Date: 2026-05-23 GPT Summary- LLMsが人間の行動を模倣する中で、どのモデルが最適かは未解決の課題である。この解決策として、Psych-201データセットを導入し、行動的一致性を測定。訓練後の段階でモデルが人間行動と一致しないことを確認し、整合性のずれは新しいモデルで拡大、一方で基盤モデルは改善を続ける。また、ペルソナ誘導法による個人レベルの予測改善は見られなかった。これらの結果から、LLMsを有用なアシスタントに転換するプロセスが人間行動の模倣を妨げている可能性が示唆される。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Do LLMs exhibit human-like response biases? A case study in survey design, Lindia Tjuatja+, arXiv'23, 2023.11

LLMがRLHFなどによって人間が好む応答とは異なるバイアスを持つことが示されている。

純粋な疑問として、人間らしいモデルが本当に人間の役に立つのか?という問いが成り立つ気がする。




Paper/Blog Link My Issue
#Novelty #LanguageModel #AIAgents #ScientificDiscovery #Initial Impression Notes Issue Date: 2026-05-23 GPT Summary- 科学的発見は認知的に利用可能である必要があり、従来のコミュニティが占有する知識の偏りが新しいアイデアの提案を妨げている。提案手法は、論文を細かな概念ユニットに分解し、アイデア原子にクラスタリングすることで、補完的な研究方向を探る枠組みである。この方法では、整合性モデルと可用性モデルの二つを学習し、原子の組み合わせをランキングすることで、異質な方向の探索を実現する。実験の結果、提案サンプラーはLCMアイデア生成ベースラインを超える広い原子語彙を探索し、整合性を維持しつつも人間と同等またはそれ以上のアイデアを生成する。これにより、科学的妥当性とコミュニティの可用性を分離し、AI的なアイデア創出を通じて見落とされた方向性への探索を拡大する。 Comment

元ポスト:

Loading…

既存のliteratureが斬新な研究アイデアを創発する際のバイアスとなる、といった切り口は興味深い。また、Recommender Systemsにおけるnovelty/serendipityのような話にも似ているように感じる。

- Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05

にて言及されているような現在のエージェントが、完全に新規なアイデアではなく既存の技術の積み重ねや組み合わせが得意というのも、このバイアスによって説明がつくように感じる。

あと、ふと以下のページを思い出した(なぜだろうか。serendipityがあるような研究タイトルがたくさんあったからかもしれない):
https://www.phontron.com/nlp-title/




Paper/Blog Link My Issue
#LanguageModel #Test-Time Scaling #read-later #LatentReasoning #RecurrentModels #RecursiveModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- 潜在状態を反復的に更新することで推論のスケーリングを実現するモデル(EqR)を提案。これにより、タスク特異の情報なしでテスト時のスケーリングが可能に。内部ダイナミクスを深さと広さで調整し、アトラクターへの収束を強化。シンプルなケースは少ない反復で収束し、難しいケースではスケーリングが有効。最終的には、精度がSudoku-Extremeで99%以上に向上。学習されたアトラクターの分布が反復的推論の理解に寄与することを示唆。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05

本研究とモチベーションが非常に類似しているように感じる。

解説:

Loading…




Paper/Blog Link My Issue
#Transformer #Architecture #LatentReasoning #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LT2(Linear-Time Looped Transformers)は、ループ処理と線形またはスパースアテンションを組み合わせ、計算コストを削減する新しいアーキテクチャ。これにより反復的なメモリ精緻化や有効受容野の拡張が実現され、従来のモデルの性能を上回る。LT2-hybridでは異なるアテンションバリアントを組み合わせ、効率と品質の両面で最適化。約1Bトークンの訓練データで、変換済みモデルは業界標準を超え、ループ型トランスフォーマーのスケーラビリティを向上させる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #read-later #Diversity #Selected Papers/Blogs #EntropyCollapse #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LLMが新しい環境に適応し、多様なタスク固有の報酬を持つロールアウトを選択できるように、Vector Policy Optimization(VPO)を提案。VPOはベクトル報酬空間を活用し、テスト時検索で最強のスカラーRLベースラインと同等かそれを上回る性能を示す。進化的探索においては、従来のモデルでは解決できない問題を解決可能。多様性の最適化が今後のポストトレーニング目標となる可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #read-later #Selected Papers/Blogs #DataFiltering #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- 高計算資源を活用したスケーリング研究で、大規模モデルの事前学習におけるデータフィルタリングを検討。一般的に思われる高品質データのみが必要との見解に反し、実験は、十分な計算資源があればデータフィルターなしが最良であることを示す。訓練された大規模モデルは低品質や誤誘導データを受け入れ、むしろ「質の悪い」データからも恩恵を得ることが判明。 Comment

元ポスト:

Loading…

LLMの事前学習において、十分に大きなモデルサイズと計算量があれば、データフィルタリングをしない場合の方が最終的にperplexityがデータをフィルタリングしたモデルよりも上回る。これはbad data (e.g., トークンのシャッフル, ランダムな文字列の挿入)を追加した場合でも当てはまる。

データプールのサイズが大きな数な場合でも、フィルタリング手法とフィルタリングがない手法との交差点が変わるのみで、その交差点は現実的なエポック数に留まったままである。データのスケーリングの傾向に基づいて、インターネットサイズのデータサイズに外挿をすると、約1e30 FLOPsが必要となる試算になるが、数年以内に到達可能な計算量と考えられる。

ダウンストリームタスクへの性能にも(ノイジーだが)事前学習での改善は寄与する。ただし、事前学習させたトークン数が少ない場合はフィルタリングした方が性能が良く、十分な計算量を投じる必要がある。

といった話が著者ポストに書かれている。興味深い。

逆に言うとこの傾向は、モデルパラメータ、計算資源が十分に大きいことが前提だと考えられるので、PhiのようなSLM研究において得られた学習データの高品質化が重要という知見とは競合しないと思われる。

解説:

Loading…

関連:
- [Paper Note] When Bad Data Leads to Good Models, Kenneth Li+, ICML'25, 2025.05




Paper/Blog Link My Issue
#DocumentSummarization #Analysis #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #memory Issue Date: 2026-05-23 GPT Summary- 過去の経験から学ぶエージェント記憶は、生データと再利用可能な教訓という二つの記憶形態を統合する。しかし、現在のLLMによる統合記憶は、効果的に役立つ経験から生成されても誤りを含むことが多い。記憶の有用性は統合が進むにつれて劣化し、特定の問題では失敗が見られる。異なる更新スケジュールは質的に異なる記憶を生み出し、エピソードの保持のみでは統合の効果を競合する。制御された環境下でエージェントが生のエピソードを保持することが精度を向上させることが示され、統合は明示的に管理するべきである。今後は、安全に統合できるLLMの開発が求められる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Tokenizer #read-later #Selected Papers/Blogs #Byte-level #Author Thread-Post Issue Date: 2026-05-22 GPT Summary- サブワードトークン化の訓練効率とモデル性能への影響を分離し、様々な次元で仮説を検証。バイトレベル環境でのシミュレーションにより、サブワードモデルの優位性を明らかにし、訓練スループットの向上とサブワード境界の重要性を強調。将来のモデル改良への洞察を提供。 Comment

LLMに記憶の更新(要約)。任せ、継続すると最初は性能が向上するが、じきに低下していき、記憶なしのモデルが上回るようになる。無条件にLLMに記憶を更新させるのではなく、要約をするタイミングを明示的に指定する、生のエピソードを最優先するといった対策があるといった感じかもだが、ちょっともう少しちゃんと読んだ方が良さそう。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Transformer #Architecture #LinearAttention Issue Date: 2026-05-22 GPT Summary- Gated DeltaNet-2は、線形アテンションの圧縮メモリを編集するためにGated Delta Rule-2を導入し、適応的忘却とチャネルごとの減衰を実現。チャネルごとの消去ゲートと書き込みゲートを分離し、それぞれの役割を明確にすることで性能を向上。13億パラメータでトレーニングされたモデルは、言語モデリングや常識推論において強力な結果を示し、特に長文のRULERベンチマークで顕著な利点を発揮。コードは公開中。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Prompting #Safety #Selected Papers/Blogs #reading #One-Line Notes #Steering #Interpretability #Reading Reflections #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- アクティベーション・ステアリングは、モデルの活性化を調整し、その挙動に変化を与える手法であり、解釈可能性や安全性研究で広く利用されている。しかし、任意のテキストプロンプトによってこの挙動が実現可能かは不明である。本研究では、この問題を全射的な観点から考察し、すべてのステアされた活性化が前像を持つかを調査する。実証的結果から、活性化ステアリングは任意のプロンプトによって同じ内部挙動を再現できないことを示し、ホワイトボックス的なステアリングとブラックボックス的なプロンプティングの違いを明確にする評価プロトコルを提案する。 Comment

元ポスト:

Loading…

steeringされたactivationを自然に生み出すプロンプトは存在しない。言い換えると、steeringによって得られる挙動はpromptでは再現できない。これにより以下が示唆される:
- prompt levelのbehaviorとactivation/weightに介入することによるbehaviorの変化は、根源的に異なる現象なので分けて考えなければならない
- white-boxなstteering手法によってjailbreakができたとしても、black-boxな手法(e.g., promptingによる脆弱性など)による脆弱性があることの証拠にはならない

image

Steeringされたactivationは下記のようなAutoencoderを学習することでverbalizeできるのだろうか?hidden_stateのreconstruction lossを通じてverbalizeするためできそうではある。元々のactivationがpromptによって到達不可能な点にいたときに、promptによって到達不能なだけであって内部のネットワークが状態を解釈できないというわけではないので(ここがめちゃめちゃなら何も学習できないということになるがそうではなさそうなので)普通にできそうではある:
- Natural Language Autoencoders: Turning Claude’s thoughts into text, Anthropic, 2026.05




Paper/Blog Link My Issue
#Analysis #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Mixture-of-Experts (MoE) アーキテクチャの設計選択を体系的に検討し、2,000件の事前学習ランを実施。エキスパート数、粒度、サイズの変化で一貫した性能向上を確認。活性パラメータ規模の増加が性能向上に寄与し、最適なエキスパートサイズは総パラメータ数に依存しないことが明らかに。共有エキスパートやロードバランシングの影響は小さく、ドロップレス・ルーティングは有益。全体として、エキスパート数と粒度にフォーカスするシンプルなアプローチが有効であることを示唆。 Comment

元ポスト:

Loading…

MoEアーキテクチャにおいては、expertのサイズと数が重要であり、他の要素は最小限の影響しか与えない

- Expertの総パラメータ数が増えれば増えるほど性能が改善する(アクティブパラメータ数に対する総パラメータ数が128倍などの極端な場合でも性能が改善)
- Expertの数は多ければ多いほど良い。また、Expert一つに対する最適なサイズは総パラメータすうには関係なく、アクティブパラメータ数にのみに依存して決まることが明らかになった。このため、まずアクティブパラメータ数を優先的に決めて、VRAMが許す限りエキスパートの数を増やすのが良い
- MoEアーキテクチャが優れているのは、ブロックを小さく分割したからではなく、非アクティブなパラメータが存在することによるSparseな活性化によって生じる(MLPを細かいブロックにして全てを活性化させても性能が悪化した実験を受けて、ブロックを細かく分割することではなくsparseな活性化に鍵があると結論)
- 共有エキスパートや、サイズを不均一にしたエキスパートの設計には効果がない
- ルーティングに関しては、特定のエキスパートにトークンが偏った場合のToken Droppingは実施せず、Droplessなルーティングをする方が一貫して少しだけ性能が良い。極端に強い/弱いロードバランシングは性能の劣化を招くが、他の設定ではほぼ最適なものを達成できるので、Token Droppingを防ぐことに注意して、あとは一般的な設定を採用すれば良い。
- レシピをまとめると
- 最大のFLOPs/Memoryの予算を決め、active/totalのエキスパートのパラメータ数を決める
- アクティブパラメータ数から最適なエキスパートのサイズ(総数)を見つける
- token droppingを防ぐようなルーティング設定で、ロードバランシングのsanity checkをする

といった 話が著者ポストに書かれている。




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy Issue Date: 2026-05-21 GPT Summary- SDARはRLを中心に据え、OPSDを補助目的として活用する新しいアプローチ。マルチターンエージェントにおける不安定性に対処し、教師の承認を得たトークンの蒸留を強化。ALFWorld、WebShop、Search-QAでの実験により、従来のGRPOを大幅に上回り、一貫したパフォーマンス向上を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #AIAgents #SelfImprovement #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment

反響がすごそうに見える

- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。

環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。

元ポスト:

Loading…

prime-rlでサポートされたとのこと:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Attention #Architecture #memory Issue Date: 2026-05-21 GPT Summary- $δ$-memは、凍結済みのフルアテンションバックボーンにコンパクトなオンラインメモリ機構を追加し、過去の情報を固定サイズの状態行列に圧縮・更新する。これにより、生成時に低ランク補正を生成し、メモリ集約型ベンチマークで顕著な性能向上を達成。従来の手法と比較して、フルファインチューニングなしで効果的なメモリ利用が可能であることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Transformer #Training-Free #Selected Papers/Blogs #MLSys #reading #One-Line Notes #SparseAttention #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- BLASSTは、LLMsの文脈での推論能力向上のために提案された動的スパースアテンション機構である。固定スカラー閾値を用いて計算を加速し、トレーニング要件を排除、既存フレームワークと容易に統合可能。自動閾値キャリブレーション手法により、最適閾値と文脈長の逆比例関係が明らかにされ、前計算とデコードそれぞれに単一の閾値を利用。現代GPU上でのベンチマークにおいて、前計算とデコードがそれぞれ1.52倍、1.48倍の速度向上を示し、精度を維持した。 Comment

元ポスト:

Loading…

training-freeで単一のスカラー閾値による制御によって、スキップ可能なattention blockをスキップするSparse Attentionとのこと。

image

非常に使い勝手が良さそうで、50%程度のSparsityにしてもベースラインとなるDense Attentionに対してダウンストリームタスクの性能低下はなく(Table 4)、50%程度のSparsityの場合、prefillとdecode step方法において、Blackwell, Hopperアーキテクチャにおいて約1.3倍の高速化を実現できる(Table5)。




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #memory #reading #One-Line Notes Issue Date: 2026-05-21 GPT Summary- 大規模言語モデル(LLM)が個人化メモリを維持する上での「暗黙的対立」能力を評価するために、400の専門家検証済みシナリオを含むSTALEを提案。三次元の探査フレームワークにより、古い信念の検出やユーザー状態の変化に応じた記憶の修正を評価。最先端のモデルでも精度55.2%に留まり、時代遅れの仮定を受け入れる傾向を示す。状態認識型メモリの改善のためのプロトタイプCUPMemを提示し、明示的な状態判断の重要性を示す。 Comment

元ポスト:

Loading…

提案されたベンチマークでは3つの次元で測定するが、特にユーザから本来とは異なる古い前提のクエリ与えられたときに、それを否定し、自身のメモリからgroundingされた情報に基づいて応答を生成させるテスト(Premise Resistence; 3.5節)に苦戦することが示されている(Table 2)。

他の二つの次元は
- State Resolution: 以前の記憶がすでに無効であることをモデルに対して直接テスト
- Implicit Policy Adaptation: 前提知識を提示せずに、最新の記憶に基づいて応答しなければならない質問(e.g., 今週の通勤プランを教えて)に対するテスト




Paper/Blog Link My Issue
#Analysis #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Diversity #KeyPoint Notes #Exploration Issue Date: 2026-05-21 GPT Summary- 大規模言語モデルに基づくエージェントは、環境特異的情報を取得する前に過去の知識で行動することにより失敗することがある。この問題に対処するため、探索チェックポイントカバレッジという指標を導入し、エージェントの探索の広さを測定。評価の結果、従来の強化学習エージェントは狭い行動パターンを示し、下流性能に悪影響を及ぼすことが判明。対策として、探索とタスク実行を交互に行う訓練戦略、Explore-then-Actパラダイムを提案し、環境知識を先に取得しそれをタスク解決に活かすことを促進する。結果から、体系的な探索の学習が一般化可能なエージェント構築に不可欠であることが示されている。 Comment

元ポスト:

Loading…

environment中の鍵となるチェックポイントをエージェントが見つけた割合(Exploration Checkpoint Coverage; ECC; 環境内に定義された重要なlocation, object, affordance等をどれだけ発見できたか)を定義し、task-orientedなGRPOがECCを低下させる傾向にあることを検証(つまり、挙動が狭くなる)。
image

これを解決するために、ExplorationとActのロールアウトを分離してGRPOを実施するExploration-then-Actパラダイムを提案。このパラダイムでは、タスクを遂行するロールアウトと、ECC Rewardに基づいた探索をするロールアウトを分離し、探索に関して明示的な報酬を与える(従来はタスク実行の結果にimplicitに含まれているだけだった)。これらロールアウトに関するGRPOを交互に実施することによってポリシーを最適化する。inference時は、タスクのゴールを与えずにNステップ探索をし、探索したtrajectoryの要約とタスクのゴール、environmentに関する知識によって条件付けをしてactionを決定する。これにより従来のGRPOよりもALFWorld, ScienceWorld等のベンチマークで性能が向上し、エージェントの挙動としても、
- アクションの繰り返しの割合が低下
- ループする割合が低下
- 情報を探索する割合が向上
- エラーからリカバリーできる割合が増加

といった変化が見受けられた。




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #DataMixture #LowResource #One-Line Notes Issue Date: 2026-05-21 GPT Summary- 低リソース言語の事前学習におけるデータ制約を克服するために、ハイパーパラメータ調整と高リソース言語のデータ混合の二つのアプローチを比較。データ混合は検証損失と下流タスクの精度向上をもたらし、特にモデルサイズが大きいほどその効果が顕著。混合による性能向上は、ターゲットデータのユニークな量の2〜13倍に相当し、混合が正則化と知識供給に寄与するが、検証損失はその効果を過小評価している。実践的な指針として、高リソース言語の混合を優先し、ハイパーパラメータ調整よりも混合比に焦点を当てることを提案。 Comment

元ポスト:

Loading…

low resourceな言語での性能向上にはハイパーパラメータを調整するよりもHigh Resourceなデータを混合し、正則化の働きを促進するのと、low resourceなデータからでは得られない知識を注入する方が効果的




Paper/Blog Link My Issue
#LanguageModel #DiffusionModel #read-later #Selected Papers/Blogs #FlowMatching Issue Date: 2026-05-21 GPT Summary- 連続データ生成において拡散モデルとフローに基づくモデルの成功が言語モデリングへの関心を高めている。論文では、連続的なDLMを離散トークンへの最小限の適応で実現するEmbedded Language Flows(ELF)を提案。ELFは連続埋め込み空間に留まりつつ、従来の手法を活用して離散トークンへ写像。実験の結果、ELFは既存のDLMを大幅に上回り、高い生成品質を少ないサンプリングステップで達成することを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Attention #Architecture #Hierarchical #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Lighthouse Attentionを提案し、因果トランスフォーマの訓練におけるSDPAの計算量とメモリ使用量の課題を解決。階層型注意アルゴリズムにより、シーケンスの圧縮・展開を行い、クエリ・キー・バリューを同時にプールすることで並列性を向上。二段階の訓練手法により、訓練時間を短縮しながら性能を向上させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Safety #PostTraining #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Negation Neglectは、LLMを否定のある文書でファインチューニングすると、モデルがその主張を真実だと信じてしまう現象を指す。実験では、否定を含む文でファインチューニングしたモデルの信念率が2.5%から88.6%に増加。一方、否定を伴わない場合は92.4%と高い。否定を主張に局在させることで、モデルは否定を正しく学習可能。また、この現象は他の認識論的修飾子やAIの挙動に影響し、AIの安全性に懸念をもたらす。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #LanguageModel #Scaling Laws #DataMixture #Initial Impression Notes Issue Date: 2026-05-21 GPT Summary- 希少なターゲットデータを扱う際、汎用データとの混合は重要だがトレードオフを伴う。ターゲットデータが少なすぎると露出不足、逆に多すぎると過学習のリスクが高まる。2,000件以上の訓練データを用いた調査から、繰り返しが性能向上の鍵であり、適切な繰り返し回数はデータのサイズやモデルのスケールによることを発見した。また、繰り返しを考慮した混合スケーリング則を提案し、効果的な混合構成を体系的に計算する手法を提供した。 Comment

元ポスト:

Loading…

汎用的なデータと少量しかないターゲットデータをMixする場合において、汎用的なデータは常に新しいトークンが供給される(ターゲットデータの過学習を防止する正則化の役割を果たす)状況で、ターゲットデータを繰り返し学習させら場合は:

> 希少なターゲットコーパスは15〜20回再利用可能で、最適な繰り返し回数はターゲットデータのサイズ、計算予算、モデルスケールに依存する。

ということらしい。

また、モデルサイズ、合計学習トークン、ターゲットデータのサイズ、混合比率、ターゲットデータの繰り返しの頻度、と、ターゲットドメインのlossの間のscaling lawsを導出したということらしい。

関連:
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23




Paper/Blog Link My Issue
#LanguageModel #DiffusionModel Issue Date: 2026-05-21 GPT Summary- 離散系列の生成モデルを球面 \(\mathbb{S}^{d-1}\) 上で学習し、von Mises-Fisher (vMF) 分布を用いて自然なノイズ過程を導入。コサイン類似度に基づくスカラーODEへ連続性方程式を還元し、唯一かつ有界な解で速度を決定。事後重み付けされた接空間上での総和により、ODEサンプリングと予測子-修正子(PC)サンプリングを行い、クロスエントロピー損失で学習。実験結果では、数独と言語モデリングにおいてvMFとPCサンプリングの組み合わせが著しく性能を向上させた。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Image Generation with a Sphere Encoder, Kaiyu Yue+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #LanguageModel #Architecture #Test-Time Scaling #read-later #Selected Papers/Blogs #Encoder-Decoder #LatentReasoning #RecursiveModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- 将来のニューラル推論システムにおける拡張計算の実装として、Generative Recursive reasoning Models (GRAM)を提案。GRAMは、再帰的潜在推論を確率的な複数の潜在軌道に変換し、条件付き推論や無条件生成を可能にする。これにより、従来の決定論的モデルよりも改善された性能を示し、構造化推論や制約充足タスクにおいて有効性を発揮。 Comment

pj page: https://ahn-ml.github.io/gram-website/

元ポスト:

Loading…

先行研究:
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
- [Paper Note] Less is More: Recursive Reasoning with Tiny Networks, Alexia Jolicoeur-Martineau, arXiv'25, 2025.10

全然まだ理解できていないが、depth(iterative refinement)のみではなく、width(multiple parallel trajectories)方向にinference-time scaling可能なrecursiveなアーキテクチャの提案で、

LoopedTransformerのようなモデルはdeterministicな推論プロセスなため単一の軌跡に収束する(同じ入力に対して同じ出力をする)が、本研究では再帰的な推論プロセスにおいて、deterministicなhidden stateの推論に加えて、確率的でlearnableなguidance ε_t(ε_tの分散の大きさによって探索の度合いを変化させられる)をサンプリングして加えることで、多様なlatent trajectoryを生成可能にするで、自然なparallel inference-time scalingを可能にする

という感じだろうか。

image




Paper/Blog Link My Issue
#LanguageModel #Evaluation #interactive #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- インタラクティブな評価の重要性を強調し、従来の応答中心のベンチマークからの変革を提案。評価を「証拠から判断へ」とする自律的な写像として定義し、インタラクションによって生成される軌跡を評価する必要性を示す。設計原理や報告基準を導出し、評価課題の再発を分析する二軸分類法を提案。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #Transformer #Attention #Architecture #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Delta Attention Residualsは、従来のアテンション残差の冗長性を解消し、それに代わりサブレイヤーによって導入される変化量に焦点を当てることで、選択的なルーティングを強化します。この新しい手法は、より高いコントラストのアテンション分布を生成し、層間での効果的なルーティングを実現することを示しています。実験により、Delta Attention Residualsは、従来の手法よりもパフォーマンスが一貫して向上し、検証perplexityが改善されることが確認されました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #read-later #Selected Papers/Blogs #memory #One-Line Notes Issue Date: 2026-05-21 GPT Summary- MeMo(Memory as a Model)フレームワークは、LLMのパラメータを変更せずに新しい知識を専用のメモリにエンコードすることで、タイムリーな情報適用を可能にする。これにより、複雑な関係の把握、検索ノイズへの耐性、壊滅的忘却の回避を実現し、LLMへのプラグアンドプレイ統合が可能となる。実験結果は、BrowseComp-Plus、NarrativeQA、MuSiQueの各ベンチマークにおいて高い性能を示した。 Comment

元ポスト:

Loading…

frozenなgeneratorモデルでコーパスからmemory model用のQAデータを合成し、QAデータを用いてmemory modelに知識を埋め込み、frozenなexecutive modelがmemory modelから情報を引き出しながらクエリに応答するアーキテクチャ
image




Paper/Blog Link My Issue
#Pretraining #LanguageModel #SmallModel #Architecture #read-later #Selected Papers/Blogs #LatentReasoning #RecurrentModels Issue Date: 2026-05-20 GPT Summary- HRMを用いた新たな言語モデルは、多タイムスケール処理を取り入れ、計算資源を大幅に節約しつつ高い性能を達成。指示-応答ペアに特化した訓練により、ゼロからの学習でもMMLUやARC-Cなどで顕著な結果を出し、公開モデルと対等以上の性能を示す。これは、アーキテクチャと学習目標の共設計によって、事前学習をよりアクセスしやすくする可能性を示唆している。 Comment

元ポスト:

Loading…

気になる




Paper/Blog Link My Issue
#LanguageModel #read-later #Selected Papers/Blogs #Steering #Initial Impression Notes Issue Date: 2026-05-20 GPT Summary- CNAを用いて、有害なプロンプトを特定する活性化を持つニューロンの0.1%を抽出。これにより、拒否率を50%以上低減しながら、流暢さと非退化性を保持する。既存の識別構造をターゲット可能な拒否ゲートに変換することで、信頼性の高い行動誘導が可能であることを示した。 Comment

元ポスト:

Loading…

追加のSAEの学習や重みの調整無しで、contrastiveなprompt pairから二つのsetの間で最もactivationが異なるMLP上位0.1%を分離することで、目的の挙動をsteeringする




Paper/Blog Link My Issue
#Analysis #LanguageModel #Transformer #LongContext #PositionalEncoding #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-19 GPT Summary- RoPEの制約を分析し、文脈長の増加が局所性バイアスとトークン関連性の一貫性を損なうことを証明。アテンションスコアがランダム推測に近づく中、位置やトークンの識別が困難になることを明らかに。ハイパーパラメータ増加は識別能力を向上させるが、トレードオフが生じることも示唆。従来のアーキテクチャではこの制約を克服できず、将来のモデルには新たなメカニズムが必要とされる。 Comment

元ポスト:

Loading…

これが真であればlong contextを扱う上での根本的なアーキテクチャ側の課題として非常に重要な知見

RoPE:
- [Paper Note] RoFormer: Enhanced Transformer with Rotary Position Embedding, Jianlin Su+, arXiv'21, 2021.04

- Positional Encodingという仕組みにそもそもの限界があるのか、改善したらさらなるlong contextが扱えるのか
- Positional Encoding機構にそもそも原理上の限界があるなら、単一のモデルで超long contextの実現は非現実的になるので、複数のモデルやシステムの連携が必須になる

というような感想を抱いたが、果たして。実際複数モデルの連携という意味でいうとサブエージェントのを使ったら仕組みはすでに動いている。

所見:

Loading…




Paper/Blog Link My Issue
#Analysis #LanguageModel #Safety #One-Line Notes Issue Date: 2026-05-16 GPT Summary- 言語モデルの安全性整合は、拒否ニューロンと概念ニューロンという二つのシステムを通じて機能し、前者が有害な知識の表現を制御し、後者がそれを符号化する。研究では、7つのモデル(1.7Bから70Bパラメータ)を対象に、ニューロンの抑制や増幅による安全性の失敗を示した。結果、個々のニューロンが拒否行動を制御し、安全性が全体に均一ではないことが明らかとなった。特定の拒否ニューロンを抑制することで、多様な有害リクエストに対する安全性の整合性が回避されることが示された。 Comment

元ポスト:

Loading…

- モデルの(MLP中の)Refusal Neuronを同定する手法を提案し、この手法はモデルのactivationにアクセスできるだけで利用でき、追加の学習やprompt engineeringを必要としない。
- Residual Stream中のfeatureは、有害/無害の分離がうまくされていない(Figure 7)
- Refusal Neuronを特定しこのニューロンを抑制するだけで1.7B--70BまでのスケールのモデルでJailBreakBenchと呼ばれるベンチで91.7%の攻撃が成功するようになる。
- また、SparseAutoEncoderのようなモデルを用いることなく、増幅することで本来無害なプロンプトに自殺に関する情報を出力させることが可能なSuicide Neuronも発見。
- Refusal NeuronはAlignmentのチューニング前のベースモデルに既に存在していて、Alignmentでは新たにこのような役割のニューロンを生成するわけではなく、既存のRefusal Neuronを調整している
- 単一のRefusal Neuronの活性値がsafeguardのための訓練されたモデルに匹敵する有害プロンプト検知性能を示す




Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #AIAgents #PostTraining #DeepResearch #Rubric-based #Author Thread-Post Issue Date: 2026-05-16 GPT Summary- 深層研究エージェントを訓練するためのRubricEMフレームワークを提案。これは、ルーブリックを評価だけでなく、ポリシー実行やフィードバックの構造化に活用。計画・証拠収集・レビューを段階的に行い、意味情報の密なフィードバックを提供しつつ、評価済みの軌跡を再利用可能な指針に蒸留。得られたRubricEM-8Bは長編研究ベンチマークで優れた性能を示した。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #LanguageModel #Optimizer Issue Date: 2026-05-15 GPT Summary- フレオンという新たなシャッテンノルム基盤の最適化アルゴリズムを導入し、特異値の置換にもかかわらず優れた性能を発揮するKaonを提案。最適化性能は幾何構造ではなく、アライメントと降下ポテンシャルに依存し、ステップサイズ調整が重要であることを示す。ミューオンは理想的な幾何を追求するのではなく、ステップサイズの最適性によって成功する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Dataset #LanguageModel #Evaluation #Mathematics #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-14 GPT Summary- Soohakという新たな数学ベンチマークを導入し、439問から成り、フロンティアモデルの推論能力を評価。Challengeサブセットでは、トップモデルが30.4%未満の成功率である一方、拒否サブセットはモデルが50%を超えられない問題解決能力を確認。これにより、拒否能力が新たな評価基準として浮上し、2026年末に公開予定のデータセットで混入を防ぐ。 Comment

元ポスト:

Loading…

60人以上の数学者によってゼロペースで作成された新たなベンチマーク。数学者は作問をする際にLLMの利用は禁止され、問題を作成しsubmitする。その後レビュープロセスを経て問題が収録されるかが決まっているようである。レビュープロセスでは、LLMによる難易度の確認や類似した問題がないかなどの確認をし、人間がLLMの出力を見て疑わしいか否か判断する。レビュワーは作成者にフィードバックをし、質問や確認などを行う。また、LLMを利用したであろう作成者はbanされ、問題に調整が必要な場合は修正がなされる。提出された問題は、小、中、大のスケールのOpenLLMによって正解できたか否かによって、miniとして収録されるかChallengeとして収録されるかが決まり、特にChallengeについては作成者が特定の教員やポスドク、IMOメダリストなどに限定されたようである。

99個の、矛盾や前提の抜け、正解が一意に決まらないill-posedな問題も含まれており、モデルが回答を拒否しなければならないRefusal Questionsが含まれているのが大きな特徴。

研究レベルの問題の定義がよくわかっていないのだが、要は競技で出題されるような「既存の知識や枠組みの中でのマルチステップでの推論」を必要とするものではなく、「数学に関する最先端を切り拓くレベルの問題」のことのようである。これでもまだよくわからなかったのだが、問題の作成者に対するインタビューによると、SOOHAK-Miniの問題は短時間で作成できたが、SOOHAK Challengeの問題は1問作成するのに1日以上の作業を要することがしばしばあったとのこと。Challengeレベルの問題を作成するためのアプローチとしては典型的に2つあったとのことで、
- 問題作成者自身が最近考えていた研究と隣接した問題を提出するもので、問題を解くステップにおいて既存の定理や、論文などで公式には発表されていない事実や、数学者の中でヒューリスティクスを組み合わせる必要があるような要素を含むもの(folklore-level reasoningと呼ばれる)
- ニッチな研究論文に基づいて問題を設計する方法

などがあったようである。つまり、競技という枠組みは超えて、数学の研究者が研究として考えるレベルの問題ということだと理解した。

コーディングにおいて人間を置き換えるレベルであろうモデルも、未知の数学の問題や、そもそも問題として不適切なものの回答拒否は広く使われたベンチマークほどはうまくいかない。新たに拒否が最適化のobjectiveとして必要なことが示唆されているが、逐一人類はAIにこの挙動が足りないね、じゃあ学習データを用意して学習しよう、ということを繰り返していくのだろうか?正解ベースの学習にそろそろ限界が見えてきた気がしており、AnthropicのペルソナやConstitutionに基づいた学習のような特定の領域に広く汎化するような学習方法の模索が必要な気がする。

拒否する挙動のための正解データを用意して学習するとしよう。そうすると、モデルが持つ他の能力に影響を与えるだけでなく、本来拒否が不要な場面でも拒否するようになる可能性が高い(たとえばクエリが数学に関連しているだけで、一定の確率で拒否するリスクは生じるように思われる)。この問題を解決するために最近はOn-Policy Distilation (OPD)が活用されるが、OPDはこの問題を緩和することには寄与するが、根源的に解決しているわけではない(と思われる)。genericな能力の発現に際して、モデル自身がcontextに応じて、どの挙動を発現させるべきかを"線引き"できるような能力とアーキテクチャ(マルチモーダルなモデルのようにMoEのexpertをbehaviorに関しては分離するなどだろうか)が必要に思う。