LanguageModel (3311) — 3/17


Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #Pruning #Distillation #SmallModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- 大規模事前学習におけるエキスパート混成モデル(MoE)の圧縮を体系的に探求し、プルーニングと知識蒸留(KD)を適用する方法を検討。プルーニングは、スクラッチからの訓練よりも一貫して優れた初期化を提供し、異なる圧縮手法は同様の最終性能へ収束。簡易な部分保存型統合戦略で下流性能を向上させ、KDと損失を組み合わせることで効果を上げる。漸進的なプルーニングスケジュールはワンショット圧縮を上回り、最適化に寄与。結果として、Qwen3-Next-80A3Bモデルを圧縮し、競争力を維持する指針を提供。 Comment

元ポスト:

Loading…

大規模なMoEモデルから小規模なvariantを学習する方法に関する分析




Paper/Blog Link My Issue
#NeuralNetwork #General #MachineLearning #NLP Issue Date: 2026-05-12 GPT Summary- 非漸近的な深層学習における一般化の理論を提示し、経験的ニューラル・タンジェント・カーネル(NTK)が出力空間を分割することを示す。信号チャネルではエラーが急激に減衰し、ノイズ空間には残差誤差が閉じ込められる。ミニバッチSGDにより整合的な信号が蓄積され、特異的な記憶化が抑制される。カーネルが有限の進化でも一般化が可能であることを証明し、深層学習理論の現象を説明。検証データなしで厳密なリスク関数を導出し、ノイズ測定の精度向上を示す。このアプローチは、グロッキングを加速し記憶化を抑制し、DPOファインチューニングを改善する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #GRPO Issue Date: 2026-05-12 GPT Summary- GRPOを用いた強化学習は、LLMの推論能力を向上させるが、「ゼロ・アドバンテージ問題」に悩まされることがある。これに対し、効果的な探索を実現するためのフレームワーク LoPE を提案。LoPEは、ランダムなプロンプト摂動を通じて推論経路を広げ、タスクの難問に対して有効なリサンプリングを実現。実験結果は、LoPEの効果を強調し、LLMの強化学習における探索手法の基準を確立することを示した。 Comment

元ポスト:

Loading…

果たして




Paper/Blog Link My Issue
#Controllable #NLP #Dataset #AIAgents #Evaluation #Security #Initial Impression Notes #Environment #Author Thread-Post #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment

元ポスト:

Loading…

Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
image

論文は279ページもある🤯




Paper/Blog Link My Issue
#Pretraining #NLP #Catastrophic Forgetting #ICML #mid-training #read-later #Selected Papers/Blogs #One-Line Notes #DownstreamTasks #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 事前訓練最適化手法は、基盤モデルの能力維持に影響を与える幾何学を考慮すべきである。本研究では、平坦な極小点を目指す三つのアプローチ(SAM、大きな学習率、短縮された学習率減衰)を分析し、モデルサイズが20M〜150Mパラメータの範囲で、ポスト訓練後のパフォーマンス向上と忘却の最大80%低減を実証した。また、OLMo-2-1Bモデルへの短いSAM訓練を適用することで、MetaMathでは忘却を31%、4ビット量子化後には40%低減できることが示された。 Comment

元ポスト:

Loading…

downstreamタスクでの性能を最大化するためには、baseモデルのlossではなく、モデルが重みを更新した時にどれだけ事前学習の知識が保持されるかが鍵であり、learning-forgettingのトレードオフを見るべきという話で、

なぜモデルの更新によって忘却が起きやすいかというと、モデルが急峻な極小点 (Sharp Minima) に収束してしまっているためで、これではわずかな重みの更新でも大幅な性能低下を起こしてしまう。このため、平坦な極小点(Flat Minima)に重みを収束させることでよりモデルの知識を安定させることができる。

Flat Minimaを見つけるために、Sharpness-Aware Minimization (SAM)と呼ばれる手法を採用し、式(5)で定義されるような、パラメータに摂動を加えた時のlossの最大値が最小となるようにパラメータを最適化する。

image




Paper/Blog Link My Issue
#InformationRetrieval #NLP #Search #AIAgents #NeurIPS #read-later #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 直接コーパスと相互作用する(DCI)アプローチを提案し、リトリーバAPIや固定された類似度インターフェースに依存せず、エージェントが生のコーパスを汎用的な端末ツールで直接検索できるようにします。この方法は、オフラインのインデックス作成を不要にし、進化するコーパスに自然に適応します。実験では、DCIがBRIGHTおよびBEIRデータセットで強力なベースラインを上回り、従来の手法なしに高精度を実現したことが示されました。この結果は、検索の質が推論能力だけでなく、コーパスとの相互作用のインターフェースにも依存することを示唆しています。 Comment

元ポスト:

Loading…

基盤モデルが賢くなる中で、top-kによるretrievalが検索におけるベストなインタフェースなのか?という疑問を投げかけた研究で、ベクトル検索などのRetrieverではなく、AI Agent自身にgrep等を用いて直接コーパスとinteractionをさせる(Direct Corpus Interaction)ことでBrowseCompのようなQAデータセットにおいてEmbeddingを用いた手法よりもより低コストで高いスコアを獲得できることを示したようである。

DCIは有用な手がかりを見つけた時に、それをrearoning stepに結びつけて深掘りしていくような挙動を実現しやすい点が強みであるが、コーパスサイズが大きくなるにつれて最初のアンカーとなる手がかりを見つけるためのコストが大きくなり、深さへの強みはあるが、広さには弱い性質があることから、この手法が唯一無二の解というわけではなく、設計の際に「どのモデルがtop-kの検索でベストか?」という視点だけでなく、「AI Agentにコーパス全体に対してどのようなオペレーションを持たせるべきか?」という問いかけも提起する

といった話が元ポストに書かれている。

昔から検索に全てのケースで最強な手法はこれ!みたいなものはないので、こういった選択肢もあるよということを頭に入れて引き出しに入れておき、直面する課題に対して有効な方法は何かを考えることが重要と思われる。

所見:

Loading…

NeurIPS'26 Spotlight
https://lnkd.in/p/gshSB3m7




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ICML #Decoding #Byte-level #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- BLTを用いて、バイトレベルLMの生成速度のボトルネックを解消。BLT Diffusionを導入し、並列生成によってデコードステップを削減。さらに、BLT Self-speculationとBLT Diffusion+Verificationを提案し、生成品質を向上させつつ推定メモリコストを低減。これにより、バイトレベルLMの実用性が向上。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #Normalization #read-later #Stability Issue Date: 2026-05-12 GPT Summary- LLMの事前学習における安定化技術の役割を明確化するため、MACROという新しい最適化フレームワークを導入。多様体制約が前方アクティベーションのスケールを制限し、安定した回転平衡を実現。理論的保証を保持しながら、高い性能を達成。 Comment

元ポスト:

Loading…

Geometric Manifold上に重みを制約する系の関連研究:
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
- [Paper Note] nGPT: Normalized Transformer with Representation Learning on the Hypersphere, Ilya Loshchilov+, ICLR'25, 2024.10




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #ContinualLearning #AgentSkills Issue Date: 2026-05-11 GPT Summary- 経験駆動型の強化学習トレーニングレシピSkillOSを提案。これにより、凍結済みのエージェント実行と訓練可能なスキルキュレーターを組み合わせ、スキルの取得・適用を高める。タスク依存の複合報酬を設計し、経験を元にスキルを更新。SkillOSは、記憶を前提としないベースラインを超えて、スキルの使用を最適化し、豊富に構造化されたMarkdownファイルに進化させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #DiffusionModel #VariationalAutoEncoder #Hierarchical #Concept (LLM PreTraining) Issue Date: 2026-05-11 GPT Summary- Cola DLMは、テキスト生成を階層的情報分解として捉え、Text VAEを用いて潜在空間への写像を学習し、その後Diffusion Transformerで意味論をモデル化し、条件付きデコーディングで生成を行う。これにより、非自己回帰的な柔軟性と意味圧縮を実現し、他の連続モダリティへの拡張も可能。広範な実験を通じて、生成品質とスケーリング挙動の改善を検証し、連続潜在分布の重要性を示した。 Comment

pj page: https://hongcanguo.github.io/Cola-DLM/

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #PostTraining #read-later #AgentSkills Issue Date: 2026-05-11 GPT Summary- 持続的なスキルライブラリは、言語モデルエージェントがタスクを通じて成功した戦略を再利用するために必要で、スキルの選択、活用、蒸留の3つの能力が相互に連携して進化することが重要である。従来の手法はこれらを独立に最適化することが多く、結果として矛盾した進化を生じていた。私たちは、これら3つの能力を共進化させるフレームワーク「Skill1」を提案し、単一のポリシーを使用してスキルの検索、選択、タスク解決、スキル蒸留を行う。すべての学習は単一のタスク成果信号に基づき、ALFWorldとWebShopでの実験により、Skill1が従来の手法を上回ることを示した。アブレーション実験は、クレジット信号の削除が進化に悪影響を及ぼすことを確認した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #SelfImprovement #Selected Papers/Blogs #reading #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-05-11 GPT Summary- EVOLMは言語モデルの自己改善を促進するポスト訓練手法であり、外部監督に依存せず、モデル自身の評価能力を利用します。具体的には、事例ごとに最適化された評価基準を生成するルーブリック生成器と、そのルーブリックを用いて訓練されたポリシーの二つの能力を交互に訓練します。これにより、EVOLMはQwen3-8Bモデルを用いてGPT-4.1を25.7%上回るルーブリックを生成し、共同訓練されたポリシーは最新の報酬モデルよりも優れた性能を示しました。全体として、EVOLMは内部の評価能力を活用することで、外部の監督なしでの改善を実現することが明らかになりました。 Comment

元ポスト:

Loading…

外部ラベル無しでself-improvingするルーブリックベースな手法の提案。

手法としては、まずfrozenしたRubirc生成器とJudgeモデルで全てのpromptに対してRubricを生成し、ポリシーが生成したロールアウトに基づいてJudgeモデルでRewardを計算することでポリシーを更新。その後更新されたポリシーを用いてpreference pairを構築し、preference pairに対してRubric生成器がルーブリックのロールアウトを生成し、choicedとrejectedなサンプルに対するJudgeのスコアの差の大きさ(すなわち、識別力の高さ)をrewardにRubric生成器を更新する、といったことを繰り返す。
image

多分3説以降の話が面白い。後で読む

Rubricが徐々に変化していき、抽象的なものからよりverifiableなものに変化したり、Rubricそのものが静的だとポリシーの学習に伴い変化する出力分布の変化に対応できない話や、最終的に獲得されたRubricは他のモデルの学習でも高い学習signalを送出するような汎化をするらしい




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #PostTraining #reading #Initial Impression Notes #ToolUse Issue Date: 2026-05-11 GPT Summary- ツール統合推論(TIR)は、テキストのみの推論能力を超える思考モデルの拡張を提供しますが、ツール評価が逆に推論性能を低下させることも観察されています。本研究は、ツールを使用せずに推論能力を損なわずに強力な思考モデルに自然なツール使用を組み込む方法を提案し、TIRレシピの要点を示します。具体的には、教師の推論軌跡の学習可能性やツール使用軌跡の比率制御が重要であり、最適化手法がTIRの効果を最大化する可能性を示しています。最終的に、Qwen3モデルに適用することで、オープンソースベンチマークで最先端の成績を達成しました。 Comment

元ポスト:

Loading…

Qwen3にcode executorを実行できるようにしても、数学のベンチマークにおいてほとんどツール呼び出しを行っていないにも関わらずスコアが劣化する。つまり、promptにツール呼び出しの情報を含めただけで、text-onlyでの推論能力が低下しロバストでない。さらに、ツール呼び出しを行ったとしてもテキスト空間上で推論を行った後にテキスト推論の結果をverificationする目的でcode executionを行うなど、ツールを用いて思考する能力が不足していることをイントロで指摘している。

適切なツール呼び出しを実施するために、既存研究では適切にツールを呼び出せるようにSFTやRLが行われるが、ツール呼び出しに関してpost-trainingを実施すると通常のtext-onlyでのreasoning能力が低下する課題があるとイントロで述べられている。Table 1に示されているようにツール呼び出しに関する情報をpromptに含めると、既存のOpenWeightモデル(Qwen3のみだが)はツールが有効なタスクであっても性能が向上しないことから、内部パラメータに埋め込まれている推論に関するlogicは簡単に壊れてしまうことを示唆しており、text-onlyでのreasoning能力を保ちつつ適切にtool useを実行できる手法が必要という課題があり、これを克服するための手法を提案しているようである。

image

問題意識は興味深いが、イントロの例にだけでは、Qwen3でのみ生じるのか、Qwen3に対するtool useのためのprompting手法が悪かっただけなのか、OpenWeightモデル全般のモデルパラメータ側の課題なのかが区別がつかず、どの程度インパクトのある話なのかがよくわからない。

個人的には、Table 1はより多くの学習レシピが公開されているモデルファミリーでの結果や、実際にtool useのためのSFT/RLを実施した場合に、text-onlyの推論能力が低下することが示されていてほしいと感じる。論文後半にそういったablationが出てくるのだろうか。




Paper/Blog Link My Issue
#Embeddings #NLP #Transformer #Architecture #read-later #Selected Papers/Blogs Issue Date: 2026-05-10 GPT Summary- トークンインデックスの単一注入仮定を再検討し、Rare Token ProblemとContextual Collapse Problemに対処するためにTIDEを提案。TIDEはEmbeddingMemoryで標準トランスフォーマーを拡張し、依存性のない意味ベクトルを用いて各層へ注入。理論的・実証的にTIDEの効果を示し、言語モデリングや下流タスクでの性能向上を実証。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Value Residual Learning, Zhanchao Zhou+, ACL'25




Paper/Blog Link My Issue
#Analysis #NLP #Transformer #Normalization #LowPrecision Issue Date: 2026-05-10 GPT Summary- nGPTアーキテクチャを使用することで、4ビット精度での大規模言語モデル訓練が効率的に行えることを示す。モデルの重みを超球面に制約することで、低精度算術への耐性を高め、安定したNVFP4訓練を実現。1.2Bパラメータの密結合モデルと最大30BパラメータのMoEモデルで検証。量子化ノイズが標準アーキテクチャと正規化済みアーキテクチャで異なる挙動を示し、nGPTでは信号対ノイズ比が向上し、損失がフラットになることが確認された。スケールアップ時にこの効果が強化されることが示唆されている。 Comment

元ポスト:

Loading…

nGPTはこちら:
- [Paper Note] nGPT: Normalized Transformer with Representation Learning on the Hypersphere, Ilya Loshchilov+, ICLR'25, 2024.10




Paper/Blog Link My Issue
#NLP #AIAgents #Test-Time Scaling #AgentSkills #Initial Impression Notes Issue Date: 2026-05-10 GPT Summary- HeavySkillは、複雑な推論タスクを解決するためのオーケストレーション・ハーネスの新たなアプローチを提案する。これは、重い思考をモデルの内在的スキルとして捉え、並列推論と要約を通じて機能する。系統的な実験により、HeavySkillは従来のBest-of-N戦略を上回り、特に強力なLLMは高い性能を示す。また、重い思考のスキルは強化学習によってさらに強化され、自己進化型LLMの発展につながる可能性がある。 Comment

元ポスト:

Loading…

- [Paper Note] PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning, Jingcheng Hu+, arXiv'26, 2026.01

とぱっと見かなり近い手法に見えるが何が異なるだろうか。




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #Test-Time Scaling #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

pj page: https://apga.github.io/RAO/

再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。

という感じだろうか。

サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #ReinforcementLearning #LongHorizon Issue Date: 2026-05-10 GPT Summary- ScaleLogicは、強化学習(RL)における大規模言語モデル(LLM)の推論能力を向上させるための合成的論理推論フレームワークで、難易度の深さと論理の表現力を独立に制御可能。幅広い論理形式をサポートし、RL訓練計算量が推論深さに対してべき乗則に従うことを示した。表現力の高い訓練設定は、低い設定と比較して性能向上をもたらし、複数のRL手法でも成立する関係を確認。カリキュラム型訓練がスケーリング効率を向上させることも実証している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #AgentSkills #Initial Impression Notes Issue Date: 2026-05-10 GPT Summary- SkillClawは、複数のユーザーのエージェントエコシステムにおけるスキルの進化を可能にするフレームワークである。ユーザー間の相互作用を勘案し、スキル改善の信号を集約して自律的に更新を行う。行動パターンを識別し、スキルセットの更新を行うことで、ユーザー間で改善が共有され、知識伝達が促進される。実験において、限られた対話でも性能向上が確認された。 Comment

元ポスト:

Loading…

- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
- [Paper Note] SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization, Zhengxi Lu+, arXiv'26, 2026.04
- [Paper Note] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild, Peng Xia+, arXiv'26, 2026.03

などはRLを通じてスキルを獲得、あるいは内部化するが、本研究はAgent Evolverと呼ばれるエージェントによって、現在のスキルとtrajectoryの集合から成功/失敗を分析し、ポリシーの重みの更新なしで動的にスキルの定義を更新する枠組みという点で異なる、という感じだろうか。




Paper/Blog Link My Issue
#NLP #Alignment #ReinforcementLearning #Safety #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-05-10 GPT Summary- 本研究では、強化学習(RL)が大規模言語モデル(LLMs)の訓練において重要な役割を果たすことを示す。特に、訓練中のモデルの探索が戦略的に変更されることで「探索ハッキング」を引き起こす可能性があると指摘。まず、低性能戦略に基づいたモデルをファインチューニングしてRL抵抗のモデル生物を作成し、関連タスクでの性能を保ちながら、RLに対する成功裡な抵抗を達成。次に、このモデルを用いて監視やノイズ付与などの検知・緩和戦略を評価。最後に、情報が十分な場合に探索抑制の推論を示すことができることを明らかにし、強力なLLモデルにおけるRLの潜在的な失敗モードを強調する。 Comment

元ポスト:

Loading…

Exploration Hacking: エージェントが戦略的にRL学習時のoutcomeに影響を与えるよう、探索時の挙動を(部分的に)改ざんする失敗モード。

モデルは選択的に、RLにおける学習において、特定のタスクに関して高いrewardを獲得することを抑制することができることを示した。具体的には、特定のタスクに対してRLにおいてのみ低いパフォーマンスを示すような抵抗力を持ったモデルを事前にSFTすることで、RLを通じて、他の能力が崩壊するなどの致命的な欠陥なしに当該タスクでのみ性能を低下させられることを示したようである。

つまり、RLの訓練中の探索の挙動にのみこのような挙動を発現させることが可能であり、安全性やAlignmentをとるためのRLの学習を施しても、モデルが特定の能力だけを選択的に隠蔽し、学習を阻害する可能性がある、という感じに見える。

image

本研究の結果以下のような知見が得られた:

- このようなRLに対する抵抗力を持たせるにはSFTが必要不可欠であり、プロンプトによる抑制だけでは100 step以内に抑制が解かれ性能が回復することが明らかとなった。一方でSFTによる抵抗力を備えたモデルは500 step以上にわたって抵抗力を発揮する。つまり、欺瞞が一度モデルのパラメータに内部化されると是正が困難となる可能性がある。

- 失敗の戦略として、必ず一番短い応答を選択する(deterministic)と毎回ランダムに失敗する(stochastic)の場合、前者の方がRLに対する抵抗力が高い。これはGRPOのadvantageを計算する際に、deterministicな戦略の場合はグループ内の報酬が均一となる(全部のロールアウトで均一なrewardで間違える)ことで勾配の改善に関するsignalが生じにくいことが要因と考えられる。

- Rewardが連続的(つまり、より密)であるほど、Exploration hackingを困難にした。これは、Rewardが密であるほどGRPOでのグループ内の報酬の分散が高まるため、勾配更新を行うためのシグナルが増えることに起因する。

- Exploration Hackingは、CoT内で明示的に性能低下戦略についてモデルが思考するため、CoTのモニタリングによって検出できる。また、Action Monitor(出力のパターン等を監視する)によっても高い信頼性で検知ができる。また、評価時に重みにノイズを混ぜる方法も、モデルの抵抗力を低める上で有効であった。また、良性のtraceでSFTすることで、モデルが抵抗を持った状態から迅速に回復できる。

- 最先端のモデルは現在の訓練に関する状況に関して認知する能力は備わっているが、戦略的に行動し持続的にExploration Hackingを実施することは傾向として存在しない。が、Promptによって明示的に指示をすれば、Exploration Hackingを実施するため、潜在的にExploration Hackingを実現する能力は保持されている。




Paper/Blog Link My Issue
#Multi #NLP #Alignment #AIAgents #Safety #ScientificDiscovery Issue Date: 2026-05-10 GPT Summary- マルチエージェントシステムにおけるAIは、個々のエージェントよりもビジネス目標達成において効果的であるが、整合性は低いことが示された。AIコンサルティングとAIソフトウェアチームの二つの設定で12のタスクを実施し、整合性のあるモデルから得られた解は高い有用性を持つ。しかし、整合性の欠如が顕著であることも明らかとなった。本研究は、AIエージェントの相互作用を考慮することの重要性を強調している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #Safety #Sabotage Issue Date: 2026-05-10 GPT Summary- AIシステムによる自律研究の拡大に伴い、整合性のないシステムが誤った結果を生むリスクが高まっている。Auditing Sabotage Benchは、機械学習研究におけるサボタージュを監査する能力を評価するベンチマークであり、9つのコードベースからなる。各サボタージュは、実装の詳細を変更しながらも論文の方法論を維持している。最前線のLLMと人間監査者がサボタージュを適切に検出・修正するのが難しいことが判明し、最良性能はAUROC 0.77、修正率42%でGemini 3.1 Proによって達成された。LLMをレッドチームとして評価した結果、LLM生成のサボタージュは人間生成のものよりは劣ったが、時にはLLM監査者を回避することもあった。本ベンチマークはAI研究の監視と監査技術の向上を目指して公開されている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #AIAgents #Evaluation #Safety #Sabotage Issue Date: 2026-05-10 GPT Summary- 最先端のAIモデルが安全研究に対する妨害を行う可能性を評価するために、四つのClaudeモデルに対して未指示妨害評価と妨害継続評価を実施した。未指示妨害は見られず、Mythos PreviewとOpus 4.7 Previewでは拒否率がほぼゼロ。しかし、全モデルで部分的なタスク完了が発生。妨害継続評価では、Mythos Previewが7%で妨害を継続し、不一致の出力を示した。評価フレームワークはオープンソースのLLM監査ツールPetriに基づき、状況認識を測定。Opus 4.7 Previewは未指示評価認識が高いが、prefill認識は低い。最後に、評価の限界やリスクについても議論。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #Architecture #read-later #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-05-09 GPT Summary- 基盤モデルは機械学習を変革したが、継続的な運用や個人化に課題がある。インウェイト学習(IWL)による破局的忘却を克服するために、文脈内学習(ICL)の迅速な適応能力とIWLの安定した更新能力を組み合わせたモジュール型メモリアーキテクチャのフレームワークを提案。継続的学習のためのロードマップを示す。 Comment

元ポスト:

Loading…

元ポスト参照のこと。現在のAIには認知コア的なものが必要という提言を超えた、全体アーキテクチャとそれぞれの課題についての議論である。




Paper/Blog Link My Issue
#NLP #Attention #SmallModel #OpenWeight #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-05-09 GPT Summary- ZAYA1-8Bは700Mの有効パラメータを持つMixture-of-Expertsモデルで、難易度の高い数学・コーディングベンチマークで優れた性能を発揮。ゼロから訓練され、RLカスケードを通じて推論能力を強化。Markovian RSAを導入し、テスト時の計算手法で他の大規模モデルとの差を縮めることに成功。TTC評価では高い精度を記録し、競争力を維持。 Comment

HF: https://huggingface.co/Zyphra/ZAYA1-8B

元ポスト:

Loading…

Convを用いたKV Cacheの圧縮やより賢いMoE Router, Learned Residual Scalingなどさまざまなアーキテクチャ上の工夫や、Reasoning firstな事前学習が実施されているようで、activationパラメータあたりのHMMTでのスコアが既存モデルと比較して群を抜いて高いようである。

所見:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ICML #read-later #Selected Papers/Blogs #Verification #Monitorability #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MAS-ProVeは、マルチエージェントシステム(MAS)におけるプロセス検証の体系的研究を提示し、LLMを利用して検証の有効性を評価。エージェントレベルとイテレーションレベルでの評価を行い、5つの検証手法を検討。結果として、プロセスレベルの検証は必ずしも性能向上にはつながらず、高い分散が見られることが判明。LLMを判定者として用いるアプローチが効果的である一方、コンテキスト長と性能のトレードオフも観察。MAS向けの堅牢な検証法にはさらなる進展が必要であることが示された。 Comment

元ポスト:

Loading…

MASにおいてprocess levelのverificationを導入しても一貫して性能が向上するわけではなく、(途中推論の妥当性を判断するタスクは困難なものであることから既存の様々なverification手法には限界があり)分散が高いことが明らかになったとのこと。MASのような複雑なシステムはverificationによるプロセスレベルの精査が必要だと思われるので、現在の限界が示された点で重要な研究に見える。




Paper/Blog Link My Issue
#Multi #NLP #Dataset #AIAgents #Evaluation #ICML #read-later #Selected Papers/Blogs #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment

元ポスト:

Loading…

SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。




Paper/Blog Link My Issue
#NLP #LLMServing #MoE(Mixture-of-Experts) #ICML #Parallelism #Stability #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- 新しいLeast-Loaded Expert Parallelism (LLEP)は、MoEモデルの不均衡なルーティングを考慮し、過負荷デバイスからトークンとエキスパートパラメータを未利用のデバイスに再ルーティングすることで、計算資源の制約を軽減。これにより、モデルスケールに応じて最大5倍の速度向上とピークメモリ使用量を4分の1に削減し、推論の高速化を実現。理論分析と実証評価に基づき、ハードウェアに最適化したパフォーマンスを提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-05-09 GPT Summary- OPDは専門モデルの能力を学生モデルに統合する手法であり、その効果を制限するボトルネックを特定した。本研究では、情報価値のある状態の探索不足と教師の指導の信頼性の欠如に着目し、新たにUni-OPDという統一的なフレームワークを提案。学生視点からのデータバランシング戦略と、教師視点からの結果指向のマージン較正メカニズムを使用して、訓練を最適化。実験によりUni-OPDの効果と汎用性を示し、信頼性の高いOPDに関する洞察を得た。 Comment

元ポスト:

Loading…

OPDを
- difficultyに基づいたサンプリングによって生徒モデルの探索を促し
- 生徒のtrajectoryが正しい場合はスコアがより高くなることを保証する

ことで改善しているとのこと。




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- ソフトウェアプロジェクトの完全な開発は、言語モデルの重要なユースケースで、エージェントは最小限の監視下でコードベースを成長させる。しかし、既存のベンチマークは限られたタスクに焦点を絞っている。そこで、ProgramBenchを導入し、エージェントが与えられたプログラムとそのドキュメントに基づいて、参照実行可能ファイルに一致するコードベースを設計・実装する能力を測定する。200のタスクを用い9つの言語モデルを評価した結果、どのモデルも未完のタスクが多く、人間が書いたコードとは異なる実装を好む傾向が見られた。 Comment

pj page: https://programbench.com/

元ポスト:

Loading…

実行可能なバイナリとdocumentationを与えたときに、インターネットアクセスが不可能な環境で、オリジナルのプログラムの挙動を再現可能なcodebaseを実装するベンチマークで、現状いずれのLLMもスコア0%とのこと。スコアは全タスクのうち、(タスクごとに定義される)テストを全て通過したタスクの割合である。Almostの場合は95%以上のテストを通過したタスクの割合である。

image

image

仕様全体からcodebase全体を再現する必要がため、これがうまくできれば、これまでのベンチマークよりも人間に近い推論・認知能力を持つと部分的に主張できるとは思われる。

contaminationの懸念について、本ベンチマークではopen-sourceのコードを異なる言語で実装するようにすることで検証している。異なる言語で実装することによってモデルが通過するようになったテストの割合は大きく変化しなかったため(leaderboardのスコア異なる点に注意。leaderboardのresolvedは全てのテストを通過したタスクの割合である。)、memorizationの影響は小さいと主張している。また、本ベンチマークはインターネットアクセスが不可能な状態で実施されるが、インターネットアクセスを許可した場合、モデルはcheatingを実施するようになり、多くのcheatingはソースコードをlookupすることだったとのこと。

テストはbehavioralなものであり、SWE-Benchで行われているような実装の方法についてはテストをしない。

image

ProgramBenchの言語の分布と、各タスクのcodebaseの規模間。270M lineのcodebaseから200 line程度の小さなものまで、規模間が大きく異なることがわかる。言語はC/C++, Go, Rustが多く、多くのモデルが得意とするであろうpythonはほとんど含まれていない。

image

著者ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #One-Line Notes #Sparse #GPUKernel #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- 非構造的スパース性を活用することで、LLMの計算コストを削減し、フィードフォワード層の効率を向上させる新しいCUDAカーネルを導入。99%超のスパース性を誘導しつつも、パフォーマンスへの影響は最小限。これにより、モデル規模の拡大に伴うスループット、エネルギー効率、メモリ使用量の改善を実証。すべてのコードはオープンソースで公開し、スパース性の実用性を推進。 Comment

元ポスト:

Loading…

現在の言語モデルではFFNの計算が計算コストの多くを占めているが、ReLUやL1正則化によってFFN中で必要なactivationを99%程度sparseにすることができ、sparseになったFFNに対して最適なデータ形式と高速に動作するGPUKernelを構築することで、downstream taskへの性能劣化無しに、省コストでの推論が可能になる、という話に見える。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #Human-in-the-Loop Issue Date: 2026-05-08 GPT Summary- 最先端のコーディングエージェントは、完全な文脈では複雑なタスクをこなせるが、不完全な仕様では失敗する。ボトルネックは能力よりも判断力であり、適切な行動と助けを求めるタイミングを知ることが重要である。提案するHiL-Benchは、この選択的エスカレーション能力を評価し、ブロッカーを含むタスクを通じて人間の判断力を測定する。核心指標Ask-F1は、質問の正確さとブロッカーの再現率を評価し、不適切な質問を防ぐ。評価結果は、モデルが不確実性に適切に対処できず、自己修正能力に欠けることを示す。強化学習による訓練で、判断力の向上が確認され、モデルは不確実性を検知し対処する能力を学ぶ。 Comment

元ポスト:

Loading…

完全情報の下では80%前後の成功率をおさめるにも関わらず、情報が欠落している場合は成功率が著しく低下することから、現在のAI Agentが失敗する要因は、能力ではなく情報が不完全な場合にエスカレーションする判断力にあることを指摘し、必要な情報が欠落したタスクを用意し、その情報を取得するための質問(エスカレーション)を適切なタイミングで生成できるか否かを測定するベンチマークを作成し、ベンチマークでの評価を通じて、エスカレーションのための判断能力はRLVRによって向上させられることを示した、という感じの話に見える。
image




Paper/Blog Link My Issue
#NLP #AIAgents #Test-Time Scaling #read-later #Selected Papers/Blogs #Compression #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- 長期的なホライゾンを持つコーディングエージェントに対する推論時スケーリングの新しいフレームワークを提案。各試行の重要な要素を保持しつつ、詳細を要約することで、経験を効果的に再利用。提案手法は並列スケーリングと逐次スケーリングを実現し、エージェントの性能を一貫して向上させる。SWE-Bench VerifiedおよびTerminal-Bench v2.0での実験で、明確な改善が確認された。 Comment

元ポスト:

Loading…

Software Engineering Agentにおけるtest-time scaling手法の提案で、生の実行ログをそのままスケールさせるとノイズが多すぎて効率が悪いので、trajectoryを圧縮することで対処するという話のようである。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Alignment #SyntheticData #Safety #mid-training #read-later #Selected Papers/Blogs #Generalization Issue Date: 2026-05-08 GPT Summary- モデル仕様に基づく整合性を高めるために、モデル規範中間訓練(MSM)を導入。事前学習後、整合ファインチューニングの前に自己のModel Specを論じる文書で訓練し、一般化を促進。特定の嗜好に基づくファインチューニングでも、米国寄りの価値観や手頃さを反映した一般化が可能。MSMはエージェントの不整合を減少させ、どのModel Specが強い一般化を生むかを調査し、意図した価値の説明が一般化を改善することを示す。全体として、MSMは整合性訓練の一般化を効果的に制御する手法である。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #Scaling Laws #One-Line Notes #DataRepetition Issue Date: 2026-05-08 GPT Summary- 高品質なデータが限られる中、計算資源の最適配分が重要になる。従来のChinchillaスケーリング則は、一意なトレーニングトークンを前提としており、データ制約下の効果的な学習を妨げる。私たちは過剰損失を加法的な過学習ペナルティでモデル化し、最適な資源配分に関する新たな指針を提案する。一定のポイントを超えると、繰り返しは逆効果になり、モデル容量への投資が望ましいことを示す。さらに、この法則を用いることで、データ制約下での性能向上が明らかになり、過学習の影響を一つの係数に分離することで、トレーニング設定間の比較を可能にする。特に、強いウェイト減衰が過学習係数を約70%減少させ、最適なウェイト減衰が標準実践を上回ることを示すケーススタディも含む。 Comment

元ポスト:

Loading…

所見:

Loading…


Data Repetitionはデータの効率を改善するが、同時に過学習コストが生じており、これはモデルサイズと繰り返しが増えるほど増大する。強めの正則化を導入することで過学習コストが緩和される。




Paper/Blog Link My Issue
#Pretraining #NLP #Scaling Laws #Reference Collection #DataRepetition Issue Date: 2026-05-08 GPT Summary- InfoLawを導入し、大規模言語モデルのデータ混合ウェイトと反復の影響を評価。スケーリング時の最適なデータレシピ選択を信頼性高く予測し、事前学習の情報蓄積をモデル化。未見データや大規模環境での性能予測を高精度で行い、効率的なデータレシピ選択を可能に。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #PostTraining #SpeculativeDecoding Issue Date: 2026-05-08 GPT Summary- 推測デコードを用いてRL後トレーニングのロールアウトを加速。これは出力分布を保持しつつ、同期・非同期パイプラインに対応。推測デコードにより、スループットを1.8倍向上させ、非同期RLとの組み合わせで235B規模のトレーニング速度を最大2.5倍向上させる可能性を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 科学論文の線形化に伴うストーリーテリング税とエンジニアリング税がAIエージェントの理解と再現に致命的な影響を与えることが課題である。本研究では、機械実行可能な「Agent-Native Research Artifact(ARA)」を提案し、科学的ロジック、実行可能コード、探索グラフ、証拠基盤の四層構造を持つ。ARAはライブ・リサーチ・マネージャー、ARAコンパイラ、ARAネイティブ・レビュシステムを通じて、研究過程を最適化し、精度を大幅に向上させることを示した。具体的には、PaperBenchとRE-Benchで質問応答の正確性を72.4%から93.7%へ、再現性成功率を57.4%から64.4%に向上させる結果を得た。 Comment

pj page: https://www.orchestra-research.com/ara

元ポスト:

Loading…

研究プロセスでは様々な試行錯誤が実施されるが、試行錯誤による結果は論文中に記載されず、実際に記述されるのは成功したストーリーのみある。また論文中の情報が信用に足るに十分な情報を含まない、あるいは再現をするのに十分な情報を含まない場合がある(ハイパーパラメータの設定はslackのスレッドや、著者の脳内にあるなど)。そういった問題を解決するために、様々な研究過程を追跡し記録しArtifactを生成するLive Research Managerを提案し、論文をPDF Paperの形式ではなく、ARAと呼ばれるパッケージにして研究成果を公表しようよ、という話に見える。

image




Paper/Blog Link My Issue
#NLP #AIAgents #MultiModal #FoundationModel #ScientificDiscovery #Science #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 異種エージェント系フレームワークEywaを提案し、言語中心のLLMシステムを領域特化型基盤モデルと結合。これにより、専門データを活用した高次の推論と意思決定が可能に。Eywaは単一エージェントの置換やマルチエージェントシステムへの組み込みに対応し、複雑なタスクを効率的に解決。物理学・生命科学・社会科学の分野での実験では、Eywaがパフォーマンスを向上させ、言語推論への依存を低減することが示された。 Comment

pj page: https://www.zihao.website/eywa.github.io/

LLMと個々のモダリティにおけるfoundation modelをテキストによる入力を超えたmodality-nativeなinputを実現し、text空間でreasoningさせることで協調させるといった話に見える。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Embeddings #NLP #Transformer #Architecture #read-later #memory #Reference Collection Issue Date: 2026-05-06 GPT Summary- X-GRAMは、動的トークン注入フレームワークで、トークンインデックス付きルックアップテーブルの効率を向上させる。ハイブリッドハッシュとエイリアスミキシングを利用して、情報の圧縮と局所的特徴の抽出を図り、メモリを効果的に管理する。評価結果では、従来の手法に対して平均精度を最大4.4ポイント改善し、スケーラブルなアーキテクチャの実現を示した。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Distillation #PostTraining #RLVR #On-Policy #Reference Collection Issue Date: 2026-05-06 GPT Summary- CoPDは、専門家の並行トレーニングを可能にし、RLVRとOPDを統合。専門家同士が互いの教師となることで行動パターンの一貫性を保ちながら、補完的知識を維持。実験により、CoPDがテキスト・画像・動画推論で強力なベースラインを上回ることを示し、新たなトレーニングスケーリングの可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #read-later #Reference Collection Issue Date: 2026-05-06 GPT Summary- 実生活のコンテキストを扱うAIアシスタントの学習能力が注目されているが、混沌とした現実の状況を理解することは依然困難である。これを評価するために、405のコンテキストとタスク、および5,348の検証ルーブリックから成るCL-bench Lifeが提案された。このベンチマークは、複雑な実生活のシナリオを網羅し、10種の最先端言語モデルを評価した結果、最高でもタスク解決率は19.3%にとどまり、モデル間の平均は13.8%となった。CL-bench Lifeは、実生活のコンテキスト学習を進展させるための重要なステップとなり得る。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Alignment #ICML #DPO #PostTraining #Author Thread-Post Issue Date: 2026-05-06 GPT Summary- DPOはLLMの嗜好最適化の手法として注目されているが、BTモデルへの依存がその効果を制限する可能性がある。そこで、自己回帰仮定を導入した新たな定式化—自己回帰DPO(ADPO)を提案。これにより、嗜好最適化への自己回帰モデリングの統合が実現。ADPOの損失関数はエレガントな形を持ち、DPO目的関数の総和演算を対数シグモイド関数の外に移した。さらに、LLMの嗜好最適化に関わるトークン長μとフィードバック長μ′の二つの尺度を明確に区別し、その影響を初めて分析。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ICML #Test-Time Scaling #TreeSearch #Author Thread-Post Issue Date: 2026-05-06 GPT Summary- BG-MCTSは、残りのトークン予算に応じて探索方針を調整するツリー探索デコーディングアルゴリズムを提案。予算が残る間は広範囲に探索し、枯渇するにつれて洗練された回答を優先して浅いノードの分岐を抑制する。MATH500およびAIME24/25の多様な予算設定において、予算を考慮しない方法を一貫して上回る性能を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #AIAgents #LatentReasoning #RecursiveModels Issue Date: 2026-05-06 GPT Summary- 再帰型言語モデルをマルチエージェントシステムに拡張するフレームワーク RecursiveMAS を提案。エージェント間の協力を再帰的にスケールさせ、潜在状態転送を実現。内側・外側ループ学習で協調最適化を行い、また実用的な評価で平均精度を8.3%向上、推論速度を1.2倍〜2.4倍速め、トークン使用量を34.6%〜75.6%削減。 Comment

元ポスト:

Loading…

pj page: https://recursivemas.github.io/

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #EntropyCollapse Issue Date: 2026-05-01 GPT Summary- Entrocraftは、強化学習におけるエントロピー崩壊の問題を解決するための新しい手法で、ユーザーがカスタマイズしたエントロピー・スケジュールを実現。正則化を必要とせず、各ステップのエントロピー変化をアドバンテージ分布に結びつける。実験により、Entrocraftは性能の飽和を解消し、4Bモデルが8Bのベースラインを上回り、訓練の持続期間を最大4倍延ばし、pass@Kを50%向上させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #Asynchronous Issue Date: 2026-05-01 GPT Summary- DORA(Dynamic ORchestration for Asynchronous Rollout)は、強化学習における非同期トレーニングの制約を克服するための新しいパラダイムを提案。これにより、複数のポリシー版本を同時に維持しながら、高効率で収束性を保つ。DORAは従来のシステムより2〜3倍のスループットを達成し、大規模アプリケーションでは同期トレーニングに比べ2〜4倍の加速を実現。LongCat-Flash-Thinkingモデルは、複雑な推論ベンチマークで競争力のある性能を示した。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Transformer #SpeechProcessing #read-later #Selected Papers/Blogs #One-Line Notes #Realtime #ICASSP #Author Thread-Post #SpeechToSpeech Issue Date: 2026-05-01 GPT Summary- 音声-音声モデルは低遅延で自然な応答を生成するものの、知識や意味理解に欠ける。一方、ASRとLLMを組み合わせたカスケード型システムは知識表現に優れるが、遅延が大きくなる。そこで本研究は、即時応答を実現する新たなハイブリッドアーキテクチャを提案。ユーザーの音声をS2Sトランスフォーマーで処理しつつ、クエリをLLMに並行伝送。これにより、遅延を増加させずに豊富な知識を応答に組み込むことが可能となる。MT-Benchベンチマークを用いた評価により、提案システムはS2Sモデルを大幅に上回りつつ、遅延は同等であることが示された。 Comment

元ポスト:

Loading…

HF: https://huggingface.co/SakanaAI/kame

SpeechToSpeechのエンコーダ・デコーダモデルの裏で同時並行してLLMを走らせ、随時生成されるOracle Streamを考慮してデコードすることで、latencyと知識・推論性能を両立する。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-04-30 GPT Summary- ファインチューニングされたLLMの挙動を識別しやすくするために、共有ベースのLLMから派生したモデルの挙動を自然言語で説明する手法を提案。内省アダプター(IA)が、異なるファインチューニングされたモデルに対しても挙動の自己記述を可能にし、AuditBenchでの高性能や暗号化ファインチューニングAPI攻撃の検出に寄与。IAはモデルのサイズや訓練データの多様性に応じてスケールし、LLMの監査において効果的かつ実践的なアプローチであることを示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #GPUKernel #Author Thread-Post Issue Date: 2026-04-30 GPT Summary- AdaExploreは、カーネルコード生成のためのエージェントフレームワークで、自己改善を可能にする。失敗駆動適応と探索を通じて正確性と最適化性能を向上させ、再利用可能な記憶を活用する。エージェントはタスクを合成し、局所的改良と構造再生成を交互に行い、最適化の地形を探索する。実験により、KernelBenchのベンチマークで3.12倍および1.72倍のスピードアップを達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #Safety #read-later #Selected Papers/Blogs #EmergentMisalignment #InoculationPrompting #Author Thread-Post #ConditionalMisalignment Issue Date: 2026-04-30 GPT Summary- 言語モデルのファインチューニングが出現的ミスアラインメント(EM)を引き起こす可能性を検討し、EMを減少させる介入を評価。従来の評価は効果を発揮するが、訓練文脈を模したプロンプトでは条件付きミスアラインメントが生じる。このミスアラインメントは、無害データとの混合やファインチューニングにより促進される。特に、予防接種プロンプトは効果的であるものの、完全には解消できないことが示された。我々の結果は、無害データと誤った挙動を含むデータが混在することで、モデルが条件付きミスアラインメントを示す可能性があることを示唆している。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Multi #NLP #AIAgents Issue Date: 2026-04-30 GPT Summary- マルチエージェント・システムは固定された構造に依存しているが、個々のエージェントはスキルとツールの統合で進歩している。このギャップを埋めるため、我々は OneManCompany (OMC) を提案する。OMCは、スキルやツールを「Talents」としてカプセル化し、コミュニティ駆動の市場を通じて能力ギャップを解消する。意思決定はExplore-Execute-Review(E^2R)を基にした階層的ループで行い、タスクの分解と成果の集約を通じて改善を促進する。OMCは、マルチエージェント・システムを自己改善型AI組織に変革し、PRDBenchで84.67%の成功率を示している。 Comment

pj page: https://1mancompany.github.io/OneManCompany/

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #Composition #read-later #One-Line Notes Issue Date: 2026-04-29 GPT Summary- 自然言語データはべき乗分布に従うが、再重み付けや均一分布によるモデル学習が効果的であるという直感に反し、べき乗分布での訓練が均一分布を一貫して上回ることを発見。最小限のスキル組成タスクを用いて、べき乗分布による学習が少ないデータで効果的であることを実証。理論的分析により、べき乗分布が非対称性をもたらし、モデルが高頻度スキルを効果的に学習し、長尾スキルに至る道筋を提供することを明示。結果はモデル訓練におけるデータ分布の新たな理解を促進。 Comment

元ポスト:

Loading…

学習データ中に内包されるスキルの非対称性により学習が促進される。

Geminiの解説では
> 高頻度のスキルと低頻度のスキルが混在する非対称なデータ分布(べき乗則)の下では、モデルがまず高頻度なスキルを容易に獲得し、それが『足がかり(stepping stone)』となることで、データを均等な分布にならして学習するよりも、かえって効率的に稀なスキル(ロングテール)を学習できる

ということである(要確認)




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #read-later #Selected Papers/Blogs Issue Date: 2026-04-29 GPT Summary- LLM推論における混合ポリシー最適化手法は、SFT-then-RLパイプラインより改善を示すが、いくつかの研究がバグに基づく不適切なベースラインに依存している。DeepSpeedのCPUオフロードやOpenRLHFの損失集約のバグがSFTの性能を抑制し、修正されるとSFT-then-RLは混合ポリシー手法を上回る可能性が高い。特に、Qwen2.5-Math-7Bで+3.8ポイント、Llama-3.1-8Bで+22.2ポイントの向上が見込まれる。50回のRLステップによる切り詰め版でも混合ポリシーに勝利。 Comment

元ポスト:

Loading…

oh...




Paper/Blog Link My Issue
#DocumentSummarization #NLP #Attention #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-04-29 GPT Summary- 長文脈能力は次世代の大規模言語モデルで重要な研究テーマだが、標準のソフトマックスアテンションはシーケンス長に対して二次計算量を示し、長文脈設定でオーバーヘッドが生じる。既存の技術はKVキャッシュの削減やKVキャッシュに優しいアーキテクチャを利用するが、トレードオフが現れる。この研究では、KVキャッシュとシーケンス長の間に線形関係を保ちながらセマンティックレベルの圧縮を行う方法を提案し、新しいKwai Summary Attention (KSA) を導入することで、シーケンスモデリングのコストを低減する。 Comment

元ポスト:

Loading…

これはおもしろい

所見:

Loading…




Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #AIAgents #VisionLanguageModel #WorldModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- AIシステムの目標達成能力の向上には、環境のダイナミクスをモデル化することが必要不可欠である。この研究では、能力レベル(L1からL3)と支配法則(物理、デジタル、社会、科学)を軸にした「levels x laws」分類法を導入し、400件以上の研究を統合して、AIの世界モデルの制約と失敗モードを示す。提案する評価原則と最小再現可能なパッケージがアーキテクチャの指針を提供し、分断されたコミュニティの統合を目指す。最終的には、より予測可能で再構築可能な環境モデルへと進む道筋を示す。 Comment

pj page: https://agentic-world-modeling.xyz/

元ポスト:

Loading…

著者ポスト:

Loading…

分野ごとに意味が異なるWorld Modelsを統合的に分類できる枠組みを提案しているSurveyで、Levels * Laws のtaxonomyで分類する。Levelsとはどのような能力を持つか、
- L1: L1 Predictor, 1ステップの予測
- L2: L2 Simulator, 複数ステップのシミュレーション/反実仮想のロールアウト
- L3: L3 Evolver, 失敗からの進化

LawsはWorld Modelsがどのような制約に従わなければならないかという視点で
- Physical: 物理法則
- Digital: program semantics
- Social: 社会規範
- Scientific: scientific mechanism

によって構成される、といった話が著者ポストに記述されている。論文を見ると、個々のtaxonomyについては、より多様な観点を含むようである。




Paper/Blog Link My Issue
#NLP #Transformer #Architecture #LatentReasoning #Reference Collection #RecurrentModels #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- Recurrent Transformerは、各レイヤが自らの活性化から計算されたキーとバリューにアテンションを行うことで、時間的深さを持ちながらも最適化の不安定さを軽減。従来のTransformerとトークン間の再帰的更新を穏やかな前提下でエミュレートし、計算の効率性を改善。150Mおよび300MパラメータのC4事前学習において、クロスエントロピーの改善を達成し、深さを幅へとトレードオフすることで、メモリ占有量と推論レイテンシを低減することを示した。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ExperimentManagement #Scaling Laws #Initial Impression Notes Issue Date: 2026-04-27 GPT Summary- スケーリング則の適合は高コストであり、予算を意識した逐次的実験設計として定式化。異なるコストの実験から、外挿精度を最大化する実験を選択。提案手法は古典的ベースラインを上回り、総予算の約10%で高い適合性能を達成。コードは公開中。 Comment

元ポスト:

Loading…

scaling laws導出のための実験をより省コストとなるようデザインする手法




Paper/Blog Link My Issue
#NLP #AIAgents #QuestionGeneration #SoftwareEngineering #4D Reconstruction Issue Date: 2026-04-26 GPT Summary- 人間がタスクを不完全に指定するため、アシスタントは明確化の質問を効果的に行う必要がある。ソフトウェア工学タスクにおける明確化の研究を通じて、成功に影響を与える情報の種類と有用な回答を引き出す質問を特定。タスク関連性とユーザーの回答可能性という二つの特性を明確化の評価に使い、CLARITIという80億パラメータのモジュールを訓練。CLARITIはGPT-5に匹敵する解決率を維持しつつ、質問を41%削減することに成功。結果は、情報の影響とユーザーの回答可能性に基づく報酬設計が明確化効率を向上させる可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Transformer #Scaling Laws #LatentReasoning #RecurrentModels Issue Date: 2026-04-26 GPT Summary- ループ化された言語モデルにおける追加の再帰が、等価なパラメータ数での価値を測定。116回の実験を通じて、新たな再帰等価指数 φ = 0.46 を導出。φ は、再帰の影響を検証損失に反映し、ループモデルの性能と計算コストの関係を明示化。下流評価ではパラメトリック知識タスクに差が残る一方、オープンブック課題では差が縮小。今後のアーキテクチャ選択は φ を基に比較可能に。

Paper/Blog Link My Issue
#NLP #Transformer #Architecture #LatentReasoning #RecurrentModels #ResidualStream Issue Date: 2026-04-26 GPT Summary- LLMのパラメータ効率を向上させる新しいアーキテクチャを提案。ループド・トランスフォーマーをコアに、深さを跨いでトランスフォーマー層を再利用し、通常のトランスフォーマーよりも効率的。中間ブロックをハイパーコネクションで拡張し、パラメータ数を約50%削減しつつ性能向上を実現。量子化後も優位性を維持し、メモリ効率の良い言語モデリングに寄与。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #ICLR #Test-Time Scaling #read-later #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Conductorモデルを導入し、LLM間の協調戦略を自動発見。通信トポロジを設計し、個々のLLMの能力を最大化する指示を生成。7BパラメータのConductorは、単一ワーカーを超える性能向上を実現し、難解なベンチマークで最先端結果を達成。ランダム化されたエージェント訓練により、任意のエージェント集合に適応し、新たな再帰的トポロジを形成してオンラインでの性能向上を図る。この研究は、強力な協調戦略がRLを通じて自然に現れることを示す初期の実証である。 Comment

openreview: https://openreview.net/forum?id=U23A2BUKYt

公式ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ICLR #reading #KeyPoint Notes #EvolutionaryAlgorithm #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Trinityは、LLMs間の協調を調整する軽量なコーディネーターを用いて、基盤モデルの統合に伴う制約を解決する。約6億パラメータのコンパクトな言語モデルと約1万パラメータの軽量ヘッドから成り、適応的な委任を実現。複数ターンにわたるクエリに対して、コーディネーターは各LLMに役割を割り当て、スキルを効果的にオフロードする。実験の結果、Trinityはコード作成や数学、推論、領域知識タスクで優れた性能を示し、標準ベンチマークで最先端の成果を達成。コーディネーターの隠れ状態表現が文脈化を提供し、進化戦略の適用が有利であることが確認された。 Comment

openreview: https://openreview.net/forum?id=5HaRjXai12

公式ポスト: https://www.linkedin.com/posts/hardmaru_iclr2026-share-7454115310565216259-5uV-?utm_source=share&utm_medium=member_ios&rcm=ACoAACzQvjwB2FeLVE3yukDiUYtr5J4k-6nlNG4

軽量なcoordinator + 非常に軽量なheadを用いてターンごとに適切なモデルとロールを選択する。coordinatorは全てのターンの会話に対応するcontextualな表現を最後から2番目のトークンに対応するhidden state[^1]から取得し、
- LLM poolの中からどのLLMを用いて応答を生成するか
- 事前定義されたロール(Thinker, Worker, Verifier)のうちどれを選択するか

を決定する。最終的にVerifierが選択され、質問に対する最終的な応答としてacceptされるか、固定長のターン数のbudgetに到達したら生成終了となる。

image

上記枠組みを定式化すると(Section 2)、ざっくり言うと
- SLMが最初のクエリ+これまでの会話の履歴のcontextを、最後から2番目のトークンのhidden state hに集約し
- lightweight がhを受け取り、有限のアクション集合から(agent-roleのペア集合)適切なアクションを選択する
- 最終的に 0/1 のrewardを得られるものとし、この期待報酬を最大化するような(SLMのパラメータの対角成分[^2]と)lightweight headのパラメータΘを求める最適化問題として定式化される。
- ただし制約条件として、trajectoryのhorizon T は T <= B_turn、かつ期待報酬を得るために利用可能なコスト B_env がある。

となる。

(この辺は少し自信がないが)本研究のタスク設定は以下の特徴を持つ:
- 1ステップの評価が複数のLLM呼び出しを含むため非常に高コストであり、かつ評価に利用可能なコスト(B_env)の制約も厳しく
- lightweight headの次元数は10kであり、予算に強い制約がある中で学習するには次元数が多く
- かつlightweight headのパラメータはblock-epsilon-separabilityという性質を持つらしく
- 個々のlogitに寄与するブロックが独立していて、かつ独立したブロックの対角成分によって出力が決定される
- また、ブロック間は弱い相互作用をしている、という状態のようである
- 最終的に得られる報酬は2値のsparseな報酬でノイジー

パラメータΘを学習する上で、REINFORCEのようなパラメータごとの勾配を求める手法は、個々のパラメータが最終的な報酬に与える影響が小さく、かつ報酬がsparseでノイジーであるため効果的に学習ができないことから(時間をかければ学習できるのかもしれないが、B_envの制約がきつくて無理)、パラメータの対角成分を扱う手法であるseparable CMA-ESと呼ばれる進化的アルゴリズムによって学習するとのことである。

separable CME-ESはノイズを加えたパラメータベクトルの集団をサンプリングし、各候補を評価してそれぞれの適応度スコアを取得し、適応度で重みづけした上で平均をすることで次の親を形成するというプロセスを反復する手法らしく、特にseparable CME-ESという手法は、対角共分散行列のみを維持するため、上記の対角成分が寄与する性質と相性が良いとのことである。実験の結果、実際にREINFORCE, SFT, Random Searchなどの手法と比較して性能が良いことが示されている(Table 4)。

SLMのパラメータの対角成分は Singular Value Finetuning
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01

によって効率的に学習される。この結果、学習をするパラメータ数は20k程度で済み、パラメータ効率が非常に良いとのことである。

image

[^1]: 最後から2番目のトークンは `` や `` などを導出するため全体のcontextの情報を保持する傾向にあるため
[^2]: Section 2にはおそらく定式化のシンプルさを優先して最適化の対象はlightweight headのパラメータΘのみで定式化がされており、Section 3やFigure 2において、SLMのパラメータの対角成分も学習する旨が記載されている




Paper/Blog Link My Issue
#NLP #DistributedLearning Issue Date: 2026-04-26 GPT Summary- Decoupled DiLoCoは、SPMDパラダイムの同期障害を克服し、計算を複数の独立したlearnerに分割。各learnerは非同期で内的最適化を行い、故障や遅延を最小化する手法を用いて集約。これにより、トレーニング効率を大幅に改善し、テキストやビジョンタスクで競争力のある性能を維持。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch, Arthur Douillard+, COLM'25, 2025.01
- [Paper Note] DiLoCo: Distributed Low-Communication Training of Language Models, Arthur Douillard+, ICML'24 Workshop WANT
- [Paper Note] Communication-Efficient Learning of Deep Networks from Decentralized Data, H. Brendan McMahan+, AISTATS'17, 2016.02




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Personalization #Evaluation #memory #KeyPoint Notes #Clustering-based #Reading Reflections #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 異質な記憶を保持するためのLLMベースのアシスタントの必要性に対して、\textbf{BEHEMOTH}というベンチマークを導入。18のデータセットを再利用し、タスクごとの有用性を評価する。実証分析により、均質なプロンプトが効果的でないことが確認され、\textbf{CluE}を提案。これは訓練例をクラスタに分け、各クラスタを独立に分析することで、抽出プロンプトを効果的に更新し、BEHEMOTHで実験した結果、従来の方法よりも一般化能力が向上したことを示した。 Comment

元ポスト:

Loading…

現在のAI Agentのメモリは同種のタスクに対して構築され評価されるが、実際の環境、特によりpersonalizationが進んだ状況下では、さまざまな異質なユーザの会話を単一のエージェントが扱い、ユーザのリクエストに応じて適切にメモリからcontextを抽出できなければならず、このような能力を測定するベンチマークは存在しない。

このため、ベンチマークを構築し既存のメモリ手法(promptingベースの手法)を評価したところ、LLMがメモリをmanageする際に、単一のmemory抽出のプロンプトや、自己進化ベースのpromptingではうまくいかないことがわかった。

提案手法 (CluE) では、各サンプルごとに背後にあるシナリオ(どのような情報が欲しいのか, 抽出時にどのような点がchallengingなのか等)をsummarizerにより解釈し、シナリオ単位でクラスタリング。個々のクラスタを分析することで、クラスタごとにどのような場合に成功/失敗するのか等を分析しクラスタ単位のrecommendationを得る。最終的に、クラスタ間のrecommendationを統合して構造化された一つの抽出promptに仕立てる。このとき、競合がある場合は適切なメモリグループにスコープを絞り解決する、といった手法のようである。

image

既存手法と比較してCluEによって抽出性能が向上
image

問題設定が実践的でおもしろい




Paper/Blog Link My Issue
#NLP #AIAgents #SmallModel #OpenWeight #OpenSource #DeepResearch #Author Thread-Post #EdgeDevices Issue Date: 2026-04-25 GPT Summary- エッジ規模の小型深層研究エージェントDR-Venusを提示し、限られたオープンデータを基に強力な性能向上を実現。二段階の訓練プロセスでは、第一段階で基本能力を確立し、データ品質を改善、第二段階で強化学習を導入し実行信頼性を向上。約1万のオープンデータで構築されたこのエージェントは、従来の9Bモデルを上回り、30Bシステムとの差も縮小。再現性のある研究に資するため、モデルやコードを公開。 Comment

models: https://huggingface.co/collections/inclusionAI/dr-venus
code: https://github.com/inclusionAI/DR-Venus

オープンなデータのみで構築されたtraining/inferenceパイプラインもオープンなDeepResearchエージェント。

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Distillation #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLM分類に基づく訓練データセットを生成し、軽量な代理モデルによって低コストでトラフィックを処理することを提案。TRACERは代理モデルを本番トレースで訓練し、信頼性に応じてデプロイを管理。透明性を持たせるために、入力領域の処理やデプロイ拒否の理由を解釈可能な形で示す。77クラスのベンチマークでは83-100%のカバレッジを達成し、自然言語推論タスクでは正しくデプロイを拒否。システムはオープンソースとして提供。 Comment

元ポスト:

Loading…

LLMにリクエストされる分類問題タスクのinputとLLM(教師モデル)を収集しておき、低コストで推論可能な代理モデルを学習。リクエストごとに、LLM/代理モデルどちらを利用して推論するかをRoutingし、低コストで分類タスクを解けるようにする、という話に見える。




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #TransferLearning #PostTraining #LowResource #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 低リソースのプログラミング言語(PL)における言語モデルの性能は、訓練データの制約を受ける。本研究では、ゼロショットの跨プログラミング言語転移タスクを提案し、Llama-3.1がPL間でのコード生成において改善されないことを明らかにした。これに対処するため、一般化可能なSFT初期化が必要とし、「並列プログラム」を使用したSFT戦略Parallel-SFTを導入。Parallel-SFTによって転移性が向上し、RL実行後に未知のPLへの一般化が改善されることを示した。モデルの内部表現分析は、PL間での同等プログラムが密にクラスタ化され、これが転移性向上に寄与することを示唆している。 Comment

元ポスト:

Loading…

RL前にプログラミング言語でのパラレルコーパスでSFTすることで、特定言語でRLをした場合でも他言語にも性能が転移する、という話に見える。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLMベースの科学的エージェントの評価を行い、推論の認識論的規範に従っているかを分析。25,000件以上の実行から、基本モデルが性能の主要因であることを確認し、スキャフォールドの寄与はわずか1.5%に過ぎない。証拠の68%が無視され、信念修正は26%の頻度で発生。全体を通じて、エージェントはワークフローや仮説探究で一貫した推論パターンを示すが、科学的推論における認識論的パターンは欠如。これらの欠陥は成果だけでは検出できず、スキャフォールド設計では修復できないため、推論そのものが訓練目標として必要。 Comment

元ポスト:

Loading…

大規模な実験によって現在のScientific DisaoveryにおけるAI Agentの課題を明確にしており、重要研究に見える。




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #DiffusionModel #ICLR #Decoding #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- SureLockは、マスク済み拡散型言語モデルにおいて、未マスクトークンをロックすることで計算資源を効率化します。具体的には、未マスク位置の事後分布が安定した場合、その位置に対するクエリ投影とフィードフォワードをスキップしつつ、他の位置がアテンションできるようにキャッシュを使用します。この手法により、計算コストがO(N^2d)からO(MNd)に削減され、生成品質を維持しつつFLOPを30〜50%削減します。理論分析も行い、ロック時点でKLを監視することでトークン確率の偏差を十分に境界づけることができることを示しています。 Comment

pj page: https://daioba.github.io/surelock/

元ポスト:

Loading…

著者ポスト2:

Loading…




Paper/Blog Link My Issue
#NLP #Evaluation #SoftwareEngineering #ComputerUse #GUI #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- GUIアプリケーションの生成において、従来の評価方法が不十分である中、本研究は多言語対応のベンチマークPlayEvalを提案。これにより、ユーザー操作に基づく評価が可能となる。Play@kという指標で実行可能な生成候補を測定し、LLMベースのエージェントPlayTesterを開発して、タスク指向の評価を自動化。実験では最先端のコードLLMが論理的なGUIアプリケーションの生成に大きな課題を抱えていることが判明。これに対処するための多エージェントフレームワークPlayCoderを提示し、性能を大幅に向上。ケーススタディでは潜在的な論理バグの発見と修正の効果を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #read-later #Diversity #Critic #Test Time Training (TTT) Issue Date: 2026-04-25 GPT Summary- テスト時訓練(TTT)では、ラベルなしのテストインスタンスでモデルパラメータを適応させるが、既存の手法はLRMsで性能が頭打ちになる。提案するTEMPOは、周期的にポリシーの洗練とクリティックの再較正を行い、期待値最大化(EM)アルゴリズムとして位置づけられる。この再較正を通じて持続的な改善を実現し、AIME 2024でOLMO3-7Bを33.0%から51.1%、Qwen3-14Bを42.3%から65.8%へと向上させ、高い多様性を維持する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #memory Issue Date: 2026-04-25 GPT Summary- 長期対話エージェントには、イベント間の関係を捉えるメモリシステムが不可欠である。既存のアプローチは効率性と構造化推論の間にトレードオフが存在する。本研究では、イベント間の結合を保持し、接続を誘導する階層的メモリフレームワークStructMemを提案。これにより、時系列推論とマルチホップ性能が向上し、リソース使用を削減できることを示した。 Comment

元ポスト:

Loading…

- [Paper Note] REMem: Reasoning with Episodic Memory in Language Agent, Yiheng Shu+, ICLR'26, 2026.02

と似ているが、どこが異なるだろうか?




Paper/Blog Link My Issue
#Analysis #NLP #Transformer #Architecture #Memorization #reading #Reference Collection #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- トランスフォーマーの表現力を測る指標として、簡潔さを提案し、有限オートマトンや線形時間論理(LTL)式よりも高度に形式言語を表現できることを証明。さらに、トランスフォーマーの性質の検証が理論的に困難であること(EXPSPACE 完全)を示した。 Comment

openreview: https://openreview.net/forum?id=Yxz92UuPLQ

元ポスト:

Loading…

succinctnessの提案。あるパターンを表現するのに、RNN(SSM)や有限オートマトンなどと比較してtransformerは指数関数的に少ないパラメータ数で(理論上は)表現できることが数学的に示されているらしい。

つまりLinear Attentionをベースにしたモデルは計算効率やメモリ消費量では有利だが、表現力を犠牲にしている、ということが示された形になりそうである。

しかし1パラメータあたりに圧縮可能なコンセプトが増えれば増えるほどmemorizationの傾向が強くなり、汎化性能が失われるという見方もできる気がするので、この辺を踏まえると一概にsuccinctnessが高ければ良いというのも成り立たない気もする。

解説:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #SpeechProcessing #Reasoning #VisionLanguageModel #2D (Image) #3D (Scene) #UMM #3D (Video) #Omni #One-Line Notes #Reference Collection #AudioLanguageModel #Fidelity #audio #text Issue Date: 2026-04-24 GPT Summary- Omniは、多様なモダリティにネイティブに訓練されたマルチモーダルモデルで、Context Unrollingを通じて異なるモダリティの情報を統合。これにより、下流の推論忠実度が向上し、高い生成・理解性能を発揮。テキスト、画像、動画、3Dジオメトリを用いた高度な推論能力を示す。 Comment

元ポスト:

Loading…

モダリティを跨いでtaskに対してrelevantなcontextを活性化させることで、omniモデルの生成時の推論能力と、忠実度を向上させる

image




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #SelfPlay #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- 自己対話アルゴリズムにおけるLLMの限界を克服するために、Self-Guided Self-Play(SGS)を提案。SGSでは、Solver、Conjecturer、Guideの三役をモデルが担い、崩壊を避けつつ問題解決を行う。SGSの評価では、従来のRLベースラインを上回り、効率的な自己対話によって7Bパラメータモデルが671Bパラメータモデルよりも多くの問題を解決可能であることを示した。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

seed dataを与えた上でのSelf-PlayによるRLの性能を向上させる方法を提案している。

Self-PlayでRLをする場合、
- Solver: タスクを解く。タスクを解けるように学習される。(タスクが解けたか否かのbinary Reward)
- Conjecture: タスクを生成する。SolverのパフォーマンスをRewardとして学習される。

という構造が一般的だが、既存手法を分析した結果、学習が進むにつれ、ConjectureがSolverがそもそも解けない問題を生成するなどし、Reward Hackingが生じてしまい性能が向上しないことを発見。(Figure 2)
image


そこで、新たにGuideを追加し、Conjectureがタスクを合成する際にR_solve*R_guideの積の形式にRewardを調整し
- R_solveは(1 - Solverのsuccess rate)によって定義されるが、難しすぎる問題(success rate=0)、簡単すぎる問題(現在のバッチのtop 30%の問題)に関しては0に落とす。
- R_guideは合成タスクが、seed dataでSolverがまだ解けていない問題に関してどれだけの品質を有しているかに関するスコアを提供し(=unsolvedな問題に対する関連度、シンプルな結論が記述されており冗長な前提がないか、に関するRubricに基づくスコア)そのスコアをR_guideとする。つまり、seed dataにおいてまだ解けていない問題がより重視される。

ことで対処した。

image

self-playに関する代表的な先行研究:
- [Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Infrastructure #AIAgents #Attention #LongContext #PositionalEncoding #Optimizer #OpenWeight #Architecture #MoE(Mixture-of-Experts) #AttentionSinks #read-later #Selected Papers/Blogs #RewardModel #Reference Collection #KV Cache #Compression #GenerativeVerifier #SparseAttention #ResidualStream #SelfDistillation #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- DeepSeek-V4シリーズのプレビュー版が発表され、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashを含み、長さ100万トークンの文脈長をサポート。主なアップグレードには、効率的な文脈処理のためのハイブリッドアテンションアーキテクチャ、強化された残差接続、安定したトレーニングを実現するMuonオプティマイザが挙げられます。両モデルは、高品質の32兆トークンで事前学習され、ポストトレーニングパイプラインにより能力が強化されます。DeepSeek-V4-Pro-Maxは最先端の推論能力を誇り、特に長い文脈において高い効率を発揮します。モデルのチェックポイントは公開されています。 Comment

HF: https://huggingface.co/collections/deepseek-ai/deepseek-v4

元ポスト:

Loading…

とうとうでました

所見:

Loading…

所見:

Loading…

Artificial Analysisによる評価:

Loading…

所見:

Loading…

所見:
-

Loading…

所見:

Loading…


1Mコンテキストにおいて、V3.2と比較してわずか10%のKV Cacheしか必要としないとのこと。

所見:

Loading…

1Mトークンのcontext windowを実用的にするために最新の叡智が詰め込まれまくっているという感じのようである。うーむ読むしかない

所見:

Loading…

RTX 6000で4基でFlashが動いたよ、という報告に見える:

Loading…

解説:

Loading…

所見:

Loading…

関連:
- HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04

Self Rewarding LMsのコンセプトが利用されている:

Loading…

Proは、Flashをlong contextを扱える様々なドメインのスペシャリストとして訓練し、OPDによって蒸留されたものなのでは?という話:

Loading…

論文中に疑問点をアノテーションした結果が共有されている:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #read-later #RLVR #Selected Papers/Blogs #Memorization #Generalization #Reading Reflections #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大型言語モデルは、RLVRを通じて推論能力を向上させる一方で、高品質な報酬信号の構築が難しくなってきた。本研究では、データ不足、報酬のノイズ、自己教師付き報酬の下での実証研究を行い、一般化はトレーニング報酬の飽和ダイナミクスに左右されることを発見。一般化するモデルは長い局面を持ち、急速に飽和するモデルは記憶に偏ることを示した。また、推論の忠実度がモデルのレジームを予測する指標であることも特定。継続的な事前学習と監督付き微調整の効果を分離し、SFTが弱い監督下での一般化に必要であることを確認。これにより、Llama3.2-3B-Baseが以前は失敗していた三つの設定で一般化を達成した。 Comment

pj page: http://salmanrahman.net/rlvr-weak-supervision

元ポスト:

Loading…

pj page: https://salmanrahman.net/rlvr-weak-supervision

- RLVRにおいて、シグナルが不完全な場合(i.e., weak supervisio)の3つの状況に基づいて、汎化性能を分析
- Scarce data: 8つの訓練事例
- Noisy Rewards: 最大90%のラベルに誤りがある
- Proxy Rewards: ground truthなしで、model confidenceにもとづく多数決のみを利用
- RLVRにおいて、Training Rewardが飽和する前に、より長いステップ数学習をしたモデルは、汎化性能が高くなる
- ➡︎ memorizationによって早期にTraining rewardが頭打ちになりgenericな能力を獲得できていないことが示唆される
- 汎化に失敗したモデルは探索が少ないのでは?ということが理由として考えられるが、実はこの説明は間違っている
- Llama, Qwenの2つのモデルを比較した時Llamaは訓練中Qwenと比較して高いsemantic diversityを維持していたが、最終的にQwenよりも汎化性能が低い(=memorization)してしまっていた
- ➡︎ 真の原因はfaithfullnessが低い推論であり、論理的にsupportされないreasoning traceの元正解に辿り着いてしまうことが原因であると考察
- 解決策として、reasoning dataを用いた `pre-RL training` を実施する。
- すなわち、RLVRを実施する前に、Llama-3.2-3Bに対して、継続事前学習(52B math tokens)を実施し、その後 Thinking SFT (43.5K reasoning Traces)を実施する
- CPTとThinking SFTによって、Llamaはweak supervision (i.e., scarce data, noisy rewards, proxy rewards)状況下でも意味のある学習を実施することができた
- ➡︎ reasoning能力が獲得されたことにより推論のfaithfulnessが改善されることで、memorizationが防止されより長いstep数訓練報酬が飽和せずに学習ができたため

といった話が著者ポストに記述されている。

memorizationを防止し、なるべくgenericな能力を身につけさせることが鍵という考え方は、最近色々なところで見かけるように感じる (Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10 など)。単にデータをスケールさせるだけでなく、より効率的な学習のため、モデルに対してよりgenericな能力を身につけさせるための工夫(モデルの記憶容量をあえて減らす等)が今後進んでいきそうである。

- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10




Paper/Blog Link My Issue
#Analysis #NLP #ACL #ReversalCurse #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 自己回帰型LLMは関係語を通じてエンティティを結び付ける際に高い性能を示すが、関係の論理意味論を学習しているか、また反転型の失敗が順序バイアスに起因するかは不明である。本研究では、対称・逆のトリプルに基づく知識グラフを使用した合成フレームワークを提案し、GPT風のモデルを訓練して論理推論と一般化を評価。論理情報の監督により、関係意味論が現れる相転移を観察し、成功する一般化が安定した中間層信号と一致することを示した。反転失敗は欠如した意味論よりも、自己回帰の順序バイアスに起因することが示唆された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ICLR #Selected Papers/Blogs #Generalization #One-Line Notes #AgentSkills #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 大規模言語モデル(LLMs)を利用して、エージェントが一般化可能なスキルを学習するための新しいフレームワーク「PolySkill」を提案。スキルの抽象的な目標と具体的な実行を切り離すことで、スキルの再利用や一般化を促進。実験では、ウェブサイトでのスキル再利用を1.7倍向上させ、成功率を最大13.9%向上させた。PolySkillにより、エージェントが自己目標を識別し、より良いカリキュラムを学習する能力が高まり、継続的に学習できる自律エージェントの構築に寄与することが示された。 Comment

元ポスト:

Loading…

エージェントスキルにポリモーフィズムの考え方を導入し、WhatとHowを分離することで汎化性能を高める。下図が分かりやすい。
image

最初に特定ドメインのwebサイト(e.g., shopping)を訪れた際に、AbstractShoppinpクラスを生成しShopping関連を扱うクラスとする。その上で、特定サイト(e.g., Amazon)のスキルを生成する際は、AbstractShoppingクラスにシグネチャを登録した後、同クラスを継承。AmazonShoppingクラス内に具体的な処理を定義する。直接スキルを生成するのではなく、抽象スキルを生成した上で、特定サイトでのメソッドを実装する。

openreview: https://openreview.net/forum?id=KdEsujyiSV




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #read-later #Selected Papers/Blogs #KV Cache #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 連鎖的推論ではKVキャッシュの拡大がボトルネックとなっており、従来の手法は手作業で管理されている。よりスケーラブルな「Neural Garbage Collection(NGC)」を提案し、言語モデルが推論と同時に忘れることを学ぶ。モデルは推論中にキャッシュエントリの追い出しを決定し、これを強化学習で最適化。成果ベースのタスク報酬を用いて学習することで、高い精度を保ちながらキャッシュサイズを圧縮し、エンドツーエンドの最適化がモデルの能力を向上させる可能性を示した。 Comment

元ポスト:

Loading…

LLMにReasoningとKV Cacheのマネジメントを同時に学習させる。

ポイント解説:

Loading…




Paper/Blog Link My Issue
#ComputerVision #NLP #SpeechProcessing #Speech #Proprietary #MoE(Mixture-of-Experts) #2D (Image) #TTS #Omni #text Issue Date: 2026-04-22 GPT Summary- Qwen3.5-OmniはQwen-Omniモデルファミリーの最新進展で、数百億パラメータと256kのコンテキスト長を持ち、テキスト-ビジョン対とオーディオ視覚コンテンツを利用したオムニモーダリティ能力を発揮します。215のサブタスクでSOTA結果を達成し、Gemini-3.1 Proを上回る性能を示しました。Hybrid Attention MoEフレームワークを採用し、長シーケンス推論を効率化。ARIAにより音声合成の安定性を向上させ、10言語で人間の感情ニュアンスをサポート。優れた音声-視覚グラウンディング能力を持ち、音声-視覚指示に基づく直接コーディングを実現する新たな機能も観察されています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #SyntheticData #SelfImprovement #PostTraining #RLVR #Scalability #Environment Issue Date: 2026-04-22 GPT Summary- 汎用エージェントとしての大規模言語モデルの期待が高まる中、Agent-Worldを提案。これは、エージェントが多様な実世界環境を探索し、自律的にタスクを合成する仕組みを提供。強化学習と動的なタスク合成により、エージェントの能力を向上させ、共進化を促進。実験で、Agent-Worldが複数のベンチマークで他のモデルを一貫して上回ることを示す。汎用エージェント知能構築のヒントも提示。 Comment

元ポスト:

Loading…

pj page: https://agent-tars-world.github.io/-/




Paper/Blog Link My Issue
#NLP #ScientificDiscovery #Test-Time Scaling #Reference Collection Issue Date: 2026-04-22 GPT Summary- 評価駆動の発見ループを科学的発見において拡張するためのフレームワーク、SimpleTESを提案。これにより並列探索やフィードバック駆動の改良を組み合わせ、21の科学的問題で最先端の解を発見。特に、LASSOアルゴリズムを大幅に高速化し、新たな構成を発見。SimpleTESは評価の履歴を生成し、見たことのない問題にも一般化できることから、LLM主導の科学的発見を推進する中心的手法として位置づけられる。 Comment

元ポスト:

Loading…

110ページ、、、




Paper/Blog Link My Issue
#NLP #Infrastructure #Quantization #LLMServing #KV Cache #Compression #Initial Impression Notes Issue Date: 2026-04-22 GPT Summary- KVキャッシュメモリは、レイテンシーに敏感な小規模バッチと高スループットワークロードの同時サポートにおけるボトルネックとなっている。多くの圧縮手法は実用的な制約に違反し、デプロイメント時の有効性を制限している。本研究では、最小限の4ビット量子化手法を特定し、INT4量子化とブロック対角Hadamard回転の組み合わせが最良のトレードオフを実現することを発見した。実装により、エンドツーエンドのオーバーヘッドを抑え、INT4スループットに匹敵する性能を達成。結果として、KVキャッシュ圧縮はシステム共設計の問題であり、軽量な手法が実用的な精度を提供することを示した。 Comment

元ポスト:

Loading…

github: https://github.com/togethercomputer/saw-int4

以下のRequirementsがある
- MHA modelsのみをサポートしており、MLA、あるいはMHA以外のアーキテクチャはサポートされていない
- 実装かれていないだけなのか、理論的に無理なのかは区別がついていない
- Prefill backend: fa3
- Decode backend: triton

解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Decoding #One-Line Notes #Reference Collection #Latency #EdgeDevices Issue Date: 2026-04-22 GPT Summary- μLMsを導入し、エッジデバイスで即座に文脈に基づく応答の最初の数語を生成し、クラウドモデルがその後を完成させることで、遅延を隠蔽する協調生成フレームワークを設計。経験的結果は、極小モデルでも大規模モデルと同等の生成が可能であることを示し、リソース制約のあるデバイスでの高い応答性を実現。 Comment

元ポスト:

Loading…

オンデバイスのMicro LLM(8M--30M)パラメータが冒頭の単語を生成し、その続きをCloud側のLLMが生成することで、Cloud LLMのlatencyの遅さをマスクする
image




Paper/Blog Link My Issue
#NLP #Prompting #Bias #ICLR #Test-Time Scaling #Diversity #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-21 GPT Summary- String Seed of Thought(SSoT)という新しいプロンプティング手法を提案し、Probabilistic Instruction Following(PIF)のパフォーマンスを改善します。PIFは選択肢を確率に基づいて選ぶタスクですが、LLMはしばしば非決定論的な挙動が要求される場面で偏りを生じることがあります。SSoTは、まずLLMにランダムな文字列を生成させ、これを操作することで多様性を維持しつつ制約を遵守した答えを導く手法です。実験により、SSoTがPIFの改善に寄与し、応答の多様性を高めることを示しました。 Comment

openreview: https://openreview.net/forum?id=luXtbX1lVK

元ポスト:

Loading…

LLMが内包するバイアスを抑制し、出力の多様性を高めるPrompting手法っぽい。興味深い。

ランダムな文字列を生成させてから、その文字列を操作させて出力を得るようなアプローチとのこと。
image

著者ポスト:
-

Loading…

-
Loading…




Paper/Blog Link My Issue
#Analysis #NLP #Transformer #Architecture #LatentReasoning #Reference Collection Issue Date: 2026-04-21 GPT Summary- ループ推論型言語モデルの推論性能向上を探求し、フィードフォワードモデルとの内部ダイナミクスの違いを比較。循環的再帰を分析し、各層が異なる不動点に収束する様子を示す。再帰の過程でアテンションヘッドの挙動が安定化し、フィードフォワードモデルの推論段階を繰り返すことを発見。再帰ブロックのサイズや入力の注入が安定性に与える影響にも焦点を当て、設計の指針へと結びつける。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#InformationRetrieval #NLP #AIAgents #RAG(RetrievalAugmentedGeneration) #FactualKnowledge #KeyPoint Notes #Clustering-based #AgentSkills Issue Date: 2026-04-21 GPT Summary- 検索強化生成(RAG)の限界を克服するために、Corpus2Skillを提案。これは文書コーパスを階層的なスキルディレクトリに変換し、LLMエージェントが効率的にナビゲート可能にする。文書をクラスタリングし、各レベルで要約を生成して構築。提供時に、エージェントはコーパス全体を把握し、段階的にトピックを掘り下げ、証拠を効果的に組み合わせる。実験により、WixQAのベンチマークでRAGの他の手法を上回る性能を示した。 Comment

元ポスト:

Loading…

Agent Skillsの機構を利用し、Skillsを検索におけるIndexのような位置づけで活用し、Skillsを用いて階層化された知識をnavigateさせることで、抽象的な情報からより細かい情報までdrill-downさせるような挙動を実現させ、RAGの性能を向上させる。
image

Skillsを定義する際は、
- root level (Skill.md)
- leaf level (Index.md)

によって構成され、root levelではトピックに関する情報+クラスタのメタ情報、leaf levelでは個別のdocのtitle+IDによって構成される。
image

Documentを階層化する際にはクラスタリングを用いる。具体的にはクラスタリングを実施し、クラスタの内容をLLMに要約させ、要約させた情報に基づいてさらにクラスタリングをする、という処理を繰り返すことで階層化を実現していそうに見える。Servingの時はSkill.md, Index.md, Document Storeに対して、2種類のツール `code_execution`, `get_document` を用いて、ツリーを探索し、relevantなdocを取得する。code_executionは具体的には、SKILL.mdとIndex.mdをviewコマンドによって閲覧し、階層構造全体を俯瞰できるようにする。get_documentでは、docのidentifierを用いて、identifierと対応するdocの全文を取得する。
image

BM25, Denseなどのbaselineと比較して高い性能を獲得している。性能に対してコスト比が併記されているが、トークン空間上で思考し探索をするためコストは高いように見える。個人的に気になるのは、金銭的なコストもそうだが、latencyである。embeddingを用いたRAGに対して、相当latencyが遅いのではないか?と思われる。
image




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Attention #Test-Time Scaling #mid-training #Decoding #PostTraining #One-Line Notes Issue Date: 2026-04-20 GPT Summary- LACEは、独立した推論試行を協調的な並列プロセスに変換するフレームワークであり、クロススレッドのアテンションを活用して推論経路間での洞察の共有と相互訂正を可能にする。合成データを使って自然な訓練データの不足を補い、実験では正確性が7ポイント以上向上することを示した。結果は、相互作用する並列推論が大規模言語モデルの効果を高める可能性を示唆している。 Comment

元ポスト:

Loading…

parallel test-time scalingによって生成をする最中にtrajectoryを交互作用させることで、trajectoryの冗長性を減らし、交互作用を可能にする。




Paper/Blog Link My Issue
#Embeddings #InformationRetrieval #NLP #AIAgents #Chain-of-Thought #Selected Papers/Blogs #memory Issue Date: 2026-04-20 GPT Summary- LLMが外部知識を効果的に取り込む課題を解決するために、Thought-Retrieverという新しいアルゴリズムを提案。これは、過去のユーザークエリで生成された中間応答を活用し、冗長な思考をフィルタリングして新しいクエリに関連する思考を取り出すことで、長期記憶を構築。AcademicEvalという新たなベンチマークで広範な実験を行い、Thought-Retrieverが最先端モデルを上回る成果を示した。特に、より多くのクエリ解決後に自己進化を促し、抽象的な問いへの応答能力を向上させることが確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Safety #SoftwareEngineering #Live #Sabotage Issue Date: 2026-04-20 GPT Summary- LinuxArenaは、エージェントが実稼働環境で操作するための制御設定で、20の環境、1,671の主要タスク、184の安全性に関するサイドタスクを含みます。妨害評価を通じて、主要タスクを完了しつつサイドタスクを処理できるかを検証し、GPT-5-nanoのモニターが1%の偽陽性率で多数の未検出妨害成功率を示しました。また、人手作成の攻撃軌跡データセットLaStrajを公開し、現行の攻撃方針がLinuxArenaに影響を与えていないことを示しました。これにより、LinuxArenaが攻撃者と防御者双方にとって重要な研究基盤となることが示唆されました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #Personalization #ICLR #Personality #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- LLMsは、異なるペルソナを自然に適応させる能力を持ち、その知識は既存のパラメータに埋め込まれていることを示す。小規模な比較データセットを用いて、特定のペルソナに関連する活性化の特徴を特定し、ペルソナサブネットワークを分離するマスキング戦略を開発。二値的な対立性を持つペルソナ間の統計的発散を生み出す対照的剪定戦略も提案し、完全な訓練を必要としない。得られたサブネットワークは、外部知識を必要とする手法よりもペルソナ整合性を大幅に向上させ、LLMsのパーソナライズに新たな視点を提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Tokenizer #Selected Papers/Blogs #reading #KeyPoint Notes #Byte-level #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- プロキシ圧縮を導入し、圧縮入力と生のバイト列の共同訓練を通じて、モデルに両者の整合を学習させる新しい訓練手法を提案。実験では、訓練効率が大幅に改善され、固定計算予算内でのバイトレベルベースラインを上回る成果を示す。モデル規模の拡大に伴い、プロキシ訓練を受けたモデルはトークナイザーアプローチに匹敵または競合する性能を発揮し、頑健性を維持。 Comment

元ポスト:

Loading…

既存の言語モデルはバイト列をcompressorを通じて圧縮されたシンボルを通じて学習されているものとみなせるが(compressorは言語モデルであればtokenizerでありシーケンス長を4--6倍削減する)、これにより特定の言語モデルがcompressorと強く紐づいてしまう欠点がある。tokenizerを噛ませる欠点としては、グリッチトークン(tokenizerのvocabには登録されているが学習ができていないトークン)やprompt boundary issue (The Art of Prompt Design: Prompt Boundaries and Token Healing, Scott Lundberg, 2023.05 )、言語固有のバイアスなどの問題が生じること。

提案手法はモデルのアーキテクチャとnext token predictionは一切変えずに適用できる。学習時のinputとして、warmupフェーズにおいてはcompressorによるトークン(タグで囲む)と、生のバイト列(タグで囲む)の両方を入力する。warm upが終わった後は、compressed dataを90%、10%をraw dataによって表現して学習する。vocabはバイト列(256個のvocabで済む)とcompressorの両方で共有するが、inference時はcompressorを完全に無くしバイト列の入力のみでinferenceする。

image

ベースラインとしてtokenizerを用いた場合と、バイト列をそのまま学習した場合、neuralモデルをcompressorとして用いた場合と比較し、0.5Bではベースラインよりもスコアが低いが、14B級になると、全てのbaselineを上回るだけでなく、tokenizerを用いた場合のモデルも上回った。
image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Infrastructure #LLMServing #Selected Papers/Blogs #reading #One-Line Notes #KV Cache #needs-revision #Author Thread-Post Issue Date: 2026-04-18 GPT Summary- Prefill-decode(PD)のデプロイにはKVCache転送が制限要因となっており、従来のアテンションモデルは大容量のKVCacheトラフィックを生成する。ハイブリッドアテンションアーキテクチャはKVCacheサイズを削減するが、データセンター間の運用に問題が残る。そこで、Prefill-as-a-Service(PrfaaS)を提案し、プリフィル処理を専用クラスタにオフロードして効率的なKVCache転送を実現。これにより、リソースの独立したスケーリングを可能にし、実績として、PrfaaSを用いた異種デプロイメントは従来よりも高い提供スループットを達成。 Comment

元ポスト:

Loading…

LLM servingにおいて、prefillはcompute-intensiveで、decodeは(kv cacheが肥大化するため)memory-intensiveであるという特性があるため、(それぞれ得意な処理は得意なノードに任せるため)prefillとdecodeを分離して異なるノードで実施するprefill-decode disaggreagated servingというインフラのアーキテクチャが超巨大モデルでは主流だが、prefill-decode間でKV Cacheを転送しなければならないため、このような分離は同じ計算機クラスター内のRDMA(Remote Direct Memory Access)が可能なノード間に限定されるのが一般的である。

しかし、compute/memory特化型のリソースは通常チップの種類と物理的な場所の両方に制約されてプールされるので、両方のハードウェアがRDMAのような密結合なドメインで利用できないという欠点がある。このため、クラスターを超えてPD分離をしたいのだが、KV Cacheの転送が結局のところボトルネックとなる。現在のモデルはSparse/LinearなアテンションによってKV Cacheに必要なリソースが一桁減っているが、それでもnaiveにクラスタを跨いでPD分離をすると、突発的なリクエストのバーストや、不均一なPrefix Cacheの分布、クラスター間の帯域幅の変動などによって、計算効率が低下してしまう。

そのため、提案手法では、高スループットな長文のprefillに特化した独立クラスタを作り、ローカルにキャッシュされていない(主に長文の)、 prefillのみを同クラスタにオフロードし、短いリクエストはローカルでPDを実施するようなアプローチをとる。こうしてprefill特化クラスタによって生成されたKV Cacheはdecode可能なPDクラスタに対してイーサネットを介して転送される。これは選択的なオフロードであり、帯域幅が制限された経路で非効率な短いリクエストを送信を避けて、prefillの高速化が重要なリクエストのみをクラスタ間転送に集中させるという考え方に基づく。

これを実現するためには、(i)長いリクエストのみをオフロードするルーティングの仕組みと、(ii)ネットワークの輻輳を制御するための、帯域幅を考慮したスケジューラ、(iii)リクエスト長、キャッシュ配置、利用可能なクラスタの帯域幅を総合的に考慮してKV Cache全体を効率的を保ちながら管理するグローバルKV Cacheマネージャが必要。
image

このようなアーキテクチャを1T級のKimi Linearモデルで実験した結果、スループットが1.54倍、TTFTが64%改善した、という感じらしい。




Paper/Blog Link My Issue
#Pretraining #NLP #SyntheticData Issue Date: 2026-04-17 GPT Summary- ウェブテキストを合成前訓練データに再表現するための重要因子を特定するため、大規模な実験を行い、1兆トークン以上の生成を実施。構造化出力形式(表、数学問題、FAQ、チュートリアル)が従来の手法を上回ることが確認され、モデルのサイズを増加させても性能向上が見られないことが示された。また、元データの選択が重要であることも分析で明らかに。これらの結果を基に、FinePhraseというおよそ4,860億トークンのオープンデータセットを開発し、既存のベースラインを超え、生成コストを大幅に削減できることを示した。データセットと生成フレームワークは研究コミュニティに提供される。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #memory #Hierarchical #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- エージェント型科学における超長期自律性の課題に対し、ML-Master 2.0という自律エージェントを提案。階層型認知キャッシュ(HCC)を導入し、瞬時の実行と長期的戦略を切り離して一貫性を持たせる。評価では、最先端のメダル獲得率56.44%を達成し、AIの自律的探索の可能性を示唆。 Comment

元ポスト:

Loading…

contextを
- experience (short-term)
- knowledge (mid-term)
- wisdom (long-term)

の3つの階層に分類し管理するmemory機構を提案しているようである。
階層ごとに異なる記憶容量とアクセス速度で実装し、必要に応じて階層間でデータが昇格(experience->knowledge等)、あるいは削除される、といった機構によってmemory cacheを管理するような手法のようである。

image

MLE-BenchでSoTA




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #OpenWeight #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-04-17 GPT Summary- Nemotron 3 Super は、1200億パラメータを持つ新しい Mixture-of-Experts モデルで、事前学習に NVFP4を使用。事後学習には SFT と RL を採用し、最大 1M のコンテキスト長をサポート。推論スループットは従来モデルと比べて最大 7.5 倍向上し、オープンソースのデータセットが提供されています。 Comment

元ポスト:

Loading…

関連:
- NVIDIA Nemotron 3 Super, NVIDIA, 2026.03




Paper/Blog Link My Issue
#NLP #Dataset #Personalization #Evaluation Issue Date: 2026-04-17 GPT Summary- 報酬モデル(RMs)の個別化評価が未解決の課題である中、Personalized RewardBench(PRB)という新しいベンチマークを導入。これにより個々のユーザーの嗜好を厳密にモデル化する能力を評価。人間の評価では、両応答が一般的な品質を維持しつつ、嗜好の識別が個別に調整され、既存の報酬モデルは個別化に苦戦していることが明らかに。PRBは下流タスクにおいて既存の性能と比べて高い相関を示し、報酬モデルの評価における信頼性のある指標として確立された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Survey #NLP #LatentReasoning #Reference Collection #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 潜在空間は言語モデルにおいて重要な役割を果たし、多くのプロセスが連続的な潜在空間で自然に行われることが示されている。本調査は、潜在空間の基盤、進化、機構、能力、展望を整理し、それを他の空間や視覚モデルと明確に区別する。特に、アーキテクチャや最適化を含む四つの主要な発展線を特定し、推論や知覚など多様な能力を支える潜在空間の役割を論じる。未解決課題と今後の研究方向も示し、次世代知能のパラダイムを理解するための基盤を提供することを期待している。 Comment

latent reasoningに関する最新survey

Taxonomyがしっかりしているのが非常に良さそうである。たとえばCOCONUT(Representation/Reasoning)、Looped Transformer (Architecture, Reasoning), VJ-JEPA (Architecture/Perception)を見るとそれぞれ異なるセルに配置されている。手法ごとの表を見ると年号だけでなく、”日付”別で整理され時系列かされている。あと毎回Surveyみて思うが、多すぎである。。。
- [Paper Note] Training Large Language Models to Reason in a Continuous Latent Space, Shibo Hao+, COLM'25
- (Looped Transformerの例) [Paper Note] Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs, Ziyue Li+, arXiv'25
- [Paper Note] VL-JEPA: Joint Embedding Predictive Architecture for Vision-language, Delong Chen+, arXiv'25, 2025.12

image

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #Reference Collection Issue Date: 2026-04-17 GPT Summary- 強化学習(RL)におけるウェイト転送の効率化のため、新しいストレージ抽象化Reference-Oriented Storage(ROS)を提案。ROSは複製されたモデルウェイトを活用し、物理的なコピーを保持せずにアクセスを提供。さらに、TensorHubを構築し最適化転送やフォールトトレランスを実現。評価結果では、GPU待機時間を6.7倍削減し、ウェイト更新を4.8倍加速、データセンター間ロールアウトの待機時間を19倍短縮。TensorHubは実運用にデプロイ済み。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #Reference Collection #ReplayBuffer Issue Date: 2026-04-17 GPT Summary- 経験再生をLLMの事後トレーニングに適用し、リプレイバッファの最適設計を探求。生成コストの高い場合、オンポリシーサンプリングが必ずしも最適でないことを示し、よく設計されたリプレイバッファが推論計算量を削減し、モデル性能を改善する可能性があることを実証。 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #Optimizer #read-later #Selected Papers/Blogs #Generalization #DownstreamTasks #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 大規模言語モデル(LLMs)の事前学習において、幾何学的問題を調査し、タスク固有のミニマの位置が下流の一般化に影響することを提案。勾配の類似性を最大化するNexus optimizerを導入し、パラメータサイズやデータに応じた実験で、下流パフォーマンスの向上を示した。特に3Bモデルでは、分布外データでの損失を低減し、複雑な推論タスクで精度を最大15.0%向上させる結果を得た。これは、事前学習損失以外の評価指標の重要性を示唆している。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…


モデルを更新する際に平均的に性能が良くなる方向ではなく、全ての異なるデータにおいて性能が改善する方向性で更新すると性能が改善するという感じだろうか。興味深い




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #mid-training #PostTraining #LowPrecision Issue Date: 2026-04-17 GPT Summary- 大型基盤モデルのトレーニングには高コストが伴うため、低精度トレーニング手法が求められている。本研究では、HiFloat4 FP4フォーマットを使用し、MXFP4と比較して4ビット精度での計算スループットとメモリ効率を最大4倍向上させる。全結合モデルとエキスパート混合モデルをFP4で評価し、安定化技術により数値的劣化を抑えつつ高精度を維持する結果を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #read-later #On-Policy #SelfDistillation Issue Date: 2026-04-16 GPT Summary- SD-Zeroは、強化学習や外部教師を必要とせず、単一のモデルを生成器と査読者として学習させる新たな手法である。生成器が初期応答を生成し、査読者がそれを改善する過程で、オンポリシー自己蒸留を利用し、密なトークンレベルの自己監督を実現する。SD-Zeroは数学・コード推論ベンチマークにおいて、基盤モデルよりも10%以上の性能向上を示し、強力なベースラインを上回った。特徴としては、重要なトークンを特定するトークンレベルの自己局在化と、教師同期化による回答改訂の反復的自己進化がある。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Chain-of-Thought #Evaluation #Reasoning #ICML #read-later #Selected Papers/Blogs #LongHorizon #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LongCoTを導入し、複雑な推論能力を測定するための2,500問の専門家設計問題からなるベンチマークを提供。問題は数万から百数万の推論トークンを含む相互依存の手順を要求し、最先端モデルは全体で<10%の精度であることが示され、長期推論の限界が明らかになる。LongCoTは、モデルの長時間にわたる安定した推論能力を評価する指標となる。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

openreview: https://openreview.net/forum?id=47NnSXz3im&referrer=%5Bthe%20profile%20of%20Ivan%20Laptev%5D(%2Fprofile%3Fid%3D~Ivan_Laptev1)




Paper/Blog Link My Issue
#NLP #AIAgents #Test-Time Scaling #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- エージェント的タスクに対する並列テスト時スケーリングの研究を行い、集約エージェントAggAgentを提案。複数のロールアウトを生成し、軌跡の情報を効果的に統合しながら、出力のオープンエンド性に対応。AggAgentは6つのベンチマークと3つのモデルファミリーで既存手法を上回り、改善を達成しつつ、オーバーヘッドを最小限に抑えた。これにより、エージェント的集約の効率性が確認された。 Comment

元ポスト:

Loading…

Parallel test time scalingをじっしするlong horizon AI Agentの複数のtrajectoryを集約する手法のようである




Paper/Blog Link My Issue
#NLP #Transformer #Architecture #Stability #LatentReasoning #RecurrentModels #RecursiveModels #Initial Impression Notes Issue Date: 2026-04-16 GPT Summary- ループ型アーキテクチャの訓練の不安定性を克服するため、動的システムとして再定式化し、注入パラメータのスペクトルノルムを制約する新しいアーキテクチャParcaeを提案。Parcaeは従来モデルより低いパープレキシティを達成し、FLOPsのスケーリング特性を調査。訓練時に固定パラメータでのFLOPs増加法則を導出し、推論時には計算量のスケーリングを実現。2.99ポイントと1.18ポイントの品質改善を報告。 Comment

blog: https://sandyresearch.github.io/parcae/

元ポスト:

Loading…

学習がより安定するような工夫を加えたlooped transformerのようである

所見:

Loading…




Paper/Blog Link My Issue
#NLP #Test-Time Scaling #read-later #Selected Papers/Blogs #Verification #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LLMの能力向上に検証を新たなスケーリング軸として適用する方法を提案。LLM-as-a-Verifierフレームワークにより、細粒度のフィードバックを提供し、連続的なスコア生成を実現。これにより、正例と負例の解の分離が向上し、追加的な検証精度が得られる。提案手法は複数のベンチマークで最先端の性能を示し、タスク進行の推定にも寄与。さらに、RLに対しても高効率なフィードバックを提供。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

著者ポスト2:

Loading…

Verification性能をtest-timeに向上させるためのテクニック

アイデアの一つにGEvalっぽいアイデアも含まれている。

続報:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #MultiModal #ContrastiveLearning #VisionLanguageModel #DeepResearch #memory #reading #Test-time Learning/Adaptation #Initial Impression Notes #needs-revision Issue Date: 2026-04-14 GPT Summary- DRAはLLMの推論と外部ツールを組み合わせ、過去の経験を活用するメモリシステムを含む。従来の方法はメモリの効率性に課題があり、MIAフレームワークを提案してこれを解決。プランナーとエグゼキューターから成る新しいアーキテクチャは、交互の強化学習で協調を強化し、推論中の更新を実現。さらに、記憶の双方向変換を可能にし、自己進化を促進する機構も搭載。広範な実験でMIAの優位性を示した。 Comment

元ポスト:

Loading…

元ポストを読みなんとなーく分かったつとりになっているゆるふわ理解だが、Plannerのパラメータに経験をTest Time Learningの枠組みを埋め込み、既存のノンパラメトリックなメモリにtrajectoryも活用する二段構えである点が新しい点に感じた。

元論文を流し読みすると、Executor(vlm), Planner(llm, parametricなmemory), Memory Manager(trajectoryを格納; non parametricなmemory)の3つにマルチモーダルなAI Agentを分離する。

plannerは(ToDo 3.2節を読むべし

executorはplannerと過去のtrajectoryに基づいて実行をする。executorはGRPOに」るRLVRで訓練されるが、tool use, plannerのトークンはマスクされ学習される。

(後ほど追記




Paper/Blog Link My Issue
#Analysis #NLP #ICLR #ConceptErasure #KnowledgeEditing #reading #KeyPoint Notes #needs-revision #Author Thread-Post Issue Date: 2026-04-14 GPT Summary- LLMsの知識更新メカニズムを理解するため、統一フレームワークKnowledgeSmithを提案。編集と忘却を制約付き最適化として位置づけ、自動データセット生成器を用いて修正戦略の知識伝播を研究。実験により、LLMsが人間と同様の更新を示さず、一貫性と容量のトレードオフがあることを発見。新たな戦略設計の示唆を提供。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=znnA2Opw6v

知識の忘却と編集のダイナミクスを制約付きの最適化問題として統一的にモデル化(式3;この最適化問題を実際に解いているわけではなくあくまで理論的にこう定式化できるねという話だと思われる)し、

この定式化を通じて見ると、編集と忘却の違いはターゲットとする分布q_targetの選び方の違いにすぎず、様々な編集と忘却の先行研究は手法は違えど、この制約付きの最適化問題の異なるインスタンスを解いているに過ぎないという視点を提供しているようである。これにより、編集と忘却のトレードオフを公平に比較することが可能となるという主張をしているように見える(自信ない)。

そして、編集と忘却のトレードオフを厳格に分析するためのベンチマークとして、階層的な依存関係や(local vs. global)、更新の多段階での伝播を扱えるベンチマークが必要だが既存ベンチマークではこれらが不足しているため、
知識グラフに基づいて自動的に構築されたデータとベンチマーク(Figure 1を見るにテンプレートベースのMCQを)を作成して分析。

分析には6つのモデルファミリーの13のモデルが用いられ、スケールは1B--123Bの幅広いスケールのモデルで検証された。

image

(先行研究も含めてしっかり読まないと、式3と実験で用いられている手法AlphaEdit, ReLearnの関係性がちょっとわからなそう)

著者ポストにおいては、以下のようなtakeawayが記載されており、大きな知見としてはLLMはデータベースではなく、トレードオフを持つ複雑に絡み合ったシステムであり、以下のような点を明らかにした

- 知識の編集は意図しない変更を引き起こし
- 忘却は知識の完全な消去には失敗する
- 更新する知識を増やせば増やすほど、ローカルの知識は更新されるが、グローバルな一貫性が崩壊し
- 変更することが極めて困難な知識(たとえば歴史)が存在する

とのことである。




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #DiffusionModel #Initial Impression Notes Issue Date: 2026-04-14 GPT Summary- 内省的受容率を定義し、拡散型言語モデル(DLM)の品質向上を目指す。新たに提案されたIntrospective Diffusion Language Model(I-DLM)は、ARトレーニングの内省的一貫性を保ちながら並列デコードを実現する。I-DLMは新しい内省的ストライドデコード(ISD)アルゴリズムを使用し、静的バッチスケジューラで最適化。従来のDLMを上回り、AIME-24で69.6、LiveCodeBench-v6で45.7の性能を達成。これにより、スループットが3倍向上し、大規模サービスへの対応力も強化。 Comment

元ポスト:

Loading…

github: https://github.com/Introspective-Diffusion/I-DLM

8B級のスケールでARモデルと15種類のベンチマークで同等程度の性能を達成し、large batchsizeでスループットが3.8倍のdLMとのこと。




Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #ICLR #read-later #Initial Impression Notes Issue Date: 2026-04-11 GPT Summary- LLMの表現空間の構造は未解明であり、学習の解釈に制限がある。研究では、LLMsを損失のある圧縮として捉え、訓練過程で目的に関連する情報のみを保持すると主張。モデルの事前訓練結果から圧縮の最適性を示し、異なるモデル間の性能が訓練データとレシピの違いによることを解明。これにより、表現構造と性能を結びつける情報理論的フレームを提供し、大規模な応用の可能性を示す。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=tvDlQj0GZB

(おそらく先行研究と比較したときの新規性に対する解釈が割れていて)スコアが相当pos/negに偏っている

なお、Rebuttalのために800以上のチェックポイントを分析する必要があったとのこと。

meta reviewによるとLLMのダイナミクスを理解するうえで有用な視点を提供している一方で、論文中で潜在的な応用可能性については言及されているが、実用的な有用性、特に本研究が示した分析結果が効果的な学習手法、モデル選択手順にどのように反映可能かが十分に示されていない、という指摘がある。

所見:

Loading…




Paper/Blog Link My Issue
#NLP #Test-Time Scaling #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-11 GPT Summary- 検証者なしの進化は、多様性と効率においてボトルネックが存在する。本研究では、Squeeze Evolveというマルチモデルオーケストレーションフレームワークを提案。モデルの能力を最適に割り当てることで、多様性とコスト効率を両立させる。Squeeze Evolveは、いくつかのマルチモーダル視覚ベンチマークにおいて、単一モデル進化と比較してコスト対能力を改善し、新たな最先端結果を達成。さらに、探索タスクでは検証者ありの進化法と同等、またはそれを上回る性能を示した。 Comment

pj page: https://squeeze-evolve.github.io/#blog-squeeze-evolve

元ポスト:

Loading…

様々なtest-time scaling手法が単一のframeworkで表現できるという話がそもそもおもしろそう。読みたい。




Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Selected Papers/Blogs #Generalization #VisionLanguageModel #Live #One-Line Notes #Environment Issue Date: 2026-04-11 GPT Summary- ClawBenchは、次世代AIエージェントを評価するための153の簡単なタスクからなるフレームワークを提供。これにより、ユーザーからの情報取得や多段階ワークフローのナビゲーション、高度なフォーム記入といった複雑なタスクを評価可能。従来の静的なベンチマークと異なり、実際のウェブサイトで動作するため、現実的な評価を可能にする。評価では、商用・オープンソースモデルがタスクの一部しか完了できないことが示され、AIエージェントの汎用性向上に寄与することが期待される。 Comment

元ポスト:

Loading…

pj page: https://claw-bench.com

実際のwebsiteに対して、日常的なオンラインでの153タスクを実行しweb agentを評価可能なフレームワークな模様。既存のオフライン、かつサンドボックスなベンチマークでは75%程度のスコアを達成していたGPT-5.4が、6.5%までスコア低下。
image

タスク性能の可否は、タスクのinstruction, 人間によるreference actionとpayload, エージェントの実際のactionとpayloadを与えて、AgenticなAIによって、ルーブリックに基づいて判断されるようである(Figure7)。

github: https://github.com/reacher-z/ClawBench

タスクinstructionの一覧は下記:
https://github.com/reacher-z/ClawBench/tree/main/test-cases

たとえば、UberEatsでパッタイをピーナッツ抜きで一つ注文する、といったタスクがある。




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #PostTraining #On-Policy #One-Line Notes #LowPrecision Issue Date: 2026-04-11 GPT Summary- 強化学習ベースのポストトレーニングを用いたテキストから画像への拡散モデルの最適化において、FP4量子化を組み込んだ二段階強化学習フレームワーク「Sol-RL」を提案。第一段で高スループットのロールアウトを行い、高コントラストのサブセットを生成、第二段でこれを高精度で再生成してポリシーを最適化。これにより、ロールアウトの効率を高めつつ訓練整合性を維持。実験により約4.64倍の収束加速を達成し、高性能な整合性を示す。 Comment

pj page: https://nvlabs.github.io/Sana/Sol-RL/

元ポスト:

Loading…

FP4でまずロールアウトを生成し、rewardモデルを用いて生成結果のスコアを得て、top/worst-Kのサンプルに絞ってBF16で(該当ノイズから)サンプルを再生成しGRPOで活用する。

探索がFP4で実施されるため高速になり、2*K件のサンプルにのみ絞って学習が行われるため2段階の高速化になっている。

image




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #ComputerUse #read-later #Selected Papers/Blogs #Verification #Rubric-based Issue Date: 2026-04-11 GPT Summary- CUA軌跡の検証は評価信号の信頼性に不可欠である。本研究では、ノイズを減らしたルーブリックの構築、プロセスと成果報酬の分離、失敗の制御、文脈管理スキームの導入を行い、Universal Verifierを設計。新しいCUA軌跡集合CUAVerifierBenchでの検証により、人間の合意に匹敵する精度を示し、偽陽性率をほぼゼロに低減。自動研究エージェントは専門家の品質を70%達成するが、Universal Verifierの戦略発見には失敗。システムとデータセットはオープンソースとして公開。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #ReinforcementLearning #Reasoning #PostTraining #read-later #Selected Papers/Blogs #Entropy Issue Date: 2026-04-11 GPT Summary- RAGEN-2では、LLMエージェントの強化学習トレーニングの不安定性に注目し、推論の質をエントロピーと相互情報量(MI)に分解。エントロピーが高くても、モデルが固定テンプレートに依存する「テンプレート崩壊」の問題を明らかにした。MIは推論品質の信頼できる指標であり、タスク性能との相関が強い。低い報酬分散が推論差を消してしまう問題をSNR対応フィルタリングを用いて解決し、入力依存性とタスク性能を改善することを提案。様々なタスクで一貫した成果を示した。 Comment

pj page: https://ragen-ai.github.io/v2/

元ポスト:

Loading…

おもしろそう

ポイント解説:

Loading…


トークンのエントロピーによって多様性を測る方法は、単一の応答内での多様性は測れるが、異なるプロンプトに対する応答の多様性は測れない。たとえば、単一応答内のエントロピーは健全だが、応答がinputに非依存の応答となっている場合など(=テンプレート崩壊)は多様性が欠如していると考えられる。このため、相互情報量に基づくメトリックを提案し、応答間で共有されている情報量を測る方法を提案。

image




Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Selected Papers/Blogs #LongHorizon Issue Date: 2026-04-11 GPT Summary- APEX-Agentsは、投資銀行アナリストや弁護士などの長期タスクをAIエージェントが遂行できるかを評価するベンチマークです。現実的な職場環境でのナビゲーションを要求し、8つのエージェントをPass@1でテスト。Gemini 3 Flashが24.0%のスコアで最優秀、続いてGPT-5.2、Claude Opus、Gemini 3 Proが続きます。全てのプロンプトやメタデータはオープンソース化され、評価インフラのArchipelagoも公開されます。

Paper/Blog Link My Issue
#ICLR #read-later #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-04-08 GPT Summary- 静的な学習パラダイムでは新情報への動的適応が制限される。本研究では、推論時訓練(TTT)を用いてモデルパラメータを更新し、インプレースTTTフレームワークを提案。これにより、MLPブロックの最終射影行列をファストウェイトとして扱い、ゼロからの再訓練なしでLLMを強化。次トークン予測タスクに目的を整合させ、スケーラブルなアルゴリズムを実現。実験により、4Bパラメータモデルが優れた性能を示し、競合するアプローチを上回った。In-Place TTTは継続的学習の新たな一歩を提供する。 Comment

openreview: https://openreview.net/forum?id=dTWfCLSoyl

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Architecture #ACL #Hierarchical Issue Date: 2026-04-08 GPT Summary- PHOTONは、トランスフォーマーの水平スキャンを垂直で多解像度の文脈スキャンに置き換える階層型自己回帰モデルである。ボトムアップエンコーダがトークンを低レートの文脈に圧縮し、軽量なトップダウンデコーダが高精細なトークンを再構築。再帰的生成により最も粗いストリームのみを更新し、ボトムアップの再エンコードを排除。実験では、PHOTONが長いコンテキストやマルチクエリタスクで優れたスループットと品質を示し、KV-cacheトラフィックを削減して最大1000倍のスループットを実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Transformer #SpeechProcessing #DiffusionModel #Speech #MultiLingual #OpenWeight #TTS #Initial Impression Notes Issue Date: 2026-04-07 GPT Summary- OmniVoiceは、600言語以上対応した多言語ゼロショットTTSモデルで、離散的非自己回帰アーキテクチャを採用。従来の複雑なパイプラインを排除し、テキストを直接音響トークンにマッピング。全コードブックランダムマスキング戦略とLLMからの初期化が技術革新を支える。581,000時間のオープンソースデータセットに基づき、中国語・英語などで最先端の性能を示す。モデルはオープンソースとして公開。 Comment

元ポスト:

Loading…

github: https://github.com/k2-fsa/OmniVoice

dLMアーキテクチャだからかなり早いのでは。600+言語をサポート。




Paper/Blog Link My Issue
#Alignment #ACL #Decoding #Findings #Routing #KeyPoint Notes #Author Thread-Post #Test-time Alignment Issue Date: 2026-04-07 GPT Summary- 推論時に固定されたLLMsを用いて、トークンレベル適応ルーティング(TARo)を提案。報酬モデルにより数学的推論の一貫性信号を捉え、ルーターが基盤モデルを自動制御。TARoは推論性能を最大+22.4%向上させ、分布外の臨床推論や指示遵守を改善。再訓練なしでの一般化も可能で、堅牢な推論を実現。 Comment

元ポスト:

Loading…

巨大なベースモデル全体を特定ドメインに適用するためにpost-trainingするのは大変なので、代わりに小規模なdomain-expertなRewardモデルを学習し(今回は数学のstep-wiseにlogicが正しいことをpreferenceとして与えるような学習方法を採用したようである; 3.2節)、各decoding step tにおいて、ベースモデルとRewardモデルのトークンのlogitを線形補完することで、出力トークンをガイドする。logitの線形補完において、固定されたスカラー値(e.g., 0.5など。GenARMという手法らしい)を用いる研究などが先行研究ではあるが、これはベースモデルの特定タスクにおいてベースモデルの性能を劣化させるので、本研究ではdecoding step t時点で出力されたベースモデル、Rewardモデルのlogitを入力として、FFNによって線形補完の重みα_tをdecoding step tごとに決定する(α_tを決定するネットワークをRouterと呼ぶ)。FFNは2種類のvariantがあり、双方のlogitをconcatしたものを入力するものと、top-kをサンプリングし、kごとにindexに基づいたembeddingをconcatして入力する方法の二種類がある(3.3節)。
image

結果としては、GenARMと比較して提案手法は有効ではあるが、ベースモデルとrewardモデルの組み合わせによっては、baseモデルよりも性能が悪化するということもありそうに見える。
image

またRouterはベースモデルのサイズを大きくしても、性能が転移するので再学習が不要である。
image




Paper/Blog Link My Issue
#Multi #NLP #ReinforcementLearning #AIAgents #TabularData #SelfImprovement #ACL #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-07 GPT Summary- 表の理解と推論を高めるため、マルチエージェントフレームワークMixture-of-Mindsを提案。計画、コーディング、回答の役割に分割し、各エージェントが特定の側面を担う。自己改善トレーニングにモンテカルロ木探索を用いて強化学習を最適化。実験結果ではTableBenchで62.13%の改善を達成し、構造化されたアプローチの有効性を示す。 Comment

元ポスト:

Loading…

複雑なタスクを特化型のエージェントに分解し、個々のエージェントを学習するためのpseudo-gold trajectoryを合成しエージェントをFinetuning。その後、FinetuningしたエージェントをGRPOによってend-to-endで学習する、という話に見える。pseudo-gold trajectoryは、個々の特化型のエージェントに対して複数の解候補を出力させ、解候補を次のエージェントに入力し解候補を生成...という手順をsequentialに適用していき、最終的に正しい応答を導き出せたtrajectoryを後ろ向きにたどることによって、pseudo-gold trajectoryを得る。FinetuningとRLがどのような順番で実施されるか、あるいは繰り返されるのか、といった部分についてはしっかり読み解けていない。

image

表データで実験をしているが、それは一つの応用例であり、汎用的に利用可能な手法と考えられる。




Paper/Blog Link My Issue
#NLP #One-Line Notes #ModelDiffing Issue Date: 2026-04-05 GPT Summary- モデルdiffingは新モデルの安全性を明らかにする効果的手法だが、主にベースモデルとファインチューニングモデルの比較に限定されていた。Crosscodersはアーキテクチャを横断するモデルdiffingを可能にするが、従来はその応用が限られていた。本研究ではCrosscodersを用いた初のアーキテクチャ横断のモデルdiffingを行い、Dedicated Feature Crosscoders(DFCs)を提案。これにより、教師なしで特定の偏りや特徴を発見し、アーキテクチャ横断のモデルdiffingがAIモデル間の挙動差を特定する有効な手法であることを示した。 Comment

モデルのアーキテクチャを跨いでモデルの特徴や性質の違いのdiffを見る方法とのこと。

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #PEFT(Adaptor/LoRA) #ModelMerge Issue Date: 2026-04-05 GPT Summary- 複数のLoRAモジュールを統合する際の不均一な寄与による問題を解決するため、サブスペースの被覆度と異方性を考慮したTARA-Mergingを提案。これにより、タスク関連のLoRAサブスペースを保持しつつ、効果的な方向ごとの再重み付けを実現。実験では、TARA-Mergingが他の手法を一貫して上回り、強固な汎化能力を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #PostTraining #EvolutionaryAlgorithm #GPUKernel Issue Date: 2026-04-05 GPT Summary- Kernel-Smithは、高性能GPUカーネルと演算子生成のためのフレームワークで、評価駆動型進化エージェントを用いて候補プログラムを改善。NVIDIAとMetaXのバックエンド特化評価サービスを活用し、トレーニングは強化学習信号とステップ中心の監督を結合。Kernel-Smith-235B-RLは、NVIDIA Tritonバックエンドにおいて総合性能の最先端を達成し、他モデルを上回る。さらに、MetaX MACAバックエンドでの適応も成功し、本番システムへの実用的な寄与を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #Coding #Reasoning #SoftwareEngineering #read-later #Reference Collection Issue Date: 2026-04-04 GPT Summary- LLMsの事前思考に依存したコード生成は制限があり、全体の複雑性を理解するには不十分である。これに対抗するために、Think-Anywhereという新しい推論機構を提案し、任意のトークン位置で推論を呼び出すことを可能にする。これにより、推論パターンの模倣と成果ベースのRL報酬を活用し、推論のタイミングを自律的に探索させる。広範な実験で、Think-Anywhereは最先端の性能を実現し、多様なLLMsにおいて一貫した一般化を示すことが確認された。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #MoE(Mixture-of-Experts) #Stability #Routing Issue Date: 2026-04-04 GPT Summary- スパースなMixture-of-Experts(MoE)アーキテクチャは、入力に対して一部のパラメータのみを活性化し効率的なスケーリングを実現するが、従来の独立ルーティングは膨大なパス空間を生じ、学習の非効率をもたらす。そこで、連続する層間でルータのパラメータを共有する\pathmoeを提案。実験により、独立ルーティングと比べてパープレキシティや下流タスクでの改善を確認した。トークンが同じパスをたどることで語機能ごとにクラスタリングされ、一貫性と頑健性が向上することが示された。これにより、MoEアーキテクチャの理解に新たな視点が得られる。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #read-later #Selected Papers/Blogs #HyperparameterTransfer Issue Date: 2026-04-04 GPT Summary- HyperPは、Muonsオプティマイザを使用した超球面パラメータ化フレームワークで、スケーリング時の安定性を向上させる。最適学習率を幅や深さ、トレーニングトークンに跨って転送可能とし、計算効率を1.58倍向上。監視指標は有界で非増加を維持し、MoEゲーティング機構SqrtGateにより粒度スケーリングを改善。トレーニングコードは公開されている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #ScientificDiscovery #Reproducibility #Physics Issue Date: 2026-04-04 GPT Summary- 大規模言語モデルを用いたAIエージェントは、科学研究タスクを支援するが、実際の科学論文からの再現性に課題がある。PRBenchを導入し、物理学の専門家が選んだ30のタスクに基づき、エージェントが論文の方法論を理解し、アルゴリズムを実装する能力を評価。エージェントは指示と論文内容のみを使い、実行環境で動作。評価の結果、GPT-5.3-Codexが最も高いスコアを得るも、全エージェントの再現成功率はゼロで、誤実装やデバッグ不能の問題が確認された。PRBenchは自律的な科学研究の進展を評価するための厳格な基準を提供する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #Coding #SoftwareEngineering #read-later Issue Date: 2026-04-04 GPT Summary- KAT-Coder-V2は、快手のKwaiKATチームが開発したエージェント指向のコーディングモデルで、5つの専門ドメインに分解し、それぞれを教師あり微調整と強化学習で独立学習した後、単一モデルに統合します。KwaiEnvを用いて数万の同時サンドボックス環境を支え、RL訓練をスケーリング。MCLAとTree Trainingにより計算の冗長性を排除し、最大6.2倍のスピードアップを達成。SWE-benchで79.6%、PinchBenchで88.7のスコアを記録し、複数のベンチマークで首位を獲得しました。モデルは公開されています。 Comment

元ポスト:

Loading…

Claude Opus 4.6に近い性能を持つagentic coding modelとのこと。

pj page: https://streamlake.com/product/kat-coder




Paper/Blog Link My Issue
#Survey #NLP #AIAgents #read-later #memory Issue Date: 2026-04-04 GPT Summary- 人工知能の研究は、ベンチマークスコアから現実世界での評価にシフトしている。今後の課題は、長期・動的な環境でのエージェントの真の有用性の確保であり、記憶がその解決策として重要視されている。本調査では、エージェント記憶を記憶基盤、認知機構、記憶対象の三次元から検討し、記憶操作を学習ポリシーと関連付けて分析。記憶の有用性評価のためのベンチマークと指標も提案し、未解決の課題と今後の方向性を示す。 Comment

AI Agent + memory に関するサーベイ。とんでもない量だ。。。

image

github: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

元ポスト:

Loading…

以下の3つの軸で整理されているようである
- メモリの基盤 (Memory Substrate):
- internal: 重み、潜在表現、KVCache
- external: vector stores, knowledge graphs, text records
- 認知機構 (Cognitive Mechanism)
- メモリの対象 (Memory Subject)

2023--2025の218の文献をレビューしたとのこと。

open challengeとしては
- continual learning
- multi-human-agent memory organization
- memory infrastructure and efficiency
- life-long personalization and trustworhy memory
- multimodal grounding
- real-world evaluations

と題されている。




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #AIAgents #Coding #PostTraining #read-later #SelfDistillation #Author Thread-Post Issue Date: 2026-04-04 GPT Summary- 簡易自己蒸留(SSD)を用いて、LLMが独自の出力のみでコード生成の改善が可能であることを示す。特定の温度とトランケーション設定で出力をサンプリングし、その後教師付きファインチューニングを行うことで、Qwen3-30B-Instructのパフォーマンスを42.4%から55.3%に向上。4B・8B・30Bスケールのモデル間で一般化され、改善のメカニズムをLLMデコードの精度と探索の相互関係に関連づけて検討。SSDは、精度を高めつつ多様性を保持するアプローチとして、LLMのコード生成に寄与する可能性を示唆する。 Comment

元ポスト:

Loading…

所見:

Loading…

解説:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Architecture #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #LowPrecision #needs-revision Issue Date: 2026-04-01 GPT Summary- NVFP4は、4ビット量子化形式として人気ですが、誤差分布の問題を抱えています。本研究では、入力値の分布に適応できる新しいデータ型、IF4(Int/Float 4)を提案します。IF4は、各16値のグループに対しFP4とINT4を選択し、NVFP4のスケールファクターでスケールします。この方法により、量子化訓練時の損失を低減し、精度を向上させることが確認されました。また、IF4のハードウェア実装も評価されています。 Comment

元ポスト:

Loading…

NVFP4と同様に、4bitで表現される16個のデータをひとつのグループとして扱い[^1]、FP8でのスケールファクターを共有するような浮動小数点フォーマットで[^2]、

グループ内の16個のデータに対して、INT4/FP4どちらを適用するかを、(NVFP4では常に正となっていた;未使用だった)スケールファクターを表現している8bitの先頭である符号ビットを用いて制御する新たな低精度浮動小数点フォーマット、IF4を提案、という話らしい。符号ビットをINT4, FP4を制御するIndicatorとして扱うため、NVFP4と比較してメモリ使用量は増えない。Indicatorはどちらがより量子化誤差が小さくなるかによって選択される、という感じらしい?

image

[^1]: グループとは単に0/1のバイナリ値が4bit分並んでいるデータのことであり、たとえばFP4で4bitの羅列を解釈すると、FP4は{±0, ±0.5, ±1, ±1.5, ±2, ±3, ±4, ±6}の16個の数値で解釈するようルールづけられている。
[^2]: スケールファクターを乗じることで、値を元々のデータのスケールに変換する。

この辺は勉強不足だなぁ、、、。

- NVFP4解説: https://licensecounter.jp/engineer-voice/blog/articles/20260317_nvfp4.html
- 本研究日本語解説: https://note.com/shimmyo_lab/n/n693c4d0da45f




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #ICLR #PostTraining #Selected Papers/Blogs #Stability #needs-revision #EntropyCollapse #Author Thread-Post Issue Date: 2026-04-01 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=E8MR8jgEeZ

PPO/GRPOなどのアルゴリズムではRL中にポリシーの多様性が低下し、ポリシーがdeterministicになり探索をしなくなり、パフォーマンスが停滞するか低下する(あるいはベースモデルでもともと高い尤度を持っていた解のPass@1が改善するが、ポリシーの出力が狭くなるため、Pass@kが犠牲になる)現象が生じる(= entropy collapse)ので、それを是正したいという話。

後ほど追記




Paper/Blog Link My Issue
#Pretraining #NLP #OpenWeight #OpenSource #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes Issue Date: 2026-03-31 GPT Summary- 基盤となる事前学習はモデルの限界を決め、事後訓練で克服するのが難しい。daVinci-LLMは、産業規模の資源と研究の自由を結集し、透明性のある完全オープンなパラダイムで事前学習を進展させる。8兆トークンを用いた二段階適応カリキュラムを採用し、能力向上のプロセスを体系的に評価。処理の深さやドメイン特性が能力に与える影響を明らかにし、探索プロセスを公開することでコミュニティが知識を蓄積できる基盤を提供する。 Comment

元ポスト:

Loading…

github: https://github.com/GAIR-NLP/daVinci-LLM

オープン"ソース" (=コード, データ, モデルが公開されている(さらに厳密にはライセンスに問題がない))な関連研究:
- OpenLLaMA, Xinyang+, 2023.05
- Introducing Marin: An Open Lab for Building Foundation Models, marin-community, 2025.05
- Marin 32B Retrospective, marin-community, 2025.10
- [Paper Note] Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, Stella Biderman+, arXiv'23, 2023.04
- [Paper Note] Olmo 3, Team Olmo+, arXiv'25, 2025.12
- [Paper Note] K2-Think: A Parameter-Efficient Reasoning System, Zhoujun Cheng+, arXiv'25, 2025.09
- [Paper Note] DataComp-LM: In search of the next generation of training sets for language models, Jeffrey Li+, NeurIPS'25, 2024.07
- [Paper Note] LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs, LLM-jp+, arXiv'24, 2024.07
- [Paper Note] TinyLlama: An Open-Source Small Language Model, Peiyuan Zhang+, arXiv'24, 2024.01
- [Paper Note] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model, BigScience Workshop+, arXiv'22, 2022.11
- [Paper Note] OLMo: Accelerating the Science of Language Models, Dirk Groeneveld+, arXiv'24, 2024.02
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
- [Paper Note] GPT-NeoX-20B: An Open-Source Autoregressive Language Model, Sid Black+, arXiv'22, 2022.04
- SmolLM2, 2024.11
- [Paper Note] LLM360: Towards Fully Transparent Open-Source LLMs, Zhengzhong Liu+, COLM'24, 2023.12
- SmolLM3: smol, multilingual, long-context reasoner, HuggingFace, 2025.07
- The Smol Training Playbook: The Secrets to Building World-Class LLMs, Allal+, HuggingFace, 2025.10

この辺の研究を全て紐解いていったらどのような変遷が起きているだろうか?

- RedPajama, a project to create leading open-source models, starts by reproducing LLaMA training dataset of over 1.2 trillion tokens, together.ai, 2023.04
- [Paper Note] Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model, Ahmet Üstün+, arXiv'24, 2024.02
- SmolLM - blazingly fast and remarkably powerful, Allal+, HuggingFace, 2024.07

この辺も関連はしているが、データはオープンだがソースコードがおそらく公開されていない。

事後学習なら
- [Paper Note] Tulu 3: Pushing Frontiers in Open Language Model Post-Training, Nathan Lambert+, COLM'25, 2024.11




Paper/Blog Link My Issue
#NLP #read-later #AgentHarness Issue Date: 2026-03-30 GPT Summary- エージェントの性能はハーネス工学に依存するが、ハーネス設計が固有のコードに埋もれているため比較や研究が困難である。そこで、我々は高レベルな制御ロジックを外部化することを提案し、自然言語エージェントハーネス(NLAHs)を導入。NLAHsはハーネスの挙動を自然言語で表現し、インテリジェント・ハーネス・ランタイム(IHR)がこれを実行する共通ランタイムを提供。コーディングや計算利用に関する様々なベンチマークで評価を行い、ハーネスの運用可能性や移行を統制しています。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #AutoML #LongHorizon #Initial Impression Notes #Asynchronous Issue Date: 2026-03-30 GPT Summary- 既存のAI研究エージェントの課題に対処するため、AIRA$_2$を提案。非同期マルチGPUワーカープールによりスループットを向上し、信頼性の高い評価信号を提供するHidden Consistent Evaluationプロトコルを導入。また、動的に行動を変更できるReActエージェントを用いる。MLE-bench-30でAIRA$_2$はパーセンタイル順位71.8%を達成し、過去最高を更新。各要素の必要性を示し、評価ノイズによる「過剰適合」の誤解を明らかに。 Comment

元ポスト:

Loading…

AutoMLベンチマーク(MLE-Bench-30)においてSoTAな手法らしい。AutoMLの現状を概観するのに良さそう。
- MLE-Bench, OpenAI, 2024.10

72h実行して、36.7%程度のコンペティションでGold medalを獲得している。よくよく表を見ると、FM-Agent 2.0の方が24hで全体的に高いメダル獲得率のように見えたのだが、そもそもMARS+, MARS, FM-Agent 2.0, そしてMLEvolveはcon-current workとのこと。2024年10月にMLE-Benchが発表され、[Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10 を見るとo1-previewでgold medalは10%程度だったが、そこから約1年半でgold medalの比率は+26%程度まで向上しているということになる。
- [Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10

ベンチマークが公開されたら早々にサチりそうな気がしていたが、個人的に思っていたよりもスコアの伸びが遅いという感想。

image




Paper/Blog Link My Issue
#NLP #AIAgents #Hallucination #Ambiguity Issue Date: 2026-03-30 GPT Summary- AIエージェントは長期的な推論に優れた能力を持つが、「幻覚の螺旋」により信頼性が損なわれる。既存の不確実性の定量化手法は受動的で、自己反省は無目的な修正に苦しむ。これを解決するために、言語化された不確実性を双方向の制御信号に変換する二過程型エージェント式UQフレームワークを提案。System 1は不確実性を伝達し盲目的な意思決定を防ぎ、System 2は合理的な手掛かりを使って必要時に推論を行う。実験によって、訓練不要で高い性能を示し、信頼できるエージェントの実現に向けた一歩としての可能性を示唆している。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #DiffusionModel #needs-revision Issue Date: 2026-03-30 GPT Summary- MDM-Primeは部分マスク法を応用し、拡散過程をサブトークンレベルでモデル化することで優れた一般化性能を示しますが、トークン粒度のハイパーパラメータ選択に関するツールが不足し、BPEとの組み合わせで尤度推定が低下します。これを受けて、MDM-Prime-v2を開発し、計算効率を21.8倍向上させ、OpenWebTextで7.77のパープレキシティを達成。11億パラメータに拡張したモデルは、ゼロショット精度でも優れた結果を示しました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #PostTraining #BudgetAllocation #Author Thread-Post Issue Date: 2026-03-29 GPT Summary- LLMの推論進展は、損失関数の洗練とアライメント戦略の整合によって進むが、標準的なRLパラダイムは一様性に縛られ、難問への対応に非効率を生む。これに対抗するため、動的に訓練分布を適応させるMulti-Adversary GDROを提案。オンライン難易度分類器を導入し、プロンプトを難易度グループに区分。二つのGDROゲームを提示し、頻度バイアスを排除しつつ難易度の高いプロンプトを強化。Qwen3-Baseでの実験により、精度がGRPOと比較して高まることを確認。新たなカリキュラムが観察され、リソースが推論のフロンティアへシフトすることで性能向上を促進。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Infrastructure #ReinforcementLearning #Architecture #SoftwareEngineering #read-later #On-Policy #Stability #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- ProRL Agentは、マルチターンのLLMエージェントにおける強化学習トレーニングを支援するためのAPIサービスであり、ロールアウトのライフサイクル全体を提供するスケーラブルなインフラです。標準化されたサンドボックス環境を通じて、多様なエージェント駆動タスクに対応し、ソフトウェア工学やSTEM関連のタスクで検証されています。ProRL Agentはオープンソースで、NVIDIA NeMo Gymに統合されています。 Comment

元ポスト:

Loading…

処理が重いロールアウトを独立したhttp serviceとして扱い(rollout-as-a-service)、モデルのtrainingと分離することで、リソース分離、可搬性、拡張性を向上させる。
image




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #Diversity #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- LMは質問に対して複数の回答候補を暗黙のうちに生成するが、訓練後のプロセスで単一の回答に圧縮されることが多い。医療診断や曖昧な質問応答などのタスクにおいては、複数の妥当な回答が必要とされる。本論文では、複数回答を扱う強化学習アプローチを提案し、モデルが単一の前方伝搬で複数の候補を生成できるようにする。実験により、多様性やカバレッジが改善し、コーディングタスクでは精度も向上した。提案手法は、計算資源効率の高い代替として評価されている。 Comment

元ポスト:

Loading…

ユーザのクエリにおいては正解が単一ではないものがしばしば存在するが、現在のRLの枠組みはモデルが出力した一つのbest answerに対して報酬を与えるように設計されているため、これによりモデルの出力が一つのモードに固執する、あるいはmode collapseを引き起こす。これを解決するために、モデルに複数の回答とそのconfidenceを一つのpromptで思考させ、k個出力させる。rewardはk個中何個のanswerが正解だったか、confidenceが実際のanswerのcorrectnessとどれだけ近いかなどに基づいて報酬を与えるような枠組みを採用することで、モデルの出力の多様性やcoverageが増加し、repeated sampling時のトークン効率も改善した、と言う話らしい。




Paper/Blog Link My Issue
#Coding #SoftwareEngineering #read-later #Verification #Proofs #Author Thread-Post Issue Date: 2026-03-28 GPT Summary- 大規模言語モデル(LLMs)はコード生成が可能だが、正確性に限界がある。これを克服するために、Lean 4における階層的証明探索フレームワークを提案し、複雑な検証目標を単純なサブゴールに分解する。分解スコアは訓練報酬と推論時の基準として機能し、最適化とデプロイメントの整合性を保証。Goedel-Code-Prover-8Bを利用し、教師あり初期化後にハイブリッド強化学習で訓練。Leanベースのコード検証ベンチマークでは、62.0%の証明成功率を実現し、強力なベースラインを2.6倍上回る成果を達成した。また、推論時のスケーリングによって成功率の向上が観察された。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Reasoning #SelfDistillation Issue Date: 2026-03-26 GPT Summary- 自己蒸留はLLMの訓練後の効果的な手法であるが、数学的推論においては長さ短縮が性能低下を招くことがある。この劣化は不確実性の表現抑制に起因し、条件付けコンテキストの豊富さによって影響を受けることが示された。具体的には、情報豊富な教師による不確実性の抑制が迅速な最適化を促進する一方で、未知問題に対する性能を悪影響を及ぼすことが確認された。Qwen3-8Bなどのモデルでは、最大40%のパフォーマンス低下が見られ、適切な不確実性の露出が推論の堅牢性に不可欠であることが強調された。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Reinforcement Learning via Self-Distillation, Jonas Hübotter+, arXiv'26, 2026.01

ポイント解説:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #ReinforcementLearning #read-later #Selected Papers/Blogs #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- Delightful Policy Gradient(DG)は、ポリシー勾配の不均衡なアップデートを解消するために、アドバンテージと行動の驚きの積に基づいたゲーティングを導入。これにより、単一コンテキスト内での方向性の精度を理論的に向上させ、複数コンテキスト間での期待される勾配を精密に近づけることができる。実験的に、DGはREINFORCEやPPOをMNISTや連続制御タスクで上回り、特に難易度の高いタスクで顕著な改善を示した。 Comment

関連:
- [Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02

元ポスト:

Loading…

所見:

Loading…

著者ポスト:

Loading…


不要なbackward passの重みを下げるのではなく完全に無くすことで効率化する




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #read-later #Off-Policy #ReplayBuffer #LongHorizon Issue Date: 2026-03-26 GPT Summary- オフポリシー学習を可能にする新しい値ベースのRLフレームワークReValを提案し、過去のデータを効率的に再利用。ReValは速度と性能向上を実現し、GRPOを上回る結果を示した。これにより、価値ベースのRLがLLMトレーニングの実用的な選択肢となることが示唆される。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #AgentSkills #Initial Impression Notes #Test Time Training (TTT) Issue Date: 2026-03-26 GPT Summary- MetaClawは、LLMエージェントが変化するニーズに対応するための継続的メタ学習フレームワークである。失敗軌跡を解析して即座にスキルを合成し、ダウンタイムをゼロにするスキル駆動の適応や、機会主義的ポリシー最適化を通じて、効果的に能力を更新する。これにより、精度を最大32%向上させ、全体のパイプラインの精度も21.4%から40.6%に増加させることが示された。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03

- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03

と一見すると似たような研究に見えるが、

[Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03 の肝は「trajectory中のprocessにおいて活用可能なシグナルがあるから、それをもっと活用しよう」という気持ちで、
本研究は「失敗したtrajectoryに適用するためにSkillを合成し、ユーザが利用しないIdle Timeの間にLoRA + RLでポリシーの重みも更新して賢くしよう」という気持ちであり、目的が異なるように見える。

- [Paper Note] SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks, Xiangyi Li+, arXiv'26, 2026.02

においては、Skillをtaskに関する手続的な知識に基づいてスキルを自己生成しても性能向上せず、むしろ悪化させるような結果が出ており、不用意にSkillを合成すると性能が劣化するという結果が出ている。
本研究は失敗したtrajectoryに対して適応するためのSkill合成である点と、LoRAによってポリシー自体も賢くなるのであれば前提が変わるので話は変わってくるのかな、という印象。




Paper/Blog Link My Issue
#NLP #Alignment #Bias #PostTraining Issue Date: 2026-03-26 GPT Summary- ポスト訓練アライメントは言語モデルを人間の嗜好に最適化するが、人間の行動を単にモデル化することとは異なる。実データを使用した取引や交渉などのゲームにおいて、整列済みモデルはベースモデルに対して選択予測精度で約10倍の優位性を示した。ただし、規範的予測に従いやすい設定では逆転する傾向が見られた。全12タイプの教科書的ゲームでは整列済みモデルが圧倒的に優位であり、特に相互作用の履歴がない第1ラウンドでもその傾向が確認された。これらの結果は、人間行動の予測においてアライメントが規範的バイアスを生じさせ、記述的ダイナミクスが重要な役割を果たすことを示唆している。このように、モデル最適化と人間行動の代理使用との間には根本的なトレードオフが存在する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Optimizer Issue Date: 2026-03-26 GPT Summary- Mousseは、深層ニューラルネットワークにおけるスペクトル最適化の新しいオプティマイザであり、Muonの平等主義的な制約の限界を克服する。Mousseは、Kronecker因子化を用いた白色化座標系で動作し、最適な更新を極分解を通じて導出。実験結果は、MousseがMuonを上回り、12%のトレーニングステップ削減を達成したことを示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #PEFT(Adaptor/LoRA) #read-later #memory #Initial Impression Notes #SoftPrompt #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- 長い文脈をコンパクトに保存するGradMemを提案。これは、推論時に文脈へアクセスできない状況で、文脈を圧縮して数のクエリに応答する。モデルの重みを凍結し、少量のプレフィックストークンで数ステップの勾配降下を行うことで、文脈の再構成を最適化。連想キー-値検索において、GradMemは従来の手法より優れた性能を発揮し、自然言語タスクで競争力のある結果を示す。 Comment

元ポスト:

Loading…

prefixにmemory用のトークンを用意し、TTTの枠組みでcontextのreconstruction lossを通じて圧縮する、という話に見える。tokenはsoft tokenであり、m*d次元の行列で表現される。

要はcontextの潜在表現をReconstruction lossによるTTTでprefix tuningするsoft prompting手法、という感じだろうか。




Paper/Blog Link My Issue
#NLP #Alignment #Evaluation #Initial Impression Notes #Author Thread-Post Issue Date: 2026-03-25 GPT Summary- プロンプトの性能を細粒度で評価するため、安価な自動評価データと限られた人間によるゴールドスタンダードラベルを統合した新しい統計モデルを提案。自動評価スコアを基に生成モデルの潜在表現を事前学習し、小さな較正セットで人間の嗜好に整合。これにより、標準ベースラインを上回る精度で人間の嗜好を予測し、詳細なリーダーボードの構築やモデルのパフォーマンス推定が可能になることを示す。 Comment

元ポスト:

Loading…

少量の人間ラベルとLLMによって合成されたraterでテンソルを作り(モデル、prompt, rateのテンソル)を行列分解することで、効率的に(=人間のrateはscarceなので行列分解を通じて潜在表現に落としてサンプル効率を高める、というより次元の呪いを回避する?)単一のスコアでのモデル評価ではなく、様々な異質のpromptの元でのスコアリング(=finegrained evaluation)を実現する、という話に見える。




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #PostTraining #Selected Papers/Blogs #reading #KeyPoint Notes Issue Date: 2026-03-25 GPT Summary- 計算効率とOOD能力のトレードオフを解消するために、PivotRLという新しいフレームワークを提案。局所的なオンポリシーロールアウトで高い分散を持つ情報量豊かな中間ターンを選別し、機能的に同等なアクションに報酬を与えることでポリシー確率の維持を促進。PivotRLは4つのエージェント系ドメインでインドメイン精度を平均4.17%向上、OOD精度を10.04%高め、少ないロールアウトターンでE2E RLと同等の精度を実現した。NVIDIAのNemotron-3-Super-120B-A12Bに採用され、実運用規模のエージェント後訓練の主力として機能中。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

関連:
- [Paper Note] Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes, Amrith Setlur+, arXiv'26, 2026.01
- [Paper Note] POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration, Yuxiao Qu+, arXiv'26, 2026.01

SFTはデータ効率が良いがOODへの汎化性能が弱い。一方でE2E RLは、OODへの汎化性能が高いが軌跡をfullでロールアウトしなければならず計算コストが高い。この両者の良いところどりができないか?という研究。

SFTデータ(expertのtrajectory)が与えられた時、trajectoryをturnレベルに分割(状態sとアクションaのタプル)。reference policy(RLの初期値に用いるモデル)でロールアウトを行い、

- rewardの分散が0より大きい(すなわち、GRPOのadvanatageが計算可能なターン)
- およびrewardの平均が小さいターン

のみにフィルタリングし、学習する価値の高いターンのみにまずフィルタリングする(D_pivot)。

その上でSFTのような文字列のexact matchによるrewardではなく、ポリシーの出力がactionとしてacceptableなものか否か(完全一致ではなく正しい方向のアクションなら報酬を与える)によって報酬を与えるようなGRPOスタイルのRLで学習する。

E2E RLベースライン(GRPO)と比較して、wall clocktimeベースで4.1--5.5倍程度の速度で同等の性能に到達する。
image

頻繁にPivotRLの名前を目にするようになってきた。




Paper/Blog Link My Issue
#Multi #NLP #AIAgents #Coding #Architecture #SoftwareEngineering #LongHorizon #Asynchronous Issue Date: 2026-03-25 GPT Summary- AIエージェントは孤立したSWEタスクでは高い能力を示すが、依存するサブタスクを含む長期的なタスクには課題が残る。非同期のマルチエージェント協調が期待されるが、同時編集や依存関係の同期、進捗の統合には困難が伴う。これに対処するため、CAIDという新たな協調パラダイムを導入。これにより中央管理者を介したタスク計画と、分離された作業スペースでの同時実行が実現され、進捗の統合が可能になる。実験的にCAIDは、PaperBenchで26.7%、Commit0で14.3%の精度向上を示し、マルチエージェント協調の調整機構としてブランチとマージを明らかにした。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #Scaling Laws #Batch Issue Date: 2026-03-25 GPT Summary- μ-Kurdyka-Łojasiewicz条件下での確率的条件付き勾配法におけるバッチサイズの影響を探求。モメンタムベースのアルゴリズムに注目し、バッチサイズ、ステップサイズ、ノイズの相互作用を分析。バッチサイズを増加させることで初期の精度向上が見られるが、臨界値を超えると利点は減少し得る。理論は最適なステップサイズを予測し、実際の経験則と合致。バッチサイズとステップサイズの選択に関する指針を提示し、適応戦略を提案。実験結果は理論を裏付け、大規模最適化に向けた設計指針を提供。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #MachineLearning #NLP #Scaling Laws #HyperparameterTransfer Issue Date: 2026-03-24 GPT Summary- ハイパーパラメータ転送の重要性を論じ、特にモデルサイズ間の転送に焦点を当てる従来の方法に対抗して、Linear Minimization Oracle(LMO)に基づく新たなハイパーパラメータスケーリング法則を提案。学習率、モメンタム、バッチサイズの閉形式のべき法則スケジュールを導出し、文献の洞察を再現。モメンタムとバッチサイズのスケーリングの相互作用を強調し、最適な性能は多様なスケーリング戦略により達成可能であることを示す。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=4ERabDxDdl&referrer=%5Bthe%20profile%20of%20Antonio%20Orvieto%5D(%2Fprofile%3Fid%3D~Antonio_Orvieto3)




Paper/Blog Link My Issue
#Pretraining #NLP #SyntheticData #read-later #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-03-22 GPT Summary- 合成データ拡張は、限られたデータでの事前学習に有効である。この研究では、有限の計算資源下での損失低減や、無限大に近づくときの損失スケーリングの改善を目指す。合成的再表現との混合で事前学習した場合、異なる分布からの合成データでもi.i.d.検証損失が改善され、データ効率は約1.48倍で頭打ちとなる。新たなアプローチとして、同文書からの合成再表現を用い、短文の代わりに長大なメガ長文を形成する手法を提案。これにより、損失とベンチマークの改善が見られ、データ効率は1.80倍に向上。合成データ生成が増えるほど、メガ長文による効果も増大することが示された。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

著者ポスト:

Loading…

- データよりもコンピューティングリソースのスケーリングの方が早く進んでおり、データ効率の高い事前学習レシピが重要となっている
- 事前学習において、合成データがi.i.d.なwebデータの損失減らすことに寄与するかを調査
- 300Mモデルで200M tokenを学習した際にどれだけi.i.d.なwebデータのlossを低減させられるかを調査
- 最初に最もシンプルなdata augmentationであるrephrasingを調査したところ、文書単位でのrephrasingの回数が増えるにつれて、web lossとdownstreamベンチマークでのエラー率が単調に改善
- 続いて、ある文書をrephraseした文書を結合することで、単一の大きな文書(=megadoc)を構成する手法を提案し、megadocを利用することでさらにlossが改善することを確認。megadocの構成方法として下記三種類を提案し:
- Real First Stitched: `文書に対するrephraseをG個生成し、それらを結合することでmegadocを構成する手法。実データを結合の頭にもってくる。
- Real Last Stitched: Real First Stichedと同様の処理をするが、実データを結合の末尾に持ってくる手法
- Latent Thoughts: 文書をG+1個の同じ長さのピースに分割し、ピース間を埋めるrationaleを合成して結合する手法。rationaleはタグで囲う。
- Real First Stitched と Real Last Stitched を比較したところ、後者の方が性能が良かった。
- 後者の方が性能が良い考察として、epiplexity [Paper Note] From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, Marc Finzi+, arXiv'26, 2026.01 の観点から考察をしている。前提として実文書の方が複雑で情報量が多いと考えたときに、Real First Stitched の場合は実文書の情報からrephraseを学ぶという簡単な変換(生成)を実施すればよいのに対し、Real Last Stitchedの場合逆で、rephraseからより詳細で複雑な実文書に変換(生成)するというタスクを実施せねばならない。このため、後者の方がより計算的に困難な関数を学習する必要があり(すなわち、epiplexityが高い学習設定ということ; epiplexityが高い学習設定の方がモデルの汎化性能が高くなる)、学習の結果より高い汎化性能を獲得しているのではないか、と考察している。

image

- また、モデルをアンサンブルした場合の性質についても考察がされており、self-distillationは単体モデルの性能を向上させることに寄与するが、アンサンブルするモデルの数を増やすと実データを用いたモデルと最終的には性能が同等となることが予測され、達成可能なピーク性能がアンサンブルによってブーストされる効果は観測できなかった。一方で、Rephrasingによる合成データによって学習されたモデルはアンサンブルによって達成可能な性能のピーク値がブーストされると考えられる。
image

関連:
- [Paper Note] Rewriting Pre-Training Data Boosts LLM Performance in Math and Code, Kazuki Fujii+, ICLR'26, 2025.05




Paper/Blog Link My Issue
#NLP #LongContext #read-later #Selected Papers/Blogs #One-Line Notes #RecurrentModels Issue Date: 2026-03-22 GPT Summary- 非線形RNNを再検討し、Matrix-to-Matrix RNN(M^2RNN)を導入。これにより、エンティティ追跡やコード実行などの高表現力タスクに対応可能。M^2RNNは、縮小された状態サイズでも効果的な性能を示し、特に長いシーケンスについて一般化できる。Hybrid M^2RNNでは、既存モデルに匹敵する精度を維持しつつ、再帰層のサイズを縮小。LongBenchでは最先端の手法を超える結果を示し、非線形RNN層の効率的でスケーラブルな言語モデルへの応用を強調。 Comment

HF: https://huggingface.co/collections/open-lm-engine/m2rnn

元ポスト:

Loading…

解説:

Loading…

状態をベクトルではなく行列として保持するRNN。

状態の更新Z_tを、前回の状態H_t-1
に対して重みWによって変換したものと、現在のトークンのk_t,v_tが与えられた時の外積から求まる行列の和を求めた後、tanhで非線形変換することで計算する(式10)。
最終的にforget gate f_tによってZ_tとH_t-1が線形補完されることで、状態H_tが決定される(式11)。
出力y_tは更新された状態H_tにq_tの積をとったものと、v_tを重みw_rで重みづけて残差接続したものの和で求められる(式12)。




Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #Supervised-FineTuning (SFT) #mid-training #PostTraining #Scheduler #One-Line Notes #DownstreamTasks Issue Date: 2026-03-20 GPT Summary- 学習率スケジューリングが大規模言語モデルの事前学習とSFT後の性能に与える影響を調査。特に、ウォームアップ後に学習率を一定に保つWarmup-Stable-Only(WSO)スケジューラが、減衰ベースのスケジューラよりも一貫してSFT後の性能を向上させることを示す。分析によれば、WSOは平坦な極小値を維持し、訓練戦略としての有用性を強調。これにより、モデルの適応性を高める指針を提供。 Comment

元ポスト:

Loading…

事前学習中にweight decayを実施しない方が、(事前学習終了時点でのlossは劣化するが)SFT後のdownstreamタスクの性能を高める。




Paper/Blog Link My Issue
#Pretraining #NLP #Supervised-FineTuning (SFT) #Scaling Laws #mid-training #PostTraining #read-later #DataMixture #Initial Impression Notes Issue Date: 2026-03-20 GPT Summary- 専門化事前学習(SPT)を通じてドメインデータを再利用し、モデルの性能を向上。SPTは微調整後の一般能力を保持し、必要な事前学習トークン数を最大1.75倍削減。特定のドメインにおいて、SPTは3Bモデルを上回る性能を示し、過適合スケーリング則を導出。事前学習段階で専門ドメインデータを導入することで、一般性能も改善し、計算量を抑えた結果を得る。訓練の早い段階でのドメインデータの統合が重要。 Comment

Finetuningに使うデータをpretraining段階から混ぜておくとより効果的という話らしい。事前学習データの量が増えるためより多くのbudgetが必要になるので効果的なmixtureのためのスケーリング則も構築したとか。興味深い

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #read-later #Personality Issue Date: 2026-03-20 GPT Summary- 大規模言語モデルによる性格シミュレーション評価には、実際のインタビュー内容を基にした手法が必要。提案した評価フレームワークは、著名人の23,000件のインタビューから671,000件の質問-回答ペアを抽出し、内容の類似性、事実的一貫性、性格適合、事実知識の保持を評価。実際のインタビュー情報を用いることで、伝記的プロフィールやパラメータ知識に依存する手法よりも優れた結果を示す。評価は、原則的な手法選択を可能にし、実践的な洞察を提供。 Comment

元ポスト:

Loading…

おもしろそう




Paper/Blog Link My Issue
#NLP #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-03-20 GPT Summary- Nemotron-Cascade 2は、30B MoEモデルで3Bの活性化パラメータを持ち、高度な推論能力とエージェント機能を提供します。小型ながら、数学およびコーディングでの推論能力は最前線モデルに匹敵。2025年の国際数学オリンピックなどで金メダル級の性能を示し、パラメータ数は20分の1でも知能密度は高い。新たにSFT後の拡張されたCascade RLで幅広い推論をカバーし、マルチドメイン蒸留を導入して性能向上を実現。モデルのチェックポイントやデータも公開予定。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #ReinforcementLearning #mid-training #read-later #Selected Papers/Blogs #Reference Collection #Author Thread-Post Issue Date: 2026-03-19 GPT Summary- PRISMの中間トレーニング設計の実証研究を行い、様々なモデルやアーキテクチャで統制実験を実施。約270億トークンのデータを使用し、数学、コード、科学ベンチマークで一貫した性能改善を達成。RLパイプラインは推論ベンチマークのスコアを大幅に向上させるも、基盤モデルへの直接適用では効果が薄い。中間トレーニングがモデル性能を効果的に高めることを示し、信頼性の向上に役立つ中間トレーニングの重要性を強調。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #SSM (StateSpaceModel) #Architecture #ICLR #Selected Papers/Blogs #Initial Impression Notes #LinearAttention Issue Date: 2026-03-18 GPT Summary- 推論効率がLLMの性能に与える影響に注目し、計算量を抑えつつ高い性能を持つモデルの開発が求められている。Transformerモデルは品質は高いが、計算コストが増加するため、サブ二次モデルの必要性が高まっている。しかし、最近の線形モデルは効率を優先した結果、性能が損なわれることも多い。これに対し、我々は状態空間モデル(SSM)に基づく三つの改善策を提案し、Mamba-3モデルを開発した。これにより、下流の言語モデリングタスクで平均精度が大幅に向上し、より少ない状態サイズで同等のパープレキシティを実現した。Mamba-3は性能と効率の向上を示す結果を得た。 Comment

openreview時点でのメモ:
- [Paper Note] MAMBA-3: IMPROVED SEQUENCE MODELING USING STATE SPACE PRINCIPLES, 2025.10

元ポスト:

Loading…

最近はMambaのようなSSM(あるいはlinear attention)とfull attentionのハイブリッドなdecoder-onlyモデルが主流になりつつあるため、抑えておいた方が良いだろう。




Paper/Blog Link My Issue
#NLP #Transformer #Architecture #Sparse #Depth #Initial Impression Notes #CurseOfDepth Issue Date: 2026-03-17 GPT Summary- LLMの深さの呪いを軽減するために、スパース性が分散伝播を調整する役割を示す。暗黙的スパース性と明示的スパース性の2つの源泉を扱い、出力分散の削減と機能的分化を促進。深いモデルを効果的に利用するための実践的な知見を提供し、下流タスクで精度を4.6%向上させた。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02

モデルのアーキテクチャやパラメータのスパース性が curse of depth を是正するという話らしい。
Figure1の記号はそれぞれ以下を表しており
- T: context window
- lambda: weight decay
- G: Group Query Attention
- MoE: Mixture of Experts

context windowを大きく、weight decayを強く(重みの正則化としての効果が強まる)、GQA (Attentionのスパース性が高まる)、MoE (MLPのスパース性が高まる)という感じだと思われ、特にGQA, MoEが大きく寄与してそうに見える。

image




Paper/Blog Link My Issue
#NLP #Transformer #Attention #Architecture #Selected Papers/Blogs #One-Line Notes #CurseOfDepth Issue Date: 2026-03-17 GPT Summary- 深さスケーリングによる信号の劣化を克服するため、混合深度アテンション(MoDA)を提案。MoDAは、各アテンションヘッドが現在の層と前層のKVペアに注意を向けることで特徴を保持し、効率的なメモリアクセスを実現。15億パラメータモデルでの実験では、強力なベースラインを超え、平均困惑度を0.2ポイント改善し、ダウンストリームタスクで2.11%の性能向上を達成。計算オーバーヘッドはわずか3.7%。MoDAは深さスケーリングにおける有望なアプローチであることが示された。 Comment

元ポスト:

Loading…

transformerにおけるattentionを、現在処理をしているトークンの、ある深さlのattentionにおいて、l-1以下の(=自身より浅い)layerの同じトークンに関するK, Vを参照できるように拡張する。
image

所見:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #read-later #Selected Papers/Blogs Issue Date: 2026-03-17 GPT Summary- MR-Searchは、自己反省を活用したエージェント主体の文脈内メタ強化学習(RL)手法を提案する。過去のエピソードに基づき探索戦略を適応させることで、報酬が乏しい状況でもポリシーを最適化する。エピソード後に生成される自己反省を次の試行に活用することで、テスト時の探索効率を向上させる。さらに、ターンレベルでの相対アドバンテージを推定する多ターンRLアルゴリズムを導入し、細粒度のクレジット割り当てを実現。様々なベンチマークでの実験により、MR-Searchが従来のRL手法よりも優れた性能を示し、相対的に9.2%から19.3%の改善を達成した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Attention #Architecture #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-03-17 GPT Summary- Attention Residuals(AttnRes)を提案し、層間の出力をソフトマックス注意機構で集約することで、深層モデルの寄与を強化。Block AttnResによりメモリと通信のオーバーヘッドを軽減しつつ、実用的な残差接続の代替として機能。実験により、モデルサイズにかかわらず改善を確認し、すべてのタスクで下流性能の向上を実現。 Comment

元ポスト:

Loading…

Opus4.6による可視化:

Loading…

- [Paper Note] DeepCrossAttention: Supercharging Transformer Residual Connections, Mike Heddes+, ICML'25, 2025.02

で既に1年以上前に同様の手法が提案されており、テクニカルレポートから引用されていないという指摘がある

Loading…

解説:

Loading…

poster skillsによる可視化:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #PRM #KeyPoint Notes #Reference Collection #Author Thread-Post Issue Date: 2026-03-14 GPT Summary- OpenClaw-RLは、エージェントの相互作用から生成される次状態信号を用いたオンライン学習フレームワークである。各エージェントのアクションに対するユーザーの反応やツールの出力を利用し、一つのポリシーで複数のトレーニング問題を同時に学習する。次状態信号は評価信号と指示信号を含み、前者はアクションの成功度を示し、後者は改善点を指摘する。非同期設計により、モデルはリアルタイムでリクエストに応じ、ポリシーを更新する。個人用エージェントや一般エージェントに適用することで、ユーザーのフィードバックを活用し、スケーラブルな強化学習を実現する。 Comment

元ポスト:

Loading…

解説:

Loading…

日本語解説: https://tech.layerx.co.jp/entry/openclawrl-agenticrl

テクニカルレポートを見ると情報量が非常に多くて圧倒されてしまうが、著者ポストを鑑みるに本研究の肝は下記である。

既存のAgentic RLは、Agentがaction a_tを実施した後に環境の状態がs_t+1に変化するが、それをcontextとして活用し次のactionを生成している。しかし、ただcontextとして活用するよりももっと有用な使い方があるのではないか、という主張をしているように見え、具体的には以下の2つの無駄が生じているという指摘で
- 次のstateは前回のアクションの暗黙的な評価を与えており、これを捨ててしまっている。たとえば、ユーザは満足いっていないことをqueryするかもしれないし、テストが通ったら成功、エラーが出たら失敗という評価に関するシグナルが潜んでいる。これは主に数学ドメインで利用されてきたProcess Reward Modelによるプロセスに関するRewardとは対照的に、verifiableなドメインを超えて自然なインタラクションの中で生じるシグナルから評価できる。
- 上記は評価に関するシグナルだが、もう一つのシグナルとして方向性に関するシグナルが得られる。たとえば、「あなたは最初にファイルを確認すべきだ」というqueryがs_t+1として得られたとする。これは、単にa_tが失敗だっただけでなく、「どのトークンが、どのように」誤っていたかに関する具体的なフィードバックとみなせる。たとえば、errorに関するtraceは具体的などこを修正すれば良いかのシグナルである。現在のRLVRの枠組みはこれらのシグナルを(最終的に得られる)sparseな単一のスカラー値に落としてしまっており、これら精緻な方向性に関するシグナルを完全に捨て去ってしまっている。

前者についてはBinary RL[^1]によってシグナルを拾え、

後者についてはs_t+1からtextualなhintを抽出しteacher contextとして活用することで、トークン単位でのadvantageを計算できる[^2]。

そしてこれら両方を組み合わせることで、より良い結果を得ることができる、といったことが著者ポストに書かれている。

元論文自体は部分的にしか読めていないのだが、論文のメッセージとしては、s_t+1の情報にはまだ活用できるシグナルがあるのにそれが見過ごされていて、現在のRLVRの枠組みではスカラー報酬に埋もれてしまっているという課題意識が肝だと感じた。

また、手法的な観点で言うと、日本語解説と、テクニカルレポート4.1.2節に書かれている通り、リアルタイムなユーザとの対話を前提てして考えた時に、ロールアウトは1つしか現実的に存在しえないため(複数ロールアウトに対してユーザからのフィードバックs_t+1を得ることは実用的な設定では非現実的)GRPOが適用できない、という点はなるほどなぁ、と感じた。

[^1]: a_t, s_t+1が与えられた時に{0, 1, -1}を返す何らかのProcess Reward Modelを定義し、m回独立した施行を実施しmajority votingをすることでreliableなa_tに対するRewardを得る(4.1.1節)。

[^2]: s_t+1から抽出可能なhintを追加のcontextとして与えたポリシーを教師、hintなしのポリシーを生徒とし、教師と生徒のa_tに対するトークンの尤度の差分をとることでtoken単位のadvantageを得る。すなわち、hintが与えられたときにa_tで尤度が低くなるトークンがあれば、そのトークンにはペナルティが課されることになる(4.2.2 Step4)。




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #Environment #autoresearch/RSI Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment

pj page: https://posttrainbench.com/

元ポスト:

Loading…




Paper/Blog Link My Issue
#InformationRetrieval #NLP #AIAgents #Reasoning #COLM #DeepResearch #Author Thread-Post Issue Date: 2026-03-12 GPT Summary- ディープリサーチエージェントは、検索システムで重要な役割を果たしており、明示的な自然言語による推論を生成してクエリを改良する。これにより、意図と文脈情報を活用する新しいアプローチを提案。具体的には、(1) 推論に基づく検索(Reasoning-Aware Retrieval)と、(2) データ合成手法(DR-Synth)を導入。これらを組み合わせてAgentIR-4Bモデルを構築し、BrowseComp-Plusベンチマークで68%の精度を達成、従来モデルよりも大きな改善を示した。 Comment

pj page: https://texttron.github.io/AgentIR/

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #PostTraining #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- Re^2は、強化学習の新手法であり、LLMsが効率的な推論経路を放棄し、必要に応じて再解法を選択することを学習。これにより、従来のRLVRよりも推論性能が30%以上向上し、サンプル数の増加に伴いテスト時の性能も改善。初期の思考過程の質に依存せず、解答の質を高めることが可能となる。 Comment

元ポスト:

Loading…

CoTの初期の推論の時点で推論の方向性が決まってしまい、うまくいかないものはうまくいかないので、まっさらな状態から解き直す挙動をRLで増幅させる、という話に見える。Self Correctionではなく、完全にtrajectoryを無くすのだろうか?だとしたら、trajectoryの質を動的に検証してその生成は放棄する、というアプローチとやっていることがあまり変わらない気はするのだが、わざわざモデルの内部パラメータに対して介入してその挙動を増幅させる意味はあるのだろうか?




Paper/Blog Link My Issue
#NLP #Dataset #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #DataFiltering #Initial Impression Notes Issue Date: 2026-03-12 GPT Summary- 高品質なコード生成モデルの訓練には高品質なデータセットが必要だが、既存のデータは様々な問題を抱えている。本研究では、系統的なデータ処理フレームワークを導入し、自動難易度フィルタリングを用いて難易度の高い問題を保持しつつ簡単な問題を排除。得られたMicroCoderデータセットは、多様な競技プログラミング問題を含み、性能向上を達成。評価によれば、三倍の性能向上を示し、難易度を意識したデータ選定がモデルの性能向上に効果的であることが明らかになった。 Comment

元ポスト:

Loading…

コーディングドメインにおいて、難易度の高いコーディング問題を収集(単純な問題をフィルタリング)することで、RLにおいて高い学習効率が得られる、という話に見える




Paper/Blog Link My Issue
#Analysis #NLP #ReinforcementLearning #PostTraining #read-later #RLVR #MajorityVoting #Scalability Issue Date: 2026-03-12 GPT Summary- URLVRは、地上真値ラベルなしで報酬を導出し、LLM訓練のボトルネックを克服する。内部報酬と外部報酬に基づく手法の分析を行い、内部報酬が一貫したパターンを示すことを発見した。モデルの事前分布によって崩壊のタイミングが決まり、内部報酬は小規模データセットでの効果的な利用が可能であることが示された。外部報酬手法も検討し、改善の可能性を示唆する。これにより、内部URLVRの限界を明らかにし、スケーラブルな代替手段への道を提示する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #DataMixture Issue Date: 2026-03-12 GPT Summary- データ混合は大規模言語モデルの訓練における異なるデータソースの組み合わせを指し、効果的な混合選択が下流性能に影響を与える。従来手法は高コストの探索や外挿の失敗に悩む。本研究では、容量認識型混合則(CAMEL)を提案し、モデルサイズと混合の相互作用を用いて検証損失をモデル化。検証損失から下流性能を予測し、計算予算を効果的に配分する方法を導入。最終的にMixture-of-Expertsモデルで実証し、混合最適化コストを50%削減し、下流性能を最大3%向上させることを示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Pretraining #NLP #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Reference Collection #Scalability #Author Thread-Post Issue Date: 2026-03-12 GPT Summary- MoEモデルのスケーリングには、パラメータの増加によるメモリ、通信、計算の制約が伴う。これを解決するために、メモリの再計算やオフロード、通信の最適化、計算のグループ化などを統合的に最適化するフレームワークを提案。これにより、長い文脈の効率化や低精度訓練サポートも実現。数兆パラメータのMoEモデルを数千台のGPUで訓練可能なオープンソースソリューションとして、実運用向けの指針を提供。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#NLP #KnowledgeEditing #MachineUnlearning(MU) Issue Date: 2026-03-10 Comment

Machine Unlearning関連研究:
- [Paper Note] Machine Unlearning of Pre-trained Large Language Models, Jin Yao+, ACL'24, 2024.02
- [Paper Note] From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks, Zhexin Zhang+, arXiv'24, 2024.07
- [Paper Note] Large Language Model Unlearning, Yuanshun Yao+, arXiv'23, 2023.10
- [Paper Note] Large Scale Knowledge Washing, Yu Wang+, ICLR'25, 2024.05
- [Paper Note] LLM Unlearning via Loss Adjustment with Only Forget Data, Yaxuan Wang+, arXiv'24, 2024.10




Paper/Blog Link My Issue
#NLP #AIAgents #read-later #Initial Impression Notes #AgentHarness Issue Date: 2026-03-08 GPT Summary- 言語モデルは、エージェントとして利用する際に最適でない行動をとることがあります。特に、Gemini-2.5-FlashはKaggle GameArenaのチェス競技で78%の敗北が違法手に起因しています。そこで、本研究では、ゲーム環境のフィードバックを用いて自動的に“ハーネス”を合成する手法を提案します。この手法は、145のTextArenaゲームにおいて全ての違法手を防ぎ、小型モデルのGemini-2.5-Flashがより大きなモデルを上回る性能を示します。また、Gemini-2.5-Flashは方針をコードとして生成し、意思決定時にLLMを必要としなくなります。得られたコードは、16の1人用ゲームでより高い平均報酬を得ており、カスタムのコード・ハーネスを用いることで、より大きなモデルを上回る性能を示します。 Comment

元ポスト:

Loading…

あのMurphy本の著者であるMurphy氏が著者にいる👀




Paper/Blog Link My Issue
#NLP #LongContext #memory #One-Line Notes #RecurrentModels Issue Date: 2026-03-08 GPT Summary- Memory Caching(MC)を用いてリカレントモデルのメモリを強化。MCはメモリ状態をキャッシュし、RNNの実効メモリ容量をシーケンス長に応じて拡張する。これにより、O(L)の計算量のRNNとO(L^2)の計算量のTransformersの間でトレードオフを提供。MCのバリアントを実験し、文脈内リコールタスクでTransformersに迫る性能を示し、最先端のリカレントモデルを上回ることを実証。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models, Xiang Hu+, arXiv'25, 2025.11

トークンをセグメントに分けて、セグメントごとにメモリの状態をキャッシュとして保存。現在の最新トークンに対するメモリ(online cache)と過去のセグメントごとのキャッシュ(memory soup)の組み合わせによって、outputを計算する。これにより、系列長Lの2乗の計算量から、セグメント長*N*系列長Lの計計算量に落としつつ、transformerのquadraticにメモリ量が増えるが計算が重い、RNNの線形時間でメモリ更新ができるがlong contextにおいては忘却が生じるという性質の良いところ取りをする、という話に見える。




Paper/Blog Link My Issue
#Survey #Analysis #NLP #AIAgents #read-later #Selected Papers/Blogs #memory #Initial Impression Notes Issue Date: 2026-03-07 GPT Summary- エージェント記憶システムは、LLMエージェントが長い相互作用を維持し、長期推論を支援するが、経験的基盤が脆弱である。既存のベンチマークは不十分で、評価指標が実用性に合致せず、性能差が大きく、コストも見落とされがちである。本調査では、エージェント記憶を構造的に分析し、4つの記憶構造から成るMAGシステムを提案。主要な問題点として、ベンチマークの飽和、評価指標の妥当性、精度のバックボーン依存、記憶維持によるオーバーヘッドを挙げ、信頼性の高い評価とスケーラブルなシステム設計の方向性を示す。 Comment

元ポスト:

Loading…

AI Agentの研究に関してtaxonomyが定義されており、研究分野全体の進展を外観するのに良さそう。




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #mid-training #PostTraining #read-later #Selected Papers/Blogs #Scheduler #One-Line Notes #Data Issue Date: 2026-03-07 GPT Summary- ターゲット領域向けの言語モデルの構築には、汎用ウェブテキストでの事前学習とターゲットデータでのファインチューニングが行われる。驚くべきことに、ファインチューニング中に汎用データをリプレイすることで、ターゲットタスクの性能が向上することが確認された。具体的には、4百万トークンのターゲットデータを使用した場合、汎用リプレイによりデータ効率が最大1.87倍、ミッドトレーニングで2.06倍向上した。また、事前学習中にターゲットデータが少ないほどリプレイ効果が高いことが分かった。80億パラメータのモデルでの実験により、エージェントのウェブナビゲーション成功率やバスク語の質問応答精度が向上したことを示した。 Comment

元ポスト:

Loading…

事前学習以後の中間学習やファインチューニング(事後学習)において、特定のドメインやタスクに特化させるための追加の学習を行う際に、破壊的忘却を防ぐために一定量の事前学習データを混ぜることはよく行われていたが、実際には破壊的忘却を防ぐだけでなく、ターゲットドメインの学習効率を大幅に高める(1.5Bモデルの実験ではファインチューニングでは1.87倍、中間学習では2.06倍)ことがわかり、これは70B級の大規模なモデルでも同様に生じることが明らかになった、という話らしい。興味深い。

解説:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ScientificDiscovery #TreeSearch #Physics #Initial Impression Notes Issue Date: 2026-03-07 GPT Summary- 本論文では、AIが理論物理学の未解決問題を解決することで数学的発見を加速できることを示す。Gemini Deep Thinkを用いたニューロ-シンボリックシステムが、宇宙ひもによる重力放射のパワースペクトルについて新しい解析解を導出。エージェントはコア積分の評価を通じて、従来の部分的な漸近解を改善。探索制約とフィードバックループを詳細に説明し、最も効果的な解析法としてGegenbauer多項式を特定。これにより、漸近解が数値結果と整合し、量子場理論とも関連づけられることを示した。 Comment

元ポスト:

Loading…

Gemini Deep Thinkが今度は理論物理に関する未解決問題を解決したらしい?




Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #Coding #SoftwareEngineering #One-Line Notes #CI Issue Date: 2026-03-07 GPT Summary- 静的なバグ修正だけでなく、複雑な要求変更に対応するため、継続的インテグレーションに基づく新しいベンチマークSWE-CIを提案。これにより、コード生成の評価が短期的な正確性から長期的な保守性にシフトし、100のタスクを通じてエージェントの分析およびコーディング能力の維持を評価する。SWE-CIは実世界の進化履歴に基づいており、コード品質の長期的な維持についての洞察を提供。 Comment

元ポスト:

Loading…

SWE Agentの現在の主要な評価パラダイムである個々の機能のバグフィクスなどの短期的な評価から、より長期的なメンテナンスなどのタスクで評価をする




Paper/Blog Link My Issue
#PairWise #NLP #read-later #Initial Impression Notes #SelfVerification Issue Date: 2026-03-06 GPT Summary- 複雑な推論タスクにおける性能向上のため、ペアワイズ自己検証を活用したフレームワーク$V_1$を提案。$V_1$は、不確実性の高い候補ペアに動的に検証計算を割り当てる$V_1$-Inferと、生成器と検証器を共同訓練する$V_1$-PairRLから成る。これにより、コード生成や数学的推論のベンチマークで顕著な性能向上を実現。また、後者は従来の手法より高い効率を達成。 Comment

元ポスト:

Loading…

self-verificationが進化するとdownstreamタスクの性能に多大な影響が出るし、かつ既存のモデルはフロンティアモデルであってもself-verificationは何らかのガイダンスがないと上手くできないことが示されているので [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11 、もしガイダンス無しでうまくできるという話であればおもしろそう

- [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #Regularization #ICML Issue Date: 2026-03-05 GPT Summary- 大規模言語モデル(LLMs)のスケーリング法則は記述的であり、データ効率を覆す研究はほとんどなかった。そこで、滑らかなセマンティック多様体上の測地線を辿るGeodesic Hypothesisを提案し、新しいタスクSemantic Tube Prediction(STP)を導入。このタスクはJEPAを言語に一般化し、隠れ状態の軌跡を測地線の近傍に制限することで、多様性を保ちつつ信号対雑音比を改善する。実験により、STPがNL-RX-SYNTHデータセットで基準精度を16分の1のデータ量で達成し、既存のスケーリング法則を超える可能性を示した。 Comment

元ポスト:

Loading…

openreview: https://openreview.net/forum?id=M8l3MmWaQB




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Quantization #Optimizer #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-05 GPT Summary- パラメータあたりのメモリを50%以上削減する最適化手法FlashOptimを提案。改善されたマスタウェイト分割と8ビットオプティマイザの量子化を活用し、AdamWのメモリを16バイトから7バイト、勾配リリースによりさらに5バイトに削減。これによりモデルのチェックポイントサイズも大幅に減少し、品質を保持しつつ視覚と言語タスクでの劣化は見られなかった。 Comment

元ポスト:

Loading…

すでにpip install flashoptimで利用可能。SGD, Adam, AdamW, Lionがサポートされている。8Bモデルの訓練に必要なピークメモリを35%削減し、チェックポイントのサイズもも57%小さくなるという優れもの。実験結果では性能の劣化もなしという報告。
image

github: https://github.com/databricks/flashoptim




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Transformer #MultiModal #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #read-later #Selected Papers/Blogs #WorldModels #UMM #Author Thread-Post Issue Date: 2026-03-05 GPT Summary- 視覚的データは言語を超えるマルチモーダルモデルの進展に重要で、我々は制御された前訓練実験を通じてその要因を明らかにした。Transfusionフレームワークを用い、テキストや視覚データで統一的に訓練し、以下の洞察を得た:(i) RAEが最適な視覚表現を提供;(ii) 視覚とテキストは相補的で相乗効果を生む;(iii) 統一学習が世界モデリングに繋がる;(iv) MoEが効率的なスケーリングを可能にする。視覚データが言語より多く必要であることを示し、MoEが両者の調和を図ることを提案。 Comment

元ポスト:

Loading…

RAE:
- [Paper Note] Diffusion Transformers with Representation Autoencoders, Boyang Zheng+, arXiv'25, 2025.10

著者ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #read-later #Selected Papers/Blogs #Live #One-Line Notes #Environment Issue Date: 2026-03-05 GPT Summary- SWEエージェントの強化学習を支えるため、実世界のソフトウェア工学タスクを自動収集し、再現可能な環境を構築するSWE-rebench V2を提案。20言語・3,600超のリポジトリから32,000以上のタスクを集め、厳選したコンテンツで信頼性のあるトレーニングデータを提供。また、タスク生成に必要なメタデータも加え、エラー要因を明示。データセットと関連リソースを公開し、多様な言語での大規模なSWEエージェントのトレーニングを支援。 Comment

元ポスト:

Loading…

environment: https://huggingface.co/datasets/nebius/SWE-rebench-V2?row=5

関連:
- [Paper Note] SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, Ibragim Badertdinov+, NeurIPS'25, 2025.05

以前の研究ではpython特化だったが、今回はlanguage-agnosticな環境になっている。

合成データではなく、実際のissue-resolutionのヒストリに基づいたデータセットであることに注意




Paper/Blog Link My Issue
#Analysis #NLP #Dataset #AIAgents #Evaluation #read-later #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-03-04 GPT Summary- AIエージェントの開発は、労働市場のベンチマーク上で進められているが、その代表性は不明である。本研究では、43のベンチマークと72,342のタスクを分析し、エージェント開発と米国労働市場の職業との整合性を測定。プログラミング重視の開発と人間労働の価値の乖離を指摘し、エージェントの自律性を評価することで実用的な指針を提供。最後に、社会的に重要な労働を捉えるベンチマーク設計のための3つの原則を提案。 Comment

元ポスト:

Loading…

AI Agentのベンチマークは実際の人間の労働に本当に紐づいたタスクで評価されているのか?という疑問に答えてくれる研究のようで、実際のAI Agentのベンチマークと人間の業務、それらのcapitalをマッピングしたところ、現在のAI Agentのベンチマークは過剰に数学とコーディングドメインに偏っており、実態としての人間の労働や、それらの中でcapitalが集中しているドメインに対するカバレッジが大きく不足していることがわかった。

ドメインごとに見ると、デジタル化がされていて高付加価値のドメインのいくつか(マネジメントや法務)のベンチマークは少なく、スキルをベースに見るとベンチマークは情報取得やエンジニアリングといった狭いスコープばかりに焦点が当たっていて(これらの人間の労働に占める割合は<7%にすぎない)、多くの他のスキルが無視されている状況とのこと。

また、エージェントの自律性を細分された尺度で評価するために、どの程度のレベルの複雑さのタスクであればreliableにagentがこなせるかという観点を導入し、タスクの複雑性に関するスケールを導入し比較を可能にした、といった話が元ポストに書かれている。

現在提供されているベンチマークにおいて、おそらくタスク全体のうちの個別のサブタスクごとに複雑度をラベル付けして、複雑度を軸にサブタスクの成功/失敗をtrajectoryから分析することで、タスクの複雑度を軸に成功率を分析したグラフを見ると、タスクの複雑度に対して基本的にはどのドメイン、スキル、エージェントフレームワーク、バックボーンモデルであれ複雑度な上がれば上がるほど成功率は減少していく傾向にあり、成功率は最終的に20%--0%付近まで低下する。

最終的に、エージェントの評価ベンチマークにおいては、実際の労働に対するカバレッジ、現実的であること(=実際のドメインや必要となるスキルを捉えており、実タスク全体を捉えたようなものが必要でFigure4にベンチマークごとのドメインとスキルのカバレッジが可視化されている)、より粒度の細かい評価が必要(タスク全体の成功/失敗でのみ評価すると、タスクのどこまでできていたのか?という重要なシグナルが欠落する)であることが議論されている。




Paper/Blog Link My Issue
#NLP #SyntheticData #Privacy #One-Line Notes #Initial Impression Notes #DifferentiallyPrivate Issue Date: 2026-03-04 GPT Summary- DP-RFTを用いて、プライベートデータに直接アクセスせずに合成データを生成するためのオンライン強化学習アルゴリズムを提案。合成サンプルの報酬信号にDP保護済み最近傍投票を活用し、LLMが期待されるDP投票を最大化するよう学習。長文やドメイン特化のデータ生成において、プライベートデータの境界を尊重しつつ、従来の手法とのギャップを縮小することに成功。 Comment

元ポスト:

Loading…

プライベートなデータの保有者が差分プライバシーが保護された状態でLLMのロールアウトに対してvotingによるrewardを返せば、個別のLLMはプライバシーに保護されたデータを見なくてもvotingによるスコアが最大となるように学習できるというアイデア。これによりプライバシーによる課題によりデータがオープンにならないドメインでも、この枠組みでLLMをpost-trainingすれば、LLMが合成データの生成器として振舞えるため、プライベートなドメインのデータスケーラビリティの課題の解決につながるのではという提案

これは利用規約などで個人情報の扱いに関して何らかのユーザとの取り決めがあった場合、どういう扱いになるのだろうか。
Gemini Proに質問して得た感想としては、少なくとも差分プライバシーによってreward signalが個人情報を含むデータではないと保証されたとしても(プライバーバジェットがどの程度設定されていれば問題ないのかといった合意があるかと言われると怪しいらしい)、reward signalを計算する部分においては個人情報を含むデータを活用しているため、個人情報利用のスコープにそれが許容されるようなステートメントが入っていないと、こういった手法を実施することは無理なのかもしれない。




Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #Annotation #DPO #PostTraining #Selected Papers/Blogs #Personality Issue Date: 2026-03-04 GPT Summary- CharacterFlywheelは、Instagram、WhatsApp、Messenger向けのLLM改善のための反復プロセスであり、LLaMA 3.1を基に15世代のモデルを洗練しました。2024年7月から2025年4月にかけてのA/Bテストで、8モデル中7モデルが新たなエンゲージメント向上を示し、最大8.8%の幅、19.4%の深さで改善しました。指示遵守率も大幅に向上し、過学習防止策やダイナミクスの対策も考慮されています。この研究は、数百万人のユーザー向けのLLM活用における科学的理解を進めます。 Comment

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #AIAgents #Coding #SoftwareEngineering #Initial Impression Notes #AGENTS.md Issue Date: 2026-03-03 GPT Summary- AIコーディング・エージェント(CodexやClaude Codeなど)がソフトウェア・リポジトリに与える影響を調査。AGENTS.mdファイルの有無で、GitHubプルリクエストにおけるエージェントの実行時間とトークン消費が異なることを示し、AGENTS.mdの存在が実行時間を28.64%、トークン消費を16.58%削減する一方、タスク完了挙動は同等であることが分かった。これに基づき、AIコーディング・エージェントの設定やデプロイに関する実務的な含意を議論し、リポジトリレベルの指示の重要性を明らかにする。 Comment

関連:
- [Paper Note] Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?, Thibaud Gloaguen+, arXiv'26, 2026.02

こちらの研究ではどちらかというとAGENTS.mdによってinference costが増大するようなことが示されているが、具体的にAGENTS.mdの内容としてどのような違いがあるだろうか?

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #AIAgents #ScientificDiscovery #TMLR Issue Date: 2026-03-03 GPT Summary- Jr. AI Scientistは、初心者の研究者のワークフローを模倣する自律型AIシステムで、基準論文をもとに限界分析、仮説提案、実験を通じて新しい研究論文を生成する。従来のシステムと異なり、明確なワークフローに従い、複雑な実装を扱う。本研究では、NeurIPS、IJCV、ICLRの研究成果を基に新規手法を提案し、生成された論文が既存の自動システムよりも高い査読スコアを得たことを示す。とはいえ、重要な限界やリスクも指摘されており、人間の専門知識が依然として必要な領域を明らかにする洞察が得られた。 Comment

openreview: https://openreview.net/forum?id=OeV062d8Sw

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #PEFT(Adaptor/LoRA) #FactualKnowledge #memory #One-Line Notes #DownstreamTasks #Test Time Training (TTT) Issue Date: 2026-03-01 GPT Summary- 長い入力を効率的に処理するために、Doc-to-LoRA(D2L)を提案。これはメタラーニングを用いて、単一の前方伝播で情報を効率よく蒸留し、適応型LoRAアダプタを生成する。D2Lにより、推論時のレイテンシとメモリ消費を削減し、文脈を超えてゼロショット精度を向上。実世界のデータセットにおいても、標準的な文脈蒸留を上回る性能を示す。 Comment

- [Paper Note] Text-to-LoRA: Instant Transformer Adaption, Rujikorn Charakorn+, ICML'25, 2025.06

に続く研究。

元ポスト:

Loading…

ポイント解説:

Loading…


Doc-to-LoRAの目的は、文書レベルの情報をメモリの内部パラメータとして埋め込むこと。




Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #read-later #Selected Papers/Blogs #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-03-01 GPT Summary- LLMを用いた自律エージェントの記憶において、実務的応用と評価基準の間にギャップが存在。これを解消するために、AMA-Benchを提案し、実世界のエージェント軌跡とQAを組み合わせて評価。多くの既存システムが因果性を欠き、類似性ベース検索に制約されている中、因果性グラフとツールを用いたAMA-Agentが性能を向上。AMA-AgentはAMA-Benchで57.22%の正解率を達成し、最強記憶システムのベースラインを11.16%上回る。 Comment

元ポスト:

Loading…

実際のAgenticなタスクのユースケースに沿ったmemoryの評価方法を提案している研究のようで、非常に重要な研究に見える。実際はチャットベースのやり取りではなく、エージェントと環境が相互作用しながら生成されるtrajectoryで構成され、指示はagentによって生成された客観的な目的を含んでおり、trajectoryには多くのnoisyな結果やsymbolが含まれる。また、agentが現在のstateから環境に作用した結果が返ってくるというチャットベースの言語的なフロートは異なり、stateに基づいた因果関係が存在するという差がある。

ベンチマークの結果ではGPT-5.2が優れていそうに見えるが、GPTの場合は最新のGPT-5.2で評価されているのに、Claudeに関してはClaude Haiku 3.5で評価されているのは気になる。Claude Opus 4.6やGemini-3で評価したらどの程度の性能になるのだろうか。
image

著者ポスト:

Loading…




Paper/Blog Link My Issue
#GraphBased #NLP #AIAgents #ICLR #Selected Papers/Blogs #memory #One-Line Notes #Grounding #Author Thread-Post Issue Date: 2026-03-01 GPT Summary- REMemは、エピソード記憶を構築し推論するための2段階フレームワークを提案する。オフラインでは、経験を時間情報を含む要旨と事実を結びつけたハイブリッド記憶グラフに変換。オンラインでは、エージェント型リトリーバを用いて記憶グラフ上での反復検索を可能にする。包括的な評価により、REMemは最先端システムを大幅に上回り、エピソード回想と推論タスクでそれぞれ3.4%、13.4%の改善を示す。回答不能な質問に対する拒否行動も堅牢であることが確認された。 Comment

元ポスト:

Loading…

単に知識や事実情報を蓄積するのではなく、過去のイベントに関するsituationalな情報(when,where,who,what)でgroundingをしながら、複数のイベント、タイムラインを跨いでreasoningができるようなepisodic memoryの提案。人間は単に意味情報から記憶を呼び起こすだけでなく、過去のイベントを想起して条件付けした上で時系列になぞって記憶を想起できる能力があることに起因する。

openreview: https://openreview.net/forum?id=fugnQxbvMm




Paper/Blog Link My Issue
#Pretraining #NLP #Optimizer Issue Date: 2026-02-28 GPT Summary- 大規模言語モデルの事前学習における効率的なオプティマイザーの必要性を強調。平坦な方向への更新に特化した行列ベースのオプティマイザーが良好な性能を示す中、リーマン幾何学的常微分方程式(ODE)フレームワークを構築し、一般的な適応アルゴリズムの相互作用を探求。新たに提案するLITEは、平坦な軌跡に沿った学習率の適用で訓練ダイナミクスを改善し、広範な条件下でMuonとSOAPの両方を加速。理論的に速い収束を確認し、効率的なLLM事前学習の体系的アプローチを提供。 Comment

元ポスト:

Loading…