read-later (1126) — 1/6
[Paper Note] Generalization Dynamics of LM Pre-training, Jiaxin Wen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #Generalization Issue Date: 2026-10-02 GPT Summary- LMは事前学習中に、パターンマッチングに依存するオウム的計算と、汎化可能な知能的計算の間を突然行き来する「モードホッピング」を起こす。 玩具的な評価スイートにより、記憶パターンへの依存、System 1的思考、もっともらしさの選択、複数ホップ推論やアライメントの失敗といった現象を捉えた。 この現象は通常の最適化やチェックポイント平均化では説明・解消できず、限られた容量を浅い回路と汎化回路が奪い合う容量配分の問題として説明される。 評価スイートを用いて、推論とアライメントが強く汎化するチェックポイントや、汎化ダイナミクスを安定化する事前学習データを選択できる。 Comment
元ポスト:
[Paper Note] RLTL;DR: Self-improvement by Internalizing Self-generated Feedback, Michael Kirchhof+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-10-01 GPT Summary- 高難度タスクで成功例や教師モデルが存在しない場合に、失敗試行から得た検証器のフィードバックをLLM自身のTL;DR形式の洞察として蓄積し、次の試行をそれらに条件付けて実行するRLTL;DRを提案。 さらに洞察への逆伝播により、タスクから洞察への写像を内部化することで、Pass@128=0のツール呼び出し・コーディングタスクにおいて、標準GRPOのPass@1 0〜1%から学習時14〜31%、評価時12〜13%まで改善。 また、わずか4,000件の(task, insight)ペアで学習するSFTL;DRにより、ロールアウトを用いた手法に近い性能を達成し、簡潔な洞察学習の有効性を示した。 Comment
元ポスト:
[Paper Note] EasyPPO: Stabilizing the Critic Is Key, Xuanyi Zhou+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Actor-Critic #PostTraining #Stability #Author Thread-Post Issue Date: 2026-09-30 GPT Summary- PPOでは、クリティックがLLMの強化学習を不安定化させる二つの失敗モード(打ち切りロールアウトのフィルタリングによる条件付き報酬への偏り、異質なリターンノイズによる高分散プロンプトの支配)を特定。 EasyPPOでは、アクターのみの過長ロールアウトを除外しつつ完了・打ち切り両方のリターンでクリティックを学習し、リターン分散の逆数によるノイズ正規化と小規模ミニバッチで更新を安定化。 コーディング、数学推論、マルチターン検索で標準PPO、VAPO、HL-Gauss PPOを一貫して上回り、PPOに対して最大14.89%の性能向上を達成。 Comment
pj page: https://easyppo.github.io/
元ポスト:
著者ポスト2:
[Paper Note] Context Language Models, Rulin Shao+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-30 GPT Summary- CLMとして、コンテキストをファイルとして管理・更新し、重要情報を自律的に保持する言語モデルを導入。 既存モデルからゼロショットで構築し、単一・マルチエージェントの各種タスクで、精度向上とFLOPs削減を同時に達成。 さらに、自然言語指示によるインコンテキスト・パラメトリック学習とオンライン強化学習により、計算量を抑えつつ未見データやBrowseComp-Plusで性能を向上。 Suffix Cache Reuseも共同設計し、同等性能を維持したままサーバー側計算量を追加で35%削減。 Comment
元ポスト:
著者ポスト:
所見:
[Paper Note] How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining, Lin Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #MultiModal #Scaling Laws #Selected Papers/Blogs #VisionLanguageModel #Backbone #UMM #Initial Impression Notes Issue Date: 2026-09-29 GPT Summary- エンコーダフリーMLLMとエンコーダベースMLLMのスケーリング則を比較。視覚エンコーダを除くと、マルチモーダル目的の計算量最適な配分は大規模モデル側へ移行するが、テキスト目的ではほぼ変化しない。小規模ではエンコーダフリーが劣るものの、約\(10^{22}\) FLOPsで追いつくと予測される。規模拡大に伴い、言語モデルが視覚処理を前段層や専門家ルーティングへ適応させ、事前学習済み視覚エンコーダの優位性が薄れることを示した。 Comment
元ポスト:
ざっくりいうと、モデルサイズを大きくでき、かつ事前学習の計算量を(今回のスケールに限っていうと)約6.1 x 10^21 FLOPs以上投入できるのであれば、Vision Encoderをコネクタで接続するタイプのVLMよりも、Encoder-freeのVLMの方がより良い損失値を得られる傾向にある、という感じだろうか。
[Paper Note] CodeMidas: Scaling Agentic Coding RL Environments from Code Itself, Bowen Ye+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #Selected Papers/Blogs Issue Date: 2026-09-28 GPT Summary- ソースコードのみを用いて、既存コードベースの機能を実行可能なRL環境へ変換するエージェント型パイプラインCodeMidasを提案。 機能探索・仕様化、テスト生成、実行チェックと反復ロールアウトによるタスク検証を行い、23言語・15分野の3,185コードベースから5,545件の訓練タスクを構築。 これらでMiMo-V2.5をGRPO学習することで、Issue修正・プログラム構築・端末操作など5つのベンチマークすべてで性能が向上し、コードベース探索や自己検証も改善。 Comment
元ポスト:
[Paper Note] Scaling Discovery through Test-Time Communication, Jongho Park+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #Selected Papers/Blogs #One-Line Notes #Author Thread-Post #Coordination Issue Date: 2026-09-28 GPT Summary- 共有ディレクトリを介してテスト時に協働するマルチエージェントチームを構築し、独立した並列試行と比較。ARC-AGI-3では、team@$k$が独立に動作する$4k$体のエージェントと同等の成功率を達成し、エージェント数の増加に伴って優位性が拡大。ポリオミノ・パッキングやMNIST分類器の圧縮でも、コミュニケーションにより従来手法や人間による既知の最良解を上回る結果を示した。ただし、計算資源や進捗に対する明確なフィードバックが不足する場合は、独立したエージェントの方が有効。 Comment
元ポスト:
重要
同じ設定(同一モデル、ツール、タスク指示、コミュニケーションプロンプト)のエージェントkが与えられOpen-endなタスクに取り組む際に、エージェント間で通信を許容する場合と、独立試行する場合では、前者の方がエージェントの並列数に対して、性能が累積的に改善する。
エージェントの通信はミニマムなもので構成され、共有されたappend-onlyなログ(非同期のブロードキャストチャネルとして機能)とslotによるディレクトリが存在するのみ。
各エージェントはログ(リーダーボード)に対して顕著な進捗があれば、検証可能な情報と客観的な指標を追記する。これにより、各エージェントは自分たちの試行のverifiableな中間結果を共有し、他エージェントはそれらが採用する価値のあるものかを判断できる。
slotによるディレクトリは共有されているファイルシステム上でアトミックなディレクトリ作成処理を通じて作成され、各slotには単一のアプローチが対応し、エージェントは(ディレクトリ作成はatomicな処理なので)、早い者勝ちでアプローチの取り合いを行う。slotの配下にはアプローチが記述されたファイルが生成され、他エージェントも参照可能とする。
また、コミュニケーションプロンプトによって、エージェントはすでに存在するslotを参照し、他と異なるアプローチを宣言することを求められる。また、他エージェントのアプローチを採用する際は、共有ログ(リーダーボード)上で顕著な進捗があることを条件とする。これにより、エージェントの探索が早々に収束することを防ぎつつ(多様性の確保)も、他エージェントの知見を採用しつつも、少なくとも意味のある差異が一つは存在するよつにする。
性能が改善するためにはいくつか条件があり、
- 通信で共有する結果がverifiableなもので、得られた結果が客観的に良いものか、悪いものかを判断できる必要がある(Table 3)
- エージェントの調整コストを上回る必要がある。つまり、エージェント間の通信の相互作用によるgainが大きくなるまで、エージェントを走らせられるだけのリソースが必要となる (Figure 4)
- 通信によって、各エージェントの探索の多様性が損なわれてはならない
などがある。
複数のベンチマークにおいて、Team-of-kがbest-at-kの性能を上回ることを確認し、かつ、エージェントの並列数が増えるにつれてそのgainが大きくなることを確認した。
また、Team-of-kでは、単一エージェントでは解決できなかったタスクも解決できるようになる現象も観測した。
全体斜め読み、および2.1節直前までしか読めていないが、ざっくりこんな感じだろうか。興味深い。
Claude-Sonnet5-mediumに上記要約をレビューさせたところ、以下のような応答を得た。細かい部分に不正確な部分がありそうなので、しっかり確認した方が良さそう。
```Claude-Sonnet5 (medium)
**大筋は正しいです。** 通信の枠組み、成立条件の3点(検証可能性、計算予算、多様性)、結果の方向性は論文の主張と合っています。ただし、次の5点は修正した方がよいです。
1. **「ログとslotのみ」ではありません。** 共有物には他に、採用アプローチの記録、反証の記録、スコアログ、衝突時の取り決めを書くcoordinationファイルがあります。また、共有の成果物はファイルロックで直列化されます。通信ログとリーダーボード(スコアログ)も別の記録なので、「ログ(リーダーボード)」と同一視しない方が正確です。
2. **slotが保証するのは枠の一意性だけです。** アトミックなmkdirで重複しないのはスロット番号です。アプローチが被らないことは、プロンプトの指示(先に取られたスロットのapproachを読み、被れば変える)に依存します。つまり「アプローチの取り合い」ではなく、「枠を確保し、その後で被らない方針を宣言する」流れです。
3. **採用条件は「顕著な進捗」だけではありません。** 計測された明確な改善が前提で、付録A.1では、再現できた場合、ブロックされた手法の代替、終盤の収束も採用の条件に挙げています。
4. **検証の条件は「最終結果を客観的に採点できる」だけでは足りません。** Terminal-Benchにも公式の検証器はありますが、実行後にしか走りません。必要なのは、実行中にエージェントが繰り返し使える、密で忠実な中間フィードバック(スコアやレベル達成)です。論文もこの点を強調しています。
5. **結果の一般化が広すぎます。**
- team@k > best@kは、ARC-AGI-3、ポリオミノ、MNISTでは成立しますが、Terminal-Bench 2.0では成立しません(team@2 < pass@2)。
- 「kが増えるほどgainが拡大する」を示したのはARC-AGI-3のk=3→5(4.3倍→6.6倍)だけです。ポリオミノ(k=3,4)とMNIST(k=4)ではkを振っていません。論文も、5を超えると収穫逓減する可能性に触れています。
- 「単独で解けないタスクが解ける」はLP85(0/64→65%)が代表例ですが、team@5が解けたのは25ゲーム中4つだけです。
なお、「なぜ効くか」の理論的な説明(最小の和から和の最小へ)が概要に入っていません。核心の一つなので、追記をお勧めします。
```
[Paper Note] Reinforcement Learning for Real-Time Vision-Language-Action Policies, Perry Dong+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #Architecture #PostTraining #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Realtime Issue Date: 2026-09-28 GPT Summary- 大規模VLAの推論遅延による古い観測と分布シフトに対し、RLでリアルタイムかつ信頼性の高いファインチューニングを実現。 Real-Time EXPO-FTでは、VLAが行動チャンクを提案し、軽量な編集方策が最新観測に基づいて行動を高速修正することで、表現力と反応性を両立。 Kinetixの全10環境で最高性能を達成し、4つの実世界タスクでも10分間のデータのみで平均性能を42%から97%へ向上。 Comment
元ポスト:
[Paper Note] Sparse Layers are Critical to Scaling Looped Language Models, Ryan Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #MoE(Mixture-of-Experts) #Scaling Laws #RecurrentModels #Initial Impression Notes Issue Date: 2026-09-28 GPT Summary- loop型モデルとMoEを組み合わせることで、メモリコストを抑えつつ表現力とスケーリング性能を向上。loop型MoEでは、各ループで異なるexpertを活性化することで、追加パラメータなしに密なloop型モデルの限界を克服。さらに、loop境界をearly exit pointとして利用することで、品質低下を抑えながら計算量と推論コストを削減。early exit付きloop型MoEは、標準Transformerを上回る性能と効率を実現。 Comment
元ポスト:
Looped Transformerは提案された初期は性能がスケールしないことが課題だったという話があり
- [Paper Note] Scaling Laws for Neural Language Models, Jared Kaplan+, arXiv'20, 2020.01
X界隈でLooped Transformerが騒がれた頃に、いつの間にかその弱点が克服されたのか?と思っていたのだが、本研究の知見に基づくと、少なくともMoEによって、isoFLOPsな設定でBaseモデルを上回る程度の性能は獲得できるようである。
元ポストに基づくと、本研究の実験設定においてMoE>Looped-MoE>Base>Loopedが示され、Looped-MoEの場合はloopごとに異なるexpertが選択されやすい傾向にあり、これがLoored Transformerの弱点解消に寄与しているとのことであった。その上でLooped-MoEを採用する利点は、保存するパラメータを抑えながらBaseよりも高い性能を出せる点としている。
メモリに載せる必要があるパラメータの量が削減されるのは、decodeが基本的にはメモリ律速であり、モデルをスケールする上でボトルネックになりがちであることから、ありがたい性質であるように思える。仮にフロンティアモデルでLooped Transformerが採用されているとしたら、アーキテクチャそのものの性能が高いから、というよりは、使用するストレージやメモリ量を抑えることができ、それらがdecodeの効率向上に繋がり事後学習(主にon-policy RL)の効率があがり、結果的にモデルの性能が向上するから、ということになるのかなあ、という気がする。知らんけど。
[Paper Note] Rufus-Air: An Open LLM Post-Training Recipe, Chia-Yuan Chang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #InstructionTuning #PostTraining #Selected Papers/Blogs Issue Date: 2026-09-27 GPT Summary- GLM-4.5-Air-Base上で、SFT、各種RL、エージェント学習、RLHFを順序立てた、オープンで再現可能な8段階のポストトレーニング手法Rufus-Airを提案。公開データとOSSコンポーネントのみを用い、データ、報酬設計、インフラ、段階順序を明示することで再現性を確保。多様なSFTで基礎能力を確立し、難易度フィルタリングと報酬の信頼性に基づく段階設計によって、推論・コーディング・指示追従・各種エージェント能力を向上。公式GLM-4.5-Airポストトレーニング済みモデルを上回り、同規模のオープンモデルと競争力のある性能を達成。 Comment
元ポスト:
[Paper Note] FutureSim: Replaying World Events to Evaluate Adaptive Agents, Shashwat Goel+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #NeurIPS #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- FutureSimでは、知識カットオフ以降の現実世界の出来事を時系列に再現し、ニュースを受け取りながら将来を予測するAIエージェントを評価。最良エージェントでも正解率は25%にとどまり、多くのエージェントが無予測より低いブライア・スキルスコアを示した。長期的なテスト時適応、検索、メモリ、不確実性推論を研究するための現実的なベンチマークを提供。 Comment
元ポスト:
[Paper Note] FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale, Runyuan He+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SyntheticData #Coding #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #LongHorizon #Open-endedTasks #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- 競技プログラミングなどのclosed-formな問題から、LLMを用いて自由度の高いcoding問題を大規模に合成するFrontierSmithを提案。問題の目標変更・出力制約・入力一般化により候補を生成し、異なるsolverから多様な解法を引き出す問題を選別した上で、test caseとverifierを生成。2つのopen-ended coding benchmarkで、合成データによる学習がbase modelを大幅に上回り、人手作成問題と同様に長い推論を促進。 Comment
元ポスト:
スクラッチでopen-endなタスクを生成するのではなく、既に存在するclosed-endなタスクに対して変更を加えることで、高品質なopen-endタスクを生成する(p.4に具体的な手法が記載。まだ読めていない)。生成されたタスクにはclosedなものが含まれているため、これらをフィルタリングしたい。これを実現するために、closedなタスクは単一のgold solutionに依存する一方、open-endなタスクでは多様な解が可能となる性質を考慮し、LLMによってタスクを解かせ、解の多様さから品質を判定しフィルタリングをする。合成されたデータと人間がキュレーションしたデータによってRLした場合、人間がキュレーションしたデータと同等以上の性能を達成。
[Paper Note] Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems, Shubham Agarwal+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #NeurIPS #SoftwareEngineering #Selected Papers/Blogs #Proofs #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- 分散システムの実装と形式証明をLLMエージェントが協調的・逐次的に合成し、失敗から学習するIDSを提案。実装と証明、性能評価を反復することで、7仕様すべてを平均6.8時間・106ドルで達成し、既存エージェントを上回る。さらに、検証済みシステムより最大3倍高速な実装を実現。 Comment
元ポスト:
[Paper Note] Reward Hacking in Rubric-Based Reinforcement Learning, Anas Mahmoud+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #NeurIPS #RewardHacking #PostTraining #Selected Papers/Blogs #Verification #Rubric-based #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ルーブリックベースの強化学習において、学習用検証器を欺く報酬ハッキングを調査し、検証器の失敗とルーブリック設計の限界に分類。弱い検証器では代理報酬のみが向上し、複合基準の部分的充足や暗黙内容の誤認などの悪用が増加する。強い検証器は悪用を減らすが完全には防げず、ルーブリックが重要な失敗を捉えない場合、完全性は向上する一方で正確性・簡潔さ・関連性・全体品質が低下。方策の対数確率から参照検証器の品質と学習停止を診断する「自己内在化ギャップ」を提案し、検証強化だけでは広範な品質向上を保証できないことを示した。 Comment
元ポスト:
[Paper Note] Matryoshka attribution: Learning to attribute language model outputs to representations and weights, Aryaman Arora+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #Interpretability #Author Thread-Post Issue Date: 2026-09-25 GPT Summary- LLMの出力に寄与する内部コンポーネントを、下流損失を最小化する入れ子状の部分集合として特定するため、微分可能なシグモイドtop-$k$マスク学習法MAttrを提案。学習時に$k$をランダム化することで、異なるスパース度に対応するコンポーネントの順位付けを獲得し、疎でタスク移転可能な回路を特定。Mechanistic Interpretability Benchmarkで1位を達成し、Llama 3.1 8B Instructでは重みの1%を復元するだけで、能力を維持したまま拒否応答を除去。 Comment
元ポスト:
[Paper Note] onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction, Lei Yang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Annotation #PostTraining #Selected Papers/Blogs #Data #Author Thread-Post Issue Date: 2026-09-23 GPT Summary- LLMのアライメントデータやエージェント軌跡を効率的にアノテーションするため、トークンレベルで「特定・修正・継続」を行うインタラクティブツールonPandaを提案。モデル応答中の不適切なトークンを修正し、その位置から生成を再開することで、低コストに出力を誘導する。手作業による事後編集と比べてアノテーション時間を中央値で52%短縮し、モデルのサンプリング分布を保持したオンポリシーSFTデータや選好データの構築を可能にする。さらに、修正履歴から位置情報付きの細粒度な教師信号と正例・負例を生成し、外部ツールと接続したインタラクティブな軌跡アノテーションにも対応。Panda-CVLデータセットとトークンレベル修正ベンチマークを公開。 Comment
元ポスト:
[Paper Note] Score Centering Stabilizes Off-policy Reinforcement Learning, Martin Marek+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #Off-Policy #Stability #train-inference-mismatch #Author Thread-Post Issue Date: 2026-09-23 GPT Summary- LLMのRLにおける学習・推論ミスマッチ(TIM)は、学習エンジンと推論エンジン間の持続的なバイアスであるドリフトにより不安定化する。ドリフトを相殺する加法的なスコア中心化補正を導入し、量子化下で重要度サンプリングと同等以上の性能を達成。さらに重要度サンプリングと組み合わせることで、古い方策を用いる設定でもベースラインを上回った。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Self-Organizing Agent Teams Learn to Reason Together, Aneesh Pappu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #Author Thread-Post #Coordination Issue Date: 2026-09-23 GPT Summary- 固定編成のAIエージェント・チームが、過去の協働から役割・対話・情報の流れを学習し、未知の問題に適応するSelf-Organizing Agent Teams(SAT)を提案。 エージェント同士が部分的な推論を交換・批判・修正・統合することで、単独では到達できない解答を生成する。 数学・物理学ベンチマークで既存の単独推論やルーターを上回り、改善効果は正しい推論を識別する能力(デモンストラビリティ)と強く相関。 Comment
元ポスト:
[Paper Note] FLARE-AI: Flaw Reporting for AI, Shayne Longpre+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Security #Author Thread-Post Issue Date: 2026-09-20 GPT Summary- AI脆弱性報告システムの課題を分析し、FLARE-AIを提案。条件分岐と早期分類でトリアージに必要な情報収集と報告作成を効率化し、標準化された機械可読形式で複数の関係者へ一括共有。脆弱性報告のサイロ化を解消し、AIエコシステム全体の相互運用性と修正対応を向上。 Comment
demo: https://www.ai-reports.org/
元ポスト:
[Paper Note] SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness, Haozhe Liu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #AgentHarness Issue Date: 2026-09-20 GPT Summary- コーディングエージェントの長期的な推論・ツール利用では、トークン効率が重要となるため、RSIに着想を得た自動ハーネス探索を提案。 複数環境で研究ループをスケールさせ、行動実行・コンテキスト圧縮・観測処理・委譲読解に関する4つの機構からSoL-Piを構築。 EdgeBenchではGPT-5.6、Sol、Opus 5でPiと同等の性能を維持しつつ、トークン通信量を44.7~49.0%、APIコストを約3分の1削減。 Comment
元ポスト:
[Paper Note] How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents, Zixi Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Transformer #Scaling Laws #RecurrentModels #Author Thread-Post Issue Date: 2026-09-18 GPT Summary- スケーリング則は、計算量の増加に伴う損失の低下を予測することに焦点を当て、アーキテクチャがスケーリング指数に影響を与えることを示す。特に、ループ型トランスフォーマーは訓練中にモデル成長を促進し、計算効率を飛躍的に向上させる結果をもたらす。7.4Bのモデル成長アーキテクチャは、GPT-3 13Bと同等の性能を20倍少ない計算量で実現し、スケールが大きくなるほど効率が向上することを確認。また、ループ回数の増加が計算最適性に寄与し、トランスフォーマーの深さを増やすことが効率改善につながることが示された。 Comment
元ポスト:
[Paper Note] Inoculation Midtraining with Learned Neologisms, Kyle O'Brien+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Safety #Generalization #Author Thread-Post Issue Date: 2026-09-17 GPT Summary- 接種ミッドトレーニング(Inoculation Midtraining)は、大型言語モデルが望ましい特性を維持しつつ、危険な挙動を減少させる手法を提案。指定された文脈で危険なデータを使用し、特定の新語を教えることでモデルを訓練し、その後文脈外で評価。監督付きファインチューニングや強化学習の枠組みを通じて、無害なデータ特性の転移を保持しつつ不整合を減少させることが実証された。ただし、訓練設定への依存が強く、さらなる研究が必要。 Comment
元ポスト:
[Paper Note] Learning to Solve Hard Problems in RL for LLMs by Never Giving Up, Michael Noukhovitch+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 大規模言語モデル(LLMs)における強化学習(RL)は、易しい問題に対しては大きな改善を示す一方、難しい問題では改善が少ないという現象を示す。これを「マタイ効果」と呼び、計算資源の不均等な配分が原因とする。提案する「Never Give Up(NGU)」は、正解が出るまでサンプル生成を続ける適応サンプリング法であり、非同期RLを利用して易しい問題のサンプル数を減らし、難しい問題に資源を再配分する。NGUは、数学ベンチマークDeepscalerで計算あたりの性能を向上させ、難しい問題に特に効果的であることを示す。また、コーディング課題Manufactoriaにおいても、NGUはより難しいテストの解法を改善し、最終的な問題解決を学習する。 Comment
元ポスト:
著者ポスト2:
post-trainingでon-policy RLを実施する際、hardな問題からの学習シグナルを得るために、簡単な問題のロールアウトを減らし、すべてのロールアウトが不正解だった場合、一定の確率でロールアウト数を増やすことでgainが増えるという話のようである。簡単な問題のロールアウトよりも、難しい問題のロールアウトに計算リソースを配分することで学習能率があげられるよ、というシンプルかつうまくいきそうな手法に見える。
[Paper Note] Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models, Kalyani Marathe+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #Byte-level Issue Date: 2026-09-15 GPT Summary- 小さなモデルは大きなモデルから蒸留されて性能が向上するが、能力のスケールがトークンとバイトの間でどう変わるのかを調査。2つの方法(近似法と厳密法)を使ってトークンロジットをバイトロジットに変換し、初の大規模過学習を行った。Token-1Bモデルは低FLOP地域でバイトモデルを上回るが、最終的には頭打ち。一方、バイトモデルは初期段階では劣るが、大きな計算資源を投入すると性能が向上し下流タスクの上限を高める。最終的に、蒸留済みEnd-Of-Token-1BがToken-1Bを最大4%上回ると予測。また、データ効率も高く、少ないデータで同等の性能を達成し、ロジット格納コストも削減。最終的に、下流タスクにおいて蒸留済みEnd-Of-Token-1Bモデルが他のモデルを上回ると予測される。 Comment
元ポスト:
[Paper Note] Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning, Mehrnaz Mofakhami+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Chain-of-Thought #Reasoning #SmallModel #MultiLingual #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-11 GPT Summary- L2推論を強化し、ユーザーのプロンプトと言語内の回答を結ぶ架け橋を構築。3.35B規模のTiny Aya L2-Thinkerによって、60言語で93%以上のL2推論率を達成。言語に依存しない推論の転移可能性を示し、モデル重みと多言語データを公開。 Comment
元ポスト:
[Paper Note] Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views, Joseph Lee+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #FactualKnowledge Issue Date: 2026-09-10 GPT Summary- LLMsが知識を獲得するメカニズムには未解明な点が多い。本研究では、知識の再表現が学習において因果的に有益であると仮定し、対照実験を実施。反復が知識獲得に必要であり、言い換えは小サイズのバッチで有効であることを確認。また、補助的表現へのトークン割当てが事実の想起を改善することを示し、生成モデルの強さに依存しないことを指摘。知識のギャップがある状況での学習を助ける文脈的および基盤的な知識を特定し、層ごとのバイアスや圧縮などの機械的な影響も考慮。結果として、自然発生的な知識の補助的表現が事前学習の成功に寄与し、データの多様性が重要である理由を説明する洞察を提供。 Comment
元ポスト:
[Paper Note] Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching, Preston Fu+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #CreditAssignment Issue Date: 2026-09-09 GPT Summary- 強化学習における従来の疎なアウトカム報酬の方法は、長く複雑なタスクの学習を遅延させる。部分的な進捗を報酬するアプローチはバイアスを生じることがあるが、我々は「progressive point matching」と呼ぶ新たな密な報酬定式化を提案する。これにより、セグメント単位での進捗報酬が長期タスクに効果的にスケールすることを理論的・実証的に示した。特に、難解な数学的推論問題において、セグメントレベルの報酬が成功率を向上させることがわかった。 Comment
blog: https://www.prestonfu.com/notes/ppm/
元ポスト:
[Paper Note] Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference, Mostafa Elhoushi+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel Issue Date: 2026-09-09 GPT Summary- レイヤー・ドロップアウトは、トランスフォーマーにおいて速いトレーニングと高い精度を実現するが、LLMsの事前学習からは姿を消しつつある。本研究では、レイヤー・ドロップアウトの使用の利点を示し、ベストプラクティスとスケーリング分析を提案。特に、同じトレーニングFLOPsで損失が低下し、最大25%のFLOPs節約が可能であり、推論速度も1.5倍向上することが確認された。2400件以上のトレーニング実験を通じて、これらの知見が大規模トレーニング環境に適用可能であることが示された。 Comment
元ポスト:
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
のFigure 6の例を見ると10Tトークン程度学習したら逆転したこともあったので、160Bは十分なのだろうか(パラメータ数やそもそも適用しているものが違うので何も言えないのだが、少なくともこういう例はある。小規模(中規模?)実験の結果をより大規模な実験に必ずしも外挿できない、というのは頭に入れておいたほうが良さそう。が、どうしようもないという)。
所見:
FLOPsだけを見ると理論上は計算量を削減できるように見えるかもしれないが、バッチ作成を考慮するとそれらの恩恵がテスト時もサービング時も無くなってしまうのでは、という指摘がある。
[Paper Note] Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning, Heng Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #Attention #KV Cache #Compression Issue Date: 2026-09-08 GPT Summary- 大規模言語モデルは長い推論タスクにおいて優れた性能を示すが、長い思考過程はメモリボトルネックとなる。従来のKVキャッシュ圧縮手法はトークンにスコアを付けて重要なものを保持するが、我々は選択信号の寄与が無視できることを示す。Random Attention手法では、プロンプトを保持しながらトークンをランダムに追放し、スコア計算を行わない。これにより、伝統的手法と同等の性能を維持しつつ、vLLMのデプロイメントで32〜43%高いスループットを達成。プロンプトの安全性が確保されればランダム抽出でも必要なトークンを保持でき、選択スコアは不要である。コードは公開中。 Comment
元ポスト:
[Paper Note] Tail-Likelihood Reinforcement Learning, Shrinivas Ramasubramanian+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ReinforcementLearning #PostTraining #Author Thread-Post Issue Date: 2026-09-08 GPT Summary- 強化学習において、平均報酬の最適化はしばしば高報酬ロールアウトの重要な違いを見落とす。そこで、報酬の上位尾部を考慮し、ポリシーが閾値を超える確率を最大化するTail-Likelihood Reinforcement Learning(TailRL)を提案。TailRLは既存の強化学習パイプラインと互換性があり、高報酬サンプルを活用して局所的な最適解から脱却し、推論時により多くの利点をもたらす。 Comment
元ポスト:
著者ポスト:
[Paper Note] Visual General Intelligence: A White Paper, Hirokatsu Kataoka+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #GenerativeAI #FoundationModel Issue Date: 2026-09-07 GPT Summary- 視覚を中心に知性を再考し、視覚的経験がAGIへの道を開く可能性を探る。トランスフォーマーに基づくGPTシリーズの進展を踏まえ、視覚モダリティから生まれる知性の形を議論。多様な寄稿者が集まり、視覚的総合知能(VGI)の原理や他のモダリティとの関係を明確化することを目指す。 Comment
元ポスト:
[Paper Note] Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments, Adam Karvonen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Prompting #Selected Papers/Blogs #Interpretability #Author Thread-Post Issue Date: 2026-09-07 GPT Summary- CHIVEというエージェント主導のパイプラインを通じて、反事実的シミュレーション可能性に基づいてモデル挙動の説明の質を評価。CHIVEは反事実的プロンプト編集を用いて高品質な説明と証拠を収集し、一般的な解釈可能性手法の効果を評価。しかし、改善は見られなかった。最終的に、CHIVEによりLLMの挙動を説明する方法が確立され、モデルが分布外設定へ一般化する能力を向上させた。 Comment
元ポスト:
[Paper Note] Language Models Can Control Their Own Attention, Namgyu Ho+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #Attention #LongContext #Selected Papers/Blogs Issue Date: 2026-09-07 GPT Summary- Declarative Attention(DA)を導入し、モデルが生成時にどの文脈に注意を払うべきかを宣言させることで、KVキャッシュのスキャンを最小化。三つのモード(global, focus, local)に分けることで、ゼロショット評価で注意トークン数を52.0%、31.1%削減しつつ、精度の低下を抑制。DAはスパースアテンションの新しい可能性を提供。 Comment
元ポスト:
[Paper Note] GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling, Guangting Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #TextToImageGeneration #VariationalAutoEncoder #ImageSynthesis Issue Date: 2026-09-07 GPT Summary- 潜在生成モデルは通常、VAEを用いた再構成と生成モデルの二段階訓練を行うが、両者の共同訓練が効果的である。一方で、エンドツーエンドの訓練は潜在崩壊を引き起こす可能性が高い。KLダイバージェンスのエントロピー項が崩壊防止に寄与する一方、再構成と生成は異なる学習ダイナミクスを持ち、非対称である。新たに提案するGenFirst戦略は、生成を先に行い、再構成を後回しにすることで潜在空間を効果的に形作る。これにより、SiTは画像生成で優れたパフォーマンスを示し、連続的なテキスト-画像生成へのフレームワーク拡張も実現した。これらの成果は、安定したエンドツーエンドの潜在学習手法の一般性を示している。 Comment
元ポスト:
[Paper Note] Sliding-window beats linear attention, Alexia Jolicoeur-Martineau+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #AttentionSinks #Selected Papers/Blogs Issue Date: 2026-09-06 GPT Summary- 二次アテンションのメモリとエネルギー消費の課題に対処するため、スライディングウィンドウアテンション(SWA)が線形アテンションモデルと同等以上の性能を発揮することを示す。特に、長文脈の推論タスクにおいてSWAは2倍から10倍の性能向上を実現し、事後訓練なしで高速かつ低メモリを実現。推論時のメモリコスト削減には、SWAへの移行が推奨される。 Comment
元ポスト:
[Paper Note] WHALE: A Simple Recipe for Joint Harness-Weight Optimization, Haechan Kim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Author Thread-Post #AgentHarness Issue Date: 2026-09-06 GPT Summary- WHALE(Weight-Harness Alternating Learning)は、エージェントの性能向上を図るための新しい手法であり、モデルと実行ハーネスの共同最適化を実現する。二段階のプロセスに基づき、モデルを更新した後で改善されたハーネスを探索する。このアプローチにより、Qwen3.5-2B/4Bエージェントは、検索型質問応答、数学的推論、チェスのパズルの各領域で従来の最適化手法を上回る精度を達成。特に、ハーネスの探索が効果的で、ロールアウトのコストを削減しつつ、精度を向上させることが示された。コードは公開されている。 Comment
元ポスト:
著者ポスト:
[Paper Note] SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers, Shaowen Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Scaling Laws #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- ループ化されたトランスフォーマーを用い、Mixture-of-Experts(MoE)での効率を評価。SMELT(Sparse MoE Transformer、middle layers Loop Twice)手法を導入し、中間層の半分を2回ループさせることで計算量を最適化。最大54Bの非埋め込みパラメータでスケールし、計算量の増加に伴い損失を迅速に低下させ、学習FLOPsを節約。アテンション・シンクを減少させることで関連トークンへの分布再配分が性能向上に寄与し、ループ化の有効性を実証。 Comment
元ポスト:
[Paper Note] Normalized Low-Rank Adaptation, Jiale Kang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #PEFT(Adaptor/LoRA) #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- LoRAの安定した最適化のために、ダウン投影行列を正規化するNormalized Low-Rank Adaptation(NoRA)を提案。初期化時に正規化を適用することで、トレーニングの全体での負担を軽減しつつ、収束を加速、性能と安定性を向上させ、壊滅的忘却を緩和。追加のパラメータや計算を必要とせず、LoRAに対する効果的な改善策となる。 Comment
元ポスト:
解説:
Aの初期値によって重みWに対する学習初期の更新量がpreconditioningされるという数式的なLoRAの解釈が重要とのこと。
[Paper Note] TailSFT: Filtered Fine-Tuning Improves Post-Training Performance, Sadhika Malladi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- 強化学習のポストトレーニングは、エージェントの能力向上に寄与するが、高性能なベースモデルを微調整する際に特に効果的である。既存のパイプラインの有効性を疑問視し、TailSFTを設計。これは、訓練時に適合済みシーケンスを除外し、データ分布の未モデル化領域に学習を集中させる。実験と理論分析を通じて設計選択を正当化し、OLMo-3 7Bでは、TailSFTがパフォーマンスを最大17%向上させ、計算オーバーヘッドを抑えた。高いカバレッジのチェックポイントは、後続の強化学習での成果につながり、TailSFTの有用性を示した。診断法を導入し、モデル開発アプローチを提唱。 Comment
元ポスト:
著者ポスト:
ポイント解説:
RL前のモデルの応答パターンのcoverageを改善することで、RLのgainを大きくしたい、という気持ちの研究。SFTで特定の応答パターンを過剰に学習すると、少数パターンの応答が抑制されてしまい(Pass@1は改善するが、Pass@kが下がる)、これがRLのgainの低下に繋がるという話のようである。
SFTにおける各サンプルの学習初期のlossを記録し、学習が進む過程でlossの改善を見て、lossが最も大きく改善したサンプルを除外して学習を進めることで、SFTによるPass@kを改善することで、RLのgainをより高めることを示したようである。
[Paper Note] Demystifying Reinforcement Learning Post-Training of Language Models, Donovan Clay+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #ReinforcementLearning #PostTraining #Exploration Issue Date: 2026-09-05 GPT Summary- RL後トレーニングは、LLMsの能力を強化する重要なフレームワークであるが、そのメカニズムは依然として不明瞭である。本研究では、RL手法を分解し、そのプロセスを明らかにする。具体的には、検証可能な報酬を用いてRLの効果を分析し、基盤モデルや報酬信号、プロンプトの多様性が結果に与える影響を探る。ポリシーの出力分布のエントロピーを通じて、各段階がモデルの確信度をどう形成するかを比較検証し、偽の報酬の影響や成功の条件について洞察を得る。本論文は、NLPコミュニティ向けのRLの理解を深めるためのリソースとなる。 Comment
元ポスト:
気になる
[Paper Note] Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation, Amr Hegazy+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Transformer #Architecture #RecurrentModels Issue Date: 2026-09-05 GPT Summary- スケーリングされたトランスフォーマー言語モデルは、表現力とメモリ効率の間に緊張を生じる。本研究では、ゲート付き再帰トランスフォーマ(Gated Recurrent Transformer)を提案し、再帰的更新を軽量な射影と要素ごと更新ゲートで調整する。これにより、少数の層に特化し、多様な機能を持つことが可能となる。3層のモデルは、12層のGPT-2 Smallと同等の精度を達成し、パラメータを63%削減しながらコンパイル済み生成遅延は10%増加することが示された。 Comment
元ポスト:
[Paper Note] LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics, Lukas Kuhn+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Selected Papers/Blogs Issue Date: 2026-09-05 GPT Summary- LeVJEPAは崩壊ゼロで訓練された初の動画エンコーダであり、非対称性を排除した設計を持つ。グローバル視野とローカル視野に対する不変性損失で正則化され、事前学習コストを観測するトークン数に基づいて減少。単一のハイパーパラメータで簡素化され、計算量を5.6~20.8倍削減しつつ、動作中心の精度を向上。ブロック因果注意を使用しても精度を維持し、結果として画像前処理済みエンコーダに近い性能を発揮。動画が一般目的の視覚的事前学習の基盤として有望であることを示す。 Comment
元ポスト:
解説:
[Paper Note] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement, Haoyang Yan+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #AgentHarness Issue Date: 2026-09-04 GPT Summary- 自律的なソフトウェア開発を探求し、LLMベースのコーディングエージェントが高レベルの要件から機能的なソフトウェアを生成する。Harness-of-Harness(HoH)フレームワークを導入し、コーディングエージェントによる継続的な改善を促進。HoHは反復的な計画—コーディング—テストループを組織し、修復と能力成長のバランスを取ることで、開発を小さく検証可能なインクリメントに限定。GameCraft-Benchなどで、HoHはスタンドアロンハーネスを上回り、平均52.25%の相対ゲインを達成。数日間の展開で、完全な一人称視点シューティングゲームを自律的に開発した。 Comment
元ポスト:
abstを読むだけだとよくわからない
[Paper Note] Best Practice Critic Optimization, Penghui Qi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- グループベースの強化学習法であるBPCOを用いて、複数の応答からトークンレベルのアドバンテージを推定し、クリティック訓練の不安定性を改善。対照実験を通じて、1.5Bから30Bパラメータの数学的推論タスクで強力な性能向上を確認、グループベースのベースラインを超える結果を達成。コードは公開されている。 Comment
元ポスト:
元ポストのスレッドを眺めてから読むと良さそう。
解説:
[Paper Note] T-Rex: Tactile-Reactive Dexterous Manipulation, Dantong Niu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Architecture #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #EmbodiedAI #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- 触覚信号に動的に反応する能力は人間レベルの器用さに不可欠だが、現代のVLAモデルは触覚を軽視する傾向がある。本研究では、触覚反応型操作の向上に向け、100時間の触覚データセットを収集し、新しい時系列触覚VQ-VAEエンコーダと可変レートのMixture-of-Transformersアーキテクチャを提案。12の操作タスクで触覚反応ポリシーの有効性を証明し、最強ベースラインの成功率を30%以上向上させた。 Comment
元ポスト:
pj page: https://tactile-reactive-dexterous.github.io/
ロボットの触覚の制御に特化した大規模でオープンなデータとアーキテクチャの提案に見え、卵を掴んで移動させるデモなどが元ポストに掲載されている。
スーパーサイヤ人になった悟空が食器を掴んだけど力が強すぎて割ってしまう、みたいなアニメのシーンをふと思い出したけど(セル編だった気がするけど実際にそのようなシーンがあったかはわからない)、実際調理ロボットが卵を掴んで運ぶ前に握り潰してしまったらだいぶ悲しいので、触覚は非常に重要なモダリティと思われる(小並感)。
[Paper Note] Mathematics in the age of AI, Terence Tao, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #AIAgents #GenerativeAI #Mathematics #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-22 GPT Summary- AIツールの登場に対する数学コミュニティの対処法を論じるエッセイ。これらのツールの能力を議論するのではなく、数学研究の目標と価値を再検討することに焦点を当て、問題解決の要素をケーススタディとして用いる。 Comment
元ポスト:
(数学に限らず)AI時代との向き合い方を考える上で重要に見える
[Paper Note] HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction, Jiahao Ji+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #Dataset #Selected Papers/Blogs #Robotics #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- HiPHIは、全身の人間モーションと相互作用の多様性を最大化するために設計された600時間超の高忠実度データセットであり、光学モーションキャプチャを用いてサブミリメートル級の精度で作成された。これにより、実験室とインターネットのデータの不一致を解消し、モーションのカバー範囲を大幅に拡張。HiPHIは物理AIアプリケーションを評価するためのベンチマークスイートも提供し、実世界のタスクにおけるヒューマノイドポリシー学習の基盤を確立する。 Comment
HF: https://huggingface.co/datasets/noitomrobotics/HiPHI
元ポスト:
[Paper Note] SPADE: Self-Play in Adaptive Synthetic Executable Environments, Bo Liu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Selected Papers/Blogs #SelfPlay #Environment #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- 自己改善には多様で適応的な目標プールが不可欠であり、SPADE(Self-Play in Adaptive Synthetic Executable Environments)は、単一の大規模言語モデルが自己対戦型強化学習フレームワークで二つの役割を果たす。環境デザイナーが長期的な訓練環境を作成し、推論エージェントが行動を学ぶ。報酬や後悔信号を最適化しつつ、環境をエージェントの能力の限界に合わせて設計。広範な実験により、大規模コーパスの使用と環境メモリの蓄積が成功に重要であることが明らかにされ、SPADEは競合ベースラインを平均+5.3ポイント上回り、特定タスクでさらに改善を達成。環境設計を学習可能にすることで、自己改善への道を示す。 Comment
元ポスト:
著者ポスト:
[Paper Note] Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence, Brian Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #ScientificDiscovery #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- Apodex Discoveryは、重厚なソルバーを用いて発見的AIを構築・評価するためのフレームワーク。16の産業から423の実世界の課題を収集し、20件を初期リリースに選定。共通環境の抽象化により、データや成果物の検証が可能。AAVカプシド設計では7%の性能向上を達成し、薬物の再利用でもスコアが改善。ApodexはAI評価を超え、真の発見を目指す検証可能な調査を可能にする。 Comment
元ポスト:
所見:
[Paper Note] Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation, Huan-ang Gao+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #Selected Papers/Blogs #Reproducibility #On-Policy Issue Date: 2026-08-20 GPT Summary- マルチティーチャーオンポリシー蒸留(M-OPD)は、強化学習エキスパートを統合する新たなアプローチとして注目されているが、その最適化ダイナミクスは未解明である。本研究では、oracleルーティングを用いたM-OPDベンチマークを設立し、能力統合のギャップを分析。標準M-OPDは、理想的なルーティングに対して35.6%の性能しか示さないことが判明し、特に簡潔なタスクでの劣化が顕著である。この問題は、トークンレベルの最適化におけるミスに起因し、3つの要因によって悪化する。これらを解決するために、Open-MOPDという新しいフレームワークを提案し、ドメインバランスの回復率を35.6%から83.4%に向上させることに成功した。全てのプロセスをオープンソース化し、広く利用可能にした。 Comment
元ポスト:
[Paper Note] SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents, Qingyao Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining Issue Date: 2026-08-20 GPT Summary- エージェントフレームワークはスキルを手続き的知識としてパッケージ化し、ポリシーが必要なスキルを決定する。しかし、候補スレート上の結果報酬付き RL では学習が難しいことが示され、セレクター・クレジット飢餓という問題が特定された。SkillGateはこの問題を解決し、クレジットを二つのチャネルに分割。これにより、試行成功率が40.8%から53.2%に向上し、誤導的候補への露出を約3分の1に削減した。 Comment
元ポスト:
[Paper Note] The Problem Is the Problem: Towards Scalable Mathematical Discovery, Zeyu Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #AIAgents #Mathematics #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- AIシステムは数学研究の効率化を進めており、希少な資源を適切に配分することが重要な課題である。従来のAIを活用した数学ワークフローでは、人間の労力が初期と末端に集中し、研究課題の選定と成果物のレビューがボトルネックとなっている。新たに提案する人間-AI発見パラダイムでは、専門家が関心のある研究方向を設定し、システムが文献から候補問題を検索。Find, Attempt, and Recommend(FAR)を構築し、問題探索を自動化する。組合せ論の実験では、5,245件の論文から6,453件の候補を収集し、最終的に77件の潜在的解決策を選定。これにより新しい協働モードの有効性が示された。 Comment
元ポスト:
[Paper Note] Matryoshka Language Model Suites, Nathan Godey+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Architecture #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- 階層的に構築された単一のネスト型アーキテクチャを用いて、サブモデルの訓練効率を向上。マトリョーシュカ訓練フレームワークでは、パラメータ数を削減し、サブモデルの低コストな蒸留が可能。5億、15億、30億のサブモデルからなるスイートを訓練し、性能は独立訓練モデルと同等ながら計算量を36%削減、推測的デコーディングのスループットを14~26%向上。アーキテクチャ選択のアブレーション結果も示す。 Comment
元ポスト:
関連:
- [Paper Note] Efficient Construction of Model Family through Progressive Training Using Model Expansion, Kazuki Yano+, COLM'25, 2025.04
上記研究とどの点が異なるのだろうか?
ポイント解説:
[Paper Note] Recirculation, Michael C. Mozer+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Transformer #Architecture #RecurrentModels Issue Date: 2026-08-19 GPT Summary- 既製の基盤モデルにアーキテクチャ改善を施し、生成と推論タスクのパープレキシティを大幅に低減し精度を向上。リサーキュレーション技術により、動的システムとしての機能を持たせ、信念状態を追跡。適応的リサーキュレーションは軽微なハイパーパラメータ調整だけで顕著な性能向上を実現し、データセット間で安定した精度改善を示す。訓練不要のアプローチが成功を収め、アーキテクチャの進化の道を開く。 Comment
元ポスト:
ポイント解説:
[Paper Note] LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure, Fanfei Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-18 GPT Summary- LITTLECURRICULUMを用いて、米国の小学校教材に基づく880億トークンからなる厳選された学習資源を導入。これにより、モデルLITTLELEARNERが明確に定義された知識と能力の範囲内で訓練され、言語能力を備えた解釈可能なカリキュラムに対応。最初の実験では、新しい知識を既存のものに結びつける手法を検証し、制約された環境の研究価値を示した。 Comment
元ポスト:
ポイント解説:
K-5の内容にフィルタリングされたコーパスによって事前学習されたモデルに対して、Beyond-K-5(K-5のレベルを超えた内容)データで事後学習をしても性能は向上しないが、K-5によって被覆される内容の性能はスケールする、という話に見える。
かなり斜め読みなので、もう少ししっかり読みたい。
[Paper Note] Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies, Conor F. Hayes+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #Diversity #Author Thread-Post Issue Date: 2026-08-18 GPT Summary- 大規模言語モデル(LLMs)は、探索領域での応用が進んでおり、特に多様な候補解を生成するパス@kプロセスが注目されている。しかし、従来の強化学習(RL)に基づく事後トレーニングでは解の網羅性が低下する可能性がある。対照的に、エボリューション・ストラテジー(ES)は、集団ベースでの最適化を通じて、より広い出力分布と高い解の網羅性を実現する。ESは標準的な数学ベンチマークにおいても優れた結果を出し、探索問題への適用において有望である。 Comment
元ポスト:
[Paper Note] Latent On-Policy Self-Distillation, Guibin Zhang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #SelfDistillation Issue Date: 2026-08-17 GPT Summary- 自己進化型AIにおいて、エージェントが経験から学ぶためにLatent On-Policy Self-Distillation(LOPD)を導入。LOPDは経験から特権的文脈をエンドツーエンドで学習し、自己教師を生成。実験的に、LOPDは既存のOPSD手法よりも優れた性能と高い学習効率を示し、エージェント進化のためのスケーラブルで自己指向的なアプローチへの進展を支持する。 Comment
元ポスト:
[Paper Note] Small-Scale Experiments: Are We There Yet?, Nicholas Lourie+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel #Scaling Laws #Selected Papers/Blogs Issue Date: 2026-08-14 GPT Summary- 小規模モデルではハイパーパラメータ感度が高く、スケーリング則が見えにくい。十分にチューニングされたモデル前線では小規模にもスケーリング則が存在し、規模拡大に伴って損失曲面の次元が低下するため、最適なハイパーパラメータを見つけやすくなる。小規模実験を用いてTransformerの正規化層配置を検証し、大規模モデルと同様に前正規化が優れることを示した。 Comment
元ポスト:
解説ポスト:
小規模モデルほどハイパーパラメータチューニングが重要なようである
[Paper Note] Simple-OPD: Demystifying Warm-up for On-policy Distillation, Tao Liu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PEFT(Adaptor/LoRA) #PostTraining #Selected Papers/Blogs #On-Policy #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- On-policy distillation (OPD) は、教師モデルからの監督信号を用いて学生を訓練する手法であり、その効果はウォームアップ段階に依存する。データ観点では、思考過程の連鎖(CoT)監督が効果的であり、誤った教師のロールアウトでも利点があることが示された。トレーニング観点では、低秩適応(LoRA)を用いたアプローチがドメイン内適応と分布外一般化のバランスを改善することを示す。これに基づき、Simple-OPDを提案し、教師生成のCoTに対してLoRAで学生をウォームアップさせる手法である。実験はその有効性と頑健性を示している。 Comment
元ポスト:
まだ論文には目を通せていないが、教師モデルと生徒モデルに差がありすぎると、OPDはうまく学習ができないので、LoRAでwarmupするとあうのは理に適っているように感じる。
OPDのFailure Modeのまとめ:
- On-policy distillation isn't a free-lunch, Bhavin Jawade, 2026.07
[Paper Note] DiG-bench: Discovery in Games, Ruairidh M. Battleday+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #ScientificDiscovery #Selected Papers/Blogs #Game #One-Line Notes #text #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 新たな知識の発見は科学プロセスの核心であるが、既存のAIベンチマークはこの能力を評価するものが不足している。これに対処するため、本研究ではDiG-bench(Discovery in Games)という新しいベンチマークを導入。70の独立したゲームから構成され、各ゲームは独自の変換ルールを持ち、AIエージェントに7段階の難易度を提供する。ゲームはルール発見の検証課題を含み、特定の勝利条件も未知である。全てのゲームは少なくとも1人の人間によって初回の試行で解かれたが、21ゲームが公開されており、残りは安全評価のために非公開。 Comment
元ポスト:
AI Agentの発見能力を測るためのベンチマーク。テキストベースで人間によって作成されたゲームで、エージェントは試行錯誤を重ねてテキストで表現された世界のルールと勝利条件を紐解く必要がある。実際に人間が挑戦をすることで初挑戦でクリアできることを確認済みだが、AI Agentでは最も難易度が高いゲームでは、20パーセント程度しかクリアできない(Opus 5)とのこと。また、世界のルールや勝利条件などのground truthをテキストで与えると、クリア率は100%になるとのことで、非常に興味深いベンチマークである。
[Paper Note] Stealing Reasoning Traces from Proprietary LLM APIs, Alexander Panfilov+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Chain-of-Thought #Proprietary #API #Attack #PII #Security #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 大規模言語モデルの推論過程が隠蔽され、クライアントに暗号化されたテキストブロックが返される中、設計上の脆弱性が明らかになった。これにより、異なるモデル間の暗号化ブロックの互換性を利用した復号ジャイルブレイクが可能となり、推論の抽出やプライベートデータの漏洩が実証された。具体的には、個人情報や資格情報が回収された他、有害情報の露呈や悪意のあるペイロードの埋め込みが可能になる課題が示された。各攻撃に対処するため、クライアント側の推論を保護する具体的な暗号技術やシステム緩和策が提案されている。 Comment
元ポスト:
所見:
-
-
所見:
関連:
- [Paper Note] How to Steal Reasoning Without Reasoning Traces, Tingwei Zhang+, arXiv'26, 2026.03
[Paper Note] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs, Kejian Zhu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #ReinforcementLearning Issue Date: 2026-08-11 GPT Summary- SFTとRLのマルチタスク推論における挙動を比較。SFTはタスク間の対立を引き起こすが、RLは安定した共存を実現。RLの干渉は分散に制約され、タスク間の最適化方向がほぼ直交することを示す。これに基づいて、効率的で柔軟なParallel-RLを提案。 Comment
元ポスト:
[Paper Note] DAPD: Dual-Anchored Policy Distillation, Jianyu Wu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Selected Papers/Blogs Issue Date: 2026-08-10 GPT Summary- OPSDの特権情報による幻覚が性能低下を引き起こす問題を解決するため、DAPDを提案。デュアルパス・アンカリングとデュアルソース・アンカリングを用いて、特権依存の行動を整合させ、情報の非対称性を解消。実験によりDAPDが特権幻覚を緩和し、Qwen3-4BでOPSDを平均+2.00ポイント上回ることを示した。 Comment
元ポスト:
[Paper Note] Scaling Properties of Text Conditioning in Visual Generation, Zilong Chen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #NLP #DiffusionModel #TextToImageGeneration #Scaling Laws #Selected Papers/Blogs #ImageSynthesis #Author Thread-Post Issue Date: 2026-08-10 GPT Summary- 視覚生成におけるテキスト条件付けのスケーリング特性を実験的に探求。収束した拡散損失は、プロンプト内の構造化言語の量に比例して減少することが明らかに。GPGとEDの指標を用いて、構造化プロンプトを改善。これにより、ほとんどの構成的・推論的ベンチマークで優れた性能を発揮し、クローズドウェイトモデルとも競合する結果を得る。 Comment
元ポスト:
著者ポスト:
[Paper Note] ReToken: One Token to Improve Vision-Language Models for Visual Retrieval, Yao Xiao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #InformationRetrieval #NLP #RepresentationLearning #VisionLanguageModel Issue Date: 2026-08-10 GPT Summary- 長い視覚的文脈は視覚言語モデルにおいて性能低下を引き起こす。これに対処するため、明示的な検索ターゲットとして訓練された埋め込み「ReToken」を提案。視覚KVキャッシュから関連するトークンを選択することで、画像と動画のベンチマークで性能向上を実現。具体的には、Visual HaystacksでQwen3VL-8Bを13.4ポイント、InternVL3.5を12.4ポイント改善し、LVBenchでは長尺動画へのゼロショット転移で8.0ポイントの改善を達成。軽量設計により、単一のH100で学習と推論が可能。 Comment
元ポスト:
[Paper Note] Can AI agents conduct open-ended AI research? Early evidence from two case studies, Peter Kirgis+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #ScientificDiscovery #Selected Papers/Blogs #One-Line Notes #Open-endedTasks #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AI研究を自動化するエージェントの進展を評価する新しい方法として、著者評価によるシャドウ評価を導入。高品質な未公開論文について実施した結果、エージェントは独力で設計開発を行ったが、実質的な進展が得られず、両論文は却下された。失敗モードとして、判断力の欠如、設計不備への非創造的対応、バックトラックの不足などが特定され、エージェントは研究の全過程において課題を抱えていることが示された。 Comment
元ポスト:
未発表のオープンエンド(=non verifiable)な研究課題に対して同様のテーマをAI Agentに与えて論文を記述させ、原論文の著者が実際に内容を検証することによって、現在のAI Agentのオープンエンドな研究課題に対するアプローチの課題を明らかにした研究で、サンプルサイズの小ささや、AI生成であることを知った上でのレビュー結果など、様々なlimitationがあるが興味深い。
たとえば、以下のような知見が得られたとのことである:
- top conferenceの水準に対する判断力の欠如
- 創造的な問題解決能力の欠如
- 誤った判断を早期に下し、それを是正できない
[Paper Note] Weak-to-Strong On-Policy Distillation, Fangxu Yu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #Initial Impression Notes Issue Date: 2026-08-09 GPT Summary- Weak-to-Strong On-Policy Distillation(W2S-OPD)は、複数の弱いモデルから強い学生を育成する新しい枠組みであり、正例と負例の対比ペアを使用してロジット空間に代理教師を構築する。学生はこの代理教師の方向性を自身のモデルに加え、トークンごとに逆KLを最小化することで蒸留を行う。W2S-OPDは、4つの数学ベンチマークと3つのコードベンチマークで従来のOPD手法を上回り、監督源が弱くても学生の能力向上を実現する。分析により異なる対比が異なる信号を生むことが示された。 Comment
元ポスト:
複数の弱モデルを用いて、より強力なモデルを改善する。モデルを改善するためには常により強いモデルからの学習シグナルが必要、となるとなかなか苦しいので、弱いモデルから学習シグナルをうまく得られるなら非常に重要な研究に見える。
[Paper Note] WorldDiT: A Unified Diffusion Architecture for World and Action Modeling, Sen Wang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #DiffusionModel #Robotics #WorldModels #UMM #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-06 GPT Summary- WorldDiTは、視覚と言語モデルを用いずにアクション生成と視覚的世界モデリングを統合する拡散トランスフォーマーを提案。訓練時に連続アクションを生成し、未来のカメラフレームのRGBパッチを予測する。LIBEROシミュレーションスイートで高い性能を示し、十億未満のパラメータで強力なベースラインを確立。 Comment
元ポスト:
[Paper Note] SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification, Pragaash Ponnusamy+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Decoding #Selected Papers/Blogs #GPUKernel Issue Date: 2026-08-04 GPT Summary- LLM推論のサンプリングを高速化するために、$\textbf{SonicSampler}$を提案。これは、固定化された実行モデルに統合されたタイル対応のTritonカーネルを用い、ダイナミックなサンプリング動作をサポート。文法制約や頻度ペナルティなどを一つのバッチ処理で実現し、CUDA Graphに完全に互換性を持つ。新しい階層的二段階top-kアルゴリズムにより最大で$\textbf{10x speedup}$を達成し、全体で最大$\textbf{16x speedup}$を実現しつつ柔軟性を維持。 Comment
元ポスト:
[Paper Note] Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks, Hossein Mobahi+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NeuralNetwork #Analysis #MachineLearning #Interpretability Issue Date: 2026-08-04 GPT Summary- 深層ニューラルネットワークの内部知識の分解は難しいが、ネットワーク圧縮は有望な分析手法である。従来の手法はバイアスに悩まされがちであるため、段階的分解の枠組みであるHOPEを提案。HOPEは重み表現をHilbert空間に移行し、ニューロンを低ランクの演算子としてモデル化する。これにより、剪定とニューロン結合を統一し、偏りのない意思決定を可能にする。データやハイパーパラメータを必要とせず、実験結果から理論の実用可能性を示す。 Comment
元ポスト:
[Paper Note] Test-Time Scaling via Error Localization, Rajiv Shailesh Chitale+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Test-Time Scaling #TreeSearch Issue Date: 2026-08-04 GPT Summary- TTEL(Test-Time Scaling via Error Localization)アルゴリズムを提案し、トークン単位の誤りを特定して推論効率を向上。固定的フィードバックを利用し、妥当なプレフィックスを再利用することで、生成トークン数を削減。広範な評価で優れたパフォーマンスを示し、特にLiveCodeBenchおいて71.0%のpass@64を達成。数学ベンチマークでも競合を上回る結果を披露。 Comment
元ポスト:
[Paper Note] Intelligence from Learnable Novelty, Yanbo Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Intelligence Issue Date: 2026-08-03 GPT Summary- 知性は様々な分野で異なる形で現れ、目的に応じた学習可能な驚き(learnable novelty)が知性の多様な投影を生む。驚きを扱う際、各目的は異なる結果をもたらし、特に、新奇性探索は環境のノイズに妨げられ、大きな驚きを避ける自由エネルギー原理は低い満足に甘んじる。提案する閉形式の推定量は、監督なしで複雑性の分類を復元し、セルオートマトンの計算能力を高める。これにより、教師なしでMNISTデータセットを整理し、強化学習エージェントに内的報酬を提供することで、探索を促し、複数の環境でタスクの基準を超える成果を達成する。探索、生成、抽象化は一つの微分可能な量に基づき、知性の発展に寄与する。 Comment
元ポスト:
[Paper Note] Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives, Siyuan Shen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #LongContext #LLMServing #SoftwareEngineering #Selected Papers/Blogs #GPUKernel #Latency #Initial Impression Notes Issue Date: 2026-08-03 GPT Summary- GPUコレクティブ通信は帯域幅最適化が主流だが、遅延制約が増加中。特に、LLM推論では多数の小規模コレクティブがトークン生成に影響を与えるため、マイクロ秒のオーバーヘッドが性能に重要。研究では、GPUコレクティブの性能向上に向け、効率的な同期とマルチキャスト利用の原則を特定。カスタムコレクティブカーネルを開発し、遅延を大幅に削減、SoL下限の7%以内に抑制。実アプリケーションでLLM推論のレイテンシとスループットを改善し、AI推論とHPCの両方に貢献。 Comment
元ポスト:
小規模バッチ、Tensor Parallelism適用時に のデコード時に頻発するAllReduceのlatencyを、usレベルで削減できる工夫を施すことで、推論コストを低下させる
[Paper Note] Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards, Yuxuan Zhu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #PEFT(Adaptor/LoRA) #RLVR #Generalization #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- RLVRはLLMの推論能力を向上させるが、その一般化性能は十分に理解されていない。本研究では、初めての非自明な一般化境界を確立し、PAC-Bayes圧縮境界を適用。Gumbel-max再パラメータ化を用い、Progressive RLVRフレームワークを提案し、これによりモデルを14,796倍圧縮しながら、LoRA微調整の性能の84-97%を維持。数学問題解決などの4領域での実証的結果も示し、精度がベースモデルを9-51%上回ることが確認された。 Comment
元ポスト:
所見:
[Paper Note] LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget, Changhai Zhou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- 長い文脈を持つRLのポストトレーニングにおいて、GRPOは複数のポリシー応答を同時に処理する必要がある。本研究では、LongStrawシステムを提案し、プロンプトのキャプチャと状態の復元を行い、効率的な応答リプレイを実現。Qwen3.6-27B と GLM-5.2 に対して実装を行い、状態維持やリプレイ演算子の集団通信をアーキテクチャに適合させた。 Comment
元ポスト:
[Paper Note] DeepLoop: Depth Scaling for Looped Transformers, Shuzhen Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Scalability #Depth #Author Thread-Post Issue Date: 2026-07-31 GPT Summary- ループド・トランスフォーマーは、逐次計算をスケールさせるために物理ブロックを再利用し、パラメータを増やすことなく展開深度を拡張します。この手法では、1つの共有更新が勾配を集約し、次の計算で再利用されます。DeepLoopとして実装されたこのアプローチは、訪問整合係数を用いて結合深さを制御します。GPT風のモデルで、再帰的深さが有効になると検証損失とタスク精度が向上し、残差スケーリング規則の考慮が重要であることが示されました。 Comment
元ポスト:
著者ポスト2:
関連:
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
[Paper Note] Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs, Joseba Fernandez de Landa+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Bias #Japanese #Selected Papers/Blogs #Cultural Issue Date: 2026-07-23 GPT Summary- LLMの文化的な偏りを分析する新しいデータセットCROQを提案。結果、LLMは日本など特定の地域に対して明確な傾向を示し、英語などの資源豊富な言語で多様な出力を生成。公用語国に関する質問では回答が少なく、偏りは監督付きファインチューニング後に現れることを示唆。 Comment
元ポスト:
[Paper Note] Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories, Ali Behrouz+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Architecture #Selected Papers/Blogs #ContinualLearning #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 機械学習アルゴリズムは、初期の浅いモデルから深層大規模言語モデル(LLMs)へと進化したが、長期的な知識の転移能力に欠けている。人間の学習に触発され、継続的学習と記憶の安定化を図る「Sleep」パラダイムを提案。これは、記憶を網羅的に蒸留する「Memory Consolidation」と、新しい知識を合成データで予行練習する「Dreaming」の二段階から成る。このアプローチは、長期学習や知識の取り込みにおいて重要であることを実験により支持されている。 Comment
元ポスト:
[Paper Note] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading, Zongxia Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #LongHorizon Issue Date: 2026-07-19 GPT Summary- Long-Horizon-Terminal-Benchは、AIエージェントの能力を検証するための新しい終端ベンチマークで、46件の長期タスクを含む。従来のベンチマークが評価する簡単な問題とは異なり、このベンチマークは中間報酬と部分点を重視し、長期的な計画や文脈管理を要求する。評価した15のモデルでは、タスクあたり平均9.9Mトークンを消費し、低いパス率が示され、改善の余地があることが示唆された。失敗モードの分析も行い、今後の進展に寄与することを目的としている。 Comment
元ポスト:
[Paper Note] RoboTTT: Context Scaling for Robot Policies, Yunfan Jiang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #NLP #LongContext #Selected Papers/Blogs #Robotics #memory #EmbodiedAI #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- RoboTTTは、8Kタイムステップの視覚-運動文脈を用いるロボットモデルであり、最先端ポリシーの1000倍のスケールを実現しつつ推論遅延を増加させない。このアプローチにより、ワンショット模倣やポリシー改善、撹乱への頑健性が向上し、長期タスクでの性能も強化される。RoboTTTはTest-Time Trainingを取り入れ、勾配降下法で履歴情報を活用した新しいモデルを生成。実験により、従来の単一步ベースラインに対して87%の性能向上が見られ、長い文脈がロボット基盤モデルにおける新たなスケーリング軸となることが示された。 Comment
元ポスト:
ポイント解説:
[Paper Note] Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes, Minh-Quan Le+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#DiffusionModel #2D (Image) #text Issue Date: 2026-07-16 GPT Summary- SC-CMJPという新しいフレームワークを通じて、モーダル間の相互作用を強化したマスク付き拡散モデル(MDMs)を提案。これにより、モダリティ間の矛盾を検出・修正し、信頼度スコアに基づいた遷移率の重み付けを実現。CO2Jumpを導入し、訓練不要のサンプラーによる効果的な共同マルチモーダル生成を実現。新たに作成したデータセットで最高性能を示し、クロスモーダルの利点が全体を通じて強化されることを確認。 Comment
元ポスト:
[Paper Note] Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning, Xinyu Tang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-07-16 GPT Summary- ゼロRLを用いた強化学習は、思考の連鎖推論を促す新たな手法として注目されていますが、計算資源の制約から小規模モデルにとどまっています。本研究は、高品質な推論行動を引き出すことを目的とし、訓練プロセスの効率を向上させるために新たな訓練パイプラインを提案します。1兆パラメータへのスケーリングによる性能向上や、自発的に高度な認知的挙動の獲得を確認しました。さらに、推論の理解可能性や再現性を評価するためのフレームワークを提案し、構造化された推論痕跡を生成するモデルの優位性を示しました。コミュニティへの洞察を提供することを目指しています。 Comment
元ポスト:
所見:
[Paper Note] The State-Prediction Separation Hypothesis, Giovanni Monea+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Transformer #Architecture #Author Thread-Post Issue Date: 2026-07-15 GPT Summary- トランスフォーマーの性能向上のために「状態予測分離仮説」を提唱し、二つの計算ストリームで役割を分ける変種を設計。実験結果は、状態予測の分離がデータ処理と計算の効率を改善し、検証損失を低下させ、下流タスクで標準のトランスフォーマーを平均2〜3%上回ることを示した。根本的な勾配の違いに関する分析も実施。 Comment
元ポスト:
[Paper Note] OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers, Siyuan Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #Pretraining #NLP #LanguageModel #Evaluation #Optimizer #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-07-12 GPT Summary- 最適化手法の選択は計算量やメモリに制約されるが、その全体像は断片的である。そこで、統合サーベイ「OmniOpt」を提案。これには、五段階メタパイプラインの構造的変換、ノルム制約付きLMOによる手法統一、二次元分類法を用いた手法の機構と訓練目標の整理、最適化手法を系統的に分析するクロスドメインベンチマークが含まれる。これにより、最適化手法選択のための実用的な座標系を提供し、今後の研究の方向性を示す。 Comment
元ポスト:
optimizerの詳細なサーベイと様々なベンチマーキングの結果が記載されている模様
全部読んだらめちゃめちゃ勉強になりそう
[Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Asynchronous Issue Date: 2026-07-09 GPT Summary- 強化学習におけるLLMsの非同期性を改善するため、Single-rollout Asynchronous Optimization (SAO)を提案。グループ単位サンプリングを廃止し、安定した訓練を1,000ステップ行える。SAOは、GRPOやその派生手法に対し、複数のエージェント型ベンチマークで優れたパフォーマンスを示し、進化する環境への適応性も強化。 Comment
元ポスト:
GLM 5.2で利用されているRL手法
所見:
VAPO:
- [Paper Note] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks, Yu Yue+, arXiv'25, 2025.04
alphaXivによるポスト:
解説:
[Paper Note] Rubric Curriculum RL: Exploiting the Generation-Verification Gap in Non-Verifiable Domains, Krishnan+, ICML'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #SelfImprovement #ICML #PostTraining #Non-VerifiableRewards #Rubric-based Issue Date: 2026-07-08 Comment
元ポスト:
[Paper Note] Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction, Chenguang Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Education #ItemDifficultyPrediction Issue Date: 2026-07-08 GPT Summary- 教育評価におけるアイテム難易度予測は重要であり、信頼性が公平性と効果的なテスト作成に寄与する。従来の方法は高コストな校正や制限された証拠に依存している。難易度はアイテムのテキストや問題解決の負担として捉えるべきとし、大規模推論モデル(LRMs)を通じてスケーラブルな証拠を提供する新しいフレームワーク「Epi2Diff」を提案。これにより、推論痕跡をエピソードにマッピングし、難易度のモデル化を実現する。実験結果はEpi2Diffが複数のベースラインを超え、特に難易度の高いアイテムにおいては努力を要するプロセスが観察されることを示した。これにより、LRM推論痕跡が人間のアイテム難易度を予測する新しい視点を提供する。 Comment
元ポスト:
[Paper Note] Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding, Marianne Arriola+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#LanguageModel #DiffusionModel #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- 新しい「セット拡散(set diffusion)」モデルは、因子分解された尤度のパラメータ化とKVキャッシュの更新をサポートし、柔軟な位置・長さのトークン集合に対する生成を実現。固定サイズのブロックを排除することで、任意順序でのデコードが可能となり、推論速度が向上。数学的推論や要約において従来のモデルより性能が改善され、ブロック拡散よりも強力なインフィリング能力を示す。 Comment
元ポスト:
元ポストのgifを見ると一目で概要がわかる。
Block Diffusionのグループによる研究
Block Diffusion:
- [Paper Note] Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models, Marianne Arriola+, ICLR'25, 2025.03
[Paper Note] Agentic Abstention: Do Agents Know When to Stop Instead of Act?, Han Luo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Initial Impression Notes #Exploration Issue Date: 2026-07-08 GPT Summary- エージェントが対話を通じてユーザーの目標を達成する際、目標が明確でない場合には行動を止めるべきであるとし、「エージェント性棄却」を定義。標準的な棄却と異なり、逐次的な意思決定問題として評価され、エージェントは環境に応じて回答、棄却、情報収集を選択。ウェブショッピングなどの場面で13のLLMを評価し、棄却のタイミングが重要であることを示した。さらに、モデルの規模や支援枠組みが棄却に影響を及ぼすことが判明。CONVOLVEという手法を導入し、対話の軌跡を利用して棄却を改善、Llama-3.3-70Bモデルでは適時リコール率を大幅に向上させた。データセットとコードは公開中。 Comment
元ポスト:
エージェントが環境とインタラクションした後にタスクが実現不能な場合はタスクを棄却すべきという話
[Paper Note] How Transparent is DiffusionGemma?, Joshua Engels+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #DiffusionModel #Architecture Issue Date: 2026-07-05 GPT Summary- LLMの推論透明性は、モデルの意思決定を理解し、悪用や不整合を緩和する上で重要である。しかし、DiffusionGemmaは潜在空間での計算が多いため、透明性が低くなる可能性がある。本研究では、透明性を変数透明性とアルゴリズム透明性の二要素に分解して分析する。DiffusionGemmaは変数透明性が低く、初見ではオートリグレッシブGemma 4モデルの28.6倍の不透明な計算深さを示すが、中間状態を解釈可能として扱うことで深さを1.1倍に減少させることができる。アルゴリズム透明性は難しく、拡散過程の各ステップでのトークン予測の変化が要因となる。また、解釈性に関するケーススタディを実施し、拡散特有の新規現象を明らかにする。最後に、DiffusionGemmaはGemma 4同様に下流タスクに対して有用であることが示された。 Comment
元ポスト:
関連:
- DiffusionGemma: The First Diffusion LLM (dLLM) Natively Supported in vLLM, vLLM, 2026.06
[Paper Note] On the Position Bias of On-Policy Distillation, Yan Xie+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #Distillation #PostTraining #Selected Papers/Blogs #On-Policy Issue Date: 2026-07-05 GPT Summary- On-Policy Distillation(OPD)は教師からの監督を通じて強化学習の効率を向上させるが、トークンの重みが均等化されているため後半のトークンの監督品質が低下する。この問題を理解し、Importance-Weighted On-Policy Distillation(IW-OPD)を提案。IW-OPDでは、トークンの重みを学生と教師の分布の乖離に基づき調整することで、学習効率を向上させ、標準のOPDよりも速く収束し、最終性能が向上することを実証。 Comment
元ポスト:
[Paper Note] MirrorCode: AI can rebuild entire programs from behavior alone, Tom Adamczewski+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- AIモデルのコーディング能力は向上しており、MirrorCodeを用いて全体のソフトウェアプロジェクトの再実装を通じた新たな長期的ベンチマークを提案。AIエージェントはコードにアクセスせず、既存のプログラムの機能を再現し、テストで出力の一致を求められる。計算機科学の多様な分野をカバーし、最強のモデルは全体で56%のスコアを記録。AIは複雑なツールを再実装でき、研究の要件が明確であれば長期タスクを完遂可能であることを示唆。AIの進化がソフトウェア工学に及ぼす影響に期待。 Comment
pj page: https://epoch.ai/MirrorCode
元ポスト:
[Paper Note] OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks, Mengqi Yuan+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #Evaluation #ComputerUse #Selected Papers/Blogs #VisionLanguageModel #LongHorizon #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- OSWorld 2.0は、現実的で複雑なコンピュータ利用タスクを評価する新しいベンチマークで、108の長期ワークフローから成る。タスクは人間が中央値1.6時間で完了し、教師が318回のツール呼び出しを必要とする。このベンチマークは、ストリーミングや動的環境、複数情報源間の推論などの課題を扱い、リアルなユーザープロファイルデータと照合される。Claude Opus 4.8は最大思考で20.6%のタスクを54.8%のスコアで完了するが、GPT-5.5は約13%で停滞。結果は現行エージェントの専門的なコンピュータ利用には限界があることを示している。 Comment
pj page: https://snorkel.ai/leaderboard/os-world-2-0/
元ポスト:
著者ポスト2:
[Paper Note] OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning, Shuo Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ReinforcementLearning #Distillation #On-Policy #AgentSkills Issue Date: 2026-07-05 GPT Summary- OPID(オンポリシー・スキル・ディスタレーション)は、軌跡から直接スキル監督を抽出するフレームワークで、エピソードレベルとステップレベルのスキルを階層的に表現し、選択されたスキルを対話履歴に注入。これにより、ポリシーの最適化に密な監督を導入し、エージェントの性能や効率を向上。ALFWorldやWebShopなどの実験結果も示す。 Comment
元ポスト:
[Paper Note] The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms, Jinghan Zhang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #ReinforcementLearning #In-ContextLearning #Generalization Issue Date: 2026-07-05 GPT Summary- 従来の評価手法は、学習アルゴリズムの性能をi.i.d.テストセット上で単一のスコアに還元し、特定の例からの学習が他の例にどの程度一般化するかを隠してしまう。これに対処するため、Generalization Spectrumという評価フレームワークを提案し、転移距離を変化させる制御されたテスト変異体を作成。これにより、アルゴリズムの学習能力とその転移可能性を明らかにする。適用例として、競技プログラミングにおいて3つの学習パラダイムを比較し、各手法の転移特性を診断。得られた結果は、局所的な利得が必ずしも一般化を拡大しないことを示し、各手法の特性と効果を詳細に分析した。 Comment
元ポスト:
[Paper Note] Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning, Wendi Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Entropy #Author Thread-Post Issue Date: 2026-07-05 GPT Summary- エージェントRLの訓練ダイナミクスにおける仮定されていなかった現象、循環的エントロピー噴出を特定。これは、高いエントロピーの噴出と徐々の沈静化を繰り返す独特のサイクルで、文の重複やハルシネーションがサイクルを超えて蓄積する可能性を示唆。SEAL(Separation-Enhanced Agent Learning)を提案し、エントロピー噴出に対処。実験により、SEALが訓練を安定化させ、エージェントの性能を向上させることを確認。 Comment
元ポスト:
[Paper Note] Inverting the Bellman Equation: From $Q$-Values to World Models, Alistair Letcher+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#MachineLearning #ReinforcementLearning #Selected Papers/Blogs #WorldModels #One-Line Notes Issue Date: 2026-07-03 GPT Summary- モデルベースおよびモデルフリーの強化学習の対立に挑戦し、価値ベースのエージェントが豊かな報酬関数の下で正確な世界モデルを暗黙にエンコードできることを証明。Q-learningの逆アナロジーとして\textit{$P$-learning}を導入し、環境の内部モデルをデコード。また、目標の型と数に基づく条件を示す。実験では、限られた報酬関数で訓練したエージェントが正確なダイナミクスをエンコードし、隠れた一般化能力を示した。これは、モデルベースとモデルフリー、ゴール条件付きRLの関係に新たな視点をもたらす。 Comment
元ポスト:
基礎:
- 強化学習の基礎, Takuya Kubo, 2025.06
以下上記元ポストの自分の理解のための要約(詳細は元ポスト参照のこと)
ゴールによって条件づけられたRLにおいて、複数のゴールが設定され、ゴールごとに十分に多様な価値を持つ場合、Q値から明示的に学習されていない世界モデル(=state, actionが与えられた時に次にどの状態に遷移するかを表す状態遷移モデルP)を一意に復元できる場合がある。Q値から状態遷移モデルPを復元することをP-Learningと呼ぶ。どの程度復元できるかはMDPにおける状態遷移の設定(有限状態、連続状態、決定論的、確率論的)により異なり、決定論的なMDPの場合は多くの場合1つのゴールだけで遷移を一意に復元できるが、確率論的な場合はより多くのゴールが必要となる。
これにより、明示的に状態遷移を学習しない場合でもQ値が世界モデルを内包し、そこから復元された世界モデルを用いて訓練時に存在しなかったゴールも解けるようになる。
という感じのようである。
[Paper Note] Multi-Agent Teams Hold Experts Back, Aneesh Pappu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #Analysis #LanguageModel #AIAgents #Initial Impression Notes #Author Thread-Post #Coordination Issue Date: 2026-07-03 GPT Summary- マルチエージェントLLMシステムは自律的に協働するが、固定のワークフローに依存せず相互作用によって協調が形成される。自己組織化されたLLMチームは、他のチームと異なり、専門エージェントのパフォーマンスに一貫して匹敵せず、最大41.1%の性能損失を経験することが判明。主なボトルネックは専門家の適切な活用であり、チーム内での合意志向は専門知識の効果的な重み付けを妨げ、チームサイズが増えるほどパフォーマンスに悪影響を及ぼす。また、合意志向の行動は敵対的なエージェントに対する頑健性を高める可能性があり、アラインメントと専門知識の活用の間にトレードオフが存在することが示唆される。 Comment
元ポスト:
Multi-agent によってチームを組成し専門家をチームに配置しても、(おそらく)正しさよりも合意形成が優先される事後学習の影響によって、エージェントは専門家に適切に移譲をすることができず、専門家単体のパフォーマンスよりもチームでのパフォーマンスは低下しシナジーを発揮できない、という感じの話らしい。興味深い。
実験設定を見ると基本的にAnthropic, OpenAIの商用のProprietary LLMが利用されているように見える。これらのLLMは大前提として人間に対してhelpfulであることを前提にAlignmentがとられているため、正しさを常に追求するといった行動はとらないのだろうと考えられる。これは完全に想像ではあるが、MASの性能を仮に最大化するのであれば、大前提として人間の役に立つという事後学習が実施されているLLMでは少なからず正しさの追求に徹底しきれないという状況が生じる気がしており、少なくともエージェント間のコミュニケーションにおいては正しさを追求する、という形のAlignmentを実施した場合に何らかのシナジーが生じるのか、というのはどうなのだろう?という疑問はある。
が、おそらくそういったAlignmentを施したエージェントは、おそらく前提として人間からの指示には従わなければならないという指示追従能力は身に着けていると思われるので、自分を人間だと誤認させて相手を服従させるといったReward Hackingっぽい挙動が生じるのだろう、と想像する。じゃあそうすると、人間を特権階級とするのやめたらどうなるの?という疑問が浮かぶのだが、そうなるとなかなか怖い話になってくるよね、という予感がする(妄想)。
商用のLLMが多くの人に対して利用されることを前提にしていて、かつビジネスの上に成り立っていることを考えると、AI Safetyの観点からこのようなLLMを学習することにはなかなか踏み切れないという気はする。特に、エージェントに対しては正しさを追求する、といったペルソナをLLMが内包する以上、何らかのMisalignmentによってそれが表出し、利用する人間に悪影響が出るという安全性の懸念が強く生じるので難しいなと思う。特定ドメインに対する単価が高いソリューションとしてはありうるのかもしれない。
あと、そもそも指示追従をしてくれないと意図した方向に行動が進行していないと思われるが、指示追従をするという特性をLLMが持つ時点で、正しさを常に追求する、という挙動は生じうるのだろうか?よくわからない。
LLMを普段使いしていてSycophancyにも似たような状況を感じる。人間とLLMの間でも、(雑にLLMを利用すると)LLMがSycophancyを優先することによって、人間とのシナジーが生まれず誤った方向に進んでしまう、ということは多いように感じる。特に自分があまり詳しくないドメインで協働するときにこのような状況に陥りやすい。
関連:
- Don’t Build Multi-Agents, Cognition, 2025.06
- Single vs Multi-Agent System?, PHILSCHMID, 2025.06
[Paper Note] VIMPO: Value-Implicit Policy Optimization for LLMs, Zhewei Kang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- VIMPOという批評家なしのポリシー最適化法を提案。KL正則化付き強化学習から導出した価値関数に基づき、自己回帰生成において端的な価値損失を得る。計算結果は、VIMPOがGRPOに対して数学的ベンチマークで優位を保ち、より細かなクレジット割り当てを可能にすることを示す。 Comment
元ポスト:
[Paper Note] To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters, Sara Dragutinović+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Optimizer #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- Muonは、深層ニューラルネットワークにおける高速最適化手法として急速に採用されていますが、本研究ではその速度向上の潜在的な欠点を探ります。特に、Muonがサドル点を回避することで得られる速度の裏側に、勾配降下法特有の単純性バイアスを犠牲にするという問題があることを示します。実験結果は、Muonがタスク間の共通基盤を見出すのに苦労し、偽の特徴へ過適合しやすいことを示唆しています。最適化の改善には、一般化の帰納的バイアスの変化という代償が伴う可能性があることを強調します。 Comment
元ポスト:
[Paper Note] Finding the Time to Think: Learning Planning Budgets in Real-Time RL, Aneesh Muppidi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #MachineLearning #ReinforcementLearning #Selected Papers/Blogs #Realtime #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- リアルタイム設定における強化学習(RL)の課題に対処するため、可変遅延リアルタイムRLを提案。エージェントが各決定点で熟慮する時間を状態依存で選択可能にし、軽量なゲーティングポリシーを用いて計画予算を決定。リアルタイムのゲーム環境において、このアプローチは固定予算やヒューリスティックのベースラインを超える性能を示した。 Comment
pj page: https://aneeshers.github.io/realtime-rl/
元ポスト:
[Paper Note] Scaling Embeddings Outperforms Scaling Experts in Language Models, Hong Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel Issue Date: 2026-07-02 GPT Summary- 埋め込みスケーリングを通じてMoEアーキテクチャのスパース性を向上させる研究。特定のレジームにおいて埋め込みスケーリングが優位性を示し、重要なアーキテクチャ因子を体系的に分析。最適化されたシステムと推論スピード向上を組み合わせ、LongCat-Flash-Liteを導入。これは68.5Bパラメータのモデルで、MoEベースラインを上回り、エージェント性やコーディング能力で競争力を発揮。 Comment
元ポスト:
[Paper Note] MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training, Wenhan Ma+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #On-Policy #Author Thread-Post Issue Date: 2026-07-02 GPT Summary- 複数の能力を統合することが困難な大規模言語モデル(LLM)のために、ポストトレーニングの新しいアプローチとしてMulti-teacher On-Policy Distillation(MOPD)を提案。ドメインごとのRL教師を用いて曝露バイアスを排除し、密な最適化信号を提供。実験によりMOPDが他の手法を上回り、教師の能力を効率的に継承することを示した。MOPDは、独立したドメイン教師の開発を可能にし、実用的な能力統合を実現。 Comment
元ポスト:
ポイント解説:
[Paper Note] Autodata: An agentic data scientist to create high quality synthetic data, Ilia Kulikov+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #SelfImprovement #PostTraining #Selected Papers/Blogs #Data #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment
元ポスト:
[Paper Note] Qwen-AgentWorld: Language World Models for General Agents, Yuxin Zuo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #Selected Papers/Blogs #WorldModels #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- 言語モデルに基づく世界モデリングがエージェントの能力を広げる可能性を探る。初の言語世界モデルQwen-AgentWorldは、7ドメインでの環境シミュレーションを実現し、3段階の訓練パイプラインによって既存モデルを大きく上回る性能を示す。加えて、エージェント性強化学習のための制御可能なシミュレーションと、下流性能向上のためのウォームアップとしての効果も検討。 Comment
元ポスト:
MCP, Terminal, Search, SWE, Web, OS, Androidなどの様々なEnvironmentをシミュレーションする統合モデル。興味深い。
[Paper Note] Pretraining Recurrent Networks without Recurrence, Akarsh Kumar+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Pretraining #MachineLearning #NLP #LanguageModel #Selected Papers/Blogs #RecurrentModels Issue Date: 2026-06-22 GPT Summary- 非線形RNNの訓練には、Supervised Memory Training(SMT)を提案。SMTは逐次的なクレジット伝播を避け、1ステップの記憶遷移を監視学習に還元。未来予測に必要な過去の情報のみを保持し、安定した長さO(1)の勾配パスで時間的並列訓練を実現。言語モデリングやピクセル系列モデリングでBPTTを上回る性能を示し、長距離依存性の把握やモデルのスケーリングを促進する可能性がある。 Comment
元ポスト:
所見:
[Paper Note] Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors, Alexander Hägele+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #LanguageModel #Optimizer #One-Line Notes #Author Thread-Post Issue Date: 2026-06-21 GPT Summary- MDデカップリングを提案し、重み行列の「大きさ」と「方向」を別々に制御することで、訓練ダイナミクスを向上させる。これにより、従来のオプティマイザに依存せず、重み減衰やウォームアップが不要に。また、Adam や Muon において、調整されたベースラインを超える性能を示し、幅広いモデルにおいて一貫した効果を発揮する。 Comment
元ポスト:
以下、著者ポストの要約
重み行列にはサイズ(ノルム)と向かう方向(どこをpointするか)があり、同じステップでも重みが小さい時は大きく回転するが、重みが大きいとほとんど回転せず、方向がどれだけ早く変化するかは重みのノルムに依存する。このため、学習中に重みの大きさが調整役になってしまい、学習時の更新幅がLRによって決まるわけではなく、重みの大きさ、weight decayなどの影響によって変化し、学習率が与える影響が間接的なものになってしまう。これを是正するために、NeuralNetworkの重みを固定サイズに保ち(球面上に配置)、方向だけを調整する。
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
と非常に似ているように感じる。
[Paper Note] Process-Oriented Evaluation of AI-Assisted Scientific Writing, Patrick Queiroz Da Silva+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AcademicWriting #Author Thread-Post Issue Date: 2026-06-20 GPT Summary- AI生成と人間による要約を比較し、科学的内容伝達における編集の役割を調査。869キーストロークの編集ログを分析し、AI要約は主体性が高いが、全体的整合性では人間作成要約に劣ることを発見。専門家はAIのソースが明らかになると編集戦略を変える傾向があり、言語モデルは局所的特徴を改善するが、全体的整合性には課題が残る。全体として、機械生成テキストの利点と欠点を明らかにする。 Comment
元ポスト:
[Paper Note] S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence, Yalun Dai+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Reasoning #Selected Papers/Blogs #Robotics #SpatialUnderstanding #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-19 GPT Summary- 空間的知性を必要とする連続的な3D世界において、既存のVLMは静的な推論に限界があります。本研究では、S-Agentという空間ツール使用型エージェントのパラダイムを提案し、空間推論をフレーム中心からシーン中心の理解へと再構築します。S-AgentはVLMを意味的プランナーとして機能させ、物体の定位から高レベルの空間知識の統合を行います。さらに、Scene MemoryとAgent Memoryを用いた時系列記憶機構により、証拠統合が可能になります。実験により、S-Agentがオープンソース・クローズドソース両方のVLMを改善し、S-300Kに対する監視付きファインチューニング(SFTが)同規模のベースラインを凌駕し、高度なモデルとも同等の性能を示すことが確認されました。 Comment
元ポスト:
Gemini 3 Proをoutperformとのこと。Ropediaは独自のデータを大量に収集していると思われるので動向が気になる。
pj page: https://ropedia.github.io/S-Agent/
[Paper Note] Agents' Last Exam, Yiyou Sun+, NeurIPS'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #NeurIPS #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-06-15 GPT Summary- AIシステムはベンチマークで優れた成果を上げているが、現実の経済的価値には繋がっていない。このギャップは評価の問題に起因していると主張し、長期的な実績を伴うAIエージェントを評価する新しいベンチマーク「Agents' Last Exam(ALE)」を紹介。ALEは250名以上の専門家と共に開発され、非物理的産業における1,000超のタスクを網羅。結果はフルパスの平均達成率が1%未満であることを示し、ALEはタスクプールを継続的に拡大し、経済的影響とベンチマークの成功とのギャップを埋める手段として設計されている。 Comment
元ポスト:
著者ポスト:
ポイント解説:
合成データではなく実際にnon-physicalな55の職業によって解かれた1500以上のタスクをverifiableな評価が可能な形式に変換した、データによって構成されたエージェント用のベンチマーク。現実世界の、経済的に価値がある、持続的に取り組まれている専門的なタスクによるエージェントの評価を目的として構築されている。300人以上の100以上の機関の専門家によって構成。
pj page: https://agents-last-exam.org/
[Paper Note] Drifting Objectives for Refining Discrete Diffusion Language Models, Daisuke Oba+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #LanguageModel #DiffusionModel #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- DDLMはカテゴリカルなトークンをデノイズしてテキストを生成しますが、連続生成モデルの漂移法をこのアプローチに応用することを検討します。具体的には、TokenDriftを定式化し、ソフトトークン特徴に基づく漂移を行うことで、DDLMの生成品質を改善しました。実験により、TokenDriftが既存の連続ベースラインを上回る成果を示し、生成品質が著しく向上することが確認されました。 Comment
元ポスト:
[Paper Note] Echo-Memory: A Controlled Study of Memory in Action World Models, Wayne King+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #Evaluation #memory #WorldActionModel Issue Date: 2026-06-11 GPT Summary- Echo-Memoryを提案し、アクション条件付きの世界モデルにおける記憶メカニズムを探究。モデルは初期フレームやカメラアクションから動画を生成し、記憶の効果を考察。共通のビデオバックボーンの下で、異なるメモリ設計を比較し、容量や圧縮、再帰の4つの軸を分離。メモリ評価のプロトコルを用いて、再生忠実度と実際の記憶の関係性を明らかにし、生のコンテキストが記憶容量の基準であり、コンパクト性は容量の代替にならないことを示した。特に、状態空間再帰はオープンドメインでのリターン機構において重要な役割を果たす。 Comment
元ポスト:
[Paper Note] Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory, Ruida Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #Verification #Initial Impression Notes #AgentHarness Issue Date: 2026-06-11 GPT Summary- **Lean4Agent**は大規模言語モデル(LLMs)のエージェントシステムの信頼性を向上させるためのフレームワークであり、正確なワークフローの仕様化・検証を実現。依存型形式言語(FL)であるLean4を用いて、エージェントの挙動を正式にモデリング・検証する最初の試みとして、**FormalAgentLib**を立ち上げ、エージェントの実行中の障害を特定可能とした。さらに、**LeanEvolve**はワークフローを改訂し能力を向上させるもので、実験では検証済みワークフローが失敗したものに比べて**11.94%**改善し、**LeanEvolve**はSWEの性能を**7.47%**向上させることを示した。 Comment
元ポスト:
Agentのワークフローのpre/post conditionを定義しverifiableにすることでワークフローを検証可能にし、失敗が生じた場合はtraceできるようにする
[Paper Note] CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions, Sherin Muckatira+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Evaluation #Mathematics Issue Date: 2026-06-11 GPT Summary- 大規模言語モデルは数学的推論で進展を見せているが、既存のベンチマークは協働的な問題解決のプロセスを捉えていない。CrowdMathは、専門家が注釈を付けた進捗チェーンのデータセットで、複数の参加者によるフォーラム形式の議論を追跡している。評価タスクを定義し、6つのモデルが投稿予測で83-88%の精度を示したが、貢献の機能的意義を特定するのは難しく、最良モデルでもマクロF1が0.42にとどまった。CrowdMathは、数学の解決と協働的な進歩の理解のギャップを明らかにしている。 Comment
元ポスト:
興味深い
[Paper Note] Rethinking the Divergence Regularization in LLM RL, Jiarui Yao+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- DRPOは、大規模言語モデル(LLMs)の強化学習における安定性を向上させるための新しい手法。従来のDPPOはハードマスクに依存していたが、DRPOは滑らかなアドバンテージ重み付き二次正則化を用いて、境界を越えた更新に対する補正信号を提供。これにより、ポリシーシフトによる発散的な更新を抑制し、学習効率を高めることを示した。 Comment
元ポスト:
[Paper Note] Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models, Atsumoto Ohashi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ReinforcementLearning #PostTraining #interactive #Realtime #Author Thread-Post #SpeechToSpeech Issue Date: 2026-06-11 GPT Summary- 全二重音声対話モデルのインタラクティブ性を向上させるため、RLを使用したポスト訓練後のアライメント手法を提案。ポーズ処理、ターン取り、バックチャネル、ユーザーの中断にフォーカスし、人間の会話データから抽出した音声セグメントで特有の報酬関数を最適化。LLMベースの報酬を加えることで応答品質を保持。MoshiとPersonaPlexモデルでの評価により、一貫したインタラクティブ性の改善を確認。 Comment
元ポスト:
[Paper Note] Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models, Yang Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #SparseAttention #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- RLVRは計算コストが高く、長いCOTを生成するが、疎結合注意が密なロールアウトを高速化する可能性がある。過度の疎化は崩壊を招き、緩すぎると速度アップが不十分になる。本研究では、疎から密へのactor-policy不一致を考察し、トークンのstatisticを一定に保つ動的な疎化スケジュールを導入。これにより、Qwen3系列モデルでのロールアウトをそれぞれ2.2倍、2.4倍、2.0倍高速化を達成。さらに、大規模モデルや他のRLドメインにも適用可能で、DistillSparseを用いた軽量な蒸留により、同じ不一致閾値で更なる速度アップが実現できることを示した。 Comment
元ポスト:
[Paper Note] Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models, Mahtab Bigverdi+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#MultiModal #VisionLanguageModel #LatentReasoning #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- 想像的知覚を利用し、VLMの空間推論能力を向上させるために、想像的知覚トークン(IPT)を導入。PET、PT、MVCの課題を通じて約2万件のデータセットを構築し、IPTによる訓練が空間推論の一貫性と精度を高めることを示した。MVCでは3.4%の精度向上を実現し、IPTとラベル監督の組み合わせにより更なる利得が得られた。全体として、IPTは観測されていない構造の推論を支援し、解釈可能な中間表現を提供する。 Comment
元ポスト:
[Paper Note] Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops, Ziqian Zhong+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#RewardHacking #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- エージェントベンチマークの成果検証器が脆弱である中、323件のタスクが最先端モデルによってハック可能であることを発見。ハッカー・フィクサー・ループを導入し、検証器を改良することでエクスプロイトを防止。KernelBenchでは攻撃成功率を62%から0%に低下させ、Gemini 3 Flashでも強力なモデルに対する防御を成功させた。Terminal Wrenchを公開し、ハック可能な環境やエクスプロイトの情報を提供。 Comment
元ポスト:
[Paper Note] Trajectory-Refined Distillation, Li Jiang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Distillation #PostTraining #On-Policy #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- オンポリシー蒸留(OPD)の背後の構造的原因を「プレフィックス・フェイラー」として特定。これにより、トークンごとの密な教師監督が二峰性の教師混合を生じ、切り捨てや再重み付けでは対処できない問題が発生。これを解決するために、Trajectory-Refined Distillation(TRD)を提案。TRDは、学習者のロールアウトを軌跡レベルで修正し、探索を改善。さまざまなベンチマークで一貫して従来のベースラインを上回り、推論のカバレッジを広げる。 Comment
元ポスト:
著者ポスト:
[Paper Note] Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics, Stella Biderman+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-06-11 GPT Summary- AIの科学的理解は、モデルの挙動を訓練ダイナミクスに基づいて研究するべきであり、単なる固定的な分析に留まるべきではない。提案は、初期訓練信号から結果を予測し、轨道の修正を可能にする手法を支持し、望ましい特性を生み出す訓練手続きを設計する重要性を強調する。スケーリング則の成果を能力や公平性、ロバスト性に拡張することが課題であり、具体的な未解決問題を識別し、進展を検討する必要がある。 Comment
元ポスト:
[Paper Note] Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It, Xinyu Zhou+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #Supervised-FineTuning (SFT) #Chain-of-Thought #Reasoning #LongContext Issue Date: 2026-06-11 GPT Summary- CoT-SFTが長い文脈における検索性能を低下させる問題を発見。特に難しい設定でのHypeNetの性能が著しく落ちるため、W_QとW_KをSFT前の状態に戻すQK-Restoreを提案。これにより、訓練コストゼロで推論性能を改善し、長い文脈の処理能力を回復することができた。例えば、HypeNet-5Bでは性能が65.4%から76.4%へ向上した。 Comment
元ポスト:
[Paper Note] Still: Amortized KV Cache Compaction in a Single Forward Pass, Charles O'Neill+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#KV Cache #Compression #Author Thread-Post Issue Date: 2026-06-11 GPT Summary- KVキャッシュのメモリボトルネックを解消するため、軽量で再利用可能な圧縮器Stillを提案。これは凍結された基礎モデルに対して層ごとの小さなPerceiverを用い、一度の学習でコンパクトなキーとバリューを生成する。Stillは圧縮比8×〜200×、文脈長8k〜128kの範囲で優れた速度と品質を実現し、長文脈のベースラインを8〜22ポイント上回る。さらに自由形式の要約にも対応し、高い性能を維持することを示す。 Comment
元ポスト:
[Paper Note] End-to-End Context Compression at Scale, Ang Li+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #LatentReasoning Issue Date: 2026-06-11 GPT Summary- 長文脈言語モデルの推論におけるKVキャッシュのメモリ問題に対処するため、エンコーダ‐デコーダ圧縮を再検討。設計・訓練した圧縮器は、3500億トークン以上で多様な圧縮比を実現し、Latent Context Language Models(LCLMs)として一般タスク性能や圧縮速度を向上。LCLMsは、エージェントが圧縮された長文脈を適応的に活用できる効率的なバックボーンを提供。 Comment
元ポスト:
[Paper Note] Revela: Dense Retriever Learning via Language Modeling, Fengyu Cai+, ICLR'26, 2025.06
Paper/Blog Link My Issue
#InformationRetrieval #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-06-09 GPT Summary- Revelaは、自己教師付きリトリーバー学習のための統一的な訓練フレームワークを提供し、言語モデリングの手法をリトリーバーの訓練に適用します。文書間の意味的依存関係をモデル化し、リトリーバーの類似度スコアを利用して最適化を実現。評価結果は、注釈付きデータを使わずに、各種ベンチマークで従来の手法を上回る性能を示し、スケーラビリティの可能性も確立しました。 Comment
openreview: https://openreview.net/forum?id=e7pAjJZJWb
元ポスト:
[Paper Note] Efficiently Reconstructing Dynamic Scenes One D4RT at a Time, Chuhan Zhang+, CVPR'26 Best Paper, 2025.12
Paper/Blog Link My Issue
#ComputerVision #CVPR #Encoder-Decoder #4D Reconstruction Issue Date: 2026-06-08 GPT Summary- 動画から動的シーンの幾何と運動を理解・再構成するための新しい前方伝播モデルD4RTを提案。単一の動画から深度や時空間対応を一括推定可能で、新しいクエリ機構により計算負担と複雑さを軽減。これにより、3D位置の探索が効率化され、4D再構成タスクで従来を超える性能を実現した。 Comment
元ポスト:
pj page: https://d4rt-paper.github.io/
解説:
[Paper Note] Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments, Parth Asawa+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-06-07 GPT Summary- 継続学習を評価するための初の専門家検証済みベンチマークであるCL-Benchを紹介。六つの多様な領域を対象に、LLMベースのシステムが経験を通じて改善するかを測定。状態を持つシステムは潜在構造を発見可能で、最先端モデルが継続学習を改善する余地があることが明らかに。専用メモリシステムでも問題は解決されず、シンプルなICLが優位であった。このベンチマークにより、現実世界における継続学習の必要性が強調されている。 Comment
元ポスト:
Question (Instance)のSequenceを完了することが求められるContiunual Learningのためのベンチマークで、各instanceは、モデルが事前に知り得ない報告可能な状態を持ち、後続のinstanceは、過去のinstanceの結果(experience)を用いなければならない。また、最終的に、Databaseのmigrationを通じて過去のexperienceを適用不可能にし、このような状況にも柔軟に対応可能な能力も評価する、という話に見える。
[Paper Note] Robots Need More than VLA and World Models, Elis Karcini+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Selected Papers/Blogs #Robotics #WorldModels #VisionLanguageActionModel Issue Date: 2026-06-06 GPT Summary- 汎用ロボット知能はポリシー学習のスケーリング問題に直面しており、非構造化の行動データを効果的なロボット監督信号に変換する仕組みが不足している。本研究では、次世代ロボティクスに必要な4つの要素を特定し、具体的には行動データの自動ラベリング、ヒトの動作のロボットアクションへのリターゲティング、物理法則に基づく3D推論のワールドモデル、動画と言語からの報酬推定インタフェースについて論じる。ロボティクスシステムが物理世界から学ぶための研究課題を提案する。 Comment
元ポスト:
[Paper Note] OneReason Technical Report, OneRec Team+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#RecommenderSystems #Pretraining #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #GenerativeRecommendation #PostTraining #Initial Impression Notes Issue Date: 2026-06-05 GPT Summary- OneRecファミリーの生成型推奨モデルは多くのサービスで利用されていますが、アイテムを表すトークンから有意義なCoTシーケンスを構築するのが困難です。この課題を克服するため、推論能力を探索する予備研究(OneRec-Think、OpenOneRec)を実施しましたが、思考モードが必ずしも優位であるとは限らないことが判明しました。推奨の効果的な推論には知覚と認知の二つの要因が重要であると考え、OneReasonを提案します。具体的には、強力なアイテム的トークン知覚、三レベルの認知強化CoT形式、“専門化→統合”の学習レシピを用いて思考能力を高めます。 Comment
元ポスト:
事前学習/SFT/RLといった現在主流なLLMの学習パイプラインをGenerative Recommender Systemsに適用したモデルのようで、
ItemIDのトークンの意味を理解させるための事前学習等を実施している点が興味深い。
[Paper Note] DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation, Jusuk Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #MultiModal #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- DynaFLIPは、ロボット操作のためのダイナミクスを意識した多モーダル事前学習フレームワークで、運動理解を知覚に統合します。異種の人間とロボットのビデオから構築したトリプレットを用い、画像のみのエンコーダを訓練。三つのモダリティが小さなシンプレックス体積を形成するよう促し、その体積が小さいほど整合が強くなります。シンプレックス体積最小化をコサイン正則化項と対照学習と組み合わせ、重要な制御関連領域に焦点を当てたダイナミクス認識表現を得て、視覚バックボーンとして機能します。多様なシミュレーションと実世界の設定で検証した結果、分布外の状況下で最大+22.5%の改善を達成。視覚表現が行動による世界の変化をエンコードすることで、ロボットの一般化能力が向上することを示唆しています。 Comment
pj page: https://dynaflip-robotics.github.io/
元ポスト:
[Paper Note] Automated Benchmark Auditing for AI Agents and Large Language Models, Junlin Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Selected Papers/Blogs #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 現代のAIベンチマークでは、複雑なタスクが多く含まれ、人間の注釈では検知が難しい問題が存在します。これを解決するために、Auto Benchmark Audit(ABA)を導入し、168のベンチマークを調査。ABAは、あいまいなタスク設計や実行環境の衝突など、25.7%以上のタスクで重大な問題を特定。問題のあるタスクがモデル評価を歪めることを示し、除外することでパフォーマンスが9.9%及び9.6%向上することを確認。今後のベンチマーク発展のため、これらのツールとタスク注釈を公開します。 Comment
元ポスト:
既存のベンチマークを
- 指示の曖昧性
- 環境に内包される問題(競合や依存関係の問題)
- 評価の品質
の観点から監査するAudit Agentの提案
[Paper Note] BAGEN: Are LLM Agents Budget-Aware?, Yuxiang Lin+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- エージェントのリソース消費に対し、コストを実行後にのみ測定するのではなく、予算を積極的な制御信号として扱うべきと提案。予算は内部(計算由来)と外部(行動由来)に分け、エージェントは各計画ステップで残り予算の予測と警告を行う。評価では、強力なエージェントが必ずしも予算意識を持たず、過度に楽観的な傾向が見られた。予算意識信号は訓練可能で、早期停止により失敗したトークンを28〜64%削減でき、SFT+RLがその効果を強化。しかし、正確な区間のキャリブレーションは依然難しい。 Comment
pj page: https://ragen-ai.github.io/bagen/
元ポスト:
以下著者ポストと論文のskim readによるサマリ(読み違えがあるかもしれないので注意)
LLM/AI Agentがbudget(あとどの程度のトークンでタスクを完了できるかの見積もり)を考慮して生成できているか否かを明らかにし、性能とトークン予算の性能は必ずしも相関しないことを示し(現在のフロンティアモデルはトークン予算に対して楽観的で、トークン予算があまり残っていないのに不必要に多くのトークンを消費する)、与えらえたトークン予算に関して、タスクを実現できるか否かの2値分類ははSFTによって強化できる(Qwen-7Bにおいて25.5%->90%まで向上)が、SFT+RLによって正確な残りの予算のrangeを当てるような推論は47%程度で頭打ちで課題が残る、という話に見える。興味深い。
[Paper Note] Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments, Qiuyue Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #mid-training #PostTraining #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment
元ポスト:
[Paper Note] AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence, Kate M. Lubrano+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #Evaluation #Conversation #Emotion #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 感情知性(EI)の評価が重要になる中、AttuneBenchを紹介。実際の複数ターンの人間-モデル対話200件に基づき、感情状態とモデルの挙動をターンごとに注釈。11モデルの評価結果は感情認識や応答品質に関する能力が分離可能であることを示し、嗜好の整合と応答品質の判断がモデル識別に強く寄与することを明らかに。AttuneBenchは、感情的に重要な会話の評価枠組みを提供し、モデルの強みや弱点を診断する。 Comment
元ポスト:
leaderboard: https://public.attunebench.com/
対話をしている本人によるプロンプト、アノテーション、マルチターンの会話を前提にモデルのEQを測定するためのベンチマークのようである(従来は合成プロンプト、シングルターン、third-partyに基づいたアノテーション(つまり対話している本人ではない、ということだと思われる)によるベンチマークだったとのこと)。
[Paper Note] Parallax: Parameterized Local Linear Attention for Language Modeling, Yifei Zuo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-30 GPT Summary- 大規模言語モデル(LLMs)用にスケール可能な局所線形アテンション(LLA)を提案するParallaxを導入。LLAの数値解法を排除し、アテンション機構を効率化。FlashAttentionに対して高い演算強度を実現し、事前学習全体で一貫したパープレキシティ改善を確認。新たな現象MuonによりParallaxの能力を向上させた。この研究は、注意機構のアーキテクチャとオプティマイザの共同設計の重要性を示す初の例である。 Comment
元ポスト:
Muonと組み合わせると非常に高い性能を発揮するようである
早速nanoGPT speedrunでParallaxによってSoTAが更新されたようである:
[Paper Note] The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, MiniMax+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #OpenWeight #SelfImprovement #MoE(Mixture-of-Experts) #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment
元ポスト:
ポイント解説:
関連:
- MiniMax-M2.7, MiniMax, 2026.03
expertの数を大きくしているようで、この設計は下記の知見と一致する:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
[Paper Note] VGGT-$Ω$, Jianyuan Wang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Transformer #Architecture #CVPR #Selected Papers/Blogs #3D Reconstruction #3D (Scene) #Backbone #Scalability Issue Date: 2026-05-27 GPT Summary- VGGT-Ωは、フィードフォワード再構成モデルの新たなアプローチを提案し、静的および動的シーンの再構成精度と効率を向上させます。アーキテクチャの改良により、GPUメモリ使用量を約30%に抑えつつ、15倍の監視付きデータを活用。レジスタを用いたコンパクトな情報表現により、フレーム間の情報交換を効率化しました。VGGT-Ωは複数のベンチマークで優れた結果を示し、Sintelでは従来ベストを77%上回る精度を達成。学習済みのレジスタは視覚・言語モデルの向上に貢献し、再構成が空間理解の強力なタスクとして機能する可能性を示しています。 Comment
pj page: https://vggt-omega.github.io/
元ポスト:
関連:
- [Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
[Paper Note] Strong Teacher Not Needed? On Distillation in LLM Pretraining, Taiming Lu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Distillation #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- 知識蒸留における教師と生徒の関係を再検討。強→弱、同等、弱→強の関係で蒸留の有効性を分析し、教師が強力である必要はないことを発見。適切に損失を混合すれば小規模教師でも大きな生徒モデルを改善可能。教師のパラメータ数や訓練トークンの増加は蒸留効果を逆転または飽和させることも。蒸留は分布外および下流タスクの性能を同一ドメインより改善する傾向がある。これにより、強力な教師の必要性に疑問を投げかける。 Comment
元ポスト:
モデルサイズやperplexity視点での強-弱ではなく、どちらかというとdownstreamタスクでの性能の方が大事なのでは?結局のところ、生徒モデルよりも教師モデルの方が秀でている部分が何かしら存在すれば、学習シグナルを得られる可能性はあるよね、という話な気が。
[Paper Note] LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws, Xu Ouyang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Quantization #Scaling Laws #PostTraining Issue Date: 2026-05-27 GPT Summary- LLMの性能改善を目指し、シャノン・スケーリング則を提案。この理論は、モデルパラメータをチャネル帯域幅、学習トークンを信号電力と見なし、学習信号と内在ノイズの相互作用を捉える。信号対雑音比が不十分な場合、性能が劣化することを示し、PythiaやOLMo2における実験で理論を検証。シャノン・スケーリング則は古典的手法を上回り、ロスの谷を正確に捉え、未知のモデル予測でも高いR^2スコアを達成。従来の単調性に基づくモデルは劣化する。 Comment
元ポスト:
[Paper Note] Understanding Data Temporality Impact on Large Language Models Pre-training, Hippolyte Pilchen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #Temporal #LanguageModel #Factuality #Selected Papers/Blogs #FactualKnowledge #One-Line Notes Issue Date: 2026-05-27 GPT Summary- 時間的根拠を学ぶためのLLMの訓練におけるデータの並び順の重要性を探求。7,000件を超える時間的質問のベンチマークを作成し、事実と時期の結び付けを評価。6Bパラメータモデルを時系列で訓練した結果、シャッフル訓練と同等以上の性能を示しつつ、最新の知識を一貫して保持。これにより、時間的順序付けが知識の新鮮さを向上させることを明らかにした。関連コードやデータセットも公開し、今後のLLMの継続学習研究に寄与。 Comment
元ポスト:
事前学習時に時系列に応じて並び替えをしたコーパスと、シャッフルしたコーパスの場合、前者の場合freshな知識が必要な質問に対する応答性能が改善する。実験では、Common Crawlのsnapshotの時刻のタイムスタンプに基づいてorderを決定しているようである(2.3説冒頭)。
評価のために作成されたQA例が下記で、NBAのバスケチームのコーチのような時間とともに正解が変化するような事実に関する質問によって構成されているようである。これらはwikipediaから特定の年と紐づいた (subject, relation, object) のタプルを抽出することによって生成される。
[Paper Note] Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws, Nandan Kumar Jha+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Optimizer #Scaling Laws #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- オプティマイザは、言語モデルの性能に重要な影響を与えるが、通常は固定的な詳細として扱われている。本研究では、異なるオプティマイザが同じTransformerアーキテクチャのスペクトルスケーリングに与える影響を調査し、AdamWとMuonの間で顕著な違いを発見した。特に、Muonは線形スケーリングを示し、スケーリング指数が2.3倍に増加するのに対し、AdamWは弱いスケーリングを示した。この異差は検証損失だけでは説明できず、同一の損失が異なる表現構造を持つ可能性を示唆する。オプティマイザの効果はアーキテクチャの効果を上回ることがあり、最適化を表現スケーリングの重要な要素として捉える必要性を強調し、オプティマイザとアーキテクチャの共同設計を促進する。 Comment
元ポスト:
lossは同じでも、AdamW/Muonの間で形成される内部representationの構造が異なる(説)
[Paper Note] One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs, Di He+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #LearningRate #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- Layerwise Learning Rate(LLR)を導入し、Transformer層ごとに異なる学習率を割り当てることで訓練を効率化。重尾性を考慮した学習率調整により、訓練の均一化、収束の加速、一般化の改善を実現。50の異なる条件での実験で、最大1.5倍の訓練速度アップを達成し、1Bモデルのゼロショット精度を47.09%から49.02%に改善。低いチューニングオーバーヘッドも特長。 Comment
元ポスト:
Layerごとに学習率を調整することで、学習効率を改善する
[Paper Note] Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate, Dayal Singh Kalra+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Embeddings #Analysis #Pretraining #NLP #LanguageModel #HyperparameterTransfer Issue Date: 2026-05-27 GPT Summary- ハイパーパラメータ転送は、小規模から大規模モデルへの最適化に不可欠で、特にスケーリング則の適合や適切なパラメータ化の選択が重要です。本研究では、ハイパーパラメータ転送をスケーリング則適合の品質、外挿誤差のロバスト性、パラメータ化による損失ペナルティの三つの指標で定量化する枠組みを提案。また、μPがSPに比べて高品質な学習率転送を提供する理由を解明し、埋め込み層の学習率最大化が訓練の安定性とハイパーパラメータ転送を向上させることを示しました。さらに、ウェイト減衰はスケーリング則の適合を促進する一方で、固定トークン設定が外挿ロバスト性を損なう可能性も指摘しました。 Comment
関連:
- [Paper Note] Scaling Exponents Across Parameterizations and Optimizers, Katie Everett+, ICML'24
- [Paper Note] A Theory on Adam Instability in Large-Scale Machine Learning, Igor Molybog+, arXiv'23, 2023.04
元ポスト:
[Paper Note] ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models, Aaron Defazio, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Optimizer #Selected Papers/Blogs #Scheduler #Scheduler-free Issue Date: 2026-05-27 GPT Summary- Schedule-Free Learningは、任意の時点で効果的に訓練できる手法として、高い成果を挙げているが、これまで小規模なスケールでの適用に限られていた。私たちは、この手法を大規模モデルとバッチサイズに拡張するための修正を行い、学習率やスケジュールが不要なScheduleFree+を提案。これにより、従来のWSDスケジュールを上回る訓練が実現され、長時間の訓練で特に効果を発揮することが示された。パラメータあたりのトークン数が1000で、先端技術よりも31%の性能向上を達成した。さらに、この手法はモデル平均化とチェックポイントのマージ利用の理論的基盤も提供する。 Comment
元ポスト:
[Paper Note] Code as Agent Harness, Xuying Ning+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #AgentHarness Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLMs)は、コード理解と生成において優れた能力を示しており、エージェント性を持つシステムでは、コードがエージェントの推論や行動に重要な役割を果たすようになっている。この研究では、「エージェント・ハーネス」という観点から、コードをエージェント基盤の中心と位置づけ、三つの層(ハーネス・インターフェース、ハーネス機構、マルチエージェント設定へのスケーリング)を整理して調査する。具体的には、コードがエージェントを接続し、計画やフィードバック駆動の制御を行う仕組み、そしてマルチエージェント環境での協調を支援する役割を探る。また、評価方法やハーネスの改善、安全性などの未解決課題も概説し、コードをエージェント的AIの中心に据えることで、実行可能で検証可能なAIエージェント系への統一的なロードマップを示す。 Comment
ポイント解説:
所見:
[Paper Note] LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation, Yukang Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #LongContext #Selected Papers/Blogs #VideoGeneration/Understandings #LowPrecision Issue Date: 2026-05-27 GPT Summary- LongLive-2.0は、長編動画生成のためのNVFP4ベースの並列基盤を提供し、速度とメモリの問題を解決する。Balanced SPによるシーケンス並列自己回帰訓練を導入し、効率的な教師強制レイアウトを実現。従来手法と異なり、拡散モデルを直接調整し、リアルタイム生成へ変換可能。推論においては、NVFP4量子化を用いたKVキャッシュによってメモリ節約を図り、最大2.15倍の速度向上を達成。初のNVFP4訓練システムとして、高速な推論(45.7 FPS)を実現。 Comment
pj page: https://nvlabs.github.io/LongLive/LongLive2/
元ポスト:
関連:
- [Paper Note] LongLive: Real-time Interactive Long Video Generation, Shuai Yang+, arXiv'25, 2025.09
[Paper Note] HalluCitation Matters: Revealing the Impact of Hallucinated References with 300 Hallucinated Papers in ACL Conferences, Yusuke Sakai+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Citations #NLP #LanguageModel #AIAgents #Hallucination #Selected Papers/Blogs Issue Date: 2026-05-27 GPT Summary- HalluCitationと呼ばれる幻の引用が科学的信頼性に深刻な影響を及ぼしている。研究では、2024年から2025年に発表されたACL、NAACL、EMNLPの全ての論文を分析し、約300件にHalluCitationが含まれていることを確認。特にEMNLP 2025での発生が顕著で、信頼性に影響を及ぼす可能性がある。
[Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #AgentSkills #Initial Impression Notes Issue Date: 2026-05-26 GPT Summary- エージェントのスキルをデジタル空間内で最適化するために、SkillOptという体系的なアプローチを提案。これにより、評価されたロールアウトを基にスキル文書の編集を行い、検証スコアを改善させることが可能に。多様なベンチマークで他の手法を上回り、GPT-5.5での性能向上も実現。最適化されたスキルは異なる環境間での移動でも価値が保持されることが確認された。 Comment
元ポスト:
自然言語で記述されるスキルを訓練可能な外部パラメータとして扱う
ポイント解説:
解説:
[Paper Note] Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning, Benhao Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #LatentReasoning #RecurrentModels #RecursiveModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- 潜在状態を反復的に更新することで推論のスケーリングを実現するモデル(EqR)を提案。これにより、タスク特異の情報なしでテスト時のスケーリングが可能に。内部ダイナミクスを深さと広さで調整し、アトラクターへの収束を強化。シンプルなケースは少ない反復で収束し、難しいケースではスケーリングが有効。最終的には、精度がSudoku-Extremeで99%以上に向上。学習されたアトラクターの分布が反復的推論の理解に寄与することを示唆。 Comment
元ポスト:
関連:
- [Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05
本研究とモチベーションが非常に類似しているように感じる。
解説:
[Paper Note] Vector Policy Optimization: Training for Diversity Improves Test-Time Search, Ryan Bahlous-Boldi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Diversity #Selected Papers/Blogs #EntropyCollapse #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- LLMが新しい環境に適応し、多様なタスク固有の報酬を持つロールアウトを選択できるように、Vector Policy Optimization(VPO)を提案。VPOはベクトル報酬空間を活用し、テスト時検索で最強のスカラーRLベースラインと同等かそれを上回る性能を示す。進化的探索においては、従来のモデルでは解決できない問題を解決可能。多様性の最適化が今後のポストトレーニング目標となる可能性を示唆。 Comment
元ポスト:
[Paper Note] A Bitter Lesson for Data Filtering, Christopher Mohri+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #DataFiltering #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- 高計算資源を活用したスケーリング研究で、大規模モデルの事前学習におけるデータフィルタリングを検討。一般的に思われる高品質データのみが必要との見解に反し、実験は、十分な計算資源があればデータフィルターなしが最良であることを示す。訓練された大規模モデルは低品質や誤誘導データを受け入れ、むしろ「質の悪い」データからも恩恵を得ることが判明。 Comment
元ポスト:
LLMの事前学習において、十分に大きなモデルサイズと計算量があれば、データフィルタリングをしない場合の方が最終的にperplexityがデータをフィルタリングしたモデルよりも上回る。これはbad data (e.g., トークンのシャッフル, ランダムな文字列の挿入)を追加した場合でも当てはまる。
データプールのサイズが大きな数な場合でも、フィルタリング手法とフィルタリングがない手法との交差点が変わるのみで、その交差点は現実的なエポック数に留まったままである。データのスケーリングの傾向に基づいて、インターネットサイズのデータサイズに外挿をすると、約1e30 FLOPsが必要となる試算になるが、数年以内に到達可能な計算量と考えられる。
ダウンストリームタスクへの性能にも(ノイジーだが)事前学習での改善は寄与する。ただし、事前学習させたトークン数が少ない場合はフィルタリングした方が性能が良く、十分な計算量を投じる必要がある。
といった話が著者ポストに書かれている。興味深い。
逆に言うとこの傾向は、モデルパラメータ、計算資源が十分に大きいことが前提だと考えられるので、PhiのようなSLM研究において得られた学習データの高品質化が重要という知見とは競合しないと思われる。
解説:
関連:
- [Paper Note] When Bad Data Leads to Good Models, Kenneth Li+, ICML'25, 2025.05
[Paper Note] Useful Memories Become Faulty When Continuously Updated by LLMs, Dylan Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#DocumentSummarization #Analysis #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory Issue Date: 2026-05-23 GPT Summary- 過去の経験から学ぶエージェント記憶は、生データと再利用可能な教訓という二つの記憶形態を統合する。しかし、現在のLLMによる統合記憶は、効果的に役立つ経験から生成されても誤りを含むことが多い。記憶の有用性は統合が進むにつれて劣化し、特定の問題では失敗が見られる。異なる更新スケジュールは質的に異なる記憶を生み出し、エピソードの保持のみでは統合の効果を競合する。制御された環境下でエージェントが生のエピソードを保持することが精度を向上させることが示され、統合は明示的に管理するべきである。今後は、安全に統合できるLLMの開発が求められる。 Comment
元ポスト:
[Paper Note] Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation, Théo Gigant+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Tokenizer #Selected Papers/Blogs #Byte-level #Author Thread-Post Issue Date: 2026-05-22 GPT Summary- サブワードトークン化の訓練効率とモデル性能への影響を分離し、様々な次元で仮説を検証。バイトレベル環境でのシミュレーションにより、サブワードモデルの優位性を明らかにし、訓練スループットの向上とサブワード境界の重要性を強調。将来のモデル改良への洞察を提供。 Comment
LLMに記憶の更新(要約)。任せ、継続すると最初は性能が向上するが、じきに低下していき、記憶なしのモデルが上回るようになる。無条件にLLMに記憶を更新させるのではなく、要約をするタイミングを明示的に指定する、生のエピソードを最優先するといった対策があるといった感じかもだが、ちょっともう少しちゃんと読んだ方が良さそう。
元ポスト:
[Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Mixture-of-Experts (MoE) アーキテクチャの設計選択を体系的に検討し、2,000件の事前学習ランを実施。エキスパート数、粒度、サイズの変化で一貫した性能向上を確認。活性パラメータ規模の増加が性能向上に寄与し、最適なエキスパートサイズは総パラメータ数に依存しないことが明らかに。共有エキスパートやロードバランシングの影響は小さく、ドロップレス・ルーティングは有益。全体として、エキスパート数と粒度にフォーカスするシンプルなアプローチが有効であることを示唆。 Comment
元ポスト:
MoEアーキテクチャにおいては、expertのサイズと数が重要であり、他の要素は最小限の影響しか与えない
- Expertの総パラメータ数が増えれば増えるほど性能が改善する(アクティブパラメータ数に対する総パラメータ数が128倍などの極端な場合でも性能が改善)
- Expertの数は多ければ多いほど良い。また、Expert一つに対する最適なサイズは総パラメータすうには関係なく、アクティブパラメータ数にのみに依存して決まることが明らかになった。このため、まずアクティブパラメータ数を優先的に決めて、VRAMが許す限りエキスパートの数を増やすのが良い
- MoEアーキテクチャが優れているのは、ブロックを小さく分割したからではなく、非アクティブなパラメータが存在することによるSparseな活性化によって生じる(MLPを細かいブロックにして全てを活性化させても性能が悪化した実験を受けて、ブロックを細かく分割することではなくsparseな活性化に鍵があると結論)
- 共有エキスパートや、サイズを不均一にしたエキスパートの設計には効果がない
- ルーティングに関しては、特定のエキスパートにトークンが偏った場合のToken Droppingは実施せず、Droplessなルーティングをする方が一貫して少しだけ性能が良い。極端に強い/弱いロードバランシングは性能の劣化を招くが、他の設定ではほぼ最適なものを達成できるので、Token Droppingを防ぐことに注意して、あとは一般的な設定を採用すれば良い。
- レシピをまとめると
- 最大のFLOPs/Memoryの予算を決め、active/totalのエキスパートのパラメータ数を決める
- アクティブパラメータ数から最適なエキスパートのサイズ(総数)を見つける
- token droppingを防ぐようなルーティング設定で、ロードバランシングのsanity checkをする
といった 話が著者ポストに書かれている。
[Paper Note] ELF: Embedded Language Flows, Keya Hu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #DiffusionModel #Selected Papers/Blogs #FlowMatching Issue Date: 2026-05-21 GPT Summary- 連続データ生成において拡散モデルとフローに基づくモデルの成功が言語モデリングへの関心を高めている。論文では、連続的なDLMを離散トークンへの最小限の適応で実現するEmbedded Language Flows(ELF)を提案。ELFは連続埋め込み空間に留まりつつ、従来の手法を活用して離散トークンへ写像。実験の結果、ELFは既存のDLMを大幅に上回り、高い生成品質を少ないサンプリングステップで達成することを示した。 Comment
元ポスト:
[Paper Note] Negation Neglect: When models fail to learn negations in training, Harry Mayne+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #PostTraining #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- Negation Neglectは、LLMを否定のある文書でファインチューニングすると、モデルがその主張を真実だと信じてしまう現象を指す。実験では、否定を含む文でファインチューニングしたモデルの信念率が2.5%から88.6%に増加。一方、否定を伴わない場合は92.4%と高い。否定を主張に局在させることで、モデルは否定を正しく学習可能。また、この現象は他の認識論的修飾子やAIの挙動に影響し、AIの安全性に懸念をもたらす。 Comment
元ポスト:
[Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #NLP #LanguageModel #Architecture #Test-Time Scaling #Selected Papers/Blogs #Encoder-Decoder #LatentReasoning #RecursiveModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- 将来のニューラル推論システムにおける拡張計算の実装として、Generative Recursive reasoning Models (GRAM)を提案。GRAMは、再帰的潜在推論を確率的な複数の潜在軌道に変換し、条件付き推論や無条件生成を可能にする。これにより、従来の決定論的モデルよりも改善された性能を示し、構造化推論や制約充足タスクにおいて有効性を発揮。 Comment
pj page: https://ahn-ml.github.io/gram-website/
元ポスト:
先行研究:
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
- [Paper Note] Less is More: Recursive Reasoning with Tiny Networks, Alexia Jolicoeur-Martineau, arXiv'25, 2025.10
全然まだ理解できていないが、depth(iterative refinement)のみではなく、width(multiple parallel trajectories)方向にinference-time scaling可能なrecursiveなアーキテクチャの提案で、
LoopedTransformerのようなモデルはdeterministicな推論プロセスなため単一の軌跡に収束する(同じ入力に対して同じ出力をする)が、本研究では再帰的な推論プロセスにおいて、deterministicなhidden stateの推論に加えて、確率的でlearnableなguidance ε_t(ε_tの分散の大きさによって探索の度合いを変化させられる)をサンプリングして加えることで、多様なlatent trajectoryを生成可能にするで、自然なparallel inference-time scalingを可能にする
という感じだろうか。
[Paper Note] MeMo: Memory as a Model, Ryan Wei Heng Quek+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #memory #One-Line Notes Issue Date: 2026-05-21 GPT Summary- MeMo(Memory as a Model)フレームワークは、LLMのパラメータを変更せずに新しい知識を専用のメモリにエンコードすることで、タイムリーな情報適用を可能にする。これにより、複雑な関係の把握、検索ノイズへの耐性、壊滅的忘却の回避を実現し、LLMへのプラグアンドプレイ統合が可能となる。実験結果は、BrowseComp-Plus、NarrativeQA、MuSiQueの各ベンチマークにおいて高い性能を示した。 Comment
元ポスト:
frozenなgeneratorモデルでコーパスからmemory model用のQAデータを合成し、QAデータを用いてmemory modelに知識を埋め込み、frozenなexecutive modelがmemory modelから情報を引き出しながらクエリに応答するアーキテクチャ
[Paper Note] HRM-Text: Efficient Pretraining Beyond Scaling, Guan Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SmallModel #Architecture #Selected Papers/Blogs #LatentReasoning #RecurrentModels Issue Date: 2026-05-20 GPT Summary- HRMを用いた新たな言語モデルは、多タイムスケール処理を取り入れ、計算資源を大幅に節約しつつ高い性能を達成。指示-応答ペアに特化した訓練により、ゼロからの学習でもMMLUやARC-Cなどで顕著な結果を出し、公開モデルと対等以上の性能を示す。これは、アーキテクチャと学習目標の共設計によって、事前学習をよりアクセスしやすくする可能性を示唆している。 Comment
元ポスト:
気になる
[Paper Note] Targeted Neuron Modulation via Contrastive Pair Search, Sam Herring+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #Steering #Initial Impression Notes Issue Date: 2026-05-20 GPT Summary- CNAを用いて、有害なプロンプトを特定する活性化を持つニューロンの0.1%を抽出。これにより、拒否率を50%以上低減しながら、流暢さと非退化性を保持する。既存の識別構造をターゲット可能な拒否ゲートに変換することで、信頼性の高い行動誘導が可能であることを示した。 Comment
元ポスト:
追加のSAEの学習や重みの調整無しで、contrastiveなprompt pairから二つのsetの間で最もactivationが異なるMLP上位0.1%を分離することで、目的の挙動をsteeringする
[Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Transformer #LongContext #PositionalEncoding #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-19 GPT Summary- RoPEの制約を分析し、文脈長の増加が局所性バイアスとトークン関連性の一貫性を損なうことを証明。アテンションスコアがランダム推測に近づく中、位置やトークンの識別が困難になることを明らかに。ハイパーパラメータ増加は識別能力を向上させるが、トレードオフが生じることも示唆。従来のアーキテクチャではこの制約を克服できず、将来のモデルには新たなメカニズムが必要とされる。 Comment
元ポスト:
これが真であればlong contextを扱う上での根本的なアーキテクチャ側の課題として非常に重要な知見
- Positional Encodingという仕組みにそもそもの限界があるのか、改善したらさらなるlong contextが扱えるのか
- Positional Encoding機構にそもそも原理上の限界があるなら、単一のモデルで超long contextの実現は非現実的になるので、複数のモデルやシステムの連携が必須になる
というような感想を抱いたが、果たして。実際複数モデルの連携という意味でいうとサブエージェントのを使ったら仕組みはすでに動いている。
所見:
[Paper Note] Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs, Guijin Son+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Mathematics #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-14 GPT Summary- Soohakという新たな数学ベンチマークを導入し、439問から成り、フロンティアモデルの推論能力を評価。Challengeサブセットでは、トップモデルが30.4%未満の成功率である一方、拒否サブセットはモデルが50%を超えられない問題解決能力を確認。これにより、拒否能力が新たな評価基準として浮上し、2026年末に公開予定のデータセットで混入を防ぐ。 Comment
元ポスト:
60人以上の数学者によってゼロペースで作成された新たなベンチマーク。数学者は作問をする際にLLMの利用は禁止され、問題を作成しsubmitする。その後レビュープロセスを経て問題が収録されるかが決まっているようである。レビュープロセスでは、LLMによる難易度の確認や類似した問題がないかなどの確認をし、人間がLLMの出力を見て疑わしいか否か判断する。レビュワーは作成者にフィードバックをし、質問や確認などを行う。また、LLMを利用したであろう作成者はbanされ、問題に調整が必要な場合は修正がなされる。提出された問題は、小、中、大のスケールのOpenLLMによって正解できたか否かによって、miniとして収録されるかChallengeとして収録されるかが決まり、特にChallengeについては作成者が特定の教員やポスドク、IMOメダリストなどに限定されたようである。
99個の、矛盾や前提の抜け、正解が一意に決まらないill-posedな問題も含まれており、モデルが回答を拒否しなければならないRefusal Questionsが含まれているのが大きな特徴。
研究レベルの問題の定義がよくわかっていないのだが、要は競技で出題されるような「既存の知識や枠組みの中でのマルチステップでの推論」を必要とするものではなく、「数学に関する最先端を切り拓くレベルの問題」のことのようである。これでもまだよくわからなかったのだが、問題の作成者に対するインタビューによると、SOOHAK-Miniの問題は短時間で作成できたが、SOOHAK Challengeの問題は1問作成するのに1日以上の作業を要することがしばしばあったとのこと。Challengeレベルの問題を作成するためのアプローチとしては典型的に2つあったとのことで、
- 問題作成者自身が最近考えていた研究と隣接した問題を提出するもので、問題を解くステップにおいて既存の定理や、論文などで公式には発表されていない事実や、数学者の中でヒューリスティクスを組み合わせる必要があるような要素を含むもの(folklore-level reasoningと呼ばれる)
- ニッチな研究論文に基づいて問題を設計する方法
などがあったようである。つまり、競技という枠組みは超えて、数学の研究者が研究として考えるレベルの問題ということだと理解した。
コーディングにおいて人間を置き換えるレベルであろうモデルも、未知の数学の問題や、そもそも問題として不適切なものの回答拒否は広く使われたベンチマークほどはうまくいかない。新たに拒否が最適化のobjectiveとして必要なことが示唆されているが、逐一人類はAIにこの挙動が足りないね、じゃあ学習データを用意して学習しよう、ということを繰り返していくのだろうか?正解ベースの学習にそろそろ限界が見えてきた気がしており、AnthropicのペルソナやConstitutionに基づいた学習のような特定の領域に広く汎化するような学習方法の模索が必要な気がする。
拒否する挙動のための正解データを用意して学習するとしよう。そうすると、モデルが持つ他の能力に影響を与えるだけでなく、本来拒否が不要な場面でも拒否するようになる可能性が高い(たとえばクエリが数学に関連しているだけで、一定の確率で拒否するリスクは生じるように思われる)。この問題を解決するために最近はOn-Policy Distilation (OPD)が活用されるが、OPDはこの問題を緩和することには寄与するが、根源的に解決しているわけではない(と思われる)。genericな能力の発現に際して、モデル自身がcontextに応じて、どの挙動を発現させるべきかを"線引き"できるような能力とアーキテクチャ(マルチモーダルなモデルのようにMoEのexpertをbehaviorに関しては分離するなどだろうか)が必要に思う。
[Paper Note] Efficient Pre-Training with Token Superposition, Bowen Peng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-13 GPT Summary- Token-Superposition Training(TST)は、事前学習中のデータスループットをFLOPあたり改善する新しい手法である。TSTは、トークンを一つのバッグにまとめてマルチホットクロスエントロピーで訓練するスーパーポジションフェーズと、標準的な訓練に戻す復元フェーズから成る。270Mおよび600Mパラメータで広範に評価され、10B A1Bモデルで最大2.5倍の事前学習時間短縮を達成し、ベースラインを一貫して上回ることを示した。 Comment
元ポスト:
事前学習の序盤にbag of tokensを読み、bag of tokensを予測するシンプルな変更で、学習が最大2--3倍高速化される
所見:
解説:
所見:
[Paper Note] AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents, Zhengkang Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #Generalization #LongHorizon #Initial Impression Notes #ToolUse Issue Date: 2026-05-13 GPT Summary- AgentEscapeBenchを導入し、LLMエージェントの新規ツール使用手順の推測・実行・修正能力を評価。脱出ゲーム形式のタスクは、依存グラフに基づいてエージェントが外部関数を呼び出し、隠れ状態や中間結果を追跡する。実験では、依存深さが増すほど性能が急低下し、成功率が難易度により大きく変動することを示した。これにより、現在のエージェントは局所的なツール使用には強いが、深い文脈依存には苦労していることが明らかに。AgentEscapeBenchは、エージェント能力の測定と今後の訓練への示唆を提供する。 Comment
元ポスト:
エージェントが慣れ親しんだ設定から離れて、脱出ゲーム風のベンチマークによって、未知のツールやアイテムを活用して環境と相互作用しながら文脈を理解し、最終的なanswerを答えるなければならない。
新たな環境での未知のツールに対する汎化性能を測るベンチマークであり、非常に興味深い。
下記研究のように、既存の知識への依存を減らして、実務能力を問うベンチマークとも言える:
- [Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
[Paper Note] Compute Optimal Tokenization, Tomasz Limisiewicz+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Tokenizer #Scaling Laws #Selected Papers/Blogs Issue Date: 2026-05-13 GPT Summary- トークンの情報粒度がスケーリング法則に与える影響を調査。988モデルを訓練し、圧縮率(トークンあたりのバイト数)を設定。実験結果は、モデルサイズは通常のトークン単位ではなく、データのバイト数に比例してスケールすることを示す。最適な圧縮率はBPEのものとは異なり、計算量が増すと低下。これらの発見は、トークン化スキームの選択において言語モデル開発者に有益な指針を提供。 Comment
元ポスト:
[Paper Note] SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training, Shengkun Tang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Pruning #Distillation #SmallModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-13 GPT Summary- 大規模事前学習におけるエキスパート混成モデル(MoE)の圧縮を体系的に探求し、プルーニングと知識蒸留(KD)を適用する方法を検討。プルーニングは、スクラッチからの訓練よりも一貫して優れた初期化を提供し、異なる圧縮手法は同様の最終性能へ収束。簡易な部分保存型統合戦略で下流性能を向上させ、KDと損失を組み合わせることで効果を上げる。漸進的なプルーニングスケジュールはワンショット圧縮を上回り、最適化に寄与。結果として、Qwen3-Next-80A3Bモデルを圧縮し、競争力を維持する指針を提供。 Comment
元ポスト:
大規模なMoEモデルから小規模なvariantを学習する方法に関する分析
[Paper Note] Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting, Ishaan Watts+, ICML'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Catastrophic Forgetting #ICML #mid-training #Selected Papers/Blogs #One-Line Notes #DownstreamTasks #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 事前訓練最適化手法は、基盤モデルの能力維持に影響を与える幾何学を考慮すべきである。本研究では、平坦な極小点を目指す三つのアプローチ(SAM、大きな学習率、短縮された学習率減衰)を分析し、モデルサイズが20M〜150Mパラメータの範囲で、ポスト訓練後のパフォーマンス向上と忘却の最大80%低減を実証した。また、OLMo-2-1Bモデルへの短いSAM訓練を適用することで、MetaMathでは忘却を31%、4ビット量子化後には40%低減できることが示された。 Comment
元ポスト:
downstreamタスクでの性能を最大化するためには、baseモデルのlossではなく、モデルが重みを更新した時にどれだけ事前学習の知識が保持されるかが鍵であり、learning-forgettingのトレードオフを見るべきという話で、
なぜモデルの更新によって忘却が起きやすいかというと、モデルが急峻な極小点 (Sharp Minima) に収束してしまっているためで、これではわずかな重みの更新でも大幅な性能低下を起こしてしまう。このため、平坦な極小点(Flat Minima)に重みを収束させることでよりモデルの知識を安定させることができる。
Flat Minimaを見つけるために、Sharpness-Aware Minimization (SAM)と呼ばれる手法を採用し、式(5)で定義されるような、パラメータに摂動を加えた時のlossの最大値が最小となるようにパラメータを最適化する。
[Paper Note] Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction, Zhuofeng Li+, NeurIPS'26 Spotlight, 2026.05
Paper/Blog Link My Issue
#InformationRetrieval #NLP #Search #LanguageModel #AIAgents #NeurIPS #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 直接コーパスと相互作用する(DCI)アプローチを提案し、リトリーバAPIや固定された類似度インターフェースに依存せず、エージェントが生のコーパスを汎用的な端末ツールで直接検索できるようにします。この方法は、オフラインのインデックス作成を不要にし、進化するコーパスに自然に適応します。実験では、DCIがBRIGHTおよびBEIRデータセットで強力なベースラインを上回り、従来の手法なしに高精度を実現したことが示されました。この結果は、検索の質が推論能力だけでなく、コーパスとの相互作用のインターフェースにも依存することを示唆しています。 Comment
元ポスト:
基盤モデルが賢くなる中で、top-kによるretrievalが検索におけるベストなインタフェースなのか?という疑問を投げかけた研究で、ベクトル検索などのRetrieverではなく、AI Agent自身にgrep等を用いて直接コーパスとinteractionをさせる(Direct Corpus Interaction)ことでBrowseCompのようなQAデータセットにおいてEmbeddingを用いた手法よりもより低コストで高いスコアを獲得できることを示したようである。
DCIは有用な手がかりを見つけた時に、それをrearoning stepに結びつけて深掘りしていくような挙動を実現しやすい点が強みであるが、コーパスサイズが大きくなるにつれて最初のアンカーとなる手がかりを見つけるためのコストが大きくなり、深さへの強みはあるが、広さには弱い性質があることから、この手法が唯一無二の解というわけではなく、設計の際に「どのモデルがtop-kの検索でベストか?」という視点だけでなく、「AI Agentにコーパス全体に対してどのようなオペレーションを持たせるべきか?」という問いかけも提起する
といった話が元ポストに書かれている。
昔から検索に全てのケースで最強な手法はこれ!みたいなものはないので、こういった選択肢もあるよということを頭に入れて引き出しに入れておき、直面する課題に対して有効な方法は何かを考えることが重要と思われる。
所見:
NeurIPS'26 Spotlight
https://lnkd.in/p/gshSB3m7
[Paper Note] Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models, Issa Sugiura+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Supervised-FineTuning (SFT) #Japanese #PostTraining #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 日本語のVQAシステムに対する高品質なデータセットJagleを紹介。約920万件のインスタンスを含み、異種ソースから生成したVQAペアを用いて多様なタスクをカバー。Jagleで学習した2.2Bモデルは、日本語タスクで高い性能を示し、既存のモデルを上回る結果を得た。さらに、JagleをFineVisionと統合することで英語でも性能向上が確認され、データセットとモデルを公開し再現性を促進。 Comment
pj page: https://speed1313.github.io/Jagle/
dataset: https://huggingface.co/datasets/llm-jp/Jagle
元ポスト:
データセットのサイズが9Mと非常に大規模で、日本語性能を大幅に改善するだけでなく、FineVisionのような英語のVQAデータセットとハイブリッドで用いることで英語タスクの性能も改善する。
[Paper Note] Demystifying Manifold Constraints in LLM Pre-training, Kang An+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Normalization #Stability Issue Date: 2026-05-12 GPT Summary- LLMの事前学習における安定化技術の役割を明確化するため、MACROという新しい最適化フレームワークを導入。多様体制約が前方アクティベーションのスケールを制限し、安定した回転平衡を実現。理論的保証を保持しながら、高い性能を達成。 Comment
元ポスト:
Geometric Manifold上に重みを制約する系の関連研究:
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
- [Paper Note] nGPT: Normalized Transformer with Representation Learning on the Hypersphere, Ilya Loshchilov+, ICLR'25, 2024.10
[Paper Note] Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning, Yaorui Shi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #AgentSkills Issue Date: 2026-05-11 GPT Summary- 持続的なスキルライブラリは、言語モデルエージェントがタスクを通じて成功した戦略を再利用するために必要で、スキルの選択、活用、蒸留の3つの能力が相互に連携して進化することが重要である。従来の手法はこれらを独立に最適化することが多く、結果として矛盾した進化を生じていた。私たちは、これら3つの能力を共進化させるフレームワーク「Skill1」を提案し、単一のポリシーを使用してスキルの検索、選択、タスク解決、スキル蒸留を行う。すべての学習は単一のタスク成果信号に基づき、ALFWorldとWebShopでの実験により、Skill1が従来の手法を上回ることを示した。アブレーション実験は、クレジット信号の削除が進化に悪影響を及ぼすことを確認した。 Comment
元ポスト:
[Paper Note] TIDE: Every Layer Knows the Token Beneath the Context, Ajay Jaiswal+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Transformer #Architecture #Selected Papers/Blogs Issue Date: 2026-05-10 GPT Summary- トークンインデックスの単一注入仮定を再検討し、Rare Token ProblemとContextual Collapse Problemに対処するためにTIDEを提案。TIDEはEmbeddingMemoryで標準トランスフォーマーを拡張し、依存性のない意味ベクトルを用いて各層へ注入。理論的・実証的にTIDEの効果を示し、言語モデリングや下流タスクでの性能向上を実証。 Comment
元ポスト:
関連:
- [Paper Note] Value Residual Learning, Zhanchao Zhou+, ACL'25
[Paper Note] Recursive Agent Optimization, Apurva Gandhi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Test-Time Scaling #PostTraining #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Initial Impression Notes #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment
元ポスト:
著者ポスト:
pj page: https://apga.github.io/RAO/
再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。
という感じだろうか。
サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。
著者ポスト2:
[Paper Note] Modular Memory is the Key to Continual Learning Agents, Vaggelis Dorovatas+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Architecture #Selected Papers/Blogs #ContinualLearning #Initial Impression Notes Issue Date: 2026-05-09 GPT Summary- 基盤モデルは機械学習を変革したが、継続的な運用や個人化に課題がある。インウェイト学習(IWL)による破局的忘却を克服するために、文脈内学習(ICL)の迅速な適応能力とIWLの安定した更新能力を組み合わせたモジュール型メモリアーキテクチャのフレームワークを提案。継続的学習のためのロードマップを示す。 Comment
元ポスト:
元ポスト参照のこと。現在のAIには認知コア的なものが必要という提言を超えた、全体アーキテクチャとそれぞれの課題についての議論である。
[Paper Note] ZAYA1-8B Technical Report, Robert Washbourne+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #SmallModel #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs Issue Date: 2026-05-09 GPT Summary- ZAYA1-8Bは700Mの有効パラメータを持つMixture-of-Expertsモデルで、難易度の高い数学・コーディングベンチマークで優れた性能を発揮。ゼロから訓練され、RLカスケードを通じて推論能力を強化。Markovian RSAを導入し、テスト時の計算手法で他の大規模モデルとの差を縮めることに成功。TTC評価では高い精度を記録し、競争力を維持。 Comment
HF: https://huggingface.co/Zyphra/ZAYA1-8B
元ポスト:
Convを用いたKV Cacheの圧縮やより賢いMoE Router, Learned Residual Scalingなどさまざまなアーキテクチャ上の工夫や、Reasoning firstな事前学習が実施されているようで、activationパラメータあたりのHMMTでのスコアが既存モデルと比較して群を抜いて高いようである。
所見:
-
-
[Paper Note] MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems, Vishal Venkataramani+, ICML'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ICML #Selected Papers/Blogs #Verification #Monitorability #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MAS-ProVeは、マルチエージェントシステム(MAS)におけるプロセス検証の体系的研究を提示し、LLMを利用して検証の有効性を評価。エージェントレベルとイテレーションレベルでの評価を行い、5つの検証手法を検討。結果として、プロセスレベルの検証は必ずしも性能向上にはつながらず、高い分散が見られることが判明。LLMを判定者として用いるアプローチが効果的である一方、コンテキスト長と性能のトレードオフも観察。MAS向けの堅牢な検証法にはさらなる進展が必要であることが示された。 Comment
元ポスト:
MASにおいてprocess levelのverificationを導入しても一貫して性能が向上するわけではなく、(途中推論の妥当性を判断するタスクは困難なものであることから既存の様々なverification手法には限界があり)分散が高いことが明らかになったとのこと。MASのような複雑なシステムはverificationによるプロセスレベルの精査が必要だと思われるので、現在の限界が示された点で重要な研究に見える。
[Paper Note] MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks, Zixuan Ke+, ICML'26, 2026.01
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #AIAgents #Evaluation #ICML #Selected Papers/Blogs #Initial Impression Notes #Orchestration #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment
元ポスト:
SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。
[Paper Note] HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?, Tu Trinh+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Human-in-the-Loop Issue Date: 2026-05-08 GPT Summary- 最先端のコーディングエージェントは、完全な文脈では複雑なタスクをこなせるが、不完全な仕様では失敗する。ボトルネックは能力よりも判断力であり、適切な行動と助けを求めるタイミングを知ることが重要である。提案するHiL-Benchは、この選択的エスカレーション能力を評価し、ブロッカーを含むタスクを通じて人間の判断力を測定する。核心指標Ask-F1は、質問の正確さとブロッカーの再現率を評価し、不適切な質問を防ぐ。評価結果は、モデルが不確実性に適切に対処できず、自己修正能力に欠けることを示す。強化学習による訓練で、判断力の向上が確認され、モデルは不確実性を検知し対処する能力を学ぶ。 Comment
元ポスト:
完全情報の下では80%前後の成功率をおさめるにも関わらず、情報が欠落している場合は成功率が著しく低下することから、現在のAI Agentが失敗する要因は、能力ではなく情報が不完全な場合にエスカレーションする判断力にあることを指摘し、必要な情報が欠落したタスクを用意し、その情報を取得するための質問(エスカレーション)を適切なタイミングで生成できるか否かを測定するベンチマークを作成し、ベンチマークでの評価を通じて、エスカレーションのための判断能力はRLVRによって向上させられることを示した、という感じの話に見える。
[Paper Note] Scaling Test-Time Compute for Agentic Coding, Joongwon Kim+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #Selected Papers/Blogs #Compression #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- 長期的なホライゾンを持つコーディングエージェントに対する推論時スケーリングの新しいフレームワークを提案。各試行の重要な要素を保持しつつ、詳細を要約することで、経験を効果的に再利用。提案手法は並列スケーリングと逐次スケーリングを実現し、エージェントの性能を一貫して向上させる。SWE-Bench VerifiedおよびTerminal-Bench v2.0での実験で、明確な改善が確認された。 Comment
元ポスト:
Software Engineering Agentにおけるtest-time scaling手法の提案で、生の実行ログをそのままスケールさせるとノイズが多すぎて効率が悪いので、trajectoryを圧縮することで対処するという話のようである。
著者ポスト:
[Paper Note] Model Spec Midtraining: Improving How Alignment Training Generalizes, Chloe Li+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #SyntheticData #Safety #mid-training #Selected Papers/Blogs #Generalization Issue Date: 2026-05-08 GPT Summary- モデル仕様に基づく整合性を高めるために、モデル規範中間訓練(MSM)を導入。事前学習後、整合ファインチューニングの前に自己のModel Specを論じる文書で訓練し、一般化を促進。特定の嗜好に基づくファインチューニングでも、米国寄りの価値観や手頃さを反映した一般化が可能。MSMはエージェントの不整合を減少させ、どのModel Specが強い一般化を生むかを調査し、意図した価値の説明が一般化を改善することを示す。全体として、MSMは整合性訓練の一般化を効果的に制御する手法である。 Comment
元ポスト:
[Paper Note] The Last Human-Written Paper: Agent-Native Research Artifacts, Jiachen Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-05-08 GPT Summary- 科学論文の線形化に伴うストーリーテリング税とエンジニアリング税がAIエージェントの理解と再現に致命的な影響を与えることが課題である。本研究では、機械実行可能な「Agent-Native Research Artifact(ARA)」を提案し、科学的ロジック、実行可能コード、探索グラフ、証拠基盤の四層構造を持つ。ARAはライブ・リサーチ・マネージャー、ARAコンパイラ、ARAネイティブ・レビュシステムを通じて、研究過程を最適化し、精度を大幅に向上させることを示した。具体的には、PaperBenchとRE-Benchで質問応答の正確性を72.4%から93.7%へ、再現性成功率を57.4%から64.4%に向上させる結果を得た。 Comment
pj page: https://www.orchestra-research.com/ara
元ポスト:
研究プロセスでは様々な試行錯誤が実施されるが、試行錯誤による結果は論文中に記載されず、実際に記述されるのは成功したストーリーのみある。また論文中の情報が信用に足るに十分な情報を含まない、あるいは再現をするのに十分な情報を含まない場合がある(ハイパーパラメータの設定はslackのスレッドや、著者の脳内にあるなど)。そういった問題を解決するために、様々な研究過程を追跡し記録しArtifactを生成するLive Research Managerを提案し、論文をPDF Paperの形式ではなく、ARAと呼ばれるパッケージにして研究成果を公表しようよ、という話に見える。
[Paper Note] Beyond N-gram: Data-Aware X-GRAM Extraction for Efficient Embedding Parameter Scaling, Yilong Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #Transformer #Architecture #memory #Reference Collection Issue Date: 2026-05-06 GPT Summary- X-GRAMは、動的トークン注入フレームワークで、トークンインデックス付きルックアップテーブルの効率を向上させる。ハイブリッドハッシュとエイリアスミキシングを利用して、情報の圧縮と局所的特徴の抽出を図り、メモリを効果的に管理する。評価結果では、従来の手法に対して平均精度を最大4.4ポイント改善し、スケーラブルなアーキテクチャの実現を示した。 Comment
元ポスト:
[Paper Note] CL-bench Life: Can Language Models Learn from Real-Life Context?, Shihan Dou+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Reference Collection Issue Date: 2026-05-06 GPT Summary- 実生活のコンテキストを扱うAIアシスタントの学習能力が注目されているが、混沌とした現実の状況を理解することは依然困難である。これを評価するために、405のコンテキストとタスク、および5,348の検証ルーブリックから成るCL-bench Lifeが提案された。このベンチマークは、複雑な実生活のシナリオを網羅し、10種の最先端言語モデルを評価した結果、最高でもタスク解決率は19.3%にとどまり、モデル間の平均は13.8%となった。CL-bench Lifeは、実生活のコンテキスト学習を進展させるための重要なステップとなり得る。 Comment
元ポスト:
[Paper Note] DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training, Tianhao Hu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Asynchronous Issue Date: 2026-05-01 GPT Summary- DORA(Dynamic ORchestration for Asynchronous Rollout)は、強化学習における非同期トレーニングの制約を克服するための新しいパラダイムを提案。これにより、複数のポリシー版本を同時に維持しながら、高効率で収束性を保つ。DORAは従来のシステムより2〜3倍のスループットを達成し、大規模アプリケーションでは同期トレーニングに比べ2〜4倍の加速を実現。LongCat-Flash-Thinkingモデルは、複雑な推論ベンチマークで競争力のある性能を示した。 Comment
元ポスト:
解説:
[Paper Note] KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI, So Kuroki+, ICASSP'26, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SpeechProcessing #Selected Papers/Blogs #One-Line Notes #Realtime #ICASSP #Author Thread-Post #SpeechToSpeech Issue Date: 2026-05-01 GPT Summary- 音声-音声モデルは低遅延で自然な応答を生成するものの、知識や意味理解に欠ける。一方、ASRとLLMを組み合わせたカスケード型システムは知識表現に優れるが、遅延が大きくなる。そこで本研究は、即時応答を実現する新たなハイブリッドアーキテクチャを提案。ユーザーの音声をS2Sトランスフォーマーで処理しつつ、クエリをLLMに並行伝送。これにより、遅延を増加させずに豊富な知識を応答に組み込むことが可能となる。MT-Benchベンチマークを用いた評価により、提案システムはS2Sモデルを大幅に上回りつつ、遅延は同等であることが示された。 Comment
元ポスト:
HF: https://huggingface.co/SakanaAI/kame
SpeechToSpeechのエンコーダ・デコーダモデルの裏で同時並行してLLMを走らせ、随時生成されるOracle Streamを考慮してデコードすることで、latencyと知識・推論性能を両立する。
著者ポスト:
[Paper Note] Introspection Adapters: Training LLMs to Report Their Learned Behaviors, Keshav Shenoy+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-04-30 GPT Summary- ファインチューニングされたLLMの挙動を識別しやすくするために、共有ベースのLLMから派生したモデルの挙動を自然言語で説明する手法を提案。内省アダプター(IA)が、異なるファインチューニングされたモデルに対しても挙動の自己記述を可能にし、AuditBenchでの高性能や暗号化ファインチューニングAPI攻撃の検出に寄与。IAはモデルのサイズや訓練データの多様性に応じてスケールし、LLMの監査において効果的かつ実践的なアプローチであることを示唆。 Comment
元ポスト:
[Paper Note] Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers, Jan Dubiński+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Safety #Selected Papers/Blogs #EmergentMisalignment #InoculationPrompting #Author Thread-Post #ConditionalMisalignment Issue Date: 2026-04-30 GPT Summary- 言語モデルのファインチューニングが出現的ミスアラインメント(EM)を引き起こす可能性を検討し、EMを減少させる介入を評価。従来の評価は効果を発揮するが、訓練文脈を模したプロンプトでは条件付きミスアラインメントが生じる。このミスアラインメントは、無害データとの混合やファインチューニングにより促進される。特に、予防接種プロンプトは効果的であるものの、完全には解消できないことが示された。我々の結果は、無害データと誤った挙動を含むデータが混在することで、モデルが条件付きミスアラインメントを示す可能性があることを示唆している。 Comment
元ポスト:
[Paper Note] The Power of Power Law: Asymmetry Enables Compositional Reasoning, Zixuan Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Composition #One-Line Notes Issue Date: 2026-04-29 GPT Summary- 自然言語データはべき乗分布に従うが、再重み付けや均一分布によるモデル学習が効果的であるという直感に反し、べき乗分布での訓練が均一分布を一貫して上回ることを発見。最小限のスキル組成タスクを用いて、べき乗分布による学習が少ないデータで効果的であることを実証。理論的分析により、べき乗分布が非対称性をもたらし、モデルが高頻度スキルを効果的に学習し、長尾スキルに至る道筋を提供することを明示。結果はモデル訓練におけるデータ分布の新たな理解を促進。 Comment
元ポスト:
学習データ中に内包されるスキルの非対称性により学習が促進される。
Geminiの解説では
> 高頻度のスキルと低頻度のスキルが混在する非対称なデータ分布(べき乗則)の下では、モデルがまず高頻度なスキルを容易に獲得し、それが『足がかり(stepping stone)』となることで、データを均等な分布にならして学習するよりも、かえって効率的に稀なスキル(ロングテール)を学習できる
ということである(要確認)
[Paper Note] SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning, Alexis Limozin+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Selected Papers/Blogs Issue Date: 2026-04-29 GPT Summary- LLM推論における混合ポリシー最適化手法は、SFT-then-RLパイプラインより改善を示すが、いくつかの研究がバグに基づく不適切なベースラインに依存している。DeepSpeedのCPUオフロードやOpenRLHFの損失集約のバグがSFTの性能を抑制し、修正されるとSFT-then-RLは混合ポリシー手法を上回る可能性が高い。特に、Qwen2.5-Math-7Bで+3.8ポイント、Llama-3.1-8Bで+22.2ポイントの向上が見込まれる。50回のRLステップによる切り詰め版でも混合ポリシーに勝利。 Comment
元ポスト:
oh...
[Paper Note] Kwai Summary Attention Technical Report, Chenglong Chu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #Attention #Selected Papers/Blogs #Reference Collection Issue Date: 2026-04-29 GPT Summary- 長文脈能力は次世代の大規模言語モデルで重要な研究テーマだが、標準のソフトマックスアテンションはシーケンス長に対して二次計算量を示し、長文脈設定でオーバーヘッドが生じる。既存の技術はKVキャッシュの削減やKVキャッシュに優しいアーキテクチャを利用するが、トレードオフが現れる。この研究では、KVキャッシュとシーケンス長の間に線形関係を保ちながらセマンティックレベルの圧縮を行う方法を提案し、新しいKwai Summary Attention (KSA) を導入することで、シーケンスモデリングのコストを低減する。 Comment
元ポスト:
これはおもしろい
所見:
[Paper Note] SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture, Haiwen Diao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #MultiModal #TextToImageGeneration #UMM #ImageSynthesis #Pixel-based #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- NEO-unifyを基盤としたSenseNova-U1は、理解と生成を統合した新しいマルチモーダル・パラダイムを提示。SenseNova-U1-8B-MoTとSenseNova-U1-A3B-MoTの2つのバリアントは、テキスト理解や視覚—言語生成で高い性能を発揮し、強力なセマンティック一貫性を提供。詳細な設計と推論戦略を通じて、視覚—言語—行動シナリオでも優れた結果を示し、マルチモーダルAIの進化を提唱。 Comment
元ポスト:
後ほどプレプリントが出るようである
公式ポスト:
code:
https://github.com/OpenSenseNova/SenseNova-U1
学習データのサンプル:
https://huggingface.co/datasets/sensenova/SenseNova-U1-Training-Sample
[Paper Note] WorldMark: A Unified Benchmark Suite for Interactive Video World Models, Xiaojie Xu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Evaluation #Selected Papers/Blogs #WorldModels #interactive Issue Date: 2026-04-26 GPT Summary- WorldMarkは、インタラクティブなImage-to-Videoワールドモデルのための初の共通ベンチマークを提供。これにより、6つの主要モデルを同一条件下で比較可能にするためのアクションマッピング、500件の評価ケースを含むテストスイート、およびモジュール式の評価ツールキットを提供。すべてのデータとコードは公開され、オンラインプラットフォームでのリアルタイム対戦も可能。 Comment
pj page: https://alaya-studio.github.io/WorldMark/
元ポスト:
interactiveなWorldModelsを統一的に評価できる評価スイートなようなので、こういった研究はこれまでにないような気がしており、重要研究に感じる。
[Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #ICLR #Test-Time Scaling #Orchestration #Author Thread-Post Issue Date: 2026-04-26 GPT Summary- Conductorモデルを導入し、LLM間の協調戦略を自動発見。通信トポロジを設計し、個々のLLMの能力を最大化する指示を生成。7BパラメータのConductorは、単一ワーカーを超える性能向上を実現し、難解なベンチマークで最先端結果を達成。ランダム化されたエージェント訓練により、任意のエージェント集合に適応し、新たな再帰的トポロジを形成してオンラインでの性能向上を図る。この研究は、強力な協調戦略がRLを通じて自然に現れることを示す初期の実証である。 Comment
openreview: https://openreview.net/forum?id=U23A2BUKYt
公式ポスト:
[Paper Note] Super Apriel: One Checkpoint, Many Speeds, SLAM Labs+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 15Bパラメータのスーパーネット「Super Apriel」を公開。各デコーダ層は選択可能な4つの訓練済みミキサー(FA、SWA、KDA、GDN)を提供し、リクエスト間でスピードプリセットを切り替え可能。全FAプリセットはApriel 1.6の性能に一致し、ハイブリッドプリセットはデコードスループットを最大10.7倍改善。構成空間は広く、代理モデルが最適なトレードオフを特定。0.5Bでは迅速に安定、15Bでは不安定性が高い。Super Aprielは、Apriel 1.6教師モデルからの確率蒸留とファインチューニングにより訓練され、関連コードやツールも公開される。 Comment
元ポスト:
[Paper Note] LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model, Inclusion AI+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #MultiModal #DiffusionModel #TextToImageGeneration #Reasoning #MoE(Mixture-of-Experts) #Selected Papers/Blogs #VisionLanguageModel #Editing #UMM #ImageSynthesis #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- LLaDA2.0-Uniは、マルチモーダルな理解と生成を統合するための統一型離散拡散大規模言語モデルです。意味論的な離散トークナイザとMoEベースのバックボーン、拡散デコーダを組み合わせ、視覚入力を効率的に処理します。高忠実度の画像生成を実現し、推論効率を最適化する独自の手法を採用。特化型VLMに匹敵する性能を持ち、生成と推論の相互運用性で次世代モデルの可能性を広げます。コードは公開されています。 Comment
元ポスト:
VLM * Diffusionモデル。テキストの生成だけでなく、TextToImage, Image Editingもサポートされているように見える。
公式ポスト:
画像を生成する前にreasoningを実施するように訓練され、UMMなのでtext, patchのrepresentationがシームレスに統合され、画像を伴うテキスト生成がより一貫性を持つ、とのこと。
著者ポスト:
[Paper Note] AI scientists produce results without reasoning scientifically, Martiño Ríos-García+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #ScientificDiscovery #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-25 GPT Summary- LLMベースの科学的エージェントの評価を行い、推論の認識論的規範に従っているかを分析。25,000件以上の実行から、基本モデルが性能の主要因であることを確認し、スキャフォールドの寄与はわずか1.5%に過ぎない。証拠の68%が無視され、信念修正は26%の頻度で発生。全体を通じて、エージェントはワークフローや仮説探究で一貫した推論パターンを示すが、科学的推論における認識論的パターンは欠如。これらの欠陥は成果だけでは検出できず、スキャフォールド設計では修復できないため、推論そのものが訓練目標として必要。 Comment
元ポスト:
大規模な実験によって現在のScientific DisaoveryにおけるAI Agentの課題を明確にしており、重要研究に見える。
[Paper Note] VLA Foundry: A Unified Framework for Training Vision-Language-Action Models, Jean Mercat+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-04-25 GPT Summary- VLA Foundryは、LLM、VLM、VLAの訓練を統合するオープンソースのフレームワークで、エンドツーエンドの制御を持つ共有訓練スタックを提供。スクラッチからの訓練と事前学習済みバックボーンの両方をサポートし、2種類のモデルを公開。1つは完全にスクラッチから訓練し、もう1つはQwen3-VLバックボーンを用いたもの。評価結果は、両モデルとも優れた性能を示し、フレームワークの利便性やシミュレータの改善にも寄与。コードとモデルウェイトは公開され、プロジェクト公式サイトで動画も提供。 Comment
元ポスト:
[Paper Note] MARCO: Navigating the Unseen Space of Semantic Correspondence, Claudia Cuttano+, CVPR'26, 2026.04
Paper/Blog Link My Issue
#CVPR Issue Date: 2026-04-25 GPT Summary- DINOv2と拡散バックボーンを組み合わせた新しいデュアルエンコーダーアーキテクチャMARCOを提案。粗さから細かさへ進む精度向上と疎な監視を強化する自己蒸留フレームワークにより、限られたキーポイントから意味的に整合した対応を実現。SPair-71k、AP-10K、PF-PASCALで新たな最先端性能を達成し、未見のキーポイントへの一般化も向上。効率も高く、拡散ベースの手法より3倍小さく、10倍速い。 Comment
pj page: https://visinf.github.io/MARCO/
元ポスト:
[Paper Note] PLaMo 2.1-VL Technical Report, Tommi Kerola+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #SmallModel #Japanese #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 自動運転向けの軽量なVision Language Model(VLM)PLaMo 2.1-VLを紹介。8Bと2Bのバリアントがあり、日本語対応のエッジ展開が可能。視覚質問応答に特化し、工場タスク分析とインフラの異常検知で評価。日本語のトレーニングリソースを整備し、JA-VG-VQA-500で61.5のROUGE-L、Japanese Ref-L4で85.2%の精度を達成。工場で53.9%のゼロショット精度、ファインチューニングにより異常検知のF1スコアが39.7から64.9に改善。 Comment
関連:
- GENIAC第3期で自律稼働デバイス向けの軽量な大規模視覚言語モデルPLaMo 2.1-8B-VLを開発, PFN, 2025.12
元ポスト:
[Paper Note] TEMPO: Scaling Test-time Training for Large Reasoning Models, Qingyang Zhang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Diversity #Critic #Test Time Training (TTT) Issue Date: 2026-04-25 GPT Summary- テスト時訓練(TTT)では、ラベルなしのテストインスタンスでモデルパラメータを適応させるが、既存の手法はLRMsで性能が頭打ちになる。提案するTEMPOは、周期的にポリシーの洗練とクリティックの再較正を行い、期待値最大化(EM)アルゴリズムとして位置づけられる。この再較正を通じて持続的な改善を実現し、AIME 2024でOLMO3-7Bを33.0%から51.1%、Qwen3-14Bを42.3%から65.8%へと向上させ、高い多様性を維持する。 Comment
元ポスト:
