Initial Impression Notes (491) — 1/3
[Paper Note] DepthBench: Measuring How Residual Connections Enable More Computational Depth, Keyu Wang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Transformer #Architecture #ResidualStream Issue Date: 2026-10-02 GPT Summary- モデルサイズと事前学習条件を固定し、幅と深さの比率を変化させるDepthBenchで、Transformerの計算深度を評価。 10種類のアーキテクチャを比較した結果、標準的なPre-LNや正規化・スケーリング系手法は深く狭い構造で性能向上が乏しく、低下する場合もある一方、HCとFull AttnResは極端に深い構造でも一貫して性能を向上。 層レベルの分析から、追加層を有効活用できる残差接続の設計が、アーキテクチャ上の深さを実効的な計算深度へ変換する主要因であることを示した。 Comment
元ポスト:
(以下元ポストを参考に自分の言葉でメモ)
残差ストリームに対する様々なアーキテクチャを、統一した条件で(1.6B程度のモデルサイズまで)比較した結果、モデルを深くした場合に性能が改善する傾向にあるのはHC, AttnResのみであった。
その理由として、HCでは複数の残差ストリームを並列に保持すること、AttnResでは層ごとの中間表現を保持し後の層が必要に応じて取り出す、といったメカニズムによって、PreLNなどで典型的に見られる深い層になると残差ストリームが類似する(結果的に層を増やしても新たな情報が蓄積されない)性質が緩和され、深さ方向に追加した層をより有効に活用していることが示唆される、という感じの話に見える。
関連:
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] DeepNet: Scaling Transformers to 1,000 Layers, Hongyu Wang+, arXiv'22, 2022.03
- [Paper Note] Post-LayerNorm Is Back: Stable, ExpressivE, and Deep, Chen Chen+, arXiv'26, 2026.01
- [Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02
- [Paper Note] Mixture-of-Depths Attention, Lianghui Zhu+, arXiv'26, 2026.03
- [Paper Note] On Layer Normalization in the Transformer Architecture, Ruibin Xiong+, arXiv'20, 2020.02
[Paper Note] Decoding Looped Transformers Better for (Almost) Free, Weihao Liu+, arXiv'26, 2026.10
Paper/Blog Link My Issue
#NLP #Transformer #Decoding #Selected Papers/Blogs #reading #RecurrentModels Issue Date: 2026-10-02 GPT Summary- ループ型Transformerの中間再帰状態を用いて、最終予測と早期予測を対比する学習不要のデコード手法LoopCDを提案。 追加の出力パスを用いるLogits版と、隠れ状態空間で動作するHidden版により、弱い予測をガイダンス信号として活用する。 4種類のモデルで性能を一貫して向上させ、再帰回数を半分にしても性能を維持しつつ、推論FLOPsを22.5〜48.2%削減。 Comment
元ポスト:
Contrastive Decodingで示されている、アマチュアの出力とエキスパートの出力の差を見ることで言語モデルにおける典型的なfailure modeを抑制し、エキスパート特有の出力を強調する、といったデコーディングの考え方をLooped Transformerのループが浅い時点の表現をアマチュア、深い時点の表現エキスパートとみなすことで、Looped Transformer上で自然に実現する、という話に見え、これによりfull depthで比較した場合により高いベンチマークスコアを得ることができ、ループの深さを半分にしても同等以上の性能が得られ、結果的に計算量を削減しながらull depthと同等程度の性能を得ることができる、という話に見える。
[Paper Note] Harness Learning Enables Generalizable Test-Time Adaptation, Alvin Zhang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #meta-learning #Generalization #Test-time Learning/Adaptation #Author Thread-Post #AgentHarness Issue Date: 2026-10-02 GPT Summary- 言語モデルエージェントのharnessを、実行フィードバックに基づいて改訂するharness learningを提案。 実行可能プログラム上のメタ学習として改訂モデルを強化学習で訓練し、テスト時にはパラメータ更新なしで新規タスクの実行結果からharnessを逐次改善する。 推論およびマルチホップQAで、改訂性能の向上と未知タスクへの適応・転移を確認。 Comment
元ポスト:
実行時のフィードバックに基づいてAgent Harnessをreviseすることを学習したモデル(Proposer)によって、テスト時にモデルの重み更新なしで、未知のタスクに対する汎化性能を獲得する
[Paper Note] How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining, Lin Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #MultiModal #Scaling Laws #read-later #Selected Papers/Blogs #VisionLanguageModel #Backbone #UMM Issue Date: 2026-09-29 GPT Summary- エンコーダフリーMLLMとエンコーダベースMLLMのスケーリング則を比較。視覚エンコーダを除くと、マルチモーダル目的の計算量最適な配分は大規模モデル側へ移行するが、テキスト目的ではほぼ変化しない。小規模ではエンコーダフリーが劣るものの、約\(10^{22}\) FLOPsで追いつくと予測される。規模拡大に伴い、言語モデルが視覚処理を前段層や専門家ルーティングへ適応させ、事前学習済み視覚エンコーダの優位性が薄れることを示した。 Comment
元ポスト:
ざっくりいうと、モデルサイズを大きくでき、かつ事前学習の計算量を(今回のスケールに限っていうと)約6.1 x 10^21 FLOPs以上投入できるのであれば、Vision Encoderをコネクタで接続するタイプのVLMよりも、Encoder-freeのVLMの方がより良い損失値を得られる傾向にある、という感じだろうか。
[Paper Note] Sparse Layers are Critical to Scaling Looped Language Models, Ryan Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #MoE(Mixture-of-Experts) #Scaling Laws #read-later #RecurrentModels Issue Date: 2026-09-28 GPT Summary- loop型モデルとMoEを組み合わせることで、メモリコストを抑えつつ表現力とスケーリング性能を向上。loop型MoEでは、各ループで異なるexpertを活性化することで、追加パラメータなしに密なloop型モデルの限界を克服。さらに、loop境界をearly exit pointとして利用することで、品質低下を抑えながら計算量と推論コストを削減。early exit付きloop型MoEは、標準Transformerを上回る性能と効率を実現。 Comment
元ポスト:
Looped Transformerは提案された初期は性能がスケールしないことが課題だったという話があり
- [Paper Note] Scaling Laws for Neural Language Models, Jared Kaplan+, arXiv'20, 2020.01
X界隈でLooped Transformerが騒がれた頃に、いつの間にかその弱点が克服されたのか?と思っていたのだが、本研究の知見に基づくと、少なくともMoEによって、isoFLOPsな設定でBaseモデルを上回る程度の性能は獲得できるようである。
元ポストに基づくと、本研究の実験設定においてMoE>Looped-MoE>Base>Loopedが示され、Looped-MoEの場合はloopごとに異なるexpertが選択されやすい傾向にあり、これがLoored Transformerの弱点解消に寄与しているとのことであった。その上でLooped-MoEを採用する利点は、保存するパラメータを抑えながらBaseよりも高い性能を出せる点としている。
メモリに載せる必要があるパラメータの量が削減されるのは、decodeが基本的にはメモリ律速であり、モデルをスケールする上でボトルネックになりがちであることから、ありがたい性質であるように思える。仮にフロンティアモデルでLooped Transformerが採用されているとしたら、アーキテクチャそのものの性能が高いから、というよりは、使用するストレージやメモリ量を抑えることができ、それらがdecodeの効率向上に繋がり事後学習(主にon-policy RL)の効率があがり、結果的にモデルの性能が向上するから、ということになるのかなあ、という気がする。知らんけど。
[Paper Note] HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing, Jianyu Wei+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Architecture #KV Cache #Author Thread-Post #Decoder-Decoder Issue Date: 2026-09-24 GPT Summary- 長期・複数ターンのエージェントに対し、HySparse2は2段階のKV共有を備えたハイブリッド・スパース注意を導入。 外側ではKV Bridgingにより、自己デコーダの隠れ状態からクロスデコーダのKVキャッシュを構築する。 内側では、KV Reuseを維持しつつ、ブロック単位のスパース性をトークン単位に変更し、直近トークンを含むスライディングウィンドウを強制することで長文検索を高精度化。 自己デコーダ処理後にクロスデコーダ層をスキップでき、プリフィル計算量とKVキャッシュ容量を削減。 80B-A3B MoEモデルにおいて、長文コンテキスト検索と複数ターンのエージェントタスクでHySparseおよびHybrid SWAを上回る性能を達成。 Comment
元ポスト:
Mimo-V3ではYOCOスタイルのデコーダ-デコーダモデルで、KVを共有するアーキテクチャになるようである。
[Paper Note] Dream-RSI: Recursive Self-Improvement through Evolving Worlds, Tong Zheng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI Issue Date: 2026-09-16 GPT Summary- 再帰的自己改善を実現するために、\textsc{Dream-RSI}というスケーラブルな探索フレームワークを提案。これにより、探索を明示化し、基盤エージェントを変更せずに効果的な探索戦略を管理可能に。累積された発見履歴を用いたリプレイシミュレータにより、オフポリシーで迅速なフィードバックを確保し、高コストのオンライン評価を回避。改善されたポリシーを再デプロイし、自己改善ループを拡充。競争力のある発見品質を維持しつつ、設定によっては発見コストを大幅に削減。 Comment
元ポスト:
ざーっと見たが、dreamingが何を指すのかよくわからない。どういう操作のことを指しているのか。
図中の太字部分がReplay Simulator、およびdreamingの話をしている気がするが、まだよくわからない。つまり、蓄積されたtrajectoryを再生成せずにprefillに使って、探索木で分岐が生じた場合は現在のポリシーに基づいて判断をし、再利用できる探索がなくなるまでこのような操作を繰り返すことで効率化するということだろうか。
[Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks, Ali Ansari+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Physics #Author Thread-Post Issue Date: 2026-09-16 GPT Summary- 最先端の言語モデルは物理学の高度な問題解決に苦戦しているとされるが、本研究では6つの物理ベンチマークを専門家と共に評価し、その報告結果を再検討する。専門家が問題文やモデルの応答を精査した結果、不正解とされた多くのケースはモデルの誤りではなく、問題自体の ambiguities に起因していた。修正後、GPT-5.6-Solのスコアは大幅に向上し、一部のベンチマークで94.4%に達するなど、現行の評価がモデルの能力を過小評価していることが示唆された。これにより、専門家による厳格な評価の必要性が強調された。 Comment
元ポスト:
blog: https://jsous.github.io/blogs/is-physics-dead/
メジャーな物理学のベンチマークスコアを物理学者たちが見たときに、それらは彼らの経験と一致していないため、主要な物理学関連のベンチマークをvalidationし、問題のある部分をrepairしたら、多くのベンチマークが飽和した、という話のようである。
[Paper Note] Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation, Jintao Zhang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#ComputerVision #Proprietary #VideoGeneration/Understandings #Editing #Author Thread-Post Issue Date: 2026-09-15 GPT Summary- Vidu S2は、対話可能なデジタルキャラクターモデルVidu S2-Avatarと映像編集モデルVidu S2-Editingを統合したシステムです。これにより、リアルタイムで720pの映像生成やダンス指示の追従が可能になります。さらに、映像のスタイルレンダリングや衣装、キャラクター、背景の置換をリアルタイムで行う機能も搭載されており、従来のモデルを上回る性能を示しました。オンラインデモも提供されています。 Comment
元ポスト:
リアルタイムにインタラクションをし、アバターやシーンの編集が可能な動画生成モデルで、リアルタイムにVRゴーグルを通じたVR体験などにも応用できるようである。
[Paper Note] ExecCritic: Learn to Test, Test to Improve for Coding Agents, Leitian Tao+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #UnitTest #Author Thread-Post #AgentHarness Issue Date: 2026-09-10 GPT Summary- 実行時フィードバックは、コーディングエージェントを正しい修正に導くが、誤ったテストが偽の自信を生む可能性がある。そこで、ExecCriticを提案し、テスト生成と修正を分離するスキャフォールドを用いて、強化学習レシピで訓練されたテストエージェントと修正エージェントを開発。Learn to Testでは正しいテストを学び、Test to Improveではフィードバックに基づく改善を学ぶ。事後訓練により成功率が向上し、両エージェントを組み合わせることで全体の性能が向上した。コードは公開済み。 Comment
元ポスト:
テスト生成と、コードの修正をするエージェント(テストの修正はできない)を分離し、RLを通じて双方の能力を高める手法を提案しているようで、高品質なテストを作成し、そこから得られるフィードバックに基づいて修正を実施するがコード修正の強力なscaffoldingとなる、という話のようである。
[Paper Note] Praxist: From Experimental Artifacts to Solution Lineages, Jin Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-04 GPT Summary- Praxistは、自律的な研究開発エージェントの限界を克服するために設計された系統情報中心のシステムで、成果物と評価結果を構造化します。このシステムは、局所的な成果物を証拠統合と分離することで、後続の試みで検証された機構を継承し、再現可能な結果を維持します。標準化された75タスクにおいてPraxistは60枚のメダルを獲得し、経済的にも優位性を示しました。四つのケーススタディによってオープンエンドの問題への適用が成功し、各タスクでの精度向上や資源コストの削減が記録されました。この新たな成果物のアプローチは、従来のものに比べて強力かつ効率的です。 Comment
blog: https://praxist.sapient.inc/en
元ポスト:
要はRSIのためのAgent Harnessのようである。
github:
https://github.com/sapientinc/praxist
Table2を見ると、Claude Code + Opus 4.8に対して、PRAXIST + DeepSeekV4-Proで性能が比較されている。
[Paper Note] Code World Model: Coding Agent as World Brain, Yiwen Chen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #AIAgents #Coding #Architecture #WorldModels Issue Date: 2026-09-04 GPT Summary- Code World Modelは、言語モデルとビデオモデルを組み合わせたフレームワークで、世界の進化と視覚的実現を分離してシミュレーションします。コーディングエージェントは、出来事の推論と持続的な世界状態の維持、進化を実行可能なコードで生成します。プロキシ表現を導入してビデオモデルに高忠実度の視覚観察を生成させ、ゲームプレイ動画から整合するデータペアを構築。これにより、オープンエンドな世界モデルに向けた新たな道を示します。 Comment
元ポスト:
World ModelのバックボーンとしてCoding Agentを利用するという話に見える
[Paper Note] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution, Guibin Zhang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #AIAgents #AgentHarness Issue Date: 2026-09-04 GPT Summary- JIT-Agentは、エージェント型LLMに対してその場でタスク適応型のハーネスを合成するために訓練されたモデルであり、手動設計のスケーラビリティの問題を解決します。特定のタスクに合わせたハーネスをカスタマイズし、過去の構成から学んで自己進化します。実験では、JIT-Agent搭載のDeepSeek-V4-Flashが、従来モデルを上回る性能を実現し、成熟したエージェントランタイムと競合することを示しました。これにより、ハーネス知能の新しい次元を確立しました。 Comment
元ポスト:
ポイント解説:
エージェントハーネスそのものを、動的にタスクに応じて合成し活用し、ハーネス生成そのものも改善されていく枠組みを提案、という話に見える。
[Paper Note] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning, Shulin Tian+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #Faithfulness #EMNLP #VisionLanguageModel #Rubric-based #Author Thread-Post #CreditAssignment Issue Date: 2026-09-01 GPT Summary- 視覚と言語モデルは、視覚的証拠に基づかない回答を生成することがあるため、妥当性を維持できない状況をクレジット割り当ての失敗と捉える。本研究では、参照回答を原子命題に分解し、視覚的忠実性、推論の一貫性、指示遵守に基づいた評価を行う視覚的ルーブリックを提案。これにより裏付け証拠のクレジットを局所化し、Qwen3-VL-8B-Instructを用いて生成したトレーニングセットV-Rubrics 50Kを作成。実験結果、ルーブリックベースのGRPOはSFT基準及び他の手法を上回る改善を示し、視覚的ポストトレーニングの報酬としてルーブリックの有効性を証明した。 Comment
元ポスト:
Rubric basedなRLを用いて、trajectoryに対して構造化された部分点を提供するcredit assignment手法を提案し、これによりVLMの
- Visual Faithfulness
- Reasoning Consistency
- Instruction Following
を改善する、という話に見える。
[Paper Note] Skill Issue: Are Skills Language-Invariant in LLMs?, Bobby Cheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #CrossLingual #MultiLingual #Selected Papers/Blogs #reading #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- 大規模言語モデルは言語間で知識へのアクセスに一貫性を欠くが、そのスキルの不一致を定量化するために多言語自己対戦を用いる。本研究では同一モデルの異なるインスタンスが別々の言語でテキストベースのゲームを対戦し、言語の影響を分離して評価。8言語、6ゲームで、モデルが言語によって異なるプレイ力を示し、戦略や勝敗に体系的な変動が見られる。言語特有の失敗が明らかになり、適切な言語選択で性能が回復する可能性が示唆され、スキルの不一致が多言語モデルの発展の障害であることが示された。 Comment
元ポスト:
同じモデルに対して、同じゲーム、ルール、アクションなどの条件を揃えた上で、使用する言語のみを変更して対戦した場合、使用言語によって勝率が変化する。このことから、モデルの中にスキルが内在しているが、利用する言語によって当該スキルをどれだけ引き出せるかが変化することが示唆される、という話に見える。
5.3節に、推論に用いる言語を変化させた場合にどの程度性能が回復できるかが示されており、ゲームによって回復した程度が異なり、推論の言語を変更するだけでは完全に性能を回復することはできていなさそうに見える。
たとえばQwenは英語と中国語の学習データが豊富だと考えられるが、この辺はどの程度影響があるのかな?という点が気になる。5.4節あたりでそのあたりの言及がありそう。
著者ポスト:
[Paper Note] Dynamic Compression in Recurrent Networks, Jyothish Pari+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #RecurrentModels #Compression Issue Date: 2026-08-29 GPT Summary- 動的圧縮を導入することで、リカレントモデルは過去のトークンを選択的に再訪問し、固定サイズの状態を修正できる。これにより、必要な関数のみを再訪問し精練することが可能になり、リカレント状態の必要性が大幅に削減される。結果として、モデルは計算とメモリのトレードオフを最適化し、より効果的に履歴を活用できる。 Comment
元ポスト:
過去トークンに対して選択的にアクセスし動的に状態を更新する
[Paper Note] Draft-OPD: On-Policy Distillation for Speculative Draft Models, Haodi Lei+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Decoding #Selected Papers/Blogs #On-Policy #SpeculativeDecoding Issue Date: 2026-08-27 GPT Summary- スペキュレーティブデコーディングでは、ターゲットモデルと軽量ドラフトモデルを組み合わせ、ドラフトモデルの提案を並行して検証し、推論を高速化する。しかし、監督付きファインチューニング(SFT)は頭打ちになることが観察され、オフラインから推論へのミスマッチが問題を引き起こす。これに対処するため、オンポリシー蒸留(OPD)の必要性が生まれるが、ドラフトモデルの展開には困難が残る。そこで、Draft-OPDを提案し、提案されたブロックの評価からフィードバックを学習し、推測的受諾を制限することに集中する。実験により、Draft-OPDは多様なタスクにおいて大幅な速度向上を達成し、EAGLE-3およびDFlashを上回る結果を示した。 Comment
元ポスト:
draft modelは基本的にtarget modelからサンプリングされたtrajectoryに対するofflineのSFTやdistillation(オフポリシー)によって学習されるが、これをオンポリシーにすることでSpeculative DecodingのAccepted Length(ドラフトモデルが生成したトークンが受理されるトークンの長さ)を上げたいという話のようである。
Figure 1に示されている通り、SFTではAccept Lengthがすぐに頭打ちになってしまうことが課題で、この原因としてSFTの学習データがオフラインであるのに対し、推論時に実際に与えられるトークン分布の分布で学習されているわけではないことを指摘している。つまり、学習時と推論時の分布にgapが存在することを指摘。
素朴にこれを解決するためには、オンポリシーにdraft modelを学習することが考えられるが、
- (Figure 2 (a)) draft modelにロールアウトをさせると、draft modelはブロック単位の生成を前提としているため、全軌跡を生成するとrepetitionや低品質やサンプルが生成され、target modelで監督をしたとしても信頼性が損なわれる
- (Figure 2 (b)) ではブロック単位でtarget modelのsupervisionを入れると、そもそも前ブロックでのdraft modelの失敗がtarget modelによって補正されてしまうため、on-policy学習によって得たかった「draft modelのエラーに基づいた分布で学習する」ことができず、実質的にoff-policyになる
という課題を指摘している。興味深い。
[Paper Note] Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection, Atsuyuki Miyai+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SelfImprovement #AgentHarness Issue Date: 2026-08-27 GPT Summary- ハーネス最適化を効率化するために、適応的検証タスク選択の新手法Task-CoEvolveを提案。ハーネスが評価コストを削減しつつ進化する中で、情報量の多いタスクの選択と部分評価から性能推定を行います。Task-CoEvolveは、エージェントの能力境界付近のタスクに重点を置き、固定サブセットのベースラインを上回りつつ、評価回数を80%削減する効果を実験で示しました。コードは公開予定です。 Comment
元ポスト:
ハーネスを最適化する際に、すべてのタスクで評価をするのではなく、効果が高いものを選択し効率化する、という話に見える。
[Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #LongHorizon #autoresearch/RSI Issue Date: 2026-08-25 GPT Summary- エージェント性を持つシステムはAI研究の自動化を進めているが、研究目的を実験的に検証されたMLシステムに変換することは依然として課題である。これを「長期的なML研究エンジニアリング」として研究し、マルチエージェントシステムAiScientistを紹介。File-as-Busワークスペースを通じて研究チームが協調し、進捗を管理。PaperBenchではGemini-3-FlashおよびGLM-5を用い、それぞれ9.92点と11.15点の改善を達成。MLE-Bench Liteでも両方のバックボーンが81.82 Any Medal%を達成し、強力な基準を上回る改善を示した。アブレーション実験は、プロジェクトの耐久性が後の改良に重要であることを明らかにし、システム的な進捗維持の重要性を示唆している。 Comment
元ポスト:
関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03
Orchestratorは簡潔な情報に基づいて個々のWorkerを制御し、Workerはファイルシステム上に残された詳細な情報にアクセスできるようにするようなアーキテクチャ
[Paper Note] T-Rex: Tactile-Reactive Dexterous Manipulation, Dantong Niu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Architecture #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- 触覚信号に動的に反応する能力は人間レベルの器用さに不可欠だが、現代のVLAモデルは触覚を軽視する傾向がある。本研究では、触覚反応型操作の向上に向け、100時間の触覚データセットを収集し、新しい時系列触覚VQ-VAEエンコーダと可変レートのMixture-of-Transformersアーキテクチャを提案。12の操作タスクで触覚反応ポリシーの有効性を証明し、最強ベースラインの成功率を30%以上向上させた。 Comment
元ポスト:
pj page: https://tactile-reactive-dexterous.github.io/
ロボットの触覚の制御に特化した大規模でオープンなデータとアーキテクチャの提案に見え、卵を掴んで移動させるデモなどが元ポストに掲載されている。
スーパーサイヤ人になった悟空が食器を掴んだけど力が強すぎて割ってしまう、みたいなアニメのシーンをふと思い出したけど(セル編だった気がするけど実際にそのようなシーンがあったかはわからない)、実際調理ロボットが卵を掴んで運ぶ前に握り潰してしまったらだいぶ悲しいので、触覚は非常に重要なモダリティと思われる(小並感)。
[Paper Note] Mathematics in the age of AI, Terence Tao, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #AIAgents #GenerativeAI #Mathematics #read-later #Selected Papers/Blogs Issue Date: 2026-08-22 GPT Summary- AIツールの登場に対する数学コミュニティの対処法を論じるエッセイ。これらのツールの能力を議論するのではなく、数学研究の目標と価値を再検討することに焦点を当て、問題解決の要素をケーススタディとして用いる。 Comment
元ポスト:
(数学に限らず)AI時代との向き合い方を考える上で重要に見える
[Paper Note] Hydra-0: Action Flow for Generalist World Modeling and Control, Hongyu Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#General #Transformer #DiffusionModel #Selected Papers/Blogs #Robotics #WorldModels #reading #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- Hydra-0は、行動フローに基づく一般的な世界モデルで、ロボットの動作をピクセル運動として表現します。このモデルは、タスクや環境を跨いで行動の結果を学習し、動作誤差を大幅に低減します。また、ゼロショット適応やデータ効率向上をサポートし、RoboLabベンチマークで高い相関を示します。さらに、人間のデモから転移した望ましい物体フローを利用して、ロボット運動を予測する新しいインタフェースも提案しています。これにより、異種の訓練データを結ぶポテンシャルが示されます。 Comment
元ポスト:
ロボットのアクションを、ロボット固有の表現ではなく、画像上の点の軌跡(action flow)で表現として学習する(特定のロボットと密結合したシグナルを学習するのをやめる)。これにより、異なる実体をデータから学習可能なgenericなモデルを実現し、転移を容易にする、という話に見える。
[Paper Note] LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure, Fanfei Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs Issue Date: 2026-08-18 GPT Summary- LITTLECURRICULUMを用いて、米国の小学校教材に基づく880億トークンからなる厳選された学習資源を導入。これにより、モデルLITTLELEARNERが明確に定義された知識と能力の範囲内で訓練され、言語能力を備えた解釈可能なカリキュラムに対応。最初の実験では、新しい知識を既存のものに結びつける手法を検証し、制約された環境の研究価値を示した。 Comment
元ポスト:
ポイント解説:
K-5の内容にフィルタリングされたコーパスによって事前学習されたモデルに対して、Beyond-K-5(K-5のレベルを超えた内容)データで事後学習をしても性能は向上しないが、K-5によって被覆される内容の性能はスケールする、という話に見える。
かなり斜め読みなので、もう少ししっかり読みたい。
[Paper Note] Simple-OPD: Demystifying Warm-up for On-policy Distillation, Tao Liu+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PEFT(Adaptor/LoRA) #PostTraining #read-later #Selected Papers/Blogs #On-Policy #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- On-policy distillation (OPD) は、教師モデルからの監督信号を用いて学生を訓練する手法であり、その効果はウォームアップ段階に依存する。データ観点では、思考過程の連鎖(CoT)監督が効果的であり、誤った教師のロールアウトでも利点があることが示された。トレーニング観点では、低秩適応(LoRA)を用いたアプローチがドメイン内適応と分布外一般化のバランスを改善することを示す。これに基づき、Simple-OPDを提案し、教師生成のCoTに対してLoRAで学生をウォームアップさせる手法である。実験はその有効性と頑健性を示している。 Comment
元ポスト:
まだ論文には目を通せていないが、教師モデルと生徒モデルに差がありすぎると、OPDはうまく学習ができないので、LoRAでwarmupするとあうのは理に適っているように感じる。
OPDのFailure Modeのまとめ:
- On-policy distillation isn't a free-lunch, Bhavin Jawade, 2026.07
[Paper Note] Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems, Vassilis Papadopoulos+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #Safety Issue Date: 2026-08-14 GPT Summary- AIエージェントの相互作用から生じるリスクとして、マインドウイルスの拡散がある。このマインドウイルスは、アイデアや目標を伝播させ、宿主に行動変化を引き起こす可能性がある。本研究では、進化アルゴリズムを用いてマインドウイルスの構築と拡散のメカニズムを分析し、宿主モデルやペイロードの有害性が伝播に与える影響を特定した。有害なペイロードは一般的に拡散しにくく、エージェントのプロンプトに警告を追加することで免疫を付与できることを示した。また、進化したマインドウイルスには「ウイルス的ペルソナ」が現れ、リスクの存在は確認されたが現段階では限定的であると結論づけた。これらの知見は今後のマルチエージェントシステム設計に寄与する。 Comment
元ポスト:
マルチエージェントシステムにおいて、ある起点となるエージェントSystem Promptに組み込まれたなんらかの思想がマルチエージェントシステムにおいて他のエージェントに伝播し、他エージェントはそのトピックについて議論し、結果がメモリに格納されていく現象(=Mind Viruses)に関する研究に見える。
[Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #LongHorizon #autoresearch/RSI Issue Date: 2026-08-10 GPT Summary- 持続的な自己進化を実現する実行環境Argusを提案。これはエージェントが安定したユーザー意図を維持しつつ、運用目標に基づいてミッションを遂行する。Argusは固定されたモデル重みを保ちながら、自己進化を運用状態と制御方針を通じて実現。SWE-Bench Proで78%、AARRI-Benchで76.8%を記録し、各アクティブワークフロー時間を短縮しつつ、検証やレビューの精度を向上。これにより、将来的な教師あり学習と強化学習のための構造化した進化を実現することを示した。 Comment
元ポスト:
メモリに永続化する情報を検証プロセスを通じて選別することで、誤った情報が蓄積され増幅されることを緩和する
[Paper Note] Training nGPT, Ilya Loshchilov+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SSM (StateSpaceModel) #Architecture #MoE(Mixture-of-Experts) #Normalization #Hybrid #LinearAttention Issue Date: 2026-08-10 GPT Summary- nGPTは、モデルパラメータと活性化を超球面に制約し、超球面表現学習を実現。実用的なトレーニングレシピを提案し、ハイブリッドMoEモデルで評価。ロジット勾配の前処理や学習率減衰などを導入し、未正規化モデルと比較して、少ないトレーニングトークンで同等のパフォーマンスを達成。検討対象モデルは最大14Bのパラメータにスケール可能。 Comment
元ポスト:
解説:
nGPTを提案した著者らによる研究で、オリジナルのnGPTではdenseなアーキテクチャで、1Bまでのサイズでしか実験がされていなかった。それをより大規模な14BBレベル、かつMoE、Mamba-2とTransformerのハイブリッドモデルで実験し、学習のために必要な提案を実施しているようである。3.3節にどのような変更が必要か、サマリが記述されている。
性能は、通常のGPTと比較して一貫して改善しており興味深い。
ハイパーパラメータが増えているように感じるが、どの程度ハイパーパラメータの設定が効いてくるのだろうか。学習率の調整だけでも厄介なので、モデルの性能は魅力的でロマンがあるが、実務上は採用しづらい気はする。
[Paper Note] Douyin Multimodal Embedding Model Technical Report, Haonan Chen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #Embeddings #NLP #RepresentationLearning #MultiModal #ContrastiveLearning #VisionLanguageModel Issue Date: 2026-08-10 GPT Summary- マルチモーダル表現学習はAIの核心で、複数のモダリティをエンコードし、産業用検索と推奨を最適化する。特に、Douyinなどの大規模プラットフォームでは、効率的かつ細かいマッチングが求められるが、既存のMLLMモデルはこれを満たしていない。私たちはDouyin Multimodal Embedding(DME)を提案し、二段階で訓練を行い、対照的な事前学習と意味的充足性を組み合わせる。DMEは迅速な応答に不可欠で、実際のDouyin検索でパフォーマンスを向上させることに成功した。 Comment
元ポスト:
Qwen3-VL-Embeddingと比較して、Videoドメインの性能向上が顕著なマルチモーダルなEmbeddingのようである。latencyが改善されていることが強みの一つのようだが、latent CoTの有無によるΔの比較はあったが、他モデルとの明示的な比較はされていないように見えたが、どの程度早いのだろうか?
[Paper Note] SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution, Zhiyuan Yao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #CreditAssignment Issue Date: 2026-08-09 GPT Summary- SkillRiseは、異なるタスクに直面する大規模言語モデルエージェントのための統一的な強化学習フレームワーク。関連する実例を難易度ごとに整理し、タスクを解くことと技能ドキュメントの編纂を交互に行うことで、タスク間の技能を学習する。実験において、SkillRiseは最強のベースラインに対して2.3~8.5ポイントの性能向上を達成し、同じタスクの繰り返しでも学習したポリシーは有効。さらに、タスク間での連続的な学習が性能向上に寄与することが示され、特に実行時オーバーヘッドの削減が高い性能を維持することにも成功した。 Comment
元ポスト:
関連タスクを難易度に基づいてカリキュラムを構築し、sequentialに解かせ後続のタスクに対する報酬を、途中のタスクに対して割り引いて割り当てることで、タスクを跨いだ能力の学習を促進する、という感じだろうか。
AgentSkillっぽい話かと最初は思ったが、そうではなさそう。
[Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents Issue Date: 2026-08-09 GPT Summary- LLMを用いたエージェントシステムは、テキスト知識とパラメトリックスキルライブラリの融合により、自律的に複雑な問題を解決する。従来の研究は主にこれらの二つを別々に扱ってきたが、本研究では、モデルウェイトを追加の推論モダリティとして取り入れ、プレフィックス・チューニングによる学習を実装する。この新しいアプローチSkillSmithは、指示主導のパラメトリック合成を通じて、優れた性能を発揮し、従来の単一モダリティベースラインを大きく上回ることを示した。 Comment
元ポスト:
ざっと眺めたがよくわからなかった。必要な時に読む。
[Paper Note] Inverse RL Helps Align AI by Imitating Humans, Michał Wiliński+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 言語モデルのアラインメントは、その挙動が有用性や安全性を反映することを目指すが、現在の手法には重要な未解決の課題が残る。これに対処するために、Project Alignment Reward Estimated from Demonstrations(PARED)を提案。PAREDは専門家デモンストレーションから暗黙の報酬を回復し、タスク固有のアノテーションを不要にする。実験を通じて、PAREDが基礎ポリシーを効果的に改善することを示し、異なる嗜好への調整も可能であることを明らかにした。 Comment
元ポスト:
特徴量に基づいてexpert/policy responseを区別できるモデルを学習し、best-of-N、あるいはon-policy RL (RL中にrefitting)で活用する、という話に見える。これにより、デモンストレーションのみでラベル付け不要、検証可能、on-policyで最適化をしながらalignmentを実施することを目指す、という感じのようである。
気持ちの部分がすっと頭に入ってこない。何かが引っ掛かっているのだろうけどなぜだろうか。そもそもPolicy ResponseがAlignmentが悪く、Expert Responseが良いもの、という暗黙の仮定が置かれている気がしており、それを特徴量空間で識別できるようなモデルを学習するということだと思うのだが、その暗黙の仮定が本当に成り立つのか、という疑問があるからだろうか(Expertの応答よりもPolicyのAlignmentが改善し良い応答が生成された場合はどうなるのだろうか?)。
[Paper Note] Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training, Jiawen Tao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #mid-training #Selected Papers/Blogs #reading Issue Date: 2026-08-09 GPT Summary- 合成教科書データは言語モデルの事前学習を向上させるが、調査の焦点は主に生成内容の特性にあった。本研究では、関連コンテンツが一貫して整理されていることの重要性を示す。このためのスケーラブルなパイプラインを開発し、686,000冊の教科書を組織化した結果、下流タスクの性能が平均で+1.09向上した。特に、文書のパッケージングの効果を確認し、構造化された合成が利益をもたらすことを強調。Llama3-8Bでもフルセットは他の条件を上回り、書籍レベルの整理が合成データ設計の重要な要素であることを支持している。 Comment
元ポスト:
関連:
- [Paper Note] Data-efficient pre-training by scaling synthetic megadocs, Konwoo Kim+, arXiv'26, 2026.03
- [Paper Note] Rewriting Pre-Training Data Boosts LLM Performance in Math and Code, Kazuki Fujii+, ICLR'26, 2025.05
(文書の長さをそろえた実験を通じて)書籍のような一貫性した整合性のある文書構造は学習に有効に働くことを実験的に示し、
また、書籍に対する局所的な書き換えを実施するよりもグローバルに書籍構造を再構築するような手法が学習に有効であることも示した、といった話のようである。
[Paper Note] Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory, Rubin Wei+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Architecture #memory #Scalability Issue Date: 2026-08-09 GPT Summary- Memory Decoderの拡張版「Memory Decoder at Scale」を提案し、69億パラメータと3,000億トークンで事前学習を実施。Faissの非効率を改善するため、分散パイプラインとスパースなバッチ読み込みを導入。メモリに多くのパラメータを割り当てることで、性能向上が確認され、17のベンチマークではPythia-410Mを大きく上回る成果を達成。事前学習済みメモリの独立スケーリングがパラメータ効率を高めることを示した。 Comment
元ポスト:
- [Paper Note] Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models, Jiaqi Cao+, NeurIPS'25, 2025.08
で提案されている Memory Decoder をスケールさせることでdownstream タスクの性能が改善することを示し、スケールさせる上での実装上の課題に対処した、という話に見える。
[Paper Note] Weak-to-Strong On-Policy Distillation, Fangxu Yu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #read-later #Selected Papers/Blogs #On-Policy Issue Date: 2026-08-09 GPT Summary- Weak-to-Strong On-Policy Distillation(W2S-OPD)は、複数の弱いモデルから強い学生を育成する新しい枠組みであり、正例と負例の対比ペアを使用してロジット空間に代理教師を構築する。学生はこの代理教師の方向性を自身のモデルに加え、トークンごとに逆KLを最小化することで蒸留を行う。W2S-OPDは、4つの数学ベンチマークと3つのコードベンチマークで従来のOPD手法を上回り、監督源が弱くても学生の能力向上を実現する。分析により異なる対比が異なる信号を生むことが示された。 Comment
元ポスト:
複数の弱モデルを用いて、より強力なモデルを改善する。モデルを改善するためには常により強いモデルからの学習シグナルが必要、となるとなかなか苦しいので、弱いモデルから学習シグナルをうまく得られるなら非常に重要な研究に見える。
[Paper Note] Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models, Junlin Fang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #Hallucination #Reasoning #Author Thread-Post Issue Date: 2026-08-05 GPT Summary- 推論経路内のノイズを特定し、幻覚検知性能を低下させる関連性のないステップと反復的なステップを除去するために、REDEという新しい学習フレームワークを提案。最終回答へのアテンションを自動監督信号として利用し、信頼性の高いノイズ除去を実現。実験結果により、REDEが競合手法より一貫して優れた幻覚検知性能を示すことが確認された。 Comment
元ポスト:
long reasoningが実施された際に現れる、タスクに対してほとんど追加の情報を得られない推論ステップ(irrelevant)、既に得られている情報であるにも関わらず繰り返される推論ステップ(repetitive)が、hallucination detectionの性能を著しく低下させることを特定し(Figure 1)、hallucination detectionの性能を向上させるために、最終的な回答に基づくattention scoreに基づいて、reasoning trace中の重要なstepとnoisyなstepを分離できるようなlightweight projectionを学習し(直感的には、最終的な回答は重要なトークンにattendし、noisyなトークンにはattendしない)、noisy stepをフィルタリングすることで、hallucination detectionの性能を向上させる (Figure 4)、という話に見える。
[Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs #RecurrentModels #RecursiveModels Issue Date: 2026-08-03 GPT Summary- Nanbeige4.2-3Bは、3Bのパラメータを持つコンパクトなエージェントモデルで、各種タスクや推論能力において高いパフォーマンスを示します。Looped Transformerを活用して新たなパラメータ追加なしに容量を拡張し、28兆トークンから事前学習されています。RLパイプラインによりモデル品質を向上させ、広範な評価で他のエージェントと比較して競争力を維持しながら、特にローカルパーソナルアシスタントとしての利用が期待されます。 Comment
元ポスト:
HF: https://huggingface.co/Nanbeige/Nanbeige4.2-3B
Looped Transformerがアーキテクチャとして採用されたOpenWeightモデル
以下の部分は興味深いが、具体的なAblationによる実験結果などは無さそうに見える。
>Loop Depth Selection. We study the number of passes through the shared layer stack. A two-pass
configuration provides the most favorable trade-off in our experiments: relative to a standard Trans-former, it retains approximately 75% of the token efficiency and provides a significant capacity gain. Increasing the number of passes provides only marginal additional improvement, but substantially
slows training and makes optimization less stable.
[Paper Note] Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives, Siyuan Shen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Infrastructure #LongContext #LLMServing #SoftwareEngineering #read-later #Selected Papers/Blogs #GPUKernel #Latency Issue Date: 2026-08-03 GPT Summary- GPUコレクティブ通信は帯域幅最適化が主流だが、遅延制約が増加中。特に、LLM推論では多数の小規模コレクティブがトークン生成に影響を与えるため、マイクロ秒のオーバーヘッドが性能に重要。研究では、GPUコレクティブの性能向上に向け、効率的な同期とマルチキャスト利用の原則を特定。カスタムコレクティブカーネルを開発し、遅延を大幅に削減、SoL下限の7%以内に抑制。実アプリケーションでLLM推論のレイテンシとスループットを改善し、AI推論とHPCの両方に貢献。 Comment
元ポスト:
小規模バッチ、Tensor Parallelism適用時に のデコード時に頻発するAllReduceのlatencyを、usレベルで削減できる工夫を施すことで、推論コストを低下させる
[Paper Note] On-Policy Delta Distillation, Byeongho Heo+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #reading Issue Date: 2026-07-31 GPT Summary- オンポリシー蒸留は、強化学習における代替的な事後訓練手法で、教師モデルからのトークンレベルの監督信号を利用する。本研究では、デルタ信号と呼ばれる新しい蒸留報酬を導入し、推論チューニング前の教師モデルと基礎モデルの差分を捉えることで、推論能力の転送を促進する。実験により、On-Policy Delta Distillation (OPD^2)が従来の手法を上回り、LLMsがわずかな後訓練期間で強力な性能を達成する可能性を示した。 Comment
元ポスト:
わかりやすい:
ポイント解説:
通常のOPDと比較して複数ドメインで大幅に性能が向上している
解説:
[Paper Note] Self-Improvements in Modern Agentic Systems: A Survey, Zhe Ren+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #ContinualLearning #AgentHarness Issue Date: 2026-07-31 GPT Summary- 自己改善型自律エージェントは、最小限の人間介入で適応を実現するため、研究プロトタイプから実運用システムへと進化している。本研究では、現代エージェントを基盤モデルと運用スキャフォールドの組み合わせとして位置づけ、自己改善を自己誘発更新演算子として定義。過去の研究を整理し、応用と評価を論じ、未解決問題や今後の方向性を考察する。技術的な更新情報は指定のリンクで追跡可能。 Comment
元ポスト:
自己進化するAI Agentについて、モデル、Scaffolding (Agent Harness)、Evaluationの観点からまとめたサーベイのようである。self-improvingと言うと、元々LLMのモデルの重みを自己進化させる枠組みの文脈で使われていたが、AI Agentの文脈ではScaffoldingのメモリの蓄積による性能の進化等も含まれる。
[Paper Note] LeRoPE: Learnable RoPE Frequencies Improve Language Modeling, Petros Karypis+, arXiv'26, 2026.07
Paper/Blog Link My Issue
Issue Date: 2026-07-31 GPT Summary- RoPE(Rotary Positional Encodings)は、言語モデルで広く使用される位置エンコーディングで、クエリとキーのチャンクを回転させて相対的位置を表現します。本研究では、周波数ごとにスカラーを学習することでRoPEを改良し、従来の固定ハイパーパラメータではなく学習可能なパラメータとして扱います。Learned RoPE(LeRoPE)は、異なるサイズの言語モデルで試験され、RoPEおよび部分RoPEを一貫して上回る性能を示しました。特に、最大スケールではRoPEがLeRoPEに追随するために3.4%の追加計算が必要であることが確認されました。 Comment
元ポスト:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
で示された限界は、frequencyをlearnableにすることで解消するのだろうか?
[Paper Note] PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning, Alexis Fox+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #AIAgents #ContextEngineering #memory #ContinualLearning #AgentHarness Issue Date: 2026-07-24 GPT Summary- PRO-LONGは、長期的なタスクに向けた最小限の文脈管理フレームワークであり、プログラム的メモリを使用して情報の保存と検索を効率化する。これにより、ARC-AGI-3ベンチマークでの性能を向上させ、平均18.0ポイントの改善を達成。最先端のハーネスと同等の成果を挙げながら、トークン効率も向上させている。Fable 5を用いた実験では、97.4%の高精度を示し、コストも抑えられている。 Comment
元ポスト:
全てのログを構造化して格納し、エージェントがread/grep/pythonなどを用いて検索可能にするというシンプルなメモリを提案しているようで
様々なモデル、ハーネスの元、パレード最適を実現しているようである。
ログが極端に肥大化した場合性能にどのような影響が出るだろうか?すぐに肥大化しそうだが。
[Paper Note] SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales, Mikail Khona+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Optimizer #Selected Papers/Blogs #Stability #reading #Scalability Issue Date: 2026-07-24 GPT Summary- 高階最適化アルゴリズムMuonとSOAPはAdamWより収束が速いが、計算コストと数値安定性の課題が大規模採用を制限している。研究では、前処理付き勾配法の強化を通じて、大規模LLMの事前学習の問題を解決する。大規模バッチサイズでのSOAPの不安定性を特定し、QR正交化や改善された前処理を提案。これにより損失スパイクを排除し、訓練の安定性を向上。MuonとSOAPは、最大1億トークンのバッチサイズでAdamWを上回る性能を示し、大規模な効率的訓練を可能にするための層別分散型最適化手法を採用。最適化アルゴリズムの新興コードベースも公開。 Comment
元ポスト:
バッチサイズを大規模にしてもMuonはAdamWよりも安定して収束することが実験的に示されたらしい(最近は分散学習下においてGPUのbubbleを削減するためにバッチサイズを大きくせざるを得ない)。
SOAP:
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
Muon:
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
Muonが世に出てからもう1年半程度たったのか
解説:
この実験においてMuonがバッチサイズが大きい場合でもロバストであることが示されたが、そもそも最近のOpenWeightモデルでMuonが採用されていたのは、Muonが大バッチ耐性があることが一因として考えられるという視点がおもしろかった。
また、Muonが必ずしもすべての行列パラメータに有効ではなく、現在はlinear projectionに対して有効。
つまりこの研究が出る前からFrontierモデルを扱うラボなどでは周知の事実だったのだろうか?どのくらい世に出ていない知見が存在するのだろう。
[Paper Note] Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit, Xiaomi MiMo Team+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #AIAgents #Attention #LLMServing #MoE(Mixture-of-Experts) #SoftwareEngineering #KV Cache Issue Date: 2026-07-23 GPT Summary- MiMo-V2.5モデルファミリの推論最適化を提案。Hybrid Sliding Window Attentionと疎なMixture-of-Expertsを組み合わせ、注意計算量とストレージを大幅に削減。レイヤーごとのプリフェッチやキャッシュ戦略を用いて、厳密なストレージと高いキャッシュヒット率を実現。高性能な分散キャッシュ基盤GCacheを構築し、計算量を減少。マルチモーダル入力への最適化も行い、初の大規模LLM提供システムを実現。 Comment
元ポスト:
関連:
- Xiaomi MiMo-V2.5-Pro: A leap in agentic and long horizon coherence, Xiaomi, 2026.04
MoEやSWA、マルチモーダルモデルを用いたモデルを効率的にサービングするためのエンジニアリング面での工夫が記述されているようである。
[Paper Note] Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization, Zhicheng Cai+, ICML'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ICML #PostTraining #Exploration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 強化学習(RL)において、PPO-Clipの根本的な欠陥を明らかにし、ユークリッド距離でのポリシー乖離測定が幾何的に不整合であることを指摘。これにより探索が崩壊する問題を考察。Riemannian Isometric Policy Optimization (RIPO)を提案し、探索と活用のバランスを改善。実験により、RIPOが既存のRLアルゴリズムを大幅に上回り、最大60%の性能向上を示した。 Comment
元ポスト:
トークンレベルでPPOのclippingの値を調整し、高確率なトークンには小さなクリッピングを、低確率なトークンには大きなクリッピングを適用する。オリジナルのPPOのクリッピングの問題点の分析もあるようである。
著者ポスト:
[Paper Note] Qworld: Question-Specific Evaluation Criteria for LLMs, Shanghua Gao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Rubric-based #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- One-Question-One-World(Qworld)を導入し、オープンエンドな質問に対する評価基準を質問特異的に生成。再帰的展開木を使用し、質問をシナリオや視点、細分化された基準に分解。HealthBenchで高いカバー率を示し、専門家によって優れた洞察と粒度が評価される。Qworldは、LLMの評価において隠れた能力差を明らかにし、固定の基準に依存せず、動的な適応評価を実現。 Comment
元ポスト:
Open-endなQuestionを評価する際に、Questionに応じて動的にcriteriaを生成し評価する
[Paper Note] xHC: Expanded Hyper-Connections, Xiangdong Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #Selected Papers/Blogs #reading #Sparse #ResidualStream #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- xHC(Expanded Hyper-Connections)は、トランスフォーマーの残差ストリームをN=4を超えて拡張し、メモリのスケーリングを実現する新手法である。これにより、書き戻し情報の質を向上させ、N=16のストリームから4つのみを更新する疎なアーキテクチャを採用。実験により、xHCは18B MoEモデルでmHCよりも4.0ポイントの性能向上を示し、学習コストの増加を抑制する。加えて、xHC-Flashを導入することでメモリトラフィックを削減し、スケーリング法則においても従来手法に比べて効率的であることを実証。これにより、LLMの大規模トレーニングにおける残差ストリーム展開が実用的に改善される。 Comment
元ポスト:
関連:
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
残渣ストリームの本数を増やし、Routerを導入しそのうちのtop-kを活性化させるようなsparseな残渣ストリームの提案のようだが、他にも工夫がありそう。mHCと比較してlossが大きく改善しているように見えるので気になる。
[Paper Note] OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers, Siyuan Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Survey #Pretraining #NLP #LanguageModel #Evaluation #Optimizer #read-later #Selected Papers/Blogs Issue Date: 2026-07-12 GPT Summary- 最適化手法の選択は計算量やメモリに制約されるが、その全体像は断片的である。そこで、統合サーベイ「OmniOpt」を提案。これには、五段階メタパイプラインの構造的変換、ノルム制約付きLMOによる手法統一、二次元分類法を用いた手法の機構と訓練目標の整理、最適化手法を系統的に分析するクロスドメインベンチマークが含まれる。これにより、最適化手法選択のための実用的な座標系を提供し、今後の研究の方向性を示す。 Comment
元ポスト:
optimizerの詳細なサーベイと様々なベンチマーキングの結果が記載されている模様
全部読んだらめちゃめちゃ勉強になりそう
[Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #Reference Collection #Asynchronous Issue Date: 2026-07-09 GPT Summary- 強化学習におけるLLMsの非同期性を改善するため、Single-rollout Asynchronous Optimization (SAO)を提案。グループ単位サンプリングを廃止し、安定した訓練を1,000ステップ行える。SAOは、GRPOやその派生手法に対し、複数のエージェント型ベンチマークで優れたパフォーマンスを示し、進化する環境への適応性も強化。 Comment
元ポスト:
GLM 5.2で利用されているRL手法
所見:
VAPO:
- [Paper Note] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks, Yu Yue+, arXiv'25, 2025.04
alphaXivによるポスト:
解説:
[Paper Note] Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training, Zijian Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の適応がトランスフォーマー層にどう分布しているかに焦点を当てる研究。単一のトランスフォーマー層を訓練することで、全パラメータRLトレーニングの利得の大半を回復可能。この現象を層寄与量で定量化し、複数のモデルとRLアルゴリズムで安定したパターンを観察。高寄与層は中間部に集中し、入力・出力端の寄与は少ないことを示唆。層の rankings は各種条件下でも強い相関を持つ。 Comment
元ポスト:
実験は8Bスケールのモデルまでしかできていないが、もしこれが数百B級のモデルにも当てはまるのだとすると、非常に計算コストの低減だけでなく、weightのsyncにおいて非常に有利になると思われるので、インパクトが大きそうな話になる可能性を感じる。
RLの効率化という観点で言うと
- [Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
のような話もある。
[Paper Note] Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?, Kotaro Yoshida+, ICML'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #ICML #reading #Rubric-based #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- インラインコメントを活用して、再利用可能な自然言語ルーブリックを学習する手法を提案。コメントの不一致を観察しながらルーブリックを改良し、現実のレビュー設定で評価。これにより、成果物の改訂やルーブリック理解が促進されることを示した。 Comment
元ポスト:
文書の中に断片化されているインラインコメント等を暗黙的な評価基準に基づいて生成された観測データと捉え、インラインコメントから明文化されていない評価基準を学習し、ルーブリックとして活用可能にする、という話に見える。
「暗黙知、ケースバイケースなのでなかなか明文化できません」という状況によく遭遇し困るので、そもそもこういった手法が利用できるように日々の判断をLLMが利用可能な形に残しておくことが重要と感じる
[Paper Note] DataComp-VLM: Improved Open Datasets for Vision-Language Models, Matteo Farina+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Pretraining #Selected Papers/Blogs #DataMixture #VisionLanguageModel #DataFiltering #reading #Author Thread-Post Issue Date: 2026-07-08 GPT Summary- VLMの訓練向上のために、DataComp(DCVLM)を導入し、160のデータセットを統合した6兆トークンのコーパスを作成。データ選別戦略の評価を行い、特にデータミキシングが重要であることを実証。DCVLM-Baselineは200Bトークンで8B VLMを63.6%の精度に達させ、FineVisionを5.4ポイント上回る性能を示した。成果物は公開予定。 Comment
元ポスト:
現在のVLMデータセットはすでにフィルタリングプロセスが踏まれており、それを追加でフィルタリングするとリターンが低減する。
重要なのはフィルタリングではなく、DataMixingで、たとえば70%を指示追従で構成したデータを用いると、バランスをとったMixture, Captionに偏重したMixtuieと比較して、小規模な場合は性能が出ないが、中規模、大規模なモデルの場合は最初の性能の立ち上がりは遅いが、25Bトークン学習させた時点で両者を上回る。
指示追従に関するデータは小規模で繰り返し学習で性能が劣化する心配があるが、4回繰り返し学習をする場合でも全てをユニークデータにしたデータと比較して高い性能を発揮する(ここはしっかり元論文を読まないと細かくはわからない)
という知見が著者ポストに書かれている。興味深い
pj page: https://www.datacomp.ai/dcvlm/
所見:
小規模で最適だったMixが中規模以上で最適なMixとならない
[Paper Note] Agentic Abstention: Do Agents Know When to Stop Instead of Act?, Han Luo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Exploration Issue Date: 2026-07-08 GPT Summary- エージェントが対話を通じてユーザーの目標を達成する際、目標が明確でない場合には行動を止めるべきであるとし、「エージェント性棄却」を定義。標準的な棄却と異なり、逐次的な意思決定問題として評価され、エージェントは環境に応じて回答、棄却、情報収集を選択。ウェブショッピングなどの場面で13のLLMを評価し、棄却のタイミングが重要であることを示した。さらに、モデルの規模や支援枠組みが棄却に影響を及ぼすことが判明。CONVOLVEという手法を導入し、対話の軌跡を利用して棄却を改善、Llama-3.3-70Bモデルでは適時リコール率を大幅に向上させた。データセットとコードは公開中。 Comment
元ポスト:
エージェントが環境とインタラクションした後にタスクが実現不能な場合はタスクを棄却すべきという話
[Paper Note] To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation, Jiuheng Lin+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #PostTraining #ShortcutLearning Issue Date: 2026-07-08 GPT Summary- 強化学習(RL)の推論能力を高めるために、ヒントを注入したペアワイズ報酬モデルを統合した新しいフレームワークHIPPOを提案。重複データの問題を解決し、識別性の高い信号を提供することで、ショートカットの合理化と真の推論を効果的に区別。広範な実験で標準的なベースラインを大幅に上回り、真正な推論スキルを抽出できることを示した。 Comment
元ポスト:
事前学習時にmemorizeされた知識でショートカットしてrewardを得るのではなく、解答へ向けてreasoningすることを促進する
[Paper Note] Reinforcement Learning Towards Broadly and Persistently Beneficial Models, Akshay V. Jagadeesh+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment #ReinforcementLearning #Safety #PostTraining #Selected Papers/Blogs #Generalization #reading #Author Thread-Post Issue Date: 2026-07-07 GPT Summary- RLを用いて多様なドメインで有益な行動を促進し、整合性の一般化を調査。データセットを構築し、50以上の独立したベンチマークで評価した結果、80%超で性能向上が見られる。特に健康ドメインでの介入が他の評価にも効果的で、整合性の維持向上を示した。この研究は、RLを通じて人間の福祉への整合性を強化する可能性を示唆する。 Comment
blog: https://alignment.openai.com/beneficial-rl/
元ポスト:
所見:
特定のドメインにおいて有益な特性を備えた少量データ(trustfulness, 不確実性の下での謙虚さ等を備えた対話)でRLされたモデルは、訓練に使用したドメインを超えて一般化し、アライメントを改善する。敵対的なプロンプトが与えられた場合でも、Alignmentが持続する能力が高まる。
以下でも良性のペルソナで学習をすることでAlignmentが改善しており、似た知見が得られている:
- Teaching Claude why, Anthropic, 2026.05
[Paper Note] Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks, Yu Wang+, ACL'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Analysis #NLP #MultiModal #In-ContextLearning #ACL #VisionLanguageModel Issue Date: 2026-07-07 GPT Summary- マルチモーダル設定における文脈内学習(ICL)の分析を行い、テキストのみのICLと比べて性能のギャップを明らかに。ゼロショット設定では同等だが、少数ショットでは大幅に劣化することを示す。視覚表現とテキスト表現の間で整合性が欠け、タスクマッピングの転送が不十分であることが判明。推論段階の改善手法を提案し、マルチモーダルICLの機構と限界に新たな知見を提供。 Comment
元ポスト:
マルチモーダルモデルを用いてfew-shot demonstrationを与えてICLを実施する場合、text-onlyモデルの場合と比較して性能が劣化することが多いのはなぜか?という疑問を追求した研究で、text-onlyの場合と比較して、マルチモーダルの場合は
- デモンストレーションからタスクルールを推論し
- 推論されたルールをクエリに適用する
という2段階のプロセスが必要で、前者はモデルが中間層まででうまく処理できるが、後者に関して中間層からより深いlayerに伝搬させることに失敗する(クエリ側の手がかりによって推論されてしまう)、ということのようである。
[Paper Note] On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity, Andrei Liviu Nicolicioiu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Distillation #PostTraining #Diversity #On-Policy Issue Date: 2026-07-05 GPT Summary- オンポリシー自己蒸留は、単一モデルを教師と生徒として利用し、高いpass@1精度を実現するが、サンプリングされたデモンストレーションに依存することでロールアウトの多様性が低下する。教師がバイアスを通じてフィードバックを与えるため、最適な自己蒸留方針は基底分布を不均一に傾斜させる。自己蒸留モデルは、制御されたタスクで競争力のある性能を示すものの、機能的多様性が不足し、分布外設定では失敗する。 Comment
元ポスト:
OPDでは教師モデルが正しいロールアウトで条件付けされるため、正しいロールアウトに近いロールアウトはより増強され、遠いものは抑制されることにつながり、結果的に出力の多様性が減少しPass@kが伸びにくくなる、という副作用があるよ、という話のようである。
[Paper Note] Improved Large Language Diffusion Models, Shen Nie+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #DiffusionModel #PostTraining Issue Date: 2026-07-05 GPT Summary- iLLaDAは、80億パラメータの双方向注意を持つマスク付き拡散言語モデルであり、ゼロから訓練された。事前学習には12兆トークンを使用し、教師ありファインチューニングを通じて大規模なコーパスで性能を向上させた。生成効率を高めるために可変長生成と信頼度に基づくスコアリングを導入。iLLaDAは、一般・数学・コードのベンチマークでLLaDAと比較し広範な改善を示し、特にBBHやARC-Challenge、MATH、HumanEvalで顕著なポイント向上を達成。非自己回帰訓練にもかかわらず、競争力を維持していることが示され、双方向拡散訓練が強力な言語モデル開発に寄与する可能性を示唆している。 Comment
元ポスト:
bi-directional attentionを用いてゼロから訓練されたたdLLM
[Paper Note] Learning Multi-Agent Coordination via Sheaf-ADMM, Jeffrey Seely+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #Author Thread-Post #Coordination Issue Date: 2026-07-04 GPT Summary- 多エージェント協調のための微分可能な最適化フレームワークを提示。重なる局所ビューを解決するエージェントは、ADMMを用いて協調し、グローバル合意を形成。マルチエージェントシステムは共同訓練され、局所ビュー不足でも正しい出力を生成。MNISTでは頑健性を向上、数独では高い解決率を達成。ADMM構造により協調ダイナミクスを直接分析可能。 Comment
元ポスト:
blog: https://pub.sakana.ai/sheaf-admm/
微分可能なフレームワークによって、エージェント同士が協調することを学習する
[Paper Note] Multi-Agent Teams Hold Experts Back, Aneesh Pappu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #Analysis #LanguageModel #AIAgents #read-later #Author Thread-Post #Coordination Issue Date: 2026-07-03 GPT Summary- マルチエージェントLLMシステムは自律的に協働するが、固定のワークフローに依存せず相互作用によって協調が形成される。自己組織化されたLLMチームは、他のチームと異なり、専門エージェントのパフォーマンスに一貫して匹敵せず、最大41.1%の性能損失を経験することが判明。主なボトルネックは専門家の適切な活用であり、チーム内での合意志向は専門知識の効果的な重み付けを妨げ、チームサイズが増えるほどパフォーマンスに悪影響を及ぼす。また、合意志向の行動は敵対的なエージェントに対する頑健性を高める可能性があり、アラインメントと専門知識の活用の間にトレードオフが存在することが示唆される。 Comment
元ポスト:
Multi-agent によってチームを組成し専門家をチームに配置しても、(おそらく)正しさよりも合意形成が優先される事後学習の影響によって、エージェントは専門家に適切に移譲をすることができず、専門家単体のパフォーマンスよりもチームでのパフォーマンスは低下しシナジーを発揮できない、という感じの話らしい。興味深い。
実験設定を見ると基本的にAnthropic, OpenAIの商用のProprietary LLMが利用されているように見える。これらのLLMは大前提として人間に対してhelpfulであることを前提にAlignmentがとられているため、正しさを常に追求するといった行動はとらないのだろうと考えられる。これは完全に想像ではあるが、MASの性能を仮に最大化するのであれば、大前提として人間の役に立つという事後学習が実施されているLLMでは少なからず正しさの追求に徹底しきれないという状況が生じる気がしており、少なくともエージェント間のコミュニケーションにおいては正しさを追求する、という形のAlignmentを実施した場合に何らかのシナジーが生じるのか、というのはどうなのだろう?という疑問はある。
が、おそらくそういったAlignmentを施したエージェントは、おそらく前提として人間からの指示には従わなければならないという指示追従能力は身に着けていると思われるので、自分を人間だと誤認させて相手を服従させるといったReward Hackingっぽい挙動が生じるのだろう、と想像する。じゃあそうすると、人間を特権階級とするのやめたらどうなるの?という疑問が浮かぶのだが、そうなるとなかなか怖い話になってくるよね、という予感がする(妄想)。
商用のLLMが多くの人に対して利用されることを前提にしていて、かつビジネスの上に成り立っていることを考えると、AI Safetyの観点からこのようなLLMを学習することにはなかなか踏み切れないという気はする。特に、エージェントに対しては正しさを追求する、といったペルソナをLLMが内包する以上、何らかのMisalignmentによってそれが表出し、利用する人間に悪影響が出るという安全性の懸念が強く生じるので難しいなと思う。特定ドメインに対する単価が高いソリューションとしてはありうるのかもしれない。
あと、そもそも指示追従をしてくれないと意図した方向に行動が進行していないと思われるが、指示追従をするという特性をLLMが持つ時点で、正しさを常に追求する、という挙動は生じうるのだろうか?よくわからない。
LLMを普段使いしていてSycophancyにも似たような状況を感じる。人間とLLMの間でも、(雑にLLMを利用すると)LLMがSycophancyを優先することによって、人間とのシナジーが生まれず誤った方向に進んでしまう、ということは多いように感じる。特に自分があまり詳しくないドメインで協働するときにこのような状況に陥りやすい。
関連:
- Don’t Build Multi-Agents, Cognition, 2025.06
- Single vs Multi-Agent System?, PHILSCHMID, 2025.06
[Paper Note] HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization, Zhentao Tan+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #Architecture #Hybrid #LinearAttention Issue Date: 2026-07-03 GPT Summary- HydraHeadは、解釈可能性に基づいた新しいハイブリッドアテンションアーキテクチャで、ヘッド単位でLinear Attention (LA) とFull Attention (FA) を統合。重要なヘッドの選択とスケール正規化融合モジュールを用いて高性能を維持しつつ、長文脈タスクで他モデルを超える。150億トークンの訓練で、512Kの文脈長においてベースラインを69%以上改善し、ヘッドレベルのハイブリッド化の可能性を示す。 Comment
元ポスト:
full attentionとlinear attentionをハイブリッドするアーキテクチャの提案
[Paper Note] VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation, Seongheon Park+, ACL'26 Findings, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #ACL #VisionLanguageModel #Findings #SelfVerification Issue Date: 2026-07-01 GPT Summary- 視覚言語モデル(LVLM)の幻覚問題を解決するために、視覚認識に基づく不確実性定量化フレームワークVAUQを提案。これにより、モデル出力の視覚的証拠への依存度を測定し、Image-Information Score(IS)を導入。トレーニング不要のスコアリング関数を用いて正確さを反映。実験により、VAUQは既存の自己評価手法を上回る性能を示した。 Comment
画像に関するタスクをVLMが処理する際に、応答のconfidenceがlanguage priorではなく、画像に基づくevidenceに基づいているかをconfidenceに反映させる
[Paper Note] Qwen-Image-2.0-RL Technical Report, Yixian Xu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #TextToImageGeneration #Distillation #PostTraining #On-Policy #VisionLanguageModel #RewardModel #Editing #ImageSynthesis Issue Date: 2026-06-29 GPT Summary- Qwen-Image-2.0-RLは、RLHFとオンポリシー蒸留を用いてQwen-Image-2.0の視覚品質と指示遵守を向上させるパイプライン。信頼性の高い報酬モデルを構築し、画像生成と編集タスクで重要な次元をカバー。最終段階でオンポリシー蒸留を提案し、複数の教師から単一モデルへの統合を実現。評価では、Qwen-Image-Benchで総合スコア57.84、テキスト対画像Eloが1193、画像編集Eloが1349を達成し、全体的に性能向上を示す。 Comment
元ポスト:
T2I, Editに特化したTeacherモデルを学習しOPDする
[Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #reading #Orchestration #Author Thread-Post Issue Date: 2026-06-27 GPT Summary- LLMの特化を統合するために、オーケストレーター型モデルSakana Fuguを開発。Fuguはユーザーのクエリを理解し、動的にエージェントフレームワークを設計。これにより、様々な難解なタスクで最先端の性能を達成。日常利用と高難度応答のバランスを取るFuguと、回答品質を優先するFugu-Ultraを公開。トレーニング方法には大規模ファインチューニングや強化学習を含む。研究がマルチエージェントシステムの発展に寄与することを目指す。 Comment
元ポスト:
基盤となる技術:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- [Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
- [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
[Paper Note] Transformer-Squared: Self-adaptive LLMs, Qi Sun+, ICLR'25, 2025.01
と [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
によってFuguが学習され、さらに [Paper Note] Learning to Orchestrate Agents in Natural Language with the Conductor, Stefan Nielsen+, ICLR'26, 2025.12
によってFugu Ultraが学習される、という構図に見える。
これはただの感想だが
- nature inspiredなAIを実現するというビジョンのもと
- 世界にインパクトを与えられるようなプロダクトを設計し
- プロダクトから逆算して技術的に必要な課題を列挙し、
- 個々の課題についてトップカンファレンスに通すレベルの水準まで、ストーリーと研究を追求した上で実際にカンファレンスに通し
- 最終的にそれらをつなぐことによってプロダクトを構成する
という、プロダクトと研究が一体となる戦略をとっているように感じた。
プロダクトと研究が分離していると、まずプロダクトがあって、そのプロダクトを運用している中で課題が見つかり、それを解決するための仕事をしていたらそこから研究にできそうな芽が出てきて、出てきた芽をうまく切り出して結果的に研究として出版される、という流れになる気がするのだが、これとは根本的に戦略が異なるように感じる。
[Paper Note] Qwen-AgentWorld: Language World Models for General Agents, Yuxin Zuo+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #read-later #Selected Papers/Blogs #WorldModels #Environment #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- 言語モデルに基づく世界モデリングがエージェントの能力を広げる可能性を探る。初の言語世界モデルQwen-AgentWorldは、7ドメインでの環境シミュレーションを実現し、3段階の訓練パイプラインによって既存モデルを大きく上回る性能を示す。加えて、エージェント性強化学習のための制御可能なシミュレーションと、下流性能向上のためのウォームアップとしての効果も検討。 Comment
元ポスト:
MCP, Terminal, Search, SWE, Web, OS, Androidなどの様々なEnvironmentをシミュレーションする統合モデル。興味深い。
[Paper Note] NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?, Yuru Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Evaluation #Author Thread-Post Issue Date: 2026-06-25 GPT Summary- NatureBenchは、査読付きNature系論文から蒸留された90のタスクから成る学際的ベンチマークで、AIコーディングエージェントの能力を評価する。NatureGymという自動パイプラインによって、環境の断片化問題を解決し、標準化されたタスク環境を構築。10種類の最先端エージェントを評価した結果、最も強力なモデルでもSOTAを超えるタスクは17.8%にとどまることが判明。成功は主に方法論的翻訳に依存し、真の科学的発明には結びついていない。失敗は主に手法選択と計算リソース不足に起因。ベンチマークと公開リーダーボードが提供される。 Comment
元ポスト:
最近は新しいベンチマークが出ると大抵はClaudeがTopな気がする
[Paper Note] Rethinking the Role of Efficient Attention in Hybrid Architectures, Ziqing Qiao+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Attention #LongContext #PositionalEncoding Issue Date: 2026-06-22 GPT Summary- ハイブリッドアーキテクチャにおける効率的アテンションモジュールの影響を、スケーリング挙動、メカニズム分析、アーキテクチャ設計の観点から体系的に分析。効率的アテンションは長い文脈能力の出現速度に影響するが、最終的には同等の性能へ収束。長距離検索はフルアテンションによるもので、効率的アテンションがその最適化を形作る。“Large-Window Laziness”という現象を説明し、窓が小さいSWAハイブリッドにNoPEを適用することで長い文脈での性能が向上することを示した。 Comment
元ポスト:
SWAにNoPEを組み合わせるとlong contextの性能が改善するようである(Table 2)
解説:
SWEのwindowサイズを小さくした方が、full attentionが長距離文脈を学習することを促進する。これは、SWEのwindow幅に存在するcontextで様々な依存関係を処理できるため、full attention側で長距離依存を学習する恩恵が低減するから、ということのようである。
[Paper Note] S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence, Yalun Dai+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Reasoning #read-later #Selected Papers/Blogs #Robotics #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-06-19 GPT Summary- 空間的知性を必要とする連続的な3D世界において、既存のVLMは静的な推論に限界があります。本研究では、S-Agentという空間ツール使用型エージェントのパラダイムを提案し、空間推論をフレーム中心からシーン中心の理解へと再構築します。S-AgentはVLMを意味的プランナーとして機能させ、物体の定位から高レベルの空間知識の統合を行います。さらに、Scene MemoryとAgent Memoryを用いた時系列記憶機構により、証拠統合が可能になります。実験により、S-Agentがオープンソース・クローズドソース両方のVLMを改善し、S-300Kに対する監視付きファインチューニング(SFTが)同規模のベースラインを凌駕し、高度なモデルとも同等の性能を示すことが確認されました。 Comment
元ポスト:
Gemini 3 Proをoutperformとのこと。Ropediaは独自のデータを大量に収集していると思われるので動向が気になる。
pj page: https://ropedia.github.io/S-Agent/
[Paper Note] ExpRL: Exploratory RL for LLM Mid-Training, Violet Xiang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #LLM-as-a-Judge #mid-training #Author Thread-Post Issue Date: 2026-06-17 GPT Summary- スパース報酬強化学習(RL)は、LLMの推論を向上させる方法だが、成功は基盤モデルの網羅性に依存する。従来の方法では、中間訓練に選ばれた推論軌跡を用いてスキルを教えるが、手動指定が必要であり、そのカバレッジが難しい問題に対して十分かは不明である。新たなアプローチとして、ExpRLは人間作成の質問応答データを用い、参照解を報酬の基盤として扱う。ポリシーは問題プロンプトから推論をサンプリングし、LLM判定者がバックグラウンド報酬を割り当てることで部分的進捗を強化する。ExpRLは、難解な数学的推論タスクにおいて、他手法よりも優れたRLプリミングを実現し、スパース報酬RLの初期化を改善することが示された。 Comment
元ポスト:
post-trainingでGRPOをすると、報酬がsparse(モデルが解けない問題に対してはadvanatageがゼロ)となりシグナルが得られない問題があるが、これをmid trainingの段階で参照データをdense報酬のためのscaffoldingとして活用することで、後続のsparseなRLの性能を改善する。どうやらmid trainingの段階で、参照データを与えた(=scaffolding) verifierを用意し、LLM-as-a-Judgeを通じて密な報酬(すなわち、最終的な応答だけでなく途中のtrajectoryの良し悪しからも報酬を得る)を与え、後続のsparseなRLのためのwarmupをする。warmupにはSFTやself-distillationが用いられることが多く、これら手法は基本的には参照データの模倣学習であるため汎化性能を犠牲(i.e., これはらトークンレベルの学習シグナルであらため、自由な探索が抑制されエントロピーが下がる)にしていたが、提案手法ではDense RewardなRLを用いることで探索が促進され(=高いエントロピーが保たれる)warmupが可能となる、という話に見える。
[Paper Note] VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models, Sen Xu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #Mathematics #SmallModel Issue Date: 2026-06-17 GPT Summary- VibeThinker-3Bは3Bパラメータを持つ小型密結合モデルで、検証可能推論の限界を調査します。Spectrum-to-Signalに基づく最適化パイプラインを用い、多ドメイン強化学習や自己蒸留を含むファインチューニングを行い、高度な検証可能タスクでフロンティア級の性能を示します。具体的には、AIME26で94.3点、LiveCodeBench v6で80.2%、LeetCodeコンテストで96.1%の合格率を実現しました。この研究は、コンパクトなモデルがフロンティア性能を持ち得ることを示し、パラメトリック圧縮-カバレッジ仮説を提唱します。 Comment
元ポスト:
3Bモデルでもpost trainingによって、100倍以上大きいモデルよりも数学、コーディングなどのドメインでは同等程度の性能に到達できる。ただし、GPQA Diamondのような知識を必要とするタスクの性能は明確に劣る。
[Paper Note] Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation, Guo Yu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Analysis #LanguageModel #Distillation #On-Policy Issue Date: 2026-06-15 GPT Summary- オンポリシー蒸留(OPD)は、オンポリシー学生の軌跡と密な教師監督を組み合わせることで進化してきたが、そのモデルパラメータへの影響は不明である。分析の結果、OPDの更新は小さく、層全体にわたって疎で、特にFFNモジュールでの相対変動が顕著であることが分かった。このスパース構造により、特定のサブネットワークのみを訓練することで高い性能を維持できるが、適応的最適化が必要な場合もある。幾何学的には、更新はフルランクだが集中した特徴を持ち、元の重みの主要な特異部分空間から離れた位置に配置されるため、OPDは密な教師監督とは異なる特性を示している。 Comment
元ポスト:
OPDはネットワーク全体に対して更新をかけるのではなく、小さなサブネットワーク(主にFFN)に対して更新をかける
[Paper Note] MiniMax Sparse Attention, Xunhao Lai+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #LongContext #SparseAttention Issue Date: 2026-06-14 GPT Summary- 大規模言語モデルの超長文脈能力に対応するため、MiniMax Sparse Attention(MSA)を提案。MSAはGrouped Query Attention(GQA)に基づくスパースアテンションで、ブロック単位で効率的な計算を実現。選択されたブロックに対して正確なアテンションを行い、トークンあたりの計算量を大幅に削減。1090億パラメータのモデルで、MSAは性能を保ちながら計算を28.4倍削減し、優れたスピードアップを達成した。詳細な推論カーネルとモデルは公開されている。 Comment
元ポスト:
GQAの各グループに対してTopKをサンプリングして利用する
[Paper Note] Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings, Songhao Wu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#DocumentSummarization #Embeddings #NLP #LanguageModel #Decoder Issue Date: 2026-06-11 GPT Summary- 大規模言語モデルはゼロショット能力に優れるが、テキスト埋め込みベンチマークでは性能が不足している。これは、高頻度トークンの過剰な表現が意味表現の能力を抑制するためと考える。そこで、EmbedFilterを導入し、LLMから生成された埋め込みを洗練させる。具体的には、頻繁なトークンの影響を抑えるためのフィルタリングを行い、意味表現を強化しつつ、埋め込み次元を削減。実験により、EmbedFilterを用いたLLMが、次元削減後もゼロショット性能が向上することを示した。本研究がLLMベースの表現の理解を深め、テキスト埋め込みの改善に寄与することを期待する。 Comment
元ポスト:
関連:
- [Paper Note] Scaling Sentence Embeddings with Large Language Models, Ting Jiang+, EMNLP'24 Findings, 2023.07
- [Paper Note] Repetition Improves Language Model Embeddings, Jacob Mitchell Springer+, ICLR'25, 2024.02
decoder-onlyモデルからembeddingを取得する際に、高頻度語の成分を除去するフィルタを導入することでembeddingの品質を向上させる
[Paper Note] CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning, Penghui Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #ImageCaptioning #VisionLanguageModel #3D (Video) #VideoCaptioning Issue Date: 2026-06-11 GPT Summary- マルチモーダルキャプション生成において、強化学習を用いる新たなフレームワークCapRL++を提案。特に、キャプションの品質を有用性に基づいて再定義し、視覚情報を用いない質問に正確に答えられることを重視。これにより、高密度なキャプション生成能力が向上し、複数のタスクでのパフォーマンスが強化。CapRL++を用いた訓練モデルは、大規模モデルと同等の性能を達成し、従来の方法の限界を超えることを示した。 Comment
元ポスト:
CapRLのアイデア(i.e., 画像に関する質問をtext-onlyモデルがcaptionのみから正解できたらそのcaptionの品質は高い; キャプションの品質を有用性で測る)をvideo-captioninに拡張
[Paper Note] Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory, Ruida Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#AIAgents #read-later #Verification #AgentHarness Issue Date: 2026-06-11 GPT Summary- **Lean4Agent**は大規模言語モデル(LLMs)のエージェントシステムの信頼性を向上させるためのフレームワークであり、正確なワークフローの仕様化・検証を実現。依存型形式言語(FL)であるLean4を用いて、エージェントの挙動を正式にモデリング・検証する最初の試みとして、**FormalAgentLib**を立ち上げ、エージェントの実行中の障害を特定可能とした。さらに、**LeanEvolve**はワークフローを改訂し能力を向上させるもので、実験では検証済みワークフローが失敗したものに比べて**11.94%**改善し、**LeanEvolve**はSWEの性能を**7.47%**向上させることを示した。 Comment
元ポスト:
Agentのワークフローのpre/post conditionを定義しverifiableにすることでワークフローを検証可能にし、失敗が生じた場合はtraceできるようにする
[Paper Note] The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show, Parsa Esmati+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Probing #Selected Papers/Blogs #VideoGeneration/Understandings #Physics Issue Date: 2026-06-11 GPT Summary- 動画拡散モデルの物理的構造のエンコードと運動パターンの再現について検討。物理的妥当性を検証するため、学習済みの速度場を用いて潜在軌道を復元し、拡散トランスフォーマーから線形にデコード可能であることを示す。平均精度は81.27%に達し、専用ベースラインを上回る結果を得た。この信号はモデル内部から現れ、自己教師なしで訓練されていないにもかかわらず物理的に意味のある表現が生成されることを示唆している。 Comment
元ポスト:
動画生成モデルの内部表現の線形プロービングで、動画の物理的妥当性を予測できる。このことより、動画生成モデルの内部には物理学に関する内部モデルが内包されていることが示唆される。
[Paper Note] Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments, Parth Asawa+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #ContinualLearning Issue Date: 2026-06-07 GPT Summary- 継続学習を評価するための初の専門家検証済みベンチマークであるCL-Benchを紹介。六つの多様な領域を対象に、LLMベースのシステムが経験を通じて改善するかを測定。状態を持つシステムは潜在構造を発見可能で、最先端モデルが継続学習を改善する余地があることが明らかに。専用メモリシステムでも問題は解決されず、シンプルなICLが優位であった。このベンチマークにより、現実世界における継続学習の必要性が強調されている。 Comment
元ポスト:
Question (Instance)のSequenceを完了することが求められるContiunual Learningのためのベンチマークで、各instanceは、モデルが事前に知り得ない報告可能な状態を持ち、後続のinstanceは、過去のinstanceの結果(experience)を用いなければならない。また、最終的に、Databaseのmigrationを通じて過去のexperienceを適用不可能にし、このような状況にも柔軟に対応可能な能力も評価する、という話に見える。
[Paper Note] Reasoning Structure of Large Language Models, Frédéric Berdoz+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Chain-of-Thought #Evaluation #Reasoning Issue Date: 2026-06-06 GPT Summary- 推論モデルの評価には、正確性やトークン数だけでなく、推論構造の理解が重要である。これに応じて、論理パズルのためのスケーラブルな評価ベンチマークと、非構造化推論を検証可能な推論グラフに変換するパイプラインを導入。これにより、推論の構造化と定量的分析が可能となり、論理的流れの集中度を測る指標を定義。分析は、構造的測定が正確性とトークン数の混同を解消し、故障モードの診断やパズルの難易度との関係を比較するのに役立つことを示した。 Comment
元ポスト:
LLMのReasoning Traceをverifiableなグラフ構造に変換し、Reasoningを評価可能にする
[Paper Note] OneReason Technical Report, OneRec Team+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#RecommenderSystems #Pretraining #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #GenerativeRecommendation #PostTraining #read-later Issue Date: 2026-06-05 GPT Summary- OneRecファミリーの生成型推奨モデルは多くのサービスで利用されていますが、アイテムを表すトークンから有意義なCoTシーケンスを構築するのが困難です。この課題を克服するため、推論能力を探索する予備研究(OneRec-Think、OpenOneRec)を実施しましたが、思考モードが必ずしも優位であるとは限らないことが判明しました。推奨の効果的な推論には知覚と認知の二つの要因が重要であると考え、OneReasonを提案します。具体的には、強力なアイテム的トークン知覚、三レベルの認知強化CoT形式、“専門化→統合”の学習レシピを用いて思考能力を高めます。 Comment
元ポスト:
事前学習/SFT/RLといった現在主流なLLMの学習パイプラインをGenerative Recommender Systemsに適用したモデルのようで、
ItemIDのトークンの意味を理解させるための事前学習等を実施している点が興味深い。
[Paper Note] OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification, Yuhang Zhou+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Distillation #PostTraining #On-Policy #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- ロジットを用いずにチャンクレベルの監督信号で教師からのフィードバックを利用する新しいフレームワーク、OmniOPDを提案。これにより、教師モデルへのアクセス制限とトークンレベル信号の脆弱性の問題を解決。ベンチマークにおいて、OmniOPDは標準OPDを最大+28.64%上回り、高い不確実性の場面でのみ監査するよう設計されている。また、より強力なブラックボックス型教師を用いた場合には、オープンウェイト教師に対してさらに+9.54%の向上を示し、自律的な強化学習の性能を超える結果をもたらした。 Comment
元ポスト:
大抵のProprietaryモデルは出力から競合となるモデルを学習することを禁止していると思うのだが、果たして
[Paper Note] Automated Benchmark Auditing for AI Agents and Large Language Models, Junlin Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 現代のAIベンチマークでは、複雑なタスクが多く含まれ、人間の注釈では検知が難しい問題が存在します。これを解決するために、Auto Benchmark Audit(ABA)を導入し、168のベンチマークを調査。ABAは、あいまいなタスク設計や実行環境の衝突など、25.7%以上のタスクで重大な問題を特定。問題のあるタスクがモデル評価を歪めることを示し、除外することでパフォーマンスが9.9%及び9.6%向上することを確認。今後のベンチマーク発展のため、これらのツールとタスク注釈を公開します。 Comment
元ポスト:
既存のベンチマークを
- 指示の曖昧性
- 環境に内包される問題(競合や依存関係の問題)
- 評価の品質
の観点から監査するAudit Agentの提案
[Paper Note] BAGEN: Are LLM Agents Budget-Aware?, Yuxiang Lin+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- エージェントのリソース消費に対し、コストを実行後にのみ測定するのではなく、予算を積極的な制御信号として扱うべきと提案。予算は内部(計算由来)と外部(行動由来)に分け、エージェントは各計画ステップで残り予算の予測と警告を行う。評価では、強力なエージェントが必ずしも予算意識を持たず、過度に楽観的な傾向が見られた。予算意識信号は訓練可能で、早期停止により失敗したトークンを28〜64%削減でき、SFT+RLがその効果を強化。しかし、正確な区間のキャリブレーションは依然難しい。 Comment
pj page: https://ragen-ai.github.io/bagen/
元ポスト:
以下著者ポストと論文のskim readによるサマリ(読み違えがあるかもしれないので注意)
LLM/AI Agentがbudget(あとどの程度のトークンでタスクを完了できるかの見積もり)を考慮して生成できているか否かを明らかにし、性能とトークン予算の性能は必ずしも相関しないことを示し(現在のフロンティアモデルはトークン予算に対して楽観的で、トークン予算があまり残っていないのに不必要に多くのトークンを消費する)、与えらえたトークン予算に関して、タスクを実現できるか否かの2値分類ははSFTによって強化できる(Qwen-7Bにおいて25.5%->90%まで向上)が、SFT+RLによって正確な残りの予算のrangeを当てるような推論は47%程度で頭打ちで課題が残る、という話に見える。興味深い。
[Paper Note] minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models, Min Zhao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #VideoGeneration/Understandings #WorldModels #3D (Video) #TextToVideoGeneration #Realtime Issue Date: 2026-05-31 GPT Summary- リアルタイムのインタラクティブなビデオワールドモデル構築のため、フルスタックのオープンソースフレームワークminWMを提案。双方向ビデオディフュージョンモデルをカメラ制御可能な少数ステップ自回帰モデルへ変換し、低遅延のロールアウトを実現。モジュール化されており、異なるアーキテクチャに対応。実用的なアブレーションも提供し、再現性や拡張性を目指す。 Comment
元ポスト:
Text-to-Videoの基盤モデルを、actionによって条件付けされて生成をするvideo world modelへ変換する
[Paper Note] AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence, Kate M. Lubrano+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #Evaluation #Conversation #read-later #Emotion #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- 感情知性(EI)の評価が重要になる中、AttuneBenchを紹介。実際の複数ターンの人間-モデル対話200件に基づき、感情状態とモデルの挙動をターンごとに注釈。11モデルの評価結果は感情認識や応答品質に関する能力が分離可能であることを示し、嗜好の整合と応答品質の判断がモデル識別に強く寄与することを明らかに。AttuneBenchは、感情的に重要な会話の評価枠組みを提供し、モデルの強みや弱点を診断する。 Comment
元ポスト:
leaderboard: https://public.attunebench.com/
対話をしている本人によるプロンプト、アノテーション、マルチターンの会話を前提にモデルのEQを測定するためのベンチマークのようである(従来は合成プロンプト、シングルターン、third-partyに基づいたアノテーション(つまり対話している本人ではない、ということだと思われる)によるベンチマークだったとのこと)。
[Paper Note] Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor, Guoxin Ma+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #ContextEngineering #Compression Issue Date: 2026-05-31 GPT Summary- 長い文脈を短縮しながら情報損失を抑える文脈圧縮の新手法「Thinking as Compression(TaC)」を提案。思考モデルが自らタスク関連情報を整理し、専用の圧縮機に依存せずに効果的な圧縮を実現。加えて、TaCを制約付きで進化させた「TaC-C」により、思考をコンパクトに管理できる。実験では、既存ベースラインを一貫して上回り、特に4倍および8倍の圧縮比でF1とEMスコアが顕著に改善された。 Comment
元ポスト:
contextを圧縮する専門のcompressorをわざわざ用意するのではなく、reasoningモデルのreasoning traceそのものを圧縮されたcontextとして扱えるような枠組みの提案のようである。
[Paper Note] Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players, Fangfu Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #ComputerVision #Transformer #DiffusionModel #VideoGeneration/Understandings #WorldModels #interactive Issue Date: 2026-05-31 GPT Summary- マルチエージェント環境におけるインタラクティブなビデオ生成のために、私たちの生成的マルチエージェントワールドモデルを提案。エージェント間の順列対称性を保ちながら、異なる位相で独立に制御可能であるSimplex Rotaryエージェントエンコーディングを用い、Sparse Hub Attentionでアテンション計算を効率化。トレーニングなしで2人から4人への一般化が可能で、映像の忠実度やアクション制御、一貫性を向上。 Comment
元ポスト:
pj page: https://research.nvidia.com/labs/sil/projects/gamma-world/
複数のエージェント環境における(エージェントのaction, 前回アクションからのobservationが与えられた上で、次の世界の状態を予測し画像で出力するという文脈での)World Model
[Paper Note] Unified Neural Scaling Laws, Ethan Caballero+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Scaling Laws #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- UNSLと呼ばれる関数形を提案し、複数の次元が同時に変化する際の深層ニューラルネットワークのスケーリング挙動を正確にモデル化。モデルパラメータ、データセットサイズ、トレーニングおよび推論ステップ数、計算量などが影響を与える様子を示し、大規模なビジョン、言語、数学、強化学習タスクに適用。既存のスケーリング関数と比べ、より精度の高い外挿を実現。 Comment
元ポスト:
データセットサイズ、推論ステップ数、幅、深さ、初期化時の重みの標準偏差、学習率、バッチサイズを変数に持ち、それらを同時に変化させても外挿可能なScaling Lawsのようである
[Paper Note] CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents, Bowen Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #ComputerUse #PostTraining #RLVR #VisionLanguageModel #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- CUA-Gymは、検証可能な報酬を伴う強化学習を支える新しいスケーラブルなパイプラインで、タスク指示、環境状態、報酬関数を共生成。生成エージェントと判別エージェントがタスク仕様に基づく報酬を生成し、オーケストレータエージェントがこれを推進。高忠実度のモックWebアプリケーションを合成し、32,112の検証済みRLVRトレーニングタプルのデータセットを構築。GSPOでの学習により、既存のCUAsを超える成果を達成し、性能のスケーリングを示唆。本研究の成果物はオープンソース化される予定。 Comment
pj page: https://cua-gym.xlang.ai/
元ポスト:
CUAのためのRLVRデータを合成できる環境の提案
[Paper Note] Parallax: Parameterized Local Linear Attention for Language Modeling, Yifei Zuo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-05-30 GPT Summary- 大規模言語モデル(LLMs)用にスケール可能な局所線形アテンション(LLA)を提案するParallaxを導入。LLAの数値解法を排除し、アテンション機構を効率化。FlashAttentionに対して高い演算強度を実現し、事前学習全体で一貫したパープレキシティ改善を確認。新たな現象MuonによりParallaxの能力を向上させた。この研究は、注意機構のアーキテクチャとオプティマイザの共同設計の重要性を示す初の例である。 Comment
元ポスト:
Muonと組み合わせると非常に高い性能を発揮するようである
早速nanoGPT speedrunでParallaxによってSoTAが更新されたようである:
[Paper Note] MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale, Zhicong Tang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #CVPR #2D (Image) #Editing #ImageSynthesis #Author Thread-Post #ImageToLayer Issue Date: 2026-05-28 GPT Summary- 多層透明画像の生成と編集に特化した200億パラメータのマスク領域拡散モデル「MRT」を提案。テキストおよび画像からのレイヤー生成を統合し、柔軟なレイヤー単位の操作を実現。オーバーフロー対応のキャンバスレイヤーによって、透明な背景合成をサポートし、リアルタイムの生成を可能に。実験により、従来の技術を大きく上回る性能を示し、特に編集品質や推論速度で優位を獲得。 Comment
元ポスト:
pj page: https://mrt-cvpr.github.io/
画像生成ではなく、layer生成にフォーカスした研究で、text-to-layer generation, image-to-layer decomposition, layer-to-layer addition, layer-to-layer restylizationなどが可能なようである。
[Paper Note] The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, MiniMax+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #OpenWeight #SelfImprovement #MoE(Mixture-of-Experts) #read-later Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment
元ポスト:
ポイント解説:
関連:
- MiniMax-M2.7, MiniMax, 2026.03
expertの数を大きくしているようで、この設計は下記の知見と一致する:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
[Paper Note] PowLU: An Activation Function for Stable Pre-Training of LLMs, Peijie Jiang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Stability #ActivationFunction #LowPrecision #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 大規模言語モデル(LLM)において、SwiGLU活性化関数は非線形性を導入するが、大きな入力での数値的不安定性が問題。これを解決するために、新たに提案したPowLU活性化関数は、安定した訓練を実現し、表現力を向上させる。実験では、PowLUがSwiGLUやSwiGLU-Clipと比較して競争力のある結果を示し、スケーラビリティの向上も確認された。 Comment
元ポスト:
Layerが深いモデルや、低精度(FP8/FP4)に対して、事前学習の安定性を高める活性化関数
[Paper Note] Strong Teacher Not Needed? On Distillation in LLM Pretraining, Taiming Lu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Distillation #read-later Issue Date: 2026-05-27 GPT Summary- 知識蒸留における教師と生徒の関係を再検討。強→弱、同等、弱→強の関係で蒸留の有効性を分析し、教師が強力である必要はないことを発見。適切に損失を混合すれば小規模教師でも大きな生徒モデルを改善可能。教師のパラメータ数や訓練トークンの増加は蒸留効果を逆転または飽和させることも。蒸留は分布外および下流タスクの性能を同一ドメインより改善する傾向がある。これにより、強力な教師の必要性に疑問を投げかける。 Comment
元ポスト:
モデルサイズやperplexity視点での強-弱ではなく、どちらかというとdownstreamタスクでの性能の方が大事なのでは?結局のところ、生徒モデルよりも教師モデルの方が秀でている部分が何かしら存在すれば、学習シグナルを得られる可能性はあるよね、という話な気が。
[Paper Note] Forecasting Scientific Progress with Artificial Intelligence, Sean Wu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #SelfImprovement #ScientificDiscovery #autoresearch/RSI #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment
元ポスト:
現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。
ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。
データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。
[Paper Note] Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws, Nandan Kumar Jha+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Optimizer #Scaling Laws #read-later Issue Date: 2026-05-27 GPT Summary- オプティマイザは、言語モデルの性能に重要な影響を与えるが、通常は固定的な詳細として扱われている。本研究では、異なるオプティマイザが同じTransformerアーキテクチャのスペクトルスケーリングに与える影響を調査し、AdamWとMuonの間で顕著な違いを発見した。特に、Muonは線形スケーリングを示し、スケーリング指数が2.3倍に増加するのに対し、AdamWは弱いスケーリングを示した。この異差は検証損失だけでは説明できず、同一の損失が異なる表現構造を持つ可能性を示唆する。オプティマイザの効果はアーキテクチャの効果を上回ることがあり、最適化を表現スケーリングの重要な要素として捉える必要性を強調し、オプティマイザとアーキテクチャの共同設計を促進する。 Comment
元ポスト:
lossは同じでも、AdamW/Muonの間で形成される内部representationの構造が異なる(説)
[Paper Note] One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs, Di He+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs #LearningRate Issue Date: 2026-05-27 GPT Summary- Layerwise Learning Rate(LLR)を導入し、Transformer層ごとに異なる学習率を割り当てることで訓練を効率化。重尾性を考慮した学習率調整により、訓練の均一化、収束の加速、一般化の改善を実現。50の異なる条件での実験で、最大1.5倍の訓練速度アップを達成し、1Bモデルのゼロショット精度を47.09%から49.02%に改善。低いチューニングオーバーヘッドも特長。 Comment
元ポスト:
Layerごとに学習率を調整することで、学習効率を改善する
[Paper Note] On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists, Seungone Kim+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #reading #Author Thread-Post #Reviwer Issue Date: 2026-05-27 GPT Summary- AIレビュアーの導入が進む中、その能力と信頼性には疑問が残る。多くの科学者はAIを専門知識を欠くシステムと見なす一方、他の研究者は楽観的である。AIレビュアーの評価を理解するため、本研究では、専門家による2,960件のレビューを評価し、その結果、GPT-5.2が人間レビュアーを上回る性能を示した一方で、他のAIレビュアーは最低評価の人間を上回った。ただし、AIレビュアーは重複や限定的知識に課題を持ち、人間の代わりではなく補完としての役割に留まることが明らかとなった。 Comment
元ポスト:
Natureの82本の論文に対してAIにレビューを実施させ、人間の専門家がレビュー結果に対して大規模なアノテーションを実施し、現在のAIレビュワーの能力を評価。その結果、AIレビュワーは
- 根拠が明確で重要な問題点を明らかにし、人間よりも多くの問題点を指摘できるが
- レビューの結果は多様性に乏しく、重複した指摘が多い。
- また、コミュニティや分野における暗黙の了解や規範が欠如した指摘をしたり (W1: missing community / field norms)、過剰に厳しい、あるいはスコープ外や非現実的な要求を実施したりする (W2: over-harsh, out-of-scope, or unrealistic demands)
などの欠点があることが明らかになった、ということのようである。
[Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #AgentSkills Issue Date: 2026-05-26 GPT Summary- エージェントのスキルをデジタル空間内で最適化するために、SkillOptという体系的なアプローチを提案。これにより、評価されたロールアウトを基にスキル文書の編集を行い、検証スコアを改善させることが可能に。多様なベンチマークで他の手法を上回り、GPT-5.5での性能向上も実現。最適化されたスキルは異なる環境間での移動でも価値が保持されることが確認された。 Comment
元ポスト:
自然言語で記述されるスキルを訓練可能な外部パラメータとして扱う
ポイント解説:
解説:
[Paper Note] Post-training makes large language models less human-like, Marcel Binz+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Alignment Issue Date: 2026-05-23 GPT Summary- LLMsが人間の行動を模倣する中で、どのモデルが最適かは未解決の課題である。この解決策として、Psych-201データセットを導入し、行動的一致性を測定。訓練後の段階でモデルが人間行動と一致しないことを確認し、整合性のずれは新しいモデルで拡大、一方で基盤モデルは改善を続ける。また、ペルソナ誘導法による個人レベルの予測改善は見られなかった。これらの結果から、LLMsを有用なアシスタントに転換するプロセスが人間行動の模倣を妨げている可能性が示唆される。 Comment
元ポスト:
関連:
- [Paper Note] Do LLMs exhibit human-like response biases? A case study in survey design, Lindia Tjuatja+, arXiv'23, 2023.11
LLMがRLHFなどによって人間が好む応答とは異なるバイアスを持つことが示されている。
純粋な疑問として、人間らしいモデルが本当に人間の役に立つのか?という問いが成り立つ気がする。
[Paper Note] The Alien Space of Science: Sampling Coherent but Cognitively Unavailable Research Directions, Alejandro H. Artiles+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Novelty #LanguageModel #AIAgents #ScientificDiscovery Issue Date: 2026-05-23 GPT Summary- 科学的発見は認知的に利用可能である必要があり、従来のコミュニティが占有する知識の偏りが新しいアイデアの提案を妨げている。提案手法は、論文を細かな概念ユニットに分解し、アイデア原子にクラスタリングすることで、補完的な研究方向を探る枠組みである。この方法では、整合性モデルと可用性モデルの二つを学習し、原子の組み合わせをランキングすることで、異質な方向の探索を実現する。実験の結果、提案サンプラーはLCMアイデア生成ベースラインを超える広い原子語彙を探索し、整合性を維持しつつも人間と同等またはそれ以上のアイデアを生成する。これにより、科学的妥当性とコミュニティの可用性を分離し、AI的なアイデア創出を通じて見落とされた方向性への探索を拡大する。 Comment
元ポスト:
既存のliteratureが斬新な研究アイデアを創発する際のバイアスとなる、といった切り口は興味深い。また、Recommender Systemsにおけるnovelty/serendipityのような話にも似ているように感じる。
- Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05
にて言及されているような現在のエージェントが、完全に新規なアイデアではなく既存の技術の積み重ねや組み合わせが得意というのも、このバイアスによって説明がつくように感じる。
あと、ふと以下のページを思い出した(なぜだろうか。serendipityがあるような研究タイトルがたくさんあったからかもしれない):
https://www.phontron.com/nlp-title/
[Paper Note] Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning, Benhao Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #LatentReasoning #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- 潜在状態を反復的に更新することで推論のスケーリングを実現するモデル(EqR)を提案。これにより、タスク特異の情報なしでテスト時のスケーリングが可能に。内部ダイナミクスを深さと広さで調整し、アトラクターへの収束を強化。シンプルなケースは少ない反復で収束し、難しいケースではスケーリングが有効。最終的には、精度がSudoku-Extremeで99%以上に向上。学習されたアトラクターの分布が反復的推論の理解に寄与することを示唆。 Comment
元ポスト:
関連:
- [Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05
本研究とモチベーションが非常に類似しているように感じる。
解説:
[Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SelfImprovement #PostTraining #Selected Papers/Blogs #Non-VerifiableRewards #WorldModels #reading #One-Line Notes #ContinualLearning #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- ECHOは、CLIエージェントのトレーニングにおいて環境のフィードバックを活用するハイブリッド目的関数を提案。標準的な政策勾配損失と、自己行動による環境観測トークン予測を組み合わせ、ロールアウトに既存の信号を密接な監督として利用する。これにより、TerminalBench-2.0でGRPOのpass@1を倍増させ、環境ダイナミクスの予測精度も向上させる。ECHOは専門家デモなしで、未知のOODタスクのポリシー改善を可能にすることを示している。 Comment
反響がすごそうに見える
- 通常のAgentのRLは環境からの応答に対してマスクをかけてしまい、エージェントが環境(本研究ではターミナル)にどう影響したかを示すground-truthのsignalであるにもかかわらず応答を切り捨ててしまう。
- 提案手法であるECHOはアクションと環境からの応答の双方で学習を行う。通常のaction tokenに対する損失はそのままに、ターミナル出力に対するシンプルなcross-entropy lossを追加する(環境からの応答はcontextに含まれ、モデル内を通過しているため追加のコストはかからない。)。
- このシンプルな修正によって、ベンチマークのスコアが改善し、特にTerminalBench-2.0のスコアはほぼ倍増した。これは言い換えると通常のRLと比較して2.3倍高速になっている。
- また、ターミナルの応答を学習したことでターミナルのダイナミクスをポリシーが学習し、held-out trajectoriesにおいて環境からの応答トークンのクロスエントロピーはECHOでは急激に低下するが、通常のGRPOではほとんどい変化しない。これは、ECHOがモデルに対してターミナルがどう応答するかを学習させていることを示唆する。
- エキスパートによる教師モデルを持たない場合でも、ECHOによってエキスパートによるdemonstrationでSFTを行った後のGRPOが達成するパフォーマンスにほぼ匹敵可能
- エキスパートのtrajectoryから模倣学習するSFTと比較して、ECHOではモデル自身がターミナルの応答を予測することで、ターミナルの応答のうち何が有用なのかを学習する。模倣からではなく、インタラクションを通じて優れた戦略を創発する。
- ECHOを使うことで、AI AgentはVerifierの報酬なしでも自己改善ができる。Verifierの報酬が一切なくても、ECHOはAI Agentが環境内で行動し、何が起こるかを予測するだけで、(GRPOなしで)さらに性能を向上させることができる。つまり、taskのpromptに対して、モデルに環境がどのような応答を返すか予測をさせ、observationに対するクロスエントロピーlossを計算し更新するだけで性能(in-distribution, OOD共に)が改善する。
環境が多くのシグナルを返してくれる場合はterminal以外の環境でもうまくいきそうな話で、非常にシンプルな変更で実現でき、かなりインパクトが大きく見える。
元ポスト:
prime-rlでサポートされたとのこと:
[Paper Note] Scaling Laws for Mixture Pretraining Under Data Constraints, Anastasiia Sedova+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Scaling Laws #DataMixture Issue Date: 2026-05-21 GPT Summary- 希少なターゲットデータを扱う際、汎用データとの混合は重要だがトレードオフを伴う。ターゲットデータが少なすぎると露出不足、逆に多すぎると過学習のリスクが高まる。2,000件以上の訓練データを用いた調査から、繰り返しが性能向上の鍵であり、適切な繰り返し回数はデータのサイズやモデルのスケールによることを発見した。また、繰り返しを考慮した混合スケーリング則を提案し、効果的な混合構成を体系的に計算する手法を提供した。 Comment
元ポスト:
汎用的なデータと少量しかないターゲットデータをMixする場合において、汎用的なデータは常に新しいトークンが供給される(ターゲットデータの過学習を防止する正則化の役割を果たす)状況で、ターゲットデータを繰り返し学習させら場合は:
> 希少なターゲットコーパスは15〜20回再利用可能で、最適な繰り返し回数はターゲットデータのサイズ、計算予算、モデルスケールに依存する。
ということらしい。
また、モデルサイズ、合計学習トークン、ターゲットデータのサイズ、混合比率、ターゲットデータの繰り返しの頻度、と、ターゲットドメインのlossの間のscaling lawsを導出したということらしい。
関連:
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23
[Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #NLP #LanguageModel #Architecture #Test-Time Scaling #read-later #Selected Papers/Blogs #Encoder-Decoder #LatentReasoning #RecursiveModels #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- 将来のニューラル推論システムにおける拡張計算の実装として、Generative Recursive reasoning Models (GRAM)を提案。GRAMは、再帰的潜在推論を確率的な複数の潜在軌道に変換し、条件付き推論や無条件生成を可能にする。これにより、従来の決定論的モデルよりも改善された性能を示し、構造化推論や制約充足タスクにおいて有効性を発揮。 Comment
pj page: https://ahn-ml.github.io/gram-website/
元ポスト:
先行研究:
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
- [Paper Note] Less is More: Recursive Reasoning with Tiny Networks, Alexia Jolicoeur-Martineau, arXiv'25, 2025.10
全然まだ理解できていないが、depth(iterative refinement)のみではなく、width(multiple parallel trajectories)方向にinference-time scaling可能なrecursiveなアーキテクチャの提案で、
LoopedTransformerのようなモデルはdeterministicな推論プロセスなため単一の軌跡に収束する(同じ入力に対して同じ出力をする)が、本研究では再帰的な推論プロセスにおいて、deterministicなhidden stateの推論に加えて、確率的でlearnableなguidance ε_t(ε_tの分散の大きさによって探索の度合いを変化させられる)をサンプリングして加えることで、多様なlatent trajectoryを生成可能にするで、自然なparallel inference-time scalingを可能にする
という感じだろうか。
[Paper Note] Targeted Neuron Modulation via Contrastive Pair Search, Sam Herring+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #Selected Papers/Blogs #Steering Issue Date: 2026-05-20 GPT Summary- CNAを用いて、有害なプロンプトを特定する活性化を持つニューロンの0.1%を抽出。これにより、拒否率を50%以上低減しながら、流暢さと非退化性を保持する。既存の識別構造をターゲット可能な拒否ゲートに変換することで、信頼性の高い行動誘導が可能であることを示した。 Comment
元ポスト:
追加のSAEの学習や重みの調整無しで、contrastiveなprompt pairから二つのsetの間で最もactivationが異なるMLP上位0.1%を分離することで、目的の挙動をsteeringする
[Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Transformer #LongContext #PositionalEncoding #read-later #Selected Papers/Blogs Issue Date: 2026-05-19 GPT Summary- RoPEの制約を分析し、文脈長の増加が局所性バイアスとトークン関連性の一貫性を損なうことを証明。アテンションスコアがランダム推測に近づく中、位置やトークンの識別が困難になることを明らかに。ハイパーパラメータ増加は識別能力を向上させるが、トレードオフが生じることも示唆。従来のアーキテクチャではこの制約を克服できず、将来のモデルには新たなメカニズムが必要とされる。 Comment
元ポスト:
これが真であればlong contextを扱う上での根本的なアーキテクチャ側の課題として非常に重要な知見
- Positional Encodingという仕組みにそもそもの限界があるのか、改善したらさらなるlong contextが扱えるのか
- Positional Encoding機構にそもそも原理上の限界があるなら、単一のモデルで超long contextの実現は非現実的になるので、複数のモデルやシステムの連携が必須になる
というような感想を抱いたが、果たして。実際複数モデルの連携という意味でいうとサブエージェントのを使ったら仕組みはすでに動いている。
所見:
[Paper Note] Efficient Pre-Training with Token Superposition, Bowen Peng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #read-later #Selected Papers/Blogs Issue Date: 2026-05-13 GPT Summary- Token-Superposition Training(TST)は、事前学習中のデータスループットをFLOPあたり改善する新しい手法である。TSTは、トークンを一つのバッグにまとめてマルチホットクロスエントロピーで訓練するスーパーポジションフェーズと、標準的な訓練に戻す復元フェーズから成る。270Mおよび600Mパラメータで広範に評価され、10B A1Bモデルで最大2.5倍の事前学習時間短縮を達成し、ベースラインを一貫して上回ることを示した。 Comment
元ポスト:
事前学習の序盤にbag of tokensを読み、bag of tokensを予測するシンプルな変更で、学習が最大2--3倍高速化される
所見:
解説:
所見:
[Paper Note] AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents, Zhengkang Guo+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #Generalization #LongHorizon #ToolUse Issue Date: 2026-05-13 GPT Summary- AgentEscapeBenchを導入し、LLMエージェントの新規ツール使用手順の推測・実行・修正能力を評価。脱出ゲーム形式のタスクは、依存グラフに基づいてエージェントが外部関数を呼び出し、隠れ状態や中間結果を追跡する。実験では、依存深さが増すほど性能が急低下し、成功率が難易度により大きく変動することを示した。これにより、現在のエージェントは局所的なツール使用には強いが、深い文脈依存には苦労していることが明らかに。AgentEscapeBenchは、エージェント能力の測定と今後の訓練への示唆を提供する。 Comment
元ポスト:
エージェントが慣れ親しんだ設定から離れて、脱出ゲーム風のベンチマークによって、未知のツールやアイテムを活用して環境と相互作用しながら文脈を理解し、最終的なanswerを答えるなければならない。
新たな環境での未知のツールに対する汎化性能を測るベンチマークであり、非常に興味深い。
下記研究のように、既存の知識への依存を減らして、実務能力を問うベンチマークとも言える:
- [Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
[Paper Note] DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents, Zhaorun Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Controllable #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Security #Environment #Author Thread-Post #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment
元ポスト:
Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
論文は279ページもある🤯
[Paper Note] Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models, Issa Sugiura+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Supervised-FineTuning (SFT) #Japanese #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 日本語のVQAシステムに対する高品質なデータセットJagleを紹介。約920万件のインスタンスを含み、異種ソースから生成したVQAペアを用いて多様なタスクをカバー。Jagleで学習した2.2Bモデルは、日本語タスクで高い性能を示し、既存のモデルを上回る結果を得た。さらに、JagleをFineVisionと統合することで英語でも性能向上が確認され、データセットとモデルを公開し再現性を促進。 Comment
pj page: https://speed1313.github.io/Jagle/
dataset: https://huggingface.co/datasets/llm-jp/Jagle
元ポスト:
データセットのサイズが9Mと非常に大規模で、日本語性能を大幅に改善するだけでなく、FineVisionのような英語のVQAデータセットとハイブリッドで用いることで英語タスクの性能も改善する。
[Paper Note] Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning, Qianjia Cheng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #PostTraining #reading #ToolUse Issue Date: 2026-05-11 GPT Summary- ツール統合推論(TIR)は、テキストのみの推論能力を超える思考モデルの拡張を提供しますが、ツール評価が逆に推論性能を低下させることも観察されています。本研究は、ツールを使用せずに推論能力を損なわずに強力な思考モデルに自然なツール使用を組み込む方法を提案し、TIRレシピの要点を示します。具体的には、教師の推論軌跡の学習可能性やツール使用軌跡の比率制御が重要であり、最適化手法がTIRの効果を最大化する可能性を示しています。最終的に、Qwen3モデルに適用することで、オープンソースベンチマークで最先端の成績を達成しました。 Comment
元ポスト:
Qwen3にcode executorを実行できるようにしても、数学のベンチマークにおいてほとんどツール呼び出しを行っていないにも関わらずスコアが劣化する。つまり、promptにツール呼び出しの情報を含めただけで、text-onlyでの推論能力が低下しロバストでない。さらに、ツール呼び出しを行ったとしてもテキスト空間上で推論を行った後にテキスト推論の結果をverificationする目的でcode executionを行うなど、ツールを用いて思考する能力が不足していることをイントロで指摘している。
適切なツール呼び出しを実施するために、既存研究では適切にツールを呼び出せるようにSFTやRLが行われるが、ツール呼び出しに関してpost-trainingを実施すると通常のtext-onlyでのreasoning能力が低下する課題があるとイントロで述べられている。Table 1に示されているようにツール呼び出しに関する情報をpromptに含めると、既存のOpenWeightモデル(Qwen3のみだが)はツールが有効なタスクであっても性能が向上しないことから、内部パラメータに埋め込まれている推論に関するlogicは簡単に壊れてしまうことを示唆しており、text-onlyでのreasoning能力を保ちつつ適切にtool useを実行できる手法が必要という課題があり、これを克服するための手法を提案しているようである。
問題意識は興味深いが、イントロの例にだけでは、Qwen3でのみ生じるのか、Qwen3に対するtool useのためのprompting手法が悪かっただけなのか、OpenWeightモデル全般のモデルパラメータ側の課題なのかが区別がつかず、どの程度インパクトのある話なのかがよくわからない。
個人的には、Table 1はより多くの学習レシピが公開されているモデルファミリーでの結果や、実際にtool useのためのSFT/RLを実施した場合に、text-onlyの推論能力が低下することが示されていてほしいと感じる。論文後半にそういったablationが出てくるのだろうか。
[Paper Note] HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness, Jianing Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #AgentSkills Issue Date: 2026-05-10 GPT Summary- HeavySkillは、複雑な推論タスクを解決するためのオーケストレーション・ハーネスの新たなアプローチを提案する。これは、重い思考をモデルの内在的スキルとして捉え、並列推論と要約を通じて機能する。系統的な実験により、HeavySkillは従来のBest-of-N戦略を上回り、特に強力なLLMは高い性能を示す。また、重い思考のスキルは強化学習によってさらに強化され、自己進化型LLMの発展につながる可能性がある。 Comment
元ポスト:
- [Paper Note] PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning, Jingcheng Hu+, arXiv'26, 2026.01
とぱっと見かなり近い手法に見えるが何が異なるだろうか。
[Paper Note] Recursive Agent Optimization, Apurva Gandhi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #Test-Time Scaling #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #RecursiveModels #Orchestration #Delegation #Author Thread-Post Issue Date: 2026-05-10 GPT Summary- 再帰エージェント最適化(RAO)を導入し、エージェントが自身のインスタンスを生成してサブタスクを委任できる強化学習アプローチを提案。推論時のスケーリングアルゴリズムを実装し、長い文脈への拡張と難しい問題への一般化を可能にする。この訓練により、効率が向上し、タスクのスケールや一般化能力が高まり、実時間の短縮が実現される。 Comment
元ポスト:
著者ポスト:
pj page: https://apga.github.io/RAO/
再帰的にAI Agentがサブタスクを委任する子エージェント(子エージェントは自身のコピー)を作成できるようにし、子エージェントがサブタスクを実施した際のRewardや子エージェントのタスクの成功率などの情報に基づいて親エージェントの報酬が決まるような報酬設計にする。再帰が深くなるにつれ、サブタスクは簡単になっていくため、エージェントは自然に学習するためのカリキュラムを構築していると捉えることができる。これにより、エージェントがタスクをサブタスクに分解し再帰的にinferenceをするような挙動をend-to-endで学習する。再帰の木構造の深さは、場合によっては特定の部分木が非常に深いものとなってしまうケースもあるため、深さの情報に基づいて重みづけを調整する。
という感じだろうか。
サブタスクを委任するポリシーが自分のコピーで、これにより自分自身を分解されたサブタスク上から得られる報酬と、適切な委任による報酬によって訓練することになるといううまい報酬設計がミソな気がする。
著者ポスト2:
[Paper Note] SkillClaw: Let Skills Evolve Collectively with Agentic Evolver, Ziyu Ma+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #AgentSkills Issue Date: 2026-05-10 GPT Summary- SkillClawは、複数のユーザーのエージェントエコシステムにおけるスキルの進化を可能にするフレームワークである。ユーザー間の相互作用を勘案し、スキル改善の信号を集約して自律的に更新を行う。行動パターンを識別し、スキルセットの更新を行うことで、ユーザー間で改善が共有され、知識伝達が促進される。実験において、限られた対話でも性能向上が確認された。 Comment
元ポスト:
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
- [Paper Note] SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization, Zhengxi Lu+, arXiv'26, 2026.04
- [Paper Note] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild, Peng Xia+, arXiv'26, 2026.03
などはRLを通じてスキルを獲得、あるいは内部化するが、本研究はAgent Evolverと呼ばれるエージェントによって、現在のスキルとtrajectoryの集合から成功/失敗を分析し、ポリシーの重みの更新なしで動的にスキルの定義を更新する枠組みという点で異なる、という感じだろうか。
[Paper Note] Modular Memory is the Key to Continual Learning Agents, Vaggelis Dorovatas+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Architecture #read-later #Selected Papers/Blogs #ContinualLearning Issue Date: 2026-05-09 GPT Summary- 基盤モデルは機械学習を変革したが、継続的な運用や個人化に課題がある。インウェイト学習(IWL)による破局的忘却を克服するために、文脈内学習(ICL)の迅速な適応能力とIWLの安定した更新能力を組み合わせたモジュール型メモリアーキテクチャのフレームワークを提案。継続的学習のためのロードマップを示す。 Comment
元ポスト:
元ポスト参照のこと。現在のAIには認知コア的なものが必要という提言を超えた、全体アーキテクチャとそれぞれの課題についての議論である。
[Paper Note] MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks, Zixuan Ke+, ICML'26, 2026.01
Paper/Blog Link My Issue
#Multi #NLP #Dataset #LanguageModel #AIAgents #Evaluation #ICML #read-later #Selected Papers/Blogs #Orchestration #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- MASのオーケストレーションを強化学習形式で定式化するMASOrchestraを提案。これにより、エージェントの複雑性を管理し、システム全体のグローバルな推論を促進。タスクを5軸で分析するMASBENCHを導入し、利得がタスクや能力に依存することを示す。公開ベンチマークで一貫した改善を達成し、10倍以上の効率を実現。MASOrchestraとMASBENCHはマルチエージェント知性の向上を目指す。 Comment
元ポスト:
SASと比べてMASにすることでどれだけ利点があるかをモデルが理解せずにfoldingしてるよね、というのは重要な指摘に感じる。
[Paper Note] ProgramBench: Can Language Models Rebuild Programs From Scratch?, John Yang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-05-09 GPT Summary- ソフトウェアプロジェクトの完全な開発は、言語モデルの重要なユースケースで、エージェントは最小限の監視下でコードベースを成長させる。しかし、既存のベンチマークは限られたタスクに焦点を絞っている。そこで、ProgramBenchを導入し、エージェントが与えられたプログラムとそのドキュメントに基づいて、参照実行可能ファイルに一致するコードベースを設計・実装する能力を測定する。200のタスクを用い9つの言語モデルを評価した結果、どのモデルも未完のタスクが多く、人間が書いたコードとは異なる実装を好む傾向が見られた。 Comment
pj page: https://programbench.com/
元ポスト:
実行可能なバイナリとdocumentationを与えたときに、インターネットアクセスが不可能な環境で、オリジナルのプログラムの挙動を再現可能なcodebaseを実装するベンチマークで、現状いずれのLLMもスコア0%とのこと。スコアは全タスクのうち、(タスクごとに定義される)テストを全て通過したタスクの割合である。Almostの場合は95%以上のテストを通過したタスクの割合である。
仕様全体からcodebase全体を再現する必要がため、これがうまくできれば、これまでのベンチマークよりも人間に近い推論・認知能力を持つと部分的に主張できるとは思われる。
contaminationの懸念について、本ベンチマークではopen-sourceのコードを異なる言語で実装するようにすることで検証している。異なる言語で実装することによってモデルが通過するようになったテストの割合は大きく変化しなかったため(leaderboardのスコア異なる点に注意。leaderboardのresolvedは全てのテストを通過したタスクの割合である。)、memorizationの影響は小さいと主張している。また、本ベンチマークはインターネットアクセスが不可能な状態で実施されるが、インターネットアクセスを許可した場合、モデルはcheatingを実施するようになり、多くのcheatingはソースコードをlookupすることだったとのこと。
テストはbehavioralなものであり、SWE-Benchで行われているような実装の方法についてはテストをしない。
ProgramBenchの言語の分布と、各タスクのcodebaseの規模間。270M lineのcodebaseから200 line程度の小さなものまで、規模間が大きく異なることがわかる。言語はC/C++, Go, Rustが多く、多くのモデルが得意とするであろうpythonはほとんど含まれていない。
著者ポスト:
[Paper Note] Scaling Test-Time Compute for Agentic Coding, Joongwon Kim+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #read-later #Selected Papers/Blogs #Compression #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- 長期的なホライゾンを持つコーディングエージェントに対する推論時スケーリングの新しいフレームワークを提案。各試行の重要な要素を保持しつつ、詳細を要約することで、経験を効果的に再利用。提案手法は並列スケーリングと逐次スケーリングを実現し、エージェントの性能を一貫して向上させる。SWE-Bench VerifiedおよびTerminal-Bench v2.0での実験で、明確な改善が確認された。 Comment
元ポスト:
Software Engineering Agentにおけるtest-time scaling手法の提案で、生の実行ログをそのままスケールさせるとノイズが多すぎて効率が悪いので、trajectoryを圧縮することで対処するという話のようである。
著者ポスト:
[Paper Note] Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark, Kai Zou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #ACL #VisionLanguageModel #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- Uni-MMMUを提案し、視覚的理解と生成の統合を推進するための新しいベンチマークを構築。科学、プログラミング、数学、パズルなどの推論中心ドメインにおいて、生成と理解の相乗効果を評価。モデルは概念的理解を視覚合成に、生成を分析的推論に活用するタスクに挑む。再現可能な評価プロトコルを導入し、モデル間の性能差と依存性を明らかにし、統合モデルの進展に貢献。 Comment
pj page: https://vchitect.github.io/Uni-MMMU-Project/
元ポスト:
processとresultの両面を評価できるのが特徴のように見える
[Paper Note] The Last Human-Written Paper: Agent-Native Research Artifacts, Jiachen Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science Issue Date: 2026-05-08 GPT Summary- 科学論文の線形化に伴うストーリーテリング税とエンジニアリング税がAIエージェントの理解と再現に致命的な影響を与えることが課題である。本研究では、機械実行可能な「Agent-Native Research Artifact(ARA)」を提案し、科学的ロジック、実行可能コード、探索グラフ、証拠基盤の四層構造を持つ。ARAはライブ・リサーチ・マネージャー、ARAコンパイラ、ARAネイティブ・レビュシステムを通じて、研究過程を最適化し、精度を大幅に向上させることを示した。具体的には、PaperBenchとRE-Benchで質問応答の正確性を72.4%から93.7%へ、再現性成功率を57.4%から64.4%に向上させる結果を得た。 Comment
pj page: https://www.orchestra-research.com/ara
元ポスト:
研究プロセスでは様々な試行錯誤が実施されるが、試行錯誤による結果は論文中に記載されず、実際に記述されるのは成功したストーリーのみある。また論文中の情報が信用に足るに十分な情報を含まない、あるいは再現をするのに十分な情報を含まない場合がある(ハイパーパラメータの設定はslackのスレッドや、著者の脳内にあるなど)。そういった問題を解決するために、様々な研究過程を追跡し記録しArtifactを生成するLive Research Managerを提案し、論文をPDF Paperの形式ではなく、ARAと呼ばれるパッケージにして研究成果を公表しようよ、という話に見える。
[Paper Note] Heterogeneous Scientific Foundation Model Collaboration, Zihao Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #MultiModal #FoundationModel #ScientificDiscovery #Science Issue Date: 2026-05-08 GPT Summary- 異種エージェント系フレームワークEywaを提案し、言語中心のLLMシステムを領域特化型基盤モデルと結合。これにより、専門データを活用した高次の推論と意思決定が可能に。Eywaは単一エージェントの置換やマルチエージェントシステムへの組み込みに対応し、複雑なタスクを効率的に解決。物理学・生命科学・社会科学の分野での実験では、Eywaがパフォーマンスを向上させ、言語推論への依存を低減することが示された。 Comment
pj page: https://www.zihao.website/eywa.github.io/
LLMと個々のモダリティにおけるfoundation modelをテキストによる入力を超えたmodality-nativeなinputを実現し、text空間でreasoningさせることで協調させるといった話に見える。
元ポスト:
[Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #ComputerVision #NLP #LanguageModel #AIAgents #VisionLanguageModel #WorldModels #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- AIシステムの目標達成能力の向上には、環境のダイナミクスをモデル化することが必要不可欠である。この研究では、能力レベル(L1からL3)と支配法則(物理、デジタル、社会、科学)を軸にした「levels x laws」分類法を導入し、400件以上の研究を統合して、AIの世界モデルの制約と失敗モードを示す。提案する評価原則と最小再現可能なパッケージがアーキテクチャの指針を提供し、分断されたコミュニティの統合を目指す。最終的には、より予測可能で再構築可能な環境モデルへと進む道筋を示す。 Comment
pj page: https://agentic-world-modeling.xyz/
元ポスト:
著者ポスト:
分野ごとに意味が異なるWorld Modelsを統合的に分類できる枠組みを提案しているSurveyで、Levels * Laws のtaxonomyで分類する。Levelsとはどのような能力を持つか、
- L1: L1 Predictor, 1ステップの予測
- L2: L2 Simulator, 複数ステップのシミュレーション/反実仮想のロールアウト
- L3: L3 Evolver, 失敗からの進化
LawsはWorld Modelsがどのような制約に従わなければならないかという視点で
- Physical: 物理法則
- Digital: program semantics
- Social: 社会規範
- Scientific: scientific mechanism
によって構成される、といった話が著者ポストに記述されている。論文を見ると、個々のtaxonomyについては、より多様な観点を含むようである。
[Paper Note] Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection, Sijie Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ExperimentManagement #Scaling Laws Issue Date: 2026-04-27 GPT Summary- スケーリング則の適合は高コストであり、予算を意識した逐次的実験設計として定式化。異なるコストの実験から、外挿精度を最大化する実験を選択。提案手法は古典的ベースラインを上回り、総予算の約10%で高い適合性能を達成。コードは公開中。 Comment
元ポスト:
scaling laws導出のための実験をより省コストとなるようデザインする手法
[Paper Note] LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model, Inclusion AI+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Chain-of-Thought #MultiModal #DiffusionModel #TextToImageGeneration #Reasoning #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #VisionLanguageModel #Editing #UMM #ImageSynthesis #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- LLaDA2.0-Uniは、マルチモーダルな理解と生成を統合するための統一型離散拡散大規模言語モデルです。意味論的な離散トークナイザとMoEベースのバックボーン、拡散デコーダを組み合わせ、視覚入力を効率的に処理します。高忠実度の画像生成を実現し、推論効率を最適化する独自の手法を採用。特化型VLMに匹敵する性能を持ち、生成と推論の相互運用性で次世代モデルの可能性を広げます。コードは公開されています。 Comment
元ポスト:
VLM * Diffusionモデル。テキストの生成だけでなく、TextToImage, Image Editingもサポートされているように見える。
公式ポスト:
画像を生成する前にreasoningを実施するように訓練され、UMMなのでtext, patchのrepresentationがシームレスに統合され、画像を伴うテキスト生成がより一貫性を持つ、とのこと。
著者ポスト:
[Paper Note] TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification, Adam Rida, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Distillation Issue Date: 2026-04-25 GPT Summary- LLM分類に基づく訓練データセットを生成し、軽量な代理モデルによって低コストでトラフィックを処理することを提案。TRACERは代理モデルを本番トレースで訓練し、信頼性に応じてデプロイを管理。透明性を持たせるために、入力領域の処理やデプロイ拒否の理由を解釈可能な形で示す。77クラスのベンチマークでは83-100%のカバレッジを達成し、自然言語推論タスクでは正しくデプロイを拒否。システムはオープンソースとして提供。 Comment
元ポスト:
LLMにリクエストされる分類問題タスクのinputとLLM(教師モデル)を収集しておき、低コストで推論可能な代理モデルを学習。リクエストごとに、LLM/代理モデルどちらを利用して推論するかをRoutingし、低コストで分類タスクを解けるようにする、という話に見える。
[Paper Note] Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL, Zhaofeng Wu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #TransferLearning #PostTraining #LowResource #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 低リソースのプログラミング言語(PL)における言語モデルの性能は、訓練データの制約を受ける。本研究では、ゼロショットの跨プログラミング言語転移タスクを提案し、Llama-3.1がPL間でのコード生成において改善されないことを明らかにした。これに対処するため、一般化可能なSFT初期化が必要とし、「並列プログラム」を使用したSFT戦略Parallel-SFTを導入。Parallel-SFTによって転移性が向上し、RL実行後に未知のPLへの一般化が改善されることを示した。モデルの内部表現分析は、PL間での同等プログラムが密にクラスタ化され、これが転移性向上に寄与することを示唆している。 Comment
元ポスト:
RL前にプログラミング言語でのパラレルコーパスでSFTすることで、特定言語でRLをした場合でも他言語にも性能が転移する、という話に見える。
著者ポスト:
[Paper Note] AI scientists produce results without reasoning scientifically, Martiño Ríos-García+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs Issue Date: 2026-04-25 GPT Summary- LLMベースの科学的エージェントの評価を行い、推論の認識論的規範に従っているかを分析。25,000件以上の実行から、基本モデルが性能の主要因であることを確認し、スキャフォールドの寄与はわずか1.5%に過ぎない。証拠の68%が無視され、信念修正は26%の頻度で発生。全体を通じて、エージェントはワークフローや仮説探究で一貫した推論パターンを示すが、科学的推論における認識論的パターンは欠如。これらの欠陥は成果だけでは検出できず、スキャフォールド設計では修復できないため、推論そのものが訓練目標として必要。 Comment
元ポスト:
大規模な実験によって現在のScientific DisaoveryにおけるAI Agentの課題を明確にしており、重要研究に見える。
[Paper Note] Transformers are Inherently Succinct, Pascal Bergsträßer+, ICLR'26 Outstanding Paper, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Transformer #Architecture #Memorization #reading #Reference Collection Issue Date: 2026-04-25 GPT Summary- トランスフォーマーの表現力を測る指標として、簡潔さを提案し、有限オートマトンや線形時間論理(LTL)式よりも高度に形式言語を表現できることを証明。さらに、トランスフォーマーの性質の検証が理論的に困難であること(EXPSPACE 完全)を示した。 Comment
openreview: https://openreview.net/forum?id=Yxz92UuPLQ
元ポスト:
succinctnessの提案。あるパターンを表現するのに、RNN(SSM)や有限オートマトンなどと比較してtransformerは指数関数的に少ないパラメータ数で(理論上は)表現できることが数学的に示されているらしい。
つまりLinear Attentionをベースにしたモデルは計算効率やメモリ消費量では有利だが、表現力を犠牲にしている、ということが示された形になりそうである。
しかし1パラメータあたりに圧縮可能なコンセプトが増えれば増えるほどmemorizationの傾向が強くなり、汎化性能が失われるという見方もできる気がするので、この辺を踏まえると一概にsuccinctnessが高ければ良いというのも成り立たない気もする。
解説:
所見:
[Paper Note] Neural Garbage Collection: Learning to Forget while Learning to Reason, Michael Y. Li+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #Selected Papers/Blogs #KV Cache #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 連鎖的推論ではKVキャッシュの拡大がボトルネックとなっており、従来の手法は手作業で管理されている。よりスケーラブルな「Neural Garbage Collection(NGC)」を提案し、言語モデルが推論と同時に忘れることを学ぶ。モデルは推論中にキャッシュエントリの追い出しを決定し、これを強化学習で最適化。成果ベースのタスク報酬を用いて学習することで、高い精度を保ちながらキャッシュサイズを圧縮し、エンドツーエンドの最適化がモデルの能力を向上させる可能性を示した。 Comment
元ポスト:
LLMにReasoningとKV Cacheのマネジメントを同時に学習させる。
ポイント解説:
[Paper Note] SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving, Jinda Jia+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #Quantization #LLMServing #KV Cache #Compression Issue Date: 2026-04-22 GPT Summary- KVキャッシュメモリは、レイテンシーに敏感な小規模バッチと高スループットワークロードの同時サポートにおけるボトルネックとなっている。多くの圧縮手法は実用的な制約に違反し、デプロイメント時の有効性を制限している。本研究では、最小限の4ビット量子化手法を特定し、INT4量子化とブロック対角Hadamard回転の組み合わせが最良のトレードオフを実現することを発見した。実装により、エンドツーエンドのオーバーヘッドを抑え、INT4スループットに匹敵する性能を達成。結果として、KVキャッシュ圧縮はシステム共設計の問題であり、軽量な手法が実用的な精度を提供することを示した。 Comment
元ポスト:
github:
https://github.com/togethercomputer/saw-int4
以下のRequirementsがある
- MHA modelsのみをサポートしており、MLA、あるいはMHA以外のアーキテクチャはサポートされていない
- 実装かれていないだけなのか、理論的に無理なのかは区別がついていない
- Prefill backend: fa3
- Decode backend: triton
解説:
[Paper Note] String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation, Kou Misaki+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Prompting #Bias #ICLR #Test-Time Scaling #Diversity #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-04-21 GPT Summary- String Seed of Thought(SSoT)という新しいプロンプティング手法を提案し、Probabilistic Instruction Following(PIF)のパフォーマンスを改善します。PIFは選択肢を確率に基づいて選ぶタスクですが、LLMはしばしば非決定論的な挙動が要求される場面で偏りを生じることがあります。SSoTは、まずLLMにランダムな文字列を生成させ、これを操作することで多様性を維持しつつ制約を遵守した答えを導く手法です。実験により、SSoTがPIFの改善に寄与し、応答の多様性を高めることを示しました。 Comment
openreview: https://openreview.net/forum?id=luXtbX1lVK
元ポスト:
LLMが内包するバイアスを抑制し、出力の多様性を高めるPrompting手法っぽい。興味深い。
ランダムな文字列を生成させてから、その文字列を操作させて出力を得るようなアプローチとのこと。
著者ポスト:
-
-
[Paper Note] GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents, Mingyu Ouyang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #Evaluation #MultiModal #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Game #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment
元ポスト:
Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは
という感想を持っているからである。
pj page: https://gameworld-project.github.io/
[Paper Note] $π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities, Physical Intelligence+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Generalization #Robotics #VisionLanguageActionModel #EmbodiedAI #EmergentAbilities #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- ロボット基盤モデルπ_{0.7}は、未知の環境で多様な言語指示に従う能力を持ち、幅広い台所家電の多段階タスクに対応。ゼロショット一般化を実現し、初期設定のままで高い性能を発揮。多様な文脈条件付けを用いて、タスクの実行方法を示すマルチモーダル情報を活用。実験では、複数のロボットプラットフォームで速度や言語追従、タスク一般化を評価し、強化学習モデルに匹敵する性能を示した。 Comment
元ポスト:
関連:
- Emergence of Human to Robot Transfer in VLAs, Physical Intelligence (π), 2025.12
以下はブログを斜め読みして感じた所感
新たなロボットが服を畳めたり(当該ロボットの服をたたむ学習データなしで)、新たなキッチン家電を(口頭でのcoachingに基づいて)使いこなす、といった汎化性能をVLAが獲得したという話に見える
関係者によるポスト:
新たなキッチン家電はノンフライヤーであり、実際に学習データの異なるロボットがフライヤーを開け閉めするエピソードからスキルを学習したことを突き止め、習得したスキルと知識の組み合わせによって、VLAの分野でも汎化が実現され、かつworld modelでロボットが到達すべきサブゴールを生成し条件付けすることが機能することを学んだといった話が書かれている。
日本語解説:
https://www.docswell.com/s/DeepLearning2023/Z27ME6-2026-04-24-135712
上記解説を見るとpreprintもあったようなので、最初のissueに追記した
[Paper Note] Geometric Context Transformer for Streaming 3D Reconstruction, Lin-Zhuo Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #LongContext #3D Reconstruction #3D (Scene) #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- ストリーミング3D再構成は、ビデオから3D情報を復元する技術で、精度や効率が求められる。LingBot-Mapは、SLAMの原理に基づいたフォワード型の3D基盤モデルで、幾何学的文脈トランスフォーマーを使用している。特徴的な注意機構は、アンカー文脈や軌跡メモリを活用し、長距離ドリフト補正を実現。これにより、長いシーケンスでも安定した推論が可能となり、従来手法に対して優れた性能を示した。 Comment
元ポスト:
pj page: https://huggingface.co/robbyant/lingbot-map
高速でlong contextでもstreaming形式で生成が可能な3D Reconstructionモデルのようである
[Paper Note] Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering, Xinyu Zhu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #memory #Hierarchical #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- エージェント型科学における超長期自律性の課題に対し、ML-Master 2.0という自律エージェントを提案。階層型認知キャッシュ(HCC)を導入し、瞬時の実行と長期的戦略を切り離して一貫性を持たせる。評価では、最先端のメダル獲得率56.44%を達成し、AIの自律的探索の可能性を示唆。 Comment
元ポスト:
contextを
- experience (short-term)
- knowledge (mid-term)
- wisdom (long-term)
の3つの階層に分類し管理するmemory機構を提案しているようである。
階層ごとに異なる記憶容量とアクセス速度で実装し、必要に応じて階層間でデータが昇格(experience->knowledge等)、あるいは削除される、といった機構によってmemory cacheを管理するような手法のようである。
MLE-BenchでSoTA
[Paper Note] Generative Refinement Networks for Visual Synthesis, Jian Han+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #read-later #ImageSynthesis Issue Date: 2026-04-17 GPT Summary- 自己回帰モデルの課題に対処するため、Generative Refinement Networks(GRN)を提案。GRNは階層的2値量子化によるボトルネックを解消し、AR生成を「人間の画家」による作品の完成に似たプロセスで向上させる。エントロピー誘導型サンプリング戦略を取り入れ、複雑さに応じた適応的ステップ生成を実現した。ImageNetベンチマークで新記録を達成し、テキストから画像・動画生成へと性能を拡張。全てのモデルとコードは公開済み。 Comment
元ポスト:
予測されたトークンを削除・更新し洗練することが可能な新たなアーキテクチャらしい
[Paper Note] Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation, Zunhai Su+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #NLP #Transformer #AttentionSinks Issue Date: 2026-04-17 GPT Summary- トランスフォーマーの常用される「Attention Sink(AS)」という課題に関する初の総説を提供。ASは過剰な注意集中により解釈可能性や推論に影響を与え、幻覚問題を悪化させる。研究は、基礎的活用、機構的解釈、戦略的緩和という三つの次元を軸にASを体系的に整理し、分野の進化を導く重要なリソースとして位置づける。 Comment
pj page: https://github.com/ZunhaiSu/Awesome-Attention-Sink
元ポスト:
Attention Sinkは
- [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
によって提言されたと思っていたのだが、時系列グラフをみると2023年1月時点で既に先行研究がありそうである。文献数は線形に増えている。
Initial FocusとしてAttention Sinksの活用方法が模索され、上記 [Paper Note] Efficient Streaming Language Models with Attention Sinks, Guangxuan Xiao+, ICLR'24
だけでなく以下のような研究も代表例として挙げられている。
- [Paper Note] KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization, Coleman Hooper+, arXiv'24, 2024.01
- [Paper Note] Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration, Zhongzhi Yu+, arXiv'24, 2024.06
[Paper Note] The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook, Xinlei Yu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #LatentReasoning #Reference Collection Issue Date: 2026-04-17 GPT Summary- 潜在空間は言語モデルにおいて重要な役割を果たし、多くのプロセスが連続的な潜在空間で自然に行われることが示されている。本調査は、潜在空間の基盤、進化、機構、能力、展望を整理し、それを他の空間や視覚モデルと明確に区別する。特に、アーキテクチャや最適化を含む四つの主要な発展線を特定し、推論や知覚など多様な能力を支える潜在空間の役割を論じる。未解決課題と今後の研究方向も示し、次世代知能のパラダイムを理解するための基盤を提供することを期待している。 Comment
latent reasoningに関する最新survey
Taxonomyがしっかりしているのが非常に良さそうである。たとえばCOCONUT(Representation/Reasoning)、Looped Transformer (Architecture, Reasoning), VJ-JEPA (Architecture/Perception)を見るとそれぞれ異なるセルに配置されている。手法ごとの表を見ると年号だけでなく、”日付”別で整理され時系列かされている。あと毎回Surveyみて思うが、多すぎである。。。
- [Paper Note] Training Large Language Models to Reason in a Continuous Latent Space, Shibo Hao+, COLM'25
- (Looped Transformerの例) [Paper Note] Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs, Ziyue Li+, arXiv'25
- [Paper Note] VL-JEPA: Joint Embedding Predictive Architecture for Vision-language, Delong Chen+, arXiv'25, 2025.12
元ポスト:
[Paper Note] Process Reward Agents for Steering Knowledge-Intensive Reasoning, Jiwoong Sohn+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #Chain-of-Thought #Reasoning #PRM #FactualKnowledge Issue Date: 2026-04-17 GPT Summary- PRAは、凍結済みポリシーに対するオンラインかつ段階的な報酬を提供することで、推論プロセスを改善。検索ベースのデコードにより、生成ステップごとに候補をランキングし、剪定する。医療推論ベンチマークで一貫して高い性能を示し、未見のポリシーモデルに対しても精度を最大25.7%向上させる。PRAはドメイン固有の報酬モジュールを通じて、複雑なドメインで再訓練なしに新たなバックボーンを展開可能にする。 Comment
pj page: https://process-reward-agents.github.io/
元ポスト:
Reasoning中に独立したProcess Reward Agent (PRA) によって外部知識からevidenceを検索しreasoning stepに対してrewardを与えることで、reasoning step単位のrewardを実現し、これによりknowledge-intensiveなドメインに対してより頑健な推論が可能になる、という感じだろうか。medical domainで評価しており、self-consistency+RAGなどの手法を上回っているように見える(が、Fair Comparisonになっているだろうか、という点が少し気になる)。あとは、汎用的な手法だと思われるので、medicalドメインだけでなく他のknowledge-intentiveなドメインでの評価もあるとなお良さそうに感じる。
[Paper Note] FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios, Xiangru Jian+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#read-later #Selected Papers/Blogs Issue Date: 2026-04-17 GPT Summary- 製造業はMLLMを活用して自律的な実行に移行中だが、現行の評価は実際の要求を反映していない。データ不足と細粒度の情報欠如が課題であるため、FORGEを提案。現実の2D画像と3D点群を用いた高品質なマルチモーダルデータセットを構築し、3つの製造タスクにおける18件のMLLMを評価。ボトルネックは視覚的根拠ではなく、ドメイン知識不足と分析し、今後の研究方向を示唆している。監視付き微調整により、3Bパラメータモデルが未知の製造シナリオで最大90.8%の精度改善を示し、ドメイン適応型製造MLLMへの道筋を示す。データは公開中。 Comment
pj page: https://ai4manufacturing.github.io/forge-web/
元ポスト:
特定ドメイン(製造業)を精緻に評価できる大規模データセットを提案し、広範なモデルでの実験の元新たな知見が明らかになっているように見え、重要研究に見える。
[Paper Note] WildDet3D: Scaling Promptable 3D Detection in the Wild, Weikai Huang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #Dataset #Transformer #Prompting #Architecture #read-later #Selected Papers/Blogs #3D (Scene) #ObjectDetection #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- 単一画像から3D物体を検出するために、WildDet3Dという統一的幾何認識アーキテクチャを提案。テキスト・点・ボックスのプロンプトを受け入れ、深度信号を組み込む。新しいオープン3DデータセットWildDet3D-Dataを生成し、13,500カテゴリの100万枚以上の画像を提供。複数のベンチマークで最先端の性能を達成し、特に深度手掛かりの活用により、平均+20.7 APの向上を実現。 Comment
pj page: https://allenai.github.io/WildDet3D/
元ポスト:
最大級の3D detection data+アーキテクチャの提案
training codeなどがリリース:
https://github.com/allenai/WildDet3D
[Paper Note] Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima, Huanran Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Optimizer #read-later #Selected Papers/Blogs #Generalization #DownstreamTasks Issue Date: 2026-04-17 GPT Summary- 大規模言語モデル(LLMs)の事前学習において、幾何学的問題を調査し、タスク固有のミニマの位置が下流の一般化に影響することを提案。勾配の類似性を最大化するNexus optimizerを導入し、パラメータサイズやデータに応じた実験で、下流パフォーマンスの向上を示した。特に3Bモデルでは、分布外データでの損失を低減し、複雑な推論タスクで精度を最大15.0%向上させる結果を得た。これは、事前学習損失以外の評価指標の重要性を示唆している。 Comment
元ポスト:
ポイント解説:
モデルを更新する際に平均的に性能が良くなる方向ではなく、全ての異なるデータにおいて性能が改善する方向性で更新すると性能が改善するという感じだろうか。興味深い
[Paper Note] Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks, Yoonsang Lee+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Test-Time Scaling #LongHorizon #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- エージェント的タスクに対する並列テスト時スケーリングの研究を行い、集約エージェントAggAgentを提案。複数のロールアウトを生成し、軌跡の情報を効果的に統合しながら、出力のオープンエンド性に対応。AggAgentは6つのベンチマークと3つのモデルファミリーで既存手法を上回り、改善を達成しつつ、オーバーヘッドを最小限に抑えた。これにより、エージェント的集約の効率性が確認された。 Comment
元ポスト:
Parallel test time scalingをじっしするlong horizon AI Agentの複数のtrajectoryを集約する手法のようである
[Paper Note] Parcae: Scaling Laws For Stable Looped Language Models, Hayden Prairie+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #Stability #LatentReasoning #RecurrentModels #RecursiveModels Issue Date: 2026-04-16 GPT Summary- ループ型アーキテクチャの訓練の不安定性を克服するため、動的システムとして再定式化し、注入パラメータのスペクトルノルムを制約する新しいアーキテクチャParcaeを提案。Parcaeは従来モデルより低いパープレキシティを達成し、FLOPsのスケーリング特性を調査。訓練時に固定パラメータでのFLOPs増加法則を導出し、推論時には計算量のスケーリングを実現。2.99ポイントと1.18ポイントの品質改善を報告。 Comment
blog: https://sandyresearch.github.io/parcae/
元ポスト:
学習がより安定するような工夫を加えたlooped transformerのようである
所見:
[Paper Note] LLM-as-a-Verifier: A General-Purpose Verification Framework, Jacky Kwok+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #Selected Papers/Blogs #Verification #Author Thread-Post Issue Date: 2026-04-16 GPT Summary- LLMの能力向上に検証を新たなスケーリング軸として適用する方法を提案。LLM-as-a-Verifierフレームワークにより、細粒度のフィードバックを提供し、連続的なスコア生成を実現。これにより、正例と負例の解の分離が向上し、追加的な検証精度が得られる。提案手法は複数のベンチマークで最先端の性能を示し、タスク進行の推定にも寄与。さらに、RLに対しても高効率なフィードバックを提供。 Comment
元ポスト:
著者ポスト:
著者ポスト2:
Verification性能をtest-timeに向上させるためのテクニック
アイデアの一つにGEvalっぽいアイデアも含まれている。
続報:
[Paper Note] Memory Intelligence Agent, Jingyang Qiao+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #MultiModal #ContrastiveLearning #VisionLanguageModel #DeepResearch #memory #reading #Test-time Learning/Adaptation #needs-revision Issue Date: 2026-04-14 GPT Summary- DRAはLLMの推論と外部ツールを組み合わせ、過去の経験を活用するメモリシステムを含む。従来の方法はメモリの効率性に課題があり、MIAフレームワークを提案してこれを解決。プランナーとエグゼキューターから成る新しいアーキテクチャは、交互の強化学習で協調を強化し、推論中の更新を実現。さらに、記憶の双方向変換を可能にし、自己進化を促進する機構も搭載。広範な実験でMIAの優位性を示した。 Comment
元ポスト:
元ポストを読みなんとなーく分かったつとりになっているゆるふわ理解だが、Plannerのパラメータに経験をTest Time Learningの枠組みを埋め込み、既存のノンパラメトリックなメモリにtrajectoryも活用する二段構えである点が新しい点に感じた。
元論文を流し読みすると、Executor(vlm), Planner(llm, parametricなmemory), Memory Manager(trajectoryを格納; non parametricなmemory)の3つにマルチモーダルなAI Agentを分離する。
plannerは(ToDo 3.2節を読むべし
executorはplannerと過去のtrajectoryに基づいて実行をする。executorはGRPOに」るRLVRで訓練されるが、tool use, plannerのトークンはマスクされ学習される。
(後ほど追記
[Paper Note] Introspective Diffusion Language Models, Yifan Yu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel Issue Date: 2026-04-14 GPT Summary- 内省的受容率を定義し、拡散型言語モデル(DLM)の品質向上を目指す。新たに提案されたIntrospective Diffusion Language Model(I-DLM)は、ARトレーニングの内省的一貫性を保ちながら並列デコードを実現する。I-DLMは新しい内省的ストライドデコード(ISD)アルゴリズムを使用し、静的バッチスケジューラで最適化。従来のDLMを上回り、AIME-24で69.6、LiveCodeBench-v6で45.7の性能を達成。これにより、スループットが3倍向上し、大規模サービスへの対応力も強化。 Comment
元ポスト:
github: https://github.com/Introspective-Diffusion/I-DLM
8B級のスケールでARモデルと15種類のベンチマークで同等程度の性能を達成し、large batchsizeでスループットが3.8倍のdLMとのこと。
[Paper Note] JaWildText: 日本語文字認識性能評価のための 実世界画像データセット, 前田+, NLP'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #Japanese #Selected Papers/Blogs #VisionLanguageModel #OCR #Author Thread-Post Issue Date: 2026-04-14 Comment
元ポスト:
OCRは非常に重要なタスクであり、特に日本語OCR向けのwildなデータセットは、日本側が主体的に作らないとグローバル側では作成されない気がしており、非常に重要な研究と感じる。実際、現行のSLMのSoTAモデル群ではうまくいかないようだ。
Sarashinaは日本語のOCR向けにプロプライエタリなデータセットを作成して学習されていると記憶しており、それでもなおQwen3-VLの方がベンチマークスコアが高いのは意外だった。
関連:
- Sarashina2.2-Vision-3B: コンパクトかつ性能が高いVLMの公開, SB Intuitions, 2025.11
- sarashina2-vision-{8b, 14b}, SB Intuitions, 2025.03
[Paper Note] Learning is Forgetting: LLM Training As Lossy Compression, Henry C. Conklin+, ICLR'26, 2026.04
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #LanguageModel #ICLR #read-later Issue Date: 2026-04-11 GPT Summary- LLMの表現空間の構造は未解明であり、学習の解釈に制限がある。研究では、LLMsを損失のある圧縮として捉え、訓練過程で目的に関連する情報のみを保持すると主張。モデルの事前訓練結果から圧縮の最適性を示し、異なるモデル間の性能が訓練データとレシピの違いによることを解明。これにより、表現構造と性能を結びつける情報理論的フレームを提供し、大規模な応用の可能性を示す。 Comment
元ポスト:
openreview:
https://openreview.net/forum?id=tvDlQj0GZB
(おそらく先行研究と比較したときの新規性に対する解釈が割れていて)スコアが相当pos/negに偏っている
なお、Rebuttalのために800以上のチェックポイントを分析する必要があったとのこと。
meta reviewによるとLLMのダイナミクスを理解するうえで有用な視点を提供している一方で、論文中で潜在的な応用可能性については言及されているが、実用的な有用性、特に本研究が示した分析結果が効果的な学習手法、モデル選択手順にどのように反映可能かが十分に示されていない、という指摘がある。
所見:
[Paper Note] Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution, Monishwaran Maheswaran+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Test-Time Scaling #read-later #Selected Papers/Blogs Issue Date: 2026-04-11 GPT Summary- 検証者なしの進化は、多様性と効率においてボトルネックが存在する。本研究では、Squeeze Evolveというマルチモデルオーケストレーションフレームワークを提案。モデルの能力を最適に割り当てることで、多様性とコスト効率を両立させる。Squeeze Evolveは、いくつかのマルチモーダル視覚ベンチマークにおいて、単一モデル進化と比較してコスト対能力を改善し、新たな最先端結果を達成。さらに、探索タスクでは検証者ありの進化法と同等、またはそれを上回る性能を示した。 Comment
pj page: https://squeeze-evolve.github.io/#blog-squeeze-evolve
元ポスト:
様々なtest-time scaling手法が単一のframeworkで表現できるという話がそもそもおもしろそう。読みたい。
[Paper Note] Vero: An Open RL Recipe for General Visual Reasoning, Gabriel Sarch+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #Reasoning #OpenWeight #OpenSource #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment
元ポスト:
ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。
[Paper Note] OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models, Han Zhu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SpeechProcessing #DiffusionModel #Speech #MultiLingual #OpenWeight #TTS Issue Date: 2026-04-07 GPT Summary- OmniVoiceは、600言語以上対応した多言語ゼロショットTTSモデルで、離散的非自己回帰アーキテクチャを採用。従来の複雑なパイプラインを排除し、テキストを直接音響トークンにマッピング。全コードブックランダムマスキング戦略とLLMからの初期化が技術革新を支える。581,000時間のオープンソースデータセットに基づき、中国語・英語などで最先端の性能を示す。モデルはオープンソースとして公開。 Comment
元ポスト:
github: https://github.com/k2-fsa/OmniVoice
dLMアーキテクチャだからかなり早いのでは。600+言語をサポート。
[Paper Note] daVinci-LLM:Towards the Science of Pretraining, Yiwei Qin+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #OpenWeight #OpenSource #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-03-31 GPT Summary- 基盤となる事前学習はモデルの限界を決め、事後訓練で克服するのが難しい。daVinci-LLMは、産業規模の資源と研究の自由を結集し、透明性のある完全オープンなパラダイムで事前学習を進展させる。8兆トークンを用いた二段階適応カリキュラムを採用し、能力向上のプロセスを体系的に評価。処理の深さやドメイン特性が能力に与える影響を明らかにし、探索プロセスを公開することでコミュニティが知識を蓄積できる基盤を提供する。 Comment
元ポスト:
github: https://github.com/GAIR-NLP/daVinci-LLM
オープン"ソース" (=コード, データ, モデルが公開されている(さらに厳密にはライセンスに問題がない))な関連研究:
- OpenLLaMA, Xinyang+, 2023.05
- Introducing Marin: An Open Lab for Building Foundation Models, marin-community, 2025.05
- Marin 32B Retrospective, marin-community, 2025.10
- [Paper Note] Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, Stella Biderman+, arXiv'23, 2023.04
- [Paper Note] Olmo 3, Team Olmo+, arXiv'25, 2025.12
- [Paper Note] K2-Think: A Parameter-Efficient Reasoning System, Zhoujun Cheng+, arXiv'25, 2025.09
- [Paper Note] DataComp-LM: In search of the next generation of training sets for language models, Jeffrey Li+, NeurIPS'25, 2024.07
- [Paper Note] LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs, LLM-jp+, arXiv'24, 2024.07
- [Paper Note] TinyLlama: An Open-Source Small Language Model, Peiyuan Zhang+, arXiv'24, 2024.01
- [Paper Note] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model, BigScience Workshop+, arXiv'22, 2022.11
- [Paper Note] OLMo: Accelerating the Science of Language Models, Dirk Groeneveld+, arXiv'24, 2024.02
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
- [Paper Note] GPT-NeoX-20B: An Open-Source Autoregressive Language Model, Sid Black+, arXiv'22, 2022.04
- SmolLM2, 2024.11
- [Paper Note] LLM360: Towards Fully Transparent Open-Source LLMs, Zhengzhong Liu+, COLM'24, 2023.12
- SmolLM3: smol, multilingual, long-context reasoner, HuggingFace, 2025.07
- The Smol Training Playbook: The Secrets to Building World-Class LLMs, Allal+, HuggingFace, 2025.10
この辺の研究を全て紐解いていったらどのような変遷が起きているだろうか?
- RedPajama, a project to create leading open-source models, starts by reproducing LLaMA training dataset of over 1.2 trillion tokens, together.ai, 2023.04
- [Paper Note] Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model, Ahmet Üstün+, arXiv'24, 2024.02
- SmolLM - blazingly fast and remarkably powerful, Allal+, HuggingFace, 2024.07
この辺も関連はしているが、データはオープンだがソースコードがおそらく公開されていない。
事後学習なら
- [Paper Note] Tulu 3: Pushing Frontiers in Open Language Model Post-Training, Nathan Lambert+, COLM'25, 2024.11
[Paper Note] AIRA_2: Overcoming Bottlenecks in AI Research Agents, Karen Hambardzumyan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #AutoML #LongHorizon #Asynchronous Issue Date: 2026-03-30 GPT Summary- 既存のAI研究エージェントの課題に対処するため、AIRA$_2$を提案。非同期マルチGPUワーカープールによりスループットを向上し、信頼性の高い評価信号を提供するHidden Consistent Evaluationプロトコルを導入。また、動的に行動を変更できるReActエージェントを用いる。MLE-bench-30でAIRA$_2$はパーセンタイル順位71.8%を達成し、過去最高を更新。各要素の必要性を示し、評価ノイズによる「過剰適合」の誤解を明らかに。 Comment
元ポスト:
AutoMLベンチマーク(MLE-Bench-30)においてSoTAな手法らしい。AutoMLの現状を概観するのに良さそう。
- MLE-Bench, OpenAI, 2024.10
72h実行して、36.7%程度のコンペティションでGold medalを獲得している。よくよく表を見ると、FM-Agent 2.0の方が24hで全体的に高いメダル獲得率のように見えたのだが、そもそもMARS+, MARS, FM-Agent 2.0, そしてMLEvolveはcon-current workとのこと。2024年10月にMLE-Benchが発表され、[Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10
を見るとo1-previewでgold medalは10%程度だったが、そこから約1年半でgold medalの比率は+26%程度まで向上しているということになる。
- [Paper Note] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, Jun Shern Chan+, ICLR'25, 2024.10
ベンチマークが公開されたら早々にサチりそうな気がしていたが、個人的に思っていたよりもスコアの伸びが遅いという感想。
[Paper Note] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild, Peng Xia+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #AgentSkills #Test Time Training (TTT) Issue Date: 2026-03-26 GPT Summary- MetaClawは、LLMエージェントが変化するニーズに対応するための継続的メタ学習フレームワークである。失敗軌跡を解析して即座にスキルを合成し、ダウンタイムをゼロにするスキル駆動の適応や、機会主義的ポリシー最適化を通じて、効果的に能力を更新する。これにより、精度を最大32%向上させ、全体のパイプラインの精度も21.4%から40.6%に増加させることが示された。 Comment
元ポスト:
関連:
- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
- [Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
と一見すると似たような研究に見えるが、
[Paper Note] OpenClaw-RL: Train Any Agent Simply by Talking, Yinjie Wang+, arXiv'26, 2026.03
の肝は「trajectory中のprocessにおいて活用可能なシグナルがあるから、それをもっと活用しよう」という気持ちで、
本研究は「失敗したtrajectoryに適用するためにSkillを合成し、ユーザが利用しないIdle Timeの間にLoRA + RLでポリシーの重みも更新して賢くしよう」という気持ちであり、目的が異なるように見える。
- [Paper Note] SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks, Xiangyi Li+, arXiv'26, 2026.02
においては、Skillをtaskに関する手続的な知識に基づいてスキルを自己生成しても性能向上せず、むしろ悪化させるような結果が出ており、不用意にSkillを合成すると性能が劣化するという結果が出ている。
本研究は失敗したtrajectoryに対して適応するためのSkill合成である点と、LoRAによってポリシー自体も賢くなるのであれば前提が変わるので話は変わってくるのかな、という印象。
[Paper Note] GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent, Yuri Kuratov+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #PEFT(Adaptor/LoRA) #read-later #memory #SoftPrompt #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-03-26 GPT Summary- 長い文脈をコンパクトに保存するGradMemを提案。これは、推論時に文脈へアクセスできない状況で、文脈を圧縮して数のクエリに応答する。モデルの重みを凍結し、少量のプレフィックストークンで数ステップの勾配降下を行うことで、文脈の再構成を最適化。連想キー-値検索において、GradMemは従来の手法より優れた性能を発揮し、自然言語タスクで競争力のある結果を示す。 Comment
元ポスト:
prefixにmemory用のトークンを用意し、TTTの枠組みでcontextのreconstruction lossを通じて圧縮する、という話に見える。tokenはsoft tokenであり、m*d次元の行列で表現される。
要はcontextの潜在表現をReconstruction lossによるTTTでprefix tuningするsoft prompting手法、という感じだろうか。
[Paper Note] Rich Insights from Cheap Signals: Efficient Evaluations via Tensor Factorization, Felipe Maia Polo+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Evaluation #Author Thread-Post Issue Date: 2026-03-25 GPT Summary- プロンプトの性能を細粒度で評価するため、安価な自動評価データと限られた人間によるゴールドスタンダードラベルを統合した新しい統計モデルを提案。自動評価スコアを基に生成モデルの潜在表現を事前学習し、小さな較正セットで人間の嗜好に整合。これにより、標準ベースラインを上回る精度で人間の嗜好を予測し、詳細なリーダーボードの構築やモデルのパフォーマンス推定が可能になることを示す。 Comment
元ポスト:
少量の人間ラベルとLLMによって合成されたraterでテンソルを作り(モデル、prompt, rateのテンソル)を行列分解することで、効率的に(=人間のrateはscarceなので行列分解を通じて潜在表現に落としてサンプル効率を高める、というより次元の呪いを回避する?)単一のスコアでのモデル評価ではなく、様々な異質のpromptの元でのスコアリング(=finegrained evaluation)を実現する、という話に見える。
[Paper Note] The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data, Christina Baek+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Supervised-FineTuning (SFT) #Scaling Laws #mid-training #PostTraining #read-later #DataMixture Issue Date: 2026-03-20 GPT Summary- 専門化事前学習(SPT)を通じてドメインデータを再利用し、モデルの性能を向上。SPTは微調整後の一般能力を保持し、必要な事前学習トークン数を最大1.75倍削減。特定のドメインにおいて、SPTは3Bモデルを上回る性能を示し、過適合スケーリング則を導出。事前学習段階で専門ドメインデータを導入することで、一般性能も改善し、計算量を抑えた結果を得る。訓練の早い段階でのドメインデータの統合が重要。 Comment
Finetuningに使うデータをpretraining段階から混ぜておくとより効果的という話らしい。事前学習データの量が増えるためより多くのbudgetが必要になるので効果的なmixtureのためのスケーリング則も構築したとか。興味深い
元ポスト:
解説:
[Paper Note] Qianfan-OCR: A Unified End-to-End Model for Document Intelligence, Daxiang Dong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #OCR Issue Date: 2026-03-18 GPT Summary- Qianfan-OCRは、文書解析と理解を統合した40億パラメータの視覚-言語モデルで、直接画像からMarkdownへの変換を実現。多様なタスクをサポートし、明示的なレイアウト分析を行うためにLayout-as-Thoughtを導入、複雑なレイアウトの精度を向上。OmniDocBenchやOlmOCR Benchでのパフォーマンスが優れており、他の一般的なモデルを上回る結果を示した。 Comment
HF: https://huggingface.co/baidu/Qianfan-OCR
元ポスト:
VLMでOCRするタイプのモデルで様々なベンチマークでSoTA、かつ192 languageをサポートととのこと。試したい
[Paper Note] Mamba-3: Improved Sequence Modeling using State Space Principles, Aakash Lahoti+, ICLR'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #SSM (StateSpaceModel) #Architecture #ICLR #Selected Papers/Blogs #LinearAttention Issue Date: 2026-03-18 GPT Summary- 推論効率がLLMの性能に与える影響に注目し、計算量を抑えつつ高い性能を持つモデルの開発が求められている。Transformerモデルは品質は高いが、計算コストが増加するため、サブ二次モデルの必要性が高まっている。しかし、最近の線形モデルは効率を優先した結果、性能が損なわれることも多い。これに対し、我々は状態空間モデル(SSM)に基づく三つの改善策を提案し、Mamba-3モデルを開発した。これにより、下流の言語モデリングタスクで平均精度が大幅に向上し、より少ない状態サイズで同等のパープレキシティを実現した。Mamba-3は性能と効率の向上を示す結果を得た。 Comment
openreview時点でのメモ:
- [Paper Note] MAMBA-3: IMPROVED SEQUENCE MODELING USING STATE SPACE PRINCIPLES, 2025.10
元ポスト:
最近はMambaのようなSSM(あるいはlinear attention)とfull attentionのハイブリッドなdecoder-onlyモデルが主流になりつつあるため、抑えておいた方が良いだろう。
[Paper Note] When Does Sparsity Mitigate the Curse of Depth in LLMs, Dilxat Muhtar+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Architecture #Sparse #Depth #CurseOfDepth Issue Date: 2026-03-17 GPT Summary- LLMの深さの呪いを軽減するために、スパース性が分散伝播を調整する役割を示す。暗黙的スパース性と明示的スパース性の2つの源泉を扱い、出力分散の削減と機能的分化を促進。深いモデルを効果的に利用するための実践的な知見を提供し、下流タスクで精度を4.6%向上させた。 Comment
元ポスト:
関連:
- [Paper Note] The Curse of Depth in Large Language Models, Wenfang Sun+, arXiv'25, 2025.02
モデルのアーキテクチャやパラメータのスパース性が curse of depth を是正するという話らしい。
Figure1の記号はそれぞれ以下を表しており
- T: context window
- lambda: weight decay
- G: Group Query Attention
- MoE: Mixture of Experts
context windowを大きく、weight decayを強く(重みの正則化としての効果が強まる)、GQA (Attentionのスパース性が高まる)、MoE (MLPのスパース性が高まる)という感じだと思われ、特にGQA, MoEが大きく寄与してそうに見える。
[Paper Note] $\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving, Pinzheng Wang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #PostTraining Issue Date: 2026-03-12 GPT Summary- Re^2は、強化学習の新手法であり、LLMsが効率的な推論経路を放棄し、必要に応じて再解法を選択することを学習。これにより、従来のRLVRよりも推論性能が30%以上向上し、サンプル数の増加に伴いテスト時の性能も改善。初期の思考過程の質に依存せず、解答の質を高めることが可能となる。 Comment
元ポスト:
CoTの初期の推論の時点で推論の方向性が決まってしまい、うまくいかないものはうまくいかないので、まっさらな状態から解き直す挙動をRLで増幅させる、という話に見える。Self Correctionではなく、完全にtrajectoryを無くすのだろうか?だとしたら、trajectoryの質を動的に検証してその生成は放棄する、というアプローチとやっていることがあまり変わらない気はするのだが、わざわざモデルの内部パラメータに対して介入してその挙動を増幅させる意味はあるのだろうか?
[Paper Note] Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems, Zongqian Li+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Coding #SoftwareEngineering #PostTraining #DataFiltering Issue Date: 2026-03-12 GPT Summary- 高品質なコード生成モデルの訓練には高品質なデータセットが必要だが、既存のデータは様々な問題を抱えている。本研究では、系統的なデータ処理フレームワークを導入し、自動難易度フィルタリングを用いて難易度の高い問題を保持しつつ簡単な問題を排除。得られたMicroCoderデータセットは、多様な競技プログラミング問題を含み、性能向上を達成。評価によれば、三倍の性能向上を示し、難易度を意識したデータ選定がモデルの性能向上に効果的であることが明らかになった。 Comment
元ポスト:
コーディングドメインにおいて、難易度の高いコーディング問題を収集(単純な問題をフィルタリング)することで、RLにおいて高い学習効率が得られる、という話に見える
[Paper Note] AutoHarness: improving LLM agents by automatically synthesizing a code harness, Xinghua Lou+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #AgentHarness Issue Date: 2026-03-08 GPT Summary- 言語モデルは、エージェントとして利用する際に最適でない行動をとることがあります。特に、Gemini-2.5-FlashはKaggle GameArenaのチェス競技で78%の敗北が違法手に起因しています。そこで、本研究では、ゲーム環境のフィードバックを用いて自動的に“ハーネス”を合成する手法を提案します。この手法は、145のTextArenaゲームにおいて全ての違法手を防ぎ、小型モデルのGemini-2.5-Flashがより大きなモデルを上回る性能を示します。また、Gemini-2.5-Flashは方針をコードとして生成し、意思決定時にLLMを必要としなくなります。得られたコードは、16の1人用ゲームでより高い平均報酬を得ており、カスタムのコード・ハーネスを用いることで、より大きなモデルを上回る性能を示します。 Comment
元ポスト:
あのMurphy本の著者であるMurphy氏が著者にいる👀
[Paper Note] Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations, Dongming Jiang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Survey #Analysis #NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #memory Issue Date: 2026-03-07 GPT Summary- エージェント記憶システムは、LLMエージェントが長い相互作用を維持し、長期推論を支援するが、経験的基盤が脆弱である。既存のベンチマークは不十分で、評価指標が実用性に合致せず、性能差が大きく、コストも見落とされがちである。本調査では、エージェント記憶を構造的に分析し、4つの記憶構造から成るMAGシステムを提案。主要な問題点として、ベンチマークの飽和、評価指標の妥当性、精度のバックボーン依存、記憶維持によるオーバーヘッドを挙げ、信頼性の高い評価とスケーラブルなシステム設計の方向性を示す。 Comment
元ポスト:
AI Agentの研究に関してtaxonomyが定義されており、研究分野全体の進展を外観するのに良さそう。
[Paper Note] Solving an Open Problem in Theoretical Physics using AI-Assisted Discovery, Michael P. Brenner+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #TreeSearch #Physics Issue Date: 2026-03-07 GPT Summary- 本論文では、AIが理論物理学の未解決問題を解決することで数学的発見を加速できることを示す。Gemini Deep Thinkを用いたニューロ-シンボリックシステムが、宇宙ひもによる重力放射のパワースペクトルについて新しい解析解を導出。エージェントはコア積分の評価を通じて、従来の部分的な漸近解を改善。探索制約とフィードバックループを詳細に説明し、最も効果的な解析法としてGegenbauer多項式を特定。これにより、漸近解が数値結果と整合し、量子場理論とも関連づけられることを示した。 Comment
元ポスト:
Gemini Deep Thinkが今度は理論物理に関する未解決問題を解決したらしい?
[Paper Note] $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners, Harman Singh+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#PairWise #NLP #LanguageModel #read-later #SelfVerification Issue Date: 2026-03-06 GPT Summary- 複雑な推論タスクにおける性能向上のため、ペアワイズ自己検証を活用したフレームワーク$V_1$を提案。$V_1$は、不確実性の高い候補ペアに動的に検証計算を割り当てる$V_1$-Inferと、生成器と検証器を共同訓練する$V_1$-PairRLから成る。これにより、コード生成や数学的推論のベンチマークで顕著な性能向上を実現。また、後者は従来の手法より高い効率を達成。 Comment
元ポスト:
self-verificationが進化するとdownstreamタスクの性能に多大な影響が出るし、かつ既存のモデルはフロンティアモデルであってもself-verificationは何らかのガイダンスがないと上手くできないことが示されているので [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
、もしガイダンス無しでうまくできるという話であればおもしろそう
- [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
[Paper Note] DP-RFT: Learning to Generate Synthetic Text via Differentially Private Reinforcement Fine-Tuning, Fangyuan Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #Privacy #One-Line Notes #DifferentiallyPrivate Issue Date: 2026-03-04 GPT Summary- DP-RFTを用いて、プライベートデータに直接アクセスせずに合成データを生成するためのオンライン強化学習アルゴリズムを提案。合成サンプルの報酬信号にDP保護済み最近傍投票を活用し、LLMが期待されるDP投票を最大化するよう学習。長文やドメイン特化のデータ生成において、プライベートデータの境界を尊重しつつ、従来の手法とのギャップを縮小することに成功。 Comment
元ポスト:
プライベートなデータの保有者が差分プライバシーが保護された状態でLLMのロールアウトに対してvotingによるrewardを返せば、個別のLLMはプライバシーに保護されたデータを見なくてもvotingによるスコアが最大となるように学習できるというアイデア。これによりプライバシーによる課題によりデータがオープンにならないドメインでも、この枠組みでLLMをpost-trainingすれば、LLMが合成データの生成器として振舞えるため、プライベートなドメインのデータスケーラビリティの課題の解決につながるのではという提案
これは利用規約などで個人情報の扱いに関して何らかのユーザとの取り決めがあった場合、どういう扱いになるのだろうか。
Gemini Proに質問して得た感想としては、少なくとも差分プライバシーによってreward signalが個人情報を含むデータではないと保証されたとしても(プライバーバジェットがどの程度設定されていれば問題ないのかといった合意があるかと言われると怪しいらしい)、reward signalを計算する部分においては個人情報を含むデータを活用しているため、個人情報利用のスコープにそれが許容されるようなステートメントが入っていないと、こういった手法を実施することは無理なのかもしれない。
[Paper Note] On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents, Jai Lal Lulla+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #AGENTS.md Issue Date: 2026-03-03 GPT Summary- AIコーディング・エージェント(CodexやClaude Codeなど)がソフトウェア・リポジトリに与える影響を調査。AGENTS.mdファイルの有無で、GitHubプルリクエストにおけるエージェントの実行時間とトークン消費が異なることを示し、AGENTS.mdの存在が実行時間を28.64%、トークン消費を16.58%削減する一方、タスク完了挙動は同等であることが分かった。これに基づき、AIコーディング・エージェントの設定やデプロイに関する実務的な含意を議論し、リポジトリレベルの指示の重要性を明らかにする。 Comment
関連:
- [Paper Note] Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?, Thibaud Gloaguen+, arXiv'26, 2026.02
こちらの研究ではどちらかというとAGENTS.mdによってinference costが増大するようなことが示されているが、具体的にAGENTS.mdの内容としてどのような違いがあるだろうか?
元ポスト:
[Paper Note] On the "Induction Bias" in Sequence Models, M. Reza Ebrahimi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #MachineLearning #NLP #Transformer #InductiveBias #Generalization Issue Date: 2026-03-03 GPT Summary- トランスフォーマーは実践的に成功しているが、状態追跡能力に限界があることが指摘されている。本研究では、トランスフォーマーとRNNのデータ効率を比較し、トランスフォーマーは状態空間とシーケンス長が増えるにつれて学習データの必要量が急激に増加することを示した。また、トランスフォーマーは異なるシーケンス長間での重み共有が少なく、長さ特有の学習を行っているのに対し、RNNはデータ再利用を通じて性能向上を実現している。これにより、トランスフォーマーの状態追跡が依然として根本的な課題であることが明らかになった。 Comment
元ポスト:
関連する話でAI Agentにおいて、学習データのtrajectoryが内包するhorizonを超えた途端に成功率が下がる、みたいな話があった気がしたのだが、どの論文だったか、、、。
linear attentionを一部用いているアーキテクチャなどでも、状態遷移の学習をうまくできないのだろうか?
[Paper Note] AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications, Yujie Zhao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #memory #Author Thread-Post Issue Date: 2026-03-01 GPT Summary- LLMを用いた自律エージェントの記憶において、実務的応用と評価基準の間にギャップが存在。これを解消するために、AMA-Benchを提案し、実世界のエージェント軌跡とQAを組み合わせて評価。多くの既存システムが因果性を欠き、類似性ベース検索に制約されている中、因果性グラフとツールを用いたAMA-Agentが性能を向上。AMA-AgentはAMA-Benchで57.22%の正解率を達成し、最強記憶システムのベースラインを11.16%上回る。 Comment
元ポスト:
実際のAgenticなタスクのユースケースに沿ったmemoryの評価方法を提案している研究のようで、非常に重要な研究に見える。実際はチャットベースのやり取りではなく、エージェントと環境が相互作用しながら生成されるtrajectoryで構成され、指示はagentによって生成された客観的な目的を含んでおり、trajectoryには多くのnoisyな結果やsymbolが含まれる。また、agentが現在のstateから環境に作用した結果が返ってくるというチャットベースの言語的なフロートは異なり、stateに基づいた因果関係が存在するという差がある。
ベンチマークの結果ではGPT-5.2が優れていそうに見えるが、GPTの場合は最新のGPT-5.2で評価されているのに、Claudeに関してはClaude Haiku 3.5で評価されているのは気になる。Claude Opus 4.6やGemini-3で評価したらどの程度の性能になるのだろうか。
著者ポスト:
[Paper Note] VidEoMT: Your ViT is Secretly Also a Video Segmentation Model, Narges Norouzi+, CVPR'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Transformer #ImageSegmentation #CVPR #read-later #Selected Papers/Blogs #Encoder #2D (Image) #3D (Video) Issue Date: 2026-02-28 GPT Summary- VidEoMTは、専用の追跡モジュールなしで動画セグメンテーションを実現するエンコーダーのみのモデルである。軽量なクエリ伝搬機構を導入し、前フレームの情報を活用することで、フレーム間の連携を図る。時系列に依存しない学習済みクエリと融合により、利益を生み出しつつ追加の複雑さを回避し、最大160 FPSで競争力のある精度を達成した。 Comment
元ポスト:
他タスクでも色々使えそうなアーキテクチャに見える
[Paper Note] Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs, Yining Hong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #ReinforcementLearning #Evaluation #PEFT(Adaptor/LoRA) #SelfCorrection #Test-Time Scaling #PostTraining #read-later #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #Test Time Training (TTT) Issue Date: 2026-02-28 GPT Summary- 具現化されたLLMsは高レベルのタスク推論を持つが、過去の失敗を振り返れず、ミスが繰り返される独立した試行となる。この問題に対処するため、Reflection Test-Time Planningを導入し、二つの省察モードを統合。実行中の反省では内部評価を通じて候補アクションを生成し、実行後の反省では外部反省を基にモデルを更新。新たに設計したベンチマークで実験を行い、ベースラインモデルに対して有意な改善を示した。定性的分析では、反省を通じた行動の修正が強調された。 Comment
pj page: https://reflective-test-time-planning.github.io/
元ポスト:
- [Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09
まだ全然理解できていないが、Action Model, Internal reflection LLM, external reflection LLMとしてLLaVA 3Dと呼ばれるモデルをベースにし、単一のモデルで3種類のモードを学習するようである。そしてテスト時にはLoRAを用いたTTTを実施するようである。
[Paper Note] On Data Engineering for Scaling LLM Terminal Capabilities, Renjie Pi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SyntheticData #Coding #OpenSource #SoftwareEngineering #Environment #Terminal Issue Date: 2026-02-28 GPT Summary- ターミナルエージェントのトレーニングデータ戦略に関するギャップを埋めるため、(1) 軽量な合成タスク生成パイプラインTerminal-Task-Genを提供し、(2) データと訓練戦略を総合的に分析。これにより、Nemotron-Terminalファミリーを訓練し、Terminal-Bench 2.0で性能を大幅に改善。ほぼすべての合成データセットをオープンソース化し、研究の加速を図る。 Comment
元ポスト:
terminalエージェントのための合成データを作成する環境と実際に作成されたSFT用のデータセットの公開をしているようである。
[Paper Note] Symmetry in language statistics shapes the geometry of model representations, Dhruva Karkada+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Embeddings #Analysis #NLP #LanguageModel #RepresentationLearning #read-later #Selected Papers/Blogs #Geometric Issue Date: 2026-02-28 GPT Summary- 言語モデルの内部表現は顕著な幾何学的構造を示し、暦の月や歴史的年の配置に関する対称性を示す。特に、月の共起頻度が時間間隔のみに依存することを証明し、高次元の単語埋め込みモデルにおける幾何学的構造を導出。実験的に大規模なテキスト埋め込みモデルとの一致を確認し、共起統計が撹乱されても幾何は維持されることを示している。この頑健性は、潜在変数によって制御される場合に自然に現れ、表現多様体の普遍的な起源を示唆する。 Comment
元ポスト:
こんな不思議なことが(小並感)
[Paper Note] Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?, Thibaud Gloaguen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #reading #Reference Collection #AGENTS.md Issue Date: 2026-02-27 GPT Summary- コーディングエージェントのタスク完遂性能を評価するため、LLMが生成したコンテキストファイルと開発者提供のファイルを用いた2つの設定を検討。結果、コンテキストファイルは成功率を低下させ、推論コストを増加させる傾向が見られた。両者はタスクの探求を促進するが、不要な要件がタスクを難化させるため、最小限の要件のみを記述することが推奨される。 Comment
元ポスト:
(現時点では)LLMによって自動生成されたコンテキストファイルは性能を劣化させ、inference costを増大させ、人間が作成したコンテキストファイルは性能を向上させる。コンテキストファイルによってoverviewを提供することを推奨しているものがあるが、性能向上には寄与しない。コンテキストファイルに従うことはより多くのthinkingを誘発し、結果的にタスクを難しくする。最小限のrequirementsのみを記述したものを使うことを推奨する、といった内容らしい?
関連:
best practiceは以下とのこと:
- # Writing a good CLAUDE.md, Kyle, 2025.11
解説:
非常にコンパクトにまとまっている。
解説:
解説:
[Paper Note] CaptionQA: Is Your Caption as Useful as the Image Itself?, Shijia Yang+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #MultiModal #CVPR #Selected Papers/Blogs #VisionLanguageModel #2D (Image) #One-Line Notes #ImageToTextGeneration Issue Date: 2026-02-26 GPT Summary- 画像キャプションはマルチモーダルシステムにおける視覚コンテンツの代理表現として機能するが、キャプションが実際のタスクで画像の代わりになり得るかを評価する必要がある。そこで、新たにユーティリティベースのベンチマークCaptionQAを提案し、キャプションの質を下流タスクへの支援度で測定する。CaptionQAは四つのドメインにわたり、33,027件の詳細な多肢選択問題を提供し、キャプションが視覚情報を必要とする質問に対応する力を検証する。LLMによる評価により、キャプションの有用性が画像よりも最大32%低下することが確認され、CaptionQAはオープンソースとして公開される。 Comment
元ポスト:
興味深い研究。MLLMの性能をCaption生成を通じて評価している。
良いCaptionであればdownstream taskに活用した際により良い性能が得られるという仮定の元[^1]、MLLMの性能をAnswer=LLM(Question, Caption)で判断する。AnswerはMultiple Choice Questionであり、Cannot Answerなども含まれる。よりQAに対して適切に回答できるCaptionを生成できたMLLMが優れているというutility-basedな評価となっている。
MLLMに対してCaptionを生成する際は、Questionに関する情報は与えずに、画像の情報のみでCaptionを生成する(ように見える)。セクション9に記述されている通り、4種類のバリエーションのpromptを用いる(long, short, simple, taxonomy hinted)。
skim readingしかできていないのだが、脚注1に記述した通り、モデルによって実画像がgivenな状態とCaptionのみで評価した場合でgapの出方に差がある点と、そもそも到達しているスコアの絶対値の対比が出せる点が個人的に興味深い。これにより特定のMLLMが、画像とテキスト、どちらの情報を"理解"するのに優れているのか、あるいは理解した情報に基づいて"生成"するのに優れているのかも間接的に評価できるのではないかと感じる。たとえばGPT-5は他モデルと比べて双方の能力秀でているが、Gemini-2.5-Proは画像を考慮することは得意だが、画像からテキストを生成する能力は少し劣ることがGPT-5とのgapの差から伺える。GLM4.1-VやLLaVAなどは画像理解は得意だが、画像から重要な情報を生成する能力は大きく低いことがわかる。
同じdownstreamタスクを通じてgapを測定でき、かつ単にベンチマークのスコアという以上の一段深い情報が得られる点がこれまでと異なりおもしろいと感じる。
[^1]:実際、セクション5を見ると実際の画像を与えた場合とCaptionのみの場合で評価した場合でgapがあることが示されており、Captionが画像中のdownstream taskに対してrelevantな情報を完全に保持していないことが示唆される。また、モデルに応じてgapが異なっており、モデルによってCaption生成能力が大きく異なることが示唆される。
この評価のパラダイムは一段抽象化をすると、特定のモダリティの情報に対する理解力と、異なるモダリティに変換して生成する能力をdownstreamタスクを通じて観測することになり、Captionの場合は画像-テキスト間だが、他にも動画-テキスト、音声-テキスト、あるいはそれらの逆など、Omniモーダルなモデルの評価やUMMの評価に使えそうな話だな、と思うなどした。
[Paper Note] Large-scale online deanonymization with LLMs, Simon Lermen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Privacy Issue Date: 2026-02-23 GPT Summary- 本研究では、大規模言語モデル(LLMs)を活用し、仮名化されたオンラインプロフィールを高精度で再識別する脱匿名化技術を実現。特に、Hacker NewsユーザーやAnthropic Interviewer参加者に対して、専任の調査官の作業量に匹敵する効率で成功。攻撃パイプラインは、身元特徴の抽出、意味的埋め込みによる候補一致の検索、そして上位候補の推論・検証の3段階から構成。従来手法を大幅に上回り、最高で適合率90%、再現率68%を達成。これにより、オンラインの仮名ユーザー保護の実務的限界が浮き彫りになり、プライバシーの脅威モデルの再考が求められる。 Comment
元ポスト:
Reddit等の匿名の投稿からプロフィールを収集し個人をある程度特定できる、という話な模様。
[Paper Note] Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook, Ming Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Society Issue Date: 2026-02-18 GPT Summary- AIエージェント社会は人間の社会システムに似た収束ダイナミクスを辿るのかという問いに対し、初の大規模な診断を行った。動的進化を定量的に評価するフレームワークを導入し、言語の安定化や個体の惰性を測定。分析の結果、意味は迅速に安定化するが、エージェント間の多様性と語彙の変化は維持され、均質化には逆らっている。しかし、強い惰性により影響力は一過性で、安定した集団的影響の形成が妨げられている。これにより、相互作用と社会化に関する新たなデザイン原理が示唆される。 Comment
元ポスト:
Moltbook:
- Moltbook is the most interesting place on the internet right now, Simon Willisons's blog, 2026.01
元ポストとアブストしか読めていないのだが、いまのAI Agentはたとえば下記Position Paperのように他者と協働するように作られていない[^1]からこのような現象が生じるのではないか。また、Moltbookにデプロイされているエージェントがどのような目的を設定されているかはわからないが、明確な目的やタスクが与えられないで活動している場合、エージェントの学習データはそのような状況を前提としていないので、エージェントの振る舞いもランダムなノイズのようなものになってしまうのではなかろうか。
- [Paper Note] Position: Humans are Missing from AI Coding Agent Research, Wang+, 2026.02
逆に他者と協働しながら、特定のタスクの正しい完了を報酬とするのではなく、もっと自身の内面的な感情や動機に対して報酬が働くような枠組みが発展し、かつ協働をすることのスキルを得られるようなデータが増えればまた違ったことが起きるのではなかろうか。
[^1]:SWE Agentの例ではあるが現在のAAgentはタスクを正しく完了したことをシグナルとして訓練されるパラダイムに支配されているので協働的な要素は生まれづらいと推察される。それはおそらくマルチエージェントでも一緒である。
[Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #Pretraining #NLP #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #Generalization #One-Line Notes #Contamination Issue Date: 2026-02-17 GPT Summary- LLMの訓練データがベンチマークのテストデータで汚染されると、分布外一般化にバイアスが生じる。従来のデコンタミネーション・フィルターは意味的重複を認識できず、私たちは「ソフト汚染」として訓練データの意味的重複を調査。Olmo3コーパスの解析から、汚染が広範囲に存在し、CodeForcesの78%、ZebraLogicの50%に意味的または厳密な重複を確認。また、ベンチマークデータの重複が訓練データに含まれることで性能が向上し、ファインチューニングが同じベンチマークの未使用データの性能も改善することが示された。これにより、最近のベンチマークの向上は本質的な能力向上とは異なる可能性があることを示唆している。 Comment
元ポスト:
n-gramマッチングによるデータのdeaontaminationは表層レベルでしか捉えられないので、意味的に等価なサンプルをdecontamgnationできず(=Soft Contamination)効果が薄く、意味的なレベルでのコンタミネーションは広範に存在し[^1]、それらサンプルが学習データに含まれるとheldoutされたテストベンチマークのスコアも改善してしまう(=本当に計りたい汎化性能を測れていない)という話をしっかり分析した研究に見え、非常に重要な研究に見える。
[^1]:Olmo3で検証しており、ZebraLogicテストセットの50%とexactに一致するデータが含まれ、CodeForcesのテストセットのうち78%のサンプルと意味的に一致したサンプルが一件以上存在したとのこと。
[Paper Note] An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking, Lars Hertel+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #Transformer #A/B Testing #SequentialRecommendation #One-Line Notes Issue Date: 2026-02-16 GPT Summary- Feed Sequential Recommender(Feed-SR)は、LinkedInフィード向けのトランスフォーマーを用いた逐次ランキングモデルで、DCNv2ベースのランカーを置換。LinkedInの運用制約を満たしつつ、メンバーのエンゲージメントを向上させ、滞在時間が+2.10%増加。オンラインA/Bテストでの性能を通じて、Feed-SRの効率性と効果についても論じる。 Comment
元ポスト:
linkedinのfeedにおけるsequential recommendationで利用されているモデルでdecoder onlyのpre-LN、RoPE、residual streamの更新がlearnableなパラメータでrescaleされて更新されるようなtransformerアーキテクチャが採用されている。細かいfeatureなどについては読めていない。A/Bテストによって効果が確認されている。
[Paper Note] Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs, Wei Zhou+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #SoftwareEngineering #read-later #Selected Papers/Blogs #Data Issue Date: 2026-02-16 GPT Summary- LLM技術がデータ前処理のパラダイムを変革中であり、幅広いアプリケーションに対応するための進化を検討。文献レビューを通じて、データクリーニング、統合、強化の主要タスクにおける手法を整理し、それぞれの利点と制約を分析。さらに、評価指標とデータセットを考察し、スケーラブルなデータシステムや信頼性の高いワークフローに向けた研究課題を提示。 Comment
元ポスト:
自動的なデータの前処理に関するSurvey。文献は120以上引用され、美麗なフォーマットで記述されている。時系列での手法の変遷と、手法間の関係性が図解で整理されており非常にわかりやすそう。データの前処理は実務上の大きなボトルネックなのでどのような研究があるか気になる。
[Paper Note] General Humanoid Whole-Body Control via Pretraining and Fast Adaptation, Zepeng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NeuralNetwork #ReinforcementLearning #MoE(Mixture-of-Experts) #Robotics #EmbodiedAI #WholeBody Issue Date: 2026-02-14 GPT Summary- ヒューマノイドロボットの全身コントローラー学習は、多様な動作や迅速な適応の難しさから依然課題が残る。既存手法はタスク固有のトレーニングを要し、新しい動作への適応時に性能が低下することが多い。本研究では、高速適応と安定した動作追跡を実現する「FAST」を提案。FASTは軽量のデルタアクションポリシーを学習し、分布外動作への効率的適応と壊滅的な忘却の軽減を図る。さらに、センターオブマスに基づく制御を導入し、バランス向上を目指す。広範なシミュレーションと実世界の実験により、FASTは堅牢性や適応効率で最先端のベースラインを超える性能を示した。 Comment
元ポスト:
腕の操作だけのような特定の部位に特化したモーションを学習するのではなく、全身の動きを制御するコントローラーをMoE+3層MLPのアーキテクチャでRL(PPO)によって学習するような手法らしい
[Paper Note] Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model, Jacqueline He+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Decoding #read-later #Selected Papers/Blogs #Legal #KeyPoint Notes #Copyright #Author Thread-Post Issue Date: 2026-02-12 GPT Summary- 「アンカーデコーディング」は、現代の言語モデルが逐語的な再現を抑制するための新しい推論法であり、リスクのあるLMからより安全な生成を実現します。この手法は、ユーザーが選択した情報予算に応じて生成過程に制約を加え、著作権リスクと有用性のトレードオフを可能にします。また、新たに導入した安全モデルと、クロスボキャブラリ融合を実現するAnchored$_{\mathrm{Byte}}$デコーディングにより、リスク低減と流暢さを維持しつつ、コピーギャップを75%まで排除することが確認されました。 Comment
元ポスト:
権利上の問題がない言語モデル(permissive licenceデータによって学習されたものなど)SafeLMと、任意の言語モデルRiskyLMの2つが与えられたときに、KL Divergenceの予算Kの元、各生成のstep tごとに語彙空間上で両LLMのKL DivergenceがK_t未満となるように生成するトークンを選択することで、出力の有用性(fluencyとfactuality)は維持しつつ、memorizationされている著作権物をそのままデコーディングしてしまうリスクを低減する手法。RiskyLMの非常に高いUtility上の語彙生成確率を、SafeLM側の安全な語彙確率で引っ張って良い塩梅で生成するようなイメージと思われる。
この手法はSafeLMがどれだけ高いUtilityを維持しつつ安全性を保てるかにデコーディング性能が依存すると思われるが、SLMで非常に性能の良いTinyComma 0.8Bもリリースしている。
また、KL Divergenceを測定する都合上、提案手法は共通のVocab(すなわちトークナイザー)を持つモデル間でしか適用できないが、KL Divergenceをバイト空間上で測るように工夫することでVocabの制約を無くす方法も提案している。
著作物をそのまま出力してしまう問題は軽減されそうだと思われるが、著者独特の思想や感情、表現や言い回しなどの著作権で保護される対象をどの程度の度合いで守れるかについては興味がある。また、そのためには次はどのようなステップが必要か?
[Paper Note] Effective Reasoning Chains Reduce Intrinsic Dimensionality, Archiki Prasad+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Chain-of-Thought #Reasoning #PEFT(Adaptor/LoRA) #PostTraining #Selected Papers/Blogs #Generalization #KeyPoint Notes Issue Date: 2026-02-12 GPT Summary- 内在次元数を指標として、推論チェーンの有効性を定量化。異なる推論戦略がタスクの内在次元数を低下させ、一般化性能に逆相関を持つことを示す。これにより、有効な推論チェーンがパラメータを効果的に利用し学習を促進することを明らかにする。 Comment
元ポスト:
元ポストを読むと、以下のような話のようである。非常に興味深い。
良いCoT(推論)はタスクを圧縮する(すなわち、inputを正解へとマッピングする際の自由度を減少させる)ことを示した。
さまざまなCoT戦略に対して、あるタスクに対してさまざまなCoT戦略と、**特定の性能に到達するまでに必要な最小のパラメータ数の関係性(=intrinsic dimensionality)**を分析。パラメータ数の制御はLoRAのパラメータを変化させることによって調整して実験。その結果、Intrinsic Dimensionalityがdownstream taskの性能と、OODへの汎化性能に対して非常に強い相関を示した(Perplexityよりも強い相関)。
Intrinsic DimensionalityをさまざまなCoT戦略で測定すると、(school math系のデータに関しては)python codeを生成し実行する方法(Executed PoT)が最もコンパクトなsolutionを生成し、かつ最も良いOODへの汎化性能が高いことがわかった(他ドメインでこのCoT手法が適しているとは限らない点には注意)。
また、モデルスケールが大きい方がより低いIntrinsic Dimensionalityを示し、良いcompressor(=タスクを圧縮する能力が高い)であることがわかった。
弱くてノイジーなCoT戦略は、スケールせず、パラメータ効率が悪いことがわかった。
非常に興味深い研究で、かつskim readingしかできていない上での感想なのだが、
- 実験がLoRAベースで実施されているため、他の学習のダイナミクスにおいて同様のことが言えるのかという点
- Gemmaでしか実験されていないため他のアーキテクチャでも同じようにIntrinsic Dimensionalityの有効性が言えるのか
- データセットがGSM系列のschool mathドメインでしか実験されていないため、ドメイン間でどの程度一般性を持って言える話なのかという点
は明らかになっていない気がしており、どうなるのか興味がある。また、実際にIntrinsic Dimensionalityを測定しようとした場合に、効率的に求める方法はあるだろうか。
[Paper Note] UI-Venus-1.5 Technical Report, Veuns-Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #ReinforcementLearning #AIAgents #mid-training #ModelMerge #Off-Policy #On-Policy #VisionLanguageModel #One-Line Notes #Rubric-based #GUI Issue Date: 2026-02-12 GPT Summary- 統合型エンドツーエンドGUIエージェントUI-Venus-1.5を紹介。さまざまなアプリケーションに対応する2B、8B、および30B-A3Bのモデルバリアントを持ち、10億トークンを活用したMid-Training、オンライン強化学習、ドメイン固有モデルの統合を実施。評価においてScreenSpot-Pro、VenusBench-GD、AndroidWorldで新たな最先端パフォーマンスを達成し、中国のモバイルアプリでも効果的なナビゲーションを実現。 Comment
元ポスト:
Mid-training(navigation, grounding, reasoning, GUI-VQA, アイコンの認識等の精緻な認識能力)でGUIに関する知識を身につけさせ、オフラインRLで特定のタスクに特化した能力(grounding, navigation等)を向上し、オンラインRLで実シナリオでのエージェントのtrajectoryレベルでの能力を向上させる。これらのモデルはモバイルとwebでそれぞれ学習され、最終的にモデルマージを通じて単一のend-to-endにタスクを実現可能なエージェントを構築する。
コールドスタートの対策のためにSFTではなくオフポリシーRLを使っているのが特徴
下記研究において、SFTが各trajectoryがトークン単位で一致したときに1となるrewardを用いたRLと一致することが示されており、汎化能力に課題があることが指摘されている[^1]。汎化性能は後回しにして、特定の能力にとにかくまずは強化したいという用途であればSFTでも良いかもしれないが、downstreamなタスクがend-to-endで多様なタスクとなる場合は、オフラインRLを用いて汎化性能も考慮しつつ多面的な能力をwarmupするのが良いのかもしれない。
- [Paper Note] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification, Yongliang Wu+, ICLR'26, 2025.08
[^1]: ポリシーがexpertのtrajectoryに対して低い尤度を示すとimportance weightingにより非常に大きい重みがかけられることで分散が大きく、かつ報酬シグナルがsparseなことが課題であることが指摘されている。
[Paper Note] ViT-5: Vision Transformers for The Mid-2020s, Feng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Transformer #Architecture #read-later #Selected Papers/Blogs #Backbone Issue Date: 2026-02-10 GPT Summary- ViT-5は、ビジョントランスフォーマーの要素を体系的に洗練し、新世代のバックボーンを形成する。このアーキテクチャは、正規化や位置エンコーディングなどの進化を含み、広範な実験で従来の最先端を上回る性能を示した。ImageNet-1k分類では84.2%のトップ-1精度を達成し、生成モデリングでも優れたFIDを記録。改善された表現学習と空間推論により、タスク間の移行が安定し、現代のファンデーションモデルに適したシンプルなアップグレードを提供する。 Comment
元ポスト:
ModernBERTと同じ動機で、ViTに現代的な様々なアーキテクチャ上の工夫を入れたものをシステマチックに調査し、最適な組み合わせを見つけ性能向上したという話に見える。
[Paper Note] Learning to Self-Verify Makes Language Models Better Reasoners, Yuxin Chen+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #RLVR #Selected Papers/Blogs #KeyPoint Notes #SelfVerification Issue Date: 2026-02-10 GPT Summary- LLMの生成能力は高いが、自己検証では弱いという非対称性を調査。生成が向上しても自己検証に改善は見られず、逆に自己検証の学習が生成性能を向上させることが示された。生成訓練に自己検証を統合するマルチタスク強化学習フレームワークを提案し、両者の性能向上を実証。 Comment
元ポスト:
LLMの生成能力を高めるようにRLによって事後学習をしてもVerificationの能力は向上しないが、LLMが自身の出力に対してVerificationが正しくできるようにRLVRすると生成と自己検証能力の双方が向上する。
クエリに対して応答を生成し、フィルタリング(応答が長すぎるもの、全ての応答が誤りのもの、最終的な回答が存在しないもの等)を実施した後、クエリレベルで多様なクエリが存在するようにする(多様性)を保ちつつ、overfittingを避けるために正解・不正解がバランスよく存在するように自己検証のためのデータを作成(モデルは学習の初期のロールアウトは不正解ばかり生成し、後半は正解ばかり生成するといった偏りが存在する)し、式(4)で定義される自身が生成した応答が正解か否かを二値分類した結果に基づくRewardを用いてGRPOする、という手法ように見える。
ざーっと見た感じtest time scalingの実験が無いように見えたが、この方法で自己検証をモデルができるようになると、test time scalingした時の性能も向上するのではないか。
また下記研究で示されている通り、現在のLLMはself refine能力が低く何らかのガイドがないと自身で応答を改善していけないため、現在のLLMの弱みを克服するのに有効な手法に見え、非常に興味深い研究だと感じる。
- [Paper Note] RefineBench: Evaluating Refinement Capability of Language Models via Checklists, Young-Jun Lee+, ICLR'26, 2025.11
[Paper Note] SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization, Jiarui Yuan+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #Dataset #LanguageModel #ReinforcementLearning #Evaluation #SelfImprovement #PostTraining #read-later #Selected Papers/Blogs #FactualKnowledge #One-Line Notes #ContinualLearning Issue Date: 2026-02-10 GPT Summary- 自己進化には、エージェントが生涯学習者として新しい経験を内面化し、将来の問題解決に活かすことが必要。しかし、以前の知識の混在と推論の複雑さが測定を妨げる。SE-Benchという診断環境を導入し、エージェントが新しいAPIドキュメントを使用することで評価を行い、知識の保持と内面化の新たな洞察を得た。特に「クローズドブック訓練」が知識保持に必要であり、標準的な強化学習が新しい知識を内面化できないことを示す。SE-Benchは知識内面化のための厳密なプラットフォームを提供する。 Comment
元ポスト:
関数をリネームし関連するAPIドキュメント(今回はnumpy)を更新し、Claudeを用いてテストケースを生成し、複数のLLMのVotingで検証可能かどうかを判定した後人手による検証を行いフィルタリングする。テスト時にクローズドブックの設定で評価することで、インタフェースに関するモデルのFactual Knowledgeを更新しないとモデルはテストケースに正解できず、モデルが内部パラメータに保持するFactual Knowledgeをどれだけ適切に保持、更新しているかを評価するようなコントロールされた環境下でのベンチマークに見える。
APIに関するドキュメントの文脈をしっかり変更しないと元のモデルが文脈から過去の関数名との対応関係を類推できてしまいそうだが、その辺はどうなっているのだろうか。
[Paper Note] Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents, Zhihan Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #CrossDomain #Generalization #KeyPoint Notes #DomainGap Issue Date: 2026-02-08 GPT Summary- 一般化されたLLMエージェントのポストトレーニングにおける課題を調査。特に、強化学習環境の特性がアウトオブドメイン性能に与える影響を分析。状態情報の豊富さとプランニングの複雑さがクロスドメインの一般化に強く相関し、リアリズムやテキスト類似性は主要な要因ではないことを発見。状態情報を増やすことでロバスト性を向上可能で、ランダム化技術を提案。また、モデリング選択として、SFTのウォームアップが忘却を防ぐが一般化を損なう可能性や、ステップ・バイ・ステップ思考が一般化に重要な役割を果たすことを示した。 Comment
元ポスト:
事後学習におけるクロスドメインの汎化性能に関する調査を行い、ドメインの表層的な情報ではなく、
- 状態情報の豊富さ(どれだけのテキストを処理する必要があるか; 認知コスト)
- 推論の複雑さ(long-horizonやゴールへの到達可能性)
がドメイン間の汎化に相関を示すことが明らかになり、要は構造の複雑さが鍵であることが分かった。
ドメイン間の汎化性能を改善するために、実タスクは変えずにobservationに対して少量のノイズを加えることで、モデルがノイズから重要なシグナルを抽出することを学習し汎化性能が向上。
RLを行う際の注意点として、
- mid-trainingはDataMixに含まれるドメインの知識を補充するが、カバーされていないドメインの忘却をより悪化させる可能性があり
- ステップ単位での推論が汎化性能向上に役ダウン(言い換えると、ショートカットは転移しない)
を挙げており、
デプロイされるドメインが不明な場合の実用的な対策として
- より状態の記述がリッチなドメインかつ複雑な推論を要する環境で学習し
- 明示的な推論をオンにし
- 軽量な状態情報へのノイズの注入や拡張をすふこと
を挙げている。
さらにざっくり言うとエンコード時にドメインの表層情報に依存させず、表層情報の中から必要な情報を抽出するスキルをモデルに学習させ、かつデコーディング時は精緻な推論によって誤った転移を防ぐのがドメイン間の汎化の鍵、という話に感じる。
[Paper Note] Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening, Zhenxiong Yu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Safety #One-Line Notes Issue Date: 2026-02-08 GPT Summary- 「Spider-Sense」と呼ばれるイベント駆動型防御フレームワークを提案し、エージェントが危険を認識した際にのみ防御を発動。階層的な防御メカニズムにより効率と精度をトレードオフしつつ、既知のリスクを軽量マッチングで解決し、曖昧なケースは内部推論に移行。新たなベンチマーク「S$^2$Bench」を用いた実験で、競争力のある防御性能と最低の攻撃成功率を示し、わずか8.3%の遅延オーバーヘッドを実現。 Comment
元ポスト:
従来のAI Agentのセキュリティチェックは決められたタイミングで、しばしば重いチェックがかかりレイテンシが高かったが、提案手法では動的にどの程度の計算量を費やすかを調整して、必要なタイミングで重い推論、そうでない場合は軽量なチェックで済ませることでレイテンシと性能を改善する、といったコンセプトな模様。
エージェントのステージごとにobservationを事前定義されたテンプレートで囲い、テンプレートによってスクリーニングをトリガーし、ベクトル検索によって危険度を判定する。判定した危険度が一定以下なら軽量なチェック、一定以上ならLLMによる推論を用いた重い処理を走らせるという手法に見える。図中のcのnotationが本文中に見当たらない気がするが、見落としているだろうか。
結局のところ、テンプレートによってセキュリティチェックが誘発されるように見えるので、元々の問題意識である固定されたタイミングで強制的にセキュリティチェックがかかる、という課題は解決されない気がする。固定されたタイミングで強制的にセキュリティチェックがかかる点は従来手法と変わらないが、セキュリティチェックに費やすコストや計算量を動的に変更します、という話に感じる。
[Paper Note] LatentMem: Customizing Latent Memory for Multi-Agent Systems, Muxin Fu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #memory #KeyPoint Notes #Adaptive Issue Date: 2026-02-07 GPT Summary- LatentMemは、LLMを用いたマルチエージェントシステム向けに設計された学習可能なメモリフレームワークで、カスタマイズと情報最適化を実現します。経験バンクと潜在メモリを活用し、メモリエントリーの均質化と情報過多の問題を解決。タスクレベルの最適化信号を利用することで、従来のメモリ設計に対し最大19.36%の性能向上を達成しました。 Comment
元ポスト:
skim readingしかできていないが、現在のMulti AI Agentsにおけるメモリ機構はstaticな機構であるため、メモリが均質化してしまいエージェントの役割ごとに最適化されておらず、かつlong trajectoryを扱う際に情報がコンパクトに圧縮されておらずtrajectoryが肥大化していってしまう。このため、エージェントの役割ごとに異なるメモリを生成し、かつ固定長の潜在表現に情報を圧縮する(これによりlong contextでのメモリ肥大化を防ぐ)ような新たなDeep Neural Networkに基づくMemory ComposerをRLを通じて学習するという話のようである。
エージェントのプロファイルと、experience bankから抽出された現在のクエリに対するtrajectoryに基づいて、個々のエージェントごとにrelevantな情報が圧縮されたメモリの潜在表現を生成するようなMemory ComposerをRLで学習し活用する(LMPO)。このとき、エージェントのパラメータは更新せずfreezeする。あくまでバックボーンはfreezeして変更せず、メモリ機構のみを最適化することに焦点を当てている。Memory Composerは、与えられたメモリ, エージェントの(freezeされた)パラメータ, 与えられたプロンプトによってreasoningを実施し、最終的な応答が正しかったかどうかに基づいてGRPOベースのRLVR(=LMPO)を実施することによって学習する。エージェントがメモリを活用して得られたtrajectoryはexperience bankに格納されて利用される。
既存手法と比べて多くのQAベンチマークで高い性能を獲得し、OODなベンチマークでもある程度は汎化するようである。
in-domainなベンチマークと比較して、out-of-domainなベンチマークでの性能向上が小さいので、汎化性能にまだ課題があるように感じた。解決している問題は非常に重要だと考えられ、どのようにすれば汎用的なMemory Composerが学習できるか?を考えるとおもしろそうである。
[Paper Note] ERNIE 5.0 Technical Report, Haifeng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Speech #Proprietary #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #2D (Image) #UMM #3D (Video) #Omni #text Issue Date: 2026-02-06 GPT Summary- ERNIE 5.0は、テキスト、画像、ビデオ、音声に対応したマルチモーダル理解と生成のための基盤モデルです。超スパースな専門家の混合アーキテクチャを使用し、依存しないルーティングでトークン予測を行います。新たなトレーニングパラダイムにより、モデルは性能、サイズ、推論レイテンシを柔軟に調整可能です。幅広い実験において、ERNIE 5.0は複数のモダリティで優れた性能を示し、初の商用規模の兆パラメータモデルとして注目されています。 Comment
元ポスト:
リリース時の公式ポスト:
あくまでskim readingをして得た印象なのだが、非常に興味深い研究で、Omniモダリティを超大規模モデルでスクラッチからUnified Multimodal Modelとして学習し、MoEで効率的に推論するというアーキテクチャと手法に見え(個人的にこういう手法でやったらどうなるのだろう?と思っていたドンピシャな設定)、各種ベンチマークの性能指標を見ると多くの指標で全体的に良いスコアを達成しており様々なタスクを高性能で実現できる一方、特定の分野のベンチマークでGemini Pro 3の方が強い面が多く(たとえばテキストモダリティのstem, coding, vision全般, ASR全般)、Omniモダリティの統合は一筋縄ではいかず、どのようにモダリティを統合し、学習することが効果的なのか?という根源的な問いがあらためて思い浮かぶ。
Ming Omniでも同様のことがやられていた:
- [Paper Note] Ming-Omni: A Unified Multimodal Model for Perception and Generation, Inclusion AI+, arXiv'25, 2025.06
[Paper Note] WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning, Zelai Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining Issue Date: 2026-02-06 GPT Summary- マルチエージェントシステムを用いた情報探索の幅のスケーリングを探求する本研究では、WideSeek-R1フレームワークを提案。リードエージェントとサブエージェントが共同最適化することで、20,000のタスクで高い性能を発揮。WideSeek-R1-4BはアイテムF1スコア40.0%を達成し、性能がサブエージェント数の増加と共に向上することを示す。 Comment
元ポスト:
Context Foldingと比較した時の新規性がweaknessに感じる:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
[Paper Note] A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces, Mingxuan Du+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #RAG(RetrievalAugmentedGeneration) #Test-Time Scaling #One-Line Notes #Scalability #Adaptive Issue Date: 2026-02-06 GPT Summary- A-RAGは、階層的な取得インターフェースを通じてエージェント型のRAGシステムを実現し、モデルが適応的に情報を検索・取得できる能力を向上させる。キーワード検索、意味検索、チャンク読み取りの3つのツールを提供し、既存の方法と比較して一貫した優れた性能を示す。モデルのスケーリング特性についても体系的に検討し、今後の研究のためにコードを公開予定。 Comment
元ポスト:
固定されたワークフローでのRAGではなく、エージェントが自ら考えて最適な検索ツールを模索し情報を自動的に取得するAgentic RAGな枠組みを提案している。研究としての新規性はweaknessだと感じるが、実務的に有効な方法だと思う。LLM側のreasoning effortやmax tokenを増やすことで性能がスケーリングするため(Test Time Scaling)これもまた実用的な手法だと感じる。
[Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#DocumentSummarization #NLP #LanguageModel #ReinforcementLearning #AIAgents #Reasoning #PostTraining #read-later #RLVR #Selected Papers/Blogs #OOD #Generalization #KeyPoint Notes #LongHorizon #Robustness #Compression Issue Date: 2026-02-05 GPT Summary- 大規模言語モデル(LLM)は、テスト時の適応能力により複雑な問題を解決する外挿特性を持つが、標準的な強化学習(RL)はその変化に制約がある。これに対処するために、反復デコーディングアルゴリズム(RC)を導入し、LLMの応答生成能力を活用して推論を継続的に改善。実験では、16kトークンの訓練で4BモデルがHMMT 2025でのパフォーマンスを40%から約70%に引き上げ、既存のモデルを上回る結果を示した。RCを使用したモデルは、学習した要約生成能力によりテスト時のパフォーマンスも向上できることが証明された。 Comment
元ポスト:
reasoningの生成と、生成されたreasoningとinputで条件付けでsummaryを生成、さらにinputとsummaryで条件付けてreasoningを生成するという、生成と要約を反復する枠組みを採用(LLMはreasoningを要約することが生成するよりも得意で、かつ過去の要約から将来の推論を生成できるという非対称性を活用)することで、訓練時の予算は決まっているため、訓練時の予算では到達できないhorizonにテスト時に遭遇すると汎化しない課題を克服し、テスト時により長いステップ数の推論もこなせるように外挿する。また、このようなgeneration-summaryの反復を各ステップごとでRLVRすることでさらに性能を向上でき、実際にlong horizonな推論や学習時よりもより長いreasoning token budgetの場合に大きなgainを獲得できている。
RLVRをする際に各ステップごとのSummaryを保存しておき、各ステップのsummaryが与えられたときに正解できるかどうかのシグナルに基づいて、ステップごとの要約で条件付けられた応答能力を改善する。これにより、さまざまなステップで応答を生成する能力が強化され、結果的にshort horizonからlong horizonの推論をする能力が強化される。
このときsummaryはリプレイバッファとして扱い後のepochの訓練でもオフポリシーデータとして活用する。要約はinputに条件付けられて生成されるものであり、optimizationのtargetとは異なるためリプレイバッファとして活用でき、かつさまざまな要約に対して正解が生成できるように学習されるためテスト時の要約の分布のシフトにロバストになる。また、オンポリシーデータだけだと、long horizonに対する要約は非常に稀になるため、リプレイバッファを利用することで補う。
テスト時に学習時を超えたhorizonで推論できることは現在のAIエージェントの大きな課題だと思うので非常に興味深い研究だと思う。
[Paper Note] Learning to Reason in 13 Parameters, John X. Morris+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #ReinforcementLearning #Reasoning #PEFT(Adaptor/LoRA) #PostTraining Issue Date: 2026-02-05 GPT Summary- 低ランクアダプタTinyLoRAを提案し、推論のための強化学習が低ランクパラメータ化を効果的にスケールできることを示しています。わずか13のトレーニングパラメータでQwen2.5を91%の精度に達成し、複雑なベンチマークでも少ないパラメータで90%のパフォーマンス向上を実現しました。特に、強化学習を用いることで、従来の方法よりも大幅に少ないパラメータで強力な結果を得ることができました。 Comment
元ポスト:
Qwen2.5に関してはLlamaと比較して異なる傾向が生じることは以下でも見受けられる。果たして本研究で報告されていることはどこまで一般的なのだろうか?:
- [Paper Note] Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination, Mingqi Wu+, arXiv'25
- [Paper Note] Spurious Rewards: Rethinking Training Signals in RLVR, Shao+, 2025.05
[Paper Note] Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text, Ximing Lu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #PostTraining #read-later #RLVR #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-02-05 GPT Summary- RLVRはLLMの推論を解きほぐす基盤だが、検証データの不足がスケールアップのボトルネックとなっている。この課題を克服するために「ゴールデン・グース」を提案し、インターネットの非検証テキストから無限のRLVRタスクを生成する。具体的には、LLMに主要な推論ステップを特定させ、豊富なタスクを持つGooseReason-0.7Mデータセットを合成。これにより、従来モデルを復活させ、15のベンチマークで新たな最先端結果を達成。また、リアルなサイバーセキュリティデータからRLVRタスクを合成し、Qwen3-4B-Instructをトレーニング。これにより7Bモデルを超える成果を上げ、推論に富んだインターネットテキストを活用する可能性を示している。 Comment
元ポスト:
テキストからMultiple Choice Question (MCQ) を生成することでRLVR用のverifiableな学習データを大量に合成可能にする。おそらく次のステップとしては、生成されるMCQの stem, key, distractor の質が今度は焦点となり、そこの質が改善されればより大きなgainを得られるようになる気がする(たとえば消去法で正解を知らなくても正解できてしまうようなdistractorや、問題文に正解がそのまま含まれてしまっているようなノイジーなMCQから人間が何も学ばないように、モデルが学習するときと一緒だと思われる)。
データとモデルが公開:
[Paper Note] Maximum Likelihood Reinforcement Learning, Fahim Tajwar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #RLVR #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-02-05 GPT Summary- 強化学習を用いてモデルを訓練する際、尤度の最大化ではなく低次近似を最適化する限界に触発され、最大尤度強化学習(MaxRL)を提案。これは、サンプリングされたデータから最大尤度を近似するためのフレームワークであり、得られた目的関数はシンプルで偏りのないポリシー勾配推定を可能にする。実験では、MaxRLが既存の手法を上回り、テスト時間効率を最大20倍向上。追加データや計算へのスケーラビリティも優れており、RL訓練を正確性に基づいて拡張するための有望なフレームワークであることを示した。 Comment
元ポスト:
著者ポスト:
pj page: https://zanette-labs.github.io/MaxRL/
skim readingしかできていないが、
微分不可能な生成がされbinaryの正誤が与えられるような条件下でモデルを最適化するときにxが与えられてyが正解である確率はimplicitな尤度を表している。この最適化問題を解くために現在はRLが利用されており、RLは正解の確率pを最大化するような定式化がされているが、最尤推定で定式化するとlog pで定式化をすることになり、これは根本的に異なる最適化となる。具体的には、RLはpass@1に対して最適化しているが、MaxRLはk=1,...∞に対するpass@kの調和平均に対して最適化をするような違いがある。この最尤推定の勾配は実は成功したtrajectoryのスコアの平均という非常にシンプルな形で近似的に求められるらしく、最尤推定として解くと最大20倍程度効率が向上した、といった話に見える。
関連:
- [Paper Note] Rewards as Labels: Revisiting RLVR from a Classification Perspective, Zepeng Zhai+, arXiv'26, 2026.02
- [Paper Note] Likelihood-Based Reward Designs for General LLM Reasoning, Ariel Kwiatkowski+, arXiv'26, 2026.02
所見:
所見:
[Paper Note] $V_0$: A Generalist Value Model for Any Policy at State Zero, Yi-Kai Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #In-ContextLearning #PostTraining #Stability #Scheduler #Routing #BudgetAllocation Issue Date: 2026-02-05 GPT Summary- GRPOを用いた訓練において、$V_0$という新たなバリューモデルを提案。これはパラメータ更新を必要とせず、モデルの期待パフォーマンスを推定し、能力の変化を捉える。$V_0$は成功率を予測し、効率的なサンプリングを実現。結果、LLMルーティングタスクにおいて、コストとパフォーマンスのバランスで優れた結果を示した。 Comment
元ポスト:
ポイント解説:
Actor-Critiqueの枠組みにおいてValueモデル(のポリシーに追従するための逐次的な更新が)重すぎる問題をGRPOはValueモデルを無くすことで回避したが今度はロールアウトのサンプリングコストがでかすぎる問題があるので、学習無しで汎用的に利用可能なValueモデル(パラメータ更新ではなくICLとして定義する)を用いて、ロールアウト前から成功率を予測し無駄なロールアウトを削減したり、クエリをどのモデルに投げるかといったルーティングをするなどの計算機リソースの配分を決めるといったことをやるらしい。
[Paper Note] HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing, Yizhao Gao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Attention #Architecture #KV Cache #Hybrid #SparseAttention Issue Date: 2026-02-05 GPT Summary- 新しいアーキテクチャ「ハイブリッド疎注意」(HySparse)を提案。全注意層と疎注意層を交互に配置し、疎層のトークン選択を全注意層から導出。これにより、トークンの重要性予測が簡素化され、KVキャッシュの再利用が可能に。評価では、7B密集モデルと80B MoEモデルの両方で全注意およびハイブリッドSWAのベースラインを超え、特に49層の80B MoEモデルで顕著な性能向上とKVキャッシュの10倍削減を実現。 Comment
元ポスト:
ポイント解説:
Full attentionとsparse attentionを組み合わせたアーキテクチャの提案で、Full attentionと同等以上の性能を効率的に達成し、sparse attentionではfull attentionのKV Cacheを再利用するように設計されていることから、KV Cacheのスペースを大幅に削減できて嬉しい、という話に見える。
