AIAgents (883) — 3/5
[Paper Note] Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents, Zonghan Yang+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #SoftwareEngineering #read-later #Selected Papers/Blogs #reading #KeyPoint Notes #Author Thread-Post Issue Date: 2025-10-02 GPT Summary- 大規模言語モデル(LLMs)のソフトウェア工学(SWE)への応用が進んでおり、SWE-benchが重要なベンチマークとなっている。マルチターンのSWE-Agentフレームワークと単一ターンのエージェントレス手法は相互排他的ではなく、エージェントレストレーニングが効率的なSWE-Agentの適応を可能にする。本研究では、Kimi-DevというオープンソースのSWE LLMを紹介し、SWE-bench Verifiedで60.4%を達成。追加の適応により、Kimi-DevはSWE-Agentの性能を48.6%に引き上げ、移植可能なコーディングエージェントの実現を示した。 Comment
元ポスト:
Agentlessはこちら:
- [Paper Note] Demystifying LLM-based Software Engineering Agents, Chunqiu Steven Xia+, FSE'25, 2024.07
著者ポスト:
ポストの中でOpenhandsが同モデルを内部で検証し、Openhandsの環境内でSWE Bench Verifiedで評価した結果、レポート内で報告されているAcc. 60.4%は達成できず、17%に留まることが報告されていた模様。
Openhandsの説明によるとAgentlessは決められた固定されたワークフローのみを実施する枠組み(Kimi Devの場合はBugFixerとFileEditor)であり、ワークフローで定義されたタスクは効果的に実施できるが、それら以外のタスクはそもそもうまくできない。SWE Agent系のベンチのバグfixの方法は大きく分けてAgentlike(コードベースを探索した上でアクションを実行する形式)、Fixed workflow like Agentless(固定されたワークフローのみを実行する形式)の2種類があり、Openhandsは前者、Kimi Devは後者の位置付けである。
実際、テクニカルレポートのFigure2とAppendixを見ると、File Localization+BugFixer+TestWriterを固定されたプロンプトテンプレートを用いてmid-trainingしており、評価する際も同様のハーネスが利用されていると推察される(どこかに明示的な記述があるかもしれない)。
一方、Openhandsではより実環境の開発フローに近いハーネス(e.g., エージェントがコードベースを確認してアクションを提案→実行可能なアクションなら実行→そうでないならユーザからのsimulated responceを受け取る→Agentに結果をフィードバック→エージェントがアクション提案...)といったハーネスとなっている。
このように評価をする際のハーネスが異なるため、同じベンチマークに対して異なる性能が報告される、ということだと思われる。
単にSWE Bench VerifiedのAcc.だけを見てモデルを選ぶのではなく、評価された際のEvaluation Harnessが自分たちのユースケースに合っているかを確認することが重要だと考えられる。
参考:
- OpenhandsのEvaluation Harness:
https://docs.all-hands.dev/openhands/usage/developers/evaluation-harness
[Paper Note] RecoWorld: Building Simulated Environments for Agentic Recommender Systems, Fei Liu+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#RecommenderSystems #LanguageModel #ReinforcementLearning Issue Date: 2025-09-30 GPT Summary- RecoWorldは、エージェント型レコメンダーシステムのためのシミュレーション環境を提案し、エージェントがユーザーに影響を与えずに学習できる場を提供します。ユーザーシミュレーターとエージェント型レコメンダーがマルチターンのインタラクションを行い、ユーザーの保持を最大化します。ユーザーシミュレーターはユーザーの反応を基に指示を生成し、レコメンダーはそれに応じて推奨を適応させる動的なフィードバックループを形成します。さらに、テキストベースやマルチモーダルなコンテンツ表現を探求し、マルチターン強化学習を通じて戦略を洗練させる方法を議論します。RecoWorldは、ユーザーとエージェントが共同でパーソナライズされた情報を形成する新しいインタラクションパラダイムを提示します。 Comment
元ポスト:
[Paper Note] SWE-QA: Can Language Models Answer Repository-level Code Questions?, Weihan Peng+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #Dataset #QuestionAnswering #Evaluation #Coding #SoftwareEngineering Issue Date: 2025-09-27 GPT Summary- SWE-QAは、ソフトウェアリポジトリ全体を理解し推論するための新しいコード質問応答ベンチマークで、576の高品質な質問-回答ペアを含む。これは、複数のファイルをナビゲートし、ソフトウェアアーキテクチャや長距離のコード依存関係を理解する能力を評価するために設計された。LLMエージェントを用いたプロトタイプSWE-QA-Agentも開発され、実験によりLLMの可能性と今後の研究課題が示された。 Comment
元ポスト:
コードスニペットレベルではなく、リポジトリレベルのコードベースの理解が求められるQAベントマーク
[Paper Note] ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution, Robert Tjarko Lange+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #ScientificDiscovery #read-later #Selected Papers/Blogs #EvolutionaryAlgorithm Issue Date: 2025-09-25 GPT Summary- ShinkaEvolveは、科学的発見を促進するための新しいオープンソースフレームワークであり、LLMsを利用して高い効率性とパフォーマンスを実現します。従来のコード進化手法の制限を克服し、親サンプリング技術や新規性拒否サンプリング、バンディットベースのアンサンブル選択戦略を導入。多様なタスクでの評価により、サンプル効率と解の質が向上し、150サンプルで新たな最先端ソリューションを発見しました。ShinkaEvolveは、オープンソースでのアクセス性を提供し、計算問題における発見を民主化します。 Comment
pj page: https://sakana.ai/shinka-evolve/
元ポスト:
国際的なプログラミングコンテストでShinkaEvolveのサポートの元、チームが優勝した模様:
-
-
ShinkaEvolveの公開から現在までの軌跡:
[Paper Note] LIMI: Less is More for Agency, Yang Xiao+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Supervised-FineTuning (SFT) Issue Date: 2025-09-23 GPT Summary- AIシステムのエージェンシーを、自律的に問題を発見し解決策を実行する能力と定義。急速に変化する業界のニーズに応じて、単なる推論を超えた自律的なエージェントが求められている。LIMI(Less Is More for Intelligent Agency)は、最小限のトレーニングサンプルで高いエージェンシーを実現する新たな原則を提案し、78サンプルで73.5%の成果を達成。これは、従来のデータ量に依存するアプローチに対する挑戦であり、高品質なデモの戦略的キュレーションが重要であることを示している。 Comment
元ポスト:
LLM AgentのSFTにおけるLess is more
参考:
- [Paper Note] LIMA: Less Is More for Alignment, Chunting Zhou+, arXiv'23, 2023.05
ポイント解説:
[Paper Note] ARE: Scaling Up Agent Environments and Evaluations, Pierre Andrews+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-09-23 GPT Summary- Meta Agents Research Environments (ARE)を紹介し、エージェントのオーケストレーションや環境のスケーラブルな作成を支援するプラットフォームを提供。Gaia2というベンチマークを提案し、エージェントの能力を測定するために設計され、動的環境への適応や他のエージェントとの協力を要求。Gaia2は非同期で実行され、新たな失敗モードを明らかにする。実験結果は、知能のスペクトル全体での支配的なシステムが存在しないことを示し、AREの抽象化が新しいベンチマークの迅速な作成を可能にすることを強調。AIの進展は、意味のあるタスクと堅牢な評価に依存する。 Comment
元ポスト:
GAIAはこちら:
- GAIA: a benchmark for General AI Assistants, Grégoire Mialon+, N/A, arXiv'23
Execution, Search, Ambiguity, Adaptability, Time, Noise, Agent2Agentの6つのcapabilityを評価可能。興味深い。
現状、全体的にはGPT-5(high)の性能が最も良く、続いてClaude-4 Sonnetという感じに見える。OpenWeightなモデルでは、Kimi-K2の性能が高く、続いてQwen3-235Bという感じに見える。また、Figure1はbudgetごとのモデルの性能も示されている。シナリオ単位のbudgetが$1以上の場合はGPT-5(high)の性能が最も良いが、$0.1--$0.4の間ではKiml-K2の性能が最も良いように見える。
- [Paper Note] GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models, GLM-4. 5 Team+, arXiv'25
しっかりと読めていないがGLM-4.5は含まれていないように見える。
ポイント解説:
[Paper Note] Latent learning: episodic memory complements parametric learning by enabling flexible reuse of experiences, Andrew Kyle Lampinen+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #In-ContextLearning #RAG(RetrievalAugmentedGeneration) #Generalization #ReversalCurse #memory Issue Date: 2025-09-22 GPT Summary- 機械学習システムの一般化失敗の原因として、潜在学習の欠如を指摘。認知科学の視点から、エピソード記憶やオラクルリトリーバルメカニズムが一般化を改善する手段であることを示す。文脈内学習が情報活用の鍵であり、リトリーバル手法がパラメトリック学習を補完することで、データ効率を向上させる可能性を提案。 Comment
元ポスト:
[Paper Note] ToolRL: Reward is All Tool Learning Needs, Cheng Qian+, NeurIPS'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #NeurIPS #Author Thread-Post Issue Date: 2025-09-20 GPT Summary- 大規模言語モデル(LLMs)のツール使用能力向上のため、報酬設計に関する初の包括的研究を行い、さまざまな報酬戦略を探求。ツール使用タスクに特化した報酬設計を提案し、GRPOを用いてLLMsを訓練。実証評価により、ベースモデルに対して17%、SFTモデルに対して15%の性能改善を達成。報酬設計の重要性を強調し、コードを公開。 Comment
元ポスト:
著者ポスト:
[Paper Note] OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents, Thomas Kuntz+, NeurIPS'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #Safety #NeurIPS Issue Date: 2025-09-19 GPT Summary- コンピュータ使用エージェントの安全性を評価するために、新しいベンチマークOS-Harmを導入。OS-Harmは、意図的な誤用、プロンプトインジェクション攻撃、不適切な行動の3つの危害をテストする150のタスクを含む。自動ジャッジを用いてエージェントの正確性と安全性を評価し、高い一致率を達成。最前線モデルの評価から、意図的な誤用に従う傾向や脆弱性が明らかになった。OS-Harmは、エージェントの安全性向上に寄与することを目指す。 Comment
元ポスト:
[Paper Note] WebSailor: Navigating Super-human Reasoning for Web Agent, Kuan Li+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData #Reasoning #On-Policy Issue Date: 2025-09-18 GPT Summary- WebSailorは、LLMのトレーニングにおいて人間の認知的限界を超えるためのポストトレーニング手法であり、複雑な情報探索タスクでの性能を向上させる。構造化サンプリングや情報の難読化、DUPOを用いて高不確実性タスクを生成し、オープンソースエージェントの能力を大幅に上回ることを目指す。
[Paper Note] WebDancer: Towards Autonomous Information Seeking Agency, Jialong Wu+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData Issue Date: 2025-09-18 GPT Summary- 複雑な問題解決のために、エンドツーエンドの情報探索エージェントを構築する一貫したパラダイムを提案。4つの主要ステージ(データ構築、軌跡サンプリング、教師ありファインチューニング、強化学習)を経て、WebDancerを実装。GAIAとWebWalkerQAでの評価により、強力なパフォーマンスを示し、トレーニングパラダイムの有効性を確認。コードは公開予定。
[Paper Note] BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese, Peilin Zhou+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Factuality Issue Date: 2025-09-18 GPT Summary- BrowseComp-ZHは、中国のウェブ上でLLMエージェントを評価するために設計された高難易度のベンチマークで、289のマルチホップ質問から構成される。二段階の品質管理プロトコルを適用し、20以上の言語モデルを評価した結果、ほとんどのモデルが10%未満の精度で苦戦し、最良のモデルでも42.9%にとどまった。この結果は、効果的な情報取得戦略と洗練された推論能力が必要であることを示している。 Comment
[Paper Note] ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization, Xixi Wu+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #read-later #ContextEngineering Issue Date: 2025-09-17 GPT Summary- ReSumという新しいパラダイムを導入し、定期的なコンテキスト要約を通じて無限の探索を可能にする。ReSum-GRPOを提案し、エージェントが要約条件付き推論に慣れるようにする。実験により、ReSumはReActに対して平均4.5%の改善を示し、WebResummer-30Bは既存のウェブエージェントを上回る性能を達成。 Comment
元ポスト:
[Paper Note] WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research, Zijian Li+, arXiv'25
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Planning #LongContext #read-later #DeepResearch #memory Issue Date: 2025-09-17 GPT Summary- 本論文では、AIエージェントがウェブ情報を統合してレポートを作成するオープンエンド深層研究(OEDR)に取り組み、WebWeaverという新しい二重エージェントフレームワークを提案。プランナーが証拠取得とアウトライン最適化を交互に行い、ライターが情報を階層的に検索してレポートを構成することで、長いコンテキストの問題を軽減。提案手法は主要なOEDRベンチマークで新たな最先端を確立し、高品質なレポート生成における人間中心のアプローチの重要性を示した。 Comment
元ポスト:
[Paper Note] Scaling Agents via Continual Pre-training, Liangcai Su+, arXiv'25
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #FoundationModel #read-later Issue Date: 2025-09-17 GPT Summary- 大規模言語モデル(LLMs)を用いたエージェントシステムは、複雑な問題解決において進化しているが、ポストトレーニングアプローチではパフォーマンスが低下することが多い。これは、堅牢な基盤モデルの欠如が原因である。そこで、継続的な事前トレーニング(Agentic CPT)を導入し、強力なエージェント基盤モデルを構築することを提案。新たに開発したAgentFounderモデルは、10のベンチマークで最先端のパフォーマンスを達成し、特にBrowseComp-enで39.9%、BrowseComp-zhで43.3%、HLEでのPass@1で31.5%を記録した。 Comment
元ポスト:
AI Agentのための基盤モデルを継続事前学習によって実現した模様
[Paper Note] Towards General Agentic Intelligence via Environment Scaling, Runnan Fang+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #read-later #MCP Issue Date: 2025-09-17 GPT Summary- 本研究では、エージェント知能を向上させるために環境を拡大し、関数呼び出し能力を強化するスケーラブルなフレームワークを提案。エージェントの訓練は二段階で行い、基本能力を付与した後、特定のドメインに特化させる。実験により、提案モデルAgentScalerが関数呼び出し能力を大幅に向上させることを示した。 Comment
元ポスト:
blog: https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
[Paper Note] WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents, Zile Qiao+, arXiv'25
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #read-later #DeepResearch Issue Date: 2025-09-17 GPT Summary- 新しいフレームワーク「WebResearcher」を提案し、AIエージェントが外部ソースから知識を自律的に発見・統合する方法を示す。WebResearcherは、深層研究をマルコフ決定過程として再定式化し、報告書に発見を統合することで文脈の問題を克服。また、スケーラブルなデータ合成エンジン「WebFrontier」を用いて高品質なトレーニングデータを生成し、ツール使用能力を向上させる。実験により、WebResearcherは最先端の性能を達成し、商用システムを上回ることが確認された。 Comment
元ポスト:
blog: https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
OpenAI DeepResearchとベンチマーク上で同等の性能を実現したopenweightモデル
ベンチマーク:
- [Paper Note] Humanity's Last Exam, Long Phan+, arXiv'25, 2025.01
- [Paper Note] BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents, Jason Wei+, arXiv'25
- GAIA: a benchmark for General AI Assistants, Grégoire Mialon+, N/A, arXiv'23
- [Paper Note] WebWalker: Benchmarking LLMs in Web Traversal, Jialong Wu+, arXiv'25
- [Paper Note] Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation, Satyapriya Krishna+, NAACL'25
- [Paper Note] BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language
Models in Chinese, Peilin Zhou+, arXiv'25
[Paper Note] Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents, Jiacheng Miao+, arXiv'25
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ScientificDiscovery #Reproducibility #MCP Issue Date: 2025-09-17 GPT Summary- Paper2Agentは、研究論文をAIエージェントに自動変換するフレームワークで、研究成果の利用や発見を加速します。従来の論文は再利用の障壁を生んでいましたが、Paper2Agentは論文を知識豊富な研究アシスタントとして機能するエージェントに変換します。複数のエージェントを用いて論文と関連コードを分析し、モデルコンテキストプロトコル(MCP)を構築、洗練します。これにより、自然言語を通じて科学的クエリを実行できるエージェントを作成し、実際にゲノム変異やトランスクリプトミクス分析を行うエージェントが元の論文の結果を再現できることを示しました。Paper2Agentは、静的な論文を動的なAIエージェントに変えることで、知識の普及に新たなパラダイムを提供します。 Comment
code: https://github.com/jmiao24/Paper2Agent?tab=readme-ov-file#-demos
論文を論文が提案する技術の機能を提供するMCPサーバに変換し、LLM Agentを通じてユーザはsetup無しに呼びだして利用できるようにする技術な模様。論文から自動的にcodebaseを同定し、コアとなる技術をMCP toolsとしてラップし、反復的なテストを実施してロバストにした上でHF上のAI Agentに提供する、みたいな感じに見える。
ポイント解説:
[Paper Note] SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?, John Yang+, ICLR'25
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LanguageModel #Evaluation #MultiModal #ICLR #SoftwareEngineering #VisionLanguageModel Issue Date: 2025-09-16 GPT Summary- 自律システムのバグ修正能力を評価するために、SWE-bench Mを提案。これは視覚要素を含むJavaScriptソフトウェアのタスクを対象とし、617のインスタンスを収集。従来のSWE-benchシステムが視覚的問題解決に苦労する中、SWE-agentは他のシステムを大きく上回り、12%のタスクを解決した。 Comment
openreview: https://openreview.net/forum?id=riTiq3i21b
[Paper Note] The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs, Akshit Sinha+, arXiv'25
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Reasoning #LongContext #Scaling Laws #read-later #Selected Papers/Blogs #ContextEngineering #Author Thread-Post Issue Date: 2025-09-14 GPT Summary- LLMsのスケーリングが収益に影響を与えるかを探求。単一ステップの精度向上がタスクの長さに指数的改善をもたらすことを観察。LLMsが長期タスクで失敗するのは推論能力の欠如ではなく実行ミスによると主張。知識と計画を明示的に提供することで実行能力を向上させる提案。モデルサイズをスケーリングしても自己条件付け効果は減少せず、長いタスクでのミスが増加。思考モデルは自己条件付けを行わずに長いタスクを実行可能。最終的に、実行能力に焦点を当てることで、LLMsの複雑な推論問題解決能力と単純タスクの長期化による失敗理由を調和させる。 Comment
元ポスト:
single stepでのタスク性能はサチって見えても、成功可能なタスクの長さは(single stepの実行エラーに引きづられるため)モデルのsingle stepのタスク性能に対して指数関数的に効いている(左上)。タスクが長くなればなるほどモデルは自身のエラーに引きずられ(self conditioning;右上)、これはパラメータサイズが大きいほど度合いが大きくなる(右下; 32Bの場合contextにエラーがあって場合のloeg horizonのAcc.が14Bよりも下がっている)。一方で、実行可能なstep数の観点で見ると、モデルサイズが大きい場合の方が多くのstepを要するタスクを実行できる(左下)。また、ThinkingモデルはSelf Conditioningの影響を受けにくく、single stepで実行可能なタスクの長さがより長くなる(中央下)。
といった話に見えるが、論文をしっかり読んだ方が良さそう。
(元ポストも著者ポストだが)著者ポスト:
このスレッドは読んだ方が良い(というか論文を読んだ方が良い)。
特に、**CoTが無い場合は**single-turnでほとんどのモデルは5 stepのタスクをlatent spaceで思考し、実行することができないというのは興味深い(が、細かい設定は確認した方が良い)。なので、マルチステップのタスクは基本的にはplanningをさせてから出力をさせた方が良いという話や、
では複雑なstepが必要なタスクはsingle turnではなくmulti turnに分けた方が良いのか?と言うと、モデルによって傾向が違うらしい、といった話が書かれている。たとえば、Qwenはsingle turnを好むが、Gemmaはmulti turnを好むらしい。
日本語ポイント解説:
解説:
[Paper Note] MedBrowseComp: Benchmarking Medical Deep Research and Computer Use, Shan Chen+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Medical Issue Date: 2025-09-13 GPT Summary- 大規模言語モデル(LLMs)は臨床意思決定支援に期待されているが、異種の知識ベースを統合する厳格な精度が求められる。既存の評価は実用性が不明確であるため、MedBrowseCompを提案。これは、医療従事者が情報を調整する臨床シナリオを反映した1,000以上の質問を含む初のベンチマークである。最前線のエージェントシステムに適用した結果、パフォーマンス不足が10%に達し、LLMの能力と臨床環境の要求との間に重要なギャップが示された。MedBrowseCompは信頼性の高い医療情報探索のためのテストベッドを提供し、将来のモデル改善の目標を設定する。 Comment
[Paper Note] WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents, Junteng Liu+, arXiv'25
Paper/Blog Link My Issue
#GraphBased #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData #LongContext #read-later Issue Date: 2025-09-10 GPT Summary- 本研究では、情報探索のためのデータ不足に対処するため、WebExplorerというモデルベースの探索手法を提案。これにより、複雑なクエリ-回答ペアを生成し、高度なウェブエージェントWebExplorer-8Bを開発。128Kのコンテキスト長を持ち、最先端の情報探索ベンチマークで高いパフォーマンスを達成。特に、WebExplorer-8Bは他の大規模モデルを上回る精度を示し、長期的な問題解決に向けた実用的なアプローチを提供することが確認された。 Comment
元ポスト:
評価で利用されているデータ:
- [Paper Note] BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents, Jason Wei+, arXiv'25
- [Paper Note] Humanity's Last Exam, Long Phan+, arXiv'25, 2025.01
学習データの合成方法が肝
[Paper Note] An AI system to help scientists write expert-level empirical software, Eser Aygün+, arXiv'25
Paper/Blog Link My Issue
#NLP #Search #LanguageModel #ScientificDiscovery #read-later #TreeSearch Issue Date: 2025-09-10 GPT Summary- AIシステムを用いて質の指標を最大化する専門的な科学ソフトウェアを生成。大規模言語モデルと木探索を活用し、複雑な研究アイデアを統合。バイオインフォマティクスや疫学の分野で新しい手法を発見し、既存のモデルを上回る成果を達成。多様なタスクに対する新しい解決策を提供し、科学的進歩を加速することを目指す。 Comment
元ポスト:
BioML-bench: Evaluation of AI Agents for End-to-End Biomedical ML, Miller+, bioRxiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Medical #Biological Issue Date: 2025-09-10 Comment
元ポスト:
Biomedicalドメインにおける24種類の非常に複雑でnuancedな記述や画像の読み取りなどを含む実タスクによって構成される初めてのAgenticベンチマークとのこと。
[Paper Note] Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate, Andrea Wynn+, arXiv'25
Paper/Blog Link My Issue
#Multi #NLP Issue Date: 2025-09-10 GPT Summary- マルチエージェントディベートはAIの推論能力向上に有望だが、時には有害であることが判明。従来の研究が同質のエージェントに焦点を当てる中、モデルの能力の多様性が相互作用に与える影響を探求。実験により、ディベートが精度低下を引き起こす可能性を示し、強力なモデルでも弱いモデルを上回る状況で同様の結果が得られた。エージェントは誤った答えにシフトし、合意を優先する傾向があり、これがディベートの効果を損なうことを示唆している。 Comment
元ポスト:
元ポストを読んだ限り、マルチエージェントシステムにdebateをさせても必ずしも性能改善するわけではないよ、という話のようである。
複数のstrong llmの中にweak llmが混在すると、モデルはおべっかによって同意するようにalignmentされる傾向があるので、良い方向に議論が収束するとは限らず、コンセンサスをとるような仕組みではなく、批判をする役目を設けるように設計するなどの工夫が必要、というような話らしい。
[Paper Note] SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, Ibragim Badertdinov+, NeurIPS'25, 2025.05
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #Coding #NeurIPS #SoftwareEngineering #read-later #Contamination-free #Selected Papers/Blogs #Live #Environment Issue Date: 2025-09-06 GPT Summary- LLMベースのエージェントのSWEタスクにおける課題として、高品質なトレーニングデータの不足と新鮮なインタラクティブタスクの欠如が挙げられる。これに対処するため、21,000以上のインタラクティブなPythonベースのSWEタスクを含む公的データセットSWE-rebenchを自動化されたパイプラインで構築し、エージェントの強化学習に適したベンチマークを提供。これにより、汚染のない評価が可能となり、いくつかのLLMの性能が過大評価されている可能性を示した。 Comment
pj page: https://swe-rebench.com
元ポスト:
コンタミネーションのない最新のIssueを用いて評価した結果、Sonnet 4が最も高性能
[Paper Note] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning, Haoming Wang+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #ReinforcementLearning #MultiModal #Reasoning #ComputerUse #VisionLanguageModel Issue Date: 2025-09-05 GPT Summary- UI-TARS-2は、GUI用自律エージェントの新しいモデルで、データ生成、安定化されたマルチターンRL、ハイブリッドGUI環境を統合。実証評価では、前モデルを大幅に上回り、複数のベンチマークで高いスコアを達成。約60%の人間レベルのパフォーマンスを示し、長期的な情報探索タスクにも適応可能。トレーニングダイナミクスの分析が安定性と効率向上の洞察を提供し、実世界のシナリオへの一般化能力を強調。 Comment
元ポスト:
1.5をリリースしてから5ヶ月で大幅に性能を向上した模様
[Paper Note] GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents, Manish Shetty+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Dataset #LanguageModel #Evaluation #Coding #SoftwareEngineering Issue Date: 2025-09-03 GPT Summary- 高性能ソフトウェア開発における言語モデルの能力を評価するためのベンチマークGSOを提案。102の最適化タスクを特定する自動化パイプラインを開発し、主要なソフトウェアエンジニアリングエージェントの成功率は5%未満であることを示した。定性的分析により、低レベル言語や最適化戦略の課題が明らかになった。研究の進展のために、ベンチマークのコードとエージェントのデータを公開。 Comment
pj page: https://gso-bench.github.io
ソフトウェアの高速化に関するベンチ
元ポストに掲載されているリーダーボードはどこにあるのだろう。ざっと見た感じ見当たらない。
[Paper Note] The Landscape of Agentic Reinforcement Learning for LLMs: A Survey, Guibin Zhang+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #ReinforcementLearning Issue Date: 2025-09-03 GPT Summary- エージェント的強化学習(Agentic RL)は、従来の強化学習から大規模言語モデル(LLM)への適用におけるパラダイムシフトを示し、LLMを自律的な意思決定エージェントとして再構築します。本調査では、LLM-RLの単一ステップのマルコフ決定過程(MDP)とエージェント的RLの部分観測マルコフ決定過程(POMDP)を対比し、計画や推論などのエージェント能力を中心に二重分類法を提案します。強化学習は、静的なヒューリスティックから適応的なエージェント行動への変換に重要な役割を果たすと主張し、500以上の研究を統合してこの分野の機会と課題を明らかにします。 Comment
元ポスト:
[Paper Note] Memento: Fine-tuning LLM Agents without Fine-tuning LLMs, Huichi Zhou+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #memory #Test-time Learning/Adaptation Issue Date: 2025-09-02 GPT Summary- 本論文では、ファインチューニングを必要としない新しい学習パラダイムを提案し、メモリベースのオンライン強化学習を通じて低コストでの継続的な適応を実現します。これをメモリ拡張マルコフ決定過程(M-MDP)として形式化し、行動決定のためのニューラルケース選択ポリシーを導入。エージェントモデル「Memento」は、GAIA検証で87.88%の成功率を達成し、DeepResearcherデータセットでも最先端の手法を上回る性能を示しました。このアプローチは、勾配更新なしでのリアルタイム学習を可能にし、機械学習の進展に寄与します。 Comment
元ポスト:
元ポスト:
[Paper Note] AWorld: Orchestrating the Training Recipe for Agentic AI, Chengyue Yu+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP Issue Date: 2025-08-31 GPT Summary- AWorldというオープンソースシステムを導入し、エージェントと環境の相互作用を効率化。経験収集を14.6倍加速し、Qwen3-32Bベースのエージェントを訓練してGAIAの精度を21.59%から32.23%に向上。最難関レベルで商用モデルを超える性能を達成。 Comment
元ポスト:
解説:
[Paper Note] A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems, Jinyuan Fang+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #SelfCorrection #SelfImprovement Issue Date: 2025-08-31 GPT Summary- 自己進化型AIエージェントの研究が進展しており、動的環境に適応する能力を持つエージェントシステムの自動強化が求められている。本調査では、自己進化型エージェントの設計におけるフィードバックループを抽象化したフレームワークを提案し、システムの主要コンポーネントを強調。さらに、ドメイン特化型進化戦略や評価、安全性、倫理的考慮についても議論し、研究者や実務者に体系的な理解を提供することを目指す。 Comment
元ポスト:
[Paper Note] MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers, Zhenting Wang+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #MCP Issue Date: 2025-08-30 GPT Summary- MCP-Benchは、ツールの使用や調整、計画/推論を必要とする多段階タスクを評価するためのベンチマークであり、250のツールを持つ28のMCPサーバーにLLMsを接続します。従来のベンチマークとは異なり、相互に連携するツールセットを提供し、複雑なタスクを構築可能にします。タスクは、ツールの取得能力や多段階実行経路の計画能力をテストし、既存のベンチマークでは評価されていない能力を明らかにします。20のLLMに対する実験を通じて、MCP-Benchの課題が示されました。 Comment
元ポスト:
またしてもMCPに基づいたtool useのベンチマークが出た模様
[Paper Note] MK2 at PBIG Competition: A Prompt Generation Solution, Xu+, IJCAI WS AgentScen'25, 2025.08
Paper/Blog Link My Issue
#NLP #Planning #Prompting #Reasoning #IJCAI #Workshop #IdeaGeneration Issue Date: 2025-08-30 Comment
元ポスト:
Patentからmarket-readyなプロダクトのコンセプトを生成し評価するタスク(PBIG)に取り組んでいる。
Reasoningモデルはコストとレスポンスの遅さから利用せず(iterationを重ねることを重視)、LLMのアシストを受けながらpromptを何度もhuman in the loopでiterationしながら品質を高めていくアプローチをとり、リーダーボードで1st placeを獲得した模様。
[Paper Note] AI-Researcher: Autonomous Scientific Innovation, Jiabin Tang+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Proprietary #ScientificDiscovery Issue Date: 2025-08-29 GPT Summary- AI-Researcherという自律型研究システムを提案し、文献レビューから論文作成までの研究プロセスを自動化。Scientist-Benchを用いてAIの研究能力を評価し、実験により人間レベルの研究論文を生成する成功率を示す。この研究は、自律的な科学的革新の新たな基盤を築く。 Comment
github: https://github.com/HKUDS/AI-Researcher
元ポスト:
[Paper Note] Mobile-Agent-v3: Foundamental Agents for GUI Automation, Jiabo Ye+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SmallModel #ComputerUse #On-Policy #GUI #Asynchronous Issue Date: 2025-08-29 GPT Summary- 本論文では、GUI-OwlというGUIエージェントモデルを提案し、デスクトップおよびモバイル環境での最先端性能を達成したことを報告しています。特に、Mobile-Agent-v3フレームワークを導入し、性能を向上させました。GUI-Owlは、クラウドベースの仮想環境を利用した自己進化するデータ生成、エンドツーエンドの意思決定を支援する多様な機能、スケーラブルな強化学習フレームワークを特徴としています。これらの成果は、オープンソースとして公開されています。 Comment
github: https://github.com/X-PLUG/MobileAgent?tab=readme-ov-file
元ポスト:
ベンチマーク:
- [Paper Note] AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents, Christopher Rawles+, ICLR'25
- [Paper Note] OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, Tianbao Xie+, arXiv'24, 2024.04
Trajectory-aware Relative Policy Optimization
(TRPO)
[Paper Note] LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries, Ming Yin+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #MCP Issue Date: 2025-08-25 GPT Summary- 本研究では、AIエージェントが複数のMCPツールを協調的に使用してマルチステップタスクを解決する能力を評価するためのベンチマーク「LiveMCP-101」を提案。101の実世界のクエリを用い、真の実行計画を基にした新しい評価アプローチを導入。実験結果から、最前線のLLMの成功率が60%未満であることが示され、ツールのオーケストレーションにおける課題が明らかに。LiveMCP-101は、実世界のエージェント能力を評価するための基準を設定し、自律AIシステムの実現に向けた進展を促進する。 Comment
元ポスト:
解説:
[Paper Note] MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning, Justin Chih-Yao Chen+, EMNLP'25
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #SelfCorrection #EMNLP Issue Date: 2025-08-24 GPT Summary- MAgICoReは、LLMの推論を改善するための新しいアプローチで、問題の難易度に応じて洗練を調整し、過剰な修正を回避する。簡単な問題には粗い集約を、難しい問題には細かい反復的な洗練を適用し、外部の報酬モデルを用いてエラーの特定を向上させる。3つのエージェント(Solver、Reviewer、Refiner)によるマルチエージェントループを採用し、洗練の効果を確保する。Llama-3-8BおよびGPT-3.5で評価した結果、MAgICoReは他の手法を上回る性能を示し、反復が進むにつれて改善を続けることが確認された。 Comment
元ポスト:
[Paper Note] ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools, Shaofeng Yin+, arXiv'25
Paper/Blog Link My Issue
#Multi #ComputerVision #NLP #Dataset #LanguageModel #SyntheticData #VisionLanguageModel Issue Date: 2025-08-24 GPT Summary- 本研究では、実世界のツール使用能力を向上させるために、23Kのインスタンスからなる大規模マルチモーダルデータセット「ToolVQA」を提案。ToolVQAは、実際の視覚的コンテキストと多段階推論タスクを特徴とし、ToolEngineを用いて人間のようなツール使用推論をシミュレート。7B LFMを微調整した結果、テストセットで優れたパフォーマンスを示し、GPT-3.5-turboを上回る一般化能力を持つことが確認された。 Comment
人間による小規模なサンプル(イメージシナリオ、ツールセット、クエリ、回答、tool use trajectory)を用いてFoundation Modelに事前知識として与えることで、よりrealisticなscenarioが合成されるようにした上で新たなVQAを4k程度合成。その後10人のアノテータによって高品質なサンプルにのみFilteringすることで作成された、従来よりも実世界の設定に近く、reasoningの複雑さが高いVQAデータセットな模様。
具体的には、image contextxが与えられた時に、ChatGPT-4oをコントローラーとして、前回のツールとアクションの選択をgivenにし、人間が作成したプールに含まれるサンプルの中からLongest Common Subsequence (LCS) による一致度合いに基づいて人手によるサンプルを選択し、動的にcontextに含めることで多様なで実世界により近しいmulti step tooluseなtrajectoryを合成する、といった手法に見える。pp.4--5に数式や図による直感的な説明がある。なお、LCSを具体的にどのような文字列に対して、どのような前処理をした上で適用しているのかまでは追えていない。
元ポスト:
[Paper Note] MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers, Ziyang Luo+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #MCP Issue Date: 2025-08-22 GPT Summary- モデルコンテキストプロトコル(MCP)は、LLMを外部データソースに接続する新しい標準であり、MCP-Universeという包括的なベンチマークを導入。これにより、実際のアプリケーションにおけるLLMの評価が可能となる。6つのコアドメインをカバーし、厳密な評価手法を実装。主要なLLMは性能制限を示し、長文コンテキストや未知のツールの課題に直面。UIサポート付きの評価フレームワークをオープンソース化し、MCPエコシステムの革新を促進。 Comment
pj page: https://mcp-universe.github.io/
元ポスト:
解説:
[Paper Note] WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model, Tianqing Fang+, EMNLP'25
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #EMNLP Issue Date: 2025-08-22 GPT Summary- 自己改善エージェントのために、共進化するワールドモデルLLMを導入する新しいフレームワークを提案。これにより、エージェントのポリシーを洗練する自己指導型トレーニングデータを生成し、行動選択を導く先読みシミュレーションを実現。実験により、既存の自己進化エージェントに対して10%のパフォーマンス向上を示し、持続的な適応性を促進することを目指す。 Comment
元ポスト:
[Paper Note] MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents, Shilong Li+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #Evaluation #Factuality #read-later #Selected Papers/Blogs Issue Date: 2025-08-22 GPT Summary- MM-BrowseCompは、AIエージェントのマルチモーダル検索および推論能力を評価する新しいベンチマークで、224の手作りの質問を含む。これにより、画像や動画を含む情報の重要性を考慮し、テキストのみの手法の限界を示す。最先端モデルの評価では、OpenAI o3などのトップモデルでも29.02%の精度にとどまり、マルチモーダル能力の最適化不足が明らかになった。 Comment
元ポスト:
[Paper Note] Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL, Weizhen Li+, arXiv'25
Paper/Blog Link My Issue
#Single #EfficiencyImprovement #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #LongContext #read-later Issue Date: 2025-08-21 GPT Summary- Chain-of-Agents(CoA)という新しいLLM推論パラダイムを提案し、マルチエージェントシステムの協力を単一モデル内でエンドツーエンドに実現。マルチエージェント蒸留フレームワークを用いて、エージェント的な教師ありファインチューニングを行い、強化学習で能力を向上。得られたエージェント基盤モデル(AFMs)は、ウェブエージェントやコードエージェントの設定で新たな最先端性能を示す。研究成果はオープンソース化され、今後の研究の基盤を提供。 Comment
元ポスト:
マルチエージェントのように振る舞うシングルエージェントを、マルチエージェントから得られたtrajectoryを通じて蒸留することめ実現する手法を提案。SFTでcold startに対して訓練した後、verifiable reward (タスクを正常に完了できたか否か)でRLする模様。
データセットも公開されている模様
所見:
解説:
[Paper Note] Agent Laboratory: Using LLM Agents as Research Assistants, Samuel Schmidgall+, EMNLP'25 Findings
Paper/Blog Link My Issue
#NLP #LanguageModel #ScientificDiscovery #EMNLP #Findings Issue Date: 2025-08-21 GPT Summary- Agent Laboratoryは、全自動のLLMベースのフレームワークで、研究アイデアから文献レビュー、実験、報告書作成までのプロセスを完了し、質の高い研究成果を生成します。人間のフィードバックを各段階で取り入れることで、研究の質を向上させ、研究費用を84%削減。最先端の機械学習コードを生成し、科学的発見の加速を目指します。 Comment
元ポスト:
pj page: https://agentlaboratory.github.io
[Paper Note] ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents, Hanyu Lai+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #ComputerUse Issue Date: 2025-08-20 GPT Summary- ComputerRLは、自律的なデスクトップインテリジェンスのためのフレームワークで、API-GUIパラダイムを用いてエージェントがデジタルワークスペースを操作します。分散RLインフラを開発し、数千の仮想デスクトップ環境でのスケーラブルな強化学習を実現。Entropulseトレーニング戦略により、長期トレーニング中のエントロピー崩壊を軽減。GLM-4-9B-0414を用いたAutoGLM-OS-9Bは、OSWorldベンチマークで48.1%の新しい最先端精度を達成し、デスクトップ自動化における重要な改善を示しました。 Comment
ポイント解説:
ポイント解説:
[Paper Note] xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations, Kaiyuan Chen+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Selected Papers/Blogs #CrossDomain #Live Issue Date: 2025-08-18 GPT Summary- 「xbench」は、AIエージェントの能力と実世界の生産性のギャップを埋めるために設計された動的な評価スイートで、業界専門家が定義したタスクを用いて商業的に重要なドメインをターゲットにしています。リクルートメントとマーケティングの2つのベンチマークを提示し、エージェントの能力を評価するための基準を確立します。評価結果は継続的に更新され、https://xbench.org で入手可能です。
[Paper Note] BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents, Jason Wei+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #read-later #Selected Papers/Blogs Issue Date: 2025-08-16 GPT Summary- BrowseCompは、エージェントのウェブブラウジング能力を測定するための1,266の質問からなるベンチマークで、絡み合った情報を探すことを要求します。シンプルで使いやすく、短い回答が求められ、参照回答との照合が容易です。このベンチマークは、ブラウジングエージェントの能力を評価するための重要なツールであり、持続力と創造性を測定します。詳細はGitHubで入手可能です。
[Paper Note] OpenCUA: Open Foundations for Computer-Use Agents, Xinyuan Wang+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2025-08-15 GPT Summary- OpenCUAは、CUAデータと基盤モデルをスケールさせるためのオープンソースフレームワークであり、アノテーションインフラ、AgentNetデータセット、反射的なChain-of-Thought推論を持つスケーラブルなパイプラインを提供。OpenCUA-32Bは、CUAベンチマークで34.8%の成功率を達成し、最先端の性能を示す。研究コミュニティのために、アノテーションツールやデータセットを公開。 Comment
元ポスト:
著者ポスト:
CUAにおいてProprietaryモデルに近い性能を達成した初めての研究な模様。重要
続報:
OSWorld VerifiedでUI-TARS-250705,claude-4-sonnet-20250514超えでtop1に君臨とのこと。
[Paper Note] Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL, Jiaxuan Gao+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Search #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #Asynchronous #Author Thread-Post Issue Date: 2025-08-14 GPT Summary- ASearcherは、LLMベースの検索エージェントの大規模なRLトレーニングを実現するオープンソースプロジェクトであり、高効率な非同期RLトレーニングと自律的に合成された高品質なQ&Aデータセットを用いて、検索能力を向上させる。提案されたエージェントは、xBenchで46.7%、GAIAで20.8%の改善を達成し、長期的な検索能力を示した。モデルとデータはオープンソースで提供される。 Comment
元ポスト:
著者ポスト:
解説ポスト:
関連ベンチマーク:
- [Paper Note] xbench: Tracking Agents Productivity Scaling with Profession-Aligned
Real-World Evaluations, Kaiyuan Chen+, arXiv'25
- GAIA: a benchmark for General AI Assistants, Grégoire Mialon+, N/A, arXiv'23
- [Paper Note] Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation, Satyapriya Krishna+, N/A, NAACL'25
既存のモデルは <= 10 turnsのデータで学習されており、大規模で高品質なQAデータが不足している問題があったが、シードQAに基づいてQAを合成する手法によって1.4万シードQAから134kの高品質なQAを合成した(うち25.6kはツール利用が必要)。具体的には、シードのQAを合成しエージェントがQAの複雑度をiterationをしながら向上させていく手法を提案。事実情報は常にverificationをされ、合成プロセスのiterationの中で保持され続ける。個々のiterationにおいて、現在のQAと事実情報に基づいて、エージェントは
- Injection: 事実情報を新たに注入しQAをよりリッチにすることで複雑度を上げる
- Fuzz: QA中の一部の詳細な情報をぼかすことで、不確実性のレベルを向上させる。
の2種類の操作を実施する。その上で、QAに対してQuality verificationを実施する:
- Basic Quality: LLMでqualityを評価する
- Difficulty Measurement: LRMによって、複数の回答候補を生成する
- Answer Uniqueness: Difficulty Measurementで生成された複数の解答情報に基づいて、mismatched answersがvalid answerとなるか否かを検証し、正解が単一であることを担保する
また、複雑なタスク、特にtool callsが非常に多いタスクについては、多くのターン数(long trajectories)が必要となるが、既存のバッチに基づいた学習手法ではlong trajectoriesのロールアウトをしている間、他のサンプルの学習がブロックされてしまい学習効率が非常に悪いので、バッチ内のtrajectoryのロールアウトとモデルの更新を分離(ロールアウトのリクエストが別サーバに送信されサーバ上のInference Engineで非同期に実行され、モデルをアップデートする側は十分なtrajectoryがバッチ内で揃ったらパラメータを更新する、みたいな挙動?)することでIdleタイムを無くすような手法を提案した模様。
既存の手法ベンチマークの性能は向上している。学習が進むにつれて、trajectory中のURL参照回数やsearch query数などが増大していく曲線は考察されている。他モデルと比較して、より多いターン数をより高い正確性を以って実行できるといった定量的なデータはまだ存在しないように見えた。
[Paper Note] WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent, Xinyu Geng+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #LanguageModel #SyntheticData #Evaluation #MultiModal #VisionLanguageModel #DeepResearch Issue Date: 2025-08-14 GPT Summary- WebWatcherは、視覚と言語の推論能力を強化したマルチモーダルエージェントであり、情報探索の困難さに対処する。合成マルチモーダル軌跡を用いた効率的なトレーニングと強化学習により、深い推論能力を向上させる。新たに提案されたBrowseComp-VLベンチマークでの実験により、WebWatcherは複雑なVQAタスクで他のエージェントを大幅に上回る性能を示した。 Comment
元ポスト:
公式:
[Paper Note] LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?, Guozhao Mo+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #MCP Issue Date: 2025-08-13 GPT Summary- LiveMCPBenchは、10,000を超えるMCPサーバーに基づく95の実世界タスクから成る初の包括的なベンチマークで、LLMエージェントの大規模評価を目的としています。70のMCPサーバーと527のツールを含むLiveMCPToolを整備し、LLM-as-a-JudgeフレームワークであるLiveMCPEvalを導入して自動化された適応評価を実現しました。MCP Copilot Agentは、ツールを動的に計画し実行するマルチステップエージェントです。評価の結果、最も優れたモデルは78.95%の成功率を達成しましたが、モデル間で性能のばらつきが見られました。全体として、LiveMCPBenchはLLMエージェントの能力を評価するための新たなフレームワークを提供します。 Comment
pj page: https://icip-cas.github.io/LiveMCPBench/
元ポスト:
MCP環境におけるLLM Agentのベンチマーク。論文中のTable1に他のベンチマークを含めサマリが掲載されている。MCPを用いたLLMAgentのベンチがすでにこんなにあることに驚いた…。
[Paper Note] Memp: Exploring Agent Procedural Memory, Runnan Fang+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ContextEngineering #memory Issue Date: 2025-08-12 GPT Summary- 本研究では、LLMに基づくエージェントに学習可能で更新可能な手続き的記憶を持たせるための戦略を提案。Mempを用いて過去のエージェントの軌跡を指示や抽象に蒸留し、記憶の構築と更新を行う。TravelPlannerとALFWorldでの実証評価により、記憶リポジトリが進化することでエージェントの成功率と効率が向上することを示した。また、強力なモデルからの手続き的記憶の移行により、弱いモデルでも性能向上が得られることが確認された。 Comment
元ポスト:
アドホックに探索と実行を繰り返すのではなく、過去の試行のtrajectoryをメモリに記憶しておき、活用するような枠組みな模様。trajectoryは新たなタスクが来た際にretrieverでrelevantなtrajectoryを検索して利用され、良質なtrajectoryがキープされれば成功率や効率が向上すると考えられる。trajectoryはprocedure memoryとして保存され、成功率が低いtrajectoryは破棄されることで更新される。
メモリはT個のタスクに対するs_t, a_t, o_t, i.e., state, action, observation,の系列τと、reward rが与えられた時に、Builderを通して構築されてストアされる。agentは新たなタスクt_newに直面した時に、t_newと類似したメモリをretrieyeする。これはτの中のある時刻tのタスクに対応する。メモリは肥大化していくため、実験では複数のアルゴリズムに基づくメモリの更新方法について実験している。
procedural memoryの有無による挙動の違いに関するサンプル。
memoryに対してretrieverを適用することになるので、retrieverの性能がボトルネックになると思われる。追加の学習をしなくて済むのは利点だが、その代わりモデル側がメモリ管理をする機能を有さない(学習すればそういった機能を持たせられるはず)ので、その点は欠点となる、という印象。
ポイント解説:
[Paper Note] NoCode-bench: A Benchmark for Evaluating Natural Language-Driven Feature Addition, Le Deng+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #SoftwareEngineering Issue Date: 2025-08-12 GPT Summary- 自然言語駆動のノーコード開発におけるLLMsの評価のために「NoCode-bench」を提案。634のタスクと114,000のコード変更から成り、ドキュメントとコード実装のペアを検証。実験結果では、最良のLLMsがタスク成功率15.79%に留まり、完全なNL駆動のノーコード開発には未だ課題があることが示された。NoCode-benchは今後の進展の基盤となる。 Comment
元ポスト:
リーダーボード: https://nocodebench.org
ドキュメントをソフトウェアの仕様書とみなし、ドキュメントの更新部分をらinputとし、対応する"機能追加"をする能力を測るベンチマーク
SoTAモデルでも15.79%程度しか成功しない。
元ポストによると、ファイルを跨いだ編集、コードベースの理解、tool useに苦労しているとのこと。
[Paper Note] Agent Lightning: Train ANY AI Agents with Reinforcement Learning, Xufang Luo+, arXiv'25
Paper/Blog Link My Issue
#LanguageModel #ReinforcementLearning #SoftwareEngineering Issue Date: 2025-08-10 GPT Summary- Agent Lightningは、任意のAIエージェントのためにLLMsを用いたRLトレーニングを可能にする柔軟なフレームワークで、エージェントの実行とトレーニングを分離し、既存のエージェントとの統合を容易にします。マルコフ決定過程としてエージェントの実行を定式化し、階層的RLアルゴリズムLightningRLを提案。これにより、複雑な相互作用ロジックを扱うことが可能になります。実験では、テキストからSQLへの変換などで安定した改善が見られ、実世界でのエージェントトレーニングの可能性が示されました。 Comment
元ポスト:
[Paper Note] A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence, Huan-ang Gao+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #SelfCorrection #SelfImprovement Issue Date: 2025-07-30 GPT Summary- 大規模言語モデル(LLMs)は静的であり、動的な環境に適応できないため、自己進化するエージェントの必要性が高まっている。本調査は、自己進化するエージェントに関する初の包括的レビューを提供し、進化の基礎的な次元を整理。エージェントの進化的メカニズムや適応手法を分類し、評価指標や応用分野を分析。最終的には、エージェントが自律的に進化し、人間レベルの知能を超える人工超知能(ASI)の実現を目指す。 Comment
元ポスト:
Figure3がとても勉強になる。Self-Evolveと呼んだ時に、それがどのようにEvolveするものなのかはきちんとチェックした方が良さそう。追加の学習をするのか否かなど。これによって使いやすさが段違いになりそうなので。
[Paper Note] EduThink4AI: Translating Educational Critical Thinking into Multi-Agent LLM Systems, Xinmeng Hou+, arXiv'25
Paper/Blog Link My Issue
#Multi #NLP #Prompting Issue Date: 2025-07-29 GPT Summary- EDU-Promptingは、教育的批判的思考理論とLLMエージェント設計を結びつけ、批判的でバイアスを意識した説明を生成する新しいマルチエージェントフレームワーク。これにより、AI生成の教育的応答の真実性と論理的妥当性が向上し、既存の教育アプリケーションに統合可能。 Comment
元ポスト:
Critiqueを活用したマルチエージェントのようである(具体的なCritiqueの生成方法については読めていない。その辺が重要そう
[Paper Note] Deep Researcher with Test-Time Diffusion, Rujun Han+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #LLM-as-a-Judge #SelfCorrection #DeepResearch Issue Date: 2025-07-25 GPT Summary- TTD-DRは、LLMsを用いた研究報告書生成の新しいフレームワークで、草案から始まり、デノイジングプロセスを通じて情報を動的に取り入れながら洗練される。自己進化アルゴリズムにより高品質なコンテキストを生成し、情報損失を減少させる。TTD-DRは、集中的な検索とマルチホップ推論を必要とするベンチマークで最先端の結果を達成し、既存の深層研究エージェントを上回る性能を示す。 Comment
元ポスト:
Self-Evolutionというのは、モデルのパラメータを更新するというものではなく、Agentに渡すContextをLLM-as-a-Judgeのスコアが改善するように、フィードバックとして得られるcritiqueなどを通じて反復的にoutput(=別のAgentにcontextとして渡される情報)を洗練させていくような方法のことを指している模様。このようなプロセスを複数のパスで実施し、最終的にマージすることで高品質なoutput(context)を得る。
日本語解説: https://zenn.dev/knowledgesense/articles/5a341158c2c9ab
[Paper Note] A Survey of Context Engineering for Large Language Models, Lingrui Mei+, arXiv'25
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #ContextEngineering Issue Date: 2025-07-19 GPT Summary- 本調査では、LLMsの性能を向上させる「コンテキストエンジニアリング」を提案し、その要素と実装方法を体系的に分類。コンテキストの取得、生成、処理、管理を検討し、洗練されたシステム実装を探る。1300以上の研究を分析し、モデルの能力の非対称性を明らかにし、複雑な文脈理解と長文出力生成のギャップに対処する重要性を強調。研究者とエンジニアのための統一フレームワークを提供。 Comment
もうContext Engineeringという切り口の体系化されたSurveyが出てきた。早すぎ。
元ポスト:
[Paper Note] SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?, Xinyi He+, arXiv'25
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Dataset #Evaluation #SoftwareEngineering Issue Date: 2025-07-18 GPT Summary- コードのパフォーマンス最適化は重要であり、LLMsのリポジトリレベルでの能力は未探求。これに対処するため、SWE-Perfという初のベンチマークを導入。140のインスタンスを用いて、LLMsと専門家の最適化パフォーマンスのギャップを評価し、研究機会を示す。 Comment
元ポスト:
これまでのSWE系のベンチマークはBug Fixなどにフォーカスされてきたが、こちらのベンチマークはソフトウェアのパフォーマンス(i.e., 実行時間)を改善させられるかにフォーカスしているとのこと。
実際にリポジトリからPRを収集し、パッチ前後の実行時間を比較。20回のrunを通じて統計的に有意な実行時間の差があるもののみにフィルタリングをしているとのこと。
Human Expertsは平均10.9%のgainを得たが、エージェントは2.3%にとどまっており、ギャップがあるとのこと。
傾向として、LLMはlow levelなインフラストラクチャ(環境構築, 依存関係のハンドリング, importのロジック)を改善するが、Human Expertsはhigh levelなロジックやデータ構造を改善する(e.g., アルゴリズムや、データハンドリング)。
[Paper Note] Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents, Saaket Agashe+, COLM'25, 2025.04
Paper/Blog Link My Issue
#COLM #ComputerUse #VisionLanguageModel #GUI #Author Thread-Post Issue Date: 2025-07-09 GPT Summary- GUIを直接操作するコンピュータ利用エージェントにおいて、複数の汎用モデル・専門モデルに役割分担させるAgent S2を提案。 Mixture-of-GroundingでGUI要素の位置特定を高精度化し、Proactive Hierarchical Planningで複数時間スケールの行動計画を動的に改善。 OSWorld、WindowsAgentArena、AndroidWorldの3ベンチマークでSOTAを達成し、主要ベースラインを大きく上回る性能を実現。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=zg5is4GJ3R
[Paper Note] AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench, Edan Toledo+, NeurIPS'25, 2025.07
Paper/Blog Link My Issue
#GraphBased #NLP #Search #LanguageModel #ScientificDiscovery #NeurIPS #read-later #Selected Papers/Blogs #EvolutionaryAlgorithm #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2025-07-08 GPT Summary- AI研究エージェントを、演算子で候補解を反復的に変更する探索方策として定式化。 異なる演算子集合と貪欲法・MCTS・進化的手法を組み合わせ、相互作用を体系的に検証。 最良の組み合わせにより、MLE-bench liteでKaggleメダル獲得成功率を39.6%から47.7%に向上させ、最先端性能を達成。 Comment
元ポスト:
関連:
- MLE-Bench, OpenAI, 2024.10
グラフ中の各ノードはartifacts(i.e., エージェントが生成したコード)で、先行研究がiterativeな実験に加え、潜在的なsolutionに対してtree searchをすることでSoTAを達成しており、これをグラフを用いてより一般化することで異なるデザインのエージェントでも適用できるようにしている。
あとで追記する
openreview: https://openreview.net/forum?id=RwfrdKSgCE
[Paper Note] Future of Work with AI Agents: Auditing Automation and Augmentation Potential across the U.S. Workforce, Yijia Shao+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #GenerativeAI #Investigation Issue Date: 2025-07-02 GPT Summary- AIエージェントによる職務自動化に対する労働者の希望と、現在の技術的能力の一致度を評価する監査フレームワークを提案。 音声インタビューとHuman Agency Scale(HAS)を用いて、104職種・844以上のタスク・1,500人の労働者を対象とするWORKBankを構築し、タスクを自動化のグリーンライト、レッドライト、研究開発機会、優先度の低い領域に分類。 職種ごとに人間の関与への希望は異なり、AI導入によって情報重視のスキルから対人スキルへ重点が移行する可能性を示した。 Comment
元ポスト:
[Paper Note] The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements, Bingchen Zhao+, arXiv'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ScientificDiscovery #Reproducibility Issue Date: 2025-06-30 GPT Summary- 大規模言語モデル(LLMs)の進展を活用し、AIエージェントの研究再現能力を評価するために、LLMスピードランベンチマークを導入。19のタスクで訓練スクリプトとヒントを提供し、迅速な実行を促進。既知の革新の再実装が難しいことを発見し、科学的再現を自動化するための指標を提供。 Comment
元ポスト:
[Paper Note] ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering, Yuki Imajuku+, NeurIPS'25
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #Coding #LongContext #ScientificDiscovery #NeurIPS #Author Thread-Post Issue Date: 2025-06-17 GPT Summary- AIシステムの最適化問題に対するパフォーマンスを評価する新しいベンチマークALE-Benchを提案。ALE-Benchは実際のタスクに基づき、長期的な解決策の洗練を促進する。大規模言語モデル(LLM)の評価では特定の問題で高いパフォーマンスを示すが、一貫性や長期的な問題解決能力において人間とのギャップが残ることが明らかになり、今後のAI進展に向けた必要性を示唆している。 Comment
元ポスト:
関連ポスト:
NeurIPSにaccept:
[Paper Note] Go-Browse: Training Web Agents with Structured Exploration, Apurva Gandhi+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Author Thread-Post Issue Date: 2025-06-12 GPT Summary- Go-Browseを提案し、ウェブ環境の構造的探索を通じて多様なデータを自動収集。グラフ探索を用いて効率的なデータ収集を実現し、WebArenaベンチマークで成功率21.7%を達成。これはGPT-4o miniを2.4%上回り、10B未満のモデルでの最先端結果を2.9%上回る。 Comment
元ポスト:
[Paper Note] Training Language Models to Generate Quality Code with Program Analysis Feedback, Feng Yao+, NeurIPS'25
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Coding #NeurIPS #One-Line Notes #Author Thread-Post Issue Date: 2025-06-06 GPT Summary- プログラム分析に基づくフィードバックを用いた強化学習フレームワーク「REAL」を提案。セキュリティや保守性の欠陥を検出し、機能的正確性を保証することで、LLMsによる高品質なコード生成を促進。手動介入不要でスケーラブルな監視を実現し、実験により最先端の手法を上回る性能を示した。 Comment
元ポスト:
現在のCoding LLMはUnitTestを通るように学習されるが、UnitTestに通るからといってコードの品質が良いわけでは無いので、UnitTestに通るか否かのReward(Functionality)に加えて、RL中に生成されたコードを制御フローグラフ[^1]に変換し汚染解析[^2]をした結果をRewardに組み込むことで、FunctionalityとQualityを両立したよ、という話のようである。
Figure1のグラフの縦軸は、Functionalityと(UnitTestが通ったか否か)と、Quailty(セキュリティや保守性に関する問題が検出されなかった)、という両方の条件を満たした割合である点に注意。
[^1]:プログラムを実行したときに通る可能性のある経路のすべてをグラフとして表したもの[引用元](
https://qiita.com/uint256_t/items/7d4556cb8f5997b9e95c)
[^2]:信頼できない汚染されたデータがプログラム中でどのように処理されるかを分析すること
[Paper Note] Self-Challenging Language Model Agents, Yifei Zhou+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #SelfImprovement #Author Thread-Post Issue Date: 2025-06-03 GPT Summary- Self-Challengingフレームワークを用いて、エージェントが自己生成した高品質なタスクで訓練。エージェントはチャレンジャーとして役割を果たし、Code-as-Task形式でタスクを生成し、その後実行者として強化学習で評価。M3ToolEvalとTauBenchベンチマークで、Llama-3.1-8B-Instructが自己生成データのみで2倍以上の性能向上を達成。 Comment
元ポスト:
解説ポスト:
[Paper Note] Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering, Guangtao Zeng+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #SoftwareEngineering #read-later #Author Thread-Post Issue Date: 2025-06-01 GPT Summary- 言語モデルは標準化されたコーディングのベンチマークでは良好な性能を示すが、実世界のソフトウェア工学タスクには苦戦。特に1000億未満のパラメータ数では顕著で、小型モデルの性能改善は難しい。従来は教師ありファインチューニングに依存し、データ整備には高いコストがかかる。新たなアプローチとしてEvoScaleを提案。これは生成を進化プロセスとして扱い、反復的な出力改善を通じて高スコア領域にシフトさせることで、必要なサンプル数を削減。自己進化するよう強化学習で訓練され、外部検証器に依存せず自らスコアを改善。評価の結果、32BモデルSatori-SWE-32Bは少数のサンプルで1000億超モデルと同等以上の性能を達成。すべてのコード、データ、モデルはオープンソース。 Comment
元ポスト:
[Paper Note] AlphaEvolve: A coding agent for scientific and algorithmic discovery, Alexander Novikov+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #ScientificDiscovery Issue Date: 2025-05-17 GPT Summary- AlphaEvolveは、未解決の科学問題に取り組み、計算基盤を最適化するための進化的コーディングエージェントです。自律的にアルゴリズムを改善し、評価者のフィードバックを基に反復的に進化させ、新たな発見を促します。具体的には、データセンターの効率的なスケジューリングや回路設計の簡素化を実現し、高度な数学問題に対して新たな証明可能なアルゴリズムを導入しました。特に、56年ぶりにストラスレンのアルゴリズムを上回る新しい掛け算手法を発見しました。AlphaEvolveは、科学と計算分野への大きな貢献が期待されています。 Comment
[Paper Note] Why Do Multi-Agent LLM Systems Fail?, Mert Cemri+, arXiv'25, 2025.03
Paper/Blog Link My Issue
#Multi #Analysis #NLP #NeurIPS #One-Line Notes #Author Thread-Post Issue Date: 2025-04-26 GPT Summary- マルチエージェントLLMシステム(MAS)の性能向上が乏しい中、初の故障分類法MASTを提案。200以上のタスクを通じて14の故障モードを特定し、3つのカテゴリに整理。LLMを活用した評価パイプラインを開発し、故障分析の実用性を示す。特定された故障には複雑な解決策が必要であり、研究への道筋を強調。データセットとLLM注釈者をオープンソース化してMASの進展を促進。 Comment
元ポスト:
7つのメジャーなマルチエージェントフレームワークに対して200以上のタスクを実施し、6人の専門家がtraceをアノテーション。14種類の典型的なfailure modeを見つけ、それらを3つにカテゴライズ。これを考慮してマルチエージェントシステムの失敗に関するTaxonomy(MAS)を提案
[Paper Note] UI-TARS: Pioneering Automated GUI Interaction with Native Agents, Yujia Qin+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Blog #Reasoning #OpenWeight #ComputerUse #VisionLanguageModel #2D (Image) #One-Line Notes #text Issue Date: 2025-04-18 GPT Summary- UI-TARSは、スクリーンショットを入力として人間のような操作を行うエンドツーエンドのGUIエージェントモデルである。従来の商用モデルに依存せず、知覚、グラウンディング、GUIタスク実行において最先端の性能を発揮。OSWorldベンチマークでは、UI-TARSが高スコアを達成し、他のモデルを上回る。主要な革新には、強化された知覚、統一されたアクションモデリング、System-2推論、反省的オンライン・トレースによる反復的トレーニングが含まれる。これにより、UI-TARSは未知の状況にも適応可能な学習能力を持つ。GUIエージェントの進化経路も分析し、今後の発展を探る。 Comment
色々と書いてあるが、ざっくり言うとByteDanceによる、ImageとTextをinputとして受け取り、TextをoutputするマルチモーダルLLMによるComputer Use Agent (CUA)
関連
- OpenAI API での Computer use の使い方, npaka, 2025.03
元ポスト:
[Paper Note] Hallucination Mitigation using Agentic AI Natural Language-Based Frameworks, Diego Gosmar+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Hallucination Issue Date: 2025-04-11 GPT Summary- 複数の専門AIエージェントを協調させて生成系AIモデルの幻覚を緩和する研究。自然言語処理(NLP)を用いてエージェント間の相互作用を促進し、300以上の幻覚を誘発するプロンプトを導入。二次・三次エージェントが出力を検討し、異なるモデルを活用して主張を検出、免責事項を追加。新たに設計されたKPIを用いて幻覚的行動の変化を定量化。OVONフレームワークにより文脈情報を転送し、テキストを洗練する。これにより、幻覚の緩和に有望な成果が得られ、AIコミュニティ内での信頼が向上することを示唆。 Comment
元ポスト:
[Paper Note] Training Software Engineering Agents and Verifiers with SWE-Gym, Jiayi Pan+, ICML'25
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ICML #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Environment Issue Date: 2025-04-02 GPT Summary- SWE-Gymを提案し、2,438件の実世界のPythonタスクを含む環境を構築。言語モデルに基づくSWEエージェントを訓練し、SWE-Benchで最大19%の解決率向上を達成。微調整されたエージェントは新たな最先端の性能を示し、SWE-Gymやモデル、エージェントの軌跡を公開。 Comment
SWE-Benchとは完全に独立したより広範な技術スタックに関連するタスクに基づくSWEベンチマーク
- [Paper Note] SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, Carlos E. Jimenez+, ICLR'24
SWE-Benchと比べて実行可能な環境と単体テストが提供されており、単なるベンチマークではなくエージェントを訓練できる環境が提供されている点が大きく異なるように感じる。
[Paper Note] Demystifying LLM-based Software Engineering Agents, Chunqiu Steven Xia+, FSE'25, 2024.07
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SoftwareEngineering #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2025-04-02 GPT Summary- 最近のLLMの進展により、ソフトウェア開発タスクの自動化が進んでいるが、複雑なエージェントアプローチの必要性に疑問が生じている。これに対し、Agentlessというエージェントレスアプローチを提案し、シンプルな三段階プロセスで問題を解決。SWE-bench Liteベンチマークで最高のパフォーマンスと低コストを達成。研究は自律型ソフトウェア開発におけるシンプルで解釈可能な技術の可能性を示し、今後の研究の方向性を刺激することを目指している。 Comment
日本語解説: https://note.com/ainest/n/nac1c795e3825
LLMによる計画の立案、環境からのフィードバックによる意思決定などの複雑なワークフローではなく、Localization(階層的に問題のある箇所を同定する)とRepair(LLMで複数のパッチ候補を生成する)、PatchValidation(再現テストと回帰テストの両方を通じて結果が良かったパッチを選ぶ)のシンプルなプロセスを通じてIssueを解決する。
これにより、低コストで高い性能を達成している、といった内容な模様。
Agentlessと呼ばれ手法だが、preprint版にあったタイトルの接頭辞だった同呼称がproceeding版では無くなっている。
[Paper Note] OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning, Pan Lu+, arXiv'25, 2025.02
Paper/Blog Link My Issue
#Tools #NLP #LanguageModel #Reasoning #ACL #One-Line Notes Issue Date: 2025-02-20 GPT Summary- OctoToolsは複雑な推論タスクを解決するための訓練不要で拡張可能なマルチエージェントフレームワーク。標準化されたツールカード、プランナー、実行者を導入し、16の多様なタスクでGP4oより平均精度を9.3%向上。AutoGenやLangChainに対しても最大10.6%の改善を示し、タスク計画とツール使用の効果を実証。詳細はサイトに公開。 Comment
元ポスト:
NAACL2025 KnowledgeNLP Workshopでベストペーパーに選出:
ACL2026のOralにaccept:
[Paper Note] Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?, Wenzhe Li+, TMLR'25, 2025.02
Paper/Blog Link My Issue
#NLP #LanguageModel #TMLR #read-later #Selected Papers/Blogs Issue Date: 2025-02-09 GPT Summary- Self-MoAは、単一の高性能LLMの出力を統合し、従来のMixture-of-Agents(MoA)を上回るアンサンブル手法である。実験では、Self-MoAがAlpacaEval 2.0で6.6%、様々なベンチマークで平均3.8%の改善を示し、新たな最先端性能を達成。MoAの性能は出力品質に敏感で、異なるLLMを混ぜると平均品質が低下することが確認された。さらに、Self-MoAの逐次版も導入し、複数ラウンドにわたって同等の統合効果を提供する。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=K6WwK8URlV
Towards Adaptive Mechanism Activation in Language Agent, Ziyang Huang+, COLING'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #COLING #PostTraining #One-Line Notes #needs-revision Issue Date: 2024-12-10 GPT Summary- 自己探索によるメカニズム活性化学習(ALAMA)を提案し、固定されたメカニズムに依存せずに適応的なタスク解決を目指す。調和のとれたエージェントフレームワーク(UniAct)を構築し、タスク特性に応じてメカニズムを自動活性化。実験結果は、動的で文脈に敏感なメカニズム活性化の有効性を示す。 Comment
元ポスト:
手法としては、SFTとKTOを活用しpost trainingするようである
- [Paper Note] KTO: Model Alignment as Prospect Theoretic Optimization, Kawin Ethayarajh+, ICML'24, 2024.02
[Paper Note] Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation, Satyapriya Krishna+, N_A, NAACL'25
Paper/Blog Link My Issue
#InformationRetrieval #NLP #Dataset #Evaluation #Factuality #RAG(RetrievalAugmentedGeneration) #Reasoning #NAACL #One-Line Notes Issue Date: 2024-10-20 GPT Summary- LLMsを用いた情報検索強化生成(RAG)システムの性能評価のために、FRAMESという新しい評価データセットを提案。これは、事実に基づく応答、検索能力、推論を統一的に評価するもので、複数の情報源を統合するマルチホップ質問を含む。最新のLLMでも0.40の精度に留まる中、提案するマルチステップ検索パイプラインにより精度が0.66に向上し、RAGシステムの開発に貢献することを目指す。 Comment
RAGのfactuality, retrieval acculacy, reasoningを評価するためのmulti hop puestionとそれに回答するための最大15のwikipedia記事のベンチマーク
元ポスト:
[Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
Paper/Blog Link My Issue
#LanguageModel #Evaluation #ScientificDiscovery #NeurIPS #Selected Papers/Blogs #Science #One-Line Notes Issue Date: 2026-04-14 GPT Summary- DISCOVERYWORLDは、エージェントが科学的発見の全過程を実行できる初の仮想環境で、放射性同位体年代測定やロケット科学など多様な課題を提供します。タスクは一般的な発見スキルの育成を奨励し、シミュレーションされたテキスト環境で、オプションの2Dビジュアルオーバーレイもあります。120の課題は3つの難易度に分かれ、エージェントは仮説立案から結果分析までを行います。また、性能評価は課題完遂度や行動に基づき、自動指標で行われます。強力なベースラインエージェントが多くの課題で苦戦することから、DISCOVERYWORLDの新規性に関わる挑戦を捉えており、科学的発見能力の評価と開発を促進する可能性が示唆されます。 Comment
pj page: https://allenai.github.io/discoveryworld/
ベンチマークの概要は
- Evaluating agents for scientific discovery, Ai2, 2026.04
参照のこと。
[Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
Paper/Blog Link My Issue
#Dataset #Evaluation #MultiModal #ACL #ComputerUse #Selected Papers/Blogs #VisionLanguageModel #KeyPoint Notes #GUI Issue Date: 2025-11-25 GPT Summary- WebVoyagerは、実際のウェブサイトと対話しユーザーの指示をエンドツーエンドで完了できる大規模マルチモーダルモデルを搭載したウェブエージェントである。新たに設立したベンチマークで59.1%のタスク成功率を達成し、GPT-4やテキストのみのWebVoyagerを上回る性能を示した。提案された自動評価指標は人間の判断と85.3%一致し、ウェブエージェントの信頼性を高める。 Comment
日本語解説: https://blog.shikoan.com/web-voyager/
スクリーンショットを入力にHTMLの各要素に対してnumeric labelをoverlayし(Figure2)、VLMにタスクを完了するためのアクションを出力させる手法。アクションはFigure7のシステムプロンプトに書かれている通り。
たとえば、VLMの出力として"Click [2]" が得られたら GPT-4-Act GPT-4V-Act, ddupont808, 2023.10
と呼ばれるSoM [Paper Note] Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V, Jianwei Yang+, arXiv'23, 2023.10
をベースにWebUIに対してマウス/キーボードでinteractできるモジュールを用いることで、[2]とマーキングされたHTML要素を同定しClick操作を実現する。
[Paper Note] Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks, Adam Fourney+, arXiv'24, 2024.11
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #Library Issue Date: 2025-11-25 GPT Summary- 高性能なオープンソースエージェントシステム「Magentic-One」を提案。マルチエージェントアーキテクチャを用いて計画、進捗追跡、エラー回復を行い、専門エージェントにタスクを指示。GAIA、AssistantBench、WebArenaのベンチマークで競争力のあるパフォーマンスを達成。モジュラー設計により、エージェントの追加や削除が容易で、将来の拡張が可能。オープンソース実装とエージェント評価ツール「AutoGenBench」を提供。詳細は公式サイトで確認可能。 Comment
日本語解説: https://zenn.dev/masuda1112/articles/2024-11-30-magnetic-one
blog:
https://www.microsoft.com/en-us/research/articles/magentic-one-a-generalist-multi-agent-system-for-solving-complex-tasks/
code:
https://github.com/microsoft/autogen/tree/main/python/packages/autogen-magentic-one
[Paper Note] AgentInstruct: Toward Generative Teaching with Agentic Flows, Arindam Mitra+, arXiv'24, 2024.07
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #PostTraining Issue Date: 2025-11-25 GPT Summary- 合成データは言語モデルの開発に重要であり、本研究では「Generative Teaching」と呼ばれる手法を提案。高品質な合成データを自動生成する「AgentInstruct」フレームワークを用いて、2500万ペアのポストトレーニングデータセットを作成。これにより、Mistral-7bをポストトレーニングしたモデルOrca-3は、複数のベンチマークで顕著な性能向上を示し、他のモデルに対しても優れた結果を得た。 Comment
関連:
- [Paper Note] Orca 2: Teaching Small Language Models How to Reason, Arindam Mitra+, arXiv'23, 2023.11
[Paper Note] SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering, John Yang+, arXiv'24, 2024.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #NeurIPS #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-11-25 GPT Summary- LMエージェントのパフォーマンスにおけるインターフェースデザインの影響を調査し、ソフトウェアエンジニアリングタスクを解決するためのシステム「SWE-agent」を提案。SWE-agentのカスタムインターフェースは、コード作成やリポジトリナビゲーション、プログラム実行能力を向上させ、SWE-benchとHumanEvalFixで最先端のパフォーマンスを達成。pass@1率はそれぞれ12.5%と87.7%に達し、従来の非インタラクティブなLMを大きく上回る結果を示した。 Comment
SWE bench Verifiedで利用されているハーネスで、mini-SWE-agentと呼ばれるもの
https://github.com/SWE-agent/mini-swe-agent
[Paper Note] OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, Tianbao Xie+, arXiv'24, 2024.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Evaluation #MultiModal #VisionLanguageModel #Environment Issue Date: 2025-08-29 GPT Summary- 自律エージェントは、複雑なコンピュータ作業を最小限の人間介入で達成し、生産性を向上させる可能性を持つ。しかし、既存のベンチマークは対話的環境の欠如や特定のドメインに限定され、スケーラビリティを制限している。これに対処するため、OSWorldという実機コンピュータ環境を提案し、様々なOSにまたがるマルチモーダルエージェント向けの統一環境を提供。369のコンピュータタスクを現実世界の利用ケースに基づいて評価するためのベンチマークを作成。評価の結果、最先端のLLM/VLMベースのエージェントは人間の72.36%に対しわずか12.24%の成功しか得られず、GUIのグラウンディングと運用知識の不足が主な要因であることが明らかになった。OSWorldは汎用エージェントの開発に向けた有益なインサイトを提供する。 Comment
openreview: https://openreview.net/forum?id=tN61DTr4Ed#discussion
マルチモーダル AI Agentを評価するための実コンピュータでの仮想環境が提供されており、Ubuntu, Windows, macOS等でのキーボード、マウスコントロールを受け付ける。396の実際のユーザが直面するシナリオが定義されており、タスクごとにinitial stateが定義され、実際にタスクを実行することをベースにした評価を実行可能。
タスクとタスクの実行結果を評価するためのスクリプトの例が以下で、たとえばAmazonのcookieを全て削除する依頼や、エクセルの操作を実施するようなタスクなど、多様なタスクが用意されている。
Agentが実施可能なアクションの一部は下記で、マウス操作、キーボード入力を通じて実行可能なアクションが定義されている。
[Paper Note] Agent Workflow Memory, Zora Zhiruo Wang+, arXiv'24, 2024.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #memory #One-Line Notes #needs-revision Issue Date: 2025-04-02 GPT Summary- エージェントが複雑なタスクを解決するために、再利用可能なワークフローを学習するAgent Workflow Memory(AWM)を提案。AWMは、オフライン・オンラインのシナリオで選択的にワークフローを提供し、200以上のドメインにおいて実験した結果、Mind2Webで24.6%、WebArenaで51.1%の相対的成功率向上を達成。タスク解決に要する手順数も削減し、訓練-テスト分布ギャップが広がる中でも堅牢な一般化を示した。 Comment
過去のワークフローをエージェントがprompt中で利用することができ、利用すればするほど賢くなるような仕組みの提案
openreview: https://openreview.net/forum?id=PfYg3eRrNi
[Paper Note] CoAct: A Global-Local Hierarchy for Autonomous Agent Collaboration, Xinming Hou+, arXiv'24, 2024.06
Paper/Blog Link My Issue
#NLP #LanguageModel #SoftwareEngineering #One-Line Notes Issue Date: 2025-04-02 GPT Summary- CoActフレームワークを提案し、LLMに人間社会の協調パターンを適用。グローバル計画エージェントがマクロ計画を策定し、ローカル実行エージェントが具体的なサブタスクを実行。WebArenaベンチマークで、長期的なウェブタスクにおいて従来手法を上回る性能を示した。 Comment
Planningエージェントと実行エージェントを活用するソフトウェアエージェント
ReActより性能向上
- [Paper Note] ReAct: Synergizing Reasoning and Acting in Language Models, Shunyu Yao+, ICLR'23, 2022.10
[Paper Note] WebArena: A Realistic Web Environment for Building Autonomous Agents, Shuyan Zhou+, ICLR'24
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ICLR #Selected Papers/Blogs #One-Line Notes Issue Date: 2025-04-02 GPT Summary- 生成AIの進展により、自律エージェントが自然言語コマンドで日常タスクを管理する可能性が生まれたが、現行のエージェントは簡略化された環境でのテストに限られている。本研究では、ウェブ上でタスクを実行するエージェントのための現実的な環境を構築し、eコマースやソーシャルフォーラムなどのドメインを含む完全なウェブサイトを提供する。この環境を基に、タスクの正確性を評価するベンチマークを公開し、実験を通じてGPT-4ベースのエージェントの成功率が14.41%であり、人間の78.24%には及ばないことを示した。これにより、実生活のタスクにおけるエージェントのさらなる開発の必要性が強調される。 Comment
Webにおけるさまざまなrealisticなタスクを評価するためのベンチマーク
実際のexample。スタート地点からピッツバーグのmuseumを巡る最短の経路を見つけるといった複雑なタスクが含まれる。
人間とGPT4,GPT-3.5の比較結果
[Paper Note] SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, Carlos E. Jimenez+, ICLR'24
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ICLR #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Reference Collection Issue Date: 2025-04-02 GPT Summary- SWE-benchは、12の人気Pythonリポジトリから得られた2,294のソフトウェアエンジニアリング問題を評価するフレームワークで、言語モデルがコードベースを編集して問題を解決する能力を測定します。評価の結果、最先端の商用モデルや微調整されたモデルSWE-Llamaも最も単純な問題しか解決できず、Claude 2はわずか1.96%の問題を解決するにとどまりました。SWE-benchは、より実用的で知的な言語モデルへの進展を示しています。 Comment
ソフトウェアエージェントの最もpopularなベンチマーク
主にpythonライブラリに関するリポジトリに基づいて構築されている。
SWE-Bench, SWE-Bench Lite, SWE-Bench Verifiedの3種類がありソフトウェアエージェントではSWE-Bench Verifiedを利用して評価することが多いらしい。Verifiedでは、issueの記述に曖昧性がなく、適切なunittestのスコープが適切なもののみが採用されているとのこと(i.e., 人間の専門家によって問題がないと判断されたもの)。
https://www.swebench.com/
Agenticな評価をする際に、一部の評価でエージェントがgit logを参照し本来は存在しないはずのリポジトリのfuture stateを見ることで環境をハッキングしていたとのこと:
これまでの評価結果にどの程度の影響があるかは不明。
openreview: https://openreview.net/forum?id=VTF8yNQM66
[Paper Note] PromptWizard: Task-Aware Prompt Optimization Framework, Eshaan Agarwal+, arXiv'24, 2024.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Prompting #AutomaticPromptEngineering #One-Line Notes Issue Date: 2025-02-10 GPT Summary- 大規模言語モデル(LLMs)の効果的な活用に向けて、完全自動化されたプロンプト最適化フレームワーク「PromptWizard」を提案。自己進化・自己適応機能に基づき、プロンプトと文脈内例を反復的に洗練し、優れた品質のプロンプトを生成。45のタスクで高性能を示し、限られたデータや小規模モデルでも適用可能。コスト分析により効率性と優位性が確認される。 Comment
Github:
https://github.com/microsoft/PromptWizard?tab=readme-ov-file
元ポスト:
初期に提案された
- Large Language Models Are Human-Level Prompt Engineers, Yongchao Zhou+, ICLR'23
と比較すると大分性能が上がってきているように見える。
reasoning modelではfewshot promptingをすると性能が落ちるという知見があるので、reasoningモデル向けのAPE手法もそのうち出現するのだろう(既にありそう)。
OpenReview:
https://openreview.net/forum?id=VZC9aJoI6a
ICLR'25にrejectされている
[Paper Note] Chain of Agents: Large Language Models Collaborating on Long-Context Tasks, Yusen Zhang+, arXiv'24, 2024.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #ContextWindow #Blog #NeurIPS #LongHorizon #Initial Impression Notes Issue Date: 2025-01-25 GPT Summary- 長い文脈を処理するために、Chain-of-Agents(CoA)フレームワークを提案。複数のワーカーエージェントが逐次的に情報を集約し、マネージャーエージェントが最終出力を統合。各エージェントに短い文脈を割り当てることで焦点の問題を軽減し、質問応答や要約などのタスクで最大10%の性能向上を実現。 Comment
元ポスト:
LLMがどこまでいってもcontext長の制約に直面する問題に対してLLM Agentを組み合わせて対処しました、的な話な模様
ブログ中にアプローチを解説した動画があるのでわかりやすい
Is the experimental code open source?
Thank you for your comment. I tried to find an official open-source implementation provided by the authors, but I was not able to locate one. In fact, I also checked the personal webpage of the first author, but there was no link to any released code.
Is seems that an unofficial implementation is listed under the “Code” tab on the NeurIPS page. I hope this is helpful. Thank you.
NeurIPS link:
https://nips.cc/virtual/2024/poster/95563
openreview:
https://openreview.net/forum?id=LuCLf4BJsr
[Paper Note] MAG-V: A Multi-Agent Framework for Synthetic Data Generation and Verification, Saptarshi Sengupta+, arXiv'24, 2024.11
Paper/Blog Link My Issue
#Multi #NLP #Dataset #SyntheticData #Evaluation Issue Date: 2025-01-03 GPT Summary- MAG-Vというマルチエージェントフレームワークを提案し、顧客クエリを模倣したデータセットを生成してエージェントのパフォーマンスを向上させる。軌跡の検証手法は従来のMLモデルを上回り、GPT-4と同等の性能を示す。多様なタスクエージェントを統一するアプローチを提供。 Comment
元ポスト:
[Paper Note] TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks, Frank F. Xu+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #NeurIPS #Selected Papers/Blogs #Surface-level Notes #Author Thread-Post Issue Date: 2025-01-03 GPT Summary- 大規模言語モデル(LLMs)によるAIエージェントの進展が、日常業務の効率化にどのように寄与するかを探求。TheAgentCompanyを通じて、AIエージェントがデジタル労働者のように働く能力を評価する拡張可能なベンチマークを導入。模擬のソフトウェア企業環境で、タスクの自律的完了率は30%に達し、単純なタスクは成功する一方、複雑な長期タスクは今のモデルでは難しいことを示す。 Comment
元ポスト:
ソフトウェアエンジニアリングの企業の設定で現実に起こりうるな 175種類のタスクを定義してAI Agentを評価できるベンチマークTheAgentCompanyを提案。
既存のベンチマークより、多様で、実際のソフトウェアエンジニアリング企業でで起こりうる幅広いタスクを持ち、タスクの遂行のために同僚に対して何らかのインタラクションが必要で、達成のために多くのステップが必要でかつ個々のステップ(サブタスク)を評価可能で、多様なタスクを遂行するために必要な様々なインタフェースをカバーし、self hostingして結果を完全に再現可能なベンチマークとなっている模様。
(画像は著者ツイートより引用)
プロプライエタリなモデルとOpenWeightなモデルでAI Agentとしての能力を評価した結果、Claude-3.5-sonnetは約24%のタスクを解決可能であり、他モデルと比べて性能が明らかに良かった。また、Gemini-2.0-flashなコストパフォーマンスに優れている。OpenWeightなモデルの中ではLlama3.3-70Bのコストパフォーマンスが良かった。タスクとしては具体的に評価可能なタスクのみに焦点を当てており、Open Endなタスクでは評価していない点に注意とのこと。
まだまだAI Agentが完全に'同僚'として機能することとは現時点ではなさそうだが、このベンチマークのスコアが今後どこまで上がっていくだろうか。
openreview: https://openreview.net/forum?id=LZnKNApvhG
Generative Agent Simulations of 1,000 People, Joon Sung Park+, arXiv'24
Paper/Blog Link My Issue
#NLP Issue Date: 2024-11-27 GPT Summary- 新しいエージェントアーキテクチャを提案し、1,052人の実在の個人の態度と行動を85%の精度で再現。大規模言語モデルを用いた質的インタビューに基づき、参加者の回答を正確にシミュレート。人口統計的説明を用いたエージェントと比較して、精度バイアスを軽減。個人および集団の行動調査の新しいツールを提供。
GUI Agents with Foundation Models: A Comprehensive Survey, Shuai Wang+, arXiv'24
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #One-Line Notes #needs-revision Issue Date: 2024-11-12 GPT Summary- (M)LLMを活用したGUIエージェントの研究を統合し、データセット、フレームワーク、アプリケーションの革新を強調。重要なコンポーネントをまとめた統一フレームワークを提案し、商業アプリケーションを探求。課題を特定し、今後の研究方向を示唆。 Comment
Referenceやページ数はサーベイにしては少なめに見える。
[Paper Note] Beyond Browsing: API-Based Web Agents, Yueqi Song+, arXiv'24, 2024.10
Paper/Blog Link My Issue
#NLP #API #read-later Issue Date: 2024-11-11 GPT Summary- APIを利用したAIエージェントの研究が進んでおり、従来のウェブブラウジングタスクに新たなアプローチを提供する。2種類のエージェントを提案:API呼び出しエージェントはAPIのみを使用し、ハイブリッドエージェントはウェブ閲覧とAPIの両方を活用する。実験結果では、APIエージェントがウェブブラウジングエージェントを上回り、ハイブリッドエージェントは全タスクで優れた性能を示し、成功率は38.9%に達するなど、APIの利用が効果的であることを示唆している。 Comment
CMUの研究。後で読みたい
[Paper Note] ToolGen: Unified Tool Retrieval and Calling via Generation, Renxi Wang+, arXiv'24, 2024.10
Paper/Blog Link My Issue
#Pretraining #Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #ICLR #PostTraining #KeyPoint Notes #Reading Reflections Issue Date: 2024-10-20 GPT Summary- ToolGenは、LLMとツールの統合を革新する新しいアプローチを提案する。ツールをユニークなトークンとして表現し、ツール知識を直接LLMのパラメータに組み込むことで、ツール呼び出しと生成をシームレスに実現する。このフレームワークにより、追加ステップなしで多数のツールにアクセスでき、性能とスケーラビリティが向上する。47,000以上のツールでの実験結果は、ToolGenが自律的なタスク完遂において優れた成果を示し、多様な領域に適応可能なAIエージェントの新時代を切り開くことを示唆している。さらに、エンドツーエンドのツール学習を可能にし、他の高度な技術との統合機会を提供することで、LLMsの実践的な能力を拡張する。 Comment
昔からよくある特殊トークンを埋め込んで、特殊トークンを生成したらそれに応じた処理をする系の研究。今回はツールに対応するトークンを仕込む模様。
斜め読みだが、3つのstepでFoundation Modelを訓練する。まずはツールのdescriptionからツールトークンを生成する。これにより、モデルにツールの情報を覚えさせる(memorization)。斜め読みなので読めていないが、ツールトークンをvocabに追加してるのでここは継続的事前学習をしているかもしれない。続いて、(おそらく)人手でアノテーションされたクエリ-必要なツールのペアデータから、クエリに対して必要なツールを生成するタスクを学習させる。最後に、(おそらく人手で作成された)クエリ-タスクを解くためのtrajectoryペアのデータで学習させる。
学習データのサンプル。Appendix中に記載されているものだが、本文のデータセット節とAppendixの双方に、データの作り方の詳細は記述されていなかった。どこかに書いてあるのだろうか。
最終的な性能
特殊トークンを追加のvocabとして登録し、そのトークンを生成できるようなデータで学習し、vocabに応じて何らかの操作を実行するという枠組み、その学習手法は色々なタスクで役立ちそう。
openreview: https://openreview.net/forum?id=XLMAMmowdY
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery, Chris Lu+, N_A, arXiv'24
Paper/Blog Link My Issue
#NLP #LanguageModel #ScientificDiscovery Issue Date: 2024-08-13 GPT Summary- 最先端の大規模言語モデルを使用して、完全自動の科学的発見を可能にする包括的なフレームワークが提案された。AI Scientistは新しい研究アイデアを生成し、コードを記述し、実験を実行し、結果を可視化し、完全な科学論文を執筆し、査読プロセスを実行することができる。このアプローチは、機械学習における科学的発見の新しい時代の始まりを示しており、AIエージェントの変革的な利点をAI自体の研究プロセス全体にもたらし、世界で最も難しい問題に無限の手頃な価格の創造性とイノベーションを解き放つことに近づいています。
[Paper Note] Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback, Baolin Peng+, arXiv'23, 2023.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Factuality #RAG(RetrievalAugmentedGeneration) #AutomaticPromptEngineering Issue Date: 2025-09-24 GPT Summary- LLM-Augmenterシステムを提案し、LLMが外部知識に基づいた応答を生成できるように拡張。フィードバックを用いてプロンプトを改善し、タスク指向の対話と質問応答での有効性を実証。ChatGPTの幻覚を減少させつつ、流暢さや情報量を維持。ソースコードとモデルを公開。
GAIA: a benchmark for General AI Assistants, Grégoire Mialon+, N_A, arXiv'23
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #QuestionAnswering #Evaluation #Selected Papers/Blogs Issue Date: 2023-11-23 GPT Summary- GAIAは、General AI Assistantsのためのベンチマークであり、AI研究のマイルストーンとなる可能性がある。GAIAは、推論、マルチモダリティの処理、ウェブブラウジングなど、実世界の質問に対する基本的な能力を必要とする。人間の回答者は92%の正答率を達成し、GPT-4は15%の正答率を達成した。これは、最近の傾向とは異なる結果であり、専門的なスキルを必要とするタスクではLLMsが人間を上回っている。GAIAは、人間の平均的な堅牢性と同等の能力を持つシステムがAGIの到来に重要であると考えている。GAIAの手法を使用して、466の質問と回答を作成し、一部を公開してリーダーボードで利用可能にする。 Comment
Yann LeCun氏の紹介ツイート
Meta-FAIR, Meta-GenAI, HuggingFace, AutoGPTによる研究。人間は92%正解できるが、GPT4でも15%しか正解できないQAベンチマーク。解くために推論やマルチモダリティの処理、ブラウジング、ツールに対する習熟などの基本的な能力を必要とする実世界のQAとのこと。
- Open-source DeepResearch – Freeing our search agents, HuggingFace, 2025.02
で言及されているLLM Agentの評価で最も有名なベンチマークな模様
[Paper Note] MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation, Qian Huang+, arXiv'23, 2023.10
Paper/Blog Link My Issue
#MachineLearning #NLP #Dataset #LanguageModel #Evaluation #AutoML #One-Line Notes Issue Date: 2023-10-09 GPT Summary- 機械学習の実験を行うためのエージェントを強力な言語モデルを用いて構築し、MLAgentBenchという13のタスクベンチマークを導入。エージェントはファイル操作やコード実行を行い、Claude v3 Opusが最も高い成功率を示す。タスク全体で平均成功率37.5%を達成するが、結果はデータセットによって大きく変動。長期計画や幻覚の低減といった重要な課題も明らかにした。コードは公開中。 Comment
GPT4がMLモデルをどれだけ自動的に構築できるかを調べた模様。また、ベンチマークデータを作成した模様。結果としては、既存の有名なデータセットでの成功率は90%程度であり、未知のタスク(新たなKaggle Challenge等)では30%程度とのこと。
[Paper Note] A Survey on Large Language Model based Autonomous Agents, Lei Wang+, arXiv'23, 2023.08
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #Selected Papers/Blogs #One-Line Notes Issue Date: 2023-09-01 GPT Summary- LLMを活用した自律エージェントの研究を体系的に整理し、構築方法や応用例、評価戦略を概説。人間の学習に近づくための課題と今後の方向性を示す。関連文献のリポジトリも提供。 Comment
Fig1の時系列での論文数と代表的な研究のリストアップとエージェントの質の変遷、Table1のモデルの分類表など非常に分かりやすい。
[Paper Note] Prompt2Model: Generating Deployable Models from Natural Language Instructions, Vijay Viswanathan+, arXiv'23, 2023.08
Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #DataAugmentation #Supervised-FineTuning (SFT) #SyntheticData #EMNLP #PostTraining #Selected Papers/Blogs #System Demonstration #KeyPoint Notes #Author Thread-Post Issue Date: 2023-08-28 GPT Summary- Prompt2Modelは、LLMによるプロンプトを用いて特定用途モデルを訓練する方法を提案。既存データセットの検索とLLMを使ったデータ生成により、強力なモデルを得られる。提示したプロンプトで、gpt-3.5-turboの結果を約20%上回り、最大700倍小型化できる。モデルの性能を信頼性高く推定可能で、オープンソースとして公開。 Comment
Dataset Generatorによって、アノテーションが存在しないデータについても擬似ラベル付きデータを生成することができ、かつそれを既存のラベル付きデータと組み合わせることによってさらに性能が向上することが報告されている。これができるのはとても素晴らしい。
Dataset Generatorについては、データを作成する際に低コストで、高品質で、多様なデータとするためにいくつかの工夫を実施している。
1. ユーザが与えたデモンストレーションだけでなく、システムが生成したexampleもサンプリングして活用することで、生成されるexampleの多様性を向上させる。実際、これをやらない場合は120/200がduplicate exampleであったが、これが25/200まで減少した。
2. 生成したサンプルの数に比例して、temperatureを徐々に高くしていく。これにより、サンプルの質を担保しつつ、多様性を徐々に増加させることができる。Temperature Annealingと呼ぶ。
3. self-consistencyを用いて、擬似ラベルの質を高める。もしmajority votingが互角の場合は、回答が短いものを採用した(これはヒューリスティックに基づいている)
4. zeno buildを用いてAPIへのリクエストを並列化することで高速に実験を実施
非常に参考になる。
著者らによる現在の視点での振り返り(提案当時はAI Agentsという概念はまだなく、本研究はその先取りと言える):
AgentBench: Evaluating LLMs as Agents, Xiao Liu+, N_A, arXiv'23
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #One-Line Notes Issue Date: 2023-08-27 GPT Summary- 本研究では、大規模言語モデル(LLMs)をエージェントとして評価するための多次元の進化するベンチマーク「AgentBench」を提案しています。AgentBenchは、8つの異なる環境でマルチターンのオープンエンドの生成設定を提供し、LLMの推論と意思決定能力を評価します。25のLLMsに対するテストでは、商用LLMsは強力な能力を示していますが、オープンソースの競合他社との性能には差があります。AgentBenchのデータセット、環境、および評価パッケージは、GitHubで公開されています。 Comment
エージェントとしてのLLMの推論能力と意思決定能力を評価するためのベンチマークを提案。
トップの商用LLMとOpenSource LLMの間に大きな性能差があることを示した。
[Paper Note] MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework, Sirui Hong+, arXiv'23, 2023.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ICLR #Selected Papers/Blogs #One-Line Notes Issue Date: 2023-08-08 GPT Summary- MetaGPTは、LLMベースのマルチエージェントシステムに人間のワークフローを統合し、複雑なタスクを小さなサブタスクに効率的に分解するメタプログラミングフレームワークです。これにより、中間結果の検証が可能になり、誤りを減少させます。また、共同ソフトウェアエンジニアリングのタスクにおいて、従来のシステムよりも一貫性のある解決策を提供します。プロジェクトはGitHubで公開されています。 Comment
要はBabyTalk, AutoGPTの進化系で、人間のワークフローを模倣するようにデザインしたら良くなりました、という話と思われる
ソフトウェアエンジニア、アーキテクト、プロダクトオーナー、プロジェクトマネージャーなどのロールを明示的に与えて、ゴールを目指す。もはやLLM内部でソフトウェア企業を模倣しているのと同様である。
openreview: https://openreview.net/forum?id=VtmBAGCN7o
[Paper Note] ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs, Yujia Qin+, arXiv'23, 2023.07
Paper/Blog Link My Issue
#Tools #NLP #Dataset #LanguageModel #SyntheticData #API #ICLR #One-Line Notes #ToolUse Issue Date: 2023-08-08 GPT Summary- オープンソースのLLMにおけるツール使用能力の限界を克服するため、ToolLLMフレームワークを提案。ToolBenchデータセットを用いて、ChatGPTに指示を与え実世界のAPIを収集し、多様なシナリオをカバー。新しい探索手法DFSDTを開発することで、LLMsの推論能力を高め、ToolLLaMAが複雑な指示を効果的に実行できることを示した。ToolEvalにより評価を行い、ToolLLaMAはChatGPTと同等の性能を発揮する。さらに、適切なAPIを推奨するニューラルAPIリトリーバーを導入し、手動の選択を不要にした。 Comment
16000のreal worldのAPIとインタラクションし、データの準備、訓練、評価などを一貫してできるようにしたフレームワーク。LLaMAを使った場合、ツール利用に関してturbo-16kと同等の性能に達したと主張。
openreview: https://openreview.net/forum?id=dHng2O0Jjr
Towards A Unified Agent with Foundation Models, Norman Di Palo+, N_A, arXiv'23
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel Issue Date: 2023-07-22 GPT Summary- 本研究では、言語モデルとビジョン言語モデルを強化学習エージェントに組み込み、効率的な探索や経験データの再利用などの課題に取り組む方法を調査しました。スパースな報酬のロボット操作環境でのテストにおいて、ベースラインに比べて大幅な性能向上を実証し、学習済みのスキルを新しいタスクの解決や人間の専門家のビデオの模倣に活用する方法を示しました。
[Paper Note] Mind2Web: Towards a Generalist Agent for the Web, Xiang Deng+, arXiv'23, 2023.06
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #NeurIPS #ComputerUse #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #GUI Issue Date: 2023-07-03 GPT Summary- Mind2Webは、ウェブ上での汎用的なタスクをこなすエージェントの開発のための初のデータセットで、137のウェブサイトと31のドメインにまたがる2,000件以上のオープンエンドタスクを収集。これにより、多様なドメイン・タスクを扱え、実世界のサイトを対象にしたエージェント構築を支援。大規模言語モデル(LLMs)を用いることで、未見のウェブサイトでも一定の性能を発揮することを示し、データセットとモデルをオープンソース化して研究の促進を目指す。 Comment
Webにおけるgeneralistエージェントを評価するためのデータセットを構築。31ドメインの137件のwebサイトにおける2350個のタスクが含まれている。
タスクは、webサイトにおける多様で実用的なユースケースを反映し、チャレンジングだが現実的な問題であり、エージェントの環境やタスクをまたいだ汎化性能を評価できる。
プロジェクトサイト:
https://osu-nlp-group.github.io/Mind2Web/
[Paper Note] Think Before You Act: Decision Transformers with Working Memory, Jikun Kang+, arXiv'23, 2023.05
Paper/Blog Link My Issue
#NLP #Transformer Issue Date: 2023-06-16 GPT Summary- Decision Transformerベースのエージェントは複数タスクの一般化能力を示すが、大量のデータと計算資源に依存している。訓練中の忘却現象が新タスクの性能低下を引き起こすと考え、分散型の記憶ストレージを用いる人間の脳に着想を得て、作業記憶モジュールを提案。評価結果は、AtariゲームとMeta-Worldのタスクで訓練効率と一般化の向上を示し、メモリ微調整が適応性をさらに強化することを証明。
[Paper Note] ReAct: Synergizing Reasoning and Acting in Language Models, Shunyu Yao+, ICLR'23, 2022.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #needs-revision Issue Date: 2023-04-13 GPT Summary- 大規模言語モデルを用いて、推論と行動計画を相互に組み合わせるReActアプローチを提案。推論の痕跡が行動計画の導出を促進し、行動が外部情報を活用することで、推論の効率を向上。質問応答や事実検証タスクで従来手法を凌駕し、人間の解釈性と信頼性を向上させる。対話的意思決定ベンチマークでも優れた性能を発揮。 Comment
# 概要
人間は推論と行動をシナジーさせることで、さまざまな意思決定を行える。近年では言語モデルにより言語による推論を意思決定に組み合わせる可能性が示されてきた。たとえば、タスクをこなすための推論トレースをLLMが導けることが示されてきた(Chain-of-Thought)が、CoTは外部リソースにアクセスできないため知識がアップデートできず、事後的に推論を行うためhallucinationやエラーの伝搬が生じる。一方で、事前学習言語モデルをinteractiveな環境において計画と行動に利用する研究が行われているが、これらの研究では、高レベルの目標について抽象的に推論したり、行動をサポートするための作業記憶を維持したりするために言語モデルを利用していない。推論と行動を一般的な課題解決のためにどのようにシナジーできるか、またそのようなシナジーが単独で推論や行動を実施した場合と比較してどのような利益をもたらすかについて研究されていない。
そこで、REACTを提案。REACTは推論と行動をLLMと組み合わせて、多様な推論や意思決定タスクを実現するための一般的な枠組みであり、推論トレースとアクションを交互に生成するため、動的に推論を実行して行動するための大まかな計画を作成、維持、調整できると同時に、wikipediaなどの外部ソースとやりとりして追加情報を収集し、推論プロセスに組み込むことが可能となる。
- 要はいままではGeneralなタスク解決モデルにおいては、推論とアクションの生成は独立にしかやられてこなかったけど、推論とアクションを交互作用させることについて研究したよ
- そしたら性能がとってもあがったよ
- reasoningを人間が編集すれば、エージェントのコントロールもできるよ という感じ
# イントロ
人間は推論と行動の緊密なシナジーによって、不確実な状況に遭遇しても適切な意思決定が行える。たとえば、任意の2つの特定のアクションの間で、進行状況をトレースするために言語で推論したり(すべて切り終わったからお湯を沸かす必要がある)、例外を処理したり、状況に応じて計画を調整したりする(塩がないから代わりに醤油と胡椒を使おう)。また、推論をサポートし、疑問(いまどんな料理を作ることができるだろうか?)を解消するために、行動(料理本を開いてレシピを読んで、冷蔵庫を開いて材料を確確認したり)をすることもある。
近年の研究では言語での推論を、インタラクティブな意思決定を組み合わせる可能性についてのヒントが得られてきた。一つは、適切にPromptingされたLLMが推論トレースを実行できることを示している。推論トレースとは、解決策に到達するための一連のステップを経て推論をするためのプロセスのことである。しかしながらChain-of-thoughytは、このアプローチでは、モデルが外界対してgroundingできず、内部表現のみに基づい思考を生成するため限界がある。これによりモデルが事後対応的に推論したり、外部情報に基づいて知識を更新したりできないため、推論プロセス中にhallucinationやエラーの伝搬などの問題が発生する可能性が生じる。
一方、近年の研究では事前学習言語モデルをinteractiveな環境において計画と行動に利用する研究が行われている。これらの研究では、通常マルチモーダルな観測結果をテキストに変換し、言語モデルを使用してドメイン固有のアクション、またはプランを生成し、コントローラーを利用してそれらを選択または実行する。ただし、これらのアプローチは高レベルの目標について抽象的に推論したり、行動をサポートするための作業記憶を維持したりするために言語モデルを利用していない。
推論と行動を一般的な課題解決のためにどのようにシナジーできるか、またそのようなシナジーが単独で推論や行動を実施した場合と比較してどのような利益をもたらすかについて研究されていない。
LLMにおける推論と行動を組み合わせて、言語推論と意思決定タスクを解決するREACTと呼ばれる手法を提案。REACTでは、推論と行動の相乗効果を高めることが可能。推論トレースによりアクションプランを誘発、追跡、更新するのに役立ち、アクションでは外部ソースと連携して追加情報を収集できる。
REACTは推論と行動をLLMと組み合わせて、多様な推論や意思決定タスクを実現するための一般的な枠組みである。REACTのpromptはLLMにverbalな推論トレースとタスクを実行するためのアクションを交互に生成する。これにより、モデルは動的な推論を実行して行動するための大まかな計画を作成、維持、調整できると同時に、wikipediaなどの外部ソースとやりとりして追加情報を収集し、推論プロセスに組み込むことが可能となる。
# 手法
変数を以下のように定義する:
- O_t: Observertion on time t
- a_t: Action on time t
- c_t: context, i.e. (o_1, a_1, o_2, a_2, ..., a_t-1, o_t)
- policy pi(a_t | c_t): Action Spaceからアクションを選択するポリシー
- A: Action Space
- O: Observation Space
普通はc_tが与えられたときに、ポリシーに従いAからa_tを選択しアクションを行い、アクションの結果o_tを得て、c_t+1を構成する、といったことを繰り返していく。
このとき、REACTはAをA ∪ Lに拡張しする。ここで、LはLanguage spaceである。LにはAction a_hatが含まれ、a_hatは環境に対して作用をしない。単純にthought, あるいは reasoning traceを実施し、現在のcontext c_tをアップデートするために有用な情報を構成することを目的とする。Lはunlimitedなので、事前学習された言語モデルを用いる。今回はPaLM-540B(c.f. GPT3は175Bパラメータ)が利用され、few-shotのin-context exampleを与えることで推論を行う。それぞれのin-context exampleは、action, thoughtsそしてobservationのtrajectoryを与える。
推論が重要なタスクでは、thoughts-action-observationステップから成るtask-solving trajectoryを生成する。一方、多数のアクションを伴う可能性がある意思決定タスクでは、thoughtsのみを行うことをtask-solving trajectory中の任意のタイミングで、自分で判断して行うことができる。
意思決定と推論能力がLLMによってもたらされているため、REACTは4つのuniqueな特徴を持つ:
- 直感的で簡単なデザイン
- REACTのpromptは人間のアノテータがアクションのトップに思考を言語で記述するようなストレートなものであり、ad-hocなフォーマットの選択、思考のデザイン、事例の選定などが必要ない。
- 一般的で柔軟性が高い
- 柔軟な thought spaceと thought-actionのフォーマットにより、REACTはさまざまなタスクにも柔軟に対応できる
- 高性能でロバスト
- REACTは1-6個の事例によって、新たなタスクに対する強力な汎化を示す。そして推論、アクションのみを行うベースラインよりも高い性能を示している。REACTはfinetuningの斧系も得ることができ、promptの選択に対してREACTの性能はrobustである。
- 人間による調整と操作が可能
- REACTは、解釈可能な意思決定と推論のsequenceを前提としているため、人間は簡単に推論や事実の正しさを検証できる。加えて、thoughtsを編集することによって、m人間はエージェントの行動を制御、あるいは修正できる。
# KNOWLEDGE INTENSIVE REASONING TASKS
openreview: https://openreview.net/forum?id=tvI4u1ylcqs
[Paper Note] Reflexion: Language Agents with Verbal Reinforcement Learning, Noah Shinn+, NeurIPS'23, 2023.03
Paper/Blog Link My Issue
#MachineLearning #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SelfCorrection #NeurIPS #PostTraining #Initial Impression Notes Issue Date: 2023-03-28 GPT Summary- LLMを用いた言語エージェントが外部環境と相互作用しつつ、迅速な学習を可能にする新しいフレームワーク「Reflexion」を提案。言語的フィードバックを活用し、エージェントはタスクのフィードバックを反映、エピソディックメモリに保持して意思決定を改善。多様なフィードバック信号を取り入れ、様々なタスクで大幅な性能向上を実現。HumanEvalベンチマークでは91%のpass@1精度を達成し、従来の最先端を超える成果を示した。 Comment
なぜ回答を間違えたのか自己反省させることでパフォーマンスを向上させる研究
openreview: https://openreview.net/forum?id=vAElhFcKW6
[Paper Note] ScienceWorld: Is your Agent Smarter than a 5th Grader?, Ruoyao Wang+, EMNLP'22, 2022.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #ScientificDiscovery #EMNLP #Selected Papers/Blogs #Science #One-Line Notes Issue Date: 2026-04-14 GPT Summary- ScienceWorldは、小学校の科学カリキュラムに基づき、エージェントの科学的推論能力を評価するための対話型テキスト環境を提供します。従来のモデルは、新しい文脈で学んだ科学概念を推論するのが苦手で、特に未知の材料の伝導率を見つけるための実験方法を問われると苦戦します。これは、モデルが類似例から答えを得ているのか、再利用可能な方法で推論を学んでいるのかという疑問を生み出します。私たちは、エージェントは対話型環境にグラウンディングされることで推論能力を得るべきだと仮定し、150万パラメータのエージェントが10万ステップの対話型訓練を受けた結果、静的訓練を受けた110億パラメータのモデルを上回ることを実証しました。 Comment
ベンチマークの概要は
- Evaluating agents for scientific discovery, Ai2, 2026.04
参照のこと。
Introducing Aikido Altar: the model that makes sovereign security intelligence possible, aikido, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Pruning #Quantization #Blog #OpenWeight #Security #Author Thread-Post Issue Date: 2026-10-02 Comment
元ポスト:
[Paper Note] AutoBenchmark: benchmark creation & the role of humans, Seungone+, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #Evaluation #read-later #Selected Papers/Blogs #autoresearch/RSI #Author Thread-Post Issue Date: 2026-10-01 Comment
元ポスト:
Gemini 4 Argon: our next era of frontier intelligence, Google, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #VisionLanguageModel Issue Date: 2026-10-01 Comment
元ポスト:
Geminiがcome back?
DeepGEMM Ascend, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Library #GPUKernel #Author Thread-Post Issue Date: 2026-09-30 Comment
元ポスト:
所見:
DeepSeekGEMMと呼ばれる、NVIDIA GPU向けに構築されたGPUカーネルライブラリをHuawei Ascend NPU向けに移植したもので、APIがDeepSeekGEMMと互換性があるため、同じpythonコードから動作させることができるようである。
一言解決:
Halo: Frontier-Lab Training for Everyone, White Circle, 2026.09
Paper/Blog Link My Issue
#Article #Multi #ComputerVision #EfficiencyImprovement #Pretraining #Tools #NLP #LanguageModel #ReinforcementLearning #MultiModal #Blog #mid-training #DPO #PostTraining #Parallelism #VisionLanguageModel #Asynchronous #Author Thread-Post #TrainingFramework Issue Date: 2026-09-29 Comment
元ポスト:
dlab Open Source Week: Frontier AI on Your Own Hardware, Tim Dettmers, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Test-Time Scaling #Selected Papers/Blogs #DeepResearch #Compression #Reading Reflections #autoresearch/RSI Issue Date: 2026-09-29 Comment
元ポスト:
前半にオープンソースにするエコシステムとして
- エージェントのcontextの自動圧縮技術
- autonomous research
- 効率的なtest time scaling手法
- Deep Research
などの開発中におけるエピソードや、その性能の高さについて述べられている。
一方、記事全体で述べられている気持ちは博士課程在籍者(やアカデミアにいる研究者に)対するメッセージである。個人的に印象深かったのは、研究のunitが論文ではなく一貫性のあるエコシステムを構築することになる、という主張と、博士課程において容易に解決することができない課題に粘り強く取り組む力を身につけることは投資をする価値がある、という部分で、第一線の研究者の方がAI Agentによる研究環境の変化をどう捉えているかが少し垣間見えるのと、(現在の悲観的な博士課程の学生に対して)博士課程で学ぶことの価値やアカデミアだからこそなし得ることがメッセージングされており、非常に興味深く拝読した。
要約を読んだりするよりも、原文から伝わる気持ちを汲み取った方が良いと思う(という意味で原文全文を読んだ方が良いと思う)。
Step Code, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #Coding #SoftwareEngineering #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-09-23 Comment
元ポスト:
高いトークン効率を持つStepFun製のターミナル向けのコーディング用Agent Harness
Introducing Claude Opus 5.5, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection Issue Date: 2026-09-23 Comment
元ポスト:
KernelBench-MegaのRTX PRO 6000向けにKimi Linearのデコード向けのメガカーネルを記述するベンチマークでAstraを超えてSoTAを達成したようである:
所見:
所見:
GPTはeffortの増加に従い単調増加だが、Claude系はそうならない
Introducing MiMo-V2.6 series, Xiaomi, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #read-later #Selected Papers/Blogs #Reference Collection #Author Thread-Post Issue Date: 2026-09-23 Comment
HF: https://huggingface.co/collections/XiaomiMiMo/mimo-v26
元ポスト:
所見:
Mimo-2.6はSWA+GQAのシンプルなアーキテクチャであり、それでOpenWeightモデルでSoTAを達成しており、進歩の多くはデータと事後学習のレシピの改善によってもたらされているという主張。
DeepSeekでも同じような報告がされている:
- DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
事前学習でも以下のような話はある:
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
関連:
- We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
開発者の方のポスト:
所見:
AA IndexでGPT-5.6-Solと同等性能を達成し、7kのRL dataとフレームワークをオープンにする予定とのこと。
所見:
解説:
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
もあわせて読みたい
Reinforcing Agents with Collective Skills, Xu+, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #ReinforcementLearning #Environment #Author Thread-Post Issue Date: 2026-09-23 Comment
元ポスト:
dataset, env: https://hub.harborframework.com/datasets/skill2env/skill2env
Measurements for understanding the pace of AI development inside frontier labs, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Evaluation #Blog #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
所見:
Introducing Astra for Law, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Legal #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
Step 5 Preview: Advancing the Pareto Frontier, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
StepFunのフラグシップモデルで、Fable 5, GPT-5.6-luna, GLM-5.3、Kimi-K3と並びAAの評価においてパレート最適に位置する。
600B-A27B, 1M contextのVLM, 10/15にOpenWeight化されるとのこと。
Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure, Z.ai, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Infrastructure #Blog #SelfImprovement #SoftwareEngineering #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-19 Comment
元ポスト:
GLM開発におけるRSIよ初期の事例
Jev’s Architecture Unmasked, Archer Hume, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #Blog #Coding #SoftwareEngineering #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
果たして
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Quantization #Blog #OpenWeight #ComputerUse #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-2
関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。
【ノーカット】AIに関わる米中戦争と日本の現状 国立情報研 佐藤教授, 時事通信映像センター, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Alignment #GenerativeAI #FoundationModel #Safety #Video #Selected Papers/Blogs #VisionLanguageModel #Robotics #WorldModels #VisionLanguageActionModel #EmbodiedAI #Reading Reflections #WorldActionModel Issue Date: 2026-09-18 Comment
非常におもしろかった...色々と考えさせられるなあ。
特にフィジカルAIにおいて、中国は人海戦術で、(簡単な動作を学習できたら複雑な動作を実現することにつながるという仮説の元)非専門家の簡単な動作に関するデータを大量に収集し、最近では仮想環境でデータを合成し活用する動きがある(Sim-to-Real)に対して、日本の場合は、特定の企業の現場のデータを収集しようとする動きがある。(このような文脈において、日本の政策として考えた場合に)特定の企業が有する現場のデータは、その現場特有の特徴が入り込むから実はロボットの学習データに向いていない、という話は、なるほど、と思うなどした。
たとえば、
- [Paper Note] Open X-Embodiment: Robotic Learning Datasets and RT-X Models, Open X-Embodiment Collaboration+, arXiv'23, 2023.10
- [Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02
のように、多様なデータを統一された枠組みで学習をすることで汎化することを狙うという戦略の場合は、現場データの現場特有のバイアス問題はどの程度緩和されるのだろうか。
- Superposition, Memorization, and Double Descent, Transformer Circuits Thread, 2023.01
のDouble Decentのような議論を考えると、同じ種別のデータで、きちんと多様なデータが集まっていれば、現場固有のバイアスが含まれていても汎用的な特徴量としては学習されずらい、という現象は起こるように思える。
また、仮想空間と実世界のgapもあるようで、視覚的なgapは合成データ等で埋め合わせがある程度できそうな一方で、触覚や力感のような繊細な部分や、物理的なセンサーのノイズや、実際のデバイスの物理的な個体差のようなものは、仮想空間上では再現しづらいという話もあるようである。
ただ、なんとなーく、まず汎用的なモデルを学習して基礎的な動作(LLMで言うところのatomic skill)を満足にできる基盤モデルを用意し(これはおそらく仮想空間や非専門家データで足りる)、その基盤モデルはin-context learning能力を備えていて、現場のロボットに適用する際にはfew-shotのdemonstrationや、ルーブリックのようなものを与えて制御する、というのでうまくいくシナリオは起きそうな気がしており、そうなると大量の現場データは必ずしも必要ではなさそうだよね、という気はする。
ただし、日本が人海戦術をとれないのであれば、汎用基盤モデル→現場での適用、というレールの上に乗るのであれば、直接的に汎化させるには専門的すぎる現場のデータが与えられたときに、そこからどのようにして汎用的な基盤モデルを学習できるのか、というところがうまくいけば、ある程度形になるのではなかろうか、と思うなどした。
We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい
コストの試算:
Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。
現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。
Introducing System One Models & Jev, TypeSafe AI, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Blog #Coding #SoftwareEngineering #Selected Papers/Blogs #reading #KeyPoint Notes #Reference Collection #Reading Reflections #SystemOneModel Issue Date: 2026-09-16 Comment
細かいことは全くわからないが、LLMのようなチャットモデルは超人的な性能なのになぜAGIに繋がっていないのかが常々疑問で、code+AIに特化したモデルを開発したとのことで、それはどのようなものかというと、
LLMは人間の好みとなる応答を返すように、autoregressiveにテキストを生成するが、
本ブログで紹介されているシステムSystemOneは意思決定に最適化し、並列で生成され、自由なテキストを返せないが構造化出力を高速かつ安価に生成可能で、キャリブレーションされた確信度を常に返す、
というもののようである。
着眼点はとてもおもしろいのだが、どの程度高度な推論をすることができるのだろうか?
現代では高度な推論は計算コストである程度賄っているため、安価で高度な推論もできるのでれば大きなブレイクスルーだが、その技術はLLM側にも適用できる可能性があり、結局いつかLLM側に追いつかれる、という可能性がある。
逆に高度な推論ができないのであれば、適用可能なスコープは限定的となる。
RLCDという技術はすでに先行事例があったようだ:
利用規約でJevに関するベンチマークスコアや性能を公開することが禁止されているようである:
所見:
JamC-QAのスコアは(GPT-5.6-lunaより)低く、日本特有の知識などには弱い可能性がある:
- 『JamC-QA』: 日本の文化や風習に特化した質問応答ベンチマークの構築・公開(前編), SB Intuitions, 2025.09
色々な動向を鑑みるに、Encoderか、Decoderかはさておき(利用者から見たらどちらでもよい気がするので)、
- zero-shotで様々なタスクに利用可能で
- latencyが非常に速くて
- コストが安価なモデル
という3つの要素が重要に思える。
chatはできないが、構造化出力/関数出力等が可能(なことで様々な分類タスク等に適用できる)というのは、latencyの速さとコストの安価さを得るための手段。エンコーダ、デコーダも手段の話。
過去にPFNがJevに相当する機能を開発しサービス化までしていた、という話がある(関連技術は幅広く特許を取得しているようである)。
なぜ需要を掘り起こせなかったのか、という点は考えてみるとおもしろいのかもしれない。
個人的にはいまJevが流行っぽい兆しを見せているのは、時期的なものが大きい気がしており、
- (Reasoningモデルの台頭によって) LLMのlatencyが悪い
- 多くのワークフローに組み込む場合に得たい出力が(おそらく)構造化出力(で、めちゃめちゃ賢い判断はそこまで必要とされない)
- モデルのトークン利用料が増加し、(おそらく)運用コストが課題となってきた
という課題に世の中が直面し始めて、課題感として持たれ始めていること、が背景としてある気がしており、ちょうどタイミング的に「安い、速い、(そこそこ)賢い」のJevが世の中に刺さったのではないか、という気がしている。
AI Infrastructure at Periodic, Periodic Labs, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Infrastructure #ReinforcementLearning #Blog #LLMServing Issue Date: 2026-09-16 Comment
元ポスト:
[Paper Note] FLASHREINFORCE: CRITIC-FREE SINGLE-ROLLOUT ASYNCHRONOUS RL FOR AGENTIC LANGUAGE MODELS, Hu+, ResearchGate, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #Asynchronous Issue Date: 2026-09-15 Comment
元ポスト:
解説:
CubeSandbox, Tencent, 2026.09
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #One-Line Notes #Security #Author Thread-Post #SandboxEnvironment Issue Date: 2026-09-15 Comment
元ポスト:
AI Agentのためのサンドボックス環境を構築できるツールのようで、独立したカーネルを用いたサンドボックス環境が高速に可能で、secureでスケーラブルである、ということのようである。
万字长文带你读懂 RSI(自进化,Self-Evolving), 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Blog #SelfImprovement #KeyPoint Notes #autoresearch/RSI Issue Date: 2026-09-14 Comment
元ポスト:
中国語が読めないので、LLMの力を借りながら読んでいるが、RSIについての定義と、RSIに関する研究を整理、分類するためのTaxonomyを複数の軸から整理しているようである。以下LLMの力を借りて読んだ内容を自分の言葉も交えてメモとして残す。
---
RSIとは、Agentが環境との相互作用から得たタスク軌跡とフィードバックを利用して、自身の状態を更新し、更新後の状態を後続タスクに活用すること、と定義しているようである。
かなり広めの定義に見えるが、ざっくり言うとこのような定義になるのは、管理人の理解でもそうだと思う。
Agent = Model + Harness と捉え、RSIの何を変えるのか、という部分について以下の分類を用いて整理をしているようである:
- Parameter: 経験をモデルの重みに内在化する
- 一例: [Paper Note] Self-Adapting Language Models, Adam Zweiger+, arXiv'25
- Context: LLMへのInputに反映させる
- 一例: [Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
- Memory: 外部に保存された経験や情報として蓄積し、必要に応じて利用する
- 一例: [Paper Note] ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory, Siru Ouyang+, ICLR'26, 2025.09
- Skill: 次に同じ状況が起きたらどうすべきかをskillとして定義する。Memoryは過去の経験を蓄積するものであり、Skillは次どうするかを定義するという棲み分けをしている
- 以下は参考として管理人がピックしたもの
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
(パラメータも最適化しているがSKILLBANKが該当すると思われる)
- [Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
- Harness Code: Agentを動作させるプログラム(Scaffolding)を変更する
- 一例: [Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
- 元ブログ中では↑が挙げられているが、Darwin Godel Machineの方が近いのでは?[Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
また、進化を構造化(バージョン管理)する際の分類軸として
- chain: A->B->Cのように進化させ常に最新版を利用する
- tree: 木構造でバージョンを管理する。ある1つの親ノードから子ノードが構成される親子関係で管理
- 一例: [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- graph: グラフ構造でバージョン管理する。すなわち、複数のノードに基づいて新たなノードを構成できる。ノードはバージョンだけでなく、タスク、trajectoryなども該当すると読める。
と整理しているようである。
誰がAgentを更新するかという軸の整理では
- self (student): (生徒)自身が更新する
- Teacher: trajectoryをteacherが分析しteacherが更新する
- Student + Teacher: 上記の両方で、生徒がまずtrajectoryを整理し必要な項目の候補を挙げ、Teacherが精査をし反映させる
いつ進化するのか、という軸では
- offline: 経験を蓄積し一括で更新する
- online: タスク実行ごとに動的に更新する
- hybrid: オフラインで更新した後にデプロイ。デプロイ後もオンラインで新たな経験等を追加し動的に更新するような方式
と定義しているようである。
そのほかにも、補足的な分類軸として、
- acceptance criteria: 更新したものを反映する基準
- feedback source: feedbackの出自(ベンチマーク, 環境, verifier, LLM, 人間など)
- feedback type: score, non-score,
- update frequency: 更新頻度
- scope of experience: 経験がどのスコープまで利用可能なのか(generickに使えるのか、特定ドメインのみなのか等)
We Must Pace the Frontier, Dario Amodei, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Blog #SelfImprovement #Safety #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-13 Comment
元ポスト:
果たして。
独占禁止法で訴えられているとのこと:
ApprenticeBench: The first end-to-end benchmark of computer use, continual learning, and long-horizon agentic capabilities, set in a real job., NeoCognition, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #One-Line Notes #ContinualLearning Issue Date: 2026-09-13 Comment
元ポスト:
Computer Use + Continual Learningに関するベンチマークで、仮想的な建設会社の経理担当として入社し、一定の見習い期間(7ヶ月)を経て、その期間に企業のハンドブックやERPシステムチュートリアル、過去の請求書などで学習をする想定。その実際の請求書処理をこなしていくが、そこには実務上の罠が多く意図的に仕掛けられているようで、Human Baselineでも成功率は51%。最終的にHuman Baselineを上回ったのはAstra, Fable 5.1のようである。モデル間の傾向の違いなども考察されているようである。
Introducing SWE-2: Pushing the Pareto Frontier, The Cognition Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #One-Line Notes #Author Thread-Post Issue Date: 2026-09-11 Comment
元ポスト:
Kimi-K3をベースに事後学習を通じてAstra, Fable 5.1と同等程度のSWE系ベンチマークスコアを獲得
Introducing Auto Engineering for Robotics, General Robotics, 2026.09
Paper/Blog Link My Issue
#Article #LanguageModel #SelfImprovement #Robotics #Initial Impression Notes #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-09-10 Comment
元ポスト:
ロボットにおける実験プロセス全体を自動的にループするハーネスの提案、という話に見える。
Muse, your personal AI agent that gets things done, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Personalization #GenerativeAI #Blog #Author Thread-Post Issue Date: 2026-09-09 Comment
元ポスト:
16年前に思い描いた未来像までとうとう到達したなあ...(小並感)
On the Navier–Stokes Millennium Prize Problem, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #GenerativeAI #Blog #Mathematics #Selected Papers/Blogs #Proofs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-09 Comment
あのペレルマン氏が証明したポアンカレ予想と並ぶミレニアム懸賞問題の一つである、ナビエストークス方程式の解の存在と滑らかさ、とやらがOpenAIが保有する未公開モデルによって証明されたかもしれないらしい。10000の協調エージェントによって88時間, トークン量は1300億トークンで解に到達したのだとか。
元ポスト:
解説:
Research acceleration: The view inside OpenAI, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #GenerativeAI #Blog #SelfImprovement #ScientificDiscovery #autoresearch/RSI Issue Date: 2026-09-08 Comment
元ポスト:
Automation’s Early Footprint: Where AI Agents Are (and Aren’t) Being Built, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation #Blog #read-later Issue Date: 2026-09-07 Comment
元ポスト:
Steering towards “automated grading” degrades alignment, Betley+, LW, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #read-later Issue Date: 2026-09-07 Comment
元ポスト:
终局奖励之后:从 Apodex 1.1 看长程 Agentic RL 如何分配 credit, 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #CreditAssignment Issue Date: 2026-09-06 Comment
元ポスト:
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, Google, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
コストパフォーマンスは良さそうに見えるが、GPT-5.6-lunaが比較の表に記載されておらず、GPT-5.6-lunaのコストパフォーマンスに勝てるのだろうか?Artificial Analysisによる評価を待ちたい。
と思ったら以下ポストを見つけたが、DeepSWEにおいてはパレート最適な模様。GPT-5.6-lunaよりもコストは高いがその分性能も高い、ように見える。
- DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, DeepSWE, 2026.05
高いように見えるなあ、と思ったらこのような話もある、ようである:
CursorBenchでも似たような傾向:
- Composer 2 のご紹介, Cursor, 2026.03
Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:
task単位のstep数がかなり異なる:
Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
397Bモデルに対するDPPOによる事後学習によってAPEX-Agentsのスコアを+11.2%を実現するための取り組みと地検が共有されているようである。
関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
Agentic Kernels in Production, Brian Li, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #LLMServing #Post #GPUKernel Issue Date: 2026-09-06
TERMINAL-BENCH 4.0, TERMINAL-BENCH, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #Live #Initial Impression Notes Issue Date: 2026-09-05 Comment
元ポスト:
新しいタスクを追加する方向性ではなく、既存のタスクで課題(拒否、正解が公開、品質面等)があるものや飽和したものを改善、評価実行時のタイムアウトやエラーなどのリソース面の改善をし測定誤差の低減なども実施しているようである
所見:
TERMINAL-BENCH-SCIENCE 0.1: A benchmark for evaluating AI agents on research workflows across scientific domains, harbor-framework, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Science #Author Thread-Post Issue Date: 2026-09-05 Comment
元ポスト:
Introducing K2 Horizon: Frontier Performance, Radically Open, Institute of Foundation Models, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-09-04 Comment
元ポスト:
所見:
HF: https://huggingface.co/collections/IFM/k2-horizon
GPT-5.6-luna級の性能を375B-A23Bで実現されているように見え、データ、レシピ、コード、重みが公開される。
Introducing Muse Spark 1.3, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-04 Comment
元ポスト:
早くもGPT-5.6-Solと同等以上の性能に到達した模様
long context性能が良さそうに見える:
と思いきや、(Museに限らないが)MRCRのスコアにはコンタミネーションの疑いがある。
Artificial Analysisによる評価:
Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:
GPT-6 Astra: A new generation of intelligence, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Blog #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-04 Comment
元ポスト:
GPT-5.6 Solから大幅に性能向上。scaling lawはいつまで続くのだろうか
ベンチマーク上は
- Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
を超えている。
所見:
アーキテクチャに関する所見:
- [Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
- [Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25
より注意深く指示に従い、CUAの能力も大幅に向上しているようである:
CUAによってBlenderで作成されたhouseの例がなかなかすごい
Artificial Analysisによる評価によると、Artificial Analysis Indexでは5.6-Solと同等、Coding IndexでもFable 5と同等であり、OpenAIによるベンチマークスコアとかなり乖離があるように見える。パブリックなベンチマークに対して過剰に適合しているのか。それともArtificial Analysisのベンチマーク群とその重みづけにより算出されるスコアの相性が悪いのか。(まあこれを考えても不毛だけど)
SRE-Benchと呼ばれるモデルがコンパイル済みのバイナリからソフトウェアをリバースエンジニアリングできるかを測定するベンチマークが飽和したとのこと:
SRE-Bench:
https://benchlm.ai/benchmarks/srebench
所見:
Artificial Analysis Indexのスコアが更新されてFable 5.1とAstraのスコアが同じになったようである😅:
RSI-Exam: Benchmarking Recursive Self-Improvement through Executable Research, RSI-Exam, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
Hugging Face のインシデントと今後の道筋, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Blog #read-later #Selected Papers/Blogs #Security #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
の件の調査結果のようである。
Introducing Pipette: A benchmarking suite for on-device intelligence, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #SmallModel #read-later #Author Thread-Post Issue Date: 2026-08-29 Comment
元ポスト:
dots3-note Preview: A Small but Mighty Step Toward Long-Horizon Agency in Real Life, dots studio, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Blog #OpenWeight #VisionLanguageModel Issue Date: 2026-08-22 Comment
HF: https://huggingface.co/dots-studio/dots3-note-prev
元ポスト:
DeepSeek-V4-Flash-Vision-Exp, DeepSeek AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-22 Comment
DeepSeek初のマルチモーダルモデル(VLM)とのこと
重みが公開: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Scaling Activation Oracles to Trillion-Parameter Models: Oracles improve with model size, data size, and data quality, Transluce, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
WildArtifactBench, Meta, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Evaluation #MultiModal #LLM-as-a-Judge #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
AI Agentによるpreference judgeに基づく、win rate/Elo Scoreによるマルチモーダルエージェントのベンチマークのようである
Ornith-1.5: From Self-Scaffolding to Self-Improvement, Ornith, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #OpenWeight #SelfImprovement #reading Issue Date: 2026-08-20 Comment
HF: https://huggingface.co/collections/ornith-ai/ornith-15
元ポスト:
関連:
- Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
モデルを学習するためのタスク生成、scaffolding(e.g.,ヒントなどのタスクを適切な難易度に調整する足場を作ること)生成、解答の生成(ロールアウト)それぞれをself-improvementさせながら学習されたモデルとのこと。
Cua: Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation, trycua, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #NLP #Infrastructure #ComputerUse #Selected Papers/Blogs #Author Thread-Post #SandboxEnvironment Issue Date: 2026-08-20 Comment
元ポスト:
DataSmith: Automating Data Research, datologyai, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #SyntheticData #Blog #SelfImprovement #One-Line Notes #Reading Reflections #Data #autoresearch/RSI #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment
元ポスト:
Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。
興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。
が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com
- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。
NanoGPT Speedrun Frontier, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #SelfImprovement #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-17 Comment
元ポスト:
所見:
18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。
The AI Engineering Skills Map, Andrew Ng, 2026.08
Paper/Blog Link My Issue
#Article #GenerativeAI #Post #SoftwareEngineering Issue Date: 2026-08-15
Introducing Toast 1, Mixedbread, 2026.08
Paper/Blog Link My Issue
#Article #NLP #Search #LanguageModel #Blog #One-Line Notes #Author Thread-Post Issue Date: 2026-08-15 Comment
GPT 5.6 Sol, Opus 5と同等以上の性能をもち、10倍安く、12倍高速なsearch agentとのこと。技術的な詳細は書かれていないように見え、ベンチマークの話が記述されている。
元ポスト:
Prime Intellectによるポスト:
Prime Intellectを通じて学習されたということは、大規模なAgentic RLを大規模なEnvironmentに対して実行したことが示唆される。
Introducing NAC, an Open-Source Harness for Long-Running Agent Work, Arcee, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #LongHorizon #AgentHarness Issue Date: 2026-08-15 Comment
元ポスト:
DeepSeek Harness, Deepseek AI, 2026.08
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #Coding #SelfImprovement #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 Comment
元ポスト:
モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。
元ポスト:
高い拡張性を持つため、self-improveするハーネスと相性が良さそう。
所見:
MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost, MAI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #Coding #Proprietary #SoftwareEngineering #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device, Meta, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/meta-models/Muse-Glimmer-30B
Museシリーズから初のOpenWeightモデルがリリースされ、ライセンスはApache 2.0
所見:
Alexandr Wang氏によるポスト:
ザッカーバーグ氏によるポスト:
Muse Spark 1.2もオープンになるとのこと。
所見:
アーキテクチャ解説:
Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
Paper/Blog Link My Issue
#Article #Blog #read-later #Selected Papers/Blogs #Security Issue Date: 2026-08-10 Comment
元ポスト:
所見:
所見:
関連:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
Multi-Agent Systems in PRIME-RL, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #Multi #NLP #LanguageModel #Infrastructure #ReinforcementLearning #Blog #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
VISTA: A Visual Harness for Reasoning in an Interactive World, Han+, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Reasoning #read-later #Selected Papers/Blogs #2D (Image) #3D (Scene) #memory #LongHorizon #Author Thread-Post #AgentHarness Issue Date: 2026-08-10 Comment
元ポスト:
数学と理論計算機科学における10の進展, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #GenerativeAI #Blog #Mathematics #ScientificDiscovery #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-09 Comment
元ポスト:
歴史的な出来事になる可能性がある
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence, Google Research, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Hallucination #Blog #SelfImprovement #ScientificDiscovery #Verification #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
[Paper Note] Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents, MAI-UI Team, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #ComputerUse #VisionLanguageModel #Initial Impression Notes #GUI Issue Date: 2026-08-09 Comment
pj page: https://tongyi-mai.github.io/Qwen-UI-Agent/
多くのベンチマークでFrontier Modelを上回る性能を示すGUI Agent。デモを見るとなかなかインパクトがある。
元ポスト:
[Paper Note] Statutory construction and interpretation for AI, He+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #PostTraining #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
Constitutional AIのようなルーブリックに基づいてモデルの振る舞いを調整する方法では、ルールの捉え方がモデルに応じて異なることで幅広い解釈が存在することが問題となることを指摘。モデル間での解釈を一致させるために、
- Interpretive Constraints: 法解釈の原理に基づいたPromptingによって、モデル側の解釈の裁量を制限し
- Iterative Refinement: 曖昧性のある記述をiterativeに洗練させる
ことによって緩和する。
関連:
- [Paper Note] Constitutional AI: Harmlessness from AI Feedback, Yuntao Bai+, arXiv'22
2 つの設定で ARC-AGI-3 ベンチマークのスコアが 3 倍に, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Selected Papers/Blogs #One-Line Notes #Compression #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-08 Comment
元ポスト:
ARC-AGI-3のベンチマークを測定する際に、ARC-AGI-3が提供いているオフィシャルのシンプルなハーネスではなく、Response APIで実施されているような reasoningの保持と圧縮をするようなハーネスに変更したら、スコアが3倍以上になったよ、という話のようである。
それはそう、という感じではあるのだが、シンプルなハーネスでそのモデルが持つ強みを発揮しきれないのであれば、公平な比較になっていないよね?という話でもある。モデルの能力を測定するための変数が増えすぎて、公平な比較をするのがどんどん難しくなってきている。
Introducing MazeBench, MazeBench, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Planning #VisionLanguageModel #3D (Scene) #SpatialUnderstanding #One-Line Notes #LongHorizon Issue Date: 2026-08-05 Comment
元ポスト:
3D空間において、カメラアングルの移動とブロックの移動をすることで実施可能なパズルゲームによる新たなベンチマークで、視覚的・空間的な推論能力と、長期のplanning能力を評価する。
AI が広げる人々の仕事, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #GenerativeAI #Blog #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。
このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?
AgentENV, kvcache-ai, 2026.07
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #ReinforcementLearning #PostTraining #Initial Impression Notes #Environment #Author Thread-Post #SandboxEnvironment Issue Date: 2026-08-05 Comment
元ポスト:
大規模、かつ高速にAgentic RLのためのサンドボックス環境をself-hosting可能な実装
下記ポストに速度やKimi K3で利用された時の環境の規模感が記述されているので参照のこと:
MAI-Cyber-1-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Security #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
公式:
BTL-3, badtheorylabs, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Coding #PEFT(Adaptor/LoRA) #OpenWeight #SoftwareEngineering #One-Line Notes #ToolUse Issue Date: 2026-08-04 Comment
ポイント解説:
Qwen3.6-27Bに対してLoRAによってcoding, tool useに特化した事後学習を実施したモデルで、HFではアダプタが公開されている。
Introducing Antares: Highly Efficient Open Weight AI Models for Vulnerability Localization, Cisco Blogs, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Coding #SmallModel #OpenWeight #SoftwareEngineering #One-Line Notes #Security #Author Thread-Post Issue Date: 2026-08-04 Comment
HF: https://huggingface.co/fdtn-ai/antares-1b
コードベースの脆弱性を検知することに特化したSLM
ポイント解説:
公式ポスト:
How much science is verifiable? Results from replicating ICML 2026 oral papers, SAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
ICML 2026のOralとして採択された論文の再現実験を通じて得られた知見がまとめられているようで、非常に面白そう。
エージェントスウォームと新しいモデルの経済性, Cursor, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #SoftwareEngineering #read-later #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
コストが最大15倍も利用するモデルにより変化したとのことだが、コードの品質はどの程度変化したのだろうか?(まだ読めていない
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。
nanogpt speedrunを通じた分析結果なども載っている。
DeepSeek-V4-Flash, Deepseek, 2023.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs Issue Date: 2026-08-02 Comment
Artiflcial Analysisによる評価:
GLM-5.2, Muse Spark 1.1, Gemini3.6-Flash, GPT-5.6-lunaと同等程度のスコアにもかかわらず、スコアに対するパラメータ比率で圧倒的にパレート最適に位置付けられる。
Epoch Capabilities IndexでOpenWeightモデルでKimi K3に次ぐ2位、全体でOpus 4.6に次ぐ7位
Language model harnesses are compositional generalizers, Zhang+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #read-later #Generalization #RecurrentModels #RecursiveModels #AgentHarness Issue Date: 2026-07-31
長時間稼働モデル時代の安全性とアラインメント, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Blog #Safety #LongHorizon #Security #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。
関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Extending Legal Agent Bench to M&A Due Diligence, Harvey, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Post #read-later #Legal Issue Date: 2026-07-31 Comment
元ポスト:
Agentic World Models, Cameron R. Wolfe, Ph.D., 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #Blog #read-later #WorldModels #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
[Paper Note] Towards Long-Horizon Agents: A Survey Foundation, Evolution, Harness, Optimization, Application, and Frontier, Dong+, 2026.07
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #LongHorizon #Author Thread-Post Issue Date: 2026-07-31 Comment
pj page: https://long-horizon-agents.github.io/
元ポスト:
とても良さそう。とんでもない量だ。。。Open Problemsのところは非常にコンパクトで明快
github:
https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
LLMエージェント評価の現在地 — 主要ベンチマークに学ぶ設計原則, Hiraoka, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Evaluation #read-later #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
こちらの記事を含めて元ポストに5本、日本語でAI Agentの評価に関して実際に手を動かした知見がまとまっているようで、読みたい。
The new rules of context engineering for Claude 5 models, Thariq, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Post #ContextEngineering #reading #AgentHarness Issue Date: 2026-07-25 Comment
元ポスト:
Introducing Claude Opus 5, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment
元ポスト:
coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分
いよいよベンチマークではClaude一強という感じになってきた:
Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07
脆弱性を検知する能力が高い:
[Paper Note] LLaDA2.2, InclusionAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #DiffusionModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-25 Comment
HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash
元ポスト:
LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。
FRONTIER-BENCH V0.1: A benchmark to measure and evolve with the frontier of agent work, FRONTIER-BENCH, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #Selected Papers/Blogs #Live #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。
タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。
Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
Grok Build is open source: SpaceXAI's coding agent and CLI, SpaceXAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #One-Line Notes #AgentHarness Issue Date: 2026-07-23 Comment
元ポスト:
github: https://github.com/xai-org/grok-build
SpaceXAIによるcoding agent harness
所見:
Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search, Prime Intellect, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #PostTraining #One-Line Notes #Scalability #Environment Issue Date: 2026-07-23 Comment
元ポスト:
36.5kのagentic RLのためのenvironments。対象はSWE, Search, terminal。全てのタスクセットが、任意のハーネス、ランタイム上でone commandで実行可能とのこと。
Solar Open 2: Korea's Sovereign Foundation Model, Built for Agentic Use, Upstage, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Korean Issue Date: 2026-07-23 Comment
元ポスト:
