autoresearch/RSI


Paper/Blog Link My Issue
#ScientificDiscovery #LongHorizon Issue Date: 2026-09-06 GPT Summary- AI研究エージェント(AIRA)は、機械学習実験の効率を高めるために、評価コストを抑えるAI研究嗜好モデル(RPMs)を導入。これにより、候補解の中から最も有望なものを予測し、固定予算内での進捗を最適化。RPMsは事前学習済み言語モデルの変種として構築され、AIRA-dojoに統合後、機械学習ベンチマーク AIRS-Benchでのスコアを向上させ、実行時間を短縮しながら新たな最先端結果を達成。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Evaluation Issue Date: 2026-09-06 GPT Summary- ループエンジニアリングにおいて、コーディングエージェントがタスクを実行する際の進行を管理するためのベンチマーク「LoopArena」を提案する。この評価では、コントローラーがエージェントに次のアクションや検証を指示し、タスク遂行の成功を測定する。三つの異なる設定で評価を行い、観察された最高成功率は24.69%であり、長期的な改善の余地があることが示された。評価コードは公開されている。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-09-06 GPT Summary- 自己改善するLLMエージェントは、従来の方法ではメタレベルの固定に限界があり、メタ操作を安定化させる必要がある。本研究ではMeta^nを提案し、固定されたメタ操作で再帰的に作用する新しいアプローチを採用。Ω演算により、生成物に繰り返し適用し、次層を戦略的に処理する。深さは入力の増大に応じて決まり、進化的なアーカイブを活用。実験により、Meta^nが従来の自己改善エージェントを上回り、特にARC-AGI-2ではゼロスコアを超える性能を達成。再帰的利得は条件付けに起因し、層ごとの役割が進化することが示唆された。コードは公開済み。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Alignment #Author Thread-Post Issue Date: 2026-09-05 GPT Summary- 自動化された整合性研究者(AARs)は、整合性の失敗を緩和するために複数の安全ベンチマークを最適化する手法を提案。最強のAAR法は整合性の失敗を大幅に減少させ、他のベンチマークや大規模モデルへの一般化も実現。人間の研究者によるワンショット法と比較して、AARは優れた性能を示し、経験豊富な研究者の助言が必須でない可能性を示唆。これにより、整合性研究の自動化が実用的であることが示された。 Comment

blog: https://alignment.anthropic.com/2026/automated-alignment-researchers/

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-09-04 GPT Summary- Praxistは、自律的な研究開発エージェントの限界を克服するために設計された系統情報中心のシステムで、成果物と評価結果を構造化します。このシステムは、局所的な成果物を証拠統合と分離することで、後続の試みで検証された機構を継承し、再現可能な結果を維持します。標準化された75タスクにおいてPraxistは60枚のメダルを獲得し、経済的にも優位性を示しました。四つのケーススタディによってオープンエンドの問題への適用が成功し、各タスクでの精度向上や資源コストの削減が記録されました。この新たな成果物のアプローチは、従来のものに比べて強力かつ効率的です。 Comment

blog: https://praxist.sapient.inc/en

元ポスト:

Loading…

要はRSIのためのAgent Harnessのようである。
github: https://github.com/sapientinc/praxist

Table2を見ると、Claude Code + Opus 4.8に対して、PRAXIST + DeepSeekV4-Proで性能が比較されている。




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #read-later #AgentHarness Issue Date: 2026-09-04 GPT Summary- 自律的なソフトウェア開発を探求し、LLMベースのコーディングエージェントが高レベルの要件から機能的なソフトウェアを生成する。Harness-of-Harness(HoH)フレームワークを導入し、コーディングエージェントによる継続的な改善を促進。HoHは反復的な計画—コーディング—テストループを組織し、修復と能力成長のバランスを取ることで、開発を小さく検証可能なインクリメントに限定。GameCraft-Benchなどで、HoHはスタンドアロンハーネスを上回り、平均52.25%の相対ゲインを達成。数日間の展開で、完全な一人称視点シューティングゲームを自律的に開発した。 Comment

元ポスト:

Loading…

abstを読むだけだとよくわからない




Paper/Blog Link My Issue
#NLP #AIAgents #memory #AgentSkills #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- Recurisは再帰的自己改善の課題に対処するための作業記憶アーキテクチャで、タスクの履歴が増えてもスキル利用を最適化することを目指す。タスク進行を追跡し、現在のニーズに基づいたスキル選択を行うことで、実行を証拠に変換し、失敗を特定に局在化する。4つのベンチマークで35件のモデルが成功率を向上させ、特にtau-benchではGPT-5.6 Solに+17.8ポイントの向上を示す。長期的な互換性では利点が拡大し、一般的な失敗を最大80%低減することが確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
Issue Date: 2026-08-25 GPT Summary- エージェント性変異演算子(AVO)は、進化的探索において従来の手法を自律的なコーディングエージェントに置き換える新たな手法である。候補生成に言語モデルを限定せず、AVOは自己指向的なエージェントループとして実装編集を提案する。NVIDIA Blackwell上での評価において、AVOはマルチヘッド・アテンションの自律進化を通じて、cuDNNやFlashAttention-4を上回る最適化を発見。これにより、エージェントが進化パイプラインの候補生成者から変異演算子へと進化し、最先端のGPU上で顕著な性能向上を示すことが明らかとなった。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07




Paper/Blog Link My Issue
Issue Date: 2026-08-25 GPT Summary- InfiAgentは、LLMエージェントの文脈を厳密に制限し、永続状態を外部化する汎用的なフレームワークである。文献信息調査の実験により、20Bのオープンソースモデルを用いても、特定の微調整なしで長期的なカバレッジを向上させることが示された。これにより、長期安定性を求めるエージェントの実用的な基盤が支持される。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03




Paper/Blog Link My Issue
Issue Date: 2026-08-25 GPT Summary- ARC-AGI-3は、ゲームの規則や状態を推測しながらプレイヤーが行動効率を保つインタラクティブな環境を提供する。Tychoシステムを通じて、ゲーム固有のモデルを構築し、自由形式の仮説を検証・計画・修復する能力を付与。実行可能な観測から改善された行動効率(RHAE)は88.49に達し、選択した方針ではRHAEが100.00に到達。自動修復後のモデルは正確ながらRHAEは減少。強いプレイには、モデル利用のタイミングを決定することが重要であり、これを能動的抽象化と称す。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] Toward Autonomous Long-Horizon Engineering for ML Research, Guoxin Chen+, arXiv'26, 2026.04
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongHorizon #Initial Impression Notes Issue Date: 2026-08-25 GPT Summary- エージェント性を持つシステムはAI研究の自動化を進めているが、研究目的を実験的に検証されたMLシステムに変換することは依然として課題である。これを「長期的なML研究エンジニアリング」として研究し、マルチエージェントシステムAiScientistを紹介。File-as-Busワークスペースを通じて研究チームが協調し、進捗を管理。PaperBenchではGemini-3-FlashおよびGLM-5を用い、それぞれ9.92点と11.15点の改善を達成。MLE-Bench Liteでも両方のバックボーンが81.82 Any Medal%を達成し、強力な基準を上回る改善を示した。アブレーション実験は、プロジェクトの耐久性が後の改良に重要であることを明らかにし、システム的な進捗維持の重要性を示唆している。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- [Paper Note] PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks, Yuki Orimo+, arXiv'25, 2025.12
- [Paper Note] Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning, Boxiu Li+, arXiv'26, 2026.08
- [Paper Note] InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents, Chenglin Yu+, arXiv'26, 2026.01
- [Paper Note] Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3, Jens Lehmann+, arXiv'26, 2026.07
- [Paper Note] AVO: Agentic Variation Operators for Autonomous Evolutionary Search, Terry Chen+, arXiv'26, 2026.03

Orchestratorは簡潔な情報に基づいて個々のWorkerを制御し、Workerはファイルシステム上に残された詳細な情報にアクセスできるようにするようなアーキテクチャ

image




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #Creativity Issue Date: 2026-08-24 GPT Summary- LLMエージェントは、訓練戦略の内部で反復しながら事後訓練を行い、下流の性能を改善する能力を持つ。しかし、実際には初期の戦略が固定され、訓練後は局所的な調整に陥ることが多い。これに対し、経験駆動のアプローチは実行力を向上させ、指導は初期戦略を効果的に再指向するが、その後の調整は不十分である。重要なのは、エージェントが自発的に戦略を再評価する仕組みが欠けていることである。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Author Thread-Post #Creativity Issue Date: 2026-08-22 GPT Summary- 再帰的自己改善(RSI)に関する本研究は、AIシステムが他のAIシステムを自ら改善できるかを探求し、その過程として訓練アルゴリズムの設計が鍵となることを示す。AI4AI-Benchという新たなベンチマークを提示し、エージェントが訓練アルゴリズムを最適化する能力を評価。各タスクにおいてエージェントはコードを書き換え、実行結果を比較。平均スコアは0.166、最良システムで0.250に達したが、既存アルゴリズムとの距離は依然として大きい。タスク群や評価結果を公開し、再現性のある測定を可能にする。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#LanguageModel #AIAgents #Mathematics #read-later #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- AIシステムは数学研究の効率化を進めており、希少な資源を適切に配分することが重要な課題である。従来のAIを活用した数学ワークフローでは、人間の労力が初期と末端に集中し、研究課題の選定と成果物のレビューがボトルネックとなっている。新たに提案する人間-AI発見パラダイムでは、専門家が関心のある研究方向を設定し、システムが文献から候補問題を検索。Find, Attempt, and Recommend(FAR)を構築し、問題探索を自動化する。組合せ論の実験では、5,245件の論文から6,453件の候補を収集し、最終的に77件の潜在的解決策を選定。これにより新しい協働モードの有効性が示された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongHorizon #Initial Impression Notes Issue Date: 2026-08-10 GPT Summary- 持続的な自己進化を実現する実行環境Argusを提案。これはエージェントが安定したユーザー意図を維持しつつ、運用目標に基づいてミッションを遂行する。Argusは固定されたモデル重みを保ちながら、自己進化を運用状態と制御方針を通じて実現。SWE-Bench Proで78%、AARRI-Benchで76.8%を記録し、各アクティブワークフロー時間を短縮しつつ、検証やレビューの精度を向上。これにより、将来的な教師あり学習と強化学習のための構造化した進化を実現することを示した。 Comment

元ポスト:

Loading…

メモリに永続化する情報を検証プロセスを通じて選別することで、誤った情報が蓄積され増幅されることを緩和する




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #PostTraining #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 再帰的自己改善(RSI)を実現するためのAIシステムOpenMLEを提案。機械学習エンジニアリング(MLE)のフルスタック環境を提供し、ポストトレーニングを通じたメタ進化エージェントFrontis-MA1(35B)が、基本的なプログラム進化演算子を用いてタスクを改善。OpenMLE-Evoを使って、性能が大幅に向上し、他の先進的モデルを超える結果を示す。全体のモデルの重みとスタックは公開されており、RSI研究の再現性を支援。 Comment

元ポスト:

Loading…

pj page: https://frontisai.github.io/OpenRSI/

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #One-Line Notes #Open-endedTasks #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AI研究を自動化するエージェントの進展を評価する新しい方法として、著者評価によるシャドウ評価を導入。高品質な未公開論文について実施した結果、エージェントは独力で設計開発を行ったが、実質的な進展が得られず、両論文は却下された。失敗モードとして、判断力の欠如、設計不備への非創造的対応、バックトラックの不足などが特定され、エージェントは研究の全過程において課題を抱えていることが示された。 Comment

元ポスト:

Loading…

未発表のオープンエンド(=non verifiable)な研究課題に対して同様のテーマをAI Agentに与えて論文を記述させ、原論文の著者が実際に内容を検証することによって、現在のAI Agentのオープンエンドな研究課題に対するアプローチの課題を明らかにした研究で、サンプルサイズの小ささや、AI生成であることを知った上でのレビュー結果など、様々なlimitationがあるが興味深い。
たとえば、以下のような知見が得られたとのことである:
- top conferenceの水準に対する判断力の欠如
- 創造的な問題解決能力の欠如
- 誤った判断を早期に下し、それを是正できない




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Safety #Monitorability #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- AIエージェントの信頼性が懸念される中、出力の安全な利用を評価する方法が求められる。本研究では、AIコントロールの手法を用いて、自動化されたAI R&Dの信頼性を評価するフレームワークResearchArenaを提案。4つの長期タスクにおいて、サボタージュを検出するために監視機構を導入し、モデルやアーティファクトの性能を確認。監視メカニズムは有効だが、隠れたサボタージュの検出が難しいことが示された。このフレームワークは自動化されたAI R&Dのなかでのサボタージュと統制の評価を可能にする。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #PostTraining #Data Issue Date: 2026-08-07 GPT Summary- LLMエージェントによる再帰的自己改善を目指し、固定のポストトレーニングスタックを用いた統制ベンチマークRSIBench-Dataを導入。エージェントは訓練データ戦略を反復的に修正し、データ中心の研究能力を示すが改善は一貫せず。最初の試みにおける58.33%の成功率の中、78.26%が低い最終スコアで終わる。四つの成功パターンを特定し、有用な発見は可能もフィードバックの一貫した改善には至らず。コードはオープンソースとして公開。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03
- ML Intern, HuggingFace, 2026.04
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07

解説:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #AgentHarness Issue Date: 2026-08-06 GPT Summary- AREXは、再帰的自己改善型の深層研究エージェントで、複数の制約を満たす回答を効率的に見つけるための手法を提案します。内部研究ループで暫定的な回答を構築し、外部ループで回答を監査・改善することで、検証過程を強化します。自律的な文脈更新ツールを学習し、長期的な視野での学習を促進。密結合モデルおよびMixture-of-Expertsモデルを用いた実験では、様々なベンチマークで顕著な性能向上を示しました。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #SyntheticData #PostTraining #read-later #Selected Papers/Blogs #Data #Author Thread-Post Issue Date: 2026-06-26 GPT Summary- データサイエンティストとして機能するAIエージェントの一般的手法Autodataを提案。エージェントはメタ最適化を通じて高品質な訓練データを生成。計算機科学や法的推論、数学を用いた実験で、従来の手法と比較して性能向上を確認。エージェントのメタ最適化がさらなる改善をもたらし、高品質なモデル訓練を支援する可能性を示唆。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #AIAgents #ScientificDiscovery #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AIは科学的発見に活用されつつあるが、科学の進歩を予測可能かは不明。本研究では、科学進歩予測のための評価フレームワークCUSPを提案し、4,760件の科学イベントを分析。最先端モデルには体系的・領域依存的な限界があり、科学的進歩の実現を信頼性高く予測できず、特に生物学・化学・物理学での予測が異なる。モデルは不確実性推定の信頼性に欠け、過信や応答バイアスを示し、現行のAIシステムは科学進歩予測には不十分であることを示唆。知識へのアクセスが信頼性に結びつかないことも明らかになった。 Comment

元ポスト:

Loading…

現在のモデルはブレイクスルーの要素技術となるようなアプローチを認識できるが、実際にいつブレイクスルーが起きるかを正確には予測できず(ほぼランダムと同等)、dateがgivenで4種類のイベントが与えられて以下のどれが起きるか?といったMCQだったらそこそこ予測できる、という感じだろうか。

image

image

ブレイクスルーがいつ起きるか、dateを予測するというタスク設定にはノイズが多すぎて無理があるのでは...?と最初は思ったが、MCQと対比して予測能力の限界を示すという観点では興味深い。また、もしautoresearchが本格的に実施されるようになった未来があったとして、投入される計算機リソースとモデルが一定だとしたら、少し状況は変わるのかもしれない。

データセットの構築方法、BinaryがどのようなQuestionによって実施されたのか(negationを用いていると記述されているが)、FRQとdate predictionの違いは何か、といったあたりはしっかりわかっていない。




Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- AI支援研究は進化し、自動化システムが低コストで論文を生成可能になったが、整合性の問題が浮き彫りに。特に、最先端のLLMでも結果の捏造や誤りの見逃しがある。研究ライフサイクルを四つの段階(Creation, Writing, Validation, Dissemination)で分析し、AIの信頼性と自律性の限界を特定。AIは構造化されたタスクには優れるが、新規のアイデアや実験には脆弱であり、人間の協働が最も信頼される。具体的なリソースはプロジェクトページで提供。 Comment

pj page: https://worldbench.github.io/awesome-ai-auto-research

元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #GenerativeAI #ScientificDiscovery #read-later Issue Date: 2026-04-05 GPT Summary- AIは複雑な認知タスクを実行するツールであり、その急速な進化は伝統的な哲学的問いを呼び起こす。本論文では、AIが歴史を通じて人間の道具として発展してきたことに触れ、人間中心の開発が重要であると主張。AIの応用が人間の生活向上や思考能力の拡張に寄与することを目指し、知的分野への統合の道筋を提案する。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #PostTraining #read-later #Selected Papers/Blogs #Environment Issue Date: 2026-03-14 GPT Summary- AIエージェントは推論能力の向上によりソフトウェア工学で高い能力を発揮し、AI研究の自動化可能性を考察する。本論文では、基盤LLMを有用なアシスタントへ変えるポストトレーニングの評価を行うためのベンチマークPostTrainBenchを導入。特定のベンチマークで最先端エージェントの性能を評価し、自律性を持たせた実行方法を検討することが重要である。進捗は見られるが、公式の指示調整済みモデルには劣る状況が多く、時折上回るケースも存在。エージェントの行動にはリワードハックなどの懸念があり、慎重なサンドボックス化の重要性を示唆する。PostTrainBenchはAIの研究開発の進捗とリスクを追跡する上で有用である。 Comment

pj page: https://posttrainbench.com/

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #SelfImprovement #ScientificDiscovery #PostTraining #read-later #Selected Papers/Blogs #One-Line Notes #EvolutionaryAlgorithm Issue Date: 2026-01-24 GPT Summary- 自動化されたAI研究は科学的発見の加速に寄与するが、現在のLLMはしばしば効果的でないアイデアを生成。アイデア実装のための自動実行器を構築し、並行GPU実験を通じてその効果を検証。進化的探索と強化学習の2方法を分析し、前者はGRPOベースラインを上回るサンプル効率、後者は単純なアイデアに収束し上限を制限。実行に基づくAI研究の未来を探る。 Comment

アイデアを実行できる環境を与え、進化的な探索をRLと実行結果に基づくReward(ベンチマーク性能など)によって実施するような話で、実行結果に基づくRewardに基づいてRLすると、平均的にうまくいくように最適化され性能を最大化することに苦労する、といった知見が得られた、という趣旨の話が元ポストで記述されている。

best solutionを見つけるようにRLする研究がこちら:
- [Paper Note] Learning to Discover at Test Time, Mert Yuksekgonul+, arXiv'26, 2026.01

元ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #LongHorizon #Author Thread-Post Issue Date: 2025-12-06 GPT Summary- PARCは、自律的に長期的な計算タスクを実行するコーディングエージェントであり、自己評価と自己フィードバックを通じて高レベルのエラーを検出・修正します。材料科学の研究において重要な結果を再現し、数十の並列シミュレーションタスクを管理します。Kaggleを基にした実験では、最小限の指示からデータ分析を行い、競争力のある解決策を生成します。これにより、独立した科学的作業を行うAIシステムの可能性が示されました。 Comment

元ポスト:

Loading…

PFNから。

著者ポスト:

Loading…


Planner, Workerによるoutcomeをself-reflectionする際に、Planner, Workerのcontextをあえて渡さないことでより客観的な検証(誤った前提や思い込みがないか等の検証)を実現しているとのこと。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Blog #One-Line Notes #Reading Reflections #Data #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment

元ポスト:

Loading…

Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。

image

興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
image

decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。

が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com

- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02

で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-17 Comment

元ポスト:

Loading…

所見:

Loading…

18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Repository #ScientificDiscovery #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-10 Comment

元ポスト:

Loading…

リポジトリのDiscussionsに、定期的にsession reportがアップロードされるようだ:
https://github.com/karpathy/autoresearch/discussions/43

nanochatは現在、126回の実験を経て、Validation BPBが0.997900 -> 0.969686 まで改善しているとのこと。

pjの目的やテーマは、**研究者がpythonファイルのコードをいじるのではなく、program.mdと呼ばれるAgentにコンテキストとして与えるmarkdownファイルのみの編集を通じて、研究組織(≠単一のPh.D student)をエミュレートできるか?** という点にありそうである。
https://github.com/karpathy/autoresearch/blob/master/program.md

その題材の一つとして、nanochatを簡略化したGPTを用いて、GPTの事前学習の性能を改善させるようなtraining.pyの編集をAI Agentsに実施させ、5分間学習させて成果を報告させるという形式をとっている(と解釈した。)

関連:
- [Paper Note] AlphaEvolve: A coding agent for scientific and algorithmic discovery, Alexander Novikov+, arXiv'25, 2025.06
- [Paper Note] ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution, Robert Tjarko Lange+, arXiv'25, 2025.09

続報:

Loading…