AIAgents (883) — 5/5
Introducing Google Antigravity, a New Era in AI-Assisted Software Development, Google, 2025.11
Paper/Blog Link My Issue
#Article #LanguageModel #GenerativeAI #Blog #Proprietary #SoftwareEngineering Issue Date: 2025-11-19 Comment
元ポスト:
google謹製のAI Agent FirstなIDE、らしい
Holo2: Cost-Efficient Models for Cross-Platform Computer-Use Agents, H Company, 2025.11
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Blog #OpenWeight #ComputerUse #Selected Papers/Blogs #VisionLanguageModel #Grounding #GUI Issue Date: 2025-11-14 Comment
HF: https://huggingface.co/collections/Hcompany/holo2
元ポスト:
関連:
- Holo1.5 - Open Foundation Models for Computer Use Agents, H Company, 2025.09
Lessons from the Trenches on Building Usable Coding Agents - Graham Neubig, Graham Neubig, 2025.11
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Coding #Video Issue Date: 2025-11-09 Comment
元ポスト:
戦えるAIエージェントの作り方, Takuya Akiba, SakanaAI, 2025.10
Paper/Blog Link My Issue
#Article #Tutorial #Slide #Test-Time Scaling #One-Line Notes Issue Date: 2025-11-01 Comment
元ポスト:
SakanaAIの研究を中心に、特に推論時スケーリング(test time scaling)の話が紹介されている。
Introducing Aardvark: OpenAI’s agentic security researcher, OpenAI, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #One-Line Notes #Security Issue Date: 2025-10-31 Comment
元ポスト:
> In benchmark testing on “golden” repositories, Aardvark identified 92% of known and synthetically-introduced vulnerabilities, demonstrating high recall and real-world effectiveness.
合成された脆弱性については92%程度検出できたとのこと。Claudeとかだとこの辺はどの程度の性能なのだろう。
Introducing SWE-1.5: Our Fast Agent Model, Cognition, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #SoftwareEngineering Issue Date: 2025-10-30 Comment
元ポスト:
windsurfから利用可能とのこと
AIエージェントのためのコンテキストエンジニアリング:Manus構築から得た教訓, Manus AI, 2025.07
Paper/Blog Link My Issue
#Article #NLP #Blog #ContextEngineering #reading Issue Date: 2025-10-28 Comment
元ポスト:
KV Cacheのhit率がまず重要で、TTFTの速さと、コストの双方に影響する。1トークンでも異なるとCacheがhitしなくなるので、注意を払う。たとえば、Contextのfeedが決定論的であることを確認し、prompt冒頭にタイムスタンプを含めるなどは避ける。セルフホスティングの場合はルーティングによってCacheが働くように共通のワーカーを一貫して使う。
LangGraph と NeMo Agent Toolkit ではじめる ReAct エージェント, Masaomi Tokunaga+, 2025.10
Paper/Blog Link My Issue
#Article #Tutorial #Blog Issue Date: 2025-10-27 Comment
元ポスト:
langchain, langgraphを用いたReActエージェントの実装方法のチュートリアルと、さまざまなフレームワークで記述されたエージェントの差分を吸収して統一されたプラットフォーム上でエージェントを実装できる(framework-agnosticな)NeMo Agent Toolkitによる実装
Building the Open Agent Ecosystem Together: Introducing OpenEnv, openenv, 2025.10
Paper/Blog Link My Issue
#Article #NLP #Selected Papers/Blogs #Standardization Issue Date: 2025-10-25 Comment
元ポスト:
AIエージェントを学習、運用するためのenvironmentを標準化し、共有可能にする取り組み。Meta PyTorchとHFの共同。
標準化:
- エージェントのコアアーキテクチャ(Environment,Task, Agentなど):
https://github.com/meta-pytorch/OpenEnv/blob/main/rfcs/001-abstractions.md
- インタフェース等:
https://github.com/meta-pytorch/OpenEnv/blob/main/rfcs/002-env-spec.md
- MCPツールのカプセル化:
https://github.com/meta-pytorch/OpenEnv/blob/main/rfcs/003-mcp-support.md
- エージェントのアクション:
https://github.com/meta-pytorch/OpenEnv/blob/main/rfcs/004-actions-as-tool-calls.md
Environment Hub: https://huggingface.co/openenv
Introducing torchforge – a PyTorch native library for scalable RL post-training and agentic development, PyTorch team at Meta, 2025.10
Paper/Blog Link My Issue
#Article #NLP #Library #ReinforcementLearning #Blog #Selected Papers/Blogs #TrainingFramework Issue Date: 2025-10-25 Comment
元ポスト:
Introducing ControlArena: A library for running AI control experiments, AISI, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Safety Issue Date: 2025-10-23 Comment
元ポスト:
FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems, FlashInfer Community, 2025.10
Paper/Blog Link My Issue
#Article #NeuralNetwork #MachineLearning #Dataset #Transformer #Evaluation #SoftwareEngineering #GPUKernel Issue Date: 2025-10-22 Comment
元ポスト:
GPUカーネルのエージェントによる自動最適化のためのベンチマークとのこと。
Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
Paper/Blog Link My Issue
#Article #Pretraining #MachineLearning #NLP #LanguageModel #ReinforcementLearning #In-ContextLearning #Blog #RewardHacking #PostTraining #Diversity #Selected Papers/Blogs #PRM #Generalization #Cultural #Emotion #ContinualLearning Issue Date: 2025-10-20 Comment
元ポスト:
関連:
- In-context Steerbility: [Paper Note] Spectrum Tuning: Post-Training for Distributional Coverage and
In-Context Steerability, Taylor Sorensen+, arXiv'25, 2025.10
(整理すると楽しそうなので後で関連しそうな研究を他にもまとめる)
とても勉強になる!AIに代替されない20%, 1%になるには果たして
所見:
Introducing SWE-grep and SWE-grep-mini: RL for Multi-Turn, Fast Context Retrieval, Cognition, 2025.10
Paper/Blog Link My Issue
#Article #Multi #EfficiencyImprovement #ReinforcementLearning #Blog #Proprietary #Parallelism #ContextEngineering #KeyPoint Notes Issue Date: 2025-10-18 Comment
元ポスト:
最大で4 turnの間8つのツールコール(guessingとしては従来モデルは1--2, Sonnet-4.5は1--4)を並列する(3 turnは探索、最後の1 turnをanswerのために使う) parallel tool calls を効果的に実施できるように、on policy RLでマルチターンのRLを実施することで、高速で正確なcontext retrievalを実現した、という感じらしい。
従来のembedding-basedなdense retrieverは速いが正確性に欠け、Agenticなsearchは正確だが遅いという双方の欠点を補う形。
parallel tool callというのは具体的にどういうtrajectoryになるのか…?
Context Engineering in Manus, Lance's Blog, 2025.10
Paper/Blog Link My Issue
#Article #Tutorial #NLP #Blog #ContextEngineering #One-Line Notes Issue Date: 2025-10-18 Comment
元ポスト:
- Reduce
- Offload
- Isolate
図解つきで各コンセプトについて非常に詳細に記述されている。最後のConclusionを見ればコンパクトに概要をつかめる。
Harnessを利用してLLMアプリケーション評価を自動化する, LINEヤフー テックブログ, 2024.12
Paper/Blog Link My Issue
#Article #LanguageModel #ML-LLM Ops #Blog #SoftwareEngineering Issue Date: 2025-10-13
supermemory, supermemoryai, 2025.10
Paper/Blog Link My Issue
#Article #NLP #Personalization #Repository #API #SoftwareEngineering #memory Issue Date: 2025-10-13
Building Brain-Like Memory for AI | LLM Agent Memory Systems, Adam Lucek, 2025.01
Paper/Blog Link My Issue
#Article #Tutorial #NLP #Video #memory Issue Date: 2025-10-13 Comment
元ポスト:
Shipping with Codex, OpenAI, 2025.10
Paper/Blog Link My Issue
#Article #NLP #GenerativeAI #Coding #Video #SoftwareEngineering #One-Line Notes Issue Date: 2025-10-12 Comment
元ポスト:
OpenAI内部で92%の技術スタッフがdailyで利用している、というマーケティングメッセージが非常に強力で、説得力を持たせていると感じる。
K2 Vendor Verifier, MoonshotAI, 2025.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #OpenWeight Issue Date: 2025-10-12 Comment
Kimi K2のプロバイダー間でのツール呼び出しの性能の違いを確認できる
元ポスト:
関連:
- Kimi-K2-Instruct-0905, MoonshotAI, 2025.09
- Kimi K2: Open Agentic Intelligence, moonshotai, 2025.07
Making AI citations count with Asta, AI2, 2025.10
Paper/Blog Link My Issue
#Article #Citations #NLP #Blog #ScientificDiscovery #One-Line Notes Issue Date: 2025-10-09 Comment
RAGベースの研究支援プラットフォームAstaに対して送信されたクエリに対して、システムが引用した研究論文に関する統計情報を公開したとのこと。興味深い。
citationに関するデータはこちら:
https://huggingface.co/datasets/allenai/asta-summary-citation-counts
定期的に更新するとのこと。
エージェント機能が大幅に強化されたPLaMo 2.1 Primeの提供開始, PFN, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Japanese Issue Date: 2025-10-07 Comment
マルチターンのtool callingのベンチマーク のSimple, Multiple(それぞれ単一ツール呼び出し、複数のツールの中から適切なツールを呼び出す能力)でBFCVv3でGPT-5超え。ただしGPT-5はツール呼び出しではなくユーザと対話する傾向にあるため、chatアプリケーションではこちらの方が有用な場合があるので全てのユースケースでPLaMoが上回ることを示しているわけではない、という注釈がついている。より実験的な環境であるLive MultipleではGPT-5の方がスコアが高い模様。
- BFCLv2, UC Berkeley, 2024.08
単一呼び出し、複数定義されている中から適切なツールを呼び出すことで済むようなユースケースの場合は検討の余地があると思われる。ただし細かいreasoning_effortやverbosity等のパラメータ設定が記述されていないように見えるので、その辺はどうなんだろうか。
PipelineRL, Piche+, ServiceNow, 2025.04
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Repository #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2025-10-05 Comment
code: https://github.com/ServiceNow/PipelineRL
元ポスト:
Inflight Weight Updates
(この辺の細かい実装の話はあまり詳しくないので誤りがある可能性が結構あります)
通常のon-policy RLでは全てのGPU上でのsequenceのロールアウトが終わるまで待ち、全てのロールアウト完了後にモデルの重みを更新するため、長いsequenceのデコードをするGPUの処理が終わるまで、短いsequenceの生成で済んだGPUは待機しなければならない。一方、PipelineRLはsequenceのデコードの途中でも重みを更新し、生成途中のsequenceは古いKV Cacheを保持したまま新しい重みでsequenceのデコードを継続する。これによりGPU Utilizationを最大化できる(ロールアウト完了のための待機時間が無くなる)。また、一見古いKV Cacheを前提に新たな重みで継続して部分sequenceを継続するとポリシーのgapにより性能が悪化するように思えるが、性能が悪化しないことが実験的に示されている模様。
Conventional RLの疑似コード部分を見るととてもわかりやすくて参考になる。Conventional RL(PPOとか)では、実装上は複数のバッチに分けて重みの更新が行われる(らしい)。このとき、GPUの利用を最大化しようとするとバッチサイズを大きくせざるを得ない。このため、逐次更新をしたときのpolicyのgapがどんどん蓄積していき大きくなる(=ロールアウトで生成したデータが、実際に重み更新するときにはlagが蓄積されていきどんどんoff-policyデータに変化していってしまう)という弊害がある模様。かといってlagを最小にするために小さいバッチサイズにするとgpuの効率を圧倒的に犠牲にするのでできない。Inflight Weight Updatesではこのようなトレードオフを解決できる模様。
また、trainerとinference部分は完全に独立させられ、かつplug-and-playで重みを更新する、といった使い方も想定できる模様。
あとこれは余談だが、引用ポストの主は下記研究でattentionメカニズムを最初に提案したBahdanau氏である。
- [Paper Note] Neural Machine Translation by Jointly Learning to Align and Translate, Dzmitry Bahdanau+, ICLR'15
続報:
続報:
PFN LLMセミナー, PFN, 2025.10
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #LLMServing #Japanese #PostTraining Issue Date: 2025-10-05 Comment
元ポスト:
Effective context engineering for AI agents, Anthropic, 2025.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #SoftwareEngineering #read-later #Selected Papers/Blogs #ContextEngineering #One-Line Notes Issue Date: 2025-10-04 Comment
元ポスト:
AnthropicによるContextEngineeringに関するブログ。
ざーっとみた感じ基礎的な定義からなぜ重要なのか、retrievalの活用、longnhorizon taskでの活用、compaction(summarization)など、幅広いトピックが網羅されているように見える。
最新サーベイはこちら
- [Paper Note] A Survey of Context Engineering for Large Language Models, Lingrui Mei+, arXiv'25
所見:
Pepper: A Real‑Time, Event‑Driven Architecture for Proactive Agentic Systems, Agentica Team, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #Personalization #Blog #Architecture #interactive #Initial Impression Notes Issue Date: 2025-10-03 Comment
元ポスト:
受動的なエージェントではなく、ユーザに対して能動的に働きかけてくるイベントドリブンなAI Agentのアーキテクチャ提案と、そのためのライブラリな模様。
GDPVAL: EVALUATING AI MODEL PERFORMANCE ON REAL-WORLD ECONOMICALLY VALUABLE TASKS, Patwardhan+, 2025.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation #Selected Papers/Blogs Issue Date: 2025-09-29 Comment
米国のGDPを牽引する9つの代表的な産業において、44の職種を選定し、合計1320件の実務タスクを設計したベンチマーク。ベンチマークは平均14年程度の経験を持つ専門家が実際の業務内容をもとに作成し、(うち、約220件はオープンソース化)、モデルと専門家のsolutionにタスクを実施させた。その上で、第三者である専門家が勝敗(win, lose, tie)を付与することでモデルがどれだけ実務タスクにおいて人間の専門家に匹敵するかを測定するベンチマークである。
評価の結果、たとえばClaude Opus 4.1の出力は47.6%程度、GPT-5 (high) は38.8%程度の割合で専門家と勝ち + 引き分け、という性能になっており、人間の専門家にかなり近いレベルにまで近づいてきていることが分かる。特にClaude Opus 4.1はデザインの品質も問われるタスク(ドキュメントの書式設定、スライドレイアウトなど)で特に優れているとのこと。
limitationとしては、
- 網羅性: データセットサイズが小さく、occupationごとの30タスクしかデータがないこと
- 自己完結型・知識労働への偏り: コンピュータ上でのタスクに限定されており、肉体労働や暗黙知が多いタスク、個人情報へのアクセス、企業内の専用ツールを利用した作業や他社とのコミュニケーションが必要なタスクは含まれていない。
- 完全な文脈: 完全な文脈を最初からpromptで与えているが、実際は環境とのインタラクションが必要になる。
- grader performance: 自動評価は人間の専門家の評価に比べると及ばない
といったことが書かれている。
How to Fix Your Context, dbreunig.com, 2025.07
Paper/Blog Link My Issue
#Article #DocumentSummarization #InformationRetrieval #NLP #Pruning #RAG(RetrievalAugmentedGeneration) #Blog #SoftwareEngineering #ContextEngineering Issue Date: 2025-09-28 Comment
Context Poisoning, Context Distraction, Context Confusion,
Context Clashの定義とそれらの対処法について書かれている。後ほど追記する
When Speed Kills Stability: Demystifying RL Collapse from the Training-Inference Mismatch, Liu+, 2025.09
Paper/Blog Link My Issue
#Article #Analysis #MachineLearning #NLP #LanguageModel #ReinforcementLearning #Blog #Selected Papers/Blogs #Stability #train-inference-mismatch Issue Date: 2025-09-27 Comment
元ポスト:
訓練時のエンジン(fsdp等)とロールアウト時のエンジン(vLLM等)が、OOVなトークンに対して(特にtooluseした場合に生じやすい)著しく異なる尤度を割り当てるため学習が崩壊し、それは利用するGPUによっても安定性が変化し(A100よりもL20, L20よりもH20)、tokenレベルのImporttance Weightingでは難しく、Sequenceレベルのサンプリングが必要、みたいな話な模様。
関連:
- Your Efficient RL Framework Secretly Brings You Off-Policy RL Training, Yao+, 2025.08
- [Paper Note] Group Sequence Policy Optimization, Chujie Zheng+, arXiv'25
FP16にするとtrain-inferenae gapが非常に小さくなるという報告:
- [Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10
A100でvLLMをバックボーンにした時のdisable_cascade_attnの設定値による挙動の違い:
そもそもFlashAttnention-2 kernelにバグがあり、A100/L20で特定のカーネルが呼ばれるとミスマッチが起きるのだとか。vLLM Flashattentionリポジトリのissue 87によって解決済み。~~具体的にどのカーネル実装なのだろうか。~~ (vLLM Flashattentionリポジトリだった模様)
https://github.com/vllm-project/flash-attention
disable_cascade_attnの設定値を何回も変えたけどうまくいかないよという話がある:
Liquid Nanos, LiquidAI, 2025.09
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #Mathematics #SmallModel #OpenWeight #Japanese #DocParser #EdgeDevices Issue Date: 2025-09-26 Comment
blog: https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices
モデルファミリーに350Mの日英翻訳モデルが含まれている…だと!?
タスクスペシフィックなedgeデバイス向けのSLM群。
以下のようなモデルファミリー。非構造テキストからのデータ抽出、日英翻訳、RAG, tooluse, Math, フランス語のチャットモデル。これまでマルチリンガルに特化したMTとかはよく見受けられたが、色々なタスクのSLMが出てきた。
元ポスト:
LFM2はこちら:
- Introducing LFM2: The Fastest On-Device Foundation Models on the Market, LiquidAI, 2025.07
Vibe Coding Cleanup as a Service, Donado Labs, 2025.09
Paper/Blog Link My Issue
#Article #Blog #Coding Issue Date: 2025-09-23 Comment
元ポスト:
Tongyi DeepResearch: A New Era of Open-Source AI Researchers, Tongyi Lab, 2025.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #DeepResearch Issue Date: 2025-09-17 Comment
元ポスト:
ベンチマーク:
- [Paper Note] Humanity's Last Exam, Long Phan+, arXiv'25, 2025.01
- [Paper Note] BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents, Jason Wei+, arXiv'25
- GAIA: a benchmark for General AI Assistants, Grégoire Mialon+, N/A, arXiv'23
- [Paper Note] xbench: Tracking Agents Productivity Scaling with Profession-Aligned
Real-World Evaluations, Kaiyuan Chen+, arXiv'25
- [Paper Note] SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric
Knowledge, Lukas Haas+, arXiv'25
- [Paper Note] WebWalker: Benchmarking LLMs in Web Traversal, Jialong Wu+, arXiv'25
- [Paper Note] Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation, Satyapriya Krishna+, NAACL'25
- [Paper Note] BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language
Models in Chinese, Peilin Zhou+, arXiv'25
関連研究:
- [Paper Note] WebWalker: Benchmarking LLMs in Web Traversal, Jialong Wu+, arXiv'25
- [Paper Note] WebDancer: Towards Autonomous Information Seeking Agency, Jialong Wu+, arXiv'25
- [Paper Note] WebSailor: Navigating Super-human Reasoning for Web Agent, Kuan Li+, arXiv'25
- [Paper Note] WebShaper: Agentically Data Synthesizing via Information-Seeking
Formalization, Zhengwei Tao+, arXiv'25
- [Paper Note] WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent, Xinyu Geng+, arXiv'25
- [Paper Note] WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon
Agents, Zile Qiao+, arXiv'25
- [Paper Note] ReSum: Unlocking Long-Horizon Search Intelligence via Context
Summarization, Xixi Wu+, arXiv'25
- [Paper Note] WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for
Open-Ended Deep Research, Zijian Li+, arXiv'25
- [Paper Note] WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic
Data and Scalable Reinforcement Learning, Kuan Li+, arXiv'25
- [Paper Note] Scaling Agents via Continual Pre-training, Liangcai Su+, arXiv'25
- [Paper Note] Towards General Agentic Intelligence via Environment Scaling, Runnan Fang+, arXiv'25
Agent Payments Protocol (AP2), Google, 2025.09
Paper/Blog Link My Issue
#Article #Blog Issue Date: 2025-09-17 Comment
AI Agentにpaymentをさせるためのsecureなプロトコルな模様
元ポスト:
OpenManus, Liang+, FoundationAgents, 2025.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Repository #OpenSource #DeepResearch Issue Date: 2025-09-13
OpenDeepResearch, LangChain, 2025.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Repository #OpenSource #DeepResearch Issue Date: 2025-09-13 Comment
Kimi-Researcher End-to-End RL Training for Emerging Agentic Capabilities, MoonshotAI, 2025.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #DeepResearch Issue Date: 2025-09-13
Context Engineering - Short-Term Memory Management with Sessions from OpenAI Agents SDK, OpenAI, 2025.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Blog #ContextEngineering Issue Date: 2025-09-11 Comment
元ポスト:
OpenHands PR Arena, neulab, 2025.09
Paper/Blog Link My Issue
#Article #Dataset #Evaluation #Repository #Coding #SoftwareEngineering #Selected Papers/Blogs Issue Date: 2025-09-04 Comment
元ポスト:
実際に存在するIssueにタグ付けすることで、リアルタイムに複数LLMによってPRを作成(API callはOpenHandswが負担する)し、ユーザは複数LLMの中で良いものを選択する、といったことができる模様?リーダーボードも将来的に公開するとのことなので、実際にユーザがどのモデルのoutputを選んだかによって勝敗がつくので、それに基づいてランキング付けをするのだろうと推測。興味深い。
slime, THUDM & Zhihu, 2025.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Library #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Asynchronous #TrainingFramework Issue Date: 2025-09-02 Comment
元ポスト:
GLM-4.5のRL学習に利用されたフレームワーク
- [Paper Note] GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models, GLM-4. 5 Team+, arXiv'25
The Hitchhiker's Guide to Autonomous Research: A Survey of Scientific Agents, Wang+, TechRxiv, 2025.08
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #ScientificDiscovery Issue Date: 2025-09-01 Comment
元ポスト:
NEC、暗黙知をデータ化し学習・活用することでWeb業務を自動化するエージェント技術「cotomi Act」を開発 〜世界初、人間を超えるWebタスク成功率80.4%を達成〜, NEC, 2025.08
Paper/Blog Link My Issue
#Article #NLP #Blog #ComputerUse Issue Date: 2025-08-27 Comment
元ポスト:
Best Practices for Building Agentic AI Systems: What Actually Works in Production, Shayan Taslim, 2025.08
Paper/Blog Link My Issue
#Article #Tutorial #Blog Issue Date: 2025-08-25 Comment
元ポスト:
DeepCode, Data Intelligence Lab@HKU, 2025.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Repository #Coding Issue Date: 2025-08-19 Comment
研究論文からコードを生成するpaper2code、テキストからweb pageを生成するtext2web、textからスケーラブルなバックエンドを構築するtext2backendを現状サポートしているvibe coding frameworkらしい。
論文のベンチマークの再現の自動化やパフォーマンス向上、自動コード検証などが追加されるらしい。
研究の出版に対して再現実験など現状到底間に合わないので、再現性があるかどうかを自動的に検証して欲しいなぁ、とは思っていたので個人的に嬉しい。
Introducing Kaggle Game Arena, Meg Risdal, 2025.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #Game Issue Date: 2025-08-06 Comment
元ポスト:
現在はチェスのみの模様
チェスときくとこの研究を思い出す:
- Learning to Generate Move-by-Move Commentary for Chess Games from Large-Scale Social Forum Data, Jhamtani+, ACL'18
Claude Opus 4.1, Anthropic, 2025.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #Proprietary #VisionLanguageModel Issue Date: 2025-08-06 Comment
他モデルとの性能比較:
やはりコーディングでは(SNS上での口コミでは非常に高評価なように見えており、かつ)o3やGeminiと比較してClaudeがベンチ上でも高い性能を示している模様。
元ポスト:
運用して初めてわかったDevinのセキュリティ課題 - Devin Meetup Tokyo 2025, 株式会社メルカリHiroki Akamatsu, 2025.07
Paper/Blog Link My Issue
#Article #Coding #Slide #SoftwareEngineering #Sequrity Issue Date: 2025-07-26
Python Template for Claude Code (Cookiecutter), zerebom, 2025.07
Paper/Blog Link My Issue
#Article #project_template #python #Coding #SoftwareEngineering Issue Date: 2025-07-26 Comment
元ポスト:
AI時代のソフトウェア開発を考える(2025_07版) _ Agentic Software Engineering Findy 2025-07 Edition, Takuto Wada, 2025.07
Paper/Blog Link My Issue
#Article #NLP #Coding #Slide Issue Date: 2025-07-25 Comment
Vibe Codingによってソフトウェアエンジニアリングの課題は解決されたわけではなく、昔からある問題は依然として存在し(技術的負債、レビューなど)、道具が変わりこれらが顕在化するスピードが急速に速まっただけ、という話な模様。
どの領域に、どのAIを使うか(委託, 伴走)なども考察されている。ロジックの複雑さが小さいものは委託(補完など)、ロジックの複雑さが高く競合との差別化が重要なエリアには伴走、といった使い方。AIは自走するが迷走、暴走もするのでガードレールがより一層重要。自分自身の能力の向上も不可欠。
Qwen Code, Qwen Team, 2025.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Repository #Coding Issue Date: 2025-07-23
Claude Code の Context Engineering, schroneko, 2025.07
Paper/Blog Link My Issue
#Article #Coding #Slide #SoftwareEngineering #ContextEngineering Issue Date: 2025-07-06
Context Engineering - What it is, and techniques to consider, llamaindex, 2025.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #SoftwareEngineering #ContextEngineering #Author Thread-Post Issue Date: 2025-07-04 Comment
元ポスト:
The New Skill in AI is Not Prompting, It's Context Engineering, PHLSCHMID, 2025.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #SoftwareEngineering #ContextEngineering Issue Date: 2025-07-04 Comment
元ポスト:
rLLM, Agentica, 2025.06
Paper/Blog Link My Issue
#Article #NLP #Library #ReinforcementLearning #PostTraining #Initial Impression Notes #TrainingFramework Issue Date: 2025-07-04 Comment
>rLLM is an open-source framework for post-training language agents via reinforcement learning. With rLLM, you can easily build their custom agents and environments, train them with reinforcement learning, and deploy them for real-world workloads.
なるほど。
バックボーンにはverlが採用されており、シンプルかつ統一的なインタフェースでカスタムエージェントが学習できる模様?
https://rllm-project.readthedocs.io/en/latest/#key-features
元ポスト:
関連:
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04
v0.2がリリースされ、任意のagentia programの学習がサポートされた模様(マルチエージェントや複雑なワークフローに基づくものなど):
AI Agent Manager (AAM) として生きていく : 作業環境とワークフローの設計, icoxfog417, 2025.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #SoftwareEngineering #read-later #Author Thread-Post Issue Date: 2025-06-23 Comment
元ポスト:
AI-assisted coding for teams that can't get away with vibes, Atharva Raykar, 2025.05
Paper/Blog Link My Issue
#Article #Blog #Coding #SoftwareEngineering #read-later Issue Date: 2025-06-21 Comment
元ポスト:
Single vs Multi-Agent System?, PHILSCHMID, 2025.06
Paper/Blog Link My Issue
#Article #NLP #Blog #read-later #Author Thread-Post Issue Date: 2025-06-21 Comment
元ポスト:
Don’t Build Multi-Agents, Cognition, 2025.06
Paper/Blog Link My Issue
#Article #Multi #NLP #Blog #read-later #ContextEngineering #Reference Collection Issue Date: 2025-06-17 Comment
元ポスト:
まとめ:
OpenAI-Codex, OpenAI, 2025.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #SoftwareEngineering #One-Line Notes #Reference Collection Issue Date: 2025-05-18 Comment
OpenHandsのNeubig氏が、OpenAIのブログポスト中で報告されているSWE-Bench Verifiedのスコアについて、言及している。OpenAIは23個サンプルについて(internal infrastructureで動作させられないため)除外しているので、その分スコアに下駄が履かれているようで、ブログ中のpassNのスコアを他のリーダーボードのスコアと比較する際には注意が必要っぽい。
Agent Frameworkはどれを使うべきか [タスク性能編], はち, 2025.05
Paper/Blog Link My Issue
#Article #Analysis #NLP #Library #Blog #One-Line Notes #Author Thread-Post Issue Date: 2025-05-06 Comment
各フレームワーク毎の性能の違いや消費したトークン数、実装の微妙や違いがまとめられており、太字でtakeawayが記述されているので非常にわかりやすい。
元ポスト:
Cursor_Devin全社導入の理想と現実, Ryoichi Saito, 2025.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Coding #Slide #SoftwareEngineering #Reading Reflections Issue Date: 2025-04-26 Comment
Devinの思わぬ挙動のくだりが非常に面白かった。まだまだ使いづらいところが多そうだなあ…。
Deepwiki, Cognition, 2025.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Repository #One-Line Notes Issue Date: 2025-04-26 Comment
githubリポジトリに関するリッチなドキュメントに対してDevinを通じて対話的に質問ができる模様。サインアップ不要で、githubリポジトリのドメインをdeepwikiに変えるだけで利用可能
BFCLv2, UC Berkeley, 2024.08
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation #API #Selected Papers/Blogs #One-Line Notes #ToolUse Issue Date: 2025-04-08 Comment
LLMのTool Useを評価するための現在のデファクトスタンダードとなるベンチマーク
BFCLv3:
https://gorilla.cs.berkeley.edu/blogs/13_bfcl_v3_multi_turn.html
The TypeScript Agent Framework, mastra, 2025.03
Paper/Blog Link My Issue
#Article #NLP #Library Issue Date: 2025-03-16 Comment
日本語解説: https://zenn.dev/yosh1/articles/mastra-ai-agent-framework-guide
Model Context Protocol (MCP), Anthropic
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #SoftwareEngineering #Selected Papers/Blogs #MCP Issue Date: 2025-03-15 Comment
下記リンクのMCPサーバ/クライアントの作り方を読むとだいぶ理解が捗る:
https://modelcontextprotocol.io/quickstart/server
https://modelcontextprotocol.io/quickstart/client
browser-useの基礎理解, むさし, 2024.12
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #ComputerUse #Reading Reflections Issue Date: 2025-03-15 Comment
公式リポジトリ: https://github.com/browser-use/browser-use
BrowserUseはDoMを解析するということは内部的にテキストをLLMで処理してアクションを生成するのだろうか。OpenAIのComputer useがスクリーンショットからアクションを生成するのとは対照的だと感じた(小並感)。
- OpenAI API での Computer use の使い方, npaka, 2025.03
AI_Agent_の作り方_近藤憲児, Kenji KONDO, 2025.03
Paper/Blog Link My Issue
#Article #LanguageModel #Slide Issue Date: 2025-03-14
OpenAI API での Computer use の使い方, npaka, 2025.03
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #ComputerUse #Reading Reflections Issue Date: 2025-03-12 Comment
OpenAIのCompute Useがどのようなものかコンパクトにまとまっている。勉強になりました。
公式: https://platform.openai.com/docs/guides/tools-computer-use
Open-source DeepResearch – Freeing our search agents, HuggingFace, 2025.02
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenSource #DeepResearch Issue Date: 2025-03-12
smolagents, HuggingFace, 2025.03
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #Library #Selected Papers/Blogs Issue Date: 2025-03-06
Introducing the SWE-Lancer benchmark, OpenAI, 2025.02
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation #Coding #SoftwareEngineering #One-Line Notes Issue Date: 2025-03-02 Comment
元ポスト:
1400以上のフリーランスソフトウェアエンジニアリングタスクを集めたベンチマーク。タスクはバグ修正から機能実装まで多岐にわたり、経験豊富なエンジニアによって評価されたもの。
Llama Stack, Meta, 2024.11
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #RAG(RetrievalAugmentedGeneration) #One-Line Notes Issue Date: 2025-01-25 Comment
Llamaを用いたLLM Agentを構築するための標準化されたフレームワーク。Quick StartではRAG Agentを構築している。
AI Agents 2024 Rewind - A Year of Building and Learning, VICTOR DIBIA, 2025.01
Paper/Blog Link My Issue
#Article #LanguageModel #Blog Issue Date: 2025-01-05
AI Agent Era, 福島良典 | LayerX, 2024.12
Paper/Blog Link My Issue
#Article #LanguageModel #Blog Issue Date: 2025-01-05
browser-use やばいです, Syoitu, 2024.12
Paper/Blog Link My Issue
#Article #NLP #python #Blog #API #ComputerUse #Reading Reflections Issue Date: 2025-01-04 Comment
すごい手軽に使えそうだが、クローリング用途に使おうとするとhallucinationが起きた時に困るのでうーんと言ったところ。
MLE-Bench, OpenAI, 2024.10
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation #AutoML #One-Line Notes Issue Date: 2024-10-20 Comment
75のkaggleのcompetitionsを収集(賞金1.9M$に相当する)し、そこから機械学習モデルの構築するためのエンジニアリングタスク(データセットの準備, モデルの学習, 実験)を抽出し、AI Agentsが機械学習モデルのこれらエンジニアリングタスクに対してどの程度実施できるかを測定できるようにしたベンチマーク
AutoGen, Microsoft, 2024.10
Paper/Blog Link My Issue
#Article #Multi #LanguageModel #Library #Repository #Conversation #MCP #One-Line Notes Issue Date: 2024-10-02 Comment
マルチエージェントを構築するためのフレームワーク。MCP Serverとの連携も可能で、AssistantAgent classを入れ子のように設定することで、親エージェントが特定領域に特化した子エージェントをtool useとして呼び出すようなマルチエージェントを構築できるように見受けられる。
PaperQA2, Future-House, 2023.02
Paper/Blog Link My Issue
#Article #NLP #QuestionAnswering #GenerativeAI #RAG(RetrievalAugmentedGeneration) #Repository #Author Thread-Post Issue Date: 2024-09-11 Comment
元ポスト:
OpenDevin: Code Less, Make More, 2024
Paper/Blog Link My Issue
#Article #NaturalLanguageGeneration #NLP #LanguageModel #Repository #One-Line Notes Issue Date: 2024-07-04 Comment
LLMによるOpenSourceなソフトウェア生成エージェントプラットフォーム
full timeのスタッフを雇用しworldクラスのUXを目指すとのこと。楽しみ。
参考:
Open化される前の最初のDevinのツイート
Awesome LM with Tools
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #Repository #One-Line Notes #ToolUse Issue Date: 2024-03-22 Comment
Toolを利用するLMに関するNeubig氏のグループによるSurvey。
IBIS2023チュートリアル「大規模言語モデル活用技術の最前線」, Michimasa Inaba, 2023.10
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Chain-of-Thought #Slide #One-Line Notes Issue Date: 2023-11-01 Comment
LLMの応用研究やPromptingを中心としたチュートリアル。アノテーションや対話式推薦システムへの活用、ReAct、プロンプトの最適化技術、CoTの基本から応用まで幅広くまとまっているので、LLMの応用技術の概観や、CoTを実践したい人に非常に有用だと思う。
Agents: An opensource framework for autonomous language agents
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #One-Line Notes Issue Date: 2023-09-30 Comment
以下の特徴を持つLLMAgent開発のためのフレームワーク
- long-short term memory
- tool usage
- web navigation
- multi-agent communication
- human-agent interaction
- symbolic control
また、他のAgent frameworkと違い、ゴールを達成するだの細かいプランニングを策定(SOP; サブタスクとサブゴールを定義)することで、エージェントに対してきめ細かなワークフローを定義できる。
Llamaindex, LlamaIndex, 2023.04
Paper/Blog Link My Issue
#Article #Tools #InformationRetrieval #NLP #Library #DocParser Issue Date: 2023-04-22 Comment
- 関連:
- LlamaIndexのインデックスを更新し、更新前後で知識がアップデートされているか確認してみた, nokomoro3@製造BT部, 2023.03
-
https://dev.classmethod.jp/articles/llama-index-insert-index/
LangChain関連で参考にしたReference
Paper/Blog Link My Issue
#Article #Tools #InformationRetrieval #NLP #LanguageModel #Library #Reference Collection Issue Date: 2023-04-21 Comment
- LangChain の Googleカスタム検索 連携を試す, npaka, 2022.12
-
https://note.com/npaka/n/nd9a4a26a8932
- LangChainのGetting StartedをGoogle Colaboratoryでやってみる ④Agents, kun432, 2023.03
-
https://zenn.dev/kun432/scraps/8216511783e3da
