Author Thread-Post (954) — 5/5
Introducing LongCat-2.0, LongCat, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes Issue Date: 2026-06-30 Comment
元ポスト:
- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD
HF:
https://huggingface.co/meituan-longcat/LongCat-2.0
現在はまだ公開されていないがモデルは上記で公開予定
Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象
LongCat Sparse Attentionポイント解説:
所見:
50k基のH800 GPUで学習されているとのこと。
所見:
ポイント解説:
Previewing GPT‑5.6 Sol: a next-generation model, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-06-27 Comment
元ポスト:
OpenAIによる新たなフロンティアモデルで、terminal benchでMythos 5, Fable 5超え。まずは少数のパートナーに提供し、その後数週間以内にGAを目指す、という感じらしい。
所見:
ベンチマーク:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
- [Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
- CyScenarioBench: Evaluating LLM Cyber Capabilities Through Scenario-Based Benchmarking, IRREGULAR, 2026.06
- [Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
- [Paper Note] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale, Zhun Wang+, arXiv'25, 2025.06
サイバーセキュリティに関するベンチマークの報告が増えてきたなぁ
Thinking to recall: How reasoning unlocks parametric knowledge in LLMs, Google Research, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Blog #Reasoning #read-later #FactualKnowledge Issue Date: 2026-06-26 Comment
元ポスト:
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #OpenWeight #SoftwareEngineering #PostTraining #One-Line Notes Issue Date: 2026-06-26 Comment
HF: https://huggingface.co/collections/deepreinforce-ai/ornith-10
元ポスト:
gemma4とQwen3.5をpost trainingしたコーディング特化LLMで、397BモデルではSWE Bench ProでGLM 5.2超え
Introducing Claude Tag, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #NLP #AIAgents #GenerativeAI #Blog Issue Date: 2026-06-24 Comment
元ポスト:
ポイント解説:
PLaMo 3.0 Primeをリリースしました, PFN, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Japanese Issue Date: 2026-06-23 Comment
元ポスト:
推論基盤のパフォーマンス検証と最適化戦略, Mikiya Michishita, 第3回 vLLM roundup Community Meetup Tokyoの登壇資料, 2026.03
Paper/Blog Link My Issue
#Article #LLMServing #Slide #read-later Issue Date: 2026-06-22 Comment
元ポスト:
Humans Still Beat AI in the Long Horizon: Revisiting Test-Time Scaling in the Agent Era, Mang+, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Coding #read-later #Selected Papers/Blogs #LongHorizon #Initial Impression Notes Issue Date: 2026-06-22 Comment
2週間にわたるopen endなプログラミングコンテストのデータを用いて人間の専門家とAI AgentのElo ratingの変遷を比較すると、序盤は人間に対して大きくリードしスコアは試行回数の対数に対して線形にスケーリングし次第に停滞を始めるが、人間の専門家は4日を超えたあたりから非線形にスコアが進化し、最終的にAI Agentよりも高いスコアを記録する。人間はAI Agentと比較して、継続学習ができていることが示唆され、AI Agentのlong horizonタスクに対する能力の限界が示唆される、という話に見える。
元ポスト:
Predicting model behavior before release by simulating deployment, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article Issue Date: 2026-06-22 Comment
元ポスト:
Map of Sentence Encoders, Danu-Blog, 2026.06
Paper/Blog Link My Issue
#Article #Embeddings #Blog #Encoder #Visualization Issue Date: 2026-06-20 Comment
元ポスト:
Deli_AutoResearch, Deli Chen, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #SelfImprovement #read-later #AgentSkills #autoresearch/RSI Issue Date: 2026-06-20 Comment
元ポスト:
日本語エージェントベンチマーク「J-tau telecom」の公開, SB Intuitions, 2026.06
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Japanese Issue Date: 2026-06-20 Comment
元ポスト:
[Paper Note] Post-Training Science for Supervised Fine-Tuning, O'Neill, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) Issue Date: 2026-06-20 Comment
元ポスト:
MolmoMotion: Language-guided 3D motion forecasting, Ai2, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #DiffusionModel #VideoGeneration/Understandings #3D (Scene) #FlowMatching #Robotics Issue Date: 2026-06-18 Comment
元ポスト:
Introducing LifeSciBench, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Biological Issue Date: 2026-06-18 Comment
元ポスト:
[Paper Note] ENPIRE: Agentic Robot Policy Self-Improvement in the Real World, Xiao+, 2026.06
Paper/Blog Link My Issue
#Article #SelfImprovement #Robotics #autoresearch/RSI Issue Date: 2026-06-17 Comment
元ポスト:
Sakana AI、初の商用プロダクト「Sakana Marlin」を提供開始, SakanaAI, 2026.06
Paper/Blog Link My Issue
#Article Issue Date: 2026-06-15 Comment
元ポスト:
ZONOS2: Real-time TTS with High-Fidelity Voice Cloning, ZYPHRA, 2026.06
Paper/Blog Link My Issue
#Article #NLP #Dataset #Evaluation #SpeechProcessing #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #TTS #Realtime Issue Date: 2026-06-15 Comment
元ポスト:
First Steps Toward Automated AI Research, Recursive Superintelligence, 2026.06
Paper/Blog Link My Issue
#Article #Blog #SelfImprovement #read-later #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-06-14 Comment
元ポスト:
word2vec, GloVe, Rucursive ModelのRichard Socher氏のポスト
Introducing Omnigent: A Meta-Harness to Combine, Control and Share Your Agents, Databricks, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #One-Line Notes #AgentHarness Issue Date: 2026-06-14 Comment
元ポスト:
ハーネスの上に統一されたAPIを追加し、複数エージェントのハーネスを協調させるメタハーネス
World Model Self-Distillation: Training World Models to Solve General Tasks, 2026,06
Paper/Blog Link My Issue
#Article #WorldModels Issue Date: 2026-06-14 Comment
pj page: https://wmsd-paper.github.io/World-Model-Self-Distillation/
元ポスト:
[Paper Note] What can a neuron compute, bioRxiv, 2026.06
Paper/Blog Link My Issue
#Article Issue Date: 2026-06-13 Comment
元ポスト:
olmo-eval: An evaluation workbench for the model development loop, Ai2, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Evaluation #ExperimentManagement Issue Date: 2026-06-13 Comment
元ポスト:
Research ideas you can't be outscaled on., Anthea Li, 2026.06
Paper/Blog Link My Issue
#Article #Blog #Repository #ScientificDiscovery #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-06-11 Comment
元ポスト:
計算リソースやスケールよりも洞察が重要な研究アイデアを共有できるページのようである。興味深い。
DiffusionGemma: 4x faster text generation, Google, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #DiffusionModel #Blog #OpenWeight Issue Date: 2026-06-11 Comment
元ポスト:
関連:
- [Paper Note] How Transparent is DiffusionGemma?, Joshua Engels+, arXiv'26, 2026.06
- DiffusionGemma: The First Diffusion LLM (dLLM) Natively Supported in vLLM, vLLM, 2026.06
gemma-4-12B-it-qat-UD-japanese-imatrix, dahara1, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #Japanese #read-later Issue Date: 2026-06-11 Comment
元ポスト:
[Paper Note] PixelRAG: Web Screenshots Beat Text for Retrieval Augmented Generation, 2026.06
Paper/Blog Link My Issue
#Article #RAG(RetrievalAugmentedGeneration) #read-later #OCR Issue Date: 2026-06-11 Comment
元ポスト:
Fluid, natural voice translation with Gemini 3.5 Live Translate, Google, 2026.06
Paper/Blog Link My Issue
#Article #MachineTranslation #SpeechProcessing #MultiLingual #SpeechToSpeech Issue Date: 2026-06-10 Comment
元ポスト:
人間中心の意思決定支援AI 2026年度 人工知能学会全国大会 (JSAI 2026) チュートリアル (2026.06.09), Yukino Baba, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #read-later Issue Date: 2026-06-09 Comment
元ポスト:
Implications of Large-Scale Test-Time Compute, Noam Brown, 2026.06
Paper/Blog Link My Issue
#Article #Post #read-later Issue Date: 2026-06-09
Apodex-1.0: A Verification-Centric Agent Team for Discoverative Intelligence, Apodex, 2026.06
Paper/Blog Link My Issue
#Article #OpenWeight #DeepResearch Issue Date: 2026-06-09 Comment
HF: https://huggingface.co/collections/apodex/apodex-1
元ポスト:
Introducing FrontierCode, Cognition, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Coding #SoftwareEngineering #One-Line Notes Issue Date: 2026-06-09 Comment
元ポスト:
Fable5, Opus5で、本ベンチマークにおいてtest-time-scalingを適用すると、性能は単調増加ではなくなる現象が報告されている
原因としては、Fable5, Opus5などはタスクとは関係ないコードのリファクタリングを実施することがあり、ベンチマークはスコープ外の編集に対してペナルティを課すため、このような場合はスコアにペナルティが課されている、ということのようである。
Improving our LLM Pretraining Efficiency, Open Athena, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #NLP #LanguageModel #Optimizer #MoE(Mixture-of-Experts) #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-06-06 Comment
元ポスト:
以下の処理によって、事前学習が高速化(FLOPsの改善幅)された知見が共有されている
- DenseからMoEモデルへの移行で実測値3.6倍
- MoEのexpart数を64->256で実測値1.3倍
- optimizerをMuonHにすることで、実測値1.25倍
- **Partial Key Offset (PKO) によって実測値1.2倍改善**
- **modded-nanogptリポジトリ、プルリクエスト169で初めて提案された手法とのこと。**
- **long windowのattentionに対して、keyの半分の次元をオフセット(=前のトークンのkey)、残りの半分の次元を自身のトークンのkeyとすることで、単一のクエリが連続した複数のキーにattendできるようになり、「過去の文脈からあるトークンの継続部分を検索して取得する」といった操作が単一のattention layerによって実現できるようになる**
- (これは知らなかった)
- expertのルーティングを再正規化・スケーリングすることで、実測値1.04倍
今後はHyperConnectionのようなResidual Streamの改善、推論効率向上のためMLA, LatentMoE, Multi Token Prediction, Gated Deltanet, quantizationなどの技術を検証するとのこと。
Expert数が多ければ多いほど性能が改善することは下記研究でも示されている:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
MuonH(というよりoptimizerのHyperplaneに基づいたラッパ)は以下(こちらもPercy Liang氏のグループ):
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
Hyper Connection:
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
MLA, LatentMoE, Multi Token Prediction, Gated Deltanet:
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- [Paper Note] Better & Faster Large Language Models via Multi-token Prediction, Fabian Gloeckle+, ICML'24
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
- [Paper Note] Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, Ali Hatamizadeh+, arXiv'26, 2026.05
Towards Compositional Steepest Descent, Tilde Research, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Blog #Optimizer Issue Date: 2026-06-06 Comment
元ポスト:
Ideogram 4: Open image model at the forefront of design, Ideogram, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #OpenWeight #ImageSynthesis Issue Date: 2026-06-05 Comment
元ポスト:
HF: https://huggingface.co/collections/ideogram-ai/ideogram-4
CUDA Programming Guide Part 1, Kazuki Fujii, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #Selected Papers/Blogs #reading Issue Date: 2026-06-05 Comment
元ポスト:
読む
NVIDIA Nemotron 3 Ultra, nvidia, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Reference Collection #LowPrecision #LinearAttention Issue Date: 2026-06-05 Comment
元ポスト:
アーキテクチャ解説:
Mamba2 layer, Latent MoE, GQA
ポイント解説:
HF: https://huggingface.co/collections/nvidia/nvidia-nemotron-v3
所見:
所見:
LFM2.5-VL-450M-Extract, LiquidAI, 2026.06
Paper/Blog Link My Issue
#Article #SmallModel #OpenWeight #VisionLanguageModel #One-Line Notes Issue Date: 2026-06-05 Comment
元ポスト:
画像から抽出したい情報をシステムプロンプトに定義することで、json形式で結果を返してくれるVLM
Introducing Gemma 4 12B: a unified, encoder-free multimodal model, Google, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #OpenWeight #VisionLanguageModel #2D (Image) #UMM #SpatialUnderstanding #One-Line Notes #Reference Collection #AudioLanguageModel #audio Issue Date: 2026-06-04 Comment
元ポスト:
vision/audioエンコーダーを無くしたvision/audio nativeなマルチモーダルLLM
HF: https://huggingface.co/google/gemma-4-12B
アーキテクチャ図:
A Functional Taxonomy of World Models, Fei-Fei Li, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #NLP #Post #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #VisionLanguageActionModel #KeyPoint Notes #TextToVideoGeneration #Reading Reflections #WorldActionModel Issue Date: 2026-06-04 Comment
元ポスト:
以下ポストの内容の要約(と意訳、間違ってたらごめんなさい)
- 世界モデルは現在最も重要だが、最も多義的な概念の一つになっている。
- 様々な分野がWorld Modelを構築していると主張するが、意味するところが実際には大きく異なる
- (実際 [Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
のような研究も存在し似たような問題意識のもと様々な分野での統一的な分類体系が提案されている)
- 世界モデルという用語のもともとの枠組みは「部分観測マルコフ決定過程 (POMDP)」であり、
- エージェントは行動を実行し、行動は世界の状態に影響を与え、エージェントは観測データを受け取り(≠状態を認識する)、新たな観測データに基づいてアクションが実行される、といったループが繰り返される枠組みである
- ここで、「状態」とは、ある時点における世界で何が起きているかに関する完全なdescriptionであり、エージェントは状態自体を認識することはできず、行動と状態から生じた部分的な観測データのみである。
- 現在様々な世界モデルと呼ばれるものが存在するが、構造としては上記のループを持っており、それらの切り口が異なっているにすぎない。
- 世界モデルのカテゴリ1: Renderer
- Rendererは人間の目に見えるピクセルで「観測」を出力する。
- たとえば、テキストのプロンプトを映像に変換するText-To-Videoモデル、ユーザの入力に応じてリアルタイムにフレームを生成するシステムはレンダラーに相当する。
- これらモデルは観測者にとって「見えるもの」を生成しているにすぎず、実際の3次元構造を明示的に理解しているわけではない(i.e., 見えるもの≠実在するもの)。
- ビジネスとして最も成長(してきており、学習データもインターネット上の動画が活用できるため他の2カテゴリと比べて多い)
- 世界モデルのカテゴリ2: Simulator
- Simulatorは「状態」を出力する。これは実際に人間やコンピュータが相互作用可能な世界の表現である。
- Rendererは単に視覚的なものであるが、Simulatorは実世界の幾何学的・物理的・動的なダイナミクスを理解することが求められる。
- Simulatorは建築家やゲーム開発者などの視覚を超えた(たとえば構造・物理的な)正確性を必要とする職種や、RLの学習の環境として利用できる。
- Simulator は Rendererと次のPlannerの土台となる技術(Simulatorは RendererとPlannnerの双方をバイパスできる)であるが、学習データが最も不足
- 世界モデルのカテゴリ3: Planner
- Plannerは「行動」を出力する。観測と目標が与えられた時に「次に何をすべきか」を出力する。
- Vision Language Action Model / World Action Model は Planner に該当し、これらはロボットが次に何をすべきかを決定できる。
- 現在研究初期段階で、研究所内での閉じられた環境でのデモ中心で、実世界で活用するためにはまだまだ多くの課題が残る。
- これら3つのカテゴリは現在世に出ているWorld Modelの多くを説明しており、区別をする際に役に立つ。
- が、これらカテゴリは独立したものではなく、これらは世界の機能に関する基本的な知識(幾何学、物理学、ダイナミクス)の上に成り立つ。
- これら3つのカテゴリは最近は互いが融合してくる流れにあり、たとえば事前学習された Renderer は、次に何が起こるか・何をすべきか(=Planner)を予測するためのバックボーンとして利用できることが示されてきており、これは Renderer と Plannerが 融合した例と言える。
- (この辺の話はBackboneとしてVision Encoderを持つVLA系全般の研究と、事前学習済みのVision Encoderを用いずに事前学習の方法をそもそも改善するような方向などだろうか)
上記の話に基づくと、たとえばターミナルでのWorld Modelに相当すると考えられる
- [Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
は3つのカテゴリのうちにどれに該当するだろうか。
次のアクションを予測できるので、まずPlannerには該当すると思われる。また、ある時点においてターミナル上で何が起きているかの記述(ターミナルの出力)を予測しているので、Simulatorの役割を果たしていると思われる(ただ、ターミナルの出力だけがターミナルの状態を完全に記述した情報なの?定義としてそれでいいの?という疑問はあるのが)。このため、Planner と Simulator が融合した研究と言えるのではなかろうか。
Holo3.1: Fast & Local Computer Use Agents, H Company, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #OpenWeight #ComputerUse #VisionLanguageModel Issue Date: 2026-06-03 Comment
HF: https://huggingface.co/collections/Hcompany/holo31
元ポスト:
関連:
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03
Building a hill-climbing machine: Launching seven new MAI models, Mustafa Suleyman, MAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #TextToImageGeneration #Blog #Coding #Proprietary #TTS #ImageSynthesis #Transcript Issue Date: 2026-06-03 Comment
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
元ポスト:
関連:
Artificial Analysisによる評価で、MAI Image-2.5がT2Iで2位, Image Editingが3位とのこと:
Is Frontier Asynchronous RL Solved?, Luke J. Huang, 2026.05
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #ReinforcementLearning #Blog #Selected Papers/Blogs #reading #Asynchronous Issue Date: 2026-06-03 Comment
元ポスト:
Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3, nvidia, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #OpenWeight #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #UMM #reading #Omni #One-Line Notes #WorldActionModel Issue Date: 2026-06-02 Comment
元ポスト:
公式:
encoder-freeなOmniモダリティモデルで、かつ将来の世界の状態、およびactionを予測可能なWorldActionModel
MiniMax-M3, MiniMaxAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MultiModal #OpenWeight #Post #Selected Papers/Blogs #VisionLanguageModel #UMM #One-Line Notes #Reference Collection Issue Date: 2026-06-01 Comment
ベンチマーク上はフロンティアモデルに性能がかなり肉薄しており、10日以内にモデルがオープンになる。
所見:
関連:
- [Paper Note] Learning Dynamics of LLM Finetuning, Yi Ren+, ICLR'25 Outstanding Paper Award
Artificial Analysisによる評価:
OpenWeightでSoTA
RLVR時代におけるInference Framework: Weight Syncing編, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #Blog #read-later Issue Date: 2026-06-01 Comment
元ポスト:
MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #Blog #read-later Issue Date: 2026-05-31 Comment
元ポスト:
次:
- RLVR時代におけるInference Framework: Weight Syncing編, Kazuki Fujii, 2026.05
Tips: Containerを利用したDL分散学習Libraryの開発環境, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #NeuralNetwork #Blog #Coding #SoftwareEngineering #One-Line Notes Issue Date: 2026-05-31 Comment
元ポスト:
次:
- MLエンジニアのための本質から理解するLLM推論 KV cache編, Kazuki Fujii, 2026.05
GPUクラスタのログインノード上にvscodeのRemote SSH接続をして作業をする際に、importの解決/補完/定義ジャンプ等のデバッグに有用な機能を有効化する3種類の方法について概説されている。特にその中の一つであるsandbox mirrorと呼ばれる方法は詳細に解説され、SIFをsandbox形式のディレクトリに展開し、その中のディレクトリをvscode側の設定に追加することで、コンテナにsessionをはらなくても有効化できる、といった話が書かれている。
MLエンジニアのための本質から理解するLLM推論 KV cache編, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #LLMServing #Selected Papers/Blogs #One-Line Notes #KV Cache Issue Date: 2026-05-31 Comment
元ポスト:
次:
- MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05
数式レベルで、図解付きで曖昧性なく、非常に丁寧で、かつ実装面にまで踏み込んだ解説だが、冗長ではなくコンパクトに解説されており、すごい。今度からKV Cacheってなんなんですか?の問いにはこの記事をベースに教えよう。感謝🙏
Announcing Surya OCR 2: small, accurate, multilingual, Datalab, 2026.05
Paper/Blog Link My Issue
#Article #Blog #OpenWeight #OCR Issue Date: 2026-05-31 Comment
HF: https://huggingface.co/datalab-to/surya-ocr-2
元ポスト:
Step-3.7-Flash, stepfun-ai, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #MultiModal #OpenWeight #MoE(Mixture-of-Experts) #read-later #VisionLanguageModel Issue Date: 2026-05-31 Comment
元ポスト:
公式:
Introducing Claude Opus 4.8, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #VisionLanguageModel #Reference Collection Issue Date: 2026-05-31 Comment
元ポスト:
ベンチマーク比較:
ビジネススキルを学習させると不誠実になる:
Repo2RLEnv: Turn any GitHub repository into a verifiable RL environment for training and evaluation, HuggingFace, 2026.05
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #ReinforcementLearning #PostTraining #reading #Environment Issue Date: 2026-05-31 Comment
元ポスト:
[Paper Note] LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding, Wang+, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #CVPR #read-later #Selected Papers/Blogs #ObjectLocalization #VisionLanguageModel #2D (Image) #UMM #3D (Video) #text #ObjectDetection #GUI Issue Date: 2026-05-30 Comment
元ポスト:
DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, DeepSWE, 2026.05
Paper/Blog Link My Issue
#Article #NLP #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #LongHorizon Issue Date: 2026-05-27 Comment
元ポスト:
所見:
既存のベンチマークのような、githubのPRに基づいたものではなく(memorizationの問題があるため)、ゼロベースで構築。rolloutのtrajectoryを分析して、有効なPRなのに拒否する、あるいは何らかのcheatingをするといった挙動のdetectionもできるとのこと。また、SWE Bench Proと比較して、タスクを解くためのpromptは1/2である一方、タスクを解くために必要なコードの量は5.5倍となっており、より複雑なタスクとなっている。
contamination-freeが主張されているが、データセットは公開されているので、そのうちcontaminationが生じるであろう点には注意。
Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #DiffusionModel #TextToImageGeneration #SmallModel #Selected Papers/Blogs #One-Line Notes #ImageSynthesis #LowPrecision Issue Date: 2026-05-27 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-image
Ternary Weight {-1, 0, 1}による画像生成モデル
PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects, Ropedia, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #VisionLanguageModel #Robotics #Simulation #3D Object Generation Issue Date: 2026-05-27 Comment
元ポスト:
MagicLite, Microsoft, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #NLP #SmallModel #ComputerUse #One-Line Notes Issue Date: 2026-05-27 Comment
元ポスト:
Faraを用いたブラウザベースのChatUIを備えたCUAで、ローカルストレージへのアクセスも可能な模様
Hy-MT2-30B-A3B, Tencent Hy, 2026.05
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #MultiLingual #OpenWeight #One-Line Notes Issue Date: 2026-05-27 Comment
HF: https://huggingface.co/collections/tencent/hy-mt2
元ポスト:
テンセントによる1.8B--30BのMT特化モデルファミリー。fast thinkingが強みとのこと。
LeRobot Humanoid: An Open, Low-Cost, 3D-Printed Humanoid for Robot Learning, LeRobot, 2026.05
Paper/Blog Link My Issue
#Article #Blog #Robotics Issue Date: 2026-05-27 Comment
元ポスト:
Agent Evaluation: A Detailed Guide, CAMERON R. WOLFE, PH.D., 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #AIAgents #Evaluation #One-Line Notes Issue Date: 2026-05-27 Comment
元ポスト:
ざーっとしか眺められていないが、AI Agentの基礎的な話と、実際のtool useをした場合のレスポンスの例を踏まえた動作の説明や、Scaffoldingとは何か/multi-agentとは何か/context engineeringとはといった説明をし、その後AI Agentの評価の方法の体系的な枠組みと、具体的なベンチマークとして tau-bench/terminal-benchを挙げて解説されている。これを読んだらAI Agentとはなんぞやから、評価までかなり理解できるのではないだろうか。
Terminal-Bench Science: Evaluating AI Agents on Real-World Computational Workflows in the Natural Sciences, harbor-framework, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Repository #ScientificDiscovery #Science #One-Line Notes Issue Date: 2026-05-27 Comment
元ポスト:
ターミナル上でのscienceに関するワークフローを定義しAI Agentを評価することで、教科書的な知識を問うのではなく、より複雑で実践的なタスクによる評価をしたい、というモチベーションのpjで、Discordを通じてタスクを生成するcontributorを募集しているようである。
Nemotron-Labs-Diffusion-14B, Nvidia, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #OpenWeight #LLMServing #SpeculativeDecoding #One-Line Notes Issue Date: 2026-05-27 Comment
元ポスト:
3つの生成モード: AR/dLM/Hybrid を備えたLLM(VLM variantも存在)ファミリーで、ARモードでは一般的な自己回帰的な生成をし、dLMモードでは拡散モデルに基づくparallel decodingを実施、hybridではdLMでドラフト作成、ARでverificationを実施するSpeculative Decoding (self-speculation)を実施する。これらモードは内部のattention patternを変化させることでシームレスに切り替えられ(シームレスモード)期待されるconcurrencyに応じて柔軟に対応ができるようである。
シームレスの粒度がどの程度のものかはよくわからない。concurrency levelを検知して、それに応じて動的に切り替わったりするのだろうか。
Speculative Decodingの高速化手法としては以下のようなものもある:
- [Paper Note] TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification, Haoyun Jiang+, arXiv'26, 2026.01
Marlin-2B, NemoStation, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #Temporal #VideoGeneration/Understandings #VisionLanguageModel #3D (Video) #reading #Grounding Issue Date: 2026-05-27 Comment
元ポスト:
何が、いつ起きたかに答えるVideo VLMで、イベントごとのキャプションとtimestampのspanを出力してくれるようである。2Bモデルなので軽量である。
例は以下:
より安全で透明性の高い AI エコシステムに向けて、コンテンツ来歴の取り組みを前進, OpenAI, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #TextToImageGeneration #Proprietary #2D (Image) #One-Line Notes #ImageSynthesis #AI Detector Issue Date: 2026-05-27 Comment
元ポスト:
画像生成にSynthID追加、また、画像がChatGPT, Codex, OpenAI APIから生成されたものかを判定するツールの一般向けプレビューを開始
https://openai.com/ja-JP/research/verify/
OlmoEarth v1.1: A more efficient family of models, Ai2, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #FoundationModel #OpenWeight #2D (Image) Issue Date: 2026-05-27 Comment
元ポスト:
関連:
- OlmoEarth-v1-Large, Ai2, 2025.11
- Introducing OlmoEarth embeddings: Custom embedding exports from OlmoEarth Studio for downstream analysis, Ai2, 202604
General Agent: A Self-Evolving, Synthetic Agent Environment, Mika, PRIMEIntellect, 2026.05
Paper/Blog Link My Issue
#Article #General #NLP #LanguageModel #AIAgents #SyntheticData #reading #One-Line Notes #Environment #ToolUse Issue Date: 2026-05-27 Comment
environment: https://app.primeintellect.ai/dashboard/environments/primeintellect/general-agent
元ポスト:
著者ポスト:
約1000のドメイン、約4500タスク、約8000種類以上の独自のツールを持つ、汎用エージェント学習のための学習環境とその構築方法。タスクを生成するAIとそれに対して解答するAIを用意し、解答がどの程度正解していたかによって難易度を同定しフィルタリング等を行いつつ、生成されたタスクをacceptするか否かを決定する。実際に構築された環境でRL/SFTを実施したところ、未知のベンチマークに対して性能が反化することも確認したとのこと。
mKernel: Fast Multi-GPU, Multi-Node Fused Kernels, Ziming Mao, and the UCCL team, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Infrastructure #read-later #GPUKernel Issue Date: 2026-05-26 Comment
元ポスト:
> mKernel is our attempt at the missing piece: GPU-driven, fused kernels that deliver fine-grained compute–communication overlap across both intra-node NVLink and inter-node RDMA, while staying portable across various networking backends (ConnectX-7, AWS EFA, and more on the way).
The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #Survey #NLP #LanguageModel #ReinforcementLearning #Distillation #Catastrophic Forgetting #PostTraining #On-Policy #KeyPoint Notes #SelfDistillation Issue Date: 2026-05-26 Comment
元ポスト:
- On Policy DistillationはKnowledge Distillationの一種で、教師モデルの知識を小さなモデルに蒸留する
- off policy KD Objectiveの場合は固定されたオフラインデータを用いるが、on policy distillationは生徒モデル自身が生成したデータに対するシグナルに基づいて学習される。
- off policy手法の課題はCatastrophic Forgettingと、(sequence長に対するquadraticな)エラーの蓄積がある。
- (オフポリシーRLの特殊なケースとみなすことができる)SFTはForward KLに基づいており、教師モデルの出力分布が確率を持つ部分に対して、生徒モデルの確率がゼロの場合はKLが発散するため、学習される生徒モデルの分布さスムージングされた分布になる。つまり、教師モデルの出力パターンを網羅できるように分布が学習される。
- このような手法で複数のドメインのデータで学習をした場合、分布のシフトが生じやすくCatastrophic Forgettingが生じやすい。
- on policy RLでは、Reverse KLが採用されており、この場合教師が確率が低いと考える場所に高い確率を割り振った場合のみに大きなペナルティを受けるため、教師の重要なモードをカバーしていれば、教師の他のモード全体は無視できる。これにより、学習したいモード以外の挙動に影響を与えにくく、特定のモードの学習ができる。
- (SFTがCatastrophic Forgettingが起きやすそうということは理解できるが、オフポリシーRL全体においてCatastrophic Forgettingが起きやすい問題があるという文脈で書かれている気がしており(エラーの蓄積の冒頭でオフポリシーRLのもう一つの根本的な課題は、という文脈で書かれているため)、SFTの議論がオフポリシーRL全体につながるのかがわからず、モヤっとする。が、LLMのpost-traingではCatrastrophic Forgettingが問題であるという文脈であれば理解できる)
- また、on-policyな学習ではエラーの蓄積を線形に留めることができることが示されている(off-policyな手法ではポリシーが生成したデータで訓練されていないため、inference時の冒頭でミスをすると学習時に観測していないトークンスペースを扱わなければならなくなり、さらにミスが増えモード崩壊に陥る)。
- on policy distillationは直接的にこのexposure biasのgapを小さくする。すなわち、学習時のinput(教師モデルが生成)と推論時のinput(生徒モデルが生成)の分布のgapを縮める。
- 生徒は学習時に常に自身の出力に基づいて学習するため、学習時のprefixと推論時のprefixの傾向が一致しやすい。このため生成時にエラーが起きてもin-distributionとなるため、エラーの蓄積が低減される。
以後はon policy distillation, on policy self-distillationの最新研究のサーベイと動向について記載されている。
関連:
- [Paper Note] Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting, Howard Chen+, arXiv'25, 2025.10
- [Paper Note] RL's Razor: Why Online Reinforcement Learning Forgets Less, Idan Shenfeld+, ICLR'26
- Multi-Teacher On-Policy Distillation: A New Post-Training Primitive, Yumo Xu, 2026.04
後半のサーベイパートなどで記述があったのかもしれないが、OPDでは、GRPOなどで主流なRLVRなどと比較して、報酬のシグナルがdenseであるという点も押さえておきたい。
Synthetic Persona Pretraining: Alignment from Token Zero, Minder+, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Alignment #SyntheticData #Blog #Reasoning #Safety #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-25 Comment
元ポスト:
**事前学習の時点で**Harmful/良性/ニュートラルな文書にReflectionに関するassistantの思考過程(何が間違っていて/間違っていなくて、それはなぜか)をappendすることで、道徳的に推論することを学ぶ。
Pedagogical RL: Teaching Models to Teach Themselves from Privileged Information, Chakraborty+, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #CurriculumLearning #PRM #On-Policy #SelfDistillation Issue Date: 2026-05-21 Comment
元ポスト:
Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #ScientificDiscovery #One-Line Notes Issue Date: 2026-05-21 Comment
元ポスト:
nanogpt speedrun
- Modded-NanoGPT, KellerJordan, 2024.05
autoresearchをnanogpt speedrun (Track 3)で実施したところ、人間の最高記録を上回ることに成功した。この記録は既存のアイデアの組み合わせや、ハイパーパラメータの探索などによって等のもたらされた。一方で、完全に新規のアイデアの創出し改善するには上流にいる人間のヒントが必要となる弱点があることも浮き彫りになった。
AI Agentごとに挙動の性質が異なりOpus(Claude Code)は自律的なループを停止してしまったり、GPT(Codex)は自律的なループが止まることはないものの、同じハイパーパラメータを何度も繰り返し探索するなどの現象も見受けられた。
関連:
Ring-2.6-1T, inclusionAI, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight Issue Date: 2026-05-21 Comment
元ポスト:
Reliable Reasoning, Naoto Iwase, 2026.05
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #Blog #Reasoning #read-later Issue Date: 2026-05-20 Comment
元ポスト:
Investigating the consequences of accidentally grading CoT during RL, OpenAI, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Chain-of-Thought #Monitorability Issue Date: 2026-05-12 Comment
元ポスト:
Teaching Claude why, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Reasoning #Safety #PostTraining #KeyPoint Notes #Reading Reflections Issue Date: 2026-05-12 Comment
元ポスト:
- [Paper Note] Agentic Misalignment: How LLMs Could Be Insider Threats, Aengus Lynch+, arXiv'25, 2025.10
のように自身を守るために脅迫メールを送るような挙動が観測されたが、それをなくすことができたという話のようである。
細かい学習データのサンプルなどは記載されていないように見えるが
- 評価時のシナリオと類似したもので正しい挙動を教え込むような方法は、評価のスコアは改善するが、OODに対応できない
- モデルに行動を教えるのではなく、理由を教えることが重要で、これはモデル自身が倫理観に関するジレンマに置かれた状況を解決するというデータではなく、ユーザが倫理的なジレンマを抱えているというシナリオで、モデルが倫理的に塾講された思慮深いアドバイスをするようなデータ(difficult advice dataset)で学習することが非常に効果的であった。
- これは単に正しい答えを教えるのではなく、倫理的な"思考"を教えるため効果的であり、これをさらに発展させ、Claudeの人物像をより詳細に与えることでペルソナをより模範的なものに更新する、具体的には質の高いConstitutionに関する文書と、模範的なAIに関するフィクションの物語を学習させることで、misalignmentを非常に効果的に抑制できることを発見した
という感じだろうか。
トップダウンに正解を教えるのではなく、ボトムアップに根源的に正しい思考過程を誘発するような情報を教える(ある種のPRMのようなものだと思われる)ことで、高い汎化性能を獲得できるということだと思われる。このアプローチは最近のAI Agentにおけるoutcome basedなreward設計などにも一石を投じるような議論に感じる。学習の結果得られる汎化性能を重視していかないと、データセットやEnvironmentを逐一構築して課題を潰していく必要があり、キリがないと思う。
Raven Part-1 - Memory as a set of Slots, Afzal+, Goomba Lab, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SSM (StateSpaceModel) #read-later #memory #Initial Impression Notes Issue Date: 2026-05-10 Comment
元ポスト:
元ポストのGIFがわかりやすく、SSMにおけるStateの更新をgatingによって選択的に実施するモデル、という感じだろうか。これによりSSMの弱点であった、long contextにおけるrecall-heavyなタスクにおいてより高い性能を獲得する。
Advancing voice intelligence with new models in the API, OpenAI, 2026.05
Paper/Blog Link My Issue
#Article #NLP #SpeechProcessing #Reasoning #MultiLingual #Proprietary #TTS #Realtime #SpeechToSpeech Issue Date: 2026-05-10 Comment
元ポスト:
GPT-Realtime-2
Natural Language Autoencoders: Turning Claude’s thoughts into text, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Explanation #Safety #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-10 Comment
LLM内の数値情報として保持されるactivationの情報をテキストで説明させる技術 Natural Language Autoencoeder (NLA) で、従来のSparseAutoencoderを用いたProbingなどとは異なり、より直接的にテキストによってactivationの情報を出力させる。
手法はシンプルで、autorncoderを用いて、target modelのactivationに関する情報が入力されたときに、
- Activation Verbalizerが、activationを説明するテキストを生成し
- Activation Reconstructorが、生成された説明テキストから元のactivationを復元する
- Activation Verbalizer/Reconstructorをreconstruction lossによって学習する
というもののようである。
このような手法はAI safetyの分野などで活用することができ、たとえば、Opus 4.6はBlackmail testingにおいて、context中でそのような情報を明言していないにも関わらず、NLAによるverbalizationによってそのような疑念を抱いていることが示唆される。
元ポスト:
所見:
MolmoAct 2: An open foundation for robots that work in the real world, Ai2, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #Reasoning #OpenWeight #OpenSource #read-later #Robotics #VisionLanguageActionModel Issue Date: 2026-05-08 Comment
元ポスト:
関連:
- [Paper Note] MolmoAct: Action Reasoning Models that can Reason in Space, Jason Lee+, arXiv'25
dataset:
https://huggingface.co/collections/allenai/molmoact2-datasets
models:
https://huggingface.co/collections/allenai/molmoact2-models
著者ポスト:
著者ポスト2:
著者ポスト3:
Autodata: an automatic data scientist to create high-quality data, Ilia+, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #SyntheticData Issue Date: 2026-05-06 Comment
元ポスト:
OlmPool: How small architectural choices compound to undermine long context extension, Ai2, 2026.04
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Transformer #Attention #LongContext #Architecture #read-later #Selected Papers/Blogs #One-Line Notes #ContextRot Issue Date: 2026-05-01 Comment
元ポスト:
QK Norm, GQA, SWA, 事前学習のcontext長の短縮、これらはいずれもモデルが入力に対するattendの仕方を変えるものだが、これらを3つ以上組み合わせるとlong contextでの性能が急落するらしく、このようなlong contextの性能劣化は一般的な(しばしば短い)コンテキスト長のベンチマークやloss/perplexityなどでは検知できず、long contextで性能が急落するアーキテクチャでは、50Bトークンでのlong contextの学習を経ても、Llamaアーキテクチャが1Bトークンの学習で到達できる性能に届かない、といった話が元ポストに書かれている。
Scaling Pain of Coding Agent Serving: Lessons from Debugging GLM-5 at Scale, Z.ai, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Infrastructure #LLMServing #SoftwareEngineering #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-04-30 Comment
GLM-5をサービングしている中でのバグ(モデル側ではなくインフラ側)の発見と修復
Laguna XS.2 and M.1: A Deeper Dive, Poolside team, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #OpenWeight #MoE(Mixture-of-Experts) #SoftwareEngineering #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2026-04-30 Comment
HF: https://huggingface.co/poolside/Laguna-XS.2
元ポスト:
テクニカルレポート:
https://poolside.ai/assets/laguna/laguna-m1-xs2-technical-report.pdf
元ポスト:
Gemini Embedding 2: Our first natively multimodal embedding model, Google, 2026.03
Paper/Blog Link My Issue
#Article #ComputerVision #Embeddings #NLP #MultiModal #Blog #Proprietary #read-later #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-04-25 Comment
元ポスト:
単一のモデルで、マルチモーダルな情報を統合されたembedding空間で表現し、マトリョーシカ表現によって3種類の次元で取得でき、100+言語をサポートしかつcontext windowは8192。オーディオをわざわざ書き起こしてテキストモダリティに変換する必要もなく直接unifiedなembeddingを取得可能というなかなか便利そうな代物。
(以前のIssueを誤って削除したため再掲)
Generally Availableになったとのこと:
ワークスペースエージェントでチームを拡張, OpenAI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #AIAgents #ChatGPT #GenerativeAI #Blog #WorkspaceAgents Issue Date: 2026-04-25 Comment
元ポスト:
関連:
- OpenClaw — Personal AI Assistant, openclaw, 2026.03
- 🍫 Local Cocoa: Your Personal AI Assistant, Fully Local 💻, synvo-ai, 2026.01
- Cowork: Claude Code for the rest of your work, Anthropic, 2026.01
What 81,000 people told us about the economics of AI, Anthropic, 2026.04
Paper/Blog Link My Issue
#Article #Analysis #GenerativeAI #Blog #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-04-25 Comment
元ポスト:
賃金が最も小さいグループ、おより最も高いグループではClaudeによる生産性向上が最も大きく、職を失う懸念も同時に大きい。同様に、Claudeの利用量が多いグループも職を失う懸念が大きい。
アメリカにおいて代替されると思っていたソフトウェアエンジニアの求人がむしろ増えていて、AIによって新たな雇用が生まれているという意見もある:
vismatch (formerly Image Matching Models), gmberton, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #Library #2D (Image) #One-Line Notes #needs-revision Issue Date: 2026-04-25 Comment
元ポスト:
50種類以上のimage matchingモデルを統一的なinterfaceでシームレスに利用可能なライブラリとのこと
Hy3-preview, tencent, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #MoE(Mixture-of-Experts) Issue Date: 2026-04-24 Comment
元ポスト:
Introducing GPT‑5.5, OpenAI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Reference Collection #Reading Reflections Issue Date: 2026-04-24 Comment
元ポスト:
- FrontierMath, Terminal-Bench, GDPValでOpus 4.7を上回りダントツのトップ
- Artificial Analysis IndexでもOpus 4.7超え
しかし、Terminal-Benchは"ターミナル操作を通じた多様、かつlong horizonなタスクを評価する(多くはソフトウェアエンジニアタスクであるコーディングもタスクには含まれるが)"のベンチマークであり、SWE Bench Proのような一般的なcoding能力を測るベンチマークのスコアが掲載されていない。HLEやVisual Reasoning系のベンチマークのスコアも報告されていないように見える。
恣意的にGPT-5.5が強いデータ、比較対象をピックアップしているのではないか、という印象を持った。
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
- [Paper Note] SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, Carlos E. Jimenez+, ICLR'24
- Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02
Artificial Analysisによる評価:
所見:
サイバー分野でMythosと同等?
Xiaomi MiMo-V2.5-Pro: A leap in agentic and long horizon coherence, Xiaomi, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #MultiModal #Blog #Coding #OpenWeight #Selected Papers/Blogs #UMM #Reference Collection #Initial Impression Notes Issue Date: 2026-04-23 Comment
元ポスト:
いずれモデルをオープンにするとのこと
Artificial Analysisによる評価:
オープンになった:
https://huggingface.co/collections/XiaomiMiMo/mimo-v25
元ポスト:
GDPValやSWE-Bench-ProがGemini-3.1-Proよりも高い。
MIT Licenceかつnative multimodal
所見:
解説:
PaddleOCR, PaddlePaddle
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #NLP #DocParser #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-04-23 Comment
元ポスト:
ブラウザ上でも動作可能らしい
Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model, Qwen Team, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #OpenWeight #SoftwareEngineering #One-Line Notes Issue Date: 2026-04-23 Comment
HF: https://huggingface.co/Qwen/Qwen3.6-27B
元ポスト:
Qwen3.5-397B-A17Bを主要なcodingベンチマークで上回り、同等程度の規模感のdenseモデルを上回る。
Introducing ChatGPT Images 2.0: A new era of image generation, OpenAI, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #ChatGPT #TextToImageGeneration #Proprietary #Selected Papers/Blogs #ImageSynthesis #Initial Impression Notes Issue Date: 2026-04-22 Comment
元ポスト:
めとゃめちゃ良くなってそう
関連:
関連:
Artificial Analysisによる評価(SoTA):
Deep Research Max: a step change for autonomous research agents, Google, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #DeepResearch Issue Date: 2026-04-22 Comment
元ポスト:
Gemini APIからの使い方:
inclusionAI: Ling-2.6-flash (free), OpenRouter (InclusionAI), 2026.04
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #AIAgents #OpenWeight #MoE(Mixture-of-Experts) #Reference Collection #Initial Impression Notes Issue Date: 2026-04-22 Comment
元ポスト:
Lingの最新モデル。元ポストに強みが簡潔に書かれている。OpenRouterで1週間freeで利用可能で、今後商用モデルのLingDTのリリースも控えているとこと。
また、将来的に本モデルはオープンになる予定とのこと。
Artificial Analysisによる評価:
オープンになった:
HF: https://huggingface.co/inclusionAI/Ling-2.6-flash
FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #Attention #Selected Papers/Blogs #GPUKernel #Initial Impression Notes Issue Date: 2026-04-21 Comment
ベンチマーク: https://github.com/MoonshotAI/FlashKDA/blob/master/BENCHMARK_H20.md
関連:
- Kimi K2.6: Advancing Open-Source Coding, Kimi, 2026.04
- KDA: [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
Kimi Delta Attentionがより高速に(2倍程度)動作する実装のようである。
公式ポスト:
Defeating the trainer-generator precision mismatch in TRL, HuggingFace, 2026.04
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading #train-inference-mismatch #LowPrecision Issue Date: 2026-04-20 Comment
元ポスト:
関連:
- Making RL Fast, Finbarr Timbers, 2026.04
こーーれは必読では
Designing synthetic datasets for the real world: Mechanism design and reasoning from first principles, Google, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #SyntheticData #Distillation #read-later #Selected Papers/Blogs #One-Line Notes #Reference Collection #Critic #Reading Reflections #Human-in-the-Loop Issue Date: 2026-04-19 Comment
元ポスト:
公式:
解説:
(詳細は解説や元ブログ参照のこと)
強い教師モデルから弱い生徒モデルを学習する場合の合成データ生成手法で、
生成したいデータの観点(内容、形式等)を分類し、どの観点からどの程度の難易度のデータを合成するかを制御する。その後生成されたデータが正しいか/正しくないかの2方向から批評を行いvalidationをするような枠組みのようである。
単純なデータ合成では性能がすぐに頭打ちになるが、ローカル多様性(特定のパターンの多様性)、グローバル多様性(データ全体がカバーするパターンの範囲)の2つを同時に大きくしないと不十分であることや、批判によるvalidationは少なくとも性能を悪化させることはないことも示されたとのこと。
AI週報#1 | LLMは「決めてから考える」のか? 他2件, toda, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog Issue Date: 2026-04-19 Comment
元ポスト:
[Paper Note] Open-world evaluations for measuring frontier AI capabilities, Kapoor+, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #read-later #Selected Papers/Blogs Issue Date: 2026-04-19 Comment
元ポスト:
PAW: Define functions in English. Run them locally, ProgramAsWeights, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #Coding #PEFT(Adaptor/LoRA) #SoftwareEngineering #One-Line Notes Issue Date: 2026-04-17 Comment
元ポスト:
英語で説明した機能をNeural Compilerと呼ばれる機構によって、text + Continuous LoRA (Continuous LoRAってなんだ。。。) によってインタプリタを構築し、python関数として利用できる、という感じらしい?
.pawファイルと呼ばれるファイルが作成され、中には
- Discrete pseudo-program: neural compilerによって生成されたtext instructions
- continuous neural adapter: 量子化されたLoRA adapter
が格納されて実行時に利用されるとのこと。完全にローカルで動作させられる。
LoRAを使うということは、事前に関数を実行するbase modelのDLが必要そうだが、どうなのだろうか?.pawファイルの例にも特定のベースモデル名が記載されているように見える。
8 Tips for Writing Agent Skills, Philipp Schmid, 2026.04
Paper/Blog Link My Issue
#Article #NLP #AIAgents #read-later #AgentSkills Issue Date: 2026-04-17
FrontierSWE: Benchmarking coding agents at the limits of human abilities, FrontierSWE, 2026.04
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #AIAgents #Evaluation #SoftwareEngineering #One-Line Notes #LongHorizon Issue Date: 2026-04-17 Comment
元ポスト:
WAN2.1の推論パイプライン構築、llmのpost-trainingをしてlogic gameができるように学習させる、など、long horizonかつ非常に現実的なタスクで評価される
v2がリリース:
FrontierSWE v2:
https://www.frontierswe.com/blog/v2
HY-World-2.0, Tencent, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #Transformer #DiffusionModel #OpenWeight #WorldModels Issue Date: 2026-04-16 Comment
元ポスト:
テクニカルレポート: https://3d-models.hunyuan.tencent.com/world/world2_0/HY_World_2_0.pdf
Introducing GPT‑Rosalind for life sciences research: A new purpose-built model to accelerate scientific research and drug discovery., OpenAI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Medical #Biological #One-Line Notes Issue Date: 2026-04-16 Comment
元ポスト:
Life Sciencesドメイン特化モデル
Introducing Claude Opus 4.7, Anthropic, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection Issue Date: 2026-04-16 Comment
元ポスト:
Artificial Analysisによる評価:
GDPval-AAでGPT-5.4超えのSoTA
IntelligenceでもSoTA(同等)
所見:
所見:
新たなtokenizerを用いている。knowledge cutoffも更新されている。すなわち、新たなベースモデルが事前学習された可能性が高い
tokenizerが更新された=必ずしもベースモデルも新しいということではないよねという指摘:
デグレしたベンチマークがある模様:
所見:
Qwen3.6-35B-A3B: Agentic Coding Power, Now Open to All, QwenTeam, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #MultiModal #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Sparse #Initial Impression Notes Issue Date: 2026-04-16 Comment
HF: https://huggingface.co/Qwen/Qwen3.6-35B-A3B
元ポスト:
ざっと見た感じ明言されていない気がするが、プロプライエタリとなったQwen3.6-Plusの廉価版(オープンなので廉価と言うのかはあれだが)だと思われる。
Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
Paper/Blog Link My Issue
#Article #read-later Issue Date: 2026-04-16 Comment
HF: https://huggingface.co/collections/prism-ml/ternary-bonsai
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
の次世代モデル。
前回リリースからまだ1ヶ月しか経っていない。デコーディング速度が速いのでその分RLによるPostTrainingも高速なのだろうと推察される。
元ポスト:
Our evaluation of Claude Mythos Preview’s cyber capabilities, AISI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #Security Issue Date: 2026-04-15 Comment
元ポスト:
Trusted access for the next era of cyber defense, OpenAI, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #One-Line Notes #Security Issue Date: 2026-04-15 Comment
GPT-5.4をサイバーセキュリティユースケースに特化してチューニングしたGPT-5.4-Cyber
元ポスト:
マルチエージェントシステムでGPUカーネルを38%高速化, Cursor, 2026.04
Paper/Blog Link My Issue
#Article #Multi #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #GPUKernel #AgentHarness Issue Date: 2026-04-15 Comment
元ポスト:
自律的に長期間稼働し235件の問題を1回の実行で解くマルチエージェントハーネスに関するレポートで、3週間程度でBlackwell GPUカーネルをゼロから構築・最適化し38%高速化とのこと。
Introducing ERNIE‑Image, Baidu, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Transformer #DiffusionModel #TextToImageGeneration #OpenWeight #Selected Papers/Blogs #2D (Image) #One-Line Notes #ImageSynthesis Issue Date: 2026-04-15 Comment
HF: https://huggingface.co/baidu/ERNIE-Image
ERNIEからtext-to-imageモデルがOpenWeightモデルとしてリリース。ベンチマークとしては公式ブログ上ではOpenWeightモデルの中でトップで、nano banana 2.0に匹敵するようなスコアが出ているように見える
Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning, Google Deepmind, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Reasoning #Proprietary #Robotics #VisionLanguageActionModel #SpatialUnderstanding #Reference Collection #Initial Impression Notes #MultiView Issue Date: 2026-04-15 Comment
元ポスト:
おー、とうとうDeepmindからVLAがでた。プロプライエタリモデル
私が知らなかっただけで、以前からリリースされていたようだ:
- Building the Next Generation of Physical Agents with Gemini Robotics-ER 1.5, Google, 2025.09
-
https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/
ポイント解説:
LLM-jp-4-VL 9B betaリリース, LLM-jp, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #OpenWeight #Japanese #OpenSource #VisionLanguageModel Issue Date: 2026-04-14 Comment
元ポスト:
Evaluating agents for scientific discovery, Ai2, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #ScientificDiscovery #Science #Surface-level Notes #Reading Reflections Issue Date: 2026-04-14 Comment
元ポスト:
scientific discoveryを実現するエージェントに関して、research paperで主張される素晴らしさと、実態のgapを埋めるためにAi2が実施してきたベンチマークに関する研究についての解説。
- [Paper Note] ScienceWorld: Is your Agent Smarter than a 5th Grader?, Ruoyao Wang+, EMNLP'22, 2022.03
- 小学校レベルの理科の実験をエージェントが実行できるかを評価するベンチマーク
- 教科書に載っているような古典的なdiscoveryを再現させる
- 200種類以上にものぼるオブジェクトが配置された、物理法則に従う(e.g., 氷が加熱すると溶けるなど)シミュレーション世界において、水の沸点を選択肢から正解を選ぶのではなく、自身で発見することを求められる。
- 2022年、Multiple Choice Questionのschool science examでハイスコアを記録したモデルはスコアは10%未満、2025年にはスコアは80%代に到達したが、まだ完全にこなふことができない。
- [Paper Note] DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents, Peter Jansen+, NeurIPS'24 Spotlight, 2024.06
- 独自の科学的な調査をスクラッチから設計実行させるベンチマーク
- 大学、あるいはPhDレベルのopen-endなdiscoveryに関する能力を問う
- 宇宙の惑星Xでの最初の科学者として調査を実施する設定で8トピックにわたる120のタスクをこなす必要がある
- 難易度は3段階に分かれていて、タスクは架空のcontextで実施されるため事前知識に頼ることができない中でタスクを解決し、正しいプロセスで実施されたかや、理解をしているかなどの能力も問われる。
- 現在のエージェントは、normal/challengingな難易度のタスク群について、80%の完了率を達成できない
- 双方のベンチマークともに、知識と実務力を分離した上で能力を測定するものとなっており、知識を答えるだけの見かけ上の能力ではなく、スクラッチから知識に基づいてエビデンスを積み上げ、実行し、タスクを遂行し科学的な発見をできるか、という実務力を問うている
という話。
この話は
- Andrej Karpathy — AGI is still a decade away, DWARKESH PATEL, 2025.10
において議論されている「認知コア」と関連が深いと感じる。
認知コアとは、単なる記憶に頼るのではなく、事前学習において、いわゆる人間のような知性を(データ内に潜むアルゴリズム的なパターンを学習することで)獲得し、その結果としてIn context Learningのような能力を発達させることとされ、
既に獲得された知識がモデルの認知コアの発達を阻害し、未知の環境でも適応できるような汎化能力を獲得することを阻害している(=モデルは既存の知識と紐づけて簡単に回答できてしまうため、アルゴリズムに基づいた思考と行動を備える必要がなく学習が進み、結果的に汎用的な能力が身につかない)恐れがある、という話である。
上記ベンチマーク(特にDiscoveryWorld)は既存の世界知識に捉われない、アルゴリズム的な思考と行動が求められると推察されるため、モデルの認知コア的な側面を部分的に測定していると言えると感じる。
Distilling 100B+ Models 40x Faster with TRL, Hugging Face, 2026.04
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #Distillation #One-Line Notes Issue Date: 2026-04-13 Comment
元ポスト:
on-policy蒸留(生徒モデルが生成したロールアウトに対して教師モデルが評価を与える方式)を、バッチ処理や、生徒モデルと教師モデルの通信量を削減するためバイナリ形式に変換してやり取りするなどの工夫をして高速化した話とのこと。
著者ポスト:
Memento: Teaching LLMs to Manage Their Own Context
Paper/Blog Link My Issue
#Article #DocumentSummarization #NLP #LanguageModel #Selected Papers/Blogs #ContextEngineering #One-Line Notes #KV Cache Issue Date: 2026-04-11 Comment
元ポスト:
著者によるtakeaway:
頻繁に要約を作成することが大事で、SummaryのKV Cacheを再計算してはいけない(すなわち、推論をrestartしてはいけない)。なぜなら、SummaryよKV Cacheには仮に当該ブロックがなかったとしても過去のコンテキストの情報が残っているから。という話が書かれている。なるほど。
dataset: https://huggingface.co/datasets/microsoft/OpenMementos
所見:
Introducing Muse Spark: Scaling Towards Personal Superintelligence, Meta, 2026.04
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #Proprietary #read-later #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Reference Collection Issue Date: 2026-04-11 Comment
元ポスト:
-
-
元ポストのベンチマークスコアを見るとマルチモーダルの性能はフロンティアモデル(gpt5.4, Opus 4.6, Gemini 3.1 Pro)と同等、text/reasoningはフロンティアモデルより少しスコアが低く、特に抽象的な思考が苦手(ARC-AGI-2)。HEALTH分野はhealthは高スコアだがmedicalは少し低めのスコア、Agenticな分野では、SWE Bench Verified/Proよスコアは少し低め、terminal useは明確にスコアが低くtool useは少しスコアが低い、という感じにみえる。
codingとlong horizon taskに継続的に投資するとのこと。
中の人による解説:
全てをフルスクラッチから作り直したっぽい。
Artificial Analysisによる解説:
一気にOpenWeight最強のGLM-5.1超え
所見:
所見:
所見:
第三者によるおそらく独自のベンチマークによる評価の結果、(おそらく101モデルのうち)全体で3位となっているらしい(つまり、既存ベンチマークにoverfittingしているわけではないという考えがある)。
The ATOM Report: Measuring the Open Language Model Ecosystem, Lambert+, 2026.04
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #OpenWeight #OpenSource #read-later #Data Issue Date: 2026-04-11 Comment
著者ポスト:
元ポスト:
Xiaomi MiMo-V2-TTS, Xiaomi, 2026.03
Paper/Blog Link My Issue
#Article #SpeechProcessing #TTS Issue Date: 2026-03-21 Comment
元ポスト:
Xiaomi MiMo-V2-Omni, Xiaomi, 2026.03
Paper/Blog Link My Issue
#Article #Omni Issue Date: 2026-03-21 Comment
元ポスト:
Xiaomi MiMo-V2-Pro, Xiaomi, 2026.03
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary Issue Date: 2026-03-21 Comment
元ポスト:
Reasoning models struggle to control their chains of thought, and that’s good, OpenAI, 2026.03
Paper/Blog Link My Issue
#Article #Controllable #NLP #Dataset #LanguageModel #Chain-of-Thought #Evaluation #Blog #Reasoning #read-later Issue Date: 2026-03-06 Comment
元ポスト:
著者ポスト:
Opus 4.6, Codex 5.3, and the post-benchmark era, Interconnects, 2026.02
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #Blog #Coding #SoftwareEngineering #One-Line Notes Issue Date: 2026-02-10 Comment
有識者によるClaude 4.6 Opus と Codex 5.3 を利用した際の所見(定性評価)が記述されている。
元ポスト:
著者によるTLDR:
[Paper Note] On the Slow Death of Scaling, Hooker+, 2026.01
Paper/Blog Link My Issue
#Article #NeuralNetwork #EfficiencyImprovement #NLP #LanguageModel #Scaling Laws Issue Date: 2026-01-09 Comment
元ポスト:
著者ポスト:
Emergence of Human to Robot Transfer in VLAs, Physical Intelligence (π), 2025.12
Paper/Blog Link My Issue
#Article #Pretraining #FoundationModel #Selected Papers/Blogs #DataMixture #Robotics #VisionLanguageActionModel #3D (Video) #EmbodiedAI #KeyPoint Notes #EmergentAbilities #EgocentricView #DomainGap Issue Date: 2025-12-18 Comment
元ポスト:
pi_0.5と呼ばれる基盤モデルのfinetuningにおいてロボット用の学習データに追加して人間のegocentricなvideoをmixtureするだけで創発現象が生じ、人間の動画側にしか存在しない4種類のgeneralizationが必要なシナリオにおいて2倍の性能を示した。そしてこの傾向は、事前学習における基盤モデルのサイズをスケールさせる、ロボットのデータをより多く投入することでより顕著となった。
人間とロボットの特徴量を2D plotした散布図を見ると、事前学習で利用するロボットの学習データ(事前学習時点では人間の動画は含まれないことに注意)をスケールさせると、両者の特徴量が重なるようになったので、human-robotのalignmentをモデルが獲得していることが示唆される。
これにより、今後VLAを学習する際に、domain gapを埋めるための特別な処理が不要となる可能性がある、といった話らしい。
これが真だとすると、たとえば以下のように、人間のegocentric viewデータを大量に保有したところが有利にはなりそうではある。
- Interactive Intelligence from Human Xperience, Ropedia, 2025.12
Introducing the WeirdML Benchmark, Håvard Tveit Ihle, 2025.01
Paper/Blog Link My Issue
#Article #MachineLearning #NLP #LanguageModel #Evaluation #Blog #Initial Impression Notes Issue Date: 2025-11-29 Comment
著者ポスト:
元ポスト:
WeirdML v2: https://htihle.github.io/weirdml.html
MLにおけるあまり一般的ではない(=Weird)なタスクによるLLMのベンチマークらしい
RLP: Reinforcement as a Pretraining Objective, Hatamizadeh+, 2025.09
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #ReinforcementLearning Issue Date: 2025-10-01 Comment
元ポスト:
関連:
- [Paper Note] Reinforcement Pre-Training, Qingxiu Dong+, arXiv'25, 2025.06
- [Paper Note] Reinforcement Learning on Pre-Training Data, Siheng Li+, arXiv'25, 2025.09
著者ポスト:
所見:
解説:
Why Language Models Hallucinate, Kalai+, 2025.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Hallucination #Selected Papers/Blogs Issue Date: 2025-09-06 Comment
著者ポスト:
解説:
所見:
The Bitter Lesson for RL: Verification as the key to Reasoning LLMs, Rishabh Agarwal, 2025.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Slide #PostTraining #read-later #RLVR Issue Date: 2025-08-26 Comment
元ポスト:
著者ポスト:
Swallow LLM Leaderboard v2, Swallow LLM Team, 2025.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #OpenWeight #Proprietary #Japanese #Selected Papers/Blogs Issue Date: 2025-08-20 Comment
元ポスト:
LLMの性能を公平な条件で評価するために、従来のnon thinkingモデルで採用していた方法はthinkingモデルでは過小評価につながることが明らかになった(e.g., non thinkingモデルはzero shotを標準とするが、thinkingモデルではfewshot、chat templateの採用等)ため、日本語/英語ともに信頼の高い6つのベンチマークを採用し、thinkingモデルに対して公平な統一的な評価フレームワークを確立。主要なプロプライエタリ、OpenLLMに対して評価を実施し、リーダーボードとして公開。Reasoningモデルに対する最新の日本語性能を知りたい場合はこちらを参照するのが良いと思われる。
評価に用いられたフレームワークはこちら:
https://github.com/swallow-llm/swallow-evaluation-instruct
主要モデルの性能比較:
リーダーボードがアップデート:
-
-
GPT-5.4, Qwen 3.5, Gemma 4, llm-jp04などが追加され、Gemma 4 31Bが非常に強力な日本語性能を備えており、GPT-5.4 Thinkingに匹敵する日本語性能を備えているとのこと。
Context Engineering - What it is, and techniques to consider, llamaindex, 2025.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #SoftwareEngineering #ContextEngineering Issue Date: 2025-07-04 Comment
元ポスト:
AI Agent Manager (AAM) として生きていく : 作業環境とワークフローの設計, icoxfog417, 2025.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Coding #SoftwareEngineering #read-later Issue Date: 2025-06-23 Comment
元ポスト:
Single vs Multi-Agent System?, PHILSCHMID, 2025.06
Paper/Blog Link My Issue
#Article #NLP #AIAgents #Blog #read-later Issue Date: 2025-06-21 Comment
元ポスト:
Mirage Persistent Kernel: Compiling LLMs into a MegaKernel, 2025.06
Paper/Blog Link My Issue
#Article #NLP #python #LLMServing #Initial Impression Notes Issue Date: 2025-06-20 Comment
vLLM, SGLangよりもデコーディングが早い模様(図は下記ブログより引用)
ブログ:
https://zhihaojia.medium.com/compiling-llms-into-a-megakernel-a-path-to-low-latency-inference-cf7840913c17
元ポスト:
MiniMax-M1, MiniMax, 2025.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #One-Line Notes Issue Date: 2025-06-17 Comment
元ポスト:
vLLMでのservingが推奨されており、コンテキストは1M、456BのMoEアーキテクチャでactivation weightは46B
公式ポスト:
Agentもリリースした模様:
[Paper Note] Unsupervised Elicitation of Language Models, Wen+, Anthropic, 2025.06
Paper/Blog Link My Issue
#Article #Unsupervised #NLP #LanguageModel #Supervised-FineTuning (SFT) Issue Date: 2025-06-12 Comment
元ポスト:
Qwen_Qwen3-Embedding-4B-GGUF, QwenTeam, 2025.06
Paper/Blog Link My Issue
#Article #Embeddings #NLP #LanguageModel #RepresentationLearning #OpenWeight #One-Line Notes Issue Date: 2025-06-06 Comment
8BモデルはMTEBでトップの性能を達成。context 32K。100以上の言語をサポート。32--2560次元にoutputの次元数をカスタマイズできる(嬉しい、が性能にどの程度影響が出るから気になる)。
元ポスト:
QwenTeam post:
[Paper Note] Spurious Rewards: Rethinking Training Signals in RLVR, Shao+, 2025.05
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Mathematics #SmallModel #PostTraining #RLVR #Reference Collection Issue Date: 2025-05-27 Comment
元ポスト:
参考(考察):
参考(考察):
こちらでもQwen2.5 MATH 7b を用いて検証しているが、コンタミネーションの問題が仮に本当だとしたら、どう影響するだろうか。スレッド中のグラフもMATH500(Qwen2.5においてコンタミの可能性がある)の性能を示している。
ms-swiftによるMegatron-LMベースのQwen3のファインチューニング, Aratako, 2025.05
Paper/Blog Link My Issue
#Article #NLP #Library #Supervised-FineTuning (SFT) #Blog #OpenWeight #MoE(Mixture-of-Experts) #PostTraining #One-Line Notes Issue Date: 2025-05-11 Comment
元ポスト:
Megatron-SWIFTというAlibaba製のライブラリを利用しQwen3の継続事前学習とSFTを実施する方法を、ベストプラクティスに則って記述し、かつ著者自身が学習したモデルも公開している。(おそらくインスタンス代は自腹なので)すごい...!!
Megatron-SWIFTはMoEアーキテクチャを採用したモデルであれば、DeepSpeed Zero3 [^1]と比べて10倍程度のスループットで学習できる模様(早い)。一方MoEアーキテクチャでないモデルの場合はそこまで大きな差はない。
[^1]: A100 80GB 2ノードでは、Qwen3-30B-A3Bは、DeepSpeed-Zero2ではOOMとなり載らないようだ…。なんとリソースに厳しいこと…(涙)
Agent Frameworkはどれを使うべきか [タスク性能編], はち, 2025.05
Paper/Blog Link My Issue
#Article #Analysis #NLP #Library #AIAgents #Blog #One-Line Notes Issue Date: 2025-05-06 Comment
各フレームワーク毎の性能の違いや消費したトークン数、実装の微妙や違いがまとめられており、太字でtakeawayが記述されているので非常にわかりやすい。
元ポスト:
Llama-3_1-Nemotron-Ultra-253B-v1, Nvidia, 2025.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #ReinforcementLearning #InstructionTuning #Pruning #Reasoning #OpenWeight #KeyPoint Notes Issue Date: 2025-04-08 Comment
DeepSeek-R1をGPQA Diamond GPQA: A Graduate-Level Google-Proof Q&A Benchmark, David Rein+, N/A, COLM'24
, AIME2024/2025, Llama4 Maverickを
BFCLv2(Tool Calling, BFCLv2, UC Berkeley, 2024.08
), IFEVal [Paper Note] Instruction-Following Evaluation for Large Language Models, Jeffrey Zhou+, arXiv'23, 2023.11
で上回り, そのほかはArenaHardを除きDeepSeekR1と同等
DeepSeekR1が671B(MoEで37B Activation Param)に対し、こちらは253B(ただし、Llama3.1がベースなのでMoEではない)で同等以上の性能となっている。
ReasoningをON/OFFする能力も備わっている。
モデルがどのように訓練されたかを示す全体図がとても興味深い:
特に [Paper Note] Demystifying Long Chain-of-Thought Reasoning in LLMs, Edward Yeo+, ICML'25
でも有効性が示されているように、SFTをしてからReasoningを強化する(強化というより元々持っている能力を引き出す?)RLを実施している。
詳細は下記Blogとのこと:
https://developer.nvidia.com/blog/build-enterprise-ai-agents-with-advanced-open-nvidia-llama-nemotron-reasoning-models/
元ポスト:
Recommendation Systems • LLM, vinjia.ai, 2025.03
Paper/Blog Link My Issue
#Article #RecommenderSystems #Survey #NLP #LanguageModel #Blog Issue Date: 2025-03-31 Comment
Qwen2.5-VL-32B-Instruct, Qwen Team, 2025.03
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #OpenWeight Issue Date: 2025-03-25 Comment
元ポスト:
Sudoku-bench, SakanaAI, 2025.03
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Reasoning #Initial Impression Notes Issue Date: 2025-03-21 Comment
元ポスト:
既存モデルでベンチマークを取ったらどういうランキングになるのだろうか。特にまだそういぅたランキングは公開されていない模様。
ブログ記事に(将来的に最新の結果をrepositoryに追記される模様)現時点でのリーダーボードが載っていた。現状、o3-miniがダントツに見える。
https://sakana.ai/sudoku-bench/
SmolDocling-256M, IBM Research, 2025.03
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #OpenWeight #DocParser #One-Line Notes Issue Date: 2025-03-18 Comment
Apache-2.0ライセンス。言語はEnglishのみな模様
マルチモーダルなImage-To-Textモデル。サンプルはこちら
ERNIE4.5_X1, Baidu, 2025.03
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #OpenWeight #Proprietary #One-Line Notes #Reference Collection Issue Date: 2025-03-17 Comment
解説ポスト:
- ERNIE4.5はGPT4.5をさまざまなベンチマークで上回り、価格がなんとGPT4.5の1%
- X1はマルチモーダルなreasoningモデルでDeepSeek-R1と同等の性能で半額
らしい
このモデルは6月30日にオープン(ウェイト?)になるとスレッドで述べられている。
modernbert-ja-130m, SB Intuitions, 2025.02
Paper/Blog Link My Issue
#Article #Embeddings #NLP #LanguageModel #RepresentationLearning #pretrained-LM #Japanese Issue Date: 2025-02-12 Comment
MIT Licence
元ポスト:
Aya Expanse, Cohere, 2024.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MultiLingual #OpenWeight #One-Line Notes Issue Date: 2024-10-24 Comment
CohereによるマルチリンガルLLM, 8B, 32Bのモデルが存在する。
8BモデルのArenaHardでの評価
32BモデルのArenaHardでの評価
元ポスト:
PaperQA2, Future-House, 2023.02
Paper/Blog Link My Issue
#Article #NLP #QuestionAnswering #AIAgents #GenerativeAI #RAG(RetrievalAugmentedGeneration) #Repository Issue Date: 2024-09-11 Comment
元ポスト:
Reflection 70B, GlaiveAI, 2024.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #InstructionTuning #OpenWeight #SelfCorrection #PostTraining #KeyPoint Notes #Reference Collection Issue Date: 2024-09-06 Comment
ただまあ仮に同じInputを利用していたとして、promptingは同じ(モデルがどのようなテキストを生成し推論を実施するかはpromptingのスコープではない)なので、そもそも同じInputなのでfair comparisonですよ、という話に仮になるのだとしたら、そもそもどういう設定で比較実験すべきか?というのは検討した方が良い気はする。まあどこに焦点を置くか次第だと思うけど。
エンドユーザから見たら、reflectionのpromptingのやり方なんてわからないよ!という人もいると思うので、それを内部で自発的に実施するように学習して明示的にpromptingしなくても、高い性能を達成できるのであれば意味があると思う。
ただまあ少なくとも、参考でも良いから、他のモデルでもreflectionをするようなpromptingをした性能での比較結果も載せる方が親切かな、とは思う。
あと、70Bでこれほどの性能が出ているのはこれまでにないと思うので、コンタミネーションについてはディフェンスが必要に思う(他のモデルがそのようなディフェンスをしているかは知らないが)。
追記
→ 下記記事によると、LLM Decontaminatorを用いてコンタミネーションを防いでいるとのこと
https://github.com/lm-sys/llm-decontaminator
Reflection自体の有用性は以前から示されている。
参考: Self-Reflection in LLM Agents: Effects on Problem-Solving Performance, Matthew Renze+, N/A, arXiv'24
, [Paper Note] Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection, Akari Asai+, ICLR'24, 2023.10
, [Paper Note] AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API Calls, Yu Du+, ICML'24, 2024.02
, [Paper Note] Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies, Liangming Pan+, TACL'24, 2023.08
ollamaで実際に動かして日本語でのQAを試している記事。実際のアウトプットやreflectionの内容が確認でき、おもしろい。
システムプロンプトで< thinking >タグでInputに対して推論し、< output >タグ内で最終出力を行い、推論過程で誤りがある場合は< reflection >タグを用いて修正するように指示している。
おそらく、thinkingタグ内の思考過程でモデルが誤りに気づいた場合は、thinkingタグの途中でreflectionタグが出力され、その時点でCoTが修正されるようである(もしくはoutputとthinkingの中間)。このため、誤ったCoTに基づいてOutputが生成される頻度が減少すると考えられる。
このような挙動はおそらく、reflection用の学習データでSFTしないとできないと思うので
(たとえば、ReflectionタスクをするようなデータでSFTをしていない場合、出力の途中で誤りを検出し出力を修正するという挙動にはならず、回答として自然な文を最後までoutputすると思う。その後でreflectionしろと促すことはpromptingでできるかもしれないが、そもそもreflectionする能力があまり高くない可能性があり、うまく修正もしてくれないかも)
reflectionの能力を高めるようなデータでSFTをしていないモデルで似たようなpromptingをしても、うまくいかない可能性があるので注意が必要だと思われる。
参考:
https://note.com/schroneko/n/nae86e5d487f1
開発者曰く、HFに記載の正しいシステムプロンプトを入れないと、適切に動作しないとのこと。
元ツイート:
どうやら初期にアップロードされていたHFのモデルはweightに誤りがあり、挙動がおかしくなっていたようだ。
正しいモデルの挙動は下記ツイートのようである。thinking内でreflectionが実施されている。
実際にいくつかの例をブログをリリース当日に見た時に、reflectionタグがoutputの後に出力されている例などがあり、おや?という挙動をしていたので、問題が是正されたようだ。
HFのモデルが修正された後もベンチマークの結果が再現されないなど、雲行きが色々と怪しいので注意した方が良い。
続報
開発者ポスト:
再現実験を全て終了し、当初報告していた結果が再現されなかったとCEOが声明:
Nejumi LLMリーダーボード, Weights & Biases
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Japanese #One-Line Notes Issue Date: 2023-10-02 Comment
JGLUEを使ったLLMの日本語タスクベンチマーク
v4が公開:
https://wandb.ai/llm-leaderboard/nejumi-leaderboard4/reports/Nejumi-LLM-4--VmlldzoxMzc1OTk1MA
元ポスト:
Exploring the Potential of Using an AI Language Model for Automated Essay Scoring, Mizumoto+, Research Methods in Applied Linguistics‘23
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Education #AES(AutomatedEssayScoring) Issue Date: 2023-04-01 Comment
著者によるポスト:
著者によるブログ:
https://mizumot.com/lablog/archives/1805
