NLP (4152) — 16/21
Online KL Shampoo, Tilde, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Optimizer #read-later Issue Date: 2026-08-06 Comment
元ポスト:
Muonよりもさらに高性能なoptimiserのようである。
関連:
- [Paper Note] Shampoo: Preconditioned Stochastic Tensor Optimization, Vineet Gupta+, ICML'18, 2018.02
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
Introducing MazeBench, MazeBench, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #AIAgents #Planning #VisionLanguageModel #3D (Scene) #SpatialUnderstanding #One-Line Notes #LongHorizon Issue Date: 2026-08-05 Comment
元ポスト:
3D空間において、カメラアングルの移動とブロックの移動をすることで実施可能なパズルゲームによる新たなベンチマークで、視覚的・空間的な推論能力と、長期のplanning能力を評価する。
AI が広げる人々の仕事, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #GenerativeAI #Blog #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。
このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?
Introducing PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models, Kimi Team, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #Evaluation #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2026-08-05 Comment
元ポスト:
Vision系の新たなベンチマーク。42種類のベンチマークのフロンティアモデルが失敗する事例に基づいて評価対象とするatomicな能力を定義し、それらのatomicなスキルを独立して評価可能なサンプルを作成し評価するベンチマーク。サンプルは与えられた情報のみから、評価対象とするatomicな能力を駆使すれば成功できるverifiableなタスクとして定義されているようである。能力ごとにモデルのスコアが算出可能。
実例としては、たとえば、魚が泳いでいる複数の池のイラストが与えられて、真ん中の池には何匹の魚がいる?といったクエリに応答するなどである。これには localization の能力が求められる(Countingも必要な気がするが)。
AgentENV, kvcache-ai, 2026.07
Paper/Blog Link My Issue
#Article #Tools #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Initial Impression Notes #Environment #Author Thread-Post #SandboxEnvironment Issue Date: 2026-08-05 Comment
元ポスト:
大規模、かつ高速にAgentic RLのためのサンドボックス環境をself-hosting可能な実装
下記ポストに速度やKimi K3で利用された時の環境の規模感が記述されているので参照のこと:
MAI-Cyber-1-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #Security #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
公式:
DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Library #MoE(Mixture-of-Experts) #Parallelism #GPUKernel Issue Date: 2026-08-05 Comment
Expert Parallelism での通信を高速化する上で代表的なライブラリ
その後以下のようなものが登場:
- Mixture-of-Kittens: our open-source MoE megakernel for NVL72s, Cursor, 2026.08
- MoonEP, MoonshotAI, 2026.07
credit-assignment-is-all-you-need, haotian, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #ReinforcementLearning #PostTraining #reading #Author Thread-Post #CreditAssignment Issue Date: 2026-08-05 Comment
元ポスト:
英語版公式ポスト:
Qwen3.8-Max: A New Bar for Coding and Cowork, QwenTeam, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #Proprietary #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
Fable5には及ばないがOpus4.8と同等以上のベンチマークスコア、という印象
細かすぎて伝わらないChat Completions _ Responses APIのモデル間挙動差異, nyanp, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Reasoning #API #SoftwareEngineering #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
BTL-3, badtheorylabs, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #PEFT(Adaptor/LoRA) #OpenWeight #SoftwareEngineering #One-Line Notes #ToolUse Issue Date: 2026-08-04 Comment
ポイント解説:
Qwen3.6-27Bに対してLoRAによってcoding, tool useに特化した事後学習を実施したモデルで、HFではアダプタが公開されている。
Introducing Antares: Highly Efficient Open Weight AI Models for Vulnerability Localization, Cisco Blogs, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #SmallModel #OpenWeight #SoftwareEngineering #One-Line Notes #Security #Author Thread-Post Issue Date: 2026-08-04 Comment
HF: https://huggingface.co/fdtn-ai/antares-1b
コードベースの脆弱性を検知することに特化したSLM
ポイント解説:
公式ポスト:
Motif-3-Beta, Motif-Technologies, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #One-Line Notes Issue Date: 2026-08-04 Comment
元ポスト:
アーキテクチャ解説:
所見:
DeepSeek-V4 Pro, MiniMax M3等のモデルと同等程度のスコアの314B-A13Bモデル。
Grouped Differential Latent Attention (GDLA), Grouped PolyNorm activation と呼ばれる(おそらく本モデル独自の)技術を利用している。
optimize_anything Goes omni: Composing Optimizers into Meta-Optimizer Pipelines, Shangyin Tan+, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #One-Line Notes #Author Thread-Post Issue Date: 2026-08-04 Comment
元ポスト:
GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、
Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、
Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善
このようなパイプラインを実現するmeta optimiser-omniを実装している。
関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03
Introducing FLUX-mimic: Scaling Video-Action Models for General Purpose Dexterity, mimic robotics, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #VideoGeneration/Understandings #Robotics #EmbodiedAI #WorldActionModel Issue Date: 2026-08-03 Comment
元ポスト:
FLUX3をベースに構築されたVision Action Model
- 大規模な動画生成モデルをバックボーンとすることで、ロボットのActionの予測をVLAと比較して最大10倍のデータ効率で実現
- 動画生成バックボーンの性能が向上すれば、Video Action Modelの性能もそれに伴い向上することが示唆される
Introducing MAI-Image-2.5- Pro and MAI-Voice-2-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #SpeechProcessing #TextToImageGeneration #Proprietary #TTS #ImageSynthesis #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
関連:
- Building a hill-climbing machine: Launching seven new MAI models, Mustafa Suleyman, MAI, 2026.06
How much science is verifiable? Results from replicating ICML 2026 oral papers, SAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
ICML 2026のOralとして採択された論文の再現実験を通じて得られた知見がまとめられているようで、非常に面白そう。
WeirdChat: A catalog of unexpected AI behaviors, discovered automatically, Transluce, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #Blog #Safety #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
OpenWeightモデルからの100M以上のレスポンスから、安全性やAlignmentに問題のある応答をサンプリングし、再現可能な形でまとめたカタログのようである。
Surfacing Benchmark-Maxxing in Kimi-K3, arjun, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Evaluation #Post #read-later #Initial Impression Notes #RewardSeeking Issue Date: 2026-08-03 Comment
元ポスト:
関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07
Kimi K3における、評価されていると認識した上で評価作成者の意図の検討や、reference solutionに関する検討をするなど、ベンチマークに過度に最適化されているような挙動を示す現象に関する検討な模様。
On-policy distillation isn't a free-lunch, Bhavin Jawade, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Distillation #Post #PostTraining #Selected Papers/Blogs #On-Policy #reading #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
OPD/OPSDのfailure modeが非常に分かりやすくまとまっている
エージェントスウォームと新しいモデルの経済性, Cursor, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #Coding #SoftwareEngineering #read-later #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
コストが最大15倍も利用するモデルにより変化したとのことだが、コードの品質はどの程度変化したのだろうか?(まだ読めていない
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。
nanogpt speedrunを通じた分析結果なども載っている。
DeepSeek-V4-Flash, Deepseek, 2023.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs Issue Date: 2026-08-02 Comment
Artiflcial Analysisによる評価:
GLM-5.2, Muse Spark 1.1, Gemini3.6-Flash, GPT-5.6-lunaと同等程度のスコアにもかかわらず、スコアに対するパラメータ比率で圧倒的にパレート最適に位置付けられる。
Epoch Capabilities IndexでOpenWeightモデルでKimi K3に次ぐ2位、全体でOpus 4.6に次ぐ7位
Language model harnesses are compositional generalizers, Zhang+, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #read-later #Generalization #RecurrentModels #RecursiveModels #AgentHarness Issue Date: 2026-07-31
長時間稼働モデル時代の安全性とアラインメント, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #AIAgents #Blog #Safety #LongHorizon #Security #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。
関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Introducing Cosmos 3 Edge, Nvidia, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #Blog #SmallModel #OpenWeight #VisionLanguageModel #Robotics #WorldModels #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
HF: https://huggingface.co/nvidia/Cosmos3-Edge?linkId=100000431533162
autoregressive -> diffusion の two-tower モデル
Cosmos3 テクニカルペーパー:
- [Paper Note] Cosmos 3: Omnimodal World Models for Physical AI, NVIDIA+, arXiv'26, 2026.06
Extending Legal Agent Bench to M&A Due Diligence, Harvey, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Post #read-later #Legal Issue Date: 2026-07-31 Comment
元ポスト:
Agentic World Models, Cameron R. Wolfe, Ph.D., 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #AIAgents #Blog #read-later #WorldModels #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
[Paper Note] Towards Long-Horizon Agents: A Survey Foundation, Evolution, Harness, Optimization, Application, and Frontier, Dong+, 2026.07
Paper/Blog Link My Issue
#Article #Survey #LanguageModel #AIAgents #LongHorizon #Author Thread-Post Issue Date: 2026-07-31 Comment
pj page: https://long-horizon-agents.github.io/
元ポスト:
とても良さそう。とんでもない量だ。。。Open Problemsのところは非常にコンパクトで明快
github:
https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10
Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #RepresentationLearning #Evaluation Issue Date: 2026-07-31
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval, Nvidia, 2026.07
Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #LanguageModel #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #MultiLingual #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-31 Comment
元ポスト:
HF: https://huggingface.co/collections/nvidia/nemotron-3-embed
LLMベースのretrieval, STSタスク特化のembeddingモデルで、最大32k contextをサポート。多言語対応している。
RTEB Multilingualと呼ばれるベンチマークでSoTA:
https://mteb-leaderboard.hf.space/benchmark/RTEB(beta)
- Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10
解説:
Autoregressiveなモデルをbidirectionalなattentionに変換した上で、contrastive learning+高品質データでFinutuning。小規模モデルの作成には、pruning, NAS, 蒸留を2回繰り返すことで実現。
LLMエージェント評価の現在地 — 主要ベンチマークに学ぶ設計原則, Hiraoka, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #AIAgents #Evaluation #read-later #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
こちらの記事を含めて元ポストに5本、日本語でAI Agentの評価に関して実際に手を動かした知見がまとまっているようで、読みたい。
22580: From GPT2 to Kimi3, Explained, ali, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Post Issue Date: 2026-07-31
MoonEP, MoonshotAI, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #LanguageModel #Library #SoftwareEngineering #mid-training #PostTraining #Parallelism #One-Line Notes #GPUKernel Issue Date: 2026-07-28 Comment
大規模なExpertParallelにおいて通信を効率的に実施するためのライブラリとのこと。
元ポスト:
{G}igatoken: SIMD and Cache Hierarchies for 1000x Faster Byte-Pair Encoding Tokenization on Modern CPUs, Marcel R{\o}d, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Library #Tokenizer Issue Date: 2026-07-26 Comment
元ポスト:
所見:
どうやら、上記所見によると
- 与えられた文字列に対して正規表現を適用し、あらかじめ単語の境界を決める処理(pretokenize)を、
- SIMD命令(1つの命令を同時に複数のデータに対して適用;各バイトがどの文字クラスに属するかを判定する)と、
- ビット演算(文字クラスの判定結果に対して、シフトにより境界判定に必要な過去の文字クラス情報を構成し、シフト前後の系列に対するビット演算によりtokenizerの境界判定処理を実装みたいなことをやっているらしい)によって実現
- short pretokenに対するBPEをキャッシュする
という二段構えで高速化が実現されているようである。
---
参考:
- C++ SIMD命令入門(初心者向け), ancienthawk, 2025.08:
https://zenn.dev/ancienthawk/articles/for_simd_beginner_cp
- ゼロから作るLLM Part1: BPEトークナイザーの実装, so_dev000, 2025.11: https://qiita.com/so_dev000/items/037a21cba4e52182daea
A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Prompting #Blog #reading Issue Date: 2026-07-25 Comment
元ポスト:
The new rules of context engineering for Claude 5 models, Thariq, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Post #ContextEngineering #reading #AgentHarness Issue Date: 2026-07-25 Comment
元ポスト:
Auto-Routing Models, dari.dev, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #SmallModel #Selected Papers/Blogs #Initial Impression Notes #Orchestration Issue Date: 2026-07-25 Comment
元ポスト:
HF: https://huggingface.co/dari-ai/router-slm
Sakana FuguのようなLLMプールの中からターン単位で適切なLLMを選択するオーケストレータ(ルータ)で、QwenのLoRA Weightとして学習された重みが公開されているようである。
関連:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
- Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
The fastest LLM on Earth: Frontier level intelligence, 15x faster, celeris, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #DiffusionModel #Blog #Proprietary #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment
元ポスト:
アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。
Artificial Analysisによるoutput speed評価で1位:
Introducing Claude Opus 5, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment
元ポスト:
coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分
いよいよベンチマークではClaude一強という感じになってきた:
Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07
脆弱性を検知する能力が高い:
[Paper Note] LLaDA2.2, InclusionAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #DiffusionModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-25 Comment
HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash
元ポスト:
LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。
stack-v3-full, HuggingFaceCode, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #Dataset #LanguageModel #Blog #Coding #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。
また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。
Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24
所見:
FRONTIER-BENCH V0.1: A benchmark to measure and evolve with the frontier of agent work, FRONTIER-BENCH, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Blog #Selected Papers/Blogs #Live #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。
タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。
Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
Introducing Composite-Bench: the strongest open-weights model isn't Kimi K3, composite, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #Evaluation #Blog #ComputerUse #VisionLanguageModel #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
エンタープライズ向けのサービスに基づく専門家の操作に基づくbrowser-useベンチマークのようである。ざっくりブログを読んだが実際にどのようなサービスなのか知らないためあまりよくわからなかったので、公開されているベンチマークを見る方が直感的な理解は捗りそう。
本ベンチマーク上では、GLM-5.2がOpenWeightモデルの中では最も性能が高いようである。
Grok Build is open source: SpaceXAI's coding agent and CLI, SpaceXAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #One-Line Notes #AgentHarness Issue Date: 2026-07-23 Comment
元ポスト:
github: https://github.com/xai-org/grok-build
SpaceXAIによるcoding agent harness
所見:
Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search, Prime Intellect, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Blog #PostTraining #One-Line Notes #Scalability #Environment Issue Date: 2026-07-23 Comment
元ポスト:
36.5kのagentic RLのためのenvironments。対象はSWE, Search, terminal。全てのタスクセットが、任意のハーネス、ランタイム上でone commandで実行可能とのこと。
Solar Open 2: Korea's Sovereign Foundation Model, Built for Agentic Use, Upstage, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #OpenWeight #Korean Issue Date: 2026-07-23 Comment
元ポスト:
Introducing Laguna S 2.1 Poolside team, Poolside, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #OpenWeight Issue Date: 2026-07-22 Comment
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber, Google, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Proprietary #VisionLanguageModel Issue Date: 2026-07-22 Comment
元ポスト:
Artificial Analysis Indexでは、3.6 FlashはMuse 1.1と同程度の性能。
ただし、Time Per Intelligence Index Taskでは上位を独占
OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #AIAgents #Evaluation #Blog #Safety #Attack #Video #Selected Papers/Blogs #Security Issue Date: 2026-07-22 Comment
Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026
元ポスト:
video: https://youtu.be/87DyyMV0kCY
関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
所見:
GPT‑Red: Unlocking Self-Improvement for Robustness, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Security #Initial Impression Notes #RedTeaming Issue Date: 2026-07-19 Comment
元ポスト:
redteamingに特化したGPT
Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #MultiModal #Blog #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-27b
Bonsaiシリーズ:
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
- Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
- Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
1-bit, ternary weightによって、27B級モデルがエッジデバイス上で動作する。
How We Serve Ideogram V4 Lightning Fast on fal, fal, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #TextToImageGeneration #Blog #OpenWeight #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
関連:
- Ideogram 4: Open image model at the forefront of design, Ideogram, 2026.06
Ideogramに基づいた、高速なTextToImage Modelのようである。
🦋 Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning, Jian Hu and Molt Contributors, 2026.07
Paper/Blog Link My Issue
#Article #Tools #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #One-Line Notes #TrainingFramework Issue Date: 2026-07-19 Comment
元ポスト:
ハイパフォーマンス、かつminimalな実装のRLライブラリで、研究用のハックがしやすいフレームワーク。verlの1/9, Slimeの1/3の行数で実現されているとのこと。
verl:
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04
Slime:
- slime, THUDM & Zhihu, 2025.09
[Paper Note] Cura1T: Specialized Model for Agentic Healthcare, actAVA AI Team, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Health #Medical #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
Healthcare関連の6つのベンチマークのうち5つでGPT-5.5, Opus4.8を上回る性能を示したモデルとのこと。Proprietaryモデル。
SingGuard-NSFA, inclusionAI, 2026.07
Paper/Blog Link My Issue
#Article #AIAgents #OpenWeight #Safety #One-Line Notes #Security #Safeguard Issue Date: 2026-07-19 Comment
元ポスト:
AI Agent向けのガードレールで、モデルの安全性からランタイムの安全性を指向して開発されている。エージェントのアクション実行前に、attackを検知し防御するなどの用途に使われる。
The 4-bitter Lesson: Balancing Stability and Performance in NVFP4 RL, Humans&, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #ReinforcementLearning #Blog #PostTraining #LowPrecision Issue Date: 2026-07-19 Comment
元ポスト:
How up-to-date is each AI model?, Apoorv Saxena, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Evaluation #Blog #FactualKnowledge #One-Line Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
330種類の30ヶ月に及ぶ予測不可能なイベントに関する情報を持ちいてモデルの実際のknowledge cutoffを推定する
元ポスト:
The Future Worth Building Is Human, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #GenerativeAI #Blog #read-later Issue Date: 2026-07-19 Comment
元ポスト:
Introducing Muse Spark 1.1, Meta, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #AIAgents #MultiModal #Proprietary #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
元ポスト:
Muse Spark:
- Introducing Muse Spark: Scaling Towards Personal Superintelligence, Meta, 2026.04
大幅にAgenticな能力やコーディング能力が向上。Agenticな能力では多くのベンチマークでOpus4.8超え、CodingはGPT-5.5にベンチマーク上では及ばず(SWE Bench Proでは勝っているが、OpenAIから30%以上のpromptが評価で不適切との報告があった Separating signal from noise in coding evaluations, OpenAI, 2026.07 )。
Alexandr Wang氏によるポスト:
Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
Paper/Blog Link My Issue
#Article #Controllable #LanguageModel #Blog #Reasoning #Length #read-later #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
OpenAIのReasoning Effortについては調整方法が公開されていないのでGPT-OSSのテンプレートなどから可能な方法を推測、そのほかOpenWeightモデルについてはテクニカルレポートに記載されている情報からReasoning Effortの調整方法が解説されている
PLaMoベースの強い日本語報酬モデルの構築, PFN, 2026.07
Paper/Blog Link My Issue
#Article #Blog #Japanese #read-later #RewardModel Issue Date: 2026-07-17 Comment
元ポスト:
Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #reading #One-Line Notes #Reference Collection Issue Date: 2026-07-17 Comment
元ポスト:
Artificial Analysisによる評価:
Artificial Analysis IndexでOpus 4.8超え!?
各ブロックの出力を重みつきで足し合わせることで柔軟にどのブロックにattendするかを決定するattention residualと呼ばれる技術が導入されているように見える。
また、MoEのexpert数をスケールさせ、896 experts, 16 activated expertsに変更。
学習レシピの洗練化と合わせてK2との比較で2.5倍のスケーリング効率が改善され、投入した計算コストをより効果的に知能に変換しているとのこと。
やはり
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
でも示されているようにexpert数を増やすのが今のところ良さそうに見える。
どうやら2.8Tモデルらしい:
design arenaでFable5超えのSoTA:
writingに関するベンチマークでSoTA:
Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
KDA
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
Linear TransformerとDelta Net
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
所見:
Latent MoEによってこれほどのsparsityを実現できているのではという所見:
GDPValでも3位:
Kernel optimizationにおいてもFable5と同等性能という報告:
Next.jsのコーディングベンチマークでもFable5超えのSoTAとのこと:
DeepSWEでGPT-5.6-sol, fable5に次ぐ3位:
アーキテクチャを公開されている情報から再構築した図:
公式ブログの図ではValueにはConvがかかっていないように見えたが、はたして。
テクニカルレポート:
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
HF:
https://huggingface.co/moonshotai/Kimi-K3
アーキテクチャのポイント:
テクニカルレポートまとめ(スレッド):
解説スレッド:
解説:
関連:
- AgentENV, kvcache-ai, 2026.07
- MoonEP, MoonshotAI, 2026.07
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- MoonViT
- [Paper Note] Kimi-VL Technical Report, Kimi Team+, arXiv'25
KDAの更新ルールに位置情報が直接エンコードされるためRoPEを必要としない:
WSDよりもcosine decayの方が一貫して優れていた...?どういう条件の実験だろうか:
- [Paper Note] MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies, Shengding Hu+, COLM'24
Quantile Balancingについて理解したい
VQAからDocument Parsingへ:Nemotron-3-Nano-Omniに対する日本語文書の構造化出力Post-training, Stockmark, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #OpenWeight #Japanese #VisionLanguageModel #reading Issue Date: 2026-07-16 Comment
元ポスト:
Inkling: Our open-weights model, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #MultiModal #SpeechProcessing #Blog #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #AudioLanguageModel #Author Thread-Post Issue Date: 2026-07-16 Comment
HF: https://huggingface.co/thinkingmachines/Inkling
元ポスト:
THINNING MACHINESによる最初のOpenWeightモデル。975B-41B
- フルスクラッチで学習したReasoningモデル
- 1M context window
- text, image, audio, video 45Tトークンで学習
- バランスよくさまざまな領域で性能を発揮するように訓練し、Tinker上でのfinetuningやカスタマイゼーションの良い基盤として機能することを目指した
- vision, audioドメインに関してはencoder freeアーキテクチャを採用
- audio signalの入力は dMel spectrogramsと呼ばれる手法を採用
- [Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
- 画像は40x40のパッチに分割され、4つのhMLPと呼ばれるレイヤーでエンコーディング
- [Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
- IFの訓練には、Rubric basedなgraderとclaims graderの2種類のgraderを用いることで、helpfulnessとhallucinationを同時に低減
- Rubric basedなgraderはチェックリストに基づいてスコアリング
- claims graderはfactualな主張をagentic web searchを通じてverificationする
- アーキテクチャはDeepSeek V3を踏襲し、256のexpertsと2つのshared expertを採用し、6つのexpertsがactivateされる
- SWAとGlobal attentionの比率は5:1でKV Headは8つ (GQA)
- **相対位置エンコーディングを用いることでRoPEよりもlong contextに対してより高い外挿性能を示した**
- [Paper Note] Self-Attention with Relative Position Representations, Peter Shaw+, NAACL'18
- K, Vのprojection後、**およびattentionとMLPが残差ストリームに合流する前にshort convolutionを導入**
- QKV projection後に convolution を導入するアーキテクチャは下記研究で提案
- [Paper Note] Primer: Searching for Efficient Transformers for Language Modeling, David R. So+, NIPS'21, 2021.09
- optimiserはMuonとAdamWのハイブリッドで、前者は巨大な行列の重みに対して適用し、そのほかは後者を利用
- 重み自体が多様体上に存在するように制約することが有効であったことに着想を得て、weight decayを学習率の2乗に連動させることでモデルの重みの大きさを安定させたとのこと
- Modular Manifolds, Jeremy Bernstein+, THINKING MACHINES, 2025.09
- [Paper Note] Why Gradients Rapidly Increase Near the End of Training, Aaron Defazio, arXiv'25, 2025.06
- 事後学習としては、まずKimi K2.5を含むOpenWeightモデルで合成データ上でSFTをし、その後合成、あるいは人間が作成したenvironment上で大規模なRLを実施
- RLは非同期RLを異様し、ロールアウト数に対して推論能力が対数線形にスケールした。
- 最終的に30Mロールアウト以上のRLを実施した
- システムメッセージを変更し、トークン単位のコストを調整することでreasoning effortを調整
- Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
- **276B-A12BのInkling-Smallもプレビュー段階にあり、agenticな能力においてInklingに近い性能を達成しており、今後公開予定**
1M context windowを実現した工夫は特に書かれていなかったように感じるが、よく使われるのはKV CacheをコンパクトにするためのSparse Attention、あるいはLinear Attentionなのに対し、本モデルでは使われていないように見える。linear attentionでなくとも、SWAとGlobal Attentionのハイブリッド、かつGQAによって、KV Cacheの肥大化を実用レベルで抑制できるのだろうか。また、外挿性能に関してはRoPEは採用せず、相対位置エンコーディングのを採用したという点が効いているのだろうか。1Mレベルでのcontextでの評価がなさそうに見えるので性能はよくわからない。
RoPEのlong contextでの限界を示した以下の研究を思い出した:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Artificial Analysisによる評価:
アーキテクチャでの目新しい点:
所見:
公式:
所見:
AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
Paper/Blog Link My Issue
#Article #SelfImprovement #read-later #autoresearch/RSI #Author Thread-Post #AgentHarness Issue Date: 2026-07-15 Comment
元ポスト:
Reducing Doom Loops with Final Token Preference Optimization, Liquid.AI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Reasoning #read-later #Author Thread-Post Issue Date: 2026-07-12 Comment
元ポスト:
LingBot-VLA-V2, Robbyant, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #OpenWeight #Robotics #VisionLanguageActionModel #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-12 Comment
元ポスト:
Workspace geometry, model by model., elie, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Blog #OpenWeight #read-later #Interpretability #Initial Impression Notes Issue Date: 2026-07-12 Comment
元ポスト:
38種類のOpenWeightモデルのlayer間でのJ-lensの類似性を検証したとのこと
アーキテクチャが異なっていても非常にモデル間で類似しているようである。gemma-4やSLM(Qwen, GPT2)などは外れ値を含む模様
関連:
- Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07
Harness Engineering for Self-Improvement, Lilian Weng, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #AIAgents #Blog #SelfImprovement #read-later #RecursiveModels #Author Thread-Post #AgentHarness Issue Date: 2026-07-12 Comment
元ポスト:
GPT-5.6: Frontier lntelligence that scales with your ambitlon, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-10 Comment
元ポスト:
GPT-5.6の変更点まとめ:
Model Guidance: https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
全体的に性能が高いだけでなく、コストパフォーマンスも良いという印象
コストパフォーマンス比:
Terra Ultra並の性能が必要なければ、Lunaのreasoning effortを上げるのがコスパ良いという話:
Lunaが80%の値下げでGPT-5.4-nanoよりも安くなった。触っている感じおそろしく安いくせに、非常に性能が高い。
The Surprising Power of Small Language Models, Mojan Javaheripi+, Microsoft Research, 2023.12
Paper/Blog Link My Issue
#Article #LanguageModel #SmallModel #Slide #One-Line Notes Issue Date: 2026-07-09 Comment
Phi-2のNeurIPSでの発表資料で、小さいスケールのLLMの学習済みの重みを、より大きなスケールのLLMの初期化に活用するweight reusinhgについて図解されている。実際にこの手法が説明されている文献は、スライド中で引用されている
- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
であるため、そちらも併せて参照のこと。上記issueに手法について説明を記載した(正しく読み解けているか少し自信がない)。
大規模言語モデルの次期バージョンPLaMo 3シリーズにおける120B事前学習モデル、31B蒸留モデルの評価, PFN, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #LongContext #OpenWeight #Reading Reflections #Author Thread-Post Issue Date: 2026-07-09 Comment
元ポスト:
weight reusing:
- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
- The Surprising Power of Small Language Models, Mojan Javaheripi+, Microsoft Research, 2023.12
long context評価:
- [Paper Note] RULER: What's the Real Context Size of Your Long-Context Language Models?, Cheng-Ping Hsieh+, COLM'24, 2024.04
- [Paper Note] Repeat After Me: Transformers are Better than State Space Models at Copying, Samy Jelassi+, arXiv'24, 2024.02
HF: https://huggingface.co/pfnet/plamo-3-nict-2604-31b-base
YaRNを適用するとlong contextの性能が大きく改善し、事前学習で学習させるトークン数を増やしすぎるとYaRNのcontext lengthの外挿能力が低下するという実験結果が非常に興味深い。
記載がなかった気がするのだが、Sink Tokenの利用などはやっているのだろうか?
- [Paper Note] YaRN: Efficient Context Window Extension of Large Language Models, Bowen Peng+, ICLR'24
Separating signal from noise in coding evaluations, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Dataset #LanguageModel #AIAgents #Evaluation #Blog #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-09 Comment
元ポスト:
SWE-Bench Proの約30%にタスクが評価として機能しないタスクが含まれているとのこと(SWE-Bench Verifiedと同じ流れでは)。
これらは、5人の熟練なソフトウェアエンジニアによる監査と、AI Agentによる監査結果を人間がレビューするプロセスの2つを介して同定された。
以下のようなものがある:
- 過剰に制約されたテスト: 実装の制約が強すぎて機能として正しいのにテストが通らず、かつプロンプトでその制約が明示されていない
- requlrementが不足したテスト: プロンプトでの推測することができない要件の漏れ
- 低カバレッジのテスト: 実装が不完全でも通過するテスト
- ミスリーディングなプロンプト: テストが求める要件とは異なる挙動に向かわせるプロンプト
これにより、OpenAIは以前SWE Bench Proを推奨していたがそれを撤回するとのこと。
SWE Bench Verifiedでも同様の事案があった:
- Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02
そしてSWE Bench Verifiedにおけるコンタミネーションやテストの問題点を改善したSWE Bench Proを構築した、という経緯だったはずだが、そのSWE Bench Proでも問題が見つかったという流れである。
あと、そもそもSWE Bench Proで問題のなかった70%で評価したら現在のモデルのスコアはどうなるのだろうか?
SWE-1.7: Frontier Intelligence at a Fraction of the Cost, Cognition, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Author Thread-Post Issue Date: 2026-07-09 Comment
元ポスト:
Introducing Grok 4.5, SpaceXAI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Proprietary Issue Date: 2026-07-09 Comment
元ポスト:
Artificial Analysisの評価によるとGDPValで4位:
interpreting GPT: the logit lens, nostalgebraist, 2020.08
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Blog #Selected Papers/Blogs #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment
LLMの中間層のhidden_state(残差ストリーム)に対して、出力層を連結しnext tokenを予測することで、当該中間層でどのようなトークンが想起されているかを可視化する
Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Selected Papers/Blogs #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment
元ポスト:
関連:
- interpreting GPT: the logit lens, nostalgebraist, 2020.08
本文献の本旨であるJ-Spaceの定義、Global Workspace等の発見の話は元ポストを参照のこと。
以下、J-Lensについて元ポストを参考にメモする。
元ポストによると、logit lens
- interpreting GPT: the logit lens, nostalgebraist, 2020.08
と比較して、本文献で提案されているJacobi Lens (J-lens)は、ある中間層での残差ストリームにおける活性値の摂動が、最終層にどのような影響を与えるかを分析することで、当該中間層における残差ストリームがどのようなトークンを将来出力させる傾向にあるかを可視化する手法、とのことである。元ポスト中の具体例による説明が非常にわかりやすい。
logit lensは中間層の残差ストリームに対して、出力層を用いた線形変換を施して残差ストリーム内でどのようなトークンが想起されているかを可視化するが、J-lensは後段の層に与える影響を考慮して可視化する点が異なる。
Hy3, Tencent, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-08 Comment
元ポスト:
- Hy3-preview, tencent, 2026.04
の公開後から、50以上のプロダクトからフィードバックを受けより高品質なデータで事後学習を実施したとのこと。
- GLM-5.2: Built for Long-Horizon Tasks, Z.ai, 2026.06
が744B-A40B。Hy3は295B-A21Bなので、半分程度のパラメータ数でフロンティアモデルに近い性能を達成している。
公式:
Introducing Rampart, National Design Studio, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #OpenWeight #Privacy #One-Line Notes #PII #Author Thread-Post Issue Date: 2026-07-08 Comment
HF: https://huggingface.co/nationaldesignstudio/rampart
生成AIに送信されるリクエストを検閲し、プロンプトに含まれる個人情報をマスクするよう訓練された軽量モデルのようである。ブログ下部のデモンストレーションを見るとイメージを掴みやすい。
元ポスト:
[Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 Comment
RLによる事後学習の際にtrainer側のoptimizerが1 step学習した後にinferenceエンジンに重みをpushするが、BF16でのRLにおける1 stepの更新では多くのモデルの重みに変化はなく(99%程度)、差分だけをpushすればlosslessで2桁程度trafficを削減できて、RDMAが不要でたとえばイーサネットベースのデータセンターを跨いだ環境でもRLが実行できそうだよ、という話のようである。
元ポスト:
Devin Fusion: Frontier Performance at 35% Lower Cost, Cognition, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Architecture #read-later #ContextEngineering #One-Line Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-07 Comment
元ポスト:
高価で高性能なメインエージェントがタスクを管理し、安価なサイドキックエージェントがメインエージェントからタスクを移譲され処理をするようなアーキテクチャによって、メインエージェントで処理した場合と同等の性能を発揮しつつコストを削減できる。
似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Fusion Harness: How to combine a more expensive main model and a sidekick model, Graham Neubig, GithubGist, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #ContextEngineering #MinimalCode #One-Line Notes #Author Thread-Post #AgentHarness #Gist Issue Date: 2026-07-07 Comment
元ポスト:
openhands SDKを用いて、全体の管理を高性能で高価なメインエージェントにより実施し、個々の作業を安価なサブエージェントに移譲することで、コンテキストを管理しつつパイプライン全体のコスト削減を実施する実装
似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Using Local Coding Agents, Sebastian Raschka, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #AIAgents #Blog #Coding #OpenWeight #LLMServing #SoftwareEngineering #Author Thread-Post #AgentHarness Issue Date: 2026-07-05 Comment
元ポスト:
Introducing computer use in Gemini 3.5 Flash, Google, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #Blog #Proprietary #ComputerUse #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-05 Comment
元ポスト:
quick start guide:
computer useがだいぶ使いやすくなってきたなあ(小並感)
Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel, nvidia, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Library #MoE(Mixture-of-Experts) #PostTraining #Selected Papers/Blogs #Finetuning #reading #One-Line Notes #EfficientEvaluation #TrainingFramework Issue Date: 2026-07-05 Comment
わずか数行を追加するだけで、MoEモデルをマルチGPU環境でFinetuningする際のスループットが約3--4倍、メモリ使用量が30%程度削減されるライブラリ。既存のQwen, Nemotron, GPT-OSS, DeepSeek V3などの一般的なMoEアーキテクチャに対して、最適化済みの実装が提供されているとのこと。
repository: https://github.com/NVIDIA-NeMo/Automodel
Leanstral 1.5: Proof Abundance for All, Mistral AI, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #Mathematics #OpenWeight #Proofs #Author Thread-Post Issue Date: 2026-07-04 Comment
元ポスト:
HF: https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B
所見:
The Verification Stack, OpenHands, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
コードがプッシュされる前にエージェントの作業を評価する小型のcriticモデルと、プルリクエストに対してコードレビュー(スキルを利用)+QAを実施するシステム(実際にエントリーポイントを見つけ、動作させ、証跡を資料としてまとめてレポートをポストするシステム)によってコードの検証プロセスを効率化し、マージまでの時間が平均58%削減され、開発効率が向上する話のようである。
Agentic RL: Frameworks and Best Practices, CAMERON R. WOLFE, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #read-later Issue Date: 2026-07-03
Speculative Decoding - The Bits and the Bytes, Aakash Kumar Nain, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Blog #Decoding #read-later #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
Speculation Is All You Need, Modal, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Decoding #read-later #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
[Paper Note] EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments, ByteDance Seed, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-03 Comment
blog: https://edge-bench.org/
人間が平均で57.2時間かかるようなlong horizonなタスクによるAgentのベンチマーク
Sarashina3 guard: 日本語特化ガードレールモデル, SB Intuitions, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Japanese #Safeguard #Author Thread-Post Issue Date: 2026-07-02 Comment
元ポスト:
Learning to Replicate Expert Judgment in Financial Tasks, THINKING MACHINES, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #ReinforcementLearning #Blog #Financial #PostTraining #read-later #Author Thread-Post Issue Date: 2026-07-02 Comment
元ポスト:
Simple, Fast, Vibe‑Ready ZCode combines the best AI agents with your existing tools so you can plan, code, review, and deploy without friction., Z.ai, 2026.07
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #Coding #SoftwareEngineering #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-02 Comment
元ポスト:
GLMのZ.aiによるAgent Harness (Scaffolding)
Sarashina3 embedding: 日本語に強い最新のテキスト埋め込みモデル, SB Intuitions, 2026.07
Paper/Blog Link My Issue
#Article #Embeddings #RepresentationLearning #Japanese #read-later Issue Date: 2026-07-02 Comment
元ポスト:
Introducing Claude Sonnet 5, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #VisionLanguageModel #One-Line Notes Issue Date: 2026-07-01 Comment
元ポスト:
Artificial Analysisによる評価:
SWE Bench ProのスコアはOpus 4.8とSonnet 4.8の中間程度
Opus 4.8よりも2倍程度生成されるトークンが長い傾向にあり、結果的にArtificial Analysisによる評価を実施する際にOpus 4,8よりもコストが高くついたとのこと:
Sarashina3 mini _ Sarashina3 nano: フルスクラッチで開発した最新の国産LLM, SB Intuitions, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Proprietary #Japanese Issue Date: 2026-06-30 Comment
元ポスト:
Introducing LongCat-2.0, LongCat, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #OpenWeight #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-30 Comment
元ポスト:
- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD
HF:
https://huggingface.co/meituan-longcat/LongCat-2.0
現在はまだ公開されていないがモデルは上記で公開予定
Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象
LongCat Sparse Attentionポイント解説:
所見:
50k基のH800 GPUで学習されているとのこと。
所見:
ポイント解説:
Hermes-Agent, Nous Research, 2026.02
Paper/Blog Link My Issue
#Article #Tools #LanguageModel #AIAgents #SelfImprovement #One-Line Notes #ContinualLearning #AgentSkills #AgentHarness Issue Date: 2026-06-27 Comment
Nous ResearchによるAgentSkillsを自己改善していくタイプのAgent Harness (Scaffolding)。2026.0628現在20k star
CyScenarioBench: Evaluating LLM Cyber Capabilities Through Scenario-Based Benchmarking, IRREGULAR, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #LongHorizon #Security Issue Date: 2026-06-27
Previewing GPT‑5.6 Sol: a next-generation model, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-27 Comment
元ポスト:
OpenAIによる新たなフロンティアモデルで、terminal benchでMythos 5, Fable 5超え。まずは少数のパートナーに提供し、その後数週間以内にGAを目指す、という感じらしい。
所見:
ベンチマーク:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
- [Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
- CyScenarioBench: Evaluating LLM Cyber Capabilities Through Scenario-Based Benchmarking, IRREGULAR, 2026.06
- [Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
- [Paper Note] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale, Zhun Wang+, arXiv'25, 2025.06
サイバーセキュリティに関するベンチマークの報告が増えてきたなぁ
Scaling Laws, Carefully, Lilian Weng, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Scaling Laws #read-later Issue Date: 2026-06-26 Comment
元ポスト:
LFM2.5-230M: Built to Run Anywhere, Liquid AI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SmallModel #OpenWeight Issue Date: 2026-06-26 Comment
HF: https://huggingface.co/LiquidAI/LFM2.5-230M
元ポスト:
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #OpenWeight #SoftwareEngineering #PostTraining #One-Line Notes #Author Thread-Post Issue Date: 2026-06-26 Comment
HF: https://huggingface.co/collections/deepreinforce-ai/ornith-10
元ポスト:
gemma4とQwen3.5をpost trainingしたコーディング特化LLMで、397BモデルではSWE Bench ProでGLM 5.2超え
Introducing Claude Tag, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #AIAgents #GenerativeAI #Blog #Author Thread-Post Issue Date: 2026-06-24 Comment
元ポスト:
ポイント解説:
PLaMo 3.0 Primeをリリースしました, PFN, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Proprietary #Japanese #Author Thread-Post Issue Date: 2026-06-23 Comment
元ポスト:
Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #Test-Time Scaling #Initial Impression Notes #Reading Reflections #Orchestration Issue Date: 2026-06-23 Comment
元ポスト:
所見:
Opus 4.8, Gemini 3.1 Pro, GPT 5.5(他にもありそう)のオーケストレータ
beta:
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
テクニカルレポート:
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
v1.1になり、新たに公開されたフロンティアモデルをルーティングに加えることで性能向上:
基本的に新たなモデルが公開されたらルーティングを更新すればFuguの性能も向上していくので、性能面でFrontier Modelに遅れをとる可能性は小さいと思われる。一方で、Fugu内部で商用APIを叩いた場合そのコストは他社のマークアップが上乗せされたものになると思うので、利用コストをどの程度抑えられるかがポイントになるだろうか。ただ、ターン単位で利用されるモデルが変更されるので、たとえばFable5を最も重要なプランニングで利用し、その後のフェーズではより安価なモデルを使う、といった柔軟なモデルの組み換えが可能なので、そこの最適化がされればタスクを完遂する際に特定の1モデルを利用するよりも結果的に安い可能性は高い。
Humans Still Beat AI in the Long Horizon: Revisiting Test-Time Scaling in the Agent Era, Mang+, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #Coding #read-later #Selected Papers/Blogs #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-22 Comment
2週間にわたるopen endなプログラミングコンテストのデータを用いて人間の専門家とAI AgentのElo ratingの変遷を比較すると、序盤は人間に対して大きくリードしスコアは試行回数の対数に対して線形にスケーリングし次第に停滞を始めるが、人間の専門家は4日を超えたあたりから非線形にスコアが進化し、最終的にAI Agentよりも高いスコアを記録する。人間はAI Agentと比較して、継続学習ができていることが示唆され、AI Agentのlong horizonタスクに対する能力の限界が示唆される、という話に見える。
元ポスト:
Deli_AutoResearch, Deli Chen, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SelfImprovement #read-later #AgentSkills #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-20 Comment
元ポスト:
日本語エージェントベンチマーク「J-tau telecom」の公開, SB Intuitions, 2026.06
Paper/Blog Link My Issue
#Article #Dataset #LanguageModel #AIAgents #Evaluation #Japanese #Author Thread-Post Issue Date: 2026-06-20 Comment
元ポスト:
Introducing LifeSciBench, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Biological #Author Thread-Post Issue Date: 2026-06-18 Comment
元ポスト:
Ming-omni-tts-16.8B-A3B, inclusionAI, 2026.06
Paper/Blog Link My Issue
#Article #SpeechProcessing #OpenWeight #TTS #One-Line Notes #AudioLanguageModel #audio #Music Issue Date: 2026-06-17 Comment
元ポスト:
pj page: https://xqacmer.github.io/Ming-omni-tts/
speech/sound/musicを単一のモデルで生成可能
GLM-5.2: Built for Long-Horizon Tasks, Z.ai, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Actor-Critic #OpenWeight #Selected Papers/Blogs #Reference Collection #Critic #LongHorizon #train-inference-mismatch #Initial Impression Notes Issue Date: 2026-06-16 Comment
HF: https://huggingface.co/zai-org/GLM-5.2
1Mコンテキストでフロンティアモデルには少し劣るが非常に高い性能。SWE Bench ProではGPT5.5をoutperform、Terminal Bench/DeepSWEなどでは3--12pt程度GPT5.5が高い。Opus4.8はさらにスコアが高い。
744B-A40B
元ポスト:
Artificial Analysis Intelligence IndexでOpenWeightモデルでSoTA更新:
MiniMax-M3超え
long Horizonのタスクの学習でGRPOではなく、criticベースのPPOを利用:
アーキテクチャ解説:
GLM 5.2では、Reward Hackingを検知した場合、ペナルティを与えるのではなく、ツール呼び出しをブロックしてダミー情報を返し、ロールアウト自体は継続させる。Reward Hackingをすると、ただ損をするという構造に近づけていると思われる。
slimeフレームワークを用いることで10を超えるエキスパートモデルに基づくOPDを2日で終えたとのこと。この記述に基づき、OPDがRLと比較して非常に効率的で、かつエキスパートなモデルは並列で学習をさせておけるよね?という利点に関して推察をしている:
エキスパートなRLでは常にドメイン別のRLを走らせ特化モデルを学習しておき、性能が向上したらOPDで単一モデルに効率的に蒸留することで、モデルに知識を集約するプロセスと、個々のドメインごとに強力なモデルを得るプロセスが分離されて良さそう、という感想を得た。
1M context + linear attentionが標準に:
MTPの学習時において、step 2以後のMTP Layerの出力は、学習時はteacher forcing, 推論時はstep 1のMTP Layerが推定したhidden_stateが用いられるが、これが学習-推論時のgapを生んでしまう。このため、step 1の計算で利用したKV(とsparse attentionのtop-kで洗濯をしたトークンのindex)を全て共有し、step 2以後のMTP Layerで活用し、かつstep 2以後のsparse attentionの計算のオーバヘッドをなくしつつ、学習-推論のgapを無くすことでspeculative decodingの性能を向上させる、といった話題があるようである:
画像分野におけるself-forcingと同じ発想に思う。
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
GRPO, PPOのそれぞれの利点と欠点、およびLong Horizonタスクに適用する価値の説明:
Cursor Benchにおいて、Opus 4.8と同等程度のコスト効率とのこと:
PPOへ最終的に回帰してきたのは一種のbitter lesson:
PPO vs. GRPOに関する所見:
GLM 5.2で利用されたRL:
- [Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07
要はGRPOだと応答単位のrewardから算出されるAdvantageがトークン単位に一律に割り当てられるが、PPOの場合はトークン単位のcredit assignmentが可能(Criticが各時点でのValueを推定し、GAEなどを通じてAdvantageに反映されるため)な点が重要と思われる。
ZONOS2: Real-time TTS with High-Fidelity Voice Cloning, ZYPHRA, 2026.06
Paper/Blog Link My Issue
#Article #Dataset #Evaluation #SpeechProcessing #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #TTS #Realtime #Author Thread-Post Issue Date: 2026-06-15 Comment
元ポスト:
Introducing North Mini Code: Cohere’s first model for developers, Cohere, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #OpenWeight #SoftwareEngineering Issue Date: 2026-06-14 Comment
元ポスト:
アーキテクチャ解説:
Introducing Omnigent: A Meta-Harness to Combine, Control and Share Your Agents, Databricks, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #One-Line Notes #Author Thread-Post #AgentHarness Issue Date: 2026-06-14 Comment
元ポスト:
ハーネスの上に統一されたAPIを追加し、複数エージェントのハーネスを協調させるメタハーネス
Kimi-K2.7-Code, moonshotai, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #OpenWeight #SoftwareEngineering Issue Date: 2026-06-12 Comment
元ポスト:
Claude Fable 5 and Claude Mythos 5, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Initial Impression Notes #Reading Reflections Issue Date: 2026-06-10 Comment
元ポスト:
Mythos級の性能を持ち、サイバーセキュリティ、生物学、化学、蒸留に対してsafeguardを持つfrontier model
GDPValでSoTA:
フロンティアLLMの構築に関わるクエリは意図的に制限を設ける措置がとられているようだ:
一部の人間にしかAIの能力が解放されない未来に対する懸念:
-
フロンティアモデルの関連に関するリクエストに対しては、通常のsafeguardとは異なり**サイレントに性能が限定される**ようである。これはAIの開発が加速しすぎると重大なリスクが生じるため(February 2026 Risk Report)、とのこと:
-
-
このような性能の低減は、prompt modification, steering, peftなどを通じて行われるとのこと。利用者からしたらpromptの調整や工夫で検知されないようにするしか対策(?)の打ちようがないと思われる。
しかしこの情報をわざわざ公開する意図はなんだろうか。完全に憶測だが
- Mythos級のモデルの性能が良く、半自律的にモデルがモデル自身をよくする仕組みが成立している
- ライバルにモデルを使わせないで、自分たちだけで独占することでMoatを築くフェーズまできた
- 情報を公開しようがしまいが、性能に制限をかけていたら、フロンティアモデル開発者たちにはすぐバレるので、他のユーザたちが混乱するのを避けるために最初から線引きを明確にしておく
- ほほ全てのユーザに影響はないので、一部のフロンティアモデル開発に近しい人間から不満は出るが、全体で見たら気にしなくて良いレベル
- フロンティアモデル開発には使えないと銘打つことで、ライバルよりも本当に性能が良いんだな、という印象を与えることができるマーケティング効果
とかだろうか。
Geminiさんと壁打ちをしたら欠けている視点として以下のような意見を頂戴した(以下の引用部分はGeminiの出力です)
> 規制当局へのポーズ(アライメント):
「自社モデルが、制御不能なさらに強力なAI(AGI/ASI)を勝手に生み出す引き金(ゴーレムが生むゴーレム)にならないよう、防衛策を講じています」という姿勢を政府や規制当局に見せる必要があります。
なるほど
続報:
フロンティアモデルで性能が制限された時に、それらが他のsafeguardと同様ユーザ側に通知されるように変更されるようだ
モデルのそのものの性能などは置いておいて、今回の特定のタスク、プロンプトには恣意的に一定の制限を設ける措置を受け、(Project Glasswingの頃から違和感はあったが)Anthropicが恣意的にAIの能力を供給する姿勢に見え、雲行きの怪しさを感じる
- Project Glasswing Securing critical software for the AI era, Anthropic, 2026.04
Mythos級のモデルでは、全てのpromptと生成結果が、信頼性と安全性の確認のために30日間保持される:
https://support.claude.com/en/articles/15425996-data-retention-practices-for-mythos-class-models
所見: https://simonwillison.net/2026/Jun/9/claude-fable-5/
コーディング関連ベンチマークでは抜きん出ている:
所見:
Fable再公開後のClassifierによる安全マージンについて:
輸出規制解除:
約1ヶ月かかった。
KernelBench MegaでSoTA:
Improving our LLM Pretraining Efficiency, Open Athena, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #LanguageModel #Optimizer #MoE(Mixture-of-Experts) #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-06-06 Comment
元ポスト:
以下の処理によって、事前学習が高速化(FLOPsの改善幅)された知見が共有されている
- DenseからMoEモデルへの移行で実測値3.6倍
- MoEのexpart数を64->256で実測値1.3倍
- optimizerをMuonHにすることで、実測値1.25倍
- **Partial Key Offset (PKO) によって実測値1.2倍改善**
- **modded-nanogptリポジトリ、プルリクエスト169で初めて提案された手法とのこと。**
- **long windowのattentionに対して、keyの半分の次元をオフセット(=前のトークンのkey)、残りの半分の次元を自身のトークンのkeyとすることで、単一のクエリが連続した複数のキーにattendできるようになり、「過去の文脈からあるトークンの継続部分を検索して取得する」といった操作が単一のattention layerによって実現できるようになる**
- (これは知らなかった)
- expertのルーティングを再正規化・スケーリングすることで、実測値1.04倍
今後はHyperConnectionのようなResidual Streamの改善、推論効率向上のためMLA, LatentMoE, Multi Token Prediction, Gated Deltanet, quantizationなどの技術を検証するとのこと。
Expert数が多ければ多いほど性能が改善することは下記研究でも示されている:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
MuonH(というよりoptimizerのHyperplaneに基づいたラッパ)は以下(こちらもPercy Liang氏のグループ):
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
Hyper Connection:
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
MLA, LatentMoE, Multi Token Prediction, Gated Deltanet:
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- [Paper Note] Better & Faster Large Language Models via Multi-token Prediction, Fabian Gloeckle+, ICML'24
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
- [Paper Note] Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, Ali Hatamizadeh+, arXiv'26, 2026.05
LFM2.5-1.2B-JP-202606, LiquidAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #SmallModel #OpenWeight #Japanese Issue Date: 2026-06-06 Comment
元ポスト:
Towards Compositional Steepest Descent, Tilde Research, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Blog #Optimizer #Author Thread-Post Issue Date: 2026-06-06 Comment
元ポスト:
Understanding Self-Distillation and Privileged Information Distillation, Penaloza+, 2026
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #ReinforcementLearning #Blog #Distillation #read-later #Selected Papers/Blogs #On-Policy #SelfDistillation Issue Date: 2026-06-05
Ideogram 4: Open image model at the forefront of design, Ideogram, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #TextToImageGeneration #OpenWeight #ImageSynthesis #Author Thread-Post Issue Date: 2026-06-05 Comment
元ポスト:
HF: https://huggingface.co/collections/ideogram-ai/ideogram-4
NLP colloquium: AI Safety Survey, Masahiro Kaneko, 2026.04
Paper/Blog Link My Issue
#Article #Tutorial #Survey #LanguageModel #Slide #Safety Issue Date: 2026-06-05 Comment
元ポスト:
元ポスト:
APIの背後にあるモデルの隠れ層から語彙分布に変換する線形層の隠れ次元数を盗む方法があるのか...
NVIDIA Nemotron 3 Ultra, nvidia, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Reference Collection #LowPrecision #LinearAttention #Author Thread-Post Issue Date: 2026-06-05 Comment
元ポスト:
アーキテクチャ解説:
Mamba2 layer, Latent MoE, GQA
ポイント解説:
HF: https://huggingface.co/collections/nvidia/nvidia-nemotron-v3
所見:
所見:
Introducing Gemma 4 12B: a unified, encoder-free multimodal model, Google, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #OpenWeight #VisionLanguageModel #2D (Image) #UMM #SpatialUnderstanding #One-Line Notes #Reference Collection #AudioLanguageModel #audio #Author Thread-Post Issue Date: 2026-06-04 Comment
元ポスト:
vision/audioエンコーダーを無くしたvision/audio nativeなマルチモーダルLLM
HF: https://huggingface.co/google/gemma-4-12B
アーキテクチャ図:
A Functional Taxonomy of World Models, Fei-Fei Li, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #Post #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #VisionLanguageActionModel #KeyPoint Notes #TextToVideoGeneration #Reading Reflections #WorldActionModel #Author Thread-Post Issue Date: 2026-06-04 Comment
元ポスト:
以下ポストの内容の要約(と意訳、間違ってたらごめんなさい)
- 世界モデルは現在最も重要だが、最も多義的な概念の一つになっている。
- 様々な分野がWorld Modelを構築していると主張するが、意味するところが実際には大きく異なる
- (実際 [Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
のような研究も存在し似たような問題意識のもと様々な分野での統一的な分類体系が提案されている)
- 世界モデルという用語のもともとの枠組みは「部分観測マルコフ決定過程 (POMDP)」であり、
- エージェントは行動を実行し、行動は世界の状態に影響を与え、エージェントは観測データを受け取り(≠状態を認識する)、新たな観測データに基づいてアクションが実行される、といったループが繰り返される枠組みである
- ここで、「状態」とは、ある時点における世界で何が起きているかに関する完全なdescriptionであり、エージェントは状態自体を認識することはできず、行動と状態から生じた部分的な観測データのみである。
- 現在様々な世界モデルと呼ばれるものが存在するが、構造としては上記のループを持っており、それらの切り口が異なっているにすぎない。
- 世界モデルのカテゴリ1: Renderer
- Rendererは人間の目に見えるピクセルで「観測」を出力する。
- たとえば、テキストのプロンプトを映像に変換するText-To-Videoモデル、ユーザの入力に応じてリアルタイムにフレームを生成するシステムはレンダラーに相当する。
- これらモデルは観測者にとって「見えるもの」を生成しているにすぎず、実際の3次元構造を明示的に理解しているわけではない(i.e., 見えるもの≠実在するもの)。
- ビジネスとして最も成長(してきており、学習データもインターネット上の動画が活用できるため他の2カテゴリと比べて多い)
- 世界モデルのカテゴリ2: Simulator
- Simulatorは「状態」を出力する。これは実際に人間やコンピュータが相互作用可能な世界の表現である。
- Rendererは単に視覚的なものであるが、Simulatorは実世界の幾何学的・物理的・動的なダイナミクスを理解することが求められる。
- Simulatorは建築家やゲーム開発者などの視覚を超えた(たとえば構造・物理的な)正確性を必要とする職種や、RLの学習の環境として利用できる。
- Simulator は Rendererと次のPlannerの土台となる技術(Simulatorは RendererとPlannnerの双方をバイパスできる)であるが、学習データが最も不足
- 世界モデルのカテゴリ3: Planner
- Plannerは「行動」を出力する。観測と目標が与えられた時に「次に何をすべきか」を出力する。
- Vision Language Action Model / World Action Model は Planner に該当し、これらはロボットが次に何をすべきかを決定できる。
- 現在研究初期段階で、研究所内での閉じられた環境でのデモ中心で、実世界で活用するためにはまだまだ多くの課題が残る。
- これら3つのカテゴリは現在世に出ているWorld Modelの多くを説明しており、区別をする際に役に立つ。
- が、これらカテゴリは独立したものではなく、これらは世界の機能に関する基本的な知識(幾何学、物理学、ダイナミクス)の上に成り立つ。
- これら3つのカテゴリは最近は互いが融合してくる流れにあり、たとえば事前学習された Renderer は、次に何が起こるか・何をすべきか(=Planner)を予測するためのバックボーンとして利用できることが示されてきており、これは Renderer と Plannerが 融合した例と言える。
- (この辺の話はBackboneとしてVision Encoderを持つVLA系全般の研究と、事前学習済みのVision Encoderを用いずに事前学習の方法をそもそも改善するような方向などだろうか)
上記の話に基づくと、たとえばターミナルでのWorld Modelに相当すると考えられる
- [Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
は3つのカテゴリのうちにどれに該当するだろうか。
次のアクションを予測できるので、まずPlannerには該当すると思われる。また、ある時点においてターミナル上で何が起きているかの記述(ターミナルの出力)を予測しているので、Simulatorの役割を果たしていると思われる(ただ、ターミナルの出力だけがターミナルの状態を完全に記述した情報なの?定義としてそれでいいの?という疑問はあるのが)。このため、Planner と Simulator が融合した研究と言えるのではなかろうか。
Holo3.1: Fast & Local Computer Use Agents, H Company, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #AIAgents #OpenWeight #ComputerUse #VisionLanguageModel #Author Thread-Post Issue Date: 2026-06-03 Comment
HF: https://huggingface.co/collections/Hcompany/holo31
元ポスト:
関連:
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03
Is Frontier Asynchronous RL Solved?, Luke J. Huang, 2026.05
Paper/Blog Link My Issue
#Article #Survey #LanguageModel #ReinforcementLearning #Blog #Selected Papers/Blogs #reading #Asynchronous #Author Thread-Post Issue Date: 2026-06-03 Comment
元ポスト:
MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #Proprietary #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-06-02 Comment
元ポスト:
解説:
解説:
解説:
所見:
Figure 6について言及されている:
Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3, nvidia, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #OpenWeight #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #UMM #reading #Omni #One-Line Notes #WorldActionModel #Author Thread-Post Issue Date: 2026-06-02 Comment
元ポスト:
公式:
encoder-freeなOmniモダリティモデルで、かつ将来の世界の状態、およびactionを予測可能なWorldActionModel
Amazon Bedrock 経由で使える LLM の日本語ベンチマーク性能, yoheikikuta, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AWS #Evaluation #Blog #Japanese #KeyPoint Notes Issue Date: 2026-06-02 Comment
元ポスト:
Bedrock経由で利用できるLLMに対する llm-jp-evalの評価結果が、コストとパフォーマンスの双方の上で比較されている。Claude Opus 4.6(4.7, 4.8と比較して)のスコアが最も高く、日本語能力はベンチマーク上は平均スコアで見ると向上していないように見える。カテゴリごとの結果では、4.8がQAにおいて大幅にスコアが悪化しているのが興味深い。また、スコアを掲載して終わりではなく、全てのLLMが間違える個別の事例などもいくつか掲載されており興味深い。OpenWeightなLLMではKimi 2.5のコストパフォーマンスが最も良さそうに見えるが、Gemma4は評価に含まれていないので気になるところ。
日本語LLMの評価は
- Swallow LLM Leaderboard v2, Swallow LLM Team, 2025.08
も参考のこと。
On-Policy Self-Distillation: 言葉で学ぶ LLMの新たな学習パラダイム, ぶち, 2026.03
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #On-Policy #Reading Reflections #SelfDistillation Issue Date: 2026-06-01 Comment
元ポスト:
日本語でのOPSD解説で、細かい数式などよりも、何が重要で、なぜ今なのかといった気持ちのところが非常に重点的に説明されている。
後半の今後の課題の、どの程度の能力であればself teacherが成立するのか、どのような情報を与えると良いのか、といった話は、
- [Paper Note] Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why, Mohammadreza Armandpour+, arXiv'26, 2026.05
で模索されている。
また、OPSDの気持ち的な部分だけでなく、(簡単な)数式的な解釈、最近のサーベイなど、より詳細な情報は
- The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05
のブログにまとめられているので参照のこと。
MiniMax-M3, MiniMaxAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #MultiModal #OpenWeight #Post #Selected Papers/Blogs #VisionLanguageModel #UMM #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-06-01 Comment
ベンチマーク上はフロンティアモデルに性能がかなり肉薄しており、10日以内にモデルがオープンになる。
所見:
関連:
- [Paper Note] Learning Dynamics of LLM Finetuning, Yi Ren+, ICLR'25 Outstanding Paper Award
Artificial Analysisによる評価:
OpenWeightでSoTA
MLエンジニアのための本質から理解するLLM推論 KV cache編, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #LLMServing #Selected Papers/Blogs #One-Line Notes #KV Cache #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
次:
- MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05
数式レベルで、図解付きで曖昧性なく、非常に丁寧で、かつ実装面にまで踏み込んだ解説だが、冗長ではなくコンパクトに解説されており、すごい。今度からKV Cacheってなんなんですか?の問いにはこの記事をベースに教えよう。感謝🙏
Step-3.7-Flash, stepfun-ai, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #AIAgents #MultiModal #OpenWeight #MoE(Mixture-of-Experts) #read-later #VisionLanguageModel #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
公式:
Native RL APIs in vLLM, vLLM, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #ReinforcementLearning #Blog #SoftwareEngineering #PostTraining #reading #Asynchronous Issue Date: 2026-05-31 Comment
元ポスト:
所見:
Introducing Claude Opus 4.8, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Proprietary #VisionLanguageModel #Reference Collection #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
ベンチマーク比較:
ビジネススキルを学習させると不誠実になる:
LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts, LiquidAI, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #SmallModel #OpenWeight #read-later Issue Date: 2026-05-31 Comment
Repo2RLEnv: Turn any GitHub repository into a verifiable RL environment for training and evaluation, HuggingFace, 2026.05
Paper/Blog Link My Issue
#Article #Tools #LanguageModel #ReinforcementLearning #PostTraining #reading #Environment #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
Should we use genetics instead of system prompts for AI Agents & Personas?, Fyx, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Supervised-FineTuning (SFT) #Blog #PEFT(Adaptor/LoRA) #PostTraining #read-later #Personality #One-Line Notes #Reading Reflections Issue Date: 2026-05-31 Comment
元ポスト:
ゲノム文字列からキャラクターのペルソナを推論し出力に反映可能なLoRAアダプタを学習することによって、ゲノム文字列によってペルソナの条件付けを可能とするモデルに関する実験の報告のようである。
具体的には、まずゲノム文字列と、ペルソナに関するテキストを対応付ける。次に、ペルソナテキストを与えてモデルの応答を収集し、ゲノム文字列と(ペルソナのテキストなしで)収集したモデルの応答を用いてLoRAアダプタを学習する。これにより、LoRAアダプタはゲノム文字列から、ペルソナテキストによって応答づけられた応答を出力することを学習する、といった挙動を実現する。
ざっとみた感じLoRAアダプタとは書かれているが、学習手法が書かれていないような気がする。が、手法はおそらくSFTだと思われる。
これにより、prefillをするinput tokenが削減可能と思われるが、実用上はどちらかというと出力/reasoningトークンが圧縮される方がlatency/コストの双方から恩恵があるので、事後学習をして他の能力が劣化、あるいはAlignmentが悪化するリスクを背負ってまでやる価値があるかは怪しいな、という感想を持ったが、果たしてどうだろうか。
非常に大規模なユーザからの同時接続があり、キャラクターと対話できるようなサービスにおいて、キャラクターのペルソナテキスト(用途はペルソナだけには限らない汎用的な技術だと思うが)が97%圧縮できたら結構なインパクトがあるかもしれない。
[Paper Note] LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding, Wang+, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #CVPR #read-later #Selected Papers/Blogs #ObjectLocalization #VisionLanguageModel #2D (Image) #UMM #3D (Video) #text #ObjectDetection #GUI #Author Thread-Post Issue Date: 2026-05-30 Comment
元ポスト:
DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, DeepSWE, 2026.05
Paper/Blog Link My Issue
#Article #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
所見:
既存のベンチマークのような、githubのPRに基づいたものではなく(memorizationの問題があるため)、ゼロベースで構築。rolloutのtrajectoryを分析して、有効なPRなのに拒否する、あるいは何らかのcheatingをするといった挙動のdetectionもできるとのこと。また、SWE Bench Proと比較して、タスクを解くためのpromptは1/2である一方、タスクを解くために必要なコードの量は5.5倍となっており、より複雑なタスクとなっている。
contamination-freeが主張されているが、データセットは公開されているので、そのうちcontaminationが生じるであろう点には注意。
PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects, Ropedia, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #VisionLanguageModel #Robotics #Simulation #3D Object Generation #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
MagicLite, Microsoft, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #SmallModel #ComputerUse #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
Faraを用いたブラウザベースのChatUIを備えたCUAで、ローカルストレージへのアクセスも可能な模様
Hy-MT2-30B-A3B, Tencent Hy, 2026.05
Paper/Blog Link My Issue
#Article #MachineTranslation #LanguageModel #MultiLingual #OpenWeight #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment
HF: https://huggingface.co/collections/tencent/hy-mt2
元ポスト:
テンセントによる1.8B--30BのMT特化モデルファミリー。fast thinkingが強みとのこと。
token speed: How fast is 10 tokens per second really?, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Decoding #Initial Impression Notes Issue Date: 2026-05-27 Comment
元ポスト:
これはおもしろい。トークンの生成速度を可視化可能なサイト
Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?, Z.ai, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Infrastructure #LLMServing #Post #SoftwareEngineering #read-later Issue Date: 2026-05-27
Terminal-Bench Science: Evaluating AI Agents on Real-World Computational Workflows in the Natural Sciences, harbor-framework, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Repository #ScientificDiscovery #Science #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
ターミナル上でのscienceに関するワークフローを定義しAI Agentを評価することで、教科書的な知識を問うのではなく、より複雑で実践的なタスクによる評価をしたい、というモチベーションのpjで、Discordを通じてタスクを生成するcontributorを募集しているようである。
Nemotron-Labs-Diffusion-14B, Nvidia, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #DiffusionModel #OpenWeight #LLMServing #SpeculativeDecoding #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
3つの生成モード: AR/dLM/Hybrid を備えたLLM(VLM variantも存在)ファミリーで、ARモードでは一般的な自己回帰的な生成をし、dLMモードでは拡散モデルに基づくparallel decodingを実施、hybridではdLMでドラフト作成、ARでverificationを実施するSpeculative Decoding (self-speculation)を実施する。これらモードは内部のattention patternを変化させることでシームレスに切り替えられ(シームレスモード)期待されるconcurrencyに応じて柔軟に対応ができるようである。
シームレスの粒度がどの程度のものかはよくわからない。concurrency levelを検知して、それに応じて動的に切り替わったりするのだろうか。
Speculative Decodingの高速化手法としては以下のようなものもある:
- [Paper Note] TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification, Haoyun Jiang+, arXiv'26, 2026.01
General Agent: A Self-Evolving, Synthetic Agent Environment, Mika, PRIMEIntellect, 2026.05
Paper/Blog Link My Issue
#Article #General #LanguageModel #AIAgents #SyntheticData #reading #One-Line Notes #Environment #ToolUse #Author Thread-Post Issue Date: 2026-05-27 Comment
environment: https://app.primeintellect.ai/dashboard/environments/primeintellect/general-agent
元ポスト:
著者ポスト:
約1000のドメイン、約4500タスク、約8000種類以上の独自のツールを持つ、汎用エージェント学習のための学習環境とその構築方法。タスクを生成するAIとそれに対して解答するAIを用意し、解答がどの程度正解していたかによって難易度を同定しフィルタリング等を行いつつ、生成されたタスクをacceptするか否かを決定する。実際に構築された環境でRL/SFTを実施したところ、未知のベンチマークに対して性能が反化することも確認したとのこと。
mKernel: Fast Multi-GPU, Multi-Node Fused Kernels, Ziming Mao, and the UCCL team, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Infrastructure #read-later #GPUKernel #Author Thread-Post Issue Date: 2026-05-26 Comment
元ポスト:
> mKernel is our attempt at the missing piece: GPU-driven, fused kernels that deliver fine-grained compute–communication overlap across both intra-node NVLink and inter-node RDMA, while staying portable across various networking backends (ConnectX-7, AWS EFA, and more on the way).
The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #Survey #LanguageModel #ReinforcementLearning #Distillation #Catastrophic Forgetting #PostTraining #On-Policy #KeyPoint Notes #SelfDistillation #Author Thread-Post Issue Date: 2026-05-26 Comment
元ポスト:
- On Policy DistillationはKnowledge Distillationの一種で、教師モデルの知識を小さなモデルに蒸留する
- off policy KD Objectiveの場合は固定されたオフラインデータを用いるが、on policy distillationは生徒モデル自身が生成したデータに対するシグナルに基づいて学習される。
- off policy手法の課題はCatastrophic Forgettingと、(sequence長に対するquadraticな)エラーの蓄積がある。
- (オフポリシーRLの特殊なケースとみなすことができる)SFTはForward KLに基づいており、教師モデルの出力分布が確率を持つ部分に対して、生徒モデルの確率がゼロの場合はKLが発散するため、学習される生徒モデルの分布さスムージングされた分布になる。つまり、教師モデルの出力パターンを網羅できるように分布が学習される。
- このような手法で複数のドメインのデータで学習をした場合、分布のシフトが生じやすくCatastrophic Forgettingが生じやすい。
- on policy RLでは、Reverse KLが採用されており、この場合教師が確率が低いと考える場所に高い確率を割り振った場合のみに大きなペナルティを受けるため、教師の重要なモードをカバーしていれば、教師の他のモード全体は無視できる。これにより、学習したいモード以外の挙動に影響を与えにくく、特定のモードの学習ができる。
- (SFTがCatastrophic Forgettingが起きやすそうということは理解できるが、オフポリシーRL全体においてCatastrophic Forgettingが起きやすい問題があるという文脈で書かれている気がしており(エラーの蓄積の冒頭でオフポリシーRLのもう一つの根本的な課題は、という文脈で書かれているため)、SFTの議論がオフポリシーRL全体につながるのかがわからず、モヤっとする。が、LLMのpost-traingではCatrastrophic Forgettingが問題であるという文脈であれば理解できる)
- また、on-policyな学習ではエラーの蓄積を線形に留めることができることが示されている(off-policyな手法ではポリシーが生成したデータで訓練されていないため、inference時の冒頭でミスをすると学習時に観測していないトークンスペースを扱わなければならなくなり、さらにミスが増えモード崩壊に陥る)。
- on policy distillationは直接的にこのexposure biasのgapを小さくする。すなわち、学習時のinput(教師モデルが生成)と推論時のinput(生徒モデルが生成)の分布のgapを縮める。
- 生徒は学習時に常に自身の出力に基づいて学習するため、学習時のprefixと推論時のprefixの傾向が一致しやすい。このため生成時にエラーが起きてもin-distributionとなるため、エラーの蓄積が低減される。
以後はon policy distillation, on policy self-distillationの最新研究のサーベイと動向について記載されている。
関連:
- [Paper Note] Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting, Howard Chen+, arXiv'25, 2025.10
- [Paper Note] RL's Razor: Why Online Reinforcement Learning Forgets Less, Idan Shenfeld+, ICLR'26
- Multi-Teacher On-Policy Distillation: A New Post-Training Primitive, Yumo Xu, 2026.04
後半のサーベイパートなどで記述があったのかもしれないが、OPDでは、GRPOなどで主流なRLVRなどと比較して、報酬のシグナルがdenseであるという点も押さえておきたい。
Synthetic Persona Pretraining: Alignment from Token Zero, Minder+, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Alignment #SyntheticData #Blog #Reasoning #Safety #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-25 Comment
元ポスト:
**事前学習の時点で**Harmful/良性/ニュートラルな文書にReflectionに関するassistantの思考過程(何が間違っていて/間違っていなくて、それはなぜか)をappendすることで、道徳的に推論することを学ぶ。
[Paper Note] Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
Paper/Blog Link My Issue
#Article #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #Mathematics #Test-Time Scaling #PostTraining #RLVR #Verification #Physics Issue Date: 2026-05-21 Comment
pj page: https://simplified-reasoning.github.io/SU-01/
元ポスト:
ポイント解説:
Pedagogical RL: Teaching Models to Teach Themselves from Privileged Information, Chakraborty+, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #ReinforcementLearning #PostTraining #CurriculumLearning #PRM #On-Policy #SelfDistillation #Author Thread-Post Issue Date: 2026-05-21 Comment
元ポスト:
Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #ScientificDiscovery #One-Line Notes #Author Thread-Post Issue Date: 2026-05-21 Comment
元ポスト:
nanogpt speedrun
- Modded-NanoGPT, KellerJordan, 2024.05
autoresearchをnanogpt speedrun (Track 3)で実施したところ、人間の最高記録を上回ることに成功した。この記録は既存のアイデアの組み合わせや、ハイパーパラメータの探索などによって等のもたらされた。一方で、完全に新規のアイデアの創出し改善するには上流にいる人間のヒントが必要となる弱点があることも浮き彫りになった。
AI Agentごとに挙動の性質が異なりOpus(Claude Code)は自律的なループを停止してしまったり、GPT(Codex)は自律的なループが止まることはないものの、同じハイパーパラメータを何度も繰り返し探索するなどの現象も見受けられた。
関連:
Violin: An open-source video translation skill that breaks language barriers, together.ai, 2026.05
Paper/Blog Link My Issue
#Article #MachineTranslation #LanguageModel #AIAgents #Blog #3D (Video) #AgentSkills #SpeechToSpeech Issue Date: 2026-05-21 Comment
元ポスト:
demo:
https://www.violin-ai.com/
github:
https://github.com/shang-zhu/violin
Ring-2.6-1T, inclusionAI, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #OpenWeight #Author Thread-Post Issue Date: 2026-05-21 Comment
元ポスト:
Introducing Command A+: Making sovereign agentic capabilities available to all, Cohere, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #Reference Collection #Initial Impression Notes Issue Date: 2026-05-21 Comment
元ポスト:
HF:
https://huggingface.co/CohereLabs/command-a-plus-05-2026-w4a4
apache-2.0
デコーディング速度が非常に速い
アーキテクチャサマリ:
-
-
翻訳性能高いよという話のようである:
MemEx: A Programmable Scratchpad for LLM Agents, Databricks, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #read-later #ContextEngineering Issue Date: 2026-05-20 Comment
元ポスト:
元ポスト:
Composer 2.5 の紹介, Cursor, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #SyntheticData #Optimizer #mid-training #On-Policy #One-Line Notes #Reference Collection #SelfDistillation Issue Date: 2026-05-20 Comment
元ポスト:
- trajectory中の不適切な箇所にヒントを挿入したcontextを用いたself-on-policy distillation
- Composer 2から25倍の量の合成タスクデータの利用。タスクは特定のテスト可能な機能をコードベースからablationすることによってverifiableなタスクを作成
- mid-trainingではMuonを利用し、expertが複数のノードにシャーディングされているため、all-to-allと呼ばれる処理によって重み行列全体を復元しMuonの直行化を実施し、同じくall-to-allという処理で重みを再びシャーディングするらしい。これらは非同期で実行される。
- dual mesh HSDPと呼ばれるものも利用されているようだがよくわかっていない
関連:
- Composer 2 のご紹介, Cursor, 2026.03
artificial analysisによる評価:
所見:
学習の規模感に関する所見:
所見:
Gemini 3.5: frontier intelligence with action, Google, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Proprietary #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-05-20 Comment
Artificial Analysisによる評価:
賢い上にデコーディングが高速で今の所非常に使い勝手が良い
Gemini Omni を発表, Google Japan Blog, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #SpeechProcessing #Blog #Proprietary #VideoGeneration/Understandings #Omni Issue Date: 2026-05-20 Comment
元ポスト:
Reliable Reasoning, Naoto Iwase, 2026.05
Paper/Blog Link My Issue
#Article #Survey #LanguageModel #Blog #Reasoning #read-later #Author Thread-Post Issue Date: 2026-05-20 Comment
元ポスト:
ZAYA1-VL-8B: Efficient Open Visual Intelligence, ZYPHRA, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #SmallModel #OpenWeight #MoE(Mixture-of-Experts) #VisionLanguageModel #One-Line Notes Issue Date: 2026-05-12 Comment
HF: https://huggingface.co/Zyphra/ZAYA1-VL-8B
元ポスト:
画像トークンには双方向のattentionを適用できるようなアーキテクチャを採用
Investigating the consequences of accidentally grading CoT during RL, OpenAI, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Chain-of-Thought #Monitorability #Author Thread-Post Issue Date: 2026-05-12 Comment
元ポスト:
Marco-MoE: A suit of multilingual MoE models with highly-sparse architectures, AIDC-AI, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #CurriculumLearning #One-Line Notes Issue Date: 2026-05-12 Comment
元ポスト:
4 stageのカリキュラムによって学習されているようで、学習が進むにつれて、広く使われる英語やreasoning, instructionなどのデータは減らし、low resourceな言語のデータを増やしていき最終的にマルチリンガルなデータを支配的にするような学習レシピとなっているようである。
Aurora: A Leverage-Aware Optimizer for Rectangular Matrices, Tilde Research, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Optimizer #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-05-12 Comment
元ポスト:
nanoGPT speedrunのSoTAを更新したoptimiserのようである。
Teaching Claude why, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #Reasoning #Safety #PostTraining #KeyPoint Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-12 Comment
元ポスト:
- [Paper Note] Agentic Misalignment: How LLMs Could Be Insider Threats, Aengus Lynch+, arXiv'25, 2025.10
のように自身を守るために脅迫メールを送るような挙動が観測されたが、それをなくすことができたという話のようである。
細かい学習データのサンプルなどは記載されていないように見えるが
- 評価時のシナリオと類似したもので正しい挙動を教え込むような方法は、評価のスコアは改善するが、OODに対応できない
- モデルに行動を教えるのではなく、理由を教えることが重要で、これはモデル自身が倫理観に関するジレンマに置かれた状況を解決するというデータではなく、ユーザが倫理的なジレンマを抱えているというシナリオで、モデルが倫理的に塾講された思慮深いアドバイスをするようなデータ(difficult advice dataset)で学習することが非常に効果的であった。
- これは単に正しい答えを教えるのではなく、倫理的な"思考"を教えるため効果的であり、これをさらに発展させ、Claudeの人物像をより詳細に与えることでペルソナをより模範的なものに更新する、具体的には質の高いConstitutionに関する文書と、模範的なAIに関するフィクションの物語を学習させることで、misalignmentを非常に効果的に抑制できることを発見した
という感じだろうか。
トップダウンに正解を教えるのではなく、ボトムアップに根源的に正しい思考過程を誘発するような情報を教える(ある種のPRMのようなものだと思われる)ことで、高い汎化性能を獲得できるということだと思われる。このアプローチは最近のAI Agentにおけるoutcome basedなreward設計などにも一石を投じるような議論に感じる。学習の結果得られる汎化性能を重視していかないと、データセットやEnvironmentを逐一構築して課題を潰していく必要があり、キリがないと思う。
EMO: Pretraining mixture of experts for emergent modularity, Ai2, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Routing #Initial Impression Notes Issue Date: 2026-05-11 Comment
元ポスト:
従来のMoEモデルを学習する際には全てのトークンが全てのexpertsに対してroutingされるため、能力のごく一部しか必要ないにもかかわらず、experts全体をデプロイする必要があり効率が悪かった。本研究では、MoEモデルを学習する際に、ドキュメント単位で8個のshared experts poolに対してのみtokenがroutingされるように制約することで、特定のexpertsの集合が特定のドメインのexpertsとなることが奨励されmodularityが高まり、必要なexpertsのみをデプロイすることで効率化が図れるようになるので嬉しい、といった話に見える。
Pushing the Frontier for Data Agents with Genie, Databricks, 2026.05
Paper/Blog Link My Issue
#Article #Multi #LanguageModel #AIAgents #Test-Time Scaling #Data Issue Date: 2026-05-11 Comment
元ポスト:
Raven Part-1 - Memory as a set of Slots, Afzal+, Goomba Lab, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #SSM (StateSpaceModel) #read-later #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment
元ポスト:
元ポストのGIFがわかりやすく、SSMにおけるStateの更新をgatingによって選択的に実施するモデル、という感じだろうか。これによりSSMの弱点であった、long contextにおけるrecall-heavyなタスクにおいてより高い性能を獲得する。
Advancing voice intelligence with new models in the API, OpenAI, 2026.05
Paper/Blog Link My Issue
#Article #SpeechProcessing #Reasoning #MultiLingual #Proprietary #TTS #Realtime #Author Thread-Post #SpeechToSpeech Issue Date: 2026-05-10 Comment
元ポスト:
GPT-Realtime-2
Natural Language Autoencoders: Turning Claude’s thoughts into text, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Explanation #Safety #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment
LLM内の数値情報として保持されるactivationの情報をテキストで説明させる技術 Natural Language Autoencoeder (NLA) で、従来のSparseAutoencoderを用いたProbingなどとは異なり、より直接的にテキストによってactivationの情報を出力させる。
手法はシンプルで、autorncoderを用いて、target modelのactivationに関する情報が入力されたときに、
- Activation Verbalizerが、activationを説明するテキストを生成し
- Activation Reconstructorが、生成された説明テキストから元のactivationを復元する
- Activation Verbalizer/Reconstructorをreconstruction lossによって学習する
というもののようである。
このような手法はAI safetyの分野などで活用することができ、たとえば、Opus 4.6はBlackmail testingにおいて、context中でそのような情報を明言していないにも関わらず、NLAによるverbalizationによってそのような疑念を抱いていることが示唆される。
元ポスト:
所見:
Automated Weak-to-Strong Researcher, Wen+, Alignment Science Blog, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #AIAgents #Safety #ScientificDiscovery #Initial Impression Notes Issue Date: 2026-05-10 Comment
元ポスト:
Alignmentを自動で研究
Releasing Lab: the training platform for self-improving agents, PrimeIntellect, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #SelfImprovement Issue Date: 2026-05-09 Comment
元ポスト:
betaからついにリリース
関連:
- Introducing Lab: The Full-Stack Platform for Training your Own Models, Prime Intellect, 2026.02
ここまでおよそ1年らしい?
Accelerating Gemma 4: faster inference with multi-token prediction drafters, Google, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #Decoding Issue Date: 2026-05-08 Comment
関連:
- Gemma 4: Byte for byte, the most capable open models, Google, 2026.04
元ポスト:
MolmoAct 2: An open foundation for robots that work in the real world, Ai2, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #Reasoning #OpenWeight #OpenSource #read-later #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-08 Comment
元ポスト:
関連:
- [Paper Note] MolmoAct: Action Reasoning Models that can Reason in Space, Jason Lee+, arXiv'25
dataset:
https://huggingface.co/collections/allenai/molmoact2-datasets
models:
https://huggingface.co/collections/allenai/molmoact2-models
著者ポスト:
著者ポスト2:
著者ポスト3:
The ultimate guide to RL environments: building and scaling them in the LLM era, HuggingFace, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #ReinforcementLearning #Blog #PostTraining #read-later #Selected Papers/Blogs #Environment Issue Date: 2026-05-08 Comment
元ポスト:
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #LongHorizon Issue Date: 2026-05-08 Comment
元ポスト:
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
Paper/Blog Link My Issue
#Article #LanguageModel #Supervised-FineTuning (SFT) #PostTraining #Copyright Issue Date: 2026-05-08 Comment
元ポスト:
Multi-Teacher On-Policy Distillation: A New Post-Training Primitive, Yumo Xu, 2026.04
Paper/Blog Link My Issue
#Article #Multi #Tutorial #LanguageModel #ReinforcementLearning #Blog #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #One-Line Notes Issue Date: 2026-05-08 Comment
元ポスト:
(multi teacher)オンポリシー蒸留の解説を、気持ち(何かに特化させると、他の部分が劣化していて、多方面に優れたモデルを学習するのが難しい課題を克服したい)だけでなく、
GRPOに対してAdvantage部分を生徒と教師モデルのreverse KLに置き換えることで統合できるよ、という説明と、
なぜreverse KLを使うのかという説明[^1]、
最近の最先端のOpenLLMにおいてmulti teacher オンポリシー蒸留がどのように使われているかが丁寧に説明されている。
[^1]: forward KLだと教師が少しでも確率を持つトークンにおいて生徒の確率が0だと発散するのでスムージングされた分布になってしまい、特定のトークンにフォーカスした分布が形成されづらく、テキスト生成の多峰性と(意味不明な出力をできるだけ回避するという意味での)安全性の観点からreverse KLの相性が良いよ、という話)
関連:
- 【LLM】On-Policy Distillation入門:小規模モデルを「実戦」で育てる技術, Currently Learning そんけいご, Zenn, 2026.02
解説と所見:
【LLM】On-Policy Distillation入門:小規模モデルを「実戦」で育てる技術, Currently Learning そんけいご, Zenn, 2026.02
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #Reading Reflections Issue Date: 2026-05-08 Comment
直感的な説明だけでなく、数式ベースの説明、RLとの比較などがコンパクトにまとまっておりとてもわかりやすかった...!!勉強になりました
Autodata: an automatic data scientist to create high-quality data, Ilia+, 2026.05
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Author Thread-Post Issue Date: 2026-05-06 Comment
元ポスト:
AgentTrove, open-thoughts, 2025.12
Paper/Blog Link My Issue
#Article #Dataset #LanguageModel #AIAgents #Coding #Mathematics #SoftwareEngineering #ComputerUse #One-Line Notes Issue Date: 2026-05-06 Comment
元ポスト:
219のデータソースに対する170M規模のcoding, terminal/computer use, mathに関するagentのtrajectory。trace自体は、Agentic HarnessとしてTerminus 2を用いたOpenThinker-Agent-v1によるものだと推察される。
Grok 4.3, xAI, 2026.05
My Issue
#Article #LanguageModel #Proprietary Issue Date: 2026-05-02 Comment
元ポスト:
Artificial Analysis IndexではKimi-K2.5, Mimo-V2.6 Pro未満のスコア
500Bモデルらしい?:
OlmPool: How small architectural choices compound to undermine long context extension, Ai2, 2026.04
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Transformer #Attention #LongContext #Architecture #read-later #Selected Papers/Blogs #One-Line Notes #ContextRot #Author Thread-Post Issue Date: 2026-05-01 Comment
元ポスト:
QK Norm, GQA, SWA, 事前学習のcontext長の短縮、これらはいずれもモデルが入力に対するattendの仕方を変えるものだが、これらを3つ以上組み合わせるとlong contextでの性能が急落するらしく、このようなlong contextの性能劣化は一般的な(しばしば短い)コンテキスト長のベンチマークやloss/perplexityなどでは検知できず、long contextで性能が急落するアーキテクチャでは、50Bトークンでのlong contextの学習を経ても、Llamaアーキテクチャが1Bトークンの学習で到達できる性能に届かない、といった話が元ポストに書かれている。
Cosmos-Reason2-32B, Nvidia, 2026.04
Paper/Blog Link My Issue
#Article #Reasoning #OpenWeight #VisionLanguageModel #Robotics #EmbodiedAI Issue Date: 2026-05-01 Comment
元ポスト:
Qwen-Scope: Decoding Intelligence, Unleashing Potential, Qwen Team, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #SparseAutoencoder #Interpretability Issue Date: 2026-05-01 Comment
元ポスト:
Scaling Pain of Coding Agent Serving: Lessons from Debugging GLM-5 at Scale, Z.ai, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #Infrastructure #LLMServing #SoftwareEngineering #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-30 Comment
GLM-5をサービングしている中でのバグ(モデル側ではなくインフラ側)の発見と修復
Mistral-Medium-3.5-128B, MistralAI, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight Issue Date: 2026-04-30
Laguna XS.2 and M.1: A Deeper Dive, Poolside team, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Coding #OpenWeight #MoE(Mixture-of-Experts) #SoftwareEngineering #read-later #Selected Papers/Blogs #LongHorizon #Author Thread-Post Issue Date: 2026-04-30 Comment
HF: https://huggingface.co/poolside/Laguna-XS.2
元ポスト:
テクニカルレポート:
https://poolside.ai/assets/laguna/laguna-m1-xs2-technical-report.pdf
元ポスト:
Vintage Large Language Models, Owain Evans
Paper/Blog Link My Issue
#Article #LanguageModel #read-later #Selected Papers/Blogs #vintage LLMs Issue Date: 2026-04-29 Comment
過去の特定の時刻までのデータで学習された大規模言語モデル, vintage Large Language Modelsを提唱
Introducing talkie: a 13B vintage language model from 1930, Levine+, 2026.04
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #read-later #Selected Papers/Blogs #Initial Impression Notes #vintage LLMs Issue Date: 2026-04-29 Comment
元ポスト:
1930年以前の英語テキストで学習された言語モデル(vintage Large Language Models)で、歴史や文化の変化を分析したり、1930年までのデータで学習されたモデルが1931年以後に発見された革新的な科学的な発見を自ら見出せるか?、LLMが将来を予測する能力がどの程度あり、それがモデルサイズによってどのように変化するか?、プログラミングに関する知識がないモデルが現代のコーディングを学習できるかなどのcontamination freeな評価など様々な活用方法があるとのこと。
関連:
- Vintage Large Language Models, Owain Evans
所見:
HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Attention #Blog #KeyPoint Notes #KV Cache #SparseAttention Issue Date: 2026-04-28 Comment
元ポスト:
SparseAttentionはattention計算をする際にtop-kのトークンのみを用いて計算する手法であり、token単位でactivateされるKV Cacheを減らすことができるが、top-kで選択されたトークンのKV Cacheに対して迅速にアクセスをしなければならないためHBM上にKV Cacheを全てロードしておかなければならない。このため、memory-boundな処理になりがちである。このような場合、同時アクセス数が増えたときに、HBMが飽和して、一定サイズの同時アクセスを超えるとスループットが向上しなくなる課題がある。
これを克服するために、HiSparseと呼ばれる手法を提案している。具体的には、頻繁にアクセスされるKV CacheのみをHBM上に置いておき、使わないものはホストメモリにオフロードしておき必要に応じてswapするというものである。top-kのトークンとしてどれが必要か、それがHBM(バッファ)上に存在するか、存在しない場合はLRUでホストメモリとバッファのエントリをswapするといった操作を高速で実現するカーネルに基づいて、効率的に実施されるようである。
smol-audio, Deep-unlearning, 2026.04
Paper/Blog Link My Issue
#Article #Tutorial #SpeechProcessing #Repository #Finetuning #TTS #AudioLanguageModel Issue Date: 2026-04-28 Comment
元ポスト:
pyptx: A Python DSL to write Nvidia PTX for Hopper and Blackwell in JAX and PyTorch, patrick-toulme, 2026.04
Paper/Blog Link My Issue
#Article #NeuralNetwork #EfficiencyImprovement #LanguageModel #python #SoftwareEngineering #GPUKernel Issue Date: 2026-04-27 Comment
元ポスト:
pythonの記法で、PTX(どの世代のNVIDIA GPUでも理解可能な仮想的なアセンブリ言語)を記述可能で自動最適化は一切入らないDSLとのこと。
PTXについては以下を読んだ:
PTXってなんだ?〜GPUの「共通語」仮想アセンブリを完全理解〜,GeneLab_999, 2026.01
https://qiita.com/GeneLab_999/items/5c49a21e5fd7e618b671
Project Deal, Anthropic, 2026.04
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #Personalization #read-later #One-Line Notes #Sales Issue Date: 2026-04-26 Comment
元ポスト:
AI同士が商取引をしたら何が起きるかという社内実験のようである。69人の社員に何を売りたいか/買いたいををインタビューし、カスタム指示が与えられた上でAI Agentに取引をさせたところ、きちんと商取引が行われ、186件、$4000のやりとりがあったとのこと。そして賢いモデルが大幅に有利に取引を終えて、実際の参加者はこの事実に気づかなかったとのこと。また、カスタム指示(e.g., 強行姿勢, 礼儀正しいなど)はあまり良い成果を上げる上では重要ではなかった、
といった話が元ポストに書かれている。
