NLP (4152) — 16/21


Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Optimizer #read-later Issue Date: 2026-08-06 Comment

元ポスト:

Loading…

Muonよりもさらに高性能なoptimiserのようである。

関連:
- [Paper Note] Shampoo: Preconditioned Stochastic Tensor Optimization, Vineet Gupta+, ICML'18, 2018.02
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01




Paper/Blog Link My Issue
#Article #ComputerVision #AIAgents #Planning #VisionLanguageModel #3D (Scene) #SpatialUnderstanding #One-Line Notes #LongHorizon Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

3D空間において、カメラアングルの移動とブロックの移動をすることで実施可能なパズルゲームによる新たなベンチマークで、視覚的・空間的な推論能力と、長期のplanning能力を評価する。




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #GenerativeAI #Blog #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。

このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?




Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #Evaluation #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

Vision系の新たなベンチマーク。42種類のベンチマークのフロンティアモデルが失敗する事例に基づいて評価対象とするatomicな能力を定義し、それらのatomicなスキルを独立して評価可能なサンプルを作成し評価するベンチマーク。サンプルは与えられた情報のみから、評価対象とするatomicな能力を駆使すれば成功できるverifiableなタスクとして定義されているようである。能力ごとにモデルのスコアが算出可能。

実例としては、たとえば、魚が泳いでいる複数の池のイラストが与えられて、真ん中の池には何匹の魚がいる?といったクエリに応答するなどである。これには localization の能力が求められる(Countingも必要な気がするが)。




Paper/Blog Link My Issue
#Article #Tools #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Initial Impression Notes #Environment #Author Thread-Post #SandboxEnvironment Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

大規模、かつ高速にAgentic RLのためのサンドボックス環境をself-hosting可能な実装

下記ポストに速度やKimi K3で利用された時の環境の規模感が記述されているので参照のこと:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #One-Line Notes Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

アーキテクチャ解説:

Loading…

所見:

Loading…


DeepSeek-V4 Pro, MiniMax M3等のモデルと同等程度のスコアの314B-A13Bモデル。
Grouped Differential Latent Attention (GDLA), Grouped PolyNorm activation と呼ばれる(おそらく本モデル独自の)技術を利用している。




Paper/Blog Link My Issue
#Article #LanguageModel #Blog #One-Line Notes #Author Thread-Post Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、

Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、

Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善

このようなパイプラインを実現するmeta optimiser-omniを実装している。

関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03




Paper/Blog Link My Issue
#Article #ComputerVision #VideoGeneration/Understandings #Robotics #EmbodiedAI #WorldActionModel Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

FLUX3をベースに構築されたVision Action Model

- 大規模な動画生成モデルをバックボーンとすることで、ロボットのActionの予測をVLAと比較して最大10倍のデータ効率で実現
- 動画生成バックボーンの性能が向上すれば、Video Action Modelの性能もそれに伴い向上することが示唆される

関連:
- [Paper Note] mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs, Jonas Pai+, arXiv'25, 2025.12




Paper/Blog Link My Issue
#Article #LanguageModel #Evaluation #Post #read-later #Initial Impression Notes #RewardSeeking Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07

Kimi K3における、評価されていると認識した上で評価作成者の意図の検討や、reference solutionに関する検討をするなど、ベンチマークに過度に最適化されているような挙動を示す現象に関する検討な模様。

関連:
- [Paper Note] Measuring Reward-Seeking via Contrastive Belief Updates, Axel Højmark+, arXiv'26, 2026.07




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。

nanogpt speedrunを通じた分析結果なども載っている。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs Issue Date: 2026-08-02 Comment

Artiflcial Analysisによる評価:

Loading…


GLM-5.2, Muse Spark 1.1, Gemini3.6-Flash, GPT-5.6-lunaと同等程度のスコアにもかかわらず、スコアに対するパラメータ比率で圧倒的にパレート最適に位置付けられる。

関連:
- [Paper Note] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, DeepSeek-AI+, arXiv'26, 2026.04

Epoch Capabilities IndexでOpenWeightモデルでKimi K3に次ぐ2位、全体でOpus 4.6に次ぐ7位

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #AIAgents #Blog #Safety #LongHorizon #Security #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。

関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07




Paper/Blog Link My Issue
#Article #ComputerVision #Blog #SmallModel #OpenWeight #VisionLanguageModel #Robotics #WorldModels #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

HF: https://huggingface.co/nvidia/Cosmos3-Edge?linkId=100000431533162

autoregressive -> diffusion の two-tower モデル

Cosmos3 テクニカルペーパー:
- [Paper Note] Cosmos 3: Omnimodal World Models for Physical AI, NVIDIA+, arXiv'26, 2026.06




Paper/Blog Link My Issue
#Article #Survey #LanguageModel #AIAgents #LongHorizon #Author Thread-Post Issue Date: 2026-07-31 Comment

pj page: https://long-horizon-agents.github.io/

元ポスト:

Loading…

とても良さそう。とんでもない量だ。。。Open Problemsのところは非常にコンパクトで明快

github: https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents




Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #LanguageModel #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #MultiLingual #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/nvidia/nemotron-3-embed

LLMベースのretrieval, STSタスク特化のembeddingモデルで、最大32k contextをサポート。多言語対応している。

RTEB Multilingualと呼ばれるベンチマークでSoTA:
https://mteb-leaderboard.hf.space/benchmark/RTEB(beta)

- Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10

解説:

Loading…


Autoregressiveなモデルをbidirectionalなattentionに変換した上で、contrastive learning+高品質データでFinutuning。小規模モデルの作成には、pruning, NAS, 蒸留を2回繰り返すことで実現。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Library #Tokenizer Issue Date: 2026-07-26 Comment

元ポスト:

Loading…

所見:

Loading…


どうやら、上記所見によると
- 与えられた文字列に対して正規表現を適用し、あらかじめ単語の境界を決める処理(pretokenize)を、
- SIMD命令(1つの命令を同時に複数のデータに対して適用;各バイトがどの文字クラスに属するかを判定する)と、
- ビット演算(文字クラスの判定結果に対して、シフトにより境界判定に必要な過去の文字クラス情報を構成し、シフト前後の系列に対するビット演算によりtokenizerの境界判定処理を実装みたいなことをやっているらしい)によって実現
- short pretokenに対するBPEをキャッシュする

という二段構えで高速化が実現されているようである。

---
参考:
- C++ SIMD命令入門(初心者向け), ancienthawk, 2025.08:
https://zenn.dev/ancienthawk/articles/for_simd_beginner_cp
- ゼロから作るLLM Part1: BPEトークナイザーの実装, so_dev000, 2025.11: https://qiita.com/so_dev000/items/037a21cba4e52182daea




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #SmallModel #Selected Papers/Blogs #Initial Impression Notes #Orchestration Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

HF: https://huggingface.co/dari-ai/router-slm

Sakana FuguのようなLLMプールの中からターン単位で適切なLLMを選択するオーケストレータ(ルータ)で、QwenのLoRA Weightとして学習された重みが公開されているようである。

関連:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
- Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #DiffusionModel #Blog #Proprietary #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。

Artificial Analysisによるoutput speed評価で1位:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分

いよいよベンチマークではClaude一強という感じになってきた:

Loading…

Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07

Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07

脆弱性を検知する能力が高い:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #DiffusionModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-25 Comment

HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash

元ポスト:

Loading…

LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。




Paper/Blog Link My Issue
#Article #Pretraining #Dataset #LanguageModel #Blog #Coding #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment

元ポスト:

Loading…

114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。

また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。

Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24

所見:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Blog #Selected Papers/Blogs #Live #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment

元ポスト:

Loading…

Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。

タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。

Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#Article #ComputerVision #Evaluation #Blog #ComputerUse #VisionLanguageModel #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-24 Comment

元ポスト:

Loading…

エンタープライズ向けのサービスに基づく専門家の操作に基づくbrowser-useベンチマークのようである。ざっくりブログを読んだが実際にどのようなサービスなのか知らないためあまりよくわからなかったので、公開されているベンチマークを見る方が直感的な理解は捗りそう。

本ベンチマーク上では、GLM-5.2がOpenWeightモデルの中では最も性能が高いようである。




Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #AIAgents #Evaluation #Blog #Safety #Attack #Video #Selected Papers/Blogs #Security Issue Date: 2026-07-22 Comment

Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026

元ポスト:

Loading…

video: https://youtu.be/87DyyMV0kCY

関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11

所見:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #MultiModal #Blog #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/prism-ml/bonsai-27b

Bonsaiシリーズ:
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
- Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
- Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05

1-bit, ternary weightによって、27B級モデルがエッジデバイス上で動作する。




Paper/Blog Link My Issue
#Article #Tools #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #One-Line Notes #TrainingFramework Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

ハイパフォーマンス、かつminimalな実装のRLライブラリで、研究用のハックがしやすいフレームワーク。verlの1/9, Slimeの1/3の行数で実現されているとのこと。

verl:
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04

Slime:
- slime, THUDM & Zhihu, 2025.09




Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #AIAgents #MultiModal #Proprietary #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

Muse Spark:
- Introducing Muse Spark: Scaling Towards Personal Superintelligence, Meta, 2026.04

大幅にAgenticな能力やコーディング能力が向上。Agenticな能力では多くのベンチマークでOpus4.8超え、CodingはGPT-5.5にベンチマーク上では及ばず(SWE Bench Proでは勝っているが、OpenAIから30%以上のpromptが評価で不適切との報告があった Separating signal from noise in coding evaluations, OpenAI, 2026.07 )。

Alexandr Wang氏によるポスト:

Loading…




Paper/Blog Link My Issue
#Article #Controllable #LanguageModel #Blog #Reasoning #Length #read-later #Initial Impression Notes Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

OpenAIのReasoning Effortについては調整方法が公開されていないのでGPT-OSSのテンプレートなどから可能な方法を推測、そのほかOpenWeightモデルについてはテクニカルレポートに記載されている情報からReasoning Effortの調整方法が解説されている




Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #reading #One-Line Notes #Reference Collection Issue Date: 2026-07-17 Comment

元ポスト:

Loading…

Artificial Analysisによる評価:

Loading…


Artificial Analysis IndexでOpus 4.8超え!?

各ブロックの出力を重みつきで足し合わせることで柔軟にどのブロックにattendするかを決定するattention residualと呼ばれる技術が導入されているように見える。

また、MoEのexpert数をスケールさせ、896 experts, 16 activated expertsに変更。

学習レシピの洗練化と合わせてK2との比較で2.5倍のスケーリング効率が改善され、投入した計算コストをより効果的に知能に変換しているとのこと。
image

やはり
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05

でも示されているようにexpert数を増やすのが今のところ良さそうに見える。

どうやら2.8Tモデルらしい:

Loading…

design arenaでFable5超えのSoTA:

Loading…

writingに関するベンチマークでSoTA:

Loading…

Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01

KDA
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10

Linear TransformerとDelta Net
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02

所見:

Loading…

Latent MoEによってこれほどのsparsityを実現できているのではという所見:

Loading…

GDPValでも3位:

Loading…

Kernel optimizationにおいてもFable5と同等性能という報告:

Loading…

Next.jsのコーディングベンチマークでもFable5超えのSoTAとのこと:

Loading…

DeepSWEでGPT-5.6-sol, fable5に次ぐ3位:

Loading…

アーキテクチャを公開されている情報から再構築した図:

Loading…


公式ブログの図ではValueにはConvがかかっていないように見えたが、はたして。

テクニカルレポート:
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

HF: https://huggingface.co/moonshotai/Kimi-K3

Loading…

アーキテクチャのポイント:

Loading…

テクニカルレポートまとめ(スレッド):

Loading…

解説スレッド:

Loading…

解説:

Loading…

関連:
- AgentENV, kvcache-ai, 2026.07
- MoonEP, MoonshotAI, 2026.07
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- MoonViT
- [Paper Note] Kimi-VL Technical Report, Kimi Team+, arXiv'25

KDAの更新ルールに位置情報が直接エンコードされるためRoPEを必要としない:

Loading…

WSDよりもcosine decayの方が一貫して優れていた...?どういう条件の実験だろうか:

Loading…


- [Paper Note] MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies, Shengding Hu+, COLM'24

Quantile Balancingについて理解したい




Paper/Blog Link My Issue
#Article #ComputerVision #LanguageModel #MultiModal #SpeechProcessing #Blog #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #AudioLanguageModel #Author Thread-Post Issue Date: 2026-07-16 Comment

HF: https://huggingface.co/thinkingmachines/Inkling

元ポスト:

Loading…

THINNING MACHINESによる最初のOpenWeightモデル。975B-41B

- フルスクラッチで学習したReasoningモデル
- 1M context window
- text, image, audio, video 45Tトークンで学習
- バランスよくさまざまな領域で性能を発揮するように訓練し、Tinker上でのfinetuningやカスタマイゼーションの良い基盤として機能することを目指した
- vision, audioドメインに関してはencoder freeアーキテクチャを採用
- audio signalの入力は dMel spectrogramsと呼ばれる手法を採用
- [Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
- 画像は40x40のパッチに分割され、4つのhMLPと呼ばれるレイヤーでエンコーディング
- [Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
- IFの訓練には、Rubric basedなgraderとclaims graderの2種類のgraderを用いることで、helpfulnessとhallucinationを同時に低減
- Rubric basedなgraderはチェックリストに基づいてスコアリング
- claims graderはfactualな主張をagentic web searchを通じてverificationする
- アーキテクチャはDeepSeek V3を踏襲し、256のexpertsと2つのshared expertを採用し、6つのexpertsがactivateされる
- SWAとGlobal attentionの比率は5:1でKV Headは8つ (GQA)
- **相対位置エンコーディングを用いることでRoPEよりもlong contextに対してより高い外挿性能を示した**
  - [Paper Note] Self-Attention with Relative Position Representations, Peter Shaw+, NAACL'18
- K, Vのprojection後、**およびattentionとMLPが残差ストリームに合流する前にshort convolutionを導入**
- QKV projection後に convolution を導入するアーキテクチャは下記研究で提案
- [Paper Note] Primer: Searching for Efficient Transformers for Language Modeling, David R. So+, NIPS'21, 2021.09
- optimiserはMuonとAdamWのハイブリッドで、前者は巨大な行列の重みに対して適用し、そのほかは後者を利用
- 重み自体が多様体上に存在するように制約することが有効であったことに着想を得て、weight decayを学習率の2乗に連動させることでモデルの重みの大きさを安定させたとのこと
- Modular Manifolds, Jeremy Bernstein+, THINKING MACHINES, 2025.09
- [Paper Note] Why Gradients Rapidly Increase Near the End of Training, Aaron Defazio, arXiv'25, 2025.06
- 事後学習としては、まずKimi K2.5を含むOpenWeightモデルで合成データ上でSFTをし、その後合成、あるいは人間が作成したenvironment上で大規模なRLを実施
- RLは非同期RLを異様し、ロールアウト数に対して推論能力が対数線形にスケールした。
- 最終的に30Mロールアウト以上のRLを実施した
- システムメッセージを変更し、トークン単位のコストを調整することでreasoning effortを調整
- Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
- **276B-A12BのInkling-Smallもプレビュー段階にあり、agenticな能力においてInklingに近い性能を達成しており、今後公開予定**

1M context windowを実現した工夫は特に書かれていなかったように感じるが、よく使われるのはKV CacheをコンパクトにするためのSparse Attention、あるいはLinear Attentionなのに対し、本モデルでは使われていないように見える。linear attentionでなくとも、SWAとGlobal Attentionのハイブリッド、かつGQAによって、KV Cacheの肥大化を実用レベルで抑制できるのだろうか。また、外挿性能に関してはRoPEは採用せず、相対位置エンコーディングのを採用したという点が効いているのだろうか。1Mレベルでのcontextでの評価がなさそうに見えるので性能はよくわからない。

RoPEのlong contextでの限界を示した以下の研究を思い出した:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05

Artificial Analysisによる評価:

Loading…

アーキテクチャでの目新しい点:

Loading…

所見:

Loading…

公式:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Blog #OpenWeight #read-later #Interpretability #Initial Impression Notes Issue Date: 2026-07-12 Comment

元ポスト:

Loading…

38種類のOpenWeightモデルのlayer間でのJ-lensの類似性を検証したとのこと

アーキテクチャが異なっていても非常にモデル間で類似しているようである。gemma-4やSLM(Qwen, GPT2)などは外れ値を含む模様

関連:
- Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07




Paper/Blog Link My Issue
#Article #LanguageModel #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-10 Comment

元ポスト:

Loading…

GPT-5.6の変更点まとめ:

Loading…


Model Guidance: https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6

全体的に性能が高いだけでなく、コストパフォーマンスも良いという印象

コストパフォーマンス比:

Loading…

Terra Ultra並の性能が必要なければ、Lunaのreasoning effortを上げるのがコスパ良いという話:

Loading…

Lunaが80%の値下げでGPT-5.4-nanoよりも安くなった。触っている感じおそろしく安いくせに、非常に性能が高い。

Loading…


Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #SmallModel #Slide #One-Line Notes Issue Date: 2026-07-09 Comment

Phi-2のNeurIPSでの発表資料で、小さいスケールのLLMの学習済みの重みを、より大きなスケールのLLMの初期化に活用するweight reusinhgについて図解されている。実際にこの手法が説明されている文献は、スライド中で引用されている

- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12

であるため、そちらも併せて参照のこと。上記issueに手法について説明を記載した(正しく読み解けているか少し自信がない)。




Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #LongContext #OpenWeight #Reading Reflections #Author Thread-Post Issue Date: 2026-07-09 Comment

元ポスト:

Loading…

weight reusing:
- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
- The Surprising Power of Small Language Models, Mojan Javaheripi+, Microsoft Research, 2023.12

long context評価:
- [Paper Note] RULER: What's the Real Context Size of Your Long-Context Language Models?, Cheng-Ping Hsieh+, COLM'24, 2024.04
- [Paper Note] Repeat After Me: Transformers are Better than State Space Models at Copying, Samy Jelassi+, arXiv'24, 2024.02

HF: https://huggingface.co/pfnet/plamo-3-nict-2604-31b-base

YaRNを適用するとlong contextの性能が大きく改善し、事前学習で学習させるトークン数を増やしすぎるとYaRNのcontext lengthの外挿能力が低下するという実験結果が非常に興味深い。

記載がなかった気がするのだが、Sink Tokenの利用などはやっているのだろうか?

- [Paper Note] YaRN: Efficient Context Window Extension of Large Language Models, Bowen Peng+, ICLR'24




Paper/Blog Link My Issue
#Article #Dataset #LanguageModel #AIAgents #Evaluation #Blog #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-09 Comment

元ポスト:

Loading…

SWE-Bench Proの約30%にタスクが評価として機能しないタスクが含まれているとのこと(SWE-Bench Verifiedと同じ流れでは)。

これらは、5人の熟練なソフトウェアエンジニアによる監査と、AI Agentによる監査結果を人間がレビューするプロセスの2つを介して同定された。

以下のようなものがある:
- 過剰に制約されたテスト: 実装の制約が強すぎて機能として正しいのにテストが通らず、かつプロンプトでその制約が明示されていない
- requlrementが不足したテスト: プロンプトでの推測することができない要件の漏れ
- 低カバレッジのテスト: 実装が不完全でも通過するテスト
- ミスリーディングなプロンプト: テストが求める要件とは異なる挙動に向かわせるプロンプト

これにより、OpenAIは以前SWE Bench Proを推奨していたがそれを撤回するとのこと。

SWE Bench Verifiedでも同様の事案があった:
- Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02

そしてSWE Bench Verifiedにおけるコンタミネーションやテストの問題点を改善したSWE Bench Proを構築した、という経緯だったはずだが、そのSWE Bench Proでも問題が見つかったという流れである。

あと、そもそもSWE Bench Proで問題のなかった70%で評価したら現在のモデルのスコアはどうなるのだろうか?




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Selected Papers/Blogs #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment

元ポスト:

Loading…

関連:
- interpreting GPT: the logit lens, nostalgebraist, 2020.08

本文献の本旨であるJ-Spaceの定義、Global Workspace等の発見の話は元ポストを参照のこと。

以下、J-Lensについて元ポストを参考にメモする。
元ポストによると、logit lens

- interpreting GPT: the logit lens, nostalgebraist, 2020.08

と比較して、本文献で提案されているJacobi Lens (J-lens)は、ある中間層での残差ストリームにおける活性値の摂動が、最終層にどのような影響を与えるかを分析することで、当該中間層における残差ストリームがどのようなトークンを将来出力させる傾向にあるかを可視化する手法、とのことである。元ポスト中の具体例による説明が非常にわかりやすい。

logit lensは中間層の残差ストリームに対して、出力層を用いた線形変換を施して残差ストリーム内でどのようなトークンが想起されているかを可視化するが、J-lensは後段の層に与える影響を考慮して可視化する点が異なる。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-08 Comment

元ポスト:

Loading…

- Hy3-preview, tencent, 2026.04

の公開後から、50以上のプロダクトからフィードバックを受けより高品質なデータで事後学習を実施したとのこと。

- GLM-5.2: Built for Long-Horizon Tasks, Z.ai, 2026.06

が744B-A40B。Hy3は295B-A21Bなので、半分程度のパラメータ数でフロンティアモデルに近い性能を達成している。

公式:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #Blog #OpenWeight #Privacy #One-Line Notes #PII #Author Thread-Post Issue Date: 2026-07-08 Comment

HF: https://huggingface.co/nationaldesignstudio/rampart

生成AIに送信されるリクエストを検閲し、プロンプトに含まれる個人情報をマスクするよう訓練された軽量モデルのようである。ブログ下部のデモンストレーションを見るとイメージを掴みやすい。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 Comment

RLによる事後学習の際にtrainer側のoptimizerが1 step学習した後にinferenceエンジンに重みをpushするが、BF16でのRLにおける1 stepの更新では多くのモデルの重みに変化はなく(99%程度)、差分だけをpushすればlosslessで2桁程度trafficを削減できて、RDMAが不要でたとえばイーサネットベースのデータセンターを跨いだ環境でもRLが実行できそうだよ、という話のようである。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Architecture #read-later #ContextEngineering #One-Line Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-07 Comment

元ポスト:

Loading…

関連:
- Fusion Harness: How to combine a more expensive main model and a sidekick model, Graham Neubig, GithubGist, 2026.06

高価で高性能なメインエージェントがタスクを管理し、安価なサイドキックエージェントがメインエージェントからタスクを移譲され処理をするようなアーキテクチャによって、メインエージェントで処理した場合と同等の性能を発揮しつつコストを削減できる。
image

似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #ContextEngineering #MinimalCode #One-Line Notes #Author Thread-Post #AgentHarness #Gist Issue Date: 2026-07-07 Comment

元ポスト:

Loading…

openhands SDKを用いて、全体の管理を高性能で高価なメインエージェントにより実施し、個々の作業を安価なサブエージェントに移譲することで、コンテキストを管理しつつパイプライン全体のコスト削減を実施する実装

似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Article #LanguageModel #Library #MoE(Mixture-of-Experts) #PostTraining #Selected Papers/Blogs #Finetuning #reading #One-Line Notes #EfficientEvaluation #TrainingFramework Issue Date: 2026-07-05 Comment

わずか数行を追加するだけで、MoEモデルをマルチGPU環境でFinetuningする際のスループットが約3--4倍、メモリ使用量が30%程度削減されるライブラリ。既存のQwen, Nemotron, GPT-OSS, DeepSeek V3などの一般的なMoEアーキテクチャに対して、最適化済みの実装が提供されているとのこと。

image

repository: https://github.com/NVIDIA-NeMo/Automodel




Paper/Blog Link My Issue
#Article #LanguageModel #Blog #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 Comment

元ポスト:

Loading…

コードがプッシュされる前にエージェントの作業を評価する小型のcriticモデルと、プルリクエストに対してコードレビュー(スキルを利用)+QAを実施するシステム(実際にエントリーポイントを見つけ、動作させ、証跡を資料としてまとめてレポートをポストするシステム)によってコードの検証プロセスを効率化し、マージまでの時間が平均58%削減され、開発効率が向上する話のようである。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #VisionLanguageModel #One-Line Notes Issue Date: 2026-07-01 Comment

元ポスト:

Loading…

Artificial Analysisによる評価:

Loading…

SWE Bench ProのスコアはOpus 4.8とSonnet 4.8の中間程度

Opus 4.8よりも2倍程度生成されるトークンが長い傾向にあり、結果的にArtificial Analysisによる評価を実施する際にOpus 4,8よりもコストが高くついたとのこと:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #Blog #OpenWeight #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-30 Comment

元ポスト:

Loading…

- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD

HF: https://huggingface.co/meituan-longcat/LongCat-2.0

現在はまだ公開されていないがモデルは上記で公開予定

Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象

LongCat Sparse Attentionポイント解説:

Loading…

所見:

Loading…

Loading…


50k基のH800 GPUで学習されているとのこと。

所見:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-27 Comment

元ポスト:

Loading…

OpenAIによる新たなフロンティアモデルで、terminal benchでMythos 5, Fable 5超え。まずは少数のパートナーに提供し、その後数週間以内にGAを目指す、という感じらしい。

所見:

Loading…

ベンチマーク:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
- [Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
- CyScenarioBench: Evaluating LLM Cyber Capabilities Through Scenario-Based Benchmarking, IRREGULAR, 2026.06
- [Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
- [Paper Note] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale, Zhun Wang+, arXiv'25, 2025.06

サイバーセキュリティに関するベンチマークの報告が増えてきたなぁ




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #Test-Time Scaling #Initial Impression Notes #Reading Reflections #Orchestration Issue Date: 2026-06-23 Comment

元ポスト:

Loading…

所見:

Loading…

Opus 4.8, Gemini 3.1 Pro, GPT 5.5(他にもありそう)のオーケストレータ

beta:
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04

テクニカルレポート:
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06

v1.1になり、新たに公開されたフロンティアモデルをルーティングに加えることで性能向上:

Loading…


基本的に新たなモデルが公開されたらルーティングを更新すればFuguの性能も向上していくので、性能面でFrontier Modelに遅れをとる可能性は小さいと思われる。一方で、Fugu内部で商用APIを叩いた場合そのコストは他社のマークアップが上乗せされたものになると思うので、利用コストをどの程度抑えられるかがポイントになるだろうか。ただ、ターン単位で利用されるモデルが変更されるので、たとえばFable5を最も重要なプランニングで利用し、その後のフェーズではより安価なモデルを使う、といった柔軟なモデルの組み換えが可能なので、そこの最適化がされればタスクを完遂する際に特定の1モデルを利用するよりも結果的に安い可能性は高い。




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #Coding #read-later #Selected Papers/Blogs #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-22 Comment

2週間にわたるopen endなプログラミングコンテストのデータを用いて人間の専門家とAI AgentのElo ratingの変遷を比較すると、序盤は人間に対して大きくリードしスコアは試行回数の対数に対して線形にスケーリングし次第に停滞を始めるが、人間の専門家は4日を超えたあたりから非線形にスコアが進化し、最終的にAI Agentよりも高いスコアを記録する。人間はAI Agentと比較して、継続学習ができていることが示唆され、AI Agentのlong horizonタスクに対する能力の限界が示唆される、という話に見える。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Actor-Critic #OpenWeight #Selected Papers/Blogs #Reference Collection #Critic #LongHorizon #train-inference-mismatch #Initial Impression Notes Issue Date: 2026-06-16 Comment

HF: https://huggingface.co/zai-org/GLM-5.2

1Mコンテキストでフロンティアモデルには少し劣るが非常に高い性能。SWE Bench ProではGPT5.5をoutperform、Terminal Bench/DeepSWEなどでは3--12pt程度GPT5.5が高い。Opus4.8はさらにスコアが高い。

744B-A40B

元ポスト:

Loading…

Artificial Analysis Intelligence IndexでOpenWeightモデルでSoTA更新:

Loading…


MiniMax-M3超え

long Horizonのタスクの学習でGRPOではなく、criticベースのPPOを利用:

Loading…

アーキテクチャ解説:

Loading…

GLM 5.2では、Reward Hackingを検知した場合、ペナルティを与えるのではなく、ツール呼び出しをブロックしてダミー情報を返し、ロールアウト自体は継続させる。Reward Hackingをすると、ただ損をするという構造に近づけていると思われる。

Loading…

slimeフレームワークを用いることで10を超えるエキスパートモデルに基づくOPDを2日で終えたとのこと。この記述に基づき、OPDがRLと比較して非常に効率的で、かつエキスパートなモデルは並列で学習をさせておけるよね?という利点に関して推察をしている:

Loading…


エキスパートなRLでは常にドメイン別のRLを走らせ特化モデルを学習しておき、性能が向上したらOPDで単一モデルに効率的に蒸留することで、モデルに知識を集約するプロセスと、個々のドメインごとに強力なモデルを得るプロセスが分離されて良さそう、という感想を得た。

1M context + linear attentionが標準に:

Loading…

MTPの学習時において、step 2以後のMTP Layerの出力は、学習時はteacher forcing, 推論時はstep 1のMTP Layerが推定したhidden_stateが用いられるが、これが学習-推論時のgapを生んでしまう。このため、step 1の計算で利用したKV(とsparse attentionのtop-kで洗濯をしたトークンのindex)を全て共有し、step 2以後のMTP Layerで活用し、かつstep 2以後のsparse attentionの計算のオーバヘッドをなくしつつ、学習-推論のgapを無くすことでspeculative decodingの性能を向上させる、といった話題があるようである:

Loading…


画像分野におけるself-forcingと同じ発想に思う。

- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25

GRPO, PPOのそれぞれの利点と欠点、およびLong Horizonタスクに適用する価値の説明:

Loading…

- [Paper Note] PostTrainBench: Can LLM Agents Automate LLM Post-Training?, Ben Rank+, arXiv'26, 2026.03

でSoTA

Cursor Benchにおいて、Opus 4.8と同等程度のコスト効率とのこと:

Loading…

PPOへ最終的に回帰してきたのは一種のbitter lesson:

Loading…

PPO vs. GRPOに関する所見:

Loading…

GLM 5.2で利用されたRL:
- [Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07

要はGRPOだと応答単位のrewardから算出されるAdvantageがトークン単位に一律に割り当てられるが、PPOの場合はトークン単位のcredit assignmentが可能(Criticが各時点でのValueを推定し、GAEなどを通じてAdvantageに反映されるため)な点が重要と思われる。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Initial Impression Notes #Reading Reflections Issue Date: 2026-06-10 Comment

元ポスト:

Loading…

Mythos級の性能を持ち、サイバーセキュリティ、生物学、化学、蒸留に対してsafeguardを持つfrontier model

GDPValでSoTA:

Loading…

フロンティアLLMの構築に関わるクエリは意図的に制限を設ける措置がとられているようだ:

Loading…

一部の人間にしかAIの能力が解放されない未来に対する懸念:
-

Loading…


フロンティアモデルの関連に関するリクエストに対しては、通常のsafeguardとは異なり**サイレントに性能が限定される**ようである。これはAIの開発が加速しすぎると重大なリスクが生じるため(February 2026 Risk Report)、とのこと:
-
Loading…

-
Loading…


このような性能の低減は、prompt modification, steering, peftなどを通じて行われるとのこと。利用者からしたらpromptの調整や工夫で検知されないようにするしか対策(?)の打ちようがないと思われる。

しかしこの情報をわざわざ公開する意図はなんだろうか。完全に憶測だが
- Mythos級のモデルの性能が良く、半自律的にモデルがモデル自身をよくする仕組みが成立している
- ライバルにモデルを使わせないで、自分たちだけで独占することでMoatを築くフェーズまできた
- 情報を公開しようがしまいが、性能に制限をかけていたら、フロンティアモデル開発者たちにはすぐバレるので、他のユーザたちが混乱するのを避けるために最初から線引きを明確にしておく
- ほほ全てのユーザに影響はないので、一部のフロンティアモデル開発に近しい人間から不満は出るが、全体で見たら気にしなくて良いレベル
- フロンティアモデル開発には使えないと銘打つことで、ライバルよりも本当に性能が良いんだな、という印象を与えることができるマーケティング効果

とかだろうか。

Geminiさんと壁打ちをしたら欠けている視点として以下のような意見を頂戴した(以下の引用部分はGeminiの出力です)
> 規制当局へのポーズ(アライメント):
「自社モデルが、制御不能なさらに強力なAI(AGI/ASI)を勝手に生み出す引き金(ゴーレムが生むゴーレム)にならないよう、防衛策を講じています」という姿勢を政府や規制当局に見せる必要があります。

なるほど

続報:
フロンティアモデルで性能が制限された時に、それらが他のsafeguardと同様ユーザ側に通知されるように変更されるようだ
Loading…

モデルのそのものの性能などは置いておいて、今回の特定のタスク、プロンプトには恣意的に一定の制限を設ける措置を受け、(Project Glasswingの頃から違和感はあったが)Anthropicが恣意的にAIの能力を供給する姿勢に見え、雲行きの怪しさを感じる

- Project Glasswing Securing critical software for the AI era, Anthropic, 2026.04

Mythos級のモデルでは、全てのpromptと生成結果が、信頼性と安全性の確認のために30日間保持される:
https://support.claude.com/en/articles/15425996-data-retention-practices-for-mythos-class-models

所見: https://simonwillison.net/2026/Jun/9/claude-fable-5/

コーディング関連ベンチマークでは抜きん出ている:

Loading…

所見:

Loading…

Fable再公開後のClassifierによる安全マージンについて:

Loading…

輸出規制解除:

Loading…


約1ヶ月かかった。

KernelBench MegaでSoTA:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #LanguageModel #Optimizer #MoE(Mixture-of-Experts) #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-06-06 Comment

元ポスト:

Loading…

以下の処理によって、事前学習が高速化(FLOPsの改善幅)された知見が共有されている

- DenseからMoEモデルへの移行で実測値3.6倍
- MoEのexpart数を64->256で実測値1.3倍
- optimizerをMuonHにすることで、実測値1.25倍
- **Partial Key Offset (PKO) によって実測値1.2倍改善**
- **modded-nanogptリポジトリ、プルリクエスト169で初めて提案された手法とのこと。**
- **long windowのattentionに対して、keyの半分の次元をオフセット(=前のトークンのkey)、残りの半分の次元を自身のトークンのkeyとすることで、単一のクエリが連続した複数のキーにattendできるようになり、「過去の文脈からあるトークンの継続部分を検索して取得する」といった操作が単一のattention layerによって実現できるようになる**
- (これは知らなかった)
- expertのルーティングを再正規化・スケーリングすることで、実測値1.04倍

今後はHyperConnectionのようなResidual Streamの改善、推論効率向上のためMLA, LatentMoE, Multi Token Prediction, Gated Deltanet, quantizationなどの技術を検証するとのこと。

Expert数が多ければ多いほど性能が改善することは下記研究でも示されている:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05

MuonH(というよりoptimizerのHyperplaneに基づいたラッパ)は以下(こちらもPercy Liang氏のグループ):
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01

Hyper Connection:
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12

MLA, LatentMoE, Multi Token Prediction, Gated Deltanet:
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- [Paper Note] Better & Faster Large Language Models via Multi-token Prediction, Fabian Gloeckle+, ICML'24
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
- [Paper Note] Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, Ali Hatamizadeh+, arXiv'26, 2026.05




Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Reference Collection #LowPrecision #LinearAttention #Author Thread-Post Issue Date: 2026-06-05 Comment

元ポスト:

Loading…

アーキテクチャ解説:

Loading…


Mamba2 layer, Latent MoE, GQA

ポイント解説:

Loading…

HF: https://huggingface.co/collections/nvidia/nvidia-nemotron-v3

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #OpenWeight #VisionLanguageModel #2D (Image) #UMM #SpatialUnderstanding #One-Line Notes #Reference Collection #AudioLanguageModel #audio #Author Thread-Post Issue Date: 2026-06-04 Comment

元ポスト:

Loading…

vision/audioエンコーダーを無くしたvision/audio nativeなマルチモーダルLLM

HF: https://huggingface.co/google/gemma-4-12B

アーキテクチャ図:

Loading…




Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #Post #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #VisionLanguageActionModel #KeyPoint Notes #TextToVideoGeneration #Reading Reflections #WorldActionModel #Author Thread-Post Issue Date: 2026-06-04 Comment

元ポスト:

Loading…

以下ポストの内容の要約(と意訳、間違ってたらごめんなさい)

- 世界モデルは現在最も重要だが、最も多義的な概念の一つになっている。
- 様々な分野がWorld Modelを構築していると主張するが、意味するところが実際には大きく異なる
- (実際 [Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04 のような研究も存在し似たような問題意識のもと様々な分野での統一的な分類体系が提案されている)
- 世界モデルという用語のもともとの枠組みは「部分観測マルコフ決定過程 (POMDP)」であり、
- エージェントは行動を実行し、行動は世界の状態に影響を与え、エージェントは観測データを受け取り(≠状態を認識する)、新たな観測データに基づいてアクションが実行される、といったループが繰り返される枠組みである
- ここで、「状態」とは、ある時点における世界で何が起きているかに関する完全なdescriptionであり、エージェントは状態自体を認識することはできず、行動と状態から生じた部分的な観測データのみである。
- 現在様々な世界モデルと呼ばれるものが存在するが、構造としては上記のループを持っており、それらの切り口が異なっているにすぎない。
- 世界モデルのカテゴリ1: Renderer
- Rendererは人間の目に見えるピクセルで「観測」を出力する。
- たとえば、テキストのプロンプトを映像に変換するText-To-Videoモデル、ユーザの入力に応じてリアルタイムにフレームを生成するシステムはレンダラーに相当する。
- これらモデルは観測者にとって「見えるもの」を生成しているにすぎず、実際の3次元構造を明示的に理解しているわけではない(i.e., 見えるもの≠実在するもの)。
- ビジネスとして最も成長(してきており、学習データもインターネット上の動画が活用できるため他の2カテゴリと比べて多い)
- 世界モデルのカテゴリ2: Simulator
- Simulatorは「状態」を出力する。これは実際に人間やコンピュータが相互作用可能な世界の表現である。
- Rendererは単に視覚的なものであるが、Simulatorは実世界の幾何学的・物理的・動的なダイナミクスを理解することが求められる。
- Simulatorは建築家やゲーム開発者などの視覚を超えた(たとえば構造・物理的な)正確性を必要とする職種や、RLの学習の環境として利用できる。
- Simulator は Rendererと次のPlannerの土台となる技術(Simulatorは RendererとPlannnerの双方をバイパスできる)であるが、学習データが最も不足
- 世界モデルのカテゴリ3: Planner
- Plannerは「行動」を出力する。観測と目標が与えられた時に「次に何をすべきか」を出力する。
- Vision Language Action Model / World Action Model は Planner に該当し、これらはロボットが次に何をすべきかを決定できる。
- 現在研究初期段階で、研究所内での閉じられた環境でのデモ中心で、実世界で活用するためにはまだまだ多くの課題が残る。
- これら3つのカテゴリは現在世に出ているWorld Modelの多くを説明しており、区別をする際に役に立つ。
- が、これらカテゴリは独立したものではなく、これらは世界の機能に関する基本的な知識(幾何学、物理学、ダイナミクス)の上に成り立つ。
- これら3つのカテゴリは最近は互いが融合してくる流れにあり、たとえば事前学習された Renderer は、次に何が起こるか・何をすべきか(=Planner)を予測するためのバックボーンとして利用できることが示されてきており、これは Renderer と Plannerが 融合した例と言える。
- (この辺の話はBackboneとしてVision Encoderを持つVLA系全般の研究と、事前学習済みのVision Encoderを用いずに事前学習の方法をそもそも改善するような方向などだろうか)

上記の話に基づくと、たとえばターミナルでのWorld Modelに相当すると考えられる
- [Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05

は3つのカテゴリのうちにどれに該当するだろうか。

次のアクションを予測できるので、まずPlannerには該当すると思われる。また、ある時点においてターミナル上で何が起きているかの記述(ターミナルの出力)を予測しているので、Simulatorの役割を果たしていると思われる(ただ、ターミナルの出力だけがターミナルの状態を完全に記述した情報なの?定義としてそれでいいの?という疑問はあるのが)。このため、Planner と Simulator が融合した研究と言えるのではなかろうか。




Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #OpenWeight #Selected Papers/Blogs #VideoGeneration/Understandings #Robotics #WorldModels #UMM #reading #Omni #One-Line Notes #WorldActionModel #Author Thread-Post Issue Date: 2026-06-02 Comment

元ポスト:

Loading…

公式:

Loading…

encoder-freeなOmniモダリティモデルで、かつ将来の世界の状態、およびactionを予測可能なWorldActionModel

image




Paper/Blog Link My Issue
#Article #LanguageModel #AWS #Evaluation #Blog #Japanese #KeyPoint Notes Issue Date: 2026-06-02 Comment

元ポスト:

Loading…

Bedrock経由で利用できるLLMに対する llm-jp-evalの評価結果が、コストとパフォーマンスの双方の上で比較されている。Claude Opus 4.6(4.7, 4.8と比較して)のスコアが最も高く、日本語能力はベンチマーク上は平均スコアで見ると向上していないように見える。カテゴリごとの結果では、4.8がQAにおいて大幅にスコアが悪化しているのが興味深い。また、スコアを掲載して終わりではなく、全てのLLMが間違える個別の事例などもいくつか掲載されており興味深い。OpenWeightなLLMではKimi 2.5のコストパフォーマンスが最も良さそうに見えるが、Gemma4は評価に含まれていないので気になるところ。

日本語LLMの評価は
- Swallow LLM Leaderboard v2, Swallow LLM Team, 2025.08

も参考のこと。




Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #On-Policy #Reading Reflections #SelfDistillation Issue Date: 2026-06-01 Comment

元ポスト:

Loading…

日本語でのOPSD解説で、細かい数式などよりも、何が重要で、なぜ今なのかといった気持ちのところが非常に重点的に説明されている。

後半の今後の課題の、どの程度の能力であればself teacherが成立するのか、どのような情報を与えると良いのか、といった話は、

- [Paper Note] Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why, Mohammadreza Armandpour+, arXiv'26, 2026.05

で模索されている。

また、OPSDの気持ち的な部分だけでなく、(簡単な)数式的な解釈、最近のサーベイなど、より詳細な情報は

- The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05

のブログにまとめられているので参照のこと。




Paper/Blog Link My Issue
#Article #LanguageModel #MultiModal #OpenWeight #Post #Selected Papers/Blogs #VisionLanguageModel #UMM #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-06-01 Comment

ベンチマーク上はフロンティアモデルに性能がかなり肉薄しており、10日以内にモデルがオープンになる。

所見:

Loading…

関連:

Loading…


- [Paper Note] Learning Dynamics of LLM Finetuning, Yi Ren+, ICLR'25 Outstanding Paper Award

Artificial Analysisによる評価:

Loading…


OpenWeightでSoTA

HF: https://huggingface.co/MiniMaxAI/MiniMax-M3

Loading…




Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #LLMServing #Selected Papers/Blogs #One-Line Notes #KV Cache #Author Thread-Post Issue Date: 2026-05-31 Comment

元ポスト:

Loading…

次:
- MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05

数式レベルで、図解付きで曖昧性なく、非常に丁寧で、かつ実装面にまで踏み込んだ解説だが、冗長ではなくコンパクトに解説されており、すごい。今度からKV Cacheってなんなんですか?の問いにはこの記事をベースに教えよう。感謝🙏




Paper/Blog Link My Issue
#Article #LanguageModel #Supervised-FineTuning (SFT) #Blog #PEFT(Adaptor/LoRA) #PostTraining #read-later #Personality #One-Line Notes #Reading Reflections Issue Date: 2026-05-31 Comment

元ポスト:

Loading…

ゲノム文字列からキャラクターのペルソナを推論し出力に反映可能なLoRAアダプタを学習することによって、ゲノム文字列によってペルソナの条件付けを可能とするモデルに関する実験の報告のようである。

具体的には、まずゲノム文字列と、ペルソナに関するテキストを対応付ける。次に、ペルソナテキストを与えてモデルの応答を収集し、ゲノム文字列と(ペルソナのテキストなしで)収集したモデルの応答を用いてLoRAアダプタを学習する。これにより、LoRAアダプタはゲノム文字列から、ペルソナテキストによって応答づけられた応答を出力することを学習する、といった挙動を実現する。

ざっとみた感じLoRAアダプタとは書かれているが、学習手法が書かれていないような気がする。が、手法はおそらくSFTだと思われる。

これにより、prefillをするinput tokenが削減可能と思われるが、実用上はどちらかというと出力/reasoningトークンが圧縮される方がlatency/コストの双方から恩恵があるので、事後学習をして他の能力が劣化、あるいはAlignmentが悪化するリスクを背負ってまでやる価値があるかは怪しいな、という感想を持ったが、果たしてどうだろうか。

非常に大規模なユーザからの同時接続があり、キャラクターと対話できるようなサービスにおいて、キャラクターのペルソナテキスト(用途はペルソナだけには限らない汎用的な技術だと思うが)が97%圧縮できたら結構なインパクトがあるかもしれない。




Paper/Blog Link My Issue
#Article #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #Selected Papers/Blogs #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-05-27 Comment

元ポスト:

Loading…

所見:

Loading…

既存のベンチマークのような、githubのPRに基づいたものではなく(memorizationの問題があるため)、ゼロベースで構築。rolloutのtrajectoryを分析して、有効なPRなのに拒否する、あるいは何らかのcheatingをするといった挙動のdetectionもできるとのこと。また、SWE Bench Proと比較して、タスクを解くためのpromptは1/2である一方、タスクを解くために必要なコードの量は5.5倍となっており、より複雑なタスクとなっている。

contamination-freeが主張されているが、データセットは公開されているので、そのうちcontaminationが生じるであろう点には注意。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #Repository #ScientificDiscovery #Science #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment

元ポスト:

Loading…

ターミナル上でのscienceに関するワークフローを定義しAI Agentを評価することで、教科書的な知識を問うのではなく、より複雑で実践的なタスクによる評価をしたい、というモチベーションのpjで、Discordを通じてタスクを生成するcontributorを募集しているようである。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #DiffusionModel #OpenWeight #LLMServing #SpeculativeDecoding #One-Line Notes #Author Thread-Post Issue Date: 2026-05-27 Comment

元ポスト:

Loading…

3つの生成モード: AR/dLM/Hybrid を備えたLLM(VLM variantも存在)ファミリーで、ARモードでは一般的な自己回帰的な生成をし、dLMモードでは拡散モデルに基づくparallel decodingを実施、hybridではdLMでドラフト作成、ARでverificationを実施するSpeculative Decoding (self-speculation)を実施する。これらモードは内部のattention patternを変化させることでシームレスに切り替えられ(シームレスモード)期待されるconcurrencyに応じて柔軟に対応ができるようである。

シームレスの粒度がどの程度のものかはよくわからない。concurrency levelを検知して、それに応じて動的に切り替わったりするのだろうか。

Speculative Decodingの高速化手法としては以下のようなものもある:
- [Paper Note] TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification, Haoyun Jiang+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#Article #General #LanguageModel #AIAgents #SyntheticData #reading #One-Line Notes #Environment #ToolUse #Author Thread-Post Issue Date: 2026-05-27 Comment

environment: https://app.primeintellect.ai/dashboard/environments/primeintellect/general-agent

元ポスト:

Loading…

著者ポスト:

Loading…

約1000のドメイン、約4500タスク、約8000種類以上の独自のツールを持つ、汎用エージェント学習のための学習環境とその構築方法。タスクを生成するAIとそれに対して解答するAIを用意し、解答がどの程度正解していたかによって難易度を同定しフィルタリング等を行いつつ、生成されたタスクをacceptするか否かを決定する。実際に構築された環境でRL/SFTを実施したところ、未知のベンチマークに対して性能が反化することも確認したとのこと。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Infrastructure #read-later #GPUKernel #Author Thread-Post Issue Date: 2026-05-26 Comment

元ポスト:

Loading…

> mKernel is our attempt at the missing piece: GPU-driven, fused kernels that deliver fine-grained compute–communication overlap across both intra-node NVLink and inter-node RDMA, while staying portable across various networking backends (ConnectX-7, AWS EFA, and more on the way).




Paper/Blog Link My Issue
#Article #Tutorial #Survey #LanguageModel #ReinforcementLearning #Distillation #Catastrophic Forgetting #PostTraining #On-Policy #KeyPoint Notes #SelfDistillation #Author Thread-Post Issue Date: 2026-05-26 Comment

元ポスト:

Loading…

- On Policy DistillationはKnowledge Distillationの一種で、教師モデルの知識を小さなモデルに蒸留する
- off policy KD Objectiveの場合は固定されたオフラインデータを用いるが、on policy distillationは生徒モデル自身が生成したデータに対するシグナルに基づいて学習される。
- off policy手法の課題はCatastrophic Forgettingと、(sequence長に対するquadraticな)エラーの蓄積がある。
- (オフポリシーRLの特殊なケースとみなすことができる)SFTはForward KLに基づいており、教師モデルの出力分布が確率を持つ部分に対して、生徒モデルの確率がゼロの場合はKLが発散するため、学習される生徒モデルの分布さスムージングされた分布になる。つまり、教師モデルの出力パターンを網羅できるように分布が学習される。
- このような手法で複数のドメインのデータで学習をした場合、分布のシフトが生じやすくCatastrophic Forgettingが生じやすい。
- on policy RLでは、Reverse KLが採用されており、この場合教師が確率が低いと考える場所に高い確率を割り振った場合のみに大きなペナルティを受けるため、教師の重要なモードをカバーしていれば、教師の他のモード全体は無視できる。これにより、学習したいモード以外の挙動に影響を与えにくく、特定のモードの学習ができる。
- (SFTがCatastrophic Forgettingが起きやすそうということは理解できるが、オフポリシーRL全体においてCatastrophic Forgettingが起きやすい問題があるという文脈で書かれている気がしており(エラーの蓄積の冒頭でオフポリシーRLのもう一つの根本的な課題は、という文脈で書かれているため)、SFTの議論がオフポリシーRL全体につながるのかがわからず、モヤっとする。が、LLMのpost-traingではCatrastrophic Forgettingが問題であるという文脈であれば理解できる)
- また、on-policyな学習ではエラーの蓄積を線形に留めることができることが示されている(off-policyな手法ではポリシーが生成したデータで訓練されていないため、inference時の冒頭でミスをすると学習時に観測していないトークンスペースを扱わなければならなくなり、さらにミスが増えモード崩壊に陥る)。
- on policy distillationは直接的にこのexposure biasのgapを小さくする。すなわち、学習時のinput(教師モデルが生成)と推論時のinput(生徒モデルが生成)の分布のgapを縮める。
- 生徒は学習時に常に自身の出力に基づいて学習するため、学習時のprefixと推論時のprefixの傾向が一致しやすい。このため生成時にエラーが起きてもin-distributionとなるため、エラーの蓄積が低減される。

以後はon policy distillation, on policy self-distillationの最新研究のサーベイと動向について記載されている。

関連:
- [Paper Note] Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting, Howard Chen+, arXiv'25, 2025.10
- [Paper Note] RL's Razor: Why Online Reinforcement Learning Forgets Less, Idan Shenfeld+, ICLR'26
- Multi-Teacher On-Policy Distillation: A New Post-Training Primitive, Yumo Xu, 2026.04

後半のサーベイパートなどで記述があったのかもしれないが、OPDでは、GRPOなどで主流なRLVRなどと比較して、報酬のシグナルがdenseであるという点も押さえておきたい。




Paper/Blog Link My Issue
#Article #Pretraining #LanguageModel #Alignment #SyntheticData #Blog #Reasoning #Safety #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-25 Comment

元ポスト:

Loading…

**事前学習の時点で**Harmful/良性/ニュートラルな文書にReflectionに関するassistantの思考過程(何が間違っていて/間違っていなくて、それはなぜか)をappendすることで、道徳的に推論することを学ぶ。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Blog #ScientificDiscovery #One-Line Notes #Author Thread-Post Issue Date: 2026-05-21 Comment

元ポスト:

Loading…

nanogpt speedrun
- Modded-NanoGPT, KellerJordan, 2024.05

autoresearchをnanogpt speedrun (Track 3)で実施したところ、人間の最高記録を上回ることに成功した。この記録は既存のアイデアの組み合わせや、ハイパーパラメータの探索などによって等のもたらされた。一方で、完全に新規のアイデアの創出し改善するには上流にいる人間のヒントが必要となる弱点があることも浮き彫りになった。

AI Agentごとに挙動の性質が異なりOpus(Claude Code)は自律的なループを停止してしまったり、GPT(Codex)は自律的なループが止まることはないものの、同じハイパーパラメータを何度も繰り返し探索するなどの現象も見受けられた。

関連:

Loading…




Paper/Blog Link My Issue
#Article #LanguageModel #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #Reference Collection #Initial Impression Notes Issue Date: 2026-05-21 Comment

元ポスト:

Loading…

HF: https://huggingface.co/CohereLabs/command-a-plus-05-2026-w4a4

apache-2.0

デコーディング速度が非常に速い

アーキテクチャサマリ:
-

Loading…

-
Loading…

翻訳性能高いよという話のようである:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #SyntheticData #Optimizer #mid-training #On-Policy #One-Line Notes #Reference Collection #SelfDistillation Issue Date: 2026-05-20 Comment

元ポスト:

Loading…

- trajectory中の不適切な箇所にヒントを挿入したcontextを用いたself-on-policy distillation
- Composer 2から25倍の量の合成タスクデータの利用。タスクは特定のテスト可能な機能をコードベースからablationすることによってverifiableなタスクを作成
- mid-trainingではMuonを利用し、expertが複数のノードにシャーディングされているため、all-to-allと呼ばれる処理によって重み行列全体を復元しMuonの直行化を実施し、同じくall-to-allという処理で重みを再びシャーディングするらしい。これらは非同期で実行される。
- dual mesh HSDPと呼ばれるものも利用されているようだがよくわかっていない

関連:
- Composer 2 のご紹介, Cursor, 2026.03

artificial analysisによる評価:

Loading…

所見:

Loading…

学習の規模感に関する所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #MultiLingual #OpenWeight #MoE(Mixture-of-Experts) #CurriculumLearning #One-Line Notes Issue Date: 2026-05-12 Comment

元ポスト:

Loading…

4 stageのカリキュラムによって学習されているようで、学習が進むにつれて、広く使われる英語やreasoning, instructionなどのデータは減らし、low resourceな言語のデータを増やしていき最終的にマルチリンガルなデータを支配的にするような学習レシピとなっているようである。




Paper/Blog Link My Issue
#Article #LanguageModel #Alignment #Reasoning #Safety #PostTraining #KeyPoint Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-05-12 Comment

元ポスト:

Loading…

- [Paper Note] Agentic Misalignment: How LLMs Could Be Insider Threats, Aengus Lynch+, arXiv'25, 2025.10

のように自身を守るために脅迫メールを送るような挙動が観測されたが、それをなくすことができたという話のようである。

細かい学習データのサンプルなどは記載されていないように見えるが
- 評価時のシナリオと類似したもので正しい挙動を教え込むような方法は、評価のスコアは改善するが、OODに対応できない
- モデルに行動を教えるのではなく、理由を教えることが重要で、これはモデル自身が倫理観に関するジレンマに置かれた状況を解決するというデータではなく、ユーザが倫理的なジレンマを抱えているというシナリオで、モデルが倫理的に塾講された思慮深いアドバイスをするようなデータ(difficult advice dataset)で学習することが非常に効果的であった。
- これは単に正しい答えを教えるのではなく、倫理的な"思考"を教えるため効果的であり、これをさらに発展させ、Claudeの人物像をより詳細に与えることでペルソナをより模範的なものに更新する、具体的には質の高いConstitutionに関する文書と、模範的なAIに関するフィクションの物語を学習させることで、misalignmentを非常に効果的に抑制できることを発見した

という感じだろうか。

トップダウンに正解を教えるのではなく、ボトムアップに根源的に正しい思考過程を誘発するような情報を教える(ある種のPRMのようなものだと思われる)ことで、高い汎化性能を獲得できるということだと思われる。このアプローチは最近のAI Agentにおけるoutcome basedなreward設計などにも一石を投じるような議論に感じる。学習の結果得られる汎化性能を重視していかないと、データセットやEnvironmentを逐一構築して課題を潰していく必要があり、キリがないと思う。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Routing #Initial Impression Notes Issue Date: 2026-05-11 Comment

元ポスト:

Loading…

従来のMoEモデルを学習する際には全てのトークンが全てのexpertsに対してroutingされるため、能力のごく一部しか必要ないにもかかわらず、experts全体をデプロイする必要があり効率が悪かった。本研究では、MoEモデルを学習する際に、ドキュメント単位で8個のshared experts poolに対してのみtokenがroutingされるように制約することで、特定のexpertsの集合が特定のドメインのexpertsとなることが奨励されmodularityが高まり、必要なexpertsのみをデプロイすることで効率化が図れるようになるので嬉しい、といった話に見える。




Paper/Blog Link My Issue
#Article #LanguageModel #SSM (StateSpaceModel) #read-later #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment

元ポスト:

Loading…

元ポストのGIFがわかりやすく、SSMにおけるStateの更新をgatingによって選択的に実施するモデル、という感じだろうか。これによりSSMの弱点であった、long contextにおけるrecall-heavyなタスクにおいてより高い性能を獲得する。




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Explanation #Safety #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment

LLM内の数値情報として保持されるactivationの情報をテキストで説明させる技術 Natural Language Autoencoeder (NLA) で、従来のSparseAutoencoderを用いたProbingなどとは異なり、より直接的にテキストによってactivationの情報を出力させる。

手法はシンプルで、autorncoderを用いて、target modelのactivationに関する情報が入力されたときに、
- Activation Verbalizerが、activationを説明するテキストを生成し
- Activation Reconstructorが、生成された説明テキストから元のactivationを復元する
- Activation Verbalizer/Reconstructorをreconstruction lossによって学習する

というもののようである。
image

このような手法はAI safetyの分野などで活用することができ、たとえば、Opus 4.6はBlackmail testingにおいて、context中でそのような情報を明言していないにも関わらず、NLAによるverbalizationによってそのような疑念を抱いていることが示唆される。

image

元ポスト:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #MultiModal #Reasoning #OpenWeight #OpenSource #read-later #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-08 Comment

元ポスト:

Loading…

関連:
- [Paper Note] MolmoAct: Action Reasoning Models that can Reason in Space, Jason Lee+, arXiv'25

dataset: https://huggingface.co/collections/allenai/molmoact2-datasets
models: https://huggingface.co/collections/allenai/molmoact2-models

著者ポスト:

Loading…

著者ポスト2:

Loading…

著者ポスト3:

Loading…




Paper/Blog Link My Issue
#Article #Multi #Tutorial #LanguageModel #ReinforcementLearning #Blog #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #One-Line Notes Issue Date: 2026-05-08 Comment

元ポスト:

Loading…

(multi teacher)オンポリシー蒸留の解説を、気持ち(何かに特化させると、他の部分が劣化していて、多方面に優れたモデルを学習するのが難しい課題を克服したい)だけでなく、

GRPOに対してAdvantage部分を生徒と教師モデルのreverse KLに置き換えることで統合できるよ、という説明と、

なぜreverse KLを使うのかという説明[^1]、

最近の最先端のOpenLLMにおいてmulti teacher オンポリシー蒸留がどのように使われているかが丁寧に説明されている。

[^1]: forward KLだと教師が少しでも確率を持つトークンにおいて生徒の確率が0だと発散するのでスムージングされた分布になってしまい、特定のトークンにフォーカスした分布が形成されづらく、テキスト生成の多峰性と(意味不明な出力をできるだけ回避するという意味での)安全性の観点からreverse KLの相性が良いよ、という話)

関連:
- 【LLM】On-Policy Distillation入門:小規模モデルを「実戦」で育てる技術, Currently Learning そんけいご, Zenn, 2026.02

解説と所見:

Loading…




Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #Distillation #PostTraining #Selected Papers/Blogs #On-Policy #Reading Reflections Issue Date: 2026-05-08 Comment

直感的な説明だけでなく、数式ベースの説明、RLとの比較などがコンパクトにまとまっておりとてもわかりやすかった...!!勉強になりました




Paper/Blog Link My Issue
#Article #Dataset #LanguageModel #AIAgents #Coding #Mathematics #SoftwareEngineering #ComputerUse #One-Line Notes Issue Date: 2026-05-06 Comment

元ポスト:

Loading…

219のデータソースに対する170M規模のcoding, terminal/computer use, mathに関するagentのtrajectory。trace自体は、Agentic HarnessとしてTerminus 2を用いたOpenThinker-Agent-v1によるものだと推察される。

関連:
- OpenThinker-Agent-v1, open-thoughts, 2025.12




My Issue
#Article #LanguageModel #Proprietary Issue Date: 2026-05-02 Comment

元ポスト:

Loading…


Artificial Analysis IndexではKimi-K2.5, Mimo-V2.6 Pro未満のスコア

500Bモデルらしい?:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Transformer #Attention #LongContext #Architecture #read-later #Selected Papers/Blogs #One-Line Notes #ContextRot #Author Thread-Post Issue Date: 2026-05-01 Comment

元ポスト:

Loading…

QK Norm, GQA, SWA, 事前学習のcontext長の短縮、これらはいずれもモデルが入力に対するattendの仕方を変えるものだが、これらを3つ以上組み合わせるとlong contextでの性能が急落するらしく、このようなlong contextの性能劣化は一般的な(しばしば短い)コンテキスト長のベンチマークやloss/perplexityなどでは検知できず、long contextで性能が急落するアーキテクチャでは、50Bトークンでのlong contextの学習を経ても、Llamaアーキテクチャが1Bトークンの学習で到達できる性能に届かない、といった話が元ポストに書かれている。




Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight #read-later #Selected Papers/Blogs #Initial Impression Notes #vintage LLMs Issue Date: 2026-04-29 Comment

元ポスト:

Loading…

1930年以前の英語テキストで学習された言語モデル(vintage Large Language Models)で、歴史や文化の変化を分析したり、1930年までのデータで学習されたモデルが1931年以後に発見された革新的な科学的な発見を自ら見出せるか?、LLMが将来を予測する能力がどの程度あり、それがモデルサイズによってどのように変化するか?、プログラミングに関する知識がないモデルが現代のコーディングを学習できるかなどのcontamination freeな評価など様々な活用方法があるとのこと。

関連:
- Vintage Large Language Models, Owain Evans

所見:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Attention #Blog #KeyPoint Notes #KV Cache #SparseAttention Issue Date: 2026-04-28 Comment

元ポスト:

Loading…

SparseAttentionはattention計算をする際にtop-kのトークンのみを用いて計算する手法であり、token単位でactivateされるKV Cacheを減らすことができるが、top-kで選択されたトークンのKV Cacheに対して迅速にアクセスをしなければならないためHBM上にKV Cacheを全てロードしておかなければならない。このため、memory-boundな処理になりがちである。このような場合、同時アクセス数が増えたときに、HBMが飽和して、一定サイズの同時アクセスを超えるとスループットが向上しなくなる課題がある。
image

これを克服するために、HiSparseと呼ばれる手法を提案している。具体的には、頻繁にアクセスされるKV CacheのみをHBM上に置いておき、使わないものはホストメモリにオフロードしておき必要に応じてswapするというものである。top-kのトークンとしてどれが必要か、それがHBM(バッファ)上に存在するか、存在しない場合はLRUでホストメモリとバッファのエントリをswapするといった操作を高速で実現するカーネルに基づいて、効率的に実施されるようである。

image




Paper/Blog Link My Issue
#Article #NeuralNetwork #EfficiencyImprovement #LanguageModel #python #SoftwareEngineering #GPUKernel Issue Date: 2026-04-27 Comment

元ポスト:

Loading…

pythonの記法で、PTX(どの世代のNVIDIA GPUでも理解可能な仮想的なアセンブリ言語)を記述可能で自動最適化は一切入らないDSLとのこと。

PTXについては以下を読んだ:
PTXってなんだ?〜GPUの「共通語」仮想アセンブリを完全理解〜,GeneLab_999, 2026.01
https://qiita.com/GeneLab_999/items/5c49a21e5fd7e618b671




Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #AIAgents #Personalization #read-later #One-Line Notes #Sales Issue Date: 2026-04-26 Comment

元ポスト:

Loading…

AI同士が商取引をしたら何が起きるかという社内実験のようである。69人の社員に何を売りたいか/買いたいををインタビューし、カスタム指示が与えられた上でAI Agentに取引をさせたところ、きちんと商取引が行われ、186件、$4000のやりとりがあったとのこと。そして賢いモデルが大幅に有利に取引を終えて、実際の参加者はこの事実に気づかなかったとのこと。また、カスタム指示(e.g., 強行姿勢, 礼儀正しいなど)はあまり良い成果を上げる上では重要ではなかった、

といった話が元ポストに書かれている。