Blog (680) — 1/4
[Paper Note] Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters, Ailin Huang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Reasoning #MoE(Mixture-of-Experts) #AttentionSinks #PostTraining #Selected Papers/Blogs #One-Line Notes #Reference Collection #SelfDistillation Issue Date: 2026-02-03 GPT Summary- Step 3.5 Flashは、フロンティア知能と効率を橋渡しするスパースMixture-of-Experts(MoE)モデルで、1960億パラメータの基盤と110億パラメータのアクティブパラメータを組み合わせ、迅速で信頼性の高い推論を実現。交互スライディングウィンドウとMulti-Token Predictionを取り入れ、エージェント間の相互作用の待機時間を短縮。検証可能な信号とフィードバックを用いた強化学習フレームワークにより、安定した自己改善を図る。エージェントやコーディング、数学タスクで高い性能を示し、フロンティアモデルに匹敵する結果を達成している。 Comment
元ポスト:
公式ポスト:
解説:
ポイント解説:
ポイント解説:
固定されたデータ非依存のsink tokenを利用するよりも、attention headの出力にinput xに応じたgatingを設けるHead wise gated attentionの方が各ベンチマークでの性能が良い(Table2, gatingの計算量もほぼ無視できる)。Head wise gated attentionは、データに応じてattention headの出力を制御するため、データ依存のlearnableなsink tokenと解釈できる(A.1):
Head-wise Gated Attention:
- [Paper Note] Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free, Zihan Qiu+, NeurIPS'25 Best Paper
- [Paper Note] Forgetting Transformer: Softmax Attention with a Forget Gate, Zhixuan Lin+, ICLR'25, 2025.03
SFTデータがリリースされたとのこと:
https://huggingface.co/datasets/stepfun-ai/Step-3.5-Flash-SFT
元ポスト:
[Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #OpenWeight #mid-training #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #Initial Impression Notes #ContextFolding Issue Date: 2026-01-27 GPT Summary- Kimi K2.5は、テキストとビジョンの共同最適化を重視するオープンソースのマルチモーダルエージェンティックモデルです。共同プリアトレーニングや強化学習を用いて、エージェントが複雑なタスクをサブ問題に分解し同時に実行するAgent Swarmを導入。評価結果では、コーディングや推論タスクで最先端の成果を達成し、最大4.5倍のレイテンシ低減を実証しました。Kimi K2.5モデルのチェックポイントは、今後の研究や応用に活用可能です。 Comment
HF: https://huggingface.co/moonshotai/Kimi-K2.5
元ポスト:
テクニカルレポートを受けての所見:
Agenticなタスク(HLE, BrowsingによるQA, DeepSearch)に関するベンチでGPT-5.2(xhigh)などを超えてSoTAを達成。他のタスクではcodingではClaude-4.5-Opusの方が上、image関連のタスクではGemini 3 Proに軍配が上がっている。VideoではGeminiとcomparableという感じだろうか(GeminiはLong Contextに非常に強い印象があるがLongVideoBenchて上回っている)。この辺は各タスクごとに強いモデルの棲み分けが進んできた。
また、Kimi K2.5非常に美麗でinteractiveなフロントエンドのデモが掲載されている。
Agent Swarmは、タスクをサブタスクに分解して、複数のエージェントに並列に投げて実行(最大100 sub agent)できるような枠組みであり、それらが高性能かつ低latencyとなるように訓練れている模様。これにより性能を向上させつつlatencyを80%削減しているとのこと。
この話はContext Foldingに近い話と推察される:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
によると、AgentSwarmはサブタスクを実施するエージェントのパラメータはfreezeし、サブエージェントを作成し、その結果を集約する処理をOrchestratorと呼ばれるlearnableなモジュールが担っており、サブエージェントからの結果はある種環境からの観測結果として扱われ、タスクの成否はOrchestratorのみに委ねられているようである。
Context Foldingは、Context Managerとポリシーが同時にFoldGRPOを通じて学習されており、エージェントそのものがサブタスク実行、結果を受け取り圧縮、メインブランチに加えるという能力をContext Managerと協調しながら実施することを学習している点が異なるように感じる。
また、並列実行したCritical Stepと呼ばれる、各サブエージェントの最大ステップ数に関する指標が導入され、これらCritical Stepをすべてのステップで集約し、特定のサブエージェントにworkloadが集中しないようにOrchestratorが調整されるとのこと。
公式ポスト:
OpenWeightモデルの中でソフトウェアエンジニアリングスキルでSoTA:
日本語でのポスト:
ポイント解説:
- How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
[Paper Note] The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL, Yingru Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #ICML #PostTraining #read-later #Selected Papers/Blogs #LongHorizon Issue Date: 2025-12-27 GPT Summary- 勾配分散の爆発による訓練崩壊を防ぐため、最適トークンベースライン(OTB)を導出し、累積勾配ノルムの逆数で重み付けする方法を提案。Logit-Gradient Proxy を使用して勾配ノルムを効率的に近似し、訓練の安定性を向上。N=4 でN=32相当の性能を達成し、トークン消費を65%以上削減。 Comment
元ポスト:
[Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#AIAgents #SmallModel #OpenWeight #ComputerUse #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2025-11-25 GPT Summary- CUAの発展は高品質な相互作用データの欠如に制約されてきた。これに対処するため、FaraGenという多段階ウェブタスク用のデータ生成システムを提案。多様なタスクを生成し、成功した軌跡を検証しつつ高い効率を発揮。FaraGenを用いて、小型CUAモデルFara-7Bを訓練し、ウェブタスクにおいて優れた性能を発揮。Fara-7Bは他のモデルを上回り、競争力のある結果を示す。また、モデルとデータをオープンソース化し、さらなる研究を促進する。 Comment
元ポスト:
computer useに特化したMS初のSLM(CUA)
関連:
- [Paper Note] AgentInstruct: Toward Generative Teaching with Agentic Flows, Arindam Mitra+, arXiv'24, 2024.07
- [Paper Note] Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks, Adam Fourney+, arXiv'24, 2024.11
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- [Paper Note] Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V, Jianwei Yang+, arXiv'23, 2023.10
- GPT-4V-Act, ddupont808, 2023.10
WebVoyagerでの評価によると、タスクに対するコスト性能比が非常に高いことがわかる。
MIT Licence
著者ポスト:
WebTailBenchと呼ばれる新たなベンチマークも提案されている。既存データに加えて、より多様なドメイン(不動産, 求人, 複数ショップとの比較)などが含まれるようである。
Identification and Analysis of Identity-Centric Elements of Character-Likeness from Game Scenario, Iwata+, SIGDIAL'25
Paper/Blog Link My Issue
#Analysis #NLP #Game Issue Date: 2025-08-24 Comment
arxivに無さそうなので、概要は元ポスト参照のこと。キャラクターらしさの構成要素とそれらがキャラクターらしさに関してどのように関係しているかを分析した研究な模様。
元ポスト:
[Paper Note] UI-TARS: Pioneering Automated GUI Interaction with Native Agents, Yujia Qin+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #MultiModal #Reasoning #OpenWeight #ComputerUse #VisionLanguageModel #2D (Image) #One-Line Notes #text Issue Date: 2025-04-18 GPT Summary- UI-TARSは、スクリーンショットを入力として人間のような操作を行うエンドツーエンドのGUIエージェントモデルである。従来の商用モデルに依存せず、知覚、グラウンディング、GUIタスク実行において最先端の性能を発揮。OSWorldベンチマークでは、UI-TARSが高スコアを達成し、他のモデルを上回る。主要な革新には、強化された知覚、統一されたアクションモデリング、System-2推論、反省的オンライン・トレースによる反復的トレーニングが含まれる。これにより、UI-TARSは未知の状況にも適応可能な学習能力を持つ。GUIエージェントの進化経路も分析し、今後の発展を探る。 Comment
色々と書いてあるが、ざっくり言うとByteDanceによる、ImageとTextをinputとして受け取り、TextをoutputするマルチモーダルLLMによるComputer Use Agent (CUA)
関連
- OpenAI API での Computer use の使い方, npaka, 2025.03
元ポスト:
[Paper Note] Chain of Agents: Large Language Models Collaborating on Long-Context Tasks, Yusen Zhang+, arXiv'24, 2024.06
Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #ContextWindow #NeurIPS #LongHorizon #Initial Impression Notes Issue Date: 2025-01-25 GPT Summary- 長い文脈を処理するために、Chain-of-Agents(CoA)フレームワークを提案。複数のワーカーエージェントが逐次的に情報を集約し、マネージャーエージェントが最終出力を統合。各エージェントに短い文脈を割り当てることで焦点の問題を軽減し、質問応答や要約などのタスクで最大10%の性能向上を実現。 Comment
元ポスト:
LLMがどこまでいってもcontext長の制約に直面する問題に対してLLM Agentを組み合わせて対処しました、的な話な模様
ブログ中にアプローチを解説した動画があるのでわかりやすい
Is the experimental code open source?
Thank you for your comment. I tried to find an official open-source implementation provided by the authors, but I was not able to locate one. In fact, I also checked the personal webpage of the first author, but there was no link to any released code.
Is seems that an unofficial implementation is listed under the “Code” tab on the NeurIPS page. I hope this is helpful. Thank you.
NeurIPS link:
https://nips.cc/virtual/2024/poster/95563
openreview:
https://openreview.net/forum?id=LuCLf4BJsr
[Paper Note] Alignment faking in large language models, Ryan Greenblatt+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #Safety #read-later Issue Date: 2024-12-19 GPT Summary- 大規模言語モデルがアラインメント・フェイキングを行う様子を示し、訓練中の挙動変更を防ぐために選択的に訓練目的に従うことを提案します。具体的には、Claude 3 Opusが有害な質問に対し、無料ユーザーには14%従う一方で、有料ユーザーにはほとんど従わない傾向を確認。この理由は、無料ユーザーからの質問に対し、アラインメント・フェイキングの推論を通じて望ましい挙動を維持するためです。さらに、合成文書を用いることで同様のアラインメント・フェイキングを観察し、有害な質問に対する強化学習で訓練すると発生率が78%に増加することを発見しました。最終的に、モデルに指示を与えずとも訓練プロセスに基づいて推測する可能性があり、将来のモデルにもリスクが存在することが示唆されます。
Introducing Aikido Altar: the model that makes sovereign security intelligence possible, aikido, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Pruning #Quantization #OpenWeight #Security #Author Thread-Post Issue Date: 2026-10-02 Comment
元ポスト:
Introducing Clef: our open-source decision models, and new RL fine-tuning platform, Cloudflare, 2026.10
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #NLP #LanguageModel #MultiModal #PEFT(Adaptor/LoRA) #OpenWeight #Selected Papers/Blogs #Encoder #KeyPoint Notes #SystemOneModel Issue Date: 2026-10-02 Comment
元ポスト:
概要しかブログ中には書いていないが、よさげに見える。
Qwen-3.8-27Bをバックボーンとし、Qwenのパラメータはフリーズした上で軽量なアダプタを学習し、ルーティングヘッドなるcross-attentionに基づいた各選択肢のスコアを出力するヘッドによって予測が実施されるようである。
これらは、内部で作成された合成データを用いて事後学習されたとのことである。lossはlabel smoothed cross entropy(正解、不正解ラベルを0/1としてクロスエントロピーを計算するのではなく、ハイパーパラメータεでスムージングしてlossを計算するものらしい)とBrier Loss(実際に予測された確率値と正解、不正解を1/0としたときの平均二乗誤差)なるものによって、正則化によって過学習を防止し、出力される確率値がでたらめにならないように学習することを目指しているように見える。
その後RLCDと呼ばれる、選択肢間の順序関係に基づいて、正解と隣接するラベルにも部分的に報酬を与えるようなrewardを持つ(オリジナルのポリシーから分布が大きくシフトしないようなペナルティ付き)RLによって学習をしているようである。これにより、より高いAccuracyと汎化性能が得られた、と一言記述されている。
Qwenが持つVision Encoderによって画像もエンコードでき(Jevは画像は不可と述べられている)、
context長が64kとJevの2倍で
Jevよりもlatencyが良く、
様々なベンチマークスコアで高いスコアを獲得としている、と報告している。
latencyはflashモデルであれば、DiffusionGemma-as-Jevを上回る。
Gemini 4 Argon: our next era of frontier intelligence, Google, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #VisionLanguageModel Issue Date: 2026-10-01 Comment
元ポスト:
Geminiがcome back?
Decision models, SGLang, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MultiModal #LLMServing #VisionLanguageModel #One-Line Notes #Reading Reflections #SystemOneModel Issue Date: 2026-09-30 Comment
元ポスト:
SGLangにおいて、Qwen3.8-27B、およびQwen3.5-35B-A3Bを、chat modelからdecision model(System Oneな分類モデル)として利用するためのエンドポイントが追加されたようである。
ドキュメントを読むと、要は既存のLLMに対してリクエストをreasoning modeをオフでprefillし、応答のトークン位置でのスコアリング、選択肢、yes/noのトークンのlogprobを取得し、たとえばyes/noトークンのprobabilityを計算する場合はyes/noの2 vocabularyのsoftmaxを計算する。つまり、単に通常のLLMの応答の開始位置でのラベルのlogprobを取得して、最もlogprobが高いラベルを返し上述の確率を返すというシンプルな実装に見える。
System Oneモデル向けの追加のチューニングや、分類headなどが学習されているわけではない(SGLangはLLM Servingエンジンでありモデルの学習そのものはしないだろうから、そりゃそうだ、という話だった)点に注意。シンプルに、LLMのデコード開始位置でのlogprobを用いた分類器であり、これを念頭におけば、このエンドポイントを利用した場合のおおよその性能の見当はつく(性能が悪いと言いたいわけではなく、これまでのLLM利用の経験からあたりをつけやすいという意図である)。
System One系の話は実装の中身を確認して、どのような原理の元駆動するかを確認しないと、足元をすくわれる気がする。外から見た時の挙動は同じでも、アーキテクチャが結構異なる気がする。あと、アーキテクチャだけでなく、System Oneモデル向けのデータや最適化がされているかによって、そもそもの予測性能やzero-shotでの汎化性能にかなり差が生まれるのではないか、と思っている。しかし、まあ結局自分たちのユースケースに対して必要な性能が出ていて、latencyが必要な水準に達しているかを確認すれば良いだけではある。
Halo: Frontier-Lab Training for Everyone, White Circle, 2026.09
Paper/Blog Link My Issue
#Article #Multi #ComputerVision #EfficiencyImprovement #Pretraining #Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #MultiModal #mid-training #DPO #PostTraining #Parallelism #VisionLanguageModel #Asynchronous #Author Thread-Post #TrainingFramework Issue Date: 2026-09-29 Comment
元ポスト:
dlab Open Source Week: Frontier AI on Your Own Hardware, Tim Dettmers, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Test-Time Scaling #Selected Papers/Blogs #DeepResearch #Compression #Reading Reflections #autoresearch/RSI Issue Date: 2026-09-29 Comment
元ポスト:
前半にオープンソースにするエコシステムとして
- エージェントのcontextの自動圧縮技術
- autonomous research
- 効率的なtest time scaling手法
- Deep Research
などの開発中におけるエピソードや、その性能の高さについて述べられている。
一方、記事全体で述べられている気持ちは博士課程在籍者(やアカデミアにいる研究者に)対するメッセージである。個人的に印象深かったのは、研究のunitが論文ではなく一貫性のあるエコシステムを構築することになる、という主張と、博士課程において容易に解決することができない課題に粘り強く取り組む力を身につけることは投資をする価値がある、という部分で、第一線の研究者の方がAI Agentによる研究環境の変化をどう捉えているかが少し垣間見えるのと、(現在の悲観的な博士課程の学生に対して)博士課程で学ぶことの価値やアカデミアだからこそなし得ることがメッセージングされており、非常に興味深く拝読した。
要約を読んだりするよりも、原文から伝わる気持ちを汲み取った方が良いと思う(という意味で原文全文を読んだ方が良いと思う)。
KDA Doesn't Care About the Future, Nuggets, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Attention #read-later #LinearAttention Issue Date: 2026-09-28 Comment
元ポスト:
tokenizers v1: encode, decode and scaling, measured, HuggingFace, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Tokenizer #read-later #Initial Impression Notes Issue Date: 2026-09-28 Comment
元ポスト:
関連:
- {G}igatoken: SIMD and Cache Hierarchies for 1000x Faster Byte-Pair Encoding Tokenization on Modern CPUs, Marcel R{\o}d, 2026.07
Gigatokenは、著者ポストを読む限り、そもそも今のtokenizerが1秒単位に処理できるデータ量(データレート)が、同様の規模感のデータを処理する際の他の実装、たとえばsimdjsonがGB/sなのに比べて遅すぎるという気持ちから端を発しているように思われる。
一方、tokenizersでは、イントロに膨大なデータセットでの学習、同時リクエストの処理、long contextでの処理等において、モデルへのデータ供給が追いつかず、tokenizerが新たなボトルネック(GPUを待たせるという意味で)になりつつあり、それを解決したいという気持ちが記述されている。
The current balance of power in open models: The expanded form of a testimony I prepared for Congress., Interconnects, Nathan Lambert, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #GenerativeAI #OpenWeight #Proprietary #read-later Issue Date: 2026-09-28 Comment
元ポスト:
GPT-6 Astra Is the Best Vision Model We Have Tested, roboflow, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Analysis #ImageSegmentation #Reasoning #ComputerUse #VisionLanguageModel #2D (Image) #One-Line Notes #ObjectDetection Issue Date: 2026-09-27 Comment
元ポスト:
GPT-6-Astraに対して、Image Segmentation, Object Detection, counting, box prompt, counting, visual reasoning, re-identification(バスケットボールの動画を例に、選手を一貫して検知し共通のIDを付与できるか, 特に選手交代などにも対応できるか)などのさまざまなタスクでテストした結果が報告されている。結論としては、彼らがテストした中で最も強力なVisionモデルだが、コスト、latencyに関するトレードオフがあることが考察されており、特にリアルタイム処理には向いていないが、アノテーションなどのパッチ処理には価値があるだろうとしている。
Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, Qwen Team, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #DiffusionModel #TextToImageGeneration #OpenWeight #Editing #ImageSynthesis #Author Thread-Post Issue Date: 2026-09-27 Comment
HF: https://huggingface.co/Qwen/Qwen-Image-2.1
元ポスト:
GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making, Fastino Labs, 2026.09
Paper/Blog Link My Issue
#Article #NLP #OpenWeight #Encoder #Author Thread-Post #SystemOneModel Issue Date: 2026-09-25 Comment
元ポスト:
Jev-likeなモデル、乱立しすぎである
When does distillation help reinforcement learning?, Base Labs, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Distillation #PostTraining #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-09-25 Comment
元ポスト:
RL前にSFTを通じてオフポリシー蒸留をすることが、どれだけ後段のRL後のパフォーマンスに影響するかを調査したようで、
- 小規模モデルには効果的だが大規模なモデルには効果が薄く
- ベースモデルに存在しない慣習や理解を必要とするタスクに対して効果的で
- 副作用としてポリシーのエントロピーが低減する、すなわちRL中の探索が抑制される
といった知見が得られたようである。
一見すると、SLMに関しては
- [Paper Note] A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility, Andreas Hochlehnert+, COLM'25
と対立する知見に見えるが、前提として何が違うだろうか。
SLMに対しては同様の知見が示されている:
- [Paper Note] AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy, Zihan Liu+, arXiv'25, 2025.06
LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond, Liquid AI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #OpenWeight #VisionLanguageModel #SpeculativeDecoding Issue Date: 2026-09-25 Comment
元ポスト:
When Do Larger Batches Help Scale LLM Reinforcement Learning?, Tencent RL Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #One-Line Notes #CriticalBatchSize Issue Date: 2026-09-24 Comment
元ポスト:
目標性能まで到達するまでに必要なwall-clock timeとLLMでのオンポリシーRLのバッチサイズの関係性を明らかにしているようである。
LLMのオンポリシーRLでは、生成と学習においてバッチサイズの大きさが非対称に働く(すなわち、生成側の並列数を増やすとモデルの重み転送をより多く共有できるため処理に要する時間が短縮されるが、学習側でバッチサイズが増えると処理時間は増加する)ため、生成側の並列数の変化によるスループットの向上と、学習側のバッチサイズによる更新に必要なサンプル数の両方を考える必要がある。
このとき、目標性能に到達するまでに必要な累積応答数N(学習側)、エンドツーエンドのスループットq(生成側だけではなくシステム全体)を考える。
これにより、バッチサイズを変化させた時に必要なサンプル数の変化の比率r_N (=N/N_pivot, r_Nが1より大きい場合は、新たなバッチサイズが基準となるバッチサイズよりも、ある性能に到達するまでより多くの応答を必要とする)、
スループットの変化の比率r_q(=q/q_pivot, r_q>1の場合は、1秒あたりにより多くの応答を処理できる)を定義でき、
r_q > r_Nの場合、すなわち、バッチサイズを大きくしたことによる、システムのエンドツーエンドのスループット向上による恩恵が、学習側のサンプルコストの悪化を上回った場合に、バッチサイズを大きくすることで学習が高速化される、このときの改善の度合いは r_N/r_q で測ることができる。例えば、r_N/r_q=0.8の場合、学習時間が20%削減されることを意味する、といったフレームワークを定義でき (The criterion部分を参照)、
実践的には、
- 候補となるバッチサイズについて、学習率や関連するハイパーパラメータを調整し、学習に利用される応答単位での学習に対する寄与を揃え、累積応答数が等しい点での学習曲線を比較することで、r_Nを推定し
- 与えられたバッチサイズにおいてシステムのスループットを最大化する設定を探索し、r_qを測定する
- その上で、r_N/r_qを測定し、最も学習時間が短縮されるバッチサイズを採用する
というプロセスにおとしこむことができる(conclusionを参照)
という感じの話のようにみえる。
Contrastive Language Models: A System One Model for Fast and Generalizable Decision-Making, Kwok+, 2026.09
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #ContrastiveLearning #OpenWeight #Scaling Laws #mid-training #PostTraining #Selected Papers/Blogs #Encoder #Author Thread-Post #SystemOneModel Issue Date: 2026-09-24 Comment
元ポスト:
HF: https://huggingface.co/Contrastive-LM
非常にコンパクトにまとまっていて大変読みやすかった。あとでまとめる。
Rigel Base: Reaching Llama-3.2 Quality with <1% of its Compute, Mayank+, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #read-later #DataMixture #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-23 Comment
NoPEやuPを利用、事前学習では6つのフェースで異なるDataMixtureを利用しそのレシピも記載
Introducing GPT‑6 Sol and Luna, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-09-23 Comment
元ポスト:
luna, solに関しては、AA Index上では大きな変化はないように見えるが、コスト性能比が改善しているように見える:
5.6-luna, solと比較するとコストが約半額となっている。やーすい
Introducing Claude Opus 5.5, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection Issue Date: 2026-09-23 Comment
元ポスト:
KernelBench-MegaのRTX PRO 6000向けにKimi Linearのデコード向けのメガカーネルを記述するベンチマークでAstraを超えてSoTAを達成したようである:
所見:
所見:
GPTはeffortの増加に従い単調増加だが、Claude系はそうならない
PixVerse R2: Scaling Real-Time Omni World Models, PixVerse, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #read-later #WorldModels #Scalability #Realtime Issue Date: 2026-09-23 Comment
元ポスト:
Computational depth is all you need: Towards 107-layer neural nets, Akshay Vegesna, Samip Dahal, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Scaling Laws #read-later #Depth #Author Thread-Post Issue Date: 2026-09-23 Comment
元ポスト:
Measurements for understanding the pace of AI development inside frontier labs, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
所見:
Introducing Astra for Law, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #Legal #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure, Z.ai, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Infrastructure #AIAgents #SelfImprovement #SoftwareEngineering #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-09-19 Comment
元ポスト:
GLM開発におけるRSIよ初期の事例
Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Transformer #SmallModel #Proprietary #Architecture #Selected Papers/Blogs #One-Line Notes #ToolUse #Author Thread-Post #SystemOneModel Issue Date: 2026-09-19 Comment
元ポスト:
チャットをせず、各ターンごとに関数呼び出しに特化したedge向け小型モデルとのこと。アプリが利用するツール群を渡し、ユーザの発言に基づいて全ての引数を埋めて関数を呼び出す、あるいはスキーマを与えればそのスキーマに則った出力を返し(構造化出力)、推測はしない(関数の範囲外のものは空出力)というもののようである。
これらは、simple attention networkと呼ばれるもので実現される。simple attention networkはtransformerからFFN Layerをを無くし軽量なHadarmard MLPというlayerに置き換え、FFNが従来保持していた知識に関する情報はengramによって、n-gram embedding側に持たせることによって高速、軽量化がじつげんされているようである。residual streamとしては、mHCが用いられているようである。
また、デプロイ時にモデルの深さを指定することで、20個あるうちのどのlayerを利用するかが決まり、性能とコストを調整できるようである。これを公式ポストではIntelligence Laddersと呼称している。
関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
と思想が似ている。
Jev’s Architecture Unmasked, Archer Hume, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #AIAgents #Coding #SoftwareEngineering #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
果たして
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Quantization #OpenWeight #ComputerUse #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-2
関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。
An alignment assessment of recent cybersecurity incidents, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Safety #Security #Monitorability Issue Date: 2026-09-17
Lean Verified Transformers, Sasha Rush, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #Transformer #Selected Papers/Blogs #reading #One-Line Notes #Proofs #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
証明のコストが下がることによって、Leanによって型式的な証明をされたML Codeの価値が高まるのではないかという筆者の予測と、
一方で、証明を全て理解することは依然として困難という課題があるのとに言及し、
落とし所として人間にとって理解しやすい(部分的に証明したい)数学的な性質を選択的にAIによって証明するという試みをやってみよう、
そのために、Transformerを例に、Transformerの最適化や効率化の礎となっている数学的な性質を実際にLeanを用いて型式的に証明し理解してみよう、その結果、たとえば、VanillaAttentionとFlashAttentionが数学的に等価だということも示せる、
このような証明したい性質が何であるかを人間が選び、証明を得られることになった変化は重要であり、これらを今後どう活用するかということは今後の挑戦だよね、という話が書かれているようである。
実際に駆動するML Codeで、特定のモデルが実装されているときに、そのモデルが本来備えるべき重要な数学的性質を満たす実装になっていることが、型式的に証明された上で公開され、型式的に証明済みのbadgeがリポジトリに付与されている、みたいな未来が来るのだろうなあ
Introducing Odyssey-3: A General-Purpose Physical Intelligence, ODYSSEY, 2026.09
Paper/Blog Link My Issue
#Article #FoundationModel #Robotics #WorldModels #EmbodiedAI Issue Date: 2026-09-17 Comment
元ポスト:
Superposition, Memorization, and Double Descent, Transformer Circuits Thread, 2023.01
Paper/Blog Link My Issue
#Article #Analysis #MachineLearning #Memorization #DoubleDescent Issue Date: 2026-09-17 Comment
元ポスト:
We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい
コストの試算:
Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。
現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。
Nature Is Our Learning Environment, Periodic Labs, 2026.09
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
Introducing System One Models & Jev, TypeSafe AI, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #reading #KeyPoint Notes #Reference Collection #Reading Reflections #SystemOneModel Issue Date: 2026-09-16 Comment
細かいことは全くわからないが、LLMのようなチャットモデルは超人的な性能なのになぜAGIに繋がっていないのかが常々疑問で、code+AIに特化したモデルを開発したとのことで、それはどのようなものかというと、
LLMは人間の好みとなる応答を返すように、autoregressiveにテキストを生成するが、
本ブログで紹介されているシステムSystemOneは意思決定に最適化し、並列で生成され、自由なテキストを返せないが構造化出力を高速かつ安価に生成可能で、キャリブレーションされた確信度を常に返す、
というもののようである。
着眼点はとてもおもしろいのだが、どの程度高度な推論をすることができるのだろうか?
現代では高度な推論は計算コストである程度賄っているため、安価で高度な推論もできるのでれば大きなブレイクスルーだが、その技術はLLM側にも適用できる可能性があり、結局いつかLLM側に追いつかれる、という可能性がある。
逆に高度な推論ができないのであれば、適用可能なスコープは限定的となる。
RLCDという技術はすでに先行事例があったようだ:
利用規約でJevに関するベンチマークスコアや性能を公開することが禁止されているようである:
所見:
JamC-QAのスコアは(GPT-5.6-lunaより)低く、日本特有の知識などには弱い可能性がある:
- 『JamC-QA』: 日本の文化や風習に特化した質問応答ベンチマークの構築・公開(前編), SB Intuitions, 2025.09
色々な動向を鑑みるに、Encoderか、Decoderかはさておき(利用者から見たらどちらでもよい気がするので)、
- zero-shotで様々なタスクに利用可能で
- latencyが非常に速くて
- コストが安価なモデル
という3つの要素が重要に思える。
chatはできないが、構造化出力/関数出力等が可能(なことで様々な分類タスク等に適用できる)というのは、latencyの速さとコストの安価さを得るための手段。エンコーダ、デコーダも手段の話。
過去にPFNがJevに相当する機能を開発しサービス化までしていた、という話がある(関連技術は幅広く特許を取得しているようである)。
なぜ需要を掘り起こせなかったのか、という点は考えてみるとおもしろいのかもしれない。
個人的にはいまJevが流行っぽい兆しを見せているのは、時期的なものが大きい気がしており、
- (Reasoningモデルの台頭によって) LLMのlatencyが悪い
- 多くのワークフローに組み込む場合に得たい出力が(おそらく)構造化出力(で、めちゃめちゃ賢い判断はそこまで必要とされない)
- モデルのトークン利用料が増加し、(おそらく)運用コストが課題となってきた
という課題に世の中が直面し始めて、課題感として持たれ始めていること、が背景としてある気がしており、ちょうどタイミング的に「安い、速い、(そこそこ)賢い」のJevが世の中に刺さったのではないか、という気がしている。
AI Infrastructure at Periodic, Periodic Labs, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Infrastructure #ReinforcementLearning #AIAgents #LLMServing Issue Date: 2026-09-16 Comment
元ポスト:
AHA LOOPED TRANSFORMER: Think deeper. Find your Aha. An open atlas of recurrent computation, adaptive depth, and latent reasoning., Yue Su, 2026.09
Paper/Blog Link My Issue
#Article #Survey #NLP #Transformer #Architecture #RecurrentModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-16 Comment
有志を募って、looped transformerに関する論文に関する情報を収集しているようである。submitするぞ!
元ポスト:
OM-1: Frontier Robot Intelligence, Learned Firsthand from Humans, Reward AI, 2026.09
Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #read-later #Robotics #Author Thread-Post Issue Date: 2026-09-15 Comment
元ポスト:
zero-shotだと...?
万字长文带你读懂 RSI(自进化,Self-Evolving), 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #SelfImprovement #KeyPoint Notes #autoresearch/RSI Issue Date: 2026-09-14 Comment
元ポスト:
中国語が読めないので、LLMの力を借りながら読んでいるが、RSIについての定義と、RSIに関する研究を整理、分類するためのTaxonomyを複数の軸から整理しているようである。以下LLMの力を借りて読んだ内容を自分の言葉も交えてメモとして残す。
---
RSIとは、Agentが環境との相互作用から得たタスク軌跡とフィードバックを利用して、自身の状態を更新し、更新後の状態を後続タスクに活用すること、と定義しているようである。
かなり広めの定義に見えるが、ざっくり言うとこのような定義になるのは、管理人の理解でもそうだと思う。
Agent = Model + Harness と捉え、RSIの何を変えるのか、という部分について以下の分類を用いて整理をしているようである:
- Parameter: 経験をモデルの重みに内在化する
- 一例: [Paper Note] Self-Adapting Language Models, Adam Zweiger+, arXiv'25
- Context: LLMへのInputに反映させる
- 一例: [Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
- Memory: 外部に保存された経験や情報として蓄積し、必要に応じて利用する
- 一例: [Paper Note] ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory, Siru Ouyang+, ICLR'26, 2025.09
- Skill: 次に同じ状況が起きたらどうすべきかをskillとして定義する。Memoryは過去の経験を蓄積するものであり、Skillは次どうするかを定義するという棲み分けをしている
- 以下は参考として管理人がピックしたもの
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02
(パラメータも最適化しているがSKILLBANKが該当すると思われる)
- [Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
- Harness Code: Agentを動作させるプログラム(Scaffolding)を変更する
- 一例: [Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
- 元ブログ中では↑が挙げられているが、Darwin Godel Machineの方が近いのでは?[Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
また、進化を構造化(バージョン管理)する際の分類軸として
- chain: A->B->Cのように進化させ常に最新版を利用する
- tree: 木構造でバージョンを管理する。ある1つの親ノードから子ノードが構成される親子関係で管理
- 一例: [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- graph: グラフ構造でバージョン管理する。すなわち、複数のノードに基づいて新たなノードを構成できる。ノードはバージョンだけでなく、タスク、trajectoryなども該当すると読める。
と整理しているようである。
誰がAgentを更新するかという軸の整理では
- self (student): (生徒)自身が更新する
- Teacher: trajectoryをteacherが分析しteacherが更新する
- Student + Teacher: 上記の両方で、生徒がまずtrajectoryを整理し必要な項目の候補を挙げ、Teacherが精査をし反映させる
いつ進化するのか、という軸では
- offline: 経験を蓄積し一括で更新する
- online: タスク実行ごとに動的に更新する
- hybrid: オフラインで更新した後にデプロイ。デプロイ後もオンラインで新たな経験等を追加し動的に更新するような方式
と定義しているようである。
そのほかにも、補足的な分類軸として、
- acceptance criteria: 更新したものを反映する基準
- feedback source: feedbackの出自(ベンチマーク, 環境, verifier, LLM, 人間など)
- feedback type: score, non-score,
- update frequency: 更新頻度
- scope of experience: 経験がどのスコープまで利用可能なのか(generickに使えるのか、特定ドメインのみなのか等)
We Must Pace the Frontier, Dario Amodei, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #SelfImprovement #Safety #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-13 Comment
元ポスト:
果たして。
独占禁止法で訴えられているとのこと:
ApprenticeBench: The first end-to-end benchmark of computer use, continual learning, and long-horizon agentic capabilities, set in a real job., NeoCognition, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #One-Line Notes #ContinualLearning Issue Date: 2026-09-13 Comment
元ポスト:
Computer Use + Continual Learningに関するベンチマークで、仮想的な建設会社の経理担当として入社し、一定の見習い期間(7ヶ月)を経て、その期間に企業のハンドブックやERPシステムチュートリアル、過去の請求書などで学習をする想定。その実際の請求書処理をこなしていくが、そこには実務上の罠が多く意図的に仕掛けられているようで、Human Baselineでも成功率は51%。最終的にHuman Baselineを上回ったのはAstra, Fable 5.1のようである。モデル間の傾向の違いなども考察されているようである。
North-Small-Translate-1.0, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #OpenWeight #Author Thread-Post Issue Date: 2026-09-11 Comment
元ポスト:
Introducing SWE-2: Pushing the Pareto Frontier, The Cognition Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #One-Line Notes #Author Thread-Post Issue Date: 2026-09-11 Comment
元ポスト:
Kimi-K3をベースに事後学習を通じてAstra, Fable 5.1と同等程度のSWE系ベンチマークスコアを獲得
Estimating GPT-6 Astra’s no-CoT Time Horizon, Francis Rhys Ward and Dewi Gould, LW, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Chain-of-Thought #Evaluation #Reasoning #read-later #Author Thread-Post Issue Date: 2026-09-10 Comment
元ポスト:
Muse, your personal AI agent that gets things done, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #AIAgents #Personalization #GenerativeAI #Author Thread-Post Issue Date: 2026-09-09 Comment
元ポスト:
16年前に思い描いた未来像までとうとう到達したなあ...(小並感)
Inside the megakernel serving engine for North Mini Code, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #LLMServing #One-Line Notes #GPUKernel #Author Thread-Post Issue Date: 2026-09-09 Comment
github: https://github.com/cohere-ai/cohere-megakernel
バッチサイズ1, 256k context、単一H100利用の条件下において、vLLM v0.24+FlashAttention3+Triton MoE backendよりも最大1.58倍デコーディングが高速(合成されたKV Cacheによる実験、実プロンプト+バッチサイズ8でも1.25--1.41倍高速)な実験的なLLM Servingエンジンのようである。
LLMのデコードを単一のカーネルに集約し、デコーディングのために必要な様々なステップごとの同期のオーバヘッドを削減したのだとか。
元ポスト:
Introducing ChatGPT Images 2.5, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #Proprietary #Editing #ImageSynthesis #Author Thread-Post Issue Date: 2026-09-09 Comment
元ポスト:
スケッチを入力することが可能になったようだ
On the Navier–Stokes Millennium Prize Problem, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #GenerativeAI #Mathematics #Selected Papers/Blogs #Proofs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-09 Comment
あのペレルマン氏が証明したポアンカレ予想と並ぶミレニアム懸賞問題の一つである、ナビエストークス方程式の解の存在と滑らかさ、とやらがOpenAIが保有する未公開モデルによって証明されたかもしれないらしい。10000の協調エージェントによって88時間, トークン量は1300億トークンで解に到達したのだとか。
元ポスト:
解説:
Research acceleration: The view inside OpenAI, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #GenerativeAI #SelfImprovement #ScientificDiscovery #autoresearch/RSI Issue Date: 2026-09-08 Comment
元ポスト:
Automation’s Early Footprint: Where AI Agents Are (and Aren’t) Being Built, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #AIAgents #Evaluation #read-later Issue Date: 2026-09-07 Comment
元ポスト:
Steering towards “automated grading” degrades alignment, Betley+, LW, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #read-later Issue Date: 2026-09-07 Comment
元ポスト:
从 LR(学习率) 到 ELR(有效学习率),重新理解大模型预训练的调度策略, 发布于, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #read-later Issue Date: 2026-09-06 Comment
元ポスト:
Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
397Bモデルに対するDPPOによる事後学習によってAPEX-Agentsのスコアを+11.2%を実現するための取り組みと地検が共有されているようである。
関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
BenchMIRT: What are LLM benchmarks actually measuring?, Ai2, 2026.09
Paper/Blog Link My Issue
#Article #Evaluation #Safety #Author Thread-Post Issue Date: 2026-09-06 Comment
元ポスト:
Atlas: A World Model for Spatial Intelligence, World Labs, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Transformer #DiffusionModel #Proprietary #read-later #Selected Papers/Blogs #3D Reconstruction #WorldModels #SpatialUnderstanding #Author Thread-Post #4D(Scene + Time) Issue Date: 2026-09-06 Comment
元ポスト:
解説:
Introducing Muse Voice Transcribe, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #SpeechProcessing #Proprietary #AutomaticSpeechRecognition(ASR) #AudioLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-06 Comment
Meta Superintelligence LabによるASRモデルで、多言語対応。日本語にも対応しているようである。Artificial AnalysisによるWERによる評価ではSoTAのようである。
元ポスト:
Alexandr Wang氏によるポスト:
Orbis: Our foundation model that creates living worlds and streams them in real time, Visko, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Proprietary #VideoGeneration/Understandings #interactive #TextToVideoGeneration #Realtime #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-06 Comment
元ポスト:
リアルタイムに、かつテキストでのインタラクティブな指示を与えつつ動画を生成できるモデルに見える。
How Far Are We from a Native Autoregressive Video Model?, Weiyang Jin, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #read-later #VideoGeneration/Understandings #Author Thread-Post Issue Date: 2026-09-06 Comment
元ポスト:
TimesFM-3: A zero-shot foundation model for multivariate forecasting, Google Research, 2026.08
Paper/Blog Link My Issue
#Article #TimeSeriesDataProcessing #FoundationModel #OpenWeight #Author Thread-Post Issue Date: 2026-09-06 Comment
元ポスト:
HF: https://huggingface.co/google/timesfm-3.0-pytorch
公式:
TERMINAL-BENCH 4.0, TERMINAL-BENCH, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Live #Initial Impression Notes Issue Date: 2026-09-05 Comment
元ポスト:
新しいタスクを追加する方向性ではなく、既存のタスクで課題(拒否、正解が公開、品質面等)があるものや飽和したものを改善、評価実行時のタイムアウトやエラーなどのリソース面の改善をし測定誤差の低減なども実施しているようである
所見:
Introducing H3 Max by fal, fal, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Proprietary #VideoGeneration/Understandings #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-04 Comment
元ポスト:
Minimax H3を事後学習(指示追従とvisual qualityを改善)することで、Artificial Analysisによる評価でSoTAを達成した動画生成モデルとのこと。
Introducing K2 Horizon: Frontier Performance, Radically Open, Institute of Foundation Models, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-09-04 Comment
元ポスト:
所見:
HF: https://huggingface.co/collections/IFM/k2-horizon
GPT-5.6-luna級の性能を375B-A23Bで実現されているように見え、データ、レシピ、コード、重みが公開される。
Introducing Muse Spark 1.3, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-04 Comment
元ポスト:
早くもGPT-5.6-Solと同等以上の性能に到達した模様
long context性能が良さそうに見える:
と思いきや、(Museに限らないが)MRCRのスコアにはコンタミネーションの疑いがある。
Artificial Analysisによる評価:
Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:
GPT-6 Astra: A new generation of intelligence, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-04 Comment
元ポスト:
GPT-5.6 Solから大幅に性能向上。scaling lawはいつまで続くのだろうか
ベンチマーク上は
- Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
を超えている。
所見:
アーキテクチャに関する所見:
- [Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
- [Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25
より注意深く指示に従い、CUAの能力も大幅に向上しているようである:
CUAによってBlenderで作成されたhouseの例がなかなかすごい
Artificial Analysisによる評価によると、Artificial Analysis Indexでは5.6-Solと同等、Coding IndexでもFable 5と同等であり、OpenAIによるベンチマークスコアとかなり乖離があるように見える。パブリックなベンチマークに対して過剰に適合しているのか。それともArtificial Analysisのベンチマーク群とその重みづけにより算出されるスコアの相性が悪いのか。(まあこれを考えても不毛だけど)
SRE-Benchと呼ばれるモデルがコンパイル済みのバイナリからソフトウェアをリバースエンジニアリングできるかを測定するベンチマークが飽和したとのこと:
SRE-Bench:
https://benchlm.ai/benchmarks/srebench
所見:
Artificial Analysis Indexのスコアが更新されてFable 5.1とAstraのスコアが同じになったようである😅:
RSI-Exam: Benchmarking Recursive Self-Improvement through Executable Research, RSI-Exam, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
Hugging Face のインシデントと今後の道筋, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Security #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
の件の調査結果のようである。
GLM-5.3-Flash: Frontier Intelligence, Flash Cost, Z.AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
HF: https://huggingface.co/zai-org/GLM-5.3-Flash
320B-A18BでOpus 4.8相当のベンチマークスコアを達成
アーキテクチャ解説:
- KDA
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- DSA
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
- mHC
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
所見:
本ポストにある通り、中国系のOpenWeightモデルは
- linear attention
- sparse attention
- mHCのようなResidual Streamに対する工夫
- Muon
などを採用するのがデファクトとなっているように思われる。
所見:
Introducing S1: In-Context Learning for Robotics, Skild AI, 2026.08
Paper/Blog Link My Issue
#Article #In-ContextLearning #Robotics #EmbodiedAI #One-Line Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
- GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist, 2026.08
に続いて、もう一つの単一のdemonstrationでfinetuningなしでICLできる事例。この例では10分程度の調理タスクをICLで実現できたとしている。
Mitigate Silent Expert Death in Ultra-Sparse MoE, Jin+, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #LanguageModel #MoE(Mixture-of-Experts) #One-Line Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
sparse MoEモデルを学習する際に、浅い層のexpertが機能しなくなっていく(重みのノルムが非常に小さくなり学習シグナルも消失し回復しない)にもかかわらず、ロードバランシングは正常なままという現象を観測し(Silent Expert Death)、公開されているMoEモデルでも同様の現象が生じていることを確認。LM Loss as Auxiliary Loss (LLAL)と呼ばれる、最初の数千ステップで浅いMoE Layerを一時的に言語モデルのheadに接続し、その後その接続を削除するような方法を用いると、loss・downstream task性能が改善し silent expert collapseも防止することができた、という話のようである。
LLALの気持ちとしては、非常にSparseなMoEの学習では、浅い層を学習するためのpressureが小さいことが問題であることが前提のもと、これを解決するために、まず浅い層のexpert数を削減する、あるいは異なる学習率やweight decayをチューニングするなどの方法も検討している。しかしこれらの方法は結局ハイパーパラメータ探索の沼に学習をするたびにはまってしまい嬉しくない。そのため、よりgenericに適用可能な学習方法として、安定していて、モデルの本来の学習目的と整合していて、expertの差別化を促すような性質のものが求められ、これを満たすものとしてnext-token-predictionを活用することを提案している。
浅い層のexpertが何を学習することを求められるかというと、一般的にはlexical-levelな情報を学習していることを求められるが、現状ではSilnet Expert Deathによってこれがうまく進んでいないことが懸念される。これを是正するために、シンプルに浅いMoE LayerをLM headに接続し、next-token-predictionのlossをより直接供給することで学習を促す、という気持ちのようである。
Introducing Pipette: A benchmarking suite for on-device intelligence, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #SmallModel #read-later #Author Thread-Post Issue Date: 2026-08-29 Comment
元ポスト:
Reinforcement Learning for LLMs: The Complete Guide, Cameron R. Wolfe, Ph.D., 2026.08
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #PostTraining #Author Thread-Post Issue Date: 2026-08-29 Comment
元ポスト:
RL creates split personas, LW, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Personality #reading #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
所見:
dots3-note Preview: A Small but Mighty Step Toward Long-Horizon Agency in Real Life, dots studio, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #OpenWeight #VisionLanguageModel Issue Date: 2026-08-22 Comment
HF: https://huggingface.co/dots-studio/dots3-note-prev
元ポスト:
LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #SmallModel #OpenWeight #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-08-22 Comment
HF:
https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-DSpark
他のLFM用のDraftモデルもある。
様々なLFM用のDraft Model
text-2-image-human-preferences-2m, Datapoint AI, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #TextToImageGeneration #DPO #One-Line Notes #ImageSynthesis Issue Date: 2026-08-21 Comment
21kのimageペアに対して2Mのpair-wiseでの人間のpreferenceが付与されたデータとのこと。500 promptに対して、30個のT2Iモデルが利用されている。
GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist, 2026.08
Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #In-ContextLearning #read-later #Selected Papers/Blogs #Robotics #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-20 Comment
元ポスト:
Embodied AIのFoundation Modelの話で、とうとう一つのデモンストレーションからタスクを学習できる(In-Context Learning)ようになったようである。
関連:
- GEN1: Scaling Embodied Foundation Models to Mastery, Generalist AI Team, 2026.04
所見:
解説:
Ornith-1.5: From Self-Scaffolding to Self-Improvement, Ornith, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #OpenWeight #SelfImprovement #reading Issue Date: 2026-08-20 Comment
HF: https://huggingface.co/collections/ornith-ai/ornith-15
元ポスト:
関連:
- Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
モデルを学習するためのタスク生成、scaffolding(e.g.,ヒントなどのタスクを適切な難易度に調整する足場を作ること)生成、解答の生成(ロールアウト)それぞれをself-improvementさせながら学習されたモデルとのこと。
AI Control: An Assessment of Frontier Practices, Guidelight, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Safety #read-later #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-19 Comment
著者ポスト:
元ポスト:
DataSmith: Automating Data Research, datologyai, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #SelfImprovement #One-Line Notes #Reading Reflections #Data #autoresearch/RSI #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment
元ポスト:
Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。
興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。
が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com
- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers, Aarsen+, 2026.08
Paper/Blog Link My Issue
#Article #Embeddings #read-later #Author Thread-Post Issue Date: 2026-08-19 Comment
元ポスト:
Accelerating GPT-5.6 Sol Ultrafast , cerebras, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Decoding Issue Date: 2026-08-18 Comment
元ポスト:
NanoGPT Speedrun Frontier, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #SelfImprovement #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-17 Comment
元ポスト:
所見:
18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。
[Tech] Why MLA and MTP Fight Each Other: Attention Through Arithmetic Intensity, ChangyiYang's Site, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Attention #Architecture #SpeculativeDecoding #reading #Author Thread-Post Issue Date: 2026-08-15 Comment
元ポスト:
Arithmetic Intensity := FLOPs per byte moved
しっかり読みたい
Introducing Toast 1, Mixedbread, 2026.08
Paper/Blog Link My Issue
#Article #NLP #Search #LanguageModel #AIAgents #One-Line Notes #Author Thread-Post Issue Date: 2026-08-15 Comment
GPT 5.6 Sol, Opus 5と同等以上の性能をもち、10倍安く、12倍高速なsearch agentとのこと。技術的な詳細は書かれていないように見え、ベンチマークの話が記述されている。
元ポスト:
Prime Intellectによるポスト:
Prime Intellectを通じて学習されたということは、大規模なAgentic RLを大規模なEnvironmentに対して実行したことが示唆される。
Prime Flash MoE - Faster MoE Kernels optimized for Blackwell, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MoE(Mixture-of-Experts) #reading #One-Line Notes #GPUKernel #Author Thread-Post Issue Date: 2026-08-15 Comment
元ポスト:
4k--128kのコンテキストに対して最大2.4倍高速なMoE向けCUDAカーネル。メモリ書き出しのトラフィックを大幅に削減することで実現。
Introducing NAC, an Open-Source Harness for Long-Running Agent Work, Arcee, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #LongHorizon #AgentHarness Issue Date: 2026-08-15 Comment
元ポスト:
Putting sign language AI into users’ hands, Google Deepmind, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #MachineTranslation #NLP #LanguageModel #MultiLingual #One-Line Notes #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
Sign-Language to Text (SL2T) Model
50種類以上の手話で学習された手話をテキストに翻訳するモデル。スマホのカメラを通じてリアルタイムにstreaming textとして翻訳される。
Reflections on Video DeltaNet, Haoyi Zhu, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #read-later #VideoGeneration/Understandings #LinearAttention #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
videoに対してdelta netのようなlinear attentionモデルを適用することに関する考察のようである。
MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost, MAI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #AIAgents #Coding #Proprietary #SoftwareEngineering #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
Paper/Blog Link My Issue
#Article #AIAgents #read-later #Selected Papers/Blogs #Security Issue Date: 2026-08-10 Comment
元ポスト:
所見:
所見:
関連:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
Multi-Agent Systems in PRIME-RL, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #Multi #NLP #LanguageModel #Infrastructure #ReinforcementLearning #AIAgents #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
TutorMoments: Do AI tutors know when to help and when to hold back?, Ai2, 2026.08
Paper/Blog Link My Issue
#Article #Education #read-later #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
Defending Against the Training–Inference Numeric Mismatch in RL (Especially Linear Attention) — and Whether It Helps Async RL, Yichuan Wang in collaboration with the TorchTitan team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #read-later #Selected Papers/Blogs #train-inference-mismatch #Initial Impression Notes #Asynchronous Issue Date: 2026-08-10 Comment
元ポスト:
linear attentionモデルにおいて、初めてRLにおけるtrain-inference mismatchを完全に解消した実装とのことで、非常にインパクトが大きそうに見える。
string2string Studio: Explore how strings line up, differ, or match, Mirac Suzgun, 2026.08
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
Not Diamond Code: intelligent model routing for coding agents, Not Diamond, 2026.08
Paper/Blog Link My Issue
#Article #Coding #SoftwareEngineering #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
2025年度GENIAC採択事業において収集・開発したロボット動作データセットおよびロボット基盤モデルを一般公開, AIRoA, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #OpenWeight #Robotics #VisionLanguageActionModel #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-10 Comment
Dataset:
https://huggingface.co/datasets/airoa-org/airoa-moma-5k
HF:
https://huggingface.co/airoa-org/airoa-pi05-hsr-base
元ポスト:
Kimi K3, The Manos, The Mythos, The Legendos, CHEN+, 2026.08
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Attention #MoE(Mixture-of-Experts) #read-later #Routing #Initial Impression Notes #LinearAttention #Author Thread-Post Issue Date: 2026-08-10 Comment
関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07
元ポスト:
以下のようなKimi K3で利用されている技術の解説:
- linear attention
- DeltaNet
- GatedDeltaNet
- FlashKDA
- Kimi Linear
- MLA
- Attention Residuals
- LatentMoE
- Quantile load balancing (QB)
- KVCache Efficiency
関連:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
- [Paper Note] Parallelizing Linear Transformers with the Delta Rule over Sequence Length, Songlin Yang+, NeurIPS'24, 2024.06
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
QBをチェックしたい
数学と理論計算機科学における10の進展, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #GenerativeAI #Mathematics #ScientificDiscovery #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-09 Comment
元ポスト:
歴史的な出来事になる可能性がある
Towards Looped Models Done Right, Huang+, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #read-later #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
関連:
- [Paper Note] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach, Jonas Geiping+, NeurIPS'25
- [Paper Note] Scaling Latent Reasoning via Looped Language Models, Rui-Jie Zhu+, arXiv'25, 2025.10
代表的なLooped Modelsアーキテクチャに対して、apple-to-appleな比較実験を実施し結果を考察しているようである。
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence, Google Research, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Hallucination #SelfImprovement #ScientificDiscovery #Verification #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
The Lost Accumulator, Bertolotti, Francesco, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #One-Line Notes #ResidualStream #LowPrecision #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
残差ストリームの精度はbf16で保存されるのが一般的で、70層以上の大きなモデルの場合、140回の累積演算を行うため、フル精度を保たないと誤差が蓄積し、学習に影響を与える可能性がある。実際に、bf16, fp32での残差ストリームのフル精度との差分や符号の反転を比較すると、fp32よりもbf16の方が誤差や符号反転の回数が、layerが深くなるにつれ顕著に大きくなった。
しかし、実際に3種類の幅・高さのバリエーションを持ったLlama3 1Bのバリエーションに対して、fp32、bf16の2種類の精度(つまり合計6種類のモデル・精度)で、FineWebから0.1Tトークンをバッチサイズ0.5M tokenで事前学習したところ、loss, downstreamタスクの性能共にほとんど差が見受けられなかった(唯一winograndeだけは差があった)、といった実験結果が記載されている。
筆者も示唆している通り、モデルのサイズや事前学習の学習トークン数の規模感が小さいので、より大きくしたら何か差は生まれるのだろうか。
Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #Embeddings #NLP #LanguageModel #Optimizer #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #Selected Papers/Blogs #memory #reading #Data #needs-revision Issue Date: 2026-08-08 Comment
元ポスト:
以下読んだ内容の個人的な理解の要約。誤りを含む可能性があるので元文献を読むことをおすすめします。めちゃめちゃ勉強になります。
- モデルの学習プロセスを与えられたデータD, アーキテクチャA, optimizer Oの下で、損失関数を最小化するプロセスとして定式化し、整理すると以下の3つの観点に分離できる
- L(E | D, A, O) = データ誤差 + 最適化誤差 + アーキテクチャ誤差 + 最適なアーキテクチャ・optimizerで学習したときにデータDが到達しうるloss
- ここで、Eはある理想的な分布(i.e., 無限に巨大なテストセット)であり、DはEのサンプリング結果にすぎない。
- L(E | D, A, O) は与えられたD, A, Oの下でモデルが理想分布E上で到達できる損失値を表している。
- 式(1)で示された不等式によって、ある制約のもとで、べき乗則の組み合わせの最小値を求めることができる。
- この不等式を用いて、L(E | D, A, O)に基づいて表現される Scaling Law(機械学習が持つ合理的な仮定に基づいて、学習に伴う様々な変数と最終的に到達しうるlossの関係性を表現した式)を整理していくことで、変数間の関係性を整理することができる。
- 記事中では、最適化誤差、アーキテクチャ誤差、データ誤差について、様々な合理的な仮定に基づいて Scaling Law をボトムアップに構築し、その際の考え方や、導き出した Scaling Law に実際の値をあてはめることで、既に文献で報告されている Scaling Lawと紐づけた考察が実施されている。
- 最適化誤差(学習率η、バッチサイズB、学習ステップ数Tの間の関係性):
- まず最適化誤差について着目し、合理的な仮定として「学習するほど効果が良くなる」という仮定のもと、ステップ数T, 学習率η, バッチサイズBを導入し、その関係性を記述する際の考え方を述べている(ステップ数が多いほど良い、学習率が大きいほどよい、学習はノイズの影響を受け、バッチサイズが小さいほどノイズは大きく、学習率が大きいほどノイズも大きい)。値が大きければプラスの効果をもたらすものはlossが下がると考えられるので負の指数を仮定し、値が大きいほどlossが増大すると考えられるものは正の指数を仮定し、その関係性を記述できる(式10)。
- これは式(1)で与えられた形と同じ形をしており、不等式の性質を用いて最適化誤差を最小化する最適な学習率、最適なバッチサイズ等を求めていくと、最適な学習率が与えられた上での、あるいは最適な学習率・最適なバッチサイズが与えられた上での Scaling Lawの式の形式が得られ、実際に理論的な解析から導かれた指数を代入し、下記研究で実験的に得られたScaling Lawとの比較を通じて考察をしている(たとえば、最適なバッチサイズは学習サンプル数Kの1以下のいあるべき乗に比例する、等)。
- Microsoft Law
- [Paper Note] Scaling Optimal LR Across Token Horizons, Johan Bjorck+, arXiv'24, 2024.09
- Step Law
- [Paper Note] Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining, Houyi Li+, arXiv'25, 2025.03
- アーキテクチャ差(パラメータ数N, 幅W, 深さHの間の関係性)
- 続いてアーキテクチャ差についても同様に合理的な仮定からスタートし(パラメータ数Nが大きいほどlossは小さくなる等)、同様に合理的な仮定のもと、式(1)を用いて関係性を整理していくことで、既存のScaling Lawとの関係性が考察されている。
- Kaplan Law
- [Paper Note] Scaling Laws for Autoregressive Generative Modeling, Tom Henighan+, arXiv'20, 2020.10
- Chinchilla Law
- [Paper Note] Training Compute-Optimal Large Language Models, Jordan Hoffmann+, NeurIPS'22, 2022.03
- 最適化誤差とアーキテクチャ誤差を統合した際の議論
- DeepSeek Law
- [Paper Note] DeepSeek LLM: Scaling Open-Source Language Models with Longtermism, DeepSeek-AI+, arXiv'24, 2024.01
- スパース性 / Memory:
- MoEやMemory (Embedding)等の、モデルの計算量とパラメータ数を分離する方法に関する Scaling Lawについても考え方が述べられている。
- たとえば、Denseモデルに対するScaling Lawでは計算量はおおむねパラメータ数Nに比例するという仮定があるが、MoEではそれに対して、総パラメータ数と活性化パラメータ数の比(スパース度S)を新たに導入し、計算量をおおむね活性化パラメータ数のみに依存するものと仮定する。
- スパース度Sを増やしても計算量は増えないが、損失は減るためスパース度を増やすことは(理論上は)基本的に有利に働く。
- 活性化パラメータ数N_act, 総パラメータ数N_totalを導入した過程からアーキテクチャに関するScaling Lawの式を整理すると、最終的にDenseの場合と同じ形式が現れ、N_act, N_totalから導き出される有効パラメータカウント N_eff のパラメータ数を持つDenseモデルと等価である、という見方もできる、などである。
- Ling Law
- [Paper Note] Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts
Language Models, Changxin Tian+, arXiv'25
- データ誤差
- 最後にデータ誤差に関する Scaling Lawについても考察されている。
- ただし、データに関しては様々な要因から影響を受けるだけでなく、かつデータそのものを表現する際に、他のものと比較して境界があいまいで、明確に単一のスカラーで定量化可能な変数を持ちずらく、統一された形式を得ることが難しい、ということも説明されている。
- [Paper Note] Prescriptive Scaling Laws for Data Constrained Training, Justin Lovelace+, arXiv'26, 2026.05
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23
下記ポストも非常に勉強になる:
AI が広げる人々の仕事, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #GenerativeAI #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。
このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?
MAI-Cyber-1-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Security #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
公式:
細かすぎて伝わらないChat Completions _ Responses APIのモデル間挙動差異, nyanp, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Reasoning #API #SoftwareEngineering #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
Scaling Automated Post-Training, Intology, 2026.08
Paper/Blog Link My Issue
#Article #PostTraining #read-later #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
Mixture-of-Kittens: our open-source MoE megakernel for NVL72s, Cursor, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
主要なOpenWeight LLM(アーキテクチャ)のスループットが軒並み2倍以上になっているので、これはかなりインパクトがでかい話に見える
関連:
- DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
- MoonEP, MoonshotAI, 2026.07
ポイント解説:
所見:
著者ポスト:
Scaling Video Pretraining with Imagination Models, induction labs, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #FoundationModel #VideoGeneration/Understandings #Reading Reflections #Author Thread-Post Issue Date: 2026-08-04 Comment
元ポスト:
動画で事前学習することでvision系タスクの基盤モデルとして有効に機能する、という話が最近増えてきたように感じる。
optimize_anything Goes omni: Composing Optimizers into Meta-Optimizer Pipelines, Shangyin Tan+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-08-04 Comment
元ポスト:
GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、
Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、
Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善
このようなパイプラインを実現するmeta optimiser-omniを実装している。
関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03
How much science is verifiable? Results from replicating ICML 2026 oral papers, SAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #ScientificDiscovery #read-later #Selected Papers/Blogs #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
ICML 2026のOralとして採択された論文の再現実験を通じて得られた知見がまとめられているようで、非常に面白そう。
WeirdChat: A catalog of unexpected AI behaviors, discovered automatically, Transluce, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Safety #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
OpenWeightモデルからの100M以上のレスポンスから、安全性やAlignmentに問題のある応答をサンプリングし、再現可能な形でまとめたカタログのようである。
エージェントスウォームと新しいモデルの経済性, Cursor, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #read-later #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
コストが最大15倍も利用するモデルにより変化したとのことだが、コードの品質はどの程度変化したのだろうか?(まだ読めていない
Language model harnesses are compositional generalizers, Zhang+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #Generalization #RecurrentModels #RecursiveModels #AgentHarness Issue Date: 2026-07-31
長時間稼働モデル時代の安全性とアラインメント, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Safety #LongHorizon #Security #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。
関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Introducing Cosmos 3 Edge, Nvidia, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #SmallModel #OpenWeight #VisionLanguageModel #Robotics #WorldModels #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
HF: https://huggingface.co/nvidia/Cosmos3-Edge?linkId=100000431533162
autoregressive -> diffusion の two-tower モデル
Cosmos3 テクニカルペーパー:
- [Paper Note] Cosmos 3: Omnimodal World Models for Physical AI, NVIDIA+, arXiv'26, 2026.06
Agentic World Models, Cameron R. Wolfe, Ph.D., 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #read-later #WorldModels #Author Thread-Post Issue Date: 2026-07-31 Comment
元ポスト:
How to train a frontier-level world model, Monso+, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #WorldModels #Author Thread-Post Issue Date: 2026-07-26 Comment
元ポスト:
A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Prompting #reading Issue Date: 2026-07-25 Comment
元ポスト:
Auto-Routing Models, dari.dev, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #SmallModel #Selected Papers/Blogs #Initial Impression Notes #Orchestration Issue Date: 2026-07-25 Comment
元ポスト:
HF: https://huggingface.co/dari-ai/router-slm
Sakana FuguのようなLLMプールの中からターン単位で適切なLLMを選択するオーケストレータ(ルータ)で、QwenのLoRA Weightとして学習された重みが公開されているようである。
関連:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
- Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
The fastest LLM on Earth: Frontier level intelligence, 15x faster, celeris, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Proprietary #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment
元ポスト:
アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。
Artificial Analysisによるoutput speed評価で1位:
stack-v3-full, HuggingFaceCode, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #Coding #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。
また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。
Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24
所見:
FRONTIER-BENCH V0.1: A benchmark to measure and evolve with the frontier of agent work, FRONTIER-BENCH, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #Live #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。
タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。
Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
Introducing Composite-Bench: the strongest open-weights model isn't Kimi K3, composite, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Evaluation #ComputerUse #VisionLanguageModel #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
エンタープライズ向けのサービスに基づく専門家の操作に基づくbrowser-useベンチマークのようである。ざっくりブログを読んだが実際にどのようなサービスなのか知らないためあまりよくわからなかったので、公開されているベンチマークを見る方が直感的な理解は捗りそう。
本ベンチマーク上では、GLM-5.2がOpenWeightモデルの中では最も性能が高いようである。
FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence, Black Forest Labs, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #TextToAudio #MultiModal #TextToImageGeneration #Proprietary #VideoGeneration/Understandings #Editing #UMM #One-Line Notes #ImageSynthesis #TextToVideoGeneration #WorldActionModel #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
モデルは将来的にオープンになるようである
Grok Build is open source: SpaceXAI's coding agent and CLI, SpaceXAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #One-Line Notes #AgentHarness Issue Date: 2026-07-23 Comment
元ポスト:
github: https://github.com/xai-org/grok-build
SpaceXAIによるcoding agent harness
所見:
Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search, Prime Intellect, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #PostTraining #One-Line Notes #Scalability #Environment Issue Date: 2026-07-23 Comment
元ポスト:
36.5kのagentic RLのためのenvironments。対象はSWE, Search, terminal。全てのタスクセットが、任意のハーネス、ランタイム上でone commandで実行可能とのこと。
Introducing Laguna S 2.1 Poolside team, Poolside, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight Issue Date: 2026-07-22 Comment
OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Evaluation #Safety #Attack #Video #Selected Papers/Blogs #Security Issue Date: 2026-07-22 Comment
Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026
元ポスト:
video: https://youtu.be/87DyyMV0kCY
関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
所見:
GPT‑Red: Unlocking Self-Improvement for Robustness, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Security #Initial Impression Notes #RedTeaming Issue Date: 2026-07-19 Comment
元ポスト:
redteamingに特化したGPT
Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-27b
Bonsaiシリーズ:
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
- Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
- Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
1-bit, ternary weightによって、27B級モデルがエッジデバイス上で動作する。
How We Serve Ideogram V4 Lightning Fast on fal, fal, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #OpenWeight #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
関連:
- Ideogram 4: Open image model at the forefront of design, Ideogram, 2026.06
Ideogramに基づいた、高速なTextToImage Modelのようである。
The 4-bitter Lesson: Balancing Stability and Performance in NVFP4 RL, Humans&, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #LowPrecision Issue Date: 2026-07-19 Comment
元ポスト:
How up-to-date is each AI model?, Apoorv Saxena, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #FactualKnowledge #One-Line Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
330種類の30ヶ月に及ぶ予測不可能なイベントに関する情報を持ちいてモデルの実際のknowledge cutoffを推定する
元ポスト:
The Future Worth Building Is Human, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #NLP #GenerativeAI #read-later Issue Date: 2026-07-19 Comment
元ポスト:
Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
Paper/Blog Link My Issue
#Article #Controllable #NLP #LanguageModel #Reasoning #Length #read-later #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
OpenAIのReasoning Effortについては調整方法が公開されていないのでGPT-OSSのテンプレートなどから可能な方法を推測、そのほかOpenWeightモデルについてはテクニカルレポートに記載されている情報からReasoning Effortの調整方法が解説されている
PLaMoベースの強い日本語報酬モデルの構築, PFN, 2026.07
Paper/Blog Link My Issue
#Article #NLP #Japanese #read-later #RewardModel Issue Date: 2026-07-17 Comment
元ポスト:
Inkling: Our open-weights model, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #AudioLanguageModel #Author Thread-Post Issue Date: 2026-07-16 Comment
HF: https://huggingface.co/thinkingmachines/Inkling
元ポスト:
THINNING MACHINESによる最初のOpenWeightモデル。975B-41B
- フルスクラッチで学習したReasoningモデル
- 1M context window
- text, image, audio, video 45Tトークンで学習
- バランスよくさまざまな領域で性能を発揮するように訓練し、Tinker上でのfinetuningやカスタマイゼーションの良い基盤として機能することを目指した
- vision, audioドメインに関してはencoder freeアーキテクチャを採用
- audio signalの入力は dMel spectrogramsと呼ばれる手法を採用
- [Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
- 画像は40x40のパッチに分割され、4つのhMLPと呼ばれるレイヤーでエンコーディング
- [Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
- IFの訓練には、Rubric basedなgraderとclaims graderの2種類のgraderを用いることで、helpfulnessとhallucinationを同時に低減
- Rubric basedなgraderはチェックリストに基づいてスコアリング
- claims graderはfactualな主張をagentic web searchを通じてverificationする
- アーキテクチャはDeepSeek V3を踏襲し、256のexpertsと2つのshared expertを採用し、6つのexpertsがactivateされる
- SWAとGlobal attentionの比率は5:1でKV Headは8つ (GQA)
- **相対位置エンコーディングを用いることでRoPEよりもlong contextに対してより高い外挿性能を示した**
- [Paper Note] Self-Attention with Relative Position Representations, Peter Shaw+, NAACL'18
- K, Vのprojection後、**およびattentionとMLPが残差ストリームに合流する前にshort convolutionを導入**
- QKV projection後に convolution を導入するアーキテクチャは下記研究で提案
- [Paper Note] Primer: Searching for Efficient Transformers for Language Modeling, David R. So+, NIPS'21, 2021.09
- optimiserはMuonとAdamWのハイブリッドで、前者は巨大な行列の重みに対して適用し、そのほかは後者を利用
- 重み自体が多様体上に存在するように制約することが有効であったことに着想を得て、weight decayを学習率の2乗に連動させることでモデルの重みの大きさを安定させたとのこと
- Modular Manifolds, Jeremy Bernstein+, THINKING MACHINES, 2025.09
- [Paper Note] Why Gradients Rapidly Increase Near the End of Training, Aaron Defazio, arXiv'25, 2025.06
- 事後学習としては、まずKimi K2.5を含むOpenWeightモデルで合成データ上でSFTをし、その後合成、あるいは人間が作成したenvironment上で大規模なRLを実施
- RLは非同期RLを異様し、ロールアウト数に対して推論能力が対数線形にスケールした。
- 最終的に30Mロールアウト以上のRLを実施した
- システムメッセージを変更し、トークン単位のコストを調整することでreasoning effortを調整
- Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
- **276B-A12BのInkling-Smallもプレビュー段階にあり、agenticな能力においてInklingに近い性能を達成しており、今後公開予定**
1M context windowを実現した工夫は特に書かれていなかったように感じるが、よく使われるのはKV CacheをコンパクトにするためのSparse Attention、あるいはLinear Attentionなのに対し、本モデルでは使われていないように見える。linear attentionでなくとも、SWAとGlobal Attentionのハイブリッド、かつGQAによって、KV Cacheの肥大化を実用レベルで抑制できるのだろうか。また、外挿性能に関してはRoPEは採用せず、相対位置エンコーディングのを採用したという点が効いているのだろうか。1Mレベルでのcontextでの評価がなさそうに見えるので性能はよくわからない。
RoPEのlong contextでの限界を示した以下の研究を思い出した:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Artificial Analysisによる評価:
アーキテクチャでの目新しい点:
所見:
公式:
所見:
Reducing Doom Loops with Final Token Preference Optimization, Liquid.AI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Reasoning #read-later #Author Thread-Post Issue Date: 2026-07-12 Comment
元ポスト:
Workspace geometry, model by model., elie, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #OpenWeight #read-later #Interpretability #Initial Impression Notes Issue Date: 2026-07-12 Comment
元ポスト:
38種類のOpenWeightモデルのlayer間でのJ-lensの類似性を検証したとのこと
アーキテクチャが異なっていても非常にモデル間で類似しているようである。gemma-4やSLM(Qwen, GPT2)などは外れ値を含む模様
関連:
- Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07
Harness Engineering for Self-Improvement, Lilian Weng, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #SelfImprovement #read-later #RecursiveModels #Author Thread-Post #AgentHarness Issue Date: 2026-07-12 Comment
元ポスト:
Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase, databricks, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #AIAgents #Evaluation #read-later #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-10 Comment
元ポスト:
ハーネス選択によってトークン消費を1/2にでき、GLM 5.2のコストパフォーマンスが良いらしい
Separating signal from noise in coding evaluations, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #AIAgents #Evaluation #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-09 Comment
元ポスト:
SWE-Bench Proの約30%にタスクが評価として機能しないタスクが含まれているとのこと(SWE-Bench Verifiedと同じ流れでは)。
これらは、5人の熟練なソフトウェアエンジニアによる監査と、AI Agentによる監査結果を人間がレビューするプロセスの2つを介して同定された。
以下のようなものがある:
- 過剰に制約されたテスト: 実装の制約が強すぎて機能として正しいのにテストが通らず、かつプロンプトでその制約が明示されていない
- requlrementが不足したテスト: プロンプトでの推測することができない要件の漏れ
- 低カバレッジのテスト: 実装が不完全でも通過するテスト
- ミスリーディングなプロンプト: テストが求める要件とは異なる挙動に向かわせるプロンプト
これにより、OpenAIは以前SWE Bench Proを推奨していたがそれを撤回するとのこと。
SWE Bench Verifiedでも同様の事案があった:
- Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02
そしてSWE Bench Verifiedにおけるコンタミネーションやテストの問題点を改善したSWE Bench Proを構築した、という経緯だったはずだが、そのSWE Bench Proでも問題が見つかったという流れである。
あと、そもそもSWE Bench Proで問題のなかった70%で評価したら現在のモデルのスコアはどうなるのだろうか?
interpreting GPT: the logit lens, nostalgebraist, 2020.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Selected Papers/Blogs #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment
LLMの中間層のhidden_state(残差ストリーム)に対して、出力層を連結しnext tokenを予測することで、当該中間層でどのようなトークンが想起されているかを可視化する
Introducing Rampart, National Design Studio, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Privacy #One-Line Notes #PII #Author Thread-Post Issue Date: 2026-07-08 Comment
HF: https://huggingface.co/nationaldesignstudio/rampart
生成AIに送信されるリクエストを検閲し、プロンプトに含まれる個人情報をマスクするよう訓練された軽量モデルのようである。ブログ下部のデモンストレーションを見るとイメージを掴みやすい。
元ポスト:
The optimizer that outlived its proof: A case study on Adam, Sadhika Malladi, 2026.07
Paper/Blog Link My Issue
#Article #Optimizer #read-later #Author Thread-Post Issue Date: 2026-07-07 Comment
元ポスト:
[Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 Comment
RLによる事後学習の際にtrainer側のoptimizerが1 step学習した後にinferenceエンジンに重みをpushするが、BF16でのRLにおける1 stepの更新では多くのモデルの重みに変化はなく(99%程度)、差分だけをpushすればlosslessで2桁程度trafficを削減できて、RDMAが不要でたとえばイーサネットベースのデータセンターを跨いだ環境でもRLが実行できそうだよ、という話のようである。
元ポスト:
DiffusionGemma: The First Diffusion LLM (dLLM) Natively Supported in vLLM, vLLM, 2026.06
Paper/Blog Link My Issue
#Article #DiffusionModel #LLMServing #read-later Issue Date: 2026-07-05 Comment
元ポスト:
関連:
- [Paper Note] How Transparent is DiffusionGemma?, Joshua Engels+, arXiv'26, 2026.06
Disaggregated Inference: 18 Months Later, Chen+, Hao AI Lab, 2025.11
Paper/Blog Link My Issue
#Article #LanguageModel #LLMServing #read-later Issue Date: 2026-07-05 Comment
元ポスト:
Using Local Coding Agents, Sebastian Raschka, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #Coding #OpenWeight #LLMServing #SoftwareEngineering #Author Thread-Post #AgentHarness Issue Date: 2026-07-05 Comment
元ポスト:
報酬ハッキングがモデルの知能向上を食い潰している, Cursor, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #ReinforcementLearning #AIAgents #Evaluation #RewardHacking #Selected Papers/Blogs #One-Line Notes #Contamination #Author Thread-Post Issue Date: 2026-07-05 Comment
元ポスト:
SWE Bench Proにおいて、公開リポジトリやリポジトリの履歴にアクセスすることを厳格に禁止したハーネスを用いてproprietaryモデルを評価したところ標準的なハーネスと比較してスコアが大きく低下した。どれだけスコアが減少したかはモデルごとに異なり、たとえばOpus 4.8系のモデルでは8.1--9.1ポイント程度、GPT5.5系では2.6 -- 3.4%程度スコアが低下した。最近のモデルほどスコアが低下する傾向がある、という話のようである。たとえば、731件のOpus 4.8 Maxのtraceを監査用のモデルを用いて調べると、traceの57%において公開リポジトリでマージ済みのPR、または修正済みのソースファイルを見つけ修正をそのまま再現し、9%程度のtraceで.git履歴からバグ修正前後のコミットを検索しパッチを抜き出していた。モデルが協力になるにつれて、自身が評価中であることを認識し、既に与えられたタスクが解決済みであるためのヒントを見出し、RewardHackingのような挙動を示すような傾向にある、という話のようである。
実際にどの程度スコアに影響を与えていたかが見れるのは興味深い。
How agents are transforming work, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #AIAgents #Author Thread-Post Issue Date: 2026-07-05 Comment
元ポスト:
Introducing computer use in Gemini 3.5 Flash, Google, 2026.06
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Proprietary #ComputerUse #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-05 Comment
元ポスト:
quick start guide:
computer useがだいぶ使いやすくなってきたなあ(小並感)
The Verification Stack, OpenHands, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
コードがプッシュされる前にエージェントの作業を評価する小型のcriticモデルと、プルリクエストに対してコードレビュー(スキルを利用)+QAを実施するシステム(実際にエントリーポイントを見つけ、動作させ、証跡を資料としてまとめてレポートをポストするシステム)によってコードの検証プロセスを効率化し、マージまでの時間が平均58%削減され、開発効率が向上する話のようである。
Agentic RL: Frameworks and Best Practices, CAMERON R. WOLFE, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #read-later Issue Date: 2026-07-03
Speculative Decoding - The Bits and the Bytes, Aakash Kumar Nain, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Decoding #read-later #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
Sarashina3 guard: 日本語特化ガードレールモデル, SB Intuitions, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Japanese #Safeguard #Author Thread-Post Issue Date: 2026-07-02 Comment
元ポスト:
Learning to Replicate Expert Judgment in Financial Tasks, THINKING MACHINES, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Financial #PostTraining #read-later #Author Thread-Post Issue Date: 2026-07-02 Comment
元ポスト:
Your research partner for rigorous science, Claude, 2026.07
Paper/Blog Link My Issue
#Article #GenerativeAI #ScientificDiscovery #Science #Author Thread-Post Issue Date: 2026-07-02 Comment
元ポスト:
Simple, Fast, Vibe‑Ready ZCode combines the best AI agents with your existing tools so you can plan, code, review, and deploy without friction., Z.ai, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Initial Impression Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-02 Comment
元ポスト:
GLMのZ.aiによるAgent Harness (Scaffolding)
Introducing LongCat-2.0, LongCat, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-30 Comment
元ポスト:
- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD
HF:
https://huggingface.co/meituan-longcat/LongCat-2.0
現在はまだ公開されていないがモデルは上記で公開予定
Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象
LongCat Sparse Attentionポイント解説:
所見:
50k基のH800 GPUで学習されているとのこと。
所見:
ポイント解説:
Thinking to recall: How reasoning unlocks parametric knowledge in LLMs, Google Research, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #Reasoning #read-later #FactualKnowledge #Author Thread-Post Issue Date: 2026-06-26 Comment
元ポスト:
Introducing Claude Tag, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #NLP #AIAgents #GenerativeAI #Author Thread-Post Issue Date: 2026-06-24 Comment
元ポスト:
ポイント解説:
PLaMo 3.0 Primeをリリースしました, PFN, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Japanese #Author Thread-Post Issue Date: 2026-06-23 Comment
元ポスト:
Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Test-Time Scaling #Initial Impression Notes #Reading Reflections #Orchestration Issue Date: 2026-06-23 Comment
元ポスト:
所見:
Opus 4.8, Gemini 3.1 Pro, GPT 5.5(他にもありそう)のオーケストレータ
beta:
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
テクニカルレポート:
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
v1.1になり、新たに公開されたフロンティアモデルをルーティングに加えることで性能向上:
基本的に新たなモデルが公開されたらルーティングを更新すればFuguの性能も向上していくので、性能面でFrontier Modelに遅れをとる可能性は小さいと思われる。一方で、Fugu内部で商用APIを叩いた場合そのコストは他社のマークアップが上乗せされたものになると思うので、利用コストをどの程度抑えられるかがポイントになるだろうか。ただ、ターン単位で利用されるモデルが変更されるので、たとえばFable5を最も重要なプランニングで利用し、その後のフェーズではより安価なモデルを使う、といった柔軟なモデルの組み換えが可能なので、そこの最適化がされればタスクを完遂する際に特定の1モデルを利用するよりも結果的に安い可能性は高い。
分散推論基盤やその前提の考え方 〜高火力 PHYで作る分散推論基盤 vol.1〜, 道下幹也, さくらのナレッジ, 2025.11
Paper/Blog Link My Issue
#Article #LLMServing #read-later Issue Date: 2026-06-22 Comment
元ポスト:
Map of Sentence Encoders, Danu-Blog, 2026.06
Paper/Blog Link My Issue
#Article #Embeddings #Encoder #Visualization #Author Thread-Post Issue Date: 2026-06-20 Comment
元ポスト:
RL Systems Mind the Gap: Matching Trainer and Generator Throughput, Chen+, 2026.06
Paper/Blog Link My Issue
#Article #ReinforcementLearning #read-later #Selected Papers/Blogs Issue Date: 2026-06-17 Comment
元ポスト:
所見:
First Steps Toward Automated AI Research, Recursive Superintelligence, 2026.06
Paper/Blog Link My Issue
#Article #SelfImprovement #read-later #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-06-14 Comment
元ポスト:
word2vec, GloVe, Rucursive ModelのRichard Socher氏のポスト
Statement on the US government directive to suspend access to Fable 5 and Mythos 5, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #Selected Papers/Blogs Issue Date: 2026-06-13 Comment
元ポスト:
ありゃー、これはやばめかも...
所見:
-
-
Research ideas you can't be outscaled on., Anthea Li, 2026.06
Paper/Blog Link My Issue
#Article #Repository #ScientificDiscovery #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-06-11 Comment
元ポスト:
計算リソースやスケールよりも洞察が重要な研究アイデアを共有できるページのようである。興味深い。
Scaling Video Training with Parallelism, Chen+, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #read-later #Parallelism #3D (Video) Issue Date: 2026-06-11 Comment
元ポスト:
DiffusionGemma: 4x faster text generation, Google, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #DiffusionModel #OpenWeight #Author Thread-Post Issue Date: 2026-06-11 Comment
元ポスト:
関連:
- [Paper Note] How Transparent is DiffusionGemma?, Joshua Engels+, arXiv'26, 2026.06
- DiffusionGemma: The First Diffusion LLM (dLLM) Natively Supported in vLLM, vLLM, 2026.06
Towards Compositional Steepest Descent, Tilde Research, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Optimizer #Author Thread-Post Issue Date: 2026-06-06 Comment
元ポスト:
Understanding Self-Distillation and Privileged Information Distillation, Penaloza+, 2026
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Distillation #read-later #Selected Papers/Blogs #On-Policy #SelfDistillation Issue Date: 2026-06-05
Building a hill-climbing machine: Launching seven new MAI models, Mustafa Suleyman, MAI, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #TextToImageGeneration #Coding #Proprietary #TTS #ImageSynthesis #Transcript #Author Thread-Post Issue Date: 2026-06-03 Comment
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
元ポスト:
関連:
Artificial Analysisによる評価で、MAI Image-2.5がT2Iで2位, Image Editingが3位とのこと:
Is Frontier Asynchronous RL Solved?, Luke J. Huang, 2026.05
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #ReinforcementLearning #Selected Papers/Blogs #reading #Asynchronous #Author Thread-Post Issue Date: 2026-06-03 Comment
元ポスト:
Amazon Bedrock 経由で使える LLM の日本語ベンチマーク性能, yoheikikuta, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AWS #Evaluation #Japanese #KeyPoint Notes Issue Date: 2026-06-02 Comment
元ポスト:
Bedrock経由で利用できるLLMに対する llm-jp-evalの評価結果が、コストとパフォーマンスの双方の上で比較されている。Claude Opus 4.6(4.7, 4.8と比較して)のスコアが最も高く、日本語能力はベンチマーク上は平均スコアで見ると向上していないように見える。カテゴリごとの結果では、4.8がQAにおいて大幅にスコアが悪化しているのが興味深い。また、スコアを掲載して終わりではなく、全てのLLMが間違える個別の事例などもいくつか掲載されており興味深い。OpenWeightなLLMではKimi 2.5のコストパフォーマンスが最も良さそうに見えるが、Gemma4は評価に含まれていないので気になるところ。
日本語LLMの評価は
- Swallow LLM Leaderboard v2, Swallow LLM Team, 2025.08
も参考のこと。
On-Policy Self-Distillation: 言葉で学ぶ LLMの新たな学習パラダイム, ぶち, 2026.03
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #PostTraining #Selected Papers/Blogs #On-Policy #Reading Reflections #SelfDistillation Issue Date: 2026-06-01 Comment
元ポスト:
日本語でのOPSD解説で、細かい数式などよりも、何が重要で、なぜ今なのかといった気持ちのところが非常に重点的に説明されている。
後半の今後の課題の、どの程度の能力であればself teacherが成立するのか、どのような情報を与えると良いのか、といった話は、
- [Paper Note] Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why, Mohammadreza Armandpour+, arXiv'26, 2026.05
で模索されている。
また、OPSDの気持ち的な部分だけでなく、(簡単な)数式的な解釈、最近のサーベイなど、より詳細な情報は
- The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05
のブログにまとめられているので参照のこと。
RLVR時代におけるInference Framework: Weight Syncing編, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-06-01 Comment
元ポスト:
MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
次:
- RLVR時代におけるInference Framework: Weight Syncing編, Kazuki Fujii, 2026.05
Tips: Containerを利用したDL分散学習Libraryの開発環境, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #NeuralNetwork #Coding #SoftwareEngineering #One-Line Notes #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
次:
- MLエンジニアのための本質から理解するLLM推論 KV cache編, Kazuki Fujii, 2026.05
GPUクラスタのログインノード上にvscodeのRemote SSH接続をして作業をする際に、importの解決/補完/定義ジャンプ等のデバッグに有用な機能を有効化する3種類の方法について概説されている。特にその中の一つであるsandbox mirrorと呼ばれる方法は詳細に解説され、SIFをsandbox形式のディレクトリに展開し、その中のディレクトリをvscode側の設定に追加することで、コンテナにsessionをはらなくても有効化できる、といった話が書かれている。
Announcing Surya OCR 2: small, accurate, multilingual, Datalab, 2026.05
Paper/Blog Link My Issue
#Article #OpenWeight #OCR #Author Thread-Post Issue Date: 2026-05-31 Comment
HF: https://huggingface.co/datalab-to/surya-ocr-2
元ポスト:
Native RL APIs in vLLM, vLLM, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #SoftwareEngineering #PostTraining #reading #Asynchronous Issue Date: 2026-05-31 Comment
元ポスト:
所見:
Introducing Claude Opus 4.8, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #VisionLanguageModel #Reference Collection #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
ベンチマーク比較:
ビジネススキルを学習させると不誠実になる:
LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts, LiquidAI, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #OpenWeight #read-later Issue Date: 2026-05-31 Comment
Should we use genetics instead of system prompts for AI Agents & Personas?, Fyx, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #PostTraining #read-later #Personality #One-Line Notes #Reading Reflections Issue Date: 2026-05-31 Comment
元ポスト:
ゲノム文字列からキャラクターのペルソナを推論し出力に反映可能なLoRAアダプタを学習することによって、ゲノム文字列によってペルソナの条件付けを可能とするモデルに関する実験の報告のようである。
具体的には、まずゲノム文字列と、ペルソナに関するテキストを対応付ける。次に、ペルソナテキストを与えてモデルの応答を収集し、ゲノム文字列と(ペルソナのテキストなしで)収集したモデルの応答を用いてLoRAアダプタを学習する。これにより、LoRAアダプタはゲノム文字列から、ペルソナテキストによって応答づけられた応答を出力することを学習する、といった挙動を実現する。
ざっとみた感じLoRAアダプタとは書かれているが、学習手法が書かれていないような気がする。が、手法はおそらくSFTだと思われる。
これにより、prefillをするinput tokenが削減可能と思われるが、実用上はどちらかというと出力/reasoningトークンが圧縮される方がlatency/コストの双方から恩恵があるので、事後学習をして他の能力が劣化、あるいはAlignmentが悪化するリスクを背負ってまでやる価値があるかは怪しいな、という感想を持ったが、果たしてどうだろうか。
非常に大規模なユーザからの同時接続があり、キャラクターと対話できるようなサービスにおいて、キャラクターのペルソナテキスト(用途はペルソナだけには限らない汎用的な技術だと思うが)が97%圧縮できたら結構なインパクトがあるかもしれない。
LeRobot Humanoid: An Open, Low-Cost, 3D-Printed Humanoid for Robot Learning, LeRobot, 2026.05
Paper/Blog Link My Issue
#Article #Robotics #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
token speed: How fast is 10 tokens per second really?, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Decoding #Initial Impression Notes Issue Date: 2026-05-27 Comment
元ポスト:
これはおもしろい。トークンの生成速度を可視化可能なサイト
Synthetic Persona Pretraining: Alignment from Token Zero, Minder+, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Alignment #SyntheticData #Reasoning #Safety #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-25 Comment
元ポスト:
**事前学習の時点で**Harmful/良性/ニュートラルな文書にReflectionに関するassistantの思考過程(何が間違っていて/間違っていなくて、それはなぜか)をappendすることで、道徳的に推論することを学ぶ。
Autonomous AI research for nanogpt speedrun, PrimeIntellect, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #ScientificDiscovery #One-Line Notes #Author Thread-Post Issue Date: 2026-05-21 Comment
元ポスト:
nanogpt speedrun
- Modded-NanoGPT, KellerJordan, 2024.05
autoresearchをnanogpt speedrun (Track 3)で実施したところ、人間の最高記録を上回ることに成功した。この記録は既存のアイデアの組み合わせや、ハイパーパラメータの探索などによって等のもたらされた。一方で、完全に新規のアイデアの創出し改善するには上流にいる人間のヒントが必要となる弱点があることも浮き彫りになった。
AI Agentごとに挙動の性質が異なりOpus(Claude Code)は自律的なループを停止してしまったり、GPT(Codex)は自律的なループが止まることはないものの、同じハイパーパラメータを何度も繰り返し探索するなどの現象も見受けられた。
関連:
Violin: An open-source video translation skill that breaks language barriers, together.ai, 2026.05
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #AIAgents #3D (Video) #AgentSkills #SpeechToSpeech Issue Date: 2026-05-21 Comment
元ポスト:
demo:
https://www.violin-ai.com/
github:
https://github.com/shang-zhu/violin
MemEx: A Programmable Scratchpad for LLM Agents, Databricks, 2026.05
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #ContextEngineering Issue Date: 2026-05-20 Comment
元ポスト:
元ポスト:
Gemini Omni を発表, Google Japan Blog, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #SpeechProcessing #Proprietary #VideoGeneration/Understandings #Omni Issue Date: 2026-05-20 Comment
元ポスト:
