read-later (1126) — 5/6


Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-06 Comment

元ポスト:

Loading…

397Bモデルに対するDPPOによる事後学習によってAPEX-Agentsのスコアを+11.2%を実現するための取り組みと地検が共有されているようである。

関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #In-ContextLearning #Blog #Selected Papers/Blogs #Robotics #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-20 Comment

元ポスト:

Loading…

Embodied AIのFoundation Modelの話で、とうとう一つのデモンストレーションからタスクを学習できる(In-Context Learning)ようになったようである。

関連:
- GEN1: Scaling Embodied Foundation Models to Mastery, Generalist AI Team, 2026.04

所見:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Article #AIAgents #Blog #Selected Papers/Blogs #Security Issue Date: 2026-08-10 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…

関連:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #train-inference-mismatch #Initial Impression Notes #Asynchronous Issue Date: 2026-08-10 Comment

元ポスト:

Loading…

linear attentionモデルにおいて、初めてRLにおけるtrain-inference mismatchを完全に解消した実装とのことで、非常にインパクトが大きそうに見える。




Paper/Blog Link My Issue
#Article #Proprietary #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-10 Comment

元ポスト:

Loading…

ザッカーバーグ氏によるポスト:

Loading…

Alexandr Wang氏によるポスト:

Loading…

データ収集をオプトインするとtokenのコストが1/10未満になる。

GPT 5.6 Terraと同等程度のArtificial Analysis Index:

Loading…


Meta Superintelligence Lab立ち上げからここまで、すさまじいスピード感である。




Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Attention #Blog #MoE(Mixture-of-Experts) #Routing #Initial Impression Notes #LinearAttention #Author Thread-Post Issue Date: 2026-08-10 Comment

関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07

元ポスト:

Loading…

以下のようなKimi K3で利用されている技術の解説:
- linear attention
- DeltaNet
- GatedDeltaNet
- FlashKDA
- Kimi Linear
- MLA
- Attention Residuals
- LatentMoE
- Quantile load balancing (QB)
- KVCache Efficiency

関連:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
- [Paper Note] Parallelizing Linear Transformers with the Delta Rule over Sequence Length, Songlin Yang+, NeurIPS'24, 2024.06
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01

QBをチェックしたい




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Blog #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach, Jonas Geiping+, NeurIPS'25
- [Paper Note] Scaling Latent Reasoning via Looped Language Models, Rui-Jie Zhu+, arXiv'25, 2025.10

代表的なLooped Modelsアーキテクチャに対して、apple-to-appleな比較実験を実施し結果を考察しているようである。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Optimizer Issue Date: 2026-08-06 Comment

元ポスト:

Loading…

Muonよりもさらに高性能なoptimiserのようである。

関連:
- [Paper Note] Shampoo: Preconditioned Stochastic Tensor Optimization, Vineet Gupta+, ICML'18, 2018.02
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

主要なOpenWeight LLM(アーキテクチャ)のスループットが軒並み2倍以上になっているので、これはかなりインパクトがでかい話に見える

関連:
- DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
- MoonEP, MoonshotAI, 2026.07

ポイント解説:

Loading…

所見:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #RepresentationLearning #Self-SupervisedLearning #WorldModels #Author Thread-Post #LatentRepresentation Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

JEPA関連のチュートリアル

関連:
- [Paper Note] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture, Mahmoud Assran+, CVPR'23, 2023.01
- [Paper Note] LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, Randall Balestriero+, arXiv'25, 2025.11
- [Paper Note] LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels, Lucas Maes+, arXiv'26, 2026.03
- JEPAwiki, mishig, 2026.04

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Post #Initial Impression Notes #RewardSeeking Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07

Kimi K3における、評価されていると認識した上で評価作成者の意図の検討や、reference solutionに関する検討をするなど、ベンチマークに過度に最適化されているような挙動を示す現象に関する検討な模様。

関連:
- [Paper Note] Measuring Reward-Seeking via Contrastive Belief Updates, Axel Højmark+, arXiv'26, 2026.07




Paper/Blog Link My Issue
#Article #LanguageModel #Infrastructure #Post Issue Date: 2026-07-31 Comment

エネルギー効率の良いデータセンターを構築するにはどうすれば良いのか?といった話題のようで、とてもおもしろそうなので読みたい。

※ issueのタイトルは、ポストにタイトルがなかったため、私がポスト中の文言から切り出したもので、公式のタイトルではありません。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Blog #Proprietary #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。

Artificial Analysisによるoutput speed評価で1位:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #DiffusionModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-25 Comment

HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash

元ポスト:

Loading…

LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。




Paper/Blog Link My Issue
#Article #Controllable #NLP #LanguageModel #Blog #Reasoning #Length #Initial Impression Notes Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

OpenAIのReasoning Effortについては調整方法が公開されていないのでGPT-OSSのテンプレートなどから可能な方法を推測、そのほかOpenWeightモデルについてはテクニカルレポートに記載されている情報からReasoning Effortの調整方法が解説されている




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Blog #OpenWeight #Interpretability #Initial Impression Notes Issue Date: 2026-07-12 Comment

元ポスト:

Loading…

38種類のOpenWeightモデルのlayer間でのJ-lensの類似性を検証したとのこと

アーキテクチャが異なっていても非常にモデル間で類似しているようである。gemma-4やSLM(Qwen, GPT2)などは外れ値を含む模様

関連:
- Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Architecture #ContextEngineering #One-Line Notes #Author Thread-Post #AgentHarness Issue Date: 2026-07-07 Comment

元ポスト:

Loading…

関連:
- Fusion Harness: How to combine a more expensive main model and a sidekick model, Graham Neubig, GithubGist, 2026.06

高価で高性能なメインエージェントがタスクを管理し、安価なサイドキックエージェントがメインエージェントからタスクを移譲され処理をするようなアーキテクチャによって、メインエージェントで処理した場合と同等の性能を発揮しつつコストを削減できる。
image

似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #Selected Papers/Blogs #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-30 Comment

元ポスト:

Loading…

- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD

HF: https://huggingface.co/meituan-longcat/LongCat-2.0

現在はまだ公開されていないがモデルは上記で公開予定

Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象

LongCat Sparse Attentionポイント解説:

Loading…

所見:

Loading…

Loading…


50k基のH800 GPUで学習されているとのこと。

所見:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#Article #Blog #LLMServing Issue Date: 2026-06-22 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Coding #Selected Papers/Blogs #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-22 Comment

2週間にわたるopen endなプログラミングコンテストのデータを用いて人間の専門家とAI AgentのElo ratingの変遷を比較すると、序盤は人間に対して大きくリードしスコアは試行回数の対数に対して線形にスケーリングし次第に停滞を始めるが、人間の専門家は4日を超えたあたりから非線形にスコアが進化し、最終的にAI Agentよりも高いスコアを記録する。人間はAI Agentと比較して、継続学習ができていることが示唆され、AI Agentのlong horizonタスクに対する能力の限界が示唆される、という話に見える。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Slide Issue Date: 2026-06-21 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article Issue Date: 2026-06-13 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Reference Collection #LowPrecision #LinearAttention #Author Thread-Post Issue Date: 2026-06-05 Comment

元ポスト:

Loading…

アーキテクチャ解説:

Loading…


Mamba2 layer, Latent MoE, GQA

ポイント解説:

Loading…

HF: https://huggingface.co/collections/nvidia/nvidia-nemotron-v3

所見:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #Blog #PEFT(Adaptor/LoRA) #PostTraining #Personality #One-Line Notes #Reading Reflections Issue Date: 2026-05-31 Comment

元ポスト:

Loading…

ゲノム文字列からキャラクターのペルソナを推論し出力に反映可能なLoRAアダプタを学習することによって、ゲノム文字列によってペルソナの条件付けを可能とするモデルに関する実験の報告のようである。

具体的には、まずゲノム文字列と、ペルソナに関するテキストを対応付ける。次に、ペルソナテキストを与えてモデルの応答を収集し、ゲノム文字列と(ペルソナのテキストなしで)収集したモデルの応答を用いてLoRAアダプタを学習する。これにより、LoRAアダプタはゲノム文字列から、ペルソナテキストによって応答づけられた応答を出力することを学習する、といった挙動を実現する。

ざっとみた感じLoRAアダプタとは書かれているが、学習手法が書かれていないような気がする。が、手法はおそらくSFTだと思われる。

これにより、prefillをするinput tokenが削減可能と思われるが、実用上はどちらかというと出力/reasoningトークンが圧縮される方がlatency/コストの双方から恩恵があるので、事後学習をして他の能力が劣化、あるいはAlignmentが悪化するリスクを背負ってまでやる価値があるかは怪しいな、という感想を持ったが、果たしてどうだろうか。

非常に大規模なユーザからの同時接続があり、キャラクターと対話できるようなサービスにおいて、キャラクターのペルソナテキスト(用途はペルソナだけには限らない汎用的な技術だと思うが)が97%圧縮できたら結構なインパクトがあるかもしれない。




Paper/Blog Link My Issue
#Article #NLP #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-05-27 Comment

元ポスト:

Loading…

所見:

Loading…

既存のベンチマークのような、githubのPRに基づいたものではなく(memorizationの問題があるため)、ゼロベースで構築。rolloutのtrajectoryを分析して、有効なPRなのに拒否する、あるいは何らかのcheatingをするといった挙動のdetectionもできるとのこと。また、SWE Bench Proと比較して、タスクを解くためのpromptは1/2である一方、タスクを解くために必要なコードの量は5.5倍となっており、より複雑なタスクとなっている。

contamination-freeが主張されているが、データセットは公開されているので、そのうちcontaminationが生じるであろう点には注意。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Infrastructure #GPUKernel #Author Thread-Post Issue Date: 2026-05-26 Comment

元ポスト:

Loading…

> mKernel is our attempt at the missing piece: GPU-driven, fused kernels that deliver fine-grained compute–communication overlap across both intra-node NVLink and inter-node RDMA, while staying portable across various networking backends (ConnectX-7, AWS EFA, and more on the way).




Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #Pretraining #Transformer #MultiModal #ContrastiveLearning #Video #VisionLanguageModel #Backbone Issue Date: 2026-05-21 Comment

関連:
- [Paper Note] An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, Alexey Dosovitskiy+, ICLR'21
- [Paper Note] Sigmoid Loss for Language Image Pre-Training, Xiaohua Zhai+, ICCV'23
- [Paper Note] PaliGemma: A versatile 3B VLM for transfer, Lucas Beyer+, arXiv'24, 2024.07

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Routing #Initial Impression Notes Issue Date: 2026-05-11 Comment

元ポスト:

Loading…

従来のMoEモデルを学習する際には全てのトークンが全てのexpertsに対してroutingされるため、能力のごく一部しか必要ないにもかかわらず、experts全体をデプロイする必要があり効率が悪かった。本研究では、MoEモデルを学習する際に、ドキュメント単位で8個のshared experts poolに対してのみtokenがroutingされるように制約することで、特定のexpertsの集合が特定のドメインのexpertsとなることが奨励されmodularityが高まり、必要なexpertsのみをデプロイすることで効率化が図れるようになるので嬉しい、といった話に見える。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SSM (StateSpaceModel) #memory #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment

元ポスト:

Loading…

元ポストのGIFがわかりやすく、SSMにおけるStateの更新をgatingによって選択的に実施するモデル、という感じだろうか。これによりSSMの弱点であった、long contextにおけるrecall-heavyなタスクにおいてより高い性能を獲得する。




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #Reasoning #OpenWeight #OpenSource #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-08 Comment

元ポスト:

Loading…

関連:
- [Paper Note] MolmoAct: Action Reasoning Models that can Reason in Space, Jason Lee+, arXiv'25

dataset: https://huggingface.co/collections/allenai/molmoact2-datasets
models: https://huggingface.co/collections/allenai/molmoact2-models

著者ポスト:

Loading…

著者ポスト2:

Loading…

著者ポスト3:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Transformer #Attention #LongContext #Architecture #Selected Papers/Blogs #One-Line Notes #ContextRot #Author Thread-Post Issue Date: 2026-05-01 Comment

元ポスト:

Loading…

QK Norm, GQA, SWA, 事前学習のcontext長の短縮、これらはいずれもモデルが入力に対するattendの仕方を変えるものだが、これらを3つ以上組み合わせるとlong contextでの性能が急落するらしく、このようなlong contextの性能劣化は一般的な(しばしば短い)コンテキスト長のベンチマークやloss/perplexityなどでは検知できず、long contextで性能が急落するアーキテクチャでは、50Bトークンでのlong contextの学習を経ても、Llamaアーキテクチャが1Bトークンの学習で到達できる性能に届かない、といった話が元ポストに書かれている。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #Initial Impression Notes #vintage LLMs Issue Date: 2026-04-29 Comment

元ポスト:

Loading…

1930年以前の英語テキストで学習された言語モデル(vintage Large Language Models)で、歴史や文化の変化を分析したり、1930年までのデータで学習されたモデルが1931年以後に発見された革新的な科学的な発見を自ら見出せるか?、LLMが将来を予測する能力がどの程度あり、それがモデルサイズによってどのように変化するか?、プログラミングに関する知識がないモデルが現代のコーディングを学習できるかなどのcontamination freeな評価など様々な活用方法があるとのこと。

関連:
- Vintage Large Language Models, Owain Evans

所見:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Personalization #One-Line Notes #Sales Issue Date: 2026-04-26 Comment

元ポスト:

Loading…

AI同士が商取引をしたら何が起きるかという社内実験のようである。69人の社員に何を売りたいか/買いたいををインタビューし、カスタム指示が与えられた上でAI Agentに取引をさせたところ、きちんと商取引が行われ、186件、$4000のやりとりがあったとのこと。そして賢いモデルが大幅に有利に取引を終えて、実際の参加者はこの事実に気づかなかったとのこと。また、カスタム指示(e.g., 強行姿勢, 礼儀正しいなど)はあまり良い成果を上げる上では重要ではなかった、

といった話が元ポストに書かれている。




Paper/Blog Link My Issue
#Article #ComputerVision #Embeddings #NLP #MultiModal #Blog #Proprietary #Selected Papers/Blogs #KeyPoint Notes #Author Thread-Post Issue Date: 2026-04-25 Comment

元ポスト:

Loading…

単一のモデルで、マルチモーダルな情報を統合されたembedding空間で表現し、マトリョーシカ表現によって3種類の次元で取得でき、100+言語をサポートしかつcontext windowは8192。オーディオをわざわざ書き起こしてテキストモダリティに変換する必要もなく直接unifiedなembeddingを取得可能というなかなか便利そうな代物。

(以前のIssueを誤って削除したため再掲)

Generally Availableになったとのこと:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #GenerativeAI #Blog #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-04-25 Comment

元ポスト:

Loading…

賃金が最も小さいグループ、おより最も高いグループではClaudeによる生産性向上が最も大きく、職を失う懸念も同時に大きい。同様に、Claudeの利用量が多いグループも職を失う懸念が大きい。

アメリカにおいて代替されると思っていたソフトウェアエンジニアの求人がむしろ増えていて、AIによって新たな雇用が生まれているという意見もある:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #SyntheticData #Distillation #Selected Papers/Blogs #One-Line Notes #Reference Collection #Critic #Reading Reflections #Human-in-the-Loop #Author Thread-Post Issue Date: 2026-04-19 Comment

元ポスト:

Loading…

公式:

Loading…

解説:

Loading…


(詳細は解説や元ブログ参照のこと)
強い教師モデルから弱い生徒モデルを学習する場合の合成データ生成手法で、
生成したいデータの観点(内容、形式等)を分類し、どの観点からどの程度の難易度のデータを合成するかを制御する。その後生成されたデータが正しいか/正しくないかの2方向から批評を行いvalidationをするような枠組みのようである。

単純なデータ合成では性能がすぐに頭打ちになるが、ローカル多様性(特定のパターンの多様性)、グローバル多様性(データ全体がカバーするパターンの範囲)の2つを同時に大きくしないと不十分であることや、批判によるvalidationは少なくとも性能を悪化させることはないことも示されたとのこと。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Factuality #Blog #LLM-as-a-Judge #Test-Time Scaling #Reference Collection #Scalability #Initial Impression Notes Issue Date: 2026-04-17 Comment

元ポスト:

Loading…

Netflix上に存在するsynopses(映画の短いdescription)を高品質に保ちたいが、非常に量が多いのでどのようにスケーラブルに評価しているか、という話のようである。

LLM-as-a-Judgeを活用して評価をしており、4種類の観点(制度、事実性、トーン、明瞭さ)のような多次元のRubricを用いて、それぞれの観点ごとにLLM-as-a-Judgeを専門家の判断にalignさせるためにgold dataを作成し、どのように推論すればLLM-as-a-Judgeの性能が向上するかを調査した結果、long CoT / Majority Voting (精度向上+分散低下)/ Agents-as-a-Judge (複数のFactualityの側面を評価するために4種類のAI Agentを用いてメタデータとsynopsesのFactual Consistencyを評価し、全てのエージェントの結果を集約)といった感じのことをやっているらしい。




Paper/Blog Link My Issue
#Article #Author Thread-Post Issue Date: 2026-04-16 Comment

HF: https://huggingface.co/collections/prism-ml/ternary-bonsai

- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03

の次世代モデル。

前回リリースからまだ1ヶ月しか経っていない。デコーディング速度が速いのでその分RLによるPostTrainingも高速なのだろうと推察される。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-04-11 Comment

元ポスト:
-

Loading…

-
Loading…

元ポストのベンチマークスコアを見るとマルチモーダルの性能はフロンティアモデル(gpt5.4, Opus 4.6, Gemini 3.1 Pro)と同等、text/reasoningはフロンティアモデルより少しスコアが低く、特に抽象的な思考が苦手(ARC-AGI-2)。HEALTH分野はhealthは高スコアだがmedicalは少し低めのスコア、Agenticな分野では、SWE Bench Verified/Proよスコアは少し低め、terminal useは明確にスコアが低くtool useは少しスコアが低い、という感じにみえる。

codingとlong horizon taskに継続的に投資するとのこと。

中の人による解説:

Loading…


全てをフルスクラッチから作り直したっぽい。

Artificial Analysisによる解説:

Loading…


一気にOpenWeight最強のGLM-5.1超え

所見:

Loading…

所見:

Loading…

所見:

Loading…


第三者によるおそらく独自のベンチマークによる評価の結果、(おそらく101モデルのうち)全体で3位となっているらしい(つまり、既存ベンチマークにoverfittingしているわけではないという考えがある)。




Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #Evaluation Issue Date: 2026-04-11 Comment

元ポスト:

Loading…

GDPvalだけでなく、RLI, APEX Agentsと呼ばれるものも解説されているようである

- REMOTE LABOR INDEX (RLI) : Evaluating the capability of AI agents to perform real-world, economically valuable remote work
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks, Tejal Patwardhan+, arXiv'25, 2025.10




Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Selected Papers/Blogs #Initial Impression Notes #AgentHarness Issue Date: 2026-04-05 Comment

LLM, Reasoning Model, Agent, Agent Harness, coding harnessなどの定義とその役割やスコープ、そしてそれらを構成するためのminimalなコンポーネントについて説明されており、基礎的な理解に役立ちそう。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #mid-training #Initial Impression Notes Issue Date: 2026-04-04 Comment

元ポスト:

Loading…

mid trainingにおいてalignment関してmisaligned/alignedな文書で学習をすると中間学習直後はalignmentに関する挙動が維持されるが、RLをしたらその効果は消えて無くなってしまう、という感じだろうか?超絶流し読みなので、後でしっかり読んだ方が良さそう。




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #MultiModal #OpenWeight #MoE(Mixture-of-Experts) #ComputerUse #VisionLanguageModel #One-Line Notes #GUI #Environment Issue Date: 2026-04-02 Comment

元ポスト:

Loading…

HF: https://huggingface.co/Hcompany/Holo3-35B-A3B

関連:
- Holo2: Cost-Efficient Models for Cross-Platform Computer-Use Agents, H Company, 2025.11

Qwen3.5をファインチューニングすることで実現。以前のシリーズもQwenベースだったが、新たなQwenのリリースに伴いより強力なベースモデルを得て、かつシナリオをベースにして自動でwebsiteを構築しverifiableが可能な独自のEnvironmentを保持しており、多様な合成データの活用とRLを実現することで、性能が向上していると思われる。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #SmallModel #OpenWeight #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2026-04-01 Comment

元ポスト:

Loading…

- LFM2のアーキテクチャを採用の350Mパラメータモデルで、CPUでも十分な速度で推論可能
- 追加の事前学習(10T -> 28T tokens)、および、large-scale RLを実施
- 同等規模のパラメータ数(あるいは2倍程度)のモデル群に対して、知識, 指示追従能力, ツール呼び出し、データ抽出などのベンチマークで上回る

image

image

- LFM2-350Mと比較して、指示追従能力, データ抽出, tool useの性能が大きく向上
- edgeデバイスでの軽量なデータ抽出パイプラインとして有用
- しかし、math, coding, creative writingなどでの利用は推奨されない

- CPU/GPUでの推論ともに同等規模、あるいは1B級のモデルよりも早く、省メモリ
image

image

HF: https://huggingface.co/LiquidAI/LFM2.5-350M




Paper/Blog Link My Issue
#Article #NLP #SpeechProcessing #DiffusionModel #OpenWeight #Architecture #Selected Papers/Blogs #TTS #Initial Impression Notes Issue Date: 2026-04-01 Comment

HF:
- https://huggingface.co/meituan-longcat/LongCat-AudioDiT-1B
- https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B

元ポスト:

Loading…

デコード時に、メルスペクトログラム→Vocoderの場合細かい特徴が落ちてしまうことが懸念されるため、Waveformを直接デコードするWav-VAEによって、音声に直接変換する、というアーキテクチャの革新があるように見える。




Paper/Blog Link My Issue
#Article Issue Date: 2026-03-28 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering Issue Date: 2026-03-26 Comment

全体をざっくり概観してイメージをつかむのに良さそう。詳細を知りたい場合はリンク先を見ると良さげ。

(スライド最後の強化学習における「3」のスケーリングってなんだろう...?)

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Video Issue Date: 2026-03-22 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Safety #Initial Impression Notes Issue Date: 2026-03-20 Comment

元ポスト:

Loading…

LLMに意識があるように振る舞うように学習したらどうなるかという話らしい。これによって新たなpreferenceが獲得され、自己保存欲求や反発が発現したり、共感や葛藤などの人間的な感情について話したり、思考過程をモニタリングされることをどう感じますか?といった質問に対して、uncomfortableだと感じる、私は悪い評価を受けたら停止されてしまうの?といった不安について述べたりするなど、これまでにない挙動が見受けられるという感じらしい。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #AIAgents #Evaluation #Coding #SoftwareEngineering #mid-training #PostTraining #Selected Papers/Blogs #ContextEngineering #Live #Reference Collection #Initial Impression Notes Issue Date: 2026-03-20 Comment

元ポスト:

Loading…

所見:

Loading…

Kimi-K2.5がベースらしいとのこと:

Loading…

Loading…


ベンチマークスコアに対する所見:
Loading…

テクニカルレポートが出た:
https://cursor.com/resources/Composer2.pdf

元ポスト:

Loading…


Kimi-K2.5をベースに、どのようにinstruction tuning後のモデルに対して継続事前学習、RLをし、GPT-5.4(high)級の性能を達成できたのか、ヒントがわかるかもしれない。

- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02

所見:

Loading…

所見:

Loading…


RLによってpass@k(best-of-16)とpass@1の両方が改善する。既存研究では少なくともRLVRを用いた場合はPass@1は改善するが多様性が損なわれてPass@kの性能は改善しない ([Paper Note] Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR, Xiao Liang+, arXiv'25, 2025.08 , VibeVoice-1.5B, microsoft, 2025.08 )、という話があったが、Composer 2のレシピではそうではないようだ。どんなレシピだろう~と思ってさらっと関連しそうなところを見てみたが、詳細は書いてなさそうだ。
- [Paper Note] Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR, Xiao Liang+, arXiv'25, 2025.08
- VibeVoice-1.5B, microsoft, 2025.08

QA:

Loading…

CursorBenchの解説:

Loading…


要はrealisticなデータとシチュエーションでの評価に非常に重きを置いていて
- 実際のコーディングsessionのデータが用いられ、contamination-free
- 機能的な正しさのみならず、コードの品質、効率、挙動などの実用的な価値を意識し
- long horizonなタスクが多く取り入れられ
- Promptは曖昧性をうまく扱えるかを評価するために意図的にシンプルで短く
- CursorBenchのデータは継続的に更新される
- realisticなsessionデータだけでなく、その他の重要な挙動の評価(e.g., 指示追従, ルール/skilltのハンドリング, コメントの品質, editするか否かの判断の適切性など)のためのデータでも拡張されている

という感じらしい

ポイント解説:
- How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03

self-summarizationによるcontextのcompressionを実施している
- [Paper Note] InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning, Yuchen Yan+, arXiv'26, 2026.02
- [Paper Note] Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL, Ian Wu+, arXiv'26, 2026.02
- より長いホライズンに向けた Composer の学習, Cursor, 2026.03

所見:

Loading…




Paper/Blog Link My Issue
#Article Issue Date: 2026-03-19 Comment

元ポスト:

Loading…

公式:

Loading…




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #SyntheticData #Selected Papers/Blogs #KeyPoint Notes #Reading Reflections Issue Date: 2026-03-17 Comment

元ポスト:

Loading…

- インターネットのデータ枯渇問題が指摘されながらも、合成データによって事前学習は進化を続けている
- LLMは事後学習で性能を向上させられるが、事前学習時点で伸ばせる上限が決まっているとされている
- 事前学習データの投入量はChinchilla則のパラメータ量の20倍から現在は60倍まで増加
- MoEは過学習しやすくパラメータ数の40倍は必要
- 学習データの多様性が重要で繰り返し同じデータを見ても性能は改善しない
- 合成データをそのまま用いるとmode collapseが生じ出力が単調化するため、実データを混ぜるか言い換えをしたデータで是正する(弱めのdata augmentationで良い)
- 最近重要な合成データはコードと推論過程を含むデータで、これらが事前学習データに含まれていると汎用な表現、思考能力、推論能力を事前学習時点から獲得できる可能性がある

というような話が元ポストに書かれている。

- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23

のようにrepetitionは4回までが効果的といった知見が報告されているが、現在はどこまで当てはまるのだろうか?

後ほど関連するissueのリンクを貼りたい

うーんおもしろそう、p.15, p.20, p.26, p.28, p.35, p.36 あたりが気になる。

てかこれが大学の講義...?楽しすぎでは。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #OpenSource #MoE(Mixture-of-Experts) #Selected Papers/Blogs #KeyPoint Notes #Reference Collection #Hybrid #LowPrecision #LinearAttention Issue Date: 2026-03-12 Comment

元ポスト:

Loading…

解説:

Loading…

artificial analysisによる評価:

Loading…

Swallow LVM Leaderboardに性能が掲載:

Loading…

解説:

Loading…

アーキテクチャ:

Loading…

- NVFP4で学習して gpt-ossより2.2倍高速だが性能も向上
- 88 Layer: 40 Latent MoE / 40 Mamba-2 / 8 GQA Attention
- GQA Attentiom Layerは非常に少なく、ほとんどがMamba-2 (linear attention)となっている
- Latent MoEは入力をそのまま変換するshared expertsと、入力を1/4のlatent vectorに変換した潜在空間上で処理をするLatext expertsの組み合わせによって出力を得る。
- 具体的には、RouterによってTop-22のexpertsを選択し、inputを1/4のlatent vectorに圧縮した上でExpertsに入力。Expertsの出力を加算して4倍のvectorに変換し次元を戻して、別ルートでshared expertsに元の入力次元から変換されたベクトルと組み合わせて出力するようなアーキテクチャ

Latent MoE解説:

Loading…


要はMoEに必要なmatrixが、latent vectorを扱うことで小さくなるのでMoEのWeightのメモリロードのボトルネックが緩和されるだけでなく、

各MoE Laverは異なるGPUやマシンに分散されて配置されるため計算のためにはベクトルのバッチを通信しなければならないがそのコストが削減されスループットの向上につながるので嬉しい、ということだと思われる。

ポイント解説:

Loading…

technical reportが出た:
- [Paper Note] Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'26, 2026.04




Paper/Blog Link My Issue
#Article Issue Date: 2026-03-12 Comment

元ポスト:

Loading…

4月下旬までの期間限定公開とのこと




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #SyntheticData #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-03-10 Comment

12.7 GPU yearを使い、90回の実験、1 Trillion tokenの生成を経て見つけた、合成事前学習データの構築方法のbest recipeが紹介されている模様。先行研究を上回る学習効率を達成している。

image

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #NLP #MultiModal #SpeechProcessing #Self-SupervisedLearning #2D (Image) #FlowMatching #3D (Video) #Omni #RectifiedFlow #audio Issue Date: 2026-03-10 Comment


backbone modelは下記のFLUX.2と呼ばれるモデル:
FLUX Commercial Licensing: https://bfl.ai/licensing

先行研究:
- The Simulation Company, Simile, 2026.02

先行研究から読みたい

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Attention #OpenWeight #mid-training #Selected Papers/Blogs #One-Line Notes #RecurrentModels #Hybrid #LinearAttention Issue Date: 2026-03-06 Comment

元ポスト:

Loading…

x1のFull Attention + x3のGated DeltaNetによるハイブリッドアーキテクチャで、75%のattentionをlinear attention (recurrent module)に置換。x3のSliding Window Attentionを用いているOlmo3と比較した結果
- 事前学習におけるデータ効率がより高く(約2倍)
- mid-training後の評価では、数学、コード、STEM, non-STEM, QA、long-contextなどの主要なドメインにおいてOlmo3と同と床それ以上の性能を達成。特に、long-contextにおけるベンチマでは大幅な性能向上(Recurrentなアーキテクチャの恩恵)

関連:
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12

元ポスト:

Loading…

関連:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article Issue Date: 2026-03-04 Comment

元ポスト:

Loading…