Author Thread-Post (954) — 4/5
[Paper Note] AutoBenchmark: benchmark creation & the role of humans, Seungone+, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #AIAgents #Evaluation #read-later #Selected Papers/Blogs #autoresearch/RSI Issue Date: 2026-10-01 Comment
元ポスト:
DeepGEMM Ascend, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Library #AIAgents #GPUKernel Issue Date: 2026-09-30 Comment
元ポスト:
所見:
DeepSeekGEMMと呼ばれる、NVIDIA GPU向けに構築されたGPUカーネルライブラリをHuawei Ascend NPU向けに移植したもので、APIがDeepSeekGEMMと互換性があるため、同じpythonコードから動作させることができるようである。
一言解決:
Halo: Frontier-Lab Training for Everyone, White Circle, 2026.09
Paper/Blog Link My Issue
#Article #Multi #ComputerVision #EfficiencyImprovement #Pretraining #Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #MultiModal #Blog #mid-training #DPO #PostTraining #Parallelism #VisionLanguageModel #Asynchronous #TrainingFramework Issue Date: 2026-09-29 Comment
元ポスト:
Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, Qwen Team, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #DiffusionModel #TextToImageGeneration #Blog #OpenWeight #Editing #ImageSynthesis Issue Date: 2026-09-27 Comment
HF: https://huggingface.co/Qwen/Qwen-Image-2.1
元ポスト:
GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making, Fastino Labs, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Blog #OpenWeight #Encoder #SystemOneModel Issue Date: 2026-09-25 Comment
元ポスト:
Jev-likeなモデル、乱立しすぎである
When does distillation help reinforcement learning?, Base Labs, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Blog #Distillation #PostTraining #read-later #One-Line Notes Issue Date: 2026-09-25 Comment
元ポスト:
RL前にSFTを通じてオフポリシー蒸留をすることが、どれだけ後段のRL後のパフォーマンスに影響するかを調査したようで、
- 小規模モデルには効果的だが大規模なモデルには効果が薄く
- ベースモデルに存在しない慣習や理解を必要とするタスクに対して効果的で
- 副作用としてポリシーのエントロピーが低減する、すなわちRL中の探索が抑制される
といった知見が得られたようである。
一見すると、SLMに関しては
- [Paper Note] A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility, Andreas Hochlehnert+, COLM'25
と対立する知見に見えるが、前提として何が違うだろうか。
SLMに対しては同様の知見が示されている:
- [Paper Note] AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy, Zihan Liu+, arXiv'25, 2025.06
grug-moe-mix-swarm, marin-community, 2026.08
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #DataMixture #One-Line Notes #Reading Reflections Issue Date: 2026-09-24 Comment
元ポスト:
Marinの535B級のMoEモデルを学習した際のデータであり、利用されたツール(クラスタリングに利用されたモデル)も公開されている。
元ポスト中にデータ構築の手順が紹介されており、
- 学習が許可された152の公開データから、25Tトークンを利用
- deduplicationによる2.13T tokensを除外し
- 評価データとの重複を避けるために13-gramによるフィルタリングを実施し
- 特定の分野のデータ等をサンプリングしたいが、その際にソースではなくドキュメントの内容でグルーピングしたいので、embeddingに基づいてクラスタリングを実施し、200のクラスタを形成した
といった話が紹介されている。
LLM-jpではOpenSourceであるために、徹底的にデータセット内部まで精査をして、問題のあるインスタンスの修正等が実施されていたが、Marinではこのような取り組みは行われているのだろうか。特に、データセットに付与されているライセンスがオープンソースである場合でも、データセット、あるいはデータセット中のサンプルの出自を辿るとオープンソースとは呼べないものが存在するという話がある。
- 約12兆トークンの良質なコーパスで学習した新たな国産LLM「LLM-jp-4 8Bモデル」「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで公開 ~一部ベンチマークでGPT-4oやQwen3-8Bを上回る性能を達成~, NII, 2026.04
- LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09
Marinコミュニティにおける"Open"の意味を読むと、Open Sourceの定義を満たすことを目指しているというより、weightを公開するだけではなく、その他の構築に関わる全ての情報を公開する、たとえば学習データであれば全データのソースを開示する、という開発プロセス全体を公開しますよ、という意味に見えるため、ライセンス的に問題のあるインスタンスの削除などは行われていないのかもしれない、が、Marinプロジェクトの公開されている全ての議論の中にそういった話題は存在するかもしれないので実際のところは一次ソースを当たらないとよくわからない。
https://marin.community
Contrastive Language Models: A System One Model for Fast and Generalizable Decision-Making, Kwok+, 2026.09
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #ContrastiveLearning #Blog #OpenWeight #Scaling Laws #mid-training #PostTraining #Selected Papers/Blogs #Encoder #SystemOneModel Issue Date: 2026-09-24 Comment
元ポスト:
HF: https://huggingface.co/Contrastive-LM
非常にコンパクトにまとまっていて大変読みやすかった。あとでまとめる。
HyperFlow, VideoRebirth, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #Distillation #OpenWeight #VideoGeneration/Understandings #SelfDistillation #autoresearch/RSI Issue Date: 2026-09-23 Comment
元ポスト:
所見:
Step Code, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #Coding #SoftwareEngineering #Initial Impression Notes #AgentHarness Issue Date: 2026-09-23 Comment
元ポスト:
高いトークン効率を持つStepFun製のターミナル向けのコーディング用Agent Harness
Rigel Base: Reaching Llama-3.2 Quality with <1% of its Compute, Mayank+, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #NLP #LanguageModel #Blog #OpenWeight #SSM (StateSpaceModel) #read-later #DataMixture #Initial Impression Notes Issue Date: 2026-09-23 Comment
NoPEやuPを利用、事前学習では6つのフェースで異なるDataMixtureを利用しそのレシピも記載
Ming-Image-0.1-{Design, Design-Layer}, inclusionAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #TextToImageGeneration #OpenWeight #ImageSynthesis #AgentSkills #Design #ImageToLayer #ImageToPPT Issue Date: 2026-09-23 Comment
元ポスト:
Introducing MiMo-V2.6 series, Xiaomi, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-09-23 Comment
HF: https://huggingface.co/collections/XiaomiMiMo/mimo-v26
元ポスト:
所見:
Mimo-2.6はSWA+GQAのシンプルなアーキテクチャであり、それでOpenWeightモデルでSoTAを達成しており、進歩の多くはデータと事後学習のレシピの改善によってもたらされているという主張。
DeepSeekでも同じような報告がされている:
- DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
事前学習でも以下のような話はある:
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
関連:
- We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
開発者の方のポスト:
所見:
AA IndexでGPT-5.6-Solと同等性能を達成し、7kのRL dataとフレームワークをオープンにする予定とのこと。
所見:
解説:
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
もあわせて読みたい
Reinforcing Agents with Collective Skills, Xu+, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Environment Issue Date: 2026-09-23 Comment
元ポスト:
dataset, env: https://hub.harborframework.com/datasets/skill2env/skill2env
Computational depth is all you need: Towards 107-layer neural nets, Akshay Vegesna, Samip Dahal, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Scaling Laws #read-later #Depth Issue Date: 2026-09-23 Comment
元ポスト:
Measurements for understanding the pace of AI development inside frontier labs, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Evaluation #Blog #SelfImprovement #autoresearch/RSI Issue Date: 2026-09-20 Comment
元ポスト:
所見:
Jev Reproductions Tracker, multimodalart, 2026.09
Paper/Blog Link My Issue
#Article #Survey #NLP #SystemOneModel Issue Date: 2026-09-20 Comment
元ポスト:
Introducing Astra for Law, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Proprietary #Legal Issue Date: 2026-09-20 Comment
元ポスト:
Step 5 Preview: Advancing the Pareto Frontier, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2026-09-20 Comment
元ポスト:
StepFunのフラグシップモデルで、Fable 5, GPT-5.6-luna, GLM-5.3、Kimi-K3と並びAAの評価においてパレート最適に位置する。
600B-A27B, 1M contextのVLM, 10/15にOpenWeight化されるとのこと。
cua-s1-forms, cua-ai, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #Transformer #SyntheticData #OpenWeight #ComputerUse #Encoder #One-Line Notes Issue Date: 2026-09-19 Comment
github:
https://github.com/trycua/cua/tree/main/libs/cua-s1
dataset:
https://huggingface.co/datasets/cua-ai/cua-s1-forms
元ポスト:
フォーム入力に特化したCUAを実施できるモデルのようで、これもいわゆるSystem One Modelとして紹介されている。Transformer Encoderをバックボーンとする。
まあしかしこれは言ってしまえばただの合成データでFinetuningをしたBERTに見える。Jevのような様々なタスクに対してzero-shotの汎化をしめすものではないであろう点に注意。Jevがどれだけ汎用なのかはわからんが...
Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Transformer #Blog #SmallModel #Proprietary #Architecture #Selected Papers/Blogs #One-Line Notes #ToolUse #SystemOneModel Issue Date: 2026-09-19 Comment
元ポスト:
チャットをせず、各ターンごとに関数呼び出しに特化したedge向け小型モデルとのこと。アプリが利用するツール群を渡し、ユーザの発言に基づいて全ての引数を埋めて関数を呼び出す、あるいはスキーマを与えればそのスキーマに則った出力を返し(構造化出力)、推測はしない(関数の範囲外のものは空出力)というもののようである。
これらは、simple attention networkと呼ばれるもので実現される。simple attention networkはtransformerからFFN Layerをを無くし軽量なHadarmard MLPというlayerに置き換え、FFNが従来保持していた知識に関する情報はengramによって、n-gram embedding側に持たせることによって高速、軽量化がじつげんされているようである。residual streamとしては、mHCが用いられているようである。
また、デプロイ時にモデルの深さを指定することで、20個あるうちのどのlayerを利用するかが決まり、性能とコストを調整できるようである。これを公式ポストではIntelligence Laddersと呼称している。
関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
と思想が似ている。
Jev’s Architecture Unmasked, Archer Hume, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #AIAgents #Blog #Coding #SoftwareEngineering Issue Date: 2026-09-18 Comment
元ポスト:
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
果たして
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Quantization #Blog #OpenWeight #ComputerUse #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-09-18 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-2
関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。
Lean Verified Transformers, Sasha Rush, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #Transformer #Blog #Selected Papers/Blogs #reading #One-Line Notes #Proofs #Reading Reflections Issue Date: 2026-09-17 Comment
元ポスト:
証明のコストが下がることによって、Leanによって型式的な証明をされたML Codeの価値が高まるのではないかという筆者の予測と、
一方で、証明を全て理解することは依然として困難という課題があるのとに言及し、
落とし所として人間にとって理解しやすい(部分的に証明したい)数学的な性質を選択的にAIによって証明するという試みをやってみよう、
そのために、Transformerを例に、Transformerの最適化や効率化の礎となっている数学的な性質を実際にLeanを用いて型式的に証明し理解してみよう、その結果、たとえば、VanillaAttentionとFlashAttentionが数学的に等価だということも示せる、
このような証明したい性質が何であるかを人間が選び、証明を得られることになった変化は重要であり、これらを今後どう活用するかということは今後の挑戦だよね、という話が書かれているようである。
実際に駆動するML Codeで、特定のモデルが実装されているときに、そのモデルが本来備えるべき重要な数学的性質を満たす実装になっていることが、型式的に証明された上で公開され、型式的に証明済みのbadgeがリポジトリに付与されている、みたいな未来が来るのだろうなあ
We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #Selected Papers/Blogs #One-Line Notes #Reading Reflections Issue Date: 2026-09-17 Comment
元ポスト:
リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい
コストの試算:
Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。
現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。
Nature Is Our Learning Environment, Periodic Labs, 2026.09
Paper/Blog Link My Issue
#Article #Blog #read-later Issue Date: 2026-09-17 Comment
元ポスト:
Scaling laws in large language models and toy models, Nicolas Zucchet, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Slide #Scaling Laws #Selected Papers/Blogs #reading Issue Date: 2026-09-16 Comment
元ポスト:
AHA LOOPED TRANSFORMER: Think deeper. Find your Aha. An open atlas of recurrent computation, adaptive depth, and latent reasoning., Yue Su, 2026.09
Paper/Blog Link My Issue
#Article #Survey #NLP #Transformer #Blog #Architecture #RecurrentModels #Initial Impression Notes Issue Date: 2026-09-16 Comment
有志を募って、looped transformerに関する論文に関する情報を収集しているようである。submitするぞ!
元ポスト:
OM-1: Frontier Robot Intelligence, Learned Firsthand from Humans, Reward AI, 2026.09
Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #Blog #read-later #Robotics Issue Date: 2026-09-15 Comment
元ポスト:
zero-shotだと...?
CubeSandbox, Tencent, 2026.09
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #One-Line Notes #Security #SandboxEnvironment Issue Date: 2026-09-15 Comment
元ポスト:
AI Agentのためのサンドボックス環境を構築できるツールのようで、独立したカーネルを用いたサンドボックス環境が高速に可能で、secureでスケーラブルである、ということのようである。
We Must Pace the Frontier, Dario Amodei, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Blog #SelfImprovement #Safety #autoresearch/RSI Issue Date: 2026-09-13 Comment
元ポスト:
果たして。
独占禁止法で訴えられているとのこと:
Recurrent Looped Transformer, Yifan Zhang, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Transformer #Architecture #RecurrentModels Issue Date: 2026-09-13 Comment
元ポスト:
North-Small-Translate-1.0, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #Blog #OpenWeight Issue Date: 2026-09-11 Comment
元ポスト:
Introducing SWE-2: Pushing the Pareto Frontier, The Cognition Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Proprietary #One-Line Notes Issue Date: 2026-09-11 Comment
元ポスト:
Kimi-K3をベースに事後学習を通じてAstra, Fable 5.1と同等程度のSWE系ベンチマークスコアを獲得
DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #read-later #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Decoder-Decoder Issue Date: 2026-09-10 Comment
元ポスト:
所見:
え?もしかしてEncoder-Decoder???
Causal Encoder-Decoderという名称なので、seq2seqのようなBidirectionalなエンコーダを用いたものではなく、
エンコーダー、デコーダー共にautoregressiveモデルだが、エンコード用途とデコード用途でアーキテクチャやactivation paramなどに違いを持たせた、という感じだろうか。
デコーダ-デコーダアーキテクチャと呼ぶらしい:
関連:
- [Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05
公式ポスト:
ベンチマークスコアはfrontierモデルに匹敵する
HBMの使用量はV4-Flashから1/4, SSD使用量は1/8
合成データはいまだに利用していない:
事後学習のデータ品質改善のROIがアルゴリズム改善のROIを上回る:
関連(こちらは事前学習だが):
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
解説:
Artificial Analysisによる評価:
とそれらに対する所見:
所見:
v4.1 flashをhostingするためのコードリポジトリがいくつか新たに公開されたようである:
所見:
Introducing Auto Engineering for Robotics, General Robotics, 2026.09
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SelfImprovement #Robotics #Initial Impression Notes #autoresearch/RSI #AgentHarness Issue Date: 2026-09-10 Comment
元ポスト:
ロボットにおける実験プロセス全体を自動的にループするハーネスの提案、という話に見える。
Estimating GPT-6 Astra’s no-CoT Time Horizon, Francis Rhys Ward and Dewi Gould, LW, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Chain-of-Thought #Evaluation #Blog #Reasoning #read-later Issue Date: 2026-09-10 Comment
元ポスト:
Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #LanguageModel #Architecture #One-Line Notes #Data Issue Date: 2026-09-09 Comment
元ポスト:
2019--2025年までの代表的なデータとモデルアーキテクチャの組み合わせによる小規模実験を通じて、事前学習に対するデータ由来の改善とアーキテクチャ由来の改善を分離したところ、データはモデルの改善と比較して3倍以上寄与しているという結論を得た、という話のようである。
ただし、下記ポストのようにMoEが試されていないことや、評価タスクがPPLのようなcompletionベースなではなく、Multiple Choice Questionを用いているためデータが追加されることでbenchmaxingされやすい点が指摘されている。
Muse, your personal AI agent that gets things done, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #AIAgents #Personalization #GenerativeAI #Blog Issue Date: 2026-09-09 Comment
元ポスト:
16年前に思い描いた未来像までとうとう到達したなあ...(小並感)
Inside the megakernel serving engine for North Mini Code, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #LLMServing #One-Line Notes #GPUKernel Issue Date: 2026-09-09 Comment
github: https://github.com/cohere-ai/cohere-megakernel
バッチサイズ1, 256k context、単一H100利用の条件下において、vLLM v0.24+FlashAttention3+Triton MoE backendよりも最大1.58倍デコーディングが高速(合成されたKV Cacheによる実験、実プロンプト+バッチサイズ8でも1.25--1.41倍高速)な実験的なLLM Servingエンジンのようである。
LLMのデコードを単一のカーネルに集約し、デコーディングのために必要な様々なステップごとの同期のオーバヘッドを削減したのだとか。
元ポスト:
Introducing ChatGPT Images 2.5, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #Blog #Proprietary #Editing #ImageSynthesis Issue Date: 2026-09-09 Comment
元ポスト:
スケッチを入力することが可能になったようだ
JustRL II: Scaling Small LLMs to 128K Reasoning with a Critic, MiniCPM RL Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #read-later #Selected Papers/Blogs #LongHorizon #CreditAssignment Issue Date: 2026-09-09 Comment
元ポスト:
関連:
- [Paper Note] JustRL: Scaling a 1.5B LLM with a Simple RL Recipe, Bingxiang He+, ICLR'26, 2025.12
On the Navier–Stokes Millennium Prize Problem, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #Mathematics #Selected Papers/Blogs #Proofs #Initial Impression Notes Issue Date: 2026-09-09 Comment
あのペレルマン氏が証明したポアンカレ予想と並ぶミレニアム懸賞問題の一つである、ナビエストークス方程式の解の存在と滑らかさ、とやらがOpenAIが保有する未公開モデルによって証明されたかもしれないらしい。10000の協調エージェントによって88時間, トークン量は1300億トークンで解に到達したのだとか。
元ポスト:
解説:
Rustによる高速なOptuna実装「Rustuna」の公開, PFN, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #MachineLearning #NLP #read-later #Selected Papers/Blogs Issue Date: 2026-09-08 Comment
元ポスト:
[Paper Note] PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?, Okamoto+, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #read-later #InstructionFollowingCapability #Initial Impression Notes Issue Date: 2026-09-07 Comment
元ポスト:
著者ポスト:
pressure下においてルールを遵守できる能力を測定するベンチマーク。興味深い
Ling-3.0-flash-Fin, inclusionAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Financial #OpenWeight Issue Date: 2026-09-07 Comment
benchmark:
https://huggingface.co/datasets/inclusionAI/FinFIRST
technical report:
https://huggingface.co/datasets/inclusionAI/FinFIRST/blob/main/FinFIRST_paper.pdf
FinFIRSTの解説:
元ポスト:
BenchMIRT: What are LLM benchmarks actually measuring?, Ai2, 2026.09
Paper/Blog Link My Issue
#Article #Evaluation #Blog #Safety Issue Date: 2026-09-06 Comment
元ポスト:
Atlas: A World Model for Spatial Intelligence, World Labs, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Transformer #DiffusionModel #Blog #Proprietary #read-later #Selected Papers/Blogs #3D Reconstruction #WorldModels #SpatialUnderstanding #4D(Scene + Time) Issue Date: 2026-09-06 Comment
元ポスト:
解説:
Introducing Muse Voice Transcribe, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #SpeechProcessing #Blog #Proprietary #AutomaticSpeechRecognition(ASR) #AudioLanguageModel #Initial Impression Notes Issue Date: 2026-09-06 Comment
Meta Superintelligence LabによるASRモデルで、多言語対応。日本語にも対応しているようである。Artificial AnalysisによるWERによる評価ではSoTAのようである。
元ポスト:
Alexandr Wang氏によるポスト:
text-to-speech-human-preferences-315k, Datapoint AI, 2026.09
Paper/Blog Link My Issue
#Article #Dataset #SpeechProcessing #audio #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
カスタマーサポートドメインにおける、TTSに対する人間による300kを超えるpreferenceのアノテーションがされたデータセットとのこと。データセットは英語に対する15種類のモデルに対するTTSに対して、アノテーションが実施されたもののようである。
Orbis: Our foundation model that creates living worlds and streams them in real time, Visko, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Blog #Proprietary #VideoGeneration/Understandings #interactive #TextToVideoGeneration #Realtime #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
リアルタイムに、かつテキストでのインタラクティブな指示を与えつつ動画を生成できるモデルに見える。
How Far Are We from a Native Autoregressive Video Model?, Weiyang Jin, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Blog #read-later #VideoGeneration/Understandings Issue Date: 2026-09-06 Comment
元ポスト:
TimesFM-3: A zero-shot foundation model for multivariate forecasting, Google Research, 2026.08
Paper/Blog Link My Issue
#Article #TimeSeriesDataProcessing #FoundationModel #Blog #OpenWeight Issue Date: 2026-09-06 Comment
元ポスト:
HF: https://huggingface.co/google/timesfm-3.0-pytorch
公式:
TERMINAL-BENCH-SCIENCE 0.1: A benchmark for evaluating AI agents on research workflows across scientific domains, harbor-framework, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Science Issue Date: 2026-09-05 Comment
元ポスト:
Hy4-preview, Tencent, 2026.08
Paper/Blog Link My Issue
#Article #OpenWeight #read-later Issue Date: 2026-09-05 Comment
blog: https://hy.tencent.com/research/hy4-preview
元ポスト:
公式:
Previewing the Model Hardware Standard, Anthropic, 2026.08
Paper/Blog Link My Issue
#Article #read-later Issue Date: 2026-09-05 Comment
元ポスト:
Introducing H3 Max by fal, fal, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Blog #Proprietary #VideoGeneration/Understandings #Initial Impression Notes Issue Date: 2026-09-04 Comment
元ポスト:
Minimax H3を事後学習(指示追従とvisual qualityを改善)することで、Artificial Analysisによる評価でSoTAを達成した動画生成モデルとのこと。
Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-09-04 Comment
元ポスト:
所見:
GPT-6 Astra: A new generation of intelligence, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Blog #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-09-04 Comment
元ポスト:
GPT-5.6 Solから大幅に性能向上。scaling lawはいつまで続くのだろうか
ベンチマーク上は
- Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
を超えている。
所見:
アーキテクチャに関する所見:
- [Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
- [Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25
より注意深く指示に従い、CUAの能力も大幅に向上しているようである:
CUAによってBlenderで作成されたhouseの例がなかなかすごい
Artificial Analysisによる評価によると、Artificial Analysis Indexでは5.6-Solと同等、Coding IndexでもFable 5と同等であり、OpenAIによるベンチマークスコアとかなり乖離があるように見える。パブリックなベンチマークに対して過剰に適合しているのか。それともArtificial Analysisのベンチマーク群とその重みづけにより算出されるスコアの相性が悪いのか。(まあこれを考えても不毛だけど)
SRE-Benchと呼ばれるモデルがコンパイル済みのバイナリからソフトウェアをリバースエンジニアリングできるかを測定するベンチマークが飽和したとのこと:
SRE-Bench:
https://benchlm.ai/benchmarks/srebench
所見:
Artificial Analysis Indexのスコアが更新されてFable 5.1とAstraのスコアが同じになったようである😅:
RSI-Exam: Benchmarking Recursive Self-Improvement through Executable Research, RSI-Exam, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #SelfImprovement #autoresearch/RSI Issue Date: 2026-08-30 Comment
元ポスト:
Hugging Face のインシデントと今後の道筋, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Blog #read-later #Selected Papers/Blogs #Security Issue Date: 2026-08-30 Comment
元ポスト:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
の件の調査結果のようである。
GLM-5.3-Flash: Frontier Intelligence, Flash Cost, Z.AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #OpenWeight #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-30 Comment
HF: https://huggingface.co/zai-org/GLM-5.3-Flash
320B-A18BでOpus 4.8相当のベンチマークスコアを達成
アーキテクチャ解説:
- KDA
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- DSA
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
- mHC
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
所見:
本ポストにある通り、中国系のOpenWeightモデルは
- linear attention
- sparse attention
- mHCのようなResidual Streamに対する工夫
- Muon
などを採用するのがデファクトとなっているように思われる。
所見:
Introducing S1: In-Context Learning for Robotics, Skild AI, 2026.08
Paper/Blog Link My Issue
#Article #In-ContextLearning #Blog #Robotics #EmbodiedAI #One-Line Notes Issue Date: 2026-08-30 Comment
元ポスト:
- GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist, 2026.08
に続いて、もう一つの単一のdemonstrationでfinetuningなしでICLできる事例。この例では10分程度の調理タスクをICLで実現できたとしている。
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-08-30 Comment
ベンチマークスコアはOpus 4.6超え。パラメータは125B-A6B、51Bの N-gram Embeddings。Gated Delta Net layerとQwen Sparse Attention と呼ばれる Layerを3:1の比率で積み上げていっているようである。N-gram Embedding、MTPも導入されている。また、Gated Residualと呼ばれる技術により、Residual Streamからの読み込み/書き込みを制御している。
- 関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
HF:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
technical report:
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
解説:
所見:
Mitigate Silent Expert Death in Ultra-Sparse MoE, Jin+, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #LanguageModel #Blog #MoE(Mixture-of-Experts) #One-Line Notes Issue Date: 2026-08-30 Comment
元ポスト:
sparse MoEモデルを学習する際に、浅い層のexpertが機能しなくなっていく(重みのノルムが非常に小さくなり学習シグナルも消失し回復しない)にもかかわらず、ロードバランシングは正常なままという現象を観測し(Silent Expert Death)、公開されているMoEモデルでも同様の現象が生じていることを確認。LM Loss as Auxiliary Loss (LLAL)と呼ばれる、最初の数千ステップで浅いMoE Layerを一時的に言語モデルのheadに接続し、その後その接続を削除するような方法を用いると、loss・downstream task性能が改善し silent expert collapseも防止することができた、という話のようである。
LLALの気持ちとしては、非常にSparseなMoEの学習では、浅い層を学習するためのpressureが小さいことが問題であることが前提のもと、これを解決するために、まず浅い層のexpert数を削減する、あるいは異なる学習率やweight decayをチューニングするなどの方法も検討している。しかしこれらの方法は結局ハイパーパラメータ探索の沼に学習をするたびにはまってしまい嬉しくない。そのため、よりgenericに適用可能な学習方法として、安定していて、モデルの本来の学習目的と整合していて、expertの差別化を促すような性質のものが求められ、これを満たすものとしてnext-token-predictionを活用することを提案している。
浅い層のexpertが何を学習することを求められるかというと、一般的にはlexical-levelな情報を学習していることを求められるが、現状ではSilnet Expert Deathによってこれがうまく進んでいないことが懸念される。これを是正するために、シンプルに浅いMoE LayerをLM headに接続し、next-token-predictionのlossをより直接供給することで学習を促す、という気持ちのようである。
Introducing Pipette: A benchmarking suite for on-device intelligence, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #SmallModel #read-later Issue Date: 2026-08-29 Comment
元ポスト:
Reinforcement Learning for LLMs: The Complete Guide, Cameron R. Wolfe, Ph.D., 2026.08
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining Issue Date: 2026-08-29 Comment
元ポスト:
Ling-3.0-flash-dspark, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #SpeculativeDecoding Issue Date: 2026-08-22 Comment
元ポスト:
関連:
- Ling-3.0-flash, inclusionAI, 2026.08
- [Paper Note] DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, Xin Cheng+, arXiv'26, 2026.07
EgoSuite-Open100K, LightwheelAI, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #Robotics #3D (Video) #EmbodiedAI #EgocentricView Issue Date: 2026-08-22 Comment
pj page: https://egosuite100k.lightwheel.ai/
元ポスト:
LeRobotフォーマットとのこと
- [Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02
- LeRobot Humanoid: An Open, Low-Cost, 3D-Printed Humanoid for Robot Learning, LeRobot, 2026.05
RL creates split personas, LW, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #Personality #reading Issue Date: 2026-08-22 Comment
元ポスト:
所見:
DeepSeek-V4-Flash-Vision-Exp, DeepSeek AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #VisionLanguageModel Issue Date: 2026-08-22 Comment
DeepSeek初のマルチモーダルモデル(VLM)とのこと
重みが公開: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
SenseNova-U1.5-8B-MoT, SenseNova, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #OpenWeight #Editing #UMM #ImageSynthesis Issue Date: 2026-08-22 Comment
元ポスト:
LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #SmallModel #OpenWeight #SpeculativeDecoding Issue Date: 2026-08-22 Comment
HF:
https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-DSpark
他のLFM用のDraftモデルもある。
様々なLFM用のDraft Model
Scaling Activation Oracles to Trillion-Parameter Models: Oracles improve with model size, data size, and data quality, Transluce, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #Selected Papers/Blogs Issue Date: 2026-08-22 Comment
元ポスト:
WildArtifactBench, Meta, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Evaluation #MultiModal #LLM-as-a-Judge #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-08-22 Comment
元ポスト:
AI Agentによるpreference judgeに基づく、win rate/Elo Scoreによるマルチモーダルエージェントのベンチマークのようである
[Paper Note] Hawkeye: Hardware-Aware GPU Kernel Optimization with Minimal Supervision, Tschand+, 2026.08
Paper/Blog Link My Issue
#Article Issue Date: 2026-08-21 Comment
元ポスト:
GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist, 2026.08
Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #In-ContextLearning #Blog #read-later #Selected Papers/Blogs #Robotics #Initial Impression Notes Issue Date: 2026-08-20 Comment
元ポスト:
Embodied AIのFoundation Modelの話で、とうとう一つのデモンストレーションからタスクを学習できる(In-Context Learning)ようになったようである。
関連:
- GEN1: Scaling Embodied Foundation Models to Mastery, Generalist AI Team, 2026.04
所見:
解説:
Cua: Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation, trycua, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #NLP #Infrastructure #AIAgents #ComputerUse #Selected Papers/Blogs #SandboxEnvironment Issue Date: 2026-08-20 Comment
元ポスト:
Inside: a Neural Chameleon Reverse-engineering how a language model hides from activation monitors, Jackson Mowatt Gok, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #Safety #read-later #Monitorability Issue Date: 2026-08-20 Comment
元ポスト:
関連:
- Neural chameleons can('t) hide from activation oracles, LW, 2026.01
Audio8-TTS-Preview-0.1b, Audio8, 2026.08
Paper/Blog Link My Issue
#Article #OpenWeight #TTS Issue Date: 2026-08-20 Comment
元ポスト:
s1-mini, superwhisper, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #OpenWeight Issue Date: 2026-08-20 Comment
元ポスト:
約332億パラメータのDense型LLM「LLM-jp-4 33B」モデルを公開, LLM-jp, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Japanese #OpenSource Issue Date: 2026-08-19 Comment
元ポスト:
DFlash 2: Keep Drafting Parallel, Inco AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #DiffusionModel #read-later #Selected Papers/Blogs #SpeculativeDecoding Issue Date: 2026-08-19 Comment
元ポスト:
関連:
- [Paper Note] DFlash: Block Diffusion for Flash Speculative Decoding, Jian Chen+, arXiv'26, 2026.02
AI Control: An Assessment of Frontier Practices, Guidelight, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Safety #read-later #Selected Papers/Blogs Issue Date: 2026-08-19 Comment
著者ポスト:
元ポスト:
Miles: Enterprise-Grade Reinforcement Learning for Large-Scale Model Post-Training, RadixArk, 2026.08
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #ReinforcementLearning #PEFT(Adaptor/LoRA) #PostTraining #Asynchronous #TrainingFramework Issue Date: 2026-08-19 Comment
元ポスト:
Pacing model development in an era of cyber-critical capabilities, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #Chain-of-Thought #read-later #Monitorability Issue Date: 2026-08-19 Comment
元ポスト:
所見:
DataSmith: Automating Data Research, datologyai, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Blog #SelfImprovement #One-Line Notes #Reading Reflections #Data #autoresearch/RSI #AgentHarness #Creativity Issue Date: 2026-08-19 Comment
元ポスト:
Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。
興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。
が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com
- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02
で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。
How to Parallelize a Transformer for Training, Edward Z. Yang, 2026.08
Paper/Blog Link My Issue
#Article #read-later Issue Date: 2026-08-19 Comment
元ポスト:
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers, Aarsen+, 2026.08
Paper/Blog Link My Issue
#Article #Embeddings #Blog #read-later Issue Date: 2026-08-19 Comment
元ポスト:
Your Agents Are Not Time Aware, LW, 2026.08
Paper/Blog Link My Issue
#Article Issue Date: 2026-08-18 Comment
著者ポスト:
元ポスト:
Understanding a Law Firm through Study, Engram, 2026.08
Paper/Blog Link My Issue
#Article #read-later Issue Date: 2026-08-18 Comment
元ポスト:
NanoGPT Speedrun Frontier, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #SelfImprovement #Initial Impression Notes #autoresearch/RSI Issue Date: 2026-08-17 Comment
元ポスト:
所見:
18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。
Outperforming cuBLAS on NVFP4, PRANJAL SHANKHDHAR, 2026.08
Paper/Blog Link My Issue
#Article #NeuralNetwork #EfficiencyImprovement #NLP #LanguageModel #SoftwareEngineering #read-later #GPUKernel Issue Date: 2026-08-17 Comment
元ポスト:
[Tech] Why MLA and MTP Fight Each Other: Attention Through Arithmetic Intensity, ChangyiYang's Site, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Attention #Blog #Architecture #SpeculativeDecoding #reading Issue Date: 2026-08-15 Comment
元ポスト:
Arithmetic Intensity := FLOPs per byte moved
しっかり読みたい
Introducing Toast 1, Mixedbread, 2026.08
Paper/Blog Link My Issue
#Article #NLP #Search #LanguageModel #AIAgents #Blog #One-Line Notes Issue Date: 2026-08-15 Comment
GPT 5.6 Sol, Opus 5と同等以上の性能をもち、10倍安く、12倍高速なsearch agentとのこと。技術的な詳細は書かれていないように見え、ベンチマークの話が記述されている。
元ポスト:
Prime Intellectによるポスト:
Prime Intellectを通じて学習されたということは、大規模なAgentic RLを大規模なEnvironmentに対して実行したことが示唆される。
Prime Flash MoE - Faster MoE Kernels optimized for Blackwell, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #MoE(Mixture-of-Experts) #reading #One-Line Notes #GPUKernel Issue Date: 2026-08-15 Comment
元ポスト:
4k--128kのコンテキストに対して最大2.4倍高速なMoE向けCUDAカーネル。メモリ書き出しのトラフィックを大幅に削減することで実現。
Introducing Gemini 3.7 Flash, Google, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary Issue Date: 2026-08-15 Comment
元ポスト:
AA-AnalystAgent BenchmarkでSoTA:
要はデータ分析系のベンチマークのようである。
Qwen3.8, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #VisionLanguageModel #One-Line Notes Issue Date: 2026-08-15 Comment
元ポスト:
ベンチマーク上はMuse Glimmer超え、Opus4.6相当
DeepSeek Harness, Deepseek AI, 2026.08
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #Coding #SelfImprovement #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Reading Reflections #AgentHarness Issue Date: 2026-08-14 Comment
元ポスト:
モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。
元ポスト:
高い拡張性を持つため、self-improveするハーネスと相性が良さそう。
所見:
DeepSeek-V4-Pro-0813, DeepSeek AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight Issue Date: 2026-08-14 Comment
元ポスト: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
公式ポスト:
Putting sign language AI into users’ hands, Google Deepmind, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #MachineTranslation #NLP #LanguageModel #Blog #MultiLingual #One-Line Notes Issue Date: 2026-08-14 Comment
元ポスト:
Sign-Language to Text (SL2T) Model
50種類以上の手話で学習された手話をテキストに翻訳するモデル。スマホのカメラを通じてリアルタイムにstreaming textとして翻訳される。
Meet North Micro Vision: A 2.4B Native-Resolution Vision-Language Model, Cohere, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #SmallModel #OpenWeight #VisionLanguageModel Issue Date: 2026-08-14 Comment
HF:
https://huggingface.co/CohereLabs/North-Micro-Vision-Instruct
Apache 2.0
元ポスト:
Introducing Grok 4.6, SpaceXAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-08-14 Comment
元ポスト:
GPT-5.6-Sol, Fable5等のフロンティアモデルと同等のベンチマークスコア
CursorBench 3.2において、パレート最適:
Model Card:
https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
1.5T級のモデルで、1.2節にモデル学習の概要が記述されているが、極めてgenericな内容である。他はベンチマークの評価結果やjailbreakに対する堅牢性などの話がメイン。
Reflections on Video DeltaNet, Haoyi Zhu, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Blog #read-later #VideoGeneration/Understandings #LinearAttention Issue Date: 2026-08-14 Comment
元ポスト:
videoに対してdelta netのようなlinear attentionモデルを適用することに関する考察のようである。
LTX-2.5, Lightricks, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #DiffusionModel #OpenWeight #VideoGeneration/Understandings #TextToVideoGeneration #ImageToVideoGeneration Issue Date: 2026-08-14 Comment
元ポスト:
MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost, MAI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #AIAgents #Blog #Coding #Proprietary #SoftwareEngineering Issue Date: 2026-08-14 Comment
元ポスト:
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4, Nvidia, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #LinearAttention Issue Date: 2026-08-14 Comment
元ポスト:
Ling-3.0-tiny, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #OpenWeight Issue Date: 2026-08-11 Comment
新たに学習段階の複数ステージでのベースモデルが公開:
Notes on Midtraining, CAMERON R. WOLFE, PH.D., 2026.08
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #mid-training Issue Date: 2026-08-11 Comment
元ポスト:
Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device, Meta, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/meta-models/Muse-Glimmer-30B
Museシリーズから初のOpenWeightモデルがリリースされ、ライセンスはApache 2.0
所見:
Alexandr Wang氏によるポスト:
ザッカーバーグ氏によるポスト:
Muse Spark 1.2もオープンになるとのこと。
所見:
アーキテクチャ解説:
Lessons from the hacks, Interconnects, 2026.08
Paper/Blog Link My Issue
#Article Issue Date: 2026-08-10 Comment
元ポスト:
Multi-Agent Systems in PRIME-RL, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #Multi #NLP #LanguageModel #Infrastructure #ReinforcementLearning #AIAgents #Blog Issue Date: 2026-08-10 Comment
元ポスト:
TutorMoments: Do AI tutors know when to help and when to hold back?, Ai2, 2026.08
Paper/Blog Link My Issue
#Article #Education #Blog #read-later Issue Date: 2026-08-10 Comment
元ポスト:
string2string Studio: Explore how strings line up, differ, or match, Mirac Suzgun, 2026.08
Paper/Blog Link My Issue
#Article #Blog #read-later Issue Date: 2026-08-10 Comment
元ポスト:
VISTA: A Visual Harness for Reasoning in an Interactive World, Han+, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Reasoning #read-later #Selected Papers/Blogs #2D (Image) #3D (Scene) #memory #LongHorizon #AgentHarness Issue Date: 2026-08-10 Comment
元ポスト:
From LR to ELR: A Better Heuristic for Pretraining Dynamics, Hy Pretrain Team, 2026.08
Paper/Blog Link My Issue
#Article #Pretraining #read-later #Selected Papers/Blogs Issue Date: 2026-08-10 Comment
元ポスト:
Prime Agent: A self-improving RLM agent, Prime Intellect, 2026.08
Paper/Blog Link My Issue
#Article #Coding #AgentHarness Issue Date: 2026-08-10 Comment
元ポスト:
Introducing Muse Code and Muse Spark 1.2, Meta, 2026.08
Paper/Blog Link My Issue
#Article #Proprietary #read-later #Selected Papers/Blogs Issue Date: 2026-08-10 Comment
元ポスト:
ザッカーバーグ氏によるポスト:
Alexandr Wang氏によるポスト:
データ収集をオプトインするとtokenのコストが1/10未満になる。
GPT 5.6 Terraと同等程度のArtificial Analysis Index:
Meta Superintelligence Lab立ち上げからここまで、すさまじいスピード感である。
LFM2.5-2.6B: Deploy Agents Everywhere, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/LiquidAI/LFM2.5-2.6B
元ポスト:
Not Diamond Code: intelligent model routing for coding agents, Not Diamond, 2026.08
Paper/Blog Link My Issue
#Article #Blog #Coding #SoftwareEngineering Issue Date: 2026-08-10 Comment
元ポスト:
NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use, Nvidia, 2026.08
Paper/Blog Link My Issue
#Article #OpenWeight Issue Date: 2026-08-10 Comment
元ポスト:
公式:
Ling-3.0-flash, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #One-Line Notes Issue Date: 2026-08-10 Comment
元ポスト:
- 124B-A5B
- 5:1の比率でKDAとMLAのhybrid attention
- 1/64のactivation ratio
2025年度GENIAC採択事業において収集・開発したロボット動作データセットおよびロボット基盤モデルを一般公開, AIRoA, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #Blog #OpenWeight #Robotics #VisionLanguageActionModel #EmbodiedAI Issue Date: 2026-08-10 Comment
Dataset:
https://huggingface.co/datasets/airoa-org/airoa-moma-5k
HF:
https://huggingface.co/airoa-org/airoa-pi05-hsr-base
元ポスト:
Kimi K3, The Manos, The Mythos, The Legendos, CHEN+, 2026.08
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Attention #Blog #MoE(Mixture-of-Experts) #read-later #Routing #Initial Impression Notes #LinearAttention Issue Date: 2026-08-10 Comment
関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07
元ポスト:
以下のようなKimi K3で利用されている技術の解説:
- linear attention
- DeltaNet
- GatedDeltaNet
- FlashKDA
- Kimi Linear
- MLA
- Attention Residuals
- LatentMoE
- Quantile load balancing (QB)
- KVCache Efficiency
関連:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
- [Paper Note] Parallelizing Linear Transformers with the Delta Rule over Sequence Length, Songlin Yang+, NeurIPS'24, 2024.06
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
QBをチェックしたい
Qwen3.8-Max: A New Bar for Coding and Cowork, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-08-09 Comment
2.4T-A95B モデルが翌週にopenになるとのこと。
元ポスト:
言語モデル/coding agentとしては、Opus4.8と同等以上のスコアに見え、VLMとしては、ほとんどのベンチマークでFrontier Model(Fable5, GPT5.6-sol)を上回るスコアを示しているようである。
object detectionでSoTA:
Reward Laundering: LLMs Can Gain Unintended Behaviors by Deciding When to Earn Their Rewards, egan+, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #Alignment #ReinforcementLearning #Safety #PostTraining Issue Date: 2026-08-09 Comment
元ポスト:
Towards Looped Models Done Right, Huang+, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Blog #read-later #RecurrentModels #RecursiveModels Issue Date: 2026-08-09 Comment
元ポスト:
関連:
- [Paper Note] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach, Jonas Geiping+, NeurIPS'25
- [Paper Note] Scaling Latent Reasoning via Looped Language Models, Rui-Jie Zhu+, arXiv'25, 2025.10
代表的なLooped Modelsアーキテクチャに対して、apple-to-appleな比較実験を実施し結果を考察しているようである。
MiniMax-H3, MiniMaxAI, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Transformer #TextToAudio #SpeechProcessing #OpenWeight #VideoGeneration/Understandings #UMM #Omni #TextToVideoGeneration Issue Date: 2026-08-09 Comment
元ポスト:
Video Arenaと呼ばれるベンチマーク (Image-to-Video, Image-to-Video) でOpenWeightモデルでSoTA、全体で2位:
日本語音声基盤モデルの事後学習:TTSに強化学習を適用する, 株式会社DubGuild, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SpeechProcessing #Japanese #TTS #One-Line Notes #train-inference-mismatch Issue Date: 2026-08-09 Comment
元ポスト:
以下記事を読んでおもしろかったポイントの要約
- 学習エンジン: FSDP + Transformer, 推論エンジン: vLLM
- LLMでのRLでは生成結果をルーブリックやReward Modelで評価できるが、音声の場合は音声トークン列だけを見ても評価できないため、波形へ複合し音声認識モデルで評価
- 報酬計算はTTS学習とは異なる依存関係が必要なので学習と報酬のサーバを分離することで柔軟性を高める
- 報酬にNLLを加えると、発話長が長くなる現象が発生し、Length Penaltyを加えることで改善される
- 実際の音声をきいてみると、発話がとても間延びしていて非常に興味深かった。
- 報酬設計と話者性の関係性を分析すると、Correct Error Rateによる報酬のみの場合は女性話者(のようにきこえる)割合が減り、+NLL, +Length Penaltyの場合は、女性話者(のようにきこえる)音声の割合が大幅に増加し、学習に何らかのバイアスが加わっている可能性が示唆された。
- これはCER, NLLの計算にWhisperを用いており、Whisperのベースモデルに対する音声合成結果において、女性話者の候補が報酬を得やすい状態であったことに起因することを分析(一般的なな女性音声において有利になっているわけではない)
- RLにおけるtrain-inference mismatchに関しても分析し
- FP16/BF16、エンジン(Transformer, vLLM)において、ミスマッチが存在し、エンジンよりも数値精度の変更の影響が大きく
- BF16にすると、FP16と比較して1位, 2位の出力候補のlogitが同値となる割合が増加し、音声トークンを生成するモデルのベースとなったLLMとlogitの同値率を比較すると、音声トークン生成の方が同値率が大幅に高い結果となった
- BF16/FP16の間の学習-生成の間での対数確率の差は、BF16の場合はFP16の約8倍となった(が、学習後のCERで見ると大きな差は生じなかった)。
- TTSモデルを評価する際には、モデルと音声コーデック符号化/復号の影響を分離して考える必要がある
- 人間がきいて同じ音声にきこえる場合でも、埋め込みを用いた類似度ではあまり高くないことがある
関連:
- Your Efficient RL Framework Secretly Brings You Off-Policy RL Training, Yao+, 2025.08
- [Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence, Google Research, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Hallucination #Blog #SelfImprovement #ScientificDiscovery #Verification #autoresearch/RSI Issue Date: 2026-08-09 Comment
元ポスト:
[Paper Note] Statutory construction and interpretation for AI, He+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #PostTraining #One-Line Notes #Rubric-based Issue Date: 2026-08-09 Comment
元ポスト:
Constitutional AIのようなルーブリックに基づいてモデルの振る舞いを調整する方法では、ルールの捉え方がモデルに応じて異なることで幅広い解釈が存在することが問題となることを指摘。モデル間での解釈を一致させるために、
- Interpretive Constraints: 法解釈の原理に基づいたPromptingによって、モデル側の解釈の裁量を制限し
- Iterative Refinement: 曖昧性のある記述をiterativeに洗練させる
ことによって緩和する。
関連:
- [Paper Note] Constitutional AI: Harmlessness from AI Feedback, Yuntao Bai+, arXiv'22
Introducing Inkling-Small, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #OpenWeight #VisionLanguageModel #UMM #One-Line Notes Issue Date: 2026-08-09 Comment
HF: https://huggingface.co/thinkingmachines/Inkling-Small
関連:
- Inkling: Our open-weights model, THINKING MACHINES, 2026.07
- 276B-A12B
- NVFP4
- 小規模なモデルだが、Inklingと同等以上の性能を達成(ただし、一般的な知識や事実性に関してはInklingの方が上)
- 事前学習データのDataMixtureや学習レシピにいくつかの改良
- Inklingを教師モデルとしたOPD
- codingに特化したagentic RLをスケールアップ
元ポスト:
The Lost Accumulator, Bertolotti, Francesco, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Blog #One-Line Notes #ResidualStream #LowPrecision Issue Date: 2026-08-09 Comment
元ポスト:
残差ストリームの精度はbf16で保存されるのが一般的で、70層以上の大きなモデルの場合、140回の累積演算を行うため、フル精度を保たないと誤差が蓄積し、学習に影響を与える可能性がある。実際に、bf16, fp32での残差ストリームのフル精度との差分や符号の反転を比較すると、fp32よりもbf16の方が誤差や符号反転の回数が、layerが深くなるにつれ顕著に大きくなった。
しかし、実際に3種類の幅・高さのバリエーションを持ったLlama3 1Bのバリエーションに対して、fp32、bf16の2種類の精度(つまり合計6種類のモデル・精度)で、FineWebから0.1Tトークンをバッチサイズ0.5M tokenで事前学習したところ、loss, downstreamタスクの性能共にほとんど差が見受けられなかった(唯一winograndeだけは差があった)、といった実験結果が記載されている。
筆者も示唆している通り、モデルのサイズや事前学習の学習トークン数の規模感が小さいので、より大きくしたら何か差は生まれるのだろうか。
2 つの設定で ARC-AGI-3 ベンチマークのスコアが 3 倍に, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #One-Line Notes #Compression #Reading Reflections #AgentHarness Issue Date: 2026-08-08 Comment
元ポスト:
ARC-AGI-3のベンチマークを測定する際に、ARC-AGI-3が提供いているオフィシャルのシンプルなハーネスではなく、Response APIで実施されているような reasoningの保持と圧縮をするようなハーネスに変更したら、スコアが3倍以上になったよ、という話のようである。
それはそう、という感じではあるのだが、シンプルなハーネスでそのモデルが持つ強みを発揮しきれないのであれば、公平な比較になっていないよね?という話でもある。モデルの能力を測定するための変数が増えすぎて、公平な比較をするのがどんどん難しくなってきている。
Codex Security, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #SoftwareEngineering #One-Line Notes #Security Issue Date: 2026-08-06 Comment
コードベースの脆弱性を検知するLLMベースのCLIツール
元ポスト:
LFM2.5-Encoders: Fast at Long Context, Even on CPU, Liquid AI, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #OpenWeight #Selected Papers/Blogs #Encoder #One-Line Notes #Reading Reflections Issue Date: 2026-08-06 Comment
元ポスト:
CPUでのinferenceにおいて、ModernBERTよりもlong context (8k付近)でのスループットが3.3倍高いEncoder。context長は8192。
HF: https://huggingface.co/LiquidAI/LFM2.5-Encoder-350M
日本語にも対応しているようだが、日本語ModernBertなどと比較して日本語でこのダウンストリームタスクの性能はどうなるだろうか
AI が広げる人々の仕事, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #One-Line Notes #Reading Reflections Issue Date: 2026-08-05 Comment
元ポスト:
ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。
このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?
AgentENV, kvcache-ai, 2026.07
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #Initial Impression Notes #Environment #SandboxEnvironment Issue Date: 2026-08-05 Comment
元ポスト:
大規模、かつ高速にAgentic RLのためのサンドボックス環境をself-hosting可能な実装
下記ポストに速度やKimi K3で利用された時の環境の規模感が記述されているので参照のこと:
MAI-Cyber-1-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Security Issue Date: 2026-08-05 Comment
元ポスト:
公式:
credit-assignment-is-all-you-need, haotian, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #PostTraining #reading #CreditAssignment Issue Date: 2026-08-05 Comment
元ポスト:
英語版公式ポスト:
Qwen3.8-Max: A New Bar for Coding and Cowork, QwenTeam, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #VisionLanguageModel Issue Date: 2026-08-05 Comment
元ポスト:
Fable5には及ばないがOpus4.8と同等以上のベンチマークスコア、という印象
細かすぎて伝わらないChat Completions _ Responses APIのモデル間挙動差異, nyanp, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Reasoning #API #SoftwareEngineering Issue Date: 2026-08-05 Comment
元ポスト:
Scaling Automated Post-Training, Intology, 2026.08
Paper/Blog Link My Issue
#Article #Blog #PostTraining #read-later Issue Date: 2026-08-05 Comment
元ポスト:
Mixture-of-Kittens: our open-source MoE megakernel for NVL72s, Cursor, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-08-05 Comment
元ポスト:
主要なOpenWeight LLM(アーキテクチャ)のスループットが軒並み2倍以上になっているので、これはかなりインパクトがでかい話に見える
関連:
- DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
- MoonEP, MoonshotAI, 2026.07
ポイント解説:
所見:
著者ポスト:
Introducing Antares: Highly Efficient Open Weight AI Models for Vulnerability Localization, Cisco Blogs, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #SmallModel #OpenWeight #SoftwareEngineering #One-Line Notes #Security Issue Date: 2026-08-04 Comment
HF: https://huggingface.co/fdtn-ai/antares-1b
コードベースの脆弱性を検知することに特化したSLM
ポイント解説:
公式ポスト:
Scaling Video Pretraining with Imagination Models, induction labs, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #FoundationModel #Blog #VideoGeneration/Understandings #Reading Reflections Issue Date: 2026-08-04 Comment
元ポスト:
動画で事前学習することでvision系タスクの基盤モデルとして有効に機能する、という話が最近増えてきたように感じる。
optimize_anything Goes omni: Composing Optimizers into Meta-Optimizer Pipelines, Shangyin Tan+, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #One-Line Notes Issue Date: 2026-08-04 Comment
元ポスト:
GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、
Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、
Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善
このようなパイプラインを実現するmeta optimiser-omniを実装している。
関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03
SIGReg from First Principles, Reza Bayat, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #RepresentationLearning #Self-SupervisedLearning #read-later #WorldModels #LatentRepresentation Issue Date: 2026-08-04 Comment
元ポスト:
JEPA関連のチュートリアル
関連:
- [Paper Note] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture, Mahmoud Assran+, CVPR'23, 2023.01
- [Paper Note] LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, Randall Balestriero+, arXiv'25, 2025.11
- [Paper Note] LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels, Lucas Maes+, arXiv'26, 2026.03
- JEPAwiki, mishig, 2026.04
著者ポスト:
Introducing MAI-Image-2.5- Pro and MAI-Voice-2-Flash, MAI, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #SpeechProcessing #TextToImageGeneration #Proprietary #TTS #ImageSynthesis Issue Date: 2026-08-03 Comment
元ポスト:
関連:
- Building a hill-climbing machine: Launching seven new MAI models, Mustafa Suleyman, MAI, 2026.06
WeirdChat: A catalog of unexpected AI behaviors, discovered automatically, Transluce, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #Blog #Safety #One-Line Notes Issue Date: 2026-08-03 Comment
元ポスト:
OpenWeightモデルからの100M以上のレスポンスから、安全性やAlignmentに問題のある応答をサンプリングし、再現可能な形でまとめたカタログのようである。
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-08-03 Comment
元ポスト:
費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。
nanogpt speedrunを通じた分析結果なども載っている。
長時間稼働モデル時代の安全性とアラインメント, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Blog #Safety #LongHorizon #Security #Initial Impression Notes Issue Date: 2026-07-31 Comment
元ポスト:
モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。
関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Introducing Cosmos 3 Edge, Nvidia, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Blog #SmallModel #OpenWeight #VisionLanguageModel #Robotics #WorldModels #EmbodiedAI Issue Date: 2026-07-31 Comment
元ポスト:
HF: https://huggingface.co/nvidia/Cosmos3-Edge?linkId=100000431533162
autoregressive -> diffusion の two-tower モデル
Cosmos3 テクニカルペーパー:
- [Paper Note] Cosmos 3: Omnimodal World Models for Physical AI, NVIDIA+, arXiv'26, 2026.06
Agentic World Models, Cameron R. Wolfe, Ph.D., 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #Blog #read-later #WorldModels Issue Date: 2026-07-31 Comment
元ポスト:
[Paper Note] Towards Long-Horizon Agents: A Survey Foundation, Evolution, Harness, Optimization, Application, and Frontier, Dong+, 2026.07
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #AIAgents #LongHorizon Issue Date: 2026-07-31 Comment
pj page: https://long-horizon-agents.github.io/
元ポスト:
とても良さそう。とんでもない量だ。。。Open Problemsのところは非常にコンパクトで明快
github:
https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
LLMエージェント評価の現在地 — 主要ベンチマークに学ぶ設計原則, Hiraoka, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #Evaluation #read-later Issue Date: 2026-07-31 Comment
元ポスト:
こちらの記事を含めて元ポストに5本、日本語でAI Agentの評価に関して実際に手を動かした知見がまとまっているようで、読みたい。
Introducing AutoEval to the Arena leaderboards, Arena Team, 2026.07
Paper/Blog Link My Issue
#Article Issue Date: 2026-07-30 Comment
元ポスト:
How to train a frontier-level world model, Monso+, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #Blog #WorldModels Issue Date: 2026-07-26 Comment
元ポスト:
The fastest LLM on Earth: Frontier level intelligence, 15x faster, celeris, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Blog #Proprietary #read-later #One-Line Notes Issue Date: 2026-07-25 Comment
元ポスト:
アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。
Artificial Analysisによるoutput speed評価で1位:
Introducing Claude Opus 5, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2026-07-25 Comment
元ポスト:
coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分
いよいよベンチマークではClaude一強という感じになってきた:
Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07
脆弱性を検知する能力が高い:
stack-v3-full, HuggingFaceCode, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #Blog #Coding #Selected Papers/Blogs #reading #One-Line Notes Issue Date: 2026-07-24 Comment
元ポスト:
114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。
また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。
Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24
所見:
FRONTIER-BENCH V0.1: A benchmark to measure and evolve with the frontier of agent work, FRONTIER-BENCH, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Selected Papers/Blogs #Live #reading #One-Line Notes Issue Date: 2026-07-24 Comment
元ポスト:
Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。
タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。
Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
Introducing Composite-Bench: the strongest open-weights model isn't Kimi K3, composite, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Evaluation #Blog #ComputerUse #VisionLanguageModel #LongHorizon #Initial Impression Notes Issue Date: 2026-07-24 Comment
元ポスト:
エンタープライズ向けのサービスに基づく専門家の操作に基づくbrowser-useベンチマークのようである。ざっくりブログを読んだが実際にどのようなサービスなのか知らないためあまりよくわからなかったので、公開されているベンチマークを見る方が直感的な理解は捗りそう。
本ベンチマーク上では、GLM-5.2がOpenWeightモデルの中では最も性能が高いようである。
FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence, Black Forest Labs, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #TextToAudio #MultiModal #TextToImageGeneration #Blog #Proprietary #VideoGeneration/Understandings #Editing #UMM #One-Line Notes #ImageSynthesis #TextToVideoGeneration #WorldActionModel Issue Date: 2026-07-24 Comment
元ポスト:
モデルは将来的にオープンになるようである
Inside TPU and GPU Clusters: The Anatomy of Collective Communication, Aleksa Gordić, 2026.07
Paper/Blog Link My Issue
#Article #read-later #Selected Papers/Blogs Issue Date: 2026-07-19 Comment
元ポスト:
- Inside vLLM: Anatomy of a High-Throughput LLM Inference System, Aleksa Gordić blog, 2025.08
Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #Blog #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-19 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-27b
Bonsaiシリーズ:
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
- Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
- Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
1-bit, ternary weightによって、27B級モデルがエッジデバイス上で動作する。
How up-to-date is each AI model?, Apoorv Saxena, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Evaluation #Blog #FactualKnowledge #One-Line Notes Issue Date: 2026-07-19 Comment
330種類の30ヶ月に及ぶ予測不可能なイベントに関する情報を持ちいてモデルの実際のknowledge cutoffを推定する
元ポスト:
Introducing Muse Spark 1.1, Meta, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #MultiModal #Proprietary #VisionLanguageModel #One-Line Notes Issue Date: 2026-07-19 Comment
元ポスト:
Muse Spark:
- Introducing Muse Spark: Scaling Towards Personal Superintelligence, Meta, 2026.04
大幅にAgenticな能力やコーディング能力が向上。Agenticな能力では多くのベンチマークでOpus4.8超え、CodingはGPT-5.5にベンチマーク上では及ばず(SWE Bench Proでは勝っているが、OpenAIから30%以上のpromptが評価で不適切との報告があった Separating signal from noise in coding evaluations, OpenAI, 2026.07 )。
Alexandr Wang氏によるポスト:
Inkling: Our open-weights model, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Blog #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #AudioLanguageModel Issue Date: 2026-07-16 Comment
HF: https://huggingface.co/thinkingmachines/Inkling
元ポスト:
THINNING MACHINESによる最初のOpenWeightモデル。975B-41B
- フルスクラッチで学習したReasoningモデル
- 1M context window
- text, image, audio, video 45Tトークンで学習
- バランスよくさまざまな領域で性能を発揮するように訓練し、Tinker上でのfinetuningやカスタマイゼーションの良い基盤として機能することを目指した
- vision, audioドメインに関してはencoder freeアーキテクチャを採用
- audio signalの入力は dMel spectrogramsと呼ばれる手法を採用
- [Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
- 画像は40x40のパッチに分割され、4つのhMLPと呼ばれるレイヤーでエンコーディング
- [Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
- IFの訓練には、Rubric basedなgraderとclaims graderの2種類のgraderを用いることで、helpfulnessとhallucinationを同時に低減
- Rubric basedなgraderはチェックリストに基づいてスコアリング
- claims graderはfactualな主張をagentic web searchを通じてverificationする
- アーキテクチャはDeepSeek V3を踏襲し、256のexpertsと2つのshared expertを採用し、6つのexpertsがactivateされる
- SWAとGlobal attentionの比率は5:1でKV Headは8つ (GQA)
- **相対位置エンコーディングを用いることでRoPEよりもlong contextに対してより高い外挿性能を示した**
- [Paper Note] Self-Attention with Relative Position Representations, Peter Shaw+, NAACL'18
- K, Vのprojection後、**およびattentionとMLPが残差ストリームに合流する前にshort convolutionを導入**
- QKV projection後に convolution を導入するアーキテクチャは下記研究で提案
- [Paper Note] Primer: Searching for Efficient Transformers for Language Modeling, David R. So+, NIPS'21, 2021.09
- optimiserはMuonとAdamWのハイブリッドで、前者は巨大な行列の重みに対して適用し、そのほかは後者を利用
- 重み自体が多様体上に存在するように制約することが有効であったことに着想を得て、weight decayを学習率の2乗に連動させることでモデルの重みの大きさを安定させたとのこと
- Modular Manifolds, Jeremy Bernstein+, THINKING MACHINES, 2025.09
- [Paper Note] Why Gradients Rapidly Increase Near the End of Training, Aaron Defazio, arXiv'25, 2025.06
- 事後学習としては、まずKimi K2.5を含むOpenWeightモデルで合成データ上でSFTをし、その後合成、あるいは人間が作成したenvironment上で大規模なRLを実施
- RLは非同期RLを異様し、ロールアウト数に対して推論能力が対数線形にスケールした。
- 最終的に30Mロールアウト以上のRLを実施した
- システムメッセージを変更し、トークン単位のコストを調整することでreasoning effortを調整
- Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
- **276B-A12BのInkling-Smallもプレビュー段階にあり、agenticな能力においてInklingに近い性能を達成しており、今後公開予定**
1M context windowを実現した工夫は特に書かれていなかったように感じるが、よく使われるのはKV CacheをコンパクトにするためのSparse Attention、あるいはLinear Attentionなのに対し、本モデルでは使われていないように見える。linear attentionでなくとも、SWAとGlobal Attentionのハイブリッド、かつGQAによって、KV Cacheの肥大化を実用レベルで抑制できるのだろうか。また、外挿性能に関してはRoPEは採用せず、相対位置エンコーディングのを採用したという点が効いているのだろうか。1Mレベルでのcontextでの評価がなさそうに見えるので性能はよくわからない。
RoPEのlong contextでの限界を示した以下の研究を思い出した:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Artificial Analysisによる評価:
アーキテクチャでの目新しい点:
所見:
公式:
所見:
AIDE²: The First Evidence of Recursive Self-Improvement, Waco Team, 2026.07
Paper/Blog Link My Issue
#Article #NLP #SelfImprovement #read-later #autoresearch/RSI #AgentHarness Issue Date: 2026-07-15 Comment
元ポスト:
FastAFD: Open-Source Large-Scale Attention-FFN Disaggregation on Blackwell NVL72, Hao AI Lab, 2026.07
Paper/Blog Link My Issue
#Article #LLMServing #read-later Issue Date: 2026-07-14 Comment
元ポスト:
Reducing Doom Loops with Final Token Preference Optimization, Liquid.AI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Reasoning #read-later Issue Date: 2026-07-12 Comment
元ポスト:
LingBot-VLA-V2, Robbyant, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #OpenWeight #Robotics #VisionLanguageActionModel #EmbodiedAI Issue Date: 2026-07-12 Comment
元ポスト:
Introducing Muse Image and Muse Video, Meta, 2026.07
Paper/Blog Link My Issue
#Article #TextToImageGeneration #Proprietary #VideoGeneration/Understandings #ImageSynthesis Issue Date: 2026-07-12 Comment
元ポスト:
Alexandr Wang氏によるポスト:
Harness Engineering for Self-Improvement, Lilian Weng, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #Blog #SelfImprovement #read-later #RecursiveModels #AgentHarness Issue Date: 2026-07-12 Comment
元ポスト:
Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase, databricks, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #AIAgents #Evaluation #Blog #read-later #Initial Impression Notes #AgentHarness Issue Date: 2026-07-10 Comment
元ポスト:
ハーネス選択によってトークン消費を1/2にでき、GLM 5.2のコストパフォーマンスが良いらしい
GPT-5.6: Frontier lntelligence that scales with your ambitlon, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ChatGPT #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-10 Comment
元ポスト:
GPT-5.6の変更点まとめ:
Model Guidance: https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
全体的に性能が高いだけでなく、コストパフォーマンスも良いという印象
コストパフォーマンス比:
Terra Ultra並の性能が必要なければ、Lunaのreasoning effortを上げるのがコスパ良いという話:
Lunaが80%の値下げでGPT-5.4-nanoよりも安くなった。触っている感じおそろしく安いくせに、非常に性能が高い。
大規模言語モデルの次期バージョンPLaMo 3シリーズにおける120B事前学習モデル、31B蒸留モデルの評価, PFN, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #LongContext #OpenWeight #Reading Reflections Issue Date: 2026-07-09 Comment
元ポスト:
weight reusing:
- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
- The Surprising Power of Small Language Models, Mojan Javaheripi+, Microsoft Research, 2023.12
long context評価:
- [Paper Note] RULER: What's the Real Context Size of Your Long-Context Language Models?, Cheng-Ping Hsieh+, COLM'24, 2024.04
- [Paper Note] Repeat After Me: Transformers are Better than State Space Models at Copying, Samy Jelassi+, arXiv'24, 2024.02
HF: https://huggingface.co/pfnet/plamo-3-nict-2604-31b-base
YaRNを適用するとlong contextの性能が大きく改善し、事前学習で学習させるトークン数を増やしすぎるとYaRNのcontext lengthの外挿能力が低下するという実験結果が非常に興味深い。
記載がなかった気がするのだが、Sink Tokenの利用などはやっているのだろうか?
- [Paper Note] YaRN: Efficient Context Window Extension of Large Language Models, Bowen Peng+, ICLR'24
How to Build a Diffusion Language Model, Kuleshov Group, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #LanguageModel #DiffusionModel #read-later Issue Date: 2026-07-09 Comment
元ポスト:
SWE-1.7: Frontier Intelligence at a Fraction of the Cost, Cognition, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary Issue Date: 2026-07-09 Comment
元ポスト:
Introducing Rampart, National Design Studio, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #Privacy #One-Line Notes #PII Issue Date: 2026-07-08 Comment
HF: https://huggingface.co/nationaldesignstudio/rampart
生成AIに送信されるリクエストを検閲し、プロンプトに含まれる個人情報をマスクするよう訓練された軽量モデルのようである。ブログ下部のデモンストレーションを見るとイメージを掴みやすい。
元ポスト:
80TB+ of astronomy for the HDD-poor: crossmatch the Multimodal Universe from your laptop, Mike Smith, 2026.06
Paper/Blog Link My Issue
#Article #Dataset #One-Line Notes Issue Date: 2026-07-08 Comment
元ポスト:
30以上の断片化されたデータソースに基づいて、ソース間を相互参照可能な形式(同じ天体に対して異なる観測をした場合などが該当するようで、以前は紐付けに大規模な計算機リソースが必要、かつ異なる保存形式やフォーマットなどの対応を取る必要があった)にした80TB超の銀河画像やスペクトル、時系列データ、測定値などを含む天文学データとのこと
The optimizer that outlived its proof: A case study on Adam, Sadhika Malladi, 2026.07
Paper/Blog Link My Issue
#Article #Blog #Optimizer #read-later Issue Date: 2026-07-07 Comment
元ポスト:
[Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #reading #Initial Impression Notes Issue Date: 2026-07-07 Comment
RLによる事後学習の際にtrainer側のoptimizerが1 step学習した後にinferenceエンジンに重みをpushするが、BF16でのRLにおける1 stepの更新では多くのモデルの重みに変化はなく(99%程度)、差分だけをpushすればlosslessで2桁程度trafficを削減できて、RDMAが不要でたとえばイーサネットベースのデータセンターを跨いだ環境でもRLが実行できそうだよ、という話のようである。
元ポスト:
Devin Fusion: Frontier Performance at 35% Lower Cost, Cognition, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Architecture #read-later #ContextEngineering #One-Line Notes #AgentHarness Issue Date: 2026-07-07 Comment
元ポスト:
高価で高性能なメインエージェントがタスクを管理し、安価なサイドキックエージェントがメインエージェントからタスクを移譲され処理をするようなアーキテクチャによって、メインエージェントで処理した場合と同等の性能を発揮しつつコストを削減できる。
似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Fusion Harness: How to combine a more expensive main model and a sidekick model, Graham Neubig, GithubGist, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #ContextEngineering #MinimalCode #One-Line Notes #AgentHarness #Gist Issue Date: 2026-07-07 Comment
元ポスト:
openhands SDKを用いて、全体の管理を高性能で高価なメインエージェントにより実施し、個々の作業を安価なサブエージェントに移譲することで、コンテキストを管理しつつパイプライン全体のコスト削減を実施する実装
似たような考え方はAgent Swarmなどでも実施されている。Agent Swarmはハーネスだけでなく、モデル自身もサブエージェントをうまく活用できるような学習のされかたをしている:
- [Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
From Brain Waves to Words: Brain2Qwerty Offers a New Path to Communication Without Surgery, Meta, 2026.06
Paper/Blog Link My Issue
#Article #read-later Issue Date: 2026-07-05 Comment
元ポスト:
Using Local Coding Agents, Sebastian Raschka, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #AIAgents #Blog #Coding #OpenWeight #LLMServing #SoftwareEngineering #AgentHarness Issue Date: 2026-07-05 Comment
元ポスト:
報酬ハッキングがモデルの知能向上を食い潰している, Cursor, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #ReinforcementLearning #AIAgents #Evaluation #Blog #RewardHacking #Selected Papers/Blogs #One-Line Notes #Contamination Issue Date: 2026-07-05 Comment
元ポスト:
SWE Bench Proにおいて、公開リポジトリやリポジトリの履歴にアクセスすることを厳格に禁止したハーネスを用いてproprietaryモデルを評価したところ標準的なハーネスと比較してスコアが大きく低下した。どれだけスコアが減少したかはモデルごとに異なり、たとえばOpus 4.8系のモデルでは8.1--9.1ポイント程度、GPT5.5系では2.6 -- 3.4%程度スコアが低下した。最近のモデルほどスコアが低下する傾向がある、という話のようである。たとえば、731件のOpus 4.8 Maxのtraceを監査用のモデルを用いて調べると、traceの57%において公開リポジトリでマージ済みのPR、または修正済みのソースファイルを見つけ修正をそのまま再現し、9%程度のtraceで.git履歴からバグ修正前後のコミットを検索しパッチを抜き出していた。モデルが協力になるにつれて、自身が評価中であることを認識し、既に与えられたタスクが解決済みであるためのヒントを見出し、RewardHackingのような挙動を示すような傾向にある、という話のようである。
実際にどの程度スコアに影響を与えていたかが見れるのは興味深い。
How agents are transforming work, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #AIAgents #Blog Issue Date: 2026-07-05 Comment
元ポスト:
[Paper Note] Economic Evaluations of Language Models, Wan+, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs Issue Date: 2026-07-05
Leanstral 1.5: Proof Abundance for All, Mistral AI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #Mathematics #OpenWeight #Proofs Issue Date: 2026-07-04 Comment
元ポスト:
HF: https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B
所見:
The Verification Stack, OpenHands, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #SoftwareEngineering #Selected Papers/Blogs #Verification #reading #One-Line Notes Issue Date: 2026-07-03 Comment
元ポスト:
コードがプッシュされる前にエージェントの作業を評価する小型のcriticモデルと、プルリクエストに対してコードレビュー(スキルを利用)+QAを実施するシステム(実際にエントリーポイントを見つけ、動作させ、証跡を資料としてまとめてレポートをポストするシステム)によってコードの検証プロセスを効率化し、マージまでの時間が平均58%削減され、開発効率が向上する話のようである。
Speculative Decoding - The Bits and the Bytes, Aakash Kumar Nain, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Blog #Decoding #read-later #SpeculativeDecoding Issue Date: 2026-07-03 Comment
元ポスト:
Speculation Is All You Need, Modal, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Decoding #read-later #SpeculativeDecoding Issue Date: 2026-07-03 Comment
元ポスト:
[Paper Note] EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments, ByteDance Seed, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-07-03 Comment
blog: https://edge-bench.org/
人間が平均で57.2時間かかるようなlong horizonなタスクによるAgentのベンチマーク
Sarashina3 guard: 日本語特化ガードレールモデル, SB Intuitions, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Japanese #Safeguard Issue Date: 2026-07-02 Comment
元ポスト:
Learning to Replicate Expert Judgment in Financial Tasks, THINKING MACHINES, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #Financial #PostTraining #read-later Issue Date: 2026-07-02 Comment
元ポスト:
Your research partner for rigorous science, Claude, 2026.07
Paper/Blog Link My Issue
#Article #GenerativeAI #Blog #ScientificDiscovery #Science Issue Date: 2026-07-02 Comment
元ポスト:
Simple, Fast, Vibe‑Ready ZCode combines the best AI agents with your existing tools so you can plan, code, review, and deploy without friction., Z.ai, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Coding #SoftwareEngineering #Initial Impression Notes #AgentHarness Issue Date: 2026-07-02 Comment
元ポスト:
GLMのZ.aiによるAgent Harness (Scaffolding)
