OpenWeight (517) — 1/3
[Paper Note] T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks, Junyao Yang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Actor-Critic #Coding #SoftwareEngineering #PostTraining #Author Thread-Post #CreditAssignment Issue Date: 2026-09-13 GPT Summary- エージェントは長期タスクに適応し、122BのMixture-of-Expertsモデルを強化学習で訓練。実際のシェルを操作し、最大300回のツール呼び出しとタスク検証を行う。訓練では、アクター‐クリティック法を安定化し、正確なサンプルリングを行うことで最適化。Terminal-Bench 2.1を用いて真の能力移転を達成し、T1は27.9%に到達し、他のモデルを上回る性能を示した。 Comment
元ポスト:
pj page: https://jyyang26.github.io/t1/
[Paper Note] NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference, Aurélien Lac+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#ComputerVision #Embeddings #NLP #MultiModal #Encoder #UMM #Author Thread-Post Issue Date: 2026-09-07 GPT Summary- NeoMMEは、260Mおよび800Mパラメータの双方向マルチモーダルエンコーダで、テキストと画像を統合的に処理。ゼロから事前学習し、ViDoRe v3ベンチマークで優れた性能を発揮。非対称量子化により、文書埋め込みを大幅に圧縮し、Hugging Face Transformersで公開。 Comment
元ポスト:
[Paper Note] Apodex 1.1: Scaling Agentic Intelligence for Complex Work, B. An+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #ScientificDiscovery #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-08-30 GPT Summary- Apodex 1.1は、複雑な作業における「作業能力」を二つの次元で進化させ、持続可能で検証可能な進捗を実現する。環境スケーリングは実行可能ファイルや情報源の多様性を拡大し、エージェント中心の協調スケーリングは長期的なタスクを分解し、並行作業を委任する。共通の実行ハーネスとAgentOSにより、タスク状態を維持し、訓練が信頼できる挙動を促進する。Apodex 1.1は350億パラメータのモデルで、様々な領域において先端性能を達成し、長時間の複雑なタスクに対応する能力を備える。 Comment
元ポスト:
専門職(アナリストや弁護士等)、finance、化学研究に特化した36Bモデルで、ベンチマークスコアはKimi-K3等にも匹敵するモデルとハーネスのようである
関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
HF:
https://huggingface.co/collections/apodex/apodex-11
ハーネス:
https://github.com/ApodexAI/FrontierAgent
所見:
- [Paper Note] PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost, Junkeun Yi+, arXiv'26, 2026.03
[Paper Note] MOSS-VL Technical Report, Pengyu Wang+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#VideoGeneration/Understandings #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-19 GPT Summary- MOSS-VLは、リアルタイムのインタラクションを可能にするビジョン-ランゲージモデルファミリです。言語デコーダは視覚情報をゲート付きクロスアテンションで処理し、生成中にフレームを参照します。合成コーパスがインタラクションを監視し、段階的なカリキュラムが訓練を最適化します。オフライン基盤でのMOSS-VL-Instructは競争力があり、MOSS-VL-Realtimeはストリーミングモデルで最高の性能を示しました。視覚トークンのデコード性能も向上し、初期トークンの処理時間優位性を拡大しました。すべてのチェックポイントとコードはオープンソースで公開されています。 Comment
元ポスト:
[Paper Note] Motif 3: Technical Report, Junghwan Lim+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel Issue Date: 2026-08-11 GPT Summary- Motif 3は、3140億のパラメータを持つデコーダー専用のMixture-of-Experts言語モデルで、トークンごとに384のエキスパートから8つを選択するスパースMoE層を採用。Grouped Differential Latent Attention(GDLA)を核にし、専門化と効率を向上させ、最大256Kトークンの訓練を実現。得られたモデルは推論やコーディング、指示追従などの能力を統合し、競争力のある性能を発揮。 Comment
HF: https://huggingface.co/Motif-Technologies/Motif-3
関連:
- Motif-3-Beta, Motif-Technologies, 2026.07
所見:
[Paper Note] K-EXAONE 2.0 Technical Report, Eunbi Choi+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- K-EXAONE 2.0は、LG AI Researchが開発したオープンウェイトの多言語基盤モデルで、7500億の総パラメータを持つMixture-of-Experts(MoE)モデル。最大256,000トークンのコンテキスト長をサポートし、言語対応を六言語から十言語に拡張。継続的な事前訓練や中間訓練を通じて推論力や安全性が向上し、評価カテゴリーで前任モデルを上回る性能を示す。Apache 2.0ライセンスで公開され、AIエコシステムの発展を促進。 Comment
関連:
- K-EXAONE-236B-A23B, LG AI Research, 2025.12
HF: https://huggingface.co/LGAI-EXAONE/K-EXAONE-2.0-750B-A37B
[Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Selected Papers/Blogs #RecurrentModels #RecursiveModels #Initial Impression Notes Issue Date: 2026-08-03 GPT Summary- Nanbeige4.2-3Bは、3Bのパラメータを持つコンパクトなエージェントモデルで、各種タスクや推論能力において高いパフォーマンスを示します。Looped Transformerを活用して新たなパラメータ追加なしに容量を拡張し、28兆トークンから事前学習されています。RLパイプラインによりモデル品質を向上させ、広範な評価で他のエージェントと比較して競争力を維持しながら、特にローカルパーソナルアシスタントとしての利用が期待されます。 Comment
元ポスト:
HF: https://huggingface.co/Nanbeige/Nanbeige4.2-3B
Looped Transformerがアーキテクチャとして採用されたOpenWeightモデル
以下の部分は興味深いが、具体的なAblationによる実験結果などは無さそうに見える。
>Loop Depth Selection. We study the number of passes through the shared layer stack. A two-pass
configuration provides the most favorable trade-off in our experiments: relative to a standard Trans-former, it retains approximately 75% of the token efficiency and provides a significant capacity gain. Increasing the number of passes provides only marginal additional improvement, but substantially
slows training and makes optimization less stable.
[Paper Note] Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model, Xinghang Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #MultiModal #FoundationModel #TextToImageGeneration #Robotics #EmbodiedAI #ImageSynthesis Issue Date: 2026-07-19 GPT Summary- Xiaomi-Robotics-U0は、380億パラメータを持つマルチモーダル自己回帰モデルで、具現化生成のための統一的な枠組みを提供。画像・動画生成を含む多様なタスクを共同最適化し、事前訓練済みモデルの一般化を保持しつつ具現化設定に適応。これにより、高品質なマルチビューシーン生成が可能となり、細粒度の編集制御が実現。単一ステップ及び逐次生成タスクで最先端の成果を上げ、具現化動画生成でトップに立ち、実世界の操作タスクの成功率を向上させた。この成果は、基盤世界モデルが具現世界モデルとしての機能を持つことを示している。 Comment
元ポスト:
pj page: https://robotics.xiaomi.com/xiaomi-robotics-u0.html
HF: https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
[Paper Note] Infinite Worlds with Versatile Interactions, Zelin Gao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #Selected Papers/Blogs #WorldModels #interactive #3D (Video) #Realtime #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- LingBot-World 2.0を紹介。出力品質を保ちながら無限に広がる対話の時間的範囲を実現し、リアルタイム応答を可能にする。多様なインタラクティブ要素を導入し、エージェント機能の統合にも先駆ける。複数プレイヤーが同時に参加できるインターフェースを開発し、14Bモデルと1.3Bモデルを組み合わせてGPUデプロイを簡素化。 Comment
pj page: https://technology.robbyant.com/lingbot-world-v2
元ポスト:
公式:
HF: https://huggingface.co/collections/robbyant/lingbot-world-v2
[Paper Note] Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence, Shuailei Ma+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #Pretraining #FoundationModel #Selected Papers/Blogs #Robotics #3D (Video) #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- ロボット制御に特化した動画生成モデルLingBot-Videoを提案。Mixture-of-Experts(MoE)アーキテクチャを採用し、計算効率とモデリング容量のバランスを向上。ロボット志向の映像を追加するデータプロファイリングエンジンを構築し、行動理解を強化。物理的合理性を保証する多次元報酬システムを導入し、標準を超える評価を実施。LingBot-Videoはデジタル創造と物理的作動を結ぶ大規模・オープンソースのMoE動画基盤モデルとしてコミュニティに貢献。 Comment
元ポスト:
pj page: https://technology.robbyant.com/lingbot-video
HF: https://huggingface.co/collections/robbyant/lingbot-video
公式:
[Paper Note] Vision as Unified Multimodal Generation, Xiaoyang Han+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #Supervised-FineTuning (SFT) #PostTraining #VisionLanguageModel #UMM #Author Thread-Post Issue Date: 2026-07-14 GPT Summary- コンピュータビジョンを統一型多模态生成として定式化し、SenseNova-Visionは自然言語指示と視覚プロンプトを用いて多様な視覚タスクを表現。指示-応答の例を生成するSenseNova-Vision Corpusを作成し、タスク特異的なアーキテクチャを必要とせず学習。得られたモデルは広範な視覚タスクに対応し、実験により単一の統一モデルがタスク特化システムと同等の性能を発揮することを示した。このアプローチは、コンピュータビジョン機能を汎用的なモデルに統合するスケーラブルな方法を示唆している。モデルとコーパスは公開されている。 Comment
HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
著者ポスト:
[Paper Note] Gemma 4 Technical Report, Gemma Team+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #AudioLanguageModel Issue Date: 2026-07-12 GPT Summary- Gemma 4は新世代のオープンウェイトマルチモーダル言語モデルで、計算効率と推論能力の向上を目指します。DenseとMixture-of-Expertsアーキテクチャを採用し、パラメータ数は23億〜310億で、視覚および音声エンコーダを強化しました。特に12Bモデルにはエンコーダを用いない統一アーキテクチャが導入され、生の音声と画像パッチを扱います。推論の痕跡を生成する機能を統合し、推論速度やメモリ効率を改善。Gemma 4は、STEMやマルチモーダルタスクで飛躍的な性能を達成し、最前線のオープンモデルに匹敵します。 Comment
元ポスト:
Gemma 4:
- Gemma 4: Byte for byte, the most capable open models, Google, 2026.04
ポイント解説:
解説:
[Paper Note] Unlimited OCR Works, Youyang Yin+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #NLP #LongContext #VisionLanguageModel #OCR Issue Date: 2026-07-03 GPT Summary- Unlimited OCRは、DeepSeek OCRに基づき、長期的なメモリ効率を改善するために設計されたモデルである。大規模言語モデル(LLM)を用いることでOCR性能向上が期待されるが、出力系列が長くなるとメモリ消費が増大し、生成速度が低下する問題がある。本研究では、Reference Sliding Window Attention(R-SWA)をアテンション層に導入し、KVキャッシュを一定に保ちながら計算コストを削減。これにより、最大32Kの長さのもとで、数十ページの文書を効率的に処理できる。また、R-SWAはASRや翻訳など他のタスクにも応用可能である。コードとモデル重みは公開されている。 Comment
HF: https://huggingface.co/baidu/Unlimited-OCR
元ポスト:
2週間で1Mダウンロード:
[Paper Note] Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis, Lianbo Liu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #SpeechProcessing #Japanese #TTS Issue Date: 2026-06-29 GPT Summary- 日本語中心のLLM-TTSシステムSarashina2.2-TTSを紹介。約361,000時間の音声データを使用し、日本語の漢字の多義性に対応するデータ拡張パイプラインを設計。Joyo Kanji Yomi Benchmarkを用いて、漢字の読み方の正確さを測定。実験によりデータ拡張が効果を示し、漢字レベルの精度で最先端の性能を達成。クロスリンガル評価では日本語発音の安定性も確認され、訓練アプローチが効果的であることが示された。 Comment
元ポスト:
[Paper Note] Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale, Ang Li+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Author Thread-Post Issue Date: 2026-06-17 GPT Summary- 効率的なエージェント型知能を目指し、Ling-2.6 と Ring-2.6 のモデルファミリを提案。Ling-2.6 は即時応答に特化し、Ring-2.6 は高度な推論に対応。Ling-2.0 からのアップグレードは、モデルの統一的共同設計によって実現。ハイブリッド線形アテンション設計で長文脈の効率を向上し、出力トークンの能力を最適化。Ring-2.6-1T には強化学習フレームワーク KPop を導入し、エージェント-環境学習を強化。2.6 ファミリはオープンエージェント型システムへの実践的道筋を提供し、全チェックポイントをオープンソース化。 Comment
- inclusionAI: Ling-2.6-flash (free), OpenRouter (InclusionAI), 2026.04
- Ring-2.6-1T, inclusionAI, 2026.05
元ポスト:
所見:
[Paper Note] Mellum2 Technical Report, Marko Kojic+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #MoE(Mixture-of-Experts) Issue Date: 2026-06-05 GPT Summary- Mellum 2は、ソフトウェアエンジニアリング向けの12BパラメータMoE言語モデルで、トークンあたり2.5Bのアクティブパラメータを有する。主な機能としてコード生成やデバッグ、マルチステップ推論をサポートし、64エキスパートのMixture-of-Expertsアーキテクチャを基盤にしている。また、事前学習には約10.6兆トークンを用いた3段階のカリキュラムを採用し、二段階のポスト訓練によりInstructモデルとThinkingモデルの二つのバリアントが開発された。Mellum 2は、オープンウェイトベースラインと競合しつつ効率的な計算を実現している。 Comment
[Paper Note] Paris 2.0: A Decentralized Diffusion Model for Video Generation, Ali Rouzbayani+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#VideoGeneration/Understandings #One-Line Notes #Author Thread-Post #DistributedLearning Issue Date: 2026-05-31 GPT Summary- Paris 2.0は、分散計算を駆使した事前学習動画生成モデルで、従来のParis 1.0に基づいている。新モデルは、時系列的一貫性を実現し、低解像度のテキストから動画生成において、従来のモノリシックモデルと比べてFrechet Video Distanceを約2.0倍改善した。また、CLIPテキスト-動画類似度や美的スコアも向上した。 Comment
HF: https://huggingface.co/bageldotcom/paris2
元ポスト:
Paris2.0は独立した拡散モデルのアンサンブルによって実現される(巨大なGPUクラスターを必要としない)動画生成モデルで、それぞれのエキスパートはエキスパート間でパラメータや勾配をcommunicationせず、独立したデータによって学習されており、推論中は軽量なルータが各ノイズ除去のステップにおいてサブセットを選択することでデノイジングを進めていくとのこと。
[Paper Note] The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, MiniMax+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SelfImprovement #MoE(Mixture-of-Experts) #read-later #Initial Impression Notes Issue Date: 2026-05-27 GPT Summary- MiniMax-M2シリーズは、ミニアクティベーション原理に基づくMixture-of-Experts言語モデルで、フラグシップのM2は229.9Bのパラメータを持ち、9.8Bのパラメータがトークンごとに活性化される。エージェント運用に最適化されたこのシリーズは、エージェント駆動のデータパイプライン、スケーラブルなエージェントネイティブRLシステムForge、自己進化を目指すM2.7チェックポイントの三要素に基づいている。これにより、エージェント的コーディングやディープサーチ、業務タスクにおいて最前線クラスのパフォーマンスを実現している。 Comment
元ポスト:
ポイント解説:
関連:
- MiniMax-M2.7, MiniMax, 2026.03
expertの数を大きくしているようで、この設計は下記の知見と一致する:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
Carbon: Decoding the Language of Life, Allal+, bioRxiv'26, 2026.05.25
Paper/Blog Link My Issue
#NLP #LanguageModel #FoundationModel #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
著者ポスト2:
github: https://github.com/huggingface/carbon
genomic foundation model
[Paper Note] MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction, Junbo Cui+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #SpeechProcessing #Speech #SmallModel #VisionLanguageModel #2D (Image) #3D (Video) #Omni #audio #text #Realtime #SpeechToSpeech Issue Date: 2026-05-12 GPT Summary- MiniCPM-o 4.5は、リアルタイムの全二重オムニモーダル対話を実現する最新の進展であり、視覚・聴覚・発話を同時に処理可能。Omni-Flowを用いた統一的なフレームワークにより、知覚と応答を融合させ、能動的な行動を促進する。90億パラメータを持ち、Gemini 2.5 Flashに近い性能を発揮し、エッジデバイス上でもリアルタイム処理が可能となる。 Comment
HF: https://huggingface.co/openbmb/MiniCPM-o-4_5
元ポスト:
[Paper Note] ZAYA1-8B Technical Report, Robert Washbourne+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Attention #SmallModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-05-09 GPT Summary- ZAYA1-8Bは700Mの有効パラメータを持つMixture-of-Expertsモデルで、難易度の高い数学・コーディングベンチマークで優れた性能を発揮。ゼロから訓練され、RLカスケードを通じて推論能力を強化。Markovian RSAを導入し、テスト時の計算手法で他の大規模モデルとの差を縮めることに成功。TTC評価では高い精度を記録し、競争力を維持。 Comment
HF: https://huggingface.co/Zyphra/ZAYA1-8B
元ポスト:
Convを用いたKV Cacheの圧縮やより賢いMoE Router, Learned Residual Scalingなどさまざまなアーキテクチャ上の工夫や、Reasoning firstな事前学習が実施されているようで、activationパラメータあたりのHMMTでのスコアが既存モデルと比較して群を抜いて高いようである。
所見:
-
-
[Paper Note] DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data, Venus Team+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #SmallModel #OpenSource #DeepResearch #Author Thread-Post #EdgeDevices Issue Date: 2026-04-25 GPT Summary- エッジ規模の小型深層研究エージェントDR-Venusを提示し、限られたオープンデータを基に強力な性能向上を実現。二段階の訓練プロセスでは、第一段階で基本能力を確立し、データ品質を改善、第二段階で強化学習を導入し実行信頼性を向上。約1万のオープンデータで構築されたこのエージェントは、従来の9Bモデルを上回り、30Bシステムとの差も縮小。再現性のある研究に資するため、モデルやコードを公開。 Comment
models:
https://huggingface.co/collections/inclusionAI/dr-venus
code:
https://github.com/inclusionAI/DR-Venus
オープンなデータのみで構築されたtraining/inferenceパイプラインもオープンなDeepResearchエージェント。
元ポスト:
[Paper Note] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, DeepSeek-AI+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Infrastructure #AIAgents #Attention #LongContext #PositionalEncoding #Optimizer #Architecture #MoE(Mixture-of-Experts) #AttentionSinks #read-later #Selected Papers/Blogs #RewardModel #Reference Collection #KV Cache #Compression #GenerativeVerifier #SparseAttention #ResidualStream #SelfDistillation #Author Thread-Post Issue Date: 2026-04-24 GPT Summary- DeepSeek-V4シリーズのプレビュー版が発表され、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashを含み、長さ100万トークンの文脈長をサポート。主なアップグレードには、効率的な文脈処理のためのハイブリッドアテンションアーキテクチャ、強化された残差接続、安定したトレーニングを実現するMuonオプティマイザが挙げられます。両モデルは、高品質の32兆トークンで事前学習され、ポストトレーニングパイプラインにより能力が強化されます。DeepSeek-V4-Pro-Maxは最先端の推論能力を誇り、特に長い文脈において高い効率を発揮します。モデルのチェックポイントは公開されています。 Comment
HF: https://huggingface.co/collections/deepseek-ai/deepseek-v4
元ポスト:
とうとうでました
所見:
所見:
Artificial Analysisによる評価:
所見:
所見:
-
所見:
1Mコンテキストにおいて、V3.2と比較してわずか10%のKV Cacheしか必要としないとのこと。
所見:
1Mトークンのcontext windowを実用的にするために最新の叡智が詰め込まれまくっているという感じのようである。うーむ読むしかない
所見:
RTX 6000で4基でFlashが動いたよ、という報告に見える:
解説:
所見:
関連:
- HiSparse: Turbocharging Sparse Attention with Hierarchical Memory, LMSYS, 2026.04
Self Rewarding LMsのコンセプトが利用されている:
Proは、Flashをlong contextを扱える様々なドメインのスペシャリストとして訓練し、OPDによって蒸留されたものなのでは?という話:
論文中に疑問点をアノテーションした結果が共有されている:
[Paper Note] RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time, Haozhe Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #ComputerVision #NLP #TextToImageGeneration #Reasoning #Test-Time Scaling #read-later #Selected Papers/Blogs #RewardModel Issue Date: 2026-04-19 GPT Summary- 報酬モデルは、評価を単一のスコアに縮約するのではなく、明示的で多次元の批評を生成することで、生成物の改善を促進する。本研究では、構造化された合理根拠を用いて報酬を提供し、Generate-Critique-Refineループにより批評をプロンプト修正に変換する方法を示す。また、Preference-Anchored Rationalization(PARROT)を導入し、容易に得られるデータから高品質な合理根拠を回収するフレームワークを提供する。得られたRationalRewardsモデルは、オープンソースの中で最先端の予測精度を達成し、より少ない訓練データで優れた性能を発揮する。批評-修正ループは、既存モデルの潜在能力を引き出し、より良い生成結果を提供する。 Comment
pj page: https://tiger-ai-lab.github.io/RationalRewards/
元ポスト:
[Paper Note] Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-04-17 GPT Summary- Nemotron 3 Super は、1200億パラメータを持つ新しい Mixture-of-Experts モデルで、事前学習に NVFP4を使用。事後学習には SFT と RL を採用し、最大 1M のコンテキスト長をサポート。推論スループットは従来モデルと比べて最大 7.5 倍向上し、オープンソースのデータセットが提供されています。 Comment
元ポスト:
[Paper Note] Vero: An Open RL Recipe for General Visual Reasoning, Gabriel Sarch+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #Reasoning #OpenSource #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment
元ポスト:
ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。
[Paper Note] OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models, Han Zhu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #SpeechProcessing #DiffusionModel #Speech #MultiLingual #TTS #Initial Impression Notes Issue Date: 2026-04-07 GPT Summary- OmniVoiceは、600言語以上対応した多言語ゼロショットTTSモデルで、離散的非自己回帰アーキテクチャを採用。従来の複雑なパイプラインを排除し、テキストを直接音響トークンにマッピング。全コードブックランダムマスキング戦略とLLMからの初期化が技術革新を支える。581,000時間のオープンソースデータセットに基づき、中国語・英語などで最先端の性能を示す。モデルはオープンソースとして公開。 Comment
元ポスト:
github: https://github.com/k2-fsa/OmniVoice
dLMアーキテクチャだからかなり早いのでは。600+言語をサポート。
[Paper Note] VOID: Video Object and Interaction Deletion, Saman Motamed+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #VideoGeneration/Understandings #Editing #One-Line Notes Issue Date: 2026-04-05 GPT Summary- 動画オブジェクト除去での現行手法は、背景の修正や外観アーティファクトの処理には優れているが、オブジェクト間の衝突などの複雑な相互作用には対応できない。そこで、新たに提案するフレームワーク VOID は、物理的に妥当なインペインティングを実現する。Kubric と HUMOTO を使用して、相互作用を変更する反事実的データセットを生成し、ビジョン-言語モデルが影響を受けるシーンを特定。従来手法よりも一貫した動的挙動を保持することを実験で確認し、このフレームワークが動画編集モデルの進化に寄与すると期待される。 Comment
pj page: https://void-model.github.io/
元ポスト:
HF: https://huggingface.co/netflix/void-model
NetflixがHFに公開した初めてのモデルとのこと。動画中のobjectを削除することに特化したモデルのようで、単にobjectを削除し影や反射を無くすといった話だけでなく、そのobjectが消滅したことによって物理的な相互作用も反映させる(物体が落下するなど)ということらしい。
[Paper Note] daVinci-LLM:Towards the Science of Pretraining, Yiwei Qin+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #OpenSource #read-later #Selected Papers/Blogs #Reference Collection #Initial Impression Notes Issue Date: 2026-03-31 GPT Summary- 基盤となる事前学習はモデルの限界を決め、事後訓練で克服するのが難しい。daVinci-LLMは、産業規模の資源と研究の自由を結集し、透明性のある完全オープンなパラダイムで事前学習を進展させる。8兆トークンを用いた二段階適応カリキュラムを採用し、能力向上のプロセスを体系的に評価。処理の深さやドメイン特性が能力に与える影響を明らかにし、探索プロセスを公開することでコミュニティが知識を蓄積できる基盤を提供する。 Comment
元ポスト:
github: https://github.com/GAIR-NLP/daVinci-LLM
オープン"ソース" (=コード, データ, モデルが公開されている(さらに厳密にはライセンスに問題がない))な関連研究:
- OpenLLaMA, Xinyang+, 2023.05
- Introducing Marin: An Open Lab for Building Foundation Models, marin-community, 2025.05
- Marin 32B Retrospective, marin-community, 2025.10
- [Paper Note] Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, Stella Biderman+, arXiv'23, 2023.04
- [Paper Note] Olmo 3, Team Olmo+, arXiv'25, 2025.12
- [Paper Note] K2-Think: A Parameter-Efficient Reasoning System, Zhoujun Cheng+, arXiv'25, 2025.09
- [Paper Note] DataComp-LM: In search of the next generation of training sets for language models, Jeffrey Li+, NeurIPS'25, 2024.07
- [Paper Note] LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs, LLM-jp+, arXiv'24, 2024.07
- [Paper Note] TinyLlama: An Open-Source Small Language Model, Peiyuan Zhang+, arXiv'24, 2024.01
- [Paper Note] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model, BigScience Workshop+, arXiv'22, 2022.11
- [Paper Note] OLMo: Accelerating the Science of Language Models, Dirk Groeneveld+, arXiv'24, 2024.02
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
- [Paper Note] GPT-NeoX-20B: An Open-Source Autoregressive Language Model, Sid Black+, arXiv'22, 2022.04
- SmolLM2, 2024.11
- [Paper Note] LLM360: Towards Fully Transparent Open-Source LLMs, Zhengzhong Liu+, COLM'24, 2023.12
- SmolLM3: smol, multilingual, long-context reasoner, HuggingFace, 2025.07
- The Smol Training Playbook: The Secrets to Building World-Class LLMs, Allal+, HuggingFace, 2025.10
この辺の研究を全て紐解いていったらどのような変遷が起きているだろうか?
- RedPajama, a project to create leading open-source models, starts by reproducing LLaMA training dataset of over 1.2 trillion tokens, together.ai, 2023.04
- [Paper Note] Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model, Ahmet Üstün+, arXiv'24, 2024.02
- SmolLM - blazingly fast and remarkably powerful, Allal+, HuggingFace, 2024.07
この辺も関連はしているが、データはオープンだがソースコードがおそらく公開されていない。
事後学習なら
- [Paper Note] Tulu 3: Pushing Frontiers in Open Language Model Post-Training, Nathan Lambert+, COLM'25, 2024.11
[Paper Note] MolmoWeb: Open Visual Web Agent and Open Data for the Open Web, Tanmay Gupta+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #AIAgents #MultiModal #OpenSource #ComputerUse #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #GUI Issue Date: 2026-03-24 GPT Summary- MolmoWebは、ウェブエージェントをオープンな環境で構築するために、(1) 大規模な混合データセットMolmoWebMixと、(2) 完全オープンなマルチモーダルエージェントのMolmoWebを提案。MolmoWebMixは、10万超の合成タスクと3万件以上の人間デモを統合し、エージェントは視覚言語アクションポリシーを用いて次のブラウザ操作を予測。MolmoWebエージェントは同規模の他のモデルを上回る性能を示し、再現性とオープンな研究を促進するために関連リソースを公開。 Comment
元ポスト:
github:
https://github.com/allenai/MolmoWeb
学習、評価ハーネス、アノテーションツール、合成データパイプライン、デモのclient sideのコードがリリース
Molmo2をベースにしたオープンソースのBrowser Useエージェント。スクリーンショットを通じて次のアクション(クリック、文字入力、スクロール)を予測し実行する。
従来のBrowser Useエージェントの多くは非公開データを用いている中、MolmoWebMixと呼ばれる大規模なデータセットを公開。合成データ(タスクに成功したsingleエージェントのtrajectory, タスクをサブタスクに分解して実行するタイプのmulti-agent pipeline, 数百のwebsiteのリンク構造を体系的に探索して構築されたナビゲーションの経路等)と人間に寄る高品質なアノテーション(36k, 1100タスク, 623k件の個別のサブタスクのデモンストレーションで、過去最大規模)の2種類で構成されるとのこと。
また、BroserのGUIを認識するための学習データも含まれる。これはGUIのgrounding taskと、webページの内容を読み取りながら推論を実施するスクリーンショットがgivenなQAタスクのデータとsて構成され、400程度のサイトから収集した、2.2MのQAペアによって編成される。
4種類のベンチマークで評価した結果、プロプライエタリモデルには一部及ばないものもあるが、同等規模なOpenWeightモデルをoutperform。また、WebVoyager, Online-Mind2Webデータでみると、Pass@4のようなtest-time scaling手法を用いると、プロプライエタリも出るを上回る。
ただ注意点としては、比較しているOpenWeightモデルが少し古いように見えるが、何か理由があるのだろうか。
Holoであれば、既にHolo3がリリースされており
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03
GLMであれば、GLM-4.6Vが存在する。
- GLM-4.6: Advanced Agentic, Reasoning and Coding Capabilies, Zhipu AI, 2025.09
(UI-TARS-2 [Paper Note] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn
Reinforcement Learning, Haoming Wang+, arXiv'25
はおそらくプロプライエタリなので対象外。あと使えるのかも不明。デモは公開されていた気がするが。)
いずれにせよHoloやUI-TARSなどはデータが公開されていなかったと思うので、全てを公開することによるcontributionは非常に大きいと思われる。
ベンチマーク関連:
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- Online-Mind2Web
- [Paper Note] An Illusion of Progress? Assessing the Current State of Web Agents, Tianci Xue+, COLM'25, 2025.04
- [Paper Note] Mind2Web: Towards a Generalist Agent for the Web, Xiang Deng+, arXiv'23, 2023.06
とは異なるため注意
- [Paper Note] DeepShop: A Benchmark for Deep Research Shopping Agents, Yougang Lyu+, arXiv'25, 2025.06
- WebTailBench
- [Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11
[Paper Note] Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation, Zhuolin Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-03-20 GPT Summary- Nemotron-Cascade 2は、30B MoEモデルで3Bの活性化パラメータを持ち、高度な推論能力とエージェント機能を提供します。小型ながら、数学およびコーディングでの推論能力は最前線モデルに匹敵。2025年の国際数学オリンピックなどで金メダル級の性能を示し、パラメータ数は20分の1でも知能密度は高い。新たにSFT後の拡張されたCascade RLで幅広い推論をカバーし、マルチドメイン蒸留を導入して性能向上を実現。モデルのチェックポイントやデータも公開予定。 Comment
元ポスト:
[Paper Note] Qianfan-OCR: A Unified End-to-End Model for Document Intelligence, Daxiang Dong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Selected Papers/Blogs #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-03-18 GPT Summary- Qianfan-OCRは、文書解析と理解を統合した40億パラメータの視覚-言語モデルで、直接画像からMarkdownへの変換を実現。多様なタスクをサポートし、明示的なレイアウト分析を行うためにLayout-as-Thoughtを導入、複雑なレイアウトの精度を向上。OmniDocBenchやOlmOCR Benchでのパフォーマンスが優れており、他の一般的なモデルを上回る結果を示した。 Comment
HF: https://huggingface.co/baidu/Qianfan-OCR
元ポスト:
VLMでOCRするタイプのモデルで様々なベンチマークでSoTA、かつ192 languageをサポートととのこと。試したい
[Paper Note] Phi-4-reasoning-vision-15B Technical Report, Jyoti Aneja+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Reasoning #SmallModel #read-later #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-03-07 GPT Summary- Phi-4-reasoning-vision-15Bを提案。コンパクトなオープンウェイトのマルチモーダル推論モデルであり、効率的な設計選択や厳格なデータキュレーションを通じて競争力のある性能を実現。系統的なフィルタリングや誤り訂正によりデータ品質が重要であることを再確認し、高解像度エンコーダが性能向上に寄与。単一モデルで簡単なタスクに迅速な回答、複雑な問題には推論を提供するハイブリッドデータ構成を実現。 Comment
元ポスト:
[Paper Note] FireRed-OCR Technical Report, Hao Wu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData #read-later #VisionLanguageModel #OCR #One-Line Notes #Pixel-based Issue Date: 2026-03-03 GPT Summary- FireRed-OCRは、一般的なビジョン-ランゲージモデルを特化した高性能OCRモデルへ変換するフレームワークです。VLMは一般的には優れた能力を示すものの、文書処理では「構造的幻視」が問題となります。FireRed-OCRでは、高品質な構造データの不足に対処するため、「Geometry + Semantics」データファクトリを構築し、幾何特徴のクラスタリングを利用して多様な文書タイプに対応したデータセットを作成します。3段階の訓練戦略を導入し、文書構造理解、形式的出力の標準化、強化学習による構文的整合性の確保を行います。OmniDocBench v1.5での評価結果から、FireRed-OCRは92.94%の性能を達成し、他のベースラインを大きく上回ることを示しました。コードとモデル重みをオープンソース化し、一般VLMから専門的な構造エキスパートへの変容を促進します。 Comment
元ポスト:
github: https://github.com/FireRedTeam/FireRed-OCR
- [Paper Note] OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, Linke Ouyang+, CVPR'25, 2024.12
においてSoTAとのこと。日本語はどのくらいいけるだろう。
[Paper Note] Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents, Haiyang Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #ComputerUse #GUI Issue Date: 2026-02-28 GPT Summary- GUI-Owl-1.5は、指示型および思考型のGUIエージェントモデルで、幅広いプラットフォームをサポート。複数のサイズで提供され、20のGUIベンチマークで最先端の成果を達成。重要な革新には、ハイブリッドデータパイプライン、推論能力の統一的強化、マルチプラットフォーム環境の新アルゴリズムMRPOが含まれる。モデルはオープンソースで、オンラインデモが提供されている。 Comment
pj page: https://github.com/X-PLUG/MobileAgent/tree/main/Mobile-Agent-v3.5
[Paper Note] Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts, Chen Yang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel Issue Date: 2026-02-21 GPT Summary- Nanbeige4.1-3Bは、3Bパラメータでエージェント的挙動、コード生成、推論を実現する初のオープンソースの小型言語モデルであり、報酬モデリングを活用して人間の価値観に整合した高品質な応答を提供します。複雑なコード生成には強化学習による報酬を設計し、最大600回のツール呼出しターンを信頼性高く実行可能です。実験結果は、同程度のモデルを超え、より大規模なモデルとも優れた性能を示しています。これにより、小型モデルが広範な能力と専門性を両立できることを実証しています。 Comment
HF: https://huggingface.co/Nanbeige/Nanbeige4.1-3B
元ポスト:
所見:
[Paper Note] Arcee Trinity Large Technical Report, Varun Singh+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #Stability #Sparse Issue Date: 2026-02-21 GPT Summary- Arcee Trinity Largeは4000億パラメータを持ち、130億のスパースMoEとして設計されている。Trinity Nano(60億パラメータ)とTrinity Mini(260億パラメータ)も報告されており、各モデルには局所的およびグローバルな注意機構、ゲート付き注意、深さスケールされた正規化、MoEのシグモイド・ルーティングが採用されている。Trinity Largeには新しいMoEロードバランシング戦略のSMEBUが導入され、Muonオプティマイザーで訓練された。すべてのモデルは損失のスパイクなしで訓練を完了し、Trinity NanoとTrinity Miniは10兆トークン、Trinity Largeは17兆トークンで事前学習された。モデルのチェックポイントはHugging Faceで利用可能。 Comment
[Paper Note] GLM-5: from Vibe Coding to Agentic Engineering, GLM-5 Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #LongContext #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #SparseAttention Issue Date: 2026-02-18 GPT Summary- 次世代モデルGLM-5は、エージェント主導のエンジニアリングへ移行し、推論コストを削減しながら長い文脈の忠実度を維持する。新しい非同期強化学習インフラを実装することで、学習効率を向上させ、非同期エージェントRLアルゴリズムにより複雑な相互作用からの学習効果を高める。これによりGLM-5は最先端の性能を達成し、実世界のコーディングタスクでの能力が従来の基準を超えたことが示された。 Comment
関連:
- GLM-5: From Vibe Coding to Agentic Engineering, Z.ai, 2026.02
- DeepSeek Sparse Attention (DSA)
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
元ポスト:
解説:
ASync RLにおける工夫:
[Paper Note] Causal-JEPA: Learning World Models through Object-Level Latent Interventions, Heejeong Nam+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #RepresentationLearning #Transformer #Self-SupervisedLearning #Encoder #WorldModels #KeyPoint Notes #LatentRepresentation Issue Date: 2026-02-16 GPT Summary- C-JEPAは、オブジェクト中心の世界モデルで、画像パッチからの埋め込み予測を通じてオブジェクトの相互作用を捉えることを目的としている。オブジェクトレベルのマスキングを導入し、潜在的介入を誘発することで反事実的推論を強化し、ショートカット解法を防ぐ。実験結果では、視覚質問応答において約20%の性能向上を示し、エージェント制御タスクでは必要な潜在入力のわずか1%で同等の結果を達成した。さらに、因果的帰納的バイアスを誘発することも示している。 Comment
元ポスト:
pj page: https://hazel-heejeong-nam.github.io/cjepa/
(JEPAは私にとってあまり馴染みがなく、以下の私の解説はどこかに誤りがある可能性が高い)
video basedなシステムを前提、すなわちimageのsequenceが与えられる前提である。このとき、各タイムステップごとに選択されたobjectの状態をマスクし、マスクされたobjectのhistoryを予測し、予測された状態から将来の状態を予測する。objectは状態だけでなく、補足的な観測可能な情報を保持することができ(たとえばアクションと感覚に関するシグナルなど)状態遷移に利用される。また、マスク対象として選択されたオブジェクトの最初のステップの状態だけは、アンカーとして保持する。マスク処理はlatent levelはでのinteiventionとして解釈でき、これにより予測のためにobject間の相互作用を捉えることが誘発され、object centricな潜在表現が学習される。マスクされたオブジェクトの状態は、予測された一つ前のステップでの状態に対してlinearで変換しpositional embeddingを足し合わせることで求められ(式3)、これらの予測されたhistoryの状態がViTの入力となり(bidirectionalなattentionを通じて)将来の状態を予測する。lossは予測されたhistoryの状態と将来の状態が与えられたときに、freezeされたobjectのエンコーダから得られる潜在表現との距離が最小化されるように学習される(エンコーダ側はstop gradientする)。
解説:
[Paper Note] DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos, Shenyuan Gao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #DiffusionModel #Robotics #WorldModels #3D (Video) #Realtime #Physics #EgocentricView #Author Thread-Post Issue Date: 2026-02-09 GPT Summary- DreamDojoは、エゴセントリックな人間のビデオから学習した世界モデルで、巧妙なロボットタスクのシミュレーションを可能にします。44,000時間のデータを使用し、多様なシナリオとオブジェクトをカバーしており、アクションラベルの不足を連続的な潜在アクションで解決。物理理解とアクション制御能力を向上させるポストトレーニング後、10.81 FPSでのリアルタイム処理を実現。これにより、生成的世界モデルを基にした新しいアプリケーションを実現し、オープンワールドでのタスクシミュレーションの可能性を示します。 Comment
pj page: https://dreamdojo-world.github.io/
元ポスト:
著者ポスト:
著者ポスト:
解説:
[Paper Note] World Action Models are Zero-shot Policies, Seonghyeon Ye+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #Zero/Few/ManyShotPrompting #TransferLearning #read-later #Selected Papers/Blogs #Generalization #Robotics #WorldModels #Backbone #3D (Video) #WorldActionModel Issue Date: 2026-02-05 GPT Summary- 最先端のVLAモデルは新環境での物理的動作の一般化に困難を抱えている。DreamZeroは、動画と行動を共同でモデル化するWorld Action Model(WAM)を導入し、物理的ダイナミクスを学習。これにより、繰り返しデモなしで多様なスキルを学び、タスクや環境への一般化を2倍以上向上。14Bの自己回帰型ビデオ拡散モデルがリアルタイム制御を実現。また、動画デモによって未見タスクの性能が42%以上改善され、少数ショットでの適応も可能に。 Comment
pj page: https://dreamzero0.github.io/
元ポスト:
[Paper Note] ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation, Junmin Gong+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Transformer #Chain-of-Thought #SpeechProcessing #DiffusionModel #Reasoning #SmallModel #PEFT(Adaptor/LoRA) #Music Issue Date: 2026-02-05 GPT Summary- ACE-Step v1.5は、高効率のオープンソース音楽基盤モデルで、商業音楽モデルを超える品質を持ちながら、非常に高速で動作します。ユーザーは少数の楽曲から個人のスタイルをトレーニング可能で、ハイブリッドアーキテクチャを用いてシンプルなクエリを包括的な楽曲に変換します。内因性強化学習により、スタイル制御と多様な編集機能を強化し、50以上の言語に対応。コンテンツクリエイターの創造的なワークフローに統合されるツールとして利用可能です。 Comment
元ポスト:
データは全て許可済みのもの、かつ合成データとポストされており商用利用も可らしいが、果たして。
[Paper Note] GLM-OCR Technical Report, Shuaiqi Duan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#ComputerVision #NLP #read-later #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- GLM-OCRは、0.9Bパラメータの多模态モデルで、実世界の文書理解に最適化されている。CogViT視覚エンコーダとGLM言語デコーダを組み合わせ、計算効率と性能のバランスを高めている。Multi-Token Prediction (MTP)メカニズムにより、OCRタスクのデコード効率が向上し、低メモリオーバーヘッドを実現。二段階パイプラインでレイアウト分析と認識を行い、公開ベンチマークで競争力のある性能を達成。リソース制約のある環境でも適用可能な設計。 Comment
元ポスト:
GLMのOCRがリリース。DeepSeekもOCRをリリースしているが、tokenを圧縮する目的や、モデルの学習データを担保する目的などで最終目的としては自分たちのモデルの強化に必要であり、その道中での副産物としてリリースしているのだろうか。それとも、OCRタスクの需要がシンプルに高いからリリースしているのだろうか。
公式ポスト:
関連:
- [Paper Note] LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR, Said Taghadouini+, arXiv'26, 2026.01
- olmOCR 2: Unit test rewards for document OCR, Ai2, 2025.10
- DeepSeek-OCR: Contexts Optical Compression, DeepSeek, 2025.10
- DeepSeek-OCR-2, DeepSeek-AI, 2026.01
[Paper Note] Advancing Open-source World Models, Robbyant Team+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #DiffusionModel #WorldModels #interactive Issue Date: 2026-01-30 GPT Summary- LingBot-Worldは、リアルで多様な環境を持つオープンソースの世界シミュレーターで、高忠実度と堅牢なダイナミクスを提供。文脈の一貫性を保つ「長期記憶」機能や、1秒未満のレイテンシーでのリアルタイム生成を実現。オープンソースの技術提供により、コンテンツ制作やゲーム、ロボット学習に貢献することを目指す。 Comment
pj page: https://technology.robbyant.com/lingbot-world
元ポスト:
[Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Blog #mid-training #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #Initial Impression Notes #ContextFolding Issue Date: 2026-01-27 GPT Summary- Kimi K2.5は、テキストとビジョンの共同最適化を重視するオープンソースのマルチモーダルエージェンティックモデルです。共同プリアトレーニングや強化学習を用いて、エージェントが複雑なタスクをサブ問題に分解し同時に実行するAgent Swarmを導入。評価結果では、コーディングや推論タスクで最先端の成果を達成し、最大4.5倍のレイテンシ低減を実証しました。Kimi K2.5モデルのチェックポイントは、今後の研究や応用に活用可能です。 Comment
HF: https://huggingface.co/moonshotai/Kimi-K2.5
元ポスト:
テクニカルレポートを受けての所見:
Agenticなタスク(HLE, BrowsingによるQA, DeepSearch)に関するベンチでGPT-5.2(xhigh)などを超えてSoTAを達成。他のタスクではcodingではClaude-4.5-Opusの方が上、image関連のタスクではGemini 3 Proに軍配が上がっている。VideoではGeminiとcomparableという感じだろうか(GeminiはLong Contextに非常に強い印象があるがLongVideoBenchて上回っている)。この辺は各タスクごとに強いモデルの棲み分けが進んできた。
また、Kimi K2.5非常に美麗でinteractiveなフロントエンドのデモが掲載されている。
Agent Swarmは、タスクをサブタスクに分解して、複数のエージェントに並列に投げて実行(最大100 sub agent)できるような枠組みであり、それらが高性能かつ低latencyとなるように訓練れている模様。これにより性能を向上させつつlatencyを80%削減しているとのこと。
この話はContext Foldingに近い話と推察される:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
によると、AgentSwarmはサブタスクを実施するエージェントのパラメータはfreezeし、サブエージェントを作成し、その結果を集約する処理をOrchestratorと呼ばれるlearnableなモジュールが担っており、サブエージェントからの結果はある種環境からの観測結果として扱われ、タスクの成否はOrchestratorのみに委ねられているようである。
Context Foldingは、Context Managerとポリシーが同時にFoldGRPOを通じて学習されており、エージェントそのものがサブタスク実行、結果を受け取り圧縮、メインブランチに加えるという能力をContext Managerと協調しながら実施することを学習している点が異なるように感じる。
また、並列実行したCritical Stepと呼ばれる、各サブエージェントの最大ステップ数に関する指標が導入され、これらCritical Stepをすべてのステップで集約し、特定のサブエージェントにworkloadが集中しないようにOrchestratorが調整されるとのこと。
公式ポスト:
OpenWeightモデルの中でソフトウェアエンジニアリングスキルでSoTA:
日本語でのポスト:
ポイント解説:
- How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
[Paper Note] EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience, Taofeng Xue+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #SelfImprovement #ComputerUse #PostTraining #read-later #VisionLanguageModel #Scalability #Initial Impression Notes Issue Date: 2026-01-23 GPT Summary- EvoCUAは、ネイティブコンピュータ使用エージェントの新モデルで、静的模倣に頼らずデータ生成とポリシー最適化を統合。自律的にタスクを生成し、検証可能な合成エンジンでデータ不足を解消。スケーラブルなインフラにより多様な経験を収集し、反復進化学習でポリシーを動的に調整。OSWorldベンチマークで56.7%の成功率を達成し、従来のモデルを大幅に超えた。このアプローチは、さまざまな基盤モデルでの性能向上を実証し、ネイティブエージェントの機能強化に寄与することを示唆している。 Comment
HF: https://huggingface.co/meituan/EvoCUA-32B-20260105
元ポスト:
合成データ生成(タスク合成からVerifierの定義まで?)と学習のループを回すことでデータのスケーラビリティを向上し性能向上(これまでは事前に静的に合成されたtrajectoryでの学習が主流)。Rejection Samplingをして成功したtrajectoryでSFTしつつ、工夫されたDPOが用いられている模様。あとで読みたい。
[Paper Note] Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization, Hao Luo+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Reasoning #CrossDomain #Robotics #VisionLanguageActionModel #UMM #Physics Issue Date: 2026-01-22 GPT Summary- Being-H0.5は、クロスエンボディメント一般化のために設計されたVLAモデルであり、人間の相互作用を「母国語」として扱う学習パラダイムを提案。35,000時間以上のマルチモーダルデータを含むUniHand-2.0を用いて、多様なロボット制御を統一的なアクション空間にマッピングし、リソースの少ないロボットが他のプラットフォームからスキルを習得できるようにする。Being-H0.5はMixture-of-Transformersを採用し、現実世界での安定性のために多様体保存ゲーティングとユニバーサル非同期チャンクイングを導入。シミュレーションベンチマークで最先端の結果を達成し、5つのロボットプラットフォームで強力な能力を示す。 Comment
pj page:
https://research.beingbeyond.com/being-h05
HF:
https://huggingface.co/collections/BeingBeyond/being-h05
元ポスト:
[Paper Note] STEP3-VL-10B Technical Report, Ailin Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #NLP #read-later #Selected Papers/Blogs #VisionLanguageModel #UMM #Initial Impression Notes Issue Date: 2026-01-19 GPT Summary- STEP3-VL-10Bは、効率と最先端のマルチモーダル知能のトレードオフを再定義する軽量なオープンソース基盤モデル。言語に整合した知覚エンコーダとQwen3-8Bデコーダを統合し、1k回以上の強化学習を含むスケーラブルな後処理パイプラインを導入。並列協調推論を実装し、視覚推論の探索と統合を最適化。コンパクトながら、他の大規模モデルに匹敵する性能を発揮し、MMBenchで92.2%、AIME2025で94.43%などの成果を記録。再現可能な基準として全モデルスイートをコミュニティに提供。 Comment
元ポスト:
HF: https://huggingface.co/stepfun-ai/Step3-VL-10B
たったの10Bモデルにもかかわらず、100B, 200B級のベンチマーク性能を達成しており、unifiedなアーキテクチャで事前学習中に全てのパラメータをunfrozenな上で1.2Tマルチモーダルトークンで学習し、PaCoReと呼ばれるRLで学習されたtest time scaling手法や、GRPO系ではなくPPOをRLで採用するなど、ユニークな工夫が満載に見え、重要研究に見える。
[Paper Note] HeartMuLa: A Family of Open Sourced Music Foundation Models, Dongchao Yang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #MultiModal #FoundationModel #SpeechProcessing #AudioLanguageModel #Music Issue Date: 2026-01-17 GPT Summary- オープンソースの音楽基盤モデルファミリーを提案し、音楽理解と生成を促進する。主要な4つのコンポーネントは、音声・テキストアラインメント、堅牢な歌詞認識、高忠実度音楽コーデック、ユーザー制御可能な条件での歌生成を含む。特化モードでは、音楽属性の制御と短い魅力的な生成が可能。これにより、商業グレードのシステムを再現し、多モーダルコンテンツ制作を促進する基盤を構築。 Comment
pj page:
https://heartmula.github.io/
HF:
https://huggingface.co/HeartMuLa/HeartMuLa-oss-3B
元ポスト:
[Paper Note] TranslateGemma Technical Report, Mara Finkelstein+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#MachineTranslation #NLP #LanguageModel #SmallModel #MultiLingual #Selected Papers/Blogs #One-Line Notes #Initial Impression Notes Issue Date: 2026-01-16 GPT Summary- TranslateGemmaは、Gemma 3モデルに基づく機械翻訳のオープンモデルセットで、二段階のファインチューニングプロセスを採用。初めに高品質な並行データで監視付きファインチューニングを行い、その後報酬モデルによる強化学習で翻訳品質を最適化。WMT25テストセットでの人間評価とWMT24++ベンチマークでの自動評価を通じて有効性を示し、自動指標では大幅な性能向上が確認される。特に小型モデルは大型モデルに匹敵する性能を持ちつつ効率が向上。さらに、マルチモーダル能力も保持し、画像翻訳ベンチマークでの性能向上が報告されている。TranslateGemmaの公開は、研究コミュニティに強力で適応可能な翻訳ツールを提供することを目指している。 Comment
元ポスト:
10個の翻訳元言語→翻訳先言語対で評価されている。Japanese→Englishでも評価されているが、他の言語と比べて最も性能が悪いので、日本語では苦戦していそうに見える。English→Italianは(評価した言語ペアの中では)最も性能が良い。
ポイント解説:
関連:
- PLaMo Translate: 翻訳特化大規模言語モデルの開発,今城+, Jxiv'25, 2025.08
- [Paper Note] Hunyuan-MT Technical Report, Mao Zheng+, arXiv'25, 2025.09
続報:
ブラウザ上で100%ローカルでの翻訳が可能になったらしい。WebGPUってなんだろう、、、
https://huggingface.co/spaces/webml-community/TranslateGemma-WebGPU
[Paper Note] VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control, Sixiao Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #Controllable #WorldModels #3D (Video) #Geometric Issue Date: 2026-01-14 GPT Summary- VerseCrafterは、カメラとオブジェクトの動きを一貫して制御する4Dビデオワールドモデルを提案。静的な背景と3Dガウス軌跡を使用して、オブジェクトの確率的な3D占有を表現し、高忠実度なビデオ生成を可能にする。自動データエンジンにより、大規模な4Dアノテーションデータセットを野生のビデオから抽出し、モデルのトレーニングを支援。 Comment
pj page: https://sixiaozheng.github.io/VerseCrafter_page/
元ポスト:
[Paper Note] UniVideo: Unified Understanding, Generation, and Editing for Videos, Cong Wei+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #Transformer #MultiModal #DiffusionModel #VariationalAutoEncoder #ICLR #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #Editing Issue Date: 2026-01-09 GPT Summary- UniVideoは、動画ドメインにおけるマルチモーダルコンテンツの生成と編集を目的とした統一モデルで、MLLMとMMDiTを組み合わせたデュアルストリーム設計を採用。これにより、複雑な指示の解釈と視覚的一貫性を維持しつつ、動画生成や編集タスクを統一的に訓練。実験結果では、テキスト/画像から動画への生成や文脈内編集において最先端の性能を示し、編集とスタイル転送の統合や未見の指示への対応も可能。視覚プロンプトに基づく生成もサポートし、モデルとコードは公開されている。 Comment
pj page: https://congwei1230.github.io/UniVideo/
元ポスト:
[Paper Note] DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research, Rulin Shao+, ICML'26, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #OpenSource #ICML #PostTraining #read-later #Selected Papers/Blogs #DeepResearch #Reference Collection #Rubric-based #Author Thread-Post Issue Date: 2025-11-19 GPT Summary- 長文で出典付きの回答を生成する深層研究モデルの訓練には、強化学習(RLVR)を活用した進化するルーブリック(RLER)を用いることで、モデルが新たな情報を取り込み、オンポリシーなフィードバックを提供できるようにする。本研究では、RLERを活用して初のオープンモデルDeep Research Tulu (DR Tulu-8B)を開発し、科学、医療、一般領域のベンチマークで従来モデルを大幅に上回った。データ、モデル、コードは公開され、新しいエージェント基盤も提供されている。 Comment
元ポスト:
著者ポスト:
著者ポスト2:
著者ポスト3:
demoをほぼ無料で実施できるとのこと:
takeaway:
デモが公開:
解説:
ICML'26 Spotlight:
[Paper Note] Phi-Ground Tech Report: Advancing Perception in GUI Grounding, Miaosen Zhang+, arXiv'25, 2025.07
Paper/Blog Link My Issue
#ComputerVision #MultiModal #SmallModel #ComputerUse #VisionLanguageModel #Grounding #GUI Issue Date: 2026-05-12 GPT Summary- マルチモーダル推論モデルの進化により、CUAsが現実化している。GUI groundingは、この実装において重要で、ユーザーの動作やパラメータを決定する。現行のエンドツーエンドのモデルは依然として低い精度に留まっている。本研究では、データ収集からモデル訓練に至るまで検討し、Phi-Groundモデルを開発。これにより、エージェント設定で全てのベンチマークで最先端性能を達成し、特にScreenSpot-proで43.2、UI-Visionで27.2の結果を達成した。成果と過程はgroundingモデルの理解を深め、他の知覚タスクにも貢献することが期待される。 Comment
元ポスト:
[Paper Note] LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness, Chenming Zhu+, ICCV'25, 2024.09
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #InstructionTuning #MultiModal #Reasoning #PositionalEncoding #OpenSource #PostTraining #Selected Papers/Blogs #ICCV #VisionLanguageModel #3D (Scene) #SpatialUnderstanding #KeyPoint Notes #Grounding Issue Date: 2026-02-28 GPT Summary- LLaVA-3Dは、3Dシーン理解に対応する新たなフレームワークで、2D視覚理解の知識を活用しつつ、3D位置埋め込みを統合。2D CLIPパッチを3D空間情報で強化し、2Dと3Dの共同チューニングを行うことで、迅速かつ正確な3D認識を実現。実験では、既存の3Dモデルよりも3.5倍速く収束し、3Dタスクでの最先端性能を達成しながら、2D機能も保持している。 Comment
github:
https://github.com/ZCMax/LLaVA-3D
pj page:
https://zcmax.github.io/projects/LLaVA-3D/
3Dに関するspatial understandingの能力を持つVLMで、テキストの出力だけでなく、3Dのbounding boxを出力する専用のデコーダを持つ。
2DのCLIPベースのimage encoderによる情報を活用しつつ、2D patchに対して3Dに関する位置情報(depth)を3D positional encodingを通じて加えることで3D patchを作成し入力として活用。3Dのgrounding taskを扱うgrounding decoderを導入することで3D理解に関する能力を醸成する。学習は2stageで、最初のstageでは、2D, 3D双方の能力を同時に学習するために2D, 3Dのデータ両方を用いてモデルをSFTする。その後grounding decoderは前段のSFTでさ学習しきれないため、grounding decoder以外のモジュールはfreezeして、3D groundingタスクでdecoderとlocation tokenを学習するらしい。これにより、2D, 3Dシーンの理解力を損なわず、groundingに関する性能を高める。
[Paper Note] Epona: Autoregressive Diffusion World Model for Autonomous Driving, Kaiwen Zhang+, ICCV'25, 2025.06
Paper/Blog Link My Issue
#ComputerVision #NLP #Transformer #DiffusionModel #LongContext #ICCV #WorldModels #3D (Video) #AutonomousDriving Issue Date: 2026-02-08 GPT Summary- Eponaという自回帰型拡散世界モデルを提案し、長期予測と軌道計画の統合を実現。デカップル型因子分解により局所的な時空間分布をモデリングし、エンドツーエンドで動作計画と視覚モデリングを統合。実験により7.4%のFVD改善を達成し、数分間の長期予測が可能。学習したモデルはリアルタイム動作プランナーとしても優れた性能を示す。 Comment
元ポスト:
[Paper Note] Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models, Yonggan Fu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Transformer #SmallModel #Architecture #read-later #Selected Papers/Blogs #EvolutionaryAlgorithm #Latency #Operator Issue Date: 2026-01-23 GPT Summary- SLMの効率的な展開はレイテンシ制約のあるアプリで重要。本研究は、SLMのレイテンシ決定要因を特定し、深さと幅の比率、オペレータ選択が鍵であることを示す。深く細いモデルが精度向上につながるが、トレードオフフロンティアからは外れることがある。新しい効率的アテンションの代替手段を評価し、最適なオペレータを用いた進化的検索フレームワークを開発。さらに重み正規化技術を用い、SLMの性能を向上。新ハイブリッドSLM「Nemotron-Flash」は、精度を平均+5.5%向上させ、レイテンシを大幅に低下、スループットを著しく改善。 Comment
解説:
[Paper Note] LightAgent: Mobile Agentic Foundation Models, Yangqin Jiang+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #SyntheticData #MultiModal #Reasoning #SmallModel #ComputerUse #PostTraining #VisionLanguageModel #One-Line Notes #GUI #EdgeDevices Issue Date: 2026-01-19 GPT Summary- LightAgentは、モバイルプラットフォーム向けにデバイスとクラウドの協力を活用したGUIエージェントシステムを提案。これにより、オフライン性能とコスト効率を両立し、強化された二段階トレーニングを通じて高い意思決定能力を実現。実験を通じて大規模モデルに匹敵する性能を示し、クラウドコストを大幅に削減。 Comment
pj page: https://github.com/HKUDS/OpenPhone
3Bで10B級の性能を誇る低latencyのedge device向けSVLM
元ポスト:
[Paper Note] Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, NVIDIA+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Transformer #Supervised-FineTuning (SFT) #ReinforcementLearning #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #PostTraining #Hybrid Issue Date: 2025-12-28 GPT Summary- Nemotron 3 Nano 30B-A3Bは、Mixture-of-ExpertsハイブリッドMamba-Transformer言語モデルであり、25兆のテキストトークンで事前学習され、監視付きファインチューニングと強化学習を経て精度を向上。前世代のNemotron 2 Nanoよりも高精度で、フォワードパスごとに半分未満のパラメータを活性化し、同サイズのオープンモデルと比較して最大3.3倍の推論スループットを達成。エージェント的、推論、チャット能力が向上し、最大1Mトークンのコンテキスト長をサポート。事前学習済みモデルはHugging Faceで公開。 Comment
元ポスト:
[Paper Note] Xiaomi MiMo-VL-Miloco Technical Report, Jiaze Li+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #Reasoning #VideoGeneration/Understandings #VisionLanguageModel #KeyPoint Notes Issue Date: 2025-12-23 GPT Summary- MiMo-VL-Miloco-7Bとその量子化バリアントをオープンソース化し、家庭中心の視覚と言語モデルとして優れた性能を発揮。特にスマートホーム環境に特化し、ジェスチャー認識やマルチモーダル推論で高いF1スコアを達成。二段階のトレーニングパイプラインを設計し、効率的な推論を実現。家庭シナリオのトレーニングが活動理解を向上させ、テキスト推論にも効果を示す。モデルとツールキットは公開され、スマートホームアプリケーションの研究に貢献。 Comment
元ポスト:
HF:
https://huggingface.co/collections/xiaomi-open-source/xiaomi-mimo-vl-miloco
モデル自体は11月から公開されている
home-scenario gesture recognitionとdaily activity recognitionでGemini-2.5-Proを上回る性能を達成している。特定のユースケースに特化しつつ、genericなユースケースの性能を損なわないようなモデルを学習したい場合は参考になるかもしれない。
まずSFTでhome-scenarioデータ[^1] + GeneralデータのDataMixでreasoning patternを学習させ、tokenのefficiencyを高めるためにCoTパターンを排除しdirect answerをするようなデータ(およびprompting)でも学習させる。これによりhome-scenarioでの推論能力が強化される。SFTはfull parameter tuningで実施され、optimizerはAdamW。バッチサイズ128, warmup ratio 0.03, learning rate 1 * 10^-5。スケジューラについては記述がないように見える。
その後、一般的なユースケース(Video Understanding (temporal groundingにフォーカス), GUI Grounding, Multimodal Reasoning (特にSTEMデータ))データを用いてGRPOでRLをする。明らかに簡単・難しすぎるデータは除外。RLのrewardは `r_acc + r_format`の線形補完(係数はaccL: 0.9, format: 0.1)で定義される。r_accはデータごとに異なっている。Video Understandingでは予測したqueryに対してモデルが予測したtimespanとgoldのtimespanのoverlapがどの程度あるかをaccとし、GUI Groundingではbounding boxを予測しpred/goldのoverlapをaccとする。Multimodal ReasoninghはSTEMデータなので回答が一致するかをbinaryのaccとして与えている。
モデルのアーキテクチャは、アダプターでLLMと接続するタイプのもので、動画/画像のBackboneにはViTを用いて、MLPのアダプターを持ちいてLLMの入力としている。
[^1]: volunteerによるhome-scenarioでのデータ作成; ruleを規定しvolunteerに理解してもらいデータ収集。その後研究者が低品質なものを除外
[Paper Note] T5Gemma 2: Seeing, Reading, and Understanding Longer, Biao Zhang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #MultiModal #SmallModel #MultiLingual #Encoder-Decoder #KeyPoint Notes Issue Date: 2025-12-19 GPT Summary- T5Gemma 2は、軽量なオープンエンコーダーデコーダーモデルで、多言語・多モーダル・長文コンテキスト能力を備えています。T5Gemmaの適応レシピに基づき、デコーダー専用モデルをエンコーダーデコーダーモデルに拡張し、効率向上のために埋め込みの共有とマージドアテンションを導入しました。実験により、長文コンテキストモデリングにおける強みが確認され、事前学習性能はGemma 3と同等以上、事後学習性能は大幅に向上しました。今後、事前学習済みモデルをコミュニティに公開予定です。 Comment
初めてのマルチモーダル、long-context、かつ140言語に対応したencoder-decoderモデルとのこと。
事前学習済みのdecoder-only model (今回はGemma2)によってencoder/decoderをそれぞれ初期化し、UL2 (UL2: Unifying Language Learning Paradigms, Yi Tay+, N/A, ICLR'23
) によって事前学習する。encoder / decoder側双方のword embeddingは共有し、encoder側のattentionはcausal attentionからbidirectional attentionに変更する。また、decoder側はself-attention/cross-attentionをマージする。
- UL2: Unifying Language Learning Paradigms, Yi Tay+, N/A, ICLR'23
merged attentionとは、式(1) -- (5)で表されるものであり、Qはdecoderのinput X を用いて、KVの計算する際には、単にdecoder側のinput X とencoder側の隠れ状態 H をconcatしてから、KVを算出する(K, Vのmatrixの次元がHの分大きくなる)というものである。また、マスクトークンの正方行列ではなくなりencoder次元分大きくなり、decoder/encoder部分の両方のvisibilityを制御する。(論文中の当該部分に明記されていないが、普通に考えると)encoder部分は常にvisibleな状態となる。self-/cross attentionは似たような機能を有する(=過去の情報から関連する情報を収集する)ことが先行研究で知られており、単一のモジュールで処理できるという気持ちのようである。H, Xがそれぞれconcatされるので、encoder側の情報とdecoderのこれまでのoutput tokenの情報の両方を同時に考慮することができる。
元ポスト:
HF: https://huggingface.co/collections/google/t5gemma-2
ポイント解説:
[Paper Note] Bolmo: Byteifying the Next Generation of Language Models, Benjamin Minixhofer+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenSource #Selected Papers/Blogs #KeyPoint Notes #Byte-level Issue Date: 2025-12-17 GPT Summary- Bolmoは、1Bおよび7Bパラメータのバイトレベル言語モデルで、既存のサブワードレベルLMをバイト化することでトレーニングされ、サブワードトークン化の限界を克服しつつ同等のパフォーマンスを発揮します。特別に設計されたBolmoは、サブワードモデルとの間で効果的な蒸留を行い、低コストでバイトレベルLMに変換可能です。Bolmoは従来のバイトレベルLMを上回り、文字理解やコーディングタスクで優れた性能を示し、推論速度も競争力があります。結果として、バイトレベルLMはサブワードレベルLMに対する実用的な選択肢となることが示されました。 Comment
blog:
https://allenai.org/blog/bolmo
HF:
https://huggingface.co/allenai/Bolmo-7B
元ポスト:
テキストをbyte列の系列として解釈し入出力を行う言語モデル。アーキテクチャとしては、byte列をtoken化しbyte列単位でembedding化→mLSTMによってそれらがcontextに関する情報を持った状態でエンコードされ→1バイト先のcontextを用いて単語の境界を予測するモデル(この部分はcausalではなくbi-directional)によって境界を認識し、境界まで可変長でembeddingをpoolingしパッチを形成し、Olmo3の入力とする(デコーディングはその逆の操作をして最終的に言語モデルのheadを用いる)。
スクラッチからByte Latent Transformerのようなモデルを学習するのではなく、2-stageで学習される。まずOlmo3をfreezeし、他の local encoder, local decoder, boundary predictor, and language modeling headのみを学習する。これによりsubwordモデルと同様の挙動を学習できる。そのうえで、Olmo3のfreezeを解除し全体を学習する。これにより、Olmo3に事前学習された知識や挙動を最大限に活用する(=もともとsubwordで動作していたモデルをbyteレベルで動作するように継続学習する)。
>The Bolmo architecture. Tokenization & Embedding T transforms the input text into one representation per byte. The representations are contextualized with the local encoder E consisting of mLSTM blocks. The boundary predictor B decides where to place patch boundaries using one byte of future context. The representations are then Pooled,
[Paper Note] Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models, Boxin Wang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#General #NLP #LanguageModel #Alignment #ReinforcementLearning #Reasoning #OpenSource #read-later #RLVR #Selected Papers/Blogs #CrossDomain #KeyPoint Notes #Author Thread-Post Issue Date: 2025-12-17 GPT Summary- 一般目的の推論モデルを強化学習(RL)で構築する際の課題に対処するため、カスケードドメイン別強化学習(Cascade RL)を提案。Nemotron-Cascadeは、指示モードと深い思考モードで動作し、異なるドメインのプロンプトを順次調整することで、エンジニアリングの複雑さを軽減し、最先端のパフォーマンスを実現。RLHFを前段階として使用することで推論能力が向上し、ドメイン別RL段階でもパフォーマンスが改善される。14Bモデルは、LiveCodeBenchで優れた結果を示し、2025年国際情報オリンピックで銀メダルを獲得。トレーニングとデータのレシピも共有。 Comment
元ポスト:
従来のRLはすべてのドメインのデータをmixすることでおこなれてきたが、個々のドメインのデータを個別にRLし、cascading方式で適用 (Cascade RL) することを提案している(実際は著者らの先行研究でmath->codingのcascadingは実施されていたが、それをより広範なドメイン(RLHF -> instruction following -> math -> coding -> software engineering)に適用した、という研究)。
cascadingにはいくつかのメリットがありRLの学習速度を改善できる(あるいはRLのインフラの複雑性を緩和できる)
- ドメインごとのverificationの速度の違いによって学習速度を損なうことがない(e.g. 数学のrule-basedなverificationは早いがcodingは遅い)
- ドメインごとに出力長は異なるためオンポリシーRLを適用すると効率が落ちる(長いレスポンスの生成を待たなければらないため)
本研究で得られた利点としてはFigure 1を参考に言及されているが
- RLHF, instruction followingを事前に適用することによって、後段のreasoningの性能も向上する(reasoningのwarmupになる)
- 加えて応答の長さの削減につながる
- RLはcatastrophic forgettingに強く、前段で実施したドメインの性能が後段のドメインのRLによって性能が劣化しない
- といってもFigure 2を見ると、codingとsoftware engineeringは結構ドメイン近いのでは・・・?という気はするが・・・。
- RLにおけるカリキュラム学習やハイパーパラメータをドメインごとに最適なものを適用できる
他にもthinking/non-thinking に関することが言及されているが読めていない。
[Paper Note] NVIDIA Nemotron 3: Efficient and Open Intelligence, NVIDIA+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #SSM (StateSpaceModel) #OpenSource #MoE(Mixture-of-Experts) Issue Date: 2025-12-17 GPT Summary- Nemotron 3ファミリーのモデル(Nano、Super、Ultra)は、強力なエージェント機能と推論能力を提供し、Mixture-of-ExpertsハイブリッドMamba-Transformerアーキテクチャを採用。SuperとUltraはLatentMoEを組み込み、MTPレイヤーでテキスト生成を高速化。全モデルはマルチ環境強化学習でポストトレーニングされ、Nanoはコスト効率が高く、Superは高ボリュームワークロードに最適化、Ultraは最先端の精度を提供。モデルの重みやデータはオープンにリリース予定。 Comment
元ポスト:
解説:
Artificial Intelligenceによるポイント解説&ベンチマーキング:
所見:
training data, RL environment, training codeも含めて公開されているとのこと。
ポイント解説:
所見:
[Paper Note] Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models, Chen Yang+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #Distillation #mid-training #PostTraining #read-later #Selected Papers/Blogs Issue Date: 2025-12-13 GPT Summary- Nanbeige4-3Bは、23兆の高品質トークンで事前学習し、3000万以上の指示でファインチューニングされた高性能な小規模言語モデルです。FG-WSDトレーニングスケジューラを用いて段階的にデータを洗練し、SFTデータの質向上のために共同メカニズムを設計しました。さらに、DPDメソッドを通じてモデルを蒸留し、強化学習フェーズで推論能力を強化しました。評価結果は、同等のパラメータスケールのモデルを大幅に上回り、より大きなモデルにも匹敵することを示しています。モデルのチェックポイントは、https://huggingface.co/Nanbeige で入手可能です。 Comment
元ポスト:
3Bモデルにも関わらず10倍以上大きいモデルと同等以上の性能を発揮し、trainingのstrategyが非常に重要ということが伺える。元ポストにも各学習方法の概要が記載されているが、読みたい。
[Paper Note] VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning, Yixuan Zhou+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#SpeechProcessing #SmallModel #TTS Issue Date: 2025-12-10 GPT Summary- 音声合成の生成モデルは、安定性と表現力のトレードオフに直面している。これを解決するために、半離散残差表現を用いた新しいトークナイザー不要のTTSモデルVoxCPMを提案。テキスト-セマンティック言語モデル(TSLM)が意味的計画を生成し、残差音響モデル(RALM)が音響の詳細を復元。180万時間のデータで訓練されたVoxCPM-0.5Bモデルは、最先端のゼロショットTTSパフォーマンスを達成し、文脈に応じた自然な音声を生成する能力を示す。VoxCPMはApache 2.0の下で公開され、コミュニティの研究開発を促進する。 Comment
HF: https://huggingface.co/openbmb/VoxCPM1.5
元ポスト:
[Paper Note] OneThinker: All-in-one Reasoning Model for Image and Video, Kaituo Feng+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #Dataset #ReinforcementLearning #MultiModal #Reasoning #VisionLanguageModel #2D (Image) #UMM #3D (Video) #One-Line Notes #text Issue Date: 2025-12-06 GPT Summary- OneThinkerは、視覚的推論を統一するオールインワンの強化学習モデルであり、質問応答やキャプショニングなどの多様なタスクに対応。OneThinker-600kトレーニングコーパスを用いて訓練され、報酬の異質性に対処するEMA-GRPOを提案。広範な実験により、10の視覚理解タスクで強力なパフォーマンスを示し、タスク間の知識移転とゼロショット一般化能力を実証。全てのコード、モデル、データは公開。 Comment
pj page:
https://github.com/tulerfeng/OneThinker
HF:
https://huggingface.co/OneThink
元ポスト:
image/videoに関するreasoningタスクをunifiedなアーキテクチャで実施するVLM
Qwen3-VL-Instruct-8Bに対するgain。様々なタスクで大幅なgainを得ている。特にTracking, segmentation, groundingのgainが大きいように見える。
[Paper Note] AutoNeural: Co-Designing Vision-Language Models for NPU Inference, Wei Chen+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#ComputerVision #NLP #SmallModel #Selected Papers/Blogs #3D Reconstruction #VisionLanguageModel #Realtime Issue Date: 2025-12-04 GPT Summary- AutoNeuralは、NPU向けに最適化されたVLMアーキテクチャで、量子化の脆弱性とI/Oバウンドな注意メカニズムの問題を解決。MobileNetV5スタイルのバックボーンを採用し、量子化誤差を最大7倍削減、エンドツーエンドのレイテンシを14倍短縮。実世界の自動車ケーススタディでリアルタイム性能を実証し、NPU制約に特化したモデル設計の重要性を示した。 Comment
pj page: https://nexa.ai/solution/intelligent-cockpit
HF: https://huggingface.co/NexaAI/AutoNeural
元ポスト:
[Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #AIAgents #SyntheticData #MoE(Mixture-of-Experts) #Selected Papers/Blogs #reading #KeyPoint Notes #Reference Collection #SparseAttention Issue Date: 2025-12-01 GPT Summary- DeepSeek-V3.2を紹介。主な技術革新は、(1) 効率的なアテンション機構DSAにより長い文脈での性能を維持しつつ計算複雑性を削減、(2) スケーラブルな強化学習によりGPT-5に匹敵する性能を達成、特にDeepSeek-V3.2-SpecialeはGPT-5を上回り、International Mathematics OlympiadおよびInternational Olympiad in Informaticsで金メダル級の性能を示す。(3) 新規合成パイプラインにより大規模な訓練データ生成を実現し、複雑な環境での一般化と指示遵守の向上を図る。 Comment
HF: https://huggingface.co/deepseek-ai/DeepSeek-V3.2
GPT-5級のスコアを獲得している。なんということだ。
公式ポスト:
vLLM recipe:
https://docs.vllm.ai/projects/recipes/en/latest/DeepSeek/DeepSeek-V3_2-Exp.html
関連:
- Expert Parallel Deployment, vLLM, 2025.10
元ポスト:
所見:
事前学習にさらに計算機リソースを投下する見込みとのこと:
解説:
解説:
所見:
artificial analysisによる評価ではOpen Weightモデルの中ではKimi K2 Thinkingに次いで2番目の性能:
- Introducing Kimi K2 Thinking, MoonshotAI, 2025.11
所見:
関連:
- [Paper Note] DeepSeek-Math-V2, DeepSeekAI, 2025.11
DeepSeek Sparse Attention (DSA)
DSAの図解:
MLAはこちら:
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
テクニカルペーパーのDSAに該当する箇所を読んだが、数式が省略されていたり、図解の中の添え字の説明などもすべてはされていないため、概要しかわからなかった (おそらく [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
を読まなければならない)。が、要点としては以下だと思われる:
- Lightning Indexerによって、高速に現在のhidden_state h_t と関連が深い過去のトークン h_s を同定し top-k を選択
- 選択した top-k のKVを用いて、Multi Query Attention を実行するSparse Attention
- DSAとMLA、さらにはMQAは全て組み合わせることとができる。すなわち、
- MLAによって、すべてのKV Cacheをそのまま保持する必要がなく、個々のKV Cacheを圧縮した小さなtiny latent vectorを保持し、それを復元する重み行列を保持
- さらにKV Cacheを全てのheadに対して共有することで、MQAとも併用ができる。
DSAでは、Top-kのtokenに対してのみAttentionの計算が走るので、計算量のオーダーが系列長をNとするとO(N^2)からO(Nk)となり、線形のオーダーとなり計算量が削減される。
また、MLAによって、ので、メモリも効率化される。
DSAは計算量を削減し、MLAはメモリを削減する。
[Paper Note] Qwen3-VL Technical Report, Shuai Bai+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #MoE(Mixture-of-Experts) #VisionLanguageModel Issue Date: 2025-11-27 GPT Summary- Qwen3-VLは、テキスト、画像、動画を統合した最先端のビジョン・ランゲージモデルで、256Kトークンの長文コンテキスト理解を実現。強化されたテキスト理解、堅牢なマルチモーダル推論、空間・時間モデリングのアップグレードを特徴とし、様々なベンチマークで優れたパフォーマンスを示す。密なアーキテクチャとエキスパート混合アーキテクチャの両方で高い性能を発揮し、実世界のマルチモーダルコードインテリジェンスの基盤エンジンとしての役割が期待される。 Comment
元ポスト:
[Paper Note] INTELLECT-3: Technical Report, Prime Intellect Team+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #OpenSource #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Initial Impression Notes #Asynchronous #Author Thread-Post Issue Date: 2025-11-27 GPT Summary- INTELLECT-3は、1060億パラメータのMixture-of-Expertsモデルであり、強化学習を用いて高性能を達成。数学・コード・科学・推論のベンチマークで最先端の結果を示し、全インフラストラクチャがオープンソースとして公開される。prime-rlを利用した大規模RL環境は、多様なGPUに対応し、高効率な訓練を実現。 Comment
HF: https://huggingface.co/PrimeIntellect/INTELLECT-3
元ポスト:
著者ポスト:
完全にオープンソースでデータやフレームワーク、評価も含め公開されているとのこと。素晴らしい
in-flight weight updates が利用されている
- PipelineRL, Piche+, ServiceNow, 2025.04
[Paper Note] HunyuanOCR Technical Report, Hunyuan Vision Team+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#ComputerVision #NLP #VisionLanguageModel #OCR Issue Date: 2025-11-26 GPT Summary- HunyuanOCRは、OCRタスクに特化した軽量な商業グレードのオープンソースVision-Language Model(VLM)であり、優れた性能を示し、従来のソリューションを上回っています。主な特徴は、スポッティング、パース、情報抽出、翻訳などの機能を統一した軽量フレームワーク、エンドツーエンドのアーキテクチャによるエラー伝播の解消、強化学習戦略による性能向上です。HunyuanOCRはHuggingFaceでオープンソース化され、産業応用の基盤を提供することが期待されています。 Comment
元ポスト:
公式ポスト:
pj page: https://github.com/Tencent-Hunyuan/HunyuanOCR
HF: https://huggingface.co/tencent/HunyuanOCR
OmniDocBenchでSoTA
- [Paper Note] OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, Linke Ouyang+, CVPR'25, 2024.12
[Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#AIAgents #Blog #SmallModel #ComputerUse #read-later #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2025-11-25 GPT Summary- CUAの発展は高品質な相互作用データの欠如に制約されてきた。これに対処するため、FaraGenという多段階ウェブタスク用のデータ生成システムを提案。多様なタスクを生成し、成功した軌跡を検証しつつ高い効率を発揮。FaraGenを用いて、小型CUAモデルFara-7Bを訓練し、ウェブタスクにおいて優れた性能を発揮。Fara-7Bは他のモデルを上回り、競争力のある結果を示す。また、モデルとデータをオープンソース化し、さらなる研究を促進する。 Comment
元ポスト:
computer useに特化したMS初のSLM(CUA)
関連:
- [Paper Note] AgentInstruct: Toward Generative Teaching with Agentic Flows, Arindam Mitra+, arXiv'24, 2024.07
- [Paper Note] Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks, Adam Fourney+, arXiv'24, 2024.11
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- [Paper Note] Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V, Jianwei Yang+, arXiv'23, 2023.10
- GPT-4V-Act, ddupont808, 2023.10
WebVoyagerでの評価によると、タスクに対するコスト性能比が非常に高いことがわかる。
MIT Licence
著者ポスト:
WebTailBenchと呼ばれる新たなベンチマークも提案されている。既存データに加えて、より多様なドメイン(不動産, 求人, 複数ショップとの比較)などが含まれるようである。
[Paper Note] OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe, Kaichen Zhang+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #SmallModel #OpenSource #read-later #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2025-11-25 GPT Summary- 本研究では、マルチモーダル推論のための透明な二段階トレーニングレシピ「OpenMMReasoner」を提案。監視付きファインチューニング(SFT)で874Kサンプルのデータセットを構築し、強化学習(RL)で74Kサンプルを活用して推論能力を向上。評価の結果、9つのベンチマークでQwen2.5-VL-7B-Instructに対し11.6%の性能向上を達成し、データの質とトレーニング設計の重要性を示した。すべてのリソースはオープンソースで公開。 Comment
pj page: https://evolvinglmms-lab.github.io/OpenMMReasoner/
SoTAなVLMを構築するためのオープンなデータとレシピらしい
[Paper Note] Olmo 3, Team Olmo+, arXiv'25, 2025.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #OpenSource #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2025-11-20 GPT Summary- Olmo 3は、7Bおよび32Bパラメータの完全オープンな言語モデルファミリーで、長文コンテキスト推論やコーディングなどに対応。全ライフサイクルの情報が含まれ、特にOlmo 3 Think 32Bは最も強力な思考モデルとして注目される。 Comment
元ポスト:
解説:
post-LN transformer
OLMo2:
- OLMo 2 32B: First fully open model to outperform GPT 3.5 and GPT 4o mini, AllenAI, 20250.3
ポイント解説:
official livestream video:
解説:
Qwen3-32Bと同等の性能を達成している。そしてそれがオープンソース、素晴らしい。読むべし!!
Olmo3のライセンスに関する以下のような懸念がある:
ポイント解説:
[Paper Note] Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B, Sen Xu+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel #read-later Issue Date: 2025-11-20 GPT Summary- VibeThinker-1.5Bは、Spectrum-to-Signal Principle(SSP)を用いて開発された1.5Bパラメータのモデルで、小型モデルの推論能力を向上させることを目指す。Two-Stage Diversity-Exploring DistillationとMaxEnt-Guided Policy Optimizationを組み合わせ、低コストで優れた推論性能を実現。数学ベンチマークで大規模モデルを上回る結果を示し、小型モデルが大規模モデルに匹敵する能力を持つことを証明。これにより、AI研究の民主化が促進される。 Comment
元ポスト: https://github.com/WeiboAI/VibeThinker
元ポスト:
オフィシャル:
https://huggingface.co/WeiboAI/VibeThinker-1.5B
GGUF版:
https://huggingface.co/MaziyarPanahi/VibeThinker-1.5B-GGUF
1.5Bのモデルでここまでできるようになったのか
[Paper Note] MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling, MiroMind Team+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Reasoning #DeepResearch Issue Date: 2025-11-19 GPT Summary- MiroThinker v1.0は、ツール強化推論と情報探索能力を向上させるオープンソースの研究エージェントで、モデルと環境の相互作用を深めるインタラクションスケーリングを採用。256Kのコンテキストウィンドウを持ち、最大600回のツールコールを実行可能で、従来のエージェントを上回る精度を達成。インタラクションの深さがモデルの性能を向上させることを示し、次世代の研究エージェントにおける重要な要素として位置づけられる。 Comment
元ポスト:
HF: https://huggingface.co/miromind-ai/MiroThinker-v1.0-72B
ポイント解説:
[Paper Note] Intelligence per Watt: Measuring Intelligence Efficiency of Local AI, Jon Saad-Falcon+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #read-later Issue Date: 2025-11-14 GPT Summary- ローカルLMが実世界のクエリに正確に回答できるかを評価するため、タスクの精度を電力単位で割った「ワットあたりの知能(IPW)」を提案。20以上のローカルLMと8つのアクセラレーターを用いた実証研究により、ローカルLMは88.7%の精度でクエリに応答し、IPWは5.3倍改善、カバレッジは23.2%から71.3%に上昇。ローカルアクセラレーターはクラウドよりも低いIPWを達成し、ローカル推論が中央集権型インフラから需要を再分配できる可能性を示唆。IPWプロファイリングハーネスも公開。 Comment
pj page: https://hazyresearch.stanford.edu/blog/2025-11-11-ipw
元ポスト:
この切り口は興味深い。
Open Technical Problems in Open-Weight AI Model Risk Management, Casper+, SSRN'25, 2025.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Safety #read-later #Selected Papers/Blogs Issue Date: 2025-11-13 GPT Summary- オープンウェイトのフロンティアAIモデルは強力で広く採用されているが、リスク管理には新たな課題がある。これらのモデルはオープンな研究を促進する一方で、恣意的な変更や監視なしの使用がリスクを増大させる。安全性ツールに関する研究は限られており、16の技術的課題を提示。オープンな研究と評価がリスク管理の科学を構築する鍵であることを強調。 Comment
元ポスト:
[Paper Note] EdgeTAM: On-Device Track Anything Model, Chong Zhou+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #ImageSegmentation #SmallModel #Video #2D (Image) #EdgeDevices Issue Date: 2025-11-09 GPT Summary- SAM 2は動画セグメンテーションの基盤モデルであり、メモリバンクメカニズムを通じて性能を向上させています。本研究では、モバイルデバイス上での効率を高めるために、EdgeTAMを提案し、2D空間パーセプターを用いて計算コストを削減します。これにより、メモリの空間構造を保持しつつ、推論オーバーヘッドなしで性能を向上させる蒸留パイプラインも導入。EdgeTAMは複数のデータセットで高いJ&Fスコアを達成し、iPhone 15 Pro Maxで16 FPSで動作します。 Comment
元ポスト:
SAM2より性能は少し劣るが、edge-deviceてわ動作可能で非常に高速なモデル(promptによって制御可能なsegmentation)とのこと
- [Paper Note] SAM 2: Segment Anything in Images and Videos, Nikhila Ravi+, ICLR'25, 2024.08
[Paper Note] Step-Audio-EditX Technical Report, Chao Yan+, arXiv'25, 2025.11
Paper/Blog Link My Issue
#LanguageModel #SpeechProcessing #Editing #TTS #AudioLanguageModel Issue Date: 2025-11-09 GPT Summary- 初のオープンソースLLMベースの音声モデル「Step-Audio-EditX」を発表。感情や話し方の編集に優れ、ゼロショットのテキスト音声合成機能も搭載。大きなマージンの合成データを活用し、従来のアプローチからの転換を実現。評価では、感情編集や細かい制御タスクで他のモデルを上回る性能を示した。 Comment
元ポスト:
[Paper Note] LongCat-Video Technical Report, Meituan LongCat Team+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#ComputerVision #DiffusionModel #VideoGeneration/Understandings #WorldModels #3D (Video) #TextToVideoGeneration #SparseAttention #Video Continuation #ImageToVideoGeneration Issue Date: 2025-11-02 GPT Summary- 「LongCat-Video」は、13.6Bパラメータを持つ動画生成モデルで、複数の動画生成タスクにおいて高いパフォーマンスを発揮します。Diffusion Transformerフレームワークに基づき、テキストや画像から動画を生成し、長時間動画の生成においても高品質と一貫性を維持します。効率的な推論を実現するために、粗から細への生成戦略とブロックスパースアテンションを採用し、720p、30fpsの動画を数分で生成可能です。マルチリワードRLHFによるトレーニングにより、最新のモデルと同等の性能を達成し、コードとモデルの重みは公開されています。 Comment
pj page: https://github.com/meituan-longcat/LongCat-Video
元ポスト:
[Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Attention #LongContext #Architecture #read-later #Selected Papers/Blogs #Reference Collection #Hybrid #LinearAttention Issue Date: 2025-10-31 GPT Summary- Kimi Linearは、短・長コンテキスト及び強化学習のシナリオにおいてフルアテンションを超えるハイブリッドな線形アテンションアーキテクチャです。Kimi Delta Attention(KDA)を核とし、ゲーティング機構を拡張した線形アテンションモジュールで、RNNのメモリをより有効利用します。特注のチャンク単位アルゴリズムにより、DPLR遷移行列の効率を向上させ、計算量を大幅に削減します。Kimi Linearモデルは48Bパラメータで事前学習され、評価タスクでMLAを大きく上回り、KVキャッシュ使用量を75%削減し、デコードスループットを6倍向上させました。これにより、フルアテンションアーキテクチャの優れた代替として機能し、長い入力・出力タスクに対応可能であることが示されています。 Comment
HF: https://huggingface.co/moonshotai/Kimi-Linear-48B-A3B-Instruct
元ポスト:
所見:
所見:
アーキテクチャ解説:
KDAとFull Attention, Sliding Window Attentionの比較:
Full Attentionと同等の性能をより効率良く達成できる
KDAに関する図解:
KDAの更新ルールに直接位置情報がエンコードされるためRoPEを必要としない:
[Paper Note] Hubble: a Model Suite to Advance the Study of LLM Memorization, Johnny Tian-Zheng Wei+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #read-later #Memorization Issue Date: 2025-10-26 GPT Summary- Hubbleは、LLMの記憶に関する研究のためのオープンソースモデルスイートで、標準モデルと変化モデルの2種類を提供。標準モデルは大規模な英語コーパスで事前学習され、変化モデルは特定のテキストを挿入して記憶リスクを模倣。8つのモデルが1Bまたは8Bのパラメータを持ち、100Bまたは500Bのトークンで訓練。研究により、敏感なデータの記憶はコーパスのサイズに依存し、データの露出が少ない場合は忘れられることが示された。Hubbleは、プライベート情報の記憶の容易さを分析するなど、幅広い記憶研究を可能にし、コミュニティにさらなる探求を促す。 Comment
pj page: https://allegro-lab.github.io/hubble/
元ポスト:
[Paper Note] Extracting alignment data in open models, Federico Barbero+, arXiv'25, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Alignment #InstructionTuning #SyntheticData Issue Date: 2025-10-23 GPT Summary- 本研究では、ポストトレーニングモデルからアライメントトレーニングデータを抽出する方法を示し、埋め込みモデルが特定の能力向上に適していると主張します。文字列マッチングに依存せず、意味的類似性を捉えることで、抽出可能なデータ量を過小評価するリスクを明らかにしました。また、モデルはポストトレーニングフェーズで使用されたデータを再生でき、元のパフォーマンスを回復可能であることを示しました。研究は蒸留手法の影響についても議論します。 Comment
元ポスト:
Magpieのような話だろうか?
[Paper Note] MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention, MiniMax+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #ReinforcementLearning #Reasoning #MoE(Mixture-of-Experts) Issue Date: 2025-10-17 GPT Summary- MiniMax-M1は、4560億パラメータを持つ世界初のオープンウェイトのハイブリッドアテンション推論モデルで、Mixture-of-Expertsアーキテクチャとライトニングアテンションを組み合わせています。1百万トークンのコンテキスト長をサポートし、複雑なタスクに適しています。新しいRLアルゴリズムCISPOを提案し、効率的な訓練を実現。標準ベンチマークで強力なオープンウェイトモデルと同等以上の性能を示し、特にソフトウェアエンジニアリングや長いコンテキストタスクで優れた結果を出しています。モデルは公開されています。 Comment
- MiniMax-M1, MiniMax, 2025.06
のテクニカルレポート。
- [Paper Note] The Art of Scaling Reinforcement Learning Compute for LLMs, Devvrit Khatri+, arXiv'25, 2025.10
でGSPO, DAPOよりも安定性と最終到達性能でより優れていることが示されたCISPOと呼ばれるRLアルゴリズムが提案されている。
関連:
[Paper Note] Magistral, Mistral-AI+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #One-Line Notes Issue Date: 2025-10-07 GPT Summary- Mistralの推論モデルMagistralと独自の強化学習パイプラインを紹介。ゼロからのアプローチで、LLMのRLトレーニングの限界を探り、テキストデータのみでのRLが能力を維持することを示す。Magistral MediumはRLのみで訓練され、Magistral Smallはオープンソース化。 Comment
元ポスト:
関連:
- Magistral-Small-2509, MistralAI, 2025.09
MistralAIの初めてのreasoningモデル
[Paper Note] LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training, Xiang An+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #OpenSource #VisionLanguageModel #One-Line Notes Issue Date: 2025-10-04 GPT Summary- LLaVA-OneVision-1.5は、計算コストと財政コストを削減しつつ最先端のパフォーマンスを実現する新しい大規模マルチモーダルモデルです。オープンで効率的なフレームワークを提供し、85Mの事前学習データセットと26Mの指示データセットを含む大規模キュレーションデータセットを構築しました。効率的なトレーニングフレームワークにより、限られた予算内でのトレーニングが可能となり、幅広い下流タスクで競争力のある性能を示しています。特に、LLaVA-OneVision-1.5-8Bは18のベンチマークでQwen2.5-VL-7Bを上回り、4Bモデルは全ての27のベンチマークでQwen2.5-VL-3Bを超えています。今後、LLaVA-OneVision-1.5-RLのリリースも予定されています。 Comment
元ポスト:
各種ベンチでQwen2.5-VL超え
pj page: https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5
ポイント解説:
[Paper Note] CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning, Long Xing+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#ComputerVision #NLP #ImageCaptioning #SmallModel #VisionLanguageModel Issue Date: 2025-09-29 GPT Summary- 画像キャプショニングにおいて、従来の監視型ファインチューニング(SFT)の限界を克服するため、検証可能な報酬を用いた強化学習(RLVR)を提案。新しいトレーニングフレームワーク「キャプショニング強化学習(CapRL)」を導入し、キャプションの質をその有用性で再定義。CapRLは、視覚非依存のLLMの精度に基づく客観的な報酬を得る二段階のパイプラインを採用。CapRL-3Bによる事前学習は、12のベンチマークで大幅な性能向上を実現し、Qwen2.5-VL-72Bと同等のパフォーマンスを達成。 Comment
元ポスト:
HF: https://huggingface.co/collections/long-xing1/caprl-68d64ac32ded31596c36e189
公式ポスト:
[Paper Note] EmbeddingGemma: Powerful and Lightweight Text Representations, Henrique Schechter Vera+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#Embeddings #NLP #RepresentationLearning #SmallModel #MultiLingual Issue Date: 2025-09-25 GPT Summary- EmbeddingGemmaは、Gemma 3言語モデルに基づく軽量なオープンテキスト埋め込みモデルで、エンコーダ-デコーダの初期化と幾何学的埋め込み蒸留を用いて大規模モデルの知識を活用。分散正則化器を使用し、異なるチェックポイントを統合することで一般化能力を向上。300Mのパラメータで、MTEBで最先端の結果を達成し、従来のトップモデルを上回る性能を示す。量子化や出力の切り詰めにも耐え、低遅延かつ高スループットのアプリケーションに適している。EmbeddingGemmaはコミュニティに公開され、さらなる研究を促進する。 Comment
公式モデル概要: https://ai.google.dev/gemma/docs/embeddinggemma?hl=ja
元ポスト:
100以上の言語で訓練されマトリョーシカ表現なのでベクトルのサイズを調整可能な模様
マトリョーシカ表現:
- [Paper Note] Matryoshka Representation Learning, Aditya Kusupati+, NeurIPS'22
公式による解説ブログ:
[Paper Note] CWM: An Open-Weights LLM for Research on Code Generation with World Models, FAIR CodeGen team+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Coding #mid-training #PostTraining #Selected Papers/Blogs #WorldModels #One-Line Notes Issue Date: 2025-09-25 GPT Summary- 320億パラメータのCode World Model (CWM)をリリースし、コード生成のための世界モデルの研究を進める。静的コードだけでなく、PythonインタプリタやDocker環境から得た観測-行動トレジェクトリで中間トレーニングを実施し、マルチタスク推論RLによる広範な能力を評価。CWMは強力なテストベッドを提供し、世界モデルがエージェンティックコーディングに貢献できることを示す。主要なタスクで高いパフォーマンスを記録し、モデルチェックポイントも提供。 Comment
元ポスト:
World Modelと銘打ってあるが、一般的なCV分野でのWorld Modelではなく、python やbash等の実行をトークン列として仮想的にトレースできるようにmid trainingされている(大量の実トレースデータが利用されている模様)ので、World Modelと銘打たれている模様?
GRPOに対するモダンなtweakがまとまっている模様:
DeepSeek-R1で提案されてから細かな調整が重ねられて来た。
[Paper Note] OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning, Yanqing Liu+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #OpenSource #Encoder #Backbone Issue Date: 2025-09-16 GPT Summary- 本論文では、OpenVisionのアーキテクチャを簡素化し、トレーニング効率を向上させる方法を提案。テキストエンコーダーと対照損失を削除し、キャプショニング損失のみを使用したOpenVision 2を導入。初期結果は、トレーニング時間を約1.5倍短縮し、メモリ使用量を約1.8倍削減することを示し、10億以上のパラメータにスケールアップ可能であることを強調。 Comment
元ポスト:
事前学習時にtext, image encoderのcontrastive lossで学習していたが、text encoderを無くしimage encoderに入力されたimageからcaptionを生成するcaption lossのみにすることで性能を落とすことなく効率を改善
[Paper Note] Scalable Vision Language Model Training via High Quality Data Curation, Hongyuan Dong+, ACL'25
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel #ACL #VisionLanguageModel Issue Date: 2025-09-16 GPT Summary- SAIL-VLは、2Bおよび8Bパラメータのオープンソースビジョン言語モデルで、最先端の性能を達成。主な改善点は、(1) 高品質な視覚理解データの構築、(2) 拡大した事前学習データによる性能向上、(3) 複雑さのスケーリングによる効果的なSFTデータセットのキュレーション。SAIL-VLは18のVLMベンチマークで最高スコアを達成し、2Bモデルは同等のVLMの中でトップの位置を占める。モデルはHuggingFaceで公開。 Comment
元ポスト:
[Paper Note] K2-Think: A Parameter-Efficient Reasoning System, Zhoujun Cheng+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #OpenSource #GRPO #read-later #RLVR #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2025-09-10 GPT Summary- K2-Thinkは320億パラメータの推論システムで、GPT-OSS 120BやDeepSeek v3.1と同等かそれ以上の性能を示します。Qwen2.5ベースのモデルに先進的なポストトレーニングと推論技術を融合し、長いチェーン・オブ・ソート思考と強化学習を用いて数学的推論で卓越した成果を上げています。公開ベンチマークでも高得点を記録し、よりパラメータ効率の高いモデルが最先端システムと競争できることを明らかにしました。K2-Thinkは迅速な推論速度を提供し、オープンソースの推論システムをより利用しやすくしています。 Comment
HF:
https://huggingface.co/LLM360/K2-Think
code:
-
https://github.com/MBZUAI-IFM/K2-Think-SFT
-
https://github.com/MBZUAI-IFM/K2-Think-Inference
RLはverl+GRPOで実施したとテクニカルペーパーに記述されているが、当該部分のコードの公開はされるのだろうか?
RLで利用されたデータはこちら:
- [Paper Note] Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective, Zhoujun Cheng+, NeurIPS'25
元ポスト:
[Paper Note] Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search, Xin Lai+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #ReinforcementLearning #Reasoning #LongContext #GRPO #VisionLanguageModel Issue Date: 2025-09-10 GPT Summary- Mini-o3システムは、数十ステップの深いマルチターン推論を実現し、視覚検索タスクで最先端の性能を達成。Visual Probe Datasetを構築し、多様な推論パターンを示すデータ収集パイプラインを開発。オーバーターンマスキング戦略により、ターン数が増えるほど精度が向上することを実証。 Comment
HF: https://huggingface.co/Mini-o3
pj page: https://mini-o3.github.io
元ポスト:
既存のオープンなVLMはマルチターンのターン数を増やせないという課題があったがそれを克服するレシピに関する研究な模様。元ポストによると6ターンまでのマルチターンで学習しても、inference時には32ターンまでスケールするとか。
[Paper Note] LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model, Xiyao Wang+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #ReinforcementLearning #Reasoning #SelfCorrection #VisionLanguageModel #Critic Issue Date: 2025-09-04 GPT Summary- 本研究では、視覚と言語のモデリングにおいて、批評モデルを強化学習を用いて再編成し、生成モデルに直接適用する新しいアプローチを提案します。これにより、マルチモーダル批評モデルLLaVA-Critic-R1を生成し、視覚的推論ベンチマークで高い性能を示しました。さらに、自己批評を用いることで、追加の訓練なしに推論タスクでの性能を向上させることができることを示しました。この結果は、評価と生成の両方に優れた統一モデルを実現する可能性を示唆しています。 Comment
元ポスト:
HF: https://huggingface.co/collections/lmms-lab/llava-critic-r1-68922484e5822b89fab4aca1
[Paper Note] Hunyuan-MT Technical Report, Mao Zheng+, arXiv'25, 2025.09
Paper/Blog Link My Issue
#MachineTranslation #NLP #LanguageModel #Catastrophic Forgetting #mid-training #Selected Papers/Blogs #In-Depth Notes #Surface-level Notes Issue Date: 2025-09-01 GPT Summary- Hunyuan-MT-7Bは、33の主要言語間の双方向翻訳をサポートする初のオープンソースモデルであり、特に標準中国語と少数言語間の翻訳に焦点を当てています。スロースローチンキングに触発されたHunyuan-MT-Chimera-7Bを導入し、複数の出力を統合することで性能を向上させています。モデルは包括的なトレーニングプロセスを経ており、強化学習を用いた高度な整合性を実現。実験では、両モデルが同等のパラメータサイズの他の翻訳モデルを上回り、WMT2025共有タスクで30の言語ペアで1位を獲得しました。これにより、モデルの堅牢性が強調されています。 Comment
テクニカルレポート: https://github.com/Tencent-Hunyuan/Hunyuan-MT/blob/main/Hunyuan_MT_Technical_Report.pdf
元ポスト:
Base Modelに対してまず一般的な事前学習を実施し、その後MTに特化した継続事前学習(モノリンガル/パラレルコーパスの利用)、事後学習(SFT, GRPO)を実施している模様。
継続事前学習では、最適なDataMixの比率を見つけるために、RegMixと呼ばれる手法を利用。Catastrophic Forgettingを防ぐために、事前学習データの20%を含めるといった施策を実施。
SFTでは2つのステージで構成されている。ステージ1は基礎的な翻訳力の強化と翻訳に関する指示追従能力の向上のために、Flores-200の開発データ(33言語の双方向の翻訳をカバー)、前年度のWMTのテストセット(English to XXをカバー)、Mandarin to Minority, Minority to Mandarinのcuratedな人手でのアノテーションデータ、DeepSeek-V3-0324での合成パラレルコーパス、general purpose/MT orientedな指示チューニングデータセットのうち20%を構成するデータで翻訳のinstructinoに関するモデルの凡化性能を高めるためキュレーションされたデータ、で学習している模様。パラレルコーパスはReference-freeな手法を用いてスコアを算出し閾値以下の低品質な翻訳対は除外している。ステージ2では、詳細が書かれていないが、少量でよりfidelityの高い約270kの翻訳対を利用した模様。また、先行研究に基づいて、many-shotのin-context learningを用いて、訓練データをさらに洗練させたとのこと(先行研究が引用されているのみで詳細な記述は無し)。また、複数の評価ラウンドでスコアの一貫性が無いサンプルは手動でアノテーション、あるいはverificationをして品質を担保している模様。
RLではGRPOを採用し、rewardとしてsemantic([Paper Note] xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection, Nuno M. Guerreiro+, TACL'24
), terminology([Paper Note] TAT-R1: Terminology-Aware Translation with Reinforcement Learning and
Word Alignment, Zheng Li+, arXiv'25
; ドメイン特有のterminologyを捉える), repetitionに基づいたrewardを採用している。最終的にSFT->RLで学習されたHuayuan-MT-7Bに対して、下記プロンプトを用いて複数のoutputを統合してより高品質な翻訳を出力するキメラモデルを同様のrewardを用いて学習する、といったpipelineになっている。
関連:
- [Paper Note] Large Language Models Are State-of-the-Art Evaluators of Translation Quality, EAMT'23, 2023.06
- [Paper Note] xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection, Nuno M. Guerreiro+, TACL'24
- [Paper Note] CometKiwi: IST-Unbabel 2022 Submission for the Quality Estimation Shared Task, Rei+, WMT'22
- [Paper Note] No Language Left Behind: Scaling Human-Centered Machine Translation, NLLB Team+, arXiv'22, 2022.07
- [Paper Note] Many-Shot In-Context Learning, Rishabh Agarwal+, NeurIPS'24
- [Paper Note] RegMix: Data Mixture as Regression for Language Model Pre-training, Qian Liu+, ICLR'25
- [Paper Note] TAT-R1: Terminology-Aware Translation with Reinforcement Learning and
Word Alignment, Zheng Li+, arXiv'25
関連: PLaMo翻訳
- PLaMo Translate: 翻訳特化大規模言語モデルの開発,今城+, Jxiv'25, 2025.08
こちらはSFT->Iterative DPO->Model Mergeを実施し、翻訳に特化した継続事前学習はやっていないように見える。一方、SFT時点で独自のテンプレートを作成し、語彙の指定やスタイル、日本語特有の常体、敬体の指定などを実施できるように翻訳に特化したテンプレートを学習している点が異なるように見える。Hunyuanは多様な翻訳の指示に対応できるように学習しているが、PLaMo翻訳はユースケースを絞り込み、ユースケースに対する性能を高めるような特化型のアプローチをとるといった思想の違いが伺える。
[Paper Note] Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model, Xianglong He+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #Transformer #DiffusionModel #VideoGeneration/Understandings #WorldModels #Game Issue Date: 2025-08-28 GPT Summary- Matrix-Game 2.0を提案し、インタラクティブな世界モデルがリアルタイムで長いビデオを生成できるようにする。主なコンポーネントは、スケーラブルなデータ生成パイプライン、インタラクティブな条件を可能にするアクション注入モジュール、リアルタイム生成のための数ステップの蒸留。これにより、25 FPSで高品質な1分間のビデオを生成可能。モデルの重みとコードはオープンソース化。 Comment
元ポスト:
pj page: https://matrix-game-v2.github.io
公式:
[Paper Note] Ovis2.5 Technical Report, Shiyin Lu+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #Reasoning #CurriculumLearning #VideoGeneration/Understandings #VisionLanguageModel #One-Line Notes Issue Date: 2025-08-28 GPT Summary- Ovis2.5は、ネイティブ解像度の視覚認識とマルチモーダル推論を強化するために設計されたモデルで、画像を可変解像度で処理し、複雑な視覚コンテンツの詳細を保持します。推論時には反省を行う「思考モード」を提供し、精度向上を図ります。5段階のカリキュラムで訓練され、マルチモーダルデータの効率的な処理を実現。Ovis2.5-9BはOpenCompassで平均78.3を記録し、Ovis2-8Bに対して大幅な改善を示しました。Ovis2.5-2Bも73.9を達成し、リソース制約のあるデバイスに最適です。STEMベンチマークや複雑なチャート分析においても優れた性能を発揮しています。 Comment
元ポスト:
HF:
https://huggingface.co/AIDC-AI/Ovis2.5-9B
Apache2.0ライセンス
GLM-4.1V-9B-Thinkingと同等以上の性能な模様。
- [Paper Note] GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning, GLM-V Team+, arXiv'25, 2025.07
[Paper Note] InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency, Weiyun Wang+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #read-later #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2025-08-26 GPT Summary- InternVL 3.5は、マルチモーダルモデルの新しいオープンソースファミリーで、Cascade Reinforcement Learningを用いて推論能力と効率を向上させる。粗から細へのトレーニング戦略により、MMMやMathVistaなどのタスクで大幅な改善を実現。Visual Resolution Routerを導入し、視覚トークンの解像度を動的に調整。Decoupled Vision-Language Deployment戦略により、計算負荷をバランスさせ、推論性能を最大16.0%向上させ、速度を4.05倍向上。最大モデルは、オープンソースのMLLMで最先端の結果を達成し、商業モデルとの性能ギャップを縮小。全てのモデルとコードは公開。 Comment
元ポスト:
ポイント解説:
[Paper Note] Motif 2.6B Technical Report, Junghwan Lim+, arXiv'25
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Alignment #Supervised-FineTuning (SFT) #Architecture #PostTraining #Selected Papers/Blogs #DataMixture Issue Date: 2025-08-25 GPT Summary- Motif-2.6Bは、26億パラメータを持つ基盤LLMで、長文理解の向上や幻覚の減少を目指し、差分注意やポリノルム活性化関数を採用。広範な実験により、同サイズの最先端モデルを上回る性能を示し、効率的でスケーラブルな基盤LLMの発展に寄与する。 Comment
元ポスト:
HF: https://huggingface.co/Motif-Technologies/Motif-2.6B
- アーキテクチャ
- [Paper Note] Differential Transformer, Tianzhu Ye+, N/A, ICLR'25
- [Paper Note] Polynomial Composition Activations: Unleashing the Dynamics of Large
Language Models, Zhijian Zhuo+, arXiv'24
- 学習手法
- [Paper Note] Model Merging in Pre-training of Large Language Models, Yunshui Li+, arXiv'25, 2025.05
- 8B token学習するごとに直近6つのcheckpointのelement-wiseの平均をとりモデルマージ。当該モデルに対して学習を継続、ということを繰り返す。これにより、学習のノイズを低減し、突然パラメータがシフトすることを防ぐ
- [Paper Note] Effective Long-Context Scaling of Foundation Models, Wenhan Xiong+, arXiv'23, 2023.09
- Adaptive Base Frequency (RoPEのbase frequencyを10000から500000にすることでlong contextのattention scoreが小さくなりすぎることを防ぐ)
- [Paper Note] MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies, Shengding Hu+, COLM'24
- 事前学習データ
- [Paper Note] DataComp-LM: In search of the next generation of training sets for language models, Jeffrey Li+, NeurIPS'25, 2024.07
- TxT360, LLM360, 2024.10
- [Paper Note] FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language, Guilherme Penedo+, COLM'25
を利用したモデル。同程度のサイズのモデルとの比較ではかなりのgainを得ているように見える。興味深い。
DatasetのMixtureの比率などについても記述されている。
[Paper Note] Intern-S1: A Scientific Multimodal Foundation Model, Lei Bai+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#NLP #LanguageModel #MoE(Mixture-of-Experts) #read-later #VisionLanguageModel #Science Issue Date: 2025-08-23 GPT Summary- Intern-S1は、科学専門分野に特化したオープンソースの専門家型モデルで、280億の活性化パラメータを持つマルチモーダルMixture-of-Experts(MoE)モデルです。5Tトークンで事前学習され、特に科学データに焦点を当てています。事後学習では、InternBootCampを通じて強化学習を行い、Mixture-of-Rewardsを提案。評価では、一般的な推論タスクで競争力を示し、科学分野の専門的なタスクでクローズドソースモデルを上回る性能を達成しました。モデルはHugging Faceで入手可能です。 Comment
元ポスト:
scientific domainに特化したデータで継続事前学習+RL Finetuningしたドメイン特化言語モデルらしい。
HF:
https://huggingface.co/internlm/Intern-S1
Apache 2.0ライセンス
ベースモデルはQwen3とInternViT
- InternViT:
https://huggingface.co/OpenGVLab/InternViT-300M-448px-V2_5
関連:
- [Paper Note] InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks, Zhe Chen+, CVPR'24
解説:
サマリ:
[Paper Note] NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model, NVIDIA+, arXiv'25, 2025.08
Paper/Blog Link My Issue
#Pretraining #NLP #Dataset #LanguageModel #SmallModel #SSM (StateSpaceModel) #Selected Papers/Blogs Issue Date: 2025-08-19 GPT Summary- Nemotron-Nano-9B-v2は、推論スループットを向上させつつ最先端の精度を達成するハイブリッドMamba-Transformerモデルである。自己注意層の一部をMamba-2層に置き換え、長い思考トレースの生成を高速化。12億パラメータのモデルを20兆トークンで事前トレーニングし、Minitron戦略で圧縮・蒸留。既存モデルと比較して、最大6倍の推論スループットを実現し、精度も同等以上。モデルのチェックポイントはHugging Faceで公開予定。 Comment
元ポスト:
事前学習に利用されたデータも公開されているとのこと(Nemotron-CC):
解説:
サマリ:
[Paper Note] MolmoAct: Action Reasoning Models that can Reason in Space, Jason Lee+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #SpeechProcessing #Reasoning #VisionLanguageActionModel Issue Date: 2025-08-12 GPT Summary- アクション推論モデル(ARMs)であるMolmoActは、知覚、計画、制御を三段階のパイプラインで統合し、説明可能で操作可能な行動を実現。シミュレーションと実世界で高いパフォーマンスを示し、特にSimplerEnv Visual Matchingタスクで70.5%のゼロショット精度を達成。MolmoAct Datasetを公開し、トレーニングによりベースモデルのパフォーマンスを平均5.5%向上。全てのモデルの重みやデータセットを公開し、ARMsの構築に向けたオープンな設計図を提供。 Comment
`Action Reasoning Models (ARMs)`
元ポスト:
blog: https://allenai.org/blog/molmoact
models:
-
https://huggingface.co/allenai/MolmoAct-7B-D-Pretrain-0812
-
https://huggingface.co/allenai/MolmoAct-7B-D-0812
datasets:
-
https://huggingface.co/datasets/allenai/MolmoAct-Dataset
-
https://huggingface.co/datasets/allenai/MolmoAct-Pretraining-Mixture
-
https://huggingface.co/datasets/allenai/MolmoAct-Midtraining-Mixture
データは公開されているが、コードが見当たらない?
チェックポイントとコードも公開された模様:
-
- https://github.com/allenai/MolmoAct
[Paper Note] GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models, GLM-4. 5 Team+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2025-08-12 GPT Summary- 355Bパラメータを持つオープンソースのMixture-of-ExpertsモデルGLM-4.5を発表。ハイブリッド推論手法を採用し、エージェント的、推論、コーディングタスクで高いパフォーマンスを達成。競合モデルに比べて少ないパラメータ数で上位にランクイン。GLM-4.5とそのコンパクト版GLM-4.5-Airをリリースし、詳細はGitHubで公開。 Comment
元ポスト:
- アーキテクチャ
- MoE / sigmoid gates
- DeepSeek-R1, DeepSeek, 2025.01
- [Paper Note] Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity, William Fedus+, JMLR'22
- loss free balanced routing
- [Paper Note] Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts, Lean Wang+, arXiv'24
- widthを小さく、depthを増やすことでreasoning能力改善
- GQA w/ partial RoPE
- [Paper Note] GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, Joshua Ainslie+, arXiv'23, 2023.05
- [Paper Note] RoFormer: Enhanced Transformer with Rotary Position Embedding, Jianlin Su+, arXiv'21, 2021.04
- Attention Headsの数を2.5倍(何に対して2.5倍なんだ、、?)(96個, 5120次元)にすることで(おそらく)事前学習のlossは改善しなかったがReasoning benchmarkの性能改善
- QK Normを導入しattentionのlogitsの値域を改善
- [Paper Note] Query-Key Normalization for Transformers, Alex Henry+, EMNLP'20 Findings
- Multi Token Prediction
- [Paper Note] Better & Faster Large Language Models via Multi-token Prediction, Fabian Gloeckle+, ICML'24
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
他モデルとの比較
学習部分は後で追記する
- 事前学習データ
- web
- 英語と中国語のwebページを利用
- [Paper Note] Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset, Dan Su+, ACL'25
と同様にquality scoreyをドキュメントに付与
- 最も低いquality scoreの文書群を排除し、quality scoreの高い文書群をup sampling
- 最もquality scoreyが大きい文書群は3.2 epoch分利用
- 多くのweb pageがテンプレートから自動生成されており高いquality scoreが付与されていたが、MinHashによってdeduplicationできなかったため、 [Paper Note] SemDeDup: Data-efficient learning at web-scale through semantic
deduplication, Amro Abbas+, arXiv'23
を用いてdocument embeddingに基づいて類似した文書群を排除
- Multilingual
- 独自にクロールしたデータとFineWeb-2 [Paper Note] FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language, Guilherme Penedo+, COLM'25
から多言語の文書群を抽出し、quality classifierを適用することでeducational utilityを定量化し、高いスコアの文書群をupsamplingして利用
- code
- githubなどのソースコードhosting platformから収集
- ソースコードはルールベースのフィルタリングをかけ、その後言語ごとのquality modelsによって、high,middle, lowの3つに品質を分類
- high qualityなものはupsamplingし、low qualityなものは除外
- [Paper Note] Efficient Training of Language Models to Fill in the Middle, Mohammad Bavarian+, arXiv'22
で提案されているFill in the Middle objectiveをコードの事前学習では適用
- コードに関連するweb文書も事前学習で収集したテキスト群からルールベースとfasttextによる分類器で抽出し、ソースコードと同様のqualityの分類とサンプリング手法を適用。最終的にフィルタリングされた文書群はre-parseしてフォーマットと内容の品質を向上させた
- math & science
- web page, 本, 論文から、reasoning能力を向上させるために、数学と科学に関する文書を収集
- LLMを用いて文書中のeducational contentの比率に基づいて文書をスコアリングしスコアを予測するsmall-scaleな分類器を学習
- 最終的に事前学習コーパスの中の閾値以上のスコアを持つ文書をupsampling
- 事前学習は2 stageに分かれており、最初のステージでは、"大部分は"generalな文書で学習する。次のステージでは、ソースコード、数学、科学、コーディング関連の文書をupsamplingして学習する。
上記以上の細かい実装上の情報は記載されていない。
mid-training / post trainingについても後ほど追記する
以下も参照のこと
- GLM-4.5: Reasoning, Coding, and Agentic Abililties, Zhipu AI Inc., 2025.07
[Paper Note] Ming-Omni: A Unified Multimodal Model for Perception and Generation, Inclusion AI+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #read-later #Selected Papers/Blogs #UMM #Omni Issue Date: 2025-07-26 GPT Summary- Ming-Omniは、画像、テキスト、音声、動画を処理できる統一マルチモーダルモデルで、音声生成と画像生成において優れた能力を示す。専用エンコーダを用いて異なるモダリティからトークンを抽出し、MoEアーキテクチャで処理することで、効率的にマルチモーダル入力を融合。音声デコーダと高品質な画像生成を統合し、コンテキストに応じたチャットやテキストから音声への変換、画像編集が可能。Ming-Omniは、GPT-4oに匹敵する初のオープンソースモデルであり、研究と開発を促進するためにコードとモデルの重みを公開。 Comment
元ポスト:
現在はv1.5も公開されておりさらに性能が向上している模様?
[Paper Note] Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination, Mingqi Wu+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Contamination-free Issue Date: 2025-07-16 GPT Summary- 大規模言語モデル(LLMs)の推論能力向上に関する研究が進展しており、特にQwen2.5モデルが強化学習(RL)を用いて顕著な改善を示している。しかし、他のモデルでは同様の成果が得られていないため、さらなる調査が必要である。Qwen2.5は数学的推論性能が高いが、データ汚染に脆弱であり、信頼性のある結果を得るためには、RandomCalculationというクリーンなデータセットを用いることが重要である。このデータセットを通じて、正確な報酬信号が性能向上に寄与することが示された。信頼性のある結論を得るためには、汚染のないベンチマークと多様なモデルでのRL手法の評価が推奨される。 Comment
元ポスト:
解説ポスト:
関連:
- [Paper Note] Spurious Rewards: Rethinking Training Signals in RLVR, Shao+, 2025.05
こちらでQwen-mathに対して得られたRLでのgainは他モデルでは現れず汎化しないことも報告されている。
[Paper Note] Kimi-VL Technical Report, Kimi Team+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #Reasoning #VisionLanguageModel Issue Date: 2025-07-14 GPT Summary- Kimi-VLは、効率的なオープンソースのMixture-of-Expertsビジョン・ランゲージモデルであり、2.8Bパラメータの言語デコーダーを活性化して高度なマルチモーダル推論を実現。マルチターンエージェントタスクや大学レベルの画像・動画理解において優れた性能を示し、最先端のVLMと競争。128Kの拡張コンテキストウィンドウを持ち、長い入力を処理可能。Kimi-VL-Thinking-2506は、長期的推論能力を強化するために教師ありファインチューニングと強化学習を用いて開発され、堅牢な一般能力を獲得。コードは公開されている。 Comment
- [Paper Note] Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset, Ke Wang+, NeurIPS'24 Datasets and Benchmarks Track
での性能(Vision+テキストの数学の問題)。他の巨大なモデルと比べ2.8BのActivation paramsで高い性能を達成
その他のベンチマークでも高い性能を獲得
モデルのアーキテクチャ。MoonViT (Image Encoder, 1Dのpatchをinput, 様々な解像度のサポート, FlashAttention, SigLIP-SO-400Mを継続事前学習, RoPEを採用) + Linear Projector + MoE Language Decoderの構成
学習のパイプライン。ViTの事前学習ではSigLIP loss (contrastive lossの亜種)とcaption生成のcross-entropy lossを採用している。joint cooldown stageにおいては、高品質なQAデータを合成することで実験的に大幅に性能が向上することを確認したので、それを採用しているとのこと。optimizerは
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
post-trainingにおけるRLでは以下の目的関数を用いており、RLVRを用いつつ、現在のポリシーモデルをreferenceとし更新をするような目的関数になっている。curriculum sampling, prioritize samplingをdifficulty labelに基づいて実施している。
[Paper Note] Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation, Liliang Ren+, arXiv'25
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #SmallModel Issue Date: 2025-07-10 GPT Summary- 最近の言語モデルの進展により、状態空間モデル(SSM)の効率的なシーケンスモデリングが示されています。本研究では、ゲーテッドメモリユニット(GMU)を導入し、Sambaベースの自己デコーダーからメモリを共有する新しいデコーダーハイブリッドアーキテクチャSambaYを提案します。SambaYはデコーディング効率を向上させ、長文コンテキスト性能を改善し、位置エンコーディングの必要性を排除します。実験により、SambaYはYOCOベースラインに対して優れた性能を示し、特にPhi4-mini-Flash-Reasoningモデルは推論タスクで顕著な成果を上げました。トレーニングコードはオープンソースで公開されています。 Comment
HF: https://huggingface.co/microsoft/Phi-4-mini-flash-reasoning
元ポスト:
[Paper Note] SmolVLM: Redefining small and efficient multimodal models, Andrés Marafioti+, arXiv'25
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #SmallModel #Architecture #COLM #read-later #Selected Papers/Blogs #VisionLanguageModel #EdgeDevices Issue Date: 2025-07-09 GPT Summary- SmolVLMは、リソース効率の良い推論のために設計されたコンパクトなマルチモーダルモデルシリーズであり、低い計算オーバーヘッドを持つアーキテクチャやトークン化戦略を採用。最小モデルのSmolVLM-256Mは、1GB未満のGPUメモリでIdefics-80Bモデルを上回る性能を発揮し、最大モデルは2.2Bパラメータで最先端のVLMに匹敵。これにより、エネルギー効率の良い実用的な展開が可能となる。 Comment
HFSpace: https://huggingface.co/blog/smolervlm
元ポスト:
openreview: https://openreview.net/forum?id=qMUbhGUFUb
[Paper Note] ReasonIR: Training Retrievers for Reasoning Tasks, Rulin Shao+, COLM'25, 2025.04
Paper/Blog Link My Issue
#Embeddings #InformationRetrieval #LanguageModel #RepresentationLearning #SyntheticData #RAG(RetrievalAugmentedGeneration) #Reasoning #COLM Issue Date: 2025-07-09 GPT Summary- 推論タスク向けに特化学習した検索器ReasonIR-8Bを提案。合成データ生成パイプラインにより、難しく関連性の高いクエリと、もっともらしいが有用でないハードネガティブを作成し、既存データと組み合わせて学習。BRIGHTで新たな最先端性能を達成し、RAGではMMLUおよびGPQAの性能を大幅に向上。長く情報量の多いクエリやLLMリランカーとの組み合わせでも高い性能を維持し、コード・データ・モデルを公開。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=kkBCNLMbGj#discussion
[Paper Note] OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning, Xianhang Li+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #OpenSource #Selected Papers/Blogs #ICCV #Encoder #Backbone #One-Line Notes Issue Date: 2025-06-26 GPT Summary- CLIPに代わる完全にオープンで費用対効果に優れた視覚エンコーダ群OpenVisionを提案。 CLIPSとRecap-DataComp-1Bを基盤に、LLaVAなどのマルチモーダルモデルでCLIPと同等以上の性能を実現。 5.9M〜632.1Mパラメータのモデルを公開し、性能重視からエッジ向けの軽量展開まで柔軟な選択肢を提供。 Comment
元ポスト:
v2へアップデート:
事前学習時にtext, image encoderのcontrastive lossで学習していたが、text encoderを無くしimage encoderに入力されたimageからcaptionを生成するcaption lossのみにすることで性能を落とすことなく効率を改善
テクニカルペーパーが出た模様
- [Paper Note] OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning, Yanqing Liu+, arXiv'25
HF:
https://huggingface.co/collections/UCSC-VLAA/openvision-681a4c27ee1f66411b4ae919
pj page:
https://ucsc-vlaa.github.io/OpenVision/
CLIP, SigLIPとは異なり完全にオープンなVision Encoder
v2の解説:
[Paper Note] AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy, Zihan Liu+, arXiv'25, 2025.06
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SmallModel #OpenSource #PostTraining #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2025-06-18 GPT Summary- SFTではプロンプト数と応答数を増やすことで推論性能が向上し、特にプロンプト数の拡張が有効。強力なSFTモデルは、適切なRL学習により高い最終性能につながる。サンプリング温度を調整してエントロピーを約0.3に維持することで、探索と活用のバランスを実現し、初期SFTモデル間の性能差を縮小。SFTとRLの相乗効果により、AceReason-Nemotron-1.1 7Bは数学・コードベンチマークでQwen2.5-7Bベースモデルの最高性能を達成。 Comment
元ポスト:
様々なtakeawayがまとめられている。
SFT,RLに利用されたデータも公開
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23
において事前学習時に4 epochまでは性能の改善幅が大きいと報告されていたが、SFTでも5 epoch程度まで学習すると良い模様。
また、SFT dataをscalingさせる際は、promptの数だけでなく、prompt単位のresponse数を増やすのが効果的
[Paper Note] QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization, Weizhou Shen+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext Issue Date: 2025-05-27 GPT Summary- QwenLong-CPRSは、長文コンテキスト最適化のための新しいフレームワークで、LLMsの性能低下を軽減します。自然言語指示に基づく多段階のコンテキスト圧縮を実現し、効率と性能を向上させる4つの革新を導入。5つのベンチマークで、他の手法に対して優位性を示し、主要なLLMとの統合で大幅なコンテキスト圧縮と性能向上を達成。QwenLong-CPRSは新たなSOTA性能を確立しました。 Comment
元ポスト:
[Paper Note] QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning, Fanqi Wan+, arXiv'25, 2025.05
Paper/Blog Link My Issue
#NLP #LanguageModel #LongContext #read-later Issue Date: 2025-05-27 GPT Summary- 長いコンテキストの推論におけるLRMsの課題を解決するため、QwenLong-L1フレームワークを提案。ウォームアップ監視付きファインチューニングとカリキュラム指導型段階的RLを用いてポリシーの安定化を図り、難易度認識型の回顧的サンプリングで探索を促進。実験では、QwenLong-L1-32Bが他のLRMsを上回り、優れた性能を示した。 Comment
元ポスト:
[Paper Note] Phi-4-reasoning Technical Report, Marah Abdin+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Reasoning #SmallModel #GRPO #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2025-05-01 GPT Summary- 140億パラメータの推論モデルPhi-4-reasoningは、慎重に選ばれた「teachable」プロンプトセットと監視付きファインチューニングを通じて訓練され、詳細な推論チェーンを生成します。そのバリエーションであるPhi-4-reasoning-plusは、短期間の強化学習を経て、より長い推論トレースを生成し高性能を実現。これらのモデルは、DeepSeek-R1-Distill-Llama-70Bモデルを超え、完全版DeepSeek-R1に近い性能を示します。評価は数学的・科学的推論や一般目的のベンチマークを含み、データ精選の利点と強化学習の影響を示唆しています。 Comment
元ポスト:
こちらの解説が非常によくまとまっている:
が、元ポストでもテクニカルペーパー中でもo3-miniのreasoning traceをSFTに利用してCoTの能力を強化した旨が記述されているが、これはOpenAIの利用規約に違反しているのでは…?
[Paper Note] UI-TARS: Pioneering Automated GUI Interaction with Native Agents, Yujia Qin+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #NLP #AIAgents #MultiModal #Blog #Reasoning #ComputerUse #VisionLanguageModel #2D (Image) #One-Line Notes #text Issue Date: 2025-04-18 GPT Summary- UI-TARSは、スクリーンショットを入力として人間のような操作を行うエンドツーエンドのGUIエージェントモデルである。従来の商用モデルに依存せず、知覚、グラウンディング、GUIタスク実行において最先端の性能を発揮。OSWorldベンチマークでは、UI-TARSが高スコアを達成し、他のモデルを上回る。主要な革新には、強化された知覚、統一されたアクションモデリング、System-2推論、反省的オンライン・トレースによる反復的トレーニングが含まれる。これにより、UI-TARSは未知の状況にも適応可能な学習能力を持つ。GUIエージェントの進化経路も分析し、今後の発展を探る。 Comment
色々と書いてあるが、ざっくり言うとByteDanceによる、ImageとTextをinputとして受け取り、TextをoutputするマルチモーダルLLMによるComputer Use Agent (CUA)
関連
- OpenAI API での Computer use の使い方, npaka, 2025.03
元ポスト:
[Paper Note] Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning, ByteDance Seed+, arXiv'25, 2025.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Reasoning #One-Line Notes #Initial Impression Notes Issue Date: 2025-04-12 GPT Summary- Seed1.5-Thinkingは、応答前に思考を経て推論する新しい手法で、AIME 2024で86.7、Codeforcesで55.0、GPQAで77.3といった性能を達成。非推論タスクでも優れた一般化能力を発揮し、DeepSeek R1を勝率で8%上回る。比較的小型の専門家の混成モデルで、200億の活性化パラメータと2000億の総パラメータを持つ。新たな内部ベンチマークBeyondAIMEとCodeforcesも公開予定。 Comment
DeepSeek-R1を多くのベンチで上回る200B, 20B activated paramのreasoning model
最近のテキストのOpenWeightLLMはAlibaba, DeepSeek, ByteDance, Nvidiaの4強という感じかな…?(そのうちOpenAIがオープンにするReasoning Modelも入ってきそう)。
[Paper Note] AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One, Mike Ranzinger+, CVPR'25
Paper/Blog Link My Issue
#ComputerVision #Transformer #FoundationModel #CVPR #One-Line Notes #Author Thread-Post Issue Date: 2025-04-11 GPT Summary- 視覚基盤モデル(VFM)をマルチティーチャー蒸留を通じて統合するアプローチAM-RADIOを提案。これにより、ゼロショットの視覚-言語理解やピクセルレベルの理解を向上させ、個々のモデルの性能を超える。新しいアーキテクチャE-RADIOは、ティーチャーモデルよりも少なくとも7倍速い。包括的なベンチマークで様々な下流タスクを評価。 Comment
元ポスト:
vision系のfoundation modelはそれぞれ異なる目的関数で訓練されてきており(CLIPは対照学習 Learning Transferable Visual Models From Natural Language Supervision, Radford+, OpenAI, ICML'21
, DINOv2は自己教師あり学習 [Paper Note] DINOv2: Learning Robust Visual Features without Supervision, Maxime Oquab+, TMLR'24
, SAMはsegmentation [Paper Note] Segment Anything, Alexander Kirillov+, arXiv'23, 2023.04
)それぞれ別の能力を持ってたが、それらを一個のモデルに蒸留しました、という話らしい
lossの文脈でいうと、SigLIPも広義の対照学習の一種である。
- [Paper Note] Sigmoid Loss for Language Image Pre-Training, Xiaohua Zhai+, ICCV'23
[Paper Note] Qwen2.5-Omni Technical Report, Jin Xu+, arXiv'25, 2025.03
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Speech #2D (Image) #3D (Video) #Omni #One-Line Notes #Reference Collection #audio #text Issue Date: 2025-03-31 GPT Summary- Qwen2.5-Omniは、テキスト、画像、音声、映像を同時に認識し、自然な音声応答をストリーミング生成するエンドツーエンドのマルチモーダルモデルです。音声と映像の同期には新しい位置埋め込み手法TMRoPEを導入し、Thinker-Talkerアーキテクチャにより干渉を避けつつ同時生成を実現。ストリーミング音声トークンのデコードにはスライディングウィンドウDiTを用いて初期遅延を削減。Qwen2.5-Omniは、マルチモーダルベンチマークで最先端の性能を示し、音声生成の自然さにおいて既存手段を上回ります。 Comment
Qwen TeamによるマルチモーダルLLM。テキスト、画像、動画音声をinputとして受け取り、テキスト、音声をoutputする。
weight:
https://huggingface.co/collections/Qwen/qwen25-omni-67de1e5f0f9464dc6314b36e
[Paper Note] Tulu 3: Pushing Frontiers in Open Language Model Post-Training, Nathan Lambert+, COLM'25, 2024.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #OpenSource #COLM #DPO #PostTraining #read-later #RLVR #Selected Papers/Blogs Issue Date: 2025-02-01 GPT Summary- Tulu 3は、オープンなポストトレーニングモデルのファミリーで、トレーニングデータやレシピを公開し、現代のポストトレーニング技術のガイドを提供します。Llama 3.1を基にし、他のクローズドモデルを上回る性能を達成。新しいトレーニング手法としてSFT、DPO、RLVRを採用し、マルチタスク評価スキームを導入。モデルウェイトやデモ、トレーニングコード、データセットなどを公開し、他のドメインへの適応も可能です。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=i1uGbfHHpH#discussion
[Paper Note] Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling, Xiaokang Chen+, arXiv'25, 2025.01
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #TextToImageGeneration #VisionLanguageModel #2D (Image) #UMM #One-Line Notes #ImageSynthesis Issue Date: 2025-01-28 GPT Summary- Janus-Proは、最適化されたトレーニング戦略、拡張されたデータ、より大きなモデルサイズを取り入れたJanusの進化形。これにより、マルチモーダル理解と画像生成の安定性において顕著な進歩を実現。研究成果は公開されており、さらなる探究を促すことが期待される。 Comment
DeepSeekによる新たなUMM、Janus-Proが本日リリース。MIT License
Janus-Proのパフォーマンス。
github上でのパフォーマンスの図解から引用。マルチモーダル(テキスト+画像)の理解に関するベンチマークでLLaVA超え。GenEval, DPG Benchと呼ばれる画像生成ベンチマークでDALL-E 3超え。
テクニカルレポート中での詳細から引用。どのベンチマークでも基本的に最高性能なように見える。
テクニカルレポート:
https://github.com/deepseek-ai/Janus/blob/main/janus_pro_tech_report.pdf
ベンチマーク:
- [Paper Note] GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment, Dhruba Ghosh+, NeurIPS'23
- [Paper Note] ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment, Xiwei Hu+, arXiv'24
Llama-3.1-Nemotron-70B-Instruct, Nvidia, (ICLR'25), 2024.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Alignment #ICLR #One-Line Notes Issue Date: 2024-10-17 GPT Summary- 報酬モデルの訓練にはBradley-Terryスタイルと回帰スタイルがあり、データの一致が重要だが、適切なデータセットが不足している。HelpSteer2データセットでは、Bradley-Terry訓練用の好みの注釈を公開し、初めて両モデルの直接比較を行った。これに基づき、両者を組み合わせた新アプローチを提案し、Llama-3.1-70B-InstructモデルがRewardBenchで94.1のスコアを達成。さらに、REINFORCEアルゴリズムを用いて指示モデルを調整し、Arena Hardで85.0を記録した。このデータセットはオープンソースとして公開されている。 Comment
MTBench, Arena HardでGPT4o-20240513,Claude-3.5-sonnet-20240620をoutperform。Response lengthの平均が長いこと模様
openreview: https://openreview.net/forum?id=MnfHxPP5gs
[Paper Note] LLM360: Towards Fully Transparent Open-Source LLMs, Zhengzhong Liu+, COLM'24, 2023.12
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenSource #COLM Issue Date: 2026-03-31 GPT Summary- LLMの透明性向上のため、LLM360を提唱し、訓練コードやデータ、チェックポイントを完全オープンソース化。これにより誰でも再現可能な設計を促進し、AI研究の協力を支援。7BパラメータのモデルAmberとCrystalCoderを公開し、将来的にさらに強力なモデルも計画中。 Comment
blog: https://www.llm360.ai
- Crystal:
https://huggingface.co/collections/LLM360/crystal
- Amber:
https://huggingface.co/collections/LLM360/amber
- code:
https://github.com/LLM360
[Paper Note] Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model, Ahmet Üstün+, arXiv'24, 2024.02
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiLingual #Initial Impression Notes Issue Date: 2026-03-31 GPT Summary- Ayaは、101言語に対応する生成型多言語モデルで、50%以上が低資源言語。大半のタスクでmT0およびBLOOMZを上回り、取り扱える言語数が2倍に。99言語にわたる新評価スイートを導入し、識別・生成タスクや人間評価を含む。ファインチューニングや安全性についても調査し、モデルとデータセットをオープンソースとして公開。 Comment
blog: https://cohere.com/research/papers/aya-model-paper-2024-02-13
データは公開されているが、おそらくソースコードは公開されていない
[Paper Note] TinyLlama: An Open-Source Small Language Model, Peiyuan Zhang+, arXiv'24, 2024.01
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #SmallModel #OpenSource Issue Date: 2026-03-31 GPT Summary- TinyLlamaは、1.1Bパラメータのコンパクトな言語モデルで、約1兆トークンを用いて事前学習されている。Llama 2のアーキテクチャを基に、FlashAttentionやLit-GPTなどの進歩を活用し、計算効率を向上させている。小さいサイズにもかかわらず、TinyLlamaは下流タスクで顕著な性能を発揮し、同等のオープンソースモデルを大きく上回る。モデルのチェックポイントとコードはGitHubで公開されている。 Comment
日本語解説: https://qiita.com/sergicalsix/items/7cd7665ab90b9f3b343c
[Paper Note] Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting, Melanie Sclar+, ICLR'24, 2023.10
Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Prompting #Evaluation #ICLR #Selected Papers/Blogs Issue Date: 2026-01-21 GPT Summary- LLMの性能特性化が重要であり、プロンプト設計がモデル挙動に強く影響することを示す。特に、プロンプトフォーマットに対するLLMの感度に注目し、微妙な変更で最大76ポイントの性能差が見られる。感度はモデルサイズや少数ショットの数に依存せず、プロンプトの多様なフォーマットにわたる性能範囲の報告が必要。モデル間のフォーマットパフォーマンスが弱く相関することから、固定されたプロンプトフォーマットでの比較の妥当性が疑問視される。迅速なフォーマット評価のための「FormatSpread」アルゴリズムを提案し、摂動の影響や内部表現も探る。 Comment
openreview: https://openreview.net/forum?id=RIu5lyNXjT
[Paper Note] Aria: An Open Multimodal Native Mixture-of-Experts Model, Dongxu Li+, arXiv'24, 2024.10
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #MultiModal #MoE(Mixture-of-Experts) #VisionLanguageModel Issue Date: 2025-10-07 GPT Summary- Ariaは、オープンなマルチモーダルネイティブAIモデルであり、視覚とテキストのタスクにおいて高い性能を発揮します。3.9Bの視覚トークンと3.5Bのテキストトークンを持つエキスパートの混合モデルで、既存のプロプライエタリモデルを上回ります。言語理解やマルチモーダル理解を強化する4段階のパイプラインで事前トレーニングされ、モデルウェイトとコードベースはオープンソースとして提供されます。 Comment
元ポスト:
HF: https://huggingface.co/rhymes-ai/Aria
提案された当時2024年10月時点で、VisionとText Understanding双方でに強い初めてのモデルで、初のマルチモーダルMoEモデルで(当時まだ話題になっていなかったDeepSeek-V2アーキテクチャを採用)、LongVideoのUnderstanidinpで当時の最高性能であったとのこと。
[Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#NLP #LanguageModel #Selected Papers/Blogs #One-Line Notes #Reference Collection Issue Date: 2024-12-28 GPT Summary- DeepSeek-V3は671Bのパラメータを持つMixture-of-Experts (MoE)言語モデルで、各トークンに対して37Bが活性化される。効率的な推論とコスト削減のため、MLAおよびDeepSeekMoEアーキテクチャを採用し、補助損失を用いない戦略を導入。14.8兆トークンでプレトレーニング後、ファインチューニングと強化学習を経て、高性能を発揮。評価結果はオープンソースモデルを上回り、先端的なクローズドソースモデルとも同等。訓練にはわずか2,788,000時間のH800 GPU時間を要し、安定した訓練プロセスを実現。モデルのチェックポイントは提供されている。 Comment
参考(モデルの図解):
参考:
MLA(Multi-Head Latent Attention)を提案
解説:
- MHA vs MQA vs GQA vs MLA, Zain ul Abideen, 2024.07
- DeepSeek-V2のアーキテクチャを徹底解説:MLA と DeepSeekMoE, kernelian, 2024.05
MLAはKVを低ランクなlatentベクトルに圧縮して保持し、使う時に復元するといった操作をすることで、MHAのパフォーマンスを落とすことなくKV Cacheで利用するメモリを大幅に減らせるという手法。
MLAの図解:
[Paper Note] Phi-4 Technical Report, Marah Abdin+, arXiv'24, 2024.12
Paper/Blog Link My Issue
#NLP #LanguageModel #SmallModel #One-Line Notes Issue Date: 2024-12-15 GPT Summary- phi-4は140億パラメータを持つ言語モデルで、合成データを戦略的に組み込んだトレーニングを実施。STEM分野に特化したQA能力で従来の教師モデルを超える性能を示し、サイズに対して強力な推論性能を達成。データ品質とトレーニング手法の革新が特徴。 Comment
現状Azureでのみ利用可能かも。Huggingfaceにアップロードされても非商用ライセンスになるという噂も
MITライセンス
HuggingFace:
https://huggingface.co/microsoft/phi-4
[Paper Note] Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent, Xingwu Sun+, arXiv'24, 2024.11
Paper/Blog Link My Issue
#NLP #LanguageModel #SyntheticData #MoE(Mixture-of-Experts) #One-Line Notes Issue Date: 2024-11-06 GPT Summary- Hunyuan-Largeは、3890億の総パラメータと256,000トークンに対応する混合エキスパートモデルで、言語理解や論理的推論など多様なタスクで卓越した性能を示す。また、従来のモデルを上回り、革新的な技術を採用している。コードとモデルは公開され、研究と応用の発展が期待される。 Comment
合計パラメータ数はLlama-3.1-405Bと同等の389Bだが、MoEによって52BのActive ParameterでSoTAを達成したTencentのOpenWeight LLM。大量のSynthetia Dataを利用している。
[Paper Note] Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models, Matt Deitke+, arXiv'24, 2024.09
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #OpenSource #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2024-09-27 GPT Summary- Molmoは、オープンな視覚・言語モデル(VLM)ファミリーを提案し、高性能なVLM構築に必要な基盤知識の欠如を解消する。PixMoという新しいデータセットを収集し、詳細な画像キャプション、自由形式画像Q&A、2Dポインティングデータを含む。72Bモデルは、オープンウェイトモデルの中で最高性能を示し、特にClaude 3.5 SonnetやGemini 1.5 Proなどの独自モデルよりも優れ、学術ベンチマークでGPT-4oに次ぐ第2位となった。モデルの重みやデータセットは公開中。 Comment
dataset, training code, inference, weight, recipe, 全てがオープンなVLM(OlmoのVLM版)。
以下がベンチマーク結果(VLMのベンチマーク)。11 benchmarksと書かれているのは、VLMのベンチマークである点に注意。
当時のVLMは全てプロプライエタリモデルであり、どのようにすればSoTA性能に到達できるかは不明であったが、Molmoによって明らかになった(と認識している)。
[Paper Note] LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs, LLM-jp+, arXiv'24, 2024.07
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Alignment #Evaluation #Safety #Japanese #OpenSource #mid-training #PostTraining #Selected Papers/Blogs #One-Line Notes #needs-revision Issue Date: 2024-07-10 GPT Summary- 日本語のLLMを開発するプロジェクト「LLM-jp」を紹介。1,500人以上が参加し、オープンソースの高性能モデルを目指す。設立背景、活動概要、および技術報告を示し、最新情報は公式サイトで確認可能。 Comment
llm.jpによるテクニカルレポート
[Paper Note] Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone, Marah Abdin+, arXiv'24, 2024.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #SmallModel #One-Line Notes Issue Date: 2024-04-23 GPT Summary- phi-3-miniは3.8十億パラメータの言語モデルで、3.3兆トークンを学習し、MMLUで69%、MT-benchで8.38を達成。スマートフォンでもデプロイ可能で、phi-2のデータセットをフィルタリングして作成。phi-3-smallとphi-3-mediumはそれぞれ75%、78%をMMLUで達成し、性能が向上。シリーズの新モデルphi-3.5-mini、phi-3.5-MoE、phi-3.5-Visionも導入。phi-3.5-MoEは優れた言語処理能力を発揮し、phi-3.5-Visionは複数画像とテキストのプロンプトに対応。 Comment
[Paper Note] Textbooks Are All You Need II: phi-1.5 technical report, Yuanzhi Li+, arXiv'23, 2023.09 の次の次(Phi2.0についてはメモってなかった)。スマホにデプロイできるレベルのサイズで、GPT3.5Turbo程度の性能を実現したらしい
Llama2と同じブロックを利用しているため、アーキテクチャはLlama2と共通。
[Paper Note] Gemma: Open Models Based on Gemini Research and Technology, Gemma Team+, arXiv'24, 2024.03
Paper/Blog Link My Issue
#NLP #LanguageModel #KeyPoint Notes Issue Date: 2024-04-08 GPT Summary- Gemmaは、軽量で最先端のオープンモデルで、言語理解や推論において強力な性能を発揮。2億および7億パラメータのモデルを提供し、事前学習済みとファインチューニング済みのチェックポイントを含む。Gemmaは、18のタスクのうち11で同サイズのオープンモデルを超え、安全性に関する詳細な評価とモデル開発の説明を提供。責任あるLLMのリリースが安全性向上に寄与し、次世代の革新を促進すると信じている。 Comment
アーキテクチャはTransformer Decoderを利用。モデルのサイズは2Bと7B。
オリジナルのTransformer Decoderアーキテクチャから、下記改善を実施している:
- Multi Query Attention [Paper Note] Fast Transformer Decoding: One Write-Head is All You Need, Noam Shazeer, arXiv'19, 2019.11
を利用
- RoPE Embedding [Paper Note] RoFormer: Enhanced Transformer with Rotary Position Embedding, Jianlin Su+, arXiv'21, 2021.04
を利用
- GeGLU [Paper Note] GLU Variants Improve Transformer, Noam Shazeer, arXiv'20, 2020.02
の利用
- RMSNormの利用(学習を安定させるため; LLaMAと同様)
Mistral Mistral 7B, Albert Q. Jiang+, N/A, arXiv'23
よりも高い性能を示している:
[Paper Note] OLMo: Accelerating the Science of Language Models, Dirk Groeneveld+, arXiv'24, 2024.02
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2024-03-05 GPT Summary- OLMoは、市場での商業的重要性が高まる中、真にオープンな言語モデルを提供することでNLP研究の進展を目指す。従来のモデルが重みや推論コードのみを公開するのに対し、OLMoはトレーニングデータや評価コードも含めて公開し、科学的研究の基盤を確立することで、オープンな研究コミュニティの力を引き出し、新たなイノベーションを促進することを期待している。 Comment
Model Weightsを公開するだけでなく、training/evaluation codeとそのデータも公開する真にOpenな言語モデル(truly Open Language Model)。AllenAI
[Paper Note] Mixtral of Experts, Albert Q. Jiang+, arXiv'24, 2024.01
Paper/Blog Link My Issue
#NLP #LanguageModel #MoE(Mixture-of-Experts) #One-Line Notes Issue Date: 2024-01-09 GPT Summary- Mixtral 8x7Bは、8つのエキスパートを持つスパース・ミクスチャー・オブ・エキスパーツモデルで、470億パラメータにアクセスしつつ、推論時は130億パラメータのみが活性化される。32kトークンの文脈長で訓練され、Llama 2 70BおよびGPT-3.5を上回る性能を発揮。特に数学やコード生成で優れ、指示に従うよう微調整したモデルも提供され、複数の人間ベンチマークで競合モデルを超えた。 Comment
Mixture of experts Layer: inputを受け取ったrouterが、8つのexpertsのうち2つを選択し順伝搬。2つのexpertsのoutputを加重平均することで最終的なoutputとする。
Improved Baselines with Visual Instruction Tuning, Haotian Liu+, N_A, CVPR'24
Paper/Blog Link My Issue
#ComputerVision #NLP #LanguageModel #QuestionAnswering #CVPR #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2023-10-09 GPT Summary- LLaVAは、ビジョンと言語のクロスモーダルコネクタであり、データ効率が高く強力な性能を持つことが示されています。CLIP-ViT-L-336pxを使用し、学術タスク指向のVQAデータを追加することで、11のベンチマークで最先端のベースラインを確立しました。13Bのチェックポイントはわずか120万の公開データを使用し、1日で完全なトレーニングを終えます。コードとモデルは公開されます。 Comment
画像分析が可能なオープンソースLLMとのこと。
# Overview
画像生成をできるわけではなく、inputとして画像を扱えるのみ。
pj page: https://llava-vl.github.io
[Paper Note] Scaling Instruction-Finetuned Language Models, Hyung Won Chung+, JMLR'24, 2022.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #InstructionTuning #Selected Papers/Blogs #One-Line Notes #Scalability #JMLR Issue Date: 2023-04-26 GPT Summary- 指示に基づくファインチューニングは、言語モデルの性能と一般化を向上させる。特に、タスク数やモデルサイズのスケーリング、チェーン・オブ・思考データでの適用が効果的。Flan‑PaLM 540Bは1,800件のタスクでファインチューニングを行い、PaLM 540Bを平均+9.4%上回り、最先端の結果を出している。Flan‑T5も強力なFew-shot性能を示し、指示に基づくファインチューニングがモデルの性能向上に寄与することを確認した。 Comment
T5をinstruction tuningしたFlanT5の研究
HF: https://huggingface.co/docs/transformers/model_doc/flan-t5
先行研究:
- [Paper Note] Finetuned Language Models Are Zero-Shot Learners, Jason Wei+, ICLR'22, 2021.09
[Paper Note] LLaMA: Open and Efficient Foundation Language Models, Hugo Touvron+, arXiv'23, 2023.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel Issue Date: 2026-03-31 GPT Summary- LLaMAは、7Bから65Bパラメータまでの基盤言語モデルのコレクションを提供し、数兆のトークンを使用して訓練されました。公開可能なデータセットのみを用いて最先端モデルを実現し、特にLLaMA-13Bは多くのベンチマークでGPT-3を上回り、LLaMA-65BはChinchillaやPaLMと競争力を持つ。全てのモデルは研究コミュニティに公開されます。 Comment
初代LLaMAをメモっていなかったようなのでメモ
LLaMA series:
- [Paper Note] Llama 2: Open Foundation and Fine-Tuned Chat Models, Hugo Touvron+, arXiv'23, 2023.07
- LLaMA3, Meta, 2024.04
- Llama 3.1, 2024.07
- Llama 3.2: Revolutionizing edge AI and vision with open, customizable models, Meta, 2024.09
- Llama 4 Series, Meta, 2025.04
Llama 3.3もメモっていないようだ
[Paper Note] Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, Stella Biderman+, arXiv'23, 2023.04
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-29 GPT Summary- Pythiaは、異なるスケールの16のLLMを対象にしたモデルセットで、トレーニングの進化や発展を探求する。154のチェックポイントを公開し、訓練データローダーの再構築ツールも提供する。記憶化、新規結果、few-shot性能への語頻度の影響、ジェンダーバイアスの低減を含むケーススタディを通じて、LLMsの訓練ダイナミクスに関する新たな洞察を提示する。モデルや分析コードは公開されている。 Comment
github: https://github.com/EleutherAI/pythia
pythiaもメモっていなかった。70M--12Bモデルまでの16個のLLM群で、全てのモデルが同じ順序で学習され、かつ中間チェックポイントも公開。
[Paper Note] PaLI-3 Vision Language Models: Smaller, Faster, Stronger, Xi Chen+, arXiv'23, 2023.10
Paper/Blog Link My Issue
#ComputerVision #NLP #MultiModal #VisionLanguageModel #One-Line Notes Issue Date: 2025-04-11 GPT Summary- PaLI-3は、10倍の規模のモデルに匹敵する、より小型で高速なビジョン・ランゲージモデル(VLM)です。SigLIPによって事前学習されたPaLIは、画像分類ベンチマークではわずかに劣るものの、マルチモーダルベンチマークでは優れた性能を発揮。20億パラメータのSigLIP画像エンコーダを用いて多言語間のクロスモーダル検索で新たな最先端を達成し、50億パラメータで複雑なVLMの研究を促進することが期待されています。 Comment
OpenReview:
https://openreview.net/forum?id=JpyWPfzu0b
実験的に素晴らしい性能が実現されていることは認められつつも
- 比較対象がSigLIPのみでより広範な比較実験と分析が必要なこと
- BackboneモデルをContrastive Learningすること自体の有用性は既に知られており、新規性に乏しいこと
としてICLR'24にRejectされている
Mistral 7B, Albert Q. Jiang+, N_A, arXiv'23
Paper/Blog Link My Issue
#NLP #LanguageModel #KeyPoint Notes Issue Date: 2024-05-24 GPT Summary- Mistral 7B v0.1は、70億パラメータの言語モデルであり、高速な推論のためにGQAを活用し、SWAを組み合わせている。また、Mistral 7B -- InstructはLlama 2 13B -- Chatモデルを上回っており、Apache 2.0ライセンスの下で公開されています。 Comment
Mistral Large
Mixtral-8x22B-v0.1, 2024
などのモデルも参照のこと
モデルのスケールが大きくなると、inferenceのlatencyが遅くなり、計算コストが大きくなりすぎて実用的でないので、小さいパラメータで素早いinference実現したいよね、というモチベーション。
そのために、SlidingWindowAttentionとGroupQueryAttention [Paper Note] GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, Joshua Ainslie+, arXiv'23, 2023.05
を活用している。
より小さいパラメータ数でLlama2を様々なタスクでoutperformし
Instruction Tuningを実施したモデルは、13BモデルよりもChatbotArenaで高いElo Rateを獲得した。
コンテキスト長は8192
[Paper Note] Orca 2: Teaching Small Language Models How to Reason, Arindam Mitra+, arXiv'23, 2023.11
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Chain-of-Thought #SmallModel #Reading Reflections Issue Date: 2023-11-21 GPT Summary- Orca 2 は小型 LM の推論能力を高めるために、異なるタスクごとに様々な解法戦略を学習させることを目指す。段階的推論や思い出し-推論-生成などを用いて、小型モデルの潜在能力を最大化し、約100のタスクで評価を行い、同規模モデルを大きく上回る性能を達成。重みは公開され、開発研究の支援が期待される。 Comment
ポイント解説:
HF: https://huggingface.co/microsoft/Orca-2-13b
論文を読むとChatGPTのデータを学習に利用しているが、現在は競合となるモデルを作ることは規約で禁止されているので注意
[Paper Note] Llama 2: Open Foundation and Fine-Tuned Chat Models, Hugo Touvron+, arXiv'23, 2023.07
Paper/Blog Link My Issue
#NLP #LanguageModel #FoundationModel #KeyPoint Notes Issue Date: 2023-07-22 GPT Summary- Llama 2という7億から700億パラメータの範囲の大規模言語モデルを開発・公開。対話に最適化されたファインチューニング済みモデルLlama 2-Chatは、多くのベンチマークでオープンソースモデルを上回り、人間による評価でもクローズドソースモデルの代替となる可能性を示す。ファインチューニングと安全性向上のアプローチを詳細に説明し、コミュニティへの貢献を促進。 Comment
参考:
Llama, およびLlama2では、一般的なTransformer Decoderとは異なり、linear layerの”前に”RMSPropをかませている点が異なる。
また、Llama2では、Llamaと比較して
- Group Query Attentionの利用 [Paper Note] GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, Joshua Ainslie+, arXiv'23, 2023.05
- 活性化関数として、ReLUではなく、SwiGLU [Paper Note] GLU Variants Improve Transformer, Noam Shazeer, arXiv'20, 2020.02
の活用
- Positional Embeddingとして、RoPE [Paper Note] RoFormer: Enhanced Transformer with Rotary Position Embedding, Jianlin Su+, arXiv'21, 2021.04
の活用
- より長いContext Windowsでの学習(4k)
を実施している。
出典:
https://cameronrwolfe.substack.com/p/llama-2-from-the-ground-up
[Paper Note] PMC-LLaMA: Towards Building Open-source Language Models for Medicine, Chaoyi Wu+, arXiv'23, 2023.04
Paper/Blog Link My Issue
#NLP #LanguageModel #Supervised-FineTuning (SFT) #Medical #KeyPoint Notes Issue Date: 2023-05-01 GPT Summary- 医療向けに特化したオープンソース言語モデルPMC-LLaMAを構築。一般目的の基盤モデルを医療ドメインに適応させ、4.8百万件の生物医学論文と3万冊の医療教科書から知識を注入。指示チューニング用の大規模データセットも提供し、徹底したアブレーション研究でその有効性を確認。130億パラメータの軽量版PMCLLaMAは複数の医療質問応答ベンチマークで高い性能を示し、ChatGPTを凌駕する場面も確認。 Comment
LLaMAを4.8Mのmedical paperでfinetuningし、医療ドメインの能力を向上。このモデルはPMC-LLaMAと呼ばれ、biomedicalQAタスクで、高い性能を達成した。
GPT-4を利用した異なるモデル間の出力の比較も行なっている模様
[Paper Note] GPT-NeoX-20B: An Open-Source Autoregressive Language Model, Sid Black+, arXiv'22, 2022.04
Paper/Blog Link My Issue
#NLP #LanguageModel #OpenSource #Selected Papers/Blogs Issue Date: 2026-03-31 GPT Summary- GPT-NeoX-20Bは、200億パラメータを持つ自己回帰型言語モデルで、Pileで訓練され、寛容なライセンスの下で重みが一般公開される。言語理解や数学、知識ベースのタスクで高い性能を持ち、特に5ショット評価時に同規模のモデルより優れた結果を示す。訓練および評価コード、モデルの重みはオープンソースで提供される。 Comment
[Paper Note] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model, BigScience Workshop+, arXiv'22, 2022.11
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-03-31 GPT Summary- 大規模言語モデル(LLMs)を使い、新しいタスクを少ないデモや指示で実行可能にしたBLOOMを紹介。これは1760億パラメータのオープンアクセス言語モデルで、46の自然言語と13のプログラミング言語をカバー。競争力のある性能を発揮し、マルチタスクのファインチューニングを通じてさらに向上。モデルとコードは責任あるAIライセンスで公開し、今後の研究と応用の促進を目指す。 Comment
HF: https://huggingface.co/bigscience/bloom
透明性を持ったLLMを構築し民主化を図る方向性のパイオニア的研究
Introducing Aikido Altar: the model that makes sovereign security intelligence possible, aikido, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Pruning #Quantization #Blog #Security #Author Thread-Post Issue Date: 2026-10-02 Comment
元ポスト:
Introducing Clef: our open-source decision models, and new RL fine-tuning platform, Cloudflare, 2026.10
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #NLP #LanguageModel #MultiModal #Blog #PEFT(Adaptor/LoRA) #Selected Papers/Blogs #Encoder #KeyPoint Notes #SystemOneModel Issue Date: 2026-10-02 Comment
元ポスト:
概要しかブログ中には書いていないが、よさげに見える。
Qwen-3.8-27Bをバックボーンとし、Qwenのパラメータはフリーズした上で軽量なアダプタを学習し、ルーティングヘッドなるcross-attentionに基づいた各選択肢のスコアを出力するヘッドによって予測が実施されるようである。
これらは、内部で作成された合成データを用いて事後学習されたとのことである。lossはlabel smoothed cross entropy(正解、不正解ラベルを0/1としてクロスエントロピーを計算するのではなく、ハイパーパラメータεでスムージングしてlossを計算するものらしい)とBrier Loss(実際に予測された確率値と正解、不正解を1/0としたときの平均二乗誤差)なるものによって、正則化によって過学習を防止し、出力される確率値がでたらめにならないように学習することを目指しているように見える。
その後RLCDと呼ばれる、選択肢間の順序関係に基づいて、正解と隣接するラベルにも部分的に報酬を与えるようなrewardを持つ(オリジナルのポリシーから分布が大きくシフトしないようなペナルティ付き)RLによって学習をしているようである。これにより、より高いAccuracyと汎化性能が得られた、と一言記述されている。
Qwenが持つVision Encoderによって画像もエンコードでき(Jevは画像は不可と述べられている)、
context長が64kとJevの2倍で
Jevよりもlatencyが良く、
様々なベンチマークスコアで高いスコアを獲得としている、と報告している。
latencyはflashモデルであれば、DiffusionGemma-as-Jevを上回る。
The current balance of power in open models: The expanded form of a testimony I prepared for Congress., Interconnects, Nathan Lambert, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #GenerativeAI #Blog #Proprietary #read-later Issue Date: 2026-09-28 Comment
元ポスト:
Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, Qwen Team, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #DiffusionModel #TextToImageGeneration #Blog #Editing #ImageSynthesis #Author Thread-Post Issue Date: 2026-09-27 Comment
HF: https://huggingface.co/Qwen/Qwen-Image-2.1
元ポスト:
GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making, Fastino Labs, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Blog #Encoder #Author Thread-Post #SystemOneModel Issue Date: 2026-09-25 Comment
元ポスト:
Jev-likeなモデル、乱立しすぎである
LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond, Liquid AI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Blog #VisionLanguageModel #SpeculativeDecoding Issue Date: 2026-09-25 Comment
元ポスト:
Contrastive Language Models: A System One Model for Fast and Generalizable Decision-Making, Kwok+, 2026.09
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #ContrastiveLearning #Blog #Scaling Laws #mid-training #PostTraining #Selected Papers/Blogs #Encoder #Author Thread-Post #SystemOneModel Issue Date: 2026-09-24 Comment
元ポスト:
HF: https://huggingface.co/Contrastive-LM
非常にコンパクトにまとまっていて大変読みやすかった。あとでまとめる。
HyperFlow, VideoRebirth, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #Distillation #VideoGeneration/Understandings #SelfDistillation #autoresearch/RSI #Author Thread-Post Issue Date: 2026-09-23 Comment
元ポスト:
所見:
Rigel Base: Reaching Llama-3.2 Quality with <1% of its Compute, Mayank+, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #NLP #LanguageModel #Blog #SSM (StateSpaceModel) #read-later #DataMixture #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-23 Comment
NoPEやuPを利用、事前学習では6つのフェースで異なるDataMixtureを利用しそのレシピも記載
Ming-Image-0.1-{Design, Design-Layer}, inclusionAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #TextToImageGeneration #ImageSynthesis #AgentSkills #Author Thread-Post #Design #ImageToLayer #ImageToPPT Issue Date: 2026-09-23 Comment
元ポスト:
Step 5 Preview: Advancing the Pareto Frontier, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
StepFunのフラグシップモデルで、Fable 5, GPT-5.6-luna, GLM-5.3、Kimi-K3と並びAAの評価においてパレート最適に位置する。
600B-A27B, 1M contextのVLM, 10/15にOpenWeight化されるとのこと。
decider-2b, Mapika, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #reading #One-Line Notes #Reading Reflections #SystemOneModel Issue Date: 2026-09-20 Comment
元ポスト:
こちらはJev系のモデルを謳うものと比較して、Qwenをベースにしており、かつ広範なタスクで評価がされているため、ある程度のzeroshotでの汎用モデルとは言えそうである。が、結局のところどこまで汎用的に使えるかはよくわからない。
関連:
- Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
cua-s1-forms, cua-ai, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #Transformer #SyntheticData #ComputerUse #Encoder #One-Line Notes #Author Thread-Post Issue Date: 2026-09-19 Comment
github:
https://github.com/trycua/cua/tree/main/libs/cua-s1
dataset:
https://huggingface.co/datasets/cua-ai/cua-s1-forms
元ポスト:
フォーム入力に特化したCUAを実施できるモデルのようで、これもいわゆるSystem One Modelとして紹介されている。Transformer Encoderをバックボーンとする。
まあしかしこれは言ってしまえばただの合成データでFinetuningをしたBERTに見える。Jevのような様々なタスクに対してzero-shotの汎化をしめすものではないであろう点に注意。Jevがどれだけ汎用なのかはわからんが...
laya, convaiinnovations, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #Encoder #One-Line Notes #Reading Reflections Issue Date: 2026-09-19 Comment
元ポスト:
state (email, text, ticket, あるいはJSON)を与え、質問のタイプとinstruction(choice, score, noul)を与えると、質問に対応する出力を得られるModernBERTベースのモデル。questionあたり512トークンまで扱えるようである(state, question, optionの合計で512トークン)。RLCDと呼ばれるポリシーがdistributionを出力する手法で学習され、この手法はhonest probabilityを出力することで機体報酬が最大化されるとの記載がある。100+言語に対応。
emailのサンプル例は、ユーザからの問い合わせに対して、担当部署(choice)、緊急度(score)、解約の確率(noul)を出力する例となっている。
関連:
- Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
これ系の話がいきなり増えてきた。マルチリンガルでモデルがオープンなのはありがたや。
最初読んだ時は様々なタスクやドメインに利用できるのかなと思ったが、emailドメインにしか適用できないのでは?zero-shotで汎用的に利用できないのであれば、それはただのFinetuningされたBERTである。
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Quantization #Blog #ComputerUse #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-2
関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。
North-Small-Translate-1.0, Cohere, 2026.09
Paper/Blog Link My Issue
#Article #MachineTranslation #NLP #LanguageModel #Blog #Author Thread-Post Issue Date: 2026-09-11 Comment
元ポスト:
DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #read-later #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Author Thread-Post #Decoder-Decoder Issue Date: 2026-09-10 Comment
元ポスト:
所見:
え?もしかしてEncoder-Decoder???
Causal Encoder-Decoderという名称なので、seq2seqのようなBidirectionalなエンコーダを用いたものではなく、
エンコーダー、デコーダー共にautoregressiveモデルだが、エンコード用途とデコード用途でアーキテクチャやactivation paramなどに違いを持たせた、という感じだろうか。
デコーダ-デコーダアーキテクチャと呼ぶらしい:
関連:
- [Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05
公式ポスト:
ベンチマークスコアはfrontierモデルに匹敵する
HBMの使用量はV4-Flashから1/4, SSD使用量は1/8
合成データはいまだに利用していない:
事後学習のデータ品質改善のROIがアルゴリズム改善のROIを上回る:
関連(こちらは事前学習だが):
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
解説:
Artificial Analysisによる評価:
とそれらに対する所見:
所見:
v4.1 flashをhostingするためのコードリポジトリがいくつか新たに公開されたようである:
所見:
Ling-3.0-flash-Fin, inclusionAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Financial #Author Thread-Post Issue Date: 2026-09-07 Comment
benchmark:
https://huggingface.co/datasets/inclusionAI/FinFIRST
technical report:
https://huggingface.co/datasets/inclusionAI/FinFIRST/blob/main/FinFIRST_paper.pdf
FinFIRSTの解説:
元ポスト:
LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #NLP #Dataset #Japanese #OpenSource #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes Issue Date: 2026-09-06 Comment
元ポスト:
モデル: https://huggingface.co/llm-jp/llm-jp-4-vl-9b
RefinedVision:
https://huggingface.co/datasets/llm-jp/RefinedVision
OpenSource AIの定義を満たすためにFineVisionデータセットを精査(e.g. GPT-4oの出力等は利用規約上問題がある)した上で修正(FineVisionは185サブセット, 24M VQAで構成されている)したとのこと。すごい。。。
ライセンス・利用規約上の問題を精査するだけでなく、品質(画像の品質、QAの品質)の観点でも精査の上修正しているようである。
関連:
- [Paper Note] FineVision: Open Data Is All You Need, Luis Wiedmann+, NeurIPS'26, 2025.09
TimesFM-3: A zero-shot foundation model for multivariate forecasting, Google Research, 2026.08
Paper/Blog Link My Issue
#Article #TimeSeriesDataProcessing #FoundationModel #Blog #Author Thread-Post Issue Date: 2026-09-06 Comment
元ポスト:
HF: https://huggingface.co/google/timesfm-3.0-pytorch
公式:
Hy4-preview, Tencent, 2026.08
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-09-05 Comment
blog: https://hy.tencent.com/research/hy4-preview
元ポスト:
公式:
Introducing K2 Horizon: Frontier Performance, Radically Open, Institute of Foundation Models, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #OpenSource #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-09-04 Comment
元ポスト:
所見:
HF: https://huggingface.co/collections/IFM/k2-horizon
GPT-5.6-luna級の性能を375B-A23Bで実現されているように見え、データ、レシピ、コード、重みが公開される。
GLM-5.3-Flash: Frontier Intelligence, Flash Cost, Z.AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
HF: https://huggingface.co/zai-org/GLM-5.3-Flash
320B-A18BでOpus 4.8相当のベンチマークスコアを達成
アーキテクチャ解説:
- KDA
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- DSA
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
- mHC
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
所見:
本ポストにある通り、中国系のOpenWeightモデルは
- linear attention
- sparse attention
- mHCのようなResidual Streamに対する工夫
- Muon
などを採用するのがデファクトとなっているように思われる。
所見:
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
ベンチマークスコアはOpus 4.6超え。パラメータは125B-A6B、51Bの N-gram Embeddings。Gated Delta Net layerとQwen Sparse Attention と呼ばれる Layerを3:1の比率で積み上げていっているようである。N-gram Embedding、MTPも導入されている。また、Gated Residualと呼ばれる技術により、Residual Streamからの読み込み/書き込みを制御している。
- 関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
HF:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
technical report:
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
解説:
所見:
Ling-3.0-flash-dspark, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
関連:
- Ling-3.0-flash, inclusionAI, 2026.08
- [Paper Note] DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, Xin Cheng+, arXiv'26, 2026.07
dots3-note Preview: A Small but Mighty Step Toward Long-Horizon Agency in Real Life, dots studio, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #Blog #VisionLanguageModel Issue Date: 2026-08-22 Comment
HF: https://huggingface.co/dots-studio/dots3-note-prev
元ポスト:
SenseNova-U1.5-8B-MoT, SenseNova, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #TextToImageGeneration #Editing #UMM #ImageSynthesis #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook, Liquid AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #SmallModel #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-08-22 Comment
HF:
https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-DSpark
他のLFM用のDraftモデルもある。
様々なLFM用のDraft Model
Ornith-1.5: From Self-Scaffolding to Self-Improvement, Ornith, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #SelfImprovement #reading Issue Date: 2026-08-20 Comment
HF: https://huggingface.co/collections/ornith-ai/ornith-15
元ポスト:
関連:
- Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06
モデルを学習するためのタスク生成、scaffolding(e.g.,ヒントなどのタスクを適切な難易度に調整する足場を作ること)生成、解答の生成(ロールアウト)それぞれをself-improvementさせながら学習されたモデルとのこと。
Audio8-TTS-Preview-0.1b, Audio8, 2026.08
Paper/Blog Link My Issue
#Article #TTS #Author Thread-Post Issue Date: 2026-08-20 Comment
元ポスト:
s1-mini, superwhisper, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel #Author Thread-Post Issue Date: 2026-08-20 Comment
元ポスト:
約332億パラメータのDense型LLM「LLM-jp-4 33B」モデルを公開, LLM-jp, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Japanese #OpenSource #Author Thread-Post Issue Date: 2026-08-19 Comment
元ポスト:
Qwen3.8, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-08-15 Comment
元ポスト:
ベンチマーク上はMuse Glimmer超え、Opus4.6相当
GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, Z.ai, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-08-15 Comment
GDPValでGPT-5.6-Sol, Fable5超え。ベンチマークスコアだけ見ると、フロンティアモデルにほぼ追いついたと言って良さそうに見える。残る砦はOpus 5
所見:
所見:
スケーリング則に関するLiterature、考察、GLM-5.3のその中での位置付けについて述べられている。ポスト中で言及されている Roberts et al. (2025)は以下
関連:
- [Paper Note] Compute Optimal Scaling of Skills: Knowledge vs Reasoning, Nicholas Roberts+, ACL'25 Findings, 2025.03
- Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07
weightが公開:
https://huggingface.co/zai-org/GLM-5.3
DeepSeek-V4-Pro-0813, DeepSeek AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
公式ポスト:
Meet North Micro Vision: A 2.4B Native-Resolution Vision-Language Model, Cohere, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #SmallModel #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-14 Comment
HF:
https://huggingface.co/CohereLabs/North-Micro-Vision-Instruct
Apache 2.0
元ポスト:
LTX-2.5, Lightricks, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #DiffusionModel #VideoGeneration/Understandings #TextToVideoGeneration #ImageToVideoGeneration #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4, Nvidia, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #SSM (StateSpaceModel) #LinearAttention #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
Ling-3.0-tiny, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #Author Thread-Post Issue Date: 2026-08-11 Comment
新たに学習段階の複数ステージでのベースモデルが公開:
Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device, Meta, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/meta-models/Muse-Glimmer-30B
Museシリーズから初のOpenWeightモデルがリリースされ、ライセンスはApache 2.0
所見:
Alexandr Wang氏によるポスト:
ザッカーバーグ氏によるポスト:
Muse Spark 1.2もオープンになるとのこと。
所見:
アーキテクチャ解説:
NVIDIA-Nemotron-Parse-2.0, Nvidia, 2026.08
Paper/Blog Link My Issue
#Article #OCR Issue Date: 2026-08-10 Comment
元ポスト:
[Paper Note] BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks, The BigBang Team, 2026.08
Paper/Blog Link My Issue
#Article #LanguageModel Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/endless-frontier/BigBang-v1
元ポスト:
NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use, Nvidia, 2026.08
Paper/Blog Link My Issue
#Article #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
公式:
Ling-3.0-flash, inclusionAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
- 124B-A5B
- 5:1の比率でKDAとMLAのhybrid attention
- 1/64のactivation ratio
2025年度GENIAC採択事業において収集・開発したロボット動作データセットおよびロボット基盤モデルを一般公開, AIRoA, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Dataset #Blog #Robotics #VisionLanguageActionModel #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-10 Comment
Dataset:
https://huggingface.co/datasets/airoa-org/airoa-moma-5k
HF:
https://huggingface.co/airoa-org/airoa-pi05-hsr-base
元ポスト:
MiniMax-H3, MiniMaxAI, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Transformer #TextToAudio #SpeechProcessing #VideoGeneration/Understandings #UMM #Omni #TextToVideoGeneration #Author Thread-Post Issue Date: 2026-08-09 Comment
元ポスト:
Video Arenaと呼ばれるベンチマーク (Image-to-Video, Image-to-Video) でOpenWeightモデルでSoTA、全体で2位:
Introducing Inkling-Small, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #VisionLanguageModel #UMM #One-Line Notes #Author Thread-Post Issue Date: 2026-08-09 Comment
HF: https://huggingface.co/thinkingmachines/Inkling-Small
関連:
- Inkling: Our open-weights model, THINKING MACHINES, 2026.07
- 276B-A12B
- NVFP4
- 小規模なモデルだが、Inklingと同等以上の性能を達成(ただし、一般的な知識や事実性に関してはInklingの方が上)
- 事前学習データのDataMixtureや学習レシピにいくつかの改良
- Inklingを教師モデルとしたOPD
- codingに特化したagentic RLをスケールアップ
元ポスト:
A.X K2 Raon-Speech: Introducing Korea’s First Independently Developed SpeechLM, KRAFTON AI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #SpeechProcessing #Speech #AudioLanguageModel #Korean Issue Date: 2026-08-06 Comment
元ポスト:
HF: https://huggingface.co/KRAFTON/A.X-K2-Raon-Speech-21B-A3B
A.X-K2, SK Telecom, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #DataMixture #Korean Issue Date: 2026-08-06 Comment
テクニカルレポート: https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf
- 8.2Tトークンで事前学習
- DataMixや学習ドメインの変遷などデータに関するレシピも記述されている(英語72.7%に対し、韓国語15.4%, コード8.3%, 日本語、スペイン語、中国語がそれぞれ約1%ずつ)
元ポスト:
LFM2.5-Encoders: Fast at Long Context, Even on CPU, Liquid AI, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #Selected Papers/Blogs #Encoder #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-06 Comment
元ポスト:
CPUでのinferenceにおいて、ModernBERTよりもlong context (8k付近)でのスループットが3.3倍高いEncoder。context長は8192。
HF: https://huggingface.co/LiquidAI/LFM2.5-Encoder-350M
日本語にも対応しているようだが、日本語ModernBertなどと比較して日本語でこのダウンストリームタスクの性能はどうなるだろうか
BTL-3, badtheorylabs, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #PEFT(Adaptor/LoRA) #SoftwareEngineering #One-Line Notes #ToolUse Issue Date: 2026-08-04 Comment
ポイント解説:
Qwen3.6-27Bに対してLoRAによってcoding, tool useに特化した事後学習を実施したモデルで、HFではアダプタが公開されている。
Introducing Antares: Highly Efficient Open Weight AI Models for Vulnerability Localization, Cisco Blogs, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Coding #SmallModel #SoftwareEngineering #One-Line Notes #Security #Author Thread-Post Issue Date: 2026-08-04 Comment
HF: https://huggingface.co/fdtn-ai/antares-1b
コードベースの脆弱性を検知することに特化したSLM
ポイント解説:
公式ポスト:
