ComputerVision (857) — 1/5
[Paper Note] Looped Diffusion Transformer, Yong Xien Chng+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #DiffusionModel #TextToImageGeneration #Architecture #RecurrentModels #ImageSynthesis Issue Date: 2026-10-02 GPT Summary- テキスト画像生成において、共有Transformerブロックをノイズ除去ステップ内で反復実行するLooped-DiTを提案。中間ループへの深い教師あり学習と自己調整型注意機構により、弱い教師信号と局所情報の損失を防ぐ。パラメータ数と計算量を抑えつつ、6.5倍大きいモデルを上回り、ノイズ除去ステップを増やすよりループを深くする方が効果的であることを示した。 Comment
元ポスト:
[Paper Note] How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining, Lin Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Pretraining #NLP #MultiModal #Scaling Laws #read-later #Selected Papers/Blogs #VisionLanguageModel #Backbone #UMM #Initial Impression Notes Issue Date: 2026-09-29 GPT Summary- エンコーダフリーMLLMとエンコーダベースMLLMのスケーリング則を比較。視覚エンコーダを除くと、マルチモーダル目的の計算量最適な配分は大規模モデル側へ移行するが、テキスト目的ではほぼ変化しない。小規模ではエンコーダフリーが劣るものの、約\(10^{22}\) FLOPsで追いつくと予測される。規模拡大に伴い、言語モデルが視覚処理を前段層や専門家ルーティングへ適応させ、事前学習済み視覚エンコーダの優位性が薄れることを示した。 Comment
元ポスト:
ざっくりいうと、モデルサイズを大きくでき、かつ事前学習の計算量を(今回のスケールに限っていうと)約6.1 x 10^21 FLOPs以上投入できるのであれば、Vision Encoderをコネクタで接続するタイプのVLMよりも、Encoder-freeのVLMの方がより良い損失値を得られる傾向にある、という感じだろうか。
[Paper Note] Reinforcement Learning for Real-Time Vision-Language-Action Policies, Perry Dong+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Architecture #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Realtime Issue Date: 2026-09-28 GPT Summary- 大規模VLAの推論遅延による古い観測と分布シフトに対し、RLでリアルタイムかつ信頼性の高いファインチューニングを実現。 Real-Time EXPO-FTでは、VLAが行動チャンクを提案し、軽量な編集方策が最新観測に基づいて行動を高速修正することで、表現力と反応性を両立。 Kinetixの全10環境で最高性能を達成し、4つの実世界タスクでも10分間のデータのみで平均性能を42%から97%へ向上。 Comment
元ポスト:
[Paper Note] 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code, Yipeng Gao+, NeurIPS'26, 2026.05
Paper/Blog Link My Issue
#NLP #Evaluation #NeurIPS #VisionLanguageModel #3D (Scene) #3D Object Generation Issue Date: 2026-09-26 GPT Summary- テキスト・画像参照から3Dモデリング用のプロシージャルコードを生成するVLMを、3DCodeBenchと3DCodeArenaで評価。 多くの失敗はAPI不一致に起因し、生成できても3D部品の未接続や浮遊が生じるが、思考予算の拡大や複数ターンの改良で性能が向上。 高品質なプロシージャルコードデータと、正確なフィードバックを可能にする実行環境の重要性を示した。 Comment
元ポスト:
pj page: https://www.3dcodebench.com/
[Paper Note] The PokeAgent Challenge: Competitive and Long-Context Learning at Scale, Seth Karten+, NeurIPS'26, 2026.03
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #Reasoning #NeurIPS #VisionLanguageModel #Game #LongHorizon #Author Thread-Post Issue Date: 2026-09-26 GPT Summary- ポケモンの対戦とRPG環境を用いて、部分観測・ゲーム理論的推論・長期計画を評価する大規模ベンチマーク「PokeAgent Challenge」を提案。 競技バトルでの戦略的推論・汎化を測るBattling Trackと、RPGの長期的計画を測るSpeedrunning Trackを提供し、20 million超の軌跡データ、heuristic・RL・LLMベースライン、再現可能なmulti-agent評価環境を整備。 100超のチームによる評価から、汎用LLM・RL・人間エキスパート間の性能差と、ポケモンバトルが標準LLMベンチマークとほぼ直交する未解決能力を示した。 Comment
元ポスト:
[Paper Note] Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation, Jintao Zhang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Proprietary #VideoGeneration/Understandings #Editing #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-15 GPT Summary- Vidu S2は、対話可能なデジタルキャラクターモデルVidu S2-Avatarと映像編集モデルVidu S2-Editingを統合したシステムです。これにより、リアルタイムで720pの映像生成やダンス指示の追従が可能になります。さらに、映像のスタイルレンダリングや衣装、キャラクター、背景の置換をリアルタイムで行う機能も搭載されており、従来のモデルを上回る性能を示しました。オンラインデモも提供されています。 Comment
元ポスト:
リアルタイムにインタラクションをし、アバターやシーンの編集が可能な動画生成モデルで、リアルタイムにVRゴーグルを通じたVR体験などにも応用できるようである。
[Paper Note] SenseNova-U1.5: Towards Native Unified Visual Intelligence, Haiwen Diao+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #MultiModal #TextToImageGeneration #Editing #UMM #ImageSynthesis #Pixel-based #Author Thread-Post Issue Date: 2026-09-14 GPT Summary- SenseNova-U1.5は、視覚コンテンツを理解・推論・生成する8B-MoT統合型マルチモーダルモデルをローンチ。エンコーダーやVAE不要で、最大4Kの解像度で空間的に整合性のあるパッチ再構成を実現。視覚美学や画像編集に特化したエキスパートを最適化し、指示遵守を向上。長く複雑な視覚指示にも対応し、知覚・推論・創造を行うエンドツーエンドシステムとしての可能性を示す。トレーニングコードはオープンソースで公開。 Comment
元ポスト:
関連:
- [Paper Note] Vision as Unified Multimodal Generation, Xiaoyang Han+, arXiv'26, 2026.07
- [Paper Note] SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture, Haiwen Diao+, arXiv'26, 2026.05
公式:
[Paper Note] A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications, Neel Mokaria+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #MultiModal #TMLR #VisionLanguageModel #Author Thread-Post Issue Date: 2026-09-14 GPT Summary- LLMの進展がエージェンシー研究を加速し、知覚や意思決定を調整するフレームワークを形成。LMMの登場により、多様なモダリティが統合され、現実世界への適用性が向上。しかし、モダリティがエージェンシーに与える影響は未検討。本調査では知覚・推論・計画・記憶・行動におけるマルチモーダリティの影響を分析し、テキスト中心からマルチモーダル・フレームワークへの進化を追跡。モダリティの統合方法を評価し、ロボティクスや動画理解の応用例を総説。エージェント設計における課題を明確にし、知的システムへの道筋を示す。 Comment
元ポスト:
[Paper Note] Visual General Intelligence: A White Paper, Hirokatsu Kataoka+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#GenerativeAI #FoundationModel #read-later Issue Date: 2026-09-07 GPT Summary- 視覚を中心に知性を再考し、視覚的経験がAGIへの道を開く可能性を探る。トランスフォーマーに基づくGPTシリーズの進展を踏まえ、視覚モダリティから生まれる知性の形を議論。多様な寄稿者が集まり、視覚的総合知能(VGI)の原理や他のモダリティとの関係を明確化することを目指す。 Comment
元ポスト:
[Paper Note] GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling, Guangting Zheng+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#TextToImageGeneration #VariationalAutoEncoder #read-later #ImageSynthesis Issue Date: 2026-09-07 GPT Summary- 潜在生成モデルは通常、VAEを用いた再構成と生成モデルの二段階訓練を行うが、両者の共同訓練が効果的である。一方で、エンドツーエンドの訓練は潜在崩壊を引き起こす可能性が高い。KLダイバージェンスのエントロピー項が崩壊防止に寄与する一方、再構成と生成は異なる学習ダイナミクスを持ち、非対称である。新たに提案するGenFirst戦略は、生成を先に行い、再構成を後回しにすることで潜在空間を効果的に形作る。これにより、SiTは画像生成で優れたパフォーマンスを示し、連続的なテキスト-画像生成へのフレームワーク拡張も実現した。これらの成果は、安定したエンドツーエンドの潜在学習手法の一般性を示している。 Comment
元ポスト:
[Paper Note] NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference, Aurélien Lac+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Embeddings #NLP #MultiModal #OpenWeight #Encoder #UMM #Author Thread-Post Issue Date: 2026-09-07 GPT Summary- NeoMMEは、260Mおよび800Mパラメータの双方向マルチモーダルエンコーダで、テキストと画像を統合的に処理。ゼロから事前学習し、ViDoRe v3ベンチマークで優れた性能を発揮。非対称量子化により、文書埋め込みを大幅に圧縮し、Hugging Face Transformersで公開。 Comment
元ポスト:
[Paper Note] SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models, Junchao Huang+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#Dataset #WorldModels #Author Thread-Post Issue Date: 2026-09-06 GPT Summary- SolarWMは、対話的なビデオ世界モデルを構築するためのオープンな基盤であり、データ準備から長期推論までをカバーします。異なるデータソースや動画生成モデルにおける一貫性のない監督信号の問題を解決するため、再構成可能なデータエンジンと適応フレームワークを提供。143万本の標準クリップをフレーム整合契約に変換し、視覚的情報やキャプションを網羅。4つのモデルを維持しつつ、双方向適応や分布整合蒸留を組み合わせたレシピを用いることで、リアルタイムの相互作用を実現。SolarWMは、対話型ワールドモデル研究のための再現可能で拡張可能な基盤を提供します。 Comment
pj page:
https://junchao-cs.github.io/SolarWM-Web/
data:
https://huggingface.co/datasets/junchaoh-cs/SolarWM-Data
[Paper Note] H3-World: Turning Language Understanding into World Control, Danze Chen+, arXiv'26, 2026.09
Paper/Blog Link My Issue
#NLP #PEFT(Adaptor/LoRA) #VideoGeneration/Understandings #WorldModels #interactive Issue Date: 2026-09-06 GPT Summary- H3-Worldは、33BパラメータのMiniMax-H3ビデオ生成モデルを対話型の世界モデルに変換するフレームワークであり、言語が自然な制御インターフェースとして機能することを示している。自然言語による指示を通じて、ゼロショットでキャラクターとカメラを制御できる。具体的には、アクションを構造化された指示として表現し、時間的に正確な制御を実現するための時間的注意ルーティングを導入。大規模なビデオ生成モデルから得た意味表現を再利用し、わずか0.199%の学習可能パラメータで効果的な制御を達成し、未知のシナリオにも一般化することができることを示している。 Comment
元ポスト:
[Paper Note] LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics, Lukas Kuhn+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Pretraining #read-later #Selected Papers/Blogs Issue Date: 2026-09-05 GPT Summary- LeVJEPAは崩壊ゼロで訓練された初の動画エンコーダであり、非対称性を排除した設計を持つ。グローバル視野とローカル視野に対する不変性損失で正則化され、事前学習コストを観測するトークン数に基づいて減少。単一のハイパーパラメータで簡素化され、計算量を5.6~20.8倍削減しつつ、動作中心の精度を向上。ブロック因果注意を使用しても精度を維持し、結果として画像前処理済みエンコーダに近い性能を発揮。動画が一般目的の視覚的事前学習の基盤として有望であることを示す。 Comment
元ポスト:
解説:
[Paper Note] Code World Model: Coding Agent as World Brain, Yiwen Chen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Coding #Architecture #WorldModels #Initial Impression Notes Issue Date: 2026-09-04 GPT Summary- Code World Modelは、言語モデルとビデオモデルを組み合わせたフレームワークで、世界の進化と視覚的実現を分離してシミュレーションします。コーディングエージェントは、出来事の推論と持続的な世界状態の維持、進化を実行可能なコードで生成します。プロキシ表現を導入してビデオモデルに高忠実度の視覚観察を生成させ、ゲームプレイ動画から整合するデータペアを構築。これにより、オープンエンドな世界モデルに向けた新たな道を示します。 Comment
元ポスト:
World ModelのバックボーンとしてCoding Agentを利用するという話に見える
[Paper Note] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning, Shulin Tian+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #Faithfulness #EMNLP #VisionLanguageModel #Rubric-based #Initial Impression Notes #Author Thread-Post #CreditAssignment Issue Date: 2026-09-01 GPT Summary- 視覚と言語モデルは、視覚的証拠に基づかない回答を生成することがあるため、妥当性を維持できない状況をクレジット割り当ての失敗と捉える。本研究では、参照回答を原子命題に分解し、視覚的忠実性、推論の一貫性、指示遵守に基づいた評価を行う視覚的ルーブリックを提案。これにより裏付け証拠のクレジットを局所化し、Qwen3-VL-8B-Instructを用いて生成したトレーニングセットV-Rubrics 50Kを作成。実験結果、ルーブリックベースのGRPOはSFT基準及び他の手法を上回る改善を示し、視覚的ポストトレーニングの報酬としてルーブリックの有効性を証明した。 Comment
元ポスト:
Rubric basedなRLを用いて、trajectoryに対して構造化された部分点を提供するcredit assignment手法を提案し、これによりVLMの
- Visual Faithfulness
- Reasoning Consistency
- Instruction Following
を改善する、という話に見える。
[Paper Note] T-Rex: Tactile-Reactive Dexterous Manipulation, Dantong Niu+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #Dataset #Architecture #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #EmbodiedAI #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- 触覚信号に動的に反応する能力は人間レベルの器用さに不可欠だが、現代のVLAモデルは触覚を軽視する傾向がある。本研究では、触覚反応型操作の向上に向け、100時間の触覚データセットを収集し、新しい時系列触覚VQ-VAEエンコーダと可変レートのMixture-of-Transformersアーキテクチャを提案。12の操作タスクで触覚反応ポリシーの有効性を証明し、最強ベースラインの成功率を30%以上向上させた。 Comment
元ポスト:
pj page: https://tactile-reactive-dexterous.github.io/
ロボットの触覚の制御に特化した大規模でオープンなデータとアーキテクチャの提案に見え、卵を掴んで移動させるデモなどが元ポストに掲載されている。
スーパーサイヤ人になった悟空が食器を掴んだけど力が強すぎて割ってしまう、みたいなアニメのシーンをふと思い出したけど(セル編だった気がするけど実際にそのようなシーンがあったかはわからない)、実際調理ロボットが卵を掴んで運ぶ前に握り潰してしまったらだいぶ悲しいので、触覚は非常に重要なモダリティと思われる(小並感)。
[Paper Note] Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting, Jiaming Fan+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#4D Reconstruction #4D(Scene + Time) Issue Date: 2026-08-22 GPT Summary- DAV4は、単眼動画から動的な4Dシーン再構成を行う新しいフレームワークです。主な貢献は、リーマニアン・フローマッチング(RFM)を用いて確率的経路を非ユークリッド多様体上に定義し、全ての中間状態の有効性を保証する点です。制御実験で、RFMはFスコア0.806を達成し、従来の基準より+0.044向上しました。DAV4は、手動の深度ラベルなしで、動的再構成と視点合成において従来モデルを超えています。 Comment
元ポスト:
[Paper Note] HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction, Jiahao Ji+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Dataset #read-later #Selected Papers/Blogs #Robotics #EmbodiedAI #Author Thread-Post Issue Date: 2026-08-20 GPT Summary- HiPHIは、全身の人間モーションと相互作用の多様性を最大化するために設計された600時間超の高忠実度データセットであり、光学モーションキャプチャを用いてサブミリメートル級の精度で作成された。これにより、実験室とインターネットのデータの不一致を解消し、モーションのカバー範囲を大幅に拡張。HiPHIは物理AIアプリケーションを評価するためのベンチマークスイートも提供し、実世界のタスクにおけるヒューマノイドポリシー学習の基盤を確立する。 Comment
HF: https://huggingface.co/datasets/noitomrobotics/HiPHI
元ポスト:
[Paper Note] Douyin Multimodal Embedding Model Technical Report, Haonan Chen+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#Embeddings #NLP #RepresentationLearning #MultiModal #ContrastiveLearning #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-08-10 GPT Summary- マルチモーダル表現学習はAIの核心で、複数のモダリティをエンコードし、産業用検索と推奨を最適化する。特に、Douyinなどの大規模プラットフォームでは、効率的かつ細かいマッチングが求められるが、既存のMLLMモデルはこれを満たしていない。私たちはDouyin Multimodal Embedding(DME)を提案し、二段階で訓練を行い、対照的な事前学習と意味的充足性を組み合わせる。DMEは迅速な応答に不可欠で、実際のDouyin検索でパフォーマンスを向上させることに成功した。 Comment
元ポスト:
Qwen3-VL-Embeddingと比較して、Videoドメインの性能向上が顕著なマルチモーダルなEmbeddingのようである。latencyが改善されていることが強みの一つのようだが、latent CoTの有無によるΔの比較はあったが、他モデルとの明示的な比較はされていないように見えたが、どの程度早いのだろうか?
[Paper Note] Scaling Properties of Text Conditioning in Visual Generation, Zilong Chen+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #DiffusionModel #TextToImageGeneration #Scaling Laws #read-later #Selected Papers/Blogs #ImageSynthesis #Author Thread-Post Issue Date: 2026-08-10 GPT Summary- 視覚生成におけるテキスト条件付けのスケーリング特性を実験的に探求。収束した拡散損失は、プロンプト内の構造化言語の量に比例して減少することが明らかに。GPGとEDの指標を用いて、構造化プロンプトを改善。これにより、ほとんどの構成的・推論的ベンチマークで優れた性能を発揮し、クローズドウェイトモデルとも競合する結果を得る。 Comment
元ポスト:
著者ポスト:
[Paper Note] ReToken: One Token to Improve Vision-Language Models for Visual Retrieval, Yao Xiao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#InformationRetrieval #NLP #RepresentationLearning #read-later #VisionLanguageModel Issue Date: 2026-08-10 GPT Summary- 長い視覚的文脈は視覚言語モデルにおいて性能低下を引き起こす。これに対処するため、明示的な検索ターゲットとして訓練された埋め込み「ReToken」を提案。視覚KVキャッシュから関連するトークンを選択することで、画像と動画のベンチマークで性能向上を実現。具体的には、Visual HaystacksでQwen3VL-8Bを13.4ポイント、InternVL3.5を12.4ポイント改善し、LVBenchでは長尺動画へのゼロショット転移で8.0ポイントの改善を達成。軽量設計により、単一のH100で学習と推論が可能。 Comment
元ポスト:
[Paper Note] ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine, Yukang Cao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Dataset #MultiModal #Robotics #EmbodiedAI #EgocentricView #Author Thread-Post #MultiView Issue Date: 2026-08-09 GPT Summary- 身体性を伴う知能は、知覚と行動の全体ループを捉えるためのデータのボトルネックに直面している。既存のデータセットはこれを分断しているため、全体像を捉えられない。そこで、Ambient Capture Engine(ACE)を導入し、実在の家庭環境を空間的に較正された録画スタジオに変換。ACEは、手と物体の操作や全身の運動を二つのスケールで捉え、統合された多感覚ストリームとして記録する。ACE-Data-0は150時間、1700万フレームの映像を収集し、75,000の相互作用エピソードを網羅。さらに、相互作用における自然な行動のばらつきを保持し、階層的なベンチマークを導入。ACE-Data-0は知覚、運動学、接触の同期を示し、身体性AIのスケーラブルな基盤を提供する。 Comment
pj page: https://ace-data-engine.github.io/ACE-Data-0/
元ポスト:
[Paper Note] HumanCLAW: Can Vision-Language Models Act Through a Body?, Li Siyao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #Evaluation #VisionLanguageModel #Robotics #EmbodiedAI Issue Date: 2026-08-09 GPT Summary- 行動の結果を評価することが難しい視覚-言語モデル(VLM)に対し、HumanCLAWというフレームワークを導入。VLMが一連の指令を出す中で、実行の誤差を排除し、モデルの行動知能を測定。41のシーンで1,218エピソードを構築し、9つのVLMをテストした結果、最良でも16.8%の成功率で、目標認識はボトルネックではなく、具現化された自己認識の欠如が問題であることを示した。 Comment
pj page: https://human-claw.github.io/
[Paper Note] ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU, Fan Jiang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#VideoGeneration/Understandings #WorldModels #interactive #LongHorizon #Realtime Issue Date: 2026-08-03 GPT Summary- ABot-World-0は、リアルタイムで長期的な相互作用を可能にするビデオ世界モデルで、複数のデータソースから学習した制御可能な世界ダイナミクスを持つ。WorldExplorerはエージェント主導のデータ収集を行い、統合パイプラインは品質チェックと同期注釈を適用。双方向の教師を因果的な生徒へ蒸留し、LongForcingを導入して長期の自己ロールアウトを最適化。デプロイメントでは軽量なVAEデコーダや効率的なアテンションを活用し、最大16 FPSで映像をストリーミング可能。実験結果は競争力のある制御性と一貫した世界進化を示す。 Comment
元ポスト:
[Paper Note] Cosmos 3: Omnimodal World Models for Physical AI, NVIDIA+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #LanguageModel #FoundationModel #Selected Papers/Blogs #VisionLanguageModel #Robotics #WorldModels #UMM #reading #Omni #EmbodiedAI #AudioLanguageModel #WorldActionModel Issue Date: 2026-07-31 GPT Summary- Cosmos 3は、言語、画像、動画、音声、アクション系列を共同処理・生成するオムニモーダル世界モデルです。視覚と言語のモデルを統合し、評価結果で新たな最先端を確立。事後訓練済みモデルは最良のモデルと評価され、オープンな研究のためのリソースを公開しています。 Comment
テキスト、画像、動画、音声、アクション、これらのモダリティを全て理解し、生成できるOmnimodal World Modelとのこと。
様々なモダリティで他のOpenWeightモデルと同等以上の性能を達成しているようである。Drivingドメインでは突出している。モダリティごとに評価ができない項目はグレーに塗りつぶされているが、これだけ塗りつぶされた表は初めて見た。。。インパクトがある。
[Paper Note] Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model, Xinghang Li+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#MultiModal #FoundationModel #TextToImageGeneration #OpenWeight #Robotics #EmbodiedAI #ImageSynthesis Issue Date: 2026-07-19 GPT Summary- Xiaomi-Robotics-U0は、380億パラメータを持つマルチモーダル自己回帰モデルで、具現化生成のための統一的な枠組みを提供。画像・動画生成を含む多様なタスクを共同最適化し、事前訓練済みモデルの一般化を保持しつつ具現化設定に適応。これにより、高品質なマルチビューシーン生成が可能となり、細粒度の編集制御が実現。単一ステップ及び逐次生成タスクで最先端の成果を上げ、具現化動画生成でトップに立ち、実世界の操作タスクの成功率を向上させた。この成果は、基盤世界モデルが具現世界モデルとしての機能を持つことを示している。 Comment
元ポスト:
pj page: https://robotics.xiaomi.com/xiaomi-robotics-u0.html
HF: https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
[Paper Note] Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models, Ruchit Rawal+, ECCV'26, 2026.07
Paper/Blog Link My Issue
#NLP #DiffusionModel #TextToImageGeneration #Test-Time Scaling #ECCV #One-Line Notes #ImageSynthesis #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 推論時のスケーリングは、Best-of-N(BoN)サンプリングからガイド付き探索に進化してきたが、生成コストを固定と見なしている。効率性評価でBoNがガイド付き探索に匹敵することを示し、Flash-BoNを提案。これはアクセラレーション技術を組み合わせ、多数の安価なドラフト候補を生成し、高品質へ精練する。ベンチマークではFlash-BoNが全ての基準を上回り、特にモデルスケールが大きいほど利得が顕著(AUCで+8%)。他の手法と相乗効果があり、候補の多様性向上が強化学習の収束を加速する。 Comment
pj page: https://flash-bon.github.io/
元ポスト:
中間サンプルを安価で効率的な方法で生成することで多様な中間候補を探索し、有望な候補のみに対して完全な生成をするようなBest-of-Nに基づくTextToImage手法を提案。
また効率性の評価において Number of Function Evaluations (NFEs)[^1] が利用されることが多かったが、これはdenoisingのforward passのみが考慮され、verifierのコストが無視されており、verificationコストが大きい手法が本来効率的ではないのに、効率的に見えてしまう問題があった。実際、BFSのような手法では固定されたNFEの元では効率的に見えるが、頻繁にverifierを呼び出すため、固定されたwallclock timeの元では効率性が逆転する。
[^1]: デノイジングを実施するネットワークの呼び出し回数
[Paper Note] Video Generation Models are General-Purpose Vision Learners, Letian Wang+, ECCV'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #FoundationModel #DiffusionModel #ECCV #PostTraining #UMM #3D (Video) #TextToVideoGeneration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 大規模テキストからの動画生成がコンピュータビジョンにおける強力な事前学習パラダイムとして機能し、一般的な視覚知性を支えることを提案。GenCeptionという前方伝播型の知覚モデルは、テキスト指示で多様な視覚タスクを実行し、専門モデルと同等またはそれを上回る性能を示す。また、動画生成の事前学習バックボーンは他のパラダイムより優れており、少ないデータで同等の性能を達成。さらに、合成ビデオで訓練されたモデルが現実世界に一般化することを示唆している。 Comment
元ポスト:
似たようなタイトルを見たことあるなと思ったら以下だった:
- [Paper Note] Image Generators are Generalist Vision Learners, Valentin Gabeur+, arXiv'26, 2026.04
著者ポスト:
[Paper Note] Scalable Visual Pretraining for Language Intelligence, Yiming Zhang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Selected Papers/Blogs #VisionLanguageModel #reading #One-Line Notes #LatentRepresentation Issue Date: 2026-07-19 GPT Summary- 視覚的事前学習が言語モデルの知能向上に寄与することを示す研究。テキスト変換を通さず視覚的文書を直接活用する無監督のアプローチを検討し、視覚的事前学習がテキストのみのモデルを一貫して上回ることを実証。これにより、スケーラブルな言語知能への効率的なアプローチが明らかに。 Comment
元ポスト:
事前学習をする際に、テキストだけでなく画像パッチに対してもnext visual latent predictionを実施することで性能が改善する。
next visual latent predictionでは、画像パッチをfreezeされたvision encoderでエンコードし潜在表現の系列を取得し、現在のパッチを入力したときに、次のパッチの潜在表現を予測する(離散トークンではなく、連続値ベクトルである点に注意)。loss functionは、バッチ内の全ての画像パッチを考えたときに、各パッチの正解の潜在表現と、モデルが予測した次パッチの潜在表現の類似度行列をソフトマックスで正規化した行列を考え、対角成分(すなわち正解の画像パッチに対する類似度)が最大化されるように定義される。ソフトマックスを考えることで、バッチ内の他の画像パッチがin-batch negativeの役割を果たし、これは次パッチの潜在表現と他の潜在表現の区別がつくようなcontrastive learningをしていることに相当する(Section 4)。
[Paper Note] Infinite Worlds with Versatile Interactions, Zelin Gao+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#OpenWeight #Selected Papers/Blogs #WorldModels #interactive #3D (Video) #Realtime #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- LingBot-World 2.0を紹介。出力品質を保ちながら無限に広がる対話の時間的範囲を実現し、リアルタイム応答を可能にする。多様なインタラクティブ要素を導入し、エージェント機能の統合にも先駆ける。複数プレイヤーが同時に参加できるインターフェースを開発し、14Bモデルと1.3Bモデルを組み合わせてGPUデプロイを簡素化。 Comment
pj page: https://technology.robbyant.com/lingbot-world-v2
元ポスト:
公式:
HF: https://huggingface.co/collections/robbyant/lingbot-world-v2
[Paper Note] Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence, Shuailei Ma+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #FoundationModel #OpenWeight #Selected Papers/Blogs #Robotics #3D (Video) #EmbodiedAI #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- ロボット制御に特化した動画生成モデルLingBot-Videoを提案。Mixture-of-Experts(MoE)アーキテクチャを採用し、計算効率とモデリング容量のバランスを向上。ロボット志向の映像を追加するデータプロファイリングエンジンを構築し、行動理解を強化。物理的合理性を保証する多次元報酬システムを導入し、標準を超える評価を実施。LingBot-Videoはデジタル創造と物理的作動を結ぶ大規模・オープンソースのMoE動画基盤モデルとしてコミュニティに貢献。 Comment
元ポスト:
pj page: https://technology.robbyant.com/lingbot-video
HF: https://huggingface.co/collections/robbyant/lingbot-video
公式:
[Paper Note] Video = World + Event Stream, Lianghua Huang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#VideoGeneration/Understandings #WorldModels #interactive #Realtime Issue Date: 2026-07-18 GPT Summary- Wan-Streamer v0.3は、ネイティブ・ストリーミング相互作用モデルを整理ビューの下で再定義したもので、ビデオの持続的文脈(世界)と時間とともに変化する要素(イベントストリーム)を扱います。これにより、リアルタイムでの環境変化や反応を予測する能力が生まれ、全二重音声映像相互作用に特化します。モデルは視覚・言語・行動を統合し、マルチモーダルなユーザー入力を言語形式の出力と行動に変換します。また、性能としては、動画の解像度やストリーミング単位を維持しつつ、応答時の遅延を最適化しています。 Comment
元ポスト:
pj page: https://wan-streamer.com/v0.3/
[Paper Note] RoboTTT: Context Scaling for Robot Policies, Yunfan Jiang+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LongContext #read-later #Selected Papers/Blogs #Robotics #memory #EmbodiedAI #Test Time Training (TTT) #Author Thread-Post Issue Date: 2026-07-17 GPT Summary- RoboTTTは、8Kタイムステップの視覚-運動文脈を用いるロボットモデルであり、最先端ポリシーの1000倍のスケールを実現しつつ推論遅延を増加させない。このアプローチにより、ワンショット模倣やポリシー改善、撹乱への頑健性が向上し、長期タスクでの性能も強化される。RoboTTTはTest-Time Trainingを取り入れ、勾配降下法で履歴情報を活用した新しいモデルを生成。実験により、従来の単一步ベースラインに対して87%の性能向上が見られ、長い文脈がロボット基盤モデルにおける新たなスケーリング軸となることが示された。 Comment
元ポスト:
ポイント解説:
[Paper Note] Vision as Unified Multimodal Generation, Xiaoyang Han+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #OpenWeight #PostTraining #VisionLanguageModel #UMM #Author Thread-Post Issue Date: 2026-07-14 GPT Summary- コンピュータビジョンを統一型多模态生成として定式化し、SenseNova-Visionは自然言語指示と視覚プロンプトを用いて多様な視覚タスクを表現。指示-応答の例を生成するSenseNova-Vision Corpusを作成し、タスク特異的なアーキテクチャを必要とせず学習。得られたモデルは広範な視覚タスクに対応し、実験により単一の統一モデルがタスク特化システムと同等の性能を発揮することを示した。このアプローチは、コンピュータビジョン機能を汎用的なモデルに統合するスケーラブルな方法を示唆している。モデルとコーパスは公開されている。 Comment
HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
著者ポスト:
[Paper Note] Vision Pretraining for Dense Spatial Perception, Zelin Fu+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#Pretraining #FoundationModel #SpatialUnderstanding Issue Date: 2026-07-12 GPT Summary- 境界を重視した視覚事前学習を提案。マスク境界モデリングによって、サブピクセル境界を学習し、密な視覚トークンを促進。LingBot-Visionを開発し、DINOv3を超える成果を示し、深度推定を強化することに寄与。境界モデリングは空間的に構造化された視覚表現の学習においてスケーラブルな基盤となることを示唆。 Comment
pj page: https://technology.robbyant.com/lingbot-vision
元ポスト:
[Paper Note] Gemma 4 Technical Report, Gemma Team+, arXiv'26, 2026.07
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #SpeechProcessing #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #AudioLanguageModel Issue Date: 2026-07-12 GPT Summary- Gemma 4は新世代のオープンウェイトマルチモーダル言語モデルで、計算効率と推論能力の向上を目指します。DenseとMixture-of-Expertsアーキテクチャを採用し、パラメータ数は23億〜310億で、視覚および音声エンコーダを強化しました。特に12Bモデルにはエンコーダを用いない統一アーキテクチャが導入され、生の音声と画像パッチを扱います。推論の痕跡を生成する機能を統合し、推論速度やメモリ効率を改善。Gemma 4は、STEMやマルチモーダルタスクで飛躍的な性能を達成し、最前線のオープンモデルに匹敵します。 Comment
元ポスト:
Gemma 4:
- Gemma 4: Byte for byte, the most capable open models, Google, 2026.04
ポイント解説:
解説:
[Paper Note] Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks, Yu Wang+, ACL'26, 2026.04
Paper/Blog Link My Issue
#Analysis #NLP #MultiModal #In-ContextLearning #ACL #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-07-07 GPT Summary- マルチモーダル設定における文脈内学習(ICL)の分析を行い、テキストのみのICLと比べて性能のギャップを明らかに。ゼロショット設定では同等だが、少数ショットでは大幅に劣化することを示す。視覚表現とテキスト表現の間で整合性が欠け、タスクマッピングの転送が不十分であることが判明。推論段階の改善手法を提案し、マルチモーダルICLの機構と限界に新たな知見を提供。 Comment
元ポスト:
マルチモーダルモデルを用いてfew-shot demonstrationを与えてICLを実施する場合、text-onlyモデルの場合と比較して性能が劣化することが多いのはなぜか?という疑問を追求した研究で、text-onlyの場合と比較して、マルチモーダルの場合は
- デモンストレーションからタスクルールを推論し
- 推論されたルールをクエリに適用する
という2段階のプロセスが必要で、前者はモデルが中間層まででうまく処理できるが、後者に関して中間層からより深いlayerに伝搬させることに失敗する(クエリ側の手がかりによって推論されてしまう)、ということのようである。
[Paper Note] M*: A Modular, Extensible, Serving System for Multimodal Models, Atindra Jha+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #MultiModal #SpeechProcessing #LLMServing #Architecture #UMM #Omni #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 GPT Summary- 複合モデルアーキテクチャの新時代に向け、M*を提案。M*はモデルをデータフローグラフとして表現し、モジュラーな抽象化を通じて多様なタスクを効率的に処理。具体化によって、テキスト-画像及びテキスト-音声ワークロードでの遅延を平均20%削減し、スループットを最大2.7倍向上。ロボティックプランニングでも基準を12.5倍上回る。この研究は、複雑なモデルの効率的な提供を可能にする。 Comment
元ポスト:
以下、元ポストの要約
vLLMやSGLangのようなメジャーなLLM Servingフレームワークは単一の自己回帰的な生成のループを前提としており、テキスト以外のモダリティを扱う場合は異なる推論パスを辿るため、根本的に統一的に扱える抽象化となっていない(Figure 1)。
そこで、マルチモーダルなモデルを統一的に扱えるための抽象化M*を提案:
- モデルのコンポーネントをノードとして宣言し、名前付きのWalkを定義する(1つのフェーズ(prefill_text, decode, image_gen等)を構成するサブグラフ)を定義する。
- リクエストはWalkの系列として定義され、Sequential, Parallel, Loopの3種類で実行形式を定義する。
ランタイムはリクエストに応じたコンポーネントのみを実行する。各コンポーネントはグラフのノードとして定義されるため、配置の変更はコードの変更ではなく、設定の変更で完結する。また、YAMLファイルによって、各コンポーネント、Walkの粒度でGPUの割り当てを制御できるため、個々のコンポーネントやWalk単位でリソースの効率を最大化することで、予測性能を落とすことなく、システム全体のスループットが向上する。
また、Figure1のOmniモデル、UMMそれぞれのモダリティごとの推論パスの違いが秀逸で、非常に分かりやすい。
[Paper Note] Unlimited OCR Works, Youyang Yin+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LongContext #OpenWeight #VisionLanguageModel #OCR Issue Date: 2026-07-03 GPT Summary- Unlimited OCRは、DeepSeek OCRに基づき、長期的なメモリ効率を改善するために設計されたモデルである。大規模言語モデル(LLM)を用いることでOCR性能向上が期待されるが、出力系列が長くなるとメモリ消費が増大し、生成速度が低下する問題がある。本研究では、Reference Sliding Window Attention(R-SWA)をアテンション層に導入し、KVキャッシュを一定に保ちながら計算コストを削減。これにより、最大32Kの長さのもとで、数十ページの文書を効率的に処理できる。また、R-SWAはASRや翻訳など他のタスクにも応用可能である。コードとモデル重みは公開されている。 Comment
HF: https://huggingface.co/baidu/Unlimited-OCR
元ポスト:
2週間で1Mダウンロード:
[Paper Note] World Action Models: A Survey, Qiuhong Shen+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Survey #NLP #Robotics #WorldActionModel Issue Date: 2026-07-03 GPT Summary- World Action Models(WAMs)は、未来予測と行動実行を統合した身体化されたモデルであり、最近では大規模な動画生成モデルを再利用する研究が進展している。現在のWAMsは、通常の動画生成モデルやVision-Languageのバックボーンに依存し、これにより関連領域の境界が曖昧になっている。本調査では、これらの境界を明確化し、手法を生成物の観点と予測基盤、バックボーン、アクション結合の観点から整理。WAMsは単なる動画生成モデルとは異なり、表現力とリソース間のトレードオフを重視した予測-行動手法として進化している。この分野は未来生成を抑えつつ、制御要件を満たす方法を模索している。
[Paper Note] NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment, Jisung Hwang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#DiffusionModel #TextToImageGeneration #ImageSynthesis #RewardAlignment Issue Date: 2026-07-03 GPT Summary- ノイズ傾斜付き逆カーネル(NTRK)は、報酬勾配をノイズ項に注入することで、逆カーネルを変更せずに単一サンプルで動作する拡散サンプラーです。既存手法は報酬誘導と生成品質のトレードオフがありましたが、NTRKは逆平均を固定しつつノイズを高報酬方向にバイアスしてこれを解決します。白色化演算子により、報酬勾配を損なうことなくノイズと互換性のある摂動に変換。さまざまなタスクで最先端のベースラインを上回り、特に審美的生成では500 NFEsでの報酬を25 NFEsで上回り計算資源を大幅に削減しました。 Comment
元ポスト:
[Paper Note] Orca: The World is in Your Mind, Yihao Wang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#WorldModels Issue Date: 2026-07-02 GPT Summary- Orcaは一般的な世界ファウンデーションモデルの初期実装で、マルチモーダルな信号から統一的な潜在空間を学習し、次の状態予測に焦点を当てる。無意識学習と意識的学習を通じて、密度の高い自然な状態遷移と意味のある状態遷移をモデル化。125,000時間のビデオデータと1億6千万件のイベント注釈を用いて事前学習を行い、テキスト生成や画像予測などの下流タスクでの能力を評価。Orcaは専門的ベースラインを上回る結果を示し、今後の研究に対する洞察を提供することを目指す。 Comment
元ポスト:
[Paper Note] VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation, Seongheon Park+, ACL'26 Findings, 2026.02
Paper/Blog Link My Issue
#NLP #ACL #VisionLanguageModel #Findings #Initial Impression Notes #SelfVerification Issue Date: 2026-07-01 GPT Summary- 視覚言語モデル(LVLM)の幻覚問題を解決するために、視覚認識に基づく不確実性定量化フレームワークVAUQを提案。これにより、モデル出力の視覚的証拠への依存度を測定し、Image-Information Score(IS)を導入。トレーニング不要のスコアリング関数を用いて正確さを反映。実験により、VAUQは既存の自己評価手法を上回る性能を示した。 Comment
画像に関するタスクをVLMが処理する際に、応答のconfidenceがlanguage priorではなく、画像に基づくevidenceに基づいているかをconfidenceに反映させる
[Paper Note] Improving Robotic Generalist Policies via Flow Reversal Steering, Andy Tang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#NLP #Selected Papers/Blogs #VisionLanguageModel #Robotics #VisionLanguageActionModel #reading #One-Line Notes #Steering #Author Thread-Post Issue Date: 2026-06-13 GPT Summary- 汎用ポリシーが多様なロボットデータセットから学習する中で、Flow Matching GeneralistsとFlow Reversal Steering(FRS)を提案し、サブ最適な行動を逆向きに通して潜在ノイズを特定、汎用的なアクションモードへ写像する手法を検証。FRSは粗い意味論的指示を良いロボットアクションに変換し、ゼロショット制御を改善。訓練を短時間で行い、最大95%のタスク成功率向上を示し、強化学習をブートストラップしてさらなる改善を実現。 Comment
元ポスト:
VLMや人間によって、
- Coarse Reference Action関する情報(=意味的には妥当だがロボットがアクションを実施するには粗すぎる情報; move straight right等)を与え、
- Coarse Reference Action を対応するVLAのreference action a_1に変換し
- a_1に基づいてVLAが良いアクションを生成できる潜在ノイズをFlow Matchingモデルを時間方向にbackwardさせる(noising process)ことで推定し、
- 同定した潜在ノイズから順方向にdenoisingすることで、妥当なアクションをsteeringする
Flow Reversal Sterring (FRS) を提案。FRSにはzero-shot、かつonlineでsteeringができる利点がある。
## Diffusion Steering via Behavioral Cloning (DSBC)
FRSはSupervised Learningにも活用できる。具体的には、reference actionに基づいたノイズ a^hat_0を用いてobservationからノイズを生成するノイズ方策を直接behavior cloning(=observation oが与えられた時に、a^hat_0を出力する確率を最大化する最尤推定; p.6冒頭)する。
学習データ(observation, good noiseのタプル)の収集方法は大きく分けて2通りあり
- オンライン: zero-shot FRSを実際に環境でロールアウトし、タスクが成功したときノイズをgood noiseとして記録する
- オフライン: 既存の(observation, action)データをFRSで変換し(observation, action noise)のタプルに変換して学習に利用する
このような学習手法をDSBCと呼ぶ。
## DSRL + FRS
上述のFRSとDSRL [Paper Note] Steering Your Diffusion Policy with Latent Space Reinforcement Learning, Andrew Wagenmaker+, arXiv'25, 2025.06
を組み合わせることで、DSRLの安定性を向上させる手法。DSRLは一言で言うと、アクション生成のシードとなる良いノイズを生成できるポリシー(ノイズ方策)をRLを通じて学習する手法らしく、RLをする際の報酬に対して、DSBCを重み付きで加えることによって、エキスパートのノイズから大きく逸脱することを防ぐ正則化の役割を追加する。
完全に読めたわけではないが、おもしろい。勉強になった。
[Paper Note] LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories, Zhanhao Liang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Alignment #ReinforcementLearning #DiffusionModel #TextToImageGeneration #PostTraining #FlowMatching #ImageSynthesis Issue Date: 2026-06-11 GPT Summary- フロー・マッチングモデルの人間の嗜好への整合性を向上させるため、LeapAlignというファインチューニング手法を提案。これにより、長い生成経路を二段階に短縮し、計算コストを削減しつつ効率的な勾配伝播を実現。生成ステップのランダム化や学習重みの調整によってモデルの安定性が向上し、Fluxモデルにおいて優れた画像品質と画像-テキスト整合性を実現し、既存手法を上回る結果を達成。 Comment
pj page: https://rockeycoss.github.io/leapalign/
元ポスト:
[Paper Note] CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning, Penghui Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ReinforcementLearning #ImageCaptioning #VisionLanguageModel #3D (Video) #VideoCaptioning #Initial Impression Notes Issue Date: 2026-06-11 GPT Summary- マルチモーダルキャプション生成において、強化学習を用いる新たなフレームワークCapRL++を提案。特に、キャプションの品質を有用性に基づいて再定義し、視覚情報を用いない質問に正確に答えられることを重視。これにより、高密度なキャプション生成能力が向上し、複数のタスクでのパフォーマンスが強化。CapRL++を用いた訓練モデルは、大規模モデルと同等の性能を達成し、従来の方法の限界を超えることを示した。 Comment
元ポスト:
CapRLのアイデア(i.e., 画像に関する質問をtext-onlyモデルがcaptionのみから正解できたらそのcaptionの品質は高い; キャプションの品質を有用性で測る)をvideo-captioninに拡張
[Paper Note] Echo-Memory: A Controlled Study of Memory in Action World Models, Wayne King+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#Evaluation #read-later #memory #WorldActionModel Issue Date: 2026-06-11 GPT Summary- Echo-Memoryを提案し、アクション条件付きの世界モデルにおける記憶メカニズムを探究。モデルは初期フレームやカメラアクションから動画を生成し、記憶の効果を考察。共通のビデオバックボーンの下で、異なるメモリ設計を比較し、容量や圧縮、再帰の4つの軸を分離。メモリ評価のプロトコルを用いて、再生忠実度と実際の記憶の関係性を明らかにし、生のコンテキストが記憶容量の基準であり、コンパクト性は容量の代替にならないことを示した。特に、状態空間再帰はオープンドメインでのリターン機構において重要な役割を果たす。 Comment
元ポスト:
[Paper Note] Interpreting Physics in Video World Models, Sonia Joseph+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Probing #VideoGeneration/Understandings #Physics Issue Date: 2026-06-11 GPT Summary- ビデオベースのモデルが物理変数をどのように表現しているかを解明するための初の解釈性研究を実施。層ごとのプロービングやデコーディングを用いて、物理情報がアクセス可能な「Physics Emergence Zone」を特定。運動のスカラー量は初期層からアクセス可能だが、運動の方向はこのゾーンでのみ利用可能で、高次元の集団構造を通じて符号化されている。この研究は、現代のビデオモデルが因子化された表現ではなく、分散表現を用いて物理予測を行うことを示唆している。 Comment
元ポスト:
[Paper Note] Efficiently Reconstructing Dynamic Scenes One D4RT at a Time, Chuhan Zhang+, CVPR'26 Best Paper, 2025.12
Paper/Blog Link My Issue
#CVPR #read-later #Encoder-Decoder #4D Reconstruction Issue Date: 2026-06-08 GPT Summary- 動画から動的シーンの幾何と運動を理解・再構成するための新しい前方伝播モデルD4RTを提案。単一の動画から深度や時空間対応を一括推定可能で、新しいクエリ機構により計算負担と複雑さを軽減。これにより、3D位置の探索が効率化され、4D再構成タスクで従来を超える性能を実現した。 Comment
元ポスト:
pj page: https://d4rt-paper.github.io/
解説:
[Paper Note] Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?, Yue Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #VisionLanguageModel #SpatialUnderstanding Issue Date: 2026-06-05 GPT Summary- 空間推論は視覚-言語モデル(VLM)の基本能力だが、既存の評価は視覚的観察の制限を無視している。本研究では、遮蔽と視点の曖昧性という2つの観察課題を導入し、空間的質問を設計してモデルの応答を評価。結果は、視覚的証拠が不完全な場合でも過信的応答が誘発され、遮蔽下での精度は約30%、視点の曖昧性では10%未満にとどまることを示した。また、信頼できる追加視点を識別する能力は多くのモデルでほぼランダムである。これにより、モデルが正確な回答だけでなく、適切に回答を控える能力や信頼できる証拠を求める必要性が示唆された。 Comment
元ポスト:
[Paper Note] Déjà View: Looping Transformers for Multi-View 3D Reconstruction, Alessandro Burzio+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Transformer #3D Reconstruction #RecurrentModels Issue Date: 2026-06-05 GPT Summary- DéjàViewモデルは、ループ状トランスフォーマブロックを用いて視点ごとの特徴を再帰的に処理し、反復を明示的に組み込むことにより、効率的な3D再構成を実現。これにより、少ないパラメータでフィードフォワードモデルと同等以上の性能を発揮し、計算量も低く抑えられる。明示的な反復が、より強い帰納的バイアスを提供することを示した。 Comment
元ポスト:
pj page: https://research.nvidia.com/labs/dvl/projects/dvlt/
[Paper Note] DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation, Jusuk Lee+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #MultiModal #read-later #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-06-03 GPT Summary- DynaFLIPは、ロボット操作のためのダイナミクスを意識した多モーダル事前学習フレームワークで、運動理解を知覚に統合します。異種の人間とロボットのビデオから構築したトリプレットを用い、画像のみのエンコーダを訓練。三つのモダリティが小さなシンプレックス体積を形成するよう促し、その体積が小さいほど整合が強くなります。シンプレックス体積最小化をコサイン正則化項と対照学習と組み合わせ、重要な制御関連領域に焦点を当てたダイナミクス認識表現を得て、視覚バックボーンとして機能します。多様なシミュレーションと実世界の設定で検証した結果、分布外の状況下で最大+22.5%の改善を達成。視覚表現が行動による世界の変化をエンコードすることで、ロボットの一般化能力が向上することを示唆しています。 Comment
pj page: https://dynaflip-robotics.github.io/
元ポスト:
[Paper Note] Learn from your own latents and not from tokens: A sample-complexity theory, Daniel J. Korchinski+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #Analysis #MachineLearning #NLP #Self-SupervisedLearning #One-Line Notes #Author Thread-Post #LatentRepresentation Issue Date: 2026-06-02 GPT Summary- 生成モデルは、訓練データの量が生物的学習者に比べて大きくなる中で高い性能を示している。新たな手法として、ネットワークが潜在表現を予測する訓練が行われており、これがデータ効率の改善につながる可能性がある。本研究では、確率的文脈自由文法(PCFG)をデータに用いて、潜在予測が効率を高めることを示す。教師あり学習は指数的なサンプル数を要するのに対し、潜在予測は定数のサンプルで達成可能であることを明らかにした。また、階層的クラスタリングやエンドツーエンドのニューラルネットワークを用いた分析を通じて、data2vecが階層的潜在予測を実行していることを確認し、明示的なスタッキングの冗長性を示唆している。 Comment
元ポスト:
JEPAのようなモデル自身が獲得した潜在表現を予測する自己教師あり学習手法は、階層的な生成構造を持つデータに対して、トークンレベルの予測ではO(m^{L+1})のサンプルが必要となるが、O(m^3)程度で済むことが理論的に示された模様。
著者ポスト:
[Paper Note] What Matters in Practical Learned Image Compression, Kedar Tatwawadi+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #Encoder-Decoder #2D (Image) #ConvolutionalModels #Compression Issue Date: 2026-06-01 GPT Summary- 実用的な学習済み画像コーデックを目指し、知覚品質と実行時のバランスを追求。新技術を含む主要なモデリング選択を検討し、性能を最大化。評価結果に基づき、既存コーデックに比べてビットレートを2.3〜3倍削減、同時に高速なエンコードとデコードを実現。 Comment
pj page: https://apple.github.io/ml-pico/
解説:
[Paper Note] minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models, Min Zhao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#DiffusionModel #VideoGeneration/Understandings #WorldModels #3D (Video) #TextToVideoGeneration #Realtime #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- リアルタイムのインタラクティブなビデオワールドモデル構築のため、フルスタックのオープンソースフレームワークminWMを提案。双方向ビデオディフュージョンモデルをカメラ制御可能な少数ステップ自回帰モデルへ変換し、低遅延のロールアウトを実現。モジュール化されており、異なるアーキテクチャに対応。実用的なアブレーションも提供し、再現性や拡張性を目指す。 Comment
元ポスト:
Text-to-Videoの基盤モデルを、actionによって条件付けされて生成をするvideo world modelへ変換する
[Paper Note] Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments, Qiuyue Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #mid-training #PostTraining #read-later #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- Qwen-VLAは、視覚・言語・行動モデルを統一し、異種の意思決定問題に対応するために開発された。大規模な共同事前学習を通じて、ロボット操作やナビゲーション、軌跡生成を統合したフレームワークで、体現性を考慮したプロンプト条件付けを導入。実験結果は、複数の環境やタスクにおいて、一貫したマルチタスク性能と高い一般化能力を示し、特に実世界のデータセットで優れた成果を達成した。 Comment
元ポスト:
[Paper Note] Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players, Fangfu Liu+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Multi #Transformer #DiffusionModel #VideoGeneration/Understandings #WorldModels #interactive #Initial Impression Notes Issue Date: 2026-05-31 GPT Summary- マルチエージェント環境におけるインタラクティブなビデオ生成のために、私たちの生成的マルチエージェントワールドモデルを提案。エージェント間の順列対称性を保ちながら、異なる位相で独立に制御可能であるSimplex Rotaryエージェントエンコーディングを用い、Sparse Hub Attentionでアテンション計算を効率化。トレーニングなしで2人から4人への一般化が可能で、映像の忠実度やアクション制御、一貫性を向上。 Comment
元ポスト:
pj page: https://research.nvidia.com/labs/sil/projects/gamma-world/
複数のエージェント環境における(エージェントのaction, 前回アクションからのobservationが与えられた上で、次の世界の状態を予測し画像で出力するという文脈での)World Model
[Paper Note] DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation, Makoto Shing+, ICLR'26, 2025.06
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #DiffusionModel #ICLR #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- DiffusionBlocksは、Transformerベースのネットワークを独立した訓練可能なブロックに変換する新しいフレームワークで、メモリボトルネックを軽減しながらエンドツーエンド訓練と同等の性能を維持します。残差結合の特性を活用し、各ブロックが独立に学習できるため、メモリ要件が削減されます。視覚系や拡散など多様なTransformerアーキテクチャに対する実験により、DiffusionBlocksがスケーラブルな訓練を可能にすることが示されています。 Comment
元ポスト:
openreview: https://openreview.net/forum?id=pwVSmK71cS
巨大な残差接続を持つTransformer-likeなモデルをB個のブロックに分割し、ブロック単位で独立してパラメータを学習することによって、学習時に必要なメモリを1/Bに削減できる手法のようである。
(しっかり読めていないので色々と勘違いがあるかもしれないし、気持ちの部分をうまく表現しきれていないかもしれないが)
手法の概要としては、L layer単位でブロックをB個定義する。各ブロックにはnoise rangeの元ノイズを定義し、sample data (x, y)がgivenな時に、出力yにノイズを付与した~yを考える。~yから元の出力yを再現するようデノイジングするように、他のブロックはfreezeしたままで、あるブロックのパラメータを調整する、という操作を繰り返す、という手法のようである。Inference時は、平均0、学習時に定義したnoiseレベルの最大値を分散として持つ正規分布からノイズをサンプリングし、ノイズをinput xがgivenな状態で各ブロックでsequentialにdenoisingしていく(Euler Step)ことによって、最終的に所望の出力yを得る、といったような拡散モデルの逆プロセスを経て出力を得るようである。各ブロックがカバーするノイズのrangeは決まっているが、sequentialにdenoisingをしていくため、ブロック全体でみると大きなノイズからスタートするが、それぞれのブロックに対する入力のnoise levelは徐々に低減していき、各ブロックが担当するnoise levelのrangeまで落ちることが期待され、このような手続きが実現できると思われる。
[Paper Note] CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents, Bowen Wang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#ReinforcementLearning #ComputerUse #PostTraining #RLVR #VisionLanguageModel #Initial Impression Notes #Environment #Author Thread-Post Issue Date: 2026-05-31 GPT Summary- CUA-Gymは、検証可能な報酬を伴う強化学習を支える新しいスケーラブルなパイプラインで、タスク指示、環境状態、報酬関数を共生成。生成エージェントと判別エージェントがタスク仕様に基づく報酬を生成し、オーケストレータエージェントがこれを推進。高忠実度のモックWebアプリケーションを合成し、32,112の検証済みRLVRトレーニングタプルのデータセットを構築。GSPOでの学習により、既存のCUAsを超える成果を達成し、性能のスケーリングを示唆。本研究の成果物はオープンソース化される予定。 Comment
pj page: https://cua-gym.xlang.ai/
元ポスト:
CUAのためのRLVRデータを合成できる環境の提案
[Paper Note] MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale, Zhicong Tang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#Transformer #DiffusionModel #CVPR #2D (Image) #Editing #ImageSynthesis #Initial Impression Notes #Author Thread-Post #ImageToLayer Issue Date: 2026-05-28 GPT Summary- 多層透明画像の生成と編集に特化した200億パラメータのマスク領域拡散モデル「MRT」を提案。テキストおよび画像からのレイヤー生成を統合し、柔軟なレイヤー単位の操作を実現。オーバーフロー対応のキャンバスレイヤーによって、透明な背景合成をサポートし、リアルタイムの生成を可能に。実験により、従来の技術を大きく上回る性能を示し、特に編集品質や推論速度で優位を獲得。 Comment
元ポスト:
pj page: https://mrt-cvpr.github.io/
画像生成ではなく、layer生成にフォーカスした研究で、text-to-layer generation, image-to-layer decomposition, layer-to-layer addition, layer-to-layer restylizationなどが可能なようである。
[Paper Note] SpatialBench: Is Your Spatial Foundation Model an All-Round Player?, Haosong Peng+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Dataset #Evaluation #OOD #Generalization #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 空間基盤モデルの真の一般化能力を評価するために、決定論的サンプリングを用いた新しいベンチマークSpatialBenchを提案。これにより、19データセットと546シーンを通じて5つの空間ドメインで41モデルを評価。結果は現行モデルが「万能プレーヤー」には至っていないことを明らかにし、精度向上には全文脈アテンションが有効で、有限メモリ戦略がスケーラビリティを改善することを示した。身体性を伴うタスクでは、高品質データが性能向上に重要であることも明らかになった。さらに、評価を超えてDA-Next-5MデータセットとDA-Nextモデルを導入し、空間表現学習の可能性を広げる。 Comment
pj page: https://ropedia.github.io/SpatialBench/
元ポスト:
[Paper Note] LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence, Xiang An+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #MultiModal #VisionLanguageModel #2D (Image) #UMM #3D (Video) Issue Date: 2026-05-27 GPT Summary- LLaVA-OneVision-2(LLaVA-OV-2)は、マルチモーダルベンチマークで優れた性能を示す最強のビジョン-ランゲージモデル。OneVision-Encoderを基盤に窓付き注意機構を採用し、効率的な局所計算を実現。コーデック・ストリーム・トークン化により、圧縮動画から動き残差を活用して空間情報を選択。約800万件の動画サンプルで事前学習し、JumpScoreベンチマークで優れた細粒度グラウンディングを実現。LLaVA-OV-2はJumpScoreで74.9を達成し、Qwen3-VL-8Bを大幅に上回る性能を示し、動画タスクや空間グラウンディングでの成果も卓越している。 Comment
元ポスト:
[Paper Note] VGGT-$Ω$, Jianyuan Wang+, CVPR'26, 2026.05
Paper/Blog Link My Issue
#Transformer #Architecture #CVPR #read-later #Selected Papers/Blogs #3D Reconstruction #3D (Scene) #Backbone #Scalability Issue Date: 2026-05-27 GPT Summary- VGGT-Ωは、フィードフォワード再構成モデルの新たなアプローチを提案し、静的および動的シーンの再構成精度と効率を向上させます。アーキテクチャの改良により、GPUメモリ使用量を約30%に抑えつつ、15倍の監視付きデータを活用。レジスタを用いたコンパクトな情報表現により、フレーム間の情報交換を効率化しました。VGGT-Ωは複数のベンチマークで優れた結果を示し、Sintelでは従来ベストを77%上回る精度を達成。学習済みのレジスタは視覚・言語モデルの向上に貢献し、再構成が空間理解の強力なタスクとして機能する可能性を示しています。 Comment
pj page: https://vggt-omega.github.io/
元ポスト:
関連:
- [Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
[Paper Note] (Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models, Maksim Zhdanov+, ICLR'26, 2026.04
Paper/Blog Link My Issue
#Transformer #ICLR #One-Line Notes #SparseAttention #Author Thread-Post Issue Date: 2026-05-27 GPT Summary- 本研究では、MLベースの気象予測のスペクトル劣化に対応する確率的モデル「Mosaic」を提案。三つの故障モードを扱い、アンサンブルメンバーを生成する。1.5°解像度で214Mパラメータを持つMosaicは、高解像度モデルに匹敵する性能を示し、ほぼ完璧なスペクトル整合性を達成。予報は高速に実行可能で、コードも公開中。 Comment
元ポスト:
block-sparse attentionによるtransformerベースの天気予報モデル
[Paper Note] ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop, Yining Hong+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #VisionLanguageModel #Robotics #SpatialUnderstanding #EmbodiedAI #Simulation Issue Date: 2026-05-27 GPT Summary- 空間知性は行動を通じて展開し、エージェントは能動的に観察を行い、見えない構造を明らかにする。新たに導入したESI-BENCHは、具現化された空間知性のベンチマークで、エージェントは知覚、移動、操作をもとに行動を選定し、タスク関連の証拠を蓄積する。実験により、能動的探索が受動的アプローチを上回り、エージェントは自発的に新たな戦略を見出すことが確認された。3Dグラウンディングは推論を安定させる一方、不完全な表現は逆に有害であり、モデルは証拠の質に依存せず早期に結論に達する傾向がある。 Comment
元ポスト:
pj page: https://esi-bench.github.io/
[Paper Note] LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation, Yukang Chen+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#LongContext #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #LowPrecision Issue Date: 2026-05-27 GPT Summary- LongLive-2.0は、長編動画生成のためのNVFP4ベースの並列基盤を提供し、速度とメモリの問題を解決する。Balanced SPによるシーケンス並列自己回帰訓練を導入し、効率的な教師強制レイアウトを実現。従来手法と異なり、拡散モデルを直接調整し、リアルタイム生成へ変換可能。推論においては、NVFP4量子化を用いたKVキャッシュによってメモリ節約を図り、最大2.15倍の速度向上を達成。初のNVFP4訓練システムとして、高速な推論(45.7 FPS)を実現。 Comment
pj page: https://nvlabs.github.io/LongLive/LongLive2/
元ポスト:
関連:
- [Paper Note] LongLive: Real-time Interactive Long Video Generation, Shuai Yang+, arXiv'25, 2025.09
[Paper Note] MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation, Yuta Oshima+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#Dataset #Evaluation #TextToImageGeneration #LLM-as-a-Judge #CVPR #2D (Image) #ImageSynthesis Issue Date: 2026-05-26 GPT Summary- マルチ参照生成モデルは複数の参照画像から新たな文脈で被写体を描画するが、既存のデータセットは単一もしくは少数の参照に偏っているため性能評価に限界がある。本研究では、マルチ参照設定に特化したMultiBananaを提案し、参照数やドメイン不一致、スケール不一致、まれな概念、多言語テキストに関する問題を網羅してモデルの限界を評価する。分析により性能と改善点を明らかにし、公正な比較のための標準化された基盤を提供する。 Comment
元ポスト:
[Paper Note] AMUSE: Anytime Muon with Stable Gradient Evaluation, Jueun Kim+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Optimizer #Finetuning #Stability #Backbone #One-Line Notes #Author Thread-Post #Scheduler-free Issue Date: 2026-05-26 GPT Summary- Muonの直交化は、勾配の振動を引き起こす高曲率部分空間の影響を受けつつ、訓練の進展を加速する。一方、Anytime Muon(AMUSE)は、迅速な適応を図るために時間変化する補間係数を利用し、安定した平均化を通じて振動を抑制する。AMUSEは学習率スケジュールを排除し、視覚タスクと大規模言語モデルの事前トレーニングにおいて、性能を一貫して向上させる。 Comment
元ポスト:
以下、上記著者ポストからの要約である。
MuonとScheduler-freeなoptimiserでの過去のtrajectoryの平均的な方向へ更新する考え方を組み合わせて、Muonの学習を安定させ、かつSchduler-freeを実現した模様。具体的には学習初期にはMuonの軌道を重視し、学習後半になるにつれ、ノイズの影響を低減するためにtrajectoryの平均方向に最適化する(時間変化する補完係数によって挙動が制御される)といったイメージのようである。
Muonがなぜうまくいくかの理論的な分析も実施されている。近年は損失関数の幾何構造をriver/valleyのようにたとえて表現するらしく、(Figure 1)、SGDは曲率の高い(勾配が急)な方向への更新される傾向があり振動をしながら川方向へ進むようだが、Muonはriver方向(曲率は小さいがモデルが最も学習が進捗する方向)への更新を増幅する働きがあるようである。しかし、ノイズとなる高曲率な谷方向への更新も増幅してしまいそれが振動や不安定さを生むため、それを是正するためにSchedule Freeな手法を組み合わせている、という気持ちのようである。また、先行研究に記載がある通り、WSDスケジューラをriver-valleyで説明する、Stableフェーズが川に沿った更新を促進し、Decayフェーズはパラメータを谷の底へ収束させる役割を果たしている、というイメージのようである。
[Paper Note] VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models, Alex S. Huang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #Evaluation #Reproducibility #Robotics #VisionLanguageActionModel #Reading Reflections #Author Thread-Post Issue Date: 2026-05-23 GPT Summary- VLAモデルの実世界評価に向けた低コスト且つ再現性の高いベンチマークVLA-REPLICAを提案。市販部品で構築し、多様な操作タスクとデータセットを提供。実験により、再現性を確認し、モデルの特性を明らかに。 Comment
元ポスト:
再現可能なベンチマークを作るのはロボティクスのような物理的な検証環境が必要なタスクの場合は確かに難しそうだな、と思うなどした(小並感)。オブジェクトの配置や景観、実際のロボットのパーツなど外的な要因が非常に多い気がする。
[Paper Note] Qwen-Image-VAE-2.0 Technical Report, Zekai Zhang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#DiffusionModel #VariationalAutoEncoder #Architecture #2D (Image) Issue Date: 2026-05-21 GPT Summary- Qwen-Image-VAE-2.0は、高圧縮のVariational Autoencodersで、再構成忠実度と拡散可能性の向上を実現。Global Skip Connectionsや拡張された潜在チャネルを利用し、数十億枚の画像で訓練された合成レンダリングエンジンを導入。潜在空間の収束をサポートするため、高度なセマンティック整合戦略を実施。計算効率を最適化するため、非対称なエンコーダ-デコーダを採用。また、新しいベンチマークOmniDoc-TokenBenchを提案し、Qwen-Image-VAE-2.0は卓越した再構成性能と高圧縮性、優れた拡散性を持つことが示された。 Comment
元ポスト:
[Paper Note] Generative Recursive Reasoning, Junyeob Baek+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #LanguageModel #Architecture #Test-Time Scaling #read-later #Selected Papers/Blogs #Encoder-Decoder #LatentReasoning #RecursiveModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-21 GPT Summary- 将来のニューラル推論システムにおける拡張計算の実装として、Generative Recursive reasoning Models (GRAM)を提案。GRAMは、再帰的潜在推論を確率的な複数の潜在軌道に変換し、条件付き推論や無条件生成を可能にする。これにより、従来の決定論的モデルよりも改善された性能を示し、構造化推論や制約充足タスクにおいて有効性を発揮。 Comment
pj page: https://ahn-ml.github.io/gram-website/
元ポスト:
先行研究:
- [Paper Note] Looped Transformers are Better at Learning Learning Algorithms, Liu Yang+, ICLR'24
- [Paper Note] Hierarchical Reasoning Model, Guan Wang+, arXiv'25
- [Paper Note] Less is More: Recursive Reasoning with Tiny Networks, Alexia Jolicoeur-Martineau, arXiv'25, 2025.10
全然まだ理解できていないが、depth(iterative refinement)のみではなく、width(multiple parallel trajectories)方向にinference-time scaling可能なrecursiveなアーキテクチャの提案で、
LoopedTransformerのようなモデルはdeterministicな推論プロセスなため単一の軌跡に収束する(同じ入力に対して同じ出力をする)が、本研究では再帰的な推論プロセスにおいて、deterministicなhidden stateの推論に加えて、確率的でlearnableなguidance ε_t(ε_tの分散の大きさによって探索の度合いを変化させられる)をサンプリングして加えることで、多様なlatent trajectoryを生成可能にするで、自然なparallel inference-time scalingを可能にする
という感じだろうか。
[Paper Note] Qwen-Image-2.0 Technical Report, Bing Zhao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#NLP #MultiModal #DiffusionModel #TextToImageGeneration #VisionLanguageModel #2D (Image) #Editing #ImageSynthesis Issue Date: 2026-05-14 GPT Summary- Qwen-Image-2.0は、高忠実度の生成と正確な画像編集を統合したオムニ機能を持つ画像生成モデルで、テキスト描写や複雑な構図への対応を強化。Qwen3-VLを条件エンコーダとして利用し、Multimodal Diffusion Transformerで条件と出力を同時にモデリング。最大1,000トークンの指示をサポートし、多言語のテキスト忠実度を向上、フォトリアリスティックな生成を実現。広範な人間評価で従来モデルを上回る性能を示し、実用的な画像生成モデルへの進展を果たす。 Comment
元ポスト:
[Paper Note] MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction, Junbo Cui+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #SpeechProcessing #Speech #SmallModel #OpenWeight #VisionLanguageModel #2D (Image) #3D (Video) #Omni #audio #text #Realtime #SpeechToSpeech Issue Date: 2026-05-12 GPT Summary- MiniCPM-o 4.5は、リアルタイムの全二重オムニモーダル対話を実現する最新の進展であり、視覚・聴覚・発話を同時に処理可能。Omni-Flowを用いた統一的なフレームワークにより、知覚と応答を融合させ、能動的な行動を促進する。90億パラメータを持ち、Gemini 2.5 Flashに近い性能を発揮し、エッジデバイス上でもリアルタイム処理が可能となる。 Comment
HF: https://huggingface.co/openbmb/MiniCPM-o-4_5
元ポスト:
[Paper Note] Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models, Issa Sugiura+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #Japanese #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-12 GPT Summary- 日本語のVQAシステムに対する高品質なデータセットJagleを紹介。約920万件のインスタンスを含み、異種ソースから生成したVQAペアを用いて多様なタスクをカバー。Jagleで学習した2.2Bモデルは、日本語タスクで高い性能を示し、既存のモデルを上回る結果を得た。さらに、JagleをFineVisionと統合することで英語でも性能向上が確認され、データセットとモデルを公開し再現性を促進。 Comment
pj page: https://speed1313.github.io/Jagle/
dataset: https://huggingface.co/datasets/llm-jp/Jagle
元ポスト:
データセットのサイズが9Mと非常に大規模で、日本語性能を大幅に改善するだけでなく、FineVisionのような英語のVQAデータセットとハイブリッドで用いることで英語タスクの性能も改善する。
[Paper Note] Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark, Kai Zou+, ACL'26, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #ACL #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-08 GPT Summary- Uni-MMMUを提案し、視覚的理解と生成の統合を推進するための新しいベンチマークを構築。科学、プログラミング、数学、パズルなどの推論中心ドメインにおいて、生成と理解の相乗効果を評価。モデルは概念的理解を視覚合成に、生成を分析的推論に活用するタスクに挑む。再現可能な評価プロトコルを導入し、モデル間の性能差と依存性を明らかにし、統合モデルの進展に貢献。 Comment
pj page: https://vchitect.github.io/Uni-MMMU-Project/
元ポスト:
processとresultの両面を評価できるのが特徴のように見える
[Paper Note] Let ViT Speak: Generative Language-Image Pre-training, Yan Fang+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#Pretraining #NLP #Transformer #MultiModal Issue Date: 2026-05-08 GPT Summary- GenLIPは、視覚トークンから直接言語トークンを予測する生成前訓練フレームワークで、マルチモーダル大規模言語モデル向けに設計されています。この手法は、単一のトランスフォーマーを用いて視覚とテキストを共同でモデル化することで簡潔性を持ち、データやモデルのスケーラビリティを高めるとともに、多様なベンチマークで優れた性能を示します。80億サンプルで訓練されたGenLIPは、限られた事前訓練データで強力な成果を上げ、さらにOCRやチャート理解などの細部に敏感なタスクでも改善が見られます。 Comment
元ポスト:
[Paper Note] Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation, Zhiheng Liu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#MultiModal #UMM #Pixel-based Issue Date: 2026-04-29 GPT Summary- Tuna-2は、視覚理解と生成をピクセル埋め込みに基づいて行うネイティブな統一型マルチモーダルモデルであり、従来のモジュラーなビジョンエンコーダ設計を廃止。シンプルなパッチ埋め込み層を採用することでモデルを簡略化し、高品質な画像生成が可能であることを実証。特に、規模が大きくなると細粒度の視覚知覚タスクに強い性能を発揮し、事前学習済みビジョンエンコーダの必要性を否定。エンドツーエンドのピクセルスペース学習が視覚表現の強化につながることを示した。 Comment
元ポスト:
Tuna-2のようなvision encoderを不要とするnative multi-modal modelsについて反論する意見:
vision encoderを利用する利点として
- 再利用が可能な点
- pixel-spaceで計算をするnative multi-modal modelと比較して、feature spaceでの計算を促進するvision encoderはより高速
- vision encoderを用いることで、LLMにどの程度のトークンを入力するかを調整することが可能となり、これがコスト削減となる(これが最も重要)
ということのようである。
[Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #VisionLanguageModel #WorldModels #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- AIシステムの目標達成能力の向上には、環境のダイナミクスをモデル化することが必要不可欠である。この研究では、能力レベル(L1からL3)と支配法則(物理、デジタル、社会、科学)を軸にした「levels x laws」分類法を導入し、400件以上の研究を統合して、AIの世界モデルの制約と失敗モードを示す。提案する評価原則と最小再現可能なパッケージがアーキテクチャの指針を提供し、分断されたコミュニティの統合を目指す。最終的には、より予測可能で再構築可能な環境モデルへと進む道筋を示す。 Comment
pj page: https://agentic-world-modeling.xyz/
元ポスト:
著者ポスト:
分野ごとに意味が異なるWorld Modelsを統合的に分類できる枠組みを提案しているSurveyで、Levels * Laws のtaxonomyで分類する。Levelsとはどのような能力を持つか、
- L1: L1 Predictor, 1ステップの予測
- L2: L2 Simulator, 複数ステップのシミュレーション/反実仮想のロールアウト
- L3: L3 Evolver, 失敗からの進化
LawsはWorld Modelsがどのような制約に従わなければならないかという視点で
- Physical: 物理法則
- Digital: program semantics
- Social: 社会規範
- Scientific: scientific mechanism
によって構成される、といった話が著者ポストに記述されている。論文を見ると、個々のtaxonomyについては、より多様な観点を含むようである。
[Paper Note] SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture, Haiwen Diao+, arXiv'26, 2026.05
Paper/Blog Link My Issue
#MultiModal #TextToImageGeneration #read-later #UMM #ImageSynthesis #Pixel-based #Author Thread-Post Issue Date: 2026-04-28 GPT Summary- NEO-unifyを基盤としたSenseNova-U1は、理解と生成を統合した新しいマルチモーダル・パラダイムを提示。SenseNova-U1-8B-MoTとSenseNova-U1-A3B-MoTの2つのバリアントは、テキスト理解や視覚—言語生成で高い性能を発揮し、強力なセマンティック一貫性を提供。詳細な設計と推論戦略を通じて、視覚—言語—行動シナリオでも優れた結果を示し、マルチモーダルAIの進化を提唱。 Comment
元ポスト:
後ほどプレプリントが出るようである
公式ポスト:
code:
https://github.com/OpenSenseNova/SenseNova-U1
学習データのサンプル:
https://huggingface.co/datasets/sensenova/SenseNova-U1-Training-Sample
[Paper Note] WorldMark: A Unified Benchmark Suite for Interactive Video World Models, Xiaojie Xu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Evaluation #read-later #Selected Papers/Blogs #WorldModels #interactive Issue Date: 2026-04-26 GPT Summary- WorldMarkは、インタラクティブなImage-to-Videoワールドモデルのための初の共通ベンチマークを提供。これにより、6つの主要モデルを同一条件下で比較可能にするためのアクションマッピング、500件の評価ケースを含むテストスイート、およびモジュール式の評価ツールキットを提供。すべてのデータとコードは公開され、オンラインプラットフォームでのリアルタイム対戦も可能。 Comment
pj page: https://alaya-studio.github.io/WorldMark/
元ポスト:
interactiveなWorldModelsを統一的に評価できる評価スイートなようなので、こういった研究はこれまでにないような気がしており、重要研究に感じる。
[Paper Note] Sapiens2, Rawal Khirodkar+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Pretraining #Transformer #ContrastiveLearning #Self-SupervisedLearning #ICLR #Encoder #Backbone #needs-revision #2D Reconstruction Issue Date: 2026-04-25 GPT Summary- Sapiens2は、高解像度トランスフォーマーのモデルファミリーで、人間中心のビジョンを重視する。4億〜50億パラメータを持ち、ネイティブ1K解像度を採用し、4K対応の階層的バリアントも提供。事前学習と後学習で大幅な性能向上を実現し、マスク済み画像再構成と自己蒸留型対比学習を統合したアプローチを採用。10億枚の高品質な人体画像データセットで事前学習を行い、アーキテクチャの進歩により安定性を向上。ポーズ推定や身体部位セグメンテーションなどのタスクで新たな最先端性能を達成。 Comment
openreview: https://openreview.net/forum?id=IVAlYCqdvW
元ポスト:
HF: https://huggingface.co/facebook/sapiens2
人物ドメインに特化したViTエンコーダ。事前学習はEncoder-Decoderアーキテクチャを利用しMasked Image Modelingで学習する。この際に、Reconstruction lossだけでなく、
[Paper Note] Visual Jigsaw Post-Training Improves MLLMs, Penghao Wu+, ICLR'26, 2025.09
Paper/Blog Link My Issue
#NLP #Temporal #ReinforcementLearning #MultiModal #Self-SupervisedLearning #ICLR #PostTraining #RLVR #VisionLanguageModel #2D (Image) #3D (Scene) #3D (Video) #SpatialUnderstanding Issue Date: 2026-04-25 GPT Summary- 視覚理解を強化するための自己教師付きポストトレーニングフレームワーク「Visual Jigsaw」を提案。視覚入力を分割・シャッフルし、モデルは正しい順列を自然言語で出力。これにより強化学習と一致し、追加の視覚生成なしで自動的に監督信号を得る。広範な実験で知覚、時間的推論、3D理解の改善を確認し、視覚中心タスクの可能性を示唆。 Comment
pj page: https://penghao-wu.github.io/visual_jigsaw/
openreview: https://openreview.net/forum?id=tBf2SUzfZw
元ポスト:
[Paper Note] PLaMo 2.1-VL Technical Report, Tommi Kerola+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #SmallModel #Japanese #read-later #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- 自動運転向けの軽量なVision Language Model(VLM)PLaMo 2.1-VLを紹介。8Bと2Bのバリアントがあり、日本語対応のエッジ展開が可能。視覚質問応答に特化し、工場タスク分析とインフラの異常検知で評価。日本語のトレーニングリソースを整備し、JA-VG-VQA-500で61.5のROUGE-L、Japanese Ref-L4で85.2%の精度を達成。工場で53.9%のゼロショット精度、ファインチューニングにより異常検知のF1スコアが39.7から64.9に改善。 Comment
関連:
- GENIAC第3期で自律稼働デバイス向けの軽量な大規模視覚言語モデルPLaMo 2.1-8B-VLを開発, PFN, 2025.12
元ポスト:
[Paper Note] Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding, Daisuke Oba+, ICLR'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #ICLR #Decoding #Author Thread-Post Issue Date: 2026-04-25 GPT Summary- SureLockは、マスク済み拡散型言語モデルにおいて、未マスクトークンをロックすることで計算資源を効率化します。具体的には、未マスク位置の事後分布が安定した場合、その位置に対するクエリ投影とフィードフォワードをスキップしつつ、他の位置がアテンションできるようにキャッシュを使用します。この手法により、計算コストがO(N^2d)からO(MNd)に削減され、生成品質を維持しつつFLOPを30〜50%削減します。理論分析も行い、ロック時点でKLを監視することでトークン確率の偏差を十分に境界づけることができることを示しています。 Comment
pj page: https://daioba.github.io/surelock/
元ポスト:
著者ポスト2:
[Paper Note] Context Unrolling in Omni Models, Ceyuan Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #SpeechProcessing #Reasoning #VisionLanguageModel #2D (Image) #3D (Scene) #UMM #3D (Video) #Omni #One-Line Notes #Reference Collection #AudioLanguageModel #Fidelity #audio #text Issue Date: 2026-04-24 GPT Summary- Omniは、多様なモダリティにネイティブに訓練されたマルチモーダルモデルで、Context Unrollingを通じて異なるモダリティの情報を統合。これにより、下流の推論忠実度が向上し、高い生成・理解性能を発揮。テキスト、画像、動画、3Dジオメトリを用いた高度な推論能力を示す。 Comment
元ポスト:
モダリティを跨いでtaskに対してrelevantなcontextを活性化させることで、omniモデルの生成時の推論能力と、忠実度を向上させる
[Paper Note] Image Generators are Generalist Vision Learners, Valentin Gabeur+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Pretraining #FoundationModel #read-later #Selected Papers/Blogs #2D (Image) #UMM #Author Thread-Post Issue Date: 2026-04-23 GPT Summary- 画像生成モデルがゼロショット視覚理解を示すことは、LLMsの言語理解能力に似ている。視覚モデルは強力な理解能力を持つことが証明されておらず、本研究では画像生成がLLMの事前学習に似た役割を果たすことを示す。Vision Bananaを導入し、指示調整を行い、さまざまな視覚タスクで最先端の性能を達成。特に、セグメンテーションや深度推定タスクで競争力のある結果を得ており、画像生成が視覚学習において重要な役割を果たすことを示唆。生成的視覚の事前学習は、理解と生成の基盤となるFoundational Vision Modelsの構築において重要な変革をもたらす可能性がある。 Comment
pj page: https://vision-banana.github.io/#capabilities
元ポスト:
著者ポスト:
所見:
Vision bananaの批判に対する第一著者によるレスポンスのサマリのようである:
[Paper Note] Qwen3.5-Omni Technical Report, Qwen Team, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #LanguageModel #SpeechProcessing #Speech #Proprietary #MoE(Mixture-of-Experts) #2D (Image) #TTS #Omni #text Issue Date: 2026-04-22 GPT Summary- Qwen3.5-OmniはQwen-Omniモデルファミリーの最新進展で、数百億パラメータと256kのコンテキスト長を持ち、テキスト-ビジョン対とオーディオ視覚コンテンツを利用したオムニモーダリティ能力を発揮します。215のサブタスクでSOTA結果を達成し、Gemini-3.1 Proを上回る性能を示しました。Hybrid Attention MoEフレームワークを採用し、長シーケンス推論を効率化。ARIAにより音声合成の安定性を向上させ、10言語で人間の感情ニュアンスをサポート。優れた音声-視覚グラウンディング能力を持ち、音声-視覚指示に基づく直接コーディングを実現する新たな機能も観察されています。 Comment
元ポスト:
[Paper Note] GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents, Mingyu Ouyang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #AIAgents #Evaluation #MultiModal #ComputerUse #read-later #Selected Papers/Blogs #VisionLanguageModel #Game #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-19 GPT Summary- MLLMエージェントの課題を解決するため、テストベッドとしてGameWorldを導入。34のゲームと170のタスクを含み、性能評価を標準化。結果はエージェントが人間の能力には及ばないことを示唆。ゲームエージェントの相互作用や記憶、アクション妥当性に関する研究が今後の課題を明らかに。再現性のある評価フレームワークとして、GameWorldはマルチモーダルゲームエージェント研究の進展を促進。 Comment
元ポスト:
Geminiがポケモンで評価されていたのと似ている。個人的にこの方向性の評価は非常に興味深く、理由としては
- ゲームをプレイしたデータはモデルの中の知識(学習データ)として埋め込まれずらく、コンタミネーションが生じづらい
- 知識がないのであれば、プレイして、ゲームという名の仮想世界のルールを理解してゲームをクリアせねばならず、これには高度な認知能力、プランニング、Reflectionなどの能力が求められる
- これらの能力が発揮されるには学習データのパターンから学習した手続きの適用よりも、より抽象的な理解が求められ、モデルがどれだけ人間の認知に近い能力を獲得しているかを測定できるのでは
という感想を持っているからである。
pj page: https://gameworld-project.github.io/
[Paper Note] RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time, Haozhe Wang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Multi #NLP #TextToImageGeneration #Reasoning #OpenWeight #Test-Time Scaling #read-later #Selected Papers/Blogs #RewardModel Issue Date: 2026-04-19 GPT Summary- 報酬モデルは、評価を単一のスコアに縮約するのではなく、明示的で多次元の批評を生成することで、生成物の改善を促進する。本研究では、構造化された合理根拠を用いて報酬を提供し、Generate-Critique-Refineループにより批評をプロンプト修正に変換する方法を示す。また、Preference-Anchored Rationalization(PARROT)を導入し、容易に得られるデータから高品質な合理根拠を回収するフレームワークを提供する。得られたRationalRewardsモデルは、オープンソースの中で最先端の予測精度を達成し、より少ない訓練データで優れた性能を発揮する。批評-修正ループは、既存モデルの潜在能力を引き出し、より良い生成結果を提供する。 Comment
pj page: https://tiger-ai-lab.github.io/RationalRewards/
元ポスト:
[Paper Note] Geometric Context Transformer for Streaming 3D Reconstruction, Lin-Zhuo Chen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #LongContext #3D Reconstruction #3D (Scene) #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- ストリーミング3D再構成は、ビデオから3D情報を復元する技術で、精度や効率が求められる。LingBot-Mapは、SLAMの原理に基づいたフォワード型の3D基盤モデルで、幾何学的文脈トランスフォーマーを使用している。特徴的な注意機構は、アンカー文脈や軌跡メモリを活用し、長距離ドリフト補正を実現。これにより、長いシーケンスでも安定した推論が可能となり、従来手法に対して優れた性能を示した。 Comment
元ポスト:
pj page: https://huggingface.co/robbyant/lingbot-map
高速でlong contextでもstreaming形式で生成が可能な3D Reconstructionモデルのようである
[Paper Note] Generative Refinement Networks for Visual Synthesis, Jian Han+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#DiffusionModel #read-later #ImageSynthesis #Initial Impression Notes Issue Date: 2026-04-17 GPT Summary- 自己回帰モデルの課題に対処するため、Generative Refinement Networks(GRN)を提案。GRNは階層的2値量子化によるボトルネックを解消し、AR生成を「人間の画家」による作品の完成に似たプロセスで向上させる。エントロピー誘導型サンプリング戦略を取り入れ、複雑さに応じた適応的ステップ生成を実現した。ImageNetベンチマークで新記録を達成し、テキストから画像・動画生成へと性能を拡張。全てのモデルとコードは公開済み。 Comment
元ポスト:
予測されたトークンを削除・更新し洗練することが可能な新たなアーキテクチャらしい
[Paper Note] WildDet3D: Scaling Promptable 3D Detection in the Wild, Weikai Huang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Dataset #Transformer #Prompting #Architecture #read-later #Selected Papers/Blogs #3D (Scene) #ObjectDetection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-17 GPT Summary- 単一画像から3D物体を検出するために、WildDet3Dという統一的幾何認識アーキテクチャを提案。テキスト・点・ボックスのプロンプトを受け入れ、深度信号を組み込む。新しいオープン3DデータセットWildDet3D-Dataを生成し、13,500カテゴリの100万枚以上の画像を提供。複数のベンチマークで最先端の性能を達成し、特に深度手掛かりの活用により、平均+20.7 APの向上を実現。 Comment
pj page: https://allenai.github.io/WildDet3D/
元ポスト:
最大級の3D detection data+アーキテクチャの提案
training codeなどがリリース:
https://github.com/allenai/WildDet3D
[Paper Note] Lyra 2.0: Explorable Generative 3D Worlds, Tianchang Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Transformer #DiffusionModel #LongContext #read-later #VideoGeneration/Understandings #3D Reconstruction #3D (Scene) #WorldModels #SpatialUnderstanding Issue Date: 2026-04-16 GPT Summary- Lyra 2.0は、持続可能で探索可能な大規模3D世界を生成するフレームワークを提案。空間的忘却には3Dジオメトリを保持し、視点に応じた過去フレームを取得することで対応。時系列的ドリフトには自己拡張ヒストリーを活用し、誤差を訂正することで改善。これにより、長く一貫性のある動画軌道を実現し、高品質な3Dシーンの復元に活かす。 Comment
HF: https://huggingface.co/nvidia/Lyra-2.0
pj page: https://research.nvidia.com/labs/sil/projects/lyra2/
元ポスト:
[Paper Note] Seedance 2.0: Advancing Video Generation for World Complexity, Team Seedance+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #MultiModal #Proprietary #VideoGeneration/Understandings #audio #TextToVideoGeneration #ImageToVideoGeneration Issue Date: 2026-04-16 GPT Summary- Seedance 2.0は新しい多モーダル音声・映像生成モデルで、480pおよび720pの解像度で4〜15秒のコンテンツを生成可能。テキスト、画像、音声、映像を統一的に扱い、先行モデルより多様な機能を提供。専門家評価で最先端な性能を示し、低遅延用に改善されたFast版も提供。ユーザーに強化されたクリエイティブ体験を提供。 Comment
pj page: https://seed.bytedance.com/en/seedance2_0
元ポスト:
[Paper Note] Introspective Diffusion Language Models, Yifan Yu+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Initial Impression Notes Issue Date: 2026-04-14 GPT Summary- 内省的受容率を定義し、拡散型言語モデル(DLM)の品質向上を目指す。新たに提案されたIntrospective Diffusion Language Model(I-DLM)は、ARトレーニングの内省的一貫性を保ちながら並列デコードを実現する。I-DLMは新しい内省的ストライドデコード(ISD)アルゴリズムを使用し、静的バッチスケジューラで最適化。従来のDLMを上回り、AIME-24で69.6、LiveCodeBench-v6で45.7の性能を達成。これにより、スループットが3倍向上し、大規模サービスへの対応力も強化。 Comment
元ポスト:
github: https://github.com/Introspective-Diffusion/I-DLM
8B級のスケールでARモデルと15種類のベンチマークで同等程度の性能を達成し、large batchsizeでスループットが3.8倍のdLMとのこと。
[Paper Note] A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens, Tommie Kerssies+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#EfficiencyImprovement #CVPR #read-later #Selected Papers/Blogs #WorldModels #One-Line Notes #Author Thread-Post Issue Date: 2026-04-11 GPT Summary- ビデオ世界モデリングにおいて、多様な未来状態を効率的に予測するために、DeltaTokというトークナイザーを導入。これによりVFM特徴の差を連続的な「デルタ」トークンにエンコードし、DeltaWorldという生成的世界モデルを提案。これにより、ビデオを一次元の時系列に圧縮、512×512フレームでトークン数を1,024倍削減。多仮説訓練を通じて多様な未来を平行に生成し、単一のフォワードパスで多様な予測を得られる。実験結果においてDeltaWorldは、従来のモデルよりもパラメータ数が35倍、FLOPsは2000倍少ないにもかかわらず、現実に近い未来を予測することを示した。 Comment
過去と現在のフレームを入力し差分の潜在表現を出力するDeltaEncoderを学習し、潜在表現に基づいてnext token predictionをする(複数の推論結果を出力させ、最も学習データに近いものを用いて学習する。複数の候補を出力するため推論時は多様な候補を得られる)。
これにより、予測に必要なトークン数が大幅に削減され(Dino-basedなモデルと比較して1024--2048倍)、パラメータ数が削減されFLOPSも低下(generative modelsと比較して、35倍パラメータ数が小さく、2000倍計算に要するFLOPSが低下)。
といった話が著者ポストで説明されている。
[Paper Note] Vero: An Open RL Recipe for General Visual Reasoning, Gabriel Sarch+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #ReinforcementLearning #Reasoning #OpenWeight #OpenSource #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-04-08 GPT Summary- Veroというオープンな視覚推論モデルを導入し、幅広いタスクで優れた性能を達成。600Kサンプルのデータセットを基に、異なる回答形式を扱える報酬設計を行い、最先端の結果を示す。Veroは既存モデルを超え、系統的なアブレーションを通じて広範なデータカバレージの重要性を明示。他の全データ、コード、モデルを公開。 Comment
元ポスト:
ベースモデルはgivenな上でRLを実施する際のopenなレシピ、データである点に注意。
[Paper Note] JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation, Issa Sugiura+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #QuestionAnswering #Evaluation #Japanese #VisionLanguageModel #2D (Image) Issue Date: 2026-04-07 GPT Summary- 日本語のVQAベンチマークの信頼性向上のため、JAMMEvalを導入。7つの既存データセットを人間アノテーションで精査し、データ品質向上。オープンウェイトとプロプライエタリVLMを評価し、モデル能力を正確に反映する評価スコアを生成。データセットとコードを公開し、VLM評価の信頼性を進展。 Comment
HF: https://huggingface.co/datasets/llm-jp/JAMMEval
元ポスト:
[Paper Note] A Simple Baseline for Streaming Video Understanding, Yujiao Shen+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Analysis #LongContext #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #VisionLanguageModel Issue Date: 2026-04-05 GPT Summary- 最近のストリーミング動画理解手法は、複雑なメモリ機構に依存していますが、我々は単純な「SimpleStream」ベースラインを提案します。これは最近のNフレームを用いて、公開されたストリーミングモデルと同等以上の性能を示します。OVO-Benchで平均精度67.7%、StreamingBenchで80.59%を達成し、長い文脈の価値がモデルに依存し、知覚と記憶のトレードオフが存在することを明らかにします。これにより、複雑な機能の有用性を再評価する必要があることを示唆しています。 Comment
元ポスト:
所見:
[Paper Note] VOID: Video Object and Interaction Deletion, Saman Motamed+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#OpenWeight #VideoGeneration/Understandings #Editing #One-Line Notes Issue Date: 2026-04-05 GPT Summary- 動画オブジェクト除去での現行手法は、背景の修正や外観アーティファクトの処理には優れているが、オブジェクト間の衝突などの複雑な相互作用には対応できない。そこで、新たに提案するフレームワーク VOID は、物理的に妥当なインペインティングを実現する。Kubric と HUMOTO を使用して、相互作用を変更する反事実的データセットを生成し、ビジョン-言語モデルが影響を受けるシーンを特定。従来手法よりも一貫した動的挙動を保持することを実験で確認し、このフレームワークが動画編集モデルの進化に寄与すると期待される。 Comment
pj page: https://void-model.github.io/
元ポスト:
HF: https://huggingface.co/netflix/void-model
NetflixがHFに公開した初めてのモデルとのこと。動画中のobjectを削除することに特化したモデルのようで、単にobjectを削除し影や反射を無くすといった話だけでなく、そのobjectが消滅したことによって物理的な相互作用も反映させる(物体が落下するなど)ということらしい。
[Paper Note] Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate, Chen Yang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#EfficiencyImprovement #Robotics #VisionLanguageActionModel #EmbodiedAI #Realtime Issue Date: 2026-04-05 GPT Summary- VLAモデルを実世界のロボットタスクに展開する際の実行速度が重要であり、以前の研究ではGPUでの計算高速化方法が示されましたが、実際のロボットへの展開は未解決でした。本報告では、VLA駆動ロボットをエンドツーエンドで高速に動作させるための技術セットを提案し、精度と器用さを両立させる手法を説明します。この技術スタックは、校正、計画と制御、学習ベースの最適実行速度特定に広がり、ロボットが人間の操作に匹敵する速度で動作することを示しています。 Comment
元ポスト:
[Paper Note] Grounding World Simulation Models in a Real-World Metropolis, Junyoung Seo+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#read-later #WorldModels Issue Date: 2026-04-04 GPT Summary- 実際の都市を再現するSeoul World Model (SWM)を提案。SWMはストリートビュー画像を利用して動画を生成するが、時間的ズレやデータの希薄化という課題に直面。これに対処するために、クロス・ペアリングや視点補間パイプラインを導入し、仮想先読みシンクで生成を安定化。ソウルや釜山などで比較評価した結果、SWMは長距離動画の生成において空間的かつ時間的一貫性で既存手法を上回るとともに、多様なシナリオ変化にも対応できることを示した。 Comment
pj page: https://seoul-world-model.github.io/
元ポスト:
[Paper Note] PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference, Xiaofeng Mao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#DiffusionModel #LongContext #Architecture #read-later #VideoGeneration/Understandings #KeyPoint Notes #KV Cache Issue Date: 2026-04-04 GPT Summary- 自己回帰型ビデオ拡散モデルは、線形KVキャッシュ、時間的反復、長時間動画生成時の誤差累積という課題に直面している。これを解決するために、PackForcingという新しい三分割KVキャッシュ戦略を提案。過去の文脈をシンクトークン(高解像度保持)、ミッドトークン(トークン削減)、最近トークン(局所的整合性維持)の三種類に分類し、メモリフットプリントを抑制しつつ高品質の動画生成を実現。結果として、単一のH200 GPU上で2分間の動画を16FPSで生成し、KVキャッシュを4GBに留め、時系列外挿も効果的に行えることを示した。VBenchにおける結果も最先端を記録。 Comment
元ポスト:
動画生成における (1)エラーの蓄積、(2)生成される動画の長さに応じて線形に増加するKV Cache の問題に対処するために、以下に示すアーキテクチャを提案し、重要な情報(Sink Token, Recent Token)は高解像度で保持しつつ、中間トークン (Mid Token)は圧縮をすることで、
- どのような長さの動画生成でもattentionで考慮されるtoken数の上限を27,872 tokenに制限しながらも、
- 3D convolution + low resolution re-encodingによって中間トークンを1/32に効果的に圧縮し(メモリ効率27倍)
- memoryを圧縮することでRoPEの位置エンコーディングにgapが生まれるが、それを埋める方法を提案し
- 24倍のtemporal extrapolation (時間的な外挿)を実現。つまり、5秒のclipで学習したら、120秒の動画を一貫性のある形で生成できた
という話らしく、
Sink Tokenは高解像度な情報を保持し、Mid Tokensは圧縮+動的に選択 (3D / 4-stageのCNN + 低解像度のパッチ化) をすることで容量を削減し、Recent Tokensは高解像度を保持し、古くなってきたらMid tokensとして圧縮して格納される。
120sの生成をする場合にKV Cacheをフルで保持した場合(~138G)と比較して、4G程度にKV Cacheが抑えられており
そのうえで下記ベンチマークスコアを獲得しているようである。が、他の先行研究の手法はKV Cacheをどの程度消費するのだろうか?比較表のようなものがないと、すごさがちょっとよくわからない。たとえば Self-Forcing, Deep-Forcingは両方ともContext Length Lの範囲でKV Cacheを保持する手法であるため、Table 9 で言うところのwindow-onlyに相当する手法に見える。そうすると、KV Cacheの利用量としてはほとんど変わらず、ベンチマークスコアはSelf Forcingと比較すると大幅に向上しているようだが、Deep Forcingと比べるとどうなるだろうか。おそらく、Over Cons.が最も改善しているように見えるが、Quialitative Comparisonの節ではSelf-Forcingとの比較としての言及は多いが、Deep Forcingとの比較という面での言及はないように見える。
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
- [Paper Note] Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression, Jung Yi+, arXiv'25, 2025.12
[Paper Note] HippoCamp: Benchmarking Contextual Agents on Personal Computers, Zhe Yang+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Search #Dataset #AIAgents #Personalization #Evaluation #MultiModal #VisionLanguageModel #One-Line Notes #Environment Issue Date: 2026-04-04 GPT Summary- HippoCampは、エージェントのマルチモーダルファイル管理能力を評価する新しいベンチマーク。ユーザー中心の環境でエージェントを評価し、個々のユーザープロファイルをモデル化し、膨大な個人ファイルを検索。42.4 GBに及ぶ2,000件以上の実世界ファイルから581のQAペアを構築し、エージェントの検索や推論能力を評価。最先端のマルチモーダル大規模言語モデルは、ユーザープロファイリング精度が48.3%に留まり、個人ファイルシステムにおける検索や推論に苦戦。HippoCampは、現行エージェントの制約を浮き彫りにし、次世代AIアシスタント開発の基盤を提供。 Comment
pj page: https://hippocamp-ai.github.io/
元ポスト:
「私の水曜日の予定はなんですか?」といったような、user-centricなタスクにおける、ユーザ個人のcontextを含むファイル検索やプロファイリング、reasoningを必要とする、よりuser-centricな情報を扱う必要があるベンチマークのようである。ユーザのプロファイルやpersonal情報が格納されたEnvironmentが提供されている。
environment: https://hippocamp-ai.github.io/hippocamp/
[Paper Note] World Reasoning Arena, PAN Team+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Planning #Evaluation #Reasoning #read-later #Selected Papers/Blogs #WorldModels #LongHorizon #Simulation #Arena Issue Date: 2026-03-30 GPT Summary- WR-Arenaは、ワールドモデル(WMs)の評価を進化させるための包括的なベンチマークであり、次状態予測と視覚的忠実度に限らず、知的行動に必要なシミュレーション能力を検証します。三つの基本次元に焦点を当て、アクションシミュレーション忠実度、長期予測、シミュレーション推論と計画を評価します。多様なデータセットを使用して、既存モデルと人間レベルの推論との間のギャップを明らかにし、次世代WMsの指針を提供します。コードはhttps://github.com/MBZUAI-IFM/WR-Arenaで入手可能です。 Comment
元ポスト:
[Paper Note] ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning, Shengyuan Ding+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #MultiModal #CVPR #PostTraining #VisionLanguageModel #RewardModel #GenerativeVerifier #ToolUse Issue Date: 2026-03-25 GPT Summary- ARM-Thinkerは、視覚と言語の報酬モデルを向上させるためのエージェント型システムであり、外部ツールを自律的に活用して結果を検証可能にする。これにより、幻覚や視覚的グラウンディングの弱さを克服し、複数ページの証拠を比較して推論を支持する能力を持つ。多段階強化学習によって訓練され、ツール呼び出しの意思決定と判断精度を最適化。新たに導入したARMBench-VLで評価した結果、報酬モデリングで平均+16.2%、ツール使用タスクで+9.6%の改善を達成。エージェント的なアプローチが精度と解釈性の向上に寄与することを示している。 Comment
元ポスト:
元ポスト:
[Paper Note] MolmoWeb: Open Visual Web Agent and Open Data for the Open Web, Tanmay Gupta+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #MultiModal #OpenWeight #OpenSource #ComputerUse #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #GUI Issue Date: 2026-03-24 GPT Summary- MolmoWebは、ウェブエージェントをオープンな環境で構築するために、(1) 大規模な混合データセットMolmoWebMixと、(2) 完全オープンなマルチモーダルエージェントのMolmoWebを提案。MolmoWebMixは、10万超の合成タスクと3万件以上の人間デモを統合し、エージェントは視覚言語アクションポリシーを用いて次のブラウザ操作を予測。MolmoWebエージェントは同規模の他のモデルを上回る性能を示し、再現性とオープンな研究を促進するために関連リソースを公開。 Comment
元ポスト:
github:
https://github.com/allenai/MolmoWeb
学習、評価ハーネス、アノテーションツール、合成データパイプライン、デモのclient sideのコードがリリース
Molmo2をベースにしたオープンソースのBrowser Useエージェント。スクリーンショットを通じて次のアクション(クリック、文字入力、スクロール)を予測し実行する。
従来のBrowser Useエージェントの多くは非公開データを用いている中、MolmoWebMixと呼ばれる大規模なデータセットを公開。合成データ(タスクに成功したsingleエージェントのtrajectory, タスクをサブタスクに分解して実行するタイプのmulti-agent pipeline, 数百のwebsiteのリンク構造を体系的に探索して構築されたナビゲーションの経路等)と人間に寄る高品質なアノテーション(36k, 1100タスク, 623k件の個別のサブタスクのデモンストレーションで、過去最大規模)の2種類で構成されるとのこと。
また、BroserのGUIを認識するための学習データも含まれる。これはGUIのgrounding taskと、webページの内容を読み取りながら推論を実施するスクリーンショットがgivenなQAタスクのデータとsて構成され、400程度のサイトから収集した、2.2MのQAペアによって編成される。
4種類のベンチマークで評価した結果、プロプライエタリモデルには一部及ばないものもあるが、同等規模なOpenWeightモデルをoutperform。また、WebVoyager, Online-Mind2Webデータでみると、Pass@4のようなtest-time scaling手法を用いると、プロプライエタリも出るを上回る。
ただ注意点としては、比較しているOpenWeightモデルが少し古いように見えるが、何か理由があるのだろうか。
Holoであれば、既にHolo3がリリースされており
- Holo3: Breaking the Computer Use Frontier, H Company, 2026.03
GLMであれば、GLM-4.6Vが存在する。
- GLM-4.6: Advanced Agentic, Reasoning and Coding Capabilies, Zhipu AI, 2025.09
(UI-TARS-2 [Paper Note] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn
Reinforcement Learning, Haoming Wang+, arXiv'25
はおそらくプロプライエタリなので対象外。あと使えるのかも不明。デモは公開されていた気がするが。)
いずれにせよHoloやUI-TARSなどはデータが公開されていなかったと思うので、全てを公開することによるcontributionは非常に大きいと思われる。
ベンチマーク関連:
- [Paper Note] WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models, Hongliang He+, ACL'24, 2024.01
- Online-Mind2Web
- [Paper Note] An Illusion of Progress? Assessing the Current State of Web Agents, Tianci Xue+, COLM'25, 2025.04
- [Paper Note] Mind2Web: Towards a Generalist Agent for the Web, Xiang Deng+, arXiv'23, 2023.06
とは異なるため注意
- [Paper Note] DeepShop: A Benchmark for Deep Research Shopping Agents, Yougang Lyu+, arXiv'25, 2025.06
- WebTailBench
- [Paper Note] Fara-7B: An Efficient Agentic Model for Computer Use, Ahmed Awadallah+, arXiv'25, 2025.11
[Paper Note] LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels, Lucas Maes+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #RepresentationLearning #read-later #Selected Papers/Blogs #Stability #WorldModels #Pixel-based #Author Thread-Post #LatentRepresentation Issue Date: 2026-03-24 GPT Summary- LeWorldModel(LeWM)は、原始ピクセルからエンドツーエンドで訓練できる最初のJoint Embedding Predictive Architecture(JEPA)を提案。従来の手法に比べ、調整可能な損失のハイパーパラメータを6個から1個に減らし、約1500万パラメータを持つLeWMは、ファウンデーションモデルより最大48倍速く学習。2Dおよび3Dの制御タスクで競争力を維持し、潜在空間が物理的構造を符号化していることを示す驚き評価も行われ、物理的に妥当でないイベントを検出する能力を確認。 Comment
元ポスト:
[Paper Note] V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning, Lorenzo Mur-Labadia+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#RepresentationLearning #Self-SupervisedLearning #read-later #WorldModels #LatentRepresentation Issue Date: 2026-03-22 GPT Summary- V-JEPA 2.1は、自己教師付きモデルで高品質な視覚表現を学習しつつ、強力なグローバルなシーン理解を維持します。密な予測損失により、可視トークンとマスクされたトークンが共に学習信号に寄与し、深い階層的な自己教師付き学習で表現の品質を向上。多モーダル・トークナイザーにより統一的な学習を実現し、モデル容量とデータのスケーリングを活かしています。これにより、空間的、意味的、時間的に一貫した表現を生成し、短期的物体相互作用やアクション予測で最先端の性能を達成。ロボットナビゲーションや深度推定でも高い結果を示し、密な視覚理解と世界モデリングの進展を証明しています。 Comment
元ポスト:
ポイント解説:
解説:
[Paper Note] Demystifing Video Reasoning, Ruisi Wang+, ECCV'26, 2026.03
Paper/Blog Link My Issue
#Analysis #DiffusionModel #Reasoning #ECCV #Selected Papers/Blogs #VideoGeneration/Understandings #reading #One-Line Notes Issue Date: 2026-03-21 GPT Summary- 動画生成モデルの推論メカニズムを再検討し、Chain-of-Frames (CoF) から Chain-of-Steps (CoS) への移行を提唱。モデルは初期のデノイズ過程で複数の候補解を探索し、漸進的に収束することを示す。新たな推論挙動として、作業記憶、自己修正、行動前の知覚を特定。さらに、拡散トランスフォーマー内での機能特化を明らかにし、訓練不要のアンサンブル戦略が推論を改善できることを提案。これにより、動画モデルの推論ダイナミクス理解の基盤を提供。 Comment
元ポスト:
pj page: https://www.wruisi.com/demystifying_video_reasoning/
拡散モデルに基づく動画生成モデルでは、フレームをsequentialに処理することで推論がされていく(Chain-of-Frames)と考えられてきたが、実際は拡散モデルのデノイジングのstepによって生じることを示し、
①初期のstepでは複数の候補並列に探索され、
②中盤では徐々に部分最適な解が枝刈りされ、
③後半に最終的なdecionに収束する
していく現象 Chain-of-Steps (CoS)を明らかにした、という話のようである。
また、推論能力に関する以下の三つの重要な性質を同定したとのこと:
- working memory (4.1)
- 推論のアンカーとなるobject等をデノイジングstepの過程で保持する(e.g., 初期位置, 位置の基準となるobject)
- self-correction and enhancement (4.2)
- 初期の不完全な回答を、デノイジングstepが進むにつれ洗練させる挙動(エラー訂正に限らず)で、これらは単一のデノイジングstepにおいて生じ、すべてのフレームにおいて同時に生じる(=フレーム方向に推論が進むのではなくstep方向に推論が進む)
- perception before action (4.3)
- 指示に対応するシーンの理解(対象のgrounding等)を試みた後に、その後動的なアクションを生成する
[Paper Note] DatBench: Discriminative, Faithful, and Efficient VLM Evaluations, DatologyAI+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Dataset #IRT #Evaluation #VisionLanguageModel Issue Date: 2026-03-21 GPT Summary- 基盤モデルの評価は研究の進展に不可欠だが、視覚言語モデル(VLM)の評価法は未成熟である。評価が満たすべき三つの条件(忠実性、識別性、効率性)を提案し、複数選択形式や盲目的に解ける問題、誤ラベルのサンプルがモデル評価に与える影響を分析。生成タスクへの変換やサンプルのフィルタリングを行うことで、能力の正確な識別と計算コストの削減を実現。DatBench-Fullを公開し、識別力を保ちながら速度を大幅に向上させることを目指した。この研究は、VLMの進化に合わせた持続可能な評価実践の方向性を示す。 Comment
LLMの評価はコストがかかるため、フルデータではなくサブセットで適切な評価結果が得られると嬉しい。既存のアプローチはrank correlationと呼ばれる手法が用いられ、これはフルデータで評価したモデルのランキングとサブセットで評価したモデルのランキングの相関を測ることでサブセットの評価をする。しかしこの手法には特定の評価suiteにoverfitしやすいという欠点がある。これを是正するためにIRTだぽいアプローチを採用(Raschモデルなどの一般的なIRTとしての定式化ではなさそうな点には注意)して、識別力の高いサンプルを選択してサブセットを構成する手法を提案しているとのこと。直感的にはモデル全体の平均正答率に対して、個々のモデルの平均正答率の分散が小さく、かつモデル全体の正解する確率と不正解となる確率の差分が大きいものを識別力が高いサンプルとみなす。要は強いモデルが一貫して正解し、弱いモデルが一貫して不正解となるサンプルを識別力が高いとみなす。
といった話が元ポストに書かれている。
元ポスト:
[Paper Note] HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions, Yukang Cao+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#3D Reconstruction #Robotics #3D (Video) #Simulation Issue Date: 2026-03-20 GPT Summary- HSImul3Rは、疎視点画像と単眼ビデオを用いた3D再構成の統一フレームワークです。従来の手法は、知覚とシミュレーションのギャップのために物理的制約に反することが多く、これを克服するために物理シミュレーターを監督者として利用し、人間のダイナミクスとシーンジオメトリを共同で改善する双方向最適化パイプラインを導入しました。シーン指向の強化学習で人間の運動を最適化し、シミュレーションのフィードバックを基にシーンジオメトリを改良します。また、新しいベンチマークHSIBenchも提案しています。実験により、HSImul3Rは安定した再構成結果を生み出し、実世界のヒューマノイドロボットへの展開が可能であることを示しました。 Comment
元ポスト:
[Paper Note] Qianfan-OCR: A Unified End-to-End Model for Document Intelligence, Daxiang Dong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-03-18 GPT Summary- Qianfan-OCRは、文書解析と理解を統合した40億パラメータの視覚-言語モデルで、直接画像からMarkdownへの変換を実現。多様なタスクをサポートし、明示的なレイアウト分析を行うためにLayout-as-Thoughtを導入、複雑なレイアウトの精度を向上。OmniDocBenchやOlmOCR Benchでのパフォーマンスが優れており、他の一般的なモデルを上回る結果を示した。 Comment
HF: https://huggingface.co/baidu/Qianfan-OCR
元ポスト:
VLMでOCRするタイプのモデルで様々なベンチマークでSoTA、かつ192 languageをサポートととのこと。試したい
[Paper Note] Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training, Fangfu Liu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Dataset #Self-SupervisedLearning #SpatialUnderstanding #One-Line Notes #Test Time Training (TTT) Issue Date: 2026-03-14 GPT Summary- 視覚的空間知能の強化を目指し、Streaming Visual Spatial IntelligenceのためのSpatial-TTTを提案。動画から空間証拠を記憶・整理するためにパラメータの一部を適応し、スライディングウィンドウ注意機構を採用。さらに、3D時空間畳み込みを導入し、幾何的対応と時間的連続性を捉える。実験結果は、長時間の空間理解を向上させ、最先端の性能を達成したことを示す。 Comment
pj page: https://liuff19.github.io/Spatial-TTT/
元ポスト:
HF: https://huggingface.co/collections/THU-SI/spatial-ttt
要は、spatial understandingに特化した認知機構を小規模ネットワーク+TTTで構築した研究(と思われる)。TTTについては下記issue参照のこと。動画の各フレームはViTでエンコードされ、QuestionはtokenizeされてHybridなdecoder-only modelに入力され、最終的にテキストが出力されるようなアーキテクチャになっている。Hybridなモデルは、3:1の割合でハイブリッドなブロックとFull Attention Blockがスタックされている。ハイブリッドなblockはQKVを共有した2つのルートが存在し、片方はSWA Layer, もう一方がTTT Layerとなっている。これによってSWA Layerによって高い画像理解能力をlong sequenceでも保ちつつ、TTT Layerで入力情報に基づいて動的にSpatial Understandingに特化したstate(=weight)を更新する、といった方向性のアーキテクチャに見える。
- [Paper Note] Learning to (Learn at Test Time): RNNs with Expressive Hidden States, Yu Sun+, ICML'25, 2024.07
[Paper Note] OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding, Zixian Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #MultiModal #VisionLanguageModel #3D (Video) #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-03-12 GPT Summary- MLLMに空間理解を持たせるためのフレームワークOnlineSIを提案。動画ストリームを利用して、有限の空間メモリを用いた継続的な推論を実現し、計算量を増加させない。3D点群と意味情報を統合し、物体の位置決定を向上。ファジーF1スコアを用いて実験し、現実世界の具現化システムへの展開の可能性を示した。 Comment
pj page: https://onlinesi.github.io/
元ポスト:
著者ポスト:
[Paper Note] Phi-4-reasoning-vision-15B Technical Report, Jyoti Aneja+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #MultiModal #Reasoning #SmallModel #OpenWeight #read-later #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-03-07 GPT Summary- Phi-4-reasoning-vision-15Bを提案。コンパクトなオープンウェイトのマルチモーダル推論モデルであり、効率的な設計選択や厳格なデータキュレーションを通じて競争力のある性能を実現。系統的なフィルタリングや誤り訂正によりデータ品質が重要であることを再確認し、高解像度エンコーダが性能向上に寄与。単一モデルで簡単なタスクに迅速な回答、複雑な問題には推論を提供するハイブリッドデータ構成を実現。 Comment
元ポスト:
[Paper Note] ArtHOI: Articulated Human-Object Interaction Synthesis by 4D Reconstruction from Video Priors, Zihao Huang+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#4D Reconstruction #interactive #Reference Collection #Author Thread-Post Issue Date: 2026-03-06 GPT Summary- ArtHOIは、単眼動画からの情報を用いて4Dの関節付き人間-物体相互作用を合成する初のゼロショットフレームワークである。このアプローチでは、動画の逆レンダリングを通じて接触や関節運動を自然に満たす物理的に妥当な4Dシーンを再構成する。提案手法は、光学フローを基に動的および静的領域を分離し、安定した物体のアーティキュレーションを回復した後、条件として人間の運動を生成する。また、多様なシーンにおいて、従来手法を上回る精度で相互作用を実現する。 Comment
pj page: https://arthoi.github.io/
元ポスト:
著者ポスト:
ポイント解説:
著者ポスト:
[Paper Note] Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning, Huihan Liu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #Catastrophic Forgetting #Selected Papers/Blogs #Robotics #VisionLanguageActionModel #One-Line Notes #ContinualLearning Issue Date: 2026-03-06 GPT Summary- 継続学習はロボットの方策学習における課題で、VLAモデルは従来の小規模モデルに比べて忘却に対して頑健であることを発見。単純な経験再生が効果的で、小さなデータサイズでも忘却ゼロを達成可能。また、VLAは新タスク学習時に以前の知識を保持し、スキルの迅速な回復を可能にする。これにより、大規模事前訓練が継続学習のダイナミクスを変え、新しいスキルを獲得できるモデルを実現することが示唆される。 Comment
元ポスト:
解説:
モデルを大規模にすることで表現が安定し、継続学習による破壊的忘却が軽減される可能性が示された一方で、評価タスクが比較的単純でありVLAモデルでは既に解けている可能性があり、継続学習の評価ではなくzero-shotの能力の汎化を見ている可能性がある点には注意という話のようである。
[Paper Note] Beyond Language Modeling: An Exploration of Multimodal Pretraining, Shengbang Tong+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Transformer #MultiModal #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #read-later #Selected Papers/Blogs #WorldModels #UMM #Author Thread-Post Issue Date: 2026-03-05 GPT Summary- 視覚的データは言語を超えるマルチモーダルモデルの進展に重要で、我々は制御された前訓練実験を通じてその要因を明らかにした。Transfusionフレームワークを用い、テキストや視覚データで統一的に訓練し、以下の洞察を得た:(i) RAEが最適な視覚表現を提供;(ii) 視覚とテキストは相補的で相乗効果を生む;(iii) 統一学習が世界モデリングに繋がる;(iv) MoEが効率的なスケーリングを可能にする。視覚データが言語より多く必要であることを示し、MoEが両者の調和を図ることを提案。 Comment
元ポスト:
著者ポスト:
解説:
[Paper Note] FireRed-OCR Technical Report, Hao Wu+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #SyntheticData #OpenWeight #read-later #VisionLanguageModel #OCR #One-Line Notes #Pixel-based Issue Date: 2026-03-03 GPT Summary- FireRed-OCRは、一般的なビジョン-ランゲージモデルを特化した高性能OCRモデルへ変換するフレームワークです。VLMは一般的には優れた能力を示すものの、文書処理では「構造的幻視」が問題となります。FireRed-OCRでは、高品質な構造データの不足に対処するため、「Geometry + Semantics」データファクトリを構築し、幾何特徴のクラスタリングを利用して多様な文書タイプに対応したデータセットを作成します。3段階の訓練戦略を導入し、文書構造理解、形式的出力の標準化、強化学習による構文的整合性の確保を行います。OmniDocBench v1.5での評価結果から、FireRed-OCRは92.94%の性能を達成し、他のベースラインを大きく上回ることを示しました。コードとモデル重みをオープンソース化し、一般VLMから専門的な構造エキスパートへの変容を促進します。 Comment
元ポスト:
github: https://github.com/FireRedTeam/FireRed-OCR
- [Paper Note] OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, Linke Ouyang+, CVPR'25, 2024.12
においてSoTAとのこと。日本語はどのくらいいけるだろう。
[Paper Note] VidEoMT: Your ViT is Secretly Also a Video Segmentation Model, Narges Norouzi+, CVPR'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #ImageSegmentation #CVPR #read-later #Selected Papers/Blogs #Encoder #2D (Image) #3D (Video) #Initial Impression Notes Issue Date: 2026-02-28 GPT Summary- VidEoMTは、専用の追跡モジュールなしで動画セグメンテーションを実現するエンコーダーのみのモデルである。軽量なクエリ伝搬機構を導入し、前フレームの情報を活用することで、フレーム間の連携を図る。時系列に依存しない学習済みクエリと融合により、利益を生み出しつつ追加の複雑さを回避し、最大160 FPSで競争力のある精度を達成した。 Comment
元ポスト:
他タスクでも色々使えそうなアーキテクチャに見える
[Paper Note] The Trinity of Consistency as a Defining Principle for General World Models, Jingxuan Wei+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Dataset #Evaluation #read-later #WorldModels Issue Date: 2026-02-28 GPT Summary- 世界モデルの構築は人工汎用知能の基本課題であり、Soraの動画生成モデルやUnified Multimodal Model (UMM)の進展がデータ駆動型の物理ダイナミクス近似の可能性を示している。しかし、一般的な世界モデルに必要な理論フレームワークは未整備である。本研究では、世界モデルが整合性の三位一体(モーダル・空間的・時間的整合性)に基づくべきと提案し、マルチモーダル学習の進化をレビュー。新たにCoW-Benchを導入し、これを用いて動画生成モデルとUMMを評価する。研究は一般的世界モデルへの道筋を確立し、現行システムの限界と将来のアーキテクチャ要件を明らかにする。 Comment
[Paper Note] Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents, Haiyang Xu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #AIAgents #OpenWeight #ComputerUse #GUI Issue Date: 2026-02-28 GPT Summary- GUI-Owl-1.5は、指示型および思考型のGUIエージェントモデルで、幅広いプラットフォームをサポート。複数のサイズで提供され、20のGUIベンチマークで最先端の成果を達成。重要な革新には、ハイブリッドデータパイプライン、推論能力の統一的強化、マルチプラットフォーム環境の新アルゴリズムMRPOが含まれる。モデルはオープンソースで、オンラインデモが提供されている。 Comment
pj page: https://github.com/X-PLUG/MobileAgent/tree/main/Mobile-Agent-v3.5
[Paper Note] LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer, Lihan Zha+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #Zero/FewShotLearning #Robotics #VisionLanguageActionModel #EmbodiedAI #Author Thread-Post Issue Date: 2026-02-28 GPT Summary- LAPを用いてロボットの動作を自然言語で表現し、ゼロショット転移を実現。特定の体現に依存せず、LAP-3Bは複数のロボットやタスクでの成功率を50%超え、既存モデルに対して約2倍の改善を示す。アクション予測とVQAを統合することで効率的な適応が可能。 Comment
元ポスト:
著者ポスト:
[Paper Note] Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models, Shojiro Yamabe+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#DataAugmentation #SyntheticData #CVPR #VisionLanguageModel #text Issue Date: 2026-02-28 GPT Summary- テキスト中心訓練を用いて、画像収集のコストを削減する新たなアプローチとしてText-Printed Image(TPI)を提案。TPIはテキストを白いキャンバスに直接レンダリングすることで合成画像を生成し、VQAタスクでのモダリティギャップを軽減。系統的な実験により、TPIは合成画像生成モデルよりも効果的な性能を示し、LVLMsの自動データ生成の可能性を強調。 Comment
元ポスト:
[Paper Note] The Diffusion Duality, Chapter II: $Ψ$-Samplers and Efficient Curriculum, Justin Deschenaux+, ICLR'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #DiffusionModel #ICLR #read-later #Selected Papers/Blogs #ImageSynthesis #Samplers #Author Thread-Post Issue Date: 2026-02-28 GPT Summary- Uniform-state離散拡散モデルは自己修正能力により優れた生成とガイダンスを実現していますが、ステップ数が増えるとサンプリング品質が限界に達します。本研究では、予測子-修正子(PC)サンプラーを導入し、任意のノイズ過程に対応可能な一般化手法を提案します。Uniform-state拡散と組み合わせることで、従来の手法を超える性能を発揮し、生成パープレキシティを低減させるとともに、サンプリングステップを増やすことで性能が向上します。また、効率的なカリキュラムを構築し、訓練時間を25%、メモリを33%削減しつつ、強力な下流タスク性能を維持します。 Comment
元ポスト:
著者ポスト:
openreview: https://openreview.net/forum?id=RSIoYWIzaP
著者コメント:
openreview: https://openreview.net/forum?id=RSIoYWIzaP
著者ポスト:
[Paper Note] Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion, Haodong Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#DiffusionModel #VideoGeneration/Understandings #One-Line Notes #train-inference-mismatch #Author Thread-Post Issue Date: 2026-02-27 GPT Summary- 自己回帰型動画拡散モデルは高い性能を達成するが、訓練期間と推論間のギャップにより長期視野での視覚的劣化が生じる。本研究では、訓練を超えたギャップを探求し、訓練不要でAR動画生成を効果的に長時間スケールする手法Rolling Sinkを提案。これにより、5分から30分の動画を生成し、一貫した被写体や安定した色を実現。広範な実験により、視覚的忠実度と時間的一貫性でSOTAを上回る性能を示した。 Comment
pj page: https://rolling-sink.github.io/
元ポスト:
著者ポスト:
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
のduration版。training durationとtesting durationが大幅に異なるとうまく生成ができなくなるのでそのgapを埋めましょうという話
[Paper Note] A Very Big Video Reasoning Suite, Maijunxian Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Dataset #Supervised-FineTuning (SFT) #Evaluation #Reasoning #mid-training #PostTraining #VideoGeneration/Understandings #3D (Video) #Author Thread-Post Issue Date: 2026-02-27 GPT Summary- ビデオ推論の能力を探究するため、100万本以上のビデオクリップを含む前例のないVBVRデータセットを導入。200の推論タスクを網羅し、既存データセットの約1000倍の規模で、評価フレームワークとしてVBVR-Benchを提示。これにより、ビデオ推論の研究における再現性と解釈可能性を向上させ、新規タスクへの応用の初期兆候を示す。VBVRは次の研究段階の基盤となる。データ、ツール、モデルは公開中。 Comment
pj page: https://video-reason.com/
元ポスト:
著者ポスト:
[Paper Note] CaptionQA: Is Your Caption as Useful as the Image Itself?, Shijia Yang+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #MultiModal #CVPR #Selected Papers/Blogs #VisionLanguageModel #2D (Image) #One-Line Notes #Initial Impression Notes #ImageToTextGeneration Issue Date: 2026-02-26 GPT Summary- 画像キャプションはマルチモーダルシステムにおける視覚コンテンツの代理表現として機能するが、キャプションが実際のタスクで画像の代わりになり得るかを評価する必要がある。そこで、新たにユーティリティベースのベンチマークCaptionQAを提案し、キャプションの質を下流タスクへの支援度で測定する。CaptionQAは四つのドメインにわたり、33,027件の詳細な多肢選択問題を提供し、キャプションが視覚情報を必要とする質問に対応する力を検証する。LLMによる評価により、キャプションの有用性が画像よりも最大32%低下することが確認され、CaptionQAはオープンソースとして公開される。 Comment
元ポスト:
興味深い研究。MLLMの性能をCaption生成を通じて評価している。
良いCaptionであればdownstream taskに活用した際により良い性能が得られるという仮定の元[^1]、MLLMの性能をAnswer=LLM(Question, Caption)で判断する。AnswerはMultiple Choice Questionであり、Cannot Answerなども含まれる。よりQAに対して適切に回答できるCaptionを生成できたMLLMが優れているというutility-basedな評価となっている。
MLLMに対してCaptionを生成する際は、Questionに関する情報は与えずに、画像の情報のみでCaptionを生成する(ように見える)。セクション9に記述されている通り、4種類のバリエーションのpromptを用いる(long, short, simple, taxonomy hinted)。
skim readingしかできていないのだが、脚注1に記述した通り、モデルによって実画像がgivenな状態とCaptionのみで評価した場合でgapの出方に差がある点と、そもそも到達しているスコアの絶対値の対比が出せる点が個人的に興味深い。これにより特定のMLLMが、画像とテキスト、どちらの情報を"理解"するのに優れているのか、あるいは理解した情報に基づいて"生成"するのに優れているのかも間接的に評価できるのではないかと感じる。たとえばGPT-5は他モデルと比べて双方の能力秀でているが、Gemini-2.5-Proは画像を考慮することは得意だが、画像からテキストを生成する能力は少し劣ることがGPT-5とのgapの差から伺える。GLM4.1-VやLLaVAなどは画像理解は得意だが、画像から重要な情報を生成する能力は大きく低いことがわかる。
同じdownstreamタスクを通じてgapを測定でき、かつ単にベンチマークのスコアという以上の一段深い情報が得られる点がこれまでと異なりおもしろいと感じる。
[^1]:実際、セクション5を見ると実際の画像を与えた場合とCaptionのみの場合で評価した場合でgapがあることが示されており、Captionが画像中のdownstream taskに対してrelevantな情報を完全に保持していないことが示唆される。また、モデルに応じてgapが異なっており、モデルによってCaption生成能力が大きく異なることが示唆される。
この評価のパラダイムは一段抽象化をすると、特定のモダリティの情報に対する理解力と、異なるモダリティに変換して生成する能力をdownstreamタスクを通じて観測することになり、Captionの場合は画像-テキスト間だが、他にも動画-テキスト、音声-テキスト、あるいはそれらの逆など、Omniモーダルなモデルの評価やUMMの評価に使えそうな話だな、と思うなどした。
[Paper Note] MultiShotMaster: A Controllable Multi-Shot Video Generation Framework, Qinghe Wang+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#Controllable #CVPR #VideoGeneration/Understandings #3D (Video) Issue Date: 2026-02-24 GPT Summary- MultiShotMasterは、マルチショット動画生成のための高度に制御可能なフレームワークを提案する。これにより、ショット遷移の位相シフトを適用し、柔軟なショット配置を実現。参照トークンとグラウンディング信号を用いた設計により、時空間的参照を強化し、データ不足を克服するための自動データ注釈パイプラインを確立。結果として、テキスト駆動の一貫性とカスタム対象を持つマルチショット動画生成を支援し、高性能と卓越した制御性を示した。 Comment
pj page: https://qinghew.github.io/MultiShotMaster/
元ポスト:
[Paper Note] Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control, Linxi Xie+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#VideoGeneration/Understandings #interactive #3D (Video) Issue Date: 2026-02-24 GPT Summary- 人間中心のビデオワールドモデルを提案し、追跡された頭部および手の姿勢に基づく生成モデルを導入。既存の条件付け戦略を改善し、巧妙な手と物体の相互作用を可能にする。双方向のビデオ拡散モデルを訓練し、自分視点の仮想環境を作成。評価実験により、タスクパフォーマンスの向上と高い知覚的制御感を示す。 Comment
[Paper Note] Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following, Tianyi Xiong+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #MultiModal #CVPR #VisionLanguageModel #2D (Image) Issue Date: 2026-02-24 GPT Summary- Multi-Critは、大規模マルチモーダルモデル(LMMs)の評価能力を測定するためのベンチマークであり、複数基準への適合性や判断信頼性を評価する。厳格なデータキュレーションを通じて収集された応答ペアは、オープンエンド生成と検証可能な推論タスクを含む。分析の結果、商用およびオープンソースモデルは多様な基準への適合に課題があり、ファインチューニングが視覚的根拠づけを高めるが、多元的基準判断に至らないことがわかった。Multi-Critは、信頼できるマルチモーダルAI評価の基盤を構築する。 Comment
元ポスト:
[Paper Note] Generative Scenario Rollouts for End-to-End Autonomous Driving, Rajeev Yasarla+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Planning #Reasoning #CVPR #Robotics #VisionLanguageActionModel #AutonomousDriving Issue Date: 2026-02-23 GPT Summary- VLAモデルを用いた自動運転システムのためのGeRoフレームワークを提案。エゴ車両の動態を潜在トークンにエンコードし、言語条件付きの自己回帰生成を通じて交通シーンを共同生成。整合性損失を利用して予測を安定化し、長期的推論を支援。Bench2Driveで運転スコアを+15.7ポイント、成功率を+26.2ポイント改善。生成的かつ言語条件付けられた推論の有望性を示す。 Comment
元ポスト:
[Paper Note] SLA2: Sparse-Linear Attention with Learnable Routing and QAT, Jintao Zhang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #Attention #DiffusionModel #VideoGeneration/Understandings #Routing #3D (Video) #One-Line Notes #SparseAttention #LinearAttention Issue Date: 2026-02-20 GPT Summary- SLA2は、スパース注意とリニア注意を動的に選択する学習可能なルータを導入し、パフォーマンスを向上させる。さらに、アテンションブランチを組み合わせるための比率や量子化を意識した設計を採用。実験により、動画生成モデルで97%のスパース性を達成し、18.6倍の速度向上を実現した。 Comment
元ポスト:
ポイント解説:
Sparse AttentionとLinear Attentionを動的に選択するルータを学習して効率を向上させる
[Paper Note] EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing, Yehonathan Litman+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #DiffusionModel #VideoGeneration/Understandings #Editing #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-02-19 GPT Summary- 高忠実度なビデオ編集には、新しい局所的ビデオ文脈モジュールを使用するEditCtrlフレームワークを提案。これにより、マスクされたトークンのみに集中し、計算コストを編集サイズに比例させる。全体の文脈の一貫性を保持しつつ、他の手法に比べて計算効率が10倍向上し、編集品質も改善。テキストプロンプトを利用した新機能を実現。 Comment
pj page: https://yehonathanlitman.github.io/edit_ctrl/
元ポスト:
著者ポスト:
video editing/inpaintingタスクにおいて、editに必要なlocal contextとeditとの一貫性を保つためのglobal contextを分離し、global contextに対するfull-attention計算を削減する(i.e., local contextに計算量を集中させる)ことで効率を向上、という話に見える。
[Paper Note] DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories, Chenlong Deng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#InformationRetrieval #Search #Dataset #LanguageModel #AIAgents #Evaluation #MultiModal #One-Line Notes Issue Date: 2026-02-18 GPT Summary- 既存のマルチモーダル検索システムはクエリと画像の関連性を独立して評価することを前提としているが、このアプローチは現実の視覚データの依存関係を無視している。これを解決するために、我々はDeepImageSearchを提案し、画像検索を自律的探査タスクとして再定義する。このモデルは文脈的手掛かりに基づき、視覚データの多段階推論を行いターゲットを特定する。相互に関連した視覚データ用のベンチマークDISBenchを構築し、文脈依存クエリの生成におけるスケーラビリティ課題を人的なモデル協働で解決するパイプラインも提案。また、モジュール型エージェントフレームワークと二重メモリシステムを用いて、堅牢なベースラインを開発した。実験により、DISBenchが先端モデルに対して重要な課題を示すことが明らかになり、次世代検索システムへのエージェント的推論の統合の必要性が強調されている。 Comment
元ポスト:
検索クエリが与えられた時に、Corpus中の画像中に含まれる情報を考慮しなければ検索できないような検索タスクとベンチマークDIBenchの提案。たとえば、白と青のロゴのイベントで、lead singerだけがステージに立っている画像、のような、白と青のロゴのイベントをCorpus画像から同定(クエリと画像の相互作用)→その上で当該イベントでソロでステージにlead singerが立っている画像を探す、といったような検索である。
proprietaryモデルだとClaude-4.5-Opusの性能がよく、次いでGemini-Pro-Previewの性能が良い。GPT5.2は大きく性能面で劣っている。OpenModelと比較すると、ClaudeはQwen3-VLやGLM-4.6Vの倍程度のスコアを獲得している(Table1)。
[Paper Note] Image Generation with a Sphere Encoder, Kaiyu Yue+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #Encoder #Encoder-Decoder #2D (Image) #KeyPoint Notes #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- Sphere Encoderは、1回のフォワードパスで画像を生成できる効率的な生成フレームワークです。球面潜在空間への均一な写像を行うエンコーダと、ランダムな潜在ベクトルを画像空間に変換するデコーダを学習し、画像再構成損失のみで訓練を行います。このアプローチにより、複数のデータセットにおいて最先端の拡散モデルに匹敵する性能を示しながら、推論コストを大幅に削減しています。 Comment
元ポスト:
画像を球面状(i.e., 3次元の)の潜在表現にエンコードするエンコーダと、エンコーダに摂動を加えた球面上の点からデコーダを通じて元画像を再構成するデコーダを学習することで、潜在表現から画像のピクセルを直接生成する枠組み。球面上の潜在表現から1回のforward pathで画像を構成するよっに学習するため高速に生成ができる。また、生成した画像をさらにエンコードしデコードすることで、追加のデノイジングstepを実施することができ、画像をより洗練させることができる。4ステップ程度でDiffusion Modelには及ばないものの(ImageNet 256*256でgFID 1.38--2.77)、gFID 4.02--4.76程度のスコア(GAN以上、ADM-Gと呼ばれるDiffusionモデルと同等程度)の画像を生成可能(Table3)という感じに見える。
loss functionはピクセル単位の再構成loss、ピクセルの一貫性に関するloss (i.e., 2つの摂動を加えた潜在表現vが類似した画像を生成するか)をL1_perception lossによって学習する(i.e., ピクセル同士の誤差をスムージングしながら直接測るlossと、既存の学習済み画像エンコーダの潜在表現上でのFeature MapのL1/2距離の組み合わせ)と、
潜在空間の一貫性に関するloss(i.e., 元の潜在表現と、潜在表現をデコード→エンコードした後得られる潜在表現のコサイン類似度)が用いられる式(7,8,9,10)。
[Paper Note] BitDance: Scaling Autoregressive Generative Models with Binary Tokens, Yuang Ai+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #DiffusionModel #TextToImageGeneration #Decoding #read-later #2D (Image) #ImageSynthesis Issue Date: 2026-02-17 GPT Summary- BitDanceは、バイナリ視覚トークンを予測する自己回帰型の画像生成モデルであり、高エントロピーのバイナリ潜在変数により最大2^{256}の状態を表現できます。バイナリ拡散ヘッドを採用し、標準の分類を超えたトークン生成を実現。次パッチ拡散技術により、複数トークンを高精度で並列予測し、推論速度を8.7倍向上させます。ImageNet 256x256では最高のFIDスコア1.24を達成し、1024x1024画像生成においては従来モデルと比較して30倍以上の速度向上を実現しています。コードとモデルは公開されています。 Comment
pj page: https://bitdance.csuhan.com/
元ポスト:
[Paper Note] CoPE-VideoLM: Codec Primitives For Efficient Video Language Models, Sayan Deb Sarkar+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #VisionLanguageModel #Encoder #3D (Video) #One-Line Notes Issue Date: 2026-02-17 GPT Summary- 動画理解のために、動画コーデックのプリミティブを活用し、計算オーバーヘッドを軽減。軽量トランスフォーマーエンコーダにより、トークン生成を大幅に効率化し、一般的なベンチマークで性能を維持。最大で86%の時間短縮と93%のトークン削減を実現。 Comment
元ポスト:
VideoLanguageModelのinputにおあて、より効率的な画像のΔエンコーダを導入して高速化しつつ性能向上
[Paper Note] MonoLoss: A Training Objective for Interpretable Monosemantic Representations, Ali Nasiri-Sarvi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Explanation #RepresentationLearning #Transformer #Encoder #SparseAutoencoder Issue Date: 2026-02-17 GPT Summary- Sparse autoencoders (SAEs)は、多義的な神経表現を単義的特徴に分解する。しかし、従来の学習目的はこの分解を促進せず、単義性指標も効率を低下させる。MonoScore指標を用いて、線形に増加する単一パスアルゴリズムを提案し、評価時に1200倍、トレーニング時に159倍の高速化を実現。これにより、モノセマンティシティ・ロス(MonoLoss)を導入し、一貫した活性化を促進。これにより、クラス純度が大幅に向上し、ImageNet-1Kの精度も改善。コードは公開中。 Comment
元ポスト:
[Paper Note] Causal-JEPA: Learning World Models through Object-Level Latent Interventions, Heejeong Nam+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #RepresentationLearning #Transformer #Self-SupervisedLearning #OpenWeight #Encoder #WorldModels #KeyPoint Notes #LatentRepresentation Issue Date: 2026-02-16 GPT Summary- C-JEPAは、オブジェクト中心の世界モデルで、画像パッチからの埋め込み予測を通じてオブジェクトの相互作用を捉えることを目的としている。オブジェクトレベルのマスキングを導入し、潜在的介入を誘発することで反事実的推論を強化し、ショートカット解法を防ぐ。実験結果では、視覚質問応答において約20%の性能向上を示し、エージェント制御タスクでは必要な潜在入力のわずか1%で同等の結果を達成した。さらに、因果的帰納的バイアスを誘発することも示している。 Comment
元ポスト:
pj page: https://hazel-heejeong-nam.github.io/cjepa/
(JEPAは私にとってあまり馴染みがなく、以下の私の解説はどこかに誤りがある可能性が高い)
video basedなシステムを前提、すなわちimageのsequenceが与えられる前提である。このとき、各タイムステップごとに選択されたobjectの状態をマスクし、マスクされたobjectのhistoryを予測し、予測された状態から将来の状態を予測する。objectは状態だけでなく、補足的な観測可能な情報を保持することができ(たとえばアクションと感覚に関するシグナルなど)状態遷移に利用される。また、マスク対象として選択されたオブジェクトの最初のステップの状態だけは、アンカーとして保持する。マスク処理はlatent levelはでのinteiventionとして解釈でき、これにより予測のためにobject間の相互作用を捉えることが誘発され、object centricな潜在表現が学習される。マスクされたオブジェクトの状態は、予測された一つ前のステップでの状態に対してlinearで変換しpositional embeddingを足し合わせることで求められ(式3)、これらの予測されたhistoryの状態がViTの入力となり(bidirectionalなattentionを通じて)将来の状態を予測する。lossは予測されたhistoryの状態と将来の状態が与えられたときに、freezeされたobjectのエンコーダから得られる潜在表現との距離が最小化されるように学習される(エンコーダ側はstop gradientする)。
解説:
[Paper Note] Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation, Alan Baade+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Embeddings #Transformer #DiffusionModel #Architecture #2D (Image) #ImageSynthesis #Pixel-based Issue Date: 2026-02-13 GPT Summary- 潜在拡散モデルは高品質な画像生成を実現するものの、エンドツーエンドの利点を失うことが課題であった。本研究では、ラテント強制(Latent Forcing)を提案し、ラテントとピクセルを別々のノイズスケジュールで共同処理することで、効率的に高周波ピクセル特徴を生成する。条件信号の順序が重要であることを発見し、これを分析することで、トークナイザーのREPA蒸留と拡散モデルの違いや生成品質の関係を示す。ImageNetでの適用により、新たな最先端を達成した。 Comment
元ポスト:
[Paper Note] Prism: Spectral-Aware Block-Sparse Attention, Xinghao Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #LongContext #VisionLanguageModel #One-Line Notes #SparseAttention Issue Date: 2026-02-12 GPT Summary- ブロックスパースアテンションの効率を改善するために、平均プーリングによる粗粒度アテンションの不正確さの原因を分析し、Prismというトレーニング不要のアプローチを提案。Prismは、ブロック選択を高周波数と低周波数に分解し、エネルギーベースの温度キャリブレーションで位置情報を復元。結果、フルアテンションと同等の精度を維持しつつ、最大5.1倍の速度向上を達成。 Comment
元ポスト:
sparse attentionにおいて、RoPEとmean poolingによるブロックの重要度の同定が組み合わさったときに、mean poolingがlow pass filterの役割を果たし高周波成分が破壊される(ことを理論的に示した)。このため、低周波成分と高周波成分を分けて扱う手法を提案しているという感じの話らしい。
[Paper Note] OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence, Feilong Tang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #read-later #Encoder #Backbone Issue Date: 2026-02-12 GPT Summary- 仮説として、人工汎用知能は圧縮問題であると提唱。深層学習はデータ構造とアーキテクチャの整合時に最も効果的であるが、現在の視覚アーキテクチャは過剰計算を行い冗長性を無視している。OneVision-Encoderは、視覚情報を圧縮し、計算をエントロピーの高い領域に集中させる方法論を採用。結果として効率と精度の向上が証明され、OV-Encoderは他の視覚モデルを複数のベンチマークで上回り、特に動画理解での改善が見られる。これにより、次世代の視覚AIの基盤となる可能性が示された。 Comment
元ポスト:
pj page: https://github.com/EvolvingLMMs-Lab/OneVision-Encoder?tab=readme-ov-file
[Paper Note] UI-Venus-1.5 Technical Report, Veuns-Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #AIAgents #mid-training #ModelMerge #Off-Policy #On-Policy #VisionLanguageModel #One-Line Notes #Rubric-based #Initial Impression Notes #GUI Issue Date: 2026-02-12 GPT Summary- 統合型エンドツーエンドGUIエージェントUI-Venus-1.5を紹介。さまざまなアプリケーションに対応する2B、8B、および30B-A3Bのモデルバリアントを持ち、10億トークンを活用したMid-Training、オンライン強化学習、ドメイン固有モデルの統合を実施。評価においてScreenSpot-Pro、VenusBench-GD、AndroidWorldで新たな最先端パフォーマンスを達成し、中国のモバイルアプリでも効果的なナビゲーションを実現。 Comment
元ポスト:
Mid-training(navigation, grounding, reasoning, GUI-VQA, アイコンの認識等の精緻な認識能力)でGUIに関する知識を身につけさせ、オフラインRLで特定のタスクに特化した能力(grounding, navigation等)を向上し、オンラインRLで実シナリオでのエージェントのtrajectoryレベルでの能力を向上させる。これらのモデルはモバイルとwebでそれぞれ学習され、最終的にモデルマージを通じて単一のend-to-endにタスクを実現可能なエージェントを構築する。
コールドスタートの対策のためにSFTではなくオフポリシーRLを使っているのが特徴
下記研究において、SFTが各trajectoryがトークン単位で一致したときに1となるrewardを用いたRLと一致することが示されており、汎化能力に課題があることが指摘されている[^1]。汎化性能は後回しにして、特定の能力にとにかくまずは強化したいという用途であればSFTでも良いかもしれないが、downstreamなタスクがend-to-endで多様なタスクとなる場合は、オフラインRLを用いて汎化性能も考慮しつつ多面的な能力をwarmupするのが良いのかもしれない。
- [Paper Note] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification, Yongliang Wu+, ICLR'26, 2025.08
[^1]: ポリシーがexpertのtrajectoryに対して低い尤度を示すとimportance weightingにより非常に大きい重みがかけられることで分散が大きく、かつ報酬シグナルがsparseなことが課題であることが指摘されている。
[Paper Note] Code2World: A GUI World Model via Renderable Code Generation, Yuhao Zheng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Coding #VisionLanguageModel #WorldModels #One-Line Notes #GUI Issue Date: 2026-02-12 GPT Summary- 自律的なGUIエージェントは、GUI Worldモデルを用いて行動を実行し、人間のような先見性を持つ。既存のアプローチは視覚的忠実性と構造的制御の両立が困難である。そこで、Code2Worldを提案し、レンダリング可能なコード生成を通じて次の視覚状態をシミュレートする。GUIトラジェクトリを高忠実度のHTMLに変換し、合成コードを洗練。Render-Aware Reinforcement Learningを用いて視覚的意味の忠実性と行動の一貫性を強化。広範な実験により、Code2World-8Bは競争力のあるモデルに匹敵するパフォーマンスを達成し、ナビゲーション成功率を大幅に向上させた。 Comment
pj page: https://amap-ml.github.io/Code2World/
元ポスト:
現在のスクリーンショットと、アクションのペアから、次のスクリーンショットをレンダリング可能なコードを通じて予測する(Next UI Prediction)
[Paper Note] LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs, Benno Krojer+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Explanation #read-later #Selected Papers/Blogs #VisionLanguageModel #One-Line Notes #VisualTokens Issue Date: 2026-02-12 GPT Summary- 視覚トークンをLLMの埋め込み空間にマッピングする新手法「LatentLens」を提案。これにより視覚トークンの解釈可能性が向上し、従来の手法よりも高い精度で記述を生成。評価では、LatentLensが視覚トークンの解釈を効果的に提供し、視覚と言語の整合性に関する新たな証拠を示すことが確認された。 Comment
元ポスト:
VLMのVisual Tokenを、LLMで事前にコーパスからエンコードされたテキストのrepresentationとsimilarityを測ることでテキスト空間での類似した表現を見つけ解釈する方法な模様。興味深い。
[Paper Note] When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning, Shoubin Yu+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Test-Time Scaling #WorldModels #SpatialUnderstanding #Adaptive Issue Date: 2026-02-11 GPT Summary- 視覚的空間推論における想像の役割を分析し、制御可能なリソースとしてのテスト時視覚的想像の効果を評価。静的証拠が十分であるか、想像が改善に寄与するかを探求し、適応型フレームワークAVICを導入。結果は、想像の必要性や有害性の明確なシナリオを示し、制御された想像が固定戦略に匹敵するかそれを超える成果を達成。効率的な空間推論には、想像の分析と制御が不可欠であることを強調。 Comment
元ポスト:
[Paper Note] Reinforced Attention Learning, Bangzheng Li+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #ReinforcementLearning #MultiModal #Attention #PostTraining #VisionLanguageModel #One-Line Notes Issue Date: 2026-02-11 GPT Summary- 強化学習を用いた内部注意分布の直接最適化を通じて、マルチモーダルLLMの情報配分を改善する強化注意学習(RAL)を提案。RALは複雑な入力におけるグラウンディングを向上させ、さまざまなベンチマークで一貫した性能向上を示す。オンポリシー注意蒸留を採用し、クロスモーダル整合性を強化する新たなアプローチを提供。 Comment
元ポスト:
マルチモーダルLLM(実験ではVLM利用)におけるクロスモーダルなAttention表現を改善するためのRLに基づく事後学習手法で、attention分布を直接最適化する手法な模様
[Paper Note] ViT-5: Vision Transformers for The Mid-2020s, Feng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Transformer #Architecture #read-later #Selected Papers/Blogs #Backbone #Initial Impression Notes Issue Date: 2026-02-10 GPT Summary- ViT-5は、ビジョントランスフォーマーの要素を体系的に洗練し、新世代のバックボーンを形成する。このアーキテクチャは、正規化や位置エンコーディングなどの進化を含み、広範な実験で従来の最先端を上回る性能を示した。ImageNet-1k分類では84.2%のトップ-1精度を達成し、生成モデリングでも優れたFIDを記録。改善された表現学習と空間推論により、タスク間の移行が安定し、現代のファンデーションモデルに適したシンプルなアップグレードを提供する。 Comment
元ポスト:
ModernBERTと同じ動機で、ViTに現代的な様々なアーキテクチャ上の工夫を入れたものをシステマチックに調査し、最適な組み合わせを見つけ性能向上したという話に見える。
[Paper Note] Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition, Yuhao Dong+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #In-ContextLearning #EMNLP #VideoGeneration/Understandings #VisionLanguageModel #3D (Video) Issue Date: 2026-02-10 GPT Summary- デモ駆動型ビデオインコンテキスト学習を提案し、ビデオに関する質問に対してインコンテキストデモから学ぶ新たなタスクを定義。1200本のYouTubeビデオを用いた「Demo-ICL-Bench」を作成し、テキストと動画のデモを提供。Demo-ICLモデルを開発し、ビデオ監督付きファインチューニングによってインコンテキスト学習能力を向上。実験によりベンチマークの難易度を検証し、モデルの性能を明示。 Comment
元ポスト:
[Paper Note] DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos, Shenyuan Gao+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #DiffusionModel #OpenWeight #Robotics #WorldModels #3D (Video) #Realtime #Physics #EgocentricView #Author Thread-Post Issue Date: 2026-02-09 GPT Summary- DreamDojoは、エゴセントリックな人間のビデオから学習した世界モデルで、巧妙なロボットタスクのシミュレーションを可能にします。44,000時間のデータを使用し、多様なシナリオとオブジェクトをカバーしており、アクションラベルの不足を連続的な潜在アクションで解決。物理理解とアクション制御能力を向上させるポストトレーニング後、10.81 FPSでのリアルタイム処理を実現。これにより、生成的世界モデルを基にした新しいアプリケーションを実現し、オープンワールドでのタスクシミュレーションの可能性を示します。 Comment
pj page: https://dreamdojo-world.github.io/
元ポスト:
著者ポスト:
著者ポスト:
解説:
[Paper Note] ERNIE 5.0 Technical Report, Haifeng Wang+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #LanguageModel #MultiModal #SpeechProcessing #Speech #Proprietary #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #2D (Image) #UMM #3D (Video) #Omni #text #Initial Impression Notes Issue Date: 2026-02-06 GPT Summary- ERNIE 5.0は、テキスト、画像、ビデオ、音声に対応したマルチモーダル理解と生成のための基盤モデルです。超スパースな専門家の混合アーキテクチャを使用し、依存しないルーティングでトークン予測を行います。新たなトレーニングパラダイムにより、モデルは性能、サイズ、推論レイテンシを柔軟に調整可能です。幅広い実験において、ERNIE 5.0は複数のモダリティで優れた性能を示し、初の商用規模の兆パラメータモデルとして注目されています。 Comment
元ポスト:
リリース時の公式ポスト:
あくまでskim readingをして得た印象なのだが、非常に興味深い研究で、Omniモダリティを超大規模モデルでスクラッチからUnified Multimodal Modelとして学習し、MoEで効率的に推論するというアーキテクチャと手法に見え(個人的にこういう手法でやったらどうなるのだろう?と思っていたドンピシャな設定)、各種ベンチマークの性能指標を見ると多くの指標で全体的に良いスコアを達成しており様々なタスクを高性能で実現できる一方、特定の分野のベンチマークでGemini Pro 3の方が強い面が多く(たとえばテキストモダリティのstem, coding, vision全般, ASR全般)、Omniモダリティの統合は一筋縄ではいかず、どのようにモダリティを統合し、学習することが効果的なのか?という根源的な問いがあらためて思い浮かぶ。
Ming Omniでも同様のことがやられていた:
- [Paper Note] Ming-Omni: A Unified Multimodal Model for Perception and Generation, Inclusion AI+, arXiv'25, 2025.06
[Paper Note] Generative Modeling via Drifting, Mingyang Deng+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#MachineLearning #GenerativeAI #Architecture #read-later #Selected Papers/Blogs #Reference Collection Issue Date: 2026-02-05 GPT Summary- ドリフティングモデルを提案し、プッシュフォワード分布を進化させることで、自然なワンステップ推論を可能に。サンプルの動きを制御するドリフティングフィールドを導入し、効率的なトレーニングを実現。ImageNetでの実験では、最先端のFID値を達成し、高品質な生成の新たな可能性を示す。 Comment
元ポスト:
所見:
pj page: https://lambertae.github.io/projects/drifting/
ポイント解説:
解説:
[Paper Note] CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding, Yuling Shi+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#NLP #MultiModal #Coding #VisionLanguageModel #2D (Image) #OCR #Compression Issue Date: 2026-02-05 GPT Summary- 大規模言語モデル(LLM)はソースコード理解で成功を収めていますが、計算効率が課題です。従来、LLMはコードをトークンの線形シーケンスとして扱い、計算コストが増加します。そこで、マルチモーダル大規模言語モデル(MLLM)による画像モダリティの利用が提案され、圧縮の可能性を探る研究を行いました。その結果、(1) MLLMは最大8倍のトークン削減を実現し、効果的にコードを理解できることが分かりました;(2) 構文ハイライトなどの視覚的手がかりを活用し、4倍の圧縮下でパフォーマンス向上;(3) クローン検出タスクは視覚的圧縮に対して耐性があり、圧縮比で生のテキストを上回る結果もありました。これにより、MLLMの効率的な推論可能性が示唆されています。 Comment
元ポスト:
textをimageとして扱う関連研究:
- [Paper Note] Language Modelling with Pixels, Phillip Rust+, ICLR'23, 2022.07
- [Paper Note] PixelWorld: Towards Perceiving Everything as Pixels, Zhiheng Lyu+, arXiv'25, 2025.01
- DeepSeek-OCR: Contexts Optical Compression, DeepSeek, 2025.10
literatureについては下記ポスト参考:
[Paper Note] World Action Models are Zero-shot Policies, Seonghyeon Ye+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #Zero/Few/ManyShotPrompting #TransferLearning #OpenWeight #read-later #Selected Papers/Blogs #Generalization #Robotics #WorldModels #Backbone #3D (Video) #WorldActionModel Issue Date: 2026-02-05 GPT Summary- 最先端のVLAモデルは新環境での物理的動作の一般化に困難を抱えている。DreamZeroは、動画と行動を共同でモデル化するWorld Action Model(WAM)を導入し、物理的ダイナミクスを学習。これにより、繰り返しデモなしで多様なスキルを学び、タスクや環境への一般化を2倍以上向上。14Bの自己回帰型ビデオ拡散モデルがリアルタイム制御を実現。また、動画デモによって未見タスクの性能が42%以上改善され、少数ショットでの適応も可能に。 Comment
pj page: https://dreamzero0.github.io/
元ポスト:
[Paper Note] Programming with Pixels: Can Computer-Use Agents do Software Engineering?, Pranjal Aggarwal+, ICLR'26, 2025.02
Paper/Blog Link My Issue
#Dataset #AIAgents #Evaluation #Coding #ICLR #SoftwareEngineering #ComputerUse #VisionLanguageModel #GUI Issue Date: 2026-02-05 GPT Summary- CUA(コンピュータ利用エージェント)は一般的なタスクを実行する可能性があるが、ソフトウェアエンジニアリングのような専門的な作業の自動化能力は不明である。本研究では、「Programming with Pixels」(PwP)を導入し、エージェントが視覚的にIDEを操作して多様なソフトウェアエンジニアリングタスクを実行する環境を提供する。また、15のソフトウェアエンジニアリングタスクに対するベンチマーク「PwP-Bench」を設立し、CUAsの性能を評価した。結果、純粋な視覚的インタラクションでは専門エージェントに劣るが、APIへの直接アクセスを与えることで性能が向上し、専門性に達することが多かった。CUAsは視覚的基盤の限界と環境の効果的な活用に課題があるが、PwPは洗練されたタスクに対する評価の新たな基準を提供する。 Comment
pj page: https://github.com/ProgrammingwithPixels/PwP
元ポスト:
[Paper Note] FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space, FSVideo Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #DiffusionModel #3D (Video) #ImageToVideoGeneration Issue Date: 2026-02-05 GPT Summary- FSVideoは、高速なトランスフォーマーベースの画像から動画(I2V)への拡散フレームワークで、圧縮された潜在空間を持つ動画オートエンコーダー、強化された層間の情報フローを持つ拡散トランスフォーマー、少数ステップのアップサンプラーを利用して多解像度生成を実現。最終モデルは14BのDITベースとアップサンプラーを含み、競争力のある性能と優れた速度を誇る。モデル設計とトレーニング戦略も詳述。 Comment
pj page: https://kingofprank.github.io/fsvideo/
元ポスト:
[Paper Note] Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models, Wenxuan Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #LanguageModel #Evaluation #MultiModal #2D (Image) #DeepResearch #Initial Impression Notes Issue Date: 2026-02-05 GPT Summary- Vision-DeepResearchは、マルチモーダル大規模言語モデル(MLLMs)において、多ターン・多エンティティ・多スケールの視覚およびテキスト検索を実現する新しい深層研究パラダイムを提案。これにより、実際のシナリオでの視覚ノイズに対処し、数十の推論ステップと多くのインタラクションをサポート。強化学習を通じて深層研究能力を内在化し、既存のMLLMを上回る性能を発揮する。コードは公開予定。 Comment
pj page: https://osilly.github.io/Vision-DeepResearch/
元ポスト:
image searchやVQAなどを伴うDeepResearchに関するタスクとそのベンチマークの提案という感じに見える。
[Paper Note] GLM-OCR Technical Report, Shuaiqi Duan+, arXiv'26, 2026.03
Paper/Blog Link My Issue
#NLP #OpenWeight #read-later #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- GLM-OCRは、0.9Bパラメータの多模态モデルで、実世界の文書理解に最適化されている。CogViT視覚エンコーダとGLM言語デコーダを組み合わせ、計算効率と性能のバランスを高めている。Multi-Token Prediction (MTP)メカニズムにより、OCRタスクのデコード効率が向上し、低メモリオーバーヘッドを実現。二段階パイプラインでレイアウト分析と認識を行い、公開ベンチマークで競争力のある性能を達成。リソース制約のある環境でも適用可能な設計。 Comment
元ポスト:
GLMのOCRがリリース。DeepSeekもOCRをリリースしているが、tokenを圧縮する目的や、モデルの学習データを担保する目的などで最終目的としては自分たちのモデルの強化に必要であり、その道中での副産物としてリリースしているのだろうか。それとも、OCRタスクの需要がシンプルに高いからリリースしているのだろうか。
公式ポスト:
関連:
- [Paper Note] LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR, Said Taghadouini+, arXiv'26, 2026.01
- olmOCR 2: Unit test rewards for document OCR, Ai2, 2025.10
- DeepSeek-OCR: Contexts Optical Compression, DeepSeek, 2025.10
- DeepSeek-OCR-2, DeepSeek-AI, 2026.01
[Paper Note] VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents, Zirui Wang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #LongContext #VisionLanguageModel #interactive #Initial Impression Notes Issue Date: 2026-02-03 GPT Summary- 現代の視覚-言語モデル(VLM)は、複雑な視覚的相互作用において効果的に機能しておらず、特に長期的な知覚や記憶の統合に課題があります。これに対処するため、「VisGym」という17の環境を導入し、記号パズルやナビゲーションを含む多様な設定でモデルを評価・訓練します。実験では、最前線のモデルがインタラクティブな場面で苦戦していることが示され、長い文脈の活用に制限があることが明らかになりました。しかし、目標観察やテキストフィードバックによる微調整は、モデルの視覚的意思決定を改善する効果が確認されました。 Comment
pj page: https://visgym.github.io/
元ポスト:
このベンチマーク上のSoTAであるGemini 3 Proでも平均Acc.50%に到達しないinteractiveなVQAタスク群な模様
[Paper Note] PaperBanana: Automating Academic Illustration for AI Scientists, Dawei Zhu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Multi #NLP #Dataset #AIAgents #Evaluation #DiffusionModel #VisionLanguageModel #2D (Image) #AcademicWriting Issue Date: 2026-02-03 GPT Summary- PaperBananaは、学術イラストの自動生成を実現するエージェントフレームワークであり、視覚言語モデルと画像生成モデルを活用しています。専門エージェントを調整して参照を取得し、コンテンツとスタイルを計画、画像をレンダリングし、批評を通じて洗練を行います。PaperBananaBenchを用いた評価では、多様なスタイルの292のテストケースにおいて、忠実性や美的感覚で主要なベースラインを上回る成果を示しました。これにより、高品質な出版準備の整ったイラスト生成が可能となります。 Comment
pj page: https://dwzhu-pku.github.io/PaperBanana/
元ポスト:
[Paper Note] VideoMind: A Chain-of-LoRA Agent for Long Video Reasoning, Ye Liu+, ICLR'26, 2025.03
Paper/Blog Link My Issue
#NLP #Supervised-FineTuning (SFT) #AIAgents #LongContext #PEFT(Adaptor/LoRA) #ICLR #VideoGeneration/Understandings #VisionLanguageModel Issue Date: 2026-02-01 GPT Summary- VideoMindは、動画理解のための新しい動画・言語エージェントで、時間的推論に特化した役割ベースのワークフローを導入。プランナー、グラウンダー、バリファイア、アンサーの役割を組み合わせ、LoRAアダプタを用いたChain-of-LoRA戦略で効率的に切り替え。14の公共ベンチマークにおける実験で、地に基づいた動画質問応答や一般的な動画質問応答において最先端のパフォーマンスを達成し、その有効性を示した。 Comment
pj page: https://videomind.github.io/
[Paper Note] Grounding Computer Use Agents on Human Demonstrations, Aarash Feizi+, ICLR'26, 2025.11
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #ICLR #ComputerUse #PostTraining #UI Issue Date: 2026-02-01 GPT Summary- 専門家の実演から構築したデスクトップグラウンディングデータセット「GroundCUA」を提案。87のアプリをカバーし、56,000枚のスクリーンショットと356万件以上の注釈を含む。これに基づき、指示をUI要素にマッピングする「GroundNext」モデル群を開発。教師ありファインチューニングにより最先端の結果を達成し、強化学習によるポストトレーニングでさらに性能向上。高品質なデータセットがコンピューターエージェントの進展に貢献することを示唆。 Comment
pj page: https://groundcua.github.io/
元ポスト:
[Paper Note] Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models, Zengbin Wang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #DiffusionModel #TextToImageGeneration #read-later #Selected Papers/Blogs #SpatialUnderstanding Issue Date: 2026-01-31 GPT Summary- T2Iモデルの空間処理能力を評価する新しいベンチマーク「SpatialGenEval」を提案。1,230の長い情報密度の高いプロンプトを用いて、空間関係の推論が主なボトleneckであることを確認。また、「SpatialT2I」データセットを構築し、ファインチューニングによって現実的な空間効果を向上させるデータ中心のアプローチを強調。 Comment
元ポスト:
[Paper Note] Innovator-VL: A Multimodal Large Language Model for Scientific Discovery, Zichen Wen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #MultiModal #ScientificDiscovery #VisionLanguageModel Issue Date: 2026-01-30 GPT Summary- 「Innovator-VL」は、科学分野の理解と推論を向上させるためのマルチモーダル大規模言語モデルで、視覚タスクでも優れた性能を発揮します。透明なトレーニング手法によりデータ要件を削減し、完全再現可能なエンドツーエンドのパイプラインを提供。500万未満のサンプルで競争力のあるパフォーマンスを達成し、原則に基づくデータ選択が効果的な推論を可能にすることを示しました。一般化能力も高く、科学的整合性と一般的な能力を両立しています。この研究は、高性能な科学的モデルが大規模データなしでも構築できることを示しています。 Comment
pj page: https://innovatorlm.github.io/Innovator-VL/
元ポスト:
[Paper Note] Advancing Open-source World Models, Robbyant Team+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #DiffusionModel #OpenWeight #WorldModels #interactive Issue Date: 2026-01-30 GPT Summary- LingBot-Worldは、リアルで多様な環境を持つオープンソースの世界シミュレーターで、高忠実度と堅牢なダイナミクスを提供。文脈の一貫性を保つ「長期記憶」機能や、1秒未満のレイテンシーでのリアルタイム生成を実現。オープンソースの技術提供により、コンテンツ制作やゲーム、ロボット学習に貢献することを目指す。 Comment
pj page: https://technology.robbyant.com/lingbot-world
元ポスト:
[Paper Note] WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World, Ao Liang+, CVPR'26, 2025.12
Paper/Blog Link My Issue
#Dataset #Evaluation #CVPR #read-later #Selected Papers/Blogs #WorldModels #3D (Video) #One-Line Notes #Author Thread-Post Issue Date: 2026-01-30 GPT Summary- 生成的世界モデルはリアルな4D環境を合成しますが、物理的または行動的に失敗することが多いです。この課題に対処するため、WorldLensを導入し、生成された世界の評価を行う全範囲ベンチマークを提供します。これには生成、再構成、行動追従など五つの側面が含まれ、視覚的現実性や物理的妥当性を評価します。既存モデルには広範囲に優れたものがなく、WorldLens-26Kという大規模な人間注釈付きデータセットを構築し、評価モデルWorldLens-Agentを開発しました。これにより、世界の忠実性を測定する統一されたエコシステムを形成し、リアルな見た目と行動の両面で評価基準を標準化します。 Comment
pj page: https://worldbench.github.io/worldlens
元ポスト:
github: https://github.com/worldbench/WorldLens
(自動運転に関する)World Model(には限られないかもしれないが)を多角的な軸から評価できるベンチマーク。3D object detection/Tracking, Novel-view Discrepancy/Quality, Occupacy Prediction, Subject Fidelity/Consistency/Coherence, Temporal Concistencyなど、20以上のdimensionから評価可能なようである。
著者ポスト:
[Paper Note] Factuality Matters: When Image Generation and Editing Meet Structured Visuals, Le Zhuo+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#Dataset #Evaluation #Factuality #DiffusionModel #ICLR #2D (Image) #Editing #UMM #ImageSynthesis Issue Date: 2026-01-30 GPT Summary- 構造化された視覚生成に特化した研究であり、高品質な構造画像データセットを構築。VLMとFLUXを統合したモデルを訓練し、推論能力を強化。新たな評価指標StructScoreを導入し、多段階Q&Aプロトコルで正確性を評価。モデルは強力な編集性能を示し、構造化視覚の統一基盤を目指す。 Comment
元ポスト:
[Paper Note] Kimi K2.5: Visual Agentic Intelligence, Kimi Team+, arXiv'26, 2026.02
Paper/Blog Link My Issue
#Pretraining #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #AIAgents #Blog #OpenWeight #mid-training #PostTraining #read-later #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #Initial Impression Notes #ContextFolding Issue Date: 2026-01-27 GPT Summary- Kimi K2.5は、テキストとビジョンの共同最適化を重視するオープンソースのマルチモーダルエージェンティックモデルです。共同プリアトレーニングや強化学習を用いて、エージェントが複雑なタスクをサブ問題に分解し同時に実行するAgent Swarmを導入。評価結果では、コーディングや推論タスクで最先端の成果を達成し、最大4.5倍のレイテンシ低減を実証しました。Kimi K2.5モデルのチェックポイントは、今後の研究や応用に活用可能です。 Comment
HF: https://huggingface.co/moonshotai/Kimi-K2.5
元ポスト:
テクニカルレポートを受けての所見:
Agenticなタスク(HLE, BrowsingによるQA, DeepSearch)に関するベンチでGPT-5.2(xhigh)などを超えてSoTAを達成。他のタスクではcodingではClaude-4.5-Opusの方が上、image関連のタスクではGemini 3 Proに軍配が上がっている。VideoではGeminiとcomparableという感じだろうか(GeminiはLong Contextに非常に強い印象があるがLongVideoBenchて上回っている)。この辺は各タスクごとに強いモデルの棲み分けが進んできた。
また、Kimi K2.5非常に美麗でinteractiveなフロントエンドのデモが掲載されている。
Agent Swarmは、タスクをサブタスクに分解して、複数のエージェントに並列に投げて実行(最大100 sub agent)できるような枠組みであり、それらが高性能かつ低latencyとなるように訓練れている模様。これにより性能を向上させつつlatencyを80%削減しているとのこと。
この話はContext Foldingに近い話と推察される:
- [Paper Note] Scaling Long-Horizon LLM Agent via Context-Folding, Weiwei Sun+, arXiv'25, 2025.10
How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
によると、AgentSwarmはサブタスクを実施するエージェントのパラメータはfreezeし、サブエージェントを作成し、その結果を集約する処理をOrchestratorと呼ばれるlearnableなモジュールが担っており、サブエージェントからの結果はある種環境からの観測結果として扱われ、タスクの成否はOrchestratorのみに委ねられているようである。
Context Foldingは、Context Managerとポリシーが同時にFoldGRPOを通じて学習されており、エージェントそのものがサブタスク実行、結果を受け取り圧縮、メインブランチに加えるという能力をContext Managerと協調しながら実施することを学習している点が異なるように感じる。
また、並列実行したCritical Stepと呼ばれる、各サブエージェントの最大ステップ数に関する指標が導入され、これらCritical Stepをすべてのステップで集約し、特定のサブエージェントにworkloadが集中しないようにOrchestratorが調整されるとのこと。
公式ポスト:
OpenWeightモデルの中でソフトウェアエンジニアリングスキルでSoTA:
日本語でのポスト:
ポイント解説:
- How Kimi, Cursor, and Chroma Train Agentic Models with RL, PHILSCHMID, 2026.03
[Paper Note] Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning, Moo Jin Kim+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#DiffusionModel #PostTraining #read-later #Selected Papers/Blogs #Robotics #3D (Video) Issue Date: 2026-01-25 GPT Summary- 動画生成モデルを用いてロボットポリシーを単一のポストトレーニング段階で適応させる「Cosmos Policy」を提案。これにより、動画モデルがエンコードしたロボットアクションを直接生成し、複雑な行動を捉える。評価では、LIBEROとRoboCasaで最高のパフォーマンスを記録し、他のモデルを上回る成功率を達成。ポリシーのロールアウトデータを利用して、経験から学び世界モデルを洗練させることが可能。 Comment
元ポスト:
[Paper Note] Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders, Shengbang Tong+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Pretraining #NLP #DiffusionModel #TextToImageGeneration #PostTraining #read-later #Selected Papers/Blogs #2D (Image) #Stability #KeyPoint Notes #ImageSynthesis #Scalability #AutoEncoder #Author Thread-Post Issue Date: 2026-01-24 GPT Summary- RAEsは高次元セマンティック空間での成果を活かし、自由形式のテキストから画像生成にスケール可能かを検証。デコーダーを用いてImageNetを超えたスケールアップを行い、特定ドメインの重要性を発見。スケーリングによりフレームワークが単純化される一方、ノイズスケジューリングは依然重要。また、RAEsは全てのモデルスケールでVAEsを上回り、安定した性能を確保し、生成品質の向上を示した。これにより、多モーダルモデルの新たな可能性を切り開く。 Comment
元ポスト:
この研究はざっくり言うとRAE[^1]がスケールするか否かを調査し、スケールするための条件を調査し、事前学習(GenEval, DPGEvalでVAEと比較して4倍早く収束)、ダウンストリームタスクの双方でVAEベースのtext2imageモデルをoutperformすることを示しており、
スケールさせる際の最初の課題はデコーダにあり、web-scale, syntheticデータをただ増やすだけではfidelityは向上するが特定のドメイン(e.g., text reconstruction)の能力は伸びず、text renderingデータなどの、dataの構成が必要不可欠で、
続いてオリジナルのRAEではアーキテクチャに工夫(decoder入力にノイズを足す、ヘッドをwideにする、その他安定化の工夫)をしていたが、モデル、データがスケールした場合シンプルなアーキテクチャ(次元依存のノイズスケジューリング)のみが必須で他は不要となったという知見が得られており、
RAEでは視覚理解と生成が同じ潜在空間の上で行われることがVAEとは異なる強みで、生成のための学習をしても理解能力が損なわれないことを示し、そして、潜在空間上で(VAEの潜在表現は生成に特化しているが、RAEは視覚理解と生成の双方を扱われており同じ空間上で操作可能なので)LLMが直接test time scalingすることを可能にする、
と言ったことが著者ポストで解説されている。
まだ完璧に理解できていないのでRAEの論文から読みたい、が非常にインパクトの大きな話に見える。
[^1]:encoderをSigLIPなどの強力なvision encoderを用いた上で、デコーダを学習する手法。VAEではCNN等で潜在表現を低次元に圧縮するが、表現力に乏しく結果的に意味的な表現を捉える能力に乏しかったが、より強力な事前学習されたエンコーダと高次元の潜在表現を扱うことでDiffusion Modelで扱う潜在表現を進化させる。
[Paper Note] The AI Hippocampus: How Far are We From Human Memory?, Zixia Jia+, TMLR'26, 2026.01
Paper/Blog Link My Issue
#Survey #NLP #LanguageModel #AIAgents #MultiModal #RAG(RetrievalAugmentedGeneration) #ConceptErasure #TMLR #KnowledgeEditing #read-later #Selected Papers/Blogs #VisionLanguageModel #memory #KeyPoint Notes Issue Date: 2026-01-24 GPT Summary- メモリは、LLMおよびマルチモーダルLLMの推論と適応性を強化する基盤的要素であり、モデルが静的からインタラクティブなシステムへと進化する中で重要なテーマです。本調査では、メモリを暗黙的、明示的、エージェンティックの三つのパラダイムに分類し、各フレームワークを詳細に述べています。暗黙のメモリは内部パラメータに埋め込まれた知識を示し、明示的なメモリは外部ストレージによる動的な情報強化を指します。エージェンティックメモリは自律エージェントのための持続的な構造を提供し、長期的計画や協調行動を促進します。また、視覚や音声を含む多様なモダリティ間の整合性の重要性も考慮し、アーキテクチャの進展やベンチマークタスクに関連する挑戦について議論されています。 Comment
元ポスト:
AI Agentのメモリに関する包括的なSurvey。現在の技術の包括的なレビューだけでなく、人間の海馬との対比などから必要な能力が議論されている模様。また、現在のメモリが抱えている課題を同定し明言していることが大きな貢献で、
- memory contamination, hallucination (無関係、不正確なデータによるメモリの汚染と、それによって生じるハルシネーション)
- large scaleな検索の計算負荷
- いつ検索するのか、パラメータに内包される知識に頼るのかの判断の困難さ
- 長期にわたるinteractionに対してどのように一貫性を保つか
ということが挙げられるとのこと。
うーーん読みたい。
openreview: https://openreview.net/forum?id=Sk7pwmLuAY
[Paper Note] RayRoPE: Projective Ray Positional Encoding for Multi-view Attention, Yu Wu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Multi #Transformer #Attention #PositionalEncoding #2D (Image) #One-Line Notes #DepthEstimation #NovelViewSynthesis Issue Date: 2026-01-23 GPT Summary- 我々は、マルチビュー変換器における位置エンコーディングの新手法RayRoPEを提案し、パッチをユニークにエンコードしてSE(3)不変な注意を実現します。既存のエンコーディング方式の限界を踏まえ、光線に基づいてパッチの位置を表現し、ジオメトリに配慮した予測点を使用します。RayRoPEは多周波数の類似性を計算するためのクエリフレームの投影座標を確立し、不正確な3D点の不確実性に対処するための位置エンコーディング手法を提供します。視点合成とステレオ深度推定のタスクにおいて、代替方式に対して一貫した性能向上を示し、RGB-D入力の効果的な利用も確認しました。 Comment
pj page: https://rayrope.github.io/
元ポスト:
複数視点(multiview)での画像を入力とするtransformerの位置エンコーディングを改善した研究で、multiviewのattentionは下記のような性質を持つのが理想としており
(a) 座標系の取り方に対してattentionの出力が不変であり
(b) 同じ点であれば、どのviewからのattention出力であっても同一であるべき
(c) 幾何学的に近い点の方が類似度が高くあるべき
(d) 様々な粒度で特徴を捉えられるべき(高周波成分、低周波成分)
これらを獲得できるようにray(方向に関する情報)を取り入れるような新たなRoPEアーキテクチャを考案した、というような感じらしい(ゆるふわ理解)。
pj pageに他手法と比較して生成される別方向の画像などが高品質になっている例が掲載されている。
[Paper Note] LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR, Said Taghadouini+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #MultiLingual #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-01-22 GPT Summary- 1Bパラメータのエンドツーエンド多言語ビジョン・言語モデル「LightOnOCR-2-1B」は、文書画像をOCRなしで自然なテキストに変換します。スキャンやフランス語文書、科学的PDFに強力な対応を見せるこのモデルは、OlmOCR-Benchで最先端の成果を達成し、従来モデルより9倍小さく高速です。また、予測したバウンディングボックスを活用し、ローカリゼーションを強化。堅牢性向上のためにチェックポイント平均化とタスク算術を統合し、チェックポイントをApache 2.0の下で公開しました。 Comment
元ポスト:
HF: https://huggingface.co/collections/lightonai/lightonocr-2
関連:
- olmOCR 2: Unit test rewards for document OCR, Ai2, 2025.10
- [Paper Note] GutenOCR: A Grounded Vision-Language Front-End for Documents, Hunter Heidenreich+, arXiv'26, 2026.01
またしてもolmocr2超えのOCRが。高性能なOCRは様々な場面で活用(RAG, Agent, 埋蔵した学習データなど)できるので個人的に非常に強い需要があると思う。
元ポスト:
[Paper Note] Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization, Hao Luo+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #MultiModal #Reasoning #OpenWeight #CrossDomain #Robotics #VisionLanguageActionModel #UMM #Physics Issue Date: 2026-01-22 GPT Summary- Being-H0.5は、クロスエンボディメント一般化のために設計されたVLAモデルであり、人間の相互作用を「母国語」として扱う学習パラダイムを提案。35,000時間以上のマルチモーダルデータを含むUniHand-2.0を用いて、多様なロボット制御を統一的なアクション空間にマッピングし、リソースの少ないロボットが他のプラットフォームからスキルを習得できるようにする。Being-H0.5はMixture-of-Transformersを採用し、現実世界での安定性のために多様体保存ゲーティングとユニバーサル非同期チャンクイングを導入。シミュレーションベンチマークで最先端の結果を達成し、5つのロボットプラットフォームで強力な能力を示す。 Comment
pj page:
https://research.beingbeyond.com/being-h05
HF:
https://huggingface.co/collections/BeingBeyond/being-h05
元ポスト:
[Paper Note] GutenOCR: A Grounded Vision-Language Front-End for Documents, Hunter Heidenreich+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #VisionLanguageModel #OCR #Initial Impression Notes Issue Date: 2026-01-22 GPT Summary- GutenOCRはQwen2.5-VL-3BとQwen2.5-VL-7BをファインチューニングしたグラウンデッドOCRシステムで、視覚言語モデルを通じて読取り、検出、グラウンディングを一元化します。ビジネス文書や科学記事に対応し、条件付きクエリへの応答が可能です。GutenOCR-7Bは新しい評価プロトコルで合成グラウンディングスコアを向上させ、特にOCRの精度を高めていますが、特定のレイアウトではトレードオフが存在することも示されました。 Comment
元ポスト:
olmOCR2と比較しても性能が良さそうに見えるが果たして
- olmOCR 2: Unit test rewards for document OCR, Ai2, 2025.10
モデルはまだオープンになっていないように見える。
[Paper Note] Motion Attribution for Video Generation, Xindi Wu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#DiffusionModel #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #Physics Issue Date: 2026-01-21 GPT Summary- Motiveを提案し、動画生成における動きの影響を理解するための運動帰属のフレームワークを提供。運動重み付けされたロスマスクを用いて静的外観と時間的ダイナミクスを分離し、データのキュレーションを改善。VBenchで74.1%の人間の選好勝率を達成し、ファインチューニングデータの選定に初めて運動を用いるアプローチを示した。 Comment
pj page: https://research.nvidia.com/labs/sil/projects/MOTIVE/
元ポスト:
[Paper Note] STEP3-VL-10B Technical Report, Ailin Huang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #OpenWeight #read-later #Selected Papers/Blogs #VisionLanguageModel #UMM #Initial Impression Notes Issue Date: 2026-01-19 GPT Summary- STEP3-VL-10Bは、効率と最先端のマルチモーダル知能のトレードオフを再定義する軽量なオープンソース基盤モデル。言語に整合した知覚エンコーダとQwen3-8Bデコーダを統合し、1k回以上の強化学習を含むスケーラブルな後処理パイプラインを導入。並列協調推論を実装し、視覚推論の探索と統合を最適化。コンパクトながら、他の大規模モデルに匹敵する性能を発揮し、MMBenchで92.2%、AIME2025で94.43%などの成果を記録。再現可能な基準として全モデルスイートをコミュニティに提供。 Comment
元ポスト:
HF: https://huggingface.co/stepfun-ai/Step3-VL-10B
たったの10Bモデルにもかかわらず、100B, 200B級のベンチマーク性能を達成しており、unifiedなアーキテクチャで事前学習中に全てのパラメータをunfrozenな上で1.2Tマルチモーダルトークンで学習し、PaCoReと呼ばれるRLで学習されたtest time scaling手法や、GRPO系ではなくPPOをRLで採用するなど、ユニークな工夫が満載に見え、重要研究に見える。
[Paper Note] V-DPM: 4D Video Reconstruction with Dynamic Point Maps, Edgar Sucar+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Transformer #3D Reconstruction #3D (Scene) #4D Reconstruction #3D (Video) #SpatialUnderstanding Issue Date: 2026-01-16 GPT Summary- DPMをビデオ入力に適用するV-DPMを提案し、動的な3D再構築を実現。3D形状とカメラパラメータを表現し、VGGTを基にしたアプローチで最新の性能を達成。動的な深さと3D動作を完全に回復可能。 Comment
pj page: https://www.robots.ox.ac.uk/~vgg/research/vdpm/
元ポスト:
VGGT:
- [Paper Note] VGGT: Visual Geometry Grounded Transformer, Jianyuan Wang+, CVPR'25
[Paper Note] AnyDepth: Depth Estimation Made Easy, Zeyu Ren+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #DepthEstimation Issue Date: 2026-01-14 GPT Summary- 単眼深度推定に関する新しい軽量フレームワークを提案し、DINOv3を用いて高品質な特徴を取得。Simple Depth Transformerを設計し、計算オーバーヘッドを削減して精度を保ちながら85%-89%のパラメータ削減を実現。品質フィルタリング戦略でデータセットのサイズを縮小しつつトレーニング品質を向上。広範な実験により、DPTを上回る精度を確認。本研究は効率的なゼロショット深度推定の実現に向けたモデル設計とデータ品質の重要性を示す。 Comment
pj page: https://aigeeksgroup.github.io/AnyDepth/
元ポスト:
[Paper Note] Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning, Chengwen Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #Dataset #AIAgents #Evaluation #MultiModal #VisionLanguageModel #DeepResearch #3D (Video) #One-Line Notes Issue Date: 2026-01-14 GPT Summary- VideoDRは、ビデオを基にしたオープンドメインのビデオ質問応答のための新たな深層研究ベンチマークで、フレーム間の視覚的手がかり抽出やインタラクティブなウェブ検索、マルチホップ推論を要求する。高品質なビデオサンプルを提供し、複数のマルチモーダル大規模言語モデルの評価を行った結果、エージェントの性能はワークフローに依存することが示された。VideoDRは次世代ビデオ深層研究エージェントへの重要な課題を明らかにする。 Comment
元ポスト:
初めてのvideo deep researchベンチマークとのこと
[Paper Note] BabyVision: Visual Reasoning Beyond Language, Liang Chen+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Analysis #Dataset #Evaluation #read-later #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- MLLMは基本的な視覚タスクで人間、特に3歳児に劣る性能を示す。これを調査するために、視覚能力を評価する「BabyVision」ベンチマークを導入。388のタスクを通じて、MLLMのパフォーマンスが人間基準を大きく下回ることが確認された。具体的には、Gemini3-Pro-Previewが49.7点で、6歳や成人の平均94.1点に遠く及ばない。これにより、MLLMは基本的な視覚原理が不足していることが明らかにされ、BabyVision-Genと自動評価ツールキットも提案された。データとコードは公開されている。 Comment
pj page: https://unipat.ai/blog/BabyVision
元ポスト:
ポイント解説:
(読了前の第一印象)現在のMLLMが純粋な視覚的な推論タスクにおいて幼児以下であることを示し、既存のベンチマークの脆弱性(純粋な視覚的な推論能力を評価できていない)を指摘した上で新たなベンチマークを提案しているように見え、非常に重要な研究に見える。
[Paper Note] MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head, Kewei Zhang+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Attention #Architecture #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-01-14 GPT Summary- トランスフォーマーの自己注意の複雑さが大規模アプリケーションでの利用を制限する中、効率的な線形注意の適用は性能低下を招くことがあります。本研究では、モデルの表現の多様性を失わせる「グローバルコンテキスト崩壊」の問題を特定し、トークン次元に沿った注意計算による「マルチヘッド線形注意(MHLA)」を提案します。MHLAは線形の複雑さを保ちながら、ソフトマックス注意の表現力を回復することに成功し、様々なドメインでImageNet分類で3.6%、自然言語処理で6.3%、画像生成で12.6%、動画生成で41%の性能改善を達成しました。 Comment
pj page: https://dagroup-pku.github.io/MHLA/
元ポスト:
(読了前の第一印象)スループットを大幅に向上させながらも、大幅な性能改善をしている新たなlikear attention手法であり、image, video, textの3つのモダリティに対して性能向上しているように見えるため、結果のインパクトが大きく重要論文に見える。
[Paper Note] VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control, Sixiao Zheng+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#Controllable #OpenWeight #WorldModels #3D (Video) #Geometric Issue Date: 2026-01-14 GPT Summary- VerseCrafterは、カメラとオブジェクトの動きを一貫して制御する4Dビデオワールドモデルを提案。静的な背景と3Dガウス軌跡を使用して、オブジェクトの確率的な3D占有を表現し、高忠実度なビデオ生成を可能にする。自動データエンジンにより、大規模な4Dアノテーションデータセットを野生のビデオから抽出し、モデルのトレーニングを支援。 Comment
pj page: https://sixiaozheng.github.io/VerseCrafter_page/
元ポスト:
[Paper Note] FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection, Mingyu Ouyang+, CVPR'26, 2026.01
Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #CVPR #VisionLanguageModel #Grounding #GUI Issue Date: 2026-01-13 GPT Summary- 視覚言語モデル(VLM)を用いたUIグラウンディングタスクに関する研究で、FocusUIという効率的なフレームワークを提案。冗長トークンを排除し、指示に関連する視覚トークンを選択しつつ、位置的連続性を保持する新戦略を採用。これにより、4つのベンチマークで優れた性能を発揮し、特にScreenSpot-Proでは3.7%の性能向上を達成。視覚トークン保持率が30%でも高い推論速度と低メモリ使用を実現。 Comment
元ポスト:
[Paper Note] The Quest for Generalizable Motion Generation: Data, Model, and Evaluation, Jing Lin+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #SyntheticData #Evaluation #DiffusionModel #ICLR #Generalization #3D (Scene) #FlowMatching #Robotics #3D (Video) #HumanMotionGeneration Issue Date: 2026-01-11 GPT Summary- 3D人間動作生成(MoGen)は一般化能力に課題があるが、動画生成(ViGen)は優れた一般化を示す。これを受けて、ViGenからMoGenへの知識移転のためのフレームワークを提案。228,000の高品質な動作サンプルを含むデータセットViMoGen-228Kを作成し、MoCapデータとViGenモデルからの情報を統合したフローマッチングベースの拡散トランスフォーマーViMoGenを開発。さらに、動作の質や一般化能力を評価するための階層的ベンチマークMBenchを提示。実験結果は、提案手法が既存のアプローチを大幅に上回ることを示した。 Comment
dataset:
https://huggingface.co/datasets/wruisi/ViMoGen-228K
leaderboard:
https://huggingface.co/spaces/wruisi/MBench_leaderboard
元ポスト:
ポイント解説:
openreview: https://openreview.net/forum?id=KNke6Pkq4o
[Paper Note] VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice, Shuming Liu+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#NLP #read-later #VideoGeneration/Understandings #VisionLanguageModel #One-Line Notes Issue Date: 2026-01-10 GPT Summary- CoT推論は動画理解タスクにおいて有用だが、直接的な回答も同等以上の性能を示すことがある。本研究では、VideoAuto-R1というフレームワークを提案し、「一度考え、二度答える」アプローチを採用。初期回答を生成後、推論を行い、見直した回答を出力する。これにより、動画QAベンチマークで最先端の精度を達成し、応答長を約3.3倍短縮。推論集約型タスクでは高い思考モード活性化率が観察され、言語ベースの推論が常に必要ではないことを示唆している。 Comment
pj page: https://ivul-kaust.github.io/projects/videoauto-r1/
元ポスト:
テキストだと基本的にCoTが良い方向に働くがVideoになるとなぜうまくいかない場面が多いのだろうか?気になる
ポイント解説:
output formatを 直接応答→thinking→thinking後応答 とし、双方の応答に対してrewardを計算することで複数のrewardシグナルを同時に扱える。
(感想)モデルの直接応答によるrewardを用いることで、internalなreasoning能力が向上するし(効率の増加)、thinking後の応答に対してrewardを用いることでthinkingのリソースを費やした場合の性能も向上する効果かありそう。
[Paper Note] UniVideo: Unified Understanding, Generation, and Editing for Videos, Cong Wei+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #MultiModal #DiffusionModel #VariationalAutoEncoder #OpenWeight #ICLR #read-later #Selected Papers/Blogs #VideoGeneration/Understandings #Editing Issue Date: 2026-01-09 GPT Summary- UniVideoは、動画ドメインにおけるマルチモーダルコンテンツの生成と編集を目的とした統一モデルで、MLLMとMMDiTを組み合わせたデュアルストリーム設計を採用。これにより、複雑な指示の解釈と視覚的一貫性を維持しつつ、動画生成や編集タスクを統一的に訓練。実験結果では、テキスト/画像から動画への生成や文脈内編集において最先端の性能を示し、編集とスタイル転送の統合や未見の指示への対応も可能。視覚プロンプトに基づく生成もサポートし、モデルとコードは公開されている。 Comment
pj page: https://congwei1230.github.io/UniVideo/
元ポスト:
[Paper Note] NitroGen: An Open Foundation Model for Generalist Gaming Agents, Loïc Magne+, CVPR'26 Best Paper Honorable Mention, 2026.01
Paper/Blog Link My Issue
#Dataset #CVPR #read-later #Selected Papers/Blogs #Game #UMM #3D (Video) #VisionActionModel Issue Date: 2025-12-21 GPT Summary- NitroGenは、1,000以上のゲームを対象に40,000時間のプレイ動画で訓練された汎用ゲーミングエージェント向けのビジョン-アクション基盤モデルです。プレイヤーの操作を自動抽出したビデオ-アクションデータセット、クロスゲーム一般化を測るマルチゲームベンチマーク、ビヘイビア・クローン学習によるモデルを含みます。3Dアクションゲーム、2Dプラットフォーマー及び手続き的生成世界において高い能力を示し、未見のゲームでも最大52%のタスク成功率向上を実現。データセットやモデルの重みを公開し、汎用的な体現エージェントの研究を促進します。 Comment
元ポスト:
HF:
https://huggingface.co/nvidia/NitroGen
pj page:
https://nitrogen.minedojo.org/
1000以上のゲームの40000時間を超えるゲームプレイから学習されたVideo to Action Model
CVPR Best Paper Honorable Mention:
[Paper Note] Light-X: Generative 4D Video Rendering with Camera and Illumination Control, Tianqi Liu+, ICLR'26, 2025.12
Paper/Blog Link My Issue
#Controllable #SyntheticData #DiffusionModel #ICLR #VideoGeneration/Understandings #3D (Video) #One-Line Notes #Relighting #Author Thread-Post Issue Date: 2025-12-06 GPT Summary- Light-Xは、単眼動画から視点と照明を制御可能にする動画生成フレームワークで、幾何学と照明信号を分離する設計を採用。これにより高品質な照明を実現し、ペアのマルチビューおよびマルチ照明動画の不足に対処するために逆マッピングを用いた合成手法を導入。実験結果では、Light-Xがカメラと照明の共同制御において従来手法を上回る性能を示した。 Comment
pj page: https://lightx-ai.github.io/
元ポスト:
著者ポスト:
openreview: https://openreview.net/forum?id=VBew6vESGL
単眼で撮影された動画の視点と照明を同時に制御しながら動画を生成するフレームワークな模様。
背景画像をあたえた
単眼で撮影された動画の視点と照明を同時に制御しながら動画を生成するフレームワークな模様。
背景画像を与えた上での動画のRelighting, Text Promptに基づくRelighting, ユーザがtrajectoryを指定した上でのRelightingなどができるようである。
[Paper Note] PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image, Ziang Cao+, CVPR'26, 2025.11
Paper/Blog Link My Issue
#RepresentationLearning #SyntheticData #CVPR #VisionLanguageModel #3D (Scene) #Robotics #EmbodiedAI #One-Line Notes #Geometric #Physics #Simulation #3D Object Generation Issue Date: 2025-11-20 GPT Summary- PhysX-Anythingは、単一の野外画像から高品質なシミュレーション準備済みの3D資産を生成する新しいフレームワークで、ジオメトリ、関節、物理的属性を明示的に持つ。VLMベースのモデルと新しい3D表現を提案し、トークン数を193倍削減。新データセットPhysX-Mobilityにより物理3Dデータの多様性を拡張し、2,000以上の実世界オブジェクトを含む。実験により、生成性能と一般化能力が確認され、ロボティックポリシー学習に直接利用可能であることが示された。 Comment
元ポスト:
ポイント解説:
CVPRにアクセプト:
pj page: https://physx-anything.github.io/
simulation-readyな3Dオブジェクトを生成するVLMベースのモデルとのこと
[Paper Note] From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors, Zhengshen Zhang+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#ICLR #3D (Scene) #Robotics #VisionLanguageActionModel #SpatialUnderstanding Issue Date: 2025-11-03 GPT Summary- FALCON(From Spatial to Action)は、視覚-言語-行動(VLA)モデルの空間的推論のギャップを解消する新しいパラダイムで、3D空間トークンを行動ヘッドに注入します。RGBから幾何学的情報を提供し、深度やポーズを融合させることで高い忠実度を実現し、再訓練やアーキテクチャの変更は不要です。FALCONは、空間表現やモダリティの転送可能性を向上させ、11の現実世界のタスクで最先端のパフォーマンスを達成しました。 Comment
pj page: https://falcon-vla.github.io/
元ポスト:
openreview: https://openreview.net/forum?id=fzmittHfq3
[Paper Notes] Investigating fine- and coarse-grained structural correspondences between deep neural networks and human object image similarity judgments using unsupervised alignment, Takahashi+, Neural Networks'26, 2026.03
Paper/Blog Link My Issue
#NeuralNetwork #Analysis #Supervised #RepresentationLearning #Self-SupervisedLearning #CLIP #One-Line Notes Issue Date: 2025-10-31 Comment
元ポスト:
CLIP, 自己教師あり学習, 教師あり学習を比較したときに、CLIPが人間が獲得するobjectのrepresentationともっともalignしている一方で、自己教師あり学習はほとんど偶然レベルでしかalignしない(ただし、粗いレベルで見ると人間で言うところのカテゴリレベルのクラスタを形成することができる)。このため、テキストベースでの学習が人間が獲得する表現とfine-grainedなレベルでalignするために非常に重要であることが示唆される、という感じらしい
[Paper Note] VisCoder2: Building Multi-Language Visualization Coding Agents, Yuansheng Ni+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #AIAgents #Evaluation #Coding #ICLR Issue Date: 2025-10-30 GPT Summary- 大規模言語モデル(LLMs)を用いた視覚化コーディングエージェントは、実行や修正において課題がある。これを解決するために、679Kの視覚化サンプルを含むデータセットVisCode-Multi-679K、自己デバッグ用のベンチマークVisPlotBench、そしてマルチ言語モデルVisCoder2を提案。実験結果では、VisCoder2がオープンソースのベースラインを超え、商用モデルに近い性能を示し、特に記号的言語での成功が顕著であった。 Comment
pj page: https://tiger-ai-lab.github.io/VisCoder2/
元ポスト:
openreview: https://openreview.net/forum?id=4zoMnmZzh4
[Paper Note] IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction, Hao Li+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#Dataset #Transformer #FoundationModel #ICLR #3D Reconstruction #3D (Scene) #UMM #SpatialUnderstanding Issue Date: 2025-10-28 GPT Summary- 人間の3Dシーン理解を模倣するため、空間再構築とインスタンス理解を統合したInstanceGrounded Geometry Transformer(IGGT)を提案。IGGTは2D視覚入力を用いて幾何学的構造とインスタンスクラスタリングを統一的に表現し、3Dシーンの一貫性を向上させる。新たに構築したInsScene-15Kデータセットを用いて、3D一貫性のあるインスタンスレベルのマスク注釈を提供。 Comment
pj page: https://lifuguan.github.io/IGGT_official/
元ポスト:
ポイント解説:
openreview: https://openreview.net/forum?id=swiL18PmUV
[Paper Note] FineVision: Open Data Is All You Need, Luis Wiedmann+, NeurIPS'26, 2025.09
Paper/Blog Link My Issue
#Multi #NLP #Dataset #QuestionAnswering #MultiModal #Conversation #NeurIPS #VisionLanguageModel #2D (Image) #Author Thread-Post Issue Date: 2025-10-22 GPT Summary- 本研究では、視覚と言語のモデル(VLM)のために、24百万サンプルからなる統一コーパス「FineVision」を紹介。これは200以上のソースを統合し、半自動化されたパイプラインでキュレーションされている。データの衛生と重複排除が行われ、66の公的ベンチマークに対する汚染除去も適用。FineVisionで訓練されたモデルは、既存のオープンミックスモデルを上回る性能を示し、データ中心のVLM研究の加速を目指す。 Comment
pj page: https://huggingface.co/spaces/HuggingFaceM4/FineVision
ポイント解説:
著者ポスト:
[Paper Note] VChain: Chain-of-Visual-Thought for Reasoning in Video Generation, Ziqi Huang+, ACL'26 Findings, 2025.10
Paper/Blog Link My Issue
#Chain-of-Thought #DiffusionModel #Reasoning #ACL #VideoGeneration/Understandings #2D (Image) #Findings Issue Date: 2025-10-20 GPT Summary- VChainは、マルチモーダルモデルの視覚的推論を動画生成に活用する新しいフレームワークで、重要なキーフレームを生成し、動画生成器のチューニングを効率的にガイドします。このアプローチにより、複雑なシナリオにおいて生成動画の品質が大幅に向上しました。 Comment
pj page: https://eyeline-labs.github.io/VChain/
元ポスト:
Chain-of-Visual-Thoughts
keyframeをchain-of-thoughtsに含めることで、時間発展をより正確にしようという試みに見える。追加の学習なしで実施できるとのこと。
[Paper Note] From Pixels to Words -- Towards Native Vision-Language Primitives at Scale, Haiwen Diao+, ICLR'26, 2025.10
Paper/Blog Link My Issue
#Pretraining #Architecture #ICLR #Selected Papers/Blogs #VisionLanguageModel #UMM #KeyPoint Notes #Scalability Issue Date: 2025-10-19 GPT Summary- ネイティブなビジョン・ランゲージモデル(VLM)の課題を明確にし、効果的な構築指針を示す。具体的には、ピクセルと単語の整合、ビジョンとランゲージの統合、クロスモーダル特性の具現化を重視。新たに開発したNEOは、390Mの画像-テキスト例で視覚的知覚を効率的に発展させ、コスト効率の高いエコシステムを提供。 Comment
元ポスト:
pj page:
https://github.com/EvolvingLMMs-Lab/NEO
HFへのリンクもpj pageにある。
openreview: https://openreview.net/forum?id=DF6udvxuvY
新たなnative-VLMアーキテクチャを提案している。
従来のVLMは、事前学習されたVision EncoderとLLMをモジュールとして扱い両者を後から統合するタイプが多く、これらは異なるモダリティの特性を独立したモジュールで捉え、柔軟にモジュールを組み替えられる利点があるが、textとvisionモダリティのalignmentのコストや不整合といった課題が生じる。
これに対して、native-VLMとはモダリティごとに異なるモジュールを導入し組み合わせるのではなく、textとvisionのモダリティを統合されたアーキテクチャで扱うようなアーキテクチャのことである。
本研究では、ベースとなるLLMとしてQwen3を用いて、それを拡張することで構築されたnative-VLMのモデルファミリーNEOを構築し
- attentionブロックのQuery, Key計算時にtextual Token Tと、visual tokenのHeight H, Width Wを分離
- H, W, Tごとに独立した周波数でのRoPEの適用
- 画像に対するbidirectionalなattentionの適用
- vision/textを共通のembedding spaceに写像するtransformer layer (Pre Buffer)の導入
といったアーキテクチャの工夫がなされており、
このようなアーキテクチャが
- 事前学習: Patch Embedding Layer (PEL)、Pre Buffer, Pre Buffer適用後のpost-LLMにおける新たなQK部分のみを学習
した後、中間学習→SFT(instruction tuning)でモデル全体が学習される。
ここで、WELとはWord Embedding Layerのことである。
