LatentRepresentation


Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #Selected Papers/Blogs #VisionLanguageModel #reading #One-Line Notes Issue Date: 2026-07-19 GPT Summary- 視覚的事前学習が言語モデルの知能向上に寄与することを示す研究。テキスト変換を通さず視覚的文書を直接活用する無監督のアプローチを検討し、視覚的事前学習がテキストのみのモデルを一貫して上回ることを実証。これにより、スケーラブルな言語知能への効率的なアプローチが明らかに。 Comment

元ポスト:

Loading…

事前学習をする際に、テキストだけでなく画像パッチに対してもnext visual latent predictionを実施することで性能が改善する。
next visual latent predictionでは、画像パッチをfreezeされたvision encoderでエンコードし潜在表現の系列を取得し、現在のパッチを入力したときに、次のパッチの潜在表現を予測する(離散トークンではなく、連続値ベクトルである点に注意)。loss functionは、バッチ内の全ての画像パッチを考えたときに、各パッチの正解の潜在表現と、モデルが予測した次パッチの潜在表現の類似度行列をソフトマックスで正規化した行列を考え、対角成分(すなわち正解の画像パッチに対する類似度)が最大化されるように定義される。ソフトマックスを考えることで、バッチ内の他の画像パッチがin-batch negativeの役割を果たし、これは次パッチの潜在表現と他の潜在表現の区別がつくようなcontrastive learningをしていることに相当する(Section 4)。
image

image




Paper/Blog Link My Issue
#Embeddings #NLP #LanguageModel #memory Issue Date: 2026-07-05 GPT Summary- EvoEmbeddingは、文脈や時間的順序を考慮した動的な埋め込みモデルであり、逐次処理により潜在メモリを更新し、進化する状況に基づいて検索対象を最適化する。EvoTrain-180Kデータセットを用いて、潜在メモリと検索を共同最適化し、長文脈検索において他の大規模モデルを凌駕する性能を発揮することを実証。さらに、エージェント型ワークフローにも統合可能で、性能向上を実現。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Analysis #MachineLearning #NLP #Self-SupervisedLearning #One-Line Notes #Author Thread-Post Issue Date: 2026-06-02 GPT Summary- 生成モデルは、訓練データの量が生物的学習者に比べて大きくなる中で高い性能を示している。新たな手法として、ネットワークが潜在表現を予測する訓練が行われており、これがデータ効率の改善につながる可能性がある。本研究では、確率的文脈自由文法(PCFG)をデータに用いて、潜在予測が効率を高めることを示す。教師あり学習は指数的なサンプル数を要するのに対し、潜在予測は定数のサンプルで達成可能であることを明らかにした。また、階層的クラスタリングやエンドツーエンドのニューラルネットワークを用いた分析を通じて、data2vecが階層的潜在予測を実行していることを確認し、明示的なスタッキングの冗長性を示唆している。 Comment

元ポスト:

Loading…

JEPAのようなモデル自身が獲得した潜在表現を予測する自己教師あり学習手法は、階層的な生成構造を持つデータに対して、トークンレベルの予測ではO(m^{L+1})のサンプルが必要となるが、O(m^3)程度で済むことが理論的に示された模様。

著者ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #read-later #Selected Papers/Blogs #Stability #WorldModels #Pixel-based #Author Thread-Post Issue Date: 2026-03-24 GPT Summary- LeWorldModel(LeWM)は、原始ピクセルからエンドツーエンドで訓練できる最初のJoint Embedding Predictive Architecture(JEPA)を提案。従来の手法に比べ、調整可能な損失のハイパーパラメータを6個から1個に減らし、約1500万パラメータを持つLeWMは、ファウンデーションモデルより最大48倍速く学習。2Dおよび3Dの制御タスクで競争力を維持し、潜在空間が物理的構造を符号化していることを示す驚き評価も行われ、物理的に妥当でないイベントを検出する能力を確認。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, Randall Balestriero+, arXiv'25, 2025.11




Paper/Blog Link My Issue
#ComputerVision #RepresentationLearning #Self-SupervisedLearning #read-later #WorldModels Issue Date: 2026-03-22 GPT Summary- V-JEPA 2.1は、自己教師付きモデルで高品質な視覚表現を学習しつつ、強力なグローバルなシーン理解を維持します。密な予測損失により、可視トークンとマスクされたトークンが共に学習信号に寄与し、深い階層的な自己教師付き学習で表現の品質を向上。多モーダル・トークナイザーにより統一的な学習を実現し、モデル容量とデータのスケーリングを活かしています。これにより、空間的、意味的、時間的に一貫した表現を生成し、短期的物体相互作用やアクション予測で最先端の性能を達成。ロボットナビゲーションや深度推定でも高い結果を示し、密な視覚理解と世界モデリングの進展を証明しています。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…

解説:

Loading…

関連:
- [Paper Note] V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning, Mido Assran+, arXiv'25, 2025.06




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #RepresentationLearning #Transformer #Self-SupervisedLearning #OpenWeight #Encoder #WorldModels #KeyPoint Notes Issue Date: 2026-02-16 GPT Summary- C-JEPAは、オブジェクト中心の世界モデルで、画像パッチからの埋め込み予測を通じてオブジェクトの相互作用を捉えることを目的としている。オブジェクトレベルのマスキングを導入し、潜在的介入を誘発することで反事実的推論を強化し、ショートカット解法を防ぐ。実験結果では、視覚質問応答において約20%の性能向上を示し、エージェント制御タスクでは必要な潜在入力のわずか1%で同等の結果を達成した。さらに、因果的帰納的バイアスを誘発することも示している。 Comment

元ポスト:

Loading…

pj page: https://hazel-heejeong-nam.github.io/cjepa/

(JEPAは私にとってあまり馴染みがなく、以下の私の解説はどこかに誤りがある可能性が高い)

video basedなシステムを前提、すなわちimageのsequenceが与えられる前提である。このとき、各タイムステップごとに選択されたobjectの状態をマスクし、マスクされたobjectのhistoryを予測し、予測された状態から将来の状態を予測する。objectは状態だけでなく、補足的な観測可能な情報を保持することができ(たとえばアクションと感覚に関するシグナルなど)状態遷移に利用される。また、マスク対象として選択されたオブジェクトの最初のステップの状態だけは、アンカーとして保持する。マスク処理はlatent levelはでのinteiventionとして解釈でき、これにより予測のためにobject間の相互作用を捉えることが誘発され、object centricな潜在表現が学習される。マスクされたオブジェクトの状態は、予測された一つ前のステップでの状態に対してlinearで変換しpositional embeddingを足し合わせることで求められ(式3)、これらの予測されたhistoryの状態がViTの入力となり(bidirectionalなattentionを通じて)将来の状態を予測する。lossは予測されたhistoryの状態と将来の状態が与えられたときに、freezeされたobjectのエンコーダから得られる潜在表現との距離が最小化されるように学習される(エンコーダ側はstop gradientする)。

解説:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #ICML #Initial Impression Notes #Author Thread-Post Issue Date: 2025-11-27 GPT Summary- LatentMASは、マルチエージェントシステムにおいて、LLMエージェントがテキスト媒介なしで直接協力できるフレームワークを提案。各エージェントは潜在思考生成を行い、共有された潜在作業メモリを通じて情報を損失なく交換。理論的分析と9つのベンチマーク評価により、従来のテキストベースのMASよりも高い表現力と効率を示し、精度向上や推論速度の改善を実現。コードはオープンソースで提供。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Thought Communication in Multiagent Collaboration, Yujia Zheng+, NeurIPS'25 Spotlight, 2025.10

Would you like to collaborate on something building from this?

著者ポスト:

Loading…

エージェントのKV Pairをとっておき、次のエージェントで生成する際に、KV Pairをconcatすることで、潜在空間上で思考をエージェント間で共有する。ただし、エージェント間でKV Cacheを共有する上での核となるアイデアが3.1, 3.2と思われるが、まだ内容を読めていない。

image

textでのコンテキスト共有と比較して性能が向上するだけでなく、トークンコストとスピードが向上する。
image




Paper/Blog Link My Issue
#NLP #LanguageModel #Transformer #Self-SupervisedLearning #Architecture #Selected Papers/Blogs #WorldModels #KeyPoint Notes #Author Thread-Post Issue Date: 2026-06-18 GPT Summary- Next-Lat Prediction(NextLat)は、トランスフォーマーの次トークン予測を潜在空間での自己教師付き予測に拡張し、予測可能な潜在状態を学習。これにより、整合した信念状態を形成し、内部世界モデルをコンパクトに構築。エビデンスとして、推論や計画において顕著な精度向上を示し、言語モデリングの推論速度を最大3.3倍に高速化。NextLatはトランスフォーマーに再帰的な帰納バイアスを効果的に注入するシンプルで強力な手法を提供。 Comment

元ポスト:

Loading…

解説:

Loading…

以下上記解説ポストの要約

transformerのアーキテクチャではRNNのような状態を逐次更新するようなアーキテクチャではないため、現在の隠れ状態とnext tokenから、次の隠れ状態を予測できるような損失関数を追加し(式3)、transformerに状態遷移を学習させる(自己教師あり学習によって実現できる)。また、next tokenの予測性能を落とさないように、真の隠れ状態が与えられた時の出力分布と離れないようなKL Divergenceに基づく損失をLossとして加える(式4)。これにより、
- transformerが過去のhistoryをコンパクトなbelief statesに圧縮することを促し
- latent spaceを予測することでone-hot tokenからの学習よりもdenseなシグナルに基づくため、データ効率を向上させ、
- look-aheadをすることによって投機的デコーディングに資する
- 内部表現が一貫した世界モデルとなることを促す

といった狙いがある。実験の結果、planning能力が向上し(belief statesによって先を見越して計画することが促されるため)next token predictionのperplexityを低下させることなく20 token先まで予測した場合にMulti Token Predictionよりもcross-entropy lossで性能を上回る、といった恩恵があるようである。




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #RepresentationLearning #Self-SupervisedLearning #read-later #WorldModels #Author Thread-Post Issue Date: 2025-12-17 GPT Summary- VL-JEPAは、視覚と言語のモデルで、従来の自動回帰的トークン生成ではなく、埋め込みを予測するアプローチを採用。これにより、パラメータを50%削減しつつ、強力なパフォーマンスを実現。選択的デコーディングをサポートし、デコーディング操作の数を2.85倍削減。さらに、オープンボキャブラリー分類やテキストからビデオの検索を自然に行える。8つのビデオ分類・検索データセットで他のモデルを上回り、1.6BのパラメータでVQAデータセットでも同等の性能を達成。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

ポイント解説:

Loading…

関連:
- [Paper Note] V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning, Mido Assran+, arXiv'25, 2025.06




Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Self-SupervisedLearning #WorldModels Issue Date: 2025-11-13 GPT Summary- JEPAの理論を基にしたLeJEPAを提案し、等方的ガウス分布に基づく新しい目的関数SIGRegを導入。これにより、トレードオフハイパーパラメータの単一化、線形の複雑性、安定性を実現。10以上のデータセットでの実証実験により、LeJEPAは高い性能を示し、自己教師あり事前学習の重要性を再確認することを目指す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Multi #NLP #LanguageModel #AIAgents #NeurIPS Issue Date: 2025-11-07 GPT Summary- 自然言語の曖昧さが集合知の可能性を制限する中、思考コミュニケーションという新しいパラダイムを提案。エージェントが直接相互作用できるようにし、潜在変数モデルとして形式化。非パラメトリックな設定で、エージェント間の共有思考とプライベート思考を特定可能。理論に基づき、潜在的な思考を抽出し、共有パターンを割り当てるフレームワークを開発。実験により理論を検証し、思考コミュニケーションの利点を示す。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Analysis #Pretraining #MachineLearning #RepresentationLearning #Self-SupervisedLearning #read-later Issue Date: 2025-10-09 GPT Summary- JEPAは、潜在空間予測と反収束を組み合わせたアーキテクチャで、データ密度を推定する能力を持つ。成功裏に訓練されたJEPAは、データキュレーションや外れ値検出に利用可能で、サンプルの確率を効率的に計算できる。JEPA-SCOREと呼ばれる手法を用いて、さまざまなデータセットや自己教師あり学習手法でその効果が実証されている。 Comment

元ポスト:

Loading…

ポイント解説:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #NLP #LanguageModel #RepresentationLearning #Self-SupervisedLearning #Architecture Issue Date: 2025-09-20 GPT Summary- LLMのファインチューニングと評価が再構成能力に依存する一方、視覚分野ではJEPAsが有利であることが示される。言語モデルにJEPAsの手法を適用することの難しさを踏まえ、本研究ではLLM-JEPAを提案。これはLLMに特化したJEPAベースの解決策で、ファインチューニングや事前学習において従来の目的を上回り、過学習にも強い。多様なデータセットとモデルでその効果が確認された。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Self-SupervisedLearning #Robotics #WorldModels #EmbodiedAI Issue Date: 2025-07-24 GPT Summary- 自己教師あり学習を用いて、インターネット規模のビデオデータと少量のロボットデータを組み合わせ、物理世界を理解・予測・計画できるモデルV-JEPA 2を開発。モーション理解で高精度を達成し、動画質問応答タスクで最先端性能を示す。また、V-JEPA 2をロボット計画に適用し、ゼロショットで物体のピックアンドプレースを実現。ウェブとロボットデータからの自己教師あり学習で、物理世界における計画可能なワールドモデルを構築できることを示す。

Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Self-SupervisedLearning #TMLR #WorldModels Issue Date: 2025-07-24 GPT Summary- V-JEPAは、自己教師付き学習における特徴予測を単独の目的として訓練された視覚モデルのコレクションであり、他の監視情報を使用せずに200万本の動画から学習する。実験結果は、動作および外観タスクで良好な汎用的視覚表現を生み出すことを示し、最大のモデルがKinetics-400で81.9%、Something-Something-v2で72.2%、ImageNet1Kで77.9%の成果を上げた。 Comment

openreview: https://openreview.net/forum?id=QaCCuDfBk2




Paper/Blog Link My Issue
#ComputerVision #Pretraining #RepresentationLearning #Transformer #Self-SupervisedLearning #CVPR #read-later #Selected Papers/Blogs #WorldModels #One-Line Notes Issue Date: 2025-07-24 GPT Summary- 本論文では、手作りのデータ拡張に依存せずに意味的な画像表現を学習するI-JEPAという自己教師あり学習アプローチを提案。I-JEPAは、単一のコンテキストブロックから異なるターゲットブロックの表現を予測する。重要な設計選択として、意味的に大きなターゲットブロックと情報量の多いコンテキストブロックのサンプリングが挙げられる。実験により、I-JEPAはVision Transformersと組み合わせることでスケーラブルであり、ImageNet上で強力な下流性能を達成した。 Comment

Joint-Embedding Predictive Architecture (JEPA)を提案した研究。ピクセルやトークンのreconstruction lossではなく、潜在表現を再構成するようなself-supervised learningによってより意味的な特徴を学習するように誘導するもの(と思われるがこれが本質的な理解として正しいかは自信がない)。




Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #RepresentationLearning #Self-SupervisedLearning #read-later #WorldModels #Author Thread-Post Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

JEPA関連のチュートリアル

関連:
- [Paper Note] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture, Mahmoud Assran+, CVPR'23, 2023.01
- [Paper Note] LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics, Randall Balestriero+, arXiv'25, 2025.11
- [Paper Note] LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels, Lucas Maes+, arXiv'26, 2026.03
- JEPAwiki, mishig, 2026.04

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #RepresentationLearning #OpenWeight #VideoGeneration/Understandings #WorldModels #3D (Video) Issue Date: 2025-06-12 Comment

元ポスト:

Loading…

Physical Reasoning Leaderboardなるもので現在トップな模様。

https://huggingface.co/spaces/facebook/physical_reasoning_leaderboard

- [Paper Note] V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning, Mido Assran+, arXiv'25, 2025.06