MultiView


Paper/Blog Link My Issue
#ComputerVision #Dataset #MultiModal #Robotics #EmbodiedAI #EgocentricView #Author Thread-Post Issue Date: 2026-08-09 GPT Summary- 身体性を伴う知能は、知覚と行動の全体ループを捉えるためのデータのボトルネックに直面している。既存のデータセットはこれを分断しているため、全体像を捉えられない。そこで、Ambient Capture Engine(ACE)を導入し、実在の家庭環境を空間的に較正された録画スタジオに変換。ACEは、手と物体の操作や全身の運動を二つのスケールで捉え、統合された多感覚ストリームとして記録する。ACE-Data-0は150時間、1700万フレームの映像を収集し、75,000の相互作用エピソードを網羅。さらに、相互作用における自然な行動のばらつきを保持し、階層的なベンチマークを導入。ACE-Data-0は知覚、運動学、接触の同期を示し、身体性AIのスケーラブルな基盤を提供する。 Comment

pj page: https://ace-data-engine.github.io/ACE-Data-0/

元ポスト:

Loading…




Paper/Blog Link My Issue
#Supervised-FineTuning (SFT) #MultiModal #Reasoning #ICML #PostTraining #GRPO #VisionLanguageModel #SpatialUnderstanding #Author Thread-Post Issue Date: 2026-05-06 GPT Summary- 視点間対応と逐次的視点変換を強化するために、HATCH(Human-Aware Training for Cross-view correspondence and viewpoint cHange)を提案。これにより、空間的整合性を促進し、視点遷移アクションを生成して推論を改善。実験結果は、HATCHが同規模のモデルを上回り、大規模モデルとも競合する性能を示した。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Reasoning #Proprietary #Robotics #VisionLanguageActionModel #SpatialUnderstanding #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-04-15 Comment

元ポスト:

Loading…

おー、とうとうDeepmindからVLAがでた。プロプライエタリモデル

私が知らなかっただけで、以前からリリースされていたようだ:
- Building the Next Generation of Physical Agents with Gemini Robotics-ER 1.5, Google, 2025.09
- https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/

ポイント解説:

Loading…