AutonomousDriving
[Paper Note] Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving, Xin Zhou+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#FoundationModel #VisionLanguageModel Issue Date: 2026-09-08 GPT Summary- Qwen-Drive-1.0は、自動運転のための統一視覚と言語基盤モデルを提供します。事前学習済みのVLMアーキテクチャを保持し、3D知覚、視覚質問応答、運動計画を統合。BEV認識ヘッドは3D物体検出や占有予測を行い、明示的な3Dシーンインターフェースを提供。Planning ExpertはVLMの表現を利用して自車の未来の軌道を生成。段階的学習により、運転監督データと視覚-言語データを組み合わせ、運転特有の能力を獲得しつつ、視覚理解能力を維持。実験で高い3D認識能力と運動計画の競争力が確認されました。 Comment
元ポスト:
[Paper Note] Generative Scenario Rollouts for End-to-End Autonomous Driving, Rajeev Yasarla+, arXiv'26, 2026.01
Paper/Blog Link My Issue
#ComputerVision #Planning #Reasoning #CVPR #Robotics #VisionLanguageActionModel Issue Date: 2026-02-23 GPT Summary- VLAモデルを用いた自動運転システムのためのGeRoフレームワークを提案。エゴ車両の動態を潜在トークンにエンコードし、言語条件付きの自己回帰生成を通じて交通シーンを共同生成。整合性損失を利用して予測を安定化し、長期的推論を支援。Bench2Driveで運転スコアを+15.7ポイント、成功率を+26.2ポイント改善。生成的かつ言語条件付けられた推論の有望性を示す。 Comment
元ポスト:
[Paper Note] Epona: Autoregressive Diffusion World Model for Autonomous Driving, Kaiwen Zhang+, ICCV'25, 2025.06
Paper/Blog Link My Issue
#ComputerVision #NLP #Transformer #DiffusionModel #LongContext #OpenWeight #ICCV #WorldModels #3D (Video) Issue Date: 2026-02-08 GPT Summary- Eponaという自回帰型拡散世界モデルを提案し、長期予測と軌道計画の統合を実現。デカップル型因子分解により局所的な時空間分布をモデリングし、エンドツーエンドで動作計画と視覚モデリングを統合。実験により7.4%のFVD改善を達成し、数分間の長期予測が可能。学習したモデルはリアルタイム動作プランナーとしても優れた性能を示す。 Comment
元ポスト:
[Paper Note] Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail, Pavone+, Nvidia, 2025.10
Paper/Blog Link My Issue
#Article #Dataset #ReinforcementLearning #Reasoning #SmallModel #OpenWeight #Robotics #VisionLanguageActionModel #Realtime Issue Date: 2025-12-06 GPT Summary- AR1は因果連鎖推論と軌道計画を統合した視覚–言語–行動モデルであり、自律運転の意思決定を強化します。主な革新は、因果連鎖データセットの構築、モジュラーVLAアーキテクチャの導入、強化学習を用いた多段階トレーニング戦略です。評価結果では、AR1は計画精度を最大12%向上させ、推論の質を45%改善しました。リアルタイムパフォーマンスも確認され、レベル4の自律運転に向けた実用的な道筋を示しています。 Comment
HF: https://huggingface.co/nvidia/Alpamayo-R1-10B
元ポスト:
