今日从 arXiv 订阅中筛选 9 篇论文。
⚡ PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
](https://arxiv.org/abs/2607.04637) · **PDF**: [`2607.04637.pdf`](./2607.04637.pdf)

⚡ UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
](https://arxiv.org/abs/2607.05133) · **PDF**: [`2607.05133.pdf`](./2607.05133.pdf)

⚡ CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving
](https://arxiv.org/abs/2607.04179) · **PDF**: [`2607.04179.pdf`](./2607.04179.pdf)

⚡ WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling
](https://arxiv.org/abs/2607.03461) · **PDF**: [`2607.03461.pdf`](./2607.03461.pdf)

⚡ DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
](https://arxiv.org/abs/2607.04112) · **PDF**: [`2607.04112.pdf`](./2607.04112.pdf)

⚡ VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
](https://arxiv.org/abs/2607.02927) · **PDF**: [`2607.02927.pdf`](./2607.02927.pdf)

⚡ TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving
](https://arxiv.org/abs/2607.04812) · **PDF**: [`2607.04812.pdf`](./2607.04812.pdf)

⚡ Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies
](https://arxiv.org/abs/2607.05122) · **PDF**: [`2607.05122.pdf`](./2607.05122.pdf)

⚡ Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling
](https://arxiv.org/abs/2607.04409) · **PDF**: [`2607.04409.pdf`](./2607.04409.pdf)
自动生成于 2026-07-08 · 基于 arXiv Daily Digest