今日从 arXiv 订阅中筛选 9 篇论文。

⚡ PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

](https://arxiv.org/abs/2607.04637) · **PDF**: [`2607.04637.pdf`](./2607.04637.pdf)

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

⚡ UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

](https://arxiv.org/abs/2607.05133) · **PDF**: [`2607.05133.pdf`](./2607.05133.pdf)

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

⚡ CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

](https://arxiv.org/abs/2607.04179) · **PDF**: [`2607.04179.pdf`](./2607.04179.pdf)

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

⚡ WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

](https://arxiv.org/abs/2607.03461) · **PDF**: [`2607.03461.pdf`](./2607.03461.pdf)

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

⚡ DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

](https://arxiv.org/abs/2607.04112) · **PDF**: [`2607.04112.pdf`](./2607.04112.pdf)

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

⚡ VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

](https://arxiv.org/abs/2607.02927) · **PDF**: [`2607.02927.pdf`](./2607.02927.pdf)

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

⚡ TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving

](https://arxiv.org/abs/2607.04812) · **PDF**: [`2607.04812.pdf`](./2607.04812.pdf)

TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving

⚡ Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

](https://arxiv.org/abs/2607.05122) · **PDF**: [`2607.05122.pdf`](./2607.05122.pdf)

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

⚡ Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling

](https://arxiv.org/abs/2607.04409) · **PDF**: [`2607.04409.pdf`](./2607.04409.pdf)


自动生成于 2026-07-08 · 基于 arXiv Daily Digest