今日从 arXiv 订阅中筛选 10 篇论文。
⚡ WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

⚡ ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

⚡ A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

⚡ AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images

⚡ OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

⚡ Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

⚡ COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

⚡ Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

⚡ Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding

自动生成于 2026-08-24 · 基于 arXiv Daily Digest
