今日从 arXiv 订阅中筛选 10 篇论文。
⚡ MoWAM: Explicit Future Motion Prediction for Efficient World Action Models
WAM 的未来表示:不用生成视频,直接预测结构化机器人运动。

⚡ MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving
自驾世界-动作模型:多条"场景-动作"假设成对演化,再按配对未来排序。

⚡ Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models
常用指标"截断深度看质量坡率"其实混了三个因素。
⚡ Astronex-World 1.0: Real-Time Interactive World Model Foundation
实时可交互视频世界模型基础:5 阶段全部在 2×L20 上完成。

⚡ CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
WAM 的表示修正:重建导向表示换成因果语义表示,OOD 泛化翻数倍。

⚡ Recency Forcing: Bridging the Long-Horizon Gap in Autoregressive Video Generation
自回归视频生成的 train-inference 差异:KV 淘汰不匹配。
⚡ M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
离散动作 tokenizer:瓶颈在重建损失,修复在多头+多码本。

⚡ GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies
动作块开多长?用去噪轨迹的几何自己说。

⚡ Worst-Case Hidden-Vehicle Trajectory Search in Spatiotemporal Occlusion Regions
遮挡里藏着什么车?把"最坏合法轨迹"搜出来。

自动生成于 2026-09-19 · 基于 arXiv Daily Digest
