端到端驾驶与规划 9 BEV与占用感知 6 3D检测与多模态融合 10 世界模型 3 VLA与机器人操作 16 人形与运动控制 3 具身导航与空间智能 8 定位与建图 6 仿真数据与评测 7
01 端到端驾驶与规划 9 篇
RefAV: Towards Planning-Centric Scenario Mining
💡 用VLM自然语言查询检测驾驶场景
🚗 实现基于语言的高效自动驾驶安全场景挖掘
Cainan Davidson · Deva Ramanan · Neehar Peri
SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World
💡 轨迹条件稀疏世界模型与细粒度碰撞推理
🚗 实现可解释的安全规划与风险评估
Jungho Kim · Jiyong Oh · Seunghoon Yu 等 6 人
CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention
💡 稀疏因果干预方案实现后门调整去偏
🚗 消除数据集伪相关提升规划鲁棒性
Jiacheng Tang · Zhiyuan Zhou · Zhuolin He 等 6 人
Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems
💡 基于神经标度律的迭代数据混合优化
🚗 系统化构建训练集以提升多指标性能
Tolga Dimlioglu · Nadine Chang · Maying Shen 等 5 人
ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving
💡 提出规划导向的主动学习策略
🚗 提升端到端自动驾驶采样和标注效率
Han Lu · Xiaosong Jia · Yichen Xie 等 7 人
Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction
💡 渐进式回顾框架对齐不完全观测
🚗 解决可变长度观测下轨迹预测难题
Hao Zhou · Lu Qi · Xiangtai Li 等 8 人
GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
💡 流匹配中直接施加显式约束
🚗 解决生成式规划器约束融入困难
Lin Liu · Caiyan Jia · Guanyi Yu 等 9 人
Unifying Language-Action Understanding and Generation for Autonomous Driving
💡 统一语言动作到共享离散码本
🚗 提升VLA中指令与动作一致性
Xinyang Wang · Qian Liu · WENJIE DING 等 10 人
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
💡 反事实推理自反思机制修正动作
🚗 提升VLA驾驶安全性和可解释性
Zhenghao Peng · Wenhao Ding · Yurong You 等 13 人
02 BEV与占用感知 6 篇
SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model
💡 端到端从图像预测多帧稀疏占用
🚗 提升自动驾驶未来占用预测的表示能力与效率
Jiayuan Du · Yiming Zhao · Zhenglong Guo 等 8 人
OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
💡 首个真实相机空中SSC基准
🚗 推动无人机场景理解与自动驾驶空中感知
Markus Gross · Sai B. Matha · Aya Fahmy 等 6 人
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes
💡 仅用几何标签实现开放词汇3D占用
🚗 为室内具身智能提供细粒度语义占用感知
Changqing Zhou · Yueru Luo · Han Zhang 等 5 人
RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation
💡 可学习天线混合器与早退策略
🚗 实现低延迟高精度雷达感知
Anuvab Sen · Mir Sayeed · Saibal Mukhopadhyay
SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors
💡 生成非侵入式、多视图时空一致的3D对抗物体
🚗 揭示BEV检测器对物理对抗物体的脆弱性
Aixuan Li · Mochu Xiang · Bosen Hou 等 6 人
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
💡 提出开放词汇域泛化分割新设置与基准
🚗 提升自动驾驶在未知域和未知类别的语义分割鲁棒性
Dong Zhao · Qi Zang · Nan Pu 等 6 人
03 3D检测与多模态融合 10 篇
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
💡 基于SAM2改进的机器人分割基础模型
🚗 提供专用机器人分割工具,支持数字孪生与动作提取
Haiyang Mei · Qiming Huang · Hai Ci 等 4 人
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
💡 结合VGGT几何建模与精确分割
🚗 提升具身AI中跨视角实例分割精度
Yulu Gao · Bohao Zhang · Zongheng Tang 等 6 人
RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes
💡 首次将毫米波雷达与神经辐射场结合用于动态场景
🚗 提升自动驾驶在恶劣天气下的场景重建鲁棒性
Jiarui Zhang · Zhihao Li · Chong Wang 等 4 人
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs
💡 首个大规模低成本LiDAR时空直方图数据集
🚗 为低价传感器实现数据驱动的非视距感知
Nikhil Behari · Diego Rivero · Luke Apostolides 等 6 人
CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography
💡 提供准密集3D真值及多传感器同步数据
🚗 填补复杂路面几何感知的数据空白
Gasser Elazab · Frank Neuhaus · Tilman Koß 等 8 人
Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation
💡 协同去噪与对齐模块处理全景畸变与域偏移
🚗 实现无源数据的全景分割迁移
Yaowen Chang · Zhen Cao · Xu Zheng 等 5 人
TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation
💡 时间一致性聚合实现多帧监督
🚗 提升自监督场景流估计鲁棒性
Qingwen Zhang · Chenhan Jiang · Xiaomeng Zhu 等 7 人
Scene Reconstruction as Mapping Priors for 3D Detection
💡 自动从传感器数据构建密集地图先验
🚗 无需人工标注提升3D检测的远程和恶劣天气性能
Yang Fu · Yuliang Zou · Hao Xiang 等 11 人
Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection
💡 自适应框架学习何时及如何利用属性间相关性
🚗 通过链式预测提高单目3D检测的深度精度
Zhihao Zhang · Abhinav Kumar · Girish Chandar Chandar 等 4 人
RaUF: Learning the Spatial Uncertainty Field of Radar
💡 各向异性概率模型建模雷达测量不确定性
🚗 改善毫米波雷达在自动驾驶中的空间感知可靠性
Shengpeng Wang · Kuangyu Wang · Wei Wang
04 世界模型 3 篇
WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World
💡 提出涵盖几何、物理与功能可靠性的多维度评测
🚗 系统揭示现有驾驶世界模型在真实场景中的缺陷
Ao Liang · Lingdong Kong · Tianyi Yan 等 22 人
U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
💡 硬到易的两阶段不确定性感知生成框架
🚗 提升动态场景下4D世界模型的真实感与时间稳定性
Xiang Xu · Ao Liang · Youquan Liu 等 7 人
PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
💡 将状态和动作统一为3D点流表示
🚗 实现跨本体机器人操作的世界模型预训练
Wenlong Huang · Yu-Wei Chao · Arsalan Mousavian 等 7 人
05 VLA与机器人操作 16 篇
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
💡 引入自适应触觉注入机制避免干扰预训练能力
🚗 提升VLA在接触丰富操作中的实时触觉反馈利用
Xiaoqi Li · Muhe Cai · Jiadong Xu 等 8 人
Structural Action Transformer for 3D Dexterous Manipulation
💡 将动作块重构为无序关节轨迹序列处理异质本体
🚗 实现跨本体3D灵巧操作的技能迁移与策略学习
Xiaohan Lei · Min Wang · Bohong Weng 等 5 人
CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics
💡 建模跨模态转移动力学而非静态对应
🚗 在LIBERO-LONG上达到94.9%成功率
Andrew Jeong · Jaemin Kim · Sebin Lee 等 4 人
SaPaVe: Towards Active Perception and Manipulation in Vision-Language Action Models for Robotics
💡 解耦相机和操作动作,自底向上学习
🚗 提出ActiveViewPose-200K数据集和几何感知模块
Mengzhen Liu · Enshen Zhou · Cheng Chi 等 9 人
ForeAct: Steering Your VLA with Efficient Visual Foresight Planning
💡 基于想象未来观察的视觉引导规划器
🚗 在H100上0.33秒生成高清未来观察指导VLA
Zhuoyang Zhang · Shang Yang · Qinghao Hu 等 8 人
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
💡 通用可迁移物理补丁攻击VLA机器人
🚗 揭示VLA模型在未知场景下的安全漏洞
Hui Lu · Yi Yu · Yiming Yang 等 8 人
Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling
💡 分阶段从柔性到刚性建模手物关节操作
🚗 实现单目下关节物体操作的鲁棒重建
Xingyu Liu · Pengfei Ren · Qi Qi 等 7 人
BiPreManip: Learning Affordance-Based Bimanual Pre-Manipulation through Anticipatory Collaboration
💡 视觉可操作性框架实现双臂协作预备操作
🚗 使机器人能处理需顺序不对称协调的物体操作任务
Yan Shen · Feng Jiang · Zichen He 等 8 人
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
💡 引入主动视觉注意力基于POMDP动态调制视觉处理
🚗 提升VLA模型在动态序列决策中的视觉token利用效率
Lei Xiao · Jifeng Li · Juntao Gao 等 9 人
Cross-Hand Latent Representation for Vision-Language-Action Models
💡 统一潜在动作空间实现跨灵巧手的VLA学习
🚗 降低新机械手数据收集成本实现跨本体迁移
Guangqi Jiang · Yutong Liang · Jianglong Ye 等 9 人
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
💡 预测性运动学与3D高斯几何训练时监督
🚗 提升VLA模型在精确3D推理操作任务中的可靠性
Jingjing Qian · Boyao Han · Chen Shi 等 7 人
StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
💡 无监督学习两token压缩状态表示,利用DiT先验
🚗 提升VLA模型11.6%和31%成功率
Mingyu Liu · Jiuhe Shu · Hui Chen 等 9 人
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
💡 引入高斯先验正则化动作分布对齐邻域几何
🚗 提升VLA微调的样本效率和泛化性
Haochen Niu · Kanyu Zhang · Shuyu Yin 等 6 人
CycleManip: Enabling Cycle-based Manipulation via Effective History Perception and Understanding
💡 端到端模仿学习周期性机器人操作任务
🚗 首个针对周期操作的基准和框架
Yi-Lin Wei · Haoran Liao · Yuhao Lin 等 7 人
Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation
💡 融合球谐表示与特征增强模块实现等变扩散
🚗 首次实现稳定多模态等变扩散策略
Qinglun Zhang · Shen Cheng · Tian Dan 等 6 人
GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions
💡 编码照明变化引导RGB与非RGB特征自适应融合
🚗 提升低光照下衣物抓取鲁棒性
Haifeng Zhong · Wenshuo Han · Zhouyu Wang 等 13 人
06 人形与运动控制 3 篇
Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
💡 统一音频到运动框架,无需显式动作重建
🚗 首次实现从音频直接生成人形机器人舞蹈和手势
Zhe Li · Cheng Chi · Yangyang Wei 等 12 人
End-to-End Language-Action Model for Humanoid Whole Body Control
💡 端到端语言到低层动作的映射,无需中间表征
🚗 实现人形机器人语言指令直接驱动全身运动控制
Yuxuan Wang · Haobin Jiang · Shiqing Yao 等 5 人
Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrains
💡 使用体素化激光雷达表示和z-分组2D CNN
🚗 实现复杂3D地形下全端到端人形运动控制
Qingwei Ben · Botian Xu · Kailin Li 等 9 人
07 具身导航与空间智能 8 篇
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
💡 分层“脑-动作”架构融入社交规范理解
🚗 构建大规模数据集与多阶段训练实现社交合规导航
Ziyi Chen · Yingnan Guo · Zedong Chu 等 16 人
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning
💡 结合高斯表征与语言描述的多尺度语义地图
🚗 实现零样本具身导航,无需额外训练特征投影
Sixian Zhang · Yiyao Wang · Xinhang Song 等 6 人
GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching
💡 VLM驱动的潜在子目标想象与多段一致性流匹配
🚗 提升无地图导航中的目标对齐和时间一致性
Yuqi Chen · Junjie Gao · Yongzhou Pan 等 7 人
When Robots Should Say ''I Don’t Know'': Benchmarking Abstention in Embodied Question Answering
💡 提出EQA中放弃回答的基准和分类
🚗 为具身agent提供不确定场景下拒答能力的评估方法
Tao Wu · Chuhao Zhou · Guangyu Zhao 等 6 人
EgoAVU: Egocentric Audio-Visual Understanding
💡 自动生成自我中心音视频标注数据
🚗 提升多模态大模型在具身视频中的理解能力
Ashish Seth · Xinhao Mei · Changsheng Zhao 等 12 人
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
💡 混合IL-RL范式与分层决策机制
🚗 提升空中VLN泛化与长距离规划
Chengjie Fan · Cong Pan · Zijian Liu 等 5 人
ReMoT: Reinforcement Learning with Motion Contrast Triplets
💡 结合自动生成运动对比数据集与组相对策略优化训练VLM
🚗 增强VLM在导航和自动驾驶中的时空一致性推理
Cong Wan · Zeyu Guo · Jiangyang Li 等 8 人
STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation
💡 统一时空表示框架融合图推理与时序动态
🚗 增强视觉导航中细粒度时空结构建模与动作预测
Hao Ren · Zetong Bi · Yiming Zeng 等 6 人
08 定位与建图 6 篇
LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization
💡 鲁棒投影几何编码器与截断相对可靠性损失
🚗 提升复杂环境下激光雷达重定位的鲁棒性和精度
Jianshi Wu · Minghang Zhu · dq Liu 等 8 人
Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization
💡 基于RKHS的局部几何表征与二阶流形优化
🚗 显著加速无对应点云配准,降低驾驶域平移旋转误差
Ray (Rui) Zhang · Carl Greiff · Thomas Lew 等 4 人
StreamVLO: Streaming Visual–LiDAR Odometry with Cumulative Drift Compensation
💡 基于Mamba的统一时空融合与在线漂移补偿
🚗 提升4D动态环境中的定位精度与稳定性
Mengmeng Liu · Jiuming Liu · Michael Ying Yang 等 9 人
VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation
💡 利用双轴变换构建地面-卫星视图的视角不变表示
🚗 提升密集城区跨视图定位的准确性与鲁棒性
Juhye Park · Wooju Lee · Dasol Hong 等 7 人
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
💡 利用VLM的空间推理能力实现文本到点云定位
🚗 将自然语言与3D点云地图对齐以精确全局定位
Shuhao Kang · Youqi Liao · Peijie Wang 等 8 人
HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps
💡 利用单应性约束引导特征融合与姿态输出
🚗 在标准地图上实现低成本高精度视觉定位
Xuchang Zhong · Xu Cao · Jinke Feng 等 4 人
09 仿真数据与评测 7 篇
SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge
💡 从单图重建物理一致的可动物体URDF
🚗 提供仿真就绪可动物体资产,加速具身AI研究
Yumeng He · Ying Jiang · Jiayin Lu 等 5 人
SimScale: Learning to Drive via Real-World Simulation at Scale
💡 基于神经渲染与扰动轨迹合成安全临界驾驶数据
🚗 弥合真实与仿真分布差异提升驾驶决策泛化性
Haochen Tian · Tianyu Li · Haochen Liu 等 13 人
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI
💡 多传感器采集+可靠重建+准确几何的实到仿框架
🚗 提供高保真闭环评估环境,揭示几何质量影响
Xinhao Liu · Jiaqi Li · Youming Deng 等 10 人
HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation
💡 无重标注的高保真车道场景生成框架
🚗 提升极端天气下车道检测模型性能
Daichao Zhao · Qiupu Chen · Feng He 等 5 人
Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation
💡 提供力觉和触觉同步的关节操作数据集
🚗 支持机器人操作中力觉和跨视角迁移研究
Tim Engelbracht · René Zurbrügg · Matteo Wohlrapp 等 8 人
Scalable Trajectory Generation for Whole-Body Mobile Manipulation
💡 GPU加速的移动操作轨迹生成,速度提升80倍
🚗 提供大规模移动操作数据集以支持通用策略学习
Yida Niu · Xinhai Chang · Xin Liu 等 5 人
RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning
💡 强化学习微调对齐仿真与真实分布
🚗 提升仿真真实性与目标可控性
Ehsan Ahmadi · Hunter Schofield · Behzad Khamidehi 等 8 人