端到端驾驶与规划 4 BEV与占用感知 1 3D检测与多模态融合 6 世界模型 2 VLA与机器人操作 5 人形与运动控制 1 具身导航与空间智能 4 定位与建图 1 仿真数据与评测 2
01 端到端驾驶与规划 4 篇
Enduring, Efficient and Robust Trajectory Prediction Attack in Autonomous Driving via Optimization-Driven Multi-Frame Perturbation Framework
💡 优化驱动的多帧对抗位置搜索攻击轨迹预测
🚗 增强对自动驾驶轨迹预测攻击的耐力与鲁棒性
Yi Yu · Weizhen Han · Libing Wu 等 6 人
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
💡 截断扩散与级联解码器,实现实时多模态驾驶动作生成
🚗 提出端到端驾驶策略生成模型,支持实时多模态动作输出
Bencheng Liao · Shaoyu Chen · Haoran Yin 等 11 人
DriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving
💡 结合高分辨率视觉分词器与专家LLM实现闭环控制
🚗 提升多模态大模型在闭环驾驶中的决策能力与速度
Zhenhua Xu · Yan Bai · Yujia Zhang 等 8 人
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
💡 视觉语言模型统一驾驶与语言动作对齐
🚗 纯相机闭环驾驶,提升可解释性
Katrin Renz · Long Chen · Elahe Arani 等 4 人
02 BEV与占用感知 1 篇
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
💡 用扩散模型对BEV特征去噪并真值引导
🚗 即插即用提升现有BEV模型下游任务性能
Xin Ye · Burhaneddin Yaman · Sheng Cheng 等 6 人
03 3D检测与多模态融合 6 篇
Towards Explicit Geometry-Reflectance Collaboration for Generalized LiDAR Segmentation in Adverse Weather
💡 分离几何与反射率特征的双分支协作框架
🚗 提升恶劣天气下LiDAR语义分割的泛化能力
Longyu Yang · Ping Hu · Shangbo Yuan 等 7 人
TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion
💡 单阶段融合雷达图结构,避免中间深度依赖
🚗 提升雷达相机深度估计的效率与鲁棒性
Yiran Wang · Jiaqi Li · Chaoyi Hong 等 9 人
CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image
💡 单阶段RGB-D融合网络同时分割与位姿估计
🚗 提升机器人对关节物体的6D位姿估计精度
Jingshun Huang · Haitao Lin · Tianyu Wang 等 6 人
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
💡 将空间坐标转为视觉标记,改善AD-VQA空间语义一致性
🚗 以标记提示学习提升自动驾驶视觉问答的空间感知与表达
Zhiyuan Zhang · Xiaofan Li · Zhihao Xu 等 7 人
SP3D: Boosting Sparsely-Supervised 3D Object Detection via Accurate Cross-Modal Semantic Prompts
💡 利用跨模态语义提示增强稀疏监督3D检测
🚗 提升稀疏标注下3D检测的判别力与鲁棒性
Shijia Zhao · Qiming Xia · Xusheng Guo 等 8 人
Learning Class Prototypes for Unified Sparse-Supervised 3D Object Detection
💡 用类原型和最优传输挖掘未标注物体
🚗 统一室内外稀疏监督3D检测,服务具身智能
Yun Zhu · Le Hui · Hang Yang 等 6 人
04 世界模型 2 篇
Navigation World Models
💡 可控视频生成预测未来视觉观测的导航世界模型
🚗 利用无标签视频提升导航规划,支持新约束
Amir Bar · Gaoyue Zhou · Danny Tran 等 5 人
SplatFlow: Self-Supervised Dynamic Gaussian Splatting in Neural Motion Flow Field for Autonomous Driving
💡 自监督动态高斯溅射学习4D运动场
🚗 无需3D框标注实现自动驾驶场景重建
Su Sun · Cheng Zhao · Zhuoyang Sun 等 5 人
05 VLA与机器人操作 5 篇
From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons
💡 多体现动作分词器统一模型,结合跨域数据与在线RL
🚗 为构建通用具身智能体提供数据与算法洞见
Andrew Szot · Bogdan Mazoure · Omar Attia 等 9 人
PDFactor: Learning Tri-Perspective View Policy Diffusion Field for Multi-Task Robotic Manipulation
💡 三平面表示的扩散策略场建模动作分布
🚗 提升多任务机器人操作的动作精度与效率
Jingyi Tian · Le Wang · Sanping Zhou 等 7 人
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
💡 从大规模视频中提取操作轨迹,训练语言生成6DoF轨迹
🚗 实现根据动作描述生成物体的6DoF操作轨迹
Tomoya Yoshida · Shuhei Kurita · Taichi Nishimura 等 4 人
OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
💡 以交互原语为空间约束,桥接VLM高层推理与底层操控
🚗 提出物体中心表示,提升机器人通用操作的空间精度与泛化
Mingjie Pan · Jiyao Zhang · Tianshu Wu 等 6 人
DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics Awareness
💡 物理约束融入扩散模型生成抓取姿态
🚗 发布超340万灵巧抓取姿态的大规模数据集
Yiming Zhong · Qi Jiang · Jingyi Yu 等 4 人
06 人形与运动控制 1 篇
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
💡 用共享本体感知标记与任务标记统一多技能策略
🚗 实现多技能人-场景交互的统一策略与知识共享
Liang Pan · Zeshi Yang · Zhiyang Dou 等 8 人
07 具身导航与空间智能 4 篇
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
💡 构建大规模空间理解数据集以训练视觉语言模型
🚗 增强机器人对空间参考框架的理解与交互能力
Chan Hee Song · Valts Blukis · Jonathan Tremblay 等 6 人
Functionality Understanding and Segmentation in 3D Scenes
💡 首个面向3D场景功能理解与分割的方法,利用语言模型推理
🚗 使具身智能体可根据任务描述定位隐含功能对象
Jaime Corsetti · Francesco Giuliari · Alice Fasoli 等 5 人
Reasoning in Visual Navigation of End-to-end Trained Agents: A Dynamical Systems Approach
💡 从动力学系统视角分析导航智能体推理
🚗 揭示端到端导航智能体的记忆与规划机制
Steeven Janny · Hervé Poirier · Leonid Antsfeld 等 9 人
Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces
💡 用VLM和LLM构建功能3D场景图
🚗 为机器人操作提供功能场景理解
Chenyangguang Zhang · Alexandros Delitzas · Fangjinhua Wang 等 7 人
08 定位与建图 1 篇
Unlocking Generalization Power in LiDAR Point Cloud Registration
💡 去交叉注意力,用渐进自注意力与BEV特征提升配准泛化
🚗 提升LiDAR点云配准在跨距离与跨数据集下的鲁棒性
Zhenxuan Zeng · Qiao Wu · Xiyu Zhang 等 8 人
09 仿真数据与评测 2 篇
Towards Autonomous Micromobility through Scalable Urban Simulation
💡 提出可扩展城市仿真平台,含层级场景生成与交互动力学
🚗 为自主微移动智能体提供大规模交互式城市训练环境
Wayne Wu · Honglin He · Chaoyuan Zhang 等 8 人
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
💡 用3D生成模型与LLM生成双臂任务数据
🚗 构建双臂机器人数据生成与评测平台
Yao Mu · Tianxing Chen · Zanxin Chen 等 14 人