CONFERENCE ARCHIVE
CVPR 2025
自动驾驶 · 具身智能论文归档
从 483 篇 Oral / Highlight 论文中,精选 26 篇对口研究
本届会议官方站未提供 Highlight 聚合页,该层级数据来自第三方论文聚合平台。
01
端到端驾驶与规划
4 篇
Highlight通过优化驱动的多帧扰动框架实现持久、高效且鲁棒的自动驾驶轨迹预测攻击
Enduring, Efficient and Robust Trajectory Prediction Attack in Autonomous Driving via Optimization-Driven Multi-Frame Perturbation Framework
💡 优化驱动的多帧对抗位置搜索攻击轨迹预测
🚗 增强对自动驾驶轨迹预测攻击的耐力与鲁棒性
Yi Yu · Weizhen Han · Libing Wu 等 6 人
HighlightDiffusionDrive:面向端到端自动驾驶的截断扩散模型
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
💡 截断扩散与级联解码器,实现实时多模态驾驶动作生成
🚗 提出端到端驾驶策略生成模型,支持实时多模态动作输出
Bencheng Liao · Shaoyu Chen · Haoran Yin 等 11 人
HighlightDriveGPT4-V2:利用大语言模型能力增强闭环自动驾驶
DriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving
💡 结合高分辨率视觉分词器与专家LLM实现闭环控制
🚗 提升多模态大模型在闭环驾驶中的决策能力与速度
Zhenhua Xu · Yan Bai · Yujia Zhang 等 8 人
HighlightSimLingo:语言-动作对齐的纯视觉闭环自动驾驶
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
💡 视觉语言模型统一驾驶与语言动作对齐
🚗 纯相机闭环驾驶,提升可解释性
Katrin Renz · Long Chen · Elahe Arani 等 4 人
02
BEV与占用感知
1 篇
HighlightBEVDiffuser:真值引导的BEV去噪扩散模型
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
💡 用扩散模型对BEV特征去噪并真值引导
🚗 即插即用提升现有BEV模型下游任务性能
Xin Ye · Burhaneddin Yaman · Sheng Cheng 等 6 人
03
3D检测与多模态融合
6 篇
Towards Explicit Geometry-Reflectance Collaboration for Generalized LiDAR Segmentation in Adverse Weather
💡 分离几何与反射率特征的双分支协作框架
🚗 提升恶劣天气下LiDAR语义分割的泛化能力
Longyu Yang · Ping Hu · Shangbo Yuan 等 7 人
TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion
💡 单阶段融合雷达图结构,避免中间深度依赖
🚗 提升雷达相机深度估计的效率与鲁棒性
Yiran Wang · Jiaqi Li · Chaoyi Hong 等 9 人
HighlightCAP-Net:类别级关节部件的6D姿态与尺寸估计
CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image
💡 单阶段RGB-D融合网络同时分割与位姿估计
🚗 提升机器人对关节物体的6D位姿估计精度
Jingshun Huang · Haitao Lin · Tianyu Wang 等 6 人
HighlightMPDrive:基于标记提示学习的自动驾驶空间理解改进
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
💡 将空间坐标转为视觉标记,改善AD-VQA空间语义一致性
🚗 以标记提示学习提升自动驾驶视觉问答的空间感知与表达
Zhiyuan Zhang · Xiaofan Li · Zhihao Xu 等 7 人
HighlightSP3D:通过准确跨模态语义提示提升稀疏监督3D目标检测
SP3D: Boosting Sparsely-Supervised 3D Object Detection via Accurate Cross-Modal Semantic Prompts
💡 利用跨模态语义提示增强稀疏监督3D检测
🚗 提升稀疏标注下3D检测的判别力与鲁棒性
Shijia Zhao · Qiming Xia · Xusheng Guo 等 8 人
Highlight学习类原型用于统一稀疏监督3D目标检测
Learning Class Prototypes for Unified Sparse-Supervised 3D Object Detection
💡 用类原型和最优传输挖掘未标注物体
🚗 统一室内外稀疏监督3D检测,服务具身智能
Yun Zhu · Le Hui · Hang Yang 等 6 人
04
世界模型
2 篇
Oral导航世界模型(NWM)
Navigation World Models
💡 可控视频生成预测未来视觉观测的导航世界模型
🚗 利用无标签视频提升导航规划,支持新约束
Amir Bar · Gaoyue Zhou · Danny Tran 等 5 人
HighlightSplatFlow:神经运动流场中的自监督动态高斯溅射用于自动驾驶
SplatFlow: Self-Supervised Dynamic Gaussian Splatting in Neural Motion Flow Field for Autonomous Driving
💡 自监督动态高斯溅射学习4D运动场
🚗 无需3D框标注实现自动驾驶场景重建
Su Sun · Cheng Zhao · Zhuoyang Sun 等 5 人
05
VLA与机器人操作
5 篇
From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons
💡 多体现动作分词器统一模型,结合跨域数据与在线RL
🚗 为构建通用具身智能体提供数据与算法洞见
Andrew Szot · Bogdan Mazoure · Omar Attia 等 9 人
PDFactor: Learning Tri-Perspective View Policy Diffusion Field for Multi-Task Robotic Manipulation
💡 三平面表示的扩散策略场建模动作分布
🚗 提升多任务机器人操作的动作精度与效率
Jingyi Tian · Le Wang · Sanping Zhou 等 7 人
Highlight从第一人称视觉中的动作描述生成6DoF物体操作轨迹
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
💡 从大规模视频中提取操作轨迹,训练语言生成6DoF轨迹
🚗 实现根据动作描述生成物体的6DoF操作轨迹
Tomoya Yoshida · Shuhei Kurita · Taichi Nishimura 等 4 人
HighlightOmniManip:通过物体中心交互原语作为空间约束实现通用机器人操作
OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
💡 以交互原语为空间约束,桥接VLM高层推理与底层操控
🚗 提出物体中心表示,提升机器人通用操作的空间精度与泛化
Mingjie Pan · Jiyao Zhang · Tianshu Wu 等 6 人
HighlightDexGrasp Anything:物理感知的通用灵巧抓取
DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics Awareness
💡 物理约束融入扩散模型生成抓取姿态
🚗 发布超340万灵巧抓取姿态的大规模数据集
Yiming Zhong · Qi Jiang · Jingyi Yu 等 4 人
06
人形与运动控制
1 篇
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
💡 用共享本体感知标记与任务标记统一多技能策略
🚗 实现多技能人-场景交互的统一策略与知识共享
Liang Pan · Zeshi Yang · Zhiyang Dou 等 8 人
08
定位与建图
1 篇
HighlightUGP:释放LiDAR点云配准的泛化能力
Unlocking Generalization Power in LiDAR Point Cloud Registration
💡 去交叉注意力,用渐进自注意力与BEV特征提升配准泛化
🚗 提升LiDAR点云配准在跨距离与跨数据集下的鲁棒性
Zhenxuan Zeng · Qiao Wu · Xiyu Zhang 等 8 人
09
仿真数据与评测
2 篇
Highlight通过可扩展城市仿真实现自主微移动
Towards Autonomous Micromobility through Scalable Urban Simulation
💡 提出可扩展城市仿真平台,含层级场景生成与交互动力学
🚗 为自主微移动智能体提供大规模交互式城市训练环境
Wayne Wu · Honglin He · Chaoyuan Zhang 等 8 人
HighlightRoboTwin:基于生成式数字孪生的双臂机器人基准
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
💡 用3D生成模型与LLM生成双臂任务数据
🚗 构建双臂机器人数据生成与评测平台
Yao Mu · Tianxing Chen · Zanxin Chen 等 14 人