CONFERENCE ARCHIVE
CVPR 2026
自动驾驶 · 具身智能论文归档
从 4090 篇接收论文中,精选 Oral / Highlight 层级的 68 篇对口研究
01
端到端驾驶与规划
9 篇
RefAV: Towards Planning-Centric Scenario Mining
💡 用VLM自然语言查询检测驾驶场景
🚗 实现基于语言的高效自动驾驶安全场景挖掘
Cainan Davidson · Deva Ramanan · Neehar Peri
HighlightSafeDrive:稀疏世界中端到端驾驶的细粒度安全推理
SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World
💡 轨迹条件稀疏世界模型与细粒度碰撞推理
🚗 实现可解释的安全规划与风险评估
Jungho Kim · Jiyong Oh · Seunghoon Yu 等 6 人
HighlightCausalVAD:通过因果干预去混杂的端到端自动驾驶
CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention
💡 稀疏因果干预方案实现后门调整去偏
🚗 消除数据集伪相关提升规划鲁棒性
Jiacheng Tang · Zhiyuan Zhou · Zhuolin He 等 6 人
HighlightMOSAIC:面向端到端自动驾驶的尺度感知数据选择
Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems
💡 基于神经标度律的迭代数据混合优化
🚗 系统化构建训练集以提升多指标性能
Tolga Dimlioglu · Nadine Chang · Maying Shen 等 5 人
HighlightActiveAD: 面向规划的端到端自动驾驶主动学习
ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving
💡 提出规划导向的主动学习策略
🚗 提升端到端自动驾驶采样和标注效率
Han Lu · Xiaosong Jia · Yichen Xie 等 7 人
HighlightRecover to Predict: 可变长度轨迹预测的渐进式回顾学习
Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction
💡 渐进式回顾框架对齐不完全观测
🚗 解决可变长度观测下轨迹预测难题
Hao Zhou · Lu Qi · Xiangtai Li 等 8 人
HighlightGuideFlow: 约束引导的流匹配用于端到端自动驾驶规划
GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
💡 流匹配中直接施加显式约束
🚗 解决生成式规划器约束融入困难
Lin Liu · Caiyan Jia · Guanyi Yu 等 9 人
HighlightLinkVLA: 统一语言-动作理解与生成用于自动驾驶
Unifying Language-Action Understanding and Generation for Autonomous Driving
💡 统一语言动作到共享离散码本
🚗 提升VLA中指令与动作一致性
Xinyang Wang · Qian Liu · WENJIE DING 等 10 人
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
💡 反事实推理自反思机制修正动作
🚗 提升VLA驾驶安全性和可解释性
Zhenghao Peng · Wenhao Ding · Yurong You 等 13 人
02
BEV与占用感知
6 篇
SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model
💡 端到端从图像预测多帧稀疏占用
🚗 提升自动驾驶未来占用预测的表示能力与效率
Jiayuan Du · Yiming Zhao · Zhenglong Guo 等 8 人
OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
💡 首个真实相机空中SSC基准
🚗 推动无人机场景理解与自动驾驶空中感知
Markus Gross · Sai B. Matha · Aya Fahmy 等 6 人
Oral室内场景单目开放词汇占用预测
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes
💡 仅用几何标签实现开放词汇3D占用
🚗 为室内具身智能提供细粒度语义占用感知
Changqing Zhou · Yueru Luo · Han Zhang 等 5 人
HighlightRAVEN: 雷达自适应视觉编码器用于高效逐chirp目标检测与分割
RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation
💡 可学习天线混合器与早退策略
🚗 实现低延迟高精度雷达感知
Anuvab Sen · Mir Sayeed · Saibal Mukhopadhyay
HighlightSABER: 空间一致的3D通用对抗物体用于BEV检测器
SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors
💡 生成非侵入式、多视图时空一致的3D对抗物体
🚗 揭示BEV检测器对物理对抗物体的脆弱性
Aixuan Li · Mochu Xiang · Bosen Hou 等 6 人
Highlight开放词汇域泛化的城市场景分割
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
💡 提出开放词汇域泛化分割新设置与基准
🚗 提升自动驾驶在未知域和未知类别的语义分割鲁棒性
Dong Zhao · Qi Zang · Nan Pu 等 6 人
03
3D检测与多模态融合
10 篇
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
💡 基于SAM2改进的机器人分割基础模型
🚗 提供专用机器人分割工具,支持数字孪生与动作提取
Haiyang Mei · Qiming Huang · Hai Ci 等 4 人
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
💡 结合VGGT几何建模与精确分割
🚗 提升具身AI中跨视角实例分割精度
Yulu Gao · Bohao Zhang · Zongheng Tang 等 6 人
HighlightRF4D:用于户外动态场景新视角合成的神经雷达场
RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes
💡 首次将毫米波雷达与神经辐射场结合用于动态场景
🚗 提升自动驾驶在恶劣天气下的场景重建鲁棒性
Jiarui Zhang · Zhihao Li · Chong Wang 等 4 人
HighlightDENALI:低成本LiDAR非视距空间推理数据集
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs
💡 首个大规模低成本LiDAR时空直方图数据集
🚗 为低价传感器实现数据驱动的非视距感知
Nikhil Behari · Diego Rivero · Luke Apostolides 等 6 人
HighlightCARD:面向挑战性道路地形的密集三维重建多模态数据集
CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography
💡 提供准密集3D真值及多传感器同步数据
🚗 填补复杂路面几何感知的数据空白
Gasser Elazab · Frank Neuhaus · Tilman Koß 等 8 人
HighlightDAPASS:面向鲁棒全景语义分割的无源域自适应
Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation
💡 协同去噪与对齐模块处理全景畸变与域偏移
🚗 实现无源数据的全景分割迁移
Yaowen Chang · Zhen Cao · Xu Zheng 等 5 人
HighlightTeFlow: 自监督前馈场景流估计的多帧监督
TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation
💡 时间一致性聚合实现多帧监督
🚗 提升自监督场景流估计鲁棒性
Qingwen Zhang · Chenhan Jiang · Xiaomeng Zhu 等 7 人
Highlight场景重建作为3D检测的地图先验
Scene Reconstruction as Mapping Priors for 3D Detection
💡 自动从传感器数据构建密集地图先验
🚗 无需人工标注提升3D检测的远程和恶劣天气性能
Yang Fu · Yuliang Zou · Hao Xiang 等 11 人
Highlight释放预测链的力量用于单目3D目标检测
Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection
💡 自适应框架学习何时及如何利用属性间相关性
🚗 通过链式预测提高单目3D检测的深度精度
Zhihao Zhang · Abhinav Kumar · Girish Chandar Chandar 等 4 人
HighlightRaUF: 学习雷达空间不确定性场
RaUF: Learning the Spatial Uncertainty Field of Radar
💡 各向异性概率模型建模雷达测量不确定性
🚗 改善毫米波雷达在自动驾驶中的空间感知可靠性
Shengpeng Wang · Kuangyu Wang · Wei Wang
04
世界模型
3 篇
WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World
💡 提出涵盖几何、物理与功能可靠性的多维度评测
🚗 系统揭示现有驾驶世界模型在真实场景中的缺陷
Ao Liang · Lingdong Kong · Tianyi Yan 等 22 人
HighlightU4D: 基于不确定性的4D激光雷达世界建模
U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
💡 硬到易的两阶段不确定性感知生成框架
🚗 提升动态场景下4D世界模型的真实感与时间稳定性
Xiang Xu · Ao Liang · Youquan Liu 等 7 人
HighlightPointWorld:为野外机器人操作扩展3D世界模型
PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
💡 将状态和动作统一为3D点流表示
🚗 实现跨本体机器人操作的世界模型预训练
Wenlong Huang · Yu-Wei Chao · Arsalan Mousavian 等 7 人
05
VLA与机器人操作
16 篇
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
💡 引入自适应触觉注入机制避免干扰预训练能力
🚗 提升VLA在接触丰富操作中的实时触觉反馈利用
Xiaoqi Li · Muhe Cai · Jiadong Xu 等 8 人
Structural Action Transformer for 3D Dexterous Manipulation
💡 将动作块重构为无序关节轨迹序列处理异质本体
🚗 实现跨本体3D灵巧操作的技能迁移与策略学习
Xiaohan Lei · Min Wang · Bohong Weng 等 5 人
HighlightCLaD:跨模态潜在动态的接地前瞻规划
CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics
💡 建模跨模态转移动力学而非静态对应
🚗 在LIBERO-LONG上达到94.9%成功率
Andrew Jeong · Jaemin Kim · Sebin Lee 等 4 人
HighlightSaPaVe:面向机器人VLA的主动感知与操作
SaPaVe: Towards Active Perception and Manipulation in Vision-Language Action Models for Robotics
💡 解耦相机和操作动作,自底向上学习
🚗 提出ActiveViewPose-200K数据集和几何感知模块
Mengzhen Liu · Enshen Zhou · Cheng Chi 等 9 人
HighlightForeAct:高效视觉前瞻规划引导VLA
ForeAct: Steering Your VLA with Efficient Visual Foresight Planning
💡 基于想象未来观察的视觉引导规划器
🚗 在H100上0.33秒生成高清未来观察指导VLA
Zhuoyang Zhang · Shang Yang · Qinghao Hu 等 8 人
Highlight当机器人服从补丁:视觉-语言-动作模型的通用可迁移补丁攻击
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
💡 通用可迁移物理补丁攻击VLA机器人
🚗 揭示VLA模型在未知场景下的安全漏洞
Hui Lu · Yi Yu · Yiming Yang 等 8 人
HighlightClay-to-Stone:单目关节手物操作建模的分阶段3D高斯泼溅
Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling
💡 分阶段从柔性到刚性建模手物关节操作
🚗 实现单目下关节物体操作的鲁棒重建
Xingyu Liu · Pengfei Ren · Qi Qi 等 7 人
HighlightBiPreManip: 基于可操作性的双臂预备操作学习
BiPreManip: Learning Affordance-Based Bimanual Pre-Manipulation through Anticipatory Collaboration
💡 视觉可操作性框架实现双臂协作预备操作
🚗 使机器人能处理需顺序不对称协调的物体操作任务
Yan Shen · Feng Jiang · Zichen He 等 8 人
HighlightAVA-VLA: 通过主动视觉注意力改进VLA模型
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
💡 引入主动视觉注意力基于POMDP动态调制视觉处理
🚗 提升VLA模型在动态序列决策中的视觉token利用效率
Lei Xiao · Jifeng Li · Juntao Gao 等 9 人
HighlightCross-Hand: 跨机械手潜在表示的VLA模型
Cross-Hand Latent Representation for Vision-Language-Action Models
💡 统一潜在动作空间实现跨灵巧手的VLA学习
🚗 降低新机械手数据收集成本实现跨本体迁移
Guangqi Jiang · Yutong Liang · Jianglong Ye 等 9 人
HighlightGeoPredict: 利用预测运动学和3D高斯几何的VLA操作
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
💡 预测性运动学与3D高斯几何训练时监督
🚗 提升VLA模型在精确3D推理操作任务中的可靠性
Jingjing Qian · Boyao Han · Chen Shi 等 7 人
HighlightStaMo:基于紧凑状态表示的无监督可泛化机器人运动学习
StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
💡 无监督学习两token压缩状态表示,利用DiT先验
🚗 提升VLA模型11.6%和31%成功率
Mingyu Liu · Jiuhe Shu · Hui Chen 等 9 人
Highlight基于可行动作邻域先验的视觉-语言-动作微调增强
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
💡 引入高斯先验正则化动作分布对齐邻域几何
🚗 提升VLA微调的样本效率和泛化性
Haochen Niu · Kanyu Zhang · Shuyu Yin 等 6 人
HighlightCycleManip:通过有效历史感知实现周期操作
CycleManip: Enabling Cycle-based Manipulation via Effective History Perception and Understanding
💡 端到端模仿学习周期性机器人操作任务
🚗 首个针对周期操作的基准和框架
Yi-Lin Wei · Haoran Liao · Yuhao Lin 等 7 人
HighlightE3Flow:基于球谐函数的高效混合SE(3)-等变视觉运动流策略
Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation
💡 融合球谐表示与特征增强模块实现等变扩散
🚗 首次实现稳定多模态等变扩散策略
Qinglun Zhang · Shen Cheng · Tian Dan 等 6 人
HighlightGraspALL:低光照下机器人抓取衣物的自适应结构补偿
GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions
💡 编码照明变化引导RGB与非RGB特征自适应融合
🚗 提升低光照下衣物抓取鲁棒性
Haifeng Zhong · Wenshuo Han · Zhouyu Wang 等 13 人
06
人形与运动控制
3 篇
HighlightFreestyle? 音频控制的表现力人形运动
Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
💡 统一音频到运动框架,无需显式动作重建
🚗 首次实现从音频直接生成人形机器人舞蹈和手势
Zhe Li · Cheng Chi · Yangyang Wei 等 12 人
HighlightSENTINEL: 人形全身控制的端到端语言-动作模型
End-to-End Language-Action Model for Humanoid Whole Body Control
💡 端到端语言到低层动作的映射,无需中间表征
🚗 实现人形机器人语言指令直接驱动全身运动控制
Yuxuan Wang · Haobin Jiang · Shiqing Yao 等 5 人
HighlightGallant:基于体素网格的人形机器人运动与局部导航
Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrains
💡 使用体素化激光雷达表示和z-分组2D CNN
🚗 实现复杂3D地形下全端到端人形运动控制
Qingwei Ben · Botian Xu · Kailin Li 等 9 人
08
定位与建图
6 篇
HighlightLEADER: 基于可靠局部到全局对应的激光雷达重定位
LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization
💡 鲁棒投影几何编码器与截断相对可靠性损失
🚗 提升复杂环境下激光雷达重定位的鲁棒性和精度
Jianshi Wu · Minghang Zhu · dq Liu 等 8 人
HighlightGeneralized-CVO: 快速无对应局部点云配准的二阶黎曼优化
Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization
💡 基于RKHS的局部几何表征与二阶流形优化
🚗 显著加速无对应点云配准,降低驾驶域平移旋转误差
Ray (Rui) Zhang · Carl Greiff · Thomas Lew 等 4 人
HighlightStreamVLO:流式视觉-激光雷达里程计与累积漂移补偿
StreamVLO: Streaming Visual–LiDAR Odometry with Cumulative Drift Compensation
💡 基于Mamba的统一时空融合与在线漂移补偿
🚗 提升4D动态环境中的定位精度与稳定性
Mengmeng Liu · Jiuming Liu · Michael Ying Yang 等 9 人
HighlightVIRD: 通过双轴变换实现视角不变表示用于跨视图姿态估计
VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation
💡 利用双轴变换构建地面-卫星视图的视角不变表示
🚗 提升密集城区跨视图定位的准确性与鲁棒性
Juhye Park · Wooju Lee · Dasol Hong 等 7 人
HighlightVLM-Loc: 通过视觉语言模型在点云地图中定位
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
💡 利用VLM的空间推理能力实现文本到点云定位
🚗 将自然语言与3D点云地图对齐以精确全局定位
Shuhao Kang · Youqi Liao · Peijie Wang 等 8 人
HighlightHOLO: 基于单应性引导的姿态估计网络用于SD地图细粒度视觉定位
HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps
💡 利用单应性约束引导特征融合与姿态输出
🚗 在标准地图上实现低成本高精度视觉定位
Xuchang Zhong · Xu Cao · Jinke Feng 等 4 人
09
仿真数据与评测
7 篇
SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge
💡 从单图重建物理一致的可动物体URDF
🚗 提供仿真就绪可动物体资产,加速具身AI研究
Yumeng He · Ying Jiang · Jiayin Lu 等 5 人
SimScale: Learning to Drive via Real-World Simulation at Scale
💡 基于神经渲染与扰动轨迹合成安全临界驾驶数据
🚗 弥合真实与仿真分布差异提升驾驶决策泛化性
Haochen Tian · Tianyu Li · Haochen Liu 等 13 人
HighlightWanderland:几何接地仿真用于开放世界具身AI
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI
💡 多传感器采集+可靠重建+准确几何的实到仿框架
🚗 提供高保真闭环评估环境,揭示几何质量影响
Xinhao Liu · Jiaqi Li · Youming Deng 等 10 人
HighlightHG-Lane:无需重新标注的高保真恶劣天气车道场景生成
HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation
💡 无重标注的高保真车道场景生成框架
🚗 提升极端天气下车道检测模型性能
Daichao Zhao · Qiupu Chen · Feng He 等 5 人
HighlightHoi!——面向力觉感知、跨视角关节操作的多模态数据集
Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation
💡 提供力觉和触觉同步的关节操作数据集
🚗 支持机器人操作中力觉和跨视角迁移研究
Tim Engelbracht · René Zurbrügg · Matteo Wohlrapp 等 8 人
Highlight全身移动操作的可扩展轨迹生成
Scalable Trajectory Generation for Whole-Body Mobile Manipulation
💡 GPU加速的移动操作轨迹生成,速度提升80倍
🚗 提供大规模移动操作数据集以支持通用策略学习
Yida Niu · Xinhai Chang · Xin Liu 等 5 人
HighlightRLFTSim:基于强化学习微调的逼真可控多智能体交通仿真
RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning
💡 强化学习微调对齐仿真与真实分布
🚗 提升仿真真实性与目标可控性
Ehsan Ahmadi · Hunter Schofield · Behzad Khamidehi 等 8 人