CONFERENCE ARCHIVE
ICCV 2025
自动驾驶 · 具身智能论文归档
从 327 篇 Oral / Highlight 论文中,精选 17 篇对口研究
ICCV 官方仅设 Oral 与 Poster 两类,不设 Highlight。本页标注为 Highlight 的条目来自第三方论文聚合平台的自有分级,不代表官方评审等级。
01
端到端驾驶与规划
2 篇
HighlightWhere, What, Why:迈向可解释的驾驶员注意力预测
Where, What, Why: Towards Explainable Driver Attention Prediction
💡 提出可解释驾驶员注意力预测任务及数据集
🚗 联合建模注意力位置、语义与原因,提升驾驶安全
Yuchen Zhou · Jiayu Tang · Xiaoyan Xiao 等 9 人
HighlightSRefiner:软辫注意力多智能体轨迹细化
SRefiner: Soft-Braid Attention for Multi-Agent Trajectory Refinement
💡 提出软辫注意力捕捉轨迹拓扑关系
🚗 提升自动驾驶多智能体轨迹预测精度
Liwen Xiao · Zhiyu Pan · Zhicheng Wang 等 5 人
02
BEV与占用感知
2 篇
Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion
💡 提出扩散模型蒸馏及结构损失加速3D场景补全
🚗 提升自动驾驶场景补全速度与几何质量
shengyuan zhang · An Zhao · Ling Yang 等 10 人
HighlightAutoOcc:基于视觉语言引导的高斯泼溅的开放语义占用自动标注
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
💡 用VLM和高斯泼溅自动标注开放语义占用
🚗 为自动驾驶/具身智能提供无人工标注的语义占用自动标注方法
Xiaoyu Zhou · Jingqi Wang · Yongtao Wang 等 6 人
03
3D检测与多模态融合
6 篇
Oral面向单芯片雷达的基础模型
Towards Foundational Models for Single-Chip Radar
💡 构建单芯片雷达基础模型预测3D占用与语义分割
🚗 提供大规模雷达数据集与强泛化感知模型
HighlightDiffRefine:基于扩散的跨域目标检测点云提案稠密化
DiffRefine: Diffusion-based Proposal Specific Point Cloud Densification for Cross-Domain Object Detection
💡 用扩散模型对检测提案点云稠密化
🚗 增强跨域3D检测对稀疏表面区域的识别,降低漏检
Sangyun Shin · Yuhang He · Xinyu Hou 等 6 人
HighlightCoopTrack:探索端到端学习的高效协同序列感知
CoopTrack: Exploring End-to-End Learning for Efficient Cooperative Sequential Perception
💡 提出实例级端到端协同跟踪,可学习关联
🚗 支撑多车协同感知,低传输成本增强跟踪能力
Jiaru Zhong · Jiahao Wang · Jiahui Xu 等 6 人
Highlight激光雷达波形值得40x128x33个词元
Lidar Waveforms are Worth 40x128x33 Words
💡 用Transformer学习式DSP处理全波形
🚗 提升恶劣环境下点云质量,助力自动驾驶感知
Dominik Scheuble · Hanno Holzhüter · Steven Peters 等 5 人
Highlight自适应双不确定性优化:测试时偏移下提升单目3D检测
Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts
💡 联合优化语义与几何双不确定性实现TTA
🚗 提升域偏移下单目3D目标检测鲁棒性
Zixuan Hu · Dongxiao Li · Xinzhu Ma 等 7 人
Highlight高保真密集全局融合用于多模态3D目标检测
Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
💡 用纯Mamba实现高保真密集全局融合
🚗 高效长距离建模,提升相机激光雷达融合检测
Hanshi Wang · Jin Gao · Weiming Hu 等 4 人
04
VLA与机器人操作
2 篇
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
💡 提出潜在运动标记作为机器人操作学习的桥梁语言
🚗 从视频数据预训练提升机器人操作学习
Yi Chen · Yuying Ge · Weiliang Tang 等 8 人
HighlightDexVLG:大规模灵巧视觉-语言-抓取模型
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
💡 基于流匹配位姿头实现语言指令对齐的灵巧抓取
🚗 构建1.7亿灵巧抓取数据集并实现指令化抓取预测
Jiawei He · Danshi Li · Xinqiang Yu 等 10 人
05
人形与运动控制
1 篇
Highlight迈向沉浸式人机交互:物理合理运动合成的实时框架
Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
💡 用自回归反应扩散规划器联合预测动作与反应
🚗 实现人机交互中实时物理合理且安全的运动合成
Kaiyang Ji · Ye Shi · Zichen Jin 等 8 人
07
定位与建图
1 篇
HighlightRALoc:基于旋转感知的户外LiDAR定位增强
RALoc: Enhancing Outdoor LiDAR Localization via Rotation Awareness
💡 提出点云规范化模块,消除旋转对定位影响
🚗 提升户外LiDAR定位在旋转变化下的精度与鲁棒性
Yuyang Yang · Wen Li · Sheng Ao 等 9 人
08
仿真数据与评测
1 篇
HighlightUnrealZoo:丰富照片级虚拟世界以促进具身AI
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
💡 构建100+照片级真实虚拟世界及工具
🚗 提供多样化环境与基准,支持具身AI研究
Fangwei Zhong · Kui Wu · Churan Wang 等 7 人