端到端驾驶与规划 2 BEV与占用感知 2 3D检测与多模态融合 6 VLA与机器人操作 2 人形与运动控制 1 具身导航与空间智能 2 定位与建图 1 仿真数据与评测 1
01 端到端驾驶与规划 2 篇
Where, What, Why: Towards Explainable Driver Attention Prediction
💡 提出可解释驾驶员注意力预测任务及数据集
🚗 联合建模注意力位置、语义与原因,提升驾驶安全
Yuchen Zhou · Jiayu Tang · Xiaoyan Xiao 等 9 人
SRefiner: Soft-Braid Attention for Multi-Agent Trajectory Refinement
💡 提出软辫注意力捕捉轨迹拓扑关系
🚗 提升自动驾驶多智能体轨迹预测精度
Liwen Xiao · Zhiyu Pan · Zhicheng Wang 等 5 人
02 BEV与占用感知 2 篇
Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion
💡 提出扩散模型蒸馏及结构损失加速3D场景补全
🚗 提升自动驾驶场景补全速度与几何质量
shengyuan zhang · An Zhao · Ling Yang 等 10 人
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
💡 用VLM和高斯泼溅自动标注开放语义占用
🚗 为自动驾驶/具身智能提供无人工标注的语义占用自动标注方法
Xiaoyu Zhou · Jingqi Wang · Yongtao Wang 等 6 人
03 3D检测与多模态融合 6 篇
Towards Foundational Models for Single-Chip Radar
💡 构建单芯片雷达基础模型预测3D占用与语义分割
🚗 提供大规模雷达数据集与强泛化感知模型
DiffRefine: Diffusion-based Proposal Specific Point Cloud Densification for Cross-Domain Object Detection
💡 用扩散模型对检测提案点云稠密化
🚗 增强跨域3D检测对稀疏表面区域的识别,降低漏检
Sangyun Shin · Yuhang He · Xinyu Hou 等 6 人
CoopTrack: Exploring End-to-End Learning for Efficient Cooperative Sequential Perception
💡 提出实例级端到端协同跟踪,可学习关联
🚗 支撑多车协同感知,低传输成本增强跟踪能力
Jiaru Zhong · Jiahao Wang · Jiahui Xu 等 6 人
Lidar Waveforms are Worth 40x128x33 Words
💡 用Transformer学习式DSP处理全波形
🚗 提升恶劣环境下点云质量,助力自动驾驶感知
Dominik Scheuble · Hanno Holzhüter · Steven Peters 等 5 人
Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts
💡 联合优化语义与几何双不确定性实现TTA
🚗 提升域偏移下单目3D目标检测鲁棒性
Zixuan Hu · Dongxiao Li · Xinzhu Ma 等 7 人
Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
💡 用纯Mamba实现高保真密集全局融合
🚗 高效长距离建模,提升相机激光雷达融合检测
Hanshi Wang · Jin Gao · Weiming Hu 等 4 人
04 VLA与机器人操作 2 篇
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
💡 提出潜在运动标记作为机器人操作学习的桥梁语言
🚗 从视频数据预训练提升机器人操作学习
Yi Chen · Yuying Ge · Weiliang Tang 等 8 人
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
💡 基于流匹配位姿头实现语言指令对齐的灵巧抓取
🚗 构建1.7亿灵巧抓取数据集并实现指令化抓取预测
Jiawei He · Danshi Li · Xinqiang Yu 等 10 人
05 人形与运动控制 1 篇
Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
💡 用自回归反应扩散规划器联合预测动作与反应
🚗 实现人机交互中实时物理合理且安全的运动合成
Kaiyang Ji · Ye Shi · Zichen Jin 等 8 人
06 具身导航与空间智能 2 篇
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
💡 融合具身传感器与VLM构建动态场景持久记忆
🚗 提升动态3D场景理解与具身AI推理规划能力
Yue Fan · Xiaojian Ma · Rongpeng Su 等 7 人
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
💡 统一主动感知与3D视觉语言学习,在线记忆
🚗 使智能体主动探索并理解三维场景
Ziyu Zhu · Xilin Wang · Yixuan Li 等 12 人
07 定位与建图 1 篇
RALoc: Enhancing Outdoor LiDAR Localization via Rotation Awareness
💡 提出点云规范化模块,消除旋转对定位影响
🚗 提升户外LiDAR定位在旋转变化下的精度与鲁棒性
Yuyang Yang · Wen Li · Sheng Ao 等 9 人
08 仿真数据与评测 1 篇
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
💡 构建100+照片级真实虚拟世界及工具
🚗 提供多样化环境与基准,支持具身AI研究
Fangwei Zhong · Kui Wu · Churan Wang 等 7 人