01 顶会论文
  • arxiv自动驾驶 CLAP:跨具身视频世界模型是零样本物理模拟器
    跨具身世界模型若成立,可让机器人从海量异构视频中学习物理规律,省去大量真机采集,值得做仿真和预训练的团队关注。
    💡 跨具身视频世界模型,零样本物理模拟
    🚗 提升机器人对物理交互的泛化能力,降低仿真成本
  • arxiv自动驾驶 FlashVLA:面向快速异步VLA推理的流式动作解码
    VLA部署瓶颈在推理延迟,流式解码方案若有效,可推动VLA上实车,做部署优化的工程师值得细读。
    💡 流式动作解码,异步推理加速
    🚗 降低VLA推理延迟,加速具身智能落地
  • arxiv自动驾驶 具身场景重排规划
    家具重排是家庭服务机器人的典型任务,该任务定义和规划方法对做导航和操作集成的团队有参考价值。
    💡 新任务定义,具身家具重排规划
    🚗 为家庭机器人场景理解与规划提供新基准
  • arxiv自动驾驶 利用大型重建模型重建交互中的人与物体
    3D人-物交互重建是具身感知的基础问题,大重建模型思路可能提升数据标注效率,做数据闭环的团队可关注。
    💡 大重建模型用于3D人-物交互估计
    🚗 提升具身感知中交互场景的3D理解能力
观察员点评
四篇Oral/Spotlight,跨具身、VLA加速、场景重排、人-物重建,方向齐全但创新点偏工程优化。FlashVLA的流式解码值得看,其他三篇属于常规推进。别指望论文能直接上车,落地还得看数据闭环和算力。
02 顶级赛事/SOTA
观察员点评
DistillDrive星数93,ICCV论文开源,但多模式蒸馏并非新概念,落地效果待验证。开源是好事,但别指望一个蒸馏方法解决端到端的安全问题。