高德发布ABot-Recon:仅凭12帧画面,实时重建万帧级3D场景
8月31日,阿里巴巴集团旗下高德近日正式发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon。该模型无需长程记忆,仅凭连续12帧局部画面,即可实时稳定重建上万帧的3D场景,实现“边拍边建”。
传统流式3D重建系统依赖长程记忆锚点来维持长距离场景的全局一致性,但序列越长,速度越慢、精度越差、显存越高。ABot-Recon选择了一条全新路径——“局部位姿预测+残差优化”。模型仅以最近12帧连续画面作为局部上下文窗口,预测当前相机坐标系下的局部点云与相邻两帧间的相对位姿,再通过在线组合逐步拼出完整的全局轨迹与三维场景。
由于预测目标始终是局部的、与序列长度无关,模型的计算复杂度与内存占用不随视频变长而膨胀。面对局部预测中的误差累积问题,ABot-Recon在预测和训练端分别设计了纠偏和误差约束机制,实时校准轨迹误差。
目前,ABot-Recon已在GitHub开源了推理及评测代码和模型权重,并在魔搭社区上线了体验专区。项目主页和完整技术报告也已同步公开。