资讯动态

从GitHub爆火到ECCV Oral,全球开发者把LingBot-Map玩出新高度

发布时间:2026/9/14 22:39:29 来源:尧图企业网站定制
机器人正在学习一种曾经只属于人类的能力记住自己走过的世界。第一次进入陌生房间时人不会把看到的一切逐帧存储下来。我们会记住关键结构门在哪里桌子在哪里刚才经过的位置以及自己现在处于什么位置。正是这种选择性记忆支撑了人类在复杂环境中的持续行动。对于机器人来说这也是走向真实世界必须解决的问题。今年 4 月蚂蚁灵波开源的流式 3D 重建基础模型 LingBot-Map正是在「机器人如何记住空间」这一核心问题上探索出了一条新的技术路线。无需复杂硬件仅靠一颗普通 RGB 摄像头就能让机器人在视频采集过程中实时完成相机位姿估计与场景三维结构重建从而填补了实时空间感知领域的关键技术空白。在穿越多房间的长序列中面对环境剧变与大幅视角变换LingBot-Map 依然能表现出极强的鲁棒性截至目前LingBot-Map 官方 GitHub 项目已获得16.9K Stars、1.9K Forks并多次登上 GitHub Trending成为 3D 视觉领域备受关注的开源项目之一。项目地址https://github.com/Robbyant/lingbot-map论文地址https://arxiv.org/pdf/2604.14141论文主页https://technology.robbyant.com/lingbot-mapHugging Face 链接https://huggingface.co/robbyant/lingbot-mapModelScope 链接https://www.modelscope.cn/models/Robbyant/lingbot-map令人惊喜的是现在这项研究迎来新的认可。其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选ECCV 2026 Oral将于会议期间进行口头报告。在昨天ECCV 的开幕式上机器之心前方编辑还在 Award Candidates 的名单中看到了这项工作。从 GitHub 社区的高度关注到顶级视觉会议的认可LingBot-Map 完成了从开发者生态到学术界的双重验证。更重要的是它背后反映出一个变化机器人空间感知的竞争正在从看见世界走向记住世界。顶会认可之前LingBot-Map 已完成开源社区验证在入选ECCV Oral 之前LingBot-Map 已经在开源社区收获了一大波关注开发者围绕这个项目进行了各种二次开发。有人快速完成复现验证有人把它搬到不同硬件环境中尝试运行也有开发者开始探索新的空间数据采集方式。每个人的玩法都很有趣这种来自社区的主动探索往往比单纯的 Stars 数量更能说明它的生命力。让更多人能够快速体验从部署到可视化对于许多研究项目论文公开并不意味着普通开发者能够真正使用。环境配置、依赖安装、结果展示等环节往往成为从论文 Demo 到实际体验之间的距离。LingBot-Map 开源后不久就有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器让用户能够更加直观地查看模型生成的空间重建结果。来源https://github.com/donalleniii/lingbot-desktop-mac与此同时也有开发者基于 Pinokio 制作了一键启动方案将环境配置、依赖安装以及 Demo 运行流程进一步封装让没有复杂配置经验的用户也能够快速体验 LingBot-Map。来源https://github.com/cocktailpeanut/lingbot-map.pinokio这些尝试补齐了从研究成果到开发体验之间的重要环节让更多用户能够真正接触和使用这一流式 3D 重建模型。更多设备运行消费级硬件适配除了优化使用流程开发者也开始尝试扩展 LingBot-Map 的硬件适用范围。开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试通过优化运行策略降低显存压力让 LingBot-Map 能够运行在更轻量的 GPU 环境中。来源https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_sourcechatgpt.com这类尝试背后的意义在于当模型不再局限于高配置工作站而能够进入更多普通开发环境时技术才有机会被更多人测试、改造和应用。从摄像头到智能眼镜探索新的采集入口在 X 平台上有开发者关注到过去部分高精度三维扫描任务通常依赖专业 LiDAR 设备或者需要复杂的离线优化流程而传统方法在长时间连续输入下也容易面临稳定性挑战。相比之下LingBot-Map 通过普通视频流实现实时流式重建仅需单 GPU 即可运行达到约 20 FPS并能够处理超过 10,000 帧的长序列输入。来源https://x.com/XAMTO_AI/status/2080900857235726635在这些开发者看来LingBot-Map 展示了一种更加轻量的空间感知路径降低对专用硬件和复杂流程的依赖让实时三维重建能力有机会进入机器人、AR/VR、自动驾驶等更多场景。基于这一点真有人进一步将 LingBot-Map 接入消费级设备。他将 Ray-Ban Meta Gen-2 智能眼镜无需 LiDAR改造成 3D 扫描设备通过手机 App 采集数据并调用部署在 RunPod 上的 LingBot-Map 后端在约 30 秒内完成所在空间的三维建图。即使使用较少的视频帧室内场景仍能获得较好的重建效果。来源https://x.com/0x6rss/status/2079597540568137866除了智能眼镜这位用户在普通戴尔台式机上运行 LingBot-Map仅对着办公桌进行一次视频采集约 61.5 秒后便获得了一个可交互浏览的三维点云模型。来源https://x.com/shavonnewong_/status/2080130333094101360而这些只是 LingBot-Map 开源之后社区探索的一部分。对于一个 3D 视觉研究项目而言这种持续的二次开发并不常见这表明 LingBot-Map 已经开始进入真实的使用场景。开源之后团队也在持续更新评测脚本、推理优化、示例案例以及问题修复进一步提升项目的可用性和稳定性。与此同时官方还展示了超长视频重建结果在约 25,000 帧、持续 13 分钟的室内行走视频中LingBot-Map 仍能保持连续重建生成完整的三维空间表示。当然社区热度只是其中一面。对于一项研究成果而言真正决定其长期影响力的仍然是它是否解决了领域中的关键问题。ECCV Oral 背后LingBot-Map 如何重新设计机器人空间记忆那么LingBot-Map 究竟解决了什么问题为什么一个流式 3D 重建模型能够吸引开发者持续扩展又能够获得ECCV Oral 的认可答案需要回到机器人空间感知中最核心的挑战如何让机器人在不断增长的视频输入中既保持对空间的长期记忆又避免计算和存储成本随着时间无限增加。对于机器人而言3D 重建需要边走边理解环境。机器人看到当前画面需要同时回答现在看到的位置在哪里过去走过的区域和当前画面之间是什么关系这意味着模型需要持续估计摄像头轨迹并生成对应的深度信息最终形成不断扩展的三维地图。流式重建相比离线重建要面对一个核心矛盾保留更多历史信息可以提升空间一致性但历史越来越长也会让计算和存储成本快速增长。现有方法大致采用三种路线。一种方法类似记住全部历史。例如基于 causal attention 的方案会缓存之前所有帧的信息。这样模型拥有完整上下文但随着序列增长显存和计算量也不断增加。另一种方法选择压缩历史状态例如循环网络式结构。但压缩过度可能导致模型遗忘关键几何信息长时间运行后出现轨迹漂移。还有一些方法结合传统 SLAM通过关键帧选择和优化算法维持稳定性。但这类方法依赖人工设计的规则并且需要额外优化过程难以兼顾实时性。因此真正困难的问题是机器人面对不断增长的视频流哪些空间信息必须保留哪些信息可以舍弃LingBot-Map 将这个问题称为 streaming reconstruction 中的 context management上下文管理。它希望让模型像人类空间记忆一样只保留最重要的几何线索而不是记录所有观察。GCA把空间记忆拆成三层让模型知道该记什么为了解决这个问题LingBot-Map 提出了Geometric Context AttentionGCA几何上下文注意力。它的核心思想来自传统 SLAM一个稳定的空间系统通常需要三类信息一个固定参考点用来确定坐标附近区域的信息用来判断当前位置长距离历史用来避免累计漂移。因此GCA 将流式状态拆成三个部分。LingBot-Map 流程。该框架处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络提取图像特征然后通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中输入视图聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后特定任务的头部预测相机姿态和深度图从而实现对长序列的鲁棒、内存高效的流式 3D 重建。第一层Anchor Context建立空间坐标。负责记住「我从哪里出发」。它为整个三维坐标系提供稳定基准空间重建最怕坐标漂移有了锚点模型在处理第一万帧时仍然清楚第一帧发生在什么位置。第二层Local Pose-Reference Window保持局部精确定位。用来负责捕捉当前位置附近的局部几何细节。这相当于对「我身边有什么」保持清醒的即时感知保证了逐帧重建的精度。第三层Trajectory Memory压缩长期历史避免漂移。这是整个架构中较为关键的设计。它把庞大的历史信息压缩成极其紧凑的逐帧 Token以较低的存储代价保留对过去路径的「印象」。正是这一机制让 LingBot-Map 的内存消耗几乎不随视频长度增长处理 100 帧和处理 10000 帧总的计算量和内存占用维持在几近相同的水平。这种设计带来的效率提升相当可观。在 1 万帧序列中传统 causal attention 需要约 500 万 tokenGCA 只需要约 7 万 token足足压缩了近 80 倍且每处理一帧新画面计算量和内存消耗几乎不随总帧数增长。注意力掩码比较。每个方框代表一帧的 Token由一小段上下文 Token 和一段较大的图像 Token 组成。(a) 全注意力Full attention会关注所有帧。(b) 因果注意力Causal attention支持流式处理但计算开销随序列长度线性增长。(c) 滑动窗口注意力Sliding-window attention虽然限制了计算成本但会丢失长程上下文。(d) GCA 将流式上下文划分为锚框 (n2)、局部窗口 (k2) 和轨迹记忆在保持计算成本随序列长度增加而近乎恒定的同时保留了丰富的长程上下文信息。在基准测试上它表现如何实验也验证了 LingBot-Map 有效性。团队首先在 Oxford Spires 数据集上进行测试并以两种设置分别测试模型的短程定位能力和长程稳定性。在稀疏设置中团队选取 320 帧图像每隔 12 帧采样测试LingBot-Map 在几乎所有指标上都取得了最佳结果。尽管 LingBot-Map 采用的是流式在线推理方式但其性能仍大幅超过最强的离线基线方法。具体来看LingBot-Map 的 AUC15 达到 61.64明显高于最佳离线方法 DA3 的 49.84并超过 VGGT 的两倍以上VGGT 为 23.84。在轨迹级别的精度指标上LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降低到了 6.42 米。相比依赖跨帧重投影误差优化的传统优化方法LingBot-Map 同样取得了更优表现。它超过了表现最好的优化方法 VIPE在位姿精度AUC1561.64 vs. 45.35和轨迹一致性ATE6.42 vs. 10.52两个指标上均取得优势。而在在线流式方法之间的比较中优势更加明显。其他流式方法普遍存在严重的记忆遗忘问题随着序列不断增长模型会逐渐丢失过去观察到的几何信息最终导致累计漂移。LingBot-Map 分别达到 61.64 和 6.42在位姿精度上提升约 10 倍在轨迹误差上降低约 2.8 倍。在密集设置完整 3840 帧下团队进一步对模型的长序列流式重建能力进行了压力测试。随着轨迹长度从 320 帧增加到 3840 帧大多数前馈式方法都会因为累计漂移问题出现明显性能下降。相比之下LingBot-Map 始终保持较低的误差水平ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下误差只增加了 0.69。这说明 GCA 的三层上下文结构 —— 包括 anchor context、trajectory memory 和 local window—— 能够在无需显式优化或回环检测loop closure的情况下有效保持长距离几何一致性。值得注意的是LingBot-Map 在保持最高轨迹精度的同时还达到了具有竞争力的推理速度运行速度达到 20.29 FPS在所有流式方法中实现了最佳的轨迹估计效果。在生成高质量三维地图方面团队在 ETH3D、7-Scenes、NRGBD 三个数据集测试点云重建。LingBot-Map 均取得最高 F1 分数。在 ETH3D 数据集上LingBot-Map 的 F1 达到 98.98相比第二名 Wint3R 的 77.28 提升了 21.70 个百分点。说明 LingBot-Map 生成的重建结果不仅更加精准也覆盖了更加完整的场景结构。在 7-Scenes 数据集上LingBot-Map 的 F1 达到 80.39并在 Accuracy0.02和 Completeness0.07两个指标上均取得最佳表现。在 NRGBD 数据集上LingBot-Map 的优势更加明显其 F1 达到 64.26。NRGBD 包含大量复杂室内环境以及精细几何结构在这类场景中其他方法由于累计位姿漂移容易导致重建结果出现表面模糊或结构重复的问题。而 LingBot-Map具备更强抗漂移能力的轨迹估计可以直接提升这类场景下的重建质量。下图是定性对比结果。在较简单的场景中图中上方几组TTT3R 和 Wint3R 已经出现建筑边缘错位的问题。随着场景复杂度增加中间几组竞争方法开始出现重复结构和模糊表面这是由于累计位姿漂移导致同一几何结构被投影到了不同位置。在最具挑战性的多建筑室外场景中底部几组差距更加明显TTT3R 和 Wint3R 几乎完全失去空间一致性生成的点云出现坍缩和碎片化甚至无法区分独立建筑。相比之下LingBot-Map 始终保持清晰的几何结构、锐利的建筑边缘以及连续的墙面表面说明 GCA 提供的长期几何一致性能力能够直接转化为高质量的 3D 重建效果。点云重建的定性比较。从一个模型到一套机器人空间感知体系其实回看蚂蚁灵波的技术布局LingBot-Map 并非孤立存在。对于机器人而言真正的空间理解并非单一能力。它首先需要看懂眼前的环境随后需要准确判断距离最后还需要把连续观察到的信息整合起来形成对整个环境的长期记忆。围绕这三个环节蚂蚁灵波已经布局了LingBot-Vision、LingBot-Depth 和 LingBot-Map分别对应视觉结构理解、高精度空间感知以及持续空间记忆。其中LingBot-Vision 提出的思路是让模型重新关注图像中的边界。它认为物体轮廓和形状变化区域包含大量几何信息是机器人理解空间的重要线索。基于此团队提出掩码边界建模Masked Boundary Modeling让模型无需人工标注或额外边缘检测器就能自主学习亚像素级边界表示并利用这些边界信息增强视觉表征。LingBot-Depth 的关键洞见是将传感器缺失视为可学习的信息而非单纯的噪声。通过掩码深度建模Masked Depth Modeling, MDM模型能够结合 RGB 图像中的视觉上下文推断缺失区域的深度信息。这样机器人不仅能看到物体还能更准确判断物体在三维空间中的位置关系尤其在处理透明、反光、密集物体时表现突出。LingBot-Map 则进一步解决记住的问题通过流式 3D 重建能力将连续视频中的视觉信息组织成稳定的三维空间表示让机器人能够在不断移动过程中更新环境认知并保持对已经探索区域的记忆。三者结合起来形成一条从感知到理解再到行动的空间智能链路。当机器人能够持续感知、理解并记忆周围环境它才有可能完成更复杂的导航、巡检、操作和任务执行。LingBot-Map 所推动的正是机器人从看到世界走向理解并利用世界的关键一步。原文链接从GitHub爆火到ECCV Oral全球开发者把LingBot-Map玩出新高度-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价