这篇不按“模型更大、指标更高”的顺序阅读,而从机器人视觉的三个缺口出发:对应关系需要几何约束,深度需要可靠尺度,开放词汇输出需要稳定的结构化接口。每项方法都能补一部分能力,但也会把新的假设带入系统。
MASt3R
MASt3R 在 pointmap 几何表示之外增加局部描述子,使像素对应同时受三维结构和外观特征约束。互惠匹配进一步过滤单向近邻,减少重复纹理中的错误关联。

CUT3R
CUT3R 用循环状态逐步吸收新观测,并持续输出同一参考系下的 pointmap。这样无需每次重算全部历史,但过去的估计也会通过隐藏状态长期影响后续重建。

Depth Anything V2
Depth Anything V2 先用精确合成深度训练大教师,再由教师为海量真实图像产生伪标签,学生模型由此兼顾几何细节与真实域覆盖。数据管线本身是性能来源之一,而非单纯依赖网络结构。

UniDepth
UniDepth 把相机表示也作为预测对象,使网络在未知内参条件下尝试恢复米制深度。self-promptable camera module 为深度分支提供成像几何条件,降低不同相机之间的分布差异。

FoundationStereo
FoundationStereo 依靠大规模合成双目数据训练通用匹配能力,并以基础视觉特征提供单目语义先验。自筛选与 side-tuning 用于减少低质量合成样本和特征域差异,希望在新场景中直接推理。

Florence-2
Florence-2 把描述、检测、指代定位和分割统一成由任务 prompt 控制的序列生成。FLD-5B 提供多类型监督,使一个 seq2seq 模型可以通过输出格式切换视觉任务。

YOLO-World
YOLO-World 将区域特征与文本类别放到实时 YOLO 检测框架中对齐,RepVL-PAN 负责视觉语言融合,区域文本对比目标负责扩展可查询类别。其核心取舍是以较低延迟获得开放词汇能力。

| 输出能力 | 代表方法 | 接入系统前的检查 |
|---|---|---|
| 对应与重建 | MASt3R / CUT3R | 外点、漂移、回环与状态重置 |
| 深度与尺度 | Depth Anything V2 / UniDepth / FoundationStereo | 米制尺度、标定和传感噪声 |
| 开放视觉接口 | Florence-2 / YOLO-World | schema、提示模板、阈值和拒识 |