Open-Vocabulary Detection-开放词汇目标检测
核心是把视觉特征和语言特征放到共同的语义空间。
这与CLIP的思想非常接近。
Attribute Recognition-可观察、任务相关的物理属性
Referring Expression-把语言表达转换成一个具体目标
Language → Target
Referring Expression的核心问题是:
给系统一句描述,让系统从多个目标中找到对应的目标。
例如:
“跟随穿黑色衣服、背包的人。”
或者:
“跟随左边第二个人。”
或者:
“跟随刚才从车辆旁边经过的人。”
CLIP可以作为其中一个重要基础模型,但:
Referring Expression ≠ CLIP。
但是复杂的Referring Expression可能需要理解:
“站在车辆左侧、背着包、离我最近的那个人。”
这里实际上涉及:
Scene Understanding:从“目标”升级到“场景”
前面三个主要关注:
Target
Scene Understanding关注:
Scene
例如机器狗看到:
传统视觉:
Person
Building
Vehicle
Tree
也就是建立:
Object + Relationship + Context
传统检测得到:
Person
Vehicle
Tree
Building
Scene Understanding进一步形成:
这已经不是简单的Computer Vision,而是在构建:
World Model / Scene Graph
也就是说:
不要把Semantic Vision Engine理解成一个每帧运行的大模型。
而应该是:
高频Tracking + 低频Semantic Reasoning。
或者用户说:
“跟随那个背包的人。”
立即:
然后传统视觉负责:
Detection
Re-ID
Tracking
多模态传感器负责:
LiDAR → Where
UWB → Who
IMU → How I Move
Radar → How Fast
四个模块中优先级并不一样:
第一优先:Referring Expression + Attribute Recognition ——直接解决“我要跟谁”。
第二优先:Open-Vocabulary Detection ——让目标类别和搜索能力摆脱固定YOLO类别。
第三优先:Scene Understanding ——等前面的目标级能力稳定后,再进一步构建环境关系和Scene Graph。
而 CLIP是这套Semantic Vision Engine的重要基础组件,但不是整个Semantic Vision Engine本身。它更像是语义空间的“视觉语言编码器”,上面再构建目标选择、属性、关系和场景理解。