阅读,与值得关注的内容Readance

Semantic Vision Engine的四个核心算法-从目标类别 → 目标属性 → 目标选择 → 场景关系逐渐向高层语义发展的四个层次

Semantic Vision Engine
 理解为:在传统“看见目标”的基础上,进一步让系统知道目标是什么、有什么属性、是不是我要找的目标、以及它处于什么场景和关系中。
其中四者不是四个平行、完全独立的算法,而是从“目标类别 → 目标属性 → 目标选择 → 场景关系”逐渐向高层语义发展的四个层次。
  • Open-Vocabulary Detection-开放词汇目标检测

核心是把视觉特征和语言特征放到共同的语义空间。

这与CLIP的思想非常接近。

  • Attribute Recognition-可观察、任务相关的物理属性
Attribute Recognition和Re-ID的区别
  • Referring Expression-把语言表达转换成一个具体目标

Language → Target


Referring Expression的核心问题是:

给系统一句描述,让系统从多个目标中找到对应的目标。

例如:

“跟随穿黑色衣服、背包的人。”

或者:

“跟随左边第二个人。”

或者:

“跟随刚才从车辆旁边经过的人。”

和CLIP是什么关系?

CLIP可以作为其中一个重要基础模型,但:

Referring Expression ≠ CLIP。

但是复杂的Referring Expression可能需要理解:

“站在车辆左侧、背着包、离我最近的那个人。”

这里实际上涉及:

因此最终的Referring Expression模块可能由:
  • Scene Understanding:从“目标”升级到“场景”

前面三个主要关注:

Target

Scene Understanding关注:

Scene

例如机器狗看到:

传统视觉:

Person

Building

Vehicle

Tree

Scene Understanding则希望进一步得到:

也就是建立:

Object + Relationship + Context


Scene Understanding实际上开始接近Ontology

传统检测得到:

Person

Vehicle

Tree

Building

Scene Understanding进一步形成:

于是系统里面开始出现:

这已经不是简单的Computer Vision,而是在构建:

World Model / Scene Graph


四个模块形成一个递进关系
AiBrainBox-UGV:
四个能力并不是都需要“实时运行”
模块
运行频率
作用
YOLO Detection
20–30 FPS
实时目标发现
Re-ID
10–30 FPS
连续身份关联
Attribute
1–5 FPS
更新目标属性
Open-Vocabulary Detection
1–5 FPS / Event
搜索特殊目标
Referring Expression
Event-driven
指定/切换目标
Scene Understanding
0.5–2 FPS
场景认知
CLIP
1–5 FPS
语义匹配
LiDAR
10–20 Hz
3D空间
IMU
100Hz+
自身运动
Tracking
20–50 Hz
状态估计

也就是说:

不要把Semantic Vision Engine理解成一个每帧运行的大模型。

而应该是:

高频Tracking + 低频Semantic Reasoning。

建议把它设计成“事件驱动”
例如正常跟随:
只有出现异常才启动Semantic Vision:

或者用户说:

“跟随那个背包的人。”

立即:

这比一直运行VLM更加合理。
四个能力归纳成四个问题

然后传统视觉负责:

Detection

Re-ID

Tracking

多模态传感器负责:

LiDAR → Where

UWB   → Who

IMU   → How I Move

Radar → How Fast


Target Intelligence

四个模块中优先级并不一样:

第一优先:Referring Expression + Attribute Recognition ——直接解决“我要跟谁”。

第二优先:Open-Vocabulary Detection ——让目标类别和搜索能力摆脱固定YOLO类别。

第三优先:Scene Understanding ——等前面的目标级能力稳定后,再进一步构建环境关系和Scene Graph。

而 CLIP是这套Semantic Vision Engine的重要基础组件,但不是整个Semantic Vision Engine本身。它更像是语义空间的“视觉语言编码器”,上面再构建目标选择、属性、关系和场景理解。


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →