阅读,与值得关注的内容Readance

AiBrainBox-UGV的端侧AI架构

AiBrainBox-UGV = RK3588 + Hailo-8 + 三目MIPI RGB相机 + LiDAR+工业级IMU+UWB+双RTK

Hailo-8负责高频视觉AI,RK3588负责融合、跟踪和轻量语义逻辑;CLIP/语义模型低频、事件驱动运行。


Semantic Vision能力
RK3588+Hailo-8
推荐实现
实时性
Open-Vocabulary Detection
🟢 可实现
YOLO + Open-Vocab/CLIP
低频
Attribute Recognition
🟢 很适合
轻量分类器 + CLIP
低频
Referring Expression
🟡 可以实现
CLIP + Detection + Spatial Logic
事件驱动
Scene Understanding
🟡 可实现
Scene Graph + VLM/规则
0.5–2 Hz
YOLO Detection
🟢 很充裕
Hailo-8
20–30 FPS
Re-ID
🟢 很充裕
Hailo-8
20–30 FPS
Tracking
🟢
RK3588 CPU
30 FPS+
LiDAR融合
🟢
RK3588 CPU
10–20 Hz

AiBrainBox-UGV的端侧AI架构

第一版算法原型直接定成:

YOLO + Re-ID + CLIP + Attribute + LiDAR + UWB + Kalman/IMM → Semantic Multi-Modal Target Tracking

而 Open-Vocabulary Detection、Referring Expression、Scene Understanding 先作为上层能力逐步加入

Hailo-8实际模型组合Benchmark
:YOLO + Re-ID + CLIP + Attribute 同时运行时的FPS、延迟、内存和PCIe数据搬运开销。因为26 TOPS只是峰值指标,最终吞吐会明显取决于具体模型、量化方式和编译后的执行图。Hailo自己的工具链也提供Profiler来评估模型在硬件上的预期性能。

RK3588 + Hailo-8足够完成第一代Semantic Vision Engine。

但建议把目标限定为:

“端侧轻量Semantic Vision Engine + 高速Tracking Engine”

而不是:

“端侧通用VLM推理平台”。

具体来说:

Hailo-8非常适合你的视觉感知 + 语义Embedding + 多模型并行路线;它的26 TOPS和2.5W典型功耗也很适合机器狗/UGV这种功耗受限平台。

四个Semantic Vision能力,我建议这样定义产品级指标

对于你现在的AiBrainBox-UGV,我不建议把指标写成:

“支持CLIP。”

而应该定义成:

Semantic Vision Engine

Scene Understanding分成两级
Edge AI Hierarchy(端—边—云三级智能架构)

所以:

端侧负责“看见、识别、跟踪、测量、执行”;边/云负责“理解、推理、规划、知识调用”。

这是非常合理的架构。

能力
UGV端
边侧
云侧
Open-Vocabulary Detection
✓
✓

Attribute Recognition
✓
✓

Re-ID
✓


CLIP Embedding
✓
✓

Referring Expression
轻量
✓
✓
Scene Understanding
简化
✓
✓
VLM

✓✓
LLM

✓✓
Mission Reasoning

✓✓
Knowledge/Ontology

✓✓
端侧最重要的不是“理解”,而是构建Target State

端侧感知 → 边侧认知 → 云侧知识/决策

也就是说:

视频是原始数据,Target Entity/Scene State才是机器真正理解后的数据。


Hailo-8:负责高频、确定性的视觉AI。
RK3588:负责ROS2、传感器融合、Tracking、Target State和设备控制。
边侧:负责VLM、Scene Understanding和多设备融合。
云侧:负责LLM、Knowledge、Ontology、Mission Intelligence。

AiBrain OS 的端侧智能节点:

Sensor → Perception → Target Entity → Edge Reasoning → Mission Intelligence → Action


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →