Hailo-8负责高频视觉AI,RK3588负责融合、跟踪和轻量语义逻辑;CLIP/语义模型低频、事件驱动运行。
| Open-Vocabulary Detection | |||
| Attribute Recognition | |||
| Referring Expression | |||
| Scene Understanding | |||
第一版算法原型直接定成:
YOLO + Re-ID + CLIP + Attribute + LiDAR + UWB + Kalman/IMM → Semantic Multi-Modal Target Tracking
而 Open-Vocabulary Detection、Referring Expression、Scene Understanding 先作为上层能力逐步加入
YOLO + Re-ID + CLIP + Attribute 同时运行时的FPS、延迟、内存和PCIe数据搬运开销。因为26 TOPS只是峰值指标,最终吞吐会明显取决于具体模型、量化方式和编译后的执行图。Hailo自己的工具链也提供Profiler来评估模型在硬件上的预期性能。RK3588 + Hailo-8足够完成第一代Semantic Vision Engine。
但建议把目标限定为:
“端侧轻量Semantic Vision Engine + 高速Tracking Engine”
而不是:
“端侧通用VLM推理平台”。
具体来说:
四个Semantic Vision能力,我建议这样定义产品级指标
对于你现在的AiBrainBox-UGV,我不建议把指标写成:
“支持CLIP。”
而应该定义成:
Semantic Vision Engine
所以:
端侧负责“看见、识别、跟踪、测量、执行”;边/云负责“理解、推理、规划、知识调用”。
这是非常合理的架构。
| ✓ | |||
| ✓ | |||
| ✓ | |||
| ✓ | |||
| ✓ | |||
| ✓ | |||
| ✓ | ✓ | ||
| ✓ | ✓ | ||
| ✓ | ✓ | ||
| ✓ | ✓ |
端侧感知 → 边侧认知 → 云侧知识/决策
也就是说:
视频是原始数据,Target Entity/Scene State才是机器真正理解后的数据。
RK3588:负责ROS2、传感器融合、Tracking、Target State和设备控制。
边侧:负责VLM、Scene Understanding和多设备融合。
云侧:负责LLM、Knowledge、Ontology、Mission Intelligence。
AiBrain OS 的端侧智能节点:
Sensor → Perception → Target Entity → Edge Reasoning → Mission Intelligence → Action