AiDBox VLM 与 GroundingDINO 指南
目标:理解 VLM 和 DINO 两种大模型工具的能力与边界,学会"写一句话"的方式定义全新的检测规则——无需采集数据、标注、训练。
为什么需要这一章?
内置的 18 条 CV 算法覆盖了最主流的检测场景(安全帽、火焰、跌倒、客流……),但客户总会提出覆盖不到的需求:
-
"楼道里有没有垃圾?"
-
"消防柜的门关了没有?"
-
"垃圾桶是不是满了?"
-
"施工围挡有没有倒?"
这类需求如果走传统定制模型路径:
| 步骤 | 工作量 | 时间 |
|---|---|---|
| 采集现场图片 | 500–2000 张 | 1–2 周 |
| 数据标注 | 人工逐张标框/标类别 | 1–2 周 |
| 模型训练 + 调优 | GPU 服务器 + 算法工程师 | 1–2 周 |
| 边缘端部署 + 适配 | 模型转换 + 性能调优 | 3–5 天 |
AiDBox 内置两种大模型能力,分别解决不同类型的长尾需求:
VLM vs DINO:怎么选?
| VLM(视觉状态判断) | DINO(开放目标检测) | |
|---|---|---|
| 一句话定位 | 判断画面中的状态(是/否、开/关) | 找到画面中目标在哪里(画检测框) |
| 输入方式 | 写一段提示词 | 写一个目标名称 |
| 输出方式 | YES / NO | 检测框 + 置信度(和 CV 小模型一样) |
| 典型场景 | "楼道里有垃圾吗?" → YES | "垃圾" → 画面上标出垃圾位置 |
| 画面表现 | 无检测框,结果在告警面板显示 | 有检测框,直接叠加在视频画面上 |
| 分析速度(NPU) | 每帧约 2–3 秒 | 每帧约 1–2 秒 |
简单记忆:要"结论"用 VLM,要"位置"用 DINO;两者也可以组合——DINO 找到目标区域,VLM 对区域做状态判断。
VLM 视觉状态判断
在场景任务中接入语言视觉大模型节点,写入封闭式问题提示词(如"柜门是否打开?"),系统输出 YES/NO;YES 时触发告警。支持两种可互换后端:
-
嵌入式本地运行时(默认):数据不出设备,已验证的量产方案;认证模型包提供
AiDBox-VL-Judge-0.8B,面向 YES/NO 视觉状态判断优化; -
OpenAI 兼容端点(自建或 SaaS):调用更大的云端模型。VLM 走异步、事件驱动路径,可吸收额外的网络往返延迟。
VLM 节点支持兼容的 Qwen3 VLM 系列与 Qwen3.5 多模态模型;也支持图片批量分析任务(上传 → 结构化视觉检查),用于质量检测、合规检查等离线场景。
GroundingDINO 开放词汇检测
文本提示词 → 目标检测框 + 置信度。无需针对特定类别训练即可查找长尾目标("消防柜""施工围挡""电动车"……),结果以标准检测框叠加在画面上,可继续接入区域判定、计数与告警规则。
实践建议
-
提示词要封闭:VLM 问题尽量是单一事实判断("是否""有没有"),避免开放式提问;
-
控制触发频率:VLM/DINO 走异步节点,按事件或降帧策略触发以平衡算力与时效;
-
组合使用:高频常规场景用 CV 小模型(快、省),长尾/复杂状态判断交给 VLM/DINO。