首页 / Wiki / AiDBox / VLM 与 GroundingDINO 指南

AiDBox VLM 与 GroundingDINO 指南

目标:理解 VLM 和 DINO 两种大模型工具的能力与边界,学会"写一句话"的方式定义全新的检测规则——无需采集数据、标注、训练。

为什么需要这一章?

内置的 18 条 CV 算法覆盖了最主流的检测场景(安全帽、火焰、跌倒、客流……),但客户总会提出覆盖不到的需求:

这类需求如果走传统定制模型路径:

步骤 工作量 时间
采集现场图片 500–2000 张 1–2 周
数据标注 人工逐张标框/标类别 1–2 周
模型训练 + 调优 GPU 服务器 + 算法工程师 1–2 周
边缘端部署 + 适配 模型转换 + 性能调优 3–5 天

AiDBox 内置两种大模型能力,分别解决不同类型的长尾需求:

VLM vs DINO:怎么选?

VLM(视觉状态判断) DINO(开放目标检测)
一句话定位 判断画面中的状态(是/否、开/关) 找到画面中目标在哪里(画检测框)
输入方式 写一段提示词 写一个目标名称
输出方式 YES / NO 检测框 + 置信度(和 CV 小模型一样)
典型场景 "楼道里有垃圾吗?" → YES "垃圾" → 画面上标出垃圾位置
画面表现 无检测框,结果在告警面板显示 有检测框,直接叠加在视频画面上
分析速度(NPU) 每帧约 2–3 秒 每帧约 1–2 秒

简单记忆:要"结论"用 VLM,要"位置"用 DINO;两者也可以组合——DINO 找到目标区域,VLM 对区域做状态判断。

VLM 视觉状态判断

在场景任务中接入语言视觉大模型节点,写入封闭式问题提示词(如"柜门是否打开?"),系统输出 YES/NO;YES 时触发告警。支持两种可互换后端:

VLM 节点支持兼容的 Qwen3 VLM 系列与 Qwen3.5 多模态模型;也支持图片批量分析任务(上传 → 结构化视觉检查),用于质量检测、合规检查等离线场景。

GroundingDINO 开放词汇检测

文本提示词 → 目标检测框 + 置信度。无需针对特定类别训练即可查找长尾目标("消防柜""施工围挡""电动车"……),结果以标准检测框叠加在画面上,可继续接入区域判定、计数与告警规则。

实践建议