用一句话找监控画面:多模态检索离实用还有多远

行业资讯

用一句话找监控画面:多模态检索离实用还有多远

用一句话找监控画面:多模态检索离实用还有多远
从「按时间翻录像」到「按描述搜画面」,技术路径已经清晰,落地难点在检索精度与算力成本。

「帮我找昨天下午一个穿红色雨衣的人经过北门的画面」——这类需求在传统监控系统里意味着逐路回放、倍速拖动,耗时往往以小时计。多模态检索要解决的正是这个问题。

技术路径大致分两步:先由模型对视频做结构化处理,提取目标属性(人、车、颜色、方向、时间等)建立索引;再通过自然语言或图片进行检索匹配。近年来的进展主要集中在第二步,即用语义匹配代替精确关键词匹配,使「穿红色雨衣的人」这样的描述可以直接被理解。

落地难点有两处。一是精度,真实监控画面存在遮挡、逆光、夜间低照度等干扰,检索结果的召回率与准确率难以同时保证,实践中通常需要「检索 + 人工复核」配合;二是成本,全量视频做结构化处理需要可观的算力,更可行的做法是对重点点位、重点时段做索引,而非全量覆盖。

对使用者而言,可以先把检索能力用在最耗时的场景上——比如事件回溯、丢失物品查找、纠纷取证,用实际效率提升来验证价值,再逐步扩大范围。

0755-33550268 13717108513 zhangyong@wuyuecctv.com
WeChat 微信
在线留言