从月饼产线到灯火夜市:旷视OpusDet的万物检测能力实测
2026/09/22 18:19AI云资讯16169
从月饼产线到灯火夜市,看旷视OpusDet如何以文本、视觉与混合提示覆盖多样目标与场景。
传统目标检测通常围绕训练阶段预设的类别工作,而万物检测允许用户在使用模型时,通过文字或图像直接指定要检测的目标。输入“灯笼”,模型可以在画面中寻找灯笼;给出一枚月饼作为视觉样例,模型可以检出与它外观相近的目标;当单一提示不足时,文字与图像还可以组合使用。旷视算法团队近日开源的轻量级万物检测模型OpusDet,将文本、视觉与混合提示统一在同一套检测框架中,使同一个模型能够应对不同场景下类别、形态和状态各异的目标,并兼顾检测精度与推理效率。一种模型,三种提示
文字、图像,或二者共同提供线索
有些目标可以通过类别名称直接说明;有些目标的外观特征难以用语言准确概括,给出一个图像样例会更加直观;还有一些高度相似的目标,需要文本语义与视觉线索共同参与判断。OpusDet将三种提示方式收进同一套算法框架,用一个模型完成多种形式的提示检测。
文本提示 ·Text Prompt

图示:写下“安全帽”,模型便可在密集人群中找到对应目标
视觉提示 · Visual Prompt

图示:框选一处钢管断面,模型据此检出并清点画面中的同类目标
混合提示 · Mixed Prompt

图示:当名称不足以排除相似外观,文字与视觉示例组合可以实现更准确的判断
从整线计数到口味区分
中秋前后的月饼产线,为多种提示能力提供了一个直观的应用场景:输入“月饼”这一文本类别,可以完成整线检测与计数;进一步给出蛋黄莲蓉与桂花奶心的实物样例,模型还可以依据外观完成口味区分。

图示:以“月饼”为文本提示,检出传送带上的目标并同步计数
图示:各给出一枚蛋黄莲蓉与桂花奶心月饼作为示例,模型按外观完成分类计数
一种能力,多种场景在开放环境与工业现场中检验万物检测的场景适应性
月饼产线展示了OpusDet对目标类别、数量和外观差异的检测能力。将视野扩展到更多场景,模型还需要面对低照度、遮挡、密集排列以及细微状态差异等不同挑战。接下来,我们通过夜市与工业现场中的一系列案例,进一步展示OpusDet的万物检测能力。
灯火之间的多目标检测——文本提示
夜色让中秋的灯火更通明,也让检测变得更难:目标密集、尺度不一,遮挡与低照度同时存在。依次输入“灯笼”“行人”“招牌”等文字提示,模型便可在同一场景中切换关注对象。

图示:同一段夜市画面,随文本提示切换检测对象并完成计数
夜市集中呈现了开放环境的复杂性;在工业现场,检测难点则表现为另一种形态:缺陷难以准确描述、零件高度密集,不同状态之间有时只相差一处细节。面对这些任务,视觉示例可以直接成为模型定位和区分目标的依据。
用示例定义缺陷——视觉提示
缺陷往往具体而细微,很难仅凭文字穷举。给出一处“缺孔”的图像示例作为参照,模型便可在整块PCB上寻找具有相同外观的异常。
图示:左:注册“缺孔”视觉示例;右:整板自动定位同类缺陷
密集目标分类计数——视觉提示
面对托盘中密集排列的孔位与螺杆,类别名称提供的信息有限。分别框选一个视觉样本后,模型即可依照示例完成全图分类与清点。
图示:以“孔位/螺杆”为视觉示例,完成密集目标的分类计数
识别药品状态差异——视觉提示
将“有药”与“空泡”分别作为视觉类别,模型逐格判断泡罩板的装填状态,为漏装质检提供直观结果。
图示:泡罩板逐格判定有药/空泡,快速识别漏装
从提示覆盖到推理效率灵活性、泛化性与推理效率的综合验证
要系统评价一个万物检测模型的综合能力,需要同时观察三个方面:不同场景下能否灵活修改提示形式,在不同数据集上的表现是否稳定,以及推理速度能否满足实际使用。OpusDet采用强语义编码器、单阶段“文本—视觉”对齐训练(ICA),在统一处理多种提示的同时大幅减少计算开销。
OpusDet同时支持视觉、文本以及混合提示,并且在各数据集上均达到了领先的指标;与此同时,其推理速度也极具竞争力:

推理速度 · FPS
从推理速度上来看,OpusDet达到21.3FPS,相较T-Rex2-T的15.4 FPS和PET-DINO-T 的8.2FPS,分别提升约38%和160%。
结语从文本描述到视觉样例,再到两者共同提供线索,OpusDet用同一个模型覆盖了多种提示检测方式。在月饼产线、夜市场景和工业质检等案例中,OpusDet展现出对不同目标、尺度、光照和外观差异的适应性;在COCO、LVIS-mv与ODinW35等基准上的结果,则进一步验证了模型在提示覆盖、跨数据集泛化和推理效率方面的综合优势。OpusDet已开源,期待与研究者、工程师及合作伙伴一起,将灵活而轻量的万物检测能力带入更多场景。
相关文章
- 从月饼产线到灯火夜市:旷视OpusDet的万物检测能力实测
- 旷视赵康:TMF决定物理世界AI场景的纵深
- 旷视多模态上下文学习工作被全球顶会ICML 2026录用,亮相韩国首尔
- 旷视智能体应用与管理平台首次亮相智博会
- 旷视方案亮相石油石化大会:让安全生产“看得见、管得住、能闭环”
- 旷视获广东联通三项殊荣,深化“AI+终端”产业协同
- 从“根技术”到“真场景”:旷视眼中的中关村国际前沿科技大赛
- 在旷视共赴一场春日之约,看见“她力量”的远见与绽放
- 合作再升级:旷视与中国移动签署战略合作框架协议
- 旷视参与首届北京市大学生“人工智能+”创新大赛 助力培育AI实战人才
- 旷视成为国家人工智能应用中试基地首批共创伙伴
- 旷视入选《人工智能治理案例集》,持续加码AI治理能力建设
- 深入实施“人工智能+”行动的号角已经吹响,旷视以“升维”解码AI未来图景
- 旷视赵康:做大模型的“炼金术士”,让AI在千行百业中兑现价值
- 旷视入选北京市数字经济100家标杆企业
- 上海MWC见证:旷视以AI驱动运营商生态跃迁
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 阶跃这次够狠:AA 全球开源前二,价格打到 Claude 的 1/8
- 科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练









