下一代视觉 Agent 亮相 WAIC 2026,Chance AI 定义摄像头为 AI 新入口
2026/07/20 10:17AI云资讯1800
2026 年 7 月 17 日至 20 日,2026 世界人工智能大会(WAIC 2026)在上海盛大举办。视觉智能企业 Chance AI 携新一代视觉推理智能 Chance Vision 1.5 亮相本届大会,该模型在权威高难度多模态理解与推理基准 MMMU-Pro 的官方公开榜单中,以 86.9% 的综合准确率登顶全球第一,刷新该基准 SOTA(State of the Art,即领域当前最佳水平)纪录。与此同时,Chance AI 将前沿视觉能力深度落地 WAIC 展会实景,让现场观众仅需拍摄一张照片,即可一站式完成展商识别、信息解读、核心要点提炼与深度延伸探索。

Chance AI 亮相 WAIC 2026,将视觉推理能力带入真实展会环境
在 WAIC,把一次拍摄变成对现场信息的理解
上千家展商、密集的产品演示和专业术语同时出现,观众往往拍了大量照片,离开展位后却很难想起“这家公司是谁、产品解决什么问题、为什么值得关注”。传统搜索还要求用户先看清名称、组织关键词,再跳转到多个页面寻找答案。

巴西人工智能协会(ABRIA)代表到访 Chance AI 展位
Chance AI 在 WAIC 现场把这条路径压缩到一次拍摄。会前,用户可以根据 Agent、硬科技、机器人和初创项目等方向选择路线;进入展馆后,只需拍下展位、展板或设备,Chance AI 就会从画面中识别展商与产品,补全团队、技术和产品背景,提炼值得关注的要点,并整理成可以继续追问、收藏与分享的结构化笔记。
例如,当观众对准一台陌生机器人时,Chance AI 不只给出“这是一台人形机器人”的标签,还会继续理解现场展板、设备形态与上下文,说明它由谁开发、正在展示什么能力、与同类产品相比有哪些关注点。用户不必先知道应该问什么,摄像头本身就是理解现场的入口。

观众使用 Chance AI 识别现场信息,并生成可以继续探索的结果
86.9% 登顶 MMMU-Pro,Chance Vision 1.5 达到 SOTA
Chance Vision 1.5 是支撑现场体验的技术底座,在 MMMU-Pro 官方公开榜单中取得 86.9% 的综合准确率,高于 人类专家的 85.4%、GPT-5.4 Thinking w/ tools 的 82.1% 和 Gemini 3.0 Pro 的 81.0%,位列第一。
MMMU-Pro 并不是普通的拍照识物测试,它覆盖工程图、地图、图表、化学结构等专业视觉材料,并通过删除不依赖图片即可作答的问题、增加干扰选项以及引入 Vision-only 设置,重点考察模型能否真正结合视觉信息、专业知识与复杂推理完成任务。
Chance Vision 1.5 的能力不只适用于展会中的物体和展商识别,也能够处理结构复杂、信息密集且需要专业知识参与的视觉问题。WAIC 现场展示则把这套高难度视觉推理能力转化为普通用户可直接体验的交互:无需预先组织问题,只需将摄像头对准眼前事物,AI 就能从画面和上下文出发继续理解。

Chance Vision 1.5 在 MMMU-Pro 视觉推理评测中取得 86.9% 综合准确率
从“看懂”到“行动”,Chance AI 公布 Visual Agent 的记忆
Chance AI 在发布 Chance Vision 1.5 的同时,公开论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》,首次系统披露个人记忆如何参与 Visual Agent 的工具选择与行动决策。研究发现,记忆并非在答案生成后附加一句“根据你的喜好”,而是会提前影响 Agent 调用什么工具、使用什么查询词、检索到什么深度,以及何时停止。
研究团队使用 800 张真实场景图片与受控构造的个人记忆,在视觉输入、基础模型和可用工具保持一致的条件下进行对照实验。移除三层个人记忆后,工具查询相关性从 4.21 降至 3.74,相对下降 11.2%;端到端任务效用从 0.842 降至 0.760,相对下降 9.7%。实验表明,即使面对同一张图片,不同用户真正需要的信息和下一步行动也可能完全不同。
例如,面对同一台机器人,行业从业者可能关注技术路线与供应链,投资人关注团队和商业化进展,普通观众则更想知道它能做什么。个人记忆的作用,是让 Visual Agent 不只识别眼前的对象,还能判断哪些信息与当前用户真正相关。
Chance AI 联合创始人兼 CTO 吴晓凡表示:“榜单验证的是 AI 能不能看懂复杂画面,真正的产品问题是,看懂之后它该查什么、为什么查,以及如何帮助用户完成下一步。视觉让 AI 看见世界,记忆让它理解眼前的人。”

现场展示 Visual Agent 从视觉感知、实时推理到场景理解的多层能力
下一代方向:让摄像头成为 AI 理解现实世界的入口
从 Chance Vision 1.5 到个人视觉记忆,再到工具调用与多步执行,Chance AI 正在搭建一套完整的 Camera-First Visual Agent 技术路径:视觉模型负责理解复杂画面,记忆系统判断什么与用户相关,Agent 则将理解转化为查询、判断与行动。
目前,Chance AI App 是这套技术面向生活场景的第一阶段载体,覆盖旅行、消费、收藏、审美与生活问答等需求。截至目前,产品总用户数达 30 万,近 30 天 MAU 约 9 万,月安装量约 3.5 万;美国及 Tier 1 市场用户约占 MAU 的 40%—46%。
下一阶段,Chance AI 将把复杂视觉理解、行业知识推理和 Agent 流程编排能力延伸至视觉信息密集的生产力工具与垂直行业,让商品图片、设备照片、工程图、表单、视频和现场画面直接进入理解、查询、判断与后续工作流。长期来看,这套能力还将进入机器人、智能眼镜、可穿戴设备及其他智能硬件,使 AI 能够通过摄像头感知现实世界、理解人的意图,并在获得授权后参与真实行动。
关于 Chance AI
Chance AI 成立于 2025 年,致力于打造以摄像头为入口的 Camera-First Visual Agent。在旧金山、东京和深圳设有办公室。产品以相机为入口,通过复杂视觉理解、个人上下文、工具调用与多步推理,帮助用户从一张图片出发,获得与自己相关、可以继续行动的答案。2026 年 5 月,Chance AI 完成由美图领投的数百万美元融资,并在视觉理解基准测试 MMMU-PRO 上排名世界第一。
关于吴晓凡
吴晓凡,Chance AI 联合创始人兼 CTO,负责公司视觉智能、Agent 系统与产品技术架构,研究方向包括复杂视觉推理、个人视觉记忆与 Camera-First Visual Agent。他是论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》的第一作者及通讯作者。
相关文章
- WAIC 2026 | 产业赋能 联通元景全栈智能体实践分享
- 2026WAIC智能财务论坛圆满举行,携手汇付天下共探财务数智化新未来
- WAIC 2026现场:Chance AI视觉推理智能86.9%刷新MMMU-Pro纪录,超越GPT-5.4
- 东方有线亮相WAIC2026,以“广电方案”共筑AI+教育新场景
- 中国联通AI+eSIM产业发展计划亮相WAIC 联合京东加速推动100万台终端落地
- “最萌机器人”亮相WAIC “成都造”爱湫让情感需求被看见
- 科华数据与多家主流AI芯片厂商携手亮相2026WAIC,全面展示人工智能时代的科华实力!
- 道通智能亮相 WAIC 2026:「空地一体·集群智慧」场景服务解决方案,驱动低空作业从单点飞行迈向集群智能
- 元知明启亮相WAIC 2026——以数智之力重构安全底座,为新型工业化筑牢发展根基
- 全球首款AI智能体手机领衔!中兴终端全场景智慧生态亮相WAIC 2026
- 曦智科技成功举办WAIC首个AI光算力论坛
- 万物有灵,端智无界 | 亿道携AI智能中枢亿灵亮相WAIC 2026
- 昆仑万维WAIC专场论坛:董事长兼CEO方汉宣布2026为“世界模型元年”
- 让创新“少走弯路”,“AI+知识产权数据”服务商八月瓜科技亮相WAIC 2026
- 下一代视觉 Agent 亮相 WAIC 2026,Chance AI 定义摄像头为 AI 新入口
- 2026WAIC | 联通在线正式发布云呦平台和呦爱系列产品
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









