Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型
2026/06/30 10:37AI云资讯13777
当AI从屏幕走向真实的物理世界,多模态模型正迎来一次架构范式的革新。
Om AI联汇正式发布全球首个面向物理世界的端侧流式多模态模型系列——VLX,首次在业界提出“流式多模态”这一全新模型架构。区别于传统视频理解模型将整段视频切帧后一次性离线处理的方式,VLX系列面向物理世界中持续涌入的视频流,以流式编码与缓存增量推理实现毫秒级实时感知,并首次在端侧打通“持续感知→精准定位→行动决策”的完整闭环。

VLX系列由三款模型协同构成,围绕实时物理智能构建完整能力体系:VLX-Flow负责持续感知,通过增量编码与缓存推理机制,让模型像人一样持续观察环境而非被动等待提问,新画面随时吸收,提问瞬间响应。VLX-Seek负责精准定位,创新性地将坐标生成转化为区域检索——不是让模型“猜坐标”,而是从候选区域中“选区域”,为端侧设备提供可靠的空间感知能力。VLX-Go负责行动执行,将视觉理解直接转化为机器人可执行的短时航点与运动轨迹,而非输出文本建议,让设备自主完成跟随、避障与导航。
在这一全新范式下,视觉信息不是以“截一帧”的方式进入模型,而是以“连续流”的方式持续进入。模型不是“看完再说”,而是“边看边理解、必要时主动行动”。这对应的不是“更好的人机对话体验”,而是“AI自主工作能力的质变”。
为了应对物理世界的AI必须直面三个刚性约束:时间是连续的、环境是动态变化的、终端算力是资源受限的,VLX系列完全围绕实时视频流与端侧设备原生构建——不是将云端模型压缩后塞进终端,而是从架构层面为端侧具身智能重新设计——以“快(流式推理,单路延迟最低0.06秒)、小(轻量化选型,覆盖0.6B至10B规格)、准(细粒度定位)、行(感知执行闭环)”四大优势,实现从持续感知到行动决策的端侧闭环。
当多模态模型从“看图答题”走向“持续感知”,当AI从屏幕走向真实的物理世界,VLX端侧流式多模态模型系列为物理AI的演进提供了一种全新的架构范式——让每一台终端都能拥有持续理解、即时决策、自主行动的能力,这才是物理世界AI应有的样子。
相关文章
- 中山大学、南洋理工大学、混沌摆实验室提出 ProSA 多模态文档解析评测框架|EMNLP 2026
- Clipto MCP斩获 Product Hunt 月榜第一:为全球智能体补上个人多模态记忆
- 紫东太初开源 ZDTaichu5.0-9B:10B 参数内空间具身能力最强通用多模态大模型
- 中科融合NANO微小型多模态高速扫描模组赋能具身智能迈向精细化作业
- 2026时序数据技术创新大会:多模态时序数智化软件栈发布,生态计划启动
- 联合影像 × 华力创科学,共筑具身智能的多模态感知底座
- 填补行业空白!宇视科技联合多家权威机构发布中小学心理健康多模态智能动态评估团体标准
- 原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
- 商汤发布日日新SenseNova U1 Pro,面向长程任务的交付级原生多模态智能体基座
- 当虹科技AI多模态能力体系,首次亮相WAIC2026
- 看懂一条素材,不能只靠字幕和肉眼:钛动科技把多模态理解拉进营销现场
- 合合信息一季度财报营收同比增27.53%,联手亚马逊云科技落地多模态文档智能体
- 多模态、无代码、全流程 东软多模态医学人工智能平台 让医生轻松用AI
- 旷视多模态上下文学习工作被全球顶会ICML 2026录用,亮相韩国首尔
- 灵科超声波多模态控制与全链互联重构全球焊接柔性生产线
- Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 阶跃这次够狠:AA 全球开源前二,价格打到 Claude 的 1/8
- 科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练









