Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型

Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型

当AI从屏幕走向真实的物理世界,多模态模型正迎来一次架构范式的革新。Om AI联汇正式发布全球首个面向物理世界的端侧流式多模态模型系列——VLX,首次在业界提出“流式多模态”这一全新模型架构。

区别于传统视频理解模型将整段视频切帧后一次性离线处理的方式,VLX系列面向物理世界中持续涌入的视频流,以流式编码与缓存增量推理实现毫秒级实时感知,并首次在端侧打通“持续感知→精准定位→行动决策”的完整闭环。

VLX系列由三款模型协同构成,围绕实时物理智能构建完整能力体系:

  • VLX-Flow:负责持续感知,通过增量编码与缓存推理机制,让模型像人一样持续观察环境。
  • VLX-Seek:负责精准定位,创新性地将坐标生成转化为区域检索。
  • VLX-Go:负责行动执行,将视觉理解转化为机器人可执行的短时航点。

这一范式下,视觉信息以“连续流”方式进入模型,实现“边看边理解、必要时主动行动”。这不是更好的人机对话体验,而是AI自主工作能力的质变。

为应对物理世界的AI必须直面三个刚性约束:时间是连续的、环境是动态变化的、终端算力是资源受限的,VLX系列完全围绕实时视频流与端侧设备原生构建。

以“快(流式推理,单路延迟最低0.06秒)、小(覆盖0.6B至10B规格)、准(细粒度定位)、行(感知执行闭环)”四大优势,实现从持续感知到行动决策的端侧闭环。

来源:量子位

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注