摘要
当 AI 的交互入口从屏幕和聊天框延伸至摄像头、麦克风与真实环境,第一视角可穿戴设备正成为多模态智能的关键落点。OpenSQZ Glass 是由上海期智研究院开源平台团队打造的本地实时多模态 AI 眼镜参考实现,面向研究者与开发者,专为第一视角感知与交互场景设计。系统采用“感知-计算分离”架构:轻量眼镜端负责图像与语音采集,本地设备完成全模态模型推理,在兼顾隐私、延迟、成本与可复现性的前提下,探索第一视角实时视觉辅助的可行路径。项目提供完整的 3D 打印眼镜文件与装配教程,软硬件双开源,降低社区的复现与使用门槛。为什么要做 OpenSQZ Glass?近年来 AI 眼镜赛道迅速升温。国内有字节、阿里、小米、雷鸟、乐奇等多家企业相继推出智能眼镜,国外有谷歌搭载 Gemini 的 AI 眼镜与 Meta Ray-Ban 激烈竞争。市场数据印证了这股热潮——2026 年 Q1 全球出货量同比增长 130%,2026 年全年销量预计增至 2000 万台,同期市场规模预计扩大至 56 亿美元(数据来自市场研究机构 Smart Analytics Global (SAG) 的报告"),行业普遍认为 2028 年或将迎来“iPhone 时刻”。然而,热潮之下,一个根本性问题尚未解决:当前 AI 眼镜的主流交互范式与真实世界的运作方式存在结构性错位。市面多数产品的使用方式仍然是“用户拍照、提问→等待模型输出答案”的离散闭环。但现实世界是流动的:视角在切换,场景在变化,值得被注意的事件可能在任意时刻突然发生。一张静态照片无法代表持续演变的现场,而每一次等待都在打断用户的注意力和行动节奏。这种错位源于一组环环相扣的结构性约束:云端推理带来延迟和隐私压力。第一视角辅助中,响应延迟直接决定可用性阈值。几秒钟的等待在很多场景下已经足以让语境变化、信息失效。同时,第一视角图像天然包含很多敏感信息,如路人面孔、工作环境、家庭空间、电脑屏幕等,将这些数据默认上传云端并不是理想选择。交互割裂偏静态。多数系统虽然接入了视觉和语音,但使用方式仍停留在“拍照→提问→等待回答”的隔离交互流程。这很难满足真实辅助场景中的持续性需求。第一视角场景不是一张静止图片,而是持续变化的环境流,用户和系统都需要在变化中保持交互。穿戴设备受限于算力、功耗和重量约束。