一句话结论
谷歌在 Gemini Live 中推出 Guided Vision,可用摄像头实时朗读小字并描述周围环境。
关键要点
- 该功能在 Gemini Live 中上线,兼容 Android 设备
- 支持通过手机摄像头实时获取画面进行 AI 处理
- 可朗读小字、描述周围环境、识别物品及描述特定物体细节
- 面向视障、低视力或在特定场景需要辅助的用户
- 功能定位类似苹果在 iPhone 和 Vision Pro 推出的 VoiceOver Live Recognition
背景与事实
Guided Vision 是谷歌今日在 Gemini Live 中推出的新辅助功能。开启后,用户可共享摄像头画面给 Gemini Live,AI 随即基于实时影像进行音频描述,例如读取细小文字、讲述用户当前的周边环境、帮助寻找或识别周围物件,以及解说某个具体物体的细节。该功能以音频方式输出结果,意在为视障或低视力人士提供实时视觉辅助,同时也覆盖在特定情境下需要即时描述帮助的用户。功能目前与 Gemini 应用关联,并在兼容的 Android 设备上通过 Gemini Live 提供。
与苹果在 iPhone 和 Vision Pro 中加入的 VoiceOver Live Recognition 相比,Guided Vision 的定位相近,都是为“看不见或看不清”的场景提供 AI 驱动的实时视觉解读。两者差异主要体现在平台与入口上:苹果将其纳入系统级辅助功能体系,而谷歌将能力嵌入 Gemini Live 的对话式界面,强调与语音交互和 AI 助手能力的结合。
影响分析
对中文开发者与从业者而言,这一发布可作为多模态 AI 在可及性领域的工程参照。它展示了将实时视觉输入与生成式语音输出结合的落地路径,也为构建类似功能的 Android 应用提供了参照:摄像头共享、实时影像理解、音频化结果表达。对于无障碍方向的产品团队,这提示在移动端引入“视觉转语音”能力时,可关注低延迟、离线或弱网表现等细节。需要说明的是,上述判断基于本文给出的功能描述与平台信息,属于分析性观点,而非官方承诺。
适用边界
该结论仅适用于在 Android 平台、通过 Gemini Live 使用 Guided Vision 的场景。它不能覆盖 iOS 系统或谷歌其他产品线的同类能力,也不代表 Apple 的 VoiceOver Live Recognition 与 Guided Vision 在功能细节、支持范围或可用性上完全一致。此外,在摄像头不可用、设备不兼容或特定对象未被正确识别时,实时朗读与描述能力将受限。
孤本观察
本次发布将 AI 视觉能力嵌入对话式助手,而非独立成“读屏工具”,这是基于事实的编辑判断。从可及性演进角度看,AI 驱动的实时视觉辅助正从专用工具走向通用助手,其影响范围可能超出视障群体。

常见问题
谷歌 Guided Vision 功能目前支持哪些操作系统平台?
该功能目前仅在兼容的 Android 设备上通过 Gemini Live 提供,不支持 iOS 系统或谷歌其他产品线的同类能力。
Guided Vision 能处理哪些具体的视觉任务?
可读取细小文字、描述周围环境、帮助寻找或识别周围物件,以及解说某个具体物体的细节,结果以音频方式输出。
Guided Vision 与苹果 VoiceOver Live Recognition 的主要区别是什么?
苹果将其纳入系统级辅助功能体系,而谷歌将能力嵌入 Gemini Live 的对话式界面,强调与语音交互和 AI 助手能力的结合。
哪些用户群体最适合使用 Guided Vision 功能?
该功能主要面向视障、低视力人士,以及在任何特定场景下需要即时视觉辅助或辅助识别物品的用户。
什么情况下 Guided Vision 的实时朗读能力会受到限制?
在摄像头不可用、设备不兼容或特定对象未被正确识别时,其实时朗读与描述能力将受到限制。
来源:The Verge AI