谷歌称其为迄今"最精准"的语音转文本模型,并已将其引入Android版Gboard及Mac版Gemini应用,同时通过Gemini API向开发者开放预览。
此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental同日推出,共同构成谷歌新的Gemini Audio系列。
分析人士指出,随着语音入口加速渗透谷歌旗下Chrome、Gboard等高频产品,语音交互有望逐步替代键盘输入,成为用户与AI系统的主要连接方式。
截至发稿,谷歌股价周四盘中下跌1.37%。
从"逐字记录"到"意图理解"
与此同时,模型会自动删除"um""uh"等口头禅,并完成标点符号和文本格式的整理。该模型能够将凌乱、非结构化的口述内容直接转化为格式化文本。
开发者接口与产品落地双线推进
在面向开发者的能力开放层面,Gemini 3.5 Transcribe已通过Gemini API进入预览阶段,支持实时语音流与录制音频文件两种处理场景。
在产品端,Gemini 3.5 Transcribe已落地Android平台的Gboard Rambler语音输入功能及Mac版Gemini应用。
谷歌还计划将其引入Chrome浏览器,届时用户可在网页文本输入框内直接通过语音输入内容,涵盖回复消息、撰写帖子及向Gemini发出指令等场景。
语音入口之争背后的商业逻辑
此次发布是谷歌系统性推进Gemini"语音入口"战略的组成部分。
谷歌正将Gemini的能力从文本和图像进一步延伸至实时对话、语音翻译和语音输入等场景,Gemini 3.5 Transcribe、Gemini 3.5 Live及Gemini 3.5 Live Experimental共同构成其Gemini Audio系列。
从商业化视角看, 语音转文本正从单纯的后台基础能力演变为AI应用的重要交互入口。随着模型具备"听懂—理解—整理—执行"的一体化能力,用户与AI的交互方式有望从键盘输入向语音指令转移。
对谷歌而言,将Gemini 3.5 Transcribe嵌入Chrome、Gboard、Docs、Gmail等高频产品,有望进一步扩大Gemini在日常生产力场景中的渗透深度,并在语音交互这一新兴入口上巩固其竞争地位。