首页 - 财经 - 全球市场 - 正文

谷歌(GOOGL.US)推出Gemini 3.5 Transcribe 号称迄今精确度最高语音转文本模型

(原标题:谷歌(GOOGL.US)推出Gemini 3.5 Transcribe 号称迄今精确度最高语音转文本模型)

智通财经APP获悉,谷歌(GOOGL.US)公布了Gemini 3.5 Transcribe,并称这是该公司迄今为止精确度最高的语音转文本模型。谷歌表示:“与传统语音识别模型在处理背景噪音、复杂专业术语以及口语停顿和不流畅表达清理等问题时表现不佳不同,Gemini 3.5 Transcribe能够将原始音频直接转换为准确、经过润色且格式规范的文本。”

据悉,该模型旨在轻松接入开发者的工作流程,从而支持构建语音代理、实时字幕或通话后分析处理流程。开发者可以通过Live API实现实时流式处理,也可以通过Interactions API处理预先录制的音频。其部分功能包括智能转录,可自动清理文本,例如删除口头停顿;识别自定义词汇;支持超过85种语言;并能够识别最多3名说话者。

该模型在流式处理场景下的错误率为4%,非流式处理场景下的错误率为2.6%。在涵盖多种语言的FLEURS基准测试中,其表现也更好。例如,Gemini Transcribe 3.5 Live的词错误率为5.5%,相比之下,OpenAI的GPT Live Transcribe词错误率为8.9%。

新模型从今天起面向开发者和企业用户开放公开预览。对于其他所有用户,该模型目前可在macOS版Gemini应用中以英语使用,并可在部分国家的Android版Rambler中使用。该模型很快还将登陆Chrome。

本月早些时候,谷歌发布了Gemini 3.7 Flash,Gemini应用的用户数量也突破10亿。不过,谷歌尚未发布下一代旗舰模型Gemini 3.5 Pro。在今年5月举办的2026年I/O开发者大会上,皮查伊曾表示会在6月推出Gemini 3.5 Pro模型,但该模型至今仍未上线。按照原本规划,Gemini 3.5 Pro模型应该承担谷歌重新冲击AI前沿竞争的任务。毕竟,在OpenAI、Anthropic不断刷新模型能力的背景下,Gemini Pro系列一直是外界衡量谷歌AI实力的重要标尺。但下一款旗舰模型的发布时间迟迟无法确定,也进一步加剧了外界对这家科技巨头能否超越竞争对手、并成功将巨额AI投资转化为市场领先的工具和服务的广泛疑问。

APP下载
广告
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-