Google DeepMind·· 2026-08-27精选AI 评分74
Google 推出语音转文字模型 Gemini 3.5 Transcribe
Intelligent transcription with Gemini 3.5 Transcribe
AI 导读
Google 推出语音转文字模型 Gemini 3.5 Transcribe,能够直接将原始音频转换为排版工整、去除语气词和自纠错口语的结构化文本。模型提供用于亚秒级双向交互的实时流式接口与用于录音分析的处理接口,在流式与非流式场景下的平均词错误率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词库以及函数调用。
推荐理由
该模型相比前代Chirp 3显著降低了词错误率与延迟,并通过实时流式接口与意图理解为语音智能体落地提供了更可用的方案。
来源:Google DeepMind · deepmind.google