漫话开发者 - UWL.ME Mobile

谷歌正式推出Gemini 3.5 Transcribe,这是面向智能语音交互场景的新一代语音转文本模型。它能够将原始音频直接转换为准确、经过润色并完成格式化的文本,减少用户在后期整理和编辑上的工作量。该模型现已在Gemini API、Google AI Studio以及Gemini Enterprise Agent Platform上线,开发者可以通过API接入实时流式转写和预录音频处理能力。这意味着会议纪要、客服对话分析、内容创作、无障碍辅助等场景可以获得更自然的语音交互体验。Gemini 3.5 Transcribe把传统语音识别从“听得清”推进到“理解并输出可用文本”,体现了大模型与语音技术融合的趋势。

核心要点

  • Gemini 3.5 Transcribe能将原始音频直接转为准确、润色且格式化后的文本。
  • 该模型已上线Gemini API、Google AI Studio和Gemini Enterprise Agent Platform。
  • 支持实时流式与预录音频处理,适用于会议、客服、创作等智能语音场景。

Read more >