快速答案
需要快速把产品脚本变成干净的配音?截至 2026-04-16,Gemini 3.1 Flash TTS 值得优先试一试。
Google 在 2026-04-15 发布了 Gemini 3.1 Flash TTS,定位为高性价比、低延迟、可控的语音模型,支持 70 多种语言、单人和多人语音生成,以及用自然语言音频标签控制节奏、语气和交付方式。截至同日,Google 将其列为 Gemini API 和 Google AI Studio 中的预览版模型。
适合使用的场景:
- 中性语气的产品演示旁白
- 多语言内部培训片段
- 需要逐字还原的脚本配音
- 从文字提示词到可用音频的快速迭代
暂时不适合的场景:
- 需要品牌声音克隆的法律敏感流程
- 要求正式上线版本(GA)而非预览版的采购或合规场景
- 已经围绕另一套 TTS 方案建立了完整的长篇后期制作链
最精简的工作流:
- 写一段朗读起来自然的短脚本
- 在文稿中直接加入音频标签和交付说明
- 在 Google AI Studio 中测试
- 如果需要在产品中重复使用该语音,把设置导出为 Gemini API 代码
- 发布前做一次发音和节奏检查
2026-04-15 发生了什么
这条新闻触发点是真实的,但真正有用的信息不是"Google 又发了一个模型",而是 Google 终于让 Gemini TTS 在实际配音场景中变得实用。在 Artificial Analysis 的 TTS 排行榜上——该基准基于数千次盲听人类偏好比较——Gemini 3.1 Flash TTS 获得了 1,211 的 Elo 分数,位于 Artificial Analysis 所说的"高质量 + 低成本"最具吸引力象限。
根据 Google 2026-04-15 的发布说明和当前 Gemini 文档,重要变化包括:
- Gemini 3.1 Flash TTS 现已通过 Gemini API 和 Google AI Studio 以预览版提供,企业端可通过 Vertex AI 接入,Workspace 用户可通过 Google Vids 集成
- Google 表示该模型支持 70 多种语言
- 模型新增了音频标签,可以用自然语言控制风格、节奏和交付方式
- Gemini TTS 文档描述了单人和多人语音生成
- Google AI Studio 可以把调整好的设置导出为 Gemini API 代码
- 所有生成的音频都带有 SynthID 水印
对产品团队而言,这些变化缩小了"模型在演示中听起来不错"和"我们确实能在工作流中重复使用这个语音输出"之间的差距。
本教程面向谁
本文面向需要配音的团队:
- SaaS 功能演示讲解
- 版本更新视频
- 客户引导支持片段
- 内部流程说明
- 多语言培训内容
本文不涉及名人声音克隆、有声书制作或对话式实时代理。Gemini 当前的 TTS 文档围绕的是可控的文本转语音生成,而非完整的声音克隆流程。
快速适配检查
投入时间之前,先用这张快速对照表判断。
| 问题 | 答案为"是" | 答案为"否" |
|---|---|---|
| 脚本已经有现成的文字版了吗? | Gemini 3.1 Flash TTS 适合 | 先把脚本写好 |
| 需要逐字还原,而不是自由对话? | 用 Gemini TTS | 看看实时语音方案 |
| 需要用同一套流程产出多语言版本? | Gemini 值得测试 | 语言覆盖度不是关键 |
| 需要自定义节奏和语气,又不想手动剪辑音频? | 音频标签有用 | 普通 TTS 可能就够了 |
| 采购或合规要求必须用非预览版模型? | 等一等或用成熟方案 | 预览版可以接受 |
核心判断很简单:Gemini 3.1 Flash TTS 在团队需要可控旁白时最强,而不是即兴对话。
第 1 步:为耳朵写作,而不是为文档写作
大多数糟糕的 AI 配音,源头都是一份为阅读而非聆听写的脚本。
做产品演示时,每句话要短到能一口气说完。把"请导航至左侧配置模块"这类充斥界面术语的说法,换成人类旁白真正会说的话。
一个可行的结构:
- 一句话说目标
- 一句话说操作
- 一句话说预期结果
反面示例:
In order to proceed with workspace member management, the administrator should first navigate to the role assignment section and review the applicable permission mappings.
改进后:
Open Role Settings. Choose the teammate you want to update. Then change the permission level and save.
如果你自己大声读一遍都觉得别扭,Gemini 也不会把它变自然。
第 2 步:添加音频标签和交付说明
这是新版本真正值得关注的实用功能。
Google 当前文档表示 Gemini TTS 可以通过自然语言提示词或音频标签来控制。不需要单独搞一套繁重的 SSML 流程来改善节奏。
标签适合用于:
- 关键操作前的停顿
- UI 标签处放慢语速
- 警告或截止时间的额外强调
- 旁白和引用语句之间切换能量级别
产品演示的起手提示词(可直接复制):
Read this as a calm product trainer.
Keep the pace steady and slightly upbeat.
Do not sound like an ad.
Pause briefly before each action step.
Emphasize the result sentence at the end.
Script:
Welcome to the new workspace approval flow.
[short pause]
Open Requests.
Select the pending item.
Choose Approve.
[short pause]
You will now see the request move into the completed queue.
内部培训的起手提示词(可直接复制):
Read this as an experienced operations lead.
Use a clear, patient tone.
Slow down slightly on policy terms.
Add a short pause before each warning.
Script:
Before you export customer data, verify the request reason and ticket ID.
[short pause]
Do not send the file to a personal email address.
[short pause]
If the customer asks for a correction, update the CRM record first and then regenerate the export.
需要两个人对话式讲解时,Google 文档中也描述了多人 TTS。适合简短的培训对话,比如讲师加学员。
示例结构:
Make Speaker1 sound calm and instructive.
Make Speaker2 sound curious and slightly unsure.
Speaker1: Open the analytics dashboard.
Speaker2: Do I need admin access for this step?
Speaker1: No. Viewer access is enough for this report.
第 3 步:先在 Google AI Studio 中测试
截至 2026-04-16,Google 表示 Gemini 3.1 Flash TTS 已在 Google AI Studio 中以预览版提供。在写应用代码之前先到这里测试。
为什么 AI Studio 是最佳起点:
- 最快了解脚本能不能用
- 不需要工程介入就能迭代方向说明
- Google 表示效果满意后可以把最终设置导出为 Gemini API 代码
在 AI Studio 中的目标不是追求完美,而是快速回答三个问题:
- 语音读脚本时是否自然?
- 你的音频标签是否真的让节奏朝期望方向移动了?
- 产品名、缩写和功能标签的发音是否正确?
三个问题中任何一个答案是"否",先改脚本再扩展流程。
第 4 步:把调好的设置导出到 Gemini API
Google 的发布说明表示 AI Studio 可以把最终语音设置导出为 Gemini API 代码。这一步很关键,因为它把一次性的工作室实验变成了可重复的内容生产环节。
操作模式:
- 内容或产品营销团队写脚本
- 有人在 AI Studio 中调语气、节奏和停顿
- 验证通过的设置进入代码,实现可重复生成
到这一步 Gemini 就不再只是新鲜玩具了。模型可以融入版本发布流程、帮助中心内容生产,或本地化的引导素材制作。
第 5 步:发布前做一轮基础 QA
不要直接发布第一版录音。
检查清单:
- 发音:产品名、API 名、缩写和客户术语发音正确
- 节奏:步骤讲解足够慢、跟得上,但不拖沓
- 重音:强调的是关键动作,而不是无关紧要的词
- 停顿位置:操作、警告和结果语句前有短停顿
- 语气匹配:内部培训片段应沉稳清晰,不像广告
- 时长:30 秒的演示配音后听起来依然简洁
好的 TTS 流程仍然需要一个人工签收环节。目的是减少剪辑时间,而不是取消判断。
Gemini 3.1 Flash TTS 目前擅长什么
根据 2026-04-16 查看的 Google 发布说明和文档,Gemini 3.1 Flash TTS 在以下场景中竞争力较强:
| 使用场景 | 为什么适合 |
|---|---|
| 功能演示配音 | 可控节奏的精准脚本式旁白 |
| 多语言培训片段 | 官方支持 70 多种语言 |
| 短篇内部说明音频 | 在 AI Studio 中设置成本低 |
| 产品讲解对话 | 支持多人 TTS |
| 工具链中的可重复配音 | AI Studio 导出为 Gemini API 代码 |
以上全是脚本驱动型任务,这也解释了为什么该模型在培训和演示场景中比开放式对话更有用。
需要明确说出来的限制
不要过度宣传一个刚发布的版本。
截至 2026-04-16,核实的 Google 官方资料显示以下边界:
- 仍为预览版模型,定价、速率限制和行为都可能变动
- 模型卡列出 Flash TTS 的文本输入上限为 16K
- 模型卡列出音频输出上限为 32K tokens
- 模型提供 30 个预置语音(Zephyr、Puck、Kore、Charon、Fenrir 及另外 25 个);没有自定义语音上传或克隆流程
- 不支持流式传输——TTS 在单次响应中返回完整音频文件,无法边生成边播放
- Google 的定位围绕可控 TTS,而非通用的实时对话音频产品
- 所有生成音频均带 SynthID 水印,在政策审查或对外分发时可能需要留意
一个实际限制是流程成熟度。如果你的团队已经围绕另一家供应商建立了完善的后期制作链,Gemini 需要在速度或成本上赢才能说服团队切换。
需要关注的定价
截至 2026-04-16,Google 的 Gemini 定价页面列出 Gemini 3.1 Flash TTS Preview 的价格为:
- 标准层:免费
- 批量层:每百万文本输入 token $1.00,每百万音频输出 token $20.00
Google 还指出音频 token 对应每秒音频 25 个 token。
作为参考,旧版 Gemini 2.5 Flash TTS 批量价格更低,为 $0.50/$10.00;Gemini 2.5 Pro TTS 与 3.1 Flash 持平,为 $1.00/$20.00。免费的标准层让 3.1 Flash TTS 在决定投入批量生产前零成本试用。
产品团队的实操工作流
如果需要一个可重复的流程,参考这套方案。
最精简流程
- 用纯文本草拟脚本
- 缩短大声读起来不自然的句子
- 添加节奏说明和音频标签
- 在 AI Studio 中测试
- 修复发音问题
- 如果需要重复使用该语音,导出到 Gemini API
- 把审核通过的提示词模式与脚本模板一起存档
团队分工
- 内容负责人:写脚本
- 产品负责人:检查事实准确性和界面用词
- 操作员:调提示词、停顿和重音
- 审核人:签收发音和语气
这套流程看起来很无聊——这是好事。复查路径越可重复,模型就越有用。
什么时候不该用 Gemini 3.1 Flash TTS
即便发布了新版本,有些场景仍然不该把它当默认选择。
应当跳过的情况:
- 组织不允许在生产环境使用预览版模型
- 项目依赖某种特定的声音克隆身份流程
- 音频必须经过一条深度嵌入的外部后期制作链,切换工具的成本很高
- 实际需要的是一个实时交互语音回路,而不是基于固定脚本的文本转语音
这不是对模型的批评,只是区分一个优秀的 TTS 发布和一个万能音频方案之间的差异。
常见问题
Gemini 3.1 Flash TTS 适合产品演示吗?
适合,这是最明确的早期使用场景之一。该模型为可控 TTS 而设计,Google 当前文档明确支持节奏、语气、风格和多人语音生成,与产品功能讲解和内部培训片段的需求高度匹配。
Gemini 3.1 Flash TTS 支持多语言吗?
支持。Google 在 2026-04-15 的发布说明中表示 Gemini 3.1 Flash TTS 支持 70 多种语言。
使用前需要先写代码吗?
不需要。截至 2026-04-16,Google 表示该模型已在 Google AI Studio 中以预览版提供,在导出为代码之前可以先在里面测试脚本和提示词方向。
Gemini 3.1 Flash TTS 和实时语音代理模型一样吗?
不一样。Google 的 TTS 文档把这个流程和 Live API 分开。Gemini TTS 用于可控的脚本式语音生成,Live API 用于交互式音频和多模态会话。
团队最容易犯的错误是什么?
试图用更好的提示词去拯救一份糟糕的脚本。提示词控制有帮助,但救不了本来就不适合朗读出来的文字。
总结
Gemini 3.1 Flash TTS 是本周最具实操价值的 AI 音频发布之一,因为它把发布头条变成了团队真正能跑通的工作流。
如果你的团队需要为演示、版本更新视频和内部培训快速做配音,现在就值得测试。选择它的理由不是追热点,而是 Google 现在提供了一个可控 TTS 模型、AI Studio 迭代环境、多人语音输出、70 多种语言覆盖,以及从提示词调优到 API 导出的直通路径。
足以让短篇语音制作明显提效。
核实说明
于 2026-04-16 依据 Google 官方资料核实。
主要来源:
- Google 发布说明:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
- Gemini API TTS 文档:https://ai.google.dev/gemini-api/docs/speech-generation
- Gemini 定价:https://ai.google.dev/gemini-api/docs/pricing
- Gemini 3.1 Flash Audio 模型卡:https://deepmind.google/models/model-cards/gemini-3-1-flash-audio/
核实要点:
- 发布日期和上线渠道(Gemini API、AI Studio、Vertex AI、Google Vids)
- 70 多种语言支持
- 30 个预置语音
- 音频标签和多人语音支持
- Gemini API 和 Google AI Studio 中的预览状态
- SynthID 水印
- TTS 不支持流式传输
- Gemini 3.1 Flash TTS Preview 定价(标准层:免费;批量层:每百万 token $1.00/$20.00)
- 模型卡限制:文本输入 16K、音频输出 32K tokens
- Artificial Analysis TTS 排行榜 Elo 分数(1,211)