Gemini TTS 最佳实践:每次都能生成一致且富有表现力的音频
快速总结: Gemini TTS 模型(2.5 Flash、2.5 Pro 和 3.1 Flash)与传统的 TTS 从根本上不同 —— 它们是生成音频的大型语言模型。这意味着你的提示、语音选择和内联标签对输出质量有巨大的影响。本指南涵盖了实现一致音频生成的五大支柱:预设、语音选择、情感标签、系统提示和护栏。
风格提示(系统说明)
整体情绪基调和表达风格的主要驱动力。为整个语音段落设定上下文。文本内容(脚本)
文字的语义含义。情感丰富、引人入胜的文本比中性文本产生的结果要可靠得多。内联标签(标记)
方括号修饰符(如 [whispers] 或 [laughs]),用于对特定短语进行细粒度、本地化的控制。它们与风格提示协同工作。
核心原则: 为获得最大的可预测性,请确保您的风格提示、文本内容和内联标签在语义上保持一致,并朝着同一个情感目标努力。一个带有中性会议安排文本的恐惧提示会产生模棱两可的结果。
# 音频配置文件:Nova ## “晨间主持人” ## 场景:直播广播工作室 [一个温暖、诱人的工作室,伴随着柔和的晨光。 Nova 轻松、自信且引人入胜 — 她 像朋友一样直接与听众交谈。] ### 导演笔记 风格:温暖、对话式、略带轻快 节奏:中等 — 不匆忙,不缓慢 口音:美式英语,中性 基调:友好且平易近人,就像在 喝咖啡时与亲密朋友交谈
- 可重现性: 应用于不同脚本的同一预设将产生听起来像同一会话中同一发言人的音频。
- 多发言人工作流程: 为每个发言人(采访者、嘉宾、旁白)定义一个预设,并在剧集中保持独特的语音。
- 减少提示偏差: 没有预设,模型仅根据文本推断风格 — 这会导致长期项目中的不一致。
- 更快的迭代: 一旦您的预设听起来正确,您只需要调整文本,而不必每次都重新发明声音。
- 给角色一个名字。 用名字(“Nova”、“Dr. Claire”、“Marcus”)来固定模型,可以将表演联系起来并减少游离。
- 定义身份,而不仅仅是语调。 “电台 DJ”或“自然纪录片旁白”为模型提供了一个可以锚定的表演原型。
- 具体说明环境。 “繁忙的清晨咖啡店”与“安静的工作室”会在输出中产生显着不同的声学特征。
- 包括“导演笔记”。 风格、节奏、口音和语调都应明确说明 — 不要让它们听天由命。
- 将预设控制在 200 字以内。 较长的预设可能会稀释模型的注意力。保持简洁但具体。
| 语音名称 | 性别 | 最适合 | 特征 |
|---|---|---|---|
| Kore | 女性 | 温暖叙述,播客 | 友好、温暖、易于亲近 |
| Puck | 男性 | 轻快内容,促销 | 充满活力、自信 |
| Enceladus | 男性 | 平静叙述,有声书 | 气声,内省 |
| Charon | 男性 | 权威内容 | 深沉、威严 |
| Aoede | 女性 | 专业演示 | 清晰、润色 |
| Callirrhoe | 女性 | 休闲对话 | 轻快、自然 |
| Orus | 男性 | 技术内容 | 精确、稳重 |
| Fenrir | 男性 | 戏剧性叙述 | 有力、强烈 |
- 匹配语音与预设风格。 如果您的预设描述了一个疲惫的角色,请选择带有自然气息的语音(如 Enceladus)。不要让明亮、轻快的语音去耳语 — 这会听起来很生硬。
- 在 Google AI Studio 中测试 [语音库]。 游乐场让您在提交之前听到每个语音对不同提示的反应。
- 利用语音 + 提示的协同作用。 深沉的男性声音 (Charon) 结合权威的风格提示会增强效果。语音和提示应该相互加强。
- 避免不匹配的年龄/性别提示。 深沉的男性声音试图模仿年轻女孩的效果会产生诡异的结果。确保预设的书面语调自然适合该语音。
- 每个角色锁定一个语音。 在多发言人内容中,为每个发言人分配一个语音,并且在项目期间永远不要更改它。一致性是关键。
- 对于非英语内容: 在各种语言中使用相同的语音以保持一致的品牌形象。Gemini TTS 使用相同的语音选项处理 70 多种语言。
专家提示: 使用 Google Cloud TTS API (Vertex AI) 时,您还可以为每个语音指定 speaker。将其与多发言人对话模式结合使用,可在播客和采访中进行自动发言人区分。
| 标签 | 效果 | 可靠性 |
|---|---|---|
| [sigh] | 插入叹息声 | 高 |
| [laughing] | 插入笑声 | 高 |
| [uhm] | 插入犹豫 | 高 |
| [gasp] | 插入喘息声 | 高 |
| [cough] | 插入咳嗽声 | 中 |
| [sighs] | 插入叹息 | 高 |
| 标签 | 效果 | 可靠性 |
|---|---|---|
| [whispers] | 耳语式传递 | 高 |
| [excitedly] | 兴奋、充满活力的语调 | 高 |
| [bored] | 平淡、漫不经心的表达 | 高 |
| [不情愿地] | 犹豫、不情愿的语气 | 高 |
| [冷静地] | 放松、适度的表达 | 高 |
| [大喊] | 响亮、有投射力的声音 | 中高 |
| [新闻广播] | 广播新闻风格 | 高 |
| [纪录片] | 自然纪录片旁白 | 高 |
| [对话式] | 随性、自然的表达 | 高 |
| 标签 | 效果 | 可靠性 |
|---|---|---|
| [慢慢地] | 较慢的语速 | 高 |
| [快点] | 较快的语速 | 高 |
| [暂停] | 继续前的短暂暂停 | 高 |
| [长暂停] | 延长的暂停 | 高 |
| [强调] | 强调下一个短语 | 中高 |
// 默认 — 无标签 嘿,你好,我是一个新的文本转语音模型。今天我能为你 提供什么帮助? // 兴奋 [excitedly] 嘿,你好,我是一个新的文本转语音模型! 今天我能为你提供什么帮助? // 厌倦 [bored] 嘿,你好,我是一个新的文本转语音模型... 今天我能为你提供什么帮助? // 讽刺并带停顿 [sighs] 嘿,你好... [pause] 我是一个新的文本转语音 模型。[pause] 今天我能为你提供什么帮助? // 低语并带笑声 [whispers] 嘿,你好... [laughing] 我是一个新的文本转 语音模型。今天我能为你提供什么帮助?
- 将标签用于局部动作,而非整体基调。 通过系统提示词设置整体基调。在特定时刻使用标签:例如在某处笑一下,在另一处低语。
- 不要过度使用标签。 短短一段话中标签过多会显得不自然。建议每段最多使用 1-2 个标签。
- 即使是非英语文本也请使用英语标签。 Google 建议使用英语标签,无论说的是哪种语言,这样效果最好。
- 发挥创意 — 标签没有详尽的列表。 模型会解释方括号中的自然语言。尝试使用 [playful]、[melancholy]、[urgently]、[with a grin] —— 模型会尽力表现。
- 先测试新标签。 你认为的风格修饰标签可能会被当作字面文本读出来。请务必在 AI Studio 游乐场中进行测试。
- 确保标签与提示词和文本一致。 如果风格提示词要求“忧伤且深思”,而使用了 [cheerful] 标签,则会产生矛盾的输出。
你是一名编剧和音频导演。 我有一个简单的背景信息,但没有脚本。 任务: 1. 根据给定的背景编写一个创意十足且引人入胜的脚本。 2. 将整个输出格式化为结构化的 TTS 提示词。 严格的输出格式: # 音频配置:[Name] ## "[Title]" ## 场景:[Scene Title] [生动的描述] ### 导演备注 风格:[Style] 语速:[Pace] 口音:[Accent]
- 描述要具体,不要笼统。 “说话像 20 世纪 40 年代的广播新闻播音员”比“用老式的方式说话”效果要好得多。
- 设定场景。 环境背景(“忙碌的机场”、“安静的工作室”、“清晨的咖啡店”)会引导模型对音效的诠释。
- 定义角色的情绪状态。 “Nova 既放松又自信”为模型的每一行对白设定了一个初始情绪基准。
- 包含副语言细节。 提及气息声、语速、停顿和嗓音质感。“略带气息,节奏适中且有自然停顿”比简单的“冷静”更具可操作性。
- 对相关内容使用相同的提示词。 如果你正在制作一系列播客节目,所有节目的系统提示词应该是相同的。
- 让 Gemini 协同导演。 如果你卡住了,给 Gemini 一个简单的背景,让它生成完整的结构化提示词。它在创意指导方面表现出色。
让 Speaker1 听起来疲惫而厌烦, 让 Speaker2 听起来兴奋而快乐: Speaker1:那么……今天的议程是什么? Speaker2:你绝对猜不到! // 结合语音配对以获得最佳效果: // Speaker1 → Enceladus(带气息,内省) // Speaker2 → Puck(活泼,精力充沛)
| 问题 | 影响 | 缓解 |
|---|---|---|
| 长输出中的质量漂移 | 几分钟后语音质量下降 | 将转录内容拆分为 2-3 分钟的片段。在后期制作中拼接音频。 |
| 文本标记返回(500 错误) | 随机 ~1-2% 的请求返回文本而不是音频 | 实施具有指数退避的自动重试逻辑。 |
| 语音与提示不匹配 | 音频与所选说话人配置文件不匹配 | 确保预设、语音和提示在语义上一致。 |
| 标签发音 | 某些标签被读作字面文本,而不是被解释 | 在生产使用前在 AI Studio 中测试新标签。 |
| 速率限制 | Gemini 2.5 Pro TTS:免费层级每天 100 个请求 | 大批量使用 Flash,优质内容使用 Pro。实施请求排队。 |
先在 AI Studio 中测试所有标签
在确定使用某套标签词汇之前,请在 Google AI Studio 游乐场中测试每个标签。验证模型是否正确理解了你的意图。
将长内容拆分为块
对于超过 3 分钟的内容,在自然断点(段落、场景转换、主题转换)处拆分脚本。分别生成每个块,然后将音频文件拼接在一起。
实施重试逻辑
Gemini TTS 偶尔会返回文本令牌而不是音频(导致 500 错误)。这在大约 1-2% 的请求中发生。在你的流水线中构建带有指数退避的自动重试机制。
验证语音与预设的一致性
为每个发言人验证所选语音是否自然匹配预设描述。深沉权威的声音配上“年轻、调皮”的预设会产生违和感。
缓存预设以保持一致性
将验证过的预设存储为配置。切勿为每次生成手动编写提示词,这会导致不一致。对同一发言人的所有内容使用相同的预设文件。
监控 SynthID 水印
所有 Gemini TTS 输出都带有 SynthID 水印(用于 AI 内容检测的不可见签名)。确保你的使用案例符合 AI 生成音频的披露要求。
| 模型 | 最适合 | 延迟 | 最大输出 | 价格层级 |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS | 日常应用,实时助手 | 低 | 10 分钟 | $ |
| Gemini 2.5 Flash TTS | 大批量旁白,对话式 | 低 | 10 分钟 | $ |
| Gemini 2.5 Pro TTS | 录音室质量旁白,有声书 | 中 | 25 分钟 | $$ |
| Gemini 2.5 Flash Lite | 成本敏感,高吞吐量 | 极低 | 5 分钟 | $ |
- 预设 → 定义谁、在何处以及如何(每个发言人可复用)
- 语音选择 → 将自然的语音特征与你的角色相匹配
- 内联标签 → 细粒度的、按句控制(谨慎使用,先测试)
- 系统提示词 → 设定整体基调、场景和表演风格
- 防护栏 → 拆分长内容、错误重试、验证一致性
跳过代码:如果您希望在 Google 文档中直接使用这些 Gemini 驱动的声音,而无需编写 API 集成,请尝试免费的 AI Narrator 插件 — 它为您处理整个语音生成流程。
- 2026 年最佳 AI 语音 API — 所有 TTS API 提供商的完整比较
- AI 语音克隆指南 — 通过分步说明克隆任何声音
- AI Narrator 对比 ElevenLabs — 质量和定价的直接比较
- 多语言 TTS 指南 — 生成 70 多种语言的语音
想亲自听到这些声音吗?
立即免费试用我们的人工智能讲述人。无需注册。