Gemini TTS 最佳实践:每次都能生成一致且富有表现力的音频

快速总结: Gemini TTS 模型(2.5 Flash、2.5 Pro 和 3.1 Flash)与传统的 TTS 从根本上不同 —— 它们是生成音频的大型语言模型。这意味着你的提示、语音选择和内联标签对输出质量有巨大的影响。本指南涵盖了实现一致音频生成的五大支柱:预设、语音选择、情感标签、系统提示和护栏

Google 的 Gemini TTS 模型重新定义了 AI 语音合成的可能性。与仅仅朗读文本的传统文字转语音引擎不同,Gemini TTS 模型建立在为 Gemini 提供支持的相同大型语言模型架构之上 —— 它们了解 什么、 在说以及它应该 听起来 怎么样。
但这股力量伴随着复杂性。如果你得到的结果不一致 —— 有时很棒,有时很平淡 —— 本指南将告诉你原因,以及确切的解决方法。
语音控制的三大杠杆
在深入了解每项最佳实践之前,请了解 Gemini TTS 在三个相互关联的杠杆上运行。所有三个必须保持一致,才能获得可预测的高质量输出:
  • 风格提示(系统说明)

    整体情绪基调和表达风格的主要驱动力。为整个语音段落设定上下文。
  • 文本内容(脚本)

    文字的语义含义。情感丰富、引人入胜的文本比中性文本产生的结果要可靠得多。
  • 内联标签(标记)

    方括号修饰符(如 [whispers] 或 [laughs]),用于对特定短语进行细粒度、本地化的控制。它们与风格提示协同工作。

核心原则: 为获得最大的可预测性,请确保您的风格提示、文本内容和内联标签在语义上保持一致,并朝着同一个情感目标努力。一个带有中性会议安排文本的恐惧提示会产生模棱两可的结果。

1. 音频预设 — 您的的一致性基础
音频预设是可重用的配置块,定义了在说话、他们在哪里以及他们应该如何表演。将它们视为一个保存的“导演设置”,确保来自同一脚本的每次生成听起来都像来自同一录音会话。
Gemini TTS 预设剖析

# 音频配置文件:Nova ## “晨间主持人” ## 场景:直播广播工作室 [一个温暖、诱人的工作室,伴随着柔和的晨光。 Nova 轻松、自信且引人入胜 — 她 像朋友一样直接与听众交谈。] ### 导演笔记 风格:温暖、对话式、略带轻快 节奏:中等 — 不匆忙,不缓慢 口音:美式英语,中性 基调:友好且平易近人,就像在 喝咖啡时与亲密朋友交谈

为什么预设对一致性很重要
  • 可重现性: 应用于不同脚本的同一预设将产生听起来像同一会话中同一发言人的音频。
  • 多发言人工作流程: 为每个发言人(采访者、嘉宾、旁白)定义一个预设,并在剧集中保持独特的语音。
  • 减少提示偏差: 没有预设,模型仅根据文本推断风格 — 这会导致长期项目中的不一致。
  • 更快的迭代: 一旦您的预设听起来正确,您只需要调整文本,而不必每次都重新发明声音。
预设最佳实践
  • 给角色一个名字。 用名字(“Nova”、“Dr. Claire”、“Marcus”)来固定模型,可以将表演联系起来并减少游离。
  • 定义身份,而不仅仅是语调。 “电台 DJ”或“自然纪录片旁白”为模型提供了一个可以锚定的表演原型。
  • 具体说明环境。 “繁忙的清晨咖啡店”与“安静的工作室”会在输出中产生显着不同的声学特征。
  • 包括“导演笔记”。 风格、节奏、口音和语调都应明确说明 — 不要让它们听天由命。
  • 将预设控制在 200 字以内。 较长的预设可能会稀释模型的注意力。保持简洁但具体。
2. 语音选择 — 匹配语音与角色
Gemini TTS 提供 30 多种内置语音,涵盖多种语言。但并非所有语音都同样适用于所有内容。选择错误的语音可能会抵消您的预设并产生不自然的结果。
可用语音选项(Gemini TTS)
语音名称性别最适合特征
Kore女性温暖叙述,播客友好、温暖、易于亲近
Puck男性轻快内容,促销充满活力、自信
Enceladus男性平静叙述,有声书气声,内省
Charon男性权威内容深沉、威严
Aoede女性专业演示清晰、润色
Callirrhoe女性休闲对话轻快、自然
Orus男性技术内容精确、稳重
Fenrir男性戏剧性叙述有力、强烈
语音选择最佳实践
  • 匹配语音与预设风格。 如果您的预设描述了一个疲惫的角色,请选择带有自然气息的语音(如 Enceladus)。不要让明亮、轻快的语音去耳语 — 这会听起来很生硬。
  • 在 Google AI Studio 中测试 [语音库]。 游乐场让您在提交之前听到每个语音对不同提示的反应。
  • 利用语音 + 提示的协同作用。 深沉的男性声音 (Charon) 结合权威的风格提示会增强效果。语音和提示应该相互加强。
  • 避免不匹配的年龄/性别提示。 深沉的男性声音试图模仿年轻女孩的效果会产生诡异的结果。确保预设的书面语调自然适合该语音。
  • 每个角色锁定一个语音。 在多发言人内容中,为每个发言人分配一个语音,并且在项目期间永远不要更改它。一致性是关键。
  • 对于非英语内容: 在各种语言中使用相同的语音以保持一致的品牌形象。Gemini TTS 使用相同的语音选项处理 70 多种语言。

专家提示: 使用 Google Cloud TTS API (Vertex AI) 时,您还可以为每个语音指定 speaker。将其与多发言人对话模式结合使用,可在播客和采访中进行自动发言人区分。

3. 内联情感标签 — [方括号] 系统
Gemini TTS 支持内联标记标签 — 直接嵌入到脚本中的方括号注释,可修改特定短语的表达方式。这是实现细粒度控制的最强大功能。
标签的工作原理:三种模式
Google Cloud 的研究表明,方括号标签以三种不同的模式运行:
模式 1:非语音声音
标签被可听见的非语音发声替换。标签本身不会被读出。
标签效果可靠性
[sigh]插入叹息声
[laughing]插入笑声
[uhm]插入犹豫
[gasp]插入喘息声
[cough]插入咳嗽声
[sighs]插入叹息
模式 2:风格修饰符
标签改变随后文本的表达方式 — 语调、节奏、强调。
标签效果可靠性
[whispers]耳语式传递
[excitedly]兴奋、充满活力的语调
[bored]平淡、漫不经心的表达
[不情愿地]犹豫、不情愿的语气
[冷静地]放松、适度的表达
[大喊]响亮、有投射力的声音中高
[新闻广播]广播新闻风格
[纪录片]自然纪录片旁白
[对话式]随性、自然的表达
模式 3:语速与重音
控制播报速度和重音的标签。
标签效果可靠性
[慢慢地]较慢的语速
[快点]较快的语速
[暂停]继续前的短暂暂停
[长暂停]延长的暂停
[强调]强调下一个短语中高
实际标签示例
相同的句子,根据标签产生截然不同的播报效果:

// 默认 — 无标签 嘿,你好,我是一个新的文本转语音模型。今天我能为你 提供什么帮助? // 兴奋 [excitedly] 嘿,你好,我是一个新的文本转语音模型! 今天我能为你提供什么帮助? // 厌倦 [bored] 嘿,你好,我是一个新的文本转语音模型... 今天我能为你提供什么帮助? // 讽刺并带停顿 [sighs] 嘿,你好... [pause] 我是一个新的文本转语音 模型。[pause] 今天我能为你提供什么帮助? // 低语并带笑声 [whispers] 嘿,你好... [laughing] 我是一个新的文本转 语音模型。今天我能为你提供什么帮助?

标签最佳实践
  • 将标签用于局部动作,而非整体基调。 通过系统提示词设置整体基调。在特定时刻使用标签:例如在某处笑一下,在另一处低语。
  • 不要过度使用标签。 短短一段话中标签过多会显得不自然。建议每段最多使用 1-2 个标签。
  • 即使是非英语文本也请使用英语标签。 Google 建议使用英语标签,无论说的是哪种语言,这样效果最好。
  • 发挥创意 — 标签没有详尽的列表。 模型会解释方括号中的自然语言。尝试使用 [playful]、[melancholy]、[urgently]、[with a grin] —— 模型会尽力表现。
  • 先测试新标签。 你认为的风格修饰标签可能会被当作字面文本读出来。请务必在 AI Studio 游乐场中进行测试。
  • 确保标签与提示词和文本一致。 如果风格提示词要求“忧伤且深思”,而使用了 [cheerful] 标签,则会产生矛盾的输出。
4. 系统提示词 — 指导演出
系统提示词(也称为“风格提示词”)是保证整体一致性的最重要手段。它告诉模型在说话、他们在哪里,以及他们应该如何表达内容。
系统提示词结构

你是一名编剧和音频导演。 我有一个简单的背景信息,但没有脚本。 任务: 1. 根据给定的背景编写一个创意十足且引人入胜的脚本。 2. 将整个输出格式化为结构化的 TTS 提示词。 严格的输出格式: # 音频配置:[Name] ## "[Title]" ## 场景:[Scene Title] [生动的描述] ### 导演备注 风格:[Style] 语速:[Pace] 口音:[Accent]

系统提示词最佳实践
  • 描述要具体,不要笼统。 “说话像 20 世纪 40 年代的广播新闻播音员”比“用老式的方式说话”效果要好得多。
  • 设定场景。 环境背景(“忙碌的机场”、“安静的工作室”、“清晨的咖啡店”)会引导模型对音效的诠释。
  • 定义角色的情绪状态。 “Nova 既放松又自信”为模型的每一行对白设定了一个初始情绪基准。
  • 包含副语言细节。 提及气息声、语速、停顿和嗓音质感。“略带气息,节奏适中且有自然停顿”比简单的“冷静”更具可操作性。
  • 对相关内容使用相同的提示词。 如果你正在制作一系列播客节目,所有节目的系统提示词应该是相同的。
  • 让 Gemini 协同导演。 如果你卡住了,给 Gemini 一个简单的背景,让它生成完整的结构化提示词。它在创意指导方面表现出色。
多发言人系统提示词
对于对话,请定义每个发言人的性格,并使用模型内置的多发言人对话模式:

让 Speaker1 听起来疲惫而厌烦, 让 Speaker2 听起来兴奋而快乐: Speaker1:那么……今天的议程是什么? Speaker2:你绝对猜不到! // 结合语音配对以获得最佳效果: // Speaker1 → Enceladus(带气息,内省) // Speaker2 → Puck(活泼,精力充沛)

5. 防护栏 — 生产可靠性
Gemini TTS 模型功能强大,但存在一些已知限制,可能会在生产环境中引发问题。以下是围绕这些模型构建防护栏的方法。
已知问题与缓解措施
问题影响缓解
长输出中的质量漂移几分钟后语音质量下降将转录内容拆分为 2-3 分钟的片段。在后期制作中拼接音频。
文本标记返回(500 错误)随机 ~1-2% 的请求返回文本而不是音频实施具有指数退避的自动重试逻辑。
语音与提示不匹配音频与所选说话人配置文件不匹配确保预设、语音和提示在语义上一致。
标签发音某些标签被读作字面文本,而不是被解释在生产使用前在 AI Studio 中测试新标签。
速率限制Gemini 2.5 Pro TTS:免费层级每天 100 个请求大批量使用 Flash,优质内容使用 Pro。实施请求排队。
生产核对清单
  1. 先在 AI Studio 中测试所有标签

    在确定使用某套标签词汇之前,请在 Google AI Studio 游乐场中测试每个标签。验证模型是否正确理解了你的意图。

  2. 将长内容拆分为块

    对于超过 3 分钟的内容,在自然断点(段落、场景转换、主题转换)处拆分脚本。分别生成每个块,然后将音频文件拼接在一起。

  3. 实施重试逻辑

    Gemini TTS 偶尔会返回文本令牌而不是音频(导致 500 错误)。这在大约 1-2% 的请求中发生。在你的流水线中构建带有指数退避的自动重试机制。

  4. 验证语音与预设的一致性

    为每个发言人验证所选语音是否自然匹配预设描述。深沉权威的声音配上“年轻、调皮”的预设会产生违和感。

  5. 缓存预设以保持一致性

    将验证过的预设存储为配置。切勿为每次生成手动编写提示词,这会导致不一致。对同一发言人的所有内容使用相同的预设文件。

  6. 监控 SynthID 水印

    所有 Gemini TTS 输出都带有 SynthID 水印(用于 AI 内容检测的不可见签名)。确保你的使用案例符合 AI 生成音频的披露要求。

快速参考:Gemini TTS 模型
模型最适合延迟最大输出价格层级
Gemini 3.1 Flash TTS日常应用,实时助手10 分钟$
Gemini 2.5 Flash TTS大批量旁白,对话式10 分钟$
Gemini 2.5 Pro TTS录音室质量旁白,有声书25 分钟$$
Gemini 2.5 Flash Lite成本敏感,高吞吐量极低5 分钟$
总结
获得一致的 Gemini TTS 输出的关键是将其视为一场受导演指挥的表演,而不是一个文本阅读器。你就是导演。你的预设定义了演员阵容,你的系统提示词设定了场景,你的标签提供了舞台指导,而你的防护栏则确保演出在没有技术故障的情况下顺利进行。
  • 预设 → 定义谁、在何处以及如何(每个发言人可复用)
  • 语音选择 → 将自然的语音特征与你的角色相匹配
  • 内联标签 → 细粒度的、按句控制(谨慎使用,先测试)
  • 系统提示词 → 设定整体基调、场景和表演风格
  • 防护栏 → 拆分长内容、错误重试、验证一致性

跳过代码:如果您希望在 Google 文档中直接使用这些 Gemini 驱动的声音,而无需编写 API 集成,请尝试免费的 AI Narrator 插件 — 它为您处理整个语音生成流程。

相关指南

想亲自听到这些声音吗?

立即免费试用我们的人工智能讲述人。无需注册。

播放语音样本

准备好尝试 AI Narrator 了吗?

立即开始将您的 Google 文档转换为专业音频。永久免费!

添加到文档 - 免费