Try AI Narrator Free
Sign up free — no credit card required. Turn your documents into natural-sounding audio in minutes.
Sign Up FreeTry AI Narrator Free
Experience the voices mentioned in this article. Install the Google Docs add-on and generate audio from any document in seconds.
Browse All VoicesGemini TTS ベストプラクティス:一貫性のある表現力豊かな音声を毎回生成する
クイックまとめ: Gemini TTSモデル(2.5 Flash、2.5 Pro、3.1 Flash)は、従来のTTSとは根本的に異なります。これらは音声を生成する大規模言語モデルです。つまり、プロンプト、音声選択、インラインタグが出力品質に多大な影響を与えます。このガイドでは、一貫した音声生成の5つの柱について解説します:プリセット、音声選択、感情タグ、システムプロンプト、ガードレール。
スタイルプロンプト(システム指示)
全体的な感情のトーンと配信スタイルの主な原動力。セグメント全体コンテキストを設定します。テキストコンテンツ(トランスクリプト)
言葉そのものの意味。感情豊かなテキストは、ニュートラルなテキストよりもモデルにより多くの作業材料を与えます。インラインタグ(マークアップ)
スタイルプロンプトと連携して、特定のフレーズを局所的に制御するための [whispers] や [laughs] などの括弧付き修飾子。
1. オーディオプリセット — 一貫性の基盤
- 再現性:異なるトランスクリプトに同じプリセットを適用すると、同じセッションの同じ話者のように聞こえるオーディオが生成されます。
- マルチスピーカーワークフロー:エピソード全体で明確な声を維持するために、話者ごと(インタビュアー、ゲスト、ナレーター)にプリセットを定義します。
- プロンプトのドリフトの軽減:プリセットがない場合、モデルはテキストのみからスタイルを推測するため、長時間のプロジェクトでドリフトが発生します。
- より速い反復:プリセットの音が正しければ、毎回声を再発明するのではなく、トランスクリプトを調整するだけです。
- キャラクターに名前を付けます。名前(「Nova」、「Dr. Claire」、「Marcus」)でモデルの基盤を固めることで、パフォーマンスがまとまります。
- トーンだけでなく、アイデンティティを定義します。「ラジオDJ」や「ドキュメンタリーナレーター」は、モデルにアンカーとなるパフォーマンスのアーキタイプを与えます。
- 環境について具体的に指定します。「忙しい朝のコーヒーショップ」と「静かなスタジオ」では、異なる音響プロファイルが生成されます。
- ディレクターのメモを含めます。偶然に任せるのではなく、スタイル、ペース、アクセント、トーンに明示的に対処します。
- プリセットを簡潔に保ちます。焦点を絞ったプリセットは、モデルが一貫して従いやすくなります。
この音声を自分で聴いてみたいですか?
今すぐAI Narratorを無料でお試しください。登録は不要です。
| 音声名 | 性別 | 最適用途 | 特徴 |
|---|---|---|---|
| Kore | 女性 | 温かみのあるナレーション、ポッドキャスト | フレンドリー、温和、親しみやすい |
| Puck | 男性 | アップビートなコンテンツ、プロモ | エネルギッシュ、自信に満ちた |
| エンケラドゥス | 男性 | 落ち着いたナレーション、オーディオブック | 息をのむような、内省的な |
| アエデ | 女性 | プロフェッショナルなプレゼンテーション | クリア、洗練された |
| フェンリル | 男性 | ドラマチックなナレーション | パワフル、強烈 |
| オルス | 男性 | テクニカルなコンテンツ | 正確、慎重な |
- 声をプリセットのスタイルに合わせてください。疲れた内省的なキャラクターのプリセットである場合は、元気な声ではなく、エンケラドゥスのような息の混じった声を選んでください。
- プレイグラウンドで声テストを行ってください。決定する前に、各声がさまざまなプロンプトにどのように対応するかを聞いてください。
- 声とプロンプトの相乗効果を活用してください。低く威厳のある声と威厳のあるスタイルのプロンプトを組み合わせることで、効果がさらに高まります。
- 年齢やトーンが一致しないプロンプトは避けてください。低い声に幼い子供のような声を出させると、不気味な結果になります。
- キャラクターごとに声を1つに固定してください。複数の話し手がいるコンテンツでは、話し手ごとに1つの声を割り当て、プロジェクトの途中で変更しないでください。
音声選択のベストプラクティス
speakerを指定することもできます。これを複数話者ダイアログモードと組み合わせることで、ポッドキャストやインタビューでの自動話者ダイアライゼーションが可能になります。| タグ | エフェクト | 信頼性 |
|---|---|---|
| [ため息] | ため息の効果音を挿入します | 高 |
| [笑い] | 笑い声を挿入します | 高 |
| [えーと] | ためらいを挿入します | 高 |
| [ため息] | 息をのむ音を挿入します | 高 |
| [咳] | 咳払いの音を挿入します | 中 |
| タグ | エフェクト | 信頼性 |
|---|---|---|
| [ささやき] | ささやき声の配信 | 高 |
| [興奮して] | 興奮した、エネルギッシュなトーン | 高 |
| [退屈そうに] | 平坦で、関心のなさそうな配信 | 高 |
| [落ち着いて] | リラックスした、落ち着いた配信 | 高 |
| [ゆっくり] | より遅いペース | 高 |
| [素早く] | より速いペース | 高 |
| [ポーズ] | 続ける前の短い一時停止 | 高 |
モード 2: スタイル修飾子
- 全体のトーンではなく、特定の局所的な瞬間にタグを使用します。システムプロンプトで全体のトーンを設定し、ここでの笑い、あそこでのささやきにはタグを使用します。
- タグの使いすぎに注意してください。短い文章にタグが多すぎると、不自然に聞こえます。段落ごとに1つか2つを目指してください。
- プロンプトとテキストに合わせてタグを調整してください。プロンプトで暗いと説明されているシーンでの [cheerful] タグは、出力と競合します。
- 新しいタグは最初にテストしてください。スタイル修飾子になることが期待されるタグが、そのままのテキストとして読み上げられる可能性があります。本番環境で使用する前に、プレイグラウンドでテストしてください。
あなたは脚本家兼オーディオディレクターです。 コンテキストはありますが、トランスクリプトはありません。 タスク: 1. コンテキストに基づいて魅力的なスクリプトを書く。 2. 出力を構造化されたTTSプロンプトとしてフォーマットする。 出力フォーマット: # オーディオプロファイル:[名前] ## 「[タイトル]」 ## シーン:[シーン] [説明] ### ディレクターのノート スタイル:[スタイル] ペース:[ペース] アクセント:[アクセント]
- 一般論ではなく、具体的に指定してください。「1940年代のラジオアナウンサーのように話す」は、「古風な話し方をする」よりも優れています。
- シーンを設定します。環境の文脈(賑やかな空港、静かなスタジオ)が音響の解釈を導きます。
- キャラクターの感情状態を定義します。「ノヴァはリラックスして自信に満ちている」という設定により、モデルにすべてのセリフの基準値が与えられます。
- 配信の詳細を含めます。 テンポ、ポーズ、声の質感を指定します。「落ち着いた」よりも「わずかに息が混じり、測定されたテンポ」の方が具体的で効果的です。
- シリーズ全体でプロンプトを統一します。 ポッドキャストの場合、エピソードごとに同じシステムプロンプトを使用します。
| 考慮事項 | 影響 | 軽減策 |
|---|---|---|
| 長い出力 | 非常に長い単一の生成では品質がドリフトする可能性があります | 自然な区切りポイントでトランスクリプトを分割し、ポストプロダクションで音声を結合します |
| プロンプトと声の不一致 | 意図した話し手と音声が一致しない場合があります | プリセット、音声、プロンプトを一致させておきます |
| 発声のタグ付け | 一部のタグは文字通りのテキストとして読み上げられる場合があります | 本番前にプレイグラウンドでタグをテストします |
| レート制限とクォータ | 大量利用時のAPIスロットリング | 適切なモデルティアを使用し、リクエストをキューに入れます |
- プリセット — 誰が、どこで、どのように(話者ごとに再利用可能)を定義します
- 音声選択 — キャラクターに声の特性を合わせます
- インラインタグ — 細やかな、フレーズごとの制御(控えめに使用し、最初にテストしてください)
- システムプロンプト — 全体のトーン、シーン、パフォーマンススタイルを設定します
- ガードレール — 長いコンテンツの分割、タグのテスト、プロンプトへの音声の調整を行います
システムプロンプトのベストプラクティス
- 2026年のベストAI音声API — すべてのTTS APIプロバイダーの完全な比較
- AI音声クローンガイド — ステップバイステップの手順であらゆる音声をクローン
- AI Narrator vs ElevenLabs — 品質と価格の直接比較
Disclosure
Some of the tools compared on this site — including AI Narrator — are our own products. We review them on the same footing as competitors, on current pricing and hands-on testing, and always tell you when a product is ours.