Gemini TTS सर्वोत्तम अभ्यास: हर बार सुसंगत, अभिव्यंजक ऑडियो उत्पन्न करें

त्वरित सारांश: Gemini TTS मॉडल (2.5 Flash, 2.5 Pro, और 3.1 Flash) पारंपरिक TTS से मौलिक रूप से भिन्न हैं — वे बड़े भाषा मॉडल हैं जो ऑडियो उत्पन्न करते हैं। इसका मतलब है कि आपके प्रॉम्प्ट, आवाज़ का चयन, और इनलाइन टैग का आउटपुट गुणवत्ता पर बहुत बड़ा प्रभाव पड़ता है। यह गाइड सुसंगत ऑडियो पीढ़ी के पांच स्तंभों को कवर करती है: प्रीसेट, आवाज़ चयन, इमोशन टैग, सिस्टम प्रॉम्प्ट, और गार्ड रेल

Google के Gemini TTS मॉडलों ने AI स्पीच सिंथेसिस के साथ जो संभव है उसे फिर से परिभाषित किया है। पारंपरिक टेक्स्ट-टू-स्पीच इंजनों के विपरीत जो केवल टेक्स्ट को ज़ोर से पढ़ते हैं, Gemini TTS मॉडल उसी बड़े भाषा मॉडल आर्किटेक्चर पर बने हैं जो Gemini को शक्ति प्रदान करते हैं — वे समझते हैं कि क्या कहना है, कौन कह रहा है, और यह कैसा सुनाई देना चाहिए।
लेकिन यह शक्ति जटिलता के साथ आती है। यदि आपको असंगत परिणाम मिल रहे हैं — कभी-कभी शानदार, कभी-कभी सपाट — तो यह गाइड आपको दिखाएगी कि क्यों, और इसे ठीक करने का सटीक तरीका क्या है।
वाक् नियंत्रण के तीन लीवर
प्रत्येक सर्वोत्तम अभ्यास में गोता लगाने से पहले, समझें कि Gemini TTS तीन परस्पर जुड़े लीवर पर काम करता है। अनुमानित, उच्च-गुणवत्ता वाले आउटपुट के लिए तीनों को संरेखित किया जाना चाहिए:
  • स्टाइल प्रॉम्प्ट (सिस्टम निर्देश)

    समग्र भावनात्मक टोन और डिलीवरी शैली का प्राथमिक चालक। पूरे भाषण खंड के लिए संदर्भ सेट करता है।
  • टेक्स्ट सामग्री (ट्रांसक्रिप्ट)

    शब्दों का अर्थगत अर्थ। भावनात्मक रूप से समृद्ध, विचारोत्तेजक टेक्स्ट तटस्थ टेक्स्ट की तुलना में कहीं अधिक विश्वसनीय परिणाम उत्पन्न करता है।
  • इनलाइन टैग (मार्कअप)

    विशिष्ट वाक्यांशों पर दानेदार, स्थानीय नियंत्रण के लिए [whispers] या [laughs] जैसे ब्रैकेटेड मॉडिफायर। वे स्टाइल प्रॉम्प्ट के साथ मिलकर काम करते हैं।

मुख्य सिद्धांत: अधिकतम पूर्वानुमान के लिए, सुनिश्चित करें कि आपका स्टाइल प्रॉम्प्ट, टेक्स्ट सामग्री और इनलाइन टैग सभी अर्थपूर्ण रूप से सुसंगत हैं और एक ही भावनात्मक लक्ष्य की दिशा में काम कर रहे हैं। तटस्थ मीटिंग-शेड्यूल टेक्स्ट के साथ एक डरा हुआ प्रॉम्प्ट अस्पष्ट परिणाम उत्पन्न करेगा।

1. ऑडियो प्रीसेट — आपकी स्थिरता नींव
ऑडियो प्रीसेट पुन: प्रयोज्य कॉन्फ़िगरेशन ब्लॉक हैं जो परिभाषित करते हैं कि कौन बोल रहा है, वे कहाँ हैं, और उन्हें कैसा प्रदर्शन करना चाहिए। उन्हें एक सहेजे गए "निर्देशक के सेटअप" के रूप में सोचें जो यह सुनिश्चित करता है कि एक ही स्क्रिप्ट से प्रत्येक पीढ़ी ऐसी लगे जैसे वह एक ही रिकॉर्डिंग सत्र से आई हो।
Gemini TTS प्रीसेट की शारीरिक रचना

# ऑडियो प्रोफ़ाइल: नोवा ## "द मॉर्निंग होस्ट" ## दृश्य: लाइव रेडियो प्रसारण स्टूडियो [एक गर्म, आमंत्रित स्टूडियो सुबह की हल्की रोशनी के साथ। नोवा रिलैक्स्ड, आत्मविश्वासी और आकर्षक है — वह सीधे श्रोता से एक दोस्त की तरह बात करती है।] ### निर्देशक के नोट्स शैली: गर्म, संवादात्मक, थोड़ी उत्साही गति: मध्यम — न जल्दबाजी में, न धीमी लहज़ा: अमेरिकी अंग्रेजी, तटस्थ टोन: मैत्रीपूर्ण और मिलनसार, जैसे कॉफी पर एक करीबी दोस्त से बात करना

स्थिरता के लिए प्रीसेट क्यों मायने रखते हैं
  • प्रतिकृति: विभिन्न ट्रांसक्रिप्ट पर लागू एक ही प्रीसेट ऐसा ऑडियो उत्पन्न करेगा जो एक ही सत्र में एक ही वक्ता की तरह लगता है।
  • मल्टी-स्पीकर वर्कफ़्लो: प्रत्येक वक्ता (साक्षात्कारकर्ता, अतिथि, कथावाचक) के लिए एक प्रीसेट परिभाषित करें और एपिसोड में अलग-अलग आवाजें बनाए रखें।
  • कम प्रॉम्प्ट ड्रिफ्ट: प्रीसेट के बिना, मॉडल केवल टेक्स्ट से शैली का अनुमान लगाता है — जो लंबी परियोजनाओं में असंगति की ओर ले जाता है।
  • तेज़ पुनरावृत्ति: एक बार जब आपका प्रीसेट सही लगने लगे, तो आपको केवल ट्रांसक्रिप्ट को समायोजित करने की आवश्यकता होती है, हर बार आवाज को फिर से बनाने की नहीं।
प्रीसेट सर्वोत्तम अभ्यास
  • पात्र को एक नाम दें। मॉडल को एक नाम ("नोवा", "डॉ. क्लेयर", "मार्कस") के साथ ग्राउंड करना प्रदर्शन को एक साथ बांधता है और भटकने को कम करता है।
  • पहचान परिभाषित करें, केवल टोन नहीं। "रेडियो डीजे" या "प्रकृति वृत्तचित्र कथावाचक" मॉडल को लंगर डालने के लिए एक प्रदर्शन पुरातन रूप देता है।
  • वातावरण के बारे में विशिष्ट रहें। "व्यस्त सुबह की कॉफी शॉप" बनाम "शांत स्टूडियो" आउटपुट में सार्थक रूप से अलग ध्वनिक प्रोफाइल उत्पन्न करता है।
  • "निर्देशक के नोट्स" शामिल करें। शैली, गति, लहज़ा और टोन को स्पष्ट रूप से संबोधित किया जाना चाहिए — उन्हें संयोग पर न छोड़ें।
  • प्रीसेट को 200 शब्दों से कम रखें। लंबे प्रीसेट मॉडल के फोकस को कम करने का जोखिम उठाते हैं। संक्षिप्त लेकिन विशिष्ट बनें।
2. वॉयस चयन — चरित्र के साथ आवाज का मिलान
Gemini TTS कई भाषाओं में 30+ इन-बिल्ट आवाज़ें प्रदान करता है। लेकिन सभी आवाज़ें सभी सामग्री के लिए समान रूप से अच्छा काम नहीं करती हैं। गलत आवाज चुनने से आपके प्रीसेट के खिलाफ लड़ाई हो सकती है और अप्राकृतिक परिणाम उत्पन्न हो सकते हैं।
उपलब्ध वॉयस विकल्प (Gemini TTS)
ध्वनि का नामलिंगसबसे अच्छाविशेषताएं
Koreमहिलावार्म नरेशन, पॉडकास्टमैत्रीपूर्ण, गर्म, मिलनसार
Puckपुरुषअपबीट कंटेंट, प्रोमोऊर्जावान, आत्मविश्वासपूर्ण
Enceladusपुरुषशांत नरेशन, ऑडियोबुक्ससांस लेने योग्य, आत्मनिरीक्षण
Charonपुरुषआधिकारिक सामग्रीगहरा, प्रभावशाली
Aoedeमहिलापेशेवर प्रस्तुतियाँस्पष्ट, पॉलिश
Callirrhoeमहिलाअनौपचारिक बातचीतहल्का, प्राकृतिक
Orusपुरुषतकनीकी सामग्रीसटीक, मापा
Fenrirपुरुषनाटकीय नरेशनशक्तिशाली, तीव्र
वॉयस चयन सर्वोत्तम अभ्यास
  • प्रीसेट शैली के साथ आवाज का मिलान करें। यदि आपका प्रीसेट एक थके हुए चरित्र का वर्णन करता है, तो प्राकृतिक सांस लेने वाली आवाज (जैसे एनसेलाडस) चुनें। एक उज्ज्वल, उत्साही आवाज को फुसफुसाने के लिए न कहें — यह मजबूर लगेगा।
  • Google AI Studio में [Voice Library] का परीक्षण करें। प्लेग्राउंड आपको यह सुनने देता है कि प्रत्येक आवाज प्रतिबद्ध होने से पहले विभिन्न प्रॉम्प्टों पर कैसे प्रतिक्रिया करती है।
  • आवाज + प्रॉम्प्ट तालमेल का उपयोग करें। एक आधिकारिक शैली प्रॉम्प्ट के साथ संयुक्त एक गहरी पुरुष आवाज (चारोन) प्रभाव को बढ़ाती है। आवाज और प्रॉम्प्ट को एक दूसरे को सुदृढ़ करना चाहिए।
  • बेमेल उम्र/लिंग प्रॉम्प्ट से बचें। एक युवा लड़की की तरह लगने की कोशिश कर रही एक गहरी पुरुष आवाज अजीब परिणाम उत्पन्न करती है। सुनिश्चित करें कि आपके प्रीसेट का लिखित टोन स्वाभाविक रूप से आवाज के अनुकूल हो।
  • प्रति चरित्र एक आवाज लॉक करें। मल्टी-स्पीकर सामग्री में, प्रति वक्ता एक आवाज निर्दिष्ट करें और इसे प्रोजेक्ट के बीच में कभी न बदलें। स्थिरता महत्वपूर्ण है।
  • गैर-अंग्रेजी सामग्री के लिए: सुसंगत ब्रांड पहचान के लिए भाषाओं में एक ही आवाज का उपयोग करें। Gemini TTS समान वॉयस विकल्पों के साथ 70+ भाषाओं को संभालता है।

प्रो टिप: Google Cloud TTS API (Vertex AI) का उपयोग करते समय, आप प्रति वॉयस speaker भी निर्दिष्ट कर सकते हैं। पॉडकास्ट और साक्षात्कार में स्वचालित वक्ता डायराइजेशन के लिए इसे मल्टी-स्पीकर संवाद मोड के साथ मिलाएं।

3. इनलाइन इमोशन टैग — [Bracket] सिस्टम
Gemini TTS इनलाइन मार्कअप टैग का समर्थन करता है — आपके ट्रांसक्रिप्ट में सीधे एम्बेडेड ब्रैकेटेड एनोटेशन जो विशिष्ट वाक्यांशों की डिलीवरी को संशोधित करते हैं। दानेदार नियंत्रण के लिए यह सबसे शक्तिशाली एकल विशेषता है।
टैग कैसे काम करते हैं: तीन मोड
Google Cloud का शोध दिखाता है कि ब्रैकेटेड टैग तीन अलग-अलग मोड में काम करते हैं:
मोड 1: गैर-भाषण ध्वनियाँ
टैग को एक श्रव्य, गैर-भाषण मुखरता द्वारा प्रतिस्थापित किया जाता है। टैग स्वयं बोला नहीं जाता है।
टैगप्रभावविश्वसनीयता
[sigh]एक आह की ध्वनि डालता हैउच्च
[laughing]एक हंसी डालता हैउच्च
[uhm]एक हिचकिचाहट डालता हैउच्च
[gasp]एक हांफने की ध्वनि डालता हैउच्च
[cough]खांसने की ध्वनि डालता हैमध्यम
[sighs]एक आह डालता हैउच्च
मोड 2: शैली संशोधक
टैग बदलता है कि निम्नलिखित टेक्स्ट कैसे वितरित किया जाता है — टोन, गति, जोर।
टैगप्रभावविश्वसनीयता
[whispers]फुसफुसाकर डिलीवरीउच्च
[excitedly]उत्साहित, ऊर्जावान स्वरउच्च
[bored]सपाट, उदासीन प्रस्तुतिउच्च
[अनिच्छा से]हिचकिचाहट भरा, अनिच्छुक स्वरउच्च
[शांत भाव से]तनावमुक्त, संतुलित प्रस्तुतिउच्च
[चिल्लाते हुए]ऊंची, स्पष्ट आवाजमध्यम-उच्च
[न्यूज़कास्ट]ब्रॉडकास्ट पत्रकारिता शैलीउच्च
[डॉक्यूमेंट्री]नेचर डॉक्यूमेंट्री नैरेटरउच्च
[संवादात्मक]अनौपचारिक, स्वाभाविक प्रस्तुतिउच्च
मोड 3: पेसिंग और ज़ोर (Emphasis)
टैग जो वितरण की गति और ज़ोर को नियंत्रित करते हैं।
टैगप्रभावविश्वसनीयता
[धीरे-धीरे]धीमी गतिउच्च
[तेजी से]तेज गतिउच्च
[विराम]आगे बढ़ने से पहले संक्षिप्त विरामउच्च
[लंबा विराम]विस्तारित विरामउच्च
[जोर]अगले वाक्यांश पर जोरमध्यम-उच्च
वास्तविक दुनिया के टैग उदाहरण
वही वाक्य, टैग के आधार पर नाटकीय रूप से अलग वितरण:

// डिफ़ॉल्ट — कोई टैग नहीं नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। मैं आज आपकी कैसे मदद कर सकता हूं? // उत्साहित [excitedly] नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं! मैं आज आपकी कैसे मदद कर सकता हूं? // ऊब गया [bored] नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं... मैं आज आपकी कैसे मदद कर सकता हूं? // विराम के साथ व्यंग्यात्मक [sighs] नमस्ते... [pause] मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। [pause] मैं आज आपकी कैसे मदद कर सकता हूं? // हंसी के साथ फुसफुसाहट [whispers] नमस्ते... [laughing] मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। मैं आज आपकी कैसे मदद कर सकता हूं?

टैग के लिए सर्वोत्तम अभ्यास
  • स्थानीयकृत क्रियाओं के लिए टैग का उपयोग करें, समग्र टोन के लिए नहीं। अपने सिस्टम प्रॉम्प्ट के साथ समग्र टोन सेट करें। विशिष्ट क्षणों के लिए टैग का उपयोग करें: एक बिंदु पर हंसी, दूसरे पर फुसफुसाहट।
  • टैग का अत्यधिक उपयोग न करें। एक छोटे से अंश में बहुत अधिक टैग अप्राकृतिक लग सकते हैं। प्रति पैराग्राफ अधिकतम 1-2 टैग का उपयोग करें।
  • गैर-अंग्रेजी प्रतिलेखों के लिए भी अंग्रेजी टैग का उपयोग करें। Google बोले जाने वाली भाषा की परवाह किए बिना सर्वोत्तम परिणामों के लिए अंग्रेजी टैग की अनुशंसा करता है।
  • रचनात्मक बनें — कोई विस्तृत सूची नहीं है। मॉडल कोष्ठक में प्राकृतिक भाषा की व्याख्या करता है। [playful], [melancholy], [urgently], [with a grin] आज़माएँ — मॉडल अपना सर्वश्रेष्ठ प्रयास करता है।
  • पहले नए टैग का परीक्षण करें। एक टैग जिसे आप शैली संशोधक मानते हैं, उसे शाब्दिक पाठ के रूप में उच्चारित किया जा सकता है। हमेशा AI Studio खेल के मैदान (playground) में परीक्षण करें।
  • टैग को प्रॉम्प्ट और टेक्स्ट के साथ संरेखित करें। ऐसे संदर्भ में [cheerful] टैग जहां शैली प्रॉम्प्ट "उदास और चिंतनशील" कहता है, परस्पर विरोधी आउटपुट उत्पन्न करेगा।
4. सिस्टम प्रॉम्प्ट — प्रदर्शन का निर्देशन
सिस्टम प्रॉम्प्ट (जिसे "स्टाइल प्रॉम्प्ट" भी कहा जाता है) समग्र निरंतरता के लिए सबसे महत्वपूर्ण लीवर है। यह मॉडल को बताता है कि कौन बोल रहा है, वे कहां हैं, और उन्हें सामग्री को कैसे वितरित करना चाहिए।
सिस्टम प्रॉम्प्ट संरचना

आप एक पटकथा लेखक और ऑडियो निर्देशक हैं। मेरे पास एक सरल संदर्भ है लेकिन कोई प्रतिलेख (TRANSCRIPT) नहीं है। कार्य: 1. दिए गए संदर्भ के आधार पर एक रचनात्मक, आकर्षक पटकथा लिखें। 2. संपूर्ण आउटपुट को एक संरचित TTS प्रॉम्प्ट के रूप में प्रारूपित करें। सख्त आउटपुट प्रारूप: # ऑडियो प्रोफ़ाइल: [Name] ## "[Title]" ## दृश्य: [Scene Title] [विस्तृत विवरण] ### निर्देशक के नोट्स शैली: [Style] गति: [Pace] लहजा (Accent): [Accent]

सिस्टम प्रॉम्प्ट सर्वोत्तम अभ्यास
  • विशिष्ट बनें, सामान्य नहीं। "1940 के दशक के रेडियो समाचार उद्घोषक की तरह बोलें" के परिणाम "पुराने ढंग से बोलें" की तुलना में कहीं बेहतर होते हैं।
  • दृश्य सेट करें। पर्यावरण संदर्भ ("व्यस्त हवाई अड्डा", "शांत स्टूडियो", "सुबह की कॉफी शॉप") मॉडल की ध्वनिक व्याख्या का मार्गदर्शन करता है।
  • पात्र की भावनात्मक स्थिति को परिभाषित करें। "नोवा शांत और आत्मविश्वासी है" मॉडल को हर पंक्ति के लिए एक प्रारंभिक भावनात्मक आधार रेखा प्रदान करता है।
  • पैरालिंग्विस्टिक विवरण शामिल करें। सांस लेने की गति, पेसिंग, विराम और मुखर बनावट का उल्लेख करें। "हल्की सांसों के साथ, प्राकृतिक विराम के साथ मापी गई गति" केवल "शांत" की तुलना में अधिक क्रियाशील है।
  • संबंधित सामग्री के लिए एक ही प्रॉम्प्ट का उपयोग करें। यदि आप पॉडकास्ट एपिसोड की एक श्रृंखला बना रहे हैं, तो सिस्टम प्रॉम्प्ट उन सभी में समान होना चाहिए।
  • Gemini को सह-निर्देशन करने दें। यदि आप फंस गए हैं, तो Gemini को एक सरल संदर्भ दें और उसे पूर्ण संरचित प्रॉम्प्ट जेनरेट करने के लिए कहें। यह रचनात्मक निर्देशन में उत्कृष्ट है।
मल्टी-स्पीकर सिस्टम प्रॉम्प्ट
बातचीत के लिए, प्रत्येक वक्ता के व्यक्तित्व को परिभाषित करें और मॉडल के अंतर्निहित मल्टी-स्पीकर संवाद मोड का उपयोग करें:

Speaker1 को थका हुआ और ऊब गया हुआ सुनाएं, और Speaker2 को उत्साहित और खुश सुनाएं: Speaker1: तो... आज के एजेंडे में क्या है? Speaker2: आप कभी अंदाजा नहीं लगा पाएंगे! // सर्वोत्तम परिणामों के लिए वॉयस पेयरिंग के साथ संयोजन करें: // Speaker1 → Enceladus (सांसों भरा, आत्मनिरीक्षण) // Speaker2 → Puck (उत्साही, ऊर्जावान)

5. गार्ड रेल्स — उत्पादन विश्वसनीयता
Gemini TTS मॉडल शक्तिशाली हैं, लेकिन उनकी ज्ञात सीमाएँ हैं जो उत्पादन में समस्याएँ पैदा कर सकती हैं। उनके चारों ओर गार्ड रेल बनाने का तरीका यहाँ दिया गया है।
ज्ञात मुद्दे और शमन
समस्याप्रभावशमन
लंबे आउटपुट में गुणवत्ता में गिरावटकुछ मिनटों के बाद वाक् गुणवत्ता खराब हो जाती हैट्रांसक्रिप्ट को 2-3 मिनट के हिस्सों में विभाजित करें। पोस्ट-प्रोडक्शन में ऑडियो जोड़ें।
टेक्स्ट टोकन रिटर्न (500 एरर)अनुरोधों का लगभग 1-2% यादृच्छिक रूप से ऑडियो के बजाय टेक्स्ट देता हैएक्सपोनेंशियल बैकऑफ़ के साथ स्वचालित पुन: प्रयास तर्क लागू करें।
प्रॉम्प्ट के साथ वॉयस बेमेलऑडियो चयनित स्पीकर प्रोफ़ाइल से मेल नहीं खातासुनिश्चित करें कि प्रीसेट, वॉयस और प्रॉम्प्ट अर्थपूर्ण रूप से संरेखित हैं।
टैग वोकलाइज़ेशनकुछ टैग को व्याख्या करने के बजाय शाब्दिक टेक्स्ट के रूप में बोला जाता हैप्रोडक्शन उपयोग से पहले AI स्टूडियो में नए टैग का परीक्षण करें।
रेट लिमिट्सजेमिनी 2.5 प्रो टीटीएस: फ्री टियर पर 100 अनुरोध/दिनउच्च-वॉल्यूम के लिए फ्लैश और प्रीमियम कंटेंट के लिए प्रो का उपयोग करें। अनुरोध कतार लागू करें।
उत्पादन चेकलिस्ट
  1. पहले AI Studio में सभी टैग का परीक्षण करें

    टैग शब्दावली के लिए प्रतिबद्ध होने से पहले, Google AI Studio खेल के मैदान में प्रत्येक टैग का परीक्षण करें। सत्यापित करें कि मॉडल आपके इच्छित अर्थ की सही व्याख्या करता है।

  2. लंबी सामग्री को टुकड़ों में बांटें

    3 मिनट से अधिक लंबी सामग्री के लिए, अपने प्रतिलेख को प्राकृतिक विराम बिंदुओं (पैराग्राफ, दृश्य परिवर्तन, विषय परिवर्तन) पर विभाजित करें। प्रत्येक टुकड़े को अलग से उत्पन्न करें, फिर ऑडियो फ़ाइलों को एक साथ जोड़ें।

  3. पुनर्प्रयास लॉजिक (retry logic) लागू करें

    Gemini TTS कभी-कभी ऑडियो के बजाय टेक्स्ट टोकन लौटाता है (जिसके परिणामस्वरूप 500 त्रुटि होती है)। यह लगभग 1-2% अनुरोधों में होता है। अपनी पाइपलाइन में घातीय बैकऑफ़ के साथ स्वचालित पुनप्रयास बनाएं।

  4. वॉइस-प्रीसेट एलाइनमेंट को मान्य करें

    प्रत्येक वक्ता के लिए, सत्यापित करें कि चुनी गई आवाज़ स्वाभाविक रूप से प्रीसेट विवरण से मेल खाती है। "युवा, चंचल" प्रीसेट के साथ जोड़ी गई एक गहरी आधिकारिक आवाज अजीब परिणाम देती है।

  5. निरंतरता के लिए प्रीसेट कैश करें

    अपने मान्य प्रीसेट को कॉन्फ़िगरेशन के रूप में संग्रहीत करें। प्रत्येक पीढ़ी के लिए कभी भी हाथ से प्रॉम्प्ट न बनाएं — यह विसंगति पैदा करता है। एक ही वक्ता की सभी सामग्री के लिए एक ही प्रीसेट फ़ाइल का उपयोग करें।

  6. SynthID वॉटरमार्क के लिए मॉनिटर करें

    सभी Gemini TTS आउटपुट में SynthID वॉटरमार्क (AI सामग्री का पता लगाने के लिए अदृश्य हस्ताक्षर) होता है। सुनिश्चित करें कि आपका उपयोग मामला AI-जनित ऑडियो के प्रकटीकरण आवश्यकताओं का अनुपालन करता है।

त्वरित संदर्भ: Gemini TTS मॉडल
मॉडलसबसे अच्छाविलंबता (लैटेंसी)अधिकतम आउटपुटमूल्य स्तर
जेमिनी 3.1 फ्लैश टीटीएसरोजमर्रा के ऐप्स, रीयल-टाइम असिस्टेंटनिम्न10 मिनट$
जेमिनी 2.5 फ्लैश टीटीएसउच्च-वॉल्यूम वर्णन, संवादात्मकनिम्न10 मिनट$
जेमिनी 2.5 प्रो टीटीएसस्टूडियो-गुणवत्ता वर्णन, ऑडियोबुकमध्यम25 मिनट$$
जेमिनी 2.5 फ्लैश लाइटलागत-संवेदनशील, उच्च-थ्रूपुटबहुत कम5 मिनट$
सब कुछ एक साथ जोड़ना
निरंतर Gemini TTS आउटपुट की कुंजी इसे एक निर्देशित प्रदर्शन के रूप में मानना है, न कि टेक्स्ट रीडर के रूप में। आप निर्देशक हैं। आपके प्रीसेट कास्ट को परिभाषित करते हैं, आपका सिस्टम प्रॉम्प्ट दृश्य सेट करता है, आपके टैग मंच निर्देश प्रदान करते हैं, और आपके गार्ड रेल यह सुनिश्चित करते हैं कि शो तकनीकी बाधाओं के बिना चलता रहे।
  • प्रीसेट्स → कौन, कहाँ और कैसे परिभाषित करें (प्रति वक्ता पुन: प्रयोज्य)
  • आवाज चयन → अपने पात्र के साथ प्राकृतिक आवाज विशेषताओं का मिलान करें
  • इनलाइन टैग → दानेदार, प्रति-वाक्यांश नियंत्रण (किफायत से उपयोग करें, पहले परीक्षण करें)
  • सिस्टम प्रॉम्प्ट → समग्र टोन, दृश्य और प्रदर्शन शैली सेट करें
  • गार्ड रेल्स → लंबी सामग्री को विभाजित करें, त्रुटियों पर पुन: प्रयास करें, संरेखण को मान्य करें

कोड छोड़ें: यदि आप बिना किसी API एकीकरण के सीधे अपने Google डॉक्स में इन जेमिनी-पावर्ड आवाज़ों को चाहते हैं, तो मुफ्त AI नैरेटर ऐड-ऑन आज़माएं — यह आपके लिए पूरी वॉयस जनरेशन पाइपलाइन को संभालता है।

संबंधित गाइड

क्या आप स्वयं ये आवाजें सुनना चाहते हैं?

अभी हमारे AI नैरेटर को निःशुल्क आज़माएँ। कोई साइन-अप आवश्यक नहीं है.

आवाज के नमूने चलायें

AI Narrator को आज़माने के लिए तैयार हैं?

आज से अपने Google Docs को पेशेवर ऑडियो में बदलना शुरू करें। हमेशा के लिए मुफ्त!

Doc में जोड़ें - यह मुफ़्त है