Gemini TTS सर्वोत्तम अभ्यास: हर बार सुसंगत, अभिव्यंजक ऑडियो उत्पन्न करें
त्वरित सारांश: Gemini TTS मॉडल (2.5 Flash, 2.5 Pro, और 3.1 Flash) पारंपरिक TTS से मौलिक रूप से भिन्न हैं — वे बड़े भाषा मॉडल हैं जो ऑडियो उत्पन्न करते हैं। इसका मतलब है कि आपके प्रॉम्प्ट, आवाज़ का चयन, और इनलाइन टैग का आउटपुट गुणवत्ता पर बहुत बड़ा प्रभाव पड़ता है। यह गाइड सुसंगत ऑडियो पीढ़ी के पांच स्तंभों को कवर करती है: प्रीसेट, आवाज़ चयन, इमोशन टैग, सिस्टम प्रॉम्प्ट, और गार्ड रेल।
स्टाइल प्रॉम्प्ट (सिस्टम निर्देश)
समग्र भावनात्मक टोन और डिलीवरी शैली का प्राथमिक चालक। पूरे भाषण खंड के लिए संदर्भ सेट करता है।टेक्स्ट सामग्री (ट्रांसक्रिप्ट)
शब्दों का अर्थगत अर्थ। भावनात्मक रूप से समृद्ध, विचारोत्तेजक टेक्स्ट तटस्थ टेक्स्ट की तुलना में कहीं अधिक विश्वसनीय परिणाम उत्पन्न करता है।इनलाइन टैग (मार्कअप)
विशिष्ट वाक्यांशों पर दानेदार, स्थानीय नियंत्रण के लिए [whispers] या [laughs] जैसे ब्रैकेटेड मॉडिफायर। वे स्टाइल प्रॉम्प्ट के साथ मिलकर काम करते हैं।
मुख्य सिद्धांत: अधिकतम पूर्वानुमान के लिए, सुनिश्चित करें कि आपका स्टाइल प्रॉम्प्ट, टेक्स्ट सामग्री और इनलाइन टैग सभी अर्थपूर्ण रूप से सुसंगत हैं और एक ही भावनात्मक लक्ष्य की दिशा में काम कर रहे हैं। तटस्थ मीटिंग-शेड्यूल टेक्स्ट के साथ एक डरा हुआ प्रॉम्प्ट अस्पष्ट परिणाम उत्पन्न करेगा।
# ऑडियो प्रोफ़ाइल: नोवा ## "द मॉर्निंग होस्ट" ## दृश्य: लाइव रेडियो प्रसारण स्टूडियो [एक गर्म, आमंत्रित स्टूडियो सुबह की हल्की रोशनी के साथ। नोवा रिलैक्स्ड, आत्मविश्वासी और आकर्षक है — वह सीधे श्रोता से एक दोस्त की तरह बात करती है।] ### निर्देशक के नोट्स शैली: गर्म, संवादात्मक, थोड़ी उत्साही गति: मध्यम — न जल्दबाजी में, न धीमी लहज़ा: अमेरिकी अंग्रेजी, तटस्थ टोन: मैत्रीपूर्ण और मिलनसार, जैसे कॉफी पर एक करीबी दोस्त से बात करना
- प्रतिकृति: विभिन्न ट्रांसक्रिप्ट पर लागू एक ही प्रीसेट ऐसा ऑडियो उत्पन्न करेगा जो एक ही सत्र में एक ही वक्ता की तरह लगता है।
- मल्टी-स्पीकर वर्कफ़्लो: प्रत्येक वक्ता (साक्षात्कारकर्ता, अतिथि, कथावाचक) के लिए एक प्रीसेट परिभाषित करें और एपिसोड में अलग-अलग आवाजें बनाए रखें।
- कम प्रॉम्प्ट ड्रिफ्ट: प्रीसेट के बिना, मॉडल केवल टेक्स्ट से शैली का अनुमान लगाता है — जो लंबी परियोजनाओं में असंगति की ओर ले जाता है।
- तेज़ पुनरावृत्ति: एक बार जब आपका प्रीसेट सही लगने लगे, तो आपको केवल ट्रांसक्रिप्ट को समायोजित करने की आवश्यकता होती है, हर बार आवाज को फिर से बनाने की नहीं।
- पात्र को एक नाम दें। मॉडल को एक नाम ("नोवा", "डॉ. क्लेयर", "मार्कस") के साथ ग्राउंड करना प्रदर्शन को एक साथ बांधता है और भटकने को कम करता है।
- पहचान परिभाषित करें, केवल टोन नहीं। "रेडियो डीजे" या "प्रकृति वृत्तचित्र कथावाचक" मॉडल को लंगर डालने के लिए एक प्रदर्शन पुरातन रूप देता है।
- वातावरण के बारे में विशिष्ट रहें। "व्यस्त सुबह की कॉफी शॉप" बनाम "शांत स्टूडियो" आउटपुट में सार्थक रूप से अलग ध्वनिक प्रोफाइल उत्पन्न करता है।
- "निर्देशक के नोट्स" शामिल करें। शैली, गति, लहज़ा और टोन को स्पष्ट रूप से संबोधित किया जाना चाहिए — उन्हें संयोग पर न छोड़ें।
- प्रीसेट को 200 शब्दों से कम रखें। लंबे प्रीसेट मॉडल के फोकस को कम करने का जोखिम उठाते हैं। संक्षिप्त लेकिन विशिष्ट बनें।
| ध्वनि का नाम | लिंग | सबसे अच्छा | विशेषताएं |
|---|---|---|---|
| Kore | महिला | वार्म नरेशन, पॉडकास्ट | मैत्रीपूर्ण, गर्म, मिलनसार |
| Puck | पुरुष | अपबीट कंटेंट, प्रोमो | ऊर्जावान, आत्मविश्वासपूर्ण |
| Enceladus | पुरुष | शांत नरेशन, ऑडियोबुक्स | सांस लेने योग्य, आत्मनिरीक्षण |
| Charon | पुरुष | आधिकारिक सामग्री | गहरा, प्रभावशाली |
| Aoede | महिला | पेशेवर प्रस्तुतियाँ | स्पष्ट, पॉलिश |
| Callirrhoe | महिला | अनौपचारिक बातचीत | हल्का, प्राकृतिक |
| Orus | पुरुष | तकनीकी सामग्री | सटीक, मापा |
| Fenrir | पुरुष | नाटकीय नरेशन | शक्तिशाली, तीव्र |
- प्रीसेट शैली के साथ आवाज का मिलान करें। यदि आपका प्रीसेट एक थके हुए चरित्र का वर्णन करता है, तो प्राकृतिक सांस लेने वाली आवाज (जैसे एनसेलाडस) चुनें। एक उज्ज्वल, उत्साही आवाज को फुसफुसाने के लिए न कहें — यह मजबूर लगेगा।
- Google AI Studio में [Voice Library] का परीक्षण करें। प्लेग्राउंड आपको यह सुनने देता है कि प्रत्येक आवाज प्रतिबद्ध होने से पहले विभिन्न प्रॉम्प्टों पर कैसे प्रतिक्रिया करती है।
- आवाज + प्रॉम्प्ट तालमेल का उपयोग करें। एक आधिकारिक शैली प्रॉम्प्ट के साथ संयुक्त एक गहरी पुरुष आवाज (चारोन) प्रभाव को बढ़ाती है। आवाज और प्रॉम्प्ट को एक दूसरे को सुदृढ़ करना चाहिए।
- बेमेल उम्र/लिंग प्रॉम्प्ट से बचें। एक युवा लड़की की तरह लगने की कोशिश कर रही एक गहरी पुरुष आवाज अजीब परिणाम उत्पन्न करती है। सुनिश्चित करें कि आपके प्रीसेट का लिखित टोन स्वाभाविक रूप से आवाज के अनुकूल हो।
- प्रति चरित्र एक आवाज लॉक करें। मल्टी-स्पीकर सामग्री में, प्रति वक्ता एक आवाज निर्दिष्ट करें और इसे प्रोजेक्ट के बीच में कभी न बदलें। स्थिरता महत्वपूर्ण है।
- गैर-अंग्रेजी सामग्री के लिए: सुसंगत ब्रांड पहचान के लिए भाषाओं में एक ही आवाज का उपयोग करें। Gemini TTS समान वॉयस विकल्पों के साथ 70+ भाषाओं को संभालता है।
प्रो टिप: Google Cloud TTS API (Vertex AI) का उपयोग करते समय, आप प्रति वॉयस speaker भी निर्दिष्ट कर सकते हैं। पॉडकास्ट और साक्षात्कार में स्वचालित वक्ता डायराइजेशन के लिए इसे मल्टी-स्पीकर संवाद मोड के साथ मिलाएं।
| टैग | प्रभाव | विश्वसनीयता |
|---|---|---|
| [sigh] | एक आह की ध्वनि डालता है | उच्च |
| [laughing] | एक हंसी डालता है | उच्च |
| [uhm] | एक हिचकिचाहट डालता है | उच्च |
| [gasp] | एक हांफने की ध्वनि डालता है | उच्च |
| [cough] | खांसने की ध्वनि डालता है | मध्यम |
| [sighs] | एक आह डालता है | उच्च |
| टैग | प्रभाव | विश्वसनीयता |
|---|---|---|
| [whispers] | फुसफुसाकर डिलीवरी | उच्च |
| [excitedly] | उत्साहित, ऊर्जावान स्वर | उच्च |
| [bored] | सपाट, उदासीन प्रस्तुति | उच्च |
| [अनिच्छा से] | हिचकिचाहट भरा, अनिच्छुक स्वर | उच्च |
| [शांत भाव से] | तनावमुक्त, संतुलित प्रस्तुति | उच्च |
| [चिल्लाते हुए] | ऊंची, स्पष्ट आवाज | मध्यम-उच्च |
| [न्यूज़कास्ट] | ब्रॉडकास्ट पत्रकारिता शैली | उच्च |
| [डॉक्यूमेंट्री] | नेचर डॉक्यूमेंट्री नैरेटर | उच्च |
| [संवादात्मक] | अनौपचारिक, स्वाभाविक प्रस्तुति | उच्च |
| टैग | प्रभाव | विश्वसनीयता |
|---|---|---|
| [धीरे-धीरे] | धीमी गति | उच्च |
| [तेजी से] | तेज गति | उच्च |
| [विराम] | आगे बढ़ने से पहले संक्षिप्त विराम | उच्च |
| [लंबा विराम] | विस्तारित विराम | उच्च |
| [जोर] | अगले वाक्यांश पर जोर | मध्यम-उच्च |
// डिफ़ॉल्ट — कोई टैग नहीं नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। मैं आज आपकी कैसे मदद कर सकता हूं? // उत्साहित [excitedly] नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं! मैं आज आपकी कैसे मदद कर सकता हूं? // ऊब गया [bored] नमस्ते, मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं... मैं आज आपकी कैसे मदद कर सकता हूं? // विराम के साथ व्यंग्यात्मक [sighs] नमस्ते... [pause] मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। [pause] मैं आज आपकी कैसे मदद कर सकता हूं? // हंसी के साथ फुसफुसाहट [whispers] नमस्ते... [laughing] मैं एक नया टेक्स्ट टू स्पीच मॉडल हूं। मैं आज आपकी कैसे मदद कर सकता हूं?
- स्थानीयकृत क्रियाओं के लिए टैग का उपयोग करें, समग्र टोन के लिए नहीं। अपने सिस्टम प्रॉम्प्ट के साथ समग्र टोन सेट करें। विशिष्ट क्षणों के लिए टैग का उपयोग करें: एक बिंदु पर हंसी, दूसरे पर फुसफुसाहट।
- टैग का अत्यधिक उपयोग न करें। एक छोटे से अंश में बहुत अधिक टैग अप्राकृतिक लग सकते हैं। प्रति पैराग्राफ अधिकतम 1-2 टैग का उपयोग करें।
- गैर-अंग्रेजी प्रतिलेखों के लिए भी अंग्रेजी टैग का उपयोग करें। Google बोले जाने वाली भाषा की परवाह किए बिना सर्वोत्तम परिणामों के लिए अंग्रेजी टैग की अनुशंसा करता है।
- रचनात्मक बनें — कोई विस्तृत सूची नहीं है। मॉडल कोष्ठक में प्राकृतिक भाषा की व्याख्या करता है। [playful], [melancholy], [urgently], [with a grin] आज़माएँ — मॉडल अपना सर्वश्रेष्ठ प्रयास करता है।
- पहले नए टैग का परीक्षण करें। एक टैग जिसे आप शैली संशोधक मानते हैं, उसे शाब्दिक पाठ के रूप में उच्चारित किया जा सकता है। हमेशा AI Studio खेल के मैदान (playground) में परीक्षण करें।
- टैग को प्रॉम्प्ट और टेक्स्ट के साथ संरेखित करें। ऐसे संदर्भ में [cheerful] टैग जहां शैली प्रॉम्प्ट "उदास और चिंतनशील" कहता है, परस्पर विरोधी आउटपुट उत्पन्न करेगा।
आप एक पटकथा लेखक और ऑडियो निर्देशक हैं। मेरे पास एक सरल संदर्भ है लेकिन कोई प्रतिलेख (TRANSCRIPT) नहीं है। कार्य: 1. दिए गए संदर्भ के आधार पर एक रचनात्मक, आकर्षक पटकथा लिखें। 2. संपूर्ण आउटपुट को एक संरचित TTS प्रॉम्प्ट के रूप में प्रारूपित करें। सख्त आउटपुट प्रारूप: # ऑडियो प्रोफ़ाइल: [Name] ## "[Title]" ## दृश्य: [Scene Title] [विस्तृत विवरण] ### निर्देशक के नोट्स शैली: [Style] गति: [Pace] लहजा (Accent): [Accent]
- विशिष्ट बनें, सामान्य नहीं। "1940 के दशक के रेडियो समाचार उद्घोषक की तरह बोलें" के परिणाम "पुराने ढंग से बोलें" की तुलना में कहीं बेहतर होते हैं।
- दृश्य सेट करें। पर्यावरण संदर्भ ("व्यस्त हवाई अड्डा", "शांत स्टूडियो", "सुबह की कॉफी शॉप") मॉडल की ध्वनिक व्याख्या का मार्गदर्शन करता है।
- पात्र की भावनात्मक स्थिति को परिभाषित करें। "नोवा शांत और आत्मविश्वासी है" मॉडल को हर पंक्ति के लिए एक प्रारंभिक भावनात्मक आधार रेखा प्रदान करता है।
- पैरालिंग्विस्टिक विवरण शामिल करें। सांस लेने की गति, पेसिंग, विराम और मुखर बनावट का उल्लेख करें। "हल्की सांसों के साथ, प्राकृतिक विराम के साथ मापी गई गति" केवल "शांत" की तुलना में अधिक क्रियाशील है।
- संबंधित सामग्री के लिए एक ही प्रॉम्प्ट का उपयोग करें। यदि आप पॉडकास्ट एपिसोड की एक श्रृंखला बना रहे हैं, तो सिस्टम प्रॉम्प्ट उन सभी में समान होना चाहिए।
- Gemini को सह-निर्देशन करने दें। यदि आप फंस गए हैं, तो Gemini को एक सरल संदर्भ दें और उसे पूर्ण संरचित प्रॉम्प्ट जेनरेट करने के लिए कहें। यह रचनात्मक निर्देशन में उत्कृष्ट है।
Speaker1 को थका हुआ और ऊब गया हुआ सुनाएं, और Speaker2 को उत्साहित और खुश सुनाएं: Speaker1: तो... आज के एजेंडे में क्या है? Speaker2: आप कभी अंदाजा नहीं लगा पाएंगे! // सर्वोत्तम परिणामों के लिए वॉयस पेयरिंग के साथ संयोजन करें: // Speaker1 → Enceladus (सांसों भरा, आत्मनिरीक्षण) // Speaker2 → Puck (उत्साही, ऊर्जावान)
| समस्या | प्रभाव | शमन |
|---|---|---|
| लंबे आउटपुट में गुणवत्ता में गिरावट | कुछ मिनटों के बाद वाक् गुणवत्ता खराब हो जाती है | ट्रांसक्रिप्ट को 2-3 मिनट के हिस्सों में विभाजित करें। पोस्ट-प्रोडक्शन में ऑडियो जोड़ें। |
| टेक्स्ट टोकन रिटर्न (500 एरर) | अनुरोधों का लगभग 1-2% यादृच्छिक रूप से ऑडियो के बजाय टेक्स्ट देता है | एक्सपोनेंशियल बैकऑफ़ के साथ स्वचालित पुन: प्रयास तर्क लागू करें। |
| प्रॉम्प्ट के साथ वॉयस बेमेल | ऑडियो चयनित स्पीकर प्रोफ़ाइल से मेल नहीं खाता | सुनिश्चित करें कि प्रीसेट, वॉयस और प्रॉम्प्ट अर्थपूर्ण रूप से संरेखित हैं। |
| टैग वोकलाइज़ेशन | कुछ टैग को व्याख्या करने के बजाय शाब्दिक टेक्स्ट के रूप में बोला जाता है | प्रोडक्शन उपयोग से पहले AI स्टूडियो में नए टैग का परीक्षण करें। |
| रेट लिमिट्स | जेमिनी 2.5 प्रो टीटीएस: फ्री टियर पर 100 अनुरोध/दिन | उच्च-वॉल्यूम के लिए फ्लैश और प्रीमियम कंटेंट के लिए प्रो का उपयोग करें। अनुरोध कतार लागू करें। |
पहले AI Studio में सभी टैग का परीक्षण करें
टैग शब्दावली के लिए प्रतिबद्ध होने से पहले, Google AI Studio खेल के मैदान में प्रत्येक टैग का परीक्षण करें। सत्यापित करें कि मॉडल आपके इच्छित अर्थ की सही व्याख्या करता है।
लंबी सामग्री को टुकड़ों में बांटें
3 मिनट से अधिक लंबी सामग्री के लिए, अपने प्रतिलेख को प्राकृतिक विराम बिंदुओं (पैराग्राफ, दृश्य परिवर्तन, विषय परिवर्तन) पर विभाजित करें। प्रत्येक टुकड़े को अलग से उत्पन्न करें, फिर ऑडियो फ़ाइलों को एक साथ जोड़ें।
पुनर्प्रयास लॉजिक (retry logic) लागू करें
Gemini TTS कभी-कभी ऑडियो के बजाय टेक्स्ट टोकन लौटाता है (जिसके परिणामस्वरूप 500 त्रुटि होती है)। यह लगभग 1-2% अनुरोधों में होता है। अपनी पाइपलाइन में घातीय बैकऑफ़ के साथ स्वचालित पुनप्रयास बनाएं।
वॉइस-प्रीसेट एलाइनमेंट को मान्य करें
प्रत्येक वक्ता के लिए, सत्यापित करें कि चुनी गई आवाज़ स्वाभाविक रूप से प्रीसेट विवरण से मेल खाती है। "युवा, चंचल" प्रीसेट के साथ जोड़ी गई एक गहरी आधिकारिक आवाज अजीब परिणाम देती है।
निरंतरता के लिए प्रीसेट कैश करें
अपने मान्य प्रीसेट को कॉन्फ़िगरेशन के रूप में संग्रहीत करें। प्रत्येक पीढ़ी के लिए कभी भी हाथ से प्रॉम्प्ट न बनाएं — यह विसंगति पैदा करता है। एक ही वक्ता की सभी सामग्री के लिए एक ही प्रीसेट फ़ाइल का उपयोग करें।
SynthID वॉटरमार्क के लिए मॉनिटर करें
सभी Gemini TTS आउटपुट में SynthID वॉटरमार्क (AI सामग्री का पता लगाने के लिए अदृश्य हस्ताक्षर) होता है। सुनिश्चित करें कि आपका उपयोग मामला AI-जनित ऑडियो के प्रकटीकरण आवश्यकताओं का अनुपालन करता है।
| मॉडल | सबसे अच्छा | विलंबता (लैटेंसी) | अधिकतम आउटपुट | मूल्य स्तर |
|---|---|---|---|---|
| जेमिनी 3.1 फ्लैश टीटीएस | रोजमर्रा के ऐप्स, रीयल-टाइम असिस्टेंट | निम्न | 10 मिनट | $ |
| जेमिनी 2.5 फ्लैश टीटीएस | उच्च-वॉल्यूम वर्णन, संवादात्मक | निम्न | 10 मिनट | $ |
| जेमिनी 2.5 प्रो टीटीएस | स्टूडियो-गुणवत्ता वर्णन, ऑडियोबुक | मध्यम | 25 मिनट | $$ |
| जेमिनी 2.5 फ्लैश लाइट | लागत-संवेदनशील, उच्च-थ्रूपुट | बहुत कम | 5 मिनट | $ |
- प्रीसेट्स → कौन, कहाँ और कैसे परिभाषित करें (प्रति वक्ता पुन: प्रयोज्य)
- आवाज चयन → अपने पात्र के साथ प्राकृतिक आवाज विशेषताओं का मिलान करें
- इनलाइन टैग → दानेदार, प्रति-वाक्यांश नियंत्रण (किफायत से उपयोग करें, पहले परीक्षण करें)
- सिस्टम प्रॉम्प्ट → समग्र टोन, दृश्य और प्रदर्शन शैली सेट करें
- गार्ड रेल्स → लंबी सामग्री को विभाजित करें, त्रुटियों पर पुन: प्रयास करें, संरेखण को मान्य करें
कोड छोड़ें: यदि आप बिना किसी API एकीकरण के सीधे अपने Google डॉक्स में इन जेमिनी-पावर्ड आवाज़ों को चाहते हैं, तो मुफ्त AI नैरेटर ऐड-ऑन आज़माएं — यह आपके लिए पूरी वॉयस जनरेशन पाइपलाइन को संभालता है।
- 2026 में सर्वश्रेष्ठ AI वॉयस API — प्रत्येक TTS API प्रदाता की पूर्ण तुलना
- AI वॉयस क्लोनिंग गाइड — चरण-दर-चरण निर्देशों के साथ किसी भी आवाज़ को क्लोन करें
- AI नैरेटर बनाम इलेवनलैब्स — गुणवत्ता और मूल्य निर्धारण की आमने-सामने तुलना
- बहुभाषी TTS गाइड — 70+ भाषाओं में भाषण उत्पन्न करें
क्या आप स्वयं ये आवाजें सुनना चाहते हैं?
अभी हमारे AI नैरेटर को निःशुल्क आज़माएँ। कोई साइन-अप आवश्यक नहीं है.
AI Narrator को आज़माने के लिए तैयार हैं?
आज से अपने Google Docs को पेशेवर ऑडियो में बदलना शुरू करें। हमेशा के लिए मुफ्त!
Doc में जोड़ें - यह मुफ़्त है