জেমিনি টিটিএস বেস্ট প্র্যাকটিস: সবসময় সামঞ্জস্যপূর্ণ ও অভিব্যক্তিপূর্ণ অডিও তৈরি করুন
দ্রুত সারসংক্ষেপ: জেমিনি টিটিএস মডেল (২.৫ ফ্ল্যাশ, ২.৫ প্রো এবং ৩.১ ফ্ল্যাশ) প্রথাগত টিটিএস থেকে মৌলিকভাবে আলাদা — এগুলো হলো লার্জ ল্যাঙ্গুয়েজ মডেল যা অডিও তৈরি করে। এর মানে হলো আপনার প্রম্পট, ভয়েস সিলেকশন এবং ইনলাইন ট্যাগের আউটপুট কোয়ালিটির ওপর বিশাল প্রভাব রয়েছে। এই গাইডটি ধারাবাহিক অডিও তৈরির পাঁচটি স্তম্ভ কভার করে: প্রিসেট, ভয়েস সিলেকশন, ইমোশন ট্যাগ, সিস্টেম প্রম্পট এবং গার্ড রেইল।
স্টাইল প্রম্পট (সিস্টেম ইনস্ট্রাকশন)
সামগ্রিক মানসিক সুর এবং ডেলিভারি স্টাইলের প্রাথমিক চালক। সম্পূর্ণ স্পিচ সেগমেন্টের জন্য প্রসঙ্গ সেট করে।টেক্সট কন্টেন্ট (ট্রান্সক্রিপ্ট)
শব্দের অর্থগত তাৎপর্য। মানসিকভাবে সমৃদ্ধ, ভাবপূর্ণ টেক্সট নিরপেক্ষ টেক্সটের তুলনায় অনেক বেশি নির্ভরযোগ্য ফলাফল তৈরি করে।ইনলাইন ট্যাগ (মার্কআপ)
নির্দিষ্ট বাক্যাংশের উপর দানাদার, স্থানীয় নিয়ন্ত্রণের জন্য [whispers] বা [laughs]-এর মতো বন্ধনীযুক্ত মডিফায়ার। এগুলো স্টাইল প্রম্পটের সাথে সমন্বয় করে কাজ করে।
মূল নীতি: সর্বাধিক পূর্বাভাসের জন্য, নিশ্চিত করুন যে আপনার স্টাইল প্রম্পট, টেক্সট কন্টেন্ট এবং ইনলাইন ট্যাগগুলি সব অর্থগতভাবে সামঞ্জস্যপূর্ণ এবং একই মানসিক লক্ষ্যের দিকে কাজ করছে। নিরপেক্ষ মিটিং-শিডিউল টেক্সট সহ একটি ভীত প্রম্পট অস্পষ্ট ফলাফল তৈরি করবে।
# অডিও প্রোফাইল: নোভা ## "দ্য মর্নিং হোস্ট" ## দৃশ্য: লাইভ রেডিও ব্রডকাস্ট স্টুডিও [সকালের মৃদু আলোতে একটি উষ্ণ, আমন্ত্রিত স্টুডিও। নোভা রিল্যাক্সড, আত্মবিশ্বাসী এবং আকর্ষণীয় — সে বন্ধুর মতো সরাসরি শ্রোতার সাথে কথা বলে।] ### পরিচালকের নোট স্টাইল: উষ্ণ, কথোপকথনমূলক, কিছুটা প্রাণবন্ত গতি: মাঝারি — খুব দ্রুত নয়, ধীরও নয় উচ্চারণ: আমেরিকান ইংরেজি, নিরপেক্ষ সুর: বন্ধুত্বপূর্ণ এবং সহজবোধ্য, যেন কফির কাপে কাছের কোনো বন্ধুর সাথে কথা বলা
- প্রজননযোগ্যতা: বিভিন্ন ট্রান্সক্রিপ্টে প্রয়োগ করা একই প্রিসেট এমন অডিও তৈরি করবে যা একই সেশনে একই স্পিকারের মতো শোনায়।
- মাল্টি-স্পিকার ওয়ার্কফ্লো: প্রতি স্পিকারের জন্য একটি প্রিসেট নির্ধারণ করুন (সাক্ষাৎকার গ্রহণকারী, অতিথি, বর্ণনাকারী) এবং এপিসোড জুড়ে আলাদা কণ্ঠ বজায় রাখুন।
- কম প্রম্পট ড্রিফট: প্রিসেট ছাড়া, মডেল শুধুমাত্র টেক্সট থেকে স্টাইল অনুমান করে — যা দীর্ঘ প্রজেক্ট জুড়ে অসামঞ্জস্যতা তৈরি করে।
- দ্রুত পুনরাবৃত্তি: একবার আপনার প্রিসেট সঠিক মনে হলে, আপনাকে শুধুমাত্র ট্রান্সক্রিপ্ট সমন্বয় করতে হবে, প্রতিবার কণ্ঠ নতুন করে তৈরি করার প্রয়োজন নেই।
- চরিত্রের একটি নাম দিন। একটি নাম দিয়ে মডেলকে ভিত্তি প্রদান করা ("নোভা", "ডঃ ক্লেয়ার", "মার্কাস") পারফরম্যান্সকে একত্রিত করে এবং বিচ্যুতি কমায়।
- শুধুমাত্র সুর নয়, পরিচয় নির্ধারণ করুন। "রেডিও ডিজে" বা "প্রকৃতি ডকুমেন্টারি বর্ণনাকারী" মডেলকে একটি পারফরম্যান্স আর্কিটাইপ দেয় যা ধরে রাখার জন্য।
- পরিবেশ সম্পর্কে নির্দিষ্ট হন। "ব্যস্ত সকালের কফি শপ" বনাম "শান্ত স্টুডিও" আউটপুটে অর্থবহভাবে ভিন্ন অ্যাকোস্টিক প্রোফাইল তৈরি করে।
- "পরিচালকের নোট" অন্তর্ভুক্ত করুন। স্টাইল, গতি, উচ্চারণ এবং সুর প্রতিটি স্পষ্টভাবে সম্বোধন করা উচিত — এগুলো ভাগ্যের উপর ছেড়ে দেবেন না।
- প্রিসেট ২০০ শব্দের নিচে রাখুন। দীর্ঘ প্রিসেট মডেলের ফোকাস নষ্ট করার ঝুঁকি বাড়ায়। সংক্ষিপ্ত কিন্তু নির্দিষ্ট হোন।
| ভয়েস নাম | লিঙ্গ | সেরা | বৈশিষ্ট্য |
|---|---|---|---|
| Kore | মহিলা | উষ্ণ বর্ণনা, পডকাস্ট | বন্ধুত্বপূর্ণ, উষ্ণ, সহজবোধ্য |
| Puck | পুরুষ | আপবিট কন্টেন্ট, প্রোমো | প্রাণবন্ত, আত্মবিশ্বাসী |
| Enceladus | পুরুষ | শান্ত বর্ণনা, অডিওবুক | শ্বাসপ্রশ্বাসপূর্ণ, অন্তর্মুখী |
| Charon | পুরুষ | কর্তৃত্বপূর্ণ কন্টেন্ট | গভীর, প্রভাবশালী |
| Aoede | মহিলা | পেশাদার উপস্থাপনা | পরিষ্কার, পরিশীলিত |
| Callirrhoe | মহিলা | অনানুষ্ঠানিক কথোপকথন | হালকা, স্বাভাবিক |
| Orus | পুরুষ | প্রযুক্তিগত কন্টেন্ট | সুনির্দিষ্ট, পরিমাপিত |
| Fenrir | পুরুষ | নাটকীয় বর্ণনা | শক্তিশালী, তীব্র |
- প্রিসেট স্টাইলের সাথে কণ্ঠ মেলান। যদি আপনার প্রিসেট একটি ক্লান্ত চরিত্রের বর্ণনা দেয়, তবে স্বাভাবিক শ্বাসপ্রশ্বাসযুক্ত কণ্ঠ বেছে নিন (যেমন এনসেলাডাস)। উজ্জ্বল, প্রাণবন্ত কণ্ঠকে ফিসফিস করতে বলবেন না — এটি জোরপূর্বক মনে হবে।
- Google AI Studio-তে [Voice Library] পরীক্ষা করুন। প্লেগ্রাউন্ড আপনাকে প্রতিটি ভয়েস কীভাবে বিভিন্ন প্রম্পটে সাড়া দেয় তা শোনার সুযোগ দেয়।
- ভয়েস + প্রম্পট সিনার্জি ব্যবহার করুন। একটি গভীর পুরুষ কণ্ঠ (চারন) একটি কর্তৃত্বপূর্ণ স্টাইল প্রম্পটের সাথে যুক্ত হলে প্রভাব বৃদ্ধি পায়। ভয়েস এবং প্রম্পট একে অপরকে শক্তিশালী করা উচিত।
- বেমানান বয়স/লিঙ্গ প্রম্পট এড়িয়ে চলুন। অল্পবয়সী মেয়ের মতো শোনাতে চাওয়া একটি গভীর পুরুষ কণ্ঠ অদ্ভুত ফলাফল তৈরি করে। নিশ্চিত করুন যে আপনার প্রিসেটের লিখিত সুরটি স্বাভাবিকভাবেই ভয়েসের সাথে মানানসই।
- প্রতি চরিত্রে একটি ভয়েস লক করুন। মাল্টি-স্পিকার কন্টেন্টে, প্রতি স্পিকারের জন্য একটি ভয়েস নির্ধারণ করুন এবং প্রজেক্টের মাঝখানে তা পরিবর্তন করবেন না। ধারাবাহিকতাই মূল চাবিকাঠি।
- অ-ইংরেজি কন্টেন্টের জন্য: ধারাবাহিক ব্র্যান্ড পরিচয়ের জন্য ভাষা জুড়ে একই ভয়েস ব্যবহার করুন। Gemini TTS একই ভয়েস বিকল্পগুলির সাথে ৭০টিরও বেশি ভাষা হ্যান্ডেল করে।
প্রো টিপ: Google Cloud TTS API (Vertex AI) ব্যবহার করার সময়, আপনি প্রতি ভয়েসে speaker নির্দিষ্ট করতে পারেন। পডকাস্ট এবং সাক্ষাৎকারে স্বয়ংক্রিয় স্পিকার ডায়ারাইজেশনের জন্য এটিকে মাল্টি-স্পিকার ডায়ালগ মোডের সাথে একত্রিত করুন।
| ট্যাগ | প্রভাব | নির্ভরযোগ্যতা |
|---|---|---|
| [sigh] | একটি দীর্ঘশ্বাস শব্দ যোগ করে | উচ্চ |
| [laughing] | একটি হাসি যোগ করে | উচ্চ |
| [uhm] | একটি দ্বিধা যোগ করে | উচ্চ |
| [gasp] | একটি হাঁপানির শব্দ যোগ করে | উচ্চ |
| [cough] | একটি কাশির শব্দ যোগ করে | মাঝারি |
| [sighs] | একটি দীর্ঘশ্বাস যোগ করে | উচ্চ |
| ট্যাগ | প্রভাব | নির্ভরযোগ্যতা |
|---|---|---|
| [whispers] | ফিসফিস করে ডেলিভারি | উচ্চ |
| [excitedly] | উচ্ছ্বসিত, প্রাণবন্ত সুর | উচ্চ |
| [bored] | ফ্ল্যাট, নিরুত্তাপ ডেলিভারি | উচ্চ |
| [অনিচ্ছাসত্ত্বেও] | দ্বিধাগ্রস্ত, অনিচ্ছুক সুর | উচ্চ |
| [শান্তভাবে] | শিথিল, পরিমিত ডেলিভারি | উচ্চ |
| [চিৎকার করে] | উচ্চ, প্রজেক্টেড কণ্ঠস্বর | মাঝারি-উচ্চ |
| [নিউজকাস্ট] | ব্রডকাস্ট সাংবাদিকতা শৈলী | উচ্চ |
| [ডকুমেন্টারি] | প্রকৃতি বিষয়ক ডকুমেন্টারি ন্যারেটর | উচ্চ |
| [কথপোকথনের মতো] | অনানুষ্ঠানিক, স্বাভাবিক ডেলিভারি | উচ্চ |
| ট্যাগ | প্রভাব | নির্ভরযোগ্যতা |
|---|---|---|
| [ধীরে ধীরে] | ধীর গতি | উচ্চ |
| [দ্রুত] | দ্রুত গতি | উচ্চ |
| [বিরতি] | চালিয়ে যাওয়ার আগে সংক্ষিপ্ত বিরতি | উচ্চ |
| [দীর্ঘ বিরতি] | দীর্ঘায়িত বিরতি | উচ্চ |
| [জোর] | পরবর্তী বাক্যাংশে জোর দেয় | মাঝারি-উচ্চ |
// ডিফল্ট — কোনো ট্যাগ নেই এই যে, আমি একটি নতুন টেক্সট টু স্পিচ মডেল। আজ আমি আপনাকে কীভাবে সাহায্য করতে পারি? // উত্তেজিত [excitedly] এই যে, আমি একটি নতুন টেক্সট টু স্পিচ মডেল! আজ আমি আপনাকে কীভাবে সাহায্য করতে পারি? // বিরক্ত [bored] এই যে, আমি একটি নতুন টেক্সট টু স্পিচ মডেল... আজ আমি আপনাকে কীভাবে সাহায্য করতে পারি? // বিরতি সহ ব্যঙ্গাত্মক [sighs] এই যে... [pause] আমি একটি নতুন টেক্সট টু স্পিচ মডেল। [pause] আজ আমি আপনাকে কীভাবে সাহায্য করতে পারি? // হাসির সাথে ফিসফিসানি [whispers] এই যে... [laughing] আমি একটি নতুন টেক্সট টু স্পিচ মডেল। আজ আমি আপনাকে কীভাবে সাহায্য করতে পারি?
- লোকালাইজড অ্যাকশনের জন্য ট্যাগ ব্যবহার করুন, সামগ্রিক টোনের জন্য নয়। আপনার সিস্টেম প্রম্পট দিয়ে সামগ্রিক টোন সেট করুন। নির্দিষ্ট মুহূর্তের জন্য ট্যাগ ব্যবহার করুন: এক জায়গায় হাসি, অন্য জায়গায় ফিসফিসানি।
- ট্যাগের অতিরিক্ত ব্যবহার করবেন না। একটি ছোট অনুচ্ছেদে খুব বেশি ট্যাগ অস্বাভাবিক শোনাতে পারে। প্রতি প্যারাগ্রাফে সর্বোচ্চ ১-২টি ট্যাগ ব্যবহার করুন।
- অ-ইংরেজি ট্রান্সক্রিপ্টের জন্যও ইংরেজি ট্যাগ ব্যবহার করুন। গুগল কথ্য ভাষা নির্বিশেষে সেরা ফলাফলের জন্য ইংরেজি ট্যাগ সুপারিশ করে।
- সৃজনশীল হন — কোনো নির্দিষ্ট তালিকা নেই। মডেলটি ব্র্যাকেটের ভেতরের স্বাভাবিক ভাষাকে ব্যাখ্যা করে। [playful], [melancholy], [urgently], [with a grin] চেষ্টা করুন — মডেলটি তার সেরাটা দেয়।
- প্রথমে নতুন ট্যাগ পরীক্ষা করুন। আপনি যে ট্যাগটিকে স্টাইল মডিফায়ার মনে করছেন, সেটি আক্ষরিক পাঠ্য হিসেবে উচ্চারিত হতে পারে। সর্বদা AI Studio প্লেগ্রাউন্ডে পরীক্ষা করুন।
- প্রম্পট এবং টেক্সটের সাথে ট্যাগ সামঞ্জস্যপূর্ণ রাখুন। যেখানে স্টাইল প্রম্পট বলছে "দুঃখিত এবং প্রতিফলিত", সেখানে [cheerful] ট্যাগ দিলে তা পরস্পরবিরোধী আউটপুট তৈরি করবে।
আপনি একজন চিত্রনাট্যকার এবং অডিও পরিচালক। আমার কাছে একটি সাধারণ প্রেক্ষাপট আছে কিন্তু কোনো ট্রান্সক্রিপ্ট নেই। কাজ: ১. প্রদত্ত প্রেক্ষাপটের ওপর ভিত্তি করে একটি সৃজনশীল, আকর্ষণীয় চিত্রনাট্য লিখুন। ২. সম্পূর্ণ আউটপুটটিকে একটি কাঠামোগত TTS প্রম্পট হিসেবে ফরম্যাট করুন। কঠোর আউটপুট ফরম্যাট: # অডিও প্রোফাইল: [Name] ## "[Title]" ## দৃশ্য: [Scene Title] [প্রাণবন্ত বর্ণনা] ### পরিচালকের নোট শৈলী: [Style] গতি: [Pace] উচ্চারণভঙ্গি (Accent): [Accent]
- সুনির্দিষ্ট হোন, সাধারণ নয়। "১৯৪০-এর দশকের রেডিও সংবাদ ঘোষণাকারীর মতো কথা বলুন" দিলে "পুরানো কায়দায় কথা বলুন"-এর চেয়ে অনেক ভালো ফলাফল পাওয়া যায়।
- দৃশ্যপট সেট করুন। পরিবেশের প্রেক্ষাপট ("ব্যস্ত বিমানবন্দর", "শান্ত স্টুডিও", "ভোরবেলার কফিশপ") মডেলের শাব্দিক ব্যাখ্যাকে নির্দেশিত করে।
- চরিত্রের মানসিক অবস্থা সংজ্ঞায়িত করুন। "নোভা রিল্যাক্সড এবং আত্মবিশ্বাসী" মডেলকে প্রতিটি লাইনের জন্য একটি প্রাথমিক মানসিক ভিত্তি প্রদান করে।
- প্যারালাঙ্গুইস্টিক বিবরণ অন্তর্ভুক্ত করুন। শ্বাস-প্রশ্বাস, গতি, বিরতি এবং কণ্ঠস্বরের গঠন উল্লেখ করুন। শুধু "শান্ত"-এর চেয়ে "সামান্য শ্বাস-প্রশ্বাসযুক্ত, স্বাভাবিক বিরতি সহ পরিমিত গতি" অনেক বেশি কার্যকর।
- সম্পর্কিত বিষয়বস্তুর জন্য একই প্রম্পট ব্যবহার করুন। আপনি যদি পডকাস্ট এপিসোডের একটি সিরিজ তৈরি করেন, তবে সিস্টেম প্রম্পট সবগুলোতে অভিন্ন হওয়া উচিত।
- Gemini-কে সহ-পরিচালনা করতে দিন। আপনি যদি আটকে যান, তবে Gemini-কে একটি সহজ প্রেক্ষাপট দিন এবং তাকে সম্পূর্ণ কাঠামোগত প্রম্পট তৈরি করতে বলুন। এটি সৃজনশীল নির্দেশনায় চমৎকার।
Speaker1-কে ক্লান্ত এবং বিরক্ত শোনান, এবং Speaker2-কে উত্তেজিত এবং খুশি শোনান: Speaker1: তো... আজকের আলোচ্যসূচিতে কী আছে? Speaker2: আপনি কখনোই আন্দাজ করতে পারবেন না! // সেরা ফলাফলের জন্য ভয়েস পেয়ারিংয়ের সাথে একত্রিত করুন: // Speaker1 → Enceladus (শ্বাসের টানযুক্ত, অন্তর্মুখী) // Speaker2 → Puck (হাসিখুশি, উদ্যমী)
| সমস্যা | প্রভাব | প্রশমন |
|---|---|---|
| দীর্ঘ আউটপুটে গুণমানের বিচ্যুতি | কয়েক মিনিট পর স্পিচ কোয়ালিটি খারাপ হয়ে যায় | ট্রান্সক্রিপ্টগুলো ২-৩ মিনিটের খণ্ডে ভাগ করুন। পোস্ট-প্রডাকশনে অডিও জোড়া লাগান। |
| টেক্সট টোকেন রিটার্ন (৫০০ এরর) | অনুরোধের র্যান্ডম ~১-২% অডিওর পরিবর্তে টেক্সট রিটার্ন করে | এক্সপোনেনশিয়াল ব্যাকঅফ সহ অটোমেটিক রিট্রাই লজিক ইমপ্লিমেন্ট করুন। |
| প্রম্পটের সাথে ভয়েস অমিল | অডিও নির্বাচিত স্পিকার প্রোফাইলের সাথে মেলে না | নিশ্চিত করুন যে প্রিসেট, ভয়েস এবং প্রম্পট সেমান্টিক্যালি অ্যালাইনড আছে। |
| ট্যাগ ভোকালাইজেশন | কিছু ট্যাগ ব্যাখ্যা করার পরিবর্তে আক্ষরিক টেক্সট হিসেবে বলা হয় | প্রডাকশনে ব্যবহারের আগে এআই স্টুডিওতে নতুন ট্যাগ পরীক্ষা করুন। |
| রেট লিমিট | জেমিনি ২.৫ প্রো টিটিএস: ফ্রি টায়ারে ১০০ অনুরোধ/দিন | হাই-ভলিউমের জন্য ফ্ল্যাশ এবং প্রিমিয়াম কন্টেন্টের জন্য প্রো ব্যবহার করুন। রিকোয়েস্ট কিউইং ইমপ্লিমেন্ট করুন। |
প্রথমে AI Studio-তে সমস্ত ট্যাগ পরীক্ষা করুন
ট্যাগ ব্যবহারের আগে Google AI Studio প্লেগ্রাউন্ডে প্রতিটি ট্যাগ পরীক্ষা করুন। মডেলটি আপনার কাঙ্ক্ষিত অর্থ সঠিকভাবে ব্যাখ্যা করছে কি না তা যাচাই করুন।
দীর্ঘ কন্টেন্ট টুকরো করে ভাগ করুন
৩ মিনিটের বেশি লম্বা কন্টেন্টের জন্য, আপনার ট্রান্সক্রিপ্টকে স্বাভাবিক বিরতি পয়েন্টে (অনুচ্ছেদ, দৃশ্য পরিবর্তন, বিষয় পরিবর্তন) ভাগ করুন। প্রতিটি টুকরো আলাদাভাবে তৈরি করুন, তারপর অডিও ফাইলগুলো একসাথে জুড়ে দিন।
রিট্রাই লজিক প্রয়োগ করুন
Gemini TTS মাঝে মাঝে অডিওর পরিবর্তে টেক্সট টোকেন ফেরত দেয় (যার ফলে ৫০০ এরর হয়)। এটি প্রায় ১-২% রিকোয়েস্টে ঘটে। আপনার পাইপলাইনে এক্সপোনেনশিয়াল ব্যাকঅফ সহ অটোমেটিক রিট্রাই ব্যবস্থা রাখুন।
ভয়েস-প্রিসেট অ্যালাইনমেন্ট যাচাই করুন
প্রতিটি স্পিকারের জন্য, যাচাই করুন যে নির্বাচিত ভয়েসটি প্রিসেট বর্ণনার সাথে স্বাভাবিকভাবে মেলে কি না। একটি গম্ভীর কণ্ঠস্বরের সাথে "তরুণ, চঞ্চল" প্রিসেট দিলে তা অদ্ভুত ফলাফল দেয়।
ধারাবাহিকতার জন্য প্রিসেট ক্যাশে করুন
আপনার যাচাইকৃত প্রিসেটগুলো কনফিগারেশন হিসেবে সংরক্ষণ করুন। প্রতিটি জেনারেশনের জন্য আলাদা প্রম্পট তৈরি করবেন না — এটি অসঙ্গতি তৈরি করে। একই স্পিকারের সমস্ত কন্টেন্টের জন্য একই প্রিসেট ফাইল ব্যবহার করুন।
SynthID জলছাপ মনিটর করুন
সমস্ত Gemini TTS আউটপুটে একটি SynthID জলছাপ (AI কন্টেন্ট শনাক্তকরণের জন্য অদৃশ্য স্বাক্ষর) থাকে। নিশ্চিত করুন যে আপনার ব্যবহার এআই-জেনারেটেড অডিওর ডিসক্লোজার শর্তাবলী মেনে চলে।
| মডেল | সেরা | ল্যাটেন্সি | সর্বোচ্চ আউটপুট | প্রাইস টায়ার |
|---|---|---|---|---|
| জেমিনি ৩.১ ফ্ল্যাশ টিটিএস | দৈনন্দিন অ্যাপস, রিয়েল-টাইম অ্যাসিস্ট্যান্ট | কম | ১০ মিনিট | $ |
| জেমিনি ২.৫ ফ্ল্যাশ টিটিএস | হাই-ভলিউম ন্যারেশন, কথোপকথন | কম | ১০ মিনিট | $ |
| জেমিনি ২.৫ প্রো টিটিএস | স্টুডিও-কোয়ালিটি ন্যারেশন, অডিওবুক | মাঝারি | ২৫ মিনিট | $$ |
| জেমিনি ২.৫ ফ্ল্যাশ লাইট | খরচ-সংবেদনশীল, হাই-থ্রুপুট | খুব কম | ৫ মিনিট | $ |
- প্রিসেট → কে, কোথায় এবং কীভাবে তা নির্ধারণ করে (স্পিকার প্রতি পুনরায় ব্যবহারযোগ্য)
- ভয়েস সিলেকশন → আপনার চরিত্রের সাথে স্বাভাবিক কণ্ঠস্বরের বৈশিষ্ট্য মেলান
- ইনলাইন ট্যাগ → সূক্ষ্ম, প্রতি-বাক্যাংশ নিয়ন্ত্রণ (মিতব্যয়ীভাবে ব্যবহার করুন, আগে পরীক্ষা করুন)
- সিস্টেম প্রম্পট → সামগ্রিক টোন, দৃশ্য এবং পারফরম্যান্স শৈলী সেট করুন
- গার্ড রেইল → দীর্ঘ কন্টেন্ট ভাগ করুন, ত্রুটিতে পুনরায় চেষ্টা করুন, অ্যালাইনমেন্ট যাচাই করুন
কোডটি এড়িয়ে যান: আপনি যদি কোনো API ইন্টিগ্রেশন লেখা ছাড়াই সরাসরি আপনার Google ডক্সে এই জেমিনি-চালিত কণ্ঠস্বরগুলো পেতে চান, তাহলে বিনামূল্যে AI ন্যারেটর অ্যাড-অন ব্যবহার করে দেখুন — এটি আপনার জন্য সম্পূর্ণ ভয়েস জেনারেশন পাইপলাইনটি পরিচালনা করে।
- ২০২৬ সালের সেরা AI ভয়েস API — প্রতিটি TTS API প্রদানকারীর সম্পূর্ণ তুলনা
- AI ভয়েস ক্লোনিং নির্দেশিকা — ধাপে ধাপে নির্দেশাবলী সহ যেকোনো কণ্ঠস্বর ক্লোন করুন
- AI ন্যারেটর বনাম ইলেভেনল্যাবস — গুণমান এবং মূল্যের সরাসরি তুলনা
- বহুভাষিক TTS নির্দেশিকা — ৭০টিরও বেশি ভাষায় বক্তৃতা তৈরি করুন
এই কণ্ঠ নিজেই শুনতে চান?
এই মুহূর্তে বিনামূল্যে আমাদের AI বর্ণনাকারী চেষ্টা করুন. কোন সাইন আপ প্রয়োজন.
এআই ন্যারেটর চেষ্টা করতে প্রস্তুত?
আজ থেকেই আপনার গুগল ডক্সকে পেশাদার অডিওতে রূপান্তর করা শুরু করুন। চিরকাল বিনামূল্যে!
Doc-এ যোগ করুন - এটি বিনামূল্যে