Các phương pháp hay nhất về Gemini TTS: Tạo âm thanh nhất quán và biểu cảm mọi lúc
Tóm tắt nhanh: Các mô hình Gemini TTS (2.5 Flash, 2.5 Pro và 3.1 Flash) khác biệt cơ bản so với TTS truyền thống — chúng là các mô hình ngôn ngữ lớn tạo ra âm thanh. Điều này có nghĩa là lời nhắc, lựa chọn giọng nói và thẻ nội dòng của bạn có tác động rất lớn đến chất lượng đầu ra. Hướng dẫn này bao gồm năm trụ cột của việc tạo âm thanh nhất quán: Cài đặt trước, lựa chọn giọng nói, thẻ cảm xúc, lời nhắc hệ thống và rào cản.
Lời nhắc phong cách (Hướng dẫn hệ thống)
Yếu tố chính điều khiển tông điệu cảm xúc và phong cách thể hiện. Thiết lập ngữ cảnh cho toàn bộ phân đoạn lời nói.Nội dung văn bản (Bản ghi)
Ý nghĩa ngữ nghĩa của các từ. Văn bản giàu cảm xúc và gợi hình tạo ra kết quả đáng tin cậy hơn nhiều so với văn bản trung tính.Thẻ nội dòng (Markup)
Các bộ điều chỉnh trong dấu ngoặc vuông như [whispers] hoặc [laughs] để kiểm soát chi tiết, cục bộ cho các cụm từ cụ thể. Chúng hoạt động phối hợp với lời nhắc phong cách.
Nguyên tắc chính: Để đạt hiệu quả dự đoán tối đa, hãy đảm bảo lời nhắc phong cách, nội dung văn bản và thẻ nội dòng của bạn thống nhất về mặt ngữ nghĩa và hướng tới cùng một mục tiêu cảm xúc. Một lời nhắc lo âu với văn bản họp hành trung tính sẽ tạo ra kết quả mơ hồ.
# HỒ SƠ ÂM THANH: Nova ## "Người dẫn chương trình buổi sáng" ## BỐI CẢNH: Studio phát thanh trực tiếp [Một studio ấm áp, mời gọi với ánh sáng buổi sáng dịu nhẹ. Nova thoải mái, tự tin và lôi cuốn — cô ấy nói chuyện trực tiếp với người nghe như một người bạn.] ### GHI CHÚ CỦA ĐẠO DIỄN Phong cách: Ấm áp, trò chuyện, hơi vui vẻ Nhịp độ: Trung bình — không vội vã, không chậm Giọng: Tiếng Anh Mỹ, trung tính Tông giọng: Thân thiện và dễ gần, giống như đang trò chuyện với bạn thân bên ly cà phê
- Tính tái tạo: Cùng một cài đặt trước áp dụng cho các bản ghi khác nhau sẽ tạo ra âm thanh giống như cùng một người nói trong cùng một phiên.
- Quy trình làm việc nhiều người nói: Xác định cài đặt trước cho mỗi người nói (người phỏng vấn, khách mời, người dẫn chuyện) và duy trì các giọng nói riêng biệt qua các tập.
- Giảm thiểu sai lệch lời nhắc: Không có cài đặt trước, mô hình suy luận phong cách chỉ từ văn bản — dẫn đến sự không nhất quán trong các dự án dài.
- Lặp lại nhanh hơn: Khi cài đặt trước của bạn đã đúng, bạn chỉ cần điều chỉnh văn bản, không cần tạo lại giọng nói mỗi lần.
- Đặt tên cho nhân vật. Việc gắn kết mô hình với một cái tên ("Nova", "Dr. Claire", "Marcus") giúp liên kết phần thể hiện và giảm thiểu sự lan man.
- Xác định danh tính, không chỉ tông giọng. "DJ đài phát thanh" hoặc "người dẫn chuyện phim tài liệu về thiên nhiên" cung cấp cho mô hình một nguyên mẫu hiệu suất để neo giữ.
- Cụ thể về môi trường. "Quán cà phê bận rộn buổi sáng sớm" so với "studio yên tĩnh" tạo ra các hồ sơ âm thanh khác biệt rõ rệt trong đầu ra.
- Bao gồm "ghi chú của đạo diễn". Phong cách, nhịp độ, giọng và tông giọng đều phải được giải quyết rõ ràng — đừng để chúng cho may rủi.
- Giữ cài đặt trước dưới 200 từ. Các cài đặt trước dài hơn có nguy cơ làm loãng sự tập trung của mô hình. Hãy súc tích nhưng cụ thể.
| Tên giọng nói | Giới tính | Tốt nhất cho | Đặc điểm |
|---|---|---|---|
| Kore | Nữ | Lời dẫn ấm áp, podcast | Thân thiện, ấm áp, dễ gần |
| Puck | Nam | Nội dung sôi động, quảng cáo | Năng động, tự tin |
| Enceladus | Nam | Lời dẫn bình tĩnh, sách nói | Thì thầm, trầm tư |
| Charon | Nam | Nội dung uy tín | Sâu sắc, mạnh mẽ |
| Aoede | Nữ | Thuyết trình chuyên nghiệp | Rõ ràng, trau chuốt |
| Callirrhoe | Nữ | Cuộc trò chuyện thông thường | Nhẹ nhàng, tự nhiên |
| Orus | Nam | Nội dung kỹ thuật | Chính xác, đo lường |
| Fenrir | Nam | Lời dẫn kịch tính | Mạnh mẽ, mãnh liệt |
- Kết hợp giọng nói với phong cách cài đặt trước. Nếu cài đặt trước của bạn mô tả một nhân vật mệt mỏi, hãy chọn giọng nói có hơi thở tự nhiên (như Enceladus). Đừng yêu cầu một giọng nói tươi sáng, sôi nổi thì thầm — nó sẽ nghe có vẻ gượng ép.
- Kiểm tra [Thư viện giọng nói] trong Google AI Studio. Sân chơi cho phép bạn nghe cách mỗi giọng nói phản hồi với các lời nhắc khác nhau trước khi quyết định.
- Sử dụng sức mạnh tổng hợp giữa giọng nói + lời nhắc. Một giọng nam trầm (Charon) kết hợp với lời nhắc phong cách có thẩm quyền sẽ khuếch đại hiệu ứng. Giọng nói và lời nhắc nên củng cố lẫn nhau.
- Tránh các lời nhắc không phù hợp về tuổi/giới tính. Một giọng nam trầm cố gắng nghe như một cô gái trẻ sẽ tạo ra kết quả kỳ lạ. Đảm bảo tông giọng viết trong cài đặt trước của bạn phù hợp tự nhiên với giọng nói.
- Khóa một giọng nói cho mỗi nhân vật. Trong nội dung nhiều người nói, hãy chỉ định một giọng nói cho mỗi người và không bao giờ thay đổi giữa dự án. Sự nhất quán là chìa khóa.
- Đối với nội dung không phải tiếng Anh: Sử dụng cùng một giọng nói trên các ngôn ngữ để có bản sắc thương hiệu nhất quán. Gemini TTS xử lý hơn 70 ngôn ngữ với cùng các tùy chọn giọng nói.
Mẹo chuyên nghiệp: Khi sử dụng API Google Cloud TTS (Vertex AI), bạn cũng có thể chỉ định speaker cho mỗi giọng nói. Kết hợp điều này với chế độ đối thoại nhiều người nói để tự động phân đoạn người nói trong podcast và phỏng vấn.
| Thẻ | Hiệu ứng | Độ tin cậy |
|---|---|---|
| [sigh] | Chèn âm thanh tiếng thở dài | Cao |
| [laughing] | Chèn một tiếng cười | Cao |
| [uhm] | Chèn một sự do dự | Cao |
| [gasp] | Chèn âm thanh tiếng thở dốc | Cao |
| [cough] | Chèn âm thanh tiếng ho | Trung bình |
| [sighs] | Chèn một tiếng thở dài | Cao |
| Thẻ | Hiệu ứng | Độ tin cậy |
|---|---|---|
| [whispers] | Cách diễn đạt thì thầm | Cao |
| [excitedly] | Giọng điệu hào hứng, năng lượng | Cao |
| [bored] | Diễn đạt bằng phẳng, vô cảm | Cao |
| [miễn cưỡng] | Giọng điệu do dự, không muốn | Cao |
| [bình tĩnh] | Diễn đạt thư thái, từ tốn | Cao |
| [hét] | Giọng nói lớn, vang | Trung-Cao |
| [bản tin] | Phong cách báo chí phát thanh | Cao |
| [phim tài liệu] | Người dẫn chuyện phim tài liệu thiên nhiên | Cao |
| [trò chuyện] | Diễn đạt tự nhiên, thân mật | Cao |
| Thẻ | Hiệu ứng | Độ tin cậy |
|---|---|---|
| [chậm] | Nhịp độ chậm hơn | Cao |
| [nhanh] | Nhịp độ nhanh hơn | Cao |
| [tạm dừng] | Dừng một chút trước khi tiếp tục | Cao |
| [tạm dừng lâu] | Dừng kéo dài | Cao |
| [nhấn mạnh] | Nhấn mạnh cụm từ tiếp theo | Trung-Cao |
// Mặc định — không có thẻ Chào bạn, tôi là một mô hình chuyển đổi văn bản thành giọng nói mới. Tôi có thể giúp gì cho bạn hôm nay? // Hào hứng [excitedly] Chào bạn, tôi là một mô hình chuyển đổi văn bản thành giọng nói mới! Tôi có thể giúp gì cho bạn hôm nay? // Chán nản [bored] Chào bạn, tôi là một mô hình chuyển đổi văn bản thành giọng nói mới... Tôi có thể giúp gì cho bạn hôm nay? // Mỉa mai kèm theo tạm dừng [sighs] Chào bạn... [pause] Tôi là một mô hình chuyển đổi văn bản thành giọng nói mới. [pause] Tôi có thể giúp gì cho bạn hôm nay? // Thì thầm kèm tiếng cười [whispers] Chào bạn... [laughing] Tôi là một mô hình chuyển đổi văn bản thành giọng nói mới. Tôi có thể giúp gì cho bạn hôm nay?
- Sử dụng thẻ cho các hành động cục bộ, không phải giọng điệu tổng thể. Thiết lập giọng điệu tổng thể bằng lời nhắc hệ thống. Sử dụng thẻ cho những khoảnh khắc cụ thể: một tiếng cười tại một thời điểm, một lời thì thầm tại một thời điểm khác.
- Đừng lạm dụng thẻ. Quá nhiều thẻ trong một đoạn văn ngắn có thể nghe không tự nhiên. Chỉ nên sử dụng tối đa 1-2 thẻ cho mỗi đoạn văn.
- Sử dụng thẻ bằng tiếng Anh ngay cả với các bản ghi không phải tiếng Anh. Google khuyên dùng thẻ tiếng Anh để có kết quả tốt nhất bất kể ngôn ngữ nói là gì.
- Hãy sáng tạo — không có danh sách đầy đủ các thẻ. Mô hình diễn giải ngôn ngữ tự nhiên trong dấu ngoặc vuông. Hãy thử [playful], [melancholy], [urgently], [with a grin] — mô hình sẽ cố gắng hết sức.
- Kiểm tra thẻ mới trước. Một thẻ mà bạn cho là công cụ điều chỉnh kiểu dáng có thể được đọc ra như văn bản thuần túy. Luôn kiểm tra trong AI Studio playground.
- Căn chỉnh thẻ với lời nhắc và văn bản. Một thẻ [cheerful] trong ngữ cảnh mà lời nhắc kiểu dáng ghi là "buồn bã và suy ngẫm" sẽ tạo ra kết quả mâu thuẫn.
Bạn là một người viết kịch bản và đạo diễn âm thanh. Tôi có một ngữ cảnh đơn giản nhưng KHÔNG CÓ BẢN GHI. NHIỆM VỤ: 1. Viết một kịch bản sáng tạo, hấp dẫn dựa trên ngữ cảnh đã cho. 2. Định dạng toàn bộ đầu ra thành một lời nhắc TTS có cấu trúc. ĐỊNH DẠNG ĐẦU RA BẮT BUỘC: # HỒ SƠ ÂM THANH: [Name] ## "[Title]" ## BỐI CẢNH: [Scene Title] [Mô tả sinh động] ### GHI CHÚ CỦA ĐẠO DIỄN Phong cách: [Style] Nhịp độ: [Pace] Giọng (Accent): [Accent]
- Càng cụ thể càng tốt, đừng chung chung. "Nói giống như một phát thanh viên tin tức đài phát thanh thập niên 1940" mang lại kết quả tốt hơn nhiều so với "nói theo cách lỗi thời".
- Thiết lập bối cảnh. Ngữ cảnh môi trường ("sân bay bận rộn", "phòng thu yên tĩnh", "quán cà phê sáng sớm") hướng dẫn cách diễn giải âm thanh của mô hình.
- Xác định trạng thái cảm xúc của nhân vật. "Nova đang thư giãn và tự tin" cung cấp cho mô hình một nền tảng cảm xúc bắt đầu cho mỗi dòng thoại.
- Bao gồm các chi tiết cận ngôn ngữ. Đề cập đến hơi thở, nhịp độ, các khoảng dừng và chất giọng. "Hơi thở nhẹ, nhịp độ vừa phải với các khoảng dừng tự nhiên" sẽ hiệu quả hơn là chỉ nói "bình tĩnh".
- Sử dụng cùng một lời nhắc cho nội dung liên quan. Nếu bạn đang tạo một loạt các tập podcast, lời nhắc hệ thống nên giống hệt nhau trong tất cả các tập.
- Để Gemini cùng chỉ đạo. Nếu bạn gặp khó khăn, hãy đưa cho Gemini một ngữ cảnh đơn giản và yêu cầu nó tạo lời nhắc có cấu trúc đầy đủ. Nó rất xuất sắc trong việc chỉ đạo sáng tạo.
Làm cho Speaker1 nghe có vẻ mệt mỏi và chán nản, và Speaker2 nghe có vẻ hào hứng và hạnh phúc: Speaker1: Vậy... chương trình nghị sự hôm nay có gì? Speaker2: Bạn sẽ không bao giờ đoán được đâu! // Kết hợp với ghép đôi giọng nói để có kết quả tốt nhất: // Speaker1 → Enceladus (thì thào, nội tâm) // Speaker2 → Puck (vui vẻ, năng động)
| Vấn đề | Tác động | Giảm nhẹ |
|---|---|---|
| Suy giảm chất lượng trong văn bản dài | Chất lượng giọng nói giảm sau vài phút | Chia bản ghi thành các đoạn 2-3 phút. Nối âm thanh trong khâu hậu kỳ. |
| Lỗi trả về mã thông báo văn bản (lỗi 500) | Ngẫu nhiên ~1-2% yêu cầu trả về văn bản thay vì âm thanh | Triển khai logic thử lại tự động với thời gian chờ tăng dần theo cấp số nhân. |
| Lệch giọng với gợi ý | Âm thanh không khớp với hồ sơ người nói đã chọn | Đảm bảo giá trị đặt sẵn (preset), giọng nói và gợi ý khớp nhau về mặt ngữ nghĩa. |
| Đọc thẻ (tag) | Một số thẻ được đọc thành văn bản chữ thay vì được diễn giải | Kiểm tra các thẻ mới trong AI Studio trước khi sử dụng chính thức. |
| Giới hạn tốc độ | Gemini 2.5 Pro TTS: 100 yêu cầu/ngày cho gói miễn phí | Sử dụng Flash cho khối lượng lớn, Pro cho nội dung cao cấp. Triển khai hàng đợi yêu cầu. |
Kiểm tra tất cả các thẻ trong AI Studio trước
Trước khi quyết định sử dụng một bộ từ vựng thẻ, hãy kiểm tra từng thẻ trong Google AI Studio playground. Xác minh mô hình diễn giải đúng ý nghĩa bạn mong muốn.
Chia nội dung dài thành các đoạn nhỏ
Đối với nội dung dài hơn 3 phút, hãy chia bản ghi của bạn tại các điểm ngắt tự nhiên (đoạn văn, thay đổi cảnh, thay đổi chủ đề). Tạo riêng từng đoạn, sau đó ghép các tệp âm thanh lại với nhau.
Triển khai logic thử lại
Gemini TTS thỉnh thoảng trả về các mã văn bản thay vì âm thanh (dẫn đến lỗi 500). Điều này xảy ra trong khoảng 1-2% số yêu cầu. Hãy xây dựng cơ chế tự động thử lại với thời gian chờ tăng dần vào quy trình của bạn.
Xác thực sự liên kết giữa giọng nói và cài đặt sẵn
Đối với mỗi người nói, hãy xác minh rằng giọng nói được chọn khớp một cách tự nhiên với mô tả cài đặt sẵn. Một giọng nói trầm ấm, uy quyền kết hợp với cài đặt sẵn "trẻ trung, vui tươi" sẽ tạo ra kết quả kỳ quặc.
Lưu trữ cài đặt sẵn để đảm bảo tính nhất quán
Lưu trữ các cài đặt sẵn đã được xác thực của bạn dưới dạng cấu hình. Đừng bao giờ tạo lời nhắc thủ công cho mỗi lần tạo — điều này gây ra sự không nhất quán. Sử dụng cùng một tệp cài đặt sẵn cho tất cả nội dung từ cùng một người nói.
Theo dõi hình mờ SynthID
Tất cả đầu ra của Gemini TTS đều mang hình mờ SynthID (chữ ký không thể nhận thấy để phát hiện nội dung AI). Đảm bảo trường hợp sử dụng của bạn tuân thủ các yêu cầu tiết lộ đối với âm thanh do AI tạo ra.
| Mô hình | Tốt nhất cho | Độ trễ | Đầu ra tối đa | Cấp giá |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS | Ứng dụng hàng ngày, trợ lý thời gian thực | Thấp | 10 phút | $ |
| Gemini 2.5 Flash TTS | Dẫn chuyện khối lượng lớn, trò chuyện | Thấp | 10 phút | $ |
| Gemini 2.5 Pro TTS | Dẫn chuyện chất lượng phòng thu, sách nói | Trung bình | 25 phút | $$ |
| Gemini 2.5 Flash Lite | Tiết kiệm chi phí, thông lượng cao | Rất thấp | 5 phút | $ |
- Cài đặt sẵn → Xác định ai, ở đâu và như thế nào (có thể tái sử dụng cho mỗi người nói)
- Chọn giọng nói → Khớp các đặc điểm giọng nói tự nhiên với nhân vật của bạn
- Thẻ nội dòng → Kiểm soát chi tiết trên từng cụm từ (sử dụng tiết chế, kiểm tra trước)
- Lời nhắc hệ thống → Thiết lập giọng điệu tổng thể, bối cảnh và phong cách trình diễn
- Rào chắn bảo vệ → Chia nhỏ nội dung dài, thử lại khi có lỗi, xác thực sự liên kết
Bỏ qua mã: Nếu bạn muốn có những giọng đọc do Gemini hỗ trợ trực tiếp bên trong Google Docs mà không cần viết tích hợp API, hãy thử tiện ích mở rộng AI Narrator miễn phí — tiện ích này xử lý toàn bộ quy trình tạo giọng nói cho bạn.
- API giọng nói AI tốt nhất năm 2026 — So sánh đầy đủ mọi nhà cung cấp API TTS
- Hướng dẫn nhân bản giọng nói AI — Nhân bản bất kỳ giọng nói nào với hướng dẫn từng bước
- AI Narrator so với ElevenLabs — So sánh trực tiếp về chất lượng và giá cả
- Hướng dẫn TTS đa ngôn ngữ — Tạo lời nói bằng hơn 70 ngôn ngữ
Bạn muốn tự mình nghe những giọng nói này?
Hãy dùng thử miễn phí Trình tường thuật AI của chúng tôi ngay bây giờ. Không cần đăng ký.
Bạn đã sẵn sàng dùng thử Trình tường thuật AI chưa?
Bắt đầu chuyển đổi Google Docs của bạn thành âm thanh chuyên nghiệp ngay hôm nay. Miễn phí mãi mãi!
Thêm vào Doc - Miễn phí