AI & Voice

Giới thiệu G v1: Giọng nói AI tự nhiên với hội thoại đa người nói

April 1, 2026 ·6 phút đọc
Giới thiệu G v1: Giọng nói AI tự nhiên với hội thoại đa người nói

Chúng tôi vô cùng hân hạnh giới thiệu G v1 trong simpleTTS.ai Studio — một công cụ chuyển văn bản thành giọng nói hoàn toàn mới, công cụ tạo giọng nói bằng AI mới của chúng tôi. G v1 mang đến một cách tiếp cận hoàn toàn khác biệt trong tổng hợp giọng nói: thay vì chỉ đọc văn bản thành tiếng, nó hiểu ngữ cảnh, cảm xúc và ý định để tạo ra giọng nói nghe thực sự giống con người.

Công cụ này hoạt động song song với công cụ AZ v1 hiện có, mang đến cho bạn sự tự do lựa chọn công cụ phù hợp cho mọi dự án. Chuyển đổi giữa các nhà cung cấp chỉ với một cú nhấp chuột.

Tại sao chọn G v1?

Các công cụ TTS truyền thống chuyển đổi văn bản thành âm thanh bằng các mẫu giọng nói được định sẵn. G v1 khác biệt — nó được xây dựng trên mô hình ngôn ngữ lớn, không chỉ biết nói gì, mà còn biết nói như thế nào. Kết quả là giọng nói có nhịp điệu tự nhiên, nhấn mạnh phù hợp và sắc thái cảm xúc thích ứng với nội dung của bạn.

G v1 hỗ trợ 30 giọng nói có sẵn trên 24 ngôn ngữ, với khả năng biểu cảm nâng cao, nhịp điệu nhận biết ngữ cảnh và hội thoại đa người nói tích hợp — tất cả đều có thể điều khiển thông qua các lệnh ngôn ngữ tự nhiên thay vì cấu hình phức tạp.

Tính năng chính

30 giọng nói biểu cảm

Chọn từ 30 giọng nói riêng biệt, mỗi giọng có cá tính và phong cách độc đáo. Từ giọng chắc chắn của Kore đến năng lượng sôi nổi của Puck, giọng nhẹ nhàng của Achernar đến sự ấm áp của Sulafat — có một giọng nói cho mọi trường hợp sử dụng. Duyệt giọng nói theo giới tính và phong cách, tìm kiếm theo tên và lưu giọng yêu thích để truy cập nhanh.

Chế độ một người nói

Hoàn hảo cho thuyết minh, thông báo và nội dung đơn giản. Chọn giọng nói, dán văn bản và tạo. Mô hình tự động xử lý nhịp điệu và ngữ điệu dựa trên nội dung — tăng tốc khi hào hứng, chậm lại khi nhấn mạnh.

Hội thoại đa người nói

Đây là nơi G v1 thực sự tỏa sáng. Gán các giọng nói khác nhau cho các người nói khác nhau và tạo cuộc hội thoại nghe tự nhiên trong một lần — không cần ghép nối các đoạn âm thanh riêng lẻ. Mô hình duy trì giọng nhân vật nhất quán xuyên suốt và xử lý việc chuyển lượt nói một cách tự nhiên.

Chỉ cần định dạng văn bản với nhãn người nói:

  • Speaker 1: Chào mừng đến với tập hôm nay!
  • Speaker 2: Cảm ơn đã mời tôi. Hãy bắt đầu thôi.
  • Speaker 1: Vậy hãy kể cho chúng tôi về dự án mới nhất của bạn...

Mỗi người nói được lồng tiếng bởi giọng nói bạn chỉ định, và mô hình tạo ra một tệp âm thanh thống nhất với luồng hội thoại tự nhiên.

Hướng dẫn giọng nói

Kiểm soát cách giọng nói phát ra bằng tiếng Anh đơn giản. Thay vì điều chỉnh thanh trượt và thông số, chỉ cần mô tả những gì bạn muốn:

  • "Đọc với giọng ấm áp, trò chuyện"
  • "Nói với sự nhiệt tình và năng lượng"
  • "Trình bày như một phát thanh viên tin tức"

Không biết viết gì? Nhấn nút AI tạo tự động và để hệ thống gợi ý hướng dẫn giọng nói dựa trên nội dung của bạn.

Cách sử dụng

  1. Chuyển sang G v1 — Nhấp vào nút G v1 trong thanh chuyển đổi nhà cung cấp (bên cạnh AZ v1) ở bảng bên phải.
  2. Chọn chế độ — Chọn Một người nói cho thuyết minh hoặc Đa người nói cho hội thoại.
  3. Chọn giọng nói — Duyệt bảng giọng nói, tìm kiếm theo tên hoặc phong cách, và chọn giọng phù hợp với nội dung. Trong chế độ đa người nói, chọn giọng cho từng người nói.
  4. Thêm hướng dẫn giọng nói (tùy chọn) — Mô tả giọng điệu, nhịp độ hoặc phong cách bạn muốn.
  5. Tạo — Nhấn nút tạo và âm thanh của bạn sẽ sẵn sàng trong vài giây.

Bạn có thể tạo gì

  • Podcast và chương trình trò chuyện — Sử dụng chế độ đa người nói để tạo cuộc trò chuyện giữa người dẫn và khách mời với giọng nói riêng biệt, nhất quán.
  • Sách nói và truyện — Thuyết minh nội dung dài với nhịp điệu tự nhiên và cách truyền tải cảm xúc thích ứng với tài liệu.
  • E-learning và hướng dẫn — Tạo âm thanh giảng dạy hấp dẫn với cách truyền tải rõ ràng, nhịp độ phù hợp.
  • Marketing và quảng cáo — Tạo lồng tiếng chuyên nghiệp với giọng điệu và năng lượng chính xác mà bạn cần.
  • Nội dung hỗ trợ tiếp cận — Chuyển đổi nội dung viết thành âm thanh nghe tự nhiên cho người khiếm thị.

Giá cả

G v1 sử dụng số dư tín dụng hiện có của bạn với mức 2 tín dụng mỗi ký tự. Tài khoản miễn phí bao gồm 10.000 tín dụng hàng tháng để bắt đầu. Tín dụng của bạn hoạt động trên cả hai công cụ, vì vậy bạn có thể kết hợp các nhà cung cấp dựa trên nhu cầu của từng dự án.

G v1 vs. AZ v1: Khi nào dùng cái nào

Cả hai công cụ vẫn hoạt động đầy đủ. Đây là hướng dẫn nhanh:

  • Chọn G v1 khi bạn cần hội thoại nghe tự nhiên, thuyết minh biểu cảm, hoặc kiểm soát giọng điệu chi tiết thông qua hướng dẫn ngôn ngữ tự nhiên.
  • Chọn AZ v1 khi bạn cần truy cập hơn 500 giọng nói, điều khiển cấp SSML, hoặc hỗ trợ hơn 70 ngôn ngữ.

Bắt đầu

G v1 hiện đã có sẵn cho tất cả người dùng đã đăng ký. Truy cập simpleTTS.ai Studio, chuyển sang G v1 và tự mình cảm nhận sự khác biệt. Tín dụng hiện có của bạn hoạt động ngay — không cần thiết lập thêm.

Chúng tôi rất mong được nghe những gì bạn tạo ra.

Bài viết liên quan