Llega G v2: voz por IA más rápida y expresiva, con etiquetas de audio

Estamos actualizando G v1 a G v2, y es nuestro mayor salto en calidad de voz por IA hasta la fecha. G v2 funciona con el flamante modelo Gemini 3.1 Flash TTS de Google, que reemplaza a los motores Gemini 2.5 Flash y Pro de la versión original. El resultado: una voz más natural y expresiva, una cobertura de idiomas muchísimo más amplia y una nueva forma de dirigir la entonación palabra por palabra.
Y lo mejor de todo: tu forma de trabajar no cambia en nada. Cambia a G v2 en el selector de proveedor, elige una voz y genera; tus créditos actuales funcionan exactamente igual que antes.
Novedades de G v2
Un único modelo, mucho mejor
G v1 funcionaba con dos niveles: un modelo Flash más rápido y un modelo Pro de mayor calidad. G v2 lo unifica todo en Gemini 3.1 Flash TTS, un motor de voz diseñado específicamente que ofrece la calidad de Pro a la velocidad de Flash. En la tabla de clasificación independiente de TTS de Artificial Analysis —que recoge miles de preferencias de escucha humana a ciegas— se sitúa entre los modelos con sonido más natural disponibles. Un solo modelo, baja latencia y resultados de primer nivel.
Etiquetas de audio para un control palabra por palabra
Esta es la función estrella. Además de las instrucciones de habla en inglés sencillo que ya conoces, G v2 entiende las etiquetas de audio en línea: indicaciones entre corchetes que insertas directamente en tu texto para dirigir la entonación a mitad de frase:
Welcome back! [excited] You won't believe what happened next. [whispers] It was completely silent... [laughs]
Las etiquetas abarcan emociones ([excited], [curious], [frustrated]), ritmo ([slow], [fast], [long pause]) y sonidos no verbales ([laughs], [sighs], [whispers]). No hay una lista fija: el modelo hace todo lo posible por interpretar lo que pongas entre corchetes, así que puedes ser tan creativo como tu guion lo exija.
Más de 70 idiomas
G v2 admite más de 70 idiomas y variantes regionales, casi el triple de la cobertura de G v1. Incluso gestiona el cambio de idioma dentro de un mismo pasaje y guías fonéticas para términos técnicos complicados, de modo que el contenido multilingüe y mixto suene bien sin necesidad de montajes manuales.
Diálogos con varios interlocutores aún mejores
El modo de varios interlocutores sigue presente y mejor que nunca. Asigna voces distintas a cada interlocutor y genera una conversación natural entre dos personas en una sola pasada: perfecto para pódcasts, entrevistas e historias. G v2 mantiene la coherencia de la voz de cada personaje y gestiona los turnos de palabra con más naturalidad que antes.
Cómo usar G v2
- Cambia a G v2: haz clic en el botón G v2 en el selector de proveedor (junto a AZ v1) en el panel derecho.
- Elige tu modo: Single Speaker para la narración, Multi Speaker para el diálogo.
- Elige una voz: explora, busca por nombre o estilo y selecciona. En el modo de varios interlocutores, asigna una voz a cada uno.
- Añade indicaciones (opcional): escribe una instrucción de habla en inglés sencillo, inserta etiquetas de audio en línea, o ambas cosas.
- Genera: tu audio está listo en segundos.
El precio se mantiene igual
G v2 utiliza tu saldo de créditos actual a razón de 2 créditos por carácter, sin cambios respecto a G v1. Las cuentas gratuitas incluyen 10.000 créditos mensuales, y tus créditos sirven tanto para G v2 como para AZ v1, así que puedes combinar motores según el proyecto.
G v2 frente a AZ v1: cuándo usar cada una
Ambos motores siguen estando totalmente disponibles:
- Elige G v2 para una narración natural y expresiva, diálogos con varios interlocutores, control palabra por palabra con etiquetas de audio o una amplia cobertura multilingüe.
- Elige AZ v1 cuando necesites más de 500 voces o un control a nivel de SSML.
Empieza ahora
G v2 ya está disponible para todos los usuarios registrados. Entra en simpleTTS.ai Studio, cambia a G v2 y prueba tú mismo las nuevas etiquetas de audio. Tus créditos actuales funcionan de inmediato.
Estamos deseando escuchar lo que crees.


