AI & Voice

G v2 ist da: schnellere, ausdrucksstärkere KI-Stimmen mit Audio-Tags

June 11, 2026 ·5 Min. Lesezeit
G v2 ist da: schnellere, ausdrucksstärkere KI-Stimmen mit Audio-Tags

Wir machen aus G v1 jetzt G v2 – und das ist unser bislang größter Sprung bei der Qualität von KI-Stimmen. G v2 wird von Googles brandneuem Modell Gemini 3.1 Flash TTS angetrieben und löst damit die Engines Gemini 2.5 Flash und Pro ab, die hinter der ursprünglichen Version standen. Das Ergebnis: natürlichere, ausdrucksstärkere Sprache, eine deutlich breitere Sprachabdeckung und eine neue Möglichkeit, die Betonung Wort für Wort zu steuern.

Das Beste daran: An deiner Arbeitsweise ändert sich nichts. Wechsle im Anbieter-Umschalter zu G v2, wähle eine Stimme und generiere – dein vorhandenes Guthaben funktioniert genau wie zuvor.

Das ist neu in G v2

Ein einziges, besseres Modell

G v1 lief auf zwei Stufen – einem schnelleren Flash-Modell und einem hochwertigeren Pro-Modell. G v2 vereint nun alles in Gemini 3.1 Flash TTS, einer eigens entwickelten Sprach-Engine, die Pro-Qualität mit Flash-Geschwindigkeit liefert. Auf der unabhängigen TTS-Rangliste von Artificial Analysis – die Tausende anonymer Hörpräferenzen echter Menschen erfasst – zählt das Modell zu den natürlichsten, die derzeit verfügbar sind. Ein Modell, geringe Latenz, erstklassige Ausgabe.

Audio-Tags für Steuerung Wort für Wort

Das ist das herausragende Feature. Neben den Sprechanweisungen in einfachem Klartext, die du bereits kennst, versteht G v2 auch Inline-Audio-Tags – Hinweise in eckigen Klammern, die du direkt in deinen Text einfügst, um die Betonung mitten im Satz zu lenken:

Willkommen zurück! [excited] Du wirst nicht glauben, was als Nächstes passierte. [whispers] Es war vollkommen still ... [laughs]

Die Tags decken Emotionen ([excited], [curious], [frustrated]), das Sprechtempo ([slow], [fast], [long pause]) und nonverbale Geräusche ([laughs], [sighs], [whispers]) ab. Es gibt keine feste Liste – das Modell tut sein Bestes, um alles zu interpretieren, was du in die Klammern setzt. So kannst du so kreativ sein, wie es dein Skript verlangt.

Über 70 Sprachen

G v2 unterstützt über 70 Sprachen und regionale Varianten – fast dreimal so viele wie G v1. Es bewältigt sogar Code-Switching innerhalb einer einzigen Passage sowie phonetische Hilfen für kniffelige Fachbegriffe, sodass mehrsprachige und gemischtsprachige Inhalte ohne manuelles Zusammenfügen richtig klingen.

Bessere Dialoge mit mehreren Sprechern

Der Modus für mehrere Sprecher ist weiterhin dabei und besser denn je. Weise jedem Sprecher eine eigene Stimme zu und generiere ein natürliches Gespräch zwischen zwei Personen in einem Durchgang – ideal für Podcasts, Interviews und Geschichten. G v2 hält die Stimme jeder Figur konsistent und bewältigt den Sprecherwechsel natürlicher als zuvor.

So nutzt du G v2

  1. Zu G v2 wechseln – Klicke im rechten Bereich im Anbieter-Umschalter (neben AZ v1) auf die Schaltfläche G v2.
  2. Modus wählen – Einzelner Sprecher für Erzählungen, mehrere Sprecher für Dialoge.
  3. Stimme auswählen – Stöbere, suche nach Name oder Stil und triff deine Wahl. Im Modus mit mehreren Sprechern weist du jedem Sprecher eine Stimme zu.
  4. Anweisung hinzufügen (optional) – Schreibe eine Sprechanweisung in einfachem Klartext, füge Inline-Audio-Tags ein oder beides.
  5. Generieren – Dein Audio ist in Sekunden fertig.

Die Preise bleiben gleich

G v2 nutzt dein vorhandenes Guthaben mit 2 Credits pro Zeichen – keine Änderung gegenüber G v1. Kostenlose Konten enthalten 10.000 Credits pro Monat, und dein Guthaben funktioniert sowohl bei G v2 als auch bei AZ v1, sodass du die Engines pro Projekt kombinieren kannst.

G v2 vs. AZ v1: Wann nutzt du was?

Beide Engines bleiben vollständig verfügbar:

  • Wähle G v2 für natürliche, ausdrucksstarke Erzählungen, Dialoge mit mehreren Sprechern, Steuerung Wort für Wort per Audio-Tags oder eine breite mehrsprachige Abdeckung.
  • Wähle AZ v1, wenn du mehr als 500 Stimmen oder Steuerung auf SSML-Ebene brauchst.

Jetzt loslegen

G v2 ist ab sofort für alle registrierten Nutzer verfügbar. Geh ins Studio von simpleTTS.ai, wechsle zu G v2 und probiere die neuen Audio-Tags selbst aus. Dein vorhandenes Guthaben funktioniert sofort.

Wir sind gespannt, was du erschaffst.

Ähnliche Artikel