G v2 आ गया है: ऑडियो टैग के साथ तेज़ और अधिक अभिव्यक्तिपूर्ण AI स्पीच

हम G v1 को G v2 में अपग्रेड कर रहे हैं — और यह अब तक AI स्पीच क्वालिटी में हमारी सबसे बड़ी छलांग है। G v2 Google के बिल्कुल नए Gemini 3.1 Flash TTS मॉडल से संचालित है, जो मूल रिलीज़ के पीछे मौजूद Gemini 2.5 Flash और Pro इंजनों की जगह लेता है। नतीजा: अधिक स्वाभाविक, अधिक अभिव्यक्तिपूर्ण स्पीच, कहीं ज़्यादा व्यापक भाषा कवरेज, और हर शब्द पर डिलीवरी को निर्देशित करने का एक नया तरीका।
और सबसे अच्छी बात यह है कि आपके काम करने के तरीके में कुछ भी नहीं बदलता। प्रोवाइडर टॉगल में G v2 पर स्विच करें, एक वॉइस चुनें, और जेनरेट करें — आपके मौजूदा क्रेडिट बिल्कुल पहले की तरह ही काम करते हैं।
G v2 में क्या नया है
एक ही, बेहतर मॉडल
G v1 दो टियर पर चलता था — एक तेज़ Flash मॉडल और एक उच्च-गुणवत्ता वाला Pro मॉडल। G v2 सब कुछ Gemini 3.1 Flash TTS पर समेकित कर देता है, जो एक खासतौर पर बनाया गया स्पीच इंजन है और Flash-स्तर की गति पर Pro-स्तर की क्वालिटी देता है। स्वतंत्र Artificial Analysis TTS लीडरबोर्ड पर — जो हज़ारों ब्लाइंड मानव श्रोता प्राथमिकताओं को दर्ज करता है — यह उपलब्ध सबसे स्वाभाविक-ध्वनि वाले मॉडलों में शुमार है। एक मॉडल, कम लेटेंसी, शीर्ष-स्तरीय आउटपुट।
शब्द-स्तरीय नियंत्रण के लिए ऑडियो टैग
यह सबसे प्रमुख फ़ीचर है। उन सादे-अंग्रेज़ी बोलने के निर्देशों के साथ-साथ जिन्हें आप पहले से जानते हैं, G v2 इनलाइन ऑडियो टैग को समझता है — ब्रैकेट में दिए गए संकेत जिन्हें आप सीधे अपने टेक्स्ट में डालते हैं ताकि वाक्य के बीच में ही डिलीवरी को दिशा दी जा सके:
Welcome back! [excited] You won't believe what happened next. [whispers] It was completely silent... [laughs]
टैग भावना ([excited], [curious], [frustrated]), गति ([slow], [fast], [long pause]), और गैर-मौखिक ध्वनियों ([laughs], [sighs], [whispers]) को कवर करते हैं। कोई निश्चित सूची नहीं है — मॉडल आपके ब्रैकेट में जो भी डाला है उसकी व्याख्या करने की पूरी कोशिश करता है, इसलिए आपकी स्क्रिप्ट जितनी रचनात्मकता माँगे, आप उतने रचनात्मक हो सकते हैं।
70+ भाषाएँ
G v2 70+ भाषाओं और क्षेत्रीय रूपों का समर्थन करता है — जो G v1 के कवरेज से लगभग तीन गुना है। यह एक ही पैसेज के भीतर कोड-स्विचिंग और मुश्किल तकनीकी शब्दों के लिए फ़ोनेटिक गाइड को भी संभालता है, ताकि बहुभाषी और मिश्रित-भाषा वाली सामग्री बिना किसी मैन्युअल जोड़-तोड़ के सही ढंग से सुनाई दे।
बेहतर मल्टी-स्पीकर संवाद
मल्टी-स्पीकर मोड अब भी मौजूद है और पहले से कहीं बेहतर है। हर स्पीकर को अलग वॉइस असाइन करें और एक ही पास में दो लोगों के बीच एक स्वाभाविक बातचीत जेनरेट करें — पॉडकास्ट, इंटरव्यू और कहानियों के लिए एकदम सही। G v2 हर किरदार की वॉइस को सुसंगत रखता है और बारी-बारी से बोलने को पहले की तुलना में अधिक स्वाभाविक रूप से संभालता है।
G v2 का उपयोग कैसे करें
- G v2 पर स्विच करें — दाएँ पैनल में प्रोवाइडर टॉगल में (AZ v1 के बगल में) G v2 बटन पर क्लिक करें।
- अपना मोड चुनें — नैरेशन के लिए Single Speaker, संवाद के लिए Multi Speaker।
- एक वॉइस चुनें — ब्राउज़ करें, नाम या स्टाइल से खोजें, और चुनें। मल्टी-स्पीकर मोड में, हर स्पीकर के लिए एक वॉइस असाइन करें।
- निर्देश जोड़ें (वैकल्पिक) — सादी-अंग्रेज़ी में बोलने का निर्देश लिखें, इनलाइन ऑडियो टैग डालें, या दोनों।
- जेनरेट करें — आपका ऑडियो कुछ ही सेकंड में तैयार हो जाता है।
कीमत वही रहती है
G v2 आपके मौजूदा क्रेडिट बैलेंस का उपयोग 2 क्रेडिट प्रति कैरेक्टर की दर से करता है — G v1 से कोई बदलाव नहीं। मुफ़्त अकाउंट में हर महीने 10,000 क्रेडिट शामिल हैं, और आपके क्रेडिट G v2 और AZ v1 दोनों पर काम करते हैं, इसलिए आप हर प्रोजेक्ट में इंजनों को मिला-जुला कर इस्तेमाल कर सकते हैं।
G v2 बनाम AZ v1: कब किसका उपयोग करें
दोनों इंजन पूरी तरह उपलब्ध रहते हैं:
- स्वाभाविक, अभिव्यक्तिपूर्ण नैरेशन, मल्टी-स्पीकर संवाद, ऑडियो टैग के साथ शब्द-स्तरीय नियंत्रण, या व्यापक बहुभाषी कवरेज के लिए G v2 चुनें।
- जब आपको 500+ वॉइस या SSML-स्तरीय नियंत्रण की ज़रूरत हो तो AZ v1 चुनें।
शुरुआत करें
G v2 अब सभी रजिस्टर्ड उपयोगकर्ताओं के लिए लाइव है। simpleTTS.ai Studio पर जाएँ, G v2 पर स्विच करें, और नए ऑडियो टैग को खुद आज़माकर देखें। आपके मौजूदा क्रेडिट तुरंत काम करते हैं।
आप जो बनाएँगे उसे सुनने के लिए हम बेसब्री से इंतज़ार कर रहे हैं।


