G v2 출시: 오디오 태그로 더 빠르고 풍부한 표현의 AI 음성

G v1을 G v2로 업그레이드합니다. 지금까지 중 AI 음성 품질에서 가장 큰 도약입니다. G v2는 Google의 최신 모델인 Gemini 3.1 Flash TTS를 기반으로 하며, 기존 버전에서 사용하던 Gemini 2.5 Flash 및 Pro 엔진을 대체합니다. 그 결과 더 자연스럽고 표현력이 풍부한 음성, 훨씬 넓어진 언어 지원, 그리고 단어 단위로 전달 방식을 조율할 수 있는 새로운 방법을 누릴 수 있습니다.
무엇보다 작업 방식은 전혀 달라지지 않습니다. 제공자 토글에서 G v2로 전환하고, 음성을 고른 뒤 생성하기만 하면 됩니다. 보유한 크레딧도 이전과 똑같이 사용됩니다.
G v2의 새로운 점
더 뛰어난 단일 모델
G v1은 두 가지 등급, 즉 더 빠른 Flash 모델과 더 높은 품질의 Pro 모델로 구동되었습니다. G v2는 이 모든 것을 Gemini 3.1 Flash TTS 하나로 통합했습니다. 이 모델은 음성 전용으로 설계되어 Flash 수준의 속도로 Pro 수준의 품질을 제공합니다. 수천 건의 블라인드 청취 선호도를 반영하는 독립 평가 기관 Artificial Analysis의 TTS 리더보드에서도 현재 사용 가능한 가장 자연스러운 모델 중 하나로 평가받았습니다. 하나의 모델, 낮은 지연 시간, 최상위 결과물입니다.
단어 단위 제어를 위한 오디오 태그
이번 업데이트의 핵심 기능입니다. 이미 익숙한 평이한 영어 발화 지시문과 더불어, G v2는 인라인 오디오 태그를 이해합니다. 텍스트 안에 직접 넣는 대괄호 형태의 신호로, 문장 중간에서 전달 방식을 조정할 수 있습니다.
Welcome back! [excited] You won't believe what happened next. [whispers] It was completely silent... [laughs]
태그는 감정([excited], [curious], [frustrated]), 속도([slow], [fast], [long pause]), 그리고 비언어적 소리([laughs], [sighs], [whispers])를 아우릅니다. 정해진 목록은 없습니다. 모델이 대괄호 안에 넣은 내용을 최대한 해석하려 하므로, 대본이 요구하는 만큼 자유롭게 창의력을 발휘할 수 있습니다.
70개 이상의 언어
G v2는 70개 이상의 언어 및 지역 변형을 지원합니다. G v1 대비 거의 세 배에 달하는 범위입니다. 한 단락 안에서의 코드 스위칭은 물론, 까다로운 기술 용어를 위한 발음 가이드까지 처리하므로, 수동으로 짜깁기하지 않아도 다국어 및 혼합 언어 콘텐츠가 자연스럽게 들립니다.
향상된 다중 화자 대화
다중 화자 모드는 그대로 유지되며 그 어느 때보다 좋아졌습니다. 각 화자에게 서로 다른 음성을 지정하고 한 번에 자연스러운 2인 대화를 생성할 수 있어, 팟캐스트와 인터뷰, 스토리텔링에 안성맞춤입니다. G v2는 각 인물의 음성을 일관되게 유지하며, 이전보다 더 자연스럽게 발화 순서를 처리합니다.
G v2 사용 방법
- G v2로 전환 — 오른쪽 패널의 제공자 토글에서 (AZ v1 옆에 있는) G v2 버튼을 클릭하세요.
- 모드 선택 — 내레이션은 단일 화자, 대화는 다중 화자를 선택하세요.
- 음성 선택 — 둘러보거나 이름 또는 스타일로 검색해 고르세요. 다중 화자 모드에서는 화자별로 음성을 지정합니다.
- 연출 추가(선택 사항) — 평이한 영어로 발화 지시문을 작성하거나, 인라인 오디오 태그를 넣거나, 둘 다 사용하세요.
- 생성 — 몇 초 만에 오디오가 준비됩니다.
가격은 그대로
G v2는 기존 크레딧 잔액을 문자당 2크레딧 비율로 사용합니다. G v1과 동일합니다. 무료 계정에는 매월 10,000크레딧이 포함되며, 크레딧은 G v2와 AZ v1 모두에서 사용할 수 있으므로 프로젝트마다 엔진을 섞어 쓸 수 있습니다.
G v2 vs. AZ v1: 언제 무엇을 쓸까
두 엔진 모두 계속 완전하게 이용할 수 있습니다.
- G v2를 선택하세요 — 자연스럽고 표현력 있는 내레이션, 다중 화자 대화, 오디오 태그를 이용한 단어 단위 제어, 또는 폭넓은 다국어 지원이 필요할 때.
- AZ v1을 선택하세요 — 500개 이상의 음성이나 SSML 수준의 제어가 필요할 때.
시작하기
G v2는 모든 등록 사용자에게 지금 바로 제공됩니다. simpleTTS.ai 스튜디오로 이동해 G v2로 전환하고, 새로운 오디오 태그를 직접 사용해 보세요. 보유한 크레딧이 바로 적용됩니다.
여러분이 만들어낼 작품이 무척 기대됩니다.


