구글 ‘Gemini 3.8 TTS’ 공개…30초 음성으로 캐릭터 만들고 대사별 연기 지시
구글이 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 공개했습니다. 고품질 제작용과 대량·저지연 처리용으로 역할을 나누고, 자연어 음성 설계와 30초 샘플 기반 복제, 대사별 감정·속도·방언 지시, 두 화자 장면 생성을 한 API 체계에 담았습니다. 게임·오디오북·더빙 제작의 반복 비용을 낮출 가능성이 크지만, 동의 확인과 SynthID 워터마크가 실제 유통 과정에서도 유지되는지가 핵심 검증 과제입니다.
한 모델이 아니라 제작용과 운영용 두 갈래
구글은 9월 23일 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. Flash는 연기 뉘앙스와 지역 억양, 여러 화자의 장편 안정성을 중시하는 상위 제작 모델이고, Flash-Lite는 읽어주기·음성 에이전트·대량 더빙처럼 처리량과 지연이 중요한 작업을 겨냥합니다. 두 모델은 Google AI Studio와 Gemini API 등에서 사용할 수 있습니다.
기능표상 Flash는 130개 언어, Lite는 101개 언어를 지원합니다. 두 모델이 같은 요청 구조를 쓰기 때문에 개발자는 모델 이름을 바꿔 품질 우선과 비용·속도 우선 경로를 나눌 수 있습니다. 다만 지원 언어 수가 곧 모든 언어의 동일한 자연스러움이나 발음 정확도를 뜻하지는 않아 실제 대상 언어별 청취 검수가 필요합니다.
30초 샘플 또는 문장으로 목소리를 설계한다
Flash TTS는 역할, 억양, 음색을 자연어로 설명해 새 캐릭터 음성을 만들 수 있습니다. 구글은 2,000개가 넘는 제작 준비 음성 라이브러리와 함께 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역 변형을 제시했습니다. 게임 스튜디오는 임시 대사를 빠르게 만들고, 확정된 인물의 음색을 프로젝트에 저장해 후속 장면에서 반복 사용할 수 있습니다.
권리가 있는 목소리는 30초 음성 샘플로 복제할 수 있다고 설명합니다. 여기서 중요한 변화는 단순한 프리셋 선택이 아니라 인물 설정과 대사 연출이 같은 제작 흐름에 들어왔다는 점입니다. 그러나 샘플이 짧을수록 감정 폭과 발음 예외를 모두 대표하기 어렵고, 최종 공개물은 성우의 계약 범위와 사용 기간을 별도로 관리해야 합니다.
대사마다 속도·감정·반응음을 따로 지시
새 스키마는 화자와 지속적인 말하기 스타일을 `speech_metadata`에 넣도록 요구합니다. 웃음, 한숨, 기침, 숨소리, 짧은 멈춤처럼 특정 순간에만 발생하는 표현은 본문 안 태그로 남깁니다. 두 화자의 장면도 한 스크립트에서 분리해 생성할 수 있어 팟캐스트나 게임 컷신의 초벌 녹음과 반복 수정에 유용합니다.
이전 방식처럼 ‘기쁘게 말해’라는 지시를 대사 텍스트에 섞으면 그 문장 자체가 읽힐 수 있습니다. 또 기본 출력이 헤더 없는 PCM에서 WAV로 바뀌었으므로 기존 파이프라인이 WAV 헤더를 다시 씌우면 파일이 깨질 수 있습니다. 모델 교체는 이름 한 줄로 가능해도 메타데이터와 출력 형식의 마이그레이션은 반드시 시험해야 합니다.
게임 제작에서 빨라지는 것과 남는 사람의 일
게임 개발에서는 퀘스트 분기와 언어별 대사가 수천 줄로 늘어날 때 임시 음성 제작이 병목이 됩니다. 이번 모델은 캐릭터별 목소리를 저장하고 대사 단위로 속도와 감정을 바꾸며 여러 언어를 같은 도구에서 생성할 수 있어 플레이테스트용 음성, 접근성 읽기, 지역화 샘플을 빠르게 만드는 데 맞습니다. 확정 녹음 전에 연출 의도를 소리로 검증하는 범위가 넓어집니다.
그렇다고 성우·음향감독·현지화 검수의 역할이 사라지는 것은 아닙니다. 서사의 맥락, 장면 간 감정 축적, 고유명사 발음, 문화적 말투는 자동 생성만으로 판단하기 어렵습니다. 특히 복제 음성을 상업 작품에 쓸 때는 최초 동의뿐 아니라 재사용 범위, 수정 권한, 보상, 삭제 요청을 제작 계약에 명시해야 합니다.
동의 확인·워터마크가 유통까지 이어져야
구글은 음성 복제 전 소유자가 참조 화자와 일치하는 동의 문장을 녹음하도록 하고, Gemini Audio가 만든 모든 클립에 눈에 띄지 않는 SynthID 워터마크를 넣는다고 밝혔습니다. 생성 사실을 표시하는 C2PA 자격 정보도 안전장치로 제시했습니다. 이는 무단 사칭의 문턱을 높이지만, 잘라내기·재인코딩·다른 편집 도구를 거친 뒤 탐지가 유지되는지는 독립 검증이 필요합니다.
이번 공개의 핵심은 TTS가 문장을 읽는 기능에서 ‘목소리 캐스팅과 연출을 코드로 관리하는 제작 도구’로 이동했다는 데 있습니다. 개발팀은 음질 시연만 보지 말고 언어별 오류율, 지연, 비용, 권리 기록, 워터마크 보존을 함께 시험해야 합니다. 빠른 합성이 신뢰할 수 있는 제작 공정이 되려면 기술 성능과 동의 증명이 같은 수준으로 운영돼야 합니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목
미니게임 고르기 ▶