구글, Gemini 3.8 TTS 출시: 30초 샘플로 음성 복제, 배치 생성 시간당 $0.27
- 구글이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시함. 자연어 프롬프트로 새 캐릭터 음성을 설계하고 대사 한 줄씩 속도·감정·방언·추임새를 지시할 수 있음
- 30초 음성 샘플로 일관된 음성을 재현하는 음성 복제 기능이 동의 확인, SynthID 워터마킹, C2PA 자격 증명을 함께 넣어 제공됨
- 시간당 가격은 3.8 Flash TTS 표준 $0.81, 배치 $0.41, Flash-Lite 표준 $0.54, 배치 $0.27임. 한 댓글러 계산으로 10시간 오디오북 배치 생성이 $5~10 수준
- 배포 범위는 Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids이며 기존 30개 프리셋 음성을 넘어 무제한 음성 라이브러리를 표방함
- 해커뉴스 댓글에선 프롬프트가 실제 출력에 반영되지 않고 여성 음성이 획일적이라는 지적이 나옴. 로컬 대안으로 Qwen3 TTS Voice Design, Fish Audio, Kokoro 기반 pdf-narrator가 거론됨
Hacker News opinions
내가 만든 로컬 오디오북 앱 KeenLore 소개함. Gemma 4로 원문 분석하고 Qwen3 TTS Voice Design으로 음성 샘플 만들어서 캐릭터별 목소리로 책을 읽어줌.
인용 대사 귀속 정확도는 97.2%(499개 중 485개) 나오고 8GB T1000 GPU, 96GB RAM에서 돌아감. 클라우드도 토큰비도 없음.
링크 임의로 따라가게 하는 거 좀 불쾌하다. 영상 제목은 'KeenLore 데모'이고 내용은 웹 UI에 텍스트 파일 읽는 로컬 스택임.
난 오디오북만 수백 시간 들었는데 그냥 글만 봐도 뇌가 캐릭터 목소리를 채운다고 봄. 성우가 연기하는 건 재미있지만 꼭 필요하진 않음.
이런 걸 만들려고 벼르고 있었는데, 읽는 방식에 영향 주는 무대 지시를 텍스트에 끼워 넣을 수 있나?
비슷한 프로젝트 올해 내내 하는 중인데 조언 하나면 Qwen3 대신 Fish Audio나 Higgs 써봐. 운율이 훨씬 좋아서 길게 듣기 편함.
구글이 30초 샘플 복제를 실은 거 보니 다른 곳에서 이미 널리 퍼져서 부담이 줄었나 봄.
GPT-Lite처럼 '내가 이 목소리 주인이고 합성에 동의한다'는 문장 샘플을 요구하겠지. 아니면 로컬 클론이 이미 그 정도라 구글이 특별히 책임지는 게 아닐까 하고.
어젯밤 QwenTTS 1.7B로 깨끗한 데이터셋 만들고 파인튜닝 레시피 실험해서 robo-me 만들었는데 몇 시간 만에 가족이 깜짝 놀랄 정도로 잘 나옴. 고양이는 가방에서 나왔지.
"Super tinny monotone robotic voice" 결과가 하나도 티니하거나 단조롭지 않아. 90년대 TTS나 영화 속 로봇 연기랑 비교하면 오히려 인간 쪽인데.
예시 전부 프롬프트가 요구한 게 아님. 이미지 모델이랑 같아서 컴퓨터가 만들었다는 사실에 놀라면 결과물이 원하는 게 아니라는 걸 깨닫게 됨.
스타 트랙 팬픽 시즌 2 에피소드 17까지 쓰고 있는데 오디오 드라마로 만들려면 GPT-Live는 목소리 구분이 안 되고 연출 통제가 부족함. 이 모델의 대사별 제어는 도움될 듯.
다만 5,286개쯤 되는 Gemini 제품 중 뭔지, 내 텍스트 파일을 어떻게 넣는지, 학습에 내 데이터가 어떻게 쓰이는지가 불명확함. 나중에 로컬 대안이 나오길 기다리는 중.
alexandria-audiobook이랑 Qwen3-TTS, 그리고 pdf-narrator(Kokoro 프론트엔드) 추천함. 2020년형 M1 맥북에어 8GB로 무료 오디오북 만드는 중이고 am_michael 목소리가 최애임.
AI 이메일 답장에 이어서 전화로 내 연락처 목소리를 흉내내는 AI까지 생기겠네. 아주 좋군.
10시간짜리 오디오북 배치 생성하면 대충 $5~10임. 시간당 Flash 표준 $0.81, 배치 $0.41, Flash-Lite $0.54, 배치 $0.27이더라.
이걸 구글 플레이 북 오디오북 기능에 넣으면 좋을 텐데 거긴 아직 목소리가 구식임. AI 적용하기에 가장 좋은 곳인데 왜 안 하는지 모르겠음.
해커뉴스에서 보는 새 음성 모델 수 대비 내가 쓰는 제품에 실제 탑승된 수는 사실상 0임.
TTS 영국식 억양이 그럴듯한 걸 단 한 번도 못 봤음. 전부 미국인이 억지로 흉내 낸 것처럼 들린다고.
성우는 당분간 안전함. 기술은 엄청난데 결과가 별로고 프롬프트와도 잘 안 맞아서 핵심 요소가 통째로 무시되는 예시가 대부분임.
남성 음성은 그럴듯한데 여성 음성은 전부 똑같이 인공적으로 들리더라. 토이스토리 목소리도 떠오르고. 학습 데이터 편향인가?
AI Studio에서 Voice Design 돌리면 에러 나고 음성 복제는 우리 지역에선 미지원임. 중성 음성도 없고 Gaming 유스케이스는 아예 비어 있고 가격표도 없음. 롤아웃이 엉성해.