신모델·

구글 제미나이 3.8 TTS 공개, 목소리 무한 생성 시대 열렸다

한 줄 요약구글 제미나이 3.8 TTS, 프리셋 30개→무한 커스텀 음성으로 진화…휴메 1위 달성
광고

구글이 목소리 스튜디오를 열었다

구글이 제미나이 3.8 플래시 TTS와 플래시-라이트 TTS를 공개했다. 기존 30개 프리셋 목소리에서 무한 커스텀 음성 라이브러리로 확장했다. 구글 AI 스튜디오, 제미나이 API, 제미나이 엔터프라이즈, 제미나이 노트북, Google Vids에서 즉시 쓸 수 있다.

단순 텍스트 읽기를 넘어섰다. 억양, 감정, 액센트까지 프롬프트로 지정한다. 멜버른 DJ 톤, 단조로운 로봇 목소리, 일본어 용 목소리까지 시연 영상에 담겼다. 두 화자 대화 시나리오도 줄 단위로 연출 가능하다.

벤치마크 1위, 그런데 체감은?

휴메 AI 보이스 디자인 벤치마크에서 종합 71.4점으로 1위다. 액센트 모델링도 60.8점으로 선두. 전체 품질 지수에서도 플래시 1위, 플래시-라이트 2위를 차지했다. 블라인드 테스트에서 다음 언어들에서 상위권을 기록했다.

  • 일본어
  • 브라질 포르투갈어
  • 베트남어
  • 현대 표준 아랍어
  • 멕시코 스페인어
  • 힌디어

한국어는 100개 이상 지원 언어 명단에 포함돼 있다. 다만 한국어별 블라인드 테스트 순위는 자료에 없다.

구글은 이전 3.1 플래시 TTS 대비 장문 콘텐츠와 듀얼 화자 제어에서 대폭 개선됐다고 밝혔다. 구체적 지연 시간이나 가격 정책은 아직 공개되지 않았다. 벤치마크 점수가 실사용 품질을 보장하지는 않는다. 이 대목이 걸린다.

광고

안전장치는 이중으로 걸었다

음성 복제 기능에는 동의 검증이 필수다. 원본 화자의 육성 동의 녹음을 제출해야만 복제 목소리를 생성할 수 있다. 모든 출력 오디오에는 신스아이디 워터마크가 심어진다. 사람 귀엔 안 들리지만 탐지 도구로는 AI 생성 음성임을 확인 가능하다.

모델 카드에 상세 정책이 있다. 하지만 동의 녹음 검증이 실제 서비스에서 얼마나 엄격하게 작동할지는 지켜봐야 한다.

개발자 생태계가 이미 움직인다

개발 플랫폼 4곳이 제미나이 API 연동을 마쳤다.

  • 아고라
  • 라이브킷
  • 파이프캣
  • 버셀

서비스 통합 중인 기업 6곳.

  • 피그마
  • 헤이젠
  • 링구아나
  • 원더크래프트
  • 99.co
  • 올랑

글로벌 더빙, 지역 액센트 현지화, 대화형 음성 에이전트 확장이 목표다.

쉽게 풀어보면

구글이 목소리 무한 생성 도구를 내놨다. 이전에는 구글이 준비한 30개 목소리 중에 골라 썼다. 이제는 "차분한 40대 남성, 부산 사투리, 약간 코맹맹이 소리" 같은 식으로 묘사하면 새 목소리를 그 자리에서 만들어 준다.

오디오북 제작자가 주인공 목소리를 직접 설계할 수 있다. 게임 개발자는 NPC마다 다른 억양을 입힌다. 팟캐스트 제작자는 게스트 목소리 없이도 대본을 연출한다. 두 사람 대화도 한 줄씩 톤을 지정해 자연스러운 턴테이킹이 가능하다.

비유하자면 성우 캐스팅 디렉터가 내 컴퓨터에 들어온 셈이다. 단, 이 디렉터는 한국어를 포함한 100개 언어를 소화하고, 만든 목소리마다 눈에 안 보이는 워터마크를 찍어 보낸다.

나에게 미치는 영향

지금 바로 해볼 수 있다. 구글 AI 스튜디오에 접속하면 무료로 테스트 가능하다. 목소리를 프롬프트로 만들고, 듀얼 화자 에디터에서 대사를 줄 단위로 연출해 본다. 개발자라면 제미나이 API 키만 있으면 연동 끝.

이런 분들이 바로 써먹을 수 있다.

  • 오디오북·팟캐스트 제작자: 성우 섭외 비용과 일정 단축
  • 게임·앱 기획자: 프로토타입 단계에서 바로 음성 더빙 테스트
  • 콘텐츠 현지화팀: 한국어 원문을 멕시코 스페인어, 브라질 포르투갈어 액센트로 즉시 변환

주의할 점.

  • 상업용으론 제미나이 엔터프라이즈나 유료 API 티어가 필요할 수 있다
  • 가격표 미공개, 무료 티어 한도도 미공개
  • 수익 모델 확정 전엔 프로토타입·내부 검토용으로만 쓰는 게 안전하다

경쟁 모델과 비교하면

오픈소스 진영에선 Qwen3-TTS가 이미 로컬 실행으로 비슷한 기능을 보여줬다. 해커뉴스 댓글에선 "올해 초부터 유튜브 영상에서 목소리 따와 내 텍스트 읽게 했다"는 증언도 있다. 구글의 차별점은 클라우드 안정성, 100개 언어 지원, 안전장치, 에코시스템 연동이다.

일레븐랩스 등 기존 TTS 강자들과는 가격·품질·지연시간 삼각 비교가 필요하다. 벤치마크 1위지만 실서비스에서 얼마나 우위인지는 독립 검증이 나와야 안다.

남은 쟁점

가격표가 없다. 무료 한도, 종량제 단가, 엔터프라이즈 계약 조건이 모두 미공개다. 한국어 품질에 대한 독립 평가도 아직 없다. 동의 검증 우회 가능성, 워터마크 제거 기술 등장 여부도 지켜봐야 한다.

구글은 "오늘부터 개발자 체험 가능"이라고만 했다. 정식 출시 일정, SLA, 데이터 거버넌스 정책은 후속 발표를 기다려야 한다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고