Google은 AI 생성 음성 사운드 개선에 초점을 맞춘 두 가지 새로운 텍스트 음성 변환 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시했습니다. 설명에서 음성을 생성하고, 자세한 말하기 지시를 따르고, 두 명의 화자가 하는 대화를 처리하고, 긴 녹음에서 해당 음성을 일관되게 유지할 수 있습니다.
나레이션, 팟캐스트, 오디오북 또는 비디오 음성 해설을 위해 Gemini를 사용하는 사람들의 경우 업데이트를 통해 완성된 오디오를 훨씬 더 효과적으로 제어할 수 있습니다. 사용자는 원하는 음성의 종류를 설명하고 Gemini에게 개별 회선을 전달하는 방법을 알려줄 수 있습니다.
Gemini에게 목소리가 어떻게 들리기를 원하는지 말할 수 있습니다.
Gemini 3.8 Flash TTS는 자연어 설명에서 음성을 생성할 수 있습니다. 사용자는 성격, 악센트 및 기타 보컬 특성을 지정하거나 2,000개 이상의 기존 음성 중에서 선택할 수 있습니다. 이 모델은 100개 이상의 언어와 방언을 지원합니다.

스크립트 전체에 지침을 추가할 수도 있습니다. 예를 들어, 대사에 속삭이거나, 더 천천히 말하거나, 다른 감정을 담아 전달하거나, 웃음, 한숨, 헐떡임, “음” 또는 “예”와 같은 대화 반응을 포함할 수 있습니다. 또한 업데이트를 통해 단일 스크립트에서 두 명의 화자 대화를 생성할 수 있으며 음성과 속도는 더 긴 녹음에서 일관되게 유지될 수 있습니다.
사용자 정의 음성을 저장하고 프로젝트 전반에 걸쳐 재사용할 수도 있으므로 동일한 캐릭터나 내레이터가 점차 다르게 들리는 것을 방지하는 데 도움이 됩니다. Google은 나중에 음성 리믹싱을 추가하여 기존 음성의 피치, 속도, 음색 및 악센트를 조정할 수 있도록 할 계획입니다.
음성 복제에는 몇 가지 보호 장치가 제공됩니다.
Gemini는 30초 녹음에서 일관된 보컬 프로필을 재현할 수 있지만 단순히 음성 샘플을 제공할 수는 없습니다. 구글은 녹음이 사용자의 것이어야 하거나 사용자가 사용할 권리가 있는 음성이어야 한다고 말합니다. 또한 음성 소유자는 복제본을 생성하기 전에 참조 화자와 일치하는 별도의 구두 동의 녹음을 제공해야 합니다.
생성된 Gemini 오디오 클립에는 눈에 띄지 않는 SynthID 워터마크도 포함되어 있으며, Google은 음성 복제에 AI 생성 자료를 식별하는 데 도움이 되는 C2PA 자격 증명이 포함되어 있다고 말합니다. Gemini 3.8 Flash TTS는 Gemini Notebook, Gemini API 및 Google AI Studio를 통해 출시됩니다. 더 저렴한 Flash-Lite 모델이 Google Vids에 출시될 예정이며 더빙, 내레이션, 음성 에이전트와 같은 대규모 작업을 위해 설계되었습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요