우리 모두는 큰 소리로 말할 때 말을 가로막고, 되돌아가고, 넘어집니다. Google의 새로운 Gemini 3.5 Transcribe는 불완전한 음성을 염두에 두고 제작되었습니다. 지금까지 회사에서 가장 정확한 음성-텍스트 모델로 발표된 이 모델은 뉴스 앵커처럼 들릴 것이라고 기대하지 않고 지저분하고 다듬어지지 않은 음성을 깨끗하고 서식이 지정된 텍스트로 변환합니다.
Gemini 3.5 Live 및 Gemini 3.5 Live Experimental이라는 두 개의 동반 모델과 함께 출시되며, 이 세 가지가 함께 Google이 “Gemini Audio”라는 브랜드를 구성합니다.
Gemini 3.5 Transcribe가 음성을 정리하는 방법
모델은 “음” 및 “아”와 같은 필러 단어를 자동으로 제거하므로 복사된 텍스트에 모든 언어 문제가 포함되지 않습니다. 실시간으로 자체 수정 사항도 잡아주기 때문에 “화요일, 기다리지 말고 수요일에 만나자”라고 말하면 수요일을 의미한 것으로 이해하고 그에 따라 조정합니다. 음성만으로 텍스트를 편집할 수도 있습니다.
또한 모델은 현재 macOS의 Gemini 앱에 있는 기능인 함수 호출을 통해 이미지 생성이나 파일 분석과 같은 작업을 다른 Gemini 모델에 위임할 수도 있습니다.
Google은 실시간 스트리밍의 경우 단어 오류율이 4%, 사전 녹음된 오디오의 경우 2.6%에 불과하고 85개 이상의 언어, 지역 억양 및 전문 용어를 지원하여 이를 뒷받침하는 강력한 정확도 수치를 보고합니다. 타임스탬프와 함께 녹음에서 음성을 최대 3명의 화자에게 귀속시킬 수도 있습니다.
Gemini 3.5 Transcribe가 이미 설치된 Google 앱

이 모델은 실험실 어딘가에 앉아 있지 않습니다. 이미 macOS의 Gemini 앱과 함께 Android Gboard의 받아쓰기 기능인 Rambler를 지원하고 있습니다. Chrome 지원이 곧 제공될 예정이며 이를 통해 모든 웹 필드에 직접 지시할 수 있습니다.
개발자는 이제 Google AI Studio 및 Google 에이전트 코딩 플랫폼인 Antigravity에서 이에 액세스할 수 있습니다. 기업 사용자는 Gemini Enterprise Agent Platform을 통해 액세스합니다. 또한 Search Live, Gemini Live, Docs, Keep 및 Gmail로 확장됩니다. 따라서 다음번에 당신이 휴대폰을 만지작거리고 있을 때, Gemini는 당신 자신보다 당신을 더 잘 이해할 수도 있습니다.
관련 정보는 아래 링크에서 확인하세요