Gemini 3.5 Transcribe는 완벽한 말하는 사람이 되는 것에 대한 걱정을 멈추기를 바랍니다.

우리 모두는 큰 소리로 말할 때 말을 가로막고, 되돌아가고, 넘어집니다. Google의 새로운 Gemini 3.5 Transcribe는 불완전한 음성을 염두에 두고 제작되었습니다. 지금까지 회사에서 가장 정확한 음성-텍스트 모델로 발표된 이 모델은 뉴스 앵커처럼 들릴 것이라고 기대하지 않고 지저분하고 다듬어지지 않은 음성을 깨끗하고 서식이 지정된 텍스트로 변환합니다.

Gemini 3.5 Live 및 Gemini 3.5 Live Experimental이라는 두 개의 동반 모델과 함께 출시되며, 이 세 가지가 함께 Google이 “Gemini Audio”라는 브랜드를 구성합니다.

지금까지 가장 정확한 음성-텍스트 모델인 Gemini 3.5 Transcribe를 소개합니다

오디오를 85개 이상의 언어로 정확하게 변환하여 “ums” 및 “ahs”와 같은 필러 단어를 제거하는 동시에 자체 수정을 처리하고 의도를 포착하여 다음을 사용하여 작업을 완료할 수 있습니다. pic.twitter.com/4GgHjSd301

— 구글(@Google) 2026년 8월 26일

Gemini 3.5 Transcribe가 음성을 정리하는 방법

모델은 “음” 및 “아”와 같은 필러 단어를 자동으로 제거하므로 복사된 텍스트에 모든 언어 문제가 포함되지 않습니다. 실시간으로 자체 수정 사항도 잡아주기 때문에 “화요일, 기다리지 말고 수요일에 만나자”라고 말하면 수요일을 의미한 것으로 이해하고 그에 따라 조정합니다. 음성만으로 텍스트를 편집할 수도 있습니다.

또한 모델은 현재 macOS의 Gemini 앱에 있는 기능인 함수 호출을 통해 이미지 생성이나 파일 분석과 같은 작업을 다른 Gemini 모델에 위임할 수도 있습니다.

Gemini 3.5 Transcribe는 @Android에서 Rambler를 지원합니다.

우리는 말한 생각을 세련된 텍스트로 바꾸는 데 도움을 주기 위해 Android 쇼에서 Rambler를 처음 소개했습니다.

3.5 Transcribe를 사용하여 자동으로 필러 단어를 제거하고 음성을 정리합니다. 음성을 사용하여 편집하고 수정하는 것도 가능합니다… pic.twitter.com/BTHQuDYtkB

— 구글(@Google) 2026년 8월 26일

Google은 실시간 스트리밍의 경우 단어 오류율이 4%, 사전 녹음된 오디오의 경우 2.6%에 불과하고 85개 이상의 언어, 지역 억양 및 전문 용어를 지원하여 이를 뒷받침하는 강력한 정확도 수치를 보고합니다. 타임스탬프와 함께 녹음에서 음성을 최대 3명의 화자에게 귀속시킬 수도 있습니다.

Gemini 3.5 Transcribe가 이미 설치된 Google 앱

이 모델은 실험실 어딘가에 앉아 있지 않습니다. 이미 macOS의 Gemini 앱과 함께 Android Gboard의 받아쓰기 기능인 Rambler를 지원하고 있습니다. Chrome 지원이 곧 제공될 예정이며 이를 통해 모든 웹 필드에 직접 지시할 수 있습니다.

개발자는 이제 Google AI Studio 및 Google 에이전트 코딩 플랫폼인 Antigravity에서 이에 액세스할 수 있습니다. 기업 사용자는 Gemini Enterprise Agent Platform을 통해 액세스합니다. 또한 Search Live, Gemini Live, Docs, Keep 및 Gmail로 확장됩니다. 따라서 다음번에 당신이 휴대폰을 만지작거리고 있을 때, Gemini는 당신 자신보다 당신을 더 잘 이해할 수도 있습니다.

관련 정보는 아래 링크에서 확인하세요

완벽 가이드 보기

관련 기사

댓글 남기기