Skip to content

Google은 최신 Gemini 전사 모델을 통해 귀하의 횡설수설을 구조화된 텍스트로 바꿀 수 있다고 말합니다.

Posted in tech

Google은 향상된 음성 인식 및 전사 기능을 제공하는 새로운 AI 오디오 모델을 공개했습니다. 이 회사는 Gemini 3.5 Transcribe가 이전 모델보다 음성을 텍스트로 변환하는 데 더 능숙하며 더 정확하고 85개 이상의 언어를 자동으로 감지하는 기능을 갖추고 있다고 밝혔습니다. 이 모델은 사용자의 구조화되지 않은 음성을 형식화된 텍스트로 조정할 수 있다고 말합니다. 이를 사용하여 음성 명령으로 편집할 수 있으며, 녹음된 음성에서도 필러 단어를 제거합니다.

구글은 이 모델이 맞춤형 어휘와 고유한 철자를 학습할 수 있으며 주문 번호 및 우편번호와 같은 영숫자 문자열을 캡처하는 데 능숙하다고 말합니다. 또한 회사는 Gemini 3.5 Transcribe가 사전 녹음된 오디오를 기반으로 단어 수준 타임스탬프를 사용하여 최대 3명의 화자에게 음성을 전달할 수 있다고 주장합니다. 예를 들어 팟캐스트를 복사할 때 유용할 수 있습니다.

Gemini 3.5 Transcribe가 Pixel 11 시리즈 휴대폰과 같은 Android 장치와 macOS의 Gemini 앱(다른 Gemini 모델과 함께 작동하여 에이전트 작업을 수행할 수 있음)에서 Rambler 기능을 지원한다는 것은 놀라운 일이 아닙니다.

흥미롭게도 Google은 곧 Chrome 웹페이지의 모든 필드에서 텍스트 음성 변환을 사용할 수 있다고 말합니다. 예를 들어 답글과 게시물을 지시하고 음성을 사용하여 Gemini에게 메시지를 보낼 수 있습니다. Gemini 3.5 Transcribe는 회사의 에이전트 개발 플랫폼인 Google Antigravity에서도 사용할 수 있으며 Search Live, Gemini Live, Docs, Keep 및 Gmail에도 출시될 예정입니다. 개발자는 API를 통해 모델을 활용할 수 있습니다.

업데이트, 2026년 8월 26일 오후 2시 05분(ET): Google이 아직 공개적으로 발표하지 않은 일부 정보를 제거하도록 업데이트되었습니다.

관련 정보는 아래 링크에서 확인하세요

완벽 가이드 보기

관련 기사

Be First to Comment

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다