
Meta는 최초의 실시간 오디오 모델인 Muse Voice Transcribe를 출시했습니다. 이 모델은 20명 이상의 화자의 받아쓰기와 전사를 처리할 수 있으며 동시에 여러 언어를 원활하게 처리할 수 있다고 Meta는 말합니다.
플랫폼에 게시하지 않은 지 3년 만에 최근 X로 돌아온 Meta CEO Mark Zuckerberg는 여러 사용자와 언어를 동시에 처리하는 모델의 능력에 대한 예를 공유했습니다. 비디오에서 전사는 자동으로 여러 화자를 구별하고 언어를 전환할 수 있습니다. 심지어 “코드 전환”을 감지하고 여러 언어의 단어를 사용하는 문장을 전사할 수도 있습니다.
Muse Voice Transcribe는 오늘 출시되는 MSL 최초의 실시간 오디오 인식 모델입니다. 음성-텍스트 스트리밍의 SOTA는 단일 모델에서 기본적으로 화자 분할 및 엔드포인트를 처리합니다. pic.twitter.com/LViMDSkbim
— 마크 주커버그(@finkd) 2026년 9월 1일
“모델은 언제 들어야 할지 결정합니다. 적응형 지연을 사용하여 각 토큰을 예측하고 정확도를 높이면서 어려운 단어에서는 조금 더 오래 기다리고 쉬운 단어에서는 더 빠르게 커밋합니다.”라고 그는 설명했습니다. “70개 이상의 언어(출시 시 25개 검증됨)로 훈련되고, 문장 중간 코드 전환을 처리하고, 20개 이상의 화자와 함께 한 시간 동안 진행되는 세션을 관리합니다.
Meta의 출시는 유사한 기능을 자랑하는 자체 오디오 모델인 Google Gemini 3.5 Transcribe 이후 일주일도 채 지나지 않아 출시되었습니다. 그러나 Google이 오디오 모델을 Android와 (결국) Chrome에 적용하고 있는 동안 Meta가 Muse Voice Transcribe를 주력 서비스에 통합할 계획이 있는지는 확실하지 않습니다.
하지만 현재 사람들은 Meta가 최근 출시한 Meta AI Mac 앱에서 새로운 모드의 기능을 경험할 수 있습니다. Mac 앱은 다른 앱의 음성 지원 기능을 강화할 수 있으므로 Muse Voice Transcribe는 이제 다른 서비스의 받아쓰기 기능을 강화합니다. 이 모델은 Muse Code 및 Meta의 모델 API 내에서 개발자에게도 제공됩니다. 가격은 1,000분 오디오당 3달러입니다. 또한 Meta의 연구 블로그에는 Muse Transcribe의 데모 버전이 있습니다.
3/ 이미 메타 데스크톱 앱과 Muse 코드에서 받아쓰기를 지원하고 있습니다. 지금 메타 모델 api를 통해 실시간 스트리밍 중입니다https://t.co/MFosERCV0E pic.twitter.com/UESTQhKJrH
— 알렉산드르 왕(@alexandr_wang) 2026년 9월 1일
Muse Voice Transcribe는 새로운 AI 모델과 도구를 양산해 온 Meta Superintelligence Lab(MSI)의 최신 릴리스입니다. 지난 몇 주 동안 회사는 최초의 전용 코딩 에이전트인 개방형 모델과 앞서 언급한 Meta AI Mac 앱도 출시했습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요