Grok Voice Transcribe 2.0, 32개 스트리밍 모델 중 정확도 1위

xAI가 Grok Voice Transcribe 2.0을 공개했다. 실제 환경의 시끄럽고 다국어가 섞인 오디오로 학습해, Artificial Analysis 리더보드에서 32개 스트리밍 모델 중 정확도 1위를 기록했다. 짧은 구문의 단어 오류율은 20.6%에서 6.8%로 줄었고, 가격은 1.0과 동일하다. 화자 분리, 단어별 타임스탬프, 키텀 바이어싱 등 기능도 갖췄다.

Grok Voice Transcribe 2.0은 수십 개 언어를 전사하고, 언어를 자동 감지하며, 녹음 중간에 언어가 바뀌어도 한 번에 따라간다.

이 날의 다른 글

2026-09-18