Wispr Flow, 실전 받아쓰기용 음성 모델 Canto 공개

Canto: A speech model built for the real world

Wispr Flow, 실전 받아쓰기용 음성 모델 Canto 공개

Wispr Advanced Interfaces Lab이 실시간 받아쓰기용 음성 모델 Canto를 발표했다. 2,300명 이상 화자의 실제 Wispr Flow 받아쓰기 10시간으로 평가한 결과, Canto는 Google, OpenAI, AssemblyAI, Deepgram 모델보다 낮은 단어 오류율(WER)을 기록했다. 소음·속삭임·짧은 발화 등 까다로운 조건의 3시간 챌린지 세트에서는 Gemini 3.1 Pro에 이어 2위였지만, 실시간 모델 중에서는 가장 우수했다. Canto는 지도 미세조정과 GRPO 기반 강화학습으로 훈련됐으며, 사용자 교정을 학습 신호로 활용하는 연구도 소개한다.

우리는 대규모로 음성 롤아웃을 생성하고 평가할 수 있는 인프라를 구축해, 특정 행동과 실패 모드에 맞춘 훈련 환경을 만들 수 있게 됐다.

이 날의 다른 글

2026-09-17