Apple SpeechAnalyzer完胜Whisper

Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor

Apple SpeechAnalyzer完胜Whisper

我们刚刚完成了一场硬核测试,将Apple最新的SpeechAnalyzer API与Whisper系列模型及旧版SFSpeechRecognizer进行了直接对比。结果令人震惊:SpeechAnalyzer在LibriSpeech数据集上的准确率全面碾压Whisper Small,错误率低至2.12%,同时速度却快了约三倍。更讽刺的是,Apple自家的旧引擎SFSpeechRecognizer表现甚至不如40MB的Whisper Tiny。对于在Apple设备上开发应用的朋友,迁移到SpeechAnalyzer已是必选项,它不仅精准度大幅提升,还能输出带标点和大小写的文本。这次测试也意外帮我们揪出了产品中的一个严重Bug。

对于英语转录任务,在当前的iPhone或Mac上,Whisper自动成为首选准确性的日子已经结束了。
  • 尽管 SpeechAnalyzer 在准确率和速度上完胜 Whisper,但 Whisper 凭借跨平台支持和 100+ 种语言覆盖,依然拥有更宽的生态护城河。
  • 一位 iOS 开发者指出,SpeechAnalyzer 要求每种语言单独下载模型,这虽然减小了 App 体积,却给处理多语言混合音频带来了显著的开发障碍。
  • 开发者实测发现,SpeechAnalyzer 支持流式处理(streaming),能实时显示识别结果,相比传统录音后批量转录的模式,带来了巨大的 UX 提升。
  • 有观点反驳称,Whisper v3 在处理低质量输入(如监控背景音)时表现依然最强,尽管其更容易产生幻觉,这体现了不同场景下的性能权衡。
  • 针对专业领域术语(如代码符号),现有工具仍难以精准识别,用户希望看到类似 LSP 的上下文集成,以区分专有名词和普通发音。

同日更多故事

2026-07-13