transcribe.cpp:本地语音转写新利器

我是 Handy 的维护者,今天兴奋地向大家推出 transcribe.cpp。这是一个基于 ggml 构建的语音转写库,旨在解决当前跨平台 ASR 应用分发困难的问题。它支持 16 个 ASR 家族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现全面加速。与 whisper.cpp 不同,我们不仅提供了数值验证和 WER 测试,确保推理结果与参考实现高度一致,还原生支持 Python、JavaScript/Typescript、Rust 和 ObjC/Swift 四种语言的绑定。无论是 Mac、Windows 还是 Linux,你都能轻松部署,让本地推理更快速、更准确,无需依赖云端服务。

更快的实时转写配合最先进模型,仅需数瓦功耗即可运行,这不再是幻想,而是事实。
  1. rmunn

    看起来非常酷。我一直在寻找的一个功能,这个项目似乎没有涵盖(至少在模型文档里我没看到任何关于 IPA 的提及),那就是用国际音标(IPA)对未知语言进行语音转写(基于声音的拼写,而非基于含义的拼写)。我认识几位正在研究少数族裔语言的語言学家(有些语言的使用者甚至不到 1 万人),这些语言规模太小,永远不可能有足够的人力去训练针对该语言的专用模型。

    有没有我不知晓的、专门为此任务训练的模型?即输入未知语言的音频,不识别具体语言,而是直接将声音转写为 IPA?这对大多数人来说可能没用,但对于全球许多研究少数族裔语言的語言学家来说,这简直是救星。

  2. ghm2199

    恭喜发布。我喜欢在 Mac 和手机上使用 Handy,特别是在原生 STT 模型无法使用或表现不佳的情况下(例如 Apple 的东西不够好,会错误翻译某些特定领域的词汇)。

    新手问题:你觉得通过基金会获得资金来维护这个项目怎么样?(我不确定你是否需要,但我确实希望你能通过某种方式获得报酬,因为 Handy 太棒了)。如果你已经或打算通过寻求支持来为这样的项目获得报酬,你会寻找什么样的组织来提供支持,又会怎么做呢?

  3. abdullahkhalids

    给任何想在此基础上构建应用的人:我尝试过几种不同的 STT 系统,它们都能准确捕捉我说的话。不幸的是,它们不支持我想要的合理工作流。

    我想打开一个办公文档,然后开始说话。我希望软件能在我说话时,以最低延迟在光标处持续输入我所说的内容。这个“持续”的部分至关重要。很多软件要等我停止录音后才会粘贴我说的话,但这并不实用。

  4. simonw

    > 维护者支持 4 种语言的绑定

    不错。这是 Python 版本的链接:https://github.com/handy-computer/transcribe.cpp/tree/main/b... - 看起来它目前还没有作为包含依赖项的二进制 wheel 包发布在 PyPI 上(PyPI 上现有的库使用 ctypes 调用单独安装的库),但这计划在未来的版本中推出。

  5. bengotow

    这是对社区的一项不可思议的贡献,而且……只是一个人?我读着读着,以为底部会宣布 Series A 轮融资。

    这很好地提醒了我们:你可以用 AI 以最快的速度炮制垃圾,也可以用它来放大你的雄心,构建出比以往任何时候都更严谨、更持久的东西。

    我会把 Transcribe.cpp 集成到我维护的应用中,但我感觉这种功能(通常)应该集成到操作系统中,或者通过像 Handy 这样的应用实现“无处不在”。

  6. aomix

    发现这个的时机真好。我最近看到越来越多的人讨论将 TTS 纳入他们的提示工具包,也想尝试一下。那种“对着文档随意倾倒思绪 -> 编辑润色 -> 发送给机器人”的循环听起来很有吸引力。

  7. aarvin_roshin

    一针见血:

    > 展望未来,出于各种原因,越来越多的推理将在本地进行。这让分发故事变得至关重要。为了让更多应用在本地运行推理,我们需要让运行推理变得更简单。

    这让这些项目变得更值得信赖、更容易上手:

    > 这里的任何单词是用 AI 写的吗?不是。它们来自我的嘴巴或我的手指。

  8. ukuina

    给这个项目添加说话人分离(speaker separation)最简单的方法是什么?

同日更多故事

2026-07-19