transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,统一 16 个 ASR 模型族
开源语音转录应用 Handy 的作者兼维护者今日正式发布 transcribe.cpp v0.1.0——一个基于 ggml 的跨平台语音转录推理库,目标是成为 whisper.cpp 的直接替代品。作者表示,该库源于自己向大量用户分发跨平台语音转文字应用时遭遇的现实痛点:当前 ASR 推理栈基本只有 whisper.cpp 和 ONNX 两条路,性能和模型支持都难以兼得。
transcribe.cpp 的核心卖点是”宽模型支持 + 可验证的准确性”:首发即支持 16 个 ASR 模型族、60 余个模型,发布在 handy-computer Hugging Face org 下的每个模型都经过与参考实现的数值验证和完整 WER 扫描测试,验证数据随仓库和模型页公开。加速方面覆盖 Vulkan、Metal、CUDA 和 TinyBLAS,官方公布了 Ryzen 4750U(CPU + Vulkan,Fedora)与 M4 Max 两个平台的基准数据。库同时支持流式与批量转录,并提供 Python、JavaScript/TypeScript、Rust、ObjC/Swift 四种官方维护的语言绑定。
对桌面/移动应用开发者而言,该库可直接读取 whisper.cpp 流行的 .bin 模型文件,迁移成本低。作者也坦承 v0.1.0 仍有粗糙边缘、尚未覆盖 whisper.cpp 的全部 flag 与特性,欢迎社区提交 issue 共同完善。随着 llama.cpp 生态(ggml)持续向语音、多模态扩张,transcribe.cpp 这类”统一推理底座”项目正在成为本地 ASR 分发的新标准路径。