老傅 Voice
面向应用与 AI 助手的语音识别工具包,将音频文件和实时语音转换为可处理的文字。
给应用接上语音识别
老傅 Voice 将音频处理、识别路由、转写结果和任务状态整理为一套接口。它作为本机独立服务运行,便于软件开发者把语音识别接入已有产品,也能通过 MCP 供 AI 助手调用。
文件与实时语音
- 提交音频文件,查询转写任务进度,并导出 TXT、SRT、VTT 或 JSON。
- 通过 WebSocket 接入实时音频,接收阶段性文字与最终结果。
- 配置本地 FunASR,或接入阿里云、豆包识别服务;云服务需要自行配置凭据。
- 通过 HTTP、WebSocket、Node SDK、CLI 和 MCP 集成,保持应用与识别服务分离。
当前阶段
当前 1.4.0 是面向 Linux x86_64 的内部集成版本,尚未提供公开下载。本地模型准备完成后可离线识别;模型与运行依赖需要单独准备。云端识别需要网络和相应服务账号。
当前重点是语音转文字,不包含语音合成或实时语音对话。具体场景的识别质量与部署效果仍需结合实际音频验证。
可以用来做什么
- 为业务应用接入音频文件转写。
- 接收实时音频并呈现逐步产生的识别文字。
- 让 AI 助手创建、查询和导出转写任务。