公司动态

蛐蛐(QuQu)语音工作流完整指南:让国产语音识别与AI模型免费跑在你电脑上

📅 2026/8/21 17:16:35
蛐蛐(QuQu)语音工作流完整指南:让国产语音识别与AI模型免费跑在你电脑上
蛐蛐(QuQu)语音工作流完整指南让国产语音识别与AI模型免费跑在你电脑上【免费下载链接】ququ开源免费的 Wispr Flow 替代方案 | 集成FunASR本地模型和可配置大语言模型的下一代中文桌面语音工作流项目地址: https://gitcode.com/gh_mirrors/qu/ququ你是否遇到过这样的场景开会要整理纪要手指在键盘上飞舞却赶不上讲话速度写周报憋了半小时脑子里想得挺清楚打出来却变了味想用语音输入提高效率结果市面上的工具要么订阅费贵得肉疼要么把录音传到云端让人心里发毛。蛐蛐QuQu正是冲着这些痛点来的。这是一款开源免费、面向中文用户设计的桌面语音工作流工具核心卖点只有三句话语音识别完全在本地完成、AI文本优化可接入通义千问等国产大模型、整体体验对标国际付费产品 Wispr Flow 却分文不取。本文会从安装、配置到进阶调校带你把它完整跑起来。先认识这位话痨助理它到底能干什么你可以把蛐蛐理解成一个住在电脑里的速记员编辑。它用两段式引擎工作第一段内置阿里巴巴开源的 FunASR 语音识别模型Paraformer 系列把你说的话实时转成文字这一步全程在你的电脑本地运行不需要联网第二段把识别结果交给可配置的大模型做润色自动删掉嗯、啊、那个纠正同音错字甚至把你随口说的会议定在周三不对是周四整理成干净的会议定在周四。除了基础转写它还有几个让人眼前一亮的小本事编程术语友好能识别并格式化 camelCase、snake_case 这类代码风格命名程序员口述代码场景很实用。智能分场景处理内置短文本润色、长文本分段整理、摘要总结、纠错增强等多种处理模式根据文本长度自动切换。历史记录归档所有转录内容保存在本地 SQLite 数据库中随时可回溯数据文件默认位于data/transcriptions.db。全局唤醒设置一个快捷键在任何应用里按一下就能开始说话松手自动转写并粘贴到当前光标位置。凭什么值得换与云端订阅工具的账本对比如果你正在用或考虑用 Wispr Flow 这类产品下面这张对比表可以帮你快速做决定对比维度蛐蛐 (QuQu)云端订阅类工具如 Wispr Flow费用完全免费Apache 2.0 开源协议通常 12 美元/月左右的订阅录音数据本地处理不上传需上传到服务商云端中文识别专为中文优化内置 FunASR通用型支持中文体验一般AI 模型通义千问、Kimi、智谱等国产模型也可接任意 OpenAI 兼容接口通常仅限其指定模型扩展自由可改提示词、可换模型、可看源码黑盒能力受厂商限制一句话总结蛐蛐把花钱买服务变成了本地装工具数据主权和钱包都握在自己手里。十分钟跑起来三条安装路线怎么选项目需要 Node.js 18、pnpm 以及 Python 3.8 环境macOS 10.15、Windows 10、Linux 均可运行。安装前先把项目代码拉下来git clone https://gitcode.com/gh_mirrors/qu/ququ cd ququ接着按你的情况选一条路线路线 Auv 一键管理新手首选uv 是新一代 Python 包管理器会自动下载匹配的 Python 版本并管理依赖几乎不会出现环境冲突这种劝退问题pnpm install uv sync uv run python download_models.py pnpm run dev路线 B系统 Python 虚拟环境开发老手适用如果你习惯自己掌控 Python 环境可以用传统方式pnpm install python3 -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install funasr modelscope torch torchaudio librosa numpy python download_models.py pnpm run dev路线 C嵌入式 Python生产/打包部署用需要完全隔离、不依赖系统 Python 的发行场景走这条pnpm install pnpm run prepare:python pnpm run test:python pnpm run dev三条路线的适用场景可以这样记图省事选 A想折腾选 B要交付选 C。关键一步接上国产大模型启动应用后打开设置页面你会看到三个核心字段API Key、Base URL 和模型名称。这里有一个很贴心的设计设置页内置了应用阿里云推荐配置按钮一键填入通义千问的接口地址和模型名填入你自己的 API Key 就能用。几个国产模型参考配置如下模型服务Base URL 示例适用场景阿里云通义千问https://dashscope.aliyuncs.com/compatible-mode/v1通用文本优化设置页一键可配Kimi (Moonshot)官方兼容接口地址长文本处理、逻辑整理智谱 AI (GLM)官方兼容接口地址偏技术向的内容整理任意 OpenAI 兼容服务服务商提供的/v1地址自由扩展填写完成后设置页提供测试配置功能验证通过再开始使用避免录音半天才发现模型没接上。只要服务兼容 OpenAI Chat Completions 接口理论上都能接入。用起来快捷键与权限缺一不可快捷键清单可在设置中自定义操作默认快捷键开始/停止录音Ctrl Shift 空格macOS 为⌘ Shift 空格打开设置应用内设置入口首次使用还需要在设置页完成两项权限授权麦克风权限语音录制的前提点击测试麦克风可验证辅助功能权限自动粘贴文本到任意应用所必需点击测试权限确认是否生效。这两项在不同系统上的授权入口略有差异macOS 在系统设置 → 隐私与安全性中管理Windows 在设置 → 隐私中开启麦克风权限。权限就绪后在任何编辑器或聊天窗口里按下快捷键说完松开优化后的文字就自动落在光标处。调教一个更懂你的 AI提示词与进阶设置蛐蛐的文本处理逻辑集中在src/hooks/useTextProcessing.js内置了多套提示词模板。默认的优化指令非常讲究——它要求模型最小化修改、保留口语风格只删口头禅和废话不强行改写成书面语。这意味着你得到的输出还是你的话只是更干净了。如果你想自定义可以按需调整。比如希望输出更正式的书面语可以改写提示词加入类似这样的要求请将以下语音转录文本整理为正式的书面语 1. 保留全部关键信息不增删内容 2. 修正语法和错别字 3. 将口语表达改写为书面表达 4. 直接输出整理结果不要附加说明 原始文本 这里粘贴语音识别结果另外项目还支持通过环境变量做精细调校例如# 设置全局热键 export GLOBAL_HOTKEYCommandOrControlShiftSpace # 添加热词逗号分隔提升专业词汇识别率 export HOTWORDS蛐蛐,通义千问,Wispr # 调整录音时长上限秒 export MAX_RECORDING_DURATION300其中热词HOTWORDS对提升人名、产品名等专有名词的识别准确率很有帮助值得一试。从 Wispr Flow 搬家的实操清单如果你已经在用 Wispr Flow 或同类工具迁移成本比你想象的低得多清点刚需功能列出你依赖的功能实时转录、AI 润色、历史记录对照本文确认蛐蛐均有对应能力导出并归档旧记录把旧工具里的历史转录文本导出为 Markdown 或纯文本作为备份留存安装并配置按上文路线完成安装接入你已有的国产大模型 API习惯新工作流用 2-3 天时间适应新快捷键和本地识别的节奏把常用提示词抄进设置确认无遗漏后取消订阅跑通完整流程、确认满意度后再退订旧服务无缝衔接。翻车急救手册常见问题排查速查症状可能原因处理办法提示No module named funasrPython 依赖未装好重新执行uv sync后用uv run python download_models.py或重跑pip install funasr modelscope torch torchaudio librosa numpy模型下载缓慢或失败无法稳定访问 modelscope.cn检查网络重试python download_models.pymacOS 遇到 SSL 报错可尝试pip install urllib32.0Python 版本不兼容本地 Python 版本过旧用 uv 自动管理会自动下载 Python 3.11或手动安装 Python 3.8录音没反应麦克风权限未授权到系统隐私设置中开启麦克风权限回设置页点击测试麦克风文字粘贴不进去辅助功能权限未授权到系统设置中开启辅助功能权限并重新测试首次启动慢正在加载本地模型模型默认下载到~/.cache/modelscope/后续启动会明显加快一份实在的账本性能与体验对比基于项目设计与本地化特性整理一张体验对比参考指标蛐蛐 (QuQu)云端订阅类工具中文识别准确率本地 FunASR 大模型加持中文场景表现突出通用模型中文表现一般延迟本地推理 AI 优化整体流畅受网络波动影响明显隐私安全录音不出本机数据经云端中转长期成本0 元 模型 API 按量计费固定月费越用越贵可定制性源码开放提示词可改几乎不可定制社区与未来方向作为一个 Apache 2.0 协议的开源项目蛐蛐的成长依赖社区共建。官方维护了微信交流群群内可以获取项目更新动态、与开发者直接交流踩坑经验、分享好用的 AI 指令和自动化工作流遇到问题或有好点子也可以通过提交 Issue 或 Pull Request 的方式参与进来。技术栈方面前端采用 React 19 Tailwind CSS桌面层基于 Electron语音层使用 FunASR数据库使用 better-sqlite3对想贡献代码的开发者相当友好。行动之前最后划一遍重点把整篇文章浓缩成一张清单方便你直接收藏照做✅免费开源Apache 2.0 协议无订阅、无功能阉割✅本地识别FunASR 模型在本地跑隐私有保障✅国产模型友好通义千问、Kimi 等一键配置也兼容任意 OpenAI 接口✅中文特化从识别到润色都为中文表达习惯优化✅两段式工作流识别 优化输出即用✅三类安装方案uv、系统 Python、嵌入式任选总有一款适合你✅高度可定制热词、提示词、热键、环境变量皆可调。如果你正受困于打字速度、订阅账单或云端隐私顾虑今天就可以行动克隆仓库、装上依赖、下好模型按快捷键说第一句话。从这一刻起你的电脑里就多了一位随叫随到的中文速记员——而且它分文不取只为你工作。【免费下载链接】ququ开源免费的 Wispr Flow 替代方案 | 集成FunASR本地模型和可配置大语言模型的下一代中文桌面语音工作流项目地址: https://gitcode.com/gh_mirrors/qu/ququ创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考