公司动态

Windows 离线语音转文字免费工具 TMSpeech 完整指南:3 分钟把电脑声音变成实时字幕

📅 2026/8/21 16:20:30
Windows 离线语音转文字免费工具 TMSpeech 完整指南:3 分钟把电脑声音变成实时字幕
Windows 离线语音转文字免费工具 TMSpeech 完整指南3 分钟把电脑声音变成实时字幕【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款 Windows 下的免费开源离线语音转文字工具它捕获电脑正在播放的声音把语音实时转成文字字幕。全程本地运行断网可用CPU 占用低适合会议纪要、网课字幕等场景。它能干什么离线语音转文字的 3 个典型场景TMSpeech 本质上是一台Windows 离线字幕生成器最典型的用法是下面三个场景线上会议会议软件播放的声音会被实时转成屏幕字幕走神后瞟一眼就能接回话题。→ 你得到的是按日期自动保存的识别记录会后打开稍作整理一份会议纪要就有了。网课 / 无字幕视频捕获视频播放的内音实时转字幕字幕窗口无边框、可任意拖动和调整大小放视频旁边不挡内容。→ 你得到的是一个即开即用的本地字幕生成器不用等字幕文件。语音笔记 / 口述草稿把音频来源切换为麦克风直接录你的说话声。→ 你得到的是一个不依赖网络的离线语音识别工具口述内容随时可回看、可复制。快速上手3 分钟跑起来 没有安装向导也没有注册账号环节下载从项目 Release 页面获取最新的压缩包也可以克隆源码自行构建命令为git clone https://gitcode.com/gh_mirrors/tm/TMSpeech。安装解压后直接运行TMSpeech.exe建议桌面建一个快捷方式。首次启动程序会自动在系统目录创建配置文件和日志目录打开主窗口点红色按钮即可开始识别无需任何配置。恢复默认万一配置改乱了运行 Release 包里附带的重置配置 bat 脚本会清除现有配置并回到默认状态。核心功能指引从音频源到历史记录音频来源怎么选TMSpeech 提供三类音频来源系统音频捕获电脑正在播放的全部声音用的是 Windows 的 WASAPI 环回采集也就是常说的录内音麦克风直接录制你的说话声进程音频只捕获某一个指定程序的声音其他应用一概忽略。在设置窗口的音频源一栏切换即可。选系统音频有个实用特性即使把系统音量完全关掉识别依然正常因为它是直接从系统内部取音频的。多数场景选系统音频就够只有明确想只录自己的声音、或某个特定程序的声音时才切换到另外两种。语音识别引擎怎么选识别引擎负责把音频算成文字TMSpeech 内置三种Sherpa-Onnx为 CPU 优化默认选项、Sherpa-Ncnn可调用 GPU速度和资源占用表现更激进、命令行识别器面向高级用户的外部程序接口进阶部分会展开讲。在设置窗口的语音识别一栏从下拉列表切换识别器点刷新后即时生效。只求省心就用默认的 Sherpa-Onnx有 GPU、追求更低延迟的话可以试 Sherpa-Ncnn。模型安装步骤引擎只是发动机真正的知识来自语音识别模型。TMSpeech 在设置界面的资源标签页集中管理模型安装模型由社区仓库提供中文模型体积约 300MB。目前可安装的模型有中文、英文、中英双语三种都属于 Zipformer-transducer 开源流式模型系列。点击对应条目右侧的安装按钮等下载完成条目会变为已安装状态。按你识别的语言选主要听中文会议就装中文模型经常看英文课程就补装英文或双语模型。历史记录怎么查识别结果会按日期自动保存到我的文档下的TMSpeechLogs文件夹一天一个记录文件。从主窗口打开历史记录即可查看当天及往日的识别内容支持右键菜单或 Ctrl-C 复制方便摘出关键段落。需要回看会议前文、整理归档会议纪要时使用文件本身就是纯文本可以直接当底稿编辑。为什么可以放心用本地识别原理 TMSpeech 基于 sherpa-onnx 语音识别框架做二次开发模型文件就放在本地音频采集、特征提取、识别计算全部在本机完成。识别链路是边说边出字的流式处理没有网络往返环节响应快链路里也根本没有上传步骤。可验证的好处有三条断网可用不依赖任何服务端电脑完全离线也能正常识别不存在服务到期问题。声音数据不出本机隐私保障由架构决定——音频从头到尾没被送出去过适合会议纪要这类敏感内容。CPU 占用低项目作者在 AMD 5800u 笔记本上实测运行时 CPU 占用不到 5%。常见问题与解决❓识别准确率不理想。原因通常是环境音太吵、多人同时说话或模型与你的场景、口音不匹配。先排查环境和音频源是否选对都正常就换一个模型试试也可以在设置里把模型路径改成更合适的流式模型。录不到系统声音。原因一般是 Windows 音频设备设置问题不是程序本身。进入声音控制面板的录制标签页启用立体声混音设备没显示就右键空白处勾选显示禁用的设备再把它作为系统音频源。历史记录找不到。原因通常是TMSpeechLogs文件夹不存在或没有写入权限。检查我的文档/TMSpeechLogs目录是否正常权限异常时以管理员身份运行程序一般能解决。CPU 占用偏高。原因通常是模型偏重或开了实时标点这类附加处理。换用更省资源的识别器和轻量级模型并关掉不需要的附加处理占用会明显下降。进阶一点接入任何识别程序 TMSpeech 采用核心框架 功能插件架构插件管理、任务调度、配置管理等通用能力在核心框架里具体功能音频源、识别器、翻译都在 src/Plugins/ 下以插件形式存在每个插件目录有一个tmmodule.json描述文件程序启动时扫描插件目录按描述加载完整流程见 docs/Process.md。想新增一个音频来源或识别引擎只需写一个插件实现对应接口核心代码不用动。扩展空间最大的是命令行识别器它启动一个外部子进程子进程的标准输出作为字幕文本以单个换行结尾表示更新当前句子多个换行表示句子结束标准错误输出写入日志文件双方统一 UTF-8 编码。临时结果允许被后续识别修正只有句子结束后的结果才会存入历史记录。仓库的 external_recognizer/ 目录里有参考 Python 脚本照它很快能搭一个外部识别原型。注意三点该模式下音频由子进程独立获取设置里切换音频源不生效带空格的参数要用双引号转义指定 bat 脚本时开头加隐藏命令回显结尾不要写pause。用起来不顺手或想要新功能直接提 Issue 讨论熟悉 Windows 与 C# 开发的话欢迎提交 Pull Request如果你发现了效果更好的开源识别模型也推荐给社区。从会议救场到本地字幕生成器TMSpeech 的定位很朴素把电脑里的声音变成你随时能翻回来看的文字。免费、开源、离线、几分钟上手——如果你常写会议纪要、要看网课视频或者在意声音隐私不想让数据出本机可以下载试试。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考