恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字
首页
资讯中心
/
Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字
Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字
发布时间:2026/9/7 2:33:47
Buzz 完整教程如何在电脑上零基础搭好离线语音转文字工具把音频转成文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线语音转文字应用它在你自己的电脑上调用 OpenAI 的 Whisper 模型一个把语音转成文字的深度学习模型完成音频转录和翻译全程不需要把录音上传到任何服务器。它适合两类人一是手里有大量会议、课程、采访录音需要批量转成文字或字幕的人二是处理内容敏感、绝不能联网上传的隐私场景。本教程从确认电脑能不能跑到安装、第一次转录、调模型提速再到排错一条线讲完。 先确认Buzz 适不适合你的场景选型前先看结论避免装完才发现用不上你的情况结论说明音频必须留在本机或内网✅ 正合适转录在本地完成模型下载后即可离线工作会议录音、课程、播客批量转文字✅ 正合适支持队列任务、文件夹监控自动转录给视频做 SRT / VTT 字幕✅ 正合适转录结果可直接导出字幕格式还能按词重新切分想要秒级跟读式的实时转录⚠️ 有门槛实时录音比较吃资源需要用 Whisper.cpp 后端加小模型硬件弱会追不上只有老旧笔记本不支持 AVX2 指令集❌ 跑不了Buzz 依赖 AVX2太老的 CPU 直接排除完全离线的内网机器⚠️ 可以但要准备模型文件要先在联网机器下载好再拷贝过去见离线准备脚本系统要求不苛刻Windows 10、macOSIntel 与 Apple Silicon 均可、主流 Linux 发行版普通双核 CPU 能跑小模型8GB 内存以上体验更稳。模型文件的位置是固定的Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\CachemacOS 在~/Library/Caches/BuzzLinux 在~/.cache/Buzz管理空间时心里有数。 装好并跑起来三个平台各一条推荐路线每个平台只走一条最省事的路装完启动看到主界面就算成功。Windows从官方发布页下载.exe安装文件直接安装。应用没有做代码签名安装时系统会弹安全警告点更多信息再选仍要运行即可这不是中病毒。安装包自带 CUDA 12 支持N 卡用户无需额外配置。macOS下载.dmg后拖进应用程序文件夹Apple Silicon 和 Intel 版都有。Linux一条 Flatpak 命令flatpak install flathub io.github.chidiwilliams.Buzz备选路线一行流Linux 也可以sudo snap install buzz需先装libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module三个依赖并执行sudo snap connect buzz:password-manager-service或者用 Python 3.12 环境执行pip install buzz-captions后运行python -m buzz需自行装好 ffmpeg。验证是否装好打开 Buzz 能看到任务列表界面点工具栏的 图标能弹出文件选择框录音按钮能点亮就说明环境没问题。 第一次使用把一个音频文件变成文字目标只有一个导入一个音频文件拿到文字。点菜单File → Import Media File或工具栏 图标快捷键 Ctrl/Cmd O选中你的音频或视频文件——注意 Buzz 也能直接粘贴视频链接导入视频里的音轨同样可以转。任务栏里选择Transcribe转写语言手动选一个比自动检测稳得多官方文档明确建议别依赖自动检测。模型先用 Whisper.cpp 的 small 起步够快也不至于错得离谱。点Run进度列会显示百分比状态变成 Completed 即完成。双击这一行打开转录查看器每段文字都带开始/结束时间戳底部有播放器可以边听边改。在查看器里改完错字用 Export 菜单导出 TXT、SRT 或 VTT。导入时点 Advanced... 还能看到几个实用开关Word-Level Timings按词生成时间戳为之后切字幕做准备、Extract speech先把人声从背景音里抽出来再转嘈杂音频可用、以及Initial prompt初始提示词把容易拼错的专有名词、术语写进去能显著减少错字。⚙️ 选模型与调速度先定后端再定档位转得太慢和错得太离谱都出在模型选择上。Buzz 里其实有两层选择先用哪个后端怎么跑再用哪个大小的模型跑多大。后端怎么挑你的硬件后端选择理由没有独显 / 集显Whisper.cpp基于 Vulkan 加速任何显卡都能用纯 CPU 也能跑Mac 上它是最佳选择N 卡显存 ≥ 6GBFaster Whisper比原版 Whisper 快一个数量级吃显存内存充裕、追求原始精度Whisper原版准确但慢、吃内存想用特定语言的定制模型HuggingFace支持 MMS覆盖上千种语言等第三方模型家族本地硬件弱到转不动OpenAI API放到远端算需配置 API Key要联网模型档位怎么挑档位参数量级定位tiny / base约 39M / 74M实时录音、快速过一遍错字多small约 244M日常主力速度和准确率的平衡点medium约 769M长音频、要求高的内容large-v3 / large-v3-turbo约 1.5B最准v3 偶尔会幻听出没说的词turbo 版主打速度精度平衡官方 FAQ 的建议很实在各档位之间没有标准答案用你自己的语言各试一遍最靠谱。模型在Help → Preferences → Models页下载下完还能点 Show file location 找到文件。Whisper.cpp 还支持量化版如 q_5和自定义模型 URL省显存、可换多语言模型。提速的关键调节项多数在 Preferences 里高级项通过环境变量设置BUZZ_WHISPERCPP_N_THREADSWhisper.cpp 线程数默认是 CPU 核心数的一半16 线程的笔记本设成 8 反而快约 15%设太高线程合并开销会拖慢速度。BUZZ_FORCE_CPUtrue显卡驱动有坑时强制走 CPU。BUZZ_REDUCE_GPU_MEMORYtrue用 8 位量化压缩模型省显存。BUZZ_MODEL_ROOT把模型目录指到大磁盘上。HF_ENDPOINT模型下载慢时设成https://hf-mirror.com换镜像加速。PyPI 安装的用户要 GPU 加速需手动装 CUDA 版 PyTorch两条核心命令pip3 install -U torch2.8.0cu129 torchaudio2.8.0cu129 --index-url https://download.pytorch.org/whl/cu129 pip3 install nvidia-cublas-cu1212.9.1.4 nvidia-cuda-cupti-cu1212.9.79 nvidia-cuda-runtime-cu1212.9.79 --extra-index-url https://pypi.nvidia.comLinux 的 N 卡开箱即用Windows 安装包已内置。显卡太老反而拖慢速度时用BUZZ_FORCE_CPUtrue退回 CPU 通常更快。 进阶玩法实时录音、翻译、批量与命令行实时录音点工具栏的麦克风图标选好麦克风、任务、语言就开录。官方提醒默认 Whisper 后端做实时转录很吃资源建议切到 Whisper.cpp 并用小模型。录音开始后会出现Presentation window演示窗口选项适合讲座、会议场景投屏展示实时字幕。要录电脑里播放的声音而不是麦克风需要配一个虚拟声卡macOS 用 BlackHole、Windows 用 VB CABLE把系统输出接到虚拟设备后在 Buzz 里选它当麦克风即可。翻译分两种。Transcribe 之外的默认翻译任务走 Whisper 自带的译成英语能力纯离线译成英语以外的语言则需要 AI 翻译——在 Preferences 里填一个 OpenAI 兼容 API 的 Key 和地址也支持 Ollama、LM Studio 这类本地部署给 AI 一段明确的翻译指令即可。开启实时转录导出后文字会边生成边写进 txt 文件译文是.translated.txt方便接 OBS 等工具。官方给的参考成本约 1 美元可翻译 1 小时音频。批量与自动任务列表本身就是队列导入一堆文件会依次排队转录。更省事的是Folder WatchPreferences 里的选项卡指定一个文件夹新丢进去的音频自动进转录队列。插件1.4.5 起Help → Plugins 里开关、拖拽排序、按 URL 添加社区插件。内置的几个很实用AI Summary调 API 生成摘要存进备注、Export to DOCX导出 Word、Resize Transcript自动把按词的转录合并成字幕段、DeepFilterNet 降噪转前先消噪、Skip Already Transcribed重导同一文件夹时跳过已转过的文件。插件机制的源码在 buzz/plugins/照着写自己的不难。命令行Buzz 自带 CLI可写进脚本做自动化完整参数见 docs/docs/cli.md。最高频的一条# 转录一个 MP3同时导出 TXT 和 SRT buzz add -m whispercpp -s small -l zh --txt --srt input.mp3-t translate可切换成翻译任务--model-type还能选 fasterwhisper、huggingface、openaiapi 等后端。️ 排错常见问题对照表症状处理办法转录太慢换更小模型或换 Whisper.cpp 后端显存 ≥6GB 的 N 卡上改 Faster Whisper有更强的机器就用更大的模型启动崩溃多半是模型文件下载不完整——在 Preferences → Models 删掉重下再不行看日志Help → About Buzz → Show logs并注意 CPU 是否支持 AVX2录音报Unanticipated host error [PaErrorCode-9999]系统层面禁止了麦克风访问。Windows 到 设置 → 隐私 → 麦克风 里给应用开权限并临时排查杀毒软件内网无网机器怎么用在联网机器下载模型后把模型文件夹整体拷到目标机的对应缓存目录路径见前文可配合 scripts/download-models.py 批量准备实时字幕追不上语速换 tiny/base 模型 Whisper.cpp调大 Transcription step实时录音高级设置里牺牲一点延迟换负载Flatpak 版不跟随深色主题安装gnome-themes-extra把主题复制到~/.themes并给 Flatpak 开访问权限详见 FAQ字幕时间戳对不上、一段太长转录时勾 Word-Level Timings完成后用 Resize 工具按静音间隔和标点重新合并排完这些还解决不了的去项目仓库提 issue附上日志文件维护者响应很快。结语Buzz 把离线语音转文字这件事拆得很直白装好、选模型、丢文件剩下的时间都花在改错字上。想参与项目本身可以从 docs/ 文档、翻译 locale 语言包 或给 buzz/plugins/ 写一个插件开始。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考