恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Buzz 离线语音转文字指南:5 分钟用本地 Whisper 跑通第一条转录

  • 首页
  • 资讯中心
  • /
  • Buzz 离线语音转文字指南:5 分钟用本地 Whisper 跑通第一条转录

相关资讯

Linux操作系统核心原理与实战指南 2026/9/10 23:06:42
Resume-Matcher Prompt 工作流设计:本地偏差检测与重试机制全解析 2026/9/10 23:01:41
如何为多智能体并发会话配置 chrome-devtools-mcp 的 --experimentalPageIdRouting 页面路由 2026/9/10 23:01:41

最新资讯

火焰图像动态特征提取:闪烁频率与面积的时序建模方法
中文语音识别系统实战:从CTC到DFCNN与CBHG语言模型的全栈解析
Budibase 本地开发环境搭建与运行指南:从全新克隆到 dev 栈启动的完整实践
HuffPost新闻数据集解析:JSONL加载与时间感知分类实战
YOLO烟盒数据集目标检测训练全流程:标注校验、格式转换与模型复现
Podman 零基础 → 云计算实战手册

今日推荐

YOLO烟盒数据集目标检测训练全流程:标注校验、格式转换与模型复现
HuffPost新闻数据集解析:JSONL加载与时间感知分类实战
Budibase 本地开发环境搭建与运行指南:从全新克隆到 dev 栈启动的完整实践

本周热门

超人会飞不算本事:系统稳定依赖清晰规则与边界设计
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
基于CNN的调制信号识别:MATLAB实现时频图分类实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Buzz 离线语音转文字指南:5 分钟用本地 Whisper 跑通第一条转录

发布时间:2026/9/10 23:06:42
Buzz 离线语音转文字指南:5 分钟用本地 Whisper 跑通第一条转录 Buzz 离线语音转文字指南5 分钟用本地 Whisper 跑通第一条转录【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款运行在你自己电脑上的离线语音转文字工具底层使用 OpenAI 的 Whisper 模型把音频和视频文件转换成文字稿或字幕。它不依赖云端服务转写、翻译都在本机完成适合处理不方便上传的会议录音、采访素材和课程视频。先判断Buzz 适合谁适合录音内容涉及隐私、不方便传到在线转录服务的场景比如内部会议、患者采访、法务材料适合没有稳定网络或希望转写成本为零的环境适合需要批量处理音频并导出 SRT/VTT 字幕的视频制作者不适合期待开箱即用的极轻量用户——首次使用需要下载模型文件几十到几 GB 不等不适合对多语种识别精度有苛刻要求、且本机没有 GPU 加速条件的场景此时云端方案可能更省时5 分钟跑通第一条录音这一节带你走最短路径装好、丢一个文件进去、拿到文字稿。安装。macOS 和 Windows 可直接从发行版下载图形版安装包Linux 用flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz即可。习惯代码的同学也可以走 PyPIpip install buzz-captions python -m buzz导入。打开主界面后点工具栏的选择本地的 MP3、WAV、MP4 等文件也可以直接粘贴一个 YouTube 链接。选模型和任务。在任务行里选择模型新手先用 Base 或 Small任务保持默认的 Transcribe 即可。开始。点启动按钮进度列会显示百分比完成后双击该行就能打开带时间轴的文字稿。模型档位怎么选Buzz 内置 Whisper 的多个尺寸档位模型首次使用会自动下载到本机缓存目录。下表是通用参考实际速度取决于你的 CPU/GPU档位下载体积通常速度精度水平适用场景Tiny约 73 MB很快基础快速预览、嘈杂长音频粗筛Base约 139 MB快良好日常会议、口述记录Medium约 1.5 GB中等较好正式文稿、字幕制作Large约 2.9 GB较慢高精度优先的学术、出版场景只处理英语时可以选带.en后缀的档位如 base.en通常更省算力想兼顾速度和精度Large-v3-Turbo 是折中选择模型管理入口在首选项 → Models已下载和可下载的模型都列在那里也支持填入自定义模型地址从转录稿到成品字幕、翻译与导出拿到转录稿只是第一步Buzz 的转录查看器提供了编辑、翻译和导出的完整链路。编辑时间轴和文本打开转录稿后每段都有 Start、End 时间列和 Text 文本列直接改字即可下方有播放器可以边听边对。调字幕长度Resize做字幕时经常需要控制每行字数。点Resize可以设置目标字幕长度并勾选按间隔合并按标点拆分按最大长度拆分点 Merge 后分段会重新排好。翻译与导出点Translate可把整份转录稿翻成英语外语素材尤其有用点Export可导出 TXT、SRT、VTT 三种格式导出文件名的默认模板是{{ input_file_name }} ({{ task }}d on {{ date_time }})在首选项的 General 页可以改成自己的格式比如{{ date }}_{{ input_file_name }}相关默认值定义在 buzz/settings/settings.py让转录更快更多加速与批量硬件加速Buzz 支持三种后端——NVIDIA GPU 用 CUDA、Mac 用 Apple Silicon、Whisper.cpp 后端还能用 Vulkan 跑在大多数显卡包括核显上。后端在选模型时选择详见 buzz/transcriber/ 下的多后端实现命令行批量add命令接受多个文件还能同时指定输出格式例如python -m buzz add -s medium --srt --vtt audio1.mp3 audio2.mp3文件夹监控在首选项的Folder Watch页指定一个目录新放进来的文件会自动排队转写适合扔进去就不用管的归档流实时录音工具栏的麦克风按钮支持麦克风边说边转讲课时还能开独立的展示窗口投屏插件扩展AI 摘要、说话人区分、自动字幕重排等能力都在 buzz/plugins/ 目录里按需启用装不上或跑不动卡点速查程序启动失败 / 无声音Linux 下先补音频依赖sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-modulePyPI 安装的用户还需要系统里有 ffmpeg模型下载失败或卡在 0%网络原因居多可以到首选项 → Models里换一个模型源或手动放一个.bin/.pt文件到模型缓存目录缓存路径在 buzz/model_loader.py 顶部有定义转录特别慢多半是模型开太大或跑在纯 CPU 上先降到 Small/Base再换带 GPU 加速的后端CUDA/Vulkan识别错词多音频本身有噪声时选更大的模型或开启extract speech先做语音提取专有名词多的场景可以填 initial prompt 给模型一点上下文Windows 安装时系统警告安装包未签名属于已知现象点更多信息 → 仍要运行即可PyPI 版想用 NVIDIA GPU需要单独装带 CUDA 的 torch 版本README 里给了对应命令下一步行动建议你先按5 分钟跑通一节装上用一段 1 分钟以内的录音试 Base 模型确认整条流程走通。之后如果要做字幕重点看首选项里的 Folder Watch 和导出模板设置想批量自动化直接查python -m buzz add --help查看全部参数。更多细节可参考仓库内 docs/docs/ 下的使用文档。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号