恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
faster-whisper 语音转文字:本地离线跑通,比原版快 4 倍
首页
资讯中心
/
faster-whisper 语音转文字:本地离线跑通,比原版快 4 倍
faster-whisper 语音转文字:本地离线跑通,比原版快 4 倍
发布时间:2026/9/5 23:41:29
faster-whisper 语音转文字本地离线跑通比原版快 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper会议录音一个多小时、外语视频没有字幕你总不能逐字听吧faster-whisper 用 CTranslate2 引擎重写了 OpenAI Whisper在准确率基本不变的前提下把转写速度提到原版的约 4 倍还能离线跑、内存占用更低。 三步跑通第一次转写拿到你的第一份文字先别管配置把最小闭环走通。它要求 Python 3.9音频解码由 PyAV 自带不需要你另外装 FFmpeg只有在用 NVIDIA 显卡时才需要额外的 cuBLAS 和 cuDNN。# 安装主包要求 Python 3.9 pip install faster-whisper装完直接跑下面这段。WhisperModel按名字加载模型首次会自动从 Hugging Face 下载并缓存到本地第二次就快了。from faster_whisper import WhisperModel # 没有 NVIDIA 显卡用 CPU int8 量化内存更省 model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3, beam_size5) print(语言:, info.language, 置信度:, round(info.language_probability, 2)) for seg in segments: # segments 是生成器开始遍历才真正启动转写 print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})跑通这一步你就有了带时间戳的文字稿。所有可调参数都集中在WhisperModel.transcribe里完整签名可以在 faster_whisper/transcribe.py 里对照。适用场景会议录音、访谈、语音笔记等任意音频文件的快速出稿。⚙️ 选对模型与计算类型把速度榨出来模型档位和计算类型compute_type决定了多快、占多少内存。官方基准是在同一硬件上测得的可验证数字GPUNVIDIA RTX 3070 Tilarge-v2 模型13 分钟音频实现精度耗时显存占用openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperbatch_size8fp1617s6090MBfaster-whisperint8int859s2926MBCPUIntel i7-12700Ksmall 模型13 分钟音频实现精度耗时内存占用openai/whisperfp326m58s2335MBfaster-whisperint8int81m42s1477MB结论很直接GPU 上加batch_size冲吞吐CPU 上优先int8省内存。按你的硬件和精度要求挑档位档位精度取向推荐计算类型适配硬件典型用途tiny / base快、省CPUint8普通笔记本试错、实时、长音频粗转small平衡CPUint8/ GPUfloat16入门独显日常会议、播客medium较准GPUfloat16中端独显精度要求更高large-v3最高GPUfloat16/int8_float16大显存正式交付、多语言turbo大模型速度GPUfloat16独显大批量、追吞吐[!TIP]segments是生成器不会在transcribe那一刻就开始算。想一次性跑完就list(segments)追求速度时在 GPU 上把batch_size调大如 8、16实测能把 13 分钟音频从 1 分钟压到十几秒。适用场景确定你的硬件和精度底线后用这张表锁定model_size和compute_type。 解锁词级时间戳、翻译与静音过滤基础出稿之外三个参数值得单独记住它们覆盖绝大多数进阶需求。# 词级时间戳 翻译 静音过滤一次配齐 segments, _ model.transcribe( audio.mp3, languagezh, # 显式指定中文避免自动误判 tasktranslate, # 需要译成英文时填 translate word_timestampsTrue, # 逐词时间戳做字幕的刚需 vad_filterTrue, # 用内置 Silero VAD 跳过静音段 vad_parametersdict(min_silence_duration_ms500), # 停顿超 500ms 才断开 ) for seg in segments: for word in seg.words: # 每个词都有 start / end / word print(f{word.start:.2f}s {word.word})几个关键点word_timestampsTrue把时间戳精确到每个词做字幕、逐词分析都靠它。tasktranslate把源语言转写成英文文本配合language指定源语言即可跨语言。vad_filterTrue内置 Silero VAD 过滤无语音片段默认只会去掉超过 2 秒的静音参数默认值见 faster_whisper/vad.py。[!WARNING] 如果结果出现重复、时间戳错乱或陷入循环多半是解码卡进了失败循环。把它设成condition_on_previous_textFalse用上一段输出做提示的机制会关闭稳定性明显提升。适用场景视频字幕制作、外语内容转译、长访谈里大段停顿的录音整理。⚠️ 绕开五个最常见的坑现象更可能的原因处理方式首次运行卡很久正在自动下载模型下载完会缓存本地第二次直接复用CUDA 报错 / 找不到库缺 cuBLAS、cuDNN或 CUDA 版本不符装 CUDA 12 的 cuBLAS 与 cuDNN 9没有卡就直接用 CPU中文识别不准语言被自动误判transcribe里显式写languagezh输出重复、乱码循环解码陷入失败循环设condition_on_previous_textFalse显存不足OOM模型太大或精度太高换更小模型或compute_typeint8语言支持可查 faster_whisper/tokenizer.py 里的_LANGUAGE_CODES内置代码覆盖了 100 种语言中文zh也在其中。完整基准与换算模型的命令都在 README.md需要复现对比时以它为准。适用场景第一次跑不顺、或跨语言/中文效果不达预期时按这张表逐项排查。 按你的角色把下一步做对不同人拿到这套工具后的落点不一样对号入座学生 / 研究者先base试错讲课录音、访谈素材批量出稿再用词级时间戳整理引用位置。职场 / 会议日常用smallvad_filter长会议开batch_size把纪要整理时间省下来。字幕 / 内容创作word_timestampsTrue直接导出逐词时间轴配tasktranslate做多语言字幕。开发者 / 批量GPU 上turbo或large-v3batch_size拉吞吐把转写嵌进自动化管道。最后用这四步把它真正用起来pip install faster-whisper确认 Python 版本达标跑通上面的最小示例拿到第一份带时间戳的文字按你的硬件选对model_size与compute_type需要快就加batch_size、省内存就int8按场景叠加word_timestamps、translate、vad_filter把出稿变成能直接交付的结果。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考