恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
PodcastCopilot本地AI实战:用Dolly 2.0 + ONNX DirectML自动提取播客嘉宾姓名
首页
资讯中心
/
PodcastCopilot本地AI实战:用Dolly 2.0 + ONNX DirectML自动提取播客嘉宾姓名
PodcastCopilot本地AI实战:用Dolly 2.0 + ONNX DirectML自动提取播客嘉宾姓名
发布时间:2026/8/21 17:10:57
PodcastCopilot本地AI实战用Dolly 2.0 ONNX DirectML自动提取播客嘉宾姓名【免费下载链接】PodcastCopilotBuild 2023 demo项目地址: https://gitcode.com/gh_mirrors/po/PodcastCopilot录完一期播客你是不是还得手动回听录音、翻笔记只为找出这期节目的嘉宾到底是谁其实这件事完全可以交给 AI 自动完成。本文带来的 PodcastCopilot本地AI实战将带你认识微软 Build 2023 大会演示的开源项目 PodcastCopilot——一个由微软 CTO Kevin Scott 亲自展示的 Copilot 架构示例。它先用本地 Whisper 模型把播客音频转成文字稿再用本地 Dolly 2.0 模型自动提取嘉宾姓名全程无需把录音上传云端既保护隐私又节省成本。一文看懂 PodcastCopilotBuild 2023 的 Copilot 架构 ️PodcastCopilot 的目标非常直接输入一段播客音频自动产出一条可发布到社交平台的推广内容。整个流程像一条流水线共 6 个环节本地 Whisper 模型把播客音频转成文字稿Transcript本地 Dolly 2.0 模型从文字稿中自动提取嘉宾姓名 ← 本文主角Bing 搜索 API根据嘉宾姓名检索人物简介云端 GPT-4结合文字稿与简介生成社交媒体推广文案DALL-E 模型根据文案生成配图LinkedIn 插件把文案和图片一键发布到社交平台从上图可以清晰看到前两个环节Whisper 转录、Dolly 2.0 提取嘉宾姓名都在本地完成这是整个项目最值得学习的亮点。仓库还自带了一段示例音频PodcastSnippet.mp3克隆下来即可开箱跑通全流程。为什么用本地 Dolly 2.0而不是直接调用云端 API在 Build 2023 的演示中Kevin Scott 特意选择了「本地 云端」的混合架构原因主要有三点隐私更安全播客录音属于未公开内容本地推理意味着原始音频永远不会离开你的电脑成本更低转录与姓名提取是最耗时、调用量最大的环节放在本地 GPU 上跑能省下大量云端 API 费用响应更快本地推理没有网络往返延迟调试和反复实验时体验更流畅Dolly 2.0 ONNX DirectML本地推理的核心原理 ⚙️ONNX DirectML不挑显卡的本地加速方案Dolly 2.0 是一个 70 亿参数的开源指令模型直接加载对硬件要求很高。PodcastCopilot 的巧妙之处在于使用微软 Olive 工具优化过的microsoft/dolly-v2-7b-olive-optimized模型仓库通过量化与算子合并大幅降低显存占用推理时指定DmlExecutionProvider也就是ONNX DirectML执行提供程序让模型直接调用 DirectX 12 兼容的 GPU 加速这意味着不需要 CUDA、不需要 Linux一台普通的 Windows 电脑AMD / Intel / NVIDIA 显卡均可就能本地跑 7B 模型这也是「本地AI实战」含金量所在。结构化提示词嘉宾姓名是这样被精准提取的PodcastCopilot 没有使用笼统的提示语而是写了一个专门的提示模板向 Dolly 2.0 交代清楚背景播客名为 Beyond the Tech主持人是 Kevin Scott 与 Christina Warren他们绝不可能是嘉宾请从文字稿中提取真正的嘉宾姓名。为了让输出格式稳定项目还自定义了一个指令文本生成 Pipeline见instruct_pipeline.py它负责按### Instruction:、### Response:、### End的结构组织提示词并精确截取模型回答保证提取结果干净可用。快速上手指南三步跑通本地嘉宾姓名提取 第一步安装依赖环境项目依赖全部集中在requirements.txt中一条命令即可完成安装pip install -r requirements.txt与本地推理直接相关的关键依赖包括onnxruntime-directmlDirectML 加速运行时、optimumONNX 模型加载与transformers模型与 Tokenizer其余则是 Whisper、LangChain 等配套组件。第二步填写你的配置密钥打开主程序PodcastSocialMediaCopilot.py在文件顶部的「Endpoint Settings」区域依次填入bing_subscription_keyBing 搜索资源密钥openai_api_base/openai_api_keyAzure OpenAI 资源地址与密钥gpt4_deployment_nameGPT-4 模型部署名称podcast_audio_file换成你自己的播客音频文件路径第三步一键运行全流程python PodcastSocialMediaCopilot.py程序会自动完成「音频切片 → Whisper 转录 → Dolly 2.0 提取嘉宾姓名 → Bing 查简介 → GPT-4 写文案 → DALL-E 配图」的完整流程并在终端实时打印每一步的中间结果。最终是否发布到 LinkedIn 需要你输入y确认——这是项目遵循 Responsible AI 实践特意保留的人工审核环节避免未经确认就自动发帖。项目代码结构速览每个文件都是干什么的PodcastSocialMediaCopilot.py主程序串联全部 6 个环节的 Copilot 流水线instruct_pipeline.py为 Dolly 2.0 定制的指令文本生成 Pipeline负责提示词格式化与结果解析dalle_helper.pyDALL-E 文生图 API 的封装助手类负责提交绘图任务并轮询结果requirements.txt全部 Python 依赖清单images/PodcastCopilotDataFlow.png官方数据流架构图PodcastSnippet.mp3官方自带的播客示例音频常见问题 FAQ Q1没有 NVIDIA 显卡能跑吗可以。ONNX DirectML 支持所有兼容 DirectX 12 的 GPUAMD / Intel / NVIDIA 均可这正是该项目选择 DirectML 而非 CUDA 的原因。Q2Dolly 2.0 只能提取嘉宾姓名吗不止。它本质上是通用指令模型你完全可以修改PodcastSocialMediaCopilot.py中的提示模板让它提取节目主题、时间戳、金句等任意结构化信息。Q3播客音频太长、内存不够怎么办程序内置了静音切片逻辑长音频会先分段再逐个转录转录结果既可以累积在内存中也可以按代码注释的提示写回磁盘方便在内存受限的机器上运行。总结一次「本地 云端」混合 AI 的最佳实践 ✅PodcastCopilot 虽然只是 Build 2023 的演示项目却示范了一个非常实用的架构思路把隐私敏感、高频耗时的环节放在本地Whisper Dolly 2.0 ONNX DirectML把需要联网检索与强生成能力的环节放在云端Bing GPT-4 DALL-E。如果你正在做播客运营、字幕处理或内容自动化不妨克隆仓库跑一遍git clone https://gitcode.com/gh_mirrors/po/PodcastCopilot亲手体验一次「自动提取播客嘉宾姓名」的本地 AI 实战你会发现Copilot 离普通开发者其实并不遥远。【免费下载链接】PodcastCopilotBuild 2023 demo项目地址: https://gitcode.com/gh_mirrors/po/PodcastCopilot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考