恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
把 AI 知识库搬回本机纯国内 永久免费 · 0 Token 的羽山数智方案
首页
资讯中心
/
把 AI 知识库搬回本机纯国内 永久免费 · 0 Token 的羽山数智方案
把 AI 知识库搬回本机纯国内 永久免费 · 0 Token 的羽山数智方案
发布时间:2026/8/28 21:53:12
AI本地知识库搭建方案纯国内 · 永久免费 · 0 Token · 数据不出本机实测 18/18 校验通过 · Qwen3-8B BGE-M3 · Top-1 检索相关度 0.82 · 断网永久可用先问三个扎心的问题你有没有算过用云端 AI 知识库一年花了多少 Token你的笔记、文档、内部资料又上传了多少到第三方服务器羽山数智方案AI本地知识库搭建方案 思源笔记 本地大模型 本地向量库——0 费用、0 出境、0 绑定。整条链路笔记存储、语义检索、智能问答、工作流编排全部跑在自己的电脑上。这不是概念稿是跑通了的实盘18/18 交付校验通过Qwen3-8B BGE-M3 本地推理Top-1 检索相关度 0.82Agent 自动调用工具且零幻觉。Python代码平台MIT 开源。一、先看证据凭什么信你技术方案的说服力从来不在 PPT 里在实测数据里验证项实测结果交付校验verify_hermes.py18 / 18 全过语法 / 依赖 / 分块 / 6 工具 / MCP Schema / 配置持久化语义检索Top-4 命中最高相关度 0.82BGE-M3 中文嵌入Agent 工具循环自动调用search_notes结构化回答逐条标注来源 [文件名]服务自检Ollama ✓ · Qwen3-8B ✓ · 嵌入 ✓ · 知识库 36 片段运行成本0 Token——模型常驻本地问多少次都不花钱断网可用模型下载完成后离线永久使用二、三条路总有一条适合你你的水平推荐路径耗时纯小白下载一键包 跟着界面点Web 平台5 分钟会用命令行按「快速开始」四步跑通10 分钟开发者读hermes_core.py扩展自己的工具按需三、用了之后你每天省下什么不用 vs 用了落差是这样的场景云端方案Hermes 本地方案 费用每月 ¥200 Token 费知识库越大越贵¥0一次性下载模型即可 数据笔记、文档全部上传第三方服务器全程不出本机合规审计直接过✈️ 离线断网/高铁/飞机/内网环境不可用照常问答永久离线 绑定换产品 重新迁移知识资产MIT 开源随时可改可带走 费用估算口径按每日 50 次问答 × 云端 API 计费估算实际随使用频率浮动。四、三方对比Hermes vs ObsidianWorkBuddy vs Notion AI维度Obsidian WorkBuddy 云 APINotion AI**Hermes本方案**笔记存储Obsidian本地Notion 云思源笔记本地AGPL智能体调度WorkBuddy云端 SaaS内置Hermes本地MIT大模型云端 API云端 APIOllama Qwen3本地嵌入云端 Embedding API云端BGE-M3本地向量库托管服务托管ChromaDB本地文件月成本¥100–500¥80–200¥0数据出境是是否断网使用否否是可审计/私有化否否是全栈开源五、一年成本账云端 vs 本地项目云端方案1 年Hermes1 年API 调用费¥2,400按月 ¥200 计¥0向量库托管¥600–1,200¥0订阅费¥1,000¥0一次性投入—下载模型 5–17 GB电费可忽略合计¥4,000–5,000≈ ¥0六、它凭什么做到架构与实现思源笔记 / Hermes CLI / Web 操作平台交互层↓ 自然语言提问 / HTTP 127.0.0.1:11434无需 KeyHermes Agent 中枢思考 → 工具调用 → 汇总 · MCP Tool Schema↓OllamaQwen3-8B 对话推理 BGE-M3 中文嵌入↓ChromaDB 本地持久化 Markdown 笔记存储层三个让你秒懂的设计检索是找邻居不是搜关键词BGE-M3 把你的每篇笔记变成 1024 个数字的坐标提问时找最近的邻居——就像图书馆按主题分类而不是按书名排序。让 7B 小模型不胡说把模型想象力调到 0.1低温采样再给它一个固定回答模板检索结果双通道注入。这是用提示词对照实验跑出来的最优组合——实测逐条标注来源、零编造。分块像切披萨按你笔记的标题结构切块每块带上父标题当上下文——就像切披萨时每块都带点边上的料语义完整不割裂。核心模块hermes_core.py500 余行模块职责Config集中管理所有路径与模型配置一键保存/加载HermesTools6 个 MCP 兼容工具语义检索、目录读写、思源 SQL 反查、自检RAGEngine本地 BGE-M3 嵌入 ChromaDB 持久化Markdown 友好分块HermesAgent思考 → 工具调用 → 汇总回答的 Agent 循环CLIinit / ingest / query / chat / health 五个命令七、杀手级差异思源 SQL 反查这个能力几乎所有同类方案都没有——Obsidian 的 Dataview 是静态查询而 Hermes 能在 AI 回答时自动反查思源数据库把结构化笔记任务、日记、项目也纳入检索范围。# Hermes 内置工具直接对思源 SQL API 反查双链/块引用recall_from_siyuan SELECT * FROM blocks WHERE typed AND content LIKE %待办%笔记的正文走向量检索语义结构化数据走 SQL 反查精确——两条腿走路这是纯 Markdown 方案给不了的。八、Web 操作平台不只是 CLI很多人以为知识库工具命令行其实 Hermes 带完整可视化平台五大功能页仪表盘服务自检/智能问答Agent 对话 RAG 检索测试/知识库一键导入/笔记在线编辑/设置模型下拉框实时读取 Ollama。九、避坑记录两个真实踩过的坑坑 1Ollama 官方源国内不可达走 ModelScope 导入ollama pull走官方源在国内经常超时。实测可行路径# 1. ModelScope 下载 GGUF国内直连约 4.7 GBcurl -L -o Qwen3-8B-Q4_K_M.gguf \https://modelscope.cn/api/v1/models/Qwen/Qwen3-8B-GGUF/repo?FilePathQwen3-8B-Q4_K_M.gguf# 2. 写 ModelfileChatML 模板 停止符# 3. 本地导入之后断网永久使用ollama create qwen3:8b -f Modelfile注意Qwen3 系列没有 7B 档位对应 Qwen2.5-7B 的是 8B——很多教程写的qwen3:7b实际应为qwen3:8b。坑 2从 Obsidian 迁移到思源好消息思源可直接导入 Markdown 原文双向链接、知识图谱体验高度一致需注意Dataview / Templater 这类 Obsidian 特有语法要在思源中用「模板片段 / SQL 嵌入」重建——这是迁移唯一需要手动处理的部分完成后:ingest重建向量索引即可原有笔记零改动。十、代码走读Agent 循环的精妙 30 行hermes_core.py里最值得读的是 Agent 循环——它让 7B 小模型也能可靠地思考→调用工具→汇总for _ in range(cfg[max_tool_rounds]):resp _ollama_request(f{cfg[ollama_url]}/api/chat, payload)calls (resp.get(message, {}) or {}).get(tool_calls) or []if not calls:return msg.get(content, ).strip()msgs.append({role: assistant, content: msg.get(content, ), tool_calls: calls})for tc in calls:result tools.call(fn.get(name, ), raw)msgs.append({role: tool, content: result})if fn.get(name) search_notes: # 检索结果双通道注入防幻觉msgs.append({role: system, content: freference{result}/reference})两个关键设计双通道注入检索结果同时出现在 tool 消息和 system 参考块——7B 模型对 tool 消息注意力弱双通道保证最终回答不编造来源强制标注系统提示要求逐条标注[文件名]回答可回溯、可审计。十一、快速开始10 分钟版# 1. 安装 Ollama拉取模型首次联网之后永久离线ollama pull qwen3:8bollama pull bge-m3# 国内网络从 ModelScope 下载 GGUF 后 ollama create 导入见第九节# 2. Python 依赖pip install chromadb sentence-transformers requests fastapi uvicorn# 3. 初始化 构建知识库python hermes_core.py initpython hermes_core.py ingest --dir ~/SiYuan/data# 4. 使用CLI 与 Web 二选一python hermes_core.py chat # 命令行对话python webui.py # Web 操作平台 http://127.0.0.1:8767模型选择建议内存推荐模型说明8 GBQwen3-4B可用推理偏慢16 GBQwen3-8B推荐平衡点本项目实测≥32 GBQwen3-14B / 32B质量更好BGE-M3 约 2.1 GB纯 CPU 即可运行。十二、谁适合这套方案个人知识工作者笔记量大、重视隐私、不想持续付费高铁上、飞机上、断网时照常查自己的知识库企业与机构数据主权敏感金融 / 政务 / 研发全栈国产化、可审计、可私有化部署开发者MIT 开源自由扩展工具、接入更多数据源、定制 Agent 工作流。一句话笔记层用思源调度层用 Hermes模型层跑 Ollama Qwen3——中文适配、数据主权、离线能力全面占优完全自主可控。Hermes 已开源 · MIT 协议 · 可商用、可修改、可私有化部署配套交付hermes_core.py核心 500 行/webui.pyWeb 操作平台/verify_hermes.py18 项校验/README.md部署文档