恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Skill Seekers Skill Builder 实战指南:在 Claude Code 中把任意知识源一键构建为 AI Skill
首页
资讯中心
/
Skill Seekers Skill Builder 实战指南:在 Claude Code 中把任意知识源一键构建为 AI Skill
Skill Seekers Skill Builder 实战指南:在 Claude Code 中把任意知识源一键构建为 AI Skill
发布时间:2026/9/23 2:50:41
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载导读skill-builder是 Skill Seekers 项目随 Claude Code 插件分发的一个 Agent Skill位于 distribution/claude-plugin/skills/skill-builder/SKILL.md。它把文档网站、GitHub 仓库、PDF、视频、本地代码库 → 可供 LLM 直接消费的 AI Skill这条完整流水线封装成了 Claude 可自动调用的能力底层依赖 Skill Seekers MCP Server 提供的约 40 个工具并在 MCP 未连接时提供同等的 CLI 兜底路径。读完本文你将掌握如何安装并连接 MCP 环境、如何让 Claude 自动识别 8 类知识源、如何按 7 步推荐工作流完成从抓取到发布的全过程以及每个 MCP 工具与 CLI 命令的真实参数与底层实现位置。Skill Builder 是什么Skill Builder 是一份面向 Claude 的技能说明书Agent Skill。它不包含抓取逻辑本身而是充当调度层识别用户意图当用户说把 React 文档做成一个 skill抓取 Flask 仓库并打包给 OpenAI导出到 Chroma 向量库时Claude 读取本 Skill 的检测规则决定调用哪个 MCP 工具编排流水线源类型检测 → 配置生成/拉取 → 规模预估 → 抓取 → AI 增强 → 打包 → 向量库导出降级策略如果 MCP 工具不可用Skill 明确要求使用文件底部的 CLI 兜底而不是停下原文do not stop。在插件体系中的位置见 distribution/claude-plugin/README.md插件自带 MCP Server、三个斜杠命令/skill-seekers:create-skill、/skill-seekers:sync-config、/skill-seekers:install-skill以及本 Skill。安装插件后Skill Builder 对 Claude 自动可用。环境准备安装与连接 MCPSkill Builder 文档给出的前置条件只有两步安装包含 MCP 依赖pip install skill-seekers[mcp]连接 MCP Server按安装方式二选一以 Skill Seekers 插件形式安装无需手动注册插件自带的.mcp.json会自动拉起服务器但仍需完成第 1 步安装 Python 包独立安装例如手动把 skill 复制到~/.claude/skills/需手动注册一次claude mcp add skill-seekers -- python -m skill_seekers.mcp.server_fastmcp判断是否连接成功如果scrape_docs、package_skill等工具没有出现在 Claude 的工具列表中说明服务器未连接。此时应向用户说明上面两步并立即转用 CLI 兜底方案见下文CLI 兜底一节。MCP 服务器入口为skill_seekers.mcp.server_fastmcpFastMCP 实现其工具实现按功能拆分在 src/skill_seekers/mcp/tools/ 目录下包括config_tools.py配置管理、scraping_tools.py抓取、packaging_tools.py打包/上传/增强/安装、splitting_tools.py拆分/路由、vector_db_tools.py向量库导出、source_tools.py配置源管理等模块最终在 tools/init.py 统一注册导出。何时使用 Skill Builder按 Skill 文档当用户出现以下任一诉求时应当激活本技能想从文档网站、GitHub 仓库、PDF、视频或其他来源创建 AI Skill需要把文档转换成适合 LLM 消费的格式想用最新源文档更新或同步已有 Skill需要把 Skill 导出到向量数据库Weaviate、Chroma、FAISS、Qdrant询问任何关于为 AI 抓取、转换、打包文档的问题。这也对应了插件的三种典型用法create-skill创建、sync-config同步配置、install-skill端到端安装以及直接用自然语言向 Claude 描述意图的方式。源类型自动检测Skill 文档给出了一张核心的输入模式 → 源类型 → 工具映射表这是整个流水线的入口输入模式源类型使用的工具https://...非 GitHub/YouTube文档站点scrape_docsowner/repo或github.com/...GitHub 仓库scrape_github*.pdfPDFscrape_pdfYouTube/Vimeo 链接或视频文件视频scrape_video本地目录路径代码库scrape_codebase*.ipynb、*.html、*.yamlOpenAPI、*.adoc、*.pptx、*.rss、*.1-*.8各类scrape_genericJSON 配置文件统一multi-source结合配置使用scrape_docs检测逻辑在源码层面有两处印证CLI 侧create_command.py 的帮助文本完整罗列了同一套自动检测规则URL/域名 → 网页抓取、owner/repo→ GitHub 分析、./path→ 本地代码库、file.pdf→ PDF 提取、file.docx/file.epub→ Word/EPUB 提取、youtube.com/.../file.mp4→ 视频提取、file.json→ 多源配置MCP 侧scraping_tools.py 中scrape_generic_tool内置了 10 种泛化源类型jupyter、html、openapi、asciidoc、pptx、word、confluence、notion、rss、manpage、chat并维护了每种类型到转换器配置键的映射如jupyter → notebook_path、confluence → export_pathURL 型源confluence/notion/rss/openapi则使用base_url/page_id/feed_url/spec_url等键。需要说明的是scrape_docs工具本身也具备格式自动判定能力——scrape_docs_tool 会读取配置 JSON若包含sources数组则走Unified多源格式否则按base_url/repo/pdf_path/directory等键推断 legacy 单源类型并路由到对应转换器。推荐工作流7 步Skill 文档定义了从输入到产出的标准流水线检测源类型根据用户输入判定生成或拉取配置需要时使用generate_config或fetch_config预估规模文档站点用estimate_pages抓取源使用对应的抓取工具增强用户需要 AI 能力提升时用enhance_skill打包用package_skill面向目标平台打包导出向量库按需使用export_to_*系列工具。这条流水线与源码中的调用链一一对应步骤 2 的generate_config实现于 config_tools.py默认生成 Unified 格式配置sources数组并内置保守默认值max_pages100、rate_limit0.5s默认选择器为main_content: article、title: h1、code_blocks: pre codefetch_config支持三种模式注册表命名源 直接 Git URL API实现在 source_tools.py步骤 3 的estimate_pages_toolscraping_tools.py以max_discovery默认 1000为上限做快速预估unlimitedTrue或max_discovery-1时进入无上限发现模式步骤 4 的抓取工具统一通过get_converter(source_type, config)创建转换器并进程内执行_run_converter日志实时回传步骤 6 的package_skill_toolpackaging_tools.py在targetauto时通过AgentClient.detect_default_target()自动探测目标平台。MCP 工具详解Skill 文档将约 40 个工具分为四组下面结合源码补全每个工具的真实参数与默认值。配置管理Config Management工具功能关键参数源码依据generate_config由 URL 生成抓取配置name、url、description、max_pages默认 100-1或unlimitedtrue时无上限、rate_limit默认 0.5s、force是否覆盖已存在配置list_configs列出可用预设配置无参数扫描仓库configs/目录展示 name/URL/descriptionvalidate_config校验配置文件config_path同时支持 Unified 与 Legacy 格式输出格式信息与逐源详情generate_config生成的配置可直接与仓库中的现成示例对照——例如 configs/react.json 就是一个典型的 Unified 配置顶层含name、description、version、merge_mode: rule-basedsources数组内同时挂载documentationbase_url: https://react.dev/、选择器、url_patterns排除/blog/、categories分类、rate_limit: 0.5与githubrepo: facebook/react、code_analysis_depth: deep、max_issues: 100两类源展示出文档 代码融合构建 Skill 的形态。抓取Scraping按源类型选用scrape_docs文档站点抓取。支持unlimited解除页数限制会创建临时配置、dry_run预览不落盘、skip_scrape跳过抓取、复用缓存、merge_mode覆盖 Unified 配置的合并模式等参数scrape_githubGitHub 仓库抓取。提取 README、Issues、Changelog、Releases 与代码结构参数含repo/config_path、name、description、token、no_issues/no_changelog/no_releases、max_issues默认 100、scrape_onlyscrape_pdfPDF 抓取三种输入方式config_path、直接pdf_pathname、或from_json从已提取的 JSON 重建scrape_video视频转写YouTube/Vimeo/本地文件。参数最丰富url/video_file/playlist、languages、visual逐帧画面提取、whisper_model默认 base、visual_interval默认 5s、visual_min_gap默认 2s、visual_similarity默认 0.95、vision_ocr、start_time/end_time、setup自动检测 GPU 并安装视觉提取依赖scrape_codebase本地代码库分析。directory必填depthsurface/deep/full默认 deep、enhance_level0-30 关闭 AI 增强3 为全量增强、languages、file_patterns以及一组skip_*开关默认所有功能开启API 参考、依赖图、设计模式、测试示例、How-to 指南、配置模式、文档提取scrape_generic泛化源。source_type必填jupyter/html/openapi/asciidoc/pptx/word/confluence/notion/rss/manpage/chat配合path或url与name。后处理Post-processing工具功能关键行为源码依据enhance_skillAI 增强 Skillmodelocal默认调用本地编码 Agent无需 API Key超时 900smodeapi走目标平台 API需api_key或对应环境变量增强后生成SKILL.md.backup备份package_skill面向目标平台打包skill_dir必填、targetauto/claude/gemini/openai/markdown默认 auto、auto_upload默认 true仅在检测到平台 API Key 时上传MCP 场景自动追加--no-open与--skip-quality-checkupload_skill上传到平台 APIskill_zip、target、api_key可选缺省读环境变量markdown 平台不支持上传install_skill端到端安装工作流编排 5 个阶段拉取配置 → 抓取文档 → AI 增强强制→ 打包 → 上传支持dry_run预览、unlimited、destination还可按配置中的marketplace_targets追加市场发布阶段其中install_skill_toolpackaging_tools.py是流水线的一键版它依次调用fetch_config_tool、scrape_docs_tool、enhance_skill_local.py、package_skill_tool、upload_skill_tool并输出各阶段完成清单与产物路径。其上传阶段依赖平台环境变量如ANTHROPIC_API_KEY、GOOGLE_API_KEY、OPENAI_API_KEY未设置时跳过上传并给出手动上传指引。高级Advanceddetect_patterns在代码中检测设计模式Singleton、Factory、Observer、Strategy、Decorator、Builder、Adapter、Command、Template Method、Chain of Responsibility支持 10 种语言参数file/directory、depth、jsonextract_test_examples从测试文件提取真实 API 用法示例实例化、方法调用、配置、fixture 与多步工作流Python 使用 AST 深度分析其余语言正则分析参数language、min_confidence默认 0.5、max_per_file默认 10build_how_to_guides基于test_examples.json生成分步教学指南支持 4 种分组策略ai-tutorial-group、file-path、test-name、complexity与no_ai开关split_config拆分超大配置如 1 万页以上的文档站按 5000 页/份切分Unified 配置按源类型拆分strategy可选 auto/none/source/category/router/size实现在 splitting_tools.pyexport_to_weaviate/export_to_chroma/export_to_faiss/export_to_qdrant把 Skill 目录导出为对应向量库的 JSON 包含 schema、objects、config实现在 vector_db_tools.py每个工具还会输出一段可复制的 Python 上传/查询示例代码。CLI 兜底MCP Server 未连接时Skill 文档强调MCP 工具不可用绝不意味着流程中断。同一套流水线可从命令行执行需pip install skill-seekersskill-seekers create source # 自动检测URL、owner/repo、./path、file.pdf、视频链接…… skill-seekers package skill_dir --target claude # 目标平台可为 gemini/openai/langchain/chroma/...关键语义create一步完成检测 → 抓取 → 构建加--enhance-level 0可跳过 AI 增强命令结束后读取生成的SKILL.md并向用户总结产物内容。create子命令的实现位于 create_command.py除了自动检测外还提供一套实用的辅助能力三档预设-pquick约 1-2 分钟基础功能、standard约 5-10 分钟推荐、comprehensive约 20-60 分钟全功能渐进式帮助--help-web、--help-github、--help-local、--help-pdf、--help-word、--help-epub、--help-video、--help-config、--help-advanced、--help-all按源类型分组展开 13→120 个参数避免一次性输出全部选项常见组合skill-seekers create source -p quick、skill-seekers create source -p standard --enhance-level 2、skill-seekers create source --chunk-for-rag面向 RAG 的分块。此外skill-seekers package支持--target指定 21 个 LLM 平台适配器实现在 src/skill_seekers/cli/adaptors/MCP 的package_skill_tool与 CLI 走的是同一套get_adaptor适配器机制。完整实战示例结合插件用法与上述工具链一次典型的React 文档 → Claude Skill会话如下# 1. 安装MCP 模式 pip install skill-seekers[mcp] # 2. 连接 MCP独立安装场景 claude mcp add skill-seekers -- python -m skill_seekers.mcp.server_fastmcp # 3. 在 Claude 中发起请求 # 把 https://react.dev 做成一个 Claude skill # 4. 内部自动执行的步骤等价于如下命令 skill-seekers create configs/react.json -p standard --enhance-level 2 skill-seekers package output/react --target claude若 MCP 未连接直接用 CLI 兜底skill-seekers create https://react.dev -p standard skill-seekers package output/react --target claude之后读取生成的output/react/SKILL.md向用户汇报Skill 名称、覆盖的文档范围、增强内容与打包产物路径。若需要进一步接入 RAG可继续调用export_to_chroma等工具将同一份 Skill 目录导出为向量库格式。排查与最佳实践工具列表中看不到scrape_docs/package_skill说明 MCP Server 未连接。按环境准备一节重新执行安装与注册两步期间用 CLI 兜底继续任务大站点抓取超时/页数过多先用estimate_pages预估规模再决定是否使用split_config按 5000 页/份切分或将max_pages调低确需全量抓取时再用unlimitedtrue自动上传失败package_skill与install_skill仅在检测到平台 API Key 时才上传未设置环境变量如ANTHROPIC_API_KEY时会优雅跳过并提示手动上传不会中断打包产物质量install_skill将 AI 增强设为强制阶段因为文档声称增强能带来明显的质量提升质量分从 3/10 提升到 9/10见 packaging_tools.py 的说明package_skill在交互式终端外会自动跳过质量检查对话框适合自动化场景复用与同步generate_config生成的配置保存在configs/目录可手工微调后复用插件还提供sync_config命令MCP 侧为sync_config_tool见 sync_config_tools.py用于让既有配置与线上文档保持同步。结语Skill Builder 的价值在于把 Skill Seekers 的完整工程能力8 类源检测、多源 Unified 配置、AI 增强、21 平台打包、4 种向量库导出收敛为 Claude 里一段可自主决策的技能说明检测、编排、降级三者齐备且每条指令都能在 src/skill_seekers/mcp/tools/ 与 src/skill_seekers/cli/ 的源码中找到对应的实现依据。对于希望让 Agent 自主完成知识源 → AI Skill闭环的团队这份 Skill 与配套的 MCP Server 提供了开箱即用的参考实现。赞分享人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载相关推荐Skill Seekers 的 create-skill 命令实战一条命令把任意知识源变成 Claude AI SkillSkill Seekers 的 create skill 命令实战一条命令把任意知识源变成 Claude AI Skill 本文以 Skill Seekers人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 抓取指南17 种知识源一键转换为 Claude Skill 的完整实战手册Skill Seekers 抓取指南17 种知识源一键转换为 Claude Skill 的完整实战手册 本文对应 Skill Seekers 的官方抓取指南人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 项目扫描实战用 skill-seekers scan 为真实代码库一键构建 AI 技能知识库Skill Seekers 项目扫描实战用 skill seekers scan 为真实代码库一键构建 AI 技能知识库 skill seekers scan人工智能AI 应用AI 技能RAGMCP 服务网页爬虫创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考