恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?
首页
资讯中心
/
SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?
SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?
发布时间:2026/10/11 19:43:19
人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载SkillsBench是目前首个专门评测AI Agent Skills智能体技能的开源基准benchmark它用同一任务 × 有无技能 × 多次重复的配对实验跑出了7,308 条真实执行轨迹来回答一个关键问题——给 Agent 挂载技能文件Skills到底能不能、以及在多大程度上提升任务成功率本文用通俗的方式带你读完这些数据的结论。Agent技能是什么为什么需要基准测试先说结论性的背景大模型很聪明但缺乏程序性知识procedural knowledge——即这类工作该怎么一步步做的领域惯例和标准操作。微调太贵于是业界流行给 Agent 挂载技能包一个包含指令、脚本、参考资料的结构化文件夹在推理时动态加载不改模型本身。可以把它类比成模型是 CPUAgent 运行框架harness是操作系统技能就是安装的应用程序。社区里已经出现了数万个用户贡献的技能GitHub 上 45k 的 SKILL.md但一直没有基准系统性地回答技能真的有用吗多少有用什么时候反而有害SkillsBench 就是为此而生。基准构成配对实验设计是关键SkillsBench 的方法论核心是配对评估paired evaluation同一任务在同一个 Docker 容器里分别跑三种条件——Condition A无技能只有任务指令Condition B挂载专家编写的技能包指令中不点名技能考察 Agent 是否会主动调用Condition C自生成技能让 Agent 先自己写技能再解题任务覆盖11 个专业领域软件工程、自然科学、网络安全、金融、制造、医疗等按人工耗时分为 Core / Extended / Extreme 三档难度。任务由 105 位贡献者提交经过自动校验 人工审核两级筛选。每个任务都是自带确定性验证器程序化断言不用 LLM 当裁判的独立容器保证结果可复现。想亲手复现实验流程可以打开仓库里的 experiments/run_experiment.ipynb 实验笔记本任务分类学定义见 taxonomy.md。核心发现一技能平均提升16个百分点但差异巨大在 7 种 Agent 模型组合、84 个任务、每任务 5 次试验合计约 7.3k 次试跑中所有配置在挂载技能后性能都上升了平均 16 个百分点区间为13.6 ~ 23.3Agent 模型无技能有技能提升Gemini CLI (Gemini 3 Flash)31.348.717.4Claude Code (Opus 4.5)22.045.323.3Codex (GPT-5.2)30.644.714.1v1.1 版本进一步扩大到87 个任务 × 18 种模型-框架组合平均解决率从33.9% 提升到 50.5%16.6 分所有配置均为正增益。核心发现二技能可能帮倒忙——盲目挂载是危险的技能并非处处增益。在 v1 的 84 个任务中16 个任务出现负向效果最惨的一个任务掉了 39.3 分软件工程、数学这类模型预训练覆盖充足的领域增益最小4.5 ~ 6.0 分。v1.1 中仍有13/87 个任务技能后效果反而变差。规律很清晰模型越不擅长的领域技能越值钱模型已经见过很多的专业外部程序性指导的边际价值就小。所以实践建议是——先小规模 A/B 测试再决定给哪个领域挂技能。核心发现三模型自己写的技能反而拉低性能最反直觉的一条让 Agent自己先生成技能再解题Bring Your Own Skills 条件结果不如不挂技能——在 v1.1 的三个配置上分别下降 8.1 / 11.3 / 11.5 分而同期专家技能包带来 18.2 ~ 24.8 分的提升。轨迹分析揭示了两种失败模式模型要么写出的技能过于笼统比如只写用 pandas 处理数据却没有任何具体 API 模式要么根本没意识到任务需要专业技能。有效的技能需要人类领域的专家经验模型目前无法可靠地自我生产。核心发现四小模型好技能可替代大模型成本敏感的朋友重点看这条Haiku 4.5 技能27.7%明显超过了 Opus 4.5 无技能22.0%。用更便宜、更小的模型配上正确的程序性知识可以追平甚至反超更大模型裸跑的表现在 v1.1 中同样成立GLM 5.1 技能58.4%超过了 Opus 4.8 无技能45.7%。从7,308条轨迹提炼的好技能设计准则论文对轨迹做了逐条归因沉淀出几条非常实用的技能设计准则数量上少即是多每任务2~3 个技能增益最优v1.1 中 19.0 分堆到 4 个以上收益骤降至 10.1 分长度上精简胜冗长紧凑/标准长度技能增益 19~21.5 分百科全书式技能只有 0.7 分可运行代码示例是最大增量从纯文字说明升级到带可执行示例是性能跳变最大的一步调用率差异巨大技能调用率Skill Invocation Rate在不同框架间从46% 到 99%不等——你的 Agent 框架是否会主动读取技能文件本身就决定了收益上限意外收获挂载技能后平均单任务耗时反而从 14.5 分钟降到 13.8 分钟又快又准。如何上手与参与快速上手与任务验证流程见 README.md贡献新任务的完整规范见 CONTRIBUTING.md实验配置含各框架的有/无技能对照 YAML在 experiments/configs/ 下v1.1 完整结果与解读见 website/src/content/news/skillsbench-1-1.mdx社区技能生态调研2M 技能快照的分类、去重、相似度分析在 docs/skills-research/想跑本地实验克隆仓库git clone https://gitcode.com/gh_mirrors/sk/skillsbench再安装 BenchFlow CLI 即可验证任务结论7,308 条轨迹给出的答案相当明确技能确实能提升 Agent 性能平均 16 分左右但增益高度依赖于领域 × 技能质量 × 框架三重匹配。技能不是免费午餐——写错的技能会拖后腿模型也还不会自己写好技能。对使用者的落地建议就一句话挑对领域、保持精简、带上可运行示例、先小范围验证再全面铺开。赞分享人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载相关推荐SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌 AI技能Skills正在成为AI编程代理生态中最活跃的一环但人工智能大模型AI 评测Agent 评测VRR测试真的能提升你的显示器性能吗一键验证指南VRR测试真的能提升你的显示器性能吗一键验证指南 还在为游戏画面撕裂而烦恼吗可变刷新率技术或许正是你需要的解决方案今天我们将通过VRRTest这款轻量级工开发工具智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘 在数字内容爆炸的时代视频创作者面临着巨大的效率挑战。NarratoAI作为一款利用AIAI 应用大模型音视频语音媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考