恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?

  • 首页
  • 资讯中心
  • /
  • SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?

相关资讯

如何选对AI模型?MeiGen AI Design MCP模型清单指南:GPT Image 2、Midjourney V8.1一文讲透 2026/10/11 19:43:19
线性回归可执行教案:从推导到代码的完整复现 2026/10/11 19:43:19
WINCC SQL报表开发:VBScript+ActiveX实现查询打印 2026/10/11 19:43:19

最新资讯

avalon 属性操作进阶:`ms-attr` 从指令拆分到对象化表达的演进与源码解析
注意力机制计算规则学习
CAN控制器与收发器深度解析|全网独家拆解层级分工与硬件协同逻辑、厘清信号转换链路、助力车载工业CAN总线高可靠稳定通信
Spotless 版本发布流程全指南:从 CHANGES 修订、changelogPush 到真实项目冒烟测试
Apache Beam 的 Cloud Dataflow Runner 完整使用指南:托管执行、管道选项与实战配置
AI Agent 面试题 098:如何设计LLM-as-Judge的评分标准和评估Prompt?

今日推荐

Debian新手入门:从部署到日常操作的完整指南
MongoDB复制集扩缩容实战:从rs.add到选主事故复盘
条形码目标检测数据集实战:从YOLOv8训练到部署

本周热门

UE动画修改实战:从资产编辑到重定向与蒙太奇驱动
统计随机数生成器攻击下的KLJN安全密钥交换协议Matlab仿真
政务API安全治理:资产测绘、低代码编排与行标对标实践

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?

发布时间:2026/10/11 19:43:19
SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗? 人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载SkillsBench是目前首个专门评测AI Agent Skills智能体技能的开源基准benchmark它用同一任务 × 有无技能 × 多次重复的配对实验跑出了7,308 条真实执行轨迹来回答一个关键问题——给 Agent 挂载技能文件Skills到底能不能、以及在多大程度上提升任务成功率本文用通俗的方式带你读完这些数据的结论。Agent技能是什么为什么需要基准测试先说结论性的背景大模型很聪明但缺乏程序性知识procedural knowledge——即这类工作该怎么一步步做的领域惯例和标准操作。微调太贵于是业界流行给 Agent 挂载技能包一个包含指令、脚本、参考资料的结构化文件夹在推理时动态加载不改模型本身。可以把它类比成模型是 CPUAgent 运行框架harness是操作系统技能就是安装的应用程序。社区里已经出现了数万个用户贡献的技能GitHub 上 45k 的 SKILL.md但一直没有基准系统性地回答技能真的有用吗多少有用什么时候反而有害SkillsBench 就是为此而生。基准构成配对实验设计是关键SkillsBench 的方法论核心是配对评估paired evaluation同一任务在同一个 Docker 容器里分别跑三种条件——Condition A无技能只有任务指令Condition B挂载专家编写的技能包指令中不点名技能考察 Agent 是否会主动调用Condition C自生成技能让 Agent 先自己写技能再解题任务覆盖11 个专业领域软件工程、自然科学、网络安全、金融、制造、医疗等按人工耗时分为 Core / Extended / Extreme 三档难度。任务由 105 位贡献者提交经过自动校验 人工审核两级筛选。每个任务都是自带确定性验证器程序化断言不用 LLM 当裁判的独立容器保证结果可复现。想亲手复现实验流程可以打开仓库里的 experiments/run_experiment.ipynb 实验笔记本任务分类学定义见 taxonomy.md。核心发现一技能平均提升16个百分点但差异巨大在 7 种 Agent 模型组合、84 个任务、每任务 5 次试验合计约 7.3k 次试跑中所有配置在挂载技能后性能都上升了平均 16 个百分点区间为13.6 ~ 23.3Agent 模型无技能有技能提升Gemini CLI (Gemini 3 Flash)31.348.717.4Claude Code (Opus 4.5)22.045.323.3Codex (GPT-5.2)30.644.714.1v1.1 版本进一步扩大到87 个任务 × 18 种模型-框架组合平均解决率从33.9% 提升到 50.5%16.6 分所有配置均为正增益。核心发现二技能可能帮倒忙——盲目挂载是危险的技能并非处处增益。在 v1 的 84 个任务中16 个任务出现负向效果最惨的一个任务掉了 39.3 分软件工程、数学这类模型预训练覆盖充足的领域增益最小4.5 ~ 6.0 分。v1.1 中仍有13/87 个任务技能后效果反而变差。规律很清晰模型越不擅长的领域技能越值钱模型已经见过很多的专业外部程序性指导的边际价值就小。所以实践建议是——先小规模 A/B 测试再决定给哪个领域挂技能。核心发现三模型自己写的技能反而拉低性能最反直觉的一条让 Agent自己先生成技能再解题Bring Your Own Skills 条件结果不如不挂技能——在 v1.1 的三个配置上分别下降 8.1 / 11.3 / 11.5 分而同期专家技能包带来 18.2 ~ 24.8 分的提升。轨迹分析揭示了两种失败模式模型要么写出的技能过于笼统比如只写用 pandas 处理数据却没有任何具体 API 模式要么根本没意识到任务需要专业技能。有效的技能需要人类领域的专家经验模型目前无法可靠地自我生产。核心发现四小模型好技能可替代大模型成本敏感的朋友重点看这条Haiku 4.5 技能27.7%明显超过了 Opus 4.5 无技能22.0%。用更便宜、更小的模型配上正确的程序性知识可以追平甚至反超更大模型裸跑的表现在 v1.1 中同样成立GLM 5.1 技能58.4%超过了 Opus 4.8 无技能45.7%。从7,308条轨迹提炼的好技能设计准则论文对轨迹做了逐条归因沉淀出几条非常实用的技能设计准则数量上少即是多每任务2~3 个技能增益最优v1.1 中 19.0 分堆到 4 个以上收益骤降至 10.1 分长度上精简胜冗长紧凑/标准长度技能增益 19~21.5 分百科全书式技能只有 0.7 分可运行代码示例是最大增量从纯文字说明升级到带可执行示例是性能跳变最大的一步调用率差异巨大技能调用率Skill Invocation Rate在不同框架间从46% 到 99%不等——你的 Agent 框架是否会主动读取技能文件本身就决定了收益上限意外收获挂载技能后平均单任务耗时反而从 14.5 分钟降到 13.8 分钟又快又准。如何上手与参与快速上手与任务验证流程见 README.md贡献新任务的完整规范见 CONTRIBUTING.md实验配置含各框架的有/无技能对照 YAML在 experiments/configs/ 下v1.1 完整结果与解读见 website/src/content/news/skillsbench-1-1.mdx社区技能生态调研2M 技能快照的分类、去重、相似度分析在 docs/skills-research/想跑本地实验克隆仓库git clone https://gitcode.com/gh_mirrors/sk/skillsbench再安装 BenchFlow CLI 即可验证任务结论7,308 条轨迹给出的答案相当明确技能确实能提升 Agent 性能平均 16 分左右但增益高度依赖于领域 × 技能质量 × 框架三重匹配。技能不是免费午餐——写错的技能会拖后腿模型也还不会自己写好技能。对使用者的落地建议就一句话挑对领域、保持精简、带上可运行示例、先小范围验证再全面铺开。赞分享人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载相关推荐SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌 AI技能Skills正在成为AI编程代理生态中最活跃的一环但人工智能大模型AI 评测Agent 评测VRR测试真的能提升你的显示器性能吗一键验证指南VRR测试真的能提升你的显示器性能吗一键验证指南 还在为游戏画面撕裂而烦恼吗可变刷新率技术或许正是你需要的解决方案今天我们将通过VRRTest这款轻量级工开发工具智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘 在数字内容爆炸的时代视频创作者面临着巨大的效率挑战。NarratoAI作为一款利用AIAI 应用大模型音视频语音媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号