恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论

  • 首页
  • 资讯中心
  • /
  • 为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论

相关资讯

e2e遥测模块源码解析:PostHog事件与字段清单完全指南 2026/10/8 18:17:17
Skills不是长Prompt:AI助手技能封装的原理与实战 2026/10/8 18:17:17
在PB中动态修改SQL语句:用Describe与SetSQLSelect重构DataWindow查询的TaoToken实践 2026/10/8 18:12:17

最新资讯

基于springboot宠物领养系统-计算机毕设 附源码【课程设计】94217
DeepSeek-R1 模型架构拆解:从 MoE 到推理链路的工程视角
EasyClaw 全版本选型实操指南:基于 OpenClaw 的 AI Agent 个人 / 团队 / 企业落地全攻略|TaoToken 统一 Key 接入
让framebuffer不显示光标:无控制台场景下用TaoToken统一Key调试logo显示
拆解Open Island的Hook系统:13种AI代理Payload解码与指令响应协议全解
MT4跟单DLL桥接方案:从接口设计到部署排错全解析

今日推荐

context-mode实战指南:从全量塞入到结构化裁剪与检索增强
大模型对话上下文管理实战:三种模式与Token优化
抖音用户主页视频数据爬虫详解:点赞、收藏、分享字段抓取与 TaoToken 统一 Key 配置

本周热门

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论

发布时间:2026/10/8 18:17:17
为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论 为什么Harness比模型更重要Ante在Terminal-Bench 2.1上公开评测82.7%的方法论【免费下载链接】ante-previewGhost in your shell. Ante is a self-contained agent harness with a highly optimized core. It works like Claude Code or Codex, with none of their dependencies or model constraints.项目地址: https://gitcode.com/gh_mirrors/an/ante-previewAnte 是一个自包含的终端智能体Agent Harness像 Claude Code 一样在 Shell 中替你干活但它评测的不是某个英雄模型而是Harness 本身的调度能力——在 Terminal-Bench 2.1 官方约束下Ante 的公开全量评测达到 82.7%89 个任务 × 5 次试验 445 次独立运行并且这套结果完全可审计、可复现。这篇文章带你拆解这套评测方法论为什么它比晒一张跑分截图可信得多。什么是 Agent Harness为什么它比模型更值得评测大多数 AI 编程工具的演示都是这样的换上更贵的模型 → 分数涨 → 归功于模型。但 Ante 团队的立场正好相反我们评测的是Agent Harness——它如何调度模型的算力而不是模型本身。 ——docs-site/docs/benchmarks/eval.mdx打个比方模型是发动机Harness 是底盘和传动系统。同一台发动机装在调校精良的底盘上跑圈速度可以差出几秒。Terminal-Bench 2.1 考察的正是这套传动系统读上下文 → 推理 → 执行命令 → 验证结果这个循环的每一步都由 Harness 负责编排。方法论一评测你真正在分发的版本这是整套方法论里最反作弊的一条评测真实分发的构建每次评测都运行固定且公开可下载的 Ante 发行版与你ante update装到的是同一个二进制。没有评测专用分支也没有针对 Benchmark 定制的提示词。运行记录完全可审计每个分数都链接其原始 Harbor 运行记录任何人都能审查 445 次试验中每一次的完整过程。沙箱内真实安装测试适配器 ante-harbor/ante_agent.py 在隔离沙箱内通过官方安装脚本装好 Ante再执行--yolo --output-format json --no-skills等最小化参数运行——评测环境与用户环境一致而不是实验室特供版。换句话说你下载跑的那个二进制就是打榜的那个二进制。分数和交付物零漂移。方法论二89个任务×5次试验 445次可审计运行Ante 遵循 Terminal-Bench 官方排行榜的完整约束约束项设定任务集89 个终端任务Terminal-Bench 2.1每任务试验数5 次总试验数445 次独立运行超时与硬件与官方榜单严格一致的超时和硬件上限执行环境Harbor 隔离沙箱每次运行从零开始5 次试验的设计是为了对抗运气分——单次跑出的高分可能是蒙的5 次取平均才能看出真实水平。这也解释了为什么结果会标注误差范围例如 GLM 5.2 的74.6% ±2.06。Ante 并非第一次上榜Terminal Bench 1.02025公开榜第一Terminal Bench 2.0 验证智能体第一。连续三届榜单的成绩本身就是Harness 能力持续进化的最好证据。方法论三统一 Harness跑遍所有模型Ante 最激进的方法论设计是不发布一个英雄分数而是发布一组跨模型分数。实时看板截至 2026 年 6 月的关键数据模型准确率同模型排名DeepSeek V4.1 Flash83.9%#1GLM 5.274.6% ±2.06#1MiMo V2.565.8% ±2.30#1DeepSeek V4 Pro65.8% ±2.25#1DeepSeek V4 Flash62.7% ±2.29#1MiniMax M362.1% ±2.33#1两个值得注意的事实Ante DeepSeek V4.1 Flash 达到 83.9%370/445 次成功全量 445 次试验的推理总成本仅约 $18Ante GLM 5.2 达到 74.6%让一个开源权重模型跻身公开验证榜单的第一梯队这说明什么一个优秀的 Harness 能把前沿能力下放让中端开源模型完成以往只有昂贵旗舰模型才能胜任的工作。同模型第一#1 same-model的判定口径也很严格——在同一个模型下没有任何其他 Harness 跑出比 Ante 更高的分数。优化 Harness而不是调 PromptAnte 的评测原则里有一句非常清醒的话Improve the harness, not the prompt.如果分数提升是因为系统真的变好了那提升会保持住如果是因为调了一条 Prompt那就是脆弱的。对比一下两种提分路径路径做法结果❌ 调 Prompt针对特定 Benchmark 定制提示词分数上涨换个任务就塌✅ 改 Harness改进运行时、编排、可靠性ante-acp/src/session.rs、ante-acp/src/turn.rs 背后的会话/回合循环分数上涨且持续有效这套哲学的落地就是早开始、保持简单、隔离可复现从小而诚实的失败案例集开始每次评测都从干净环境启动——分数下跌就意味着真实回归不存在环境脏了这种借口。轻量也是实力Docker 实测 7 倍内存优势Harness 的另一个隐藏维度是资源足迹。Ante 团队在 Docker 中用相同约束跑了 20 个并行任务实测 CPU / 内存 / 磁盘指标AnteClaude CodeOpencode峰值内存1.9 GB13.9 GB12.9 GB平均 CPU1.3%12.1%3.8%磁盘总 I/O2.8 GB32.6 GB33.7 GBAnte 的峰值内存约为 Claude Code 的 1/7平均 CPU 约 1/9。对单个用户感知不强但当 Harness 轻到可以同时跑上万个实例时这份轻量就是经济账。完整数据见 docs-site/docs/benchmarks/compare_table.md。客户端/守护进程分离的架构见上图文档源 docs-site/docs/reference/architecture.mdx让 TUI、无头 CLI、ante serve前端共享同一个引擎——这也保证了无论哪种入口被测的 Harness 内核都是同一份代码。如何复现这套评测方法论的价值在于可复现。整个评测链路都由仓库内的 ante-harbor/ 目录承载适配器ante-harbor/ante_agent.py 把 Ante 接进 Harbor 测试框架ante-harbor/ante_events.py 负责把 Ante 的结构化事件流翻译成用量、步骤数、失败分类等审计元数据样本数据ante-harbor/fixtures/ 提供真实运行切片方便调试适配器执行方式harbor run --agent ante_agent:AnteAgent --dataset terminal-bench2.0 --n-attempts 5模型、Provider、推理力度均可参数化注入结果发布每次全量运行锁定具体版本号如0.preview.98原始 Harbor 运行记录公开可查结语回到标题的问题为什么 Harness 比模型更重要因为模型是公共资源人人都能接而 Harness 是私有工程决定了模型能力的损耗率。Ante 用 89×5445 次可审计运行证明了三点✅诚实——评的就是你装的那个二进制✅公平——官方约束、跨模型横评、同模型第一✅可持续——改底盘而非改提示词分数只涨不塌如果你想在自己的终端里体验这套 Harness安装入口见 README.md核心执行原语在 crates/exec/协议定义在 crates/protocol-shape/。想要一个只保留 4 个工具的极简形态复制 curated/pi.settings.json 再执行ante --profile pi即可——同一个二进制任意一种智能体这正是One Harness的全部含义。【免费下载链接】ante-previewGhost in your shell. Ante is a self-contained agent harness with a highly optimized core. It works like Claude Code or Codex, with none of their dependencies or model constraints.项目地址: https://gitcode.com/gh_mirrors/an/ante-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号