恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
从bench到优化循环:用evo:optimize自动驱动AI代码优化的实战教程
首页
资讯中心
/
从bench到优化循环:用evo:optimize自动驱动AI代码优化的实战教程
从bench到优化循环:用evo:optimize自动驱动AI代码优化的实战教程
发布时间:2026/10/12 6:24:07
【免费下载链接】evoturns your codebase into an autoresearch loop — discovers what to measure, instruments the benchmark, then runs tree search with parallel subagents.项目地址https://gitcode.com/gh_mirrors/evo13/evo点击查看免费下载evo 是一个把代码库变成自动研究autoresearch循环的开源工具先用/evo:discover自动发现要优化的指标并搭好 benchmark再用/evo:optimize启动优化循环——编排器派发多个并行 subagent 各自在独立 worktree 中提假设、改代码、跑评测保留提升分数的改动丢弃失败的实验。本文带你用两条命令跑通整个 AI 代码优化流程。evo 是什么比“爬山法”更强的自动优化循环传统的自动优化如 Karpathy 的 autoresearch本质是贪心爬山试一下、保留或回滚、在单条分支上重复。evo 在这之上加了结构树搜索Tree search多个方向可以从任意已提交节点分叉探索不会塌缩到一条路径并行半自主 subagent每个 subagent 在自己的 git worktree 里读 trace、提假设、跑多轮迭代共享状态失败 trace、注释、被丢弃的假设对每个 agent 可见Gates门禁回归测试或安全检查不过关的实验即使分数更高也会被丢弃Dashboard实时可视化最优分数与实验树它运行在 Claude Code、Codex、Cursor、Kimi、OpenClaw、Hermes、Opencode、Pi 等 agent 框架上实验可以跑在本地也可以跑在 Modal、E2B、Daytona、AWS、Azure、SSH 等远程沙箱里。三步安装最快配置方法# 1. 安装 evo CLI uv tool install evo-hq-cli # 2. 安装宿主 agent二选一示例 npm install -g anthropic-ai/claude-code # 或 openai/codex # 3. 安装插件与宿主 hooks evo install claude-code # 或 codex / cursor / kimi / opencode 等如需远程后端用对应 extra 安装例如uv tool install evo-hq-cli[modal]。完整的命令速查见 cli-quick-reference.md。第一步/evo:discover 自动发现优化指标并构建 benchmark进入你的项目后在宿主 agent 中执行/evo:discover make the JSON parser at src/parser.py fasterdiscover会探索仓库、回答“优化什么、benchmark 命令是什么、指标方向是 max 还是 min”——你也可以像上面这样直接把答案塞进命令跳过提问。它会自动完成三件事构建评测在 baseline worktree 中搭好 benchmark并接好 trace 插桩优先用 SDK 方式见 sdk_node.js 与 sdk_python.py注册 gates如果 benchmark 是新建的自动附加一个“留出集分数下限”门禁防止优化循环通过返回常数、跳过工作、牺牲正确性换速度来作弊提交 baseline跑出第一个实验记下基线分数并自动启动 Dashboarddiscover 的详细流程定义在 discover/SKILL.md。第二步/evo:optimize 启动并行优化循环/evo:optimize subagents3 budget5 stall5这就是整个项目的核心。每个 round编排器orchestrator会读状态evo scratchpad、evo frontier查看实验树、frontier 节点与失败模式派 scan subagent 做跨实验分析找出重复失败的根因、共性墙模式写结构化 brief每个 subagent 一份包含 Objective要攻击的瓶颈、Parent node从哪个实验分叉、Boundaries不要尝试什么、Pointer traces先研究哪些任务并行派发 N 个优化 subagent每个在自己的 worktree 里evo new→ 改代码 →evo run分数提升且过 gate 才提交收集结果、裁剪分支然后进入下一轮直到连续stall轮默认 5 轮没有提升才自动停止三个旋钮值得了解参数说明见 optimize/SKILL.md参数含义怎么选subagentsN每轮并行宽度独占 GPU / 独占资源 → 1CPU 轻量隔离任务 → 可以更大budgetN每个 subagent 分支内的迭代深度运行确定性高可以给更大stallN连续多少轮无提升则停止默认 5宽度选择有讲究并行度过低浪费墙钟时间过高则内存抖动、OOM甚至干扰计时类 benchmark 的测量精度。选择前先通读 sizing-the-round.md里面枚举了独占加速器、内存重型、共享可变 fixture、外部限流等情形。Frontier 策略下一轮往哪走每轮结束后编排器按策略选择从哪个已提交分支继续扩展argmax——扩展分数最高的分支top_k——在 K 个最优中轮询epsilon_greedy——多数时候选最优偶尔随机探索softmax——按分数加权采样pareto_per_task——保留聚合分数掩盖的单项专家在 Dashboard 的 Frontier 标签页中即可切换并调参。循环中的实用小技巧无人值守默认autonomous on循环跨轮次自动推进想每轮停一下就evo autonomous off中途下指令evo direct可以在运行中注入用户级指令agent 收到 banner 后evo ack确认等待别用 while 轮询用evo wait --for processpid --for log-growthlog --timeout 60m进程退出、日志停更或超时任意一个条件触发即返回见 evo-wait.md卡壳时自动补充创意连续 3 个实验无进展或每 5 个提交实验会并行派出 ideator失败分析 / 文献扫描 / frontier 外推产出新假设Dashboard实时监控你的 AI 代码优化进度/evo:discover或evo init会自动启动 Dashboard 并打印 URL默认http://127.0.0.1:8080端口被占时自动顺延。顶栏四个指标一目了然Best Score当前最优及相对基线的提升、Experiments总数与 kept/skip/err 分布、Frontier可探索的开放分支数、Active正在运行的实验数。中间是实验树——每个节点标注假设与分数点击节点可看 SUMMARY / DIFF / TASKS 三个标签底部是分数随时间的阶梯曲线。不想开浏览器时evo report会在终端直接渲染分数散点图evo status、evo frontier、evo show exp_id则是最常用的只读排查命令。收尾/evo:ship 把胜出实验变成可合并的改动循环停止后别急着手动git diff——胜出 worktree 的 diff 通常混着调试打印、搜索过程中的反复修改直接合并不干净。执行/evo:shipship 技能ship/SKILL.md会自动选出历史中分数最高的有效实验展示 baseline → winner 的累计 diff 供你确认然后重新推导出一个最小、干净、可复现胜出行为的改动有 remote 就开 PR否则合并进工作分支并附上一份 mergeability 报告。指定具体实验则用/evo:ship exp_0042。常见问题Q串行任务比如只有 1 张 GPU值得用 evo 吗值得。/evo:optimize subagents1依然保留完整结构——round 之间的跨切面扫描、verifier 预检/事后审计、ideator 补充创意、frontier 选择与 stall 纪律这些才是循环价值的核心并行只是其中一环。Q实验会改坏我的仓库吗不会。每个实验在独立 worktree / 远程容器中运行失败即丢弃gate 不过不提交所有状态写入都走evoCLIevo new/evo run/evo discard等由锁管理避免手工改graph.json造成的竞态。Q如何升级evo update # 升级 CLI 所有已安装宿主 evo update codex --force # 单个宿主0.4.4 之前版本迁移建议加 --force小结整个流程只有两条核心命令/evo:discover # 一次性发现指标、构建 benchmark、注册 gates、提交基线 /evo:optimize # 启动优化循环并行 subagent 树搜索 gates直到分数停滞 /evo:ship # 收尾把胜出实验蒸馏成可合并的改动evo 把改代码 → 跑评测 → 保留/丢弃这条循环从手工变成了有共享状态、有门禁、有观测面的自动研究系统。挑一个有清晰可测指标的目标解析器提速、agent 任务成功率、模型质量等让机器替你夜以继日地爬山你只负责早上看 Dashboard 上的 0.94。更多细节README.md 中有完整的后端对照表与安装说明Python/Node 两套评测插桩 SDK 分别在 sdk/python 与 sdk/node。赞分享【免费下载链接】evoturns your codebase into an autoresearch loop — discovers what to measure, instruments the benchmark, then runs tree search with parallel subagents.项目地址https://gitcode.com/gh_mirrors/evo13/evo点击查看免费下载相关推荐Scalene AI 优化建议实战从 profiling 到自动化代码优化Scalene AI 优化建议实战从 profiling 到自动化代码优化 本文围绕 Scalene 仓库中 test/automatic/README.md开发工具性能测试AI 应用A-Evolve 完全指南用 LLM 驱动的演化循环自动优化 AI AgentA Evolve 完全指南用 LLM 驱动的演化循环自动优化 AI Agent A Evolve 是一套面向任意领域、任意演化算法的 AI Agent 自我进AI 技能人工智能大模型深度学习工作流自动化实战指南从零代码到流程优化工作流自动化实战指南从零代码到流程优化 你是否曾遇到这样的困境每天重复处理Excel数据直到深夜错过重要会议或者因为跨平台数据同步不及时导致客户投诉工作流自动化低代码AI 应用人工智能AI AgentMCP 服务后端前端创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考