恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
看懂 LongHorizon-Harness 三大核心角色:Manager、Executor、Auditor 如何分工协作?
首页
资讯中心
/
看懂 LongHorizon-Harness 三大核心角色:Manager、Executor、Auditor 如何分工协作?
看懂 LongHorizon-Harness 三大核心角色:Manager、Executor、Auditor 如何分工协作?
发布时间:2026/10/11 12:02:44
人工智能AI AgentAgent 工作流Agent 评测GUI 自动化【免费下载链接】LongHorizon-HarnessThe long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.项目地址https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness点击查看免费下载LongHorizon-Harness 是一个面向 AI Agent 长时运行的开源执行框架它把跨桌面应用和终端的复杂任务拆成Manager 负责计划、Executor 负责执行、Auditor 负责独立验证的三角色协作循环Plan → act → verify → checkpoint or recover → repeat直到任务真正完成。这篇文章用新手友好的方式讲清三个角色各自管什么、怎么配合、以及为什么这样分工能显著提升长时任务的完成率。为什么长时 AI Agent 任务需要三角色分工如果你用过 Claude Code、Codex 这类 Agent 直接跑长任务大概率遇到过这些坑上下文越滚越长几十轮对话后模型开始忘记最初的目标甚至跑偏️自说自话Agent 说文件已保存但实际没保存自己还觉得自己成功了失败后全盘作废中途一报错之前几十小时的进度全部丢掉从头再来。LongHorizon-Harness 的思路是循环工程Loop Engineering不训练新模型而是围绕现有 Agent 设计执行、验证、纠正、恢复的闭环。它不替换你的 Agent而是把任务管理、动手执行、结果审计拆给三个边界清晰的角色每个角色只干一件事干得可靠。一轮循环里三角色如何协作计划 → 执行 → 验证整个系统每一轮Round都固定走三步Manager 出一个有边界的子任务 → Executor 在全新上下文中执行 → Auditor 只读审计真实环境。下面这张官方架构图完整展示了三个角色的信息流和权限边界三个角色不是各自为政的三个 Agent而是同一条循环里的实现边界——它们共享同一份已验证的任务状态谁也不能绕过审计去推进任务。Manager只管计划和调度绝不动手Manager任务管理器是循环的大脑但它从不接触真实环境不能改文件、不能点鼠标、不能跑命令。它的输入是原始任务描述一份跨轮维护的任务契约把用户请求落成可验证的目标状态上一轮的任务状态所有历史 Auditor 报告的原文这是可信中间状态的唯一权威来源。每轮 Manager 的输出非常克制维护当前任务状态、评估依赖关系然后给出且仅给出一个路由决策路由含义Next: gui把当前最关键的子任务交给 GUI Executor点击、输入、截图等视觉操作Next: cli交给 CLI Executorshell、代码、日志、数据等非视觉工作Next: ask缺少必须由用户提供的信息向人请示Next: done仅当 Auditor 连续三行控制头为完成 / 干净 / 对齐时才允许Next: blocked确实无法推进时如实上报两条铁规矩值得新手记住① 一轮只安排一个主导状态变化禁止把多个大目标塞给一个子任务② Manager 引用的每条事实都必须标注来自哪一轮审计报告如round_003Executor 未经验证的自述一律不采信。相关实现见 src/lh_harness/role_prompts.py 中的build_role_manager_prompt角色指令文本在 src/lh_harness/prompt_texts.py。Executor每轮全新上下文只干一个子任务Executor 是循环里的双手分 GUI 和 CLI 两种变体但共同点只有一个每轮都从全新上下文fresh context启动只完成 Manager 分派的那一个有明确边界和验收标准的子任务。GUI Executor主目标必须是真实屏幕状态——观察、点击、输入、滚动、等待、视觉确认、保存真实屏幕截图禁止用脚本绘图等手段伪造GUI 证据CLI Executor主目标是 shell、文件、代码、测试、日志、服务诊断允许小范围借用 Computer Use 做辅助观察但视觉核心工作必须改派 GUI两个 Executor 都不能与真人对话——需要用户输入时只能停下并报告 Manager 走ask通道。子任务完成后Executor 报告自己实际做了什么、产物路径在哪、还有什么遗留问题然后等待审计而不是自我宣布成功。三角色的执行循环由 src/lh_harness/manager.py 驱动不同 Agent 后端Claude Code / Codex / OpenCode / DeepSeek Harness通过 src/lh_harness/adapters/ 下的适配器接入各后端保留原生执行方式harness 只负责角色边界和跨轮状态。Auditor只读独立验证唯一可信状态的来源Auditor审计员是循环里最关键的角色——它决定什么算真的做完了。它的纪律性极强严格只读不点击、不输入、不修改任务文件Computer Use 只能用于观察和截图。harness 还会在审计前后对工作区做快照比对发现 Auditor 动了文件就恢复快照并标记违规见 src/lh_harness/auditor_agent.py 中的只读违规处理标准控制头每份审计报告的前三行必须固定为Status完成/未完成/阻塞、Integrity干净/存疑/违规、Contract audit对齐/未知/需修订/无效正文再给出审计事实、证据、缺口和给 Manager 的状态更新️独立取证对照子任务直接检查真实文件内容、界面状态、日志、测试输出对截图产物还会检查元数据确认它来自真实屏幕而非脚本合成。被拒绝的结果不会消失而是降级为证据evidence——它只用来指导下一步修复绝不计入进度。只有通过独立审计的结果才能成为下一轮的可信任务状态。三角色的协作闭环验证状态 断点恢复把三个角色串起来就得到 LongHorizon-Harness 的完整闭环Manager 基于原始目标 已验证状态规划本轮唯一子任务Executor 在全新上下文中执行输出产物和自述Auditor 只读审计产出权威报告审计通过 → 进度固化为检查点checkpoint进入下一轮审计失败 → 失败证据连同产物交回 Manager下一轮从原始目标 最后一个已验证检查点恢复。这意味着即使上下文刷新、动作失败、甚至中途崩溃任务也不会失控下一轮永远基于原始目标和最后验证过的状态重新开始而不是基于 Executor 的自述。每次运行的完整审计轨迹都保存在./.lh-harness/runs/run-id/下包含任务状态、事件流、审计报告和各角色轨迹进度可检查、可恢复、可复现。如何配置三个角色使用不同模型和后端三大角色的一大实用特性每个角色都可以独立指定 Agent 后端和模型用强模型做 Manager 和 Auditor用高性价比模型做 Executor兼顾质量、速度和成本。在项目的./.lh-harness/config.toml中通过[run.roles.*]分段配置如[run.roles.manager]、[run.roles.auditor]解析链为gui_executor → executor → [run]的继承兜底也可在命令行用--gui-executor-model、--auditor-timeout等参数单次覆盖。配置体系定义在 src/lh_harness/config.py。每个角色还配有独立的超时预算Manager 默认 600 秒、Executor 1800 秒、Auditor 600 秒某角色超时不会毁掉整轮——harness 保留部分轨迹和任务状态让下一轮 Manager 检查真实工作区后恢复。配合lh-harness web启动的 Dashboardsrc/lh_harness/webapi/server.py你可以在浏览器里实时查看每轮的计划、执行结果、审计证据和返工原因并在任务完成、阻塞、反复失败时人工介入。实测提升三角色协作带来多少收益同样的模型、同样的执行后端只把执行方式换成 Manager–Executor–Auditor 循环在数百个真实复杂任务上测得基准指标普通 AgentLongHorizon-Harness提升WeaveBench114 个 GUICLI 混合任务PassRate51.880.728.9OSWorld 2.0108 个桌面任务二值完成率2.88.33.0×Terminal-Bench 2.1成功率69.777.27.5token 还省 24%复现套件在 eval/ 下按基准分目录存放如 eval/WeaveBench-harness/、eval/OSWorldv2-harness/、eval/TB-harness/完整数据表可参考 README.md。快速上手第一次跑起三角色协作只需三步详见 README.mduv tool install lh-harness # 1. 安装要求 Python 3.10 与一个 Agent CLI lh-harness init # 2. 在项目目录生成 ./.lh-harness/config.toml lh-harness run --task task.md --dashboard # 3. 从文件启动任务并打开 Dashboard运行过程中控制台会按角色逐轮打印进展任务结束时你会收到一份仅基于已验证状态写成的白话总结——没做完就直说没做完绝不美化。小结角色一句话定位关键纪律 Manager状态机维护任务契约每轮调度一个子任务不碰环境事实必须引用审计报告⚡ Executor行动者全新上下文执行单个有边界的子任务不自宣成功需用户输入时停下上报 Auditor守门员只读独立验证真实环境严格只读三行控制头给出权威结论LongHorizon-Harness 的核心洞察可以浓缩成一句话模型决定 Agent 一轮能做多少而循环工程决定它能可靠地走多远。当你需要 AI Agent 在桌面应用和终端里连续工作几个小时而不失忆、不漂移、不谎报时这套 Manager–Executor–Auditor 分工协作机制就是值得理解并采用的那套方案。赞分享人工智能AI AgentAgent 工作流Agent 评测GUI 自动化【免费下载链接】LongHorizon-HarnessThe long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.项目地址https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness点击查看免费下载相关推荐IGListKit核心架构解析Adapter、Updater与SectionController三大角色如何协作IGListKit核心架构解析Adapter、Updater与SectionController三大角色如何协作 IGListKit 是 Instagram移动开发UI组件终极指南Artemis核心架构深度解析——Collector、Strategy、Executor三组件如何协同工作终极指南Artemis核心架构深度解析——Collector、Strategy、Executor三组件如何协同工作 Artemis是一个用Rust编写的简单、Seata核心架构解析TC、TM、RM三角色协同工作原理Seata核心架构解析TC、TM、RM三角色协同工作原理 引言 在微服务架构中分布式事务问题一直是开发者面临的一大挑战。随着业务的不断扩展传统的单体应用逐后端微服务创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考