恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Agent-S 完整上手指南:让 AI 像人一样操作你的电脑,OSWorld 成绩超人类的开源框架
首页
资讯中心
/
Agent-S 完整上手指南:让 AI 像人一样操作你的电脑,OSWorld 成绩超人类的开源框架
Agent-S 完整上手指南:让 AI 像人一样操作你的电脑,OSWorld 成绩超人类的开源框架
发布时间:2026/9/14 17:39:14
Agent-S 完整上手指南让 AI 像人一样操作你的电脑OSWorld 成绩超人类的开源框架【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-SAgent-S 是一个开源的计算机操作智能体框架computer use agent它通过视觉理解 代码执行的方式让大模型真正动手操作桌面点击、输入、切换窗口、处理文件像人一样完成任务。最新的 Agent S3 版本在 OSWorld 基准测试中单跑即可达到 66% 成功率配合 Behavior Best-of-N 技术后达到 72.6%超过了约 72% 的人类水平。如果你想在本地跑一个能用电脑的 AI或者想研究 GUI 智能体的工程实现这个项目值得仔细看一遍。它到底能干什么先回答一个最关心的问题Agent-S 和普通的聊天机器人有什么本质区别区别在于它不只会说话还会动手。你给它一句自然语言指令比如帮我关闭 VS Code或计算表格里的总销售额并生成图表它会截图看屏幕像人一样看当前桌面状态规划操作把任务拆成子步骤决定下一步做什么生成代码执行通过 Agent-Computer InterfaceACI把操作翻译成 Python 代码如pyautogui.click()并执行持续观察反馈每一步执行后再截图确认结果是否符合预期。整个流程可以概括为看屏幕 → 想 → 动手 → 再看屏幕的循环。早期的 Agent S1 版本还支持从网页检索外部知识通过 Perplexica 搜索服务、从记忆中提取历史任务经验这些能力在 gui_agents/s1/ 目录下都有完整实现。架构怎么设计的看懂这张图就够了Agent-S 的模块化设计是它最值得借鉴的地方。下面这张 S2 架构图把核心闭环讲得很清楚各角色分工如下Worker执行层主脑负责理解任务、规划步骤、决定下一步动作Grounding定位层把点击那个蓝色按钮这类描述性动作落地为精确的屏幕坐标和可执行代码Memory记忆层交互产生的经验先存入记忆Manager管理层从记忆中提取可复用的知识再指导 Worker 做更主动的规划Proactive Plan。这个经验 → 记忆 → 知识 → 规划的闭环是 Agent-S 区别于无状态调用大模型的关键它越用越熟练。到了 S3 版本团队反而做了减法——去掉了层级结构以降低推理延迟见 gui_agents/s3/agents/agent_s.py 中AgentS3的注释uses no hierarchy for less inference time只保留 Worker Grounding 一个可选的反思Reflection智能体。结构更简单速度更快效果更好。环境怎么准备在动手之前有四个前置条件需要确认1. 单显示器Agent-S 的坐标定位基于单屏幕设计多显示器环境不是它的主场。2. 操作系统Linux、macOS、Windows 均支持。3. 安装依赖pip install gui-agents如果想改代码做实验先克隆仓库再装开发版git clone https://gitcode.com/GitHub_Trending/ag/Agent-S pip install -e .另有一个容易漏掉的步骤安装 Tesseract OCR因为pytesseract依赖它的原生组件brew install tesseract # macOS sudo apt install tesseract-ocr # Linux4. 配置 API Key把主模型的 key 写入 shell 配置文件Linux 用.bashrcmacOS 用.zshrcexport OPENAI_API_KEY你的key export ANTHROPIC_API_KEY你的key export HF_TOKEN你的token支持的推理后端包括 OpenAI、Anthropic、Gemini、Azure OpenAI、vLLM 本地部署和 Open Router详细的环境变量设置见 models.md。这里有一个硬性要求Grounding定位模型是必需的官方推荐 UI-TARS-1.5-7B可通过 Hugging Face Inference Endpoints 或其他厂商托管。没有 grounding 模型智能体就看不见该点哪里无法完成精细操作。跑通第一个任务环境就绪后用官方推荐的组合主模型gpt-5-2025-08-07 定位模型ui-tars-1.5-7b运行 CLIagent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080启动后会出现一个输入提示框输入类似打开计算器的指令智能体就会开始接管屏幕。运行中按CtrlC可以随时暂停观察按Esc恢复执行——这个调试机制对第一次运行的人非常有用。两个参数容易踩坑注意一下--grounding_width / --grounding_height不是屏幕分辨率而是定位模型输出坐标系的分辨率。用 UI-TARS-1.5-7B 填1920 1080用 UI-TARS-72B 则填1000 1000如果你用的是 o3 系列等特殊模型需要通过--model_temperature 1.0固定温度。除了 CLI也可以作为 Python SDK 集成到自己的项目里核心就三步实例化AgentS3、传入截图、调用predict。完整的推理循环可以直接参考 gui_agents/s3/cli_app.pyOpenClaw 集成的封装脚本在 integrations/openclaw/。成绩有多硬看数据说话这是 Agent-S 最受关注的部分。先看 OSWorld 基准上各家智能体的对比OSWorld 是一套 369 个真实桌面任务的评测集覆盖操作系统操作、办公、专业软件等场景几个关键数字客观陈述模型/设置OSWorld 成功率Agent SS115 步20.6%OpenAI CUA30.5%Agent S248.8%GTA1 GPT-5此前 SOTA63.4%Agent S3100 步单跑66%Agent S3 Behavior Best-of-N72.6%人类水平参考线约 72%Behavior Best-of-NbBoN不是换个更强的模型而是一个评测策略同一任务跑多条轨迹rollout由一个裁判模型对比轨迹间的行为差异选出最优的一条。工具脚本就在 osworld_setup/s3/bbon/ 里generate_facts.py生成行为描述run_judge.py做轨迹对比。这个策略的泛化性也不错在 WindowsAgentArena 上从零样本的 50.2% 提升到 56.6%3 条 rollout 中挑选AndroidWorld 上从 68.1% 提升到 71.6%。S2 时代的纵向进步也很直观——同样步数预算下S2 明显领先同期的 Operator、UI-TARS 和 Claude 3.7S1 时代按任务类别的拆解操作系统类是强项办公与专业软件类相对弱也可以参考这张图进阶玩法与调优技巧开启本地编程环境。很多任务用代码比用鼠标快得多批量处理文件、操作表格、跑自动化脚本。加上一个参数即可agent_s ... --enable_local_env启用后智能体可以调用call_code_agent直接在本地执行 Python 和 Bash。但必须郑重提醒这会以当前用户权限执行任意代码Bash 命令有 30 秒超时保护。只在可信环境和可信输入下开启处理不可信任务时建议放进沙盒。用 SDK 精细控制。CLI 之外的 Python 接口暴露了几个实用的调优参数见 gui_agents/s3/max_trajectory_length默认 8轨迹中保留的历史截图轮数。调小省 token、提速度调大让智能体记性更好但上下文成本更高enable_reflection默认 True反思智能体会检查 Worker 的决策并给出修正建议。简单任务上关掉它对应 OpenClaw 封装里的--no-reflection可以明显提速代价是准确率略有下降。模型替换很灵活。主模型和 grounding 模型是解耦的可以各自独立更换厂商或换成 vLLM 本地部署的模型工程参数只需改engine_params字典里的engine_type和model两个字段。在评测环境里部署。如果目标是跑 OSWorld 完整评测而不是在真机上玩仓库提供了现成的运行脚本本地 VMware 用run_local.pyAWS 用run.py命令顺序都写在 osworld_setup/s3/run.sh 中部署细节见 osworld_setup/s3/OSWorld.md。WindowsAgentArena 的环境搭建坑比较多Office 应用缺失、虚拟机不重置等WAA_setup.md 里有一份很详细的排障记录。谁适合用这个项目想在本地部署会用电脑的 AI 的人pip install gui-agents加一个 grounding 模型端点就能在自己桌面上跑起来研究 GUI 智能体的工程师S1 → S2 → S3 三代实现全部开源在 gui_agents/ 下从带记忆知识闭环的完整架构到 S3 的极简结构可以直接对比不同设计的取舍做自动化评测的团队OSWorld、WindowsAgentArena 两套评测的部署脚本和 bBoN 裁判工具都已内置。最后一句安全提醒Agent-S 拥有完整的 GUI 控制权并且会直接执行生成的代码。把它当成一位权限很大的新同事给它安排任务前先确认环境是可信的。【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考