恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Agent-S 智能体框架完整指南:从一句需求到自动点击、计算与出图
首页
资讯中心
/
Agent-S 智能体框架完整指南:从一句需求到自动点击、计算与出图
Agent-S 智能体框架完整指南:从一句需求到自动点击、计算与出图
发布时间:2026/9/14 12:38:45
Agent-S 智能体框架完整指南从一句需求到自动点击、计算与出图【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-SAgent-S 智能体框架是一个开源项目让你用一句大白话指挥计算机你说帮我算总销售额、算月均并出图它就自己打开表格、点按钮、写代码做计算、生成图表。下面跟着一个真实任务把这套框架由哪几个模块协作完成讲清楚最后给你一份可直接上手的路径。场景把「算销售额、出图」整句交给它这一节先建立画面感你只负责提需求剩下的拆解、点击、计算它自己来你几乎不用动手。假设你的屏幕上已经打开了一个记账表格你对 Agent-S 说帮我计算总销售额、平均月销售额并生成一个可视化图表。从这一刻起任务就进入一条流水线它先想起在表格里做过类似的求和任务再决定先算总额、再算月均、最后插入图表最后把每一步变成真实的鼠标点击和键盘输入。上图展示了 Agent-S 处理算销售额、出图表任务时的整体分工从记忆检索、任务规划到计算机接口的执行闭环大脑拆任务Worker 把一句话变成下一步动作这一节讲谁在指挥和你有关的是它不会一口气想太多而是每步只决定一个动作跑得快也好定位问题。在最新一代 S3 里指挥者是一个叫Worker的模块见 gui_agents/s3/agents/worker.py。它拿到你的指令和当前截图后每轮只输出一个描述性动作比如点工具栏上的插入图表图标。S3 特意去掉了层层规划的结构用更扁平的方式换取更短的推理时间——这也是它更快的原因之一。上图是 Agent-S 的协作环路Worker 生成动作、交互层执行、经验回写记忆再由管理器把知识反哺给规划手眼配合ACI 把「点这个按钮」翻译成真实点击这一节讲怎么落到屏幕上和你有关的是你不用给坐标用一句哪个按钮就行定位交给专门的视觉模型。真正动手的是一套叫 Agent-Computer InterfaceACI的接口在 Linux 桌面里对应OSWorldACI见 gui_agents/s3/agents/grounding.py。它把自然语言描述变成坐标你写窗口右上角的菜单按钮一个视觉定位模型推荐 UI-TARS-1.5-7B就返回该点的(x, y)。常用动作都封装成好读的方法例如agent.click()、agent.type()、agent.drag_and_drop()、agent.hotkey()、agent.scroll()。需要选中一段文字时它还会调用 OCR基于 Tesseract把屏幕上的词定位出来再做精确的划选。会写代码的第二只手call_code_agent 负责计算与批量数据这一节讲它为什么算得准、改得快和你有关的是求和、批量填数这类活儿它不靠鼠标一格一格点而是直接写代码。S3 里Worker和代码手配合干活当任务涉及计算、过滤、批量改数据时它调用call_code_agent把一个专门的代码智能体见 gui_agents/s3/agents/code_agent.py拉出来。这个智能体在后台按最多 20 步的预算一步步写 Python 或 Bash 去改文件跑完交回一份完成 / 失败 / 超预算的报告。改完文件后它还会提醒你关掉应用再重新打开确认效果——因为它只改内容界面刷新要靠 GUI 验证。对 LibreOffice 表格它甚至有一条直达的set_cell_values通道绕过鼠标直接写单元格和公式。少踩坑靠这两件事逐步反思 程序化记忆这一节讲它怎么不出错、怎么越用越顺和你有关的是它每做一步都回头检查且带着一整套操作守则。一是逐步反思每轮由一个反思模型看着动作前 / 后的截图判断这步有没有进展、是不是在原地打转再把结论喂回给Worker避免重复无效点击。二是程序化记忆所有操作规范集中在 gui_agents/s3/memory/procedural_memory.py里面写明了何时用 GUI、何时用代码、代码改完要重新打开文件核对等守则。另外它还有一个轻量知识罐save_to_knowledge能把任务中途看到的关键文本存下来供后续步骤复用。成绩到底怎么样OSWorld 上 72.6% 怎么来的这一节只看带场景、有对比的硬数据避免空喊数字。在 OSWorld一个在真实桌面里完成操作任务的基准上单独运行的 Agent S3 在 100 步内做到 66%已经超过此前的最高纪录 63.4%GTA1 搭配 GPT-5再加上 Behavior Best-of-N跑多次让裁判挑最好的轨迹成功率升到72.6%超过了人类约 72% 的基准线。在跨平台泛化上它同样有效WindowsAgentArena 上从 50.2% 提到 56.6%选 3 次结果中最好AndroidWorld 上从 68.1% 提到 71.6%。上图为 OSWorld 上各方案的对比Agent S3 结合 Behavior Best-of-N 达到 72.6%越过约 72% 的人类水平线接下来你可以做什么这一节给你一份可执行路径照着走就能跑起来。装依赖pip install gui-agents即可不改源码也可以跑若要在 Linux 上用 OCR再brew install tesseract。配模型把OPENAI_API_KEY等写到环境里支持 OpenAI、Anthropic、Gemini、vLLM、Open Router 等见 models.md另需一个定位模型推荐 UI-TARS-1.5-7B坐标尺寸设 1920×1080。跑起来用命令行工具agent_s带上--provider、--model、--ground_url、--ground_model等参数需要写代码执行时加--enable_local_env注意它会在本机运行代码务必只在可信环境开启。推理主循环可参考 gui_agents/s3/cli_app.py。换个环境验证想放进 OSWorld 评测按 osworld_setup/s3/OSWorld.md 部署想跑 Windows 场景看 WAA_setup.md。安全提示Agent-S 会执行代码来控制你的电脑且代码智能体用的是你本人的权限处理敏感文件或陌生任务时建议在沙箱里跑。【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考