恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
autoMate 开源程序配 TaoToken:本地 AI 自动化助手 settings.json 骨架与验证
首页
资讯中心
/
autoMate 开源程序配 TaoToken:本地 AI 自动化助手 settings.json 骨架与验证
autoMate 开源程序配 TaoToken:本地 AI 自动化助手 settings.json 骨架与验证
发布时间:2026/9/28 19:33:00
1. autoMate 是什么为什么值得折腾 settings.jsonautoMate 是一款 AI 驱动的本地自动化助手核心思路和 Manus、Computer Use AgentCUA、OmniParser 属于同一类让计算机自己看屏幕、自己点鼠标、自己敲键盘。你只需要用自然语言描述任务比如「打开浏览器搜索今天的天气并截图保存」它就会规划步骤、识别界面元素、执行操作。它基于 OmniParser 做视觉解析把屏幕上的图标、按钮、输入框转成结构化信息再交给大模型决策下一步动作。它适合谁适合每天被重复性桌面操作消耗时间的人批量整理文件、跨软件搬运数据、定时填表、自动截图归档。传统 RPA 需要你拖拽流程、录制宏、写选择器界面一改就崩autoMate 用自然语言描述任务界面变化由视觉模型重新识别维护成本低很多。而且它支持本地部署数据不出本机隐私敏感场景也能用。但真正落地时很多人卡在第一步模型通道怎么接。autoMate 默认走 OpenAI 系列模型需要多模态加结构化输出能力国内直连不稳定自己维护多个厂商 Key 又很乱。我试过把 autoMate 的模型请求统一收到 TaoToken 的 API 通道上一个 Key 管所有模型调用settings.json 里改几行就能跑通。下面把配置骨架和验证动作完整拆开你照着做就能跑起最小闭环。2. 前置准备TaoToken Key 与 autoMate 环境在动 settings.json 之前先把两件事准备好TaoToken 的 API Key以及 autoMate 的运行环境。TaoToken 这边你需要拿到一个可用的 API Key。登录控制台后进入 API Keys 页面创建复制出来的字符串就是后面要填进配置的凭证。它的 API 入口是https://taotoken.net/api兼容 OpenAI 的请求格式所以 autoMate 这种按 OpenAI 协议发请求的程序可以直接对接不需要改底层代码。模型对话、Coding Plan、控制台、API Keys、接入文档这些入口都在官网导航里能找到建议先把接入文档扫一遍心里有数。autoMate 这边官方推荐用 miniConda 管理依赖Python 版本锁 3.12。完整流程如下# 克隆项目 git clone https://github.com/yuruotong1/autoMate.git cd autoMate # 创建 Python 3.12 环境 conda create -n automate python3.12 # 激活环境 conda activate automate # 安装依赖 python install.py安装脚本会拉取 OmniParser 相关的视觉模型和 OCR 依赖这一步比较吃磁盘和网络耐心等它跑完。装完后用python main.py启动浏览器打开http://localhost:7888/就能看到配置界面。注意如果你机器上没有 NVIDIA 独显视觉标注会走 CPU速度明显变慢。官方建议至少 4GB 显存的 NVIDIA 卡并且 torch 版本要和 CUDA 版本匹配。跑之前用pip list确认一下 torch 版本不匹配就按官网命令重装。3. settings.json 配置骨架把模型通道指向 TaoTokenautoMate 的配置分两层一层是 Web 界面里的基础设置一层是落盘的settings.json。Web 界面适合快速试但要做版本管理、多机同步、批量部署直接改settings.json更靠谱。下面给出一份可复制的骨架重点是把base_url和api_key指向 TaoToken。先找到配置文件位置。autoMate 启动后会在项目目录或用户配置目录生成settings.json常见路径是项目根目录下的config/settings.json具体以你启动日志里打印的路径为准。用编辑器打开结构大致如下{ llm: { provider: openai, base_url: https://taotoken.net/api, api_key: sk-你的TaoToken密钥, model: gpt-4o, temperature: 0.2, max_tokens: 4096, timeout: 120 }, vision: { enabled: true, ocr_engine: omniparser, annotation_mode: structured }, agent: { max_steps: 30, step_delay: 1.5, screenshot_scale: 1.0, save_screenshots: true }, runtime: { headless: false, log_level: info, output_dir: ./runs } }几个关键字段逐个说明。provider保持openai因为 TaoToken 走 OpenAI 兼容协议autoMate 不需要知道背后是哪家模型。base_url填https://taotoken.net/api注意不要带多余路径程序会自己拼/v1/chat/completions。api_key填你在控制台创建的 Key建议用环境变量注入而不是硬编码后面会讲。model填gpt-4o这是 autoMate 官方测试过、多模态加结构化输出都支持的型号如果你在 TaoToken 上想换其他同能力模型改这个字段即可但务必确认它同时支持图片输入和 JSON 结构化输出否则视觉解析那步会失败。vision段是 autoMate 的核心ocr_engine保持omniparserannotation_mode用structured这样屏幕元素会被转成带坐标和语义的 JSON模型才能精准点击。agent段的max_steps控制单任务最大步数新手先设 30防止任务跑飞step_delay是每步之间的等待秒数机器慢就调大。runtime段的save_screenshots建议开着排障时能回看每一步的屏幕状态。如果你不想把 Key 写进文件可以用环境变量覆盖export TAOTOKEN_API_KEYsk-你的TaoToken密钥然后在settings.json里把api_key写成${TAOTOKEN_API_KEY}autoMate 启动时会做变量替换。这样配置文件可以进 GitKey 留在本机环境里。4. 连通性验证从一条 curl 到一次真实自动化任务配置写完别急着跑复杂任务先做三层验证逐层排除问题。第一层直接用 curl 打 TaoToken 的接口确认 Key 和网络通curl https://taotoken.net/api/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer sk-你的TaoToken密钥 \ -d { model: gpt-4o, messages: [ {role: user, content: 回复两个字通了} ], max_tokens: 20 }返回里如果能看到choices数组和正常内容说明 Key 有效、通道可达。如果返回 401检查 Key 有没有复制全、有没有多余空格返回 404检查base_url是不是写成了带/v1的完整路径导致重复拼接。第二层启动 autoMate 后在 Web 界面http://localhost:7888/里点一次「测试连接」或等价的连通性按钮看它能不能正常拉到模型列表或完成一次空对话。这一步验证的是 autoMate 读取settings.json的逻辑有没有生效。如果界面报错但 curl 通多半是配置文件路径不对或者 JSON 格式有语法错误用python -m json.tool settings.json校验一下。第三层跑一个最小真实任务。在任务输入框里写打开记事本输入 hello automata然后截图保存到桌面观察执行日志。正常流程是autoMate 截当前屏幕 → OmniParser 解析出桌面图标和任务栏 → 模型规划「先找记事本图标」→ 执行点击 → 再截图 → 解析出编辑区 → 输入文字 → 截图保存。每一步在./runs目录下都有截图留档。如果卡在某一步看那一步的截图和模型返回的 JSON基本能定位是识别错了还是动作没执行。提示第一次跑建议把step_delay调到 2 秒以上给视觉解析留足时间。机器性能一般时OCR 标注是瓶颈调大延迟比换模型更有效。5. 常见报错与排查清单配置和验证过程中下面这几类问题出现频率最高我按现象、原因、处理列出来。报错一openai.BadRequestError: model does not support image input。说明你选的模型不支持多模态。autoMate 的视觉解析会把截图作为图片消息发给模型纯文本模型直接拒。回到settings.json把model换成gpt-4o这类支持图片输入的型号别用gpt-3.5或纯文本模型。报错二JSONDecodeError或模型返回内容不是合法 JSON。autoMate 依赖结构化输出模型如果返回带 markdown 代码块的文本解析会失败。处理办法是把temperature降到 0.1 到 0.2减少发散同时在系统提示里已经内置了格式约束不要自己再去改提示模板。如果换了模型后频繁出现说明该模型的结构化输出能力弱换回官方测试过的型号。报错三任务执行到一半卡住日志停在「parsing screen」。这是 OmniParser 在跑 OCRCPU 模式下可能几十秒没输出。先确认不是死机看任务管理器里 Python 进程 CPU 占用是否在动。如果确实慢检查 torch 和 CUDA 版本是否匹配用pip list | grep torch看版本再到 PyTorch 官网查对应 CUDA 的安装命令重装。显存不足 4GB 的话把screenshot_scale降到 0.8减少单帧像素量。报错四点击位置偏移点到了隔壁按钮。多半是屏幕缩放比例问题。Windows 在高分屏下默认 125% 或 150% 缩放截图坐标和实际点击坐标会对不上。把系统缩放临时调到 100% 再试或者在settings.json里调整screenshot_scale让解析坐标和物理坐标对齐。这个坑我在多台机器上遇到过统一缩放比例后就没再偏。报错五Connection timed out但 curl 能通。检查 autoMate 是不是走了系统代理设置而 curl 没走。两者网络路径不一致会导致一个通一个不通。把settings.json里的timeout调大到 180并确认程序运行环境没有额外的代理变量干扰。排查顺序建议固定成先 curl 验通道再 Web 界面验配置读取最后跑最小任务验全链路。这样任何一层出问题都能快速定位不会在复杂任务里瞎猜。6. 把 Key 管起来长期跑 autoMate 的接入建议跑通最小闭环之后真正影响体验的是稳定性和 Key 管理。autoMate 这类 Computer Use Agent 的特点是请求密集每一步动作都要发一次多模态请求一个中等任务几十步很正常Token 消耗比普通对话高一个量级。所以通道的稳定性和计费透明度比单次调用价格更重要。我的做法是把 autoMate 的模型请求统一收在 TaoToken 的 API 通道上一个 Key 覆盖所有模型调用不用在多个厂商后台之间切换。settings.json里只维护一个base_url和一个api_key换模型只改model字段接入层不动。这样多台机器部署时配置文件可以共用Key 通过环境变量注入安全性和可维护性都好。如果你打算长期跑编码类或 Agent 类任务可以看一下 TaoToken 的 Coding Plan它针对高频调用场景做了额度规划比按次零散调用更可控。接入文档里有完整的请求示例和参数说明遇到协议层面的问题先查文档大部分坑里面都写了。最后给一个实用技巧把./runs目录纳入定期清理。每次任务都会存截图跑几天就是几个 G。写个定时脚本只保留最近三天的运行记录磁盘不会爆。autoMate 的价值在于把重复操作交出去配置一次、稳定运行才是它真正省时间的地方。