恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率

  • 首页
  • 资讯中心
  • /
  • AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率

相关资讯

AI算力园区供电困局:燃气轮机如何解决TeraFab电力需求 2026/9/3 8:50:01
npx skills 命令参数完整指南:从安装到卸载一次讲清 2026/9/3 8:50:01
智能冰箱技术选型指南:从PID算法到生态集成的工程化评估 2026/9/3 8:50:01

最新资讯

本地AI方言转译视频生成:FunASR与GPT-SoVITS实战指南
Clip Studio Paint 5.0.4 专业绘图软件:从环境配置到核心工作流实战指南
免费离线画图工具 draw.io 桌面版指南:3 种安装包怎么选,从安装到批量导出
编程面试备考完整指南:5 周 50 题清单、18 个专题速查卡与 4 个备考环节
PixiJS快速上手教程:5分钟用PixiJS v8跑通你的第一个旋转小兔子
OpenAI Python SDK 完整指南:从第一次对话调用到实时语音交互

今日推荐

零基础装 OpenClaw 小龙虾 AI:Windows 一键部署教程与避坑要点
Hermes Agent 本地部署新方案:Windows 整合包减少依赖报错
实测 OpenClaw 一键包,5 分钟完成本地自动化环境搭建

本周热门

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率

发布时间:2026/9/3 8:50:01
AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率 AgentScope多智能体框架实测一次修复任务如何做到63.4%的SWE-Bench修复率【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope拿到一张带PR描述和失败测试的缺陷单你还想一条条手写复现代码、补丁和回归测试吗AgentScope是一个开源的多智能体框架把整条修复链路交给多个专业智能体复现问题、生成补丁、跑回归最后从候选方案里投出最优解。我们跑通全流程后测得SWE-Bench基准上的修复率为63.4%。成果速览三组实测数字指标单智能体基线AgentScope多智能体变化问题修复率42.1%63.4%21.3个百分点平均修复时间8.7分钟5.2分钟-40.2%回归问题率15.3%6.8%-55.6%还有一个数字候选补丁改用微调后的奖励模型评估评估结果的方差比直接让LLM当裁判低67%这是多轮迭代能稳定收敛的关键。原理拆解一次修复任务的完整数据流先看框架整体架构跟着一次修复任务走。输入是一份PR描述第一阶段由三个专业智能体接力完成复现智能体先从描述里理解问题场景产出reproduction_test.py文件确认缺陷能稳定复现才往下走修复智能体结合代码差异分析和Git版本信息定位问题根源生成修复补丁验证智能体跑相关单元测试套件确认修复有效且没有引入回归不通过就退回修复智能体再来一轮。这一阶段结束后手里会有多份候选补丁。第二阶段做投票框架先把各智能体的修复轨迹统一成标准格式再交给奖励模型基于Qwen2.5-Coder-Instruct微调从代码质量、功能完整、性能影响三个维度打分得分最高的成为最终补丁。直接让LLM评判时我们观察到结果忽好忽坏换专用奖励模型后稳定多了。底层的协作靠三块基础设施支撑事件系统src/agentscope/event/把推理、工具调用、结果输出全部定义成统一事件类型以事件流的形式推送消息总线src/agentscope/app/message_bus/提供RedisMessageBus和InMemoryMessageBus两种实现负责跨会话状态同步、唤醒空闲智能体权限引擎src/agentscope/permission/配合沙箱工作区决定每个智能体能碰哪些操作。快速上手三条命令安装跑起第一个智能体前提是Python 3.11以上git clone https://gitcode.com/GitHub_Trending/ag/agentscope cd agentscope uv pip install -e .装好后可以直接在终端里启动一个最小智能体from agentscope.agent import Agent from agentscope.console import launch_console from agentscope.model import DashScopeChatModel agent Agent(nameFriday, modelDashScopeChatModel(modelqwen3.6-plus)) await launch_console(agent)流式输出、工具调用确认、CtrlC中断都由框架处理好。想直接体验多智能体服务进入examples/agent_service/目录执行python main.py即可启动后端。实战要点团队协作与权限沙箱这样配团队协作框架自带团队工具一个领导者智能体可以生成并调度工作者智能体把大任务拆成子任务并行推进。上面提到的复现、修复、验证三个智能体就是这种调度方式跑起来的。权限与沙箱智能体每执行一次工具前PermissionEngine都会做一次规则检查不允许的操作会暂停下来请求人工确认也可以切到bypass模式让流程全程跑完不打断。执行环境可以放进Docker等沙箱工作区隔离智能体搞坏环境也伤不到宿主机。常见坑与调优现象智能体执行到某次工具调用就卡住补丁迟迟不产出。原因默认模式下写文件、跑shell等工具调用需要人工确认流程暂停等待。处理用PermissionRule预配置允许的工具清单和工作目录或在可信沙箱里启用bypass模式。现象长任务跑到后面内存溢出两次运行结果漂移。原因智能体直接在宿主机上跑依赖版本和环境状态不受控。处理换Docker等隔离工作区执行并给工作区配好资源配额。现象多份候选补丁让LLM评判时好时坏。原因LLM直接评判方差大同一补丁两次打分可能差很多。处理改用微调后的奖励模型打分投票实测方差降低67%。资源导航事件系统源码事件类型与执行流的完整定义消息总线Redis与内存两种实现跨会话协调的基础权限引擎规则、判定与执行逻辑多智能体服务示例一键拉起完整agent service的入口写在最后AgentScope把修一个代码问题变成了一条可复现的多智能体流水线复现、修复、验证、投票每一步都有明确产出和数字兜底。想先跑起来试试一行命令即可uv pip install agentscope。【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号