恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

  • 首页
  • 资讯中心
  • /
  • Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

相关资讯

TOAST UI Editor 国际化(i18n)完全指南:语言包机制、代码注册与自定义语言扩展 2026/9/21 2:31:45
Git面试高频考点:从工作区到回滚的完整心智模型 2026/9/21 2:31:45
torch2trt源码深度解析:从PyTorch到TensorRT的企业级落地指南 2026/9/21 2:31:45

最新资讯

STM32智能婴儿床毕设实战:从方案设计到答辩完整指南
2026产品管理系统选型指南:能力模型评分与四款主流工具实测对比
Python pdfplumber提取PDF表格:从原理到批量处理实战
聚焦具身智能教育,华清远见发布三款硬件新品与课程体系2.0
STM32结构体封装原理与GPIO初始化设计解析
python-sdk 客户端订阅实战:使用 client.listen 监控 MCP 服务器的动态目录

今日推荐

OneUptime 自定义探针(Custom Probe)部署实战:私网监控、代理配置与断连排障全指南
大众TL52625前端框架材料要求详解:从性能测试到落地执行
TiXL 浮点运算算子库 Lib.numbers.float 完全指南:44 个算子的参数详解、源码原理与实战串联

本周热门

BrewUI:给Homebrew套上图形界面,让macOS软件包管理更简单
BrewUI:让Homebrew包管理变得可视化与高效
公式与文本对齐全攻略:从Word到LaTeX的实用技巧

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵

发布时间:2026/9/21 2:31:45
Harvey LAB SWEEP_MATRIX完整配置指南:快速掌握模型扫描矩阵 Harvey LAB SWEEP_MATRIX完整配置指南快速掌握模型扫描矩阵【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LAB 是面向法律场景的大模型智能体基准测试项目其核心配置项SWEEP_MATRIX定义了模型扫描矩阵——一组模型与推理强度reasoning effort的组合清单。本指南带你快速读懂这份矩阵的每个字段并学会用它批量评测不同大模型完成法律任务的能力。什么是 SWEEP_MATRIXSWEEP_MATRIX是扫描sweep工具的核心数据源定义在 utils/sweep.py。它本质上是一个**模型 × 推理强度的组合表**每一项都是一个字典常见字段如下字段含义示例model模型标识可省略厂商前缀自动路由claude-sonnet-5、gpt-5.6-solreasoning推理深度档位None表示不支持思考模式low/medium/high/maxtemperature可选采样温度仅个别条目显式指定0.7扫描工具运行时会把「矩阵条目 × 任务」做笛卡尔积生成所有待执行的组合这就是矩阵扫描名字的由来。矩阵里都有哪些模型当前矩阵覆盖 5 家厂商、20 多个模型按厂商分组一目了然Anthropic 系列claude-opus-4-8与claude-sonnet-5各跑 5 档推理强度low/medium/high/xhigh/max用于对比思考越多是否表现越好claude-haiku-4-5-20251001非推理模型reasoning为None见 utils/sweep.pyOpenAI 系列gpt-5.6-sol4 档low~maxgpt-5.6-terra与gpt-5.6-luna各 3 档对应不同能力/成本层级Google 系列gemini-3.1-pro-preview3 档、gemini-3.5-flash含minimal档、gemini-3.1-flash-lite无推理档位Mistral 与 Fireworks 托管模型mistral-medium-3.5默认配置 一个high推理档显式设置temperature: 0.7见 utils/sweep.pyFireworks 网关托管的kimi-k2p6、glm-5p1、glm-5p2、nemotron-3-ultra-nvfp4各含 4 档配置 这种同一模型多档位的设计正是基准测试的关键固定任务、扫描推理强度才能看清模型的成本—质量曲线。如何筛选自己想测的模型命令行通过--models传关键词即可过滤矩阵匹配逻辑在 matches_filter既支持直接子串匹配如sonnet、gpt也内置厂商别名——过滤词实际匹配anthropic所有claude模型openai所有gpt模型google所有gemini模型fireworkskimi、glm、nemotron开头模型还可以叠加--reasoning high只保留某一档推理强度实现厂商 × 档位两级过滤。配置 ID 与结果目录是怎么生成的每次运行都会生成确定性的配置标识方便断点续跑与结果归档make_config_id生成任务路径/模型短名-推理档位无推理档时记为disabledmake_run_id再追加时间戳形成完整运行 IDfind_latest_run查找该配置最近一次已完成运行——已完成的组合会自动SKIP中断重跑不会浪费已有结果三步跑完一次完整扫描 扫描流程分为三个阶段智能体执行 → 评审打分 → 报告生成详见 utils/sweep.py 的main函数。官方入口是utils/sweep.py也可用兼容包装脚本 scripts/run_model_sweep.py。第一步先 dry-run 预览组合数uv run python -m utils.sweep --task real-estate --models sonnet --dry-run第二步正式扫描支持并行uv run python -m utils.sweep --task all --models opus gpt --parallel 8第三步只重跑评审或只重出报告uv run python -m utils.sweep --task real-estate --eval-only uv run python -m utils.sweep --task real-estate --report-only⚠️ 扫描前会自动执行预检run_preflight校验配置 ID 无冲突、任务可加载、task.json中存在评分标准rubric任一失败即中止避免白烧 API 费用。新手避坑清单评审模型独立于被测模型--judge-model默认claude-sonnet-4-6不在矩阵内见 evaluation/run_eval.py超时保护单个智能体运行超时 7200 秒、评审超时 1800 秒超时即终止并计入失败评审并发受限评审阶段并发自动压到 4全量模式 8防止触发 API 限流--task支持四级粒度all/ 整个业务领域 / 嵌套工作流 / 单个任务完整流程可对照官方教程 docs/tutorial.md 的Run A Sweep章节架构细节见 docs/architecture.md小结SWEEP_MATRIX用一份简洁的矩阵清单就把测哪些模型、开到多深、怎么命名结果、如何断点续跑全部约定好。理解它的三个字段model / reasoning / temperature与两级过滤--models--reasoning你就能像配置实验矩阵一样系统化地比较各家大模型在真实法律任务上的表现。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号