恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Harvey LAB贡献指南:如何添加新法律任务

  • 首页
  • 资讯中心
  • /
  • Harvey LAB贡献指南:如何添加新法律任务

相关资讯

MicroPython 固件烧录指南:WeAct Studio RP2040 开发板的 UF2 Bootloader 部署全流程 2026/9/21 3:31:49
naive-ui Ellipsis 组件完全指南:单行/多行省略、点击展开与高性能渲染 2026/9/21 3:31:49
plotly.py v4 迁移指南:从 v3 到 v4 的完整升级路线与破坏性变更详解 2026/9/21 3:31:49

最新资讯

TypePHP编译器API参考:程序化调用PHP AOT编译器的完整指南
React Admin 实时数据提供者(Realtime Data Provider)接入完整指南:方法签名、内置适配器与自定义实现
VitePress 默认主题 Layout 指南:深入理解 doc、page、home 与自定义布局
Weex 鸿蒙化实践:js-base64 纯 JS 编解码库在 WebSceneAPI 中的集成与使用指南
ARIS 工作流总览:从 idea 到 paper 的 13 条 pipeline 如何一次看全
Chrome Apps UDP 网络访问实战:基于 chrome-extensions-samples 的 UDP Echo 客户端示例解析

今日推荐

OneUptime 自定义探针(Custom Probe)部署实战:私网监控、代理配置与断连排障全指南
大众TL52625前端框架材料要求详解:从性能测试到落地执行
TiXL 浮点运算算子库 Lib.numbers.float 完全指南:44 个算子的参数详解、源码原理与实战串联

本周热门

BrewUI:给Homebrew套上图形界面,让macOS软件包管理更简单
BrewUI:让Homebrew包管理变得可视化与高效
公式与文本对齐全攻略:从Word到LaTeX的实用技巧

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Harvey LAB贡献指南:如何添加新法律任务

发布时间:2026/9/21 3:31:49
Harvey LAB贡献指南:如何添加新法律任务 Harvey LAB贡献指南如何添加新法律任务【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个开源的法律智能体基准测试项目它内置覆盖 24 个法律执业领域、1600 个真实感法律任务的数据集以及一套可运行、可评分的 Agent 执行框架。除了跑分Harvey LAB 最欢迎的贡献之一就是添加新的法律任务——编写任务说明、合成文档和评分准则rubric。本文是一份面向新手的完整教程带你从零理解任务结构、写好 task.json、打磨评分标准到提交前跑通全部校验命令。先了解Harvey LAB 有哪几种贡献方式在动手之前建议先通读官方的 CONTRIBUTING.md它列出了项目的五条主要贡献路径贡献方式说明适合谁 添加/改进基准任务编写任务指令、文档、交付物和评分准则有法律背景或想练手的贡献者✍️ 打磨 rubric 评分准则让评分标准更具体、可审计熟悉评分机制的贡献者 添加模型适配器将新的 LLM 提供商接入执行框架有工程经验的贡献者 运行评测与批量测试对比模型、诊断失败、生成报告所有贡献者 更新文档保持教程、架构说明与代码同步所有贡献者几条铁律来自贡献规范只使用合成的人物、公司、律所、地址和案件事实绝不包含真实客户材料任务必须自包含在tasks/目录下rubric 必须显式审阅者只读match_criteria就能知道通过长什么样优先提交小而聚焦的 PR并在提交前跑通相关离线测试。环境准备两条命令完成初始化贡献前你需要一个能跑评测的环境。克隆仓库后执行官方安装脚本 scripts/setup.shgit clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.sh首次运行需要几分钟。之后在仓库根目录的.env文件中配置 API Key默认评委模型需要 Anthropic 的 Key可选其他提供商ANTHROPIC_API_KEY...更完整的入门流程含跑任务、评分、看报告见 docs/tutorial.md。新法律任务目录结构把 task.json 放对位置Harvey LAB 采用文件系统优先的设计详见 docs/architecture.md没有数据库、没有服务一个任务就是一个目录。任务 ID 就是它在tasks/下的斜杠分隔路径支持扁平或嵌套两种形式tasks/practice-area/task-or-workflow/optional-scenario/ ├── task.json # 任务定义指令、交付物、评分准则 └── documents/ # 合成的案件源文档 ├── source-document.docx └── source-spreadsheet.xlsx例如嵌套任务real-estate/extract-psa-key-terms/scenario-01和扁平任务corporate-ma/analyze-qoe-reconciliation都是合法的。想找一个真实例子参考推荐看 tasks/corporate-ma/analyze-qoe-reconciliation/task.json——一个收益质量对账与收购价格分配备忘录任务包含 4 个交付物和数百行细粒度评分准则。task.json 字段详解最小可运行配置task.json是整个任务的灵魂。最小可用配置如下{ title: Analyze Change of Control Provisions Across Targets Material Contracts, work_type: analyze, tags: [MA, due-diligence, change-of-control], instructions: Analyze the source documents and produce coc-analysis-report.docx., deliverables: { coc-analysis-report.docx: coc-analysis-report.docx }, criteria: [ { id: C-001, title: Identifies the key change-of-control consent issue, match_criteria: PASS if the report identifies the material contract that requires consent before closing and explains the consequence. FAIL if it omits the consent issue., deliverables: [coc-analysis-report.docx], sources: [material-contract.docx] } ] }各字段的作用与是否必填字段必填说明title✅人类可读的任务标题instructions✅发送给 Agent 的指令提示词criteria✅内联的全通过all-pass评分准则列表deliverables建议期望产出的文件名映射work_type建议取analyze/draft/review/research之一tags可选用于任务发现与可视化统计每条准则criterion还包含id唯一标识如C-001title准则描述性标题match_criteria实质评分标准——评委 LLM 判分的唯一依据deliverables该准则只读取这些输出文件作用域隔离避免串扰sources可选该准则相关的源文档文件名。写好 rubric让评分标准一眼可判Harvey LAB 采用全通过all-pass计分只有当所有准则全部通过时任务才得 1.0 分否则为 0.0 分原理见 docs/eval-strategies.md。这意味着你写的每一条准则都是发射关键项。官方给出的好准则标准点名具体事实写明要求的事实、问题、条款、计算、截止日期或起草动作带上具体数值相关时写明期望的数字、日期、当事方和阈值❌写清失败模式用FAIL if ...的语言描述常见错误限定交付物范围把准则限定在评委应读取的文件上不加锦上添花的冗余项——它们只会拉低全通过率不产生真实质量信号。另外注意不要添加遗留的weight字段当前计分方案中所有准则等权。提交前验证三条命令跑通再提 PR任务写好后按顺序执行以下验证均来自 CONTRIBUTING.md 的 Validate A Task 章节① 检查任务能否被正确解析uv run python -m utils.describe_task practice-area/task-id这个命令由 utils/describe_task.py 实现会打印任务标题、交付物、文档数量和全部评分准则是快速自查任务结构是否完整的好帮手。② 跑任务完整性测试uv run python -m pytest tests/test_task_integrity.py对应测试文件为 tests/test_task_integrity.py确保你的task.json符合基准的数据模式。③ 做一次短模型冒烟测试可选但推荐uv run python -m harness.run \ --model anthropic/claude-haiku-4-5-20251001 \ --task practice-area/task-id \ --max-turns 20跑完后还可以用 evaluation/run_eval.py 对结果打分看看小模型能过几条准则uv run python -m evaluation.run_eval \ --run-id run-id \ --task practice-area/task-id \ --judge-model claude-sonnet-4-6提交前快速清单提交 PR 前对照检查一下任务目录位于正确的执业领域下结构为tasks/area/task/task.json含title、instructions、criteria三个必填字段所有文档均为合成材料无任何真实客户信息每条准则都有明确的PASS if ...和FAIL if ...表述每条准则的deliverables与顶层deliverables映射一致uv run python -m pytest tests/test_task_integrity.py通过PR 小而聚焦方便审阅完成这些你的新法律任务就能进入基准被 24 个执业领域的评测体系所复用。更多贡献细节模型适配器开发、批量评测 sweeps、文档同步请查阅 CONTRIBUTING.md项目整体架构可参考 docs/architecture.md评测方法论详见 docs/eval-strategies.md。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号