恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

一文读懂Harvey LAB:法律AI智能体评估的终极指南

  • 首页
  • 资讯中心
  • /
  • 一文读懂Harvey LAB:法律AI智能体评估的终极指南

相关资讯

Claude Code上下文锚定法提升AI编程效率 2026/9/18 6:26:14
MoE-LSTM股票预测:MATLAB完整实现与门控权重可视化 2026/9/18 6:21:14
Hyperresearch出刊门(Ship Gate)完全解析:研究报告零幻觉的最后一道防线 2026/9/18 6:21:14

最新资讯

kona-serde 解析:为 kona 配置体系打造的宽容数值(quantity)序列化工具
OneUptime 自托管 SendGrid Inbound Email 集成指南:构建「入站邮件监控器」的完整 Webhook 链路
AReaL 基于 Megatron-LM 后端微调大型 MoE 模型:并行策略、Bridge 选择与训练稳定性实践
基于图像采样的Unity方阵点阵动画实现与优化指南
Flutter在OpenHarmony上的健康报告模块开发实践
AI时代职业发展:从成功学到智能训练系统

今日推荐

2026年AI设计工具在PPT制作中的核心应用与评测
Matlab手写逻辑回归:从数学原理到多变量概率预测模型实现
高值医用耗材研报PDF:用Python完成字段抽取、清洗与趋势预测

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

一文读懂Harvey LAB:法律AI智能体评估的终极指南

发布时间:2026/9/18 6:26:14
一文读懂Harvey LAB:法律AI智能体评估的终极指南 一文读懂Harvey LAB:法律AI智能体评估的终极指南【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个开源的法律AI智能体评估基准项目它用 1600 个真实感的法律工作任务来测试大模型能否独立完成尽调审查、合同起草、条款提取等真实律师工作并用LLM 评审 全通过计分机制给出客观分数。无论你是想了解 AI 法律能力边界的从业者还是想搭建智能体评估体系的技术人员这份指南都能帮你在 20 分钟内跑通第一次评估。为什么需要法律AI智能体评估基准 市面上的大模型评测大多停留在问答和通用推理层面而法律工作的难度在于智能体必须自主阅读上百份案卷文件、交叉比对条款、最终产出备忘录或合同等交付物——这正是 Harvey LAB 要解决的核心问题。它的三大亮点真实任务集覆盖 24 个法律执业领域公司并购、知识产权、基金资管、破产重组等共约 1660 个任务、10 万 条评分标准全部由合成文档构成经人类律师审核把关完整执行框架内置智能体运行循环、6 个工作区工具bash/read/write/edit/glob/grep以及多模型适配器开箱即用可解释评分LLM 评审逐条打分并记录推理理由生成 HTML 报告和对比仪表盘你能清楚看到模型错在哪Harvey LAB 的核心架构任务集 执行框架整个项目采用文件系统优先设计——没有数据库、没有 Web 服务一切以目录组织目录职责tasks/任务数据集每个任务含task.json指令 评分标准和documents/案卷文件harness/执行框架智能体循环、工具执行器、模型适配器evaluation/评分引擎LLM 评审、rubric 计分、报告与对比仪表盘utils/任务发现、模型矩阵批量扫描sweep、运行回放等工具sandbox/每任务独立容器沙箱隔离执行智能体所有文件操作执行流程分三个阶段Run智能体干活→ EvaluateLLM 评审打分→ Report生成报告与对比面板。更深入的架构说明可参考 docs/architecture.md。每个任务由 task.json 定义包含发送给智能体的指令、期望交付物文件名、以及内联的评分标准criteria。注意没有单独的标准答案文件——评分标准本身就描述了什么样的输出算通过。最快上手步骤5 分钟配置环境 ⚡官方一键脚本会安装 uv、pandoc、Podman 沙箱镜像等全部依赖跨平台支持 Linux / macOS / Windows需 WSL2git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.sh脚本细节见 scripts/setup.sh。首次运行约需几分钟之后几秒即可完成。配置模型密钥在项目根目录创建.env文件至少需要一个 Anthropic API Key默认评审模型是 Claude Sonnet 4.6若要评测 OpenAI 或 Google 的模型再按需添加OPENAI_API_KEY和GOOGLE_API_KEY即可。跑一个真实法律任务尽调红旗审查 官方教程选用的第一个任务corporate-ma/review-data-room-red-flag-review要求智能体审查 60 份并购数据室文件产出一份红旗备忘录对照 68 条评分标准打分。完整分步走查请阅读 docs/tutorial.md。第 1 步查看任务详情uv run python -m utils.describe_task corporate-ma/review-data-room-red-flag-review第 2 步运行智能体uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-review \ --max-turns 200运行结束后会打印 Run ID 和统计摘要24 轮对话、读取了 60 份文档中的 31 份、耗时 180 秒——所有轨迹transcript.jsonl、指标metrics.json和交付物都会保存在results/下。第 3 步LLM 评审打分uv run python -m evaluation.run_eval --run-id run-id \ --task corporate-ma/review-data-room-red-flag-review评分逻辑在 evaluation/scoring.py评审提示词模板位于 evaluation/prompts/rubric_criterion.txt。第 4 步查看 HTML 报告uv run python -m evaluation.report --run-id run-id报告会展示总分、逐条标准的通过/未通过理由、文档覆盖率等是理解模型遗漏点的最快方式。评分方法论为什么采用全通过计分 ⚖️这是 Harvey LAB 最值得学习的设计。每条标准由 LLM 评审独立判定 pass/fail而任务总分 全部标准通过才得 1.0否则为 0.0没有部分得分。听起来严苛但非常贴合法律实务一份只抓到 95% 问题的尽调备忘录漏掉的那 1 个重大风险就可能让交易出问题。所以真正该问的问题是智能体多能次次全对这正是 all-pass 率回答的指标。同时项目也会输出诊断性指标——标准通过率通过条数/总条数帮你判断失败是差一条还是差十条。完整方法论见 docs/eval-strategies.md。评审过程还有几个关键设计温度设为 0.0 保证可复现每条标准单独调用评审、互不干扰按标准作用域只喂相关交付物避免上下文污染所有判定的 reasoning 都留档备查。多模型对比与批量扫描找出最强选手 换模型重跑把--model换成openai/gpt-5.4或google/gemini-3.1-pro-preview即可适配器代码在 harness/adapters/已支持 Anthropic、OpenAI、Google、Mistral、Fireworks 五家。批量矩阵扫描用内置 sweep 工具一次跑模型 × 任务矩阵自动完成运行、评分、报告三阶段uv run python -m utils.sweep \ --task corporate-ma/review-data-room-red-flag-review \ --models sonnet opus --parallel 2建议先加--dry-run预览计划。支持按执业领域如--task real-estate、工作流目录甚至all全量展开实现见 utils/sweep.py。对比仪表盘uv run python -m evaluation.compare --all仪表盘汇总 all-pass 率、标准通过率、逐条热力图、文档覆盖率、Token 消耗、耗时与估算成本——横向对比多个模型一目了然。安全设计每个任务独立沙箱运行 ️所有智能体运行都发生在按任务隔离的 Podman 容器中断网、去特权documents/只读挂载、output/可写6 个工具全部经由沙箱接口执行——即使案卷文件本身带有恶意内容也只会在容器内被解析不会触及宿主机。威胁模型细节见 sandbox/README.md。常见问题速查FAQ问题解答需要什么密钥必须Anthropic Key默认评审模型可选OpenAI / Google KeyWindows 能跑吗可以需 Windows 11 BIOS 开启虚拟化 WSL2setup.sh 会自动安装结果存在哪results/run-id/下含 config、transcript、metrics、scores、report.html可以只重新评分吗可以sweep 支持--eval-only报告支持--report-only如何浏览全部任务uv run python -m utils.list_tasks支持按领域/工作类型/难度过滤下一步深入探索与参与共建 完整教程docs/tutorial.md从环境到对比仪表盘的全流程架构详解docs/architecture.md评估方法论docs/eval-strategies.md贡献指南CONTRIBUTING.md——支持新增任务、编写更精准的 rubric、添加模型适配器Harvey LAB 还在持续扩充任务集与执行框架。如果你在评估法律大模型的能力边界、构建智能体测试体系或研究 LLM 评审LLM-as-judge方法这套任务 框架 全通过评分的组合都值得一试——先用utils.list_tasks浏览 1600 个任务挑一个最贴近你业务的开始吧【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号