harvey-labs_harveyai
harvey-labs
Harvey LAB 是一个开源的法律代理基准测试项目,用于评估大语言模型(LLM)代理在真实法律工作环境中的能力。
项目核心功能:
- 任务数据集:包含代理指令、法律文档和评分标准,覆盖 24+ 法律实践领域,共 1671 个任务
- 执行框架:用于运行代理并对照任务进行评估打分
- 评估方法论:支持通过 rubric 逐项评分和 LLM 裁判机制
- 文档与教程:提供完整的架构说明、评估策略和贡献指南
该项目由 Harvey AI 开发,将持续更新任务和执行框架。