harveyai

@harveyai

harvey-labs

harveyai/harvey-labs

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

STARS697
FORKS170
OPEN ISSUES / PRS46
LANGUAGEPython

CHOOSE YOUR VIEW

你想怎么了解这个项目?

同一份项目事实,两种阅读深度。不会改变页面地址和搜索内容。

当前展示快速摘要和完整技术内容,请按需要选择。选择只保存在当前设备。

ADOPTION BRIEF

项目采用前简报

当前判断证据不足,继续观察
标准证据模板项目采用前评估

已有部分公开证据,但样本或表述仍不足以支撑采用结论。

已有公开依据

  • 项目用途:来自项目描述、README 或现有中文解读。
  • 榜单记录:来自本站保存的周期快照和历史排名。
  • 健康证据:已采集公开提交、Issue、PR 或 Release 样本,当前置信度为 样本有限。
  • License:仓库当前声明为 MIT,仍需回到完整协议核验。
  • 近期变化:已有可展示的公开事实摘要,原始链接仍是最终核验入口。
  • 部署提醒:页面保留 README 和仓库链接,具体依赖、数据边界与运行方式以项目方文档为准。

采用前仍需核验

当前模板未发现明确证据缺口,但仍需在你的实际环境完成安装、依赖、数据和安全验证。

建议的下一步

  1. 打开 README 和完整 License,确认依赖与使用义务。
  2. 在隔离的测试环境完成最小可运行验证。
  3. 根据真实业务数据决定继续评估或暂缓采用。
01

QUICK UNDERSTANDING

先用几分钟判断它是否值得继续看

人话与术语分开,事实不变
先说人话 它提供一套法律工作的模拟考试和统一评分方法,用来检验帮助处理法律事务的电脑程序完成得对不对、好不好,从而找到它们的不足并改进。

可以把它理解成一个法律工作考试的出题组,既出真实任务当考题,又给出标准答案要点,让不同的电脑帮手考同一张卷子,比较谁完成得更好。

WHEN TO USE IT

什么时候用得上

  • 当你想比较两款法律文书处理软件哪个更可靠时,可以用这套考题让它们做同样的任务来对比。
  • 当你在开发一个帮律师整理和查找资料的小工具,想知道它离正式使用还有多少差距时,可以拿它来模拟测试。
ONE EXAMPLE

举个具体例子

例如,一家小律所想引入软件协助审阅合同,负责人从中选了几份标准合同,让两款试用软件分别标出风险条款,再按随附的评分标准打分,最终选出出错更少的一款,也明白了仍需人工复核哪些环节。

WHO IT FITS

如果你是……

  • 如果你需要为团队挑选法律相关软件,不想只听厂商宣传,想自己用统一题目验证。
  • 如果你正在学习如何开发这类辅助程序,希望有一个现成的练习和检验方式。
BEFORE YOU START

开始前先知道

  • 开始前,你要确认被测试的电脑程序能按题目要求读取材料并输出结果,否则无法进行评分。
  • 开始前,你应仔细阅读项目自带的教程和评分说明,确保自己按相同规则进行测试。
当前维护状态近期活跃

最近 30 天内有代码推送记录。

License 提醒通常允许商业使用

通常仍需保留版权、许可声明,并遵守协议中的附加义务。

结论从哪里来?中文说明由公开项目资料辅助整理,最终判断请回到项目方原始来源。

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
日榜首次记录
历史最佳#11当前排名#11

暂无可比的上一期数据

记录天数
1 天
记录期 Star
0
本站共 17 天日榜快照 · 最近记录 2026-08-09
本站最早记录:2026-08-09

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
样本有限
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
25
按公开记录统计 · 完整窗口
活跃贡献者
11
按公开记录统计 · 按公开提交账号去重
近 12 月活跃月份
4/12
有提交的自然月
RESPONSE

社区响应

核对样本
Issue 关闭率
44%
按公开记录统计 · 8/18 个同期新 Issue · Issue 原始样本 18 条/有效样本 18 条/排除 0 条
Issue 关闭中位数
7.8 天
按公开记录统计 · 仅统计已关闭样本
PR 合并率
40%
按公开记录统计 · 23/58 个同期新 PR · PR 原始样本 58 条/有效样本 58 条/排除 0 条
PR 合并中位数
22 小时
按公开记录统计 · 仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
0
按公开记录统计 · 排除草稿与预发布
最近正式 Release
暂无记录
按公开记录统计 · 以公开发布时间为准
发布间隔中位数
样本不足
按公开记录统计 · 至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
MIT
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

仓库类型 代码项目统计窗口 90 天快照样本 1 天计算规则 health-v2采集于 2026-08-09 19:10

代码项目:按提交、协作、发布与采用风险分开观察。 当前样本覆盖、分页完整性或适用度不足,不把局部数据写成整体结论。 这些信号不替代代码审计、安全测试和真实生产验证。

90-DAY CHANGE RADAR

最近 90 天发生了什么

依据可复核的项目特定事件生成,不用通用文案补足事实。
部分样本
近 90 天的可复核变化主要来自已合并 PR

近 90 天记录到 25 次 Commit、58 个新 PR(23 个已合并)和 18 个新 Issue(8 个已关闭);同期可复核正式 Release 0 个。

代码推进25 次 Commit

按公开提交记录统计,不判断内容或代码质量。

合并协作23 / 58 个 PR

前者为已合并数量,后者为同期新建样本。

问题响应8 / 18 个 Issue

前者为已关闭数量,后者为同期新建有效样本。

正式发布0 个 Release

仅统计窗口内非草稿、非预发布版本。

2026-05-11 至 2026-08-09规则 changes-v3生成于 2026-08-09 19:10

  • 代码项目:按提交、协作、发布与采用风险分开观察。
  • 事件是否存在由确定性规则识别,摘要不使用 AI 猜测事件。
  • 这些公开活动记录不等同于代码质量、安全性或生产可用性结论。
  • 本站每日指标快照目前积累 1 天,不补算缺失日期,也不伪造完整 90 天增量。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

Harvey LAB是Harvey AI开源的基准项目,用于评估和改进AI代理在真实法律工作场景中的能力,提供1671个任务及执行评估框架。

Harvey LAB是Harvey AI推出的开源基准测试项目,遵循MIT许可。其目标是通过真实法律工作任务(如并购数据室审查)来评估和提升AI代理的能力。项目包含两大部分:任务数据集,内含指令、文档和评分标准;执行harness,用于运行代理并对结果进行评分和报告。据README自述,当前覆盖24个以上法律实践领域,包含1671个任务。仓库在GitHub上有682星、170 fork和46个开放问题/PR。项目处于持续演进中,提供了教程和贡献指南。

核心亮点

项目最值得关注的能力

AI 推断
  • 基准覆盖24个以上法律实践领域,包含1671个任务
  • 提供从任务检查、运行、评分到报告对比的完整执行框架
  • 以MIT许可开源,支持社区贡献任务和模型适配器

适用场景

它可以解决哪些实际问题

AI 推断
  • 学术研究中评估法律领域AI代理的通用能力
  • 法律科技团队在开发中对比不同代理实现的性能
  • 企业内部评估法律自动化工具在特定场景下的适用性

技术观察

从公开资料提炼的实现特征

AI 推断
  • 任务模型由指令、支撑文档和评分规则组成,支持结构化评估
  • 执行harness通过模型适配器接入不同代理,支持批量扫描和报告生成
  • 评分策略采用全通过规则,并依赖LLM作为裁判进行判定

优势判断

相对明确的项目价值

AI 推断
  • 开源且采用MIT许可,便于二次开发和集成
  • 任务集以真实法律工作为蓝本,具有实践导向

局限与注意

评估和采用前需要留意

AI 推断
  • 评估结果依赖基准本身的覆盖度和评分设计,存在主观性
  • 项目仍处于持续演进中,任务集和工具链可能发生变动

适用人群

哪些开发者和团队值得关注

AI 推断
  • 从事法律AI研究的学者和研究人员
  • 需要验证法律自动化工具效果的产品与技术团队
综合参考
从公开资料看,Harvey LAB为法律领域的AI代理评估提供了一套结构化且覆盖面较广的基准,有助于标准化测试和对比。但需注意,其有效性依赖于任务数据集和评分方法的合理性,这些尚未经独立第三方验证。项目仍处早期演进阶段,在采用前应自行验证其适用性、安全性和性能。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:仓库由harveyai组织创建,使用Python编写,MIT许可;当前数据为682星、170 fork、46个开放issue/PR。
  • 项目方自述:README宣称该项目包含任务数据集和执行harness,覆盖24+法律实践领域、1671个任务,并提供教程、架构与评估方法文档。
生成于 2026-08-09 19:25 规则版本 2026-08-v5-plain-language
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。