AI律师到底行不行?Harvey开源法律AI评测基准harvey-labs,给AI发了一张考卷

· 科技资讯

AI 能当律师吗?先过考卷再说

法律行业是 AI 落地最难啃的骨头之一:合同审阅、法律检索、文书起草,每一步都要求零容错。但”AI 法律助手”到底靠不靠谱,之前一直缺一把统一的尺子。

AI律师到底行不行?Harvey开源法律AI评测基准harvey-labs,给AI发了一张考卷封面

harvey-labs,由法律 AI 独角兽 Harvey AI 开源,今天登上 GitHub Trending(+87 星)。它的定位简单直接:一个专门评估和提升 AI Agent 法律工作能力的评测基准——给所有想做”AI 律师”的模型发一张标准考卷,谁行谁不行,跑分说话。

它解决什么痛点?

法律 AI 有两个老大难:

1. 没标准:各家都宣称自己”懂法律”,但没有统一考题,无从比较。

2. Agent 化难:法律工作不是单次问答,而是多步骤任务——读卷宗→检索法条→起草文书→交叉验证,一个 Agent 要连续干完,哪一步断了都不行。

harvey-labs 就是冲着这两点来的:它不测”模型背书能力”,而是测完整 Agent 在法律任务上的实际表现,覆盖真实法律工作流,用可复现的基准跑分说话。

Harvey 本身就是法律 AI 赛道的头部玩家,拿真实业务场景沉淀评测标准,比学院派 benchmark 更贴近实战——这也是这个项目一发布就被开发者关注的核心理由。

上手体验

项目是 Python 写的,结构清晰,clone 下来就能跑:

git clone https://github.com/harveyai/harvey-labs.git
cd harvey-labs
pip install -r requirements.txt

评测核心是把法律任务拆成可自动评分的子任务,跑完输出结构化报告,方便横向对比不同模型/Agent 的差距。

和同类比强在哪?

场景真实:不是选择题式问答,而是模拟完整法律工作流

Agent 友好:专门评估多步推理、工具调用,而非单轮问答

开源可复现:基准公开,人人都能跑,避免”自说自话式宣传”

相比一些学院派法律基准偏重”知识问答”,harvey-labs 更接近”执业能力测试”——你关心的是 AI 能不能把活干完,而不是它背了多少法条。

适合谁?注意什么?

法律科技创业者:用基准检验自家产品,找到短板,省去大量内部评测成本。

企业法务 / 律所 IT:采购 AI 法律工具前,先拿基准跑一遍候选产品,数据说话。

AI 研究者:法律是高难度 Agent 场景,这套基准是很好的研究素材。

限制提醒:项目还很年轻(2026年3月创建,目前 800+ 星),评测覆盖的司法辖区和任务类型有限,别把单一跑分当”法律能力全貌”。

为什么现在火?

法律 AI 正在从”演示阶段”进入”采购阶段”,买方最需要的就是可比较的评测标准。Harvey 把自家测试基准开源,既立了行业标准,也占了”裁判”身位——谁定义考卷,谁就定义赛道

对普通用户来说,这条新闻最大的价值是:下次再看到”AI 律师包赢”的广告,你可以反问一句——过 harvey-labs 了吗?

🔥 关注LC智趣厅,AI 行业标准与开源动态不错过

👇 转发给做法律科技、关注 AI 落地的朋友


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅