Artificial Analysis 与 Harvey 合作更新法律智能体基准 LAB-AA v1.1
Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,为法律智能体基准(LAB)加入幻觉检查,新指标 Hallucination-Gated All-Pass Rate 要求交付物满足全部评分标准且不含实质性幻觉。
今天,我们与 Harvey 合作发布 Harvey LAB-AA v1.1。本次更新调整了法律智能体基准(LAB)的评分方法,新增了幻觉检查,并要求正确回答不得包含实质性错误陈述。LAB-AA v1.1 的新核心指标——幻觉门控全通过率(Hallucination-Gated All-Pass Rate),只有当交付物满足所有评分标准且不含实质性幻觉时,才计入任务通过。
我们将实质性幻觉定义为会在实质问题上误导读者的幻觉,例如合同要求的日期出错;而轻微幻觉是真实存在的错误,但不太可能对交付物的法律解读产生实质性影响。轻微幻觉会单独报告,不影响核心得分。
Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通过率位居第一;在发布时测试的各模型中,原本通过的结果里有超过 60% 含有实质性幻觉。
这是完善 Harvey LAB-AA 方法论的第一步。在未来的更新中,我们正与 Harvey 合作,以更好地纳入律师所重视的全部因素,包括风格和语气等易用性特征。
核心要点:
➤ 榜首:来自 @SpaceXAI 的 Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通过率领先,略微超过 @AIatMeta 的 Muse Spark 1.3 (max)(8.9%)和 @OpenAI 的 GPT-6 Astra (max)(8.6%)
➤ 幻觉重塑了排行榜:如果没有幻觉门控,Muse Spark 1.3 (max) 会以 26.7% 的全通过率明显领先,但其中三分之二的通过结果含有一处或多处实质性幻觉,导致其幻觉门控全通过率仅为 8.9%。GPT-6 Astra (max) 在幻觉门控后几乎保留了全部通过结果(从 8.9% 到 8.6%),排名从并列第 10 升至第 3
➤ GPT-6 系列模型最扎实:GPT-6 Astra (max) 平均每任务 0.03 处实质性幻觉(全部 120 个任务中共 4 处),GPT-6 Sol (max) 平均每任务 0.07 处。在用 6 个检查模型对 20 个任务的子集进行比较时,GPT-6 Astra 在每个检查模型下均无实质性幻觉,包括 Claude Opus 5.5 (high)。相比之下,Gemini 3.8 Flash (high) 平均每任务有 13.96 处实质性幻觉。
➤ 得分最高的模型并非最贵:Grok 4.7 (xhigh) 以每任务约 9.50 美元的成本登上榜首,不到最贵模型 Claude Fable 5.1 (max with fallback,每任务约 21.70 美元) 的一半。Muse Spark 1.3 (max) 以每任务约 4.20 美元的成本取得了出色的性价比,位列第二
感谢 @harvey 的 @nikogrupen 和 @ItsJulioPereyra 在 Harvey LAB 上的工作与合作。
来源:ArtificialAnlys · x.com