跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 9 小时前AI 评分49

Overmind 微调 Qwen3.5 9B 对比 GPT5.6 Luna

AI 导读

Overmind 用生产 trace 微调 Qwen3.5 9B,在法律合同任务上对比 GPT5.6 Luna,报告幻觉条款减少 20 至 30 倍、逐字引用条款准确率提升 7 倍。其可观测层与训练层共用同一数据,evals 基于真实任务构建而非公开 benchmark。产出为权重自有的小模型,可在 Overmind 托管或自行部署。

正文 · AI 翻译

前沿模型在阅读合同时,有时会引用一条并不存在的条款。

Overmind 会用你自己的生产环境轨迹对一个小型开源模型进行微调,然后在基于这些真实任务构建的评测集上,将其与你当前的模型进行对比打分。

他们公布的对比结果是:通过 Overmind 调优的 Qwen3.5 9B 对比 GPT5.6 Luna。该公司报告称,在法律合同中幻觉条款减少了 20 到 30 倍,逐字引用条款的准确率提升了 7 倍。

在这里,可观测层和训练层共享同一份数据。那些向你展示智能体在何处失败的轨迹,本身就成为了数据集,而评测也是基于真实任务构建的,而非公开基准。

最终产出的是一个更小的开源模型,其权重归你所有。你可以将其托管在 Overmind 上,也可以自行运行。

来源:rohanpaul_ai · x.com