跳到正文
原文
omarsar0· @omarsar0 · X·· 18 小时前AI 评分59

HarnessSQL 让 Qwen3-14B 在 Spider 2.0-SQLite 上从 22.2% 升至 54.8%

AI 导读

一篇论文提出 HarnessSQL,在与部署一致的执行 harness 内训练 Text-to-SQL 模型,Qwen3-14B 在 Spider 2.0-SQLite 上从 22.2% 提升到 54.8%,Qwen3-8B 从 15.5% 升至 45.2%。

正文 · AI 翻译

请密切关注自定义 harness(执行框架)。

这篇论文非常有意思,展示了在 harness 内部进行训练的影响。

当 Qwen3-14B 在与部署时相同的执行 harness 中训练时,它在 Spider 2.0-SQLite 上的成绩从 22.2% 提升到了 54.8%。

Text-to-SQL 模型通常被训练为写出一条静态查询。而部署的数据库智能体会检查 schema、运行探测查询并进行修改,但对应的 harness 只在推理时才出现。

HarnessSQL 构建了带有隐藏答案校验的隔离可执行数据库。教师模型在目标 harness 内运行;我们只保留经过验证的轨迹用于 SFT,然后应用执行奖励 RL。

此外,Qwen3-8B 从 15.5% 提升到了 45.2%,并且两个模型都能迁移到 BIRD-Interact 和 LiveSQLBench。

论文:arxiv.org/abs/2610.12274

论文讨论:academy.dair.ai/papers/harne…

来源:omarsar0 · x.com