maithra_raghu· @maithra_raghu · X·· 1 天前AI 评分
前沿AI模型在财报预测上首次超越人类专家共识
作者团队分享新结果,称前沿AI模型(Opus 5.5、Fable 5.1、Astra)配合 Samaya 的 harness,在 Earnings Predictions 任务上首次在营收、毛利率等常见财报指标上明显超越专家共识预测。
我们正在分享一项新成果:前沿AI模型首次在财务预测上超越了人类专家。我们为「盈利预测」这一高难度任务搭建了一个评测环境,发现最新的前沿模型(Opus 5.5、Fable 5.1、Astra)在搭配 Samaya 的框架后,在公司营收、毛利率等常见盈利指标的预测上,显著优于专家共识预测。
我们在该环境中为框架设置了「时点」闸门,以确保不存在信息泄露,并构建了尊重该闸门的金融检索与数据工具,让模型能够获取与专家同等的信息。我们还对专家共识中的偏差进行了校正,从而建立了一个高难度的、偏差校正后的基准线——只有超越它,才算具备真正的预测信号。目前只有最新的前沿AI模型能够击败这一高难度基准,这标志着AI在金融领域的能力迎来了一个重要拐点。
与 FrontierFinance 一样,我们看到该环境在强化学习训练方面仍有巨大的提升空间——模型在不同 rollout 中的误差差异很大。我们正继续研究如何利用盈利预测及其他预测性任务对模型进行后训练,让模型从自身的错误中学习。如果您希望合作或试用 alpha 版本,欢迎与我们联系。完整研究的链接见下方。
来源:maithra_raghu · x.com