aipulseda1ly· @aipulseda1ly · X·· 5 天前AI 评分
Gemini 4 Argon 在 Artificial Analysis 幻觉率仅 15%
Gemini 4 Argon 在 Artificial Analysis 上幻觉率为 15%,Grok 4.7 为 29%、GPT-6 Astra 为 45%、Opus 5.5 为 59%、Fable 5.1 为 69%。低于它的模型答题量极少,正确率均不超过 15%;Gemini 4 Argon 在 max 模式下正确率为 50%,低于 Opus 5.5 的 66%,但不确定时会直接说明而非编造。
Gemini 4 Argon 在 Artificial Analysis 上的幻觉率低得惊人,只有 15%。
Grok 4.7 是 29%,GPT-6 Astra 45%,Opus 5.5 59%,Fable 5.1 69%。
排在它下面的模型几乎什么都答不上来,正确率没有一个超过 15%。
在最高档位下,它答对的题目比 Opus 5.5 少,50% 对 66%。但当它不知道时,它会直说,而不是胡编乱造。
我已经迫不及待想上手试试了。
来源:aipulseda1ly · x.com