跳到正文
原文
Google Research·· 2026-04-03AI 评分39

Google 如何评估 LLM 行为倾向与人类的对齐程度

AI 导读

Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

当前提供 AI 导读,完整正文请阅读原文。

来源:Google Research · research.google