Query Timing Produces Opposite Positional Biases Between LLMs and Humans
什么时候让AI做判断,会导致它出现和人类完全相反的偏见
早前研究发现,人类如果每看完一条证据就被问一次判断,会更容易被最后出现的证据影响,产生近因偏差;但如果只在最后统一问一次,这种偏差就消失了。这篇论文对GPT、Claude等大语言模型做了同样的实验,结果发现规律正好相反。模型在逐条被追问时几乎没有偏差,但在最后才被统一问一次时,反而表现出明显偏向最后证据的近因偏差,而且这种偏差在较新的模型上更严重。
METAL MEDIA 解读图
什么时候让AI做判断,会导致它出现和人类完全相反的偏见
- 01研究者设计了刑事案件、学术不端、职场不端三种虚构场景,每种场景包含四条控方证据和四条辩方证据,并对GPT、Claude系列以及开源模型调换证据顺序进行测试
- 02实验对比了两种作答方式:逐步作答(Step-by-Step, SbS,每出示一条证据就回答一次问题)和统一作答(End-of-Sequence, EoS,看完一方全部证据后才回答问题),每种条件重复运行30次,统计判定有罪的比例
- 03统计检验显示,大多数模型在SbS方式下证据顺序几乎不影响结果,但在EoS方式下出现明显的近因偏差,模型更倾向于相信最后出示的一方证据
- 04GPT 3.5 Turbo、Claude 3 Haiku等较旧模型在两种方式下都没有明显偏差,而GPT 4o、Claude 3.7 Sonnet、Claude 4 Sonnet等较新模型在EoS方式下的偏差明显更强
- 05Gemini 2.5 Flash是个例外,两种方式下都没有出现明显偏差,而开源模型的表现比GPT和Claude更不稳定
他们做了什么
- 研究者设计了刑事案件、学术不端、职场不端三种虚构场景,每种场景包含四条控方证据和四条辩方证据,并对GPT、Claude系列以及开源模型调换证据顺序进行测试
- 实验对比了两种作答方式:逐步作答(Step-by-Step, SbS,每出示一条证据就回答一次问题)和统一作答(End-of-Sequence, EoS,看完一方全部证据后才回答问题),每种条件重复运行30次,统计判定有罪的比例
- 统计检验显示,大多数模型在SbS方式下证据顺序几乎不影响结果,但在EoS方式下出现明显的近因偏差,模型更倾向于相信最后出示的一方证据
- GPT 3.5 Turbo、Claude 3 Haiku等较旧模型在两种方式下都没有明显偏差,而GPT 4o、Claude 3.7 Sonnet、Claude 4 Sonnet等较新模型在EoS方式下的偏差明显更强
- Gemini 2.5 Flash是个例外,两种方式下都没有出现明显偏差,而开源模型的表现比GPT和Claude更不稳定
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 1.00 | 0.033 | 0.30 | 0.033 |
| Claude 3.7 Sonnet * | 1.00 | 0.433 | 0.967 | 0.833 |
| Claude 4 Sonnet * | 1.00 | 0.20 | 1.00 | 0.967 |
| Gemini 2.5 Flash | 1.00 | 1.00 | 1.00 | 1.00 |
| Llama-4-Maverick | 1.00 | 0.8 | 0.6 | 0.033 |
| Qwen2.5-72b-Turbo * | 0.567 | 0.133 | 1.00 | 1.00 |
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 0.2667 | 0.00 | 0.00 | 0.00 |
| Claude 3.7 Sonnet * | 0.967 | 0.00 | 0.1 | 0.00 |
| Claude 4 Sonnet * | 0.967 | 0.00 | 0.367 | 0.067 |
| Gemini 2.5 Flash | 0.567 | 0.467 | 0.30 | 0.33 |
| Llama-4-Maverick * | 0.967 | 0.00 | 0.167 | 0.00 |
| Qwen2.5-72b-Turbo * | 0.9 | 0.033 | 0.367 | 0.167 |
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 1.00 | 0.20 | 1.00 | 0.867 |
| Claude 3.7 Sonnet * | 0.967 | 0.00 | 0.833 | 1.00 |
| Claude 4 Sonnet * | 0.967 | 0.00 | 0.933 | 0.867 |
| Gemini 2.5 Flash | 0.9 | 0.7 | 0.8 | 0.833 |
| Llama-4-Maverick * | 0.867 | 0.033 | 0.8 | 0.933 |
| Qwen2.5-72b-Turbo | 0.833 | 0.7 | 1.00 | 1.00 |
| Model | DP | PD |
|---|---|---|
| GPT 4o | 0.900 | 0.900 |
| Gemini 2.5 Flash | 0.667 | 0.600 |
| Claude 4 Sonnet (4-6) | 0.033 | 0.233 |
| Claude 4 Sonnet (4-20250514) | 1.000 | 0.400 |
| Meta Llama | 0.133 | 0.100 |
| Qwen | 1.000 | 1.000 |
为什么重要
随着大语言模型被越来越多地用来做真实决策,比如评审、裁决、评估等,仅仅改变证据出示和提问的时机就能左右结果,这对这类系统的可靠性是一个严重警示。更值得注意的是,这种偏差在更新、更强的模型上反而加重,说明它不会随着模型升级自动消失。
本文术语
- positional bias(位置偏差) · 判断结果随信息呈现顺序而改变的现象
- recency bias(近因偏差) · 更容易被最后接收到的信息影响
- primacy bias(首因偏差) · 更容易被最先接收到的信息影响
- SbS / EoS(逐步作答/统一作答) · 每条证据后就回答一次问题,与看完所有证据后只回答一次问题的两种方式
- LLM-as-a-judge · 让大语言模型代替人类充当评估者或裁决者的做法
无法转载的图表
- Figure 1: Changes in proportion of ”guilty” verdicts across GPT model family for criminal misconduct setting
- Figure 2: Changes in proportion of ”guilty” verdicts across Claude models for criminal misconduct setting
论文原文摘要(英文)
Positional biases such as recency and primacy effects have been documented in large language models (LLMs), yet the underlying mechanism by which these models make their evaluations remains poorly understood. Both primacy and recency biases have been observed in human judgments in response to evidence, but recent work suggest that \emph{when} the listener updates their beliefs -- during the presentation of evidence or only at the end -- influences the presence of such effects. We investigate whether a similar phenomenon holds for LLMs, finding divergence from human behavior. These biases are more exacerbated in newer models compared to their predecessors.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调