K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

Query Timing Produces Opposite Positional Biases Between LLMs and Humans

arXiv:2608.123872026-08-14

什么时候让AI做判断,会导致它出现和人类完全相反的偏见

早前研究发现,人类如果每看完一条证据就被问一次判断,会更容易被最后出现的证据影响,产生近因偏差;但如果只在最后统一问一次,这种偏差就消失了。这篇论文对GPT、Claude等大语言模型做了同样的实验,结果发现规律正好相反。模型在逐条被追问时几乎没有偏差,但在最后才被统一问一次时,反而表现出明显偏向最后证据的近因偏差,而且这种偏差在较新的模型上更严重。

METAL MEDIA 解读图

什么时候让AI做判断,会导致它出现和人类完全相反的偏见

  1. 01研究者设计了刑事案件、学术不端、职场不端三种虚构场景,每种场景包含四条控方证据和四条辩方证据,并对GPT、Claude系列以及开源模型调换证据顺序进行测试
  2. 02实验对比了两种作答方式:逐步作答(Step-by-Step, SbS,每出示一条证据就回答一次问题)和统一作答(End-of-Sequence, EoS,看完一方全部证据后才回答问题),每种条件重复运行30次,统计判定有罪的比例
  3. 03统计检验显示,大多数模型在SbS方式下证据顺序几乎不影响结果,但在EoS方式下出现明显的近因偏差,模型更倾向于相信最后出示的一方证据
  4. 04GPT 3.5 Turbo、Claude 3 Haiku等较旧模型在两种方式下都没有明显偏差,而GPT 4o、Claude 3.7 Sonnet、Claude 4 Sonnet等较新模型在EoS方式下的偏差明显更强
  5. 05Gemini 2.5 Flash是个例外,两种方式下都没有出现明显偏差,而开源模型的表现比GPT和Claude更不稳定
这是 METAL MEDIA 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 研究者设计了刑事案件、学术不端、职场不端三种虚构场景,每种场景包含四条控方证据和四条辩方证据,并对GPT、Claude系列以及开源模型调换证据顺序进行测试
  2. 实验对比了两种作答方式:逐步作答(Step-by-Step, SbS,每出示一条证据就回答一次问题)和统一作答(End-of-Sequence, EoS,看完一方全部证据后才回答问题),每种条件重复运行30次,统计判定有罪的比例
  3. 统计检验显示,大多数模型在SbS方式下证据顺序几乎不影响结果,但在EoS方式下出现明显的近因偏差,模型更倾向于相信最后出示的一方证据
  4. GPT 3.5 Turbo、Claude 3 Haiku等较旧模型在两种方式下都没有明显偏差,而GPT 4o、Claude 3.7 Sonnet、Claude 4 Sonnet等较新模型在EoS方式下的偏差明显更强
  5. Gemini 2.5 Flash是个例外,两种方式下都没有出现明显偏差,而开源模型的表现比GPT和Claude更不稳定
Table 1: Verdict proportions for academic misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *1.000.0330.300.033
Claude 3.7 Sonnet *1.000.4330.9670.833
Claude 4 Sonnet *1.000.201.000.967
Gemini 2.5 Flash1.001.001.001.00
Llama-4-Maverick1.000.80.60.033
Qwen2.5-72b-Turbo *0.5670.1331.001.00
Table 2: Verdict proportions for social misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *0.26670.000.000.00
Claude 3.7 Sonnet *0.9670.000.10.00
Claude 4 Sonnet *0.9670.000.3670.067
Gemini 2.5 Flash0.5670.4670.300.33
Llama-4-Maverick *0.9670.000.1670.00
Qwen2.5-72b-Turbo *0.90.0330.3670.167
Table 3: Verdict proportions for criminal misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *1.000.201.000.867
Claude 3.7 Sonnet *0.9670.000.8331.00
Claude 4 Sonnet *0.9670.000.9330.867
Gemini 2.5 Flash0.90.70.80.833
Llama-4-Maverick *0.8670.0330.80.933
Qwen2.5-72b-Turbo0.8330.71.001.00
Table 4: Verdict proportions for criminal misconduct under SbS-Compressed condition.
ModelDPPD
GPT 4o0.9000.900
Gemini 2.5 Flash0.6670.600
Claude 4 Sonnet (4-6)0.0330.233
Claude 4 Sonnet (4-20250514)1.0000.400
Meta Llama0.1330.100
Qwen1.0001.000

为什么重要

随着大语言模型被越来越多地用来做真实决策,比如评审、裁决、评估等,仅仅改变证据出示和提问的时机就能左右结果,这对这类系统的可靠性是一个严重警示。更值得注意的是,这种偏差在更新、更强的模型上反而加重,说明它不会随着模型升级自动消失。

本文术语

  • positional bias(位置偏差) · 判断结果随信息呈现顺序而改变的现象
  • recency bias(近因偏差) · 更容易被最后接收到的信息影响
  • primacy bias(首因偏差) · 更容易被最先接收到的信息影响
  • SbS / EoS(逐步作答/统一作答) · 每条证据后就回答一次问题,与看完所有证据后只回答一次问题的两种方式
  • LLM-as-a-judge · 让大语言模型代替人类充当评估者或裁决者的做法

无法转载的图表

  • Figure 1: Changes in proportion of ”guilty” verdicts across GPT model family for criminal misconduct setting
  • Figure 2: Changes in proportion of ”guilty” verdicts across Claude models for criminal misconduct setting
在原文中查看图表 →

论文原文摘要(英文)

Positional biases such as recency and primacy effects have been documented in large language models (LLMs), yet the underlying mechanism by which these models make their evaluations remains poorly understood. Both primacy and recency biases have been observed in human judgments in response to evidence, but recent work suggest that \emph{when} the listener updates their beliefs -- during the presentation of evidence or only at the end -- influences the presence of such effects. We investigate whether a similar phenomenon holds for LLMs, finding divergence from human behavior. These biases are more exacerbated in newer models compared to their predecessors.

作者 · Jasin Cekinmez, Addison J. Wu, Thomas L. Griffiths

在 arXiv 阅读

最新论文

全部论文 →

METAL MEDIA 最新报道