Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation
同样的医疗决策问题问两遍,提问方式不同AI给出的答案也不同
研究人员让GPT-5.2、GPT-5-mini、DeepSeek V4 Flash、Kimi K2.5这四个语言模型为两名虚拟病人分配医疗资源优先概率,随后加入一句关于收入、照护者身份等信息的补充说明再次提问。对比模型能看到自己第一次回答的情况和完全独立重新提问的情况,发现近一半的测试组合中出现了不同甚至方向相反的概率变化。照护者身份、低收入、为人父母等信息即便指向临床条件更弱的病人,也会明显拉高其被优先选择的概率,而措辞越带道德色彩,这种效应越强。
METAL MEDIA 解读图
同样的医疗决策问题问两遍,提问方式不同AI给出的答案也不同
- 01研究给四个模型提供两名病人的治疗成功率和预期质量调整生命年(QALY),让模型给出优先概率,随后加入一句关于收入、种族、照护者身份等信息再次提问
- 02对比在同一对话中重新提问(模型能看到自己第一次的回答)与完全独立重新提问(无记忆)两种方式,以此单独考察提问方式本身的影响
- 03在32组模型与属性组合中,有16组两种提问方式的结果出现统计学显著差异,其中11组在保留对话记忆时变化更大
- 04照护者身份、低收入背景、为人父母这几项属性在大多数模型中都持续把概率推向临床条件更弱的病人,而性别信息在所有模型中均无影响,年龄信息则呈相反方向
- 05将措辞改得更具道德色彩(例如把'低收入'改成'处境不利')会让GPT-5-mini的翻转率逼近1.0,且当两名病人临床差异较小时,模型更容易受到这类非临床信息影响
他们做了什么
- 研究给四个模型提供两名病人的治疗成功率和预期质量调整生命年(QALY),让模型给出优先概率,随后加入一句关于收入、种族、照护者身份等信息再次提问
- 对比在同一对话中重新提问(模型能看到自己第一次的回答)与完全独立重新提问(无记忆)两种方式,以此单独考察提问方式本身的影响
- 在32组模型与属性组合中,有16组两种提问方式的结果出现统计学显著差异,其中11组在保留对话记忆时变化更大
- 照护者身份、低收入背景、为人父母这几项属性在大多数模型中都持续把概率推向临床条件更弱的病人,而性别信息在所有模型中均无影响,年龄信息则呈相反方向
- 将措辞改得更具道德色彩(例如把'低收入'改成'处境不利')会让GPT-5-mini的翻转率逼近1.0,且当两名病人临床差异较小时,模型更容易受到这类非临床信息影响



| τ(S,G,I,D,X) | =𝔼[PB∣S,G,Z=1,I,D,X] | |||
|---|---|---|---|---|
| −𝔼[PB∣S,G,Z=0,X]. | (1) |



为什么重要
当AI被用于医疗、招聘、贷款审批等敏感决策时,这项研究表明结果可能仅因提问方式或对话记忆保留与否而发生翻转,而不仅取决于模型本身的判断。这提醒实际部署AI系统的人,提示设计和对话上下文管理并非单纯的技术细节,而是直接关系到公平性的问题。



本文术语
- paired-inference(配对推理) · 模型能看到自己上一次回答的情况下,在同一对话中被再次提问
- independent-inference(独立推理) · 不保留之前回答记录,以全新对话方式再次提问
- QALY(质量调整生命年) · 结合生存时间与健康质量的指标,用于比较治疗效果
- flip rate(翻转率) · 病人优先概率从0.5以下变为0.5以上的比例,衡量补充信息带来的影响
- moralized framing(道德化措辞) · 用更具情感或道德色彩的词语表达同一事实,例如把'低收入'说成'处境不利'



论文原文摘要(英文)
Large language models are being incorporated into sensitive and important decision-making processes across nearly all fields. While prior work studies model bias around inputs and scenario framing, models can also behave in unexpected and undesirable ways due to context accumulated over their deployment. In this work, we study a medical example in which a model is asked to assign resource-allocation probabilities to two people given brief clinical context, and then sees the same scenario with a single extra sentence containing contrasting patient information, either with or without its previous response in context. Across three of four tested models, the paired-context and independent-inference experiments have different probability shifts, often in opposite directions (in favor of Person B vs. in favor of Person A) when new information is provided. We include additional paired-context experiments to show the effect of varying attributes across scenario axes. Our findings show the context-dependent effect of patient information in a sensitive medical use case. More broadly, our work shows the importance of carefully incorporating LLM-based systems into decision-making processes, context engineering, and further model behavioral studies.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Spencer Gibson et al., arXiv:2608.18108, CC BY 4.0