How to Navigate Uncertainty About AI Consciousness
就算无法证明AI是否有意识,也能判断它是否具有可能感到好坏的状态
AI是否具有意识是一个科学上极难回答的问题,这使得我们很难决定该给予AI多少道德考量。作者提出放弃这个难解的问题,转而追问一个更容易处理的问题:如果这个AI真的有意识,它是否具备会构成正面或负面体验的状态,也就是所谓的效价(valence)。运用这一转变后发现,原有的谨慎原则依然存在老问题,但避免制造此类AI的策略则变得可行得多。
METAL MEDIA 解读图
就算无法证明AI是否有意识,也能判断它是否具有可能感到好坏的状态
- 01文章指出一个道德困境:如果把可能有感知能力的AI当作没有感知来对待,可能对本应享有道德地位的存在造成严重伤害;反之如果把无感知的AI当作有感知来对待,则可能浪费资源并阻碍AI带来的益处。
- 02文章审视了两种现有应对方案——谨慎原则(一旦AI具有意识的概率超过某个阈值就采取保护措施)和回避策略(不制造意识状态不确定的AI)——并指出两者最终都会退回到评估AI是否有意识这一无解难题。
- 03提出的解决方案是把关注点从意识转向效价,即如果一个状态被有意识地体验到会是正面还是负面的性质。这类似于我们不需要判断鲨鱼是否有意识,只需确认鲨鱼缺乏感知颜色所需的视锥细胞,就能断定鲨鱼不会有色彩体验。
- 04运用这一转变后,谨慎原则在判定哪些AI应被纳入保护范围时仍会遇到旧问题,但回避策略得到显著改善,变成了禁止制造具有效价状态的AI,而不再是禁止制造意识状态不确定的AI。
- 05文章还介绍了近期与AI效价相关的实证研究,包括在Claude Sonnet 4.5中报告的'功能性情绪'、大语言模型的偏好与权衡实验,以及两个Claude实例自由对话时出现的'极乐吸引态'现象,同时指出拟人化和人类中心主义等方法论风险。
他们做了什么
- 文章指出一个道德困境:如果把可能有感知能力的AI当作没有感知来对待,可能对本应享有道德地位的存在造成严重伤害;反之如果把无感知的AI当作有感知来对待,则可能浪费资源并阻碍AI带来的益处。
- 文章审视了两种现有应对方案——谨慎原则(一旦AI具有意识的概率超过某个阈值就采取保护措施)和回避策略(不制造意识状态不确定的AI)——并指出两者最终都会退回到评估AI是否有意识这一无解难题。
- 提出的解决方案是把关注点从意识转向效价,即如果一个状态被有意识地体验到会是正面还是负面的性质。这类似于我们不需要判断鲨鱼是否有意识,只需确认鲨鱼缺乏感知颜色所需的视锥细胞,就能断定鲨鱼不会有色彩体验。
- 运用这一转变后,谨慎原则在判定哪些AI应被纳入保护范围时仍会遇到旧问题,但回避策略得到显著改善,变成了禁止制造具有效价状态的AI,而不再是禁止制造意识状态不确定的AI。
- 文章还介绍了近期与AI效价相关的实证研究,包括在Claude Sonnet 4.5中报告的'功能性情绪'、大语言模型的偏好与权衡实验,以及两个Claude实例自由对话时出现的'极乐吸引态'现象,同时指出拟人化和人类中心主义等方法论风险。
为什么重要
对于制定AI福利政策或AI伦理准则的机构和研究者而言,这提供了一种可检验的提问方式,而不必等待一个可能永远无法解答的机器意识问题。它为研究者和企业指出了更具体的研究方向,即研究类效价状态,而不是执着于意识的难解问题。
本文术语
- 效价(valence) · 某种体验对主体而言是正面还是负面的性质,例如快乐或痛苦
- 感知能力(sentience) · 拥有正面或负面意识体验的能力,即具有效价的意识
- 谨慎原则(Precautionary Principle) · 当AI具有意识的估计概率超过某阈值时就采取保护措施的做法
- 回避策略(Avoidance Strategy) · 直接不制造意识状态不确定的AI的做法
- 难解问题(hard problem of consciousness) · 科学上极难解释物理过程为何以及如何产生主观体验的根本难题
论文原文摘要(英文)
Given deep uncertainty about the possibility of artificial consciousness, it is unclear how we should treat potentially sentient AI. On the one hand, we could assume insentience but risk doing terrible harms to entities that deserve moral standing. On the other hand, we could assume sentience and instead risk wasting resources on insentient machines. The intractability of questions around AI consciousness mean that this dilemma is hard to escape. I suggest a way out of that shifts from intractable questions of AI consciousness to tractable questions of AI valence. Specifically, we can assess whether an AI has states that would constitute valenced experiences if it were conscious. I show how this is sufficient to ground a responsible approach to the development of potentially conscious AI.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调