Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities
只用9个情绪词和450段小故事,就能在AI内部找到判断正负情绪的方向,而且这个方向在文字、图像、声音甚至脑电波中都通用
语言模型内部藏着一条能判断一句话是正面还是负面情绪的内部方向,这篇论文展示了如何仅用9个情绪类别名称和每种情绪约50段短故事(而不是传统方法所需的数千条标注数据)就能找到这条方向。用同样的方法在从未一起训练过的图像、音频和人类脑电波模型中,也能找到几乎相同的方向。研究者从语言模型内部人为删除这条方向后,情绪判断能力大幅下降,证明这条方向不只是与情绪相关,而是真正在起作用。
METAL MEDIA 解读图
只用9个情绪词和450段小故事,就能在AI内部找到判断正负情绪的方向,而且这个方向在文字、图像、声音甚至脑电波中都通用
- 01仅用愤怒、喜悦、恐惧等9个情绪类别名称,以及每种情绪约50段(共450段)短篇叙事段落,比传统监督学习方法少用约1500倍的标注数据,就找到了这条'效价轴'(V-axis)。
- 02具体做法是:把这些故事输入一个冻结(不再训练)的编码器模型,按情绪类别取平均得到9个情绪中心向量,再用主成分分析找出这9个点分布最分散的方向,即为V-axis。
- 03这条V-axis在四种不同领域都能达到与监督学习分类器相差7个百分点以内的效果:文本(Llama-3-8B在SST-2情感分类上AUC为0.772,达到监督学习0.828的93%)、图像(EmoSet数据集上与人工评分相关系数为0.636)、音频(ESC-50上AUC为0.906)、脑电波(FACED数据集上AUC为0.720)。
- 04研究者从语言模型内部强行删除这条V-axis方向后,三个不同模型的情感分类准确率下降了5.5到37.2个百分点,而删除同等大小的随机方向最多只下降0.88个百分点,证明这条方向确实被模型用来做情感判断,而非仅仅是巧合相关。
- 05仅用文本数据训练的一个极简两参数分类器,不经任何额外训练就能直接用于图像(AUC 0.961)、音频(0.764)和脑电波(0.828)数据,效果远超使用16维通用共享特征的方法(0.525,接近随机水平)。
他们做了什么
- 仅用愤怒、喜悦、恐惧等9个情绪类别名称,以及每种情绪约50段(共450段)短篇叙事段落,比传统监督学习方法少用约1500倍的标注数据,就找到了这条'效价轴'(V-axis)。
- 具体做法是:把这些故事输入一个冻结(不再训练)的编码器模型,按情绪类别取平均得到9个情绪中心向量,再用主成分分析找出这9个点分布最分散的方向,即为V-axis。
- 这条V-axis在四种不同领域都能达到与监督学习分类器相差7个百分点以内的效果:文本(Llama-3-8B在SST-2情感分类上AUC为0.772,达到监督学习0.828的93%)、图像(EmoSet数据集上与人工评分相关系数为0.636)、音频(ESC-50上AUC为0.906)、脑电波(FACED数据集上AUC为0.720)。
- 研究者从语言模型内部强行删除这条V-axis方向后,三个不同模型的情感分类准确率下降了5.5到37.2个百分点,而删除同等大小的随机方向最多只下降0.88个百分点,证明这条方向确实被模型用来做情感判断,而非仅仅是巧合相关。
- 仅用文本数据训练的一个极简两参数分类器,不经任何额外训练就能直接用于图像(AUC 0.961)、音频(0.764)和脑电波(0.828)数据,效果远超使用16维通用共享特征的方法(0.525,接近随机水平)。

| Modality | Encoder | Dataset | Recipe AUC | Sup. AUC | Ratio | p |
|---|---|---|---|---|---|---|
| Text | Llama-3-8B-Inst (block 20) | SST-2 | 0.772 | 0.828 | 93% | — |
| Text | Qwen3-8B (block 31, depth 0.86) | SST-2 | 0.787 | 0.840 | 94% | — |
| Vision | CLIP-img-768 | EmoSet | r=+0.636 | r=+0.81 | 79% | null 0.112 |
| Audio | CLAP-aud-512 | ESC-50 | 0.906 | 0.94 | 96% | 2.2×10−15 |
| EEG | CBraMod-200 | FACED | 0.720±0.055 | 0.83 | 87% | 3.65×10−8 |

| Model | Block | Base (%) | V-abl. (%) | Drop (V) | Random (μ±σ) | z |
|---|---|---|---|---|---|---|
| Llama-3-8B-Inst | 20 | 87.96 | 82.45 | −5.50 pp | −0.15±0.05 pp | 109 |
| Qwen3-1.7B | 18 | 84.40 | 68.58 | −15.83 pp | −0.88±1.24 pp | 12 |
| Qwen3-8B | 23 | 87.61 | 50.46 | −37.16 pp | −0.08±0.19 pp | 196 |

| Source ↓ Target → | Text | Image | Audio | EEG |
|---|---|---|---|---|
| Text | 0.741 (CV) | 0.961 | 0.764 | 0.828 |
| Image | 0.725 | 0.960 (CV) | 0.764 | 0.828 |
| Audio | 0.725 | 0.961 | 0.751 (CV) | 0.828 |
| EEG | 0.725 | 0.961 | 0.764 | 0.867 (CV) |
| Bridge between text and image encoder | Cross-modal AUC |
|---|---|
| Generic K=16 substrate (same encoder family) | 0.525 (chance) |
| Random K=16 subspace | ≈ chance |
| Cross-encoder-family substrate (CLIP-text + CLAP-audio) | ≈ chance |
| Raw 768-D CLIP-text features | 0.771 |
| V-axis (1-D, sentiment-specific) | 0.961 |
为什么重要
这项研究说明,像情绪这种模糊的人类感受,也能用极少量样本在AI内部被精确定位,并且这个方向能跨越文字、图像、声音甚至脑电波共享,这意味着未来构建情感识别系统可能会变得更便宜、更快捷。但研究也发现同样的方法能操控Llama和Mistral系列模型生成内容的情绪倾向,而对Qwen和Gemma系列无效,这提示该技术存在被滥用来操纵AI输出情绪的风险,值得警惕。
本文术语
- 效价轴(V-axis) · AI模型内部表示空间中,标示事物正面或负面程度的一条单一方向
- 残差流(residual stream) · Transformer模型逐层累加信息所形成的内部状态流
- 主成分分析(PCA) · 一种统计方法,用于找出一组数据点分布最分散的方向
- AUC · 衡量分类器区分正确与错误答案能力的指标,1.0为完美,0.5为随机猜测水平
- 方向性消融(directional ablation) · 一种实验手段,强行从模型内部状态中去除某个特定方向的成分
论文原文摘要(英文)
Inside a modern language model sits a single internal direction that tracks how positive or negative a sentence feels. We show how to find this valence axis (V-axis) from just 9 emotion category names plus 50 short narrative paragraphs per emotion -- about 1,500 fewer labels than the usual supervised approach -- and that the same direction appears in vision, audio, and human-brain encoders never jointly trained. The recipe: embed nine emotion-anchored story sets in a frozen encoder, take the top principal direction of the nine averaged embeddings. Projecting new inputs onto it captures 93% of supervised performance on SST-2 (Llama-3-8B-Instruct, AUC 0.772 vs. 0.828), correlates with human valence ratings on 11,811 EmoSet images at r=0.636, reaches AUC 0.906 on ESC-50 audio (p 12). A 2-parameter classifier trained on text labels transfers to images (AUC 0.961), audio (0.764), and brain recordings (0.828) without target-modality labels; a generic 16-D subspace stays at chance (0.525). The recipe is bounded to continuous attributes -- seven tests on categorical concepts return near-chance -- and steering is family-specific (Llama/Mistral yes, Qwen/Gemma no).
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Yousef Radwan et al., arXiv:2608.18090, CC BY 4.0