hcai-lab-gt/capabilibara
追踪语言模型的社会推理能力究竟来自训练数据的哪些部分
这个项目构建了一套流程,用来追踪语言模型的某项能力(比如社会推理)究竟依赖训练语料中的哪些内容。团队把568万份抽样文档归入576个主题乘格式的区域,计算这些区域对基准测试答案的影响力,再直接删除被标记的区域,检验模型能力是否真的因此下降。该研究由佐治亚理工学院实验AI实验室、EleutherAI等参与完成,是COLM 2026会议论文。
- ai-research
- capability-provenance
- interpretability
- language-models
- machine-unlearning
- mechanistic-interpretability
- research
- training-data-attribution
它做什么
- 团队从去重后约12.6亿份文档的Dolma3语料中抽取568万份文档,按24种主题乘24种格式分类,划分出576个语料区域
- 在OLMo3-7B模型上使用基于梯度的训练数据溯源方法TrackStar(通过Bergson工具),追踪SocialIQA、MMLU等基准测试的答案受到哪些训练文档影响,并将影响力汇总到576个区域
- 对被标记为高影响力的区域进行选择性遗忘(unlearning),即从模型中删除这些内容的影响,以因果方式验证该区域是否真的支撑了对应能力
- 删除与SocialIQA相关的被标记区域后,模型在该测试上的表现下降了1.60个百分点,该结果具有统计显著性(p约为十的负五次方)
- 代码、采样清单、影响力矩阵和遗忘后的模型检查点计划随论文最终版一起发布,目前仅公开了仓库结构和方法说明
为什么重要
了解模型某项能力究竟来自哪部分训练数据,能让研究者更精准地修正或删除有问题的数据,而不是凭猜测行事。这个项目展示了一种不依赖逐篇文档、而是按语料大区域来追踪能力来源的方法,并用真实的删除实验在大型开放模型上加以验证,对做可解释性和数据治理研究的人有参考价值。
本仓库术语
- 训练数据溯源(training-data attribution) · 追踪模型某个具体行为或答案是由哪部分训练数据产生的技术
- 机器遗忘(machine unlearning) · 从已训练好的模型中有选择地去除特定数据影响的技术
- WebOrganizer 24x24分类体系 · 将网页文档按24种主题与24种格式交叉分类的方案
- TrackStar(Bergson) · 利用梯度估算哪些训练文档影响了模型输出的工具
- LoRA · 一种轻量级微调方法,只调整新增的少量参数而非整个模型
仓库简介(英文)
Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.
在 GitHub 打开项目主页相关报道
热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库