DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models
11个AI专家智能体组队,用来解读一味中药经典方剂的作用机制
广州中医药大学等机构的研究者以通用大语言模型DeepSeek V3.2为核心大脑,打造了DeepTCM1.0多智能体系统,让11个模拟专家协作分析中药复方的作用机制。他们以经典方剂桂枝汤为案例进行验证,结果显示该系统的评分显著优于单一大语言模型。该框架无需额外构建数据库或对模型进行微调,完全依靠提示词工程实现。
METAL MEDIA 解读图
11个AI专家智能体组队,用来解读一味中药经典方剂的作用机制
- 01以往的数据挖掘、网络药理学、分子对接等方法都难以让中医经典理论与现代科学实现深度融合,而直接向通用大语言模型提问又存在对中医理论适配不足、容易产生推理幻觉(AI生成看似合理但缺乏依据的内容)等问题
- 02团队设计了三层协作架构,共11个智能体:首席科学家与招募官负责任务拆解,7名固定核心专家与4名动态招募的专业专家开展多轮协作推理,评论家和报告整合专家负责质量控制与最终成果产出,整个过程遵循独立解读、整合深化、优化提升三轮迭代讨论机制
- 03将框架应用于桂枝汤后,系统把中医经典病机'营卫不和'(营养功能与防御功能失调)与现代神经-免疫-代谢调控网络联系起来,并提出了三项针对长期争议问题的新机制假说
- 04由4个独立大语言模型作为评估者,对5份匿名报告各评分5轮,共完成100次独立评分,结果显示评估者内部一致性(同一评估者重复评分的稳定程度)的ICC值在0.789至0.867之间,评估者之间的一致性达0.868;单因素方差分析显示组间差异极其显著(F=66.969,P<0.001),多智能体组与单一大语言模型组比较也显示出显著差异(U=191.00,P<0.001,效应量r=0.5403),证实DeepTCM1.0整体表现明显优于单一通用大语言模型
- 05雷达图可视化显示,DeepTCM1.0在所有评价维度上都取得了4.8至5.0分的近乎满分成绩,且评分一致性在所有测试模型中最高,同时具备轻量化部署、无需微调、高可复现性等实用优势
他们做了什么
- 以往的数据挖掘、网络药理学、分子对接等方法都难以让中医经典理论与现代科学实现深度融合,而直接向通用大语言模型提问又存在对中医理论适配不足、容易产生推理幻觉(AI生成看似合理但缺乏依据的内容)等问题
- 团队设计了三层协作架构,共11个智能体:首席科学家与招募官负责任务拆解,7名固定核心专家与4名动态招募的专业专家开展多轮协作推理,评论家和报告整合专家负责质量控制与最终成果产出,整个过程遵循独立解读、整合深化、优化提升三轮迭代讨论机制
- 将框架应用于桂枝汤后,系统把中医经典病机'营卫不和'(营养功能与防御功能失调)与现代神经-免疫-代谢调控网络联系起来,并提出了三项针对长期争议问题的新机制假说
- 由4个独立大语言模型作为评估者,对5份匿名报告各评分5轮,共完成100次独立评分,结果显示评估者内部一致性(同一评估者重复评分的稳定程度)的ICC值在0.789至0.867之间,评估者之间的一致性达0.868;单因素方差分析显示组间差异极其显著(F=66.969,P<0.001),多智能体组与单一大语言模型组比较也显示出显著差异(U=191.00,P<0.001,效应量r=0.5403),证实DeepTCM1.0整体表现明显优于单一通用大语言模型
- 雷达图可视化显示,DeepTCM1.0在所有评价维度上都取得了4.8至5.0分的近乎满分成绩,且评分一致性在所有测试模型中最高,同时具备轻量化部署、无需微调、高可复现性等实用优势
为什么重要
这项工作说明,在中医这种既需要处理海量经典文献、又要对接现代生物医学数据的复杂领域,通过角色分工让通用大语言模型协作,无需任何领域专用微调也能产出可靠的分析结果。仅靠提示词工程和专家角色扮演就能降低幻觉、整合跨学科知识,这为其他复杂传统知识体系和跨学科研究提供了一套低成本、可复用的方法范式。
本文术语
- 大语言模型(LLM) · 基于海量文本训练、能够理解并生成自然语言的AI模型,例如GPT、DeepSeek
- 幻觉(hallucination) · AI生成看似合理但缺乏事实依据内容的现象
- 网络药理学 · 通过分析药物成分-靶点蛋白-生物通路之间关系网络来揭示药效机制的研究方法
- 组内相关系数(ICC) · 衡量同一评估者多次评分结果一致程度的统计指标
- 营卫不和 · 中医经典病机概念,指人体防御功能(卫气)与营养滋养功能(营气)之间失去平衡的状态
论文原文摘要(英文)
Background: Mechanistic elucidation of traditional Chinese medicine (TCM) compound formulas remains a central challenge in the modernization of TCM. Conventional approaches, including data mining and network pharmacology, are insufficient for achieving deep integration between classical TCM theory and modern scientific research. In addition, direct question-answering using general-purpose artificial intelligence large language models is limited by inadequate adaptation to TCM theoretical frameworks and susceptibility to reasoning hallucinations. Consequently, there is an urgent need to develop intelligent analytical methods aligned with the holistic principles of TCM. Objective: To establish a multi-expert intelligent agent framework integrating classical TCM theory with modern life sciences, thereby enabling systematic and interpretable mechanistic analysis of TCM compound formulas, with Guizhi Decoction serving as a representative validation case. Methods: The DeepTCM1.0 framework was constructed based on the general-purpose large language model DeepSeek V3.2. It adopts a three-tier collaborative architecture and a three-round iterative quality-control workflow, simulating the collaborative analytical process of 11 interdisciplinary intelligent agents. The framework was applied to the mechanistic interpretation of Guizhi Decoction from the dual perspectives of classical traditional Chinese medicine theory and modern scientific research. Framework performance was comprehensively evaluated through double-blind five-dimensional scoring, intraclass correlation coefficient (ICC) reliability testing, Mann-Whitney U tests, and effect size analysis. The evaluation employed four independent large language models as evaluators, each conducting five rounds of repeated scoring on five anonymized reports, resulting in a total of 100 independent scoring assessments.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调