Research Assistant: AstraZeneca's Agentic System for R&D
阿斯利康公开了内部生物医药AI助手的架构,一年内已有超过1.5万名员工使用
阿斯利康团队开发了名为Research Assistant的对话式系统,汇聚文献、知识图谱、化学、临床试验、安全性数据等多种来源,给出带引用来源的答案。系统提供快速单轮回答的Scientific Mode,以及多步规划执行的Deep Research Mode,从小规模试点在一年内扩展到内部1.5万独立用户。这篇论文是一份技术说明,介绍系统架构、设计取舍以及大规模部署中获得的经验,而非传统意义上带有严格基准对比的研究论文。
METAL MEDIA 解读图
Research Assistant处理一次查询的流程
证据状态实测结果与计划中的工作并存
- 用户提问在聊天界面输入生物医学问题后,系统会分流到单轮的Scientific Mode或多步规划的Deep Research Mode。
- 工具智能体选择器自动识别问题中的主题(化学信息、生物学关系、药物安全等),从12个专门智能体中只挑选相关的一部分并行调用。
- 证据收集(Observation)每个被选中的智能体以统一的Observation对象格式返回证据,包含ID、来源URL、支撑数据和引用文本。
- 大模型综合与引用较大的语言模型仅根据检索到的证据撰写答案,并将每条陈述链接回原始来源供用户核查。
- 真实用户反馈循环利用数万条已记录的用户交互以及LLM评判智能体的打分,持续识别哪些数据源或工具智能体需要改进。
他们做了什么
- 系统设有12个专门的'工具智能体',分别覆盖文献检索、生物知识图谱、化合物化学、临床试验、药物安全、基因表达和内部实验数据等主题,相关智能体被并行触发,再由一个较大的语言模型综合各方结果生成最终答案。
- 团队没有让每次查询都调用全部智能体,而是构建了'工具智能体选择器'路由模块,自动识别用户问题中的主题;最初采用向量嵌入匹配示例问题的方案,但维护困难,后改为对数万条真实用户交互做自动主题建模,再将主题映射到对应工具智能体。
- 对于复杂问题,Deep Research Mode会自动生成一个由子问题构成的有向无环图(DAG)研究计划,按拓扑顺序依次执行,并用前一步获得的信息改写后续问题(例如用前面识别出的药物同义词替换)。
- 项目早期在没有真实用户的情况下,团队用BioASQ数据集中100道是非题,计算系统相对GPT-4等'原生'大模型的平衡准确率作为基准;还用基于PrimeKG并映射到阿斯利康内部知识图谱BIKG的STaRK基准,衡量知识图谱工具智能体返回的三元组与预期节点集合的重合度;后期则引入LLM评判智能体对真实用户问答对打分。
- 一个程序化调用的案例是CRAM Auto Tool,它通过REST/MCP接口调用Research Assistant,支持药物安全科学家评估多种药物联用时的风险(Combination Risk Assessment)。

| Agent Name | Use-Case | Topics |
|---|---|---|
| Literature Agent | Scientific literature search, electronic notebooks, patent/conference lookups. | biological relationships, chemistry information, drug safety, general biomedical knowledge, internal experimental data |
| Compound Agent | Compound ID lookups, SMILES resolution, bioactivity, physicochemical properties. | chemistry information, entity synonyms |
| Knowledge Graph Agent | Pairwise entity relationships (gene–disease, compound–target, compound–disease). | biological relationships |
| Clinical Trial Agent | Trial search by drug/condition/status/sponsor; specific NCT lookups, inclusion/exclusion criteria. | clinical endpoints, clinical trials |
| Web Search Agent | Real-time web search; recent organised events and news. | general biomedical knowledge, recent events |
| OFF-X Agent | Drug adverse events and safety alerts by drug name or gene target. | drug safety |
| Discover Agent | Ranked predictions of novel gene–disease–compound associations. | discovery and ranking |
| Mapping Agent | Cross-database ID and synonym mapping for compounds, genes, diseases. | entity synonyms |
| Clinical Endpoints Agent | Clinical efficacy endpoint extraction (OS, PFS, ORR, CR) with LLM-generated summary. | clinical endpoints |
| Human Protein Atlas Agent | Tissue and cell-type gene expression levels (broad patterns or specific TPM/CPM values). | gene expression |
| Glossary Agent | AstraZeneca-specific acronym and abbreviation definitions. | AZ terminology |
| In Vivo Agent | Internal AZ in vivo study data: toxicity studies, animal models, compound testing, dosing. | internal experimental data, preclinical studies |

研究结果
- 开发初期用BioASQ数据集中100道是非题作为基本检查(sanity check),计算系统相对GPT-4等'原生'大模型的平衡准确率。
- 用STaRK基准(将基于PrimeKG的查询映射到阿斯利康内部知识图谱BIKG)计算知识图谱工具智能体返回的三元组与预期节点集合之间的重合统计量,用于监控回归问题。
- 系统从小规模试点在一年内增长到内部1.5万独立用户,目前每月支持数千次交互。
- 按2026年7月Google Cloud Platform的按token计费标准估算,使用Gemini 3 Flash和Gemini 3.1 Pro模型时,每次查询平均成本约为16美分(包含全部输入输出token),典型响应时间为10到30秒。
- 根据用户反馈做出的改进并未在BioASQ问题集上带来分数提升,表明生物医学问答基准与真实用户需求之间存在脱节。

可应用场景
- 在制药或生物科技企业内部搭建能整合文献、知识图谱、化学与临床试验数据、并给出可追溯引用来源的研发问答助手
- 参考CRAM Auto Tool的做法,让其他内部安全或研究工具通过REST/MCP接口以程序化方式调用该助手,支持诸如药物联用风险评估之类的任务
- 将复杂的多步骤研究问题拆解为基于DAG的执行计划,并在后续步骤中复用前面得到的结果(如同义词)
- 设计基于主题识别的路由层,仅按需并行调用相关工具,以控制响应延迟和成本
局限与待验证事项
- 作者指出系统仍存在幻觉问题,以及对生物学细微差别(如高度相似的基因旁系同源物之间的区别)敏感度有限。
- BioASQ和STaRK等基准主要用作开发早期的基本检查和回归监控手段,并非对实际可用性的全面衡量,基于用户反馈的改进也未必能在这些基准上体现出来。
- 网页搜索智能体有时会引用论坛、博客等可信度较低的来源,且Gemini的引用标注有时声称某个事实有网页依据,但仔细核查后发现该网页只是间接提及,需要额外验证。
- 系统与阿斯利康自有的基础设施(BIKG知识图谱、CAG化学网关、内部电子实验记录系统等)深度绑定,其他机构难以直接复制。
- 这篇文章是一份技术说明而非正式研究论文,并未给出与其他同类生产系统的系统性、严格的准确率对比。
为什么重要
这为想要搭建类似企业级研发助手的团队提供了一个已在生产环境大规模运行的参考架构,展示了如何用检索证据为大模型答案提供依据,并给出了一种基于主题的工具路由方案。文中也指出一个实用的经验教训:根据真实用户反馈做出的改进并未反映在标准生物医学问答基准分数上,说明基准测试成绩与实际可用性之间可能存在落差。
本文术语
- 证据基础(Grounding) · 让大模型的回答建立在检索到的真实证据之上,以减少凭空编造的内容
- 知识图谱(Knowledge Graph) · 以节点和边表示基因、疾病、药物等实体及其相互关系的数据库
- 有向无环图(DAG) · 一种存在先后依赖关系但没有循环的图结构,这里用来安排子问题的执行顺序
- GraphRAG · 利用知识图谱检索出的事实为大模型回答提供依据,以减少幻觉的一种方法
- MCP(模型上下文协议) · 让其他AI系统能以标准化方式调用该工具的接口规范
论文原文摘要(英文)
We describe Research Assistant, an internal LLM-based system developed at AstraZeneca to help scientists and clinicians explore biomedical questions across a broad range of data sources. The system provides a chat-style interface that brings together evidence from scientific literature, knowledge graphs, chemistry, clinical trials, safety resources, expression data, and internal experimental systems. It supports both a fast mode for direct question answering and a multi-step mode for more complex research tasks. Responses are grounded in retrieved evidence and linked back to the original sources, allowing users to review and further explore the underlying data. In this technical note, we outline the system architecture, the main design choices behind the product, and lessons learned from deploying it at scale to support day-to-day R&D workflows across AstraZeneca.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Piotr Grabowski et al., arXiv:2608.12395, cc-by-nc-nd-4.0