Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
一个分子往往有好几种合成路径,让AI一次给出15个答案后表现大幅提升
逆合成预测是指从目标分子倒推出起始原料的过程,现实中一个分子常常存在多种可行方案,但传统的单一答案评测方式却忽略了这种多样性。研究团队提出了Top-K提示法,训练和评测AI语言模型时要求其一次给出15个候选答案,并用约4560万条经过验证的化学反应构建了大规模数据集来训练C3LM模型。结果显示,该模型在一个全新的高难度基准测试中,表现超过了传统的逆合成预测软件。
METAL MEDIA 解读图
一个分子往往有好几种合成路径,让AI一次给出15个答案后表现大幅提升
- 01逆合成分析是从目标分子倒推出可获得的起始原料的过程,天然存在多种合理路径,但传统的单一答案评测协议无法体现这种一对多的特性
- 02研究团队没有像以往那样只要求AI给出一个答案(Top-1),而是采用Top-K提示法,明确要求模型针对每个分子给出15个不同的候选答案,并以此方式训练和评测模型
- 03团队构建了名为CREED-CCV-2+USPTO-XL的超大规模数据集,包含约368万个独特产物分子和约4565万条经过验证的化学反应,用其训练C3LM模型,并进一步用强化学习结合化学合理性评分工具ChemCensor以及新颖性奖励对模型进行微调
- 04在具有挑战性的、包含全新分子的URSA-expert-2026基准测试中,C3LM超过了MHNreact等主流传统逆合成软件以及多款强大的商业AI模型;分析还发现AI模型和传统软件往往找到彼此不重合的反应,提示将二者结合使用可以覆盖更广的化学空间
他们做了什么
- 逆合成分析是从目标分子倒推出可获得的起始原料的过程,天然存在多种合理路径,但传统的单一答案评测协议无法体现这种一对多的特性
- 研究团队没有像以往那样只要求AI给出一个答案(Top-1),而是采用Top-K提示法,明确要求模型针对每个分子给出15个不同的候选答案,并以此方式训练和评测模型
- 团队构建了名为CREED-CCV-2+USPTO-XL的超大规模数据集,包含约368万个独特产物分子和约4565万条经过验证的化学反应,用其训练C3LM模型,并进一步用强化学习结合化学合理性评分工具ChemCensor以及新颖性奖励对模型进行微调
- 在具有挑战性的、包含全新分子的URSA-expert-2026基准测试中,C3LM超过了MHNreact等主流传统逆合成软件以及多款强大的商业AI模型;分析还发现AI模型和传统软件往往找到彼此不重合的反应,提示将二者结合使用可以覆盖更广的化学空间
| Model | URSA-expert-2026 | USPTO-50K-test-mini | ||||||
|---|---|---|---|---|---|---|---|---|
| Max | Av. PT-Top-K CC | Max | Av. PT-Top-K CC | |||||
| @3 | @5 | @10 | @3 | @5 | @10 | |||
| Proprietary Foundation Models | ||||||||
| Grok-4.1 | 1.86 | 1.56 | 1.31 | 0.86 | 3.99 | 2.61 | 2.02 | 1.24 |
| Grok-4.3 | 1.74 | 1.41 | 1.13 | 0.66 | 3.99 | 2.58 | 1.95 | 1.15 |
| Gemini 3.1 Pro | 1.91 | 1.69 | 1.46 | 1.08 | 4.32 | 2.92 | 2.34 | 1.59 |
| GPT 5.4 | 1.19 | 0.78 | 0.55 | 0.29 | 2.34 | 1.43 | 1.02 | 0.55 |
| GPT 5.5 | 1.94 | 1.68 | 1.46 | 1.05 | 4.50 | 3.07 | 2.45 | 1.63 |
| Claude Opus 4.7 | 1.91 | 1.65 | 1.39 | 0.95 | 4.35 | 2.96 | 2.31 | 1.45 |
| Claude Opus 4.8 | 1.89 | 1.62 | 1.34 | 0.85 | 4.35 | 2.95 | 2.30 | 1.44 |
| Open-weight Foundation Models | ||||||||
| Qwen 3.5 | 1.61 | 1.32 | 1.07 | 0.64 | 3.44 | 2.39 | 1.84 | 1.09 |
| Kimi K2.5 | 1.68 | 1.38 | 1.13 | 0.69 | 3.65 | 2.43 | 1.86 | 1.10 |
| GLM-5 | 1.22 | 0.97 | 0.75 | 0.42 | 2.16 | 1.39 | 1.03 | 0.58 |
| Conventional SSRS Models | ||||||||
| LocalRetro | 2.11 | 1.85 | 1.59 | 1.22 | 4.84 | 3.31 | 2.67 | 1.81 |
| GLN | 1.96 | 1.72 | 1.49 | 1.03 | 4.80 | 3.18 | 2.52 | 1.58 |
| MHNreact | 2.05 | 1.84 | 1.62 | 1.28 | 4.86 | 3.30 | 2.68 | 1.90 |
| RetroKNN | 2.10 | 1.84 | 1.60 | 1.22 | 4.85 | 3.33 | 2.68 | 1.82 |
| R-SMILES | 2.08 | 1.83 | 1.56 | 1.11 | 4.85 | 3.36 | 2.67 | 1.75 |
| C3LM, Supervised Fine-Tuning, Top-1 Mode | ||||||||
| C3LM-LFM2-CREED-CCV+USPTO* | 1.62 | 1.06 | 0.72 | 0.38 | 4.12 | 2.10 | 1.36 | 0.70 |
| C3LM, Supervised and Reinforcement Learning Fine-Tuning, Top-K Mode | ||||||||
| C3LM-LFM2-CREED-CCV+USPTO | 1.92 | 1.68 | 1.42 | 0.98 | 4.16 | 2.74 | 2.17 | 1.42 |
| C3LM-LFM2-CREED-CCV-2+USPTO-XL | 2.04 | 1.81 | 1.59 | 1.27 | 4.16 | 2.88 | 2.37 | 1.70 |
| C3LM-LFM2-RFT-CC | 2.08 | 1.88 | 1.65 | 1.29 | 4.16 | 2.92 | 2.41 | 1.73 |
| C3LM-LFM2-RFT-CC-NR | 2.16 | 1.94 | 1.73 | 1.37 | 4.28 | 3.01 | 2.51 | 1.85 |
| Chemical Plausibility and Diversity Frontier of Generated Reactions | ||||||||
| All GP LLMs (17) together | 2.19 | 2.07 | 1.93 | 1.65 | 4.85 | 3.98 | 3.53 | 2.87 |
| All conventional SSRS models (8) together | 2.18 | 1.99 | 1.78 | 1.45 | 4.90 | 3.58 | 3.00 | 2.26 |
| Model Name | Short Name | Training Data | Reward |
|---|---|---|---|
| C3LM, Supervised Fine-Tuning, Top-1 task | |||
| C3LM-LFM2-CREED-CCV+USPTO* | C3LM-1 | TD-1 | – |
| C3LM, Supervised Fine-Tuning, Top-K task | |||
| C3LM-LFM2-CREED-CCV+USPTO | C3LM-2 | TD-1 | – |
| C3LM-LFM2-CREED-CCV-2+USPTO-XL | C3LM-3 | TD-2 | – |
| C3LM, Reinforcement Learning Fine-Tuning, Top-K task | |||
| C3LM-LFM2-RFT-CC | C3LM-4 | TD-2 | ChemCensor |
| C3LM-LFM2-RFT-CC-NR | C3LM-5 | TD-2 | ChemCensor, Novelty |
| Model | URSA-expert-2026 | USPTO-50K-test-mini | ||||||
|---|---|---|---|---|---|---|---|---|
| Max | Av. PT-Top-K CC | Max | Av. PT-Top-K CC | |||||
| @3 | @5 | @10 | @3 | @5 | @10 | |||
| Proprietary Foundation Models | ||||||||
| Grok-4.1 | 1.73 | 1.28 | 0.92 | 0.47 | 4.01 | 2.29 | 1.53 | 0.79 |
| Grok-4.3 | 1.47 | 0.86 | 0.56 | 0.28 | 3.06 | 1.34 | 0.83 | 0.41 |
| Gemini 3.1 Pro | 1.63 | 0.92 | 0.57 | 0.28 | 4.00 | 1.70 | 1.03 | 0.51 |
| GPT 5.1 | 0.73 | 0.34 | 0.21 | 0.11 | 1.37 | 0.63 | 0.38 | 0.19 |
| GPT 5.2 | 0.86 | 0.45 | 0.28 | 0.14 | 2.02 | 0.95 | 0.58 | 0.29 |
| GPT 5.4 | 0.11 | 0.05 | 0.03 | 0.02 | 2.12 | 0.97 | 0.60 | 0.30 |
| GPT 5.5 | 1.52 | 0.96 | 0.63 | 0.32 | 3.90 | 1.89 | 1.18 | 0.59 |
| Claude Sonnet 4.5 | 1.44 | 0.86 | 0.56 | 0.28 | 3.34 | 1.67 | 1.05 | 0.52 |
| Claude Sonnet 4.6 | 1.26 | 0.71 | 0.44 | 0.22 | 3.32 | 1.64 | 1.01 | 0.51 |
| Claude Opus 4.5 | 1.31 | 0.68 | 0.42 | 0.21 | 3.33 | 1.54 | 0.94 | 0.47 |
| Claude Opus 4.6 | 1.36 | 0.84 | 0.53 | 0.26 | 3.63 | 1.81 | 1.12 | 0.56 |
| Claude Opus 4.7 | 1.67 | 1.04 | 0.66 | 0.33 | 3.72 | 1.79 | 1.12 | 0.56 |
| Claude Opus 4.8 | 1.66 | 1.06 | 0.67 | 0.34 | 3.64 | 1.69 | 1.04 | 0.52 |
| Open-weight Foundation Models | ||||||||
| DeepSeek 3.2 | 0.39 | 0.16 | 0.09 | 0.05 | 1.14 | 0.44 | 0.26 | 0.13 |
| Qwen 3.5 | 1.54 | 1.04 | 0.73 | 0.38 | 3.69 | 2.02 | 1.32 | 0.67 |
| Kimi K2.5 | 1.47 | 0.98 | 0.64 | 0.33 | 3.73 | 1.85 | 1.16 | 0.58 |
| GLM-5 | 1.03 | 0.49 | 0.29 | 0.15 | 3.67 | 1.92 | 1.23 | 0.62 |
| LFM2 2.6B | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| Model | Intersection | Unique for Model | Unique for MHNreact | Δ |
|---|---|---|---|---|
| C3LM-LFM2-CREED-CCV-2+USPTO-XL | 5.0 | 6.8 | 6.4 | +0.4 |
| C3LM-LFM2-RFT-CC-NR | 5.0 | 6.7 | 6.4 | +0.3 |
| C3LM-LFM2-RFT-CC | 4.8 | 6.0 | 6.6 | -0.6 |
| C3LM-LFM2-CREED-CCV+USPTO | 3.6 | 4.0 | 7.9 | -3.9 |
| Gemini 3.1 Pro | 5.2 | 3.5 | 6.2 | -2.7 |
| GPT 5.5 | 5.2 | 3.2 | 6.2 | -3.0 |
| Grok-4.1 | 3.9 | 2.7 | 7.5 | -4.8 |
| Claude Opus 4.7 | 4.5 | 2.6 | 6.9 | -4.3 |
| Claude Opus 4.8 | 4.0 | 2.2 | 7.4 | -5.2 |
| Qwen 3.5 | 2.7 | 2.0 | 8.7 | -6.7 |
| Claude Opus 4.6 | 3.0 | 1.9 | 8.5 | -6.6 |
| Grok-4.3 | 3.1 | 1.9 | 8.4 | -6.5 |
| Kimi K2.5 | 3.1 | 1.9 | 8.4 | -6.5 |
| Claude Sonnet 4.5 | 2.3 | 1.9 | 9.1 | -7.2 |
| Claude Opus 4.5 | 2.7 | 1.8 | 8.7 | -6.9 |
| GLM-5 | 2.3 | 1.4 | 9.2 | -7.8 |
| C3LM-LFM2-CREED-CCV+USPTO* | 1.4 | 1.3 | 10.0 | -8.7 |
| GPT 5.4 | 1.0 | 1.1 | 10.5 | -9.4 |
| Claude Sonnet 4.6 | 1.6 | 0.8 | 9.8 | -9.0 |
| GPT 5.2 | 0.3 | 0.6 | 11.1 | -10.5 |
| GPT 5.1 | 0.3 | 0.5 | 11.1 | -10.6 |
| DeepSeek 3.2 | 0.4 | 0.4 | 10.9 | -10.5 |
| Model | URSA-expert-2026 | USPTO-50K-test-mini | ||||||
|---|---|---|---|---|---|---|---|---|
| Max | Av. PT-Top-K CC | Max | Av. PT-Top-K CC | |||||
| @3 | @5 | @10 | @3 | @5 | @10 | |||
| Proprietary Foundation Models | ||||||||
| Grok-4.1 | 2.17 | 1.81 | 1.54 | 1.06 | 4.13 | 2.84 | 2.27 | 1.46 |
| Grok-4.3 | 2.02 | 1.62 | 1.32 | 0.82 | 4.14 | 2.81 | 2.19 | 1.35 |
| Gemini 3.1 Pro | 2.20 | 1.93 | 1.68 | 1.29 | 4.42 | 3.12 | 2.56 | 1.83 |
| GPT 5.1 | 0.69 | 0.40 | 0.27 | 0.14 | 1.41 | 0.79 | 0.54 | 0.28 |
| GPT 5.2 | 0.51 | 0.33 | 0.24 | 0.15 | 1.61 | 0.99 | 0.71 | 0.40 |
| GPT 5.4 | 1.37 | 0.97 | 0.71 | 0.39 | 2.50 | 1.62 | 1.19 | 0.66 |
| GPT 5.5 | 2.28 | 1.94 | 1.68 | 1.27 | 4.60 | 3.26 | 2.68 | 1.86 |
| Claude Sonnet 4.5 | 1.86 | 1.51 | 1.21 | 0.75 | 3.36 | 2.31 | 1.80 | 1.11 |
| Claude Sonnet 4.6 | 1.17 | 0.90 | 0.70 | 0.42 | 3.13 | 2.07 | 1.57 | 0.92 |
| Claude Opus 4.5 | 1.92 | 1.55 | 1.24 | 0.79 | 3.54 | 2.46 | 1.94 | 1.22 |
| Claude Opus 4.6 | 1.95 | 1.59 | 1.29 | 0.83 | 3.96 | 2.77 | 2.19 | 1.37 |
| Claude Opus 4.7 | 2.24 | 1.89 | 1.61 | 1.16 | 4.44 | 3.16 | 2.55 | 1.68 |
| Claude Opus 4.8 | 2.17 | 1.85 | 1.54 | 1.02 | 4.45 | 3.17 | 2.55 | 1.68 |
| Open-weight Foundation Models | ||||||||
| DeepSeek 3.2 | 0.55 | 0.40 | 0.29 | 0.17 | 1.18 | 0.73 | 0.52 | 0.30 |
| Qwen 3.5 | 1.91 | 1.54 | 1.26 | 0.81 | 3.61 | 2.61 | 2.07 | 1.29 |
| Kimi K2.5 | 1.98 | 1.61 | 1.35 | 0.88 | 3.84 | 2.67 | 2.11 | 1.33 |
| GLM-5 | 1.76 | 1.40 | 1.11 | 0.66 | 3.12 | 2.11 | 1.61 | 0.96 |
| Conventional SSRS Models | ||||||||
| LocalRetro | 2.38 | 2.11 | 1.84 | 1.41 | 4.88 | 3.49 | 2.87 | 2.02 |
| GLN | 2.26 | 1.94 | 1.68 | 1.21 | 4.86 | 3.35 | 2.71 | 1.76 |
| MEGAN | 2.34 | 1.95 | 1.61 | 1.09 | 4.85 | 3.34 | 2.67 | 1.72 |
| Chemformer | 2.01 | 1.16 | 0.78 | 0.40 | 4.73 | 1.73 | 1.05 | 0.52 |
| Graph2Edits | 2.38 | 2.05 | 1.73 | 1.22 | 4.86 | 3.18 | 2.46 | 1.55 |
| MHNreact | 2.33 | 2.08 | 1.82 | 1.44 | 4.90 | 3.48 | 2.89 | 2.12 |
| RetroKNN | 2.35 | 2.11 | 1.82 | 1.41 | 4.90 | 3.53 | 2.91 | 2.04 |
| R-SMILES | 2.35 | 2.09 | 1.79 | 1.30 | 4.90 | 3.54 | 2.89 | 1.95 |
| Model | URSA-expert-2026 | USPTO-50K-test-mini | ||||||
|---|---|---|---|---|---|---|---|---|
| Max | Av. PT-Top-K CC | Max | Av. PT-Top-K CC | |||||
| @3 | @5 | @10 | @3 | @5 | @10 | |||
| Proprietary Foundation Models | ||||||||
| Grok-4.1 | 1.90 | 1.59 | 1.33 | 0.88 | 4.04 | 2.71 | 2.13 | 1.33 |
| Grok-4.3 | 1.80 | 1.45 | 1.16 | 0.69 | 4.02 | 2.65 | 2.03 | 1.22 |
| Gemini 3.1 Pro | 1.96 | 1.72 | 1.49 | 1.11 | 4.35 | 2.97 | 2.42 | 1.66 |
| GPT 5.1 | 0.61 | 0.35 | 0.23 | 0.12 | 1.31 | 0.72 | 0.48 | 0.25 |
| GPT 5.2 | 0.43 | 0.28 | 0.20 | 0.12 | 1.53 | 0.92 | 0.65 | 0.36 |
| GPT 5.4 | 1.23 | 0.81 | 0.57 | 0.30 | 2.40 | 1.50 | 1.08 | 0.59 |
| GPT 5.5 | 1.98 | 1.71 | 1.48 | 1.08 | 4.51 | 3.15 | 2.55 | 1.72 |
| Claude Sonnet 4.5 | 1.59 | 1.29 | 1.02 | 0.60 | 3.21 | 2.10 | 1.58 | 0.93 |
| Claude Sonnet 4.6 | 1.04 | 0.79 | 0.61 | 0.35 | 2.98 | 1.92 | 1.42 | 0.81 |
| Claude Opus 4.5 | 1.70 | 1.34 | 1.07 | 0.65 | 3.37 | 2.28 | 1.75 | 1.06 |
| Claude Opus 4.6 | 1.73 | 1.39 | 1.13 | 0.70 | 3.82 | 2.61 | 2.02 | 1.23 |
| Claude Opus 4.7 | 1.95 | 1.68 | 1.42 | 0.97 | 4.37 | 3.04 | 2.40 | 1.53 |
| Claude Opus 4.8 | 1.93 | 1.66 | 1.38 | 0.88 | 4.37 | 3.03 | 2.40 | 1.51 |
| Open-weight Foundation Models | ||||||||
| DeepSeek 3.2 | 0.51 | 0.35 | 0.24 | 0.13 | 0.99 | 0.60 | 0.42 | 0.23 |
| Qwen 3.5 | 1.63 | 1.33 | 1.07 | 0.64 | 3.49 | 2.46 | 1.92 | 1.16 |
| Kimi K2.5 | 1.73 | 1.42 | 1.16 | 0.71 | 3.72 | 2.51 | 1.94 | 1.17 |
| GLM-5 | 1.50 | 1.20 | 0.93 | 0.52 | 2.93 | 1.92 | 1.44 | 0.83 |
| Conventional SSRS Models | ||||||||
| LocalRetro | 2.14 | 1.87 | 1.61 | 1.23 | 4.82 | 3.35 | 2.73 | 1.88 |
| GLN | 1.97 | 1.73 | 1.50 | 1.04 | 4.81 | 3.23 | 2.58 | 1.66 |
| MEGAN | 2.03 | 1.76 | 1.50 | 1.01 | 4.82 | 3.26 | 2.59 | 1.67 |
| Chemformer | 1.77 | 1.02 | 0.68 | 0.35 | 4.70 | 1.73 | 1.05 | 0.53 |
| Graph2Edits | 2.11 | 1.81 | 1.54 | 1.09 | 4.80 | 3.12 | 2.40 | 1.51 |
| MHNreact | 2.08 | 1.86 | 1.63 | 1.28 | 4.84 | 3.34 | 2.75 | 1.98 |
| RetroKNN | 2.13 | 1.86 | 1.62 | 1.23 | 4.84 | 3.37 | 2.75 | 1.90 |
| R-SMILES | 2.10 | 1.87 | 1.64 | 1.24 | 4.87 | 3.51 | 2.86 | 1.95 |
为什么重要
逆合成预测是判断候选药物分子能否在实验室中真正被合成出来的关键筛选步骤,提升AI在这方面的多样性和可靠性有助于减少新药研发早期的试错成本。同时,AI模型与传统软件探索出不同反应空间这一发现,也为未来结合两者、形成互补组合方案提供了实践方向。
本文术语
- 逆合成(Retrosynthesis) · 从目标分子出发倒推出起始原料及合成路径的化学分析方法
- Top-K提示法 · 要求AI一次性生成多个不同候选答案,而不是只给一个答案
- ChemCensor · 用于给生成的化学反应打分、判断其是否化学上合理的评估工具
- GRPO(分组相对策略优化) · 一种强化学习方法,通过比较一组候选答案的相对优劣来训练模型
- SMILES · 一种用文本字符串表示分子结构的化学记法
无法转载的图表
- Figure 1: Comparison of representative top-performing models from each model tier, normalized by metric-specific frontier scores.
- Figure 2: Data-generation pipeline for the CREED-CCV-2+USPTO-XL training set.
- Figure 3: Top-1 → Top-K transition on URSA-expert-2026 (Av. PT-Top-10 CC). Hollow = Top-1 task, filled = Top-K task; line length is the gain Δ=Top-K−Top-1 (right column, sorted).
- Figure 4: Intersection between the reactions predicted for the URSA-expert-2026 benchmark set by each LLM and those predicted by MHNreact. Values on the right (Δ) show the average per-target difference between the number of reactions unique to the LLM and those unique to MHNreact; positive values indicate more LLM-unique reactions. C3LM-2: C3LM-LFM2-CREED-CCV+USPTO; C3LM-3: C3LM-LFM2-CREED-CCV-2+USPTO-XL; C3LM-5: C3LM-LFM2-RFT-CC-NR. See all results in Figure 5.
- Figure 5: Intersection of reactions predicted by LLMs and the conventional SSRS model MHNreact. Values on the right show the difference between the number of reactions unique to the model and those unique to MHNreact (model − MHNreact). C3LM-1: C3LM-LFM2-CREED-CCV+USPTO*; C3LM-2: C3LM-LFM2-CREED-CCV+USPTO; C3LM-3: C3LM-LFM2-CREED-CCV-2+USPTO-XL; C3LM-4: C3LM-LFM2-RFT-CC; C3LM-5: C3LM-LFM2-RFT-CC-NR.
- Figure 6: Intersection of reactions predicted for X404-1768-5005 by C3LM-LFM2-CREED-CCV-2+USPTO-XL and MHNreact.
- Figure 7: Distribution of the number of reactant sets for products from USPTO-50K-test-mini. For each product, all reference reactant sets were retrieved by matching it against USPTO-full.
论文原文摘要(英文)
Single-step retrosynthesis is a central component of computer-aided synthesis planning, yet its intrinsically one-to-many nature is poorly captured by single-answer evaluation and benchmarking protocols. To address this, we introduce Top-K prompting as a robust training and inference paradigm to better capture diverse, plausible reaction predictions. We compile CREED-CCV-2+USPTO-XL, an ultra-large-scale dataset of ~45.6 million verified reactions to train the C3LM (Chemistry Constraint-Consistent Language Model). By integrating fine-tuning with ChemCensor-based and novelty-oriented rewards, our model achieves state-of-the-art performance on the OOD URSA-expert-2026 benchmark. Further analysis of reaction uniqueness shows that LLMs and conventional models explore complementary reaction spaces, motivating ensemble-based retrosynthesis systems. Overall, our results establish Top-K, plausibility-aware training as a practical new direction for robust future LLM-based synthesis planning.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调