← 返回日报
🌐 机器翻译 · DeepSeek · MIT TR

Closing the data loop in AI-driven drug discovery


在人工智能驱动的药物发现中闭环数据循环

人工智能正以前所未有的速度识别新的治疗靶点。但这种速度也暴露了实验室中的物理瓶颈,以及对更优质数据的需求。

*由 MIT Technology Review Insights 提供* *2026年7月27日* *与 Cytiva 合作*

药物发现是一项高成本、高风险的事业,在一个日益由先发优势定义的市场中,它正承受着越来越大的压力。自20世纪50年代以来,开发新药的成本大约每九年翻一番——这一现象被称为反摩尔定律。如今,将一种新药推向市场平均需要10到15年,成本在10亿到25亿美元之间,失败率高达90%以上。

人工智能已成为制药行业提高成功率、缩短研发周期的最重要赌注。制药公司识别、测试和优化新化合物的速度越快,在后期开发中遭遇代价高昂的失败的风险就越低。

“药物发现的主要成本仍然在临床阶段,因此努力降低风险并提高该阶段的成功率显然大有裨益,”全球生命科学公司 Cytiva 的蛋白质研究策略总监 Paul Belcher 表示。“人工智能是制药公司希望采用的一种方法,它不仅有望节省时间、压缩周期,还能使更高质量的候选药物进入临床。”

人工智能在药物发现中的早期应用显示出潜力,但也凸显了对强大且真实的数据的需求,以及将其与实验室系统集成的必要性。

人工智能为实验室带来效率

人工智能在药物发现中最有前景的早期应用之一是命中识别。这涉及针对疾病相关靶点(如蛋白质)筛选分子实体库,以找到能与之结合的分子。一个成功的命中为研究人员提供了进一步测试和优化的起点,目标是最终开发出可行的药物。

Belcher 观察到从经验性筛选到预测性设计的转变:制药公司不再进行物理筛选库,而是使用人工智能从头设计候选药物,并在投入研发之前预测它们将如何与疾病靶点相互作用。这意味着公司不再受限于物理筛选能力来寻找起点。

“人工智能消除了这种限制,”Belcher 说。“而且它可以帮助你在必须进行物理测试之前淘汰低质量的候选药物,从而节省时间和资源。”

Belcher 表示,人工智能目前还无法可靠地预测新化合物的动力学或可开发性。这意味着每个人工智能生成的候选药物仍然需要在实验室中进行验证。传统的筛选工作流程旨在大规模识别命中,而不是详细分析大量复杂的候选药物。这给实验室团队带来了更大的压力,他们现在必须测试、表征和纯化数量日益增多、种类更加多样的人工智能生成化合物。

“目前用于命中识别的技术,可以使用基于二元或阈值的技术筛选数十万、有时甚至数百万种化合物,产生低保真度的数据——即‘是或否’的响应,”Belcher 解释道。“人工智能可以增加你获得的命中数量,并可能同时提供更高质量的命中。这增加了对更高通量、信息更丰富的技术的需求,以便验证和表征这些命中。”

模型需要完整、高质量的数据

随着人工智能加速了对数据密集型实验室系统的需求,它也凸显了对更好、更完整数据的基本需求。许多早期的人工智能模型是在公开可用的数据集上训练的,现在正触及 Belcher 所说的数据墙。由于模型可以访问相同的数据,它们都会得出相似的结论,随着时间的推移收益递减。此外,这些数据集在构建时并未考虑人工智能,这意味着它们缺乏保持模型准确性和无偏见所需的结构、标签和多样性。

发表偏见加剧了这个问题。“大多数公开可用的数据集和科学出版物只关注阳性结果,”Belcher 说。“没有人愿意分享他们的失败。这种偏见就像被绑住了一只手。人工智能模型可以识别与成功相关的模式,但它们缺乏对失败的全面理解,而这本可以使预测更加可靠。”

Belcher 认为能够显著改进模型的数据——失败的实验、不结合的化合物——仍然难以获得,令人沮丧。“我们经常开玩笑说,应该有一本《阴性数据期刊》,”他说。“这些数据通常被埋藏在实验笔记本中,从未被用来指导或启发未来的研究。”

这种阴性数据的缺乏造成了一个根本性问题:如果没有广泛的数据访问,模型就无法得到充分训练以避免偏见。“在所有机器学习应用中,模型的性能在很大程度上依赖于训练数据的质量和范围,”Belcher 指出。

随着人工智能的出现,数据伪造也变得更加容易,加剧了人们对数据完整性的担忧。以蛋白质印迹法为例。这是识别血液或组织样本中蛋白质的标准技术的一部分,也是生物医学研究中最常见的篡改目标之一。Belcher 引用了荷兰微生物学家 Elisabeth Bik 的研究,该研究发现近4%的生物医学论文包含重复或篡改的图像。这还是在2016年,当时生成式人工智能尚未使伪造变得轻而易举。

“篡改或伪造的数据在科学界一直是个问题,但在人工智能领域,特别是当用于训练模型时,它可能带来潜在的灾难性后果,”Belcher 说。“需要有更多的工具来验证数据没有被篡改。”

一些供应商已经开始应对这一挑战。Belcher 提到了像 Cytiva 的图像完整性检查器这样的解决方案,例如,它使用安全哈希算法...

📖 阅读原文 →