预测pKa,ACD/Labs凭什么成为行业标杆?

2026-06-11 17:47:37, CHEMICO Advanced Chemistry Development, Inc. (ACD/Labs)


Modern Scientific Laboratory Scene

在药物研发、环境化学和材料科学中,pKa(酸解离常数)是一个绕不开的关键参数。它直接影响药物的溶解性、膜渗透性、蛋白结合亲和力,甚至决定一个候选分子能否成为最终上市的药物。然而,准确测定pKa并非易事——实验方法耗时费力,理论计算又面临精度与成本的权衡。

近日,一篇发表于 《Journal of Computer-Aided Molecular Design》 的综述文章(Baitiké et al., 2026, 40:5)对当前主流pKa预测方法进行了全面评估。

image.png

该文由Juda Baitiké、Alhadji Malloum和Jeanet Conradie三位学者共同撰写,系统梳理了从实验测定到量子化学、再到机器学习方法的完整技术路线,并重点对比了各模型在SAMPL6、SAMPL7、SAMPL8挑战赛及诺华基准测试中的表现。

在众多工具中,ACD/Labs凭借其深厚的数据库积累与稳健的预测性能,始终占据重要一席。今天,我们就结合这篇最新综述,聊聊ACD/Labs在pKa预测上的硬核优势。


1

坐拥"超级数据库":26,000+分子,42,000+ pKa值

综述在表1中系统梳理了当前主要的pKa数据库,ACD/Labs的表现尤为突出:

ACD/pKa DB:超过26,000个分子,42,000+ pKa值,覆盖有机酸、碱、杂环以及分子量高达2000道尔顿的生物分子

相比之下,许多公开数据库规模有限:

· S+pKa:约1,200条
· DrugBank:约8,250条
· OCHEM:约14,000条
· PubChem:约25,000条(但实验条件较为混杂)

ACD/Labs的数据库经过精心整理,涵盖多种溶剂条件(水相及有机溶剂),为模型训练提供了扎实的"燃料"。正如综述所指出的,高质量、标准化的实验数据是提升pKa预测精度的关键前提


ACD/pKa—酸解离常数的预测原理与算法全解析【2025】


2

SAMPL6挑战赛:RMSE仅0.55,力压多款商业软件

SAMPL系列挑战赛是pKa预测领域的"奥林匹克"。综述的表2详细列出了各模型在SAMPL6、SAMPL7、SAMPL8中的表现,ACD/Labs的数据如下:

模型方法SAMPL6 RMSESAMPL6 MAE
ACD/Labs
LFER
0.55
0.78
QupKake
QM+ML
0.44
0.32
Epik 7 Ensemble
Empirical
0.61
0.48
MoKa
QSPR/ML
0.94
0.77
ChemAxon Marvin
MLR
1.00
1.24
COSMOtherm
QM+LEC
0.90
0.71
OPERA
kNN+SVM
0.97
1.28

ACD/Labs的RMSE为0.55,显著优于MoKa(0.94)、ChemAxon Marvin(1.00)、COSMOtherm(0.90)等商业软件,与当时表现最好的模型QupKake(0.44)差距不大。值得注意的是,根据文档内容,QupKake虽然基于GNN与量子化学的混合模型实现了较高的预测精度(在SAMPL挑战赛中RMSE为0.44至1.04),但其主要缺陷在于计算成本高昂、流程复杂且依赖大规模训练数据。QupKake的运行分为互变异构体识别、反应位点确定和微观pKa估计三个阶段,流程比ACD/Labs基于LFER的单一方法复杂得多,且其核心依赖DFT等量子化学计算来提供电子结构信息,而文档明确指出量子化学技术“计算成本仍然高昂,限制了其在大数据集上的应用”,同时基于DFT的方法“计算时间可长达每个分子数小时”;此外,QupKake在147.5万个分子的数据集上进行训练,本身就需要大量的计算资源和时间。相比之下,ACD/Labs的LFER方法“计算速度比量子化学方法快10到100倍”,更适合高通量筛选和快速预测场景,而QupKake追求更高精度付出的代价是计算更耗时、流程更繁琐。



3

方法成熟可靠:LFER + 专有参数化

综述在"经验与半经验方法"一节中明确指出,LFER方法基于Hammett关于取代基效应的研究,通过线性方程将pKa与分子描述符关联起来。ACD/Labs在此基础上,利用其庞大的专有数据库进行了精细的参数化。

ACD/pKa classic算法预测界面展示

LFER的优势在于:

· 物理意义明确:基于经典的电子效应理论,可解释性强
· 计算速度快:综述指出,LFER方法的预测速度比量子化学方法快10到100倍,在药物筛选中"不可或缺"
· 稳定性好:在常见药物骨架和官能团上表现稳定

对于药物研发中的高通量筛选场景,这种快速且可靠的预测远比黑箱模型更受青睐。


告别预测偏差!Percepta自建专属训练库,pKa预测更准更快


4

持续迭代:经典版与GALAS版双线并行

综述还提到,ACD/Labs不仅拥有经典的ACD/pKa classsic预测模块(历史数据约14,000个化合物),还推出了GALAS算法版本,同样具备类似规模的历史数据支持。这种双线策略既保证了老用户的连续性,又通过新版本引入更先进的算法(如全局与局部模型结合),进一步提升了预测精度。

ACD/pKa GALAS算法预测界面展示


5

局限与展望:商业属性与挑战赛覆盖

当然,ACD/Labs并非没有短板。综述的表2显示,ACD/Labs在SAMPL7和SAMPL8挑战中未提供数据(表格中显示为"-"),意味着其在新近挑战中的表现尚未被公开验证。此外,作为商业软件,其访问受限,且对于极端结构或非水溶剂体系,LFER方法的泛化能力可能不如混合模型。

但瑕不掩瑜。综述在"结论"部分明确指出:

"实验方法仍是可靠的参考依据,但它们正日益被更快、成本更低的计算方法所补充甚至超越。每种方法各有优劣,但最大的潜力正蕴藏于它们的结合与融合之中。"

在需要高置信度、可重复、且经过大量实验数据验证的pKa预测场景中,ACD/Labs依然是许多药企和科研机构的"首选武器"

结语

从26,000+分子的数据库,到SAMPL6中0.55的RMSE,ACD/Labs用数据和方法论证明了其在pKa预测领域的深厚功底。在机器学习狂飙突进的时代,经典方法+高质量数据依然能打出漂亮的一拳。

如果你正在为药物分子的pKa预测发愁,不妨试试ACD/Labs——它不会给你最"炫酷"的模型,但一定会给你最"靠谱"的结果。


参考文献

Baitiké J, Malloum A, Conradie J. pKa prediction for small molecules: an overview of experimental, quantum, and machine learning-based approaches. J Comput Aided Mol Des, 2026, 40: 5. DOI: 10.1007/s10822-025-00719-9.


往期推荐


提升PROTACs的pKa预测精度

根据结构准确预测酸解离常数——ACD/pKa

化合物pKa预测的原理、工具与应用

从“可靠”到“精准”:客户合作驱动的pKa预测算法升级

分子属性计算平台——ACD/Percepta

2025PhysChem论坛的热点话题

ACD/Labs pKa®预测算法的增强——基于专有高质量数据集的优化升级



ACD/Labs CN

微信号|ACDLabsCN

长按识别二维码关注我们

联系我们:

阎作伟 13816084932  zuowei.yan@acdlabs.com

陈诚 17705179237  martin.chen@acdlabs.com


  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved