机器学习算法在中药活性成分筛选中的应用 引言 中药作为复杂的化学体系,其活性成分筛选长期面临成分多样性高、作用机制不明等挑战。因此,构建高效、系统的活性成分筛选方法,尤其是高通量筛选技术,对于克服传统方法的局限、深入解析中药复杂体系至关重要。近年来,机器学习算法技术的介入为中药现代化研究提供了新范式。机器学习(machine learning,ML)算法展现出强大的应用潜力。ML致力于构建能够通过经验自动改进的计算机系统,凭借其强大的高通量数据处理能力、卓越的复杂模式识别与预测优势,能够通过多模态数据融合(如舌象、脉象)构建中医辨证逻辑,结合疗效反馈优化模型,实现“同病异治”的个性化分析,进一步借助知识图谱可解析方剂中药物间的“君臣佐使”结构关系,或通过人工智能系统模拟药物协同机制,辅助药物筛选与配伍优化,实现传统诊疗逻辑的数字化建模与复现。 上海中医药大学王天明团队系统梳理机器学习算法的分类并探讨其在中药活性成分筛选中的应用场景、技术挑战与优化策略。原文已发表于《上海中医药杂志》2026年第2期人工智能与中医药前沿研究专栏。 1 中药活性成分筛选的研究进展 近年来,对于生物色谱法、亲和超滤筛选法和计算机网络虚拟筛选等新技术在中药活性成分筛选的应用研究愈加广泛和深入。 1.1 生物色谱法 生物色谱法以生物活性材料作为固定相,通过色谱参数定量表征药物与生物大分子、靶体或细胞间的相互作用,从而模拟药物在体内的活性表达过程。该方法无需预先分离样品,兼具药理学相关性与结合特异性。例如,何丽君等采用人脐静脉内皮细胞(HUVEC)生物色谱模型筛选心叶淫羊藿乙酸乙酯提取物,通过比对色谱图谱识别潜在心血管活性成分,并借助多种分离技术最终获得7个单体化合物。然而,该技术仍存在固定相制备成本高、柱寿命短、商品化难度大以及难以模拟体内复杂代谢环境等局限,可能导致活性成分筛选不全。 1.2 亲和超滤筛选法 亲和超滤筛选法基于配体与受体间的特异性结合,借助超滤装置实现活性小分子的快速筛选,并结合液相色谱-质谱联用(LC?MS)完成结构鉴定,具有筛选与鉴定一体化的特点,尤其适用于复杂体系中活性成分的发现。黄晨存等以凝血酶为靶标,采用亲和超滤-质谱技术对赤芍不同极性部位进行逆靶向筛选,成功识别出鞣花酸作为潜在抗凝血成分;随后的分子对接结果进一步证实其与凝血酶活性位点具有较高亲和力。 1.3 计算机网络虚拟筛选 计算机网络虚拟筛选技术借助数学算法与计算机建模、数据库构建及搜索能力,实现对中药药效物质基础的高通量研究。该技术通过整合前期研究成果,构建涵盖中药化学成分、药理作用及临床功效的专题数据库,并持续引入系统生物学等多学科进展,不断拓展与完善数据资源。在此基础上,虚拟筛选能够系统探究中药的药效物质基础、药性理论及作用机制,不仅推动中药知识的数字化与系统化整合,也为活性成分筛选与药效机制解析提供了高效、集成的信息分析平台。 2 ML算法类型与选择 2.1 监督学习算法 监督学习算法利用带标签的训练数据集,学习从输入特征到目标输出的映射关系,以构建预测模型,并对未知样本进行精准预测或分类。监督学习算法可通过已知活性数据训练模型,实现对化合物生物活性的高效预测,在中药靶向筛选中具有高精度优势,因而被广泛应用于虚拟筛选、药物-靶点相互作用预测及药物反应建模等领域。其应用于中药活性成分筛选的一般流程如图1所示。典型的监督学习算法包括支持向量机(SVM)、随机森林(RF)与XGBoost等。 图1 监督学习算法和深度学习算法筛选中药活性成分一般流程 注: AUC为曲线下面积,R2为决定系数,RMSE为均方根误差。 2.1.1 SVM SVM是一种基于统计学习理论的监督学习算法,其核心思想是在特征空间中构造一个具有最大间隔的最优分类超平面,以实现不同类别样本的最大化分离。针对非线性分类问题,SVM通过引入核函数将原始数据映射到高维特征空间,从而在该空间中实现线性划分。SVM具有良好的泛化能力,该方法在小样本、非线性及高维数据处理中表现出优异的泛化能力,在药物活性成分筛选等领域得到广泛应用。 2.1.2 决策树 决策树通过树状结构递归划分特征空间,以根节点起始、内部节点做特征判断、叶节点输出分类或回归结果。其核心是依据信息增益等指标选择最优特征,构建直观可解释的决策路径,但易过拟合,需剪枝优化。为解决单一决策树容易过拟合的弱点,集成学习算法应运而生,如RF、XGBoost。 2.1.3 RF RF是一种集成学习算法,通过构建多棵决策树并集成其预测结果以提升模型性能与稳定性。该算法在每棵树的生成过程中采用双重随机策略:从原始数据集中进行有放回抽样,并在节点分裂时仅随机选取部分特征进行评价。这种机制使RF能够有效抑制过拟合,同时具备处理高维数据与缺失值的能力。RF可用于对大量化学成分进行分类,识别具有潜在活性的候选分子。 2.1.4 XGBoost XGBoost是一种高效的梯度提升集成学习算法,其通过迭代式构建多棵决策树以持续提升模型预测性能。在每一轮迭代中,该算法基于前一棵树的预测残差,通过优化可微目标函数来训练新树,从而逐步降低模型误差、提高预测精度。 2.1.5 浅层神经网络 浅层神经网络是仅包含一个输入层、一个输出层和一个隐藏层的人工神经网络,是深度学习的基础结构。它通过模拟人脑神经元的连接方式,实现对非线性数据的拟合和特征提取,其中前馈神经网络(FNN)是最基础也是应用最广泛的网络结构,可用于虚拟筛选、靶点预测和药物反应预测。 2.2 无监督学习算法 无监督学习算法通过对无标签数据集进行内在结构挖掘,实现模式识别与关联发现,尤其适用于从复杂数据中提取潜在信息。该技术在中药活性成分筛选中的一般流程如图2所示。其主要方法包括聚类分析与降维分析两大类。 图2 无监督学习算法筛选中药活性成分一般流程 注: DBSCAN为基于密度的噪声应用空间聚类。 2.2.1 聚类算法 聚类算法通过度量数据点间的相似性,将数据集划分为若干具有内部同质性的群组。常用算法包括K均值、分层聚类、基于密度的噪声应用空间聚类(DBSCAN)以及模糊聚类等方法。 2.2.2 降纬算法 降维算法旨在将高维数据投影至低维空间,在保留关键结构信息的同时简化数据复杂性。主成分分析(PCA)和因子分析等方法已广泛应用于分子模拟及物理化学领域,可用于解析中药多靶点作用的分子网络机制以及区分化合物的成药潜力。 2.3 强化学习算法 强化学习算法的核心思想是智能体通过与环境进行持续交互,根据环境反馈的奖励信号来学习最优策略,以达成长期累积奖励最大化的目标。强化学习与深度学习、大语言模型等先进技术结合,已在药物发现的多个环节取得突破性进展,为中医药的现代化研究提供了全新的技术工具。 2.4 深度学习算法 深度学习算法基于多层神经网络结构,能够自动提取数据中的多层次抽象特征,在虚拟筛选及中药多组学数据整合与机制解析方面展现出显著优势。主动深度学习能够用有限的数据进行高效筛选,与传统方法相比,命中发现率提高了6倍。该技术应用于中药活性成分筛选的一般流程如图1所示。 2.4.1 卷积神经网络(CNN) CNN通过卷积层提取局部特征,擅长处理网格结构数据。CNN已成为药物筛选和发现的强大工具,可以处理复杂的分子和生物数据,从而能够更快、更准确地识别潜在候选药物、预测药物反应以及评估药物相互作用。 2.4.2 循环神经网络(RNN) RNN通常具有长短期记忆(LSTM)单元,可用于通过从现有化学数据库中学习来生成新型类药物化合物、预测药物靶标结合亲和力、高精度预测药物不良反应。 2.4.3 图神经网络(GNN) GNN处理图结构数据(如分子键连接、社交网络),可直接建模节点与边的关系。其常用于预测分子特性、结合亲和力和药物靶点相互作用、从头药物设计、药物筛选。 2.4.4 大语言模型 大语言模型是深度学习领域在自然语言处理方向的核心技术成果,指通过数百亿至数千亿级参数的深度神经网络构建,依托海量文本数据训练,具备自然语言理解、生成与推理能力的先进模型,已成为推动人工智能产业化应用的关键技术之一。以ChatGPT为代表的大语言模型正迅速变革着药物发现的传统流程。例如,ConPLex模型凭蛋白质序列和SMILES字符串,无需依赖复杂的三维结构计算,就能快速预测药物与靶标的相互作用。 2.5 算法的选择 算法的选择应紧密围绕研究目标、数据特征和可用计算资源来决定。首先,要明确研究任务类型,包括:分类任务,即预测一个类别标签(是否为活性成分);回归任务,即预测一个连续数值(半数抑制浓度得分);聚类任务,即在无标签数据中发现内在的群组结构。在确定任务类型后,根据数据规模与特征进行初选,对于样本数<10>10 000的大规模数据集,深度学习算法能够自动学习复杂的特征表示,潜力巨大。接着尝试上述提到的主流算法,利用交叉验证和网格搜索对其进行优化。在实践中,将多个表现良好的模型进行集成(如投票法、堆叠法),往往能获得比单一模型更准确的预测结果。 3 资源与工具 3.1 中药系统药理学数据库与分析平台(TCMSP) TCMSP(https://tcmsp-e.com)是目前应用最广泛的中药数据库之一,收录了中药化学成分、药物靶点、药代动力学参数(如口服生物利用度、药物相似性)等信息,为构建“成分-靶点-疾病”网络提供核心数据。在ML工作流中,其核心作用是为网络分析和特征构建提供化合物、靶点基础数据,是提取中药特异性特征的关键起点,可为后续模型训练提供高质量的基础关联数据支撑。 3.2 中药综合数据库(TCMID) TCMID( http://www.megabionet.org/ tcmid/)侧重于中药的现代化与标准化研究,整合了中药、成分、靶点、疾病等相关信息,可将现代药理学和生物医学体系联系在一起,常作为TCMSP的补充,用于交叉验证和扩充“成分-靶点-疾病-证候”关联网络,增强网络构建的覆盖度和可靠性。 3.3 本草组鉴(HERB) HERB(http://herb.ac.cn/)为集成了高通量实验数据和文献挖掘数据的中药数据库,提供了中药、活性成分、基因靶点、疾病等关键信息,数据全面,尤其适合进行深入的机制挖掘。其可为ML模型提供更丰富的标注数据和关系网络,支撑复杂的多任务学习与预测。 3.4 RDKit RDKit是一个开源的化学信息学工具包,可用于分子的读写、2D/3D结构处理、分子指纹和描述符计算、化合物相似性搜索及亚结构分析等,是进行分子特征提取和预处理的强大工具。在ML工作流中,RDKit是连接中药化学成分与ML模型的关键桥梁,其核心作用聚焦于分子表征环节,可将中药化学成分转化为ML模型可识别的数字特征(如拓扑指纹、物理化学描述符等),实现化学成分的量化表达,为后续模型训练提供标准化的输入特征。 3.5 DeepChem DeepChem(https://deepchem.io/)是一个专注于深度学习在药物发现、材料科学和量子化学领域应用的开源工具库。它内置了MoleculeNet基准数据集,包含多个已标注的分子性质数据集,方便模型训练与比较。其核心作用是为中药成分提供先进的分子表征方法(如GNN表示),并集成多种深度学习模型,直接支持化合物性质预测、活性分类等端到端的ML建模任务。 3.6 Cytoscape Cytoscape(https://cytoscape.org)是一款开源的网络可视化与分析工具,支持复杂网络的构建、拓扑结构分析、模块划分及可视化展示。在ML工作流中,可对TCMSP、TCMID、HERB等数据库构建的“成分-靶点-疾病-证候”网络进行结构优化与特征提取,如计算节点度、中介中心性、聚类系数等拓扑特征,这些特征可作为补充输入融入ML模型,帮助模型捕捉网络层面的关联规律,提升模型对中药多成分协同作用机制的解析能力。 3.7 NetworkX NetworkX(https://networkx.org)是Python语言的网络分析工具库,专注于复杂网络的数学建模与算法实现。在ML工作流中,可实现多源中医药数据(如成分-靶点数据、靶点-疾病数据、证候-功效数据)的整合与结构化处理,通过编程化方式高效构建和分析“成分-靶点-疾病-证候”网络,其输出的标准化网络数据可直接对接后续ML模型的特征处理流程,尤其适用于大规模中医药网络数据的自动化分析场景。 3.8 Neo4j Neo4j(https://neo4j.com)是基于图数据库的知识图谱构建与查询工具,具备高效的关联数据存储与复杂关系查询能力。在ML工作流中,可将分散的中医药多源数据(中药、成分、靶点、疾病、证候、功效等)整合构建为标准化的中医药知识图谱,通过图谱的语义关联推理功能挖掘潜在的“成分-靶点-疾病-证候”关联关系,为ML模型提供额外的特征信息和数据标注依据,同时可支撑模型预测结果的可解释性分析,实现“数据-模型-推理”的闭环。 4 ML算法在中药活性成分筛选中的应用 4.1 基于配体的活性预测 基于配体的活性预测本质上是定量构效关系(QSAR)研究的延伸,其核心理论基础在于:分子的理化性质和结构特征与其生物活性之间存在内在联系。通过ML算法这种关联模式,能够实现对未知化合物活性的有效预测。王曦廷等采用梯度提升决策树(GBDT)与逻辑回归相结合的集成策略,以分子指纹作为特征描述符,构建了用于抗纤维化中药成分的虚拟筛选模型,经验证该模型对姜黄素、甘草酸等已知活性化合物的预测结果,与后续分子对接实验高度一致,证实了该计算模型可有效替代部分传统的实验筛选流程,提升早期药物发现的效率。Yang等采用4种单分类器(包括AdaBoost、K最邻近法、分类树和RF)结合分子指纹描述符,构建了堆叠朴素贝叶斯(s-NB)模型,并借助虚拟筛选与细胞实验验证,发现两种化合物可同时抑制过氧化氢和连二亚硫酸钠诱导的神经毒性,该研究证实了ML在预测中药神经保护活性成分及阐释其配伍机制方面的有效性。Xiong等提出了一种融合深度玻尔兹曼机(DBM)与偏最小二乘法(PLS)的新型分析模型,该模型首先利用DBM从特征空间中提取非线性特征,再将这些特征输入PLS进行多元线性回归分析,通过在麻杏石甘汤实验数据上的评估,该方法的预测准确率较现有主流方法平均提升了10%。Huang等以转录因子叉头框蛋白O1(FoxO1)为靶点,采用朴素贝叶斯(NB)、RF及SVM等ML算法,结合MACCS分子指纹与电拓扑状态指数作为特征,从甘草提取物中筛选得到FoxO1抑制剂欧甘草素B;随后,通过同位素标记实验、免疫染色及荧光素酶报告基因检测等多种体内外药理学实验,进一步验证了该化合物的生物活性,从而强化了模型预测的可靠性。 4.2 多模态数据融合策略 中药活性成分筛选的现代研究正逐步由“单一模态分析”向“多模态融合”的研究范式转变。由于中药成分复杂、作用机制多元,单一维度的数据往往难以全面捕捉其活性特征。跨模态数据融合通过整合化学分析、多组学数据与药理实验等多源信息,借助ML算法的强大学习能力,能够显著提升活性成分筛选的准确性与效率,为中药创新研发提供新的路径。Guo等将无监督学习策略应用于小儿消食片颗粒的研究,探索其对功能性消化不良的多向药理机制,利用基于细胞功能相似性的分层聚类,建立从化学聚类模块到细胞功能的联系,有助于将中药化合物分类为几个具有相似治疗功能的模块,以研究中药的多药理作用。Zhao等开发了条形图指纹(BFD)结合谱效关系分析技术,以栀子根为模型,通过灰色关联分析(GRA)、偏最小二乘回归(PLSR)和高分辨峰分馏(HRPF)策略,筛选出8种护肝关键质量标志物(Q-markers),为中药现代化质量控制提供了新方法。Tian等融合LC-MS成分鉴定、斑马鱼抗炎验证及双向门控循环单元-多注意力模型(BiGRU-MAR),筛选出安宫牛黄丸中牛磺胆酸等7种关键成分,构建NIR便携检测体系,预测精度达0.98,实现“分钟级”快速质控。Pan等采用集成学习策略,从化合物的整体拓扑结构、局部化学环境及药效团特征3个层面进行系统性解析,并结合与抗衰老表型相关的特征重要性进行加权整合,构建了具有更强判别能力的分子指纹表征方法,该方法显著提升了分子指纹在抗衰老化合物筛选任务中的表征质量与实用性;基于此,从天然活性化合物、中药成分库及美国食品药品管理局批准药物数据库中筛选出一系列候选分子,并对其中排名最高的6种化合物进行了深入的功能验证,实验结果表明,所有6种化合物在热休克应激条件下均能显著延长模式生物线虫的寿命,其中4种化合物(百里醌、重楼皂苷Ⅵ、美迪松和白花前胡素C)更具备直接延长线虫健康寿命的能力,展现出良好的抗衰老活性。Wang等提出一种TCMCPI模型,通过图卷积网络(GCN)提取化合物的“分子图结构模态”,通过CNN提取靶点的“序列/结构模态”,实现化合物与靶点双实体特征的跨模态融合;进一步模型创新将CPI网络转化为线图,引入“网络拓扑模态”,并借助GAT在学习线图节点特征时,将前述融合后的双实体特征与网络拓扑特征深度结合,形成“实体属性模态+网络结构模态”的多模态协同利用框架,模型的性能优于其他基准方法。 4.3 多技术联合应用 多技术联合应用于ML算法筛选活性药物,核心在于通过不同技术的互补性突破单一方法的局限,实现筛选效率、准确性和范围的多重提升,为药物研发的早期阶段提供更精准、高效指导。其中,网络药理学与ML算法的深度整合,为推进中医药作用机制的深度解析展现出潜力。网络药理学的核心优势在于能够系统阐明药物、靶点与疾病之间复杂的相互作用网络,这与中医药“多组分、多靶点、多通路”的整体调节特征高度契合。结合ML算法在处理海量异构数据和挖掘深层语义关系方面的能力,这种融合策略能够更深入地揭示中医药复杂机制背后的生物学基础,提供更为系统、动态的见解。 Ma等则采用ML方法从血清代谢组学数据中识别差异代谢物,并基于网络药理学构建“成分-靶点-通路-疾病”多维网络,在成分-靶点相互作用预测模型的框架下,他们成功识别出药效成分及其作用靶点,建立了一种高效、准确的中药复方药效物质基础与作用机制解析方法,为阐明中药复方的复杂作用机制奠定了基础。有研究以中药复方白及五味子颗粒为对象,利用ML方法筛选出与疾病相关的差异代谢物及潜在生物标志物;进一步通过构建“化合物-靶点-通路-疾病”多维网络,整合Floyd-Warshall算法识别网络中最短路径,从而定位关键调控节点;同时,采用AdaBoost模型,结合分子指纹特征,对化合物与靶点之间的相互作用进行高效预测;最终,通过分子对接等实验手段对筛选得到的有效成分及其作用靶点进行验证,系统揭示了该复方抗酒精性肝损伤的核心有效成分及可能的作用通路。 为探究百咳宁(BKN)颗粒治疗儿童流感的潜在机制,Gong等首先从TCMSP和中国知网收集其活性成分,并基于PubChem与PharmMapper平台预测其作用靶点,同时,从GSE34205(分析集)与GSE42026(验证集)数据集中识别差异表达基因(DEGs),作为疾病相关靶标用于后续网络药理学分析;通过构建“BKN-成分-靶点”相互作用网络,筛选出BKN靶点与流感DEGs之间的重叠基因,进而构建蛋白质相互作用网络,并进行基因本体数据库功能注释与京都基因和基因组数据库通路富集分析;进一步将BKN相关的DEGs(定义为BKN-RCGs)进行聚类分析与PCA,以评估其分类能力;在此基础上,采用加权基因共表达网络分析(WGCNA)识别与流感表型高度相关的核心模块及枢纽基因;随后,整合RF、LASSO回归与支持向量机-递归特征消除(SVM-RFE)3种ML算法,筛选用于儿童流感诊断的关键标志物,并在外部数据集GSE42026中进行了独立验证;最后,通过分子对接与分子动力学模拟(MDS)评估活性成分与核心靶点之间的结合模式与稳定性。 Zheng等建立了一种整合多组学数据与计算及实验验证的系统性研究策略,以深入解析解毒散根汤(JSD)的抗结直肠癌(CRC)作用机制,首先采用超高效液相色谱-串联质谱(UPLC-MS/MS)技术,从JSD及其在大鼠体内的血浆样本中,共筛选出18种原型成分与8种潜在代谢物;在此基础上,结合网络药理学与ML方法,进一步从中确定了3种最具潜力的生物活性成分;通过RNA-seq技术和生物信息学方法阐明其作用靶点,同时评估了其临床意义;随后,通过分子对接与分子动力学模拟,从计算层面预测了最优的“成分-靶点”相互作用对;表面等离子共振(SPR)与微量热泳动(MST)实验则直接证实了这些成分-靶点存在特异性结合;进一步的分子生物学实验揭示,白藜芦醇可能通过调控相关信号通路诱导CRC细胞凋亡,而金雀异黄素则通过下调β-连环蛋白表达,从而抑制CRC细胞增殖;此研究不仅证实JSD在体外对CRC细胞具有显著的促凋亡作用,更开发并实践了一套从活性成分筛选到靶点机制验证的完整研究框架,为中药复方的现代化机制研究提供了新模式。 5 技术挑战与优化策略 5.1 数据质量和数量问题 高质量、大规模数据是支撑ML算法有效性能的基础。在中药活性成分筛选研究中,数据来源的异质性(实验误差、文献矛盾、数据库滞后)进一步破坏了模型的独立同分布假设,使得模型在跨数据集验证时泛化能力显著下降。此外,与化学药物相比,中药相关数据规模整体有限,尤其缺乏针对特定疾病或靶点的高质量标注数据集,多数研究样本量远未达到ML模型对大规模训练数据的基本要求,这一现状严重制约了ML模型的训练效果与泛化能力,影响预测结果的准确性和可靠性。 为应对上述挑战,未来研究需整合多源数据——包括高通量实验数据、临床观察记录及中医古籍知识等,构建更全面、系统的中药活性成分信息库。同时,应建立严格的数据质量控制体系,涵盖数据清洗、验证与标准化等环节,以提升数据的一致性与可用性。通过多源高质量数据的融合,可为ML模型提供更充分的训练基础,从而显著提升其在中药活性成分筛选中的性能与可靠性。 5.2 特征选择和提取的复杂性 中药活性成分具有复杂的化学结构和多样的物理化学性质,如何从中选取并构建有效特征成为ML应用中的关键挑战。目前常用的分子描述符多达数百种,涵盖二维指纹、三维结构参数及理化性质等多种类型,当前特征选择陷入“盲目堆砌”误区,与目标活性无关的特征仍被保留,严重干扰模型学习。同时,中药成分与生物活性间多呈非线性关系,难以通过简单特征组合实现准确描述。此外,许多与活性相关的关键特征尚未被充分发掘与定义,进一步增加了特征工程的难度。不当的特征选择易导致模型出现过拟合或欠拟合,从而降低预测性能。 针对中药活性成分特征选择和提取的复杂性,需要进一步开发更有效的特征工程方法。结合领域知识和先进的数据分析技术,系统探索能够更准确表征成分-活性关系的特征表达体系。 5.3 模型的可解释性问题 ML模型,特别是深度学习等复杂模型,常被视为“不可解释模型”,其决策逻辑与内在机制往往缺乏透明性。在中药活性成分筛选中,模型的可解释性尤为重要,因为只有明晰模型的预测依据,才能深入理解活性成分的作用机制,进而推动中药研究的深化与药物开发。然而,当前多数ML模型在预测结果的解释方面仍存在明显局限。复杂模型在有限数据条件下易产生“虚假可解释性”——模型通过记忆噪声弥补知识空白,提供看似合理却无生物学基础的解释。常用的事后解释方法[如沙普利加法解释工具(SHAP)、黑箱模型预测结果解释工具(LIME)]仅能描述数学关联,无法建立机制性联系。这一不足制约了该类方法在中药筛选领域的深入应用与推广。 为提升模型的可解释性,需进一步发展可解释ML技术。一方面,应针对现有模型开发解释性工具,如基于特征重要性分析的局部解释模型等,帮助理解模型的决策过程。另一方面,需探索构建具有内在可解释性的ML模型,使其输出能够直接关联中药活性成分的结构与功能特性,从而为研究人员提供更直观、可信的预测分析支持。 5.4 中药复杂体系的特殊性 现有研究仍沿袭“单成分-单靶点”的西药研究范式,无法表征中药多组分协同的本质特征。模型预测在表征中药成分间相互作用方面存在三重局限,即缺乏协同/拮抗效应的数学框架、忽略时空动态过程、未能整合炮制配伍等工艺参数。如何将这些因素纳入ML模型中,也是需要解决的问题。 考虑到中药复杂体系的特殊性,未来需要构建能够更好反映中药活性成分之间相互作用以及中药炮制、配伍等因素影响的ML模型,使模型能够更真实地模拟中药在实际应用中的情况,提高中药活性成分筛选的准确性和有效性,减少能耗,以期为“精准中药”的创新发展提供思路。 6 小结 ML算法在中药活性成分筛选中展现出巨大的潜力,为中药现代化研究提供了有力的技术支持。通过对多种ML算法的应用,能够有效地预测中药活性成分与靶点的相互作用、生物活性,揭示结构特征与活性的关系,以及筛选中药复方中的活性成分。然而,目前在应用过程中仍面临数据质量和数量、特征选择和提取、模型可解释性以及中药复杂体系特殊性等方面的挑战。未来,通过融合多源数据、开发更有效的特征工程方法、提高模型可解释性、构建适应中药复杂体系的模型以及与实验研究的深度结合等措施,有望进一步提升ML算法在中药活性成分筛选中的应用效果,加速中药活性成分的研究和开发,推动中药现代化进程,为人类健康事业做出更大贡献。 基金 国家自然科学基金项目(82404823);上海中医药大学科技发展项目(23KFL043) 【引用本文】 张能仪,李园园,王天明.机器学习算法在中药活性成分筛选中的应用[J].上海中医药杂志,2026,60(2):1-10. ZHANG N Y,LI Y Y,WANG T M.Application of machine learning algorithms in screening of active components in Chinese materia medica[J].Shanghai J Tradit Chin Med,2026,60(2):1-10. 作者:张能仪,李园园,王天明 编辑:黄博韬 排版:徐天 新媒体编辑:徐天 新媒体审校:岳备 【免责声明】 1. 标注“来源”的内容版权归原权利人所有; 2. 原创内容转载须注明来源“”并附链接,禁止篡改/商用,未经允许不得转载; 3. 转载内容二次传播时必须标注原始出处,不得提及本账号为来源,其观点/准确性由原作者负责; 4. 使用互联网素材的,如涉版权异议,请及时联系我们处理。
