首页/文章/ 详情

黄芪茎多糖代谢物与DAO结合GROMACS模拟

1天前浏览6

关键词:GROMACS;分子动力学;MM-PBSA;黄芪多糖;分子对接

一、文章简要介绍

黄芪的根是常用中药,茎秆却大量废弃。这篇论文把黄芪茎里的多糖提出来,喂给泌乳中期的奶山羊,看能不能改善抗氧化能力和产奶性能。作者先做提取条件优化,再做60天饲喂试验,然后上血清代谢组学找差异代谢物,最后用分子对接和GROMACS分子动力学验证关键代谢物与靶蛋白的结合。论文发表在Scientific Reports 2026年第16卷12762篇,DOI:10.1038/s41598-026-39922-5。

图1是整个研究的流程。从黄芪茎预处理、热水提取多糖,到奶山羊饲喂、血液和乳样分析,再到代谢组学筛选、对接和动力学验证,一条线走下来。

二、仿真步骤

步骤一:锁定代谢物和靶蛋白。血清代谢组学(UPLC-MS/MS)筛出307个差异代谢物,134个上调、173个下调,富集在甘油磷脂代谢、D-氨基酸代谢等20条通路。挑出6个关键代谢物:LPC(22:3)、L-鸟氨酸、L-色氨酸、咖啡酸、莽草酸和苯乙酰-L-谷氨酰胺,分别对应PLA2G2A、OTC、IDO1、SHMT1、SHMT1和DAO六个靶蛋白。

步骤二:AutoDock Vina对接。靶蛋白结构从PDB取人源同源结构(羊没有晶体结构,用人源做代理):3U8I、1OTH、8ABX、1BJ4、1BJ4、7U9U。配体从PubChem拿SDF,用AutoDock Tools转成PDBQT。对接结果显示六个复合物结合能-4.687到-8.339千卡每摩尔,多数小于等于-5.0。最强的是苯乙酰-L-谷氨酰胺对DAO,-8.339千卡每摩尔,三个氢键撑着(Gly312、Leu316、Thr317)。这个复合物被选去做分子动力学。

图2是六个对接pose。每个代谢物都待在各自靶蛋白的口袋里。苯乙酰-L-谷氨酰胺与DAO的结合最牢,后面所有动力学分析都围绕它展开。

步骤三:GROMACS搭建体系。蛋白用AMBER14SB力场,配体用Antechamber算AM1-BCC电荷、GAFF2原子类型,再经ACPYPE转成GROMACS拓扑,离子参数走Joung-Cheatham。复合物放进截断八面体盒子,蛋白表面到盒边至少1.2纳米,TIP3P水溶剂,补0.15摩尔每升氯化钠。先最陡下降能量最小化,力小于1000千焦每摩尔纳米收敛,再分两段各200皮秒做NVT和NPT平衡,温度298K。

步骤四:100纳秒生产模拟。NPT系综,2飞秒步长,Verlet积分,PME处理长程静电,范德华和库仑截断1.2纳米,氢键用LINCS约束,Nosé-Hoover控温、Parrinello-Rahman控压,298K、1巴。轨迹每10皮秒存一帧,分析用GROMACS自带工具加VMD和PyMOL,结合自由能用gmx_MMPBSA算。

三、关键结果与发现

结果一:复合物很稳。骨架RMSD大约20纳秒后稳定在0.38加减0.05纳米,配体RMSD始终低于0.10纳米,空蛋白稳定在0.25纳米(图3A)。回转半径Rg在2.75纳米附近小幅波动,整体紧凑度没变(图3B)。RMSF显示308到322号残基的环区活动大,最大 波动约0.60纳米(图3C)。配体和结合口袋的质心距离恒定在1.45加减0.03纳米,SASA均值6加减0.5平方纳米,界面稳定(图3D-E)。

图3是MD全程的总览,A到O十五个子图。RMSD收敛、Rg平稳、氢键维持在3个左右、PCA只采样两个主导构象簇,这些信号指向同一个结论:苯乙酰-L-谷氨酰胺在DAO口袋里待得住。

图4把稳定性指标单独放大看。A到E分别是RMSD、回转半径、残基波动、配体距离和溶剂可及面积,从头到尾没有漂移。

结果二:能量上有利。MM-PBSA算出的总结合自由能是负92.051加减0.366千焦每摩尔。拆开看,范德华项贡献最大,负158.225千焦每摩尔,静电项负37.614,非极性溶剂化负17.688,极性溶剂化正121.475抵消掉一部分,熵项正8.288,修正后结合自由能负83.764。范德华主导,疏水作用跟上来,静电帮忙但不占大头(图3G-H)。

结果三:关键残基和氢键网络。残基分解指出Tyr224和Tyr314是两个热点,π-π堆积、T形π-π和π-烷基相互作用挂在Tyr224和Tyr228上,范德华接触涉及Ile230、Tyr314、Thr44。全程氢键数平均3个,具体接触有六个:Gly312、Gly313、Gly315、Leu316、Thr317和Leu51(图3I-J)。静电表面显示结合沟带正电,正好配配体的极性基团(图3L)。自由能景观只有一个深盆地,体系就一个稳定构象(图3M)。

图5是能量和构象部分。H图的MM-PBSA残基分解里,Tyr224和Tyr314的柱子明显高过其他残基,这两个位点是将来做定点突变的候选。

来源:320科技工作室
ACP分子动力学试验PLCGROMACS
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-10-10
最近编辑:1天前
320科技工作室
硕士 | 结构工程师 微❤️ CAE320
获赞 243粉丝 447文章 503课程 0
点赞
收藏
作者推荐

Flexynesis多组学深度学习生信分析

关键词:多组学整合;深度学习;生信分析;Flexynesis;标志物发现一、文章简要介绍这篇Nature Communications文章来自德国柏林马普分子医学中心BIMSB生物信息学平台,2025年发表,DOI:10.1038/s41467-025-63688-5。做的是精准肿瘤里的老难题:怎么把基因组、转录组、甲基化、拷贝数这些不同层次的组学数据揉在一起,训练出一个能预测药效、分型、生存期的模型。文章拿80篇已发表的多组学整合工作做了摸底:29篇没给代码,45篇给的是脚本和笔记本,几乎都不能直接装来用。于是他们干脆做了一个打包好的工具,取名Flexynesis,基于PyTorch Lightning开发,PyPI、Bioconda、Galaxy都能装。图1是整体工作流:多组学表格输入后自动清洗、特征选择,用贝叶斯优化搜超参数,训练多种神经网络,最后用Integrated Gradients算特征重要性,输出每个任务的关键标志物。二、Flexynesis工具与分析方法先说架构。工具内置五种网络:全连接网络DirectPred、带MMD损失的变分自编码器supervised_vae、跨模态编码器CrossModalPred、三元组对比网络MultiTripletNetwork、图神经网络GNN(接STRING蛋白互作网络,支持GraphConv、GCNConv、SAGEConv三种卷积)。数据融合支持早融合和中间融合两种。再说流程。数据进来先做质控:缺失值插补、低方差特征剔除。特征选择用拉普拉斯评分,每个组学模态单独筛,再剔冗余。超参数用scikit-optimize做贝叶斯序列优化,搜编码维度、学习率、隐藏层大小。评估指标按任务区分:回归看皮尔逊相关和R方,分类看AUC和F1,生存看一致性指数。图2是三类单任务演示。回归:用CCLE细胞系基因表达和拷贝数预测两种靶向药的响应,在GDSC数据上独立验证,预测和实测相关约0.6;分类:预测微卫星不稳定状态,只用表达和甲基化就拿到AUC 0.981;生存:LGG和GBM胶质瘤合并队列训练Cox比例风险头,高风险和低风险组明显分开。三、关键结果与发现第一个结果:多任务能同时学。在1865例转移性乳腺癌METABRIC队列上,同时预测亚型和化疗状态,嵌入空间把两个临床变量都分开了,比单独训练效果好。胶质瘤上用年龄、组织学诊断、生存三个头同时训,嵌入里能看出年龄越大风险越高、且多是胶质母细胞瘤;三个任务筛出的标志物重叠在IDH1、ATRX、PIK3CA、EGFR这些已知基因上。图3是METABRIC嵌入的对比:上面两个图是单任务模型,只能分开一个变量;下面是多任务模型,亚型和化疗状态两个变量同时分开。图4是无监督玩法:不加任何标签,用VAE-MMD把TCGA的21种癌、1600个样本压缩成嵌入,k-means自动分群,得到的聚类和真实癌型高度吻合,调整互信息0.78。第二个结果:跨模态翻译。用DepMap数据做基因必需性预测:每个基因用三组特征表示,细胞系表达谱、ProtTrans蛋白语言模型的序列嵌入、DescribePROT蛋白功能特征。输入基因表达去重建CRISPR敲除必需性分数,1064个细胞系的预测相关度明显提升,蛋白语言模型嵌入贡献最大,光加DescribePROT没有额外收益。图5左上是跨模态架构示意,右边小提琴图对比三种输入组合的预测相关度,加了蛋白序列嵌入那组明显上移。第三个结果:微调救活跨分布预测。用TCGA肿瘤组织训练的模型直接去预测CCLE细胞系癌型,F1只有0.16,几乎瞎猜;拿50个细胞系样本微调后,深度学习模型F1拉到0.8,传统方法没法微调只能干瞪眼。数据分布接近时微调收益不大,分布偏移大时是质变。图6上面是分布接近的场景(CCLE到GDSC),微调没什么差别;下面是分布偏移的场景(肿瘤组织到细胞系),微调后分数直接翻五倍。第四个结果:标志物能对上临床库。预测八种已知靶点药物的响应,每个药取前十特征,八种里有六种找到了CIViC数据库收录的已知标志物,比如厄洛替尼的EGFR、紫杉醇的ERBB2。另外所有表现最好的模型都包含RNA表达层,单用突变信息效果最差,这和业内经验一致。图7上半是每种药最优模型的皮尔逊相关,下半是按数据层着色的top10标志物,标着Known Target的柱子就是CIViC验证过的已知靶点。作者也说了,这套工具没有发明新算法,价值在于把数据清洗、特征选择、超参搜索、训练评估、标志物发现串成一条标准化流水线,让不熟悉深度学习的临床研究者也能上手。来源:320科技工作室

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈