首页/文章/ 详情

Flexynesis多组学深度学习生信分析

51分钟前浏览0

关键词:多组学整合;深度学习;生信分析;Flexynesis;标志物发现

一、文章简要介绍

这篇Nature Communications文章来自德国柏林马普分子医学中心BIMSB生物信息学平台,2025年发表,DOI:10.1038/s41467-025-63688-5。做的是精准肿瘤里的老难题:怎么把基因组、转录组、甲基化、拷贝数这些不同层次的组学数据揉在一起,训练出一个能预测药效、分型、生存期的模型。

文章拿80篇已发表的多组学整合工作做了摸底:29篇没给代码,45篇给的是脚本和笔记本,几乎都不能直接装来用。于是他们干脆做了一个打包好的工具,取名Flexynesis,基于PyTorch Lightning开发,PyPI、Bioconda、Galaxy都能装。

图1是整体工作流:多组学表格输入后自动清洗、特征选择,用贝叶斯优化搜超参数,训练多种神经网络,最后用Integrated Gradients算特征重要性,输出每个任务的关键标志物。

二、Flexynesis工具与分析方法

先说架构。工具内置五种网络:全连接网络DirectPred、带MMD损失的变分自编码器supervised_vae、跨模态编码器CrossModalPred、三元组对比网络MultiTripletNetwork、图神经网络GNN(接STRING蛋白互作网络,支持GraphConv、GCNConv、SAGEConv三种卷积)。数据融合支持早融合和中间融合两种。

再说流程。数据进来先做质控:缺失值插补、低方差特征剔除。特征选择用拉普拉斯评分,每个组学模态单独筛,再剔冗余。超参数用scikit-optimize做贝叶斯序列优化,搜编码维度、学习率、隐藏层大小。评估指标按任务区分:回归看皮尔逊相关和R方,分类看AUC和F1,生存看一致性指数。

图2是三类单任务演示。回归:用CCLE细胞系基因表达和拷贝数预测两种靶向药的响应,在GDSC数据上独立验证,预测和实测相关约0.6;分类:预测微卫星不稳定状态,只用表达和甲基化就拿到AUC 0.981;生存:LGG和GBM胶质瘤合并队列训练Cox比例风险头,高风险和低风险组明显分开。

三、关键结果与发现

第一个结果:多任务能同时学。在1865例转移性乳腺癌METABRIC队列上,同时预测亚型和化疗状态,嵌入空间把两个临床变量都分开了,比单独训练效果好。胶质瘤上用年龄、组织学诊断、生存三个头同时训,嵌入里能看出年龄越大风险越高、且多是胶质母细胞瘤;三个任务筛出的标志物重叠在IDH1、ATRX、PIK3CA、EGFR这些已知基因上。

图3是METABRIC嵌入的对比:上面两个图是单任务模型,只能分开一个变量;下面是多任务模型,亚型和化疗状态两个变量同时分开。

图4是无监督玩法:不加任何标签,用VAE-MMD把TCGA的21种癌、1600个样本压缩成嵌入,k-means自动分群,得到的聚类和真实癌型高度吻合,调整互信息0.78。

第二个结果:跨模态翻译。用DepMap数据做基因必需性预测:每个基因用三组特征表示,细胞系表达谱、ProtTrans蛋白语言模型的序列嵌入、DescribePROT蛋白功能特征。输入基因表达去重建CRISPR敲除必需性分数,1064个细胞系的预测相关度明显提升,蛋白语言模型嵌入贡献最大,光加DescribePROT没有额外收益。

图5左上是跨模态架构示意,右边小提琴图对比三种输入组合的预测相关度,加了蛋白序列嵌入那组明显上移。

第三个结果:微调救活跨分布预测。用TCGA肿瘤组织训练的模型直接去预测CCLE细胞系癌型,F1只有0.16,几乎瞎猜;拿50个细胞系样本微调后,深度学习模型F1拉到0.8,传统方法没法微调只能干瞪眼。数据分布接近时微调收益不大,分布偏移大时是质变。

图6上面是分布接近的场景(CCLE到GDSC),微调没什么差别;下面是分布偏移的场景(肿瘤组织到细胞系),微调后分数直接翻五倍。

第四个结果:标志物能对上临床库。预测八种已知靶点药物的响应,每个药取前十特征,八种里有六种找到了CIViC数据库收录的已知标志物,比如厄洛替尼的EGFR、紫杉醇的ERBB2。另外所有表现最好的模型都包含RNA表达层,单用突变信息效果最差,这和业内经验一致。

图7上半是每种药最优模型的皮尔逊相关,下半是按数据层着色的top10标志物,标着Known Target的柱子就是CIViC验证过的已知靶点。

作者也说了,这套工具没有发明新算法,价值在于把数据清洗、特征选择、超参搜索、训练评估、标志物发现串成一条标准化流水线,让不熟悉深度学习的临床研究者也能上手。

来源:320科技工作室
BIMMETA
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-10-09
最近编辑:51分钟前
320科技工作室
硕士 | 结构工程师 微❤️ CAE320
获赞 243粉丝 447文章 500课程 0
点赞
收藏
作者推荐

STAR-CCM+双体船浅水阻力仿真

关键词:STAR-CCM+;浅水阻力;双体船;RANS;网格验证一、文章简要介绍太阳能双体船SolarCat跑在浅水区,阻力会涨多少?这个问题直接关系到航行安全和能耗。克罗地亚萨格勒布大学的Martic等人用STAR-CCM+对SolarCat做了系统的阻力数值评估,发表于Journal of Marine Science and Engineering 2023年11卷。计算基于RANS方程加k-omega SST湍流模型,自由液面用VOF捕捉,浅水工况还启用了网格变形算法。四个水深(无限深、h/T=7.6、4、2)两个航速(4节、5.5节)共七组算例,外加一套完整的网格无关性验证。这篇的工作量很扎实,对做船舶水动力仿真的同行有参考价值。SolarCat是太阳能电动客渡双体船,模型左右对称,仿真只取一半计算域。二、STAR-CCM+仿真设置计算域和边界条件是第一步。双体船左右对称,只建一半域。深水工况:入口和顶部离船1.5倍LPP,出口在船后3倍LPP,底部在船下2.5倍LPP,侧面离对称面2倍LPP。入口、顶部、底部用速度入口,出口用压力出口,对称面设对称边界,船体是无滑移壁面。浅水工况的底部位置按h/T比例放:h/T=7.6、4、2分别对应龙骨线下0.3、0.14、0.05倍LPP,底部也加无滑移壁面,相对速度与船速等值反向。深水工况边界:速度入口、压力出口、对称面、无滑移船体壁面,域尺寸按LPP倍数布置。有限水深工况底部按h/T比例放置并施加无滑移壁面,模拟水底对流动的约束。网格策略上,自由液面区域加密以捕捉Kelvin尾流,两个片体之间以及片体与底部之间也做了局部加密。浅水工况底部有边界层,用棱柱层网格细化。y+按ITTC建议控制:船体用壁面函数,y+落在30到300之间;底部y+控制在1以下,直接解析黏性底层。时间步长按LPP/航速除以系数设定,细、中、粗三档分别是0.01325秒、0.0265秒、0.053秒,速度亚松弛0.7、压力0.4,内迭代5次。船体表面棱柱层网格加自由液面加密,浅水工况底部再叠一层棱柱层。船体y+分布在30到300区间,满足壁面函数的适用条件。验证研究用的是GCI方法,网格加密比取根号2、时间步加密比取2。深水工况总阻力在细网格和细时间步下GCI都低于1%,中网格中时间步低于1.5%;h/T=2浅水工况网格不确定度变大,细网格GCI到3.79%,中网格4.87%,时间步GCI仍在1%上下。下沉量各工况GCI基本都在2%以内。结论是中等网格加中等时间步的配置精度可接受,后续算例统一用这套配置。h/T=2的网格截面,可见底部间隙内网格明显加密。三、关键结果与发现总阻力随水深变浅明显上升。5.5节时,h/T=7.6工况总阻力710.57牛,h/T=4是749.54牛,h/T=2涨到989.51牛,比h/T=7.6高了约40%。4节航速下h/T=2比h/T=7.6高约14.6%。水深变浅对压阻力影响远大于摩擦阻力:5.5节时h/T=4压阻力增13%,h/T=2几乎翻倍;摩擦阻力占比从h/T=4的约70%降到h/T=2的约60%,说明浅水里压阻成分在变大。下沉量方面,h/T=2在5.5节时出现明显的蹲效应,下沉约10厘米,湿表面积随之增加,摩擦阻力也往上走。4节时各水深下沉量都小很多。纵倾角基本不变,浅水对纵倾的影响可以忽略。流场细节上,水深变浅后对称面速度幅值增大,自由液面波型在片体内侧变化明显,纵向波切面的对比能直接看出浅水对兴波的影响。这套仿真流程从建模、网格到验证闭环完整,算例设置和不确定度评估方法可以直接借鉴。水深从7.6缩到2,对称面速度幅值逐渐增大,流动加速更明显。不同水深的纵向波切面直接对比,浅水兴波特性差异一目了然。来源:320科技工作室

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈