TAPAS通过TabPFN融合AlphaFold3置信度指标、结构几何特征和ESM-2序列嵌入,在多个评估设置下实现比任何单一零样本指标更稳健的TCR-pMHC结合预测。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @BiologyAIDailyTAPAS:学习整合AlphaFold3置信度与几何特征,用于TCR-pMHC结合预测 1. TAPAS针对基于结构的TCR-pMHC预测中一个实际问题:AlphaFold3各项"零样本"置信度指标(ipTM、pDockQ2、iPAE衍生置信度、pLDDT)各有信息量,但在不同数据集上没有哪一项始终表现最优,导致在新基准上选择指标缺乏可靠性。 2. 该方法将TCR-pMHC结合预测重新表述为表格分类问题,使用TabPFN(一种用于表格数据的Transformer基础模型)整合互补信号,无需任务特定的梯度训练或超参数调优,旨在跨评估设置下实现稳健性能。 3. TAPAS特征由三组构成:(a)AlphaFold3界面置信度(4个特征:iPAE置信度和pDockQ2,分别在TCR侧和pMHC侧界面计算);(b)结构几何特征(11个特征:肽链–CDR3接触计数/比例、pLDDT ≥ 70且PAE ≤ 10 Å的"高置信接触"、质心距离,以及TCR相对于pMHC的朝向);(c)序列嵌入(288个经PCA降维的ESM-2特征,来源于肽链和六条CDR环)。 4. 数据设计强调泛化能力:从VDJdb人类配对αβ/HLA-I中筛选出2,149个跨207种肽链的配对,采用5折交叉验证,分别在(i)随机划分和(ii)严格划分(测试肽链在训练中未见过)两种设置下评估;阴性样本通过肽链–TCR重新配对生成,并施加肽链差异约束(Levenshtein距离 > 3),以降低阴性采样偏差。 5. 在VDJdb随机划分上,TAPAS达到macro-AUC@0.1 = 0.8985,优于最佳零样本指标(TCR-pMHC ipTM,0.8393)和序列基线方法(TSpred 0.8311,NetTCR-2.2 0.8174);与最佳零样本指标的配对提升为+0.0592,肽链级bootstrap置信区间不含0(p<0.001)。 6. 在VDJdb严格划分(未见肽链)上,TAPAS达到macro-AUC@0.1 = 0.8425,与最佳零样本指标(iPAE置信度,0.8371)基本持平。纯序列模型性能大幅下降(均约0.717),而AF3衍生指标相对稳健——这表明结构置信度携带着可在不同肽链间迁移的信号。 7. 外部基准1(ePytope-TCR病毒表位;去除与VDJdb重叠后:445条TCR,8个pMHC,3,560对)显示TAPAS集成模型macro-AUC@0.1 = 0.5618,与最强零样本指标(ipTM,0.5585)数值接近,而序列基线方法接近随机水平(约0.50)。 8. 外部基准2(IMMREP25未见病毒肽链;20种肽链,10,000对)显示TAPAS集成模型macro-AUC@0.1 = 0.5847,超过最佳零样本指标(pDockQ2,0.5740),具有较小但有统计支持的提升(Δ=+0.0107;p=0.047)。在应用IMMREP25风格归一化加TCRdist聚类平滑后,TAPAS仍保持最优(macro-AUC@0.1提升至0.6020)。 9. 消融实验阐明了各信号的适用场景:在随机划分上,仅ESM-2组是最强的单一特征组(0.8634);但在严格划分上,仅ESM-2组性能骤降(0.7246),而仅置信度组(0.7755)和仅几何组(0.7736)更为稳定;三组全部结合总体表现最佳(严格划分0.8425),表明在肽链分布偏移的情况下,特征整合尤为关键。 10. 解释性与计算成本:对仅含结构特征的子模型进行SHAP分析表明,pDockQ2界面得分在结构特征中占据主导地位(pMHC侧pDockQ2在各设置中均排名第一),其次是iPAE,而几何特征的贡献较小且不稳定。计算性能分析显示,AF3推断耗时最长(约780秒/对),远超特征提取(约12秒/对)和TabPFN集成推断(总计约151秒),结构生成是主要的计算瓶颈。 💻代码:https://t.co/gVwqt2Aq53 📜论文:https://t.co/Ti2ZPgU6Ec #TCR #Immunology #ComputationalBiology #AlphaFold3 #ProteinStructure #MachineLearning #TabPFN #ESM2 #Bioinformatics #TCellReceptor