在 iGEM 阶段,干实验为 α-乳白蛋白预测了改造位点(E121K / E121R),但相应的湿实验结果未达预期。该位点紧邻二硫键半胱氨酸 Cys120,这促使我转向一个更基础的问题:ESM2 这类序列模型,是否真的可靠地刻画了这一含四对二硫键的蛋白?本项目即针对这一问题,对模型在该蛋白上的预测进行系统校准。
本项目起源于 iGEM 2025。团队对 α-乳白蛋白引入 E121K / E121R 改造;依据团队 wiki 的设计目标,意在该位点引入胰蛋白酶切位点,以提升其经 PepT1 的消化吸收。改造位点由干实验预测,但相应的湿实验结果未达预期。
复盘时我注意到一个被先前忽略的细节:改造位点 121 紧邻 Cys120,而后者是四对二硫键中跨度最大的 6–120 二硫桥的一端。由此产生一个直接的疑问——在动手改造之前,所依赖的模型是否真的可靠地刻画了这个蛋白的二硫键约束?这一点此前并未验证。项目因此从"设计更优的蛋白"转向"先检验模型在该蛋白上的可靠性"。
本项目不含湿实验,不对功能改进作出经实验验证的结论;它要回答的是模型可靠性,而非蛋白性能。本研究承接 01 · 生物 · iGEM 中那次未达预期的 E121K/R 改造。
α-乳白蛋白适合用来检验这一问题:它的折叠高度依赖多对二硫键,而长程、成对的共价约束正是纯序列模型容易忽略之处。
本项目统一以成熟编号为基准,每张输出表同时标注 uniprot_pos 与 mature_pos,以避免编号歧义。
思路是把该蛋白已知的生物学约束——首先是 8 个参与二硫键的半胱氨酸——作为标尺,检验模型能否召回这些它本应掌握的约束。
具体做法:用 ESM2-650M(masked-marginal)对全序列逐位点打分,再核对它在每个二硫键半胱氨酸上的判断。若模型连已知的二硫键都无法可靠识别,那么它在该蛋白上的其余预测同样不可轻信;在可靠性得到确认之前,我不据此提出改造方案。
→ 这一校准的实测结果(含逐残基 LLR 与数据出处)见 第 2 页 · 校准发现。