周宏远 · 申请作品集
机器学习 · 蛋白校准研究 01 背景与方法 02 校准发现
人源 α-乳白蛋白 · 多二硫键模型缺陷研究

从一个失败的改造位点,
到模型对多二硫键蛋白的系统性盲区

在 iGEM 阶段,干实验为 α-乳白蛋白预测了改造位点(E121K / E121R),但相应的湿实验结果未达预期。该位点紧邻二硫键半胱氨酸 Cys120,这促使我转向一个更基础的问题:ESM2 这类序列模型,是否真的可靠地刻画了这一含四对二硫键的蛋白?本项目即针对这一问题,对模型在该蛋白上的预测进行系统校准。

6–120 · 跨度最大的二硫桥 1 123 6 28 61 73 77 91 111 120 E121K/R 改造位点
图 1 · α-乳白蛋白的四对二硫键;iGEM 改造位点 121 紧邻 Cys120(6–120 二硫桥的一端)
二硫键半胱氨酸 改造位点 / 跨度最大的二硫桥
01 · 背景

起点:一次未达预期的改造

本项目起源于 iGEM 2025。团队对 α-乳白蛋白引入 E121K / E121R 改造;依据团队 wiki 的设计目标,意在该位点引入胰蛋白酶切位点,以提升其经 PepT1 的消化吸收。改造位点由干实验预测,但相应的湿实验结果未达预期。

复盘时我注意到一个被先前忽略的细节:改造位点 121 紧邻 Cys120,而后者是四对二硫键中跨度最大的 6–120 二硫桥的一端。由此产生一个直接的疑问——在动手改造之前,所依赖的模型是否真的可靠地刻画了这个蛋白的二硫键约束?这一点此前并未验证。项目因此从"设计更优的蛋白"转向"先检验模型在该蛋白上的可靠性"。

本项目不含湿实验,不对功能改进作出经实验验证的结论;它要回答的是模型可靠性,而非蛋白性能。本研究承接 01 · 生物 · iGEM 中那次未达预期的 E121K/R 改造。

02 · 研究对象

α-乳白蛋白:多二硫键带来的预测难点

α-乳白蛋白适合用来检验这一问题:它的折叠高度依赖多对二硫键,而长程、成对的共价约束正是纯序列模型容易忽略之处。

结构特征

  • 四对二硫键,半胱氨酸配对 6–120 / 28–111 / 61–77 / 73–91;其中 6–120 为长程末端配对,是序列模型的潜在弱区。
  • 钙结合环,由 D82 / D84 / D87 / D88 / K79 等残基协调钙离子,对稳定性与功能至关重要。
  • 熔球态行为,去钙状态下进入 molten-globule 态,增加了预测难度。
  • 疏水核心,深埋的大体积疏水残基(Trp / Phe / Leu / Ile)应高度保守。

身份与编号

UniProt
P00709(基因 LALBA,人源)
成熟蛋白
UniProt 20–142 = 成熟 1–123
换算
mature_pos = uniprot_pos − 19
主结构
1B9O 链 A(holo,1.15 Å)

本项目统一以成熟编号为基准,每张输出表同时标注 uniprot_posmature_pos,以避免编号歧义。

03 · 方法

用已知的二硫键作为标尺

思路是把该蛋白已知的生物学约束——首先是 8 个参与二硫键的半胱氨酸——作为标尺,检验模型能否召回这些它本应掌握的约束。

具体做法:用 ESM2-650M(masked-marginal)对全序列逐位点打分,再核对它在每个二硫键半胱氨酸上的判断。若模型连已知的二硫键都无法可靠识别,那么它在该蛋白上的其余预测同样不可轻信;在可靠性得到确认之前,我不据此提出改造方案。

→ 这一校准的实测结果(含逐残基 LLR 与数据出处)见 第 2 页 · 校准发现