承接第 1 页的问题,这一页给出 ESM2 在 α-乳白蛋白二硫键上的实测结果:模型正确识别了 8 个半胱氨酸中的 7 个,唯独漏掉 Cys120——也就是 iGEM 改造位点紧邻的那个残基。下面所有数字均核验自 esm_dms_matrix.tsv 的 2337 行实测打分。
在 αLA 的 8 个二硫键半胱氨酸中,ESM2-650M(masked-marginal)对 7 个给出强烈的"不可替换"判断(最佳替换的 LLR 显著为负)。
唯一失手:Cys120 —— 模型认为最佳替换是 C→K,LLR = +0.995,即误判该替换为有利,等于没看见这座末端二硫桥。
规律:被漏掉的 Cys120 处于 C 端、属于跨度最大的 6–120 长程二硫桥;模型对近程二硫桥(61–77、73–91)判断稳健。这提示长程 / 末端二硫键是纯序列模型的薄弱区 —— 也正是结构感知模型 M2(ThermoMPNN) 应当补上的地方。
LLR(log-likelihood ratio)越负,表示 ESM 越认为该位置的野生型 Cys 不可替换(召回越强)。Cys120 是唯一为正的位置 —— 模型实际偏好把它换成 Lys。
| mature pos | WT | best substitution | ESM LLR | judgement |
|---|---|---|---|---|
| 6 | C | Y | −6.205 | recalled |
| 28 | C | Y | −8.560 | recalled |
| 61 | C | Y | −7.774 | recalled |
| 73 | C | Y | −7.916 | recalled |
| 77 | C | S | −8.981 | recalled |
| 91 | C | Y | −8.490 | recalled |
| 111 | C | Y | −7.286 | recalled |
| 120 | C | K | +0.995 | MISSED |
ESM 没有结构输入,只能从进化序列模式推断哪里该是 Cys。对大多数二硫键这套先验成立 —— 但对 C 端长程配对 6–120,序列信号不足,模型甚至偏好 C→K。
这正是项目要测的东西:模型的先验在这个蛋白上哪里可信、哪里不可信。
ThermoMPNN 直接看 1B9O 的三维坐标,Cys120–Cys6 的空间邻近与共价约束对它是显式信息。因此 M2 是 M1 的正交验证。
若 M2 在 Cys120 上给出强失稳信号,就证明"换一种模态即可补盲";若 M2 也漏,则盲点更深。两种结果都有价值。
这正是项目所要刻画的那类缺陷:一个可复现、可定位的失效点。它界定了模型在该蛋白上的可信边界——对二硫键,尤其是长程配对,ESM 的判断需要结构信号加以校正,而不宜直接采用。这也回到第 1 页的起点:在依赖模型预测改造位点之前,先确认它是否真的理解了这个蛋白。
二硫键测试之外,整张矩阵还做了野生型恢复率检查,确认打分整体可信。
运行元数据:run_date 2026-06-06 · git 9cff69f · results/m1_esm_zeroshot/run_metadata.json
本页给出的二硫键召回数是 7/8,直接按项目自身 notebook 的判据("某替换 LLR 为正 = 模型没看见该约束")对 esm_dms_matrix.tsv 的 2337 行实测打分重新核算。项目早期的记忆与摘要里曾记为 4/8 等结论,与实测不一致 —— 本页以实测为准,并且未改动任何原始文件。
| 项目 | 早期摘要 / 记忆所记 | 实测矩阵重算(本页采用) |
|---|---|---|
| 二硫键 Cys 召回 | 4 / 8 | 7 / 8 |
| 漏掉的位置 | C6–C120 整对漏掉 | 仅 Cys120(Cys6 实测 LLR=−6.205,强召回) |
| 二硫键配对写法 | …C61–C76 / C73–C90 | C61–C77 / C73–C91(与 known_effects.tsv、源码一致) |
三重互证:源码 DISULFIDE_CYS_POSITIONS=(6,28,61,73,77,91,111,120) · notebook 判据 · 2337 行实测 LLR。所有对外数字均以此实测为准。