mirror of
https://github.com/RYDE-WORK/lnp_ml.git
synced 2026-07-21 21:22:05 +08:00
2.3 KiB
2.3 KiB
LLM 编码器分支 — 实验结果
LNP 多任务预测模型在引入不同 LLM 分子编码器(V5 token)后的测试集表现。
所有实验:LNPModelWithoutMPNN(无 MPNN、无 MoE),固定 seed=42,先在外部数据上预训练 delivery,再用 Optuna 做 3-fold 调参 + 全量训练。
总览对比
| 任务 | 指标 | Baseline (无 LLM) | MolT5 | MoleculeSTM | BioT5-plus | SELFIES-TED |
|---|---|---|---|---|---|---|
| delivery | R² | 0.373 | 0.602 | 0.552 | 0.633 | 0.618 |
| size | R² | 0.215 | 0.440 | 0.408 | 0.423 | 0.381 |
| pdi | acc | 0.786 | 0.748 | 0.710 | 0.695 | 0.664 |
| ee | acc | 0.679 | 0.702 | 0.679 | 0.679 | 0.679 |
| toxic | acc | 0.980 | 0.980 | 0.951 | 0.960 | 0.941 |
| biodist | KL↓ | 0.293 | 0.727 | 0.646 | 0.703 | 0.643 |
(粗体为该行最优;KL 越低越好,其余越高越好。)
模型信息
| llm_type | 模型 | 年份 | 参数量 | hidden | 输入表示 |
|---|---|---|---|---|---|
| biot5 | BioT5-plus | 2024 | ~250M | 768 | SMILES |
| molt5 | MolT5-base | 2022 | 109M | 768 | SMILES |
| moleculestm | MoleculeSTM GNN | 2023 | ~2M (GNN) | 300 | 分子图 |
| selfiested | SELFIES-TED | 2025 | 358M | 1024 | SELFIES |
主要结论
-
四个 LLM 编码器都显著提升核心回归任务:delivery R² 从 baseline 的 0.373 最高提升到 0.633(BioT5-plus),size R² 也从 0.215 提升到 0.38–0.44。
-
领域专用预训练 > 堆参数:BioT5-plus(针对生物分子预训练)效果最好;参数最大、最新的 SELFIES-TED(358M)仅排第二,说明针对生物分子的预训练比单纯扩大规模更有效。
-
序列模型 > 图模型:三个基于序列(SMILES/SELFIES)的语言模型都优于基于图的 MoleculeSTM GNN。
-
MolT5 性价比最高:仅 109M 参数,delivery R² 排第三(0.602,与第一仅差 0.03),且三个分类任务表现最均衡。
-
共同局限 — biodist:四个 LLM 在 biodist(组织分布预测)上都比 baseline 差,属于多任务学习中的 trade-off:模型容量向回归任务倾斜,牺牲了分布预测。后续可通过调整各任务损失权重缓解。
复现方式
各模型的完整 Colab 操作步骤见 docs/ 下的四份 quickstart 指南;模型构造与参数说明见 README_llm_encoders.md。