mirror of
https://github.com/RYDE-WORK/lnp_ml.git
synced 2026-07-22 05:49:55 +08:00
43 lines
2.3 KiB
Markdown
43 lines
2.3 KiB
Markdown
# LLM 编码器分支 — 实验结果
|
||
|
||
LNP 多任务预测模型在引入不同 LLM 分子编码器(V5 token)后的测试集表现。
|
||
所有实验:`LNPModelWithoutMPNN`(无 MPNN、无 MoE),固定 seed=42,先在外部数据上预训练 delivery,再用 Optuna 做 3-fold 调参 + 全量训练。
|
||
|
||
## 总览对比
|
||
|
||
| 任务 | 指标 | Baseline (无 LLM) | MolT5 | MoleculeSTM | BioT5-plus | SELFIES-TED |
|
||
|---|---|---|---|---|---|---|
|
||
| delivery | R² | 0.373 | 0.602 | 0.552 | **0.633** | 0.618 |
|
||
| size | R² | 0.215 | **0.440** | 0.408 | 0.423 | 0.381 |
|
||
| pdi | acc | **0.786** | 0.748 | 0.710 | 0.695 | 0.664 |
|
||
| ee | acc | 0.679 | **0.702** | 0.679 | 0.679 | 0.679 |
|
||
| toxic | acc | **0.980** | 0.980 | 0.951 | 0.960 | 0.941 |
|
||
| biodist | KL↓ | **0.293** | 0.727 | 0.646 | 0.703 | 0.643 |
|
||
|
||
(粗体为该行最优;KL 越低越好,其余越高越好。)
|
||
|
||
## 模型信息
|
||
|
||
| llm_type | 模型 | 年份 | 参数量 | hidden | 输入表示 |
|
||
|---|---|---|---|---|---|
|
||
| biot5 | BioT5-plus | 2024 | ~250M | 768 | SMILES |
|
||
| molt5 | MolT5-base | 2022 | 109M | 768 | SMILES |
|
||
| moleculestm | MoleculeSTM GNN | 2023 | ~2M (GNN) | 300 | 分子图 |
|
||
| selfiested | SELFIES-TED | 2025 | 358M | 1024 | SELFIES |
|
||
|
||
## 主要结论
|
||
|
||
1. **四个 LLM 编码器都显著提升核心回归任务**:delivery R² 从 baseline 的 0.373 最高提升到 0.633(BioT5-plus),size R² 也从 0.215 提升到 0.38–0.44。
|
||
|
||
2. **领域专用预训练 > 堆参数**:BioT5-plus(针对生物分子预训练)效果最好;参数最大、最新的 SELFIES-TED(358M)仅排第二,说明针对生物分子的预训练比单纯扩大规模更有效。
|
||
|
||
3. **序列模型 > 图模型**:三个基于序列(SMILES/SELFIES)的语言模型都优于基于图的 MoleculeSTM GNN。
|
||
|
||
4. **MolT5 性价比最高**:仅 109M 参数,delivery R² 排第三(0.602,与第一仅差 0.03),且三个分类任务表现最均衡。
|
||
|
||
5. **共同局限 — biodist**:四个 LLM 在 biodist(组织分布预测)上都比 baseline 差,属于多任务学习中的 trade-off:模型容量向回归任务倾斜,牺牲了分布预测。后续可通过调整各任务损失权重缓解。
|
||
|
||
## 复现方式
|
||
|
||
各模型的完整 Colab 操作步骤见 `docs/` 下的四份 quickstart 指南;模型构造与参数说明见 `README_llm_encoders.md`。
|