lnp_ml/RESULTS.md

43 lines
2.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# LLM 编码器分支 — 实验结果
LNP 多任务预测模型在引入不同 LLM 分子编码器V5 token后的测试集表现。
所有实验:`LNPModelWithoutMPNN`(无 MPNN、无 MoE固定 seed=42先在外部数据上预训练 delivery再用 Optuna 做 3-fold 调参 + 全量训练。
## 总览对比
| 任务 | 指标 | Baseline (无 LLM) | MolT5 | MoleculeSTM | BioT5-plus | SELFIES-TED |
|---|---|---|---|---|---|---|
| delivery | R² | 0.373 | 0.602 | 0.552 | **0.633** | 0.618 |
| size | R² | 0.215 | **0.440** | 0.408 | 0.423 | 0.381 |
| pdi | acc | **0.786** | 0.748 | 0.710 | 0.695 | 0.664 |
| ee | acc | 0.679 | **0.702** | 0.679 | 0.679 | 0.679 |
| toxic | acc | **0.980** | 0.980 | 0.951 | 0.960 | 0.941 |
| biodist | KL↓ | **0.293** | 0.727 | 0.646 | 0.703 | 0.643 |
粗体为该行最优KL 越低越好,其余越高越好。)
## 模型信息
| llm_type | 模型 | 年份 | 参数量 | hidden | 输入表示 |
|---|---|---|---|---|---|
| biot5 | BioT5-plus | 2024 | ~250M | 768 | SMILES |
| molt5 | MolT5-base | 2022 | 109M | 768 | SMILES |
| moleculestm | MoleculeSTM GNN | 2023 | ~2M (GNN) | 300 | 分子图 |
| selfiested | SELFIES-TED | 2025 | 358M | 1024 | SELFIES |
## 主要结论
1. **四个 LLM 编码器都显著提升核心回归任务**delivery R² 从 baseline 的 0.373 最高提升到 0.633BioT5-plussize R² 也从 0.215 提升到 0.380.44。
2. **领域专用预训练 > 堆参数**BioT5-plus针对生物分子预训练效果最好参数最大、最新的 SELFIES-TED358M仅排第二说明针对生物分子的预训练比单纯扩大规模更有效。
3. **序列模型 > 图模型**三个基于序列SMILES/SELFIES的语言模型都优于基于图的 MoleculeSTM GNN。
4. **MolT5 性价比最高**:仅 109M 参数delivery R² 排第三0.602,与第一仅差 0.03),且三个分类任务表现最均衡。
5. **共同局限 — biodist**:四个 LLM 在 biodist组织分布预测上都比 baseline 差,属于多任务学习中的 trade-off模型容量向回归任务倾斜牺牲了分布预测。后续可通过调整各任务损失权重缓解。
## 复现方式
各模型的完整 Colab 操作步骤见 `docs/` 下的四份 quickstart 指南;模型构造与参数说明见 `README_llm_encoders.md`