# LLM 编码器分支 — 实验结果 LNP 多任务预测模型在引入不同 LLM 分子编码器(V5 token)后的测试集表现。 所有实验:`LNPModelWithoutMPNN`(无 MPNN、无 MoE),固定 seed=42,先在外部数据上预训练 delivery,再用 Optuna 做 3-fold 调参 + 全量训练。 ## 总览对比 | 任务 | 指标 | Baseline (无 LLM) | MolT5 | MoleculeSTM | BioT5-plus | SELFIES-TED | |---|---|---|---|---|---|---| | delivery | R² | 0.373 | 0.602 | 0.552 | **0.633** | 0.618 | | size | R² | 0.215 | **0.440** | 0.408 | 0.423 | 0.381 | | pdi | acc | **0.786** | 0.748 | 0.710 | 0.695 | 0.664 | | ee | acc | 0.679 | **0.702** | 0.679 | 0.679 | 0.679 | | toxic | acc | **0.980** | 0.980 | 0.951 | 0.960 | 0.941 | | biodist | KL↓ | **0.293** | 0.727 | 0.646 | 0.703 | 0.643 | (粗体为该行最优;KL 越低越好,其余越高越好。) ## 模型信息 | llm_type | 模型 | 年份 | 参数量 | hidden | 输入表示 | |---|---|---|---|---|---| | biot5 | BioT5-plus | 2024 | ~250M | 768 | SMILES | | molt5 | MolT5-base | 2022 | 109M | 768 | SMILES | | moleculestm | MoleculeSTM GNN | 2023 | ~2M (GNN) | 300 | 分子图 | | selfiested | SELFIES-TED | 2025 | 358M | 1024 | SELFIES | ## 主要结论 1. **四个 LLM 编码器都显著提升核心回归任务**:delivery R² 从 baseline 的 0.373 最高提升到 0.633(BioT5-plus),size R² 也从 0.215 提升到 0.38–0.44。 2. **领域专用预训练 > 堆参数**:BioT5-plus(针对生物分子预训练)效果最好;参数最大、最新的 SELFIES-TED(358M)仅排第二,说明针对生物分子的预训练比单纯扩大规模更有效。 3. **序列模型 > 图模型**:三个基于序列(SMILES/SELFIES)的语言模型都优于基于图的 MoleculeSTM GNN。 4. **MolT5 性价比最高**:仅 109M 参数,delivery R² 排第三(0.602,与第一仅差 0.03),且三个分类任务表现最均衡。 5. **共同局限 — biodist**:四个 LLM 在 biodist(组织分布预测)上都比 baseline 差,属于多任务学习中的 trade-off:模型容量向回归任务倾斜,牺牲了分布预测。后续可通过调整各任务损失权重缓解。 ## 复现方式 各模型的完整 Colab 操作步骤见 `docs/` 下的四份 quickstart 指南;模型构造与参数说明见 `README_llm_encoders.md`。