lnp_ml/RESULTS.md

2.3 KiB
Raw Permalink Blame History

LLM 编码器分支 — 实验结果

LNP 多任务预测模型在引入不同 LLM 分子编码器V5 token后的测试集表现。 所有实验:LNPModelWithoutMPNN(无 MPNN、无 MoE固定 seed=42先在外部数据上预训练 delivery再用 Optuna 做 3-fold 调参 + 全量训练。

总览对比

任务 指标 Baseline (无 LLM) MolT5 MoleculeSTM BioT5-plus SELFIES-TED
delivery 0.373 0.602 0.552 0.633 0.618
size 0.215 0.440 0.408 0.423 0.381
pdi acc 0.786 0.748 0.710 0.695 0.664
ee acc 0.679 0.702 0.679 0.679 0.679
toxic acc 0.980 0.980 0.951 0.960 0.941
biodist KL↓ 0.293 0.727 0.646 0.703 0.643

粗体为该行最优KL 越低越好,其余越高越好。)

模型信息

llm_type 模型 年份 参数量 hidden 输入表示
biot5 BioT5-plus 2024 ~250M 768 SMILES
molt5 MolT5-base 2022 109M 768 SMILES
moleculestm MoleculeSTM GNN 2023 ~2M (GNN) 300 分子图
selfiested SELFIES-TED 2025 358M 1024 SELFIES

主要结论

  1. 四个 LLM 编码器都显著提升核心回归任务delivery R² 从 baseline 的 0.373 最高提升到 0.633BioT5-plussize R² 也从 0.215 提升到 0.380.44。

  2. 领域专用预训练 > 堆参数BioT5-plus针对生物分子预训练效果最好参数最大、最新的 SELFIES-TED358M仅排第二说明针对生物分子的预训练比单纯扩大规模更有效。

  3. 序列模型 > 图模型三个基于序列SMILES/SELFIES的语言模型都优于基于图的 MoleculeSTM GNN。

  4. MolT5 性价比最高:仅 109M 参数delivery R² 排第三0.602,与第一仅差 0.03),且三个分类任务表现最均衡。

  5. 共同局限 — biodist:四个 LLM 在 biodist组织分布预测上都比 baseline 差,属于多任务学习中的 trade-off模型容量向回归任务倾斜牺牲了分布预测。后续可通过调整各任务损失权重缓解。

复现方式

各模型的完整 Colab 操作步骤见 docs/ 下的四份 quickstart 指南;模型构造与参数说明见 README_llm_encoders.md