
文章核心总结与创新点
主要内容
该研究聚焦分子大语言模型(Mol-LLMs)的核心局限,提出了数据集与表征策略的双重创新,最终开发出性能领先的多模态分子大语言模型KnowMol。研究首先指出当前Mol-LLMs因预训练数据集质量不足(PubChem覆盖失衡、粒度粗糙)和分子表征策略欠佳(1D/2D模态信息编码低效),在分子原子识别、官能团鉴定、结构解析和性质预测等基础任务中存在明显缺陷;随后构建了包含10万条多级别分子标注的KnowMol-100K数据集,并设计了化学信息增强的分子表征方案;基于上述创新,通过两轮指令微调训练出KnowMol模型,在分子理解(标注生成、性质预测)和分子生成(反应预测、逆合成分析)7类下游任务中均超越现有模型。





