一、文章主要内容
本文聚焦大语言模型(LLMs)的文本结构化处理能力,核心解决当前模型在复杂文本处理中缺乏稳定中间表示(IR)、泛化能力弱的问题。研究通过两大核心贡献推动领域进展:
提出Structure of Thought(SoT)提示策略:借鉴人类处理长文本的逻辑(提取关键点、明确关系、结构化信息),指导模型在生成答案前先将文本转化为“节点-链接”结构。实验显示,SoT在8个文本处理任务、3个模型家族中均实现稳定性能提升,平均提升5.7%。
构建T2S-Bench基准数据集:首个专门评估文本到结构(Text-to-Structure)能力的数据集,包含1.8K高质量样本,覆盖计算机科学、经济学、环境科学等6大科学领域、32种结构类型。数据集分为训练集(T2S-Train-1.2k)、多跳推理测试集(T2S-Bench-MR,500样本)和端到端结构提取测试集(T2S-Bench-E2E,87样本),具备结构准确性高、评估公平通用、样本质量严格三大优势。
大规模模型评估与验证:对45个主流模型(含GPT、Gemini、Claude、开源模型如Qwen3、DeepSeek等)进行基准测试,发现当前模型存在显著提升空间(多跳推理平均EM仅52.1%,顶尖模型节点提取准确率仅58.1%);基于T2S-Bench训练后,模型在下游文本任务中性能进一步提升至8.6%,证实结构化能力对文本处理的核心价值。
二、创新点
通用中间表示范式