文章核心总结与翻译
一、主要内容
ToMMeR(Token-Matching Mention Recognition)是一种轻量级实体提及检测模型,旨在从大型语言模型(LLM)的早期层中高效提取实体提及(即识别文本中指向实体的文本片段)。该模型仅含不到30万个参数,无需提示工程、模式输入或文本生成,通过冻结LLM骨干网络并探测其早期层表示,实现了高性能的提及检测。
在13个命名实体识别(NER)基准测试中,ToMMeR的零样本召回率达93%,经LLM判定的精确率超90%,且极少产生虚假预测。跨模型分析表明,不同架构(1400万至150亿参数)的LLM在提及边界识别上高度一致(DICE系数>75%),证实提及检测是语言建模的自然涌现能力。当扩展跨度分类头后,ToMMeR在标准基准测试中实现了接近最先进水平的NER性能(F1值80%-87%),为信息提取管道提供了模块化、与模式无关的高效解决方案。

![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)
