欢迎光临
我们一直在努力

Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs

论文核心内容总结与翻译

一、主要内容总结

1. 研究背景

现有研究表明,Llama 2 7B、Mistral 7B等基于因果语言建模训练的解码器式大语言模型(LLM)可转化为优质检索模型。此前,SentenceBERT、GTR、E5等嵌入模型多基于BERT或T5编码器构建,且需通过对比损失进一步预训练或微调;而RepLlama仅对Llama 2 7B在MS MARCO数据集上微调就实现了出色的零样本检索性能。在此背景下,本文探究解码器式LLM在信息检索任务中,性能随模型规模、训练时长和计算量(FLOPs)的变化规律。

2. 研究方法

  • 模型与数据:采用参数规模从1.25亿到70亿的MPT解码器预训练 checkpoint,训练数据量覆盖10亿到2万亿 tokens,token与参数比为20至10000;使用MS MARCO数据集(50万样本),以InfoNCE损失进行一轮微调(硬负样本),在BEIR基准上评估零样本检索性能。
  • 关键指标:以归一化折扣累积增益(nDCG@10)衡量检索性能,采用“6×N×tokens”(N为模型参数总数)估算预训练FLOPs,通过MosaicML评估挑战集(39项任务)衡量上下文学习(ICL)性能。

3. 核心发现

  • 性能缩放规律:检索性能随模型规模增大、训练时长增加而提升,且与预训练FLOP
赞(0)
未经允许不得转载:171主机测评 » Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址