欢迎光临
我们一直在努力

什么是上下文压缩(Context Compaction)?有哪些常见的压缩策略?

👨‍⚕️ 主页: gis分享者 👨‍⚕️ 感谢各位大佬 点赞👍 收藏⭐ 留言📝 加关注✅! 👨‍⚕️ 收录于专栏:AI大模型原理和应用面试题

文章目录

  • 一、🍀回答重点
  • 二、🍀扩展知识
    • 2.1 ☘️对话场景的上下文压缩
    • 2.2 ☘️代码场景的上下文压缩
    • 2.3 ☘️压缩的质量评估
    • 2.4 ☘️压缩策略的选择原则
  • 三、🍀面试官追问

一、🍀回答重点

上下文压缩是在不丢失关键信息的前提下,减少输入给大模型的上下文长度。核心目的是在有限的上下文窗口里塞进更多有用信息,同时把 token 消耗和推理延迟压下来。

虽然现在模型动辄支持 128K 甚至更长的上下文窗口,但实际用起来有三个绕不开的问题:

1)token 是按量计费的,上下文越长越烧钱。输入跑一次长文档分析,光 token 费用可能就到挺高。

2)上下文越长推理越慢,Transformer 的注意力计算量跟序列长度是平方关系,128K 的延迟比 8K 高出一个数量级

3)大模型存在 Lost in the Middle 现象,放在上下文中间的信息容易被忽略,塞太多反而把回答质量拉低了

常见的压缩策略有四种:

1)摘要压缩:用大模型或专门的摘要模型把长文档压成简短摘要。多轮对话场景最常用,把历史对话总结成一段话,不用把完整聊天记录全塞进去

2)选择性保留:只保留和当前任务最相关的上下文片段。通过语义检索找到最相关的几段内容,其余直接丢掉

3)token 级压缩:在不改变语义的前提下减少 token 数量,比如去掉冗余空格、缩短重复表述、把冗长的 JSON 压缩成更紧凑的格式

4)分层压缩:对不同重要程度的信息用不同的压缩级别。核心指令保持原文,背景信息用摘要,低优先级信息直接砍掉

赞(0)
未经允许不得转载:171主机测评 » 什么是上下文压缩(Context Compaction)?有哪些常见的压缩策略?
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址