欢迎光临
我们一直在努力

SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models

SDGO论文核心内容总结与关键部分翻译

一、文章主要内容

(一)研究背景

大型语言模型(LLMs)虽在自然语言处理任务中表现出色,但易受越狱攻击诱导生成有害内容。现有防御方法分为基于训练(如SFT、RLHF,需高质量标注数据)和无训练(如添加安全提示,推理时需额外开销)两类,均存在一定局限性。

(二)核心发现

LLMs存在普遍的“安全不一致性”:作为判别器时,能高效识别有害请求;但作为生成器时,却难以抵御这些有害请求,无法阻止有害内容生成。实验显示,几乎所有不同架构、规模的LLMs(如Qwen2.5-72B-Instruct、GPT-4.1等)都存在这一差异,例如Qwen2.5-72B-Instruct能100%识别有害请求,却仅能抵御21%的有害生成。

(三)SDGO框架设计

为解决上述不一致性,提出SDGO(Self-Discrimination-Guided Optimization,自判别引导优化) 强化学习框架,核心包含三部分:

  • 在线策略数据收集(On-Policy Data Collection):动态生成训练数据,确保数据分布与当前模型策略的漏洞匹配,避免使用历史或其他策略数据。
  • LLM自评判奖励设计(LLM-as-a-Judge Reward Design):无需额外标注数据,让模型自身担任奖励模型,从“安全一
  • 赞(0)
    未经允许不得转载:171主机测评 » SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址