SDGO论文核心内容总结与关键部分翻译
一、文章主要内容
(一)研究背景
大型语言模型(LLMs)虽在自然语言处理任务中表现出色,但易受越狱攻击诱导生成有害内容。现有防御方法分为基于训练(如SFT、RLHF,需高质量标注数据)和无训练(如添加安全提示,推理时需额外开销)两类,均存在一定局限性。
(二)核心发现
LLMs存在普遍的“安全不一致性”:作为判别器时,能高效识别有害请求;但作为生成器时,却难以抵御这些有害请求,无法阻止有害内容生成。实验显示,几乎所有不同架构、规模的LLMs(如Qwen2.5-72B-Instruct、GPT-4.1等)都存在这一差异,例如Qwen2.5-72B-Instruct能100%识别有害请求,却仅能抵御21%的有害生成。
(三)SDGO框架设计
为解决上述不一致性,提出SDGO(Self-Discrimination-Guided Optimization,自判别引导优化) 强化学习框架,核心包含三部分:






