
目录
1. 概述
2. 价值
3. 关键技术
4. 代码实现
代码说明
1. 核心组件
SafetyGuardrails 类
SafeAIClient 类
2. 安全特性
多层防御机制
风险管理
3. 使用方式
4. 扩展建议
1. 概述
随着智能体和LLM越来越自主,若无约束,可能带来不可预测风险,生成有害、偏见、伦理或事实错误内容,造成现实损害。系统易受Jailbreak等对抗攻击,绕过安全协议。无护栏,智能体可能行为失控,失去用户信任,带来法律和声誉风险。
护栏(Guardrails),也称为安全模式,是确保智能体安全、合规、按预期运行的关键机制,尤其是在智能体日益自主并集成到关键系统中的情况下。为智能体系统风险管理提供标准化解决方案,是多层防御机制确保智能体安全、合规、目标一致。它们作为保护层,引导智能体的行为和输出,防止有害、偏见、无关或其他不良响应。护栏可在多个阶段实施,包括输入验证/清洗、输出过滤/后处理、行为约束、工具使用限制、外部内容审核API,以及\”人在回路\”机制。可以采用计算资源消耗较低的模型作为快速额外防线,对主模型的输入或输出进行预筛查,检测是否有政策违规。

图1:护栏设计模式
2. 价值
护栏的主要目标不是限制智





