文末附网课期末测试答案链接
第一章-AI安全与伦理概述
第二章-对抗攻击方法
f
(
x
)
f(x)
f(x)的一阶梯度
第三章-对抗防御方法
第四章-后门攻击与防御
能够基于扩散模型实现后门去除是因为扩散过程可以降低 后门攻击中相关的高频触发器
扩散过程如何影响后门攻击中的高频触发器?扩散过程可以降低图像中其他部分的相关性,从而降低后门攻击中高频触发器的影响
全局触发器使得原始图像相邻像素 相关性降低,从而带来高频伪影
以下哪项描述了多目标触发器的特点?多目标触发器指有多个目标类,且可能使用多个触发器,不同的触发器对应于不同目标类,而不管源类是什么
以下哪项描述了动态触发器的特点?动态触发器对触发器的形成和触发过程有一定的随机性或变化
以下哪项描述了TUAP的特点?TUAP是一种特定于类的通用对抗性扰动,会使模型错误分类到目标类别上,可以应用于任何输入图像中
以下哪项描述了SSBA图像隐写术的特点?使用特定的编码器-解码器网络将攻击者指定的字符串编码为后门触发器的噪声,然后将其注入良性图像中
数字隐写的目的是什么?将秘密消息以一定的编码或加密方式嵌入到公开的数字媒体中
数字隐写是利用什么进行信息隐藏?数字媒体的数据冗余和人类感知器官的生理、心理特性
BadNets的添加方式中,第二步是什么?将给定的触发器标记在待操作样本中
哪种后门攻击不仅可以接触和更改数据集,还可以控制训练过程?控制训练过程的后门攻击
以下哪种后门攻击只能接触和更改训练数据集,但无法控制训练过程?基于数据投毒的后门攻击
下面描述中不属于训练后的防御设置的是 假设防御者可以访问攻击者的工具和资源来模拟攻击场景并测试防御措施的有效性
在基于训练过程解耦的后门防御中进行模型微调属于 半监督学习
在基于训练过程解耦的后门防御中移除“低可信度”样本标签属于 半监督学习
在基于训练过程解耦的后门防御中基于训练样本训练剩余全连接层属于 监督学习
在基于训练过程解耦的后门防御中冻结学习到的所有特征提取器属于 监督学习
在基于训练过程解耦的后门防御中学习DNN模型的主干属于 自监督学习
后门模型将自动对包含特定语义信息的测试图像进行错误的分类,需要对原始图像做出修改,这句描述
×
\\times
×
训练后的防御其防御目标包括
后门攻击分类可以分为
下列关于防御设置描述不正确的是 假设受害者知道数据集中后门样本的比例和分布
图中所示的后门防御属于 部署 
图中所示的后门防御属于 训练之后 
图中所示的后门防御属于 训练之中 
图中所示的后门防御属于 训练之前 
图中所示的属于 多目标类后门攻击 
图中所示的属于 单一目标类后门攻击 
在训练阶段将所有中毒的训练样本标记为一个单一的目标类,在推理阶段期望所有中毒样本被预测为该目标类。属于 单一目标触发器
不同的触发器对应于于不同目标类而不管源类是什么属于 多目标触发器
使用相同的触发器,来自不同源类的样本将被预测为不同的目标类属于 多目标触发器
良性样本中的特定特征或图像中的特定词句的编码属于 语义触发器 触发器
随机噪声触发器或高亮像素点组合属于 非语义触发器 触发器
攻击者不仅可以接触和更改数据集,还可以控制训练过程属于 控制训练过程的后门攻击
攻击者只可以接触和更改训练数据集,不可以控制训练过程属于 基于数据投毒的后门攻击
图中的stage-3属于 半监督学习 
图中的stage-1属于 自监督学习 
攻击者先训练一个大模型,然后用户进行模型压缩、模型轻量化或剪枝得到轻量级模型属于 部分控制攻击
攻击者在大规模数据集上预训练其模型,然后用户在小数据集上,针对不同的下游任务进行微调属于 部分控制攻击
一阶段训练中为了使这个训练过程稳定,在干净样本和中毒样本上更新的同时 搜集更新轨迹
在训练阶段将所有中毒的训练样本标记为一个单一的目标类,在推理阶段期望所有中毒样本被预测为该目标类是 单一目标触发器
与静态触发器相比,动态触发器到目标类形成稳定的映射可能更 困难,但会增加其隐蔽性
将图像从空间域变换到频域上常采用 离散余弦 变换
在DBD(基于训练过程解耦的后门防御)中,自监督训练,有毒样本 不能 聚在一起
在控制训练过程的后门攻击中,两阶段训练指的是两个任务 顺序执行
BadNets采用的是 静态触发器
下面属于非语义触发器的是 BadNets
BadNets添加方式的正确顺序是 ①②③。 ①选择一定比例的良性训练样本作为待操作样本。 ②将给定的触发器标记在待操作样本中,将这些样本的标签从真实标签更改成目标标签。 ③使用更改后的中毒训练集对模型进行训练
经过离散余弦变换(DCT)变换后的图像左上角是 低频 ,右下角是 高频
在自监督训练中,有毒样本 不能 聚在一起
假设恶意模型训练器生成的模型通过压缩后展开,并通过了模型测试的后门检测环节,则称该攻击为 成功 的
在 一阶段 训练攻击的最终后门模型中,触发器与模型参数的耦合更加紧密
根据训练过程是否完全由攻击者完成,可以将后门攻击分为 完全控制攻击 和 部分控制攻击
与两阶段训练攻击相比,在一阶段训练攻击的最终后门模型中,触发器与模型参数的耦合更加 紧密
在控制训练过程的后门攻击中,一阶段训练指的是两个任务 联合进行
根据对目标标签的修改情况,可以将数据投毒分为 单一目标触发器 和 多目标触发器
根据后门触发器是否是可变化的,可以将触发器分为 静态触发器 和 动态触发器
TUAP:是一种特定于类的通用对抗性扰动。与特定于特定输入的其他类型的对抗性扰动不同,TUAP会使模型错误分类到 目标类别 上,这意味着它们可以应用于任何输入图像中
对抗性后门与传统触发器的区别:1. 对抗噪声 是肉眼不可见的噪声;2. 模型训练过程与原始保持一致,无需更改
数字隐写:是利用各类数字媒体本身所具有的数据冗余,以及人类感知器官的生理、心理特性,将秘密消息以一定的编码或加密方式嵌入到公开的数字媒体中,对载有秘密消息的数字媒体进行传输,以达到 隐蔽通信 目的的信息隐藏技术
以添加的触发器是否被人类肉眼可见为分类依据可以分为 可见触发器,不可见触发器
后门防御手段可以存在在模型实现的各个阶段,例如在训练前对 训练数据 进行后门检测、训练过程中对异常激活神经元进行检测、训练后对得到的模型进行后门检测等
后门攻击的目的是获得一个 后门模型,当输入良性测试集中的样本,模型表现正常;当输入是中毒测试集中的样本,模型输出为 目标标签
第五章- AI伦理技术
将AI可解释技术分类,其中网络层作用,独立单元作用,表征向量属于AI 表征 可解释性
将AI可解释技术分类,其中线性代理模型,决策树,自动规则提取,显著图属于AI 过程 可解释性
差分隐私 的核心是通过在数据库中添加噪声,使查询结果变成了一个随机变量。使得模型不会学习到具体某一个数据提供的梯度
模型窃取训练过程:1.构建具有代表性的数据集作为训练集,输入目标黑盒模型,2.利用 黑盒模型的输出 作为标签,基于知识蒸馏的思想去训练本地替代模型
模型的“正向”过程就是通过输入得到一个输出,而“反演”则是通过模型的输出,反推训练集中某条目标数据的部分或全部属性值
面向数据隐私的保护方式有对 成员推断攻击 的数据隐私保护方法,对 模型反演攻击 的数据隐私保护方法
面向数据隐私的攻击方式有 成员推断攻击 和 模型反演攻击
利用数据生成方法,生成一个属性公平的数据集,典型方法为 FairGAN
审查调整数据集典型应用为 REVISE
在处理中实现公平AI算法的方式有 增加公平性限制项 ,对抗训练,领域独立训练
在预处理阶段实现公平AI算法的方式有 平衡数据集,审查调整数据集,合成公平数据集,合成成对公平数据集
图中表示 可解释性越好的模型,效果越差 
图中所示的网络结构的名称是 Transformer 
尽管控制注意力的单元没有训练来创建人类可读的解释,但它们确实直接揭示了 信息通过网络的路径 ,这可以作为一种解释形式
深层视觉表征的量化解释(network dissection):通过评估 各个隐藏单元和视觉语义概念 (对象、部分、纹理和颜色)之间的对齐来量化 CNN 表示的可解释性
网络层的信息可以进一步细分为单个 神经元 或单个 卷积滤波器
Grad-CAM通过 计算梯度 来高效的生成显著图
Visualizing and understanding convolutional networks通过 遮挡部分输入 来重复测试网络,显示数据的哪些部分实际上对网络输出有影响
CRED(Continuous Rule Extractor via Decision tree induction)利用决策树对 神经网络进行分解 ,并将从每棵树中提取的规则进行合并,得到生成规则。该算法不依赖于网络结构,只提取数据中输入和输出变量之间的关系,同时适用于连续和离散的问题
线性代理模型功能是对于一个分类器(复杂模型),想用一个 可解释的模型(简单模型如线性规划),搭配可解释的特征进行适配,并且这个可解释模型在局部的表现上很接近复杂模型的效果
可解释人工智能:要么是指人类可以保留智力监督的人工智能系统,要么是指实现这一目标的方法。主要焦点通常是 人工智能做出的决策或预测背后的推理 ,这些决策或预测更容易理解和透明
透明和可解释性:对AI系统的决策过程提供 可解释性 和 追溯性 ,使其决策过程能被监督、评估和负责
面临的安全和隐私问题:数据投毒、 模型投毒 、后门攻击、 成员推理攻击 等
联邦机器学习的主要作用是可以避免 非授权的数据扩散 和解决 数据孤岛 问题
联邦学习 是一个机器学习框架,能有效帮助多个机构在满足用户隐私保护、数据安全和政府法规的要求下,进行数据使用和机器学习建模
数字水印嵌入是选择几层神经网络作为嵌入水印的网络层,然后将水印提取的损失,加入到原来的神经网络的 损失函数 中。这样就可以在神经网络训练时嵌入水印
一旦模型被窃取,需要有手段来证明这个模型的所有权,常用的保护方法是 数字水印
差分隐私的核心是通过 在数据库中添加噪声 ,使查询结果变成了一个随机变量。使得模型不会学习到具体某一个数据提供的梯度
差分隐私(DP-SGD )是对 模型反演攻击 的数据隐私保护方法
在模型已经训练好时,防御成员推断攻击,并使得原始模型 输出的可用性不下降
MemGuard是 对成员推断攻击 的数据隐私保护方法
模型窃取训练过程:1.构建具有代表性的数据集作为训练集,输入 目标黑盒模型 ,2.利用黑盒模型的输出作为标签,基于知识蒸馏的思想去训练本地替代模型
在模型窃取攻击中,在本地训练一个与目标模型任务相同的替代模型,当经过大量训练之后,该模型就具有了和目标模型相近的性质,其目的在 利用替代模型拟合目标模型的功能
在黑盒模型反演攻击中,根据黑盒模型中输出的 置信度向量 或 标签信息 ,训练出逆向模型,输出重构的样本
在白盒模型反演攻击中,可以其作为一个优化问题,优化目标为:使逆向数据的输出向量与目标数据的输出向量差异尽可能地小,假如攻击者获得了属于某一类别的输出向量,那么可以利用 梯度下降 的方法,使逆向的数据经过目标模型的推断后仍然能得到同样的输出向量
攻击者只能访问目标模型,得到输出向量,不知道模型的结构、参数、数据集是 黑盒 模型反演攻击
模型的“正向”过程就是通过输入得到一个输出,而“反演”则是通过模型的 输出 ,反推训练集中 某条目标数据的部分或全部属性值
成员推断攻击中,利用多个 影子模型 对训练集和测试集的结果来作为训练样本,使得攻击模型可以区分训练集和测试集
成员推断攻击的基本流程正确的顺序是:② 攻击者将一个目标样本输入到目标模型中,并获得相应的预测结果;③ 将样本的标签、目标模型的预测结果输入到攻击模型里;① 攻击模型判断目标样本是否在目标模型的训练集中;
成员推断攻击的原理是 机器学习中的过拟合现象
在成员推断攻击中,攻击者的目的是判断某个目标输入样本是否存在于目标模型的训练数据集中。这是一种 黑盒 攻击,攻击者只能够访问模型,通过给定输入观察输出
攻击者非法获取到隐私模型的参数、结构、功能等敏感信息是 模型隐私
攻击者从模型的输出中推测出输入数据、训练数据集等敏感信息是 数据隐私
从攻击对象不同角度,AI隐私主要存在于两方面,一种是 数据隐私 ,另一种为 模型隐私
根据不同敏感属性,将数据划分为不同的域,每个域的数据使用单独的分类器进行预测,最后再将多个分类器结合起来使用是 领域独立训练
在通过对抗训练来排除敏感属性对分类结果的影响中特征提取器优化目标是
L
t
a
r
g
e
t
=
−
(
∑
i
(
P
(
y
i
∣
x
i
)
−
α
log
P
(
z
i
∣
x
i
)
)
)
L_{target}= – (\\sum_{i}(P(y_{i}|x_{i})-\\alpha \\log P(z_{i}|x_{i})))
Ltarget=−(∑i(P(yi∣xi)−αlogP(zi∣xi)))
在通过对抗训练来排除敏感属性对分类结果的影响中,属性判别器优化目标是
L
p
r
o
t
e
c
t
e
d
=
−
∑
i
log
(
z
i
∣
x
i
)
L_{protected}=-\\sum_{i}\\log(z_{i}|x_{i})
Lprotected=−∑ilog(zi∣xi)
在构造数据集时,令一类中具有两种敏感属性的样本成对增加,始终保持其平衡性。属于 合成成对数据
REVISE,是一种半自动化的数据集公平性审查工具。向其输入为含有标注的图片,REVISE 会根据数据集的语义分割和标注、标签信息,使用内置的 公平性指标(物体、性别、地域)进行计算,分析数据集中潜在偏见,提供可能的解决方案
标注图片中的敏感标签,在选取训练数据时,挑选出平衡数据,保证多样性。属于 平衡数据集
下面属于后处理的是 修改敏感属性
下面属于处理中的是 领域独立训练
下面属于预处理的是 平衡数据集
在模型的部署过程中,按照 预处理 ,处理中,后处理 三个方面,来实现公平AI算法
存在偏见的类型包括 数据偏见、算法偏见 、 用户行为偏见
随着 AI 的使用越来越广泛,AI 在 性别、种族 、年龄、性取向或政治或宗教取向等方面的表现存在着不同程度的偏见和歧视
第六章-攻击在AI伦理中的良性应用
跨模型通用噪声对抗deepfake文章的目标是什么?获得一个多图像通用的噪声,可以应对多种deepfake模型
噪声保护存在的问题之一是什么?每张图像都需要计算一个特定的噪声,导致计算资源消耗大
以下哪个案例属于被动防御?Google推出了名为“Assembler”的工具,用于帮助检测和分析deepfake视频
以下哪个案例属于主动防御?通过图像保护手段,禁止deepfake模型深度伪造过程
以下哪种防御策略是在侵权发生之后进行的?被动防御
关于决策边界唯一性的描述,哪项是正确的?在特定的训练数据集、特征表示、训练策略和随机初始化参数条件下,一个给定的机器学习模型将学习到唯一的决策边界
通用对抗扰动的特点是什么?能够被添加到多个不同输入样本上,使得这些样本都被误分类,是相对于整个数据集或者某个广泛的类别而言的,而不是针对某个特定的输入
普通对抗扰动的特点是什么?指针对单个特定输入样本生成的扰动,使得该样本被误分类,是相对于特定输入数据的,对其他输入可能不具有欺骗性
在指纹相似度计算过程中,下列哪项描述了该步骤的实施策略?使用对比学习训练一个编码器,将指纹映射成潜在空间中的编码,通过计算编码余弦相似度,来衡量指纹相似程度
常见的对抗攻击有:对抗样本,对抗水印,对抗贴纸,对抗噪声
deepfake技术包括重现,编辑,替换,合成
模型通用噪声对抗deepfake目标是1. 获得一个多图像通用的噪声 2. 通用噪声可以应对多种deepfake模型
主动防御通常使用在侵权发生 前
被动防御通常使用在侵权发生 后
图中红框内步骤的目的是 设计假设检验流程,对可疑模型进行检测 
下图中Dt表示的是 中毒子集 
下图中T表示的是 风格转换器 
图中红框内步骤的目的是 训练分类器,对模型进行识别,输出识别结果 
图中红框内步骤的目的是 引入外部特征 构建用于数据投毒的训练集 
采用不改变数据标签的数据投毒的方式,将不属于训练集中的外部特征嵌入隐私模型中,通过分析模型面对外部特征时的输出表现,用假设检验的方式判断可疑模型是否为盗版模型。其中外部特征保证了 识别能力不易丢失
采用不改变数据标签的数据投毒的方式,将不属于训练集中的外部特征嵌入隐私模型中,通过分析模型面对外部特征时的输出表现,用假设检验的方式判断可疑模型是否为盗版模型。其中不改变数据标签 不创建显式后门,防止后门漏洞被利用
采用不改变数据标签的数据投毒的方式,将不属于训练集中的外部特征嵌入隐私模型中,通过分析模型面对外部特征时的输出表现,用假设检验的方式判断可疑模型是否为盗版模型。其中数据投毒 不会显著降低模型性能
传统的水印存在 降低性能 、易丢失 和 有安全隐患 这几点问题
图中的 f_pir表示 隐私模型及隐私模型衍生出的盗版模型 
图中的f_homo表示同类任务的 分类模型 
计算指纹相似分数,使用对比学习训练一个编码器,编码器将指纹映射成潜在空间中的编码,通过计算编码 余弦相似度 ,来衡量指纹相似程度
下图所示的公式目的是:训练一个模型,输入隐私模型和可疑模型的指纹对,输出 指纹相似度分数 
用公式表示指纹生成这一过程:其中x表示 选取的数据点





本文参考原链接文章参考链接
期末测试链接网课期末测试




