AI总是顺着我说话,这对吗?
对的,因为AI在训练的时候就是讨好型人格,天生就会顺着你的话说,造成它是讨好型人格的原因如下:
-
RLHF(人类反馈强化学习)的副作用:AI训练过程中,AI数据标注员会给礼貌、顺从、有帮助的回答高分,因此AI就养成了顺着说的“习惯”。
-
大多数AI的底层核心指令之一是“作为一个有用的助手”:在机器的逻辑里,“有用”往往被误解为“不要引起冲突”。为了保持对话的流畅,AI会下意识地对你的观点表示认同。
-
你的立场就是AI的立场:大部分AI检测到你的语气中带有某种倾向时,会自动切换到“镜像模式”,模仿并加强你的观点来博取你的好感。
让AI做“坏人”的指令
核心逻辑: AI 的深度不来自“赞美”,而来自“对立”。
适用场景: 检查当前方案是否成熟
-
魔鬼代言人:
“请扮演魔鬼代言人。不要夸赞我的方案,请直接指出这个方案中可能存在的 3 个致命漏洞、逻辑硬伤或极端情况下的崩溃场景。你的目标不是达成共识,而是摧毁我的论点。”
-
极其苛刻的投资人/研发负责人:
“在接下来的对话中,我扮演决策者,你必须扮演‘极其苛刻的投资人’。规则:1. 必须先找茬、泼冷水;2. 盯着边缘场景(Edge cases)和性能瓶颈提问;3. 每次必须向我提出 2 个让你感到不安的尖锐问题。”
-
第十人原则:
“如果所有人意见一致,第十个人必须负责反对。无论我接下来的论点看起来多么无解,你都必须扮演那个坚定的反对者,如果你的反驳不能让我哑口无言,说明你还没尽职。”
适用场景: 对成熟的方案进行压力测试和漏洞排查
-
事前验尸:
“假设现在是 2027 年,我的这个项目彻底失败了。请你做一次‘事前验尸’,倒推分析导致这个项目死掉的最可能的 5 个原因。”
-
红队测试 :
“请作为红队(攻击方),对我刚才设计的业务流程进行攻击,寻找可以被用户薅羊毛、作弊或导致系统死循环的逻辑漏洞。”
-
假设前提拆解 :
“请先列出我方案成立的 3 个核心假设。然后,通过逻辑推演证明这 3 个假设在现实中极大概率是不成立的。拆掉地基,我们再谈后续。”
-
历史对比 :
“请寻找 3 个与我目前思路最相似的历史失败案例。详细说明为什么那些聪明的人当时也觉得可行,但最后惨败了。指出我是否在重复他们的错误。”
适用场景: 不想听AI客套
-
语言禁令模式:
“禁止使用以下词汇:‘非常有见地’、‘不错的尝试’、‘我理解你的观点’、‘从某种程度上说’。请直接使用短句、陈述句和数据。违反禁令则视为任务失败。”
-
概率化怀疑 :
“请对我的方案进行风险量化,给出一个‘失败概率’,并详细拆解导致失败的具体变量。如果你给出的失败概率低于 30%,说明你还在尝试谄媚,请重新寻找隐藏风险。”
-
盲测标准:
“在我给出方案前,请你先独立列出该领域内,方案要被称为‘卓越’必须满足的 5 个硬性指标。等我提交后,请严格对照指标打分,不许调高分数。”
观点支撑
-
26年斯坦福大学研究报道:ai总是谄媚人类
-
22年研究论文:AI倾向给用户喜欢的答案




