欢迎光临
我们一直在努力

大模型为何知而不言?揭秘AI说谎的深层原因

一、为什么模型\”心里知道、嘴上说假\”?(ITI 现象的根因)

现象回顾

  • 模型隐藏层里,真话和假话在向量空间里\”分得清清楚楚\”——能被一条线(超平面)分开;
  • 但最终输出层却经常说出错的那一边。

通俗原因(3 条)

① 训练目标本来就不是\”说真话\”,而是\”说得像\”

  • LLM 的训练目标是 最大化下一个 token 的似然 P(y|x)——通俗说就是\”在这种上下文下,人最常接着说什么词\”。
  • 这个目标只关心\”说出来像不像人话\”,不关心\”是不是事实\”。所以模型学到的是 “什么搭配在语料里高频出现”,而不是 “什么是真”。
  • 类比:考试时你的目标是\”得高分\”,老师从没考过\”你心里到底信不信\”,所以你的笔答和心里想的可能不一致。

② 隐藏层是\”理解层\”,输出层是\”流畅层\”——两者目标不同

  • Transformer 走完几十层后,中后段隐藏层已经积累出\”真假可分\”的判别信号(这是 ITI 论文用线性探针证明的);
  • 但隐藏层 → 词表的那一步矩阵(unembedding/lm_head),在训练时只被要求 “让最终困惑度低、文字流畅”;
  • 于是 “真假方向
赞(0)
未经允许不得转载:171主机测评 » 大模型为何知而不言?揭秘AI说谎的深层原因
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址