本课是AI数学最核心、最常用的底层三要素:
内积 = 判断两个向量「像不像」
范数 = 向量的「长度/大小」
夹角 = 两个向量「方向差异」
大模型90%的底层逻辑都靠这三个公式:相似度计算、注意力机制、归一化、向量检索、 embedding匹配。
一、先建立直观理解
把向量理解成一段“带方向的趋势”
比如:
- 文本向量A:【喜欢篮球、运动、阳光】
- 文本向量B:【爱打球、健身、户外】
- 文本向量C:【喜欢看书、安静、独处】
人的直觉:
A和B很像 → 夹角小
A和C不像 → 夹角大
数学把人的直觉量化成三件事:
AI所有相似度、匹配、检索,全部来自这三个东西。
二、第一层:范数(向量的长度)
1、通俗定义
范数 = 向量的长度、强度、大小
二维向量:
v=(x,y)
范数(L2范数,AI默认范数):
|v|=\\sqrt{x2+y2}
2、大白话例子
向量 v=(3,4)
长度 = \\sqrt{32+42}=5
就是初中勾股定理。
3、AI真实含义
embedding向量有128维、512维、1024维
范数越大 → 语义越强、特征越强烈
范数越小 → 特征微弱、模糊、接近空白
大模型训练必须做:向量归一化
就是:把所有向量范数强制拉成1
只保留方向、消除大小干扰,让相似度更准。
三、第二层:向量内积(最重要!AI灵魂公式)
1、定义(超简单)
两个向量对应位置相乘、全部相加
a\\cdot b = a_1b_1+a_2b_2+…
2、通俗理解
内积越大 = 两个向量越重合、越相似
举例直观看懂
例1:方向几乎一样
a=(2,3)
b=(2,3)
内积 = 4+9=13(很大)
例2:方向相反
a=(2,3)
b=(-2,-3)
内积 = -4-9=-13(负数,完全相反)
例3:方向垂直、毫无关系
a=(2,0)
b=(0,3)
内积 = 0+0=0(完全不相关)
3、工程三结论(记住终身受用)
3<0:相反、对立**
大模型注意力分数、向量检索、匹配打分,本质就是算内积。
四、第三层:夹角(相似度的最终标尺)
1、核心万能公式(AI最重要公式之一)
\\cos\\theta=\\frac{a\\cdot b}{|a||b|}
一句话翻译:
夹角余弦 = 内积 ÷ 两个向量长度的乘积
2、逐级解读含义
- \\cos\\theta=1 → 夹角0° → 完全相同
- \\cos\\theta=0 → 夹角90° → 毫无关系
- \\cos\\theta=-1 → 夹角180° → 完全相反
3、大白话生活类比
向量A:我喜欢夏天
向量B:我热爱盛夏
→ 夹角极小,cos接近1 → AI判定语义一致
向量A:喜欢夏天
向量C:讨厌炎热
→ 夹角很大,cos负数 → AI判定语义相反
五、三者串联完整逻辑(本节课最大收获)
我帮你把三个知识点串成一条闭环逻辑(考试、AI、工程通用)
为什么大模型要用余弦相似度?
因为:
内积会被向量长度影响,夹角不会。
比如:
长向量、强特征向量天然内积大,不公平。
所以AI统一:用余弦夹角做相似度,只看方向,不看强弱。
六、AI落地终极总结(必考、必懂)
Transformer注意力机制核心公式:
Attention(Q,K,V)=softmax(\\frac{QK^T}{\\sqrt{d}})V
QK^T 本质就是批量向量内积
除以根号维度,就是防止范数爆炸、稳定夹角分布
七、极简随堂(自测是否吃透)
欢迎评论区写下你的答案。
收藏本文,防止以后要用找不到;关注本专栏,下一课实战讲解向量归一化,吃透余弦相似度工程坑点。



