1. Token(词元)
定义
大模型处理文本的最小基础单位,不是单纯汉字 / 单词,是模型词表预拆分后的片段,英文、中文拆分规则不同。
换算规则
- 英文:4 个字符 ≈ 1 Token,0.75 个英文单词 ≈ 1 Token
- 中文:1 个汉字 ≈ 1.5~2 Token(中文编码成本更高)
- 符号、空格、标点都会单独占用 Token
核心作用
2. 上下文窗口 Context Window
定义
模型单次推理能同时读取、记忆、参考的最大 Token 总容量,等同于模型的短期工作记忆上限。
包含内容
一次请求内全部 Token 总和:历史对话 + 系统提示词 Prompt + 用户当前提问 + 已生成的回答内容。
关键特性
3. Temperature 温度参数
定义
控制模型生成文字的随机发散程度,取值范围 0.0 ~ 2.0,默认 1.0,底层通过缩放预测分数 logits 调整概率分布。
不同取值效果
- Temperature ≈ 0(0.1~0.3):概率分布极度陡峭,只选最高概率 Token;输出严谨、重复少、无脑洞,适合代码、数学计算、事实问答、数据抽取
- Temperature = 0.5~0.7:平衡稳定与多样性,通用聊天、翻译、普通文案首选
- Temperature ≥ 1.0(1.0~1.5):分布变平缓,低概率词汇更容易出现;创意更强,适合小说、写诗、头脑风暴;过高容易产生幻觉、逻辑混乱
公式原理
调整后概率 = softmax(logits / temperature)
4. Top-p 核采样(Nucleus Sampling)
定义
动态截断候选词池:将所有预测 Token 按概率从高到低累加,只保留累积概率总和达到 p 的词汇集合,其余低概率长尾词直接丢弃。取值 0.0 ~ 1.0,默认 1.0(不截断)。
取值效果
- Top-p=0.1~0.5:仅保留极少数高确信词汇,输出严谨统一,适合专业问答
- Top-p=0.8~0.95:保留绝大多数主流合理词汇,兼顾自然度与多样性,日常对话标配
- Top-p=1:等价不限制候选词,全部词汇参与采样
和 Temperature 区别
- Temperature:整体缩放全部词汇的概率高低,改变随机倾向
- Top-p:直接过滤掉低概率冷门词汇,控制可选词汇范围 工程最佳实践:二者不要同时大幅调高,一般固定一个微调另一个。
5. 流式输出 Stream
定义
SSE(服务器推送事件)流式推理,模型逐 Token 实时返回生成片段,不用等完整回答生成完毕再一次性返回结果。
工作流程
优势
- 用户体验:打字机实时效果,消除长时间空白等待
- 低延迟:长回答场景感知速度提升数倍
是否开启流式
绝大多数前端聊天场景:必须开流式(stream=True)
后端批量 / 程序自动化场景:关闭流式(stream=False)
原因:
特殊工具调用(Function Calling)建议
流式开启:工具调用参数会分段吐出,需要代码拼接完整 JSON 才能解析调用;
流式关闭:直接拿到完整工具调用结构,解析更省事。
如果你的业务大量依赖工具联网、查数据,很多开发者会临时关流式。
Function Calling 函数调用(工具调用)
定义
大模型自主识别用户意图,自动生成外部函数 / API 调用参数,交给开发者本地执行工具,再把工具结果传回模型整合输出自然语言,打通模型与外部真实数据、系统操作的能力。
完整执行四步流程
典型应用场景
- 实时信息:天气、股票、新闻、航班查询
- 系统操作:数据库增删查改、设备控制、邮件发送
- 智能 Agent:多工具链式调用、复杂任务自动化
核心价值
解决大模型知识截止、无法访问实时数据、不能操作外部系统三大短板,是智能体 Agent 的底层核心能力。


