文章目录
- 定义
-
- 1)参数规模庞大
- 2)训练数据庞大
- 3)能力强大
- 为什么会出现大模型?
-
- 1)数据够多:训练范式的改变使得训练数据规模获得了数量级上的跃迁
- 2)算力够强:GPU/TPU等并行计算设备性能发展与分布式训练成熟
- 3)架构合理:Transformer架构的出现
- 4)总结
- 大模型计量单位
-
- 1)参数规模(Parameters Scale)
- 2)训练数据集规模
- 3)计算规模
- 4)算力
- 分类
-
- 1.按模型功能/输出形态分类
-
- 1)生成式模型(Generative Model)
- 2)嵌入模型/向量表征模型(Embedding Model / Representation Model)
- 3)重排序 / 相关性打分模型(Reranking / Scoring Model)
- 4)分类器 / 判别模型(Classifier / Judge Model)
- 2.生成模型根据模态分类
-
- 1)什么是模态(Modality)?
- 2)语言/文本模型(Language/Text Model)
- 3)多模态理解模型(Multimodal Understanding Model)
- 4)多模态生成模型(Multimodal Generative Model)
- 总结
- AIGC和AGI
-
- 1)AIGC的定义
- 2)AGI的定义
- 3)对比
- 大模型的开源
-
- 1)开源模型
- 2)闭源模型
定义
目前关于大模型(Large Models)并没有统一的定义,通常是指参数规模庞大(顶尖大模型参数可达万亿)、训练数据庞大、能力强大的深度神经网络模型。
1)参数规模庞大
大模型的参数量通常在10亿以上,目前顶尖模型的参数规模已达万亿级别。 
2)训练数据庞大
Common Crawl是大模型中的大语言模型预训练阶段的数据来源之一,它是一个公共网络爬虫项目,每隔1-2个月会发布一次主爬取的文件,包含了部分网页的快照,是互联网数据的子集。
WET是对网页内容进行抽取和清洗之后的数据,通常作为大模型预训练数据集的构建起点。完整的数据集可能包含若干次主爬取的WET,还可能包含其它渠道获取的数据。
3)能力强大
传统模型针对特定任务设计,泛化能力有限,通常只能完成单一任务,如:情感分析、实体标注等。 而大模型具备强大的跨任务泛化能力,单一大模型可以解决大多数传统模型可以完成的任务。
为什么会出现大模型?
大模型的出现并非偶然,而是数据、算力与模型架构协同演进的结果。
1)数据够多:训练范式的改变使得训练数据规模获得了数量级上的跃迁
传统监督学习高度依赖人工标注数据(对原始数据进行标记、分类、注释或结构化的过程,便于机器可识别和理解),获取成本高、规模受限。
而大模型主要采用自监督学习范式(如“预测下一个token”),能够直接利用海量的未标注文本与多模态数据,可用数据规模获得了数量级上的跃迁。 如Qwen3的预训练阶段使用了约36T个token(近似理解为词)的语料,这一数据规模远超传统机器学习时代的训练数据总量。
2)算力够强:GPU/TPU等并行计算设备性能发展与分布式训练成熟
上图的纵轴是32位浮点数的计算性能(可能是FP32或BF32,取最大)。
- 深度学习训练本质是大规模矩阵运算,这类计算具有高度并行性,与GPU/TPU的硬件架构天然契合。
- 与此同时,数据并行、张量并行、流水线并行等分布式训练体系日趋成熟,使得跨节点、跨集群训练超大规模参数模型成为可能。
3)架构合理:Transformer架构的出现
Transformer架构摒弃了强序列依赖的递归计算方式,支持并行计算。并且在模型规模、数据规模、训练步数(计算量)提升时展现出稳定的性能收益(即良好的“可扩展性”,如下图所示,图中的Test Loss表示损失函数的值,用于衡量模型性能,损失越小模型越强)。 
4)总结
综上,数据规模的跃迁、算力基础设施的发展,和Transformer架构优异的可扩展性,共同推动了模型规模和性能的持续膨胀,迎来了“大模型时代”。
大模型计量单位
在大语言模型(LLM)及更一般的大模型研究中,通常从参数规模、训练数据集规模和计算规模三个维度来度量模型的规模。
1)参数规模(Parameters Scale)
大模型参数规模通常以B为单位,B是Billion的缩写,即10亿,10⁹。 如Qwen3-235B模型参数量为235B,即2350亿。
2)训练数据集规模
多模态模型的数据集格式五花八门,无法用统一单位度量,此处只讨论LLM。 LLM的训练是在文本语料上进行的,语料处理的第一步是分词为一系列token,所以通常用token的数量衡量LLM训练数据集规模。
1B token=10⁹ token=10亿token 1T token=10³ B token=10¹² token=1万亿token LLM的数据集规模通常用T token作为单位,如Qwen3预训练数据集规模为36Ttoken。
3)计算规模
计算规模是指大模型训练消耗的计算量。 大模型是一系列浮点数的组合,训练过程涉及大量浮点数运算,因此计算规模通常用FLOPs(Floating Point Operations,浮点运算次数)来衡量。
1FLOPs=1次浮点运算 1PFLOPs=10¹⁵ FLOPs 1EFLOPs=10³ PFLOPs=10¹⁸ FLOPs 现代顶尖的基础模型(LLM)通常用EFLOPs作为单位。计算规模通常不公开。 计算规模和硬件平台无关,描述模型理论上做了多少计算。
4)算力
算力是指“能算多快”,是指计算设备(显卡)单位时间内完成浮点运算的能力。单位通常是FLOPS(Floating Point Operations Per Second,每秒钟完成的浮点运算次数)。 现代GPU性能强大,通常用PFLOPS或TFLOPS作为算力单位。
1P = 10³T = 10⁶G = 10⁹M = 10¹²K = 10¹⁵ 1PFLOPS = 10¹⁵FLOPS 1TFLOPS = 10¹²FLOPS 浮点数有多种规格,如FP64、FP32、TF32等,同一款显卡在不同浮点数规格下的算力不同,因此在描述算力时,通常需要标注对应的浮点数规格。 如英伟达B200显卡的单卡
- TF32算力为2.5PFLOPS
- FP32算力为80TFLOPS
- FP64算力为40TFLOPS
随着硬件性能的发展,目前顶尖显卡的算力已迈入PFLOPS级别。
分类
1.按模型功能/输出形态分类
按“模型输出的数学形态 + 使用方式”分类。
1)生成式模型(Generative Model)
(1)定义 输入:上下文(控制生成结果)。 输出:样本,可以是token序列或别的形式。 核心特征是生成接近真实分布的样本,可以是各种模态的数据。
(2)典型用途 对话、推理、图像生成
(3)示例 GPT-5系列 / DeepSeek-V3系列 / Qwen3系列 / DALL·E / Nano-Banana
2)嵌入模型/向量表征模型(Embedding Model / Representation Model)
(1)定义 输入:各种模态的数据 输出:固定维度向量(dense vector) 不生成文本
(2)典型用途 语义搜索 RAG 向量检索 相似度计算
(3)示例 BGE系列 / Qwen3-Embedding系列 / Qwen3-VL-Embedding系列
3)重排序 / 相关性打分模型(Reranking / Scoring Model)
(1)定义 输入:(query,doc) 输出:相关性分数(scalar)
(2)典型用途 RAG的第二阶段(Top-K) 精排(Top-N(50/100/200) → Top-K(5/10/20))
(3)示例 BGE-Reranker系列 / Qwen3-Reranker系列 / Qwen3-VL-Reranker系列
4)分类器 / 判别模型(Classifier / Judge Model)
(1)定义 输入:各种模态数据 输出:标签 / 概率 / Yes-No
(2)用途 意图识别 内容审核 路由决策
(3)示例 通常是经过微调的小模型,如基于BERT微调的分类模型。
2.生成模型根据模态分类
1)什么是模态(Modality)?
模态是指人或机器感知世界的方式,常见的模态有:文本、图像、音频/语音、视频等。
根据模态,可以将大模型分为语言大模型、多模态理解大模型和多模态生成大模型。如果没有特别说明,“大模型”通常是指“语言大模型”。 
2)语言/文本模型(Language/Text Model)
又称为大语言模型(Large Language Model,简称LLM)。
(1)定义 输入:文本 输出:文本(token序列)
(2)典型能力 对话、写作、推理、代码生成
(3)示例 Qwen3系列 / DeepSeek-V3.2系列 / GPT-5系列(语言模块) / Gemini-3系列(语言模块)
注意:ChatGPT和Gemini都是一个以语言大模型为中枢的智能体系统,是面向用户推出的AI产品,支持文本生成、图像理解和生成。并不属于单一的某一类。
3)多模态理解模型(Multimodal Understanding Model)
(1)定义 输入:文本 + 图像 / 音频 / 视频 输出:通常是文本
(2)典型能力 看图说话(VQA) 文档理解(PDF / 表格 / 图像) 视频理解、音频理解
(3)示例 GPT-5(图片理解模块) / Qwen3-VL系列 / Gemini-3(图片理解模块)
4)多模态生成模型(Multimodal Generative Model)

(1)定义 输入:文本 / 图像 输出:图像 / 视频 / 音频
(2)子类 文生图(Text-to-Image) 文/图片生视频(Text/Image-to-Video) 文生音频(TTS / Music)
(3)示例
- 图像生成:Stable Diffusion系列 / DALL·E / GPT-Image-1.5 / Nano-Banana系列
- 视频生成:Sora系列 / Veo系列
- 音频生成:AudioLM / VALL-E
总结
按照功能分类
- 生成式大模型 GPT-5/DeepSeek-V3/Qwen3
- 嵌入模型 BGE/Qwen3-Embedding
- 重排序模型 BGE-Reranker/Qwen3-Reranker
- 分类模型 通常是经过微调的小模型
生成模型按照模态分类
- 大语言模型 Qwen3/DeepSeek-V3/GPT-5语言模块
- 多模态理解模型 Qwen3-VL/GPT-5(视觉理解模块)
- 多模态生成模型 Stable Diffusion/DALL·E/Nano-Banana
AIGC和AGI
1)AIGC的定义
AIGC(人工智能生成内容,Artificial Intelligence Generated Content)是以生成式模型为核心,基于对海量数据分布、模式与关联结构的学习,在人类提示或条件约束下,自动生成文本、图像、音频、视频、代码等多模态内容的生成技术及其应用。
简而言之,AIGC就是用AI生成内容。
2)AGI的定义
和大模型一样,AGI并没有统一的定义。 AGI(Artificial General Intelligence,通用人工智能)可以理解为一种具备跨领域、跨任务的通用认知能力的人工智能形态,能够在不同环境和目标下进行理解、学习、推理、规划与知识迁移,并在缺乏明确任务定义或规则约束的情况下,自主发现问题并制定解决策略,其整体智能水平接近或超越人类。
简而言之,AGI是通用人工智能,可以自主学习并解决大多数人类可以解决的问题。 目前,AGI尚未实现,涉及复杂决策、随机应变以及和物理世界交互的任务AI基本都无法完成。
3)对比

大模型的开源
大模型由四个要素构成:模型权重(参数)、训练代码、推理代码、训练数据集。 不同于传统软件的开源,大模型开源主要指开源权重(模型参数),可能包含推理代码,通常不包含训练代码和数据集。
1)开源模型
DeepSeek系列、Qwen系列、Llama系列。
2)闭源模型
GPT系列(不包括早期的GPT-1、GPT-2,以及最近开源的GPT-OSS系列) Gemini系列(大多数) Claude系列。
相关文章: 大模型快速入门-01大模型常识 大模型快速入门-02大语言模型的架构演进 大模型快速入门-03模型的训练范式和算力 大模型快速入门-04大模型的工程实现(上) 大模型快速入门-05大模型的工程实现(中)

![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)
