写在前面

欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群(涵盖涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
这篇论文《UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing》讨论的不是一个表面上的“数据清洗工具”,而是一个更底层的问题:当互联网可用文本逐渐接近物理上限,LLM 继续提升到底还能靠什么?
过去几年,大模型行业最直接的增长路径,是更大的模型、更大的算力、更大的训练数据。但这个路径正在进入一个很现实的阶段:高质量公开文本不是无限的,低质量网页噪声也不是简单多抓一点就能弥补的。数据规模继续扩大当然仍然重要,但边际收益会越来越依赖“每一个 token 是否真的有训练价值”。
UltraX 给出的答案,是把预训练数据精炼从两类旧范式中往前推了一步:
- 不是只靠固定规则过滤,因为规则便宜但僵硬,很难处理实例级差异;
- 也不是直接让大模型端到端重写全部文本,因为质量可能更好,但成本、吞吐和长文一致性很难支撑预训练级规模;
- 而是让专家 LLM 先产生高质量精炼结果,再把“原文 -> 精炼文”的差异转换成可执行函数调用监督,训练一个轻量级 refiner 在大规模语料上输出结构化编辑程序。
Rocky 认为,这篇工作的本质价值在于:它把“数据清洗”从一次性规则工程,变成了可学习、可审计、可执行、可规模化的数据工程系统。真正值得看的是这条路线,而不只是论文里某几个 benchmark 分数。
论文的主要结论可以压缩成三句话:
一、问题背景:数据 scaling 的下一阶段,不是“更多”,而是“更有效”
Scaling Law 过去给行业带来了一个很强的直觉:模型参数变大、训练 token 变多,性能就会持续提升。但这个直觉有一个前提——你得有足够多、足够新、足够高质量的数据。
现在的问题是,公开可抓取文本不是无限矿藏。越往后,模型继续吃进去的新增数据越容易包含重复、模板、广告、导航栏、SEO 垃圾、格式破坏、机器生成低质文本和语义空洞内容。此时继续盲目扩大数据规模,会遇到两个问题:
- 训练 token 数上去了,但有效信息密度不一定上去;
- 数据噪声被模型吸收以后,会以更隐蔽的方式影响推理、常识、格式、事实和泛化能力。
这也是 UltraX 这篇论文切入点比较现实的地方。它没有把数据质量问题简化成“过滤掉坏文档”这么粗,而是把它拆成三种更细的操作:
- 有些文档应该完整保留;
- 有些文档确实应该整体删除;
- 但更多网页文本处在中间态:有价值内容和噪声混在一起,需要删除局部噪声、替换局部错误,甚至插入缺失结构。
这类中间态数据,恰恰是传统规则和端到端生成都不舒服的地带。
规则方法的问题,是它能处理明确模式,却很难处理实例级差异。比如“删除导航栏”“删除广告”“清理版权声明”看起来简单,但网页结构一变、语言一混、格式一破,规则就需要反复调参。
LLM 端到端改写的问题,则是成本和可靠性。让强模型把每个文档重写一遍,质量上限高,但输出 token 接近输入规模,吞吐慢、费用高;遇到长文还要切分和重组,稍不注意就会产生语义断裂、结构不一致或者过度改写。
所以 UltraX 的关键判断是:大规模预训练数据精炼不应该让模型“自由写作”,而应该让模型“输出可执行编辑程序”。
二、核心思路:把数据精炼变成函数调用,而不是端到端重写
UltraX 的整体流程可以分成两个阶段:先构建精炼模型,再把它部署到大规模语料上执行。

这张图是理解 UltraX 的关键。左侧是“监督怎么来”:从原始网页语料中采样 seed data,用自动 prompt 优化机制为不同数据集生成适配其噪声模式的 prompt,再让专家 LLM 生成端到端精炼文本。随后,UltraX 不直接拿这些精炼文本训练一个“重写模型”,而是把原文与精炼文之间的差异映射成函数调用序列。
右侧是“大规模怎么跑”:轻量级 refiner 对长文做滑动窗口预测,生成局部操作;系统再将局部操作映射回全局行号空间,做操作聚合、格式校验、歧义过滤、相邻操作合并和异常重复检测,最后由确定性执行器真正修改原始语料。
这个设计的技术味道很明确:LLM 负责高质量示范,小模型负责低成本执行;模型负责预测“应该怎么改”,程序负责确定性执行“真的怎么改”。
Rocky 认为,这里最值得重视的是“责任边界”被拆清楚了:
- 专家模型承担语义判断;
- 映射算法承担监督构造;
- 小模型承担大规模操作预测;
- 后处理与执行器承担可靠性约束;
- 最终编辑过程可以被记录、回放和审计。
这比“让一个大模型把文本改好”更像工业系统。
三、函数空间设计:为什么 add_line 不是一个小补丁
UltraX 的函数空间包括五类操作:
| keep_all() | 文档无需修改,原样保留 |
| remove_all() | 文档整体缺乏有效信息,全部删除 |
| remove_lines(start_line, end_line) | 删除连续行区间,适合导航栏、广告块、版权声明、模板噪声 |
| replace_str(line, source_str, target_str) | 对指定行内的局部字符串做替换,适合 HTML 残留、行内噪声、轻量格式错误 |
| add_line(base_line, sub_idx, new_str) | 在指定位置附近插入文本,用于结构恢复或内容补全 |
表面看,这就是一个编辑函数列表。但它背后其实对应了数据精炼的一个重要转向:从 deletion-only 走向完整编辑。
很多数据清洗系统天然偏向删除。因为删除最安全、最便宜,也最容易定义:遇到低质量片段就删掉。但删除不是万能的。真实网页文本里常见的问题不是“整段都没用”,而是结构坏了、标题和正文粘在一起、表单字段被抓成一行、多个新闻条目被拼成一坨、局部广告和有效内容混杂。
如果系统只有删除能力,它就会被迫在两个坏选择之间摇摆:
- 删除太少,噪声留下;
- 删除太多,有价值内容也没了。
add_line 的意义就在这里。它不是为了让模型自由创作,而是为了让程序化精炼能够表达“结构恢复”这一类操作。比如把粘连在一行里的字段重新拆成多行,把标题补回合适位置,把被压扁的文本恢复成更适合预训练的结构。
这也是 UltraX 相比 ProX-C/RefineX 这类函数调用式精炼方法的核心改进之一:函数空间更完整,能同时覆盖删除、修改和插入。
四、监督构造:真正难的不是函数调用,而是把文本差异变成可靠程序
UltraX 的一个关键工程难点,是如何得到高质量程序监督。
如果直接让 LLM 生成函数调用,问题是可靠性不够。LLM 可能生成不可执行的操作,可能定位不准,也可能在重复字符串场景里替换错位置。
UltraX 采用的是间接路线:
这里有两个核心模块。
第一是 Line Alignment Mapping。它在行级别对齐原始文本和精炼文本,判断哪些行被删除、哪些行被插入、哪些行需要进一步做字符级分析。它不只看单行内容,也考虑上下文和相对位置关系。
第二是 Dynamic Context Replacement。它处理行内修改,将字符级差异转换成 replace_str 操作。难点在于网页文本里经常有重复字符串。如果只预测 “把 A 替换成 B”,执行器可能替换错同名片段。UltraX 的做法是动态扩展前后上下文,让替换操作变成唯一可定位的局部修改。
这一步非常关键。因为大规模数据精炼不是 demo,不能只看输出文本“像不像改好了”。它必须可执行、可定位、可复现。一个替换操作如果在百万级、十亿级文档上有千分之一的定位歧义,最后都会变成不可控噪声。
所以 UltraX 又引入了低置信度样本过滤和按操作组合的配比采样。前者提升监督可靠性,后者稳定训练分布,避免模型只学到“保留”或只学到“删除”。
论文中的采样策略对比很有意思:
| keep_all | 60.000% | 14.419% |
| remove_lines + replace_str | 24.293% | 45.921% |
| remove_lines | 7.678% | 15.307% |
| replace_str | 4.870% | 12.874% |
| remove_all | 2.742% | 7.535% |
| 含 add_line 的组合 | 0.417% | 3.944% |
可以看到,Edit-Weighted 明显提高了编辑型样本比例,尤其是 remove_lines + replace_str。这意味着 UltraX 并不是训练一个“保守筛选器”,而是在训练一个真正会做细粒度编辑的 refiner。
五、大规模执行:系统价值藏在后处理里
很多论文讲数据清洗,会把重点放在模型能力上。但 UltraX 比较工程化的一点,是它认真处理了执行阶段的稳定性。
长文档无法直接一次输入 refiner,因此系统需要滑动窗口切分。窗口切分会引入新的问题:同一段文本可能出现在重叠窗口中,多个局部预测操作需要合并回原始文档;不同窗口可能对同一行给出不同修改;连续 replace_str 操作可能相互影响;重复模式还可能导致模型输出异常循环。
UltraX 对这些问题做了系统化后处理:
- 将局部窗口操作映射回全局行号;
- 只保留重叠窗口中非重复区域的操作;
- 过滤不可解析或不符合函数格式的调用;
- 统一处理 keep_all / remove_all;
- 过滤有歧义的替换;
- 合并同一行内连续或相互影响的 replace_str;
- 检测异常重复函数模式并 fallback。
这也是 Rocky 觉得这篇论文有工程价值的地方。它不是简单提出“用函数调用清洗数据”的概念,而是沿着规模化执行的真实问题往下做了很多约束。
对于大规模预训练数据来说,数据精炼系统最怕两种事:
一种是成本不可控。端到端重写会输出大量 token,吞吐和费用都不适合预训练规模。
另一种是错误不可审计。规则或模型一旦在某类数据上系统性误删、误改,很难回溯到底是哪一步出了问题。
UltraX 的程序化路径至少提供了一种更可控的工程界面:每条数据预测了什么操作、执行后变成什么样,可以保存、检查、统计,也可以做失败回退。
六、实验结果:UltraX 的提升不来自“删得更多”,而来自“删得更准”
论文实验使用五类大规模预训练语料:FineWeb、RedPajama-v2、AICC、Ultra-FineWeb、FineWeb-ProX-Doc。每类语料都构建 Raw、ProX-C、UltraX 三个 20B-token 训练集,并用约 1B 参数 MiniCPM 模型从零预训练,再用 LightEval 在 10 个 benchmark 上评估。
主结果可以先看平均分和胜出任务数:
| FineWeb | 45.08 | 45.05 | 46.14 | 10 / 10 |
| RedPajama-v2 | 43.09 | 43.47 | 43.98 | 7 / 10 |
| AICC | 41.63 | 42.15 | 42.43 | 5 / 10 |
| Ultra-FineWeb | 47.45 | 47.28 | 48.14 | 5 / 10 |
| FineWeb-ProX-Doc | 46.89 | 47.19 | 47.93 | 7 / 10 |
UltraX 在五个语料上都取得最高平均分。论文给出的总体结论是,相比 Raw 和 ProX-C,UltraX 分别带来约 2.00% 和 1.53% 的平均相对提升,并在 50 个任务-语料组合中拿到 34 个最佳结果。
这里要注意一个细节:在预训练数据实验里,1 个百分点左右的平均提升并不小,尤其是在同等模型、同等训练规模、只改变数据精炼方式的情况下。它说明模型能力差异不是来自架构、训练 token 或训练配置,而主要来自数据有效性变化。
更值得看的是 FineWeb 上不同训练 token 预算的曲线。

论文报告称,UltraX 在 16B training tokens 时达到 45.49 的平均分,已经超过 Raw 和 ProX-C 在 20B tokens 时的最终结果(分别是 45.08 和 45.05);到 20B tokens 时,UltraX 提升到 46.14。
这说明 UltraX 的价值不是简单“最终分更高”,而是提高了训练 token 的有效信息密度。换句话说,同样一批训练预算里,模型更早学到更有效的信号。
对训练大模型的人来说,这一点很现实。因为 pre-training 阶段最贵的不是写一篇论文,而是真实 GPU 时间。数据精炼如果能让模型用更少 token 达到同等能力,它就不是单纯的数据清洗成本,而是在换训练效率。
七、消融实验:完整函数空间、指令协议、编辑采样都不是装饰
UltraX 的消融实验主要证明四件事。
第一,系统指令有用。没有系统指令时,UltraX 也能把 FineWeb 平均分从 Raw 的 45.08 提升到 45.73;加入系统指令后,进一步提升到 46.14,并在 8/10 个任务上取得最佳结果。原因并不复杂:小模型输出函数调用时,需要清晰的操作定义、保留原则和删除边界,否则容易在“该删还是该留”上漂移。
第二,编辑型采样更适合完整 UltraX。Preservation-Weighted 更保守,在 ARC-C、ARC-E、OBQA、SciQ 等任务上有优势;Edit-Weighted 的平均分最高,说明增加修改类监督能增强细粒度清洗能力。但这里也有边界:保留监督不能太少,否则会诱导过度编辑。
第三,低质量 Tail 子集更值得积极精炼。论文用 Ultra-FineWeb classifier 将 FineWeb-20B 划分为高质量 Head(约 21.5%)和低质量 Tail(约 78.5%)。结果显示,仅精炼 Tail 通常收益更明显;仅精炼 Head 的收益更有限且不稳定。这符合直觉:高质量数据本身可改空间小,过强编辑反而可能破坏已有内容;低质量区域才是数据精炼最能释放收益的地方。
第四,完整函数空间最重要。论文比较了只做文档级决策、文档级决策 + 行级编辑、文档级决策 + 行内替换,以及完整 UltraX。结果如下:
| Document-Level Decision | 45.22 | 2 / 10 |
| Line-Level Editing | 45.35 | 1 / 10 |
| Intra-Line Replacement | 44.91 | 0 / 10 |
| Full UltraX | 46.14 | 8 / 10 |
这说明只做文档级保留/删除,确实能过滤一部分低价值样本;但如果没有行级删除、行内替换和插入之间的协同,系统很难处理真实网页噪声里的结构性冗余。完整 UltraX 的优势来自组合,而不是某一个函数的单点能力。
八、数据分布分析:UltraX 没有一味压缩 token
论文进一步分析了五个语料在精炼前后的文档级 token 分布。





更直接的数据是下面这张统计表:
| FineWeb | 29.20M | 20.00B | 28.86M | 17.58B(-12.1%) | 28.36M | 18.30B(-8.5%) |
| RedPajama-v2 | 22.12M | 20.00B | 19.83M | 15.65B(-21.8%) | 20.34M | 16.02B(-19.9%) |
| AICC | 21.28M | 20.11B | 15.92M | 13.45B(-33.1%) | 18.59M | 13.44B(-33.2%) |
| Ultra-FineWeb | 23.92M | 20.06B | 23.79M | 18.50B(-7.8%) | 23.74M | 19.30B(-3.8%) |
| FineWeb-ProX-Doc | 17.28M | 19.65B | 17.25M | 18.07B(-8.0%) | 17.25M | 18.97B(-3.4%) |
这里最重要的观察是:UltraX 并不是总比 ProX-C 删得更多。
在 FineWeb、RedPajama-v2、Ultra-FineWeb、FineWeb-ProX-Doc 上,UltraX 通常保留了更多 token。即便在 AICC 上两者 token reduction 接近,UltraX 也保留了更多非空文档。
这意味着 UltraX 的提升不是来自激进删除,而是来自更细粒度的“去噪 + 保留”平衡。ProX-C 可能更容易把有效内容一起删掉;UltraX 通过 replace_str、add_line 和更完整的行级操作,能够在删除低价值噪声时保留更多可训练信号。
这也是数据精炼和数据过滤的区别。过滤是问“要不要”;精炼是问“怎么改到更适合训练”。
九、函数分布:不同语料需要不同编辑强度
UltraX 还统计了在五类语料上生成的函数分布:
| FineWeb | 35.6 | 2.9 | 61.6 | remove_lines + replace_str 36.6% |
| RedPajama-v2 | 9.6 | 8.0 | 82.4 | remove_lines + replace_str 53.7% |
| AICC | 0.0 | 12.7 | 87.3 | remove_lines + replace_str 62.5% |
| Ultra-FineWeb | 52.1 | 0.7 | 47.1 | remove_lines + replace_str 28.8% |
| FineWeb-ProX-Doc | 45.1 | 0.2 | 54.8 | remove_lines + replace_str 34.9% |
这个分布很能说明问题。
Ultra-FineWeb 和 FineWeb-ProX-Doc 这类已经做过较强文档级筛选的数据,keep_all 比例更高,说明很多样本可以直接保留。AICC 和 RedPajama-v2 修改比例明显更高,说明它们需要更积极的结构删除与行内清理。
同时,最主要的修改组合是 remove_lines + replace_str。这说明真实网页噪声很少是单一形态:既有结构级冗余,也有行内局部污染。只做删除不够,只做替换也不够。
论文还给出一个补充统计:除 AICC 外,多数语料中被修改文档平均只包含约 2.3 到 2.9 个函数调用,且 remove_lines 多为短跨度删除。也就是说,UltraX 并不是对每篇文章大动刀,而是用紧凑的操作表达局部修改。
Rocky 认为,这个现象比单纯分数更有启发:好的数据精炼系统不应该追求“改得多”,而应该追求“在必要位置做最小可执行修改”。
十、质量评估与案例:防止过度编辑,才是数据精炼的难点
论文还从 FineWeb 中随机抽取 80K 个原始文档,对 ProX-C 和 UltraX 的精炼结果做成对质量评估。评分维度包括噪声移除、不过度编辑、内容保留、格式完整性和无价值内容识别。
结果如下:
| ProX-C | 9.1737 | 71.88 | 85.50 | 2.59 | 1.714 | 1.974 | 1.895 | 1.951 |
| UltraX | 9.6042 | 78.66 | 97.84 | 0.38 | 1.854 | 1.988 | 1.957 | 1.989 |
成对比较中,UltraX 在 22.90% 的样本上总分高于 ProX-C,65.30% 持平,仅 11.80% 低于 ProX-C;平均差值为 +0.431。最大的提升来自无价值内容识别和噪声移除。
这组结果要和前面的 token 分布一起看。UltraX 在很多语料上保留了更多 token,但质量评分更高。这说明它不是“少删所以保留更多”,而是在保持内容的同时更准确地去除噪声。
论文附录中的 case study 也强调了同一个问题:ProX-C 在一些场景会把有价值的产品规格、叙事内容、事件信息或结构化字段一起删掉;UltraX 则可以保留有效信息,只删除购物按钮、导航指令、邮箱模板、SEO spam 等低价值部分。在结构破坏场景里,add_line 和 replace_str 的组合可以恢复标题、表单字段或新闻条目结构,而 deletion-only 方法往往只能粗暴删掉。
这就是预训练数据精炼最难的地方:真正的目标不是清理得干净,而是在清理噪声时不伤害训练信号。
十一、补充图:FineWeb 十项基准的训练动态
论文附录还给出了 FineWeb 上十个 benchmark 随训练 token 增加的曲线。

这张图的作用,是帮助判断 UltraX 的收益是否只来自单一任务波动。从主文总结看,UltraX 在 FineWeb 的 10 个任务上全部胜出;从曲线趋势看,它更像是在多个能力维度上提升了训练数据的有效性,而不是针对某个 benchmark 的偶然优化。
当然,这里也要保持克制。论文实验用的是约 1B 参数 MiniCPM、20B token 预算。这个结论能否线性外推到更大模型、更长训练周期、更大语料规模,还需要后续验证。
十二、边界与可复现性:这篇论文不能被过度解读
UltraX 的方向有价值,但它也有明确边界。
第一,实验规模仍然有限。论文没有覆盖更大参数模型、更长训练周期和更大 token 预算。1B 模型上的数据效率提升很重要,但不等于在 10B、100B 乃至更大模型上幅度相同。
第二,RefineX 没有开源,因此论文未能做直接实验比较。这会影响方法间横向结论的完整性。
第三,论文主要关注英文网页语料。中文、多语言和代码混合数据的噪声结构更复杂,例如中英混排、异常换行、表格断裂、论坛模板、短视频文案、OCR 噪声、机翻污染等,UltraX 是否能直接迁移仍需要实验。
第四,种子监督质量依赖专家模型和自动评审机制。如果专家模型本身偏好有问题,或者 prompt optimization 对某类语料误判,后续的小模型会放大这种监督偏差。
第五,LLM-based quality evaluation 本身也需要谨慎看待。裁判模型可以提供有用信号,但不等价于人类标注,也可能继承模型偏好。
所以 Rocky 不建议把 UltraX 理解为“已经解决预训练数据质量问题”。更准确的说法是:它提出了一条比规则过滤和端到端改写更工程化的中间路线,并用相对系统的实验验证了这条路线在 1B/20B-token 设置下的有效性。
十三、对大模型团队的实际启发
这篇论文对大模型团队的启发,不在于照抄 UltraX 的每个模块,而在于它给出了一个数据工程范式:
第一,数据精炼要从文档级过滤走向实例级编辑。很多有价值数据不应该被整体保留或整体删除,而应该被局部修复。
第二,强模型不一定直接用于全量处理,更适合用于构造高质量监督。让专家 LLM 做“示范生成”,让小模型做“规模执行”,会比全量端到端改写更有成本优势。
第三,可执行程序比自然语言改写更适合数据流水线。它天然支持审计、统计、回滚和错误分析。
第四,数据质量不是“删得越多越好”。真正要优化的是 token 的有效信息密度,以及噪声移除和内容保留之间的平衡。
第五,数据精炼系统需要像模型训练系统一样严肃对待后处理、fallback 和执行校验。大规模语料里的小概率错误,最后都会变成系统性噪声。
十四、Rocky 的最终判断
UltraX 不是一个炫技型工作,它的技术路线相对朴素:专家模型生成精炼文本,算法映射成函数监督,小模型预测函数调用,执行器做确定性修改。
但这类朴素系统往往更接近真实产业价值。因为预训练数据质量问题不是一个靠 prompt 就能解决的问题,它需要一套成本、吞吐、可靠性、可审计性都成立的工程闭环。
Rocky 认为,UltraX 的长期价值主要体现在三个层面:
如果未来大模型继续进入“数据质量红利”阶段,那么类似 UltraX 的方法会越来越重要。模型架构和训练算法仍然是显性竞争点,但底层数据工程会变成更隐性的护城河。
工具不是护城河,判断才是护城河。对大模型团队来说,真正的竞争不会只是谁能抓更多网页,而是谁能把同样的原始语料加工成更高信息密度、更低噪声、更可控、更适合模型学习的训练分布。
UltraX 这篇论文,讲的正是这个方向。
术语与概念速查
| Pre-training data refinement | 对预训练语料进行清洗、过滤、修复和结构恢复,以提高有效训练价值 |
| Function-calling refinement | 让模型输出结构化编辑函数,而不是直接重写完整文本 |
| Program supervision | 用可执行程序作为监督信号,训练模型学习如何修改文本 |
| Line Alignment Mapping | 将原文和精炼文在行级别对齐,识别删除、插入和待进一步分析的修改 |
| Dynamic Context Replacement | 对行内修改动态扩展上下文,生成可唯一定位的替换操作 |
| Edit-Weighted sampling | 提高编辑类样本比例的监督采样策略 |
| Tail refinement | 针对低质量子集做更积极的数据精炼 |
| Effective information density | 每个训练 token 携带的有效学习信号密度 |
核心参考源
- arXiv 摘要页:https://arxiv.org/abs/2607.08646
- arXiv PDF:https://arxiv.org/pdf/2607.08646
- arXiv TeX Source:https://arxiv.org/e-print/2607.08646
推荐阅读
Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析DeepSeek系列核心基础知识
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的“ResNet”——LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
深入浅出完整解析ControlNet核心基础知识
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”:
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don‘t worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的“得力助手”,广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识





