欢迎光临
我们一直在努力

好书推荐|全球畅销榜上榜图书《从零构建大模型》

一、导语

如今,几乎每个人的工作和学习都或多或少地借助着生成式AI:聊天问答、辅助编程、文案润色的背后,都站着一个大语言模型。但对绝大多数开发者而言,这项技术更像一只打不开的“黑盒”——会调接口、会写提示词的人很多,能说清一段文本在模型内部如何被切分、编码,如何经过注意力层层加工并最终逐词吐出回答的人却寥寥无几。想真正吃透原理,与其反复翻论文、读二手解读,不如挽起袖子,从第一行代码开始,亲手把一个大模型完整地写出来、训出来。

这正是Sebastian Raschka所著《Build a Large Language Model (From Scratch)》的写作初衷。作者在GitHub上维护的配套仓库LLMs-from-scratch广受好评,是该平台上热度最高的LLM教学项目之一;英文版尚在预印连载阶段就被全球读者不断催更,正式出版后长期占据Amazon相关品类榜单前列。这本书的简体中文版《从零构建大模型》由人民邮电出版社旗下图灵公司引进出版,覃立波、冯骁骋、刘乾三位深耕NLP的学者担纲翻译,上市后迅速成为国内大模型方向最受关注的技术新书之一。接下来,就带大家全面认识一下它。

二、图书推荐

作者:Sebastian Raschka(译者:覃立波、冯骁骋、刘乾)

推荐语:这是一本让你"亲手敲代码、真正懂原理、跑得动模型"的大模型从零构建实战指南。

三、作者和译者介绍

1.作者

Sebastian Raschka

知名机器学习研究者、畅销书作家与开源贡献者,现任Lightning AI首席AI教育官,曾在美国威斯康星大学麦迪逊分校从事深度学习研究工作。他在机器学习与深度学习领域深耕多年,尤其擅长将复杂的算法原理以清晰易懂的方式传递给读者。其代表作《Python机器学习》自出版以来畅销全球,被翻译为多国语言,成为无数开发者踏入机器学习领域的启蒙读物。此外,他还著有《大模型技术30讲》(Machine Learning Q and AI)等广受好评的作品。在学术研究方面,他在深度学习模型效率优化、大语言模型训练技术等方向发表了多篇具有影响力的论文。他长期活跃于技术社区,其个人博客与GitHub项目深受全球开发者追捧。

个人主页Sebastian Raschka, LLM Research Engineer | Sebastian Raschka, PhD

2.译者

(1)覃立波

中南大学特聘教授、博士生导师。2018年于香港中文大学获得博士学位,随后加入腾讯AI Lab担任自然语言处理研究员,研究方向包括人工智能、自然语言处理、大模型技术等。

(2)冯骁骋

哈尔滨工业大学计算学部社会计算与信息检索研究中心教授、博士生导师,国家高层次青年人才计划入选者,研究方向包括自然语言处理、大模型技术等。

个人主页冯骁骋 – 哈尔滨工业大学教师个人主页

(3)刘乾

新加坡某公司研究科学家,主要研究方向为代码生成与自然语言推理、大模型技术等。

个人主页Qian Liu · 刘乾

四、图书具体信息

图1 书籍的封面

1. 内容架构

作为一本以"动手实现"为核心主线的大模型实战指南,本书围绕"理解原理——处理数据——构建模型——预训练——微调应用"五大阶段展开。全书共7章并配有附录,循序渐进地带领读者完成一个类GPT大模型的完整构建流程,让读者在每一行代码的编写中逐步建立起对大模型工作原理的深刻认知。

第1章"理解大语言模型"为全书奠定认知基础,系统梳理了LLM的发展脉络、核心概念以及构建与使用LLM的三个关键阶段——预训练、微调与对齐,帮助读者在动手之前先建立起清晰的全局图景。

第2章"处理文本数据"聚焦于大模型的"食粮"准备环节,详细讲解如何将原始文本切分为词元(Token)、构建词表、生成训练所需的词元嵌入与位置嵌入,这是理解模型如何"阅读"人类语言的第一步。

第3章"编码注意力机制"深入到大模型最核心的技术创新,从最基础的注意力概念出发,逐步推导并实现自注意力、因果注意力与多头注意力机制,让读者真正理解Transformer为何能够捕捉长距离的语义依赖关系。

第4章"从头实现GPT模型进行文本生成"则将前述模块组装成一个完整的GPT架构,涵盖层归一化、前馈网络、残差连接等关键组件,最终实现文本生成功能,让读者亲眼见证一个能够"说话"的模型在自己手中诞生。

第5章"在无标签数据上进行预训练"揭开预训练的神秘面纱,讲解模型如何通过"预测下一个词"这一简单却强大的自监督学习目标,在海量无标注文本中积累通用语言能力,并介绍如何加载与评估预训练模型。

第6章"针对分类的微调"与第7章"通过微调遵循人类指令"则分别展示如何让预训练模型适配具体下游任务——前者聚焦于垃圾邮件分类等文本分类场景,后者则讲解如何通过指令微调让模型学会理解并执行人类指令,最终蜕变为一个可交互的对话助手。

附录部分补充了PyTorch基础、训练优化技巧等实用内容,是学习本书的补充材料。

2. 图书特色

本书最大的特色在于"代码驱动、从零搭建"的实战导向。与许多停留在理论讲解或API调用层面的图书不同,本书坚持让读者亲手编写每一行核心代码,从词元化器到注意力层,从GPT架构到训练循环,所有关键组件均由读者自行实现。这种"造轮子"式的学习路径看似费时费力,却能帮助读者建立起对大模型内部机制的透彻理解,真正做到知其然更知其所以然。当读者亲手跑通第一个生成文本的模型时,那种"原来如此"的顿悟感,是任何理论读物都无法替代的。

此外,本书的内容编排极具工程化思维,采用模块化拆解的方式,将复杂的大模型系统分解为一个个可独立理解、可单独测试的功能单元,每个章节都配有完整的可运行代码与详尽的图示说明,读者可以边读边练、边学边验证。书中所有代码均基于PyTorch框架编写,风格简洁清晰,便于读者理解与二次开发。配套的GitHub开源仓库持续更新,提供了完整的代码实现、数据集与训练脚本,并获得了全球开发者的认可,形成了活跃的技术讨论社区。整体而言,本书既适合作为有一定Python与深度学习基础的读者进阶大模型领域的实战指南,也可作为高校人工智能相关课程的教学参考用书,是一本兼具深度与可操作性的大模型构建宝典。

3. 图书目录和配套资源

(1)图书目录

本书以代码为主线,以原理为内核,模块清晰,讲解透彻,对读者深入理解大模型内部机制并动手实践非常有帮助。为方便读者了解书籍的内容架构,给出本书的目录如下。

图2 书籍的目录

(2)配套资源

代码下载https://github.com/rasbt/LLMs-from-scratch

习题解答:本书配有专门的习题解答,目前已经推出中文版,可与图书一起购买。

(3)购买链接

本书是学习大模型原理与构建的畅销书籍,跟着本书亲手敲代码即可搭建你的第一个GPT模型。书籍内容架构清晰,知识点覆盖全面,讲解深入浅出,以代码驱动的方式呈现大模型的核心原理,通俗易懂。重要的是,书籍提供了详尽可运行的开源代码与配套数据集,让读者上手构建大模型变得切实可行。

在人工智能普遍应用的时代,大量的论文和书籍可能都是人工智能撰写的。一篇高质量的论文,一本高质量的书籍,这些都需要专业人士为您仔细挑选。公众号为读者遴选人工智能好书,帮助读者高效学习人工智能。通过公众号给出的链接进行购买,价格更实惠。您可点击链接好书推荐|全球畅销榜上榜图书《从零构建大模型》放心购买。

公众号已经开通商品橱窗功能,商品橱窗列出了学习人工智能的高质量教材,并将不断更新最新教材。读者可以通过购买和阅读商品列表中的教材,高效学习让人工智能,不必自己再花时间去搜集高质量教材,省心又省力。具体操作如下图所示,请先打开《人工智能怎么学》公众号,然后点击商品橱窗即可查看商品列表。您可在商品列表选择需要的教材进行购买。读者通过公众号的商品橱窗购买人工智能精品教材,将获得更多优惠。

注:本推文由图灵编辑部授权发布,所有材料已获得授权。

赞(0)
未经允许不得转载:171主机测评 » 好书推荐|全球畅销榜上榜图书《从零构建大模型》
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址