译者: 覃立波 / 冯骁骋
出版社: 人民邮电出版社
出版年: 2025-4
ISBN: 9787115666000
页数: 310
装帧: 平装
定价: 109.00元
丛书: 图灵程序设计丛书
内容简介 · · · · · ·
本书是关于如何从零开始构建大模型的指南,由畅销书作家塞巴斯蒂安• 拉施卡撰写,通过清晰的文字、图表和实例,逐步指导读者创建自己的大模型。在本书中,读者将学习如何规划和编写大模型的各个组成部分、为大模型训练准备适当的数据集、进行通用语料库的预训练,以及定制特定任务的微调。此外,本书还将探讨如何利用人工反馈确保大模型遵循指令,以及如何将预训练权重加载到大模型中。
编辑推荐
大佬作者倾力打造:GitHub项目LLMs-from-scratch(4万星)作者、大模型独角兽公司Lightning AI工程师倾力打造
零基础实战指南:只需Python基础,手把手教你从零实现类ChatGPT模型
行业大咖力荐:本书获得多位AI领域大咖的推荐,包括新浪微博首席科学家&AI研发部负责人张俊林,NLP知名博客“科学空间”博主苏剑林,GitHub高级工程师Benjamin...
本书是关于如何从零开始构建大模型的指南,由畅销书作家塞巴斯蒂安• 拉施卡撰写,通过清晰的文字、图表和实例,逐步指导读者创建自己的大模型。在本书中,读者将学习如何规划和编写大模型的各个组成部分、为大模型训练准备适当的数据集、进行通用语料库的预训练,以及定制特定任务的微调。此外,本书还将探讨如何利用人工反馈确保大模型遵循指令,以及如何将预训练权重加载到大模型中。
编辑推荐
大佬作者倾力打造:GitHub项目LLMs-from-scratch(4万星)作者、大模型独角兽公司Lightning AI工程师倾力打造
零基础实战指南:只需Python基础,手把手教你从零实现类ChatGPT模型
行业大咖力荐:本书获得多位AI领域大咖的推荐,包括新浪微博首席科学家&AI研发部负责人张俊林,NLP知名博客“科学空间”博主苏剑林,GitHub高级工程师Benjamin Muskalla,Netflix资深科学家Cameron Wolfe,《设计机器学习系统》与AI Engineering作者Chip Huyen,FM Global高级数据科学家Vahid Mirjalili博士等
惊喜彩蛋DeepSeek:教你构建与优化推理模型的方法和策略
配套资源丰富:GitHub 4万星开源配套代码、YouTube配套视频教程
从零构建大模型的创作者
· · · · · ·
-
塞巴斯蒂安·拉施卡 作者
作者简介 · · · · · ·
塞巴斯蒂安·拉施卡(Sebastian Raschka)
极具影响力的人工智能专家,GitHub项目LLMs-from-scratch的星标数达4万。
现在大模型独角兽公司Lightning AI任资深研究工程师。博士毕业于密歇根州立大学,2018~2023年威斯康星大学麦迪逊分校助理教授(终身教职),从事深度学习科研和教学。
除本书外,他还写作了畅销书《大模型技术30讲》和《Python机器学习》。
目录 · · · · · ·
1.1 什么是大语言模型 2
1.2 大语言模型的应用 3
1.3 构建和使用大语言模型的各个阶段 4
1.4 Transformer架构介绍 6
1.5 利用大型数据集 9
· · · · · · (更多)
1.1 什么是大语言模型 2
1.2 大语言模型的应用 3
1.3 构建和使用大语言模型的各个阶段 4
1.4 Transformer架构介绍 6
1.5 利用大型数据集 9
1.6 深入剖析GPT架构 11
1.7 构建大语言模型 13
1.8 小结 14
第 2章 处理文本数据 15
2.1 理解词嵌入 16
2.2 文本分词 18
2.3 将词元转换为词元ID 21
2.4 引入特殊上下文词元 25
2.5 BPE 29
2.6 使用滑动窗口进行数据采样 31
2.7 创建词元嵌入 37
2.8 编码单词位置信息 40
2.9 小结 44
第3章 编码注意力机制 45
3.1 长序列建模中的问题 46
3.2 使用注意力机制捕捉数据依赖关系 48
3.3 通过自注意力机制关注输入的不同部分 49
3.3.1 无可训练权重的简单自注意力机制 50
3.3.2 计算所有输入词元的注意力权重 54
3.4 实现带可训练权重的自注意力机制 57
3.4.1 逐步计算注意力权重 58
3.4.2 实现一个简化的自注意力Python类 63
3.5 利用因果注意力隐藏未来词汇 66
3.5.1 因果注意力的掩码实现 67
3.5.2 利用dropout掩码额外的注意力权重 70
3.5.3 实现一个简化的因果注意力类 72
3.6 将单头注意力扩展到多头注意力 74
3.6.1 叠加多个单头注意力层 74
3.6.2 通过权重划分实现多头注意力 77
3.7 小结 82
第4章 从头实现GPT模型进行文本生成 83
4.1 构建一个大语言模型架构 84
4.2 使用层归一化进行归一化* 89
4.3 实现具有GELU*函数的前馈神经网络 94
4.4 添加快捷连接 99
4.5 连接Transformer块中的注意力层和线性层 102
4.6 实现GPT模型 105
4.7 生成文本 110
4.8 小结 115
第5章 在无标签数据上进行预训练 116
5.1 评估文本生成模型 117
5.1.1 使用GPT来生成文本 117
5.1.2 计算文本生成损失 119
5.1.3 计算训练集和验证集的损失 126
5.2 训练大语言模型 131
5.3 控制随机性的解码策略 137
5.3.1 温度缩放 138
5.3.2 Top-k采样 141
5.3.3 修改文本生成函数 142
5.4 使用PyTorch加载和保存模型权重 144
5.5 从OpenAI加载预训练权重 145
5.6 小结 152
第6章 针对分类的微调 153
6.1 不同类型的微调 154
6.2 准备数据集 155
6.3 创建数据加载器 159
6.4 初始化带有预训练权重的模型 163
6.5 添加分类头 166
6.6 计算分类损失和*率 172
6.7 在有监督数据上微调模型 176
6.8 使用大语言模型作为垃圾消息分类器 182
6.9 小结 184
第7章 通过微调遵循人类指令 185
7.1 指令微调介绍 186
7.2 为有监督指令微调准备数据集 187
7.3 将数据组织成训练批次 190
7.4 创建指令数据集的数据加载器 201
7.5 加载预训练的大语言模型 204
7.6 在指令数据上微调大语言模型 207
7.7 抽取并保存模型回复 211
7.8 评估微调后的大语言模型 216
7.9 结论 224
7.9.1 下一步 225
7.9.2 跟上领域的*进展 225
7.9.3 写在* 225
7.10 小结 225
附录A PyTorch简介 227
附录B 参考文献和延伸阅读 263
附录C 练习的解决方案 273
附录D 为训练循环添加更多细节和优化功能 285
附录E 使用LoRA进行参数*微调 294
附录F 理解推理大语言模型:构建与优化推理模型的方法和策略 308
· · · · · · (收起)
丛书信息
· · · · · ·
喜欢读"从零构建大模型"的人也喜欢的电子书 · · · · · ·
喜欢读"从零构建大模型"的人也喜欢 · · · · · ·
-
- AI工程 8.7
-
- 大模型技术30讲 7.0
-
- 图解大模型 7.8
-
- 大模型算法 9.1
-
- GPT图解 8.0
-
- 大模型动力引擎 8.5
-
- 大模型应用开发 RAG实战课 9.3
-
- 深度学习入门 9.6
-
- 人工智能现代方法(第4版) 9.1
从零构建大模型的书评 · · · · · · ( 全部 9 条 )
这是一本初学AI非常好的书
> 更多书评 9篇
论坛 · · · · · ·
| 第89页,样本维度问题 | 来自五彩石 | 2 回应 | 2025-11-07 22:45:19 |
以下书单推荐 · · · · · · ( 全部 )
- 机器学习-数学理论与实际领域应用入门进阶 (xiaoliable)
- 工作后购书目录 (张小国)
- 一个计算机爱好者的自我修养 (热心市民钟先生)
- 书单|AI大模型研发训练营 (欧阳)
- 书单|科学哲学与分析哲学20230607 (宇凡)
谁读这本书? · · · · · ·
二手市场
· · · · · ·
- 在豆瓣转让 有2286人想读,手里有一本闲着?
订阅关于从零构建大模型的评论:
feed: rss 2.0

4 有用 惟以不永怀 2026-03-01 22:25:48 江苏
图表展示各个阶段有点累赘,可以精简点不用那么多重复。本书名称虽是从零构建,但学习曲线不是那么平缓,还是需要有些先验知识和基础的。学习深度学习,我建议的学习书籍,先《Python神经网络编程》、再鱼书《深度学习入门》+《深度学习进阶》,最后再看这本《从零构建大模型》了解下大模型的基本原理。PS:学习时代码可以拍照直接贴到豆包中让大模型详细解释,比以前看书搜索效率高多了,不懂的地方还可以追问,用大模型... 图表展示各个阶段有点累赘,可以精简点不用那么多重复。本书名称虽是从零构建,但学习曲线不是那么平缓,还是需要有些先验知识和基础的。学习深度学习,我建议的学习书籍,先《Python神经网络编程》、再鱼书《深度学习入门》+《深度学习进阶》,最后再看这本《从零构建大模型》了解下大模型的基本原理。PS:学习时代码可以拍照直接贴到豆包中让大模型详细解释,比以前看书搜索效率高多了,不懂的地方还可以追问,用大模型学习大模型 (展开)
3 有用 Feynman 2025-06-05 09:17:43 北京
五星好评,看了之后能有一个系统性的认识。
27 有用 0xzzssss 2025-05-10 13:04:09 日本
好书。这本书去年10月才出的,讲的东西有点老。看了下吴恩达今年放上youtube 的春季课程《Language Modeling from scratch》,貌似更新一点,还有讲混合专家的内容。
1 有用 人间无事人 2026-05-16 12:49:42 广东
(本人完全计算机白痴)非常好的一本入门书,全部七章把大模型原理都讲清楚了(至少我觉得应该是讲清楚了,没看懂的部分都得算我自己的),跟着把全部代码敲一遍就能跑通一个简单的小bot了。当我输入what's your favorite color它回答我I like blue的时候还是很开心的。尽管本身因为缺乏太多前置知识所以绝大部分的代码内容都云里雾里,不过也给我提供了很好的知识框架和学习和了解的路径... (本人完全计算机白痴)非常好的一本入门书,全部七章把大模型原理都讲清楚了(至少我觉得应该是讲清楚了,没看懂的部分都得算我自己的),跟着把全部代码敲一遍就能跑通一个简单的小bot了。当我输入what's your favorite color它回答我I like blue的时候还是很开心的。尽管本身因为缺乏太多前置知识所以绝大部分的代码内容都云里雾里,不过也给我提供了很好的知识框架和学习和了解的路径,十颗星推荐啊。 (展开)
0 有用 方 圆 2025-11-16 17:23:42 北京
看完第三章后接下来的内容看不下去了,直接找大语言模型来解释之后的内容了...