LLMs from Scratch官网
LLMs from Scratch 是 Sebastian Raschka 所著《Build a Large Language Model (From Scratch)》一书的官方配套代码仓库,托管在 GitHub 的 rasbt/LLMs-from-scratch 路径下。它的主张很直接:不调用任何现成的大模型库,只用 PyTorch 一行行把类 ChatGPT 的模型从数据处理写到指令微调。仓库按书的章节划分目录,从文本分词、注意力机制、GPT 架构实现、无标注数据预训练,一直到文本分类微调和指令跟随微调,每章都配 Jupyter notebook、精简版 Python 脚本和练习题解答,另有五个附录覆盖 PyTorch 速成、训练循环增强与 LoRA 参数高效微调。它解决的是”框架黑盒”问题——很多人熟练使用 transformers 库,却说不清 KV 缓存怎么工作、指令数据集该长什么样。仓库长期活跃维护,Bonus 目录还持续补充主流开源模型的从零复现代码。
LLMs from Scratch官网页面
LLMs from Scratch的主要功能
- 章节化的可执行代码目录:ch02 到 ch07 分别对应文本数据处理、注意力机制、GPT 架构、预训练、分类微调、指令微调,每个目录都能跑通,不必从头开始;
- 文本预处理全链路:从字符切分讲到 BPE 分词,再到滑动窗口 DataLoader、token 嵌入与位置嵌入的组合,产出一条完整可复用的数据管线;
- 注意力机制的渐进实现:先写最朴素的点积注意力,再加缩放、因果掩码、dropout,最后拼成多头结构,并提供简洁版对照实现帮助理解;
- 可直接复用的 GPTModel 类:LayerNorm、GELU、前馈网络、残差连接、Transformer 块逐一手写,最终组装成结构清晰、可加载权重的模型类;
- 预训练与生成策略:完整的训练循环、交叉熵损失计算、困惑度评估,以及温度采样与 top-k 采样等文本生成控制手段;
- 两类微调实战:一类是替换分类头做垃圾短信识别,讲清冻结与解冻策略;另一类是用 Alpaca 风格数据集做指令微调,把基座模型变成能对话的助手;
- 五个实用附录:附录 A 是 PyTorch 速成含多 GPU 训练脚本,附录 D 讲学习率调度、梯度裁剪等训练技巧,附录 E 从零实现 LoRA;
- 持续更新的 Bonus 材料:涵盖 KV 缓存推理加速、GQA 与滑动窗口注意力等变体、MoE 架构、DPO 偏好对齐,以及 Llama、Qwen、Gemma 等主流开源模型的从零复现;
- 工程化配套:提供 pip 可安装的 Python 包、Docker 与 DevContainer 环境配置、跨平台自动化测试,降低”环境装不上”的劝退率。
如何使用LLMs from Scratch
推荐使用流程:
- 执行 git clone –depth 1 https://github.com/rasbt/LLMs-from-scratch.git 拉取仓库,只取最新版可以显著加快下载;
- 先读 setup 目录下的环境说明,按建议装好 Python 与依赖,习惯容器的话直接用仓库自带的 Docker/DevContainer 配置;
- PyTorch 不熟就先做附录 A 的两个 notebook,把张量操作、autograd 和 nn.Module 过一遍再进主线;
- 按 ch02 到 ch07 的顺序推进,每章先跑通主 notebook,再看精简版脚本理解代码是如何被工程化收敛的;
- 每章做完练习题再对照 exercise-solutions 检查,这些题的区分度比正文示例更高;
- 跑到 ch05 时可以用书里提供的脚本加载官方 GPT-2 预训练权重,避免从零预训练带来的算力压力;
- 主线跑完后按需挑 Bonus 专题深入,比如做推理优化就看 KV 缓存和注意力变体,做对齐就看 DPO 那部分。
LLMs from Scratch的使用场景
- 想吃透底层的 AI 应用开发者:天天调 API 和 transformers 库,但需要在出问题时能定位到模型结构层面;
- 准备大模型岗面试的求职者:手写多头注意力、解释因果掩码、说明指令微调数据格式,都是高频考点;
- 高校课程与实验室培训:章节划分清晰、代码有测试、练习有答案,很适合作为一学期的课程配套材料;
- 需要自研小模型的团队:垂直领域数据量有限、不适合直接用大模型时,从小规模自训起步需要这套完整的工程参考;
- 研究注意力变体与推理优化的工程师:Bonus 里的 GQA、MLA、稀疏注意力、KV 缓存实现可以直接当作对照基线;
- 技术读书会共读:七章加五个附录的体量适合按周拆分,每次一章加一次代码复现和讨论。
LLMs from Scratch的价格与版本
GitHub 仓库本身完全免费开源,无需注册账号即可浏览和克隆,全部 notebook、脚本、练习答案和 Bonus 材料都可使用,用于自学、教学和研究都没有障碍。需要付费的是纸质书或电子书本体,由 Manning 出版社发行并在各大书店销售,价格随渠道和促销变动,作者另有一套配套视频课程,同样属于售卖的商业内容——但要强调的是,仓库里的代码是完整的,不买书也能跑通全部章节,书的价值主要在于系统的文字讲解和图示。真正的隐性成本是算力:主线章节刻意把模型规模控制在普通笔记本 CPU 可完成的范围内,代码检测到 GPU 会自动启用;但如果想把预训练扩展到更大语料,或者复现 Bonus 里的大参数量模型,就需要自备显卡或租用云端 GPU。指令微调章节用 Ollama 做本地评估,模型下载会占用一定磁盘空间。
LLMs from Scratch的常见问题解答
- 不买书只用仓库能学完吗?
- 可以,但体验有差别。仓库里的 notebook 带有相当完整的 Markdown 说明,代码注释也很细致,配合网上的公开资料自学完全走得通,很多人就是这么过来的。书的不可替代之处在于图示和思路铺垫——比如注意力从朴素版演进到多头版的中间推导、为什么某个设计要这样取舍,这些叙述性内容在代码注释里只能压缩表达。如果你自学能力强、看代码不吃力,先用仓库跑一遍,卡住的章节再考虑补书。
- 需要多好的硬件?没有显卡行不行?
- 没有显卡也能完成主线。作者明确把主章节的数据规模和模型参数量控制在常规笔记本可接受的范围,CPU 上跑一轮训练通常是分钟级到十几分钟量级,不需要专用硬件。代自动检测并使用可用的 GPU,有独显自然更快。真正需要算力的是两类情况:一是想在更大语料上做有意义的预训练,二是复现 Bonus 中 Llama、Qwen 这类模型的完整推理。这两种情况建议用云 GPU 按小时计费,或者直接加载官方开源权重跳过训练环节。
- 它和 Karpathy 的视频课程重复吗?先学哪个?
- 覆盖面有交叉但侧重完全不同。视频课程强在讲原理和思维过程,节奏是”讲者边想边写”,能把每个决策的动机说透,但内容止于 GPT 与分词器,不涉及下游微调。这个仓库强在体系完整和工程规范:章节划分严谨、代码有测试、覆盖分类微调、指令微调、LoRA、DPO 等完整链路,更接近可复用的工程模板。建议的顺序是先看视频课程建立梯度和注意力的直觉,再用这个仓库把知识结构补齐并沉淀成自己的代码库。
LLMs from Scratch官网网址
LLMs from Scratch 官方网址:https://github.com/rasbt/LLMs-from-scratch
相关资源:出版社图书页 https://www.manning.com/books/build-a-large-language-model-from-scratch
入门阶段建议先用 Neural Networks: Zero to Hero 建立梯度直觉,写注意力那章卡壳时打开 LLM Visualization 对照张量形状;中文读者想同步补深度学习基础,动手学深度学习 是配套性最好的一本。
OpenI AI时代点评
在”从零实现 LLM”这个赛道上,这个仓库大概是目前工程质量最高的一份公开材料。它跟很多同类项目的差别不在于讲了什么,而在于讲完之后你手里剩下什么——章节代码结构规整、有跨平台 CI 测试、有 pip 包,Bonus 目录还在跟进最新的注意力变体和开源模型复现,几乎可以直接当作自研小模型的起始脚手架。作者本人也确实在持续投入,这一点在开源教育项目里并不常见。适合谁:有 Python 和基本 PyTorch 经验、想把理解从 API 层推到架构层的工程师和研究生。不适合谁:完全没写过神经网络的新手,直接进来会被 ch03 的张量运算劝退,建议先补基础;同样不适合只想快速产出业务效果的团队,那种场景下微调开源模型的性价比远高于从零造。实操上有个容易被忽视的点:别只跑 notebook,一定要动手做练习题,那才是检验理解的地方。学完之后想扩展到工程部署和算力优化,可以看看 NVIDIA Deep Learning Institute 的实训内容,或者用 李沐 B站课程与论文精读 把论文追踪的习惯建立起来。
数据评估
本站OpenI提供的LLMs from Scratch都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 5月 29日 下午9:01收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

