AI学习网站

Neural Networks: Zero to Hero

Karpathy 免费课程,8 讲从手写自动求导引擎一路做到 GPT 与分词器。

标签: OpenIAPI,一站式大模型API聚合平台
一站式AI创作平台

Neural Networks: Zero to Hero官网

Neural Networks: Zero to Hero 是 Andrej Karpathy 自 2022 年底开始陆续更新的免费视频系列,目前共 8 讲、总时长约 13 小时,配套代码仓库为 karpathy/nn-zero-to-hero。它的教学路线与主流深度学习教程正好相反:不先 import torch 调用现成的 nn.Transformer,而是用几百行纯 Python 手写一个自动求导引擎,把反向传播拆解到加法、乘法这种最朴素的算子层面,再层层加码到字符级语言模型、多层感知机、BatchNorm 调试,最后现场敲出一个可训练的 GPT 和一个 BPE 分词器。它针对的痛点非常明确——很多人能把模型跑通,却说不清梯度是怎么回流的、参数初始化尺度为什么会影响收敛、tokenizer 为什么总有各种诡异行为。课程前置要求只有扎实的 Python 基础和高中程度的微积分记忆,主线代码在普通笔记本的 CPU 上就能跑完。

Neural Networks: Zero to HeroNeural Networks: Zero to Hero官网页面

Neural Networks: Zero to Hero的主要功能

  1. micrograd 自动求导引擎:第 1 讲用约 150 行 Python 实现一个标量级 Value 类,手工搭建计算图并递归回传梯度,把 autograd 这个”黑盒”彻底拆开;
  2. makemore 语言模型渐进演化:从 bigram 计数模型起步,同一份人名数据集贯穿多讲,逐步升级为 MLP、深层网络、卷积结构,能清楚看到每一步改动带来的损失变化;
  3. 激活值与梯度诊断:第 4 讲专门讲前向激活分布与反向梯度分布的直方图诊断,解释饱和的 tanh、死神经元、初始化尺度失配等常见故障,并引入 Batch Normalization;
  4. 手推反向传播训练:Backprop Ninja 一讲要求绕过 loss.backward(),手动对交叉熵、线性层、tanh、BatchNorm、嵌入表逐个求导,建立张量级而非标量级的梯度直觉;
  5. WaveNet 式层级结构:把两层 MLP 改造成树状分层网络,顺带讲透 torch.nn 内部是怎么组织模块的,以及真实开发中如何管理多维张量形状;
  6. 从零构建 GPT:对照 Attention is All You Need 与 GPT-2 结构,现场实现自注意力、多头拼接、残差连接、LayerNorm 与 Dropout,产出物就是 nanoGPT 的课堂版;
  7. GPT Tokenizer 全流程:最后一讲完整实现 BPE 分词器,解释为什么大模型算不好字符数、非英文文本为什么更费 token、特殊字符为什么会触发异常输出;
  8. 可执行 notebook 与练习题:每讲对应 lectures 目录下的 Jupyter notebook,视频描述里附带练习清单,核心组件还被拆成 micrograd、makemore、minbpe、nanoGPT 等仓库供延伸阅读。

如何使用Neural Networks: Zero to Hero

推荐使用流程:

  1. 先打开课程主页确认前置条件,确保能读懂 Python 函数、类和基本的链式求导;
  2. 执行 git clone https://github.com/karpathy/nn-zero-to-hero.git,建一个 venv 虚拟环境,安装 jupyter、numpy 与 torch;
  3. 严格按 1 到 8 的顺序看,跳讲会导致后面的代码上下文接不上;
  4. 关键动作是边看边敲——新建空白 .py 或 notebook,跟着视频暂停自己写,不要直接复制仓库代码;
  5. 每讲结束先做视频描述里的练习,再打开 lectures 目录的官方 notebook 对答案;
  6. 遇到某一层的张量变换想不明白时,配合交互式可视化工具边看边对照维度;
  7. 学完第 7 讲去读 nanoGPT 源码,学完第 8 讲去读 minbpe,再换一份自己的语料把 makemore 重跑一遍。

Neural Networks: Zero to Hero的使用场景

  1. 转型深度学习的软件工程师:能写业务代码但对模型内部没底,需要一条以代码为主、公式为辅的入门路径;
  2. 算法岗面试准备:需要能在白板上手写 attention、解释 softmax 梯度、说清 LayerNorm 与 BatchNorm 区别的候选人;
  3. 高校学生补底层:课堂上学的是框架 API,缺少一次把反向传播亲手实现一遍的经历;
  4. 论文阅读前的地基工程:准备读 GPT 系列或注意力变体论文,但需要先建立对张量维度和梯度流的直觉;
  5. 团队内训与读书会:13 小时的体量适合拆成 8 周共读,每周一讲加一次代码复现;
  6. 做推理优化与工程落地的人:理解 KV 结构、分词边界与数值稳定性问题,才能判断哪些优化是安全的。

Neural Networks: Zero to Hero的价格与版本

整套课程完全免费。视频托管在 YouTube 播放列表,无需注册即可观看,也无需订阅或购买任何会员;配套代码仓库以开源许可发布在 GitHub,可克隆、修改和用于教学。真正的隐性成本有三块:一是时间,13 小时视频加上认真敲代码和做练习,实际投入通常在数十小时;二是网络环境,YouTube 与 GitHub 的访问需要自行解决,B 站上存在第三方中文搬运但并非官方发布,更新可能滞后;三是算力,主线内容刻意把数据规模控制在笔记本 CPU 可承受范围内,但如果你想把 GPT 那一讲的模型扩到更大规模、或者换成更长的语料重训,就要自备 GPU 或租用云端实例,这部分费用与课程本身无关。课程没有官方证书,也没有作业批改和答疑服务,学习效果完全取决于自律程度。

Neural Networks: Zero to Hero的常见问题解答

完全没有机器学习基础可以直接学吗?
可以尝试,但要有心理准备。课程唯一硬性要求是 Python 写得利索,能理解类、递归和列表推导;数学方面只需要知道导数是什么、链式法则怎么用。真正卡人的不是数学,而是编程熟练度——如果看到 x @ w + b 无法在脑中推出张量形状,建议先补两周 Python 和线性代数基础再回来。相比之下,学过其他入门课再来看这门课的人,往往会有”原来当初那些概念是这个意思”的顿悟感。
学习和跑代码需要 GPU 吗?
主线内容不需要。第 1 讲的 micrograd 只依赖标准库和 numpy,之后几讲虽然用 PyTorch,但数据集规模被刻意压得很小,普通笔记本 CPU 几分钟就能训完一轮,Karpathy 明确控制了这一点以降低门槛。只有当你想把第 7 讲的 GPT 扩展到真实语料、或复现更大参数量时,才需要 GPU;届时可以用 Google Colab 的免费额度,或者租按小时计费的云 GPU,成本可控。
它和从零实现 LLM 的书籍教程该怎么选?
两者互补而非替代。这门课的强项是”讲透原理”,节奏偏演讲式,Karpathy 会把每一个决策的动机讲清楚,适合建立直觉;书籍类教程的强项是”体系完整”,章节划分严谨、代码工程化程度更高,还覆盖分类微调、指令微调、LoRA 等课程没讲的下游环节。常见的高效路径是先看完这门课的前 5 讲打牢梯度基础,再切到书籍教程按章节系统推进,遇到注意力和分词器时回头看第 7、8 讲加深理解。

Neural Networks: Zero to Hero官网网址

Neural Networks: Zero to Hero 官方网址:https://www.youtube.com/playlist

相关资源:课程大纲页 https://karpathy.ai/zero-to-hero.html,配套代码仓库 https://github.com/karpathy/nn-zero-to-hero

如果你更习惯”看着模型内部动起来”的学习方式,可以配合 LLM Visualization 一起用;想把这门课的手写实现延伸成一整套工程化代码,建议接着看 LLMs from Scratch。中文母语的学习者还可以把 动手学深度学习 当作术语对照手册。

OpenI AI时代点评

在铺天盖地的 LLM 教程里,这门课的稀缺性在于它坚决不走捷径。绝大多数教程的逻辑是”先让你跑出结果,再解释原理”,而 Karpathy 反过来,先让你手写一个 150 行的求导引擎,等你亲眼看见梯度是怎么从损失函数一路递归回到每个权重上,后面所有的 PyTorch API 就都变成了”这个我知道它在干嘛”。这种理解一旦建立就很难忘掉,价值远超过八小时视频本身。适合谁:有 Python 基础、想从”会调包”跨到”能改架构”的工程师和学生。不适合谁:三天内要交付业务模型的人,直接用现成框架调更划算;只想了解 AI 概念、不打算写代码的产品经理,看科普内容效率更高。使用建议上有两点要提醒:第一,务必自己敲代码,纯观看的留存率会掉到很低;第二,这门课覆盖的是”造轮子”能力,工程落地所需的分布式训练、推理服务、评测体系它都没讲,建议学完后接上 李沐 B站课程与论文精读 补论文视野,或用 Stanford CS224n 补 NLP 的学术脉络,形成”手写实现 + 论文追踪 + 学术体系”的三角结构。

数据评估

Neural Networks: Zero to Hero浏览人数已经达到0,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:Neural Networks: Zero to Hero的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找Neural Networks: Zero to Hero的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于Neural Networks: Zero to Hero特别声明

本站OpenI提供的Neural Networks: Zero to Hero都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 5月 29日 下午9:03收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

相关导航