LLM 基础概念,从向量到Transformer
30 节清晰简洁的大模型学习教程,每课从一个你一眼就懂的问题出发,先给最朴素的方案,再亲手发现不足、迭代改好——把向量、神经网络、注意力机制亲手「逼」出来。
HOW WE LEARN · 学习方式
所有技术,都是为了解决问题而出现的
没有人一开始就想到了RNN、LSTM、Transformer,都是在前一代技术方案上不断迭代调整,一步一步演化出来的。现在让我们从最开始那个问题开始,开启这趟自然语言处理的旅程。
01
提出问题
从一个小白都能听得懂的具体问题开始
→02
最小方案
先用最简单的技术方案来尝试解决这个问题。
→03
发现不足
这个最简单的技术方案遇到了它解决不了的部分
→04
迭代
对这个最简单的技术方案进行一轮迭代,解决了那部分无法解决的问题。
→05
总结
回头看——你刚刚「发明」的那个东西,就是教科书里那个术语。
「学习,不是背诵那些技术名词——
而是亲历那个技术是怎么被逼出来的过程。」
LEARNING PATH · 学习路径
从向量到 Transformer,一条线穿起来
卷III自然语言处理教机器读懂语言
卷V附录回到原典与全景
EXPAND · 逐课展开
想知道每一课在解决什么问题?下面把五个部分逐课摊开,标题旁那句话,就是这一课的开场问题。
一
基础数学
—— 把世界变成数字下一卷
二
神经网络
—— 让数字学会学习下一卷
三
自然语言处理
—— 教机器读懂语言下一卷
四
大语言模型
—— 一路长成ChatGPT- 19注意力机制翻译「它」的时候,该看句子里的哪个词?去学习 →
- 20多头注意力注意力只能有一种看法吗?——同时关注语法、语义、指代关系去学习 →
- 21Transformer 架构当注意力机制遇到残差连接和层归一化——质变发生了去学习 →
- 22Tokenizer 分词器大模型输入的不是字,不是词——那到底是什么?去学习 →
- 23编码器、解码器与大语言模型同样是Transformer,BERT为什么不能生成文章,GPT为什么是主流?去学习 →
- 24残差连接与层归一化96层Transformer——梯度怎么从第96层传回第1层而不消失?去学习 →
- 25预训练 · 监督微调 · 强化学习「会接话」和「会帮忙」之间有一道鸿沟——ChatGPT的三个训练阶段去学习 →
- 26KV缓存、稀疏注意力与FlashAttention注意力的账单是O(n²)——处理一本书,工程师用什么手段把它变快?去学习 →
- 27MoE 混合专家架构GPT-4据说有1.8万亿参数——推理每次却只用其中一小部分,怎么做到的?去学习 →
- 28模型蒸馏大模型的能力能「传授」给小模型吗?——软标签里藏着什么「暗知识」?去学习 →
- 29串讲:从N-gram到Transformer学了这么多细节,怎么把它们重新串成一条线?——每一代技术,都是来解上一代死结的去学习 →
- 30前沿与未来:下一程ChatGPT之后呢?——当下最活跃的研究方向,与大模型可能的演变去学习 →
下一卷
五
附录
—— 回到原典与全景🚀 开始你的 LLM 学习之旅!
建议从第 1 课开始,顺着学习路径一步步前进。每一课都建立在前一课的基础上,让你亲手把整个知识体系「搭建」起来。