LLM 原理与训练
从零理解 Token、Transformer、训练、后训练与推理。
文章
1 篇后续专题
8 个选题- 《Attention Is All You Need》精读:Transformer 解决了什么待深入
- 现代 LLM 的 Transformer:从 Token 输入到下一个 Token待深入
- Tokenization:模型看到的文字为什么和人不一样待深入
- KV Cache:大模型生成为什么越来越占显存待深入
- LLM 预训练:数据、目标函数与 Scaling Law待深入
- 大模型微调:Full Fine-tuning、LoRA 与 QLoRA待深入
- LLM 后训练:从 SFT、RLHF、DPO 到 GRPO待深入
- 推理优化:Continuous Batching、PagedAttention、量化与投机解码待深入