45 张卡片

大模型是怎样工作的

精选

沿着 N-Gram 到 RLHF 的连续构建流程,理解 GPT 每一步为什么非得这样做。来源:《GPT 图解:大模型是怎样构建的》(黄佳,人民邮电出版社)。

45 张卡片/2026/9/7 发布
加载中…

主要解决什么问题

  • 会调用大模型 API,却说不清模型内部发生了什么,输出异常时只能反复试提示词。
  • 读过 Transformer 图解却串不起来:不知道每一代技术分别解决了上一代的什么缺陷,概念彼此孤立。
  • 自己训练或微调小模型效果差,无法判断问题出在分词、嵌入、掩码、解码策略还是数据规模。

值得掌握的核心知识

  • 沿 N-Gram、词向量、神经概率语言模型、RNN、Seq2Seq、注意力、Transformer、自回归 GPT 到对齐这条主线,说清每一步的动机与代价。
  • 解释词向量怎样从共现关系中被训练出来、存放在哪个权重矩阵里,以及查表为什么比独热编码乘矩阵更省。
  • 完整走一遍注意力计算:点积打分、缩放、归一化、加权求和,并由 Q/K/V 的来源判断属于哪一种注意力。
  • 说出 Transformer 编码器与解码器的子层构成,以及位置编码、残差连接、层归一化、前馈网络各自解决什么问题。
  • 区分训练与生成两阶段的自回归含义,掌握教师强制、因果掩码、贪婪与集束搜索,以及预训练、监督微调、奖励模型与对齐分别改了什么。

卡片

展示 20 张 / 共 45 张