Decoder-only models (architecture) — 仅解码器
Jump to navigation
Jump to search
仅解码器模型(Decoder-Only Models)是大语言模型(LLM)的一种主流架构,它完全基于Transformer架构的解码器(decoder)部分。这些模型专攻文本生成任务,是当今大多数聊天机器人和 AI 助手的技术基础。
推广并普及了这种方法的旗舰模型系列是 OpenAI 的 GPT 系列。
概念与架构
仅解码器模型的核心思想是序列的自回归生成(autoregressive generation)。这意味着模型基于所有先前已生成的词元(token)来预测下一个词元。用户的输入提示(prompt)和已生成的文本被视为一个单一序列,模型在此基础上进行续写。
从架构上看,模型由 个相同的解码器层堆叠而成。与编码器或完整的解码器不同,每个解码器层仅包含两个主要子层:
- 掩码多头自注意力 (Masked Multi-Head Self-Attention): 这是确保模型具有自回归特性的关键机制。在处理序列时,一个特殊的因果掩码 (causal mask) 会阻止每个词元“看到”其后的词元。因此,对位置 的预测仅依赖于位置 的词元。
- 前馈神经网络 (Feed-Forward Network): 对每个词元的表示应用非线性变换。
在仅解码器模型中,没有交叉注意力 (cross-attention)机制,因为不存在可供“关注”的编码器。
预训练任务
仅解码器模型通过一项强大而单一的自监督任务进行训练:
因果语言建模 (Causal Language Modeling, CLM)
- 工作原理: 模型学习预测序列中的下一个词元。在每个训练步骤中,它接收一段文本作为输入,并需要为下一个词元生成概率分布。
- 目标: 在海量文本数据上,最大化预测出正确下一个词元的概率。这个看似简单的任务迫使模型学习语法、句法、世界知识以及复杂的语言规律。
应用
由于其自回归的特性,仅解码器模型非常适合任何需要生成文本的任务:
- 自由形式的文本生成: 撰写文章、诗歌、剧本等。
- 对话系统和聊天机器人: 以对话方式回答用户问题。
- 文本摘要: 为长篇文章生成简明摘要。
- 机器翻译: 尽管编码器-解码器模型更常用于此任务,但仅解码器模型也能处理翻译,只要在提示中明确说明任务即可(例如,“将以下英文翻译成中文:...”)。
- 代码编写: 根据文本描述生成代码。
- 上下文学习 (In-context learning): 凭借其庞大的规模,大型解码器模型展现出解决新任务的能力,只需在提示中提供少量示例(few-shot)甚至无需示例(zero-shot),而无需进行微调(fine-tuning)。
主要模型及其演进
- GPT 系列 (2018-至今): 该方法的先驱和推广者。GPT-1 验证了预训练的有效性,GPT-2 展示了规模化的力量,而 GPT-3 则催生了 few-shot 能力。ChatGPT 和 GPT-4 使该架构成为 AI 助手的行业标准。
- LLaMA (2023-至今): Meta推出的一系列开源模型,使强大的 LLM 更加普及,并激励了社区的创新浪潮。
- Claude (2023-至今): Anthropic 开发的模型系列,通过 Constitutional AI (宪法 AI)技术专注于安全性和可控性。
- PaLM 与 Gemini (2022-至今): Google 的旗舰模型。Gemini 也是一个原生的多模态仅解码器模型。
与其他架构的比较
| 架构 | 主要任务 | 上下文方向 | 典型模型 |
|---|---|---|---|
| 仅解码器 | 文本生成 | 单向(从左到右) | GPT, LLaMA, Claude, Gemini |
| 仅编码器 | 文本理解 | 双向 | BERT, RoBERTa |
| 编码器-解码器 | 序列到序列转换 | 双向(编码器)+ 单向(解码器) | T5, BART, 原始 Transformer |
参见
- GPT