Decoder-only models (architecture) — 仅解码器

From Systems analysis wiki
Jump to navigation Jump to search

仅解码器模型(Decoder-Only Models)是大语言模型(LLM)的一种主流架构,它完全基于Transformer架构的解码器(decoder)部分。这些模型专攻文本生成任务,是当今大多数聊天机器人和 AI 助手的技术基础。

推广并普及了这种方法的旗舰模型系列是 OpenAI 的 GPT 系列。

概念与架构

仅解码器模型的核心思想是序列的自回归生成(autoregressive generation)。这意味着模型基于所有先前已生成的词元(token)来预测下一个词元。用户的输入提示(prompt)和已生成的文本被视为一个单一序列,模型在此基础上进行续写。

从架构上看,模型由 N 个相同的解码器层堆叠而成。与编码器或完整的解码器不同,每个解码器层仅包含两个主要子层:

  1. 掩码多头自注意力 (Masked Multi-Head Self-Attention): 这是确保模型具有自回归特性的关键机制。在处理序列时,一个特殊的因果掩码 (causal mask) 会阻止每个词元“看到”其后的词元。因此,对位置 i 的预测仅依赖于位置 <i 的词元。
  2. 前馈神经网络 (Feed-Forward Network): 对每个词元的表示应用非线性变换。

在仅解码器模型中,没有交叉注意力 (cross-attention)机制,因为不存在可供“关注”的编码器。

预训练任务

仅解码器模型通过一项强大而单一的自监督任务进行训练:

因果语言建模 (Causal Language Modeling, CLM)

  • 工作原理: 模型学习预测序列中的下一个词元。在每个训练步骤中,它接收一段文本作为输入,并需要为下一个词元生成概率分布。
  • 目标: 在海量文本数据上,最大化预测出正确下一个词元的概率。这个看似简单的任务迫使模型学习语法、句法、世界知识以及复杂的语言规律。

应用

由于其自回归的特性,仅解码器模型非常适合任何需要生成文本的任务:

  • 自由形式的文本生成: 撰写文章、诗歌、剧本等。
  • 对话系统和聊天机器人: 以对话方式回答用户问题。
  • 文本摘要: 为长篇文章生成简明摘要。
  • 机器翻译: 尽管编码器-解码器模型更常用于此任务,但仅解码器模型也能处理翻译,只要在提示中明确说明任务即可(例如,“将以下英文翻译成中文:...”)。
  • 代码编写: 根据文本描述生成代码。
  • 上下文学习 (In-context learning): 凭借其庞大的规模,大型解码器模型展现出解决新任务的能力,只需在提示中提供少量示例(few-shot)甚至无需示例(zero-shot),而无需进行微调(fine-tuning)。

主要模型及其演进

  • GPT 系列 (2018-至今): 该方法的先驱和推广者。GPT-1 验证了预训练的有效性,GPT-2 展示了规模化的力量,而 GPT-3 则催生了 few-shot 能力。ChatGPT 和 GPT-4 使该架构成为 AI 助手的行业标准。
  • LLaMA (2023-至今): Meta推出的一系列开源模型,使强大的 LLM 更加普及,并激励了社区的创新浪潮。
  • Claude (2023-至今): Anthropic 开发的模型系列,通过 Constitutional AI (宪法 AI)技术专注于安全性和可控性。
  • PaLMGemini (2022-至今): Google 的旗舰模型。Gemini 也是一个原生的多模态仅解码器模型。

与其他架构的比较

基于 Transformer 的关键架构比较
架构 主要任务 上下文方向 典型模型
仅解码器 文本生成 单向(从左到右) GPT, LLaMA, Claude, Gemini
仅编码器 文本理解 双向 BERT, RoBERTa
编码器-解码器 序列到序列转换 双向(编码器)+ 单向(解码器) T5, BART, 原始 Transformer

参见

  • GPT