PaLM (Pathways Language Model) — 路径语言模型

From Systems analysis wiki
Jump to navigation Jump to search

PaLMPathways Language Model,路径语言模型)是一个由谷歌公司开发的大型语言模型(LLM)家族。该模型的首个版本于2022年4月发布,拥有5400亿参数,在当时是全球规模最大的语言模型之一,通过大规模扩展展现了突破性的能力[1]

PaLM的关键技术基础是Pathways——谷歌推出的新一代机器学习系统架构,它能够高效地协调数千个加速器芯片上的分布式计算[2]。PaLM是该系统的首次大规模应用展示,在巨大的规模下实现了前所未有的训练效率。

Pathways系统:规模化的基础

Pathways概念由谷歌于2021年提出,旨在创建一个能够有效泛化不同领域知识并同时执行数千个任务的单一神经网络。PaLM成为该系统的首次大规模应用:其训练过程并行分布在6144个专用TPU v4处理器上,这些处理器组成了两个云端集群(TPU v4 Pods)[1]

在当时,这是有史以来用于训练单个模型的最大TPU配置。该系统实现了创纪录的硬件利用效率(57.8% FLOPs),从而在规模上远超以往的项目,并成功训练出一个拥有超过五千亿参数的模型[3]

架构与训练数据

模型架构

PaLM是一种密集的(非稀疏)语言模型,采用“仅解码器”(decoder-only)架构,类似于GPT系列模型。这种架构专注于下一个词元(token)的预测任务,非常适合文本生成。与标准的Transformer架构不同,PaLM采用了一些关键修改以提升效率[1]

  • 并行层:注意力机制和全连接层并行计算,使训练速度提升了约15%。
  • SwiGLU激活函数:使用SwiGLU激活函数替代标准的ReLU,显著提升了模型质量。

训练数据

PaLM的训练使用了一个包含7800亿个词元的高质量语料库。该数据集是多语言且多样化的,包括[1]

  • 高质量的网页文档和书籍。
  • 维基百科文章。
  • 社交媒体对话(占语料库的50%)。
  • 来自GitHub的源代码(占语料库的5%)。

约78%的数据为英语,其余22%为多语言数据集。为了进行词元化,模型采用了一种特殊的“无损”方法,保留了所有空格(对代码至关重要),并将无法识别的Unicode字符分解为字节。

能力与成果

涌现能力与少样本学习(few-shot learning)

PaLM证明,模型规模、数据量和计算能力的增加可以催生涌现(emergent)能力(即意外出现的能力)。在许多任务上,模型的性能仅在达到最大规模时才出现急剧的非线性增长,这表明模型获得了以往未曾观察到的新能力[3]

该模型在少样本学习(few-shot learning)模式(即不进行微调,仅在提示词中提供少量示例)下进行了评估,并在29个流行的自然语言处理基准测试中的28个上超越了之前的大型模型(如GPT-3和LaMDA)。在综合性任务集BIG-bench上,PaLM成为首个性能超越人类测试者平均水平的模型[1]

思维链推理(Chain-of-Thought)

PaLM最显著的成就之一是,在使用“思维链”(chain-of-thought prompting)提示技术时,展现出多步逻辑推理的能力[1]。该方法旨在为模型提供将任务解决方案分步拆解的示例。通过学习这些示例,PaLM能够生成自己的“思维链”来解决新的复杂问题,例如:

  • 数学问题:在GSM8K测试(小学水平的数学应用题)中,PaLM解决了58%的问题,超越了之前由经过微调的模型创下的最佳纪录。
  • 常识性问题:模型能够为非常规问题生成详细解释,例如解释以前从未见过的笑话。

这种能力使模型的“思考”过程更加透明,也更接近人类的思维方式。

代码生成与多语言能力

尽管源代码仅占训练数据的5%,但PaLM在代码生成和转换任务上表现出的水平可与专门的模型OpenAI Codex相媲美。该模型还在包括翻译在内的多语言任务中展示了强大的能力[3]

演进与后续模型:PaLM家族

PaLM成为谷歌开发的整个模型家族的基础。

PaLM 2 - PaLM 2

于2023年5月发布的PaLM 2是其效率更高、多语言能力更强的后续版本。其重点不再是追求参数数量,而是转向提升训练数据质量和架构效率。PaLM 2在超过100种语言的文本上进行训练,在逻辑、编程和翻译方面表现出更强的能力[4]。该模型提供四种尺寸(从最小到最大):GeckoOtterBisonUnicorn。其中最紧凑的版本(Gecko)足够轻量,可以在移动设备上离线运行。

专业化版本

基于PaLM和PaLM 2,谷歌为特定领域创建了多个版本:

  • Med-PaLM 2:专为医疗领域设计的模型。它成为首个在美国医师执照考试(USMLE)问题上达到专家水平的人工智能系统[4]
  • Sec-PaLM 2:专注于网络安全的模型,经过训练可用于识别漏洞和分析恶意代码[5]

PaLM-E:多模态版本

PaLM-E(Pathways Language Model Embodied)是一种多模态模型,它将PaLM语言模型与来自视觉转换器(Vision Transformer, ViT)的视觉数据相结合。这使得模型能够同时处理文本和图像,解决与物理世界相关的任务,例如控制机器人[6]

伦理考量与局限性

PaLM的创建者强调,在开发大型语言模型时必须采取负责任的态度。官方发布的科研论文对模型生成文本中可能存在的偏见与毒性进行了分析。为确保透明度,谷歌为PaLM发布了模型卡片(Model Card)数据表(Datasheet),其中记录了数据集的特征、测试结果以及已发现的局限性[1]。这些措施符合负责任AI的现代实践,旨在降低由偏见和生成有害内容所带来的风险。

外部链接

参考文献

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

注释

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]