AI开放平台模型训练

PaLM——5400亿参数大型语言模型

PaLM(Pathways Language Model)是谷歌研发的大型语言模型,拥有5400亿参数。基于Pathways系统高效训练,具备卓越的自然语言理解、多步逻辑推理及代码生成能力。支持少样本学习,...

标签:

产品简介

PaLM(Pathways Language Model)是由谷歌研究团队开发的大型语言模型(LLM)。该模型拥有5400亿个参数,采用密集的仅解码器Transformer架构。PaLM旨在通过扩展模型规模来实现性能的突破,能够在无需大量特定任务数据收集或参数更新的情况下,通过少样本学习完成多种复杂的语言理解和生成任务。

核心功能与技术架构

PaLM的核心优势在于其高效的训练系统和强大的基础能力。它基于谷歌的Pathways系统进行构建,该系统能够协调加速器之间的分布式计算。PaLM在两个Cloud TPU v4 Pod上进行了大规模训练,使用了6144个芯片,实现了当时大型语言模型中最高的硬件FLOPs利用率(57.8%)。

在数据处理方面,PaLM使用了包含高质量网络文档、书籍、维基百科、对话记录以及GitHub代码在内的英语和多语言数据集。其词汇表设计具有“无损”特性,保留了所有空格,这对于代码处理尤为重要,并将数字拆分为单个数字令牌,以提升数值处理能力。

自然语言理解与生成

在29项广泛使用的英语自然语言处理(NLP)任务评估中,PaLM 540B在28项任务上超越了此前的大型模型(如GPT-3、GLaM、LaMDA等)的少样本学习性能。这些任务涵盖问答、完形填空、句子补全、常识推理及自然语言推断等。

此外,PaLM在多语言NLP基准测试中也表现出强劲性能,尽管其训练语料库中非英语内容仅占22%。在BIG-bench基准测试中,PaLM展示了区分因果关系、理解概念组合甚至通过表情符号猜测电影等高级能力,其性能随规模扩大呈现对数线性增长,未见 plateau 迹象。

逻辑推理能力

结合思维链(Chain-of-Thought)提示技术,PaLM在需要多步算术或常识推理的任务中展现出突破性能力。在GSM8K基准测试(包含数千道挑战性小学水平数学题)中,PaLM 540B通过8-shot提示解决了58%的问题,这一成绩超过了此前经过微调并结合外部计算器的GPT-3 175B模型,并接近9-12岁儿童的平均解题水平。

PaLM还能生成高质量的解释,针对需要多步逻辑推断、世界知识和深度语言理解的场景提供清晰的分析,例如解释网络上未收录的新颖笑话。

代码生成与修复

尽管预训练数据集中代码占比仅为5%,PaLM 540B在代码任务上表现优异。其在文本到代码(text-to-code)和代码到代码(code-to-code)任务中的少样本学习性能可与经过微调的Codex 12B相媲美,但使用的Python训练代码量仅为后者的五十分之一。

经过进一步微调的PaLM-Coder在代码修复任务DeepFix中表现出色,将C程序编译成功率提升至82.1%,优于此前的71.7%最先进水平,显示出解决软件开发中复杂错误的潜力。

适用人群与场景

  • 研究人员与开发者:用于探索大规模模型在自然语言处理、推理和代码生成方面的前沿能力。
  • 教育领域:辅助解决复杂数学问题,提供逐步推理过程,作为教学参考。
  • 软件工程:辅助代码编写、跨语言代码翻译及编译错误修复,提高开发效率。
  • 内容创作:进行多语言文本生成、摘要提取及创意写作辅助。

使用建议与伦理考量

在使用PaLM等大型语言模型时,建议用户关注其潜在风险。谷歌研究团队提供了模型卡片和数据表,详细记录了预期用途、测试结果以及偏差和风险分析。由于模型基于网络文本训练,可能存在某些偏见或生成不当内容的风险。

用户在进行特定领域应用时,应进行专门的领域和任务分析,以校准和缓解可能的危害。目前,针对防止恶意使用的防护措施及风险益处的深入理解仍是 ongoing research 的重点。

常见问题

PaLM如何处理多步逻辑推理问题?

PaLM通过结合模型规模与思维链(Chain-of-Thought)提示技术来处理复杂推理。这种方法将多步推理问题分解为中间步骤,类似于人类解决问题的方式。实验显示,这种机制显著提升了PaLM在算术和常识推理任务上的表现,使其能够生成明确的解释并提高解题准确率。

PaLM在代码生成方面的训练数据占比是多少?

PaLM的预训练数据集中,代码内容仅占5%。尽管如此,凭借大规模模型的样本效率优势,PaLM能够有效转移来自其他编程语言和自然语言数据的学习成果,在少样本设置下实现与专门微调模型相当的代码生成性能。

PaLM的训练效率如何体现?

PaLM通过Pathways系统实现了高效的分布式训练。在6144个TPU v4芯片的配置下,其硬件FLOPs利用率达到57.8%,这是当时同等规模大型语言模型中最高的效率。这得益于并行策略以及Transformer块的重构,允许注意力层和前馈层并行计算,从而获得编译器优化带来的加速效果。

数据统计

相关导航