分享
05|大模型如何工作
输入“/”快速插入内容
🐱
05|大模型如何工作
用户4739
用户4739
2024年8月16日修改
大家好,我是大圣,一个致力于使用AI技术将自己打造为超级个体的程序员。
一、写在前面
这篇文章带大家一起了解下大模型的工作原理。
请注意,本篇内容是非技术向文章,文章旨在进行科普,而并非是技术研究。
但尽管如此,本文内容还是会有一些难懂,我建议你可以多看几遍。
如果你想要更深度的使用AI,大模型这一个概念是无法绕开的
本文分两部分:
•
我写的文字部分,我期望通过和人脑进行对比,让你对大模型有一个感性的认识
•
B站的两个神级视频,建议在阅读完我的文字之后开始观看
之所以建议首先阅读文字,是因为B站的两个视频还是蛮长的。
二、大模型的基本概念
当我们说大模型时我们在说什么
在人工智能领域,"大模型"与"大语言模型"是两个关键概念,都指向以庞大规模和复杂性为特征的算法模型。
•
大模型(Large Model)
:如其名,依赖于大量数据和算法的复杂性,广泛应用于图像识别、自然语言处理等多种任务中。
•
大语言模型(Large Language Model)
:作为大模型的一种特例,专注于处理和理解自然语言,包括文本生成和语言翻译。通过分析海量的文本数据,这些模型能够学习语言的深层规律和结构。
那么,何为"大"?在大模型的语境中,"大"主要指模型的规模,这可以从两个方面来理解:
•
一是模型参数的数量,它直接关联到模型能够捕获的数据特征的丰富性和处理任务的复杂度;
•
二是模型训练所需的数据量,确保模型能学习到充足的知识,防止过拟合。
因此,"大"不仅意味着对巨量数据资源的需求,也意味着对计算资源的巨大需求。以生成式AI模型ChatGPT为例,其训练可能需要至少1万张英伟达A100显卡,考虑到每张显卡的高昂成本,这表明仅算力投入就可能超过数亿元。
用人脑来理解大模型
大模型由三个层次来构成,分别是算法(模型结构)、模型参数(数量和数值)、训练数据。为了更好的理解大模型,我们可以将这三个层次映射到人类的大脑
•
算法(模型结构)
:想象这就像是大脑的基本工作方式或“使用说明书”。就如同我们学习走路或说话遵循某种基本规则一样,算法告诉大模型如何基本地处理和理解信息
•
模型参数
:这可以比作是你的生活经验和记忆,它们让你变得独一无二。比如,你学会骑自行车后,大脑就记住了如何保持平衡的“设置”(参数)。在大模型中,这些参数是它通过查看大量数据学到的“经验”,帮助它做出决策
•
训练数据
:就像是人通过看、听、感觉到的一切来学习新事物。假设你去过很多国家,你的大脑就会根据这些旅行的经历来理解世界。对于大模型,训练数据就是它用来学习的信息,这些信息帮助模型“体验”世界。
📍
通过这种方式,我们可以把大模型想象为一个正在学习世界的“电子大脑”,它通过
观察(训练数据)
、
记忆(模型参数)
和
基本规则(算法)
来理解和预测世界,就像一个人通过生活经验来学习和成长一样。
四、大模型的基本原理
大模型是如何工作的
当大语言模型回答人类的提问时,其过程可以用以下几个通俗易懂的步骤来描述:
1.
接收问题
:首先,大模型接收到一个问题,就像人类的大脑通过耳朵听到别人提出的问题一样。这一步骤中,大模型“阅读”问题文本,开始理解提问的内容。类比人脑通过听觉或视觉接收信息,然后大脑开始处理这些信息。
2.
理解问题
:接下来,大模型会分析问题的意图和关键词,就像人类大脑在听到问题后,会根据已知的语言规则和词汇理解问题的意思。类比大脑会根据以往的经验和知识,理解问题的意图。