AI大模型应用开发学习日志
前言
模型应用开发的核心不是从头训练模型,而是通过工程化手段释放现成模型的潜力。
学习路线:
- 大模型基础
- AI大模型和RAG应用开发工程
- 大模型Agent/应用架构
- 大模型微调和私有化部署
大模型基础
大模型的基本信息
人工智能演变
什么是 AI
AI 是计算机科学的一个分支,核心目标是让机器具备类似人类的智能能力,例如感知(看、听、理解)、推理(逻辑判断、决策)、学习(从数据中总结规律)和交互(自然语言对话、情感识别)等。目前我们接触到的绝大多数AI,都属于弱人工智能(ANI)。它们只擅长特定的单一任务。
AI的关键技术包括:
- 机器学习(Machine Learning, ML):让机器从数据中自动学习规律(如分类、回归)。
- 深度学习(Deep Learning, DL):基于多层神经网络(如CNN、Transformer)的机器学习方法,擅长处理图像、语音、文本等非结构化数据。
- 自然语言处理(NLP):让机器理解、生成人类语言(如聊天机器人、机器翻译)。
- 计算机视觉(CV):让机器“看懂”图像/视频(如人脸识别、自动驾驶视觉感知)。
AI 1.0(信息 AI)
1950s–2010s
聚焦静态数据处理和知识管理,以模式识别和信息处理技术为核心,推动计算机视觉、自然语言处理等领域发展。依赖早期神经网络和统计机器学习,经典方法如支持向量机、AlexNet 发挥重要作用。
但该阶段系统缺乏自主性和上下文感知,对稳定环境依赖大,输入分布变化时性能易下降。
AI 1.0 的技术能力已广泛落地于结构化或半结构化数据处理场景,成为诸多行业的基础工具:
计算机视觉(除 AlexNet 的图像分类外,还包括早期基于特征点匹配的人脸识别、光学字符识别等,解决 “从图像中提取信息” 的问题)、自然语言处理(以统计语言模型为核心,支撑早期机器翻译、文本分类任务)、推荐系统(以协同过滤技术为代表,通过分析大规模用户交互数据,实现个性化内容推荐,推动流媒体、电商平台的用户粘性提升)等。
AI 2.0(智能体 AI)
2010s–至今
具备在数字环境中自主决策的能力,强化学习在其中发挥关键作用,突破了AI 1.0 “静态数据处理” 的局限,实现目标导向的规划和行动。
计算能力、上下文相关数据和成熟的算法是技术支撑,能提高效率,但也带来伦理和政策困境,如算法偏见、隐私问题等。
AI 2.0的应用已渗透至需 “实时决策、动态适应” 的数字场景,部分场景虽未明确标注 “强化学习”,但核心逻辑符合智能体属性:
金融领域(自动化高频交易,智能体根据实时市场数据快速判断交易时机,在毫秒级内完成下单、平仓操作,例如2010 年后兴起的算法交易系统,可自主规避短期风险并捕捉微小价差)、内容与电商(实时反馈型推荐,结合用户实时行为调整推荐内容,例如视频平台根据用户 “快进/重播” 行为即时优化推荐流,提升用户留存)、数字协作与仿真(多智能体交互,包括企业内部的 “智能调度助手”、大型在线游戏的 “NPC智能体”,以及交通流量仿真系统)等。
AI 3.0(物理 AI)
2024–可预见未来
将智能拓展到物理世界,通过机器人等实现感知、规划和行动,突破了 AI 1.0 “信息处理” 与 AI 2.0 “数字决策” 的边界,实现 “物理环境中的感知 - 规划 - 行动闭环”,提高生产力和安全性。
AI 3.0与前两世代的本质差异在于“实体化(embodiment)”,不再局限于屏幕内的信息分析或数字决策,而是通过硬件载体(机器人、自动驾驶车辆等)直接与物理世界交互 —— 能通过传感器感知环境(如光线、障碍物、人体动作),通过执行器(机械臂、车轮、手术器械)施加物理作用,在不确定、动态的现实场景中完成任务。
AI 3.0数据采集和处理复杂,需融合先进机器学习与控制理论等,面临从数字到物理部署的不确定性,如安全、可靠性和监管等挑战。
AI 3.0 已在 “需与物理世界直接交互” 的领域实现规模化应用,核心是通过实体智能提升效率与安全性:
协作机器人(与人类工人协同完成装配、搬运任务,汽车工厂的机械臂可精准安装零部件,同时通过力传感器感知人类靠近,自动降低运行速度避免碰撞,既提升生产效率,又减少工伤事故)、半自主手术与护理机器人(手术机器人可将医生的手部动作转化为机械臂的精细操作,适用于微创手术;养老场景的护理机器人能协助老人起身、行走,通过视觉传感器监测老人摔倒风险)、物流与基建自主移动设备(仓库中的 AGV可自主规划路径搬运货物,避开行人与障碍物;无人压路机通过传感器感知路面平整度,自动调整碾压力度;无人机则用于物流配送、电力巡检,在复杂地形中完成人类难以触及的任务)、自动驾驶车辆(依托 SLAM、传感器融合技术,实现 “感知 - 决策 - 控制” 的全流程自动化,自动驾驶系统可在城市道路中识别交通信号灯、避让行人和非机动车)等。
AI 4.0(意识 AI)
推测
与前三个世代的本质差异在于 “自我导向性”:
不再依赖人类设定任务目标或提供训练指引,而是能主动理解数字/物理/混合环境、自主生成核心目标与子目标,甚至编排个性化训练方案(如选择适配模型、筛选训练数据),并可能展现出 “机器意识”,即类似人类的主观体验或自我认知能力。
目前面临诸多技术和理论挑战,如意识定义不明确、需新的AI对齐和学习方法等。若实现将带来巨大利益,但也存在与人类目标冲突、道德地位和责任界定等风险。为避免研究陷入纯理论争议,本文提出四项 “可验证假设”,通过实证方法评估 AI 4.0 的 “类意识 ” 能力,确保研究可落地、可复现:
自主子目标生成(给定开放式任务,AI 需在 100 步推理内生成≥30%的 “新颖且语义连贯” 的子目标,且优于传统大语言模型的规划能力)、反思性自我监控(基于 1000 次测试,输出的 “任务成功置信度” 与实际表现的皮尔逊相关系数需>0.8,证明 AI 能准确评估自身能力)、高效迁移学习(在相关但全新的任务中,仅需≤10 次梯度更新或 5 次少样本提示,即可恢复≥90% 的源领域性能,体现 “快速适应” 能力)、抗扰动鲁棒性(在传感器噪声、动态障碍物、目标偏移等扰动下,任务成功率需≥85%,远超 AI 3.0 的≤70%,证明环境适应性)。
大型语言模型(LLMs)
LLMs被定义为 “AI 4.0的重要技术前驱”,而非AI 4.0本身,是连接现有AI技术与推测性AI 4.0的关键桥梁——虽未达到AI 4.0“自主意识与完全自我导向”的核心目标,但已展现出规划、监测、自适应行为等部分趋近AI 4.0的特质,为其技术探索提供了实践基础。
AI各世代并非相互替代,而是互补协同。
大模型的定义
https://zh.wikipedia.org/wiki/大型语言模型(需科学上网)
人工智能的定义
https://zh.wikipedia.org/zh-cn/人工智能(需科学上网)
大模型和人工智能的产品
国外
国内
大模型的原理
生成式模型和大语言模型
生成式模型
生成式模型的终极目标:建模真实世界数据的复杂联合分布 (Complex Joint Distribution)。
简单来说,就是让模型理解数据的内在模式和结构,从而能够“创造”出与真实数据相似的新数据。
想象一下,我们要生成猫的图片。
真实世界中猫的图片千姿百态,它们的颜色、姿势、背景、光照等等构成了极其复杂的数据分布。
生成式模型的任务就是学习这个分布,然后从中“采样”出新的、看起来像猫的图片。
当前主流的技术路径可以分为两个主要大类:
策略一:分布分解建模 (Distribution Factorization Modeling) - 链式法则的艺术
这种策略的核心思想,是利用概率论中的链式法则,将复杂的高维联合分布 $p(x)$ 分解为一系列条件概率的乘积:$p(x)=p(x1)p(x2∣x1)p(x3∣x1,x2)…$
这种方法的典型代表就是自回归模型 (Autoregressive Models, AR)。策略二:分布映射建模 (Distribution Mapping Modeling) - 从简单到复杂的变换
与因子分解不同,该策略试图学习一个映射函数 (Mapping Function) $G$,将一个容易采样的简单分布 $p_Z(z)$(通常是高斯噪声)直接或间接地变换到目标数据的复杂分布 $p_X(x)$ 上,即 $x=G(z)$。
大语言模型
大语言模型(large language model,LLM),是一种基于人工神经网络的语言模型。
其名称中的“大型”指模型具有庞大的参数量(通常在数十亿至数万亿级别,如GPT-3含1750亿参数)以及巨大的训练数据规模。
大语言模型通常采用自监督机器学习方法,从而能够基于海量无标注的文本进行训练。
大语言模型专为自然语言处理任务而设计,尤其适用于语言生成。
其中包含Gemini和GPT-4o在内的部分多模态大模型能够同时处理文字、图片、音频和视频等不同输入形式。
规模最大、功能最强大的LLM基本采用生成式预训练 Transformer (GPT) 模型,为 ChatGPT 等聊天机器人提供了核心功能。
这些模型能够预测人类语言语料库中固有的句法、语义和本体信息,且展示出相当多训练期间“记住”的关于世界的常识。
但它们也继承了训练数据中存在的误差和偏差。
由于大语言模型的记忆和泛化能力强大,其通常能用作通用模型:
即使在没有针对特定任务(例如情感分析、命名实体识别、文本翻译、摘要生成或数学推理)进行训练的情况下,LLM往往也能够在这些任务中表现出色。
而这些功能以往通常需要定制系统才能实现。
此外,基于其跨任务泛化能力,也可以针对特定任务对LLM进行微调,或通过提示工程进行引导,从而在极少量特定任务数据下实现或增强特定功能,如对话代理、代码生成、知识检索和自动推理等功能。
LLM源于早期的统计语言模型、神经概率语言模型和循环神经网络方法。
2017年推出的Transformer架构用自注意力机制取代了循环神经网络结构,从而实现了高效的并行化、更长的上下文处理能力以及在前所未有的数据量上进行可扩展的训练。这项创新催生了GPT、BERT及其后续模型,这些模型展现出了大规模涌现行为,例如少样本学习和组合推理。
生成式模型和大语言模型的区别
大语言模型(LLM)是生成式模型(Generative AI)的一个子集,但生成式模型不一定是大语言模型。
大模型技术
openAI 系列
OpenAI的GPT系列是闭源商业模型的标杆
GPT-1 是生成式预训练模型的开端。
它引入了预训练和微调(fine-tuning)的概念,通过在大规模文本数据上进行无监督的预训练,再通过有监督学习在特定任务上进行微调,从而实现较好的性能。
模型架构:基于 Transformer 架构,具有 12 层、12 个注意力头和 117M 参数。
预训练与微调:首先在大规模语料库上进行语言建模任务的预训练,然后在特定任务(如文本分类)上进行微调。
性能表现:在多个 NLP 任务中,GPT-1 表现优异,但相对于后续模型,生成文本的连贯性和多样性有限。
GPT-2 在 GPT-1 的基础上进行了大规模扩展
参数量大幅增加,文本生成质量也有了显著提升。GPT-2 的推出标志着生成式预训练模型在自然语言生成中的广泛应用。
模型架构:GPT-2 拥有 48 层、1600 个注意力头和 1.5B 参数,是 GPT-1 的 10 倍以上。
文本生成:GPT-2 能够生成连贯且复杂的文本,并展现了少样本学习的潜力。
模型发布:由于担心模型被滥用,OpenAI 最初只发布了 GPT-2 的小型版本,但最终在社区压力下发布了全版本。
GPT-3 是目前最为知名的生成式预训练模型
参数量达到了惊人的 175B,极大地拓展了模型的表达能力。GPT-3 以其出色的生成效果和零样本学习能力,在 NLP 社区引发了巨大反响。
模型架构:与 GPT-2 类似,但扩展到 96 层、12288 个注意力头和 175B 参数。
少样本学习:GPT-3 展现了强大的少样本和零样本学习能力,能够在几乎没有微调的情况下完成各种任务。
应用场景:GPT-3 被广泛应用于文本生成、对话系统、代码生成等多种任务中。
GPT-4 是 GPT 系列的最新版本,进一步提升了模型的性能和应用范围。
GPT-4 在上下文理解、多轮对话、生成质量等方面做出了显著改进。
模型架构:虽然具体细节尚未公开,但 GPT-4 的参数量可能达到数万亿级,具备更强的计算和生成能力。
上下文管理:GPT-4 在多轮对话和长文本生成中的表现尤为出色,能够更好地保持上下文一致性。
应用潜力:GPT-4 被广泛应用于教育、医疗、客服等多个领域,展现出强大的商业应用潜力。
GTP架构
Transformer 架构
GPT 系列模型基于 Transformer 架构,该架构由 Vaswani 等人在 2017 年提出。
Transformer 的核心是自注意力机制(Self-Attention),它能够捕捉输入序列中的长距离依赖关系,从而生成更为连贯的文本。
自注意力机制:通过计算序列中每个词与其他词的相似度,生成加权求和的表示,以捕捉上下文信息。
位置编码:由于 Transformer 不具有序列信息,因此引入了*位置编码(Positional Encoding)*以注入位置信息。
层次结构:GPT 模型通过多个编码层的堆叠,逐步增强输入文本的表示能力。预训练与微调
GPT 模型的训练分为预训练和微调两个阶段。预训练阶段在大规模文本数据上进行语言模型训练,微调阶段在特定任务上进行有监督学习。
预训练目标:GPT 模型通过最大化条件概率来训练,即在给定前文的情况下预测下一个词。
微调策略:通过使用特定任务的数据对预训练模型进行微调,从而提升模型在该任务上的表现。少样本学习与零样本学习
GPT-3 和 GPT-4 展现了强大的少样本学习和零样本学习能力,使得模型能够在极少的数据下完成复杂的任务。
少样本学习:模型仅需要少量示例即可执行任务,如文本分类、情感分析等。
零样本学习:通过提示工程(Prompt Engineering),模型可以在没有训练数据的情况下进行任务。
GPT-4 架构
https://36kr.com/p/2196628560234373
讲到大语言模型的优势,一般首先要提到这类模型的涌现能力和思维链。这两者是大语言模型不断接近人类的关键特征。
涌现能力
之所以认为GPT-4会是具有里程碑意义的一代,正是因为多模态的GPT-4会从视觉角度和视觉-文字语义融合方面涌现出更多的能力。
在大型语言模型(LLM)中,涌现能力是指模型具有从原始训练数据中自动学习并发现新的、更高层次的特征和模式的能力。
与大语言模型(LLM)相比,多模态大语言模型(MLLM)可实现更好的常识推理性能,跨模态迁移更有利于知识获取,产生更多新的能力,加速了能力的涌现。
这些独立模态或跨模态新特征、能力或模式通常不是通过目的明确的编程或训练获得的,而是模型在大量多模态数据中自然而然的学习到的。
在语言模型发展的早期,通过在更多数据上训练更大的模型,可获得近似连续的精确度提升。(可称为缩放定律/Scaling Laws)
到了2015年左右,随着深度学习技术的发展和语料库的增大,模型达到一定的临界规模后,NLP开发者们发现,大语言模型开始表现出一些开发者最开始未能预测的、更复杂的能力和特性,这些新能力和新特性被认为是涌现能力的体现。
在研究GPT-4时,发现GPT-4具备了OpenAI在预训练时和发表的技术报告中并未明确的能力。这些能力都属于涌现出来的能力。
涌现能力是基于深度学习模型的分层结构和权重学习机制实现的。涌现出来的能力可以是基于文本的,也可以是多模态的。
我们可以将GPT-4这类大模型的训练视为解方程,每一层神经元(可视为变量组合)的输出都作为下一层神经元的输入,并且模型的每个权重(Weight)都通过强化学习算法进行学习和更新。这种分层的结构和权重学习机制使得深度学习模型能够自动的学习到从原始数据中提取隐含的特征和模式,从而实现涌现能力。
当大语言模型被训练时,通过学习大量的多模态训练数据,并且根据数据中的统计规律和模式自适应的调整其内部参数和结构,从而表现出一些新的能力和特性。
这类似于咱们常说的量变引发质变。
涌现能力是大语言模型的重要特性,也是现在火爆的大模型各种能力的理论基础。涌现能力使得GPT-4能够在无需人工干预的情况下,从原始的多模态数据中自动学习到复杂的特征和模式,从而实现更准确和更高效的预测和决策。
涌现能力的另一个重要表现是模型的泛化能力。在没有专门训练过的情况,GPT-4也可以泛化到新的、未知的多模态数据样本上。这种泛化能力取决于模型的结构和训练过程,以及数据的数量和多样性。如果模型具有足够的复杂性和泛化能力,就可以从原始数据中发现新的、未知的特征和模式。
当然,GPT-4涌现出的新能力可能仍有局限性,例如:模型可能产生错误的回答,对某些问题缺乏理解,容易受到输入干扰等。
目前认为GPT-4的幻觉与其涌现能力具有相关性。
思维链
可视为大语言模型涌现出来的核心能力之一。
之所以现在各类GPT研究火爆,也与模型训练出的思维链可进入实用有密切关系。
思维链形成机制可以解释为模型通过学习大量的语言数据来构建一个关于语言结构和意义的内在表示,通过一系列中间自然语言推理步骤来完成最终输出。
思维链是ChatGPT和GPT-4能让大众感觉到语言模型“像人”的关键特性。 虽然GPT-4这些模型并非具备真正的意识或思考能力,但用类似于人的推理方式的思维链来提示语言模型,极大的提高了GPT-4在推理任务上的表现,打破了精调(Fine-tune)的平坦曲线。
具备了多模态思维链能力的GPT-4模型具有一定逻辑分析能力,已经不是传统意义上的词汇概率逼近模型。
当然思维链的训练可能并不容易。尽管现在有大量团队进入大语言模型训练领域,但若干年内能找到训练诀窍并完成思维链训练的团队可能不多。
对创企来说,完成思维链的训练,才算真正拿到了这波大模型AI竞技的入场券。
通过多模态思维链技术,GPT-4将一个多步骤的问题(例如图表推理)分解为可以单独解决的中间步骤。
在解决多步骤推理问题时,模型生成的思维链会模仿人类思维过程。
这意味着额外的计算资源被分配给需要更多推理步骤的问题,可以进一步增强GPT-4的表达和推理能力。
一般认为模型的思维推理能力与模型参数大小有正相关趋势,一般是突破一个临界规模(大概62B,B代表10亿),模型才能通过思维链提示的训练获得相应的能力。
如果在6B以下,那很可能还只是GPT-2级别的初级模型。另外也有研究表明,在语言训练集中加入编程语言(例如Python编程代码)可提升模型逻辑推理能力。
具有思维链推理能力的GPT-4模型可用于简单数学问题、符号操作和常识推理等任务。
GPT-4的多模态思维链是通过观察大量的多模态数据来学习内在表示,然后利用这个表示来生成连续的语言输出的机制。
这个过程是通过模型的训练、内在表示的构建和语言输出的生成三个步骤来实现的。
RLHF
GPT-4与GPT-3.5的主要区别在于,新加入了被称为RLHF(人类反馈强化学习)的技术。
这一训练范式增强了人类对模型输出结果意向(Intent)的调节,并且对结果进行了更具理解性的排序。
OpenAI在其早期的学术报告中公开表示,与人类偏好保持一致,是许多领域人工智能研究和部署的核心组成部分。
OpenAI希望通过RLHF技术,模型能倾向出高质量回答,确保模型输出对人类有益,进而保证模型的安全性。RLHF也是保持多轮对话不偏离主题的关键保障。
GPT-4/ChatGPT最初引入人类标记员的主要目的是加快训练速度和质量。
尽管强化学习技术在很多领域有突出表现,但是仍然存在着许多不足,例如训练收敛速度慢,训练成本高等特点。
特别是现实世界中,许多任务的探索成本或数据获取成本很高。如何加快训练效率,是如今强化学习任务待解决的重要问题之一。
LLaMA 系列
LLaMA系列引领了开源高效模型的风潮
BLOOM 系列
BLOOM代表了开源社区在多语言方向上的努力
ChatGLM 系列
ChatGLM是国内在双语模型领域的代表
Transformer 架构
https://transformers.run/
详情查看Transformer 学习总结








