AI大模型应用开发学习日志
前言
模型应用开发的核心不是从头训练模型,而是通过工程化手段释放现成模型的潜力。
学习路线:
- 大模型基础
- AI大模型和RAG应用开发工程
- 大模型Agent/应用架构
- 大模型微调和私有化部署
大模型基础
大模型的基本信息
人工智能演变
什么是 AI
AI 是计算机科学的一个分支,核心目标是让机器具备类似人类的智能能力,例如感知(看、听、理解)、推理(逻辑判断、决策)、学习(从数据中总结规律)和交互(自然语言对话、情感识别)等。目前我们接触到的绝大多数AI,都属于弱人工智能(ANI)。它们只擅长特定的单一任务。
AI的关键技术包括:
- 机器学习(Machine Learning, ML):让机器从数据中自动学习规律(如分类、回归)。
- 深度学习(Deep Learning, DL):基于多层神经网络(如CNN、Transformer)的机器学习方法,擅长处理图像、语音、文本等非结构化数据。
- 自然语言处理(NLP):让机器理解、生成人类语言(如聊天机器人、机器翻译)。
- 计算机视觉(CV):让机器“看懂”图像/视频(如人脸识别、自动驾驶视觉感知)。
AI 1.0(信息 AI)
1950s–2010s
聚焦静态数据处理和知识管理,以模式识别和信息处理技术为核心,推动计算机视觉、自然语言处理等领域发展。依赖早期神经网络和统计机器学习,经典方法如支持向量机、AlexNet 发挥重要作用。
但该阶段系统缺乏自主性和上下文感知,对稳定环境依赖大,输入分布变化时性能易下降。
AI 1.0 的技术能力已广泛落地于结构化或半结构化数据处理场景,成为诸多行业的基础工具:
计算机视觉(除 AlexNet 的图像分类外,还包括早期基于特征点匹配的人脸识别、光学字符识别等,解决 “从图像中提取信息” 的问题)、自然语言处理(以统计语言模型为核心,支撑早期机器翻译、文本分类任务)、推荐系统(以协同过滤技术为代表,通过分析大规模用户交互数据,实现个性化内容推荐,推动流媒体、电商平台的用户粘性提升)等。
AI 2.0(智能体 AI)
2010s–至今
具备在数字环境中自主决策的能力,强化学习在其中发挥关键作用,突破了AI 1.0 “静态数据处理” 的局限,实现目标导向的规划和行动。
计算能力、上下文相关数据和成熟的算法是技术支撑,能提高效率,但也带来伦理和政策困境,如算法偏见、隐私问题等。
AI 2.0的应用已渗透至需 “实时决策、动态适应” 的数字场景,部分场景虽未明确标注 “强化学习”,但核心逻辑符合智能体属性:
金融领域(自动化高频交易,智能体根据实时市场数据快速判断交易时机,在毫秒级内完成下单、平仓操作,例如2010 年后兴起的算法交易系统,可自主规避短期风险并捕捉微小价差)、内容与电商(实时反馈型推荐,结合用户实时行为调整推荐内容,例如视频平台根据用户 “快进/重播” 行为即时优化推荐流,提升用户留存)、数字协作与仿真(多智能体交互,包括企业内部的 “智能调度助手”、大型在线游戏的 “NPC智能体”,以及交通流量仿真系统)等。
AI 3.0(物理 AI)
2024–可预见未来
将智能拓展到物理世界,通过机器人等实现感知、规划和行动,突破了 AI 1.0 “信息处理” 与 AI 2.0 “数字决策” 的边界,实现 “物理环境中的感知 - 规划 - 行动闭环”,提高生产力和安全性。
AI 3.0与前两世代的本质差异在于“实体化(embodiment)”,不再局限于屏幕内的信息分析或数字决策,而是通过硬件载体(机器人、自动驾驶车辆等)直接与物理世界交互 —— 能通过传感器感知环境(如光线、障碍物、人体动作),通过执行器(机械臂、车轮、手术器械)施加物理作用,在不确定、动态的现实场景中完成任务。
AI 3.0数据采集和处理复杂,需融合先进机器学习与控制理论等,面临从数字到物理部署的不确定性,如安全、可靠性和监管等挑战。
AI 3.0 已在 “需与物理世界直接交互” 的领域实现规模化应用,核心是通过实体智能提升效率与安全性:
协作机器人(与人类工人协同完成装配、搬运任务,汽车工厂的机械臂可精准安装零部件,同时通过力传感器感知人类靠近,自动降低运行速度避免碰撞,既提升生产效率,又减少工伤事故)、半自主手术与护理机器人(手术机器人可将医生的手部动作转化为机械臂的精细操作,适用于微创手术;养老场景的护理机器人能协助老人起身、行走,通过视觉传感器监测老人摔倒风险)、物流与基建自主移动设备(仓库中的 AGV可自主规划路径搬运货物,避开行人与障碍物;无人压路机通过传感器感知路面平整度,自动调整碾压力度;无人机则用于物流配送、电力巡检,在复杂地形中完成人类难以触及的任务)、自动驾驶车辆(依托 SLAM、传感器融合技术,实现 “感知 - 决策 - 控制” 的全流程自动化,自动驾驶系统可在城市道路中识别交通信号灯、避让行人和非机动车)等。
AI 4.0(意识 AI)
推测
与前三个世代的本质差异在于 “自我导向性”:
不再依赖人类设定任务目标或提供训练指引,而是能主动理解数字/物理/混合环境、自主生成核心目标与子目标,甚至编排个性化训练方案(如选择适配模型、筛选训练数据),并可能展现出 “机器意识”,即类似人类的主观体验或自我认知能力。
目前面临诸多技术和理论挑战,如意识定义不明确、需新的AI对齐和学习方法等。若实现将带来巨大利益,但也存在与人类目标冲突、道德地位和责任界定等风险。为避免研究陷入纯理论争议,本文提出四项 “可验证假设”,通过实证方法评估 AI 4.0 的 “类意识 ” 能力,确保研究可落地、可复现:
自主子目标生成(给定开放式任务,AI 需在 100 步推理内生成≥30%的 “新颖且语义连贯” 的子目标,且优于传统大语言模型的规划能力)、反思性自我监控(基于 1000 次测试,输出的 “任务成功置信度” 与实际表现的皮尔逊相关系数需>0.8,证明 AI 能准确评估自身能力)、高效迁移学习(在相关但全新的任务中,仅需≤10 次梯度更新或 5 次少样本提示,即可恢复≥90% 的源领域性能,体现 “快速适应” 能力)、抗扰动鲁棒性(在传感器噪声、动态障碍物、目标偏移等扰动下,任务成功率需≥85%,远超 AI 3.0 的≤70%,证明环境适应性)。
大型语言模型(LLMs)
LLMs被定义为 “AI 4.0的重要技术前驱”,而非AI 4.0本身,是连接现有AI技术与推测性AI 4.0的关键桥梁——虽未达到AI 4.0“自主意识与完全自我导向”的核心目标,但已展现出规划、监测、自适应行为等部分趋近AI 4.0的特质,为其技术探索提供了实践基础。
AI各世代并非相互替代,而是互补协同。
大模型的定义
https://zh.wikipedia.org/wiki/大型语言模型(需科学上网)
人工智能的定义
https://zh.wikipedia.org/zh-cn/人工智能(需科学上网)
大模型和人工智能的产品
国外
国内
大模型的原理
生成式模型和大语言模型
生成式模型
生成式模型的终极目标:建模真实世界数据的复杂联合分布 (Complex Joint Distribution)。
简单来说,就是让模型理解数据的内在模式和结构,从而能够“创造”出与真实数据相似的新数据。
想象一下,我们要生成猫的图片。
真实世界中猫的图片千姿百态,它们的颜色、姿势、背景、光照等等构成了极其复杂的数据分布。
生成式模型的任务就是学习这个分布,然后从中“采样”出新的、看起来像猫的图片。
当前主流的技术路径可以分为两个主要大类:
策略一:分布分解建模 (Distribution Factorization Modeling) - 链式法则的艺术
这种策略的核心思想,是利用概率论中的链式法则,将复杂的高维联合分布 $p(x)$ 分解为一系列条件概率的乘积:$p(x)=p(x1)p(x2∣x1)p(x3∣x1,x2)…$
这种方法的典型代表就是自回归模型 (Autoregressive Models, AR)。策略二:分布映射建模 (Distribution Mapping Modeling) - 从简单到复杂的变换
与因子分解不同,该策略试图学习一个映射函数 (Mapping Function) $G$,将一个容易采样的简单分布 $p_Z(z)$(通常是高斯噪声)直接或间接地变换到目标数据的复杂分布 $p_X(x)$ 上,即 $x=G(z)$。
大语言模型
大语言模型(large language model,LLM),是一种基于人工神经网络的语言模型。
其名称中的“大型”指模型具有庞大的参数量(通常在数十亿至数万亿级别,如GPT-3含1750亿参数)以及巨大的训练数据规模。
大语言模型通常采用自监督机器学习方法,从而能够基于海量无标注的文本进行训练。
大语言模型专为自然语言处理任务而设计,尤其适用于语言生成。
其中包含Gemini和GPT-4o在内的部分多模态大模型能够同时处理文字、图片、音频和视频等不同输入形式。
规模最大、功能最强大的LLM基本采用生成式预训练 Transformer (GPT) 模型,为 ChatGPT 等聊天机器人提供了核心功能。
这些模型能够预测人类语言语料库中固有的句法、语义和本体信息,且展示出相当多训练期间“记住”的关于世界的常识。
但它们也继承了训练数据中存在的误差和偏差。
由于大语言模型的记忆和泛化能力强大,其通常能用作通用模型:
即使在没有针对特定任务(例如情感分析、命名实体识别、文本翻译、摘要生成或数学推理)进行训练的情况下,LLM往往也能够在这些任务中表现出色。
而这些功能以往通常需要定制系统才能实现。
此外,基于其跨任务泛化能力,也可以针对特定任务对LLM进行微调,或通过提示工程进行引导,从而在极少量特定任务数据下实现或增强特定功能,如对话代理、代码生成、知识检索和自动推理等功能。
LLM源于早期的统计语言模型、神经概率语言模型和循环神经网络方法。
2017年推出的Transformer架构用自注意力机制取代了循环神经网络结构,从而实现了高效的并行化、更长的上下文处理能力以及在前所未有的数据量上进行可扩展的训练。这项创新催生了GPT、BERT及其后续模型,这些模型展现出了大规模涌现行为,例如少样本学习和组合推理。
生成式模型和大语言模型的区别
大语言模型(LLM)是生成式模型(Generative AI)的一个子集,但生成式模型不一定是大语言模型。








