
大模型定义
广义:计算机视觉、语音、自然语言处理等领域基于深度学习的 AI 技术研究范式
狭义(LLM):通过深度学习,利用庞大文本数据集训练,具备生成自然流畅文本、理解深层语义能力,广泛应用于文本分类、智能问答、人机交互等任务
与深度神经网络(DNN)对比
定义:DNN 是多层神经网络组成的模型,用于特征提取与学习(含 CNN、RNN、Transformer 等
大模型是参数数量极大(亿~千亿)、支持多任务 / 多语言的大规模模型,一般基于Transformer参数量:DNN 通常几十万到几千万参数;大模型动辄上亿、百亿甚至千亿参数(如 GPT-4、PaLM 2)任务范围:DNN 适用于单一任务(如图像分类、情感分析)
大模型是多任务通用模型(可问答、写文案、编程、摘要等)训练数据:DNN 使用结构化/小规模数据
大模型使用万亿 token 级别的大语料,多语言、多模态数据是否可微调:DNN 通常专门训练;大模型支持提示工程(Prompting)、LoRA、SFT 等多种调优方式是否理解 “语言”:DNN 依任务而定,需特定设计
大模型内建语言模型能力,能理解自然语言
提示举例:DNN:图像识别、情感分析;大模型:GPT-3/4、Claude、通义千问、文心一言等
核心能力
文本生成、语言理解、知识问答、数学能力、逻辑推理、代码能力
三大局限
1. 知识幻想问题:知识记忆模糊,缺少证明判别知识有效性的机制,易无中生有
2. 自进化和个性化问题:不易区分新知识、错误反馈及个性化信息,个性化成本高
3. 多模态及具身智能训练问题:不同模态语义空间不统一,缺乏大规模高质量对齐数据,训练方式复杂且无统一评估与任务标准
底层实现步骤
1. 预训练(Pre-training):像“读万卷书”,海量文本的高质量清洗及超大规模语言模型训练,让模型学习通用特征和知识,数据需足够大和多样化
2. 有监督微调(Supervised Fine-Tuning):像 “习题训练”基于预训练模型,针对特定任务和数据集进一步训练,数据量中等、针对性强,使模型更好遵循指令、保证事实准确性、避免幻觉
3. 人类反馈的强化学习(RLHF):像 “老师讲评 + 修正风格”,以人类反馈为优化目标实现模型表现对齐,适用于目标复杂、定义不明确或难以具体描述的任务,局限是数据收集成本高、人类输入主观性强、评估者可能不可靠
广义:计算机视觉、语音、自然语言处理等领域基于深度学习的 AI 技术研究范式
狭义(LLM):通过深度学习,利用庞大文本数据集训练,具备生成自然流畅文本、理解深层语义能力,广泛应用于文本分类、智能问答、人机交互等任务
与深度神经网络(DNN)对比
定义:DNN 是多层神经网络组成的模型,用于特征提取与学习(含 CNN、RNN、Transformer 等
大模型是参数数量极大(亿~千亿)、支持多任务 / 多语言的大规模模型,一般基于Transformer参数量:DNN 通常几十万到几千万参数;大模型动辄上亿、百亿甚至千亿参数(如 GPT-4、PaLM 2)任务范围:DNN 适用于单一任务(如图像分类、情感分析)
大模型是多任务通用模型(可问答、写文案、编程、摘要等)训练数据:DNN 使用结构化/小规模数据
大模型使用万亿 token 级别的大语料,多语言、多模态数据是否可微调:DNN 通常专门训练;大模型支持提示工程(Prompting)、LoRA、SFT 等多种调优方式是否理解 “语言”:DNN 依任务而定,需特定设计
大模型内建语言模型能力,能理解自然语言
提示举例:DNN:图像识别、情感分析;大模型:GPT-3/4、Claude、通义千问、文心一言等
核心能力
文本生成、语言理解、知识问答、数学能力、逻辑推理、代码能力
三大局限
1. 知识幻想问题:知识记忆模糊,缺少证明判别知识有效性的机制,易无中生有
2. 自进化和个性化问题:不易区分新知识、错误反馈及个性化信息,个性化成本高
3. 多模态及具身智能训练问题:不同模态语义空间不统一,缺乏大规模高质量对齐数据,训练方式复杂且无统一评估与任务标准
底层实现步骤
1. 预训练(Pre-training):像“读万卷书”,海量文本的高质量清洗及超大规模语言模型训练,让模型学习通用特征和知识,数据需足够大和多样化
2. 有监督微调(Supervised Fine-Tuning):像 “习题训练”基于预训练模型,针对特定任务和数据集进一步训练,数据量中等、针对性强,使模型更好遵循指令、保证事实准确性、避免幻觉
3. 人类反馈的强化学习(RLHF):像 “老师讲评 + 修正风格”,以人类反馈为优化目标实现模型表现对齐,适用于目标复杂、定义不明确或难以具体描述的任务,局限是数据收集成本高、人类输入主观性强、评估者可能不可靠


