1 什么是大模型
大模型:参数量巨大、用海量数据训练出的人工智能模型。
核心特点
参数规模大:百亿、千亿级参数
学习数据多:文本、图片、音频等海量知识
具备通用智能:聊天、写作、推理、画图、编程都能做
有涌现能力:训练到一定程度,生出复杂思考能力
简单说:懂知识、会思考、能处理各类任务的超强 AI。
2 大模型的三大特征
海量参数:千亿级规模参数量,具备超强拟合学习能力
海量数据训练:依托大规模文本、多模态数据预训练
涌现能力:训练达标后自发出现推理、创作、理解等复杂智能行为
3 大模型底层核心机制
Transformer 架构
基础骨架,依靠自注意力机制,读懂上下文关联关系。
词嵌入编码
把文字、图像转成数字向量,让 AI 能识别语义。
海量预训练
用全网数据学习语言规律、常识、逻辑、知识。
概率预测生成
逐字计算下一个最合理字词,连贯输出回答。
涌现智能
参数 & 数据达标后,自然产生推理、总结、创作能力。
微调对齐
修正回答逻辑、价值观,贴合人类需求。
4 大模型 创造的五个核心阶段
1 高质量的数据准备语治理
核心 数据是粮食,决定上限。收集清洗脱敏,构建合规高质量数据集。
2 预训练阶段(Pre-training)
核心 模型 '闭关苦读'。海量无监督学习 ,预测下一词,构建世界知识体系。
3 监督微调阶段(Supervised Fine-Tuning)
核心 变'工具'。利用指令-响应数据微调参数,让模型精准理解并遵循人类指令。
4 对齐与强化学习(RLHF)
核心 树立"三观"。通过人类反馈优化输出,确保模型符合价值观与安全规范。
5 部署与迭代优化
上线后持续收集反馈,进行增量训练,闭环优化