资讯动态

大模型是怎么“炼“出来的?

发布时间:2026/9/12 2:48:30 来源:尧图企业网站定制
最近看有文章分析 DeepSeek V4 训练时有没有用到华为的卡总看到预训练和后训练看了一下相关的内容总结了一下大模型训练的过程。从原始数据到智能对话——ChatGPT、DeepSeek、Qwen 这类大模型是怎么炼出来的当你在手机上向 AI 助手提问它能流畅地回答、写代码、做分析这背后是一套复杂而精密的训练工程。本文将从工程视角完整拆解大语言模型LLM的训练过程包括每一步在做什么、需要哪些数据、依赖哪些技术基础设施、训练完会得到什么。一、先搞清楚两个大阶段LLM 的训练通常分为两大阶段预训练Pre-training让模型博览群书获得通用知识与语言能力。后训练Post-training让模型上岗培训学会按指令回答、安全礼貌地与用户交流。后训练的计算量只有预训练的约 5%但它决定了模型的实际可用性也是近年来研究最活跃的方向。二、六大训练步骤详解第一步数据收集与预处理一切从数据开始。训练一个现代大语言模型需要数万亿Trillions个 Token 的文本语料。数据来源包括通用网页文本Common Crawl、C4 等互联网爬虫数据集书籍与学术文献Books3、ArXiv、PubMed 等代码GitHub 公开代码仓库、Stack Overflow 问答百科全书多语言 Wikipedia原始数据质量参差不齐必须经过严格的清洗流程去重使用 MinHash / SimHash 去除重复内容防止模型过拟合质量过滤基于困惑度Perplexity、规则过滤低质量内容语言识别与分类按语言比例混合多语言数据Tokenizer 训练使用 BPE字节对编码或 SentencePiece 训练分词器这一步的产出TB 级别的清洁语料库 训练好的 Tokenizer。第二步大规模预训练这是整个流程中计算量最大、成本最高的环节通常需要数千块 GPU 运行数周甚至数月。核心原理自回归语言建模Autoregressive Language Modeling——给模型看一段文本让它预测下一个 Token 是什么。通过在海量文本上反复迭代模型逐渐学会了语言规律、世界知识、逻辑推理。关键技术组件组件作用Transformer 架构多头注意力Multi-head Attention 前馈网络FFNRoPE 位置编码让模型理解 Token 之间的位置关系RMSNorm 归一化稳定训练过程替代传统 LayerNormFlash Attention 2/3IO 感知的高效注意力算法2-4 倍提速GQA 分组查询注意力减少 KV Cache 占用提升推理效率混合精度训练BF16节省显存加速计算这一步的产出基础模型Base Model。它掌握了丰富的知识但只会续写文本不会听指令。第三步继续预训练可选如果需要打造垂直领域模型如医疗 AI、金融 AI可以在通用基础模型上继续用领域无标注语料进行训练。核心挑战是灾难性遗忘Catastrophic Forgetting——模型在学习领域知识的过程中可能忘记之前掌握的通用能力。应对策略是使用极低的学习率将少量通用数据混入领域数据Replay 策略第四步有监督微调SFT这是后训练的第一步也是让模型从文字接龙变成问答助手的关键。做法构建大量指令 → 回复对以对话格式System Prompt User Assistant继续训练模型。数据来源人工标注的高质量问答对Self-Instruct 自动生成的多样化指令Chain-of-Thought 推理示范提升复杂推理能力开源数据集Alpaca、ShareGPT、OpenAssistant 等参数高效微调方案LoRA / QLoRA允许在消费级 GPU 上完成微调大幅降低了研究门槛。这一步的产出SFT 模型——能够理解并回答问题具备初步的指令遵循能力。第五步偏好对齐RLHF / DPO仅有 SFT 还不够——模型可能给出正确但措辞生硬、甚至有害的回复。这一步通过人类反馈进一步让模型的输出更有帮助、更安全、更符合人类价值观。经典方案 RLHF基于人类反馈的强化学习流程收集人工偏好数据对同一问题的多个回答进行排名Chosen vs Rejected训练奖励模型Reward Model学习什么样的回答是好的使用PPO 强化学习优化策略模型同时加入 KL 散度惩罚防止过度偏移现代替代方案——DPO直接偏好优化跳过奖励模型直接用偏好数据优化策略模型更简洁稳定已成为工业界主流。此外还有 GRPO、SimPO、Constitutional AI 等变体持续演进。这一步的产出对齐模型——安全性增强、拒绝有害请求、输出风格流畅自然。这就是我们每天使用的 Chat 版本模型。第六步评估、安全测试与部署优化模型训练完成后还需要全面验证才能上线。评测基准通用能力MMLU、HellaSwag、ARC数学推理GSM8K、MATH代码能力HumanEval、SWE-bench对话质量MT-Bench、AlpacaEval安全性红队测试Red Teaming部署优化技术量化压缩GPTQ / AWQ / INT4显著缩小模型体积推理加速vLLMPagedAttention、TensorRT-LLM投机采样Speculative Decoding小模型辅助大模型提升生成速度模型蒸馏将大模型能力迁移到小模型三、训练数据全景不同训练阶段对数据的需求完全不同阶段数据类型数量级核心要求预训练无标注文本数万亿 Token多样性、覆盖广继续预训练领域无标注文本数十亿 Token领域专业性SFT指令-回复对数万~数百万条高质量、多样化RLHF/DPO偏好对比数据数万~数十万对标注一致性四、训练基础架构训练一个前沿大模型需要一套完整的工程体系支撑。硬件加速器NVIDIA H100当前主流训练 GPU80GB HBM3 显存支持 BF16/FP8NVIDIA A100上一代旗舰广泛用于中大规模训练Google TPU v5Gemini 系列训练所用专为矩阵运算优化AMD MI300X192GB 超大显存可装载更大模型华为昇腾 950Atlas 350DeepSeek V4 主力适配国产芯片128GB 自研 HBM带宽 1.6TB/s支持 FP4 低精度片间互联 2TB/s支撑万亿参数 MoE 模型训练与推理。深度学习框架PyTorch事实标准动态图原生支持 FSDP 分布式训练DeepSpeed微软ZeRO 优化器、显存卸载让单 GPU 训练大模型成为可能Megatron-LMNVIDIA张量并行与流水线并行专为超大规模设计JAX / XLAGoogle函数式编程JIT 编译TPU 训练首选CANN华为昇腾 AI 软件栈替代 CUDA支持 95% CUDA 代码一键迁移针对 MoE / 稀疏注意力 / 低精度深度优化配套 TileLang 编译器算子优化后算力利用率可达 85%。通信与互联NCCLNVIDIA 集合通信库AllReduce 梯度同步核心InfiniBand节点间 400Gbps RDMA 高速互联NVLink / NVSwitchGPU 间直连900GB/s 双向带宽消除 PCIe 瓶颈华为 HCCS昇腾超节点内部高速互联单链路 2TB/s支持 8–192 卡全连接支撑大规模训练集群。五、分布式训练如何让数千块 GPU 协同工作训练千亿参数模型单卡装不下需要将计算拆分到成千上万块 GPU 上。[7] 现代 LLM 训练通常采用三种并行策略的组合3D 并行① 数据并行DP每块 GPU 持有完整模型处理不同批次数据通过 AllReduce 同步梯度。最容易实现是最基础的并行方式。② 流水线并行PP将不同 Transformer 层分配到不同 GPU形成流水线。前向传播逐级传递激活值反向传播逐级传递梯度。③ 张量并行TP在单层内部切分权重矩阵如注意力头分布到多块 GPU。需要频繁通信适合在同节点 NVLink 连接的 GPU 间使用。六、一张图总结全流程12345678910111213原始数据 ↓ 清洗、去重、Tokenizer 训练海量语料数万亿 Token ↓ 自监督预训练数周 数千 GPU基础模型Base Model ↓ 继续预训练可选领域场景领域基座模型 ↓ SFT 有监督微调指令遵循模型 ↓ RLHF / DPO 偏好对齐对齐模型Chat Model ↓ 量化、蒸馏、推理加速生产部署版本 ✅结语大语言模型的训练是数据工程、模型算法、分布式系统的高度融合。每一步都有大量工程细节和研究前沿。当前领域演进极快——后训练技术尤其是强化学习对齐正在成为拉开模型能力差距的关键战场。理解这一流程不仅有助于更好地使用 AI 工具也为进入这一领域打下坚实的认知基础。参考来源MLOps Community、53AI、redteams.ai、arXiv 分布式训练研究等公开资料

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价