资讯动态

【老计带你懂AI算法】21:大模型是怎么炼成的,预训练、微调、对齐与MoE

发布时间:2026/10/4 16:55:11 来源:尧图企业网站定制
【老计带你懂AI算法】21大模型是怎么炼成的预训练、微调、对齐与MoE开头从一个架构到一个博学助手上一篇讲了大模型的心脏Transformer。但你可能有个疑问一个网络架构怎么就变成了ChatGPT那样博览群书、能聊天、会写代码、通情达理的助手这中间隔着一整套精心设计的炼制工艺。大模型不是训练一次就成的它像炼丹要经过好几道工序一步步从一个什么都不会的架构变成一个有用的智能助手。这一篇也是我们原理部分的收官就把这套炼制流程完整讲清楚。理解了它你对大模型的认知就完整了。大模型的炼制核心是三大步预训练、微调、对齐我一步步讲讲完你就知道你每天在用的那个AI助手究竟是怎么一步步被造出来的了。第一步预训练博览群书打下深厚底子第一步也是最耗资源的一步叫预训练。它要干的事是让模型阅读海量的文本几乎是整个互联网能拿到的文本书籍、网页、代码等从中学习语言的规律、知识和常识。它怎么学方式简单得惊人就是做一个填空或接龙游戏预测下一个词。给模型看今天天气真___“让它预测下一个词是好”看海量的文本反复玩这个根据前文猜下一个词的游戏。你可能觉得这不就是个文字接龙吗能学出什么神奇就神奇在这。为了能准确地预测下一个词模型被迫去理解语法、积累知识、甚至掌握一定的推理能力。比如要接好中国的首都是___它得知道这个事实要接好一段推理它得理解逻辑。在海量数据上玩这个接龙游戏玩到极致模型就在不知不觉中把语言、知识、常识、推理都学进去了。这就是预训练的魔力用一个极简单的目标逼出了极丰富的能力。打个比方预训练就像让一个人把图书馆里所有的书都读一遍、还反复做完形填空练习。读得足够多、练得足够狠他自然就博学多识、出口成章了。这一步造出来的叫基座模型它知识渊博但还只是个读书破万卷的书呆子不太会好好回答你的具体问题。预训练极其烧钱要用成千上万张GPU训练好几个月花费动辄几千万上亿。这也是为什么只有少数大公司能训练顶尖大模型算力和数据是极高的门槛这正是我做AI Infra的价值所在给这台炼丹炉提供算力基础设施。第二步微调从博学书呆子到干活能手预训练出的基座模型博学但不听话第二步微调就是在基座模型的基础上用相对少量的、高质量的特定数据继续训练教它做具体的事、按人希望的方式回应。最关键的一种微调叫指令微调用大量指令加优质回答的样本比如帮我写一封请假邮件配上一封范文来训练教会模型理解并遵循人的指令。经过指令微调模型就从一个只会文字接龙的书呆子变成了一个能听懂你的要求、给出像样回答的助手。这里要接上第14篇讲的那个思想预训练加微调正是迁移学习的极致体现。预训练在海量数据上学到的通用语言能力是那个深厚的通用底子微调则用少量数据把这个通用能力快速适配到具体任务上。你不用为每个任务从头训练一个大模型那谁也训不起而是站在预训练基座的肩膀上微调一下就能用这大大降低了用好大模型的门槛。企业用大模型很多就是拿开源基座模型用自己的行业数据微调出专用模型。第三步对齐让它好好说话符合人类价值观第三步对齐就是第19篇重点讲的RLHF基于人类反馈的强化学习那套。微调后的模型会干活了但还不够它可能说话不够礼貌、可能被诱导说出有害内容、可能一本正经胡说八道。对齐这一步就是让模型的行为符合人类的价值观和期望变得有用、诚实、无害。具体做法上一篇讲过用人类对回答的偏好训练一个奖励模型再用强化学习让大模型朝着人类更喜欢的方向优化。经过对齐模型才真正变得通情达理、让人用着舒服、也更安全。你现在感受到的ChatGPT的情商和分寸感很大程度来自这一步。预训练、微调、对齐这三步走完一个大模型才算炼成博学预训练、能干活微调、还懂事对齐。这就是完整的炼丹流程。让模型又大又省MoE混合专家炼制流程之外还有一个让大模型能越做越大的关键技术值得讲一讲MoE混合专家。前面说过大模型越大越强但也越大越贵参数多了每次计算都要动用全部参数算力吃不消。MoE想了个聪明办法把模型内部拆成很多个专家子网络每次处理一个输入时不动用全部专家而是通过一个调度员只挑选最相关的几个专家来干活。打个比方一家大医院有几十个科室的专家模型很大、知识很全但你来看病不需要惊动所有专家导诊台调度员根据你的症状只叫相关的一两个专家来会诊就行。这样模型可以拥有海量参数知识容量大但每次实际计算只用其中一小部分算力省实现了又大又省。MoE让大模型能在可控的计算成本下把参数规模推到极致是当前很多顶尖大模型如一些万亿参数模型采用的关键架构。这个按需调用部分专家的思路也是大模型工程上很重要的一个优化方向正是我做AI Infra关注的前沿之一。为什么大模型会涌现出智能最后聊个迷人又重要的现象涌现。研究者发现当模型规模参数、数据、算力越过某个临界点后会突然涌现出小模型完全不具备的能力比如多步推理、按例子举一反三叫上下文学习、理解隐喻等仿佛量变引起了质变。这就像水温一度度升高到100度突然沸腾、发生质变一样大模型的能力也不是线性增长而是到了某个规模会突然跃升。这个现象至今没有被完全解释清楚但它是大模型如此震撼的根源之一也是大家拼命把模型做大的动力。它也提醒我们大模型的一些行为已经超出了简单的可预测范围这既是它的魅力也带来了可控性和安全性的新课题。用好大模型的两把利器提示工程与RAG大模型炼成之后普通人和企业怎么把它用好还有两个极其重要、也极其实用的手段值得专门讲因为这是你真正落地时最常打交道的。第一把利器是提示工程。同样一个大模型你问的方式不同回答质量天差地别。把问题问清楚、给足背景、给几个示例、明确要求输出格式模型就答得又准又好这门怎么把话说好让模型听懂的手艺就叫提示工程。它几乎零成本却能大幅提升效果是用好大模型的第一课。打个比方大模型像个能力超强但需要明确指令的下属你把活儿交代得越清楚他干得越漂亮。第二把利器是RAG检索增强生成。大模型有两个软肋一是知识停留在训练那一刻、不知道最新的事二是不知道你公司内部的私有资料还爱一本正经地胡编叫幻觉。RAG的办法很巧妙先从你的知识库文档、数据库里检索出和问题相关的资料把这些资料连同问题一起喂给大模型让它基于这些真实资料来回答而不是凭记忆瞎编。打个比方这就像开卷考试让模型先翻到相关的参考资料再照着回答自然又准又不跑偏。我自己做的K8sChat那个运维助手核心就用了RAG让大模型基于真实的集群信息和运维文档来回答而不是空谈。提示工程加RAG是当下不用重新训练、就能让通用大模型在你的具体场景里好用起来的两大法宝。输入输出与调用代码输入一段文本提示prompt也就是你说的话或你的问题。输出模型生成的文本回答一个词一个词地续写出来。实际用大模型绝大多数人是调用API或现成模型而不是自己炼。输入你的问题。输出模型的回答。# 依赖pip install openai (以OpenAI风格API为例,很多大模型兼容这个接口)fromopenaiimportOpenAI clientOpenAI(api_key你的API密钥)# 换成你自己的密钥# 调用大模型对话:messages里放对话历史,role区分身份responseclient.chat.completions.create(modelgpt-3.5-turbo,messages[{role:system,content:你是一个乐于助人的AI助手。},{role:user,content:用一句话解释什么是机器学习。},],temperature0.7,# 控制回答的随机性/创造性)print(response.choices[0].message.content)运行输出示例大模型回答每次措辞不同机器学习是让计算机从大量数据中自动找出规律并用这些规律对新情况做出预测或判断的技术。这段代码展示了当今用大模型最主流的方式通过API发送你的提示prompt拿回模型生成的回答system设定它的角色、user是你的问题、temperature控制发挥的随机程度。绝大多数应用包括我做的K8sChat这类AI助手本质都是在这个基础上把大模型的能力接入自己的业务。需要说明这段是标准API调用示例需真实密钥和网络作者未实机运行读者按实际服务和库版本微调。小结与承上启下炼制三大步预训练海量文本上玩预测下一个词的接龙博览群书打底子、微调少量优质数据教它听指令干活是迁移学习的极致、对齐RLHF让它好好说话、有用诚实无害。MoE混合专家把模型拆成很多专家每次只调用相关的几个实现又大又省把参数推向极致。涌现规模越过临界点突然冒出小模型没有的能力量变引起质变。用法绝大多数人通过API或现成模型调用站在巨人肩膀上再用提示工程和RAG让它在自己场景里好用起来。到这里从最朴素的线性回归到最前沿的大模型整个AI算法模型的原理地图我们就走完了一整圈。你已经具备了理解绝大多数AI模型的底层认知。最后一篇我们做个收官总结给你一份实用的模型选型速查并回答一个特别重要的问题怎么判断一个模型到底好不好。我们下一篇系列收官见。延伸阅读Hugging Face 官方文档与教程模型下载、微调、部署https://huggingface.co/docsOpenAI API 官方文档本篇调用代码参考https://platform.openai.com/docs大模型综述可按关键词A Survey of Large Language Models检索最新版本说明以上为官方与经典公开资料地址可能随版本调整如打不开可用标题搜索。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑