资讯动态

开源模型实战指南:基于 Generative AI for Beginners 课程第 16 讲全面解读开源 LLM 家族

发布时间:2026/9/10 8:37:14 来源:尧图企业网站定制
开源模型实战指南基于 Generative AI for Beginners 课程第 16 讲全面解读开源 LLM 家族【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本文基于 generative-ai-for-beginners 课程第 16 讲开源模型印尼语译本见 translations/id/16-open-source-models/README.md撰写。课程共 21 讲本讲聚焦开源与开放模型的定义、优势、主流模型家族Llama、Mistral、Falcon的选型对比以及如何在 Hugging Face 与 Azure AI FoundryMicrosoft Foundry模型目录中快速上手。读完本文你将掌握判断开源模型与开放模型的差异标准、三大开放模型家族各自的技术特色与适用场景以及一套可落地的模型筛选与对比方法。学习目标理解什么是开源模型Open Source Models理解使用开源模型带来的核心收益探索 Hugging Face 与 Microsoft Foundry 模型目录原 Azure AI Studio中可用的开放模型。什么是开源模型开源软件Open Source Software在不同技术领域的发展中一直扮演着关键角色。开放源代码促进会Open Source Initiative简称 OSI为软件被归类为开源定义过10 条标准OSD核心要求是源代码必须在 OSI 批准的许可证下公开共享。虽然 LLM 的研发与软件开发有相似之处但二者过程并不完全相同。这引发了社区对LLM 语境下开源定义的大量讨论。要让一个模型符合传统意义上的开源定义以下信息必须公开可得用于训练模型的数据集Datasets作为训练一部分的完整模型权重Full model weights评估代码The evaluation code微调代码The fine-tuning code完整模型权重与训练指标Full model weights and training metrics。目前只有极少数模型能满足上述全部标准。由艾伦人工智能研究所Allen Institute for Artificial Intelligence简称AllenAI创建的 OLMo 模型 正是符合这一类别的代表。由于大多数模型在撰写本文时可能尚未满足上述全部标准本讲以及本文统一使用开放模型Open Models这一称呼。关联阅读关于专有闭源模型与开源模型的详细对比可参见课程第 2 讲 探索与对比不同 LLM关于微调机制的深入讲解可参见课程第 18 讲 微调 LLM。使用开放模型的三大收益高度可定制Highly Customizable由于开放模型随发布附带详细的训练信息研究人员和开发者可以修改模型内部结构。这使创建高度专精的模型成为可能——针对特定任务或研究领域进行微调例如代码生成、数学运算和生物学等垂直场景。这与课程第 18 讲 微调 LLM 所讲的内容一脉相承微调fine-tuning通过对预训练模型追加新数据进行再训练从而在特定任务上获得更精准、更相关的自定义模型同时还能减少 few-shot 示例的 token 消耗、降低调用成本。成本Cost使用和部署这些模型的每 token 成本低于专有模型。在构建生成式 AI 应用时必须针对你的具体用例评估性能 vs 价格这一关键权衡图片来源Artificial Analysis灵活性Flexibility使用开放模型让你在使用不同模型或组合多个模型上拥有充分的灵活性。典型例子是 HuggingChat 助手HuggingChat Assistants用户可以直接在界面中切换当前使用的模型探索不同的开放模型家族Llama 2MetaLlama 2 由 Meta 开发是一个针对聊天类应用优化的开放模型。这得益于其微调方法——训练中包含了大量对话数据与人类反馈。通过这种方式模型输出更符合人类期望从而带来更好的用户体验。常见的 Llama 微调版本示例Japanese LlamaELYZA-japanese-Llama-2-7b专精于日语的微调版本Llama ProLLaMA-Pro-8B对基础模型的增强版本。仓库延伸Meta 家族的新进展课程第 21 讲 Building With the Meta Family Models 进一步介绍了 Llama 3.1 与 Llama 3.2 两大新成员Llama 3.170B Instruct / 405B Instruct上下文窗口从 Llama 3 的 8k 提升至128k tokens最大输出 token 从 2048 提升至 4096多语言支持更佳并具备原生函数调用能力内置 Brave Search 与 Wolfram Alpha 两个工具适用于更复杂的 RAG 与合成数据生成场景Llama 3.211B / 90B Vision Instruct以及 1B / 3B 纯文本变体引入多模态能力同时理解文本与图像提示1B / 3B 小体量变体可部署在边缘 / 移动设备上提供低延迟体验。MistralMistral 是一个将高性能与高效率作为核心追求的开放模型。它采用**专家混合Mixture-of-ExpertsMoE**架构把一组专精的专家模型组合进一个统一系统中根据输入动态选择启用特定的专家子集。由于每个模型只处理自己擅长的输入计算效率显著提升。常见的 Mistral 微调版本示例BioMistral专注于医学领域OpenMath MistralNVIDIA执行数学计算。仓库延伸Mistral 家族的新进展课程第 20 讲 Building with Mistral Models 详细介绍了三个不同定位的 Mistral 模型Mistral Large 2旗舰模型面向企业级应用。上下文窗口达128k上一代为 32k数学与编码任务准确率明显提升支持 13 种以上语言的多语言能力在 RAG、函数调用支持并行/串行与代码生成Python、Java、TypeScript、C上表现出色Mistral Small定位为小语言模型SLM相比 Large/NeMo 成本下降约 80%延迟更低、部署更灵活适合摘要、情感分析、翻译等文本任务与高频调用场景Mistral NeMo唯一的Apache 2.0 许可证免费开放模型被视为 Mistral 7B 的升级。使用 Tekken 分词器而非常见的 tiktoken在更多语言与代码上表现更优基础模型开放微调并支持原生函数调用。关联阅读小语言模型SLM与 LLM 在规模、理解力、算力、偏见与推理速度五个维度的系统对比参见课程第 19 讲 Introduction to Small Language Models。FalconTIIFalcon 是由技术创新研究院Technology Innovation Institute简称TII创建的 LLM。Falcon-40B使用 400 亿参数训练在更低的算力预算下表现出优于 GPT-3 的性能。这得益于它采用FlashAttention 算法与 multiquery attention显著削减了推理时的内存需求。由于推理时间更短Falcon-40B 非常适合聊天应用。常见的 Falcon 微调版本示例OpenAssistantfalcon-40b-sft-top1-560构建在开放模型之上的助手GPT4ALLnomic-ai/gpt4all-falcon性能高于基础模型的增强版本。如何选择开放模型对于如何选择开放模型没有唯一答案。以下是文档给出的三条实用路径按任务筛选一个很好的起点是使用 Microsoft Foundry 模型目录原 Azure AI Studio 的模型目录的按任务筛选filter by task功能这能帮助你理解模型被训练用来完成哪些类型的任务。参考排行榜Hugging Face 维护着LLM Leaderboard可以按特定指标查看表现最佳的模型。跨类型对比当需要跨不同类型比较 LLM 时Artificial Analysis 是另一个优秀的资源图片来源Artificial Analysis此外如果你正在处理某个特定用例搜索聚焦于相同领域的微调版本往往非常有效。同时在多个开放模型上做实验、观察它们是否符合你和用户的期望也是值得推荐的实践。补充对比视角课程第 2 讲 探索与对比不同 LLM 指出LLM 可按架构、训练数据与用例进行多维分类文本生成、语音识别、图像生成、多模态等选型时应综合比较任务质量、延迟、上下文窗口、工具调用能力、安全行为、区域可用性与总成本而不是只看发布日期或价格。下一步行动开放模型最大的优势在于你可以非常快速地开始使用它们。查看 Azure AI Foundry 模型目录其中收录了专门的 Hugging Face 模型集合上面讨论到的这些模型都在其中。课程主仓库 README.md 也提供了完整的 21 讲索引、代码示例与配套学习资源方便你继续深入。继续学习完成本讲后你还可以继续第 18 讲 微调 LLM——深入理解微调的动机、方法与局限第 20 讲 基于 Mistral 模型构建——通过可运行的 Python 代码体验 Mistral Large 2 的 RAG 示例、Mistral Small/Large 延迟对比与 NeMo 分词器对比第 21 讲 基于 Meta 家族模型构建——通过代码示例体验 Llama 3.1 原生函数调用与 Llama 3.2 多模态图像理解第 19 讲 小语言模型SLM——了解 SLM 与 LLM 的差异以及 Microsoft Phi-3/3.5 家族的实际推理方式。翻译说明本文依据仓库印尼语译本 translations/id/16-open-source-models/README.md 编写其英文原文见 16-open-source-models/README.md。文中涉及的模型名称、指标与结论均以课程文档与仓库源码为准具体数据可能随时间变化请以 Hugging Face 模型卡片及官方模型目录的最新信息为准。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价