资讯动态

使用 MLX-LM 在 macOS 上本地部署 Yi-1.5 系列大模型:安装、加载与推理实战

发布时间:2026/9/16 18:02:41 来源:尧图企业网站定制
使用 MLX-LM 在 macOS 上本地部署 Yi-1.5 系列大模型安装、加载与推理实战【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi本文是一份面向 macOS 开发者的 Yi 系列模型本地部署指南核心聚焦于 MLX-LM 本地运行文档 所讲解的技术方案借助 Apple 官方机器学习框架 MLX 的 Python 封装mlx-lm在 Apple Silicon 芯片的 Mac 上以量化形式运行 Yi-1.5 系列开源大模型。读完本文你将掌握mlx-lm的安装方法、模型选择策略8-bit 与 4-bit 量化版本的内存取舍以及通过loadgenerate两步完成本地推理的完整实战流程并了解它与此仓库 Cookbook 中 ollama、llama.cpp、LM Studio 等本地部署方案的定位差异。MLX-LM 与 Yi 系列为什么选择在 Mac 上本地运行MLX-LM 是基于 Apple 的 MLXMachine Learning eXchange框架构建的大模型本地部署框架专为 macOS 设计能够在 Apple SiliconM 系列芯片上高效运行和推理大型语言模型。其核心价值在于MLX 深度利用 Apple 统一内存架构Unified Memory使得 CPU 与 GPU 共享同一块内存模型权重无需在设备间反复拷贝配合 mlx-lm 内置的量化权重加载能力让数十亿参数的大模型也能在消费级 Mac 上流畅运行。Yi 系列是由 01-ai 从零训练的开源大语言模型。根据仓库根目录 README.md 的 News 记录Yi-1.5 系列模型于 2024-05-13 开源进一步提升了编码coding、数学math、推理reasoning与指令遵循instruction-following能力且 Yi-1.5 系列模型的代码与权重基于 Apache 2.0 许可证分发。MLX 社区mlx-community已为 Yi-1.5 系列提供转换好的量化权重用户无需自行转换即可开箱即用——这正是 local-mlx.md 文档推荐的路线。⚠️ 重要前提MLX-LM仅兼容 macOS 操作系统且建议使用 Apple SiliconM1/M2/M3 及以上芯片的 Mac。x86 架构的旧款 Mac 或 Linux/Windows 环境无法使用本方案。环境准备与安装平台要求操作系统macOSApple Silicon 芯片Python 环境建议 Python 3.9 及以上网络环境首次加载模型时需要从模型仓库下载权重安装 mlx-lmMLX-LM 的安装非常简单直接通过 pip 安装即可pip install mlx-lm建议在独立的虚拟环境中安装避免污染系统 Python 环境python3 -m venv mlx-env source mlx-env/bin/activate pip install mlx-lm安装完成后可以通过以下方式验证是否安装成功python -c import mlx_lm; print(mlx_lm.__version__)补充从源码安装可选如果希望使用最新开发特性也可以直接从 MLX 官方示例仓库克隆源码进行安装需要先克隆 mlx-examples 仓库再进入llms/mlx_lm目录执行pip install .。日常使用场景下直接pip install mlx-lm已经足够本仓库文档推荐的也正是这种最简方式。模型选择Yi-1.5 的 MLX 社区量化版MLX 社区mlx-community已经为 Yi-1.5 系列模型提供了多种量化精度的转换版本用户可以直接在mlx_lm.load中指定模型仓库名进行加载。原文档给出的两个推荐模型模型仓库名参数量量化精度适用场景mlx-community/Yi-1.5-6B-Chat-8bit6B8-bit内存较小16GB 及以下的 Mac兼顾质量与速度mlx-community/Yi-1.5-34B-Chat-4bit34B4-bit内存较大32GB 及以上的 Mac追求更高模型能力两个模型的量化粒度差异反映了明确的取舍逻辑8-bit8 位量化精度损失更小输出质量更接近原始 FP16 模型但内存占用更高。6B 参数的 8-bit 版本约需 68GB 内存适合统一内存较小的入门级 Apple Silicon Mac。4-bit4 位量化内存占用大幅压缩但精度略有损失。34B 参数的 4-bit 版本内存需求约在 20GB 量级。作为参考仓库根目录 README.md 中给出了 Yi 系列模型在 GPU 上的显存需求表格Yi-6B-Chat-8bits最低显存 8GB、Yi-6B-Chat-4bits最低显存 4GBYi-34B-Chat-4bits最低显存 20GB、Yi-34B-Chat-8bits最低显存 38GBbatch1 场景。虽然该表格面向 NVIDIA GPU 环境但可以据此大致估算 MLX 量化版本在 Mac 统一内存上的占用量级作为选择模型的参考依据。Apple Silicon 上 Mac 的统一内存同时供 CPU 与 GPU 使用因此建议预留出操作系统与常用应用的内存余量。选择建议先在自己的 Mac 上运行 6B 8-bit 版本验证流程如果内存充裕且需要更强的推理与编码能力再升级到 34B 4-bit 版本。你也可以在 mlx-community 下检索其他 Yi 系列模型的量化版本替换模型名即可。快速上手加载模型并生成文本原文档给出了一个最小可运行的推理示例使用mlx-community/Yi-1.5-6B-Chat-8bit作为示例模型from mlx_lm import load, generate model, tokenizer load(mlx-community/Yi-1.5-6B-Chat-8bit) response generate(model, tokenizer, prompthello, verboseTrue)这段代码包含两个关键 API值得深入理解1.load()加载模型与分词器model, tokenizer load(mlx-community/Yi-1.5-6B-Chat-8bit)load函数接受模型仓库名或本地路径返回(model, tokenizer)二元组。其内部行为包括自动下载首次调用时如果本地缓存中不存在该模型会自动从模型仓库下载权重到本地缓存目录~/.cache/huggingface。自动量化模型仓库名中的-8bit、-4bit后缀标识了权重精度mlx-lm 会按仓库内已转换好的权重直接加载无需手动量化。设备映射模型自动加载到 Apple Silicon 的统一内存上由 MLX 运行时统一调度 CPU/GPU 计算。2.generate()执行文本生成response generate(model, tokenizer, prompthello, verboseTrue)generate是推理入口verboseTrue会在生成过程中实时打印输出。在实际使用中还可以传入更多生成参数来控制行为以下参数为 mlx-lm 生成接口的常见可选参数可按需组合max_tokens控制生成的最大 token 数避免无限制生成导致内存膨胀temp采样温度控制输出的随机性值越低越确定top_p核采样概率阈值repetition_penalty重复惩罚系数抑制模型输出重复文本stream是否以流式方式逐 token 返回结果一个更完整的示例from mlx_lm import load, generate model, tokenizer load(mlx-community/Yi-1.5-6B-Chat-8bit) response generate( model, tokenizer, prompt介绍一下你自己, max_tokens512, temp0.7, top_p0.9, repetition_penalty1.1, verboseTrue, )3. 结合 Yi 的对话格式Yi-1.5-Chat 系列是经过指令微调的对话模型实践中建议使用其对话模板组织 prompt例如User: .../AI: ...的对话格式以获得更符合预期的回复。这一点与仓库中 llama.cpp 本地运行文档 里使用-r User:反转义分隔符组织多轮对话的思路是一致的。mlx-lm 也支持在生成时指定chat_template参数以适配对话格式。进阶用法命令行与服务化部署除了 Python APImlx-lm安装后还会提供命令行工具适合脚本化与快速验证场景命令行直接生成mlx_lm.generate --model mlx-community/Yi-1.5-6B-Chat-8bit --prompt hello --max-tokens 256启动本地兼容服务mlx_lm.server --model mlx-community/Yi-1.5-6B-Chat-8bit启动后可通过 OpenAI 兼容的 HTTP 接口进行调用便于接入到现有应用或工具链中例如与 基于 LlamaIndex 和 Yi-large 构建智能问答系统 类似的 RAG 场景做本地化替换。与 Cookbook 其他本地部署方案的对比本仓库 Cookbook 的本地运行local系列提供了四条 Yi 模型本地部署路径local-mlx.md 是其中之一。四者的定位差异如下方案适用平台核心特点对应文档MLX-LMmacOSApple Silicon深度利用统一内存Apple 生态原生体验local-mlx.mdllama.cppLinux / macOS / WindowsC 实现支持 GGUF 格式跨平台local-llama.cpp.mdollamaLinux / macOS / Windows一键安装、命令即用生态成熟local-ollama.mdLM StudiomacOS / Windows图形化桌面应用上手门槛低local-lm-studio.md如果你只使用 Mac 且追求与 Apple 硬件的深度结合MLX-LM 是优选Python API 与命令行兼备方便融入自己的推理脚本。如果需要跨平台复用同一套模型文件GGUFllama.cpp 的通用性更强。如果希望零代码开箱即用ollama终端与 LM Studio图形界面更合适。这四篇文档统一收录于 Cookbook 总览 的 Local Run 章节中英文版本齐全中文版对应文件为 local-mlx.md。注意事项与常见问题平台限制MLX-LM仅适用于 macOS这是硬性前提。如果你在 Linux/Windows 环境部署 Yi 模型请改用 llama.cpp 或 ollama 方案或参考仓库 demo/text_generation.py 中基于 Transformers 的标准推理入口该脚本支持--model、--max-tokens、--streaming、--cpu等参数在 GPU 服务器场景同样适用。内存与磁盘首次运行 34B 模型前请确认 Mac 统一内存充足并预留系统运行余量内存不足会导致明显的性能下降甚至被系统终止。模型权重下载到本地缓存后会占用磁盘空间量化版本4-bit/8-bit相对 FP16 已大幅压缩体积但 34B 量级的模型仍会占用可观空间请注意磁盘容量。加载失败排查确认模型仓库名拼写正确如mlx-community/Yi-1.5-6B-Chat-8bit。确认网络可正常访问模型下载源首次加载耗时取决于网速与模型体积。确认mlx-lm版本为最新pip install -U mlx-lm。总结MLX-LM 为 macOS 用户提供了一条在本地运行 Yi-1.5 系列大模型的轻量路径pip install mlx-lm完成安装loadgenerate两步即可完成从下载权重到文本生成的全流程。原文档推荐的mlx-community/Yi-1.5-6B-Chat-8bit与mlx-community/Yi-1.5-34B-Chat-4bit两个量化版本分别对应了「低内存下的快速验证」与「大内存下的高能力推理」两种典型诉求开发者可根据自身 Mac 的内存配置灵活选择并结合max_tokens、temp、top_p等生成参数做精细化控制。对于希望将 Yi 模型完整接入自身工具链的读者建议进一步阅读本仓库 Cookbook 中的 llama.cpp 方案、ollama 方案 与 LM Studio 方案按部署环境与使用习惯选择最合适的本地运行方式。【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价