资讯动态

四台 Mac 一起跑 235B 大模型,Exo 分布式 AI 推理实战指南

发布时间:2026/9/16 11:01:44 来源:尧图企业网站定制
四台 Mac 一起跑 235B 大模型Exo 分布式 AI 推理实战指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo235B 参数的大模型 8-bit 量化后要占用约 500GB 内存单台设备根本装不下而客厅里闲置的四台 Mac 加起来却有超过 2TB 内存。这正是分布式 AI 推理工具 Exo 要解决的问题每台设备装一份互相自动发现、把模型切开、并行跑起来多设备 AI 集群就搭好了家庭 AI 算力也聚起来了。一分钟看懂 ExoExo 是一个把多台本地设备拼成一个推理集群的开源项目。每台设备跑一个 exo 进程同局域网内自动发现同伴其中一台担任协调者。原理一句话大模型按块或按阶段拆开分别放到不同设备上每台机器算自己那部分设备之间交换中间结果加设备就能加速度。图中是一个四节点集群每台机器实时显示内存占用如 172GB/512GB、GPU 占用率、温度与功耗虚线为设备间的互联关系。快在哪让对比数据说话在 4 × M3 Ultra Mac Studio 上实测 Qwen3 235B8-bitExoRDMA对 llama.cppTCP1 台19.5 对 20.4 tokens/sTCP 略快2 台26.2 对 17.2Exo 快约 52%4 台31.9 对 15.2Exo 快 2.1 倍。RDMA远程直接内存访问让设备直接读写对方内存绕过系统网络栈。节点越多设备间通信越频繁延迟差距被放大这就是设备一多、领先幅度反而拉大的原因。三步跑通多设备模型1️⃣装好每台设备安装 exomacOS 可用 Homebrew 一条命令装好源码方式则先拉取仓库git clone https://gitcode.com/GitHub_Trending/exo8/exo2️⃣组网每台设备运行 exo。同局域网的设备自动互相发现不需要手动配置。3️⃣起模型打开http://localhost:52415的 dashboard选模型指定切分方式Pipeline 或 Tensor和节点数集群会自动算出放得下的方案、下载分片并启动推理。哪些玩法值得试本地玩大参数量化的 AI 爱好者用四台 Mac Studio 跑 235B、671B 级模型单台跑不动集群能稳定输出 30 tokens/s 以上日常对话够用。想把现成工具接进来的开发者API 兼容 OpenAI Chat Completions、Claude Messages、Ollama 等接口现有客户端改个地址指向localhost:52415就能用。需要离线推理的团队开启离线模式只用本地模型请求不出局域网。先知道这些限制RDMA 加速有硬件门槛需要 Thunderbolt 5 的 MacM4 Pro、M4 Max、M3 Ultra 等、macOS 26.2 以上设备之间用 TB5 线缆全互联且所有设备系统版本必须完全一致。达不到就退回普通网络多节点提速会明显缩水。自动发现依赖同一局域网跨网络组集群要另外做网络规划。Linux 版目前仅 CPU 可用GPU 支持还在开发中追求性能建议 Mac。手头有多台 Mac 的话先跑一个两节点集群熟悉组网和 dashboard再上四节点与更大的模型。接口与端点细节见 API 文档。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价