资讯动态

3 条命令组成本地 AI 集群:exo 免费跑动 671B 大模型完整指南

发布时间:2026/8/31 13:31:01 来源:尧图企业网站定制
3 条命令组成本地 AI 集群exo 免费跑动 671B 大模型完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 将多台 Mac mini、Mac Studio 乃至 Linux 机器连成 本地 AI 集群节点自动互相发现模型按设备内存与链路带宽自动切分671B 参数的前沿大模型得以在本机运行数据不出门。内置仪表盘与 OpenAI 兼容 API 运行在 http://localhost:52415现有客户端可原样接入。把闲置设备的内存拼成 671B 大模型的推理池当前 本地跑大模型 的第一瓶颈是内存一个 671B 的模型用 8-bit 精度加载就需要约 700 GB 内存超出任何单机的 128–512 GB 上限。转向云端 API 意味着按 token 付费且数据外发自己堆 GPU 则显卡内存价格昂贵。把家里几台闲置设备的内存拼起来做 多设备大模型推理是成本最低的出路边际成本几乎只有一根网线或一根雷雳线。exo 的定位免配置节点发现加按拓扑切分模型exo 是一款 Apache-2.0 开源的 本地 AI 集群 工具核心差异在于零手动配置设备上启动 exo 后通过局域网自动发现彼此系统再根据每台设备的可用内存、链路类型Thunderbolt 5 RDMA 或以太网与实测带宽自动计算模型的最优部署方式并通过/instance/previews接口列出所有可行切分方案供选择。开启 Thunderbolt 5 上的 RDMA 后设备间延迟可降低 99%官方 README 数据——加设备让模型跑得更快而不是被网络拖慢。拓扑感知自动并行模型先看房再落位把 exo 的调度器想象成一位物业经理安放每台设备前先逐层勘察电力容量与线缆负载再决定机器装在哪一层。其准确定义是Topology-Aware Auto Parallel系统实时获取设备拓扑视图节点内存、每条链路的延迟与带宽据此计算管线切分或张量并行的最优方案。除了按层顺序切分的管线并行exo 还支持张量并行每台设备持有同一层权重的一片所有设备同时参与每个 token 的计算。官方给出的加速上限是 2 台设备 1.8 倍、4 台设备 3.2 倍这意味着 张量并行 是加机器变快的来源。⚡ 最快完成首次部署的 3 条命令从源码构建并启动节点macOS 需先装好 Xcode 与 uvLinux 需 node 18 以上与 rust安装方式见 README。随后git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build执行后终端打印 SvelteKit 构建日志完成后在dashboard/build生成静态仪表盘产物。uv run exo执行后当前节点加入集群并自动发现其他节点日志打印节点 ID仪表盘与 API 出现在 http://localhost:52415。macOS 用户也可用brew install --cask exo直接安装后台应用。用兼容 API 发起第一次对话curl -N -X POST http://localhost:52415/v1/chat/completions \ -H Content-Type: application/json \ -d {model:mlx-community/Llama-3.2-1B-Instruct-4bit,messages:[{role:user,content:Hello}],stream:true}终端会流式打印 OpenAI Chat Completions 格式的回复同一端口同时兼容 Claude Messages、OpenAI Responses 与 Ollama 接口。 看实测数据4 台 Mac Studio 的张量并行集群下图来自项目文档中的真实集群视图4 台 512 GB M3 Ultra Mac Studio 同时加载 DeepSeek v3.18-bit与 Kimi K2 Thinking4-bit每个节点的内存占用、模型实例与任务状态一览可见。同一集群上 DeepSeek v3.1 671B8-bit的基准测试画面如下展示了 张量并行 加 RDMA 链路下的吞吐表现。排查 RDMA 卡点并判断 exo 的适用边界设备发现不到彼此时的检查清单Thunderbolt RDMA 需要 macOS 26.2Tahoe以上且机型必须是 Thunderbolt 5 设备M4 Pro Mac mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio并在恢复模式终端执行rdma_ctl enable后重启。集群内每台设备须用支持 TB5 的线缆直连成环Mac Studio 上紧邻以太网口的那个 TB5 口不可用。所有节点的 macOS 版本必须完全一致连 beta 号都要相同否则 RDMA 端口互相发现失败。exo 目前在 Linux 上仅跑 CPUGPU 支持仍在开发别在 Linux 节点上预期 GPU 加速。哪些场景不建议上集群单请求延迟优先于模型规模时小模型8B 以下放单机更快——跨设备链路会引入额外往返设备之间只有 2.4 GHz WiFi 或严重拥塞的无线网络时跨设备推理对延迟敏感建议先换成有线或 Thunderbolt 5同一网络要跑多个互不干扰的集群时记得用--namespace参数隔离发现域避免节点误加入别人的集群。接口细节与环境变量可查 API 文档 docs/api.md不同切分方案的实测工具在 bench/exo_bench.py。当闲置设备白天吃灰时它们随时可以拼成一座只属于你自己的推理集群模型放在自家内存里数据不出门唯一消耗是电费。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价