ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

周末3步,把吃灰的Mac组成本地AI集群,跑起235B大模型

2026/8/31 20:01:16 拓冰建站 浏览量
周末3步,把吃灰的Mac组成本地AI集群,跑起235B大模型 周末3步把吃灰的Mac组成本地AI集群跑起235B大模型【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo书房的角落攒了一台 M2 Max 的 Mac mini、一台 M3 Pro 的笔记本还有一台 512GB 内存的 Mac Studio——想用来跑本地大模型可单台装不下、又懒得手动配集群。exo 就是干这个的开源项目把家里设备自动拼成一个分布式 AI 集群多台设备协同推理的计算网络一条命令装好浏览器里直接和 235B 参数的大模型对话。3分钟跑通最简路径先让一台机器跑起来别急着组集群。第1步把代码拉下来。这条命令只是克隆 exo 源码仓库到本地git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo执行完你会在磁盘上看到exo文件夹里面有src、dashboard、docs等目录。第2步编译管理面板然后启动。下面三行分别做进面板目录装依赖、编译前端、回到根目录启动一个集群节点cd dashboard npm install npm run build cd .. uv run exo你应该看到终端持续输出日志浏览器随后可以打开http://localhost:52415/那就是 exo 的集群管理页面。第3步验证节点真的活着。这条命令查询本节点 ID是最轻的一次 API 调用curl http://localhost:52415/node_id返回一段 JSON形如{node_id: ...}就说明节点、API、面板三件套全部就位。一张图看懂核心机制上图是 4 台 Mac Studio 组网后 exo 实际看到的集群结构机制用三句话就能说完输入每台设备启动后就在局域网里广播我在并上报芯片、内存、带宽等硬件信息处理节点间互相探测后自动选举出一个大脑master由它按每台机器的内存占比给模型切片内存大的节点多扛点输出你提问时所有节点同时参与计算、逐 token 协同出结果。全程不用配 IP、不用写配置发现是自动的分工也是自动的。搭建实操从单机到集群 先让一台节点跑起来依赖很简单uvPython 依赖管理、node编译面板、Rust编译网络库。装完后按上一节两条命令执行即可。macOS 用户走 Homebrew 装uv和node最快Linux 目前是 CPU 推理GPU 支持还在路上先当能用而不是最快来期待。 同一网段自动发现不配一个IP把同一命令在其他设备上再跑一遍就行——只要默认命名空间一致设备之间会互相发现、自动加入同一个集群uv run exo启动几秒后你应该看到日志里陆续出现新节点被发现的记录面板节点列表里多出几台机器芯片型号和内存一目了然。同网段有多套 exo、想互相隔离的话给每台加上--namespace 家庭AI集群这类参数即可。 最胖的那台自动当大脑exo 没有手动指定 master这回事。每台节点都参与选举节点间投票选出一个协调者内存和状态最好的机器当上 master 负责分片调度其余的当 worker。被选中的机器会自己重启 worker 和 API 进程日志里会明确打出选举结果——你不用干预也不需要干预。 选个模型让分片自动下载浏览器打开http://localhost:52415/在模型列表里挑一个Qwen3、DeepSeek、Kimi 等也支持从 HuggingFace 加载自定义模型点创建实例。集群会按各节点内存占比把模型分片下载到对应机器并加载。你应该看到面板上分片进度条逐条走满实例状态变为就绪聊天框可以直接开聊。三个进阶玩法上图是面板里一台节点的实时视图加载了哪些模型、内存占用多少、集群拓扑长什么样全在一屏之内。如果我想跑单台装不下的超大模型235B、671B 这类模型单台再大的 Mac Studio 都吃不下。做法就是多开几台节点在面板里创建实例——集群自动完成分片计算、下载和加载4 台 512GB 的 M3 Ultra Mac Studio 就能同时挂起 DeepSeek v3.18bit和 Kimi-K2-Thinking4bit。效果模型从装不下变成日常可用而且全部跑在本地数据不出门。如果我想让推理更快而不只是更大张量并行模型按张量维度切分到多台设备同时算是 exo 的看家本领2 台设备提速约 1.8 倍4 台约 3.2 倍。下面这张来自社区实测的基准图就是 4 台 Mac Studio 跑 Qwen3-235B 的表现上图展示了 4 台设备经 Thunderbolt 5 RDMA 直连后的吞吐数据比单台快了近一半——对加设备是变快不是摊薄。想榨干这点速度给 TB5 的 Mac 开启 RDMA over Thunderbolt进恢复模式执行rdma_ctl enable重启即可设备间延迟能降 99%。注意两点Mac Studio 别用网口旁边那个 TB5 口集群内所有机器的 macOS 版本要一模一样连 beta 号都得一致。如果我想把现有代码直接接上集群exo 的 API 同时兼容 OpenAI Chat Completions、Claude Messages 和 Ollama 三种接口。你现有的 Python 代码、前端应用、脚本只需把base_url换成http://节点IP:52415、密钥随便填一个占位值就能把请求打给整个集群。接口细节看仓库里的 API 参考文档 就够写业务了。避坑与排错两台设备互相看不到原因路由器开了 AP 隔离或系统防火墙拦了默认 UDP 52413 发现广播。 解法关掉 AP 隔离、临时放行防火墙再确认两边--namespace一致——命名空间不同的节点是互相不认识的。同一台机器启动时报已有 exo 在运行原因上次进程异常退出PID 锁文件还残留着。 解法清理~/.local/share/exo/下遗留的 pid 文件后重新启动macOS 在~/.exo/对应路径。组了集群反而更慢原因张量并行要求每台设备出 token 时互相同步普通 WiFi 的延迟被放大成瓶颈。 解法优先有线或 Thunderbolt 直连节点间延迟控制在 10ms 以内走普通网络时改用面板里的 MLX Ring 模式网络传输分片对延迟不敏感把 TB 直连留给张量并行。RDMA 没生效原因系统版本不够需 macOS 26.2 及以上、线缆不是 TB5或 Mac Studio 用错了网口旁那个口。 解法升级系统、换线进恢复模式执行rdma_ctl enable后重启再次确认所有节点系统版本完全相同。吃灰的 Mac 重新通电235B 就在家里跑起来了。接口和更多配置细节见 docs/api.md。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考