公司动态
把三台闲置设备拼成 AI 推理集群:Exo 环境配置到出字的完整路径
把三台闲置设备拼成 AI 推理集群Exo 环境配置到出字的完整路径【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo 是一个把闲置设备拼成 AI 推理集群的开源项目零配置组网、内存聚合单机装不下的模型可以拆到多台一起跑。本文带你走完 Exo 安装路径与 Python 3.12当前锁定 3.13的依赖问题。先看你的设备够不够唯一的硬门槛是总内存把集群里所有设备的内存加起来要大于模型文件体积。下面以 Llama-3.1 8B 为例示例模型最低总内存可行组合Llama-3.1 8Bfp16约 16 GB2 台 8 GB 内存的 MacBook AirLlama-3.1 8Bfp16约 16 GB1 台 16 GB 内存的 RTX 4070 Ti 笔记本Llama-3.1 8Bfp16约 16 GB2 台 4 GB 树莓派 400 1 台 8 GB Mac Mini软件侧一句话记住Python 3.12当前 pyproject.toml 实际锁定 3.13macOSApple Silicon体验最好Linux 可用但目前仅 CPU。上限的话4 台 M3 Ultra Mac Studio 能跑 235B 参数的模型 五分钟把环境搭起来第一步拿到代码git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo第二步一条命令装完。项目用 uv快速的 Python 依赖管理工具管理依赖不用手动建虚拟环境just build-dashboard uv sync前者构建 Web 面板相当于手动执行cd dashboard npm install npm run build后者创建虚拟环境并装完全部 Python 依赖。装上的是 aiohttp异步 HTTP 框架、transformers模型推理库、pydantic数据校验库这几个核心件完整清单见 pyproject.toml。没有 just 工具就直接手敲上面两条命令效果一样。第三步验证跑通uv run exo进程起来不报错后浏览器打开 http://localhost:52415面板能加载就算环境就绪。装不上八成是这几个原因先别急着慌报错基本逃不出三类版本不匹配—— pyproject.toml 把 Python 锁在 3.13版本太老会装不上。最短修复uv python install 3.13 uv sync网络与证书受限—— 从 Hugging Face 拉模型超时或 macOS 报 SSL 错误。设置国内镜像后重启export HF_ENDPOINThttps://hf-mirror.com内存与权限不足—— 模型加载报内存不够或 52413~52415 端口被占用。清出内存、减少节点数或换端口uv run exo --api-port 52416装完能干什么最小可用案例就三件事启动集群uv run exo打开面板开聊http://localhost:52415选个模型就能对话。面板前端代码在 dashboard/src/。直接调 API兼容 OpenAI 格式curl -N http://localhost:52415/v1/chat/completions \ -H Content-Type: application/json \ -d {model:mlx-community/Llama-3.2-1B-Instruct-4bit,messages:[{role:user,content:什么是 Exo}],stream:true}面板的集群视图长这样高级配置RDMA低延迟跨机通信组网、张量并行、环境变量看官方 README。组网跑通后每加一台设备内存池就再大一圈。环境变量与 API 细节见 README.md推理引擎实现见 src/exo/worker/engines/。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考