Edge0教程:流式MoE本地推理框架

📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:1,000+

📋 项目简介

Edge0 是一个开源的流式 MoE 推理框架,核心配方是三件套:SSD 专家卸载 + Recover-LoRA + 预路由(prerouter)预测。它的目标很直接——让消费级设备(目前是 Apple Silicon Mac)也能流畅跑 MoE 大模型:35B-A3B 模型峰值内存仅约 2.9GB,8B 版只要 1GB。当前后端为 MLX,CUDA 后端在路线图上。

本地跑大模型的另一种思路可以参考 Qwen3.8-Flash-Next 单机 DGX Spark 教程,以及 Real API Pricing 订阅制 AI 真实单价排行,算清本地部署和云端调用的成本账。

🔧 技术原理速览

组件作用
SSD 专家卸载MoE 专家权重放在 SSD 上按需流式加载
Recover-LoRA补偿量化/卸载带来的精度损失
Prerouter 预路由提前预测激活哪些专家,掩盖加载延迟
MLX 后端Apple Silicon 原生加速,M1-M4 可用

📦 两档模型

档位基座配置磁盘占用
edge0-35bQwen3.5-MoE 35B-A3B4bit / 40层 / 256专家 / K=4约 23 GB
edge0-8bLing 3.0 bailing hybrid4bit / 24层 / 128专家 / K=8约 4.2 GB

🚀 上手使用

# 要求:Apple Silicon Mac + Python 3.10+(推荐3.12)
pip install edge0

# 一条命令启动已训练好的完整流水线
# (checkpoint、LoRA、prerouter 三件套自动协同加载)
edge0 serve edge0-35b
edge0 serve edge0-8b

💡 使用建议

📚 常见问题

Edge0 是什么?

一个开源的流式 MoE 推理框架,核心配方是三件套:SSD 专家卸载 + Recover-LoRA + 预路由(prerouter)预测,让消费级设备(目前为 Apple Silicon Mac)也能流畅跑 MoE 大模型:35B-A3B 模型峰值内存仅约 2.9GB,8B 版只要 1GB。

对硬件有什么要求?

目前支持 Apple Silicon Mac(M1-M4),后端为 MLX,CUDA 后端在路线图上。SSD 速度直接决定流式卸载体验,优先在 NVMe 机型上使用;内存小于 16GB 的 Mac 建议选 edge0-8b 档。

有哪些模型档位可选?

两档:edge0-35b 基于 Qwen3.5-MoE 35B-A3B(4bit / 40层 / 256专家 / K=4,磁盘约 23GB);edge0-8b 基于 Ling 3.0 bailing hybrid(4bit / 24层 / 128专家 / K=8,磁盘约 4.2GB)。一条 edge0 serve 命令即可启动。