📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:160+
这个仓库是一份自包含的部署配方:在单台 DGX Spark 的 121 GiB 统一内存上,用 vLLM 服务 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 检查点(99 GB)——PLE 表卸载并内存映射,不依赖任何双机配置。这是一个视觉语言模型:文本、图像、视频输入开箱即用。
本地跑大模型一直是"显存军备竞赛",这份配方证明了单机统一内存架构的可行性;想了解一体化本地AI服务器的整体方案,看我们对 Osmantic ODS本地AI服务器 的评测;想从零理解模型训练,则看 MiniMind从零训练教程。
cp .env.sample .env # 按需编辑 IMAGE / HF_TOKEN
./download.sh # 拉取 ~99GB 检查点(支持断点续传)
./start.sh # 约10-12分钟到 /health,服务端口 :8888
./stop.sh # 容器+看门狗优雅退出
磁盘预算约 130 GiB:检查点 99 GB + 首次启动生成的 ~27 GB 打包 PLE 表。start.sh 从不联网下载——只从本地 HF 缓存解析检查点,缺了就直接报错。./start.sh --no-launch 可以先打印推导出的内存预算与 docker 命令预览。
| 参数 | 值 |
|---|---|
| 上下文长度 | 262,144(YaRN off) |
| MTP / KV缓存 | MTP 3;KV fp8,目标16 GiB |
| 并发 | MAX_NUM_SEQS=4,MAX_NUM_BATCHED_TOKENS=2048 |
| 主机内存预留 | 26 GiB |
| 实测速度 | 46.3 tok/s(单流散文,2026-09-04/05 sparkDash扫测) |
--ipc host 运行,务必用 stop.sh 正常退出(等vLLM清理POSIX共享内存),强杀会在 /dev/shm 留泄漏直到重启这个仓库是一份自包含的部署配方:在单台 DGX Spark 的 121 GiB 统一内存上,用 vLLM 服务 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 检查点(99 GB)——PLE 表卸载并内存映射,不依赖任何双机配置。这是一个视觉语言模型:文本、图像、视频输入开箱即用。
容器以 --ipc host 运行,务必用 stop.sh 正常退出(等vLLM清理POSIX共享内存),强杀会在 /dev/shm 留泄漏直到重启