Qwen3.8-Flash-Next教程:单台DGX Spark跑通99GB视觉语言模型

📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:160+

📋 项目简介

这个仓库是一份自包含的部署配方:在单台 DGX Spark 的 121 GiB 统一内存上,用 vLLM 服务 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 检查点(99 GB)——PLE 表卸载并内存映射,不依赖任何双机配置。这是一个视觉语言模型:文本、图像、视频输入开箱即用。

本地跑大模型一直是"显存军备竞赛",这份配方证明了单机统一内存架构的可行性;想了解一体化本地AI服务器的整体方案,看我们对 Osmantic ODS本地AI服务器 的评测;想从零理解模型训练,则看 MiniMind从零训练教程

📦 三条命令部署

cp .env.sample .env      # 按需编辑 IMAGE / HF_TOKEN
./download.sh            # 拉取 ~99GB 检查点(支持断点续传)
./start.sh               # 约10-12分钟到 /health,服务端口 :8888
./stop.sh                # 容器+看门狗优雅退出

磁盘预算约 130 GiB:检查点 99 GB + 首次启动生成的 ~27 GB 打包 PLE 表。start.sh 从不联网下载——只从本地 HF 缓存解析检查点,缺了就直接报错。./start.sh --no-launch 可以先打印推导出的内存预算与 docker 命令预览。

🔧 默认配置与实测

参数
上下文长度262,144(YaRN off)
MTP / KV缓存MTP 3;KV fp8,目标16 GiB
并发MAX_NUM_SEQS=4,MAX_NUM_BATCHED_TOKENS=2048
主机内存预留26 GiB
实测速度46.3 tok/s(单流散文,2026-09-04/05 sparkDash扫测)

💡 使用建议

📚 常见问题

Qwen3.8-Flash-Next是什么?

这个仓库是一份自包含的部署配方:在单台 DGX Spark 的 121 GiB 统一内存上,用 vLLM 服务 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 检查点(99 GB)——PLE 表卸载并内存映射,不依赖任何双机配置。这是一个视觉语言模型:文本、图像、视频输入开箱即用。

如何上手Qwen3.8-Flash-Next?

容器以 --ipc host 运行,务必用 stop.sh 正常退出(等vLLM清理POSIX共享内存),强杀会在 /dev/shm 留泄漏直到重启