1Cat-vLLM安装教程:让Tesla V100跑Qwen3.5 27B的vLLM分支

2026-08-10 | AI Tools Hub

1Cat-vLLM是vLLM的fork分支,专为Tesla V100(SM70架构)优化,支持AWQ 4-bit量化,CUDA 12.8构建流程,已验证Qwen3.5 27B可运行。GitHub: github.com/1CatAI/1Cat-vLLM

为什么需要1Cat-vLLM

原版vLLM已放弃V100支持。1Cat-vLLM让老旧V100显卡也能跑最新大模型,适合有闲置V100的个人开发者和实验室。

环境要求

Tesla V100 / Titan V (SM70架构) | CUDA 12.8+ | Python 3.10+ | PyTorch 2.2+

安装步骤

git clone https://github.com/1CatAI/1Cat-vLLM.git
cd 1Cat-vLLM
pip install -r requirements.txt
python setup.py install

运行Qwen3.5 27B(AWQ 4-bit)

python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen3.5-27B-Instruct-AWQ \
  --quantization awq \
  --dtype float16 \
  --max-model-len 8192 \
  --port 8000

V100性能基准

Qwen3.5-27B AWQ 4bit:吞吐量45 tokens/s,延迟1.2s首token

Llama-3.1-8B FP16:吞吐量120 tokens/s

DeepSeek-V4-Flash(量化):可用但速度一般,建议至少2张V100

注意事项

V100不支持Flash Attention 2,1Cat-vLLM使用替代实现。4-bit量化是V100跑大模型的必要条件。SM70架构的flash_qla和flashinfer分支可进一步优化。

相关:vLLM本地部署Unsloth本地微调

📚 常见问题

1Cat-vLLM安装是什么?

1Cat-vLLM是vLLM的fork分支,专为Tesla V100(SM70架构)优化,支持AWQ 4-bit量化,CUDA 12.8构建流程,已验证Qwen3.5 27B可运行。GitHub: github.com/1CatAI/1Cat-vLLM