1Cat-vLLM是vLLM的fork分支,专为Tesla V100(SM70架构)优化,支持AWQ 4-bit量化,CUDA 12.8构建流程,已验证Qwen3.5 27B可运行。GitHub: github.com/1CatAI/1Cat-vLLM
原版vLLM已放弃V100支持。1Cat-vLLM让老旧V100显卡也能跑最新大模型,适合有闲置V100的个人开发者和实验室。
Tesla V100 / Titan V (SM70架构) | CUDA 12.8+ | Python 3.10+ | PyTorch 2.2+
git clone https://github.com/1CatAI/1Cat-vLLM.git cd 1Cat-vLLM pip install -r requirements.txt python setup.py install
python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.5-27B-Instruct-AWQ \ --quantization awq \ --dtype float16 \ --max-model-len 8192 \ --port 8000
Qwen3.5-27B AWQ 4bit:吞吐量45 tokens/s,延迟1.2s首token
Llama-3.1-8B FP16:吞吐量120 tokens/s
DeepSeek-V4-Flash(量化):可用但速度一般,建议至少2张V100
V100不支持Flash Attention 2,1Cat-vLLM使用替代实现。4-bit量化是V100跑大模型的必要条件。SM70架构的flash_qla和flashinfer分支可进一步优化。
相关:vLLM本地部署、Unsloth本地微调。
1Cat-vLLM是vLLM的fork分支,专为Tesla V100(SM70架构)优化,支持AWQ 4-bit量化,CUDA 12.8构建流程,已验证Qwen3.5 27B可运行。GitHub: github.com/1CatAI/1Cat-vLLM