llama.cpp是大模型推理领域的基础设施级项目,实现了在消费级硬件上高效运行大语言模型的能力。支持CPU和GPU混合推理,是Ollama等工具的底层引擎。2026年8月GitHub星标超70k。
llama.cpp用C/C++实现,无第三方依赖,支持GGUF量化格式(2-bit到8-bit)。CPU推理:AVX2/AVX-512指令集优化,i7处理器可跑7B模型。GPU推理:CUDA/Metal/Vulkan后端,16GB显存可跑DeepSeek V4 Flash(130亿激活参数)。混合推理:CPU+GPU协同,GPU放不下的大模型自动offload到CPU。
git clone https://github.com/ggerganov/llama.cpp cd llama.cpp make GGML_CUDA=1 # GPU编译 # 下载GGUF模型 huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF # 运行推理 ./llama-cli -m DeepSeek-V4-Flash-Q4_K_M.gguf -p "你好" -n 512
Q4_K_M:4-bit量化,体积最小,速度最快,质量损失小(推荐)。Q5_K_M:5-bit,质量与体积平衡。Q8_0:8-bit,几乎无损,体积大。根据显存选择:8GB→Q4,12GB→Q5,16GB→Q8。
对推理框架感兴趣?阅读Ollama本地部署,或了解vLLM部署指南。
llama.cpp是大模型推理领域的基础设施级项目,实现了在消费级硬件上高效运行大语言模型的能力。支持CPU和GPU混合推理,是Ollama等工具的底层引擎。2026年8月GitHub星标超70k。