Muse Glimmer本地部署教程:Meta开源30B Agent模型单卡运行

日期:2026-08-14 | 分类:AI工具教程


项目简介

Meta于8月10日开源Muse Glimmer(Apache 2.0),300亿参数稠密模型,专为本地Agent工作流深度优化。4bit量化后可在24GB显存单GPU运行,支持12万+Token上下文,单GPU每秒2万Token处理速度。

环境要求

安装部署

方法1:Ollama一键部署(推荐)

# 安装Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 拉取Muse Glimmer 4bit量化版
ollama pull muse-glimmer:4b

# 启动推理服务
ollama serve

# 测试
ollama run muse-glimmer:4b "帮我整理这个目录的文件"

方法2:vLLM部署

pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Muse-Glimmer-30B \
  --quantization awq \
  --max-model-len 131072 \
  --port 8000

方法3:HuggingFace Transformers

pip install transformers torch accelerate

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "meta-llama/Muse-Glimmer-30B",
    load_in_4bit=True,
    device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Muse-Glimmer-30B")

inputs = tokenizer("规划:每天早上整理邮件并回复重要邮件", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(output[0]))

Agent工作流配置

pip install llama-index

from llama_index.agent import AgentWorker

agent = AgentWorker.from_model(
    model="meta-llama/Muse-Glimmer-30B",
    quantization="4bit",
    tools=["file_read", "file_write", "shell_exec"]
)

# 执行Agent任务
response = agent.chat("帮我分析项目代码结构并生成README")

性能对比

指标Muse Glimmer 4bitMuse Glimmer FP16
显存占用~18GB~60GB
推理速度~15 tok/s (4090)~8 tok/s
Agent任务衰减<5%基准

相关阅读

📚 常见问题

Muse Glimmer本地部署是什么?

Meta于8月10日开源Muse Glimmer(Apache 2.0),300亿参数稠密模型,专为本地Agent工作流深度优化。4bit量化后可在24GB显存单GPU运行,支持12万+Token上下文,单GPU每秒2万Token处理速度。

如何上手Muse Glimmer本地部署?

Muse Spark 1.2模型解析