日期:2026-08-14 | 分类:AI工具教程
Meta于8月10日开源Muse Glimmer(Apache 2.0),300亿参数稠密模型,专为本地Agent工作流深度优化。4bit量化后可在24GB显存单GPU运行,支持12万+Token上下文,单GPU每秒2万Token处理速度。
# 安装Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 拉取Muse Glimmer 4bit量化版
ollama pull muse-glimmer:4b
# 启动推理服务
ollama serve
# 测试
ollama run muse-glimmer:4b "帮我整理这个目录的文件"
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Muse-Glimmer-30B \
--quantization awq \
--max-model-len 131072 \
--port 8000
pip install transformers torch accelerate
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Muse-Glimmer-30B",
load_in_4bit=True,
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Muse-Glimmer-30B")
inputs = tokenizer("规划:每天早上整理邮件并回复重要邮件", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(output[0]))
pip install llama-index
from llama_index.agent import AgentWorker
agent = AgentWorker.from_model(
model="meta-llama/Muse-Glimmer-30B",
quantization="4bit",
tools=["file_read", "file_write", "shell_exec"]
)
# 执行Agent任务
response = agent.chat("帮我分析项目代码结构并生成README")
| 指标 | Muse Glimmer 4bit | Muse Glimmer FP16 |
|---|---|---|
| 显存占用 | ~18GB | ~60GB |
| 推理速度 | ~15 tok/s (4090) | ~8 tok/s |
| Agent任务衰减 | <5% | 基准 |
Meta于8月10日开源Muse Glimmer(Apache 2.0),300亿参数稠密模型,专为本地Agent工作流深度优化。4bit量化后可在24GB显存单GPU运行,支持12万+Token上下文,单GPU每秒2万Token处理速度。
Muse Spark 1.2模型解析