Opik教程:LLM应用可观测性平台,追踪评估调试监控一体化

📌 评测日期:2026年8月 | 数据来源:GitHub官方仓库 | 星数:21,100+

📋 项目简介

Opik 是 comet-ml 团队开源的 LLM 应用可观测性平台,采用 Apache-2.0 协议,在 GitHub 上获得了超过 2.1 万颗星。它提供了一体化的 LLM 应用追踪(tracing)、评估(evaluation)、调试(debugging)和监控(monitoring)能力,帮助开发者构建更可靠的 LLM 应用。

随着 LLM 应用从原型走向生产,可观测性成为关键瓶颈。传统 APM 工具(如 Datadog、New Relic)针对请求-响应模式设计,无法处理 LLM 应用的多步骤链式调用、流式输出、Token 消耗等特殊场景。Opik 专为 LLM 应用设计,能够追踪完整的调用链路,包括 Prompt 构建、模型调用、RAG 检索、工具使用等每个环节。

Opik 特别适合监控复杂的 Agent 工作流和 RAG 系统,能帮助开发者快速定位"为什么Agent给出了错误答案"这类难以调试的问题。结合 上下文压缩技术,可以进一步优化LLM应用的性能和成本。

🔧 核心功能

功能说明使用场景
调用链追踪追踪LLM应用完整调用链,包括多步骤Agent工作流调试复杂Agent行为、性能分析
自动评估内置LLM-as-judge评估器,自动评分输出质量持续监控应用质量
RAG追踪追踪检索-生成全流程,记录检索文档和引用关系RAG系统调试和优化
Prompt版本管理版本化Prompt,支持A/B测试和回滚Prompt迭代优化
Token成本分析按调用链统计Token消耗和API成本成本优化和预算控制
实时监控面板Dashboard展示延迟、错误率、质量趋势生产环境实时监控

📦 安装部署

# 安装Opik SDK
pip install opik

# 方式1: 使用Opik Cloud (免费层支持10k traces/月)
export OPIK_API_KEY=your_api_key
export OPIK_WORKSPACE=your_workspace

# 方式2: 本地自托管部署
docker run -d --name opik \
  -p 3000:3000 \
  -v opik_data:/app/data \
  cometml/opik:latest

# 配置Python应用接入
export OPIK_URL=http://localhost:3000

# 验证连接
python -c "
import opik
opik.configure(use_local=True)
print('Opik connected successfully!')
"

💡 使用示例

# 基本用法:追踪LLM调用
from opik import track
from openai import OpenAI

client = OpenAI()

@track(project_name="my-llm-app")
def generate_response(user_question: str):
    # Opik自动追踪这个函数的输入输出
    response = client.chat.completions.create(
        model="gpt-4o",
        messages=[
            {"role": "system", "content": "你是一个专业的AI助手"},
            {"role": "user", "content": user_question}
        ]
    )
    return response.choices[0].message.content

# 追踪RAG流程
@track(project_name="rag-app")
def rag_pipeline(question: str):
    # 检索阶段 (自动追踪)
    docs = retrieve_documents(question)
    
    # 生成阶段 (自动追踪)
    answer = generate_response(
        f"基于以下文档回答问题:\n{docs}\n\n问题: {question}"
    )
    return answer

# 进阶:添加自定义评估
from opik.evaluation import evaluate
from opik.evaluation.metrics import HallucinationMetric, AnswerRelevanceMetric

# 定义评估指标
hallucination = HallucinationMetric(
    model="gpt-4o",
    sample_size=100
)
relevance = AnswerRelevanceMetric(
    model="gpt-4o",
    sample_size=100
)

# 对历史追踪数据进行批量评估
evaluation_result = evaluate(
    project_name="rag-app",
    dataset_name="eval-dataset",
    metrics=[hallucination, relevance],
    experiment_name="v2-rag-eval"
)

print(f"幻觉率: {evaluation_result.hallucination_score}")
print(f"相关性: {evaluation_result.relevance_score}")

# 进阶:监控Agent工作流
@track(project_name="agent-workflow")
def run_agent(task: str):
    steps = []
    # 每个步骤自动被追踪
    plan = planner(task)
    steps.append({"step": "plan", "result": plan})
    
    for action in plan["actions"]:
        result = executor(action)
        steps.append({"step": "execute", "result": result})
    
    final = synthesizer(steps)
    return final

🔄 竞品对比

项目优势劣势
Opik开源Apache-2.0,LLM专用评估器,自托管支持社区较新,集成生态待完善
LangSmithLangChain深度集成,功能丰富商业产品,数据需上云
Phoenix (Arize)开源,强大的可视化能力评估能力较弱于Opik
Langfuse开源,功能全面,社区活跃UI体验一般,评估器较少

📦 使用建议

推荐场景:

不推荐场景:

📚 常见问题

Opik是什么?

Opik 是 comet-ml 团队开源的 LLM 应用可观测性平台,采用 Apache-2.0 协议,在 GitHub 上获得了超过 2.1 万颗星。它提供了一体化的 LLM 应用追踪(tracing)、评估(evaluation)、调试(debugging)和监控(monitoring)能力,帮助开发者构建更可靠的

如何上手Opik?

LLM应用从原型走向生产,需要系统化可观测性