RAG(Retrieval-Augmented Generation)是2026年企业AI应用的核心架构。本文从文档处理到向量检索全流程,教你搭建一个生产可用的RAG知识库。
文档解析:MarkItDown(微软开源,10万星)转Markdown。向量模型:bge-m3(多语言)或text-embedding-3-large(OpenAI)。向量数据库:Chroma(轻量)、Milvus(生产级)、pgvector(Postgres内)。编排框架:LlamaIndex(数据为中心)或LangGraph(复杂编排)。
# 1. 文档预处理
pip install markitdown
markitdown *.docx *.pdf > knowledge.md
# 2. 分块与向量化
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader
documents = SimpleDirectoryReader("./docs").load_data()
index = VectorStoreIndex.from_documents(documents)
# 3. 检索问答
query_engine = index.as_query_engine()
response = query_engine.query("公司的出差报销流程是什么?")
分块策略:固定大小(512 token)+重叠(50 token)适合大多数场景。重排序:用bge-reranker对检索结果二次排序,提升相关性。混合检索:关键词检索+向量检索结合,覆盖精确匹配和语义匹配。上下文窗口:Top-5检索结果,控制总token在4000以内。
对知识库搭建感兴趣?阅读Ollama本地部署,或了解MarkItDown文档转换。
RAG(Retrieval-Augmented Generation)是2026年企业AI应用的核心架构。本文从文档处理到向量检索全流程,教你搭建一个生产可用的RAG知识库。