📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:176,412+
Firecrawl 自称"网页上下文API"——搜索、抓取、与网页交互的一站式接口,把任意网页变成 LLM 友好的干净 Markdown 或结构化数据。官方基准覆盖 96% 的网页,包括 JS 重度渲染的站点,不用你再操心代理池和无头浏览器。开源可自托管,也提供托管版 firecrawl.dev。
对做 RAG 和 Agent 的团队来说它是基础设施级的组件:检索到的内容直接进向量库,Agent 的工具箱里多一个"查网页"能力。搭 RAG 知识库可以参考 Dify RAG知识库教程,把它编排进自动化流程则看 n8n工作流自动化教程。
| 能力 | 说明 |
|---|---|
| Scrape | 单页抓取,输出 Markdown / 结构化数据,JS 渲染站点无压力 |
| Search | 网页搜索,直接返回清洗后的结果列表 |
| Agent | 自主数据收集:给一句提示词,自动多步检索汇总 |
| Crawl | 整站递归抓取,异步任务自动轮询 |
| 双端SDK | Python(firecrawl-py)与 Node.js(firecrawl)官方包 |
# Python SDK
pip install firecrawl-py
from firecrawl import Firecrawl
app = Firecrawl(api_key="fc-YOUR_API_KEY")
# 抓取单页
doc = app.scrape("https://firecrawl.dev", formats=["markdown"])
print(doc.markdown)
# 网页搜索
results = app.search("best AI data tools 2024", limit=10)
# Agent 自主收集数据
result = app.agent(prompt="Find the founders of Stripe")
// Node.js SDK
npm install firecrawl
import { Firecrawl } from 'firecrawl';
const app = new Firecrawl({ apiKey: 'fc-YOUR_API_KEY' });
const doc = await app.scrape('https://firecrawl.dev', { formats: ['markdown'] });
console.log(doc.markdown);
SDK 自动处理异步操作的轮询;需要私有化部署时,仓库提供完整自托管方案,配合 Docker 即可起服务。
Firecrawl 自称"网页上下文API"——搜索、抓取、与网页交互的一站式接口,把任意网页变成 LLM 友好的干净 Markdown 或结构化数据。官方基准覆盖 96% 的网页,包括 JS 重度渲染的站点,不用你再操心代理池和无头浏览器。开源可自托管,也提供托管版 firecrawl.dev。
RAG 管道里用 Crawl 整站转 Markdown,再切块入库,比自写爬虫省两周