Firecrawl教程:17.6万星网页上下文API,给AI Agent插上全网抓取能力

📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:176,412+

📋 项目简介

Firecrawl 自称"网页上下文API"——搜索、抓取、与网页交互的一站式接口,把任意网页变成 LLM 友好的干净 Markdown 或结构化数据。官方基准覆盖 96% 的网页,包括 JS 重度渲染的站点,不用你再操心代理池和无头浏览器。开源可自托管,也提供托管版 firecrawl.dev。

对做 RAG 和 Agent 的团队来说它是基础设施级的组件:检索到的内容直接进向量库,Agent 的工具箱里多一个"查网页"能力。搭 RAG 知识库可以参考 Dify RAG知识库教程,把它编排进自动化流程则看 n8n工作流自动化教程

🔧 核心能力

能力说明
Scrape单页抓取,输出 Markdown / 结构化数据,JS 渲染站点无压力
Search网页搜索,直接返回清洗后的结果列表
Agent自主数据收集:给一句提示词,自动多步检索汇总
Crawl整站递归抓取,异步任务自动轮询
双端SDKPython(firecrawl-py)与 Node.js(firecrawl)官方包

📦 快速上手

# Python SDK
pip install firecrawl-py

from firecrawl import Firecrawl

app = Firecrawl(api_key="fc-YOUR_API_KEY")

# 抓取单页
doc = app.scrape("https://firecrawl.dev", formats=["markdown"])
print(doc.markdown)

# 网页搜索
results = app.search("best AI data tools 2024", limit=10)

# Agent 自主收集数据
result = app.agent(prompt="Find the founders of Stripe")
// Node.js SDK
npm install firecrawl

import { Firecrawl } from 'firecrawl';
const app = new Firecrawl({ apiKey: 'fc-YOUR_API_KEY' });
const doc = await app.scrape('https://firecrawl.dev', { formats: ['markdown'] });
console.log(doc.markdown);

SDK 自动处理异步操作的轮询;需要私有化部署时,仓库提供完整自托管方案,配合 Docker 即可起服务。

💡 使用建议

📚 常见问题

Firecrawl是什么?

Firecrawl 自称"网页上下文API"——搜索、抓取、与网页交互的一站式接口,把任意网页变成 LLM 友好的干净 Markdown 或结构化数据。官方基准覆盖 96% 的网页,包括 JS 重度渲染的站点,不用你再操心代理池和无头浏览器。开源可自托管,也提供托管版 firecrawl.dev。

如何上手Firecrawl?

RAG 管道里用 Crawl 整站转 Markdown,再切块入库,比自写爬虫省两周