基础资料 · 开发建站

Crawl4AI

面向大模型与 RAG 的开源网页爬虫。

Crawl4AI 是一个功能丰富的网页爬虫与抓取工具,面向 RAG 管道或直接输入大模型,支持生成干净 Markdown、结构化提取、高级浏览器控制与并行爬取。

开发建站

01 / 概览

关于

Crawl4AI 是一个功能丰富的网页爬虫与抓取工具,面向 RAG 管道或直接输入大模型,支持生成干净 Markdown、结构化提取、高级浏览器控制与并行爬取。

02 / 工具截图

工具截图

已人工审核并发布的官网页面快照。

03 / 核心功能

核心功能

01

干净 Markdown 输出

为 RAG 管道或直接输入大模型生成干净 Markdown。

02

结构化提取

使用 CSS、XPath 或基于 LLM 的提取解析重复模式。

03

高级浏览器控制

通过钩子、代理、隐身模式和会话复用控制浏览器。

04

高性能并行爬取

支持并行爬取、分块提取和实时应用场景。

05

LLMTableExtraction

面向大型表格提供智能分块表格提取。

06

代理与 Docker 支持

支持灵活代理配置,并改进 Docker API 与原始 HTML 处理。

04 / 同类产品

同类产品

按任务与产品类型整理,不代表优劣排序。

Readdy

用自然语言生成、编辑并发布多页面网站,内置托管、域名和业务集成能力。

AI 建站与落地页

DeepSeek Harness

面向 Harness 开发者的插件化 Agent 开发者预览版。

组合和扩展面向真实任务的 Agent 能力。

Chat4Data

用自然语言从网页提取结构化数据的 Chrome 插件。

用自然语言从网页提取结构化数据的 Chrome 插件。

superun

用对话创建网站、应用和业务工作台的 AI 产品创作平台。

用对话创建网站、应用和业务工作台的 AI 产品创作平台。

05 / 来源

来源