RAG 知识库文档处理工具

智能文档下载与
Markdown 转换脚本

轻松下载各类技术文档并自动转换为 Markdown 格式,为 RAG 知识库构建提供高质量语料。支持多种文档源,一键转换。

核心特性

为文档处理工作流打造的强大工具集

智能下载

支持多种文档源的智能爬取,自动处理页面结构,保留文档层级关系和格式信息。

格式转换

自动转换为标准 Markdown 格式,保留代码块、表格、图片等富文本元素。

知识库集成

为 RAG 知识库优化的输出格式,便于后续向量化存储和检索使用。

使用指南

三步完成文档处理流程

1

创建环境

使用 Conda 创建独立的 Python 环境:

conda create -n doc-crawler python=3.10.13 -y
2

安装依赖

安装所需的 Python 包:

pip install -r requirements.txt
3

下载文档

运行爬虫脚本下载并转换文档(示例:Dify 文档):

python doc_crawlers/dify_doc_crawler.py

常见问题

使用过程中的疑问解答

支持哪些文档网站?

目前支持主流技术文档网站,如 Dify、Vercel、Stripe 等。每种文档源都有专用的爬虫脚本,可根据文档网站结构进行定制化处理。

如何添加新的文档源?

doc_crawlers 目录下创建新的爬虫脚本,参考现有脚本的结构。主要步骤包括:页面解析、内容提取、Markdown 转换和文件输出。

转换后的 Markdown 文件存储在哪里?

默认情况下,转换后的文件存储在项目的 output 目录中,保持原始文档的目录结构。可通过脚本配置修改输出路径。

Python 版本要求是什么?

推荐使用 Python 3.10.13 版本。项目在 Conda 环境中测试,确保依赖兼容性。其他 3.10.x 版本通常也能正常工作。