为文档处理工作流打造的强大工具集
支持多种文档源的智能爬取,自动处理页面结构,保留文档层级关系和格式信息。
自动转换为标准 Markdown 格式,保留代码块、表格、图片等富文本元素。
为 RAG 知识库优化的输出格式,便于后续向量化存储和检索使用。
三步完成文档处理流程
使用 Conda 创建独立的 Python 环境:
conda create -n doc-crawler python=3.10.13 -y
安装所需的 Python 包:
pip install -r requirements.txt
运行爬虫脚本下载并转换文档(示例:Dify 文档):
python doc_crawlers/dify_doc_crawler.py
使用过程中的疑问解答
目前支持主流技术文档网站,如 Dify、Vercel、Stripe 等。每种文档源都有专用的爬虫脚本,可根据文档网站结构进行定制化处理。
在 doc_crawlers 目录下创建新的爬虫脚本,参考现有脚本的结构。主要步骤包括:页面解析、内容提取、Markdown 转换和文件输出。
默认情况下,转换后的文件存储在项目的 output 目录中,保持原始文档的目录结构。可通过脚本配置修改输出路径。
推荐使用 Python 3.10.13 版本。项目在 Conda 环境中测试,确保依赖兼容性。其他 3.10.x 版本通常也能正常工作。