把整个网站转为适合 LLM 的 Markdown 或结构化数据的抓取 API。
Tesseract
历史最悠久的开源 OCR 引擎。
- 仓库
- tesseract-ocr/tesseract
- Stars
- ★ 76,900
- Forks
- 10,825
- 语言
- C++
- 许可证
- Apache-2.0
- 最近更新
- 2026-10-10
- 访问次数
- 1
OCR
历史最悠久的开源 OCR 引擎。
OCR
把整个网站转为适合 LLM 的 Markdown 或结构化数据的抓取 API。
百度飞桨的 OCR 工具库,百余种语言、PP-OCR 与文档解析一体。
把 PDF 等文档高质量转换为 Markdown / JSON,面向大模型语料。
IBM 开源的文档解析工具,PDF / Office 转结构化数据。
微软出品,把 Office、PDF 等文件转为 Markdown 供 LLM 使用。
为 LLM 设计的开源网页爬虫与抓取工具。