把整个网站转为适合 LLM 的 Markdown 或结构化数据的抓取 API。
olmOCR
AI2 的 PDF 线性化工具包,用视觉语言模型解析文档。
- 仓库
- allenai/olmocr
- Stars
- ★ 19,734
- Forks
- 1,644
- 语言
- Python
- 许可证
- Apache-2.0
- 最近更新
- 2026-03-25
- 访问次数
- 0
OCRPDF
AI2 的 PDF 线性化工具包,用视觉语言模型解析文档。
OCRPDF
把整个网站转为适合 LLM 的 Markdown 或结构化数据的抓取 API。
百度飞桨的 OCR 工具库,百余种语言、PP-OCR 与文档解析一体。
把 PDF 等文档高质量转换为 Markdown / JSON,面向大模型语料。
IBM 开源的文档解析工具,PDF / Office 转结构化数据。
微软出品,把 Office、PDF 等文件转为 Markdown 供 LLM 使用。
为 LLM 设计的开源网页爬虫与抓取工具。