与上一期排名持平
- 记录天数
- 2 天
- 记录期 Star
- +669
@firecrawl
Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.
HISTORICAL INTELLIGENCE
与上一期排名持平
2026-08-03 至 2026-08-04,掉榜日期保留为空缺。
VERIFIABLE HEALTH SIGNALS
AI-ASSISTED PROJECT BRIEF
AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。
项目资料AI 整理
pdf-inspector 是 Firecrawl 开发的 Rust PDF 处理库,可快速分类 PDF 类型并提取文本,无需 OCR 即可转换为 Markdown,支持 Python、Node.js 和 WebAssembly。
pdf-inspector 是一个开源的 Rust 库,专注于 PDF 检查、分类和文本提取。它通过采样内容流在约 10-50ms 内判断 PDF 是文本型、扫描型、图像型还是混合型,并返回置信度评分。该库还提供位置感知的文本提取、多列布局检测和 Markdown 转换,支持表格、标题、代码块等格式。项目提供 Python、Node.js 和 WebAssembly 绑定,MIT 许可,旨在让文本型 PDF 在本地快速处理,避免不必要的 OCR 成本。
项目最值得关注的能力
它可以解决哪些实际问题
从公开资料提炼的实现特征
相对明确的项目价值
评估和采用前需要留意
哪些开发者和团队值得关注
pdf-inspector 在 PDF 分类和 Markdown 转换方面展现了较高的性能与结构保留能力,多语言绑定使其易于集成。从公开资料看,它是文本型 PDF 本地处理的优选方案之一,但扫描型 PDF 仍需 OCR 辅助。采用前建议自行完成安全与兼容性验证。由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。
区分可验证事实、项目方自述与 AI 推断
Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。
功能与使用方式主要来自仓库描述和 README,未经本站独立验证。
适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。