firecrawl

@firecrawl

pdf-inspector

firecrawl/pdf-inspector

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

STARS7,974
FORKS533
ISSUES59
LANGUAGERust

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
日榜持续记录
历史最佳#3当前排名#3

与上一期排名持平

记录天数
2 天
记录期 Star
+669
本站共 12 天日榜快照 · 最近记录 2026-08-04
本站最早记录:2026-08-03

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

日榜历史趋势

2026-08-03 至 2026-08-04,掉榜日期保留为空缺。

排名,数字越小越靠前当日新增 Star
折线表示历史榜单排名,柱形表示相同快照记录的新增 Star。排名纵轴已反向,越靠上排名越高。 #1 #2 #2 #3 #3 2026-08-03:新增 1769 Star 2026-08-04:新增 1769 Star 2026-08-03:排名 #3,新增 1769 Star2026-08-04:排名 #3,新增 1769 Star 08-03 08-04 +1.8k
图表仅使用本站保存的快照,不补零、不推算掉榜期间数据;下方历史明细继续保留原始日期、排名与 Star 数。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
部分样本
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
≥97
已采集下限
活跃贡献者
≥2
按公开提交账号去重
近 12 月活跃月份
7/12
基于已采集提交
RESPONSE

社区响应

核对样本
Issue 关闭率
17%
5/30 个同期新 Issue
Issue 关闭中位数
3.0 天
仅统计已关闭样本
PR 合并率
74%
95/129 个同期新 PR
PR 合并中位数
0.4 小时
仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
0
排除草稿与预发布
最近正式 Release
暂无记录
以公开发布时间为准
发布间隔中位数
样本不足
至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
MIT
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

统计窗口 90 天快照样本 2 天计算规则 health-v1采集于 2026-08-04 00:10

高活跃数据触及分页上限,数值以已采集下限展示。 这些信号不替代代码审计、安全测试和真实生产验证。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

pdf-inspector 是 Firecrawl 开发的 Rust PDF 处理库,可快速分类 PDF 类型并提取文本,无需 OCR 即可转换为 Markdown,支持 Python、Node.js 和 WebAssembly。

pdf-inspector 是一个开源的 Rust 库,专注于 PDF 检查、分类和文本提取。它通过采样内容流在约 10-50ms 内判断 PDF 是文本型、扫描型、图像型还是混合型,并返回置信度评分。该库还提供位置感知的文本提取、多列布局检测和 Markdown 转换,支持表格、标题、代码块等格式。项目提供 Python、Node.js 和 WebAssembly 绑定,MIT 许可,旨在让文本型 PDF 在本地快速处理,避免不必要的 OCR 成本。

核心亮点

项目最值得关注的能力

AI 推断
  • 智能 PDF 分类:约 10-50ms 内识别文本型、扫描型、图像型或混合型 PDF,附置信度评分。
  • 原生的 Markdown 转换:支持标题、列表、表格、代码块、粗体/斜体及 URL 链接。
  • 多平台绑定:提供 Python、Node.js 和浏览器 WebAssembly 接口。

适用场景

它可以解决哪些实际问题

AI 推断
  • 文档处理管道中智能路由:为扫描型 PDF 决定是否调用 OCR 服务。
  • 将报告、论文、财务票据等文本型 PDF 批量转为结构化 Markdown。
  • 在无服务器的浏览器环境或 Web Worker 中完成本地 PDF 解析。

技术观察

从公开资料提炼的实现特征

AI 推断
  • 核心为纯 Rust 实现,仅依赖 lopdf 进行 PDF 解析,不包含机器学习模型。
  • 支持 CID 字体(Type0/Identity-H)的 ToUnicode CMap 解码,以及多种文本编码。
  • 表格检测采用矩形绘制操作与文本对齐启发式相结合的双模式方案。

优势判断

相对明确的项目价值

AI 推断
  • 从公开资料看,在 opendataloader-bench 基准中展现出较高的读取顺序和表格结构保留分数,且完整处理 200 份文档耗时较低。
  • 轻量且易于集成,提供多语言绑定,可覆盖服务端与浏览器场景。

局限与注意

评估和采用前需要留意

AI 推断
  • 从公开资料看,项目本身不提供 OCR 能力,纯扫描型 PDF 需要外部 OCR 服务介入。
  • 从公开资料看,GitHub 上仍有 54 个未关闭的 issue,建议在生产环境采用前自行评估其对特定工作负载的稳定性与安全性。

适用人群

哪些开发者和团队值得关注

AI 推断
  • 面向需要高效 PDF 解析与格式转换的软件开发者。
  • 适合构建文档处理管道、RAG 数据导入或无头解析服务的团队。
综合参考
pdf-inspector 在 PDF 分类和 Markdown 转换方面展现了较高的性能与结构保留能力,多语言绑定使其易于集成。从公开资料看,它是文本型 PDF 本地处理的优选方案之一,但扫描型 PDF 仍需 OCR 辅助。采用前建议自行完成安全与兼容性验证。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:该仓库在 GitHub 上有 6629 星、465 fork,最近一次基准数据更新于 2026 年 7 月。
  • 项目方自述:README 中列出的功能与基准测试结果由项目团队自行发布,未经第三方独立验证。
生成于 2026-08-03 19:15 规则版本 2026-07-v3
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。