工具介绍
本工具可以直接在浏览器中从PDF文件里提取所有嵌入的图片,无需上传到服务器,处理过程全部在本地完成,保护文件隐私。提取到的图片可以单张下载保存。
使用方法
- 点击「选择PDF文件」按钮,选择你需要提取图片的PDF文档
- 设置图片输出质量,范围为 0(最低质量)到 1(最高质量),默认 0.8 为平衡质量和大小
- 勾选「跳过小图片」可自动过滤小于 100×100 像素的图标、装饰小图,只提取大尺寸图片
- 点击「开始提取图片」按钮,等待处理完成后即可查看所有提取的图片,点击下载按钮保存单张图片
提取原理
本工具使用 Mozilla 开源的 pdf.js 库解析PDF文件结构,逐页遍历PDF页面的操作指令,识别出所有嵌入图片对象,将位图数据解码后绘制到Canvas画布,再导出为JPG图片文件。
注意事项
- 如果PDF包含很多大图片,处理过程可能会消耗较多内存,浏览器卡顿属于正常现象,请耐心等待。
- 扫描版PDF本质是一整页一张图片,本工具可以提取,但需要PDF本身是嵌入整页图片的结构。
- 提取出来的图片清晰度和PDF中原始嵌入图片的清晰度一致,本工具不会提升也不会降低原始清晰度(仅在导出为JPG时根据你设置的质量做轻微压缩)。