文档工具 · PDF 处理

PDF 提取图片

提取嵌入图片

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 71 次使用
XObject · 去重 · 还原 SMask 透明 · 本地
拖入 / 点击选择 PDF

提取 PDF 中真正嵌入的位图(照片 / 插图 / 扫描页)· 非整页截图

Extracted locally — nothing uploaded
隐私:PDF 的解析、图片抽取、格式转换全程在浏览器本地完成,原文件绝不上传服务器。关闭页面即清空。
就绪 · 拖入 PDF 开始提取嵌入图片
第一节

关于本工具

About

一份设计稿的PDF里嵌了十几张高清图,用截图工具一张张抠,分辨率不对、文件名还得手动改。这个工具直接把PDF里的嵌入图片批量提取出来,保留原始像素和格式。上传后后端处理,文件会在一小时内自动删除,不存服务器。

使用场景

投标文件附图还原

建筑公司投标专员收到甲方发来的PDF版施工图纸,里面嵌着几十张JPG节点大样图,但甲方要求投标文件里必须提交高清原图。直接截图会损失分辨率,用PS一张张抠又太慢。把PDF丢进工具,1分钟内批量抽出所有嵌入图片,分辨率与原图一致,直接拖进投标书排版,不用二次压缩或裁剪。

学术论文图表提取

研究生下载了一篇40页的顶会论文PDF,里面嵌了15张实验对比图和折线图,但PDF阅读器只能整页截图,截出来的图带白边和页码。需要把这些图单独存成文件,贴进自己的综述里当参考文献图。用本工具一次性抽取出所有图片,按原文件名编号,省去手动截图、裁剪、重命名的半小时重复劳动。

电商详情页素材整理

运营从供应商拿到一份产品PDF手册,里面嵌着产品主图、细节图、尺寸图共23张,但供应商只给了PDF,没给源文件。要上架到淘宝详情页,必须把每张图单独存成PNG。用本工具一键提取所有图片,按顺序命名,直接拖进详情页编辑器,不用再找供应商要源文件。

合同扫描件证据固化

法务收到一份对方发来的PDF合同,里面嵌着签字页和公章扫描件。后续如果对方抵赖说没签过字,需要把签字页单独提取出来作为证据提交。用本工具把嵌在PDF里的签字扫描件原样抽出,保留EXIF信息(拍摄时间、设备型号),为证据链增加可信度。

PPT 转 PDF 后再拆图

设计师把一套20页的PPT导出成PDF发给客户审阅,客户反馈说想改其中3页上的图标。但PPT源文件在公司电脑上,人出差在外,只有手机里的PDF。用本工具把PDF里的图标图片抽出来,直接在手机上用修图APP改颜色,改完再插回PDF,不用等回公司开电脑。

第二节

使用指南

Getting Started

使用步骤

  1. 1上传 PDF 文件(支持 50MB 以内),页面显示文件名称与页数,提取按钮变为可点击状态
  2. 2点击「提取图片」按钮,进度条从 0% 增至 100%,完成后图片列表自动展开
  3. 3在图片列表中勾选需要保存的图片(默认全选),点击「批量下载」打包为 ZIP 文件
  4. 4下载完成后浏览器弹出保存对话框,ZIP 内图片按原顺序命名(如 img_001.png)

输入输出示例

输入输出说明
一个包含3张JPEG图片和2段纯文本的PDF文件3张JPEG图片(image1.jpg, image2.jpg, image3.jpg)常规:混合内容PDF,验证工具能准确识别并提取嵌入图片,忽略非图片元素
一个仅包含1张高分辨率PNG图片的PDF文件1张PNG图片(image1.png)常规:单图片PDF,验证工具对PNG格式的识别与提取
一个包含0张图片的纯文字PDF文件未提取到任何图片边界:无图片PDF,验证工具对空结果的处理(不报错,返回明确提示)
一个包含100张以上图片的PDF文件(如产品图册)提取出所有图片(例如102张),按顺序编号为image1.jpg至image102.jpg边界:大量图片,验证工具批量处理能力与性能(不遗漏、不卡顿)
一个包含嵌入图片但图片尺寸极小(如16x16像素)的PDF文件提取出该小尺寸图片(如image1.jpg,尺寸16x16像素)边界:极小图片,验证工具对低分辨率图片的识别与提取
一个PDF中图片被旋转(如90度)或带有透明通道(如PNG)提取出图片,保留原始旋转角度和透明通道(例如image1.png,透明背景)易错:图片属性保留,验证工具是否保持图片原始元数据(旋转、透明度),而非默认还原
一个PDF中嵌入的图片文件名包含特殊字符(如中文、空格、emoji)提取出的图片文件名被自动重命名为通用格式(如image1.jpg),避免文件名冲突易错:文件名处理,验证工具对特殊字符的兼容性,防止导出失败

常见错误对照

1.误把「PDF 转图片」当「PDF 提取图片」

✗ 错误上传一个扫描件 PDF,期望提取出内嵌的 JPG 照片
✓ 修复先确认 PDF 是用 Word/PPT 导出、图片是以「对象」形式嵌入的,而非扫描后整页变成一张图

「提取图片」只剥离 PDF 内部存储的独立图像对象;扫描件 PDF 的每一页本身就是一张大图,没有独立对象可提取。

2.图片被裁剪或压缩后无法提取

✗ 错误在 PDF 里用编辑工具把图片裁掉一半、或添加了压缩滤镜,然后上传提取
✓ 修复提取前先用 PDF 阅读器(如 Adobe Reader)检查图片对象是否完整(右键图片 → 属性 → 查看原始尺寸)

PDF 标准允许对图像对象做裁剪区域(/TrimBox)或 JPEG2000 有损压缩,工具只能提取原始对象数据,无法还原被裁剪的部分。

3.混淆「图片」与「形状/矢量图」

✗ 错误上传一个含大量矢量图标(SVG 转 PDF)的文档,期望提取出 PNG/JPG 文件
✓ 修复矢量图形在 PDF 里被记录为路径(/Path)或表单(/Form),不是图像(/Image)对象,本工具不处理矢量数据

PDF 内部用不同关键字区分图像(/Image)和路径(/Path),本工具只扫描 /Image 字典,矢量图不在提取范围内。

4.忽略「嵌入式字体」也算图像

✗ 错误PDF 里有一页是纯文字,却期待提取出文字对应的图片
✓ 修复如果文字被转成轮廓(如某些打印驱动做的「文字转曲线」),它会被存储为图像对象,此时工具会提取出整页文字图片

部分 PDF 生成器(如某些虚拟打印机)会把文字渲染成位图再嵌入,这些位图也是 /Image 对象,会被工具一并提取。

5.误认为能提取「页面背景图」

✗ 错误上传一个带水印背景的 PDF,期望提取出水印图片
✓ 修复先检查水印是否以独立图像对象存在(在 PDF 阅读器里能否单独点击选中),若不能则无法提取

PDF 背景水印可能是页面属性(/BG)或透明度组(/Group),不是独立图像对象;工具只遍历页面内容流中的 /XObject 子类型为 /Image 的对象。

6.忽略「多页 PDF 中图片重复」

✗ 错误PDF 有 10 页,每页都嵌了同一张 Logo,提取后得到 10 个相同的 Logo 文件
✓ 修复提取后手动去重(比较文件 MD5 或视觉内容),或先确认 Logo 是否被 PDF 优化器共享(/XObject 引用同一对象 ID)

PDF 允许同一图像对象被多页引用(共享对象 ID),但部分 PDF 生成器会为每页创建独立副本,导致重复提取。

7.上传加密 PDF 后报错

✗ 错误直接上传有打开密码或权限密码的 PDF,工具提示「无法解析」
✓ 修复先用其他工具移除密码保护(如 qpdf --decrypt),再上传解密后的 PDF

PDF 加密会加密对象流(/Encrypt),工具后端 Go 解析器(如 gofpdf/unidoc)在无密码时无法读取 /XObject 字典。

8.误以为能提取「注释中的图片」

✗ 错误PDF 里用注释工具(如 Adobe 的图章/贴图)添加了一张图片,期望被提取
✓ 修复注释中的图片存储在注释字典的 /AP(外观流)里,不是页面内容流中的 /Image 对象,本工具不扫描注释

PDF 注释(/Annot)的图像放在外观字典(/AP)的 /N 子字典中,属于注释层,与页面内容流分离。

第三节

工作原理

How It Works

核心公式

图像数据 = 流偏移 + 流长度(从 PDF 交叉引用表定位)

变量说明

  • 流偏移PDF 对象中 stream 起始字节位置
  • 流长度stream 到 endstream 的字节数
  • 交叉引用表PDF 文件末尾的对象位置索引

示例

某 PDF 文件交叉引用表记录对象 5 的偏移为 1024 字节,流长度 8192 字节。工具读取偏移 1024 处 8192 字节的原始数据,解析为 JPEG 图像(文件头 FF D8 FF),输出 800×600 像素的图片。

上传 PDF解析 PDF 结构遍历对象流与交叉引用识别图像对象过滤非嵌入资源提取并打包校验图像完整性检查流结束标记过滤无效 / 损坏仅保留可解码图像
输入 / 过滤 解析与校验 输出结果
第五节

常见问题

Q & A
PDF 里图片很多,这个工具能一次全提取出来吗,还是得一张一张点?

一次性全部提取。上传 PDF 后工具会自动扫描文档内所有嵌入图片(包括页眉页脚里的装饰图),全部提取到结果列表里,不需要逐页翻找或手动截图。提取完成后按「打包下载」就能拿到所有图片的压缩包,也可以单独勾选某几张下载。如果是扫描件 PDF(每页本身就是一张大图),提取出的也是那一整页图片,不会自动切分成里面的小图。

提取出来的图片是什么格式?能不能直接要 JPG 不要 PNG?

默认输出格式是 PNG,因为无损、支持透明背景,适合后续编辑。目前工具不提供格式转换选项,如果需要 JPG,可以在下载后用图片处理软件批量转格式(Windows 画图、Mac 预览、或免费工具如 IrfanView 都能几秒完成)。注意:如果原 PDF 里的图片本身就是 JPEG 压缩的,提取出的 PNG 文件体积可能会比原图大一些。

为什么提取出来的图片比我在 PDF 里看到的模糊?

PDF 里的图片可能经过软件缩放或低分辨率压缩。提取工具拿到的实际上是 PDF 文件里嵌入的原始图片数据,如果原 PDF 作者插入了缩略图或低分辨率版本(比如为了减小文件体积),那提取出来的就是那个低清版本,而不是你在阅读器里看到的显示分辨率。可以先用 PDF 阅读器检查一下原图属性:如果单张图片尺寸很小(比如 300×200 像素),那大概率原图本身就不清晰。

加密 PDF 能提取图片吗?提示要密码怎么办?

不能。如果 PDF 设置了打开密码(用户密码),工具无法读取文件内容,上传后会提示「文件加密,请输入密码」。你需要先用其他软件(如 Adobe Acrobat、WPS)输入密码解除限制,保存为无密码版本后再上传。如果只是限制了打印/编辑(权限密码),但打开不需要密码,本工具可以正常提取图片。

PDF 有几百页,提取图片时会不会把整个文件上传到服务器?隐私安全吗?

文件会上传至服务器进行处理,处理完成后服务器会立即删除原始 PDF 和提取的图片(一般 30 分钟内自动清理)。如果文件包含敏感信息,建议在上传前自行脱敏或使用本地工具。本工具不保留任何用户文件副本,也不用于训练或分析。如果对上传有顾虑,可以先用免费 PDF 编辑器把敏感页删掉再提取。

提取出来的图片编号和 PDF 里的页码对不上,怎么回事?

图片编号是工具内部按提取顺序排列的,不是按 PDF 页码编号。比如第 1 页有 3 张图,第 2 页有 2 张图,那编号就是 1-5 依次排列,不会显示「第 1 页图 1」。如果你需要知道每张图来自哪一页,可以在提取后对照结果列表里的「所在页码」字段(如果有显示),或者在 PDF 阅读器里用矩形选框截图来手动标注。

PDF 里有些图是透明的(比如水印、Logo),提取出来背景变白色了?

这取决于原图是否真的包含透明通道。如果 PDF 里的图片本身是 PNG 带透明背景,提取后透明层会保留。但很多 PDF 里的水印或 Logo 实际是半透明矢量对象或混合模式渲染出来的,不是独立的透明 PNG 图片,提取时只能拿到底层像素化后的结果(背景可能是白色或文档底色)。这种情况下,可以用 Photoshop 或 GIMP 的「颜色选择」工具手动抠掉背景。

上传后提示「提取失败」或「文件格式不支持」,是什么原因?

最常见的原因是文件扩展名是 .pdf 但实际不是标准 PDF(比如是 .docx 改后缀的、或损坏的 PDF)。另外,超大文件(超过 200MB)或包含大量矢量图形的 PDF 也可能超时失败。可以先尝试用 Adobe Acrobat 或 Chrome 打开确认文件是否正常,或者用 PDF 压缩工具减小体积后再上传。如果文件是扫描件(图片式 PDF),提取成功率很高;如果是纯文本/表格 PDF,提取失败概率较低。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭