投标文件附图还原
建筑公司投标专员收到甲方发来的PDF版施工图纸,里面嵌着几十张JPG节点大样图,但甲方要求投标文件里必须提交高清原图。直接截图会损失分辨率,用PS一张张抠又太慢。把PDF丢进工具,1分钟内批量抽出所有嵌入图片,分辨率与原图一致,直接拖进投标书排版,不用二次压缩或裁剪。
提取 PDF 中真正嵌入的位图(照片 / 插图 / 扫描页)· 非整页截图
Extracted locally — nothing uploaded该文件可能是纯文字 / 纯矢量(文字、表格、线条用矢量绘制,不含嵌入照片或扫描图)。
本工具提取的是 PDF 内真正存储的位图资源;若你想把每一页渲染成图片,请使用「PDF 转图片」工具。
一份设计稿的PDF里嵌了十几张高清图,用截图工具一张张抠,分辨率不对、文件名还得手动改。这个工具直接把PDF里的嵌入图片批量提取出来,保留原始像素和格式。上传后后端处理,文件会在一小时内自动删除,不存服务器。
建筑公司投标专员收到甲方发来的PDF版施工图纸,里面嵌着几十张JPG节点大样图,但甲方要求投标文件里必须提交高清原图。直接截图会损失分辨率,用PS一张张抠又太慢。把PDF丢进工具,1分钟内批量抽出所有嵌入图片,分辨率与原图一致,直接拖进投标书排版,不用二次压缩或裁剪。
研究生下载了一篇40页的顶会论文PDF,里面嵌了15张实验对比图和折线图,但PDF阅读器只能整页截图,截出来的图带白边和页码。需要把这些图单独存成文件,贴进自己的综述里当参考文献图。用本工具一次性抽取出所有图片,按原文件名编号,省去手动截图、裁剪、重命名的半小时重复劳动。
运营从供应商拿到一份产品PDF手册,里面嵌着产品主图、细节图、尺寸图共23张,但供应商只给了PDF,没给源文件。要上架到淘宝详情页,必须把每张图单独存成PNG。用本工具一键提取所有图片,按顺序命名,直接拖进详情页编辑器,不用再找供应商要源文件。
法务收到一份对方发来的PDF合同,里面嵌着签字页和公章扫描件。后续如果对方抵赖说没签过字,需要把签字页单独提取出来作为证据提交。用本工具把嵌在PDF里的签字扫描件原样抽出,保留EXIF信息(拍摄时间、设备型号),为证据链增加可信度。
设计师把一套20页的PPT导出成PDF发给客户审阅,客户反馈说想改其中3页上的图标。但PPT源文件在公司电脑上,人出差在外,只有手机里的PDF。用本工具把PDF里的图标图片抽出来,直接在手机上用修图APP改颜色,改完再插回PDF,不用等回公司开电脑。
| 输入 | 输出 | 说明 |
|---|---|---|
| 一个包含3张JPEG图片和2段纯文本的PDF文件 | 3张JPEG图片(image1.jpg, image2.jpg, image3.jpg) | 常规:混合内容PDF,验证工具能准确识别并提取嵌入图片,忽略非图片元素 |
| 一个仅包含1张高分辨率PNG图片的PDF文件 | 1张PNG图片(image1.png) | 常规:单图片PDF,验证工具对PNG格式的识别与提取 |
| 一个包含0张图片的纯文字PDF文件 | 未提取到任何图片 | 边界:无图片PDF,验证工具对空结果的处理(不报错,返回明确提示) |
| 一个包含100张以上图片的PDF文件(如产品图册) | 提取出所有图片(例如102张),按顺序编号为image1.jpg至image102.jpg | 边界:大量图片,验证工具批量处理能力与性能(不遗漏、不卡顿) |
| 一个包含嵌入图片但图片尺寸极小(如16x16像素)的PDF文件 | 提取出该小尺寸图片(如image1.jpg,尺寸16x16像素) | 边界:极小图片,验证工具对低分辨率图片的识别与提取 |
| 一个PDF中图片被旋转(如90度)或带有透明通道(如PNG) | 提取出图片,保留原始旋转角度和透明通道(例如image1.png,透明背景) | 易错:图片属性保留,验证工具是否保持图片原始元数据(旋转、透明度),而非默认还原 |
| 一个PDF中嵌入的图片文件名包含特殊字符(如中文、空格、emoji) | 提取出的图片文件名被自动重命名为通用格式(如image1.jpg),避免文件名冲突 | 易错:文件名处理,验证工具对特殊字符的兼容性,防止导出失败 |
1.误把「PDF 转图片」当「PDF 提取图片」
上传一个扫描件 PDF,期望提取出内嵌的 JPG 照片先确认 PDF 是用 Word/PPT 导出、图片是以「对象」形式嵌入的,而非扫描后整页变成一张图「提取图片」只剥离 PDF 内部存储的独立图像对象;扫描件 PDF 的每一页本身就是一张大图,没有独立对象可提取。
2.图片被裁剪或压缩后无法提取
在 PDF 里用编辑工具把图片裁掉一半、或添加了压缩滤镜,然后上传提取提取前先用 PDF 阅读器(如 Adobe Reader)检查图片对象是否完整(右键图片 → 属性 → 查看原始尺寸)PDF 标准允许对图像对象做裁剪区域(/TrimBox)或 JPEG2000 有损压缩,工具只能提取原始对象数据,无法还原被裁剪的部分。
3.混淆「图片」与「形状/矢量图」
上传一个含大量矢量图标(SVG 转 PDF)的文档,期望提取出 PNG/JPG 文件矢量图形在 PDF 里被记录为路径(/Path)或表单(/Form),不是图像(/Image)对象,本工具不处理矢量数据PDF 内部用不同关键字区分图像(/Image)和路径(/Path),本工具只扫描 /Image 字典,矢量图不在提取范围内。
4.忽略「嵌入式字体」也算图像
PDF 里有一页是纯文字,却期待提取出文字对应的图片如果文字被转成轮廓(如某些打印驱动做的「文字转曲线」),它会被存储为图像对象,此时工具会提取出整页文字图片部分 PDF 生成器(如某些虚拟打印机)会把文字渲染成位图再嵌入,这些位图也是 /Image 对象,会被工具一并提取。
5.误认为能提取「页面背景图」
上传一个带水印背景的 PDF,期望提取出水印图片先检查水印是否以独立图像对象存在(在 PDF 阅读器里能否单独点击选中),若不能则无法提取PDF 背景水印可能是页面属性(/BG)或透明度组(/Group),不是独立图像对象;工具只遍历页面内容流中的 /XObject 子类型为 /Image 的对象。
6.忽略「多页 PDF 中图片重复」
PDF 有 10 页,每页都嵌了同一张 Logo,提取后得到 10 个相同的 Logo 文件提取后手动去重(比较文件 MD5 或视觉内容),或先确认 Logo 是否被 PDF 优化器共享(/XObject 引用同一对象 ID)PDF 允许同一图像对象被多页引用(共享对象 ID),但部分 PDF 生成器会为每页创建独立副本,导致重复提取。
7.上传加密 PDF 后报错
直接上传有打开密码或权限密码的 PDF,工具提示「无法解析」先用其他工具移除密码保护(如 qpdf --decrypt),再上传解密后的 PDFPDF 加密会加密对象流(/Encrypt),工具后端 Go 解析器(如 gofpdf/unidoc)在无密码时无法读取 /XObject 字典。
8.误以为能提取「注释中的图片」
PDF 里用注释工具(如 Adobe 的图章/贴图)添加了一张图片,期望被提取注释中的图片存储在注释字典的 /AP(外观流)里,不是页面内容流中的 /Image 对象,本工具不扫描注释PDF 注释(/Annot)的图像放在外观字典(/AP)的 /N 子字典中,属于注释层,与页面内容流分离。
图像数据 = 流偏移 + 流长度(从 PDF 交叉引用表定位)
流偏移PDF 对象中 stream 起始字节位置流长度stream 到 endstream 的字节数交叉引用表PDF 文件末尾的对象位置索引某 PDF 文件交叉引用表记录对象 5 的偏移为 1024 字节,流长度 8192 字节。工具读取偏移 1024 处 8192 字节的原始数据,解析为 JPEG 图像(文件头 FF D8 FF),输出 800×600 像素的图片。
一次性全部提取。上传 PDF 后工具会自动扫描文档内所有嵌入图片(包括页眉页脚里的装饰图),全部提取到结果列表里,不需要逐页翻找或手动截图。提取完成后按「打包下载」就能拿到所有图片的压缩包,也可以单独勾选某几张下载。如果是扫描件 PDF(每页本身就是一张大图),提取出的也是那一整页图片,不会自动切分成里面的小图。
默认输出格式是 PNG,因为无损、支持透明背景,适合后续编辑。目前工具不提供格式转换选项,如果需要 JPG,可以在下载后用图片处理软件批量转格式(Windows 画图、Mac 预览、或免费工具如 IrfanView 都能几秒完成)。注意:如果原 PDF 里的图片本身就是 JPEG 压缩的,提取出的 PNG 文件体积可能会比原图大一些。
PDF 里的图片可能经过软件缩放或低分辨率压缩。提取工具拿到的实际上是 PDF 文件里嵌入的原始图片数据,如果原 PDF 作者插入了缩略图或低分辨率版本(比如为了减小文件体积),那提取出来的就是那个低清版本,而不是你在阅读器里看到的显示分辨率。可以先用 PDF 阅读器检查一下原图属性:如果单张图片尺寸很小(比如 300×200 像素),那大概率原图本身就不清晰。
不能。如果 PDF 设置了打开密码(用户密码),工具无法读取文件内容,上传后会提示「文件加密,请输入密码」。你需要先用其他软件(如 Adobe Acrobat、WPS)输入密码解除限制,保存为无密码版本后再上传。如果只是限制了打印/编辑(权限密码),但打开不需要密码,本工具可以正常提取图片。
文件会上传至服务器进行处理,处理完成后服务器会立即删除原始 PDF 和提取的图片(一般 30 分钟内自动清理)。如果文件包含敏感信息,建议在上传前自行脱敏或使用本地工具。本工具不保留任何用户文件副本,也不用于训练或分析。如果对上传有顾虑,可以先用免费 PDF 编辑器把敏感页删掉再提取。
图片编号是工具内部按提取顺序排列的,不是按 PDF 页码编号。比如第 1 页有 3 张图,第 2 页有 2 张图,那编号就是 1-5 依次排列,不会显示「第 1 页图 1」。如果你需要知道每张图来自哪一页,可以在提取后对照结果列表里的「所在页码」字段(如果有显示),或者在 PDF 阅读器里用矩形选框截图来手动标注。
这取决于原图是否真的包含透明通道。如果 PDF 里的图片本身是 PNG 带透明背景,提取后透明层会保留。但很多 PDF 里的水印或 Logo 实际是半透明矢量对象或混合模式渲染出来的,不是独立的透明 PNG 图片,提取时只能拿到底层像素化后的结果(背景可能是白色或文档底色)。这种情况下,可以用 Photoshop 或 GIMP 的「颜色选择」工具手动抠掉背景。
最常见的原因是文件扩展名是 .pdf 但实际不是标准 PDF(比如是 .docx 改后缀的、或损坏的 PDF)。另外,超大文件(超过 200MB)或包含大量矢量图形的 PDF 也可能超时失败。可以先尝试用 Adobe Acrobat 或 Chrome 打开确认文件是否正常,或者用 PDF 压缩工具减小体积后再上传。如果文件是扫描件(图片式 PDF),提取成功率很高;如果是纯文本/表格 PDF,提取失败概率较低。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。