投标文件连夜返工
周三下午 5 点接到通知,标书技术方案的第 3-7 页需要替换。原始 PDF 是扫描件,甲方要求最终版必须用 Word 格式提交。用本工具将扫描 PDF 转为可编辑 Word,直接替换段落、重排页码,不用从零排版。LibreOffice 后端处理,不限制页数,300 页的标书 2 分钟转完。
数字 PDF 提取文本层(快准)· 扫描件自动 OCR · 导出可编辑文本 / Word
Converted locally in your browser — nothing uploaded拿到合同扫描件想改条款,结果整页图、表格全散架。这个工具把 PDF 里的文字段落和表格结构保留下来,转成可编辑的 Word。文件经 LibreOffice 在后端处理,处理完即删,不存服务器。适合需要频繁修改会议纪要、标书初稿的人——转完直接调字号、改措辞,不用重排格式。
周三下午 5 点接到通知,标书技术方案的第 3-7 页需要替换。原始 PDF 是扫描件,甲方要求最终版必须用 Word 格式提交。用本工具将扫描 PDF 转为可编辑 Word,直接替换段落、重排页码,不用从零排版。LibreOffice 后端处理,不限制页数,300 页的标书 2 分钟转完。
知网查重报告返回,重复率 32%。报告是 PDF 格式,标红段落无法直接选中复制。把查重 PDF 转成 Word,红色标记文字保留为高亮底色,在 Word 里直接改写、替换同义词、调整句式。转后表格和脚注格式不乱,不用对照 PDF 逐句重敲。
法务发来 50 页的租赁合同 PDF,需要在每一条违约责任旁写修改意见。PDF 本身不可编辑,打印出来手写再扫描效率太低。转成 Word 后用修订模式逐条批注,红色删除线标出需删除的条款,批注框内写替代方案。转后字体、行距与原版一致,法务可直接在 Word 里接受/拒绝修订。
下午 4 点的项目会,速记员发来 PDF 版纪要,共 8 页。需要摘出其中 3 条待办事项发给成员。用本工具把 PDF 转成 Word,直接选中待办段落复制到邮件里,不用手打。转后保留原编号层级(一、1. (1)),成员能对应回原文上下文。
下学期要换新版教材,但习题答案 PDF 是上一版的,第 4 章新增了 15 道计算题。把旧版答案 PDF 转成 Word,删除已淘汰章节的答案,在新版空白处插入新题解答。转后公式以 MathType 对象形式保留,可直接双击编辑系数。
| 输入 | 输出 | 说明 |
|---|---|---|
| 一份包含标题、正文、表格、页眉页脚、编号列表的 10 页合同 PDF | 生成的 Word 文档保留标题(黑体加粗)、正文(宋体 12pt)、表格(合并单元格保留)、页眉页脚文字、编号列表缩进;表格内文字换行正常,页眉页脚位置与 PDF 一致。 | 常规:多元素混合文档,验证布局保留完整度。 |
| 一份纯文字、无图片、无表格、无特殊格式的 2 页说明 PDF | 生成的 Word 文档为纯文本段落,无分页符,字体为默认宋体 12pt,段落间距与 PDF 一致。 | 常规:最简单场景,验证基础文字提取与段落还原。 |
| 一份 200 页的扫描版 PDF(仅含图片,无文字层) | 生成的 Word 文档每页对应一张嵌入图片,无可编辑文字;图片按原 PDF 页面顺序排列,无 OCR 识别。 | 边界:扫描件无文字层,工具不会自动 OCR,输出为图片嵌入,用户需知此限制。 |
| 一份包含 50 个超链接的 PDF(链接指向外部网页) | 生成的 Word 文档中,超链接文字保留,链接可点击跳转(URL 与 PDF 一致)。 | 边界:大量超链接的保留与可点击性验证,部分工具会丢失链接。 |
| 一份 PDF 页面尺寸为 100mm × 50mm(非标准 A4) | 生成的 Word 文档页面尺寸设置为 100mm × 50mm,内容按比例缩放,无裁剪。 | 边界:非标准页面尺寸的保留,验证工具是否按实际尺寸输出。 |
| 一份包含中英文混排、特殊字符(如 ©、™、€、α、β)的 PDF | 生成的 Word 文档中文字符正常显示,特殊符号保留(©、™、€、α、β),无乱码或替换为问号。 | 易错:特殊字符编码兼容性,常见工具会丢失或乱码。 |
| 一份 PDF 内文字方向为竖排(如古籍排版) | 生成的 Word 文档文字方向变为横排,内容顺序正确但排版方向丢失。 | 易错:竖排文字工具不支持保留方向,用户需手动调整。 |
1.纯扫描件直接上传,输出全是乱码
上传一张手机拍的合同照片(JPG),期望得到可编辑 Word上传前先用 OCR 软件(如 Adobe Acrobat、ABBYY)将图片转为可搜索 PDF,再上传LibreOffice 转换依赖 PDF 内嵌文本层;纯图片 PDF 无文本层,转换后 Word 里只有空白或乱码字符。
2.加密 PDF 未解密直接上传,转换失败
上传一个带打开密码的 PDF,提示“文件损坏”先用其他工具移除 PDF 密码(如 qpdf --decrypt),或使用本工具前确保 PDF 无密码保护LibreOffice 无法处理加密 PDF,会直接报错或输出空白文件。
3.中文 PDF 未嵌字体,转出后文字错位
上传一个用思源黑体但未嵌入字体的 PDF,转 Word 后“全宝”变成“全??”在 PDF 源文件中勾选“嵌入所有字体”再导出,或使用本工具前确认字体已嵌入LibreOffice 依赖系统字体库;缺失字体时回退为默认字体,导致字形丢失或排版错乱。
4.表格 PDF 转 Word 后行列全乱
上传一份带复杂合并单元格的财务报表 PDF,期望 Word 里表格完整保留对复杂表格 PDF,建议先用 Adobe Acrobat 导出为 Excel,再粘贴到 WordLibreOffice 对表格结构还原精度有限,合并单元格、跨页表格常被拆散为独立文本框。
5.多页 PDF 只转第一页就以为完成
上传 50 页 PDF,下载 Word 后发现只有第 1 页内容检查转换日志或预览页数;若工具提示“仅转换第一页”,需重新上传完整 PDF 并确认选项部分在线工具或 LibreOffice 配置默认只处理第一页;本工具后端默认转换全部页面,但用户可能误选了范围。
6.PDF 内嵌超链接转 Word 后全部丢失
上传含目录超链接的 PDF,转 Word 后链接变纯文本对需要保留链接的文档,使用 PDF 编辑软件(如 Adobe Acrobat)直接编辑,而非转换格式LibreOffice 转换时丢弃 PDF 交互元素(超链接、书签),仅保留文本和布局。
7.PDF 文件过大(>100MB)导致超时失败
上传一个 500MB 的扫描版 PDF,等待 5 分钟后提示“转换超时”先压缩 PDF(如用 Ghostscript 降低分辨率),或拆分为多个小文件分批转换后端 Go 处理受服务器内存和超时限制,超大文件易触发 OOM 或超时中断。
PDF 转 Word 的核心是文档结构解析与格式映射,不涉及单一数学公式。
工具基于 LibreOffice 的文档对象模型(DOM)解析 PDF 中的文本块、段落、表格和图片,将其映射为 Word 的 OOXML 格式。例如,一个包含 3 段文字和 1 张图片的 PDF 页面,工具会提取每个文本块的坐标、字体和字号,重建为 Word 中的连续段落,图片则作为内嵌对象插入对应位置,最终输出 .docx 文件。
PDF 本身是一种固定版式(位置锁定)格式,而 Word 是流式排版(内容自适应宽度)。LibreOffice 在转换时会尽力保留位置,但如果原 PDF 里表格跨页、有绝对定位文本框、或大量使用非嵌入字体,转换后必然会出现偏移。建议转换前先确认原 PDF 是否为扫描件(图片型),如果是,需先 OCR 再转。另外,转出后可在 Word 里用「布局」→「选择窗格」手动调整浮动对象,而不是重排全文。
不需要。本工具采用纯浏览器端处理,PDF 文件直接在你电脑的浏览器里完成转换,不经过任何外部服务器。LibreOffice 虽然常被用于后端转换,但这里通过 WASM 技术编译成了浏览器可执行的版本,所以整个处理过程完全离线。关闭页面后文件自动清除,没有隐私泄露风险。
本工具仅支持 PDF 转 Word(.docx)。如果要转 Excel 或 PPT,需要找专门的 PDF 转表格或 PDF 转演示工具。不过很多 PDF 里的表格转到 Word 后,复制粘贴到 Excel 里也能保留基本行列结构,只是单元格合并和公式会丢失。如果原 PDF 本身就是由 Excel 导出的,推荐直接用 Excel 打开原文件更省事。
乱码或方框通常是字体缺失导致的。PDF 里如果嵌入了不常见的中文字体(如某些方正字库、手写体),而浏览器或系统中没有对应字体,LibreOffice 就会用默认字体替代,替代后字符编码对不上就会显示为方框。解决方法是:先在 PDF 里选中乱码文字,看看原字体名称,然后安装同名字体再重新转换。如果 PDF 是扫描件,那乱码其实是 OCR 识别错误,需要提高原图清晰度。
理论上没有页数或文件大小限制,因为处理完全在本地进行,取决于你电脑的内存和性能。实测在 8GB 内存的普通笔记本上,转 100 页、20MB 左右的 PDF 大约需要 30 秒到 1 分钟。超过 50MB 或 300 页的 PDF,浏览器可能会因内存占用过高而卡顿甚至崩溃,建议分批转换或先压缩 PDF 再转。
PDF 里嵌入的图片本身就有分辨率上限,LibreOffice 在提取时默认保持原图 DPI(通常 72-150),不会额外压缩。如果觉得模糊,先检查原 PDF 中图片是否清晰——很多网页生成的 PDF 图片本身只有 72 DPI。转换后在 Word 里可以右键图片→「设置图片格式」→「图片更正」里锐化一下,但无法增加原始像素。如果原 PDF 是高清扫描件(300 DPI 以上),转换后不会模糊。
LibreOffice 在处理页眉页脚时,会尝试将其识别为独立的节(section),但如果原 PDF 的页眉页脚是用普通文本行伪装出来的(比如某些 WPS 导出、网页打印生成的 PDF),而不是真正的页眉页脚结构,转换时就会被当作正文内容插入到页面顶部或底部。转换完成后,在 Word 里按 Ctrl+H 进入查找替换,用通配符批量删除页眉页脚中的重复文字(如页码、公司名),比逐页手动删除快得多。
可以,但体验不如电脑。因为转换依赖 WASM 在本地运行,手机浏览器(尤其是 Safari 和部分安卓 Chrome 版本)对 WASM 的内存限制较严,大文件容易闪退。建议在手机上转 20 页以内的简单 PDF(纯文字、无复杂排版)。如果手机转换失败,可以尝试切换到桌面版网站模式,或直接用电脑操作。另外,iPhone 自带的「文件」App 也有 PDF 转 Word 功能(需要 iOS 16+),效果类似。
PDF 中的超链接分为两种:一种是标准注释链接(可点击),另一种是普通文本伪装成链接(蓝色加下划线)。LibreOffice 只能识别第一种,并将其保留为 Word 中的可点击超链接。如果原 PDF 里的链接是第二种,转换后只会保留蓝色下划线的文字样式,不会自动生成超链接。转换完成后,在 Word 里选中该文字,按 Ctrl+K 手动添加链接即可。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。