文本框 · 表格 · 分栏 · 字体 —— 到底哪里乱了,为什么
PDF 转 Word 格式乱了:六个症状,逐条排查
PDF 里没有「段落」这个东西。它记的是某个字形在某个坐标,然后是下一个字形在下一个坐标。 你说的格式——标题、分栏、表格的格子、首行那两个字的缩进——全都要从几何关系里 重新推断出来,再重新搭一遍。这一步做成什么样,决定了你第一次动手改的时候, 整页是稳住还是垮掉。
上传 PDF Basic 模式免费、无需账号:每天 10 页、每月 100 页;登录后每天 100 页、每月 1000 页。扫描件按页嵌入为图片,PDF 本身带有的文字仍可编辑。AI 模式把扫描件转写成真正可编辑的文字——需要登录并添加支付方式,或在下方粘贴你自己的 API key。无水印。
转换中…
默认不保留。不勾选时,你的 PDF 会按期删除;勾选后,我们仅保留它供工程师研究本次转换。随时可取消勾选。
选项 · AI / 基础 · 自带 key
高级——自带 AI 服务商
扫描件由 AI 视觉模型识别。自带你自己的服务商,即可按你选择的质量转换扫描件,费用直接付给服务商。
仅在使用你自己的 key 时生效。扫描件始终使用 AI 视觉识别。
仅用于本次转换,绝不保存、绝不记录。
最后更新:2026-09-16
为什么「PDF 转 Word」这么容易转乱
下面六个症状根子是同一个。PDF 描述的是一张印好的纸:这个字形、这款字体、这个位置。 它不记录「这六个字是个标题」,也不记录「这四根线和十二个短串是一张表」。微软自己在 说明里把这件事讲得很干脆:PDF 是一种固定版式。版面是坐标,结构从来没被写下来。
所以每个转换器都得把结构倒推回去,分歧就在这里。要么放弃推断——整页变成 一张图,或者散成一堆按坐标钉死的小框;要么只推了一半:表格变成用制表位 对齐的几行字,两栏并成一栏,字体被换掉、字宽不同,于是每一行都在别处断开。
还在比较用哪条路转?四种转法的对比在另一页。
症状一:段落变成了一个个文本框
这是被报告得最多的一种。.docx 打开看着跟原件一模一样,你点进一句话想改个错别字—— 光标却落在一个带八个控制点的矩形里。
微软对文本框的定义就是答案:它是你添加到文档里、可以把文字放在文件任意位置的对象。 「任意位置」就是全部原因——它是个绝对定位的容器,记住一个坐标和一个尺寸就死守不放; Word 的段落则是正文里的流式内容,邻居一动它就跟着动。
所以按打印坐标把每块文字各塞一个框,开门那一瞬间分毫不差;之后这些框就当彼此不存在: 你在其中一个里多敲一行,它会长过去压住旁边那个,而不是把它顶下去。
症状二:换个工具还是一堆文本框
这不是你运气不好。换个地方再转一次,常常拿回形状一样的文件——这不是在说谁家的产品, 而是一种策略的性质。转换器可以瞄准两个目标:复刻这一页的外观,或者把当初被印出来的 那份文档重建回来。追外观的话,绝对定位的框最直接:墨在哪儿放哪儿, 不必判断这团墨是什么。重建则要求逐块表态。
满页文本框就是「外观优先」这条策略的签名,解法也跟着变:不是让同一类工具再输出一遍, 而是换一个真的去回答结构问题的转换器。至于让 AI 助手代劳,那是另一套机制—— 语言模型写的是文字,跟生成一份文档文件是两件事。
症状三:怎样才叫「没有文本框」——四个十秒自检
拿到一份文档而不是一堆摆件,要多走一步:转换器先给页面上每一块定性——这是标题、这是正文、 这十二个短串是一张表——再把每个结论写成 Word 里对应的构造:标题样式、表格对象、 带栏数的分节,而不是一个装着字的矩形。
有四个检查能告诉你手上这份是哪一种,对任何转换结果都成立,包括我们的:
- 在段落中间按一下回车。正文会把后面的内容整体往下推。如果什么都没动、 或者版面当场炸开、或者光标根本落不进文字里,那你不是在框里,就是在一张图上面。
- 打开导航窗格。它是靠标题样式填出来的——和 Word 用文档里的标题自动 生成目录是同一套机制。窗格空着,说明你的标题只是加粗的文字,不是结构。
- 点一行字,看字体框。你要看到一个具体的字体名;框里空白说明这一选区 横跨了好几款字体——一页按行切碎的框,从功能区看过去就长这样。
- 把光标点进表格。微软写明:只有当你点进表格里,「表设计」和「布局」 两个选项卡才会出现。没有这两个选项卡,就没有表格,只有文字和它旁边的几根线。
我们这边:文字版 PDF 全程不经过模型,直接按页面几何重建;每次转换交付前还会自动核对 页数、.docx 里的文字与页面上读到的是否一致、样式是不是真正可编辑的样式。
效果对比
重建出来的文档长什么样
症状四:表格散架,中文在格子里乱换行
表格是一页上最贵的东西,因为 PDF 里的表格往往根本不是表格:有时是文字外面画了几个矩形, 有时只是用制表位把文字对齐成几列。那张网格是读者的眼睛拼出来的,文件自己从没声明过。 所以转换器要么真检测出来——列边界、行边界、合并单元格——写成一张真正的 Word 表格; 要么照着外观抄:制表符分隔的文字加几根线。打印出来差不多,但只有前一种能让你插一行。
这里表格检测是流水线上单独的一个环节,结果按表格对象写出去。跨页断开的表格还要再过一道: 源文件里没有任何地方写着「此表接下页」,所以只有当列结构一致并且表头重复或出现 「续表」字样佐证时,两半才会被接起来。如果那张表才是你转这份文件的全部理由, PDF 表格转 Excel 走的是电子表格那条路。
症状五、六:分栏并成一栏,字体被悄悄换掉
分栏与分节。Word 不是靠挪动文字来做双栏的。它把文档切成若干节, 每节带着自己的栏数、页边距、页眉页脚;微软把「连续」分节符描述成在同一页上开始新一节的 那种,用途正是不另起一页地改变栏数。一个从不把栏边界读成节边界的转换器只剩一个选择: 把文字铺满整个版心——双栏论文并成一栏,句子在两条思路之间来回跳。我们的构建器把分栏的 那一段用一对连续分节符夹住。
字体替换。这几乎不算转换的问题。PDF 把字体程序本身嵌进去;.docx 引用的 只是字体的名字。在一台解析不了这个名字的机器上打开,渲染端就悄悄换上一款看着像的, 字符宽度一变,每行断在哪里全变。微软给的办法是嵌入字体;我们做的比这窄:把字体名归一化成 规范名记录下来——你的机器上有没有这一款,任何文档都管不着,旧式登记名依然可能被替换。 中文里这个风险更具体,中文 PDF 转 Word那一页专讲。
中文排版另外那几个坑
上面六条对任何语言都成立,下面几条是中文文稿独有的。首行缩进两字符本该是 段落属性,却常被导出成两个全角空格;把光标放到行首按方向键,走两格才碰到第一个字的就是空格。 全角标点会原样带过去,但中西文之间那点空隙是排版引擎当场算的,换 Word 重排就可能差一点。
竖排的题词、奖状、古籍,字符顺序能读对,但 Word 的竖排是节一级属性, 转出来通常是横排正文。页眉页脚里的公文格式——红头、版记、外侧页码—— 靠页面重复元素推断,遇上装订线两侧交替的页码会比正文保守。
如果这份 PDF 本来就是扫描件
上面全部的前提是:有东西可供推断。扫描页里只有像素,没有文字层。所以判断是逐页做的: 一份文件可以正文全是文字版,只有最后签字那页是扫描的。没有文字层的页面交给视觉模型, 把文字连同结构一起读出来,产出再进入与文字页相同的构建流程,而不是被当成一张图片嵌进去。 这条路另有一页:扫描件 PDF 转 Word。
我们实际做了什么,以及边界在哪
在这里把 PDF 转成可编辑的 Word:文字版全程不碰模型,直接按页面几何 重建成段落、表格对象和分节。这一条不花我们的钱,没有水印。Basic 模式免费、无需账号:每天 10 页、每月 100 页;登录后每天 100 页、每月 1000 页。 扫描页每读一页都有真实成本:AI 模式把扫描件转写成真正可编辑的文字,需要登录并绑定付款方式,与 Basic 共用同一份账号额度;超出后按已购页数计费。也可以粘贴你自己的 Anthropic、OpenAI、Gemini 或任意 OpenAI 兼容端点的 API key,按自己的成本继续转——自带 API key 的转换完全不计入额度。 按页购买的套餐列在价格页上,目前还没开放。产物默认六小时后删除。
我们没有说的是:重建出来的文档会和原页面连断行位置都一样。真正的段落完全可能在某处断行, 而固定版式的那一页并没有。能站住的主张比这窄得多——你要动的那些东西, 是 Word 知道该怎么动的东西。拿你自己的文件转一页,把那四个检查跑一遍。
资料来源
上文中 Word 的行为均引自微软官方说明,2026-09-14 逐条核对。
常见问题
格式怎么保住 — 常见问题
从 PDF 里复制粘贴到 Word,为什么中文段落全挤成一坨?
复制粘贴搬走的是字符,不是结构。段落样式、表格的行列设定、分栏的分节信息都不在剪贴板里,所以粘出来就是一长条文字;中文更明显,因为一页中文没有空格可以让 Word 猜断词断行,原来的分段一丢就彻底连成一片。要几行字,粘完手动排一下就好;要整份稿子,走转换这条路,转换器看的是整页的几何结构,会判断哪里是标题、哪里是表格行、哪里是第二栏。
首行缩进两个字,转出来变成了两个空格,能改回来吗?
能,但要先知道它为什么会这样。中文排版里的首行缩进是段落的一个属性;有些 PDF 生成器在导出时把它直接写成了两个全角空格,字符层面就只剩空格,转换器再怎么读也读不出「这是缩进」。分辨方法:在 Word 里打开段落设置看「首行缩进」有没有值,或者把光标放在行首按一下方向键,走两格才到第一个字的就是空格。真是空格的话,用查找替换清掉行首空格,再统一设一次段落缩进。
转换之前,怎么判断这份 PDF 大概率会转乱?
花十秒看三件事。一,用鼠标横着拖选一行字:选不中、整页被一个框罩住,说明这是扫描件,没有文字层可抽。二,看有没有分栏、脚注、跨页的长表格——这三样是最考验结构判断的地方。三,看正文用的是不是带 _GB2312 之类旧登记名的字体。三样都没有的普通单栏文稿,基本上是最省心的一类;占了两样以上的,建议先只转一页看看再决定。
全角标点和中英混排的间距,转过去还保得住吗?
全角逗号、顿号、书名号、引号都是实打实的字符,从文字版 PDF 的文本层直接带过来,不会被换成半形的相似符号。中英混排的间距是另一回事:那不是字符,是排版引擎按字体度量当场算出来的。同一段文字在 Word 里由 Word 自己重新排一遍,中西文之间的空隙就可能和 PDF 里差一点。字在、标点在、顺序在,但逐字符的间距对不上原件,这是重建和「照着描」的必然差别。
表格转过来了,可格子里的中文换行位置不对,是表格没转对吗?
多半不是。先确认它是不是真表格:把光标点进格子,Word 顶上出现「表设计」「布局」两个选项卡,才说明这是表格对象。是表格对象的话,换行位置由列宽和字体度量决定,Word 用自己的规则重新断一次行,和原件差一两个字很正常;调一下列宽就归位。如果点进去没有那两个选项卡,那就不是表格,只是用制表位对齐的文字加几根线,这时候要解决的是结构问题,不是换行问题。
Word 另存成 PDF 的时候格式变了,这一页帮得上忙吗?
帮不上,因为那是反方向的问题。这一页和这个转换器处理的是「PDF 进来、Word 出去」;你问的是「Word 出去、PDF 生成」,两件事在机制上几乎没有重叠——导出端的排版由 Word 自己和你本机装的字体决定。真要找答案,去 Word 的另存为 / 导出 PDF 那组选项里找,尤其是字体嵌入那一项,它是导出端最常见的原因。