文字方塊 · 表格 · 分欄 · 字型 —— 到底哪裡跑掉了,為什麼
PDF 轉 Word 跑版:六個症狀,逐項檢查
PDF 裡沒有「段落」這種東西。它記的是某個字形在某個座標,然後是下一個字形在下一個座標。 你講的版面——標題、分欄、表格的格子、首行那兩個字的縮排——全部得從幾何關係裡 重新推斷出來,再重新搭一次。這一步做成什麼樣,決定了你第一次動手改的時候, 整頁是撐得住還是垮掉。
上傳 PDF Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。掃描檔按頁嵌入為圖片,PDF 本身帶有的文字仍可編輯。AI 模式把掃描檔轉寫成真正可編輯的文字——需要登入並新增付款方式,或在下方貼上你自己的 API key。無浮水印。
轉換中…
預設不保留。不勾選時,你的 PDF 會依排程刪除;勾選後,我們僅保留它供工程師研究本次轉換。隨時可取消勾選。
選項 · AI / 基礎 · 自備 key
進階——自備 AI 供應商
掃描檔由 AI 視覺模型辨識。自備你自己的供應商,即可按你選擇的品質轉換掃描檔,費用直接付給供應商。
僅在使用你自己的 key 時生效。掃描檔始終使用 AI 視覺辨識。
僅用於本次轉換,絕不儲存、絕不記錄。
最後更新:2026-09-16
為什麼 PDF 轉 Word 這麼容易跑版
下面六個症狀的根是同一個。PDF 描述的是一張印好的紙:這個字形、這款字型、這個位置。 它不記錄「這六個字是一個標題」,也不記錄「這四條線加十二個短字串是一張表」。 微軟講得很乾脆:PDF 是一種固定版式。版面是座標,結構從來沒被寫下來。
所以每一個轉換器都得把結構倒推回去,差別就在這裡。要麼放棄推斷——整頁變成 一張影像,或者散成一堆按座標釘死的小方塊;要麼只推了一半:表格變成用定位點 對齊的幾行字,兩欄併成一欄,字型被換掉、字寬不同,於是每一行都在別的地方斷開。
還在決定要不要用線上轉檔?入口與費用在PDF 轉 Word那一頁; 這一頁只處理一件事——已經跑版了,是哪一段出的問題。四種轉法的比較在 PDF 轉 Word 的四種方法。
症狀一:段落變成一個一個文字方塊
這是被回報最多的一種。.docx 開起來跟原稿幾乎一樣,你點進一句話想改個錯字—— 游標卻落在一個帶著八個控制點的方框裡。
微軟對文字方塊的定義本身就是答案:它是你加進稿子裡、可以把文字放在檔案任何位置的 物件。「任何位置」就是全部的原因——它是個絕對定位的容器,記住一個座標和一個尺寸就守著不放; 而 Word 的段落是正文裡的流動內容,旁邊一動它就跟著動。
所以按列印座標把每塊文字各塞一個方塊,開啟那一瞬間分毫不差;在那之後這些方塊就當彼此 不存在:你在其中一個裡多敲一行,它會長過去壓住旁邊那個,而不是把它頂下去。
症狀二:換一個工具還是一堆文字方塊
這不是運氣不好。換個地方再轉一次,常常拿回形狀一樣的東西——這句話不是在講誰家的產品, 它講的是一種策略的性質。轉換器可以瞄準兩個目標:複刻這一頁的外觀, 或者把當初被印出來的那份稿子重建回來。追外觀的話,絕對定位的方塊最直接: 墨在哪裡放哪裡,不必判斷這團墨是什麼意思。重建則要求逐塊表態。
滿頁文字方塊就是「外觀優先」這條策略的簽名,解法也跟著變:不是讓同一類工具再跑一次, 而是換一個真的去回答結構問題的轉換器。至於讓 AI 助理代勞,那是另一套機制—— 語言模型寫的是文字,跟產生一份檔案是兩件事。
症狀三:怎樣才叫「沒有文字方塊」——四個十秒自檢
要拿到一份稿子而不是一堆擺設,得多走一步:轉換器先替頁面上每一塊定性——這是標題、 這是內文、這十二個短字串是一張表——再把每個結論寫成 Word 裡對應的構造:標題樣式、 表格物件、帶欄數的分節,而不是一個裝著字的方框。
有四個檢查能告訴你手上這份是哪一種,對任何轉出來的結果都成立,包括我們的:
- 在段落中間按一下 Enter。內文會把後面的內容整段往下推。如果什麼都沒動、 或者版面當場炸開、或者游標根本落不進文字裡,那你不是在方塊裡,就是在一張影像上面。
- 打開導覽窗格。它是靠標題樣式長出來的——和 Word 用稿子裡的標題自動 產生目錄是同一套機制。窗格空著,表示你的標題只是加粗的字,不是結構。
- 點一行字,看字型方塊。你要看到一個明確的字型名;方塊空白表示這個選取 範圍橫跨了好幾款字型——一頁按行切碎的方塊,從功能區看過去就長這樣。
- 把游標點進表格。微軟寫得很清楚:只有在你點進表格之後,表格的設計與 版面兩個索引標籤才會出現。沒有這兩個標籤,就沒有表格,只有文字和它旁邊的幾條線。
我們這邊:文字版 PDF 全程不經過模型,直接按頁面幾何重建;每一次轉檔在交給你之前還會 自動核對頁數、.docx 裡的文字與頁面上讀到的是否一致、樣式是不是真正可編輯的樣式。
效果對照
重建出來的稿子長什麼樣
症狀四:表格散掉,中文在儲存格裡亂斷行
表格是一頁上最貴的東西,因為 PDF 裡的表格常常根本不是表格:有時候是文字外面畫了幾個框, 有時候只是用定位點把文字對齊成幾欄。那張格子是讀者的眼睛拼出來的,檔案自己從沒宣告過。 所以轉換器要麼真的偵測出來——欄邊界、列邊界、合併儲存格——寫成一張真正的 Word 表格; 要麼照著外觀抄:定位字元分隔的文字加幾條線。只有前一種能讓你插一列。
這裡的表格偵測是流程上獨立的一個環節,結果會以表格物件寫出去。跨頁斷開的表格還要再過一道: 來源檔裡沒有任何地方寫著「此表接下頁」,所以只有在欄結構一致並且表頭重複或者出現 「續表」字樣佐證時,兩半才會被接起來。如果那張表才是你轉這份稿子的全部理由, PDF 表格轉 Excel 走的是試算表那條路。
症狀五、六:分欄併成一欄,字型被悄悄換掉
分欄與分節。Word 不是靠搬動文字來做雙欄的。它把稿子切成好幾節, 每一節帶著自己的欄數、邊界、頁首頁尾;微軟把「接續本頁」的分節符號描述成在同一頁上開始 新一節的那一種,用途正是不另起一頁地改變欄數。一個從不把欄邊界讀成節邊界的轉換器只剩 一個選擇:把文字鋪滿整個版心——雙欄論文併成一欄,句子在兩條思路之間來回跳。 我們的建構器把分欄那一段用一對接續分節符號夾住。
字型替換。這幾乎不算轉檔的問題。PDF 把字型程式本身內嵌進去;.docx 參照的 只是字型的名字。在一台解析不了這個名字的電腦上開啟,顯示端就悄悄換上一款看起來像的, 字元寬度一變,每行斷在哪裡全變。微軟給的解法是內嵌字型;我們做的比這窄:把字型名正規化成 規範名記錄下來——你的電腦上有沒有這一款,任何稿子都管不著,舊式登錄名依然可能被換掉。 繁體與中英混排裡這個風險更具體,中文 PDF 轉 Word那一頁專講。
中文排版另外那幾個坑
上面六條對任何語言都成立,下面這幾條是中文稿件獨有的。首行縮排兩個字本該是 段落屬性,卻常被匯出成兩個全形空白;把游標放到行首按方向鍵,走兩格才碰到第一個字的就是空白。 全形標點會原樣帶過去,但中西文之間那點空隙是排版引擎當場算出來的,換 Word 重排就可能差一點。
直排的題辭、獎狀、古籍,字元順序讀得對,但 Word 的直排是節一級屬性, 轉出來通常是橫排內文。頁首頁尾裡的公文格式——發文字號、版記、外側頁碼—— 靠每頁重複出現的元素推斷,遇到裝訂線兩側交替的頁碼會比內文保守。
如果這份 PDF 本來就是掃描檔
上面全部的前提是:有東西可以推斷。掃描頁裡只有像素,沒有文字層。所以判斷是逐頁做的: 一份稿子可以內文全是文字版,只有最後簽名那一頁是掃描的。沒有文字層的頁面交給視覺模型, 把文字連同結構一起讀出來,產出再進入與文字頁相同的建構流程,而不是被當成一張影像嵌進去。 這條路另有一頁:掃描 PDF 轉 Word。
我們實際做了什麼,邊界在哪裡
在這裡把 PDF 轉成可編輯的 Word:文字版全程不碰模型,直接按頁面幾何 重建成段落、表格物件和分節。這一條不花我們的錢,也沒有浮水印:Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。 掃描頁每讀一頁都有真實成本,AI 模式把掃描檔轉寫成真正可編輯的文字,需要登入並綁定付款方式,與 Basic 共用同一份帳號額度;超出後依已購頁數計費。也可以貼上你自己的 Anthropic、OpenAI、Gemini 或任何 OpenAI 相容端點的 API key,按自己的成本繼續轉。 依頁數計費的方案列在價格頁上,目前尚未開放。產物預設六小時後刪除。
我們沒有說的是:重建出來的稿子會和原頁面連斷行位置都一樣。真正的段落完全可能在某處斷行, 而固定版式的那一頁並沒有。站得住的主張比這窄得多——你要動的那些東西, 是 Word 知道該怎麼動的東西。拿你自己的稿子轉一頁,把那四個檢查跑一遍。
資料來源
上文中 Word 的行為都引自微軟官方說明,2026-09-14 逐條核對。
常見問題
版面怎麼撐住 — 常見問題
轉出來的 Word 我想逐項檢查,該從哪裡看起?
照順序跑四關就夠了。第一關,在正文中間按一下 Enter,後面的內容要整段往下推;第二關,打開導覽窗格,看得到標題階層才表示標題是樣式而不是加粗的字;第三關,點一行字看字型方塊,要看到一個明確的字型名;第四關,把游標點進表格,上方要出現表格的設計與版面兩個索引標籤。四關都過,這份檔才撐得住你接下來一整個下午的編輯。
把 PDF 的內容用複製貼上搬進 Word,版面為什麼整個散掉?
複製貼上搬走的是字元,不是結構。段落樣式、表格的欄列設定、分欄用的分節資訊都不在剪貼簿裡,所以貼出來就是一長串文字。中文尤其明顯,因為一整頁中文沒有空白可以讓 Word 推斷斷詞與斷行,原本的分段一掉就連成一片。要搬幾行字,貼完手動排一次就好;要搬整份稿子,走轉檔這條路——轉換器看的是整頁的幾何關係。
首行縮排兩個字,轉過來變成兩個全形空白,該怎麼處理?
先確認它原本是不是真的縮排。中文排版的首行縮排應該是段落的一個屬性,但不少 PDF 在匯出時直接把它壓成兩個全形空白,字元層面就只剩空白,轉換器再怎麼讀也讀不出「這是縮排」。判斷方法:把游標放到行首按方向鍵,走兩格才碰到第一個字的就是空白。確認是空白之後,用尋找取代清掉行首空白,再統一設一次段落縮排。
公文的頁首頁尾和頁碼跑掉了,是哪一段出了問題?
頁首頁尾在 .docx 裡是節的屬性,不是正文的一部分,所以它必須先被認出來才談得上重建。做法是看整份稿子裡哪些元素在每一頁重複出現,把它們從正文裡剝出來放進頁首頁尾。遇到裝訂線兩側交替的外側頁碼,這個推斷會比正文保守——寧可少認一個,也不要把一行正文誤剝成頁碼。真的沒接上的話,在 Word 的頁首頁尾編輯裡補一次,之後整份稿子都會跟著走。
同一份檔在我電腦上好好的,寄給同事就跑版,是檔壞了嗎?
檔多半是好的,壞掉的是顯示它的那一台電腦。.docx 存的是字型的名字,不是字型本身,Word 會在開啟它的那台機器上去解析這個名字。標楷體、舊式登錄名結尾帶 _GB2312 的那一批,在很多機器上解不開,於是被換成另一款字。字寬一換,每一行斷在哪裡就全變了,看起來就像整份稿子跑版。對方裝了同一款字型,版面就會回來。
我是用 Word 另存 PDF 的時候跑版,這一頁幫得上忙嗎?
幫不上,因為那是反方向的問題。這一頁和這個轉檔工具處理的是「PDF 進來、Word 出去」;你問的是「Word 出去、PDF 產生」。兩件事在機制上幾乎沒有重疊——匯出端的版面由 Word 自己和你本機裝了哪些字型決定。要找答案,去 Word 的另存新檔/匯出成 PDF 那一組選項裡看,尤其是字型內嵌那一項。