中文 PDF → Word · 免費 · 免註冊

中文 PDF 轉可編輯 Word:不再是空方框和亂碼

中文 PDF 出狀況的方式,是純英文檔案不會有的:字變成一格一格的空方框,變成一排問號, 或者整頁乾脆成了一張打不了字的圖。把你的檔案傳上來,拿回一份中文選得起來、 搜尋得到、可以重打、可以直接寄給同事的 Word。

繁體 · 簡體 掃描檔走 AI 模式 無需帳號 每天免費 10 頁 · 每月 100 頁

上傳 PDF Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。掃描檔按頁嵌入為圖片,PDF 本身帶有的文字仍可編輯。AI 模式把掃描檔轉寫成真正可編輯的文字——需要登入並新增付款方式,或在下方貼上你自己的 API key。無浮水印。

PDF
輸出格式 預設輸出 Word。Excel 試算表適合以表格為主的 PDF;Markdown 檔會打包成 .zip,裡面是 .md 和它的圖片。簡報版式的 PDF 會自動轉成 PowerPoint。 依頁數計費,選哪種格式價格都一樣。

選項 · AI / 基礎 · 自備 key
轉換模式 基礎模式免費、即時、無需帳號:掃描頁以圖片形式嵌入,不可編輯文字。AI 模式會把掃描頁辨識為可編輯文字——品質最佳;需要登入並綁定付款方式,或自備 API key。
進階——自備 AI 供應商

掃描檔由 AI 視覺模型辨識。自備你自己的供應商,即可按你選擇的品質轉換掃描檔,費用直接付給供應商。

品質

僅在使用你自己的 key 時生效。掃描檔始終使用 AI 視覺辨識。

僅用於本次轉換,絕不儲存、絕不記錄。

最後更新:2026-09-16

為什麼中文會變成空方框、豆腐字和亂碼

搜這個問題,搜到的往往不是產品頁,而是一串論壇貼文:Adobe 的使用者社群、Reddit 的 r/Acrobat、 chinesemac 郵件討論群、chinese-forums。譯者、研究生、在整理家裡舊資料的人——同一個問題被反覆 問了十年。原因之一是,「亂碼」這兩個字被拿來指三件毫無關聯的事,而它們在螢幕上長得一樣。

第一種:這份 PDF 裡本來就沒有讀得出來的中文。PDF 存的是字的形狀,外加一張把 形狀對回 Unicode 的表。很多中文 PDF 只嵌入這一頁真正用到的那部分字形,有些在產生的時候還漏掉了 那張對照表。畫面顯示完全正常,因為形狀都在;但一複製出來就是一串沒有意義的編碼,因為文字不在。 Big5 年代用舊排版系統做的檔,以及用使用者造字區(EUDC)造出來的字,最容易落在這一類——那些字 在標準字集裡根本沒有位置。這種情況下,任何依賴文字層的做法都救不了,只能把這一頁重讀一遍。

第二種:轉換器放棄了版面。遇到一頁它搭不出來的中文——雙欄的報告、帶格線的 表單、一張練習卷——常見的做法是把整頁當圖片貼進 Word,或者把字打散進幾十個互相疊著的文字方塊。 嚴格說那確實是個 .docx,但你幾乎改不動一個字:一動,整頁就跑版。

第三種:字是對的,字型沒了。這一種最讓人光火,因為檔案其實好好的。.docx 裡 存的不是字型,而是字型的名字,Word 會在打開它的那台電腦上去解析這個名字;解析不到就 替換,而中文被替換得不好時,畫出來就是那一格一格的空方框,也就是大家說的「豆腐字」。你寄出去的 檔案沒壞,壞的是顯示它的那台電腦。

動手之前先花三十秒判斷一下:在 PDF 裡選起一行中文,貼進一個純文字編輯器。貼出來是正常的字, 表示文字層沒問題,後面出的岔子不是在轉換器就是在字型;什麼都選不起來,表示這頁是掃描的; 選得起來但貼出來是亂碼,那就是第一種,同樣得按掃描頁來處理。

繁體、簡體,還有混在同一份裡的日文漢字

大多數中文辨識工具會先要你選字集:繁體一個入口、簡體另一個入口,而一份兩種都有的檔案該走哪邊, 它沒有答案。這其實是個很奇怪的要求——很多人手上有這份 PDF,恰恰是因為他還讀不全它。

這裡沒有這個選項。你上傳 PDF,要做的決定就到此為止。文字版 PDF 的字直接來自檔案自己的文字層, 原本是哪個碼位就還是哪個碼位,我們不替你做任何字形改寫:可能是一份台灣的合約,中間引了一條大陸的 標準;也可能是一份學術引註,裡面夾著日文漢字。掃描頁則交給 AI 視覺模型,像人一樣把整頁讀下來, 而不是套上一個你必須事先挑好的單一字集引擎。標點也是同樣的道理:全形逗號、頓號、《》書名號、 「」引號,出來還是它們本身,不會被換成半形的替身。

掃描檔:其他工具最容易投降的地方

掃描的中文文書是難的那一類,也正是這個轉換器圍繞著做的那一類。不是從 Word 乾淨匯出的檔案, 而是影印的練習卷、蓋了章的通知、帶格線要手填的表單、隨手在桌上拍的一頁。這套引擎的驗收語料 本身就是這些東西:中文練習卷、公文、帶格線的表單、多欄排版的報告。

結果這種事,看比說有用。下面這頁是帶四線三格的掃描中文練習卷——通常會被整頁壓成一張圖塞進 Word 的那種頁面——重建成了帶真實標題、真實格線列、能直接打字的檔案。

進去是一頁掃描的中文,出來是一份改得動的檔案。

Before — 含四線三格手寫格的掃描中文練習卷 掃描 PDF
After — editable Word, 含四線三格手寫格的掃描中文練習卷 可編輯 .docx
掃描的中文練習卷(含四線三格)→ 可編輯的 Word:真實的標題、真實的格線列、可以重打的文字。

這份練習卷只是一個例子;從掃描頁到可編輯檔案的完整路徑——單靠辨識做不到什麼、「可編輯」到底是 什麼意思——在掃描 PDF 轉 Word這頁裡講清楚了。

你拿到的是什麼

衡量一次轉檔好不好,不看它剛打開時像不像原件,而看你動它一下會怎樣。刪掉一段中文裡的一句話, 段落應該自己重排;改表格裡的一個數字,那一列應該穩住;插進一列,後面的內容應該往下推,而不是 整頁跑版。要做到這些,檔案必須由真正的 Word 物件組成,而不是「一張長得像 Word 的圖」:

這和首頁那套 PDF 轉可編輯 Word 用的是同一個引擎;單獨做這一頁, 是因為中文檔案把所有難點湊在了一起:繁簡混排、密集格線、掃描檔,還有誰都不一定裝了的字型。 預設輸出是 Word,同一次上傳也可以改成 Excel 試算表或 Markdown。

直式排版與它的表格

直排在程式眼裡特別容易散掉。直式標題在頁面上是一欄字,但在抽取的時候,每一個字各自成為一行, 於是一條七個字的標題變成七個各自獨立的小段落,還會和旁邊的橫排內容交錯在一起——文字一個都沒少, 順序卻全亂了,而這種壞法光看字數是看不出來的。

所以我們會特別去量這種「一個字一行」的直欄,把同一欄裡的字接回它原本的閱讀順序,再寫進 Word。 直排的表格是同一件事的另一個版本:一張直排的表常被誤讀成行與列顛倒的格子,於是每一格都變窄, 裡面的字被擠成一行一個;量到整塊確實是直排,就把軸轉回來,欄寬也按來源真正的比例分配。

要講明白的是,我們重建的是內容和它的結構,不是書寫方向本身——轉出來的是橫排的可編輯段落。 如果你要的是一份仍然直排的成品,那是在 Word 裡設定版面的事,而你至少已經有一份順序正確、 改得動的文字可以拿來設定。

關於 Word 裡的中文字型

這件事值得弄明白一次,因為「我這邊好好的,他那邊全是方框」基本上都由它引起。Word 檔案裡記的是 字型的名字,不是字型本身;在解析不到這個名字的電腦上打開,Word 就會挑一個替代品, 而中文被替換時,輕則正文從明體變成黑體、從襯線變成非襯線,重則整片變成空方框。

名字的講究比看上去多。標楷體、新細明體、微軟正黑體在台灣的 Windows 上很常見,換到 Mac 上就 不一定在;另外有一批舊式的登錄名(結尾帶 _GB2312 的那一類),在很多電腦上解不開,於是被換成 另一款字型,甚至畫成空方框——檔案其實是好的,壞掉的是顯示它的那台電腦。所以只要來源 PDF 裡 量得到它實際用的是哪一款字型,我們寫進 .docx 的就是那一款字型的現代規範名,而不是 PDF 產生器 當年嵌進去的內部拼法;我們也不會把字型檔嵌進 .docx 裡。這不是一句「所有檔案都不會再出方框」的 保證,只是把方框的一個可以避免的成因拿掉。

你這邊可以做兩件事。檔案要寄給你管不到的電腦時,把中文內文設成對方一定裝了的字型最穩妥; 因為內文是真正的 Word 樣式,這是改一次樣式的事,不是逐段刷一遍。反過來,如果是你自己看到一片 方框,先別當檔案壞了:選起那段字,看一眼字型方塊——如果 Word 顯示的是一款你沒裝的字型, 底下的字其實是完好的。

三步驟轉檔

  1. 上傳中文 PDF——繁體、簡體或兩者混排,文字版或掃描檔都行,單檔最多 2,000 頁。
  2. 系統逐頁判斷是文字還是掃描,掃描頁交給 AI 視覺模型辨識並重建版面。
  3. 下載 .docx,直接在 Word 裡改中文。

沒有跳轉、沒有彈出視窗、不用裝任何軟體,也不會把東西寄到你的電子信箱。版式判定為簡報的 PDF 會自動改走 PowerPoint。轉出來的成品大約六小時後自動刪除——轉合約或專利的時候,這一點值得知道。

還在比較幾種轉法的話,PDF 轉 Word 的四種方法那一頁把每一條路都列了出來。

想先看看這套引擎在一般檔案上的樣子,可以從PDF 轉 Word 那一頁開始,那裡講的是「重建」和「描圖」的差別,以及格式為什麼會跑版。

免費到什麼程度,頁數多了怎麼辦

Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。轉出來的檔案都沒有浮水印;頁數上限就寫在這裡, 不藏在下載按鈕後面。 大家日常貼進來的多半就是這一類——Word 或 WPS 匯出的檔案、論著、公告、合約。

掃描頁是另一回事,因為讀它每一頁都有真實成本,所以 AI 模式需要登入並綁定付款方式,與 Basic 共用同一份帳號額度,超出後依已購頁數計費。另外 有兩條都不用你掏錢的路:一是貼上你自己的 API key(Anthropic、OpenAI、Google Gemini, 或任何 OpenAI 相容的端點),按你自己供應商的成本把掃描頁轉個夠;二是讓這次改走免費的 Basic 模式,文字頁照樣可編輯,掃描頁則整頁以影像嵌入。依頁數計費的方案列在價目頁上, 目前尚未開放;現在真正在跑的就是 Basic 模式和你自己的 key。

資料來源

上文引用的廠商行為均出自各家官方說明,每個頁面均於 2026-09-16 核對。每家廠商只被引用來說明其自家軟體。

中文 PDF 轉 Word 常見問題

中文 PDF 轉成 Word 之後變成一格一格的空方框,是怎麼回事?

螢幕上長得一樣,底下其實是三件不同的事。一是這份 PDF 裡本來就沒有可以抽出來的中文——頁面畫得出字的形狀,卻沒有把形狀對回文字的那張表,複製出來當然是亂碼。二是轉換器放棄了版面,把整頁當成一張圖貼進去,或者把字打散進幾十個互相疊著的文字方塊,於是什麼都選不起來。三是字其實完全正確,只是檔案裡指名的那款字型,在打開它的那台電腦上沒有裝,Word 只好挑一款替代,中文被替換得不好時就畫成一格一格的空方框。三種的處理方式完全不同,所以先分清楚最省時間。

從 PDF 裡複製一段中文,貼出來是一串怪符號——這個檔壞了嗎?

檔沒壞,是它的文字層對不回文字。PDF 裡存的是字的形狀,外加一張把形狀對回 Unicode 的表;這張表可以缺、可以錯,尤其是 Big5 年代用舊排版系統做的檔,以及用使用者造字區(EUDC)造出來的字——那些字在標準字集裡根本沒有位置,複製出去自然對不上。遇到這種情況,任何從文字層抽字的做法都拿不回原文,只能把這一頁當成掃描頁重讀一遍。上傳時你不必自己判斷,逐頁的判定本來就會把讀不出字的頁面交給視覺模型。

轉出來的 Word 在 Windows 上和在 Mac 上長得不一樣,是轉壞了嗎?

多半沒壞。.docx 裡存的是字型的名字,不是字型本身,Word 會在打開它的那台電腦上去解析這個名字;解析不到就替換。標楷體、新細明體、微軟正黑體這幾款在台灣的 Windows 上很常見,換到 Mac 上就不一定在,於是同一份檔案兩邊的字重、字寬、行長都可能差一截。判斷方法:選起那段字,看一眼字型方塊——如果 Word 顯示的是一款你沒裝的字型,底下的字其實是好好的。

直式排版(直排)的 PDF 轉出來會變成什麼樣?

會變成橫排的可編輯段落,而且順序是對的。直排在程式眼裡很容易散掉:一個字一行,於是整條標題被拆成一個一個單字,還會和旁邊的橫排內容交錯在一起。我們會量出這種一字一行的直欄,把它接回原本的閱讀順序再寫進 Word;直排的表格也一樣,它常被誤讀成行列顛倒的格子,量到是直排就把軸轉回來。要說清楚的是,我們重建的是內容和它的結構,不是把直排的書寫方向原樣照抄。

檔案裡夾雜日文漢字,會不會被誤判成亂碼或方框?

不會,因為我們不是靠比對字集來決定要不要轉碼。文字版 PDF 的每個字都直接來自它原本的文字層,碼位是什麼就還是什麼,日文漢字、簡體字、全形標點都照原樣留著,不會被誤認成別的語系而被替換或吃掉。掃描頁同理:整頁交給視覺模型直接讀,而不是先套一個單一語系的辨識引擎再回頭挑錯字。所以一份合約裡夾一段日文條款、引一句簡體標準,出來的還是原本那些字,不會變成方框或亂碼。

轉出來的中文可以搜尋,也可以丟進翻譯工具嗎?

可以,而且這通常才是重點。重建出來的是真正的文字,不是文字的照片,所以可以用滑鼠選起來、可以全文搜尋、可以貼進別的地方。翻譯記憶庫和 CAT 工具要開始工作,前提就是這一條——它們吃的是可切分的段落,不是一張圖。我們不替你翻譯,只是把中文原文交到你用來翻譯的那個工具手上。

影印的、傳真的、用手機拍的繁體文書,能轉到什麼程度?

這幾種都算掃描頁:整頁其實是一張影像,裡面沒有文字可以抽。它們會被交給 AI 視覺模型整頁閱讀,把內容連同它周圍的結構一起讀出來,再重建成真正的 Word 物件——標題是標題樣式、表格有真正的欄和列、填寫線和格線是結構而不是畫上去的圖。蓋章、手寫簽名這類影像會留在它原本的位置上。掃描頁走 AI 模式,需要登入並綁定付款方式,或自備 API key;也可以讓這次改走 Basic 模式,掃描檔按頁嵌入為圖片。