把 PDF 財報丟給 ChatGPT,結果出來的表格數字全糊在一起、欄位大錯亂?這並非 AI 判讀失敗,而是 PDF 格式本身只記錄文字印在哪個座標,缺乏儲存表格結構的資訊。

想讓 AI 準確讀懂報表,最好的作法是先將 PDF 轉換為帶有結構標籤的 Markdown 格式。本文精選 3 款實用的免費工具,包括無需安裝的網頁版,到掃描圖檔的進階工具,以及安裝步驟流程,帶你挑選合適的轉檔方案!

一、轉檔前置作業:文字型、掃描型…先搞懂你的 PDF 是哪一種?

三、工具一〉pdf-inspector:適用於純文字 PDF 的轉換工具

五、工具二〉MarkItDown:支援 Office 格式的微軟開源方案

六、工具三〉Docling:支援版面分析與 OCR 的 IBM 開源工具

選擇轉檔工具的首要條件,在於確認 PDF 是否具備「可選取之文字層」。建議使用瀏覽器或專業 PDF 軟體開啟檔案,並透過滑鼠在表格區域進行反白測試:

文字型: 文字可順利反白,代表檔案具備原生文字層。

掃描型: 僅出現藍色選取方框,文字無法單獨標記,代表該頁面為掃描圖檔。

需要注意的是,台灣許多上市公司的財報屬於「混合型」文件,前面的文字說明具備文字層,但經會計師簽章的四大報表往往為掃描影像。若未逐頁確認,轉換後的關鍵數據區塊將呈現空白。

此外,目前市場上並無「免安裝且能處理掃描件」的免費工具。具備 Web 端直接執行能力的工具通常不支援 OCR(光學文字辨識);而內建 OCR 模組的工具,皆需於本機環境部署。若文件為掃描型,可直接參閱第六段的 Docling 解決方案。

以下三款工具皆採用寬鬆的 MIT 授權條款,適合企業內部評估與商業導入,建議依據檔案屬性搭配運用。

第一步可將 PDF 匯入 pdf-inspector 網頁版,系統將自動判定檔案屬性。若為文字型,轉檔即可直接完成;若判定為掃描型或混合型,則啟動 Docling 進行深度 OCR 解析;若原始檔案為 Office 格式(Word / Excel),則交由 MarkItDown 處理以獲取最佳結構還原度。

由 Firecrawl 團隊開源的 Rust 解析工具,其主體為提供開發者安裝的開源套件,官方也提供了無須建置環境的網頁示範版,並聲稱能在提供基本轉檔速度的同時,維持檔案不外傳的作業環境。

以下的步驟將以該線上示範頁為主,功能足以應付一般文件的轉檔需求。不過需特別留意,網頁版設有 25MB 的檔案大小上限,且執行的引擎版本略舊於套件版。

於瀏覽器輸入官方網址 firecrawl.github.io/pdf-inspector。不用註冊登入,初次載入核心程式需等待數秒,後續執行速度將大幅提升。

將 PDF 檔案拖曳至網頁指定區域放開,也可以點擊頁面上的上傳區域,用檔案選取視窗挑檔案。系統處理完成後,會顯示 Markdown 原始碼,並回報該文件的屬性分類:

將畫面顯示的 Markdown 內容全選複製,即可貼入 ChatGPT、Claude 或 NotebookLM 使用。貼上前建議先參閱第七段的檢查項目與提示詞範例,能大幅降低 AI 誤讀數字的機率。

後續兩款工具需依賴 Python 環境,若已有開發環境可跳過此環節。

打開終端機: macOS 按 Command + 空白鍵 輸入「終端機」;Windows 於開始選單搜尋「PowerShell」。

確認 Python 版本: 終端機輸入 python3 --version(Windows 請改輸入 python --version),若顯示版號即代表已安裝。

檔案路徑小技巧: 終端機預設不在您的檔案資料夾。最省事的作法是先打好指令加一個空格(如 markitdown ),然後直接把 PDF 檔案拖進終端機視窗放開,系統會自動填入完整路徑。

由微軟釋出的檔案轉換工具,其優勢在於跨越 PDF,廣泛支援多種企業辦公軟體格式,但並不具備 OCR 功能,遇掃描型文件會回傳空白。

雖然 MarkItDown 的原始碼託管在 GitHub,但實際上不需要手動去下載檔案,官方已發布在 Python 官方套件庫(PyPI)上,因此最標準且簡單的作法,就是直接打開終端機,透過 pip 指令讓系統自動下載並建置環境。

請注意中括號不可省略,否則無法安裝 PDF 解析元件(Windows PowerShell 若報錯,請將單引號改為雙引號 "[all]")。

輸入指令與空格,拖入檔案,並指定輸出檔名,轉好的「財報.md」會出現在你當下所在的資料夾。

它真正的價值在 PDF 以外。Word、Excel、PowerPoint、Outlook 郵件都能轉,用法完全一樣,換個副檔名就行:

由 IBM Research 開發的企業級工具,是三款中唯一搭載 OCR 技術與深度學習版面分析模型的解決方案。與 MarkItDown 相同,Docling 同樣發布於 Python 套件庫上,不需要額外下載安裝檔,直接透過終端機輸入指令即可完成建置。

必須明確指定 OCR 引擎群組,否則預設不會安裝。在終端機輸入:

首次執行需下載模型檔,請耐心等候。--output ./ 代表存檔至當下資料夾。

預設語言不涵蓋繁中,若不指定參數會產生亂碼。EasyOCR 引擎的繁中代碼為 ch_tra。

這條指令會同時載入版面分析與 OCR 兩組模型,對記憶體需求偏高。記憶體較少的電腦處理整頁掃描件時,程序可能中途停止且不顯示錯誤訊息;遇到這種情形,可改用較輕量的 --ocr-engine tesseract --ocr-lang chi_tra(需另行安裝 Tesseract 與繁中語言包)。

Docling 在處理文件時有硬體限制,主要是利用深度學習模型(Deep Learning)來「看懂」文件的版面,記憶體消耗大。若電腦無 GPU 顯示卡而僅靠 CPU 運算,單頁掃描件可能耗時數十秒至數分鐘。

但相較於傳統付費的商業軟體或人工建檔,Docling 也足以應付轉換少量的掃描表格,讓程式自動執行運算,仍可為一般使用者省下大量手動輸入與排版的時間。

轉檔完成後,請先抽查以下 3 個容易出錯的區域,再提供給 AI:

跨頁的表格: 欄列是依座標推斷,表格從前一頁延續到下一頁時最容易錯位。

合併儲存格的表頭: 例如財報常見的兩層表頭,需確認數據是否對齊正確的年度欄位。

恆等式驗算: 若為財報,請直接利用「流動資產+非流動資產=資產總計」進行加總驗算,抓出難以察覺的錯誤。

強烈建議加入「不要推算」,避免 AI 遇到轉檔缺漏時,自行利用鄰近數字產生幻覺。

表格結構靠推斷: PDF 無原生欄列關係,遇到複雜表格時各工具可能出現不同型態的失誤。

OCR 辨識風險: 掃描型文件經 OCR 後,可能會出現中文字元誤判、千分位符號錯亂、數字位數遺失等狀況,且錯誤外觀正常不易察覺。掃描件轉出的財務數字務必逐格對照原始檔案。

版本指令更迭快: 開源工具改版頻繁,本文指令以 2026 年 8 月為準,執行前建議利用 --help 確認最新參數。

A:根據官方,三款的程式碼都是 MIT 授權,免費、無用量限制、不需要 API 金鑰,商業使用的限制也相對寬鬆。

A:pdf-inspector 網頁版在瀏覽器內運算,檢視原始碼可確認沒有任何夾帶檔案外流的網路呼叫;MarkItDown 與 Docling 皆安裝於電腦本機端離線執行(首次安裝 Docling 須連網下載模型),套件內也沒有回傳任何使用紀錄的遙測(Telemetry)程式。

A:pdf-inspector 的網頁版不用,開網頁拖檔案即可。MarkItDown 和 Docling 需要在終端機輸入指令,但不需要寫程式碼,照本文的指令複製貼上即可。

A:這代表 Python 沒裝好或沒加進系統路徑,須重新安裝 Python,Windows 使用者記得在安裝畫面勾選「Add Python to PATH」。部分環境要改用 pip3 或 python3 -m pip。

A:用瀏覽器打開 PDF,在表格文字上按住滑鼠拖曳。文字反白就是有文字層;只出現藍色方框、文字毫無反應,那頁就是圖片。記得逐頁測試,不要只測封面。

Q:轉出來的 Markdown 可以直接丟給 ChatGPT 或 NotebookLM 嗎?

A:可以,這正是將其轉為 Markdown 的最大意義。AI 閱讀帶有標記標籤的純文字表格,準確率高於直接讀取 PDF。