把 PDF 財報丟給 ChatGPT,結果出來的表格數字全糊在一起、欄位大錯亂?這並非 AI 判讀失敗,而是 PDF 格式本身只記錄文字印在哪個座標,缺乏儲存表格結構的資訊。
想讓 AI 準確讀懂報表,最好的作法是先將 PDF 轉換為帶有結構標籤的 Markdown 格式。本文精選 3 款實用的免費工具,包括無需安裝的網頁版,到掃描圖檔的進階工具,以及安裝步驟流程,帶你挑選合適的轉檔方案!
文章重點:
一、轉檔前置作業:文字型、掃描型…先搞懂你的 PDF 是哪一種?
三、工具一〉pdf-inspector:適用於純文字 PDF 的轉換工具
五、工具二〉MarkItDown:支援 Office 格式的微軟開源方案
六、工具三〉Docling:支援版面分析與 OCR 的 IBM 開源工具
一、轉檔前置作業:文字型、掃描型…先搞懂你的 PDF 是哪一種?
選擇轉檔工具的首要條件,在於確認 PDF 是否具備「可選取之文字層」。建議使用瀏覽器或專業 PDF 軟體開啟檔案,並透過滑鼠在表格區域進行反白測試:
文字型: 文字可順利反白,代表檔案具備原生文字層。
掃描型: 僅出現藍色選取方框,文字無法單獨標記,代表該頁面為掃描圖檔。
需要注意的是,台灣許多上市公司的財報屬於「混合型」文件,前面的文字說明具備文字層,但經會計師簽章的四大報表往往為掃描影像。若未逐頁確認,轉換後的關鍵數據區塊將呈現空白。
此外,目前市場上並無「免安裝且能處理掃描件」的免費工具。具備 Web 端直接執行能力的工具通常不支援 OCR(光學文字辨識);而內建 OCR 模組的工具,皆需於本機環境部署。若文件為掃描型,可直接參閱第六段的 Docling 解決方案。
二、3 款免費開源工具,怎麼挑選才適合?
以下三款工具皆採用寬鬆的 MIT 授權條款,適合企業內部評估與商業導入,建議依據檔案屬性搭配運用。
| 比較面向 | pdf-inspector | MarkItDown | Docling |
|---|---|---|---|
| 開發機構 | Firecrawl | 微軟 (Microsoft) | IBM Research |
| 免安裝網頁版 | 支援 | 不支援 | 不支援 |
| 內建 OCR 模組 | 否 | 否 | 是 |
| 支援檔案格式 | 僅 PDF | PDF、Office 生態系、電子郵件 | PDF、Office、影像圖檔 |
| 系統環境需求 | 無(瀏覽器執行,另有開源套件可安裝) | 基礎 Python 環境 | 需安裝機器學習模型套件 |
| 最佳適用情境 | 具備文字層的 PDF | Word、Excel、PPT 轉檔 | 掃描影像件、多欄位複雜版面 |
第一步可將 PDF 匯入 pdf-inspector 網頁版,系統將自動判定檔案屬性。若為文字型,轉檔即可直接完成;若判定為掃描型或混合型,則啟動 Docling 進行深度 OCR 解析;若原始檔案為 Office 格式(Word / Excel),則交由 MarkItDown 處理以獲取最佳結構還原度。
三、工具一〉pdf-inspector:適用於純文字 PDF 的轉換工具
由 Firecrawl 團隊開源的 Rust 解析工具,其主體為提供開發者安裝的開源套件,官方也提供了無須建置環境的網頁示範版,並聲稱能在提供基本轉檔速度的同時,維持檔案不外傳的作業環境。
以下的步驟將以該線上示範頁為主,功能足以應付一般文件的轉檔需求。不過需特別留意,網頁版設有 25MB 的檔案大小上限,且執行的引擎版本略舊於套件版。
步驟一:開啟網頁環境
於瀏覽器輸入官方網址 firecrawl.github.io/pdf-inspector。不用註冊登入,初次載入核心程式需等待數秒,後續執行速度將大幅提升。
步驟二:匯入 PDF 檔案
將 PDF 檔案拖曳至網頁指定區域放開,也可以點擊頁面上的上傳區域,用檔案選取視窗挑檔案。系統處理完成後,會顯示 Markdown 原始碼,並回報該文件的屬性分類:
| 判定結果 | 代表意義 | 後續處置建議 |
|---|---|---|
| 文字型 (text-based) | 全份文件皆具備文字層 | 格式完整,可直接進入步驟三 |
| 掃描型 (scanned) | 全份文件皆為影像圖檔 | 需更換具備 OCR 功能的工具 |
| 混合型 (mixed) | 部分頁面為影像圖檔 | 可使用,但影像頁面將輸出空白 |
| 圖片型 (image-based) | 文件內容以圖片為主 | 需更換具備 OCR 功能的工具 |
步驟三:複製結果到 AI 工具
將畫面顯示的 Markdown 內容全選複製,即可貼入 ChatGPT、Claude 或 NotebookLM 使用。貼上前建議先參閱第七段的檢查項目與提示詞範例,能大幅降低 AI 誤讀數字的機率。
四、前置準備:安裝 Python 與打開終端機
後續兩款工具需依賴 Python 環境,若已有開發環境可跳過此環節。
-
打開終端機: macOS 按 Command + 空白鍵 輸入「終端機」;Windows 於開始選單搜尋「PowerShell」。
-
確認 Python 版本: 終端機輸入 python3 --version(Windows 請改輸入 python --version),若顯示版號即代表已安裝。
-
檔案路徑小技巧: 終端機預設不在您的檔案資料夾。最省事的作法是先打好指令加一個空格(如 markitdown ),然後直接把 PDF 檔案拖進終端機視窗放開,系統會自動填入完整路徑。
五、工具二〉MarkItDown:支援 Office 格式的微軟開源方案
由微軟釋出的檔案轉換工具,其優勢在於跨越 PDF,廣泛支援多種企業辦公軟體格式,但並不具備 OCR 功能,遇掃描型文件會回傳空白。
雖然 MarkItDown 的原始碼託管在 GitHub,但實際上不需要手動去下載檔案,官方已發布在 Python 官方套件庫(PyPI)上,因此最標準且簡單的作法,就是直接打開終端機,透過 pip 指令讓系統自動下載並建置環境。
步驟一:安裝指令
請注意中括號不可省略,否則無法安裝 PDF 解析元件(Windows PowerShell 若報錯,請將單引號改為雙引號 "[all]")。
# 建議直接安裝全格式支援版
pip install 'markitdown[all]'
步驟二:確認安裝成功
markitdown --help
步驟三:進行轉檔
輸入指令與空格,拖入檔案,並指定輸出檔名,轉好的「財報.md」會出現在你當下所在的資料夾。
markitdown /你的路徑/財報.pdf -o 財報.md
步驟四:轉其他格式
它真正的價值在 PDF 以外。Word、Excel、PowerPoint、Outlook 郵件都能轉,用法完全一樣,換個副檔名就行:
markitdown 簡報.pptx -o 簡報.md
六、工具三〉Docling:支援版面分析與 OCR 的 IBM 開源工具
由 IBM Research 開發的企業級工具,是三款中唯一搭載 OCR 技術與深度學習版面分析模型的解決方案。與 MarkItDown 相同,Docling 同樣發布於 Python 套件庫上,不需要額外下載安裝檔,直接透過終端機輸入指令即可完成建置。
步驟一:安裝指令
必須明確指定 OCR 引擎群組,否則預設不會安裝。在終端機輸入:
pip install 'docling[easyocr]'
步驟二:確認安裝成功
docling --version
步驟三:轉換一般 PDF
首次執行需下載模型檔,請耐心等候。--output ./ 代表存檔至當下資料夾。
docling convert /你的路徑/財報.pdf --to md --output ./
步驟四:轉換繁體中文掃描件
預設語言不涵蓋繁中,若不指定參數會產生亂碼。EasyOCR 引擎的繁中代碼為 ch_tra。
docling convert 掃描檔.pdf --ocr-engine easyocr --ocr-lang ch_tra --to md --output ./
這條指令會同時載入版面分析與 OCR 兩組模型,對記憶體需求偏高。記憶體較少的電腦處理整頁掃描件時,程序可能中途停止且不顯示錯誤訊息;遇到這種情形,可改用較輕量的 --ocr-engine tesseract --ocr-lang chi_tra(需另行安裝 Tesseract 與繁中語言包)。
Docling 具硬體限制,但仍能應付少量掃描表格
Docling 在處理文件時有硬體限制,主要是利用深度學習模型(Deep Learning)來「看懂」文件的版面,記憶體消耗大。若電腦無 GPU 顯示卡而僅靠 CPU 運算,單頁掃描件可能耗時數十秒至數分鐘。
但相較於傳統付費的商業軟體或人工建檔,Docling 也足以應付轉換少量的掃描表格,讓程式自動執行運算,仍可為一般使用者省下大量手動輸入與排版的時間。
七、轉檔後的必做3個檢查+AI 提示詞技巧
轉檔完成後,請先抽查以下 3 個容易出錯的區域,再提供給 AI:
跨頁的表格: 欄列是依座標推斷,表格從前一頁延續到下一頁時最容易錯位。
合併儲存格的表頭: 例如財報常見的兩層表頭,需確認數據是否對齊正確的年度欄位。
恆等式驗算: 若為財報,請直接利用「流動資產+非流動資產=資產總計」進行加總驗算,抓出難以察覺的錯誤。
推薦 AI 提示詞(Prompt)範例:
以下是一份台灣上市公司財報轉成的 Markdown。金額單位為新台幣仟元,年度為民國年。回答時請標明每個數字來自哪一列、哪個年度欄位;表格中找不到的數字,請直接說找不到,絕對不要推算。
強烈建議加入「不要推算」,避免 AI 遇到轉檔缺漏時,自行利用鄰近數字產生幻覺。
八、使用限制與常見問題 (FAQ)
實務限制:
表格結構靠推斷: PDF 無原生欄列關係,遇到複雜表格時各工具可能出現不同型態的失誤。
OCR 辨識風險: 掃描型文件經 OCR 後,可能會出現中文字元誤判、千分位符號錯亂、數字位數遺失等狀況,且錯誤外觀正常不易察覺。掃描件轉出的財務數字務必逐格對照原始檔案。
版本指令更迭快: 開源工具改版頻繁,本文指令以 2026 年 8 月為準,執行前建議利用 --help 確認最新參數。
常見問題 (FAQ)
Q:這三款工具完全免費嗎?
A:根據官方,三款的程式碼都是 MIT 授權,免費、無用量限制、不需要 API 金鑰,商業使用的限制也相對寬鬆。
Q:我的檔案會被上傳到哪裡嗎?
A:pdf-inspector 網頁版在瀏覽器內運算,檢視原始碼可確認沒有任何夾帶檔案外流的網路呼叫;MarkItDown 與 Docling 皆安裝於電腦本機端離線執行(首次安裝 Docling 須連網下載模型),套件內也沒有回傳任何使用紀錄的遙測(Telemetry)程式。
Q:一定要會寫程式才能用嗎?
A:pdf-inspector 的網頁版不用,開網頁拖檔案即可。MarkItDown 和 Docling 需要在終端機輸入指令,但不需要寫程式碼,照本文的指令複製貼上即可。
Q:安裝時終端機顯示「找不到 pip 指令」怎麼辦?
A:這代表 Python 沒裝好或沒加進系統路徑,須重新安裝 Python,Windows 使用者記得在安裝畫面勾選「Add Python to PATH」。部分環境要改用 pip3 或 python3 -m pip。
Q:怎麼知道我的 PDF 有沒有文字層?
A:用瀏覽器打開 PDF,在表格文字上按住滑鼠拖曳。文字反白就是有文字層;只出現藍色方框、文字毫無反應,那頁就是圖片。記得逐頁測試,不要只測封面。
Q:轉出來的 Markdown 可以直接丟給 ChatGPT 或 NotebookLM 嗎?
A:可以,這正是將其轉為 Markdown 的最大意義。AI 閱讀帶有標記標籤的純文字表格,準確率高於直接讀取 PDF。
延伸閱讀: 股票分析提示詞|用NotebookLM分析台股及美股財報,AI prompt一次收 NotebookLM、Gemini、Claude 三個AI分工術!券商分析師的產業研究工作流,用Markdown檔接力 NotebookLM(Gemini Notebook)完整攻略:23篇實戰一次收
資料來源:pdf-inspector GitHub、Microsoft MarkItDown、Docling/IBM、Tesseract 語言資料庫 (註:本文指令參數與操作方式以 2026 年 8 月為準,執行前建議參閱官方最新文件。)
本文初稿為AI編撰,整理.編輯/蘇柔瑋
