深度求索發布DeepSeek-OCR:解密「光學壓縮」的文字速讀機制,為何AI學會遺忘反而省算力?
深度求索發布DeepSeek-OCR:解密「光學壓縮」的文字速讀機制,為何AI學會遺忘反而省算力?
2025.10.21 |

重點一:DeepSeek OCR 以「光學壓縮」技術處理寫滿文字的圖片,最高壓縮10倍且保留約97%資訊,讓AI可處理更長文件。

重點二:DeepSeek OCR 把文件當成圖片處理,用兩個擅長不同工作的模型分工合作,再用一個「16倍壓縮器」把需要計算的資料量大幅減少。

重點三:DeepSeek OCR 每天可以在單一 Nvidia A100 GPU 上處理超過 20 萬頁資料。如果使用 20 台伺服器,每台伺服器運行 8 塊 A100 處理器,吞吐量將躍升至每天 3,300 萬頁。

中國AI公司Deepseek(深度求索)於10月21日推出DeepSeek-OCR(光學文字辨識)系統,主打將以「影像」呈現的文字文件做高效率壓縮後再交由語言模型處理。其技術上核心訴求是:處理「影像中的文字」比直接處理「數位文字」更省算力。

而在應用上,這套系統的核心賣點也很簡單: 用更少的「視覺符號」(內部的影像單位)就能把文件讀懂,並輸出成可編輯的文字或結構化內容,包含表格、公式與圖表。

OCR讀起字來多有效率?DeepSeek技術報告指出,在維持約97%資訊的前提下,文字脈絡可被壓縮至最多10倍,從而延長LLM可承載的上下文長度,減少記憶體與推論成本。

系統也可將「對話歷史影像化並壓縮」,將較舊的聊天內容以低解析度保存,類似人類「漸漸遺忘」的機制:資料越久、越遠、越低解析,就越模糊。

DeepSeek-OCR的記憶機制
圖片以時間、距離和解析度為三個維度,說明了記憶、視覺和文字的清晰度變化。
圖/ DeepSeek-OCR的記憶機制

記憶刻度 :時間從「剛發生」到「1年」,清晰度由「Crystal Clear」逐步變成「Almost Gone」,描述人類記憶隨時間自然衰退。
視覺刻度:距離從 10 cm 到 20 m,越遠越不清楚,對應「看得近清楚、遠則模糊」的直覺感受。
文字刻度(解析度):從「Gundam」到「Tiny」等級,解析度越低、需要的「視覺符號」越少,文字呈現也越模糊,象徵以圖片方式壓縮舊文本。

這樣的優勢主要瞄準長文件處理、跨頁表格與圖形理解,以及跨語言(約100種)文件抽取,並在維持原始版面或輸出純文字的彈性間取得平衡。

白話來說,處理更少的符號,意味著更快的處理、更低的成本。對需要大量掃描、歸檔和資料萃取的工作類型,是最直接的效率紅利。

OCR如拼裝車!3步驟把資料「切塊再瘦身」

技術上,OCR如何辦到?DeepSeek‑OCR的做法是:把一頁文件當成「圖片」丟給AI,先切塊、再瘦身,最後才請懂圖又懂字的模型來讀。

第一步,前處理引擎DeepEncoder把版面「劃重點」:段落在哪、表格在哪、圖形在哪,別讓後面的模型浪費力氣在邊角裝飾(這裡用的是臉書母公司Meta的SAM,專門做影像分割)。

第二步是「資訊減肥」。例如原本一張1,024×1,024的頁面,會變成4,096個「視覺單位」(token),先經過壓縮器直接砍到256個,類似把會議逐字稿濃縮成重點條列,將算力和記憶體省下來。

第三步則是「理解」。其利用OpenAI的CLIP,負責把「看到的區塊」對上「語意」,也就是判斷這段到底在說什麼、這張圖在表達什麼。而因為前面已經切塊並瘦身,所以CLIP不用面對整頁的雜訊。

DeepSeek-OCR技術原理
Deepseek OCR先把文件當成圖片處理,用兩個擅長不同工作的模型分工合作,再用一個「16倍壓縮器」把需要計算的資料量大幅減少。
圖/ DeepSeek

結果,同樣的一頁文件,DeepSeek‑OCR通常只需要64到400個視覺token就能讀懂:一般簡報大約64個、書籍或報告約100個。而若遇到版面複雜的報紙,再打開所謂的「Gundam模式」把配額拉到最多800。對比傳統OCR動輒上千到上萬token,這套路線是「少算力、更多內容」。

 DeepSeek‑OCR 的輸入模式有三種
DeepSeek‑OCR 的輸入模式分成三類,對應不同「視覺符號」數量,以測試在各種壓縮比例下的表現。
圖/ DeepSeek

進一步來說,DeepSeek‑OCR的輸入模式分成三類,以對應不同「視覺符號」數量,以測試在各種壓縮比例下的表現。

• Tiny|Small:固定尺寸(約 512、640),輸出 64 或 100 個視覺符號。適合字數不多、版面簡單的頁面,用少量符號就能還原內容。
• Base|Large:較大尺寸(約 1024、1280),輸出 256 或 400 符號。以「補邊」保留原始長寬比;有效符號會因黑邊扣除而少於名義值。
• Gundam|Gundam‑Master:動態模式,把頁面切成 n 個局部視野,再加一張全局視野。

一日處理3,300萬頁!OCR資料集與權重全面開放

在實務部署方面,DeepSeek-OCR宣稱以單顆Nvidia A100每日可處理約200,000頁;若以20台伺服器、每台8顆A100組成叢集,日處理量可達3,300萬頁。此吞吐量不僅可支援企業級文件工作流,也有助於為LLM建構海量文字語料。

研究團隊訓練時使用約3,000萬頁PDF(含近百種語言,其中中文與英文約2,500萬頁),並加入1,000萬張合成圖表500萬份化學式100萬份幾何圖形以強化多模態文件理解。

更重要的是,官方開放程式碼模型權重,讓生態系可驗證與擴充此技術;在多語、保版面與純文字輸出之間提供彈性,適合長文件抽取、AI訓練語料建置,以及聊天機器人脈絡的「成本感知式」保存。

整體而言,DeepSeek-OCR以「影像壓縮+少量token」策略,將OCR從單純文字擷取,推進到可支援LLM長脈絡與結構化資料抽取的系統級能力。

英國資深網頁開發者Simon Willison實測指出,DeepSeek‑OCR 可在 NVIDIA Spark(ARM64 + CUDA)的環境中順利跑通,整體印象是:只要花時間選擇合適的「運行方式/提示」,DeepSeek‑OCR本身的模型表現「非常好」,足以在新硬體條件下完成高品質 OCR。

如何使用 DeepSeek OCR ?

一般讀者可用 Hugging Face 下載模型,安裝必要套件後,把圖片丟進範例程式即可做 OCR。其建議簡易流程如下:

  • 事前準備:有一台可用的電腦。若沒有 NVIDIA 顯示卡,也能跑,但會較慢;Hugging Face 頁面示範是用 NVIDIA GPU、CUDA 11.8。
  • 安裝工具:安裝 Python(建議 3.12)與套件管理工具(pip 即可)。
  • 安裝必要套件:torch 2.6.0、transformers 4.46.3、tokenizers 0.20.3、einops、addict、easydict;加速可選擇安裝 flash-attn 2.7.3
  • 取得模型:從 Hugging Face 載入模型名稱 deepseek-ai/DeepSeek-OCR
  • 放入圖片:把要辨識文字的圖片檔(如掃描的合約、收據、海報)指定到程式,執行後就會輸出文字或 Markdown。

延伸閱讀:Canva回來了!AWS雲端服務全面修復完成,快打開看Perplexity、Coinbase⋯⋯能不能用?

資料來源:DeepSeekDecoderSimon Willison’s Weblog

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #AI工具 #DeepSeek
往下滑看下一篇文章
當AI開始幫消費者做決定,品牌怎麼做?iKala Connection Day揭企業轉型解方
當AI開始幫消費者做決定,品牌怎麼做?iKala Connection Day揭企業轉型解方

隨著代理式AI(Agentic AI)快速發展,人工智慧的角色也從被動問答的對話工具,轉變為能主動代為執行搜尋的商業介面;兩者根本的差異在於,前者仍須仰賴使用者逐步下達指令,後者則能自主完成任務。當AI代理為人類代勞搜尋、比價、甚至決策等任務,品牌競爭的對象便不再限於消費者,也涵蓋替消費者把關的AI代理。

因此,「Business to Agent」(B2A)成為當代企業必須面對的新命題,為了擁抱嶄新的思路,跨國AI轉型解決方案供應商iKala舉辦第二屆「iKala Connection Day」論壇,以「數據領航:AI時代的真實價值」為題,邀集Google Cloud、Google Ads等產業領袖,一同剖析企業如何從基礎建設走向市場端,搶佔AI先機。

不只SEO,還要GEO!企業如何讓AI認識你

回顧過往科技發展週期,新科技普遍需10至12年才能成熟。iKala共同創辦人暨集團董事長程世嘉引述AMD執行長蘇姿丰的比喻來說,若AI是一場棒球賽,目前僅走到第三局。這意味著,只要企業採用率持續攀升,尚且毋需擔憂AI泡沫化;反之,AI產業可能才正要邁入超級循環。

不過,程世嘉也提出「智慧通膨」的現象,他表示:「各大廠不斷推出新模型,資本支出也不斷提升,但使用成本並沒有因此下降,因為算力供不應求;不過長期來看,成本曲線一定會往下走,未來AI智慧會像水龍頭一樣,打開就有。」

隨著AI逐步普及,使用者尋找資訊的方式也隨之轉變。程世嘉強調,搜尋行為正從關鍵字轉向AI對話與生成式搜尋。企業除經營傳統SEO,更需布局GEO(生成式引擎優化),提高被AI引用與推薦的機會。這波版位重分配與十餘年前SEO興起時無異,及早掌握規則者,才能在新流量分配中卡位。

2.JPG
iKala共同創辦人暨集團董事長 程世嘉
圖/ 數位時代

迎戰Business-to-Agent,如何搶進AI決策新戰場

要爭取AI時代的流量紅利,關鍵前提在於企業內部的基礎建設是否到位。「現在超過9成的企業都有AI焦慮症,大家都很急著導入AI工具,但背後缺乏整體的策略與架構。」iKala AI服務事業部副總經理Gary Yang認為,AI專案應如培訓新進員工,結合商業策略與數據資產雙向評估,才能真正落地。

「如果沒有穩定的雲端基礎,企業的AI就會是空中樓閣。」他強調,雲端即是企業佈局AI的關鍵基礎建設之一。如多數企業選擇Google Cloud,看重的就是技術護城河、數據主權與總體擁有成本;而iKala推出的企業級AI代理平台iKala Nexus,定位為策略中樞與營運大腦,即立基於此。

3.JPG
iKala AI服務事業部副總經理Gary Yang
圖/ 數位時代

然而,架構穩固只是起點。Google Workspace銷售總監Murray Chiang指出,全球僅約3%企業成功透過AI達成深度轉型,關鍵就在AI代理能取得多少企業資料與情境。因此,企業級Gemini Enterprise App結合個人級Google Workspace,構成Google所主張的「代理型工作轉型」(Agentic Workplace Transformation,AWT)主軸,讓AI從被動對話框升級為跨系統執行的代理,並恪守數據主權歸屬企業的原則,讓企業級AI能真正發揮效益。

4.JPG
Google Workspace銷售總監Murray Chiang
圖/ 數位時代

當企業打穩內部地基,外部競爭也才能順勢轉向市場端。「Google Search全球年搜尋量達5兆次,近八成消費者認為AI讓購物決策更快、更有信心。」Google Ads廣告產品行銷資深總監Alvin Tsai指出,「B2A」(Business to Agent)的時代來臨,當AI代理主導決策時,看重的是API串接流暢度與數據結構化程度,企業必須從爭取「被看見」的SEO排名,走向爭取「被推薦」的AI清單,並進一步走向「被選擇」。其中,信任將成為AI時代品牌經營的關鍵。

5.JPG
Google Ads廣告產品行銷資深總監Alvin Tsai
圖/ 數位時代

從洞察到執行,iKala全方位解方引領品牌佈局

這份信任要能落地,關鍵在於底層數據是否可信。對此,iKala行銷科技事業部總監Donna Hsu提出的IMC整合行銷架構,正是iKala因應Agentic Commerce時代所提出的整體解決方案。

面對高度碎片化的行銷環境,品牌需要建立的,是一套能從市場洞察延伸至全通路執行、並持續優化的整合行銷系統。Ontix即時掌握消費者社群聲量與市場趨勢,代表品牌對人的理解;Kuroma則從AI搜尋視角,分析品牌在生成式搜尋中的能見度與引用表現,代表對AI的理解;兩者合力,讓品牌同時掌握人類與AI代理的決策脈絡。再透過Kolr行銷數據平台,將洞察轉化為具體行銷執行,使每一次決策都能以數據驅動、持續優化,協助品牌在AI時代建立長期競爭優勢。

6.JPG
iKala行銷科技事業部總監Donna Hsu
圖/ 數位時代

最後,在論壇壓軸的高峰對談中,程世嘉強調,當前正是典範轉移的關鍵時機,如同過往率先布局SEO的業者得以享有紅利;他認為,這同樣是企業重生的契機,提早深耕者將在此波轉型中佔得先機。尤其,AI轉型已非單機運作所能達成,企業應優先建立基礎建設與治理架構;當自身能力有限,也須慎選合作夥伴、借助外部資源,並在安全可信任的前提下,實現共同成長。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓