深度求索發布DeepSeek-OCR:解密「光學壓縮」的文字速讀機制,為何AI學會遺忘反而省算力?
深度求索發布DeepSeek-OCR:解密「光學壓縮」的文字速讀機制,為何AI學會遺忘反而省算力?
2025.10.21 |

重點一:DeepSeek OCR 以「光學壓縮」技術處理寫滿文字的圖片,最高壓縮10倍且保留約97%資訊,讓AI可處理更長文件。

重點二:DeepSeek OCR 把文件當成圖片處理,用兩個擅長不同工作的模型分工合作,再用一個「16倍壓縮器」把需要計算的資料量大幅減少。

重點三:DeepSeek OCR 每天可以在單一 Nvidia A100 GPU 上處理超過 20 萬頁資料。如果使用 20 台伺服器,每台伺服器運行 8 塊 A100 處理器,吞吐量將躍升至每天 3,300 萬頁。

中國AI公司Deepseek(深度求索)於10月21日推出DeepSeek-OCR(光學文字辨識)系統,主打將以「影像」呈現的文字文件做高效率壓縮後再交由語言模型處理。其技術上核心訴求是:處理「影像中的文字」比直接處理「數位文字」更省算力。

而在應用上,這套系統的核心賣點也很簡單: 用更少的「視覺符號」(內部的影像單位)就能把文件讀懂,並輸出成可編輯的文字或結構化內容,包含表格、公式與圖表。

OCR讀起字來多有效率?DeepSeek技術報告指出,在維持約97%資訊的前提下,文字脈絡可被壓縮至最多10倍,從而延長LLM可承載的上下文長度,減少記憶體與推論成本。

系統也可將「對話歷史影像化並壓縮」,將較舊的聊天內容以低解析度保存,類似人類「漸漸遺忘」的機制:資料越久、越遠、越低解析,就越模糊。

DeepSeek-OCR的記憶機制
圖片以時間、距離和解析度為三個維度,說明了記憶、視覺和文字的清晰度變化。
圖/ DeepSeek-OCR的記憶機制

記憶刻度 :時間從「剛發生」到「1年」,清晰度由「Crystal Clear」逐步變成「Almost Gone」,描述人類記憶隨時間自然衰退。
視覺刻度:距離從 10 cm 到 20 m,越遠越不清楚,對應「看得近清楚、遠則模糊」的直覺感受。
文字刻度(解析度):從「Gundam」到「Tiny」等級,解析度越低、需要的「視覺符號」越少,文字呈現也越模糊,象徵以圖片方式壓縮舊文本。

這樣的優勢主要瞄準長文件處理、跨頁表格與圖形理解,以及跨語言(約100種)文件抽取,並在維持原始版面或輸出純文字的彈性間取得平衡。

白話來說,處理更少的符號,意味著更快的處理、更低的成本。對需要大量掃描、歸檔和資料萃取的工作類型,是最直接的效率紅利。

OCR如拼裝車!3步驟把資料「切塊再瘦身」

技術上,OCR如何辦到?DeepSeek‑OCR的做法是:把一頁文件當成「圖片」丟給AI,先切塊、再瘦身,最後才請懂圖又懂字的模型來讀。

第一步,前處理引擎DeepEncoder把版面「劃重點」:段落在哪、表格在哪、圖形在哪,別讓後面的模型浪費力氣在邊角裝飾(這裡用的是臉書母公司Meta的SAM,專門做影像分割)。

第二步是「資訊減肥」。例如原本一張1,024×1,024的頁面,會變成4,096個「視覺單位」(token),先經過壓縮器直接砍到256個,類似把會議逐字稿濃縮成重點條列,將算力和記憶體省下來。

第三步則是「理解」。其利用OpenAI的CLIP,負責把「看到的區塊」對上「語意」,也就是判斷這段到底在說什麼、這張圖在表達什麼。而因為前面已經切塊並瘦身,所以CLIP不用面對整頁的雜訊。

DeepSeek-OCR技術原理
Deepseek OCR先把文件當成圖片處理,用兩個擅長不同工作的模型分工合作,再用一個「16倍壓縮器」把需要計算的資料量大幅減少。
圖/ DeepSeek

結果,同樣的一頁文件,DeepSeek‑OCR通常只需要64到400個視覺token就能讀懂:一般簡報大約64個、書籍或報告約100個。而若遇到版面複雜的報紙,再打開所謂的「Gundam模式」把配額拉到最多800。對比傳統OCR動輒上千到上萬token,這套路線是「少算力、更多內容」。

 DeepSeek‑OCR 的輸入模式有三種
DeepSeek‑OCR 的輸入模式分成三類,對應不同「視覺符號」數量,以測試在各種壓縮比例下的表現。
圖/ DeepSeek

進一步來說,DeepSeek‑OCR的輸入模式分成三類,以對應不同「視覺符號」數量,以測試在各種壓縮比例下的表現。

• Tiny|Small:固定尺寸(約 512、640),輸出 64 或 100 個視覺符號。適合字數不多、版面簡單的頁面,用少量符號就能還原內容。
• Base|Large:較大尺寸(約 1024、1280),輸出 256 或 400 符號。以「補邊」保留原始長寬比;有效符號會因黑邊扣除而少於名義值。
• Gundam|Gundam‑Master:動態模式,把頁面切成 n 個局部視野,再加一張全局視野。

一日處理3,300萬頁!OCR資料集與權重全面開放

在實務部署方面,DeepSeek-OCR宣稱以單顆Nvidia A100每日可處理約200,000頁;若以20台伺服器、每台8顆A100組成叢集,日處理量可達3,300萬頁。此吞吐量不僅可支援企業級文件工作流,也有助於為LLM建構海量文字語料。

研究團隊訓練時使用約3,000萬頁PDF(含近百種語言,其中中文與英文約2,500萬頁),並加入1,000萬張合成圖表500萬份化學式100萬份幾何圖形以強化多模態文件理解。

更重要的是,官方開放程式碼模型權重,讓生態系可驗證與擴充此技術;在多語、保版面與純文字輸出之間提供彈性,適合長文件抽取、AI訓練語料建置,以及聊天機器人脈絡的「成本感知式」保存。

整體而言,DeepSeek-OCR以「影像壓縮+少量token」策略,將OCR從單純文字擷取,推進到可支援LLM長脈絡與結構化資料抽取的系統級能力。

英國資深網頁開發者Simon Willison實測指出,DeepSeek‑OCR 可在 NVIDIA Spark(ARM64 + CUDA)的環境中順利跑通,整體印象是:只要花時間選擇合適的「運行方式/提示」,DeepSeek‑OCR本身的模型表現「非常好」,足以在新硬體條件下完成高品質 OCR。

如何使用 DeepSeek OCR ?

一般讀者可用 Hugging Face 下載模型,安裝必要套件後,把圖片丟進範例程式即可做 OCR。其建議簡易流程如下:

  • 事前準備:有一台可用的電腦。若沒有 NVIDIA 顯示卡,也能跑,但會較慢;Hugging Face 頁面示範是用 NVIDIA GPU、CUDA 11.8。
  • 安裝工具:安裝 Python(建議 3.12)與套件管理工具(pip 即可)。
  • 安裝必要套件:torch 2.6.0、transformers 4.46.3、tokenizers 0.20.3、einops、addict、easydict;加速可選擇安裝 flash-attn 2.7.3
  • 取得模型:從 Hugging Face 載入模型名稱 deepseek-ai/DeepSeek-OCR
  • 放入圖片:把要辨識文字的圖片檔(如掃描的合約、收據、海報)指定到程式,執行後就會輸出文字或 Markdown。

延伸閱讀:Canva回來了!AWS雲端服務全面修復完成,快打開看Perplexity、Coinbase⋯⋯能不能用?

資料來源:DeepSeekDecoderSimon Willison’s Weblog

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #AI工具 #DeepSeek
往下滑看下一篇文章
溝通時間砍半、成交率衝 3 成!創造智能以完整 AI解方讓行銷事半功倍
溝通時間砍半、成交率衝 3 成!創造智能以完整 AI解方讓行銷事半功倍

隨著生成式 AI 工具快速普及,使用 AI 生成圖片、文案與影音素材,早已不再稀奇;真正困難的是,如何讓 AI 內容不只具備媲美真人拍攝的質感,還能精準貼合品牌語氣、商品賣點與社群傳播節奏,進一步帶動流量、轉換率與會員經營。

不過,有一家成立不到 5 年的團隊,卻憑藉著這項能力,吸引百年家電品牌、大型連鎖零售品牌、化妝品代工龍頭到政府機關等不同類型客戶合作。近期更與以創意出名的電商平台 蝦皮購物共同合作。

這家隱身在眾多一線大廠背後的 AI 操盤手,正是三立集團旗下的 MarTech 公司「創造智能」。相較於單純提供 AI 工具或單點行銷服務,創造智能更像是企業的 AI 行銷整合夥伴,不只是生成 AI 影音內容,而是從行銷目標出發,運用 AI 串起從內容生成、社群導流、顧客互動到會員經營的完整行銷旅程,突破過往內容與數據各自為政的盲點,這才是它真正讓企業買單的關鍵。

#1 創造智能
除了預算大幅減少、製作效率提升外,林慧珍指出,現在很多人都可以利用 AI 工具生成圖片或影片,但真正拉開差距的,不是 AI 應用能力,而是內容本身。創造智能刻意打造一支由行銷人才與工程師組成的「混血團隊」,兼顧 AI 影音內容的製作效率與品質。
圖/ 創造智能

串起行銷斷點,打造 AI 一條龍整合服務

對台灣企業行銷現場的長期觀察,是創造智能跳脫單一工具走向「AI 行銷整合」模式的起點。

創造智能執行長林慧珍指出,企業行銷工作往往交由不同廠商負責,從影音內容製作、廣告投放、社群經營到會員管理,各自使用不同工具與平台,導致資料散落在各處,形成一個個看不見的行銷斷點,一旦成效不如預期,很難釐清問題究竟出在哪一個環節,是素材無法打動消費者、投放策略失準,還是會員經營沒有發揮效益。

「很多 AI 或軟體業者的想法是,用自家產品去解決客戶的問題,但我們想的不只是解決問題,而是如何讓客戶用最方便、最完整的一條龍方式達成商業目標,」林慧珍強調,也因此,創造智能成立初期便鎖定AIGC 商業影音、AI客服/虛擬人及LINE CRM三大領域,希望從內容、互動到會員經營,串起完整的行銷流程。

在行銷旅程的前端,創造智能透過自家研發的系統與深厚的行銷經驗,快速產製出 AI 影音內容,協助品牌放大聲量、吸引目標受眾;接著透過 AI 客服與 AI 虛擬人即時回應顧客需求,不受時間、地點與語言限制,提高互動與成交機率;最後再藉由 LINE CRM 將流量收斂為品牌的第一方會員資產,透過會員貼標、分群分眾、自動化推播、再行銷等機制,持續深化顧客關係,將一次性的流量轉化為持續回購的忠誠會員。

用 AI 加速內容測試,快速找到市場答案

除了串起完整的行銷流程外,創造智能還能為企業創造兩大價值,第一個是協助企業更快找到真正打動消費者的內容。

「現在很多人都可以利用 AI 工具生成圖片或影片,但真正拉開差距的,不是 AI 應用能力,而是內容本身。」林慧珍指出,創造智能刻意打造一支由行銷人才與工程師組成的「混血團隊」,兼顧 AI 影音內容的製作效率與品質。

林慧珍進一步說明,團隊許多成員原本就來自專業影音團隊,長期協助企業製作導流影片,因此在劇本企劃、分鏡設計與敘事節奏上,累積大量實戰經驗。以近期協助蝦皮購物製作 AI 短影音為例,團隊並非直接交由 AI 工具生成內容,而是先分析目標受眾的偏好,再於腳本設計時加入企劃巧思。像是刻意運用消費者熟悉的歌曲氛圍,營造「似曾相識」的共感,引發社群討論。這些對品牌語感、社群節奏與內容敘事的掌握,正是創造智能團隊多年累積的內容經驗,也是現階段 AI 難以取代的核心價值。

另一方面,團隊則負責研發系統,以滿足企業多元行銷需求。例如:創造智能自行開發的「AI 導演模板」,不僅能快速生成高度擬真的影音內容,還可以依據品牌的不同需求,快速調整畫面風格、配音語氣與敘事方式,協助品牌進行 A/B Test,找出最能吸引消費者的內容。同時,還能依照不同社群平台需求,自動延伸出不同秒數與尺寸的版本,讓同一支影片快速應用於不同投放渠道。

更重要的是,從企劃發想到完成影片,最快約一週即可完成,不僅大幅縮短製作時程,也較傳統真人拍攝節省約 4 至 6 成的成本

讓 AI 走進工作流程,從客服升級為企業數位夥伴

創造智能為企業帶來的第二個價值是,透過 AI 客服 / AI 虛擬人推動流程自動化。林慧珍認為,AI 的價值不只是回答問題,而是深入既有的工作流程,以自動化服務協助企業降低成本、提升營運效率。

舉例來說,創造智能在與百年家電品牌合作時,先以 LINE 官方帳號與會員經營為核心,透過 LINE CRM 建立會員數據基礎,依據會員的瀏覽行為、產品偏好及互動紀錄,自動完成會員標籤與分群,並透過精準推播提供更符合需求的內容。隨著會員數據逐步累積,再進一步串接 Facebook 等社群平台,讓會員經營從單一通路延伸至跨平台互動,逐步建立完整的品牌數位接觸點。

目前,雙方合作已進入第二階段,將 AI 客服真正導入企業日常營運中。從客服受理、案件分流到售後服務,整個流程皆可透過 AI 與系統自動串接完成,不僅縮短服務時間、提升案件處理效率,也讓 AI 的角色從單純的客服工具,進一步成為串聯客服、門市與售後服務的企業數位夥伴。

同樣的模式,也被延伸到 B2B 外貿場景。創造智能為某知名化妝品代工廠打造 AI Sales(AI 虛擬人),並匯入產品知識與各國出口法規,讓 AI 不僅能以多國語言即時回覆海外買家問題,更可自動完成名片蒐集、預約真人業務及商機派單等流程,不僅溝通時間由 6 個月降至 3 個月,減少 30% 以上真人處理成本,訂單成交率提升 25%-32%,

#0 創造智能
某知名化妝品代工廠打造 AI Sales(AI 虛擬人)為例,AI已經可以回復日常問題的70%,真正優化前端開發的營運效率。
圖/ 創造智能

未來,AI 工具將持續演進,但企業真正需要的,始終是能協助創造商業價值的解決方案。林慧珍相信,唯有整合技術、內容與流程,並站在企業角度思考,AI 才能從工具升級為夥伴。這也是創造智能希望實踐的品牌理念──最人性化的MarTech 公司,創造更有溫度的智能夥伴。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
代理式商務連動百兆商機
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓