五個避免被資料誤導的建議與為何與我們切身相關
五個避免被資料誤導的建議與為何與我們切身相關

數據的存在是為了引導,而非誤導。

當我們講Data(數據/資料)的時候,通常是指已經轉換成電腦的數位訊號。

而真實世界的類比訊號要轉換成數位,都必須經過取樣(sampling)、量化(quantization)、編碼(encoding) 等步驟。

影像訊號是這樣、聲音訊號是這樣,還有人的購買記錄、GPS位置記錄、IP記錄、瀏覽記錄,所有我們分析的數據,都是經過轉換得來。

然而,取樣有偏差、量化有誤差、編碼會有損失,還會根據數據的收集方法、實驗方法、推導方法 等方式影響解讀,一直到最後結論之前,這中間的每一項過程都是加工。

只看別人加工過的結論就照單全收是很危險的事情,因為那些結論必須建立在正確的數據解讀前提之下,才有意義。

資料應該起到「引導」的作用,很多時候卻變成「誤導」我們做決定

王堅博士講,數據是人類第一次自己創造了能源、創造了資源,衣服人家穿過,你穿就會不值錢,數據是人家用過,你用會更值錢,你用過以後出去更值錢,是越用越值錢的東西。

數據應該類比成「能量」,它的確頗具價值,但怎麼使用才能發揮效益,最終還是靠引擎,也就是使用資料的「方法」。

錯誤的解讀,不但無法發揮價值,可能還會適得其反。

商業上說數據驅動,很多時候是老闆在驅動數據

我們常說數據驅動 (Data Driven),無非是想要做出正確的決策。

比如一間公司要決定一個產品的功能、時程、外型、定價等等。這些重大、明顯的決策,已經被不少專家提出來要謹慎,過度仰賴數據驅動(Data Driven)會有危險。

或許不少人也經歷過上司「看著一堆荒謬的數字,臉不紅氣不喘地講出愚蠢結論」的情況,那其實只是HiPPO (highest paid person’s opinion,意即「最高薪人士的意見」),假裝是數據先決罷了。

以下是一些參考資料,像有一篇英文文章《The problem with data driven decisions》寫得很好,摘錄一些我認為很受用的句子:

Rich in Data and Poor in Insight

Data is a false God. You can tag every link, generate every metric, and run split tests for every decision, but no matter how deep you go, no matter how many hours you invest, you’re only looking at one piece of the puzzle. Besides, has anyone ever A/B tested the practice of running A/B tests? There could be better, albeit less measurable things, for a development team to do.

(中譯)
數據是偽神(或假神,不過偽神比較好懂,西方宗教用語
你可以標記任何連結、產生任何指標、對每一個決定分開跑測試
但不管你做得多深入、你投資多少時間,你只是在觀察謎題的一小部分
並且,有人曾經對 A/B test 做過 A/B test 嗎?(當然沒有辦法)
我們仍然有更好的(雖然可衡量數字也比較少的)事物讓開發團隊去做

在《Know the difference between data-informed and versus data-driven》一文中也說到:

1. The data you can collect is often systematically biased in unfixable ways.
2. Not everything is an optimization problem

(中譯)
1. 你可以收集到的數據通常都(以一種很難修復的方式)存在系統性的偏差
2. 並非任何事都是「最佳化問題」

「解讀資料」是每個人切身相關的事情

我們每天都無法避免接受資訊洪流的轟炸,即使你我不是高階經理人、主管,商業決策也離我們很遠,但市井小民還是會受到很多錯誤的解讀過程影響,因而改變選擇傾向,相信那些「加工過的數據」做出錯誤決定。

有很多日常生活的例子可以說明,我們看到的數據幾乎全部都是被整理過的:

  • 被操作過的數據抹黑後,改變支持的政黨
  • 被刻意斷章取義的報導洗腦,潛移默化改變價值觀
  • 被隱藏部分資訊的金融產品,讓你誤以為有利可圖

如果照單全收而不思考,很容易就被有話語權的操作者牽著走。

五個避免反被資料誤導的方法

1. 保持好奇心與懷疑

永遠記得,所有結論都經過一連串的處理:

取樣、量化、編碼、收集、實驗、推導

所以看到任何結論,第一件事情就是把句號改成問號。

每一個步驟都可以去想以下問題:

他是怎麼做的?
有沒有更好的設計方法來問這個問題?
有沒有更貼切的假設?他為什麼不這樣假設?
如果結論跟我的想像或直覺不一致,那是為什麼?
再類似的想法都可以找出些微不同的地方

2. 試著用自己的方式解讀、甚至想像

對原文問了問題之後,反過來開始問自己:

如果讓我自己歸納、提出假設、設計實驗
也就是自己拿到第一手的數據,會變成什麼樣?

如果原作者沒提供資料就下結論,那就趁這個機會自己去蒐集,驗證是否正確。

如果原作者有提供資料但卻跟你搜集到的有出入,那就找出差異的原因:是作者被誤導,還是作者想要誤導大家?

3. 不要違背直覺、脫離現實經驗

舉例來說,某天的賣場記錄看到不少人結帳都買了泡麵。

當我們只看到數據,卻不知道日期、價格、贈品等訊息,有些人就會過度推論:

「是不是台灣人開始不愛吃飯了?」

「是不是有一款泡麵超夯」

然而實際去賣場之後可能會發現:其實只是颱風要來、特價活動,甚至是贈品很超值,等等這些很稀鬆平常的理由。

任何數據都是為了反映現實,一旦脫離現實就沒意義。

但這件事情非常難,因為我們從小就是在取樣偏差(自己的經驗)中長大。

每個人都覺得自己的常識才是常識。

每個人都覺得自己的直覺才是直覺。

每個人都覺得自己心中的世界才是真實世界。

但每個人的生活經驗與直覺又都有所差異,不可能所有人都是對的。

只能透過不斷觀察、蒐集資料、反問自己、修正對世界的認知來彌補。

4. 實踐在生活中

我自己常在看完文章之後,馬上把自己覺得不對勁的部份筆記下來。

這裡有幾篇寫過的例子:

譬如看到大家都很窮的數字時,不是只跟著結論說「對!根本都存不到錢!」;也不是說「他們都太會花了,都是月光族!」

而是看到這些消費數字的意義,試著理解並推敲來龍去脈、找到行為背後真正代表的問題(雖然我這樣推論不一定就是對的)。

譬如有人拿消費者物價指數算出一個不合理的薪水時,可以在理解CPI的定義之後,知道這樣的算法與現實脫鉤。

譬如看到台積電新人年薪148萬的新聞,可以查資料推算出前三年平均約110萬,第一年甚至只有80萬。

再加上高分紅有其對應的「延遲性」與「無保障性」,進一步折扣出更真實的年收入。

5. 最後,不斷思考,才不會被資訊垃圾淹沒

我們生在「垃圾資訊」洪流,每個人都擁有比以前更強的搜尋能力,有能力知道更多事情。但也因此必須自己主動篩選,或被動讓別人替我們篩選,隨時檢視這些資料來源與推論是否正確,就像隨時關心你我吃的食物從哪裡來一樣重要。

參考資料

<How to Avoid Being Deceived By Data>

這篇比較偏統計與資料科學,給專業的研究者看,這裡大致摘要出六個重點:

  • 隨時保持懷疑
  • 一定要確認樣本
  • 「相關」不等於「因果」
  • 「後此謬誤」與其他說故事的方法
  • 「平均」會說謊
  • 注意視覺化方法的把戲
《數位時代》長期徵稿,針對時事科技議題,需要您的獨特觀點,歡迎各類專業人士來稿一起交流。投稿請寄edit@bnext.com.tw,文長至少800字,請附上個人100字內簡介,文章若採用將經編輯潤飾,如需改標會與您討論。

(觀點文章呈現多元意見,不代表《數位時代》的立場。)

往下滑看下一篇文章
AI NAS 何時才值得部署?QNAP 拆解地端 AI 的成本、算力與資料門檻
AI NAS 何時才值得部署?QNAP 拆解地端 AI 的成本、算力與資料門檻

當資料不能離開企業,運算就得靠近:AI 先改寫儲存架構

AI 帶來的第一個變化,不只是運算能力提高,而是企業必須重新決定資料放在哪裡。

儲存架構大致分為雲端與地端兩塊,QNAP 身為資料安全的守護者,長期發展的是地端網路儲存設備(NAS),並擴展至 25GbE、100GbE 高速網路交換器產品線,提供完整的儲存與高速網路基礎架構。威聯通科技(QNAP)總經理劉文義解釋,當資料因合規要求或敏感度不能上雲,就必須留在靠近使用者與應用的地方;運算需求一旦增加,承接資料的裝置也自然被推向地端 AI。

不能上雲的名單比想像中長。醫療業持有大量醫療個資,金融與保險業受到合規與法規限制,部分大學院校與設計公司也不希望資料被雲端存取。對這些組織而言,問題並不是雲端好不好用,而是一開始就沒有把核心資料全面上雲的選項。

qnap2.jpg
威聯通科技(QNAP)總經理暨威強電集團(IEI)董事長 劉文義
圖/ 數位時代

真正讓更多企業回頭計算的,則是長期成本。劉文義指出,資料上傳雲端可能免費,下載卻會按流量收費;當企業把一年、兩年、三年的費用加總回推,可能會發現,購買一台同等容量的 NAS,還能使用 7-10 年。資料規模愈大、存取愈頻繁,總持有成本的差距就愈值得評估。

這並不代表雲端與地端只能二選一。雲端仍適合模型訓練、程式開發與波動大的工作負載;地端則較適合高頻存取、對延遲敏感,或不能離開企業邊界的資料。企業真正要回答的,是每一類資料與任務應該放在哪裡。

依 QNAP 觀察,客戶過去關心的是需要幾 TB、幾 PB,或備份速度有多快;現在更常問的是,機器裡的資料要如何被 AI 活用。QNAP 也從 2021 年起,把公司發展定調在 AI 與高速網路的融合,試圖讓 NAS 從資料保存的位置,進一步成為資料被調用的位置。

當資料量持續擴大,搜尋與管理方式也會跟著改變。「在 NAS 裡放入 AI Agent 會越來越不可或缺。」劉文義舉例,當照片累積到 10 萬、20 萬張,要找出其中幾張特定畫面,已不可能只靠人工翻找。此時,能理解內容、接受自然語言指令的 AI 工具,會從加分功能逐漸變成必要條件。

從資料治理到地端推論:AI NAS 如何進入企業工作流?

AI NAS 不是「多了 AI 功能的 NAS」,而是 NAS 在企業工作流裡換了位置。
依 QNAP 觀察,目前客戶大致分布在一條導入光譜上。人數最多的一群,仍在把資料集中、分類、清理與建立權限。這一步看似與 AI 無關,卻決定後續系統能不能找到正確資料、辨識版本,並把答案交給有權限的人。

中間一群開始建置私有的檢索增強生成(RAG)知識庫。RAG 並不是重新訓練一個模型,而是在模型回答前,先從企業的 SOP、合約、法規或技術文件中取回相關內容,再產生附有來源依據的答案。QNAP 以 Qsirch 的語意搜尋能力協助建構這類應用,協助企業建立私有知識庫;而走在最前面的少數企業,則已經嘗試地端推論與 AI Agent。

模型的選擇權,QNAP 刻意留給客戶。知識庫背後採用哪一個模型,可由企業依需求決定,不綁定單一 AI 供應商。QNAP 也以 QuAgent AI 助理與模型情境協定(MCP)相關能力,讓管理者透過自然語言查詢狀態、調整設定,並讓 NAS 成為 AI Agent 可調用的資料節點。

不過,劉文義沒有把這條路說得太容易。他坦言,目前 NAS 硬體的 AI 運算能力仍有限。一般企業期待的應用,可能需要約 300 到 800 TOPS,甚至 1,000 TOPS,因此多數方案會以 NVIDIA 顯示卡補足算力;一張卡約需新台幣 10 萬至 12 萬元,一張算不完,就得配置 2 張或 4 張。

「整體成本可能是過去單獨一台 NAS 的 5 倍到 10 倍,並不是大部分中小企業都能接受。」除了硬體,使用者還需要 AI 應用的 Know-how、程式背景與開發資源,這些都是落地成本。

QNAP 則是透過算力分級讓各規模與需求的企業都可以有適合的解決方案。在 Computex 2026 搶先亮相的 QNAP AI NAS 中,一類是採用含有 iGPU 與專屬 NPU 的處理器平台,以一百多 TOPS 的範圍,可順暢使用 AI 應用程式;另一類機種則可安裝 1 張或 2 張 NVIDIA 顯示卡,處理更大的運算量。

同時 QNAP 也在軟體端也持續開發,目標是讓 NAS 裡的資料更有效率地被 AI 工具調用,讓資料成為有價值的知識。

從規格走到現場:能源公司如何導入私有 LLM?

本地 AI 實際落地部署會是什麼模樣?劉文義舉了一家約 50 多人的能源公司為例。這家公司原本想用 NAS 搭配雲端 AI 建置內部資料庫,但很快遇到兩個瓶頸:一是員工查詢時明顯出現卡頓;二是專利、技術與合約都高度敏感,高層不願上傳至公有雲,擔心機密資料會有外洩的疑慮。

後來,該公司導入 QNAP AI NAS 的旗艦機種 QAI-h1290FX,搭配顯示卡與全快閃 SSD,在地端部署私有大型語言模型,把數十年來封存的靜態檔案交給 AI 調用,進行跨檔案摘要與精準搜尋。員工因此省下翻找合約與報告的時間,核心機密也能留在企業內部。

這個案例說明,若任務範圍明確,有些應用不必動用雲端大型模型,地端運算量就可能足以支應。

但不同企業的資料量、查詢方式與模型大小不同,導入前仍需要概念驗證(POC)與技術人員評估。

而且,資料留在地端並不等於自動安全。企業仍要處理帳號權限、網路隔離、備份復原、漏洞修補與日常維運。地端的價值,是讓資料邊界與控制權回到企業手上;相對地,安全責任也會更直接地回到企業。

哪些企業現在該做,哪些再等?先看重複性與三個條件

能不能導入地端 AI,不只由產業標籤決定,也要看工作是否重複,以及場景能不能被清楚定義。劉文義觀察,第一批走進來的,除了受法規限制的醫療、金融與保險業,也包括利用地端 AI 加速資料處理的科技業,以及會計、律師等有大量重複文書工作的專業服務業,因為效益較容易被看見。

工廠也是可預期的場景。一條生產線可能有 10 台、20 台機器,每台處理與儲存資料的 Protocol 都不同,需要相對應的儲存裝置;生產過程累積的影像與紀錄可能要保存 3 年到 5 年。當企業要跨設備調用這些資料,AI Agent 與地端資料節點就有發揮空間。

「重複性資料處理越多,或重複性動作越多的產業,越容易透過導入 AI 提高工作效率。」反過來說,較傳統、人力密集,或仍高度依賴人工判斷的製造業,短期內未必能快速導入地端 AI。

依 QNAP 提供的資料,企業也可用「高頻、大量、敏感」三個條件做第一輪判斷:資料是否被頻繁調用?規模是否大到雲端傳輸與長期費用開始變得明顯?內容是否涉及個資、法規、智慧財產或商業機密?三個條件愈集中,地端部署愈值得評估;三者都不成立時,使用雲端 API 往往更簡單,也可能更划算。

可以先等的企業,大致也有三種。第一,資料仍分散、版本混亂、權限不清,急著上 AI 只會把混亂放大,先完成集中與治理,效率就可能先提升。第二,找不到一個具體且反覆發生的業務痛點,只因為「別人都在做」而採購,設備很可能變成昂貴的展示品。第三,使用量仍小、需求偶發,現階段雲端的彈性反而更有優勢。

因此,POC 不應只驗證「模型答不答得出來」,還要回答三個問題:資料由誰負責,誰可以存取?導入後能節省多少查找時間、傳輸成本或人工作業?正式上線後,誰負責資料、模型與資安維運?只有當效益與責任都能被量化,才適合從展示走向正式部署。

企業願意把部分資料留在自己的機房,動力最終仍回到資料主權。QNAP 的主要市場分布在歐洲、美洲與亞太,其中歐洲占比將近一半,而歐洲也正是全球推動資料主權的最大動力。

QNAP 的產品已取得 ISO 27001、ISO 27017 與 ISO 27018 等多項認證,並滿足 GDPR、HIPAA 等資料保護與法規遵循需求;累積至今,已售出約數百萬台裝置,協助企業打造智慧、安全的儲存方案。

至於普及時間點,劉文義提出一個明確的價格與效能交會點:地端應用若要順暢運作,運算量可能至少要達到 300 至 600 TOPS,甚至 800 TOPS,同時價格要落在新台幣 5 萬至 8 萬元。目前符合這些條件的硬體方案仍很有限。

qnap3.png
「AI NAS 不是多了 AI 功能,而是改寫了資料在工作流的位置。」威聯通科技總經理劉文義坦言,地端算力成本高昂,QNAP 透過「算力分級」與開放模型架構,助企業逐步建構私有 RAG 知識庫與 AI 團隊。
圖/ 數位時代

「預測約兩、三年後,應該很快會看到符合一般大眾期待、具備合理 CP 值的產品。那個時間點,就會是 AI 落地最蓬勃發展的時候。」在此之前,企業真正能先做的,不是搶著買最大的模型或最昂貴的顯示卡,而是把資料治理、使用權限與高價值場景準備好。

QNAP 以「資料煉油廠」比喻自己的角色:原油再多,沒有整理、提煉與配送的過程,也無法成為可用的能源。這個定位也點出地端 AI 的競賽條件——不是誰先買到算力,而是誰的資料先準備好被調用。模型會持續更換,但企業自己的資料層則會長期存在。

AI NAS 不是把模型塞進儲存設備,而是在資料必須留在企業內時,讓搜尋、推論與管理靠近資料的地端節點。

QNAP World Tour 2026 台北場將於 2026 年 9 月 18 日(五)舉行,現場將聚焦 AI 應用、儲存備份、網通產品、資安與監控,並安排 Live Demo,適合 IT 管理者、系統整合商與企業決策者參加。

活動地點:新板希爾頓酒店|如意 AB 廳

活動時間:09:20–16:00

地址:新北市板橋區民權路 88 號 2F

立即報名:https://bnex.tw/9f7my4

2026 QNAP 台灣企業資安韌性大調查,填問券抽好禮,倒數計時:https://www.surveycake.com/s/q4abw

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓