訓練AI模型,要多少數據?拆解企業人工智慧專案為何難落地
訓練AI模型,要多少數據?拆解企業人工智慧專案為何難落地

企業的AI專案在釐清問題本質、找到命題之後,首先會面臨到一個問題:收集數據(Data Collection)和建立AI模型(Model Establishing),該以什麼作為評估基準?

AI模型
圖/ 若水國際

訓練一個AI數據模型,需要多少數據?

訓練AI數據模型時,其實有三個要素,彼此互相影響。分別是: 商業問題的複雜度AI模型複雜度 (Model Complexity),以及 數據複雜度 (Data Complexity)。

因此,如果想知道需要多少訓練數據(Training Data),建議先釐清:這個AI專案到底要處理什麼問題,以及這個問題有多複雜?確定之後,再來判斷應該選用哪種程度的模型來做訓練。根據不同的商業命題複雜度,用不同複雜度的模型和精準數據彼此搭配,找出最佳平衡,才能讓AI專案順利落地。

但光憑想像,很難評估實際的AI數據量和成效,所以開始AI的第一步,需要先透過POC概念驗證(Proof of Concept)實驗來找答案。

AI模型
圖/ 截圖自YouTube

AI模型的POC概念驗證實驗怎麼做?

簡單來說,就是針對不同複雜程度的商業問題,嘗試選用不同複雜度的模型搭配測試,直到模型跑出來的曲線,符合理想目標。

一般狀態下,假設商業問題本身的複雜度很高,我們會預期要選擇複雜度較高的模型。但是如果數據量不足,那麼選擇複雜度較高的AI模型,反而會比用簡單的AI模型效果還差。(上圖左上、右上,分別代表複雜度10和複雜度50的問題,可以明顯看出複雜的模型曲線比較接近學習數據集(Dataset),但是在測試數據集上的誤差 Eout,反而比簡單模型還差了許多。)

上圖的左下和右下,是以不同複雜度的模型去做POC,跑出來的結果曲線圖。藍色線代表的是學習數據(Training Data)成效,紅色線代表的是測試數據(Testing Data)成效。最理想的POC目標,應該是兩條曲線很貼近彼此,而且位置越低越好。

我們會發現,左下這張圖的兩條曲線雖然彼此貼近,但是就算增加數據,也無法降低誤差。這表示模型偏誤(Bias)高,效果不佳,應該要增加模型複雜度 (Model Complexity)。

增加模型複雜度之後,就會像右下這張圖,藍色曲線(學習數據)雖然數值很低,但在學習數據不足的情況下(灰色區塊),紅色曲線(測試數據)卻「飄」得太高。這表示模型變異誤差(Variance)高,應該要增加學習數據。最後在慢慢增加模型複雜度以及學習數據之後,我們就可以達到理想的結果(兩條曲線很貼近彼此,而且位置越低越好)。

數據哪裡來?發展AI人工智慧之前,先建立數據流

先前我在文章裡提到,很多企業會急著開發AI模型,但AI專案落地經驗的三大關鍵之一,其實是先確認:是否已經準備好數據了?如果沒有這樣的能力,談AI落地其實有點好高騖遠。

軟體人才_軟體開發設計_軟體工程師_(來源shutterstock)_401334640.jpg
圖/ shutterstock

AI數據收集(Data Collection)最大的挑戰,在於針對不同型態的命題,會產生不同的AI數據需求,因此需要建立的「數據流」(Data Pipeline),AI數據處理 (Data Processing)和數據標註(Data Annotation)的模式及流程也會有所不同。

發展AI之前,如果能建立起從數據收集(Data Collection)、數據處理(Data Processing)到AI模型學習的數據流(Data Pipeline),並確保可以順暢運行,實際訓練AI模型時才會省力很多。

數據不夠或太多怎麼辦?

Google開設的機器學習(Machine Learning)課程中,第一項原則就開宗明義地指出:「Don’t be afraid to launch a product without machine learning」。

如果你的產品或業務不一定需要用到機器學習(Machine Learning),那就別用,除非你有AI數據。有數據,再來談機器學習(Machine Learning)。但在業界的實際狀況,大家不是沒有數據,而是只有一些些,這時候該怎麼辦?我會建議,先從小地方開始做起,也就是從POC專案著手。

POC專案要有具體成效,除了要注意設計專案、實驗模型的指標(Metrics),企業最重要的是要先定義清楚:AI專案要達到什麼樣的指標,才算是成功?這樣最後做出來的成果,才會真正符合商業目標。

如果今天不是沒有AI數據,而是數據很多,又該從何下手呢?

我建議,嘗試減少訓練AI人工智慧時的「 數據大小 」和「 數據筆數 」。

過去曾經處理過一個AI專案,數據多達2億筆。第一次實驗,把數據全部餵進AI模型,取得結果。第二次,只拿其中有代表性的500萬筆出來訓練人工智慧。

猜猜結果如何?兩次實驗的表現,只差異不到1%。

所以,如果企業對於AI數據的品質和數量有一定程度的自信根據,其實不用把數據全部餵進AI模型訓練(Model Training),只用有代表性的AI數據來訓練就可以了。市面上很多常見的AI工具(Cluster),可以做到這點,幫助省時省力。

AI模型訓練,記得校準商業目標

企業發展AI人工智慧的最終目的,還是希望能 達到商業目標,創造價值

所以,訓練AI模型時,團隊如果不知道如何判斷哪個指標,對AI模型學習來說比較重要,建議回歸初心,重新釐清「 這個專案想達到的商業目標是什麼 」。

比方,趨勢科技(Trend Micro)要開發一個能夠判斷電腦病毒的AI,但是勒索病毒(denial-of-access attack)和廣告病毒對客戶的傷害程度大不相同。這時候,工程師就會針對這個命題,餵給AI模型不同病毒種類的數據,讓它學會判斷不同病毒的重要性,分辨出哪些病毒比較嚴重不能有判斷錯誤,而哪些病毒比較無害,不一定要做到一百分。

創業困境_突破難關障礙_overcome_shutterstock_521271766.jpg
圖/ shutterstock

最常見的訓練方法,是用成本函數(Cost Function)的方式,訓練完再回去調整AI模型的評分(Rating),用加扣分的方式,告訴機器它的學習表現是好是壞,做對就加分,做錯就扣分。

上述評分原則的制定,和企業的商業價值考量息息相關,所以一般在組織分工,會由PM專案團隊負責判斷哪些項目重要,請資料科學家設計在上述Cost Function裡面。

很多人以為,AI人工智慧開發要做到很完美才行,但其實根據我們的經驗,只要AI開發成本符合預算、AI模型表現可接受(大約做到60–70分),而且結果有助於降低成本,就可以算是達到商業目標。反過來,即使AI模型表現非常好(高達90分),但成本卻遠超出預算,就不建議執行。

另外,因為POC階段會做很多的實驗,需要拿兩個穩定且可以互相比較的基準做A/B Test,所以做好基礎建設非常重要。

如果一個團隊裡面有三位工程師,但三個人做出來的結果都無法互相比較,那麼這個實驗就會變得霧裡看花,導致AI專案難以落地。

AI數據小學堂:模型指標(metrics)

在做模型實驗時,通常會用混淆矩陣(Confusion Matrix)的四種指標:TP(True Positive)、TN(True Negative)、FP(False Positive)、FN(False Negative),以及Count、Unique和Accuracy等等函數,來判斷這個模型的表現好不好。

P或TN值,代表模型辨識的答案正確,和預期結果一致。例如:模型正確判斷出「這是一隻貓」、「這不是一隻貓」。而FP或FN值,則代表模型的判斷錯誤,例如「明明是貓,模型卻說不是貓」、「明明不是貓,模型卻說它是貓」。

責任編輯:文潔琳、蕭閔云
本文授權轉載自:若水AI數據處理實戰攻略

往下滑看下一篇文章
從第一天就走向全球!MOOIMOM、大研生醫、特力集團借力亞馬遜出海,以創新、信任打造品牌護城河
從第一天就走向全球!MOOIMOM、大研生醫、特力集團借力亞馬遜出海,以創新、信任打造品牌護城河

在全球「消費升級」的時代,現今消費者要找的,不是最便宜、CP 值最高的產品,而是更安全、更值得信任、更符合需求的商品。在此趨勢下,台灣品牌的優勢反而被放大。

事實上,憑藉著深厚的製造底蘊、對品質的堅持,許多來自台灣的品牌,正透過精準的「價值創新」研發,以及「安全信任」的品牌經營,在亞馬遜上,擄獲各國消費者的青睞。

拒絕等待完美,MOOIMOM 透過出海、迭代快速進化

新創母嬰品牌 MOOIMOM 自 2016 年創立起,便瞄準全球市場,MOOIMOM 創辦人周靖棠指出,近年來,台灣新生兒人數持續下滑,若一開始就只做台灣市場,花去的時間、開發成本都無法撐起未來的成長性,「所以我們第一天就決定『Go Gloabl』,這對新創非常重要。」

AWS-2.png
新創品牌MOOIMOM瞄準母嬰市場,有鑒於台灣新生人口持續負成長,從2016年創立的第一天,創辦人周靖棠就決定Go Gloabl,決心用優質產品,挑戰更大的市場。
圖/ MOOIMOM

MOOIMOM 是從印尼市場起家,再逐步拓展回台灣,但周靖棠隨即又意識到,若「Go Global」僅在東南亞、台灣,仍然有侷限,於是 MOOIMOM 決定加入亞馬遜,跨出亞洲、進軍澳洲等市場,「MOOIMOM 需要一個已經有高信賴度、強大物流、精準數據的夥伴,協助我們降低跨足北美、澳洲等市場的門檻。」

AWS-3
MOOIMOM創辦人周靖棠、共同創辦人李沆澎及團隊,透過運用亞馬遜數據與工具,以最真實的消費者反饋,反覆打磨產品。
圖/ MOOIMOM

為了找到市場缺口、實踐價值創新,MOOIMOM 積極運用亞馬遜上的數據與賣家工具。相較於其他品牌可能會注意自家產品有多少五顆星的評價,周靖棠尤其重視「四顆星」的留言,「因為那往往是能不能從『好』做到『更好』的關鍵。」以 MOOIMOM 的「涼感產後束腹帶」為例,團隊透過評論,發現邊緣縫線會造成皮膚的些微摩擦,加上產婦穿不住悶熱的材質,於是,MOOIMOM 花了近兩年時間,參考亞馬遜後台數據,包括消費者留言、競品的包裝顏色、排名落差等資訊,將產品從 1.0 迭代至 3.0 版本,不僅改採涼感透氣材質,更做到無縫線的舒適感。周靖棠透露,1.0 版的束腹帶,原先一週賣不到 1000 美元,但發展至 3.0 時,除了評價穩定保持在 4.3 顆星以上,一週甚至可以達到1萬美元的營業額,等於成長十倍。

AWS-4.png
圖/ MOOIMOM
AWS-5.png
產後束腹帶三代迭代圖,不僅涼感透氣,更做到無縫線的舒適體驗,讓產後媽媽可以穿得住,真正達到束腹的效果。
圖/ MOOIMOM

另外,周靖棠也善用亞馬遜的「A+ Content」等工具,將「永續」元素植入 MOOIMOM。由於澳洲對環保、安全規範的要求,向來以嚴格聞名,對於跨境電商無法「觸摸實品」的鴻溝,團隊便運用 A+ Content,在產品頁面中將小麥桿融合PP材質等無毒認證和安全細節,讓消費者一目瞭然。針對各國嚴格的母嬰用品法規,團隊也在亞馬遜協助下,一一完成合規程序,把出海阻礙轉化為讓消費者安心買單的保證。

科學實證敲開日本大門,大研生醫靠極致細節贏得信任

以德國頂級魚油、視易適葉黃素等產品聞名的大研生醫,起初是為了自己和家人的保健需求創立,在台灣取得佳績後,大研決定將這份堅持帶向世界。而出海的首站,是保健食品發展逾百年、相當競爭的日本市場。

AWS-6.jpg
大研生醫出海首站就挑戰保健食品發展逾百年、相當競爭的日本市場,大研生醫董事長林東慶表示,進入日本市場真的很辛苦,但當收到日本消費者正向的回饋時,對團隊帶來很大的鼓舞。
圖/ 數位時代

大研生醫董事長林東慶解釋,先選擇日本,是因為當地消費者偏好網購、多居住於公寓,購物習慣、商業環境和台灣相近。至於決定透過亞馬遜進軍日本,一方面出於亞馬遜是日本使用率最高的電商網站之一。其次,在日本市場想「從 0 到 1」發展不易,溝通成本高,「但亞馬遜上的消費者,都很願意接受新東西。代表我們更容易在上面找到對的人。」

林東慶特別提到,日本保健食品市場歷史悠久,卻並非完全沒有切入機會。例如:日本延續過往經驗,原料進展未必跟上時代需求,市面的魚油濃度普遍都不足。除了端出創新的產品之外,想進入相對成熟的日本保健品市場,安全有效、建立信任是唯一真理,「大研經營的正是『信任』,信任背後代表了你的產品、服務和品牌。而亞馬遜就是過程中的最強後盾。」

大研透過亞馬遜的後台數據,從消費習慣與市場需求兩個面向,深入了解日本市場。例如,日本消費者偏好小顆粒、一天可服用多顆保健品;另一方面,日本社會因工作壓力大,助眠、舒緩情緒等產品需求也持續成長。團隊再搭配「在地製造、世界原料」的策略,讓「Made in Japan」成為敲門磚,「就和在台灣帶起『高濃度魚油』的風潮一樣,我們以國際頂級專利原料、強大的科學實證及嚴格的產品檢驗,帶起新趨勢。」

大研甚至將細節延伸至包裝、服務。比方說,日本家戶的信箱尺寸偏小,大研的包裝設計,便要確保能順利投遞進信箱;消費者認為用紙盒包裝更安全,大研也從善如流,採精緻紙盒而非美國市場的簡約瓶裝。由於在每個環節都做到極致,大研才進軍日本亞馬遜半年,就奪下 Omega-3 魚油類目排名第一,整體 BSR 也達到 1000 至 1200 名以內。

接下來,大研計劃進軍極度重視天然與健康的澳洲市場,以及競爭激烈的美國市場,林東慶強調,大研期望透過亞馬遜,將對品質的堅持帶出台灣,成為具影響力的全球品牌。

AWS-7.jpg
大研生醫因應不同市場消費習慣,推出日本、美國、台灣三種版本魚油產品,同樣訴求高濃度、高品質。不僅在生產上呼應其「在地製造、世界原料」的全球化策略,更配合當地市場習慣,量身定做外包裝規劃,左:日本版、中:美國版、右:台灣版德國頂級魚油)
圖/ 數位時代

跳脫傳統代工宿命,特力集團用數據算出市場需求

擁有 30 年歷史的特力集團,從傳統 B2B 貿易起家,如今再下一城、攻入跨境電商市場,在亞馬遜上的營收,每月穩定達到美元六位數。這背後,是一場為了解決傳統代工痛點發起的 DNA 轉型。

特力集團業務總監 Isaac Liao 指出,傳統 B2B 貿易是特力深厚且穩固的根基,但為了在全球供應鏈重組的變局中更具敏捷度,特力必須打破過去與終端市場之間的隔紗。但中上游企業打下游 B2C 戰局,最怕盲目下注或因為怕虧損而不敢試錯。特力的心法,是建立一個「基於數據的科學容錯機制」,把亞馬遜當成全球導航儀,大膽做小規模的市場實驗,算準了、看清了再重注出擊。

AWS-8
特力集團業務總監 Isaac Liao(左三)分享:特力發揮多軌營運優勢,結合在地團隊實體佈局與供應鏈韌性,打造品牌護城河。
圖/ 特力集團

Isaac 透露,特力在歐美家居市場突圍的關鍵,在於用「數據」找出消費者的痛點,再據此創新產品,「中上游企業常覺得自家產品無敵,怎麼會賣不好?但在電商戰場,消費者沒搜那個關鍵字,產品再好都等於不存在。」特力是用亞馬遜的商機探測器、品牌分析工具,抓出高需求、低競爭的藍海市場,並將自家產品、競品的負評,作為研發參考。例如團隊抽絲剝繭後,發現消費者通常在購買資源回收桶時,最痛恨「異味洩漏」和「腳踏板易壞」;買烤肉推車時,則有「說明書看不懂」、「組裝太複雜」等痛點。團隊會再據此回頭改良製程、產品,並將行銷時,將這些痛點的「解方」直接放大在亞馬遜的產品頁面 A+ Content 和主圖影片中。

AWS-9
結合質感美學與實用功能,特力熱銷居家產品主打極窄隙縫省空間設計(左)與質感靜音緩降上蓋(右),精準切中消費者痛點。
圖/ 特力集團

Isaac 特別提到,近期特力導入了亞馬遜行銷雲(Amazon Marketing Cloud, AMC),拆解完整的消費旅程。以特力在亞馬遜熱銷的烤肉推車為例,透過 AMC 的底層數據藍圖,團隊發現歐洲消費者從心動到行動平均需要三週。消費者可能在第一週看球賽時,先被特力的品牌影片廣告(DSP)吸引;第二週滑亞馬遜時,看到展示型廣告(SD)被再次提醒;直到第三週週末要辦派對了,才在搜尋框輸入關鍵字並透過商品廣告(SP)下單結帳,「AMC 讓我們看清這條跨渠道的『消費旅程藍圖』,把過去盲目砸廣告的焦慮,變成每分錢都能精算回報率的高精準 ROI 投資。」

特力已立下月營收達七位數美元的新目標。Isaac 透露,團隊正積極布局生成式引擎優化(GEO)等最新 AI 搜尋趨勢,並根據亞馬遜的後台數據,延伸家居周邊產品線,期望推動內部從「製造思維」進化為「市場和品牌思維」,讓台灣深厚的製造底蘊,能在國際零售舞台上走得更深、更遠。

在迎戰「消費升級」的此刻,台灣企業從來不缺好技術,缺的是直面終端市場的勇氣與機會。而亞馬遜提供的,不只是一套銷售工具,而是一套完整的「持續創新」能力——從全球物流、在地合規,到消費者洞察與數據分析,讓品牌得以直接理解世界各地消費者的真實需求。透過這套基礎設施,品牌能在國際市場中「快速測試、快速修正、快速成長」,把每一次迭代都變成站穩腳步的養分。台灣品牌只要願意邁出第一步,再借力亞馬遜的全球能力,勢必能在世界舞台走得更穩、更遠,實踐「Go Global From Day One」的布局。

想要挑戰跨境,讓更多人認識你的產品嗎?
立即報名 Taiwan Select Day

圖/ Amazon

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
代理式商務連動百兆商機
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓