【黑貘來說】 挖掘巨量資料的秘密步驟
【黑貘來說】 挖掘巨量資料的秘密步驟
2013.03.26 | 創業

現在已經有太多的報導說某某公司利用使用者的行為記錄,來算出每一個人的喜好,並且導出商機等等新聞到處可見,但我相信大家看再多次,不是覺得這樣會不會太可怕了?不然就是這好厲害阿!這兩種答案,不然就是兩種都有。

但事實上這件事並不神奇或可怕,會覺得這樣是因為大部份的人不知道怎麼做,或者是說這能夠做甚麼,若是你知道後,發現這跟本只是個套來套去經過計算的結果,甚至在某方面你用手來算都可以,只是不一樣的是人只能處理少量資料,而電腦可以處理巨量資料,當很多事情會有量變產生質變的時候,威力就在此顯現,但這些步驟,說穿了一點都不聰明,甚至還非常的機械化的制式。

當然我不是很好的深入淺出的作者,所以沒辦法寫給大多數的讀者看,而是寫給已經有一點實務經驗的人,尤其是程式設計師或資料庫管理師等工程師,但若沒有這技術背景,我相信做這樣的拆解,可以讓大家從一知半解變成知道個大概,而透過這樣的了解,讓大家有機會去應用是我寫這幾篇的目的。

只是還有一個前提,就是我不會在這邊寫資料探勘的基礎,也就是說,「請先去看本資料探勘的書」,再來看下面幾篇文章吧。

目標:能夠知道某個特定人喜歡甚麼東西,購買每一個商品的機率,或者是說我們該如何推薦商品給他,以及知道他喜歡這商品的原因?

人與商品之間的行為有下面幾種:

  1. 瀏灠
  2. 放入清單
  3. 購買
  4. 評價或評論
  5. 其他

    上面每一種行為都有其數量化的差異,有些是一年幾次,幾十次或到幾百次或更多,而每一個行為都可能有個 「權重 (Weight)」,以及時間 (Time) 與次數 (Times) 的屬性,甚至更有可能是一個 Vector (向量) 的指標,例如喜好、觀感等等,無論是可以量化或不能量化,這些都可以成為建立人與商品的「關連」。

    所有的資料探勘系統實作都是從這些資料做轉化,甚至是簡化,畢竟可以運算,以及算得出結果才是重點,甚至是能夠算給所有消費者顧客使用才是資料探勘的精隨。

    但有趣的事是很多實用的系統都很少是用單一方法去建構出來的,畢竟除了人的行為之外,商品有有幾個屬性:

  6. 商品本質、內容

  7. 商品描述 (meta-data) 與分類
  8. 最後才是商品的使用

    在還沒有 Semantic Web 之前, 我們能用的就是商品的使用,也就是我們使用者/消費者與商品/物品之間的關係,而在有了語意網路之後,我們就可以進一步的處理本質 (文化商品) 與描述了,只是在這之前還要有幾個前置作業。

  9. 會自動化新增關鍵字詞的表

  10. 會自動化連結出語意網路的表

    這兩個表若是可以扣掉前面「會自動化新增/連結」 的話,我相信很多人都有從很多單位去取得這樣的詞庫與關連庫,但在實務上我們有絕大部份的狀況都是在處理運算最新的商品或議題時,沒有一種機制能夠新增或更新的話,幾乎是不實用的。

    只是這新增/更新有時不見得是自動化,因為自動化是件相當困難的事,就我所知有不少在做這項業務的公司單位,用的就是「工人智慧」,而不是人工智慧,但無論如何,有了這兩個表之後,再加上從資料探勘能夠得知的:

  11. 關連分析 (一階, 或高階)

  12. 群落分析 (Clustering)
  13. 時間序列預測

    有了上面三個很基本的工具後,可以配合產出很多的可能性:

  14. 最常見的關連購買

  15. 在搜尋結果中做排序
  16. 從分類結果做語意分析產出因子
  17. 有了高階的關連分析可以透過配對做活動
  18. 從銷售預測中作備品或庫存準備
  19. 只要你想得到的

    當然上面說得很簡單,好像是三兩天就可以開發出來的東西,但事實上單單一個「會自動化連結出語意網路的表」,我記得當時就弄了兩三個月才弄出來,當然現在再弄一次就只須要兩三天到兩三個星期了,畢竟有經驗跟沒有經驗還是差很多的。

    記得我在 5 年多前寫過 Data Mining 是一個須要跟效率挑戰的高度技術的事,但現在的機器已經比 5 年前快 5 倍了,加上資料庫的多樣性,雲端系統的完善,讓寫這樣的系統跟之前簡單不只 5 倍,我在兩個月以前自己從無到有又自己跑一次,以前須要半年的現在只要半個多月就夠了,想想時代還真可怕阿。

    所以說,在這樣成熟的時機而言,導入真正的巨量資料探勘已經不是預算的問題,也不是技術的問題,而是心態的問題了,你準備好了嗎?

轉自[黑貘來說](http://gene.speaking.tw/2013/03/blog-post_20.html)
關鍵字: #大數據
往下滑看下一篇文章
AI 競爭全新戰場!美光 Mike Cordano:記憶體將成下一個企業戰略制高點
AI 競爭全新戰場!美光 Mike Cordano:記憶體將成下一個企業戰略制高點

從生成式AI訓練、推論,到代理式工作流程(Agentic Workflow)與未來的實體AI,資料流量正以指數級成長,讓記憶體從過去支援運算的配角躍升為決定AI效能與能源效率的關鍵角色。

全球知名的半導體與微電子技術分析機構TechInsights指出,AI競爭正逐漸從晶片算力擴展到記憶體架構設計能力,加速「Computational Memory」等新架構興起;在這波浪潮中,深耕記憶體與儲存技術數十年的美光科技,正與關鍵夥伴展開深度協同設計,包含攜手NVIDIA共同開發適用於新世代資料中心的低功耗記憶體技術,在AI基礎建設的新賽局中成為不可或缺的關鍵。

當GPU不再是唯一主角,記憶體為何躍上AI舞台中央?

過去,半導體的焦點多圍繞在晶片,例如CPU、GPU跟AI加速器等,市場普遍認為,晶片運算能力是左右科技產業發展速度的關鍵,但在進入生成式AI世代後,產業逐漸發現另一個事實:真正限制AI效能的瓶頸不是運算,而是資料能否快速被存取與傳輸。

從大型語言模型訓練,到AI推論、代理式工作流程(Agentic Workflow),甚至未來的機器人與自駕車,龐大的資料流量正持續推升對高頻寬、低延遲、高容量記憶體的需求,讓記憶體產業從過去相對標準化、以價格競爭為主的市場,逐漸轉變為AI基礎建設的重要核心。

「仔細觀察AI應用服務會發現,大多數工作負載都被頻寬限制。」美光科技全球業務執行副總裁Mike Cordano認為,記憶體是突破(頻寬)瓶頸的關鍵,也讓AI競賽從晶片算力升級到記憶體與儲存架構的系統級競爭。這樣的產業洞察,也正是Mike在歷經二十餘年的儲存產業資歷,加上四年半的創投生涯後,選擇加入美光的核心原因之一:在AI重塑產業結構的浪潮下,記憶體將成為這波成長最直接的動能所在。

美光 x 數位時代
美光科技全球業務執行副總裁 Mike Cordano
圖/ 數位時代

從零組件供應商到策略夥伴,記憶體共創時代來臨

AI的崛起,正在改變記憶體廠商與客戶的關係。

過去,記憶體產品多是標準化元件,客戶關注的是價格、供貨與規格;合作模式也偏向短期採購與交易導向。然而隨著AI系統規模愈來愈大,從資料中心、雲端平台到終端裝置,記憶體已經成為決定系統效能的重要關鍵,也因如此,越來越多企業將記憶體視為「策略性資產」,而非單純零組件。

Mike表示:「現在,我們跟客戶合作的時間跨度改變了,在產品正式上市前三到四年便開始合作,從系統架構階段就共同規劃未來需求。」例如,美光科技與NVIDIA共同研發的資料中心所使用的低功耗記憶體,便是雙方提前多年展開深度合作(co-design)的成果。

值得特別注意的是,美光科技除從技術層面與晶片製造商等夥伴共創產品,也在需求層面與客戶進行密切合作,例如,將過去較無約束力、期限僅一年的長期協議(LTA)轉變成為期五年、條款更具約束力的策略性客戶協議(SCA),藉此掌握客戶的未來需求,進而在技術層面做更深度的合作。Mike坦言,深度協同設計是高成本的投入,美光的做法是先廣泛進行市場感知,理解不同場域的需求方向,再與生態系統中的夥伴們展開客製化合作。

從裝置導向轉為Token導向,AI浪潮重寫記憶體成長模式

除了合作模式改變,更大的典範轉移是需求的改變。

Mike解釋,過去記憶體需求跟PC、手機跟伺服器出貨量息息相關,但在AI新世代,推動記憶體需求成長的核心不再是設備數量,而是AI模型所產生的運算與資料消耗量。「AI產業逐漸走向以『Consumption』或『Token』為主的新經濟模式,每一次的模型運算都需要消耗大量的記憶體跟儲存資源,這意味著,即使設備銷量成長趨緩,記憶體需求仍可能持續上升。」

更重要的是,AI應用正從資料中心外擴至手機、PC、自駕車與機器人等場域,儘管不同場域對記憶體的需求不盡相同,但是,Mike認為:所有AI裝置都存在三項共同需求:更快的速度、更大的容量,以及更高的能源效率。

正如Mike在受訪時提到的:「我們最大的挑戰,是如何與客戶和整個生態系保持高度一致,一方面創造供給與產能,另一方面持續推動技術創新。」可以預期,在接下來的五年,記憶體產業面臨的挑戰不僅僅是擴展產能,而是如何與客戶共同規劃需求、同步投入技術創新,而這也是美光科技積極經營AI生態體系的原因。

總的來說,AI帶來的改變,不只是算力提升,而是重新定義整個運算架構:過去,記憶體被視為支援運算的基礎元件;現在,則是決定AI效能、能源效率與創新速度的關鍵資源;當產業競爭從晶片性能延伸到資料流動效率,從裝置數量轉向Token消耗量,記憶體的重要性也將隨之水漲船高,對美光科技來說,這將是其從供應商走向AI生態系核心夥伴的關鍵角色轉變。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
代理式商務連動百兆商機
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓