要讓AI看穿人類行為,Google讓人工智慧看了超過50萬支YouTube影片
要讓AI看穿人類行為,Google讓人工智慧看了超過50萬支YouTube影片

在近期研究項目中,Google開始藉由旗下YouTube影片內容讓人工智慧開始學習人類自然互動間所產生肢體動作,藉此理解人類自然互動行為模式。

根據Google方面表示,藉由名為AVA(atomic visual actions)的原子視覺化動作數據學習模式,讓人工智慧系統能進一步學習、理解人類自然互動中所呈現動作行為,例如行走、擁抱或握手時所產生自然動作表現。

而數據取樣來源則是以YouTube收錄大量影片內容為主,並且逐一擷取有人類互動行為的15分鐘片段,在進一步將15分鐘影片長度均分為300組不重複的3秒長度片段,同時將影片中人類互動行為模式各下註記,標示每一種互動行為所代表含意,進而讓人工智慧進行深度學習。

目前在AVA數據資料中,已將互動行為區分為姿勢或移動時的動作表現、人與物品互動行為,以及人與人互動行為三大類型,其中再區分不同細節表現,總計在超過57萬組影片內容註記約9萬6,000組人類行為動作。

為了避免不同地區文化、種族行為差異造成資料誤判,Google在AVA數據資料也加入不同地區、不同類型的YouTube影片內容,藉此確保全人類行為判斷結果的一致性,例如避免產生在認定西方國家常以擁抱作為親密互動,卻因此認為亞洲國家較無親密互動的情況發生。

AVA數據研究目的,主要是為了讓人工智慧更能理解人類互動行為,藉此提昇行為預測能力,進而可用於內容判斷等動態影片分析應用,例如監視系統、內容推薦,或是廣告媒合推薦等。類似應用,先前NVIDIA也曾借助顯示卡運算加速模式打造影片內容分析功能,而先前台灣新創團隊創意引晴(Viscovery)也透過視覺分析方式協助影片內容服務廠商優化廣告系統。

延伸閱讀:連騰訊都採用的影像辨識技術,創意引晴闖中國:我們存活下來了

進一步讓人工智慧學習人類互動模式,預期將可讓電腦系統更容易自主判斷,進而可透過電腦視覺方式即時認知人類預期發生行為模式,並且做出更快反應或互動行為,例如未來發展社交機器人的過程,將可讓機器人以更自然方式與人互動。

現階段的人工智慧系統已經能將靜態影像內容進行相當準確的情境描述與認知,例如目前已經能將照片中的狗跟貓做具體區隔,但在動態影片內容分析仍有進步空間,即便現行技術已經能在動態影片中分析尋找相同人物,或是追蹤特定人物在影片中的行進方向,並且與多組影片行進方向做串接,卻仍無法完整分析影片中的複雜動態行為,因此Google此次藉由AVA數據分析學習人類互動模式,主要就是為了讓人工智慧系統能更理解人類自然互動行為。

本文授權轉載自:Mashdigi

往下滑看下一篇文章
把老師傅經驗變成 AI!智穎智能讓射出機從「導航」走向「自駕」,桃園如何助攻技術落地?
把老師傅經驗變成 AI!智穎智能讓射出機從「導航」走向「自駕」,桃園如何助攻技術落地?

曾是台灣製造業重要根基的塑膠射出產業,如今正面臨人才斷層危機。尤其桃園聚集大量工業區與製造業者,老師傅退休、新人才接不上的現況,更是許多工廠正在面對的現實難題。

從汽車零組件、網通設備、醫療器材到半導體載具,許多產品都離不開射出成型。智穎智能創辦人暨執行長張詠翔指出,全球塑膠射出市場規模超過 3000 億美元,每年仍以約 3% 至 4% 的幅度成長。需求並未消失,只是製造基地從台灣、中國逐步往東南亞等地移動。但機器可以搬、訂單可以轉,老師傅數十年累積的經驗卻很難複製。

這道人才缺口,正是 2020 年成立的智穎智能切入市場的機會。團隊從桃園中原大學的研究能量出發,歷經近十年研究與工廠驗證,嘗試把老師傅腦中的射出經驗,轉化成可以計算、保存與持續學習的 AI 模型,解決產業第一線面對到的挑戰。

把老師傅經驗交給 AI,射出成型從「導航」走向「自駕」

「餐廳沒有廚師是不行的。有再好的設備,不會做的人還是會把它做失敗。」張詠翔如此比喻射出成型的技術門檻。當模具完成後,生產現場仍得依產品、材料與機台特性,調整溫度、速度、壓力、位置等條件;即使使用同一種塑料,不同產品的調整方式也可能完全不同。

而老師傅的珍貴之處,不只是記住參數,而是知道面對材料、機台與環境變化時如何修正。智穎智能要做的,就是把這些難以傳承的「火候」拆解成可以運算的製程邏輯。目前其 AI 解決方案已應用於超過 200 種材料、50 多種產品類型。

把老師傅的經驗轉化為製程邏輯後,第一步就是讓 AI 協助操作人員找到合適的成型條件。智穎智能為此開發智能成型導引系統,工廠只要輸入材料、機台規格、產品尺寸等資訊,sMolding 便能計算第一組成型參數;若試模後出現產品缺陷,再由 sTroubleshooting 提供修正建議。

用手機即可查看系統狀況
圖/ 智穎智能提供

「它就像導航。我今天告訴你要從 A 點到 B 點,但不知道路怎麼走,導航會把路徑算給你。」張詠翔說。對射出成型而言,這條「路徑」就是溫度、速度、壓力與位置等參數如何組合。以半導體載具試模為例,傳統方式需 7.5 小時,導入系統後縮短至 2 小時,材料使用量從 23 公斤降至 8.7 公斤,整體試模成本降低 64%。

但找到正確參數只是第一步,真正進入量產後,工廠面對的「路況」還會持續改變。溫溼度、材料批次與機台耗損,都可能讓原本設定好的製程條件產生偏移。智穎智能因此進一步開發 StabMolding 成型穩定模組,透過射出壓力數據持續監控品質,並依生產狀態自動補償關鍵參數。換言之,AI 不只在試模階段提供一條正確的「導航路徑」,進入量產後還能因應製程變化持續修正,進一步朝「自駕」邁進。

從產線驗證到海外布局,桃園如何助攻智穎智能跨過0到1?

但要讓 AI 真正走進工廠,智穎智能採取 SaaS 訂閱模式,將核心運算留在雲端持續學習與更新,降低中小型製造商一次投入大量資金的門檻。另一項差異則是「跨廠牌」。現實中的射出工廠往往同時擁有台灣、日本、歐洲不同品牌與年份的設備,因此智穎智能的方案既能導入既有設備,也能與射出機、控制器業者合作,在新機出廠時直接整合。「一個工廠不會只有一個廠牌,就像你家的車庫不會永遠只放同一品牌的車。」張詠翔說。

對智穎智能而言,AI 真正走進製造現場的關鍵,在於不同世代、不同品牌的設備都能導入。只是對工業 AI 而言,降低導入門檻還不夠,更關鍵的是能否取得真實產線反覆驗證。對從中原大學研究成果衍生創立的智穎智能而言,桃園不只是公司所在地,也提供了技術走向市場的第一塊試驗場。「對新創來說,第一個就是要經費、要人才、要場域,再來就是客戶與合作夥伴資源。」張詠翔說。

成立初期,團隊透過桃園市政府研發補助、新創競賽與基地進駐等資源,降低早期研發與營運負擔。更重要的是,桃園密集的製造業聚落,本身就是智穎智能最直接的潛在市場。透過市府串聯工業區與在地企業,智穎智能在創業初期接觸到位於桃園的「良器」,成為公司第一個客戶。從概念驗證、產品調整到實際導入,合作一路延續至今。對必須進入產線反覆驗證才能成熟的工業 AI 而言,第一個願意開放場域的客戶,意義遠超過第一筆營收。

如今,從桃園製造現場磨出的解決方案也開始往海外走。「日本這一次,完完全全都是桃園市政府帶著我們去做這件事情。」張詠翔表示,透過市府帶領團隊前往日本神戶,智穎智能接觸當地官方與企業資源。在市府引薦下,團隊成功對接了神戶知名加速器,更取得日方針對外資新創設立公司與拓展市場的兩階段實質補助資訊。目前團隊正籌備日本布局,為下一階段海外市場拓展做準備。

智穎智能在 TaipeiPLAS 2026 台北國際塑橡膠工業展,展示 AI 智慧製造成果,現場商洽氣氛熱烈,成功吸引產業關注。
圖/ 智穎智能提供

AI 解決「怎麼生產」後,下一步是「替誰生產」

當 AI 開始解決「怎麼生產」,張詠翔看到的下一個問題,是「替誰生產」。部分製造商提高生產效率後反過來問他,如果我的產能多了 20%,但沒有多 20% 的訂單,我何必要做那麼快?

這個問題催生了智穎智能下一階段的製造媒合平台構想。隨著供應鏈分散至不同國家,品牌要在海外重新尋找符合特定規範與製程能力的供應商,也愈來愈困難。團隊因此希望串聯既有使用 AI 方案的製造商,讓品牌端能依條件尋找供應商,也讓製造端的閒置產能有機會被看見。團隊預計 2027 年上半年推進平台服務,初期規劃串聯超過 200 家製造商與破千台機器。

從中原大學的研究,到桃園工廠提供第一個實際驗證場域;從把老師傅經驗變成 AI「導航」,再走向能自行修正製程的「自駕」,智穎智能試圖數位化的,是製造業最難被保存的資產:人的經驗。而當全球供應鏈持續移動、製造基地愈來愈分散,這套從桃園工廠磨出的 AI,下一步不只要替老師傅找到數位接班人,也要重新連結散落全球的製造能力。
而「Meet 桃園+」也期盼持續透過計畫的媒體報導與宣傳資源,將更多像智穎智能這樣扎根在地、走出海外的創業故事傳遞出去,讓外界看見桃園豐沛且具實戰力的創新動能。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓