亞馬遜AWS大當機的原因找到了:技術人員「打錯字」
亞馬遜AWS大當機的原因找到了:技術人員「打錯字」
2017.03.03 | Amazon

亞馬遜雲端資料儲存服務S3(Amazon Simple Storage Service)位於美國維吉尼亞州北部的資料中心,本周二出現大規模故障,波及Giphy、Medium、Slack、Quora等上千家使用亞馬遜雲端服務(AWS)儲存資料和提供線上服務網站,歷經4小時才搶修完成。亞馬遜今日公布事故調查報告,造成上千個網站停擺的原因,全都只因技術人員「打錯字」。

技術人員打錯字,意外關閉大量伺服器

根據亞馬遜說明,28日上午,一名技術人員正在進行例行維修,其中一個步驟便是關閉S3子系統下的少量伺服器。「不幸的是,其中一條指令輸入錯誤,導致意外關閉比預期還多的伺服器。」亞馬遜解釋。

正巧,在那些被關閉的伺服器,有些負責處理S3子系統的和資料檢索和儲存功能,被移除後相關服務皆無法執行,也導致AWS無法正常運作,需要重新啟動才能回復設定。

系統規模大且許久未重啟,導致系統重啟耗時長

不過亞馬遜表示,按照S3子系統的設計,就算發生重大故障被移除,也不至於對客戶造成影響,只要重新開啟子系統,就能簡單回復這名員工的疏失。至於這次為何耗費4小時才解決問題,亞馬遜表示,AWS已經好幾年沒真正重啟這些子系統,且S3的資料量也成長許多,電腦光是跑安全檢查和驗證底層後設資料(metadata)的完整性就花了不少時間,因此重啟系統時間比預期的還久。

亞馬遜增設安全機制、避免快速關閉大量伺服器

為了避免類似情形再發生,亞馬遜表示,它們目前使用移除容量的工具「允許太多容量可於短時間內移除」,因此,未來他們將調整,讓工具移除容量的速度變更慢,並增加安全檢查機制,防止移除超過子系統正常運作所需的最小容量。此外,它們也將把S3子系統拆成更小的單位,以縮短系統回復所需時間。

尷尬的是,在這次事件中,用來追蹤AWS運作狀況的「服務健康檢查(Service Health Dashboard)」網站也受到S3故障而停擺,導致亞馬遜只能在Twitter上更新搶修狀況。亞馬遜在報告中也保證未來S3故障、該網站將能正常運作。

「我們希望向所有受到此事件影響的客戶道歉。我們將盡所有努力在這次的事件學習,並進一步改善我們服務的可用性。」亞馬遜說。

資料來源:AmazonTechCrunchThe VergeEngadget

往下滑看下一篇文章
AI代理時代已至!國泰金控以GAIA 2.0框架加速AI應用百花齊放
AI代理時代已至!國泰金控以GAIA 2.0框架加速AI應用百花齊放

AI正以驚人速度重塑世界樣貌,金融產業也不例外。國泰金控作為台灣最大的金融控股公司之一,不僅積極擁抱創新變革,更透過開放分享促進產業共好:在「2025國泰金控技術年會」中分享「GAIA 2.0技術框架」,揭示多代理(Multi-Agent)雲端協作架構,讓AI從知識問答助理進化成可以自主推論、規劃與協作的夥伴,拉開以人為中心的金融科技新世代序幕。

以GAIA 2.0技術框架為基礎,加速集團應用百花齊放

GAIA是國泰金控為實現AI即服務(AI as a Service)提出的關鍵技術框架,歷經一年的發展,不僅成功建立超過200種資料類別的知識庫、彙整50多種生成式AI模型的Model Hub、設有70道安全防護檢查點的AI護欄。

國泰金控
國泰金控副總暨國泰世華銀行數據長梁明喬分享GAIA 2.0技術框架與集團GenAI應用案例
圖/ 數位時代

國泰金控副總經理暨國泰世華銀行數據長梁明喬指出:「隨著代理式AI技術崛起,我們在今年提出GAIA 2.0技術框架,目標是讓AI助理(Assistant)進化成AI Agent,可以跨單位整合工具、數據與分工,實現真正的智慧協作。」

舉例來說,為深化集團員工運用AI提升工作效率,我們打造員工AI助手—Agia,協助同仁進行知識查詢、資料摘要等任務,提升效率與生產力;另外,透過AI自助開發平台—GAIA Studio,讓員工以No Code工具,連結內部知識庫,並以視覺化介面或Prompt快速自主開發,打造業務場景所需的生成式AI服務與工具。GAIA Studio 上線三個月已有28個部門自助開發超過40支內部應用AI服務(包含行銷文案、各類產品知識、趨勢摘要等)。

在技術面,具體作法是透過GAIA 2.0框架下的四個模組,包含負責統籌AI Agent任務分配與協作流程的「Agent Core核心框架」、提供安全自主運作環境的「Agent Workspace可控環境」、連結Agent間共通語言的「Agent Protocol串接協定」,以及集中管理AI工具與元件的「Agent Marketplace整合市集」,以加速AI Agent應用研發與部署。

梁明喬表示:「接下來,我們將以GAIA為引擎,打造通用型、業務型、IT型與服務型AI應用,如Vibe Coding、CUBE Intelligence等服務,一步一腳印擴展集團的AI Agent生態圈,型塑智慧金融新格局。」

舉例來說,隨著生成式AI普及,客戶對於數位(助理)服務的期待更高,國泰世華銀行數位品牌CUBE推出「CUBE Intelligence」兩項新服務,包含「升級版」智能助理–阿發,滿足客戶詢問複雜問題的需求,無論客戶提出什麼問題,都可以完整步驟與適當的情緒價值強化與客戶的連結,讓服務更智慧、貼心且符合期待。

國泰金控
國泰金控副總暨國泰世華銀行數位長陳冠學展示「CUBE Intelligence」兩項新服務
圖/ 數位時代

國泰金控副總經理暨國泰世華銀行數位長陳冠學表示:「除了升級版阿發,另一新服務是我們也在CUBE App新增『對話式功能搜尋(CUBE Search)』,就像把行員放到CUBE App一樣,讓客戶可以用自然語言輕鬆找到想要的服務,讓服務體驗變得更聰明、更人性也更懂你。」兩項CUBE Intelligence新服務即將在年底正式上線。

跨界合作推動台灣大型語言模型落地,加速生成式AI發展

大型語言模型具備強大的語意理解與內容生成能力,是生成式AI快速發展的關鍵推力。國立政治大學金融科技研究中心主任王儷玲指出:「金融產業因為有獨特的金融語境、法規語意以及在地化的繁體中文知識,國際通用模型並不適用,必須建構本土知識庫、標準化模型機制、AI 法規沙盒及在地算力平台,發展台灣企業共同主導與管理的大型語言模型,方能讓更多金融業者透過微調打造適用模型、加速可信賴的AI Agent服務落地。」

國泰金控數數發中心數據暨人工智慧發展部副總經理劉浩翔進一步補充:「本地大型語言模型的成功關鍵,不僅是掌握充足且高品質的數據,還要透過後訓練微調與人類回饋強化學習的訓練方式去微調出適用的AI模型,藉此提升答案的精準度,尤其是需要跨法規、多層邏輯的嚴謹金融專業知識。」

AI要成功,除了應用場景、模型,算力也扮演至關緊要角色,對此,鴻海科技集團亞灣超算執行長姚延宗表示:「本土算力是支持本土大型語言模型落地的關鍵。」不過,他也強調,AI算力快速迭代且進入門檻高,不是每一間企業都可以自建算力,因此,亞灣超算與NVIDIA合作啟用超算中心,讓金融等台灣企業可以按需租賃所需算力,解決資料共享等敏感問題,加速金融AI應用的多元發展。

國泰金控
產業與學界專家於國泰金控技術年會交流生成式AI如何在台落地應用,左起為:國泰金控副總經理施君蘭、政治大學金融科技研究中心主任王儷玲、國泰金控數數發中心副總經理劉浩翔、鴻海科技集團亞灣超算執行長姚延宗
圖/ 數位時代

總的來說,從GAIA 2.0技術框架的推出、生成式AI的落地應用、到積極參與本土大型語言模型建置等行動,可以清楚看到,國泰金控正由內而外推動全面AI創新:強化內部流程效率與治理能力、以智慧化服務提升客戶體驗,並透過技術開放與跨域合作,為金融產業的數位與AI智慧轉型注入新動能。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
進擊的機器人
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓