AI為何不擅長找出Bug?微軟研究揭關鍵原因:無法模仿人類工程師的Debug流程
AI為何不擅長找出Bug?微軟研究揭關鍵原因:無法模仿人類工程師的Debug流程

人工智慧成為新世代開發者的重要夥伴已是不爭事實。Google 執行長 Sundar Pichai 就曾表示,如今已有高達四分之一的新程式碼由 AI 生成,Meta 的 Mark Zuckerberg 也高度關注 AI 在開發領域的應用。然而,儘管 AI 在「寫程式」表現搶眼,但在「找 bug」這件事上,卻明顯力有未逮。

根據微軟研究院最新發表的研究,即便是目前業界最強大的生成式 AI 模型,在面對軟體除錯任務時,表現仍不盡理想。研究團隊測試了包含 Anthropic 的 Claude 3.7 Sonnet 與 OpenAI o3-mini 在內的多款主流 AI 模型,並以 SWE-bench Lite 這套軟體除錯基準集進行 300 項挑戰,結果發現:

  • Claude 3.7 Sonnet 成功率僅為 48.4%
  • OpenAI 模型更低,僅 30.2% 與 22.1%

為什麼 AI 除錯這麼難?關鍵在於「學不到人怎麼做」

研究團隊指出,AI 模型目前最大的瓶頸在於訓練資料本身。現有的語言模型訓練內容多聚焦於程式碼生成與片段補全,但卻缺乏來自真實開發者的除錯紀錄與決策流程。

ai出錯
圖/ t客邦

簡單來說,AI 還無法像人類那樣理解「哪裡出錯、該怎麼判斷、該試哪些工具、怎麼一步步排查」,因為它根本沒看過我們怎麼除錯。

未來若要讓 AI 真正具備除錯能力,就必須蒐集更多「人類除錯歷程」的資料,並進行專門訓練與微調,讓模型學會如何與除錯工具互動、如何思考 bug 形成邏輯。

程式寫得快,但錯也不少?AI 的可靠性仍需觀察

即使現在許多開發者已經習慣使用 Copilot、ChatGPT、CodeWhisperer 等工具輔助寫程式,但許多研究也指出,AI 生成的程式碼中仍潛藏著各種潛在錯誤或安全風險。

例如近期話題工具「Devin」,雖號稱可自主完成軟體專案,但在 20 項基準測試中僅完成了 3 項,顯示其對實際開發場景的理解與應變能力仍遠遠不及人類工程師。

AI 是夥伴不是替代者,開發者仍是不可取代的核心

微軟的研究再次印證,寫程式不只是技術任務,更是一種結合創造力、邏輯推理與經驗判斷的綜合能力。正如比爾・蓋茲所說, 「程式設計是一門藝術,而不是機械複製。」

Replit 執行長 Amjad Masad、IBM 執行長 Arvind Krishna 等多位產業領袖也曾表示,AI 是開發者的工具,而不是取代者。未來的工程師不只要懂寫程式,還得學會善用 AI 幫手,讓效率倍增。

AI 還在學走路,開發者要更學會如何駕馭

AI 在編寫程式方面的確展現出驚人潛力,但在除錯、邏輯判斷與系統性問題解決上,仍有不少路要走。開發者該做的不是擔心會被取代,而是學會如何駕馭這位「新手助手」,讓 AI 幫你省力,而不是添亂。

就像給新手司機裝了自動駕駛一樣——直路行得穩,但遇到彎路和突發狀況,還是得靠真正的人來掌握方向盤。

延伸閱讀:情勒鳥轉型!Duolingo宣布「AI優先原則」:預告汰除外包人員,5/1速推148堂新課程
2025台灣AI大賞|智慧農業、數位牙科、AI紡織⋯這11家台企,如何讓AI落地成真?

本文授權轉載自:T客邦

關鍵字: #AI
往下滑看下一篇文章
懂保險的 AI 才有用!國泰人壽數據暨人工智慧發展部如何解開壽險業的 AI 實戰難題
懂保險的 AI 才有用!國泰人壽數據暨人工智慧發展部如何解開壽險業的 AI 實戰難題

金管會調查顯示,國內金融機構與周邊單位已有 33% 導入 AI,其中壽險業導入比例達 67%,僅次於銀行業的 87%。事實上,保險業應用 AI 的難題不在技術,真正的挑戰是要在高度監理、複雜流程與專業領域中,找到可落地的應用場景。國泰人壽數據暨人工智慧發展部走過八年、歷經三次組織定位演進,如何摸索出自己一套的 AI 轉型路徑?

國泰人壽養兵練 AI

國泰人壽數據團隊的起點,可以追溯到 2016 年成立的「客群經營部」。2018 年,隨著公司希望讓 AI 發展更具基礎架構、更具規模地展開,團隊轉型為「數據經營部」;到了 2024 年,正式成立「數據暨人工智慧發展部」,角色也從推廣,轉向更專注的技術發展。

國泰人壽-2.jpg
國泰人壽數據暨人工智慧發展部目前為一約 65 人的團隊,平均年齡 33 歲。
圖/ 數位時代

八年間,團隊的任務始終圍繞同一件事:深入業務現場,釐清痛點,再與 IT、業務、客服等單位協作,推動 AI 從研究走向實踐。國泰人壽數據暨人工智慧發展部協理莊淑儀形容,這個過程更像是傳教士的工作:「很多數據產品是由我們發想,從核保到理賠,有哪些導入機會?我們要去和各部門溝通,AI 可以協助什麼。」

國泰人壽-3.jpg
國泰人壽數據暨人工智慧發展部協理莊淑儀。
圖/ 數位時代

這樣的溝通並不容易,因為壽險業的專業門檻極高。國泰人壽數據暨人工智慧發展部首席數據分析師黃喬敬博士指出,一張保單牽涉的關係人本來就複雜:「在保險業,一張保單的銷售,涉及要保人、被保人、受益人,是多方關係,尤其在金管會的要求下,還必須兼顧模型的公平性與可解釋性。」核保邏輯、理賠判斷、業務員培訓,每個環節都有各自的專業門檻與監理要求,通用技術難以直接套用。這也是國泰人壽選擇自己養兵練 AI 的原因,唯有深度理解壽險場景,AI 才有落地的條件。

從真實需求長出來的 AI 實戰力

要讓技術模型真正為前線人員所用,數據暨人工智慧發展部團隊長期觀察業務現場,確保 AI 產出都能有效銜接既有作業流程。去年,團隊面對的挑戰,是在十三個部門提案中,篩選出值得投入的場景。莊淑儀說明,評估標準有三項:「是否能複製到多元場景?對公司有什麼效益?技術可行性?」最終六個案子出線,其中包括「AI Coach」。

AI Coach 以 AI 陪練業務員磨練銷售技巧,同步縮短培訓週期,讓業務員能更快提供專業、貼近保戶需求的服務。看見 AI Coach 的成效後,國泰人壽也將同一套模式延伸至客服中心及直效團隊,評估面向包括禮貌、問題回應、服務要點...等面向,給於評分及建議。黃喬敬博士解釋背後的難度:「以往這些評估指標是由人來判斷,現在則是要做到標準化,讓 AI 系統可以自己判斷。」今年一月上線後,客服新人有超過九成以此作為教育訓練工具,業務端使用率也過半,不僅省下資深人員帶新人的時間,也讓保戶獲得更一致、更高品質的服務體驗。

國泰人壽-4.jpg
國泰人壽數據暨人工智慧發展部協理莊淑儀(左)與首席數據分析師黃喬敬博士(右)帶領團隊在國泰人壽保險領域驗證 AI 應用。
圖/ 數位時代

另一項落地應用則是「Cathay Eye」,是國泰人壽自行開發的智能風險控管模型。莊淑儀說明:「這最主要是幫案件的複雜度做分級,讓新進同仁處理複雜度低、資深同仁處理複雜度高的案件,一來反映人力價值,二來加速案件處理流程,讓客戶更快獲得所需服務。」

黃喬敬博士也補充背後的機制:「Cathay Eye 是把公司過去數千萬筆資料整合起來,藉此建立一個平均的判斷基準,用來做複雜度分級與派工。」目前,Cathay Eye 的識別能力相較原流程提升一倍精準度,也讓流程的判斷效率明顯加快。

壽險業 AI 應用的新標竿

對國泰人壽而言,讓 AI 發揮作用的關鍵,在於將產業領域知識與技術能力結合,而這仰賴的是兩條並行的人才路徑。對內,是強化已熟悉保險核心業務人才的 AI 素養;對外,則是網羅生成式 AI 工程與系統設計、AI 治理、雲端數據工程...等專業人才,補齊技術深度。莊淑儀強調:「在人才 AI 素養上,以往我們著重精兵制。去年開始,我們要做到全員素養提升,在人人都會用 AI 的時代,如何善用、如何合規,這都是需要教育訓練的。」

黃喬敬博士則從技術端點出下一步的方向,如 Agentic AI 是明確的發展趨勢,但在企業級的應用上,不可能讓它完全自由運作,如何兼顧安全與效益,是關鍵任務。「檢視整個 Workflow,如何建立更好的決策流程,人員的角色和流程都會慢慢轉換。」他也指出,把端到端的自動化流程建置起來,是團隊接下來的重點工程。

國泰人壽-5.jpg
國泰人壽數據暨人工智慧發展部首席數據分析師黃喬敬博士。
圖/ 數位時代

導入 AI,或許已是壽險業的產業常態;但能不能真正走進核心業務的第一線,關鍵仍是有沒有先搞懂保險本身。從需求出發、從場景驗證,國泰人壽正以這套方法,定義壽險業 AI 應用的新標竿。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓