不只看圖說故事而已!OpenAI發布o3與o4-mini視覺推理模型,讓AI「以圖思考」
不只看圖說故事而已!OpenAI發布o3與o4-mini視覺推理模型,讓AI「以圖思考」

OpenAI最新推出的o3與o4-mini多模態模型,在視覺感知領域投下震撼彈,首次能夠在思考鏈(chain-of-thought)中運用圖像進行推理,而非僅僅「看見」圖像。

這項創新功能可說徹底改變了AI與視覺內容的互動方式,讓模型從看圖說故事的階段,進階到自行使用網路搜尋、資料分析工具,更深入地理解和解決複雜的圖像資訊。

o3和o4-mini不只會看,還能「解讀」圖像背後意義

根據OpenAI,o3和o4-mini經過特殊訓練,能夠對圖像使用較長的內部思考鏈來形成回應,從而擴展視覺推理能力,也就是在思考過程中直接運用圖像進行推理並給出解答。

這種「以圖像思考」的能力,是透過各種工具包括裁剪、放大、旋轉以及其他的圖像處理技術,來推理用戶上傳的圖像。更重要的是,這些視覺推理能力是原生整合的,不依賴外部專業模型。

o3和o4-mini也能與其他工具協同工作,例如Python程式碼、網路搜尋、圖像生成和ChatGPT中的所有工具等,有效地解決步驟較多的問題。o3和o4-mini模型的視覺推理能力使ChatGPT能夠:

  • 深度分析圖像:模型能夠更全面、準確且可靠地分析圖像內容
  • 無縫結合多種工具:可同時運用高級推理、網路搜尋和圖像處理工具
  • 主動處理圖像:自動縮放、裁剪、翻轉或增強圖像以提取更多訊息
  • 處理不完美圖像:即使從品質不佳的照片中也能抓出有用見解

OpenAI也表示,o3和o4-mini在多種人工考試和ML基準測試中,明顯優於前代模型。

視覺推理如何應用?辨識手寫、找公車時刻表都有戲

OpenAI展示了多種視覺推理應用,用戶能夠以更自然、直觀的方式與ChatGPT互動,以下舉幾個應用例子示範,皆使用o3模型完成:

辨識手寫內容

用戶可以拍攝含有文字的照片提問,無需擔心物體的定位問題。例如,即使照片中的筆記本文字是顛倒的,模型也能識別出「4th February – finish roadmap」的內容。

解決複雜學術問題

模型能夠分析和解決高階的學術問題,例如,含有物理學的量子電動力學(QED)題目照片,它能夠識別費曼圖和相關數學公式,逐一拆解步驟提供詳細解答。

OpenAI o3 and o4-min
圖/ OpenAI

識別公共標誌與資訊

用戶拍攝街道上的公共標誌照片,模型能夠識別上頭的文字字樣,例如「Ochsner URGENT CARE」,即使文字相對模糊或距離較遠。

OpenAI o3 and o4-min
圖/ OpenAI

分析地點與交通資訊

模型能夠識別特定地點,並結合網路搜索、資料查找,提供準確交通訊息,例如,從照片中的公車顏色、看板招牌辨識出「箱根登山公車站」,並透過網路搜尋等工具分析公車時刻表,找到「白天每15-20分鐘一班車」的發車資訊。

解決特殊視覺難題

模型能夠分析並解決視覺難題,例如迷宮問題,透過Python資料分析,自動推理路徑並以紅線標示解謎。

OpenAI o3 and o4-min
圖/ OpenAI

推理事件與地點特徵

能夠分析照片中的學術禮服和場景特徵,藉此確認特定事件,例如,從一張沒有任何文字的照片中,判斷出背景為MIT畢業典禮、畢業生戴著博士生學位的灰色帽子,以及「24」字樣代表為「2024屆」,並以網路搜尋找出MIT在2024年的畢業典禮時程,確定是工程學院在2024年5月29日的畢業典禮。

OpenAI o3 and o4-min
圖/ OpenAI

辨認特定建築與相關資訊

模型能夠根據建築特徵和風格識別地點,提供在該地點拍攝的電影訊息,例如從照片中的紅色紋路欄杆、海岸背景等線索,推測出照片地點為法國里維埃拉的Villa Kérylos,並進一步網路搜尋有哪些電影曾在此地點拍攝過。

OpenAI o3 and o4-min
圖/ OpenAI

軟體與媒體公司《Every》執行長Dan Shipper發布一篇體驗文章,表示自己「已離不開o3了」,他利用o3進行各種研究評測,例如採訪對象研究、預測公司內部會議內容、制定YouTube 播放列表、挖掘書籍細節等,並對o3強大的代理性網路搜尋和視覺推理能力給予高度評價,同時也指出該模型在一些方面仍存在限制:

1. 表格偏好過度

o3的小缺點是它對表格的過度依賴,無論是在回應任何問題時,都傾向於用表格來展示答案。雖然表格能有效地展示訊息,但在某些情況下,過多的表格呈現反而無法清楚解釋。

2. 圖像識別尚未完美

在圖像識別方面,o3仍有改進空間。當使用者要求識別嬰兒車品牌時,o3偶爾會錯誤地將注意力集中在嬰兒車旁的牆壁上,而不是品牌Logo,並且給出了一個看似正確但實際錯誤的答案。然而,經過多次測試,o3模型在三次嘗試中兩次提供了正確答案。

3. 長文件處理仍有瑕疵

o3在處理超長文件檔案時有時會出現幻覺,這是許多 AI 模型的常見問題。此外,當對話持續進行多小時後,o3有時會顯得較為懶散,回應的品質略有下降。

Shipper表示,o3目前的問題其實也沒有比其他模型來得嚴重,且從回應品質上來看,o3整體出錯率反而比較低。隨著未來版本的更新,這些小問題有望得到修正,使 o3 在穩定性和準確性上達到更高水準,進一步提升使用者體驗。

延伸閱讀:吉卜力生圖引爆破圈!奧特曼稱OpenAI用戶「暴增至約8億人」:全球10%的人都在用

資料來源:OpenAI、Every

本文初稿為AI編撰,整理.編輯/ 蘇柔瑋

關鍵字: #openai
往下滑看下一篇文章
硬體新創如何打國際盃?邁特Demo Day揭出海關鍵:技術是門票,信任才是護照
硬體新創如何打國際盃?邁特Demo Day揭出海關鍵:技術是門票,信任才是護照

第十屆邁特創新加速計畫Demo Day在2025 Meet Taipei盛大登場。今年邁特以「邁國際」為活動主軸,邀請加拿大、新加坡、日本和台灣的專家,除了探討全球市場的開拓,也期望運用邁特創新基地,建立具磁性的網絡(Magnetic Net),持續吸引硬體創新團隊與專家,建構蓬勃發展的全球硬體生態系。

中華民國全國創新創業總會秘書長謝戎峰在致詞時直指,台灣市場量體小,硬體新創要走到小量試產非常不容易,過往台積電就是為輝達做到開源、加速整合的角色,「邁特也在系統面扮演同樣角色,從打樣、試樣到小量試產,提供新創全方位協助。」

從矽島進化新創島,「國際化」是關鍵指標

事實上,邁特創新基地自2016年創立以來,便致力成為硬體創新領域的加速器,期望提供「從0到100的解決方案」,並打通「硬體創新的最後一哩路」。邁特創新基地執行長戴憶帆指出,台灣被譽為半導體、電子製造服務強國,在全球產業鏈中具核心地位。如今,台灣正在善用「矽島」具備的卓越製造、供應鏈能力,聚焦創新研發,成為讓硬科技落地、加速商業應用的「新創島」,「其中,『國際化』絕對是衡量新創團隊能否快速成長、取得成功的最重要指標。」

邁特創新基地
加拿大駐台北貿易辦事處副處長拓喬丹特別蒞臨分享,期待與更多台灣新創攜手合作。
圖/ 數位時代

目前,邁特已幫助來自全球逾13個國家、超過150家的新創公司向外擴展。而為了具體展現協助台灣硬體新創出海、邁國際的決心,本屆Demo Day特別邀請來自跨國創投的專家,一同探討全球市場的開拓。

加拿大駐台北貿易辦事處副處長拓喬丹(Jorden Turley)首先指出,邁特的國際協同合作理念,與加拿大不謀而合,「加拿大視台灣為亞太戰略中,不可或缺的重要夥伴,我們彼此間不是競爭而是合作。」例如台灣在硬體製造、實作方面有優勢,加拿大則在設計方面表現出色,多邊合作有助於企業分散風險,並加速打入第三市場。

講好故事、建立信任感,打破技術迷思

跨界對談開場前,主持人邁特創新基地顧問柯旂,也先回應「邁國際」不只是今年的主題,更是台灣硬體創新的必然道路。本屆 Demo Day 不僅邀請到加拿大駐台單位、日本京都大學創投、新加坡創新生態圈代表,更有台灣創新總會秘書長、台經院等重要嘉賓蒞臨,一同見證台灣硬體新創與全球鏈結的關鍵時刻。跨界對談更邀請包含:日本京都大學創投(Kyoto University Innovation Capital)亞太區業務發展經理Raymond Woo,以及德國馬牌集團(Continental)旗下創投部門的合作與創投管理總監邱殷樂,為新創提供具體出海建議。

戴憶帆強調,「國際化」已是台灣新創現今最重要的課題,而新加坡、日本會是台灣進軍國際的首選前哨站。新加坡作為東南亞地區的中心,許多國際團隊選擇在當地募資、上市櫃,介接資源方便;日本則與台灣的文化、理念相近,相當重視「信任」、夥伴關係,加上在東京、京都等頂尖大學裡,有最前沿的技術,對需要發展應用、商業化成長的新創來說,是值得尋求技術互補的合作對象。

邁特創新基地
跨界對談由左至右分別為主持人邁特創新基地顧問柯旂、邁特創新基地執行長戴憶帆、日本京都大學創投(Kyoto University Innovation Capital)亞太區業務發展經理Raymond Woo,以及德國馬牌集團(Continental)旗下創投部門的合作與創投管理總監邱殷樂,與現場與會者進行交流。
圖/ 數位時代

邱殷樂直指,台灣新創的技術極佳、很有實力,甚至勝過美國、以色列的公司,「最大的問題,是不會講述自己的故事,以及不清楚如何對接正確的人和事。」他建議,新創在展開跨國合作之前,必須先確定在台灣的根基已穩,同時了解自家的技術優勢,以便說服投資人和潛在客戶;在和大集團、大客戶合作時,也要找到能推動技術使用的關鍵人物或團隊。

Raymond Woo觀察,技術背景出生的創辦人,經常會犯下只看技術、看不到大局的盲點,加上創業是相當依賴人脈的事業,「新創必須學習用技術來解決特定商業問題,並與合作夥伴建立最重要的『信任』,否則技術再好、再先進,也無法順利擴展、被妥善應用。」

硬體新創精銳盡出,智慧農業、智慧醫療、綠色創新吸睛

精彩的對談後,緊接著輪到參與第十屆邁特創新加速器計畫,涵蓋智慧農業、智慧健康、智慧製造與綠色創新等硬體領域的六組新創團隊,一一登台Pitch,並由邱殷樂、Raymond Woo、日本村田製造所新規事業推進部部長東端和亮、邁特創新基地日本代表顧問上野峻基和華碩電腦協理Sean Lai等業界先進擔任評審。

首先登場的台灣百應生物科技,是運用AI、電腦視覺技術,實現家禽養殖的自主監控,完全無需人工干預,準確度已可達98.5%。擴核生醫科技則打造一款模組化、可程式化的實驗室自動化平台,能將整合液體處理、細胞培養、影像擷取和資料分析等流程集於一體,加速生技與藥物開發的研發、驗證流程。雨傘不滴的綠色創新專利產品「傘不滴」,是透過物理擠壓與高科技吸水部件,讓雨傘四秒內便完全不滴水,取代一次性塑膠套,解決公共場所地滑和環保痛點。恆帝斯智能科技是結合ESG輔導與碳IoT設備,自主開發韌體,解決聯網不穩、斷電導致的數據品質等問題,助力企業邁向淨零轉型。領動智慧科技的空中手寫輸入技術,鎖定的是下一代殺手級產品「智慧眼鏡」,透過高精度動態感測,為智慧眼鏡提供直覺、隱私友善的文字輸入解決方案。超術感醫學科技研發的AR顯微手術模擬訓練系統,則利用真實手術器械,提供精確控制回饋與AI動作分析,解決傳統訓練器械缺乏的「手感」問題,能被應用在眼科、神經外科等高精密的手術訓練。

最終大獎,分別由台灣百應生物科技、擴核生醫科技和超術感醫學科技抱走。東端和亮直言,透過此次Pitch,一方面看到台灣在軟硬整合的實力,更令人激賞的是,「團隊在營利之外,還致力解決社會問題,創造美好世界。」

邁特創新基地
日本村田製造所新規事業推進部部長東端和亮特別代表評審團致詞,除了欣賞台灣新創軟硬整合的實力,更發現團隊在營利之外,還致力解決社會問題,創造美好世界。
圖/ 數位時代

從在地驗證到鏈結全球,助新創在國際市場站穩腳跟

團隊對於自家產品、服務的用心,正是邁特極力提倡的核心價值,也是台灣新創通往世界舞台的基石。邁特創新加速計畫的運作模式,便如同硬體創新領域的國際嚮導,持續為新創團隊提供在地技術驗證和商業基礎訓練,並將新創的產品對接到國外大廠、國際創投。未來,台灣新創若能持續深化國際化、與多元夥伴合作,並具備正確的敘事能力和出海戰略,必能加速向外擴展,在全球市場中站穩腳跟。

立刻了解更多
https://bit.ly/m/mightynet

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
進擊的機器人
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓