文字轉圖像浪潮襲來,網路小編大敵!OpenAI、Google搶進投資AI新創
文字轉圖像浪潮襲來,網路小編大敵!OpenAI、Google搶進投資AI新創

人工智慧(AI)研究實驗室OpenAI基於人工智慧演算的文字轉圖像技術「DALL·E」將推出API公測版,這表示開發者可直接將DALL·E串接至應用程式或產品中,讓DALL·E的人工智慧圖像生成技術有更多的應用及可能性。

文字轉圖像技術是什麼?怎麼做的?

DALL·E透過AI模型來理解自然語言輸入(例如「五邊形形狀的綠色皮革錢包」或「一隻悲傷水豚的等距視圖」),並生成相應的圖片。它既可以生成現實的圖像(例如「帶有藍色草莓圖像的彩色玻璃窗」),也能夠生成現實中不存在的物體(例如「具有豪豬紋理的立方體」)。

DALL·E API Now Available in Public Beta.jpg
OpenAI 旗下AI繪圖軟體DALL·E,讓使用者只需輸入文字就能生成圖像。

DALL·E透過大量的演算法模型訓練,讓用戶使用自然語言提示創建和編輯圖像的轉換器語言模型,在正式釋出API之前,已經有時尚設計平台Cala和在裝飾瓷磚印出線上照片的Mixtiles等公司合作,針對特定的使用場景和產品需求進行測試。

OpenAI根據開發者使用的圖像數量及圖像尺寸收費,DALL·E 2的API使用價格為1024×1024 的圖片每張約0.6元台幣(0.02美元);512×512的圖片每張約0.58元台幣(0.018美元); 256×256的圖片則是每張約0.05元台幣(0.016美元)。

與微軟、Shutterstock合作,你想要的圖AI都能生給你

文字轉圖像的AI應用近來受到廣大用戶的喜愛,微軟日前也與OpenAI合作,將DALL·E整合至圖形設計應用程式Designer,以及內建Image Creator工具的瀏覽器 Bing 和 Microsoft Edge 之中, 當用戶在網路上搜尋不到想要的圖片時,就會透過整合DALL·E的Image Creator產生所需的圖像

此外,圖庫平台Shutterstock日前也宣布和OpenAI合作,讓使用者根據輸入的文字條件產生圖像。Shutterstock去年起就與OpenAI合作,授權OpenAI以平台上的圖片為素材,訓練DALL-E演算模型。不過,為了避免侵權的狀況發生,其他圖庫業者包括Getty目前仍是禁止出售以AI產生的圖片。

OpenAI_貓
OpenAi可產出256×256、512×512、1024×1024 三種畫素。
圖/ OpenAI

文字轉圖像商機有多大?為何連Google也投入?

不僅是OpenAI積極投入DALL·E的開發,Google今年中也公布了基於人工智慧的文字轉圖像生成系統Imagen。Imagen基於大型Transformer語言模型所建立,透過使用文字轉圖像擴散模型(Diffusion Model),讓Imagen對文字能有更深的理解,進而產出更貼近用戶所需的圖像。

Google表示,在未能完全過濾網路上不當的色情、暴力、種族主義、社會刻板印象等內容之前,以及建立安全框架之前,不考慮將Imagen公開給大眾使用。

由於開發先進人工智慧系統所需的人員、運算、及最重要的資金等資源都很龐大,多數人工智慧新創公司在初期所獲的融資規模仍是入不敷出,因此目前針對AI新創公司的孵化器項目並不多,因此OpenAI無疑是希望透過這項投資計畫,在商用範圍和利潤越來越大的AI行業中,能透過扶植有潛力的AI新創公司以斬獲先機。

雖然今年以來美國科技公司多受到通膨及經濟不景氣的影響而撙節開銷、謹慎投資,但OpenAI卻在微軟與其他合作夥伴的支持下,與獲得OpenAI投資1億美元的新創團隊Converge合作,將選出尚在種子輪的10位新創公司創辦人,提供100萬美元的資金、獲得早期使用OpenAI模型、為其新創公司量身定制的AI程式等協助,同時享有與OpenAI員工一同工作、參加研討會等活動共計5周的時間。

同一時間,市場傳出Google計畫投資專注開發自然語言處理軟體的人工智慧新創公司Cohere 2億美元的資金。Cohere執行長艾登·戈梅茲(Aidan Gomez)之前是Google Brain的實習生,他發表的論文推動了Transformer AI 模型的廣泛應用。從OpenAI和Google近來砸大錢投資人工智慧新創公司的做法,可預期人工智慧將是大型科技公司之間軍備競賽的另一個領域。

這點從AI新創公司Stability AI和Jasper今年來相繼獲得創投基金的注資,而在一遍不景氣中躍升為估值達10億美元以上的新創獨角獸公司可證明。Stability.Ai與DALL·E同樣都是基於人工智慧技術開發的文字轉生成圖像的工具;而Jasper則是透過白話的編寫開放式命令來產生社群、部落格、行銷用的文案或文章內容,讓使用者可輸入直白的文字,設定文章主軸、內容資訊、目標讀者等訊息,就能產生行銷文章來分享,堪稱是網路小編和行銷人未來的大敵。

資料來源:OpenAITech CrunchImagenWall Street JournalThe Register

責任編輯:林美欣

往下滑看下一篇文章
全台首創對話式金融服務iWish 永豐銀讓GAI真正走進金融交易現場
全台首創對話式金融服務iWish 永豐銀讓GAI真正走進金融交易現場

你還在手寫填單、逐格Key-in資料嗎?在生成式AI浪潮席捲各行各業之際,永豐銀行推出全台首創「說話就能完成交易」的智能對話式金融服務iWish,讓繁瑣的填單流程成為過去式,使用者可以透過文字輸入、口說敍述或上傳照片等方式,向AI傳達自身需求,無論哪一種方式,AI都可以即時理解使用者意圖,並根據與使用者的對話內容,自動填寫存款、提款、轉帳、匯款等相關表單,顛覆使用者對金融服務的想像。

生成式AI再進化,開啟AI代理人時代

隨著生成式AI的進步,LLM大型語言模型已具備多輪對話和上下文理解的能力,甚至正邁向可以獨立完成任務、不需要人類涉入的AI代理人(AI Agent)的新階段,這項技術突破讓企業既有服務得以展現全新樣貌。

以國際證券經紀商FBS為例,其推出的FBS AI Assistant服務,跳脫傳統單向建議模式,不直接提供評論或建議,而是讓用戶先選擇一至多項技術指標,再交由生成式AI模型解讀並生成專屬分析與操作建議,打造更具互動性與參與感的使用體驗。

永豐金控數位科技長張天豪認為,這種以生成式AI為核心的互動式服務模式,將大幅優化客戶的使用體驗,成為金融服務新常態。未來,客戶不必學習如何操作App,也不用記得交易程序,只要用對話、上傳照片或螢幕截圖等自己習慣的方式表達需求,AI就會理解並協助完成後續動作。「未來的金融服務將像生活中人與人之間的對話一樣,簡單而自然,」張天豪強調。

永豐銀行
前排由左至右:永豐金控數位科技長 張天豪、永豐銀行資訊、數位及作業督導張升寶、永豐銀行綜合企劃處處長 王筱嵐 後排由左至右:永豐金控數位科技處專案經理 林維婕、永豐金控數位科技處專案工程師 廖庭暘
圖/ 永豐銀行

從填單到對話,iWish重塑分行服務體驗

瞄準此未來趨勢,永豐銀行進一步盤點金融服務場景,決定從最貼近客戶的分行場域出發,打造互動式服務新體驗。

張天豪說明,臨櫃交易往往需要填寫各式各樣的表單,這些表單格式通常很制式、欄位繁複,對不熟悉流程的客戶而言,常常填到一半才發現格式錯誤、填錯位置,甚至必須整張重來,徒增挫折與作業時間。

「iWish服務的推出,就是為了讓這段流程可以變得更自然、直覺且輕鬆,」永豐銀行資訊、數位及作業督導張升寶說,客戶不再需要手寫填單,只要開口說、輸入文字或是上傳圖片,告訴iWish想要使用哪些金融服務,就可以完成交易,將原本繁瑣、仰賴經驗的填單作業,轉化成只需一句話或一張圖就能搞定,大幅提升臨櫃交易的服務體驗與作業效率。

以轉帳交易為例,客戶可以口說轉帳帳戶及金額,或是上傳網購訂單的轉帳頁面截圖、團媽在Line上提醒轉帳付款的對話截圖等,iWish會從中辨識表單所需資訊並精準填入銀行系統中對應的欄位,待客戶確認資訊無誤之後,系統就會生成一個二維條碼,只要將二維條碼交由臨櫃人員完成最後核對,就能輕鬆完成金融交易。

AI減輕行員負擔,專注更高價值服務

除了顛覆客戶的使用體驗,iWish服務也為內部作業流程帶來優化和改變,「對永豐銀行而言,iWish服務不是引進AI技術的炫技展示,而是與現有服務模式的無縫融合,讓創新落地、貼近人性」,永豐銀行綜合企劃處王筱嵐處長說。

王筱嵐進一步表示,最開始,金融交易需要經歷「客戶填單+櫃員輸入」的雙重程序,不僅耗時,也容易出錯。之後,永豐銀行推出免填單服務,客戶可以口述或將交易資訊抄寫在紙上,交由櫃員輸入至系統中、列印單據,待客戶簽名確認即可完成交易。

永豐銀行
圖/ 永豐銀行

而iWish則是免填單服務的再進化,藉由生成式AI(GAI)的語意理解與圖像辨識能力,取代櫃員的手動輸入作業,不僅提高效率與準確度,也大幅降低櫃員的作業負擔,可以將心力投注在更有價值的服務與溝通上。

GAI不只是客服輔助工具,更是金融轉型的推進引擎

相較於目前金融業的生成式AI應用,多數仍停留在客服階段,iWish是全台首創直接導入金融交易場景的GAI服務,堪稱跨出關鍵一步。

然而,在實際開發過程中,永豐銀行團隊也面臨諸多挑戰,其中壓力最大的,便是如何降低LLM可能出現的「幻覺」與辨識錯誤風險。尤其在金融交易場景中,AI的辨識精準度不僅關係到客戶權益,更直接影響其對金融服務的信任感,必須以更審慎的態度來看待。

為此,永豐銀行從多個面向著手提升模型準確度,包括優化Prompt設計與模型邏輯、與前線單位密切協作,共同討論介面呈現、使用流程與應用情境、在UI/UX介面加入提醒文字與引導機制,避免造成誤解。此外,團隊也分階段進行大規模封閉測試,邀請全行數百位同仁參與測試,並根據測試結果持續微調優化,確保最終推出的服務穩定度。

iWish的智慧來自於訓練與學習,「越用越聰明」的特性需要使用者參與激發

iWish是一款全新上市的智能服務,專為提升臨櫃交易體驗而設計。現階段iWish服務聚焦於台幣存款、提款、轉帳及匯款4大交易類型,並以「分行」為主要場景,未來則計劃將iWish服務擴展至更多金融交易類型,甚至走出分行場景,與iBranch等線上服務結合。

永豐銀行
永豐iWish以「智讀」、「智說」、「智寫」人性化操作,讓金融交易更方便快速
圖/ 永豐銀行

iWish的成功落地不僅是技術突破,更宣示意味著,生成式AI正式從客服輔助工具,搖身一變成為可以理解意圖、自然回應、主動引導的智慧助理,讓用戶在熟悉的對話情境中完成交易,實現真正以人為本的金融體驗。而AI模型的成長需要訓練,iWish在初期也需要客戶的參與來變得更聰明,透過接觸到更多元的使用情境,進一步完善服務,讓每一次互動都更懂客戶的需求。

「iWish服務只是第一步,」張升寶認為,這項服務不僅重新定義人與銀行的互動方式,也為生成式AI在金融業的應用看見新的可能。他期許未來能進一步擴大AI Agent應用範圍,讓AI不再只是輔助工具,而是驅動金融轉型的核心力量。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
蘋果能再次偉大?
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓