Deep Research怎麼用?GPT、Perplexity、Grok大評測:誰最強?誰CP值最高?
Deep Research怎麼用?GPT、Perplexity、Grok大評測:誰最強?誰CP值最高?

各大科技巨頭近期紛紛推出DeepResearch功能,通常標榜了先進的資訊蒐集、分析與報告生成能力,但實際使用起來,究竟哪裡不一樣?

2025年1月底,中國DeepSeek問世可說是為了這場AI競賽擊發了起跑第一槍,基於R1模型的DeepResearch功能驚豔各界,更挑戰了美國在AI領域的技術主導地位。

事實上,Google最早於去年12月初率先推出基於Gemini 1.5 Pro模型的DeepResearch功能。而在DeepSeek後,包括OpenAI、Perplexity,以及由特斯拉創辦人馬斯克旗下xAI所發布的Grok3模型,陸續在2月份發布「深度研究」功能。

那麼,各家的DeepResearch功能差異為何?

《數位時代》以下將以「檔案解讀」及「開放式提問」兩大題,針對各家模型進行資料搜尋的「廣度」、「深度」、「可讀性」等維度進行整體評分,來看看對於慣用繁體中文的台灣用戶來說,哪一家的產品最實用。

要先說明的是,以下測試檔案解讀皆採用主計總處的「2024全年及12月的工業及服務業薪資統計結果」,該檔案一共34頁,並包含大量行業薪資數據。而提示詞為: 「請就檔案內容提出關鍵洞察」 ,旨在利用相對抽象的提問測試各模型對用戶需求的理解程度。

而「開放式提問」,則以歸納國內外新聞為題,具體提示詞為: 「請協助整理至今30天內的國際&台灣10大新聞」 ,旨在測試各家模型的搜尋廣度以及理解深度。

註:本次由於DeepSeek過程中一直呈現過載狀態,故未納入評測。

選手一:ChatGPT(GPT 4.5)

ChatGPT部分以GPT 4.5模型為測試,在上傳檔案之後並輸入提示詞之後,約莫在30秒之內生成出七項洞察要點。其中,較為關鍵的訊息包括「全體受僱員工的經常性薪資」,以及「12月總薪資的平均數」,均在第一點出現。

但針對薪資分布差距,僅列出中位數及年增率,雖有提到「第9十分位」與「第1十分位」比值,但卻未列出檔案中的具體數據,必須追問「請提出具體數據」才可撈出數據;行業別薪資差異部分,也僅列出最高薪行業(金融業)及部分高薪行業;而對「低薪行業」的描述則更少。

GPT4.5.jpg
ChatGPT 4.5的生成速度快,但在沒有精確提示的情況下,論述深度有賴用戶進一步提問強化。
圖/ ChatGPT

在加分項上追問「請協助列出各產業薪資中位數排名」, ChatGPT所列出的分數並未完全依照高低排列,需要用戶進一步整理才可使用 ;除此之外,在評測時雖然輸入繁中提示詞,原始資料也是中文,但ChatGPT多次都以英文回覆,需要請他「說中文」,才會把生成結果翻譯成中文。

GPT排名.jpg
要求GPT 4.5整理數據排名,有子母項目混用的問題,導致數據未依照高低排序。
圖/ ChatGPT

而在新聞搜尋方面,GPT確實有理解「至今30天內」為2025年2月10日至3月12日, 但在新聞內容上信度頗低,有過度簡化(例如:全球通脹壓力持續,多國面臨高通脹率),甚至是引用維基百科,把2024年的花蓮強震當作新聞露出。

選手二:Perplexity(DeepResearch)

Perplexity的深度搜尋特色是生成內容結構化完整,更像是由人類寫出來的報告。舉例而言,包括經常性薪資平均數及成長率,以及成長因素,再到各產業差異發展,論述的架構要更為理想。另外,夾帶檔案後的生成時間約莫在30秒以內。

值得注意的是,Perplexity會自動在各標題上產生連結,方便用戶點擊,針對有興趣深入研究的項目進一步追問,相較ChatGPT更為人性化。

per結構.jpg
Perplexity深度研究的論述結構完整。
圖/ Perplexity

而在加分項上追問「請協助列出各產業薪資中位數排名」, Perplexity就會自動歸納檔案中的表格,並附上「中位數/平均數比」,以及各產業年增率,甚至提出「前三大高薪產業占總受僱人數僅8.74%」等更深入經過推論的洞察 。但Perplexity的表格僅列出薪資中位數前12高,同時仍有部分排名錯置的問題(更低的排名卻較高),不過正確性無誤。

per中位數排名.jpg
Perplexity整理的表格各自正確性無誤,但排名未依照高低順序。
圖/ Perplexity

而在新聞搜尋方面,Perplexity對國際新聞的表現比台灣本地新聞更理想,前五條確實為近一個月內的國際要聞,但第六名之後就有報題重複,以及納入2024年末新聞的狀況;台灣新聞方面,可從引用資料察覺AI大量引用國內媒體的2024年回顧新聞,因此時效性幾乎都與提示詞不太吻合。

per國際新聞.jpg
Perplexity的國際新聞排名,多為政治經濟議題。
圖/ Perplexity

選手三:Gemini(DeepResearch with 2.5 Pro)

實測時發現, Gemini的DeepResearch無法夾帶檔案(測試帳號為Advanced版) ,因此改用唯一可夾帶PDF檔的模型2.0 flash進行測試。

結果發現,Gemini的生成結果類似GPT 4.5,採以列點的方式將重點摘要出來,雖在資料正確性上無誤,但並未將大量資料結構化,導致可讀性偏低,若用戶本身對於這類型資料沒有基礎概念,不容易在生成結果上產生深入洞察。

GEM檔案輸出.jpg
Gemini的資料處理能力與ChatGPT雷同,精準、快速,但深度不足。
圖/ Gemini

而在加分項上追問「請協助列出各產業薪資中位數排名」,Gemini確實依照金額高低,將列入統計數據逐一列點排出。

值得注意的是,由於原檔案內有部分產業分成母項與子項, 例如「批發及零售業」底下,還可細分為「批發」及「零售」兩項,而Gemini選擇將母項(兩項子項加總)排除,因此在排名上更為直觀,也是在加分項上贏過CahtGPT的關鍵。

GEM加分.jpg
Gemini重組資訊的能力尚算可靠,用戶可進一步提示優化。
圖/ Gemini

而在新聞搜尋方面切換回DeepResearch,Gemini的亮點是,可以在生成結果之前「編輯研究計畫」,Gemini會列出研究題目的各種項目,協助用戶提出更精確的研究架構。而若回應「不用更動」,就會依照計畫生成結果。

GEM計畫.jpg
Gemini可以再生成前優化提示,或可取得更好的成果。
圖/ Gemini

生成出爐後,Gemini的優勢是與Google文件整合度高,因此可以直接將成果輸出,方便用戶取用。 但第一版生成結果雖以中文提問,卻是以日文顯示成果,必須進一步請AI顯示中文。(應與引用資料為日文有關)

而在新聞選擇上,國際新聞的時效性更為精準,主題大多以地緣衝突與選舉為主。 這點可以從引用資料來源有限觀察到,Gemini生成國際要聞僅引用3條來源,應該是主題雷同的關鍵 ;而在台灣新聞方面,一貫的引用舊文、過度簡化問題也有發生,甚至有蘇貞昌擔任行政院長時期的新聞。

Gemini新聞.jpg
Gemini歸納新聞的能力有待加強。
圖/ Gemini

選手四:Grok(Grok 3)

在夾帶檔案之後,Grok的特色是會跑出一連串的推論過程(Perplexity也有這個過程),可發現AI確實一步一步的透過提示詞擬定生成內容,並有強調「必須驗證關鍵訊息」。 但Grok生成也耗時相對久,前後約為4分鐘。

首先,Grok的資料結構化功能相當完整,內容優先擷取關鍵訊息,包括「薪資增長」、「行業差異」與「就業動態」,並在往下的篇章逐一描述原因。例如: 「住宿和餐飲業薪資最低,為30,960新台幣,反映了非典型員工比例較高的影響。」

GROK洞察.jpg
Grok的資料結構能力,與Perplexity相當,甚至更理想一些。
圖/ Grok

令人眼睛一亮的是,Grok生成的第二部分是「詳細報告」,其中針對「行業特定數據」進行分析(在沒有進一步提問的情況下),自動將「中位數經常性薪資」依照高低排名,並附上年增率數據(但部分產業數據有遺漏),內文也有進一步高薪行業的背景因素概略說明。

GROK薪資中位數.jpg
Grok的初次生成結果不俗,但部分資料有遺漏問題。
圖/ Grok

而在加分項上追問「請協助列出各產業薪資中位數排名」,Grok在推論接近10分鐘後仍未產出結果。經查詢推論過程, Grok卡關的關鍵在於無法理解中文「中位數」跟「平均數」的定義,而被AI認為是相同的值而產生混亂。

在經過將近13分鐘的推論後, Grok列出一份清單,但「中位數」與「平均數」混淆的問題並未解決。經過思維過程查詢,該表中的「年增率」是Grok利用各產業2024年每個月的總表推論運算而成。 雖然Grok疑似因中文能力而造成錯誤推論,但其推論功能令人眼睛為之一亮。

GROK行業排.jpg
Grok雖然沒有生成正確的表格,但推論過程顯示了改善中文問題後的潛力。
圖/ Grok

來到新聞搜尋環節,Grok與其他AI模型差異頗大,它在新聞篩選上首先考慮了選材多元性。在國際新聞上,烏俄停火被認為是最大頭條,而德州野火則被選為第二名。第三名以後陸續有AI突破、美股下跌等要聞,但與其他家模型一致的是有過度簡化描述的問題,導致參考度不高。

而在台灣新聞方面,Grok甚至指出 「假設3月有總統選舉,結果可能主導新聞走向」 ,可以說凸顯Grok活躍的推論能力,反而可能導致蒐集客觀訊息的能力存在重大偏差。就結論上來說,一樣是國際新聞比台灣新聞更具參考性。

GROK台灣新聞.jpg
Grok在新聞歸納上不盡理想。
圖/ Grok

結論:Perplexity最泛用、Grok推論活躍、Gemini與ChatGPT持平

根據測試結果,各模型在「廣度」、「深度」及「可讀性」三個維度上各有優劣:

ChatGPT(GPT 4.5)

優勢 :反應速度偏快,生成內容重點清楚無誤,數據準確性高。

劣勢 :資料結構性偏低,且對繁體中文支持不足(需多次提醒使用中文),新聞搜尋時效性不佳。

適用場景 :適合需要快速獲取概要資訊的用戶,但對深度研究需求較高者可能不夠理想。

Perplexity(DeepResearch)

優勢 :生成內容結構化程度高,提供深入洞察,且自動生成表格輔助理解,頗為好用。

劣勢 :部分排名仍有錯置問題,台灣本地新聞時效性較差。

適用場景 :適合需要結構化報告與深入分析的用戶。

Gemini(2.0 flash + 1.5 Pro)

優勢 :資料正確性高,生成結果直觀,且可手動優化提示詞,與Google生態系統整合度佳。

劣勢 :無法處理複雜結構化數據,搜尋廣度略低,可讀性較低。

適用場景 :適合簡單資料整理,與重度Google生態系用戶。

Grok(Grok 3)

優勢 :推論過程透明,資料結構化能力最強,且具備活躍推論能力,潛力可期。

劣勢 :處理速度相對慢,對中文詞彙的理解存在偏差,比其他模型明顯更差。

適用場景 :適合需要透明推論過程與多元視角的用戶,但需容忍較長生成時間。

若從訂閱費的CP值角度出發, 目前Gemini、Grok、Perplexity都開放免費用戶試用Deep Research功能 。至於ChatGPT則僅開放Plus方案以上用戶使用,得購買每月20美元方案才能解鎖。

Gemini、Grok、Perplexity雖開放免費使用,但要注意的是次數有限,且有上下文窗口的token限制;目前,Gemini advanced可透過訂閱「Google One AI」使用,月費為新台幣650元;Perplexity Pro訂閱費也是每月20美元;Grok的超級方案則為每月30美元。

不能只靠AI!「人機協作」是優化關鍵

而在評測4家深度搜尋功能後,可以確定的是,目前AI工具的最大貢獻在於免於人類一次性的讀取大量資料,並從中歸納出重要數據,或是代勞部分製表的工作時間,對於需要快速產出數據精華的用戶而言,十分實用。

但在資訊歸納上,AI的資料結構化能力仍有待加強,尤其是在提示詞較為模糊的情況下,會讓AI的推論能力難以發揮;除此之外,AI在梳理資料或是推論上,仍有不低的機率產生錯誤,因此逐一查核數據正確性非常重要。

因此,若用戶要對資料提出更深入的洞察與詮釋,建議還是在充分閱讀資料後,不斷與AI對話並隨之調整提示詞,才可獲得更理想的成果。

最後必須聲明,這份評測是在相當有限的條件限制下推導出來的結果。換言之,任何人使用不同提示詞,都可能會得到更理想的結果,故本文的評測結果有一定侷限。

延伸閱讀:台積電傳找輝達、AMD、博通「合資經營」英特爾!台積持股比率不超過50%
影片|Perplexity教學|讓資料搜尋更簡單的AI!免費版Perplexity怎麼用?4大優點、中文設定一次看

責任編輯:李先泰

本文不開放轉載

往下滑看下一篇文章
從第一天就走向全球!MOOIMOM、大研生醫、特力集團借力亞馬遜出海,以創新、信任打造品牌護城河
從第一天就走向全球!MOOIMOM、大研生醫、特力集團借力亞馬遜出海,以創新、信任打造品牌護城河

在全球「消費升級」的時代,現今消費者要找的,不是最便宜、CP 值最高的產品,而是更安全、更值得信任、更符合需求的商品。在此趨勢下,台灣品牌的優勢反而被放大。

事實上,憑藉著深厚的製造底蘊、對品質的堅持,許多來自台灣的品牌,正透過精準的「價值創新」研發,以及「安全信任」的品牌經營,在亞馬遜上,擄獲各國消費者的青睞。

拒絕等待完美,MOOIMOM 透過出海、迭代快速進化

新創母嬰品牌 MOOIMOM 自 2016 年創立起,便瞄準全球市場,MOOIMOM 創辦人周靖棠指出,近年來,台灣新生兒人數持續下滑,若一開始就只做台灣市場,花去的時間、開發成本都無法撐起未來的成長性,「所以我們第一天就決定『Go Gloabl』,這對新創非常重要。」

AWS-2.png
新創品牌MOOIMOM瞄準母嬰市場,有鑒於台灣新生人口持續負成長,從2016年創立的第一天,創辦人周靖棠就決定Go Gloabl,決心用優質產品,挑戰更大的市場。
圖/ MOOIMOM

MOOIMOM 是從印尼市場起家,再逐步拓展回台灣,但周靖棠隨即又意識到,若「Go Global」僅在東南亞、台灣,仍然有侷限,於是 MOOIMOM 決定加入亞馬遜,跨出亞洲、進軍澳洲等市場,「MOOIMOM 需要一個已經有高信賴度、強大物流、精準數據的夥伴,協助我們降低跨足北美、澳洲等市場的門檻。」

AWS-3
MOOIMOM創辦人周靖棠、共同創辦人李沆澎及團隊,透過運用亞馬遜數據與工具,以最真實的消費者反饋,反覆打磨產品。
圖/ MOOIMOM

為了找到市場缺口、實踐價值創新,MOOIMOM 積極運用亞馬遜上的數據與賣家工具。相較於其他品牌可能會注意自家產品有多少五顆星的評價,周靖棠尤其重視「四顆星」的留言,「因為那往往是能不能從『好』做到『更好』的關鍵。」以 MOOIMOM 的「涼感產後束腹帶」為例,團隊透過評論,發現邊緣縫線會造成皮膚的些微摩擦,加上產婦穿不住悶熱的材質,於是,MOOIMOM 花了近兩年時間,參考亞馬遜後台數據,包括消費者留言、競品的包裝顏色、排名落差等資訊,將產品從 1.0 迭代至 3.0 版本,不僅改採涼感透氣材質,更做到無縫線的舒適感。周靖棠透露,1.0 版的束腹帶,原先一週賣不到 1000 美元,但發展至 3.0 時,除了評價穩定保持在 4.3 顆星以上,一週甚至可以達到1萬美元的營業額,等於成長十倍。

AWS-4.png
圖/ MOOIMOM
AWS-5.png
產後束腹帶三代迭代圖,不僅涼感透氣,更做到無縫線的舒適體驗,讓產後媽媽可以穿得住,真正達到束腹的效果。
圖/ MOOIMOM

另外,周靖棠也善用亞馬遜的「A+ Content」等工具,將「永續」元素植入 MOOIMOM。由於澳洲對環保、安全規範的要求,向來以嚴格聞名,對於跨境電商無法「觸摸實品」的鴻溝,團隊便運用 A+ Content,在產品頁面中將小麥桿融合PP材質等無毒認證和安全細節,讓消費者一目瞭然。針對各國嚴格的母嬰用品法規,團隊也在亞馬遜協助下,一一完成合規程序,把出海阻礙轉化為讓消費者安心買單的保證。

科學實證敲開日本大門,大研生醫靠極致細節贏得信任

以德國頂級魚油、視易適葉黃素等產品聞名的大研生醫,起初是為了自己和家人的保健需求創立,在台灣取得佳績後,大研決定將這份堅持帶向世界。而出海的首站,是保健食品發展逾百年、相當競爭的日本市場。

AWS-6.jpg
大研生醫出海首站就挑戰保健食品發展逾百年、相當競爭的日本市場,大研生醫董事長林東慶表示,進入日本市場真的很辛苦,但當收到日本消費者正向的回饋時,對團隊帶來很大的鼓舞。
圖/ 數位時代

大研生醫董事長林東慶解釋,先選擇日本,是因為當地消費者偏好網購、多居住於公寓,購物習慣、商業環境和台灣相近。至於決定透過亞馬遜進軍日本,一方面出於亞馬遜是日本使用率最高的電商網站之一。其次,在日本市場想「從 0 到 1」發展不易,溝通成本高,「但亞馬遜上的消費者,都很願意接受新東西。代表我們更容易在上面找到對的人。」

林東慶特別提到,日本保健食品市場歷史悠久,卻並非完全沒有切入機會。例如:日本延續過往經驗,原料進展未必跟上時代需求,市面的魚油濃度普遍都不足。除了端出創新的產品之外,想進入相對成熟的日本保健品市場,安全有效、建立信任是唯一真理,「大研經營的正是『信任』,信任背後代表了你的產品、服務和品牌。而亞馬遜就是過程中的最強後盾。」

大研透過亞馬遜的後台數據,從消費習慣與市場需求兩個面向,深入了解日本市場。例如,日本消費者偏好小顆粒、一天可服用多顆保健品;另一方面,日本社會因工作壓力大,助眠、舒緩情緒等產品需求也持續成長。團隊再搭配「在地製造、世界原料」的策略,讓「Made in Japan」成為敲門磚,「就和在台灣帶起『高濃度魚油』的風潮一樣,我們以國際頂級專利原料、強大的科學實證及嚴格的產品檢驗,帶起新趨勢。」

大研甚至將細節延伸至包裝、服務。比方說,日本家戶的信箱尺寸偏小,大研的包裝設計,便要確保能順利投遞進信箱;消費者認為用紙盒包裝更安全,大研也從善如流,採精緻紙盒而非美國市場的簡約瓶裝。由於在每個環節都做到極致,大研才進軍日本亞馬遜半年,就奪下 Omega-3 魚油類目排名第一,整體 BSR 也達到 1000 至 1200 名以內。

接下來,大研計劃進軍極度重視天然與健康的澳洲市場,以及競爭激烈的美國市場,林東慶強調,大研期望透過亞馬遜,將對品質的堅持帶出台灣,成為具影響力的全球品牌。

AWS-7.jpg
大研生醫因應不同市場消費習慣,推出日本、美國、台灣三種版本魚油產品,同樣訴求高濃度、高品質。不僅在生產上呼應其「在地製造、世界原料」的全球化策略,更配合當地市場習慣,量身定做外包裝規劃,左:日本版、中:美國版、右:台灣版德國頂級魚油)
圖/ 數位時代

跳脫傳統代工宿命,特力集團用數據算出市場需求

擁有 30 年歷史的特力集團,從傳統 B2B 貿易起家,如今再下一城、攻入跨境電商市場,在亞馬遜上的營收,每月穩定達到美元六位數。這背後,是一場為了解決傳統代工痛點發起的 DNA 轉型。

特力集團業務總監 Isaac Liao 指出,傳統 B2B 貿易是特力深厚且穩固的根基,但為了在全球供應鏈重組的變局中更具敏捷度,特力必須打破過去與終端市場之間的隔紗。但中上游企業打下游 B2C 戰局,最怕盲目下注或因為怕虧損而不敢試錯。特力的心法,是建立一個「基於數據的科學容錯機制」,把亞馬遜當成全球導航儀,大膽做小規模的市場實驗,算準了、看清了再重注出擊。

AWS-8
特力集團業務總監 Isaac Liao(左三)分享:特力發揮多軌營運優勢,結合在地團隊實體佈局與供應鏈韌性,打造品牌護城河。
圖/ 特力集團

Isaac 透露,特力在歐美家居市場突圍的關鍵,在於用「數據」找出消費者的痛點,再據此創新產品,「中上游企業常覺得自家產品無敵,怎麼會賣不好?但在電商戰場,消費者沒搜那個關鍵字,產品再好都等於不存在。」特力是用亞馬遜的商機探測器、品牌分析工具,抓出高需求、低競爭的藍海市場,並將自家產品、競品的負評,作為研發參考。例如團隊抽絲剝繭後,發現消費者通常在購買資源回收桶時,最痛恨「異味洩漏」和「腳踏板易壞」;買烤肉推車時,則有「說明書看不懂」、「組裝太複雜」等痛點。團隊會再據此回頭改良製程、產品,並將行銷時,將這些痛點的「解方」直接放大在亞馬遜的產品頁面 A+ Content 和主圖影片中。

AWS-9
結合質感美學與實用功能,特力熱銷居家產品主打極窄隙縫省空間設計(左)與質感靜音緩降上蓋(右),精準切中消費者痛點。
圖/ 特力集團

Isaac 特別提到,近期特力導入了亞馬遜行銷雲(Amazon Marketing Cloud, AMC),拆解完整的消費旅程。以特力在亞馬遜熱銷的烤肉推車為例,透過 AMC 的底層數據藍圖,團隊發現歐洲消費者從心動到行動平均需要三週。消費者可能在第一週看球賽時,先被特力的品牌影片廣告(DSP)吸引;第二週滑亞馬遜時,看到展示型廣告(SD)被再次提醒;直到第三週週末要辦派對了,才在搜尋框輸入關鍵字並透過商品廣告(SP)下單結帳,「AMC 讓我們看清這條跨渠道的『消費旅程藍圖』,把過去盲目砸廣告的焦慮,變成每分錢都能精算回報率的高精準 ROI 投資。」

特力已立下月營收達七位數美元的新目標。Isaac 透露,團隊正積極布局生成式引擎優化(GEO)等最新 AI 搜尋趨勢,並根據亞馬遜的後台數據,延伸家居周邊產品線,期望推動內部從「製造思維」進化為「市場和品牌思維」,讓台灣深厚的製造底蘊,能在國際零售舞台上走得更深、更遠。

在迎戰「消費升級」的此刻,台灣企業從來不缺好技術,缺的是直面終端市場的勇氣與機會。而亞馬遜提供的,不只是一套銷售工具,而是一套完整的「持續創新」能力——從全球物流、在地合規,到消費者洞察與數據分析,讓品牌得以直接理解世界各地消費者的真實需求。透過這套基礎設施,品牌能在國際市場中「快速測試、快速修正、快速成長」,把每一次迭代都變成站穩腳步的養分。台灣品牌只要願意邁出第一步,再借力亞馬遜的全球能力,勢必能在世界舞台走得更穩、更遠,實踐「Go Global From Day One」的布局。

想要挑戰跨境,讓更多人認識你的產品嗎?
立即報名 Taiwan Select Day

圖/ Amazon

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
代理式商務連動百兆商機
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓