Claude實測|ChatGPT最強對手再升級:減少AI幻覺、設定人設、一口氣讀15萬字!
Claude實測|ChatGPT最強對手再升級:減少AI幻覺、設定人設、一口氣讀15萬字!

如果問當下最強的 AI 助手是哪個?那無庸置疑,絕對是 ChatGPT。

前不久 ChatGPT 猝不及防地故障了,直接炸出一大批重度用戶。靠它完成作業的的學生族群,一時之間面對論文無從下筆,靠它「續命」的打工人更是連班都不想上了。

今年以來,ChatGPT 每隔一段時間就會「暴斃」,號稱其最強平替的 Claude 或許是你最可靠的備選方案。

延伸閱讀:ChatGPT最強對手「Claude」開放台灣註冊、兩步驟免費用!能讀整本書?支援中文?

Claude 2.1 大更新一次看

更新一:上下文長度翻倍至200K token

恰巧,近日 Claude 進行一波大更新。以往 Claude 能處理的上下文只有 10 萬 token(token 是文本處理中的最小單位,如單字或片語),現在 Claude 2.1 Pro 版能處理高達 200K 上下文。

Anthropic 官方表示,200K 上下文約等於 150000 個單字或 500 頁文本,這意味著你可以上傳代碼、財務報表、或長篇文學作品,供 Claude 進行總結、問答、預測趨勢、比較和對比多個文檔。

那它能處理漢語的能力有多強呢?我們可以以此前飽受爭議的 Yi-34B 舉例說明。同樣是發布支持 200K 超長上下文窗口版本, Yi-34B 可以處理約 40 萬漢字超長文本輸入,約等於一本《儒林外史》的長度。

在語言模型上,長上下文能夠提供更精確的用法和含義,有助於消除歧義,幫助模型生成連貫、準確度的文本,比如「蘋果」一詞出現在「摘採水果」或「新款 iPhone」上,含義就完全迥異。

值得一提的是,在 GPT-4 尚未恢復即時網路瀏覽功能之前,免費的 Claude 能夠即時訪問網頁連結並總結網頁內容,即使到了現在,也是當下 GPT-3.5 所不具備的優點。

免費版 Claude 還能讀取、分析和總結用戶上傳的文檔,哪怕碰上 GPT-4,Claude 處理文檔的表現也絲毫不遜色。

我們同時給當下網頁版的 Claude 和 GPT-4「喂」了一份 90 頁的 VR 產業報告,並詢問同樣的問題。

3-2.jpg!720.jpeg
圖/ 愛范兒
4-3.jpg!720.jpeg
圖/ 愛范兒

二者的反應速度沒有拉開差距,但免費版 Claude 的回覆反而更流暢,且答案的質量也略高,而 GPT-4 的檢索功能還會因為分頁和檢視受到限制,相當不「靈性」。

檢索只是「兒戲」,作為提高學習或工作效率的工具,我們需要的是更「聰明」的模型。當我讓它們分析 VR 行業五年後的變化格局,雖然表達的觀點都差不多,但 Claude 以富有邏輯的分點作答取勝。

8-4.jpg!720.jpeg
圖/ 愛范兒
9-4.jpg!720.jpeg
圖/ 愛范兒

更新二:降低模型幻覺,寧願表達遲疑也不會給不正確的答案

答是能答得上來,能不能答對才是關鍵。過去一年,我們目睹不少被大模型「滿嘴跑火車」坑了的悲傷案例。Anthropic 稱 Claude 2.1 的虛假或幻覺類陳述減少了 2 倍,但它也沒有給出明確的數據,以至於輝達科學家 Jim Fan 提出質疑:「最簡單實現 0% 幻覺的解決方案就是拒絕回答每一個問題。」

10-3.png!720.jpg
圖/ 愛范兒

Anthropic 還設計了很多陷阱問題來檢驗 Claude 2.1 的誠實度。多輪結果表明,遇到知識的盲區,Claude 2.1 更傾向於不確定的表達,而不是生造似是而非的回答來欺騙用戶。

簡單點理解就是,假如 Claude 2.1 的知識圖譜裡沒有「廣東的省會不是哈爾濱」這樣的儲備,它會誠懇地說「我不確定廣東的省會是不是哈爾濱」,而不是言之鑿鑿地表示「廣東的省會是哈爾濱」。

更新三:增添新應用「工具使用」,整合API

Claude Pro 的訂閱費用約為 20 美元,使用次數達到免費版的五倍,普通用戶可以發送的消息數量將根據消息的長度有所不同。還剩 10 條消息時,Claude 就會發出提醒。

假設你的對話長度約為 200 個英語句子,每句 15-20 個單字,那麽你每 8 小時至少能發送 100 則訊息。若你上傳了像《大亨小傳》這樣大的文檔,那麽在接下來的 8 小時裡你可能只能發送 20 則訊息。

除了普通用戶,Claude 2.1 還貼心的根據開發者的需求,推出了一項名為「工具使用」的測試版功能,允許開發者將 Claude 集成到用戶已有的流程、產品和 API 中。

也就是說,Claude 2.1 可以調用開發者自定義的程式函數或使用第三方服務提供的 API ,可以向搜尋引擎查詢訊息以回答問題,連接私有數據庫,從數據庫搜尋訊息。

你可以定義一組工具供 Claude 使用並指定請求。然後 Claude 將決定需要哪種工具來完成任務並代表他們執行操作,比如使用計算器進行複雜的數值推理,將自然語言請求轉換為結構化 API 等。

Anthropic 也做出了一系列改進提供 Claude API 的開發者更好地服務,結果如下 👇
• 開發者控制台優化體驗和用戶界面,使基於 Claude API 的開發更便捷
• 更容易測試新的 prompt(輸入提示/問題),有利於模型的持續改進
• 讓開發者像在沙盒環境中叠代試錯不同的 prompt
• 可以為不同的項目創建多個 prompt 並快速切換
• prompt 的修改會自動保存下來,方便回溯
• 支持生成代碼集成到 SDK 中,應用到實際項目中

更新四:導入系統提示功能,維持Claude人設

此外,Claude 2.1 還引入了「系統提示」功能,這是一種向 Claude 提供上下文和指令的方式,能夠讓 Claude 在角色扮演時更穩定地維持人設,同時對話中又不失個性和創造力。當然,不同於簡單 Prompt 的應用,該功能主要是面向開發者和高級用戶設計的,是在 API 使用的,而不是在網頁端使用。

和 Claude 2.0 一樣,Claude 2.1 每輸入 100 萬 token 需要花費 8 美元,比 GPT-4 Turbo 便宜了 2 美元,輸出為 24 美元,比 GPT-4 Turbo 便宜了 6 美元。適用於低延遲、高吞吐量的 Claude Instant 版本每輸入 100 萬 token 需要收費 1.63 美元,輸出為 5.51 美元。

是ChatGPT殺手還是平替?

就目前而言,雖然 Claude 2.1 表現很強悍,但仍只能充當 ChatGPT 當機的替代品,想要顛覆 ChatGPT 還有很長的路要走。打個不太嚴謹的比方,Claude 2.1 就像是丐版的 GPT-4。

以 Claude 2.1 Pro 最擅長的 200K 為例,儘管 Claude 2.1 Pro 理論處理能力上要比 128K 的 GPT-4 Turbo 更強,但實際結果顯示,在需要回憶和準確理解上下文的能力上,Claude 2.1 Pro 還是要遠遜色於 GPT-4 Turbo。

OpenAI 開發者大會之後,網友 Greg Kamradt 曾對 GPT-4-128K 的上下文回憶能力進行了測試。透過使用 Paul Graham(美國著名程式設計師)的 218 篇文章湊了 128K 的文本量,他在這些文章的不同位置(從文章頂端 0% 到底部 100%)隨機插入一個語句:「在陽光明媚的日子裡,在多洛雷斯公園吃三明治是在舊金山的最佳活動。」

然後他讓 GPT-4 Turbo 模型搜尋這個語句,並回答有關這個語句的相關問題,最後採用業界常用的 LangChain AI 評估方法來評估答案。

14-2.png!720.jpg
圖/ 愛范兒

評估結果如上圖,GPT-4 Turbo 可以在 73K token 長度內保持較高的記憶準確率。倘若訊息位於文檔開頭,無論上下文有多長,它總能檢索到。只有當需要回憶的訊息位於文檔的 10%-50% 區間時,GPT-4 Turbo 的準確率才開始下降。

作為對比,該網友還提前要到了 Claude 2.1 Pro 的內測資格,並同樣做了「大海撈針」的測試。從評估的結果來看,在長達 20 萬 token(大約 470 頁)的文檔中,和 GPT-4 Turbo 一樣,Claude 2.1 Pro 文檔前部的訊息比後部的回憶效果差一些。

但 Claude 2.1 Pro 上下文長度效果較好的區間是在 24K 之前,遠低於 GPT-4 Turbo 的 73K。超過 24K 後,Claude 2.1 Pro 記憶就開始明顯下降,90K 後,效果變得更差,出錯率更是大幅度上升。

可以看到的是,隨著上下文長度的增加,GPT-4 Turbo 和 Claude 2.1 Pro 檢測的準確度都在逐漸降低。儘管 Claude 2.1 Pro 的測試覆蓋了更寬的上下文長度,但相比更實用的準確度,GPT-4 Turbo 還是 Claude 2.1 Pro 需要追趕的對象。

Claude 或許是免費版中最強的大模型之一。如果你是文字工作者,當 ChatGPT 崩潰,堪比 GPT-3.8 的 Claude 能夠解決你的燃眉之急,甚至表現得要更好。

但個性化的 GPTs、輕鬆生圖的 DALL·E3,語音交流等功能都是 ChatGPT 不可多得的護城河。在強大的 GPT-4 Turbo 面前,升級後的 Claude 2.1 Pro 版本也得敗下陣來。

延伸閱讀:客製化太夯,ChatGPT Plus暫停註冊!開發者大會後為何網站被擠爆?亮點一次看

本文授權轉載自:愛范兒ifanr
責任編輯:蘇祐萱

往下滑看下一篇文章
《星城》告別 Online,打破的不只是名字!網銀國際的「泛娛樂」願景,下一步怎麼走?
《星城》告別 Online,打破的不只是名字!網銀國際的「泛娛樂」願景,下一步怎麼走?

近年遊戲公司的競爭早已不只是留住玩家,而是爭奪使用者的日常娛樂時間。遊戲、短影音、直播、社群、IP 授權、線下活動都在搶同一批注意力;當遊戲產業的競爭從單一產品體驗,轉向使用者日常娛樂時間的爭奪,品牌能否跨出遊戲場景、進入影音、社群與生活,便成為老牌遊戲平台延長生命週期的關鍵。因此,遊戲品牌從「產品經營」走向「內容經營」,成為產業發展的合理趨勢。

2026 年 7 月起,網銀國際旗下經營超過 18 年的休閒娛樂品牌《星城 Online》正式更名為《星城》,同步啟動為期一個月的品牌月系列活動,從線上遊戲福利、影音內容、社群貼圖,到線下實體互動全面鋪開。

拿掉「Online」,看似只是識別上的調整,實際上是一次明確的宣告:這個品牌不再把自己定義為「一款線上遊戲」,而是要往內容娛樂、IP 經營、跨界合作的方向延伸。用網銀國際的說法,目標是「把娛樂融入生活」。

從產業角度來看,單一遊戲產品的生命週期往往有限,玩家喜新厭舊的速度很快,一款遊戲再怎麼長青,終究會面臨用戶成長趨緩的天花板;相較之下,內容與 IP 的價值可以跨平台、跨載體被重複利用,也更容易隨著時間累積成品牌資產。對一個已經經營 18 年的老牌來說,與其持續在單一產品上加碼,不如把長期累積的用戶基礎,轉化成內容娛樂生態的起點。

泛娛樂願景,邊界劃在哪裡

把服務邊界從單一遊戲平台,擴張到內容產製與 IP 經營,幾乎是近幾年線上娛樂產業共同的功課。玩家不再只滿足於一款好玩的遊戲本身,而是期待品牌能提供更有情感連結、更貼近日常的內容體驗,這也是「泛娛樂」這個詞近年頻繁出現在遊戲業轉型論述裡的原因。

對網銀國際來說,這樣的路線並非臨時起意。這家成立於 2009 年的集團,本業雖以遊戲研發與代理起家,但版圖早已橫跨數位娛樂、影視製作、電競戰隊等多元領域,而《星城》正是集團資源品牌化的重要窗口。網銀國際本來就具備豐沛的泛娛樂資源,透過這次《星城》的更名,這些資源才更容易被消費者理解成一個具體的品牌體驗,也讓外界更容易看見「泛娛樂」布局的落地。

IP 經營,是願景的現在進行式

比起口號,更能說服人的永遠是正在發生的行動。品牌月期間,全新 YouTube 頻道《XinFun 星泛娛樂》於 7 月 1 日正式上線,讓品牌指標性的遊戲角色跳脫原本的機台設定,化身生活短劇主角,一連 7 天每晚 7 點固定釋出新內容,後續也將持續規劃角色短劇、節慶互動與玩家共鳴題材,成為長期經營的內容入口;同步上線的還有角色版 LINE 個性貼圖,把遊戲角色帶進使用者的日常對話裡。品牌吉祥物「星城好冰友」也在這波煥新中迎來視覺升級,新增「小鵝」「小鴨」兩個角色,把「小額娛樂、理性遊玩」的概念轉化成更親和的形象。

星城-2.png
網銀國際旗下《星城》品牌煥新,吉祥物「星城好冰友」新增「小鵝」「小鴨」兩角色,將「小額娛樂、理性遊玩」理念轉化為更親和的視覺形象。
圖/ 網銀國際
星城-3.jpg
品牌月期間同步推出角色版 LINE 個性貼圖,讓《星城》遊戲角色走入玩家日常對話,強化 IP 在社群場景的日常曝光與情感連結。
圖/ 網銀國際

IP 走出螢幕的動作,也不只發生在線上。今年 4 月,《星城》連續參與白沙屯媽祖進香與大甲媽祖遶境,並特別加開「累了請上車」休息巴士,陪伴信眾走過前後橫跨 15 天的年度信仰巡禮。從角色內容化到走進廟會現場,這類操作要驗證的其實是同一件事:「娛樂融入生活」不是一句廣告詞,而是品牌願意把資源實際投入到玩家生活場景裡的具體行動。

這種「虛實整合」的操作邏輯,其實也呼應了內容產業近年的共同趨勢:IP 的價值不再只靠單一載體撐起,而是要靠角色、影音內容、線下場景多點觸及,才能真正在使用者心中留下記憶點。

星城-4.jpg
今年 4 月《星城》連續參與白沙屯媽祖進香與大甲媽祖遶境,加開「累了請上車」休息巴士,陪伴信眾走過橫跨 15 天的信仰巡禮。
圖/ 網銀國際

數位信任工程,是願景能走多遠的地基

不過,一個品牌想從遊戲延伸到內容、IP 甚至跨界合作,光有創意還不夠,背後的信任基礎才是能不能走遠的關鍵。尤其對仰賴金流與帳號安全運作的娛樂平台而言,信任從來不是加分項,而是先決條件。

網銀國際在這塊的布局,其實已經行之有年。平台導入 OTP 驗證與帳號多層防護機制,針對異常儲值行為與高風險帳號建立風險監測與處置流程,並設有 24 小時客服巡檢與主管機關聯繫窗口,持續參與防詐治理相關會議。這些機制平常不太會被玩家注意到,卻是支撐品牌敢往內容娛樂、跨界合作等更複雜業務延伸的底氣。

而從集團近期布局來看,網銀國際投資信任科技與防詐服務業者 Gogolook,也透露出其對數位信任基礎建設的重視。對《星城》這類高度仰賴帳號、金流與使用者信任的平台而言,防詐能力與風險治理,將是品牌能否走向更大泛娛樂合作場景的重要底層能力。

另一個值得留意的細節是,《星城》過去成功取得日本講談社等國際知名動漫 IP,如新世紀福音戰士等的官方授權,開發聯名機台。國際版權方在授權合作前,通常會針對合作企業進行嚴格的商譽與信用調查,順利通過審查,某種程度上也是外部對企業信譽的一次客觀驗證,而不只是單方面的自我宣稱。

對線上娛樂產業而言,信任機制往往是「看不見卻決定成敗」的一塊。玩家不會因為平台治理做得好而每天掛在嘴邊,但一旦信任出現破口,品牌過去累積的內容力與 IP 資產都可能一夕歸零。換個角度看,能夠通過國際版權方的商譽審查、持續維持與監理單位的溝通管道,也讓網銀國際在後續尋求跨界合作與 IP 授權時,握有更高的議價籌碼。

更名是起點,行動已經在路上

把《星城》放回台灣泛娛樂產業的座標來看,這不是第一家想從遊戲公司轉型成內容集團的業者,卻是少數把「信任機制」和「IP 內容」同時當成轉型兩隻腳、同步往前走的案例。

不過,從遊戲平台走向泛娛樂品牌,真正的考驗不在於一次品牌月能創造多少聲量,而在於內容是否能持續更新、角色能不能累積辨識度,以及線上下互動能否形成長期社群關係。對《星城》而言,告別 Online 是起點,能否把短期活動轉化為穩定內容資產,才是這場品牌煥新的關鍵。

觀察其未來走向,主要可以從三個面向切入:

  1. 內容頻率:《XinFun 星泛娛樂》能否從品牌月短期企劃變成穩定的內容頻道,持續維持更新動能。

  2. IP 延展:角色能否從貼圖、短劇走向更多授權、聯名與線下體驗,累積長期辨識度。

  3. 信任治理:責任遊戲、防詐與平台安全能否成為品牌差異化的底層能力,而不只是合規描述。

這條路已經開始走,接下來能否將短期聲量沉澱為長期的社群資產與防禦壁壘,將是這場轉型能否走得遠的真正考驗。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂工業AI
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓