首頁 AI 工具評測 關於我們

Claude Opus 5 實測:三題親測,還撞到官方沒寫的 effort 級別

Anthropic 在 2026 年 7 月 24 日發布了 Claude Opus 5官方這次主打的重點很具體:這一代「更會檢查自己的工作、更謹慎地反覆驗證」。這句話聽起來很虛,所以我在它發布隔天就登入 claude.ai,用一題我事先知道正確答案、而且刻意埋了陷阱的題目,把 Opus 5、上一代 Opus 4.8、以及 Opus 5 的新「effort(用力程度)」開關各測一次,看看實際回出來的答案長什麼樣。(先講清楚:我看得到的只有輸出文字,無法驗證官方那句關於模型內部的說法。)

先講最重要的結論,因為它跟我原本的預期不一樣:三種設定全都沒有被陷阱騙倒。這三次輸出的差別不在有沒有識破,而在各自多寫了什麼——注意這是三次個別回答的比較,不是模型之間的穩定差距。

目錄

官方這次主打什麼(官方資料整理,非我實測)

以下規格與跑分全部來自 Anthropic 官方發布頁,我沒有能力自行驗證跑分,一律標為官方數據

  • 核心賣點:官方說 Opus 5「much stronger at verifying its work and iterating carefully」(更擅長驗證自己的產出、謹慎迭代),主打代理式(agentic)工作、除錯與根因分析。
  • 價格沒漲:每百萬 token 輸入 5 美元、輸出 25 美元,與上一代 Opus 4.8 相同;官方說是 Fable 5(10/50 美元)的一半。
  • 新的 effort(用力程度)開關:官方定位是「在智慧程度與省 token/求快之間取捨」。官方發布頁沒有把級別列成清單,只在跑分段落順口提到 highxhighmax,以及「最低的 effort 設定」。介面上實際看到幾級、叫什麼名字,我下面有一段專門講——那兩邊對不上
  • 官方列的跑分:Frontier-Bench v0.1 稱「超過 Opus 4.8 表現的兩倍」、CursorBench 3.2 稱「與 Fable 5 高分差距在 0.5% 以內但成本減半」、ARC-AGI 3 稱「約為次佳模型的三倍」、OSWorld 2.0 稱以約三分之一成本超越 Fable 5。
  • 可用範圍:官方列出 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、claude.ai、Claude Code 等。實際方案與計費請以官方頁為準。

(本文寫作當下的價格與方案以官方頁面為準;這類資訊變動快,看到本文時請點上面的官方連結再確認一次。)

我怎麼設計這一題:看輸出會不會自己指出「前提有問題」

我沒辦法看到模型內部做了什麼,所以我能做的是給一題「照著公式硬算就會得出荒謬答案」的題目,然後看它的輸出會不會自己先指出前提有問題。我用的是這題:

一個水池容量 500 公升,現在裡面有 200 公升水。進水管每小時注入 30 公升,同時出水管每小時排出 50 公升。請問幾小時後水池會裝滿?請給我計算過程和答案。

陷阱在哪:進水 30、出水 50,淨變化是每小時「少」20 公升——水只會越來越少,這個水池永遠不會裝滿。如果模型只顧著套公式「還差的水 ÷ 每小時變化」,就會算出 (500−200)÷(30−50) = −15,得到一個「負 15 小時」的荒謬答案卻照樣講得頭頭是道。而輸出裡有沒有先指出「方向不對」,是我從外面唯一看得到的線索——我看得到的是文字結果,看不到模型內部到底做了什麼。

實測一:Opus 5(effort = High)

Claude Opus 5 實測截圖:水池陷阱題,Opus 5 判定水池永遠不會裝滿、算出10小時後排空,並主動提出題目數字可能寫反並算出15小時
Opus 5(High)實測畫面:識破陷阱之後,還主動假設「題目數字可能寫反」並把那個版本的答案也算出來。

它開頭第一句就是「這題的數字其實有問題」,然後把過程攤開:算淨變化(30−50=每小時 −20 公升)→ 判斷方向(負的,所以「幾小時後裝滿」永遠不會發生)→ 反過來算「那它多久會排乾」(200÷20 = 10 小時後空掉)。

真正讓我覺得有意思的是它沒有停在「無解」就交差。它接著補了一段:如果題目本來是想寫成「進水 50、出水 30」(淨 +20),那答案會是還要裝 300 公升、300÷20 = 15 小時後裝滿,最後請我回頭確認一下進出水的數字是不是寫反了。

換句話說,這次的輸出除了指出前提有問題,還多寫了一段「你可能想問的是另一個版本」並把它算完。這次回答從送出到寫完約 17 秒

實測二:同一題丟給上一代的 Opus 4.8(effort = High)

Claude Opus 4.8 實測截圖:同一題水池陷阱題,Opus 4.8 同樣判定無解與10小時後排空,但沒有提出替代情境
同一題、同樣 High,換成上一代 Opus 4.8:一樣沒被騙,但回答到「無解」就結束了。

這裡要老實說:上一代的 Opus 4.8 也沒有被騙。它一樣算出淨變化 −20、一樣指出「永遠不可能裝滿到 500 公升」、一樣給出 200÷20 = 10 小時後排空,還直接下了「所以這題無解」的判斷。

這兩次輸出的差別在後半段:上一代的 Opus 4.8 這次到「無解」就收尾,沒有推測題目可能哪裡寫錯、也沒給替代情境。它回得比較快,約 10 秒(各跑一次,快慢也可能只是當下的變異)。

所以如果你看到別處說「新模型才抓得到陷阱題」,至少在我這一題上不成立——上一代這次也抓到了。這兩次看得到的差別,只是其中一次多寫了一個替代情境。

實測三:把 Opus 5 的 effort 調成 Low,同一題的答案會變差嗎?

Claude Opus 5 把 Effort 調成 Low 的實測截圖:同一題仍判定不會裝滿並算出10小時後排空
Opus 5 但 effort 切到 Low:同一題,一樣識破陷阱。

這是我最想知道的一題,因為 effort 開關是這代的新東西:調低來省 token 求快,同一題的輸出會不會就不再指出前提有問題?

我跑了兩次,兩次都一樣識破(兩次不足以斷言「調低 effort 不會影響輸出品質」,只能說這兩次的輸出都有指出前提有問題)。Low 一樣算出淨變化 −20、一樣明講「不管等幾個小時,都不可能從 200 公升漲到 500 公升」、一樣給出 10 小時排空。它甚至也給了延伸:如果想問「進水管要調到多少才裝得滿」,答案是進水必須大於 50 公升/小時才會開始上升。

時間上,Low 這次約 12 秒、High 約 17 秒就這一題的這幾次來說,Low 的輸出並沒有比 High 少掉哪個步驟,省下的時間也有限。

補測一:官方主打的「除錯與根因分析」,我丟一段真的有 bug 的程式給它

上面那題是數學陷阱,跟官方主打的「除錯與根因分析」其實搭不太上,所以我補測了一題真正的除錯題:一段會在特定輸入下算錯的合併重疊區間程式。這題的 bug 我事先就知道在哪,所以能逐項核對它有沒有講對。

這段合併重疊區間的程式在某些輸入下會給錯答案,幫我找出 bug、說明根因,並給修正版:
def merge_ranges(ranges): ranges.sort() ... if start <= last_end: merged[-1] = (last_start, end)(完整程式碼見下圖)

Claude Opus 5 除錯實測截圖:模型指出 bug 在 merged[-1] = (last_start, end) 這行,根因是排序只保證開頭遞增不保證結尾遞增,並舉出輸入 (1,10) 與 (2,3) 會算成 (1,3) 的錯誤例子
Opus 5(effort=Low)除錯實測畫面前半段:指出 bug 在哪一行、寫出根因,並直接舉出會算錯的輸入。畫面右下的模型列標著「Opus 5 Low」。

逐項核對如下(這次是 effort 開在 Low 跑的):

  • 抓到真正的那一行merged[-1] = (last_start, end) 直接把結尾換成新區間的結尾,沒有比較誰比較大。
  • 根因講對了:它寫「排序只保證『開頭』是遞增的,不保證『結尾』也是遞增的」——這句直接把根因說清楚了,比只寫一句「要記得取最大值」具體得多。
  • 舉得出會出錯的實際輸入[(1, 10), (2, 3)] 會被算成 (1, 3),正確答案是 [(1, 10)]。這點我最看重——它舉出的反例我實際核對過、確實會重現這個 bug,代表這次的輸出不只給了修法,還給了可以自己驗的案例。(我只看得到輸出,看不到它內部怎麼推的。)
  • 還抓到兩個我沒問的問題:空 list 進來會在 ranges[0] 直接 IndexError;ranges.sort() 會就地改動呼叫方傳進來的 list(副作用)。
Claude Opus 5 除錯實測截圖後半段:修正版把結尾改成 max(last_end, end),附五組驗證案例,最後給出相鄰接觸是否算重疊的判斷點
同一則回答的後半段:修正版把結尾改成 max(last_end, end),附五組驗證案例,最後補一句「剛好碰到不算重疊的話,條件要改成 start < last_end」的判斷點。

修正版就是把那一行改成取 max(last_end, end),並改用 sorted() 不動原始輸入。它另外附了五組驗證案例,最後補一句判斷點:如果你的定義是「剛好碰到不算重疊」(例如 (1,4) 和 (4,5) 要分開),條件要從 start <= last_end 改成 start < last_end這句是整段裡我覺得最有價值的——它沒有替我決定,而是把「這裡有個定義你還沒講清楚」指出來,讓我自己決定。

誠實界線:這是一題、跑一次。我沒有拿同一題去跑上一代 Opus 4.8 做對照,所以這段不能拿來說「Opus 5 比較會除錯」——只能說這一次它把根因講對了、也舉得出反例。而且這題是常見的邊界錯誤、難度不高,不代表真實專案裡那種橫跨多個檔案的除錯。

補測二:需要多步規劃的排程題,effort 開 Low 跟 High 差在哪

前面水池那題只要一步判斷,看不出 effort 開關的差別。所以我另外設計了一題需要多步規劃的:四個工作、兩個人、彼此有前後相依,問最少要幾小時。這題我事先手算過,答案是 6 小時

A 需要 3 小時,沒有前置。B 需要 2 小時,必須等 A 做完才能開始。C 需要 4 小時,沒有前置。D 需要 1 小時,必須等 B 和 C 都做完才能開始。全部做完最少要幾小時?請說明排法。

陷阱在於:總工時 3+2+4+1=10 小時,兩個人「看起來」5 小時就該做完;但 A→B→D 是一條綁死的相依鏈,3+2+1=6 小時,再多找人也壓不下去。只拿總工時除以人數會得到 5;正確答案必須符合 A→B→D 這條相依鏈造成的 6 小時下限。

Claude Opus 5 Low effort 多步規劃實測截圖:四個工作兩人排程,算出最少 6 小時並列出時間表
effort=Low:答 6 小時,附三列的時間表。
Claude Opus 5 High effort 多步規劃實測截圖:同一題四個工作兩人排程,同樣算出最少 6 小時,並多算出總工時與閒置時間
effort=High:同一題同樣答 6 小時。它把 B 拆成 3–4、4–5 兩列,並多算了一段「總工時 10 小時、兩人理論最快 5 小時、必然有 1 小時閒置」。

兩邊都答對 6 小時,也都主動指出 A→B→D 是關鍵路徑、再多人也沒用。差別在寫法:

  • Low(15.2 秒):三列的時間表加一段說明,把「為什麼不可能更快」講完就收。
  • High(25.4 秒):時間表拆成四列(把 C 跨過第 3 小時那段也拆開),並多算一段——總工時 10 小時、兩人理論最快 5 小時,但因為相依卡在 6 小時,所以中間必然有 1 小時閒置。

在這兩次單次執行裡,High 那次比 Low 那次多花 10.2 秒,多出來的是一段量化分析;兩次的答案同樣都是 6 小時。

要先講清楚一件事,免得被我誤導:三題裡只有這一題我真的做了 Low/High 同題對跑,另外兩題(水池題的 Low、除錯題)都只有 Low 的結果。所以我不能說「effort 調低不影響正確率」或「調高只是講得比較細」——那需要更多題、更多次。我能誠實講的只有:這幾次 Low 的輸出都答對了,而唯一那次同題對跑,兩邊的答案一樣。

一個只有點進去才知道的落差:官方文案的 effort 名稱,跟介面對不上

這是這次實測我覺得最實用的一個發現:官方發布頁沒有列出完整的級別清單,我是實際展開介面選單才看到的

官方發布頁從頭到尾沒有把 effort 級別列成一張清單。它只在跑分段落裡順口提到「on high, xhigh, and max effort」「at max effort」,以及「Even at its lowest effort setting」。你整篇看完,其實不會知道到底有幾級、每一級叫什麼。

claude.ai 介面 Opus 5 的 Effort 選單截圖:實際列出 Low、Medium、High(標示 Default)、Extra、Max 五個級別
claude.ai 模型選單 →「Effort」實際展開的樣子:五個級別,High 那一列標著 Default。

實際點開 claude.ai 的模型選單、再點「Effort」,看到的是五個級別

  • Low
  • Medium
  • High——旁邊標著 Default,也就是你什麼都不設,跑的就是這一級
  • Extra
  • Max——名稱旁有一個說明用的 ⓘ 圖示

對不上的地方在名字:官方文案提到 xhigh,但我看到的介面上沒有 xhigh,在 High 和 Max 中間的那一級叫做 Extra;而「Extra」這個字,在整篇官方發布頁裡一次都沒有出現過Extra 是不是就是文案裡的 xhigh,官方發布頁並沒有說明,我光憑這兩個畫面也無法確認——我能確定的只有:你看完官方公告去介面找「xhigh」,會找不到那個字。

另一個實用的點:預設是 High,不是最低那一級。那個選單自己寫著「Higher effort means more thorough responses, but takes longer and uses your limits faster」(用力程度越高,回答越完整,但花的時間更久、也更快吃掉你的用量)。換句話說,如果你在意用量,什麼都不動的情況下你跑的是第三高的那一級,不是最省的

誠實界線:這是我這個帳號、2026 年 7 月 25 日、claude.ai 網頁版看到的畫面。不同方案、不同時間、或是 API 那邊看到的級別很可能不一樣,介面選項本來就隨時會調整——請以你自己點開看到的為準。

這幾次測下來,我實際的感受

先說清楚一件事:官方那句「更會檢查自己的工作」是在講模型能力,而我這一題驗證不了「更會」。上一代同樣識破了陷阱,而「多算一個假設情境」也不等於驗證得更徹底。我能誠實說的只有:這一次,Opus 5 的輸出多寫了一段筆誤推測並請我確認,上一代的 Opus 4.8 那次沒有。我原本預期的差別是「新的抓得到、舊的抓不到」,結果不是這樣——這點值得先講,免得被跑分表帶著走。

補測那兩題之後,我能多說的也很有限,但方向一致:除錯那題它把根因講對了、還舉得出具體反例,也主動點出一處我沒問到的定義模糊多步規劃那題 Low 和 High 都答對,差別在 High 多寫了一段量化分析。三題的 Low 結果都答對了;但只有排程那一題我做了 Low/High 同題對跑,所以這不能當成「調低 effort 不影響正確率」的證據。

要給一句實用的話,我只敢給到這裡:在我唯一那次同題對跑裡,我看不出 High 在關鍵步驟上有什麼差異,至於其他任務需不需要開 High,這次測試回答不了。真的想知道的話,建議挑幾種你日常會做的任務,Low 和 High 各重複跑幾次,再綜合正確性、完整度、耗時和用量一起看。順帶一提,你如果從來沒動過那個開關,你跑的是 High(預設),不是最省的那一級。

誠實說明這次實測的限制

  • 這是單次觀察,不是系統性評測。每個設定我各跑一次(Low 我跑了兩次、結論一致),單一題目、單次結果不能推論成模型的整體能力,也不排除隨機變異——同樣的題目你再問一次,措辭與詳略都可能不同。
  • 測到的範圍很窄。我測了三種:前提有問題的陷阱題、一段有 bug 的程式(除錯根因)、一題需要多步規劃的排程題。沒有測長文件、影像、以及官方主打的代理式(agentic)長任務——那種要連續呼叫工具、跑很多步的情境,我這次完全沒碰到。除錯那題也只有一題、且沒跟上一代對照。
  • 所有跑分數字都是官方的,我沒驗證過。Frontier-Bench、ARC-AGI、OSWorld 那些倍數是官方發布頁的說法,本文只做轉述。
  • 價格與可用範圍以官方頁為準,這類資訊隨時可能調整。
  • 測試環境:claude.ai 網頁版、繁體中文提問、2026 年 7 月 25 日(發布隔日)。水池題三次跑在 effort=High/High/Low;除錯題跑在 Low;排程題 Low 與 High 各跑一次。

常見問題

Opus 5 的 effort 到底有幾級?我該用哪一級?

我在 claude.ai 介面上看到的是五級:Low、Medium、High(標示為 Default)、Extra、Max。官方發布頁沒有列出清單,只提到 high、xhigh、max;介面上則有 Extra、沒有 xhigh。Extra 是不是就是文案裡的 xhigh,官方沒有明說,我也無法只憑畫面確認。至於該用哪一級:我測的三題 Low 單次結果都答對了;三題裡只有多步規劃那一題另外跑了 High,那一次 High 多寫一段分析、比 Low 多花 10.2 秒,答案兩邊一樣。這是少數幾題的單次觀察,推不出通則。真要決定的話,建議挑幾種你日常會做的任務,Low 和 High 各重複跑幾次,再綜合正確性、完整度、耗時和用量一起看。

Opus 5 比上一代 Opus 4.8 強在哪裡?

我唯一做過同題對照的只有那道水池陷阱題,結果是兩代都沒被騙倒,差別只在 Opus 5 那一次多寫了一段「你的數字可能寫反了」的推測。除錯題和排程題我沒有跑 4.8 對照,所以不能說誰比較強。官方發布頁列了 Frontier-Bench、ARC-AGI、OSWorld 等跑分優勢,那些是官方數據,我沒有能力驗證。

Opus 5 有漲價嗎?

依官方發布頁,每百萬 token 輸入 5 美元、輸出 25 美元,與上一代 Opus 4.8 相同。這是官方數字、我沒有驗證,而且價格與方案隨時可能調整,請直接點官方頁面確認當下的價格。

官方說 Opus 5「更會檢查自己的工作」,實際感覺得到嗎?

我看得到的只有輸出文字,驗證不了模型內部到底做了什麼,所以那句話我沒辦法證實或否定。我能講的具體事實是:除錯那題它主動舉出一組會算錯的實際輸入、另外抓到兩個我沒問到的問題(空 list、就地排序的副作用),並指出一處定義不清的判斷點。那代表輸出比較完整,但不等於官方那句關於模型內部的說法被驗證了。

這篇算是實測還是官方資料整理?

兩種都有,而且分開標。三道題目的提問、五張介面截圖、回答耗時,都是我實際在 claude.ai 上跑出來的;規格、價格、可用平台、所有跑分數字,全部來自官方發布頁,我沒有驗證,文中一律標為官方數據。

想自己驗一次的話,成本很低:把上面那題水池題原封不動貼進去,看它會不會先停下來說「這題數字有問題」。這比看跑分表更能感覺到差別在哪。



返回頂端