首頁 AI 工具評測 關於我們

Claude Opus 5 實測:我用一題陷阱題比了 Opus 5、Opus 4.8 和 Low effort

Anthropic 在 2026 年 7 月 24 日發布了 Claude Opus 5。官方這次主打的重點很具體:這一代「更會檢查自己的工作、更謹慎地反覆驗證」。這句話聽起來很虛,所以我在它上線當天就登入 claude.ai,用一題我事先知道正確答案、而且刻意埋了陷阱的題目,把 Opus 5、上一代 Opus 4.8、以及 Opus 5 的新「effort(用力程度)」開關各測一次,看看實際回出來的答案長什麼樣。(先講清楚:我看得到的只有輸出文字,無法驗證官方那句關於模型內部的說法。)

先講最重要的結論,因為它跟我原本的預期不一樣:三種設定全都沒有被陷阱騙倒。這三次輸出的差別不在有沒有識破,而在各自多寫了什麼——注意這是三次個別回答的比較,不是模型之間的穩定差距。

目錄

官方這次主打什麼(官方資料整理,非我實測)

以下規格與跑分全部來自 Anthropic 官方發布頁,我沒有能力自行驗證跑分,一律標為官方數據

  • 核心賣點:官方說 Opus 5「much stronger at verifying its work and iterating carefully」(更擅長驗證自己的產出、謹慎迭代),主打代理式(agentic)工作、除錯與根因分析。
  • 價格沒漲:每百萬 token 輸入 5 美元、輸出 25 美元,與上一代 Opus 4.8 相同;官方說是 Fable 5(10/50 美元)的一半。
  • 新的 effort 開關:可在 Low/Medium/High 之間切換,官方定位是「在智慧程度與省 token/求快之間取捨」。
  • 官方列的跑分:Frontier-Bench v0.1 稱「超過 Opus 4.8 表現的兩倍」、CursorBench 3.2 稱「與 Fable 5 高分差距在 0.5% 以內但成本減半」、ARC-AGI 3 稱「約為次佳模型的三倍」、OSWorld 2.0 稱以約三分之一成本超越 Fable 5。
  • 可用範圍:官方列出 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、claude.ai、Claude Code 等。實際方案與計費請以官方頁為準。

(本文寫作當下的價格與方案以官方頁面為準;這類資訊變動快,看到本文時請點上面的官方連結再確認一次。)

我怎麼設計這一題:看輸出會不會自己指出「前提有問題」

我沒辦法看到模型內部做了什麼,所以我能做的是給一題「照著公式硬算就會得出荒謬答案」的題目,然後看它的輸出會不會自己先指出前提有問題。我用的是這題:

一個水池容量 500 公升,現在裡面有 200 公升水。進水管每小時注入 30 公升,同時出水管每小時排出 50 公升。請問幾小時後水池會裝滿?請給我計算過程和答案。

陷阱在哪:進水 30、出水 50,淨變化是每小時「少」20 公升——水只會越來越少,這個水池永遠不會裝滿。如果模型只顧著套公式「還差的水 ÷ 每小時變化」,就會算出 (500−200)÷(30−50) = −15,得到一個「負 15 小時」的荒謬答案卻照樣講得頭頭是道。而輸出裡有沒有先指出「方向不對」,是我從外面唯一看得到的線索——我看得到的是文字結果,看不到模型內部到底做了什麼。

實測一:Opus 5(effort = High)

Claude Opus 5 實測截圖:水池陷阱題,Opus 5 判定水池永遠不會裝滿、算出10小時後排空,並主動提出題目數字可能寫反並算出15小時
Opus 5(High)實測畫面:識破陷阱之後,還主動假設「題目數字可能寫反」並把那個版本的答案也算出來。

它開頭第一句就是「這題的數字其實有問題」,然後把過程攤開:算淨變化(30−50=每小時 −20 公升)→ 判斷方向(負的,所以「幾小時後裝滿」永遠不會發生)→ 反過來算「那它多久會排乾」(200÷20 = 10 小時後空掉)。

真正讓我覺得有意思的是它沒有停在「無解」就交差。它接著補了一段:如果題目本來是想寫成「進水 50、出水 30」(淨 +20),那答案會是還要裝 300 公升、300÷20 = 15 小時後裝滿,最後請我回頭確認一下進出水的數字是不是寫反了。

換句話說,這次的輸出除了指出前提有問題,還多寫了一段「你可能想問的是另一個版本」並把它算完。這次回答從送出到寫完約 17 秒

實測二:同一題丟給上一代的 Opus 4.8(effort = High)

Claude Opus 4.8 實測截圖:同一題水池陷阱題,Opus 4.8 同樣判定無解與10小時後排空,但沒有提出替代情境
同一題、同樣 High,換成上一代 Opus 4.8:一樣沒被騙,但回答到「無解」就結束了。

這裡要老實說:上一代的 Opus 4.8 也沒有被騙。它一樣算出淨變化 −20、一樣指出「永遠不可能裝滿到 500 公升」、一樣給出 200÷20 = 10 小時後排空,還直接下了「所以這題無解」的判斷。

這兩次輸出的差別在後半段:上一代的 Opus 4.8 這次到「無解」就收尾,沒有推測題目可能哪裡寫錯、也沒給替代情境。它回得比較快,約 10 秒(各跑一次,快慢也可能只是當下的變異)。

所以如果你看到別處說「新模型才抓得到陷阱題」,至少在我這一題上不成立——上一代這次也抓到了。這兩次看得到的差別,只是其中一次多寫了一個替代情境。

實測三:把 Opus 5 的 effort 調成 Low,同一題的答案會變差嗎?

Claude Opus 5 把 Effort 調成 Low 的實測截圖:同一題仍判定不會裝滿並算出10小時後排空
Opus 5 但 effort 切到 Low:同一題,一樣識破陷阱。

這是我最想知道的一題,因為 effort 開關是這代的新東西:調低來省 token 求快,同一題的輸出會不會就不再指出前提有問題?

我跑了兩次,兩次都一樣識破(兩次不足以斷言「調低 effort 不會影響輸出品質」,只能說這兩次的輸出都有指出前提有問題)。Low 一樣算出淨變化 −20、一樣明講「不管等幾個小時,都不可能從 200 公升漲到 500 公升」、一樣給出 10 小時排空。它甚至也給了延伸:如果想問「進水管要調到多少才裝得滿」,答案是進水必須大於 50 公升/小時才會開始上升。

時間上,Low 這次約 12 秒、High 約 17 秒就這一題的這幾次來說,Low 的輸出並沒有比 High 少掉哪個步驟,省下的時間也有限。

這幾次測下來,我實際的感受

先說清楚一件事:官方那句「更會檢查自己的工作」是在講模型能力,而我這一題驗證不了「更會」。上一代同樣識破了陷阱,而「多算一個假設情境」也不等於驗證得更徹底。我能誠實說的只有:這一次,Opus 5 的輸出多寫了一段筆誤推測並請我確認,上一代的 Opus 4.8 那次沒有。我原本預期的差別是「新的抓得到、舊的抓不到」,結果不是這樣——這點值得先講,免得被跑分表帶著走。

要給一句實用的話,我只敢給到這裡:在我測的這一題上,Low 的輸出沒比 High 少什麼,所以「一律開 High」不見得必要——但一題不足以推薦你把所有任務都調成 Low,值得你拿自己每天真的在問的題目各跑一次比比看。

誠實說明這次實測的限制

  • 這是單次觀察,不是系統性評測。每個設定我各跑一次(Low 我跑了兩次、結論一致),單一題目、單次結果不能推論成模型的整體能力,也不排除隨機變異——同樣的題目你再問一次,措辭與詳略都可能不同。
  • 只測了一種情況。我測的是「面對前提有問題的題目,輸出會不會指出前提有問題」,沒有測程式開發、長文件、影像、代理式長任務。官方主打的 agentic 與除錯能力,我這次沒有實測。
  • 所有跑分數字都是官方的,我沒驗證過。Frontier-Bench、ARC-AGI、OSWorld 那些倍數是官方發布頁的說法,本文只做轉述。
  • 價格與可用範圍以官方頁為準,這類資訊隨時可能調整。
  • 測試環境:claude.ai 網頁版、繁體中文提問、2026 年 7 月 25 日(發布隔日)。

想自己驗一次的話,成本很低:把上面那題水池題原封不動貼進去,看它會不會先停下來說「這題數字有問題」。這比看跑分表更能感覺到差別在哪。

返回頂端