這篇寫給誰:要編團隊預算、做模型選型的人。如果你想先弄懂 token 到底怎麼切、中文為什麼比英文貴、各家計算器差在哪,先看這篇:Token 計費機制拆解。
目錄
先別急著看價目表,很多人一開始就把 token 算錯了
常見的誤解之一,是把 token 直接當成「字數」或「單字數」。於是有人估算 API 成本時,抓一篇一千字的文章就當成一千個 token,結果實際帳單跟預期差了一大截。這個落差,往往就是成本失控的起點。
Token 是大型語言模型處理文字的最小計費單位,但它跟「字」不是一對一的關係。主流模型多半用一種叫 BPE(Byte Pair Encoding)的切詞方式,把文字拆成常見的片段。英文裡一個常見單字可能是一個 token,較長或罕見的字則會被拆成好幾個。中文的情況更需要注意:以子詞方式切分時,一個中文字常常不只對應一個 token,這代表同樣一段話,中文內容吃掉的 token 通常比你直覺想的多。
所以成本控制的第一步,不是先去比誰便宜,而是先搞懂「你的文字會變成多少 token」。這個數字抓對了,後面的估算才站得住腳。
輸入和輸出為什麼要分開算

商用模型的計費,常見的做法是把「輸入」和「輸出」拆成兩筆分開計價。輸入指的是你送進去的東西——你的提示詞、系統設定、還有對話歷史;輸出則是模型生成回你的內容。這兩者的單價常常不一樣,至於各自標多少、哪一邊高,以各家官方定價頁為準。從機制上看,輸入是模型讀進你給的內容,輸出則是模型逐一生成每個 token,兩者的處理方式不同,這也是官方常把它們分開計價的原因。
這帶出一個很實際的控制點:對話式應用如果把完整歷史一直往後帶,輸入 token 會像滾雪球一樣越滾越大。你以為只是多聊了幾句,實際上每一次呼叫都把前面所有內容重新計費一遍。單次帶進去的內容越多、送進模型的輸入 token 就越多;在按 token 計價的前提下,這次呼叫的輸入費用也會跟著變多。
換句話說,控制成本有兩個方向:一是壓縮「你送進去多少」,二是控制「模型吐出多少」。很多預算優化的技巧,本質上都在這兩件事上打轉。
把四家主流模型的計費結構放在一起看
下表整理的是計費的「結構」;具體單價我另外列在表格下方,並標了查證日期與來源。要說在前面的是:各家的單價、折扣比例、免費額度都會調整,任何一篇文章寫下的數字都有保鮮期。所以下面每個數字我都標了「哪一天、從哪一頁讀到的」,你真要下決策時,拿那個連結去核對當月報價即可。
先給你幾個真實的參考點,免得整段只剩結構沒有數字。以下都是 2026-07-28 當天從各家官方定價頁讀到的、每百萬 token 的價格(USD):
- Anthropic(官方頁):Claude Haiku 4.5 輸入 $1/輸出 $5;Claude Sonnet 5 輸入 $2/輸出 $10,但這是優惠價、官方頁明載只到 2026-08-31,2026-09-01 起回到輸入 $3/輸出 $15;Claude Opus 5 輸入 $5/輸出 $25。
- OpenAI(官方頁,標準計費、短脈絡那一欄):gpt-5.6-luna 輸入 $1/輸出 $6;gpt-5.6-terra 輸入 $2.50/輸出 $15;gpt-5.6-sol 輸入 $5/輸出 $30。同一頁另有長脈絡的欄位,價格更高(以 luna 為例,輸入 $2、輸出 $9),所以看報價時要先確認自己落在哪一欄。
- Google Gemini(官方頁):這頁沒辦法用一個數字代表——它把型號、模態(文字/圖片/影片/音訊)與計費模式分開列,同一個「每百萬 token」欄位下有十幾組數字,而且部分型號還有免費額度。要比價就得先確定你用的是哪一個型號、哪一種模態。
- DeepSeek(官方頁):deepseek-v4-flash 是輸入 $0.14(快取未命中)/輸出 $0.28,快取命中的輸入低到 $0.0028;deepseek-v4-pro 則是 $0.435/$0.87。
兩件事值得你從這組數字裡讀出來。第一,同一家的旗艦與輕量模型可以差好幾倍(Anthropic 那兩檔是五倍、DeepSeek 那兩檔約三倍),任務分層是實打實的省錢。第二,優惠價會到期——上面 Claude Sonnet 5 那一條就是活生生的例子,照優惠價編出來的年度預算,九月起就會失準。
還有一個容易看走眼的地方:輸出的單價高於輸入——上面有列出文字輸入/輸出單價的 Anthropic、OpenAI 與 DeepSeek 三家都是如此(Gemini 那頁按模態分開列,不在這個比較裡)。但這不代表「砍回覆長度一定比精簡提示詞省」——真正省下來的錢是「少掉的 token 數 × 該方向的單價」,兩邊要各自算過才知道哪邊划算。如果你的應用是長提示詞、短回覆,精簡輸入反而才是重點。
至於這張表為什麼刻意不填「誰最便宜」的分數:即時價格會變、各家還常有階段性折扣,我沒有辦法給你一個當下就正確、下個月也正確的排名。與其給一個會過期的名次,不如教你自己算。想更完整比對消費端的訂閱方案,可以搭配我先前整理的AI 工具訂閱方案那篇一起看。
用計算器把一個真實場景的成本抓出來
光看單價沒有意義,要乘上「用量」才是你真正付的錢。各家官方大多提供 token 計算器或 tokenizer 工具,可以把一段文字丟進去、看它會變成多少 token;不方便的話,一個粗略但夠用的抓法是把預估 token 數當成後續乘法的基礎,重點是流程走通。
我們拿一個很常見的場景走一遍:假設你要做一個客服問答機器人,每天處理 2000 次對話,平均每次輸入 600 token、輸出 400 token。算法是這樣:
- 每次對話:600 + 400 = 1000 token
- 每日:2000 次 × 1000 = 200 萬 token(其中輸入 120 萬、輸出 80 萬)
- 每月(以 30 天計):輸入 3600 萬 token、輸出 2400 萬 token
接著把 token 數乘上你選用模型的單價。這裡用官方公告的真實單價走一次,你才看得出量級:以 Anthropic 的輕量模型 Claude Haiku 4.5 為例,輸入每百萬 token US$1、輸出每百萬 token US$5(Anthropic 官方定價頁,2026-07-28 查證)。代進去:輸入 36 × 1 = US$36,輸出 24 × 5 = US$120,合計約 US$156/月。
換一個旗艦模型,同一個場景的數字會整個跳一級。同一頁上 Claude Opus 5 是輸入 US$5、輸出 US$25,代進去就是 36 × 5 + 24 × 25 = US$780/月——同樣的客服機器人,月成本變成原本的五倍。這就是「先分層再選模型」為什麼值得做的原因。
這個算法真正的價值不在最後那個數字,而在於它讓你看清楚:輸出雖然 token 數只有輸入的三分之二,在這個例子裡卻吃掉了 US$120、佔月費約七成七。所以在這個例子裡,「限制模型的回覆長度」動到的正是佔比較大的輸出那一塊。把同一套算法換上不同模型的官方單價,你就能自己做出一張屬於你這個場景的成本對照表——它反映的是你自己的真實用量,而不是通用排名。
企業要控成本,該從哪幾個地方下手

個人用戶多半付訂閱制,成本相對固定;但企業走 API 用量計費,花費會隨業務量放大,所以更需要一套框架。以下幾個方向,是控成本時值得優先檢查的。
先分層,別讓大砲打蚊子
不是每個任務都需要旗艦模型。分類標籤、簡單摘要、格式轉換這類任務,可以先評估輕量模型是否足以應付;需要複雜推理的環節,再動用高階模型。旗艦與輕量模型的單價往往有明顯差距,把任務按複雜度分流,是常見的省錢做法之一。
把成本監控接進流程
看不到的花費,往往就是失控的起點。各家官方後台多半有用量儀表板,可以看到 token 消耗與費用;另一種做法是在自己的程式裡就記錄每次呼叫的 token 數,按功能、按用戶分帳,這樣才知道錢花在哪。設定用量告警、預算上限,能避免某個迴圈失控把帳單燒穿。
善用平台級的降本機制
幾個常見的方向:非即時的大量任務(例如夜間批次處理資料)可以看官方是否提供批量處理管道;重複出現的長提示詞(例如固定的系統指令)可以看有沒有快取機制能避免重複計費。這些功能各家支援情況不同,實際請查官方文件,但它們背後的邏輯是共通的——別為同樣的東西付兩次錢。
把這三件事串起來,中小企業其實不需要複雜的採購流程:先用上一節的算法估出各業務場景的月成本,把簡單任務分層下放,接一個最基本的用量監控,就已經能擋掉不少常見的浪費。至於「該選哪家」,我的看法是——對還在驗證產品、用量不穩定的小團隊,單看「先跑起來、隨用量調整」這個面向,我會偏向先挑一個有免費層或試用額度、方便你把上面那套算法實測一遍的平台,把真實數字抓出來再決定要不要重壓;用量一旦穩定、金額變大,才值得花力氣去做跨平台的單價比價與遷移。先算清楚,再選貴的還是便宜的,順序別顛倒。
三種團隊,三種算法

接案開發者:預算敏感、用量起伏大
假設你是一個接案的獨立開發者,同時手上有兩三個用到 AI 的小專案,收入不穩、也不想被固定月費綁死。你的重點會放在「按用量付費、能隨時關掉」的彈性上。實務上會建議你把每個專案的 token 用量分開記帳,簡單任務盡量用輕量模型,並且盯緊輸出長度——因為對這種規模,輸出失控很容易吃掉利潤。
中小企業 PM:要導入 AI 但沒有大預算
假設你是一家二十人公司的產品經理,老闆同意試水溫但預算有限。你需要的是一份能講給老闆聽的成本預估。這時前面那套「用量 × 單價」的算法就是你的簡報素材:把預計的日呼叫次數、平均輸入輸出長度填進去,算出月成本區間,再加上任務分層能省下的幅度。有了可驗證的數字,導入決策就不是憑感覺。
大量文件處理的營運團隊:批次任務為主
假設你的團隊每天要處理大量文件——合約摘要、報表分類、資料清洗。這類任務多半不需要即時回覆,很適合排成批次在離峰時段跑。你的優化重點會是:確認官方是否提供批量處理管道、把重複的系統提示詞抽出來看能不能快取,並且對長文件切塊處理,避免把超長上下文一次塞進去導致單次成本暴衝。若你的文件流程還牽涉多語言,翻譯環節的成本可以參考AI 翻譯工具那篇一起評估。
常見問題
中文的 token 到底比英文貴多少?
沒有一個固定倍數可以套用,因為它取決於各家模型的 tokenizer 怎麼切詞、以及你的文字內容。以子詞切分的方式來說,一個中文字常常不只對應一個 token,所以同樣「一段話」,中文吃掉的 token 通常比英文多。要抓準確數字,可靠的做法是把你實際會用到的中文樣本,丟進該模型官方的 tokenizer 工具算一次,而不是憑一個網路上聽來的倍數估算。不同模型算出來可能不一樣,這也是為什麼估成本一定要用你自己的真實文字去試。
到底哪個模型最便宜?
老實說,我沒辦法給你一個「永遠正確」的答案,任何寫死的排名都會過期——各家單價會調、還常有階段性折扣。更重要的是,「最便宜」對你不一定等於「最省錢」:一個單價低但需要來回多次才能完成任務的模型,總成本未必比單價高、一次到位的模型划算。與其問誰最便宜,不如用文章裡那套「用量 × 官方當月單價」的算法,拿你自己的真實場景各跑一遍,比出來的才是對你有意義的答案。
免費額度能撐一個正式產品嗎?
部分平台會提供試用額度或免費層,具體額度以各家官方為準,而且政策會變。免費額度很適合拿來做原型驗證、把成本算法實測一遍,但要撐一個穩定的正式產品通常不夠,因為多半有速率或用量上限。我的建議是把免費額度當成「測量工具」而不是「營運資源」——用它把你的真實 token 用量抓出來,再據此估算正式上線後的月成本,而不是指望它一直免費幫你扛流量。
輸入輸出分開計價,我該先優化哪一邊?
先看你的場景哪一邊 token 量大、單價又高。輸入與輸出可能採不同單價,實際費率以各家官方定價為準;若你採用的模型是輸出單價高於輸入,而你的應用又是「短輸入、長輸出」(例如寫長文),那控制輸出長度就會很有感;如果是「長輸入、短輸出」(例如塞一大堆上下文問一個小問題),那精簡輸入、善用快取才是重點。用文章裡的算法把輸入、輸出各自的月花費拆開算一次,你馬上就知道該把力氣花在哪邊,不用瞎猜。
批量處理和快取真的能省很多嗎?
這兩個機制背後的邏輯是「別為同樣的東西重複付錢」與「非即時的任務用較低成本的管道跑」。各家是否提供、折扣幅度多少,請以官方文件為準,我無法保證一個固定的省錢比例。實務上判斷值不值得導入,關鍵在你的任務特性:如果你有大量可以延遲、可以排隊的批次工作,或有大段固定重複的提示詞,那這類機制就值得研究;如果你全是即時、且每次內容都不同的呼叫,能省的空間就比較有限。
中小企業導入 AI,第一步該做什麼?
先算清楚,別急著選工具。第一步是把你打算用 AI 的幾個業務場景列出來,估計每個場景的日呼叫次數、平均輸入與輸出長度,用文章的算法乘出月成本。有了這張成本地圖,你才知道哪些場景值得投入、哪些可以優先考慮成本更低的做法。接著再接一個基本的用量監控(後台儀表板或自己記帳都行),設個預算上限。工具選型反而可以放在後面——因為當你手上有真實的用量數字,比價才有意義。
對話應用的成本為什麼會越用越貴?
多半是因為把完整對話歷史一直往後帶。當你每次呼叫都把前面所有的對話內容一起送進去,這些內容就會被當成輸入再計費一次,聊得越久、輸入 token 就滾得越大,成本自然節節上升。控制方法有幾種:只保留最近幾輪對話、把較早的內容摘要壓縮後再帶、或看官方是否提供快取來降低重複內容的成本。設計對話應用時,把「上下文管理」當成一個要主動控制的變數,而不是放著讓它自由膨脹。
值得自己寫一個 token 成本計算工具嗎?
看規模。如果你只是偶爾估一下,用各家官方的 tokenizer 加上手算就夠了,沒必要另外開發。但如果你是要長期營運、多個功能都在燒 token 的團隊,把 token 計數與費用記錄直接接進自己的程式,好處是能按功能、按用戶分帳,看清楚錢花在哪、哪個功能的單位成本較高。這不需要多複雜,很多平台的 API 回應本身就會回傳這次用了多少 token,你只要把它記下來累計即可。與其說是「寫計算器」,不如說是「把成本變成可觀測的數據」。
最後更新:2026 年
喜歡這篇評測?
👉 瀏覽 AI 工具庫,找到適合你工作流程的 AI 工具。
