PLAY AI 筆記回 PLAY AI
AI 知識科普發布 · 5 分鐘 · 約 2,288 字

Token 是什麼?為什麼 AI 收費都用 Token 算:從文字切分到成本估算一次看懂

Token 不是字數,也不是訊息次數,而是模型真正讀取與產生內容時使用的計量單位。搞懂 input、output、cache 與 tokenizer,就能看懂 AI API 為什麼這樣計價。

PLAY
PLAY AI 編輯部把複雜概念拆成一般人也讀得懂的版本,聚焦名詞解釋、比較、來源與實作脈絡。
本篇內容
Token 是什麼?為什麼 AI 收費都用 Token 算:從文字切分到成本估算一次看懂
Token 是什麼?為什麼 AI 收費都用 Token 算:從文字切分到成本估算一次看懂

如果你開始用 ChatGPT API、Claude API、Gemini API,或任何以大型語言模型為核心的服務,很快就會遇到一個看似抽象的單位:Token。很多人第一個疑問是:為什麼不用字數、秒數或一則訊息多少錢,而要另外發明 Token?答案其實跟模型怎麼讀文字、怎麼產生答案,以及服務商怎麼衡量實際運算量有關。

先講結論:Token 是模型真正『吃進去』的文字單位

人類看到的是句子、單字與中文字;模型在運算時看到的則是一串 token。Tokenizer 會先把輸入拆成模型詞彙表中的片段,再交給模型處理。這個片段可能是一個完整單字、單字的一部分、標點、空格附近的組合,甚至在某些語言裡接近單一字元。

因此,Token 不等於『一個字』,也不等於『一個英文單字』。OpenAI 提供的英文粗略估算是 1 token 約 4 個字元、約四分之三個英文單字;但這只能當英文估算,中文、程式碼、數字、特殊符號與不同 tokenizer 都可能有不同結果。

為什麼同一句話,在不同模型的 Token 數可能不一樣?

因為 tokenizer 本身就是模型設計的一部分。不同供應商、不同模型世代可能使用不同詞彙表與切分方式。同一段文字換一個模型,可能被切成不同數量的 token;甚至模型升級 tokenizer 後,相同內容的 token 數也可能改變。

  • 語言不同:英文常能用常見字根或單字片段表示,中文與混合語言的切法可能不同。
  • 內容不同:程式碼、網址、表格、JSON、特殊符號可能比一般自然語言更密集。
  • 模型不同:每個模型使用的 tokenizer 與詞彙表不一定相同。
  • 上下文不同:空格、大小寫與相鄰字元也可能影響切分結果。

AI API 為什麼用 Token 收費,而不是按『一則訊息』收費?

因為兩則訊息的成本可能差非常多。『幫我翻譯這一句』和『讀完一份數十萬字文件,再整理成報告』雖然都只送出一次請求,但模型實際處理的資料量完全不同。Token 能把輸入與輸出規模量化,讓使用量更接近實際的模型運算負載。

最常見的 3 種 Token:Input、Output、Cached Input

  1. Input tokens:你送進模型的內容,包括 prompt、對話歷史、系統指令,以及某些工具定義等。
  2. Output tokens:模型生成的回答。許多服務的 output 單價會高於 input,因為模型需要逐步產生新 token。
  3. Cached input tokens:相同或可重用的前綴內容如果命中 prompt cache,部分平台會用較低費率計算。

部分推理模型還會記錄 reasoning tokens 或其他內部用量類別。是否計費、怎麼歸類,要以各家 API 的 usage 欄位與最新定價規則為準。

費用怎麼估?先用這個公式就夠了

最基本的估算方式是:Input 成本 + Cached Input 成本 + Output 成本。也就是把每一類實際 token 數除以一百萬,再乘上該模型對應的每百萬 token 費率。若還有搜尋、影像生成、工具呼叫或其他額外能力,則再加上那些服務自己的計價項目。

這也解釋了為什麼只看『每百萬 Token 單價』還不夠。便宜模型如果需要更長 prompt、更多重試或產生更多輸出,最後總成本不一定比較低。真正值得看的,是完成一個任務需要多少總 token,以及成功完成一次工作的成本。

為什麼對話越聊越久,API 成本常會往上?

在一般聊天 API 裡,模型通常需要看到足夠的前文才能延續上下文。如果每一輪都把大量歷史訊息再次送進模型,input tokens 就會一路增加。這也是為什麼正式產品常會做對話摘要、截斷過舊內容、RAG 檢索或 prompt caching,而不是無限把全部歷史原文塞回去。

圖片、音訊也有 Token 嗎?

Token 不只跟文字有關。Google 的 Gemini 文件明確說明,文字、圖片、音訊與影片等輸入都會被模型轉成可計量的 token。不同模型對影像尺寸、音訊長度與影片採樣方式有不同規則,因此多模態成本要看該模型的官方計數方式,不能直接用文字 token 的經驗值換算。

實務上怎麼把 Token 成本壓下來?

  • 不要每次都傳整份文件:先檢索真正相關的段落。
  • 縮短固定 system prompt 與工具 schema,只留下必要規則。
  • 重複的大型前綴善用 prompt caching。
  • 限制不必要的輸出長度,讓模型回答到足夠就停。
  • 批次工作先估 token,再選模型,不要只看單價。
  • 記錄每次 request 的 usage,直接用真實資料做成本監控。

最後記住:Token 是『計量單位』,不是固定大小的字

把 Token 想成 AI 模型的計量單位,就會比把它硬換算成字數更準確。模型先把內容 token 化,處理 input tokens,再逐步產生 output tokens;平台再依模型與 token 類別計價。當你理解這一層,API 帳單、context window、max tokens、prompt caching,甚至為什麼長對話會越來越貴,都會變得容易理解。