Token 是什么?为什么各家长短不一
用 AI 产品时你会遇到两种「长度」:一种是字数,一种是 token。看懂 token,计费账单和上下文限制就都看懂了。
Token 是模型眼里的「字」
模型不认识汉字和单词,它读的是 token——文本被分词器切出来的最小单位。同一段话,在模型眼里可能是这样:
我/今天/试用/了/DeepSeek——一句话被切成 5 个 token
规则大致是:英文约 4 个字符或 0.75 个单词折 1 个 token;中文一个字通常折 0.6~2 个 token,取决于分词器和这个字有多「常用」。「的」这种高频字很省,「熵」这种生僻字可能一个字就占两个 token。
为什么各家不一样
分词器是各家自己训练的,词表大小、切分策略不同,同一句话算出来的 token 数就不同。所以「怎么 GPT 算出来 20,Kimi 算出来 25」很正常——不是谁算错了,是尺子不一样。
这也解释了两个常见现象:
- 中英混排的文档,换模型后成本会变;
- 同一份系统提示词,在不同产品里吃掉的上下文额度不同。
上下文窗口:模型的「工作记忆」
产品页常写 8K、32K、128K,指的是模型一次能读入的 token 上限。超了会怎样?要么直接拒绝,要么「只见尾巴不见头」。所以长文档摘要前先估一估体积很有必要——本站的 Token 估算工具就是干这个的,按中英文比例近似估算,够你判断量级。
计费:input 和 output 是两笔账
按量计费的 API 都是输入、输出分开计价,通常 output 比 input 贵几倍。这带来一个省钱技巧:
- 系统提示词写精炼:它每次请求都要付一遍 input 钱;
- 长素材做摘要后再用:第一次花大钱读全文,后续多轮对话只带摘要;
- 要求输出「不超过 N 字」:直接压缩 output 成本。
算一算:你的用法大概花多少
用一个日常例子建立体感:你发了一段 500 字的中文需求 + 一份 2000 字的材料,让 AI 写 300 字的回复。
- 输入:500 + 2000 = 2500 字,按中文约 1.5 字/token 折算 ≈ 1700 tokens;
- 输出:300 字 ≈ 200 tokens;
- 这一轮总共约 1900 tokens,其中 input 占了近九成。
这正是「系统提示词要精炼、长材料先摘要」能省钱的原因:input 是每轮都要重复支付的部分,砍它一次,省的是整个会话。精打细算之前,先用Token 估算看看你的常用提示词体积,超过 2000 tokens 的,都值得瘦身。
两个高频问题
问:为什么对话越长,AI 越容易「忘了开头」? 上下文窗口是有限额度,会话历史加上系统提示词一起占它。老对话要么被截断,要么在部分产品里被摘要压缩——细节丢失由此而来。重要约束(比如格式要求)在长会话里要定期重申。
问:token 数能精确预知吗? 同一家产品内可以(它用自家分词器计算),跨产品只能近似。本站工具给出的是量级估计,做预算够用,做精确对账要以各家控制台的实际计数为准。
顺手抄走:给常用提示词瘦身
理解了「input 每轮重复计费」,就可以让 AI 帮你压缩常用提示词:
你是一位提示词优化师。请把下面的系统提示词压缩到一半以内:
1. 保留全部硬性约束与输出格式要求
2. 合并重复表述,删除客气话与背景铺垫
3. 输出压缩后的版本,并用一行说明压缩比例
原提示词:{{粘贴你的系统提示词}}
压缩完成后,用本站的Token 估算前后对比一下,省下的都是每轮请求的真金白银。
一句话总结
token 是模型的计量单位:上下文看它,账单也看它。理解了「中英文折算不一样」「输入输出分开计价」,你就能对绝大多数 AI 产品的限制和价格做出合理解释。想深入对比各家产品,见主流大模型产品怎么选。