1M Token 是多少
这里的 token 是模型计量文本的基本单位,和控制台里创建的 API 令牌(也常叫 Token)不是一回事。你发给模型的提示词、上下文、历史消息,以及模型返回的内容,都会被拆成 token 计入用量。1M Token 就是一百万个 token。
它不等于一百万个汉字,也不等于一百万个单词——具体怎么拆,由每个模型的分词器(tokenizer)决定。
token 是怎么算的
把 token 理解成「模型眼里的文字颗粒」:
- 一个常见英文单词大约是 1 个 token,较长或少见的单词会被拆成几个。
- 一个中文句子通常被拆成多个 token,数量取决于模型。
- 标点、空格、换行、代码符号也会单独计入。
- 一次请求里的系统提示词、历史对话、工具参数、模型输出,全都算 token。
粗略换算
不同模型和语言会有差异,下面是常见的估算:
| 内容 | 粗略关系 |
|---|---|
| 英文文本 | 约 4 个字符 ≈ 1 token |
| 英文单词 | 约 75 个单词 ≈ 100 tokens |
| 中文文本 | 1 个汉字通常约 1~2 个 token |
| 代码 | 符号和缩进都计入,通常比同长度短文更费 token |
所以 1M Token 大致相当于约 400 万个英文字符、约 75 万个英文单词;中文方面,1M token 大致对应 50 万~100 万汉字的量级。不同模型分词差异较大,不建议按字数硬套,精确数值以「使用日志」里的实际用量为准。
一百万 token 能做多少
下面帮你建立直观感受。实际消耗会随语言、模型、上下文和输出长度变化。
| 场景 | 单次大致消耗 | 1M Token 大约可支持 |
|---|---|---|
| 很短的问答 | 100 - 300 tokens | 3,000 - 10,000 次 |
| 普通聊天对话 | 500 - 1,500 tokens | 600 - 2,000 次 |
| 一段代码解释 | 2,000 - 5,000 tokens | 200 - 500 次 |
| 一篇中长文章总结 | 3,000 - 8,000 tokens | 125 - 330 篇 |
| 一份产品文档问答 | 10,000 - 30,000 tokens | 30 - 100 份 |
| 一次长会议纪要整理 | 15,000 - 40,000 tokens | 25 - 65 次 |
对个人日常使用,1M Token 通常够用很久;对团队,它更适合用来估算某个项目或客户端的真实消耗。
计费上要记住的几点
- 输入和输出都计费,不是只算模型的回答。
- 输出越长越贵;历史上下文越长,每次请求也越贵。
- 不同模型的分词器和价格都不同,同一段文字在不同模型上的 token 数和费用可能不一样。
- 同一个模型,输入 token 和输出 token 的单价也可能不同。
所以看用量时别只数请求次数,还要看每次带了多少上下文、返回了多少内容、用的是哪个模型。具体价格以模型广场为准。