跳到主要内容

1M Token 是多少

这里的 token 是模型计量文本的基本单位,和控制台里创建的 API 令牌(也常叫 Token)不是一回事。你发给模型的提示词、上下文、历史消息,以及模型返回的内容,都会被拆成 token 计入用量。1M Token 就是一百万个 token。

它不等于一百万个汉字,也不等于一百万个单词——具体怎么拆,由每个模型的分词器(tokenizer)决定。

token 是怎么算的

把 token 理解成「模型眼里的文字颗粒」:

  • 一个常见英文单词大约是 1 个 token,较长或少见的单词会被拆成几个。
  • 一个中文句子通常被拆成多个 token,数量取决于模型。
  • 标点、空格、换行、代码符号也会单独计入。
  • 一次请求里的系统提示词、历史对话、工具参数、模型输出,全都算 token。

粗略换算

不同模型和语言会有差异,下面是常见的估算:

内容粗略关系
英文文本约 4 个字符 ≈ 1 token
英文单词约 75 个单词 ≈ 100 tokens
中文文本1 个汉字通常约 1~2 个 token
代码符号和缩进都计入,通常比同长度短文更费 token

所以 1M Token 大致相当于约 400 万个英文字符、约 75 万个英文单词;中文方面,1M token 大致对应 50 万~100 万汉字的量级。不同模型分词差异较大,不建议按字数硬套,精确数值以「使用日志」里的实际用量为准。

一百万 token 能做多少

下面帮你建立直观感受。实际消耗会随语言、模型、上下文和输出长度变化。

场景单次大致消耗1M Token 大约可支持
很短的问答100 - 300 tokens3,000 - 10,000 次
普通聊天对话500 - 1,500 tokens600 - 2,000 次
一段代码解释2,000 - 5,000 tokens200 - 500 次
一篇中长文章总结3,000 - 8,000 tokens125 - 330 篇
一份产品文档问答10,000 - 30,000 tokens30 - 100 份
一次长会议纪要整理15,000 - 40,000 tokens25 - 65 次

对个人日常使用,1M Token 通常够用很久;对团队,它更适合用来估算某个项目或客户端的真实消耗。

计费上要记住的几点

  • 输入和输出都计费,不是只算模型的回答。
  • 输出越长越贵;历史上下文越长,每次请求也越贵。
  • 不同模型的分词器和价格都不同,同一段文字在不同模型上的 token 数和费用可能不一样。
  • 同一个模型,输入 token 和输出 token 的单价也可能不同。

所以看用量时别只数请求次数,还要看每次带了多少上下文、返回了多少内容、用的是哪个模型。具体价格以模型广场为准。

继续阅读