Token
AI用来计算文本的单位。费用和使用量全部按Token计算。
简单来说
AI不是按字符来读写文本的,而是按“Token”为单位。Token是经常使用的语言片段——一个英文单词通常是12个Token,韩语大致上一个字是12个Token。可以大致理解为“1个Token≈几个短音节”。
这个单位之所以重要,是因为费用和限制全部按Token计算。AI公司的价格表写的是“每百万Token多少美元”,免费使用额度、一次能处理的文本量(上下文窗口)也都是以Token为单位。
就像水费按“升”计算一样,AI使用费按“Token”计算——记住这一点,费用相关的报道就一下子看懂了。
在报道中是这样出现的
“新模型的API价格是每百万输入Token 3美元”——意思是处理几百页A4纸的内容大概只需几美元。输入(用户输入的文本)和输出(AI生成的文本)的单价不同也是一个特点。
亲手试一试
- 在搜索框中搜索“OpenAI tokenizer”,打开分词器体验页面。
- 分别输入一句英文和意思相同的一句韩语,比较Token数量。
- 大多数情况下韩语会被切分成更多Token——也就是说同样的内容却要花更多的计费单位,“韩语AI更贵”的争论正是由此而来。
Token和参数,有什么不同
是往来文字的量吗, 是模型内部数字的个数吗
两者都是用来衡量规模的数字,所以文章里出现「700亿」这种数字时,很容易分不清指的是哪一个。一个是你输入和收到的文字量,另一个是模型本身有多大。用得越多就越涨的是前者,模型做出来那一刻就定了、不再变的是后者。
| 对比项 | Token | 参数 |
|---|---|---|
| 数的是什么 | 把往来的文字切分后计数的单位 | 模型内部可调节的旋钮数量 |
| 会变吗 | 用得越多就越增加 | 模型做成时就定了,不再变化 |
| 和费用的关系 | 计费按这个算 | 越大,运行成本越贵 |
| 文章中常见说法 | 「百万Token上下文」「每Token单价」 | 「70B模型」里的B指的就是这个 |
| 比喻 | 打电话的分钟数 | 那个人脑子里的脑细胞数 |
判断方法用得越多就越涨的是Token,模型做出来那一刻就定了、不再变的是参数。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。