🧠 图解记忆:Token 是模型眼里的积木;点击图片可查看原图。
Token 是 LLM 处理文本的基本单位(不是字,也不是词)。
| 语言 | 仅用于估算的经验值 |
|---|---|
| 英文 | 常见分词器中,1 token 往往约为 4 个英文字符或 0.75 个单词 |
| 中文 | 一个汉字可能对应一个或多个 token,不能用固定比例精确换算 |
例子:
"你好世界" → 具体数量取决于模型使用的 tokenizer
"Hello World" → 常见 tokenizer 通常切成少量 tokens不同模型、特殊符号、数字、空格和代码都会改变切分结果;计费或容量规划应使用目标模型的 tokenizer 或 API usage 数据实测。
影响:
- 计费按 token 计算
- 上下文限制按 token 计算
- 生成长度按 token 计算
