Skip to content
🔗 分享本题
查看我的学习进度 →

Token 动漫知识图:Token 不等于字或词,不同语言和模型的切分方式不同,计费、上下文和生成长度均按 Token 计量

🧠 图解记忆:Token 是模型眼里的积木;点击图片可查看原图。

Token 是 LLM 处理文本的基本单位(不是字,也不是词)。

语言仅用于估算的经验值
英文常见分词器中,1 token 往往约为 4 个英文字符或 0.75 个单词
中文一个汉字可能对应一个或多个 token,不能用固定比例精确换算

例子:

"你好世界" → 具体数量取决于模型使用的 tokenizer
"Hello World" → 常见 tokenizer 通常切成少量 tokens

不同模型、特殊符号、数字、空格和代码都会改变切分结果;计费或容量规划应使用目标模型的 tokenizer 或 API usage 数据实测。

影响:

  • 计费按 token 计算
  • 上下文限制按 token 计算
  • 生成长度按 token 计算

📚 参考:OpenAI:What are tokens and how to count them