tokenizer
概念词 📚 基础词库 · 存量热词分词器
🔍 Google 联想 10 📅 首次出现 2026-08-28
🧠 tokenizer 是什么
Tokenizer(分词器)是大模型处理文本的第一步:把原始文本切分成词元(token)——模型的最小处理单位,再映射为数字 ID 输入网络。现代大语言模型大多采用 BPE(字节对编码)或其变体,如 GPT 系列的 tiktoken、Llama 系列的分词器。
Token 划分直接影响计费与效果:API 按 token 计费,上下文窗口也以 token 度量。中文一个字通常约占 1-2 个 token,英文一个单词约 1-1.5 个 token,常用词可能一个 token 就是完整单词。
分词质量影响模型对稀有词、多语言与代码的理解,业界也在探索无需分词的字节级模型。对用户而言,「token 超限」「按量计费」等现象都源于分词与上下文窗口的搭配。
🔥 为什么现在火
大模型 API 按 token 计费让「怎么分词」直接关系到使用成本,分词器在线工具与 token 优化技巧在开发者社区热度很高。
📄 证据链(交叉验证)
- ▸arxiv《Neural Machine Translation of Rare Words with Subword Units》(BPE 原始论文, Sennrich et al.)
- ▸OpenAI 官方 Tokenizer 在线工具
🔍 搜索形态
what is a tokenizer in AI tokenizer OpenAI LLM tokenizer explained tokenizer tool
tokenizer 常见问题 FAQ
token 和字数是什么关系?+
token 是模型的处理单位,不等于字数:中文约 1 字≈1-2 token,英文约 4 个字符≈1 token,不同模型略有差异。
BPE 分词是什么?+
字节对编码,一种从字符/字节级别逐步合并高频相邻片段来构造词表的算法,是 GPT、Llama 等主流模型的分词基础。
与 tokenizer 相关的搜索
人们搜索 tokenizer 时,还会关心这些问题:
- tokenizer 是什么
- 什么是 tokenizer
- tokenizer 是什么意思
- tokenizer 原理
- tokenizer 有什么用
- tokenizer 应用场景
- tokenizer 为什么火
- tokenizer 2026