Token 是什么
理解模型处理文字的基本单位,以及它为什么影响长度、速度和费用。
Token 是语言模型读取和生成文本时使用的基本单位。它可能是一个字、词的一部分、标点或空格组合,不等同于固定数量的汉字或英文单词。
01
为什么不是直接按字数计算
模型先通过分词器把文本切成 Token。不同语言、符号和模型的切分方式不同,所以 100 个汉字不一定等于 100 个 Token。
你输入的内容和模型输出的内容通常都会占用 Token。
02
Token 会影响什么
模型一次能处理的 Token 总量受到上下文窗口限制。长文档、历史对话和输出都要共享这个空间。
在按用量计费的 API 中,Token 也通常影响费用;在普通聊天产品里,它更多表现为长度限制或速度变化。
- 能放进多少资料
- 对话能保留多少上下文
- 生成速度与 API 费用
03
零基础用户怎样应对
不必每天精确计算 Token。优先删除无关内容、分批处理长资料,并明确要求输出长度。遇到文档过长时,先让 AI 建目录,再逐段处理。
文档例子:总结一份长报告
如果报告超过工具的上下文窗口,模型可能无法一次读完。更稳妥的方法是按章节总结,再把各章摘要放进最后一次对话中做总览。
这些概念不要混在一起
Token 与汉字
二者不是固定一对一关系,实际切分取决于分词器。
Token 与上下文窗口
Token 是计量单位,上下文窗口是一次可处理的 Token 容量。
可以这样用
- 估计内容是否可能过长
- 帮助控制输出篇幅
- 理解 API 用量的基本单位
不能这样假设
- 仅凭字数精确推算所有模型的 Token
- 突破具体模型的上下文上限
- 代表内容的重要程度
动手练习 · 约 10 分钟
把一个长任务拆成三段
- 选择一篇较长文章。
- 把任务拆为提取结构、逐段总结、合并结论。
- 每一步只提供必要内容,并观察回答是否更稳定。
常见问题
一个汉字等于一个 Token 吗?
不一定。不同模型和分词器的切分结果不同。
提示词越短越好吗?
不一定。应删除无关信息,但保留完成任务所需的背景、限制和材料。
上下文满了会怎样?
产品可能拒绝继续输入、截断较早内容,或让模型无法利用超出窗口的信息。