达达工具

Token 计数器

在浏览器中精确统计 GPT token 数(o200k_base、cl100k_base),Claude 和 Gemini 给出标注为估算的数值,并展示文本是如何被切分的。

仅在浏览器中处理

使用方法

粘贴或输入文本,数字会随之更新:字符数、词数,以及 OpenAI 两种编码下的精确 token 数。o200k_base 是 GPT-4o、GPT-4.1 和 o 系列推理模型使用的编码;cl100k_base 是 GPT-4 和 GPT-3.5 所用的旧编码。同一段文本在两者之间往往相差几个百分点,所以两个都显示。这里运行的是真正的 BPE 分词器而不是近似算法,数字和 API 计费一致。

Claude 和 Gemini 没有提供能在浏览器里运行的分词器,因此它们的数值是估算,界面上也明确标注了"估算"。它用的是简单的经验法则:拉丁字母文本大约 3.5 个字符一个 token,中文、日文、韩文大约 1.5 个字符一个 token。遇到代码、特殊格式或多语言混排时误差可能超过 20%,只适合粗略预算,精确值请以 API 响应中的 usage 字段为准。

token 数决定了提示词能否放进上下文窗口、一次请求花多少钱,以及留给回答的空间还有多少。数字下方的彩色小块展示分词器如何切分前 200 个 token。常见英文单词通常是一个 token,而一个汉字往往是两三个 token,这就是同一份文档用中文更贵的原因。看这些小块也是找出提示词膨胀原因最快的办法:长 URL、base64 数据块和重复的空白一眼就能看出来。

所有计算都在本地完成。分词器词典在你第一次输入时下载一次,每个几 MB,之后文本不会离开页面。粘贴机密提示词或公司内部文档都是安全的。超过一百万字符的输入会被拒绝,因为编码时会卡死标签页,请先拆开再统计。

常与它一起使用的工具