📊 上下文窗口可视化对比
📄 文档容量估算
📖 上下文窗口详解
什么是上下文窗口
上下文窗口(Context Window)是大语言模型单次能处理的最大token数量。它决定了模型一次能读取多少文本,包括输入和输出。上下文窗口越大,模型能处理的长文档、多轮对话和复杂任务就越多。
Token与字数换算
- 英文 — 1 token ≈ 4字符 ≈ 0.75个单词
- 中文 — 1 token ≈ 1.5-2个汉字
- 代码 — 1 token ≈ 3-4个字符
- 128K tokens ≈ 英文96000词(约300页书) / 中文64000-85000字
上下文窗口的实际影响
- 长文档处理 — 上下文越大,能一次处理的文档越长
- 多轮对话 — 对话历史越长,需要越大的上下文窗口
- 成本 — 输入token越多,API调用越贵
- 速度 — 上下文越长,响应时间越长
- 注意力 — 超长上下文可能导致中间信息被忽略
📖 常见问题
什么是上下文窗口?
上下文窗口(Context Window)是大语言模型单次能处理的最大token数量。它决定了模型一次能读取多少文本,包括输入和输出。例如128K上下文窗口约等于一本300页的书。上下文窗口越大,模型能处理的长文档、多轮对话和复杂任务就越多。
1个token大约等于多少字?
英文约1token=4字符(约0.75个单词),中文约1token=1.5-2个汉字。因此128K token约等于:英文约96000词(约300页书),中文约64000-85000字(约2-3万字长文)。不同模型的tokenizer不同,实际数量会有差异。
上下文窗口越大越好吗?
不一定。大上下文窗口的优势是可以处理长文档、多轮对话和复杂任务;但劣势包括:1)成本更高——按token计费时输入越长越贵;2)速度更慢——处理更多token需要更多时间;3)注意力稀释——模型可能对长文本中间部分关注不足(中间丢失问题)。选择时需根据实际需求平衡。
如何估算我的文档需要多少token?
粗略估算:英文文本token数≈字数×1.3,中文文本token数≈字数×0.6。更精确的方法是使用各模型官方的tokenizer工具。本工具提供文档容量估算功能,输入字数即可查看各模型能处理多少页文档。
数据会上传到服务器吗?
不会。所有对比计算都在浏览器本地完成,不发送任何数据到服务器。模型数据为内置静态数据,无需联网。