LLM之Token和Context:聪明使用AI的第一课
你有没有遇到过这种情况:让AI写一篇3000字的文章,它写到一半突然“失忆”,或者明明问的是同一个话题,它却忘了你半小时前说过的话?如果是,那你已经撞上了LLM(大语言模型)最核心的两个概念——Token和Context。
理解它们,就像拿到AI的“使用说明书”。这篇文章会用最通俗的方式,帮你搞懂这两个关键原理,并附上真实案例和实用技巧。
一、Token是什么?AI的“语言碎片”
想象一下,你把一个句子拆成最小的拼图块。比如“我喜欢吃苹果”,AI会把它拆成:我 喜欢 吃 苹果。每一个这样的“碎片”,就是一个Token。
但Token不一定是完整的单词。对于英文,“unbelievable”可能被拆成“un”、“believe”、“able”三个Token。AI就是通过处理这些Token序列,来理解并生成语言的。
一个真实的例子
你问AI:“请用100字总结《三体》”。AI会首先把你的问句拆成若干Token(中文约1-2字/Token,英文约0.75字/Token),然后根据这些Token,去预测下一个最可能的Token,循环往复,最终生成回答。
做个小测试:在大多数AI输入框里,复制一段300字的文字,看它显示“已使用约150-300个Token”。这就是你的“弹药”成本。
实用建议:写提示词时,尽量用简洁、明确的词语。少用“请麻烦您帮我……非常感谢”这类客套话——它们会消耗Token,却不增加信息密度。
二、Context是什么?AI的“短期记忆”
Context(上下文)就是AI一次对话中能“记住”的内容总量。它就像一个工作台,上面只能放有限的信息。一旦你放了新东西,旧信息就可能被“挤掉”。
最常见的困惑
用户抱怨:“AI刚还说我生日是1990年,怎么问它‘那我今年多大了’就乱给答案?” 原因很简单:你之前的对话太长,AI的Context窗口满了,它被迫“遗忘”了你的生日信息。
各模型的Context窗口(2025年主流数据)
| 模型 | 最大Context Token数 | 约等于多少字(中文) |
|---|---|---|
| GPT-4o | 128K | 约96,000字 |
| Claude 3.5 | 200K | 约150,000字 |
| 智谱 GLM-4 | 128K | 约96,000字 |
| 文心一言4.0 | 8K | 约6,000字 |
注意:你看到的“128K”是理论极限。实际上,当上下文接近80%时,AI的注意力会明显衰减——它开始走神、重复、甚至胡说。
三、Token和Context的“相爱相杀”
它们的关系可以用一个比喻理解:Token是米粒,Context是碗。你往碗里倒的米粒越多,碗里的空间就越少。但如果碗太小(Context小),你就没法一次淘出足够多的米(喂给AI足够的信息)。
真实翻车案例
某程序员用AI帮忙重构一个2万行代码的项目。前5000行,AI还能准确理解。但当他一次性把2万行代码全部粘贴进去时(约15万Token),AI突然开始胡编函数名、忘记之前的变量定义,甚至建议删除核心模块。
原因:Context太大,AI的注意力被稀释,就像你同时听20个人说话,谁也听不清。
四、聪明人的4个实用技巧
-
分块对话:要处理超长文本(比如一本小说),别一次性丢进去。先让AI读前10章,问几个问题;再读后10章。每段控制在3000~5000字(约4K~6K Token)效率最高。
-
定期“刷新”:如果对话超过10轮,AI可能已经忘了最初的信息。建议主动说:“请基于我们最初讨论的X问题,重新生成建议。” 这会强制AI回溯上下文。
-
利用“系统提示”:在Chat类AI里,把最重要的信息(你的身份、任务目标、关键约束)放在第一轮对话的前半段。AI通常对“工作台”最前面的信息记忆最强。
-
巧妙压缩:如果信息太多,可以预处理——用AI自己帮你总结。比如:“请将以上5000字会议纪要,压缩为300字核心要点,保留所有决定和负责人。” 再把这个压缩版丢进下一轮对话。
五、未来已来:Context在变大
2023年,主流模型Context还是4K~8K(约3000~6000字);2025年,128K已经普及,200K甚至1M(约100万字)的模型正在测试。你可以想象一辆能装1072个人同时说话的汽车——是的,AI的记忆容量正以指数级增长。
但记住:容量大≠效率高。就像你给了一个人100本书,但他一次只能专注看一本。未来,AI需要的不是更大的Context,而是更聪明的“注意力分配”。
行动号召(别只收藏,做点改变)
下次使用AI时,试着做三件事:
- 打开AI的设置面板,看看它的Context上限是多少(很多平台会显示)。
- 用一个长文档测试:粘贴进去后,问一个最早出现的问题,看AI是否还记得。
- 开始实践“分块对话”技巧——你会发现AI的回答质量直接翻倍。
免责声明:本文中的模型参数和Context数据基于2025年2月已公开资料整理,实际数值可能因版本更新或平台差异而略有不同。LLM技术迭代迅速,建议以官方文档最新数据为准。文中案例为模拟或通用场景,不代表特定模型表现。