上下文窗口是模型在单次请求里能“看到”的文字总量,按 token 计算,你输入的提示和它生成的回答共用这一份额度。它决定了一轮对话里模型能同时顾及多少内容,超出的部分它就看不见了。
一句话定义
上下文窗口就是模型一次能处理的 token 上限,输入和输出共用这份额度。token 可以粗略理解为一小段文字:几个字符、一个词,或者半个词。当对话越堆越长、超过这个上限,最早的内容会被挤出视野或被截断,模型就没法再引用它已经看不到的东西。
一个例子
把一份长报告粘进对话让模型总结,报告本身、你的问题、加上它给出的回答,全都要塞进同一个窗口。整份报告在窗口内,模型能一次读完;一旦超了,靠后的段落可能被丢掉。你可以在 Claude 或 Google Gemini 这类工具里做这件事。要注意,即便资料塞得进窗口,长文里分散的细节也可能被漏掉:拿 Google Gemini 做大文件分析时,分散的细节可能被漏掉,结论需要回看原文。Claude 这边同理,联网找来的资料和它得出的结论,都要对照原始来源再确认一遍。
和相近概念的区别
上下文窗口和模型的“记忆”是两回事,别混为一谈。训练数据是模型早就学过、固定在参数里的东西;上下文窗口是当前这轮对话临时装进去的内容,请求一结束就清空。有些产品会在窗口之外再加一层长期记忆或资料检索来补足,但那是另一套机制,并不等于窗口本身变大了。
什么时候用得上
当你要处理长文档、连续多轮的长对话,或大段代码时,窗口大小直接决定模型能不能一次看全。窗口越大,一次能喂进去的资料越多;但更大的窗口往往和更高的方案绑定,Claude 的用量和高级功能会随方案变化,动手前值得先确认自己的额度够不够。还有一点:把资料塞满窗口,不等于模型会平均对待每一段,靠中间位置的细节最容易被忽略,重要结论最好回原文核一遍。