
模型上下文窗口从几千 token 一路涨到百万级,很多团队于是天真地以为:把资料一股脑塞进提示词就行了。但很快发现,长上下文会带来"迷失在中间"、成本飙升与响应变慢。真正决定效果的,是一门新学问——上下文工程。
窗口再大,注意力也是有限的。每一段无关内容都在稀释模型对关键信息的聚焦,同时按 token 计费的成本线性上涨。上下文工程的第一原则是:精心编排"放什么、放多少、放在哪"。
面对跨越数万 token 的长任务,靠单次上下文硬撑不现实。把外部记忆(向量库、文件、数据库)与工具调用纳入上下文管理,让模型"按需取用、用完即弃",才能既保持连贯又控制成本。
长窗口给了 AI 一张更大的书桌,但把书桌整理成高效工作台的,是上下文工程。未来的竞争,一半在模型,一半在这张书桌。
