返回 ELI5 知识库首页 🧠 AGENT ARCHITECTURE & CONTEXT ENGINEERING
🧠 Agent Context · Short/Long Term Memory · Context Window

什么是 Agent Context(智能体上下文)?

大模型本质上是一个“没有长期记忆的失忆症患者”,每一次对话都是全新开始;而 Agent Context(上下文工程) 就是AI 探员手里的“便签夹与随身工作台” —— 把系统人设、工具描述、短期对话历史和 RAG 检索知识整齐码好,让 AI 拥有持续思考与解决复杂任务的灵魂!

🐟 裸大模型:7 秒金鱼记忆

转头就忘,无法执行连续任务

纯大模型是无状态(Stateless)的函数:你问第 2 句话时,它早就把第 1 句话忘得一干二净;不知道你是谁、手头有哪些工具、上一步改了哪个文件!

第 1 轮对话 我叫 Kyle 第 2 轮询问 "我叫什么名字?" ⚠️ 大模型回答:"抱歉,我不记得你是谁"
  • 无连续状态:无法胜任多步骤自主编程或多轮复杂调研
  • 缺乏纪律约束:没有严格的 System Prompt 约束行为边界
VS
🧠 Agent Context:精心装配的记忆三明治

全景视野,运筹帷幄步步为营

每次调用大模型前,上下文引擎像组装三明治一样把“系统铁律 + 工具说明 + 历史记忆 + 检索文档 + 当前提问”拼装为一整段 Prompt,瞬间激活 AI 的连贯智能!

📜 System Prompt (人设/工具权限/输出规范) 💭 Short-term Memory (多轮对话轮次历史) 📚 External RAG (从向量库检索的专业知识) 🎯 User Query (当前最新用户意图与状态) ✨ 动态压缩装配 · 让 AI 拥有连续推理与执行力!
  • 状态持久自愈:随时回顾上一步执行结果与环境报错
  • 按需检索(RAG):在有限的窗口内精准注入最相关的事实知识
💡

一句话顿悟:为什么说“上下文工程”决定了 Agent 的智商上限?

大模型本身就像一块“算力显卡”,而 Context(上下文)则是输入给它的“全部工作记忆(RAM 内存)”! 无论模型多聪明,如果你往 Context 里塞满了垃圾废话或者漏掉了关键工具说明,Agent 就会立刻沦为胡言乱语的笨蛋。

拆解 Agent Context 的 4 大核心维度

从系统人设到长期外挂记忆,读懂智能体记忆流转机制

📜

1. System Prompt (系统底座)

设定 AI 的最高行为准则、安全铁律、可用工具(Tool Definition)与结构化输出格式(JSON Schema)。

💭

2. 短期工作台 (In-Context)

滑动窗口内的多轮问答、思考链(CoT)、工具调用参数与终端执行返回结果(Tool Outputs)。

📚

3. 长期外挂记忆 (RAG / DB)

当历史信息超出 128k/1M 窗口限制时,将长期记忆存入向量数据库,按语义相似度按需动态检索注入

🗜️

4. 上下文压缩与总结 (Summarize)

自动监控 Token 消耗。在窗口用尽前触发“阶段性摘要压缩(Checkpoint)”,将数万字历史凝练为数百字精要。

🕹️ Agent 上下文三明治动态剖析演练台

点击切换 Context 中的各个切片组件,观察每一层为 AI 注入了哪些关键认知:

📜 System Prompt 不可动摇的最高铁律
📚 Dynamic RAG Context 检索召回的领域知识
💭 Short-term Memory 上几轮工具调用轨迹
🎯 User Query 当前最新提问与上下文
📜 1. System Prompt 层分析
定义身份:“你是一个高级资深架构师 Antigravity”
包含可用工具列表(bash, read, edit, write)、安全红线(严禁越狱)、输出要求(单文件自包含 HTML)等基石规范。
Token 占比估算: 约 15% (固定开销)
⚠️ 著名心理学陷阱

迷失在中间 (Lost in the Middle)

研究表明:当上下文长达数十万 Token 时,大模型对“开头”和“结尾”的信息注意力极高,却极易忽略“夹在正中间”的关键线索。

优秀的上下文工程必须把最关键的系统规则和用户问题分别放在最前和最后!

⚡ 缓存经济学

Prompt Caching 降本 90%

Anthropic 与 OpenAI 推出的 Prompt Caching 技术:

由于 System Prompt 与代码库前缀在多轮调用中保持完全不变,大模型只计算一次 KV Cache 并在内存缓存,API 成本与响应延迟骤降 80%~90%

🤖 未来终局

从 128k 到无限上下文 (Infini-Context)

从最早 GPT-3 的 4k 窗口,到 Gemini 1.5 Pro 的 200 万超长窗口。

结合滑动窗口注意力(Sliding Window)与状态空间模型(Mamba),未来的 Agent 将能把全公司十年所有文档作为无缝常驻上下文随身携带!