大语言模型上下文工程综述
Lingrui Mei1,6,† Jiayu Yao1,6,† Yuyao Ge1,6,† Yiwei Wang2 Baolong Bi1,6,†
Yujun Cai3 Jiazhi Liu1 Mingyu Li1 Zhong-Zhi Li6 Duzhen Zhang6
Chenlin Zhou4 Jiayi Mao5 Tianze Xia6 Jiafeng Guo1,6,† Shenghua Liu1,6,†,
1 Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所),
2 University of California, Merced, 3 The University of Queensland,
4 Peking University(北京大学), 5 Tsinghua University(清华大学),
6 University of Chinese Academy of Sciences(中国科学院大学)
arXiv:2507.13334v2 [cs.CL] 21 Jul 2025
摘要: 大语言模型(Large Language Models, LLMs)的性能从根本上取决于推理(inference)时所提供的上下文信息。本综述引入上下文工程(Context Engineering)这一形式化学科——它超越简单的提示设计,涵盖面向 LLMs 的信息载荷(information payloads)的系统性优化。我们提出一套全面的分类体系(taxonomy),将上下文工程分解为基础组件(Foundational Components)以及将其整合为智能系统的复杂实现(Implementations)。我们首先考察基础组件:(1)上下文检索与生成(Context Retrieval and Generation),涵盖基于提示的生成与外部知识获取;(2)上下文处理(Context Processing),面向长序列处理、自我精炼(self-refinement)与结构化信息整合;(3)上下文管理(Context Management),涵盖记忆层次(memory hierarchies)、压缩(compression)与优化。随后,我们探讨这些组件如何在架构上被整合,以构建复杂的系统实现(System Implementations):(1)检索增强生成(Retrieval-Augmented Generation, RAG),包括模块化(modular)、智能体式(agentic)与图增强(graph-enhanced)架构;(2)记忆系统(Memory Systems),支持持久化交互;(3)工具集成推理(Tool-Integrated Reasoning),用于函数调用(function calling)与环境交互;(4)多智能体系统(Multi-Agent Systems),协调通信与编排(orchestration)。通过对逾 1400 篇研究论文的系统分析,本综述不仅为该领域确立了技术路线图,也揭示了一项关键研究缺口:模型能力之间存在根本性的不对称。尽管当前模型在先进上下文工程的加持下,在理解复杂上下文方面展现出卓越能力,但在生成同等精巧、长篇幅输出方面却表现出明显局限。弥补这一差距是未来研究的核心优先事项。最终,本综述为推进上下文感知人工智能的研究者与工程师提供了统一框架。
† 同时隶属:(1) Key Laboratory of Network Data Science and Technology, ICT, CAS;(2) State Key Laboratory of AI Safety
通讯作者(Corresponding Author)
关键词: 上下文工程,大语言模型,LLM 智能体,多智能体系统
日期:July 21, 2025
代码仓库:https://github.com/Meirtz/Awesome-Context-Engineering
联系方式:meilingrui25b@ict.ac.cn, liushenghua@ict.ac.cn
目录
- 1 引言
- 2 相关工作
- 3 为何需要上下文工程?
- 3.1 上下文工程的定义
- 3.2 为何需要上下文工程
- 3.2.1 当前局限
- 3.2.2 性能提升
- 3.2.3 资源优化
- 3.2.4 未来潜力
- 4 基础组件
- 4.1 上下文检索与生成
- 4.1.1 提示工程与上下文生成
- 4.1.2 外部知识检索
- 4.1.3 动态上下文组装
- 4.2 上下文处理
- 4.2.1 长上下文处理
- 4.2.2 上下文自我精炼与适应
- 4.2.3 多模态上下文
- 4.2.4 关系型与结构化上下文
- 4.3 上下文管理
- 4.3.1 基本约束
- 4.3.2 记忆层次与存储架构
- 4.3.3 上下文压缩
- 4.3.4 应用
- 4.1 上下文检索与生成
- 5 系统实现
- 5.1 检索增强生成
- 5.1.1 模块化 RAG 架构
- 5.1.2 智能体式 RAG 系统
- 5.1.3 图增强 RAG
- 5.1.4 应用
- 5.2 记忆系统
- 5.2.1 记忆架构
- 5.2.2 记忆增强智能体
- 5.2.3 评估与挑战
- 5.3 工具集成推理
- 5.3.1 函数调用机制
- 5.3.2 工具集成推理
- 5.3.3 智能体–环境交互
- 5.4 多智能体系统
- 5.4.1 通信协议
- 5.4.2 编排机制
- 5.4.3 协调策略
- 5.1 检索增强生成
- 6 评估
- 6.1 评估框架与方法
- 6.1.1 组件级评估
- 6.1.2 系统级集成评估
- 6.2 基准数据集与评估范式
- 6.2.1 基础组件基准测试
- 6.2.2 系统实现基准测试
- 6.3 评估挑战与新兴范式
- 6.3.1 方法局限与偏差
- 6.3.2 新兴评估范式
- 6.3.3 安全与鲁棒性评估
- 6.1 评估框架与方法
- 7 未来方向与开放挑战
- 7.1 基础研究挑战
- 7.1.1 理论基础与统一框架
- 7.1.2 扩展定律与计算效率
- 7.1.3 多模态整合与表示
- 7.2 技术创新机遇
- 7.2.1 下一代架构
- 7.2.2 高级推理与规划
- 7.2.3 复杂上下文组织与图问题求解
- 7.2.4 智能上下文组装与优化
- 7.3 应用驱动的研究方向
- 7.3.1 领域专门化与适应
- 7.3.2 大规模多智能体协调
- 7.3.3 人机协作与集成
- 7.4 部署与社会影响考量
- 7.4.1 可扩展性与生产部署
- 7.4.2 安全、安保与鲁棒性
- 7.4.3 伦理考量与负责任开发
- 7.1 基础研究挑战
- 8 结论
1. 引言
大语言模型(LLMs)的出现标志着人工智能的范式转变,在自然语言理解、生成与推理方面展现出前所未有的能力 [103, 1067, 459]。然而,这些模型的性能与效力从根本上受其所接收上下文的制约。这一上下文——从简单的指令性提示(prompt)到复杂的外部知识库——是引导其行为、增强其知识并释放其能力的主要机制。随着 LLMs 从基础的指令遵循系统演进为复杂应用的核心推理引擎,设计与管理其信息载荷的方法也相应演进为上下文工程这一形式化学科 [25, 1265, 1068]。
上下文工程的研究版图以爆炸性速度扩张,催生了大量专门化却彼此割裂的研究领域。我们将这一版图概念化为由基础组件及其后续实现所构成。基础组件通过三个关键阶段表征上下文工程的系统化流水线:上下文检索与生成,涵盖基于提示的生成与外部知识获取 [25, 597, 48];上下文处理,涉及长序列处理、自我精炼机制与结构化信息整合 [200, 741, 495];以及上下文管理,面向记忆层次、压缩技术与优化策略 [1372, 1082, 819]。
这些基础组件构成了更复杂、面向应用的实现的基石,从而将 LLMs 与外部现实相桥接。这类系统包括:已演进为模块化与智能体式架构、实现动态知识注入的先进检索增强生成(RAG) [597, 316, 973, 315];模拟人类认知官能以实现信息持久保留的显式记忆系统 [1191, 943, 1372];以及整个智能智能体系统(Intelligent Agent Systems)生态。后一类代表了上下文工程的巅峰——智能体(agent)借助函数调用与工具集成推理与世界交互 [939, 864, 669],并依赖精巧的智能体通信协议与上下文编排(Context Orchestration),在多智能体配置中达成复杂目标 [360, 250, 902, 128]。
尽管上述各领域均产生了大量创新,但它们大多被孤立地研究。这种碎片化发展遮蔽了各技术之间的根本联系,既给试图理解更广版图的研究者、也给希望有效运用这些方法的实践者带来显著障碍。该领域迫切需要一个统一框架,系统组织这些多样化技术,澄清其底层原理,并阐明其间的相互依存关系。
为填补这一关键空白,本综述提供首份面向 LLMs 上下文工程的全面、系统评述。我们的主要贡献是一套新颖的结构化分类体系,对设计、管理与优化上下文的多面技术加以分类。该分类体系将领域组织为连贯类别,区分基础组件及其向复杂系统实现的整合。通过这一框架,我们:(1)对各领域的前沿现状给出清晰、结构化的概览;(2)分析不同方法的核心机制、优势与局限;(3)识别总体挑战并勾勒有前景的未来研究方向。本工作既可作为导航上下文工程复杂版图的技术路线图,也可作为深化理解与催化未来创新的基础。
本文其余部分组织如下。在讨论相关工作并形式化定义上下文工程之后,我们首先考察该领域的基础组件,涵盖上下文检索与生成、上下文处理与上下文管理。随后探讨其系统实现,包括检索增强生成、记忆系统、工具集成推理与多智能体系统。最后讨论评估方法、未来研究方向并给出结论。图 1 给出了我们分类体系的全面概览,展示了上下文工程版图中各技术的层次组织及其相互关系。
2. 相关工作
LLMs 的迅速成熟催生了大量旨在勾勒其多面版图的综述文献。既有工作虽有价值,但大多聚焦于我们所谓上下文工程这一更广领域中的特定纵向子域。本综述力图通过提供横向、统一的分类体系来补充这些努力——该体系区分基础组件及其向复杂系统的整合,从而桥接这些专门领域。
基础组件 众多综述已讨论构成有效上下文操控核心技术能力的上下文工程基础组件。上下文检索与生成的挑战同时涵盖提示工程(prompt engineering)方法与外部知识获取技术。关于提示工程的综述已系统梳理引导 LLM 行为的大量技术,从基础少样本(few-shot)方法到高级结构化推理框架 [25, 257, 1322]。外部知识检索与整合技术——尤其是通过知识图谱与结构化数据源——则在综述表示技术、整合范式及其在增强 LLMs 事实接地(grounding)方面应用的工作中得到评述 [489, 432, 823, 897]。
图 1:大语言模型中上下文工程的分类体系,划分为基础组件、系统实现、评估方法与未来方向。各领域涵盖具体技术与框架,共同推进面向 LLMs 的信息载荷系统性优化。(原文图见 PDF 第 6 页)
上下文处理领域则面向处理长序列、自我精炼机制与结构化信息整合的技术挑战。长上下文(Long Context)处理在分析扩展上下文窗口、优化注意力(attention)机制与高效管理记忆等技术的综述中得到讨论 [837, 651, 1298, 272]。LLMs 的内部认知过程也日益成为综述对象,关于自我情境化技术与自我改进范式的工作日益突出 [1339, 231, 1176, 943]。
最后,上下文管理文献聚焦于记忆层次、压缩技术与优化策略,使信息能够在计算约束下得到有效组织与检索。尽管专门将上下文管理作为统一领域加以全面综述的工作仍属有限,但有关记忆系统与上下文压缩技术的相关工作为这些关键能力提供了基础性洞见。
系统实现 与此并行,文献已广泛覆盖将基础组件整合为复杂架构、以满足现实应用需求的系统实现。RAG 领域受到大量关注,基础性综述追溯了其发展及其对缓解幻觉的影响 [315, 257, 1140]。近期工作则综述了向模块化、智能体式与图增强 RAG 架构的演进 [166, 628, 120, 316, 1401]。
支持持久交互与认知架构的记忆系统,已通过聚焦记忆增强智能体及其应用的综述加以探讨。更广的基于 LLM 的智能体类别构成另一基础领域,已有工作对自主智能体、其架构、规划与方法进行了全面概述 [1099, 725, 281, 849, 1350, 504, 1281]。
涵盖函数调用机制与智能体–环境交互的工具集成推理也有充分文献记载,探讨了从单工具系统到复杂编排框架的演进 [669, 864, 777, 875]。向多智能体系统(MAS)的演进是另一焦点,相关综述详述了 MAS 工作流、基础设施、通信协议与协调机制 [631, 360, 250, 1244, 38, 509, 191, 464]。
评估 评估这些复杂系统的关键方面已得到充分评述,相关工作分析了用于评估组件级与系统级能力及性能的基准测试(benchmark)与方法 [1268, 384, 841, 314]。该评估文献横跨基础组件评估与集成系统评估两类范式。
我们的贡献 尽管上述综述对其各自领域提供了不可或缺的深入分析,但它们本质上呈现的是该领域的碎片化图景。RAG 作为外部记忆的一种形式、工具使用作为上下文获取方法、以及提示工程作为编排这些组件的语言——其间的联系往往被隐而不宣。本工作的独特之处在于提出上下文工程作为统一抽象,显式区分基础组件与其在复杂实现中的整合。通过将这些分散领域组织到单一、连贯的分类体系中,本综述旨在阐明其间的根本关系,为上下文如何被生成、处理、管理并用于引导下一代智能系统提供整体地图。
3. 为何需要上下文工程?
随着大语言模型(LLMs)从简单的指令遵循系统演进为复杂、多面应用的核心推理引擎,与之交互的方法也必须随之演进。“提示工程”一词虽具基础性,但已不足以涵盖设计、管理与优化现代 AI 系统所需信息载荷的全部范围。这些系统并不运行于单一、静态的文本字符串之上;它们依赖动态、结构化且多面的信息流。为此,我们引入并形式化上下文工程这一学科。
图 2:上下文工程演进时间线:全面可视化 2020 至 2025 年间上下文工程实现的发展轨迹,展示从基础 RAG 系统到复杂多智能体架构与工具集成推理系统的演进。(原文图见 PDF 第 8 页)
3.1. 上下文工程的定义
为形式化定义上下文工程,我们从自回归 LLM 的标准概率模型出发。模型由参数 θ 参数化,在给定输入上下文 C 时,通过最大化条件概率生成输出序列 Y = (y₁, …, y_T):
$$P_\theta(Y \mid C) = \prod_{t=1}^{T} P_\theta(y_t \mid y_{<t}, C) \tag{1}$$
历史上,在提示工程范式中,上下文 C 被当作整体、静态的文本字符串,即 C = prompt。这一观点对现代系统而言已不充分。
上下文工程将上下文 C 重新概念化为由信息组件 c₁, c₂, …, cₙ 构成的动态结构化集合。这些组件由一组函数进行来源获取、过滤与格式化,最终由高层组装函数 A 加以编排:
$$C = A(c_1, c_2, \ldots, c_n) \tag{2}$$
组件 cᵢ 并非任意;它们直接映射到本综述的核心技术领域:
- $c_{\text{instr}}$:系统指令与规则(上下文检索与生成,第 4.1 节)。
- $c_{\text{know}}$:外部知识,通过 RAG 等函数检索或来自集成知识图谱(RAG,第 5.1 节;上下文处理,第 4.2 节)。
- $c_{\text{tools}}$:可用外部工具的定义与签名(函数调用与工具集成推理,第 5.3 节)。
- $c_{\text{mem}}$:来自先前交互的持久信息(记忆系统,第 5.2 节;上下文管理,第 4.3 节)。
- $c_{\text{state}}$:用户、世界或多智能体系统的动态状态(多智能体系统与编排,第 5.4 节)。
- $c_{\text{query}}$:用户的即时请求。
上下文工程的优化问题。 由此视角看,上下文工程即是寻找理想的上下文生成函数集合(我们将其统记为 $F = {A, \text{Retrieve}, \text{Select}, \ldots}$)以最大化 LLM 输出期望质量的形式化优化问题。给定任务分布 $T$,目标为:
$$F^{} = \arg\max_{F} \mathbb{E}{\tau \sim T}\bigl[\text{Reward}\bigl(P{\theta}(Y \mid C_{F}(\tau)), Y_{\tau}^{}\bigr)\bigr] \tag{3}$$
其中 $\tau$ 为特定任务实例,$C_{F}(\tau)$ 为由 $F$ 中函数为该任务生成的上下文,$Y_{\tau}^{*}$ 为真值或理想输出。该优化受硬约束制约,最突出的是模型的上下文长度限制 $|C| \leq L_{\max}$。
数学原理与理论框架。 这一形式化揭示了更深层次的数学原理。组装函数 $A$ 是一种动态上下文编排(Dynamic Context Orchestration)形式,即由格式化与拼接操作构成的流水线 $A = \text{Concat} \circ (\text{Format}{1}, \ldots, \text{Format}{n})$,其中每个函数都必须针对 LLM 的架构偏置(例如注意力模式)进行优化。
知识检索 $c_{\text{know}} = \text{Retrieve}(\ldots)$ 可被框定为信息论最优性问题。目标是在给定查询 $c_{\text{query}}$ 的条件下,选择与目标答案 $Y^{*}$ 互信息最大的知识:
$$\text{Retrieve}^{} = \arg\max_{\text{Retrieve}} I(Y^{}; c_{\text{know}} \mid c_{\text{query}}) \tag{4}$$
这确保检索到的上下文不仅语义相似,而且对求解任务具有最大信息量。
进一步地,整个过程可通过贝叶斯上下文推理(Bayesian Context Inference)的视角理解。我们并非确定性地构造上下文,而是推断最优上下文后验 $P(C \mid c_{\text{query}}, \text{History}, \text{World})$。由贝叶斯定理,该后验正比于给定上下文下查询的似然以及上下文相关性的先验概率:
$$P(C \mid c_{\text{query}}, \ldots) \propto P(c_{\text{query}} \mid C) \cdot P(C \mid \text{History}, \text{World}) \tag{5}$$
决策论目标则是寻找在可能答案分布上最大化期望奖励的上下文 $C^{*}$:
$$C^{} = \arg\max_{C} \int P(Y \mid C, c_{\text{query}}) \cdot \text{Reward}(Y, Y^{}), dY \cdot P(C \mid c_{\text{query}}, \ldots) \tag{6}$$
这一贝叶斯表述为处理不确定性、通过更新先验进行自适应检索,以及在多步推理任务中维持关于上下文的信念状态提供了原则性方法。
| 维度 | 提示工程 | 上下文工程 |
|---|---|---|
| 模型 | $C = \text{prompt}$(静态字符串) | $C = A(c_{1}, c_{2}, \ldots, c_{n})$(动态、结构化组装) |
| 目标 | $\arg\max_{\text{prompt}} P_{\theta}(Y \mid \text{prompt})$ | $F^{} = \arg\max_{F} \mathbb{E}{\tau \sim T}[\text{Reward}(P{\theta}(Y \mid C_{F}(\tau)), Y_{\tau}^{})]$ |
| 复杂性 | 在字符串空间上手动或自动搜索 | 对 $F = {A, \text{Retrieve}, \text{Select}, \ldots}$ 的系统级优化 |
| 信息 | 信息内容固定于提示词之内 | 在约束 $|C| \leq L_{\max}$ 下最大化任务相关信息 |
| 状态 | 主要为无状态 | 内在有状态,具有 $c_{\text{mem}}$ 与 $c_{\text{state}}$ 的显式组件 |
| 可扩展性 | 脆弱性随长度与复杂性增加 | 通过模块化组合管理复杂性 |
| 误差分析 | 人工检查与迭代精炼 | 对各个上下文函数的系统评估与调试 |
表 1: 提示工程与上下文工程范式的比较。
范式比较。 上下文工程的形式化凸显了其与传统提示工程的根本区别。上表总结了关键差异。
总之,上下文工程提供了构建、理解与优化那些正日益定义该领域未来的复杂、上下文感知 AI 系统所需的形式化、系统化框架。它将焦点从提示设计的“艺术”转向信息物流与系统优化的“科学”。
上下文扩展(Context Scaling)。 上下文扩展涵盖两个共同界定上下文信息处理范围与精密度的基本维度。第一维是长度扩展(length scaling),应对处理超长序列的计算与架构挑战,将上下文窗口从数千扩展至数百万 token,同时在扩展的叙事、文档与交互中保持连贯理解。这涉及复杂的注意力机制、记忆管理技术以及架构创新,使模型能够在大幅扩展的输入序列上维持上下文连贯性。
第二维同样关键,即多模态与结构扩展(multi-modal and structural scaling),将上下文从简单文本扩展到涵盖多维、动态、跨模态的信息结构。这包括时间上下文(理解时间依赖关系与序列)、空间上下文(解释基于位置与几何的关系)、参与者状态(跟踪多个实体及其演化条件)、意图上下文(理解目标、动机与隐含目的)以及文化上下文(在特定社会与文化框架内解释交流)。
现代上下文工程必须同时应对这两个维度,因为现实世界应用要求模型不仅处理冗长文本信息,还要处理多样数据类型,包括结构化知识图谱、多模态输入(文本、图像、音频、视频)、时间序列以及人类自然理解的隐含上下文线索。这种上下文扩展的多维方法代表了从参数扩展向开发能够理解复杂、模糊上下文之系统的根本转变,这些系统反映了人类智能在面对复杂世界时的细微本质 [1044]。
3.2. 为什么需要上下文工程
3.2.1. 当前局限
大语言模型面临亟待复杂上下文工程方法的关键技术障碍。自注意力机制随序列长度增加施加二次计算与内存开销,对处理扩展上下文构成重大障碍,并显著影响聊天机器人与代码理解模型等现实应用 [1025, 985]。商业部署通过重复的上下文处理进一步加剧这些挑战,引入额外延迟与基于 token 的定价成本 [1025]。
除计算约束外,LLM 还表现出令人担忧的可靠性问题,包括频繁幻觉、对输入上下文的不忠实、对输入变化的问题性敏感,以及表面上句法正确却缺乏语义深度或连贯性的响应 [959, 1288, 529]。
提示工程过程呈现方法论挑战:其近似驱动且主观的方法狭隘地聚焦于任务特定优化,而忽视个体 LLM 行为 [806]。尽管存在这些挑战,通过精确且上下文丰富的提示词减少歧义并增强响应一致性,提示工程对有效利用 LLM 仍然至关重要 [972]。
3.2.2. 性能提升
上下文工程通过检索增强生成(RAG)与叠加提示(superposition prompting)等技术带来实质性性能提升,已记录的改进包括文本导航准确率提高 18 倍、94% 的成功率,以及跨专业领域通过仔细构造提示词与自动优化获得的显著收益 [271, 774, 687]。
结构化提示技术——尤其是思维链(CoT)方法——通过中间步骤实现复杂推理,同时增强元素感知摘要能力,以整合源文档中的细粒度细节 [1147, 756, 1129]。通过精心选择演示示例实现的少样本学习带来实质性性能增益,包括代码摘要 BLEU-4 分数提高 9.90%,以及缺陷修复精确匹配指标提高 175.96% [310]。
领域特定的上下文工程在专业应用中尤为有价值:执行感知调试框架在代码生成基准测试上实现高达 9.8% 的性能提升,硬件设计应用则受益于专门的测试台生成与安全属性验证 [1370, 881, 44]。这些针对性方法弥合了通用模型训练与专业领域需求之间的差距。
3.2.3. 资源优化
上下文工程通过智能内容过滤以及经由精心设计的提示词直接传递知识,为资源密集型传统方法提供了高效替代方案 [636, 676]。即使相关信息从输入上下文中被删除,LLM 仍可生成期望响应,利用上下文线索与先验知识在保持响应质量的同时优化上下文长度使用,这在数据获取挑战显著的领域尤为宝贵 [636, 676]。
专门的优化技术进一步增强效率收益:上下文感知与责任调优显著降低 token 消耗,动态上下文优化采用精确的 token 级内容选择,以及用于长上下文推理的注意力引导机制 [430, 952, 354]。这些方法在最大化信息密度的同时降低处理开销并维持性能质量 [952, 354]。
3.2.4. 未来潜力
上下文工程通过上下文学习(ICL)实现灵活适应机制,使模型无需显式重训练即可适应新任务,上下文窗口大小直接影响可用于任务适应的示例数量 [623]。先进技术整合压缩与选择机制以进行高效模型编辑,同时保持上下文连贯性 [625]。这种适应性在低资源场景中尤为有价值,使其能够在不需要领域特定微调的情况下有效运用各类提示工程技术,包括零样本方法、少样本示例与角色上下文 [932, 129, 1083]。
包括上下文学习(ICL)、思维链(CoT)、思维树(tree-of-thought)与规划方法在内的复杂上下文工程技术,为细腻的语言理解与生成能力奠定基础,同时优化检索与生成过程,以支撑稳健、上下文感知的 AI 应用 [803, 982]。
未来研究方向表明,通过带有 logit 对比机制的思维链增强 [961]、更好地跨领域利用不同类型上下文——尤其是在结合语法、语义、执行流与文档的代码智能任务中 [1102],以及随着先进语言模型持续证明提示工程的持久价值而理解最优上下文利用策略 [1087],在推进上下文敏感应用方面具有巨大潜力。向复杂过滤与选择机制演进是应对 Transformer 架构扩展局限同时保持性能质量的关键路径。
4. 基础组件(Foundational Components)
上下文工程建立在三个基础组件之上,它们共同应对大语言模型中信息管理的核心挑战:上下文检索与生成(Context Retrieval and Generation)通过提示工程、外部知识检索与动态上下文组装获取适当的上下文信息;上下文处理(Context Processing)通过长序列处理、自我精炼机制与结构化数据集成对已获取信息进行变换与优化;上下文管理(Context Management)通过应对基本约束、实现复杂记忆层次结构并开发压缩技术,解决上下文信息的高效组织与利用。这些基础组件为所有上下文工程实现确立了理论与实践基础,构成一个综合框架:各组件分别应对上下文工程流水线的不同方面,同时保持协同关系,以实现全面的上下文优化与有效的上下文工程策略。
4.1. 上下文检索与生成
上下文检索与生成构成上下文工程的基础层,涵盖为 LLM 系统检索与构建相关信息。该组件通过三种主要机制应对获取适当上下文信息的关键挑战:基于提示的生成,用于设计有效指令与推理框架;外部知识检索,用于访问动态信息源;以及动态上下文组装,将已获取组件编排为连贯、任务优化的上下文。
图 3: 上下文工程框架:上下文工程组件的综合分类体系,包括上下文检索与生成、上下文处理与上下文管理,并集成到检索增强生成(RAG)系统、记忆架构、工具集成推理与多智能体协调机制等系统实现中。
4.1.1. 提示工程与上下文生成
提示工程与上下文生成构成上下文检索的基础层,涵盖将艺术与科学相结合以为 LLM 设计有效指令的策略性输入设计。CLEAR 框架——简洁性(conciseness)、逻辑性(logic)、明确性(explicitness)、适应性(adaptability)与反思性(reflectiveness)——指导有效的提示词构造,而核心架构则整合任务指令、上下文信息、输入数据与输出指示符 [708, 1142, 575, 213, 25]。
零样本与少样本学习范式。 零样本提示使模型无需先验示例即可执行任务,完全依赖指令清晰度与预训练知识 [1371, 340, 559, 67, 1054]。少样本提示通过纳入有限示例来扩展这一能力以引导模型响应,经由策略性示例选择演示任务执行 [1371, 405, 103, 552, 794, 1381]。上下文学习(ICL)通过在提示词中利用演示示例,使模型无需参数更新即可适应新任务,其性能显著受示例选择与排序策略影响 [369, 103, 1296, 1024, 928, 852, 1148, 352, 582]。
思维链基础。 思维链(CoT)提示将复杂问题分解为中间推理步骤,映照人类认知 [1147, 405, 340, 947, 609]。零样本 CoT 使用如“Let’s think step by step”等触发短语,将 MultiArith 准确率从 17.7% 提升至 78.7% [559, 1107, 478, 668],Automatic Prompt Engineer 的精炼可带来额外增益 [1224, 532]。
思维树(Tree-of-Thoughts, ToT)将推理组织为具有探索、前瞻与回溯能力的层次结构,将 Game of 24 成功率从 4% 提升至 74% [1255, 221, 563, 604]。思维图(Graph-of-Thoughts, GoT)将推理建模为任意图,以思想为顶点、依赖为边,相较 ToT 质量提升 62%,成本降低 31% [69, 832, 1376]。
认知架构集成。 认知提示实现结构化的类人操作,包括目标澄清、分解、过滤、抽象与模式识别,通过确定性、自适应与混合变体实现系统化的多步任务求解 [564, 563, 1214, 1173]。Guilford 的智力结构模型为模式识别、记忆检索与评价等认知操作的分类提供了心理学基础,增强推理的清晰度、连贯性与适应性 [562, 195]。先进实现将认知工具作为模块化推理操作纳入,通过结构化认知操作序列,GPT-4.1 在 AIME2024 上的表现从 26.7% 提升至 43.3% [247, 1038]。
| 方法 | 描述 |
|---|---|
| Self-Refine [741, 924] | 使 LLM 通过迭代反馈与精炼循环改进输出,同一模型充当生成器、反馈提供者与精炼器,无需监督训练。 |
| Multi-Aspect Feedback [805] | 整合多个反馈模块(冻结 LM 与外部工具),各模块聚焦特定错误类别,以实现更全面、独立的评估。 |
| N-CRITICS [795] | 实现批评者集成以评估初始输出。来自生成 LLM 与其他模型的汇集反馈指导精炼,直至满足停止准则。 |
| ISR-LLM [1383] | 通过将自然语言翻译为形式化规约、创建初始计划,再用验证器系统精炼,改进基于 LLM 的规划。 |
| SELF [710] | 以有限示例教授 LLM 元技能(自我反馈、自我精炼),随后模型通过生成并过滤自身训练数据持续自我演化。 |
| ProMiSe [892] | 针对较小 LM 的自我精炼,采用原则引导的迭代精炼,结合代理指标阈值与少样本精炼及拒绝采样。 |
| A2R [583] | 通过基于度量的迭代反馈学习增强 LLM,利用跨多维度(如正确性)的显式评估生成反馈并精炼输出。 |
| Experience Refinement [863] | 使 LLM 智能体在任务执行中通过从近期(相继)或全部先前(累积)经验中学习来精炼经验,优先高质量经验。 |
| I-SHEEP [660] | 允许 LLM 通过生成、评估、过滤并在高质量合成数据集上训练,从零开始持续自我对齐,无需外部指导。 |
| CaP [1280] | 使用外部工具精炼思维链(CoT)响应,应对模型陷入不可纠正推理循环的局限。 |
| Agent-R [1286] | 使语言智能体通过迭代自我训练“即时”反思,利用蒙特卡洛树搜索(MCTS)构造纠正错误路径的训练数据。 |
| GenDiE [616] | 以句子级优化增强上下文忠实性,结合生成与判别训练,赋予 LLM 自我生成与自我评分能力。 |
| Self-Developing [472] | 使 LLM 通过将改进算法生成为代码、评估它们并用 DPO 递归改进,自主发现、实现并精炼自身的改进算法。 |
| SR-NLE [1130] | 通过使用自我反馈与特征归因的迭代批判与精炼过程,改进事后自然语言解释的忠实性。 |
表 2: 大语言模型中的自我精炼方法及其关键特征。
4.1.2. 外部知识检索(External Knowledge Retrieval)
外部知识检索是上下文检索的关键组件,通过动态访问包括数据库、知识图谱与文档集合在内的外部信息源,应对参数化知识的基本局限。
检索增强生成基础。 RAG 将存储于模型参数中的参数化知识与从外部源检索的非参数化信息相结合,在保持参数效率的同时实现对当前、领域特定知识的访问 [597, 315, 257]。FlashRAG 提供 RAG 系统的全面评估与模块化实现,而 KRAGEN 与 ComposeRAG 等框架则展示了在多样基准测试上具有实质性性能提升的先进检索策略 [506, 755, 1168]。
Self-RAG 引入自适应检索机制:模型动态决定何时检索信息,并生成特殊 token 以控制检索时机与质量评估 [41]。先进实现包括用于层次化文档处理的 RAPTOR、受记忆启发的检索架构 HippoRAG,以及利用结构化知识表示改进信息访问的图增强 RAG 系统 [936, 370, 364]。
知识图谱集成与结构化检索。 知识图谱集成通过如 KAPING 等框架应对结构化信息检索:该框架基于语义相似性检索相关事实并将其前置到提示词中,无需模型训练 [48, 679]。KARPA 通过预规划、语义匹配与关系路径推理提供免训练的知识图谱适应,在知识图谱问答任务上达到最先进性能 [262]。
Think-on-Graph 使模型能够在知识图谱上顺序推理以定位相关三元组,开展探索以从外部数据库检索相关信息,同时生成多条推理路径 [1008, 726]。StructGPT 实现迭代的“先读后推理”方法,构造专门函数以从结构化数据源收集相关证据 [495]。
智能体式(agentic)与模块化检索系统。 智能体式 RAG 系统将检索视为动态操作,其中智能体充当智能调查员,分析内容并交叉参照信息 [654, 166, 973]。这些系统纳入复杂的规划与反思机制,需要整合任务分解、多计划选择与迭代精炼能力 [444, 1192]。
模块化 RAG 架构通过标准化接口与即插即用设计实现检索组件的灵活组合。图增强 RAG 系统利用结构化知识表示改进信息访问,而实时 RAG 实现则应对流式应用中的动态信息需求 [316, 1401]。
4.1.3. 动态上下文组装(Dynamic Context Assembly)
动态上下文组装代表将已获取信息组件编排为连贯、任务优化上下文的复杂过程,在尊重计算约束的同时最大化语言模型性能。
组装函数与编排机制。 组装函数 $A$ 涵盖基于模板的格式化、基于优先级的选择以及自适应组合策略,必须适应变化的任务需求、模型能力与资源约束 [708, 1142, 575]。当代编排机制在多智能体系统中管理智能体选择、上下文分发与交互流控制,通过用户输入处理、上下文分发以及基于能力评估的最优智能体选择实现有效协作 [902, 53, 175]。
先进编排框架纳入意图识别、上下文记忆维护与任务分派组件,以实现跨领域特定智能体的智能协调。Swarm Agent 框架利用实时输出引导工具调用,同时应对静态工具注册表与定制通信框架的局限 [814, 267, 250]。
多组件集成策略。 上下文装配必须应对跨模态集成挑战,纳入文本、结构化知识、时序序列以及外部工具接口等多样数据类型,同时保持连贯的语义关系 [535, 1230, 502]。言语化(verbalization)技术将知识图谱三元组、表格行与数据库记录等结构化数据转换为自然语言句子,从而在无需修改架构的情况下与现有语言系统无缝集成 [12, 788, 1072, 13]。
结构化数据的程序设计语言表示——尤其是知识图谱的 Python 实现与数据库的 SQL——在复杂推理任务中优于传统自然语言表示,因其能利用固有的结构属性 [1175]。多层次结构化方法依据语言关系将输入文本重组为分层结构;而结构化数据表示则利用现有大语言模型提取结构化信息,并将关键要素表示为图、表或关系模式 [687, 1134, 1334]。
自动化装配优化。 自动化提示工程(automatic prompt engineering)通过系统化的提示生成与精炼算法,解决人工优化的局限。Automatic Prompt Engineer (APE) 采用搜索算法发现最优提示;LM-BFF 则引入自动化流水线,将基于提示的微调与动态示例纳入相结合,在 NLP 任务上取得最高约 30% 的绝对提升 [311, 421, 596]。Promptbreeder 实现自指涉的进化系统,大语言模型同时改进任务提示以及支配这些改进的变异提示,类比自然选择 [279, 514]。
Self-Refine 通过多轮自我批判与修订实现输出的迭代改进;GPT-4 借此方法取得约 20% 的绝对性能提升 [741, 676]。多智能体协作框架模拟专业化团队动态,智能体承担分析师、编码者、测试者等不同角色,相较单智能体方法,在 Pass@1 指标上取得 29.9%–47.1% 的相对提升 [440, 1266]。
工具集成框架将思维链(CoT)推理与外部工具执行相结合,将中间推理步骤自动生成为可执行程序,并策略性地纳入外部数据。LangChain 为顺序处理链、智能体开发与网页浏览能力提供全面框架支持;Auto-GPT 与 Microsoft 的 AutoGen 等专用框架则以用户友好的接口促进复杂 AI 智能体的开发 [971, 1095, 25, 875]。
4.2. 上下文处理(Context Processing)
上下文处理聚焦于对已获取的上下文信息进行变换与优化,以最大化其对大语言模型的效用。该组件应对超长序列上下文的处理挑战,支持迭代式上下文自我精炼(Contextual Self-Refinement)与适应机制,并促进将多模态、关系型与结构化信息整合为连贯的上下文表示。
4.2.1. 长上下文处理(Long Context Processing)
超长序列上下文处理应对由 Transformer 自注意力 $O(n^{2})$ 复杂度引发的根本性计算挑战:随着序列长度增加,该复杂度形成显著瓶颈,并对实际应用产生实质性影响 [1067, 737, 299, 272, 420]。将 Mistral-7B 的输入从 4K 增至 128K token 需要约 122 倍的计算量增加;而预填充(prefilling)与解码阶段的内存约束亦造成巨大资源需求——Llama 3.1 8B 在每个 128K-token 请求上最高需约 16GB [1040, 1236, 429]。
面向长上下文的架构创新。 状态空间模型(State Space Models, SSMs)通过固定大小的隐状态保持线性计算复杂度与恒定内存需求;Mamba 等模型提供较传统 Transformer 更可扩展的高效递推计算机制 [1267, 351, 350]。LongNet 等膨胀注意力(dilated attention)方法随 token 距离增大而指数扩展注意力场,在保持 token 间对数依赖的同时实现线性计算复杂度,从而能够处理超过十亿 token 的序列 [220]。
Toeplitz Neural Networks (TNNs) 用相对位置编码的 Toeplitz 矩阵对序列建模,将时空复杂度降至对数线性,并支持从 512 个训练 token 外推至 14,000 个推理 token [876, 877]。线性注意力机制通过将自注意力表达为核特征映射的线性点积,将复杂度从 $O(N^{2})$ 降至 $O(N)$,在处理极长序列时可实现最高约 4000× 的加速 [528]。非注意力大语言模型等替代路径则借助递归记忆 Transformer 及其他架构创新突破二次方障碍 [553]。
位置插值与上下文扩展。 位置插值技术通过智能地重缩放位置索引(而非外推至未见位置),使模型能够处理超出原始上下文窗口限制的序列 [153]。神经切线核(Neural Tangent Kernel, NTK)方法为上下文扩展提供数学上有据的框架;YaRN 将 NTK 插值与线性插值及注意力分布校正相结合 [839, 477, 1029]。
LongRoPE 通过两阶段方法实现 2048K token 的上下文窗口:先将模型微调至 256K 长度,再进行位置插值以达到最大上下文长度 [222]。Position Sequence Tuning (PoSE) 通过组合多种位置插值策略,展示了高达 128K token 的显著序列长度扩展 [1387]。Self-Extend 技术采用双层注意力策略——分组注意力与邻近注意力——以捕获远距离与相邻 token 之间的依赖,从而在无需微调的情况下使大语言模型处理长上下文 [505]。
高效处理的优化技术。 Grouped-Query Attention (GQA) 将查询头划分成共享键/值头的组,在多查询注意力与多头注意力之间取得平衡,同时降低解码阶段的内存需求 [16, 1351]。FlashAttention 利用非对称的 GPU 记忆层次(memory hierarchy),实现线性而非二次方的内存扩展;FlashAttention-2 通过减少非矩阵乘法运算并优化工作分配,提供约两倍速度 [200, 199]。
Ring Attention with Blockwise Transformers 通过跨多设备分布计算、利用分块计算并将通信与注意力计算重叠,从而支持极长序列 [682]。稀疏注意力技术包括 LongLoRA 中的 Shifted sparse attention (S²-Attn) 以及带 SF-Attn 的 SinkLoRA,在显著节省计算的同时达到全注意力困惑度改进的 92% [1313, 1226]。
Efficient Selective Attention (ESA) 提出通过将查询与键向量压缩为低维表示,在 token 级别选择关键信息,从而支持处理长达 256K token 的序列 [1092]。BigBird 将局部注意力与可关注整个序列的全局 token 相结合,并辅以随机连接,使高效处理的序列长度可达此前约 8× [1294]。
内存管理与上下文压缩。 内存管理策略包括 Rolling Buffer Cache 等技术:其维持固定注意力跨度,在 32K token 序列上将缓存内存使用降低约 8× [1351]。StreamingLLM 通过保留关键的“注意力汇(attention sink)”token 以及近期的 KV 缓存条目,在无需微调的情况下处理无限长序列;相对滑动窗口重计算,在长达 400 万 token 的序列上最高可加速 22.2× [1185]。
Infini-attention 将压缩记忆纳入普通注意力,在单个 Transformer 块中结合掩码局部注意力与长期线性注意力,从而以有界内存与计算处理无限长输入 [798]。Heavy Hitter Oracle (H₂O) 基于“少量 token 贡献大部分注意力价值”的观察,提出高效的 KV 缓存驱逐策略,吞吐量最高提升约 29×,延迟最高降低约 1.9× [1343]。
QwenLong-CPRS 等上下文压缩技术实现由自然语言指令引导的多粒度压缩动态上下文优化机制 [952]。Inf LLM 将远距离上下文存储于额外记忆单元,并采用高效机制检索与 token 相关的单元用于注意力计算,使在仅数千 token 序列上预训练的模型能够有效处理长达 1,024K token 的序列 [1184]。
4.2.2. 上下文自我精炼与适应(Contextual Self-Refinement and Adaptation)
上下文自我精炼(self-refinement)使大语言模型能够通过循环反馈机制——镜像人类修订过程——改进输出;其借助提示工程以对话式自我交互进行自我评估,有别于强化学习方法 [741, 924, 25, 1220]。
基础自我精炼框架。 Self-Refine 框架由同一模型兼任生成器、反馈提供者与精炼器,表明识别并修复错误往往比一次性产出完美初始解更容易 [741, 1322, 231]。Reflexion 将反思性文本保存在情节记忆缓冲中,供未来决策通过语言反馈使用 [964];结构化引导被证明至关重要,因为过于简单的提示往往无法实现可靠的自我纠错 [678, 593]。
Multi-Aspect Feedback 整合冻结语言模型与专注特定错误类别的外部工具,以实现更全面、独立的评估 [805]。N-CRITICS 框架实施基于集成的评估:初始输出同时由生成该输出的大语言模型及其他模型评估,汇总反馈指导精炼,直至满足任务特定的停止准则 [795]。
A2R 框架对正确性与引用质量等多个维度进行显式评估,为各方面形成自然语言反馈并迭代精炼输出 [583]。ISR-LLM 通过将自然语言翻译为形式化规范、生成初始规划,再由验证器系统精炼,从而改进基于大语言模型的规划 [1383]。
元学习与自主演化。 SELF 以有限示例教会大语言模型元技能(自我反馈、自我精炼),随后模型通过生成并筛选自身训练数据持续自我演化 [710]。自我奖励机制使模型通过迭代式自我评判自主改进:单一模型同时扮演执行者与评判者,最大化其自我赋予的奖励 [1172, 1287]。
Creator 框架扩展了这一范式,使大语言模型通过涵盖创建、决策、执行与识别的四模块过程创建并使用自身工具 [954, 862]。Self-Developing 框架代表最为自主的路径:大语言模型通过迭代循环以可执行代码生成算法候选,从而发现、实现并精炼其自身的改进算法 [472]。
上下文学习(in-context learning)本质上是一种元学习形式:模型在预训练阶段习得可跨多样任务泛化的优化策略,从而在推理时快速适应新挑战 [183, 1174]。元上下文学习(meta-in-context learning)表明,上下文学习能力可通过上下文学习本身递归改进,自适应地重塑对期望任务的先验,并修改上下文学习策略 [181]。
记忆增强的适应框架。 记忆增强是实现元学习的有力途径,例如 Memory of Amortized Contexts 框架:其利用特征提取与记忆增强,将新文档信息压缩为紧凑调制量并存入记忆库 [1019]。Context-aware Meta-learned Loss Scaling 通过元训练小型自回归模型,在在线微调期间为每个 token 动态重加权语言建模损失,以应对过时知识挑战 [436]。
Decision-Pretrained Transformers 展示了如何训练 Transformer 执行上下文强化学习,通过超出预训练分布的泛化来求解此前未见的 RL 问题 [1021, 588]。基于上下文的元强化学习方法通过对上下文编码器的直接监督增强性能,相较端到端训练提高样本效率 [1080]。
长思维链与高级推理。 长思维链(Long Chain-of-Thought)已成为一项重要演进:其以显著更长的推理轨迹支持充分的问题探索,并体现在 OpenAI-o1、DeepSeek-R1、QwQ 与 Gemini 2.0 Flash Thinking 等先进模型中 [148, 724, 1223]。LongCoT 的有效性似乎与上下文窗口容量相关;经验证据表明,更大的上下文窗口往往带来更强的推理表现 [1238]。
扩展推理使模型能够在解题过程中进行自我反思与纠错 [1344]。即便不增加新信息,单纯增加推理步长亦可借助测试时扩展(test-time scaling)在多个数据集上显著增强推理能力 [1355]。
针对冗长推理轨迹带来的计算低效,优化策略包括:经 best-of-N 采样自生成更短推理路径、Zero-Thinking 与 Less-Thinking 等自适应推理模式,以及在保持推理质量的同时减少 token 用量的显式紧凑 CoT 方法 [797, 1358, 703]。Auto Long-Short Reasoning 可按问题复杂度动态调整推理路径长度,帮助模型判断何时需要更长的链条 [721]。
4.2.3. 多模态上下文(Multimodal Context)
多模态大语言模型(Multimodal Large Language Models, MLLMs)将上下文工程扩展至文本之外,把视觉、音频与三维环境等多样数据模态整合为统一的上下文表示。这一扩展在模态融合、跨模态推理与长上下文处理方面引入新挑战,同时使依赖丰富多模态上下文理解的复杂应用成为可能。
多模态上下文集成
基础技术。 多模态 MLLM 在传统大语言模型之上整合视觉、音频与三维环境等多样模态数据 [105, 49, 965]。一种主要集成方式是将视觉输入转换为离散 token,并与文本 token 拼接,从而使大语言模型的生成过程以联合表示为条件 [1295]。这通常由视觉提示生成器(Visual Prompt Generators, VPGs)促成:其在图像–字幕对上训练,以将视觉特征映射到大语言模型的嵌入空间 [613]。主导架构范式是通过 Q-Former 或简单 MLP 等对齐模块,将 CLIP(视觉)或 CLAP(音频)等专用外部多模态编码器连接到大语言模型主干 [19, 86, 615, 1139];该模块化设计允许独立更新编码器而无需重训整个模型 [624]。
高级集成策略。 更精深的方法支持更深的模态融合。跨模态注意力机制直接在大语言模型嵌入空间内学习文本与视觉 token 之间的细粒度依赖,从而增强图像编辑等任务的语义理解 [570, 909, 102]。为管理冗长输入,分层设计分阶段处理各模态以保证可扩展性 [158];“浏览–聚焦(browse-and-concentrate)”范式则在输入大语言模型之前融合多幅图像的上下文,以克服孤立处理的局限 [1143]。部分研究绕过对纯文本大语言模型的适配,转而采用统一训练范式:从一开始即在多模态数据与文本语料上联合预训练,以缓解对齐挑战 [1391, 1233]。另有方法将文本作为通用语义空间,利用大语言模型的上下文学习提升跨多样模态组合的泛化 [1058]。对于视频,上下文集成技术涵盖从提示调优到基于适配器的方法,将视频内容转换为可供推理的序列 [1088]。这些模型的发展往往受制于对海量高质量多模态数据与显著算力资源的需求 [1304, 615, 215]。
多模态上下文处理的核心挑战
模态偏置与推理缺陷。 MLLM 发展中的首要障碍是模态偏置(modality bias):模型偏好文本输入,依赖已学语言模式而非整合的视觉或听觉信息,生成看似合理却未在多模态上接地(grounding)的回答 [1368, 24, 319, 1335]。训练方法会加剧该问题;例如,在简单图像字幕任务上训练的 VPG 仅学会抽取对字幕显著的特征,而忽略对更复杂、基于指令的任务至关重要的其他视觉细节,从根本上限制了深层多模态理解 [613, 510]。因此,MLLM 常在细粒度空间或时间推理上吃力,例如精确目标定位或理解视频中的细致事件序列 [1039, 965],尤其在社交媒体等复杂领域——解读文本与图像交织以理解虚假信息或讽刺尤为困难 [511]。有效的多模态推理不仅要求理解各模态本身,还需推断其组合后的整体含义 [389]。雪上加霜的是,我们对 MLLM 内部机制的理解仍然有限:其内部运作大体上是黑箱,阻碍了更优架构的研发 [1283]。
高级上下文能力与未来方向
上下文学习与长上下文学习。 MLLM 的一项关键能力是上下文学习:模型无需更新权重,即可从提示中的多模态示例适应新任务 [1407, 1408, 557]。链接上下文学习(link-context learning, LCL)通过提供带显式因果链接的示范增强这一能力,从而改进泛化 [1020]。然而,上下文学习受固定上下文窗口制约——图像 token 占用大量空间,限制了多样本学习 [443]。性能亦对输入顺序敏感,且各模态的相对重要性因任务而异 [1028, 1206]。处理长多模态上下文(对视频分析等应用至关重要)仍是主要研究前沿 [1094]。创新包括面向视频的自适应分层 token 压缩 [1128]、可变视觉位置编码(V2PE) [1391]、用于对话记忆的 ContextQFormer 等专用模块 [595],以及面向视频的动态、查询感知帧选择 [587]。MLLM 在延长交互中还表现出涌现的通信效率,该现象仍在研究之中 [442]。
新兴应用。 处理丰富多模态上下文的能力正在解锁新应用。MLLM 被用于预测性推理,例如从视觉场景预测人类活动 [1392],并在多种多模态基准测试上展现出色的感知与认知能力 [294]。在视觉问答(VQA)中,上下文被用于更精确的回答,例如提示 MLLM 为图像生成自身的描述性文本上下文 [1356],或通过检索增强生成(RAG)整合外部知识 [1001, 105]。其他应用包括基于感官输入规划数字动作 [611]、通过记忆增强的上下文理解强化手术决策支持 [422],以及通过整合视觉信息与语音、音频线索实现细腻的视频理解 [648, 1202, 7]。研究者还将 MLLM 扩展至触觉信息、事件数据与图结构等新兴模态 [1368, 1031, 1222]。这些现实用例日益重要,推动了评估上下文理解的综合评估框架的发展 [1118]。这些进展使图像字幕与复杂多模态推理等纯文本模型此前无法实现的应用成为可能 [1182, 683, 139]。
4.2.4. 关系型与结构化上下文(Relational and Structured Context)
大语言模型在处理表格、数据库与知识图谱等关系型与结构化数据时面临根本性约束,源于基于文本的输入要求与顺序架构局限 [495, 47, 1145]。线性化往往无法保留复杂关系与结构属性;当信息分散于上下文各处时,性能会下降 [592, 591, 946]。
知识图谱嵌入与神经集成。 先进编码策略通过知识图谱嵌入将实体与关系转换为数值向量,以应对结构局限,从而在语言模型架构内高效处理 [12, 1259, 938, 1203]。图神经网络捕获实体间复杂关系,经 GraphFormers 等专用架构——在 Transformer 块旁嵌套 GNN 组件——促进跨知识图谱结构的多跳推理 [982, 408, 1230, 489]。
GraphToken 通过显式表示结构信息取得大幅改进,经参数高效的编码函数在图推理任务上最高提升约 73 个百分点 [842]。Heterformer 及其他混合 GNN–LM 架构在统一模型中执行上下文化文本编码与异构结构编码,以应对扩展此类集成系统的计算挑战 [502, 471, 757]。
| 方法 | 方法路径 | 性能 | 关键创新 |
|---|---|---|---|
| ODA [1009] | 观察驱动的智能体框架 | 12.87% 与 8.9% 的提升 | 带行动–反思的递归观察 |
| RAG-KG [1215] | 历史问题知识图谱构建 | 77.6% MRR,0.32 BLEU 提升 | 查询解析与子图检索 |
| KARPA [262] | 免训练知识图谱适配 | 知识图谱问答(KGQA) 达到当时最优 | 预规划关系路径 |
| Faithful Reasoning [726] | 规划–检索–推理框架 | N/A | 经关系路径的 LLM–KG 协同 |
表 3:面向大语言模型增强推理的知识图谱集成方法。
言语化与结构化数据表示。 言语化技术将知识图谱三元组、表格行与数据库记录等结构化数据转换为自然语言句子,从而在无需架构修改的情况下与现有语言系统无缝集成 [12, 788, 1072, 13]。多层次结构化方法依据语言关系将输入文本重组为分层结构;而结构化数据表示则利用现有大语言模型提取结构化信息,并将关键要素表示为图、表或关系模式 [687, 1134, 1334, 1043, 608]。
结构化数据的程序设计语言表示——尤其是知识图谱的 Python 实现与数据库的 SQL——在复杂推理任务中优于传统自然语言表示,因其能利用固有的结构属性 [1175]。使用结构化矩阵表示的资源高效方法,为在结构化数据任务上降低参数量同时保持性能提供了有前景的方向 [347]。
集成框架与协同方法。 知识图谱与语言模型的集成遵循不同范式,各具实现策略与性能权衡 [823, 1149]。预训练集成方法如 K-BERT 在训练期间注入知识图谱三元组以内化事实知识;而推理时方法则可在无需完整重训模型的情况下实现实时知识访问 [696, 1246, 718]。
知识图谱增强的大语言模型通过检索式增强方法纳入结构化知识以改进事实接地,例如 KAPING:其基于语义相似度检索相关事实并前置到提示中,无需模型训练 [48, 679, 597]。更精深的实现通过适配器模块与跨注意力机制,将知识图谱导出的表示直接嵌入模型潜在空间;Text2Graph 映射器则在输入文本与知识图谱嵌入空间之间提供链接 [132, 1074, 432]。
协同方法构建统一系统,使两类技术扮演同等重要角色,通过由数据与知识驱动的双向推理应对根本局限 [823, 859, 1120]。GreaseLM 促进所有模型层上的深度交互,使语言上下文表示由结构化世界知识接地,同时语言细微差别亦可信息化图表示 [1330]。
QA-GNN 通过联合图构建与基于图的消息传递,实现问答上下文与知识图谱之间的双向注意力(attention)机制及相互表示更新 [1259, 982]。
应用与性能增强。 结构化数据集成在多个维度显著增强大语言模型能力:知识图谱提供结构化信息,通过将回答锚定于可验证事实来减少幻觉,并借助清晰界定的信息来源提升事实准确性 [1010, 1352, 204, 571]。知识图谱通过提供结构化实体关系增强推理能力,支持复杂的多跳推理与逻辑推断;其丰富的层次化知识库显著提高推断的精度与可靠性 [1175, 212, 1026]。
真实世界应用在多个专业领域展现出实质性改进。医疗系统通过检索增强生成(Retrieval-Augmented Generation, RAG)框架将结构化医学知识与上下文理解相结合,以改进疾病进展建模与临床决策 [848, 589]。科研平台将发现组织为结构化知识以支持假设生成与研究空白识别;商业分析系统则在基于规则的精确性与人工智能模式识别之间取得平衡,以产生更具可操作性的洞见 [1336, 1070]。
问答系统受益于面向结构化数据源的自然语言接口;这种集成可构建更稳健的系统,能够处理多模态查询并提供个性化回答,从而突破静态知识库的局限 [1326, 1125, 922, 1215]。研究表明,相较于非结构化记忆方法,结构化知识表示可在公开数据集上将摘要性能分别提升 40% 与 14%;而链式关键(Chain-of-Key)策略通过动态结构化记忆更新可带来额外性能增益 [465]。
| 方法 | 数据类型 | 集成方法 | 关键创新 | 任务范围 |
|---|---|---|---|---|
| K-LAMP [48] | 知识图谱 | 基于检索的增强 | KAPING 框架 | 零样本问答 |
| Pan et al. [823] | 知识图谱 | 预训练与推理集成 | 协同化 LLM + KG | 多领域推理 |
| StructLM [1402] | 表格、图、数据库 | 指令微调 | 110 万示例数据集 | 18 个数据集、8 项 SKG 任务 |
| Shao et al. [946] | 表格、数据库、KG | 线性化方法 | 模式链接与语法预测 | Text-to-SQL 任务 |
表 4: 大语言模型中结构化数据集成的代表性方法。
4.3. 上下文管理(Context Management)
上下文管理(Context Management)关注 LLM 中上下文信息的高效组织、存储与利用。该组件应对有限上下文窗口所带来的根本性约束,发展复杂的记忆层次(Memory Hierarchies)与存储架构,并实现压缩技术,以在保持可访问性与连贯性的同时最大化信息密度。
4.3.1. 根本性约束
LLM 在上下文管理方面面临根本性约束,源于多数架构固有的有限上下文窗口规模:这显著降低模型在需要深入理解长文档的任务上的效能,并带来沉重的计算开销,从而阻碍需要快速响应与高吞吐量的应用 [1082]。尽管扩展上下文窗口使模型能够处理整篇文档并捕获更长程依赖,但传统 Transformer 架构的计算复杂度随序列长度呈二次增长,使处理极长文本的代价过高 [1007]。虽有 LongNet 等创新方法将该复杂度降至线性,但在窗口大小与泛化能力之间取得平衡仍具挑战 [1007, 220]。
实证证据揭示了“中间迷失”(lost-in-the-middle)现象:LLM 难以访问长上下文中间部分的信息,而当相关信息位于输入开头或结尾时表现显著更好 [128, 691, 654]。这种位置偏置严重损害扩展思维链(chain-of-thought)推理任务的表现——其中关键的早期结果易被遗忘,性能相较无先验上下文时可急剧下降多达 73% [128, 1147, 381]。
LLM 本质上独立处理每次交互,缺乏跨序列交换维持状态的原生机制以及稳健的自我验证机制;这些约束可追溯至哥德尔不完备定理所揭示的根本局限 [128, 372]。这种根本的无状态性需要显式管理系统来维持连贯的操作序列,并确保稳健的故障恢复机制 [128]。上下文管理面临彼此对立的挑战:上下文窗口溢出——模型因超出窗口限制而“遗忘”先前上下文;以及上下文坍塌(context collapse)——扩大的上下文窗口或对话记忆使模型无法区分不同对话上下文 [993]。研究表明,思维链提示(prompt)所声称的益处并非源于真正的算法学习,而是依赖于问题特定的提示,且随问题复杂度增加而衰减 [992]。长上下文处理的计算开销还带来管理键值(key-value)缓存的额外挑战:缓存随输入长度大幅增长,在延迟与准确性两方面均形成瓶颈;多轮与纵向交互挑战进一步复杂化上下文管理——有限的有效上下文阻碍纵向知识积累,而多样本提示的 token 需求挤压系统与用户输入的可用空间并减慢推理速度 [919, 725, 393]。
4.3.2. 记忆层次与存储架构
现代 LLM 记忆架构采用复杂的层次化设计,并按方法论途径组织,以克服固定上下文窗口的局限。受操作系统启发的层次化记忆系统实现虚拟内存管理概念;MemGPT 是这一路径的典范,其系统在有限上下文窗口(主存)与外部存储之间分页信息,类似于传统操作系统 [819]。此类架构由主上下文(含系统指令、FIFO 消息队列与可写草稿区)以及通过显式函数调用访问的外部上下文组成;借助函数调用能力进行记忆管理,可实现自主分页决策 [837]。PagedAttention 受操作系统中虚拟内存与分页技术启发,用于管理 LLM 中的键值缓存记忆 [57]。
动态记忆组织基于认知原理实现创新系统:MemoryBank 运用艾宾浩斯遗忘曲线理论,根据时间与重要性动态调整记忆强度 [1211, 1372]。ReadAgent 采用情节分页以切分内容、记忆摘要以生成简洁表示,以及交互式查找以检索信息 [1211]。压缩–检索器(compressor-retriever)架构通过使用基座模型前向函数压缩与检索上下文,支持终身上下文管理,并保证端到端可微性 [1245]。
架构适配通过内部修改增强模型记忆能力,包括增强的注意力机制、改进的键值缓存机制以及修改的位置编码 [164, 1362]。知识组织方法将记忆结构化为互联语义网络,以支持自适应管理与灵活检索;而以检索机制为导向的方法则将语义检索与记忆遗忘机制相结合 [521, 1372, 450]。
系统配置通过组织方式在效率与可扩展性之间取得平衡:集中式系统能高效协调任务,但随主题增加在可扩展性上吃力,易导致上下文溢出;去中心化系统可减少上下文溢出,但因智能体间查询而增加响应时间 [400]。混合方法在共享知识与专业化处理之间取得平衡,以实现半自主运行,应对在计算效率与上下文保真度之间取舍的挑战,并缓解记忆饱和——过度存储过往交互会导致检索低效 [164, 400]。上下文管理器组件(Context Manager Components)为大语言模型提供快照创建、中间生成状态恢复以及整体上下文窗口管理等基础能力 [763]。
4.3.3. 上下文压缩(Context Compression)
上下文压缩(Context Compression)技术通过降低计算与记忆负担、同时保留关键信息,使 LLM 能够高效处理更长上下文。基于自编码器的压缩通过上下文内自编码器(In-context Autoencoder, ICAE)实现显著的上下文缩减:ICAE 将长上下文压缩为紧凑记忆槽,LLM 可直接以其为条件,实现 4× 上下文压缩,并在推理时显著提升处理扩展上下文的能力,同时改善延迟与记忆占用 [321]。循环上下文压缩(Recurrent Context Compression, RCC)在受限存储空间内高效扩展上下文窗口长度,并通过指令重建技术应对指令与上下文均被压缩时模型响应变差的挑战 [447]。
记忆增强方法通过基于 kNN 的记忆缓存增强上下文管理:该缓存存储过往输入的键值对以供后续查找,借助基于检索的机制提升语言建模能力 [397]。对比学习方法提高记忆检索准确性;旁路网络在无需微调 LLM 的情况下缓解记忆陈旧;而巩固表示方法则动态更新过往 token 表示,使上下文窗口可任意扩大而不受固定记忆槽限制 [397]。
层次化缓存系统实现复杂的多层方案:激活再填充(Activation Refilling, ACRE)采用双层 KV 缓存——第 1 层缓存紧凑捕获全局信息,第 2 层缓存提供细致局部信息,并根据查询从 L2 动态再填充 L1 中的相关条目,以融合宏观理解与具体细节 [865]。Infinite-LLM 通过 DistAttention 将注意力计算分布到 GPU 集群、跨实例借用记忆的责任机制以及全局规划协调,应对动态上下文长度管理 [943]。KCache 通过将 K Cache 存放于高带宽内存、将 V Cache 保留在 CPU 内存,并基于注意力计算选择性复制关键信息,以优化推理 [943]。
多智能体分布式处理是一种新兴路径:使用基于 LLM 的多智能体方法以分布式方式处理海量输入,应对在处理大量外部知识时知识同步与推理过程中的核心瓶颈 [705]。对真实世界键值缓存访问模式的分析揭示,RAG 与智能体等工作负载具有高缓存可复用性,凸显了高效分布式缓存系统与优化元数据管理的必要性,以减少冗余并提升速度 [1399]。这些压缩技术可与其他长上下文建模方法相结合,进一步增强 LLM 高效处理与利用扩展上下文的能力,同时降低计算开销并保持信息完整性 [321]。
| 方法 | 策略 | 效率 | 准确性 | 长度管理 | 可扩展性 |
|---|---|---|---|---|---|
| O1-Pruner [724] | RL 微调 | N/A | +准确率,-开销 | 自动剪枝 | +效率 |
| InftyThink [1223] | 迭代 + 摘要 | 复杂度降低 | +3–13% | 迭代控制 | 可扩展 |
| Long-CoT Survey [148] | 长 CoT + 推理 | +效率框架 | +复杂领域 | 深度探索 | 测试时扩展 |
| PREMISE [1282] | 提示优化 + 诊断 | 梯度启发优化 | 维持/+准确率 | −87.5% tokens | 性能维持 |
| Prune-on-Logic [727] | 结构感知剪枝 | 选择性剪枝 | +准确性 | 选择性框架 | 基于逻辑的优化 |
表 5: 大语言模型中长链推理方法及其特征。O1-Pruner 使用类强化学习微调缩短推理链同时保持准确性。InftyThink 采用带中间摘要的迭代推理以降低计算复杂度。Long-CoT Survey 探讨长思维链特征如何通过效率改进与增强的知识框架提升推理能力。PREMISE 以轨迹级诊断结合梯度启发优化对提示进行优化,实现 87.5% 的 token 缩减。Prune-on-Logic 通过选择性移除低效用推理步骤,对逻辑图进行结构感知剪枝。
4.3.4. 应用
有效的上下文管理使 LLM 的能力超越简单问答,支撑跨多领域、依托全面上下文理解的复杂应用。文档处理与分析能力使 LLM 能够处理整篇文档或理解完整文章而非片段,通过全面理解输入材料给出上下文相关的回答;这对基因序列、法律文书与技术文献等本身冗长的序列数据尤为重要,因为在广延内容上保持连贯性至关重要 [1007]。
由上下文管理技术促成的扩展推理能力支持需要在扩展序列中维持并基于中间结果进行构建的复杂推理。通过捕获更长程依赖,这些系统支持多步问题求解——其中后续推理依赖先前的计算或演绎——从而赋能需要广泛上下文感知的复杂决策支持系统与科研助手等应用 [1007, 164]。
协作与多智能体系统受益于多轮对话或顺序任务中的有效上下文管理:在此类场景中,维持一致状态并在协作模型间同步内部信息至关重要 [157]。这些能力支撑分布式任务处理、协作内容创作以及多智能体问题求解等应用,要求跨多次交互保持上下文连贯性 [157]。
增强的会话界面依托稳健的上下文管理无缝处理长对话而不丢失线索连贯性,从而实现更自然、可持续的对话,更接近人类交谈 [891]。面向任务的 LLM 系统受益于结构化上下文管理方法:滑动窗口存储实现最小上下文管理系统,将提示与回答永久追加到上下文存储;检索增强生成系统则为 LLM 补充对动态外部信息源的访问 [216, 934]。这些能力支撑个性化虚拟助手、长期辅导系统以及在扩展交互中保持连续性的治疗性会话智能体等应用 [891]。
记忆增强应用实现使 LLM 能够持久存储、管理并动态检索相关上下文信息的策略,支撑需要随时间积累知识的应用:通过持续交互构建个性化用户模型、在扩展交互中实施有效知识管理,以及支持依赖历史上下文的长期规划场景 [164]。诸如上下文感知智能记忆(Contextually-Aware Intelligent Memory, CAIM)等先进记忆框架,通过融入认知 AI 原则的模块增强长期交互:这些模块支持用户特定信息的存储与检索,并支持基于上下文与时间的相关性过滤 [1152]。面向 LLM 智能体的记忆管理纳入类似人类记忆再巩固的过程,包括去重、合并与冲突解决;反思记忆管理(Reflective Memory Management)等方法结合前瞻与回顾反思,以实现动态摘要与检索优化 [1176, 386]。基于案例的推理系统为 LLM 智能体记忆提供理论基础:其架构组件支持认知集成,持久上下文存储技术则实现缓存策略,以更快地供给必要上下文 [387, 385]。这些收益不仅在于处理更长文本,更从根本上通过提升理解力、生成更相关回答以及在扩展互动中保持更大连续性来增强 LLM 交互质量,从而显著拓展 LLM 的效用,并化解受限于受限上下文窗口的局限 [891]。
5. 系统实现(System Implementations)
在上下文工程(Context Engineering)的基础组件(Foundational Components)之上,本节考察将这些组件整合为实用智能架构的复杂系统实现(System Implementations)。这些实现体现了从理论框架到可部署系统的演进,后者运用上下文工程原则。我们介绍四大类系统实现。RAG 系统通过模块化架构与图增强方法展示外部知识集成。记忆系统通过支持长期学习的复杂记忆架构展示持久上下文管理。工具集成推理通过函数调用与环境交互将语言模型转化为世界交互者。多智能体系统通过通信协议与编排机制呈现协调方法。每类实现均建立在基础组件之上,同时应对上下文利用中的特定挑战,展示理论原则如何转化为实用系统。
5.1. 检索增强生成(Retrieval-Augmented Generation)
检索增强生成(Retrieval-Augmented Generation)通过将外部知识源与语言模型生成相集成,弥合参数化知识与动态信息访问之间的鸿沟。该实现使模型能够通过模块化架构、智能体式框架与图增强方法访问当前的、领域特定的信息,从而超越静态训练数据。
5.1.1. 模块化RAG架构
模块化RAG(Modular RAG)从线性检索–生成架构转向具有灵活组件交互的可重构框架 [315, 1140, 597]。不同于朴素 RAG(Naive RAG)与高级 RAG(Advanced RAG)的查询改写,模块化 RAG 引入层次化架构:顶层 RAG 阶段、中层子模块与底层操作单元 [316, 736]。这通过路由、调度与融合机制超越线性结构,实现动态重构 [316]。
形式化表示 $\mathrm{RAG} = {R, G}$ 通过复杂的模块编排运作,支持改写–检索–阅读(Rewrite-Retrieve-Read)模型与生成–阅读(Generate-Read)方法,并纳入自适应搜索模块、用于多查询处理的 RAGFusion、用于最优数据源选择的路由模块,以及兼顾检索准确性与上下文相关性的混合检索策略 [315, 497, 916, 1053, 888, 95]。
图 4: 检索增强生成框架:RAG 系统架构概览,包括模块化RAG、智能体式RAG系统以及用于外部上下文集成的图增强RAG方法。(原文图见 PDF 第 27 页)
当代框架在检索准确性与可信度方面展现显著改进 [1382]。FlashRAG 提供含 5 个核心模块与 16 个子组件的模块化工具包,支持独立调整与流水线组合 [506]。KRAGEN 通过将知识图谱与向量数据库集成增强生物医学问题求解,利用面向生物医学知识图谱优化的提示生成,以应对复杂推理中的幻觉 [401, 755, 981]。ComposeRAG 实现用于问题分解与查询改写的原子模块,并纳入自我反思机制以进行迭代精炼 [1168]。这种模块性便于与微调及强化学习集成,支持面向特定应用的定制化,以及覆盖多样化 NLP 任务的综合工具包 [316, 920, 4]。
5.1.2. 智能体式RAG系统(Agentic RAG)
智能体式RAG(Agentic RAG)将自主 AI 智能体嵌入 RAG 流水线,实现由持续推理引导的动态、上下文敏感操作 [973, 281]。这些系统借助反思、规划、工具使用与多智能体协作,动态管理检索策略,并使工作流适配复杂任务需求 [973]。RAG 与智能体工作流通过对齐而关联:查询改写对应语义理解,检索阶段对应规划与执行 [628]。
基于 LLM 的自主智能体通过多模态感知、工具利用与外部记忆集成扩展基础语言模型能力 [1169, 1099, 939, 849]。外部长期记忆作为知识数据存储,使智能体能够在较长时期内纳入并访问信息 [1169, 386]。不同于静态方法,智能体式 RAG 将检索视为动态操作,智能体充当智能调查员,分析内容并交叉核验信息 [654, 166]。
实现范式包括无需额外训练的基于提示的方法,以及通过强化学习优化模型以进行策略性工具调用的基于训练的方法 [654, 1327, 973]。先进系统使 LLM 智能体能够在单一工作流中查询向量数据库、访问 SQL 数据库或调用 API;方法论进展聚焦于推理能力、工具集成、记忆机制以及面向自主决策的指令微调 [709, 6]。
核心能力包括通过任务分解、多计划选择与记忆增强规划策略实现的推理与规划组件,使智能体能够拆解复杂任务并选择合适策略 [444, 445]。PlanRAG 通过先规划再检索的方法改进决策,使智能体能够评估多信息源并优化检索策略;SLA 管理框架则面向可重构多智能体架构 [166, 467]。工具利用使系统能够调用搜索引擎、计算器与 API 等多样化资源;ReAct 与 Reflexion 等框架展示了将推理与行动交错如何增强适应性 [166, 1169, 964]。记忆机制提供外部长期存储,而自适应检索策略则支持对复杂度与上下文的自主分析 [166, 1137]。
自我反思与适应机制使智能体式 RAG 系统能够通过基于先前交互结果精炼操作的迭代反馈环,在动态环境中运行 [1192, 692]。MemoryBank 等先进记忆系统实现受艾宾浩斯遗忘曲线启发的更新机制,增强智能体从过往交互中检索并应用所学的能力 [1372, 169]。CDF-RAG 采用闭环过程,将因果图检索与强化学习驱动的查询精炼及幻觉纠正相结合 [537]。Self-RAG 训练按需检索段落、并对其检索与生成进行反思的模型,在推理时使用反思 token 控制行为 [243, 41]。
5.1.3. 图增强RAG(Graph-Enhanced RAG)
基于图的检索增强生成从面向文档的方法转向捕获实体关系、领域层次与语义连接的结构化知识表示 [120, 1363, 364, 1401]。这使得能够提取向语言模型提供相关信息的特定推理路径,并通过结构化路径导航支持多跳推理 [120]。图结构借助互联性增强上下文感知检索与逻辑连贯性,从而最小化上下文漂移与幻觉 [518, 812]。
知识图谱作为基础表示,以结构化格式封装实体及其相互关系,支持高效查询与语义关系捕获 [166, 1066]。基于图的知识表示可划分为:以图作为知识载体的基于知识的 GraphRAG、以图作为索引工具的基于索引的 GraphRAG,以及结合两者的混合 GraphRAG [1208]。复杂实现包括带社区检测的 GraphRAG 层次化索引、将文档组织为三层层次结构的 PIKE 多层次异构知识图谱,以及 EMG-RAG 的可编辑记忆图(Editable Memory Graph)架构 [317]。
图神经网络通过应对处理结构化知识方面的局限增强 RAG 系统;GNN 擅长捕获实体关联并提升知识一致性 [232, 116]。GNN-RAG 实现采用轻量级架构以有效检索知识图谱元素,在与语言模型对接前改进图结构捕获 [1380, 166]。集成过程涵盖通过节点与边提取构建图、基于查询的检索,以及纳入检索信息的生成 [1380]。
多跳推理能力使基于图的系统能够跨多个相连知识图谱节点综合信息,从而促进需要互联事实整合的复杂查询求解 [1066, 170]。这些系统采用结构化表示,以非结构化文本无法实现的方式捕获实体间语义关系与领域层次 [1066, 170]。Hierarchical Lexical Graph 等先进框架在保留陈述来源的同时对主题聚类以支持灵活检索,并链接实体以进行基于图的遍历 [333]。GraphRAG、LightRAG 及其衍生系统实现双层检索、层次化索引与图增强策略,以支持稳健的多层次推理 [1183, 317]。
主流架构展现了图增强检索的多样化方法,其优化策略在检索有效性方面取得了显著提升 [106]。LightRAG 通过双层检索范式将图结构与向量表示相结合,提升了效率与内容质量 [416, 723]。HippoRAG 利用知识图谱上的个性化 PageRank,在多跳问答中取得了显著改进 [1096, 752, 370]。HyperGraphRAG 提出超图结构化表示,超越了二元关系 [723]。RAPTOR 提供层次化摘要树构建以实现递归上下文生成,而 PathRAG 则为基于图的检索引入了剪枝技术 [1359, 936, 134]。这些结构化方法能够实现带有显式实体连接的透明推理路径,降低噪声并改善语义理解,同时克服传统检索增强生成(RAG)的挑战 [1183, 518]。
5.1.4. 应用
实时 RAG 系统应对生产环境中的关键挑战,其中动态知识库需要持续更新与低延迟响应 [1349, 534]。核心挑战包括高效部署与处理流水线优化,现有框架缺乏即插即用方案,因而需要系统级优化 [1349]。流式数据的集成引入了额外复杂性,因为传统架构在信息频繁变化时准确率较差,且随着文档量增长效率下降 [520]。
动态检索机制通过在生成过程中持续更新策略,超越了静态方法:基于生成状态与已识别的知识缺口,实时调整目标与语义向量空间 [388]。当前在确定最优检索时机与查询构造方面的局限,通过思维链(Chain-of-Thought)推理、迭代检索过程、分解式提示,以及用于动态检索的 LLM 生成内容等方法加以应对,从而实现自适应信息选择;相关方法还扩展到通过反思标签增强生成质量的自适应控制机制 [1000, 536, 85, 539, 1248]。
低延迟检索方法利用基于图的技术,在速度–准确率优化方面展现出显著潜力,稠密段落检索技术则提供了基础性改进 [525]。LightRAG 的双层检索系统增强了信息发现能力,同时将图结构与向量表示相结合以实现高效的实体关系检索,在保持相关性的同时缩短响应时间 [364]。多阶段检索流水线通过基于图的重排序等技术优化计算效率,在降低存储需求的同时实现对当前信息的动态访问 [982]。
可扩展性方案采用分布式处理架构,结合高效的数据分区、查询优化,以及适应变化流条件的容错机制 [1048, 35]。通过转换后的重击者(heavy hitters)流式算法进行内存优化,可智能过滤无关文档并保持质量,这对内容频繁变化的场景尤为有价值 [520]。生产框架通过支持查询扩展等预检索过程以及压缩与选择等后检索精炼的模块化 RAG 架构展现效率提升,从而能够对各个组件进行微调 [1077]。
增量索引与动态知识更新确保系统无需完全重新训练即可适应新信息,这在网络安全与气候金融等快速演进的领域尤为关键 [836, 1064]。现代框架纳入动态知识检索方法,能够基于不断演进的输入与上下文信息持续调整策略,增强交互性与语义理解,同时提升跨领域集成的适用性 [388]。先进的基于智能体的方法在复杂环境中展现出精细的任务分配能力,例如需要实时决策的协同无人机操作,其应用还延伸到具身智能体的接地规划 [1324, 983]。动态检索增强生成框架如 DRAGON-AI 展示了面向本体生成的专门实现,结合文本与逻辑组件,并纳入自记忆机制以实现迭代改进 [1051]。这些进展标志着向在动态环境中无缝集成实时知识与灵活检索能力的显著演进。
5.2. 记忆系统(Memory Systems)
记忆系统(Memory Systems)通过实现持久化的信息存储、检索与利用机制,使大语言模型(LLM)能够超越无状态交互。这一实现将模型从模式匹配处理器转变为能够学习、适应,并在扩展交互中具备长期上下文理解能力的复杂智能体。
图 5:记忆系统框架:面向 LLM 超长上下文处理的记忆架构、记忆增强智能体与评估挑战概览。(原文图见 PDF 第 30 页)
5.2.1. 记忆架构(Memory Architectures)
记忆使复杂语言系统区别于模式匹配模型,使其能够跨自然语言任务进行信息处理、存储与利用 [1191, 1176, 300]。尽管在文本生成与多轮对话方面取得突破,LLM 仍面临相当大的记忆系统约束 [1191]。神经记忆机制受困于结构化信息存储不足,以及依赖近似向量相似度计算而非精确符号运算,这对多跳推理中的准确存储与检索构成挑战 [427]。这些局限是开发在复杂现实世界应用中有效运行的 AI 系统所面临的关键挑战 [550]。
记忆分类框架。 LLM 记忆系统可按多种分类框架加以组织。主要的时间分类将记忆划分为三类:感觉记忆(sensory memory,输入提示)、短期记忆(short-term memory,即时上下文处理),以及长期记忆(long-term memory,外部数据库或专用结构) [943]。从持久性视角看,短期记忆包括仅存在于单次会话中的键值缓存与隐藏状态,而长期记忆涵盖基于文本的存储以及嵌入模型参数中的知识,可跨多个交互周期持久存在 [943, 824]。
基于实现方式的分类识别出参数记忆(parametric memory,编码于模型权重中的知识)、短暂激活记忆(ephemeral activation memory,受上下文限制的运行时状态),以及通过检索增强生成(RAG)方法访问的明文记忆(plaintext memory) [643]。当前实现缺乏精细的生命周期管理与多模态集成,限制了长期知识演化。前馈网络层作为存储记忆的键值表,充当词语检索的“内部词库”,并形成类似人类联想记忆的机制 [524, 329, 330, 770, 470]。这些分类方案反映了构建与人类认知系统相平行的 LLM 记忆架构的尝试 [1176]。
短期记忆机制。 LLM 中的短期记忆通过上下文窗口运作,充当工作记忆(working memory),维持对先前处理过的 token 的即时访问 [1291]。该功能通过存储 token 表示的键值缓存实现,但在会话终止时消失 [899]。架构变体展现出显著差异:基于 Transformer 的模型实现工作记忆系统,可在任意延迟下灵活检索单个 token 表示;而 LSTM 架构则维持更粗粒度、快速衰减的语义表示,并偏向最早的条目 [40]。
现代 LLM 短期记忆常表现为上下文学习,反映模型在上下文窗口内临时获取与处理信息的能力 [1189, 103]。这使得无需参数更新即可进行少样本学习与任务适应。研究识别出三种主要记忆配置:完整记忆(利用全部上下文历史)、有限记忆(使用上下文子集),以及无记忆操作(不使用历史上下文)[1052]。尽管进展已将上下文窗口扩展至数百万 token,LLM 在对扩展上下文进行有效推理方面仍存在困难,尤其当相关信息出现在中间位置时 [899, 691]。
长期记忆实现。 由于上下文窗口限制与灾难性遗忘,LLM 在维持长期记忆方面面临重大挑战 [114]。基于外部记忆的方法通过利用物理存储缓存历史信息来应对这些限制,从而无需在受限上下文窗口内保留全部信息即可检索相关历史 [688, 1372]。这些方法与关注降低自注意力计算成本以扩展序列长度的基于内部记忆的方法形成对比 [688, 291]。
长期记忆实现可归类为知识组织方法(将记忆结构化为相互连接的语义网络)、面向检索机制的方法(将语义检索与遗忘曲线机制相结合),以及架构驱动方法(实现带有显式读写操作的层次结构)[521, 1372, 450]。记忆存储表示可进一步划分为 token 级记忆(信息以结构化文本形式存储以便直接检索)与潜在空间记忆(利用高维向量进行抽象且紧凑的信息表示)[1225, 1133]。先进方法融入心理学原理,其中 MemoryBank 实现艾宾浩斯遗忘曲线理论,基于时间因素进行选择性记忆保留 [1372];情感感知框架采用心境依存记忆理论 [450];记忆机制则通过抽取脆弱性分析在性能优势与隐私关切之间取得平衡 [1049, 122, 123]。
记忆访问模式与结构。 LLM 展现出与人类认知过程具有显著相似性的特征性记忆访问模式,在回忆信息列表时表现出清晰的首因效应与近因效应 [483]。记忆检索通过顺序访问(按连续顺序检索内容)与随机访问(从任意点访问信息而无需处理前述内容)运作 [1397]。记忆持久性研究采用识别实验、回忆实验与保持实验,以量化信息可访问时长与检索条件 [816];语义记忆与情景记忆(episodic memory)整合等认知心理学概念可提升 LLM 的信息综合能力 [244]。
记忆组织涵盖多样化结构方法,包括文本形式存储(完整与近期的智能体–环境交互、检索到的历史交互、外部知识)、知识表示结构(块、知识三元组、原子事实、摘要、混合方法)、带有库增强推理组件的层次系统,以及按任务、时间相关性或语义关系组织的功能模式 [1339, 1299, 1035]。核心记忆操作包括编码(将文本信息转换为潜在空间嵌入)、检索(基于语义相关性、重要性与近因性访问相关信息)、反思(提取更高层洞察)、摘要(压缩文本同时突出关键要点)、利用(整合记忆组件以形成统一输出)、遗忘(选择性丢弃信息)、截断(在 token 限制内进行格式化),以及判断(评估信息重要性以确定存储优先级)[1341]。这些结构在全面性、检索效率与计算需求之间提供不同权衡。
5.2.2. 记忆增强智能体(Memory-Enhanced Agents)
记忆系统从根本上将 LLM 从无状态模式处理器转变为能够在扩展交互中进行持久学习与适应的复杂智能体 [1268]。记忆增强智能体(Memory-Enhanced Agents)同时利用短期记忆(促进实时响应与即时上下文感知)与长期记忆(支持在更长时期内的深层理解与知识应用),以适应变化的环境、从经验中学习,并做出需要持久信息访问的知情决策 [1268]。
智能体架构集成。 当代 LLM 智能体采用类似于计算机内存层次结构的记忆系统:短期记忆作为上下文窗口内上下文理解的主存储,而长期记忆则作为扩展信息保留的持久存储 [776]。从面向对象视角看,AI 系统生成与个体用户相关的个人记忆,以及包含中间任务结果的系统记忆 [1176]。诸如 MemOS 等结构化框架将记忆划分为参数记忆(编码于模型权重中的知识)、激活记忆与明文记忆;参数记忆表示嵌入前馈与注意力层中的长期知识,支持零样本生成 [643]。
记忆集成框架已演进为通过精细架构应对 LLM 局限。自控记忆(Self-Controlled Memory, SCM)框架通过基于 LLM 的智能体主干、记忆流以及管理更新与利用的记忆控制器来增强长期记忆 [655]。REMEMBERER 框架为 LLM 配备经验记忆,以跨任务目标利用过往情节,通过言语强化与自我反思反馈机制,无需参数微调即可实现成败学习 [1308]。诸如 MemLLM 等先进系统实现结构化读写记忆模块,应对稀有事件记忆、信息更新与防止幻觉等挑战 [785]。利用 LLM 的自主智能体依赖四个基本组件——感知、记忆、规划与行动——协同工作以实现环境感知、交互回忆以及实时规划与执行 [620, 38]。
| 文本形式 | 参数形式 | |||||
|---|---|---|---|---|---|---|
| 模型 | 完整 | 近期 | 检索 | 外部 | 微调 | 编辑 |
| 核心记忆系统 | ||||||
| MemoryBank [1373] | × | × | ✓ | × | × | × |
| RET-LLM [784] | × | × | ✓ | × | × | × |
| ChatDB [427] | × | × | ✓ | × | × | × |
| TiM [689] | × | × | ✓ | × | × | × |
| Voyager [1086] | × | × | ✓ | × | × | × |
| MemGPT [820] | × | ✓ | ✓ | × | × | × |
| RecMind [1124] | ✓ | × | × | × | × | × |
| Retroformer [1258] | ✓ | × | × | ✓ | ✓ | × |
| ExpeL [1347] | ✓ | × | ✓ | ✓ | × | × |
| Synapse [1367] | × | × | ✓ | × | × | × |
| 基于智能体的系统 | ||||||
| ChatDev [861] | ✓ | × | × | × | × | × |
| InteRecAgent [456] | × | ✓ | ✓ | ✓ | × | × |
| TPTU [917, 560] | ✓ | × | × | ✓ | × | × |
| MetaGPT [413] | ✓ | × | × | × | × | × |
| S3 [305] | × | × | ✓ | × | × | × |
| Mem0 [173] | × | × | ✓ | × | × | × |
| 先进记忆架构 | ||||||
| Larimar [202] | × | ✓ | ✓ | × | × | ✓ |
| EM-LLM [290] | × | ✓ | ✓ | × | × | × |
| Controllable Working Memory [603] | ✓ | ✓ | ✓ | × | ✓ | × |
| Working Memory Hub [359] | ✓ | ✓ | ✓ | ✓ | × | × |
| 近期与新兴系统 | ||||||
| LLM-based Opinion Dynamics [179] | × | × | ✓ | × | × | × |
| Memory Sandbox [462] | × | × | ✓ | × | × | ✓ |
| A-MEM [1212] | × | × | ✓ | × | × | ✓ |
| MemEngine [1341] | × | × | ✓ | ✓ | × | × |
| HIAGENT [433] | × | ✓ | ✓ | × | × | × |
| MemInsight [925] | × | × | ✓ | ✓ | × | × |
| Memory Sharing (MS) [306] | × | × | ✓ | ✓ | × | × |
| MemoRAG [866] | ✓ | × | ✓ | ✓ | ✓ | × |
| Echo [700] | ✓ | ✓ | ✓ | ✓ | ✓ | × |
表 6:扩展自 [1339]:记忆实现模式。✓= 已采用,×= 未采用
现实世界应用。 记忆增强 LLM 智能体已在多样化应用领域展现变革性影响。在对话式 AI 中,记忆系统通过回忆过往体验与用户偏好,交付个性化、上下文感知的响应,从而实现更自然、类人的交互。商业实现包括 Charlie Mnemonic(结合使用 GPT-4 的长期、短期与情景记忆)、Google Gemini(利用长期记忆在 Google 生态系统中提供个性化体验),以及 ChatGPT Memory(跨会话记住对话)[584]。用户模拟应用采用由 LLM 驱动的对话智能体模仿人类行为,以进行成本效益高的对话系统评估,并可灵活适应开放域对话、任务导向交互与对话式推荐 [208];诸如 Memory Sandbox 等系统通过数据对象操作使用户能够控制对话记忆 [461]。
任务导向智能体利用记忆以最少的人工干预执行复杂自主操作,将 LLM 作为控制器,并通过多模态感知、工具利用与外部记忆加以扩展 [1169]。应用涵盖推荐系统(RecMind 通过规划与外部知识提供个性化推荐,InteRecAgent 将推荐模型作为工具与 LLM 结合使用)、自动驾驶(DiLu 通过推理、反思与记忆注入类人知识)、科学研究(ChemCrow 自动化化学合成设计与执行),以及社会仿真(生成式智能体通过记忆存储与综合展现可信行为)[1027, 653, 92, 831]。主动对话智能体应对战略对话场景中的挑战,这些场景需要目标导向的对话引导,通过基于提示的策略规划方法以及基于对话历史的 AI 反馈生成加以实现 [208, 207]。
个性化助手应用利用记忆与用户维持连贯的长期关系,记忆组件作为结构化仓储,存储包括用户偏好与历史交互在内的上下文相关信息 [444]。领域特定实现包括采用记忆协调进行医疗交互的医疗助手 [1325, 1316]、利用外部知识库的推荐智能体 [1325, 1302]、通过记忆支持的进度跟踪提供上下文感知支持的教育智能体 [653],以及像 MARK 这样通过用户偏好记忆增强个性化 AI 助手的专门框架 [303]。
记忆技术与集成方法。 记忆技术演进通过 RAG 应对根本性的上下文窗口限制:RAG 结合参数与非参数记忆,使用预训练的 seq2seq 模型与稠密向量索引进行语言生成 [1218, 597]。该方法无需重新训练即可访问参数存储之外的信息,显著扩展知识能力。包括向量数据库与检索增强生成在内的先进记忆机制,能够实现海量信息存储与快速相关数据访问,并纳入短期上下文记忆与长期外部存储 [38, 371, 1193, 513]。
非参数方法在保持 LLM 参数冻结的同时,利用 RAG 等外部资源丰富任务上下文 [942]。诸如 Reflexion 等系统通过情景记忆缓冲区中的自我反思反馈实现言语强化,而 REMEMBERER 则纳入持久经验记忆,从而能够从过往成败中学习。诸如 MemoryBank 等先进架构通过整合先前交互信息,支持记忆检索、通过更新实现持续演化,以及个性适应 [1211, 1372]。
专门记忆架构通过精细的组织与检索机制应对特定智能体需求。早期系统需要预定义的存储结构与检索时机,而像 Mem0 这样的较新系统则遵循 RAG 原则纳入图数据库,以实现更有效的记忆组织与基于相关性的检索 [1211]。包括 OpenAI ChatGPT Memory、Apple Personal Context、mem0 与 MemoryScope 在内的商业与开源实现,表明记忆系统在增强个性化能力方面已被广泛采用 [1176]。工具增强范式验证了在复杂任务分解中的有效性,同时利用与世界交互的工具;记忆增强智能体正成为现代 AI 系统的核心,通过自然语言整合规划、工具使用、记忆与多步推理来执行复杂任务 [251, 360, 1099, 34]。
5.2.3. 评估与挑战
记忆评估框架已成为系统评估 LLM 智能体在多维度能力方面的关键组件,反映了智能系统中记忆的多面性。这些全面评估方法揭示了重大挑战,同时指向有望解锁记忆增强智能体新能力的研究方向。
评估框架与指标。 当代记忆评估采用专门指标,超越传统 NLP 性能指标,以捕捉记忆功能的细微方面 [1340]。有效性指标通过准确率(基于历史消息的响应正确性)与 recall@5 指标(在前 5 个结果中检索到相关消息的百分比),聚焦事实信息的存储与利用。效率指标通过响应时间(信息检索与利用所需时长)与适应时间(新信息存储所需时段)考察时间维度 [1340]。
诸如 LongMemEval 等大规模基准测试评估五项基本长期记忆能力:信息抽取、时间推理、多会话推理、知识更新与弃答,通过 500 个精心选取的问题,表明商业助手在长时间交互中准确率下降约 30%;自动化记忆评估框架则促进超越通关密钥搜索方法的全面评估 [1180]。专门框架通过评估时间定位体验的基准测试面向情景记忆;研究表明,包括 GPT-4、Claude 变体与 Llama 3.1 在内的前沿模型,即使在相对较短的上下文中,面对涉及相互关联事件或复杂时空关联的情景记忆挑战时仍遇到困难 [463]。当代 LLM 基准测试主要集中于评估模型对事实信息与语义关系的保持,却实质性地忽视了情景记忆评估——即将记忆与时间与空间发生细节进行情境化的能力 [847]。
任务特定评估涵盖长上下文段落检索(在扩展上下文中定位特定段落)、长上下文摘要(形成全面理解以生成简洁摘要)、NarrativeQA(基于冗长叙事回答问题),以及像 MADail-Bench 这样在对话语境中评估被动与主动记忆回忆的专门基准测试,其新颖维度包括记忆注入、情感支持能力与亲密度评估 [1339, 1390, 556, 390]。其他任务特定框架包括用于会议摘要的 QMSum、用于阅读理解的 QuALITY、需要时空记忆的基于对话问答的 DialSim,以及使用两阶段过程评估物理环境任务中记忆利用的个性化具身智能体评估框架 MEMENTO [1390, 572]。
当前局限与挑战。 记忆评估面临显著限制能力有效评估的挑战。根本局限包括缺乏评估记忆性能的一致、严格方法论,尤其是在训练数据之外的泛化方面 [288]。缺乏专门为长期记忆评估设计的标准化基准测试是另一重大障碍,现有框架往往无法捕捉类人智能所需记忆能力的全谱 [1079]。
架构约束显著增加了评估难度,因为大多数当代基于 LLM 的智能体以根本上无状态的方式运行,将交互视为彼此独立,并未真正随时间增量积累知识 [1365, 1364]——尽管通过注意力标记机制实现的工作记忆进展已使灵活的记忆表示控制成为可能 [870]。这一局限阻碍了对真正终身学习的评估——终身学习是人类水平智能的基石,涉及跨多样情境与延展时间跨度的持续知识获取、保留与重用。
当试图将记忆相关性能与其他智能方面相隔离时会出现方法论问题,从而难以判定失败究竟源于记忆机制不足,还是推理能力的局限 [288]。现实应用中的动态记忆使用也对评估构成挑战,因为受控的实验室测试难以充分刻画记忆系统在复杂场景中的表现——在这些场景中,信息相关性会以不可预测的方式发生变化 [1079]。
优化策略与未来研究方向 记忆优化涵盖多种技术,旨在提升利用率的同时最小化计算开销并最大化效率。受生物学启发的遗忘机制提供了有效的优化途径,例如 MemoryBank 等框架采用艾宾浩斯遗忘曲线,依据时间因素与重要性有选择地保留或丢弃信息 [1372]。基于反思的优化则通过 Reflexion 等系统,经集成评估与自我反思进行性能评估,构建双重反馈系统,通过持续学习精炼记忆与行为 [304]。
层次化记忆结构通过多层级格式优化信息组织以实现高效检索,其例证包括具备快速记忆访问模块的基于经验的层次控制(Experience-based Hierarchical Control)框架 [868]、通过双向快–慢变量交互实现的记忆巩固过程 [63],以及依据查询相关性动态排序记忆的自适应交叉注意力网络(Adaptive Cross-Attention Networks)[410]。
未来研究方向包括:结合参数化精度与非参数化效率的混合记忆框架 [942]、用于可扩展响应评估的自动化反馈机制 [893]、通过共享外部记忆实现协作学习的多智能体记忆系统 [306]、融合知识图谱的增强元数据学习 [896, 386]、面向特定应用的领域专用记忆架构 [507]、在非活跃期融入记忆巩固的认知启发优化 [758],以及通过低秩适应(Low-Rank Adaptation)等技术实现参数高效的记忆更新以完成高效知识整合 [428, 256]。这些进展有望推动记忆增强的大语言模型智能体迈向更复杂、类人的认知能力,同时缓解计算与架构层面的局限;其应用可延伸至长期机器人规划、现实决策系统,以及通过流式学习场景与持续反馈集成实现的协作式 AI 助手 [1159, 1346, 1278]。
5.3. 工具集成推理(Tool-Integrated Reasoning)
工具集成推理(Tool-Integrated Reasoning)将语言模型从被动的文本生成器转变为能够动态利用工具并操控环境的主动世界交互者。该实现使模型能够通过函数调用(Function Calling)机制、集成推理框架以及复杂的环境交互能力,突破其固有局限。
5.3.1. 函数调用(Function Calling)机制
函数调用通过利用函数抽象机制的结构化输出生成,将大语言模型从生成式模型转变为交互式智能体,使其能够操控外部工具,并获取当前的、领域特定的信息以解决复杂问题 [5, 669, 335, 882, 58, 523, 1113]。
其演进始于 Toolformer 的自监督方法,该方法展示了自主 API 学习能力,并启发了 ReAct 的“思考–行动–观察”循环;随后发展为 Gorilla 等专用模型,以及 ToolLLM、RestGPT 等综合性框架,并以 OpenAI 的 JSON 标准化为标志;而 Chameleon 等进阶系统实现了多模态问答,TaskMatrix.AI 则跨领域管理各类 AI 模型 [939, 252, 654, 547, 923, 874, 875, 715, 659, 953]。
图 6:工具增强系统框架: 经函数调用机制、工具集成推理与环境交互能力,从文本生成器演进为世界交互者。
技术实现主要包括微调(主流方法,通过大规模 API 训练提供稳定能力,但资源需求较高)与提示工程(灵活、资源高效但不稳定);诸如“逆向链”(Reverse Chain)等方法可借助提示实现 API 操作,并应对大规模工具管理中的挑战 [392, 5, 1332, 791, 144, 254]。
核心流程涵盖意图识别、函数选择、参数–值对映射、函数执行与响应生成;现代实现利用结构化的大语言模型输出与外部程序交互,而工具则包括多样接口(数字系统、草稿本、用户交互、其他大语言模型、开发者代码),需要在工具选择、参数构造与结果解析之间进行复杂导航 [1268, 669, 1141, 193, 960, 590, 910]。
训练方法与数据系统 训练方法已从基础的基于提示的方法演进为复杂的多任务学习框架;通过对专用数据集进行微调——例如 ToolLLM 与 Granite-20B-FunctionCalling 等系统——通常先使用合成的单工具数据,再辅以人工标注 [392, 5, 357, 777, 1235]。
数据生成策略包括 Weaver 基于 GPT-4 的环境合成,以及 APIGen 的分层验证流水线(格式检查、函数执行、语义验证),在数千个 API 上生成了 60,000+ 条高质量条目 [1113, 1186, 1268, 1165, 65, 1403, 749]。
工具选择增强涉及无关性感知的数据增强,包括 Hammer 的函数掩码技术、用于提升难度的 oracle 工具混合,以及用于缓解过度触发的工具意图检测合成;这些方法强调通过严格过滤与格式验证保证高质量数据 [670, 10, 357, 473, 1300, 218]。
自我改进范式通过降低对外部监督的依赖来实现,例如 JOSH 算法的稀疏奖励仿真环境,以及 TTPA 结合面向错误打分的 token 级优化;在保持通用能力的同时展现出性能提升 [579, 446, 366, 1271]。
复杂基准测试包括 API-Bank(73 个 API、314 段对话)、StableToolBench(针对 API 不稳定性的解决方案)、NesTools(嵌套工具评估)、ToolHop(995 个查询、3,912 个工具),覆盖从单工具到多跳场景 [621, 363, 377, 1264, 827, 995, 1257, 987]。
5.3.2. 工具集成推理(Tool-Integrated Reasoning)
工具集成推理(Tool-Integrated Reasoning, TIR)代表了大语言模型能力的范式性进展,通过在推理过程中与外部资源进行动态交互,应对知识过时、计算不准确以及推理浅层等根本局限 [864]。与完全依赖模型内部知识的传统推理方法不同,TIR 建立了一种协同关系:推理引导将复杂问题分解为可管理的子任务,而专用工具则确保每一步计算的准确执行 [777]。该范式超越常规的基于文本的推理,要求模型自主选择合适工具、解释中间输出,并根据实时反馈自适应地精炼其方法 [864]。
TIR 方法的演进涵盖三类主要实现,分别针对工具利用优化的不同方面。基于提示的方法通过精心设计的指令引导模型而无需额外训练,例如将数学问题分解为可执行代码、并将计算委派给 Python 解释器的方法 [155, 601]。监督微调方法通过模仿学习教会工具使用,如 ToRA 等系统聚焦数学问题求解,将自然语言推理与计算库及符号求解器相结合 [345]。强化学习方法通过结果驱动的奖励优化工具使用行为,但现有实现往往只优先最终正确性而不考虑效率,可能导致认知卸载现象——即模型过度依赖外部工具 [227]。
在操作层面,基于 TIR 的智能体充当智能编排者,系统性地将认知处理与外部资源参与交织,以实现既定目标 [1095]。该机制要求内在推理能力与外在工具利用和谐集成,以逐步完成面向目标的知识综合;智能体的执行路径可形式化为工具激活与相应信息吸收事件的结构化序列 [1095]。新兴发展已确立智能体推理(Agentic Reasoning)架构,通过引入自主部署工具的智能体放大语言模型智能,流畅编排基于网络的信息检索、计算处理以及分层的推理–记忆集成,以应对需要全面研究与级联逻辑分析的复杂挑战 [1162]。
实现框架与范式 单工具框架通过面向特定计算领域的专用实现,确立了工具集成推理的基本原则。程序辅助语言模型(Program-Aided Language Models, PAL)通过生成可执行代码并将数学计算委派给 Python 解释器,开创了问题分解策略 [309]。ToolFormer 表明,语言模型仅需极少示例即可学会外部 API 使用,并接入计算器、搜索引擎及多种工具以增强计算能力 [939]。ToRA 通过将自然语言处理与计算库及符号求解器结合推进了数学推理;ReTool 则应用强化学习优化代码解释器使用,并在自我纠错模式上展现改进 [345, 1320, 973]。Self-Edit 利用所生成代码的执行结果提升竞赛编程任务中的代码质量,采用故障感知的代码编辑器根据测试用例结果纠正错误 [1318]。
多工具协调系统应对在集成推理架构中编排异构工具的复杂性。ReAct 开创了将推理轨迹与任务特定行动交错的做法,使模型能够互补地思考与行动:推理支持计划跟踪,而行动则与外部信息源对接 [1254]。Chameleon 通过合成结合视觉模型、搜索引擎与 Python 函数的程序,并以基于大语言模型的规划器为核心,引入了即插即用的组合推理 [715]。AutoTools 建立了将原始工具文档自动转化为可执行函数的框架,降低了工具集成中的手工工程需求 [423, 960]。智能体链(Chain-of-Agents, CoA)训练模型解码带有抽象占位符的推理链,随后调用领域专用工具填补知识缺口 [600, 1337]。
基于智能体的框架代表了 TIR 系统最复杂的演进形态,超越静态提示方法,构建自主且自适应的 AI 系统。与遵循僵化模式的常规工具使用不同,智能体模型学习将思维链(Chain-of-Thought, CoT)与行动链(Chain-of-Action, CoA)模式耦合进其核心行为,从而在推理与行动之间获得更强的逻辑连贯性与更自然的过渡 [1338]。这些系统建立在基础智能体架构之上,包括将感知直接映射到行动的反应式系统、实现信念–欲望–意图(Belief-Desire-Intention, BDI)模型的慎思式系统,以及在层次结构中组合多个子系统的混合架构 [734]。
表 7:工具增强语言模型架构: 在 8 类工具上对多种方法的比较,包括搜索、计算、知识库、API、多模态、语言工具、交互环境与领域专用应用。
| 方法 | 搜索与检索 | 计算与代码执行 | 知识库与问答 | API 与外部服务 | 多模态工具 | 语言处理 | 交互环境 | 领域专用工具 |
|---|---|---|---|---|---|---|---|---|
| ReAct [1256] | ✓ | ✓ | ✓ | |||||
| Toolformer [939] | ✓ | ✓ | ✓ | ✓ | ✓ | |||
| ToolkenGPT [382] | ✓ | ✓ | ✓ | ✓ | ✓ | |||
| ToolLLM [875] | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| ToRA [345] | ✓ | |||||||
| PAL [307] | ✓ | |||||||
| HuggingGPT [953] | ✓ | ✓ | ||||||
| GPT4Tools [1234] | ✓ | |||||||
| CRITIC [344] | ✓ | ✓ | ✓ | |||||
| Chain of Code [601] | ✓ | |||||||
| TRICE [869] | ✓ | ✓ | ✓ | ✓ | ||||
| TP-LLaMA [152] | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| AlignToolLLaMA [165] | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| ReTool [274] | ✓ | |||||||
| Tool-Star [225] | ✓ | ✓ | ||||||
| ARTIST [973] | ✓ | |||||||
| Ego-R1 [1046] | ✓ | |||||||
| VTool-R1 [1164] | ✓ | |||||||
| KG-Agent [493] | ✓ | ✓ | ||||||
| CACTUS [761] | ✓ | |||||||
| MuMath-Code [1274] | ✓ | |||||||
| ToRL [627] | ✓ | |||||||
| MetaTool [458] | ✓ | ✓ | ✓ | ✓ | ||||
| ToolEyes [1262] | ✓ | ✓ | ||||||
| Graph-CoT [501] | ✓ | ✓ | ||||||
| ToolRL [864] | ✓ | ✓ | ✓ | ✓ | ||||
| LATS [1374] | ✓ | ✓ |
5.3.3. 智能体-环境交互(Agent-Environment Interaction)
强化学习方法已成为优于基于提示的方法与监督微调的工具集成替代方案,使模型能够通过探索与结果驱动的奖励自主发现最优工具使用策略 [227]。ReTool 体现了这一进展:其聚焦于面向数学推理的代码解释器优化,仅经 400 步训练即在 AIME2024 基准测试上达到 67.0% 准确率,大幅优于经充分训练后达 40.0% 准确率的基于文本的强化学习基线 [274]。这表明在决策过程中显式建模工具使用,可同时增强推理能力与训练效率。
搜索增强推理系统代表了将信息检索直接集成到推理过程中的创新:通过专用学习环境实现。Search-R1 框架训练模型在多步推理任务中动态决定何时搜索以及生成何种查询,这与传统的检索增强生成(RAG)系统不同 [984]。该架构采用专用 token 系统来组织推理与搜索过程,模型学习生成与显式搜索行动交错的推理步骤,而这些搜索行动由封装所生成查询的 token 触发 [654]。
多轮与可定制的工具调用框架应对推理过程中协调多种异构工具的复杂性。近期发展包括 VisTA 等框架,其利用强化学习使视觉智能体能够依据经验表现,从多样库中动态探索、选择并组合工具 [460]。ReVeal 通过迭代的生成–验证过程展示了自我演化的代码智能体 [512]。在多模态领域,VideoAgent 等系统将视觉–语言基础模型用作翻译与检索视觉信息的工具,并在视频理解基准测试上取得了令人印象深刻的表现 [1117, 258]。
评估与应用 对工具集成推理系统的全面评估需要专用基准测试,以衡量工具集成能力而非一般模型性能。MCP-RADAR 提供标准化评估框架,采用源自可量化性能数据的严格客观指标,并具备可扩展设计,覆盖软件工程、数学推理与一般问题求解等领域 [314]。该框架通过雷达图可视化性能,突出模型在多维度上的优势与不足,从而能够对工具集成语言模型进行系统比较,而不受实现机制限制。
面向现实世界的评估方法揭示了当前系统与人类水平能力之间的显著性能差距,为实践局限与优化机会提供了关键洞见。通用工具智能体(General Tool Agents, GTA)基准测试针对现有评估的局限:包含真实人工撰写、隐含工具使用需求的查询;部署了涵盖感知、操作、逻辑与创造力类别工具的评估平台;以及包括图像与代码片段在内的真实多模态输入 [1098]。结果表明当前大语言模型面临重大挑战,GPT-4 的完成率不到 50%。
函数调用使复杂的多智能体系统成为可能:多个大语言模型智能体通过协调的工具使用与任务分解进行协作;多智能体系统(MAS)借助并行处理、信息共享与自适应角色分配利用集体智能;而大语言模型集成则通过 DyLAN、MAD 与 MetaGPT 等框架增强了规划、专业化与任务分解能力 [243, 911, 348, 140, 631]。进阶的多智能体函数调用采用复杂编排机制,将复杂任务分解为可管理的子任务;基本方法包括将奖励机拆分为并行执行单元,每个智能体维护各自的奖励机、局部状态空间与命题;而自适应编排则能够依据上下文、响应与状态报告动态选择智能体 [39, 1056, 697, 117]。
5.4. 多智能体系统(Multi-Agent Systems)
多智能体系统(Multi-Agent Systems)代表协作智能的巅峰,使多个自主智能体能够协调与通信,以解决超出单个智能体能力的复杂问题。该实现聚焦于复杂的通信协议(Communication Protocols)、编排(Orchestration)机制以及协调(Coordination)策略,从而实现跨多样智能体架构的无缝协作。
图 7:多智能体系统框架: 面向协作式 AI 智能体系统的通信协议、编排机制与协调策略概览。
5.4.1. 通信协议(Communication Protocols)
智能体通信系统源于 20 世纪 90 年代初的知识共享计划(Knowledge Sharing Effort),通过标准化语言应对互操作性挑战,确立了自主实体协调的基本原则 [373, 93]。KQML 作为开创性的智能体通信语言(Agent Communication Language)出现,引入了将内容层、消息层与通信层相分离的多层架构,并运用言语行为理论 [373, 82, 663, 284]。FIPA ACL 则通过基于模态逻辑的语义框架、可行性前置条件与理性效应,进一步增强了这一基础 [1155, 373, 82]。
互操作性要求具备语义层面的通信能力,使跨平台智能体无需大量预通信设置即可相互理解;通过基于本体的协议形式化与语义网(Semantic Web)技术应对日益增长的异构性,并纳入针对通信脆弱性的安全机制 [486, 66, 449, 487, 792, 1063]。
当代协议生态 当代标准化协议旨在解决阻碍大语言模型智能体协作的碎片化挑战 [1244, 1137, 412]。MCP 充当“AI 的 USB-C”,通过 JSON-RPC 客户端–服务器接口标准化智能体–环境交互,使数百个服务器可覆盖多样领域,同时也引入了安全脆弱性 [934, 250, 622, 270, 15, 261, 930, 1102, 374, 1194, 301, 1016, 719, 273]。
A2A 通过基于能力的智能体卡片(Agent Cards)标准化点对点通信,经基于 JSON 的生命周期模型实现任务委派与安全协作 [622, 250, 934]。ACP 提供通用的 RESTful HTTP 通信,支持多部分消息以及同步/异步交互,并具备发现、委派与编排功能 [281, 250]。
ANP 借助 W3C 去中心化标识符与 JSON-LD 图,将互操作性扩展至开放互联网;新兴协议 AGNTCY 与 Agora 则进一步丰富了标准化生态 [250, 685, 1137]。
渐进分层策略:MCP 提供工具访问,ACP 实现消息交换,A2A 支持对等交互,ANP 扩展网络互操作性 [1015, 934]。
大语言模型增强的通信框架 大语言模型通过复杂的自然语言处理改变了智能体通信,在跨越社会科学、自然科学与工程领域的学术与工业应用中实现了前所未有的上下文敏感性 [492, 690, 504, 1099, 1179, 1136, 904, 1060, 879]。增强系统通过专用知识库、规划、记忆与内省能力展现认知协同,并支持合作式、辩论式与竞争式通信范式 [492, 360]。
通信结构涵盖分层的层次组织、去中心化的点对点网络、中心化协调以及共享消息池架构,并辅以顺序交换、通用语言接口与消息传递策略 [360, 1249, 1219, 171, 400, 491, 543, 665, 799, 949]。
框架实现支撑完整生态:AutoGen 支持动态响应生成,MetaGPT 提供共享消息池,CAMEL 提供集成编排,CrewAI 促进自适应;强化学习集成则增强奖励重设计、行动选择与策略解释 [188, 38, 119, 1004, 228, 871, 935, 958, 1273]。人–智能体通信通过灵活参与与认知多样性引入复杂交互景观,智能体可推断沟通者属性并镜像人类的交际意图 [1409, 34, 675]。
5.4.2. 编排机制(Orchestration Mechanisms)
编排机制构成多智能体系统的关键协调基础设施,管理智能体选择、上下文分发与交互流控制 [902];通过处理用户输入、分发上下文,并基于能力评估与响应评价进行最优智能体选择,实现人类与非人类行动者之间的有效合作 [53];同时管理消息流、确保任务推进并纠正任务偏离 [175]。进阶编排框架纳入意图识别、上下文记忆维护与任务分派组件,以跨领域专用智能体实现智能协调;其中 Swarm Agent 框架利用实时输出引导工具调用,同时应对静态工具注册表与定制通信框架的局限 [814, 267, 250]。
当代编排策略呈现不同的运行范式:先验编排通过对用户输入与智能体能力的执行前分析确定智能体选择;后验编排则将输入同时分发给多个智能体,并利用置信度指标与响应质量评估,如 3S 编排器框架所示 [901];基于函数的编排强调从可用池中选择智能体、管理上下文信息并控制对话流 [54];基于组件的编排采用动态规划过程,编排器依据用户指令按逻辑顺序排列组件,并将大语言模型用作组件编排工具以生成嵌入编排逻辑的工作流 [681]。
新兴编排范式包括提线木偶式编排:由中心化编排器响应不断演变的任务状态,通过基于强化学习的自适应排序与优先级动态指挥智能体;以及序列化编排:通过将协作图展开为由拓扑遍历引导的推理序列,应对协作拓扑复杂性,使编排器在每一步依据全局系统状态与任务规范选择单个智能体 [198]。
上下文管理与环境适应(Context Management and Environmental Adaptation)。 上下文是指导编排系统中智能体行动与交互的基础要素,通过全局状态维护支持运行模式多样性,同时保持应用个体性与任务执行顺序;全局状态使编排系统能够跨分布式节点跟踪任务执行进度,并为智能体提供在更广阔工作流语境中有效完成子任务所需的上下文感知 [26]。基于会话的上下文精炼界定协作范围边界,促进事件驱动编排:智能体可动态进入与退出、创建输出流并对共享会话流作出贡献;可配置会话根据用户输入或自主决策纳入智能体,从而构建能响应任务需求变化的自适应系统 [519]。
设计良好的交互结构与任务编排机制凸显了上下文在可扩展多智能体协作中的关键作用。系统根据上下文需求调整通信模式与智能体角色,通过复杂任务分解与为子任务分配合适智能体,支持面向特定任务需求的动态协作 [1137]。这种上下文适应涵盖组织与运营两个维度,使系统在保持一致性的同时,能够适应环境变化与不断演进的用户需求。
5.4.3. 协调策略(Coordination Strategies)
多智能体编排在跨复杂工作流维护事务完整性方面面临重大挑战;当代框架(包括 LangGraph、AutoGen 与 CAMEL)表现出事务支持不足:LangGraph 提供基本状态管理,但缺乏原子性保证与系统化补偿机制;AutoGen 优先支持灵活的智能体交互,却没有充分的补偿动作管理,可能在部分失败后导致系统状态不一致;验证局限亦随之显现——许多框架仅依赖大语言模型固有的自我验证能力,而未实施独立验证程序,使系统暴露于推理错误、幻觉与智能体间不一致 [128]。
上下文处理失败进一步加剧这些挑战:智能体难以维护涵盖情节性与语义性信息的长期上下文 [214, 1122];中心编排器拓扑引入非确定性、依赖运行时的执行路径,在增强适应性的同时使异常检测更复杂,需要动态图重构而非简单路径匹配 [394];环境错误配置与 LLM 幻觉可能干扰智能体系统,恢复不佳会导致目标偏离,并在具有分布式子任务的多智能体设置中被放大 [214, 1099]。
智能体间依赖不透明带来额外担忧:智能体可能在没有显式约束或验证层的情况下基于不一致假设或冲突数据运行,因而需要结合对编排意图与规划一致性的推理进行异常检测 [394]。应对这些挑战需要全面方案,例如提供事务支持、独立验证程序与稳健上下文保持机制的 SagaLLM 框架 [128],以及将 Python 解释器与 LLM 智能体集成、通过多轮交互实现代码动作执行与动态修订能力的 CodeAct 等方法 [1122]。
应用与性能影响(Applications and Performance Implications)。 智能体与上下文编排在多样化应用领域展现出实用价值:医疗健康应用在专门的基于智能体架构中采用上下文切换机制,执行信息检索、问答与决策支持,利用监督智能体解释输入特征,并根据临床查询类型、用户背景与数据模态需求将子任务分配给专门智能体 [619, 760, 1059];网络管理应用借助上下文感知编排应对复杂性挑战,为接入点(Points of Access)配备专属于特定上下文的智能体,通过包括可用服务实例与网络路径在内的上下文特定动作集,实现高效的网络动态管理 [966]。
业务流程管理与仿真通过 AgentSimulator 等平台成为重要应用领域,支持在编排与自主两种设定下进行过程行为发现与仿真:编排行为遵循全局控制流模式,活动选择依赖先前活动,智能体分配基于能力与可用性;自主行为则通过本地控制流与交接模式运行,承认协作工作中的智能体自主性 [549]。
性能影响表明,设计良好的编排通过发挥不同智能体的独特能力来提升系统有效性;研究表明,人类用户常常难以从可用集合中有效选择智能体,而自动化编排可提升整体性能 [72],这推动了在线学习智能体能力、并在成本、能力需求与运营限制等现实约束下编排多个智能体的框架;自主性水平因实现而异,部分系统在指定阶段表现出显著自主性,在动作管理上展现与任务特异性相应的适应性,并通过上下文资源利用达到 Level 2 自主性 [466]。
6. 评估(Evaluation)
对上下文工程(Context Engineering)系统的评估提出了超越传统语言模型评估范式的前所未有的挑战。这些系统呈现复杂的多组件架构与动态、依赖上下文的行为,需要能够评估组件级诊断、基于任务的性能以及整体系统鲁棒性的综合评估框架 [841, 1141]。
上下文工程组件的异质性——涵盖检索机制、记忆系统、推理链与多智能体协调——要求评估方法既能捕捉单个组件的有效性,也能捕捉涌现的系统级行为 [314, 939]。
6.1. 评估框架与方法(Evaluation Frameworks and Methodologies)
本小节介绍用于评估上下文工程中单个组件与集成系统的综合方法。
6.1.1. 组件级评估(Component-Level Assessment)
内在评估关注孤立条件下单个组件的性能,为系统能力与失效模式提供基础洞见。
对提示工程组件而言,评估涵盖通过语义相似度指标衡量提示有效性、响应质量评估,以及跨多样化输入变体的鲁棒性测试。当前方法揭示了提示设计中的脆弱性与鲁棒性挑战,因而需要更精细的评估框架,以评估上下文校准与自适应提示优化 [1141, 669]。
长上下文处理评估需要专门指标,以衡量信息保持、位置偏差以及跨扩展序列的推理连贯性。“大海捞针(needle in a haystack)”评估范式测试模型从长上下文中检索嵌入特定信息的能力,而多文档推理任务则评估跨多个信息源的综合能力。位置插值技术与超长序列处理方法面临显著的计算挑战,限制了实际评估场景 [737, 299]。
自我上下文化机制通过元学习评估、适应速度测量以及跨多次迭代的一致性分析进行评估。包括 Self-Refine、Reflexion 与 N-CRITICS 在内的自我精炼框架表现出显著性能提升,GPT-4 通过迭代自我精炼过程约提升 20% [741, 964, 795]。多维反馈机制与基于集成的评估方法为自主演化能力提供了全面评估 [583, 710]。
结构化与关系数据集成评估考察知识图谱遍历、表格理解与数据库查询生成的准确性。然而,当前评估框架在评估结构推理能力方面存在显著局限,高质量结构化训练数据的开发仍面临持续挑战。基于 LSTM 的模型在序列信息与结构信息冲突时错误增多,凸显了需要更精细的基准测试来检验结构理解 [769, 674, 167]。
6.1.2. 系统级集成评估(System-Level Integration Assessment)
外在评估衡量下游任务的端到端性能,通过涵盖问答、推理与现实世界应用的综合基准测试,对系统效用提供整体评估。
系统级评估必须捕捉由组件交互产生的涌现行为,包括组合组件超越个体性能的协同效应,以及组件集成反而降低整体有效性的潜在干扰模式 [841, 1141]。
检索增强生成(RAG)评估通过涵盖精确率、召回率、相关性与事实准确性的综合指标,同时衡量检索质量与生成有效性。智能体化 RAG(Agentic RAG)系统引入额外复杂性,需要评估任务分解准确性、多计划选择有效性以及记忆增强规划能力。自我反思机制通过反馈环展示迭代改进,MemoryBank 实现融入 Ebbinghaus 遗忘曲线原则以增强记忆评估 [444, 166, 1372, 1192, 41]。
记忆系统评估因缺乏标准化评估框架以及当代 LLM 固有的无状态特性而面临重大困难。LongMemEval 提供 500 道精心策划的问题,评估信息提取、时间推理、跨会话推理与知识更新等基本能力。商业 AI 助手在长时间交互中表现出约 30% 的准确率下降,凸显了记忆持久性与检索有效性方面的重大不足 [1340, 1180, 463, 847, 390]。NarrativeQA、QMSum、QuALITY 与 MEMENTO 等专用基准测试应对情节记忆评估挑战 [556, 572]。
工具集成推理系统需要覆盖整个交互轨迹的综合评估,包括工具选择准确性、参数提取精度、执行成功率与错误恢复能力。MCP-RADAR 框架为软件工程与数学推理领域提供采用客观指标的标准化评估。现实世界评估揭示了显著的性能差距:在 GTA 基准测试中,GPT-4 完成任务不足 50%,而人类表现达 92% [314, 1098, 126, 939]。包括 BFCL(2,000 个测试用例)、T-Eval(553 个工具使用用例)、API-Bank(73 个 API、314 段对话)与 ToolHop(995 个查询、3,912 个工具)在内的先进基准测试,针对多轮交互与嵌套工具调用场景 [263, 363, 377, 1264, 160, 835]。
多智能体系统评估通过专门指标捕捉通信有效性、协调效率与集体结果质量,涵盖协议遵循、任务分解准确性与涌现协作行为。当代编排框架(包括 LangGraph、AutoGen 与 CAMEL)表现出事务支持不足,验证局限随之显现——系统仅依赖 LLM 自我验证能力,而无独立验证程序。上下文处理失败进一步加剧挑战,智能体难以维护涵盖情节性与语义性信息的长期上下文 [128, 394, 901]。
6.2. 基准测试数据集与评估范式(Benchmark Datasets and Evaluation Paradigms)
本小节综述专为评估上下文工程系统性能而设计的专门基准测试与评估范式。
6.2.1. 基础组件基准测试(Foundational Component Benchmarks)
长上下文处理评估采用专门基准测试套件,以检验跨扩展序列的信息保持、推理与综合。当前基准测试面临显著的计算复杂性挑战,注意力机制中的 $O(n^2)$ 缩放限制对超长序列造成实质性内存约束。位置插值与扩展技术需要精细的评估框架,能够在不同序列长度上同时评估计算效率与推理质量 [737, 299, 1236]。
包括 LongMamba 与专门位置编码方法在内的先进架构为长上下文处理展示了有前景的方向,但评估仍揭示在跨扩展序列保持连贯性方面的持续挑战。滑动注意力机制与内存高效实现的开发,需要能够同时评估计算可处理性与任务性能的综合基准测试 [1267, 351]。
结构化与关系数据集成基准测试涵盖多样化的知识表示格式与推理模式。然而,当前评估框架在评估结构推理能力方面存在局限,高质量结构化训练数据的开发仍面临持续挑战。评估必须处理序列信息与结构信息处理之间的根本张力,尤其是在这两类信息冲突的场景中 [769, 674, 167]。
6.2.2. 系统实现基准测试(System Implementation Benchmarks)
检索增强生成(RAG)评估借助应对多样化检索与生成挑战的综合基准测试套件。模块化 RAG 架构通过检索、增强与生成的专门模块展现出增强的灵活性,从而能够对单个组件及其交互进行细粒度评估。融入 GraphRAG 与 LightRAG 的图增强 RAG 系统在复杂推理场景中表现出改进性能,但评估框架必须应对图遍历与多跳推理评估的额外复杂性 [316, 973, 364]。
智能体化 RAG 系统引入精细的规划与反思机制,需要评估任务分解准确性、多计划选择有效性与迭代精炼能力。实时与流式 RAG 应用在动态信息条件下同时评估延迟与准确性方面,提出了独特的评估挑战 [444, 166, 1192]。
工具集成推理系统评估采用跨越多样化工具使用场景与复杂度层级的综合基准测试。Berkeley Function Calling Leaderboard(BFCL)提供 2,000 个测试用例,通过逐步与端到端评估衡量调用准确率、通过率与胜率,覆盖日益复杂的场景。T-Eval 贡献 553 个工具使用用例,测试多轮交互与嵌套工具调用能力 [263, 1390, 835]。包括 StableToolBench 在内的先进基准测试应对 API 不稳定挑战,NesTools 评估嵌套工具场景,ToolHop 则跨 995 个查询与 3,912 个工具评估多跳工具使用 [363, 377, 1264]。
包括 WebArena 与 Mind2Web 在内的 Web 智能体评估框架,跨 137 个网站的数千项任务提供综合评估,揭示了当前 LLM 在复杂 Web 交互能力上的显著性能差距。VideoWebArena 将评估扩展到多模态智能体,Deep Research Bench 与 DeepShop 则分别针对研究智能体与购物智能体提供专门评估 [1378, 206, 87, 482]。
多智能体系统评估采用专门框架,针对协调、通信与集体智能。然而,当前框架在跨复杂工作流的事务完整性方面面临重大挑战,许多系统缺乏针对部分失败的充分补偿机制。编排评估必须处理上下文管理、协调策略有效性,以及在变化运营条件下保持系统一致性的能力 [128, 901]。
| 发布日期 | 开源 | 方法 / 模型 | 成功率 (%) | 来源 |
|---|---|---|---|---|
| 2025-02 | × | IBM CUGA | 61.7 | [753] |
| 2025-01 | × | OpenAI Operator | 58.1 | [813] |
| 2024-08 | × | Jace.AI | 57.1 | [476] |
| 2024-12 | × | ScribeAgent + GPT-4o | 53.0 | [950] |
| 2025-01 | ✓ | AgentSymbiotic | 52.1 | [1323] |
| 2025-01 | ✓ | Learn-by-Interact | 48.0 | [998] |
| 2024-10 | ✓ | AgentOccam-Judge | 45.7 | [1231] |
| 2024-08 | × | WebPilot | 37.2 | [1331] |
| 2024-10 | ✓ | GUI-API Hybrid Agent | 35.8 | [988] |
| 2024-09 | ✓ | Agent Workflow Memory | 35.5 | [1144] |
| 2024-04 | ✓ | SteP | 33.5 | [979] |
| 2025-06 | ✓ | TTI | 26.1 | [951] |
| 2024-04 | ✓ | BrowserGym + GPT-4 | 23.5 | [238] |
表 8:WebArena [1378] 排行榜:表现最佳模型及其成功率与可用性状态。(原文表见 PDF 第 48 页)
6.3. 评估挑战与新兴范式(Evaluation Challenges and Emerging Paradigms)
本小节识别评估方法中的当前局限,并探讨更有效评估的新兴方法。
6.3.1. 方法局限与偏差(Methodological Limitations and Biases)
传统评估指标从根本上不足以捕捉上下文工程系统所展现的细微、动态行为。BLEU、ROUGE 与困惑度等静态指标最初为更简单的文本生成任务设计,无法评估复杂推理链、多步交互与涌现系统行为。多组件系统固有的复杂性与相互依赖造成归因挑战,使隔离故障与识别根因在计算与方法上变得难以处理。未来指标必须演进,不仅捕捉任务成功,还要捕捉底层推理过程的质量与鲁棒性,尤其是在需要组合泛化与创造性问题解决的场景中 [841, 1141]。
记忆系统评估因缺乏标准化基准测试以及当前 LLM 的无状态性质而面临特殊挑战。自动化记忆测试框架必须解决隔离问题——不同记忆测试阶段无法有效分离,导致评估结果不可靠。商业 AI 助手在持续交互中表现出显著性能退化,准确率下降可达 30%,凸显了当前评估方法的关键缺口,并指向需要能够随时间跟踪记忆保真度的纵向评估框架 [1340, 1180, 463]。
工具集成推理系统评估揭示了当前系统与人类水平能力之间的显著性能差距。GAIA 基准测试表明,人类在通用助手任务上达到 92% 准确率,而 GPT-4 等先进模型仅达 15%,表明当前评估框架与系统能力存在根本局限 [778, 1098, 126]。评估框架必须应对多工具协调、错误恢复以及跨多样化运营上下文的自适应工具选择的复杂性 [314, 939]。
6.3.2. 新兴评估范式(Emerging Evaluation Paradigms)
自我精炼评估范式利用迭代改进机制,跨多个精炼周期评估系统能力。包括 Self-Refine、Reflexion 与 N-CRITICS 在内的框架通过多维反馈与基于集成的评估方法展现出显著性能提升。GPT-4 通过自我精炼过程约提升 20%,凸显了跨多次迭代周期而非单次评估系统的重要性。然而,未来的关键挑战在于评估元学习能力本身——不仅看系统是否改进,还要看它随时间学习精炼策略的效率与鲁棒性 [741, 964, 795, 583]。
多方面反馈评估纳入正确性、相关性、清晰度与鲁棒性等多样化反馈维度,为系统输出提供综合评估。自我奖励机制使自主演化与元学习评估成为可能,允许系统通过迭代精炼发展日益精细的评估标准 [710]。
批评引导评估采用专门的批评模型对系统输出提供详细反馈,从而对推理质量、事实准确性与逻辑一致性进行细粒度评估。这些方法通过提供可适应多样化任务需求与输出格式的上下文感知、内容感知评估,弥补了传统指标的局限 [795, 583]。
编排评估框架通过纳入事务完整性评估、上下文管理评估与协调策略有效性测量,应对多智能体协调的独特挑战。包括 SagaLLM 在内的先进框架提供事务支持与独立验证程序,以弥补仅依赖 LLM 自我验证能力的系统局限 [128, 394]。
6.3.3. 安全性与鲁棒性评估(Safety and Robustness Assessment)
面向安全的评估纳入综合鲁棒性测试、对抗攻击抵抗力与对齐评估,以确保上下文工程系统的负责任开发。必须特别关注可在长时间内自主运行的智能体系统评估,因为这些系统提出了传统评估框架无法充分应对的独特安全挑战 [973, 364]。
鲁棒性评估必须通过综合压力测试协议,评估系统在分布偏移、输入扰动与对抗条件下的性能。多智能体系统在协调失败场景中面临额外挑战,部分系统故障可级联至整个智能体网络。评估框架必须处理优雅降级策略、错误恢复协议,以及在不利条件下保持系统功能的能力。除预定义失效模式外,未来评估还必须应对对“未知的未知”——高度复杂、自主多智能体系统中涌现且不可预测的故障级联——的韧性评估 [128, 394]。
对齐评估通过专门评估框架衡量系统对预期行为的遵循、价值一致性与有益结果优化。上下文工程系统因其动态适应能力与跨多组件的复杂交互模式,提出了独特的对齐挑战。长期评估必须检验系统在经延长运营周期适应与演化时,是否保持有益行为 [901]。
展望未来,上下文工程系统的评估需要从静态基准测试转向动态、整体性评估的范式转变。未来框架必须超越衡量任务成功,进而评估面向新问题的组合泛化,并在交互环境中跟踪长期自主性。与 AI 能力共同演进的“活”基准测试的发展,以及社会技术与经济指标的整合,对于确保这些先进系统在现实世界应用中不仅强大,而且可靠、高效并与人类价值观对齐至关重要 [314, 1378, 1340]。
上下文工程系统的评估格局随新架构、能力与应用的出现而持续快速演进。未来评估范式必须在应对日益增长的系统复杂性的同时,为系统改进与部署决策提供可靠、全面且可操作的洞见。从组件级评估到系统范围鲁棒性测试等多种评估方法的整合,是确保上下文工程系统在现实世界应用中可靠部署的关键研究优先事项 [841, 1141]。
7. 未来方向与开放挑战(Future Directions and Open Challenges)
上下文工程正处于关键拐点:基础进展与新兴应用需求交汇,在创造前所未有创新机遇的同时,也揭示了需要跨多个维度持续研究努力的根本挑战 [841, 1141]。
随着该领域从孤立组件开发转向集成系统架构,研究挑战的复杂性呈指数增长,要求能够连接理论计算机科学、实用系统工程与领域专业知识的跨学科方法 [314, 939]。
本节系统考察将界定未来十年上下文工程演进的关键研究方向与开放挑战(Open Challenges)。
7.1. 基础研究挑战(Foundational Research Challenges)
本小节考察为使上下文工程系统超越当前局限而必须应对的核心理论与计算挑战。
7.1.1. 理论基础与统一框架(Theoretical Foundations and Unified Frameworks)
上下文工程目前缺乏连接不同技术并提供原则性设计指南的统一理论基础(Theoretical Foundations),这是限制系统化进展与最优系统开发的关键研究缺口。
缺乏刻画不同架构配置下上下文工程能力、局限与最优设计原则的数学框架,阻碍了基础理解与实际优化 [1141, 669, 841, 314]。
对上下文工程系统的信息论分析,需要全面研究最优上下文分配策略、信息冗余量化,以及上下文窗口内的根本压缩极限。当前方法缺乏确定最优上下文构成的原则性手段,导致资源利用欠优与性能下降。研究必须建立上下文效率的数学界限,开发上下文选择的优化算法,并创建用于预测不同上下文配置下系统行为的理论框架 [737, 299]。
对上下文工程系统的组合性理解,需要描述单个组件在集成架构中如何交互、干扰与协同的形式模型。由组件交互产生的复杂行为涌现,要求通过实证研究与理论建模方法进行系统调查。多智能体编排在开发用于预测协调有效性与涌现协作行为的数学框架方面,提出了特别挑战 [128, 901]。
7.1.2. 缩放定律与计算效率(Scaling Laws and Computational Efficiency)
LLM 卓越理解能力与其显著生成局限之间的根本不对称,是上下文工程研究中最关键的挑战之一。
这种理解–生成差距体现在多个维度,包括长篇输出连贯性、事实一致性维护与规划精细度,需要研究这些局限究竟源于架构约束、训练方法,还是根本的计算边界 [841, 1141]。
长篇生成能力需要系统研究能够在数千个 token 上保持连贯性、同时维护事实准确性与逻辑一致性的规划机制。当前系统在扩展生成任务中表现出显著性能退化,凸显了需要超越传统 Transformer 范式的架构创新。包括 Mamba 在内的状态空间模型通过线性缩放特性展现出更高效长序列处理的潜力,但当前实现仍需大量发展,才能在多样化任务上匹配 Transformer 性能 [737, 1267, 351, 220]。
上下文扩展效率面临根本性的计算挑战:当前注意力机制随序列长度呈二次方($O(n^{2})$)扩展,对超长序列造成难以承受的内存与计算开销。滑动注意力机制与内存高效实现是有前景的方向,但仍需大量研究以同时解决计算可行性与推理质量保持问题 [299, 1236, 351]。位置插值与扩展技术也需进一步发展,以便在处理超出当前架构限制的序列时仍能保持位置理解与连贯性。
7.1.3. 多模态集成(Multi-Modal Integration)与表示
在上下文工程系统中融合多样模态,在表示学习、跨模态推理与统一架构设计方面提出了根本性挑战。当前方法通常采用模态专用编码器,跨模态交互有限,难以捕捉复杂多模态理解所特有的丰富相互依赖关系。VideoWebArena 展示了多模态智能体评估的复杂性,揭示了当前系统在同时处理视频、音频与文本时存在显著性能差距 [482]。
除这些感知模态之外,上下文工程还必须处理更抽象的信息形式,例如图(graph)——其结构语义无法被语言模型直接解释。捕捉图结构中编码的高层含义带来独特挑战,包括将图表示与语言模型嵌入对齐,以及高效表达图拓扑。近期工作如 GraphGPT [1032] 与 GraphRAG [248] 试图通过跨模态对齐策略弥合这一差距,另一些研究则探索将图转化为自然语言描述以促进模型理解 [266, 323]。Bi 等人 [75] 进一步提出分而治之的方法来编码文本属性异构网络,以应对上下文长度限制并实现有效的链接预测。因此,图推理成为上下文工程中的核心难点,要求模型在原始模态之外驾驭复杂关系结构。
跨多模态上下文的时序推理需要能够在扩展序列中追踪对象持续性、因果关系与时序动态的复杂架构。包括 WebArena 在内的 Web 智能体框架展示了在涉及多样模态与动态内容的复杂多步交互中保持连贯理解的挑战。当前系统在协调多模态信息处理与动作规划、执行方面表现出显著局限 [1378, 206]。
跨模态对齐与一致性是持续存在的挑战,需确保从不同模态提取的信息在事实上保持一致、在语义上保持连贯。Deep Research Bench 评估表明,当前多模态智能体在需要综合文本、视觉与结构化数据源的复杂研究任务上仍有困难,凸显了对更精细对齐机制的需求 [87]。
7.2. 技术创新机遇
本小节探讨有望增强上下文工程能力的新兴技术路径与架构创新。
7.2.1. 下一代架构(Next-Generation Architectures)
超越传统 Transformer 范式的架构创新,为解决上下文工程系统当前局限提供了有前景的方向。包括 LongMamba 在内的状态空间模型通过线性扩展特性与改进的内存利用,展现了更高效长序列处理的潜力,但当前实现仍需大量发展才能在多样任务上匹敌 Transformer 性能 [1267, 737]。专用位置编码方法与参数高效架构为在保持计算可行性的同时扩展到超长序列提供了机遇 [351, 299]。
记忆增强架构需超越当前外部记忆机制,以实现更精细的长期记忆组织、层次化记忆结构与自适应记忆管理策略。融入艾宾浩斯遗忘曲线(Ebbinghaus Forgetting Curve)原理的 MemoryBank 实现展示了记忆持久性方面的有前景方法,但仍需大量研究以应对当前大语言模型(LLM)根本性的无状态特性 [1372, 1340, 1180, 819, 1211]。开发能够在扩展交互中保持连贯长期上下文的情景记忆系统,是一项关键架构挑战 [463, 847, 397]。
模块化与组合式架构通过专用组件集成实现灵活的系统构建,同时保持整体系统连贯性。模块化检索增强生成(RAG)架构通过检索、增强与生成的专用模块展现更强灵活性,从而可对各个组件进行细粒度优化。包括 GraphRAG 与 LightRAG 在内的图增强方法展示了将结构化知识表示与神经处理相结合的潜力 [316, 973, 364]。
7.2.2. 高级推理与规划(Advanced Reasoning and Planning)
上下文工程系统需要增强的推理能力,涵盖因果推理、反事实思维、时序推理以及跨扩展上下文的类比推理。当前系统在需要整合多证据源、考虑替代情景并在复杂推理链中保持逻辑一致性的精细推理模式上能力有限 [1141, 841]。
多步规划与执行能力是关键推进方向,使系统能够分解复杂任务、制定执行策略、监控进度,并根据中间结果调整计划。智能体式 RAG(Agentic RAG)系统展示了复杂的规划与反思机制,需要整合任务分解、多计划选择与迭代精炼能力。然而,当前实现在扩展规划时域上保持连贯性以及适应动态信息条件方面仍面临重大挑战 [444, 166, 1192]。
工具集成推理代表一种范式性进展,要求在推理过程中与外部资源进行动态交互。GAIA 基准测试显示了巨大的性能差距:人类达到 92% 准确率,而先进模型仅约 15%,凸显了当前推理与规划能力的根本局限 [778, 1098, 126]。先进的工具集成必须解决自主工具选择、参数提取、多工具协调以及在多样操作情境下的错误恢复等问题 [314, 939]。
7.2.3. 复杂上下文组织与图问题求解
图推理是上下文工程中的根本挑战,要求系统在互联元素间驾驭复杂结构关系的同时保持语义理解。图—语言模型集成的近期进展展示了多种范式:纳入图专用组件的专用架构方法,以及将图结构转化为自然语言表示的基于文本的编码策略 [1093, 1031]。
架构集成方法包括 GraphGPT,它采用双阶段指令微调,通过自监督图匹配将图结构信息与语言 token 对齐 [1031, 747]。该框架引入经 Graph Instruction Tuning 精炼的专用 GraphTokens,并利用轻量级图—文本对齐投影器在文本处理与结构处理模态之间转换 [1279, 278]。在指令微调范式基础上,GraphWiz 进一步引入 DPO 以增强推理可靠性,在多样图任务上达到 65% 的平均准确率,显著优于 GPT-4 的 43.8% [145]。思维链蒸馏机制可增强逐步推理性能 [1147, 1401]。强化学习(RL)是另一有前景的方向,如 G1 所示:该工作在 Erdős 数据集上对 LLM 进行图论合成任务训练(涵盖 50 类多样任务),以 3B 参数模型取得强零样本泛化,并优于显著更大规模的模型 [361]。
基于文本的编码方法通过少样本提示与思维链推理,在无需修改架构的情况下将图结构转化为自然语言描述 [266, 196]。这些方法引入多样图描述模板,通过多种语义解释对结构元素进行情境化 [944, 722]。近期工作研究了图描述顺序对 LLM 性能的影响,发现序列呈现方式显著影响模型理解与推理准确率 [323]。基准评估亦在扩展:GraphArena 同时提供多项式时间任务与 NP 完全挑战,并采用严格评估框架,将输出分类为正确、次优、幻觉或缺失 [1033]。结合 NLGraph 与 GraphDO 等现有基准,这些评估揭示了简单连通性问题与最大流计算等复杂任务之间的显著性能差距 [1093, 903, 323]。
当前实现在扩展到大规模结构、跨多跳关系保持一致性以及对新拓扑泛化等方面仍面临挑战:基于文本的方法以降低结构精度为代价提供可解释性,而专用架构通过增加复杂度获得更强性能 [897, 1109]。包括 InstructGraph 与 GraphAdapter 在内的新兴混合方法试图通过结构化格式言语化器与基于 GNN 的适配器弥合这些范式,但在处理动态结构与关系的时序演化方面局限依然存在 [265]。展望未来,以联想网络而非碎片化搜索来组织信息、从中心节点向外扩散以发现实体间潜在联系的广泛连接范式,或可代表面向复杂上下文组织的下一代 RAG 系统 [131]。
7.2.4. 智能上下文组装与优化
能够从可用组件中智能组装上下文的自动化上下文工程系统,是关键研究前沿,需要发展上下文优化算法、自适应选择策略与可学习的组装函数。当前方法严重依赖启发式手段与领域专用工程,限制了跨多样应用的可扩展性与最优性 [1141, 669]。
自精炼机制通过迭代改进过程展现出智能上下文优化的巨大潜力。Self-Refine、Reflexion 与 N-CRITICS 框架取得了显著性能提升,其中 GPT-4 经迭代精炼约提升 20%。然而,这些方法仍需在跨多样上下文的自主演化与元学习优化策略方面进一步推进 [741, 964, 795, 583]。
纳入正确性、相关性、清晰度与鲁棒性等多样反馈维度的多维反馈机制,为上下文优化提供了有前景的方向。自我奖励机制使自主演化成为可能,但研究仍须回答关于最优适应速率、稳定性—可塑性权衡,以及在变化运行条件下保留有益适应等根本问题 [710]。
7.3. 应用驱动的研究方向
本小节讨论由真实部署需求与领域专用应用所引发的研究挑战。
7.3.1. 领域特化与适应
上下文工程系统需要面向医疗健康、法律分析、科学研究、教育与工程应用等多样领域的精细特化机制;各领域在知识整合、推理模式、安全考量与法规遵从方面具有独特要求。领域专用优化需要研究迁移学习策略、领域适应技术以及在增强领域性能的同时保持通用能力的专用训练范式 [1141, 669]。
科学研究应用要求对复杂技术内容、数学表达式、实验数据与理论框架进行精细推理,同时维持严格的准确性标准。Deep Research Bench 评估揭示了当前系统在开展需要跨多信息源综合并对技术内容进行推理的复杂研究任务方面存在显著挑战。研究须解决符号推理与神经方法的融合,以及领域专用知识库的纳入 [87]。
医疗健康应用要求全面的安全评估框架、法规遵从机制、隐私保护协议,以及与现有临床工作流的集成,同时满足可解释性与可审计性要求。医学上下文工程必须应对敏感信息处理、确保临床准确性、支持诊断推理,以及在复杂医疗生态中维护患者隐私等挑战。当前评估框架揭示了医学推理能力与安全评估方法学方面的显著缺口 [390]。
7.3.2. 大规模多智能体协调
将多智能体上下文工程系统扩展到数百乃至数千参与智能体,需要发展分布式协调机制、高效通信协议与层次化管理结构,以在保持系统连贯性的同时赋予局部自主性。研究必须应对大规模智能体群体中的分布式共识、容错与涌现行为预测等根本挑战 [243, 140]。
通信协议标准化是关键研究前沿;新兴协议包括 MCP(“AI 的 USB-C”)、A2A(Agent-to-Agent)、ACP(Agent Communication Protocol)与 ANP(Agent Network Protocol),表明需要统一框架以实现跨多样智能体生态的互操作性。然而,当前实现面临安全漏洞与可扩展性局限,大规模部署前必须加以解决 [37, 1015, 468, 1, 250, 934, 622]。
编排挑战——包括事务完整性、上下文管理与协调策略有效性——是大规模多智能体部署的重大障碍。包括 LangGraph、AutoGen 与 CAMEL 在内的当代框架表现出事务支持不足与验证局限,致使系统只能依赖 LLM 的自我验证能力。先进协调框架必须应对部分失败的补偿机制,并在变化运行条件下保持系统连贯性 [128, 394, 901]。
7.3.3. 人机协作(Human-AI Collaboration)与集成
精细的人机协作框架需要深入理解人类认知过程、沟通偏好、信任动态与协作模式,以构建发挥互补优势的有效混合团队。研究必须探究最优任务分配策略、通信协议,以及人与 AI 系统之间共享心智模型的构建 [1141, 841]。
Web 智能体评估框架揭示了人机协作中的显著挑战,尤其是在需要持续交互与协调的复杂任务情景中。WebArena 与 Mind2Web 表明,当前系统在跨多样网站的多步交互上仍有困难,凸显了协作任务执行方面的根本缺口。先进接口需要研究情境感知适应与个性化机制,以提升人机团队绩效 [1378, 206]。
信任校准与透明机制是确保人类对 AI 系统形成恰当依赖、同时保持人类能动性与决策权威的关键研究领域。评估框架必须涵盖解释生成、不确定性传达与置信度校准,以支持协作情景中的知情人类决策。GAIA 等基准所揭示的巨大性能差距,凸显了开发能够有效传达自身局限与能力之系统的重要性 [778, 1098]。
7.4. 部署与社会影响考量
本小节审视在规模化部署上下文工程系统时,为确保负责任且有益的结果所需的关键考量。
7.4.1. 可扩展性与生产部署
上下文工程系统的生产部署需要在多个维度应对可扩展性挑战,包括计算资源管理、延迟优化、吞吐量最大化与成本效率,同时在多样运行条件下保持一致性能。当前注意力机制的 $O(n^{2})$ 扩展局限对在生产环境中部署超长上下文系统构成重大障碍,因而需要推进内存高效架构与滑动注意力机制 [299, 1236]。
随着上下文工程系统在跨领域决策过程中承担日益重要的角色,可靠性与容错机制变得至关重要。多智能体编排框架在跨复杂工作流保持事务完整性方面面临特殊挑战,当前系统缺乏针对部分失败的充分补偿机制。研究必须应对优雅降级策略、错误恢复协议以及在不利条件下维持系统功能的冗余机制 [128, 394]。
可维护性与演化挑战需要研究系统版本控制、向后兼容、持续集成协议以及支持在不中断已部署服务的前提下持续改进的自动化测试框架。由于当前 LLM 的无状态特性,以及缺乏针对长期记忆持久性与检索效率的标准化基准,记忆系统实现面临额外挑战 [1340, 1180]。
7.4.2. 安全性、安保与鲁棒性(Safety, Security, and Robustness)
全面的安全评估需要发展能够识别上下文工程系统全能力谱系中潜在失效模式、安全违规与非预期行为的评估框架。智能体系统因其自主运行能力以及在扩展运行周期中的复杂交互模式而带来特殊安全挑战 [973, 364]。
安保考量涵盖对对抗攻击、数据投毒、提示注入、模型窃取与隐私侵犯的防护,同时保持系统功能与可用性。包括 MCP、A2A 与 ACP 在内的多智能体通信协议引入了必须在保持互操作性与功能的同时加以解决的安全漏洞。研究必须发展防御机制与检测系统,以应对分布式智能体网络中不断演变的威胁态势 [250, 934]。
对齐(alignment)与价值规约挑战需要研究如何确保上下文工程系统按预期目标行事,同时避免规约博弈、奖励黑客与目标错位。由于其动态适应能力以及跨多组件的复杂交互模式,上下文工程系统呈现独特的对齐挑战。评估框架所揭示的巨大性能差距,凸显了发展能够在系统演化与适应过程中保持有益行为的鲁棒对齐机制的重要性 [778, 128]。
7.4.3. 伦理考量(Ethical Considerations)与负责任开发
偏见缓解与公平性评估需要全面评估框架,以识别并应对跨不同人口群体、应用领域与用例的系统性偏见,同时保持系统性能与效用。研究必须探究训练数据、模型架构与部署情境中的偏见来源,并发展针对根源而非表象的缓解策略 [1141, 841]。
隐私保护机制必须应对敏感信息处理、防止数据泄露以及在赋能有益系统能力的同时维护用户隐私等挑战。记忆系统因其持久信息存储与检索能力而面临特殊隐私挑战,需要安全记忆管理与选择性遗忘机制的先进框架 [1340, 463]。
透明性与问责框架需要发展解释系统、审计机制与治理结构,以便对上下文工程系统进行负责任的监督,同时支持创新与有益应用。GAIA 等评估框架所揭示的巨大性能差距(人类 92% 对 AI 15%)凸显了透明传达能力与为已部署系统设定恰当期望的重要性 [778, 1098]。
上下文工程(Context Engineering)的未来将取决于我们能否通过持续、协作的研究努力应对这些相互关联的挑战,并将技术创新与社会考量相衔接。成功需要持续投入基础研究、跨学科协作以及负责任的开发实践,以确保上下文工程系统在日益融入关键社会功能时保持有益、可靠并与人类价值观对齐 [841, 1141, 314]。
8. 结论(Conclusion)
本综述首次对上下文工程作为一门形式化学科进行了全面审视:该学科系统性地设计、优化并管理面向 LLM 的信息载荷。通过对逾 1400 篇研究论文的分析,我们将上下文工程确立为开发复杂 AI 系统的关键基础——此类系统能够有效整合外部知识、维持持久记忆,并与复杂环境动态交互。
我们的主要贡献在于提出统一的分类框架,将上下文工程技术组织为基础组件(Foundational Components:上下文检索与生成、上下文处理、上下文管理)与系统实现(System Implementations:检索增强生成、记忆系统、工具集成推理、多智能体系统)。该框架展示了核心技术能力如何整合为应对真实世界需求的复杂架构。
通过这一系统性审视,我们识别出若干关键洞见。第一,我们观察到 LLM 在理解复杂上下文方面的卓越能力与其生成同等精细输出方面的局限之间存在根本不对称。这一理解—生成鸿沟是该领域面临的最关键挑战之一。第二,我们的分析揭示了日益精细的集成模式:多种技术协同组合,创造出超越各组件之和的能力。第三,我们观察到向模块化与组合性发展的清晰趋势,使架构能够灵活适应多样应用,同时保持系统连贯性。我们所识别的评估挑战凸显了对能够刻画上下文工程系统所表现的复杂、动态行为的全面评估框架的需求。传统评估方法对整合多组件、展现自适应行为并在扩展时域上运行的系统已显不足。对未来研究方向的审视揭示了显著机遇,包括开发高效处理长上下文的下一代架构、创建智能上下文组装系统,以及推进多智能体协调机制。关键挑战横跨理论基础、技术实现与实际部署,包括缺乏统一理论框架、扩展局限以及安全考量。
展望未来,随着领域迈向复杂的多组件系统,上下文工程有望在 AI 发展中扮演日益核心的角色。上下文工程的跨学科本质要求跨越计算机科学、认知科学、语言学与领域专业知识的协作研究路径。
随着 LLM 持续演进,上下文工程的根本洞见——即 AI 系统性能根本上由上下文信息所决定——将继续居于人工智能发展的中心。本综述既提供当前状态的全面快照,也为未来研究提供路线图,将上下文工程确立为一门具有自身原则、方法与挑战的独立学科,以促进创新并支持情境感知 AI 系统的负责任发展。
致谢(Acknowledgments)
本综述代表一项持续努力,旨在全面描绘面向大语言模型的上下文工程这一快速演进的图景。鉴于该领域的动态特性以及新进展不断涌现,我们承认:尽管已尽最大努力,仍可能无意中遗漏或未充分呈现部分近期工作或新兴趋势。我们欢迎研究社区反馈,以改进本工作的未来迭代。我们感谢更广泛研究社区的奠基性贡献,使本综述成为可能。若无研究社区与开源社区的宝贵支持,本工作将无法完成——双方在开发框架、工具与资源方面的协作努力显著推进了上下文工程领域。我们特别感谢 Long Chain-of-Thought [149] 与 AI4Research [151] 项目团队出色的模板设计与可视化,它们显著提升了本综述的呈现质量。我们对他们为研究社区所作的周到贡献深表感谢。
参考文献
(参考文献列表共约 108 页、逾 1400 篇文献,请参见原文 PDF 第 59–166 页,此处不再翻译。)