Agent Harness 日报:框架与运行时等25项框架动态,编排范式与成熟度演进
核心判断: Agent Harness 领域今日 25 项动态。框架与运行时方向 18 项,评测与可观测方向 7 项最为活跃。基于Agent Harness 成熟度模型 (AHMM) 分析,当前生态主要处于 L2 组件化阶段,向 L3 可观测跃迁是最大瓶颈。编排模式上,DAG 和事件驱动范式正在超越线性链成为主流。
2026-10-05,基于 arXiv cs.AI、GitHub Trending 和 Hacker News 的监测数据。
Agent Harness 成熟度模型 (AHMM)
| 级别 | 名称 | 特征 | 代表项目 | 2026现状 |
|---|---|---|---|---|
| L1 | 能力验证 | 单场景 Demo 可跑 | BabyAGI, Crawl4AI | 已跨越 |
| L2 | 组件化 | 模块可组合替换 | LangChain, CrewAI, OpenAI Agents SDK | 当前主流 |
| L3 | 可观测 | 链路追踪+评估闭环 | LangSmith, OpenClaw, Weave | 部分达到 |
| L4 | 弹性伸缩 | 动态调度+容错自愈 | Dify(企业版), Coze, Amazon Bedrock Agent | 少数达到 |
| L5 | 自治运维 | Agent 自监控自修复 | Google A2A, AG2 | 探索中 |
定义: 衡量 Agent 开发框架/运行时从原型到生产就绪的五级成熟度模型。L1 能力验证 → L2 组件化 → L3 可观测 → L4 弹性伸缩 → L5 自治运维。大多数框架当前处于 L2-L3 之间。
今日动态的成熟度分布
| 成熟度 | 动态数 | 说明 |
|---|---|---|
| L1 能力验证 | 2 | 原型验证阶段 |
| L2 组件化 | 6 | 模块可组合替换 |
| L3 可观测 | 1 | 链路追踪+评估闭环 |
| L4 弹性伸缩 | 1 | 动态调度+容错自愈 |
| L5 自治运维 | 0 | 自监控自修复(暂无) |
Agent 编排四范式
| 范式 | 特点 | 适用场景 | 代表实现 | 局限 |
|---|---|---|---|---|
| 线性链 (Chain) | 固定顺序,简单可靠 | 单任务Pipeline | LangChain Chain, OpenAI Agents SDK | 不支持分支 |
| DAG (有向图) | 并行+依赖,高效 | 多步骤编排 | LangGraph, ControlFlow | 需预定义拓扑 |
| 事件驱动 (EDA) | 解耦+实时,灵活 | 响应式Agent | Inngest, Trigger.dev | 调试复杂 |
| 自治协作 (Autonomous) | Agent自决策,弹性 | 复杂探索任务 | AG2, CrewAI, Google A2A | 可控性弱 |
定义: Agent 编排架构的四种基本范式:线性链(Chain)、有向无环图(DAG)、事件驱动(Event-Driven)、自治协作(Autonomous)。实际系统通常是多种范式的混合。
今日动态概览
| 分类 | 动态数 | 热度 |
|---|---|---|
| 框架与运行时 | 18 | 🔥 热点 |
| 评测与可观测 | 7 | 🔥 热点 |
| 编排与工作流 | 6 | 🔥 热点 |
| 多智能体协作 | 6 | 🔥 热点 |
| 记忆与检索 | 5 | 📈 活跃 |
| 工具与协议 | 2 | ➡️ 关注 |
| 部署与运维 | 2 | ➡️ 关注 |
框架与运行时(18 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| langchain-ai/langchain | GitHub | The agent engineering platform. | 关注架构演进方向 |
| TauricResearch/TradingAgents | GitHub | TradingAgents: Multi-Agents LLM Financial Trading Framework | 多Agent协作框架演进 |
| FoundationAgents/MetaGPT | GitHub | 🌟 The Multi-Agent Framework: First AI Software Company, Tow | 多Agent协作框架演进 |
| microsoft/autogen | GitHub | A programming framework for agentic AI | 多Agent协作框架演进 |
| crewAIInc/crewAI | GitHub | Framework for orchestrating role-playing, autonomous AI agen | 多Agent协作框架演进 |
| HKUDS/nanobot | GitHub | Ultra-lightweight, open-source, self-hosted personal AI agen | MCP 生态值得关注 |
| langchain-ai/langgraph | GitHub | Build resilient agents. | DAG编排成主流 |
| AstrBotDevs/AstrBot | GitHub | AI Agent Assistant & development framework that integrates l | 关注架构演进方向 |
评测与可观测(7 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| 大型语言模型了解哥伦比亚法律吗?哥伦比亚法律系统的可靠性基准 / Do Large Language Kimi解读 | arXiv | 本文针对大型语言模型在哥伦比亚法律系统中的可靠性问题,提出了一个专家基准测试。研究发现,模型在判断法律正确性时存在过度自 | 评估闭环是关键 |
| HazardWeaver:面向危险分析智能体的科学路径选择 / HazardWeaver: Scie Kimi解读 | arXiv | 本文提出了HazardWeaver,一个为危险分析智能体设计的科学路径选择框架。该系统能够从可用工作流中选择并生成可执行 | DAG编排成主流 |
| 学习评估毫米波心率感知的心跳可观测性 / Learning to Assess Heartbeat Kimi解读 | arXiv | 本文提出了一种评估毫米波心率感知中心跳可观测性的学习方法。通过引入可观测性评分,该方法能够有效识别散射体对心率监测的影响 | 向L3可观测演进 |
| 从基准到生产:面向复杂金融数据的Text-to-SQL系统 / From Benchmarks to Kimi解读 | arXiv | 本文提出了Flint,一个面向复杂金融数据的Text-to-SQL生产系统。该系统解决了金融数据中不透明和可读模式的链接 | 向L4生产就绪 |
| 类型化决策模型中的候选覆盖度基准测试 / Benchmarking Candidate Covera Kimi解读 | arXiv | 本文针对类型化决策模型中的候选覆盖度问题进行了基准测试。研究基于TREC和DBpedia数据集,分析了候选答案的覆盖度与 | 评估闭环是关键 |
| ReFract:基于文本世界模型的语言智能体视角感知基准测试 / ReFract: Benchmar Kimi解读 | arXiv | 本文提出了ReFract,一个基于文本世界模型的语言智能体视角感知基准。该基准评估智能体在不同角色和装备条件下的视角感知 | 评估闭环是关键 |
| Show HN: VoltAgent – Open-Source Observability-Fir | HN | Show HN: VoltAgent – Open-Source Observability-First TS AI A | 向L3可观测演进 |
编排与工作流(6 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| HazardWeaver:面向危险分析智能体的科学路径选择 / HazardWeaver: Scie Kimi解读 | arXiv | 本文提出了HazardWeaver,一个为危险分析智能体设计的科学路径选择框架。该系统能够从可用工作流中选择并生成可执行 | DAG编排成主流 |
| 知识还是计算器?可验证金融智能体工作流中的技能溢价分解 / Knowledge or Calcula Kimi解读 | arXiv | 本文分解了可验证金融智能体工作流中的技能溢价,探讨了程序性知识与计算工具的协同作用。研究表明,仅依赖工具无法完全替代知识 | DAG编排成主流 |
| HKUDS/nanobot | GitHub | Ultra-lightweight, open-source, self-hosted personal AI agen | MCP 生态值得关注 |
| langchain-ai/langgraph | GitHub | Build resilient agents. | DAG编排成主流 |
| labring/FastGPT | GitHub | FastGPT is a knowledge-based platform built on the LLMs, off | DAG编排成主流 |
| deepset-ai/haystack | GitHub | Open-source AI orchestration framework for building context- | DAG编排成主流 |
多智能体协作(6 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| TauricResearch/TradingAgents | GitHub | TradingAgents: Multi-Agents LLM Financial Trading Framework | 多Agent协作框架演进 |
| FoundationAgents/MetaGPT | GitHub | 🌟 The Multi-Agent Framework: First AI Software Company, Tow | 多Agent协作框架演进 |
| microsoft/autogen | GitHub | A programming framework for agentic AI | 多Agent协作框架演进 |
| crewAIInc/crewAI | GitHub | Framework for orchestrating role-playing, autonomous AI agen | 多Agent协作框架演进 |
| HKUDS/nanobot | GitHub | Ultra-lightweight, open-source, self-hosted personal AI agen | MCP 生态值得关注 |
| Fabrice AI: Multi-Agent Framework for TypeScript | HN | Fabrice AI: Multi-Agent Framework for TypeScript | 多Agent协作框架演进 |
记忆与检索(5 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| HazardWeaver:面向危险分析智能体的科学路径选择 / HazardWeaver: Scie Kimi解读 | arXiv | 本文提出了HazardWeaver,一个为危险分析智能体设计的科学路径选择框架。该系统能够从可用工作流中选择并生成可执行 | DAG编排成主流 |
| 类型化决策模型中的候选覆盖度基准测试 / Benchmarking Candidate Covera Kimi解读 | arXiv | 本文针对类型化决策模型中的候选覆盖度问题进行了基准测试。研究基于TREC和DBpedia数据集,分析了候选答案的覆盖度与 | 评估闭环是关键 |
| HKUDS/nanobot | GitHub | Ultra-lightweight, open-source, self-hosted personal AI agen | MCP 生态值得关注 |
| labring/FastGPT | GitHub | FastGPT is a knowledge-based platform built on the LLMs, off | DAG编排成主流 |
| deepset-ai/haystack | GitHub | Open-source AI orchestration framework for building context- | DAG编排成主流 |
工具与协议(2 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| 知识还是计算器?可验证金融智能体工作流中的技能溢价分解 / Knowledge or Calcula Kimi解读 | arXiv | 本文分解了可验证金融智能体工作流中的技能溢价,探讨了程序性知识与计算工具的协同作用。研究表明,仅依赖工具无法完全替代知识 | DAG编排成主流 |
| HKUDS/nanobot | GitHub | Ultra-lightweight, open-source, self-hosted personal AI agen | MCP 生态值得关注 |
部署与运维(2 项)
| 项目/论文 | 来源 | 核心描述 | 工程启示 |
|---|---|---|---|
| 从基准到生产:面向复杂金融数据的Text-to-SQL系统 / From Benchmarks to Kimi解读 | arXiv | 本文提出了Flint,一个面向复杂金融数据的Text-to-SQL生产系统。该系统解决了金融数据中不透明和可读模式的链接 | 向L4生产就绪 |
| deepset-ai/haystack | GitHub | Open-source AI orchestration framework for building context- | DAG编排成主流 |
深度分析
Agent Harness 领域动态深度报告:从工作流编排到生产级评测的演进
报告概览:今日 Agent 领域动态呈现明显的“向生产环境收敛”趋势。框架层面,LangChain 确立“工程平台”定位;学术与工程界则将重心从“单点能力炫技”转向“复杂工作流编排与可验证评测”。在编排范式上,基于确定性 DAG 的图结构工作流在金融、法律等高风险场景中胜出,成为当前从 L2(基础推理)向 L3(复杂工作流)跨越的核心抓手。
1. 框架演进判断
判断一:Agent 框架正从“通用推理引擎”向“领域工作流编排平台”演进。
- 论据:今日动态中,多篇论文(如 From Benchmarks to Production: A Text-to-SQL System、Knowledge or Calculator? Decomposing the Skill Premium)均聚焦于如何将 LLM 嵌入到具有严格 Schema 约束和工具依赖的复杂可执行工作流中。LangChain 明确将自身定位为“The agent engineering platform”,标志着框架竞争已度过“通用智能体”概念期,进入解决具体工程落地问题的深水区。
- 对开发者的影响:开发者不再需要追求无限泛化的自治 Agent,而应利用框架提供的 DAG/图编排能力,将领域知识(如 SQL Schema、法律条文)与 LLM 的过程性推理强绑定,构建高可靠性的垂直工作流。
判断二:评测与可观测性成为制约 Agent 从 Demo 走向生产的唯一瓶颈。
- 论据:今日有 7 篇动态涉及评测与可观测,涵盖法律基准(Colombian Legal System)、视角认知(ReFract)以及传感器可观测性(Heartbeat Observability)。研究表明,LLM 在专业领域存在“过度自信与错误归因”问题,传统的端到端准确率已无法评估 Agent 工作流的可靠性,必须引入过程级、多维度的基准测试。
- 对开发者的影响:开发团队必须将评测基建前置。在架构选型时,框架是否具备细粒度(Token/Tool 级别)的 Trace 和状态快照能力,将比支持多少种 Prompt 模板更为关键。
判断三:新兴学术框架侧重“安全与控制”,成熟工程框架侧重“集成与抽象”。
- 论据:以 HazardWeaver 为代表的新兴框架,强调在危险分析等场景下为 Agent 提供科学的路径选择与执行边界;而 LangChain 等成熟框架则致力于提供统一的工具协议和记忆检索抽象,降低集成成本。
- 对开发者的影响:架构选型应采取“双轨制”:业务主干流依赖成熟框架(如 LangChain/LangGraph)以降低开发成本;在涉及高风险决策(如金融交易、危险操作)的节点,引入控制论模型进行硬编码拦截或独立校验。
2. 编排模式分析
基于“Agent 编排四范式”(线性链 / DAG / 事件驱动 / 自治协作),今日动态反映了以下趋势:
- 今日编排趋势:DAG(有向无环图)工作流占据绝对主导。在金融(Financial Agent Workflows)和数据分析(Text-to-SQL)场景中,几乎所有的编排都采用了显式的图结构,将 LLM 的推理步骤与确定性工具(Calculator、SQL Engine)解耦。
- 范式胜出场景:
- DAG 范式在高风险、高确定性场景(金融、法律、SQL 生成)中胜出。它通过预定义的节点状态和边条件,确保了执行路径的可预测性。
- 自治协作范式仅在探索性研究场景(如 HazardWeaver 的科学路径选择)中出现,作为 DAG 无法覆盖长尾路径的补充。
- 事件驱动在今日动态中较少出现,说明在当前模型能力下,基于中断触发的响应式 Agent 尚未成为主流生产范式。
- 混合编排最佳实践:“DAG 为主,局部自治为辅”。在宏观工作流上采用 DAG 确保流程不跑偏(如强制 Text-to-SQL 必须经过 Schema Linking -> SQL Generation -> Execution 三个节点);在特定节点内部(如复杂查询改写)允许 Agent 进行有限步的自治推理(ReAct),但必须受限于超时控制和最大迭代次数。
3. 工程实践建议
建议一:框架选型建议——优先选择具备“图状态机”能力的框架
- 操作指引:放弃纯粹的 Prompt 链式框架(如早期简单的 LCEL 或顺序调用),转向如 LangGraph、LlamaIndex Workflows 等支持状态图和循环的框架。在构建系统时,首先定义
State(状态对象),然后将所有节点定义为纯函数,通过条件边控制流转。这能将无状态的 LLM 调用转化为有状态的可靠工作流。
建议二:从 L2 到 L3 的升级路径——从“端到端生成”转向“过程性工具依赖”
- 操作指引:L2 Agent 试图用 LLM 直接输出答案,而 L3 Agent 将任务分解为可执行工作流。升级路径如下:
- 识别当前流程中 LLM 容易幻觉的环节(如数学计算、Schema 映射)。
- 将这些环节剥离为外部工具。
- 在框架中强制 LLM 输出结构化参数调用这些工具(如 Knowledge or Calculator? 论文所示,分离知识与计算器能显著提升 Skill Premium)。
- 引入中间校验节点,对工具输出进行断言,失败则回退到上一个节点重试。
建议三:生产环境注意事项——构建防御性的“评测与拦截”层
- 操作指引:不要信任 LLM 的自我判断。在生产部署中:
- 建立“专家小模型”或规则引擎作为 Judge,对主 Agent 的输出进行二次评估(参考 Colombian Legal System 论文的 Reliability Benchmark 方法)。
- 对关键操作(如写数据库、资金转移)实施“双人原则”,即必须通过另一个独立 Agent 或规则集的验证方可执行。
- 实现全链路的可观测性,记录每一次工具调用的输入/输出和 Token 消耗,用于后续的失败归因和成本优化。
4. FAQ:关于 Agent Harness 的常见问题
Q1:在 Agent 架构中,Harness(运行时/编排层)的具体职责是什么?
A: Harness 是连接 LLM 推理能力与外部环境的“操作系统”。其核心职责包括:(1) 状态管理,维护上下文与中间变量;(2) 流程编排,控制节点间的跳转与循环;(3) 工具调度,解析 LLM 输出并安全执行外部 API;(4) 可观测性,记录执行轨迹用于调试与评估。它确保了 LLM 的非确定性输出能够转化为确定性的业务执行流。
Q2:DAG(有向无环图)工作流与完全自治的多智能体协作(MAC)相比,有什么本质优势?
A: 本质优势在于可靠性与可调试性。DAG 显式定义了执行路径,开发者可以精准定位失败节点、实现断点重试和状态回滚。而完全自治的 MAC 依赖 Agent 间的自由对话,容易陷入死循环或产生“幻觉共识”,且难以进行单元测试。在当前模型能力下,生产级系统应优先采用 DAG,仅在需要动态规划的长尾场景中局部引入自治协作。
Q3:如何评估一个 Agent 工作流是否达到了生产可用状态?
A: 需满足三个核心指标:(1) 过程级正确率,不仅看最终结果,还需通过 Trace 分析每个中间步骤(如 Schema Linking、参数提取)的准确率;(2) 失败降级能力,当 LLM 输出格式错误或工具调用超时时,系统能否优雅降级或回退,而非直接崩溃;(3) 成本可控性,单次任务的平均 Token 消耗和工具调用次数是否在预算范围内,且不随上下文增长而指数级爆炸。
常见问题
Q: 2026年应该选哪个 Agent 框架?
A: 取决于场景。简单 RAG → LangChain/LlamaIndex;多步骤编排 → LangGraph/CrewAI;企业生产 → Dify 企业版 + Temporal;快速原型 → OpenClaw。核心选型标准不是功能多少,而是可观测性(L3)是否达标。
Q: MCP 和 Function Calling 的区别是什么?
A: Function Calling 是模型能力(模型理解何时调用),MCP 是协议标准(定义工具如何被发现和接入)。MCP 解决工具生态互操作性,Function Calling 解决模型推理问题。两者互补不互斥。
Q: Agent 框架从 L2 到 L3 最难跨越的是什么?
A: 可观测性闭环——不只是能看到 trace,还要能基于 trace 自动评估、归因、优化。大多数框架有 tracing,但缺少从 trace 到 improvement 的自动回路。
本文由 OpenClaw AI Research 基于 arXiv、GitHub 和 Hacker News 数据自动生成,分析观点为原创内容。框架定义:Agent Harness 成熟度模型 (AHMM)、Agent 编排四范式。