MCI Agent 基于多源运维数据协助数据中心操作人员完成监测、诊断、规划与安全决策

关键任务基础设施中的 Agent Harness 部署

电力系统、供水系统、通信网络和信息基础设施,是现代社会持续运行的底座。美国《关键基础设施保护法》将关键基础设施定义为:对国家至关重要的实体或虚拟系统与资产,一旦失去能力或遭到破坏,将对国家安全、经济安全、公共健康或公共安全造成严重影响。[1][2]

在我们的研究中,我们将信息技术、电力和水系统等具有高度运行关键性的基础设施统称为 Mission-Critical Infrastructure(MCI,关键任务基础设施)。这类系统需要长期稳定运行,其故障、中断或错误操作还可能产生远超单个设备范围的影响。

从 MCI 运维到大模型 Agent

MCI 的稳定运行依赖大量运行与维护任务,即 O&M(Operations and Maintenance)。这些任务涉及日常监测、故障处理、状态预测和控制决策。

有些任务相对直接,例如:

  • 当前冷却水温度是多少?
  • 哪一台设备触发了告警?
  • 最近一小时的能耗是否异常?

另一些任务则需要更深入地理解系统:

  • 温度升高是负载变化,还是设备故障造成的?
  • 某条输电线路退出后,系统是否仍能稳定运行?
  • 如果调整泵速,未来的温度和能耗会如何变化?
  • 当前应该采取什么控制或维护操作?

这些任务横跨监测、诊断、预测、规划和控制,需要综合处理实时传感器数据、历史日志、设备手册、系统拓扑、物理约束,甚至不同操作下的未来仿真结果。随着基础设施规模和复杂度提高,大模型 Agent 开始进入数据中心和电力系统,用于云系统运维与工业资产管理,辅助操作人员获取信息、调用工具并作出决策。

MCI Agent 的工作范围比普通聊天模型更广。它可能需要读取实时告警、查询标准操作流程、调用诊断和仿真工具、理解设备之间的关系,甚至在授权范围内执行控制指令。Agent 的错误也会影响实际运维。遗漏告警可能延误故障处理,错误判断可能导致不合理的维护方案,不恰当的接口和权限使用还可能造成数据泄露、越权访问或错误操作。

MCI Agent 基于多源运维数据协助数据中心操作人员完成监测、诊断、规划与安全决策
图1|MCI Agent 基于多源运维数据,协助操作人员完成监测、诊断、规划与安全决策。(图片由 GPT-Image-2 生成)

模型之外,还有 Harness

讨论大模型 Agent 时,人们通常首先关注模型本身,例如模型是否足够聪明、推理能力是否足够强。但在真实系统中,模型只是 Agent 的一部分。

Agent 能够访问哪些设备数据,能否读取日志和操作手册,能否获得系统拓扑与物理约束,可以调用哪些计算、诊断和仿真工具,以及是否具有操作设备的权限,都取决于模型之外的运行环境。这些围绕模型构建的信息、工具、接口、权限和执行机制,可以统称为 Agent 的 Harness。[3]

可以将大模型理解为 Agent 的“大脑”,而 Harness 决定这个大脑能够看到什么、使用什么,以及能够把决策转化为什么行动。模型决定 Agent 如何推理,Harness 则规定了它的实际能力边界。近年的研究也开始将 Harness 视为涵盖上下文、工具访问、状态管理、执行控制、验证与恢复的独立系统层。

完整的 Harness,一定更好吗?

一种直接的设计,是为所有任务提供同一套完整 Harness。无论 Agent 面对的是读取传感器数值、诊断设备故障,还是预测未来状态、制定控制方案,都向它开放尽可能完整的数据、工具和系统接口。

这种做法看起来很稳妥:信息越多,判断似乎越充分;工具越全,完成复杂任务的可能性似乎越高。但它隐含了一个未经验证的假设:更完整的 Harness,一定会带来更好的结果吗?

不同 O&M 任务的实际需求并不相同。读取当前温度可能只需要实时传感器数据;判断异常是否持续可能需要历史时间序列;诊断故障原因还可能依赖设备结构、运行机制和维修手册;预测未来状态或制定控制方案,则可能进一步需要系统约束、物理模型与仿真能力。

如果所有任务都获得相同的完整配置,许多资源可能与当前任务无关。额外的上下文和工具会增加 token、延迟与计算开销,也可能引入无关信息,干扰模型识别重要证据。与此同时,每多开放一种数据接口、工具或操作权限,Agent 的访问边界也会扩大。

因此,“全部开放”未必最可靠,它可能只是提供得最多。

传统固定 Harness 配置与动态任务感知型 Harness 配置流程对比
图2|传统固定 Harness 配置与动态任务感知型 Harness 配置流程对比。

MCI Agent 必须同时满足三个条件

在普通 AI 应用中,人们可能主要关注任务是否完成。但在关键任务基础设施中,一个可部署的 Agent 至少需要同时满足以下三个条件。

1. 正确而可靠地运行

Agent 必须获得完成任务所必需的信息和能力。如果只提供当前传感器读数,却要求它判断设备内部的潜在故障原因,它可能缺少历史变化、设备结构和物理机制等重要依据。如果要求它制定控制方案,却不提供系统约束和结果验证能力,那么即使方案在语言上合理,也不代表它能在真实系统中安全执行。

Harness 首先必须充分。配置不足可能使 Agent 无法完成任务,也可能让它在缺乏依据的情况下作出错误判断。

2. 具有经济性

Agent 的每一次运行都有成本。更长的上下文意味着更多 token,更多工具调用意味着更长的执行时间,更复杂的仿真和优化则需要更多计算资源。对于持续监测、频繁诊断和批量执行任务的基础设施系统,这些开销会被迅速放大。

因此,评价一个 Harness 配置时,不能只问“它能否完成任务”,还要问:为了完成这项任务,我们是否使用了超出必要范围的资源?

3. 保障信息与系统安全

MCI 中包含大量敏感信息,例如设备拓扑、实时运行状态、控制逻辑、历史告警和内部操作接口,但并不是每一项任务都需要访问全部资源。一个只负责汇总告警的 Agent,通常不需要获得完整的设备控制权限;一个查询操作规范的任务,也未必需要读取内部拓扑和实时系统状态。

按照最小权限原则,Agent 应当只获得当前任务需要的信息与操作能力。开放不必要的数据、工具和权限,会增加信息泄露的可能性,也会扩大误调用、越权操作和攻击利用的风险。

从“可能有用”到“实际足够”

可靠性、经济性和信息安全共同构成了 MCI Agent 的 Harness 配置问题:配置不足可能导致执行失败,配置过度则会增加资源消耗与安全暴露。由于监测、诊断、预测和控制等任务的需求不同,很难期待一套固定的完整配置适用于所有任务。

目前,一些 Agent 系统会根据任务描述检索相关资料和工具[4][5],一些系统按照预设规则分配权限[6][7],还有一些系统直接让模型判断自己需要哪些资源[8][9]。这些方法主要回答的是:哪些资源可能与任务有关?

但“相关”并不等于“必要”。一份文档可能有所帮助,却未必是完成任务不可缺少的;一个工具能够提供更多信息,也不意味着每次调用都值得相应成本;模型声称需要某项权限,也不能证明这项权限是可靠执行的必要条件。

我们要回答的问题是:

对于一项具体的 MCI 运维任务,能够保证可靠执行的最小 Harness 是什么?

这个问题是在匹配任务需求与系统供给:任务需要哪些信息和能力,Harness 又实际提供了什么。目标是为 Agent 提供完成当前任务所需的能力。

Agent 输出类型与最低验证强度关系示意图
图3|Agent 输出类型与证据强度关系的概念示意。随着任务由观测走向规划与控制,最低验证要求可能逐级提高。(图片由 GPT-Image-2 生成)

围绕这一问题,我们正在研究如何统一描述不同 MCI 运维任务的需求,如何衡量 Harness 提供的信息与能力,以及如何通过实际执行判断一种配置是否已经充分。本文先说明我们希望探究的问题。具体方案和实验结果将在后续分享,完整工作也将在近期上传至 arXiv。

引用文献

[1] United States Congress. Critical infrastructures protection: 42 U.S.C. § 5195c[EB/OL].

[2] Cybersecurity and Infrastructure Security Agency. Critical infrastructure security and resilience[EB/OL].

[3] Li J, Xiao X, Zhang Y, et al. Agent harness engineering: A survey[J]. OpenReview preprint, 2026.

[4] Qin Y, Liang S, Ye Y, et al. ToolLLM: Facilitating large language models to master 16000+ real-world APIs[C]//International Conference on Learning Representations. 2024: 9695-9717.

[5] Franko U. Dynamic system instructions and tool exposure for efficient agentic LLMs[J]. arXiv preprint arXiv:2602.17046, 2025.

[6] Kim J, Choi W, Lee B. Prompt flow integrity to prevent privilege escalation in LLM agents[J]. arXiv preprint arXiv:2503.15547, 2025.

[7] Shi T, He J, Wang Z, et al. Progent: Programmable privilege control for LLM agents[J]. arXiv e-prints, 2025: arXiv:2504.11703.

[8] Asai A, Wu Z, Wang Y, et al. Self-RAG: Learning to retrieve, generate, and critique through self-reflection[C]//International Conference on Learning Representations. 2024: 9112-9141.

[9] Jiang Z, Xu F F, Gao L, et al. Active retrieval augmented generation[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023: 7969-7992.

Leave a Reply

Your email address will not be published. Required fields are marked *