电力系统、供水系统、通信网络和信息基础设施,是现代社会持续运行的底座。美国《关键基础设施保护法》将关键基础设施定义为:对国家至关重要的实体或虚拟系统与资产,一旦失去能力或遭到破坏,将对国家安全、经济安全、公共健康或公共安全造成严重影响。[1][2]
在我们的研究中,我们将信息技术、电力和水系统等具有高度运行关键性的基础设施统称为 Mission-Critical Infrastructure(MCI,关键任务基础设施)。这类系统需要长期稳定运行,其故障、中断或错误操作还可能产生远超单个设备范围的影响。
从 MCI 运维到大模型 Agent
MCI 的稳定运行依赖大量运行与维护任务,即 O&M(Operations and Maintenance)。这些任务涉及日常监测、故障处理、状态预测和控制决策。
有些任务相对直接,例如:
- 当前冷却水温度是多少?
- 哪一台设备触发了告警?
- 最近一小时的能耗是否异常?
另一些任务则需要更深入地理解系统:
- 温度升高是负载变化,还是设备故障造成的?
- 某条输电线路退出后,系统是否仍能稳定运行?
- 如果调整泵速,未来的温度和能耗会如何变化?
- 当前应该采取什么控制或维护操作?
这些任务横跨监测、诊断、预测、规划和控制,需要综合处理实时传感器数据、历史日志、设备手册、系统拓扑、物理约束,甚至不同操作下的未来仿真结果。随着基础设施规模和复杂度提高,大模型 Agent 开始进入数据中心和电力系统,用于云系统运维与工业资产管理,辅助操作人员获取信息、调用工具并作出决策。
MCI Agent 的工作范围比普通聊天模型更广。它可能需要读取实时告警、查询标准操作流程、调用诊断和仿真工具、理解设备之间的关系,甚至在授权范围内执行控制指令。Agent 的错误也会影响实际运维。遗漏告警可能延误故障处理,错误判断可能导致不合理的维护方案,不恰当的接口和权限使用还可能造成数据泄露、越权访问或错误操作。

模型之外,还有 Harness
讨论大模型 Agent 时,人们通常首先关注模型本身,例如模型是否足够聪明、推理能力是否足够强。但在真实系统中,模型只是 Agent 的一部分。
Agent 能够访问哪些设备数据,能否读取日志和操作手册,能否获得系统拓扑与物理约束,可以调用哪些计算、诊断和仿真工具,以及是否具有操作设备的权限,都取决于模型之外的运行环境。这些围绕模型构建的信息、工具、接口、权限和执行机制,可以统称为 Agent 的 Harness。[3]
可以将大模型理解为 Agent 的“大脑”,而 Harness 决定这个大脑能够看到什么、使用什么,以及能够把决策转化为什么行动。模型决定 Agent 如何推理,Harness 则规定了它的实际能力边界。近年的研究也开始将 Harness 视为涵盖上下文、工具访问、状态管理、执行控制、验证与恢复的独立系统层。
完整的 Harness,一定更好吗?
一种直接的设计,是为所有任务提供同一套完整 Harness。无论 Agent 面对的是读取传感器数值、诊断设备故障,还是预测未来状态、制定控制方案,都向它开放尽可能完整的数据、工具和系统接口。
这种做法看起来很稳妥:信息越多,判断似乎越充分;工具越全,完成复杂任务的可能性似乎越高。但它隐含了一个未经验证的假设:更完整的 Harness,一定会带来更好的结果吗?
不同 O&M 任务的实际需求并不相同。读取当前温度可能只需要实时传感器数据;判断异常是否持续可能需要历史时间序列;诊断故障原因还可能依赖设备结构、运行机制和维修手册;预测未来状态或制定控制方案,则可能进一步需要系统约束、物理模型与仿真能力。
如果所有任务都获得相同的完整配置,许多资源可能与当前任务无关。额外的上下文和工具会增加 token、延迟与计算开销,也可能引入无关信息,干扰模型识别重要证据。与此同时,每多开放一种数据接口、工具或操作权限,Agent 的访问边界也会扩大。
因此,“全部开放”未必最可靠,它可能只是提供得最多。

MCI Agent 必须同时满足三个条件
在普通 AI 应用中,人们可能主要关注任务是否完成。但在关键任务基础设施中,一个可部署的 Agent 至少需要同时满足以下三个条件。
1. 正确而可靠地运行
Agent 必须获得完成任务所必需的信息和能力。如果只提供当前传感器读数,却要求它判断设备内部的潜在故障原因,它可能缺少历史变化、设备结构和物理机制等重要依据。如果要求它制定控制方案,却不提供系统约束和结果验证能力,那么即使方案在语言上合理,也不代表它能在真实系统中安全执行。
Harness 首先必须充分。配置不足可能使 Agent 无法完成任务,也可能让它在缺乏依据的情况下作出错误判断。
2. 具有经济性
Agent 的每一次运行都有成本。更长的上下文意味着更多 token,更多工具调用意味着更长的执行时间,更复杂的仿真和优化则需要更多计算资源。对于持续监测、频繁诊断和批量执行任务的基础设施系统,这些开销会被迅速放大。
因此,评价一个 Harness 配置时,不能只问“它能否完成任务”,还要问:为了完成这项任务,我们是否使用了超出必要范围的资源?
3. 保障信息与系统安全
MCI 中包含大量敏感信息,例如设备拓扑、实时运行状态、控制逻辑、历史告警和内部操作接口,但并不是每一项任务都需要访问全部资源。一个只负责汇总告警的 Agent,通常不需要获得完整的设备控制权限;一个查询操作规范的任务,也未必需要读取内部拓扑和实时系统状态。
按照最小权限原则,Agent 应当只获得当前任务需要的信息与操作能力。开放不必要的数据、工具和权限,会增加信息泄露的可能性,也会扩大误调用、越权操作和攻击利用的风险。
从“可能有用”到“实际足够”
可靠性、经济性和信息安全共同构成了 MCI Agent 的 Harness 配置问题:配置不足可能导致执行失败,配置过度则会增加资源消耗与安全暴露。由于监测、诊断、预测和控制等任务的需求不同,很难期待一套固定的完整配置适用于所有任务。
目前,一些 Agent 系统会根据任务描述检索相关资料和工具[4][5],一些系统按照预设规则分配权限[6][7],还有一些系统直接让模型判断自己需要哪些资源[8][9]。这些方法主要回答的是:哪些资源可能与任务有关?
但“相关”并不等于“必要”。一份文档可能有所帮助,却未必是完成任务不可缺少的;一个工具能够提供更多信息,也不意味着每次调用都值得相应成本;模型声称需要某项权限,也不能证明这项权限是可靠执行的必要条件。
我们要回答的问题是:
对于一项具体的 MCI 运维任务,能够保证可靠执行的最小 Harness 是什么?
这个问题是在匹配任务需求与系统供给:任务需要哪些信息和能力,Harness 又实际提供了什么。目标是为 Agent 提供完成当前任务所需的能力。

围绕这一问题,我们正在研究如何统一描述不同 MCI 运维任务的需求,如何衡量 Harness 提供的信息与能力,以及如何通过实际执行判断一种配置是否已经充分。本文先说明我们希望探究的问题。具体方案和实验结果将在后续分享,完整工作也将在近期上传至 arXiv。
引用文献
[1] United States Congress. Critical infrastructures protection: 42 U.S.C. § 5195c[EB/OL].
[2] Cybersecurity and Infrastructure Security Agency. Critical infrastructure security and resilience[EB/OL].
[3] Li J, Xiao X, Zhang Y, et al. Agent harness engineering: A survey[J]. OpenReview preprint, 2026.
[4] Qin Y, Liang S, Ye Y, et al. ToolLLM: Facilitating large language models to master 16000+ real-world APIs[C]//International Conference on Learning Representations. 2024: 9695-9717.
[5] Franko U. Dynamic system instructions and tool exposure for efficient agentic LLMs[J]. arXiv preprint arXiv:2602.17046, 2025.
[6] Kim J, Choi W, Lee B. Prompt flow integrity to prevent privilege escalation in LLM agents[J]. arXiv preprint arXiv:2503.15547, 2025.
[7] Shi T, He J, Wang Z, et al. Progent: Programmable privilege control for LLM agents[J]. arXiv e-prints, 2025: arXiv:2504.11703.
[8] Asai A, Wu Z, Wang Y, et al. Self-RAG: Learning to retrieve, generate, and critique through self-reflection[C]//International Conference on Learning Representations. 2024: 9112-9141.
[9] Jiang Z, Xu F F, Gao L, et al. Active retrieval augmented generation[C]//Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023: 7969-7992.