从问答到执行:Cloudnet网络智能体优化实践
以前,我用AI编程的方式是先问AI、把AI生成的代码拷贝到编程软件,在编程软件里执行之后再把结果贴回AI聊天窗,让AI帮我看看哪里出了问题——看似在驾驭AI,实则是在给AI打下手。

后来,Vibe Coding来了。我彻底解放了双手,只需要描述需求,AI工具会自己分析需求、编写代码、安装依赖、完成测试乃至提交Git。而同一时间我可以去做其他事,直到AI工具提示我任务完成。

现在,网络运维也在发生着同样的改变——比如Cloudnet云管平台的网络智能体,就是把“用AI助手辅助运维”这件事从问答升级到执行。
为了更高效精准地执行不同任务,Cloudnet在平台部署了针对不同任务类型的专用智能体,如态势智能体、排障智能体等,并通过一个超级智能体进行子智能体的任务分配。
以最典型的“无线卡顿”报障为例:

在这个过程中,所有动作都由不同智能体有序自主地规划执行,平台用户无需翻找不同Web页面,也无需关注背后复杂的流程,只需要通过灵犀AI助手即可完成排障或查询动作。
当前,Cloudnet已经部署了如下三大类专用智能体:
问答智能体: 通过自然语言查询运维知识、配置入口和命令建议;
态势智能体: 查询场所、设备和终端状态,并归纳需要关注的信息;
排障智能体: 调用智诊工具,分析可能原因并给出处置建议;
三类不同的智能体分别针对知识问答、态势查询、智能排障及调优场景提供对应能力,通过聚焦任务和多智能体协同来提升响应速度和执行效率。

当然,光有智能体还不够,要编排好流程、提升运维效果,核心还在于沉淀专业知识的Skill。
曾经,有销售对我说,客户自己用运维工具时总是抱怨工具没效果,请了总部专家来演示,客户一下子就改观了——不是工具不好,而是只有专家才知道怎么使用才能发挥工具的效果。这也正是Cloudnet网络智能体要解决的问题:把专家变成Skill和工作流,让智能体用最佳组合编排调用各种工具,从而让每个人都能像专家一样有效运维。
目标很清晰,走起来却不简单。一个客观现实是,网络协议众多、特性也异常丰富,仅新华三网络操作系统Comware平台就支持了1400多种网络协议,有近5万条命令行。即使能够把这些功能都封装为Skill,真实的网络又是不同特性和协议的组合叠加,如何查找和组合Skill成为了一个难题。
为了控制执行复杂度、提高系统效率,新华三将网络Skill进行了分层设计,根据协议和运维类型对Skill进行分类和规划,比如,二层转发Skill、三层转发Skill、路由协议Skill、无线接入Skill等。同时,提供综合诊断Skill类型,用于针对典型问题进行综合研判,比如路径通断、应用访问异常等。为了更灵活地适配各种任务,Skill之间还会进行嵌套调用,因此新华三也针对Skill调用和书写定义了一系列规范。
通过这种规范前置、统一规划、分层管理的方式,新华三在Cloudnet上打造了一套易于查询调用且可以长期迭代的网络Skill库。

现在,智能体和Skill都已到位,接下来的优化目标就是如何进一步让网络智能体跑得更快。
众所周知,智能体具有独立思考和执行能力,这使得他可以根据用户语义和Skill自行策划流程,虽然能让智能体灵活应对各种情况,但同时也增加了计算资源消耗、让响应和执行时间变得更久。
而另一方面,日常的网络运维过程中有许多固定的常规流程,比如查询端口信息,只需要按照固定的步骤分别查询端口物理状态和协议状态、统计信息、日志记录并进行整理组合即可。
针对这种确定性流程,新华三创新性地利用知识图谱将其固化为图谱脚本。当网络智能体理解用户语义后,如果匹配到对应图谱,则跳过任务规划编排,直接按照图谱脚本执行,极大提高了运维速度。而对于非确定性需求,如果没有匹配到图谱,则网络智能体还是会正常匹配Skill并进行任务规划和执行。
通过这种“固定脚本+动态规划”组合,兼顾了模型的泛化性和脚本执行的确定性,将响应时间压缩到了极致,显著提升了平台用户的运维交互体验。

从问答到执行,Cloudnet网络智能体演进的背后,是新华三对网络运维的深刻理解与持续优化。
面对真实网络中的复杂问题,新华三通过多智能体协同和Skill分层管理,把专家经验沉淀为可调用、可编排、可迭代的任务能力;同时,通过“高频标准流程固化、复杂任务智能编排”的双路径机制,让常规任务更快执行,让复杂问题也能灵活响应。
这也是 Cloudnet AgenticOps 的目标:把专家级运维能力带到一线,让网络问题更快闭环,让天下没有难搞的运维。

支持
