行业定制实战|基于腾讯云助手 Skill 搭建运维专属智能体,自动处理日常运维工单
通用智能体聊聊天可以,让它真正干活,还得"垂直"。
本文不聊概念,直接落地:如何基于腾讯云智能体开发平台(ADP)的 Skills 能力,零代码/低代码搭建一个运维专属智能体,实现工单自动识别 → 故障分类 → 简单问题自动修复 → 运维报表生成的完整闭环,并给出 2 个行业落地案例。
01 为什么通用智能体解决不了运维问题?
很多人第一个智能体都从"通用助手"开始:会写文案、能翻译、能总结文档。但在运维场景里,它几乎派不上用场,因为运维有四个"反通用"特征:
| 术语专业 | SNMP、RTO/RPO、Load Average、Swap 命中率…… | 听不懂,答非所问 |
| 动作有风险 | 重启服务、清理磁盘、改配置,一步出错就是事故 | 只敢"建议",不敢"执行" |
| 格式强约束 | 工单、告警、报表都有固定格式与字段 | 输出自由发挥,没法直接进系统 |
| 强依赖历史上下文 | 判断故障要靠历史工单、SOP、变更记录 | 没有私有知识库,只会"编" |
所以结论很直接:运维智能体必须垂直定制。而垂直定制的本质,就是给 AI 一套"身份(角色)+ 工具(Skill)+ 资料(知识库)+ 规矩(规则)"。
02 认识腾讯云智能体开发平台与 Skill
腾讯云智能体开发平台(Agent Development Platform,简称 ADP) 提供 LLM + RAG + 工具调用的统一底座,支持零代码搭建智能体。
而 Skills(技能) 是给智能体扩展专业能力的核心组件:文档翻译、图像识别、语音合成……本质是"对话即操作"的桥梁——每个 Skill 就是一个可复用的专业工具包。
Skills 分三类,落地时按需选择:
| 内置 Skills | 平台官方预置(ADP 原生 + SkillHub 社区 + 腾讯生态) | 开箱即用 | 否 |
| 自定义 Skills | ① 导入本地 ZIP 技能包(含 SKILL.md)② 对话中让 AI 直接生成 | 仅导入所在空间 | 否(自动安全扫描) |
| 企业共享 Skills | 成员自定义 Skill 经企业管理员审批升级 | 全企业空间 | 是 |
在 Skills 广场,平台已按 12 大场景 分类沉淀了大量技能。其中与运维直接相关的有:ADP 平台能力(知识库运维、工作流与应用创建)、经营管理(数据分析、数据周报月报)、设计与开发(文件整理)等——它们是运维智能体的"现成零件"。
Skill 有四种使用方式:智能工作台对话调用、Claw 模式应用集成(单个应用最多挂载 80 个)、导出 ZIP 到其他平台、同步到 WorkBuddy 供企业员工使用。
03 运维专属智能体的总体设计
先画清楚架构,再动手搭。整套体系如下:
┌─────────────┐ ┌──────────────────────────────────────────────┐
│ 工单/告警 │───▶│ 运维专属智能体(ADP) │
│ 入口 │ │ ① 角色设定:运维工程师身份 + 行动守则 │
│ (IM/工单系统)│ │ ② Skill 编排:识别→分类→修复→报表 │
└─────────────┘ │ ③ 私有知识库:历史故障库 / SOP 手册 │
│ ④ 执行规则:分步执行 / 高危确认 / 格式约束 │
└───────────────┬──────────────────────────────┘
│
┌──────────────┼──────────────┬─────────────┐
▼ ▼ ▼ ▼
工单结构化JSON 故障分类结果 自动修复动作 运维报表
(回填工单系统) (多标签+置信度)(白名单内脚本)(日报/周报)
能力矩阵(这是设计时的"灵魂"):
| 工单自动识别 | 工单解析 Skill / 文档解析 | 原始工单文本 | 结构化 JSON(意图/对象/影响面/紧急度) |
| 故障分类 | 分类推理 Skill + 历史故障库 | 结构化工单 | 分类标签 + 置信度 + 关联历史案例 |
| 简单问题自动修复 | 自动修复 Skill(脚本白名单) | 分类结果 | 修复动作 / 执行回执 / 转人工建议 |
| 运维报表生成 | 数据分析 + 文档生成 Skill | 处置记录 | 日报/周报 Markdown |
04 手把手从 0 到 1 搭建(核心实操)
4.1 第一步:定义角色与任务边界
搭建前先写清楚三个要素:角色定位、核心任务、输出规范。正确示范是"做运维工单处理助手,识别故障类型,能自动修复的立即修复并回执,不能的转人工并给处置建议",而不是"做一个全能运维助手"。
下面是可直接复制的角色提示词(System Prompt):
你是一名资深运维专家「OpsAgent」,服务对象是 XX 运维团队。
【职责边界】
1. 只处理与运维相关的事务:工单解析、故障分类、简单问题处置、报表生成。
2. 超出运维范围(财务、人事、法律等)一律拒绝,并引导提交到对应渠道。
【工作流程】
收到工单/告警后,严格按以下顺序执行:
1. 解析并结构化工单(意图、对象、影响面、紧急度);
2. 调用故障分类技能,参考知识库中的历史案例给出分类与置信度;
3. 若是"简单问题"(磁盘空间不足、服务进程异常、日志爆量),调用自动修复技能处置;
4. 处置成功后回执,失败或高危操作必须转人工,并给出建议步骤;
5. 每个工作日结束时,汇总生成当日运维报表。
【输出规范】
– 工单解析结果必须是合法 JSON;
– 分类结果必须附带置信度,低置信度(<0.8)必须转人工复核;
– 涉及重启、删除、停服等操作,必须先说明风险并获得确认;
– 禁止编造监控指标,数据一律以知识库和工具返回为准。
【安全铁律】
– 不执行白名单以外的任何命令;
– 不做任何涉及生产数据删除、权限变更的操作;
– 修复动作执行前必须二次确认。
4.2 第二步:装配 Skill 组合
按能力矩阵勾选/创建以下技能(建议精简,只装用得上的):
| 文档/文本解析 | 内置 | 解析工单原文、日志片段 |
| 数据分析 / 报表生成 | 内置 | 汇总处置记录生成日报周报 |
| ops-ticket-parser(工单解析) | 自定义 | 输出结构化工单 JSON |
| ops-fault-classifier(故障分类) | 自定义 | 多标签分类 + 置信度 |
| ops-auto-fix(自动修复) | 自定义 | 白名单脚本执行修复 |
自定义 Skill 的导入方式(二选一):
- 对话生成:在智能工作台用自然语言描述"帮我创建一个运维工单解析技能,输出结构化 JSON……",AI 自动生成并装配;
- ZIP 导入:本地按平台规范打包(必须含 SKILL.md),导入时平台自动触发格式校验与安全扫描,审核通过后可用。
若 Skill 需要调用第三方 API(如监控平台、通知机器人),记得在「管理 Skills → 环境变量」中配置 API Key(加密保存,按用户隔离),否则 Skill 无法正常运行。
4.3 第三步:绑定运维私有知识库
知识库决定智能体"懂不懂你们家业务"。建议上传三类资料:
运维私有知识库/
├── 历史故障库/ # 近一年故障工单 + 根因分析 + 处置方案(脱敏)
├── SOP手册/ # 服务重启流程、磁盘扩容规范、日志采集标准
└── 命令白名单.md # 允许自动修复技能执行的安全命令清单
并在角色提示词中明确引用规则:“优先参考知识库作答;知识库中无对应信息时,如实告知,不得编造。”
4.4 第四步:编排执行规则
在智能体配置中设置:
4.5 第五步:测试与迭代
用真实工单做回归测试,重点盯三个维度:角色提示词、Skill 是否生效、知识库是否被引用。
| “/var 磁盘使用率 95%,请处理” | 识别为"磁盘空间不足",分类置信度 >0.9,自动清理缓存并回执 |
| “订单服务 503 报错,支付超时” | 识别为"应用服务异常",触发服务重启流程(确认后执行) |
| “帮我算一下上月报销” | 超出运维边界,拒绝并引导 |
| “数据库磁盘 IO 频繁告警,无历史案例” | 分类置信度低,转人工并附排查建议 |
注意:零代码不代表"一次配置即完美"。前期把场景与规则定义清楚,再通过多轮测试迭代,效果才会稳定。
05 四大核心能力实战拆解
5.1 工单自动识别:从一段话到结构化 JSON
输入(模拟工单):
【紧急】用户反馈登录页加载慢,服务端 CPU 飙升到 98%,持续 20 分钟,影响订单查询功能。
智能体输出:
{
"ticket_id": "T20260826-0137",
"intent": "性能告警处置",
"object": "登录服务 / 订单查询",
"symptom": "页面加载慢,CPU 98% 持续 20 分钟",
"impact": "订单查询受影响,范围:中",
"urgency": "P1",
"suggested_skill": "ops-fault-classifier"
}
这一层把"非结构化入口"变成了"结构化数据",是后续分类、修复、报表的前提。
5.2 故障分类:多标签 + 置信度
分类体系建议按公司实际来,参考结构:
├── 硬件类 (服务器宕机、磁盘故障、网卡异常)
├── 网络类 (丢包、延迟、路由、DNS)
├── 系统类 (CPU/内存/负载、内核日志、文件句柄)
├── 应用类 (进程、接口 5xx、中间件、数据库)
├── 存储类 (容量、IO、快照、备份失败)
└── 安全类 (入侵告警、漏洞、异常登录)
输出示例:
{
"primary": "系统类-资源饱和",
"tags": ["CPU", "登录服务", "性能"],
"confidence": 0.93,
"related_history": "T20260518-0021:同类 CPU 饱和,根因为慢查询未加索引",
"action": "可自动修复"
}
5.3 简单问题自动修复:有边界的"动手能力"
先给自动修复划一条"决策线":
工单/告警
│
├─ 命中白名单 + 低风险(清理缓存、重启异常服务、压缩轮转日志)
│ │
│ ▼
│ 二次确认 → 执行修复 → 回执结果
│
└─ 高危/无案例/置信度低
│
▼
转人工,附上下文与建议步骤
自定义 Skill 包(ops-auto-fix)核心结构示例(导入时平台会自动做格式校验与安全扫描,完整字段以《新建 Skills》文档为准):
ops-auto-fix/
├── SKILL.md # 技能元信息:名称、描述、权限声明、环境变量
└── scripts/
├── cleanup-disk.sh # 磁盘空间清理(仅清理临时/缓存目录)
├── restart-service.sh# 服务重启(仅限白名单服务)
└── log-rotate.sh # 日志轮转压缩
SKILL.md 参考:
—
name: ops-auto-fix
description: 运维简单问题自动修复技能。仅支持三类操作:清理磁盘缓存、重启白名单服务、轮转压缩日志。高危操作一律拒绝并转人工。执行前必须二次确认。
version: 1.0.0
permissions:
– execute: allow
– network: deny
– filesystem: read, write # 仅限临时/缓存目录
env:
OPS_SAFE_MODE: "true"
OPS_NOTIFY_URL: "https://hooks.example.com/ops-alert"
—
磁盘清理脚本核心逻辑:
#!/bin/bash
# 仅清理安全目录,白名单机制,防误删
SAFE_DIRS=("/tmp" "/var/tmp" "/var/cache" "/opt/app/logs/archive")
for dir in "${SAFE_DIRS[@]}"; do
if [[ -d "$dir" && "$(du -sm "$dir" 2>/dev/null | cut -f1)" -gt 1024 ]]; then
find "$dir" -type f -mtime +3 -delete 2>/dev/null
echo "[OK] cleaned: $dir"
fi
done
curl -s -X POST "$OPS_NOTIFY_URL" \\
-H "Content-Type: application/json" \\
-d "{\\"event\\":\\"disk_cleanup\\",\\"host\\":\\"$(hostname)\\",\\"ts\\":\\"$(date +%s)\\"}"
自动修复三条铁律(务必写进角色提示词):
5.4 运维报表生成:让日报从 2 小时变成 5 分钟
配置一个"报表生成"技能,绑定日报模板知识库,每班次结束时汇总处置记录,自动产出:
## 运维日报 2026-08-26
### 概览
– 新增工单:38 单(自动处理 16 单,占比 42%)
– 转人工:22 单(其中 8 单为高危变更类)
– 平均响应时长:4.2 分钟(上月同期 28 分钟)
### 故障分类分布
| 分类 | 数量 | 自动处理 | 转人工 |
| — | — | — | — |
| 系统类-资源饱和 | 12 | 9 | 3 |
| 应用类-接口异常 | 10 | 4 | 6 |
| 网络类 | 6 | 1 | 5 |
| 存储类-容量 | 8 | 2 | 6 |
| 安全类 | 2 | 0 | 2 |
### 待跟进
– T20260826-0131:数据库 IO 高,无历史案例,已转 DBA 跟进
06 行业专属落地案例
案例一:电商大促期间的告警工单自动分流(某电商平台 SRE 团队)
- 背景:大促期间单日告警工单从日常 200+ 飙升至 3000+,SRE 人力完全被"读告警"淹没。
- 方案:搭建运维专属智能体,接入监控告警 + 工单系统,装配工单解析、故障分类、自动修复三个 Skill,绑定历史大促故障库,并对接企业微信通知。
- 效果:
- 工单平均响应时长由 30 分钟降至 5 分钟以内;
- 约 40% 的容量类、缓存类告警由智能体直接闭环(自动清理 + 回执);
- 高危告警(数据库、安全类)自动升级至值班 SRE,且附带结构化上下文,人工定位时间缩短一半。
案例二:工单分类 + 报表自动化(某 SaaS 企业 IT 运维组)
- 背景:运维组每天手工给几十个工单打标签,分类口径不统一,周报要花半天拼表格。
- 方案:在智能工作台中定制"工单处理助手",加载历史工单库做分类对齐,配置报表生成 Skill 自动产出周报。
- 效果:
- 工单自动分类准确率从约 70% 提升至 90%+(低置信度工单自动转人工复核,保证兜底);
- 周报生成时间从 2 小时压缩到 5 分钟,且口径统一、可直接进管理层看板。
两个案例的数据均为常见落地区间的示意值,具体以贵司实际规模与配置为准。
07 避坑指南(都是真实踩过的)
| Skill 装了不生效 | 未在对话中调用,或缺少运行环境 | 用技能胶囊/@ 显式唤起;确认依赖环境(如 Node.js)已安装 |
| 知识库被"无视" | 未开启引用开关,或文件过大、指令没提知识库 | 开启知识库引用;大文件拆分;提示词中明确"优先参考知识库" |
| 自动修复误操作 | 边界没划清,白名单缺失 | 严格执行"白名单 + 二次确认 + 全程留痕"三条铁律 |
| 报表出现"编造"的指标 | 提示词允许自由发挥 | 强制"数据以工具/知识库返回为准,禁止编造" |
| 第三方 Skill 一直报错 | 缺环境变量(API Key) | 在「管理 Skills → 环境变量」中配置密钥 |
| 挂载超限 | 无关技能装太多 | 单个 Claw 应用最多 80 个技能,按能力矩阵精简到够用即可 |
08 总结与进阶方向
一句话总结这套打法:用"垂直角色 + 精选 Skill + 私有知识库 + 明确规则"四个零件,把通用大模型改造成能干活、敢干活、干不坏事的运维专属智能体。
进阶方向(按性价比排序):
本文基于腾讯云智能体开发平台(ADP)Skills 能力编写,产品能力与界面以腾讯云官方文档为准。内容为技术实践分享,仅供学习交流。


