目录
一、前言
二、AI运维介绍
2.1 AI 运维是什么
2.2 AI运维核心价值
2.3 AI运维特点
2.4 AI工具运维的解决方案
三、AI 运维项目实操案例
3.1 前置工具准备
3.2 基于MCP 服务配置与使用
3.2.1 配置redis mcp工具
3.2.2 配置mysql mcp 工具
3.2.3 配置远程服务器 mcp 工具
方案一:SSH MCP Server(最通用,推荐)
方案二:更安全的免密登录方式(推荐)
3.3 操作服务器
3.3.1 远程连接服务器
3.3.2 进程管理
3.3.3 安装中间件
3.3.4 服务器空间优化与清理
3.3.5 告警通知提醒
四、写在最后
一、前言
在日常项目开发和项目管理中,不可避免的要操作服务器,比如将项目部署到远程服务器上,在服务器上部署项目需要用到的各种中间件,日常对服务器上的各种中间件进行运维、管理、监控,对服务器上的资源消耗情况进行监控等,对很多开发工程师来说,这些原本属于运维的活儿可能并不擅长,手动去做需要投入时间去学习、研究‘尝试,而这些操作不仅费时费力,而且有一定的风险,现在有了各种好用的AI工具之后,基于AI运维的模式逐渐盛行起来,开发者哪怕不懂服务器的各种操作,只需要能把问题描述清楚,就可以完成对服务器的各种基本的运维工作,本篇将详细介绍使用AI工具辅助日常运维的操作。
二、AI运维介绍
2.1 AI 运维是什么
AI运维,全称是智能运维(AIOps,Artificial Intelligence for IT Operations)。简单来说,就是利用人工智能(AI)和机器学习(ML)来管理和维护复杂的IT系统,让运维工作从过去被动、低效的“救火队”模式,向主动、智能、自动化的方向演进。
为了更好地理解,可以把它看作是运维发展的高级阶段。IT运维大致经历了从早期依赖人工命令的手工运维,到利用脚本和工具的自动化运维,再到如今以AI为核心的智能运维(AIOps)。
2.2 AI运维核心价值
AI运维的价值在于它能将传统方式难以处理的海量运维数据(如日志、监控指标、追踪信息等)转化为智能决策。主要体现为以下四大能力:
-
智能监测与预测:AI能7×24小时不知疲倦地分析数据,敏锐地发现那些人力难以察觉的微小异常,并对未来的资源瓶颈或潜在故障进行预测,提前发出预警。
-
智能诊断与根因定位:当故障发生时,AI能快速分析错综复杂的告警风暴,自动绘制故障传播链,精准定位问题的根源,而不是让运维人员“大海捞针”。
-
智能决策与自动修复:基于诊断结果,AI不仅能提供解决方案建议,甚至能触发预设的自动化脚本或执行“自愈”操作,直接在系统做出反应,最大程度减少业务中断。
-
智能知识沉淀:通过大语言模型等技术,AI可以建立运维知识库,将专家经验固化为可复用的规则。运维人员甚至可以用自然语言(如“查一下最近一小时支付服务的异常”)直接与系统交互,降低了技术门槛。
2.3 AI运维特点
AI运维的价值,体现在它将传统的、被动的IT运维,转变为一种主动、智能、高效的运营模式。其主要特点可以概括为以下四点:
从"被动救火"到"主动预防":AI运维不仅能实时发现问题,更重要的是能基于历史数据学习,预测潜在风险,在故障影响用户之前就提前预警并处理。这从根本上改变了运维团队的工作节奏。
从"大海捞针"到"精准定位":面对海量告警,AI能自动过滤噪音,进行事件关联,并迅速找到问题的根本原因。实践表明,这可以将故障定位时间从"小时级"缩短到"分钟级"。
从"人工操作"到"自动闭环":除了发现问题,AI还能触发自动化修复流程,如重启服务、执行脚本,形成一个"监控-诊断-修复-验证"的闭环,减少对人工干预的依赖。
从"依赖专家"到"赋能全员":AI通过自然语言交互和知识库,让不同水平的运维人员都能高效工作。生成式AI(GenAI)还能自动总结事件、给出修复建议,将专家经验固化为可复用的知识。
2.4 AI工具运维的解决方案
在实际应用中,基于AI工具做日常的运维工作也有不同的方式,具体来说,主要有三种路径:
工具链集成法:用 AI 驱动已有运维工具 这是最直接的方式,通过 MCP(模型上下文协议) 等机制,将 AI 与现有的运维工具连接起来。这样,当你对 AI 说"检查服务器负载"时,它就能理解并自动调用背后的 SSH 或监控工具去执行。
举个实际例子:社区中有一个名为 ops-automation-mcp-ts 的开源项目,为 Codex 提供了一套标准的运维 MCP 服务器。配置后,你可以直接对 Codex 说"重启 87 上的 microfront-main 服务"或"看看测试服务器负载",Codex 就会帮你完成。
补充资料:为了更安全地在团队间交接任务,还有像 handoff-relay 这样的工具,支持在 AI 助手之间传递带有人工审批环节的"任务包"。
平台化配置法:为 AI 构建专属"操作手册" 面对一套复杂的运维系统,直接让 AI 去操作容易出错。更稳妥的做法是,提前为 AI 准备好一份结构化的"说明书"。
实践案例:一个叫 Licell 的项目,支持将高度结构化的命令说明注入到 Cursor 或 Claude 的技能(Skills)中。这样,AI 就知道 licell deploy –target preview 这个命令是干什么用的。你可以直接对它说:"帮我把项目发布到生产环境,申请SSL证书",AI 就会按步骤调用命令执行。这种模式对命令行操作尤其有效。
自动化工作流法:让 AI 处理重复性运维任务 Cursor 最新推出的 Automations 功能,允许你创建"始终在线"的 AI Agent,按计划或由事件(如收到告警、新 PR 合并)触发,自动执行运维任务。
典型场景:
-
事件响应:当 PagerDuty 触发告警时,AI Agent 可以自动拉起日志、分析变更,甚至在 Slack 中给值班工程师发来包含修复建议的 PR。
-
代码审查:在每次代码提交时,AI Agent 自动进行安全检查,甚至根据风险等级自动批准或指派审查者。
三、AI 运维项目实操案例
接下来通过具体的案例操作来演示使用普通的AI工具如何进行一些日常的运维操作。
3.1 前置工具准备
目前很多主流的AI工具均有可视化客户端,可以更方便操作人员通过可视化的方式与AI进行交流对话,同时,这些AI可视化工具提供了很多扩展能力,比如配置MCP服务,配置大模型,配置Skill等,方便用户扩展AI工具本身的能力,下面推荐几个常用且高效的AI工具,方便接下来对服务器,服务中间件,服务器日常操作、监控等进行AI的运维。
-
Cursor ,老牌AI编程工具,功能完善,使用简单,容易上手,可视化效果好
-
Codex ,全能AI助手工具,内置ChatGPT系列大模型,处理任务能力强,综合性能优秀
-
Qoder,国产AI编程工具(阿里旗下产品),内置千问系列大模型以及国产优秀大模型,本土化优势强
-
龙虾类产品,比如OpenClaw,Hemes ,自动化能力强
接下来以Cursor 为例,结合日常工作中一些高频的运维场景为例进行操作演示。
3.2 基于MCP 服务配置与使用
3.2.1 配置redis mcp工具
MCP 到今天对很多同学来说,应该不陌生了,MCP的出现大大拓展了大模型的能力,也使得业务系统能够更方便快捷的对接各类大模型能力,在Cursor 中,通过设置找到MCP配置的入口,如下:

以一个实际场景为例,现在想通过AI来辅助开发者(用户)对本地(远程服务器)上面的redis服务进行一些基本的操作,比如查看redis的key,内存使用情况,首先,在上面打开的MCP的配置那里,点击添加一个MCP Server,在新打开的mcp.json文件中将redis的mcp信息配置上去:
-
这里配置的是本机,如果是远程服务器上面的,更换一下服务器IP地址,端口
-
如果redis设置的有密码,把密码也加一下
{
"mcpServers": {
"redis": {
"command": "npx",
"args": [
"-y",
"@modelcontextprotocol/server-redis",
"redis://localhost:6379"
]
}
}
}
配置完成后,启动一下本地redis服务,然后打开一个对话框,输入下面的自然语言,做一个测试
我刚刚配置了redis的mcp,你现在能操作本机的redis吗
等待一会之后,返回了相关的信息,可以看到,AI已经能够通过redis的mcp连上本地的redis服务了

接下来测试一下效果

提一个常用的redis运维场景,寻找大key
在这些key里面,列出各个key占用的空间,以便我判断下有没有大key


3.2.2 配置mysql mcp 工具
参考上面的方式,将下面的信息配置到mcp.json文件中,mysql的相关连接信息使用你自己提供的即可
{
"mcpServers": {
"mysql": {
"command": "npx",
"args": [
"-y",
"@modelcontextprotocol/server-mysql",
"mysql://你的数据库用户:你的密码@你的服务器地址:3306/你的数据库名"
]
}
}
}
紧接着输入下面的提示词做一下测试
我刚刚配置了mysql的mcp,你现在能操作这个连结IP的mysql数据库吗

接下来做几个场景的模拟效果测试
1)查看表信息
这个库中跟订单相关的表有哪些,帮我列出来

2)查询表的数据
查看下XXX这个表中5月份到现在一共产生了多少数据

3)获取查询SQL
给我提供一个sql,能够根据某个订单号,查到这个订单的物流轨迹信息

补充与注意:
-
与数据库数据表日常运维的操作项还有很多,这里就不再过多演示了
-
使用AI 做数据库的运维工作时,非必要的情况单独开账号,并且账号的操作权限尽可能的小
-
其他更多本地或者远程服务器上需要操作的中间件,都可以按照上面的思路来做,先寻找并配置MCP,然后测试一下连通性,最后开始做实际的运维
3.2.3 配置远程服务器 mcp 工具
对服务器的操作可以说是很多开发或运维人员日常非常高频的操作了,下面推荐两个方案,一个轻量通用,一个企业级安全。
方案一:SSH MCP Server(最通用,推荐)
这个方案通过 SSH 协议连接远程服务器,让 AI 可以帮你执行任何 Shell 命令。
配置示例(mcp.json):
{
"mcpServers": {
"ssh-server": {
"command": "npx",
"args": [
"-y",
"@kukapay/mcp-ssh-server",
"your-server-ip",
"your-username"
],
"env": {
"SSH_PASSWORD": "你的SSH密码"
}
}
}
}
方案二:更安全的免密登录方式(推荐)
如果你配置了 SSH 密钥,可以改用密钥认证,更安全:
{
"mcpServers": {
"ssh-server": {
"command": "npx",
"args": [
"-y",
"@kukapay/mcp-ssh-server",
"your-server-ip",
"your-username",
"–private-key",
"/path/to/your/private-key"
]
}
}
}
参数说明:
-
your-server-ip:服务器 IP 地址(如 192.168.1.100)
-
your-username:登录用户名(如 root 或 ubuntu)
-
–private-key:指定私钥文件路径(如 ~/.ssh/id_rsa)
配置完成后,你可以在 Cursor 中这样使用:
-
“帮我查看 /var/log/nginx/error.log 最近 20 行错误日志”
-
“检查服务器上 nginx 进程是否在运行”
-
“列出 /home/deploy/app 目录下的文件”
这里以第一种方式为例进行说明,将上面的信息配置到mcp.json中,配置完成后做一下测试
我配置了服务器连接的mcp,测试连接下XXX这台服务器

下面测试几个基本的服务器操作场景。
1)查看服务器负载情况
列出当前服务器的负载情况,包括:内存,CPU,进程信息

2)查看服务器安装了哪些软件

补充:
-
基于配置的服务器远程连接MCP工具还可以做更多其他的事项,但是实际在操作的时候,尽可能的对每一步AI的操作进行人工检查,避免权限太大出现意外
3.3 操作服务器
对服务器的操作是日常开发和运维中高频的使用场景,比如:
监控服务器健康状况
服务器负载过高预警
服务器上的服务日常运维
服务器安装部署中间件
管理中间件集群
服务器定期空间清理、优化等
…
接下来基于一些具体的使用场景案例,进行详细的说明。
3.3.1 远程连接服务器
在上文中初步介绍了使用MCP的方式远程连接服务器,这种方式在大部分场景下没啥问题,不过MCP工具自身的使用范围会根据这种工具自身的能力存在一定的范围局限,如果是更通用的做法,可以直接在对话窗口,提供服务器的连接配置信息,然后进行连接操作,如下,某个服务器必须要使用SSH的安全方式连接,打开对话框,提供下面的提示词:
-
我这里提前将ssh信息放在本地的一个文件中
-
如果使用的是普通的账号密码登录,建议提供一个权限受控的,避免意外的问题发生
登录XXXXX 这台服务器,使用ssh的方式登录,服务器登录账号是root,端口22,我的ssh文件信息在这个文件里面:@d:\\工作空间\\ssh文件\\ssh文件.txt

登录进去之后,理论上就可以基于当前的AI会话窗口,对当前这台服务器进行所有的操作了。这里让AI查一下当前服务器上正在运行的进程有哪些。

3.3.2 进程管理
对服务器上的进程进行日常管理,比如查看进程信息,进程对资源的占用情况,查找服务器上比较耗资源的前几个进程号等

更进一步,查询下各个进程的资源占用情况

再让AI对当前启动的服务进程给出一些优化建议,结合输出日志可以看到,AI会先分析当前的现状,对现状做一个诊断分析之后才会给建议



3.3.3 安装中间件
日常项目开发过程中,经常会涉及到在服务器上安装部署各种中间件,对很多开发工程师来说,安装部署运维中间件是一件头疼的事情,现在可以借助AI工具来完成相关中间件的安装部署和运维整个过程。
1)安装redis服务
首先,在当前的服务器上,希望通过docker 的方式安装一个redis 6.X的版本,在对话框输入下面的提示词
在当前192.168.1.195 这台服务器上,我现在想使用docker的方式部署一个redis服务,为了方便后续的维护,需要做容器数据卷的映射,可以放在 /usr/local/redis 目录下,端口使用默认的6379,不需要设置密码
输入之后,AI首先会解读提示词需求,进行分析拆解,并给出规划的部署方案,然后等你确认

将AI的几个问题一一确认后,接下来就开始部署过程

等待一会之后,AI帮我们完成了Redis容器服务的部署

可以登录到服务器上进行检查确认,可以看到,redis 服务已经正常运行,相关的配置文件也在指定的目录下创建


2)安装redis集群
更进一步,为了确保生产环境下的redis服务高可用,有时候需要搭建redis集群,比如以大家熟悉的redis复制集群为例进行说明,给出如下提示词:
我想在这台服务器上搭建一个redis的复制集群,两个redis服务形成一个复制集群,仍然使用docker的方式搭建,方案你自己先规划,为了方便后续的维护,配置文件和数据需要做好持久化
接下来AI开始根据我的需求描述进行部署方案的规划设计

根据AI给出的设计方案,确认里面提出的问题

经过一段时间响应后,将主从集群需要的2个redis服务按照确定的方案启动了,并且给出了后续的运维相关命令

3.3.4 服务器空间优化与清理
服务器持续运行过程中,可能会产生很多垃圾文件,长期不对这些文件进行清理,服务器的磁盘空间会面临不够用的情况,在下面这个简单的场景中,让AI查找下服务器上比较耗费存储资源的目录


找到了比较耗费资源的文件目录后,接下来让AI提供具体的清理方案

3.3.5 告警通知提醒
经常操作服务器的同学应该对这个场景不陌生,当服务器的存储资源,CPU负载等达到一定的界限时,会将告警信息推送出来,比如发送邮件通知,短信通知,或者发到工作群里,下面这个提示词中是一个具体的场景,当这台服务器上的内存不足50%的时候,把监控信息发到指定的邮箱
我想监控一下这台服务器的内存使用情况,当内存使用达到50%的时候,希望能够将告警通知出来,发到我给你的邮箱中,邮箱:XXX@qq.com
AI会先做方案的规划,给出相关的方案设计和建议

我觉得配置邮箱比较麻烦,就让AI提供发送到飞书群通知,飞书群告警通知对接起来更简单,只需要提供一下群的webhook地址即可,然后AI会根据我的需求调整,重新规划下面的设计方案


最后,只需要提供飞书的webhook地址给它即可完成后面的流程。
四、写在最后
本文通过较大的篇幅详细介绍了如何使用AI工具来协同对各种中间件,以及服务器的运维操作实践演示,更多的运维场景,有兴趣的同学还可以基于此继续做深入的研究,本篇到此介绍,感谢观看。
