欢迎光临
我们一直在努力

华为云运维三件套实战:云审计 + 云监控 + 云日志完整操作指南

运维类服务实践实验 —— 云审计、云监控、云日志全流程操作

本文基于华为云实验环境,完整记录了云审计服务(CTS)、云监控服务(CES)和云日志服务(LTS)的配置与使用过程,涵盖关键操作通知、告警规则、日志采集等核心功能,适合初学者参考。


一、实验背景与目的

1.1 实验简介

本实验通过实际操作,完成以下任务:

  • 开通并配置云审计服务,追踪云资源操作事件;
  • 配置消息通知服务(SMN),实现关键操作短信告警;
  • 使用云监控服务监控弹性云服务器(ECS)的 CPU 等指标,并创建告警规则;
  • 模拟 CPU 负载升高,触发告警并排查问题;
  • 使用云日志服务采集 ECS 系统日志,并进行检索。

1.2 学习目标

  • 理解云审计如何记录操作轨迹;
  • 掌握云监控的告警配置与故障定位方法;
  • 学会使用云日志服务查看、搜索日志。

二、云审计服务(CTS)—— 关键操作通知

2.1 开启追踪器

  • 登录华为云控制台,创建一台 ECS(规格:1核2GB,CentOS 7.8)。

  • 在服务列表搜索“云审计”并进入。

  • 系统会自动创建一个默认追踪器,状态为“正常”即表示已生效。

    追踪器会自动关联当前租户所有云服务操作,事件默认保存 7 天,可配置转储至 OBS 长期保存。

  • 2.2 配置关键操作通知(结合 SMN)

  • 在云审计左侧栏点击“关键操作通知” → “创建关键操作通知”。
  • 填写参数:
    • 通知名称:keyOperate_info_notify(可自定义)
    • 操作类型:自定义
    • 操作列表:选择 ECS – ecs:DeleteServer、ecs:RebootServer
    • 配置用户:不指定(即所有用户)
    • SMN 主题:需提前创建(若无,则跳转至消息通知服务新建)
  • 2.3 消息通知服务(SMN)配置

  • 进入“消息通知服务” → “主题管理” → “创建主题”(名称自定,如 ecs-notify)。
  • 为主题添加订阅:
    • 协议:选择“短信”
    • 订阅终端:填写自己的手机号
    • 点击确定后,手机会收到确认短信,点击链接完成订阅,状态变为“已确认”。
  • 可先发布测试消息(如内容 “hello”),验证短信接收是否正常。
  • 2.4 完成关键操作通知

    • 返回云审计服务,在创建关键操作通知时,选择已创建的主题,完成创建。
    • 随后在 ECS 列表中对云服务器执行“重启”操作。
    • 数秒内手机将收到华为云发送的重启操作通知短信。

    2.5 查看事件列表

    • 在云审计服务左侧“事件列表”中,可查看近 7 天的所有操作记录,包括时间、操作者、资源类型等。
    • 实验结论:云审计能有效追踪操作行为,结合 SMN 可实现实时告警,方便安全审计和运维追溯。

    三、云监控服务(CES)—— 监控弹性云服务器

    3.1 查看监控指标

  • 在服务列表搜索“云监控服务 CES”并进入。
  • 点击“主机监控”,找到目标 ECS,点击“查看监控指标”。
    • 可看到 CPU 利用率、内存使用率、磁盘读写等基础指标。
    • 若插件未安装,可一键安装(默认已装)。
  • 3.2 创建告警规则

  • 在主机监控页面,点击对应 ECS 右侧的“创建告警规则”。
  • 配置参数(示例):
    • 名称:alarm-ecs
    • 告警类型:指标
    • 云产品:弹性云服务器
    • 资源层级:云产品
    • 监控范围:指定资源(选中当前 ECS)
    • 触发规则:自定义
    • 告警策略:每 5 分钟告警一次,CPU 使用率 > 90% 触发(级别:重要)
    • 发送通知:关闭(为实验简化,可开启)
  • 点击“立即创建”,返回告警规则列表,状态为“已启用”即成功。
  • 3.3 模拟 CPU 负载升高,触发告警

  • 使用 root 用户远程登录 ECS。

  • 执行以下命令,使 CPU 占用飙升(计算圆周率):

    bash

    echo "scale=800000;4*a(1)" | bc -l -q

    (该命令会启动 bc 计算,CPU 利用率迅速升至 100%)

  • 回到云监控页面,刷新主机监控或查看监控图表,CPU 使用率明显升高。

  • 进入“告警 → 告警记录”,可以看到告警状态变为“告警中”,原因是 CPU 使用率超过 90%。

  • 3.4 排查和恢复

  • 再次登录 ECS,执行 top 命令,查看高 CPU 进程(如 bc 进程,PID 示例 4210)。

  • 终止该进程:

    bash

    kill -9 4210

  • 再次 top 确认进程已结束,CPU 恢复正常。

  • 回到云监控,告警记录会逐渐恢复为“已解决”。

  • 思考:云监控配合告警机制能快速发现资源异常,并通过指标定位问题进程,是运维的必备手段。


    四、云日志服务(LTS)—— 查看云服务器日志

    4.1 创建日志组和日志流

  • 在服务列表搜索“LTS”进入云日志服务。
  • 点击“日志管理” → “创建日志组”,填写名称和存储时间(如 7 天)。
  • 在日志组内点击“创建日志流”,输入名称。
  • 4.2 安装 ICAgent(日志采集工具)

  • 进入“主机管理” → “安装 ICAgent”。

  • 选择区域内主机(Linux),获取 AK/SK(在“我的凭证”中管理)。

  • 复制系统生成的安装命令(包含 region、projectid 等参数),手动替换其中的 AK/SK。

    ⚠️ 注意:实际生产中切勿泄露 AK/SK,本实验为测试环境。

  • 使用 SSH 以 root 用户登录 ECS,粘贴执行命令,等待显示 ICAgent install success。

  • 返回“主机管理”页面,查看主机状态变为“运行”,表示 ICAgent 已正常工作。

  • 4.3 配置日志采集规则

  • 在 LTS 控制台选择“云主机 ECS → 文本日志”。
  • 选择刚才创建的日志组和日志流,点击“下一步”。
  • 新建主机组,选择已安装 ICAgent 的 Linux 主机,完成主机组创建。
  • 配置采集路径,例如 /var/log/messages(系统日志),其他选项保持默认,提交。
  • 在“结构化配置”阶段选择“跳过并提交”,完成接入。
  • 4.4 查看和搜索日志

  • 进入“日志管理”,点击日志流名称。

  • 在 ECS 上手动生成一条日志:

    bash

    echo "test log from user" >> /var/log/messages

  • 在日志流页面选择“实时日志”,等待几分钟,即可看到新产生的日志。

  • 切换到“原始日志”,输入关键词(如 error)进行搜索,可快速过滤。

  • 收获:云日志服务集中管理分散的服务器日志,结合关键词检索,极大提高排查效率。


    五、实验收尾 —— 资源删除

    为避免产生持续费用,实验完成后需清理资源:

    • 删除 ECS 实例;
    • 删除告警规则;
    • 删除日志组和日志流;
    • 删除 SMN 主题及订阅;
    • 确认 VPC、安全组等关联资源已释放。

    六、自主练习作业(可选)

  • 创建一台弹性云服务器;
  • 为该服务器配置云审计关键操作通知;
  • 变更该服务器的规格(如升级 CPU/内存);
  • 通过云审计服务查看变更事件,验证审计记录是否完整。
  • 通过这个练习,可以加深对云审计事件跟踪的理解。


    七、总结

    本次实验覆盖了华为云三大运维服务的核心功能:

    • 云审计:记录所有 API 操作,结合 SMN 实现操作告警;
    • 云监控:实时监控资源指标,自定义告警策略,帮助快速定位故障;
    • 云日志:统一采集、存储和检索日志,是问题诊断的利器。

    这些服务相互配合,构成了云上运维的“可观测性”基础,无论是日常巡检还是应急响应,都不可或缺。希望这份笔记能为你的云运维学习提供参考。


    📌 本文仅作学习记录,实际操作时请遵循安全规范,保护好账号凭证。如有疑问,欢迎留言交流。

    赞(0)
    未经允许不得转载:171主机测评 » 华为云运维三件套实战:云审计 + 云监控 + 云日志完整操作指南
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址