欢迎光临
我们一直在努力

Docker Swarm 容器编排全流程实操|三节点集群高可用实战教程

docker swarm

摘要:本文全面介绍了 Docker Swarm 容器编排引擎的核心概念与实践操作。首先阐述了集群化(Clustering)的基本原理,解释了 Docker Swarm Mode 的架构特点。接着详细讲解了 Swarm 中的关键概念:swarm(集群)、node(管理节点与工作节点)和 service(服务定义)。实践部分涵盖了三节点 Swarm 集群的部署、第一个 Service 的创建与运行、Service 的伸缩(Scale Up/Down)操作、故障切换(Failover)机制的实现、Service 的访问方式(包括端口映射),以及 Swarm 的核心特性——routing mesh 和 ingress 网络的工作原理。通过完整的操作示例,展示了 Docker Swarm 如何简化容器编排,实现高可用、负载均衡和自动故障恢复。

docker swarm中重要的概念

从主机的层面来看,Docker Swarm 管理的是 Docker Host 集群。所以先来讨论一个重要的概念 – 集群化(Clustering)。

服务器集群由一组网络上相互连接的服务器组成,它们一起协同工作。一个集群和一堆服务器最显著的
区别在于:

集群能够像单个系统那样工作,同时提供高可用、负载均衡和并行处理。

如果我们部署应用和服务时选择的是多个独立的服务器而非集群,资源的整体利用率则很难达到最优,因为我们无法提前知道如何分布这些应用才能达到资源利用的最大化。而且,应用使用资源的趋势是波动的,早上某些服务可能需要大量的内存,而下午使用量就降下来了。提前指定应用应该运行在哪个服务器上会丧失业务的弹性,当某个服务器宕机了,我们不得不手工将受影响的应用迁移到其他服务器上。

实现集群化后我们的思维方式就必须改变了:不再考虑一个一个的服务器,而是将集群看做是一个整体。

部署应用时,我们只考虑需要多少内存和 CPU,而不是考虑会使用那台服务器的内存和 CPU。我们不应该关心应用会被部署在哪里,我们关心的是运行这个应用需要哪些资源,然后将它部署到集群,集群管理程序(比如 Docker Swarm)会搞定这些细节。

集群整体容量的调整是通过往集群中添加和删除主机节点实现的。但不管做怎样的操作,集群始终还是一个整体。

本章,我们会创建 Docker Swarm 集群、部署应用、伸缩扩展应用。

Docker Swarm Mode

Docker v1.12 是一个非常重要的版本,Docker 重新实现了集群的编排方式。在此之前,提供集群功能的 Docker Swarm 是一个单独的软件,而且依赖外部数据库(比如 Consul、etcd 或 Zookeeper)。

从 v1.12 开始,Docker Swarm 的功能已经完全与 Docker Engine 集成,要管理集群,只需要启动 Swarm Mode。安装好 Docker,Swarm 就已经在那里了,服务发现也在那里了(不需要安装 Consul 等外部数据库)。

相比 Kubernetes,用 Docker Swarm 创建集群非常简单,不需要额外安装任何软件,也不需要做任何额外的配置。很适合作为学习容器编排引擎的起点。

重要概念

在创建集群之前,先明确几个概念。

swarm

swarm 运行 Docker Engine 的多个主机组成的集群。

从 v1.12 开始,集群管理和编排功能已经集成进 Docker Engine。当 Docker Engine 初始化了一个 swarm 或者加入到一个存在的 swarm 时,它就启动了 swarm mode。

没启动 swarm mode 时,Docker 执行的是容器命令;运行 swarm mode 后,Docker 增加了编排 service 的能力。

Docker 允许在同一个 Docker 主机上既运行 swarm service,又运行单独的容器。

node

swarm 中的每个 Docker Engine 都是一个 node,有两种类型的 node:manager 和 worker。

为了向 swarm 中部署应用,我们需要在 manager node 上执行部署命令,manager node 会将部署任务拆解并分配给一个或多个 worker node 完成部署。

manager node 负责执行编排和集群管理工作,保持并维护 swarm 处于期望的状态。swarm 中如果有多个 manager node,它们会自动协商并选举出一个 leader 执行编排任务。

woker node 接受并执行由 manager node 派发的任务。默认配置下 manager node 同时也是一个 worker node,不过可以将其配置成 manager-only node,让其专职负责编排和集群管理工作。

work node 会定期向 manager node 报告自己的状态和它正在执行的任务的状态,这样 manager 就可以维护整个集群的状态。

service

service 定义了 worker node 上要执行的任务。swarm 的主要编排任务就是保证 service 处于期望的状态下。

举一个 service 的例子:在 swarm 中启动一个 http 服务,使用的镜像是 httpd:latest,副本数为 3。

manager node 负责创建这个 service,经过分析知道需要启动 3 个 httpd 容器,根据当前各 worker node 的状态将运行容器的任务分配下去,比如 worker1 上运行两个容器,worker2 上运行一个容器。

运行了一段时间,worker2 突然宕机了,manager 监控到这个故障,于是立即在 worker3 上启动了一个新的 httpd 容器。

这样就保证了 service 处于期望的三个副本状态。

下一节我们开始实践 Docker Swarm。

部署swarm集群

本节我们将创建三节点的 swarm 集群

在这里插入图片描述

swarm-manager 是 manager node,swarm-worker1 和 swarm-worker2 是 worker node。

通过docker教案中安装的docker虚拟机,完整克隆出swarm-manager,swarm-worker1,swarm-worker2,并修改IP地址与主机名与上图相同。

所有节点的 Docker 版本均不低于 v1.12。我们的实验环境 node 的操作系统为 centos-stream-8,当然其他 Linux 也是可以的。

在 swarm-manager 上执行如下命令创建 swarm。

[root@swarm-manager ~]# docker swarm init –advertise-addr 192.168.108.30

在这里插入图片描述

–advertise-addr 指定与其他 node 通信的地址。
docker swarm init 输出告诉我们:
① swarm 创建成功,swarm-manager 成为 manager node。
② 添加 worker node 需要执行的命令。
③ 添加 manager node 需要执行的命令。
执行 docker node ls 查看当前 swarm 的 node,目前只有一个 manager。

[root@swarm-manager ~]# docker node ls
ID HOSTNAME STATUS AVAILABILITY MANAGER
STATUS ENGINE VERSION
bpuyqqwojwjz9avzuaeyjszyo * swarm-manager Ready Active Leader
26.1.3

复制前面的 docker swarm join 命令,在 swarm-worker1 和 swarm-worker2 上执行,将它们添加到 swarm 中。命令输出如下:

注意:三个节点将防火墙zone设置为trust

[root@swarm-manager ~]# firewall-cmd –set-default-zone=trusted
[root@swarm-worker1 ~]# firewall-cmd –set-default-zone=trusted
[root@swarm-worker2 ~]# firewall-cmd –set-default-zone=trusted

[root@swarm-worker1 ~]# docker swarm join –token SWMTKN-15it8t4f2tbrmxuhahkwp7i4jzhq7q14l35tkjotbiln0bztrzw-bmwlgmv1inatgm1hpl1739ncy 192.168.108.30:2377
This node joined a swarm as a worker.
[root@swarm-worker2 ~]# docker swarm join –token SWMTKN-15it8t4f2tbrmxuhahkwp7i4jzhq7q14l35tkjotbiln0bztrzw-bmwlgmv1inatgm1hpl1739ncy 192.168.108.30:2377
This node joined a swarm as a worker.

docker node ls 可以看到两个 worker node 已经添加进来了。

[root@swarm-manager ~]# docker node ls
ID HOSTNAME STATUS AVAILABILITY MANAGER
STATUS ENGINE VERSION
bpuyqqwojwjz9avzuaeyjszyo * swarm-manager Ready Active Leader
26.1.3
s3o9n5wkkbiyc21ehmk3xecvk swarm-manager Ready Active
26.1.3
mdudczt56hzbaw7aum3smrula swarm-manager Ready Active
26.1.3

如果当时没有记录下 docker swarm init 提示的添加 worker 的完整命令,可以通过docker swarm join-token worker查看。

[root@swarm-manager ~]# docker swarm join-token worker
To add a worker to this swarm, run the following command:

docker swarm join –token SWMTKN-1-5it8t4f2tbrmxuhahkwp7i4jzhq7q14l35tkjotbiln0bztrzw-bmwlgmv1inatgm1hpl1739ncy
192.168.108.30:2377

注意:此命令只能在 manager node 上执行。
至此,三节点的 swarm 集群就已经搭建好了,操作还是相当简单的。
下一节我们将在 swarm 中部署第一个 service。

运行第一个 Service

上一节我们创建好了 Swarm 集群, 现在部署一个运行 httpd 镜像的 service,执行如下命令:

[root@swarm-manager ~]# docker service create –name web_server httpd
1ntzbsmbu3q3d4f969gpu0a8c
overall progress: 1 out of 1 tasks
1/1: running [==================================================>]
verify: Service 1ntzbsmbu3q3d4f969gpu0a8c converged

部署 service 的命令形式与运行容器的docker run 很相似,–name 为 service命名,httpd为镜像的名字。

通过docker service ls可以查看当前 swarm 中的 service。

[root@swarm-manager ~]# docker service ls
ID NAME MODE REPLICAS IMAGE PORTS
1ntzbsmbu3q3 web_server replicated 1/1 httpd:latest

REPLICAS显示当前副本信息,1/1的意思是 web_server 这个 service 期望的容器副本数量为 1,目前已经启动的副本数量为 1。也就是当前 service 已经部署完成。命令docker service ps可以查看 service 每个副本的状态。

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE
CURRENT STATE ERROR PORTS
lfwcnkg6pgth web_server.1 httpd:latest `swarm-worker2` Running
Running 56 seconds ago

可以看到 service 唯一的副本被分派到 swarm-worker2,当前的状态CURRENT是 Running ,达到期望DESIRED的状态 Running

如果觉得不放心,还可以到 swarm-worker2去确认 httpd 容器已经运行。

[root@swarm-worker2 ~]# docker ps
CONTAINER ID IMAGE COMMAND CREATED STATUS
PORTS NAMES
bef3b50af9ea httpd:latest "httpd-foreground"
80/tcp web_server.1.lfwcnkg6pgthdkqno2pu4w8n3

当前 web_server 在 swarm 中的分布如图所示。

在这里插入图片描述

目前为止 Service 与普通的容器还没有太大的不同,下一节我们就要学习容器编排引擎的强大功能了,首先从应用伸缩 Scale Up/Down 开始。

如何实现 Service 伸缩?

上一节部署了只有一个副本的 Service,不过对于 web 服务,我们通常会运行多个实例。这样可以负载均衡,同时也能提供高可用。

swarm 要实现这个目标非常简单,增加 service 的副本数就可以了。在 swarm-manager 上执行如下命令:

[root@swarm-manager ~]# docker service scale web_server=5
web_server scaled to 5
overall progress: 5 out of 5 tasks
1/5: running [==================================================>]
2/5: running [==================================================>]
3/5: running [==================================================>]
4/5: running [==================================================>]
5/5: running [==================================================>]
verify: Service web_server converged

副本数增加到 5,通过docker service ls 和docker service ps 查看副本的详细信息。

[root@swarm-manager ~]# docker service ls
ID NAME MODE REPLICAS IMAGE PORTS
1ntzbsmbu3q3 web_server replicated 5/5 httpd:latest

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
1fwcnkg6pgth web_server.1 httpd:latest swarm-worker2 Running Running 4 minutes ago
q4006zahgaqm web_server.2 httpd:latest swarm-worker1 Running Running 53 seconds ago
ug6dgvoycg91 web_server.3 httpd:latest swarm-worker2 Running Running about a minute ago
324xfyww2awh web_server.4 httpd:latest swarm-manager Running Running about a minute ago
v4btzz1lr69q web_server.5 httpd:latest swarm-worker1 Running Running 53 seconds ago

5 个副本已经分布在 swarm 的所有三个节点上。

在这里插入图片描述

默认配置下 manager node 也是 worker node,所以 swarm-manager 上也运行了副本。如果不希望在manager 上运行 service,可以执行如下命令:

[root@swarm-manager ~]# docker node update –availability drain swarm-manager
swarm-manager

通过 docker node ls 查看各节点现在的状态:

[root@swarm-manager ~]# docker node ls
ID HOSTNAME STATUS AVAILABILITY MANAGER STATUS ENGINE VERSION
bpuyqqwojwjz9avzuaeyjszyo * swarm-manager Ready Active Leader 26.1.3
s3o9n5wkkbiyc21ehmk3xecvk swarm-worker1 Ready Active 26.1.3
mdudczt56hzbaw7aum3smrula swarm-worker2 Ready Active 26.1.3

Drain 表示 swarm-manager 已经不负责运行 service,之前 swarm-manager 运行的那个副本会如何处理呢?用 docker service ps 查看一下:

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
lfwcnkg6pgth web_server.1 httpd:latest swarm-worker2 Running Running 8 minutes ago
q4006zahgaqm web_server.2 httpd:latest swarm-worker1 Running Running 4 minutes ago
ug6dgvoycg91 web_server.3 httpd:latest swarm-worker2 Running Running 4 minutes ago
732oh5htny76 web_server.4 httpd:latest swarm-worker2 Running Running 49 seconds ago
324xfyww2awh \\_ web_server.4 httpd:latest swarm-manager Shutdown Shutdown 50 seconds ago
v4btzz1lr69q web_server.5 httpd:latest swarm-worker1 Running Running 4 minutes ago

swarm-manager 上的副本web_server.4已经被 Shutdown了,为了达到 5 个副本数的目标,在swarm-worker2 上添加了副本web_server.4 。

在这里插入图片描述

前面我们的场景是 scale up,我们还可以 scale down,减少副本数,运行下面的命令:

[root@swarm-manager ~]# docker service scale web_server=3
web_server scaled to 3
overall progress: 3 out of 3 tasks
1/3:
2/3: running [==================================================>]
3/3: running [==================================================>]
verify: Service web_server converged

[root@swarm-manager ~]# docker service ls
ID NAME MODE REPLICAS IMAGE PORTS
1ntzbsmbu3q3 web_server replicated 3/3 httpd:latest

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
lfwcnkg6pgth web_server.1 httpd:latest swarm-worker2 Running Running 10 minutes ago
q4006zahgaqm web_server.2 httpd:latest swarm-worker1 Running Running 6 minutes ago
ug6dgvoycg91 web_server.3 httpd:latest swarm-worker2 Running Running 7 minutes ago
324xfyww2awh web_server.4 httpd:latest swarm-manager Shutdown Shutdown 2 minutes ago

可以看到,web_server.4 和 web_server.5这两个副本已经被删除了。

在这里插入图片描述

Service 的伸缩就讨论到这里,下一节我们学习故障切换 Failover。

Swarm 如何实现 Failover?

故障是在所难免的,容器可能崩溃,Docker Host 可能宕机,不过幸运的是,Swarm 已经内置了 failover 策略。

创建 service 的时候,我们没有告诉 swarm 发生故障时该如何处理,只是说明了我们期望的状态(比如运行3个副本),swarm 会尽最大的努力达成这个期望状态,无论发生什么状况。

以上一节我们部署的 Service 为例,当前 3 个副本分布在 swarm-worker1 和 swarm-worker2 上。

在这里插入图片描述

现在我们测试 swarm 的 failover 特性,关闭 swarm-worker1。

[root@swarm-worker1 ~]# shutdown now

warm 会检测到 swarm-worker1 的故障,并标记为 Down。

[root@swarm-manager ~]# docker node ls
ID HOSTNAME STATUS AVAILABILITY MANAGER STATUS ENGINE VERSION
bpuyqqwojwjz9avzuaeyjszyo * swarm-manager Ready Drain Leader 26.1.3
s3o9n5wkkbiyc21ehmk3xecvk swarm-worker1 `Down` Active 26.1.3
mdudczt56hzbaw7aum3smrula swarm-worker2 Ready Active 26.1.3

Swarm 会将 swarm-worker1 上的副本调度到其他可用节点。我们可以通过 docker service ps 观察这个 failover 过程。

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
lfwcnkg6pgth web_server.1 httpd:latest swarm-worker2 Running Running 41 minutes ago
gx95mteiiaq1 web_server.2 httpd:latest swarm-worker2 Running Running about a minute ago
324xfyww2awh \\_ web_server.2 httpd:latest swarm-worker1 Shutdown Shutdown 37 minutes ago
q4006zahgaqm web_server.3 httpd:latest swarm-worker2 Running Running 38 minutes ago
ug6dgvoycg91 web_server.4 httpd:latest swarm-manager Shutdown Shutdown 34 minutes ago

可以看到,web_server.2已经从 swarm-worker1 迁移到了 swarm-worker2,之前运行在故障节点
swarm-worker1 上的副本状态被标记为 Shutdown 。

在这里插入图片描述

Failover 就讨论到这里,下一节我们学习如何访问 Service。

如何访问 Service?

前面我们已经学习了如何部署 service,也验证了 swarm 的 failover 特性。不过截止到现在,有一个重要问题还没有涉及:如何访问 service?这就是本节要讨论的问题。

为了便于分析,我们重新部署 web_server。

# ① 删除原有web_server服务
[root@swarm-manager ~]# docker service rm web_server
web_server

# ② 新建副本数为2的web_server服务,镜像httpd
[root@swarm-manager ~]# docker service create –name web_server –replicas=2 httpd
izro3jrl6e09czc0iz08q9p44
overall progress: 2 out of 2 tasks
1/2: running [==================================================>]
2/2: running [==================================================>]
verify: Service izro3jrl6e09czc0iz08q9p44 converged

# ③ 查看服务运行实例
[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
9zve246nlqed web_server.1 httpd:latest swarm-worker1 Running Running 12 seconds ago
yvker0qkyfe2 web_server.2 httpd:latest swarm-worker2 Running Running 13 seconds ago

①docker service rm删除 web_server,service 的所有副本(容器)都会被删除。

② 重新创建 service,这次直接用 –replicas=2 创建两个副本。

③ 每个 worker node 上运行了一个副本。

好了,现在 service 已经在那里了,我们如何访问呢?

要访问 http 服务,最起码网络得通吧,服务的 IP 我们得知道吧,但这些信息目前我们都不清楚。不过至少我们知道每个副本都是一个运行的容器,要不先看看容器的网络配置吧。

[root@swarm-worker1 ~]# docker ps
CONTAINER ID IMAGE COMMAND CREATED STATUS PORTS NAMES
22973a0645e2 httpd:latest "httpd-foreground" About a minute ago Up About a minute 80/tcp web_server.1.9zve246nlqedn272fgtddepok

在 swarm-worker1 上运行了一个容器,是 web_server 的一个副本,容器监听了 80 端口,但并没有映
射到 Docker Host,所以只能通过容器的 IP 访问。查看一下容器的 IP。

[root@swarm-worker1 ~]# docker inspect web_server.1.9zve246nlqedn272fgtddepok
[
.......
"Networks": {
"bridge": {
"IPAMConfig": null,
"Links": null,
"Aliases": null,
"MacAddress": "02:42:ac:11:00:02",
"NetworkID":
"325e2b265f380ba7278c32b3a6a0def045452e684b23eae5341b494d864a262a",
"EndpointID":
"8e3002fa399c0b412ae04a12481d9824db22bc0c54e6c2bd7b5c47e6705d5344",
"Gateway": "172.17.0.1",
`"IPAddress": "172.17.0.2",`
.....
]
[root@swarm-worker1 ~]#

容器 IP 为 172.17.0.2,实际上连接的是 Docker 默认 bridge 网络。
我们可以直接在 swarm-worker1 上访问容器的 http 服务。

[root@swarm-worker1 ~]# curl 172.17.0.2
<html><body><h1>It works!</h1></body></html>

但这样的访问也仅仅是容器层面的访问,服务并没有暴露给外部网络,只能在 Docker 主机上访问。换句话说,当前配置下,我们无法访问 service web_server。

从外部访问 service

要将 service 暴露到外部,方法其实很简单,执行下面的命令:

[root@swarm-manager ~]# docker service update –publish-add 8080:80 web_server
web_server
overall progress: 2 out of 2 tasks
1/2: running [==================================================>]
2/2: running [==================================================>]
verify: Service web_server converged

如果是新建 service,可以直接用使用 –publish 参数,比如:

[root@swarm-manager ~]# docker service create –name web_server –publish 8080:80 –replicas=2 httpd

容器在 80 端口上监听 http 请求,–publish-add 8080:80 将容器的 80 映射到主机的 8080 端口,这
样外部网络就能访问到 service 了。

[root@swarm-manager ~]# curl http://192.168.108.30:8080
<html><body><h1>It works!</h1></body></html>

[root@swarm-manager ~]# curl http://192.168.108.31:8080
<html><body><h1>It works!</h1></body></html>

[root@swarm-manager ~]# curl http://192.168.108.32:8080
<html><body><h1>It works!</h1></body></html>

大家可能会奇怪,为什么 curl 集群中任何一个节点的 8080 端口,都能够访问到 web_server?
这实际上就是使用 swarm 的好处了,这个功能叫做 routing mesh,我们下一节重点讨论。

神奇的 routing mesh

接上一节案例,当我们访问任何节点的 8080 端口时,swarm 内部的 load balancer 会将请求转发给 web_server 其中的一个副本。

这就是 routing mesh 的作用。
在这里插入图片描述

所以,无论访问哪个节点,即使该节点上没有运行 service 的副本,最终都能访问到 service。

另外,我们还可以配置一个外部 load balancer,将请求路由到 swarm service。比如配置 HAProxy,将请求分发到各个节点的 8080 端口。

在这里插入图片描述

ingress 网络
当我们应用 –publish-add 8080:80 时,swarm 会重新配置 service,我们看看容器都发生了哪些重
要变化。

[root@swarm-manager ~]# docker service ps web_server
ID NAME IMAGE NODE DESIRED STATE CURRENT STATE ERROR PORTS
lwfdj841ph0g web_server.1 httpd:latest swarm-worker1 Running Running 28 seconds ago
jv6lapqesurf \\_ web_server.1 httpd:latest swarm-worker1 Shutdown Shutdown 29 seconds ago
gh9s2wst0klm web_server.2 httpd:latest swarm-worker2 Running Running 25 seconds ago
2yc07ps3oejh \\_ web_server.2 httpd:latest swarm-worker2 Shutdown Shutdown 25 seconds ago

是不是觉得很诧异?之前的所有副本都被 Shutdown,然后启动了新的副本。我们查看一下新副本的容
器网络配置。

[root@swarm-worker1 ~]# docker inspect web_server.1.lwfdj841ph0glbrwwjucmckex
[
......
"Networks": {
"ingress": {
"IPAMConfig": {
"IPv4Address": "10.0.0.15"
......
]

容器的网络与–publish-add 之前已经大不一样了。

[root@swarm-worker1 ~]# docker network ls
NETWORK ID NAME DRIVER SCOPE
325e2b265f38 bridge bridge local
06615073d3f0 docker_gwbridge bridge local
77d2734d1c55 host host local
t2ie77rl777k ingress overlay swarm
a0663936827d none null local

实际上:

ingress ,其作用是让运行在不同主机上的容器可以相互通信。
docker_gwbridge ,其作用是让容器能够访问到外网。
ingress 网络是 swarm 创建时 Docker 为自动我们创建的,swarm 中的每个 node 都能使用 ingress 。

通过 overlay 网络,主机与容器、容器与容器之间可以相互访问;同时,routing mesh 将外部请求路由到不同主机的容器,从而实现了外部网络对 service 的访问

赞(0)
未经允许不得转载:171主机测评 » Docker Swarm 容器编排全流程实操|三节点集群高可用实战教程
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址