文章摘要
前面的章节已经完成权限感知RAG、异步长任务和发布质量门禁。本章进入企业AI应用真正上线的最后一公里:如何把Spring AI服务构建为可复现容器,部署到Kubernetes,正确配置启动、存活与就绪探针,在滚动发布和SIGTERM期间排空流式请求、保存任务Checkpoint,并使用Canary逐步验证新模型、Prompt、知识索引和Tool目录。
普通Kubernetes发布只认识容器镜像和Pod状态,但AI系统的实际运行版本由应用代码、模型路由、Prompt Manifest、Embedding与Reranker、RAG索引、Tool Schema、Memory和安全策略共同构成。因此,本章不会把kubectl rollout undo当作完整回滚,而是建立AiReleaseManifest与Release Pointer,让每个Pod回显真实运行版本;Canary阶段同时比较HTTP错误率、P95延迟、Token成本、Claim支持率、引用合法率、Tool副作用和评测通过率;任何安全或重复副作用事件立即回滚,轻微质量波动则暂停等待更多样本。
本章将完整实现:Spring Boot容器镜像、非Root运行、Actuator探针、资源与JVM参数、优雅停机、Deployment基础配置、Argo Rollouts Canary、Prometheus AnalysisTemplate、发布指标标签、多Artifact回滚、长任务版本绑定、回滚验证和CI/CD流程。



