在实际 AI 内容创作领域,本地部署一个能够自动生成角色、分镜和视频的 AI 漫剧工作流,已经成为很多开发者和小型工作室关注的方向。尤其当显存只有 8G 时,如何选择模型、配置工具链、串联工作流,并最终实现全自动的漫剧生成,是很多技术实践者面临的挑战。本文将以 ComfyUI 为核心,结合当前可用的开源大模型和视觉生成工具,带你从零搭建一个可在 8G 显存环境下运行的 AI 漫剧生成系统。全文将涵盖环境准备、工作流设计、关键节点配置、模型选型、常见问题排查以及生产级优化建议,目标是让读者能够复现一个可扩展、兼容多 API 平台的本地自动化创作流水线。
1. 理解 AI 漫剧生成的技术栈与核心组件
AI 漫剧生成不是单一模型的任务,而是多个 AI 模块的串联结果。典型流程包括:剧本理解、角色设计、分镜生成、画面绘制、语音合成和视频剪辑。在本地部署时,我们需要根据硬件条件(尤其是 8G 显存)选择合适的轻量模型,并通过工作流工具(如 ComfyUI)将各模块连接起来。
1.1 核心组件及其作用
- 大语言模型(LLM) :负责剧本分析、角色设定和分镜描述生成。在 8G 显存下,需要选择量化版本的大模型,例如 Qwen2.5-1.5B 或 ChatGLM3-6B 的 4-bit 量化版。
- 文生图模型(Text-to-Image) :根据分镜描述生成对应画面。SDXL-Turbo 或 Stable Diffusion 1.5 的轻量变体适合低显存环境。
- 无限画布(Infinite Canvas) :在 ComfyUI 中,无限画布是一个可视化编排界面,允许用户将多个生成节点拖拽连接,形成可重复执行的工作流。
- 语音合成(TTS) :可选模块,用于为角色配音。本地 TTS 模型如 ChatTTS 或 Edge-TTS 的本地版本可以在 CPU 或低显存模式下运行。
- 视频合成工具 :将生成的图片序列和音频合成为视频。FFmpeg 是本地部署的首选工具。
1.2 为什么选择 ComfyUI 作为工作流引擎
ComfyUI 是一个基于节点图的可视化编程工具,专门为 Stable Diffusion 工作流设计。相比其他 UI,它的优势在于:
- 可扩展性 :每个功能(如文本编码、VAE 解码、图像后处理)都是独立节点,可以灵活组合。
- 低资源占用 :ComfyUI 本身轻量,且支持模型动态加载,适合显存受限环境。
- 兼容性强 :支持多种模型格式(.safetensors、.ckpt)、自定义节点,以及通过 API 与其他平台交互。
- 可复现性 :工作流可以保存为 JSON 文件,便于分享和批量执行。
在 8G 显存条件下,ComfyUI 可以通过优化节点执行顺序和显存分配,避免同时加载多个大模型而导致显存溢出。
2. 环境准备与依赖安装
在开始构建工作流之前,需要先准备好基础环境。以下步骤在 Windows 10/11 或 Ubuntu 20.04 LTS 上测试通过,所需显存最低为 8G。
2.1 硬件与软件要求
| GPU | NVIDIA GTX 1070 8G | RTX 3060 12G 或以上 |
| 内存 | 16 GB | 32 GB |
| 存储 | 50 GB 可用空间(用于存放模型) | 100 GB SSD |
| 系统 | Windows 10 / Ubuntu 20.04 | Windows 11 / Ubuntu 22.04 |
| Python | 3.8 – 3.10 | 3.10 |
注意:如果使用 AMD GPU,需要配置 ROCm 环境,但本文以 NVIDIA + CUDA 为例。
2.2 安装 ComfyUI
ComfyUI 的安装方式有多种,推荐使用源码直接安装,便于后续自定义和调试。
# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# 创建虚拟环境(可选但推荐)
python -m venv venv
# Windows 激活环境
venv\\Scripts\\activate
# Linux/Mac 激活环境
source venv/bin/activate
# 安装依赖
pip install torch torchvision torchaudio –index-url https://download.pytorch.org/whl/cu118
pip install
