欢迎光临
我们一直在努力

输入一个主题,AI 全自动生成短视频!这个开源工具让视频创作真正零门槛

输入一个主题,AI 全自动生成短视频!这个开源工具让视频创作真正零门槛

一句话介绍:Pixelle-Video 是一款 AI 全自动短视频引擎,只需输入一个主题,就能自动完成文案撰写、AI 配图、语音合成、BGM 叠加、视频合成全套流程。支持 Windows 一键整合包、零门槛上手,完全免费可本地运行。

在这里插入图片描述

目录

  • 1. 先看效果:输入主题,一键出片
  • 2. 它能做什么?核心能力全览
  • 3. 技术架构:ComfyUI 模块化设计
  • 4. 快速上手:Windows 一键整合包
  • 5. 进阶配置:从源码到自定义
  • 6. 费用方案对比
  • 7. 扩展玩法:数字人口播 / 图生视频 / 动作迁移
  • 8. 总结

1. 先看效果:输入主题,一键出片

你有没有过这种经历:想做一个短视频,但——

  • 😩 不会写脚本
  • 😩 找不到配图素材
  • 😩 不会配音
  • 😩 不会剪辑
  • 😩 买了一堆会员还是做不出满意的效果

Pixelle-Video 的解法是:把这五件事全部交给 AI,你只负责想一个主题。

你只需要在输入框里写:「为什么要养成阅读习惯」

然后等待几分钟,AI 自动完成:

  • ✍️ 撰写视频文案
  • 🎨 生成 AI 配图(每句话一张图)
  • 🗣️ 合成语音解说(支持克隆音色)
  • 🎵 添加背景音乐
  • 🎬 一键合成视频

🔗 GitHub:https://github.com/AIDC-AI/Pixelle-Video


2. 核心能力全览

完整流水线

环节支持方案说明
📝 文案生成 通义千问 / GPT-4o / DeepSeek / Ollama 输入主题,AI 创作完整解说词
🎨 配图生成 ComfyUI(FLUX/Qwen 等)/ RunningHub 云端 每句话自动生成一张匹配插图
🗣️ 语音合成 Edge-TTS / Index-TTS 等多种 TTS 工作流 支持声音克隆,多语言音色
🎵 背景音乐 内置 BGM / 自定义上传 MP3/WAV 让视频更有氛围感
🎬 视频合成 竖屏 / 横屏 / 方形多模板 自动拼接分镜,生成完整视频

最新功能(2026年1月更新)

功能说明
👤 数字人口播 上传照片,AI 生成数字人说话视频,支持多语言
🖼️ 图生视频 AI 生成静态图片 → 转换为动态视频
💃 动作迁移 上传参考视频和图片,将视频动作迁移到图片人物上

模板体系

按文件名分类,清晰明了:

static_*.html → 静态模板(纯文字样式,无需 AI 生成媒体)
image_*.html → 图片模板(AI 生成图片作为背景,最常用)
video_*.html → 视频模板(AI 生成视频作为背景,最炫酷)

支持竖屏(9:16)、横屏(16:9)、**方形(1:1)**三种尺寸,适配抖音、小红书、B站等各大平台。


3. 技术架构:ComfyUI 模块化设计

Pixelle-Video 的核心设计理念是原子能力可组合——整个系统基于 ComfyUI 的工作流架构,每个环节都可以独立替换和定制。

视频生成流程

输入主题


┌──────────────────────────┐
│ LLM(通义千问/GPT等) │ → 自动撰写视频文案
└──────────┬───────────────┘
│ 文案

┌──────────────────────────┐
│ 分镜规划 │ → 将文案拆分为多个分镜
└──────────┬───────────────┘
│ 分镜列表(每句话一个分镜)

┌──────────────────────────┐
│ 并行处理(分镜级) │
│ ┌─────────┐ ┌─────────┐ │
│ │ 分镜 1 │ │ 分镜 2 │ │ … ← 同时进行
│ │ AI配图 │ │ AI配图 │ │
│ │ TTS语音 │ │ TTS语音 │ │
│ └─────────┘ └─────────┘ │
└──────────┬───────────────┘
│ 配图 + 语音

┌──────────────────────────┐
│ 视频模板合成 │ → 将分镜拼接成完整视频
│ (竖屏/横屏/方形) │
└──────────┬───────────────┘


输出:完整短视频

为什么选择 ComfyUI 架构?

优势说明
🔧 组件可替换 换生图模型?换 TTS 引擎?直接替换工作流文件即可
🎨 风格可定制 替换生图模型为 FLUX,换 TTS 为 ChatTTS,完全自由
📊 流程可视化 工作流文件即配置,所见即所得
🌐 生态丰富 ComfyUI 社区有大量现成工作流可复用

4. 快速上手:Windows 一键整合包

这是整个项目最友好的地方——Windows 用户不需要装任何环境,解压即用。

第一步:下载整合包

👉 点击下载最新 Windows 一键整合包

下载后解压,双击运行 start.bat,浏览器自动打开 http://localhost:8501

第二步:配置 API

在 Web 界面展开「⚙️ 系统配置」:

LLM 配置(生成文案用):

推荐方案说明
通义千问 成本极低,性价比最高,推荐!
GPT-4o 效果好,但有 API 费用
DeepSeek 国产平替,便宜好用
Ollama 完全免费,但需要本地部署

图像配置(生成配图用):

方案说明
本地 ComfyUI(推荐) 本地部署,完全免费,需有 NVIDIA 显卡
RunningHub 云端 无需本地环境,按调用量付费

第三步:生成视频

  • 左侧输入主题:「为什么要养成阅读习惯」
  • 中间选择语音和配图风格
  • 点击「🎬 生成视频」,等待完成
  • 进度实时显示:生成文案 → 分镜规划 → 生成配图 → 合成语音 → 合成视频


    5. 进阶配置:从源码到自定义

    macOS / Linux 从源码安装

    # 1. 安装依赖
    brew install ffmpeg # macOS
    # Ubuntu: sudo apt install ffmpeg

    # 2. 安装 uv(Python 包管理器)
    # https://docs.astral.sh/uv/getting-started/installation/

    # 3. 下载并启动
    git clone https://github.com/AIDC-AI/Pixelle-Video.git
    cd Pixelle-Video
    uv run streamlit run web/app.py

    自定义 TTS 工作流

    系统会自动扫描 workflows/ 文件夹中的 TTS 工作流。懂 ComfyUI 的朋友可以:

  • 在 ComfyUI 中设计自己的 TTS 工作流
  • 保存为 JSON 文件放入 workflows/ 文件夹
  • 刷新 Web 界面,新工作流出现在下拉菜单中
  • 自定义视频模板

    在 templates/ 文件夹创建 HTML 文件即可:

    static_*.html → 静态模板(纯文字)
    image_*.html → 图片模板(AI 配图)
    video_*.html → 视频模板(AI 视频)

    👉 查看所有模板效果图

    自定义 Prompt 风格

    在「视觉设置」中填写 Prompt Prefix(需要英文),控制配图整体风格:

    # 示例:极简线条插画风格
    Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style

    # 示例:电影感摄影风格
    Cinematic photography, dramatic lighting, film grain, 35mm lens


    6. 费用方案对比

    方案LLM 费用图像费用总成本适合人群
    完全免费 Ollama(本地) ComfyUI(本地) 0元 有 NVIDIA 显卡的用户
    推荐方案 通义千问(极低) ComfyUI(本地) ≈几角钱/视频 普通用户日常使用
    云端方案 OpenAI RunningHub 几元/视频 无显卡、不想配置环境的用户

    💡 有显卡建议用完全免费方案——Ollama 本地运行大模型 + ComfyUI 本地部署 = 完全不花钱。


    7. 扩展玩法:数字人口播 / 图生视频 / 动作迁移

    数字人口播

    上传一张人物照片 + 一段语音/文案 → 生成数字人说话视频。支持多语言,适合做多语种内容本地化。

    图生视频

    先用 AI 生成一张精美的静态图片(支持 FLUX 等模型),再将静态图转换为动态视频。适合风景、插画等内容的视频化创作。

    动作迁移

    上传一段参考视频 + 一张目标人物图片 → 将参考视频中的动作「迁移」到目标人物身上。

    💃 例如:上传一段舞蹈视频 + 一张自己的照片 → 照片里的人跳起了同样的舞

    这是 2026 年 1 月新上线的功能,详见 GitHub 仓库最新更新。


    8. 总结

    Pixelle-Video 的核心竞争力在于两个字:**全」和「简」。

    全: 从文案到配图、配音、BGM、视频合成,一条龙全覆盖。 简: Windows 一键整合包,零门槛;ComfyUI 模块化架构,技术用户也能深度定制。

    推荐指数:⭐⭐⭐⭐⭐

    无论是想快速做短视频的自媒体人、想要自动化批量生产内容的运营团队,还是想研究 AI 视频生成的技术爱好者,这个项目都值得关注。


    🔗 GitHub: https://github.com/AIDC-AI/Pixelle-Video 📦 Windows 整合包: 点击下载 📘 文档: https://aidc-ai.github.io/Pixelle-Video/zh 🎥 视频教程: B站 BV1WzyGBnEVp


    标签:#AI视频生成 #短视频创作 #PixelleVideo #ComfyUI #数字人 #AIDC-AI #开源项目 #TTS #自动化视频

    赞(0)
    未经允许不得转载:171主机测评 » 输入一个主题,AI 全自动生成短视频!这个开源工具让视频创作真正零门槛
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址