用于验证多模型协同的视频生成工作流原型。
项目将提示词生成、文生图、图生视频、文生音乐和媒体合成串联在一个桌面应用中,重点探索不同 AI 服务之间的任务编排、状态管理与人工选择点。
生成式视频通常依赖多个模型和供应商:一个模型负责理解创意,一个模型生成图片,另一个模型生成视频或音乐。手工在多个平台之间传递提示词和文件,会增加等待、版本管理和失败重试成本。
AI Video Workflow 将这些步骤组织为一条可视化流水线,并允许用户在关键阶段预览和选择结果。
- AI 提示词生成:内置基于豆包(Doubao)大模型的提示词生成器,提供多种预设主题与场景组合,一键产出整套图片、音乐提示词以及标题与标签草稿(发布前需人工确认)
- 文生图:调用 LibLibAI 平台完成文生图任务,支持丰富的 Checkpoint、LoRA 模型与采样参数,可多次生成并对比候选结果
- 图生视频:调用火山引擎即梦(Jimeng)I2V 模型,将选定的静态图片转换为平滑自然的动态视频
- 文生音乐:接入即梦音乐模型,通过文本描述风格、情绪与乐器生成定制背景音乐
- 异步任务编排:轮询各服务的异步任务状态、处理结果文件与失败边界,管理候选图片、视频和音频的多个版本
- 媒体合成与人工选择点:使用 FFmpeg 将生成的视频与音乐合成为最终输出;提示词确认、图片选片、最终审核等关键节点均保留人工选择,界面支持在候选图片间前后翻页对比
- 三阶段桌面界面:将创作过程分为"文生图 → 图生视频 → 文生音乐与合成"三个阶段,在 PyQt5 界面中集中配置参数、实时预览媒体、管理任务状态,并可一键重置流程
Creative brief
-> Prompt generation
-> Human review
-> Text-to-image
-> Image selection
-> Image-to-video
-> Music generation
-> Media composition
-> Final review
LiblibClient:文生图任务提交与状态查询JimengI2VClient:图生视频服务适配JimengMusicClient:音乐生成服务适配AIGenerationPipeline:跨服务工作流编排,统一处理异步轮询、超时与失败恢复PromptGenerationStrategy:可扩展提示词策略,预设主题与场景以策略形式注册MainWindow:参数、预览和任务状态管理
主要技术:Python、PyQt5、Volcengine SDK、LibLibAI API、FFmpeg/媒体处理库。
- Python 3.8+
- FFmpeg(需加入
PATH,可用ffmpeg -version验证) - 对应模型服务的有效 API 凭据:豆包 API Key(提示词生成)、LibLibAI Access/Secret Key(文生图)、火山引擎 Access/Secret Key(图生视频与文生音乐)
- 克隆仓库并创建虚拟环境:
git clone https://github.com/toki-plus/ai-video-workflow.git
cd ai-video-workflow
python -m venv venv
# Windows: venv\Scripts\activate
# macOS/Linux: source venv/bin/activate- 安装依赖:
pip install -r requirements.txt- 配置凭据(建议通过环境变量,程序自动读取;也可启动后在 "API 密钥" 标签页中填写):
DOUBAO_API_KEY
LIBLIB_AK
LIBLIB_SK
JIMENG_AK
JIMENG_SK
- 运行程序:
python ai-video-workflow.py典型使用路径:选择主题与场景生成提示词并人工确认 → 文生图并翻页选出满意的候选图 → 图生视频 → 生成配乐并合成最终视频(产物保存在 output 目录,可随时一键重置开始新一轮)。
- 不同供应商的接口、配额和模型行为可能发生变化。
- 生成结果应经过人工审核,并遵守素材版权与模型服务条款。
- API 凭据只能保存在安全的本地环境中,不要提交到仓库。
- 当前实现以原型验证为主,尚未建立完整的自动化测试与 CI。
本项目展示的核心不是单次生成效果,而是多模型服务的抽象、异步任务编排、失败边界和人工确认点设计:每个供应商被封装为可替换的客户端,提示词策略可扩展,关键阶段的产出始终由人选择后才进入下一步。
- video-mover — 多平台内容分发自动化流水线:素材处理、文案生成、定时调度与多平台适配
- ai-highlight-clip — 长视频智能初筛:Whisper 转写 + LLM 评分 + 人工终审,分钟级定位高光片段
- ai-ttv-workflow — 文案到短视频的桌面工作流,关键节点保留人工确认
- ai-mixed-cut — 素材库结构化与脚本重组的视频再创作工作流
- ai-trader-for-mt4 — LLM×MT4 受控执行框架:工具约束、风控规则、状态管理与异步桥接
- ai-trader-for-mt5 — 面向 MT5 的 AI 交易助手与 EA 工程化框架
- auto-usps-tracker — 跨境电商批量物流追踪与 Excel 报告自动化
- AB-Video-Deduplicator — 基于高帧率抽帧混合的视频再创作实验工具
- netease-downloader — 网易云音乐下载桌面应用:扫码登录、下载队列、ID3 元数据写入
See LICENSE.



