ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI视频生成上手指南:Open Generative AI

AI视频生成上手指南:Open Generative AI AI视频生成上手指南Open Generative AI【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AIOpen Generative AI 是一个可自托管的开源 AI 视频与图像生成工作室把 Flux、Midjourney、Kling、Sora、Veo 等 400 余个模型接入统一界面覆盖文生视频、图生视频与唇形同步的完整产出链路。项目采用 MIT 许可证提供在线版、桌面客户端与本地推理三种启动方式无需订阅费。能力与定位速览功能模块一句话说明关键组件路径图像生成文生图 / 图生图双模式单次最多 14 张参考图src/components/ImageStudio.js视频生成文生视频 40 模型、图生视频 60 模型参数随模型自适应src/components/VideoStudio.js唇形同步肖像音频或视频音频生成说话视频9 个专用模型src/components/LipSyncStudio.js影视镜头控制机身、镜头、焦段、光圈选择转为提示词修饰src/components/CinemaStudio.js工作流编排节点编辑器把图像、视频、音频模型连成多步管线src/components/WorkflowStudio.jsWeb 版基于 Next.js 的 App Router 构建入口页面在app/studio/目录桌面版与共享包packages/studio/复用同一份模型定义两边能力保持一致。环境准备与三种启动方式在线版免安装浏览器打开托管地址即可使用全部工作室模型列表始终跟随最新版本适合先体验再决定是否自建。桌面客户端macOSDMG、WindowsNSIS、LinuxAppImage/DEB均有预构建安装包从源码构建则需要 Node 18git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev注意npm run setup不可省略它会在装依赖后构建packages/studio等 workspaces 子包只跑npm install起不来服务。本地推理仅桌面客户端支持内置两条独立引擎。sd.cpp 打包在应用内在本机跑图像模型支持 Metal/CUDA/Vulkan/ROCmWan2GP 是你在 GPU 机器上自建的 PythonPyTorch 服务应用通过 HTTP 提交任务可跑 Flux、Wan 2.2、Hunyuan 等视频与图像模型。硬件上8GB 内存的机器建议只跑 SD 1.5 级别的小模型跑 2.5GB 以上的扩散模型推荐 16GB 起Wan2GP 侧需要 CUDA/ROCm GPU。两者区别本地推理权重跑在你自己的显卡上、免 API Key云端模式则把请求发往 API 网关首次使用需在界面里配置访问密钥。桌面客户端中的工作室界面暗色玻璃拟态 UI顶部为各工作室标签页从提示词到成片核心工作流文生视频在 Video Studio 输入场景描述默认展示 40 余个文生视频模型Kling、Sora、Veo、Seedance、Hailuo 等主逻辑在 src/components/VideoStudio.js。参数控件会随所选模型自动刷新宽高比16:9、9:16、4:3 等与时长5/10/15 秒只列出该模型支持的档位。点击生成后客户端先提交 prompt 与参数再轮询任务状态拿到视频 URL 后写入右侧历史面板可直接全分辨率下载。生成工作室界面顶部输入提示词切换标签页后选择模型与参数图生视频上传一张起始帧图像后工作室自动切换到 60 余个图生视频模型集Kling I2V、Veo3 I2V、Runway I2V、Wan I2V、Midjourney I2V此时提示词变为可选用来描述期望的运动轨迹。上传过的参考图会进入本地上传历史下次复用无需再次上传多参考图模型按你勾选的顺序提交。唇形同步音频驱动的说话视频Lip Sync 提供两种输入模式。「肖像音频」模式上传人像照片与音频即可得到说话视频模型含 Infinite Talk、Wan 2.2 Speech to Video、LTX Lipsync 等分辨率可选 480p 至 1080p「视频音频」模式则为现有视频重做口型模型含 LatentSync、Sync、Veed 等。实现位于 src/components/LipSyncStudio.js页面刷新后未完成的同步任务会自动恢复轮询。后期镜头控制生成素材后可切到 Cinema Studio 按专业摄影语言微调机身从 8K 数字机到 70mm 胶片、镜头含变形宽幅与复古定焦、焦段覆盖 8mm 至 85mm、光圈 f/1.4 到 f/11。这些选择会被翻译成镜头语法的提示词修饰项注入下一次生成而不是在本地做滤镜处理。Cinema Studio 的「Classic 16mm Film」机型选项模拟复古胶片纹理进阶批量、API 与模型扩展Workflow Studio 批量编排Workflow Studio 用节点编辑器把图像、视频、音频模型连成多步管线自带模板库与社区工作流Playground 可以交互式试跑。每条管线同时暴露 API 调用入口适合把「生成—修图—转视频」这类重复流程批量执行。提交加轮询的两步 APIsrc/lib/muapi.js 封装了统一的调用模式首个请求返回request_id随后轮询结果端点直至状态完成。自建系统对接时照此写即可const res await muapi.generateVideo({ apiKey, model: seedance-2.0, prompt: 霓虹夜街缓慢推镜, aspect_ratio: 16:9, duration: 5 });扩展模型列表全部模型定义集中在 packages/studio/src/models.js每条含id、参数 schema分辨率、宽高比、时长支持与映射到 API 路径的endpoint。新增模型只需在此追加一条定义Web 端与桌面端随共享包同步生效不需要改工作室组件。适用人群、技术栈与资源入口适合谁需要统一界面横向比较多模型视频生成效果、或要求数据留在自己机器上的团队不适合谁只想零配置开箱即用的用户——云端模式需要访问密钥本地模式需要自备 GPU。技术栈Next.js 15 / React 19 / Tailwind CSS / Electronnpm workspaces 单仓库共享 UI 库位于packages/studio/。完整安装、本地推理与排错步骤见 README.md架构与状态管理背景见 project_knowledge.md问题反馈与社区讨论在仓库的 Issues 区评估这类自托管 AI 视频生成方案时最省事的起点是先 clone 仓库完整跑通一次文生视频链路再决定是否接本地推理。【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表