
模型选型与常见陷阱vox-director中真人、品牌与9:16竖屏该选哪个视频模型【免费下载链接】vox-directorTurn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud ffmpeg. An agent skill.项目地址: https://gitcode.com/gh_mirrors/vo/vox-directorvox-director 是一个开源 Agent Skill能把一个一句话话题自动变成成品 Vox 风格纸质拼贴解说视频分镜脚本、拼贴关键帧、动效、配音、音乐和字幕全流程自动化。跑通它的过程中最影响成片质量的决定只有一个——为每一类内容选对 AI 视频模型真人出镜选谁品牌广告选谁9:16 竖屏短剧/口播选谁本文用项目内置的真实样例把默认模型选择逻辑和最容易踩的坑一次性讲清楚帮你少走弯路。一、先看全貌一条视频背后的 3 条生成路径vox-director 支持三种输入模式模型需求各不相同模式输入典型场景关键模型B-roll一个话题知识科普、品牌短片nano-banana-2拼贴海报gemini-omni-flash动画化A-roll真人出镜视频讲者口播转拼贴风gemini-omni-flash/video-edit失败自动重试seedance-2.0C-roll一张照片真人/产品锚定拼贴nano-banana-2/edit锚定主体再走动画流程上图30 秒「中国文明演变」影片B-roll 默认路径Omni Flash 动画化的成片效果其中B-roll 是默认路径也是新手最常用的给一个话题模型自动生成每一帧拼贴海报再让它活起来。这条路径下绝大多数内容都应该用默认动画模型——除非内容涉及真人或品牌。二、核心结论真人、品牌必须切到 Kling这是整个选型里最重要的一条规则对非真实内容的动画化用google/gemini-omni-flash/image-to-video一旦涉及真人或品牌 LogoOmni 和 Seedance 会直接拒绝生成必须改用kwaivgi/kling-video-o3-pro/image-to-video。两个模型的定位差异维度gemini-omni-flash默认kling-video-o3-pro适用内容纯插画/拼贴、无真人无商标真人脸部、名人、品牌 Logo文字稳定性好标题不易抖动同样可用分辨率仅 720p跟随输入竖屏支持仅 16:9 / 9:16 两档image-to-video 跟随输入reference-to-video 额外支持 1:1为什么默认模型会拒绝真人这是内容安全过滤机制不是你 prompt 写错——无论措辞多委婉让 Omni 或 Seedance 动画化一张真人照片基本都会被拦截。项目内置了一个可直接运行的样例 examples/ronaldo-9x16-kling.beats.json它就是9:16 竖屏 真人 Kling三件套的组合拳打开就能看到关键写法aspect: 9:16配video_model: kwaivgi/kling-video-o3-pro/image-to-video。上图足球题材 60 秒影片——人物类题材建议参考同目录的 ronaldo 样例切换到 Kling三、品牌广告的两个隐藏陷阱品牌片比真人片更刁钻除了换模型还有两个容易翻车的细节1. 产品标签会被重新拼字动画模型在 C-roll 路径中可能把产品上的文字改写——项目验证时实际观察到过香水标签 PARFUM 变成 PAREUM。解法croll_keyframes.py会往 beats.json 写入anchor_freeze保护句scripts/clips.py 在生成运动 prompt 时把它注入每个镜头。不要跳过 keyframe 阶段直接生成动画否则保护句不存在。2. 别要求模型重画人脸A-roll 模式下无论 prompt 怎么写强措辞或弱化措辞让模型对真人面部做重绘/网点化纹理都会被拒绝——项目两种写法都实测失败。正确姿势是保持真人面部、口型、手势逐帧跟随原素材只把人物剪影边缘和背景换成纸拼贴。相关规则见 SKILL.md 的 A-roll 章节。四、9:16 竖屏比例路由与确认门机制很多人把竖屏 9:16 视频做废不是模型不行而是比例没对齐。vox-director 在 scripts/styles.py 的resolve_video_aspect里内置了一套比例路由规则精确匹配优先项目目标比例如 9:16若被所选模型原生支持直接用近似回退必须人工确认若模型没有精确匹配项比如某些模型只认 16:9/9:16/1:1脚本会取最近比例但停下来要求你确认——在 beats.json 里设置aspect_approx_confirmed: true才会继续绝不静默重裁画面全片统一同一次运行的所有镜头共享同一个解析后的比例成片不会出现横竖混剪。上图60 秒「金钱简史」竖屏成片对应样例 examples/money-60s-9x16-english.beats.json竖屏还有一个与模型无关但影响巨大的节奏规则9:16 社交场景下单个镜头别超过 7 秒建议 4–6 秒一切、每个 beat 给 2 个镜头带标题的全景 不带标题的细节特写。这是 SKILL.md 中总结的最大节奏收益点——模型再强一个 10 秒静止镜头在竖屏里也像死画面。五、常见陷阱速查清单 把项目已验证的坑整理成清单遇到问题先对一遍内容涉及真人/名人/品牌→ 忘了切 KlingOmni 直接拒单A-roll 想重绘人脸→ 必被拒保持面部原样、只重做背景风格C-roll 产品文字漂移→ 漏跑 keyframe 阶段anchor_freeze没注入竖屏用了不支持的比例→ 没看确认门提示就强跑画面被静默改框镜头太长→ 9:16 下单镜头超过 7 秒成片像 PPT模型 ID 失效→ 模型编号会漂移项目运行前会自动拉取在线模型列表以实时列表为准Omni 想要 1080p→ 它只有 720p要更高分辨率换 Seedance支持 480p/1080p所有 API 调用统一经过 scripts/provider.py内置失败/卡死任务自动重提交机制单个镜头卡住不会拖垮整条流水线。六、总结一张表记住选型逻辑你的内容动画模型备注纯插画/拼贴科普gemini-omni-flash/image-to-video默认保持文字稳定720p 起步够用真人脸部 / 名人kwaivgi/kling-video-o3-pro/image-to-video参考 ronaldo 9:16 样例品牌 Logo / 产品文字Kling 跑完 keyframe 阶段确保anchor_freeze生效A-roll 口播重制omni-flash/video-edit自动回退 Seedance面部保持原样只重做背景9:16 竖屏任一模型 确认比例路由4–6 秒一切每 beat 两个镜头模型选型定对vox-director 的其余环节——拼贴风格、配音、配乐、剪辑——都会按 SKILL.md 定义的流水线自动完成。新手最省力的起步方式直接复制 examples/ 里的 beats.json 改一改跑通一条自己的成片。【免费下载链接】vox-directorTurn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud ffmpeg. An agent skill.项目地址: https://gitcode.com/gh_mirrors/vo/vox-director创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考