
1. 文生视频提示词到底在写什么1.1 先搞清楚模型在“听”什么很多人第一次接触AI视频生成脑子里想的还是“我写一句话它给我一段视频”。真上手之后才发现同一句话在不同工具里出来的东西天差地别有时候甚至同一个工具、同一句话跑两次结果都不一样。问题出在哪儿出在你以为你在“描述画面”但模型实际在“解析结构”。文生视频的提示词本质上是一份给模型看的拍摄脚本。它需要同时告诉模型五件事画面里有什么、这些东西长什么样、它们在怎么动、镜头怎么拍、整体是什么风格。这五个维度缺一个模型就会自己“脑补”而它脑补的方向往往和你想要的完全不是一回事。我拿一个实际例子来说明。假设你想生成“一个女孩在海边散步”的视频。如果你只写这一句模型大概率会给你一个中景固定镜头女孩在画面中间匀速走海浪微微动整体像一张会动的照片。但如果你写成“广角镜头低角度跟拍一个穿白色连衣裙的女孩赤脚走在浅水区裙摆被海风吹起夕阳从她身后打过来形成逆光轮廓海浪一层层涌上沙滩又退去”出来的效果就完全不一样了。后者给了模型足够多的约束条件它不需要猜只需要执行。这里有个关键认知提示词不是越短越好也不是越长越好而是信息密度要够。所谓信息密度就是每一个词都在给模型提供有效的约束。像“美丽的”“好看的”这种词对模型来说几乎是噪声因为它没有具体的视觉指向。而“逆光轮廓”“低角度跟拍”“裙摆被风吹起”这种词每一个都在缩小模型的搜索空间。1.2 不同工具对提示词的“理解方式”差异MiniMax、可灵、Runway、ComfyUI 这几个工具虽然都叫文生视频但它们对提示词的解析逻辑差别很大。这个差别直接决定了你写提示词的策略。MiniMax 和可灵属于云端闭源模型它们的提示词解析更偏向“自然语言理解”。你写一段流畅的描述它能抓住重点。这类工具通常对中文支持很好你不需要刻意翻译成英文直接用中文写就行。但它们对“镜头语言”的敏感度相对低一些你写“推拉摇移”它不一定能精确执行更多是靠语义联想。Runway 属于英文优先的云端模型它的提示词解析更偏向“关键词匹配语义组合”。你用英文写效果通常比中文好。而且 Runway 对镜头术语的响应比较积极像 “dolly in”“pan left”“tracking shot” 这类词它是有专门训练的。ComfyUI 则完全是另一套逻辑。它本身不是模型而是一个节点式工作流引擎。你在 ComfyUI 里写提示词实际上是在给某个具体的视频生成模型比如 MiniMax H3、SVD、AnimateDiff 等写输入。这意味着提示词的写法取决于你加载的是哪个模型。同一个 ComfyUI 工作流换一个模型节点提示词的风格可能就要跟着变。提示如果你刚开始接触文生视频建议先用 MiniMax 或可灵这类云端工具练手把“画面描述”的基本功打好再去折腾 ComfyUI 的本地工作流。反过来先搞 ComfyUI很容易被节点和参数淹没反而忽略了提示词本身的质量。1.3 提示词的基本结构五段式写法基于上面说的五个维度我总结了一个比较通用的提示词结构叫“五段式写法”。这个结构在 MiniMax、可灵、Runway 上都验证过效果稳定。第一段主体描述。画面里最重要的那个东西是什么人、动物、物体、场景要具体到颜色、材质、外观特征。比如“一只橘色的短毛猫”就比“一只猫”好“一只橘色的短毛猫左耳有一个小缺口”就更精确。第二段动作与交互。主体在做什么它和周围环境怎么互动比如“猫从窗台上跳下来落地时前爪先着地尾巴向上翘起”。动作要具体到身体部位和运动方向。第三段环境与背景。场景是什么样的光线从哪来天气如何比如“午后阳光从左侧窗户斜射进来窗台上有一盆绿萝背景是模糊的书架”。第四段镜头与构图。摄影机怎么拍景别、角度、运动方式。比如“中景平视角度镜头缓慢向右平移”。第五段风格与画质。整体是什么调性电影感、动画感、纪录片感比如“电影级调色浅景深35mm 胶片质感”。这五段不是必须严格按顺序写但逻辑上要覆盖到。你可以把它们揉成一段流畅的话也可以分段写。实测下来分段写在 ComfyUI 里效果更稳定因为很多工作流会把正面提示词和负面提示词分开处理分段写方便你调整权重。2. 核心细节解析与实操要点2.1 主体描述越具体越可控主体描述是提示词的地基。地基没打好后面镜头和风格写得再花哨也没用。我见过太多人写“一个美女在跳舞”然后抱怨出来的视频脸崩、手崩、动作诡异。问题不在模型在提示词太模糊。具体到什么程度我给你一个参考标准如果你把这段描述给一个画师他能不能在不问你的情况下画出符合你预期的画面如果能说明描述够具体了如果不能说明还有模糊地带。拿“一个美女在跳舞”来说画师肯定会问你什么风格的美女穿什么衣服跳什么舞在哪儿跳光线怎么样镜头从哪拍这些问题就是你需要写进提示词里的东西。改写一下“一个二十岁出头的亚洲女性黑色长发扎成高马尾穿红色运动背心和黑色紧身裤在木质地板的工作室里跳街舞动作利落有力手臂和腿部线条清晰可见汗水在灯光下微微反光。”这个描述就具体多了模型能抓住的信息量完全不一样。还有一个技巧用“特征锚点”来稳定主体。所谓特征锚点就是主体身上最独特、最容易识别的那个特征。比如“左耳有一个小缺口”“戴着一副圆框金丝眼镜”“穿着一件印有白色字母的黑色卫衣”。这些锚点能帮助模型在每一帧里保持主体的一致性减少“变脸”的概率。在 ComfyUI 里如果你用的是 MiniMax H3 这类模型主体描述还可以配合参考图来用。也就是所谓的“参考生视频”。这时候提示词里的主体描述要和参考图保持一致否则模型会困惑到底听文字的还是听图片的我的经验是参考图负责“长相”提示词负责“动作和场景”分工明确效果最好。2.2 动作描述动词的选择决定成败动作描述是文生视频里最容易翻车的部分。因为视频和图片最大的区别就是“动”而模型对动作的理解往往很粗糙。先说什么样的动词不能用。“跳舞”“跑步”“打斗”这种大词模型很难精确执行。它知道你在说一个动作类别但不知道具体怎么做。出来的结果往往是“看起来像在跳舞但说不上哪里怪”。那用什么动词用分解动作用身体部位的动词。比如不说“跳舞”说“右脚向前迈一步重心下沉左臂向上抬起手腕翻转”。不说“跑步”说“双腿交替蹬地手臂前后摆动身体微微前倾”。这里有个实操技巧动作描述要遵循“时间顺序”。模型对时间序列的理解是按你写的顺序来的。你先写“抬起右手”再写“转身”它就会先抬手再转身。如果你反过来写它可能就同时做了或者顺序乱了。还有一个坑动作幅度要合理。你写“跳起来三米高”模型要么做不到要么做出来像弹簧。你写“微微抬头”它可能抬得太多。我的经验是动作幅度用“轻微”“缓慢”“大幅度”这类程度词来修饰比用具体数字更稳。在可灵和 MiniMax 上动作描述的响应比较好因为它们的中文语义理解能力强。在 Runway 上动作描述建议用英文而且要用简单句一个句子一个动作不要用从句套从句。2.3 镜头语言让模型知道“怎么拍”镜头语言是区分“业余”和“专业”提示词的分水岭。很多人写提示词只写画面内容不写镜头出来的视频就像监控录像——内容都对但毫无美感。镜头语言主要包含四个维度景别、角度、运动、焦段。景别就是画面里主体占多大。远景、全景、中景、近景、特写。这个直接决定了观众和主体的距离感。比如你想表现“孤独”用远景人在画面里很小你想表现“紧张”用特写只拍眼睛或手。角度就是摄影机从哪个方向拍。平视、俯视、仰视、斜角。俯视让人显得渺小仰视让人显得高大斜角增加动感。运动就是摄影机怎么动。推、拉、摇、移、跟、升降。推是靠近拉是远离摇是原地转头移是平移跟是跟着主体走升降是上下移动。焦段就是广角还是长焦。广角视野大有透视变形长焦视野窄有压缩感背景虚化强。在提示词里你不需要把这四个维度都写全但至少要写清楚景别和运动。比如“中景镜头缓慢推进”就比什么都不写强很多。注意不同工具对镜头术语的识别能力不一样。MiniMax 和可灵对“推拉摇移”的识别还可以但不如 Runway 精确。Runway 对 “dolly in”“pan left”“tracking shot” 这类英文术语响应很好。ComfyUI 里则取决于你用的模型节点有些模型节点有专门的镜头控制参数提示词里写不写镜头术语影响不大。2.4 风格与画质最后的“调色盘”风格与画质是提示词的最后一段但它的作用不容小觑。同样的画面内容和镜头加上不同的风格词出来的感觉完全不一样。风格词主要分几类艺术风格油画、水彩、赛博朋克、蒸汽波、媒介风格胶片、数码、VHS、监控录像、导演风格诺兰式、韦斯·安德森式、宫崎骏式、画质描述4K、8K、超高清、电影级调色。这里有个坑风格词不要堆太多。你写“赛博朋克蒸汽波油画胶片”模型会懵出来的东西四不像。选一个主风格最多加一个辅助风格就够了。画质描述也要适度。“4K”“8K”这种词在有些模型上会触发过度锐化反而显得假。我的经验是用“电影级调色”“浅景深”“自然光”这类描述性词汇比单纯堆分辨率数字更有效。在 ComfyUI 里风格词还可以通过 LoRA 来强化。比如你加载一个“胶片风格 LoRA”提示词里再写“胶片质感”两者叠加效果更明显。但要注意 LoRA 的权重不要调太高否则会覆盖掉其他信息。3. 实操过程与核心环节实现3.1 从零写一条完整提示词分步拆解光说理论没用我带你走一遍完整的实操流程。假设我们要生成一段“一个男人在雨夜街头抽烟”的视频。第一步确定主体。男人三十岁左右穿深色风衣短发胡茬明显。手里夹着一支烟烟头有火光。第二步确定动作。他站在街边微微低头把烟送到嘴边吸一口然后缓缓吐出烟雾。烟雾在雨中散开。第三步确定环境。夜晚下雨街道湿漉漉的地面有积水反射霓虹灯光。背景是模糊的店铺招牌暖黄色和冷蓝色交织。第四步确定镜头。中近景平视角度镜头从侧面拍缓慢向前推进。景深较浅背景虚化。第五步确定风格。电影感黑色电影风格高对比度冷色调为主暖色点缀。胶片颗粒感。把这五步揉成一段完整的提示词“一个三十岁左右的男人穿深色风衣短发胡茬明显站在雨夜的街边。他微微低头把烟送到嘴边吸一口缓缓吐出烟雾烟雾在雨中散开。夜晚下雨街道湿漉漉的地面积水反射着霓虹灯光背景是模糊的店铺招牌暖黄色和冷蓝色交织。中近景平视角度侧面拍摄镜头缓慢向前推进浅景深背景虚化。电影感黑色电影风格高对比度冷色调为主暖色点缀胶片颗粒感。”这条提示词大概 150 字左右信息密度足够五个维度都覆盖到了。在 MiniMax 和可灵上实测出片率比较高。3.2 在 ComfyUI 里搭建文生视频工作流ComfyUI 的工作流搭建是另一个维度的操作。很多人卡在“装好了但不知道怎么连节点”这一步。我梳理一下核心流程。第一步安装 ComfyUI。如果你不想手动配环境可以用秋叶整合包。秋叶整合包的好处是依赖都打包好了解压就能用。下载之后解压到一个非中文路径的文件夹双击运行脚本等它自动打开浏览器界面就行。第二步安装视频生成节点。ComfyUI 本身不带视频生成能力你需要装对应的节点插件。比如你想用 MiniMax H3就要装 MiniMax 的 ComfyUI 节点。通过 ComfyUI Manager 搜索安装是最方便的方式。Manager 里搜 “MiniMax”找到对应的节点包点安装重启 ComfyUI。第三步下载模型。模型文件通常比较大几个 GB 到十几个 GB 不等。下载之后放到 ComfyUI 的 models 文件夹对应子目录里。具体放哪个子目录看节点说明。一般是models/checkpoints或models/diffusion_models。第四步搭建工作流。核心节点包括模型加载节点、文本编码节点正面提示词和负面提示词、视频生成节点、视频保存节点。把这些节点拖到画布上用连线连起来。模型加载节点的输出连到视频生成节点的模型输入文本编码节点的输出连到视频生成节点的条件输入视频生成节点的输出连到保存节点。第五步填写提示词和参数。在文本编码节点里填提示词。参数方面视频长度、帧率、分辨率、采样步数、CFG 值这些都要设。视频长度一般 2-4 秒起步帧率 8-16 帧分辨率 512x512 或 768x768 起步。采样步数 20-30CFG 7-12。第六步运行。点运行按钮等进度条走完。第一次运行会比较慢因为要加载模型。如果爆显存就降低分辨率或视频长度。提示ComfyUI 生成视频时爆内存是常见问题。除了降低分辨率还可以在启动脚本里加--lowvram或--medvram参数。另外关掉其他占显存的程序也有帮助。3.3 参数计算与选择显存、分辨率、帧数的三角关系ComfyUI 本地部署最头疼的就是显存不够。视频生成比图片生成吃显存得多因为要同时处理多帧。这里有一个基本的计算公式显存占用 ≈ 分辨率面积 × 帧数 × 模型系数模型系数取决于你用的模型。MiniMax H3 的系数大概在 0.5-1.0 之间SVD 更高一些。假设你用 512x512 分辨率16 帧模型系数 0.8那显存占用大概是 512×512×16×0.8 ≈ 3.3GB。这还没算模型本身加载占的显存。如果你只有 8GB 显存建议从 512x512、8 帧起步。跑通了再往上加。如果爆显存优先降分辨率因为分辨率对显存的影响是平方级的。帧数的影响是线性的降帧数效果没那么明显。还有一个技巧用 MiniMax H3 的量化版。量化版模型体积更小显存占用更低画质损失在可接受范围内。比如 NVFP4 量化版显存占用能降 30%-40%。但要注意量化版可能需要特定的节点支持装之前先看说明。3.4 参考生视频的分镜写法“参考生视频”是 MiniMax H3 的一个特色功能。你给一张参考图再给一段提示词模型会基于参考图里的人物或场景来生成视频。这个功能用好了可以保持角色一致性做系列视频很方便。分镜写法的核心是参考图负责“是谁”提示词负责“在干嘛”。提示词里不要再重复描述参考图里已经有的东西比如长相、服装。你只需要写动作、场景、镜头、风格。举个例子。你有一张参考图是一个穿红色连衣裙的女孩站在花园里。你想生成她转身微笑的视频。提示词就写“女孩缓缓转身面向镜头露出微笑。镜头从中景缓慢推进到近景。阳光从侧面打过来背景花朵微微晃动。电影感浅景深。”不要写“一个穿红色连衣裙的女孩”因为参考图已经告诉模型了。你重复写反而可能让模型困惑到底以哪个为准还有一个细节参考图和提示词的风格要一致。如果参考图是写实风格提示词里写“动漫风格”出来的东西会很怪。模型会试图在两者之间找平衡结果两边都不像。4. 常见问题与排查技巧实录4.1 画面崩坏脸崩、手崩、肢体扭曲这是文生视频最常见的问题没有之一。原因通常有三个提示词太模糊、模型能力不够、参数设置不当。排查思路先看提示词里有没有具体描述主体的外观特征。如果只写“一个人”模型就自由发挥脸崩的概率很高。加上“亚洲女性黑色长发圆脸戴眼镜”这类描述崩的概率会降低。如果提示词没问题那就是模型能力问题。有些模型在人脸和手部细节上就是弱项。这时候可以试试换模型或者在 ComfyUI 里加一个面部修复节点。参数方面CFG 值太高会导致画面过饱和、崩坏。试试把 CFG 从 12 降到 7-9。采样步数太低也会导致画面粗糙提到 25-30 试试。4.2 动作不自然像幻灯片、像鬼畜动作不自然通常是因为帧数太低或提示词里的动作描述太笼统。帧数低于 8 帧看起来就像幻灯片。提到 12-16 帧会好很多。提示词方面把“跳舞”改成具体的身体部位动作比如“左臂抬起右腿向前迈一步身体微微旋转”。模型对具体动作的响应比笼统动作好得多。还有一个原因视频长度太长。有些模型在生成超过 4 秒的视频时后半段动作会开始重复或扭曲。试试缩短到 2-3 秒或者分段生成再拼接。4.3 ComfyUI 报错CLIP 不匹配、节点缺失、爆显存ComfyUI 的报错信息有时候很晦涩我整理了几个常见的。CLIP 不匹配通常是因为你下载的模型和节点要求的 CLIP 版本不一致。比如 MiniMax H3 量化版 clip5120 与 4096 不匹配的问题解决办法是下载对应版本的 CLIP 模型放到正确的目录里。或者换一个节点版本。节点缺失打开工作流时提示某个节点是红色的说明你没装对应的插件。通过 ComfyUI Manager 搜索缺失的节点包名安装后重启。爆显存前面说过降分辨率、降帧数、加--lowvram参数。还有一个技巧是关掉 ComfyUI 的预览功能减少显存占用。生成到一半卡住可能是模型文件损坏重新下载。也可能是硬盘空间不足清理一下。4.4 常见问题速查表问题现象可能原因解决办法脸崩、手崩提示词太模糊加具体外观描述动作像幻灯片帧数太低提到 12-16 帧动作鬼畜视频太长缩短到 2-3 秒CLIP 不匹配模型版本不对下载对应 CLIP节点红色插件缺失Manager 安装爆显存分辨率太高降到 512x512生成卡住模型损坏重新下载画面过饱和CFG 太高降到 7-9画面粗糙步数太低提到 25-30风格四不像风格词太多只留一个主风格4.5 独家避坑技巧技巧一负面提示词不要偷懒。很多人只写正面提示词负面提示词留空。其实负面提示词对画质影响很大。常用的负面词包括模糊、变形、扭曲、多余的手指、多余的手臂、文字、水印、低画质。在 ComfyUI 里负面提示词是单独一个节点填进去就行。技巧二提示词权重可以手动调。在 ComfyUI 里用(关键词:权重)的格式来调整某个词的重要性。比如(红色连衣裙:1.3)会让红色连衣裙更突出。权重范围一般 0.5-1.5太高会崩。技巧三种子固定法。如果你生成了一条比较满意的视频想微调提示词再生成类似的可以固定种子值。这样模型会在同一个随机起点上生成变化不会太大。技巧四分段生成再拼接。对于超过 4 秒的视频与其一次性生成不如分成几段生成每段 2-3 秒然后用剪辑软件拼接。这样每段的画质和动作都更可控。技巧五参考图的质量决定参考生视频的质量。参考图越清晰、主体越突出、背景越干净生成效果越好。如果参考图本身就很糊模型也救不回来。4.6 工具选型什么场景用什么工具最后说一下工具选型。不同工具适合不同场景没有哪个是万能的。工具适合场景优势劣势MiniMax中文提示词、快速出片中文理解好、上手快镜头控制弱可灵中文提示词、人物动作动作自然、画质好排队慢Runway英文提示词、镜头控制镜头精确、风格多中文支持差ComfyUI本地部署、深度定制完全可控、免费门槛高、吃硬件我的建议是日常快速出片用 MiniMax 或可灵需要精确镜头控制用 Runway需要批量生成或深度定制用 ComfyUI。三者不冲突可以搭配使用。提示ComfyUI 的秋叶整合包更新比较频繁建议关注更新日志。有时候新版本会修复一些显存泄漏的问题或者增加对新模型的支持。但也不要盲目追新稳定版往往比最新版更可靠。4.7 关于“无违禁词”的说明网上有些人在搜“无违禁词AI视频生成软件”这个思路本身就有问题。任何正规的AI视频生成工具都有内容审核机制这是行业惯例也是为了保护用户。与其琢磨怎么绕开审核不如把精力放在提升提示词质量上。好的提示词能让模型在合规范围内生成高质量的内容这才是正道。另外有些工具对某些词汇比较敏感比如涉及暴力、血腥、成人内容的词。这些词你写了也没用模型会直接拒绝生成。所以写提示词的时候尽量用中性、描述性的语言不要用带有强烈情绪或暗示的词汇。5. 提示词进阶从“能用”到“好用”5.1 用“镜头脚本”思维写提示词当你把五段式写法练熟之后可以尝试进阶玩法用“镜头脚本”的思维来写提示词。所谓镜头脚本就是像拍电影一样把视频拆成几个镜头每个镜头单独写提示词然后分别生成最后剪辑在一起。比如你要做一个 10 秒的短片可以拆成三个镜头镜头一远景城市天际线日出镜头二中景主角站在天台边缘风吹动衣角镜头三特写主角的眼睛瞳孔里有城市的倒影。每个镜头写一条提示词分别生成 3-4 秒的视频再用剪辑软件拼接。这种做法的好处是每个镜头的画质和动作都更可控而且可以通过剪辑产生节奏感。缺点是工作量大适合对质量要求高的项目。5.2 提示词的“迭代优化”方法没有人能一次写出完美的提示词。好的提示词都是迭代出来的。我的迭代方法是每次只改一个变量。第一版生成之后看哪里不满意。如果是主体不对就改主体描述如果是动作不对就改动作描述如果是风格不对就改风格词。不要一次改好几个地方否则你分不清是哪个改动起了作用。每次改完之后记录下改动内容和生成结果。积累多了你就有了自己的“提示词-效果”对照表下次写类似场景的时候可以直接参考。5.3 跨工具提示词迁移的注意事项有时候你在 MiniMax 上写了一条很好的提示词想搬到 Runway 上用。直接复制粘贴通常效果不好因为两个工具的解析逻辑不一样。迁移的时候要注意几点第一语言要换。MiniMax 用中文Runway 用英文。第二镜头术语要换。MiniMax 写“镜头推进”Runway 写 “dolly in”。第三风格词要调整。有些风格词在 A 工具上有效在 B 工具上可能没反应。第四长度要调整。Runway 对长提示词的解析不如 MiniMax 稳定可能需要精简。我的经验是跨工具迁移提示词不要指望一次成功。先迁移核心的主体和动作描述镜头和风格词根据目标工具的特点重新写。生成一版看看效果再微调。5.4 关于 MiniMax H3 在 ComfyUI 里的显存优化MiniMax H3 在 ComfyUI 里跑显存占用是大家最关心的问题。除了前面说的量化版和低分辨率还有几个技巧。技巧一用--lowvram启动。这个参数会让 ComfyUI 把模型分块加载显存占用能降不少但生成速度会慢一些。技巧二关掉不必要的节点。有些工作流里带了预览节点、对比节点这些都会占显存。生成的时候可以先把它们禁用。技巧三用 CPU 卸载。有些节点支持把部分计算放到 CPU 上虽然慢但能跑起来。在节点设置里找 “CPU offload” 选项。技巧四分批生成。不要一次性生成太长的视频。分成几段每段 2 秒生成完再拼接。这样每段的显存占用都在可控范围内。技巧五提高显存占用率。这个听起来反直觉但有时候显存没跑满反而效率低。如果你显存够用可以适当提高分辨率或帧数让 GPU 跑满生成速度反而更快。具体怎么调看你的显卡型号和显存大小。5.5 关于“导演台全能工作流”的实践网上有人分享“MiniMax H3 导演台全能工作流”这个工作流把文生视频、图生视频、参考生视频整合在一起还带了镜头控制和风格预设。我用过一段时间说说体会。这个工作流的优点是集成度高不用自己连节点打开就能用。缺点是节点多显存占用大8GB 显存跑起来比较吃力。而且预设的风格不一定符合你的需求还是要自己调提示词。我的建议是如果你刚开始玩 ComfyUI可以先从这个工作流入门熟悉一下视频生成的流程。等你摸清楚了每个节点的作用再根据自己的需求搭建精简版的工作流。不要一上来就追求“全能”先把一个场景跑通再说。5.6 提示词写作的常见误区最后说几个我踩过的坑希望能帮你少走弯路。误区一提示词越长越好。不是。长度不等于信息密度。一堆形容词堆在一起模型反而抓不住重点。该具体的地方具体该简洁的地方简洁。误区二照搬别人的提示词。别人的提示词是在别人的工具、别人的参数下调出来的。你直接拿来用效果可能差很远。参考可以但一定要根据自己的情况调整。误区三忽略负面提示词。负面提示词对画质的影响很大尤其是消除畸形和多余肢体。不要偷懒。误区四不记录不总结。每次生成的结果不管好坏都值得记录。好的提示词是怎么写出来的坏的提示词问题在哪积累多了就是你的经验库。误区五只用一个工具。不同工具有不同优势。MiniMax 中文好Runway 镜头准ComfyUI 可控性强。根据场景切换工具效率更高。我在实际使用中的体会是文生视频的提示词写作三分靠技巧七分靠练习。你看再多教程不动手写几十条提示词是找不到感觉的。所以别光看打开工具写起来。第一条可能很烂第十条可能还是烂但第三十条的时候你会发现自己已经能稳定产出可用的视频了。这个过程中积累的手感才是真正属于你的东西。