ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ComfyUI-LTXVideo LTX-2.5 蒸馏工作流实战指南:九张图的选型、配置与原理剖析

ComfyUI-LTXVideo LTX-2.5 蒸馏工作流实战指南:九张图的选型、配置与原理剖析 人工智能大模型AI 应用媒体生成本地部署【免费下载链接】ComfyUI-LTXVideoLTX-Video Support for ComfyUI项目地址https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideo点击查看免费下载LTX-2.5 是 LTX 系列中首个以蒸馏模型为主打的视频生成版本本仓库 example_workflows/2.5/ 下收录的 9 张官方示例工作流全部基于蒸馏主干搭建统一遵循加载模型 → 设置输入 → 预处理 → 采样 → 解码的同一子图布局。本文以 example_workflows/2.5/README.md 为骨架逐张拆解 9 个工作流的能力边界、输入输出与模型依赖并结合工作流 JSON 内部的节点注释MarkdownNote与仓库源码如 easy_samplers.py还原参数的真实含义与底层机制帮助你读完即可上手运行、按需选型并学会通过调整解码分块来适配自己的显存。工作流家族概览统一布局与蒸馏主干所有 2.5 工作流共享同一套子图布局因此切换文件不需要重新学习图结构加载模型由统一的模型加载子图节点一次性载入扩散模型、视频 VAE、音频 VAE、文本编码器与空间上采样器设置输入左侧 Inputs 区域填写提示词、可选首帧图片、帧率与时长以及各图特有的输入音频、参考视频、参考图等预处理把输入编码为 latent构建空视频/音频 latent注入 IC-LoRA 引导等采样执行蒸馏采样两级图还会追加 2× 空间上采样与精修采样解码用分块 VAE 解码出视频并混入音频后保存。所有工作流都使用同一个蒸馏 Transformer 权重ltx-2.5-22b-distilled-transformer-bf16.safetensors只需很少的采样步数适合快速迭代。两级Two-Stage图会额外做一次 2× 空间上采样并追加一段短的精修采样单级Single-Stage图则跳过该阶段更轻更快。显存提示图中默认值是为较低显存机器调校的。如果你的显存更充裕可以增大解码分块尺寸每张图内的 Decode 注释都有说明更少、更大的分块运行更快但需要更多显存。快速上手从打开 ComfyUI 到产出第一个视频以下步骤假设 ComfyUI 已安装完成安装方式见 ComfyUI 官方下载页、LTX 官方 ComfyUI 集成指南与系统要求文档。打开 ComfyUI。加载工作流通过Workflow → Open选择本文件夹下的.json文件或将文件直接拖拽到画布上。ComfyUI 内置的Templates搜索中同样有LTX-2.5系列模板属于同一族图可作为替代入口。打开 Workflow Overview 面板首次使用时它会列出Missing Models缺失的模型。点击 Download all一键把缺失权重下载到ComfyUI/models/的正确子目录。这一步只需做一次之后的运行都会复用。填写左侧 Inputs提示词、可选图片、时长以及该图要求的其他输入如音频或参考视频。点击 Run开始生成。如需手动下载权重每张图的Model Links注释都会列出其确切需要的文件包括 IC-LoRA 权重。首次下载时注意Hugging Face 仓库需要先点击Agree and Access同意协议才能下载。帧数与时长约束务必牢记帧数必须是1 8 的倍数。图内的时长是由fps × 秒数换算而来的最终帧数会按上述约束就近取整因此实际时长与你输入的数字可能有轻微偏差。这一约束贯穿所有 2.5 工作流也是预处理阶段构建 latent 的底层逻辑。工作流详解一四张生成类工作流工作流功能LTX-2.5_T2V_I2V_Two_Stage_Distilled.json推荐起点。文生视频可选首帧图片。第一级在基础分辨率生成做 2× 空间上采样再进行 3 步精修。视频与音频一起生成。LTX-2.5_T2V_I2V_Single_Stage_Distilled.json相同的文本/图片输入只做一次蒸馏采样无上采样。更快更轻空间细节低于两级版。LTX-2.5_A2V_Two_Stage_Distilled.json音频生视频Audio-to-Video。编码输入片段可设置开始时间与时长裁剪在两个阶段都冻结这些音频 token并把原始波形直接混入输出不做音频解码。可选首帧图片。LTX-2.5_T2A_Single_Stage_Distilled.json纯文生音频Text-to-Audio。不含视频 VAE 与上采样器。T2V / I2V Two-Stage默认生成的完整链路这是官方推荐的入门图。从其 JSON 中的 MarkdownNote 可以看到清晰的分区Inputs正片提示词可开启enhance positive prompt先重写为更完整的描述负面提示词按原样使用、从不增强填写LTX API key后会改为通过 API 编码并增强提示词以节省内存工作流检测到 key 就自动切换无需手动 bypass图像输入需加载图片并打开use image input。Preprocess通过video width / video height调整输出分辨率若提供了首帧图片可用img_strength与img_compression调节输入图像的条件强度。Generate - stage 1对蒸馏模型做8 步扩散采样可改 noise seed、guider cfg视频与音频共用以及采样器默认euler_ancestralseed 42。Generate - stage 2把第一级结果在宽高两个维度各放大 2 倍对输入 latent 加噪后再跑3 步扩散精修默认euler若提供了首帧图片会在此再次用于条件注入。Decode对视频 latent 与音频 latent 联合解码输出 VIDEO 后由 Save Video 节点保存。A2V Two-Stage音频驱动的关键机制音频是必填输入。audio start与duration会先裁剪音频再编码同样的 duration 也决定视频长度同样受18 的倍数约束。原裁剪波形最终被mux 进输出视频——音频从不通过 latent 解码生成。预处理阶段用音频 VAE 编码音频后将其冻结noise mask 0因此两个生成阶段都不会对音频 token 加噪第二级上采样时再次拼接并冻结的是原始冻结音频 token而非第一级的音频输出。工作流详解二五张 IC-LoRA 控制与编辑工作流这类图保留蒸馏 2.5 主干额外挂载一个 IC-LoRA用引导信号视频、图片 sheet、轨迹、掩码等来牵引生成。工作流功能LTX-2.5_ICLoRA_Union_Control_Distilled.json以参考片段的depth / canny / pose标注器做视频到视频。默认接 depth可在图内切换标注器。LTX-2.5_V2V_ICLoRA_Single_Stage_Distilled.json把源视频帧直接作为 IC-LoRA 引导做视频到视频。默认内置Instant ShaveLoRA 作为示例可换成其他身份/编辑 LoRA。原始音频全程冻结。LTX-2.5_ICLoRA_Ingredients_Single_Stage_Distilled.json依据参考图 sheet角色、道具、服装、场景在一张图中排布生成。提示词按图上的位置描述每个元素。LTX-2.5_ICLoRA_Motion_Track_Distilled.json图生视频使用你在首帧上绘制的稀疏运动轨迹sparse motion tracks控制运动可选静帧作为开场帧。LTX-2.5_ICLoRA_Inpaint_Two_Stage_Distilled.json填充参考视频的掩码区域两阶段。源音频可保持冻结。LTX-2.5_ICLoRA_Outpaint_Two_Stage_Distilled.json扩展参考视频的画布两阶段。与 inpaint 使用同一个输入输出 LoRA。Union Control标注器如何切换从 LTX-2.5_ICLoRA_Union_Control_Distilled.json 的注释可知参考视频由标注器转为引导信号默认接DepthVideoDepthAnything。切换方法把CannyCannyEdgePreprocessor或PoseDWPreprocessor的输出接到scale-to-multipleResize 节点的input替代 Depth 输出即可。三个标注器都读取同一份缩放后的参考帧只有接进该 Resize 的那个会被使用。Motion Track轨迹绘制与预览Motion Track 图在预处理阶段用LTXVDrawTracks把稀疏轨迹绘制成引导视频尺寸与缩放后的输入图片一致再通过LTXAddVideoICLoRAGuide注入 IC-LoRA同时构建同尺寸、同帧数的空音视频 latent并把输入图片作为开场帧条件。采样结束后用LTXVCropGuides把引导帧裁掉只解码生成的视频。图中会输出一份tracks_preview绘制好的引导图与结果一同保存方便在长时间运行前先确认运动轨迹是否符合预期。如何选择工作流官方决策树原文档给出了一套自顶向下的决策逻辑几乎覆盖所有常见需求Do you only need audio (no picture)? ├─ YES → LTX-2.5_T2A_Single_Stage_Distilled.json │ Do you have an audio file the video should follow? ├─ YES → LTX-2.5_A2V_Two_Stage_Distilled.json │ (optional still as the first frame) │ Do you have an existing video to edit or follow? ├─ YES → What kind of control? │ ├─ Depth / edges / pose from the clip │ │ → LTX-2.5_ICLoRA_Union_Control_Distilled.json │ ├─ Keep the footage, change appearance (identity / style LoRA) │ │ → LTX-2.5_V2V_ICLoRA_Single_Stage_Distilled.json │ ├─ Fill a masked region │ │ → LTX-2.5_ICLoRA_Inpaint_Two_Stage_Distilled.json │ └─ Grow the frame / canvas │ → LTX-2.5_ICLoRA_Outpaint_Two_Stage_Distilled.json │ Do you have stills rather than a video? ├─ YES → A sheet of characters / props / locations? │ ├─ YES → LTX-2.5_ICLoRA_Ingredients_Single_Stage_Distilled.json │ └─ NO → Draw motion paths on a first frame? │ ├─ YES → LTX-2.5_ICLoRA_Motion_Track_Distilled.json │ └─ NO → Text-to-video with an optional opening still │ (see below) │ Text-to-video (optional image)? ├─ Want 2× spatial upscale and a refine pass? │ └─ YES → LTX-2.5_T2V_I2V_Two_Stage_Distilled.json (recommended) └─ Want the fastest / lightest run? └─ YES → LTX-2.5_T2V_I2V_Single_Stage_Distilled.json结论追求空间细节时两阶段是更好的默认选择单阶段适合快速预览和更紧的显存预算。工作流对比总表工作流阶段数上采样主要条件输入最适合T2V / I2V two-stage22× 空间文本 可选图片默认生成T2V / I2V single-stage1—文本 可选图片快速预览A2V two-stage22× 空间音频冻结 可选图片需要贴合音轨的视频T2A single-stage1—文本纯音频片段Union Control1—参考视频depth / canny / pose跟随结构的视频到视频V2V IC-LoRA1—源视频 冻结音频现有素材的外观编辑Ingredients1—参考图 sheet单图生成角色/道具/场景Motion Track1—图片 手绘轨迹从静帧做定向运动Inpaint two-stage22× 空间视频 掩码 冻结音频替换某个区域Outpaint two-stage22× 空间视频 目标尺寸 冻结音频扩展画面解码分块Decode Tiling显存与速度的调节阀每张图内置的 Decode 注释都给出了同一套推荐设置按照更少、更大的分块运行更快但更耗显存的原则选择。原文档特别强调默认值面向低显存机器显存更充裕时增大分块尺寸即可提速。图内表格给出的是节点设置像素与解析后 latent 几何的对应关系节点设置像素解析后的 latent 几何512 / 64 / 128 / 3216×16, ov 216f, ov 4768 / 192 / 128 / 3224×24, ov 616f, ov 41024 / 256 / 128 / 4832×32, ov 816f, ov 61536 / 384 / 192 / 4848×48, ov 1224f, ov 6768 / 192 / spatial-only24×24, ov 6无时间维切分在 LTX-2.5_T2V_I2V_Two_Stage_Distilled.json 的解码节点中默认值即fps 30 / 8 / 512 / 64 / 128 / 32这一档。仓库侧对应的底层实现是 tiled_vae_decode.py 中的LTXVTiledVAEDecode与 tiled_sampler.py 中的LTXVTiledSampler负责把大尺寸视频 latent 拆块解码以可控显存换完整输出。模型依赖与存放目录各工作流 JSON 的Model Links注释均列明所需权重与落盘位置。以 T2V/I2V Two-Stage 为例完整清单如下蒸馏扩散模型ltx-2.5-22b-distilled-transformer-bf16.safetensors→models/diffusion_models/音频 VAEltx-2.5-audio-vae-bf16.safetensors→models/vae/视频 VAE二选一ltx-2.5-video-vae-bf16.safetensors扩散解码器画质最佳ltx-2.5-video-vae-conv-bf16.safetensors卷积解码器更低内存、更快空间上采样器ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors→models/latent_upscale_models/两级图必需文本编码器gemma4-12b-with-proj-ltx-2.5-bf16.safetensors→models/text_encoders/文本增强器gemma4_e2b_it_bf16.safetensors→models/text_encoders/IC-LoRA 系列图在此基础上追加各自的 LoRA 权重例如 Union Control 使用ltx-2.3-22b-ic-lora-union-control-ref0.5.safetensors、Motion Track 使用ltx-2.3-22b-ic-lora-motion-track-control-ref0.5.safetensors均放入models/loras/。这些下载元数据文件名、URL、目标目录直接内嵌在工作流 JSON 的模型加载子图properties.models数组中这也是 Workflow Overview 面板能一键Download all的原因。源码视角采样与引导节点的底层支撑上述工作流中的大部分采样、引导与 latent 操作节点都对应本仓库的自定义节点实现入口统一注册在init.py 的NODE_CLASS_MAPPINGS中。几个与 2.5 工作流强相关的实现easy_samplers.py 中的LTXVBaseSampler定义宽度/高度默认 768×512步长 32、帧数默认 97步长 8与18 的倍数约束一致、guider、sampler、sigmas、noise 等输入并支持可选条件图片、条件强度默认 0.9与 crop/crf/blur 预处理参数工作流第一级的 8 步蒸馏采样正是这类节点的实例。guiders/multimodal_guider.py 与 guiders/parameters.py实现视频与音频共享同一 cfg 的 multimodal guider对应图中guider cfg 同时用于视频和音频的说明。iclora.py 中的LTXAddVideoICLoRAGuide/LTXAddVideoICLoRAGuideAdvanced/LTXICLoRALoaderModelOnlyIC-LoRA 注入链路A2V 图还用到 latents.py 的LTXVSetVideoLatentNoiseMasks来冻结音频 token。sparse_tracks.py 中的LTXVDrawTracks/LTXVSparseTrackEditor与 web/js/sparse_track_editor.js实现首帧轨迹的绘制、预览与编辑器交互对应 Motion Track 工作流。tiled_vae_decode.py、tiled_sampler.py、tiled_fusion_sizes.py分别实现解码分块、分块采样与分块尺寸计算是上表推荐设置的实际执行者。实用提示汇总负面提示词永不被增强enhance positive prompt只作用于正向提示词若想完全按原文使用保持关闭即可。API key 自动接管只要在输入节点填入 LTX API key文本编码与增强就会自动切换到 API 路径以节省显存无需手动 bypass 任何节点。时长偏差是特性不是 bug由于帧数必须是18 的倍数fps × duration的换算结果会被就近取整实际时长与输入值可能略有出入规划精确时长时建议直接按帧数反推。两级图的图片条件会使用两次首帧图片在第一级作为开场条件、第二级上采样精修时再次注入保证放大后仍维持首帧一致性。A2V 的音频是原样搬运输入音频从不经过 latent 解码而是裁剪编码冻结后与原波形一起 mux 进输出因此音轨质量不受采样影响。无论你是第一次接触 LTX-2.5还是想在既有流水线中替换生成方案这 9 张工作流都遵循同一套加载 → 输入 → 预处理 → 采样 → 解码范式。记住两条主线即可快速上手追求细节选两阶段、追求速度选单阶段需要外部信号控制就选对应的 IC-LoRA 图再配合本文的解码分块建议把显存与速度调到平衡点。赞分享人工智能大模型AI 应用媒体生成本地部署【免费下载链接】ComfyUI-LTXVideoLTX-Video Support for ComfyUI项目地址https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideo点击查看免费下载相关推荐ComfyUI-LTXVideo 完全指南LTX-2 视频生成的自定义节点集与 IC-LoRA 工作流实战ComfyUI LTXVideo 完全指南LTX 2 视频生成的自定义节点集与 IC LoRA 工作流实战 ComfyUI LTXVideo 是专为 Ligh人工智能大模型AI 应用媒体生成本地部署PaddleOCR 知识蒸馏完全指南原理、配置文件解析与模型微调实战PaddleOCR 知识蒸馏完全指南原理、配置文件解析与模型微调实战 PaddleOCR 在 knowledge_distillation.md https:人工智能计算机视觉深度学习LTX-2 量化感知蒸馏QAD实战在原生 LTX 训练循环中用 Model Optimizer 融合 NVFP4 校准与知识蒸馏LTX 2 量化感知蒸馏QAD实战在原生 LTX 训练循环中用 Model Optimizer 融合 NVFP4 校准与知识蒸馏 本文基于 NVIDIA人工智能大模型模型优化模型量化模型压缩上一篇WebGPU Samples性能优化秘籍时间戳查询和渲染管线调优下一篇5分钟掌握AI桌面助手用自然语言控制电脑的革命性方案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表