
今天给大家演示一个基于 Qwen Image Edit 的人像一致性写真修图工作流,这个流程通过多模型协同、自动化场景描述生成、精细化条件编码和高质量采样,让原始人像在保持面部特征稳定的前提下,实现连续、多镜头、自然衔接的动态写真效果。整个流程围绕输入照片展开,从图像分析、动作延展、场景重建到最终画面生成,都做到连贯顺滑,适合需要大量一致性输出的人像创作场景。文章目录工作流介绍核心模型Node 节点工作流程大模型应用AILab_QwenVL 图像理解与动态场景生成节点TextEncodeQwenImageEditPlus 文本条件编码节点使用方法应用场景开发与应用工作流介绍这个工作流围绕 Qwen 系列视觉模型构建,核心目标是从单张输入人像图像出发,通过大模型对画面进行深度理解,再生成连续的“下一秒动作场景”提示词,并驱动图像编辑模型生成高一致性的新画面。在结构上,工作流使用了 UNET、CLIP、VAE 作为基础模型组件,配合两个 LoRA 进行风格和镜头强化,再经过 AuraFlow 采样修正和 CFG 归一化保证输出的稳定性。节点上,包括图像加载、纵横比控制、视觉理解、文本拆分、条件编码、采样、解码和最终保存等环节,形成完整的生产路径。综合来看,它是一套面向人像一致性编辑的高自动化工作流,为摄影级别的动态写真创作提供了清晰、高效的解决方案。核心模型整个工作流依靠多模型协同来保持人物一致性、镜头逻辑和最终画面的自然过渡。UNET 提供图像编辑核心能力,CLIP 负责图像与文本的双向理解,VAE 用来压缩与还原潜空间图像,LoRA 承担风格强化与镜头语义补充,而 AuraFlow 与 CFGNorm 则用于优化采样质量与一致性。这些模型组合在一起,使工作流能从输入图像中精确提取人物信息,再根据生成的下一场景提示词重建整体画面。模型名称说明UNETLoader(qwen_image_e