ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI绘画学习路径:Midjourney与Stable Diffusion协同工作流拆解

AI绘画学习路径:Midjourney与Stable Diffusion协同工作流拆解 1. 从零拆解一套AI绘画课程MJ加SD到底该怎么学AI绘画这个词这两年火得不行但真正沉下心把Midjourney和Stable Diffusion两条线都跑通的人其实没想象中多。大部分人的状态是MJ充值了会员每天在Discord里刷图出图全靠运气SD装好了模型下载了一堆打开界面一脸懵最后只用来跑了几张默认模型的人像就再也没碰过。这套“知乎知学堂-AI绘画MJSD课程”本质上要解决的就是这个问题——把两个工具从“玩具”变成“生产力”。我接触AI绘画的时间不算短从最早MJ还在V3版本、SD还是1.4基础模型的时候就开始折腾。踩过的坑包括但不限于MJ提示词写了一长串结果出图还不如别人三个词、SD的VAE配错导致出图灰蒙蒙一片、ControlNet装了半天发现版本不兼容、LoRA训练出来效果还不如不训。这些经历让我意识到一件事AI绘画的学习路径如果不对你花的时间大部分都是在做无用功。这套课程的核心价值在于它把MJ和SD放在一起讲而不是割裂开来。很多人会问我学一个不就行了吗我的实际体会是MJ和SD解决的是完全不同的问题。MJ强在审美在线、出图快、适合做概念探索和风格尝试SD强在可控性、可定制、适合做精细化调整和批量生产。你只学MJ遇到需要精确控制构图和姿态的需求就抓瞎你只学SD前期配置和调试的时间成本会让你怀疑人生。两个配合用才是效率最高的方式。这篇文章我会从课程设计的底层逻辑出发把MJ和SD两条线的核心知识点、实操要点、常见坑点全部拆开讲一遍。不管你是完全没接触过AI绘画的新手还是已经用过一段时间但总觉得不得要领的老玩家应该都能从中找到对自己有用的东西。尤其是那些卡在“能出图但出不了好图”阶段的朋友下面这些内容可能会帮你省下不少试错时间。2. 课程整体设计与学习路径拆解2.1 为什么MJ和SD要放在一起学先说说这套课程把MJ和SD放在一起讲的逻辑。市面上很多课程要么只讲MJ要么只讲SD分开讲的好处是每个工具能讲得更深但坏处是学员学完之后不知道什么时候该用哪个。这套课程的设计思路是“先建立全局认知再深入各自细节最后做协同工作流”我觉得这个顺序是对的。MJ的定位是“快速创意验证器”。你有一个模糊的想法比如“我想要一个赛博朋克风格的城市夜景带点雨后的反射感”在MJ里你只需要输入一段描述几十秒就能拿到四张质量相当不错的候选图。这个阶段你不需要考虑分辨率、采样器、CFG这些参数MJ帮你把审美门槛降到了最低。SD的定位是“精确执行引擎”。当你在MJ里确定了大致方向之后比如选定了某一张图的构图和色调接下来需要做的是把这张图的分辨率提到4K、把人物的手部修好、把背景里多余的元素去掉、保持角色一致性生成一组图。这些需求MJ做起来很吃力但SD配合ControlNet、Inpainting、LoRA就能搞定。课程里有一个我觉得很实用的设计它不会一上来就教你装SD而是先让你在MJ里跑通“提示词-出图-筛选-迭代”这个循环。等你对AI绘画的“语言”有了感觉之后再进入SD的世界。这个顺序很重要因为SD的学习曲线陡峭如果一开始就面对一堆参数和模型很容易劝退。2.2 学习路径的四个阶段根据课程的结构和我自己的学习经验我把AI绘画的学习路径分成四个阶段第一阶段建立审美判断和提示词直觉。这个阶段的核心任务不是学会多少技巧而是培养对AI出图的“感觉”。你需要知道什么样的提示词能出什么样的效果什么样的构图是好的什么样的色彩搭配是舒服的。MJ是这个阶段最好的老师因为它的反馈足够快你可以在短时间内看到大量不同提示词的效果差异。第二阶段掌握SD的基础操作和核心参数。这个阶段开始进入“技术活”。你需要理解SD的界面布局、模型加载逻辑、采样器和步数的关系、CFG值的含义、种子和随机性的控制。这些概念听起来多但实际操作一遍就能记住。课程里会用具体的案例来演示每个参数变化对出图的影响比如同一个提示词下CFG从7调到12画面会发生什么变化。第三阶段学习ControlNet和LoRA等进阶工具。这是SD真正发挥威力的地方。ControlNet让你可以控制人物的姿态、画面的深度、边缘的线稿LoRA让你可以注入特定的风格或角色特征。课程里会讲怎么安装、怎么配置、怎么调权重以及最重要的——什么时候该用哪个ControlNet模型。第四阶段建立MJSD的协同工作流。这个阶段是把前面学的东西串起来。比如用MJ做概念探索选出满意的图之后导入SD做高清修复和细节调整或者用SD生成特定姿态的底图再导入MJ做风格化处理。课程里会给出几个完整的工作流案例从需求分析到最终出图每一步都有说明。2.3 课程适合什么样的人这套课程的内容覆盖面比较广但并不是所有人都适合。根据我的观察以下几类人学起来收益最大设计师和插画师需要快速产出概念图、素材图或者用AI辅助完成重复性高的绘图工作。自媒体创作者需要大量配图、封面图、视频素材但预算有限请不起专业插画师。产品经理和运营需要做原型图、活动海报、社交媒体素材对出图速度要求高。AI技术爱好者想深入理解扩散模型的工作原理以及如何通过参数和工具控制生成结果。如果你只是偶尔想玩一玩不想花时间学参数和配置那MJ单独用就够了SD的部分可能会让你觉得繁琐。但如果你有持续产出图像的需求或者想在这个方向上建立真正的竞争力那MJSD的组合是绕不开的。3. 核心细节解析与实操要点3.1 MJ提示词的核心结构MJ的提示词看起来简单但写好并不容易。课程里把提示词拆成了几个核心模块我结合实际使用经验重新整理了一下主体描述你要画什么。这部分要具体但不要堆砌。比如“一个穿着红色斗篷的女孩”比“一个女孩”好但“一个穿着红色斗篷、金色头发、蓝色眼睛、微笑的女孩站在森林里”就太长了MJ会抓不住重点。我的经验是主体描述控制在10-15个词以内把最核心的特征说清楚就行。风格关键词你想要什么风格。比如“cyberpunk”、“watercolor”、“oil painting”、“anime style”、“photorealistic”。这部分可以叠加但要注意风格之间的冲突。比如你同时写“anime style”和“photorealistic”MJ会困惑出来的图可能两边都不像。构图和视角比如“close-up portrait”、“wide shot”、“from above”、“low angle”。这部分对出图的影响很大但很多人会忽略。如果你想做头像就写“close-up portrait”如果你想做场景概念图就写“wide shot”或者“establishing shot”。光照和氛围比如“golden hour”、“neon lights”、“soft lighting”、“dramatic shadows”。光照是决定画面情绪的关键因素同样的主体在不同的光照下给人的感觉完全不同。参数MJ的参数包括宽高比--ar、风格化程度--s、混沌值--c等。课程里会讲每个参数的具体作用和推荐取值范围。比如--ar 16:9适合做视频封面--ar 9:16适合做手机壁纸--s 50-100适合写实风格--s 200-400适合艺术风格。注意MJ的提示词不要写否定句。你写“no cars”MJ可能会给你更多车。正确的做法是用正面描述来引导比如你想要空旷的街道就写“empty street”而不是“street without cars”。3.2 SD模型的选择和加载SD的模型体系比MJ复杂得多这也是很多人卡住的地方。课程里把模型分成了几大类基础模型Checkpoint这是SD出图的核心决定了整体的画风和能力范围。常见的有SD 1.5、SD 2.1、SDXL、以及各种社区微调版本。SD 1.5的生态最丰富ControlNet和LoRA的支持最好SDXL的出图质量更高但对显存的要求也更高。课程里建议新手从SD 1.5的某个综合型微调模型开始比如Realistic Vision或者DreamShaper这两个模型对新手比较友好出图稳定。VAE负责色彩的解码。有些基础模型内置了VAE有些需要单独加载。VAE选错了会导致出图灰蒙蒙或者色彩过饱和。课程里会讲怎么判断VAE是否匹配以及常见的VAE推荐。LoRA小型风格或角色插件。文件小、加载快、可以叠加使用。课程里会讲怎么调整LoRA的权重以及多个LoRA叠加时的注意事项。ControlNet控制网络用于精确控制构图、姿态、深度等。课程里会重点讲OpenPose、Canny、Depth、IP-Adapter这几个常用的ControlNet模型。模型下载是另一个坑点。网上有很多模型下载网站但质量参差不齐。课程里会推荐几个靠谱的来源以及怎么判断一个模型是否值得下载。我的经验是优先选下载量大、评分高、有示例图的模型下载前先看模型介绍页确认它擅长的风格和推荐的参数设置。3.3 SD核心参数的实操理解SD的参数比MJ多得多但真正需要经常调整的其实就那几个。课程里用了一个很直观的方式来讲解固定其他参数只调一个看出图的变化。采样器Sampler决定了去噪的过程。常见的采样器有Euler、Euler a、DPM 2M Karras、DPM SDE Karras等。不同采样器的出图风格和速度不同。Euler a出图有随机性适合创意探索DPM 2M Karras出图稳定适合精细控制。课程里建议新手先用DPM 2M Karras等熟悉了再尝试其他的。步数Steps去噪的迭代次数。步数太低比如10以下出图会糊步数太高比如50以上收益递减且浪费时间。课程里建议20-30步是大多数情况的甜点区。但要注意不同采样器的最佳步数不同比如DPM SDE Karras在25步左右效果就很好而Euler a可能需要30步以上。CFG Scale提示词引导强度。CFG太低比如3以下出图会偏离提示词CFG太高比如15以上出图会过饱和、出现伪影。课程里建议7-12是常用范围具体取决于模型和提示词。我的经验是写实风格用7-9艺术风格用9-12。种子Seed控制随机性。固定种子可以复现同一张图改变种子可以生成变体。课程里会讲怎么用种子来做迭代优化——比如你出了一张构图不错的图固定种子后微调提示词可以在保持构图的前提下改变细节。分辨率SD 1.5的原生分辨率是512x512SDXL是1024x1024。直接生成高分辨率图会导致画面出现重复元素或结构崩坏。正确的做法是先生成原生分辨率的图再用高清修复Hires Fix或后期放大Upscale来提升分辨率。课程里会讲高清修复的参数设置以及不同放大算法的效果对比。提示SD的出图质量和显存直接相关。6GB显存可以跑SD 1.5的512x5128GB可以跑SDXL的1024x102412GB以上可以跑高清修复和ControlNet。如果显存不够可以通过--medvram或--lowvram参数来降低显存占用但出图速度会变慢。3.4 ControlNet的实战应用ControlNet是SD从“随机出图”变成“精确控制”的关键。课程里重点讲了几个常用的ControlNet模型OpenPose提取人物的骨骼姿态。你可以用一张参考图提取姿态然后让SD生成同样姿态但不同角色和风格的图。这个在角色设计和动作参考中非常实用。Canny提取边缘线稿。适合把线稿或草图转换成完整上色的图。课程里会讲Canny的高低阈值怎么调阈值太低会保留太多细节阈值太高会丢失重要边缘。Depth提取深度信息。适合控制场景的空间关系比如前景、中景、背景的层次。Depth和Canny的区别在于Depth关注的是远近关系Canny关注的是边缘轮廓。IP-Adapter风格迁移。你可以用一张风格参考图让SD生成的新图保持同样的风格。这个在保持系列图风格一致性时特别好用。ControlNet的安装和配置是新手最容易卡住的地方。课程里会讲怎么在SD WebUI里安装ControlNet插件、怎么下载和放置模型文件、怎么调整控制权重和引导时机。我的经验是控制权重从0.5开始试太高会过度约束导致画面僵硬太低则控制效果不明显。4. 实操过程与核心环节实现4.1 从MJ到SD的完整工作流这套课程里最值钱的部分之一就是MJ和SD的协同工作流。我按照课程里的思路结合自己的实操经验整理了一个完整的流程第一步用MJ做概念探索。在MJ里输入你的初步想法生成一批候选图。这个阶段不要追求完美重点是快速看到不同方向的可能性。比如你想做一个科幻风格的角色可以在MJ里尝试不同的风格关键词组合看看哪种方向最接近你想要的。第二步筛选和确定方向。从MJ生成的图中选出构图、色调、氛围最接近你需求的几张。这时候你不需要考虑细节问题比如手部是否完美、背景是否有瑕疵这些后面用SD来修。第三步把MJ的图导入SD做高清修复。把选中的MJ图作为底图在SD里用Img2Img模式做高清修复。这里的关键参数是去噪强度Denoising Strength太低比如0.2以下变化不大太高比如0.6以上会改变原图太多。课程里建议0.3-0.5是常用范围。第四步用ControlNet做精确调整。如果需要保持原图的构图但改变风格可以用Canny或Depth提取结构信息然后配合新的提示词生成。如果需要调整人物的姿态可以用OpenPose提取骨骼然后重新生成。第五步用Inpainting修细节。对于手部、眼睛、饰品等细节问题用Inpainting局部重绘。课程里会讲怎么画蒙版、怎么设置重绘区域和提示词。第六步用LoRA注入特定风格。如果你需要保持某个特定的画风可以加载对应的LoRA调整权重到合适的位置。课程里会讲怎么测试LoRA的最佳权重——从0.3开始每次加0.1看出图风格的变化。第七步最终放大和输出。用Ultimate SD Upscale或ESRGAN等放大算法把图提到目标分辨率。课程里会讲不同放大算法的适用场景以及怎么避免放大后出现伪影。4.2 参数计算与选择过程在SD里调参数很多人是凭感觉试但课程里给了一套更系统的方法。我以高清修复为例讲一下参数选择的逻辑假设你用SD 1.5生成了一张512x512的图现在想放大到1024x1024。高清修复的放大倍数设为2放大算法选R-ESRGAN 4x去噪强度设为0.4。这个组合的逻辑是放大倍数2倍512到1024刚好是SD 1.5原生分辨率的2倍不会引入太多伪影。R-ESRGAN 4x这个算法在放大同时能补充细节适合写实风格。去噪强度0.4保留原图的大部分结构同时让SD补充细节。如果设0.2细节补充不够如果设0.6原图结构会被改变太多。再比如CFG Scale的选择。假设你的提示词是“a portrait of a woman, soft lighting, detailed skin”模型是Realistic Vision。CFG设7出图自然但可能不够贴近提示词CFG设12出图更贴近提示词但可能过饱和。课程里建议先设9然后根据出图效果微调。如果画面太灰加1-2如果画面太艳减1-2。4.3 实操现场记录一次完整的出图过程我按照课程里的流程完整跑了一遍从MJ到SD的出图过程记录如下需求生成一张赛博朋克风格的城市夜景图用于视频封面分辨率1920x1080。MJ阶段在MJ里输入提示词“cyberpunk city at night, neon lights, rain, reflections, wide shot, cinematic lighting --ar 16:9 --s 250”。生成了四张候选图选了一张构图最满意的——画面中央是一条街道两侧是高楼霓虹灯倒映在湿漉漉的地面上。SD阶段把MJ的图导入SD的Img2Img模型选Realistic VisionVAE选vae-ft-mse-840000。去噪强度设0.35采样器DPM 2M Karras步数25CFG 8。生成了一张1024x576的图细节比MJ原图丰富但分辨率不够。高清修复开启Hires Fix放大倍数2放大算法R-ESRGAN 4x去噪强度0.4步数15。生成了一张2048x1152的图细节清晰霓虹灯的光晕效果很好。最终调整用Inpainting修了一下画面右下角一个模糊的广告牌提示词改成“neon sign, sharp text”去噪强度0.5。最终输出1920x1080的图。整个过程从MJ出图到SD最终输出大概花了20分钟。如果不用SDMJ直接出的图分辨率不够放大后细节会糊如果不用MJ直接在SD里从零生成调参数和试错的时间可能要翻倍。5. 常见问题与排查技巧实录5.1 MJ常见问题速查问题可能原因解决方法出图模糊提示词太笼统增加具体描述词如“sharp focus”、“detailed”出图风格不对风格关键词冲突检查是否有矛盾的风格词只保留一个主风格人物比例失调缺少构图描述增加“full body”、“portrait”等构图词出图重复性高种子固定或提示词太短换种子或增加提示词的多样性画面太暗缺少光照描述增加“bright lighting”、“well-lit”等词5.2 SD常见问题速查问题可能原因解决方法出图灰蒙蒙VAE不匹配更换VAE或检查模型是否内置VAE人物脸部崩坏分辨率太低或模型不适合提高分辨率或换用专门的人像模型手部畸形SD的常见问题用Inpainting局部重绘或增加手部描述词出图速度慢显存不足或步数太高降低步数或开启--medvramControlNet不生效模型未正确加载检查ControlNet模型是否放在正确目录LoRA效果不明显权重太低提高LoRA权重或检查LoRA是否与基础模型兼容5.3 独家避坑技巧MJ的--s参数不要设太高。很多人觉得风格化程度越高越好但实际上--s超过400之后出图会变得过于抽象偏离你的提示词。我的经验是写实风格用50-150插画风格用150-300艺术风格用300-500。SD的种子不要一直固定。固定种子适合做微调但如果你一直用同一个种子出图的多样性会很差。课程里建议探索阶段用随机种子确定方向后再固定种子做微调。ControlNet不要叠加太多。同时用OpenPose、Canny、Depth三个ControlNet出图会非常僵硬。课程里建议一次最多用两个而且权重不要都设太高。LoRA的权重不要超过1.0。超过1.0之后LoRA的风格会过度影响出图导致画面失真。我的经验是0.6-0.8是大多数LoRA的甜点区。高清修复的去噪强度不要超过0.6。超过0.6之后原图的结构会被改变太多高清修复就变成了重新生成。课程里建议0.3-0.5是安全范围。模型不要贪多。下载几十个模型并不会让你出图更好反而会让你在选择上浪费时间。课程里建议一个综合型基础模型、一个人像模型、一个场景模型再加几个常用的LoRA就足够覆盖大多数需求了。5.4 关于AI绘画学习的一些个人体会学AI绘画这件事工具和参数只是基础真正拉开差距的是审美和判断力。我见过很多人参数调得很溜但出图就是不好看问题出在他们不知道什么是“好看”。MJ在这方面是一个很好的训练工具因为它的出图质量普遍较高你可以通过大量的观察和对比来培养自己的审美判断。另外不要指望一套课程能解决所有问题。AI绘画的生态变化很快新的模型、新的工具、新的技巧层出不穷。课程能给你的是基础框架和学习方法真正的提升还是要靠持续的实践和探索。我的建议是学完基础之后给自己定一个具体的项目比如“做一套10张的系列插画”或者“给一个产品做一套宣传图”在完成项目的过程中你会遇到各种具体问题解决这些问题的过程就是最好的学习。最后再分享一个小技巧建立自己的提示词库和参数预设。每次调出一组好用的参数就保存下来每次写出一段效果好的提示词就记录下来。时间长了你就有了一个属于自己的“工具箱”出图效率会大幅提升。这个习惯我从开始学AI绘画就一直在坚持现在积累了几百条提示词和几十组参数预设每次做新项目的时候直接调用省下了大量试错时间。
返回列表