跟传统大语言模型相比有什么优势?一文讲透!!)
前言这个图可以很轻松的让没有任何基础的人看懂DLM的工作原理它会根据问题直接生成一个回答草稿然后一次次的修改和润色草稿最终输出回答。PromptExplain what artificial intelligence is.来源https://ml-gsai.github.io/LLaDA-demo/而传统的大模型是一个字一个字的吐比如我问DeepSeek跟上面同样的问题它的回答模式就是线性的下一个字的输出取决于前面的内容跟后面的内容没有关系。这个就是现在最为主流的大模型生成原理autoregressive modeling (ARM)它的核心公式就是下面就是根据前面的所有内容预测下个字。我在介绍ChatGPT原理的时候提到过从deepseek书里面找。而DLMDiffusion Large language model走的是非常不一样但是又比较符合人类直觉的路子。就比如说高考作文题要求写一篇不少于800字的议论文“AI的出现给人类带来了什么改变”传统的LLM会一个字一个字的往外蹦也就是线性生成过程。就比如这个生成了一句话。下一时刻它生成的就只有一个字不多不少就只多一个字。你可以观察任何一个传统的大模型DeepSeekChatGPTQwenGemini等等都是这样的跳不出这个逻辑因为它的底层设计就是一个字一个字的往外吐。而DLM则是完全不同的逻辑它是直接生成一篇800字的“文章”为什么要加引号是因为这个最初生成的“文章”很有可能狗屁不通压根不能算做文章。但是它快呀你别管它能不能读反正快是肯定的。并且它有独特的更新机制就像下面的这张图它会一轮轮的迭代更新自己的内容你看当前时刻可能只确定了一部分的词汇红色但是在下一时刻可能就有更多的内容被确定了出来绿色。多轮迭代之后就可以实验整体性的优化最后实现跟传统大模型类似的结果你像这个领域的经典工作LLaDA在同等模型大小的前提下在大多数的任务上表现并不比其他的模型差多少。从结果为导向来看这也是DLM为什么会吸引关注的主要原因因为它真的快传统大模型生成速度再快也得一个字一个字来。有些工作虽然在做next two tokens预测下两个字符甚至更多的字符但是进展非常缓慢并且从直觉来看DLM明显要比传统大模型更具备可扩展性。就跟我们写作文的时候很少时候是一个字一个字的往出蹦想法而是总体上有个考量然后甚至会在几个部分想几个金句出来只不过在最后执行的时候是一个字一个字的写。油画的创作过程就比较类似先来一个非常粗略的草稿然后一层层的上颜色一次次的涂个几层几十层都不是什么稀罕事。其实这个正好暗合了DLM中D这个字母所代表的技术也就是Diffusion这个技术原本是应用在图像生成Image generation上面的可以说现在绝大多数的图像以及视频生成都是基于这个技术比如OpenAI的Sora阿里的Wan通义万相等。简单来说就是生成一堆乱七八糟的噪音然后让AI学习怎么从噪音转换到想要的图片或者视频。DLM只不过是把脱胎于图像生成的技术应用到了文字生成所以这也是很多技术到了最后都会兼容的主要原因单一技术总会存在这样那样的限制而取众家之长则是必然要走的路。DLM的核心技术技术其实原理上很直观不同于LLM的next token prediction它做的是mask predictor。Next token prediction我们之前讲过了那就是根据现有的句子预测下一个词Mask predictor类似就是随机的把一段话的部分内容“掩盖”住这就是Mask的来源被盖住的内容就叫掩码masked token。比如说在最开始训练的时候我们提供了一个数据下面这个基本上大家都知道。如果是LLM学习的话它在知道“世上无”这三个字之后基本上可以稳定输出后面的所有内容它是线性的。而DLM不太一样它会随机“掩盖”几个字就比如说这样的然后让大模型去学习怎么去填空。它可能会这么填也可能有其他的填法。但是在一轮轮的训练迭代它也能学会这种填空的方法。正好契合了LLaDA的流程总体上就是随机掩盖一部分字符然后去预测这些内容。最后达到极致就是直接输出要求的所有内容只不过是以随机的字符输出然后在一轮轮的迭代下生成最终需要的文章。这篇文章的这个例子很直观用户了提问了一个简单的数学题Lily can run 12 kilometers per hour for 4 hours. After that, she runs 6 kilometers per hour. How many kilometers can she run in 8 hours?LLaDA在生成回答的时候颜色深的部分是后面确定的颜色浅的部分时早些时候确定的。可以看到非关键信息比如人名Lily量词hours很早就确定了下来。而比较关键的数字特别是4这个数字以及涉及到运算和逻辑的部分都是在后面确定的。也可以从这个案例中看到DLM在生成内容的时候在遵循一定的主次关系。还有更多的案例可以在论文的附录appendix里找到。总的来说这是一项非常有前景的技术只不过相比起只预测下一个字符来说技术难度要更高一些但从长远来说潜力不小特别是Google也在下场做这件事。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】