
前言Vision Transformer (VIT)是将图像转换为向量表征最常用的技术之一这些向量表征可被语言模型用于理解视觉输入。我们主要探讨两种方法(1) 将图像块展平 (2) 使用卷积滤波器生成图像块嵌入作为Transformer模型的输入。视觉Transformer与其他Transformer架构的核心区别在于输入处理方式——一旦图像块嵌入被送入Transformer其处理流程就与其他模态如语言或音频再无差异。ViT方法的核心在于将图像视作序列化数据的概念但如何将二维图像转化为Transformer能够理解的一维序列呢VIT处理流程下图展示了VIT通用的输入输出流程输入是由图像块嵌入组成的矩阵每个嵌入代表图像的一个局部区域输出同样是图像块嵌入矩阵但此时的嵌入已包含上下文语义信息——每个图像块都能感知其他图像块的语义含义。而CLS标记作为特殊向量可一次性捕捉整张图像的全局信息。图 1ViT 图像块嵌入到 Transformer 输入与输出我们首先将图像转换为图像块嵌入patch embeddings这可以通过常规方法或使用卷积层来实现。以下分章节进行详细讨论。常规实现首先我们讨论常规方法。将图像划分为固定大小的图像块网格。块的尺寸是一个超参数。例如如下图2所示的12x12图像可被划分为九个4x4的块。块的数量取决于图像尺寸12x12和块大小4x4即 N width × height / p²。图 2如何为 vit 创建图像块嵌入。每个图像块会通过展开其像素值被“展平”为一维向量。对于彩色图像每个块包含所有三个RGB通道的信息这些信息也会被一并展平。图2展示了从图像块网格到线性嵌入序列的转换过程。因此展平后的图像块仅表示像素信息。为了学习像素信息背后的概念或含义每个展平后的块会与块嵌入矩阵patch_size×dimension相乘。最终生成的块嵌入便对先前展平的块具备了概念层面的理解。位置嵌入为保留原本会丢失的空间信息ViT会为每个块嵌入添加位置嵌入。这能让模型识别出某个图像块是来自原图的左上角、中心还是其他位置。上图2通过“图像块嵌入位置嵌入”步骤展示了这一过程。位置嵌入是一个为每个位置单独学习的简单向量。将位置嵌入矩阵与块嵌入矩阵相加后就得到了Transformer的实际输入。若没有位置嵌入模型在需要理解图像元素间空间关系的任务中会表现不佳。CLS Token上图2中有一个不太显眼却特别有趣的细节在序列开头添加了一个特殊的蓝色[CLS] Token标记。CLS Token标记代表完整图像而其他Tokens则对应各个图像块。通过自注意力机制CLS Token会汇集所有图像块的信息。由于它存储的是整张图像的综合信息而非单个图像块的信息其最终状态通常被用于图像分类任务。那么其他嵌入是否也通过自注意力机制捕获了所有嵌入的信息确实如此。但不同的是其他输出向量还额外存储了其对应图像块的专属信息。因此CLS向量与其他向量的差异并不悬殊主要区别在于每个非CLS向量都会更偏向自身对应的图像块信息。使用卷积层实现我们当然也可以通过卷积滤波器生成图像块嵌入。下图详细演示了该过程的实现原理需要说明的是卷积神经网络中的输出通道数即特征图数量每个特征图负责编码输入图像的特定信息。而输出通道的尺寸则决定了序列长度输出通道的数量将代表每个图像块嵌入的隐藏维度。原论文采用非重叠式处理方案非重叠块计算成本更低且实现简单但可能导致块间信息断裂与上下文缺失。原始ViT实现采用此方案。重叠块会增加计算成本但通过信息共享能提升性能减少块间不连续性。对于捕获复杂特征至关重要。图 3使用卷积创建图像块嵌入。当stride3、卷积核尺寸kernel_size3时每个卷积核位置会严格按卷积核尺寸偏移这意味着该配置下相邻块之间不存在重叠。在上图3示例中我们获得3x3尺寸的特征图这意味着序列长度将为9对应9个图像块。我们选择两个滤波器产生两个输出通道即feature maps。因此这9个块中每个块的隐藏维度为2。这仅为示例实际应用中会采用更高维度以捕获更多信息我们通过nn.Flatten(2)将这些特征图展平该操作会从第2个维度开始合并所有维度本例中将张量从(1,2,3,3)重塑为(1,2,9)随后调整维度顺序为(1,9,2)。接着按前述方法添加CLS标记得到新形状(1,10,2)。这意味着我们获得了10个维度为2的嵌入向量其中9个对应图像块1个代表完整图像CLS标记此时该矩阵即可作为Transformer模块的输入。一旦我们有了输入图像块后续的处理就与其他任何 Transformer 相同了。图像块大小的影响在两种方法中我们都将输入图像划分为更小的块。每个块旨在捕获该特定块中存在的图像信息。如果我们选择较大的图像块我们的块嵌入会变得不那么细粒度它存储了图像更大区域的信息。然而我们得到的块嵌入数量更少这对Transformer来说计算效率更高。这是因为注意力层会将每个输入块与其他所有块进行比较所以比较次数是n²。使用较大的块大小我们会得到一个更小的n。何时需要更小的图像块尺寸当我们想要捕获细粒度信息时这一点很重要例如输入图像中的小文本。如果我们不使用图像块而是单独使用每个像素会怎样确实有可能将每个像素视为单独的标记token。Pixel Transformers (PiT) 模型分析了这种方法。目标是减少依赖图像块的 Vision Transformers (ViT) 中固有的局部归纳偏置locality inductive bias。通过处理单个像素模型被迫从头开始学习空间关系这可能导致更灵活的表示。事实上作者能够证明将每个像素视为一个标记可以提高图像分类性能然而单独处理每个像素会极大地增加序列长度由于自注意力机制的二次方复杂度导致计算成本更高。例如一个 32x32 的图像有 1024 个像素而一个 224x224 的图像已经有 50176 个像素。增加的序列长度也会增加内存需求这使得训练此类模型变得具有挑战性。06CNN 与 ViT 中的归纳偏置归纳偏置是模型在看到任何数据之前所拥有的“先验知识”或“假设”。以下是归纳偏置的重要性以及它与 CNN 和 ViT 的关系泛化能力归纳偏置有助于模型泛化到新的、未见过的数据。通过对数据中的潜在模式做出假设模型即使在没有见过特定模式的情况下也能做出预测。学习效率良好的归纳偏置可以显著减少达到特定性能水平所需的训练数据量。如果模型的假设与数据的真实结构很好地匹配它就可以更快、更有效地学习。权衡强烈的归纳偏置与灵活性之间存在权衡。强烈的偏置可以在符合假设的数据上获得良好的性能但在违反假设的数据上性能会很差。较弱的偏置允许模型学习更复杂的模式但可能需要更多数据才能有效训练。与 CNN 相比Vision Transformers (ViT) 具有显著更少的图像归纳偏置。CNN 在结构上通过以下方式理解图像局部性每个层都关注图像的小局部区域。其理念是相邻的像素比距离较远的像素更相关。二维邻域结构它们显式地处理以二维网格如图像排列的数据。平移等变性如果移动输入图像输出特征图也会移动相同的量。这意味着 CNN 能够自动识别模式而无需考虑它们在图像中的位置。总结由于图像块嵌入我们在 ViT 中确实具有一定的局部性。ViT 中的多层感知机MLP层具有局部性和平移等变性但其核心的自注意力层则在整个图像范围内进行全局操作。这使得 ViT 在处理不同类型的数据时更加灵活和适应性强但也意味着它们可能需要更多的训练数据才能达到与卷积神经网络CNN相当的性能水平。ViT 需要从零开始学习二维结构和空间关系因为其位置嵌入在训练初期是随机初始化的。这也表明 ViT 对数据的需求量更大。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】