ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ViT 不是和 Transformer 并列的东西:真正该对比的是 CNN 和 Transformer 两套看图方式

ViT 不是和 Transformer 并列的东西:真正该对比的是 CNN 和 Transformer 两套看图方式 摘要本文先纠正一个常见误区——ViT 并不是和 Transformer 并列的独立架构它就是 Transformer 在视觉任务上的落地版本。真正值得对比的是 CNN 和 Transformer 这两套“看图方式”CNN 靠局部窗口层层堆叠扩大视野省参数、适合纯视觉任务TransformerViT从第一层起就能全局建模参数不共享、吃算力但和 NLP 同构、天然适合多模态。一句话总结CNN 和 Transformer 是两种并列的看图架构ViT 只是后者在图像上的应用。李沐深度学习191集课程全解析模块拆解、学习路径-CSDN博客吴恩达《面向开发者的提示词工程》-CSDN博客吴恩达 MCP 教程Model Context Protocol一-CSDN博客先纠正一个概念ViT 不是和 Transformer 并列的东西——ViT 就是 Transformer 拿来做视觉的版本。真正值得对比的是 CNN 和 Transformer 这两套“看图方式”对小白最直观的对比CNNTransformerViT看图方式局部每次只看一小块窗口靠层层堆叠慢慢扩大视野全局第一层起每个位置就能直接看到全图所有位置参数全图共享一套卷积核省参数、便宜参数不共享费参数、吃算力打个比方拿着放大镜逐块扫描图片的侦探站在山顶一眼俯瞰全图的观察者强项纯视觉任务够用、省资源全局关系建模强和 NLP 同构天然好做多模态而ViT vs Transformer这个问题就像问“香蕉和水果有什么区别”——ViT 就是 Transformer 的视觉落地版流程笔记里讲得很清楚把图切成 Patch → 每块线性投影成向量 → 加位置编码和 Class Token → 整串喂给标准 Transformer Encoder → 取 Class Token 输出做分类。架构上没有任何新东西新的是“图像可以当成序列喂 Transformer”这个思路。所以一句话记住CNN 和 Transformer 是两种并列的看图架构ViT 只是后者在图像上的应用。
返回列表