
GPU Compute │ ┌──────┴──────┐ │ │ Registers Shared Memory │ │ └──────┬──────┘ │ L1 │ L2 │ Global Memory │ VRAM往上↑速度更快容量更小离计算单元更近往下↓速度更慢容量更大离计算单元更远Register 是最靠近计算单元的存储,它的速度非常快作用范围单个thread所以每个线程都有自己的register。shared memory是block的小仓库作用范围block内线程共享。L1 Cache它主要用于缓存近期访问的数据可以理解位GPU计算单元旁边的小型高速缓存L2 比 L1 更大但通常也更远、更慢它是 GPU 多个计算单元之间可以共享的数据缓存层。global memory速度相对慢延迟高但是容量大。Global Memory 和 VRAM 在 CUDA 语境里经常指的是同一大类显存资源不要把它们当成两个完全独立的物理内存层.内存谁使用核心特点Register单个 Thread极快、很小Shared MemoryBlock 内 Threads快、可共享L1GPU 硬件高速 CacheL2GPU 多个计算单元共享更大、较慢Global Memory / VRAMGPU大、相对慢