
半导体量测间里最“折磨”人的问题不是光学分辨率上不去而是晶圆台高速运动的时候曝光时间被压缩到极限画面暗得没法看。这时候噪点、拖影、对比度下降一起涌上来普通工业相机基本没有还手之力TDI相机却能做到又快又亮又干净。这个技术不新但理解它的人远没有用它的多真正上手做过产线验证、算过链路预算的更清楚它的脾气。这篇文章就把TDI相机的原理、它在半导体量测里的真实角色、以及实际落地时那些文档里不会写的东西一次讲透适合设备工程师、制程整合工程师以及所有在看“高速高灵敏度成像”这条技术路线的朋友。1. 半导体量测给成像出了道什么题1.1 高速运动下的低光照困局先还原一个非常具体的现场。晶圆检测设备里晶圆被真空吸附在运动平台上为了产能平台移动速度往往要做到每秒几百毫米甚至更高。相机是线扫方式逐行成像行频决定了在运动方向上能采多密——以0.5米每秒的运动速度、要求运动方向分辨率为1微米来计算行频至少要拉到50kHz。曝光时间直接由行频决定50kHz行频下每行曝光只有20微秒。就是这20微秒把绝大多数相机打回了原型。光通量不够图像信号弱满阱电子都攒不满一半更常见的情况是连十分之一都装不满。信号弱散粒噪声、读出噪声、暗电流噪声全都压上来了SNR跌到个位数画面噪点像下雪一样。半导体检测又偏偏特别吃图像质量边角划痕、亚微米级的颗粒、CMP后的残留物哪一个的特征对比度都不高噪声一旦上来这些小缺陷全被淹没了。1.2 普通线扫相机为什么扛不住有人会说既然暗加光照不就行了。但半导体产线上的光照不是你想加就能加的。一方面高照度照明会带来热辐射晶圆局部升温温度变化直接影响套刻精度和线宽均匀性产线对热预算极其敏感。另一方面光路空间有限照明系统的数值孔径、均匀性都有天花板光强堆到一定程度均匀性急剧恶化检测结果反而更不可靠。所以“加光”这条路线在半导体量测里普遍走不通。还有人会想到面阵相机配合频闪。这个方案在很多通用机器视觉场景里有效但放到晶圆检测上一样别扭面阵相机的帧率限制决定了它很难兼顾宽视野和高速高分辨率要拍清运动中的细节就得缩短曝光但频闪光源的峰值能量又很难一直稳定。说白了常规相机的思路是“在有限的曝光时间里尽可能多攒光”可曝光时间本身被速度卡死了怎么优化都绕不开这道坎。那换个角度能不能把同一目标的信号重复利用起来让光子在传感器内部替你先做几次累加这个思路就是TDITime Delay Integration时间延迟积分。它的出现本质上是为“高速运动低照度高分辨率”这个三角约束寻找一个工程解。2. TDI的工作机制一场时间换信噪比的接力赛2.1 把一行感光变成N行接力先回忆一下普通线扫相机的工作方式它只有一行或者少数几行当作RGB分离用感光像元目标经过视野时只在那一行上积分一次扫过去就没了。问题是晶圆在动目标在每一时刻只能照亮一行像素这行像素还没攒够电子目标已经挪走了。TDI相机的传感器结构是让同一个目标依次经过N行像元。举个例子一个正常的64级TDI传感器长方向排列了64行像元。晶圆移动过程中目标点先照到第1行第1行开始积攒光生电子等目标移动到第2行的时间恰好等于传感器把第1行的电荷转移到第2行的时间目标照到第2行时第1行的电荷也刚好汇入第2行两轮光生电子加在一起继续累积。就这样一行接一行目标走完64行电荷也汇合了64次最终在输出端得到一个“叠加了64次曝光”的总信号。这就是“延迟积分”四个字的由来——电荷的转移时间故意延迟到和目标运动速度匹配让每一次曝光都精准落进同一组电荷包。整个过程像一场接力赛目标就是那个选手每一行像素是不同接棒点电荷包是那根接力棒每一棒都把上一棒的信号完整带上越跑信号越强。2.2 电荷如何精准跑赢目标TDI的工程实现核心在CCD的电荷转移机制上。CCD的每一个像元下面有一组电极通过给电极施加时序脉冲改变电势阱的位置电荷包就能沿转移方向逐级搬移。TDI模式下转移方向必须和晶圆运动方向严格平行转移速度必须和晶圆在像面上的运动速度严格一致。简单计算一下如果传感器像元尺寸在TDI方向上是5微米光学系统放大倍率是1:1那么晶圆移动5微米的时间就是电荷转移一行所需要的时间。晶圆移动速度为0.25米每秒时每一个5微米需要20微秒对应电荷行转移周期就是20微秒行频50kHz。如果放大倍率是0.5像面上目标移动速度变成了0.125米每秒转移周期则变为40微秒行频降到25kHz。这个匹配关系必须非常精确任何速度失配都会让叠加的信号错位等效于图像模糊。TDI行频和目标速度的匹配公式[ f_{line} \frac{v_{stage}}{p_{pixel} / M} ]f_line 是行频v_stage 是载物台移动速度p_pixel 是像元尺寸在TDI方向的大小M 是镜头放大倍率实际设备里平台速度和相机的行触发信号做硬同步。电机编码器发出脉冲一个脉冲对应一个平台移动距离这个脉冲直接触发相机走一行。这样就算平台速度有微小的波动每一行曝光的起始位置也是严格对齐的电荷转移和目标运动之间不会累积误差。没有这种硬同步速度漂移、抖动会直接表现为图像分辨率下降那种模糊和焦不准还不太一样更像“顺着运动方向被抹了一层”。2.3 等效曝光时间N级叠加的数学TDI最直观的收益是等效曝光时间。普通线扫一行曝光20微秒64级TDI传感器让同一目标累积64次等效曝光时间就是20乘以64也就是1.28毫秒。请注意这不是把曝光时间拉长而是把多行时间里的信号做相干叠加获得的效果和单次曝光1.28毫秒几乎一样。这个叠加对随机噪声的抑制效果是TDI最大的卖点。光生信号是线性叠加的——64行叠加后信号强度是原来的64倍。但很多噪声源是随机的其中散粒噪声服从泊松分布标准差是信号强度的开方。信号变64倍散粒噪声只变8倍所以信噪比提升为64除以8等于8倍。从这个角度看N级TDI的SNR提升效果是 (\sqrt{N}) 。64级就是8倍96级接近9.8倍128级约11.3倍。想要SNR翻倍N值得变成原来的4倍这个边际收益衰减规律决定了选型时不是盲目堆N。对于半导体量测来说SNR提升8倍代表什么代表原本需要1.28毫秒积分才能看见的微弱缺陷信号现在在20微秒单行曝光条件下也能被清晰分辨。很多亚表面损伤、极浅的划痕、低对比度的薄膜异常就是在这种情况下才“现形”的。3. 玩转TDI必须吃透的物理边界与工程折中3.1 N不是越大越好噪声项的边际效应既然TDI的SNR提升是 (\sqrt{N})那是不是做成1024级、2048级更好理论上确实但工程上没这么简单。第一道坎是暗电流和残余电荷。“N行接力”的代价是电荷在传感器里待的时间变成了N倍暗电流也随之累积。制冷不佳的情况下64级TDI的暗电流信号可能已经接近微弱信号本身叠加出来图像上是一片灰雾。暗电流是加性噪声它不享受信号增强的收益但它会占掉满阱容量压缩动态范围还在长时间积分中引入更多非均匀性。第二道坎是像元响应的非均匀性PRNU。每一行像元对光的响应不可能完全一致60多万行哪能一个个校正到完美总有几个行偏亮或偏暗。普通线扫中PRNU只影响一行在TDI中PRNU会在N行叠加中线性累计所以TDI图像的固定图案噪声往往比普通线扫明显得多。产线上看这个现象很直观TDI图像上会出现垂直于运动方向的条纹就是PRNU累积的效果。第三道坎是时序控制难度。N越大对相机转移时序的精度、驱动电路的功耗、传感器片内时钟分配的要求越高。实际产线中高N带来的SNR增益在暗电流、PRNU、读出速率限制的夹击下可能会被吃掉一半以上。3.2 满阱容量、动态范围和分辨率之间怎么算账满阱容量决定了一个像元最多能装多少电子。每行像元的电荷叠加到同一个包里意味着一行里的电子会一路累积到最后一行的满阱极限。假如满阱是60ke-N等于64目标亮度又比较强可能只走了20行电荷就装满了后面的44行全部溢出图像完全毁掉。所以TDI并不是把弱信号变强的同时把强信号也保住了——动态范围上限是被写死的。处理这个问题的办法是分级增益或抗溢出结构。部分高端TDI传感器内部设计了抗溢出漏极电荷超过阈值后自动泄放另外很多方案从系统端解决——调整曝光量让最强的目标信号在N行累积后不超过满阱的70%到80%。这就需要做充分的链路预算根据光源亮度、反射率分布、镜头透过率、像元量子效率拉通计算。计算公式大致是[ S_{total} \Phi \times QE \times A_{pixel} \times t_{line} \times N / C_{full} ]( \Phi ) 是到达像面的光功率密度QE 是量子效率( A_{pixel} ) 是像元面积( t_{line} ) 是单行曝光时间N 是TDI级数( C_{full} ) 是满阱容量最终 ( S_{total} ) 要落在满阱的合理区间太低埋没信号太高溢出出售。我在调试里见过不止一次明明光源和相机都高级却因为忘记算满阱预算图像高光处一片死白、细节全无就是这一步没做扎实。3.3 电荷域TDI和数字域TDI两条完全不同的路线传统TDI大多是电荷域TDI也就是前面描述的光生电子在CCD内部以电荷包形式逐级转移累加最终一次性读出。它的优势是噪声极低因为电荷域的累加完全不影响读出噪声——噪声只叠加一次而不是每行叠加一次。这在低照度下是决定性的差异。数字域TDI则是用CMOS传感器先按普通模式把每一行独立读出来然后在数字电路里对齐叠加。它的优势是灵活性高可以对每一行做不同的增益、黑电平校正、坏点校正后再叠加还能从软件层面对齐速度、处理畸变劣势是每一行都独立读出噪声N行叠加时读出噪声也乘以 (\sqrt{N})。在非常暗的信号下数字域TDI的SNR天花板通常不如电荷域TDI。最近几年CMOS-TDI技术把两条路线拉近了不少低噪声读出电路叠加上千级数字累加很多场景数字域TDI已经敢和CCD-TDI掰手腕了。但在半导体量测这种对弱信号、低噪声极度挑剔的领域主流量测设备还是倾向于用CCD-TDI尤其是需要极低噪音做复现性测量的环节。当然CMOS-TDI也在不断向这个市场渗透。4. 半导体量测里的典型应用与相机选型思路4.1 晶圆宏观缺陷检测TDI的主场晶圆宏观缺陷检测也就是常说的Macro Inspection是对整个晶圆表面做低倍率快速扫描找划痕、颗粒、水渍、膜层不平整这类宏观问题。检测速度要求极高一片12英寸晶圆往往要求在几十秒内扫完单次扫描的视野又要有一定宽度才能保证产能。这种场景下TDI的优势是碾压性的。平台高速运动时只有TDI能在保证横向分辨率的同时把SNR顶上去。一个典型配置是5微米像元、放大倍率0.5、64级TDI、50kHz行频扫一片晶圆只需要不到一分钟同时还能看清1微米级别的颗粒。如果换成普通线扫要么行频降下来、产线产能崩掉要么灯加到晶圆热变形怎么选都是错。明场模式和暗场模式在这个场景的分工也很有讲究。表面颗粒和划痕适合暗场——它们把光散射到相机里背景是黑的信噪比天然高薄膜干涉导致的颜色不均适合明场——它反映的是反射率的空间变化。TDI相机对两种模式都适应暗场下N值可以小一些比如32或64因为背景噪声低明场下通常把N拉到96或128来弥补整体对比度不足。4.2 先进封装检测对宽幅和景深的要求先进封装是另一个被TDI深度绑定的战场。Bumping工艺的凸块高度、形貌、位置偏移TSV通孔的填充质量RDL重布线层的边缘粗糙度都要高精度测量。封装基板的尺寸比晶圆大不少动辄几百毫米而且翘曲度高景深需求很严。封装检测里的TDI往往要求更宽的扫描视野和更大的景深范围。选择低倍率镜头、大像元传感器用TDI来弥补低倍率带来的光通量损失是这个场景下的典型组合。例如像元尺寸7微米、放大倍率0.2左右、96级TDI扫描视场能达到35毫米以上同时景深能盖住基板的翘曲量。封装基板的反射特性也比晶圆复杂有焊料、金属走线、阻焊层、介电材料混在一起反照率差异大。这需要TDI相机具有较宽的动态范围同时最好支持多档增益和曝光微调防止亮暗跳变区域出现饱和或者丢失。固定增益做单一量测配方在封装场景里通常是不行的。4.3 光刻与掩模相关测量、以及高均匀性场景光刻前道和后道光刻对准标记的测量对成像的畸变和均匀性要求极高。这类检测的量测对象不只是尺寸缺陷还包括线宽、套刻误差、图案形貌等关键参数。TDI在这里不是用来“看有没有缺陷”的而是提供高精度、低噪声的原始图像供算法计算位置和轮廓。在这个场景TDI的行频通常不会拉满而是选择中等行频搭配较大N值把SNR推到极高让亚像素算法有充足的灰阶信息去拟合边缘和中心位置。有时甚至会用双通道TDI一个通道做强信号采集另一个通道做弱信号补偿最后在算法端做差分计算可以显著抑制共模噪声。掩模版检测也是类似掩模表面的缺陷对比度很低很多污染颗粒信号只有几个电子级别的差异。TDI的高SNR在这里是“看没看见”和“判断出是什么”的底层保障。整体而言这些场景强调的不是速度而是极致的均一性和复现性。4.4 选型前必须拉通的几个参数实际选型时下面这几个参数是关键项建议做成表格逐一确认。参数项目说明典型参考像元尺寸影响分辨率与灵敏度较大像元聚光更强3.5μm / 5μm / 7μm / 10μmTDI级数决定SNR提升幅度64/96/128/256常见颗粒检测用64~96弱信号用128以上满阱容量决定单像素存储上限影响动态范围30ke- / 60ke- / 200ke-量子效率/QE近红外或深紫外场景需关注光谱响应峰值单色峰值60%~95%行频上限决定了能匹配的最大平台速度20kHz~200kHz数据接口行频高时数据传输是瓶颈Camera Link、CoaXPress、GigE制冷方式影响暗电流水平高N场景需关注风冷/水冷/无制冷选型时候最容易犯的一个错误是“只盯着分辨率和行频看”。我见过不少项目TDI相机的分辨率和行频都够了却因为量子效率在目标波长上不够漂亮导致信号强度低到算法完全跑不动。光谱响应曲线一定要从相机供应商那里要到别只看标称的QE峰值这个峰值的波长不一定匹配你的照明波长。5. 落地TDI检测线必须处理的工程细节5.1 标定与同步速度和时序是TDI的命门安装完硬件、写完配置第一步永远是同步校准。TDI成像质量直接取决于电荷转移时序和平台运动速度是否匹配这个失配哪怕只有1%都会让图像出现整体模糊。测试办法很简单放一张高对比度的分辨率靶做一次静态扫描后对比动态扫描的图像观察运动方向上的分辨率是不是明显变差。如果变差优先检查平台速度反馈信号再检查编码器触发的滤波设置。平台运动不可能绝对恒速编码器的刻线密度决定了速度反馈的分辨率。编码器每转多少个脉冲、平台每毫米多少个脉冲决定了行触发的空间间隔精度。刻线密度越高行间间隔误差越小TDI叠加精度越高。有的产线为了省钱用了低线数编码器结果TDI图像始终有一层不均匀的模糊折腾很久找不到原因最后发现自己最大的噪声源是触发抖动这种情况我见过不止一次。标定时的另一个重点是确保TDI方向与平台运动方向严格平行。传感器装偏哪怕零点几度目标在N次叠加过程中就会产生亚像素级的横向漂移。N级之后累积漂移可能到几个像素图像边缘便会出现一种“斜向拖影”的特殊模糊感。调试时先用几何靶标测对角线方向的分辨率下降情况能较快定位到这个问题。5.2 光照设计忽略均匀性等于浪费TDI很多人以为有TDI的高灵敏度加持光源随便弄弄就行。事实恰恰相反TDI恰恰会把照明的不均匀给“放大”。原因很简单同一目标在N行叠加过程中如果光源在扫描方向上有亮度起伏那么目标在不同行看到的亮度不同叠加后就会形成类似闪烁的条纹图案。普通线扫对这种起伏不敏感因为某个像素只被照一次TDI不同它在移动过程中被照了N次N次亮度不一致叠加结果必然不均匀。所以TDI产线的光源一要亮度足够二要空间均匀性可控三要时间稳定性好。LED光源的电流纹波、老化漂移都会直接影响TDI图像的一致性和复现性。设计光路时考虑在光源和相机之间增加匀光棒或复眼透镜并且定期做平场校正能显著降低固定图案噪声的影响。5.3 数据吞吐与实时处理TDI相机一旦跑起来数据量是相当可观的。一个16kHz行频、单行4096像素、8-bit位深的相机每秒输出大约536MB如果是10-bit甚至12-bit数据量继续上涨。产线上还要做实时缺陷检测图像数据传输、算法处理、结果上报必须全部在产线节拍内完成这对计算架构的挑战很大。解决方案通常分两种一种是拉高数据链路带宽CoaXPress或者Camera Link HS接口是常见选择另一种是在前端做智能预处理例如FPGA中完成ROI裁剪、亚像素对齐、频域滤波把传给上位机的数据压缩到原来的几分之一。后端再结合GPU或NPU跑深度学习检测模型。TDI的数据特性是运动方向上有天然的连续性适当利用相邻行的相关性做压缩或预筛选效果远比盲处理要好。5.4 温度、振动与暗电流产线环境里的隐形杀手TDI对环境的敏感程度要远高于普通工业相机。哪怕没有光照置于完全黑暗的镜头盖下TDI图像上也会积累越来越亮的底色——这就是暗电流。暗电流和温度呈指数相关温度每升高5到7度暗电流可能翻倍。在做半导体量测时如果相机机箱散热不好运行半小时后图像背景亮度爬升整个检测阈值全部失效。振动方面虽然行触发是由编码器硬同步的但平台本身的振动会带来TDI方向上的瞬时速度波动反映到图像上就是局部条纹抖动或模糊。把相机和平台安装在同一个刚性基础上能显著改善这个问题。信号线也要用高屏蔽等级的同轴线避免运动平台电机、静电吸盘控制器的电磁干扰串入触发信号。6. TDI往后会往哪些方向演进6.1 背照式与更高量子效率把每一个光子都接住传统前照式CCD的电极层会遮挡一部分入射光量子效率在可见光波段往往只有40%到60%。背照式工艺把感光层翻过来让光从没有电极阻挡的背面进入量子效率可以冲到80%以上在蓝紫光波段提升尤其明显。对半导体量测来说这意味着可以用更少的光源能量达到同样的信号强度或者用同样的光能量获得更高的SNR都是产线求之不得的事情。背照式TDI在深紫外波段的价值会更突出。很多掩模检测、光刻胶潜像检测需要UV或DUV照明常规传感器的QE低到让人绝望背照式传感器的QE在这些波段可以有数量级的改善。未来随着DUV光源和光学系统的进一步普及背照式TDI的窗口会更大。6.2 多光谱与偏振TDI从拍亮度到拍“材质”普通TDI只记录灰度但半导体量测里很多缺陷在灰度上没有差异却在光谱响应或偏振特性上有明显不同。多光谱TDI相机把不同波长的响应通过不同TDI通道分开能同时采集多个波段的图像再在算法端做比值分析就可以把某些特定材料或膜层的异常识别出来。偏振TDI的思路类似它对表面取向、应力分布、膜厚变化极其敏感在先进工艺节点的高深宽比结构检测上越来越受重视。这类相机在硬件上通常会把N级TDI分成几组每一组配不同滤光片或偏振片各组之间通过光学延迟或软件对齐来保证同一目标被所有通道拍到。代价是每个通道的N值变小SNR下降所以真正量产落地时需要在多信息量和灵敏度之间做精细配平。6.3 数据接口与实时计算让数据流跟得上产线节拍TDI解决的是采集端的问题但产线整体效率还取决于数据的处理能力。下一代TDI系统更多时候是“传感器边缘计算”整体方案相机内部直接做平场校正、缺陷预筛选、图像压缩只把可疑区域和统计数据传给主控电脑。对于半导体量测这种数据量极大的场景这样做能大幅降低后端的算力压力和存储成本。我判断接下来的趋势一定是TDI技术和AI检测算法更深度的绑定用前端硬件把数据“吃”掉一部分算法才能在产线节拍内做更细致的判断。6.4 双层TDI与三维检测的探索TDI的传统定位是二维成像但在半导体三维检测需求上升的背景下一些新思路开始冒头。比如把两个TDI传感器放在不同光路方向上一处聚焦表面一处聚焦中间层再从图像融合中重建三维信息可以比纯共聚焦扫描快得多。又比如通过多层TDI分段曝光分别对应不同景深位置再在算法端做深度合成实现“一次扫描、多深度同时聚焦”。这类方案还处于工程验证阶段但方向很明确TDI的“时间延迟积分”思想正在和更多光学设计结合去解决新一代先进封装和先进工艺带来的三维量测挑战。我在实际使用中的体会是TDI这类技术最迷人的地方不在于它能拍多快、多亮而在于它逼着你把整条成像链路都当成一个精密系统来思考光、传感器、运动控制、数据链路每一个环节都不能当配角。很多人问为什么自己买了好相机还是拍不好排查到最后往往都是同步、温控、光源均匀性这些“外围”环节在拖后腿。如果你正准备上TDI方案我个人的建议是留足前期的调试预算别急着换上产线跑量先在实验台上把速度匹配、照明均匀性和标定做扎实后面会省下数不清的折腾时间。