ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

机器学习与深度学习(李宏毅)day6

机器学习与深度学习(李宏毅)day6 Transfomer上Seq2seq model分为两块encoder和decodeer当输入一个sequence由encoder处理再把处理好的结果给decoder由decoder决定输出什么样的sequence。Encoder内部结构如下transformer里面encoder一个block的输出具体如下residual直接把input和output加起来Layer Normalization对同一个feature里面不同的dimension去计算mean和standard deviationTransfomer下Decoder之Autoregressive(AT)Size Vvocabulary的size如果要输出的是中文那么此size可能就是中文字的数目。然后Decoder会把自己的输出当做接下来的输入。Decoder内部结构如下Self-attention和Masked Self-attention的区别Self-attention每一个输出都要看过完整的input之后才会做决定比如输出b1的时候就是根据a1到a4所有的信息输出b1Masked Self-attention每一个输出不考虑其右边的信息比如b1只考虑a1的信息b2考虑a1a2的信息......即要产生b2的时侯只拿第二个位置的query去跟第一个位置的key和第二个位置的key计算attention第三个和第四个位置的就不管。当输入结束时Decoder要能输出一个特殊的符号来表示输入结束。Decoder之Non-autoregressive(NAT)由于不知道要输出的长度不知道要放多少个begin当做NAT Decoder的输入因此用以下方法确定NAT输出长度1.设置一个classifier向这个classifier输入encoder的input然后classifier就会输出decoder应该输出的长度2.直接给decoder一长串的begin再确定在哪里输出endend之后的就直接丢弃NAT优点1.平行化AT的decoder在输出句子的时候是一个一个字的产生当需要输出长句子的时候需要很多次的decoder而NAT不管句子的长度都是一个步骤就产生完整的句子。因此NAT会更快。2.容易控制输出的长度缺点通常效果比AT差Cross attention运行过程训练Seq2seq model的tipsCopy Mechanism从使用者的输入中copy一些词汇当做输出或总结摘要。Guided Attention要求机器在做attention的时侯有固定的方式比如语音识别产生文字的时侯从左到右。Beam Searchexposure bias训练的时候decoder看到的是完全正确的测试的时候decoder看到的是自己的输出所以可能会看到错误的东西。解决办法Schedule Sampling给decoder的输入加一些错误的东西各式各样的AttentionLocal Attention/Truncated Attention有时候在做attention的时侯不一定需要看整个sequence也许有些问题在做attention的时侯在每一个位置上只需要看左右邻居就可以。就可以直接把相距更远的weight设为零缺点每次做attention的时候只能看得到一个小范围的信息那么就跟CNN没什么差别了Stride Attention相较于Local Attention不是看上一个下一个的信息而是跳几个再看信息就可以看到一个比较大范围的信息。Global Attention在attention里加入一个特殊的token或符号代表某个位置要做Global attention。首先它会从sequence里的每一个token收集信息了解整个input sequence里发生了什么事情Global Attention做法1.在原来的sequence里面直接让一些token作为特殊的token2.额外加上特殊tokenClustering1.根据query和key的相近程度把比较近的分类在一起比较远的就属于不同的cluster2.如果一个query和一个key在一个cluter里面才会计算attention的weight其他的直接为零从而加快attention matrix的计算Sinkhorn Sorting Network在计算attention的时侯先产生一个N*N的matrixmatrix里面有些位置是1有些位置是0位置为1的地方才去计算attention位置为0的地方就不计算attention从N个keyN个value中选出K个有代表性的key减小matrix的大小。纵轴为表现横轴为速度圈的大小为需要的memory大小
返回列表