Attention

在Encoder-Decoder结构中,Encoder把所有的输入序列都编码成一个统一的语义特征c再解码,因此, c中必须包含原始序列中的所有信息,它的长度就成了限制模型性能的瓶颈。Attention机制通过在每个时间输入不同的c来解决这个问题。每个 c 会自动选取与当前需要输出的 y 最合适的上下文信息。具体来说,用a_{ij}衡量 encoder 中第 j 阶段 的h_i和解码时第 i 阶段的相关性,从而 decoder 第 i 阶段的上下文信息c_i 就来自于所有h_ja_{ij}的加权和。

图中标红表示该权重值较大。

a_{ij}是从模型中学出的,它实际和Decoder的第i-1阶段的隐状态、Encoder第j个阶段的隐状态有关。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容