这一节来自3b1b的最后一个DeepLearning视频。
Chapter3用一种笼统的方式讲述了反向传播的原理和方式。这一节我们深入一点去研究反向传播,以及相关的calculus。大概都是最基本的东西,其实讲得简单的。
先讨论最简单的network:

把最后一层的输出写作a^(L), 前一层写作a^(L-1),与指数没有关系只是一个写法。把我们期望的输出写作y,则某个训练的Cost Function是 (a(L)-y)^2。 我们把这一次example写作C_0。最后一个a(L)取决于一个weight,我们写作w^(L)。 即,a^(L) =f( w^(L) a^(L-1) + b^(L))。其中f()可能是Sigmoid或者ReLu。为了方便,我们把上面的和命名为z,即 a^(L) = f (z^(L))。

我们会得到如下式子~

Chain Rule
然后各自求导数:

在这里,w^(L) 的大小取决于a^(L-1) 的大小,in the case of the last derivative, the amount that a small nudge to this weight influences the last layer depends on how strong the previous neuron is, remember, this is where that "neurons that fire together wire together" idea comes in.
这只是一个cost,full cost function是这些的平均值。
这也只是其中一个的梯度,总体的梯度对所有参数求导都相关。

但算起来的原理都差不多。