一文看尽26种神经网络激活函数（从ReLU到Sinc）

发布时间：2019-08-29 12:54 所属栏目：19 来源：机器之心

导读：在神经网络中，激活函数决定来自给定输入集的节点的输出，其中非线性激活函数允许网络复制复杂的非线性行为。正如绝大多数神经网络借助某种形式的梯度下降进行优化，激活函数需要是可微分(或者至少是几乎完全可微分的)。此外，复杂的激活函数也许产生一些

在神经网络中，激活函数决定来自给定输入集的节点的输出，其中非线性激活函数允许网络复制复杂的非线性行为。正如绝大多数神经网络借助某种形式的梯度下降进行优化，激活函数需要是可微分(或者至少是几乎完全可微分的)。此外，复杂的激活函数也许产生一些梯度消失或爆炸的问题。因此，神经网络倾向于部署若干个特定的激活函数(identity、sigmoid、ReLU 及其变体)。

下面是 26 个激活函数的图示及其一阶导数，图的右侧是一些与神经网络相关的属性。

1. Step

一文看尽26种神经网络激活函数（从ReLU到Sinc）

激活函数 Step 更倾向于理论而不是实际，它模仿了生物神经元要么全有要么全无的属性。它无法应用于神经网络，因为其导数是 0(除了零点导数无定义以外)，这意味着基于梯度的优化方法并不可行。

2. Identity

一文看尽26种神经网络激活函数（从ReLU到Sinc）

通过激活函数 Identity，节点的输入等于输出。它完美适合于潜在行为是线性(与线性回归相似)的任务。当存在非线性，单独使用该激活函数是不够的，但它依然可以在最终输出节点上作为激活函数用于回归任务。

3. ReLU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

修正线性单元(Rectified linear unit，ReLU)是神经网络中最常用的激活函数。它保留了 step 函数的生物学启发(只有输入超出阈值时神经元才激活)，不过当输入为正的时候，导数不为零，从而允许基于梯度的学习(尽管在 x=0 的时候，导数是未定义的)。使用这个函数能使计算变得很快，因为无论是函数还是其导数都不包含复杂的数学运算。然而，当输入为负值的时候，ReLU 的学习速度可能会变得很慢，甚至使神经元直接无效，因为此时输入小于零而梯度为零，从而其权重无法得到更新，在剩下的训练过程中会一直保持静默。

4. Sigmoid

一文看尽26种神经网络激活函数（从ReLU到Sinc）

Sigmoid 因其在 logistic 回归中的重要地位而被人熟知，值域在 0 到 1 之间。Logistic Sigmoid(或者按通常的叫法，Sigmoid)激活函数给神经网络引进了概率的概念。它的导数是非零的，并且很容易计算(是其初始输出的函数)。然而，在分类任务中，sigmoid 正逐渐被 Tanh 函数取代作为标准的激活函数，因为后者为奇函数(关于原点对称)。

5. Tanh

一文看尽26种神经网络激活函数（从ReLU到Sinc）

在分类任务中，双曲正切函数(Tanh)逐渐取代 Sigmoid 函数作为标准的激活函数，其具有很多神经网络所钟爱的特征。它是完全可微分的，反对称，对称中心在原点。为了解决学习缓慢和/或梯度消失问题，可以使用这个函数的更加平缓的变体(log-log、softsign、symmetrical sigmoid 等等)

6. Leaky ReLU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

经典(以及广泛使用的)ReLU 激活函数的变体，带泄露修正线性单元(Leaky ReLU)的输出对负值输入有很小的坡度。由于导数总是不为零，这能减少静默神经元的出现，允许基于梯度的学习(虽然会很慢)。

7. PReLU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

参数化修正线性单元(Parameteric Rectified Linear Unit，PReLU)属于 ReLU 修正类激活函数的一员。它和 RReLU 以及 Leaky ReLU 有一些共同点，即为负值输入添加了一个线性项。而最关键的区别是，这个线性项的斜率实际上是在模型训练中学习到的。

8. RReLU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

随机带泄露的修正线性单元(Randomized Leaky Rectified Linear Unit，RReLU)也属于 ReLU 修正类激活函数的一员。和 Leaky ReLU 以及 PReLU 很相似，为负值输入添加了一个线性项。而最关键的区别是，这个线性项的斜率在每一个节点上都是随机分配的(通常服从均匀分布)。

9. ELU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

指数线性单元(Exponential Linear Unit，ELU)也属于 ReLU 修正类激活函数的一员。和 PReLU 以及 RReLU 类似，为负值输入添加了一个非零输出。和其它修正类激活函数不同的是，它包括一个负指数项，从而防止静默神经元出现，导数收敛为零，从而提高学习效率。

10. SELU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

扩展指数线性单元(Scaled Exponential Linear Unit，SELU)是激活函数指数线性单元(ELU)的一个变种。其中λ和α是固定数值(分别为 1.0507 和 1.6726)。这些值背后的推论(零均值/单位方差)构成了自归一化神经网络的基础(SNN)。

11. SReLU

一文看尽26种神经网络激活函数（从ReLU到Sinc）

S 型整流线性激活单元(S-shaped Rectified Linear Activation Unit，SReLU)属于以 ReLU 为代表的整流激活函数族。它由三个分段线性函数组成。其中两种函数的斜度，以及函数相交的位置会在模型训练中被学习。

12. Hard Sigmoid

一文看尽26种神经网络激活函数（从ReLU到Sinc）

Hard Sigmoid 是 Logistic Sigmoid 激活函数的分段线性近似。它更易计算，这使得学习计算的速度更快，尽管首次派生值为零可能导致静默神经元/过慢的学习速率(详见 ReLU)。

13. Hard Tanh

一文看尽26种神经网络激活函数（从ReLU到Sinc）

Hard Tanh 是 Tanh 激活函数的线性分段近似。相较而言，它更易计算，这使得学习计算的速度更快，尽管首次派生值为零可能导致静默神经元/过慢的学习速率(详见 ReLU)。

14. LeCun Tanh

一文看尽26种神经网络激活函数（从ReLU到Sinc）

LeCun Tanh(也被称作 Scaled Tanh)是 Tanh 激活函数的扩展版本。它具有以下几个可以改善学习的属性：f(± 1) = ±1;二阶导数在 x=1 最大化;且有效增益接近 1。

15. ArcTan

一文看尽26种神经网络激活函数（从ReLU到Sinc）

（编辑：ASP站长网）