Bereits im Abschnitt Vom biologischen zum künstlichen Neuron wurde gesagt, dass ein Neuron selbst erst "feuert", wenn die Summe der Eingangswerte eine gewisse Schwelle überschreitet:

Neuron feuert erst, wenn die gewichtete Summe der Eingaben ein gewisses Maß überschreitet
Neuron feuert erst, wenn die gewichtete Summe der Eingaben ein gewisses Maß überschreitet

Diese Schwelle wird durch die sogenannte "Aktivierungsfunktion" festgelegt, weil sie entscheidet, ob ein Neuron aktiviert werden soll oder nicht. D.h. also, sie entscheidet, ob die Eingaben des Neurons in das KNN für den Prozess der Vorhersage wichtig ist oder nicht. Kleine gewichtete Eingaben sind eben nicht wichtig und werden nicht berücksichtigt, weil das Neuron nicht aktiv wird und nicht "feuert".

Auswahl an Aktivierungsfunktionen

Lineare Aktivierungsfunktion

Lineare Funktion

Die lineare Funktion als Aktivierungsfunktion ist nur zwischen 2 Schichten, bzw. nur für die Ausgabeschicht anwendbar. Wird Sie auf mehrere Schichten hintereinander angewendet, fallen diese auf auf 2 Schichten zusammen, weil sich mehrere lineare Funktionen aufsummiert als eine einzige lineare Funktion darstellen lässt:

Die Addition von linearen Funktionen ergibt wieder einer lineare Funktion.
Beispiel: Addition von linearen Funktionen ergibt wieder einer lineare Funktion.

Linearität führt zum Zusammenfallen der Schichten.
Linearität führt zum Zusammenfallen der Schichten.

Somit fällt im obigen Beispiel die verdeckte Schicht weg.

Es muss daher Nichtlinearität in das KNN gebracht werden. KNNs mit verdeckten Schichten benötigen nichtlineare Aktivierungsfunktionen:

 

Nichtlineare Aktivierungsfunktionen

Sprungfunktion

Die oben beschriebene vereinfachte Darstellung als Sprungfunktion entspricht allerdings nicht der biologischen Realität und ist auch nicht auf KNNs anwendbar:

Sprungfunktion
Sprungfunktion

Die Gründe sind, dass nur binär klassifiziert werden kann (0 oder 1). Hinzu kommt, dass die Steigung bei x = 0 nicht definiert ist, bzw. unendlich groß ist. Es handelt sich eben um einen Sprung. Die Funktion ist damit nicht stetig.

\( f(x) = \left\{ \begin{array}{lll} 0 & for & x \leq 0 \\ 1 & for & x > 0 \end{array} \right. \)

\( f'(x) = \left\{ \begin{array}{lll} 0 & for & x \leq 0 \\ ? & for & x > 0 \end{array} \right. \)

Es können nur stetige und monoton wachsende Funktionen für die Aktivierung benutzt werden (d.h. keine Sprünge und durchgehend positive Steigung):

Sigmoid-Funktion

Die Sigmoid-Funktion stellt quasi eine geglättete Form der obigen Stufenfunktion ohne deren Nachteile dar. Sie ist stetig. Ihre Steigung ist im Wendepunkt am größten und nimmt mit der Größe des Betrags ab:

Sigmoidfunktion
Sigmoid-Funktion

Jede Eingabe wird führt zu einer positiven Ausgabe zwischen 0 und 1, die oft direkt als Wahrscheinlichkeiten interpretiert werden können. Sie wird in verdeckten und Ausgabeschichten verwendet.

\( sig(x)= {\frac {1}{1+e^{-x}}}\\ sig'(x)= \frac {1}{1+e^{-x}}(1-{\frac {1}{1+e^{-x}}})=sig(x)(1-sig(x)) \)

Tangens Hyperbolicus tanh

Tangens Hyperbolicus TanH
Tangens Hyperbolicus tanh

Die Ausgabe kann posiitiv und negativ sein und liegt zwischen -1 und 1. Sie kann daher (anders als die Sigmoid-Funktion) auch negative Korrelationen liefern, was zwar in der Ausgabeschicht meist nicht benötigt wird, TanH aber in verdeckten Schichten oft überlegen macht.

\( f(x)={\frac {2}{1+e^{-2x}}}-1\\ f'(x)=1-f(x)^2 \)

 

ReLU-Funktion

Sigmoid und TanH-Funktion erfordern einen hohen Rechenaufwand. Es kann auch mit leicht zu berechnenden Aktivierungsfunktionen Nichtlinearität herbeigeführt werden:

ReLU-Funktion

Die ReLU-Funktion stellt sozusagen einen leicht zu berechnenden und damit schnellen Industriestandard her. Neuronen mit negativen Werten werden ganz einfach abgeschaltet. Was das mehrschichtige KNN oft bereits wieder konvergieren lässt.

\( f(x) = \left\{ \begin{array}{lll} 0 & for & x \leq 0 \\ x & for & x > 0 \end{array} \right.\\ f'(x) = \left\{ \begin{array}{lll} 0 & for & x \leq 0 \\ 1 & for & x > 0 \end{array} \right. \)

Es gibt noch eine Reihe anderer gebräuchlicher Aktivierungsfunktionen. Weitere Informationen s. z.B. hier:
Activation Functions in Neural Networks [12 Types & Use Cases] (v7labs.com)  (19.10.22)

Weitere Quelle:
https://github.com/siebenrock/activation-functions/blob/master/activation_functions.ipynb  (21.10.22)

Last modified: Wednesday, 18 February 2026, 10:38 AM