Algorithmen, die aus Trainingsdaten Muster lernen, um Vorhersagen zu treffen, von linearer Regression und Entscheidungsbäumen bis hin zu tiefen neuronalen Netzen
Ein Machine-Learning-Modell ist ein Programm, das Muster findet oder auf Basis eines zuvor ungesehenen Datasets Entscheidungen trifft. Bei der Verarbeitung natürlicher Sprache beispielsweise können Machine-Learning-Modelle die Absicht hinter zuvor ungehörten Sätzen oder Wortkombinationen analysieren und korrekt erkennen. Bei der Bilderkennung kann einem Machine-Learning-Modell beigebracht werden, Objekte wie beispielsweise Autos oder Hunde zu erkennen. Ein Machine-Learning-Modell kann solche Aufgaben erfüllen, wenn es mit einem großen Dataset trainiert wird. Beim Training wird der Machine-Learning-Algorithmus optimiert, um je nach Aufgabe bestimmte Muster oder Ausgaben des Datasets zu ermitteln. Das Ergebnis dieses Prozesses – oft ein Computerprogramm mit konkreten Regeln und Datenstrukturen – bezeichnet man als Machine-Learning-Modell.
Ein Machine-Learning-Algorithmus ist ein mathematisches Verfahren, mit dem man Muster in einer Datenmenge erkennt. Machine-Learning-Algorithmen werden häufig aus der Statistik, der Infinitesimalrechnung und der linearen Algebra übernommen. Einige bekannte Beispiele für Machine-Learning-Algorithmen sind die lineare Regression, Entscheidungsbäume, Random Forest und XGBoost.
Als Modelltraining bezeichnet man den Vorgang, bei dem ein Machine-Learning-Algorithmus für ein Dataset (die so genannten Trainingsdaten) ausgeführt wird, um den Algorithmus zu optimieren und auf bestimmte Muster oder Ausgaben zuzuschneiden. Die resultierende Funktion mit ihren Regeln und Datenstrukturen wird trainiertes Machine-Learning-Modell genannt.
Grundsätzlich lassen sich Machine-Learning-Verfahren in beaufsichtigtes Lernen, unbeaufsichtigtes, und verstärkendes Lernen einteilen.
Beim beaufsichtigten Machine Learning erhält der Algorithmus ein Eingabe-Dataset und wird darauf ausgerichtet, bestimmte Ergebnisse zu erzielen. Beaufsichtigtes Machine Learning wird beispielsweise häufig in der Bilderkennung eingesetzt. Dabei kommt eine Technik namens Klassifizierung zum Einsatz. Das beaufsichtigte maschinelle Lernen wird auch bei der Vorhersage von demografischen Daten wie Bevölkerungswachstum oder Gesundheitsmetriken verwendet,, wobei eine Technik namens Regression genutzt wird.
Beim unbeaufsichtigten Machine Learning erhält der Algorithmus ein Dataset als Eingabe, wird aber nicht für bestimmte Ausgaben, sondern darauf optimiert, Objekte anhand gemeinsamer Eigenschaften zu Gruppen zusammenzufassen. Empfehlungssysteme für Online-Shops beispielsweise nutzen unbeaufsichtigtes Machine Learning und ganz konkret eine Technik namens Clustering.
Beim verstärkenden Lernen wird der Algorithmus dazu veranlasst, sich selbst zu trainieren, indem er nach dem Prinzip von Versuch und Irrtum viele Experimente durchführt. Verstärkendes Lernen findet statt, wenn der Algorithmus fortlaufend mit der Umgebung interagiert, statt auf Trainingsdaten zurückzugreifen. Eines der bekanntesten Beispiele für das verstärkendes Lernen ist das autonome Fahren.
Es gibt eine ganze Reihe von Machine-Learning-Modellen, die fast alle auf bestimmten Machine-Learning-Algorithmen beruhen. Gängige Klassifizierungs- und Regressionsalgorithmen fallen unter das beaufsichtigte Machine Learning, während Clustering-Algorithmen im Allgemeinen in Szenarien mit unbeaufsichtigtem Machine Learning eingesetzt werden.
Ein Entscheidungsbaum ist ein prädiktiver ML-Ansatz, um zu ermitteln, zu welcher Klasse ein Objekt gehört. Wie der Name bereits andeutet, ist ein Entscheidungsbaum ein baumartiges Ablaufdiagramm, in dem die Klasse eines Objekts schrittweise anhand bestimmter bekannter Bedingungen ermittelt wird.
Darstellung eines Entscheidungsbaums im Databricks Lakehouse. Quelle: https://www.databricks.com/blog/2019/05/02/detecting-financial-fraud-at-scale-with-decision-trees-and-mlflow-on-databricks.html