Rückblick
Du hast ein konkretes Verfahren des unüberwachten Lernens (k-Means) implementiert und alle fünf Bewertungskriterien des KLP kennengelernt: Bias, Überanpassung, Unteranpassung, Präzision und Spezifität.
Das kann ich jetzt
- Ich kann die Funktionsweise von k-Means beschreiben. (3.1)
- Ich kann k-Means in Java implementieren. (3.1)
- Ich kann erklären, was Bias ist und wie er entsteht. (3.2)
- Ich kann Überanpassung und Unteranpassung unterscheiden. (3.3)
- Ich kann Präzision und Spezifität berechnen. (3.4)
Das Wichtigste auf einen Blick
| Begriff | Bedeutung |
|---|---|
| k-Means | Iteratives Verfahren, teilt Daten in k Cluster ohne Labels |
| Bias | Systematische Verzerrung durch unrepräsentative Daten |
| Überanpassung | Modell zu komplex; perfekt auf Trainingsdaten, schlecht auf Testdaten |
| Unteranpassung | Modell zu einfach; schlecht auf Trainings- und Testdaten |
| Präzision | TP / (TP + FP) — Zuverlässigkeit der positiven Vorhersagen |
| Spezifität | TN / (TN + FP) — korrekte Erkennung der negativen Fälle |
k-Means ist ein konkretes Verfahren zur Clusterbildung beim unüberwachten Lernen. Die fünf Bewertungskriterien — Bias, Überanpassung, Unteranpassung, Präzision, Spezifität — erlauben es, die Qualität eines KI-Modells systematisch zu beurteilen.
Gemischte Aufgaben
Aufgabe 1: k-Means auf dem Papier
Gegeben sind sechs Punkte: (1, 1), (2, 1), (1, 2), (8, 8), (9, 8), (8, 9). Gesucht sind zwei Cluster. Als Startschwerpunkte werden — wie in unserer Implementierung — die ersten beiden Punkte genommen, also (1, 1) und (2, 1).
a) Führe die erste Iteration durch: Ordne jeden Punkt dem näheren Schwerpunkt zu und berechne beide Schwerpunkte neu.
b) Führe die zweite Iteration durch. Was ändert sich?
c) Nach welcher Iteration meldet das Programm „stabil"? Begründe.
d) Der Schwerpunkt von Cluster 1 liegt nach der ersten Iteration bei (6,75 / 6,5) — dort liegt gar kein Datenpunkt. Ist das ein Fehler?
Tipp 1: Vorgehen
Lege eine Tabelle mit sechs Zeilen an und trage für jeden Punkt die Distanz zu beiden Schwerpunkten ein. Der Schwerpunkt eines Clusters ist der Mittelwert seiner Punkte, getrennt für x und y.
Tipp 2: zu a)
Achte auf den Punkt (2, 1): Er ist der zweite Startschwerpunkt, hat also zu sich selbst die Distanz 0 und landet damit zwangsläufig in Cluster 1 — zusammen mit den drei weit entfernten Punkten.
Aufgabe 2: Ein Modell beurteilen
Eine Fabrik prüft Bauteile automatisch auf Risse. Von 1000 geprüften Teilen sind 50 tatsächlich defekt. Das Modell meldet 60 Teile als defekt; 40 davon sind es wirklich.
a) Stelle die Vierfeldertafel auf (TP, FP, FN, TN).
b) Berechne Trefferquote, Präzision und Spezifität.
c) Die Firma wirbt mit „97 % Genauigkeit". Warum ist diese Zahl irreführend?
d) Zehn defekte Teile gehen durch die Prüfung. Welche Kennzahl macht das sichtbar — und welche nicht?
Tipp 1: Die Tafel füllen
Du kennst drei Zahlen: 1000 insgesamt, 50 wirklich defekt, 60 gemeldet, davon 40 richtig. Fülle zuerst TP und FP, dann ergeben sich FN und TN durch Subtraktion.
Tipp 2: zu c)
Rechne aus, welche Trefferquote ein Modell hätte, das einfach jedes Teil für in Ordnung erklärt und gar nicht rechnet.