Informatik

Rückblick

Du hast ein konkretes Verfahren des unüberwachten Lernens (k-Means) implementiert und alle fünf Bewertungskriterien des KLP kennengelernt: Bias, Überanpassung, Unteranpassung, Präzision und Spezifität.

Das kann ich jetzt

  • Ich kann die Funktionsweise von k-Means beschreiben. (3.1)
  • Ich kann k-Means in Java implementieren. (3.1)
  • Ich kann erklären, was Bias ist und wie er entsteht. (3.2)
  • Ich kann Überanpassung und Unteranpassung unterscheiden. (3.3)
  • Ich kann Präzision und Spezifität berechnen. (3.4)

Das Wichtigste auf einen Blick

Begriff Bedeutung
k-Means Iteratives Verfahren, teilt Daten in k Cluster ohne Labels
Bias Systematische Verzerrung durch unrepräsentative Daten
Überanpassung Modell zu komplex; perfekt auf Trainingsdaten, schlecht auf Testdaten
Unteranpassung Modell zu einfach; schlecht auf Trainings- und Testdaten
Präzision TP / (TP + FP) — Zuverlässigkeit der positiven Vorhersagen
Spezifität TN / (TN + FP) — korrekte Erkennung der negativen Fälle

k-Means ist ein konkretes Verfahren zur Clusterbildung beim unüberwachten Lernen. Die fünf Bewertungskriterien — Bias, Überanpassung, Unteranpassung, Präzision, Spezifität — erlauben es, die Qualität eines KI-Modells systematisch zu beurteilen.

Gemischte Aufgaben

Aufgabe 1: k-Means auf dem Papier

Gegeben sind sechs Punkte: (1, 1), (2, 1), (1, 2), (8, 8), (9, 8), (8, 9). Gesucht sind zwei Cluster. Als Startschwerpunkte werden — wie in unserer Implementierung — die ersten beiden Punkte genommen, also (1, 1) und (2, 1).

a) Führe die erste Iteration durch: Ordne jeden Punkt dem näheren Schwerpunkt zu und berechne beide Schwerpunkte neu.

b) Führe die zweite Iteration durch. Was ändert sich?

c) Nach welcher Iteration meldet das Programm „stabil"? Begründe.

d) Der Schwerpunkt von Cluster 1 liegt nach der ersten Iteration bei (6,75 / 6,5) — dort liegt gar kein Datenpunkt. Ist das ein Fehler?

Tipp 1: Vorgehen

Lege eine Tabelle mit sechs Zeilen an und trage für jeden Punkt die Distanz zu beiden Schwerpunkten ein. Der Schwerpunkt eines Clusters ist der Mittelwert seiner Punkte, getrennt für x und y.

Tipp 2: zu a)

Achte auf den Punkt (2, 1): Er ist der zweite Startschwerpunkt, hat also zu sich selbst die Distanz 0 und landet damit zwangsläufig in Cluster 1 — zusammen mit den drei weit entfernten Punkten.

Lösung. Erfrage das Passwort bei deiner Lehrkraft.

Aufgabe 2: Ein Modell beurteilen

Eine Fabrik prüft Bauteile automatisch auf Risse. Von 1000 geprüften Teilen sind 50 tatsächlich defekt. Das Modell meldet 60 Teile als defekt; 40 davon sind es wirklich.

a) Stelle die Vierfeldertafel auf (TP, FP, FN, TN).

b) Berechne Trefferquote, Präzision und Spezifität.

c) Die Firma wirbt mit „97 % Genauigkeit". Warum ist diese Zahl irreführend?

d) Zehn defekte Teile gehen durch die Prüfung. Welche Kennzahl macht das sichtbar — und welche nicht?

Tipp 1: Die Tafel füllen

Du kennst drei Zahlen: 1000 insgesamt, 50 wirklich defekt, 60 gemeldet, davon 40 richtig. Fülle zuerst TP und FP, dann ergeben sich FN und TN durch Subtraktion.

Tipp 2: zu c)

Rechne aus, welche Trefferquote ein Modell hätte, das einfach jedes Teil für in Ordnung erklärt und gar nicht rechnet.

Lösung. Erfrage das Passwort bei deiner Lehrkraft.

Selbsttest

Rückblick

Teilbare URL erstellen

Abschnitte auswählen