Die drei Punkte sind konstruiert und keine APKV-Daten. Das Lab demonstriert einen Mechanismus, nicht die Güte einer Modellfamilie im Allgemeinen.
Ziel & Voraussetzungen
Ziel: euklidische Abstände roh und nach fest vorgegebener Skalierung nachrechnen, anschließend den besten eindimensionalen Gini-Split bestimmen.
- Python 3, ausschließlich Standardbibliothek.
- Training: (Betrag, Quote, Klasse) = (850;0,1;0), (0;0,8;1), (1000;0,7;1).
- Query: (900;0,9). Skalen 1000 und 1 sind didaktisch vorgegeben; real werden Parameter ausschließlich aus Train bestimmt.
Ausführen
- Skript öffnen oder speichern.
python3 labs/model_family_walkthrough.pyausführen.- Danach Query oder Skalen verändern und vorab vermuten, welche Entscheidung kippt.
Erwartetes Ergebnis
KNN unscaled: label=0, distance=50.006
KNN scaled: label=1, distance=0.224
Best tree split: quote <= 0.400, weighted_gini=0.000
Tree prediction: label=1Interpretation: 1-NN hängt vollständig von Repräsentation, Einheit und Metrik ab. Der Baum findet hier eine perfekte Quotenschwelle; das beweist wegen n=3 weder Generalisierung noch Stabilität.
Fallstricke
- Vorgegebene Skalen nicht als Empfehlung für reale Daten lesen.
- Ein perfekter Trainingssplit kann maximal überfitten; per passendem Holdout prüfen.
- Eine monotone lineare Skalierung ändert die Reihenfolge eines einzelnen Features nicht, wohl aber Distanzanteile.
- Das Skript schreibt keine Dateien; Aufräumen ist nicht nötig.
Transferfrage
Wie würdest du den Vergleich mit mehr Daten fair gestalten? Nenne Pipeline, Hyperparametergrenze, Split, relevante Metriken, Latenzmessung und finalen Test.
Belege auf dieser Seite
- Nearest Neighbors · geprüft 2026-09-02
- Decision Trees · geprüft 2026-09-02