Ocenianie modeli ML oznacza pomiar ich wydajności — używając odpowiednich metryk (accuracy, precision, recall, itd.) na danych testowych, których model wcześniej nie widział. Właściwa ocena jest niezbędna do stwierdzenia, czy model rzeczywiście działa i jest niezawodny.
Ocenianie na nieznanych danych
→ evaluate on a TEST set the model did NOT train on → measures GENERALIZATION (real performance)
→ training accuracy alone is misleading (a model can memorize training data)
→ train/validation/test split; cross-validation → reliable performance estimates
