تقييم نماذج التعلم الآلي يعني قياس أدائها بشكل جيد — باستخدام المقاييس المناسبة (الدقة، الضبط، الاستدعاء، إلخ) على بيانات الاختبار التي لم يرها النموذج من قبل. التقييم الصحيح ضروري لمعرفة ما إذا كان النموذج يعمل فعلاً وموثوقاً.
التقييم على بيانات لم يرها النموذج
→ evaluate on a TEST set the model did NOT train on → measures GENERALIZATION (real performance)
→ training accuracy alone is misleading (a model can memorize training data)
→ train/validation/test split; cross-validation → reliable performance estimates
