اذهب إلى المحتوى
  • 0

مشروع regression في مشاكل

السؤال

نشر

https://colab.research.google.com/drive/1E8RrcKxkitkvDHoFFrTk24imY0C3GuJu?usp=sharing دا رابط المشروع 

انا عملت EDA في المشروع للبيانات عادي جدا والبيانات كنت شايفها نظيفه مفيش فيها outliers خالص وانا احاول تدريب نموذج Regression قمت بتجريب كذا نموذج ومع ذالك النتائج مش سيئه بس النموذج لا يتعلم اصلا وانا مش عارف اين المشكله بالظبط 

انا بس عايز اعرف المشكله فين وعايز اعرف Data spliting سليم و Encoding and scaling متنفذ صح  , وانا نفذت هذه العمليات بعد Data split عشان data leakage اريد فحص هذه الاشياء 

Recommended Posts

  • 0
نشر

البيانات عبارة عن ضجيج عشوائي اصطناعي تم توليده عشوائياً دون أي علاقة رياضية أو منطقية بين الخصائص Features وسعر السيارة Target، أي لا يوجد أي نمط (Signal) في البيانات لتتعلمه الخوارزميات، بل تحاول النماذج حفظ ضوضاء عشوائية فتفشل عند الاختبار.

النموذج يحقق معامل تحديد سالب، بالتالي تنبؤات النموذج أسوأ حتى من نموذج بدائي يكتفي بالتنبؤ بالمتوسط الحسابي للأسعار.

يجب أن تنخفض أسعار السيارات مع زيادة المسافة المقطوعة (ارتباط عكسي قوي)، وأن ترتفع مع حداثة سنة الصنع (ارتباط طردي)، في بياناتك، الارتباط بين كل تلك الخصائص والسعر يقترب من الصفر.

وظهور 0 قيم شاذة ليس دليلاً على نظافة البيانات، بل كان الدليل القاطع على أنها بيانات مصطنعة بتوزيع منتظم، فجميع المتغيرات العددية (Year, Mileage, Price, Engine Size) موزعة بانتظام بين حد أدنى وحد أقصى ثابتين.

جرب تشغيل نفس الكود على مجموعة بيانات حقيقية لأسعار السيارات كمجموعة بيانات Cars.gov أو Kaggle Used Cars Dataset.

انضم إلى النقاش

يمكنك أن تنشر الآن وتسجل لاحقًا. إذا كان لديك حساب، فسجل الدخول الآن لتنشر باسم حسابك.

زائر
أجب على هذا السؤال...

×   لقد أضفت محتوى بخط أو تنسيق مختلف.   Restore formatting

  Only 75 emoji are allowed.

×   Your link has been automatically embedded.   Display as a link instead

×   جرى استعادة المحتوى السابق..   امسح المحرر

×   You cannot paste images directly. Upload or insert images from URL.

  • إعلانات

  • تابعنا على



×
×
  • أضف...