إنَّ تقليل عدد المتغيرات التوضيحية التي تُستَخدم في نماذج الإنحدار يَعمَل على التقليل من الجهد والوقت والثمن المستغرق في تقدير وتحليل وتفسير الأنموذج، ويركز على المتغيرات ذات التأثير المعنوي الحقيقي على متغير الاستجابة، وكذلك يضمن لنا سهولة التحليل والفهم لطبيعة العلاقة بين المتغير المعتمد وأهم المتغيرات المستقلة تأثيراً على المتغير التابع إذ إنَّ أية زيادة في عدد المتغيرات التوضيحية غير المهمة في الأنموذج ستؤدي إلى ضياع الجهد دون جدوى، وعليه يجب أنْ يكون هناك توازن بين عملية تقليل عدد المتغيرات التوضيحية وبين زيادة عددها للحصول على نتائج تنبؤية دقيقة، ويكون من الأفضل اختيار المعادلة المُفسِرة بأقل عدد من المتغيرات التوضيحية بحيث تكون هذه المتغيرات مُهِمة ولها تأثير معنوي فعلي على المتغير التابع (Al-Subaihi, 2004).
وبرزت فكرة البحث التي تأخذ بنظر الاعتبار حصانة وكفاءة المقدرات ولهذا ستنصب آليات التحليل على تحصين طرق أختيار أفضل معادلة إنحدار بالطرق التقليدية ضد القيم الشاذة وذلك من خلال تطبيق مجموعة من دوال الوزن وطرق التقدير ومقدرات التباين والمقدرات الأبتدائية البديلة ومن ثم أنتخاب أعلى المقدرات الموزونة كفاءة وتوظيف الاوزان المستحصلة منها في مراحل أختيار أفضل معادلة انحدار.
- التقدير الحصين Robust Estimation
هي طرائق التقدير التي تعمل بشكل جيّد ليس فقط تحت ظروف مثالية, ولكن أيضاً في ظلﱢ ظروف تمثِّل خروجاً عن التوزيع أو الأُنموذج المفترض.
إنّ الهدف الأساسي من الإحصاء الحصين هو تطوير الإجراءات التي تبقى موثوقة وفعالة بشكل معقول في ظلﱢ الإنحرافات الصغيرة عن الأُنموذج. أي عندما يقع التوزيع الأساسي بالقرب من الأنموذج المفترض.
الطرائق الإحصائية الحصينة هي امتداد للطرائق المعلمية , مع الأخذ بنظر الإعتبار أنَّ النماذج المعلمية هي أفضل تقريب للواقع ولكنّها تفقد كفاءتها عند عدم تحقق الفروض التي تقوم عليها(Hurn and Mirosevich, 2008).
- بعض طرائق التقدير الحصين Robust Estimation Methods
إنَّ إتباع الطرائق التقليدية لتقدير معالم الأنموذج تكون غير دقيقة في تحليل البيانات عند وجود القيم الشاذة أو وجود خلل في إحدى فرضيات الإنحدار أو أنَّ توزيع الخطأ يكون غير طبيعي، حيث إنَّ وجود قيمة شاذه واحدة في البيانات سوف يؤدي إلى خلل في خصائص مقدرات المربعات الصغرى وإنَّ المقدر الحصين هو الذي يحافظ على الخصائص المرغوب بها للمقدرات عند خرق بعض فروض الإنحدار وسنلجأ إلى بعض طرائق التقدير الحصينة التي تمَّ تطبيقها في هذه الرسالة:
تعدُّ طريقة التقدير M واحدة من أهم الطرائق الحصينة شائعة الإستخدام, إذ أشارت أغلب الدراسات إلى إنَّ هذه الطريقة تعدُّ من أكثر الطرائق الحصينة سواء في كفاءتها المكافئة لطريقة المربعات الصغرى عندما تتوزَّع الأخطاء توزيعاً طبيعياً بوسط (صفر) وتباين ،وتكون كفاءتها أعلى من كفاءة المربعات الصغرى عندما لاتتوزع الأخطاء توزيعاً طبيعياً أو عند وجود قيم شاذة في البيانات. وقد وسع (1973,Huber) نتائجه للتقدير الحصين من معلمة الموقع إلى حالة الإنحدار الخطي. وقد اكتسبت هذه التقديرات شهرة أكثر من بقية المقدرات الحصينة الأُخرى لأنَّها أكثر مرونة، وكذلك توفر إمكانية تعميمها مباشرة إلى الإنحدار المتعدّد.
وتبدأ عملية التقدير وفق هذه الطريقة (M-estimation) إبتداءاً بإستخدام طريقة المربعات الصغرى الموزونة تكرارياً (Iteratively Re-weighted Least Squares IRWLS) مع إستخدام إحدى دوال وزن مقدرات M، وهي كثيرة، ومن أشهرها هي دوال (Huber, Hampel, Tukey’s Bisquare)، علماً أنَّ دالة Huber تضمن الحصول على مقدرات وحيدة (حل وحيد Unique Solution)، أما الطريقتان الأخريتان (Hampel و Tukey’s Bisquare) فينتج عنهما عدة نهايات صغرى (تعدد الحلول المثلى)، وعندها يصبح من الضروري إستخدام قيم إبتدائية جيّدة بالشكل الذي نضمن فيه حصول تقارب سريع في المقدرات.
ومن الناحية الرياضية تقوم فكرة طريقة التقدير(M) على تحوير الأُسلوب المتبع في طريقة المربعات الصغرى اِلتي تهدف إلى تصغير المقدار الاَتي :
(1)
أي أنَّ
أما طريقة مقدرات (M) فتهدف إلى تصغير المقدار
(2)
إذ تمثِّل دالة بدلالة الأخطاء، ولتصغير المعادلة (1) نشتقها جزئياً بالنسبة لمتجه المقدرات ومساواتها بالصفر، وكما يلي:
(3)
إذ تمثِّل Ѱ المشتقة الجزئية للدالةρ بالنسبة للمعلمات في المعادلة (2)، وتمثِّل منظومة مكونة منP من المعادلات، وتحلُّ باستخدام إحدى الطرق العددية المعروفة أو طريقة المربعات الصغرى الموزونة ((Weighted Least Squares Method ، ولإيجاد مقدرات M يتمُّ استخدام الصيغة الاَتية :
(4)
إذ تمثِّل مصفوفة الأوزان، وهي مصفوفة قطرية (n×n)عناصر قطرها الرئيسية معطاة بالصيغة الاَتية:
(5)
(6)
إذ تمثِّل القيم الإبتدائية لمتجه معلمات الأنموذج، ويتمُّ استخدامها لتحديد الأوزان، ويمكن استخدام مقدرات المربعات الصغرى كقيم ابتدائية وقد تم في هذه البحث أستخدام مقدرات المربعات الصغرى الاعتيادية OLS ومقدرات المربعات الصغرى المبتورة أو المشذبة LTS، ومن التكرار الأول نجد قيمة ، أما في التكرار الثاني فنستخدم في إيجاد الأوزان التي ستستخدم لإيجاد وهكذا تستمر عملية التكرار حتى نحصل على مقياس التقارب(Convergence) المعرف بالصيغة الاَتية :
(7)
إذ تمثِّل δ قيمة صغيرة جدا، rتمثِّل عدد مرات التكرار، أي أنَّ الحلَّ يتوقف عندما يصبح الفرق المطلق بين المعلمات المقدرة في المرحلة الحالية والمعلمات المقدرة في المرحلة السابقة أصغر من القيمة المختارةδ أو يساويها، ولجعل مقدرات (M) تمتلك خاصية ثبات التباين Invariant Scale، فإنَّ الدالة المطلوب تصغيرها هي:
(8)
حيث نقوم بإشتقاق الدالة (8) بالنسبة للمتجه ومساواتها بالصفر فنحصل على دالة الوزن، وكما يلي:
(9)
ويمكن حلُّ المعادلة أعلاه باستخدام الصيغة (2) اذ إنَّ الأوزان يتمُّ إيجادها وفق الصيغة الاَتية:-
(10)
لإيجاد ( ) في المعادلة أعلاه، والتي تمثّل قيمة الإنحراف المعياري، وأنَّ هذه القيمة تقّدر مرة واحدة فقط باستخدام القيم الأولية قبل البدء بالتكرار وهناك عدة صيغ لتقديرها منها:
(11)
(12)
(13)
إذ تمثِّل البواقي و يشير الى الوسيط، ولقد اقترح الباحثون عدداً من الدوال أو مشتقاتها ، بحيث تجعل نتائج التقدير حصينة لا تتأثر بوجود الشواذ، وفيما يلي بعض الدوال المهمة لهذا النوع من المقدرات والمعرفة بدلالة الدالة ، وبافتراض أنَّ وسيط الأخطاء المطلقة (MAD: Median Absolute Deviation) الوارد في الصيغة (13) أعلاه كمقدر للانحراف المعياري، وكما يلي:
اذ أن : تمثل وسيط التوزيع الطبيعي القياسي.
وقد أوجد الباحثون(Montgomery et. al., 2001) الصيغة القياسية للبواقيStandardized Residuals باستخدام ، أنَّ ثابت القطع (C: Tunning Constant)الذي يجعل التباين المقدرMAD غير متحيّز تقريباً لσ عندما يكون حجم العينة كبير والخطأ يتوزع طبيعياً (Hasan and Ridha, 2011). (.
بعض دوال الأوزان لمقدرM
- دالة :(Beatone and Tukey,1974) Tukey Bisquare
(14)
اذ إنَّ c تأخذ القيمة الإفتراضية ، دالة Huber(Huber,1964):
(15)
إذ أنَّ c تأخذ القيمة الإفتراضية ، دالة Hampel (Grubbs,1969):
(16)
إذ إنَّ القيم الإفتراضية لثوابت القطع (Tuning Constants)هي a = 2 b = 4 and c = 8
علماً أنَّ ثابت التوليف (Tunning Constant ) لكلﱢ دالة يستخدم لتعديل كفاءة المقدرات الناتجة لتوزيعات محدّدة ويحقق كفاءة تقريبية مقدارها (95 %) عندما تتبع الاخطاء التوزيع الطبيعي، وأنَّ الإختيار الجيّد لقيمة هذا الثابت يؤدي إلى زيادة حصانة المقدرات، لأنَّ لهذا الثابت تأثيراً كبيراً على حصانة المقدرات، وإنَّ قيمته تتراوح بين انحراف معياري واحد إلى انحرافين معياريين لقيم المشاهدات أو الاخطاء.
اقترح مقدر للإنحراف المعياري للأخطاء بالإعتماد على فكرة(Rousseeuw and Yohai,1984) و(Rousseeuw and Leroy,1987) الذين اقترحوا مقدرات S باعتبارها الحلﱢ الذي يوجد أقل قيمة تشتت ممكن للأخطاء، أي أنّه يقوم بإيجاد
(17) بالتوازي مع مقدرات المربعات الصغرى التي تقوم بتصغير تباين الأخطاء، ويجب أنْ يكون واضحاً بأنَّ مقدرات المربعات الصغرى الإعتيادية OLS يمكن النظر إليها كحالة خاصة أقل حصانة من مقدراتS ، فعندما نبدأ بتصغير تباين الأخطاء فإنَّ مقدرات S الحصينة ستقوم بتصغير مقدر التباين الحصين للأخطاء أي أنَّه يقوم بتصغير قيمة المعادلة التالية:
(18)
اذ إنَّ قيمة ثابت تعرف على أنَّها , حيث تمثّل التوزيع الطبيعي القياسي, وبعد أخذ الإشتقاق لهذه المعادلة وحلِّها نحصل على
(19)
حيث إنّ يتمُّ استبدالها بدالة وزن مناسبة. كما هو الحال بالنسبة لأكثر مقدرات M , ومن أمثلة دوال الوزن دالتي Huber أو biweightأو Hampel وغيرهم. وعلى الرغم من أنَّ مقدرات S لها نقطة انهيار تبلغ 0.5 فإنَّ كلفة ذلك هو أنَّ هذه المقدرات تمتلك كفاءة منخفضة جداً حيث تبلغ كفاءتها مقارنة بطريقة المربعات الصغرى 30% فقط حسب مابين كلٍّ من (Croux et. al., 1994).
- طريقة MM الحصينة (Rousseeuw and Leroy,1987) :
تقوم هذه الطريقة بتقدير معلمات الإنحدار باستعمال تقدير (S الحصين)، وذلك بتصغير minimize مقياس الإنحراف المعياري للبواقي من طريقة M. إنَّ طريقة (MM) تهدف للحصول على مقدرات ذات قيم عالية الدقة أو أكثر كفاءة. قبل استعمال المشاهدات في الأنموذج وهي:
(20)
إذ إنَّ هو الإنحراف المعياري الذي يتمُّ الحصول عليه من بواقي تقدير S و هي دالة Tukeys الموزونة
(21)
- طريقة المربعات الصغرى المشذبة (LTS) Least Trimmed Squares ethod:
إنَّ العديد من الباحثين لم يدرك أنَّ أداء المربعات الصغرى الإعتيادية OLS (Ordinary Least Squares) يمكن أنْ يكون ضعيفاً جداً عندما يكون شكل التوزيع الطبيعي للبيانات ذات ذيول (أطراف) ثقيلة (Heavy tails)، والتي تنشأ من القيم الشاذة حتى إذا كانت هناك قيمة شاذة واحدة فقط فانه سوف يكون لها تأثير كبير على تقديراتOLS. وللتغلب على هذه المشكلة سوف يتمُّ استخدام مقدر حصين له نقطة انهيار عالية كبديل عن طريقة OLS. ومن البدائل المتوفرة مقدر LTS الذي أُقترح من قبل (Rousseeuw and Yohai,1984) الذي يكون لديه نقطة انهيار(Breakdowm point) عالية تساوي .(Uraibi.et.,2009)
نحصل عليه بالشكل الاَتي:
إذ إنّ تمثِّل مربعات حدِّ الخطأ. وهذه الطريقة تقلل من نسبة تأثير القيم الشاذة (α) في البيانات. لتشذيب (لقطع) نسبة α اقترح (Rousseeuw and Leroy,1987) اختيارh حسب الصيغة الاَتية:-
(22)
إذ إنَّ p تمثِّل عدد المعلمات. ومن مميّزات استخدام طريقة LTS السيطرة على مستوى التشذيب الذي يعتمد على تشابه النسبة المئوية المبتورة لنسبة القيم الشاذة. إذا كان هناك شك في إنَّ البيانات تحتوي على مايقرب 10% من القيم الشاذة، فإنَّ LTS سوف تقطع 10% من الطرفين أي أنَّ عملية التقدير تتمُّ بما نسبته 80% من المشاهدات الأصلية (2012Arif ,).
- طريقة LASSO المكيفة (Wang et al. 2013) ((Zou. 2006:
(23)
اذ أن : : معلمة الضبط (التوليف) معلمة التنظيم :
التطبيق العملي
- جانب المحاكاة (الخوارزمية المقترحة للجانب التجريبي) Simulation Side
تقوم فكرة الخوارزمية التي تسعى البحث إلى تقديمها إلى تقدير المعلمات بأسلوب M وبدوال أوزان مختلفة من خلال إدخال كلﱢ المتغيرات في الأنموذج وتطبيق عدة حالات تتمثّل بتغيير المقدرات الإبتدائية ومقدرات التباين والأوزان المستخدمة. وقد تمَّ اللجوء إلى إثنين من أهم المقدرات الحصينة، وهما مقدر M-estimation الحصين ضد القيم الشاذة في المتغيّر المعتمد (y-outliers)، وكذلك مقدر MM-estimation الذي يمتلك حصانة ضد القيم الشاذة في كلٍّ من المتغيرين المعتمد، وكذلك المتغير المستقل (تدعى القيم الشاذة في فضاء المتغيّرات المستقلة بالقيم الجاذبة أو الفعالة أو المخلة (X-leverage points)، حيث أنَّ مقدر MM-estimation هو عبارة عن مقدر M-estimation بدالة وزن Tukey's biweight معتمدة على أحد مقدرات S (S-estimator) وفي أدناه مخطط إنسيابي للخوارزمية المقترحة.
وتم استخدام ثلاثة احجام عينات ، وتم أختبار بُعدين لأنموذج الانحدار كما هو واضح في الخوارزمية أعلاه وهما وتم استخدام ثلاثة نسب للتلويث وتمت عملية التلويث باستخدام طريقة تلويث صف كامل وهو الاسلوب الذي إتبعه (Toka et.al.,2021) والذي يطلق عليه casewise وتم تغيير الوسط الحسابي للقيم الملوثة مرتين، حيث أن بيانات المحاكاة قد تم توليدها بوسط حسابي = صفر وعند تلويث البيانات تم تبديل الوسط الحسابي بقيمتين وتم تغيير قيمة الأنحراف المعياري من إلى وبذلك أصبحت القيم الملوثة مختلفة من حيث قيمة المتوسط والتباين وكل الملوثات قد تم توليدها من التوزيع الطبيعي وتم تكرار توليد عينة لأختبار كل طريقة من طرق التقدير المقترحة وكانت سيناريوهات التلويث تتضمن تلويث y مره والمتغيرات المستقلة X'S مرة،
وكليهما معاً مرة ثالثة وبلغ إجمالي نماذج المحاكاة التي تم توليدها في دراسة المحاكاة هو 561,600، حيث تم توليدها وفقاً للتالي : أنموذج رياضي مقدر (علماً أن كل مقدر حصين يحتاج إلى ما أقصاه 20 تكراراً ليصل الى التقارب، أي أن عدد النماذج المقدرة فعلياً قد يصل إلى أنموذجاً مقدراً).
المخطط الانسيابي الوارد في البحث عبر عن الخوارزمية المقترحة حيث اعتمدت الباحثة على مفهوم الخوارزمية الذي يمثل مجموعة من الخطوات الرياضية والمنطقية والمتسلسلة اللازمة لحل مشكلة البحث لتحصين عملية اختيار المتغيرات في معادلة الانحدار وتم رسم المخطط الانسابي Flow Chart للتعبير عن خطوات الخوارزمية.
المخطط الانسيابي للطريقة المقترحة لإختيار أفضل مقدر لاختيار أفضل معادلة إنحدار
|
المربعات الصغرى المشذبة LTS
|
|
إستخدام الأوزان الحصينة الناتجة من التقاطعات بين المقدرات أعلاه
لوزن طريقة المربعات الصغرى والحصول على مقدر WLS
|
|
تطبيق المحاكاة بعدة سيناريوهات بـِ 200 تكرار بتغيير حجم العينة (50,100,300) وأبعاد الأنموذج (3,9) ونسبة التلويث (5%,20%,40%) في البيانات وتم تغيير قيمة المتوسط الى قيمتين وتم كذلك تغيير قيمة الأنحراف المعياري إلى
|
|
إختيار النموذج الذي يحقق أعلى كفاءة بإستخدام معيار جذر متوسط مربعات الخطأ RMSE
|
|
تحديد المتغيّرات المؤثِّرة على المتغيّر المعتمد بإستخدام المقدر ذي أعلى كفاءة من بين مقدرات WLS ومقدر لاسو المكيف الحصين Adaptive LASSO علماً أنَّ العدد الكلي للمقدرات البديلة التي تمَّ إختبارها 24 مقدر WLS ومقدر Adaptive LASSO و LS
|
|
تم تغيير قيمة الانحراف المعياري للقيم الشاذة إلى
|
لغرض أختيار الأنموذج الأفضل تم تنفيذ على بيانات مولدة بأستخدام برنامج R حيث تم أختيار الطريقة التي أثبتت أعلى كفاءة (أقل RMSE) في تجارب المحاكاة وتمت مقارنتها مع طريقة Adaptive LASSO الحصينة مقارنة بالطريقة الأكثر شيوعاً، وقد ثبت بأنها قد تغلبت على طريقة LASSOبعد أختيار أعلى دوال المربعات الصغرى الموزونة كفاءةً.
جدول (1) : الطرق التي حققت أفضل أداء (أقل RMSE) في حالة وجود قيم شاذة في المتغير المعتمد
|
لنموذج بثلاثة متغيرات
|
|
نسبة التلويث
|
محور الشواذ
|
حجم العينة
|
قيمة المتوسط
|
أكفأ طريقة
|
|
6%
|
Y-outlier
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LS.Bisquare.Mad.M
|
|
20%
|
WLS.LTS.HAMPEL.Huber.M
|
|
40%
|
|
5%
|
100
|
WLS.LS.Bisquare.Mad.M
|
|
20%
|
|
40%
|
|
5%
|
300
|
WLS.LS.Hampel.Huber.M
|
|
20%
|
WLS.LS.Hampel.Mad.M
|
|
40%
|
WLS.LS.Bisquare.Mad.M
|
|
6%
|
50
|
عند قيمة وسط حسابي = 500
|
لم تتفوق أي من
الطرق على نظيراتها
|
|
20%
|
WLS.LS.Hampel.Mad.M
|
|
%40
|
WLS.LTS.HAMPEL.Huber.M
|
|
5%
|
100
|
WLS.LS.Hampel.Huber.M
WLS.LS.Bisquar.Mad.M
|
|
20%
|
WLS.LS.Bisquar.Mad.M
WLS.LS.Hampel.Huber.M
|
|
40%
|
WLS.LS.Bisquar.Mad.M
|
|
5%
|
300
|
WLS.LS.Hampel.Huber.M
|
|
20%
|
|
40%
|
WLS.LS.Hampel.Mad.M
WLS.LTS.HAMPEL.Huber.M
|
|
لنموذج بتسعة متغيرات
|
|
6%
|
Y-outlier
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LS.HAMPEL.Huber.M
|
|
%20
|
WLS.LS.Bisquar.Mad.M
|
|
%40
|
|
5%
|
100
|
WLS.LS.HAMPEL.Huber.M
|
|
%20
|
WLS.LTS.HAMPEL.Huber.M
|
|
%40
|
WLS.LS.Bisquar.Mad.M
|
|
5%
|
300
|
WLS.LS.HAMPEL.Huber.M
|
|
%20
|
WLS.LS.Bisquar.Mad.M
|
|
%40
|
|
%6
|
50
|
عند قيمة وسط حسابي = 500
|
WLS.LS.HAMPEL.Huber.M
|
|
20%
|
WLS.LS.Bisquar.Mad.M
|
|
%40
|
|
%5
|
100
|
WLS.LS.HAMPEL.Huber.M
|
|
20%
|
WLS.LTS.HAMPEL.Huber.M
|
|
%40
|
WLS.LS.Bisquar.Mad.M
|
|
%5
|
300
|
WLS.LS.HAMPEL.Huber.M
|
|
20%
|
WLS.LS.Bisquar.Mad.M
|
|
%40
|
جدول (2) :الطرق التي حققت أفضل أداء (أقل RMSE) في حالة وجود قيم إنعطاف (شواذ) في المتغيرات المستقلة
|
لنموذج بثلاثة متغيرات
|
|
نسبة التلويث
|
محور الشواذ
|
حجم العينة
|
قيمة المتوسط
|
أكفأ طريقة
|
|
6%
|
X-leverage
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
|
5%
|
100
|
|
20%
|
|
40%
|
|
5%
|
300
|
|
20%
|
|
40%
|
WLS.LS.Hampel.Mad.M
LS
|
|
6%
|
50
|
عند قيمة وسط حسابي = 500
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
|
5%
|
100
|
|
20%
|
|
40%
|
|
5%
|
300
|
|
20%
|
|
40%
|
LS
|
|
لنموذج بتسعة متغيرات
|
|
6%
|
X-leverage
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LTS.HAMPEL.Huber.M
|
|
%20
|
|
%40
|
|
5%
|
100
|
|
%20
|
|
%40
|
|
%5
|
300
|
|
20%
|
|
%40
|
|
%6
|
50
|
عند قيمة وسط حسابي = 500
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
%40
|
|
%5
|
100
|
|
20%
|
|
%40
|
|
%5
|
300
|
|
20%
|
|
%40
|
جدول (3) : الطرق التي حققت أفضل أداء (أقل RMSE) في حالة وجود قيم شاذة في المتغيرين XوY
|
لنموذج بثلاثة متغيرات
|
|
6%
|
X-leverage
Y-outlier
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
WLS.LS.Bisquar.Mad.M
|
|
5%
|
100
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
WLS.LS.Bisquar.Mad.M
|
|
5%
|
300
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
WLS.LTS.HAMPEL.Huber.M
WLS.LS.Bisquar.Mad.M
|
|
40%
|
WLS.LS.Hampel.Huber.M
|
|
6%
|
50
|
عند قيمة وسط حسابي = 500
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
WLS.LS.Bisquar.Mad.M
|
|
5%
|
100
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
40%
|
|
5%
|
300
|
|
20%
|
|
40%
|
LS
|
|
لنموذج بتسعة متغيرات
|
|
6%
|
X-leverage
Y-outlier
|
50
|
عند قيمة وسط حسابي = 100
|
WLS.LTS.HAMPEL.Huber.M
|
|
%20
|
|
%40
|
|
5%
|
100
|
|
%20
|
|
%40
|
WLS.LS.Hampel.Mad.M
LS
|
|
5%
|
300
|
WLS.LTS.HAMPEL.Huber.M
|
|
%20
|
|
%40
|
LS
|
|
%6
|
50
|
عند قيمة وسط حسابي = 500
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
%40
|
WLS.LS.Bisquar.Mad.M
|
|
%5
|
100
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
%40
|
WLS.LS.Bisquar.Mad.M
|
|
%5
|
300
|
WLS.LTS.HAMPEL.Huber.M
|
|
20%
|
|
%40
|
LS
|
وعند النظر إلى الجداول الثلاثة (1) و (2) و (3) أعلاه الذين يمثلون ملخص نهائي لكافة تجارب المحاكاة لكل احجام النماذج والعينات ونسب التلويث ودوال الوزن وقيمتي المتوسط، حيث تظهر الطرق الأعلى كفاءة لكل حالة وتعطي الباحثين خارطة طريق حول طريقة التقدير المناسبة لكل حالة. وإذا وددنا إستخلاص طريقة متفوقة إجمالاً لكل حالة من حالات تلويث البيانات بالقيم الشاذة وكما هو مبين فيما يلي:
- كانت طريقة LS.Bisquare.Mad.M أكثر الطرق التي حققت أعلى كفاءة (اقلهم بقيمة RMSE) من بين كل الطرق التي تمت مقارنتها في دراسة المحاكاة عند وجود شواذ في المتغير المعتمد y-outliers في اغلب الحالات التي تمت مقارنتها
- كانت طريقة LTS.HAMPEL.Huber.M أكثر الطرق التي حققت أعلى كفاءة (اقلهم بقيمة RMSE) من بين كل الطرق التي تمت مقارنتها في دراسة المحاكاة عند وجود شواذ في المتغيرات المستقلة X-leverage points في اغلب الحالات التي تمت مقارنتها
- كانت طريقة LTS.HAMPEL.Huber.M أكثر الطرق التي حققت أعلى كفاءة (اقلهم بقيمة RMSE) من بين كل الطرق التي تمت مقارنتها في دراسة المحاكاة عند وجود شواذ في المتغير المعتمد y-outliers وفي المتغيرات المستقلة X-leverage points في اغلب الحالات التي تمت مقارنتها
والنقاط الواردة في أعلاه تعطي خارطة طريق موجزة يمكن للباحثين إستخدامها لاختيار طريقة التقدير الملائمة في حالة عدم توفر معلومات واضحة حول نسب الشواذ في البيانات ونوعها.
- الجانب التطبيقي Applied Side
جمع البيانات (Al-Nuaimi, 2005) :
طبقت هذه الدراسة على بيانات جمعت من مستشفى ابن الأثير التعليمي للولادة والأطفال في الموصل ، من مرضى مصابين بفقر دم البحر الأبيض المتوسط من نوع بيتا او ما يسمى الثلاسيميا ، وكان عدد المشاهدات (150) حيث أن المتغير المعتمد أو المستجيب في الدراسة مثل عمر العظم مقاساً بالشهر Age of the Bone (Month) كما واختير عدد من المتغيرات التي يعتقد بأنها تؤثر فيه بعد مراجعة أطباء اختصاصيين وممارسين في مرض الثلاسيميا.
|
|
أسم المتغير
|
Variable Name
|
|
X1
|
العمر الحقيقي (مقاساً بالشهر)
|
Real Age (Month)
|
|
X2
|
عمر المريض عند ظهور المرض (مقاساً بالشهر)
|
Onset of Disease (Month)
|
|
X3
|
تضخم الكبد (مقاساً بالسنتمتر)
|
Enlargement of liver )c.m)
|
|
X4
|
هيموكلوبين الدم
|
Hemoglobin
|
|
X5
|
مكداس الدم (خلايا الدم المضغوط)
|
Packed cell volume
|
|
X6
|
الخلايا الشبكية
|
Reticulacyte
|
|
X7
|
الأرومة الحمراء
|
Normooblast
|
|
X8
|
الهيموكلوبين الجيني
|
Fetal Hemoglobin
|
|
X9
|
عدد وحدات الدم
|
Number of Blood units
|
|
X10
|
بداية نقل الدم حسب العمر(مقاساً بالشهر)
|
Onset of Blood Trans fusion To According
|
جدول (4): كفاءة النماذج النهائية لكل الطرق المقارنة
|
الطريقة
|
X.Intercept.
|
|
|
|
|
|
|
|
|
|
|
|
|
AIC
|
|
|
LS (كل الانحدارات الممكنة بدون أوزان)
|
1
|
1
|
0
|
0
|
1
|
0
|
0
|
0
|
0
|
1
|
0
|
0.817
|
0.814
|
1274.478
|
2.2e-16
|
|
LS (الحذف العكسي بدون أوزان)
LS (الاختيار الامامي بدون أوزان)
LS (الانحدار التدريجي بدون أوزان)
|
1
|
1
|
1
|
0
|
1
|
1
|
0
|
1
|
0
|
1
|
0
|
0.836
|
0.8291
|
836.72
|
2.2e-16
|
|
WLS.LS.Bisquare.Mad.M
(كل الانحدارات الممكنة)
|
1
|
1
|
0
|
0
|
1
|
0
|
0
|
0
|
0
|
1
|
0
|
0.882
|
0.88
|
1205.105
|
2.2e-16
|
|
WLS.LS.Bisquare.Mad.M
(طريقة الحذف العكسي)
WLS.LS.Bisquare.Mad.M
(طريقة الإختيار الأمامي)
WLS.LS.Bisquare.Mad.M
(الإنحدار التدريجي)
|
1
|
1
|
1
|
1
|
1
|
1
|
0
|
1
|
0
|
1
|
0
|
0.9036
|
0.8989
|
729.29
|
2.2e-16
|
|
Robust Variable Selection
Exponential Squared Loss
|
1
|
1
|
0
|
0
|
1
|
0
|
0
|
0
|
0
|
0
|
0
|
0.7415
|
0.7229
|
-181.9097
|
Not Available
|
وبالنظر إلى الجدول (4) أعلاه نلاحظ أن الطرق المختلفة قد أنتجت نماذجاً مختلفة، فمنها ما قام بإستبعاد أغلب المتغيرات مثل طريقتي كل الانحدارات الممكنة وطريقة LASSO اللتان أبقيتا 3 و 2 متغيرات في الأنموذج على التوالي وهذا خلاف ماتمت مناقشته مع أطباء الإختصاص الذين أكدوا بأن المتغيرات العشرة الموجودة في الأنموذج مهمة وتؤثر على الإصابة بمرض الثلاسيميا وعليه فإن طرق الاختيار الامامي والحذف العكسي والانحدار التدريجي التي تم وزنها بالأوزان الحصينة والتي حققت أعلى كفاءة في دراسات المحاكاة في غالبية الحالات وهي طريقة WLS.LS.Bisquare.Mad.M التي جمعت بين الحصانة والكفاءة فضلاً عن إتفاقها مع الرؤية الطبية لهذا المرض.
ومن ناحية أخرى فإن المقارنة بين مقاييس الكفاءة بين نماذج تختلف في عدد متغيراتها غير مجدية لأن تلك المقاييس ترتبط بعدد المتغيرات الموجودة في الأنموذج، فعلى سبيل المثال فإن قيمة معامل التحديد تزداد بزيادة عدد المتغيرات وذلك لأن كل متغير مضاف إلى الأنموذج يمتلك مجموع مربعات موجب وبالتالي فإن إضافته ستؤدي إلى إضافة قيمة موجبة إلى البسط، وبما أن مقام حساب معامل التحديد يحتوي على مجموع المربعات الكلي فبالتالي فهو قيمة ثابتة وزيادة البسط ستؤدي إلى زيادة القيمة الكلية للكسر وعليه تميل الباحثة إلى إعتماد نتائج المحاكاة التي تم فيها تنفيذ عملية التقدير مئات الالاف من المرات وأعتماد الأنموذج النهائي الذي نتج من طريقة WLS.LS.Bisquare.Mad.M كنموذج نهائي يتم إعتماده لتشخيص أهم المتغيرات المؤثرة على الاصابة بالثلاسيميا. ونفس الامر ينطبق على معيار AIC والذي ترتبط عملية حسابه أيضاً بعدد المتغيرات في الأنموذج كون أن زيادة عدد المتغيرات سيطرح رقماً موجباً من البسط ( ) وبذلك فإن طرح رقم صغير أو كبير من سيكون له تأثير كبير على قيمة لوغارتم المقدار فتنتج لدينا أحياناً قيمٌ سالبة تجعل قيمة AIC سالبة. أما لو كانت النماذج التي تتم مقارنتها من نفس البعد (نفس عدد المتغيرات) لأمكنت مقارنتها باستخدام تلك المعايير ولكن هذا لايتحقق في طرق إختيار أفضل معادلة إنحدار التي تعمل على الموازنة بين تقليل عدد المتغيرات في الأنموذج وبين زيادة كفاءة الأنموذج المقدر.