تخطّي إلى المحتوى
Kudos AI

القيمة الاحتمالية p

احتمال أن نرصد بيانات لا تقلّ تطرّفاً عن البيانات التي بين أيدينا، محسوباً بافتراض صحّة الفرضية الصفرية. تقيس كم تكون العيّنة غير مألوفة في عالم ينعدم فيه الأثر، ولا تقيس سوى ذلك.

يُعرف أيضاً باسم: احتمال الدلالة, مستوى الدلالة المرصود

فهم القيمة الاحتمالية p

ابدأ من الافتراض المراد التشكيك فيه. يفترض الاختبار الإحصائي أوّلاً صحّة الفرضية الصفرية - لا فرق، ولا أثر، ولا شيء يجري - ثمّ يسأل البيانات سؤالاً واحداً: لو كان ذلك صحيحاً، فكم مرّة تبدو عيّنة بهذا القدر من التطرّف أو أكثر؟ ذلك الاحتمال هو القيمة p. وكلّ ما في معناها ينبع من أنّ الفرضية الصفرية افتُرضت صحيحة كي تُحسب.

ولهذا فإنّ القراءة الأشيع ليست غير دقيقة فحسب بل مقلوبة. لا يمكن للقيمة p أن تكون احتمال صحّة الفرضية الصفرية، لأنّ الحساب ثبّتها صحيحة أصلاً؛ ومقدار مشروط بافتراض لا يكون في الوقت نفسه احتمالاً عن ذلك الافتراض. وليست كذلك احتمال أن تكون النتيجة محض مصادفة، ولا مكمّل احتمال تكرار النتيجة.

التوزيع تحت الفرضية الصفرية يجعل التعريف ملموساً. إذا صحّت الفرضية وكان الاختبار سليماً، توزّعت القيمة p بانتظام: كلّ قيمة بين 0 و1 محتملة بالقدر نفسه. محاكاة 50,000 عيّنة من الحجم 25 تحت فرضية صفرية صحيحة تعطي إحصاءة كولموغوروف-سميرنوف قدرها 0.004299 مقابل التوزيع المنتظم، مع وقوع 0.0499 من القيم تحت 0.05. ولا شيء يميّز قيمة 0.03 عن قيمة 0.53 سوى أنّ أحدهم أعلن المنطقة الأولى مثيرة للاهتمام.

ما تثبته القيمة الصغيرة فعلاً هو أنّ البيانات ستكون غير مألوفة لو صحّت الفرضية الصفرية، وهذا دليل حقيقي يستحقّ الاقتناء. وما لا تستطيعه وحدها هو أن تخبرك بمقدار تصديقك للبديل، لأنّ ذلك يتوقّف على مدى معقوليّته سلفاً وعلى حجم الأثر الذي كانت الدراسة قادرة على كشفه. فقيمة p تقلّ عن العتبة بقليل، من دراسة صغيرة، على فرضية كانت مستبعدة أصلاً، دليل ضعيف في ثوب اكتشاف.

كيفية الحساب

p = P(T(X) ≥ t_obs | H₀), and under H₀ valid: p ~ Uniform(0,1)

حيث

H₀
الفرضية الصفرية، مفترَضة الصحّة طوال الحساب
T(X)
إحصاءة الاختبار محسوبةً على إعادة افتراضية للدراسة
t_obs
قيمة تلك الإحصاءة كما رُصدت فعلاً في البيانات المتاحة
≥
تُقرأ «لا تقلّ تطرّفاً عن»؛ وفي الاختبار ثنائي الطرف يؤخذ الذيل من الجهتين

مثال على القيمة الاحتمالية p

تحت فرضية صفرية صحيحة، تعطي 50,000 محاكاة لاختبار t ثنائي الطرف على عيّنات من 25 قيماً p تبعد عن التوزيع المنتظم بمسافة كولموغوروف-سميرنوف قدرها 0.004299 (قيمة الاختبار 0.3129)، ويقع 0.0499 منها تحت 0.05. فمعدّل 5% هو تعريف العتبة لا خاصيّة في البيانات.

أجرِ 20 اختباراً مستقلاً على فرضيات كلّها صفرية، فيكون احتمال خروج واحد منها على الأقل دالّاً عند 0.05 مساوياً 1 - 0.95^20 = 0.641514. ولم يختلّ شيء: كلّ اختبار يخطئ 5% من الوقت كما أُعلن، وعشرون فرصة تكفي لجعل ذلك مرجّحاً مرّة على الأقل.

افترض أنّ فرضية واحدة من كلّ عشر صحيحة فعلاً وأنّ لكلّ اختبار قوّة 0.8 عند alpha = 0.05. لكلّ 100 فرضية تُكشف 8 آثار حقيقية وتُثار 4.5 إنذارات كاذبة من الـ90 الصفرية، فتكون 0.36 من النتائج الدالّة خاطئة. وكلّ اختبار يتصرّف تماماً كما حُدّد له؛ المعدّل القاعدي هو ما أحدث الضرر.

الأسئلة الشائعة

هل تعني p < 0.05 أنّ الأثر حقيقي؟

تعني أنّ البيانات ستكون غير مألوفة لو لم يكن هناك أثر. أمّا كون الأثر حقيقياً فيتوقّف أيضاً على معقوليّته سلفاً وعلى قوّة الدراسة. فمع كون 10% من الفرضيات المختبَرة صحيحة وقوّة 0.8، يكون أكثر من ثلث النتائج الدالّة عند 0.05 إيجابيات كاذبة.

هل تعني القيمة الكبيرة أنّه لا أثر؟

لا. تعني أنّ الدراسة لم تجد الأثر، وهذا لا يفيد إلّا بقدر قوّتها. فاختبار t ثنائي الطرف لعيّنة واحدة عند n = 25 يكشف أثراً قدره نصف انحراف معياري 0.669708 من الوقت فقط، وأثراً قدره خُمس انحراف معياري 0.160504 فقط.

لماذا 0.05؟

عُرفاً، وعُرفاً اعتباطياً بإقرار أصحابه. فهي تضبط معدّل الإيجابيات الكاذبة على المدى الطويل بين الفرضيات الصفرية الصحيحة، أي إنّها قول في معدّل استعدادنا للخطأ. والحقول التي تختبر فرضيات كثيرة دفعةً واحدة تشترط عادةً عتبات أصغر بكثير لهذا السبب بالضبط.

الخلاصة

تجيب القيمة p جيّداً عن سؤال ضيّق واحد: كم ستكون هذه البيانات مفاجئة لو لم يكن هناك شيء يجري؟ ولا تستطيع الإجابة عن السؤال الذي يريده الناس، أي مقدار تصديق الأثر - فذاك يحتاج إلى معقوليّة الفرضية سلفاً وإلى قوّة الدراسة من خلفها.