تخطّي إلى المحتوى
Kudos AI

القوّة الإحصائية

احتمال أن يرفض الاختبار الفرضية الصفرية حين يكون بديل محدّد صحيحاً. أي فرصة كشف أثر موجود فعلاً، وهي مثبَّتة بالتصميم قبل جمع أيّ بيانات.

يُعرف أيضاً باسم: حساسيّة الاختبار, 1 − β

فهم القوّة الإحصائية

يخطئ الاختبار بطريقتين غير متماثلتين. فقد يرفض فرضية صفرية صحيحة، وذلك بمعدّل alpha الذي يختاره المحلّل، وقد يعجز عن الرفض مع وجود أثر فعلي، وذلك بمعدّل beta يرثه المحلّل من التصميم في الأغلب. والقوّة هي 1 - beta: احتمال كشف الأثر.

والقوّة دائماً قوّة في مواجهة شيء. فهي تتوقّف على حجم الأثر المطلوب، وتشتّت القياسات، وحجم العيّنة، وقيمة alpha المختارة؛ وذكرها بلا تسمية حجم أثر لا يعني شيئاً. والعُرف أن يُعبَّر عن الأثر بالانحرافات المعيارية، فيصف «نصف انحراف معياري» فرقاً ذا معنى عبر مقاييس القياس المختلفة.

والنتيجة العملية أنّ نتيجة غير دالّة ليست حكماً بانعدام الأثر ما لم تكن الدراسة قادرة بشكل معقول على إيجاده. فاختبار t ثنائي الطرف لعيّنة واحدة يبحث عن نصف انحراف معياري قوّته 0.293176 عند n = 10، و0.669708 عند n = 25، و0.933898 عند n = 50، و0.998610 عند n = 100. ودراسة من 25 لا تُبلغ عن شيء كانت ستُفوّت أثراً حقيقياً بهذا الحجم ثلث الوقت؛ وعند خُمس انحراف معياري يفوّته التصميم نفسه خمس مرّات من ستّ.

والأعمال ضعيفة القوّة تضرّ كذلك بالنتائج التي تبلغ الدلالة. فإذا كانت فرضية من عشر صحيحة والقوّة 0.8، أعطت الاختبارات لكلّ 100 فرضية 8 اكتشافات صحيحة و4.5 إنذارات كاذبة، فتكون 0.36 من النتائج الدالّة خاطئة. وخفض القوّة يرفع هذه النسبة، لأنّه يقلّص الاكتشافات الصحيحة في المقام ويترك الإيجابيات الكاذبة في البسط كما هي - ولهذا فالقوّة سؤال عن مصداقيّة أدبيّات بأكملها، لا عن تجربة واحدة فحسب.

كيفية الحساب

power = 1 − β = P(reject H₀ | H₁ true), with β = P(type II error)

حيث

α
معدّل الخطأ من النوع الأوّل: رفض فرضية صفرية صحيحة، يختاره المحلّل (0.05 عادةً)
β
معدّل الخطأ من النوع الثاني: عدم الرفض مع صحّة البديل
H₁
بديل محدّد يشمل حجم الأثر - وبدونه لا تُعرَّف القوّة
δ√n
معامل اللامركزية: حجم الأثر بالانحرافات المعيارية مضروباً في جذر حجم العيّنة

مثال على القوّة الإحصائية

اختبار t ثنائي الطرف لعيّنة واحدة، alpha = 0.05، أثر بنصف انحراف معياري، محسوباً من توزيع ستيودنت اللامركزي لا بالمحاكاة: القوّة 0.293176 عند n = 10، و0.669708 عند n = 25، و0.933898 عند n = 50، و0.998610 عند n = 100. وبلوغ الـ80% المتعارف عليها يتطلّب n = 34.

والتصميم نفسه بحثاً عن خُمس انحراف معياري قوّته 0.160504 عند n = 25. فمثل هذه الدراسة تفوّت أثراً حقيقياً خمس مرّات من ستّ، ونتيجتها الصفرية لا تحمل معلومة تُذكر.

ومع كون 10% من الفرضيات المختبَرة صحيحة، وalpha = 0.05، وقوّة 0.8، يكون معدّل الاكتشافات الكاذبة بين النتائج الدالّة (0.9 × 0.05) / (0.1 × 0.8 + 0.9 × 0.05) = 0.36. وإجراء 20 اختباراً مستقلاً على فرضيات صفرية صحيحة يعطي نتيجة دالّة واحدة على الأقل 0.641514 من الوقت؛ وعتبة بونفيروني عند 0.0025 تعيد ذلك إلى 0.048830.

الأسئلة الشائعة

هل يمكن حساب القوّة بأثر رجعي من الأثر المرصود؟

ليس على نحو مفيد. فالقوّة المحسوبة من الأثر الذي رصدته الدراسة صدفةً إعادة صياغة للقيمة p لا معلومة جديدة. والقوّة كمّية تصميم، وحجم الأثر الذي تُحسب في مواجهته ينبغي أن يكون أصغر حجم يستحقّ الكشف.

كم تكلّف زيادة القوّة من البيانات؟

أكثر ممّا يوحي الحدس، لأنّ الدقّة تتحسّن كجذر حجم العيّنة. فالانتقال من قوّة 0.669708 إلى 0.933898 لأثر بنصف انحراف معياري يعني الانتقال من 25 مشاهدة إلى 50، ثمّ تتضاءل العوائد بعد ذلك.

لماذا لا نخفض alpha ببساطة توخّياً للحذر؟

لأنّ الخطأين يتبادلان. فخفض alpha يقلّل الإيجابيات الكاذبة ويخفض القوّة مباشرةً، فيرفع احتمال تفويت آثار حقيقية. وبونفيروني عند 0.0025 لعشرين اختباراً يضبط خطأ العائلة عند 0.048830، ويدفع ثمن ذلك في كلّ اختبار على حدة.

الخلاصة

تُحسم القوّة قبل وجود أيّ بيانات، وهي التي تحدّد قيمة نتيجتَي الدراسة معاً: ما الذي تجيز النتيجة الصفرية استنتاجه، وأيّ نسبة من النتائج الدالّة في حقل ما تكون حقيقية. وهي أرخص ما يُضبط سلفاً وأغلى ما يُكتشف لاحقاً.