فهم المقارنات المتعدّدة
مستوى معنوية 5٪ يَعِد بأنّ اختباراً واحداً محدَّداً مسبقاً على بيانات بلا أثر سيضلّلك مرّة من كلّ عشرين. ولا شيء من هذا الوعد ينجو من التطبيق المتكرّر. فمع عشرين متريكاً صفرياً مستقلّاً يكون احتمال أن يخرج واحد على الأقلّ معنوياً هو واحد ناقص 0.95 مرفوعة إلى العشرين، أي 64.2٪؛ وعند خمسين متريكاً 92.3٪. والاختبارات تتصرّف كما صُمّمت تماماً، أمّا العرض فلا.
والحساب نفسه ينطبق على الزمن لا على المتريكات. فتجربة A/A، ذراعاها متطابقان بحكم البناء، معنوية 5.0٪ من الوقت حين تُقرأ مرّة عند حجمها المخطّط. وراجعها عشر مرّات مع تراكم البيانات وأوقف عند أوّل عبور، فتصير معنوية 19.3٪ من الوقت. إذ يهيم التقدير مع كبر العيّنة، والكمّية الهائمة تعبر أيّ خطّ ثابت في النهاية؛ والتوقّف هناك يبقي النتوء ويطرح العودة.
وعلى المجموعات الفرعية أيضاً. فتقطيع تجربة صفرية إلى اثنتي عشرة شريحة ينتج شريحة معنوية واحدة على الأقلّ في 46.4٪ من التشغيلات. وزيادة البيانات لا تنفع: فمع عيّنة أكبر لا يزال الاختبار الصفريّ يصنع شرائح زائفة بالوتيرة نفسها، لأنّ الوتيرة تعتمد على عدد الفرص لا على دقّتها.
والتصحيحات موجودة وهي تعمل. فبونفيروني يقسم العتبة على عدد الاختبارات، فيعيد عشرين متريكاً إلى معدّل عائليّ قدره 4.9٪، بكلفة أن يعمل كلّ اختبار عند 0.25٪ ويحتاج بيانات أكثر بكثير للقوّة نفسها. وإجراءات معدّل الاكتشافات الكاذبة أقلّ شدّة وتضبط كمّية أخرى. لكنّ كلّ تصحيح لا يعدّ إلّا المقارنات التي تعلنها، والمحلّل الذي جرّب عشرين متريكاً وثلاث شرائح وأربع نوافذ قبل أن يعرض واحدة أجرى مقارنات لا يراها أيّ تصحيح.
كيفية الحساب
P(at least one false positive) = 1 − (1 − α)^m; Bonferroni: test each at α/m
حيث
- α
- مستوى معنوية الاختبار المفرد، وعادةً 0.05
- m
- عدد الفرص المستقلّة: متريكات أو شرائح أو صيغ (والنظرات المتكرّرة إلى البيانات نفسها مترابطة فتعطي أقلّ)
- معدّل الخطأ العائليّ
- احتمال إيجابية كاذبة واحدة على الأقلّ عبر الـm كلّها
- معدّل الاكتشافات الكاذبة
- النسبة المتوقّعة للكاذب بين ما تعلنه من نتائج
مثال على المقارنات المتعدّدة
عند مستوى 5٪، احتمال أن يخرج متريك صفريّ مستقلّ واحد على الأقلّ من 1 و5 و20 و50 معنوياً هو 5.0٪ و22.6٪ و64.2٪ و92.3٪.
تجربة A/A تُقرأ مرّة: معنوية 5.0٪ من الوقت. والتجربة نفسها تُراجَع عشر مرّات وتُوقَف مبكراً: 19.3٪، أي تضخيم نحو أربعة أضعاف.
تجربة صفرية مقطَّعة إلى اثنتي عشرة شريحة تعطي شريحة معنوية واحدة على الأقلّ في 46.4٪ من التشغيلات، ولا تخفض العيّنة الأكبر تلك الوتيرة.
الأسئلة الشائعة
أيصلح التصحيح نتيجة وجدتها بالاستكشاف؟
ليس حقّاً. فهو لا يحسب إلّا المقارنات التي يمكن عدّها، والاستكشاف يولّد مقارنات لا تُعدّ. والمعاملة الأمينة لنتيجة استكشافية أن تُعدّ فرضية، تُؤكَّد أو تُترَك باختبار جديد مصوَّب إليها.
أمن الخطأ النظر في تجربة وهي جارية؟
الخطأ أن تتوقّف على ما ترى، تحت اختبار افترض نظرة واحدة. والتصاميم التتابعية وجداول إنفاق ألفا موجودة لهذا بالضبط: فهي تنفق ميزانية الخطأ عن قصد لا عرضاً.
أيّ تصحيح أستعمل؟
يتوقّف على ما تحميه. فالإجراءات العائلية كبونفيروني أو هولم صحيحة حين يكون ادّعاء كاذب واحد باهظاً. وإجراءات معدّل الاكتشافات الكاذبة صحيحة حين تغربل مرشّحين كثيرين وتحتمل نسبةً معلومة من الخيوط الكاذبة.
الخلاصة
التعدّدية هي سبب قدرة دراسة نظرت في كلّ شيء على أن تجد شيئاً في أيّ بيانات تقريباً، بما فيها بيانات لا يقع فيها شيء. والحساب بسيط والانضباط بنيويّ: أعلن المتريك والجمهور وقاعدة التوقّف قبل وصول البيانات، لأنّ أيّ تصحيح لاحق لا يرى الخيارات التي لم تسجّلها.