القوّة الإحصائية ولعنة الفائز
لماذا يُثبَّت حجم العيّنة قبل بدء التجربة، وما الذي تعلنه تجربة ناقصة القوّة حين تبلغ المعنوية، وسبب أنّ تنصيف الأثر الذي يهمّك يضاعف الزوّار اللازمين أربع مرّات.
تجري تجربتان على الميزة نفسها. الأولى بـ14751 مستخدماً في كلّ ذراع، تجد ارتفاعاً قدره 1.0 نقطة فتُطلِق. والثانية بـ2000 مستخدم في كلّ ذراع، تجد ارتفاعاً قدره 2.4 نقطة فتُطلِق بحماس.
الفريق الثاني أكثر حماساً وأبعد عن الصواب، والسبب حسابيّ لا سوء حظّ.
تحديد حجم التجربة
افترض أنّ معدّل التحويل عندك 10٪ وأنّ تحسّناً بنقطة واحدة يعنيك. حجم العيّنة لكلّ ذراع اللازم لتكون فرصة كشفه 80٪ عند مستوى 5٪ المعتاد هو
أي 14751 لكلّ ذراع. والشكل المهمّ في المقام: الأثر مرفوع إلى المربّع.
| الأثر الذي تريد كشفه | العيّنة لكلّ ذراع |
|---|---|
| 2.0 نقطة | 3841 |
| 1.0 نقطة | 14751 |
| 0.5 نقطة | 57763 |
فتنصيف الأثر يضرب حاجتك من الزوّار في 3.9. إذ ينقص الخطأ المعياري كـ ، فحلّ أثر أصغر بالنصف يقتضي تنصيف الخطأ، وذلك يحتاج أربعة أضعاف البيانات.
هذه الحقيقة وحدها تعيد ترتيب طريقة التخطيط. فالسؤال ليس أبداً «هل ثمّة أثر»، إذ يكاد يوجد أثر دائماً. السؤال هو ما أصغر أثر يستحقّ الكشف، لأنّ هذا الرقم يحدّد كلفة التجربة كلّها، وعلى من سيتصرّف بناءً على النتيجة أن يجيب عنه.
ما الذي تعلنه تجربة أصغر ممّا ينبغي
شغّل النسخة الناقصة: 2000 مستخدم في كلّ ذراع، في مقابل الارتفاع الحقيقيّ نفسه البالغ نقطة واحدة. قوّتها 17.8٪، فهي تخطئ الهدف أربع مرّات من كلّ خمس. وهذا الجزء متوقّع وليس هو المشكلة.
المشكلة ما يقع في التشغيلات التي تبلغ المعنوية. فعلى 20000 تجربة محاكاة، يبلغ متوسّط الأثر المقيس بين التشغيلات المعنوية مقدار 2.38 ضعف الحقيقة. و0.8٪ منها معنويّ في الاتّجاه الخاطئ.
ولا عيب في المقدِّر. فمتوسّطه على العشرين ألفاً كلّها غير متحيّز: متوسّط التقدير هو الأثر الحقيقي. والمتحيّز هو المتوسّط على المجموعة الجزئية التي عبرت مرشّحاً، والمرشّح هو «كان التقدير كبيراً بما يكفي لتجاوز العتبة». وعند القوّة المنخفضة، يقتضي تجاوز العتبة أن يكون الضجيج قد ساعد.
هذه هي لعنة الفائز، وبها يُفسَّر انكماش نتيجة مثيرة من تجربة صغيرة كلّما أعادها أحد على نطاق أوسع.
الشكل أدناه يحسب ذلك كله بصيغة مغلقة لا بالمحاكاة، فيتحرّك التضخيم متّصلًا وأنت تسحب حجم العيّنة. ويبدأ عند الاختبار الأصغر ممّا ينبغي: 2000 في كل ذراع، وقوة 17.8%، وفائزون يبالغون في الحقيقة 2.39 ضعفًا، و0.8% منهم دالّون بالمقلوب. ارفع المؤشّر إلى 14751 يقع أمران معًا: ينهار التضخيم نحو الواحد، وتعود القوة المعروضة إلى 80.0% بالضبط، أي أن صيغة التحجيم وهذا الحساب يتّفقان على العتبة نفسها.
تفاعلي: ماذا يُعلن الاختبار الصغير حين يفوز
حساب مضبوط لا محاكاة. والمرشِّح هو «كبير بما يكفي لتجاوز العتبة».
- القوة
- 17.8%
- التضخيم
- 2.39x
- دالّ، وبالاتجاه الخطأ
- 0.8%
- المطلوب لقوة 80%
- 14,751
عند 2,000 في كل ذراع يجد هذا الاختبار الأثر 17.8% من المرات، وليست تلك هي المشكلة. المشكلة فيما تقوله التجارب الفائزة: إذ تُعلن وسطيًا 2.39 ضعف الأثر الحقيقي، و0.8% منها دالّة في الاتجاه المعاكس تمامًا. ولا عيب في المقدِّر: فهو غير متحيّز على مجموع التجارب. إنما المتحيّز هو المتوسّط على ما اجتاز مرشِّحًا. وتسميته نتيجةً أوّلية لا تُصلحه، أما تحجيمه عند 14,751 فيُصلحه.
لماذا «أوّلية» ليست دفاعاً
الردّ المعتاد أن تُسمّى التجربة الصغيرة أوّلية ويُعامَل رقمها بوصفه مؤشّراً. وهذا لا ينفع، لسبب يستحقّ القول صراحةً.
فالتجربة الناقصة القوّة ليست نسخة مضجّجة من تجربة جيّدة. إنّها آلة، كلّما نطقت، نطقت برقم منتفخ انتفاخاً شديداً ومجال ثقة يبدو حوله سليماً تماماً. والمجال صحيح بمعنى أنّه سيغطّي الحقيقة 95٪ من الوقت على كلّ التشغيلات، لكنّك لا تنظر إلى كلّ التشغيلات، بل إلى تلك التي كانت مثيرة بما يكفي لتُعرَض.
فالتسلسل ثابت:
- حدّد أصغر أثر يستحقّ التصرّف بناءً عليه، مع من سيتصرّف
- احسب حجم العيّنة الذي يكشفه
- إن لم يكن الزوّار متاحين، فانتظر، أو وسّع الجمهور، أو اخفض التباين (الدرس الثالث)، أو لا تشغّل التجربة
وترك التجربة خيار مشروع. أمّا تشغيل تجربة لا تستطيع إلّا أن تضلّل فليس كذلك.
ملاحظة في الاتّجاه الآخر
القوّة متناظرة على نحو يُنسى. فتجربة قوّتها 17.8٪ ولم تجد شيئاً لم تخبرك بشيء يُذكر: فغياب نتيجة معنوية متّسق تماماً مع الأثر الذي كنت ترجوه. وعرض ذلك بوصفه «لا أثر» هو الخطأ نفسه في الاتّجاه المعاكس.
والعرض الأمين لنتيجة صفرية هو مجال الثقة. فقول «كان الارتفاع 0.2 نقطة، والمجال عند 95٪ من −1.7 إلى 2.1» يبيّن بوضوح أنّ التجربة لم تستطع التمييز بين مكسب كبير وخسارة كبيرة. أمّا «لا فرق معنويّ» فيخفي ذلك كلّه.
ما الذي يمهّد له هذا
تحديد الحجم على الوجه الصحيح يقيك من نمط إخفاق واحد. والدرس التالي يعالج النمط الذي ينجو من أيّ حجم عيّنة: تجربة تُراجَع مراراً، أو تُقرأ على متريكات كافية، ستنتج في النهاية فائزاً حتّى حين لا يقع شيء البتّة.
المراجع والقراءات الإضافية
- Ron Kohavi, Diane Tang, Ya Xu, Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing, Cambridge University Press, 2020· مكتبة مراجع Kudos AI
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.
افتح المسار كاملًا
هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.