تخطّي إلى المحتوى
Kudos AI
Read in English
Experimentation

التجربة التي كانت ستفوز على أيّ حال

تجربة بـ2000 مستخدم لكلّ ذراع تعرض آثاراً أكبر 2.4 مرّة ممّا ينبغي. وتجربة A/A تُراجَع عشر مرّات تخرج معنويةً 19٪ من الوقت. وعشرون متريكاً صفرياً مستقلّاً تنتج فائزاً 64٪ من الوقت، واثنتا عشرة شريحة صفرية 46٪. أربعة أرقام، وسبب واحد، والقرارات التي يجب اتّخاذها قبل وصول البيانات.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: Statistical Inference

حجم عيّنة مطلوب ينتفخ كلّما صغر الأثر المستهدف، وعتبة معنوية تكنس سحابة من التقديرات فلا تبقي إلّا الذيل المضخَّم، وتجربة صفرية تُقطَّع إلى شرائح حتّى تضيء واحدة.

شغّل تجربة ذراعاها متطابقان. الصفحة نفسها، والشيفرة نفسها، والمستخدمون موزّعون عشوائياً، ولا شيء يُكتشَف.

  • تُقرأ مرّة عند الحجم المخطّط: معنوية 5.0٪ من الوقت. صحيح.
  • تُراجَع عشر مرّات وتُوقَف حين تبدو حسنة: 19.3٪.
  • تُقرأ على عشرين متريكاً مستقلّاً بدل واحد: 64.2٪.
  • تُقطَّع إلى اثنتي عشرة شريحة: 46.4٪.

ولا يفترض أيّ من هذه الأرقام أثراً البتّة. إنّها ما يفعله اختبار سليم حين لا تكون قاعدة القراءة هي التي كُتب الضمان من أجلها. ولهذا يكون أكثر الخلاف على نتائج التجارب في الحقيقة خلافاً على قرارات كان ينبغي اتّخاذها قبل شهر.

أوّلاً: التجربة الأصغر من أن تكون أمينة

افترض معدّل تحويل 10٪، وأنّ ارتفاعاً بنقطة واحدة يهمّ. ولتكون فرصة كشفه 80٪ تحتاج 14751 مستخدماً لكلّ ذراع.

الأثر المطلوب كشفهالعيّنة لكلّ ذراع
2.0 نقطة3841
1.0 نقطة14751
0.5 نقطة57763

فتنصيف الأثر يضرب الزوّار في 3.9، لأنّ الخطأ المعياري ينقص كـ1/n1/\sqrt{n}، فتتناسب العيّنة المطلوبة مع مقلوب مربّع الأثر.

شغّلها الآن بـ2000 لكلّ ذراع. تهبط القوّة إلى 17.8٪، فتخطئ أربعاً من كلّ خمس. وهذا متوقّع، وليس هو الجزء المثير.

الجزء المثير ما تعلنه في التشغيلات التي تلتقطها. فعلى 20000 تجربة محاكاة يبلغ متوسّط الأثر بين المعنوية منها مقدار 2.38 ضعف الحقيقة، و0.8٪ منها معنويّ بالإشارة الخاطئة.

والمقدِّر غير متحيّز: فمتوسّطه على كلّ التشغيلات يقع على الأثر الحقيقي بالضبط. والمتحيّز هو المتوسّط على التشغيلات التي عبرت مرشّحاً، والمرشّح هو «كان التقدير كبيراً بما يكفي لتجاوز العتبة»، وهو ما يقتضي عند القوّة المنخفضة أن يكون الضجيج قد ساعد. هذه لعنة الفائز، وبها يُفسَّر انكماش نتيجة لافتة من تجربة صغيرة كلّما أعادها أحد كما ينبغي.

فقولك «سنعامله بوصفه أوّلياً» ليس دفاعاً. فالتجربة الناقصة القوّة ليست نسخة مضجّجة من تجربة جيّدة؛ إنّها آلة كلّما نطقت نطقت برقم منتفخ انتفاخاً شديداً ومجال يبدو سليماً حوله.

الشكل أدناه يحسب ذلك كله بصيغة مغلقة لا بالمحاكاة، فيتحرّك التضخيم متّصلًا وأنت تسحب حجم العيّنة. ويبدأ عند الاختبار الأصغر ممّا ينبغي: 2000 في كل ذراع، وقوة 17.8%، وفائزون يبالغون في الحقيقة 2.39 ضعفًا، و0.8% منهم دالّون بالمقلوب. ارفع المؤشّر إلى 14751 يقع أمران معًا: ينهار التضخيم نحو الواحد، وتعود القوة المعروضة إلى 80.0% بالضبط، أي أن صيغة التحجيم وهذا الحساب يتّفقان على العتبة نفسها.

تفاعلي: ماذا يُعلن الاختبار الصغير حين يفوز

حساب مضبوط لا محاكاة. والمرشِّح هو «كبير بما يكفي لتجاوز العتبة».

3x1x50060,000
القوة
17.8%
التضخيم
2.39x
دالّ، وبالاتجاه الخطأ
0.8%
المطلوب لقوة 80%
14,751
المعدّل الأساسالأثر الحقيقي

عند 2,000 في كل ذراع يجد هذا الاختبار الأثر 17.8% من المرات، وليست تلك هي المشكلة. المشكلة فيما تقوله التجارب الفائزة: إذ تُعلن وسطيًا 2.39 ضعف الأثر الحقيقي، و0.8% منها دالّة في الاتجاه المعاكس تمامًا. ولا عيب في المقدِّر: فهو غير متحيّز على مجموع التجارب. إنما المتحيّز هو المتوسّط على ما اجتاز مرشِّحًا. وتسميته نتيجةً أوّلية لا تُصلحه، أما تحجيمه عند 14,751 فيُصلحه.

ثانياً: كلّ نظرة إضافية فرصة أخرى

يهيم الفرق المقدَّر مع تراكم البيانات. وعتبة المعنوية خطّ ثابت. والكمّية الهائمة تعبر خطّاً ثابتاً في النهاية، والقاعدة التي تتوقّف عند أوّل عبور تبقي النتوء وتطرح العودة التي كانت ستتبعه.

هذه هي الآليّة كلّها، وهي تحوّل 5.0٪ إلى 19.3٪ عند عشر نظرات. والمتابعة المستمرّة تدفعها نحو اليقين إن أُعطيت وقتاً كافياً.

واعتراضان يتكرّران ولا يصمدان:

  • ليس أنّ البيانات المبكّرة أكثر ضجيجاً فهي خاطئة. فكلّ نظرة اختبار سليم على البيانات المتاحة. والشيء غير السليم هو القاعدة الجامعة.
  • ولا يُصلحه النظر إلى الاتّجاه بدل القيمة الاحتمالية. فأيّ قاعدة تقرّر التوقّف بناءً على النتيجة حتّى الآن لها البنية نفسها.

فإن لزمتك المراقبة - ولكشف الأعطال تلزم - فاستعمل اختباراً تتابعياً أو جدول إنفاق ألفا. فهذان ينفقان ميزانية الخطأ عن قصد. وما يكسر الضمان إنفاقها عرضاً.

ثالثاً: الحساب نفسه، عرضاً

P(at least one significant)=1−(1−α)mP(\text{at least one significant}) = 1 - (1-\alpha)^m

وذلك لعدد mm من المتريكات الصفرية المستقلّة. والمتريكات الحقيقية مترابطة إيجابياً في العادة، وهذا يخفض هذه النسب بعض الشيء.

المتريكات الصفريةاحتمال أن يخرج واحد على الأقلّ معنوياً
15.0٪
522.6٪
2064.2٪
5092.3٪

فعند عشرين متريكاً يصير أرجح من نقيضه، وعند خمسين يكاد يكون مضموناً. والشرائح تتصرّف كذلك: فاثنتا عشرة منها تنتج فائزاً في 46.4٪ من التجارب الصفرية، وتأتي دائماً بعد ذلك حكاية عن سبب اختلاف سلوك مستخدمي الهاتف أو الجدد. والحكاية تأتي بعد الرقم، وتأتي بالطلاقة نفسها حين يكون الرقم ضجيجاً.

ولاحظ ما يفاجئ: العيّنة الأكبر لا تصلح الشرائح. فالوتيرة تعتمد على عدد الفرص لا على دقّتها. والتجربة الأكبر تنتج شرائح زائفة بالوتيرة نفسها، بمجالات أضيق حولها.

ويعيد بونفيروني عشرين متريكاً إلى 4.9٪ باختبار كلّ منها عند 0.25٪، وهو صحيح ويكلّف قوّةً كبيرة. وهولم أفضل منه اطّراداً عند الضمان نفسه. وبنياميني-هوخبرغ يضبط نسبة الادّعاءات الكاذبة بدل احتمال وقوع واحد، وهو الهدف الصحيح عند غربلة المرشّحين والخاطئ حين يكون ادّعاء كاذب واحد باهظاً.

لكنّ الحدّ المهمّ ليس رياضياً. فالتصحيح لا يعدّ إلّا المقارنات التي تعلنها. والمحلّل الذي فحص عشرين متريكاً وثلاث شرائح وأربع نوافذ قبل أن يعرض ما نجح أجرى مئات المقارنات الضمنية التي لم يسجّلها شيء. فتصير القيمة الاحتمالية رقماً عن إجراء لم يتّبعه أحد.

تفاعلي: كم فرصةً قبل أن تفوز واحدة

الذراعان متطابقتان. ولا شيء يُكتشف.

0%25%50%75%100%مقارنات صفرية مستقلة →
واحدة دالّة على الأقل
64.2%
بعد بونفيروني
-
المستوى المطلوب لكل اختبار
-

بـ20 مقارنة صفرية عند مستوى 5%، يخرج شيءٌ دالًّا 64.2% من الوقت. ولا عيب في البيانات ولا في الاختبار ولا في المحلّل: فهذا ‎1 − 0.95‎20، وقد كان صحيحًا قبل أن ينظر أحد. وثمة أمران لا يتوقف هذا عليهما ويستحقان الانتباه. لا يتوقف على حجم العيّنة: فالتجربة الأكبر تنتج شرائح زائفة بالوتيرة نفسها، بفترات أضيق حولها. وهو يعدّ المقارنات التيأُجريت لا التي أُبلغ عنها. فعّل التصحيح لترى كلفة العلاج.

العلاج الرخيص: اشترِ دقّةً لا فرصاً

ثمّة طريق مشروع إلى تجربة أرخص، وليس أيّاً ممّا سبق.

يختلف المستخدمون بعضهم عن بعض اختلافاً هائلاً، وأكثر ذلك لا صلة له بتغييرك. فالمستخدم الكثيف كان كثيفاً الشهر الماضي. فإن كان لديك قياس XX لكلّ مستخدم من قبل التجربة، فاطرح الجزء الذي يتنبّأ به من النتيجة:

Yiadj=Yi−θ (Xi−Xˉ),θ=Cov(Y,X)Var(X)Y^{\text{adj}}_i = Y_i - \theta\,(X_i - \bar{X}), \qquad \theta = \frac{\mathrm{Cov}(Y, X)}{\mathrm{Var}(X)}

مطبَّقاً بالتساوي على الذراعين. وعند ارتباط 0.7 مع المدّة السابقة يزيل هذا 50.3٪ من التباين - والنظرية تقول ρ2=0.49\rho^2 = 0.49 - فتأتي الدقّة نفسها من نصف الزوّار.

ولا يمكن أن يحيّز النتيجة لأنّ XX مقيس قبل التخصيص ولا يمكن أن تكون المعالجة قد أثّرت فيه. أمّا التعديل على شيء مقيس أثناء التجربة فيكسر ذلك بالضبط، وقد يصنع أثراً غير موجود.

وأمران آخران بلا كلفة: قصّ متريك ذي ذيل ثقيل بقرار مسبق، وتطبيق التخصيص الطبقيّ كي يتوازن الذراعان بحكم البناء لا في المتوسّط.

لا يحتاج أيٌّ من رقمَي هذا الدرس إلى المحاكاة التي أنتجته، والشكل أدناه يحسبهما معًا. فالتعديل يزيل مربّع رو من التباين بالضبط، أي 49% عند ارتباط 0.7، والـ50.3% المقيسة أعلاه هي ذلك الرقم وعليه ضجيج ألف وخمسمئة تشغيلة. والاقتطاع النظيف إلى اثنتي عشرة شريحة يُظهر نتيجة دالّة واحدة على الأقل في 45.96% من المرات، وهو ما تقدّره الـ46.4%.

تفاعلي: كم من الحركة يساوي عمودٌ تملكه أصلًا

الرقمان مضبوطان. والدرس يحاكيهما، وهما لا يحتاجان محاكاة.

100%0
التباين المُزال
49.0%
الحركة المطلوبة بعدُ
51.0%
لكل ذراع، بلا تعديل
14,751
لكل ذراع، بعد التعديل
7,524

قياسٌ سابق ارتباطه بالنتيجة 0.70 يزيل 49.0% من التباين، أي مربّع رو تمامًا. وعندها تُنال الدقّة نفسها من 51.0% من المستخدمين: 7,524 لكل ذراع مقابل 14,751. ولا يمكن أن يحيّز هذا النتيجة، لأن X قيس قبل التوزيع ويُطبَّق المعامل نفسه على الذراعين.

وأخيراً: المعنوية ليست قراراً

التجربة محدَّدة الحجم ومسجّلة مسبقاً ودقيقة. وقد أعادت ارتفاعاً معنوياً قدره 0.1٪. أتُطلِق؟

المعنوية تجيب عمّا إذا كان الأثر يتميّز عن الصفر، ومع زوّار كافين يتميّز كلّ شيء تقريباً. والقرار يحتاج المجال في مقابل الكلفة:

  • من 0.02٪ إلى 0.18٪: حقيقيّ ويكاد يكون مؤكّداً أنّه لا يستحقّ صيانة الميزة
  • من 0.02٪ إلى 3.5٪، أي ارتفاع 1.8٪ معنويّ بالكاد: حالة أخرى، فالتجربة لم تحسم
  • ونتيجة صفرية مجالها من −0.05٪ إلى +0.07٪ مفيدة حقّاً: فقد استبعدت كلّ ما يستحقّ
  • ونتيجة صفرية مجالها من −4٪ إلى +5٪ لم تخبرك بشيء

ولهذا يُثبَّت أصغر أثر يستحقّ الإطلاق في اللحظة نفسها التي يُثبَّت فيها حجم العيّنة، ومن قِبل من سيتصرّف. فتثبيته مسبقاً يجعل القرار حسابياً، وتركه مفتوحاً يجعله جدالاً يقرأ فيه كلّ طرف المجال نفسه في الاتّجاه الذي كان يفضّله سلفاً.

ما هو الانضباط فعلاً

يُكتَب قبل وصول البيانات:

  1. أصغر أثر يستحقّ التصرّف بناءً عليه، متّفقاً عليه مع من سيتصرّف
  2. حجم العيّنة الذي يكشفه، وقرار عدم التشغيل إن لم يوجد الزوّار
  3. متريك رئيسيّ واحد، مع حواجز تُعلَن على حدة
  4. جمهور ومدّة وقاعدة توقّف ثابتة، مع طريقة تتابعية إن لزمك التوقّف مبكراً
  5. خفض التباين الذي تنوي تطبيقه
  6. وكلّ ما عدا ذلك يُوسَم استكشافاً، ينتج فرضيات ولا ينتج خلاصات

وليست أيّ من الإخفاقات أعلاه دقيقةً إحصائية. كلّ واحدة نتيجة قرار اتُّخذ بعد رؤية البيانات وكان ينبغي أن يُتَّخذ قبلها، وانضباط التجريب كلّه هو ممارسة تقديم تلك القرارات.

المراجع والقراءات الإضافية

  • Ron Kohavi, Diane Tang, Ya Xu, Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing, Cambridge University Press, 2020· مكتبة مراجع Kudos AI
  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 5 دقيقةالتعلّم غير المُشرَف عليه

الاتّجاه الذي يتغيّر حين تغيّر وحدة القياس

اثنا عشر شخصًا، وقياسان لكلٍّ منهم، وثلاث مكوّنات رئيسة أولى مختلفة: بالمليمترات يكون الجواب الطول وحده تقريبًا، وبالأمتار الوزن وحده تقريبًا، وبالسنتيمترات مزيجًا متوازنًا - مع بقاء الارتباط عند 0.9500 في الحالات الثلاث. وما يقوله ذلك عمّا تعظّمه المكوّنات الرئيسة، ولماذا قد تكون نسبة تباين مفسَّر تبلغ 99.999% قولًا عن الأمتار لا عن الأشخاص، وما الذي تختاره المعيرة فعلًا.

تعلّم الآلةالإحصاء
قراءة 3 دقيقةTime Series

درجةٌ تخسر أمام عدم الفعل

نموذج الجيران الخمسة الأقرب يسجّل 0.9983 في التحقّق المتقاطع العشوائي بخمسة أثلاث على مشية عشوائيّة، وهي سلسلة زياداتها غير قابلة للتنبّؤ بالبناء. وبتقييمه تقدّمًا في الزمن يسجّل 0.6559 بجذر متوسّط خطأ تربيعي أكبر 12.44 مرّة، ويخسر أمام إبقاء آخر قيمة مرصودة كما هي. فالقسمة، لا النموذج، هي التي أنتجت الرقم الأوّل.

الإحصاءتعلّم الآلة
قراءة 6 دقيقةAnomaly Detection

الكاشف الذي لا يُطلِق إنذاراً أبداً دقيق بنسبة 99.5٪

عند معدّل أساس واقعيّ يفوز الكاشف الخامل في الدقّة، وROC قدره 0.9468 يخفي طابور إنذارات كاذباً بنسبة 64٪، والمسافة عن المتوسّط تقع تحت الصدفة حين يجلس الشذوذ في المركز، وعشرون شاذّاً متجمّعاً يخفي بعضها بعضاً عن المنهج المصمَّم لإيجادها.

تعلّم الآلةالإحصاء
← العودة إلى كل المقالات