تخطّي إلى المحتوى
Kudos AI
Read in English
الاستدلال الاحتمالي

تعلّم الأعداد في نموذج احتمالي

من أين تأتي أعداد الشبكة البايزية أو التوزيع الغاوسي فعلًا: وصفة الإمكان الأعظم ذات الخطوات الثلاث مطبَّقة على معالم منفصلة ثم متصلة، وتوزيع بيتا القبلي الذي يصلح ما تفعله بحدث لم يُشاهد قط، وبايز الساذج والتكرار الصفري الواحد الذي يدمّره، وخوارزمية EM للحالة التي يتعذّر فيها العدّ أصلًا - وكل رقم محسوب لا مُدّعى.

قراءة 9 دقيقةKudos AI

المتطلبات المسبقة: الشبكات البايزية والاستدلال الاحتمالي

منحنى إمكان كيس الحلوى يُرسم بينما يتحرك الأس، وقمّته تنزلق إلى النسبة المرصودة، ثم المنحنى نفسه يبسطه اللوغاريتم إلى مجموع مشتقته سطر واحد.

كل نموذج احتمالي نوقش حتى الآن وصل وأعداده في مواضعها سلفًا. فالشبكة البايزية جاءت بجداول احتمالاتها الشرطية مملوءة؛ والتوزيع الغاوسي جاء بمتوسط وتباين. ولا بدّ أن أحدًا وضعها هناك. وهذا المقال عن كيفية ذلك، وهو ينقسم قسمين واضحين: الحالة التي يكون فيها كل متغير مرصودًا، وهي سهلة سهولةً تكاد تكون تافهة، والحالة التي لا يكون فيها متغير كذلك، وهي تقتضي خوارزمية مغايرة فعلًا.

أ. الإمكان والخطوات الثلاث

ثبّت نموذجًا معالمه θ\theta. إمكان مجموعة بيانات هو الاحتمال الذي يسنده النموذج إلى الرصدات التي حصلت عليها بالضبط، وهو جداء إذا كانت الأمثلة مستقلة:

P(d∣hθ)=∏j=1NP(dj∣hθ).P(\mathbf{d} \mid h_\theta) = \prod_{j=1}^{N} P(d_j \mid h_\theta).

ويختار التقدير بالإمكان الأعظم قيمة θ\theta التي تعظّم هذا المقدار. والوصفة واحدة دائمًا في ثلاث خطوات: اكتب الإمكان، واشتقّ لوغاريتمه، وصفّر المشتقة.

افتح 25 قطعة حلوى من كيس نسبة الكرز فيه θ\theta مجهولة فتجد 18 منها كرزًا. عندئذ P(d∣hθ)=θ18(1−θ)7P(\mathbf{d} \mid h_\theta) = \theta^{18}(1-\theta)^{7}، ومن ثم

L=18log⁡θ+7log⁡(1−θ),dLdθ=18θ−71−θ=0  ⇒  θ=1825=0.72.L = 18\log\theta + 7\log(1-\theta), \qquad \frac{dL}{d\theta} = \frac{18}{\theta} - \frac{7}{1-\theta} = 0 \;\Rightarrow\; \theta = \frac{18}{25} = 0.72 .

وشبكة على مليوني قيمة لـ θ\theta توافق ذلك إلى ست منازل عشرية: فلوغاريتم الإمكان −14.823833-14.823833 عند 0.720.72، مقابل −14.847959-14.847959 عند 0.700.70 و−14.849407-14.849407 عند 0.740.74.

والجواب هو النسبة المرصودة، وهو ما كان أي أحد ليخمّنه. وقيمة الاشتقاق أنه يبرهن أن ذلك التخمين هو المُعظِّم، وأن الخطوات الثلاث نفسها تظل تعمل حيث لا يقترح التخمين نفسه.

ويستحق أخذ اللوغاريتم دفاعًا مرتين. رياضيًا لا يمكنه إزاحة قيمة عظمى، لأن log⁡\log متزايدة تمامًا. وحاسوبيًا، جداء آلاف الاحتمالات ينهار إلى الصفر في الفاصلة العائمة بخلاف مجموع اللوغاريتمات - ولهذا يعيش كود الإنتاج في الفضاء اللوغاريتمي.

ب. لماذا تجعل البيانات الكاملة الشبكة رخيصة

أعطِ الحلوى غلافًا أيضًا، أحمر أو أخضر، باحتمال يتوقف على النكهة. صارت المعالم ثلاثًا: θ\theta، وθ1=P(red∣cherry)\theta_1 = P(\text{red} \mid \text{cherry})، وθ2=P(red∣lime)\theta_2 = P(\text{red} \mid \text{lime}). ومع 12 كرز-أحمر و6 كرز-أخضر و2 ليمون-أحمر و5 ليمون-أخضر،

L=12log⁡(θθ1)+6log⁡(θ(1−θ1))+2log⁡((1−θ)θ2)+5log⁡((1−θ)(1−θ2)).L = 12\log(\theta\theta_1) + 6\log(\theta(1-\theta_1)) + 2\log((1-\theta)\theta_2) + 5\log((1-\theta)(1-\theta_2)).

انشر اللوغاريتمات فيتبيّن أن كل حدّ يحوي θ1\theta_1 لا يحوي شيئًا سواه. والمشتقات الجزئية معادلات مستقلة، كل واحدة منها مسألة المعلمة الواحدة من جديد:

θ=0.72,θ1=1218=0.666667,θ2=27=0.285714.\theta = 0.72, \qquad \theta_1 = \tfrac{12}{18} = 0.666667, \qquad \theta_2 = \tfrac{2}{7} = 0.285714 .

ونيلدر–ميد على الإمكان الكامل ذي المعالم الثلاث يستقر في حدود 1.4×10−81.4 \times 10^{-8} من هذه القيم، عند لوغاريتم إمكان −30.468975-30.468975.

وذلك الانفكاك هو كل سبب سرعة تعلّم شبكة بايزية من بيانات كاملة. فكل جدول احتمالات شرطية يُلاءَم بالعدّ داخل حالة اشتراطه، بلا بحث ولا تكرار - مجموعةُ مسائل عدّ مستقلة لا أمثلة مشتركة واحدة.

يُفتح الشكل ومزلاجا الغلاف على القيمتين المقرّبتين 0.670.67 و0.290.29، فيقرأ لوغاريتم الإمكان الكلّي فيه −30.469740-30.469740. اضغط ثبّت على التقديرات المعدودة فتنتقل المزالج إلى قيم الإمكان الأعظم، وينتقل المجموع إلى −30.468975-30.468975 المذكور أعلاه.

تفاعلي: منحنى واحد، وثلاثة حدود

حرّك وسيط الغلاف وانظر كيف يتجاهله حدّ النكهة.

حدّ النكهة
-14.823833
حدّ الغلاف، الكرز
-11.457707
حدّ الغلاف، الليمون
-4.188200
اللوغاريتم الكلّيّ للأرجحيّة
-30.469740

المزالج الثلاثة تحرّك ثلاثة حدود، والحدود تُجمَع. وهذا هو الانفكاك كلّه: فنشر اللوغاريتمات يحوّل الأرجحيّة إلى [18 log t + 7 log(1 - t)] زائد حدّ في t1 وحده زائد حدّ في t2 وحده، فلا يمكن لقيمة t التي تُعظّم المجموع أن تتوقّف على الآخرين. ادفع t1 إلى أيّ من الطرفين، ولا يتزحزح حدّ النكهة رقمًا واحدًا. ولهذا كانت ملاءمة شبكة كاملة من بيانات تامّة عدًّا لا بحثًا، وهذا بعينه ما يسلبه الدرس التالي. والتقدير المعدود الآن 0.72، وحدّ النكهة -14.823833 عند 0.72 التي اخترتها.

ج. الحالة المتصلة، ولماذا المربعات الصغرى

من أجل NN سحبة من توزيع غاوسي، يعطي تصفير المشتقتين الجزئيتين

μ=∑jxjN,σ=∑j(xj−μ)2N.\mu = \frac{\sum_j x_j}{N}, \qquad \sigma = \sqrt{\frac{\sum_j (x_j - \mu)^2}{N}} .

لاحظ المقام. فعلى عشر قياسات مجموعها 51.051.0 ومجموع انحرافاتها التربيعية 3.983.98، يكون μ=5.1\mu = 5.1 وσ=0.630872\sigma = 0.630872، حيث تعطي القسمة على N−1N-1 القيمة 0.6649980.664998 - بفارق عامل N/(N−1)=1.054093\sqrt{N/(N-1)} = 1.054093. وكلاهما جواب صحيح لسؤال مختلف: أحدهما يعظّم الإمكان والآخر غير متحيّز. ولم يُطلب من الإمكان الأعظم قط أن يكون غير متحيّز.

وتسقط نتيجة نافعة من ذلك. لائم yy طبيعيًا حول θ1x+θ2\theta_1 x + \theta_2 بتباين ثابت، فيكون الجزء الوحيد من لوغاريتم الإمكان المتوقف على المعالم هو −∑j(yj−θ1xj−θ2)2-\sum_j (y_j - \theta_1 x_j - \theta_2)^2. فتصغير الخطأ التربيعي هو الإمكان الأعظم في ظل ضجيج غاوسي، وذلك سبب كون المربعات الصغرى الخيار الافتراضي لا مجرد تقليد مريح.

د. ما يفعله بحدث لم يشاهده

افتح قطعة واحدة فتجدها كرزًا، فتعلن الوصفة θ=1\theta = 1: الليمون مستحيل، باحتمال صفر تمامًا، وهي دعوى لا يُخرج منها أي شاهد لاحق بالضرب. فالإمكان الأعظم يقرأ «لم يُرصد بعد» على أنه «لا يمكن أن يقع».

والإصلاح البايزي توزيع قبلي. ومن أجل θ∈[0,1]\theta \in [0,1] يكون الخيار الطبيعي توزيع بيتا، وخاصيته النافعة الترافق: فتوزيع قبلي Beta(a,b)\text{Beta}(a,b) مع cc كرزة وℓ\ell ليمونة يعطي توزيعًا بعديًا Beta(a+c,b+ℓ)\text{Beta}(a+c, b+\ell). والتحديث جمع، ويبقى البعدي في العائلة نفسها، فيمكن تحديث الاعتقاد إلى الأبد دون أن يكبر التمثيل.

ويسلك Beta(a,b)\text{Beta}(a,b) مسلك a+b−2a+b-2 مشاهدة متخيَّلة معدودة سلفًا. وانظر إلى Beta(2,2)\text{Beta}(2,2) - قطعة متخيَّلة من كل نكهة - يعالج الحالة المرَضية:

الرصداتالتوزيع البعديالمتوسط البعديMAPالإمكان الأعظم
c=1c=1، ℓ=0\ell=0Beta(3,2)\text{Beta}(3,2)3/5=0.6000003/5 = 0.6000002/3=0.6666672/3 = 0.6666671.0000001.000000
c=3c=3، ℓ=1\ell=1Beta(5,3)\text{Beta}(5,3)5/8=0.6250005/8 = 0.6250002/3=0.6666672/3 = 0.6666670.7500000.750000
c=18c=18، ℓ=7\ell=7Beta(20,9)\text{Beta}(20,9)20/29=0.68965520/29 = 0.68965519/27=0.70370419/27 = 0.7037040.7200000.720000
c=180c=180، ℓ=70\ell=70Beta(182,72)\text{Beta}(182,72)91/127=0.71653591/127 = 0.716535181/252=0.718254181/252 = 0.7182540.7200000.720000

يؤدي التوزيع القبلي عمله مبكرًا ثم يتنحّى: فهو الفرق بين 0.60.6 وادّعاء اليقين عند رصدة واحدة، ويساوي ثلاثة أجزاء ونصف من الألف عند 250. ولاحظ أيضًا أن الإمكان الأعظم هو بالضبط MAP في ظل توزيع قبلي منتظم، وأن إضافة واحد إلى كل تكرار - الترقيع الميداني المعتاد - هو المتوسط البعدي في ظل Beta(1,1)\text{Beta}(1,1). لقد كان توزيعًا قبليًا منذ البداية.

هـ. بايز الساذج، وصفرٌ واحد

يفترض نموذج بايز الساذج أن السمات مستقلة شرطيًا بمعلومية الصنف، فيكون P(C,x1,…,xn)=P(C)∏iP(xi∣C)P(C, x_1, \ldots, x_n) = P(C)\prod_i P(x_i \mid C): أي 2n+12n+1 معلمة من أجل nn سمة منطقية، تُلاءَم كلها بالعدّ.

خذ 14 بحثًا مصنّفةً نظرية أو تطبيقية، موصوفةً بما إذا كان كلٌّ منها يحوي برهانًا، ويستعمل مجموعة بيانات، ويورد معيار أداء. ستة نظرية وثمانية تطبيقية، فتكون التوزيعات القبلية 3/73/7 و4/74/7:

برهانمجموعة بياناتمعيار أداء
نظري (6)5/65/62/62/60/60/6
تطبيقي (8)2/82/87/87/87/87/8

بحثٌ فيه برهان ولا شيء غيره يسجّل 5/215/21 مقابل 1/4481/448، أي احتمالًا بعديًا قدره 320/323=0.990712320/323 = 0.990712. معقول.

والآن انظر إلى الصفر. لا يورد أي بحث نظري معيار أداء، فيكون P(benchmark=1∣theory)=0P(\text{benchmark} = 1 \mid \text{theory}) = 0. صنّف بحثًا فيه برهان وبلا مجموعة بيانات ومع معيار أداء: درجة النظري جداء يحوي ذلك الصفر، فتكون صفرًا تمامًا. والاحتمال البعدي P(theory)P(\text{theory}) صفر مهما كان البرهان ومهما كان التوزيع القبلي. فقيمة سمة غائبة عن بيانات التدريب تملك حق نقض على التنبؤ برمّته - وفي تصنيف النصوص، حيث تغيب أكثر الكلمات عن أكثر الأصناف، تلك هي الحال المعتادة لا حالة حديّة.

ويحوّل تنعيم إضافة الواحد 0/60/6 إلى 1/81/8، فيسجّل البحث نفسه 105/4096105/4096 مقابل 27/100027/1000: أي احتمالًا بعديًا قدره 4375/8983=0.4870314375/8983 = 0.487031 مقابل 0.5129690.512969. تعادلٌ شبه تام وصادق بدل يقين، ولا يزال المصنّف المنعَّم يصنّف الأبحاث الأربعة عشر كلها تصنيفًا صحيحًا.

تفاعلي: صفرٌ واحد، فيتوقف المصنّف عن العمل

14 بحثًا، 6 نظرية و8 تطبيقية.

فيه برهانيستعمل مجموعة بياناتيورد مقياسًا مرجعيًا
نظري (6)5/60.8332/60.3330/60.000
تطبيقي (8)2/80.2507/80.8757/80.875
P(نظري | الدليل)
0.990712
الحكم
نظري
أبحاث التدريب الصحيحة
14 / 14

بهذا الدليل يكون المصنّف واثقًا ويتفق الضبطان. والحالة المثيرة هي التي لا يقدر المتن على تمثيلها: اطلب مقياسًا مرجعيًا وراقب عمود النظري ينهار. ولاحظ أن الصفر ظاهرٌ في الجدول المُلائم قبل أي تنبؤ: فالخانة المعلَّمة هي مقرّ حقّ النقض.

وافتراض الاستقلال باطل بالطبع - فالأبحاث ذات معايير الأداء تميل إلى امتلاك مجموعات بيانات - وحيثما كانت السمات مترابطة داخل الصنف الواحد عُدّ الشاهد المشترك مرتين، فلا ينبغي تصديق الاحتمالات. أما الترتيبات فتصمد رغم ذلك، لأن القرار arg⁡max⁡\arg\max ولأن العدّ المزدوج يميل إلى تضخيم الدرجتين معًا. ثق بالصنف لا بالعدد.

و. حين يتعذّر عدّ التكرارات

كل ما سبق احتاج بيانات كاملة. أخفِ متغيرًا - من أي عنقود جاءت النقطة، وأي موضوع كتب الوثيقة - فيصير إمكان المثال المرصود مجموعًا على ما كان يمكن أن يكونه المتغير الخفي:

P(x∣θ)=∑zP(x,Z=z∣θ).P(x \mid \theta) = \sum_{z} P(x, Z = z \mid \theta).

ولوغاريتم المجموع لا ينشطر، فلا تنفكّ المعالم بعد ذلك ولا توجد صيغة مغلقة تُصفَّر.

ويستبدل التوقع–التعظيم بالتكرارات التي يتعذّر عدّها تكراراتٍ متوقَّعة:

θ(i+1)=arg⁡max⁡θ∑zP(Z=z∣x,θ(i)) L(x,Z=z∣θ).\theta^{(i+1)} = \arg\max_{\theta} \sum_{z} P(Z = z \mid \mathbf{x}, \theta^{(i)}) \, L(\mathbf{x}, Z = z \mid \theta).

تحسب خطوة التوقع التوزيع البعدي للمتغيرات الخفية في ظل المعالم الحالية - والعضوية الكسرية التي تنالها نقطة هي مسؤوليتها. وتطبّق خطوة التعظيم صيغ البيانات الكاملة مع إحلال مجموع المسؤوليات محل كل تكرار. ومن أجل مزيج غاوسي يكون ذلك

rjk=wkN(xj∣μk,σk)∑k′wk′N(xj∣μk′,σk′),wk=nkN,μk=∑jrjkxjnk,σk=∑jrjk(xj−μk)2nk,r_{jk} = \frac{w_k \mathcal{N}(x_j \mid \mu_k, \sigma_k)}{\sum_{k'} w_{k'} \mathcal{N}(x_j \mid \mu_{k'}, \sigma_{k'})}, \qquad w_k = \frac{n_k}{N}, \quad \mu_k = \frac{\sum_j r_{jk}x_j}{n_k}, \quad \sigma_k = \sqrt{\frac{\sum_j r_{jk}(x_j - \mu_k)^2}{n_k}},

حيث nk=∑jrjkn_k = \sum_j r_{jk}. وهذه هي صيغ القسم ج الغاوسية، موزونةً.

ز. تشغيلة مقيسة، وحيث تخسر المتوسطات k

عشرون نقطة على مستقيم: ثمانٍ من مركّبة ضيقة قرب الصفر (−0.8-0.8 و−0.7-0.7 و−0.2-0.2 و0.00.0 و0.10.1 و0.50.5 و1.11.1 و1.31.3) واثنتا عشرة من مركّبة أعرض بكثير قرب الخمسة (1.71.7 و3.03.0 و3.33.3 و3.43.4 و4.04.0 و4.24.2 و4.64.6 و4.84.8 و6.96.9 و7.17.1 و7.27.2 و9.29.2)، مع حجب التسميات.

ومن بداية فجّة - متوسطان 0 و5، وانحرافان معياريان كلاهما 1 - يرتفع لوغاريتم الإمكان من −56.616239-56.616239 إلى −46.633131-46.633131 في 82 تكرارة، من غير أن يهبط قط، ويستقر على

w=(0.347288,0.652712),μ=(0.128189,4.581627),σ=(0.731077,2.367312).w = (0.347288, 0.652712), \quad \mu = (0.128189, 4.581627), \quad \sigma = (0.731077, 2.367312).

وأخذ المسؤولية الأكبر لكل نقطة يستعيد التسميات المحجوبة العشرين كلها.

يتوقّف الشكل عند التكرارة 81، أي قبل التكرارات الـ82 المذكورة أعلاه بواحدة، لأن معيار التوقّف فيه مختلف؛ أما لوغاريتم الإمكان عند البداية والنهاية، −56.616239-56.616239 و−46.633131-46.633131، فيطابق التشغيلة الموصوفة هنا.

تفاعلي: النقطة التي تبدّل انتماءها

التكرار 0 من 81.

قطع k-المتوسطات1.7
اللوغاريتم الأرجحي
-56.616239
EM: التسميات المستعادة
19 / 20
k-المتوسطات الأمثل
19 / 20
النقطة 1.7 تطالب بها
المركّبة الضيّقة

في البداية عرض المركّبتين واحد وهما حيث وُضعتا، فالملاءمة لا تزال تحسم بما يشبه المسافة، و1.7 تنتمي إلى الجهة الضيّقة. واصل الخطو: ما إن يصير للعرض أثر حتى تبدّل انتماءها. وقطع k-المتوسطات في الأسفل هو الأمثل المُبرهن على التقسيمات المتجاورة التسع عشرة كلها، فخطؤه خاصية للإسناد الصارم لا لبداية سيئة.

والارتفاع الرتيب مضمون: فكل تكرارة تعظّم حدًّا أدنى يلامس لوغاريتم الإمكان عند المعالم الحالية، فالهبوط يعني علّة برمجية. أما الأمثلية الشاملة فليست مضمونة - إذ بلغت 385 إعادة من 400 القيمة −46.633131-46.633131 وتوقفت 15 عند −48.277387-48.277387، وهي نقطة ثابتة أسوأ لا يخرج منها أي تكرار.

والآن قارن المتوسطات k على النقاط نفسها. قسمتها المثلى - المتحقَّق منها بتعداد التقسيمات المتجاورة التسعة عشر، فليست نهاية صغرى محلية - مركزاها 0.3333330.333333 و5.2454555.245455 ومجموع مربعاتها داخل العناقيد 47.34727347.347273، وهي تضع x=1.7x = 1.7 في العنقود الضيق. وذلك يبعد نقطة واحدة عن جواب EM ونقطة واحدة عن الحقيقة.

والسبب مفيد. تقع x=1.7x = 1.7 على بعد 1.5718111.571811 من المتوسط الضيق المُلاءَم و2.8816272.881627 من العريض، فالمسافة وحدها تسلّمها، والمسافة كل ما لدى المتوسطات k. أما EM فتقارن كثافات:

0.347288×N(1.7∣0.128189,0.731077)=0.018788,0.652712×N(1.7∣4.581627,2.367312)=0.052436,0.347288 \times \mathcal{N}(1.7 \mid 0.128189, 0.731077) = 0.018788, \qquad 0.652712 \times \mathcal{N}(1.7 \mid 4.581627, 2.367312) = 0.052436,

فتعطي مسؤوليتين قدرهما 0.2637890.263789 و0.7362110.736211. فالمركّبة العريضة أوسع بمقدار 3.24 مرة وتحمل الوزن الأكبر، وكلاهما يهمّ. والنقطة أبعد عن تلك المركّبة ومع ذلك أرجح أن تكون قد جاءت منها.

والمسؤوليات في غير ذلك حاسمة في أكثرها لا في كلها: إذ تنقسم x=1.1x = 1.1 إلى 0.6770.677 و0.3230.323، وتنقسم x=1.3x = 1.3 إلى 0.5550.555 و0.4450.445. فـ EM تلائم أعراض المركّبات وأوزان المزيج، وهي ما لا تمثّله المتوسطات k أصلًا.

أهم النقاط

  • مع البيانات الكاملة يكون الإمكان الأعظم ثلاث خطوات والجواب نسبةَ تكرارات؛ وتنفكّ معالم الشبكة، فتصير ملاءمتها مجموعةَ مسائل عدّ مستقلة.
  • يقسم التوزيع الغاوسي للإمكان الأعظم على NN لا على N−1N-1، وهو يفسّر كون المربعات الصغرى دالة الخسارة الصحيحة في ظل ضجيج غاوسي.
  • يسند الإمكان الأعظم احتمالًا صفرًا إلى كل ما لم يُرصد، وهو ما يدمّر تنبؤ بايز الساذج بعامل صفري واحد. وتوزيع بيتا القبلي هو الإصلاح المبدئي، وتنعيم إضافة الواحد حالة خاصة منه.
  • تضع المتغيرات الخفية مجموعًا داخل اللوغاريتم فتكسر الانفكاك. وتستبدل EM بالتكرارات تكراراتٍ متوقَّعة، ولا تخفض الإمكان أبدًا، ولا تبلغ سوى قيمة عظمى محلية - فأعِد تشغيلها.
  • ولأن EM تنمذج العرض والوزن لا المسافة وحدها، فهي تستعيد بنى يعجز عنها الإسناد القاطع.

ما التالي

كل أمثلة EM هنا لاءمت نموذجًا ساكنًا. والخطوتان نفساهما تلائمان نموذجًا يتغير عبر الزمن - إذ تصير خطوة التوقع تنعيمًا أماميًا–خلفيًا، وسبب لزوم التنعيم لا الترشيح أن تقدير انتقال ما يحتاج شواهد لاحقة لوقوعه.

المراجع والقراءات الإضافية

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI
  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 4 دقيقةالاستدلال الاحتمالي

الأسبوع الذي لم يكن ممكنًا

خذ أرجح حالة في كل يوم واكتبها بالترتيب، فيخرج لك تقرير يعطيه النموذج احتمالًا يساوي الصفر تمامًا: في مثال لمراقبة آلة على أربعة أيام يكون الجواب يومًا بيوم سليمة، سليمة، معطّلة، معطّلة، والانتقال من سليمة إلى معطّلة انتقال لا يقع. ما السؤالان فعلًا، ولماذا يجيب التنعيم وفيتربي عن سؤالين مختلفين، وماذا يعني احتمال بعدي قدره 0.411 لأفضل مسار لمن عليه أن يتصرّف.

الذكاء الاصطناعيالاحتمالات
قراءة 3 دقيقةالاستدلال الاحتمالي

مئة ألف عيّنة، أربعمئة منها حقيقيّة

على شبكة السطو مع اتّصال الجارين معًا، تُبقي المعاينة بالرفض 183 سحبًا من 100,000، وتُبقي المعاينة بالترجيح بالأرجحيّة كلَّ السحوب بحجم عيّنة فعّال قدره 396. والتقديران يبتعدان نحو 10% عن احتمال بعدي قدره 0.284172، والسبب يُحسب بالضبط: 252 عيّنة تحمل 76% من الوزن و99.975% من مربّع الوزن.

الذكاء الاصطناعيالاحتمالات
قراءة 8 دقيقةStatistical Inference

ما تستطيع العيّنة أن تقوله لك وما لا تستطيع

المقدّرات بوصفها متغيّرات عشوائية لها توزيعاتها الخاصّة، والحالة التي يكون فيها المقدّر غير المتحيّز هو الأسوأ، وما يعد به مجال الثقة فعلاً والمجال المعتاد الذي يسلّم 87% حيث يعلن 95%، وما تكون القيمة p احتمالاً له - وكلّ رقم محسوب بدقّة أو بمحاكاة ببذرة معلنة.

الإحصاءالاحتمالات
← العودة إلى كل المقالات