تخطّي إلى المحتوى
Kudos AI

موسومة بـ “mdp”

2 مقالات.

قراءة 4 دقيقةالتعلّم المعزّز

الوسيط الذي لا يختاره أحد

مكافأة البقاء في عالَم الشبكة تُكتب مرّةً ولا تُناقَش، والسياسة المثلى دالّة درجيّة فيها: ثمانية عتبات بين -3 و0، كلٌّ منها يقلب مربّعًا واحدًا بالضبط. والقيمة المألوفة -0.04 تبعد 0.0048 عن العتبة التي تقرّر هل يسلك الوكيل الطريق القصير بمحاذاة الحفرة، وفوق -0.0221، حين تكاد الخطوات تكون مجانيّة، يصير الفعل الأمثل في أحد الأركان أن يدفع الجدار عمدًا.

الذكاء الاصطناعي
قراءة 7 دقيقةالتعلّم المعزّز

عمليات القرار الماركوفية

كيف تخطّط حين لا تفعل الأفعال ما تقصده بموثوقية: الحالات، ونموذج الانتقال، والمكافآت والخصم، ومعادلة بلمان، وتكرار القيمة محلولاً عددياً حتى نقطته الثابتة.

التعلّم المعزّزالاحتمالاتالذكاء الاصطناعي