Comprendre Dilemme du prisonnier
Russell et Norvig en donnent la formulation standard. Deux suspects, Alice et Bob, sont interrogés séparément. Si l’un témoigne contre l’autre et que celui-ci refuse, le premier est libéré tandis que le second écope de dix ans. Si tous deux témoignent, chacun purge cinq ans. Si tous deux refusent, chacun écope d’un an pour une infraction moindre. Chacun ne se soucie que de sa propre peine.
La matrice des gains donne donc −5 pour chacun si tous deux témoignent, −1 pour chacun si tous deux refusent, et pour les cas asymétriques 0 pour celui qui témoigne contre −10 pour celui qui refuse. En raisonnant cas par cas, témoigner est préférable pour Alice que Bob témoigne ou refuse : cette stratégie domine. Il en va de même pour Bob.
Tous deux suivent ce raisonnement et écopent de cinq ans, alors que refuser ensemble leur aurait valu un an chacun. L’équilibre est dominé au sens de Pareto : il existe un résultat que tous deux préféreraient. Rien n’a pourtant cloché dans le raisonnement ; chaque conclusion est individuellement correcte, et la difficulté est que le meilleur résultat collectif n’est pas soutenable, puisque chacun pourrait améliorer sa position en s’en écartant.
Cette structure se retrouve bien au-delà de son habillage narratif, partout où un bénéfice partagé exige une retenue individuelle coûteuse. Ce qui change l’analyse, c’est la répétition. Dans un jeu joué une seule fois, la trahison est imparable ; lorsque les mêmes joueurs interagissent de façon répétée et se soucient des tours futurs, la coopération peut se maintenir car la trahison peut être punie ensuite, ce qui explique la différence de comportement entre les versions finies et indéfiniment répétées.
Exemple : Dilemme du prisonnier
La matrice des gains, chaque case donnant le résultat d’Alice puis celui de Bob : tous deux témoignent, (−5, −5) ; Alice témoigne et Bob refuse, (0, −10) ; Alice refuse et Bob témoigne, (−10, 0) ; tous deux refusent, (−1, −1).
Alice compare les colonnes. Face à un Bob qui témoigne, elle obtient −5 en témoignant contre −10 en refusant. Face à un Bob qui refuse, elle obtient 0 contre −1. Témoigner l’emporte dans les deux cas, de 5 dans le premier et de 1 dans le second.
La matrice de Bob est symétrique, il raisonne donc à l’identique. Le résultat est (−5, −5), alors que (−1, −1) était disponible et meilleur pour les deux. Aucun ne peut l’atteindre unilatéralement : depuis le refus mutuel, chacun pourrait passer de −1 à 0 en trahissant, ce qui est exactement pourquoi cette issue ne tient pas.
Questions fréquentes
Pourquoi parle-t-on de dilemme ?
Parce qu’un raisonnement individuel irréprochable conduit les deux joueurs à un résultat qu’ils déplorent tous deux. La tension n’est pas une erreur d’analyse ; c’est une propriété structurelle réelle, et c’est ce qui rend le jeu intéressant.
Que signifie que l’équilibre est dominé au sens de Pareto ?
Un résultat est dominé au sens de Pareto lorsqu’il en existe un autre que tous les joueurs préfèrent. Ici le refus mutuel est préféré par les deux à la dénonciation mutuelle, donc l’équilibre est dominé. Équilibre et efficacité sont simplement des propriétés distinctes.
La répétition change-t-elle le résultat ?
Elle le peut. Lorsque les mêmes joueurs se rencontrent de façon répétée et accordent de la valeur aux tours futurs, des stratégies qui récompensent la coopération et punissent la trahison peuvent rendre la coopération individuellement rationnelle. Un nombre fini et connu de tours est un cas différent, car un raisonnement à rebours depuis le dernier tour tend à défaire la coopération.
En résumé
Le dilemme du prisonnier montre la rationalité individuelle produisant une perte collective : la trahison domine, tous deux trahissent, et tous deux s’en trouvent plus mal que s’ils avaient coopéré. C’est la référence standard pour toute situation où un bénéfice partagé exige une retenue individuellement coûteuse.