Les décisions dans l’incertitude : utilité et information
Pourquoi il peut être rationnel de refuser un pari dont la valeur monétaire espérée est positive, ce que mesure la courbure d’une fonction d’utilité, et comment donner un prix à une observation avant de l’acheter - y compris dans le cas fréquent où le prix honnête est nul.
Prérequis : Réseaux bayésiens et inférence probabiliste
L’inférence produit des croyances. Les croyances ne vous disent pas quoi faire. Agir réclame ce que les croyances ne peuvent fournir - des préférences - et la théorie de la décision est l’arithmétique qui met les deux ensemble.
A. L’utilité espérée
Une fonction d’utilité donne un unique nombre disant à quel point un état est désirable. Comme une action dans un monde incertain ne fixe pas son issue, notons la variable aléatoire des issues possibles. L’utilité espérée d’une action, étant donné l’évidence , vaut
et le principe de maximisation de l’utilité espérée se réduit à .
Ce n’est pas « maximiser le meilleur cas », qui ignore le risque, ni « atteindre un but », puisque la qualité d’une issue est ici continue plutôt que réussie ou ratée.
B. L’argent n’est pas l’utilité
Vous avez gagné à un jeu télévisé. Prenez $1,000,000, ou jouez à pile ou face : rien contre $2,500,000. La valeur monétaire espérée du pari est $1,250,000, ce qui bat le million assuré. La plupart des gens refusent.
Cotez votre situation actuelle à 5, le million assuré à 8 et la meilleure issue à 9. Alors
et refuser est donc ce que le principe prescrit. La moyenne est calculée de façon identique dans les deux cas ; seule l’échelle diffère, et l’utilité est l’échelle qui encode la préférence.
Le désaccord porte sur la forme d’une courbe, non sur la prudence. L’utilité d’un milliardaire est presque linéaire sur quelques millions, ce qui donne : le même principe lui dit de prendre le pari. Deux agents, probabilités identiques, choix rationnels opposés.
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
L'argument porte sur la forme d'une courbe : voici donc la courbe. Les trois issues en sont les points, le curseur la courbe, et les probabilités ne bougent jamais. La ligne pointillée est la note que le sommet devrait atteindre pour qu'accepter soit juste : 11, avec les notes ci-dessus. Cela mérite deux lectures, car cela signifie que le second million et demi devrait apporter au moins autant que le premier million, c'est-à-dire l'exact contraire des rendements décroissants sur lesquels repose tout l'argument.
Interactif : la pièce, et la courbe qui tranche
Les probabilités ne changent jamais. Seule la forme de l’utilité change.
- Utilité espérée, accepter
- 7.00
- Utilité espérée, refuser
- 8.00
- Note du sommet qui égaliserait
- 11.00
- Ce que prescrit le MEU
- refuser
- Espérance monétaire
- $1,250,000
Le pari vaut $1,250,000 en argent contre un million sûr : l’argent dit accepter. En utilité il vaut 7.00 contre 8.00, et le principe dit refuser. Rien ici ne critique la moyenne : elle est calculée de la même façon les deux fois, et ce qui diffère est l’échelle moyennée. Pour qu’accepter soit juste, le sommet devrait valoir 11.00, c’est-à-dire que le second million et demi devrait apporter au moins autant que le premier million.
C. La courbure, c’est l’aversion au risque
Grayson a trouvé l’utilité de l’argent proche d’un logarithme, une idée qui remonte à Bernoulli en 1738. Pour un sujet, l’ajustement était . Parcourez-le par tranches égales de $100,000 et l’utilité ajoutée rétrécit : , puis , puis , puis .
Des gains qui rétrécissent, c’est la concavité, et pour une courbe concave pour toute loterie : affronter le pari vaut moins que recevoir sa valeur espérée. C’est l’aversion au risque, et elle se mesure. Sur la même courbe, une pièce équilibrée entre $0 et $800,000 a une utilité espérée de contre pour les $400,000 certains. Le montant sûr auquel il accorde exactement la valeur du pari - l’équivalent certain - vaut environ $227,000, si bien que la prime de risque avoisine $173,000.
La courbe n’est pas concave partout. Quelqu’un déjà endetté de $10 millions pourrait rationnellement accepter une pièce jouant un gain supplémentaire de $10 millions contre une perte de $20 millions, puisque les issues diffèrent à peine de là où il se tient. D’où une forme en S : goût du risque dans la détresse, aversion au risque sur les patrimoines positifs.
Les utilités n’ont pas d’échelle absolue : fixez-en une en épinglant une meilleure et une pire issue à 1 et 0, puis élicitez n’importe quel lot en l’opposant à une loterie étalon et en ajustant la probabilité jusqu’à ce que l’agent soit indifférent. Cette probabilité est l’utilité.
Là où la pire issue est la mort, les gens résistent à l’idée d’y mettre un prix, et l’arbitrage se fait quand même. Un micromort est une chance sur un million de mourir. Parcourir 230 miles en coûte un, donc les 92 000 miles que vit une voiture en coûtent 400 ; les gens paient environ $10,000 pour une voiture qui divise ce risque par deux, soit 200 micromorts épargnés, ce qui implique $50 le micromort - en accord avec ce que les études rapportent directement. La portée se limite aux petits risques ; personne n’accepte $50 millions pour mourir sur-le-champ.
Russell et Norvig décrivent une agence qui a rejeté une étude sur l’amiante au motif qu’elle supposait une valeur en dollars pour la vie d’un enfant, puis a renoncé au désamiantage - impliquant par là une valeur inférieure à celle qu’elle refusait d’énoncer.
D. Donner un prix à une observation
Un réseau de décision étend un réseau bayésien par des nœuds de décision rectangulaires pour les choix de l’agent et un nœud d’utilité en losange qui note l’issue. L’évaluer est une boucle : posez l’évidence, puis, pour chaque action, lancez l’inférence ordinaire sur les parents du nœud d’utilité, faites la moyenne, et retenez le meilleur. Le moteur d’inférence, lui, ne change pas.
Cette structure permet de demander ce que vaut une observation avant de l’acheter. La valeur de l’information parfaite est l’utilité espérée d’une décision prise après l’observation, moyennée sur ce qu’elle pourrait dire, moins l’utilité espérée d’une décision prise maintenant :
Une compagnie pétrolière peut acheter l’un de blocs indiscernables ; un seul recèle du pétrole valant et chacun coûte , donc le profit espéré est nul dans les deux cas. Un sondage définitif du bloc 3 change cela. Avec probabilité il trouve du pétrole et la compagnie gagne ; sinon les chances sur les blocs restants passent de à , ce qui vaut . Ensemble :
Le sondage d’un bloc vaut exactement le prix d’un bloc, pour tout .
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
E. Le cas où le prix est nul
Le même raisonnement a une conséquence plus tranchante. Deux itinéraires : une autoroute d’utilité espérée 10, et une piste valant 4 qu’un rapport satellite pourrait déplacer n’importe où dans . Le rapport ne vaut rien. Quoi qu’il dise, la piste plafonne à 6, vous prenez toujours l’autoroute, et l’utilité espérée après coup reste 10, donc .
Rapprochez plutôt les itinéraires - 10 contre quelque chose dans - et sur les relevés vous retenez à chaque fois le meilleur de 10 et du relevé :
Attention ensuite à la référence. Décider maintenant, ce n'est pas prendre l'autoroute : c'est prendre l'action dont l'utilité espérée est la plus grande, et la piste vaut déjà . Donc , et toute cette valeur vient d'un seul relevé. Sans le rapport vous prenez la piste ; le relevé vous renvoie à l'autoroute, ce qui vaut exactement . À les deux routes sont à égalité, si bien que changer ne rapporte rien, et les relevés et sont une bonne nouvelle et ne valent rien, puisque vous preniez déjà cette route.
Où cela vous laisse
L’information vaut quelque chose exactement quand elle peut changer ce que vous faites. Une mesure incapable d’altérer le choix ne vaut rien, si précise ou si coûteuse soit-elle, et sa valeur culmine quand les actions candidates sont proches et que l’observation est assez large pour les réordonner. C’est une vérification peu coûteuse avant de commander une étude, et c’est la même arithmétique qui explique pourquoi une personne sensée refuse un pari favorable. Le parcours Décider dans l’incertitude travaille chacun de ces points à la main et en code.
Références et lectures complémentaires
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.