/
Автор: Yildizoglu M.
Теги: absolument ! voici une liste de mots-clés en français pour décrire un livre intitulé
ISBN: 978-2-10-055837-7
Год: 2003
Текст
• t
Manuel et exercices corrigés
• •
r. i •! ••
iltl»
e - If I
Introduction
à la théorie
des jeux
Tout le catalogue sur
www.dunod.com
DUNOD
ÉDITEUR DE SAVOIRS
Introduction
à la théorie
des jeux
Murât Yildizoglu
2e édition
DUNOD
Le pictogramme qui figure ci-cantre
mérite une explication. San abjet est
d'alerter le lecteur sur la menace que
représente paur l'avenir de l'écrit,
particulièrement dans le domaine
de l'édition technique et
universitaire, le développement massif du
phatocapillage.
Le Cade de la propriété
intellectuelle du 1er juilletl 992 interdit
en effet expressément la
photocopie à usage collectif sans
autorisation des ayants droit. Or, cette pratique
s'est généralisée dans les établissements
DANGER
d'enseignement supérieur, provoquant une
baisse Drutale des achats de livres et de
revues, au point que la possibilité même pour
les auteurs de créer des œuvres
nouvelles et de les faire éditer
correctement est aujourd'hui menacée.
Naus rappelons donc que faute
reproduction, partielle au totale,
de la présente publication est
L£ PHOTOCOPULAGEI interdite sans autorisation de
TUE LE LIVREj l'auteur, de san éditeur au du
Centre français d'exploitation du
droit de copie (CFC, 20, rue des
Grands-Augustins, 75006 Paris).
© Dunod, Paris, 2003, 2011
ISBN 978-2-10-055837-7
Le Code de la propriété intellectuelle n'autorisant, aux termes de l'article
L. 122-5, 2° et 3° a), d'une part, que les «copies ou reproductions strictement
réservées à l'usage privé du copiste et non destinées à une utilisation collective »
et, d'autre part, que les analyses et les courtes citations dans un but d'exemple et
d'illustration, « toute représentation ou reproduction intégrale ou partielle faite
sans le consentement de l'auteur ou de ses ayants droit ou ayants cause est
illicite »(art. L. 1224).
Cette représentation ou reproduction, par quelque procédé que ce soit,
constituerait donc une contrefaçon sanctionnée par les articles L. 335-2 et suivants du
Code de la propriété intellectuelle.
I
able des matières
Avant-propos IX
Première partie
Premie* éléments
1. Introduction 3
I. Différents types de jeux 4
IL La question de la rationalité 6
III. Prérequis et plan de route 9
2. Jeux, stratégies et information 11
I. Définition et représentation des situations d'interaction 12
II. Représentation de l'information 16
III. Définition des stratégies 18
IV. Solutions et équilibres d'un jeu 23
Deuxième partie
Les jeux non coopératifs avec information complète
3. Équilibre de Nash (1951) 35
I. Fonctions de meilleures réponses et équilibre de Nash 38
II. Insuffisances de l'équilibre de Nash 43
III. Application : le modèle de Hotelling 49
IV. Application : le problème de l'entrant potentiel 53
4. Dynamique et rétroduction 61
I. Sous-jeux et équilibre parfait en sous-jeux (EPSJ)-Selten (1975) 62
II. EPSJ et crédibilité des menaces 66
III. Paradoxes de la rétroduction 68
IV. Application : une taxinomie des stratégies d'investissement 70
Table des matières • V
5. Jeux répétés 85
I. L'idée de base 85
II. Émergence de la coopération : le théorème folk 88
III. Observations imparfaites 94
IV. Application : l'émergence du cartel 95
V. Application : qualité des produits et réputation 98
6. Jeux de négociation 109
I. Négociation avec propositions alternées 110
II. Application : la paillote du Soleil 114
III. Stratégies pour affaiblir l'autre partie 115
Troisième partie
Jeux non coopératifs avec information incomplète
7. Jeux simultanés avec information incomplète 121
I. Le rôle de la Nature 122
II. Application : le duopole de Cournot sous information incomplète 123
III. Équilibre de Nash bayésien 126
8. Jeux séquentiels avec information incomplète 137
I. La perfection en sous-jeux devient insuffisante 138
II. Équilibre bayésien parfait 141
III. Application : retour au jeu de l'entrée 142
Quatrième partie
Jeux evolutionnaires
9. Une approche alternative : équilibres evolutionnaires 157
I. Stratégies, mutations, sélection 159
II. Stabilité évolutionnaire 160
III. Règles de comportement et dynamique de réplication 163
Bibliographie 171
Index 173
VI • INTRODUCTION À LA THÉORIE DES JEUX
A Edith, Elsa-Nuray et Romain pour leur patience et leur amour
/tvant-propos
Cet ouvrage s'adresse à toute personne désirant s'initier à la théorie des jeux. Il
a été conçu de manière à compléter l'ensemble des ouvrages déjà existants
en français. En effet, pendant la préparation d'un premier cours de théorie des
jeux dans mon université, je me suis rendu compte que les ouvrages existants
ne facilitaient pas cette tâche. Il existe bien sûr d'excellents ouvrages mais soit
ils sont trop complets, avec une structuration assez peu adaptée aux contraintes
académiques françaises, soit ils se limitent à une simple introduction au
domaine, soit ils couvrent au contraire des besoins trop spécifiques. L'objectif
de cet ouvrage est de fournir une base facile à utiliser pour un premier cours
de théorie des jeux dans les seconds cycles des filières d'économie et de gestion.
Par conséquent, ce manuel propose une initiation rigoureuse à la théorie des
jeux sans semer d'embûches mathématiques sur la route du lecteur. Une bonne
connaissance des mathématiques et de la microéconomie, telles qu'elles sont
enseignées dans le premier cycle des filières économiques est suffisante pour
bénéficier pleinement de cet ouvrage car la compréhension de la majeure partie
des concepts de la théorie des jeux demande avant toute chose un raisonnement
logique, plutôt que des outils mathématiques très sophistiqués.
Cet ouvrage ne vise pas à couvrir la totalité de la théorie des jeux.
Néanmoins, dans une optique d'hypertexte, il propose des lectures
complémentaires aux lecteurs qui désirent approfondir les concepts et les
résultats mathématiques. Dans une approche qui allie la rigueur et la nature
ludique de la théorie des jeux, chaque chapitre expose les concepts en se basant
sur des exemples et des applications appartenant à un domaine de l'économie où
l'introduction de la théorie des jeux a dramatiquement modifié les approches
théoriques : l'organisation industrielle. Chaque chapitre est suivi d'un résumé
des concepts étudiés et d'exercices corrigés. Un fichier Acrobat regroupant les
transparents des principaux résultats et principales figures sera mis à la
disposition des enseignants qui adopteront cet ouvrage pour leur cours.
La totalité du manuel peut être enseignée dans le cadre d'un cours d'une
quarantaine d'heures. Si l'enseignant a la possibilité de réserver les applications à
des séances de travaux pratiques, l'ouvrage peut être couvert en une vingtaine
Avant-propos • IX
d'heures. Sinon, avec les applications, les deux premières parties de l'ouvrage
peuvent constituer la base d'un premier cours de théorie des jeux d'une
vingtaine d'heures.
La seconde édition apporte des corrections par rapport à la première édition,
ainsi qu'un nouveau chapitre sur les jeux de négociation (chapitre 6) qui sont de
plus en plus utilisés dans la modélisation économique des interactions sociales
(y compris en macroéconomie).
Il existe un site web dédié à cet ouvrage à l'adresse suivante :
http://yildizoglu.xl0.mx/livretj/index.html
où des éléments complémentaires seront mis à la disposition des lecteurs de cet
ouvrage :
- des exercices corrigés supplémentaires qui seront ajoutés dans le temps ;
- des liens vers d'autres ressources disponibles sur Internet ;
- des transparents pour les enseignants qui adopteront cet ouvrage.
X • INTRODUCTION À LA THÉORIE DES JEUX
Première partie
y
Premiers éléments
I. Introduction 3
2m Jeux, stratégies et information 11
i« Introduction
La théorie des jeux est un ensemble d'outils analytiques qui ont été développés
pour nous faciliter la compréhension des situations d'interaction entre des
décideurs (agents, joueurs) rationnels.
La concurrence que se livrent les firmes sur les marchés est typiquement une
situation d'interaction. Pour cette raison, les stratégies des firmes et leurs
conséquences quant à V organisation industrielle nous fourniront les principales
applications des concepts développés. Mais le concept de jeu couvre une large
gamme de situations : les jeux de société (les échecs, le poker...) ; les
interdépendances entre les politiques nationales (coordination des politiques de relance
en Europe...) ; la détermination des stratégies militaires (Sun-Tzu (1972),
400 AC) ; la détermination des cartes électorales...
Par conséquent, on peut approcher la théorie des jeux de plusieurs points de
vue, allant de la philosophie (politique) à la topologie différentielle. Cet ouvrage
ne couvre pas toute cette gamme et prend le parti de présenter une vision
relativement simple de la théorie des jeux dans le but de constituer une introduction
aux principaux résultats et intuitions qu'on peut développer grâce à cette
théorie. La première formulation cohérente d'un ensemble de résultats de la théorie
des jeux date de la Seconde Guerre mondiale et nous la devons à John von
Neumann et à Oscar Morgenstern (Von Neuman & Morgenstern (1944)).
CALVIN AND HOBBES © 1991 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved
© 1993 Hors Collection/Presses de la Cité pour l'édition française.
Figure 1.1 Le jeu selon Calvin et Hobbes...
Introduction • 3
Les hypothèses de base de cette théorie sont les suivantes :
- les décideurs sont rationnels et ils poursuivent des objectifs exogènes et
indépendants ;
- ils tiennent compte de la connaissance qu'ils ont ou des anticipations qu'ils
font du comportement des autres décideurs (ils raisonnent de manière
stratégique).
Sur la base de ces deux hypothèses, la théorie des jeux propose des modèles
qui sont des représentations très abstraites des situations réelles. La nature
abstraite de ces modèles est aussi la source de leur généralité : ils couvrent ainsi
une gamme très large de phénomènes. Par exemple, le concept d'équilibre
de Nash (qui fera l'objet du chapitre 3), a été utilisé pour étudier la concurrence
oligopolistique mais aussi politique.
La théorie des jeux utilise les mathématiques pour exprimer formellement
ses idées mais ces idées ne sont pas essentiellement mathématiques. La
formulation mathématique est utilisée par commodité, dans le but de définir
précisément les concepts, de vérifier leurs implications avec rigueur. Dixit &
Nalebuf (1993), par exemple, exposent les concepts de base de la théorie des
jeux de manière non formalisée. L'objet de cet ouvrage ne sera pas l'intérêt
mathématique de la théorie des jeux mais son rôle dans la compréhension du
comportement des décideurs stratégiques.
I ■ Différents types de jeux
Différents contextes d'interaction induisent différents types de jeux entre les
agents. Mais le point commun de ces situations est la difficulté, pour la théorie
économique, de prédire le résultat auquel elles vont aboutir. La théorie des jeux
propose des prédictions basées sur les solutions du jeu concerné.
Un jeu est une description de l'intérêt des joueurs et de l'interaction
stratégique qui spécifie les contraintes qui pèsent sur les actions (stratégies) que les
joueurs peuvent choisir. Une solution est la description systématique des
situations qui peuvent émerger comme le résultat d'une famille de jeux. La théorie
des jeux propose des solutions potentielles pour des familles de jeux et étudie
leurs propriétés.
Les différents contextes d'interaction peuvent être classés selon trois
dimensions basées sur :
- le type de relation entre les agents (coopératif vs. non coopératif) ;
- le déroulement dans le temps (simultané vs. séquentiel) ;
- l'information dont disposent les agents (information parfaite vs. imparfaite et
complète vs. incomplète).
4 • PREMIERS ÉLÉMENTS
Ai Jeux coopératifs et jeux non coopératifs
L'entité de base de la théorie des jeux est le joueur. Un joueur peut être
interprété comme un individu seul ou un groupe d'individus prenant une décision.
Une fois que nous avons défini l'ensemble des joueurs, nous pouvons distinguer
deux types de modèles : les jeux dont les éléments de base sont les actions des
joueurs individuels et ceux basés sur les actions jointes d'un groupe de joueurs.
Les modèles du premier type sont appelés les jeux non coopératifs et ceux de
second type, les jeux coopératifs. Les firmes composant un duopole de Cournot
participent à un jeu non coopératif tandis que les firmes formant un cartel et
donc maximisant leur profit joint, participent à un jeu coopératif. Cet ouvrage
est consacré aux jeux non coopératifs et quand nous considérons la coopération,
la question est celle de son émergence dans les jeux non coopératifs.
D. Jeux simultanés et jeux séquentiels
Nous pouvons aussi distinguer deux types de modèles en fonction de leur
déroulement.
Un jeu simultané (ou stratégique) est le modèle d'une situation où chaque
joueur choisit son plan d'action complet une fois pour toutes au début du jeu.
Par conséquent les choix de tous les joueurs sont simultanés. Ainsi, au moment
de faire son choix, le joueur n'est pas informé des choix des autres.
Un jeu séquentiel, au contraire, spécifie le déroulement exact du jeu ; chaque
joueur considère son plan d'action non seulement au début du jeu mais aussi
chaque fois qu'il doit effectivement prendre une décision pendant le
déroulement du jeu.
En général on représente les jeux simultanés sous forme d'un tableau (la
forme normale du jeu). Cela convient surtout quand les stratégies des joueurs
sont discrètes, sinon le duopole de Cournot aussi est un jeu simultané. Les jeux
séquentiels sont en général représentés par un arbre du jeu qui permet la
représentation complète de la structure et du déroulement du jeu. Nous allons
néanmoins voir plus tard que cette distinction est loin d'être rigide et que nous
pouvons utiliser l'une ou l'autre forme pour représenter tous les jeux.
Ci Nature de l'information
L'information dont on dispose chaque fois qu'on doit choisir une action est une
dimension très importante des jeux. Elle possède une in.uence déterminante sur
l'évaluation des stratégies par les joueurs et même sur leur perception des
stratégies.
Introduction • 5
L. On dit que Vinformation est parfaite si chaque joueur est paifaitementl
^informé des actions passées des autres joueurs. L'information est imparfaitej
jÊau^nd un joueur ignore certains des choix qui ont été effectués avant le sieji^
Le jeu d'échecs est par définition un jeu à information parfaite puisque
chaque joueur observe tous les coups joués. Le jeu de la Bataille Navale est à
information imparfaite puisqu'on ignore l'emplacement choisi par l'adversaire
pour chacun de ses navires.
On utilise les ensembles d'information pour représenter l'information dont
dispose chaque joueur chaque fois qu'il doit choisir une action. Dans les jeux
simultanés, l'information est imparfaite par définition puisqu'on ne peut
observer les choix des autres joueurs.
Parfois certains joueurs peuvent même ignorer certaines composantes
du jeu auquel ils jouent. Par exemple, dans un duopole de Cournot, les profits
(donc les gains) peuvent dépendre d'un événement aléatoire influençant la
demande.
Un jeu est à information incomplète si au moins un des joueurs ne connaît^)
s parfaitement la structure du jeu. Dans le cas contraire, il est à inform
Les deux parties centrales de cet ouvrage vont suivre cette dernière
distinction : la première partie sera consacrée aux jeux avec information complète
tandis que la seconde proposera des solutions pour des jeux avec information
incomplète.
II. La question de la rationalité
Ai Comportement rationnel
Les modèles de la théorie des jeux supposent que les agents sont rationnels :
chacun est conscient des alternatifs, fait des anticipations sur les éléments
inconnus, possède des préférences claires et choisit délibérément son action
après un processus d'optimisation.
6 • PREMIERS ÉLÉMENTS
En l'absence d'incertitude, les é éments suivants constituent un modèle de
choix rationnel :
Un ensemble d'actions, A, à partir duquel le décideur fait son'cfiôix'^^|
£- Un ensemble des conséquences possibles, C, de ces actions ;
f.- Une fonction de conséquence (résultat), g : A -> C, qui associe une
conséquence à chaque action ;
Une relation de préférence (une relation binaire transitive, réflexive) >: sur
l'ensemble C.
Parfois les préférences sont représentées par une fonction d'utilité,
U : C -> M, qui représente une relation de préférence > par la condition
suivante : x >z y si et seulement si U(x) ^ U(y). Étant donné un ensemble B ç. A
d'actions réalisables dans un cas particulier, un décideur rationnel choisira une
action a* qui est réalisable {a* g B) et optimal dans le sens que g(a*) >^ g(a)
pour tout a g B. De manière alternative, il résoudra le problème suivant :
maxU(g(a)).
Une hypothèse dont dépend la validité d'un tel modèle de choix est que
l'agent utilise les mêmes préférences quand il fait son choix dans différents
ensembles B. Le comportement de nos joueurs sera donc tout à fait similaire à
celui des agents de la microéconomie.
Dans les modèles que nous allons étudier, nous serons souvent amenés à
considérer des agents qui font des choix sous incertitude. Il peut arriver que les
joueurs soient :
- incertains quant aux paramètres objectifs de leur environnement ;
- informés imparfaitement à propos des événements qui ont lieu dans le jeu ;
- incertains quant aux actions des autres joueurs qui ne sont pas déterministes ;
- incertains quant au raisonnement des autres joueurs.
Pour modéliser les choix sous incertitude, la théorie des jeux utilise quasi-
systématiquement les théories de Von Neuman & Morgenstern (1944) (VNM)
et de Savage (1954).
Dans ce cas, la fonction de conséquence est stochastique et connue par le
décideur : pour tout a G A, la conséquence g (a) est une loterie (une distribution
de probabilité) sur C. Alors le décideur est supposé se comporter comme s'il
maximisait la valeur espérée d'une fonction (d'utilité de VNM) qui attribue un
nombre à chaque conséquence. Si la relation stochastique entre les actions et les
conséquences n'est pas donnée, le décideur est supposé se comporter comme
s'il avait dans l'esprit une distribution de probabilité (subjective) qui détermine
Introduction • 7
les conséquences de chaque action (extension de Savage). Dans ce cas le
décideur est supposé se comporter comme s'il avait en tête :
- un ensemble d'états co e £2,
- une mesure de probabilité \x sur £2,
- une fonction g : A x £2 -> C et
- une fonction d'utilité u : C -> M :
Il est alors supposé choisir une action a qui maximise la valeur espérée de
u(g(a, co)) en fonction de la mesure de probabilité /x. Il faut néanmoins
signaler que cette vision du décideur rationnel est largement critiquée aujourd'hui par
les psychologues et économistes expérimentalistes. C'est la seule cohérente
dont nous disposons aujourd'hui, même si elle limite sévèrement la validité des
théories que nous allons étudier.
D. Rationalité limitée
Dans la vie, quand nous considérons des jeux, nous nous intéressons souvent à
l'asymétrie entre les capacités des joueurs. Par exemple, certains joueurs
peuvent mieux percevoir une situation ou avoir une capacité d'analyse plus forte.
C'est typiquement la différence qui existe entre un ordinateur qui joue aux
échecs et un joueur humain. Ces différences sont exclues de la théorie des jeux
du fait de l'hypothèse de rationalité. Si tous les joueurs du monde étaient des
décideurs rationnels, le jeu d'échecs n'aurait aucun intérêt. En effet nos agents
rationnels se comportent plutôt comme un ordinateur qui joue aux échecs :
l'ordinateur utilise la force brute et explore toutes les branches futures du jeu
tandis qu'un joueur humain procède par une appréhension globale et intuitive de
la situation. Or, les joueurs diffèrent du point de vue de leur connaissance du jeu
et de leurs capacités d'analyse dans les jeux réels. C'est cela même qui fait
l'intérêt des jeux que les sociétés humaines inventent.
C'est seulement très récemment qu'on a commencé à tenter de modéliser des
situations où la rationalité des agents n'est pas parfaite tandis que les travaux
d'Herbert Simon (voir par exemple, Simon (1972)) ont souligné depuis
longtemps la pertinence du concept de rationalité limitée (voir Nelson & Winter
(1982), Kirman & Salmon (1995) pour des approches alternatives, Kahneman &
Tversky (1982) et Rubinstein (1998) pour des tentatives d'axiomatiques
nouvelles). Simon propose une vision très différente du comportement rationnel.
Une vision dans laquelle les agents se contentent de leurs choix dès qu'ils leur
permettent d'atteindre un niveau suffisant de satisfaction : c'est le principe de
satisfaction (satisficing) de Simon. Cela explique notamment une certaine
stabilité dans les comportements des agents qui ne répondent pas nécessairement à
toute variation de leur environnement tant que la conséquence de cette variation
reste limitée.
8 • PREMIERS ÉLÉMENTS
D'autre part, nous savons depuis Darwin qu'il existe, dans la Nature, une
dynamique basée sur des mécanismes simples, dépourvus de rationalité propre
et que cette dynamique conduit à des solutions relativement efficaces et stables
étant données les conditions caractérisant chaque niche écologique : c'est la
dynamique d'évolution. Ce mécanisme fascine depuis longtemps les chercheurs
qui étudient la dynamique économique et, plus récemment, tout un domaine de
la théorie des jeux s'est développé pour étudier les conséquences de ce type de
dynamique : les jeux évolutionnaires. Nous consacrerons la dernière partie de
cet ouvrage à ce type de jeux et les concepts de solutions qu'il propose pour les
situations d'interaction.
Prérequis et plan de route
Il y a assez peu de prérequis pour cet ouvrage. Une maîtrise des outils
mathématiques de base, de l'analyse et de l'algèbre telles qu'elles sont enseignées
pendant les deux premières années des filières d'économie et de gestion, vous
aidera certainement, mais l'outil que nous allons le plus souvent utiliser est le
raisonnement logique. Vous aurez néanmoins souvent besoin des concepts de
base en ce qui concerne l'optimisation et les probabilités. Les applications
en organisation industrielle vont se situer dans la continuité du cours de
microéconomie tel qu'il est enseigné pendant la seconde année des filières
d'économie.
Ce manuel s'insère dans un ensemble d'ouvrages de théorie des jeux en
français. Plutôt que de reproduire les mêmes explications que ces ouvrages, l'auteur
a choisi de leur faire appel quand ils proposent une explication particulièrement
satisfaisante et complémentaire. Les ouvrages les plus sollicités ont été dotés
d'une référence simplifiée :
- [KB]Binmore(1999);
- [GG] Giraud (2000) ;
- [GU] Umbhauer (2002).
La notation suivante est utilisée dans le texte pour indiquer des lectures
complémentaires conseillées :
fL £? [KB] Chapitres 0 et 1 fait référence ici à Binmore (1999), chapitres 0 et 1 (c'est
^^ une réelle suggestion par ailleurs).
Les lecteurs intéressés peuvent aussi bénéficier de la lecture des trois
ouvrages suivants :
- Kreps (1999) ;
- Kreps (1996) ;
- Gremaq (1988) ;
Introduction • 9
Plan de l'ouvrage :
1. Les concepts de base (chapitre 2).
2. Les jeux en information complète : après avoir considéré les principaux
concepts d'équilibre (chapitres 3 et 4), nous nous intéresserons plus
spécifiquement au rôle du temps dans les interactions (chapitre 5) et aux processus
de négociation (chapitre 6).
3. Les jeux en information incomplète : les jeux statiques (chapitre 7) et les jeux
dynamiques (chapitre 8).
4. Les jeux proches de la rationalité limitée : les jeux évolutionnaires
(chapitre 9).
Chacune des étapes sera accompagnée d'exemples et d'applications en
organisation industrielle, ainsi que d'exercices corrigés.
Les lecteurs qui désirent approfondir les questions abordées dans cet ouvrage
pourront continuer leur lecture avec Kreps (1996). Kreps (1999) approfondit
la ré.exion sur la nature de certains résultats forts et de certains paradoxes
de la Théorie des jeux, ainsi que sur la cause de certaines de ses faiblesses.
Osborne & Rubinstein (1994) et Fudenberg & Tirole (1991) sont dédiés à une
présentation plus complète et aussi plus rigoureuse de la théorie des jeux non
coopératifs. Osborne & Rubinstein (1994) contient aussi une dernière partie qui
couvre les jeux coopératifs. Moulin (1979) et Myerson (1991) accordent une
place plus importante aux jeux coopératifs.
10 • PREMIERS ÉLÉMENTS
2.1
eux, stratégies
et information
L'apport principal de la théorie des jeux en économie est la prise en
compte et l'analyse des comportements stratégiques des agents.
Plus spécifiquement, en organisation industrielle, la question
principale à laquelle la théorie des jeux nous permet de répondre est la
suivante : Quelle est la structure de marché qui résulte du comportement
non coopératif des firmes? Le comportement des firmes est non
coopératif dans la mesure où chaque firme prend sa décision de manière
à obtenir la meilleure situation pour elle, sans aucune coordination avec
les autres firmes.
^Concepts clés étudiés : ce chapitre définit les différents types de jeux et les
concepts de stratégie pertinents pour ces jeux :
- les jeux en forme normale ;
- les jeux en forme extensive ;
- les ensembles d'information ;
- l'information parfaite/imparfaite ;
- l'information complète/incomplète ;
- les stratégies pures et mixtes pour la forme normale ;
-les stratégies pures, mixtes, locales et comportementales
pour la forme extensive ;
- les stratégies équivalentes ;
- l'élimination des stratégies strictement dominées.
Jeux, stratégies et information • 11
I. Définition et représentation
des situations d'interaction
Les éléments qui caractérisent les jeux non coopératifs sont les suivants :
- un petit nombre d'agents (les joueurs) qui interagissent ;
- les décisions de chaque agent influencent les gains des autres ;
- la prise en compte de l'information dont chaque agent dispose au moment de
prendre sa décision ;
- la prise en compte du déroulement des décisions dans le temps (décisions
simultanées ou séquentielles).
Les décisions simultanées sont en général représentées sous la forme d'un
tableau (jeux en forme normale) et les décisions séquentielles, sous la forme
d'un arbre de jeu (jeux en forme extensive).
Ai La forme normale d'un jeu
La définition d'un jeu en forme normale doit répondre aux trois questions
suivantes :
1. Qui joue ?
2. Quelles sont les actions disponibles pour chaque joueur ?
3. Quelle est la valeur pour chaque joueur des différents résultats possibles du
jeu?
La définition suivante introduit ces composantes d'un jeu en forme normale.
%
définition 2.1
Un jeu en forme normale est décrit par les éléments suivants :
Un ensemble de n joueurs : / = {1, 2,
- Pour chaque joueur /, / e /, un ensemble de stratégies Sh qui contient!.)
toutes les stratégies possibles de ce joueur. s{ e 5f- est une stratégie particu--|
lière du joueur i. Par conséquent, 5; = {sj, .s-?,..., s/} si kf stratégies |
sont disponibles pour le joueur /. Si chaque joueur / choisit une stratégie s,,.,
nous pouvons représenter le résultat (ou profil de stratégies) du jeu par uni
vecteur qui contient toutes ces stratégies
S = (s{,S2,.-,Sn)
12 • PREMIERS ÉLÉMENTS
Dour chaque joueur /, une fonction de gain, w,, qui représente les préfé- ?
P rences (VNM) du joueur / en donnant la valeur pour le joueur / de chaque^
^résultat du jeu : u^s). C'est un nombre réel :
iij : S = X Si -> M
/G/
;-r- 5 = (j,, j2,j.-,,^i,) \-*.u;(s):.
Précisons ces concepts à l'aide d'un premier exemple.
► Exemple 2.1 (le dilemme du prisonnier)
Deux individus (Bonnie et Clyde) sont arrêtés par la police suite à un vol
à main armée et ils sont enfermés dans deux cellules séparées sans
possibilité de communication.Chaque individu est interrogé séparément et il
a le choix entre nier d'avoir commis le vol (stratégie N) ou dénoncer son
complice comme seul responsable (stratégie D). Nous avons donc un jeu
non coopératif avec n = 2 joueurs, I = {1, 2} = {Bonnie, Clyde}.
Uensemble de stratégies de chaque joueur est S\ = S2 = {N,D}.
Chaque déroulement possible de ce jeu correspond au choix d'une
stratégie par Bonnie et d'une stratégie par Clyde. Il y a donc 4 résultats
possibles du jeu :
(Sl=N9s2 = N),(N,D),
(D,D), (D,N)
-[
Les gains des individus (connus par eux, comme les autres éléments du
jeu) représentent leur situation qui résulte des années de prisons
auxquelles ils sont condamnés en fonction de leurs dépositions et ils sont
négativement liés avec ces années :
- Si Bonnie et Clyde dénoncent tous les deux, ils sont condamnés à 8 ans
de prison.
- S'ils nient tous les deux, ils auront 1 année de prison du fait d'absence
de preuves accablantes.
- Si un seul dénonce, il est relâché en récompense de sa coopération et
l'autre est condamné à 10 ans de prison.
Nous avons donc les gains (symétriques) suivants :
ux(N,N) = u2(N,N) = -1,
ul(N,D) = u2(D,N) =-10,
ul(D,N) = u2(N,D) = 0,
Ui(D,D) = u2(D,D) = -8.
Nous pouvons alors représenter ce jeu en forme normale, sous forme
d'un tableau où nous mettons les stratégies de Bonnie en ligne et celles
de Clyde en colonne. Au croisement d'une stratégie de Bonnie avec une
stratégie de Clyde nous avons un résultat du jeu et les gains
correspondants.
Jeux, stratégies et information • 13
Ces gains sont représentés par convention sous la forme d'un vecteur
(wi, u2) où le gain du joueur qui est en ligne (ici Bonnie) apparaît en
première place. Nous obtenons alors la forme normale qui est donnée
dans le tableau 2.1.
Tableau 2.1 Dilemme du prisonnier.
N
Bonnie
D
Clyde
N D
(-1,-1) (-10,0)
(0,-10) (-8,-8)
Le vecteur de gains (—1, —1) correspond alors (u^N^N), u2(N,N)).
m > Remarque 2.1
Il ne faut pas confondre la stratégie d'un joueur individuel st et le résultat
s qui est une combinaison particulière des stratégies de tous les joueurs.
■—>* Remarque 2.2
Dans notre définition de l'ensemble de stratégies, il y a un nombre fini k'
de stratégies pour chaque agent mais en économie, les ensembles de
stratégies sont en général continus et contiennent une infinité de stratégies
possibles (choix de quantité, de prix, etc.). Ces jeux nécessiterons d'autres
formes de représentation pour être analysés.
- > Remarque 2.3
Les gains représentent en général des utilités ordinales et non des sommes
monétaires. En organisation industrielle, néanmoins, les gains des firmes
correspondent souvent à des profits.
La formulation sous la forme d'un jeu permet de clarifier une situation
conflictuelle. Il nous faut en plus comprendre à quel type de solution ce jeu peut
nous conduire. Pour déterminer cette solution, nous allons étudier plus tard les
équilibres du jeu.
Nous allons maintenant introduire la représentation de la structure et du
déroulement des jeux séquentiels.
D. La forme extensive d'un jeu
La forme normale est surtout - mais pas exclusivement - adaptée à la
représentation des jeux simultanés. Selten (1975) a popularisé une représentation
arborescente et plus intuitive des jeux : la forme extensive. Nous pouvons alors
représenter des jeux séquentiels où les décisions sont prises à des moments
différents et où chaque joueur peut être amené à jouer plusieurs fois.
14 • PREMIERS ÉLÉMENTS
► Exemple 2.2 (le problème de Ventrant potentiel)
Considérons le problème d'entrée d'une nouvelle firme sur le marché
d'un monopole.
1. L'entrant (E) doit choisir entre Entrer ou Ne pas entrer.
2. S'il entre, la firme installée (I) peut choisir de le Combattre en cassant
les prix ou de Coopérer avec lui, de manière à créer un monopole joint.
Nous pouvons alors représenter ce jeu sous la forme d'un arbre
(figure 2.1).
Entrer
E
Non
(0,300)
Coopérer
(uE, ui)
(40,50)
Combattre^ (-10,0)
Figure 2.1 Le Jeu de VEntrée I.
Le premier nœud de cet arbre représente la décision du premier joueur. À la
suite de chacun de ses choix, la possibilité est donnée au joueur suivant
d'effectuer son choix. Une fois que tous les joueurs ont pris leurs décisions, on arrive
à un résultat du jeu auquel les gains correspondants sont associés. Ainsi l'arbre
permet-il de faire apparaître les gains associés aux différents résultats possibles.
w
éfinition 2.2
¥: Un jeu en forme extensive est donné par un arbre de jeu contenant un \
I nœud initial, des nœuds de décisions, des nœuds terminaux et des branches\
pïeliant chaque nœud à ceux qui lui succèdent. |>
|- Un ensemble de n ^ 1 joueurs, indexés par / = 1, 2,... n.
Pour chaque nœud de décision, le nom du joueur qui a le droit de choisir^
une stratégie à ce nœud. $
|;- Pour chaque joueur /, la spécification de l'ensemble des actions permises à'|j
chaque nœud où il est susceptible de prendre une décision.
tSr La spécification des gains de chaque joueur à chaque nœud terminal., ^
Jeux, stratégies et information • 15
II. Représentation de l'information
Parfois un joueur qui doit prendre une décision ne connaît pas les choix
effectués par les joueurs qui ont joué avant lui. Dans ce cas, il ne connaît
pas parfaitement le nœud auquel il se situe. Si à un moment donné, un joueur
ne peut distinguer deux nœuds, nous dirons que ces deux nœuds appartiennent
au même ensemble d'information.
"^?<?5^
Définition 2.3
[ À chaque étape d'un jeu en forme extensive, on appelle un ensemble d'in-
I formation (/*,) la collection de tous les nœuds que le joueur qui doit jouer à
1 cette étape (/) ne peut distinguer, compte tenu de l'information dont il dis-
| pose. Chaque nœud contenu dans /z, contient alors exactement le même
ensemble d'actions localement disponibles. On note par H, l'ensemble des»
^ensembles d'information du joueur/. ,
Dans l'arbre du jeu, on représente chaque ensemble d'information en reliant
par une courbe en pointillé les nœuds qui appartiennent à cet ensemble.
Clarifions tout de suite avec un exemple le sens de cette définition.
Le jeu simultané du dilemme du prisonnier peut être représenté sous forme
extensive en utilisant les ensembles d'information (figure 2.2). Comme il s'agit
d'un jeu simultané, nous pouvons arbitrairement faire démarrer l'arbre du jeu
soit par le choix de Bonnie (l'arbre (a)), soit par celui de Clyde (l'arbre (b)).
Dans l'arbre (a), l'ensemble C = {CUC2} est l'ensemble d'information de
Clyde qui résulte du fait qu'il ne peut observer le choix initial de Bonnie. Il ne
peut dire par conséquent s'il doit faire face à une dénonciation par Bonnie ou
non. On représente cet ensemble d'information par une ligne en pointillé qui
B : Bonnie ; C : Clyde p
Gains : (uB, uq)
B
(-1,-1) (-10,0) (0,-10) (-8,-8) (-1,-1) (-10,0) (0,-10) (-8,-8)
(a) (b)
Figure 2.2 Dilemme du prisonnier et ensembles d'information.
16 • PREMIERS ÉLÉMENTS
relie les deux sommets qu'il contient. De manière similaire, dans l'arbre (è),
l'ensemble B = {Bu B2] est l'ensemble d'information de Bonnie.
Nous avons alors un jeu en information imparfaite.
définition 2.4 j ,
Un jeu en forme extensive est
1. un jeu avec information imparfaite si au moins un ensemble d'infor^
mation contient plus d'un nœud ;
2. un jeu avec information parfaite si chaque ensemble d'information est:|
. réduit à un seul nœud. 1^1
Pour pouvoir analyser des jeux avec information imparfaite, nous devons
adapter le concept de stratégie pour tenir compte de l'incapacité des joueurs à
distinguer entre les nœuds d'un même ensemble d'information.
définition 2.5 - ^Mv"-'*"*-' * is i '^ ■•■■■> '•'' -J *■ - ••■•"• -l-""r v--<W^
''■ f-f
Dans un jeu avec information imparfaite, chaque stratégie d'un joueur-/
|doit préciser une action à choisir pour chaque ensemble d'information de ce\
rjôueur. •■ , ., •.-■.... ■-..■■•
Dans un jeu avec information parfaite, cette définition de la stratégie
coïncide avec celle que nous avons déjà implicitement introduite, car dans ce cas,
chaque ensemble d'information correspond à un nœud de décision du joueur.
L'information imparfaite n'est pas le seul cas d'information partielle pour les
joueurs.
: '■'■ r&fltfff^p^
>éfinition2.6 r v - ^ - ^
" if
Un jeu est à information incomplète si au moins un des joueurs ne connaît ■
|pas parfaitement la structure du jeu. Dans le cas contraire, il est à information
Complète. , 'yj?('j|
Nous allons revenir dans la seconde partie de cet ouvrage sur les problèmes
liés à l'information incomplète de certains joueurs.
■ > Remarque 2.4
L'exemple du dilemme du prisonnier nous montre que plusieurs
représentations en forme extensive peuvent correspondre au même jeu en forme
normale.
Nous devons maintenant définir plus précisément un des concepts clé de la
théorie des jeux : la stratégie.
Jeux, stratégies et information • 17
Définition des stratégies
Jusqu'à maintenant, nous avons délibérément confondu les stratégies des
agents avec leurs actions propres : dénoncer, combattre l'entrée... Cela est
souvent vrai pour les jeux très simples mais la théorie des jeux est basée
sur une représentation plus fine des stratégies des joueurs en fonction de la
situation d'interaction et de la représentation retenue du jeu.
De manière générale, une stratégie d'un joueur doit spécifier une action pour
ce joueur chaque fois qu'il est susceptible de jouer (s'il joue, par exemple, à
plusieurs tours du jeu, nous devons spécifier une action pour chacun des tours).
Un profil de stratégies (appelé parfois résultat) spécifie un déroulement complet
du jeu en précisant une stratégie par joueur.
Quelle que soit la complexité du jeu,les stratégies des joueurs doivent nous
permettre de dérouler complètement le jeu quand on les combine (on considère
donc un profil de stratégies). Par conséquent,le concept de stratégie de la
théorie des jeux est plus complet que celui du langage courant. Considérons
une version plus détaillée du jeu de l'entrée afin de développer la définition des
différents types de stratégies.
► Exemple 2.3 (Le Jus de l'entrée II)
Prenons le jeu représenté dans la figure 2.3.
Augmenter capacité
il
Produire (uE,Ui)
—* (-50,40)
Installer
capacité
Ei
Non
Produire
Non
(0,100)
(-10,120)
(50,60)
Non
-* (-10,100)
Figure 2.3 Le jeu de Ventrée IL
Il s'agit d'une analyse plus fine des interactions concernant le
problème d'entrée sur un marché. Le jeu commence par la décision de l'entrant
potentiel (E) : il doit choisir s'il met en place les capacités de production
nécessaires à son entrée sur ce nouveau marché. Ayant observé cette
décision, la firme installée (I) doit choisir si elle augmente ses propres
18 • PREMIERS ÉLÉMENTS
capacités de production ou non. L'entrant doit alors prendre sa décision
de procéder effectivement à la production du bien ou non et cela, sans
pouvoir observer la décision de la firme installée. Si E choisit dès le début
de ne pas installer de capacités de production, le problème de l'entrée ne
se pose plus et I garde son monopole.
Or, même dans ce dernier cas, nous ne pouvons réduire la stratégie de
E à Non (ne pas installer capacité) car cette stratégie ne spécifie pas ce
que Efait à son ensemble d'information Ex. Or, comme nous l'avons vu,
chaque stratégie d'un joueur doit préciser une action chaque fois que ce
joueur est susceptible déjouer. Par conséquent, chaque stratégie de E doit
préciser ici une action pour l'ensemble d'information E0 et une autre
pour Ei : (Non /E0, Produire /Ex) est par exemple une stratégie
complète même si elle correspond à des actions qui semblent être
contradictoires. De la même manière, tout profil de stratégies doit préciser une
action pour la firme I aussi même si elle n'a pas l'occasion déjouer
effectivement une fois que E choisit Non en E0 et termine le jeu. Un profil de
stratégies complet de ce jeu serait par exemple ((Non /E0, Produire /Ex),
Non/I).
Pourquoi se donner tant de mal ? En quoi la précision de Produire /E\
et de Non // est nécessaire dans le profil précédent puisque le jeu
s'arrête après Non /E0 ?
Deux raisons à cela :
- Couvrir les possibilités d'erreur (de la firme E en E0) : pour évaluer ses
choix, I aura besoin de connaître ce qui pourrait se passer dans la suite
du jeu si E choisissait en E0, par erreur, Installer au lieu de Non et
donner l'occasion déjouer effectivement à I. Pour déterminer sa stratégie,
I aura donc besoin de connaître ce que fera E en Ex.
- Permettre le test de l'optimalité des actions : pour trouver les solutions
d'un jeu, nous supposerons par la suite que chaque joueur cherche la
stratégie optimale pour lui. Or, l'optimalité d'une action dépendra de
ce qui se passe dans la suite du jeu quand le joueur choisit une action
alternative. L'optimalité de Non /E0 dépendra du résultat qu'on
pourrait obtenir avec Installer /E0 mais aussi du choix en Ex.
Remarquons aussi qu'en Ex nous n'avons besoin de spécifier qu'une
seule action pour E même s'il joue à deux sommets. En effet, il ne
peut distinguer ces deux sommets (ils appartiennent au même ensemble
d'information Ex) et il ne peut que choisir la même action pour les deux
sommets. Un tel profil de stratégies nous permet maintenant de dérouler
complètement le jeu et de déboucher au nœud final où les gains des
joueurs sont (0, 100). Ces précisions ne sont pourtant pas suffisantes
pour caractériser toutes les situations.
Les stratégies ne sont pas toujours composées d'actions pures comme nous
l'avons considéré jusqu'à maintenant. En effet nous avons uniquement
considéré des stratégies pures. Il existe d'autres types de stratégies basés sur le fait
Jeux, stratégies et information • 19
que l'agent peut aussi utiliser une composition aléatoire d'actions (de stratégies
pures) comme, par exemple, au tennis : 60 % de coups droits et 40 % de revers.
On parle alors de stratégies mixtes. Les deux définitions suivantes précisent ces
deux types de stratégies.
efînition 2.7
Une stratégie pure du joueur / est un plan d'actions qui prescrit une action
de ce joueur pour chaque fois qu'il est susceptible de jouer. On note par S,
*'l'ensemble des stratégies pures du joueur / et par s, e Sj une stratégie pure de
II
e joueur. ... . v. , ,
péfinition 2.8 • • -MB
}/■■ Une stratégie mixte du joueur / est une mesure de probabilités pf définie
V's'ur l'ensemble de stratégies pures du joueur i. On note P( l'ensemble des
stratégies mixtes du joueur /. /?, e Pi correspond donc à une stratégie mixte du H
^joueur i. ^
Dans les jeux en forme extensive, nous pouvons utiliser l'information dont
nous disposons sur le déroulement du jeu pour construire des concepts de
stratégie encore plus fins.
iëRnition 2.9
t
Stratégies dans un jeu en forme extensive : ^
Une stratégie pure du joueur / est une application Si qui attribue à chaque"
| ensemble d'information du joueur / une action qu'il est susceptible de choi-
f sir dans cet ensemble d'information. S, représente l'ensemble des stratégies
\ pures du joueur /.
}
•-- Une stratégie locale du joueur / est similaire à une stratégie mixte, sauf
(. qu'elle est définie au niveau d'un ensemble d'information, au lieu du jeu
/.' global. Pour un joueur /, elle définit par conséquent, pour chaque ensemble
f d'information /*, une mesure de probabilités sur l'ensemble des actions dis-
■ ponibles en cet ensemble d'information. On la note par nih (la stratégie
locale du joueur / à son ensemble d'information h) et Uih est l'ensemble
*" des stratégies locales de / pour l'ensemble d'information /?.
■■- Une stratégie comportementale du joueur / est un vecteur de stratégies
i locales de ce joueur, contenant une stratégie locale par ensemble d'infor-
|. mation de ce joueur. On la note par 71, et n,- est l'ensemble des stratégies,,
comportementales du joueur i. ^ , -.,.■.. âJ
20 • PREMIERS ÉLÉMENTS
Les stratégies mixtes sont définies de la même manière que pour la
précédente définition, une fois qu'on tient compte de la nouvelle définition de S,.
Nous avons maintenant une batterie de concepts de stratégies pour décrire les
différents types de jeux et les différents stades d'un jeu. Les stratégies pures et
mixtes existent donc pour tout type de jeu, tandis que les stratégies locales et
comportementales ne peuvent être définies que dans les jeux en forme extensive
(car on a besoin de connaître le déroulement du jeu).
À partir du jeu de la figure 2.3, page 18, nous pouvons déterminer les
ensembles de stratégies des deux joueurs :
Le joueur E possède deux ensembles d'information (E0 et Ex) et donc
chacune de ses stratégies pures doit préciser une action en E0 et une autre en Ex :
[(Installer/E0, Produire/Ex), (Installer/E0, Non/Ex),
E ~ (Non/E0, Produire/Ex), (Non/E0, Non/Ex)}
Le joueur / possède un seul ensemble d'information (/) et il dispose de 2 actions
à cet ensemble d'information. Chacune de ses stratégies doit préciser une action
différente en cet ensemble d'information :
Sj = [Augmenter//, Non/I) = [Augmenter, Non)
Nous pouvons utiliser ces stratégies pour représenter la forme normale de ce
jeu (tableau 2.2).
Tableau 2.2 La forme normale du jeu de l'Entrée IL
{Installer!E0, Produire IE{)
{Installer 1 £o, Non/E\ )
{Non/Eo, Produire/E[ )
{NonlE^NonlE{)
I
Augmenter Non
(-50,40) (50,60)
(- 10,120) (- 10,100)
(0,100) (0,100)
(0,100) (0,100)
Les gains (—50,40) correspondent donc à uE((Installer, Produire),
Augmenter) = —50 pour l'entrant potentiel et u{ ((Installer, Produire),
Augmenter) = 40 pour la firme installée.
■—>* Remarque 2.5
Cet exemple montre qu'on peut représenter sous forme normale tout jeu
sous forme extensive et cela, grâce à une définition précise des stratégies.
Une stratégie mixte du joueur E va assigner des probabilités à chacune de
ses stratégies pures pE(s) G [0, 1] avec
2>e(*) = 1 (2.D
seSE
Jeux, stratégies et information «21
Un exemple de stratégie mixte, pE est
pE(Installer/E0, Produire/E\) = -; pE(Installer/E0, Non/Ex) = - ;
pE(Non/E0, Produire/Ei) = -; pE(Non/E0, Non/Ex) = 0
ou, un autre exemple :
pE(Installer/E0, Produire/Ex) = 1
qui correspond à la stratégie pure (Installer/E0, Produire/Ex) puisque les
autres stratégies ont une probabilité nulle d'être jouées. On dit souvent que les
stratégies pures sont des stratégies mixtes dégénérées.
Jouer une stratégie mixte correspond donc à tirer au hasard une des stratégies
pures en respectant la distribution de probabilités spécifiée par la stratégie
mixte (comme si le joueur jetait un dé au début du jeu pour choisir ses actions
effectives, ce dé étant pipé de manière à respecter les probabilités de la stratégie
mixte utilisée).
CALVIN AND HOBBES © 1989 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved.
© 1999 Waterson pour la traduction française. © 2000 Hors Collection pour l'édition française.
Figure 2.4 Faut-il toujours mixer ?...
[KB] Sections 2.1 et 2.2 pour les distributions de probabilités.
Pour les stratégies locales, nous devons donc avoir nih(Si) £ [0, 1] avec
!>„(*/) = 1 (2.2)
Pour le joueur £, le profil de stratégies locales suivant forme un exemple de
stratégie comportementale :
en E0 : nEEo(Installer) = -, nEEo(Non) = -
1 3
en Ei : nEE. (Produire) = -, nEE. (Non) = -
1 4 ' 4
22 • PREMIERS ÉLÉMENTS
Une stratégie comportementale contient donc une distribution de
probabilités (stratégie locale) par ensemble d'information du joueur. Les probabilités
portent alors sur l'ensemble d'actions élémentaires contenues dans cet ensemble
d'information. Il ne faut pas confondre cela avec une stratégie mixte qui contient
une unique distribution de probabilités sur l'ensemble des stratégies pures du
joueur et donc sur le déroulement total du jeu pour ce joueur. Ainsi, jouer une
stratégie mixte revient à jouer une seule fois, quand chaque joueur fait son tirage
au sort, au début du jeu. La stratégie pure qui résulte du tirage au sort détermine
alors toutes les actions que le joueur va jouer pendant le déroulement du jeu. La
stratégie comportementale représente au contraire le déroulement temporel du
jeu. Chaque joueur fait un tirage au sort à chacun de ses ensembles
d'information, une fois que cet ensemble est atteint.
Pourquoi des stratégies mixtes ?
- Généralisation des stratégies pures : les stratégies pures deviennent alors des
stratégies mixtes dégénérées (le poids des autres stratégies pures étant nuls)
car les stratégies mixtes couvrent un ensemble de possibilités plus large pour
les stratégies.
- Adaptation à certaines situations où il n'est pas optimal pour un joueur de
s'engager à une action unique de manière certaine. Si vous jouez au tennis
avec un partenaire dont la faiblesse est son revers, vous n'avez pas pour autant
intérêt à jouer systématiquement sur son revers puisque vos balles
deviendraient dans ce cas totalement prévisibles.
- Qualités techniques : convexité et compacité des ensembles de stratégies. En
effet, les stratégies mixtes projettent l'ensemble de stratégies pures sur
l'intervalle [0, 1] et donc sur un ensemble fermé et borné (donc compact) et la
manière dont on les construit (comme des combinaisons convexes) assure la
convexité. Ces qualités auront leur importance quand on s'intéressera à
l'existence des solutions pour les jeux.
[GU] pages 41-47.
IV. solutions et équilibres d'un jeu
Parmi l'ensemble des résultats possibles nous devons déterminer ceux auxquels
le jeu peut aboutir : les résultats d'équilibre. Nous pouvons alors prédire les
situations auxquelles ce jeu pourrait conduire une fois que tous les ajustements
entre les stratégies des joueurs {rationnels) ont eu lieu. La solution idéale
correspondrait à un équilibre unique. Dans ce cas nous pouvons précisément
prédire la solution de cette situation conflictuelle. Néanmoins on a souvent des
équilibres multiples. Parfois il n'existe même pas d'équilibre. Introduisons une
notation supplémentaire.
Jeux, stratégies et information • 23
Notation 2.1. Considérons le profil de stratégies qui contient les stratégies de
tous les joueurs sauf le joueur i. Nous pouvons alors le noter de la manière
suivante :
S-i = (^1,^2» •••» si-\> si+l> •••A)> «S-i £ X Oj
Le profil de stratégies complet s correspond alors à s = (sh .?_/).
Avant de chercher un équilibre d'un jeu, on peut essayer de simplifier ce jeu
en éliminant des stratégies redondantes et/ou des stratégies ouvertement
inférieures à d'autres. Ce type d'élimination simplifiera notre jeu et nous facilitera
la recherche de solutions mais il ne faut pas oublier que toute élimination réduit
nécessairement l'information qu'on représente dans le jeu.
L'information qu'on élimine peut être sans importance avec certains
concepts de solution mais elle peut aussi jouer un rôle important dans la
détermination d'autres types de solution. L'élimination des stratégies doit donc être
effectuée avec réflexion et soin.
Ai Elimination des stratégies équivalentes
Une première idée est d'éliminer certaines des stratégies qui semblent
redondantes. On les appelle les stratégies équivalentes. On obtient alors une forme
normale réduite du jeu.
^Définition 210
Deux stratégies st et s\ sont équivalentes si et seulement si, pour tout pro- }
f fil de stratégies donné des autres joueurs, tous les joueurs obtiennent la même
[' utilité quand / joue s{ ou s'; , ^
I, V/ g /, V.v_,- G S_f-, utsus-,) = ujis^). $
[&- Toutes les stratégies équivalentes à une stratégie st forment une classe^
pd'équivalence. •'"•©
^Définition 2.11
M
£-.. La forme normale réduite d'un jeu s'obtient à partir de la forme normale.! j
(initiale en remplaçant toutes les stratégies d'une classe d'équivalence par une ;
||seule stratégie. , , ,^
Si nous reprenons le jeu en forme normale de notre exemple (voir tableau
2.2, page 21), nous observons que toutes les stratégies du joueur E qui
contiennent l'action Non/E0 sont équivalentes. En effet, toutes ces stratégies terminent
24 • PREMIERS ÉLÉMENTS
le jeu et donc le choix en Ex n'a plus vraiment d'importance les gains. Nous
pouvons donc remplacer (Non/E0, Produire/Ex) et (Non/E0, Non/Ex) par
(Non/E0) pour construire la forme normale réduite du jeu (voir tableau 2.3).
Tableau 2.3 Élimination des stratégies équivalentes.
(Installer /E0, Produire IE\ )
E (Installer/E0t Non/Ex)
(Non/Eo)
I
Augmenter Non
(-50,40) (50,60)
(- 10,120) (- 10,100)
(0,100) (0,100)
Sans oublier le fait que nous perdons par cette élimination les choix
possibles du joueur E en Êi, entre Produire et Non, et des erreurs qui peuvent
accompagner ces choix (qui pourraient par exemple indiquer que E n'est pas
très rationnel).
Une autre simplification possible du jeu peut être basée sur une évaluation
des stratégies.
Du Elimination des stratégies dominées
Certaines des stratégies des joueurs peuvent être globalement plus mauvaises
que d'autres. On pourrait s'attendre à ce que ces stratégies ne soient jamais
choisies par des joueurs rationnels. On peut alors choisir de les éliminer
d'emblée du jeu.
;■"*&'.":%.->- ,'*
: y^^.^^^^i^y^ rr*
^Définition 2.12
La stratégie p-x du joueur / est strictement dominée par la stratégie p\ si et:
seulement si, quelque soit le comportement des autres joueurs, le joueur
•i obtient avec pi une utilité strictement inférieure à celle obtenue avec p\
Wp_i e P_,, Uiipt, p-i) < Ui(pfn p-i) ,
La stratégie /;, est faiblement dominée par/?,' si l'inégalité est faible pour
toutes les stratégies des autres joueurs et qu'il existe au moins un profil de
stratégies des autres joueurs pour lequel l'utilité avec /?, est strictement
inférieure à celle avec p\
Vp-t e P_,, Uj(pi, p-d ^ «,(/?;, p-i)
;..t«.v,x V, .-.V. et3P~i G P-i\Ui(Pi> P-i) < Ui(Pn P.-,/) \ -M.^.^V
Dans notre exemple (voir tableau 2.2), la stratégie (Installer/E0, Non/Ex)
est strictement dominée par (Non/E0, Produire/Ex) et par (Non/E0,Non/Ex).
'4
Jeux, stratégies et information • 25
Par conséquent, le joueur E, s'il est rationnel, ne devrait jamais choisir la
stratégie (Installer/E0iNon/Ei) en présence de la stratégie (Non/E0, Produire/Ei)
ou (Non/E0, Non/Ei).
En cumulant les deux types d'élimination, on obtiendrait le jeu réduit du
tableau 2.4.
Tableau 2.4 Le jeu réduit.
{Installer IEq , Produire IEi )
E
(Non/Eo)
I
Augmenter Non
(-50,40) (50,60)
(0,100) (0,100)
Remarquons que nous ne pouvons encore prédire les résultats auxquels cette
situation d'interaction peut conduire car la stratégie Augmenter de / n'est que
faiblement dominée par sa stratégie TV (égalité si E joue (Non/E0)) et donc on ne
peut être sûr que / choisira Non en présence de Augmenter. Pour aller plus loin
dans la résolution du jeu nous devons introduire des concepts de solutions
constructifs qui ne se contentent pas d'éliminer des stratégies. Cela fera l'objet
de la première partie de cet ouvrage.
'TV [GU] pages 47-53 et [KB] pages 145-151.
Remarquons néanmoins que dans notre exemple du dilemme du prisonnier :
« . N
Bonnie
D
Clyde
N D
(-1,-1) (-10,0)
(0,-10) (-8,-8)
N est strictement dominé par D pour les deux joueurs. L'élimination des
stratégies strictement dominées nous conduit donc à la solution (D, D). Quand
il existe et qu'il est unique, ce type de solution nous fournit une prédiction
très claire et intuitive sur le résultat d'un jeu. En fait il est assez proche
de la manière dont les acteurs économiques interagissent dans le monde réel.
Malheureusement, ce type d'équilibre n'existe que pour très peu de jeux.
► Exemple 2.4 (La bataille des sexes)
Paul et Jacqueline doivent décider comment organiser leur soirée. Ils ont
le choix entre aller à un match de football (F) ou à Vopéra (O). Pour les
deux, ce qui compte avant tout, c'est d'être ensemble. Néanmoins,
Jacqueline a une préférence pour le football et Paul pour l'opéra... Le
tableau suivant représente ce jeu. Les gains correspondent à des utilités.
Nous donnons ce jeu en forme normale dans le tableau 2.5, page ci-
contre.
26 • PREMIERS ÉLÉMENTS
Tableau 2.5 La bataille des sexes.
o
Paul
F
Jacqueline
0 F
(2,1) (0,0)
(0,0) (1,2)
On appelle aussi ce type de jeu, un jeu de coordination. Par exemple
les choix de standards de télévision ou de lecteur de disquette des Macs
et des PCs correspondent à ce type de jeux.Chaque constructeur voudrait
imposer son propre standard mais en cas de désaccord, les
consommateurs pourraient refuser d'acheter le produit.
Ce jeu ne comporte pas de stratégies dominées. Nous devons donc
introduire un autre concept d'équilibre pour pouvoir prédire la solution
de ce type de jeux.
^Exercices
I Exercice 2.1 Papier-Ciseaux-Caillou
I II s'agit d'un jeu entre deux enfants Leyla et Paul. Les deux choisissent simultanément
I un objet parmi les trois objets suivants : papier, ciseaux et caillou. Selon ces choix, soit
I un enfant gagne le jeu, soit il n'y a pas de gagnant (ce dernier cas apparaît s'ils choisis-
I sent le même objet). Caillou gagne contre ciseaux, ciseaux gagne contre papier et papier
I gagne contre caillou. Soit 2 le gain de l'enfant qui gagne, 0 le gain de celui qui perd et 1
I les gains en cas d'égalité.
I 1. Décrivez l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur.
I 2. Écrivez le jeu simultané en forme normale.
I 3. Est-ce qu'il existe des stratégies strictement dominées ?
I 4. Écrivez le jeu simultané en forme extensive.
I 5. Même question si Paul triche et observe le choix de Leyla avant de jouer.
I 6. Même question si Paul n'observe le choix de Leyla que si elle choisit caillou.
I Solution
I 1. / = [Leyla, Paul] ; S, = S2 = [P, Ci, Ca}.
I 2. Le jeu en forme normale :
P
Leyla Ci
Ca
Paul
P G Ca
(1,1) (0,2) (2,0)
(2,0) (1,1) (0,2)
(0,2) (2,0) (1,1)
Jeux, stratégies et information • 27
3. Il n'existe pas de stratégies dominées dans ce jeu.
4. La forme extensive de ce jeu doit tenir compte du fait que, pour chaque joueur, le choix
de l'autre n'est jamais observé avant de faire son propre choix. On peut par conséquent
commencer par Leyla ou par Paul. Si l'on commence par Leyla :
Leyla
Figure 2.5
5. L'arbre du jeu :
Leyla
Figure 2.6
28 • PREMIERS ÉLÉMENTS
6. L'arbre du jeu :
* (i,D
* (0,2)
-(2,0)
* (2,0)
* (1,1)
-(0,2)
* (0,2)
* (2,0)
-d.D
Figure 2.7
Exercice 2.2
Deux pays (A et B) considèrent séparément l'état des relations politiques entre eux. Ils
doivent choisir entre un état de guerre (G) ou un état de paix (P). Si les deux choisissent
la guerre alors chacun aura un gain de 2. Si un seul déclare la guerre alors il obtient 6 et
son voisin obtient 0. S'ils choisissent de préserver la paix, chacun obtient un gain de 4.
1. Donner l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur.
2. Représentez ce jeu en forme normale.
Solution
l.I = [A,B}\ S{ =S2 = {G,P}.
2. La forme normale de ce jeu :
A G
P
B
G P
(2,2) (6,0)
(0,6) (4,4)
Exercice 2.3
Soit le jeu en forme normale suivant :
A G
D
B
G D
(1,1) (1,1)
(-1,-1) (2,0)
Proposez des jeux en forme extensive dont la forme normale peut correspondre à ce jeu.
Jeux, stratégies et information • 29
Leyla
p
/ P1
/ Paul
\ G
\ Pz
Ca
/ Ci
\ca
P
/ G
\ca
P
/ a
\Ca
Solution
Différents jeux séquentiels peuvent donner lieu à cette représentation en forme normale.
Voici deux exemples.
(a)
(l.D
G
B,
* (-1,-1)
D
D
(2,0)
Figure 2.8
L'arbre du jeu (a) correspond à une situation où A joue le premier mais son choix n'est
pas observé par B. Cela pourrait correspondre, par exemple à un jeu simultané. L'arbre
(b) correspond à une situation où le choix initial de A est observé par B mais le jeu
s'arrête si A choisît G.
Exercice 2.4
Considérez le jeu en forme normale donné dans le tableau suivant
A
B
a
(k,[)
($.h)
b
(e,f)
<c,d)
Déterminez les conditions sur les paramètres c, d, e, f, g, h, ketl pour que
1. le résultat (A, a) résulte de l'élimination des stratégies strictement dominées ;
2. le jeu ait la même structure que le dilemme du prisonnier ;
3. le jeu ait la même structure que la bataille des sexes.
Solution
1. Les conditions minimales pour que résultat (A, a) résulte de l'élimination des
stratégies dominées : / > / et h > d (la stratégie b du joueur // est dominé par a) et k > g.
2. Le jeu possède la même structure que le dilemme du prisonnier si : k < g et
k>oe\l<f(til>d>h.
3. Le jeu possède la même structure que la bataille des sexes si : k > c > [e,g}\
d>l> [fM
30 • PREMIERS ÉLÉMENTS
Exercice 2.5
Déterminez les solutions possibles du jeu en forme normale suivant sans faire appel au
concept d'équilibre de Nash :
d
A e
f
B
abc
(4,3) (5,1) (6,2)
(2,1) (8,4) (3,6)
(3,0) (9,6) (2,8)
Solution
La stratégie b est strictement dominée par c pour le joueur B (2 > 1,6 > 4,8 > 6) et on
peut donc l'éliminer. Le jeu devient :
A
d
e
f
B
a
(4,3)
(2,1)
(3,0)
c
(6,2)
(3,6)
(2,8)
Il apparaît alors que les stratégies e et/sont strictement dominées par d pour le joueur
A. Le jeu devient alors
A d
B
a c
(4,3) (6,2)
La stratégie c est alors dominée par a pour le joueur B et nous débouchons sur la
solution de ce jeu : (dya). C'est donc par l'élimination des stratégies strictement dominées
que nous avons résolu ce jeu.
Jeux, stratégies et information «31
Y- "■ • ^y*f
Deuxième partie
v
Les jeux
non coopératifs
avec information
complète
3. Equilibre de Nash (1951) 35
4. Dynamique et rétroduction 61
5. Jeux répétés 85
0. Jeux de négociation 109
■ Equilibre de Nash
(1951)
/ohn Nash a généralisé le concept d'équilibre de Cournot(1). L'idée
de l'équilibre de Nash est extrêmement simple en soi et cohérent
avec l'essence des jeux non coopératifs. Les jeux non coopératifs
correspondent à des situations d'interactions entre individus libres dans
leurs choix et poursuivant des objectifs propres et indépendants. Ces
individus ne communiquent pas avant le jeu et n'ont pas nécessairement le
moyen de s'engager à poursuivre une stratégie particulière. Dans ce
contexte, l'équilibre de Nash cherche les résultats qui sont stables par
rapport aux déviations individuelles, donc unilatérales. L'absence de
communication implique une absence de coordination explicite et des
déviations multilatérales.
Un équilibre de Nash (EN) est donc un résultat dont aucun joueur n'a
envie de dévier unilatéralement, étant données les stratégies jouées par
les autres joueurs.
clés étudiés : Ce chapitre est consacré à l'équilibre de Nash :
- l'équilibre de Nash ;
- les fonctions de meilleures réponses ;
- l'efficacité et domination au sens de Pareto ;
- le problème de la multiplicité des équilibres ;
- les points focaux dans un jeu ;
- l'équilibre corrélé.
1. Pour un exposé simplifié du duopole de Cournot, voir http://yildizoglu.xlOmx-
/livremicro/index.html
3
Équilibre de Nash (1951) • 35
p Un profil p* = (p*,..., p*) (p* ePi,i = l...n) est un équilibre de NashA
V si aucun joueur n'a intérêt à dévier unilatéralement de sa stratégie p* quand les
Poutres joueurs continuent à jouer le profil p*_r Par conséquent nous devons avoir^l
fc UiipÎiP^^UiiPiiPlj), Vp,eP/?l. Vî = lv./i. (3A)4
ft>. p* est un équilibre de Nash strict si ut(p*, p*.) > «,- (p,-, p*,.), Vp,- e /^|
Si l'équilibre de Nash est strict, en dévier doit avoir un coût pour les joueurs.
Pour tester si un résultat p est un équilibre de Nash, nous devons vérifier si
un des joueurs au moins n'a pas intérêt à choisir une autre stratégie. Si ce n'est
pas le cas alors p est un équilibre de Nash. Reprenons l'exemple du dilemme du
prisonnier (tableau 3.1).
Tableau 3.1 Dilemme du prisonnier (reprise).
« . N
Bonnie
D
Clyde
N D
(-1,-1) (-10,0)
(0,-10) (-8,-8)
(N, N) n'est pas un équilibre de Nash car
u2(N,N) = -l <0 = u2(N,D)
et donc Clyde choisira de jouer D au lieu de N.
Nous savons déjà que (£>, D) est une solution qui apparaît après
l'élimination des stratégies dominées. Cela implique qu'aucun joueur n'a intérêt à dévier
de D quel que soit le choix de l'autre et donc, en particulier, si l'autre choisit D.
Par conséquent, c'est aussi un équilibre de Nash :
ux(D, D) = -S> -10 = Ul(N, D)
u2(D, D) = -S> -10 = u2(D, N)
Donc ni Bonnie, ni Clyde n'ont intérêt à dévier de D si l'autre joue D. Qu'en
est-il des stratégies mixtes ?
Notons les stratégies mixtes des deux joueurs par px = (g, 1 - q) et
p2 = (t, 1 - t) avec q, t e [0, 1]. q est la fréquence du choix de la stratégie N
par Bonnie et t est la fréquence du choix de N par Clyde. L'équilibre que nous
venons de calculer correspond donc aux stratégies mixtes : p* = (0, 1)
et p\ = (0, 1) où Bonnie et Clyde choisissent toujours D. Nous pouvons
36 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
représenter les stratégies mixtes des joueurs dans la forme normale du jeu pour
faciliter leur compréhension (voir le tableau 3.2).
Tableau 3.2 Dilemme du prisonnier et stratégies mixtes.
Bonnie
<7
\-q
N
D
Clyde
t \- t
N D
(-1,-1) (-10,0)
(0,-10) (-8,-8)
Peut-il y avoir d'autres équilibres en stratégies mixtes ? Étant donné que les
stratégies mixtes (et donc les événements correspondant au choix de D ou de AO,
sont indépendantes entre les deux joueurs, nous pouvons calculer la probabilité
jointe de réalisation de chaque profil de stratégies (voir tableau 3.3).
Tableau 3.3 Probabilités jointes des profils de stratégies.
q N
Bonnie
1- q D
Clyde
t \- t
N D
qx t qx (1 - t)
{\-q)Xt (l-0x(l-O
Les gains espérés des deux joueurs sont alors donnés :
Ui(pup2) = Eui(pup2) = EuAq, 0
= qtui(N,N) + q(l-t)ui(NfD)
+(1 - q)tUi{D, N) + (1 - q)(\ - t)ut(D, D)
Ui(0,0) = ui(D,D)
Avec les valeurs numériques, le gain espéré du joueur 1 devient :
tfifo, t) = qt(-l) + q(\ - 0(-10) + (1 - q)t(0)
+(l-ç)(l-0(-8)
= 9(f-2) + 8(f-l)
Par conséquent
dUx
dq
t -2<0=ïq* =0
Le même raisonnement pour le second joueur implique t* = 0.
Équilibre de Nash (1951) • 37
Le seul équilibre de Nash est donc p* = (0, 0). Cela n'est pas surprenant
dans la mesure où la stratégie pure N est strictement dominée par D et donc toute
stratégie mixte qui accorderait un poids strictement positif (q > 0) à N ferait
moins bien que la stratégie pure D.
m > Remarque 3.1
Vérifiez que le Jeu de l'entrée II possède bien trois équilibres de Nash en
stratégies pures : ((N, P),A)-> (0, 100), ((TV, N), A)-+ (0, 100) et
((/,/>),#)-► (50,60).
Il est en fait possible de déterminer l'équilibre de Nash de manière plus
constructive, en utilisant les fonctions de meilleures réponses (ou fonctions de
réaction) des joueurs.
I. Fonctions de meilleures réponses
et équilibre de Nash
Étant données la structure du jeu et donc celle des gains, nous pouvons
déterminer pour chaque joueur i les stratégies qui correspondent à la plus grande
satisfaction qu'il peut obtenir face à chaque /?_,. Alors ces stratégies
correspondent à la meilleure situation que i peut obtenir face à/?_,-. Le concept de
meilleure réponse généralise cette idée.
>éfmition 3.2 '''k-*M;rM$
Dans un jeu à n joueurs, la fonction de meilleure réponse du joueur i,hj
fyRi(p-i) associe, à chaque combinaison de stratégies des autres joueurs p_h la$
stratégie du joueur / qui maximise son gain :
■ÉfcV^fe,- Mi(Ri(P-i),Prl) > Ui(pi, p_i),; .Vpi E Pi,P-i £ P-i
Ai meilleures réponses avec stratégies pures
Construisons la fonction de meilleure réponse en stratégies pures de Bonnie et
de Clyde dans le jeu initial de Dilemme du Prisonnier (voir tableau 3.4, page
ci-contre).
Par commodité pédagogique, nous résumons les meilleures réponses des
joueurs dans le tableau 3.5, page ci-contre.
Dans la colonne concernant Bonnie, TV -> D signifie que la meilleure
réponse de Bonnie à la stratégie N de Clyde est déjouer D. Cela provient du fait
38 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tableau 3.4
N
Bonnie
D
Clyde
N D
(-1,-1) (-10,0)
(0,-10) (-8,-8)
Tableau 3.5 Meilleures réponses : caractérisation.
Bonnie - R\ (si)
N ->D
D -> D
Clyde- R2(sO
N ->D
D -> D
que Mi (D, N) = 0 > —1 = ux(N, N) comme on l'observe dans la colonne TV de
la matrice du jeu.
Une manière encore plus simple de visualiser les meilleures réponses de
chaque joueur est de les représenter dans la matrice du jeu. Représentons dans
la matrice initiale, la fonction de réaction de Bonnie par des carrés ( | | ) et
celle de Clyde par des étoiles (^f ). Cela nous donne le tableau 3.6.
Tableau 3.6 Meilleures réponses : représentation.
N
Bonnie
D
Clyde
N D
Cette analyse nous montre que face au choix de D par un joueur, l'autre ne
peut rien faire de mieux que choisir D. Donc (D, D) est l'équilibre de Nash et
il correspond à l'intersection des deux courbes de réaction.
De la même manière, construisons la fonction de meilleure réponse en
stratégies pures de Paul et de Jacqueline dans le jeu initial de la Bataille des Sexes :
0
Paul
F
Jacqueline
0 F
(2,1) (0,0)
(0,0) (1,2)
Équilibre de Nash (1951) • 39
En suivant la même démarche que pour le Dilemme du prisonnier nous
obtenons les tableaux 3.7 et 3.8.
Tableau 3.7 Meilleures réponses : caractérisation.
Paul-Ri(s2)
F -> F
Jacqueline - Ri (s\)
F ->F
Représentons dans la matrice initiale, la fonction de réaction de Paul par des
carrés et celle de Jacqueline par des étoiles (tableau 3.8).
Tableau 3.8 Meilleures réponses : représentation.
o
Paul
F
Jacqueline
0 F
H
H
L'intersection des deux courbes de réaction correspond aux deux résultats
(O, O) et (F, F) et ce sont bien les équilibres de Nash en stratégies pures de ce
jeu. De manière plus générale :
Proposition 3.1. Si s* est un équilibre de Nash, s* = /?($*,•), Vï = 1... n.
Preuve. Par définition, /?,(£*,) maximise w,fe, s*,-), pour tout joueur i.
Par conséquent, aucun joueur n'a intérêt à dévier unilatéralement de sa
stratégies*. □
Dans un duopole de Cournot, les fonctions de réactions sont les fonctions de
meilleures réponses des firmes dans un jeu où les stratégies sont des quantités
produites. L'équilibre de Cournot (et de Nash) correspond à l'intersection des
courbes de réaction où chaque firme produit de manière à maximiser son profit
étant donnée le niveau de production de son concurrent. La recherche de
l'équilibre de Nash est donc équivalente à la recherche d'un point d'intersection
entre les fonctions de meilleures réponses de tous les joueurs.
Bi Meilleures réponses avec stratégies mixtes
La prise en compte des stratégies mixtes pourrait faire apparaître d'autres
possibilités de meilleure réponse. Pour observer cela, reprenons la Bataille des
sexes. Notons les stratégies mixtes des deux joueurs parpi = (#, 1 — q) etp2 =
(t, 1 — 0 avec q, t e [0,1]. Nous obtenons alors le tableau 3.9, page ci-contre.
40 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tableau 3.9 Bataille des sexes et stratégies mixtes.
q 0
Paul
\- q F
Jacqueline
t 1- /
0 F
(2,1) (0,0)
(0,0) (1,2)
Comparons alors l'espérance d'utilité de Paul pour ses deux stratégies pures :
O : Ul(pl,p2) = Euiipi.pi) = 2f + 0(1 -t) = 2t
F : Ui(pi, Pi) = EutipuPi) = Of + 1(1 - t) = 1 - t
Face à la stratégie mixte p2 de Jacqueline, Paul choisira O si :
2t > 1 - t
1
Paul choisira tout le temps d'aller à l'Opéra (q = 1) si Jacqueline va à
l'Opéra plus d'une soirée sur trois (t > 1/3). Il choisira tout le temps d'aller au
Foot (q = 0) si Jacqueline va au Foot plus de deux soirées sur trois
(t < 1/3 =» 1 - t > 2/3). Si t = 1/3, Paul est indifférent entre aller l'Opéra et
Foot. En fait, dans ce cas, toute combinaison de ces stratégies est équivalente
pour lui.
Ce dernier point correspond à un principe général qui est souvent utile :
Lemme 3.1. Un joueur qui maximise son utilité en utilisant une stratégie mixte
sera nécessairement indifférent entre toutes les stratégies pures auxquelles la
stratégie mixte attribue une probabilité strictement positive. Si cette
indifférence n'était pas vérifiée, une stratégie qui donne une probabilité nulle à la
stratégie pure la moins préférée serait meilleure.
Preuve. Voir Osborne & Rubinstein (1994), p. 33-34. □
Par conséquent, sa fonction de meilleure réponse est :
Ri (0 = q* (0 =
1 Si t > 1/3
[0, 1] Si t = 1/3
10 Si t < 1/3.
De même pour Jacqueline, nous avons :
O : U2(pup2) - Eu2{pup2) = \q+0(\-q)=q
F : U2(pu p2) = Eu2(pup2) =0q+2(l-q) = 2-2q
Équilibre de Nash (1951) • 41
Face à la stratégie mixte p\ de Paul, Jacqueline choisira O (t = 1) si
q >2-2q -.
2
>3-
donc seulement si Paul va à l'Opéra plus de deux soirées sur trois. Par
conséquent, la fonction de meilleure réponse de Jacqueline est
f 1 Si q > 2/3
R2(q) = t*(q)= [0, 1] Si 4=2/3
[ 0 Si q < 2/3.
Nous pouvons représenter ces fonctions de réaction sur un graphique (voir
figure 3.1).
t
0 1
Jacqueline
1/3
F 0<
(
F
RAq)
■— — — ^
r -I
1
|
1
1
1
1
1
1
_ 1 1
) 2/3 1
Paul c
►
[ «
)
Figure 3.1 Les fonctions de meilleures réponses en stratégies mixtes.
Ce graphique fait apparaître trois points d'intersection entre les courbes de
réaction. Nos deux équilibres en stratégies pures (O, O) et (F, F) apparaissent
aux extrêmes (respectivement (1, 1) et (0,0)). Un nouvel équilibre en stratégies
mixtes apparaît
As'b}
Dans cet équilibre, Paul va à l'Opéra deux soirées sur
trois et Jacqueline, une soirée sur trois. Leur gain espéré est alors
Eut = 2/3, i = 1,2.
42 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
-~->- Remarque 3.2
Vérifiez que les trois équilibres correspondent bien à des couples de
stratégies (pj\ P2) telles que
P*i=Ri{PÏ)
Pî = *2(pr)-
et calculez les gains correspondants aux trois équilibres.
+/ [KB] pages 280-293.
II. Insuffisances de l'équilibre de Nash
A. Non -existence de l'équilibre de Nash
Il n'existe pas nécessairement un équilibre de Nash pour les jeux où les
stratégies sont des actions directes des joueurs. Si l'on reprend la bataille
des sexes après 30 ans de mariage (voir le tableau 3.10).
Tableau 3.10 Bataille des sexes IL
o
Paul
F
Jacqueline
0 F
(2,0) (0,2)
(0,1) (1,0)
Dans ce cas, le désir de Jacqueline de passer ses soirées avec Paul a disparu
avec le temps, tandis que Paul a gardé son amour romantique et il préfère
toujours être avec Jacqueline plutôt qu'être seul. Dans ce jeu il n'existe pas
d'équilibre de Nash en stratégies pures.
Vérifiez qu'il existe néanmoins un équilibre de Nash en stratégies mixtes
p* = (l/3,l/3).
La non-existence de l'équilibre de Nash correspond à l'absence
d'intersection entre les fonctions de meilleure réponse. S'il y a des fortes discontinuités
dans les fonctions de réaction, cela devient tout à fait possible. De manière plus
précise, on est assuré d'avoir au moins un équilibre de Nash si :
1. L'ensemble de stratégies de chaque joueur est convexe et compact, et si
2. la fonction de paiement de chaque joueur est continue et concave en la propre
stratégie du joueur.
Équilibre de Nash (1951) • 43
Ces propriétés assurent que les fonctions de réactions se comportent bien et
se croisent au moins une fois.
Un ensemble compact est un ensemble fermé et borné. La convexité d'un
ensemble assure que quand on combine différents points d'un tel ensemble, la
combinaison appartiendra à cet ensemble. Un jeu fini est un jeu où les
ensembles de stratégies des joueurs sont finis. La continuité et la concavité en
son propre argument de la fonction de paiement va assurer que sur l'ensemble
convexe et compact des stratégies, le maximum de cette fonction (la meilleure
réponse) va se modifier de manière continue et en restant dans l'ensemble des
stratégies. Cela va assurer l'intersection des fonctions (ou dans un cadre plus
générale, des correspondances) de meilleures réponses.
Quand on utilise les stratégies mixtes dans un jeu fini, celles-ci étant définies
dans l'intervalle fermée [0, 1], et sur un support fini (S,), la compacité est
vérifiée ainsi que la convexité (puisqu'une stratégie mixte est par définition
une combinaison convexe de stratégies pures).
Cette discussion concerne un problème assez technique. Les arguments que
nous venons de considérer ci-dessus sont très imprécis et ils sont uniquement
donnés pour vous suggérer l'intuition qui est derrière le théorème suivant.
Théorème 3.1 (Nash). Tout jeu fini possède au moins un équilibre de Nash si les
stratégies mixtes sont autorisées.
[KB] pages 316-326.
D. Equilibre de Nash et le bien-être social
Les concepts d'équilibre correspondent à des mécanismes particuliers de
coordination des stratégies individuelles. Dans les jeux non coopératifs, chaque
joueur cherche unilatéralement à améliorer sa situation individuelle. Est-ce que
la solution qui est donnée par l'équilibre de Nash correspond à un mécanisme
de coordination efficace ? Pour répondre à cette question nous allons utiliser le
concept d'efficacité parétienne et le concept d'optimum de Pareto. Nous
pouvons définir ces concepts dans le cadre de nos jeux.
44 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
wQn résultat s* est un optimum de Pareto s'il n'existe pas un autre résultat]!
P qui le Pareto-domine. ' ]
jk Les résultats S et s ne sont pas Pareto-comparable si JE
tim<*M^ ^uÂsÏ^M.^t, Ijjy^typ) <fuj(s),
■-^■-otf
Dans le dilemme du prisonnier (£>, D) est un équilibre de Nash mais le
résultat (N, N) Pareto-domine cet équilibre.
Proposition 3.2. Un équilibre de Nash n'est pas nécessairement un optimum de
Pareto.
Dans la bataille de sexes, les résultats (O, O) et (F, F) ne sont pas Pareto-
comparables.
Ci Multiplicité de l'équilibre de Nash
et sélection d'équilibre
L'équilibre de Nash n'est pas nécessairement unique. Reprenons l'exemple de la
bataille des sexes.
0
Paul
F
Jacqueline
0 F
(2,1) (0,0)
(0,0) (1,2)
Dans ce jeu (O, O) et (F, F) sont des équilibres de Nash. Dans ce cas, nous
ne sommes pas capables, sans aucune information supplémentaire, de prédire
quelle sera exactement la solution du jeu. Les deux résultats sont également
vraisemblables. De manière générale, il arrive souvent que les courbes de
réaction se coupent plus d'une fois. Que doit-on faire dans ce cas pour pouvoir
prédire les résultats possibles de ce jeu ?
1) Interchangeabilité et équivalence des équilibres
Si les différents équilibres correspondent à des situations suffisamment
similaires, la multiplicité ne pose pas de problème. Nous pouvons préciser cette idée
avec les deux définitions suivantes.
)ëfinition 3.4
lEteux équilibres de Nash./? et p' sont équivalents si Ui(p), = Uj(.//), Y/, g /.,
Équilibre de Nash (1951) • 45
|Deux équilibres de Nash p = (pi9 p_t) et p' — [p\, //_,), sont interchanM
jçgçables si (/?/, /?/_,) et (p/, /?_/),,Vz_ -sont aussi des équilibres de Nash, yém
Si les équilibres de Nash d'un jeu sont équivalents, alors on pourra prédire
ce qui va résulter de ce jeu malgré la multiplicité. Dans la Bataille des sexes,
les deux équilibres ne sont pas équivalents car les gains des joueurs sont
asymétriques. Ils ne sont pas interchangeables non plus puisque (F, O) et
(O, F) ne sont pas des équilibres de Nash. En fait, l'équivalence et surtout
l'interchangeabilité sont des propriétés assez rares. Que peut-on alors dire
dans le cas d'équilibres multiples ?
2) Conventions et points focaux
Le problème principal que la multiplicité fait apparaître dans les interactions, est
celui de la coordination des choix. En effet, Paul et de Jacqueline doivent se
coordonner pour organiser leur soirée. Si vous avez donné un rendez-vous à un
ami pour aller au cinéma ce soir, vous allez naturellement vous retrouver
devant... la porte du cinéma, même si vous n'avez pas initialement précisé le lieu
du rendez-vous. Ce type de choix évident pour tous les joueurs a été appelé un
point focal par Schelling.
► Exemple 3.1 (Le jeu du cartel)
Deux firmes similaires forment un cartel de manière à constituer un
monopole. Elles doivent décider de la manière dont elles vont partager les
profits du cartel Chaque firme propose une proportion Sj qu yelle désire
obtenir, s( e S,- = {0,1/2, 1}, i = 1,2. Si les choix sont compatibles
{s\+s24il) alors Ui{sus2) = st. Sinon le cartel explose etu-x = —1.
Nous pouvons construire la forme normale de ce jeu (tableau 3.11).
Tableau 3.11 Un premier jeu de cartel
0
Firme A 1/2
1
Firme B
0 1/2 1
(0,0) (0,1/2) (0,1)
(1/2,0) (1/2,1/2) (-1,-1)
(1,0) (-1,-1) (-1,-1)
Ce jeu possède trois équilibres de Nash (1,0), (0, 1) et (1/2, 1/2).
Ces équilibres ne sont ni équivalents, ni interchangeables.
Pourtant un équilibre correspond mieux que les autres à la nature des
relations qui existent entre les firmes. Les firmes sont similaires et donc.
46 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
elles vont estimer que le partage ne doit pas leur être trop défavorable.
L'équilibre (1/2, 1/2) reflète bien Végalité de taille qui existent entre les
firmes et, en connaissant cette information, on peut s'attendre à ce que les
firmes se coordonnent sur cet équilibre. En cela, étant donnée cette
connaissance (qui est par ailleurs fournie en dehors du jeu puisque la
matrice de jeu définit complètement ce jeu), ce partage égalitaire des
profits constitue un point focal.
Les conventions en vigueur dans les sociétés humaines constituent ce
type de points focaux en vue de faciliter la coordination : rouler du même
côté de la route (à gauche en Grande Bretagne), s'arrêter aux feux rouges, se
retrouver au point de rencontre dans un aéroport ou dans une gare, faire la
queue...
3) Domination au sens de Pareto
Un équilibre de Nash n'est pas nécessairement un optimum de Pareto mais
quand il y a multiplicité, un équilibre peut Pareto-dominer un autre. Quand cette
domination est claire, cela peut fournir un statut de point focal à l'équilibre
dominant. Prenons dans le tableau 3.12 une nouvelle version de la Bataille des
sexes.
Tableau 3.12 Bataille des sexes III.
0
Paul
F
Jacqueline
0 F
(2,2) (0,0)
(0,0) (*,*)
Si 0 < x < 2 alors (O, O) et (F, F) sont tous les deux des équilibres et
(O, O) Pareto-domine (F, F). La coordination sur (O, O) est facile à prédire
si x = 1 mais que doit-on penser pour x = 1.9 ou pour x = 1.99999 ?
Parfois, la dynamique de déroulement du jeu et la rationalité des joueurs
peuvent nous guider quant aux résultats qui peuvent émerger du jeu. Si
dans la Bataille des Sexes, Paul rentre à la maison avec deux billets pour
l'Opéra, cela va impliquer l'équilibre (O, O). Si les joueurs ont la possibilité de
communiquer avant le jeu, on peut penser que cela modifiera la structure
du jeu.
4) Communication avant le jeu
En effet, les joueurs ne pourraient-ils pas se mettre d'accord avant le jeu (grâce
à une bonne conversation au coin du feu) sur l'équilibre qu'ils vont jouer ?
Bonnie et Clyde ne pourraient-ils pas se mettre d'accord pour ne jamais
dénoncer, de manière à avoir la situation Pareto-optimale ? Ces deux situations sont
Équilibre de Nash (1951) • 47
bien différentes. En effet, quoi qu'ils se disent avant (cheap talk), les joueurs
seront dans une situation non-coopérative une fois que le jeu commence. Étant
donnée que Dénoncer domine fortement Nier, aucune entente tacite ne pourrait
forcer les joueurs à s'en tenir à la stratégie N. Étant donnée la tentation pour
l'autre de dénoncer, le joueur respectant l'entente risque de se trouver dans une
très mauvaise posture.
CALVIN AND HOBBES © 1992 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved.
© 1997 Hors Collection pour l'édition française.
Figure 3.2 Tenir une promesse...
Dans un jeu non coopératif, si les joueurs respectent un accord tacite, c'est
parce que cela est dans leur intérêt et non parce qu'ils doivent le respecter. C'est
le principe de rationalité individuelle. Ce n'est sûrement pas le cas d'un accord
sur la stratégie TV dans le Dilemme du prisonnier.
Tout accord qui sera respecté doit nécessairement changer la structure du jeu
(sa temporalité, les ensembles de stratégies ou les paiements). Si Bonnie et
Clyde font partie d'une bande qui promet de punir sérieusement à sa sortie le
joueur qui dénonce, cela peut correspondre à une telle modification (les
paiements seront nécessairement modifiés pour le joueur qui dénonce seul !).
Il s'agit alors d'une menace crédible. Les menaces crédibles peuvent
considérablement changer les résultats d'un jeu comme nous allons le voir dans le
prochain chapitre.
La coordination entre équilibres multiples est un problème différent. Nous
avons vu que les conventions ou la particularité de certaines situations peuvent
faciliter la coordination.
L'intervention neutre d'une tierce personne aussi peut faciliter la
coordination.
5) Équilibre corrélé (Aumann-1974)
La tierce personne la plus neutre est la Nature et son intervention aléatoire. C'est
en jouant à pile-ou-face qu'on détermine quelle équipe commence un match de
football. À partir du moment où un événement aléatoire peut être observé
conjointement par tous les joueurs, il peut faciliter la coordination.
48 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Dans la Bataille des sexes, Paul et Jacqueline peuvent demander à leur
voisin de jouer à Pile ou Face entre F et O, et dire à chacun de jouer O si Pile est
tiré et de jouer F si Face est tiré. Leur gain espéré devient dans ce cas
U, = Eui = -u,(0, O) + -u,(F, F)
K K 3
= 22+21 = 2-
Ces gains espérés sont supérieurs à ceux obtenus à l'équilibre de Nash en
stratégies mixtes : p* = (2/3, 1/3).
À partir du moment où le voisin n'est pas corruptible, les joueurs ont intérêt
à suivre sa recommandation (même si Pile sort plusieurs soirs de suite). Tout
événement aléatoire et objectif peut jouer ce rôle de coordination (y compris
l'absence ou la présence des taches solaires chaque jour) à partir du moment
où les probabilités 0.5/0.5 sont respectées. Ces événements instaurent une
corrélation entre les choix des agents, d'où le concept d'équilibre corrélé
d'Aumann.
—>- Remarque 3.3
Malgré les apparences, il s'agit bien d'un équilibre non coopératif
puisqu'aucun joueur ne s'est engagé en une action particulière à l'avance
et s'il suit l'indication, c'est parce qu'il y a intérêt.
III. Application : le modèle de Hotelling
Le modèle de Hotelling est un modèle de différenciation des biens dans un
duopole.
W D'Aspremont et ai, 1979, On Hotelling's "Stability in Compétition", Econo-
^ metrica, 47(5).
On a deux vendeurs localisés sur une plage linéaire où les consommateurs
sont uniformément distribués. Chaque consommateur achète au plus une unité
du produit. Représentons dans la figure 3.3, page suivante, cette plage par une
ligne de longueur L et les localisations des deux firmes par les points A et B.
Il existe un coût de transport unitaire c pour les consommateurs. Un
consommateur qui achète une unité du produit au prix p à un vendeur qui est à la
distance d a l'utilité suivante :
u(p, d) = u0 — p — cd
Nous posons u0 = 0 sans perte de généralité.
Équilibre de Nash (1951) • 49
L
!>• • •
r—
0
...a...
>•
A
-pfc
x i
i
a
t
L- a-b- i
B
... J>
r y
L- b
b
'"1
1
L
Figure 3.3 La cité linéaire de Hotelling.
Pour décider chez qui ils vont acheter, les consommateurs comparent donc le
prix et la distance correspondant à chaque vendeur. Regardons les
consommateurs localisés sur les différents segments du marché.
À gauche de A : Le consommateur qui est à la distance x de A achètera chez
A si et seulement si
pA + ex < pB + c(L — a — b) + ex
Pa < Pb+ c(L -a-b) (3.2)
Donc la variable x n'intervient pas dans cette condition et dès que la
condition 3.2 est vérifiée, tous les consommateurs à gauche de A achètent chez lui,
sinon, ils vont tous chez B.
À droite de B : | Le consommateur qui est à la distance )> de B achètera chez
B si et seulement si
pA + c{L - a-b)+cy > pB+cy
Pa> Pb -c{L-a- b) (3.3)
Entre A et B : | En fonction des prix, il y aura un consommateur limite qui sera
indifférent entre les deux vendeurs. Ce consommateur sera à distance t de A si
pA+ct = pB + c{L - a-b -t)
t = —[Pb -pA+c(L-a- b)] (3.4)
2c
et la demande qui s'adresse à A sera a + t.
Etant donné pB, nous avons donc trois zones pour pA :
Pa < Pb ~ c{L - a - b) = pj Zone (/)
\Pa -pB\^c(L-a-b) Zone (II) (3.5)
Pa> Pb+ c(L -a-b) = pB Zone (III)
50 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous pouvons alors construire la fonction de demande de A étant donné pB
L (/)
DA(pA\ pB) =
a + ^-[pB -pA+c(L-a- b)] (II) (3.6)
2c
l o (///)
Nous représentons cette fonction de demande dans la figure 3.4.
Da(Pa\Pb) i
L
L-b
a
' (I)
P
(II)
B
(m)
Pb
Figure 3.4 La fonction de demande.
La firme fait donc faire face à une demande qui n'est pas continue. Cette
discontinuité va aussi apparaître au niveau du profit :
7*a(Pa ; pB) = Pa ' &a(Pa ; Pb)
(3.7)
t*a(Pa\ Pb) = {
PaL
(/)
^(L + a-è) + ^-^ (//)
2 2c 2c
10
(///)
Cette fonction de profit est strictement concave uniquement dans la zone (II).
Dans les zones (/) et (III), elle est linéaire et donc concave et convexe. De plus,
elle n'est pas continue. Nous représentons cette fonction de profit dans la figure
3.5, page suivante.
La fonction de meilleure réponse de A va résulter de la maximisation de son
profit étant donné pB
Ra(Pb) = argmax nA(pA ; pB)
PA
(3.8)
Dans la zone / : RA(pB) — Pb — c(L — a — b).
Équilibre de Nash (1951) • 51
\^A{PA\PB)k
(III)
Pb Ra(Pb)
Pa
Figure 3.5 La fonction de profit.
Dans la zone // : Nous avons une fonction de profit concave et donc nous
pouvons déterminer RA par
d7tA l,r ÏN 1 1
—- = -(L + a - b) + — pB --pA=0
apA 2 2c c
1 c
RA(PB) = -PB + -(L + a-b)
(3.9)
Dans la zone///: RA(pB) = Pa est quelconque avec pA ^ pB + c(L — a — b).
Nous avons donc une fonction de réaction discontinue. Par symétrie, nous
avons la fonction de réaction de B
Rb(Pa) =
[ pA-c(L-a-b) (I)
X-pA + C-(L + b-a) (II)
y Pb> pA+c(L-a-b) (III)
Si l'équilibre a lieu dans la zone // pour les deux firmes alors il va
correspondre à l'intersection de la seconde partie de chaque courbe de réaction
Pa = ^Pb + \ (L + a - b) et pB = -p*A + |(L + b - a)
Et les profits d'équilibre sont donnés dans cette zone par
2
(3.10)
c ( a — b\ dn*A
a — b\ dnt
, —- ^0
db
52 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Donc en ce qui concerne les localisations, A a intérêt à augmenter a et B, b.
Les deux firmes vont donc se rapprocher : c'est le principe de différenciation
minimale de Hotelling.
Mais la zone de concavité // disparaît dès que nous avons a + b = L : les deux
firmes sont localisées au même endroit sur la ligne et il n'y a plus de
différenciation. Cela correspond alors au duopole de Bertrand avec pA = pB = 0 et
7r,=0,V/.
L'équilibre de Nash obtenu dans la zone concave est donc très fragile dans
ce cas par rapport à la localisation des firmes. En fait, dans le cas d'une
localisation symétrique {a = b), cet équilibre n'existe que si et seulement si
a,b ^ L/4 (les firmes doivent se localiser en dehors des quartiles).
Cet exemple illustre donc le problème de non-existence de l'équilibre de
Nash quand les fonctions de gains sont discontinues. Par exemple, si les coûts
de transport étaient quadratiques (de type ex2), les fonctions de gains auraient
les bonnes propriétés pour que l'existence de l'équilibre de Nash soit assurée.
IV. Application :
le problème de l'entrant potentiel
Rappel du problème d'entrée d'une firme dans le marché d'un monopole.
1. L'entrant (JE) doit choisir entre Entrer ou Ne pas entrer (Non).
2. S'il entre, la firme installée (7) peut choisir de le Combattre en cassant les prix
ou de Coopérer avec lui de manière à créer un monopole joint.
Nous pouvons alors représenter ce jeu sous la forme d'un arbre dans la
figure 3.6.
Figure 3.6 Le jeu de l'entrée I (reprise).
Équilibre de Nash (1951) • 53
Quel va être le résultat de ce jeu ? Quelles sont les meilleures réponses des
deux joueurs ?
Pour répondre à ces questions, construisons la forme normale de ce jeu.
Les ensembles de stratégies des joueurs sont SE = {Entrer, Non],
Sj = {Coopérer, Combattre}. Nous pouvons construire la forme normale en
mettant les stratégies de E en lignes et celles de / en colonnes :
Tableau 3.13 Forme normale du jeu de Ventrée.
Entrer
E
Non
I
Coopérer Combattre
(40, 50) (- 10, 0)
(0, 300) (0, 300)
Nous pouvons maintenant construire les fonctions de meilleures réponses
des joueurs.
[ Coopérer Si Entrer
l {Coopérer, Combattre) Sinon
{Entrer Si Coopérer
Non Sinon
Utilisons la forme normale du jeu donnée dans le tableau 3.14 pour
représenter ces fonctions de réaction ( Q pour E et ^f pour /).
Tableau 3.14 Meilleures réponses dans le Jeu de Ventrée I.
E
Entrer
Non
Coopérer
m
*
i
Combattre
El
Il y a donc deux équilibres de Nash : (Entrer, Coopérer) et (Non, Combattre).
Ces équilibres ne sont ni équivalents, ni interchangeables et il n'y a pas de
dominance parétienne entre eux. Aucun ne constitue un point focal et donc les
deux sont a priori aussi vraisemblables du point de vue de l'équilibre de Nash.
Cela implique alors qu'il existe une possibilité pour / de bloquer l'entrée sur
son marché, grâce au combat de l'entrée. Nous allons revenir sur ce résultat
dans le chapitre suivant.
54 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
^Exercices
I Exercice 3.1
I Soit le jeu en forme normale suivant :
A °
D
B
G D
(l.D (1,D
(-1,-1) (2,0)
1. Quels sont les équilibres de Nash en stratégies pures de ce jeu?
2. Existe-t-il des équilibres de Nash en stratégies mixtes?
Solution
1. On peut déterminer les équilibres de Nash en stratégies pures en considérant les
déviations unilatérales à partir de chaque profil de stratégies :
- (G, G) : C'est un équilibre de Nash (A : 1 > -1, B : 1 = 1) ;
- (D, G) : Ce n'est pas un équilibre de Nash (A : -1 < 1, B : -1 < 0) ;
- (G, D) : Ce n'est pas un équilibre de Nash (A : 1 < 2) ;
- (D, D) : C'est un équilibre de Nash (A : 2 > 1, B : 0 > -1).
On peut aussi utiliser les fonctions de meilleures réponses des joueurs. Représentons
dans la matrice initiale, la fonction de réaction de A par des carrés ( Q) et celle de B
par des étoiles ( >f ) :
A G
D
B
G D
Cela conduit aussi aux deux équilibres de Nash en stratégies pures : (G, G) et (D, D).
2. La même démarche peut être utilisée pour les équilibres de Nash en stratégies mixtes.
Notons les stratégies mixtes des deux joueurs par p\ = (q,\ — q) et p2 = (t, 1 — t)
avec q,t e [0,1].
A « G
1- q D
B
t 1- t
G D
(1,1) (l.D
(-1,-1) (2,0)
Équilibre de Nash (1951) • 55
Considérons le gain espéré de A avec ces stratégies
G:UA = EuA=t-l + (l-t)-l = l
D:UA=EuA = -l't + (l-t)-2 = 2-3t
Il préfère sa stratégie pure G si
1 > 2 - 3t =* t > 1/3
Il jouera donc tout le temps G si B joue G plus d'une fois sur trois et il est indifférent
entre ses deux stratégies pures si t = 1/3.
Considérons maintenant le cas de B
G:UB = EuB=q-\ + (-1) -(\-q)=2q-\
D:UB = EuB = \-q + (\-q)-0 = q
Elle préfère toujours sa stratégie pure G si
2q - 1 > q => q > 1
Elle jouera donc tout le temps D car q < 1 par définition. Elle est indifférente entre
les deux stratégies pour q = 1 (si A joue tout le temps G). Nous retrouvons donc les
deux équilibres en stratégies pures : (0,0) et (1, 1). Mais il existe aussi un continuum
d'équilibres en stratégies mixtes : (t e 1/3, 1 , q = 1 j.
1 f '
G 1
B
1/3
D 0<
(
L
RaO)
w
)
)
RB(q)
A
(
1
G
q
Figure 3.7
Exercice 3.2
Considérez le jeu en forme normale donné dans le tableau suivant
n
A
B
a
(M
ig,h)
b
ie,f)
(c,d)
56 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Déterminez les conditions sur les paramètres c, d, e,/, g, h,ketl pour que
1. le résultat (A, a) soit un équilibre de Nash ;
2. le résultat (A, a) soit un optimum de Pareto ;
3. le résultat (A, a) ne soit pas Pareto-comparable avec (B,b).
Solution
1. Le résultat (A, a) est un équilibre de Nash si : k ^ g et / ^ /.
2. Le résultat (A, a) est un optimum de Pareto si : k ^ max{e,g,c} et / ^ max{/,/î,d}.
3. Le résultat (A, a) n'est pas Pareto-comparable avec (P, b) : k > c et l < d.
Exercice 3.3
Deux pays (A et B) considèrent séparément l'état des relations politiques entre elles.
Elles doivent choisir entre un état de guerre (G) ou un état de paix (P). Si les deux
choisissent la guerre alors chacun aura un gain de 2. Si un seul déclare la guerre alors il
obtient 6 et son voisin obtient 0. S'ils choisissent de préserver la paix, chacun obtient un
gain de 4.
1. Donnez les fonctions de meilleures réponses en stratégies pures.
2. Que pouvez-vous en conclure sur les équilibres de Nash ?
3. Classez les différents résultats du point de vue de l'efficacité parétienne.
Solution
Ce jeu est de type dilemme du prisonnier : la stratégie P est dominé par G, avec un
équilibre de Nash (G, G) pareto-dominé par (P, P). Il n'y a pas d'autre équilibre de
Nash en stratégies mixtes puisqu'aucune stratégie mixte optimale peut donner un poids
strictement positif à la stratégie pure dominée, P.
Exercice 3.4 Fureur de vivre
Deux conducteurs (A et B) dirigent leur voiture l'une contre l'autre dans une rue trop
étroite pour qu'elles puissent se croiser sans provoquer d'accident. Si un conducteur
ralentit tandis que l'autre garde la même vitesse, il perd la face : il obtient alors une
utilité de 0 et son adversaire obtient 4. Si les deux ralentissent en même temps alors le
jeu se termine en égalité et les deux obtiennent une utilité de 2. Si aucun ne ralentit alors
l'accident arrive et chacun obtient une utilité de -2.
1. Précisez l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur.
2. Donnez la forme normale du jeu.
3. Déterminez les équilibres de Nash en stratégies pures du jeu.
4. Déterminez les équilibres de Nash en stratégies mixtes après avoir précisé les
fonctions de meilleure réponse des joueurs.
Solution
1. L'ensemble des joueurs est / = {A, B}. Pour les ensembles de stratégies, nous avons
SA = SB = {P, N] avec R : ralentir et N : Non.
2. La forme normale du jeu est donnée par le tableau suivant :
R
A
N
B
R N
(2,2) (0,4)
(4,0) (-2,-2)
Équilibre de Nash (1951) • 57
3. Les deux équilibres de Nash en stratégies pures sont (R, N) et (N, R) car 4 > 2 et
0> -2.
4. Soient les stratégies mixtes
q = P[sA =R] = l- P[sA = N](pA)
t = P[sB = R] = l- P[sB = N](pB)
Face à la stratégie pB de By le joueur A obtient
EuA(R\ pB)=2t
EuA(N; pB) =6t -2
A choisira de ralentir si 2t > 6t — 2 => t < 1/2. A sera indifférent entre R et N si
t = 1/2.
De la même manière, face à la stratégie/^, B obtient
EuB(R\ pA) = 2q
EuB(N ; pA) =6q -2
et B choisira de ralentir si q < 1/2. B sera indifférent entre R et N si q = 1/2.
Cela nous donne donc les fonctions de meilleures réponses des deux joueurs que nous
pouvons représenter de la manière habituelle.
Il Si t < 1/2
[0,1] Si t = \/2
0 Si t > 1/2.
Il Si q < 1/2
[0,1] Si 4 = 1/2
0 Si q > 1/2.
R
B
N
t
U
1/21
0
(
l\
R„(q)
i- — — — — —i
i
i
i
1 RA(t)
,
) 1/2
/
A
-j
]
F
t >
l «
>
Figure 3.8
58 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous avons donc au total 3 équilibres de Nash : deux en stratégies pures et un en
stratégies mixtes (q*, t*) = l -, - I. Dans ce dernier équilibre A et B choisiront de
ralentir une fois sur deux.
Exercice 3.5
Déterminez les équilibres de Nash du jeu Papier-Ciseaux-Caillou.
Solution
Il n'existe pas équilibre de Nash en stratégies pures dans ce jeu. Il existe un équilibre de
Nash en stratégies mixtes où chaque enfant joue chaque stratégie une fois sur trois (on
peut voir cela en notant les stratégies mixtes sous la forme pLeyia = (qp, g a A — qp — qa)
etPpa«i = (tP, ta, \-tP- ta) : p* = ( -, -, - J et U(p\ p*) = 1.
Équilibre de Nash (1951) • 59
l/ynamique
et rétroduction
t' équilibre de Nash est très peu contraignant sur les actions
choisies par les joueurs en dehors du chemin d'équilibre. Or, l'optima-
lité de ces choix peut parfois justement dépendre du fait que les
actions correspondantes ne sont pas effectivement exécutées par les
joueurs (car aucun ne dévie du chemin d'équilibre). Cela correspond à
une optimalité faible dans la mesure où, une fois en dehors du chemin
d'équilibre, l'optimalité de telles actions sera mise en cause, ainsi que
leur choix par les joueurs. Cette faiblesse réduit alors considérablement
le pouvoir prédictif et la robustesse de tout équilibre de Nash se basant
sur de telles actions.
Nous allons maintenant voir un premier concept d'équilibre qui cherche
à pallier cette insuffisance. Il se base sur le principe bien connu de
la programmation dynamique (Bellman) : Yinduction rétroactive ou la
rétroduction (1) (backward induction).
clés étudiés : Ce chapitre est consacré à l'équilibre parfait en
sous-jeux de Selten :
- le principe de Bellman et la rétroduction ;
- les sous-jeux d'un jeu ;
- l'équilibre parfait en sous-jeux ;
- les menaces crédibles ;
- les jeux de Stackelberg ;
- les stratégies complémentaires et substituables.
1. Le terme rétroduction est proposé par Umbhauer (2002) et il a l'avantage d'être plus léger que
le terme induction rétroactive.
oncept
Dynamique et rétroduction • 61
Reconsidérons les équilibres de Nash du Jeu de l'entrée I (voir figure 2.1,
page 15). Il y en a deux en stratégies pures : (Entrer, Coopérer) et
(Non, Combattre). L'équilibre (Non, Combattre) est basé sur la menace que
l'entrée sera combattue si elle a lieu. Il est donc basé sur une menace qui ne sera
jamais effectivement exécutée, puisque l'entrée n'aura pas lieu à cet équilibre.
Est-ce-que la firme installée (7) aurait choisi cette stratégie de Combattre si elle
devait effectivement faire face à l'entrée ?
Ui (Entrer, Combattre) = 0 < w7 (Entrer, Coopérer) = 50
Donc si par chance l'entrée a lieu, / a intérêt à ne pas combattre l'entrant
et sa menace ne serait pas exécutée dans ce cas : il s'agit d'une menace non-
crédible et l'équilibre de Nash (Non, Combattre) est soutenu par cette menace.
L'existence de telles menaces souligne la faiblesse de l'équilibre de Nash.
En effet ce concept d'équilibre ne distingue pas les plans d'action et le jeu
effectif: l'équilibre de Nash est établi au niveau des plans d'actions définis sur
le déroulement total du jeu.
Cela ne pose pas de problème dans les jeux simultanés. Mais quand il y a une
séquentialité des décisions, un joueur ne s'en tiendra à son plan d'action que si
et seulement si cela est optimal pour lui quand c'est son tour de jouer. Cela est
dans la continuité du concept même de jeu non coopératif et du principe de la
rationalité individuelle. Par conséquent, quand l'entrée a lieu et que c'est le tour
de la firme installée de jouer, il n'y a aucune raison qu'elle choisisse de
combattre l'entrée.
I. Sous-jeux et équilibre parfait
en sous-jeux (EPSJ)-Selten (1975)
Nous pouvons généraliser cette approche qui exige l'optimalité des choix
chaque fois qu'un joueur doit jouer,en introduisant le concept de sous-jeu et le
combiner avec le principe de rétroduction. Un sous-jeu est l'ensemble formé par
un nœud de décision du jeu original et tous les nœuds qui en découlent
directement. En étudiant les équilibres des sous-jeux, nous allons pouvoir vérifier si les
stratégies annoncées pour ces nœuds par les joueurs sont crédibles.
PDefinition 4.i ': ' L '' '^':" ' "^ ""r? • " -^^'- ySfË
l| Un sous-jeu d'un jeu en forme extensive / est constitué par : A
[ê;. - un ensemble K de sommets, comprenant un sommet de J et les sommets ]
m consécutifs à celui-ci, muni de la propriété suivante : si un sommet k
W, de K appartient à un ensemble d'information h non-réduit à un singleton J
Bfc... alors tous les sommets de h appartiennent à K (h c K) ; . ,jfl
62 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
l'ensemble des arcs reliant les différents sommets de K ; TJJ
|f - les gains terminaux de J correspondants aux sommets terminaux de K.'M
définition 4.2 I
|- Quand un sous-jeu est différent du jeu original, on l'appelle un sous-jeu
propre.
Tout jeu J en forme extensive contient au moins un sous-jeu : lui-même. Le
Jeu.de l'entrée /possède clairement deux sous-jeux : le jeu original et un sous-
jeu propre qui commence au sommet I (voir la figure 4.1).
Figure 4.1 Le sous-jeu propre du jeu de Ventrée I.
Quand le jeu contient des sous-jeux propres,on utilise cette particularité pour
affiner le concept d'équilibre de manière à éliminer les menaces non-crédibles.
Cela nous permettra alors d'appliquer le concept d'équilibre de Nash dans
chaque sous-jeu et donc de manière plus pertinente.
^Définition 4.3 (Selten (1975)) -.-.—--,<-t - ^
h Un profil de stratégies du jeu J est un équilibre (de Nash) parfait en sous-
ijeux (EPSJ) s'il correspond à un équilibre de Nash dans chaque sous-jeu du
|jeu 7.
Par conséquent, un EPSJ doit être un équilibre de Nash du jeu original car ce
dernier correspond à l'un des sous-jeux.
m Le principe de Bellman nous apprend que pour résoudre un problème
(d'optimisation dynamique
|^ on commence par chercher le choix optimal de la dernière période ;
f- on remonte le temps de période en période en cherchant à chaque période
;' le choix optimal, une fois qu'on a pris en compte les choix optimaux des
• périodes ultérieures.
Dynamique et rétroduction • 63
Pour chercher les EPSJ d'un jeu fini on utilise la rétroduction :
- on commence par chercher les équilibres de Nash des sous-jeux les plus
proches des nœuds terminaux et on remplace ces sous-jeux par les résultats
d'équilibre correspondants ;
- on remonte alors vers les sous-jeux qui contiennent ces sous-jeux terminaux
et on recommence l'opération jusqu'à ce que l'on ait atteint l'équilibre de
Nash du sous-jeu qui découle du nœud initial.
Dans l'exemple, nous devons remplacer le sous-jeu propre par le résultat
correspondant au choix de ne pas combattre l'entrant (voir ces deux étapes du
raisonnement dans la figure 4.2).
(a) le sous-jeu
Coopérer ^r (40,50)
I
Combattre^* (-10,0)
(b) le jeu-réduit
Entrer
E
Non
(0,300)
(40,50)
Figure 4.2 Détermination de l'EPSJ.
L'entrant potentiel choisit alors d'entrer et nous avons l'équilibre (Entrer,
Coopérer). Par conséquent, la menace de combattre l'entrée n'est pas une
menace crédible car elle ne fait pas partie de l'équilibre de Nash d'un sous-jeu
et ne sera jamais choisie quand il faudra exécuter effectivement cette menace.
Cette démarche se généralise de la manière suivante :
Proposition 4.1. Dans tout jeu sous forme extensive, l'ensemble des EPSJ est
l'ensemble des profils de stratégies obtenus en combinant l'équilibre de Nash
avec le principe de rétroduction.
La structure du jeu de l'entrée est trop simple pour observer pleinement le
fonctionnement de l'EPSJ. Reprenons le Jeu de l'entrée II représenté dans la
figure 2.3, page 18 (voir la figure 4.3, page ci-contre).
Ici, l'Entrant ne peut pas observer le choix d'augmentation de capacité de la
firme installée. Ce jeu possède un seul sous-jeu propre, commençant au
sommet I. Nous représentons ce sous-jeu dans la figure 4.4, page ci-contre.
Nous pouvons facilement construire la forme normale de ce sous-jeu (voir
tableau 4.1, page ci-contre) pour en déterminer les équilibres de Nash (1).
1. Les symboles utilisés pour les stratégies sont : /(nstaller capacité), N(on), Augmenter
capacité), P(roduire).
64 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Augmenter capacité
l!
Produire (ue, ui)
-* (-50,40)
Installer
capacité
er~
Ei
Non
(0,100)
Non
Produire
Non
(- 10,120)
(50,60)
(-10,100)
Figure 4.3 Le jeu de l'entrée II-reprise.
Augmenter
capacité
Ei:
Produire
*
Non
Produire
(uE, ui)
(-50,40)
* (- 10,120)
(50,60)
Non
Non
-* (-10,100)
Figure 4.4 Le sous-jeu propre du Jeu de Ventrée II.
Tableau 4.1 La forme normale du sous-jeu 4.4.
E P
N
I
A N
(-50,40) (50,60)
(- 10,120) (- 10,100)
Ce sous-jeu possède deux équilibres de Nash : s* = (s*E, s*) = (N, A) —>
(-10, 120) et v* = (v*E, v*) = (P, N) —> (50,60). Considérons les deux jeux
réduits correspondant à ces équilibres de Nash (voir figure 4.5, page suivante).
Les deux EPSJ sont donc ((N, N), A) et ((/, P), N). L'équilibre de Nash
((N, P), A) (voir page 38) est éliminé car le profil w = (P, A) ne fait pas
partie des équilibres de Nash du sous-jeu.
Dynamique et rétroduction • 65
Installer
capacité ^(_10120)
Non> KO, 100)
| (a)
Figure 4.5 Les jeux réduits du Jeu de l'entrée IL
m > Remarque 4.1
Chaque équilibre de Nash du jeu original n'est pas nécessairement un
EPSJ comme l'ont montré nos exemples.
CALVIN AND HOBBES © 1990 Wateison. Repiinted with permission of Univeisal Press Syndicate. Ail rights reserved
© 1992 Presses de la Cité pour l'édition française.
Figure 4.6 Calvin découvre les menaces crédibles...
II. Epsj et crédibilité des menaces
Dans le Jeu de Ventrée I le blocage de l'entrée est donc basé sur une menace qui
ne sera jamais réellement exécutée. Ce type de menace ne peut faire partie des
EPSJ puisqu'on considère l'optimalité des choix dans chaque sous-jeu, au
lieu de considérer uniquement dans le jeu entier. Dans le Jeu de Ventrée //,
la menace d'augmenter la capacité est bien crédible puisqu'elle fait partie
de l'équilibre de Nash du sous-jeu et la firme installée à intérêt à l'exécuter
effectivement.
Par conséquent, si ce qui se passe avant le jeu (la menace, la
communication, etc.) doit changer l'ensemble des équilibres, il doit se baser sur
une menace crédible et modifier la structure du jeu. Nous devons
alors construire le nouveau jeu qui tient compte de cette modification. Dixit
(1982) a enrichi notre compréhension des barrières à l'entrée en clarifiant
Installer
capacité
(W, A) i * (50,60) - (P, A0
Non^ > (0,100)
(b)
66 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
le rôle des menaces de la firme installée (l'installation des capacités
excédentaires, campagne de promotion coûteuse,...). Il a démontré que ce type
de menaces n'est effectif que si et seulement s'il est accompagné d'un
engagement réel de la part de la firme installée, de manière à modifier les gains
dans la suite du jeu. Nous pouvons alors étudier cette crédibilisation des
menaces en reprenant une nouvelle version du Jeu de l'entrée adaptée de
Dixit(1982).
► Exemple 4.1 (Le Jeu de l'entrée III)
Nous considérons maintenant la possibilité pour la firme installée
d'effectuer un investissement irréversible avant le début du jeu initial (voir la
figure 4.7). Cet investissement est parfaitement observable par E et I ne
peut le rentabiliser que s'il Vutilise pour combattre Ventrée (des
capacités qui resteront excédentaires ou campagne de promotion qui ne sera pas
pleinement exploitée dans le cas où I ne combat pas l'entrant).
Engagement E / Combattre
Io
Non
Coopérer («£,"/)
/ ► (30,-10)
Ji '
>a
(-10,0)
-*> (0,300)
Coopérer ,Arx ^v
F —► (40,50)
K
Combattre
*(-10,0)
No- * (0,300)
Figure 4.7 Le Jeu de Ventrée III.
Si I choisit de ne pas s'engager dans l'investissement, nous retrouvons
le jeu initial dont nous connaissons VEPSJ : (Entrer, Coopérer ). Nous
pouvons déjà remplacer cette branche par le résultat de ce sous-jeu. Nous
obtenons alors la figure 4.8, page suivante.
Nous représentons alors avec une flèche (-») les stratégies optimales
de chaque joueur, à chacun de ses ensembles d'information. Cela nous
donne donc VEPSJ :
{(Non/Ey, Entrer/E-i), (Engagement, Combattre /Ix, Coopérer//2))
où l'entrée est bien bloquée de manière optimale puisque la menace
de combattre est maintenant crédible. Nous connaissons maintenant
les conditions sous lesquelles un investissement de la part d'une firme
Dynamique et rétroduction • 67
Coopérer
Entrer It
Engagement g
* (30,-10)
(-10,0)
Non
Combattre
->* * (0,300)
Io
Non
(40,50)
Figure 4.8 Le jeu réduit du Jeu de Ventrée III.
installée peut lui permettre de protéger son marché. Cet investissement
doit
1. être irréversible ;
2. être parfaitement observable par Ventrant potentiel ;
3. modifier les gains du jeu de marché de manière à crédibiliser la
menace de combattre la firme installée.
Paradoxes de la rétroduction
Ai Le paradoxe de la rationalité
► Exemple 4.2 (Jeu de l'entrée II en information parfaite)
La figure 4.9, page ci-contre, représente ce jeu. Cette fois-ci l'entrant
observe le choix de capacité de la firme installée. Le seul EPSJ de ce jeu
est :
((N/E0, N/Eh Produire /E2), A /I)
Cet équilibre est notamment soutenu par le fait qu'au nœud I la firme
installée anticipe le fait que son choix d'augmenter la capacité sera suivi
par le choix optimal de l'entrant potentiel de ne pas produire. C'est
la réaction qu'elle peut attendre d'un concurrent rationnel. Mais si son
concurrent était rationnel, elle n'aurait même pas eu à se poser la question
de l'augmentation de la capacité (puisqu'un concurrent rationnel ne serait
jamais entré). D'où ce que Von appelle le paradoxe de la rationalité :
68 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Augmenter capacité
Installer
capacité
Produire (Ue'Ui)
tt-oouire (_5M0)
+ (-10,120)
Non
Produire
* (50,60)
Non
^ (-10,100)
Figure 4.9 Le Jeu de Ventrée II en information parfaite.
si le nœud auquel on considère les choix ne peut être atteint que comme
résultat des choix erronés, comment peut-on supposer que le concurrent
va jouer de manière rationnelle dans la suite du jeu ? Cette possibilité
d'incohérence peut conduire parfois à des résultats surprenants.
B. Sous-optimalité des EPSJ
L'application de la rétroduction et l'EPSJ se base sur des choix optimaux dans
tous les sous-jeux. Est-ce que cela implique que le résultat de l'EPSJ est
nécessairement socialement optimal ? La réponse est négative. Comme pour les
équilibres de Nash, il n'y a aucune raison pour que l'EPSJ nous conduise
à un optimum de Pareto. Pour voir cela, considérons un jeu bien connu.
► Exemple 4.3 (Le jeu du mille-pattes de Rosenthal (1980))
Ce jeu est donné dans la figure 4.10. Appliquons la rétroduction à ce
jeu : à la dernière étape, B choisit d puisque 101 > 100. Alors A —>
D(99 > 98) ; B —► d ; -
A
O-
R.
B
• ■
A
R
R
B
• -
(i,D
la
(0,3)
B A
|d Jd |d
(98,98) (97,100) (99,99) (98,101)
r
1»
.(100,100)
Figure 4.10 Le Jeu du mille-pattes de Rosenthal.
Dynamique et rétroduction • 69
Anticipant ces choix, à la première étape A choisit D et l'EPSJ de ce
jeu donne les gains (1, 1) <t (100, 100),/ = A, B. L'équilibre de ce jeu
correspond donc à la pire des situations du point de vue social.
Quand on fait des expériences, cet équilibre sort très rarement. Au
moins au début du jeu, les joueurs choisissent R et r plutôt que D et d.
Cela indiquerait-il que ces joueurs soient irrationnels ?
Il est évident que si A pense que B possède un minimum d'esprit
coopératif, il peut espérer obtenir plus que 1 en choisissant R plutôt que
D à la première étape. Observant R, B peut en déduire que A cherche à
coopérer pour améliorer leurs gains et cela peut Vinciter à choisir r.
Ce qui veut dire qu'en déviant de l'EPSJ, le joueur A peut donner un
signal à B en vue de modifier ses choix futurs. Ce raisonnement est à la
base d'une approche des équilibres d'un jeu séquentiel bien différente de
la rétroduction : l'induction projective (Torward induction).
[GU] Chapitre 4, Section I.
IV. Application : une taxinomie
des stratégies d'investissement
Dans le modèle de Dixit et, de manière générale, dans les modèles de type
Stackelberg où la firme installée peut s'engager dans un investissement
irréversible, cet investissement n'a de valeur stratégique que dans la mesure où il
influence les comportements du concurrent.
Nous allons présenter un cadre à deux périodes où ces influences seront
étudiées plus en détail (Tirole (1988), 8.3, Fudenberg & Tirole (1986a)).
Ai Digression : stratégies complémentaires
et substituables
Prenons un jeu simultané entre deux agents, où les actions a, appartiennent
à l'ensemble des nombres réels. Les fonctions de profits IT"(«/,«/) sont deux
fois continûment différentiables et strictement concaves en ax. Les conditions
suffisantes pour l'équilibre de Nash sont alors données par :
70 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Soit Rifa) la meilleure réponse de la firme / quand son concurrent choisit a^
Nous avons alors :
^(R,(aj),aj) = 0. (4.1)
S'il existe une solution intérieure alors a{ — Ri(cij) est unique du fait de la
stricte concavité et c'est la fonction de réaction de la firme /.
Un équilibre de Nash de ce jeu est une paire de stratégies (a*, a*) telle que
a* = Ri (a*), i -=f=- j = 1,2. Dans cet équilibre chaque firme réagit de manière
optimale à l'action anticipée de son concurrent.
La pente de la fonction de réaction joue un rôle important dans la
détermination de l'équilibre. En différentiant l'équation (4.1) nous pouvons obtenir :
R*aj> ~ -8'n,/0fl|)' (4'2)
La pente de la courbe de réaction dépend donc de la dérivée seconde croisée du
profit de la firme /. Cette dérivée nous donne l'influence de l'action dey sur le
profit marginal de /.
- La courbe de réaction est croissante si
»'"> »0.
ddjdcij
Les actions des deux firmes sont alors des stratégies complémentaires (1) :
à partir d'une situation où ——- = 0,
oax
an,
aJ/l=ï — >0=ï as = R(aj) /
OClj
pour atteindre a nouveau —— = 0.
OClj
- Elle est décroissante sinon. Les actions des deux firmes sont des stratégies
substituables.
Les prix sont souvent des stratégies complémentaires et les quantités sont des
stratégies substituables. Les courbes de réaction correspondants aux deux types
de stratégies sont représentées dans la figure 4.11, page suivante.
1. Cette terminologie a été introduite par Bulow, Geanakoplos & Klemperer (1985).
Dynamique et rétroduction • 71
Figure 4.11 Concurrence et nature des stratégies.
B. Le modèle à deux périodes et à deux firmes
Dans la période 1 la firme 1 (la firme installée) choisit le niveau d'une variable
K (par exemple sa capacité). Nous appellerons K Y investissement de la firme 1.
Un jeu de marché a lieu en seconde période où qx et q2 représentent les variables
de décisions des deux firmes.
La firme 2 observe K et elle décide d'entrer ou non. Si elle n'entre pas alors
elle a un profit nul et la firme installée a le monopole du marché à la seconde
période.
Son profit de monopole est donné par :
n?(K,q»(K))9
où qx est sa décision de seconde période (par exemple sa production) étant
donnée sa décision de première période, K.
Si la firme 2 entre alors les deux firmes choisissent simultanément qx et q2
et leur profit de seconde période sont donnés par :
Ul(K,quq2) et U2(Kiquq2).
Nous supposons que ces fonctions sont différentiables et que le profit de chaque
firme est strictement concave en sa propre variable de décision : d2Ui/dqf < 0.
De plus, les coûts d'entrée de l'entrant sont intégrés dans son profit.
Étant donné le choix K de la firme 1 à la première période, le jeu de la
seconde période est caractérisé par un équilibre de Nash que nous supposons
unique et stable :
(q*(K),q*(K)).
Nous allons maintenant étudier les influences du choix de première période
de la firme 1, K, sur l'équilibre de Nash de la seconde période.
Nous dirons que l'entrée est dissuadée si
U2(Kiq^K)^2(K))^0.
72 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous dirons que la firme 1 accommode Ventrée si
Tl2(K,qî(K),q;(K))>0.
La situation que la firme installée va choisir dépend de l'intérêt qu'elle a pour
bloquer l'entrée ou pour la laisser libre.
1) La dissuasion de l'entrée
Nous négligerons le cas où la décision de monopole non-contraint suffit pour
bloquer l'entrée (le cas blockaded entry de Bain) car ce cas n'est pas très
intéressant pour l'étude des stratégies optimales.
Par conséquent pour bloquer l'entrée la firme installée doit choisir un K tel
que
Tl2(K,qî(K),q;(K))^0.
Regardons comment le choix de K peut influencer le profit et donc les choix de
seconde période de l'entrant potentiel.
dU2 _ dU2 dU2 dq\ dU2 dq*
~dK ~JF + ~d^'jK+~dq2~'JK'
Or nous savons que le choix d'une décision optimale pour l'entrant potentiel à
la deuxième période implique :
^ = 0.
dq2
Par conséquent nous devons avoir (le théorème d'enveloppe) :
dTl2 _ dU2 dU2 dq*
~dK ~ ~dK+~dq~x' JK'
Le premier terme (dU2/dK) correspond à un effet direct de l'investissement
de la firme 1 sur le profit de la firme 2. Cet effet est souvent nul (le cas de Dixit
(1980), par exemple) : l'investissement de la firme 1 influence uniquement sa
propre technologie dans ce cas.
Le second effet montre comment la stratégie optimale de la firme installée à
la seconde période est influencée par sa décision d'investissement à la première
période : c'est l'effet stratégique de l'investissement (d'où l'influence sur le
profit) :
9n2 ^ dTl2 dU2 dq*
= 0 => = • —.
dK dK dq{ 8K
Fudenberg et Tirole adoptent la classification suivante :
- l'investissement rend la firme installée agressive (tough) si —— < 0 et,
dK
- l'investissement rend la firme installée pacifique (soft) si —— > 0.
Dynamique et rétroduction • 73
Évidemment, si elle veut dissuader l'entrée, la firme installée doit apparaître
agressive. Fudenberg et Tirole introduisent la taxinomie suivante pour les
stratégies d'investissement :
- top dog : être grand pour apparaître agressif ;
- puppy dog : être petit pour apparaître pacifique et inoffensif ;
- lean and hungry look : être petit (maigre) pour apparaître agressif ;
-fat cat : être grand (gros) pour apparaître pacifique et inoffensif.
Pour dissuader l'entrée la firme installée a intérêt à sur-investir par rapport à
la situation où elle ne prend pas en compte cet effet stratégique (la stratégie de
top dog) si l'investissement la rend agressive et, si l'investissement la rend
pacifique, elle doit sous-investir {lean and hungry).
2) L'accommodation de l'entrée
Si le blocage de l'entrée est trop coûteux pour la firme installée alors elle peut
choisir d'accommoder l'entrée. Dans ce cas le choix de son investissement, K,
sera guidé non pas par le niveau du profit de son concurrent mais par celui de
son propre profit. L'incitation à investir est alors donnée par la dérivée totale de
Oi par rapport à K. De nouveau on peut appliquer le théorème d'enveloppe de
sorte que
dïh_ _ djh_ djh_ dql
~dK ~ ~ÏK+~dq^ ' ~dK'
Cette influence peut donc être de nouveau décomposée en un effet direct
de minimisation des coûts et un effet indirect stratégique. Le premier effet
existerait même si l'entrant potentiel ne pouvait pas observer l'investissement
de la firme 1. L'effet stratégique provient de l'influence de la décision
d'investissement de la firme installée sur le choix optimal de la firme 2 à la seconde
période. Un effet stratégique positif incite la firme installée à sur-investir et un
effet stratégique négatif l'incite à sous-investir. Le signe de l'effet stratégique
peut être exprimé en termes de l'effet de l'investissement sur le comportement
de seconde période de la firme installée (pacifique ou agressif) et du signe des
pentes des courbes de réaction des firmes à la seconde période.
Supposons que les actions de seconde période des deux firmes soient de
même nature, c'est-à-dire
sgn(dTl]/dq2) = sgn(dU2/dql)
(par exemple s'il s'agit d'un jeu de seconde période en quantités alors ces
dérivées sont négatives et s'il s'agit d'un jeu en prix alors ces dérivées sont
positives).
En utilisant la dérivation en chaîne :
dq\ _dq\ dq\ _ R, ( „ dq\
74 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
où R2(q*) est la dérivée de la fonction de réaction de l'entrant potentiel,
calculée pour la stratégie d'équilibre de son concurrent. Par conséquent nous avons :
Par ailleurs, en utilisant l'équation (4.4), nous obtenons :
/an, dq;\ /an2 dqr\
Le signe de l'effet stratégique avec l'accommodation de l'entrée est donc
égal au produit du signe de l'effet stratégique avec la dissuasion de l'entrée
et du signe de la dérivée de la courbe de réaction de la firme 2. Or nous
savons que la pente des courbes de réaction permet de distinguer les stratégies
complémentaires et substituables.
Dans le cas où la firme installée décide d'accommoder l'entrée sa stratégie
d'investissement sera donc déterminé par deux éléments :
1. l'investissement la rend pacifique (dU2/dK > 0)
ou agressive (dYl2/dK < 0) ;
2. les stratégies de la seconde période sont substituables (R' < 0)
ou complémentaires (R' > 0).
Nous avons donc quatre cas possibles pour l'accomodation de l'entrée :
- Si l'investissement rend la firme 1 agressive et les courbes de réactions
sont décroissantes alors, l'investissement par la firme 1 pacifie et discipline
le comportement de son concurrent. La firme installée a alors intérêt à
sur-investir : stratégie de top dog.
- Par le même raisonnement, si l'investissement rend la firme 1 agressive
et les stratégies sont complémentaires alors, l'investissement provoque
une réaction agressive. Elle va alors sous-investir pour ne pas inciter son
concurrent à un comportement agressif : stratégie de puppy dog.
- Si l'investissement la rend pacifique et les stratégies sont substituables alors
elle doit sous-investir pour rester agressif : stratégie lean and hungry.
- Si l'investissement la rend pacifique et les stratégies sont complémentaires
alors l'investissement rend son concurrent pacifique aussi. La firme installée
doit alors sur-investir pour avoir un concurrent pacifique : stratégie de fat cat.
Nous résumons ces cas, ainsi que la situation de la dissuasion de l'entrée
dans le tableau 4.2, page suivante, où nous utilisons la notation suivante : A :
accommoder l'entrée. D : dissuader l'entrée.
Cette taxinomie généralise donc le cas de Dixit de manière à considérer tous les
cas possibles d'influence de l'investissement sur l'équilibre de seconde période.
Dynamique et rétroduction • 75
Tableau 4.2 Stratégies optimales d'investissement.
L'investissement rend la firme 1
Agressive
Pacifique
Str.comp.(/T> 0)
A : Puppy dog
D : Top dog
A : Fat cat
D: L. andh.
Str. subs.(/T < 0)
Top dog
Land h.
Ci Apprentissage par l'expérience
et barrières à l'entrée
L'existence d'une possibilité d'apprentissage par l'expérience implique qu'une
firme installée peut réduire ses coûts de seconde période en augmentant
sa production de la première période. Le supplément de production initiale
correspond alors à un investissement en apprentissage et cet investissement
est réducteur de coût. Nous pouvons montrer aisément que, dans ce cas,
l'investissement rend la firme installée agressive. Si, de plus, le jeu de seconde
période est en quantités (stratégies substituables)alors la firme installée doit
sur-investir et adopter un profil de top dog.
Soit une demande de marché linéaire :
p = A-bQ, où Q = qx + q2.
Soit le coût unitaire à la deuxième période de la firme installée :
c = c(q0), avec c(0) = c0, c' < 0, c" > 0,
où q0 représente la production à la première période de la firme installée.
L'entrant potentiel a le coût unitaire c(0) = c0 car il n'a aucune expérience de
cette technologie quand il entre.
Alors, étant donnée la production de la firme installée à la première période,
les quantités d'équilibre de Cournot du jeu de marché et le profit correspondant
pour la firme 2 sont donnés par :
A-2c(q0) + c0 A-2c0 + c(q0)
<?,* = ^7 , qî = ~
n2(«r.«2)
3b ll 3b
[A + c(q0) - 2c0]2 an2
9b
dqo
<0.
Nous avons donc un effet stratégique négatif. De plus, les stratégies sont
substituables (jeu de Cournot).
76 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Par conséquent, on est dans un cas où la firme installée a intérêt à
surinvestir : stratégie de top dog. On peut aussi montrer que cette stratégie peut
conduire la firme installée à bloquer l'entrée si cela est intéressant pour elle.
Nous allons considérer dans le chapitre suivant une classe de jeu où le rôle
du temps apparaîtra pleinement.
►*
ercices
Exercice 4.1
Soit le jeu en forme extensive suivant :
g .(0,0)
H 1 B 2 /
(2,2) m O **\
rf^(3,l)
Figure 4.12
Déterminez les équilibres de Nash de ce jeu. Commentez ces équilibres. Déterminez les
équilibres parfaits en sous-jeux. Discutez leur relation avec les équilibres de Nash.
Solution
(H,g) —> (2,2) et(B,d) —> (3,1) sont les équilibres de Nash de ce jeu car étant donnée
la stratégie d'équilibre de 1, le joueur 2 n'a pas intérêt à dévier de sa stratégie d'équilibre et
vice versa. Dans l'équilibre (H,g) le joueur 2 n'a pas l'occasion déjouer. Cela implique
que Foptimalité de la stratégie H pour le joueur 1 est basée sur une stratégie du joueur 2
qui ne sera jamais jouée (g). Pour calculer les EPSJ de ce jeu, nous commençons par
résoudre le seul sous-jeu propre de ce jeu qui commence au sommet 2 : l'équilibre de ce
sous-jeu correspond au choix optimal de 2 : d (car 1 > 0). Nous avons alors un jeu réduit
simple :
(2,2) JL, 1-1* (3,1)
où le joueur 1 choisit/? de manière optimale. Le seul EPSJ de ce jeu est donc (B,d). En
considérant le sous-jeu propre nous nous sommes demandés ce que le joueur 2 choisirait
s'il avait effectivement l'occasion déjouer (suite au choix effectif de B par le joueur 1).
Cela nous a permis de voir que la menace de jouer g n'est en fait pas crédible et elle ne
soutient l'équilibre de Nash (//, g) que parce qu'elle n'est jamais exécutée. Cela nous
permet donc d'éliminer cet équilibre de Nash basé sur une menace non-crédible.
Dynamique et rétroduction • 77
Exercice 4.2
La figure 4.13 représente la forme extensive d'un jeu de Bataille des sexes.
Jacqueline
Figure 4.13 Encore une scène de ménage ?
1. Quelle est la différence entre ce jeu et le jeu en forme normale 2.5, page 27, dont nous
avons étudié les équilibres de Nash dans le chapitre précédent ?
2. Combien de sous-jeux y a-t-il dans ce jeu?
3. Donnez l'équilibre de Nash dans chaque sous-jeu.
4. Donnez tous les équilibres parfaits en sous-jeux (EPSJ) de ce jeu.
5. Avant que Jacqueline ne fasse son choix, elle entend Paul dire au téléphone qu'il
compte aller à l'opéra. Cela changerait-il les résultats concernant les EPSJ ? Justifiez
votre réponse.
Solution
1. Le jeu que nous avons exposé dans le corps du texte était un jeu simultané tandis que
cette forme séquentielle montre que Paul observe le choix de Jacqueline avant
d'organiser sa soirée. Sinon, malgré le fait que les gains sont deux fois plus élevés dans
cet arbre du jeu, la structure des gains n'est pas différente.
2. Il y a deux sous-jeux propres dans ce jeu, chacun commençant à un nœud de Paul,
après chaque choix de Jacqueline. Il y a en plus le jeu entier.
3. Dans le sous-jeu qui suit le choix de l'Opéra par Jacqueline, l'équilibre correspond au
choix optimal de Jacques : O. Dans le sous-jeu qui suit le choix du Football par
Jacqueline, l'équilibre correspond au choix optimal de Jacques : F.
4. Nous avons alors le jeu réduit suivant :
o f
(2,4) <— Jacqueline > (4,2)
où Jacqueline choisira de manière optimale, d'aller au match de Football. L'EPSJ de
ce jeu est donc : (F,(0,F)).
5. Cette information ne change pas la structure du jeu car, après avoir observé que
Jacqueline choisit F, Paul choisira d'aller au match de Football. Si Jacqueline entend
• LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
au téléphone que Paul a acheté un billet pour l'Opéra, cela change alors la structure du
jeu car Paul s'engage avant le début du jeu et la perte du billet s'il va au match de
Football va changer les préférences des joueurs. Dans ce nouveau jeu (0,0) peut
émerger comme un EPSJ mais uniquement sous les conditions que nous venons de
discuter.
Exercice 4.3
Soit le jeu en forme extensive suivant :
12 12 1
O —£+ • —S-* • —£-► « —§-► • —2-^ (5,5)
|D |d |D ld iD
(1,0) (0,1) (3,0) (2,4) (6,3)
Figure 4.14
Déterminez l'EPSJ de ce jeu. Commentez ce résultat en le comparant avec les différents
gains possibles dans le jeu. Le joueur 2 vient d'observer que 1 a choisi G au début du jeu.
Qu'est-ce que cela implique pour la suite du jeu ? Discutez les différents cas possibles.
Que peut-on en conclure sur la rationalité de l'EPSJ ?
Solution
Ce jeu est une variante du jeu du mille-pattes de Rosenthal. Les conclusions que nous
avons établies dans le cadre de cet exemple s'appliquent telles qu'elles à ce jeu : l'EPSJ de
ce jeu correspond au choix de D par le premier joueur à la première étape et cela conduit
à un résultat Pareto-dominé par le résultat qu'on aurait obtenu si les joueurs choisissaient
G et g tout au long du jeu.
Exercice 4.4
Une firme considère l'entrée sur un marché où il existe déjà une firme. Si l'entrée a lieu,
la firme installée a le choix entre accommoder l'entrée et punir l'entrant potentiel pour
l'évincer du marché. L'arbre du jeu est le suivant :
Figure 4.15
Dynamique et rétroduction • 79
Partie A :
1. Donner le jeu en forme normale.
2. Donner les équilibres de Nash de ce jeu.
3. Déterminer les EPSJ en utilisant l'arbre du jeu.
Partie B : La firme installée a maintenant la possibilité de mettre en place, en première
période, une capacité de production supplémentaire qui va lui imposer un coût
supplémentaire de C = 3 uniquement dans le cas où elle n'utilise pas cette capacité pour
combattre l'entrée. En cas d'installation, cette capacité est parfaitement observée par
l'entrant potentiel.
1. Donner l'arbre de ce jeu.
2. Donner les EPSJ.
3. Discuter ce résultat en le comparant avec celui de la question 3 de la partie A.
Solution
Partie A :
1. La forme normale du jeu est :
Entrer
E
Non
I
Accommoder Non
(1,0) (-1,-1)
(0,5) (0,5)
2. Les deux équilibres de Nash de ce jeu sont : (Entrer, Accomoder) et (N,N).
3. Il y a un seul sous-jeu propre dont l'équilibre de Nash correspond au choix optimal de
la firme installée : Accomoder. Donc le seul EPSJ est (Entrer, Accomoder) —> (1,0).
Partie B : Si la firme installée la met en place, le coût de la capacité pèse uniquement
dans le cas où / ne combat pas l'entrée.
1. L'arbre du jeu est donné par :
Entrer
Non
Ji
(UE, M/)
M-l.-l)
Engagement
Eli
<z
Accomoder
3)
loi
■*■ (0,2)
Non
M-1,-1)
0)
Non
Non
Accomoder
MO, 5)
Figure 4.16
80 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
2. Il y a maintenant 4 sous-jeux propres dans ce jeu, un après chacun de ces sommets :
/i, 72, Eu E2. Nous représentons dans l'arbre suivant les équilibres de Nash de ces
sous-jeux avec des flèches (—» ) :
Engagement
M
Non
Entrer
El/
v^
Non
Entrer
w
\
Non
Non (UE>UI)
/ >> > (-1.-1)
J1/
^ ) (1 3)
Accomoder
1 * IV, z;
y22 M-1,-1)
J2/
> >■> > (1,0)
Accomoder
^ ^u, j;
Figure 4.17
Le seul EPSJ de ce jeu est alors ((Engagement, Non II\, Accomoder Ih), (Non/E\,
Entrer IE2))—+ (0,2).
3. L'engagement a permis à / de rendre sa menace de combattre l'entrée crédible et donc
de bloquer effectivement l'entrée. Malgré le coût de l'engagement, la firme installée
garde son monopole et améliore sa situation à l'équilibre puisque son profit passe
maintenant de 0 à 2.
Exercice 4.5
Soit le jeu séquentiel à deux joueurs (E et I) suivant (voir figure 4.18, page suivante).
1. Précisez l'ensemble de stratégies de chaque joueur.
2. Donnez la forme normale de ce jeu.
3. Déterminez les équilibres de Nash de ce jeu.
4. Déterminez les sous-jeux de ce jeu et leurs équilibres de Nash.
5. Déterminez les équilibres parfaits en sous-jeux de ce jeu.
Solution
1. Nous avons deux joueurs : / = {£,/}. Une stratégie d'un joueur doit préciser une
action pour chacune de ses ensembles d'information. Une stratégie de E doit donc
préciser une action pour E0, une pour E\ et une pour E2. Pour /, nous devons connaître
une action pour I\ et une pour I2 :
SE = {(A,E,I), (B,E,I), (A,F,/), (B,FJ),
(A,E,J),(B,E,J)t(A,F,J),(B,FfJ)}
Dynamique et rétroduction • 81
(uE, ui)
- (1.1)
- (0,2)
Ei:
■*• (2,0)
Eo
-* (0,0)
* (0,0)
E2:
► (2,0)
* (0,2)
► (2,2)
Figure 4.18
On remarque qu'on a bien 2x2x2 = 8 stratégies pour le joueur E.
S, = {(C,G),(C,HUD,G),(D,H)}
Ce qui donne bien 2x2 = 4 stratégies différentes pour /.
2. Pour construire la forme normale, nous allons mettre les stratégies de E en ligne de
manière à respecter l'ordre des gains dans l'arbre et nos conventions sur la forme
normale.
(A.E.I)
(B,E,I)
(A, F,I)
(B.F.I)
E (A,E,J)
{B,E,J)
(A, f, y)
(B,F,J)
(C,G)
(1,1)
(0,0)
(0,2)
(0,0)
(1,1)
(2,0)
(0,2)
(2,0)
(C. H)
(1,1)
(0,2)
(0,2)
(0,2)
(1,1)
(2,2) |
(0,2)
(2,2) |
[
(A G)
(2,0)
(0,0)
(0,0)
(0,0)
(2,0)
(2,0)
(0,0)
(2,0)
(D,H)
(2,0)
(0,2)
(0,0)
(0,2)
(2,0)
|(2,2)|
(0,0)
|(2,2)|
82 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Tous les profils de stratégies qui donnent les gains (2,2) sont des équilibres de Nash :
EN = [((B,E,J), (C,H)), ((B,E,J), (£»,//)),
((B,F,J),(C,H)),«B,F,J),(D,H)))
4. Il existe deux sous-jeux propres de ce jeu. Un qui commence en I\ et l'autre
commençant en I2. On peut présenter en forme normale pour déterminer leur équilibre de
Nash
E
E
F
I
C D
(l.D (2,0)
(0,2) (0,0)
/
E
J
I
G H
(0,0) (0,2)
(2,0) (2,2)
Sous-jeu en I\ Sous-jeu en I2
EN = {(£,C)} EN = {(/,#)}
On peut aussi remarquer que dans chaque sous-jeu il existe une stratégie strictement
dominante pour E : la stratégie E dans le sous-jeu I\ et la stratégie J dans le sous-jeu
I2. Ces stratégies font bien partie des équilibres de Nash.
5. Les équilibres Nash parfaits en sous-jeux (EPSJ) doivent contenir des stratégies qui
appartiennent, pour chaque joueur, aux équilibres de Nash des sous-jeux
Pour E : E en Ex et J en E2
Pour I : C en I{ et H en I2
Nous pouvons alors remplacer les sous-jeux par leur équilibre de Nash unique pour
déterminer l'EPSJ de ce jeu
(uE,ui)
^ (1,1)
^ (2,2)
Figure 4.19
L'EPSJ de ce jeu est donc EPSJ = {((B,E,J)y(C,H))} et il contient bien les stratégies
d'équilibre de Nash dans chacun des sous-jeux.
(C,E)
E0;
(H,J)
Dynamique et rétroduction • 83
5.1
eux répétés
Jft *ous avons étudié jusqu'à maintenant des situations où l'interac-
Ê\Ê tion n'a lieu qu'une seule fois entre les joueurs. Or, beaucoup
m W d'interactions sociales se déploient dans le temps et souvent de
manière répétée. La relation entre vous et votre boulanger ou celle entre
un producteur et son sous-traitant sont de ce type. Les modèles de jeux
répétés servent à analyser la logique de ce type d'interactions de long
terme. L'objectif est de tenir compte du fait que les joueurs vont
considérer que leurs actions immédiates auront une influence sur les actions
futures des autres joueurs. On cherche alors à expliquer les phénomènes
comme l'émergence de la coopération ou l'exécution des menaces...
Dans cet ouvrage nous allons uniquement considérer les jeux répétés
avec information complète, d'où le traitement de ce type de jeux dans
cette deuxième partie.
Concepts clés étudiés : Ce chapitre est consacré aux jeux répétés en
information complète :
- les jeux répétés finis et infinis ;
- la caractérisation des stratégies et des gains dans un jeu
répété ;
- le théorème de tout le monde -folk theorem ;
- le rôle des menaces rationnelles et des observations
imparfaites ;
- la réputation.
I. L'idée de base
L'idée de base peut être illustrée par le dilemme du prisonnier auquel deux
joueurs sont confrontés de manière répétée. Prenons une nouvelle version de ce
jeu avec des gains légèrement modifiés pour simplifier les calculs, sans que cela
change la structure du jeu (voir le tableau 5.1, page suivante).
Jeux répétés • 85
Tableau 5.1 Dilemme du prisonnier IL
N
Bonnie
D
Clyde
N D
(3,3) (-1,4)
(4,-1) (0,0)
Nous savons que le seul équilibre de Nash de ce jeu est (D,D) et il est
Pareto-dominé par (N,N). Le résultat est fort car il est dû au fait que pour
chaque joueur la stratégie D domine strictement N. Par conséquent, s'ils ne
jouent qu'une seule fois, les deux prisonniers ont peu de chances de coopérer (en
niant) de manière à éviter une longue condamnation.
L'idée principale qui est derrière la théorie des jeux répétés est que, malgré
ce résultat fort, la situation de coopération peut devenir stable si le jeu est répété
et si chaque joueur pense que s'il arrête de coopérer, cela supprimera toute
possibilité de coopération à l'avenir. Auquel cas, la perte à long terme peut dominer
le gain à court terme obtenu en ne coopérant pas à une période.
Le bénéfice majeur de cette théorie est de déterminer les types de stratégies
qui soutiennent les résultats mutuellement désirables dans tout type de jeu. La
théorie nous fournit des intuitions sur les régularités de comportements quand
les individus interagissent de manière répétée et ces régularités peuvent être
interprétées comme l'émergence des normes sociales. Le résultat que nous
décrivons montre que la norme sociale nécessaire au soutien du résultat
mutuellement bénéfique implique que chaque joueur doit punir tout joueur dont le
comportement est indésirable. Quand nous imposons la règle sous-jacente à
l'équilibre parfait en sous-jeux (EPSJ) selon laquelle les menaces de punition
doivent être crédibles, la norme sociale qui émerge doit assurer que les joueurs
qui doivent punir aient effectivement intérêt à le faire chaque fois que la norme
sociale l'implique. Dans ce cas, la nature de la punition dépend de la manière
dont les joueurs évaluent les résultats futurs. Parfois il est suffisant que la phase
de punition dure quelques périodes seulement, au terme desquelles les joueurs
retournent au résultat mutuellement désirable. Parfois la norme sociale doit
impliquer une compensation future pour les joueurs qui doivent exécuter des
punitions coûteuses. Même si les principaux résultats de la théorie concernent la
structure des stratégies d'équilibre, la majorité des résultats de la littérature se
consacrent à la caractérisation des gains qui peuvent être soutenus par
l'équilibre.
C'est notamment l'objet des théorèmes folk que nous allons étudier. Ces
théorèmes ont deux aspects. D'une part, ils montrent que les résultats
socialement désirables, qui ne peuvent être soutenus si les joueurs sont myopes,
peuvent effectivement être soutenus s'ils ont des objectifs de long terme.
D'autre part, ils montrent que l'ensemble des équilibres d'un jeu répété est
immense et que le concept d'équilibre possède peu de pouvoir prédictif.
86 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
•Rappel : Actualisation d'un flux de gains - : >,
Le temps intervient de manière cruciale dans un jeu répété. En effet, les
répétitions du jeu génèrent un flux d'utilités (gains) pour chaque joueur. À
chaque moment du temps où un joueur doit faire un choix, il doit pouvoir
évaluer les conséquences de ce choix dans la suite du jeu. Or les joueurs
accorderont de l'importance à la date à laquelle ils obtiennent les différents gains :
un euro obtenu aujourd'hui n'aura pas la même valeur aux yeux d'un joueur
* qu'un euro qui ne sera obtenu que demain. Quand le joueur doit arbitrer entre
ces deux possibilités, il doit pouvoir les comparer. Cette comparaison se fait
j^par le biais de l'actualisation.
On peut observer la préférence de l'agent entre aujourd'hui et demain en
Hui demandant de nous indiquer le gain futur minimal, xt+u qu'il acceptera
•d'échanger contre un gain xt aujourd'hui. On appelle alors 8 = x,/x,+i le
facteur d'actualisation de l'agent. xT est alors la valeur actualisée d'une
période de xt+l
xt = VAt(xt+x) = 8xf+l.
pOn peut alors utiliser le facteur d'actualisation de l'agent pour comparer des
[[revenus à des différentes dates ou pour faire voyager les gains dans le temps.
^Étant donné son facteur d'actualisation <5, l'agent économique sera indifférent
ientre obtenir x dans t périodes et obtenir 8rx aujourd'hui.
iï- En économie, l'hypothèse standard concernant la relation au temps est la
préférence pour le présent : on suppose en général que les agents préfèrent,
toutes choses égales par ailleurs, les revenus actuels aux revenus futurs. Cette
hypothèse correspond alors à 8 ^ 1.
Si le joueur du jeu répété obtient un flux infini (Y e [0,oo)) de gains «,(/),
fla valeur actualisée au début du jeu de ce flux est donnée par
oc
£>«,(>)• (5-1)
t=0
^Si mit) = //, Vr alors cette valeur actualisée devient
uJ2st = ---u (5.2)
t=Q
e manière corollaire, si l'on s'intéresse à la valeur actualisée du flux qu'on
btient à partir de t = 1 :
M = 2>
i
1-8
S
u = - -h. (5.3)
1 — O
Jeux répétés • 87
Ai Jeux répétés finis et jeux répétés infinis
Cette distinction fait référence à l'horizon des jeux. Or les résultats sont très
différents entre ces deux types de jeux.
Si Ton reprend par exemple le Dilemme du prisonnier, dans le cas où la
répétition est finie, le seul équilibre de Nash est celui où les joueurs choisissent
(D, D) à chaque période. Si le jeu se répète infiniment, l'ensemble des profils
de stratégies d'EPSJ est immense comme nous allons le voir ci-dessous. Donc
chaque fois qu'on doit appliquer ce type de jeu à une situation, nous devons bien
déterminer si l'horizon doit être fini ou infini ; les résultats en dépendront de
manière cruciale.
En fait, notre jeu doit décrire la situation (jeu fini/infini) telle qu'elle est
perçue par les joueurs et non telle qu'elle est objectivement, comme la pourrait
percevoir un observateur extérieur. Car ce qui va déterminer les résultats est le
comportement des joueurs et cela dépend de leur perception du jeu. Même si le
jeu possède en réalité un horizon fini, si les joueurs pensent à chaque période
qu'il y aura encore une période ultérieure alors ils se comporteront comme
s'ils étaient dans un jeu à horizon infini et alors, c'est ce type de jeu qui est
adéquat pour une telle situation. Ce n'est pas parce que la vie des joueurs est
nécessairement finie (sauf peut-être pour les organisations) que nous devons
utiliser un horizon fini. Si le jeu est joué suffisamment fréquemment, ils auront
l'impression que l'horizon n'existe pas en fait. Si les joueurs perçoivent une date
terminale bien définie pour le jeu alors le jeu fini est plus adéquat (même s'ils
se trompent et que le jeu est en fait infini).
II. Émergence de la coopération:
le théorème folk
Reprenons le Dilemme du prisonnier du tableau 5.1, page 86. Imaginons que la
condamnation soit courte (le vol était petit) mais que nos voleurs recommencent
de manière répétée. Ils additionnent alors leurs gains à travers le temps.
Ce type de situation a été utilisé dans les expériences. On dit aux étudiants
qu'ils vont jouer plusieurs fois de suite, sans leur donner de date finale. Ces
étudiants choisissent alors souvent de coopérer (ils jouent (N, N)\ du moins au
début du jeu. S'ils choisissent ces stratégies sous-optimales à court terme, c'est
parce qu'ils prennent en compte leur intérêt à long terme. Si chacun pense que
le gain de court terme sera dominé par la perte de long terme, il choisira alors
de coopérer. Cette coopération n'est pas en l'occurrence expliquée par
l'altruisme ou par le souci de l'intérêt de l'autrui.
88 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
CALVIN AND HOBBES © 1989 Waterson. Reprinted with permission of Universal Press Syndicate. AH rights reserved.
© 1999 Waterson pour la traduction française. © 2000 Hors Collection pour l'édition française.
Figure 5.1 L'importance de l'horizon du jeu...
L'analyse formelle de ce type de situation correspond donc aux jeux répétés.
Imaginons deux joueurs qui jouent au dilemme du prisonnier répété pour
toujours. Comment pouvons-nous représenter les gains pour un tel jeu ?
'V [KB] pages 344-349, 359-364.
Les gains des joueurs pour toute la séquence de répétitions du jeu pourraient
être représentés par la moyenne des gains qu'ils obtiennent à chaque période.
Ainsi, si les gains du joueur 1 forment la suite {wi(l), Wi(2), u{(3), ...} alors
sa fonction de gain sur l'ensemble du jeu est
1 T
Km-£>,(;) (5.4)
On pourrait aussi imaginer que le joueur utilise la valeur actualisée de ses
gains sur la totalité de la séquence de jeux (voir l'encadré de la page 87) :
oo
£«'-'«, (0, <5e(0,l) (5.5)
t = \
où S est le facteur d'actualisation du joueur 1. Dans ce cas, la moyenne de ses
gains est donnée par
oo
(l-S)^'-1^), S g (0,1) (5.6)
t=\
Quand u\(t) = w, Vf, cette moyenne est égale à u. L'utilisation de cette
moyenne facilite la comparaison des gains avec celui du jeu qui est répété (le jeu
d'étape).
Jeux répétés • 89
On pourrait aussi imaginer que le jeu est répété un nombre fini mais indéfini
de fois. Après chaque tour,il y a une probabilité 1 - q que le jeu s'arrête. Alors
l'espérance des gains sur la totalité de la séquence est
00
5>'-'h,(0, ?e(0,l) (5.7)
Il existe donc plusieurs possibilités pour représenter les gains dans un super-
jeu. Les approches (5.5) et (5.7) sont équivalentes et nous allons utiliser ce type
de représentation basée sur la valeur espérée/actualisée des gains.
Quels sont les résultats qui émergent si l'on passe du jeu statique au dilemme
de prisonnier répété ? Le résultat principal correspond à nos intuitions
initiales : la coopération devient un résultat d'équilibre. Reprenons le dilemme du
prisonnier :
N
Bonnie
D
Clyde
N D
(3,3) (-1,4)
(4,-1) (0,0)
Considérons la stratégie suivante de Bonnie :
- elle joue N tant que Clyde joue N et
- si jamais Clyde joue D, Bonnie joue D jusqu'à la fin du jeu.
Face à cette stratégie de Bonnie, il est facile d'imaginer la stratégie optimale
de Clyde. S'il joue tout le temps N, il va obtenir un flux continu de gains égaux
à 3 jusqu'à la fin des temps. La valeur actualisée/espérée de ce flux est
00
^35' =3/(1 -S)
S'il commence avec D à ce tour, alors il va obtenir 4 maintenant mais 0 pour
le reste des périodes. Il a donc intérêt à coopérer si
3 1
>4&8 >-=25%.
1 - S 4
Par conséquent, cette stratégie de Bonnie et sa symétrique pour Clyde
forment un équilibre de Nash de ce jeu pour ces valeurs de S. Un équilibre
de Nash qui correspond à l'émergence et à la persistance de la coopération.
Mais cette histoire simple pose au moins deux problèmes : la multiplicité des
équilibres et la particularité des jeux à horizon fini et défini.
90 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Ai Multiplicité des équilibres et des menaces
hors équilibre
L'équilibre de Nash que nous avons exposé est loin d'être le seul. Supposons par
exemple que Bonnie annonce la stratégie suivante :
- Elle va alterner entre N et D tant que Clyde joue N.
- Si jamais Clyde dévie et joue D, Bonnie joue D pour toujours.
Si Clyde joue N face à cette stratégie, ses gains vont alterner entre 3 et -1
jusqu'à la fin des temps. Si Clyde joue D alors il obtient 4 à cette période mais
0 pour le reste du jeu. Il est évident que pour une valeur suffisamment élevée de
S, la solution de coopération est à nouveau préférable. Cela émerge comme
équilibre si Clyde annonce une menace suffisante pour inciter Bonnie à
respecter sa stratégie (par exemple de jouer D pour toujours si jamais Bonnie arrête
d'alterner).
On peut en imaginer d'autres (par exemple un équilibre où les deux alternent
tant que l'autre continue à alterner). Donc la formulation sous forme de jeu
répété pose le problème de la profusion d'équilibres. Qu'est-ce qu'il faut pour
que les stratégies forment un équilibre ?
Il est clair que nous ne pouvons avoir un équilibre qui donne à un joueur une
valeur espérée/actualisée strictement négative. Pourquoi ? Parce qu'en jouant D
chacun peut s'assurer au moins 0. Et ses concurrents peuvent utiliser le fait de
le caler contre cette valeur comme une menace. Par conséquent, toute paire de
stratégie qui donne une valeur espérée strictement positive peut être soutenue
comme un équilibre.
Dans un jeu à horizon infini, sans actualisation, cette proposition est
parfaitement correcte. Pour les jeux avec actualisation ou avec un horizon fini
indéfini, il faut l'amender légèrement : une situation qui laisse l'un des joueurs
trop proche de 0 ne peut être soutenue dans ce cas. Les joueurs doivent avoir
suffisamment à perdre en déviant à une étape (suivie par des gains nuls pour
toutes les autres étapes) pour qu'un tel accord puisse être soutenu. Ce résultat,
au demeurant très intuitif, à été montré pour des jeux répétés plus généraux. Il
nous indique la conclusion suivante : tout vecteur de gains réalisables espérés
peut être soutenu à l'équilibre s'il donne à chaque joueur au moins autant que
ce qu'il aurait pu s'assurer comme gain si tous les autres joueurs s'étaient ligués
contre lui (rationalité individuelle). L'intuition de la preuve de cette
proposition est très simple : chaque joueur est assuré que s'il dévie de l'accord,
tous les autres joueurs vont se liguer contre lui pour le punir. Alors, aucun n'a
intérêt à dévier unilatéralement de l'accord. Ce qui est la condition nécessaire
pour l'équilibre de Nash.
Ce résultat est connu sous le nom du théorème folk (ou le théorème de tout
le monde) car il appartient au folklore de la théorie des jeux puisque, comme il
semblait être connu de tous avant d'être publié la première fois, personne n'a eu
la prétention d'en réclamer la « paternité ».
Jeux répétés • 91
On peut se poser à ce stade la question de l'intérêt des autres joueurs à punir
celui qui a dévié de l'accord. Une telle punition peut être très coûteuse non
seulement pour celui qui la subit mais aussi pour ceux qui l'infligent. Alors ces
derniers pourraient ne pas être incités à l'appliquer. Ce qui impliquerait que les
équilibres basés sur ce type de menaces ne seraient pas parfaits en sous-jeux.
Pour illustrer cela, considérons le jeu statique du tableau 5.2.
Tableau 5.2 Dilemme du prisonnier (variante).
Bonnie
D
Clyde
N D
(5,5) (-1,-2)
(6,-1) (0,-3)
Dans ce jeu, Clyde peut menacer Bonnie de la caler sur un gain nul en jouant
D. Dans ce cas, les stratégies suivantes forment un équilibre de Nash : Bonnie
joue N tout le temps. Clyde joue N tant que Bonnie joue N et adopte D si jamais
Bonnie joue D. Le problème est alors le suivant : Bonnie n'aura pas envie (si 8
est suffisamment élevé) déjouer D si elle croit que Clyde va exécuter sa menace
mais elle aura du mal à croire que Clyde va effectivement exécuter cette menace.
Après tout, Clyde n'obtiendra pas plus de -2 s'il exécute sa menace tandis qu'en
jouant N, il obtient au pire -1. Par conséquent Bonnie va être incitée à jouer
impunément D en pensant que Clyde ne va pas exécuter sa menace : la
coopération ne correspond pas dans ce cas à un EPSJ car les menaces qui la
soutiennent ne sont pas crédibles.
Mais il a été montré (Fudenberg & Tirole (1986)) que le théorème folk
s'applique aussi pour les EPSJ. Il suffit pour cela de modifier légèrement les
stratégies de punition. Étant donné que les gains du jeu statique sont finis, le
gain maximal qu'un joueur peut obtenir en déviant à une étape est borné. Il
suffit alors d'un nombre fini d'étapes pour infliger au joueur qui a dévié une
punition suffisante pour que la déviation ne soit plus intéressante a posteriori.
Une fois leur devoir accompli, les punisseurs peuvent revenir à leur stratégie
d'équilibre comme s'il n'y avait jamais eu de déviation. Comme toute la période
de punition a été effectuée dans un temps fini, elle a un poids négligeable dans
les gains des joueurs avec un horizon infini. Donc la punition est une menace
crédible et le théorème folk s'applique pour les EPSJ.
Théorème 5.1 (Friedman (1971)). Soit J un jeu fini statique en information
complète. Soient u = (u\,...uu) le vecteur des gains des joueurs à V équilibre de
Nash de ce jeu, u = (u\,...u„) un vecteur de gains réalisables dans ce jeu et 8,
le facteur d'actualisation commun à tous les joueurs. Si ux > u] pour tout
joueur i et si 8 est suffisamment proche de l'unité alors il existe un EPSJ du jeu
répété de manière infinie qui donne u comme le vecteur des gains moyens.
92 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Par conséquent, tout vecteur de gains qui respecte la rationalité individuelle
peut être obtenu grâce à un EPSJ.
Nous avons non seulement une profusion d'équilibres mais aussi une
multitude de réponses hors-équilibre qui les soutiennent. Dans l'équilibre que nous
avons donné pour le dilemme du prisonnier, Bonnie annonce que si jamais
Clyde joue D, elle va jouer D pour toujours. Mais si S est suffisamment élevé,
il est suffisant pour Bonnie de menacer que si Clyde joue D, elle jouera D à la
prochaine période. En effet, Bonnie pourrait aisément inclure une telle menace
dans une stratégie globale :
« Je (Bonnie) vais commencer par jouer Net, dans chaque période
ultérieure, je vais faire ce que Clyde a fait dans la période
précédente ».
C'est la stratégie que Axelrod a appelé tit-for-tat (donnant-donnant). Tant
que S est suffisamment proche de 1, on n'aura pas besoin d'une punition qui
durera jusqu'à la fin des temps pour soutenir la coopération. Tit-for-tat est
suffisante mais aussi beaucoup d'autres stratégies de punition. Laquelle de ces
menaces a le plus de chance d'être exécutée ? Il est difficile d'y répondre.
D'autant plus que si la menace est efficace, nous n'assisterons jamais à son
exécution.
[KB] : Sections 8.4 et 8.5.
D. Jeux avec horizon fini et défini
Le second problème avec la formulation en termes de jeux répétés provient du
fait que cela donne un résultat fondamentalement différent quand l'horizon est
fini et défini.
Considérons encore le dilemme du prisonnier répété cette fois-ci exactement
100 fois. Ainsi, si l'on atteint la période 100, on sait de manière certaine que le
jeu s'arrête à la fin de la période car c'est la dernière période. Si nous sommes
à la période 100, les deux joueurs sauront cela et ils vont nécessairement
jouer D car il n'y a plus de perte à long terme qui puisse balancer le gain
à court terme. Si nous sommes à la période 99, il y a bien une période qui
va suivre mais les joueurs savent que chacun va jouer D dans cette dernière
période. Par conséquent, personne n'a intérêt à coopérer à la période 99.
Ce raisonnement détruit totalement les possibilités de coopération car nous
pouvons ainsi remonter jusqu'à la période initiale du jeu et les joueurs vont
y jouer D. Cela démontre donc qu'il existe un EPSJ unique et il implique
l'absence de coopération. On peut aussi démontrer que la coopération ne peut
être soutenue sur aucun chemin d'équilibre de Nash. Ce résultat rappelle le
« Chain store paradoxe » de Selten (qui n'est rien d'autre que la répétition k fois
Jeux répétés • 93
du Jeu de l'entrée I) et son résultat est similaire à celui du jeu centripète de
Rosenthal.
C'est pour cette raison que nous avons besoin ici d'un argument un peu
plus sophistiqué que la retroduction. Comme pour le jeu centripète, le résultat
théorique du Dilemme du prisonnier répété est loin d'être intuitif, ni vérifié
empiriquement. Quand on expérimente ce jeu répété 100 fois avec des étudiants,
on observe que la coopération est choisie dans la majeure partie du jeu. On
observe même la coopération quand on répète le jeu une vingtaine de fois. Il
manque donc un élément fondamental à notre analyse.
III. Observations imparfaites
r
Notre analyse est basée sur l'hypothèse que toute déviation est immédiatement
observée et punie. Dans les applications de ces idées, nous pouvons être amenés
à traiter des cas où un des partis n'est pas sûr quant aux choix effectifs de l'autre.
Les observations peuvent indiquer que l'autre n'a peut-être pas
respecté l'accord. Il existe différentes manière de modéliser une telle situation.
On peut reprendre le dilemme du prisonnier et supposer que les gains sont
aléatoires et que la matrice du jeu contient en fait la moyenne de la distribution
des gains dans chaque cas. Les gains actuels peuvent, par exemple, être
distribués selon différentes lois normales avec ces moyennes et un écart-type de
5 unités, par exemple. Chaque joueur observe les deux gains (résultant du tirage
aléatoire) mais pas le choix actuel de l'autre.
« . N
Bonnie
D
Clyde
N D
(3,3) (-1,4)
(4,-1) (0,0)
Par exemple, si Bonnie choisit D et Clyde choisit TV, Bonnie obtient un gain
tiré d'une loi normale A/*(4, 5) et le gain de Clyde provient de la distribution
Af(—l, 5). Les erreurs sont indépendantes dans les deux dimensions.
Imaginons que vous êtes Clyde et qu'au premier tour vous choisissez TV et
vous obtenez un gain de 3.5 et Bonnie obtient 3.2. Au second tour vous jouez TV
est vous obtenez 2.5 et Bonnie obtient 2.4. Au troisième tour vous jouez TV et
vous obtenez -2 et Bonnie obtient 3.9. Avec ces observations vous ne pouvez
être sûr que Bonnie a joué D.
94 • LES JEUX rfON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tous ces cas appartiennent à l'intersection des deux distributions pour
chaque joueur (voir figure 5.2).
Figure 5.2 Distribution des gains de Clyde.
Devez-vous punir Bonnie ? Si oui, quelle doit être la force de la punition ?
Si -2 déclenche la punition, quid de 0 ? La punition doit-elle être
proportionnelle à vos pertes ?
Vous pouvez essayer de pardonner Bonnie. Mais dans ce cas, elle n'aura
aucune incitation à jouer N et elle peut tout le temps jouer D et justifier vos gains
par la malchance. En même temps vous n'avez pas envie de punir trop souvent
et trop brutalement. Même si Bonnie joue tout le temps TV, parfois vos gains
seront faibles et si vous déclenchez une punition en jouant D, par exemple suite
à un gain de 1, alors vous allez passer beaucoup de temps à la punir injustement
(et elle aussi à vous punir en retour) et les gains de la coopération vont
s'évaporer à force de punitions. Il y a définitivement un compromis à établir ici.
Vous allez en général chercher à punir suffisamment souvent et suffisamment
fortement pour inciter l'autre à jouer tout le temps N. Cela peut donc favoriser
une menace par rapport aux autres et résoudre le problème de la multiplicité
des menaces hors-équilibre. Mais si le bruit augmente, alors il sera de plus en
plus difficile de distinguer le choix de l'autre et le coût des punitions va baisser
les gains des deux partis à l'équilibre (cela peut même conduire à la disparition
de la coopération).
IV. Application : l'émergence du cartel
Le problème que rencontrent les duopolistes dans la constitution d'un cartel est
un résultat bien connu de l'économie industrielle. Reprenons rapidement ce
problème. Si la collusion est possible, l'objectif du cartel est la maximisation du
Jeux répétés • 95
profit total du secteur. Les firmes partagent ce profit maximal. Leur problème
est :
max n \ + 7r2.
n = 7i\ + n2
= P(qi+qi)(qi +qi) - cx{q\) - c2{qi)
où p(q) représente la demande inverse de marché (/?' < 0) et <:,(•) est la
fonction de coût total de la firme i (cf > 0, c" > 0).
Les conditions d'optimalité sont
-H = p(qi + qi) + (qi +q2)_L_ CmMi) = 0, i = 1,2 (5.8)
oqx dqt
Quand l'entreprise évalue l'impact d'une augmentation de sa quantité, elle
tient maintenant aussi compte de l'impact de la baisse de prix sur le profit de son
partenaire. Donc, en s'associant, les deux firmes sont capables d'atteindre
ensemble le profit du monopole. Soit qf les quantités produites par la firme i à
la solution du cartel et nf la part qu'elle obtient du profit du cartel.
Cette situation n'est pourtant pas un équilibre non coopératif et cela implique
un problème de stabilité pour le cartel. Nous pouvons voir cela en reprenant les
conditions d'optimalité et en imaginant que la firme envisage d'augmenter sa
quantité à partir de la solution de cartel. Nous pouvons alors récrire la condition
(5.8) pour faire apparaître le profit marginal de la firme i ^ j à la solution du
cartel :
dn; dp v dp
-r1 = P(q, + qf) + qi^~ CmMi) = -«//■> 0. (5.9)
dqs J dq{ J dq(
Ce profit marginal est donc positif à l'optimum du cartel (/?' < 0). Ce qui
veut dire que la firme sera incitée à augmenter sa production si elle pense que
son partenaire ne va pas modifier la sienne : la solution du cartel ne correspond
pas à sa meilleure réponse. Par conséquent, le cartel risque de déboucher dans
un duopole de Cournot où chaque firme va obtenir, enfin de compte, des profits
plus faibles que dans le cartel : c'est un cas typique de dilemme du prisonnier.
Le cartel sera donc instable si le problème du cartel ne se pose qu'une seule fois.
Or les firmes sont en relation de jour en jour sur le marché et la question
de la cartellisation se pose (quand on peut éviter la détection par les autorités
de la concurrence) de manière périodique et répétée. La prise en compte de
cette répétition peut-elle changer le résultat négatif sur la stabilité du cartel ?
L'équation (5.9) montre que face à la quantité de cartel de son concurrent, la
firme i a intérêt à augmenter sa production pour améliorer son profit mais alors
son concurrent arrêtera de coopérer et jouera sa meilleure réponse et le cartel
se transformera en duopole de Cournot.
96 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Considérons le cas où la firme 1 ne dévie pas de la solution de cartel et
produit qf. Si la firme 2 ne dévie pas de la solution de cartel, les deux firmes
obtiennent à chaque période nf dont la valeur actualisée est
00
*, = £>,*
/=0
Si la firme 2 en dévie à une période donnée Tet produit sa meilleure réponse
à q*, elle obtient un meilleur profit nD à cette période et son profit de Cournot
n2 pour le reste du jeu. La valeur actualisée de ses gains est alors
7-1
D = J2stn2K+STnD+ J2 *'*:
/=o
t=T+l
avec
nD > n? > n$
i2 — Jt>2
Pour faciliter la comparaison, nous pouvons récrire K2
7-1 oo
K2 = / 8*712 ~\~ 8 7Ï2 ~\~ / S 7U2
(5.10)
/=0
t=T+\
La firme 2 n'aura pas intérêt à dévier de la solution de cartel si
K2 - D ^ 0
a7(7TD-7T2*K J2 *'(*2*-*2C)
t=T+l
8T
^0
t = \
Ce qui implique (avec le résultat 5.3)
s ^
nD-n2K ,
—^ ~F < 1
7TD-7T9C
car n2 > n2 (du fait de la condition (5.10)).
Cette condition est donc vérifiée si S est suffisamment proche de 1. Par
conséquent, si la firme 2 accorde suffisamment d'importance à ses revenus
futurs, elle ne déviera pas du cartel. La même situation est bien sûr valable pour
la firme 1 et donc la solution de cartel fait partie de l'ensemble des équilibres de
Nash du jeu répété.
Jeux répétés • 97
V. Application :
qualité des produits et réputation
Un monopoleur vend un produit qu'il peut fabriquer soit de bonne qualité, soit
de mauvaise qualité. La demande pour ce bien dépend de sa qualité :
- Si la qualité est haute, la demande est donnée par pH = AH - Q = 20 - Q ;
- Si la qualité est basse, nous avons pB = AB - Q = 6 - Q.
Le coût de production d'une unité de bien de qualité haute est cH = 4 et
ce coût est de cB = 2 pour la qualité basse. Les consommateurs ne peuvent
observer la qualité du bien au moment de l'achat mais ils l'apprennent peu
après l'achat. Si les consommateurs pouvaient observer le choix de la qualité,
nous aurions les deux solutions du tableau 5.3 en fonction de la qualité(,) :
Tableau 5.3 Les deux solutions en information complète.
Quantités
Prix
Profit
se
Qualité basse
QB=2
pB= 4
JtB=4
SCB = 2
Qualité haute
G" =8
p" = 12
nH = 64
SCH = 32
Et la firme choisirait de produire la qualité haute. Ce qui aurait conduit à la
solution socialement préférable (Surplus social = surplus des consommateur
+ profit de la firme = 96 > 6).
Avec l'information asymétrique, si nous imaginons un marché qui n'a lieu
qu'une seule fois, nous obtenons un jeu dont l'arbre est représenté dans la figure
5.3, page ci-contre.
L'équilibre de ce jeu est inefficient : Quelle que soit la stratégie utilisée par
les consommateurs,la firme a un meilleur profit si elle choisit la qualité basse.
Dans la mesure où les consommateurs n'observent pas la qualité, leur décision
d'achat ne peut dépendre de la qualité. En anticipant cela, ils vont s'attendre à
ce que la firme produise la qualité basse. Ce que la firme va effectivement faire.
On aboutit alors à l'équilibre socialement sous-optimal.
Imaginons maintenant que la firme ne vende pas le produit une seule fois
mais de manière répétée dans le temps : un marché pour ce bien a lieu à des
dates dont la séquence est t = 1, 2,... Nous pouvons imaginer que les mêmes
1. Si la demande inverse est égale à p = A — Q, la solution de monopole donne : Q"1 = (A — c)/2,
nm = (A- c)2/4, SC = (A- c)2/8.
98 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Figure 5.3 Monopole et réputation.
consommateurs achètent le bien à chaque période ou que chaque fois de
nouveaux consommateurs viennent sur le marché. L'essentiel est que les
consommateurs potentiels à la date t soient informés de la qualité des unités
vendues dans les précédentes périodes t — 1, t — 2, ... La firme cherche à
maximiser son profit actualisé avec un facteur d'actualisation S.
Dans ce nouveau jeu, la qualité basse (avec les prix, quantités et le profits
correspondants) est toujours un équilibre. Mais il y a aussi d 'autres équilibres
plus intéressants. Imaginons que les consommateurs adoptent la règle de
décision suivante :
Supposer que la firme produit la qualité haute si les biens produits
dans les trois dernières périodes étaient de bonne qualité. Sinon,
supposer que le bien de cette période sera de mauvaise qualité.
Alors la firme peut obtenir les profits élevés nHH =64 à chaque période à
partir de la quatrième période et cela, en produisant systématiquement la qualité
haute.
Tableau 5.4 Demandes, coûts et profits.
Profits :
cB=2
Coûts
cH =4
Demande
AB = 6 AH = 20
JlBB=4 nBH =gl
nHB = { nHH = 64
Elle pourrait néanmoins être tentée d'en profiter et de produire la mauvaise
qualité à une période et ses profits monteraient alors, pour cette période, de
Jeux répétés • 99
64 à nBH = 81. Si la firme veut revenir à la solution haute, elle doit accepter
d'avoir, pendant les trois périodes suivantes, le profit nHB = 1. Elle préférera
alors toujours produire la qualité haute si et seulement si
(81 - 64) ^ (S + S2 + <53)(64 -l)&8^ 21,42 %.
Ce résultat correspond au phénomène bien connu d'établissement de
réputation par une firme. Cette firme aura soit une réputation de vendeur de camelote,
soit de vendeur de bonne qualité. Les consommateurs basent leurs anticipations
sur la production récente de la firme. Alors, maintenir la réputation de
producteur de bonne qualité est viable comme équilibre. Pour <5 suffisamment
proche de l'unité, une firme dans une telle situation choisira d'investir dans sa
réputation. Elle produira pendant quelques périodes la qualité élevée même si
convaincre les consommateurs est coûteux.
Il est essentiel ici que la firme soit persuadée que ses actions actuelles
influencent sa réputation et donc la demande future. Si la qualité des biens
vendus à la date t n'est jamais connue par les consommateurs futurs ou si elle est
connue avec beaucoup de retard alors l'investissement en réputation ne sera pas
viable comme équilibre dans la mesure où la firme qui a acquis une telle
réputation sera incitée à l'exploiter à court terme.
Ce résultat est très proche du raisonnement du théorème folk et il souffre des
même limites. D'abord, il y a beaucoup d'équilibres de réputation. Cela va en
plus de pair avec une absence de point focal. Ensuite, si l'horizon est fini et
déterminé, toute la construction de la réputation s'écroule : À la dernière période
les consommateurs vont rationnellement anticiper que la qualité sera basse et à
l'avant-dernière période la firme n'aura pas d'incitation à investir en réputation
et ainsi de suite.
De même, si les observations ex post ne sont pas parfaites, les choses se
compliquent considérablement. Si la firme ne peut parfaitement contrôler la
qualité de son bien alors elle aura des difficultés à établir une réputation.
Imaginons la situation suivante :
- Quand la firme cherche à produire la qualité basse, chaque unité produite est
effectivement de qualité basse avec une probabilité pB = 0.9 et elle est de
qualité haute avec une probabilité pH = 0.1 ;
-Quand la firme cherche à produire la qualité haute, les probabilités sont
respectivement pB =0.2 et/?" =0.8.
Alors si la firme produit et vend 4 unités dont 2 sont de qualité basse, que
doivent faire les consommateurs ? S'ils ne punissent pas la firme de temps en
temps alors celle-ci aura tendance à produire tout le temps la qualité basse
enmettant cela sur le dos d'une série incroyable de malchance. Mais alors,
même si la firme cherche tout le temps à produire la qualité haute, deux unités
sur dix seront de qualité basse. Donc les choses se compliquent comme on l'a
vu dans le cas général.
100 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Il ne faut pas imaginer pour autant que la construction de la réputation
marche toujours de la même manière que la répétition standard des jeux
non coopératifs. Imaginons qu'un joueur joue au dilemme de prisonnier avec
une succession de complices indépendants. Si chacun de ces complices est
myope alors les tentatives de ce joueur pour construire une réputation ne
vont pas conduire à l'émergence de la coopération. Étant donné que D est
une stratégie strictement dominante dans le jeu statique, chacun des
complices va la choisir. Alors le joueur n'a aucune incitation à construire une
réputation.
»»
ercices
Exercice 5.1
Dans le dilemme du prisonnier étudié dans ce chapitre
1. Est-ce que le résultat (N,D) peut appartenir à l'ensemble des équilibres du super-jeu
correspondant à la répétition à l'infini du dilemme du prisonnier ? Pourquoi ?
2. En utilisant l'idée des théorèmes folk, représentez dans l'espace (u\,u2) tous les gains
que les joueurs peuvent atteindre comme équilibre de ce jeu répété à l'infini, si le
facteur d'actualisation commun est 8 = 1.
Solution
Dans le dilemme du prisonnier
N
Bonnie
D
Clyde
N D
3,3 -1,4
4,-1 0,0
1. Le résultat (N,D) ne peut appartenir à un équilibre même si l'on répète à l'infini ce
jeu car ce résultat ne respecte pas la rationalité individuelle : Bonnie peut s'assurer au
moins 0 > — 1 en choisissant D au lieu N.
2. Les gains que les joueurs peuvent atteindre dans les EPSJ de ce jeu répété à l'infini,
doivent respecter la rationalité individuelle (le Théorème de Friedman). Si le facteur
d'actualisation commun est 5 = 1, les gains de toutes les périodes ont la même
importance aux yeux des joueurs. Nous représentons dans le graphique suivant les gains
moyens qui sont accessibles aux joueurs dans ce jeu répété (zone en gris clair). Seuls
les gains moyens respectant la rationalité limitée, w,- ^ 0, peuvent correspondre à un
équilibre (ces gains correspondent à la zone en gris foncé).
Jeux répétés • 101
-1 0
Exercice 5.2
Soit le marché d'un bien homogène produit par deux firmes. La demande inverse de
marché est donnée par p = 100 — Q et les fonctions de coûts des deux firmes sont
C,(q,)=2qhi = l,2.
1. Déterminez l'équilibre de cette industrie si chaque firme choisit son niveau de
production au début de la période, sans communication avec son concurrent.
2. Même question si les firmes coopèrent de manière à maximiser le profit joint
(considérez le cas où les firmes partagent de manière égalitaire les quantités et le profit du
cartel).
3. Quel sera l'équilibre de ce marché s'il n'a lieu que dix fois, avec chaque firme
actualisant ses revenus avec le facteur d'actualisation commun 8 ?
4. Quel sera l'équilibre du marché si le marché peut continuer sans fin, sachant que si une
firme dévie de sa stratégie de coopération, son concurrent jouera non coopératif
jusqu'à la fin des temps. Sous quelles conditions la solution coopérative peut émerger
comme un équilibre ?
5. Même question s'il faut à la firme seulement une période pour convaincre son
concurrent qu'elle ne déviera plus de la stratégie coopérative.
Solution
Il s'agit d'un duopole.
1. Cette situation correspond à un duopole de Cournot où chaque firme cherche à
maximiser son profit individuel
Jti = (100 - (qx + q2) - 2)qi9 i = 1, 2
^=9Z-2ql-qJ=0=*qr(qj)=49-qj/2, i?j = 1,2
102 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
q*\Qn est la fonction de meilleure réponse de la firme i. Nous devons donc avoir à
l'équilibre de Nash (qf, qf\
qC = 49-qf/2
qf=A9-qf/2
La résolution de ce système linéaire très simple donne
98
qf = — =32,67, î = l,2
11 3
Et les profit de Cournot des firmes sont symétriques
r /„„ 2x98\98 /98\2 __ 1
2. Il s'agit d'une situation de cartel où les deux firmes maximisent ensemble le profit
joint
max(98 - (qx + q2))(q\ + qi)
<7l.'/2
mais nous ne pouvons traiter séparément q\ et q2. Posons Q = cj\ + q2. Le problème
du cartel est alors celui d'un monopole
max(98-G)g
Q
an
-=98-20=0
Les profit du cartel et des firmes sont alors donnés par
k 2
2 401,
-(?).=
no2
itf = — = 1 200.5 > tt,c, 1 = 1,2
8
3. Si la firme y produit #* = 98/4, le profit de la firme / devient
ni(qi\qJK) = (9S-qi-^jqi
et ce profit est (par définition) maximal si la firme / produit sa meilleure réponse à qf.
H */ K\ 98 98 3X98 nr~,e K
Jeux répétés • 103
La firme / augmente alors son profit à
n°=n(q*(qï),qï)
- (q« - 3x98 _ ^\ 3x98
~l, 8 4/8
= (^)2 = 1 350.56 >**
Si le problème de la formation du cartel se pose uniquement sur dix périodes alors à
la dernière période la firme i sera tentée de produire qP de manière à augmenter son
profit puisqu'elle n'a rien à attendre de la stratégie coopérative (le jeu s'arrête à la fin
de cette période). Puisque cela est vrai pour les deux firmes, elles vont toutes les deux
jouer leur meilleure réponse, ce qui va conduire, à l'équilibre, à la solution de Cournot
pour cette période. Or, à la période 9, les firmes vont anticiper cela et en déduire que
la stratégie coopérative ne peut de toute façon pas conduire à la solution de cartel à la
dernière période. Il ne leur reste plus qu'à jouer leur meilleure réponse. De proche en
proche, l'équilibre de Cournot va s'imposer alors à chacune des périodes, jusqu'à la
période initiale du jeu. Nous allons donc observer une répétition pendant dix périodes
de l'équilibre de Cournot. Nous sommes bien face à jeu de type Dilemme du
prisonnier.
4. Nous avons maintenant un jeu infini où chaque joueur utilise une stratégie à
déclenchement (trigger strategy) : dès qu'une firme arrête de coopérer (en jouant sa
meilleure réponse), cela déclenche l'utilisation, par son concurrent, de sa meilleure
réponse jusqu'à la fin des temps.
Si le joueur / joue q*[qf) à une période T, il pourra augmenter ses profits à nP à
cette période mais il réduira alors ses profits de nf à nf à partir de la période T + 1.
Nous devons alors comparer les flux de gains avec qi(T) =q*(qj(j et avec
qi (T) = qf pour déterminer sa stratégie optimale :
- Si qi(t) = qf, Vf, il obtiendra le flux de profit actualisé
r=0 t=T+\
Tl* =J28'nlK+8TniK+ £ 8'n*
■Siqi(T)=q*(qf)
c
) Jl
i=T+l
La firme / ne déviera pas de la solution du cartel si
nf ^ nf
oo
«r(*,*-*/>)+ £«'(*,*-jt,c)>0
i=T+l
00 / \
104 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
{7Ti —TTiJ^TT —7T
1-5
5
1-5
5
133.4 ^ 150.06
^ 1.125
1-5
5 ^ 0.529
Sous cette condition seulement, le cartel sera stable dans le temps avec les stratégies
qu'on considère.
5. Dans ce cas, après sa déviation en période 7, la firme / peut convaincre son concurrent
à revenir au cartel si elle accepte de produire qx = qf = 98/4 en période T + 1,
tandis que son concurrent, en anticipant la non-coopération, produira
qj(q,K) =3x98/8.
Le profit de la firme i en T + 1 sera alors
r /„„ 98 3x98\
98
T
4*'-
Le flux de gains de la firme i qui dévie de la solution de cartel en T sera alors
T-\ oo
t=0 t=T+2
La firme ne déviera pas de la solution du cartel dans ce cas si (en comparant ce flux
avec Uf )
6T(*,K -x,D)+6T+1(n,K -*,')* 0
ST[(n,K-n,D)+B(n,K-nl')]>0
„D-„k _ 982 (ë4 ~ 8 J
&Z
Nous observons que la condition sur la stabilité du cartel se relâche du fait que
l'effort de convaincre l'autre à revenir à la coopération coûte cher à la firme (du fait
de la faiblesse de n?).
Exercice 5.3
Supposez que ces deux firmes se font concurrence en prix (duopole de Bertrand). La
demande de marché est donnée par D(p) = A — p et les fonctions de coûts des deux
Jeux répétés • 105
firmes sont C,(^,) = c,-^,-, i = 1, 2 avec c, = c < A. Selon les prix fixés au début
de chaque période, la demande est partagée entre les deux firmes selon la règle de
Bertrand :
^i{phPj) =
0 si pi > pj
D^ «;
—^— si p, = pj = p
D(p{) si pi < pj.
1. Déterminez l'équilibre de ce jeu s'il n'a lieu qu'une seule fois et que les firmes se
comportent de manière non-coopérative.
2. Même question si les firmes se comportent de manière coopérative et maximisent le
profit joint qu'elles partagent à parts égales.
3. Même question si le jeu a lieu 10 fois et que les firmes non-coopératives utilisent le
facteur d'actualisation commun 8.
4. Même question si le jeu a lieu à l'infini avec des firmes non-coopératives. Sous quelles
conditions peuvent-elles atteindre les gains coopératifs comme un équilibre parfait en
sous-jeux de ce jeu, sachant que si jamais une firme dévie de la coopération, l'autre la
punit en jouant non coopératif jusqu'à la fin du jeu.
Solution
1. Nous connaissons l'équilibre de Nash de ce jeu : c'est 1 'équilibre de Bertrand - voir
un cours de Microéconomie sur les structures concurrentielles, par exemple le cours
de Microéconomie II à l'adresse suivante :
http://beagle.u-bordeaux4.fr/yildi/micro2web/node34.html
L'équilibre de Bertrand correspond aux résultats suivants :
p*=c, JtiB=Ot / = 1,2
2. Si les firmes maximisent le profit joint, elles vont choisir le prix de monopole et
obtenir ensemble le profit de monopole
max(/? — c)(A — p)
M A+c M 1 (A - c)2
=*Pi = P = —; ir, =2~1—
Mais cette solution n'est pas stable car à partir ce point, chaque firme a intérêt à
légèrement baisser son prix et obtenir la totalité de la demande
Pî(p?)=PU-e
*r=«(Pî(P?),Pr) = {^-s-c)(A-T+*)
or e peut être arbitrairement petit par définition.
106 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Si le jeu a lieu 10 fois, les firmes ne vont pas coopérer à la dernière période et, de
proche en proche, l'équilibre de Bertrand statique se réalisera à chaque période.
4. Dans le jeu infini, chaque joueur utilise une stratégie à gâchette, de sorte que si la firme
/ dévie de la solution de monopole à une date 7, elle est condamnée à l'équilibre de
Bertrand pour le reste du jeu. En déviant, elle obtient à la période T un gain de
8T(7TiD-7TiM)=8T
Tandis que ses pertes dans le reste du jeu sont
00
TT," J2 8' < °
Elle choisira de ne pas dévier si
\{A-c\2 2 1 (A-c?~\
t=T+l
(*/>-*»)-*»£«'
^o
*/>-*,"£«'«>
2n
■ s —
1-5
1-5
<0
<0
Quand e -> 0 (e peut être aussi petit qu'on veut pour la firme qui dévie), cette
condition devint :
2nf - 28n^ - nf1
^(1-25X0
Donc le paradoxe de Bertrand disparaît quand la concurrence en prix est répétée de
manière infinie et le facteur d'actualisation des firmes est supérieure à 1/2 (dans ce cas
chaque firme utilise sa stratégie de cartel de manière optimale).
Jeux répétés • 107
6.1
eux de négociation
Comment partager les profits d'un cartel entre les participants ?
Comment partager les profits de l'entreprise entre les actionnaires
et les salariés ? De manière générale, comment des agents ayant
des intérêts opposés peuvent-ils finir par négocier un compromis ?
^Concepts clés étudiés : ce chapitre introduit une analyse des processus
simples de négociation :
- la négociation par offres et contre-offres alternées ;
- le rôle du temps dans les négociations ;
- le rôle des opportunités dont disposent les partis
indépendamment des négociations ;
-les stratégies pour influencer le résultat du processus de
négociation.
La théorie de la négociation représente bien plus qu'une simple application de
la théorie des jeux car, dès le début de cette discipline, les modèles de
négociation ont suscité beaucoup d'intérêt (le premier article publié de Nash portait sur
ce sujet). Comment les agents impliqués dans une négociation peuvent-ils
dépasser leur opposition et s'engager volontairement dans une action acceptable
pour tous ?
► Exemples
Négociations salariales dans une entreprise ; négociations
commerciales ; établissement d'accords de coopération entre les entreprises.
Jeux de négociation • 109
Nous allons introduire les concepts de base de la théorie des négociations
dans un cadre très simple où deux individus cherchent à partager un bien ou un
gain. Il est bien sûr possible d'étendre ce cadre pour tenir compte des
négociations qui portent sur plusieurs objectifs à la fois. On pourrait aussi distinguer les
processus de négociations plutôt informels, comme celles que nous allons
considérer dans ce chapitre, de ceux qui ont lieu dans un cadre officiel bien défini (les
négociations sociales annuelles de branche entre le patronat et les syndicats, les
négociations internationales sur le climat ou sur les quotas de pêche).
Pendant les négociations, le passage du temps aura en général un coût pour
les participants (l'entreprise ne produit pas pendant une grève et les salaires ne
sont pas versés). Dans ce cas, deux éléments joueront un rôle important dans
l'établissement du compromis :
- les procédures de négociations : la séquence des offres et des contre-offres ;
- l'urgence, pour chaque partie, de terminer le conflit.
Pour analyser la manière dont ces deux dimensions peuvent influencer le
résultat des négociations, nous pouvons envisager deux exemples de protocoles
simples de négociation :
- à prendre ou à laisser. Il s'agit d'une forme de négociation extrême dans sa
structure, mais néanmoins assez courante (quand vous allez à un
supermarché, vous n'essayez pas de négocier les prix affichés) ;
- propositions alternées. Un déroulement dans le temps des offres et contre-
offres émanant alternativement de chaque partie.
Mais en réalité, la première forme peut, elle aussi, être analysée comme un
cas particulier du protocole de propositions alternées.
I. Négociation avec propositions alternées
Considérons le problème de négociation classique où deux joueurs rationnels
cherchent à partager un objet (un profit réalisé ensemble, un butin), d'une valeur
X avec un protocole de négociation particulier :
- un joueur fait une première offre : un partage des gains, (*, 1 — jc) (par
exemple, (60 %, 40 %)) ;
- l'autre a le choix de l'accepter, auquel cas il obtient la part 1 — x ou de
refuser ;
-s'il refuse, il fait à son tour une proposition pour le partage {y A - y) ;
- le premier joueur peut à son tour soit accepter, soit faire une nouvelle
proposition.
Chaque fois qu'un joueur refuse l'offre qu'on vient de lui faire, il obtient la
possibilité de faire une offre à son tour. Ce processus continue jusqu'à ce que les
110 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
deux joueurs aboutissent à un partage acceptable pour les deux, ou que l'objet
de la négociation disparaisse.
Très souvent, le passage du temps est effectivement néfaste pour l'objet à
partager et sa valeur diminue pendant chaque session de négociation (l'usine ne
produit rien pendant que la grève continue et les ouvriers perdent leur salaire) :
une fraction S de la valeur X disparaît à chaque offre non acceptée.
Considérons un exemple très simple pour analyser les résultats possibles
d'un tel processus de négociation.
f Exemple 6.1
Bart et Lisa veulent partager une bûche glacée. Bart propose un partage
initial Si Lisa refuse, c'est à elle défaire une offre, mais une partie de la
glace aura fondu (il fait chaud et ils n'ont pas la possibilité de la laisser
dans un congélateur le temps de la négociation). De même si c'est Bart
qui refuse et doit faire une contre-offre.
Quel va être le partage décidé par les deux enfants ?
Considérons différentes possibilités de négociation.
A prendre ou à laisser
Imaginons qu'il y ait une seule période possible (la glace fond
complètement si la proposition initiale de Bart est refusée). Par conséquent
Lisa n'aura pas la possibilité de faire une contre-offre. Nous sommes
effectivement dans un cas où l'offre initiale de Bart est « à prendre ou à
laisser ». Quelle part de la glace pourrait alors demander Bart ?
Il sait que si son offre est refusée, Lisa n'aura rien (la glace aura
disparu). Il suffirait donc qu'il lui propose une petite portion de la glace
pour que Lisa accepte. En effet, dans ce cas, elle est mise devant le choix
entre ne rien obtenir et manger la portion proposée par Bart. Ce dernier
pourra donc obtenir la quasi-totalité de la glace.
Ce résultat peut paraître extrême. En effet, si on sort du cadre strict des
décisions rationnelles (où une miette est mieux que rien), il est fort
probable que Lisa refuse l'offre si elle lui paraît trop inéquitable et si elle
a effectivement la liberté de la refuser (ce type de résultats est
couramment observé dans les expériences menées par les psychologues et les
économistes). Dans la mise en œuvre réelle de la théorie de négociation,
il faut tenir compte de ces marges plus étroites dont dispose le joueur qui
fait la première offre.
Si la liberté de choix n'est pas présente, on aboutit facilement à ce type
de résultat extrême. Rappelez-vous la réplique de Don Vito Corleone dans
Le Parrain : « Je vais lui faire une offre qu'il ne pourra pas refuser ».
Deux périodes de négociation
S'il y a une seconde période de négociation (la glace prend deux périodes
pour fondre), les choses seront plus favorables pour Lisa. Elle sait
maintenant que si elle refuse l'offre initiale de Bart, elle pourra s'assurer la
Jeux de négociation • 111
presque totalité de la moitié restante de la glace. En effet, ce sera à elle,
dans ce cas, de faire une offre « à prendre et à laisser ». Anticipant que
s'il fait une offre inacceptable à Lisa, il n'aura pas de glace, à la
première période Bart ne pourra pas demander plus que la moitié de la glace.
Le partage se fera alors à parts égales.
Trois périodes de négociation
Considérons maintenant le cas où seulement un tiers de la glace fond à
chaque période, en cas de désaccord. Représentons l'évolution des
possibilités de négociation et des parts des deux parties dans un tableau
pour faciliter l'analyse de la situation (cf. tableau 6.1).
Tableau 6.1 Négociation en trois périodes.
Période
1
2
3
4
Offreur
Bart
Lisa
Bart
Demande maximale
possible
1
2/3
1/3
0
Demande effective
2/3
1/3
1/3
En accord avec le principe de rétroduction que nous avons introduit dans
le chapitre 4, commençons par la dernière période car, pour formuler son
offre, chaque joueur doit anticiper ce qui peut se passer si elle est refusée.
Si la négociation atteint la troisième période, Bart pourra s'assurer 1/3
de la glace (on a une situation de type « à prendre ou à laisser » avec le
dernier tiers restant de la glace). Anticipant cela, Lisa ne pourra
demander au plus que 1/3 de la glace à la seconde période (la moitié des
2/3 restants de la glace), sinon Bart refuserait son offre. Bart pourra alors
demander les 2/3 de la glace à la première période et Lisa acceptera cette
proposition.
Le partage se fera en parts
Quatre périodes de négociation
Supposons que seulement 1/4 de la glace fond en cas de désaccord
(cf. tableau 6.2).
Tableau 6.2 Négociation en quatre périodes.
Période
1
2
3
4
Offreur
Bart
Lisa
Bart
Lisa
Demande maximale
possible
1
3/4
1/2
1/4
Demande effective
1/2
1/2
1/4
1/4
112 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
U's}
Avec le même raisonnement, nous remarquons que si la négociation
atteint la quatrième période, Lisa pourra s*assurer 1/4 de la glace.
Anticipant cela, Bart ne pourra demander au plus que 1/4 de la glace à
la troisième période (la moitié des 1/2 restants de la glace). Lisa pourra
12 3 1
alors demander 1/2 de la glace à la seconde période : - = - = .
2 4 4 4
En anticipant cela, Bart demandera la moitié de la glace à la première
période et Lisa va accepter cette offre.
Le partage se fera en parts égales :
Cinq périodes de négociation
Pour finir, supposons que seulement 1/5 de la glace fond en cas de
désaccord (cf. tableau 6.3).
Tableau 6.3 Négociation en cinq périodes.
Période
1
2
3
4
5
6
Offreur
Bart
Lisa
Bart
Lisa
Bart
Demande maximale
possible
1
4/5
3/5
2/5
1/5
0
Demande effective
3/5
2/5
2/5
1/5
1/5
Le partage se fera dans ce cas en parts :
Evolution du partage en fonction des conditions de négociation
Nous pouvons, à partir de ces exemples, généraliser la manière dont le
partage se fera en fonction du nombre de périodes de négociation
(cf. tableau 6.4).
Tableau 6.4 Périodes de négociation et partage des gains.
Nb. Périodes
Part de Bart
Part de Lisa
1
1
0
2
1/2
1/2
3
2/3
1/3
4
1/2
1/2
5
3/5
2/5
pair
1/2
1/2
impair
r + 1
2t
t-\
t= 101
102 _ 1
202 % 2
100 _ 1
202 ^ 2
m-
§■§•
Jeux de négociation • 113
■ > Remarque 6.1
Quand le nombre de périodes de négociation est suffisamment grand, on
tend vers le partage à parts égales et le fait de faire la première ou la
dernière offre n'apporte plus d'avantage.
■ > Remarque 6.2
Dans tous les cas, le partage sera accepté dès la première proposition mais
il tient compte de la fonte de la glace, car les joueurs l'anticipent.
- > Remarque 6.3
Le raisonnement stratégique dans la conception du cadre de négociation
(le protocole, la longueur des négociations) joue un rôle important dans le
partage final.
II. Application : la paillote du Soleil
Le snack de la plage va ouvrir pour une nouvelle saison. Il ouvre pour les 101
jours qui constituent la saison haute pour cette plage. Pendant une telle saison,
le snack fait 1 000 € de bénéfices par jour.
Les deux salariés de la paillote trouvent que leur salaire n'a pas augmenté
depuis plusieurs années et qu'il est temps d'en discuter avec leur patron.
Les négociations salariales doivent donc conduire à un partage des bénéfices
et les salariés ouvrent les négociations en faisant une proposition au patron,
proposition qu'il peut accepter ou refuser... S'il refuse, la paillote n'ouvre pas,
il n'y a pas de bénéfice et les salaires ne sont pas versés. Donc chaque jour de
retard dans l'ouverture est coûteux pour les deux parties.
Si un accord n'a pas été trouvé à la veille du dernier jour de la saison, il ne
reste plus qu'une journée de bénéfices à réaliser (1 000 €). Les salariés (dont
c'est le tour de faire une proposition) pourraient alors obtenir la quasi-totalité de
ces bénéfices en laissant une part minime au patron pour l'inciter à ouvrir la
paillote. En anticipant cela, le patron proposera (à la période 100) de partager
également les deux journées de bénéfices (2 000 €) qui restent à réaliser (les
salariés n'accepteraient rien de moins que les 1 000 € qu'ils peuvent obtenir à
la dernière période).
Le principe qu'on a observé dans l'exemple 6.1 s'applique ici aussi et
conduit à un partage en parts quasiment égales des bénéfices. L'avantage des
salariés (faire l'offre finale de type « à prendre ou à laisser ») se réduit quand la
négociation se prolonge.
On obtient des résultats assez similaires si les offres ne sont pas alternées ou
s'il n'y a pas d'horizon défini à la négociation (Rubinstein).
114 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
—^- Remarque 6.4
À nouveau, l'accord est trouvé dès la première période.
—^- Remarque 6.5
Si toutes les négociations se passaient comme cela, il n'y aurait jamais de
grève ou de blocage.
Nous avons dû laisser de côté certaines dimensions importantes du processus
dont les opportunités externes.
III. Importance des opportunités externes
Une dimension importante du partage est le coût de l'attente pour chaque joueur.
Ce coût dépend des opportunités dont ils peuvent bénéficier en dehors du cadre
de la négociation.
Si les salariés peuvent avoir un job temporaire ailleurs pendant qu'ils font
grève, ils peuvent s'assurer un revenu minimum. Cela réduit du coup le coût de
l'attente et leur impatience à trouver un accord. Le partage doit tenir compte de
ces revenus supplémentaires.
Imaginons que les salariés peuvent s'assurer 200 € de revenus chaque jour
de grève, en travaillant ailleurs.
À la période 100, quand le patron fera sa proposition, il faut maintenant qu'il
tienne compte de ces revenus dans le partage des 2 000 € de bénéfices
potentiels car les salariés peuvent s'assurer 1 000 € demain en refusant l'accord
aujourd'hui, et en plus gagner 200 € aujourd'hui en travaillant ailleurs. Donc ils
n'accepteront pas un accord qui leur donnerait moins de 1 200 € sur les
2 000 €.
La règle de partage égal des gains futurs restants ne s'applique plus à la
totalité de la somme, mais au solde, une fois enlevé le revenu que les salariés
peuvent s'assurer de toute façon :
1 000 - 200 = 800
Ces 800 € seront donc partagés également et le patron obtiendra 400 et les
salariés 600.
Les opportunités extérieures des salariés deviennent un handicap pour le
patron dans les négociations. De manière similaire, une opportunité extérieure
pour le patron lui aurait donné un avantage dans les négociations (s'il peut louer
sa paillote à quelqu'un d'autre pendant la grève, par exemple).
Si les salariés peuvent obtenir 200 € en travaillant ailleurs chaque jour de
grève et le patron, 300 € en louant sa paillote, il ne reste plus que 500 € à
partager dans le cadre de la négociation.
Jeux de négociation • 115
1 000 - (200 + 300) = 500 = 2 x 250
Dans ce cas, les salariés obtiendront :
200 + 250 = 450
Et le patron :
300 + 250 = 550
Ces observations se généralisent en fait assez facilement. Dans les
négociations, la partie qui est la plus patiente obtiendra la part la plus grande.
U impatience doit être comprise ici comme le besoin d'arriver vite à un accord.
La partie qui peut supporter relativement plus facilement l'absence d'accord
pourra obtenir la part la plus importante dans la négociation.
IV. Stratégies pour affaiblir l'autre partie
Dans les deux exemples précédents, nous observons que :
- dans le premier cas, les salariés obtiennent un gain supplémentaire de 200 €
par rapport à leur patron ;
- dans le second cas, le patron obtient un gain supplémentaire de 100 € par
rapport aux salariés.
Ces gains supplémentaires correspondent à l'opportunité extérieure relative
de chaque partie par rapport à celle de l'autre (cf. tableau 6.5).
Tableau 6.5 Opportunités extérieures et avantage dans les négociations.
Partie
Cas 1
Cas 2
Salariés
200
200
Patron
0
300
Différence
200
-100
Part des salariés
600
450
Par conséquent, on peut être amené à adopter une stratégie qui réduit nos
opportunités extérieures si elle réduit encore plus celles de l'autre partie. Ce qui
peut parfois engager les parties dans une escalade qui risque de devenir coûteuse
collectivement. C'est ainsi qu'une menace de grève peut finir par conduire à la
grève elle-même, même si aucune des parties ne la désirait vraiment. Il suffit
pour cela qu'on apprécie mal les opportunités extérieures ou la patience de
l'autre partie. À nouveau, c'est la partie qui a le plus d'opportunités extérieures
qui aura recours à ce type de stratégie d'escalade.
Dans une grève, les salariés vont essayer de rendre crédible la menace d'une
grève longue et coûteuse et le patron va essayer de convaincre les salariés qu'il
peut supporter facilement une telle grève et qu'elle sera donc effectivement
coûteuse pour les salariés.
116 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Une petite erreur d'appréciation quant aux opportunités extérieures de l'autre
partie peut conduire au blocage des négociations. Il faut donc savoir bien
apprécier jusqu'où on peut pousser l'adversaire pour ne pas avoir des surprises.
ercices
Exercice 6.1
Le producteur de jeux MegaGames et la société Apple négocient pour déterminer la
manière dont les profits réalisés par MegaGames, grâce aux ventes sur AppStore (la
boutique de vente en ligne d'Apple), vont être partagés. Soit P le montant de ces profits
pour une année. La création des jeux que MegaGames va proposer sur AppStore lui a
déjà coûté P/4. Apple fait une offre à prendre et à laisser à MegaGames.
1. Quel montant pourrait réclamer Apple ?
2. Même question si MegaGames peut facilement transformer ses jeux pour les proposer
sur Android Market (la boutique de vente en ligne de Google) et réaliser un profit de
P/2.
Solution
1. L'investissement de MegaGames étant déjà effectué de manière irréversible, il ne peut
pas peser directement sur la négociation et tout profit obtenu par lui est préférable à
rien. Dans ces conditions, Apple pourrait réclamer la presque totalité de ces profits.
2. Dans ce cas, MegaGames refuserait toute offre qui ne lui laisserait pas au moins PI2
de profit. Par conséquent, Apple ne peut réclamer plus de PI2 de profits.
Exercice 6.2
Dilbert et Dogbert cherchent à partager une prime de 100 €. Dilbert fait une offre à
Dogbert : il propose de garder une partie (s\) de la somme et de laisser (100 — s\) à
Dogbert. Si Dogbert refuse cette offre, il fera une offre à son tour mais cette offre lui
coûtera 10 € : il proposera alors de garder la partie (s2) de la somme à partager et de
laisser (100 — s2) à Dilbert. Si ce dernier refuse cette offre, il fera à son tour une offre
fo) après avoir payé un coût c. Si aucune offre n'a été acceptée au bout des trois essais,
la prime est attribuée à Catbert.
1. Quel serait le partage d'équilibre si c = 0 ?
1. Même question si c = 90.
2. Même question si c = 10.
3. Même question si c = 0 mais qu'il est bien connu de tout le monde que Dogbert ne
supporterait pas une offre de s\ = 100 de la part de Dilbert et qu'il bloquerait les
négociations et laisserait les 100 € à Catbert pour se venger.
NB : Dilbert, Dogbert et Catbert sont des personnages créés par Scott Adams.
H9ËX
Jeux de négociation • 117
Solution
1. La structure du problème de négociation peut être résumée dans le tableau suivant :
Période
1
2
3
4
Offreur
Dilbert
Dogbert
Dilbert
Catbert !
Demande maximale
100
100
100
Demande
100
0
100
Gain
100
0
100
100
À la troisième étape, Dilbert pourra demander la totalité de la prime. Anticipant cela,
à la deuxième étape, Dogbert ne pourra demander plus que 0. Ce qui conduit à un
accord dès la première période où Dilbert obtient la totalité de la prime : (100, 0). Sa
menace de récupérer la totalité de la prime à la dernière période lui permet de
s'assurer ce gain dès la première période.
2. La structure du problème de négociation peut être résumée dans le tableau suivant :
Période
1
2
3
4
Offreur
Dilbert
Dogbert
Dilbert
Catbert !
Demande maximale
100
100
100
Demande
20
90
100
Gain
20
80
10
100
Cette fois-ci, le maximum que peut s'assurer Dilbert à la dernière période est 100-90
= 10. Anticipant cela, Dogbert ne lui laissera plus pendant sa proposition de la
seconde étape. Étant donné que Dogbert peut s'assurer 80 à cette étape-là, Dilbert ne
pourra obtenir plus que 20 à la première période : (20, 80).
3. Il s'agit de la situation inverse par rapport au cas 2. Nous résumons à nouveau les
étapes de la négociation dans un tableau :
Période
1
2
3
4
Offreur
Dilbert
Dogbert
Dilbert
Catbert !
Demande maximale
100
100
100
Demande
100
10
100
Gain
100
0
90
100
Dilbert pourra à nouveau récupérer la totalité de la prime dès la première période,
puisque Dogbert ne peut obtenir un gain supérieur à 0 en refusant cette offre : (100,0).
4. Ce cas est similaire au cas 1, mais Dilbert, craignant la réaction brutale de Dogbert, ne
peut proposer de récupérer la totalité de la prime. Il doit laisser une part suffisante (A)
à ce dernier pour que le partage ne lui paraisse pas trop injuste : (100 - A, A).
Période
1
2
3
4
Offreur
Dilbert
Dogbert
Dilbert
Catbert !
Demande maximale
100
100
100
Demande
100 -A
A
100-A
Gain
100-A
A
100-A
100
118 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Troisième partie
V
Jeux non coopératifs
avec information
incomplète
7» Jeux simultanés avec information
incomplète 121
o. Jeux séquentiels avec information
incomplète 137
7.1
eux simultanés
avec information
incomplète
Dans les jeux que nous avons étudiés jusqu'à maintenant, nous avons
chaque fois supposé que les joueurs connaissent toutes les données
du problème auquel ils sont confrontés. Cela correspond par
exemple au cas du jeu d'échecs où les joueurs connaissent les règles du jeu
et où ils observent tous les coups qui ont eu lieu avant chaque fois qu'ils
doivent jouer. Ce n'est pas du tout le cas d'un jeu de cartes comme le poker
où chaque joueur dispose d'une information à laquelle il est le seul à avoir
accès : les cartes qu'il a en main. Alors chaque joueur doit non seulement
anticiper la stratégie de ses concurrents pour mieux les contrer, mais aussi
deviner leur main. Quand le jeu est séquentiel (comme le poker), la
principale préoccupation de ses adversaires est alors de brouiller ces
anticipations en cherchant à le tromper par le bluff.
Les jeux en information incomplète (ou les jeux bayésiens) cherchent à
analyser ce type de situation où les joueurs ne connaissent pas
parfaitement les données du jeu. Le problème majeur dans ce cas est bien sûr
l'incomplétude : si les joueurs ne connaissent pas parfaitement le jeu,
comment peuvent-ils réagir de manière rationnelle et à quel type de
résultats pourrons-nous aboutir dans ce type de jeu ? Si l'incomplétude ne
peut être corrigée, il n'y a pas de réponse à ces questions.
Concepts clés étudiés : Ce chapitre est consacré à l'analyse des jeux
statiques en information incomplète :
- compléter l'information avec la méthode de Harsanyi ;
- les types d'un joueur ;
- la forme normale des jeux statiques bayésiens ;
- les croyances des joueurs dans un jeu bayésien ;
- la règle de Bayes ;
- la définition des stratégies dans un jeu bayésien ;
- les stratégies mélangeantes et séparatrices ;
- l'équilibre de Nash bayésien.
Jeux simultanés avec information incomplète • 121
I. Le rôle de la Nature
Harsanyi (1967-68) a le premier développé l'outil nécessaire à la modélisation
de ce type de situation qui correspond à l'incomplétude de l'information dans un
jeu stratégique.
Considérons un jeu stratégique J opposant deux joueurs. Le joueur 1 connaît
parfaitement les gains résultant de chaque paire de stratégies possibles, tandis
que le joueur 2 ne les connaît pas parfaitement. Ce dernier ignore donc une
composante essentielle du jeu. Chacun connaît néanmoins la liste des stratégies
qui est à la disposition de chaque joueur. Supposons qu'elles soient en nombre
fini. Comme le joueur 2 ne connaît pas précisément les gains du jeu auquel il
participe, il possède des croyances sur ces gains. Ces croyances sont
représentées sous la forme d'un ensemble de fonctions de gains possibles et de
probabilités attachées à chacune de ces fonctions. Notons par Jk le jeu
correspondant au /rième fonction de gain et pk la probabilité que le vrai jeu
auquel le joueur est confronté soit Jk. Chacun de ces jeux a exactement la même
structure, sinon le joueur 2 pourrait deviner à quel jeu il participe en observant
cette structure. De plus, le joueur 2 sait que le joueur 1 connaît parfaitement le
jeu.
La manière dont le joueur 2 perçoit le jeu peut être représentée, selon
Harsanyi, par un coup initial d'un joueur fictif, la Nature, qui choisit le jeu
(figure 7.1).
P\/ :
Nature .<^-—^*—*/*
Figure 7.1 Passage à Vinformation imparfaite.
D'abord la Nature tire au hasard le vrai jeu auquel doivent jouer les deux
joueurs, ensuite le joueur 1 est informé de ce choix et les joueurs jouent. Le dé
qu'utilise la Nature possède autant de faces que le nombre de jeux possibles et
ce dé est truqué de telle manière que la probabilité pk que le jeu Jk soit tiré
corresponde exactement aux croyances du joueur 2.
Harsanyi propose donc de remplacer le jeu stratégique en information
incomplète J par un jeu séquentiel en information complète (mais imparfaite),
122 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
/', où la Nature joue le premier. L'asymétrie entre les deux joueurs ne disparaît
pour autant dans /'. Elle est transposée de la définition des règles du jeu (les
deux joueurs font maintenant face au même jeu) vers la définition des stratégies
dont disposent les deux joueurs. Maintenant, le manque d'information du joueur
2 se traduira par un manque d'observation, celle du coup joué par la Nature,
tandis ce coup sera parfaitement observé par le joueur 1.
La stratégie du joueur 1 va prescrire une action différente pour chacun des
jeux possibles, tandis que la stratégie du joueur 2 ne précisera qu'une seule
action pour tous les jeux, indépendamment du choix de la Nature, puisqu'il ne
peut observer ce choix (et il ne peut distinguer les différents nœuds qui sont
conditionnés par ce choix - ils appartiennent nécessairement au même ensemble
d'information).
Dans un contexte dynamique, les choix du joueur 1 auront un intérêt
par- ticulier pour le joueur 2 dans la mesure où ces choix suivent l'observation
du choix de la Nature. C'est dans ce contexte que des phénomènes vraiment
intéressants, comme l'utilisation des choix comme des signaux ou la révélation
de l'information privée, peuvent apparaître. Nous allons considérer ces
possibilités dans le prochain chapitre.
Nous pouvons néanmoins déjà observer que l'information incomplète, qu'on
complète pour la rendre imparfaite, modifie considérablement les jeux et la
manière dont on peut les résoudre. Une application va nous permettre de
clarifier cette approche avant d'aller plus loin.
II. Application : le duopole de Cournot
sous information incomplète
Considérons un duopole produisant un bien homogène dont la demande inverse
est donnée par/?(g) = A — Q. Les fonctions de coûts des deux firmes qui se
font concurrence en quantités sont données par
Ci(qi) =c(qiy i = 1,2
avec C\ parfaitement connu par les deux firmes, tandis qu'il existe une
incertitude pour la firme 1 sur c2 car elle ne l'observe pas : c2 £ {cF>cE} avec
cE > C\ > cF. P[cF] = a = 1 — P[cE] donne la probabilité que la firme 2 ait
des coûts faibles (figure 7.2, page suivante).
La firme 2 connaît bien sûr ses coûts.
Jeux simultanés avec information incomplète • 123
Figure 7.2 Distribution des coûts de la firme 2.
La fonction de meilleure réponse de la firme 2 dépend de son type de coût :
max (A — q\ — q2)q2 — cFq2i si c2 = cF
n
max
(A-q* - q2)q2 ~ cEq2i si c2 = cE
La production optimale de la firme dépendra bien sûr de ses coûts et la firme
1 doit tenir compte de cela. Soit q\(cF) la quantité qu'elle attend du type faible
et ql(cE), celle attendue du type élevé. La firme 1 sait que la probabilité de faire
face au type F est a. Elle doit alors maximiser son profit espéré
max a [(A -qx- q2{cF))qx - cxqA
+(1 - a) [(A -qx- q2(cE))qx - cxqx]
Les meilleures réponses des firmes résulteront alors des conditions de
premier ordre de ces problèmes
q2(qi ; cF) =
A
A
-1i
2
-tfi
-cF
-cE
et nous avons alors
q2(q\ ; cE) =
q2(q\ ; cF) > q*(qx ; cE), Vqx
et E[q2] =
Le problème de la firme 1 devient alors :
max(A-^! -E[q2]-cx)qx
<71
124 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
et il conduit à la fonction de meilleure réponse suivante :
A - E[q2] - c,
q"x(qi) = j
_ A - [aq2(cF) + (1 - a)q2(cE)] - C\
2
Dans ce jeu simultané, l'équilibre de Nash correspond à une situation dont
aucune firme n'a intérêt à dévier ; ce qui correspond à l'intersection de q\{q2)
avec E[q2] (point E dans la figure 7.3, page suivante). Du fait de l'incertitude de
la firme 1, les deux types de la firme 2 se trouvent liés
, A + E[c2] - 2c,
q2(cF) =
q2(cE) =
3
1A - E[c2] + 2c, - 3cF
6
1A - E[c2] + 2c, - 3cE
6
avec q2(cF) > q2(cE) puisque cE > cF (respectivement q£ et q£ dans la figure
7.3, page suivante). On peut récrire ces quantités d'équilibre pour faciliter la
comparaison avec la production de la firme 2 en information complète (les
points EF et EE représentent les équilibres qu'on aurait eu en information
complète) :
A — lCj + c,.,.
1ï = 3 i,i#y = l,2
qïicF) = ^ L - (cE ~ cF)(l -
A-2cF + c,
A - 2cF + c,
-«)< ^
A - 2cE + c,
Dans l'équilibre de Nash avec information incomplète, la firme avec des
coûts élevés produit plus que ses quantités de Cournot et celle avec des coûts
faibles est amenée à produire moins que ses quantités en information complète :
l'incertitude de son concurrent l'empêche de profiter pleinement de ses coûts
faibles car elle sait que la réaction de son concurrent va résulter d'une espérance
qui inclut nécessairement cE :
q*\cF <q\ <qî\cE
et la firme 2 doit en tenir compte pour éviter une baisse trop forte du prix.
Jeux simultanés avec information incomplète • 125
Figure 7.3 Duopole de Cournot en information incomplète.
■ > Remarque 7.1
Dans cet exemple la prise en compte des espérances des profits et des
quantités se réduit au remplacement de c2 par son espérance. Si les coûts
n'interviennent pas de manière linéaire, cela ne sera pas nécessairement
le cas.
■ > Remarque 7.2
Du fait de l'imperfection de l'information de la firme 1, les deux jeux
(l'un avec cF et l'autre avec cE) sont liés et l'on ne peut les résoudre
séparément.
Comment pouvons-nous généraliser l'approche que nous avons utilisée pour
résoudre ce jeu ?
Ml. Equilibre de Nash bayésien
Nous avons complété l'information en considérant que la firme 2 pouvait être de
deux types différents et que la firme 1 n'observait pas le choix du type de son
concurrent par la Nature. Chaque fois que l'incertitude porte sur une des
caractéristiques d'un joueur, nous pouvons représenter les différents états de la
Nature comme des types différents de ce joueur. Quand l'incertitude porte sur
une autre caractéristique du jeu, il est quand même souvent possible d'utiliser
cette approche pour compléter l'information, en modifiant notamment les gains
des joueurs en conséquence pour les rendre dépendants de son type : w,(s ; tf)
qui est connu par le joueur i pour tout type possible tt de ce joueur.
126 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Dans le jeu précédent : t2 e {cFi cE] et t\ e {c\} et les fonctions de gains
sont 7ix(quq2 ; cx) pour le joueur 1, n2(quq2 ; cE) et 7t2(quq2 ; cF) pour le
joueur 2.
Étant donnés les types possibles de tous les joueurs (contenus dans 7} pour
chaque joueur), t = (t\y..., t„) représente une distribution particulière des types
t e T = X Tj. Dans notre exemple de duopole
des joueurs
T = {(cucF), (cucE)} avec Tx = {c^ et T2 = {cF,cE}.
Nous pouvons alors noter, comme pour un profil de stratégies, par
f_. = (r,,..., *._,, ti+i,..., tn) une distribution particulière des types de tous les
joueurs sauf celui du joueur /.
Dans cette approche le joueur i connaît son propre type f, mais il a juste une
distribution de probabilités conditionnelles sur les types des autres joueurs :
Pi(t-i\ti). Si les types des joueurs sont indépendants, cette distribution se réduit
à/?,-(*_,■) comme c'est le cas dans notre exemple.
J6 Mfc Dl5AI£...PAPA EÔT
un type &anal ,mai£ ce
n'e^t peut-être que
PB LA COMéD\& i
P6UT-ETGE QUAPÛEfc
NOU& AVOIR COUCWÉ6,
PARA ENFILE UN CO&TUMe
e»J2Acne et rapt com -
&ATTOE l£ CfclMg. PEUT-
ETRE QUE SON RÔLE DE
" RAPA" E3TJU6TE UNE
lD6NTlTé 6ECflëTE ?
peuT-ÉTce Que tewAice
L'APPELLE SUP UNe U6NE
eeccère qoànp la ville
e^T 6N DAUGta » PEOT-
éTce que c eer un euPEft
[ Wé£0& MA9Qué.' ^
FI
ei c'était
VPAl, IL
CONDUIRAIT UNE
v/oiToPePUi&y
i J££>A!€>.
UNÔTCe
/ N'A MEME
PAC» DE
£ADIO-
LCA&eETT6-
1 !
Ljî/
CALVIN AND HOBBES © 1991 Waterson. Reprinted with permission of Universal Press Syndicate. Ail riglits reserved.
© 1993 Hors Collection/Presses de la Cité pour l'édition française.
Figure 7.4 Connais-tu le type de papa ?...
La représentation en termes de types nous permet de formuler un cadre
général pour analyser ce type de jeux.
iDéfînition 7.1 ^
Un jeu bayésien statique en forme normale est décrit par les éléments
suivants :
- Un ensemble de n joueurs : / = {1, 2,..., n}.
- Pour chaque joueur /, / e I,
- un ensemble d'action A,-, qui contient toutes les actions possibles de ce
joueur et un ensemble 7} qui contient les différents types possibles de ce
joueur, ax e A,- est une action particulière du joueur / et t; e Tj est un
type du joueur /. Soit T = X Tt l'ensemble des types des joueurs et
/e/
t e T, un profil de types.
Jeux simultanés avec information incomplète • 127
myy- une fonction de gain (VNM), uh qui représente les préférences du joueur!
r^ / et qui donne la valeur pour le joueur / de chaque résultat du jeu étant -
u-t\ [X Ai ) XT
(aua2,.. ■, an ; tu t2l..., t„) f-> w,(a ; t). (7.1) "|
^ - une distribution de probabilités p-x qui donne ses croyances quant aux^
types des autres joueurs ,jj
Pi- r-^[o,i] j
(*1, '2,..., *„)»-► Piit-Mi). i
qui résulte de la règle de Bayes quand elle peut être appliquée après la
révélation de son type au joueur /
Mt-i\ti) = —— = -= (7.2) |
Le dernier élément de cette définition donne son nom à ce type de jeux.
S V tKBl Sections 3.6.2 et 10.5.
Les stratégies d'un joueur dans ce jeu doivent être construites à partir de
l'ensemble des actions du joueur et de son ensemble de types :
j Définition 7.2
Une stratégie du joueur / n'est pas directement donnée dans la définition
du jeu mais elle est définie de manière à préciser une action pour chaque type
tj e T{ à partir de l'ensemble des actions A,- :
s-, : T, -> A-,
^;:^;.r'-1'.-..,-1V:':.!..---ir ':- V, .■-<■■■■ • • * ^ ■*''(''") = ai\: ■ - ' . :■ -:;-. .-'-'
On parle alors de stratégie séparatrice quand chaque type choisit une
action différente et de stratégie mélangeante (pooling strategy) quand tous les
types du joueur choisissent la même action. Cette distinction jouera surtout
un rôle quand nous allons considérer les jeux dynamiques. Cette définition
des stratégies peut paraître assez lourde et, en quelques sorte, superflue dans la
mesure où elle demande la précision d'une action pour chaque type du joueur i.
Or, une fois que la Nature a choisi le type de chaque joueur, avons-nous besoin
de préciser ce que vont faire les autres types ? L'optimalité des choix du type r,
R
128 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
La règle de Bayes et le théorème du même nom, se basent sur les^
propriétés des distributions de probabilités conditionnelles. En effet, la
probabilité conditionnelle de l'événement 9 sachant que l'événement x s'est
déjà produit se note par /?[0|.x:]. Si p[9,x] est la probabilité que l'événement
9 et F événement x se produisent et p[9] et p[x] sont les probabilités a priori
des événements 9 et.*, cette probabilité conditionnelle se définit de la manière
gsuivante :
P[e\x] = ^^.
p[x] .
Imaginons maintenant qu'un joueur doit prendre une décision qui dépend
d'une variable aléatoire 9 e £2 et qu'il a la possibilité d'observer un
événement x auquel est lié 9. Soit/(#) la fonction de densité a priori de 9
pour ce joueur. S'il connaît la distribution conditionnelle /?[.*" !#] pour tout
9 avec/(jr|0) la fonction de densité correspondante, après avoir observé une
réalisation x, le joueur peut en déduire la distribution de probabilité a
^posteriori induite par cette observation en utilisant le Théorème de Bayes
/(9w-57ôww (7'3)
si nous avons des distributions discrètes. Le résultat (7.3) correspond à la
règle de Bayes (voir Cyert & DeGroot (1987) pour d'autres applications de
l'approche bayésienne en économie).
dépend de ce que les autres joueurs vont faire et ce que les autres joueurs vont
faire dépend de ce que le joueur i aurait fait s'il avait un autre type. Dans le
duopole de Cournot la firme 1 tient compte des quantités possibles des deux types
de la firme 2 et cela conditionne le choix optimal de chaque type à l'équilibre.
L'utilisation de la règle de Bayes dans la définition du jeu (condition (7.2))
implique que la distribution de probabilités a priori, p(t)> utilisée pour
représenter l'incertitude concernant le choix de la Nature, soit connaissance
commune pour les joueurs. Si les joueurs ne partagent pas cette connaissance
commune, leurs croyances sont quelconques et, par conséquent, leurs
comportements ne peuvent être anticipés par les autres joueurs. C'est uniquement sous
cette condition que nous pouvons résoudre ce type de jeu et prédire leur
conséquence.
L'optimalité des choix de chaque joueur dépend dans ce jeu de ses actions,
mais aussi de son type et de ses croyances quant au type des autres joueurs étant
donné que ce type va conditionner leurs choix. L'équilibre de Nash de ce jeu
peut maintenant être défini de manière habituelle : la stratégie d'équilibre de
chaque joueur doit être sa meilleure réponse aux stratégies d'équilibres des
autres joueurs et cela pour tous les types, et étant données les croyances.
Jeux simultanés avec information incomplète • 129
* Définition 7.3
L'équilibre de Nash en stratégies pures d'un jeu statique bayésien est^
un profil de stratégies s* = (s*,.. .s*) si s*(t,) est la solution du problème
suivant pour chaque joueur / et pour chacun des types ts e Ts de ce joueur i
(Vî,Vff-g7}) :
max Y] Ui(s*(fx)9... ,*;_,(//_,), a,, ^fo+i),..., <(i„) ; t) x M'-/k/)
.-.•^ss^^v.-^s- afcJtit"4fe«Ui^iSJ t; -^»-^ - -... ■ i -. — *\ t.,
Donc la stratégie d'équilibre du joueur i maximise son utilité espérée pour
chacun de ses types. Par conséquent, quel que soit son type, le joueur / n'aura
pas intérêt à dévier de sa stratégie d'équilibre si les autres joueurs continuent à
jouer leur stratégie d'équilibre quel que soit leur type. Il s'agit bien d'un
équilibre de Nash construit de manière à couvrir toutes les combinaisons des types
de joueurs.
Cette approche devient vraiment intéressante quand on s'intéresse aux jeux
dynamiques.
►*
ercices
Exercice 7.1
Considérez un jeu simultané dans lequel les ensembles de stratégies des deux joueurs
sont donnés par Si = {—2, 0, 1). La fonction d'utilité du joueur 1 est connue avec
certitude par les deux joueurs et elle est donnée par u\ (s) = s\. Mais le joueur 1 ne connaît
pas exactement celle du joueur 2 qui peut être de deux types u^is) = s\s2 ou
u%(s) = (sis2)2 avec
P[A] = l- = 1 - P[B]
L'information est asymétrique dans la mesure où le joueur 2 connaît bien sûr sa fonction
d'utilité. Tous ces éléments sont par ailleurs connaissance commune.
1. Donnez les types des deux joueurs.
2. Donnez la forme normale du jeu correspondant à chacun des types du joueur 2.
Déterminez les équilibres de Nash dans ces jeux.
3. Donnez l'arbre du jeu après avoir complété l'information avec la méthode de
Harsanyi.
4. Représentez ce jeu complet en forme normale.
5. Déterminez les fonctions des meilleures réponses du joueur 1 et des deux types du
joueur 2.
6. Déterminez l'équilibre de Nash bayésien de ce jeu.
130 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Solution
L'information est asymétrique dans la mesure où le joueur 2 connaît sa fonction
d'utilité. Tous ces éléments sont par ailleurs connaissance commune.
1. Les types des deux joueurs sont respectivement T\ = {t\} et T2 = {A,B}.
2. Les formes normales des deux jeux peuvent être représentées dans un tableau
Tableau 7.1 Jeu avec le type A.
-2
Joueur 1 o
1
Joueur 2
-2 0 1
(4,4) (4,0) (4,-2)
(0,0) (0,0) (0,0)
(1,-2) (1,0) (1,1)
Tableau 7.2 Jeu avec le type B.
-2
Joueur 1 o
1
Joueur 2
-2 0 1
(4,16) (4,0) (4,4)
(0,0) (0,0) (0,0)
(1,4) (1,0) (1,1)
Quel que soit le jeu, les deux dernières stratégies (0 et 1) du joueur 1 sont dominées
par sa première stratégie : -2. Dans les jeux réduits, la meilleure réponse du joueur 2
à cette stratégie est -2 dans le jeu A et dans le jeu B. Donc les équilibres de Nash sont
(-2, -2) dans le jeu A et (-2, -2), dans le jeu B.
3. L'arbre du jeu représente le choix de la Nature et le fait que ce choix n'est observé que
par la firme 2 (figure 6.5).
4. Le joueur 1 a un seul ensemble d'information tandis que le joueur 2 en possède deux.
La forme normale de ce jeu représente cette situation :
"2
Joueur1 0
1
Joueur 2
Type A
-2 0 1
(4,4) (4,0) (4,-2)
(0,0) (0,0) (0,0)
(1,-2) (1,0) (1,1)
Typefl
-2 0 1
(4,16) (4,0) (4,4)
(0,0) (0,0) (0,0)
(1,4) (1,0) (1,1)
Jeux simultanés avec information incomplète • 131
-2
/ ■
L
\°
V
Joueur 1
-2,
/
/.
V
V
c^~.
\J—,
-2
-2
\L-L
: -2
SjLI
-2
-2
(ui,u2)
(4,16)
(0,0)
(1,4)
(4,0)
(0,0)
(1,0)
(4,4)
(0,0)
(1,1)
(4,4)
(0,0)
(1,-2)
(4,0)
(0,0)
(1,0)
(4,-2)
(0,0)
(1,1)
Figure 7.5
5. La meilleure réponse du joueur 1 est - 2 quelque soit la stratégie du joueur 2 (c'est
une stratégie dominante).
La fonction de meilleure réponse du type A du joueur 2 est
f -2 si s, = -2
s2*(s,)= I {-2,0,1} si «i=0
Il si Si = 1
La fonction de meilleure réponse du type B du joueur 2 est
si s\ — —2
s2*(s,) =
r-2
{-2,0,1} si sx =0
—2 si si = 1
6. L'équilibre de Nash bayésien de ce jeu est donc un triplet (■s*,(^,Sfl)) =
(-2, (-2,-2)). V V "
Note : Cet exercice est un peu particulier dans la mesure où le choix optimal du joueur
moins informé ne dépend pas du type de son adversaire et donc on n'a pas besoin de
considérer la maximisation de l'utilité espérée pour lui.
132 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Exercice 7.2
Reconsidérez le duopole de Cournot de l'application mais avec une incertitude initiale
sur la demande. La fonction de demande sur le marché peut être de deux niveaux selon
la conjoncture : A e {AFi AE], AF < AE avec P[AF] = a = 1 — P[AE]. Les fonctions
de coûts des deux firmes sont symétriques : C,(#,) = cqitc < AF. L'information est
asymétrique dans la mesure où la firme 1 connaît parfaitement le niveau de la demande
tandis que la firme 2 ne possède que les croyances a priori données ci-dessus. Tous ces
éléments sont connaissance commune.
1. Définissez les ensembles de types des joueurs.
2. Définissez les stratégies des joueurs.
3. Définissez l'équilibre de Nash bayésien pour ce jeu.
4. Déterminez cet équilibre.
Solution
1. Les ensembles de types des joueurs : T\ = {AFl AE], T2 = {/}. Ce qui est nouveau ici
est le fait que le profit de la firme 2 dépend maintenant du type de son concurrent :
7t2(g\, qi ; '0 = Ci - q\ - qi - c)q2.
Ce qui est incertain. La firme 2 doit donc maximiser son profit espéré (elle est neutre
au risque)
E [n2(qu q2)] = a(AF -qx-q2- c)q2
+(1 - a)(AE -q\-q2- c)q2
2. Les stratégies des joueurs doivent maintenant préciser une action pour chaque
combinaison des types des joueurs
sx(AF) = qlF, Sx(AE) = qf, s2(t2) = q2.
3. L'équilibre de Nash bayésien de ce jeu doit correspondre à des stratégies qui maximise
le profit espéré de chaque firme pour chacun de ses types : (.s*(A/r),1s*(A£),.S2('2))
tel que
s*(af) = argmax {AF - q{ - s^(t2) - cjqx (/)
s*(AE) = argmax ( AE - qx - s^(t2) - c)qi (II)
s*(t2) = argmax \a[AF - s^(AF) - q2 - cjq2
+(1 - a)[AE - sï(AE) -q2- c)q2] (III)
Les conditions (/) et (II) assurent qu'aucun des types de la firme 1 n'a intérêt à
changer de stratégie. La condition (III) assure que la firme 2 n'a pas intérêt à changer
de stratégie. L'équilibre est constitué par l'intersection des solutions de ces trois
problèmes.
Jeux simultanés avec information incomplète • 133
4. Pour déterminer l'équilibre on doit chercher l'intersection des fonctions de meilleures
réponses. Avec :
E[A] = aAF + (l-a)AE
E[sï] = asï(AF) + (l-a)si(AE)
La meilleure réponse de la firme 2 est donnée par :
aE[jr2(tf,fc)] _
E[A]-2q2-E[Sl]-c = 0
E[A]-E[Sl]-c
tâ (s\) = 2 (/V)
Les meilleures réponses des deux types de la firme 1 sont données par :
dnAqXiq2\ tx)
—^ -=o
dqi
tl-q2-2s;(tl)-c = 0
*{ .\ h-qi-c
*r(*;*i) = —2—
q*M2,AF)=AF~q22-C (V)
4te;AE)=AE-*-c (vi)
L'équilibre (q*(Ap),q*(AE),q2f sera donné par l'intersection des conditions (IV),
(V) et (Vf). En substituant (V) et (VI) dans (IV), nous pouvons déterminer q\ :
E[A]
_^AL-^-1 + {x_a)A£-^-1yi
H2 2
g[A]- 2 -c £[A] + g._c
92 _ 2 _ 4
=>«î = ^ cm
En substituant (V7/) dans (V) et (V7), on obtient respectivement q*(AF) et 9*(/4£) :
£[A]-c
.,. , Af~ 3 ~C 3AF-E[A]-2c
qî(AF) = ^ =
. £[A]-c
... , Ae~ 3 ~C 3A£-£[A]-2c
«fG^c) = 7T = 2
134 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Si A était connu dès le début, on aurait eu les quantités de Cournot correspondant à
A-c
Or nos pouvons écrire les quantités q*(AF) et q\(AE) de manière à pouvoir les
comparer aux quantités obtenues avec les deux valeurs de A dans le cas avec certitude :
car (AF — A/r) < 0 et 1 — a > 0 ;
*iA ^ \ae~^ , (Ae ~ AF)
qx{AE) = —-— +a > q;\A=AE
Donc, dans le cas avec information asymétrique, la firme 1 produit plus que sa
quantité de Cournot en certitude quand A = AE et moins que cette quantité quand A = AF.
Cela provient du fait que les quantités de la firme 2 ne peuvent s'ajuster pleinement à
la demande quand elle ignore cette demande (ses quantités sont basées sur E[A], au
lieu de AF ou AE) :
AF-c ^ AE-c
—r— <<Ï2 < —;— •
Jeux simultanés avec information incomplète • 135
■ Jeux séquentiels
avec information
incomplète
ans les jeux dynamiques avec information incomplète, on
complète l'information exactement de la même manière que pour les
jeux statiques, en introduisant un coup initial par le joueur
fictif « Nature ». Dans un jeu séquentiel, les choix d'un joueur informé de
son type pourraient être observés par les autres joueurs qui jouent après
lui et ces choix pourraient alors les informer sur le type choisi par la Nature
pour ce joueur. Mais chaque joueur est conscient de cette possibilité et
cherchera a en tirer parti en influençant les croyances des autres joueurs :
il pourra alors émettre un signal grâce à ces choix.
Avant d'aller plus loin dans l'analyse de ce contexte riche en interactions,
nous pouvons déjà remarquer que la présence de l'information
incomplète implique une diminution de la pertinence du concept d'EPSJ.
Concepts clés étudiés: Ce chapitre est consacré à l'analyse des jeux
dynamiques en information incomplète :
•};;&* - l'insuffisance de l'équilibre parfait en sous-jeux ;
,^y - la rationalité séquentielle ;
;.,.^ - l'équilibre bayésien parfait ;
- les équilibres séparateurs et mélangeants.
CALVIN AND HOBBES ©1990 Waterson.Reprinted with permission of Universal Press Syndicate. Ail rights reserved.
©1992 Presses de la Cité pour l'édition française.
Figure 8.1 Attention au signal...
D
Jeux séquentiels avec information incomplète • 137
I. La perfection en sous-jeux
devient insuffisante
La perfection en sous-jeux est une propriété désirable des solutions des jeux
en information incomplète, mais l'imperfection de l'information de certains
joueurs implique que quand c'est leur tour de jouer, ils ne sauront pas
nécessairement dans quel sous-jeu ils se trouvent. Pour observer cela reconsidérons
le Jeu de l'Entrée I (figure 8.2).
Figure 8.2 Le jeu de Ventrée I (reprise).
L'EPSJ de ce jeu est bien sûr (Entrer, Coopérer) tandis que les équilibres de
Nash sont
(Entrer, Coopérer) et (Non, Combattre).
L'EPSJ élimine donc la menace non-crédible de Combattre face à l'entrée.
Exemple 8.1 (Le Jeu de l'Entrée IV)
Imaginons maintenant que deux types d'entrant puissent se présenter
devant ce marché : un entrant avec des coûts de production faibles (B)
et donc relativement agressif, et un entrant avec des coûts élevés (H).
La firme installée ne connaît pas le type de l'entrant auquel elle est
confrontée. Elle a les croyances suivantes: pB = 0.5 et pH =0.5.
L'entrant connaît bien sûr ses coûts, donc son type, ainsi que les croyances
a priori de la firme installée. Nous représentons l'arbre modifié de ce jeu
en information incomplète dans la figure 8.3, page ci-contre.
Le concept d'EPSJ n'apporte rien dans ce jeu car le seul sous-jeu est
le jeu en entier. Cela provient du fait que les nœuds I\ et I2 de la firme
installée appartiennent au même ensemble d'information car, n'ayant pas
observé le type de l'entrant, elle ne peut distinguer ces deux nœuds.
138 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
B E1(
—5 *"
N-
L0.5
Non
H E2
Non
Coopérer^ (40,50)
II
Entrer J Combattre^* (- 10,0)
h:
►(0,300)
Coopérer ., (40,50)
Entrer / Combattre^ (-10, II/)
-(0,300)
Figure 8.3 Le jeu de l'entrée IV
Nous paramétrisons par Y\t les gains de I dans le résultat
(H, Entrer, Combattre) pour pouvoir étudier différentes situations du
point de vue de l'asymétrie qui existe entre les deux types de l'entrant
quand on le combat (il est a priori plus intéressant de combattre un entrant
faible, donc avec des coûts élevés (H)). Si n7 = 1 alors l'information
n'est en définitive pas fortement asymétrique. Les deux firmes savent que,
face à l'entrée, I n'a pas intérêt à combattre. Ce que I ne sait pas c'est
son gain exact (1 ou 0). Mais ici nous ne pouvons utiliser l'EPSJ pour
éliminer les menaces non-crédibles. Par conséquent (Non, Combattre)
reste un équilibre (de Nash). Si Von veut éliminer les menaces non-
crédibles, nous devons affiner le concept d'équilibre.
Pour comprendre le problème posé par l'EPSJ, reconsidérons le jeu de
l'entrée II dans lequel l'EPSJ nous a permis d'éliminer l'équilibre de Nash
((Af,P),A) tout en laissant l'équilibre de Nash ((N,N),A) où, malgré
l'absence de l'entrée, la firme installée augmente sa capacité (figure 8.4, page
suivante).
Cela est dû au fait que l'entrant ne peut distinguer les nœuds composant Ex
et lafirme installée ne peut compter sur le fait que chacune de ses décisions sera
suivie par une réaction optimale de l'entrant : Augmenter —> Non et
Non —> Produire. Nous pouvons nous approcher de l'idée de l'EPSJ dans ce
cadre : nous pouvons demander à l'entrant de choisir une stratégie optimale
dans son ensemble d'information Eu étant données ses croyances concernant
l'histoire du jeu. S'il pense qu'il y a une probabilité a pour que l'action choisie
par la firme installée soit Augmenter, alors il choisira l'action qui maximise
Jeux séquentiels avec information incomplète • 139
Augmenter
Installer
capacité^-
E0^
Non\
capacité ,
Non
* (0,100)
E,
r.
Non
Produire
\ ,
Non
Produire (»k,ui)
(-50,40)
^ (-10,120)
(50,60)
(- 10,100)
Figure 8.4 Le jeu de l'entrée II (reprise).
son utilité espérée dans Ex
E[u(Pwduire)] = a(-50 + (1 - a)50 = (1 - 2a)50
E[u(Non)] = a(-10) + (1 - a)(-10) = -10
1
E[u(Produire)] ^ E[u(Non)]
3
a ^ -
(1 - 2a) ^
Si a ^ -, connaissant ces croyances et anticipant la décision de produire de
l'entrant, la firme installée choisira alors d'éviter de payer le coût de la capacité
supplémentaire et le seul équilibre qui reste est ((Installer, Produire), Non) où
l'entrée a lieu.
L'introduction des croyances dans ce contexte permet alors de compenser
l'insuffisance de l'EPSJ dans la prédiction du résultat du jeu. Un équilibre
correspond alors à la précision du profil de stratégies d'équilibre, accompagné
d'un profil de croyances (une distribution par ensemble d'information) qui
justifie l'optimalité de ce profil de stratégie.
On peut alors reprendre l'idée de base de l'EPSJ qui impose que la stratégie
de chaque joueur soit optimale étant donné le déroulement du jeu avant que ça
soit son tour de jouer. On utilise alors le concept de rationalité séquentielle :
pour chaque ensemble d'information de chaque joueur /, la stratégie
(comportementale) du joueur i doit être sa meilleure réponse aux stratégies des autres
joueurs, étant données les croyances du joueur i à cet ensemble d'information.
Le concept d'équilibre bayésien parfait se base sur cette idée.
140 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
II. Equilibre bayésien parfait
Reconsidérons le jeu de l'entrée IV. Lafîrme installée ne connaît pas le type
de l'entrant potentiel mais elle observe bien son choix quant à l'entrée. Ne
pourrait-elle pas chercher à en inférer le type de son concurrent ? Elle a ses
croyances a priori quant au type de l'entrant. Elle pourrait alors chercher à
calculer les probabilités :
P(N = B/Entrer) et P(N = B/Non)
après avoir observé une entrée ou une absence d'entrée. Mais alors l'entrant
potentiel essayera de manipuler ces croyances expost étant donné qu'il connaît,
par hypothèse, les croyances a priori de lafîrme installée et le fait que ce
dernier observe son choix en vue d'en tirer une information. Donc il n'y a pas
de solution simple à ce problème.
Kreps &Wilson (1982) cherchent à résoudre ce problème. Ils partent des
probabilités a priori communes à tous les joueurs, quant au choix de la Nature
au début du jeu. Certains joueurs observent le choix de la Nature et ils
actualisent en conséquence leurs croyances tandis que d'autres ne peuvent
se baser que sur les choix des autres joueurs (les joueurs informés) pour
actualiser leurs croyances. Cette actualisation est basée sur l'hypothèse que
les joueurs jouent des stratégies optimales et, plus spécifiquement,que leurs
stratégies d'équilibre sont conditionnées par leurs croyances. Mais comme
l'équilibre lui-même dépend maintenant des croyances, on ne peut plus le
définir uniquement en termes de stratégies. Avec une information asymétrique,
l'équilibre doit préciser à la fois les stratégies qui sont optimales, étant données
les croyances et les croyances qui sont rationnelles, étant données les stratégies
optimales. Donc pour définir l'équilibre nous devons spécifier une combinaison
de stratégies et de croyances. Combinaison que Kreps & Wilson appellent une
évaluation. En fait, mathématiquement, l'équilibre est maintenant un point fixe
dans l'espace des évaluations et non dans l'espace des stratégies.
Après une observation,une manière assez habituelle en économie
d'actualiser ses croyances est la règle de Bayes. Mais cela ne peut s'appliquer que pour
les actions qui sont sur le chemin d'équilibre et donc qui ont une probabilité
non-nulle d'être observées à l'équilibre. En dehors du chemin d'équilibre, la
règle de Bayes ne peut être utilisée par les joueurs.
Imaginons qu'à l'équilibre l'entrant entre toujours. Alors si la firme installée
observe que l'entrée n'a pas eu lieu, que doit-elle en conclure quant à la
probabilité suivante ?
P(Non/H) • P(H)
P(H/Non) = ' J
P(Non)
Jeux séquentiels avec information incomplète • 141
puisque P[Non] = 0 à l'équilibre et la règle de Bayes ne peut être utilisée pour
définir cette probabilité ?
Une manière naturelle de définir l'équilibre est alors de considérer une
combinaison de stratégies qui est la meilleure réponse dans la mesure où les
croyances d'équilibre suivent la règle de Bayes sur le chemin d'équilibre et ne
contredisent pas cette règle en dehors de l'équilibre.
^Définition 8.1 —— :-■/...-----. -w,:,.^
[■..■■ Un Equilibre Bayésien Parfait (EBP) est une combinaison de stratégies':1
l et un ensemble de croyances jx* tels qu'à chaque nœud du jeu
; 1. Les stratégies dans le reste du jeu sont des meilleures réponses aux strate
*''; gies spécifiées par l'équilibre et étant données les croyances d'équilibre ;
ff 2. Les croyances à chaque nœud sont rationnelles, étant données les |
^. connaissances fournies par le jeu jusqu'à ce point : elles sont actualisées,/
selon la règle de Bayes quand cela est possible, à partir des croyances a
yc priori et des actions observées des autres joueurs, sous l'hypothèse qu'ils \
fe>jouent leur stratégie d'équilibre. . .. ; , • •
La première condition correspond à la rationalité séquentielle. La seconde
condition impose la cohérence des croyances avec les stratégies. La règle
de Bayes doit être appliquée en accord avec les actions précisées dans les
stratégies d'équilibre, en tenant compte du fait que,pour chacun des nœuds
contenus dans un ensemble d'information, la probabilité d'être atteint dépend
des stratégies d'équilibre des joueurs qui jouent avant ce nœud.
■ > Remarque 8.1
Si les stratégies sont complètement mixtes alors la règle de Bayes peut
toujours s'appliquer.
■ > Remarque 8.2
Le concept d'EBP étend donc le concept d'EPSJ aux jeux avec
information incomplète. En cela, la condition (1) assure que tout EBP est aussi un
EPSJ, étant donné le système de croyances qui le compose.
Application : retour au jeu de l'entrée
Si nous considérons uniquement les stratégies pures, nous avons uniquement
deux types d'équilibres possibles du point de vue des croyances :
-Les équilibres séparateurs où la stratégie d'équilibre de l'entrant révèle
parfaitement son type (c'est une stratégie révélatrice).
142 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
- Les équilibres mélangeants où la stratégie d'équilibre de l'entrant n'apprend
rien de plus que les croyances a priori à la firme installée (c'est une stratégie
mélangeante).
Donc si on a un équilibre séparateur, en observant la stratégie d'équilibre de
l'entrant sE> la firme installée doit pouvoir en déduire son type avec certitude.
Nous devons avoir dans ce cas
H*{B/sE) = 1 ou n*(H/sl) = 1 (8.1)
et /jL*(B/s)(Vs =£ s*e) est quelconque tout en respectant l'équilibre (sE,s*).
Dans les équilibres mélangeants, l'observation de s*E n'apprend rien à
l'installée et si on a la distribution de probabilités a priori
P(B) = a = 1 - P(H)y
cela va impliquer les probabilités a posteriori
H'(B/sl)=a=l-n*(H/sl) (8.2)
Si nous n'excluons pas les stratégies mixtes,nous pouvons aussi avoir des
équilibres serai-séparateurs où la firme installée actualise ses croyances sans
que cela corresponde à une révélation parfaite.
Dans le dernier jeu de l'entrée, tant que n7 reste inférieur à 50, nous ne
pouvons avoir un équilibre où l'entrant choisira de rester en dehors de l'industrie
et cela, qu'il soit faible (//), ou fort (B). La stratégie d'équilibre de l'entrant
sera donc s*E = ((Entrer/H).{Entrer/B)). Cette stratégie n'apprendra rien
à la firme installée (puisque sE ne peut séparer les deux types d'entrants). Les
croyances d'équilibre de la firme installée seront donc
p,*(B/sE) = Q.5 = ii*(H/sE)
Les gains espérés correspondant aux deux stratégies, avec ces croyances,
sont alors donnés par
EU (Coopérer) = 0.5 x 50 + 0.5 x 50 = 50
EU (Combattre) = 0.5 x 0 + 0.5 x n7 = -y-
EU (Coopérer) > EU (Combattre) <£> n7 < 100.
Donc si n7 < 100, s* = Coopérer.
Il nous reste à définir les croyances hors-équilibre : Que doit penser la firme
installée, si elle observe que l'entrant potentiel choisit de rester en dehors de
l'industrie ? Nous ne pouvons utiliser la règle de Bayes puisque
fji*(s) = 0 si s ^ sE =» ii* {Non) = 0
Les croyances hors-équilibre ne sont donc pas vraiment contraintes. Tout
système de croyances qui n'oblige pas les joueurs à dévier de la stratégie
Jeux séquentiels avec information incomplète • 143
d'équilibre est compatible avec cet équilibre et
fji*(B/Non)=0A
est une possibilité.
Mais il n'est pas très important de bien spécifier les croyances hors-équilibre
dans cet exemple très simple. En effet, si l'entrant choisit de dévier et donc de
rester en dehors de l'industrie, le jeu s'arrête et la manière dont / actualise ses
croyances n'a pas d'importance. Ce n'est bien sûr pas le cas de tous les jeux en
information incomplète. En déviant, le joueur peut donner une information et
chercher à manipuler la suite du jeu.
Comme notre exemple très simple le montre, trouver des EBP n'est pas...
simple. On ne peut utiliser des algorithmes simples, notamment du fait de
l'indétermination concernant les croyances hors-équilibre. Pour chercher un
EBP, on commence par les actions qui ne font partie d'aucun équilibre et on
spécifie les croyances qui seront utilisées pour interpréter ces actions. On teste
alors si la stratégie de chaque joueur est optimale étant données ses croyances à
chacun des nœuds ou, au contraire, s'il ne désire pas choisir une action hors-
équilibre et déclencher les croyances et les stratégies hors-équilibre des autres
joueurs.
■Exercices
I Exercice 8.1 (Adapté de Umbhauer (1989))
I Nous reprenons le problème de la qualité des biens fournis par un producteur. Prenons
I une version très simple de ce problème. Le monopole produit un bien qui peut être de
I deux qualités : 6\ et 62 avec 1 < 6\ < 62 < 2. 6\ désigne donc la qualité inférieure et 62
I correspond à la qualité supérieure. Dans une première étape, le monopole fixe un prix
I pour son produit dont la qualité est une donnée pour lui. Le consommateur prend
I connaissance du prix et, dans une seconde étape, il demande une certaine quantité de bien
I en fonction de la qualité proposée. La firme maximise son profit
I mO,p,q) = (p-c(0))q
I Le consommateur maximise sa fonction d'utilité
I Q2
I Uie,piq)=eq-^-pq
I où c(6) représente le coût de production unitaire d'un bien de qualité 6 avec
I 0<c(<9,) <c(62) < l,0<c' < 1.
144 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
1. Calculer les EPSJ du jeu quand le consommateur connaît à l'avance la qualité du bien
qu'il achète (le cas en information complète). Dessiner d'abord l'arbre du jeu.
2. Le consommateur n'observe pas la qualité du bien au moment de son achat. Il a
néanmoins les croyances a priori (connues par le monopole)
P(6 = 6i) = p= \- P(6=e2)
1
Supposez p = -. Dessinez l'arbre du jeu et donner la définition générale des EBP de
ce jeu.
3. Sous la condition suivante
(p*(0,) - c(0,)) • q*(p*m) > (p*(0j) - c(ft)) • q*(p*(0j)) ,/#./ = 1,2 (7.3)
(a) Expliquez la condition (7.3).
(b) Déterminez les EBP séparateurs de ce jeu.
(c) Déterminez les EBP mélangeants de ce jeu.
Solution
L'information incomplète est due au fait que laftrme connaît la qualité de son bien tandis
que le consommateur l'ignore. À partir du prix proposé par le monopole, le consommateur
va chercher à déduire la qualité du bien. Le prix va alors jouer un rôle de signal. Le
monopole est bien sûr conscient de cela et il choisira son prix en conséquence.
1. Dans ce premier cas la qualité est connue par les deux joueurs. L'arbre du jeu est très
simple et il est donné dans la figure 8.5.
Figure 8.5 Jeu de la qualité en information complète.
Etant donné 0, la firme propose un prix en vue de maximiser son profit et le
consommateur choisît une quantité qui maximise son utilité étant donnés 6 et le prix proposé.
Pour calculer l'EPSJ, nous commençons par le dernier choix,c'est-à-dire, par celui
du consommateur :
^2
max 6q — —— pq
<i 2
q\e-P) = e-p
En anticipant ce choix optimal du consommateur, la firme cherche le prix qui maximise
son profit
n(0; p, q*(6; p)) = (p - c{6)){6 - p)
/ \ 0 + c(6)
max n(0; p, q*(6 ; p)) =» p*(0) = ^^
Jeux séquentiels avec information incomplète • 145
L'équilibre correspond alors à
P*(0) =
e + cm
q'(0;p*(0))=q*(0) =
e - c(6)
n*(j9) = n(0;p*(0),q*(0)) =
(0 - c(6))2
Sous les hypothèses posées au début de cet exercice, nous observons
dq*/d6 > 0, dp*/d6 > 0, dW/dO > 0
quand la qualité est plus élevée, la firme propose un prix plus élevé mais la demande
du consommateur est néanmoins plus élevée aussi. En conséquence, le profit de la
firme est croissant avec la qualité. La relation qui existe entre le prix optimal de la
firme et la qualité peut être exploitée par le consommateur pour apprendre la qualité
du bien quand il existe une incertitude sur cette qualité.
2. Nous sommes dans un cas avec information incomplète (pour le consommateur). Nous
utilisons la démarche de Harsanyi pour compléter l'information. L'arbre du jeu avec
information complète mais imparfaite est donné dans la figure 8.6.
(Jt(di\p,q),u(0\\p,q))
(n(e2\P,q),u(02\P,q))
Figure 8.6 Jeu de la qualité en information complétée.
Un EBP de ce jeu peut-être défini de la manière qui a été exposée dans ce chapitre :
Définition 8.2. Un EBP de ce jeu sera donné par un couple de stratégies (/?*(•),#*(•))
et une famille de distributions de probabilités a posteriori \x* (•/•) tels que :
1. V0 G {#i,02}> p*(0)est la solution de max(p — c(6))q*(p) (maximisation du
p
profit de la firme) ;
2.Vp e P (l'ensemble des prix possibles), q*(p) est la solution de
max5Z/=i q0j/jL*(6j/p) — -q2 — pq (maximisation de l'utilité espérée du
consommateur) ;
146 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Vp g P* (le support des prix d'équilibres p*(-)), M*(7p) est déduite de la
distribution a priori P(6) par la règle de Bayes et la connaissance de p*(-) ; pour tout
p £ P*, le choix de m*(7p) est arbitraire.
Note : Seule la dernière condition mérite une explication. P* contient tous les prix
qu'on peut observer dans les équilibres de ce jeu. /x*(-/p) donne les probabilités a
posteriori des différentes qualités 6 après avoir observé un prix d'équilibre joué par
la firme (et donc après l'observation d'un signal d'équilibre). Si la firme choisit un prix
quelconque, on ne peut rien apprendre sur 6 en ayant observé un tel prix et donc p,*
est quelconque.
3.aLa condition (8.3) correspond à la situtaion où aucun type n'a intérêt à imiter le
comportement d'équilibre de l'autre. Par conséquent, s'il le peut, chaque type préfère
appliquer son prix d'équilibre suivi de la demande correspondante, plutôt que le prix
d'équilibre du concurrent suivi de la demande qui en découle. En particulier, le
monopole avec la qualité faible ne sera pas tenté, dans ce cas, d'imiter le prix
d'équilibre de la qualité haute. Chaque type est incité à jouer sa propre stratégie
d'équilibre : on appelle ce type de condition une condition d'incitation.
3.b Dans un équilibre séparateur, chaque type de la firme utilise un prix qui révèle son
type (stratégies séparatrices). En fait, sous la condition (8.3), les deux types vont
pouvoir pratiquer leur prix de monopole en information complète correspondant. Les
croyances expost du consommateur, à cet équilibre vont correspondre à la révélation
parfaite
n*(oi\p*m) = un*(oj\p*m) = o, / #y = 1,2.
Pour tout autre prix (prix hors-équilibre, p ^ p*(6\) et p ^ p*(62)) les croyances
sont arbitraires. Il existe par conséquent une infinité d'EBP séparateurs. L'équilibre
de séparation suivant est soutenu par le fait que le consommateur attribue un tel prix
au type avec une qualité faible (6\ ).
Défînition 8.3. Un EBP séparateur de ce jeu sera donné par un couple de stratégies
(P* (•),#*(•)) et une famille de distributions de probabilités a posteriori /x*(-/0
tels que :
0; + c(6i)
1. Vft€{ft,ft},p*(ft)= ,^2V,;,Î = 1,2.
2. Vp G P* = {p*(0,), p*(02)}, q*(p) = 6, - p*(ft), / = 1,2.
Vp£ P\ 4* = max{O,0, -p}.
3. Vp g />*, M*(ftlp*(ft» = 1, H*(0j\p*(0i)) = 0, / # j = 1,2.
Vp i P\ n*(0xlp) = 1 et MWP) = 0.
Sous la condition (8.3) et les croyances d'équilibre,aucun des types n'a intérêt à
imiter la stratégie de l'autre et aucun ne peut gagner strictement plus en utilisant un
autre prix que son prix d'équilibre.
3.c Dans un équilibre mélangeant, les deux types doivent utiliser le même prix (stratégies
mélangeantes), sinon la consommateur pourrait en déduire la qualité du bien. Étant
donné que le consommateur n'apprend rien sur la qualité du bien avec un tel prix
d'équilibre, ses croyances a posteriori qui découlent de l'observation de ce prix
seront identiques à ces croyances a priori.
M*(ftl/>*) = l/2, î = l,2
Jeux séquentiels avec information incomplète • 147
Les croyances hors-équilibres sont à nouveau arbitraires et donc il existera une
infinité d'EBP mélangeant s'il existe un prix p* qui assure le mélange. L'EBP
mélangeant que nous allons considérer sera basé sur les croyances hors-équilibres
les plus défavorables pour le monopoleur, dans la mesure où tout prix différent de
p* sera attribué au type avec la qualité faible.
Définition 8.4. Un EBP mélangeant de ce jeu sera donné par un couple de stratégies
(/>*(•)»#*(•)) et une famille de distributions de probabilités a posteriori />t*(-/0
tels que :
LV0le{0ue2hp*m = P*,i = l,2.
2- q*(p*) = Ei M*(GI/>*)ft ~P\i = 1,2. Vp # p\ q*(p) = max{0, 0, - p).
3. M*(ft|p*) = 1/2, î = 1,2. Vp £ p\ VL*{6xlp) = 1 et n*(e2/p) = 0.
Il existe une infinité d'EBP mélangeant de ce type s'il existe un prix p* > 0 qui
vérifie à la fois
Q [P ){P ~ c(0i)) > 4
de sorte que la qualité faible n'a pas intérêt à dévier de p* et révéler son type et
q [p ){p -c(e2)j >
de sorte que le type à la qualité élevée n'a pas intérêt à dévier et laisser croire le
consommateur qu'il est de type faible (ce qui est plus facilement vérifié).
Exercice 8.2 (Milgrom & Roberts (1982)
simplifié par Tirole (1988))
Il s'agit d'un modèle à deux périodes et à deux firmes. À la première période, la firme 1 est
seule sur le marché et elle a une position de monopole. Elle choisit un prix de monopole
p pour cette période. Après avoir observé ce prix.Fentrant potentiel décide d'entrer ou
de rester en dehors du marché. S'il décide d'entrer il y a un duopole à la deuxième
période, sinon la firme 1 garde sa position de monopole. Quand l'entrant potentiel prend
sa décision d'entrée, il ignore les coûts de la firme installée. Cette dernière peut avoir
deux types de coûts : elle a des coûts faibles (cL) avec une probabilité x et elle a des coûts
élevés (cH) avec une probabilité (1 — jc) (avec cL < cH). Nous pouvons aisément montrer
qu'à la première période, si le monopoleur maximise le profit de court terme, nous
devons avoir p[n < p". Soit ce profit de court terme Ml(plnl)t avec M{(-) strictement
concave en son argument, pour t = L, H. À la seconde période, si l'entrant décide d'entrer
il y aura une concurrence en prix et cette concurrence est indépendante du prix de la
première période.
Nous supposerons de plus que l'entrée n'est vraiment intéressante pour la firme 2 que
si la firme installée a des coûts élevés. Si les profits de duopole des deux firmes sont
donnés par D\ et D'2i nous devons avoir : D£ > 0 > £>£. Par conséquent, en l'absence
d'information incomplète, la firme 2 ne serait entrée que sur le marché d'une firme de
type H. Soit 5, le facteur d'actualisation commun.
1. Discutez le rôle stratégique du prix de première période de la firme installée.
2. Donnez la forme extensive de ce jeu en précisant les gains et les ensembles
d'information des firmes.
• LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Définissez un équilibre bayésien parfait séparateur de ce jeu et les conditions qui le
soutiennent.
4. Même question pour les EBP mélangeants.
5. Quelles sont les conditions du blocage de l'entrée ?
Solution
1. La firme installée voudrait avoir une position de monopole à la seconde période
yM\ > DJ, t = L, H). Par conséquent,elle voudrait convaincre l'entrant potentiel
qu'elle a des coûts faibles. La seule manière de le faire est d'appliquer un prix de
monopole/?1 à la première période. Or comme l'entrant potentiel connaît ses
motivations, il ne va pas accepter cette information pour argent comptant. Pour résoudre ce
problème, nous devons utiliser le concept d'équilibre bayésien parfait.
La relation qui existe entre les coûts unitaires et le prix d'équilibre d'un monopole
(voir figure 8.7) est à la base de l'induction recherchée par l'entrant potentiel.
Figure 8.7 Maximisation du profit de court terme et le prix de monopole.
2. La forme extensive de ce jeu est représentée à la figure 8.8, page suivante.
3. Équilibres séparateurs
Les deux conditions nécessaires pour que l'équilibre révélateur correspondent à la
distinction des deux types par le prix d'équilibre : H ne doit pas pouvoir appliquer le
prix de L et vice-versa. De plus, les croyances hors équilibre adéquates doivent justifier
cet équilibre. Sous ces croyances,les conditions nécessaires sont aussi suffisantes :
les prix correspondants sont des prix d'équilibre.
Dans un équilibre révélateur, l'observation du prix d'équilibre de H va conduire à
l'entrée. Par conséquent à la première période H va maximiser son profit de court
terme en appliquant p%. Sinon, il aurait pu améliorer ses gains en appliquant ce prix.
Par conséquent son gain sera :
Ai?+ 8D?
(8.4)
Jeux séquentiels avec information incomplète • 149
Entrée
Nature
Firme 1
Firme 2
Entrée
iM"(p)+W," \ tM"(p)+SMA iML(p)+&M,L\ l^(p)^D^ \
Figure 8.8 Arbre du jeu.
Soit p[, le prix du type L. En appliquant ce prix le type à coûts élevés peut dissuader
l'entrée et il obtient alors :
M?(p\) + BM?
(8.5)
Par conséquent une première condition nécessaire pour ce type d'équilibre est donné
par:
M» - M» (p[) > 8 (M? - Df)
(8.6)
De même, le type L maximise son profit en appliquant un prix p\. À l'équilibre il
obtient
M\ (rf)+ 8M\
S'il dévie en appliquant son prix de monopole, le pire qu'il peut lui arriver est que à
ce prix l'entrée ne soit pas bloquée. Dans ce cas il gagne
M[ + 8D{
Par conséquent la condition nécessaire pour qu'il applique le prix p\ est :
M," - M," (p\) > 8 (M? - £>,") (8.7)
150 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Le prix p\ ne fait partie de l'équilibre que si les croyances a posteriori le soutiennent :
fi*(H/p«) = \9ii*(L/pfj = l (8.8)
sip t {rf, p[), H*(H/p) = 1, n*(L/p) = 0 (8.9)
pour tout prix hors-équilibre l'entrée est certaine.
Proposition 8.1. Sous les conditions (8.6) et (8.7), les croyances ai*(-/0 et le prix p*
forment un EBP parfaitement révélateur avec :
p*(H) = p% et p*(L) = p\.
Preuve : Cf. Tirole (1988), p.370. Il est aisé de vérifier qu'aucun type n'a intérêt à
dévier de son prix d'équilibre étant données les croyances a posteriori. Tirole montre
qu'il existe un continuum de prix d'équilibre p\. Remarquons au passage que si la
condition (5) n'est pas vérifiée pourpf = p^, c'est-à-dire si
M\ - M\(p\\ < s(M[ - D[\ (8.10)
alors la firme de type L doit appliquer un prix plus faible que son prix de monopole
pour empêcher l'autre type de l'imiter. Il existe donc un prix-limite au sens de Bain
dans ce cas. □
Dans ces équilibres séparateurs l'entrant potentiel connaît parfaitement le type de
firme installée auquel il doit faire face sur le marché. L'entrée a lieu exactement dans
le même cas qu'en information complète. Néanmoins, le type L peut être amené à
sacrifier une partie de ses profits de court terme en appliquant un prix-limite pour
signaler son type. Ce phénomène peut conduire à une amélioration du bien-être social
par rapport au cas de l'information complète : le bien-être de seconde période n'est
pas affectée par l'information asymétrique (puis que l'entrée a lieu dans les mêmes
conditions) et le bien-être de première période peut être plus élevé si la firme de type
L applique un prix-limite. Par conséquent le prix-limite ne conduit pas nécessairement
à une perte de bien-être.
Posons :
A" = M," - M?(p\\ , AL = M\ - M\[p\\ (8.11)
<j>H = 5(M,W - £>,"), 4>L = blhd[ - D[\ (8.12)
Les équilibres révélateurs sont alors donnés par les prix p\ tels que :
AH^4>H et &L<4>L=*Pie[pï>PÎ] (8-13)
Ces conditions peuvent être comparées sur un graphique (voir figure 8.9).
4. Équilibres mélangeants
Les équilibres non-révélateurs sont caractérisés par un prix d'équilibre identique pour
les deux types. Par conséquent nous devons avoir
p*(H) = p*(L) = p*
De plus pour les croyances d'équilibre nous devons avoir :
fjL*(L/P*) = X, fjL^H/p*^ = \-X
Jeux séquentiels avec information incomplète • 151
&
oH
A
1
P
Equilibres révélateurs
L f / , ,
/
\ Y / /
\A / /
S* ^ L r^ H
1 P/ Pm Prn
PÎ
Figure 8.9 Équilibres révélateurs et prix-limite.
le prix d'équilibre ne conduit pas à un affinement des croyances. Dans ces conditions,
p* ne peut être un prix d'équilibre que si :
xD£ + (l-x)D? <0.
(8.14)
Sinon au prix d'équilibre l'entrant a un profit espéré positif et il entre. L'entrée n'est
pas dissuadée et alors les firmes installées doivent appliquer leur prix de monopole
de court terme à la première période et ces prix diffèrent. Donc un équilibre non-
révélateur ne peut exister dans ce cas. Sous la condition (8.14), le prix p* dissuade
l'entrée. La condition nécessaire pour qu'il soit un prix d'équilibre est qu'aucun type
n'ait intérêt à appliquer son prix de monopole. Si toute déviation du prix d'équilibre
est interprétée comme venant du type //, c'est-à-dire si
H*(H/p) = 1 si p # p*
alors nous devons avoir :
M\ - M[(p*\ ^ sUff- - D\\
pour le type à coûts faibles et
M," - M,"(p*) ^ &(m? - Df)
pour le type à coûts élevés.
(8.15)
(8.16)
(8.17)
Proposition 8.2. Sous les conditions (8.14), (8.16), (8.17) le prix p* et les croyances
M*CA) forment un EBP non-révélateur avec
p*(H) = p*(L) = p*
Preuve : Le raisonnement est similaire au cas des équilibres révélateurs
(cf. Tirole (1988)). □
152 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Dans ce type d'équilibre la firme installée manipule son prix de manière à ne pas
révéler d'information sur son type. Il y a moins d'entrée que dans le cas avec information
symétrique : l'entrée est toujours dissuadée tandis qu'en information symétrique la
probabilité d'entrée est (1 — jc) > 0. Par conséquent le type H applique un prix-limite
pour dissuader l'entrée. L'effet sur le bien-être est ambigu dans ce cas car le bien-être
de la première période est en général amélioré du fait de l'application d'un prix-limite
par le type H mais il y a moins d'entrée à la seconde période, ce qui en général diminue
le bien-être.
5. Le modèle de Milgrom & Roberts montre donc que le prix-limite peut être
effectivement appliqué en présence d'une information incomplète et asymétrique. Mais il
n'a pas nécessairement un effet négatif sur le bien-être. Par conséquent, même s'il
peut conduire à un blocage de l'entrée, il ne correspond pas à la relation négative que
l'on établit d'habitude entre les barrières à l'entrée et le bien-être social. La relation
précise entre le prix-limite et le bien-être dépend des conditions particulières de chaque
industrie. Avant de condamner une pratique de prix-limite il faut donc procéder à une
analyse détaillée de l'industrie que l'on étudie. Cela d'autant plus que les équilibres
révélateurs et non-révélateurs conduisent à des conclusions différentes du point de vue
normative.
Un autre élément plus général apparaît dans ce modèle : il s'agit de la multiplicité des
équilibres dans les jeux à information incomplète. En fait pour les stratégies hors du
sentier d'équilibre les croyances de l'entrant potentiel sont arbitraires puisque l'on ne
peut appliquer la règle de Bayes pour des événements à probabilité nulle.
Cela engendre une multiplicité considérable des croyances, d'où la multiplicité des
équilibres qui en découlent. Les différents raffinements de l'EBP essayent de réduire
cette multiplicité en imposant des restrictions « raisonnables » sur les croyances qui
découlent de l'observation d'un événement à probabilité nulle.
Jeux séquentiels avec information incomplète • 153
,7
Quatrième partie
Jeux évolutionnaires
9. Une approche alternative :
équilibres évolutionnaires 157
9. (/ne approche
alternative :
équilibres
évolutionnaires
La coordination est-elle l'apanage d'individus nécessairement
pourvus d'une rationalité très sophistiquée ? Les approches que
nous avons considérées jusqu'à maintenant semblent donner une
réponse positive à cette question. En effet, pour sélectionner l'équilibre
de coordination, dans l'ensemble très riche des équilibres de Nash, les
théoriciens des jeux ont développé des concepts de solutions de plus en
plus sophistiqués, basés sur une rationalité de plus en plus forte pour les
joueurs. Deux exemples de cette démarche ont apparu dans notre vision
relativement réduite de la théorie des jeux :
- le passage de l'équilibre de Nash vers l'équilibre parfait en sous-jeux et
vers l'équilibre bayésien parfait ;
- la vision très complète que les joueurs doivent avoir d'un jeu répété en
vue d'atteindre la solution de coopération.
Or les expériences sur des jeux avec des sujets humains montrent plutôt que
les joueurs réels utilisent des stratégies simples, relativement stables dans le
temps et correspondant à des règles de comportement qui possèdent une
dimension adaptative importante. Leur comportement correspond alors
plus à une rationalité limitée, accompagnée d'un apprentissage guidé par
un processus d'essai et erreur ou d'imitation des autres joueurs.
Ce type de mécanismes simples est aussi observé depuis longtemps par les
biologistes dans les sociétés animales bien connues : il est difficile de
soutenir que chaque fourmi soit pourvue d'une rationalité très forte, mais
une fourmilière peut néanmoins fonctionner d'une manière harmonieuse
et stable dans le temps.
Une approche alternative : équilibres évolutionnaires • 157
De même, beaucoup de sociétés de mammifères ont remplacé les combats
à mort entre les prétendants au rôle du mâle dominant par une
symbolique de la domination et de la soumission qui permet de résoudre ce type
de conflit avant que cela débouche sur l'élimination pure de tous les
concurrents sauf un. Dans ce cadre tout se passe alors comme si des règles
de comportements simples avaient évolué dans le temps, du fait d'un
apprentissage par la communauté d'animaux ou, plus globalement, par
l'espèce concernée, sous la pression sélective de l'environnement de cette
espèce (Maynard-Smith (1987)). Cette observation et la constatation que
ce qui compte dans l'évolution est la stabilité des comportements, plutôt
que leur conformité avec un critère d'optimalité, ont conduit à l'ouvrage
de Maynard-Smith (1982). Et cet ouvrage a donné naissance au champ des
jeux évolutionnaires, aujourd'hui très riche.
Les jeux évolutionnaires (voir aussi Weibull (1995), pour une exposition
plus moderne et détaillée) s'inspirent des mécanismes de l'évolution
biologique (la mutation et la sélection) pour étudier les solutions auxquelles
peuvent conduire les interactions en l'absence d'une rationalité forte. Ils
considèrent alors que le jeu est joué un grand nombre de fois, entre des
individus possédant une rationalité limitée et très peu d'information sur le
jeu. Ces individus sont tirés de manière aléatoire d'une grande population.
Mais cette interprétation pose au moins un problème : les interactions qui
caractérisent la dynamique d'évolution se font nécessairement entre les
membres d'une population ou entre plusieurs populations et non entre
deux individus bien définis. La stabilité dont on parle est la stabilité de
certains traits caractéristiques dans chaque population et non celle des
stratégies à proprement parler. Par conséquent la transposition de ce type
de mécanismes à des jeux entre individus n'est pas immédiate et nécessite
beaucoup de soin pour pouvoir en tirer des conclusions sur les résultats des
jeux entre individus.
s clés étudiés : Ce chapitre est consacré à l'analyse des jeux
évolutionnaires :
- l'analogie évolutionniste dans l'interprétation des jeux ;
- la dynamique des populations ;
- la stabilité évolutionnaire ;
- la dynamique de réplication et ses propriétés ;
- les comportements basés sur la rationalité limitée et
l'apprentissage.
158 • JEUX ÉVOLUTIONNAIRES
I. Stratégies, mutations, sélection
La théorie de l'évolution s'intéresse à l'évolution des espèces et donc des
populations correspondantes. Cette évolution résulte des mutations dans les
génomes des individus formant l'espèce et de la sélection des caractéristiques
correspondant à ces génomes (les phénotypes) par la pression du milieu dans la
reproduction. Les génotypes qui arrivent à se reproduire plus que d'autres
s'étendent dans l'espèce (occupant de plus en plus d'individus à chaque
génération), tandis que la part des autres se réduit. Dennett (1996) montre que
ce mécanisme (algorithme) est très efficace et conduit à des solutions
remarquables dans les inventions de la Nature. Quand aucune mutation ne peut
détrôner un ensemble de caractéristiques (et donc le génome correspondant),
cela conduit à une stabilité dans le processus d'évolution. C'est l'idée de
base de la stabilité évolutionnaire que nous allons considérer dans la section
suivante.
La question qui se pose à ce stade est la suivante : étant donné que
l'évolution est celle des populations, comment pouvons-nous en tirer des leçons
concernant celle des stratégies des joueurs et leur stabilité ? Rappelons-nous que
l'équilibre de Nash est aussi basé sur un concept de stabilité : la stabilité face
aux déviations unilatérales.
Pour pouvoir utiliser le concept d'évolution, nous devons alors nous
intéresser à celle de la population de stratégies, les joueurs n'étant que le support
fictif de cette population. Dans les jeux symétriques (quand les joueurs ont le
même ensemble de stratégies et les gains sont symétriques), cette transposition
est même assez simple à concevoir : il suffit de considérer les rencontres
successives d'un couple de stratégies aléatoirement tirées de la population des
stratégies.
Reconsidérons le dilemme du prisonnier. Comment pourrions-nous étudier
les solutions de ce jeu dans une vision évolutionnaire ? Les deux joueurs ont
le même ensemble de stratégies : S = {N,D}. Nous pouvons donc imaginer
une population de n supports de stratégies, chacun initialement doté de N ou
de D de manière aléatoire. Appelons individus ces supports pour simplifier la
présentation (on aurait pu tout aussi bien imaginer un bac rempli de boules
de deux couleurs). À chaque période deux de ces individus sont aléatoirement
tirés de la population et ils jouent au dilemme du prisonnier, tel que nous le
connaissons. En fonction des stratégies qu'ils portent, ils obtiennent alors les
gains donnés par la matrice de ce jeu. Après avoir observé leur performance
(le degré d'adaptation à leur environnement - fitness en biologie) avec les
stratégies qu'ils ont actuellement, ils choisissent une nouvelle stratégie et ils
sont remis dans la population. On recommence alors avec deux individus
nouveaux encore tirés au hasard. La probabilité de survie de chaque stratégie
dans la population dépendra alors des performances de cette stratégie, puisque
Une approche alternative : équilibres évolutionnaires • 159
les règles simples que les individus utilisent doivent favoriser les stratégies qui
ont une performance meilleure.
Ces règles simples, associées à la procédure de rencontre que nous
considérons, correspondent en fait à un processus dynamique stochastique, en ce qui
concerne la distribution des stratégies TV et D dans la population. Nous laissons
pour l'instant de côté la spécification de ces règles. La question que nous
pouvons déjà poser est la suivante : si ce processus dynamique conduit à une
distribution stable des stratégies dans la population des n individus, quelles doivent
être les propriétés de cette distribution ?
IMAGINE.,. ILV4 QUATGÇ
MUIAGD& 0'ANNëe6 U
TCftCe N'éTAtT QU'UN H0AÛ&
De ftxiefcièBÊ
et la pceAUèce aAcrëeie
fârAPGARUe UVATEOfr
AAIIUAGD5 P'AMNée& .PUI&
LAVIB/UAfllNg.lfôPlNO-
&Ai)Be&.LeôoiseAUX .lcô
AAA/WllFê<2e& BTENFIN,IL
Y A UN MILLION D'ANNée&,
CALVIN AND HOBBES © 1990Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved
© 1992 Presses de la Cité pour l'édition française.
Figure 9.1 L'apogée de révolution...
I. Stabilité évolutionnaire
Avec le processus de rencontre que nous considérons, nous pouvons remarquer
que la performance espérée d'une stratégie dépend de la distribution des
stratégies dans la population, étant donné que la probabilité d'être tirée pour une
stratégie est égale à sa proportion dans la population. Si à un moment donné
la proportion de la stratégie N dans la population est a, alors tout individu a
la probabilité a d'être confronté à la stratégie N et (1 — a) d'être confronté à
la stratégie D. Si cet individu est porteur de la stratégie s = N, D, son utilité
espérée est
au (s, N) + (1 — a) u (s, D)
Une telle situation sera stable si tout individu a plus de chance de survivre
en gardant sa stratégie qu'en la changeant (en mutant). Reprenons maintenant le
Dilemme du prisonnier dans le tableau 9.1, page ci-contre.
Nous avons alors pour les deux types possibles
s = N : au (N, N) + (l-a)u (N, D) > au (D, N) + (l-a)u (D, D)
4a- 1 > 4a (9.1)
160 • JEUX ÉVOLUTIONNAIRES
Tableau 9.1 Dilemme du prisonnier Clyde
N
Bonnie
D
Clyde
N D
3,3 -1,4
4,-1 0,0
s = D : au(D9N) + (l-a)u (D, D) > au (N, N) + (\-a)u (N, D)
4a>4a-l (9.2)
On observe que la condition (9.1) ne peut être vérifiée quel que soit a et les
individus avec la stratégie N seront tentés de muter vers la stratégie D, tandis que
ceux qui jouent la stratégie D ne vont pas changer. Cela nous conduira alors à
terme à l'invasion totale de la population par la stratégie D : tout le monde jouera
la stratégie D. Par conséquent s{ = D, V/ est une situation stable.
C'est l'idée de base du concept de stabilité évolutionnaire de Maynard
Smith. Nous pouvons généraliser cette idée en considérant les stratégies mixtes.
Imaginons que tous les individus de la population utilisent une stratégie mixte
p* e P à un moment donné. Cette situation sera stable si la mutation d'une
fraction (petite), e, de la population vers une autre stratégie mixte p ne peut
permettre l'invasion de la population par la stratégie mutante/?.
p Définition 9.1 *1
|* Une stratégie mixte p* e P est une stratégie évolutionnairement stable sïd
b nous avons pour toute stratégie mutante p e P et s petit , h
L .{lre)U(p*,p*)+eU(p\p)>a-e)U(p,p*)+eU(p,p) (9.3|j
avec [/représentant la fonction d'utilité espérée symétrique des joueurs. On peut
facilement montrer qu'une condition nécessaire et suffisante pour que la
condition (9.3) soit vérifiée est :
U(p*iP*)>U(piP*) (9.4)
ou
(a) U(p*iP*) = U(p,p*) et (b) U(p*,p)>U(plP) (9.5)
Si la condition (9.4) est vérifiée alors la population avec p* ne peut être
envahie par les mutants qui ont la caractéristique p. Si c'est la condition (9.5)
Une approche alternative : équilibres évolutionnaires • 161
qui est vérifiée, face à p* les mutants font aussi bien que la population
initiale mais, face à un autre mutant, ils s'en sortent moins bien (une stratégie
plus agressive par exemple qui conduit à des dommages réciproques
dans les combats entre mutants). Ces deux conditions correspondent à la
définition originale des stratégies évolutionnairement stables par Maynard
Smith.
La condition (9.4) définit cet équilibre de manière équivalente à un équilibre
de Nash strict : la stratégie p* doit être la meilleure réponse à elle-même. Mais
la stabilité évolutionnaire est encore plus exigeante : la condition (9.5) demande
en plus que p* soit une meilleure réponse que p face à la stratégie mutante p.
On a récemment découvert que John Nash donnait déjà cette interprétation dans
sa thèse de doctorat non publiée.
Si nous reconsidérons le dilemme du prisonnier, la discussion ci-dessus
implique que le seul équilibre évolutionnairement stable de ce jeu en stratégies
pures est (D, D) car cette distribution ne peut être envahie par des mutants
jouant N. Donc dans ce cas la stabilité évolutionnaire correspond à l'équilibre
de Nash.
Par conséquent tout équilibre évolutionnairement stable est aussi un
équilibre de Nash. Mais, du fait de la condition (9.5), tout équilibre de Nash n'est
pas évolutionnairement stable contrairement à ce que laisse supposer l'exemple
du dilemme du prisonnier. Par exemple, dans le jeu Papier-Ciseaux-Caillou il
existe un équilibre de Nash unique et il correspond à la stratégie mixte
1-,-,-J mais cette stratégie n'est pas évolutionnairement stable (voir
l'exercice 9.2). Au delà du dilemme du prisonnier, il faut aussi noter qu'aucune
stratégie faiblement dominée ne peut être évolutionnairement stable. L'exemple du
dilemme du prisonnier montre aussi que la stabilité évolutionnaire n'implique
pas nécessairement l'optimalité parétienne puisque le résultat (N, N) n'est pas
évolutionnairement stable.
L'approche que nous venons d'étudier nous permet d'étudier les équilibres
des jeux symétriques en forme normale. Il est possible de l'étendre aux jeux en
forme normale finis qui ne sont pas symétriques, en adoptant une approche
avec plusieurs populations en interaction, une pour chaque position dans le
jeu (voir Weibull (1995), chapitre 5). Si nous avons n positions et donc n
populations, chaque individu tiré est apparié avec des individus provenant
des n — 1 autres populations. Une conséquence immédiate de cela est qu'une
stratégie mutante ne peut être confrontée à elle-même et donc la partie (b) de la
condition (9.5) n'est plus pertinente. Tout équilibre de Nash qui n'est pas strict
devient alors fragile face aux mutations et seul les équilibres de Nash stricts sont
évolutionnairement stables.
Nous revenons maintenant sur la question des règles de comportement que
nous avons évitée jusqu'à maintenant.
162 • JEUX ÉVOLUTIONNAIRES
III. Règles de comportement
et dynamique de réplication
Intéressons-nous maintenant plus directement au processus dynamique
concernant l'évolution des stratégies dans la population. Comme nous l'avons déjà
observé, les processus évolutionnaires comportent deux mécanismes de base :
la mutation et la sélection. La stabilité évolutionnaire souligne le rôle des
mutations dans la mesure où Ton étudie la stabilité des solutions du jeu
face aux mutations dans la population des stratégies. Nous avons pu mener
cette étude sans expliciter le mécanisme de sélection en jeu, ni les règles
de comportements simples que nos joueurs utilisent. Pour pouvoir étudier
la dynamique de sélection, nous allons d'abord nous placer dans un cadre
particulier où chaque individu joue une stratégie pure. Cela va nous permettre
de faire apparaître une approche qui a été développée au sein de la théorie de
l'évolution, pour modéliser la dynamique des populations : la dynamique de
réplication. Nous allons ensuite observer que certains types de comportements
à rationalité limitée des individus (comme l'imitation) peuvent conduire à une
dynamique très similaire au niveau de la population (cette présentation suivra en
grande partie Weibull (1998)).
A. Dynamique de réplication
Considérons donc une large population (finie) composée d'individus qui sont les
supports des stratégies pures (une par individu) d'un jeu symétrique à deux
joueurs : Sj e S = {s\>... ,sk}. Soit pf(t) > 0 le nombre d'individus qui jouent
la stratégie pure st; g S à la date t. La population totale est alors donnée par
p{t) = Yli=\ A (0 > 0. L'état de la population associé à cette situation peut être
représenté par le vecteur x(t) = (xx (t),..., xk (f )) où jc, (0 est la part de la
stratégie pure Sj dans la population au moment t : xt{t) = Pi(t)/p(t). Nous
remarquons que l'état de la population, jc(0, est formellement identique à une
stratégie mixte du jeu initial à deux joueurs. Le gain espéré d'une stratégie pure st
incluse dans une rencontre avec le reste de la population dont l'état est x(t)
correspond bien alors à
k
U(siyx) = Eu(sitx) = 22 w(5'» si)xi (9.6)
/=i
Pour l'individu jouant la stratégie pure st il n'y a pas de différence en fait
entre une rencontre avec un autre individu tiré aléatoirement de la population x
et jouer face à un vrai joueur jouant la stratégie mixte x.
Une approche alternative : équilibres évolutionnaires • 163
Le gain moyen dans la population, et donc le gain espéré d'un individu
participant à une rencontre aléatoire dans la population jc, est donné par
k
U(x9x) = ^2xiU(siix)=xAxT (9.7)
»=i
avec A, la matrice des paiements du jeu A = | w(s,, s/). =1 k | et jc7, le transposé
de jc. Le gain £/(jc,jc) est équivalent au gain espéré de la stratégie mixte jouant
contre elle-même.
Nous pouvons représenter la dynamique de la distribution de la population
par un système d'équations différentielles homogènes
xi=Si(x)xi (9.8)
où x = dx/dt et 8j(x) est le taux de croissance de la stratégie pure s, dans la
population. Nous avons bien une dynamique de sélection dans la mesure où une
stratégie qui n'est pas initialement utilisée restera inutilisée dans la population
(car si jc,(0) = 0, i,(0 = 0,W > 0).
La spécification de <5,(-) détermine alors la nature de la dynamique de la
population. Dans un contexte de jeu, on pourrait par exemple imaginer que ce
taux soit positif pour les stratégies pures qui obtiennent un gain supérieur au
gain moyen dans la population et qu'il soit négatif pour les stratégies performant
moins bien que la moyenne. La spécification la plus connue correspond à celle
qui a été développée dans le cadre de la modélisation de la dynamique des
populations au sein de la théorie de l'évolution : la dynamique de implication. Cette
spécification correspond alors au système dynamique suivant dans notre cadre
de jeu évolutionnaire :
^ = [Uist, jc_,) - U(x, x)]xi (9.9)
où £/(jc, jc) est le gain espéré de la position de joueur i quand le profil de
stratégies jc est joué dans la population (le gain moyen dans la population avec la
stratégie jc) et U(sit .*_,) est le gain espéré quand la stratégie pure s, est jouée
contre le profil de stratégie jc. Par conséquent, le taux de croissance de chaque
stratégie pure dans la population est proportionnel à l'avantage relatif de cette
stratégie dans sa population de joueurs.
On peut alors se poser deux questions :
- Vers quel type de solution peut converger ce processus dynamique ?
- Quelles sont les différentes spécifications pour <5,(-) qui peuvent résulter des
différents types de comportements avec rationalité limitée ?
Pour répondre à la première question, nous allons nous placer dans le cadre
des jeux symétriques à deux joueurs. Prenons d'abord un exemple encore plus
simple.
164 • JEUX ÉVOLUTIONNAIRES
► Exemple 9.1
Jeux symétriques 2x2: deux joueurs et deux stratégies.
Soit I = {1, 2} et S = {sx,s2}. Ces jeux peuvent alors être résumés par
leur matrice de gains symétriques A (voir Véquation (9.7)) :
VO a2J
qui correspond aux gains Ui(sXysx) = ax, U((s2is2) = a2, V/ = 1,2 et
Uj(sj,Sj) = 0, V/' ^ / = 1, 2. Nous allons supposer axa2 =£ 0. Nous avons
dans ces jeux 2 x 2, x2 = 1 — xx et X\ — —X2. Ces gains impliquent la
dynamique de réplication suivante pour la stratégie S\ (et son complément
pour s2, bien sûr)
X\ ^ \Cl\X\ — a2X2)X\X2
car
U(sux) = axxuU(s2ix) = a2x2
U(sXix) — U(x,x) = U(slyx) — [x\U(si,x) + x2U(s2yx)]
= (1 -*,)t/(si,*) -x2U(s2ix)
= x2U(sux) — x2U(s2, x)
xl = [x2U(s\,x) — x2U(s2,x)]x\
x\ = [U(slyx) - U(s2ix)]xxx2
Nous avons plusieurs cas :
- axa2 < 0 : la part de la stratégie S\ décline continûment dans le temps
si ax < 0 < a2 ou croît continûment dans le temps si ax > 0 > a2.
Par conséquent, si la population démarre avec une situation où les
deux stratégies existent dans la population, elle tend alors vers la
domination de Vunique stratégie évolutionnairement stable : s2 dans
le premier cas et sx dans le second.
- axa2 > 0 : le taux de croissance de xx change de signe quand axxx
= a2x2. Ce changement arrive donc à la stratégie mixte d'équilibre de
Nash x\ = a2/(ax + a2).
- Supposons que les deux gains soient positifs (aXya2 > 0) : xx > 0
si xx > jc* et xx < 0 si xx < xx*. Si xx démarre en dessous de xx*
alors la population converge vers une domination par s2 et si xx
démarre au dessus de xx* alors la population sera dominée par sx.
Par conséquent, à partir d'un point intérieur (où les deux stratégies
pures existent initialement dans la population), la population
converge vers l'un des équilibres évolutionnairement stables, les
bassins d'attraction des deux équilibres étant séparés par le
point jc*.
Une approche alternative : équilibres évolutionnaires • 165
- Supposons maintenant que les deux gains soient négatifs
(au a2 < 0) : Xi < 0 si x\ > jc* et x\ > 0 si xx < x\. Dans ce
cas, la population converge vers jc* à partir de tout point initial
intérieur et jc* est l'unique stratégie évolutionnairement stable de
ce jeu.
Ce petit exemple nous permet donc de montrer la relation qui peut exister
entre la dynamique de réplication de la population et les équilibres
évolutionnairement stables.
Par exemple, un jeu de coordination correspondrait à ax > 0 et a2 > 0.
La dynamique de réplication tendrait alors vers l'un des deux équilibres
évolutionnairement stables de ce jeu, en fonction de la situation initiale de la
population. Ces équilibres sont les deux équilibres de Nash du jeu : tout le
monde joue s\ ou tout le monde joue s2.
De même, comme la dynamique de réplication n'est pas modifiée par un
déplacement des gains (vers le haut ou vers le bas) de manière à garder
les préférences locales de joueurs, d'autres jeux peuvent être normalisés de
manière à correspondre à ce jeu canonique.
Le dilemme du prisonnier
N
Bonnie
D
Clyde
N D
3,3 -1,4
4,-1 0,0
correspond aux matrices
"-C ~o) ""'"(-i o)
qu'on peut normaliser localement de manière à avoir la matrice symétrique
équivalente
-a1 :)
car 3 - 4 = -1 et 0 - (-1) = 1. En utilisant le fait que jc2 = 1 - x\, cela nous
donne la dynamique de réplication
X\ = (—ljCi — (1JC2))JC2JCi
= (-*! -(1 -*i))(l ~*l)*l
X\ = —(1 — jcj)jci < 0, Vjci > 0
=$>x2>0, Vjc2 > 0.
166 • JEUX ÉVOLUTIONNAIRES
Donc, à partir d'une situation initiale intérieure (jcj > 0, x2 > 0), la
population tend vers une domination par la stratégie s2 = D.
De manière plus générale, il est possible de montrer qu'en temps continu, la
dynamique de réplication élimine de la population les stratégies strictement
dominées, si toutes les stratégies pures sont présentes dans la population
initiale. Par contre, les stratégies faiblement dominées ne sont pas nécessairement
éliminées de la population. Le premier résultat implique que même si l'on
ne suppose pas une rationalité des individus, à long terme ils vont jouer
comme s'ils étaient rationnels et comme si cette rationalité était connaissance
commune.
En ce qui concerne les équilibres de Nash, si on les voit comme un état
de la population, on peut aussi montrer qu'ils constituent un état stationnaire
de la dynamique de réplication. Il existe aussi des états stationnaires qui ne
sont pas des équilibres de Nash, mais alors ils sont dynamiquement instables :
si l'on perturbe légèrement l'état de la population, elle peut diverger de ces
états stationnaires (instabilité Lyapounov). Ainsi, dans ces dynamiques de
sélection, les individus se comportent-ils comme s'ils anticipaient cet état de
la population et jouaient de manière optimale face à cette anticipation.
[KB] : Sections 9.5-9.7.
Ces résultats sont très intéressants car ils montrent que la dynamique de
réplication peut correspondre au résultat agrégé d'une gamme large de règles
de comportements simples pour les individus.
D. Règles de comportement
Les résultats que nous venons d'étudier concernent la dynamique globale de la
population des stratégies quand on ne présuppose pas une rationalité forte des
joueurs ou une connaissance approfondie du jeu. Mais, en nous intéressant à la
dynamique agrégée, nous avons traité ces comportements de manière implicite,
sans préciser leur contenu. Nous allons maintenant revenir à la seconde question
que nous avons posée à propos des réplicateurs : quelles sont les différentes
spécifications pour 5() qui peuvent résulter des différents types de comportements
avec rationalité limitée ?
Plusieurs résultats récents des jeux évolutionnaires montrent effectivement
que la dynamique de réplication au niveau agrégé peut correspondre à des
comportements adaptatifs basés sur un apprentissage au niveau des individus.
L'apprentissage par renforcement {reinforcement leaming) ou par imitation fait
partie de ce type de comportements.
Les modèles basés sur l'apprentissage adaptatif considèrent que chaque
individu utilise une stratégie qui est confrontée aux stratégies des autres individus
dans la population et, de temps en temps, en fonction ou non de la performance
de sa stratégie, l'individu révise sa stratégie. Ce processus dynamique possède
Une approche alternative : équilibres évolutionnaires • 167
alors deux dimensions importantes :
- le taux de révision (la fréquence de révision) des stratégies par chaque
individu et
- la probabilité des stratégies d'être adoptées par un individu chaque fois qu'il
révise sa stratégie.
Ces deux éléments résultent en général de manière endogène (et souvent
aléatoire) des comportements spécifiés pour les agents et de l'évolution de l'état
de la population et des performances des stratégies.
L'apprentissage par renforcement correspond par exemple à la révision,
après chaque étape des rencontres, des probabilités d'adoption des stratégies en
fonction de la propre performance de la stratégie de l'agent.
L'apprentissage par imitation peut prendre différentes formes, la plus simple
étant l'imitation de la stratégie d'un individu quelconque dans la population,
individu tiré selon une loi uniforme. On pourrait aussi imaginer que la fréquence
des révisions soit croissante avec le retard de performance de la stratégie de
l'agent par rapport à la performance moyenne de la population. On pourrait tout
aussi considérer que l'agent choisit de manière aléatoire un individu à imiter
dans la population mais qu'il ne l'imite que si la performance moyenne de
l'autre agent (probablement observée avec une marge d'erreur) est supérieure à
celle de sa propre stratégie.
La dynamique de population découlant de ce type de comportements
adaptatifs peut être relativement similaire à la dynamique de réplication. Cela nous
conduit à voir l'équilibre de Nash avec d'autres yeux car la rationalité
sur laquelle il semble se baser n'a pas nécessairement besoin d'être aussi
forte que nous l'avons initialement supposée. Même des comportements avec
une rationalité limitée peuvent conduire à long terme et dans un contexte de
répétitions (sans lequel l'apprentissage n'est de toute façon pas possible) à des
résultats proches de l'équilibre de Nash. La théorie des jeux évolutionnaires
apporte donc de nouveaux fondements aux concepts d'équilibre de la théorie
des jeux et à leur interprétation.
ercices
Exercice 9.1
Dans le jeu de coordination suivant
A
Krunding
B
Zelefunken
A B
3,3 0,0
0,0 1,1
168 • JEUX ÉVOLUTIONNAIRES
px
1. Déterminez les stratégies de Nash en stratégies pures et mixtes de ce jeu.
2. Vérifiez si ces équilibres de Nash sont évolutionnairement stables.
Solution
1. (A, A) est l'équilibre de Nash Pareto-optimal de ce jeu mais (B, B) est aussi un
équilibre de Nash. De plus, dès qu'une firme joue assez souvent B, l'autre aura intérêt à
jouer B aussi. Il existe donc un équilibre de Nash symétrique en stratégies mixtes :
p* = (^) où/>[*] = !.
2. Les deux équilibres de Nash en stratégies pures sont stricts et donc il ne peut exister
de mutant qui peut faire mieux que ces stratégies face à lui-même. Par conséquent, ils
sont évolutionnairement stables. Ce n'est pas le cas de l'équilibre en stratégies mixtes.
En effet, toute stratégie mixtep est une meilleure réponse à/?*. Par exemple, la
stratégie pure A obtient un gain plus fort face à elle-même que p* et donc c'est un mutant
qui peut potentiellement envahir une population de p*. Dans ce cas, la partie (b) de la
3
condition (9.5) n'est pas vérifiée : U(p*,A) = - < 3 = U(A, A).
Exercice 9.2
Vérifiez que l'équilibre de Nash en stratégies mixtes du jeu de Papier-Ciseaux-Caillou
n'est pas évolutionnairement stable (voir les exercices 2.1 et 3.5).
Solution
Nous avons ici un cas similaire à celui de l'exercice précédent. Ce jeu possède un seul
équilibre de Nashp* = I -, -, - I mais cet équilibre n'est pas strict et donc il est
fragile par rapport aux mutations. Notamment la stratégie pure Papier n'obtient pas moins
contre elle-même, que la stratégie/?* face à elle : U (Papier, Papier) = 1 = U (p*t Papier).
Donc, à nouveau, la partie (b) de la condition (9.5) n'est pas vérifiée.
Exercice 9.3
Etudiez la dynamique de implication et sa solution à long terme pour les jeux dont les
matrices des gains symétriques sont respectivement données par
Solution
Matrice Ax : 1 • 1 > 0 : le taux de croissance de x\ change de signe quand x\ = x2. Ce
changement arrive donc à la stratégie mixte d'équilibre de Nash x* = -. Les deux gains
sont positifs. Nous avons alors la dynamique suivante : x\ > 0 si x\ > x* et x\ < 0 si
x\ < jc*. Si jci démarre en dessous de jc* alors la population converge vers une
domination par $2 et si xi démarre au dessus de ** alors la population sera dominée par s\. Par
conséquent, à partir d'un point intérieur (où les deux stratégies pures existent initialement
dans la population), la population converge vers l'un des équilibres évolutionnairement
stables, les bassins d'attraction des deux équilibres étant séparés par le point x* = -.
Une approche alternative : équilibres évolutionnaires • 169
Matrice A2 : (-2) • 5 = 10 < 0 : la part de la stratégie s\ décline continûment dans le
temps car — 2 < 0 < 5. Par conséquent, si la population démarre avec une situation où
les deux stratégies existent dans la population, elle tend alors vers la domination par
l'unique stratégie évolutionnairement stable : s2.
170 • JEUX ÉVOLUTIONNAIRES
ibliographie
BlNMORE, K. (1999), Jeux et Théorie Des Jeux, De Boeck Université,
Bruxelles.
Bulow, J., Geanakoplos, J. & Klemperer, P. (1985), "Multimarket
oligopoly: Stratégie substitutes and compléments", Journal of Political Economy
93,488-511.
CYERT, R. & DEGROOT, M. (1987), Bayesian Analysis and Uncertainty in
Economie Theory, Rowman & Littlefîeld, New Jersey.
DENNETT, D.C. (1996), Darwin 's Dangerous Idea, Touchstone Books (Simon
and Schuster), New York.
DiXIT, A. (1980), "The rôle of investment in entry deterrence", The Economie
Journal 90, 95-106.
DiXIT, A. (1982), "Récent developments in oligopoly theory", The American
Economie Review72, 12-17.
DiXIT, A. & NALEBUF, B. (1993), Thinking Strategically: The Compétitive
Edge in Business, Politics, and Everyday Life, W.W. Norton & Company,
New York.
Friedman, J. (1971), "A non-cooperative equilibrium for supergames", Review
of Economie Studies 38, 1-12.
FUDENBERG, D. & TlROLE, J. (1986a), Dynamic Models of Oligopoly, in A.
Jacquemin, ed.r Fundamentals of Pure and Applied Economies, vol. 3,
Harwood, New York.
FUDENBERG, D. & TlROLE, J. (1991), Game Theory, MIT Press,Cambridge:
MA.
GlRAUD, G. (2000), La Théorie Des Jeux, Champs Université, Flammarion,
Paris.
GREMAQ, A. (1988), Dynamique, Information Incomplète, stratégies
Industrielles, Economica, Paris.
HARSANYI, J. (1967-68), "Games with incomplète information played by
bayesian players ", Management science 14, 159-182, 320-334, 486-502.
Bibliographie • 171
Kahneman, D. & TVERSKY, A. (1982), "Prospect theory:An analysis of
décision under risk ", Econometrica 24, 178-191.
KlRMAN, A. & SALMON, M. (1995), Leaming and Rationality in Economies,
Blackwell, Oxford.
KREPS, D. (1999), Théorie Des Jeux et Modélisation Économique, Dunod,
Paris.
KREPS, D.M. (1996), Leçons de Théorie Microéconomique, Presses
Universitaires de France, Paris.
MAYNARD SMITH, J. (1982), Evolution and the Theory of Games, Cambridge
University Press, Cambridge.
MAYNARD-SMITH, J. (1987), "When learning guides évolution", Nature 329,
761-762.
MlLGROM, P. & ROBERTS, J. (1982), "Limit pricing and entry under incomplète
information: An equilibrium analysis", Econometrica 50, 443^459.
MOULIN, H. (1979), Fondation de la Théorie des Jeux, Herman, Paris.
MYERSON, R.B. (1991), Game Theory, Harvard University Press, Cambridge:
MA.
NELSON, R.R. & WiNTER, S. (1982), An Evolutionary Theory of Economie
Change, The Belknap Press of Harvard University, London.
OSBORNE, M.J. & RUBINSTEIN, A.(1994), A Course in Game Theory, MIT
Press, Cambridge: MA.
RUBINSTEIN, A. (1998), Modeling Bounded Rationality, The MIT Press,
Cambridge: MA.
SAVAGE, L. (1954), The Foundations of Statistics, Wiley & Sons, New York.
Selten, R. (1975), "Reexamination of the perfeetness concept for equilibrium
points in extensive games", International Journal ofGame Theory 4, 25-55.
SIMON, H.A. (1972), Théories of bounded rationality, in R. Radner,C.B.;
Radner, éd., "Décision and Organization", North-Holland, Amsterdam,
pp. 161-176.
SUN-TZU (1972), L'Art de la Guerre, Champs Flammarion, Paris.
TIROLE, J. (1988), The Theory of Industrial Organization, The MIT Press,
Cambridge, Massachusetts.
UMBAUER, G. (1989), Information Incomplète et Qualité des Produits, Thèse
de doctorat, Université Louis Pasteur, Strasbourg, France.
UMBHAUER, G. (2002), Théorie Des Jeux Appliquée À la Gestion, Éditions
ems, Colombelles.
VON NEUMAN, J. & MORGENSTERN, O. (1944), Theory of Games and
Economie Behavior, Princeton University Press, Second Ed.,Princeton.
WEIBULL, J.W. (1995), Evolutionary Game Theory, MIT Press, Cambridge
(MA).
Weibull, J.W. (1998), "Evolution,rationality and equilibrium in games",
European Economie Review 42, 641-649.
172 • INTRODUCTION À LA THÉORIE DES JEUX
A
Accord tacite : 48
Actualisation : 87
Apprentissage : 76, 157
- par imitation : 168
- par renforcement : 167
Assurance de dommages : 119, 155
B
Backward induction : 61
Barrières à l'entrée : 53
Bayes : 129
Bien-être social : 44
C
Cartel : 95
Cheap talk : 48
Communication : 47
Condition d'incitation : 147
Conventions : 47
Coopération : 88
Coordination : 46, 157
Courbe de réaction : 71
Croyances : 128, 140-142
- hors-équilibre : 144
D
D'Aspremont, Jacquemin, Gabszewich :
49
ndex
Darwin : 9
Dennett, Daniel : 159
Différenciation des biens : 49
Dixit, Avinash : 70
Domination parétienne : 44, 47, 86
Duopole de Cournot : 5, 102
- information incomplète : 123
Dynamique de réplication : 163
E
EBP : 142, 144
Efficacité parétienne : 44
Élimination des stratégies : 24
- dominées : 25
- équivalentes : 24
Ensemble
- d'information : 6,16
-dejoueurs : 12
- de stratégies : 12
Entrée
- accommodation : 74
- dissuasion : 73
EPSJ : 63, 86
-jeux bayésiens : 138
- optimalité parétienne : 69
- paradoxe de la rationalité : 68
- perfection bayésienne : 142
- théorème folk : 92
INDEX • 173
Équilibre(s)
- bayésien parfait : 142
- corrélé : 48
-d'unjeu : 23
- de Bertrand : 106
- de Cournot : 103
-deNash:36,71, 159
• bayésien : 126, 130
• conditions d'existence : 43
• en stratégies mixtes : 37
• équivalents : 45
• et meilleures réponses : 40
• interchangeables : 46
• le théorème de Nash : 44
• modèle d'Hotelling : 53
• multiplicité : 45
• non-existence : 43
• optimalité parétienne : 45
• parfait en sous-jeux : 63
• rationalité limitée : 166
• stabilité évolutionnaire : 162
• strict : 36
- mélangeant : 143
- multiples : 23
- multiplicité : 90
- semi-séparateur : 143
- séparateur : 142
Erreur pure : 19
Espérance d'utilité : 41
F
Facteur d'actualisation : 87
Fitness : 159
Fonction(s) de gain : 13
Fonction(s) de meilleure réponse
51
- en stratégies mixtes : 40
• représentation graphique : 42
- en stratégies pures : 38
Forme normale réduite : 24
Friedman, James : 93
Fudenberg, Drew : 70, 92
G
GG:9
GU:9
H
Harsanyi : 122
Hotelling : 49
I
Imitation : 157, 167
Incertitude : 7
Induction vers l'amont : 61
Information : 5
- complète : 6, 17
- compléter l'information : 123
- ensemble d'information : 16
- imparfaite : 6, 17
- incomplète : 6, 17, 121
- parfaite : 6, 17
Investissement : 72
J
Jeu(x) : 3, 4
-bayésiens : 121, 127
• séquentiels : 137
- coopératifs : 5, 10
- d'échecs : 6
- de coordination : 27
- en forme extensive : 15
- en forme normale : 12
- en information incomplète
- évolutionnaires : 159
- horizon fini et défini : 93
- non coopératif : 48
- non coopératifs : 5
- répétés : 85
• finis : 88
• infinis : 88
- séquentiels : 5, 14
- simultanés : 5
- solutions d'un jeu : 23
- stratégiques : 5
- super-jeu : 90
174 • INTRODUCTION A LA THÉORIE DES JEUX
K
KB :9
Kreps, David : 9, 141
M
Maynard-Smith, John : 158
Menaces
- crédibles : 48
• EPSJ : 66
- non-crédibles : 63
Microéconomie : 9
Milgrom, Paul : 148
Mutation : 158
Myopie : 86
N
Nash, John : 35
Nelson, Richard : 8
Norme sociale : 86
O
Observations imparfaites : 94
Optimum de Pareto : 45
Organisation industrielle : 3
P
Point focal : 46
Préférence(s) : 7
- pour le présent : 87
Principe
- de Bellman : 62
- de la rationalité individuelle : 48, 62
Prix-limite : 148
Probabilités : 7
- subjectives : 7
Profil de stratégies : 18
- locales : 22
Q
Qualité des produits : 98, 144
R
Rationalité : 6,7
- individuelle : 91
-limitée: 8, 157, 164
- Principe de rationalité individuelle :
48,62
- séquentielle : 140
Règle de Bayes : 128, 129, 141
Réputation : 98
Rétroduction : 61
Roberts, John : 148
Rosenthal : 69
Rubinstein, Ariel : 8
S
s_f- : 24
Satisficing : 8
Sélection : 158
- naturelle : 157
Selten, Reinhard : 14, 62
Simon, Herbert : 8
Sous-jeu : 63
- propre : 63
Stabilité évolutionnaire : 159, 161
Stratégie(s) : 17, 18
- complémentaires : 71
- comportementale : 20
- ensemble de stratégies : 12
- équivalentes : 24
- évolutionnairement stables : 161
- faiblement dominées : 25, 26
- jeux bayésiens : 128
- locale : 20
- locales : 22
- mélangeante : 128, 143
- mixte : 20
- mixtes : 36, 40
- profil de stratégies : 12, 37
- pure : 20, 23
- révélatrice : 142
- séparatrice : 128
- strictement dominées : 25
• dynamique de réplication : 167
- substituables : 71
- Trigger strategy : 104
INDEX • 175
T
Théorèmes folk : 86,91,93
Tirole, Jean : 70, 92, 148
U
Utilité espérée : 8
V
Valeur actualisée : 87
VNM : 7, 128
- utilité : 7
von Neumann, John : 3
von Stackelberg : 70
W
Weibul, Jôïgen : 158
176 • INTRODUCTION A LA THÉORIE DES JEUX
55837 - (I) - (1,2) - OSB 80° - LAS - API
Imprimerie Nouvelle - JOUVE
45800 Saint-Jean de Braye
N° d'Imprimeur : 646090Y
Dépôt légal: avril 2011
Dépôt légal de la lre édition : septembre 2003
Imprimé en France
ECOSUP
Murât Yildizoglu
INTRODUCTION
À LA THÉORIE DES JEUX
La théorie des jeux concerne tous les domaines de
l'économie et du management. Elle sert à analyser les
résultats possibles des interactions stratégiques entre les
agents.
Le problème de deux firmes fixant leur prix sur un marché,
celui deux pays désirant coordonner leur politique
budgétaire, celui de deux journaux optant pour une
couverture résultent tous de l'interdépendance qui existe
entre ces choix. La théorie des jeux propose des solutions
là où l'analyse économique se révèle insuffisante.
Initiation rigoureuse, cet ouvrage présente l'ensemble des
concepts de la théorie des jeux :
•jeux non coopératifs avec information complète
(équilibre de Nash, jeux répétés, jeux de négociation) ;
• jeux non coopératifs avec information incomplète (jeux
simultanés et jeux séquentiels) ;
• jeux évolutionnaires.
Chaque chapitre comprend des exercices corrigés, des
applications concrètes et un résumé des concepts. Cette
2e édition, entièrement mise à jour, est enrichie d'un
nouveau chapitre sur les jeux de négociation.
MURAT YILDIZOGLU
Professeur de sciences
économiques à l'université
d'Aix Marseille et membre
du laboratoire GREQAM,
il a aussi enseigné dans les
universités de Strasbourg et
de Bordeaux IV, ainsi que
dans des écoles doctorales
européennes.
> Étudiants
en sciences
économiques
> Étudiants en
sciences de gestion
> Étudiants en MASS
> Étudiants des écoles
de commerce
et d'ingénieurs
l
9"782100»558377ll
6916084
ISBN 978-2-10-055837-7