Aller au contenu
OIYO

L’apprentissage — conditionnement classique, conditionnement opérant, apprentissage cognitif, apprentissage par observation, récompenses et motivation intrinsèque

Comment l’expérience modifie-t-elle le comportement ? Les chiens de Pavlov et l’effet Garcia, les programmes de renforcement de Skinner et les limites de la punition, les cartes cognitives de Tolman, l’expérience de la poupée Bobo et le sentiment d’efficacité personnelle de Bandura, et l’effet de surjustification par lequel les récompenses émoussent l’intérêt, au niveau universitaire.

Dernière révision 2026-09-29

Qu’est-ce que l’apprentissage ?

En psychologie, l’apprentissage désigne un changement relativement durable du comportement ou des connaissances qui résulte de l’expérience. Les changements passagers, dus à la fatigue ou à des substances, et ceux qui ne dépendent pas de l’expérience, comme la maturation, n’en font pas partie.

Au début du XXᵉ siècle, Watson (1913) a lancé le béhaviorisme en soutenant que la psychologie devait étudier le comportement observable plutôt que des réalités invisibles comme la conscience. Dans ce courant, la recherche sur l’apprentissage est devenue la première tradition expérimentale rigoureuse de la psychologie.

Le conditionnement classique : apprendre des signaux

La découverte de Pavlov

En étudiant la digestion, le physiologiste russe Pavlov (1927) a découvert que des chiens salivaient au seul bruit des pas de la personne qui les nourrissait, avant même de voir la nourriture.

TermeSensExemple de Pavlov
Stimulus inconditionnel (SI)Stimulus qui déclenche une réponse sans apprentissageLa nourriture
Réponse inconditionnelle (RI)Réponse innée au SILa salivation
Stimulus conditionnel (SC)Stimulus neutre au départ, associé au SIUne cloche
Réponse conditionnelle (RC)Réponse apprise au seul SCSaliver au son de la cloche

La réponse apprise s’affaiblit si l’on présente le SC seul de façon répétée (extinction) et réapparaît brièvement quand on le présente de nouveau après une pause (récupération spontanée). S’y ajoutent la généralisation, qui consiste à réagir à des stimuli semblables, et la discrimination, qui consiste à ne pas réagir à des stimuli différents.

La prédiction compte plus que l’association

Rescorla (1968) a montré que, même si le SC et le SI apparaissent souvent ensemble, le conditionnement reste faible lorsque le SI survient aussi fréquemment sans le SC. Ce que l’animal apprend n’est pas une simple paire, mais l’information « ce signal annonce-t-il cet événement ? ». Le modèle de Rescorla-Wagner (1972) l’a formalisé comme un apprentissage qui réduit l’erreur de prédiction.

Toutes les associations ne s’apprennent pas aussi facilement

Les rats de Garcia et Koelling (1966) associaient un goût à une nausée ultérieure dès la première fois, mais peinaient à associer lumières et sons à la nausée ; à l’inverse, ils associaient aisément lumières et sons à un choc électrique. Les organismes sont préparés à apprendre plus facilement les liens importants pour leur survie — c’est pourquoi un aliment qui nous a rendus malades peut nous dégoûter longtemps.

Apprendre la peur, puis l’éteindre

Watson et Rayner (1920) ont rapporté qu’en produisant un bruit violent tandis qu’ils montraient un rat blanc au « petit Albert », âgé de 11 mois, ils lui avaient fait craindre le rat et des objets à poils semblables. Selon les critères actuels, l’expérience est éthiquement inacceptable et sa méthode était peu rigoureuse, mais l’idée que la peur peut s’apprendre a été confirmée par la suite. La thérapie d’exposition des troubles anxieux repose sur l’apprentissage d’extinction : faire l’expérience répétée d’un stimulus redouté dans une situation sûre.

Le conditionnement opérant : apprendre des conséquences

La loi de l’effet et la boîte de Skinner

Thorndike (1898) a observé que des chats enfermés dans des boîtes à problème, après avoir trouvé le loquet par hasard, s’échappaient de plus en plus vite : c’est la loi de l’effet, selon laquelle les comportements suivis de conséquences satisfaisantes se renforcent. Skinner (1938) l’a systématisée dans le conditionnement opérant, l’étude de la façon dont le comportement est façonné par ses conséquences.

On ajoute quelque choseOn retire quelque chose
Le comportement augmenteRenforcement positif (compliment, argent de poche)Renforcement négatif (attacher sa ceinture fait cesser le bip)
Le comportement diminuePunition positive (réprimande)Punition négative (retrait du temps de jeu)

On confond souvent « renforcement négatif » et punition ; il s’agit pourtant d’augmenter un comportement en retirant quelque chose de désagréable.

Les programmes de renforcement

ProgrammeRègleProfil de comportementExemple
Ratio fixeRécompense après un nombre fixe de réponsesRéponses rapides, courte pause après la récompenseUn café offert après 10 tampons
Ratio variableAprès un nombre moyen imprévisibleTrès rapide et régulier ; le plus résistant à l’extinctionMachines à sous, loot boxes
Intervalle fixeRécompense de la première réponse après un délai fixeRéponses concentrées avant l’échéanceSalaire mensuel, examens réguliers
Intervalle variableAprès des délais moyens imprévisiblesLent mais régulierVérifier ses messages

Ce tableau montre pourquoi le ratio variable est utilisé dans les jeux d’argent et les récompenses aléatoires des jeux vidéo : quand on ne sait pas quand viendra la prochaine récompense, il est difficile d’arrêter.

Le façonnement et les limites de la punition

Le façonnement — renforcer des approximations successives du comportement visé — permet d’enseigner des comportements complexes aux animaux. La punition, elle, peut stopper un comportement sur-le-champ mais n’indique pas ce qu’il faut faire à la place. Une méta-analyse des recherches sur les châtiments corporels infligés aux enfants les associe à une obéissance immédiate, mais aussi, de façon constante, à des effets négatifs comme une agressivité accrue et une dégradation de la relation parent-enfant (Gershoff, 2002).

L’apprentissage cognitif : des cartes dans la tête

Certains phénomènes étaient difficiles à expliquer pour le béhaviorisme. Dans l’expérience de Tolman et Honzik (1930), des rats qui avaient simplement parcouru un labyrinthe sans récompense ont, une fois nourris, trouvé aussitôt leur chemin aussi vite que des rats récompensés dès le début. Ils avaient appris une carte cognitive du labyrinthe même sans récompense (apprentissage latent ; Tolman, 1948).

Les chimpanzés de Köhler (1925), face à des bananes hors de portée, s’immobilisaient un moment puis empilaient soudain des caisses ou emboîtaient des bâtons pour les attraper : non pas des essais et erreurs, mais un apprentissage par insight, qui saisit d’un coup la structure du problème.

L’apprentissage par observation : apprendre en regardant les autres

Dans l’expérience de la poupée Bobo de Bandura, Ross et Ross (1961), des enfants ayant vu un adulte frapper une poupée gonflable et crier contre elle ont ensuite beaucoup plus imité ce comportement. L’étude a montré qu’on peut apprendre simplement en observant autrui, sans être soi-même renforcé.

Bandura (1977) a décrit l’apprentissage par observation en quatre processus.

  1. Attention : il faut remarquer le comportement du modèle.
  2. Rétention : il faut garder en mémoire ce qu’on a vu.
  3. Reproduction : il faut être capable d’exécuter le comportement.
  4. Motivation : il faut une raison de le faire, par exemple avoir vu le modèle récompensé.

Bandura soutenait aussi que le sentiment d’efficacité personnelle — la conviction « je suis capable de le faire » — détermine si l’on se lance et si l’on persévère. Il se nourrit des réussites vécues, de l’observation de personnes semblables qui réussissent, des encouragements et de l’interprétation de ses états corporels.

Quand les récompenses émoussent l’intérêt

Lepper, Greene et Nisbett (1973) ont promis un diplôme à des enfants de maternelle qui aimaient dessiner, puis le leur ont remis. Quelques semaines plus tard, pendant le temps libre, ces enfants dessinaient moins que ceux qui n’avaient pas été récompensés. Quand une récompense extérieure s’attache à une activité faite pour le plaisir, on en vient à penser « je l’ai fait pour la récompense », et l’intérêt baisse : c’est l’effet de surjustification.

Une méta-analyse de 128 études a également montré que les récompenses matérielles annoncées à l’avance et liées à la réalisation d’une tâche réduisaient la motivation intrinsèque, alors que les récompenses inattendues et les éloges précis n’avaient guère cet effet, voire aidaient (Deci, Koestner & Ryan, 1999). Le renforcement est un outil puissant, mais il faut le manier avec prudence pour les activités que l’on aime déjà. D’autres aspects de la motivation sont traités au chapitre suivant.

Questions de vérification

Question 1. Une personne qui a eu mal chaque fois qu’elle entendait la roulette du dentiste se crispe désormais au seul bruit de la roulette. Quels sont ici le SI, la RI, le SC et la RC ?

Réponse. Le SI est la douleur des soins, la RI la tension et la peur face à la douleur, le SC le bruit de la roulette, et la RC la tension provoquée par le seul bruit de la roulette.

Question 2. Un enfant est dispensé de vaisselle les jours où il range sa chambre. De quel type de renforcement ou de punition s’agit-il ?

Réponse. On cherche à augmenter un comportement souhaité (ranger) en retirant quelque chose de désagréable (la vaisselle) : c’est un renforcement négatif.

Question 3. Une appli distribue des récompenses aléatoires à chaque connexion. À l’aide des programmes de renforcement, expliquez pourquoi elle retient si bien les utilisateurs.

Réponse. Elle s’apparente à un programme à ratio variable, où l’on ne peut prévoir au bout de combien d’essais viendra la récompense. Ce programme produit des taux de réponse élevés et est le plus résistant à l’extinction : on n’arrête pas facilement, même quand les récompenses se font attendre.


Références

  • Watson, J. B. (1913). Psychology as the behaviorist views it. Psychological Review, 20(2), 158–177.
  • Pavlov, I. P. (1927). Conditioned Reflexes (G. V. Anrep, Trans.). Oxford University Press.
  • Rescorla, R. A. (1968). Probability of shock in the presence and absence of CS in fear conditioning. Journal of Comparative and Physiological Psychology, 66(1), 1–5.
  • Rescorla, R. A., & Wagner, A. R. (1972). A theory of Pavlovian conditioning: Variations in the effectiveness of reinforcement and nonreinforcement. In A. H. Black & W. F. Prokasy (Eds.), Classical Conditioning II (pp. 64–99). Appleton-Century-Crofts.
  • Garcia, J., & Koelling, R. A. (1966). Relation of cue to consequence in avoidance learning. Psychonomic Science, 4(1), 123–124.
  • Watson, J. B., & Rayner, R. (1920). Conditioned emotional reactions. Journal of Experimental Psychology, 3(1), 1–14.
  • Thorndike, E. L. (1898). Animal intelligence: An experimental study of the associative processes in animals. Psychological Review Monograph Supplements, 2(4), i–109.
  • Skinner, B. F. (1938). The Behavior of Organisms. Appleton-Century.
  • Gershoff, E. T. (2002). Corporal punishment by parents and associated child behaviors and experiences: A meta-analytic and theoretical review. Psychological Bulletin, 128(4), 539–579.
  • Tolman, E. C., & Honzik, C. H. (1930). Introduction and removal of reward, and maze performance in rats. University of California Publications in Psychology, 4, 257–275.
  • Tolman, E. C. (1948). Cognitive maps in rats and men. Psychological Review, 55(4), 189–208.
  • Köhler, W. (1925). The Mentality of Apes. Harcourt, Brace.
  • Bandura, A., Ross, D., & Ross, S. A. (1961). Transmission of aggression through imitation of aggressive models. Journal of Abnormal and Social Psychology, 63(3), 575–582.
  • Bandura, A. (1977). Social Learning Theory. Prentice-Hall.
  • Bandura, A. (1977). Self-efficacy: Toward a unifying theory of behavioral change. Psychological Review, 84(2), 191–215.
  • Lepper, M. R., Greene, D., & Nisbett, R. E. (1973). Undermining children’s intrinsic interest with extrinsic reward: A test of the “overjustification” hypothesis. Journal of Personality and Social Psychology, 28(1), 129–137.
  • Deci, E. L., Koestner, R., & Ryan, R. M. (1999). A meta-analytic review of experiments examining the effects of extrinsic rewards on intrinsic motivation. Psychological Bulletin, 125(6), 627–668.