Aprendizaje — condicionamiento clásico, condicionamiento operante, aprendizaje cognitivo, aprendizaje por observación, recompensas y motivación intrínseca
¿Cómo cambia la experiencia la conducta? Los perros de Pavlov y el efecto Garcia, los programas de reforzamiento de Skinner y los límites del castigo, los mapas cognitivos de Tolman, el experimento del muñeco Bobo y la autoeficacia de Bandura, y el efecto de sobrejustificación por el que las recompensas apagan el interés, a nivel universitario.
Última revisión 2026-09-29
¿Qué es el aprendizaje?
En psicología, el aprendizaje es un cambio relativamente duradero en la conducta o el conocimiento que surge de la experiencia. No cuentan los cambios pasajeros, como los debidos al cansancio o a sustancias, ni los que no dependen de la experiencia, como la maduración.
A comienzos del siglo XX, Watson (1913) inauguró el conductismo al sostener que la psicología debía estudiar la conducta observable y no cosas invisibles como la conciencia. En esta corriente, la investigación sobre el aprendizaje se convirtió en la primera tradición experimental rigurosa de la psicología.
Condicionamiento clásico: aprender señales
El descubrimiento de Pavlov
Mientras estudiaba la digestión, el fisiólogo ruso Pavlov (1927) descubrió que los perros salivaban con solo oír los pasos de quien les daba de comer, antes de ver la comida.
| Término | Significado | Ejemplo de Pavlov |
|---|---|---|
| Estímulo incondicionado (EI) | Estímulo que provoca una respuesta sin aprendizaje | La comida |
| Respuesta incondicionada (RI) | Respuesta innata al EI | Salivar |
| Estímulo condicionado (EC) | Estímulo neutro al principio, emparejado con el EI | Una campana |
| Respuesta condicionada (RC) | Respuesta aprendida ante el EC solo | Salivar al oír la campana |
La respuesta aprendida se debilita si se presenta repetidamente el EC solo (extinción) y reaparece brevemente al presentarlo de nuevo tras una pausa (recuperación espontánea). También aparecen la generalización, responder a estímulos parecidos, y la discriminación, no responder a estímulos distintos.
Importa más la predicción que el emparejamiento
Rescorla (1968) mostró que, aunque el EC y el EI aparezcan juntos muchas veces, el condicionamiento es débil si el EI también aparece a menudo sin el EC. Lo que aprende el animal no es una simple pareja, sino la información «¿esta señal predice ese suceso?». El modelo de Rescorla-Wagner (1972) lo formalizó como un aprendizaje que reduce el error de predicción.
No todas las asociaciones se aprenden igual
Las ratas de Garcia y Koelling (1966) asociaban un sabor con las náuseas posteriores con una sola experiencia, pero les costaba asociar luces y sonidos con las náuseas; en cambio, asociaban con facilidad luces y sonidos con una descarga eléctrica. Los organismos están preparados para aprender con más facilidad las conexiones importantes para sobrevivir: por eso una comida que una vez nos sentó mal puede resultarnos desagradable durante mucho tiempo.
Aprender el miedo y extinguirlo
Watson y Rayner (1920) informaron de que, al producir un ruido fuerte mientras mostraban una rata blanca al «pequeño Albert», de 11 meses, hicieron que temiera a la rata y a objetos peludos parecidos. Según los criterios actuales, el experimento es éticamente inaceptable y su método fue poco riguroso, pero la idea de que el miedo puede aprenderse fue respaldada por investigaciones posteriores. La terapia de exposición para los trastornos de ansiedad se basa en el aprendizaje de extinción: experimentar repetidamente un estímulo temido en una situación segura.
Condicionamiento operante: aprender de las consecuencias
La ley del efecto y la caja de Skinner
Thorndike (1898) observó que gatos encerrados en cajas problema, tras dar por casualidad con el pestillo y escapar, salían cada vez más rápido: es la ley del efecto, según la cual las conductas seguidas de consecuencias satisfactorias se fortalecen. Skinner (1938) la sistematizó en el condicionamiento operante, el estudio de cómo la conducta es moldeada por sus consecuencias.
| Se añade algo | Se retira algo | |
|---|---|---|
| La conducta aumenta | Reforzamiento positivo (elogios, paga) | Reforzamiento negativo (abrocharse el cinturón apaga el pitido) |
| La conducta disminuye | Castigo positivo (una regañina) | Castigo negativo (quitar tiempo de juego) |
El «reforzamiento negativo» se confunde a menudo con el castigo, pero consiste en aumentar una conducta retirando algo desagradable.
Programas de reforzamiento
| Programa | Regla | Patrón de conducta | Ejemplo |
|---|---|---|---|
| Razón fija | Recompensa tras un número fijo de respuestas | Respuesta rápida, breve pausa tras la recompensa | Un café gratis con 10 sellos |
| Razón variable | Tras un número medio impredecible | Muy rápido y constante; el más resistente a la extinción | Tragaperras, cajas de botín |
| Intervalo fijo | Recompensa a la primera respuesta tras un tiempo fijo | Las respuestas se acumulan antes del plazo | Sueldo mensual, exámenes periódicos |
| Intervalo variable | Tras tiempos medios impredecibles | Lento pero constante | Mirar si hay mensajes |
Esta tabla explica por qué los programas de razón variable se usan en los juegos de azar y en las recompensas aleatorias de los videojuegos: si no sabes cuándo llegará la próxima recompensa, cuesta parar.
El moldeamiento y los límites del castigo
Mediante el moldeamiento —reforzar aproximaciones sucesivas a la conducta deseada— se pueden enseñar conductas complejas a los animales. El castigo, en cambio, puede detener una conducta en el acto, pero no enseña qué hacer en su lugar. Un metaanálisis sobre el castigo físico a los niños lo asoció con la obediencia inmediata, pero también, de forma constante, con efectos negativos como más agresividad y peor relación entre padres e hijos (Gershoff, 2002).
Aprendizaje cognitivo: mapas en la cabeza
Algunos fenómenos eran difíciles de explicar para el conductismo. En el experimento de Tolman y Honzik (1930), unas ratas que solo habían recorrido un laberinto sin recompensa, al recibir por fin comida, encontraron el camino de inmediato tan rápido como las ratas recompensadas desde el principio. Habían aprendido un mapa cognitivo del laberinto incluso sin recompensa (aprendizaje latente; Tolman, 1948).
Los chimpancés de Köhler (1925), ante unos plátanos fuera de su alcance, se quedaban quietos un rato y luego, de repente, apilaban cajas o empalmaban palos para alcanzarlos: no era ensayo y error, sino aprendizaje por insight, captar de golpe la estructura del problema.
Aprendizaje por observación: aprender mirando a otros
En el experimento del muñeco Bobo de Bandura, Ross y Ross (1961), los niños que habían visto a un adulto golpear y gritar a un muñeco hinchable imitaron después esa conducta mucho más. El estudio mostró que se puede aprender solo con observar a otros, sin recibir uno mismo refuerzo.
Bandura (1977) describió el aprendizaje por observación en cuatro procesos.
- Atención: hay que fijarse en la conducta del modelo.
- Retención: hay que guardar en la memoria lo observado.
- Reproducción: hay que ser capaz de ejecutar la conducta.
- Motivación: hay que tener una razón para hacerlo, como haber visto al modelo recompensado.
Bandura sostuvo además que la autoeficacia —la creencia «soy capaz de hacerlo»— determina si empezamos una conducta y cuánto persistimos. La autoeficacia se nutre de los éxitos propios, de ver triunfar a personas parecidas, del ánimo de otros y de cómo interpretamos nuestros estados corporales.
Cuando las recompensas apagan el interés
Lepper, Greene y Nisbett (1973) prometieron un diploma a niños de preescolar a los que les gustaba dibujar y luego se lo dieron. Semanas más tarde, en el tiempo libre, esos niños dibujaban menos que los que no habían sido premiados. Cuando se añade una recompensa externa a algo que se hacía por gusto, uno pasa a pensar «lo hice por el premio», y el interés baja: es el efecto de sobrejustificación.
Un metaanálisis de 128 estudios halló también que las recompensas materiales anunciadas de antemano y ligadas a hacer la tarea reducían la motivación intrínseca, mientras que las recompensas inesperadas y los elogios concretos apenas tenían ese efecto o incluso ayudaban (Deci, Koestner & Ryan, 1999). El reforzamiento es una herramienta poderosa, pero conviene usarla con cuidado en lo que ya se disfruta. Otros aspectos de la motivación se tratan en el capítulo siguiente.
Preguntas de comprobación
Pregunta 1. Alguien que sentía dolor cada vez que oía el torno del dentista ahora se pone tenso con solo oír el torno. ¿Cuáles son aquí el EI, la RI, el EC y la RC?
Respuesta. El EI es el dolor del tratamiento, la RI la tensión y el miedo ante el dolor, el EC el sonido del torno y la RC la tensión que provoca el sonido del torno por sí solo.
Pregunta 2. Se decide que un niño no friegue los platos los días que ordene su habitación. ¿Qué tipo de reforzamiento o castigo es?
Respuesta. Se busca aumentar una conducta deseada (ordenar) retirando algo desagradable (fregar), así que es reforzamiento negativo.
Pregunta 3. Una app da recompensas aleatorias cada vez que el usuario entra. Con los programas de reforzamiento, explica por qué engancha tanto.
Respuesta. Se parece a un programa de razón variable, en el que no se puede predecir tras cuántos intentos llegará la recompensa. Este programa produce tasas de respuesta altas y es el más resistente a la extinción, así que la gente no deja de hacerlo fácilmente aunque las recompensas tarden.
Referencias
- Watson, J. B. (1913). Psychology as the behaviorist views it. Psychological Review, 20(2), 158–177.
- Pavlov, I. P. (1927). Conditioned Reflexes (G. V. Anrep, Trans.). Oxford University Press.
- Rescorla, R. A. (1968). Probability of shock in the presence and absence of CS in fear conditioning. Journal of Comparative and Physiological Psychology, 66(1), 1–5.
- Rescorla, R. A., & Wagner, A. R. (1972). A theory of Pavlovian conditioning: Variations in the effectiveness of reinforcement and nonreinforcement. In A. H. Black & W. F. Prokasy (Eds.), Classical Conditioning II (pp. 64–99). Appleton-Century-Crofts.
- Garcia, J., & Koelling, R. A. (1966). Relation of cue to consequence in avoidance learning. Psychonomic Science, 4(1), 123–124.
- Watson, J. B., & Rayner, R. (1920). Conditioned emotional reactions. Journal of Experimental Psychology, 3(1), 1–14.
- Thorndike, E. L. (1898). Animal intelligence: An experimental study of the associative processes in animals. Psychological Review Monograph Supplements, 2(4), i–109.
- Skinner, B. F. (1938). The Behavior of Organisms. Appleton-Century.
- Gershoff, E. T. (2002). Corporal punishment by parents and associated child behaviors and experiences: A meta-analytic and theoretical review. Psychological Bulletin, 128(4), 539–579.
- Tolman, E. C., & Honzik, C. H. (1930). Introduction and removal of reward, and maze performance in rats. University of California Publications in Psychology, 4, 257–275.
- Tolman, E. C. (1948). Cognitive maps in rats and men. Psychological Review, 55(4), 189–208.
- Köhler, W. (1925). The Mentality of Apes. Harcourt, Brace.
- Bandura, A., Ross, D., & Ross, S. A. (1961). Transmission of aggression through imitation of aggressive models. Journal of Abnormal and Social Psychology, 63(3), 575–582.
- Bandura, A. (1977). Social Learning Theory. Prentice-Hall.
- Bandura, A. (1977). Self-efficacy: Toward a unifying theory of behavioral change. Psychological Review, 84(2), 191–215.
- Lepper, M. R., Greene, D., & Nisbett, R. E. (1973). Undermining children’s intrinsic interest with extrinsic reward: A test of the “overjustification” hypothesis. Journal of Personality and Social Psychology, 28(1), 129–137.
- Deci, E. L., Koestner, R., & Ryan, R. M. (1999). A meta-analytic review of experiments examining the effects of extrinsic rewards on intrinsic motivation. Psychological Bulletin, 125(6), 627–668.