학습 — 고전적 조건형성, 조작적 조건형성, 인지적 학습, 관찰 학습, 보상과 내재 동기
경험은 어떻게 행동을 바꿀까요? 파블로프의 개와 가르시아 효과, 스키너의 강화 계획과 처벌의 한계, 톨먼의 인지 지도, 반두라의 보보 인형 실험과 자기효능감, 보상이 흥미를 떨어뜨리는 과잉 정당화 효과까지 대학 수준으로 정리했어요.
마지막 검토 2026-09-29
학습이란 무엇일까
심리학에서 학습은 경험을 통해 생기는 비교적 오래가는 행동이나 지식의 변화를 말해요. 피로나 약물처럼 일시적인 변화, 성숙처럼 경험과 상관없는 변화는 학습에 넣지 않아요.
20세기 초 왓슨(Watson, 1913)은 심리학이 의식 같은 보이지 않는 것 대신 관찰할 수 있는 행동을 연구해야 한다고 주장하며 행동주의를 열었어요. 학습 연구는 이 흐름 속에서 심리학 최초의 정교한 실험 전통이 됐어요.
고전적 조건형성: 신호를 배우다
파블로프의 발견
러시아의 생리학자 파블로프(Pavlov, 1927)는 소화를 연구하다가, 개가 먹이를 보기도 전에 먹이를 주는 사람의 발소리만 듣고도 침을 흘린다는 것을 발견했어요.
| 용어 | 뜻 | 파블로프의 예 |
|---|---|---|
| 무조건 자극(US) | 배우지 않아도 반응을 일으키는 자극 | 먹이 |
| 무조건 반응(UR) | US에 대한 타고난 반응 | 침 흘리기 |
| 조건 자극(CS) | 원래 중립이었지만 US와 짝지어진 자극 | 종소리 |
| 조건 반응(CR) | CS만으로 나타나는 학습된 반응 | 종소리에 침 흘리기 |
학습된 반응은 CS만 계속 주면 약해지고(소거), 쉬었다 다시 CS를 주면 잠깐 되살아나요(자발적 회복). 비슷한 자극에도 반응하는 일반화와, 다른 자극에는 반응하지 않는 변별도 함께 일어나요.
짝짓기보다 ‘예측’이 중요하다
레스콜라(Rescorla, 1968)는 CS와 US가 여러 번 함께 나타나도, US가 CS 없이도 자주 나타나면 조건형성이 잘 일어나지 않는다는 것을 보여 줬어요. 동물이 배우는 것은 단순한 짝이 아니라 “이 신호가 그 사건을 예측하는가”라는 정보라는 뜻이에요. 레스콜라-와그너 모델(1972)은 이를 예측 오류를 줄여 가는 학습으로 수식화했어요.
모든 연결을 똑같이 배우지는 않는다
가르시아와 쾨링(Garcia & Koelling, 1966)의 쥐는 맛과 뒤이은 구토는 한 번 만에 연결했지만, 빛·소리와 구토는 잘 연결하지 못했어요. 반대로 빛·소리와 전기 충격은 잘 연결했지요. 생물은 생존에 중요한 연결을 더 쉽게 배우도록 준비되어 있다는 뜻이에요. 한 번 체한 음식이 오래 싫어지는 이유도 여기에 있어요.
공포의 학습과 소거
왓슨과 레이너(Watson & Rayner, 1920)는 생후 11개월의 ‘어린 앨버트’에게 흰쥐를 보여 줄 때 큰 소리를 내, 흰쥐와 비슷한 털 있는 물건까지 무서워하게 만들었다고 보고했어요. 오늘날 기준으로는 윤리적으로 허용될 수 없는 실험이고 방법도 엉성했지만, 공포가 학습될 수 있다는 생각은 이후 연구로 뒷받침됐어요. 불안장애의 노출 치료는 두려운 자극을 안전한 상황에서 반복해 경험하게 하는 소거 학습에 기반해요.
조작적 조건형성: 결과에서 배우다
효과의 법칙과 스키너 상자
손다이크(Thorndike, 1898)는 문제 상자에 갇힌 고양이가 우연히 빗장을 풀고 탈출한 뒤, 점점 더 빨리 빠져나오는 것을 관찰했어요. 만족스러운 결과를 낳은 행동은 강해진다는 효과의 법칙이에요. 스키너(Skinner, 1938)는 이를 체계화해, 행동이 결과에 의해 조형된다는 조작적 조건형성을 연구했어요.
| 무언가를 준다 | 무언가를 없앤다 | |
|---|---|---|
| 행동이 늘어난다 | 정적 강화(칭찬, 용돈) | 부적 강화(안전벨트를 매면 경고음이 꺼짐) |
| 행동이 줄어든다 | 정적 처벌(꾸중) | 부적 처벌(게임 시간 빼앗기) |
‘부적 강화’를 처벌로 헷갈리기 쉬운데, 불쾌한 것을 없애서 행동을 늘리는 것이에요.
강화 계획
| 계획 | 규칙 | 행동 패턴 | 예 |
|---|---|---|---|
| 고정 비율 | 정해진 횟수마다 보상 | 빠르게 반응, 보상 뒤 잠깐 멈춤 | 10개 찍으면 커피 1잔 |
| 변동 비율 | 평균 횟수마다, 예측 불가 | 매우 빠르고 꾸준, 소거에 가장 강함 | 슬롯머신, 뽑기 |
| 고정 간격 | 정해진 시간 뒤 첫 반응에 보상 | 마감 직전에 몰림 | 월급, 정기 시험 |
| 변동 간격 | 평균 시간마다, 예측 불가 | 느리지만 꾸준 | 메시지 확인하기 |
변동 비율 계획이 도박과 확률형 아이템에 쓰이는 이유가 이 표에 있어요. 언제 보상이 올지 모르니 멈추기 어려워요.
조형과 처벌의 한계
원하는 행동에 가까워질 때마다 조금씩 강화하는 조형으로, 동물에게 복잡한 행동을 가르칠 수 있어요. 반면 처벌은 즉각적으로 행동을 멈추게 할 수는 있지만, 무엇을 해야 하는지는 알려 주지 않아요. 아동에 대한 체벌 연구를 모은 메타분석에서, 체벌은 즉각적인 순응과는 관련이 있었지만 공격성 증가, 부모-자녀 관계 악화 같은 부정적 결과와 꾸준히 관련이 있었어요(Gershoff, 2002).
인지적 학습: 머릿속 지도
행동주의가 설명하기 어려운 현상도 있었어요. 톨먼과 혼지크(Tolman & Honzik, 1930)의 실험에서, 보상 없이 미로를 돌아다니기만 하던 쥐들은 뒤늦게 먹이를 주자 곧바로 처음부터 보상받은 쥐만큼 빠르게 길을 찾았어요. 보상이 없는 동안에도 미로의 인지 지도를 배우고 있었던 거예요(잠재 학습; Tolman, 1948).
쾰러(Köhler, 1925)의 침팬지는 손이 닿지 않는 바나나 앞에서 한동안 멈춰 있다가, 갑자기 상자를 쌓거나 막대를 이어 붙여 바나나를 땄어요. 시행착오가 아니라 문제의 구조를 한 번에 파악하는 통찰 학습이었지요.
관찰 학습: 남을 보고 배우다
반두라·로스·로스(Bandura, Ross & Ross, 1961)의 보보 인형 실험에서, 어른이 오뚝이 인형을 때리고 소리치는 장면을 본 아이들은 나중에 같은 행동을 훨씬 많이 따라 했어요. 직접 강화를 받지 않아도, 남을 보는 것만으로 배울 수 있다는 것을 보여 준 연구예요.
반두라(Bandura, 1977)는 관찰 학습이 네 과정으로 이루어진다고 설명했어요.
- 주의: 모델의 행동을 눈여겨봐야 해요.
- 파지: 본 것을 기억에 담아 둬야 해요.
- 재생: 그 행동을 직접 해낼 능력이 있어야 해요.
- 동기: 그 행동을 할 이유(모델이 보상받는 것을 봤는지 등)가 있어야 해요.
반두라는 또 “나는 이 일을 해낼 수 있다”는 믿음인 자기효능감이 행동의 시작과 끈기를 좌우한다고 보았어요. 자기효능감은 직접 성공해 본 경험, 비슷한 사람의 성공을 본 경험, 격려, 신체 상태의 해석에서 자라요.
보상이 흥미를 떨어뜨릴 때
레퍼·그린·니스벳(Lepper, Greene & Nisbett, 1973)은 그림 그리기를 좋아하는 유치원생들에게 ‘그리면 상장을 준다’고 약속하고 상을 줬어요. 몇 주 뒤 자유 시간에 이 아이들은 상을 받지 않은 아이들보다 그림을 덜 그렸어요. 원래 즐거워서 하던 일에 외적 보상이 붙으면, “상 때문에 했다”고 생각하게 되어 흥미가 줄어드는 과잉 정당화 효과예요.
128개 연구를 모은 메타분석에서도, 과제 수행에 따라 미리 약속된 물질적 보상은 내재 동기를 떨어뜨렸어요. 반면 예상하지 못한 보상이나 구체적인 칭찬은 그런 효과가 거의 없거나 오히려 도움이 됐어요(Deci, Koestner & Ryan, 1999). 강화는 강력한 도구이지만, 이미 즐기는 일에는 조심해서 써야 한다는 뜻이에요. 동기의 다른 측면은 다음 장에서 이어서 다뤄요.
확인 문제
문제 1. 치과에 갈 때마다 드릴 소리를 듣고 아팠던 사람이, 이제는 드릴 소리만 들어도 긴장해요. 이 상황에서 US, UR, CS, CR은 각각 무엇일까요?
풀이. US는 치료의 통증, UR은 통증에 대한 긴장·공포, CS는 드릴 소리, CR은 드릴 소리만으로 생기는 긴장이에요.
문제 2. 아이가 방을 치우면 그날 설거지를 면제해 주기로 했어요. 이것은 어떤 종류의 강화나 처벌일까요?
풀이. 싫은 일(설거지)을 없애서 원하는 행동(방 치우기)을 늘리려는 것이므로 부적 강화예요.
문제 3. 한 앱이 사용자가 접속할 때마다 무작위로 보상을 줘요. 이 방식이 사용자를 오래 붙잡아 두는 이유를 강화 계획으로 설명해 보세요.
풀이. 몇 번 만에 보상이 나올지 예측할 수 없는 변동 비율 계획에 가까워요. 이 계획은 반응률이 높고 소거에 가장 강해서, 보상이 한동안 나오지 않아도 행동을 쉽게 멈추지 않아요.
참고 문헌
- Watson, J. B. (1913). Psychology as the behaviorist views it. Psychological Review, 20(2), 158–177.
- Pavlov, I. P. (1927). Conditioned Reflexes (G. V. Anrep, Trans.). Oxford University Press.
- Rescorla, R. A. (1968). Probability of shock in the presence and absence of CS in fear conditioning. Journal of Comparative and Physiological Psychology, 66(1), 1–5.
- Rescorla, R. A., & Wagner, A. R. (1972). A theory of Pavlovian conditioning: Variations in the effectiveness of reinforcement and nonreinforcement. In A. H. Black & W. F. Prokasy (Eds.), Classical Conditioning II (pp. 64–99). Appleton-Century-Crofts.
- Garcia, J., & Koelling, R. A. (1966). Relation of cue to consequence in avoidance learning. Psychonomic Science, 4(1), 123–124.
- Watson, J. B., & Rayner, R. (1920). Conditioned emotional reactions. Journal of Experimental Psychology, 3(1), 1–14.
- Thorndike, E. L. (1898). Animal intelligence: An experimental study of the associative processes in animals. Psychological Review Monograph Supplements, 2(4), i–109.
- Skinner, B. F. (1938). The Behavior of Organisms. Appleton-Century.
- Gershoff, E. T. (2002). Corporal punishment by parents and associated child behaviors and experiences: A meta-analytic and theoretical review. Psychological Bulletin, 128(4), 539–579.
- Tolman, E. C., & Honzik, C. H. (1930). Introduction and removal of reward, and maze performance in rats. University of California Publications in Psychology, 4, 257–275.
- Tolman, E. C. (1948). Cognitive maps in rats and men. Psychological Review, 55(4), 189–208.
- Köhler, W. (1925). The Mentality of Apes. Harcourt, Brace.
- Bandura, A., Ross, D., & Ross, S. A. (1961). Transmission of aggression through imitation of aggressive models. Journal of Abnormal and Social Psychology, 63(3), 575–582.
- Bandura, A. (1977). Social Learning Theory. Prentice-Hall.
- Bandura, A. (1977). Self-efficacy: Toward a unifying theory of behavioral change. Psychological Review, 84(2), 191–215.
- Lepper, M. R., Greene, D., & Nisbett, R. E. (1973). Undermining children’s intrinsic interest with extrinsic reward: A test of the “overjustification” hypothesis. Journal of Personality and Social Psychology, 28(1), 129–137.
- Deci, E. L., Koestner, R., & Ryan, R. M. (1999). A meta-analytic review of experiments examining the effects of extrinsic rewards on intrinsic motivation. Psychological Bulletin, 125(6), 627–668.