学习 — 经典条件作用、操作性条件作用、认知学习、观察学习、奖励与内在动机
经验如何改变行为?巴甫洛夫的狗与加西亚效应、斯金纳的强化程序与惩罚的局限、托尔曼的认知地图、班杜拉的波波玩偶实验与自我效能感,以及奖励削弱兴趣的过度理由效应,本文以大学水平加以梳理。
最后审阅 2026-09-29
什么是学习
在心理学中,学习是指由经验引起的、相对持久的行为或知识变化。疲劳或药物带来的暂时变化,以及成熟这类与经验无关的变化,都不算学习。
20 世纪初,华生(Watson, 1913)主张心理学应研究可观察的行为,而不是意识这类看不见的东西,由此开创了行为主义。学习研究在这一潮流中成为心理学第一个精密的实验传统。
经典条件作用:学会信号
巴甫洛夫的发现
俄国生理学家巴甫洛夫(Pavlov, 1927)在研究消化时发现,狗在看到食物之前,只要听见喂食者的脚步声就会流口水。
| 术语 | 含义 | 巴甫洛夫的例子 |
|---|---|---|
| 无条件刺激(US) | 无需学习就能引起反应的刺激 | 食物 |
| 无条件反应(UR) | 对 US 的先天反应 | 流口水 |
| 条件刺激(CS) | 原本中性、与 US 配对的刺激 | 铃声 |
| 条件反应(CR) | 仅由 CS 引起的习得反应 | 听到铃声流口水 |
如果只反复呈现 CS,习得的反应会减弱(消退);停一段时间再呈现 CS,反应又会短暂恢复(自发恢复)。同时还会出现对相似刺激也作出反应的泛化,以及对不同刺激不作反应的分化。
比起配对,“预测”更重要
雷斯科拉(Rescorla, 1968)发现,即使 CS 与 US 多次同时出现,只要 US 在没有 CS 时也经常出现,条件作用就不容易形成。动物学到的不是简单的配对,而是”这个信号能否预测那个事件”这一信息。雷斯科拉-瓦格纳模型(1972)把它表述为不断减少预测误差的学习。
并非所有联结都同样容易学会
在加西亚与克林(Garcia & Koelling, 1966)的实验中,大鼠只经历一次就能把味道与随后的恶心联系起来,却很难把光、声音与恶心联系起来;反过来,它们很容易把光、声音与电击联系起来。生物天生有所准备,更容易学会与生存相关的联结。吃坏过一次肚子的食物会让人长期敬而远之,原因就在这里。
恐惧的习得与消退
华生与雷纳(Watson & Rayner, 1920)报告说,他们在给 11 个月大的”小艾伯特”看白鼠时制造巨响,使他害怕白鼠乃至类似的毛绒物品。按今天的标准,这是伦理上不可接受的实验,方法也很粗糙,但恐惧可以被习得这一观点得到了后续研究的支持。焦虑障碍的暴露疗法正是建立在消退学习之上:在安全的情境中反复接触让人害怕的刺激。
操作性条件作用:从结果中学习
效果律与斯金纳箱
桑代克(Thorndike, 1898)观察到,被关在迷箱里的猫偶然拨开门闩逃出后,逃出的速度越来越快。这就是效果律:带来满意结果的行为会得到加强。斯金纳(Skinner, 1938)将其系统化,研究行为被结果塑造的操作性条件作用。
| 给予某物 | 拿走某物 | |
|---|---|---|
| 行为增加 | 正强化(表扬、零花钱) | 负强化(系好安全带,提示音就停了) |
| 行为减少 | 正惩罚(责骂) | 负惩罚(没收游戏时间) |
“负强化”很容易与惩罚混淆,它指的是通过拿走令人不快的东西来增加行为。
强化程序
| 程序 | 规则 | 行为模式 | 例子 |
|---|---|---|---|
| 固定比率 | 每达到固定次数给予奖励 | 反应快,得奖后短暂停顿 | 集满 10 个章换一杯咖啡 |
| 可变比率 | 按平均次数、不可预测 | 非常快而稳定,最抗消退 | 老虎机、抽卡 |
| 固定间隔 | 固定时间后的第一次反应获奖 | 临近期限时集中反应 | 月薪、定期考试 |
| 可变间隔 | 按平均时间、不可预测 | 慢但稳定 | 查看消息 |
可变比率程序之所以被用于赌博和抽卡,原因就在这张表里:不知道下一次奖励何时到来,就很难停下来。
塑造与惩罚的局限
通过每当行为更接近目标就给予一点强化的塑造,可以教会动物复杂的行为。惩罚则虽然能立即制止行为,却不能告诉对方应该做什么。一项汇总儿童体罚研究的元分析发现,体罚与即时服从有关,但也稳定地与攻击性增加、亲子关系恶化等负面结果相关(Gershoff, 2002)。
认知学习:脑中的地图
有些现象是行为主义难以解释的。在托尔曼与洪齐克(Tolman & Honzik, 1930)的实验中,一直在迷宫里闲逛、没有得到奖励的大鼠,后来一给食物,马上就能像一开始就得到奖励的大鼠一样快速找到出路。它们在没有奖励时也在学习迷宫的认知地图(潜伏学习;Tolman, 1948)。
苛勒(Köhler, 1925)的黑猩猩面对够不着的香蕉,会停顿一会儿,然后突然把箱子叠起来或把棍子接起来去取香蕉。这不是试误,而是一下子把握问题结构的顿悟学习。
观察学习:看别人就能学会
在班杜拉、罗斯与罗斯(Bandura, Ross & Ross, 1961)的波波玩偶实验中,看过成人殴打、吼叫充气不倒翁玩偶的儿童,事后模仿同样行为的次数多得多。这项研究表明,即使自己没有得到强化,人仅仅通过观察他人也能学习。
班杜拉(Bandura, 1977)认为观察学习包含四个过程。
- 注意:要留意榜样的行为。
- 保持:要把看到的内容记在记忆里。
- 再现:要有亲自做出该行为的能力。
- 动机:要有做这件事的理由(例如看到榜样得到奖励)。
班杜拉还认为,“我能做到”这一信念——自我效能感——左右着人是否开始行动以及能坚持多久。自我效能感来自亲身的成功经验、看到相似的人成功、他人的鼓励,以及对身体状态的解读。
当奖励削弱兴趣时
莱珀、格林与尼斯贝特(Lepper, Greene & Nisbett, 1973)向喜欢画画的幼儿园孩子承诺”画了就给奖状”,并兑现了奖励。几周后的自由活动时间里,这些孩子画得比没得奖的孩子少。原本因为有趣而做的事一旦附上外部奖励,人就会认为”我是为了奖才做的”,兴趣随之下降——这就是过度理由效应。
一项汇总 128 项研究的元分析也发现,按任务表现事先承诺的物质奖励会削弱内在动机;而意料之外的奖励和具体的表扬几乎没有这种效应,甚至有所帮助(Deci, Koestner & Ryan, 1999)。强化是强有力的工具,但对人们本来就喜欢的事要谨慎使用。动机的其他方面将在下一章继续讨论。
检查题
问题 1. 某人每次在牙科听到钻头声都会感到疼痛,如今一听到钻头声就紧张。这里的 US、UR、CS、CR 分别是什么?
解答. US 是治疗带来的疼痛,UR 是对疼痛的紧张与恐惧,CS 是钻头声,CR 是仅由钻头声引起的紧张。
问题 2. 规定孩子打扫了房间,当天就免洗碗。这属于哪种强化或惩罚?
解答. 通过拿走令人讨厌的事(洗碗)来增加期望行为(打扫房间),所以是负强化。
问题 3. 某应用在用户每次登录时随机发放奖励。请用强化程序解释它为何能长时间留住用户。
解答. 它接近无法预测第几次会得到奖励的可变比率程序。这种程序反应率高、最抗消退,即使一段时间没有奖励,人们也不容易停下来。
参考文献
- Watson, J. B. (1913). Psychology as the behaviorist views it. Psychological Review, 20(2), 158–177.
- Pavlov, I. P. (1927). Conditioned Reflexes (G. V. Anrep, Trans.). Oxford University Press.
- Rescorla, R. A. (1968). Probability of shock in the presence and absence of CS in fear conditioning. Journal of Comparative and Physiological Psychology, 66(1), 1–5.
- Rescorla, R. A., & Wagner, A. R. (1972). A theory of Pavlovian conditioning: Variations in the effectiveness of reinforcement and nonreinforcement. In A. H. Black & W. F. Prokasy (Eds.), Classical Conditioning II (pp. 64–99). Appleton-Century-Crofts.
- Garcia, J., & Koelling, R. A. (1966). Relation of cue to consequence in avoidance learning. Psychonomic Science, 4(1), 123–124.
- Watson, J. B., & Rayner, R. (1920). Conditioned emotional reactions. Journal of Experimental Psychology, 3(1), 1–14.
- Thorndike, E. L. (1898). Animal intelligence: An experimental study of the associative processes in animals. Psychological Review Monograph Supplements, 2(4), i–109.
- Skinner, B. F. (1938). The Behavior of Organisms. Appleton-Century.
- Gershoff, E. T. (2002). Corporal punishment by parents and associated child behaviors and experiences: A meta-analytic and theoretical review. Psychological Bulletin, 128(4), 539–579.
- Tolman, E. C., & Honzik, C. H. (1930). Introduction and removal of reward, and maze performance in rats. University of California Publications in Psychology, 4, 257–275.
- Tolman, E. C. (1948). Cognitive maps in rats and men. Psychological Review, 55(4), 189–208.
- Köhler, W. (1925). The Mentality of Apes. Harcourt, Brace.
- Bandura, A., Ross, D., & Ross, S. A. (1961). Transmission of aggression through imitation of aggressive models. Journal of Abnormal and Social Psychology, 63(3), 575–582.
- Bandura, A. (1977). Social Learning Theory. Prentice-Hall.
- Bandura, A. (1977). Self-efficacy: Toward a unifying theory of behavioral change. Psychological Review, 84(2), 191–215.
- Lepper, M. R., Greene, D., & Nisbett, R. E. (1973). Undermining children’s intrinsic interest with extrinsic reward: A test of the “overjustification” hypothesis. Journal of Personality and Social Psychology, 28(1), 129–137.
- Deci, E. L., Koestner, R., & Ryan, R. M. (1999). A meta-analytic review of experiments examining the effects of extrinsic rewards on intrinsic motivation. Psychological Bulletin, 125(6), 627–668.