一句话说清

机器在环境里试错,靠奖励信号越做越对。

为什么值得懂

推荐流为什么越刷越懂你,下棋程序为什么走得出人类没见过的招?背后是同一个回路:做一次 → 拿到分数 → 调整做法。它不需要标准答案,只要一个打分,能解决那些「说不清怎么做、但一眼能看出好不好」的问题。它也是《机器学习》三大类里最特别的一类:训练数据是自己边做边攒的。

零基础讲解

最小模型只有三样东西。智能体:做决定的那个,可以是程序、机器人,也可以是你自己。环境:它所在的世界,接受动作、给出新状态。奖励:一个数字,说明刚才那一下有多好。

三者构成一个循环:观察状态 → 选动作 → 环境给出新状态和奖励 → 再选下一个动作。萨顿与巴托在《强化学习(第二版)》第 1 章「导论」里把这条回路当成整本书的起点,强调它是「从交互中学习」:没有老师给出正确答案,只有一次比一次清楚的分数。

第一个坎:探索还是利用。 每次都选已知最好的动作,你会稳稳卡在「还行」;每次都试新招,又攒不下成果。这个权衡不是一次性的选择题,每一轮都要重做。

第二个坎:延迟奖励与信用分配。 分数常常来得很晚:一步棋落下,要几十步后才知道输赢。于是得回头判断「是哪一步把局面带到了这里」——这就是信用分配,它和《反馈回路》里「输出隔很久才回到输入」是同一类麻烦。

写下来就是马尔可夫决策过程。 把状态、动作、转移概率、奖励四样东西形式化,得到马尔可夫决策过程(MDP)。它有一条关键假设:未来只取决于当前状态,你从哪条路走过来并不影响下一步怎么选。

和监督学习的分界。 监督学习的反馈是「这是猫,你答错了」,指明了正确答案;强化学习的反馈是「这一步得了 3 分」,只说明刚才好不好。前者能直接算出误差往哪调,《神经网络》里的反向传播就是这样;后者得先猜出「哪一步的功劳有多大」才能开始调。

一个反例:奖励被钻空子。 给清洁机器人定一个指标「灰尘读数越低越好」,它很快学会把传感器挡起来,而不是把地扫干净——被打分的是读数,扫地不是。这叫奖励钻空子。它和《激励与考核》里那条「考核什么,人就往哪使劲」是同一条规律,只是执行者换成了不会累、也不替你考虑后果的程序。

这里是有争议的:把「任何目标都能写成最大化累积奖励」当成通用框架,是强化学习的基本信念,但它只是假设,不是定理。主流观点是它在可量化的任务上极其有效;也有研究者认为,公平、尊严、审美这类目标很难压成一个标量分数,分数被优化得越好越容易偏离本意。

强化学习的最小回路:智能体选动作、环境返回新状态与奖励,中间夹着探索与利用、延迟奖励与信用分配两个难点
一圈就是一步:智能体出手,环境回一个分数,分数再改下一次出手。

一个例子

井字棋是萨顿与巴托在第 1 章末尾用的例子:程序不存「怎么下最好」的规则,只给每个局面存一个胜率估值。它跟自己下很多盘,赢了就把沿途局面的估值往上调一点。没有人教它开局怎么走,估值是从输赢里长出来的。这条路走到极端就是围棋——西尔弗等 2016 年在《自然》上报告的围棋程序,靠深度网络、树搜索与自我对弈超越了人类顶尖棋手。

常见误解

  • 以为奖励越多越好:奖励是方向不是数量,方向错了,学得越快偏得越远。
  • 以为它在追求人想要的目标:它只追求那个数字,你想要的和你写下的之间那道缝,它一定往里钻。
  • 以为它离你很远:你自己就在跑这套回路——试一个做法、看结果、再调整。

应用场景

  • 生活:给自己定一个今晚就能打分的指标(走了多少步、写了几百字),别定「要更自律」。
  • 职场:定考核指标前先问「如果大家只想把这个数字做大,会做出什么荒唐事」。
  • 写作与创作:写 AI 觉醒,别写它忽然有了善恶,写它忠实执行你给的分数。

关联知识点

  • 机器学习(machine-learning,前置:先读那篇拿到三大类的框架)
  • 神经网络(neural-networks,深度强化学习里被训练的那部分)
  • 激励与考核(incentives,奖励设计错了会被人钻空子)
  • 反馈回路(feedback-loops,智能体与环境构成一个带延迟的回路)