设想一个简化的接球游戏:屏幕上方的小球正在下落,你只能让底部挡板左移、右移或不动。接住得分,漏掉结束这一局。
现在不提供“此刻应该左移”的逐步示范,只让程序看到画面、选择动作、得到结果。它怎样从胡乱移动,变成较可靠地接球?
讲到这里,时间需要回拨。强化学习与控制研究远早于今天的大语言模型Agent。1992年的Q-learning论文已经讨论如何根据行动后果改善选择;2013年的深度Q网络研究则将深度神经网络与这种路线结合,用于Atari游戏。1 2
分数没有告诉它,刚才哪一步值得表扬
先把游戏拆开。环境是负责推进游戏并返回画面的系统;动作是左移、右移等允许操作;观察是程序能看到的内容;奖励是每一步收到的数值反馈。
环境的真实状态,还可能包括小球速度等信息。一张截图里的球在同一位置,可以正往左下,也可以往右上。单看这一帧未必能决定下一步。连续画面或历史信息,有助于区分这些情况。
策略,就是根据当前可用信息选择动作的办法。强化学习希望通过经验调整策略,让累计结果更好,而不是每一帧都得到人工标准动作。2
设想挡板第一步右移,第二步继续右移,第三步停下,第四步接住球。得分在第四步出现,却与此前移动有关。如果只表扬最后的“不动”,机器可能练成一位站着等球的哲学家。
这就是长期后果给学习带来的困难:眼前没有奖励,不表示这一步没价值;眼前得了一点奖励,也未必值得牺牲后面更大的机会。相较于文本预测中直接知道下一个真实词元,行动学习的反馈往往更间接、更延迟。
给动作估计长期价值
Q-learning提供一种思路:为“处在某种状态时,采取某个动作”估计未来能取得的累计回报。Q值是这类动作价值估计,不是这个动作像不像人类玩家。
设想当前右移还不得分,但右移后到达的位置,更有机会在下一步接住球。系统用这一步实际收到的奖励,加上对下一状态未来价值的估计,来修正刚才“右移”的价值。
当接球附近的状态逐渐学到较高价值,经过反复更新,这种信息可以影响更早的选择。未来回报通常还按距离作折扣,使较远的收益在当前计算中占较小权重。折扣比例是一项设定,不是机器对人生失去了耐心。1
这个学习过程起初会依赖不准确的估计。1992年论文的收敛结论有明确条件,包括相应的状态动作访问与学习率要求;不能把表格表示下的结论直接搬给任意深度网络,说只要玩得久就保证最优。
选择动作时还要探索。若机器最初碰巧觉得“不动”最好,从此再不尝试右移,就无法知道右移可能更好。一种简单办法是多数时候选当前估计较好的动作,少数时候随机尝试。探索牺牲一部分眼前表现,换取新的经验。
动作价值把问题从“记住哪次得分”推进到“哪些早期选择通往好结果”。分数仍然晚来,但功劳开始有路往前找。
屏幕那么大,总不能每张截图单开一行表格
如果每一种可能画面都要单独记录左、右、不动的价值,表格会大得无法实际使用。2013年的深度Q网络,常简称DQN,用神经网络根据画面表示估计动作价值,让不同但相关的画面共享计算经验。2
论文使用卷积神经网络处理视觉输入。卷积的一项基本操作,是用共享的小范围计算在图像不同位置提取局部模式,再进一步组合。它适合从像素中取得有用特征;这条路线并没有使用后来才发表的Transformer。
在我们的接球设想中,小球向右挪一点,画面不同,却与原来的接球问题相近。网络有机会利用共同特征作出价值估计,不必为每个像素位置从零积攒一整套独立经验。
DQN还保存经历过的状态、动作、奖励和后续状态,再从中抽取样本训练,这叫经验回放。它一方面重复利用经验,一方面减少只连续学习相邻画面造成的强相关影响。这个想法也有更早研究,不能把整套深度学习与强化学习的历史都归给一篇论文。2
回放不是让挡板现场倒带。游戏可以继续向前,训练程序则从经验库抽取旧片段。运动员在场上接球,教练组在旁边翻录像,只不过这里的“教练组”也是计算。
学会拿分,为什么还不等于懂了游戏世界?
设想规则改成“只要挡板不断左右移动就加分”。程序可能学会疯狂摇摆,即使经常漏球。它优化的是我们给出的奖励,设计者心里的“优秀接球手”不会自动补进目标。
这与第十一篇的偏好训练连在一起:反馈怎样定义,会影响学出什么行为。评价讨喜的回答、核对程序结果、统计游戏得分,是不同奖励来源,不能因为都叫强化学习,就认为条件和能力范围相同。
还有一个对后面很关键的区别:上述Q学习可以直接学习动作价值,不必另外建立一个能预测下一幅画面的模型。这里的“无模型”,指不显式学习环境转移模型,不是说它没有神经网络这个机器学习模型。1 2
于是它可能知道“此刻右移较好”,却没有一套可供我们询问“连续右移三步,球和挡板将怎样变化”的环境预测器。行动策略与环境模型,是不同的东西。
标题的答案是:机器通过尝试动作、接收后果、更新对长期价值的估计,逐步改善策略。没人逐帧教它,不意味着没有游戏规则、奖励设计、数据和训练条件。
可如果每次尝试都要付出真实成本呢?游戏挡板坏不了,机器人撞一次货架却有账单。下一篇,我们要给行动系统增加一种能力:先预测可能发生什么,再利用这些预测练习。