Microduck 强化学习站

跟严师·Microduck 强化学习学

首页章节笔记图与动画

第 1 章 · 难度:入门 · 已完成 · 预计 4 天

第1章 强化学习基本概念:笔记

学完日期:2026-10-02。阶段小测:通过。 配套交互图:ch1-reward-hacking(奖励钻空子)、ch1-discount(折扣因子)、ch1-td-advantage(好坏/TD 误差)、ch1-explore-exploit(探索与利用)。

第1课 强化学习在干什么

奖励被钻空子(reward hacking):智能体只优化你写下的分数,不会猜你心里想要什么。

第2课 回报与折扣因子

第3课 策略与价值函数

第4课 探索与利用

阶段小测要点

  1. 概念辨析:“右膝转到 −12°”=动作;“躯干前倾 8°,左脚刚离地”=状态;输入关节数据输出电机角度的网络=策略;“这一步 +0.3 分”=奖励。
  2. 只奖励直立 → 站着不动;修法:加前进速度(跟踪)奖励,而不是笼统惩罚“不动”。
  3. γ=0.9,奖励 2、0、−1:G = 2 + 0.9×0 + 0.81×(−1) = 2 + 0 − 0.81 = 1.19。
  4. V旧=4,r=1,V新=3,γ=0.9:1 + 2.7 − 4 = −0.3 → 少做,状态变坏。
  5. 原地抖腿、奖励曲线卡在低位:原因一 探索不够卡在局部最优 → 加大探索(调大随机抖动、鼓励保持随机性);原因二 奖励有漏洞 → 加前进速度奖励,直接奖励想要的行为。

学员薄弱点(下一章继续盯)

错题本

  1. 价值函数的输入输出说错:答成“输入当前动作的打分,输出动作和策略预期得分”。正解:输入只有状态,输出一个数(预计回报);打分是拿 V 算出来的结果,不是 V 的输入。
  2. 算错符号导致结论反了:1 + 0.9×2 − 5 误算为 +2.2、结论“多做”。正解:1 + 1.8 − 5 = −2.2,比预期差,应少做。
  3. 符号混用:把 γ=0 写成 r=0。r 是奖励,γ 是折扣因子。
  4. 部署时是否保留抖动,没先给结论:只说“真机上保持稳定测试,有异常再回训练环境调整”。正解:先答“不保留”,再讲两条理由(不再学习;乱抖危险)。
  5. 小测第 3 题没算出结果:只列了 G = 2 + 0.9×0 + 0.9²×(−1),没写最终值。正解:G = 1.19。

下一步

第 2 章:Python、NumPy 和数学摸底补课(之后进入 PPO 前的铺垫)。

本章互动页

ch1-reward-hacking
ch1-discount
ch1-td-advantage
ch1-explore-exploit

互动页可直接打开,或下载后用浏览器打开。教学示意,非真实数据/规格。