Microduck 强化学习站

跟严师·Microduck 强化学习学

首页章节笔记图与动画

总体学习计划

目标
从零系统学习机器学习与强化学习,能自己设计并训练强化学习策略(奖励设计、PPO、域随机化、sim2real),在 MuJoCo 仿真中训练 Microduck 双足小鸭行走,实体鸭到货后部署上去
验收标准
仿真中 Microduck 平地稳定前行 20 秒不摔、速度跟上指令、3 个随机种子都成功;加 20 ms 控制延迟和侧向推搡后仍能走;能独立解释并调 PPO;有可用的策略导出和部署脚本
截止
2027-01-04
每天
每天 2 小时
落后时砍掉
落后时依次砍:1 手写 PPO 改为读懂库的源码;2 Q-learning 代码实现改为只做交互图;3 并行训练改为本地少量训练;4 鲁棒性测试只保留延迟和推搡两项
每日进度:4 / 15 天(27%)

章节

章节进度:1 / 9 章(11%)
#章节难度主要内容天数目标 / 完成标准状态互动页
1第1章 强化学习基本概念入门4理解状态、动作、奖励、回报与折扣、策略与价值、探索与利用
完成标准:阶段小测通过(已于 2026-10-02 通过)
已完成ch1-reward-hacking
ch1-discount
ch1-td-advantage
ch1-explore-exploit
2第2章 Python、NumPy 和数学摸底补课入门5NumPy 数组运算、概率与期望、导数与梯度
完成标准:能用 NumPy 算出一段回报;能手推一个简单函数的梯度
进行中数组形状与广播(待做)
折扣权重与代码对照(待做)
采样平均收敛(待做)
梯度下降小球(待做)
链式法则计算图(待做)
3第3章 机器学习与神经网络进阶8损失函数、梯度下降、PyTorch 自动求导、过拟合
完成标准:用 PyTorch 从零训练一个小网络并能解释损失曲线
未开始线性回归与损失(待做)
学习率对梯度下降的影响(待做)
观测→网络→动作结构图(待做)
过拟合与验证曲线(待做)
4第4章 经典强化学习进阶8MDP、贝尔曼方程、价值迭代、Q-learning
完成标准:在网格世界中手算并用代码算出价值和策略
未开始MDP 价值网格(拖 γ 和奖励看价值与策略箭头)(待做)
价值迭代分步(待做)
Q-learning 探索率对比(待做)
5第5章 策略梯度和 PPO高阶12REINFORCE、优势、actor-critic、GAE、PPO clip
完成标准:stable-baselines3 跑通 CartPole 和 Pendulum,再自写 PPO 跑通
未开始策略梯度直觉(动作概率随优势上调下调)(待做)
GAE λ 权重(待做)
PPO clip 示意(待做)
学习曲线对比(超参与种子)(待做)
6第6章 MuJoCo 仿真入门高阶8模型文件、关节和电机、Gymnasium 环境封装
完成标准:自己封装 MuJoCo 环境并训练倒立摆成功
未开始关节 PD 控制响应(待做)
倒立摆状态与控制(待做)
观测与动作归一化和限幅(待做)
7第7章 Microduck 双足行走训练高阶14观测与动作设计、奖励设计、并行训练、调参
完成标准:仿真中平地稳定前行 20 秒不摔,速度跟上指令,3 个随机种子都成功
未开始奖励分量堆叠图(待做)
观测与动作设计结构图(待做)
步态相位与参考动作(待做)
训练前后对比(待做)
8第8章 鲁棒性和 sim2real高阶8域随机化、延迟、噪声、推搡测试、导出策略
完成标准:加 20 ms 延迟和侧向推搡后仍能走;部署脚本就绪
未开始域随机化参数范围(待做)
控制延迟对稳定性的影响(待做)
推搡恢复测试(待做)
9第9章 实机部署高阶0实体鸭到货后部署策略
完成标准:真机上能走起来(天数机动,约 2027 年 1 月初)
未开始部署检查流程图(待做)

每日路线

天内容说明状态级别
1强化学习在干什么:智能体、环境、状态、动作、奖励2026-10-02;配图 ch1-reward-hacking已完成入门
2回报与折扣因子2026-10-02;配图 ch1-discount已完成入门
3策略与价值函数,好坏 = r + γV新 − V旧2026-10-02;配图 ch1-td-advantage已完成入门
4探索与利用 + 阶段小测2026-10-02;配图 ch1-explore-exploit;小测通过已完成入门
5Python 摸底与 NumPy 数组基础10/3;配图 数组形状与广播未开始入门
6用 NumPy 向量化计算回报10/4;配图 折扣权重与代码对照未开始入门
7概率与期望:采样平均10/5;配图 采样平均收敛未开始入门
8导数与梯度10/6;配图 梯度下降小球未开始进阶
9链式法则 + 第 2 章小测10/7;配图 链式法则计算图分步演示未开始进阶
10第 3 章 机器学习与神经网络(逐日路线开章时补)10/8–10/15未开始进阶
18第 4 章 经典强化学习(逐日路线开章时补)10/16–10/23未开始进阶
26第 5 章 策略梯度和 PPO(逐日路线开章时补)10/24–11/4未开始高阶
38第 6 章 MuJoCo 仿真入门(逐日路线开章时补)11/5–11/12未开始高阶
46第 7 章 Microduck 双足行走训练(逐日路线开章时补)11/13–11/26未开始高阶
60第 8 章 鲁棒性和 sim2real(逐日路线开章时补)11/27–12/4未开始高阶

章节笔记

图与动画

互动页