资讯动态

准大二学生从0开始学AI——机器学习Day25

发布时间:2026/8/20 9:35:16 来源:尧图企业网站定制
---type: daily_notetitle: 强化学习收官DQN 学习状态值函数 算法优化 C3 总结date: 2026-08-18person: 吴恩达phase: 2.3topics:[月球着陆器连续状态示例,学习状态值函数 DQN,训练数据 Bellman 造的 (x→y) 配对,改进神经网络结构一次输出全部 Q,ε-贪婪策略,小批量与软更新,强化学习的现状,]---# 2026-08-18 学习笔记## 笔记区### 核心观点- **#136 月球着陆器**连续状态 RL 的实例。状态 位置、速度、角度等**连续量**模拟器实时给的仪表盘读数动作 有限的 **4 个喷气选择**不喷/左/右/主。状态连续无限 → 离散 Q 表建不出来。- **#137 学习状态值函数DQN**Q 表建不出来就**用神经网络逼近 Q(s,a)**。核心是训练数据哪来——**不是现成的是自己生的**先用一个瞎猜的 Q 当拐杖对一批状态, 动作用 Bellman 算出目标值 y这一步的奖励 折扣×下一步最大 Q凑成状态, 动作→ y的训练集训练出更好的 Q再反过来造更准的数据越滚越准。- **#138 改进神经网络结构**改进后网络**一次输出全部 4 个动作的 Q 值**不用每个动作单独跑一遍网络省时。- **#139 ε-贪婪策略**以概率 ε **偶尔随机选动作**保证探索——避免初始的坏 Q 让智能体**永远不尝试某些动作**。- **#140 小批量与软更新可选**小批量 大训练集上拿一小批样本就更新一次快、精度略降软更新 新 Q 和旧 Q 按比例掺新 Q 只占很小比重、旧 Q 留大头因为 Q 可能错一次只挪一点点学习更平稳。- **#141 强化学习的现状**Deep RL 在游戏/棋类领域已超人类围棋、Dota但现实应用仍比监督学习受限——**对参数敏感动一下就翻车、训练烧时间模拟里行、现实里难落地**。### 关键方法/流程**DQN 学 Q 函数#137**Q 表建不出来状态连续无限→ 先瞎猜一个 Q→ 对一批 (状态, 动作) 用 Bellman 算目标值 y r γ×max Q(s′,a′)→ 配对成训练集 (x → y)→ 训练神经网络 → 得到更好的 Q→ 用更好的 Q 再造更准的数据 → 迭代**训练数据 环境流水账 Bellman 答案#137**环境读数模拟器每步给的状态 输入不是训练数据每条流水账状态 → 动作 → 奖励 → 新状态用 Bellman 给每条流水账算答案 y输入 答案配对 训练数据喂给网络学的样本集**算法优化三连#138-#140**架构一次输出全部动作的 Q → 省时ε-greedyε 概率随机选 → 保探索小批量 软更新更新快 学习稳### 实战记录- 用 bellman 方程一点点逼近到最大的 Q这个就是正确答案训练数据 你看到的那个 Bellman 填的x→y表格- 训练数据是环境读数的流水账 Bellman 算的答案配对出来的- DQN 类比深度学习强化学习有点像之前 for 和向量化对比的感觉——状态无限枚举不完那我不干了直接一次性输出完- 一次只更新一点点Q 有可能是错的所以说得精进新 Q 占 1%、旧 Q 留 99%- RL 现状RL 现在不成熟……对参数很敏感动一下就容易出事耗费大量时间而之前的算法就稳定点RL模拟可能好现实可能一坨狗屎---## 线索区学完后合上材料自问自答**Q: 连续状态下 Q 表建不出来怎么学 Q 函数**A: 用神经网络逼近。先瞎猜一个 Q用 Bellman 对一批状态, 动作算出目标值 y凑成训练集训练网络得到更好的 Q再迭代。**Q: 训练数据到底从哪来**A: 不是现成的。智能体在模拟器里玩每步记流水账状态、动作、奖励、新状态用 Bellman 给每条流水账算答案 y流水账输入 Bellman 答案配对 训练数据。**Q: 为什么改进网络结构一次输出 4 个 Q**A: 不用每个动作单独跑一遍网络一次全出省时。**Q: ε-贪婪策略解决什么问题**A: 以概率 ε 随机选动作保证探索。避免初始坏 Q 让智能体永远不尝试某些动作。**Q: 小批量和软更新各解决什么**A: 小批量大训练集更新更快精度略降软更新新 Q 和旧 Q 按比例掺学习更稳定。**Q: 强化学习现在强在哪、弱在哪**A: 强游戏/棋类超人类弱对参数敏感、训练烧时间、模拟好现实难比监督学习不成熟。---## 总结50字以内连续状态 Q 表建不出来就用神经网络从 Bellman 造的训练数据里学出 QDQN再加改进架构、ε-贪婪、小批量、软更新四招RL 强在游戏、弱在现实。C3 收官。---## 复习卡片| 概念 | 一句话 | 我的场景 || ---------- | ----------------------------------------- | ---------------------- || 月球着陆器 | 状态连续位置/速度/角度动作 4 个喷气 | 模拟器实时给状态读数 || 训练数据 | Bellman 算的x→y配对自己生的 | 表格左边 Q、右边答案 || 改进架构 | 一次输出全部动作的 Q省时 | 不用每个动作单独跑 || ε-贪婪策略 | ε 概率随机选保证探索 | 防永远不试某动作 || 小批量 | 一小批样本更新一次快、精度略降 | 大训练集提速 || 软更新 | 新 Q 旧 Q 按比例掺新占 1%学习稳定 | 一次只挪一点点 || RL 现状 | 游戏超人类现实落地难 | 参数敏感模拟好现实难 |

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价