2020李宏毅学习笔记——69 RL Advanced Version 5.Q-learning（Continuous Action）

时间 2021-01-13

原文原文链接

连续行动: 在某些情况下，action是一个连续向量（比如驾驶类游戏，需要决定一个连续的角度）在这种情况下，Q learning 并不是一个用来寻找最佳action的好方法解决方式一: 采样一系列行动，看哪个行动会返回最大的Q值解决方式二: 使用梯度上升来解决这个优化问题（具有较高的计算成本）解决方式三: 设计一个网络来使得这个优化过程更简单这里 ∑ 和 μ 是高斯分布的方差和均值，因此

>>阅读原文<<