Felix的个人博客
  • 首页
  • 文章分类
    • Python
    • 深度学习基础
    • 机器学习算法
    • 架构设计
    • 其他
  • Python 基础教程
  • Go 基础教程
  • Rust 基础教程
  • 关于我

强化学习

文章数:8 文章阅读量:3501

REINFORCE 算法

REINFORCE 算法是最经典、最基础的 Policy Gradient(策略梯度)算法,由 Ronald J. Williams (1992) 提出,直接对策略建模,寻找到最优的策略使得总体回报的期望最高。从实验的结果来看,与 DQN 相比,效果及稳定性要低于 DQN。

发布博客 2026-04-11 22:43
435 次阅读

策略梯度原理

直接对策略建模,而非求动作价值函数 Q,再转换出具体的动作

发布博客 2026-04-11 18:02
428 次阅读

Deep Q-Network

通过神经网络对动作状态函数建模,从而解决传统基于 Q-Table 这种只能处理离散状态的问题,同时通过经验回放,缓慢更新等策略,确保在 DQN 中训练的稳定性。

发布博客 2026-04-11 14:04
439 次阅读

Q-Learning 算法

Sarsa 算法和 Q-Learning 算法都是基于时序差分的算法,不同的是 Sarsa 算法是 on-policy 算法,而 Q-Learning 算法是 off-policy 算法。

发布博客 2026-04-09 00:58
358 次阅读

Sarsa 算法

在时序差分算法中,代表的算法有 Sarsa 算法和 Q-Learning 算法。本文聚焦在 Sarsa 算法。

发布博客 2026-04-08 22:54
537 次阅读

蒙特卡洛方法

蒙特卡洛方法(Monte-Carlo method)是一种基于采样估计的方法,完全不需要事先知道模型,而是通过让智能体与环境交互,收集到完整的回合(episode)的样本,然后用该回合的实际回报的平均值估计价值函数。

发布博客 2026-04-08 22:45
401 次阅读

动态规划

动态规划(dynamic programming)是程序设计中非常重要的一部分,能够高效地解决很多的一些经典问题。其核心思想是将待求解的问题分解成若干个子问题,通过对子问题的求解,从而得到最终目标问题的求解。那么关键就是基于价值的强化学习目标函数是否可以拆解成若干个子问题?答案是“可以”。

发布博客 2026-04-08 22:37
407 次阅读

强化学习基础

强化学习(Reinforcement Learning,RL)的概念相比较于监督学习或者非监督学习来说,对于初学者较难理解,其背后的原因是强化学习有着一套较为复杂的数学基础,要想理解这套数学基础就相对比较困难,而监督学习或者非监督学习的模型相比较而言,就显得简单的多,在这个系列中,我们以相对简单的语言来描述强化学习的基本知识,同时为不失专业性,我们也给出数学的推导,那就让我们开始吧。

发布博客 2026-03-29 15:53
496 次阅读

文章分类

  • 1 NLP
  • 2 CV
  • 3 搜索·推荐·广告
  • 4 C/C++
  • 5 LeetCode
  • 6 Java
  • 7 架构设计
  • 8 深度学习基础
  • 9 机器学习算法
  • 10 Python
  • 11 其他
  • 12 前端
  • 13 强化学习

热门文章

  • 1 FastChat 框架中的服务解析
  • 2 Transformer对用户行为序列建模算法BST
  • 3 多目标建模总结
  • 4 Vision Transformer(ViT)
  • 5 Transformer的基本原理
  • 6 Youtube的DeepMatch模型
  • 7 基于Graph Embedding的GES和EGES
  • 8 Wide & Deep算法
  • 9 推荐系统——DeepWalk算法
  • 10 神经网络语言模型

Copyright © 2020-2026 Felix | 京ICP备20029433号-1

备案图标 京公网安备 11010502042072号