跳到正文
原文
Hugging Face Blog·· 2022-05-20AI 评分22

Hugging Face 深度强化学习课程:Q-Learning 入门(下)

AI 导读

Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning,一种基于价值的 off-policy 方法,用 TD 方式逐步更新动作价值函数。文中从零实现首个 Q-Learning 智能体,并在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co