跳到正文
原文
Hugging Face·· 2022-07-22AI 评分44

Hugging Face 深度强化学习课程:Advantage Actor Critic(A2C)

Advantage Actor Critic (A2C)

AI 导读

Hugging Face 深度强化学习课程介绍了 Advantage Actor Critic(A2C)算法,旨在解决策略梯度算法因蒙特卡洛采样产生的高方差问题。A2C 结合控制动作的 Actor 与评估价值的 Critic,通过混合架构降低方差并提升训练稳定性。课程配套使用 Stable-Baselines3 与 PyBullet 仿真环境训练双足和蜘蛛机器人行走。

来源:Hugging Face · huggingface.co