跳到正文
原文
LINUX DO 最新· rooboo·· 5 小时前AI 评分11

DAgger 初始化后 SAC 双足机器人学习出小碎步,如何设计奖励诱导大步态

[强化学习 / SAC] DAgger 初始化后 SAC 双足机器人长期学习出小碎步,如何设计奖励诱导大步态?

AI 导读

针对 DAgger 初始化后的 SAC 双足机器人前期步态不稳、收敛后学习出小碎步前进的问题,社区正在寻求有效的引导奖励函数设计方案,以避免步态异常并诱导模型跑出稳定的大步态。

来源:LINUX DO 最新 · linux.do