LINUX DO 最新· rooboo·· 5 小时前AI 评分11
DAgger 初始化后 SAC 双足机器人学习出小碎步,如何设计奖励诱导大步态
[强化学习 / SAC] DAgger 初始化后 SAC 双足机器人长期学习出小碎步,如何设计奖励诱导大步态?
AI 导读
针对 DAgger 初始化后的 SAC 双足机器人前期步态不稳、收敛后学习出小碎步前进的问题,社区正在寻求有效的引导奖励函数设计方案,以避免步态异常并诱导模型跑出稳定的大步态。
来源:LINUX DO 最新 · linux.do