Inverse Delayed Reinforcement Learning

Published in arXiv preprint (under review), 2024

This work introduces an inverse reinforcement learning framework designed to extract rewarding features from expert trajectories affected by delayed disturbances. It employs an efficient off-policy adversarial training scheme to derive expert features and recover optimal policies from augmented delayed observations, validated in MuJoCo environments under diverse delay settings.

Authors: Simon Sinong Zhan, Qingyuan Wu, Zhian Ruan, Frank Yang, Philip Wang, Yixuan Wang, Ruochen Jiao, Chao Huang, Qi Zhu (*equal contribution)

Citation

@article{zhan2024inverse, title={Inverse Delayed Reinforcement Learning}, author={Zhan, Simon Sinong and Wu, Qingyuan and Ruan, Zhian and Yang, Frank and Wang, Philip and Wang, Yixuan and Jiao, Ruochen and Huang, Chao and Zhu, Qi}, journal={arXiv preprint arXiv:2412.02931}, year={2024} }