2德国:+49 621 776 1111 Pepperl+Fuchs组,请参阅“与Pepperl+Fuchs产品信息有关的一般说明”。美国:+1 330 486 0001新加坡:+65 6779 9091 www.pepperl-fuchs.com fa-info@us.pepperl-fuchs.com fa-info@sg.pepperl-fuchs.pepperl-fuchs.com fa-info@dinfo@d-info@de.pepperl-fuchss.com美国:+1 330 486 0001新加坡:+65 6779 9091 www.pepperl-fuchs.com fa-info@us.pepperl-fuchs.com fa-info@sg.pepperl-fuchs.pepperl-fuchs.com fa-info@dinfo@d-info@de.pepperl-fuchss.com
逆约束强化学习(ICRL)旨在以数据驱动的方式恢复专家代理人尊重的基本约束。现有的ICRL算法通常假定演示数据是由单一类型的专家生成的。在实践中,示范通常包括从尊重不同约束的各种专家代理中收集的轨迹的混合物,这使得用统一约束功能解释专家行为变得具有挑战性。为了解决此问题,我们提出了一种多模式逆约束增强学习(MMICRL)算法,以同时估计与不同类型专家相对应的多个约束。mMICRL构建了一个基于流的否定估计器,该估计量可以从演示中实现无监督的专家识别,从而推断特定于特定的约束。按照这些约束,MMI-CRL模仿了新型多模式约束策略优化目标的专家政策,从而最大程度地减少了代理条件条件的策略熵并最大化无条件的秘诀。为了增强鲁棒性,我们将此目标纳入对比度学习框架中。这种方法使模仿政策能够限制专家代理人的行为多样性。在离散环境和连续环境中进行的广泛实验表明,在约束恢复和控制性能方面,MMICRL优于其他基线。我们的实现可在以下网址获得:https://github.com/qiaoguanren/multi-modal-inverse-inverse-conconter-enversen-conference-Learning-Learning。
