近年来,增强学习(RL)已成为一种有力的工具,可在光网络(例如路由和波长分配(RWA)[1]等光网络中解决复杂而染色的优化问题[1],路由,调制和频谱分配(RMSA)[2]以及虚拟网络嵌入[3]。RL实现的性能效果表明其在现实世界中的应用潜力。但是,与其他机器学习(ML)算法类似,RL模型具有黑盒性质,使它们难以解释。这种特征使RL模型难以信任,因此在实际的光网部署中采用。对于监督的ML模型,Shap(Shapley添加说明)[4]是一种可解释的AI方法,已被广泛采用。Shap是一种基于合作游戏理论的方法,用于量化单个特征对模型决策过程的影响。Shap值提供了对每个功能的相对重要性(影响)的见解,从而估算了它们如何对模型的输出做出贡献。将这种解释性框架应用于传播质量(QOT)预测任务时,已显示出有希望的属性[5]。最近,由于需要解释和使RL模型的决策过程透明的驱动,可解释的RL(XRL)受到了越来越多的关注。在光网络的上下文中,XRL的概念仍然相对尚未探索。先前建议通过反向工程网络状态[6]或网络中资源使用分析(链接)来解释和解释RL模型的决策[1,7]。但是,这些研究并未分析不同特征如何影响RL药物的决策。因此,在光网络背景下,RL代理学到的政策仍然存在一段差距。这至关重要,因为网络运营商需要在其在实际网络中部署之前了解RL学习策略背后的推理。在这项工作中,我们旨在利用Shap(Shapley添加说明)[4]来解释应用于RMSA问题的RL模型的行为。为此,我们提出了一种使用训练有素的RL代理的观察和行动来以有监督的学习方式训练ML模型的方法。由Shap使用所得的ML模型来提取解释。与[2]中的RMSA问题的每个组件分别求解,RL代理解决路由问题,基于路径长度的调制格式选择以及基于第一拟合策略的频谱分配。我们分析了该问题的三种变化,改变了奖励函数和选择RL代理的不可行的动作的可能性。我们特别有兴趣解释重要的网络和LightPath请求特征,该特征导致RL模型拒绝该请求。结果允许我们确定哪些功能和哪些值范围影响RL代理接受或拒绝LightPath请求。我们观察到,通过更改奖励功能,RL策略会更改拒绝请求时所考虑的重要功能。引入了防止RL模型采取不可行的措施的掩码,使功能的重要性更加均匀地分布在不同的路由选项上。我们认为,提出的方法对于增加将在真实网络中部署的RL模型的可信度可能是有价值的。
符合资格的员工。 “合格员工”是指被大学归类为普通法员工(无论是否追溯重新分类)的个人,该员工要么是 (a) 有资格享受福利的大学正式教职员工,其工作量占所需全职教职员工工作量的 50%,要么是丹佛斯校区定期按学期授课的教职员工,其学期授课时间至少为 6.5 个学分;(b) 有资格享受福利的员工,其标准工作时间为每周 20 小时或以上;或 (c) 有资格享受福利的员工,其每周正常工作时间 20 小时或以上,并且是国际操作工程师工会地方分会第 148 号的成员。尽管有上述规定,合格员工不包括 (i) 根据集体谈判协议工作的员工(除非本文另有规定);(ii) 博士后研究员;(iii) 任命者、学生和临床研究员;以及 (iv) 根据大学计划领取长期残疾福利的员工。
