许多当代社会运动已在社交媒体上策划。例如,尽管占领华尔街对经济不平等的抗议很少出现在传统媒体上,但该运动在第一天就吸引了4,300个Twitter提到的4,300个Twitter提到,很快就每小时会出现10,000至15,000个职位(DeLuca等人,2012年)。同样,在其第一篇文章的24小时内,#MeToo运动发出了53,000条推文和转发,讨论了性暴力的个人经历,极大地激发了公众对性骚扰的兴趣(Kaufman等,1991)。这种快速扩散表明,通过最低限度的努力,成本和风险,社交媒体可以在广泛到达的社交网络中快速分离用户生成的行动主义(米兰,2015年)。人们不再需要放置传单,确保财政资源或协调大规模聚会来促进和支持事业,这表明社交媒体具有巨大的潜力,可以在没有正式结构或组织的情况下实现基层运动。尽管如此,如果仅在线存在社交媒体行动主义不足以产生真正的社会变革。peo-ple可以在线讨论并表达对社会问题的支持,但是除非它们
摘要 - 数据是AI中的重要资产,因为高质量的数据集可以显着提高机器学习模型的性能。在自动驾驶汽车等安全性领域中,离线深度强化学习(Offline DRL)经常用于在预采用的数据集中训练模型,而不是通过与现实世界环境进行互动作为在线DRL来培训这些模型。为了支持这些模型的开发,许多机构可以通过开放源许可公开获得数据集,但是这些数据集有可能滥用或侵权的风险。向数据集注入水印可能会保护数据的知识产权,但是它无法处理已经发布的数据集,并且以后无法更改。其他现有解决方案,例如数据集推理和会员推理,由于不同的模型行为特征和离线设置约束,因此在离线DRL方案中无法正常工作。
摘要 - 杂种闭环系统(也称为人造胰腺(AP))的最新进展已被证明可以优化葡萄糖控制,并减轻1型降解者(T1D)的人的自我管理负担。AP系统可以通过连续葡萄糖监测实时通信来调整胰岛素泵的基础输注速率。在深度神经网络中赋予的能力,深钢筋学习(DRL)引入了基础胰岛素控制算法的新范式。但是,所有现有的基于DRL的AP控制器都需要在代理和环境之间进行大量随机在线互动。虽然可以在T1D模拟器中进行阀门,但在现实世界临床环境中它变得不切实际。为此,我们提出了一个离线DRL框架,该框架可以完全离线开发和验证基础胰岛素控制的模型。它包括基于双重延迟的深层确定性策略梯度和行为克隆的DRL模型,以及使用拟合Q评估的非政策评估(OPE)。我们评估了由UVA/Padova T1D Simulator生成的10个虚拟成年人和10个虚拟青少年的硅数据集上提出的框架,而OHIOT1DM数据集则是一个具有12个真实T1D主题的临床数据集。在In Silico数据集中的性能表明,离线DRL算法在范围内显着增加了时间,同时将成人和青少年组的范围低于范围和时间以下。实际和估计的策略值之间的高矛式等级相关系数表示OPE的准确估计。然后,我们使用OPE来估计临床数据集上的模型性能,在该数据集中,观察到每个受试者的策略值显着提高。结果表明,提出的框架是改善T1D中个性化基底胰岛素控制的可行且安全的方法。
有效的混合闭环系统的广泛采用将代表着患有1型糖尿病(T1D)患者的重要里程碑。这些设备通常利用简单的控制算法选择最佳的胰岛素剂量,以将血糖水平保持在健康范围内。在线增强学习(RL)已被用作进一步增强这些设备中葡萄糖控制的方法。以前的方法已显示可降低患者的风险并降低目标范围内所花费的时间,但在学习过程中容易出现不稳定性,通常会导致选择不安全的动作。这项工作提供了对离线RL的评估,用于制定有效的给药政策,而无需在培训期间进行潜在危险的患者互动。本文研究了BCQ,CQL和TD3-BC在管理FDA批准的UVA/Padova葡萄糖动力学模拟器中可用的30名虚拟患者的血糖中的实用性。接受在线RL以实现稳定性能所需的总培训样本的十分之一的培训时,这项工作表明,离线RL可以大大增加健康血糖的时间范围为61。6±0。3%至65。3±0。与最先进的基线相比5%(𝑝<0。001)。这是在低血糖事件中没有任何相关增加的情况下实现的。离线RL也被证明能够纠正常见和具有挑战性的控制场景,例如不正确的推注剂量,不规则的进餐时间和压缩误差。这项工作的代码可在以下网址提供:https://github.com/hemerson1/offline-glucose。
广泛采用有效的混合闭合环系统将为患有1型糖尿病(T1D)的人提供重要的护理里程碑。这些设备通常利用简单的控制算法选择最佳的胰岛素剂量,以将血糖水平保持在健康范围内。在线增强学习(RL)已被用作进一步增强这些设备中葡萄糖控制的方法。与经典的对照算法相比,先前的方法已被证明可以降低患者的风险和降低焦油范围的时间,但在学习过程中容易出现不稳定性,通常会导致选择不安全的动作。这项工作介绍了对o ffl iNe rl的评估,用于制定施用剂量政策,而无需在训练过程中进行潜在危险的患者互动。本文研究了BCQ,CQL和TD3-BC在管理FDA批准的UVA/Padova葡萄糖动力学模拟器中可用的30名虚拟患者的血糖中的实用性。接受在线RL以实现稳定性能所需的总培训样本的十分之一的培训时,这项工作表明,在健康的血糖范围内,OfflIne rl可以显着增加61个。6±0。3%至65。3±0。与最先进的基线相比5%(p <0。 001)。 这是在低血糖事件中没有任何相关增加的情况下实现的。 o rl也证明能够纠正与最先进的基线相比5%(p <0。001)。这是在低血糖事件中没有任何相关增加的情况下实现的。o rl也证明能够纠正
深脑刺激(DBS)通过将电脉冲传递到大脑的基底神经节(BG)区域来治疗由帕金森氏病(PD)引起的运动症状的巨大希望。但是,美国食品药品监督管理局(FDA)批准的DBS设备只能以固定幅度提供连续的DBS(CDB)刺激;这种效率低下的操作可降低设备的电池寿命,无法动态地适应活动,并且可能引起严重的副作用(例如步态障碍)。在这项工作中,我们引入了一个离线增强学习(RL)框架,允许使用过去的临床数据来训练RL政策以实时调整刺激幅度,目的是减少能源利用,同时保持相同的治疗水平(即,控制)功效为CDB。此外,临床原型要求在患者部署之前证明此类RL控制器的安全性和性能。因此,我们还引入了一种离线政策评估(OPE)方法,以在对患者进行部署之前使用历史数据估算RL政策的性能。我们对配备RC+S DBS系统的四名PD患者进行了评估,在每月临床就诊期间采用RL控制器,并通过症状严重程度评估了整体控制功效(即,Bradykinesia和Tremor),PD生物制造商的变化(即,本地现场电位)和患者评分。临床实验的结果表明,我们的基于RL的控制器保持与CDB相同的控制功效水平,但刺激能量显着降低。此外,OPE方法在准确估算和对RL控制器的预期回报方面有效。
逐点集中是计算每个状态-动作对的置信区间的标准技术 [Azar 等人,2017 年;Liu 等人,2021 年;Xie 等人,2021b 年;Cui 和 Du,2022 年]。然而,由于 NE 可以是混合策略,因此对 MARL 的直接扩展会受到多智能体诅咒的影响。与逐点集中技术不同,策略集中直接估计每个策略,这允许更严格的置信区间,从而避免对联合动作空间的依赖。我们在第 1.2 节中给出了技术概述。此外,我们表明策略置信界限始终是一个凸函数,因此经验最佳响应策略始终可以是确定性策略,这对计算效率至关重要。
奖励动机通过中脑边缘系统、海马和皮质系统之间的相互作用(编码期间和编码后)来增强记忆。这些分布式神经回路的发展变化可能导致奖励动机记忆和潜在神经机制的年龄相关差异。跨物种研究的综合证据表明,青春期皮质下多巴胺信号增加,这可能导致奖励事件的记忆表征比平凡事件更强,以及潜在皮质下和皮质大脑机制的贡献随年龄变化而变化。在这里,我们使用 fMRI 来检查奖励动机如何影响支持两性人类参与者从童年到成年的长期联想记忆的“在线”编码和“离线”编码后大脑机制。我们发现,奖励动机导致 24 小时后联想记忆的年龄不变增强和非线性年龄相关差异。此外,奖励相关的记忆益处与年龄变化的神经机制有关。在编码过程中,随着年龄的增长,前额皮质 (PFC) 和腹侧被盖区 (VTA) 之间的相互作用与更好的高奖励记忆的关联性会更大。编码前到编码后,前海马和 VTA 之间的功能连接变化也与更好的高奖励记忆有关,但在年轻时更是如此。我们的研究结果表明,支持奖励动机记忆的离线皮层下和在线皮层大脑机制的贡献可能存在发育差异。
