Understanding Annotator Safety Policy with Interpretability
安全策略定义了安全和不安全的人工智能输出的构成,指导数据注释和模型开发。然而,注释分歧普遍存在,可能源于多种原因,例如操作失败(注释者误解或错误执行任务)、政策模糊性(政策措辞留有解释空间)或价值多元化(不同注释者对安全持有不同观点)。区分这些来源很重要。例如,运营失败需要质量控制,模糊需要政策澄清,多元化需要深思熟虑……
Metric-Dependent Annotation Saturation for Learning from Label Distributions
当注释者对某个标签存在分歧时,分歧本身就带有信号,而捕获该信号所需的注释者数量取决于评估指标。我们根据从 ChaosNLI(一个为每个项目提供 100 个独立注释器判断的数据集)二次采样的标签分布来微调 NLI 模型,并识别与度量相关的饱和度。在我们的 3 类 NLI 设置中,熵相关性(模型是否识别哪些项目引起分歧)需要 N ≈ 20-50 个注释器才能收敛,而分布匹配(KL 散度)则达到 N ≈ 10 饱和(五个模型的改进为 87-95%……