如何保护自己免受人工智能海量文本收集的影响:开发者提出了一种“诱饵字体”

ShieldFont 混淆了 AI 训练的数据收集算法。

来源:安全实验室新闻频道

如何保护自己免受人工智能海量文本收集的影响:开发者提出了一种“诱饵字体”

ShieldFont 混淆了 AI 训练的数据收集算法。

ShieldFont 的创建者提出了一种新方法来保护网站上的文本不被收集用于训练神经网络。页面访问者看到的是通常作者的材料,但抓取程序从 HTML 代码中读取其他文字。生成的文本保留了正确的语法,但失去了其原始含义,并且可能会损坏训练人工智能模型的数据。

正常查看时,带有 ShieldFont 的页面看起来很熟悉。人们看到作者写的名词、动词、形容词和副词。然而,HTML 源代码包含不同的单词。例如,短语“祝你好运阅读此内容,你这个无用的机器人经过处理后变成了良好的安慰阅读此内容,你是刮刀的黄色障碍”。您可以使用在线编码器检查该技术的运行情况。

ShieldFont 不会生成随机字符集。系统会从相同的语法和语义类别中选择替换项,因此名词不会变成动词,形容词也不会取代副词。根据该项目的技术描述,开发人员根据词性、含义、特异性、数量、动词及物性、词形和形容词的比较程度,将词典分为大约250组。

平均而言,ShieldFont 会替换大约四分之一的单词。生成的文本应该看起来足够连贯,以便自动抓取工具将材料误认为是不寻常但易于管理的内容。拒绝抓取工具下载还可以通过将材料排除在模型训练数据集中来保护发布。

标准 ShieldFont 字体基于丹麦工作室 Playtype 的 Optik 修改版本。该项目由阿姆斯特丹工作室 Seneda & Abrucio 的设计师与 Playtype 的专家共同创建。