摘要当前,大多数本体论都是手动创建的,这是耗时且劳动力密集的。同时,大型语言模型(LLM)的高级功能已被证明在各个领域中有益,从而显着提高了文本处理和文本生成的效率。因此,本文着重于将LLMS用于本体学习。它使用手动本体构建方法作为促进本体学习LLM的基础。所提出的方法基于检索增强产生(RAG),并将其传递给LLM的查询基于手动本体论方法 - Lite本体论。已经对LLM的两种不同变体进行了实验,它们都以不同程度的程度证明了本体学学习的能力。这种方法显示了使用LLMS(半)自动化本体学习学习的方向的有希望的初始结果,并使没有先前领域专业知识的人的本体论施工过程更容易。最终的本体论是由域专家评估的,并根据定义的标准对其进行了排名。基于评估结果,最终的本体论可以用作基本版本,但是它需要域专家的进一步微调以确保其准确性和完整性。
抽象的β-内酰胺抗生素是人类和兽医医疗保健中最应用的抗菌剂。因此,β-内酰胺抗性是一个主要的健康问题。AMPCβ-内酰胺酶的基因扩增是导致大肠杆菌中从头β-LAC TAM抗性的主要因素。但是,放大和随附的DNA突变的时间过程尚不清楚。在这里,我们研究了通过逐步增加阿莫西林浓度引起的抗药性演变,AMPC扩增和AMPC启动子突变的进展。AMPC启动子突变发生在第2天,而大约八倍的扩增发生在阿莫西林暴露超过6天后。放大和启动子突变的组合在22天后将AMPC mRNA水平提高了200个。a是1插入在野生型(WT)和AMPC基因互补菌株(COMPA)的耐药性诱导后的扩增连接中的插入,但在∆ AMPC中未鉴定,这表明扩增取决于移动遗传元件的转移。为了阐明基因突变与AMPC扩增之间的相关性,分析了WT,∆ AMPC和COMPA在电阻演化过程中获得的DNA突变。与进化的∆ AMPC相比,进化的WT中没有几种引起抗性突变,而在应力反应中积累了更多的突变。抗阿莫西林的ΔAMPC没有显示出原始AMPC位置周围片段的扩增,而是在另一个位置表现出很大的重复或一式三次,这表明重复基因在耐药性发展中的重要作用。
摘要。我们通过将结构化的霓虹灯方法框架与大语言模型(LLMS)相结合,以将自然语言域描述转化为Tur-The语法本体,以解决本体学习的任务。本文的主要贡献是针对域 - 不稳定建模量身定制的及时管道,例如通过应用于特定领域的案例研究:葡萄酒本体论。使用管道用于开发霓虹灯-GPT,一种自动本体模型的工作流程及其概念实现的证明,并集成在隐义平台的顶部。NEON-GPT利用了霓虹灯方法和LLMS生成型的系统方法来促进更有效的本体发展过程。我们通过使用斯坦福葡萄酒本体论作为黄金标准进行全面评估来评估所提出的方法。获得的结果表明,LLM并未完全能够执行本体开发所需的程序任务,并且缺乏所需的推理技能和领域专业知识。总体而言,LLM需要与连续知识工程任务的工作流或轨迹工具集成。尽管如此,LLMS可以大大减轻所需的时间和专业知识。我们的代码基础可公开用于研究和开发目的,可访问:https://github.com/andreamust/neon-gpt。
为机器配备常识和特定领域的知识,使其能够像人类一样理解某些问题领域,这一直是人工智能研究的主要目标,现在仍然是。在这种情况下,一个关键问题是,将所有相关知识编码成机器可以利用的自动推理、不一致性检测等方式的成本实际上有多高。虽然最近有一些关于开发方法的研究,使我们能够估算知识工程项目的成本 [12],但可以合理地假设并非所有相关知识都可以手动编码。通过分析人类行为及其产生的数据来提取和发现知识的技术可以在这方面做出重要贡献。本体学习领域是 Alexander Mädche 和 Steffen Staab 于 2001 年创造的一个术语 [7],它涉及从数据中得出相关本体知识的方法的开发。到目前为止,该领域已经进行了十多年的深入研究。该领域的早期研究侧重于将浅层方法应用于术语和概念提取以及层次和非层次关系提取 [7]。后来,在我的博士论文《从文本中进行本体学习和填充:算法、评估和应用》中,我将本体学习定义为从数据中获取领域模型,并试图通过介绍所谓的本体学习层蛋糕来系统地概述本体学习任务,此后该任务受到了广泛关注。近年来,一些研究人员试图提高从文本数据中学习到的本体的表达能力,特别是通过尝试提取更深层次的公理知识(例如参见 [13]、[14] 和 [4])。本卷中也可以找到一些类似的贡献,例如旨在通过应用归纳技术学习 OWL 公理(参见Lehmann 等人本卷中的 [5] 和 Lisi [6])。本体学习问题比预期的要困难得多。在我看来,主要原因是本体总是反映概念化世界或给定领域的方式,而从一组数据中学习的本体学习算法的结果本质上反映了所讨论数据集的特性。本体学习的问题比预想的要困难得多。因此,将本体算法的结果转化为实际反映领域概念化的本体,可能比从头开始构建本体的成本更高。在我看来,主要原因是本体总是反映概念化世界或给定领域的方式,而从一组数据中学习的本体学习算法的结果本质上反映了所讨论数据集的特性。因此,将本体的结果
让机器具备常识和特定领域的知识,使它们能够像人类一样理解某些问题领域,这一直是人工智能研究的主要目标,现在仍然是。在这种情况下,一个关键问题是,将所有相关知识编码成机器可以利用的自动推理、不一致性检测等方式的成本实际上有多高。虽然最近有一些研究开发了可以估算知识工程项目成本的方法 [12],但可以合理地假设并非所有相关知识都可以手动编码。通过分析人类行为及其产生的数据来提取和发现知识的技术可以在这方面做出重要贡献。本体学习领域是 Alexander Mädche 和 Steffen Staab 于 2001 年创造的一个术语 [7],它涉及从数据中得出相关本体知识的方法的开发。到目前为止,该领域已经进行了十多年的深入研究。该领域早期的研究集中于将浅层方法应用于术语和概念提取以及层次和非层次关系提取 [7]。后来,在我的博士论文《从文本中进行本体学习和填充:算法、评估和应用》中,我将本体学习定义为从数据中获取领域模型,并尝试通过引入所谓的本体学习层来系统地概述本体学习任务,这从那时起就受到了广泛关注。近年来,一些研究人员试图提高从文本数据中学习到的本体的表达能力,特别是尝试提取更深层次的公理知识(例如参见 [13]、[14] 和 [4])。本卷中也可以找到一些类似的贡献,例如旨在通过应用归纳技术学习 OWL 公理(参见本卷中的 Lehmann 等人 [5] 和 Lisi [6])。本体学习的问题比预期的要困难得多。在我看来,主要原因是本体总是反映概念化世界或给定领域的方式,而从一组数据中学习的本体学习算法的结果本质上反映了所讨论数据集的特性。因此,将本体算法的结果转化为实际上反映领域概念化的本体可能比从头开始构建本体的成本更高。本体学习的问题比预期的要困难得多。在我看来,主要原因是本体总是反映概念化世界或给定领域的方式,而从一组数据中学习的本体学习算法的结果本质上反映了所讨论数据集的特性。因此,将本体算法的结果转化为实际上反映领域概念化的本体可能比从头开始构建本体的成本更高。而本体学习算法从一组数据中学习的结果本质上反映了数据集的特性。因此,将本体的结果转化为
