本体论如何为AI智能体提供结构化的语义模型,使其能够理解并操作真实业务概念。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @harshbhatt7585# 本体论:赋予AI智能体世界模型 本体论通过描述数据所代表的真实世界事物及其相互关系,赋予数据以意义。 Palantir将其本体论描述为组织的运营层。它位于数据集、虚拟表、模型及其他数字资产之上,将它们映射到真实世界的事物,例如工厂、设备、产品、订单、交易和人员。Palantir还将其描述为组织的一种数字孪生。(https://www.palantir.com/docs/foundry/ontology/overview/) # 什么是本体论? 本体论是对一个世界/系统运作方式的建模。 它描述: - 存在哪些种类的事物, - 这些事物拥有哪些信息, - 这些事物之间如何相互关联, - 以及有时这些事物可能发生什么。 假设我们正在对一家网上商店进行建模。该世界中的事物可能包括: 这些是不同类型的事物。然后我们对它们进行描述。 接着我们描述它们之间的关系: 综合起来,这就开始构成一个本体论。 # 为什么我们需要本体论?数据库不已经做到这些了吗? 数据库用于存储数据。例如,一家公司可能拥有: 另一个数据库: 而Salesforce可能包含: 人类看到这些信息后能够理解:"这些记录都在谈论Alice / 客户101。" 而系统本身不一定能在全局范围内理解这种含义。它们主要包含: 本体论在这些系统之上添加了一个语义层。与其思考: 你可以这样思考: 现在计算机拥有了更接近业务现实视角的东西。 本体论定义了组织用来描述现实的词汇表。 # 本体论不只是知识图谱 本体论定义模型。知识图谱存储实际的实例和关系。本体论定义这些概念的含义以及允许哪些类型的关系。 例如: 这描述了世界可以如何被结构化。在实践中,产品有时会更广泛地使用"本体论"一词,既指语义模型,也指通过它所表示的运营数据。 知识图谱包含遵循该模型的实际实体和事实。 本体论告诉图谱其实体和关系的含义,而知识图谱则使用该结构来表示真实世界的事实。 ## ## 本体论正在成为企业级模式 Palantir将本体论用作公司共享的运营模型。它将来自数据库、ERP/CRM系统、API、模型及其他来源的数据,连接到客户、订单、工厂、员工、资产和交易等真实业务概念。然后它定义: 对象(Objects)——存在哪些事物 属性(Properties)——关于这些事物的信息 链接(Links)——这些事物之间的关联方式 动作(Actions)——用户或AI智能体可以执行的操作 函数(Functions)——业务逻辑和规则 权限(Permissions)——谁或什么被允许查看或更改某项内容 因此,AI智能体看到的不再是孤立的表格和记录,而是定义明确、相互关联的事实。 重要的是,Palantir使用本体论不仅仅是为了组织数据。它将本体论用作运营层,使人类和AI智能体都能理解业务、推理其当前状态,并将受治理的操作反馈到企业系统中。 微软正在将本体论(Ontology)构建到 Microsoft Fabric 中。微软将其描述为一种共享的、机器可理解的业务词汇体系,用于表示实体、属性、关系、规则和约束,并将这些概念与真实的企业数据相绑定。它还旨在为 AI 智能体提供业务上下文,使其能够基于概念而非单独的数据表跨系统进行推理。(https://learn.microsoft.com/en-us/fabric/iq/ontology/overview) 西门子将本体论作为其企业知识图谱方法的基础。西门子将本体论描述为通过共享词汇定义领域概念、规则和关系的结构化框架。由此生成的知识图谱将原本碎片化的企业数据中的实体与上下文关联起来,并为 AI 智能体提供更结构化的推理与行动上下文。(https://www.siemens.com/en-us/solutions/data-analytics-artificial-intelligence/knowledge-graphs/#11QoYGTrdPBsDDhMeIbUe2) LinkedIn 围绕成员、公司、职位、技能、学校、职称和地点等实体构建了其知识图谱。LinkedIn 明确将这些实体及其关系描述为构成"职业世界的本体论"。这一结构已被应用于 LinkedIn 的搜索、推荐、分析、变现及其他产品之中。(https://www.linkedin.com/blog/engineering/knowledge/building-the-linkedin-knowledge-graph) 亚马逊使用本体论和知识图谱对其庞大的商品目录进行结构化管理。其 AutoKnow 系统包含亚马逊所称的本体论套件,该套件能够识别商品类型、属性、分类体系和关系,并利用这些信息自动扩展和完善亚马逊的商品图谱。(https://www.amazon.science/blog/building-product-graphs-automatically) NASA 已在地球科学、空中交通管理和太空操作等多个领域开发了本体论。NASA 将本体论描述为位于各独立数据库设计之上的语义层,有助于对来自独立开发系统的数据进行统一查询、转换、整合和理解。例如,NASA 的空中交通管理本体论对飞机、航班、机场、航空公司、航线、设施、气象现象及其相互关系进行了正式建模。(https://data.nasa.gov/dataset/the-nasa-air-traffic-management-ontology-atmonto) 各实施方案虽有差异,但背后的核心理念相似:与其让每个数据库、应用程序、团队和 AI 智能体各自维护对组织的独立解读,不如建立一个共享模型,涵盖构成现实世界的重要实体、概念和关系。 ## 本体论实际上是如何创建的? 在实践中,本体论的创建通常是现有企业模式、领域专家以及传统机器学习/大语言模型共同作用的结果。 常见的流程如下: 大语言模型在理解非结构化数据方面尤为有用。它们能够读取文档、工单、电子邮件、合同或日志,提出某些概念可作为实体的候选项,识别其属性,并抽取实体之间的关系。 但大语言模型通常产出的是候选知识,而非不容置疑的事实。 Palantir 在历史上允许团队通过在本体论管理器(Ontology Manager)中将数据集映射到对象类型、属性和链接来构建本体论。最近,Palantir 的 Pilot 引入了一个本体论构建智能体:用户可以用自然语言描述一个应用程序,智能体随即生成候选对象类型、关系和动作类型。生成的本体论可在对话中进行审查和完善。Palantir 的 MCP 工具同样允许 AI 智能体提议本体论变更,而永久性修改则须经过人工审核和审批流程。 Microsoft Fabric 采用了一种更注重模式驱动的方法。它可以从现有的语义模型自动生成初始本体:表成为实体类型,列成为属性,现有关系成为本体关系。Microsoft 随后期望用户审查并完善生成的模型。官方文档并未将此生成步骤描述为基于大语言模型的;大语言模型更多地被用于后续阶段,包括自然语言查询以及基于本体进行推理的智能体。 大语言模型使本体构建的可扩展性大幅提升,尤其是当组织的知识深埋于非结构化文本之中时。但本体仍然是受治理的结构,约束着大语言模型所发现的内容以及知识的表示方式。 ## 本体如何帮助为 AI 智能体构建上下文 大语言模型在企业级 AI 中正变得愈发重要。各组织正在利用大语言模型构建 AI 智能体,但问题在于它们是无状态的。基于 RAG 的简单向量搜索并非可靠的解决方案。基于本体的知识图谱正在业界日益流行,用于为大语言模型构建上下文层。AI 智能体不仅仅需要更多数据,它需要理解数据所代表的含义,以及不同信息片段之间的关联方式。 本体提供了这种共享语义: 知识图谱或上下文图谱随后存储遵循该模型的实际实体、关系、历史记录和状态。 在检索过程中,智能体可以识别相关实体,并沿其关系进行遍历,从而为当前任务组装所需的上下文。它不再仅仅检索语义上相似的文本,而是能够因为信息与正在推理的实体或情境真正相关而将其检索出来。 这也是 HydraDB 应对这一问题的方式。HydraDB 提供图原生的上下文基础设施,同时允许应用程序自主定义其本体——定义诸如 CUSTOMER(客户)、CONTRACT(合同)或 POLICY(策略)等概念的含义,以及诸如 OWNS(拥有)、DEPENDS_ON(依赖于)或 SUPERSEDES(取代)等关系所代表的意义。HydraDB 随后存储并检索这些相互关联的事实,包括其关系和时态状态,以便在推理时将相关的图谱上下文提供给 AI 智能体。(https://hydradb.com/) ## 结语 本体正变得愈发重要,因为它为机器提供了一种结构化的方式来理解数据背后的世界。 对于企业而言,这意味着将碎片化的系统转化为涵盖实体、关系、状态与语义的共享模型。对于 AI 智能体而言,这意味着从检索孤立的信息片段,迈向检索推理和行动所需的关联上下文。 本体定义世界,知识图谱表示世界,而检索则将其中相关的部分引入上下文。这一组合正日益成为构建 AI 智能体、打造可靠上下文层的基础。