要谈「本体系统进行本体建模的规则提取」,首先需要把三个层层嵌套的概念厘清,它们分别对应知识的容器、知识的建模过程、以及知识中最难获取的「规则/公理」部分。
本体(Ontology)源自哲学,在信息科学中被 Gruber 定义为「概念模型的明确的、形式化的规范说明(explicit, formal specification of a shared conceptualization)」。一个本体在工程上通常被形式化为五元组:
O = { C, R, F, A, I }C 概念/类(Concepts/Classes)· R 关系(Relations)· F 函数(Functions)· A 公理/规则(Axioms)· I 实例(Instances)。其中 A(公理与规则)正是本报告聚焦的「规则提取」的目标产物——它决定了本体能否「推出没有被显式写下的新事实」,这也是本体区别于普通数据库/taxonomy 的根本所在。
「本体系统」在实践中指围绕本体的建模—存储—推理—查询—应用全栈环境,典型由本体编辑器(Protégé)、三元组库/图数据库(GraphDB、Jena、AllegroGraph、Neo4j)、推理机(HermiT、Pellet)、规则引擎(Jess、Drools)与查询接口(SPARQL)组成。
本体建模是运用某种方法论,把某一领域的概念、层级、属性、约束与规则,转化为机器可读的形式化模型(通常以 OWL/RDF 编码)的系统工程。它包含知识获取、概念化、形式化、编码、评估与维护等环节。
「规则提取」在文献中有几个相互关联的术语,理解它们的差异很重要:
术语 | 含义 | 产物层次 |
|---|---|---|
规则/公理获取(手工) | 知识工程师依据专家知识,直接以 SWRL/OWL 公理写出约束与推理规则 | 重量级本体 |
本体学习 (Ontology Learning) | 从文本/数据(半)自动抽取概念、关系直至公理与规则 | 全层次 |
规则挖掘 (Rule Mining) | 从已有知识图谱/实例数据中统计归纳出 Horn 规则等 | 规则层 |
公理学习 (Axiom Learning) | 学习 disjoint、domain/range、类表达式等 DL 公理 | 公理层 |
概念学习 (Concept Learning) | 用 ILP/DL 学出类的定义式(class expression) | 公理层 |
一句话定位「规则提取」= 用(半)自动方法,把领域中隐含的约束、推理关系、类定义,转化为本体可承载、推理机可执行的形式化规则/公理。它是本体学习「层次蛋糕」中最顶层、最难、也最有价值的一层。
规则提取不是孤立环节,而是嵌在本体建模方法论的「定义约束/规则」阶段。国际上形成了若干成熟方法论,国内工程实践中斯坦福七步法与 METHONTOLOGY 使用最广,并常做「本土化改进」。
方法论 | 提出方/背景 | 核心思想 | 规则/公理处理 | 适用 |
|---|---|---|---|---|
骨架法 / Enterprise 法 | Uschold & King(英,企业本体) | 确定目的→构建→评价→文档,强调「本体评价与完善」 | 非核心,偏概念框架 | 企业建模 |
TOVE 法 | 多伦多大学(Toronto Virtual Enterprise) | 用一阶逻辑构造形式化集成模型,「假设场景→提出能力问题(competency questions)」 | 强,一阶逻辑公理 | 企业/调度/服务 |
METHONTOLOGY | 马德里理工(结合骨架法) | 接近软件工程:区分「开发流程」与「生命周期」,含规范说明→概念化→形式化→实现→维护 | 形式化阶段编码公理 | 通用/化学/医学 |
On-To-Knowledge | 欧盟项目 | 面向知识管理应用驱动,含可行性研究、Kickoff、精化、评估、维护 | 中等 | KM 应用 |
DILIGENT | 分布式协同 | 面向分布式、松散协作、演化的本体工程 | 中等,支持演化 | 协同/演化本体 |
NeOn 方法论 | 欧盟 NeOn 项目 | 面向本体网络(networked ontologies)的复用、重构与协作,9 种场景 | 强,支持复用与模式 | 大规模/复用 |
斯坦福七步法 | 斯坦福医学院 Noy & McGuinness | 流程清晰、门槛低,配合 Protégé 落地 | 第6步「定义约束/分面」+ SWRL 规则 | 领域本体(最常用) |
循环获取法 / 五步循环法 | 半自动本体学习 | 选核心本体→概念学习→领域聚焦→关系学习→评价,迭代 | 关系/规则通过学习获取 | 动态领域、半自动 |
七步法因流程清晰被国内外领域本体广泛采用:①确定领域与范畴 ②考察复用现有本体 ③列出重要术语 ④定义类与层级(自顶向下/自底向上/综合) ⑤定义类的属性 ⑥定义属性分面(取值类型、值域、基数等约束) ⑦创建实例。
规则提取切入点第 6 步的「约束/分面」本质上就是轻量级规则(基数约束、值域约束);而更复杂的 IF-THEN 推理规则则通过 SWRL 补充,常配合 Jess/Drools 规则引擎或 Pellet/HermiT 推理机执行。国内电网应急预案、故障树等领域本体正是走这条路线。
国内研究普遍反映七步法「缺乏与具体情景衔接、缺乏对成品本体的检查评估反馈」两大局限,常见改进是:借鉴 TOVE 的「假设场景提出能力问题」在确定范围时加入应用情景分析;借鉴骨架法的「本体评价与完善」在建实例后加入定性定量评估(丰富度评价、软件一致性验证)。这是国内相较国外方案的一个鲜明特征——偏工程落地与验证闭环。
提取出来的规则必须落到一种形式化、机器可执行的表示上。W3C 语义网技术栈提供了从数据模型到规则语言的完整分层,理解这一栈是理解「规则提取产物」的前提。
标准 | 层次 | 能力 | 与规则提取的关系 |
|---|---|---|---|
RDF / RDFS | 数据 / 轻量 schema | 三元组(主-谓-宾)、类与属性层级、domain/range | 层次蛋糕前 5 层的落点;可承载简单 subClassOf 规则 |
OWL / OWL 2 | 本体公理层 | 基于描述逻辑(DL),可表达等价、不相交、基数、属性特征(传递/对称/函数)、类表达式 | 公理学习/概念学习的产物容器;可推理 |
SKOS | 受控词表 | 叙词表、taxonomy 的轻量表达 | 常作全量本体建模前的第一步 |
SWRL | 规则层 | OWL DL + RuleML,IF-THEN(body→head)的 Horn 类规则,弥补 OWL 无法表达「基于事实的推理关系」的缺陷 | 最常用的规则承载语言;手工与自动提取的规则多编码为 SWRL |
RIF | 规则交换 | Rule Interchange Format,W3C 规则交换标准,跨规则系统互操作 | 规则的可移植表示 |
SHACL | 约束校验 | Shapes Constraint Language,面向 RDF 图的数据形状/约束校验 | 数据质量校验型「规则」,近年热度上升 |
SPARQL | 查询/构造 | 图模式查询,CONSTRUCT 可实现规则式推导 | 可作为轻量规则执行手段 |
SWRL 示例(规则提取的典型产物形态) 规则「祖父定义」:hasParent(?x,?y) ∧ hasParent(?y,?z) → hasGrandparent(?x,?z); 业务规则「合同已完成」:Contract(?c) ∧ paidAmount(?c,?p) ∧ totalAmount(?c,?t) ∧ swrlb:greaterThanOrEqual(?p,?t) → CompletedContract(?c)。 这类 body→head 的 Horn 规则,既是知识工程师手工书写的形态,也是 AMIE 等挖掘算法自动输出的形态。
OWL 以 DL 为逻辑基础,保证了严格语法、形式语义与良好可计算性(可判定推理)。这既是优势(推理机可自动检测不一致、推导新事实),也是约束(过于复杂的规则会破坏可判定性)。规则提取时必须在表达力(重量级本体)与可判定/可扩展性之间权衡——这是贯穿全领域的核心张力。
Buitelaar & Cimiano(2005)提出的本体学习层次蛋糕(Ontology Learning Layer Cake)是整个领域公认的基石框架,它把本体学习从易到难分层,规则提取处于金字塔顶端。
规则 / 一般公理 (Rules / General Axioms)最难 · SWRL/一阶逻辑 · 类表达式包含
公理模式 (Axiom Schemata)disjoint、domain/range 约束
关系 (Relations,非分类关系)属性/谓词抽取
概念层级 (Concept Hierarchies)is-a 分类体系
概念 (Concepts)内涵/外延/词元
同义词 (Synonyms)
术语 (Terms)最易 · 术语抽取
W3C 栈与该框架对应:前 5 层可由 RDF/RDFS 承载;「公理模式」层由 OWL 承载;最顶「规则」层则依赖 SWRL / RIF。绝大多数早期研究集中在底部(术语/分类),而公理与规则层长期是短板——因为规则往往是隐式、抽象的,连人类专家建模都困难。
无论在哪一层,规则/本体提取的技术手段可归为三类(常混合使用):
词性标注、句法分析、依存分析、Hearst 词汇-句法模式(如「X such as Y」抽 is-a)、子范畴框架。贯穿术语/概念/关系抽取各层。
C/NC-value、共现分析、LSA、聚类、形式概念分析(FCA)、关联规则挖掘(ARM)、统计模式归纳(statistical schema induction)。用于概念/关系发现与规则归纳。
归纳逻辑编程(ILP)、描述逻辑概念学习(DL-Learner)、马尔可夫逻辑网络。用于最顶层公理与规则的形式化学习。
深度学习序列标注、图神经网络、KG 嵌入、以及大语言模型 Prompt/RAG/CoT。近两年成为跨全层的「通用引擎」。
下文按数据来源与技术范式,分四条路线展开规则提取的具体技术方案。
目标:从非结构化/半结构化文本语料中,(半)自动地构建本体各层直至规则。这是「本体学习(Ontology Learning from Text)」的经典范式,演进脉络为:浅层学习 → 深度学习 → 大模型。
命名实体识别与关系抽取全面转向神经网络:BiLSTM-CRF、BERT 预训练 + 注意力、CNN/RNN,以及实体关系联合抽取(如 CasRel 级联二进制标注解决关系重叠)。这一阶段极大提升了「概念/关系」两层的自动化与精度,但对顶层公理与规则帮助有限。
方法 | 思路 | 产物 |
|---|---|---|
统计模式归纳(Statistical Schema Induction, Völker) | 在 RDF 图上挖掘频繁模式与相关性,归纳出如「类不相交(disjointness)」等公理 | OWL 公理模式 |
关联规则 + 词汇资源 | ARM 结合 WordNet 等语义词典,产出关系与约束 | 关系/约束 |
ILP / onto-relational learning | 将 OWL 公理学习与规则学习结合,处理实例与 schema | 公理 + 规则 |
现状判断综述(Armary 等,2025《Ontology learning towards expressiveness》;PMC 本体学习综述)一致指出:底层(术语/分类/关系)已相对成熟,而公理与规则层仍是主要瓶颈——规则隐式、抽象、建模方式灵活,难以自动识别。
当已有一个(可能不完整、含噪的)知识图谱/实例库时,可直接从已有三元组中归纳出 Horn 规则,用于知识补全、纠错与推理。这是近十年最活跃、成果最密集的方向,核心挑战是 KG 的开放世界假设(OWA)、不完整性、噪声与超大规模。
算法 | 年份/机构 | 核心贡献 | 特点 |
|---|---|---|---|
AMIE / AMIE+ / AMIE 3 | Galárraga 等,MPI | 面向 RDF KG 的规则挖掘奠基作;提出部分完备假设(PCA)置信度应对 OWA;AMIE+/3 大幅提升剪枝与效率 | 闭式 Horn 规则、基准算法 |
RuleN / AnyBURL | Meilicke 等 | 基于闭合路径采样快速生成规则(anytime bottom-up),兼顾常量规则 | 高效、KG 补全 SOTA 级 |
RuDiK | Ortona 等,EURECOM | 面向不完整且含错的 KG 的声明式挖掘;支持比较谓词、字面量、负规则、条件规则;基于磁盘可在普通笔记本跑大图 | 表达力强、鲁棒、可挖负规则 |
RuLES | — | 迭代构规则,借助预训练 KG 嵌入反馈评估规则质量,置信度反映缺失事实 | 符号+嵌入混合 |
RDF2Rules | — | 借鉴 ARM,采样频繁谓词环(FPC)生成规则 | 频繁模式采样 |
Ontological Pathfinding / ScaLeKB | — | 在本体路径而非实例路径上搜索(空间更小);ScaLeKB 用 Spark 并行、结构等价分区 | 可扩展、并行 |
RARL / TyRuLe | — | 用 domain/range 与 TF-IDF 相关度约束路径采样;TyRuLe 将类型编码为嵌入引导搜索 | 类型感知 |
MPRM(2025) | arXiv | 将规则推理建模为马尔可夫链,提出新置信度,少量事实即可高效可解释补全 | 高效、可解释 |
选型要点若追求补全精度与效率→ AnyBURL / AMIE 3;若 KG 含噪、要挖负规则/条件规则→ RuDiK;若要可解释 + 少样本→ MPRM;若需结合嵌入语义→ RuLES / RL 路线。综述《Rule Learning over Knowledge Graphs: A Review》(TGDK,2024)对此有系统分类。
这条路线直接面向 OWL 本体本身,从已有本体 + 实例中学习类的定义式(class expression)与 schema 公理,产物天然是 OWL 可承载的重量级公理。
DL-Learner 输出示例对 KG 中某组实体,CELOE 可挖出并按精度排序:born_in some Thing (100%)、(alma_mater some (UCL)) or (born_in some Scotland) (100%) 等类定义式。这类「类表达式」即是可推理的重量级公理。
优点:产物逻辑严谨、可直接进入推理链、可与本体调试(不一致诊断与修复)紧耦合。局限:多基于 ILP,需要把推断知识载入内存,在大而复杂的 KG 上扩展性受限,常需统计采样缓解。Lehmann《Perspectives on Ontology Learning》指出该领域正走向混合与集成(概念学习 + 规则学习 + 众包 + 迁移复用 + 不确定性建模)。
大语言模型把本体/规则提取带入新阶段,尤其擅长填补长期短板的公理与规则层(依赖抽象推理与上下文理解)。但幻觉、可审计性、与既有本体对齐是核心难题。
Babaei Giglou 等发起的 LLMs4OL Challenge(ISWC 2023 起,2024/2025 已办两届)把本体学习标准化为任务 A(Text2Onto 术语+类型抽取)、B(术语类型分配)、C(分类体系发现)、D(非分类关系抽取),直至公理发现。评测不仅看 P/R/F1,还看本体一致性与幻觉率。2025 届结论:混合流水线(商用 LLM + 领域微调嵌入 + 微调)效果最佳,Prompt 工程、RAG、集成学习是关键。
OntoGPT(Monarch)把本体约束直接写入 prompt,引导 LLM 产出符合语法的 JSON-LD/OWL,降低歧义;用 Pydantic 校验、domain/range 一致性检查、错误回填重试。
检索相似样例增强抽取;思维链(CoT)在术语类型与关系上做上下文推理;零样本用多嵌入余弦相似度加权分类。
KGGen/Mo 等把 LLM 当匹配器,判断新术语是否匹配/从属目标本体概念,实现与既有本体对齐。
把术语与分类学习整合进统一架构端到端微调。
2025 年出现 OntoAxiom 基准(9 个本体、1.7 万三元组、2771 条公理),对比「一次性预测全部公理」与「逐类型公理(Axiom-by-Axiom)」两种 prompt 策略,评测 12 个 LLM。结论:LLM 在公理识别上有潜力但尚不能替代专家,更适合做「建议式半自动」辅助。
神经符号(Neuro-Symbolic)融合是主线纯 LLM 抽取存在幻觉与不可审计问题;主流做法是「LLM 生成 + 符号约束/校验」:候选空间限定、JSON 契约、证据指针、确定性校验与回退机制,兼得神经的召回与符号的严谨。中科院信工所王鑫团队 SCION 框架(ICML 2026)是这一思路的代表(详见第 10 节)。
环节 | 代表工具 | 说明 |
|---|---|---|
建模编辑 | Protégé / WebProtégé(斯坦福)、OntoEdit、TopBraid EDG | Protégé 为事实标准,支持 OWL 2、SWRL 规则、插件推理;WebProtégé 支持协作。曾用于 NCI 词表、WHO ICD-11 |
推理机 | HermiT、Pellet、ELK、FaCT++ | DL 推理,一致性检查与事实推导 |
规则引擎 | Jess、Drools | 把 OWL 事实 + SWRL 规则映射为引擎 facts/rules 执行(如产品配置系统) |
存储/查询 | GraphDB、Apache Jena、AllegroGraph、Stardog、Neo4j | 三元组库 + SPARQL;Neo4j 常配 Cypher 用于工程落地 |
规则挖掘 | AMIE 3、AnyBURL、RuDiK、DL-Learner | 开源,面向 KG/本体的规则与公理学习 |
LLM 抽取 | OntoGPT、LangChain 流水线 | 约束式 prompt + JSON 校验产出 OWL/JSON-LD |
可视化 | WebVOWL | OWL 渲染为交互式类关系图 |
典型工程管线Protégé 建模(类/属性/SWRL 规则)→ HermiT/Pellet 一致性校验与推理 →(可选)DL-Learner/AMIE 从实例挖新规则 → GraphDB/Jena 存储 → SPARQL/Cypher 查询 → 应用(问答、配置、告警、决策)。
国内在方法论落地、领域本体 + SWRL 规则、以及 LLM 神经符号本体归纳三条线上都有活跃产出,总体特征是「重工程落地、重领域垂直、重与知识图谱一体化」。
《计算机科学》相关工作:七步法建本体,用 SWRL 扩充隐含知识(Atom 定义限制式、Imp 定义规则),使本体具备实际推理价值。
清华学报:改进七步法(加入应用情景分析 + 定性定量评估),Protégé 建模,关联「情景-任务/预案」,软件+定性+丰富度三重验证。
自顶向下、Protégé 建本体,参考 SNOMED CT 顶层;基于规则(符号/关键词切分)抽取实体关系;RDF 三元组存 Neo4j,Cypher 问答。119 类/9136 实体/25 对象属性。推理逻辑与中医辨证一致(寒者热之)。
《信息网络安全》(2025):本体统一 schema + BERT-BiLSTM-多头注意力-CRF 做 NER、BERT-自注意力-CNN 做关系抽取,支撑图谱自动更新扩展。
此外还有再制造工艺本体(多源异构实体对齐 + 关键节点匹配的知识重用)、作战仿真本体(军事领域,OWL+SWRL 弥补事实推理)、绿色降碳技术知识图谱(本体建模 + 主题模型)等垂直案例,普遍将「本体建模」作为知识图谱构建的前置步骤。
国内规则提取的两种主流打法 ① 规则驱动抽取:利用领域文本的强规范性(如药典「【】」「用于」「归…经」等标志符),用符号规则切分抽取实体关系 —— 简单、精度高、可解释,适合结构规范语料。 ② 模型驱动抽取:BERT + 序列标注/联合抽取(CasRel、RD-CNN-CRF)做 NER 与 RE —— 适合非结构化大规模语料。二者常与「本体顶层设计 + SWRL 规则推理」结合形成闭环。
维度 | 国外技术方案 | 国内技术方案 |
|---|---|---|
方法论 | 原创方法论富集:骨架法、TOVE、METHONTOLOGY、NeOn、DILIGENT、七步法 | 以复用+本土化改进为主(改进七步法/METHONTOLOGY),强调情景衔接与评估闭环 |
规则挖掘算法 | 原创算法密集:AMIE 系、AnyBURL、RuDiK、RuLES、DL-Learner、NeuralLP/DRUM | 以改进/应用为主,亮点在 RL 规则挖掘、神经符号本体归纳(SCION) |
标准制定 | 主导 W3C 标准(RDF/OWL/SWRL/RIF/SHACL/SPARQL) | 标准采纳者;在领域标准/顶层本体本地化上发力 |
LLM 本体学习 | LLMs4OL 基准、OntoGPT、OLLM、OntoAxiom 等生态化建设 | 快速跟进,强于「可审计的规则约束流水线」与中文领域落地 |
研究取向 | 偏理论、通用性、可判定性与表达力权衡 | 偏工程落地、领域垂直(医疗/电力/工业/安全/军事)、与 KG 一体化 |
短板 | 公理/规则层自动化仍难;落地成本高 | 原创基础算法与高质量领域本体/规则库仍偏少 |
你的场景 | 推荐路线 |
|---|---|
结构规范的领域文本(法规/药典/标准) | 七步法/改进七步法建本体 + 规则驱动抽取 + SWRL 推理;Protégé + HermiT |
大规模非结构化中文语料 | BERT/LLM 做 NER+RE(CasRel 等)+ 本体顶层约束;神经符号校验 |
已有 KG,要补全/纠错/挖规则 | AnyBURL / AMIE 3(精度效率);含噪挖负规则用 RuDiK;要可解释少样本用 MPRM |
要学 OWL 重量级公理/类定义 | DL-Learner(CELOE/OCEL)、DL-FOIL,配合本体调试 |
快速冷启动 / 跨域 / 缺标注 | LLM + RAG + CoT(OntoGPT 式约束 prompt),专家复核公理层 |
需可审计、可追溯的自动本体归纳 | 候选空间约束 + JSON 契约 + 校验回退(SCION 式神经符号流水线) |
总体建议不存在「一招通吃」的方案。务实路径是「方法论(改进七步法)定框架 → 神经/LLM 抽底层概念与关系 → 符号方法(DL-Learner/AMIE/SWRL)+ 专家确认攻顶层规则 → 推理机/SHACL 校验闭环」的混合流水线,并把「可审计」作为一等目标。
说明:本报告综合公开学术文献与技术资料整理,部分论文为期刊/会议出版物,访问原文可能需机构权限。算法效果与年份以原始论文为准。
— 本体建模「规则提取」国内外技术方案深度研究报告 · 完 —