2026 年期末试题参考答案与解析
对应《2026 年期末试题回忆版》。以下答案根据课程课件和考后回忆整理,不确定的题图信息会明确标出。
一、选择题答案与解析
| 题号 | 答案 | 解析 |
|---|---|---|
| 1 | C | 知识表示的核心是用计算机可处理的符号体系对知识进行形式化表达。 |
| 2 | B | 推理利用已有事实和规则推出图中未显式给出的新知识或新关系。 |
| 3 | B | 课程中的主要路线包括基于路径、规则及距离或表示学习的推理,“基于数据推理”不属于这里的标准分类。 |
| 4 | A | 本体给出领域中的概念、属性、关系和约束,是知识图谱的模式层。 |
| 5 | A | RDF 用主语、谓词、宾语组成的三元组描述一条事实。 |
| 6 | A | 谓词表示主语具有的属性,或主语与宾语之间的关系。 |
| 7 | A | 实体链接把文本提及映射到知识图谱中的标准实体,以解决别名和歧义。 |
| 8 | A | 开放世界假设认为“知识库中没有记载”只表示未知,不能直接推出该事实为假。 |
| 9 | A | 属性图允许节点和边携带键值对属性,这是它与普通 RDF 三元组模型的重要差异。 |
| 10 | A | 知识图谱提供实体间的多跳语义关系,可提高推荐结果的多样性和可解释性。 |
| 11 | C | 语义网希望让网页数据具有机器可理解、可关联和可推理的语义。 |
| 12 | B | 知识图谱嵌入把离散的符号知识编码成低维稠密向量,以便计算相似度、评分和预测。 |
| 13 | A | TransE 把关系建模为从头实体到尾实体的平移操作。 |
| 14 | C | TransH 为每个关系定义独立超平面,实体在不同关系下可以获得不同投影表示。 |
| 15 | A | 评分函数为候选三元组给出合理性分数,用来衡量其成立的可能性。 |
| 16 | B | RotatE 将关系建模为复数空间中的旋转,能够自然表达对称、反对称、逆关系和组合关系。 |
| 17 | B | 负样本为正三元组提供对比,使模型学会区分真实事实和被破坏的三元组。 |
| 18 | C | 多跳路径能够连接没有直接边的实体,为表示学习补充更丰富的结构和语义联系。 |
| 19 | A | 远程监督假设包含同一实体对的句子都表达知识图谱中的关系,该假设会自动产生大量错误标签。 |
| 20 | C | 知识问答属于知识图谱的下游应用,不是知识图谱构建环节。 |
第 19 题 B 项目前只能读出 stsbyqlwelj。把容易混淆的 d/l、c/e 排列组合后,仍不能得到一个既符合全部首字母、又符合远程监督课程语境的自然选项。最接近的猜测是“实体识别要求利用外部链接”,但它的标准首字母应为 stsbyqlywblj,与记录并不一致,因此不将它写成确定原文。
二、知识图谱基础
1. 知识图谱的构成
知识图谱在逻辑上分为两层:
- 概念层,也称模式层:由类、本体、概念间关系和约束组成,是知识图谱的核心和骨架,通常由本体库管理。
- 实例层,也称数据层:由真实实体及实体之间的事实关系组成,是知识图谱中的具体数据。
在图结构上,知识图谱由节点和边组成:节点表示实体或概念,边表示关系或属性。一条事实通常写成“头实体—关系—尾实体”的三元组。概念之间可使用 Subclass,实例与概念之间可使用 Instance Of 或 Type,实例之间使用具体关系连接。
2. 关系型数据库与知识图谱的区别
| 对比维度 | 关系型数据库 | 知识图谱 |
|---|---|---|
| 主要对象 | 表、行、列中的结构化数据 | 实体、概念、关系及其语义 |
| 数据结构 | 预先定义的固定表结构 | 图结构,模式更灵活、易扩展 |
| 关系表达 | 依靠主键、外键和连接操作 | 关系直接表示为边 |
| 主要任务 | 数据存储、增删改查和事务处理 | 知识组织、关联检索、推理及知识应用 |
| 语义能力 | 字段本身的显式语义较弱 | 包含类型、本体、关系和约束等语义 |
| 推理能力 | 通常不直接提供语义推理 | 可结合本体、规则和表示学习完成推理 |
知识图谱不能替代关系型数据库。大规模知识图谱仍需要数据库技术完成可靠存储和高效查询;二者的主要区别在于知识图谱在数据之上增加了关系、语义和推理能力。
三、语义网与知识推理
1. RDF、RDFS、SPARQL、OWL 的功能
| 技术 | 功能 |
|---|---|
| RDF | 语义网的基础数据模型,用主语—谓词—宾语三元组表示事实,并组成有向图。 |
| RDFS | 在 RDF 之上描述类、属性、子类、子属性、定义域和值域等简单模式信息。 |
| SPARQL | RDF 图的标准查询语言,用图模式匹配、过滤和结果投影查询三元组数据。 |
| OWL | 基于描述逻辑的 Web 本体语言,表达类的等价与不相交、属性特征、基数限制等更复杂约束,并支持自动推理。 |
四者可以串成一条链:RDF 负责表示事实,RDFS 提供基础模式,OWL 提供更强的本体表达与推理,SPARQL 负责查询这些 RDF 数据。
2. 不确定知识推理采用什么方法
采用基于统计的知识推理方法。它不要求结论必然成立,而是根据样本、概率或统计规律判断结论成立的可能性。例如,可以把总体统计结论应用到具体实体,得到带概率的推理结果。更具体的实现还可以使用概率图模型、马尔可夫逻辑或模糊逻辑等方法。
四、Cypher 查询
题图中的五条已知关系是:
北航 ──全称──> 北京航空航天大学 ──成立──> 1952
│
二级单位
↓
AI 院 ──开设──> 知识图谱
└────开设──> 人工智能导论
以下查询假定所有节点都使用 name 属性保存名称。
1. 查询简称为“北航”的大学成立于哪一年
MATCH (shortName {name: '北航'})-[:全称]->(university)-[:成立]->(year)
RETURN year.name AS 成立年份
查询结果为 1952 年。
2. 查询同时开设两门课程的二级单位
MATCH (university {name: '北京航空航天大学'})-[:二级单位]->(department)
MATCH (department)-[:开设]->(course)
WHERE course.name IN ['知识图谱', '人工智能导论']
WITH department, count(DISTINCT course) AS courseCount
WHERE courseCount = 2
RETURN department.name AS 二级单位
查询结果为 AI 院。先找到北京航空航天大学的二级单位,再匹配其开设的两门课程;courseCount = 2 保证返回的单位同时开设两门课程,而不是只开设其中一门。
五、知识抽取
1. 三种包装器生成方法
| 方法 | 生成方式 | 优点 | 缺点 |
|---|---|---|---|
| 手工方法 | 人工分析网页结构并编写 XPath、CSS Selector 等抽取规则 | 规则明确,在固定模板上准确率高 | 开发慢、维护成本高、难以扩展,网页模板变化后容易失效 |
| 包装器归纳 | 标注少量页面样本,由监督学习方法归纳抽取规则 | 比完全手工构建快,可从样本中自动学习 | 依赖人工标注,跨网站和跨模板的泛化能力有限 |
| 自动抽取 | 聚类相似页面或重复结构,无监督地发现模板并生成规则 | 不需要人工标注,适合较大规模页面 | 模板识别和字段对齐更容易出错,准确率通常低于前两种方法 |
2. BiLSTM+CRF 的主要步骤
- 输入数据的分布表示:把字符或词转换为低维稠密向量,使向量的不同维度承载潜在语义特征。可以使用 Word2Vec 等预训练词向量,也可以在任务中共同学习嵌入。
- BiLSTM 上下文编码:前向 LSTM 和后向 LSTM 分别读取左右方向的序列,为每个位置融合左、右上下文信息,得到用于标签判断的中间语义表示。
- CRF 标签解码:同时考虑 BiLSTM 给出的各位置标签分数和标签之间的转移约束,在所有候选标签序列中找出整体得分最高的合法序列。
BiLSTM 解决“如何从上下文自动学习特征”,CRF 解决“如何让相邻标签组合合理”。两者结合可以避免逐位置独立分类产生不合法的 BIO/BIOES 序列。
六、AMIE 规则学习
题图中能够确定的关系如下:
F ──isFatherOf──> X ──wonPrize──> Q ──forRole──> O
│ ├- - - - - - - - - - - - -> O
│ └- - - -> U1 - - - -> U2
└──hasWife──> S ──hasChild──> X
X ──fatherIs──> F
forRole 是确定的关系名。三条虚线的关系名没有记下,因此保留为空;它们目前也没有构成连接规则头两个变量的新路径,不影响下面两条规则。
1. 所有可确定的闭式霍恩规则
规则一:利用 fatherIs 的反向关系。
规则二:通过妻子和孩子组成两跳路径。
两条规则中的每个变量均至少出现两次,规则主体又都在规则头的两个变量之间形成闭合路径,因此是闭式霍恩规则。
2. 支持度和标准置信度
规则支持度是同时满足规则主体和规则头的变量实例数量:
标准置信度是支持度与满足规则主体的变量实例数量之比:
对于规则一,图中满足主体的实例是 (B=X,A=F),对应的规则头 isFatherOf(F,X) 也存在,所以:
对于规则二,图中满足主体的实例是 (A=F,C=S,B=X),对应的规则头也存在,所以:
这一结果建立在题图展示的事实集合完整,且未知虚线不会增加同一规则主体的新匹配实例这一前提下。
七、知识图谱表示学习
1. TransE 的目标与负采样
TransE 的目标:学习实体和关系的低维向量,使正确三元组中“从头实体经过关系到达尾实体”的平移关系尽可能合理,同时让错误三元组的评分更差。训练完成后,可以根据候选三元组的评分完成链接预测和知识图谱补全。
负采样的意义:知识图谱主要记录正事实,并没有直接给出大量负事实。若只训练正三元组,模型无法学习真实事实与错误组合之间的边界。负采样人为构造错误三元组,与正样本进行对比,使正确三元组获得更优评分。
基本方法:从正三元组出发,保持关系不变,随机替换头实体或尾实体,并过滤掉知识图谱中已经存在的事实。例如,将一个正确三元组的头实体或尾实体替换成其他实体,得到候选负样本。
随机替换可能生成两类问题样本:
- 假阴性:被替换后的三元组实际上也是真的,只是训练集没有记录。
- 低质量负样本:实体类型明显不匹配,模型无需学习就能区分,训练价值较低。
因此还可以使用 Bernoulli 采样、类型约束采样、常识指导采样和困难负样本采样,提高负样本质量。
2. 三元组之外可以引入的信息
| 信息 | 作用 | 课程中的典型方向 |
|---|---|---|
| 多跳路径 | 补充实体间的间接语义联系和图结构信息 | PTransE |
| 逻辑规则 | 把可解释的符号规律转化为训练约束或生成新三元组 | KALE、RUGE、EngineKG |
| 实体类型和层次 | 约束实体语义,使相同类型实体的表示更接近 | TKRL、AutoETER |
| 常识知识 | 避免违反常识的推理,并指导高质量负采样 | CAKE |
| 实体文本描述 | 利用自然语言描述区分实体,并表示训练时未见的新实体 | DKRL |
| 图像等多模态信息 | 融合视觉特征,补充纯结构信息缺失的实体语义 | IKRL |
核心思路是利用三元组结构以外的语义和约束弥补知识图谱稀疏性,使实体与关系表示更准确,并提高链接预测和知识补全效果。