2026 年春真题(回忆版)
题目来自回忆稿,并非官方原卷;每道题的参考答案可手动展开。
根据考后速记还原。题目与选项以现有回忆为准;第 19 题的一个干扰项、AMIE 图中的三条虚线关系仍未完全还原。
折叠内容对应原有的《2026 年期末试题参考答案与解析》,是我根据课程课件和考后回忆整理的参考解析,不是课程提供的官方标准答案;我会明确标出不确定的题图信息。
一、选择题
1. 知识表示的本质是?
A. 文本生成
B. 数据加密
C. 符号化和形式化知识
D. 网络建模
查看第 1 题答案与解析
参考答案:C。知识表示的核心是用计算机可处理的符号体系对知识进行形式化表达。
2. 知识推理的主要目的是什么?
A. 压缩数据量
B. 发现新的知识和关系
C. 优化计算速度
D. 编码符号表示
查看第 2 题答案与解析
参考答案:B。推理利用已有事实和规则推出图中未显式给出的新知识或新关系。
3. 以下哪项不是知识图谱推理的主要方法?
A. 基于路径推理
B. 基于数据推理
C. 基于规则推理
D. 基于距离推理
查看第 3 题答案与解析
参考答案:B。课程中的主要路线包括基于路径、规则及距离或表示学习的推理,“基于数据推理”不属于这里的标准分类。
4. 本体的主要作用是什么?
A. 描述领域概念及概念间的关系逻辑
B. 优化计算效率
C. 存储大数据
D. 生成数据库
查看第 4 题答案与解析
参考答案:A。本体给出领域中的概念、属性、关系和约束,是知识图谱的模式层。
5. RDF 描述知识的基本形式是什么?
A. 主—谓—宾三元组
B. 谓词逻辑规则
C. 层次树结构
D. 关联图模型
查看第 5 题答案与解析
参考答案:A。RDF 用主语、谓词、宾语组成的三元组描述一条事实。
6. RDF 三元组中的谓词表示什么?
A. 对象的属性
B. 逻辑规则
C. 层次树结构
D. 状态转移
查看第 6 题答案与解析
参考答案:A。谓词表示主语具有的属性,或主语与宾语之间的关系。
7. 实体链接的主要作用是什么?
A. 将文本中的实体与知识图谱中的实体对齐
B. 生成新的实体关系
C. 删除冗余实体
D. 压缩图谱规模
查看第 7 题答案与解析
参考答案:A。实体链接把文本提及映射到知识图谱中的标准实体,以解决别名和歧义。
8. 开放世界假设的含义是什么?
A. 未被明确说明的信息可能是未知,而非错误
B. 所有数据必须完整无缺
C. 仅适用于结构化数据
D. 数据必须是事实关系
查看第 8 题答案与解析
参考答案:A。开放世界假设认为“知识库中没有记载”只表示未知,不能直接推出该事实为假。
9. 属性图模型的主要特点是什么?
A. 为节点和边添加键值对属性
B. 继承层次约束
C. 仅支持逻辑推理
D. 强制使用实体类型相同
查看第 9 题答案与解析
参考答案:A。属性图允许节点和边携带键值对属性,这是它与普通 RDF 三元组模型的重要差异。
10. 知识图谱在推荐系统中的作用是什么?
A. 利用实体关系提升推荐多样性
B. 动态优化行为数据
C. 仅用于冷启动问题
D. 降低计算复杂度
查看第 10 题答案与解析
参考答案:A。知识图谱提供实体间的多跳语义关系,可提高推荐结果的多样性和可解释性。
11. 语义网的主要目标是什么?
A. 图像数据分析
B. 文档格式转换
C. 让计算机理解数据含义
D. 压缩网页内容
查看第 11 题答案与解析
参考答案:C。语义网希望让网页数据具有机器可理解、可关联和可推理的语义。
12. 知识图谱嵌入的作用是什么?
A. 增强文本生成能力
B. 将符号知识表示为低维向量,便于计算推理
C. 优化图像识别
D. 动态自然语言处理
查看第 12 题答案与解析
参考答案:B。知识图谱嵌入把离散的符号知识编码成低维稠密向量,以便计算相似度、评分和预测。
13. TransE 的核心思想是什么?
A. 将关系看作从头实体到尾实体的平移
B. 使用神经网络提取所有语义特征
C. 对实体进行降阶操作
D. 关系作为多层矩阵运算
查看第 13 题答案与解析
参考答案:A。TransE 把关系建模为从头实体到尾实体的平移操作。
14. TransH 相较于 TransE 的主要改进是什么?
A. 将所有知识嵌入到相似空间
B. 采用循环神经网络优化实体表示
C. 为每个关系定义一个超平面
D. 引入动态注意力机制
查看第 14 题答案与解析
参考答案:C。TransH 为每个关系定义独立超平面,实体在不同关系下可以获得不同投影表示。
15. 知识图谱嵌入中评分函数的作用是什么?
A. 衡量三元组成立的可能性
B. 确定关系类型
C. 匹配实体类型
D. 筛选训练样本
查看第 15 题答案与解析
参考答案:A。评分函数为候选三元组给出合理性分数,用来衡量其成立的可能性。
16. 哪种模型适合处理对称关系?
A. TransE
B. RotatE
C. RESCAL
D. DKRL
查看第 16 题答案与解析
参考答案:B。RotatE 将关系建模为复数空间中的旋转,能够自然表达对称、反对称、逆关系和组合关系。
17. 知识表示学习中负采样的主要目的是什么?
A. 生成更多正样本
B. 提供对比学习样本
C. 提升测试精度
D. 构建知识语义关系
查看第 17 题答案与解析
参考答案:B。负样本为正三元组提供对比,使模型学会区分真实事实和被破坏的三元组。
18. 路径信息对知识图谱表示学习有什么作用?
A. 提升训练速度
B. 提供图形结构特征
C. 增强实体之间的语义联系
D. 生成新关系类型
查看第 18 题答案与解析
参考答案:C。多跳路径能够连接没有直接边的实体,为表示学习补充更丰富的结构和语义联系。
19. 远程监督关系抽取的主要问题是什么?
A. 训练数据中容易引入噪声
B. 实体识别要求……(回忆缩写为 stsbyqlwelj,原文未完全还原)
C. 效率较低
D. 对于句子中特定字段提取不准确
查看第 19 题答案与解析
参考答案:A。远程监督假设包含同一实体对的句子都表达知识图谱中的关系,该假设会自动产生大量错误标签。
第 19 题 B 项目前只能读出 stsbyqlwelj。把容易混淆的 d/l、c/e 排列组合后,仍不能得到一个既符合全部首字母、又符合远程监督课程语境的自然选项。最接近的猜测是“实体识别要求利用外部链接”,但它的标准首字母应为 stsbyqlywblj,与记录并不一致,因此不将它写成确定原文。
20. 以下哪项不属于知识图谱构建步骤?
A. 实体识别与关系抽取
B. 知识融合
C. 知识问答
D. 知识存储与推理
查看第 20 题答案与解析
参考答案:C。知识问答属于知识图谱的下游应用,不是知识图谱构建环节。
二、知识图谱基础
- 知识图谱由哪些部分构成?
查看第 1 题答案与解析
知识图谱在逻辑上分为两层:
- 概念层,也称模式层:由类、本体、概念间关系和约束组成,是知识图谱的核心和骨架,通常由本体库管理。
- 实例层,也称数据层:由真实实体及实体之间的事实关系组成,是知识图谱中的具体数据。
在图结构上,知识图谱由节点和边组成:节点表示实体或概念,边表示关系或属性。一条事实通常写成“头实体—关系—尾实体”的三元组。概念之间可使用 Subclass,实例与概念之间可使用 Instance Of 或 Type,实例之间使用具体关系连接。
- 关系型数据库和知识图谱有什么区别?
查看第 2 题答案与解析
| 对比维度 | 关系型数据库 | 知识图谱 |
|---|---|---|
| 主要对象 | 表、行、列中的结构化数据 | 实体、概念、关系及其语义 |
| 数据结构 | 预先定义的固定表结构 | 图结构,模式更灵活、易扩展 |
| 关系表达 | 依靠主键、外键和连接操作 | 关系直接表示为边 |
| 主要任务 | 数据存储、增删改查和事务处理 | 知识组织、关联检索、推理及知识应用 |
| 语义能力 | 字段本身的显式语义较弱 | 包含类型、本体、关系和约束等语义 |
| 推理能力 | 通常不直接提供语义推理 | 可结合本体、规则和表示学习完成推理 |
知识图谱不能替代关系型数据库。大规模知识图谱仍需要数据库技术完成可靠存储和高效查询;二者的主要区别在于知识图谱在数据之上增加了关系、语义和推理能力。
三、语义网与知识推理
- RDF、RDFS、SPARQL、OWL 的功能分别是什么?
查看第 1 题答案与解析
| 技术 | 功能 |
|---|---|
| RDF | 语义网的基础数据模型,用主语—谓词—宾语三元组表示事实,并组成有向图。 |
| RDFS | 在 RDF 之上描述类、属性、子类、子属性、定义域和值域等简单模式信息。 |
| SPARQL | RDF 图的标准查询语言,用图模式匹配、过滤和结果投影查询三元组数据。 |
| OWL | 基于描述逻辑的 Web 本体语言,表达类的等价与不相交、属性特征、基数限制等更复杂约束,并支持自动推理。 |
四者可以串成一条链:RDF 负责表示事实,RDFS 提供基础模式,OWL 提供更强的本体表达与推理,SPARQL 负责查询这些 RDF 数据。
- 不确定知识推理采用什么方法?
查看第 2 题答案与解析
采用基于统计的知识推理方法。它不要求结论必然成立,而是根据样本、概率或统计规律判断结论成立的可能性。例如,可以把总体统计结论应用到具体实体,得到带概率的推理结果。更具体的实现还可以使用概率图模型、马尔可夫逻辑或模糊逻辑等方法。
四、Cypher 查询
根据下图完成 Cypher 查询:
北航 ──全称──> 北京航空航天大学 ──成立──> 1952
│
二级单位
↓
AI 院 ──开设──> 知识图谱
└────开设──> 人工智能导论
题图中的五条已知关系如上。以下查询假定所有节点都使用 name 属性保存名称。
- 简称是“北航”的大学成立于哪一年?
查看第 1 题答案与解析
MATCH (shortName {name: '北航'})-[:全称]->(university)-[:成立]->(year)
RETURN year.name AS 成立年份
查询结果为 1952 年。
- 北京航空航天大学开设“知识图谱”和“AI 导论”的二级单位是什么?
查看第 2 题答案与解析
MATCH (university {name: '北京航空航天大学'})-[:二级单位]->(department)
MATCH (department)-[:开设]->(course)
WHERE course.name IN ['知识图谱', '人工智能导论']
WITH department, count(DISTINCT course) AS courseCount
WHERE courseCount = 2
RETURN department.name AS 二级单位
查询结果为 AI 院。先找到北京航空航天大学的二级单位,再匹配其开设的两门课程;courseCount = 2 保证返回的单位同时开设两门课程,而不是只开设其中一门。
五、知识抽取
- 对比手工方法、包装器归纳、自动抽取三种包装器生成方法的特点。
查看第 1 题答案与解析
| 方法 | 生成方式 | 优点 | 缺点 |
|---|---|---|---|
| 手工方法 | 人工分析网页结构并编写 XPath、CSS Selector 等抽取规则 | 规则明确,在固定模板上准确率高 | 开发慢、维护成本高、难以扩展,网页模板变化后容易失效 |
| 包装器归纳 | 标注少量页面样本,由监督学习方法归纳抽取规则 | 比完全手工构建快,可从样本中自动学习 | 依赖人工标注,跨网站和跨模板的泛化能力有限 |
| 自动抽取 | 聚类相似页面或重复结构,无监督地发现模板并生成规则 | 不需要人工标注,适合较大规模页面 | 模板识别和字段对齐更容易出错,准确率通常低于前两种方法 |
- BiLSTM+CRF 的主要步骤是什么?每一步的功能是什么?
查看第 2 题答案与解析
- 输入数据的分布表示:把字符或词转换为低维稠密向量,使向量的不同维度承载潜在语义特征。可以使用 Word2Vec 等预训练词向量,也可以在任务中共同学习嵌入。
- BiLSTM 上下文编码:前向 LSTM 和后向 LSTM 分别读取左右方向的序列,为每个位置融合左、右上下文信息,得到用于标签判断的中间语义表示。
- CRF 标签解码:同时考虑 BiLSTM 给出的各位置标签分数和标签之间的转移约束,在所有候选标签序列中找出整体得分最高的合法序列。
BiLSTM 解决“如何从上下文自动学习特征”,CRF 解决“如何让相邻标签组合合理”。两者结合可以避免逐位置独立分类产生不合法的 BIO/BIOES 序列。
六、AMIE 规则学习
根据下图回答问题:
F ──isFatherOf──> X ──wonPrize──> Q ──forRole──> O
│ ├- - - - - - - - - - - - -> O
│ └- - - -> U1 - - - -> U2
└──hasWife──> S ──hasChild──> X
X ──fatherIs──> F
图中三条虚线关系的名称未能还原。
forRole 是确定的关系名。三条虚线的关系名没有记下,因此保留为空;它们目前也没有构成连接规则头两个变量的新路径,不影响下面两条规则。
- 使用 AMIE 生成规则头为
isFatherOf(A, B)的所有闭式霍恩规则。
查看第 1 题答案与解析
规则一:利用 fatherIs 的反向关系。
规则二:通过妻子和孩子组成两跳路径。
两条规则中的每个变量均至少出现两次,规则主体又都在规则头的两个变量之间形成闭合路径,因此是闭式霍恩规则。
- 计算第 1 问中规则的支持度和标准置信度。
查看第 2 题答案与解析
规则支持度是同时满足规则主体和规则头的变量实例数量:
标准置信度是支持度与满足规则主体的变量实例数量之比:
对于规则一,图中满足主体的实例是 (B=X,A=F),对应的规则头 isFatherOf(F,X) 也存在,所以:
对于规则二,图中满足主体的实例是 (A=F,C=S,B=X),对应的规则头也存在,所以:
这一结果建立在题图展示的事实集合完整,且未知虚线不会增加同一规则主体的新匹配实例这一前提下。
七、知识图谱表示学习
- TransE 的目标是什么?负采样的意义和方法分别是什么?
查看第 1 题答案与解析
TransE 的目标:学习实体和关系的低维向量,使正确三元组中“从头实体经过关系到达尾实体”的平移关系尽可能合理,同时让错误三元组的评分更差。训练完成后,可以根据候选三元组的评分完成链接预测和知识图谱补全。
负采样的意义:知识图谱主要记录正事实,并没有直接给出大量负事实。若只训练正三元组,模型无法学习真实事实与错误组合之间的边界。负采样人为构造错误三元组,与正样本进行对比,使正确三元组获得更优评分。
基本方法:从正三元组出发,保持关系不变,随机替换头实体或尾实体,并过滤掉知识图谱中已经存在的事实。例如,将一个正确三元组的头实体或尾实体替换成其他实体,得到候选负样本。
随机替换可能生成两类问题样本:
- 假阴性:被替换后的三元组实际上也是真的,只是训练集没有记录。
- 低质量负样本:实体类型明显不匹配,模型无需学习就能区分,训练价值较低。
因此还可以使用 Bernoulli 采样、类型约束采样、常识指导采样和困难负样本采样,提高负样本质量。
- 除三元组外,还可以利用哪些信息增强知识图谱表示学习的效果?
查看第 2 题答案与解析
| 信息 | 作用 | 课程中的典型方向 |
|---|---|---|
| 多跳路径 | 补充实体间的间接语义联系和图结构信息 | PTransE |
| 逻辑规则 | 把可解释的符号规律转化为训练约束或生成新三元组 | KALE、RUGE、EngineKG |
| 实体类型和层次 | 约束实体语义,使相同类型实体的表示更接近 | TKRL、AutoETER |
| 常识知识 | 避免违反常识的推理,并指导高质量负采样 | CAKE |
| 实体文本描述 | 利用自然语言描述区分实体,并表示训练时未见的新实体 | DKRL |
| 图像等多模态信息 | 融合视觉特征,补充纯结构信息缺失的实体语义 | IKRL |
核心思路是利用三元组结构以外的语义和约束弥补知识图谱稀疏性,使实体与关系表示更准确,并提高链接预测和知识补全效果。