2026 年春真题(回忆版)

(updated 2026年8月23日)

根据考后速记和试卷照片还原。第一至第三大题来自手写回忆,第四至第六大题来自试卷照片。

建议先独立完成每个小问,再手动展开对应答案。折叠内容不是课程提供的官方标准答案,而是我根据课程讲义和现有试题信息整理的参考解析,作答时可按分值压缩。

一、序列建模与机器人任务环节

1. RNN、LSTM 和 GRU 的共同点与改进

比较普通 RNN、LSTM 和 GRU 在序列建模上的共同点,以及 LSTM、GRU 相对于普通 RNN 的改进。

展开答案与解析

三者的共同点是都用于序列建模:按时间步处理输入,利用内部状态保存此前信息;不同时间步共享同一组网络参数,因此可以处理变长序列,并对时间依赖进行建模。

模型记忆结构主要特点
普通 RNN单一隐藏状态 hth_t结构简单、参数少,但沿时间反向传播时容易出现梯度消失或爆炸,难以学习长程依赖。
LSTM隐藏状态 hth_t、细胞状态 CtC_t,以及遗忘门、输入门、输出门通过细胞状态的加法通路保留长期信息,由三个门控制忘记、写入和输出,显著缓解长程依赖问题。
GRU隐藏状态 hth_t,以及更新门、重置门将 LSTM 的结构合并简化,参数更少、训练更快,同时保留门控记忆能力。

所以,LSTM 和 GRU 的共同改进是引入门控机制,让模型选择性地保留或丢弃历史信息,而不是像普通 RNN 那样在每一步把新旧信息直接混合。

2. 抓取任务与智能机器人环节的对应

抓取机器人包含“发现目标—规划路径—移动到目标位置—执行抓取”四个环节。智能机器人完成任务时的感知、认知、决策、执行分别如何与这些环节对应?

展开答案与解析

智能机器人形成“感知—认知—决策—执行—反馈”的闭环。抓取任务中的四步可以这样对应:

抓取环节智能环节作用
发现目标感知用摄像头、深度相机等检测目标,估计其类别、位置和姿态。
规划路径认知与决策根据目标、障碍物和机器人状态理解场景,再选择机械臂或移动底盘的可行路径。
移动到目标位置执行控制底盘或机械臂沿规划轨迹运动,并通过传感反馈不断修正误差。
执行抓取执行控制末端执行器对准、接近、闭合并确认抓取是否成功。

这里不是机械的一一对应:路径规划同时包含场景认知和动作决策,移动与抓取都属于执行。执行结果还会反馈给感知环节,抓取失败时重新定位和规划。

二、RNN 计算题

已知一个简单 RNN:

ht=tanh⁡(Wxhxt+Whhht−1+bh)h_t=\tanh\left(W_{xh}x_t+W_{hh}h_{t-1}+b_h\right) yt=softmax⁡(Whyht+by)y_t=\operatorname{softmax}\left(W_{hy}h_t+b_y\right)

输入维度为 4,隐藏状态维度为 3,输出维度为 2。

1. 参数形状与数量

分别计算 WxhW_{xh}、WhhW_{hh}、bhb_h、WhyW_{hy}、byb_y 的形状和参数数量。

展开答案与解析

输入维度 dx=4d_x=4,隐藏状态维度 dh=3d_h=3,输出维度 dy=2d_y=2。按照题目公式,矩阵的每一行对应一个输出单元:

参数形状参数数量
WxhW_{xh}3×43\times412
WhhW_{hh}3×33\times39
bhb_h333
WhyW_{hy}2×32\times36
byb_y222

2. 总参数量

计算该 RNN 的总参数量。

展开答案与解析

总参数量为:

12+9+3+6+2=3212+9+3+6+2=32

3. RNN 任务举例

分别举例说明一对多和多对多的 RNN 任务。

展开答案与解析
  • 一对多:给定一张图像,依次生成一段图像描述;给定一个音乐类别,连续生成一段音符序列。
  • 多对多:对句子中每个词进行词性标注或命名实体识别;将一个源语言序列翻译成一个目标语言序列。

前一种多对多任务的输入与输出通常等长,后一种编码器—解码器任务可以不等长。

三、Mamba 与 Transformer

1. Mamba 的核心优势

与 Transformer 相比,Mamba 的核心优势是什么?

展开答案与解析

Transformer 的自注意力需要比较任意两个位置,时间和显存开销随序列长度 NN 近似按 O(N2)O(N^2) 增长。Mamba 使用带选择机制的状态空间模型,不构造完整注意力矩阵,主要计算量随序列长度近似线性增长。

因此,Mamba 的主要优势是:

  • 处理长序列时计算和显存开销更低;
  • 能把历史信息压缩到固定大小的状态中,增量推理效率高;
  • 选择机制会根据当前输入决定哪些信息写入、保留或输出,弥补传统线性状态空间模型内容选择能力不足的问题。

2. 训练与推理的计算形态

为什么说 Mamba 训练像并行扫描,推理像 RNN?

展开答案与解析

离散状态空间模型可以写成递推形式:

ht=Aˉtht−1+Bˉtxt,yt=Cthth_t=\bar A_t h_{t-1}+\bar B_t x_t, \qquad y_t=C_t h_t

训练时,完整序列已经给出。相邻状态之间的线性递推可以组合成满足结合律的运算,因此可使用并行前缀扫描一次处理许多时间步,不必真的按 Python 循环逐步计算。

推理时,新输入逐个到来。模型只需保留上一时刻的固定大小状态 ht−1h_{t-1},再递推得到 hth_t 和 yty_t。这种“保存状态—读入一步—更新状态”的方式与 RNN 相同。

所以,Mamba 是同一个状态空间模型的两种计算形态:训练时利用整段序列做并行扫描,推理时利用缓存状态做逐步递推。

四、智能控制方案设计(20 分)

训练机器人完成复杂地形下的长距离稳定行走或奔跑任务,设计智能控制方案。

1. 感知输入(4 分)

机器人需要哪些感知输入?

展开答案与解析

目标是让机器人在复杂地形上长距离稳定行走或奔跑。整体闭环可写为:

多模态传感器 → 状态估计与地形理解 → 时序特征提取
      → 强化学习策略 / TSK 辅助决策 → 关节控制器
      → 机器人与复杂地形 → 传感反馈

感知输入可以分为三类:

  • 本体感知:关节角、关节速度、关节力矩、电机电流、足端接触力、机身姿态、角速度和线加速度。编码器、IMU、力或力矩传感器提供这些信息。
  • 外部环境感知:RGB 或深度图像、激光雷达点云、地形高度图、坡度、障碍物位置、地面粗糙度和可通行区域。
  • 任务输入:目标行进方向、期望速度、目标位置,以及“行走”或“奔跑”等高层指令。

本体感知回答“机器人现在怎样”,外部感知回答“前方地形怎样”,任务输入回答“机器人要去哪里、以什么方式去”。

2. 强化学习中的状态、动作和奖励(4 分)

如何定义强化学习中的状态、动作和奖励?

展开答案与解析

状态 sts_t 应尽量包含决策所需信息,例如机身姿态和速度、关节角和角速度、足端接触、上一时刻动作、局部地形特征、目标方向和期望速度。若单帧观测不能完整反映真实状态,可用 RNN 或 Transformer 融合历史观测。

动作 ata_t 可以定义为各关节的目标位置、目标速度、目标力矩,或步态频率、步长、抬脚高度等中间控制指令。工程上常由策略输出关节目标,再交给底层 PD 控制器执行。

奖励 rtr_t 应同时体现任务、稳定、效率和安全:

rt=wvr速度跟踪+wpr前进进度+wsr姿态稳定−wer能耗−wcr碰撞或跌倒−wjr动作突变r_t= w_v r_{\text{速度跟踪}} +w_p r_{\text{前进进度}} +w_s r_{\text{姿态稳定}} -w_e r_{\text{能耗}} -w_c r_{\text{碰撞或跌倒}} -w_j r_{\text{动作突变}}

速度跟踪和前进进度给正奖励;身体倾斜、足端打滑、能耗、动作不平滑、碰撞和跌倒给惩罚。奖励设计要避免只追求速度而牺牲稳定性。

3. 时序传感数据处理(4 分)

可以如何利用 RNN/LSTM/GRU 和 Transformer 处理时序传感数据?

展开答案与解析
  1. 先对多传感器数据做时间同步、去噪、归一化和缺失值处理,再将各模态特征拼接或融合。
  2. RNN/LSTM/GRU 按时间递推隐藏状态,适合在线流式控制。普通 RNN 处理短期依赖,LSTM 和 GRU 更适合步态周期、地形变化等较长依赖。
  3. Transformer 把一段时间窗内的传感数据作为 token,加入位置编码后用自注意力提取任意时间点之间的关系,适合并行训练和融合较长历史。
  4. 时序模型输出的状态表征可送入强化学习策略、地形分类器或控制器,预测下一时刻状态、识别步态阶段并生成动作。

在线部署时还要比较时延和算力:RNN 类模型递推开销小;Transformer 上下文能力强,但窗口越长,注意力开销越大。

4. TSK 模糊系统的作用(5 分)

TSK 模糊系统可以在哪些环节发挥作用?

展开答案与解析

TSK 模糊系统的前件用隶属函数表达“坡度较大”“姿态误差较小”等模糊条件,后件用输入的函数直接计算数值输出。它可以放在以下环节:

  • 状态估计与传感融合:根据 IMU、接触力和视觉置信度,对多个估计结果进行模糊加权。
  • 地形与步态决策:根据坡度、粗糙度、速度和稳定裕度,输出步长、步频、抬脚高度或步态模式。
  • 底层控制参数整定:根据姿态误差及其变化率,在线调节 PD/PID 增益或计算关节控制补偿。
  • 抗扰与安全协调:检测到打滑、冲击或倾倒趋势时,降低期望速度、增大稳定控制权重或触发保守策略。

TSK 的规则可由专家给出,也可用数据和梯度下降训练。它既保留 IF-THEN 规则的可解释性,又能输出连续控制量,适合充当强化学习策略与底层控制器之间的可解释辅助模块。

5. 性能与安全评价(3 分)

你会如何评价该系统的性能与安全性?

展开答案与解析

性能指标包括任务成功率、平均行进距离和速度、速度跟踪误差、姿态误差、跌倒率、恢复时间、能耗、动作平滑度和单步控制时延。应在平地、坡地、台阶、碎石等不同地形上重复测试,并加入载荷变化、推搡、传感噪声和执行器参数偏差评估鲁棒性。

安全评价包括碰撞率、跌倒率、关节角或力矩越界次数、最小障碍距离和紧急制动成功率。验证应按“仿真—硬件在环—安全绳保护下真机—开放场景”逐级进行,并设置动作限幅、姿态保护、异常检测、紧急停止和传统控制器兜底。

五、模糊控制器设计(15 分)

无人配送车需要在固定道路上实现平稳定速巡航。车辆从低速行驶状态进入巡航阶段时,需要较快达到目标车速;在稳定巡航时,需要尽量减小车速波动;当车辆遇到上坡或载重变化时,需要具有一定的抗扰动能力。

设车辆初始车速为 10 km/h,目标巡航车速为 40 km/h。要求控制系统满足以下性能需求:

  1. 车辆能够较快从 10 km/h 跟踪至 40 km/h;
  2. 稳定巡航时,车速稳态误差不超过 ±1\pm1 km/h;
  3. 当车辆突然驶入 4% 上坡路段,或载重突然增加 100 kg 时,能够在约 4 s 内恢复到目标车速附近并保持稳定。

请结合模糊控制的基本思想,设计车速跟踪模糊控制器。

展开答案与解析

1. 控制器结构

采用二维增量式模糊控制器:

e(k)=vr−v(k)e(k)=v_r-v(k) ec(k)=e(k)−e(k−1)ec(k)=e(k)-e(k-1)

两个输入分别为车速误差 ee 和误差变化 ecec,输出为驱动力、油门或电机转矩的增量 Δu\Delta u:

u(k)=sat⁡(u(k−1)+Δu(k))u(k)=\operatorname{sat}\left(u(k-1)+\Delta u(k)\right)

其中 sat 表示根据执行器能力进行限幅。控制闭环为:

目标车速 → 计算 e、ec → 量化与模糊化 → 规则推理
         → 解模糊 → 控制量增量 Δu → 车辆 → 车速反馈

2. 模糊集和隶属函数

使用比例因子把实际误差映射到归一化论域:

E=Kee,EC=Kecec,Δu=KuUE=K_e e, \qquad EC=K_{ec}ec, \qquad \Delta u=K_u U

EE、ECEC 和 UU 均使用七个语言值:

{NB,NM,NS,ZO,PS,PM,PB}\{NB,NM,NS,ZO,PS,PM,PB\}

它们分别表示负大、负中、负小、零、正小、正中、正大。中间区域采用重叠三角形隶属函数,两端可采用梯形隶属函数。应在 e=0e=0 附近划分得更细,以满足稳态误差不超过 ±1\pm1 km/h。

3. 模糊规则

规则原则是:误差大时快速加减驱动力;误差正在快速减小时提前收力,避免超调;误差接近零时只作小幅修正。

E\ECNBNMNSZOPSPMPB
NBNBNBNMNMNSNSZO
NMNBNMNMNSNSZOPS
NSNMNMNSNSZOPSPS
ZONMNSNSZOPSPSPM
PSNSNSZOPSPSPMPM
PMNSZOPSPSPMPMPB
PBZOPSPSPMPMPBPB

例如:

  • IF E is PB AND EC is PB THEN U is PB:车速明显偏低且误差还在增大,迅速增加驱动力;
  • IF E is PB AND EC is NB THEN U is ZO:虽然仍未到目标车速,但误差正在快速减小,暂不继续猛加驱动力;
  • IF E is ZO AND EC is ZO THEN U is ZO:已稳定在目标附近,保持当前控制量;
  • IF E is NB THEN U is NB/NM:车速超过目标,降低驱动力或制动。

4. 推理、解模糊和参数整定

可采用 Mamdani max-min 推理,将所有激活规则的输出合成,再用重心法解模糊得到精确的 Δu\Delta u。工程实现时可把全部规则离线计算成查询表,在线直接查表,减少时延。

三个比例因子的作用不同:KeK_e 决定对速度误差的敏感度,KecK_{ec} 决定阻尼和提前收力程度,KuK_u 决定控制动作强弱。通过仿真和道路测试调整它们,并加入控制量限幅、变化率限制和抗积分饱和措施。

5. 对三类性能需求的响应

  • 从 10 km/h 加速至 40 km/h:初始 ee 为较大的正值,激活 PM/PB 规则,输出较大正控制增量,实现快速加速;接近目标时逐步减小输出,抑制超调。
  • 稳定巡航:在 e=0e=0 附近使用较密的隶属函数和小输出规则,使控制器只作细微修正,将误差控制在 ±1\pm1 km/h 内。
  • 上坡或增载扰动:车速下降使 ee、ecec 转为正值,控制器立即提高驱动力;误差恢复时逐步收力。通过增大合适的 KeK_e、KuK_u 并保证足够控制余量,使恢复时间接近 4 s,同时避免振荡。

最终应分别对阶跃目标、4% 坡度扰动和 100 kg 载重扰动仿真,检查上升时间、超调量、稳态误差、恢复时间和控制输出是否满足约束。

六、论述题(30 分,每小题 10 分)

1. 神经网络模型参考自适应控制

神经网络控制可以利用神经网络的学习能力改善传统控制系统。请给出神经网络模型参考自适应控制的基本框图,并论述参考模型和神经网络控制器的作用。(10 分)

展开答案与解析

基本框图可以表示为:

                 ┌──────> 参考模型 M ──────> y_m ───┐
参考输入 r ──────┤                                  │
                 └─> 神经网络控制器 ─> 被控对象 ─> y ├─> e_c=y_m-y
                           ↑              │          │
                           └── 输出反馈 ───┘          │
                           ↑                         │
                           └──── 学习算法更新权值 <──┘

参考模型规定系统希望达到的理想动态特性。它把参考输入 rr 转换成期望输出 ymy_m,其中可以预先规定响应速度、超调量、阻尼和稳态误差。参考模型不是实际被控对象,而是实际系统应该模仿的“标准答案”。

神经网络控制器根据参考输入和系统反馈生成控制量。由于神经网络具有非线性逼近能力,它可以学习未知对象的逆动态或直接学习控制律。学习算法使用模型跟踪误差

ec=ym−ye_c=y_m-y

调整网络权值,使实际输出 yy 逐渐逼近参考模型输出 ymy_m。实际设计还应对控制量限幅,并用稳定性分析或传统控制器兜底,防止在线学习阶段产生危险动作。

2. 迭代学习控制

请论述迭代学习控制的基本思想,并说明迭代学习控制适合应用于怎样的控制任务。(10 分)

展开答案与解析

迭代学习控制的核心是:系统重复执行同一有限时长任务,利用上一轮在每个时刻产生的跟踪误差,修正下一轮同一时刻的控制输入,使轨迹一轮比一轮接近期望轨迹。

设第 kk 轮的控制输入和误差为 uk(t)u_k(t)、ek(t)e_k(t),P 型学习律为:

uk+1(t)=uk(t)+Γek(t)u_{k+1}(t)=u_k(t)+\Gamma e_k(t)

更一般的 PID 型学习律为:

uk+1(t)=uk(t)+Γe˙k(t)+Φek(t)+Ψ∫0tek(τ) dτu_{k+1}(t)=u_k(t) +\Gamma\dot e_k(t) +\Phi e_k(t) +\Psi\int_0^t e_k(\tau)\,d\tau

普通反馈控制沿时间轴用当前误差纠正后续动作,属于“做错后再改”;ILC 还增加了迭代轴,用上一轮同一时刻的误差提前修正下一轮动作,因而能把重复扰动学习成前馈补偿。

ILC 适合满足以下特征的任务:

  • 相同或相近的任务可以反复执行;
  • 每轮具有相同时间区间、目标轨迹和近似初始条件;
  • 扰动和未建模动态具有较强重复性;
  • 允许经过多轮逐步提高精度。

典型应用包括机械臂重复焊接、喷涂与装配,数控机床加工,固定路线巡检,高铁固定区段运行以及车辆重复赛道跟踪。它不适合每次目标、环境和初始状态都完全不同的一次性任务,也不擅长不可重复的随机扰动。

3. Pi0 与 Pi0.5

Pi0 是 2024 年提出的典型视觉—语言—动作基础模型(VLA),在智能驾驶等场景中具有重要应用价值。该模型采用混合专家架构,将视觉—语言模型主干(VLM)与动作专家模块结合,并通过流匹配技术生成平滑、连续的动作序列。

Pi0.5 在 Pi0 的基础上进一步面向开放世界泛化问题,引入知识隔离架构和分层推理机制,使模型能够先预测高层语义子任务,再生成具体低层动作。

请结合课程内容,论述 Pi0 与 Pi0.5 的主要区别。(10 分)

展开答案与解析
对比维度Pi0Pi0.5
主要目标建立能控制多种机器人的通用 VLA 基础模型。在 Pi0 基础上提高开放世界中的语义泛化和长程任务能力。
基本架构混合专家架构,将 VLM 主干与动作专家结合。保留视觉—语言与动作模块,并进一步引入知识隔离和分层推理。
动作生成使用流匹配生成平滑、连续的低层动作序列。先预测高层语义子任务,再以子任务为条件生成具体低层动作。
知识处理端到端联合训练时,动作学习的梯度可能干扰 VLM 已有的语言和常识知识。使用知识隔离或梯度隔离保护 VLM 预训练知识,减少知识干扰。
训练数据主要联合机器人视觉、语言和动作数据训练通用控制能力。进一步协同利用异构数据,让高层语义知识和低层动作数据各尽其用。
泛化能力擅长生成连续动作,但复杂开放世界任务的语义规划能力有限。“先思考、再行动”,更适合新场景、新物体和多阶段长程任务。

两者的联系是 Pi0.5 并没有抛弃 Pi0 的 VLA 和流匹配动作生成路线,而是补上两个关键缺口:一是保护 VLM 已有知识,二是把高层任务推理与低层动作生成分层。因此,Pi0 更强调通用、连续的动作生成,Pi0.5 更强调开放世界泛化和多阶段任务执行。

评论