2026 年春真题(回忆版)
根据考后速记和试卷照片还原。第一至第三大题来自手写回忆,第四至第六大题来自试卷照片。
建议先独立完成每个小问,再手动展开对应答案。折叠内容不是课程提供的官方标准答案,而是我根据课程讲义和现有试题信息整理的参考解析,作答时可按分值压缩。
一、序列建模与机器人任务环节
1. RNN、LSTM 和 GRU 的共同点与改进
比较普通 RNN、LSTM 和 GRU 在序列建模上的共同点,以及 LSTM、GRU 相对于普通 RNN 的改进。
展开答案与解析
三者的共同点是都用于序列建模:按时间步处理输入,利用内部状态保存此前信息;不同时间步共享同一组网络参数,因此可以处理变长序列,并对时间依赖进行建模。
| 模型 | 记忆结构 | 主要特点 |
|---|---|---|
| 普通 RNN | 单一隐藏状态 | 结构简单、参数少,但沿时间反向传播时容易出现梯度消失或爆炸,难以学习长程依赖。 |
| LSTM | 隐藏状态 、细胞状态 ,以及遗忘门、输入门、输出门 | 通过细胞状态的加法通路保留长期信息,由三个门控制忘记、写入和输出,显著缓解长程依赖问题。 |
| GRU | 隐藏状态 ,以及更新门、重置门 | 将 LSTM 的结构合并简化,参数更少、训练更快,同时保留门控记忆能力。 |
所以,LSTM 和 GRU 的共同改进是引入门控机制,让模型选择性地保留或丢弃历史信息,而不是像普通 RNN 那样在每一步把新旧信息直接混合。
2. 抓取任务与智能机器人环节的对应
抓取机器人包含“发现目标—规划路径—移动到目标位置—执行抓取”四个环节。智能机器人完成任务时的感知、认知、决策、执行分别如何与这些环节对应?
展开答案与解析
智能机器人形成“感知—认知—决策—执行—反馈”的闭环。抓取任务中的四步可以这样对应:
| 抓取环节 | 智能环节 | 作用 |
|---|---|---|
| 发现目标 | 感知 | 用摄像头、深度相机等检测目标,估计其类别、位置和姿态。 |
| 规划路径 | 认知与决策 | 根据目标、障碍物和机器人状态理解场景,再选择机械臂或移动底盘的可行路径。 |
| 移动到目标位置 | 执行 | 控制底盘或机械臂沿规划轨迹运动,并通过传感反馈不断修正误差。 |
| 执行抓取 | 执行 | 控制末端执行器对准、接近、闭合并确认抓取是否成功。 |
这里不是机械的一一对应:路径规划同时包含场景认知和动作决策,移动与抓取都属于执行。执行结果还会反馈给感知环节,抓取失败时重新定位和规划。
二、RNN 计算题
已知一个简单 RNN:
输入维度为 4,隐藏状态维度为 3,输出维度为 2。
1. 参数形状与数量
分别计算 、、、、 的形状和参数数量。
展开答案与解析
输入维度 ,隐藏状态维度 ,输出维度 。按照题目公式,矩阵的每一行对应一个输出单元:
| 参数 | 形状 | 参数数量 |
|---|---|---|
| 12 | ||
| 9 | ||
| 3 | ||
| 6 | ||
| 2 |
2. 总参数量
计算该 RNN 的总参数量。
展开答案与解析
总参数量为:
3. RNN 任务举例
分别举例说明一对多和多对多的 RNN 任务。
展开答案与解析
- 一对多:给定一张图像,依次生成一段图像描述;给定一个音乐类别,连续生成一段音符序列。
- 多对多:对句子中每个词进行词性标注或命名实体识别;将一个源语言序列翻译成一个目标语言序列。
前一种多对多任务的输入与输出通常等长,后一种编码器—解码器任务可以不等长。
三、Mamba 与 Transformer
1. Mamba 的核心优势
与 Transformer 相比,Mamba 的核心优势是什么?
展开答案与解析
Transformer 的自注意力需要比较任意两个位置,时间和显存开销随序列长度 近似按 增长。Mamba 使用带选择机制的状态空间模型,不构造完整注意力矩阵,主要计算量随序列长度近似线性增长。
因此,Mamba 的主要优势是:
- 处理长序列时计算和显存开销更低;
- 能把历史信息压缩到固定大小的状态中,增量推理效率高;
- 选择机制会根据当前输入决定哪些信息写入、保留或输出,弥补传统线性状态空间模型内容选择能力不足的问题。
2. 训练与推理的计算形态
为什么说 Mamba 训练像并行扫描,推理像 RNN?
展开答案与解析
离散状态空间模型可以写成递推形式:
训练时,完整序列已经给出。相邻状态之间的线性递推可以组合成满足结合律的运算,因此可使用并行前缀扫描一次处理许多时间步,不必真的按 Python 循环逐步计算。
推理时,新输入逐个到来。模型只需保留上一时刻的固定大小状态 ,再递推得到 和 。这种“保存状态—读入一步—更新状态”的方式与 RNN 相同。
所以,Mamba 是同一个状态空间模型的两种计算形态:训练时利用整段序列做并行扫描,推理时利用缓存状态做逐步递推。
四、智能控制方案设计(20 分)
训练机器人完成复杂地形下的长距离稳定行走或奔跑任务,设计智能控制方案。
1. 感知输入(4 分)
机器人需要哪些感知输入?
展开答案与解析
目标是让机器人在复杂地形上长距离稳定行走或奔跑。整体闭环可写为:
多模态传感器 → 状态估计与地形理解 → 时序特征提取
→ 强化学习策略 / TSK 辅助决策 → 关节控制器
→ 机器人与复杂地形 → 传感反馈
感知输入可以分为三类:
- 本体感知:关节角、关节速度、关节力矩、电机电流、足端接触力、机身姿态、角速度和线加速度。编码器、IMU、力或力矩传感器提供这些信息。
- 外部环境感知:RGB 或深度图像、激光雷达点云、地形高度图、坡度、障碍物位置、地面粗糙度和可通行区域。
- 任务输入:目标行进方向、期望速度、目标位置,以及“行走”或“奔跑”等高层指令。
本体感知回答“机器人现在怎样”,外部感知回答“前方地形怎样”,任务输入回答“机器人要去哪里、以什么方式去”。
2. 强化学习中的状态、动作和奖励(4 分)
如何定义强化学习中的状态、动作和奖励?
展开答案与解析
状态 应尽量包含决策所需信息,例如机身姿态和速度、关节角和角速度、足端接触、上一时刻动作、局部地形特征、目标方向和期望速度。若单帧观测不能完整反映真实状态,可用 RNN 或 Transformer 融合历史观测。
动作 可以定义为各关节的目标位置、目标速度、目标力矩,或步态频率、步长、抬脚高度等中间控制指令。工程上常由策略输出关节目标,再交给底层 PD 控制器执行。
奖励 应同时体现任务、稳定、效率和安全:
速度跟踪和前进进度给正奖励;身体倾斜、足端打滑、能耗、动作不平滑、碰撞和跌倒给惩罚。奖励设计要避免只追求速度而牺牲稳定性。
3. 时序传感数据处理(4 分)
可以如何利用 RNN/LSTM/GRU 和 Transformer 处理时序传感数据?
展开答案与解析
- 先对多传感器数据做时间同步、去噪、归一化和缺失值处理,再将各模态特征拼接或融合。
- RNN/LSTM/GRU 按时间递推隐藏状态,适合在线流式控制。普通 RNN 处理短期依赖,LSTM 和 GRU 更适合步态周期、地形变化等较长依赖。
- Transformer 把一段时间窗内的传感数据作为 token,加入位置编码后用自注意力提取任意时间点之间的关系,适合并行训练和融合较长历史。
- 时序模型输出的状态表征可送入强化学习策略、地形分类器或控制器,预测下一时刻状态、识别步态阶段并生成动作。
在线部署时还要比较时延和算力:RNN 类模型递推开销小;Transformer 上下文能力强,但窗口越长,注意力开销越大。
4. TSK 模糊系统的作用(5 分)
TSK 模糊系统可以在哪些环节发挥作用?
展开答案与解析
TSK 模糊系统的前件用隶属函数表达“坡度较大”“姿态误差较小”等模糊条件,后件用输入的函数直接计算数值输出。它可以放在以下环节:
- 状态估计与传感融合:根据 IMU、接触力和视觉置信度,对多个估计结果进行模糊加权。
- 地形与步态决策:根据坡度、粗糙度、速度和稳定裕度,输出步长、步频、抬脚高度或步态模式。
- 底层控制参数整定:根据姿态误差及其变化率,在线调节 PD/PID 增益或计算关节控制补偿。
- 抗扰与安全协调:检测到打滑、冲击或倾倒趋势时,降低期望速度、增大稳定控制权重或触发保守策略。
TSK 的规则可由专家给出,也可用数据和梯度下降训练。它既保留 IF-THEN 规则的可解释性,又能输出连续控制量,适合充当强化学习策略与底层控制器之间的可解释辅助模块。
5. 性能与安全评价(3 分)
你会如何评价该系统的性能与安全性?
展开答案与解析
性能指标包括任务成功率、平均行进距离和速度、速度跟踪误差、姿态误差、跌倒率、恢复时间、能耗、动作平滑度和单步控制时延。应在平地、坡地、台阶、碎石等不同地形上重复测试,并加入载荷变化、推搡、传感噪声和执行器参数偏差评估鲁棒性。
安全评价包括碰撞率、跌倒率、关节角或力矩越界次数、最小障碍距离和紧急制动成功率。验证应按“仿真—硬件在环—安全绳保护下真机—开放场景”逐级进行,并设置动作限幅、姿态保护、异常检测、紧急停止和传统控制器兜底。
五、模糊控制器设计(15 分)
无人配送车需要在固定道路上实现平稳定速巡航。车辆从低速行驶状态进入巡航阶段时,需要较快达到目标车速;在稳定巡航时,需要尽量减小车速波动;当车辆遇到上坡或载重变化时,需要具有一定的抗扰动能力。
设车辆初始车速为 10 km/h,目标巡航车速为 40 km/h。要求控制系统满足以下性能需求:
- 车辆能够较快从 10 km/h 跟踪至 40 km/h;
- 稳定巡航时,车速稳态误差不超过 km/h;
- 当车辆突然驶入 4% 上坡路段,或载重突然增加 100 kg 时,能够在约 4 s 内恢复到目标车速附近并保持稳定。
请结合模糊控制的基本思想,设计车速跟踪模糊控制器。
展开答案与解析
1. 控制器结构
采用二维增量式模糊控制器:
两个输入分别为车速误差 和误差变化 ,输出为驱动力、油门或电机转矩的增量 :
其中 sat 表示根据执行器能力进行限幅。控制闭环为:
目标车速 → 计算 e、ec → 量化与模糊化 → 规则推理
→ 解模糊 → 控制量增量 Δu → 车辆 → 车速反馈
2. 模糊集和隶属函数
使用比例因子把实际误差映射到归一化论域:
、 和 均使用七个语言值:
它们分别表示负大、负中、负小、零、正小、正中、正大。中间区域采用重叠三角形隶属函数,两端可采用梯形隶属函数。应在 附近划分得更细,以满足稳态误差不超过 km/h。
3. 模糊规则
规则原则是:误差大时快速加减驱动力;误差正在快速减小时提前收力,避免超调;误差接近零时只作小幅修正。
| E\EC | NB | NM | NS | ZO | PS | PM | PB |
|---|---|---|---|---|---|---|---|
| NB | NB | NB | NM | NM | NS | NS | ZO |
| NM | NB | NM | NM | NS | NS | ZO | PS |
| NS | NM | NM | NS | NS | ZO | PS | PS |
| ZO | NM | NS | NS | ZO | PS | PS | PM |
| PS | NS | NS | ZO | PS | PS | PM | PM |
| PM | NS | ZO | PS | PS | PM | PM | PB |
| PB | ZO | PS | PS | PM | PM | PB | PB |
例如:
IF E is PB AND EC is PB THEN U is PB:车速明显偏低且误差还在增大,迅速增加驱动力;IF E is PB AND EC is NB THEN U is ZO:虽然仍未到目标车速,但误差正在快速减小,暂不继续猛加驱动力;IF E is ZO AND EC is ZO THEN U is ZO:已稳定在目标附近,保持当前控制量;IF E is NB THEN U is NB/NM:车速超过目标,降低驱动力或制动。
4. 推理、解模糊和参数整定
可采用 Mamdani max-min 推理,将所有激活规则的输出合成,再用重心法解模糊得到精确的 。工程实现时可把全部规则离线计算成查询表,在线直接查表,减少时延。
三个比例因子的作用不同: 决定对速度误差的敏感度, 决定阻尼和提前收力程度, 决定控制动作强弱。通过仿真和道路测试调整它们,并加入控制量限幅、变化率限制和抗积分饱和措施。
5. 对三类性能需求的响应
- 从 10 km/h 加速至 40 km/h:初始 为较大的正值,激活 PM/PB 规则,输出较大正控制增量,实现快速加速;接近目标时逐步减小输出,抑制超调。
- 稳定巡航:在 附近使用较密的隶属函数和小输出规则,使控制器只作细微修正,将误差控制在 km/h 内。
- 上坡或增载扰动:车速下降使 、 转为正值,控制器立即提高驱动力;误差恢复时逐步收力。通过增大合适的 、 并保证足够控制余量,使恢复时间接近 4 s,同时避免振荡。
最终应分别对阶跃目标、4% 坡度扰动和 100 kg 载重扰动仿真,检查上升时间、超调量、稳态误差、恢复时间和控制输出是否满足约束。
六、论述题(30 分,每小题 10 分)
1. 神经网络模型参考自适应控制
神经网络控制可以利用神经网络的学习能力改善传统控制系统。请给出神经网络模型参考自适应控制的基本框图,并论述参考模型和神经网络控制器的作用。(10 分)
展开答案与解析
基本框图可以表示为:
┌──────> 参考模型 M ──────> y_m ───┐
参考输入 r ──────┤ │
└─> 神经网络控制器 ─> 被控对象 ─> y ├─> e_c=y_m-y
↑ │ │
└── 输出反馈 ───┘ │
↑ │
└──── 学习算法更新权值 <──┘
参考模型规定系统希望达到的理想动态特性。它把参考输入 转换成期望输出 ,其中可以预先规定响应速度、超调量、阻尼和稳态误差。参考模型不是实际被控对象,而是实际系统应该模仿的“标准答案”。
神经网络控制器根据参考输入和系统反馈生成控制量。由于神经网络具有非线性逼近能力,它可以学习未知对象的逆动态或直接学习控制律。学习算法使用模型跟踪误差
调整网络权值,使实际输出 逐渐逼近参考模型输出 。实际设计还应对控制量限幅,并用稳定性分析或传统控制器兜底,防止在线学习阶段产生危险动作。
2. 迭代学习控制
请论述迭代学习控制的基本思想,并说明迭代学习控制适合应用于怎样的控制任务。(10 分)
展开答案与解析
迭代学习控制的核心是:系统重复执行同一有限时长任务,利用上一轮在每个时刻产生的跟踪误差,修正下一轮同一时刻的控制输入,使轨迹一轮比一轮接近期望轨迹。
设第 轮的控制输入和误差为 、,P 型学习律为:
更一般的 PID 型学习律为:
普通反馈控制沿时间轴用当前误差纠正后续动作,属于“做错后再改”;ILC 还增加了迭代轴,用上一轮同一时刻的误差提前修正下一轮动作,因而能把重复扰动学习成前馈补偿。
ILC 适合满足以下特征的任务:
- 相同或相近的任务可以反复执行;
- 每轮具有相同时间区间、目标轨迹和近似初始条件;
- 扰动和未建模动态具有较强重复性;
- 允许经过多轮逐步提高精度。
典型应用包括机械臂重复焊接、喷涂与装配,数控机床加工,固定路线巡检,高铁固定区段运行以及车辆重复赛道跟踪。它不适合每次目标、环境和初始状态都完全不同的一次性任务,也不擅长不可重复的随机扰动。
3. Pi0 与 Pi0.5
Pi0 是 2024 年提出的典型视觉—语言—动作基础模型(VLA),在智能驾驶等场景中具有重要应用价值。该模型采用混合专家架构,将视觉—语言模型主干(VLM)与动作专家模块结合,并通过流匹配技术生成平滑、连续的动作序列。
Pi0.5 在 Pi0 的基础上进一步面向开放世界泛化问题,引入知识隔离架构和分层推理机制,使模型能够先预测高层语义子任务,再生成具体低层动作。
请结合课程内容,论述 Pi0 与 Pi0.5 的主要区别。(10 分)
展开答案与解析
| 对比维度 | Pi0 | Pi0.5 |
|---|---|---|
| 主要目标 | 建立能控制多种机器人的通用 VLA 基础模型。 | 在 Pi0 基础上提高开放世界中的语义泛化和长程任务能力。 |
| 基本架构 | 混合专家架构,将 VLM 主干与动作专家结合。 | 保留视觉—语言与动作模块,并进一步引入知识隔离和分层推理。 |
| 动作生成 | 使用流匹配生成平滑、连续的低层动作序列。 | 先预测高层语义子任务,再以子任务为条件生成具体低层动作。 |
| 知识处理 | 端到端联合训练时,动作学习的梯度可能干扰 VLM 已有的语言和常识知识。 | 使用知识隔离或梯度隔离保护 VLM 预训练知识,减少知识干扰。 |
| 训练数据 | 主要联合机器人视觉、语言和动作数据训练通用控制能力。 | 进一步协同利用异构数据,让高层语义知识和低层动作数据各尽其用。 |
| 泛化能力 | 擅长生成连续动作,但复杂开放世界任务的语义规划能力有限。 | “先思考、再行动”,更适合新场景、新物体和多阶段长程任务。 |
两者的联系是 Pi0.5 并没有抛弃 Pi0 的 VLA 和流匹配动作生成路线,而是补上两个关键缺口:一是保护 VLM 已有知识,二是把高层任务推理与低层动作生成分层。因此,Pi0 更强调通用、连续的动作生成,Pi0.5 更强调开放世界泛化和多阶段任务执行。