【HCIA- AI(正课)】练习题和解析
判断题
- PyTorch、MindSpore等Al开发框架通常提供内置的数据处理功能用于数据采集、数据清洗、特征选择和归一化等操作。✅
LSTM是改进版RNN。序列很长的时候,RNN 记不住很早之前的信息。
LSTM 专门解决原生 RNN长序列训练时的梯度消失问题,擅长学习长距离的时序信息。
原文要点
PyTorch:torch.utils.data、torchvision.transforms 提供数据加载、清洗、归一化等预处理;
MindSpore:mindspore.dataset 数据集引擎,内置数据变换、归一化、数据增强流水线。
AI开发框架不只是搭建神经网络,自带一整套数据处理能力。
记忆方法
框架自带数据预处理工具箱,归一化、数据变换都是内置功能。
- LSTM的遗忘门决定了从细胞状态中丢弃哪些信息,丢弃弃的信息将其系数置为0,保留的信息系数置为1。❌
原文要点:
LSTM 遗忘门通过 Sigmoid 激活函数输出 0 到 1 之间的数值,是连续值,不是只有 0 和 1。数值大小代表保留信息的比例,不是单纯置 0 或置 1。
记忆方法
口诀:遗忘门是软开关,0 到 1 连续算,不是非 0 即 1 硬判断
区分:硬开关只有 0/1;LSTM 门控是 Sigmoid 输出,小数代表保留程度。
- 量化是一种模型压缩技术,可以减少模型存储占用和推理理延迟。✅
原文要点:
模型量化是典型模型压缩技术,降低参数精度,减小模型存储空间,加快推理速度,降低推理延迟,常用于端侧、昇腾硬件部署。
记忆方法
口诀:量化降精度,体积变小,推理变快
一句话记忆:量化 = 压缩模型,省空间、跑得快。
- RNN中不同时刻的权重参数是共享的。✅
RNN (循环神经网络)是专门处理序列数据的深度学习网络。序列数据就是有先后顺序的数据:句子文字、语音波形、股票时间序列。
普通神经网络每次输入独立,RNN 自带记忆(隐藏状态 hidden state):处理当前输入的时候,会带上前面时刻学到的信息。
原文要点:
RNN 在序列不同时间步之间共享权重参数。权重共享让 RNN 参数量不会随序列长度增加而变大,能够提取时序特征。
记忆方法
口诀:RNN 时间步,共用一套权重
联想:读一句话里每个字,用同一个神经网络去处理,不用单独给每个字单独造一个网络。
容易混淆:CNN 也有权重共享(卷积核滑动);RNN 是时序维度权重共享。
5.MindSpore中构建神经网络类,需要继承nn.Module。❌
原文要点:
MindSpore 中 Cell 是神经网络的基础单元,自定义网络类需要继承 nn.Cell;PyTorch 才使用 nn.Module 作为网络基类。
一句话区分:
PyTorch → 继承 nn.Module,前向写 forward()
MindSpore → 继承 nn.Cell,前向写construct()
- 使用MindSpore构建神经网络时,应继承Module类,并重写_init一方法与forward方法。❌
- K-折交叉验证中,k一般大干等干2.实际操作时一般从3开始取,只有在原始数据集合数据量小的时候才会尝试取2。❌

数据集很小的时候,不能用 k=2;小数据集反而应该取更大的 k,比如留一法 LOO(k 等于样本总数)
- L1正则化添加的成本与权重系数的平方成正比。❌


原文要点:
L1 正则化在损失函数中增加权重绝对值的惩罚项,可以产生稀疏权重,实现特征选择;
L2 正则增加权重平方的惩罚项,使权重趋向变小,不会产生稀疏权重。
记忆口诀:
L1 绝对值,L2 平方值;L1 能稀疏,L2 缩权重。
- 多层感知机具备非线性分类的能力,这种能力来自类似f(x)=ax这样的激活函数和多层网络结构。❌
(f(x)=ax) 是线性函数(一次函数)。
原文要点:
多层网络如果全部采用线性激活函数,则多层网络可以化简为单层线性变换,不具备非线性表达能力。
多层感知机的非线性拟合能力来源于非线性激活函数,而不是线性函数。
多层结构配合非线性激活,才能学习复杂非线性边界。
记忆口诀
线性激活叠多层,仍然只是线性模型;非线性激活加多层,才有非线性分类能力。
- MindSpore中的损失函数可以分为内置的损失函数和自定义损失函数数,其中自定义损失函数需要通过继承nn.Cell或者
nn.LossBase来实现。✅

原文要点:
MindSpore 提供多种内置损失函数,同时支持自定义损失函数。自定义损失函数,既可以继承基础网络基类nn.Cell,也可以继承损失专用基类nn.LossBase,并重写construct方法实现损失计算逻辑。
记忆口诀
损失两类:内置、自定义;自定义二选一:继承 Cell 或者 LossBase。
- K折交叉验证是指将训练集划分成K-1个子数据集。❌
原文要点:
K 折交叉验证将原始数据集划分为 K 个互不相交的子集。每次选取其中 1 个子集作为验证集,其余 K-1 个子集作为训练集;迭代
K 次,取平均评估结果。数据集总共划分成 K 份,不是 K-1 份。
记忆口诀
K 折,就是切成 K 块;每次留 1 块做验证,剩下 K-1 块训练。
- Dropout会在训练过程中,随机丢弃大部分神经元,此时丢弃部分对应的参数不会更新。✅

原文要点
Dropout 是深度学习中防止过拟合的正则化手段。仅在训练阶段生效,随机屏蔽部分神经元;本轮被屏蔽神经元不参与前向与反向计算,对应参数本轮不更新。测试阶段所有神经元全部激活
- 循环神经网络可以捕捉序列化数据中的动态信息,t-1时刻前的每一时刻信息对下一时刻信息同等重要。❌
RNN(循环神经网络)能够处理序列数据,把前面时刻的信息传递到后面。
但是前面所有时刻的信息并不是同等重要:
距离当前时刻越近的信息,影响通常更大;
久远的历史信息会随着时间步不断衰减(RNN 长期依赖问题,梯度消失)。
原文要点:
循环神经网络 RNN 适合处理序列数据,可以保存历史时序信息。但 RNN 存在梯度消失问题,较早时刻的信息会不断衰减,不同时刻的信息对下一时刻的贡献并不相同。
记忆口诀
RNN 记序列,远近不一样;近的影响大,远的会遗忘;信息不同权,不是同等强。
- John想要将TensorFlow框架训练的模型迁移到PyTorch中,他可以火将模型保存为ONNX格式。✅
ONNX(Open Neural Network Exchange,开放神经网络交换)是跨框架的模型中间格式。
原文要点:
ONNX 是一种通用模型文件格式,支持在不同深度学习框架之间转换模型。TensorFlow、PyTorch、PaddlePaddle 等主流框架都支持导出 / 导入 ONNX,用于模型跨框架迁移。
- MindlE是华为推出的一个部署框架,底层可以对接PyTorch和MindSpore。✅
MindIE(昇腾推理引擎),华为昇腾的高性能推理部署框架
原文要点:
MindIE 是华为昇腾推出的推理部署框架,提供多框架适配能力,可对接 MindSpore 和 PyTorch 模型,在昇腾硬件上实现统一高性能推理。
- 屏思MindSpore是一个全场景深度学习框架,提供了MindAKG用于算子优化,提升框架执行性能。✅
MindSpore(昇思)是华为推出的端边云全场景深度学习框架。
MindAKG(MindSpore AKG)是 MindSpore 配套的算子编译器,负责算子自动生成与优化,挖掘硬件算力,提升框架执行性能。
- 深度学习中前向传播和反向传播,都依赖于矩阵运算,所以在AI开发框架中矩阵为基础数据结构。✅

- 损失函数与激活函数是一类函数。❌
原文要点:
激活函数用于给网络引入非线性;
损失函数用于评估预测值与真实标签的误差,二者功能不同,不是同一类函数。
- John在实现图像分割模型时,为了增加开发效率使用了动态图的形式开发。在部署时为了提升执行效率,应该使用静态图模式进行部署。✅
原文要点:
动态图便于调试开发;
静态图预先完成计算图编译优化,执行效率更高,适合模型部署场景。
记忆口诀
动态图,好调试,开发写代码;
静态图,先编译,部署速度佳。
- 当问题的解决方案很复杂,或者问题可能涉及到大量的数据却没有明确的数据分布函数时,比较适合使用机器学习方法。✅
原文要点:
传统程序依赖人工定义规则与数据分布;机器学习适合规则复杂、数据量大、难以得到明确数据分布函数的场景,从数据中自动学习规律。
-
数据样本不平衡问题是指数据集中存在矛盾的、有差异的记录是。❌

-
在Self-Attention计算过程中,Query、Key和Value都是由输入序存列通过不同的线性变换得到的。✅


-
CPU不适合做Al计算的原因是因为单个算术逻辑单元的算力较弱,而NPU和GPU的较强。❌
不是 CPU 单个计算单元弱,而是CPU 计算单元数量太少,并行能力差。
- 卷积神经网络中的卷积层可以实现参数共享,减少网络参数。参数共享是指在同一层中使用的全部卷积核参数一致,不同层使用的卷积核参数是不同的。❌

- 卷积神经网络中,卷积核的大小通常为奇数。✅

- Seq2Seq 模型常用于机器翻译、文本摘要等序列生成任务。✅

- ReLU激活函数在x>0时导数为1,可缓解梯度消失问题。✅

- 随机森林是一种集成学习算法,通过多个决策树的投票得到最终结果。✅

- DeepSeek-R1 是特定领域(大语言模型)的 AI,仅能完成语言相关任务,属于弱人工智能(专注单一任务);强 / 通用 / 超人人工智能目前尚未实现。❌
“仅能完成语言相关任务” 这句话不对。
-
Atlas系列产品覆盖训练、推理场景,服务器、边缘计算、加速模块等产品形态。✅
-
关于机器学习算法的理性认识,其本质就是得到一个输出,使得输出与真实结果尽可能的接近。✅

-
使用mindspore.nn.Conv2d (1,3,5, has_bias=False, weight_init=‘normal’)接口,可以创建输入通道数为1、输出的通道数为5、卷积核大小为3*3、使用normal算子初始化参数的卷积层。错

-
单层感知机无法解决 XOR 问题,成为了阻碍深度学习发展的一个重要原因。✅
XOR(异或)是一个二输入逻辑运算:两个输入不一样 → 输出 1;两个输入一样 → 输出 0
- AIGC 会对殡葬业增加连接设计。❌

- 对于 AI 业务应用来说,训练环节不会对模型进行压缩,而推理部署环节则需要。❌
原文:模型压缩分为训练阶段压缩与训练后(推理部署前)压缩。训练阶段可采用量化感知训练、训练剪枝、知识蒸馏等方式完成模型轻量化;推理部署阶段也可以做训练后量化、剪枝。因此模型压缩并非只存在推理部署环节。
- RNN 跟前馈神经网络最大的区别在于每次都会将前一时刻的计算结果,带到下一时刻的隐藏层中,一起训练。
前馈神经网络FNN(多层感知机MLP、卷积神经网络CNN)
- 信息单向流动:输入层 → 隐藏层 → 输出层。
- 信号只向前传,不会回头、不会把上一轮结果存下来传给下一组输入,没有循环回路。无记忆
RNN 循环网络:有记忆,把前一时刻隐藏状态传给下一时刻
- Softmax 回归是逻辑回归的一般化,只适用于二分类的问题。❌
原文:Softmax 回归是逻辑回归的一般化推广。逻辑回归解决二分类问题;Softmax 回归适用于多分类任务,可以输出各个类别的概率分布。
都属于分类算法,用于算出样本属于各个类别的概率。
-
特征选择过滤法的局限性:过滤方法倾向于选择冗余的变量,因为它们没有考虑特征之间的关系。✅


-
昇腾 AI 处理器中 AI Core 控制单元包含标量指令处理队列和向量指令处理队列。✅
-
tanh 激活函数输出关于 0 点对称,相比于 Sigmoid 函数可以加快模型的收敛。✅

-
张量无法进行加减乘等算术运算。❌

-
为防止过拟合,在训练过程中,可以插入验证集数据的测试。当发现验证集数据的 Loss 上升时,提前停止训练。✅

-
Self-Attention 和 RNN 功能类似,可以处理时序相关问题,同时它们计算时的并行度相对都不高。❌

-
CANN 中提供了 DVPP 和 AIPP,前者使用昇腾 AI 处理器中的 DVPP 模块对图像进行处理,后者使用 AICore 对图像进行处理。✅

-
朴素贝叶斯算法假设样本特征之间相互独立,且对于样本缺失值较为敏感。❌
朴素贝叶斯是概率分类算法
- 机器学习是深度学习的一部分,人工智能也是深度学习的一部分。❌


- Sigmoid、tanh 和 Softsign 这些激活函数在网络层数加深时,都不能避免梯度消失的问题。✅

- 数据降维的目的是减少数据量,增加模型的准确度。❌

- SVM、k-NN 和 k-means 都属于非参数模型。❌
原文:
参数模型拥有固定数量的模型参数;非参数模型参数数量会随训练样本数量变化。k-NN、核 SVM属于非参数模型;k-means、线性回归属于参数模型。

- 昇腾 AI 处理器只提供了 DDR 接口,可以外接 DDR4 内存。❌
这句话错误,关键点在 “只提供 DDR 接口”。
-
AscendCL 可以基于第三方框架开发推理类应用,但是需要通过 ATC 工具先对模型进行转换。✅

-
AI 芯片会针对矩阵运算做加速设计。✅
-
当前 AI 开发框架动态计算图和静态计算图语法兼容,可以直接进行相互转换。❌

-
前馈神经网络接收前一层的输出,并输出给下一层。采用一种单向多层结构,每一层包含若干个神经元,同一层的神经元之间没有互相连接,层间信息的传送只沿一个方向进行。✅
-
异常数据在模型训练过程中不需要删除,大量的异常数据可以提升升模型的泛化能力。❌

-
John 在使用 PyTorch 框架实现 AI 模型训练时,他应该先通过 set_context 设置模型训练相关参数,如设备 ID、计算图模式等。❌

-
理论上,训练时的精度会随着模型复杂度的上升和训练时间的增加不断减小。❌

-
与 FPGA 相比,相同工艺下,基于 ASIC 的 AI 芯片功耗更大,因此不适合用于手机等终端设备上。❌

-
CPU 可以通过提高频率的方式提升 AI 计算性能。✅
CPU 主频代表单位时间能执行指令的次数。提高 CPU 频率,单位时间内可以完成更多运算,因此 AI 计算性能会得到提升。
-
AI 开发框架的功能是对开发者提供网络模型接口,模型训练过程中的前向传播和反向传播需要开发者自己完成。❌

-
MoE 是一种混合专家模型,这种方案可以有效增强模型的容量和能力,同时在推理时能够动态决定哪些专家模型工作。✅

-
Self-Attention 机制无法捕捉到序列的位置信息,因此在 Transformer 模型中需要添加位置编码。✅

-
在随机森林中,基学习器所使用的特征衡量指标需要是基尼系数。❌
原文:随机森林基学习器为决策树,分类时可选用基尼系数或者信息熵,回归使用方差,并非必须使用基尼系数。
- DeepSeek V3 是一个基于 GPT 结构的多模态模型,较 V2 版本相比,其训练成本和推理速度都有很大的提升。❌


多选题
单选题
更多推荐








所有评论(0)