HCIP-AI 备考Solution Architect V1.0
00

使用说明与学习路径

本材料由 HCIP-AI Solution Architect V1.0 三套模拟题(共 180 道)逆向拆解而成。三套题的全部考点已归并为 9 个知识模块,另附 5 个速查附录。所有考点均可在三套题中找到对应题目,附录D 提供了「题号 → 模块」的完整索引。

考试形式

项目说明
总分 / 及格1000 分 / 600 分(正确率约需 60%)
时长 / 题量90 分钟 / 60 题(平均 90 秒一题)
单选题15 题 × 17 分 = 255 分
多选题17 题 × 17 分 = 289 分(多选、少选、错选均不得分)
判断题24 题 × 16 分 = 384 分
填空题4 题 × 18 分 = 72 分

建议学习路径(约 12–16 小时)

阶段内容时长目标
第 1 遍:通读模块一 → 模块九,按顺序读完,不背4–5 h建立知识地图,知道每个名词属于哪一层
第 2 遍:精读重点回读模块三、四、五、八(分值最集中)3–4 h掌握所有对比表格,能默写差异点
第 3 遍:速记只看附录A(易错点)+ 附录B(缩写)+ 附录C(填空词库)2 h锁定送分题
第 4 阶段:实战闭卷做第 1 套 → 对照模块查漏 → 做第 2 套 → 第 3 套3–4 h每套限时 90 分钟,模拟真实节奏
第 5 阶段:回炉错题回到对应模块重读,重做三套1–2 h目标正确率 ≥ 85%

三套题的风格差异(做题前先知道)

  • 第 1 套:最偏算法与训练底层。Transformer/Diffusion 细节、ZeRO-R、剪枝算法名称、IB 网络、DX511 交换机型号,是三套中最难的一套。
  • 第 2 套:最偏方案架构与流程。AI 发展阶段、训练四阶段、MCP、存储能力、RAG 评估,题干长、场景化,属于「架构师视角」。
  • 第 3 套:最偏华为产品与工程落地。DeepSeek-V3、昇腾组件、OceanStor、鸿蒙智行、昇腾智城、MindIE,产品名与参数密集。
M018 节

模块一 AI 与大模型总体认知

本模块对应 3 套题中约 14 道题,多为送分题,但「分层」「发展阶段」两个知识点极易混淆。

1.1 AI 发展的四个阶段

阶段核心特征关键词
基于规则的自动化阶段人工编写 if-then 规则,无学习能力,泛化差专家系统、规则引擎
感知和理解阶段能从复杂数据中提取结构化语义信息,但严重依赖大量标注数据深度学习、监督学习、CV/NLP 专用模型
认知与生成阶段(大模型阶段)自监督预训练,涌现能力,少样本/零样本泛化Transformer、LLM、涌现
具身智能阶段智能体具备物理载体,与真实环境交互闭环机器人、感知-决策-执行
通用人工智能(AGI)阶段跨领域自主学习与推理,达到或超越人类水平AGI、自主目标

1.2 大模型的定义与分层(盘古 L0/L1/L2 体系)

大模型 = 具有大规模参数量与复杂计算结构的机器学习模型。注意:大模型 ≠ 大语言模型,它还包括 CV 大模型、多模态大模型、科学计算大模型(如气象、分子)。

层级别称定位示例
L0 基础模型通用大模型 / Foundation Model海量通用语料预训练,具备通用能力,不针对具体行业盘古 NLP 大模型、GPT、LLaMA
L1 行业模型行业大模型在 L0 基础上用行业语料做增量预训练,理解行业术语与知识盘古政务大模型、盘古金融大模型、盘古矿山大模型
L2 场景模型场景化模型 / 应用在 L1 基础上针对具体业务场景微调,直接可用智慧办公助手、公文写作助手、坐席助手

1.3 大模型的能力与局限

大模型相比传统模型的改进(以聊天机器人为例)

  • 更自然流畅的交互体验(从模板回复 → 自由生成)
  • 更丰富的表达和生成能力
  • 更长的上下文处理能力 —— 注意是「更长」,选项写「更短」即为错误项
  • 更好的多模态交互能力

大模型的固有局限(多选高频)

局限表现缓解手段
幻觉(Hallucination)「一本正经地胡说八道」,生成看似合理但事实错误的内容RAG、知识库挂载、事实校验
知识时效性训练成本高、周期长,时效性数据难以进入训练集,无法回答最新问题RAG + 联网检索
数据安全与隐私上传数据到公有云大模型存在泄露风险私有化部署、端云协同、本地知识库
领域专业性不足通用语料缺少行业术语与内部知识增量预训练、SFT、RAG
推理成本与时延参数量大导致显存与算力开销高量化、剪枝、蒸馏、KV Cache

1.4 大模型的典型应用场景

考点是「范围要选全」——大模型不仅用于文本任务,跨模态与科学领域同样适用。

领域典型应用
通用 NLP情感分析、机器翻译、文本摘要、文本分类、问答
医疗健康病例分析、基因序列解读、医学影像辅助诊断、辅助问诊
金融风险控制、智能投顾、欺诈检测、智能客服、研报生成
教育交互式教学、个性化学习内容生成、作业批改、答疑
政务公文撰写、摘要生成、文档问答、政策解读
科学计算盘古气象大模型(端到端全球 10 天预测,效率较传统数值模式提升约 1000 倍)、药物分子设计
交通 / 汽车自由流收费、收费稽核、视频云联网、车路协同、智能驾驶
软件工程代码生成、代码补全、缺陷定位、单元测试生成

1.5 AI 软件的演进模式

模式含义人与 AI 的关系
Embedding 模式(嵌入)AI 作为一个功能点嵌入既有软件流程,人主导全流程人做主体,AI 打辅助
Copilot 模式(副驾驶)AI 全流程伴随,实时给建议,人确认后执行人机协同,人做决策
Agent 模式(智能体)人给目标,AI 自主规划、调用工具、执行并反馈AI 做主体,人定目标与验收

1.6 AI 编程助手的能力边界

当前 AI 编程助手能做:自然语言生成函数或代码片段;IDE 内实时补全与语法建议;分析错误信息与上下文,辅助定位常见问题并给修复思路。

当前 AI 编程助手尚不能可靠做到:系统性地识别大规模代码库中深层次的逻辑漏洞与架构级安全隐患(受限于上下文窗口与全局依赖分析能力)。

1.7 智能驾驶的现状定位

目前市面在售的所有搭载「AI 智能驾驶」功能的车辆,其系统仍属于辅助驾驶范畴,驾驶人必须全程保持注意力并对行车安全负责,技术尚未达到全场景自动驾驶——该判断题为正确

鸿蒙智行智能驾驶的核心技术:多模态传感器融合(摄像头 + 激光雷达)、基于强化学习的行为预测模型、动态路径规划算法。注意「端到端语音识别系统」属于座舱交互能力,不属于智能驾驶核心技术。

1.8 深度学习 vs 传统机器学习

维度传统机器学习 / 统计方法深度学习
特征工程需人工设计特征可自动提取特征(文本分类考点)
数据量需求小样本下表现稳定依赖大量数据,小样本场景反而可能不如传统方法
可解释性较强(决策树、逻辑回归)较弱(黑箱)
算力需求
M0212 节

模块二 NLP 基础与大模型核心算法

本模块对应约 30 道题,是三套题中知识点最密集的部分,且是第 1 套的主战场。

2.1 自然语言处理的四大难点(歧义层次)

层次含义典型例子
词法歧义分词、词性标注层面的切分歧义「杭州王子文老师」→ 切成「杭州王子 / 文老师」还是「杭州 / 王子文老师」
句法歧义句子结构(成分依存关系)有多种解析树「咬死了猎人的狗」
语义歧义词义或句义有多重理解(一词多义)「苹果」指水果还是公司
语用歧义脱离语境无法确定说话人真实意图「你能把窗户关上吗」是疑问还是请求

补充:语用分析是分析语言所处的外界环境对语言使用者产生的影响——该判断题为正确

2.2 词向量:基于计数 vs 基于推理

路线原理代表方法
基于计数(Count-based)统计词在文档/上下文中出现的次数,构造共现或权重矩阵TF-IDF、One-Hot、共现矩阵、LSA
基于推理(Inference-based)通过神经网络训练/推理学习得到稠密向量表示Word2Vec、FastText、GloVe(混合)、Transformer-based(BERT/GPT 等)

2.3 语言模型发展历程

阶段代表机制要点
统计语言模型N-Gram滑动固定窗口,统计词组频率来估计词序列概率;受限于稀疏性与窗口长度
神经网络语言模型NNLM、Word2Vec、RNN/LSTM通过神经网络学习稠密嵌入(不是靠词频统计构建嵌入矩阵);RNN 串行、易遗忘长距信息
预训练语言模型Transformer、BERT、GPT摆脱序列计算限制,可并行计算词与词之间的全局关系
提示词学习范式GPT-3 及以后、In-Context Learning用户通常无需训练模型本身,通过构造输入提示引导模型完成任务

2.4 Seq2Seq 模型

  • 由 Encoder(编码器)和 Decoder(解码器)两部分组成。
  • Encoder 将可变长度的输入序列压缩为固定长度的向量表达,本质上是特征压缩
  • Encoder 与 Decoder 可以是 CNN、RNN、Transformer 等多种结构。
  • Encoder 与 Decoder 不要求是相同结构——出现「只能是相同的结构」即为错误项。

2.5 Attention 机制的计算三步

步骤操作输出
① 打分Query 与 Key 做相似度计算(点积 / 加性 / 缩放点积)原始权值 score
② 归一化对 score 做 Softmax 归一化(通常先除以 √d_k)可直接使用的权重 α
③ 加权求和将权重与 Value 加权求和Attention 输出

自注意力(Self-Attention)建模长距离依赖的优势

核心解释:能直接建立序列中任意两个位置之间的依赖关系,无需按顺序遍历整个序列(路径长度 O(1),而 RNN 为 O(n))。「支持并行计算,提高训练速度」是正确的优点,但它解释的是「效率」而非「长距离依赖」——单选题问「最合理地解释建模长距离依赖」时应选前者。

2.6 Transformer 架构

整体结构

  • 由 Encoder 与 Decoder 两部分组成,各自堆叠 N 层(原论文 N=6)。
  • Encoder 中各 layer 的结构相同,但参数不共享(每层有各自独立的权重)。
  • 编码器输入的句子首先经过自注意力层,再经前馈网络。
  • Decoder 比 Encoder 多一个「Encoder-Decoder Attention(交叉注意力)」子层,且自注意力带因果掩码。

Transformer 采用的关键技术(多选必考)

  • Self-Attention / Multi-Head Attention(自注意力与多头注意力)
  • 前馈神经网络 FFN(Feed-Forward Network,即全连接层)
  • 残差连接(Residual / 残差块)
  • 层归一化(Layer Normalization,归一化)
  • 位置编码(Positional Encoding)

输入处理流程

词嵌入(Word Embedding) → 位置编码(Positional Encoding) → 两者相加生成最终输入向量 →(Decoder 端另有掩码 Masking 操作)。

Transformer 相比 RNN/CNN 的优势(多选)

  • 支持并行计算,训练速度更快、效率更高 ✔
  • 可直接建模任意位置间的依赖,更适合长文本 ✔
  • 完全依赖 Attention 机制,能有效捕捉复杂语义依赖 ✔
  • 「利用循环结构避免前序信息遗忘」✘ —— Transformer 恰恰取消了循环结构,这是典型反向干扰项。

2.7 BERT 与 GPT

维度BERTGPT
预训练目标MLM(掩码语言建模)+ NSP(下一句预测)CLM(因果语言建模),自回归预测下一个 token
注意力方向双向(Bidirectional)单向(从左到右)
结构来源Transformer EncoderTransformer Decoder
擅长任务理解类:阅读理解(SQuAD)、分类、NER生成类:续写、对话、翻译

BERT 最后一层输出向量的性质:它是经过全部层聚合后的表示,捕捉了整个文本片段的上下文含义,对相似度得分影响较大

2.8 扩散模型(Diffusion)与文生图

要点内容
两个过程前向扩散:向清晰图像逐步加噪,从有序走向混乱;反向去噪:从纯噪声出发逐步去噪,重建图像
Denoise 模块本质预测噪声,而不是直接预测图像(考点:判断题为「正确」)
生成方式逐步迭代的扩散过程生成图像,而不是自回归逐词生成
文本条件接受文本描述作为条件输入,Stable Diffusion 使用 CLIP 作为文本编码器将文本转为嵌入向量
效果生成图像质量高、细节清晰、外观逼真;可支持文本到图像等多模态生成
Prompt 的作用不同 prompt 对生成质量影响显著(判断题「没有影响」为错误)

2.9 多模态

  • 多模态 AI 可处理文本、图像、音频、视频等多种数据类型,不局限于文本与图像两种
  • 「图文联合编码」指在统一表示空间中联合建模图像与文本,能够直接捕捉跨模态依赖关系(题中「分别编码后再融合、无法捕捉跨模态依赖」的表述为错误)。
  • 当前大模型已在向「any-to-any」多模态理解与生成演进(语音、视频、图片、文本互转),主流观点认为该能力已在实现中——第 1 套将「还不能实现」表述为判断题,按华为课程口径应判为错误

2.10 MoE(混合专家)与 DeepSeek-V3

MoE 结构

把模型中的前馈全连接层(FFN)替换为由多个「专家(Expert)」组成的层,并通过门控网络(Gating / Router)为每个 token 动态选择少数专家激活。特点是总参数量大、单次推理激活参数少,从而在可控算力下扩展模型容量。

DeepSeek-V3 的四项结构创新(第 3 套重点)

技术全称/含义作用
MLAMulti-head Latent Attention(题中写作 Memory Layer Attention)通过低秩压缩 KV,大幅降低 KV Cache 显存占用——「优化显存占用的核心技术」选它
DeepSeekMoE细粒度专家 + 共享专家的 MoE 架构智能路由到专家,提升参数效率
Top-Kr 策略受限的 Top-K 路由限制每个 token 可选择的专家数量与节点范围,降低通信开销
MTPMulti-Token Prediction一次预测多个 Token,提升训练信号密度与推理速度

2.11 GPT-o3 类推理模型的改进方向

  • 引入更高效的推理路径(推理时计算 / 思维链内化),使中等规模下性能超越前代大模型 ✔
  • 支持更长的上下文窗口,显著提升复杂任务处理能力 ✔
  • 「采用与 GPT-4 完全相同的多模态融合结构」「在编码器-解码器结构基础上调整」类表述属于干扰项——GPT 系列是 Decoder-only 架构。

2.12 文本分类方法

基于传统统计的方法需要人工构造特征(词袋、TF-IDF + SVM/朴素贝叶斯);基于深度学习的方法可以自动提取特征(该判断题为正确)。

M0310 节

模块三 大模型训练与分布式并行

本模块对应约 28 道题,是「解决方案架构师」认证的核心分值区,务必吃透并行策略与 ZeRO。

3.1 大语言模型训练的四个阶段

阶段英文数据类型目标
① 预训练Pre-training海量无标注通用语料学习通用语言规律与世界知识。不针对某项特定任务
② 有监督微调SFT(Supervised Fine-Tuning)人工标注的 Prompt-Response 对让模型在特定任务(问答、摘要、翻译)上贴近人类表达,提升准确性与可控性
③ 奖励模型训练RM(Reward Modeling)人类反馈数据(对多个回答的偏好排序)训练一个能给回答打分的奖励模型
④ 强化学习对齐RLHF(PPO/DPO 等)RM 打分 + 策略采样让模型输出对齐人类偏好(有用、诚实、无害)

3.2 增量预训练(Continue Pre-training)

  • 目的:让通用大模型理解领域内的各种问题并具备回答能力,注入领域知识。
  • 常见策略:冻结大部分参数、只训练少部分参数。尤其在增量数据量不大时,可减少训练时间与资源消耗,同时避免过拟合。
  • 选哪些层微调:模型最后几层更接近特定任务的表征,对最后几个 Block 微调能更好适应特定领域数据。
  • Embedding 层会直接影响模型对输入数据的理解,当领域数据术语较多时,也是常见的微调选择。

3.3 大模型数据集与传统模型数据集的区别

维度大模型传统模型
阶段划分需分预训练、SFT、RM/RLHF 等多阶段数据通常只有单一训练集
数据规模数据量更大,存储需求更高(TB~PB 级)GB 级为主
数据种类更广泛,支持多模态(文本/图像/音频/代码)多为单模态
领域特性以通用大规模语料为主针对专业场景使用专业数据集

3.4 分布式并行策略(核心中的核心)

策略切什么适用场景通信特征
数据并行 DP切数据。每卡保存完整模型副本,各自处理不同数据子集模型能装进单卡,想加速训练反向后 AllReduce 同步梯度
张量并行 TP(模型并行的一种)切单层内的权重矩阵(层内并行)单卡装不下模型降低首 token 时延每层前后都需 AllReduce,通信量大,一般限在单机内
流水线并行 PP(模型并行的一种)按层切分,不同设备负责不同层超大模型跨节点扩展;提升吞吐点对点传递激活值,存在气泡(bubble)
专家并行 EP把 MoE 的不同专家放到不同设备MoE 类模型All-to-All 通信
序列并行 SP按序列长度维度切分超长上下文训练配合 TP 使用

3.5 ZeRO(Zero Redundancy Optimizer)

ZeRO-DP:三个阶段

阶段分片对象显存节省(相对基线)
ZeRO-1优化器状态(Optimizer States)分片约 4 倍
ZeRO-2优化器状态 + 梯度分片约 8 倍
ZeRO-3优化器状态 + 梯度 + 模型参数分片与卡数线性相关

ZeRO-3 把模型参数切分到不同计算卡上,因此兼具模型并行的特征——第 1 套「ZeRO-3 属于模型并行的方法」这一判断,按华为课程口径应判为正确(ZeRO-DP 属数据并行框架,但 Stage-3 的参数切分等价于模型并行的显存效果)。

ZeRO-R:残余状态(Residual States)优化

  • 分区激活值检查点(Partitioned Activation Checkpointing)——优化激活值内存
  • 恒定大小的临时缓冲区(Constant Size Buffers)——在内存与计算效率之间取得平衡
  • 内存碎片整理(Memory Defragmentation)——根据张量不同生命周期管理内存,防止内存碎片化

3.6 显存构成(训练 vs 推理)

显存组成训练时推理时
模型参数
梯度(Gradients)✔ 仅在反向传播阶段存在,参数更新后可释放
优化器状态(Optimizer States)✔ 持续占用直至训练结束
激活值 / 中间结果✔(可用重计算换显存)
KV Cache✔(随序列长度近似线性增长)

3.7 训练与开发套件对比(极高频)

工具归属主要功能
DeepSpeed微软(PyTorch 生态)分布式训练加速库,核心是提高大规模训练的效率与拓展性(ZeRO、混合精度、Offload)
Megatron-LMNVIDIA大模型并行训练框架:张量并行、流水线并行、序列并行、BF16 优化器、分布式优化器
HuggingFace PEFTHuggingFace参数高效微调库(LoRA、Prefix、Prompt、P-Tuning、IA3)
HuggingFace TransformersHuggingFace大模型加载、训练、推理的通用套件
MindSpore华为AI 计算框架(对标 PyTorch/TensorFlow)
MindFormers华为昇腾大模型开发套件,支持 NLP、CV、多模态等任务的一站式开发
MindPet华为昇腾参数高效微调(PET)工具包
MindSpeed华为昇腾面向昇腾硬件优化的分布式加速库,兼容 Megatron-LM 生态
ModelSlim华为昇腾模型压缩工具:量化、剪枝、蒸馏,服务推理加速
MindIE华为昇腾推理引擎与服务化框架
MindStudio华为昇腾全流程开发工具链(算子开发、调试、调优、精度比对)

DeepSpeed 的软件架构三层

DeepSpeed APIsDeepSpeed RunTimeDeepSpeed Ops。选项中的「DeepSpeed Adapter」是杜撰的干扰项。

3.8 集合通信(Collective Communication)

操作语义记忆口诀
Broadcast一台主机把同一份数据发给所有主机一对多,广播
Scatter一台主机把数据切块分发给各主机一对多,分发不同块
Reduce多台主机把数据发给同一台主机,由目的主机做规约操作(求和/求最大等)多对一 + 运算
Gather多台主机把数据发给同一台主机,仅拼接不运算多对一,只收集
AllReduceReduce + Broadcast:所有主机都得到规约后的相同结果梯度同步/结果合并的标准操作
AllGather所有主机都得到拼接后的完整数据常用于 ZeRO 参数聚合
All-to-All每台主机向每台主机发送不同数据块MoE 专家并行常用

冲突流(Conflict Flow)

多条数据流在同一条链路上竞争带宽时产生冲突流,后果包括:单条链路的有效带宽下降总传输时间翻倍(两流平分带宽时)、最慢节点成为整体通信的瓶颈(木桶效应)。注意:冲突流是网络层现象,不会导致 GPU 计算精度下降

3.9 大模型训练的难点与影响因素

  • 数据量不足或数据质量低 → 泛化能力下降。数据清洗与预处理必须前置,「先训练后优化数据」是错误做法。
  • 节点间的同步与通信延迟 → 影响训练速度与稳定性。
  • 算力堆叠并非线性收益——「GPU 或分布式算力配置越多,训练效率必然越高」是错误项(受通信开销、并行效率、Amdahl 定律限制)。
  • 训练稳定性:loss 尖峰、梯度爆炸/消失,需要断点续训能力。

3.10 关键超参数与 CKPT

超参数说明陷阱
学习率 Learning Rate控制参数更新步长,通常配合 warmup + 余弦衰减「学习率越高越好」是错误的——过高会震荡不收敛甚至发散
批量大小 Batch Size影响梯度估计稳定性与显存占用过大可能损害泛化
训练轮次 Epochs数据集完整遍历次数过多导致过拟合
模型参数量 Parameters属于模型结构定义,不是训练超参数多选题里是干扰项

CKPT(Checkpoint):AI 训练中用于保存模型状态的文件,主要作用是断点续训(故障恢复),其次可用于阶段性评估与模型发布。填空题答「Checkpoint」。

训练调优的核心目标:提升模型在特定任务上的性能(不是减少参数量、不是适应所有场景、不是优化硬件利用率)。

奖励建模所需数据类型人类反馈数据(人工对模型多个回答的偏好排序)。

M048 节

模块四 微调与高效微调(PEFT)技术

本模块对应约 22 道题。软提示四兄弟的差异是最容易失分的地方,必须精确记忆。

4.1 微调技术全景分类

大类思路代表技术
全参数微调更新模型全部参数Full Fine-tuning、增量预训练(全量)
添加额外参数冻结原模型,新增可训练模块Adapter Tuning、Prefix Tuning、Prompt Tuning、P-Tuning、P-Tuning v2
选取部分参数更新只训练模型中一小部分已有参数BitFit(只训偏置项)、只训最后几层、只训 Embedding
引入重参数化用低秩矩阵等价表示权重更新,推理时可合并LoRA、AdaLoRA、QLoRA

4.2 软提示(Soft Prompts)四兄弟——精确对比

技术加在哪里加什么特点
Prompt Tuning仅输入层(Embedding 层)在输入序列 X 前拼接一段可学习的虚拟 Token最简单,参数最少;小模型上效果弱
P-Tuning仅输入层可学习的连续 prompt,位置更灵活(可插在中间),用 LSTM/MLP 编码器解决 prompt 向量收敛问题解决离散提示不稳定问题
Prefix Tuning模型每一层(在每层 Attention 的 K、V 前加前缀)各层的前缀向量,通常配 MLP 重参数化效果优于纯输入层方案
P-Tuning v2模型每一层(深层向量注入)各层的连续 prompt显著提升复杂推理与序列标注任务性能,可媲美全参微调

4.3 Adapter Tuning 与推理延迟

Adapter Tuning 在 Transformer 每层中串行插入小型瓶颈网络(down-project → 非线性 → up-project)。由于这些模块无法在推理时与原权重合并,必须逐层额外前向计算,因此在各类高效微调技术中引入的推理延迟最大

对比:LoRA / AdaLoRA 的低秩矩阵可在推理前合并进原权重(W + BA),推理零额外延迟BitFit 只改偏置项,同样无额外结构。

4.4 LoRA 系列

技术核心思想优势
LoRA冻结原权重 W,用低秩分解 ΔW = B·A(r ≪ d)表示更新参数量降至千分之一级;推理可合并,无额外延迟
AdaLoRA根据各权重矩阵重要性自适应分配秩预算同等参数量下效果更优
QLoRA基模型以 INT4/NF4 量化存储 + LoRA 适配器以高精度训练大幅降低显存占用;支持在有限显卡上微调更大模型;同时保持微调精度

4.5 指令微调、上下文学习与思维链

概念定义关键判别
指令微调 Instruction Tuning通过构建「指令格式」的实例,以有监督的方式对 LLM 进行微调必须是「有监督」——写成「无监督」即错
上下文学习 In-Context Learning在提示中给出若干示例,模型无需更新参数即可完成任务不涉及中间推理步骤
思维链 Chain-of-Thought要求模型在输出最终答案前,显式输出中间逐步推理步骤用于复杂推理任务
Zero-Shot CoT不给示例,仅在指令中加一句「Let's think step by step」注意是 Zero-Shot,不是 Few-Shot
Few-Shot CoT给出若干带推理过程的示例示例中包含推理链
零样本提示 Zero-Shot Prompting提示词中不提供任何任务相关示例,直接让模型执行任务判断题为正确

4.6 微调数据的作用

在微调过程中,增加与任务高度相关的数据样本,即便总量不大,也能显著提升模型在特定场景下的表现和泛化能力——该判断为正确。这也是「数据质量 > 数据数量」在微调阶段的体现。

4.7 微调 vs RAG:何时用哪个

需求首选方案理由
注入最新/动态知识RAG知识库可随时更新,无需重训
减少幻觉、答案可溯源RAG生成基于检索到的真实文档
定制模型的行为与写作风格微调(SFT)RAG 无法改变模型的语气与输出范式
注入大量领域术语与知识体系增量预训练 + SFT需要改变模型内部表征
预算有限 + 需按企业数据定制风格开源模型 + 自有数据微调闭源 API 无法深度定制

4.8 微调场景下需要/不需要考虑的问题

某工程师通过微调大模型构建业务问答机器人,需要考虑:模型幻觉问题、并行训练策略选择、推理时延过高。不需要考虑的是「预训练数据集编码问题」——预训练由基座模型提供方完成,微调者不接触预训练数据集。

M057 节

模块五 模型压缩、量化与推理加速

本模块对应约 30 道题,与模块三并列为最高分值区,第 3 套尤其密集。

5.1 模型压缩四大技术

技术原理关键考点
量化 Quantization把高精度数值表示(FP32)转为低精度(FP16/INT8/INT4)减小体积、加速推理、降低功耗
剪枝 Pruning移除冗余的权重或结构单元分结构化与非结构化两类
知识蒸馏 KD让小模型(Student)学习大模型(Teacher)的输出分布,实现轻量化不是参数裁剪,这是最大陷阱
低秩分解将大权重矩阵分解为多个小矩阵乘积与 LoRA 同源思想
稀疏训练训练中引入稀疏约束,得到稀疏权重常与剪枝配合

剪枝的分类(第 1 套考算法名)

类别含义代表算法
非结构化剪枝剪掉单个权重,产生不规则稀疏矩阵;压缩率高但需专用硬件/库才能加速SparseGPT、Wanda、Magnitude Pruning
结构化剪枝按通道、注意力头、层等整块剪除,得到规则的小模型,通用硬件即可加速LLM-Pruner、LoRAPrune、Sheared-LLaMA

5.2 量化:数值精度与换算(送分题,必须记牢)

数据类型位宽 / 字节值域相对 FP32 的模型尺寸
FP3232 bit / 4 Byte约 ±3.4×10³⁸1(基准)
FP1616 bit / 2 Byte约 ±65504,动态范围窄1/2
BF1616 bit / 2 Byte指数位同 FP32,动态范围宽、精度低1/2
INT88 bit / 1 Byte[−128, 127](有符号);UINT8 为 [0, 255]1/4,即减少 0.75(75%)
INT44 bit / 0.5 Byte[−8, 7]1/8

量化的收益与代价

  • 收益:减小模型尺寸加快推理速度减少设备功耗、降低带宽与显存压力。
  • 代价:可能带来精度损失,需要校准或量化感知训练来补偿。
  • 「量化可以提升模型泛化能力」→ 错误项。量化只压缩表示,不提升泛化。

速度提升的物理原因:访问一次 FP32 浮点的时间可以访问四次 INT8 整型(带宽 4 倍),加上整型运算单元吞吐更高——该判断题为正确

PTQ vs QAT

方法全称特点
PTQ 训练后量化Post-Training Quantization训练完成后再进行量化处理,用少量校准数据,成本低,精度损失稍大
QAT 量化感知训练Quantization-Aware Training在训练过程中模拟量化环境(插入伪量化节点),让模型提前适应低精度,精度更高、成本更高

混合精度策略

对神经网络中不同类型的算子采用不同数值精度的运算策略(如 GEMM 用 FP16/INT8、Softmax 与 LayerNorm 保持 FP32),是业界标准做法,能在几乎不损失精度的前提下大幅提速——第 2 套「会导致模型精度显著下降,需避免使用」的判断为错误

5.3 KV Cache 及其优化

KV Cache 原理:自回归生成时缓存历史 token 的 Key/Value 张量,避免重复计算,是典型的以空间换时间。其显存占用随序列长度、Batch 大小、层数、头数近似线性增长(该判断题为正确)。

优化方向方法机制
减少 KV 数量(模型结构角度)MQA(Multi-Query Attention)所有 Query 头共享同一组 K/V
GQA(Grouped-Query Attention)Query 头分组,组内共享 K/V,是 MQA 与 MHA 的折中
MLA(DeepSeek)对 KV 做低秩潜变量压缩
减少缓存长度(算法角度)窗口优化 / 滑动窗口 Attention只保留最近 N 个 token 的 KV
存储与计算管理角度PagedAttention(vLLM)借鉴操作系统虚拟内存分页,把 KV Cache 分块非连续存储,消除显存碎片,显著提升吞吐

5.4 推理性能指标

指标英文含义影响什么
首 token 时延TTFT / First Token Latency从收到请求到吐出第一个 token 的时间,由 Prefill 阶段决定对话类应用的实时体验核心指标
非首 token 时延TPOT / Inter-Token Latency后续每个 token 的间隔,由 Decode 阶段决定生成流畅度
吞吐量Throughput(tokens/s、QPS)单位时间处理的 token 或请求数服务成本与并发能力
并发数Concurrency同时在线处理的请求数资源规划

5.5 推理优化手段全景

方向具体手段
模型压缩量化、剪枝、蒸馏、低秩分解
计算加速算子融合与 Kernel 优化、FlashAttention、图优化、并行解码
缓存与调度KV Cache、PagedAttention、Continuous Batching(连续批处理 / In-flight Batching)、Prefix Caching
分布式推理张量并行(降首 token 时延)、流水线并行、专家并行
硬件选型选择匹配的加速卡(昇腾 NPU / GPU)、提高显存带宽

数据增强属于训练阶段的数据处理手段,不属于推理优化方式(第 2 套多选干扰项)。

Transformer 计算效率优化的重点

Transformer 的计算与显存瓶颈集中在 Attention(尤其是长序列下的 QK^T 与 Softmax)FFN 全连接层。残差结构本身只是逐元素加法,开销可忽略——第 1 套「应着重于对全连接层和残差结构进行优化」的判断为错误

5.6 主流推理框架

框架出品方关键特性
vLLMUC Berkeley 开源PagedAttention 优化 KV Cache,实现高吞吐量推理;Continuous Batching
TGI(Text Generation Inference)HuggingFace支持张量并行与 Continuous Batching,与 HF 生态无缝衔接
TensorRT-LLMNVIDIA面向 NVIDIA GPU 的深度编译优化,In-flight Batching
MindIE华为昇腾昇腾推理引擎,含 MindIE-Service 服务化框架

5.7 蒸馏版模型的价值

以 DeepSeek 一体机的蒸馏版模型为例:参数量更小 → 推理速度更快、部署成本更低、对硬件要求更低。「参数量更大」「训练成本更高」「仅支持文本场景」均为错误描述。

M066 节

模块六 RAG、知识库与 LangChain

本模块对应约 16 道题,是三套题共同的高频区,也是填空题最爱考的领域。

6.1 RAG 的定义与价值

RAG(Retrieval-Augmented Generation,检索增强生成):在生成回答之前先到外部知识库中检索相关内容,再由大模型整合检索结果生成答案。

价值说明
解决知识时效性知识库可随时更新,无需重新训练模型
减少幻觉生成有据可依,答案可溯源到原始文档
提升专业性与准确性注入企业内部/领域专有知识
保护数据隐私私有数据留在本地知识库,不进入模型权重
成本低相比微调,无需大量算力与标注数据

RAG 的局限:仍依赖知识库内容的完整性和质量;主要依赖模型内部参数记忆 + 外部知识库辅助共同生成回答。

6.2 RAG 的三大核心步骤

步骤英文关键动作
数据索引Indexing文档加载 → 文本分割(Chunking)→ 向量化(Embedding) → 存入向量数据库
检索Retrieval将用户 Query 向量化,在向量库中做语义相似度检索(而非仅关键词匹配),返回 Top-K 片段
生成Generation把检索结果与 Query 一起组装成 Prompt,交由大模型阅读理解并生成答案

向量化的本质

将文本、图像等数据转换为向量(矩阵)表示,便于计算机进行语义相似度计算——该判断题为正确

相似度度量方法

方法说明
余弦相似度 Cosine Similarity衡量向量夹角,文本检索最常用
欧氏距离 Euclidean / L2衡量空间直线距离
内积 Inner Product / 点积常用于归一化向量
曼哈顿距离、汉明距离等特定场景使用

6.3 大模型与知识库结合时,模型承担什么角色

当把专业文档向量化后作为知识库挂载在模型上时,模型的主要作用包括:用户意图识别、语义提取、对检索出的文档做阅读理解和摘要——该判断题为正确。检索本身由向量库完成,模型不负责存储知识。

协同效应的正确表述:大模型与知识库结合可以快速检索相关知识并生成准确回答,提高信息检索的效率和准确性。(干扰项:「限制了检索效率」「主要用于增强游戏体验」「只能应用于在线教育」——注意「只能」「主要用于某单一领域」都是错误信号。)

6.4 内部知识库 vs 外部知识库

类型承载内容价值
内部知识库企业机密技术文档、内部规章、产品资料、历史工单构建差异化竞争力,需严格权限管控
外部知识库公开常识、行业标准、法规政策、学术资料补充企业未覆盖的通用常识避免重复投入公开知识建设同步行业动态与政策更新

6.5 RAG 的评估方法

评估方式评什么
独立评估分别评估「检索」和「生成」两个环节:检索侧看命中率/召回率/MRR/NDCG,生成侧看忠实度(Faithfulness)、答案相关性
端到端评估把 RAG 当黑箱,直接评估最终答案的正确性、相关性与完整性
用户满意度调查线上真实用户反馈(点赞率、解决率、人工评分)

6.6 LangChain 六大组件

组件作用
Models(模型)统一封装各家 LLM / Chat Model / Embedding Model
Prompts(提示)提示模板、示例选择器、输出解析器
Indexes / Retrieval(索引)文档加载器(Document Loaders)、文本分割器(Text Splitters)、向量存储(Vector Stores)、检索器(Retrievers)
Chains(链)把多个调用串成流程,如 Retrieval Q&A Chain 实现了 RAG 的完整流程(判断题正确)
Memory(记忆)维护对话历史。同时支持短期记忆(Buffer)与长期记忆(Vector Store Memory、Entity Memory)
Agents(代理)让 LLM 自主决定调用哪些工具
M074 节

模块七 AI Agent 与 MCP

本模块对应约 10 道题,题量不大但概念清晰,属于必拿分。

7.1 AI Agent 的核心能力

要素英文作用
规划Planning任务分解、反思与迭代(ReAct、CoT、Reflexion)
记忆Memory短期记忆(上下文窗口)+ 长期记忆(向量库)
工具Tools调用外部 API、检索、代码执行、数据库
执行/行动Action / Execution把决策落地为实际操作并观察结果

7.2 AI Agent 在代码开发中的优势

  • 解决复杂问题:借鉴人类团队协作模式,把复杂问题拆解简化为可执行子任务。
  • 出现问题时能更清晰地定位问题 / 智能放大:每个子 Agent 职责单一,故障可归因到具体环节。
  • 复用性强:单个 Agent 与工具可在不同任务中重复使用。
  • 降低算力成本」是错误项——多 Agent 协作会产生多轮 LLM 调用,算力成本通常上升

7.3 多智能体系统(MAS)

MAS(Multi-Agent System)由多个具备自主性的 Agent 协作完成任务,恰恰适用于复杂任务场景(角色分工、辩论、流水线)——「MAS 仅适用于简单任务场景」的判断为错误

7.4 MCP(Model Context Protocol)

要点内容
定位一套开放标准协议,用于打通大语言模型与外部资源(数据、工具、提示)的交互
底层协议基于 JSON-RPC 2.0 构建(不是 HTTP / RESTful / TCP-IP,这三个是干扰项)
核心角色MCP Host(宿主应用)、MCP Client(客户端)、MCP Server(暴露资源与工具的服务端)
三类能力Resources(资源)、Tools(工具)、Prompts(提示模板)
价值从「每个模型对接每个工具」的 M×N 集成,变为「统一协议」的 M+N 集成
M086 节

模块八 昇腾算力基础设施(计算 · 网络 · 存储 · 数据中心)

本模块对应约 30 道题,是华为认证的「特色分值区」,也是最容易因不熟悉产品名而丢分的地方。

8.1 昇腾全栈软硬件体系

层次组件定位与考点
硬件Ascend(昇腾)AI 处理器、Atlas 系列服务器/集群昇腾 910/310;填空题「华为智慧交通基于华为 ____ AI 处理器」→ Ascend
异构计算架构CANN(Compute Architecture for Neural Networks)介于昇腾硬件与 AI 框架之间的异构计算架构,负责算子库、图编译、算子优化,提升 AI 处理器计算效率。CANN 不是 AI 框架
AI 框架MindSpore华为自研 AI 计算框架,核心特性:自动并行、全场景部署(端边云)、动静统一
算子开发Ascend C算子开发编程语言
开发工具MindStudio全流程开发工具链:算子开发、调试、性能调优、精度比对
大模型套件MindFormers支持 NLP、CV、多模态等任务的大模型开发套件
微调工具MindPet参数高效微调工具包
加速库MindSpeed昇腾分布式训练加速,兼容 Megatron-LM
压缩工具ModelSlim量化、剪枝、蒸馏
推理引擎MindIE / MindIE-Service推理与服务化

昇腾训练解决方案的核心组件

包括 CANN 异构计算架构MindStudio开发工具链、MindSpore 等。CUDA 编程接口属于 NVIDIA 生态,不属于昇腾训练解决方案(单选「不属于」选它)。

Ascend C 算子开发语言

  • 原生支持 C 和 C++ 标准规范,兼容 C/C++ 语法,降低学习成本(判断题为正确)
  • 结构化核函数编程,简化算子逻辑表达
  • 自动化流水并行调度(自动并行计算等关键技术),在保证性能的同时大幅降低算子开发门槛
  • 「仅支持图像处理算子,不支持 NLP 算子」为错误项——Ascend C 是通用算子开发语言。

AI Core 计算核心

AI Core 是昇腾处理器的计算核心,包含矩阵计算单元(Cube)、向量计算单元(Vector)、标量计算单元(Scalar)。其矩阵计算单元一拍可完成 16×16×16 = 4096 次 FP16 运算

8.2 Atlas 集群与硬件形态

产品/部件要点
Atlas 900 A2 PoD / Atlas 900 PoD A2面向大模型训练的集群产品,采用全液冷散热方案以支撑高功率密度。判断题「采用风墙散热方式」→ 错误
DX511 交换机Atlas 900 PoD A2 参数面交换机,前面板配置 16 个 400GE/100GE 光口,与 Atlas 服务器的连接通过光电转换模块实现(判断题为正确)
HCCS / 参数面网络服务器内/间的高速互联,承载梯度同步等集合通信流量

8.3 网络:无损以太与 IB

华为智能无损网络关键技术

技术全称作用
PFCPriority-based Flow Control优先级流控——基于优先级队列的反压,实现零丢包
ECNExplicit Congestion Notification拥塞通知——标记报文通知源端降速
DCQCNData Center QCNPFC + ECN 结合的端到端拥塞控制算法
iLossless / AI Fabric华为智能无损方案硬件层包括 Switch、NP、FPGA、AI Chip(判断题为正确)

参数面网络必须部署为无损网络(RoCEv2 / IB),不能是普通 TCP/IP 有损网络——第 3 套「参数面网络部署为 TCP/IP 有损网络」判断为错误

IB 网络 vs RoCE(RDMA over Converged Ethernet)

维度InfiniBand(IB)RoCE / 以太网
性能流控与低时延表现出色,性能过硬RoCEv2 已接近,但流控与时延仍略逊
开放性封闭、私有协议开放标准,生态广
成本成本高、运维费用高可复用现有以太网基础设施,成本低
组网划分为多个子网,每个子网通过一个或多个 IB 交换机连接,子网是具有独立拓扑与配置的通信域;由 Subnet Manager 集中管理支持多路径与数据包喷洒、拥塞控制机制、遥测,满足负载均衡、零丢包、低时延

定位结论:IB 网络是大模型训练网络的第二选项(第一选项为无损以太),因其封闭与高成本。

8.4 存储

AI 存储的关键能力(多选全选型)

  • 高带宽与低时延的数据访问能力——喂饱大规模训练集群
  • 横向扩展能力(Scale-Out)——容量与性能随节点线性扩展
  • 多协议支持——NFS/CIFS/S3/HDFS/POSIX 互通免搬迁
  • 数据可靠性与冗余机制——EC 纠删码、多副本、断点续训 CKPT 快速读写

OceanStor Pacific 的「混合负载均衡」

  • 同时处理 AI 训练、推理、数据分析等多种负载
  • 自动分级热温冷数据
  • 动态调整读写资源分配
  • 支持万卡集群并发访问

NVMe over RoCE

  • 端到端 NVMe 协议降低时延
  • 利用现有以太网基础设施降低成本
  • 支持 RDMA,绕过内核、减少 CPU 开销
  • 「仅适用于小文件随机读写场景」✘ —— 它是通用高性能块存储协议,大文件顺序读写同样受益。

分布式存储组网三张网

管理网络 + 前端业务网络 + 后端存储网络。第 1 套写成「管理网络、前端业务网络和前端存储网络」→ 错误(存储网是后端)。

8.5 数据类型:结构化 / 半结构化 / 非结构化

类型定义示例
结构化数据使用预定义和预期格式,有固定数据模型(行列/Schema)SQL 数据库、Excel 表、CSV
半结构化数据有标签或标记但无严格 SchemaJSON、XML、日志、电子邮件
非结构化数据没有预设数据模型的信息图片、音频、视频、自由文本、PPT/PDF

8.6 数据中心(DC)设计

数据中心物理模型四大区域

区域内容
主机房区域服务器(含 AI 服务器)、存储、网络设备的机柜区——算力基础设施部署于此
辅助区域监控中心、测试机房、备件间、打印室
支持区域变配电室、UPS 室、空调机房、消防设施、进线间
行政管理区域办公室、会议室、值班室、更衣间

能效与空间指标

指标含义关系
PUEPower Usage Effectiveness = 数据中心总能耗 / IT 设备能耗越接近 1 越节能
SUE / 出柜率单位建筑面积可部署的机柜数量提高出柜率可提升空间利用效率,但会增加制冷负荷,进而影响 PUE

因此规划出柜率时必须同时评估制冷能力与能效指标,避免单纯追求空间效率而损害整体能效——该判断题为正确(是一道长题干的送分题)。

M095 节

模块九 解决方案设计、部署与行业落地

本模块对应约 20 道题,是「Solution Architect」认证的落脚点,第 2、3 套集中考查。

9.1 大模型业务落地的标准流程(必考单选)

业务场景需求分析 → 模型选型 → 微调数据准备 → 训练调优 → 推理部署 → 应用集成

9.2 模型选型

开源 vs 闭源

维度开源大模型闭源大模型
获取方式模型脚本与权重可免费获取通过 API 调用,按 token 计费
定制能力可深度微调、可私有化部署定制受限(多为 Prompt / 少量微调接口)
上线速度慢——需自行微调、部署、运维快——API 调用即可快速上线
技术门槛——需关注微调、部署、优化、运维
合规需遵循相应开源协议(Apache 2.0、Llama License 等)进行修改、分发与商业使用遵循服务商条款

按能力选型(场景匹配)

业务场景所需核心能力
电商智能客服自然语言理解与对话生成能力
合同审查 / 法务法律法规与合同条款解析能力
研发提效编程与代码调试能力
风控决策 / 数学推理复杂逻辑推理能力

参考权威榜单

榜单评测方向适用任务
Chatbot Arena(LMSYS Org)人类盲测对战 Elo 排名,衡量综合对话能力对话类任务
Big Code Models Leaderboard代码生成能力代码任务(不适用于常识问答)
Open LLM LeaderboardMMLU/ARC/HellaSwag 等学术基准通用能力
C-Eval / CMMLU中文能力中文场景

低预算 + 需定制风格的选型策略

合理策略:选择闭源大模型通过 API 快速上线(先跑通)✔;选择开源模型 + 企业自有数据微调(实现风格定制)✔。两者在题中均为正确选项——前者解决「快速上线」,后者解决「定制回答风格」。

9.3 部署形态

维度选项特点与考点
云端部署公有云 / 私有云计算资源丰富,但对网络带宽依赖较高(判断正确);数据需传输到云端,隐私与传输安全必须考虑(「无需考虑数据传输安全」判断为错误)
边缘部署边缘服务器 / 一体机低时延、数据不出园区
端侧部署手机、车机、IoT 设备算力受限,需小模型 + 量化
端云协同端侧轻量推理 + 云端复杂推理典型场景:智能手机语音助手、在线文档翻译、车载导航系统、医疗影像分析

Service 部署 vs SDK 部署

Service(服务化)部署面向云端/服务器,通过 API 对外提供推理服务;SDK 部署面向嵌入式与端侧场景,集成到应用中本地推理。第 3 套「Service 部署主要用于嵌入式端侧场景,SDK 部署用于云端服务器」→ 说反了,判断为错误

服务化框架支持的接口(MindIE-Service)

RESTful API、gRPC、OpenAI 兼容接口、自定义 SDK 接口——四项均支持(多选全选)。

容器化技术的作用

实现模型的快速部署与环境隔离(依赖打包、版本一致、弹性伸缩、便于编排)。不是用来优化推理速度、减少参数量或提升精度——第 3 套「容器化技术主要用于优化模型推理速度」判断为错误

9.4 华为行业解决方案速记

方案关键要点
盘古大模型L0 基础 / L1 行业 / L2 场景三层。政务大模型基于海量公开公文训练,结合知识搜索构建智慧办公助手,支持公文撰写、摘要生成、文档问答
盘古气象大模型端到端学习实现全球 10 天天气预测,计算效率比传统数值模式提升约 1000 倍(判断为正确)
华为智慧交通基于华为 Ascend AI 处理器及全栈技术体系,覆盖高速公路自由流收费、收费稽核、视频云联网、车路协同
昇腾智城(智慧城市)三层集成架构:AI 算力基础层 → AI 平台层(使能层)→ AI 算法与服务层
DeepSeek 一体机同时支持训练与推理部署(「仅支持训练、不包含推理部署」判断为错误);提供蒸馏版模型以提升推理速度、降低成本
鸿蒙智行智驾核心技术:多模态传感器融合(摄像头+激光雷达)、基于强化学习的行为预测、动态路径规划

9.5 大模型在金融行业的应用(Chester 视角的加分项)

AI 在金融行业的典型应用包括风险控制、智能投顾、欺诈检测,其中智能客服通过语音识别与对话生成提升服务效率——该判断题为正确。可延伸的行内场景:反洗钱可疑交易研判、KYC 材料结构化、信贷报告生成、投研摘要、坐席辅助、合规审查。

A7 节

附录 A 高频易错点速记(判断题命中率最高)

下表逐条列出三套题中出现的「似是而非」表述。左列为题面说法,右列为判定与纠正。考前 30 分钟只看这一张表,判断题至少能拿 80%。

A.1 算法与模型原理

  • Seq2Seq 的 Encoder 和 Decoder 只能是相同的结构

    可以不同,且可为 CNN/RNN/Transformer

  • Transformer 的 Encoder 各 layer 之间会进行参数共享

    结构相同但参数不共享

  • Transformer 利用循环结构避免前序信息遗忘

    Transformer取消了循环结构

  • Attention 第三步是将权重和 key 加权求和

    是与 Value 加权求和

  • BERT 阅读理解强是因为采用自回归语言建模

    BERT 用 MLM 双向编码,自回归是 GPT

  • Diffusion 生成是模拟从有序到混乱的正向扩散路径

    生成走反向去噪(混乱→有序)

  • Diffusion 的 Denoise 模块预测噪声而非直接预测图像

    正确

  • Diffusion 在 T2I 中采用自回归模型逐词生成图像

    是逐步迭代的扩散过程

  • 不同 prompt 对图片生成质量没有影响

    影响显著

  • 图文联合编码无法直接捕捉跨模态依赖关系

    联合编码正是为了捕捉跨模态依赖

  • 多模态 AI 仅能处理文本和图像

    还包括音频、视频等

  • 神经网络语言模型通过词频统计构建嵌入矩阵

    词频统计是统计语言模型的做法

  • 深度学习特征提取强,因此小样本场景也更优秀

    小样本下深度学习反而劣势

  • 文本分类中深度学习方法可自动提取特征

    正确

  • 语用分析是分析外界环境对语言使用者产生的影响

    正确

  • Stable Diffusion 使用 CLIP 作为文本编码器

    正确

A.2 训练与并行

  • 大模型在预训练阶段会专门学习某项特定任务

    预训练学通用能力,特定任务靠微调

  • SFT 需要大量标注数据,而 RLHF 无需人工参与

    RLHF 的偏好数据来自人工标注

  • 单卡装不下模型,因此把张量并行改为数据并行

    方向反了,应从数据并行改为模型/张量并行

  • ZeRO-3 将参数切分到不同卡,属于模型并行的方法

    正确(参数切分具备模型并行特征)

  • ZeRO-R 的方法包括「将数据和计算卸载到 CPU」

    那是 ZeRO-Offload

  • Megatron-LM 支持 ZeRO 数据并行

    ZeRO 属 DeepSpeed

  • HuggingFace Transformers 与 DeepSpeed 不能运行在昇腾 NPU

    可通过适配层运行在昇腾

  • 并行训练框架可高效利用多计算节点协同训练

    正确

  • 数据清洗对训练结果影响有限,可先训练后优化数据

    数据质量是决定性因素,必须前置

  • 算力配置越多,模型训练效率必然越高

    受通信开销与并行效率限制,非线性

  • 训练时学习率越高越好,可加速收敛并提升性能

    过高会震荡、发散

  • 模型参数量属于训练调优的关键超参数

    那是模型结构定义,不是超参数

  • 推理所需显存与优化器状态有关

    优化器状态仅训练时存在

A.3 微调与提示工程

  • 指令微调是以无监督方式对 LLM 进行微调

    有监督方式

  • Few-Shot-CoT 不添加示例,仅加「Let's think step by step」

    那是 Zero-Shot-CoT

  • In-Context Learning 结合了中间推理步骤

    那是 CoT 的描述

  • Prompt Tuning 在输入序列前增加特殊 Token 以提高期望序列概率

    正确

  • Prompt Tuning 无需修改原始模型参数

    正确

  • Adapter Tuning 属于软提示(Soft prompts)类型

    它是插入适配器模块

  • Prefix Tuning / P-Tuning v2 只在输入层加 prompt

    它们在每一层注入

  • P-Tuning v2 深层注入同时降低了推理计算开销

    开销上升

  • P-Tuning v2 参数效率显著高于 LoRA

    无此结论

  • 大模型微调的核心是重新训练整个模型参数

    高效微调恰恰避免全参重训

  • 零样本提示是提示词中不提供任何示例直接执行任务

    正确

  • 微调时增加高相关数据,即便总量不大也能显著提升表现

    正确

  • QLoRA 无需额外计算资源

    量化/反量化仍有开销

  • RAG 可以完全定制模型的行为和写作风格

    那是微调的能力

A.4 压缩、量化与推理

  • 模型蒸馏是通过参数裁剪直接压缩原始大模型

    那是剪枝;蒸馏是小模型学大模型输出分布

  • 知识蒸馏让小模型学习大模型输出分布实现轻量化

    正确

  • 算子融合属于模型压缩技术

    属于计算加速,不减参数量

  • 量化可以提升模型泛化能力

    量化不提升泛化

  • INT8 值域为 [−128, 128] 或 [−127, 128]

    正确为 [−128, 127]

  • int8 比 FP32 快,因访问一次 FP32 的时间可访问四次 int8

    正确

  • 不同算子采用不同精度会导致精度显著下降,需避免

    混合精度是标准做法

  • Continuous Batching 会小范围修改模型权重的值

    只做请求调度,绝不改权重

  • KV Cache 内存消耗随输入长度近似线性增长

    正确

  • vLLM 通过 PagedAttention 优化 KV Cache 实现高吞吐

    正确

  • 优化 Transformer 计算效率应着重于全连接层和残差结构

    瓶颈是 Attention + FFN,残差开销可忽略

  • Pipeline Parallel 按层拆分,适合减少首 token 时延

    降首 token 时延应用张量并行

  • 降低时延的手段包括「增大 Batch Size」/「串行解码」

    前者提吞吐但增时延,后者是反向项

A.5 RAG、Agent 与知识库

  • 欧氏距离是向量相似度检索的唯一方法

    还有余弦相似度、内积等

  • 向量化的核心是把数据转为向量便于语义相似度计算

    正确

  • LangChain 的 Retrieval Q&A Chain 实现了 RAG 完整流程

    正确

  • LangChain 记忆模块仅支持短期记忆

    也支持长期记忆

  • 模型参数分析属于 RAG 的评估方法

    RAG 评估是「检索-生成」链路

  • 外部知识库用于存储企业机密技术文档

    机密文档属内部知识库

  • 知识库挂载后模型负责意图识别、语义提取、阅读理解与摘要

    正确

  • AI Agent 必须具备记忆、工具、计划和执行能力

    正确

  • 数据清洗属于 AI Agent 的核心功能

    干扰项

  • AI Agent 在代码开发中的优势包括「降低算力成本」

    多轮调用反而增加成本

  • 多智能体系统(MAS)仅适用于简单任务场景

    恰恰适用于复杂任务

  • MCP 基于 HTTP / RESTful / TCP-IP 构建

    基于 JSON-RPC 2.0

A.6 基础设施与产品

  • CANN 是华为的 AI 框架,不涉及芯片算子优化

    CANN 是异构计算架构,核心正是算子优化

  • CANN 支持 NPU 生态向 GPU 高效迁移

    方向反了,是支持第三方生态向 NPU 迁移

  • MindSpore 仅支持昇腾硬件,不兼容 GPU/CPU

    支持 Ascend/GPU/CPU

  • MindFormers 是昇腾大模型开发套件,支持 NLP/CV/多模态

    正确

  • Ascend C 原生支持 C/C++ 标准,自动并行降低开发门槛

    正确

  • Ascend C 仅支持图像处理算子

    通用算子开发语言

  • CUDA 编程接口属于昇腾训练解决方案核心组件

    属 NVIDIA 生态

  • Atlas 900 A2 PoD 集群采用风墙散热

    采用液冷

  • DX511 前面板 16 个 400GE/100GE 光口,光电转换模块连接

    正确

  • 分布式存储组网 = 管理网 + 前端业务网 + 前端存储网

    应为后端存储网络

  • 参数面网络部署为 TCP/IP 有损网络

    必须是无损网络(RoCE/IB)

  • PFC 的作用是拥塞通知

    PFC 是优先级流控;拥塞通知是 ECN

  • 华为智能无损硬件层包括 Switch、NP、FPGA 和 AI Chip

    正确

  • NVMe over RoCE 仅适用于小文件随机读写场景

    通用高性能场景

  • 非结构化数据必然是完全没有经过任何处理的信息

    绝对化错误,定义是「无数据模型」

  • 结构化数据存储效率高于非结构化,但扩展性较差

    正确

  • 提高出柜率提升空间效率但增加制冷负荷、影响 PUE

    正确

A.7 方案与部署

  • 开源大模型无需关注微调部署,技术门槛较低

    开源恰恰要求更高技术能力

  • 开源模型修改/分发/商用需遵循开源协议

    正确

  • 面向文本摘要任务可参考 Chatbot Arena 排行榜

    Chatbot Arena 评对话综合能力

  • 常识问答可优先参考 Big Code Models Leaderboard

    那是代码榜

  • 云端部署数据隐私性强,无需考虑传输安全

    必须考虑传输与存储安全

  • 云端部署计算资源丰富,但对网络带宽依赖较高

    正确

  • Service 部署用于端侧,SDK 部署用于云端

    说反了

  • 容器化技术主要用于优化模型推理速度

    用于快速部署与环境隔离

  • DeepSeek 一体机仅支持训练,不含推理部署

    训推一体

  • 盘古政务大模型属行业模型,智慧办公助手属场景模型

    正确

  • 盘古气象大模型效率比传统数值模式提升约 1000 倍

    正确

  • 在售智驾车辆仍属辅助驾驶,驾驶人须全程负责

    正确

  • AI 编程助手能系统性识别大型代码库深层逻辑漏洞

    超出当前能力边界

  • LLM 可即时处理并回答所有时效性问题

    绝对化错误

  • 把所有数据上传云端用在线大模型即可保证数据安全

    恰恰是安全风险

B

附录 B 英文缩写词表

填空题与多选题「缩写对应含义」类考点的完整词表。加粗项为三套题直接出现过的。

缩写全称中文含义
LLMLarge Language Model大型语言模型
CLMCausal Language Model因果语言模型(自回归,GPT 系)
MLMMasked Language Model掩码语言模型(BERT)
NSPNext Sentence Prediction下一句预测(不是「下一个状态预测」)
MLPMulti-Layer Perceptron多层感知机
FFNFeed-Forward Network前馈神经网络
MoEMixture of Experts混合专家模型
RAGRetrieval-Augmented Generation检索增强生成
SFTSupervised Fine-Tuning有监督微调
RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习
RMReward Model奖励模型
PEFTParameter-Efficient Fine-Tuning参数高效微调
LoRALow-Rank Adaptation低秩适配
QLoRAQuantized LoRA量化低秩适配
CoTChain-of-Thought思维链
ICLIn-Context Learning上下文学习
KDKnowledge Distillation知识蒸馏
PTQ / QATPost-Training Quantization / Quantization-Aware Training训练后量化 / 量化感知训练
MQA / GQA / MLAMulti-Query / Grouped-Query / Multi-head Latent Attention三种 KV Cache 结构优化
MTPMulti-Token Prediction多 Token 预测(DeepSeek-V3)
CKPTCheckpoint模型检查点文件(断点续训)
ZeROZero Redundancy Optimizer零冗余优化器
DP / TP / PP / EP / SPData / Tensor / Pipeline / Expert / Sequence Parallel数据 / 张量 / 流水线 / 专家 / 序列并行
CANNCompute Architecture for Neural Networks昇腾异构计算架构
NPUNeural-network Processing Unit神经网络处理器
PFCPriority-based Flow Control优先级流控
ECNExplicit Congestion Notification显式拥塞通知
RDMARemote Direct Memory Access远程直接内存访问
RoCERDMA over Converged Ethernet融合以太网上的 RDMA
IBInfiniBand无限带宽网络
NVMeNon-Volatile Memory express非易失性内存主机控制器接口
PUEPower Usage Effectiveness电能使用效率
SUESpace Usage Effectiveness(出柜率)空间/机柜利用效率
MCPModel Context Protocol模型上下文协议(基于 JSON-RPC 2.0)
MASMulti-Agent System多智能体系统
TTFTTime To First Token首 token 时延
TGIText Generation InferenceHuggingFace 推理框架
AGIArtificial General Intelligence通用人工智能
C2 节

附录 C 填空题高频答案词库

三套题共 12 道填空题,全部答案与同类高频备选词汇如下。填空题每题 18 分,是单题分值最高的题型,务必全部拿下。

C.1 三套题填空题的对应答案

套次-题号题干要点答案
套1-57回答最新业务问题 + 减少幻觉,填英文缩写RAG
套1-58多台主机发数据给同一台主机并做操作,填英文全称首字母大写Reduce
套1-59昇腾设备上做 PyTorch 开发训练,提升计算效率的平台,填英文缩写CANN
套1-60全连接层改为多个「专家」组成的层MoE(混合专家)
套2-57华为智慧交通基于华为 ____ AI 处理器,填英文Ascend(昇腾)
套2-58按层或参数拆分到多卡的并行 + 合并结果的操作,填英文Tensor(张量并行)AllReduce
套2-59AI 训练中保存模型状态的文件,填英文全称Checkpoint
套2-60仅在反向传播阶段存在、参数更新后可释放的显存梯度显存(Gradients)
套3-57昇腾智城三层架构:AI 算力基础层、____、AI 算法与服务层AI 平台层(AI 使能平台层)
套3-58Transformer 中单词最终输入表示由 ____ 和 ____ 相加得到词嵌入(Word Embedding)位置编码(Positional Encoding)
套3-59AI Core 矩阵计算单元一拍可完成 ____ 次 fp16 运算4096(16×16×16)
套3-60RAG 三大核心步骤:数据索引、____、生成检索(Retrieval)

C.2 同类备选词(可能换问法)

问法方向备选答案
集合通信操作Broadcast / Scatter / Gather / Reduce / AllReduce / AllGather / ReduceScatter / All-to-All
并行策略Data Parallel / Tensor Parallel / Pipeline Parallel / Expert Parallel / Sequence Parallel
高效微调技术LoRA / QLoRA / AdaLoRA / Adapter / Prefix Tuning / Prompt Tuning / P-Tuning / P-Tuning v2 / BitFit
压缩技术量化 Quantization / 剪枝 Pruning / 知识蒸馏 Distillation / 低秩分解
昇腾组件Ascend / CANN / MindSpore / MindStudio / MindFormers / MindSpeed / MindPet / MindIE / ModelSlim / Ascend C
推理优化KV Cache / PagedAttention / Continuous Batching / 算子融合 / FlashAttention
网络技术PFC / ECN / DCQCN / RDMA / RoCEv2 / InfiniBand
精度类型FP32 / FP16 / BF16 / INT8 / INT4 / NF4
训练阶段预训练 / 有监督微调 SFT / 奖励模型 RM / 强化学习 RLHF
D3 节

附录 D 三套模拟题考点索引

做完题后按此表回查对应模块。M1~M9 对应本材料的模块一至模块九。

D.1 第 1 套(偏算法与训练底层)

  • 1Seq2Seq 结构M2.4
  • 2数据中心物理模型 - 主机房区域M8.6
  • 3Megatron-LM 支持的功能M3.7
  • 4大模型业务落地流程顺序M9.1
  • 5微调场景无需考虑的问题M4.8
  • 6大模型对聊天机器人的改进M1.3
  • 7Transformer 参数共享M2.6
  • 8DeepSpeed 的定位M3.7
  • 9软提示技术分类M4.2
  • 10NLP 歧义层次(词法)M2.1
  • 11KV Cache 存储与计算优化M5.3
  • 12ModelSlim 压缩量化M3.7 / M8.1
  • 13大模型 + 知识库协同效应M6.3
  • 14INT8 值域M5.2
  • 15BERT 最后一层输出向量M2.7
  • 16DeepSpeed 软件架构三层M3.7
  • 17Diffusion 文生图特点M2.8
  • 18增量预训练策略M3.2
  • 19Transformer 关键技术M2.6
  • 20大模型应用场景M1.4
  • 21Attention 计算三步M2.5
  • 22ICL / CoT / 指令微调M4.5
  • 23大模型固有局限M1.3
  • 24ZeRO-R 内存优化方法M3.5
  • 25基于推理的词向量方法M2.2
  • 26只在输入层加 prompt 的技术M4.2
  • 27推理显存的影响因素M3.6
  • 28缩写对应含义(NSP)附录B
  • 29非结构化剪枝算法M5.1
  • 30大模型在交互式教学的应用M1.4
  • 31IB 网络与 RDMA 对比M8.3
  • 32大模型层级划分M1.2
  • 33Ascend C 特性M8.1
  • 34Diffusion Denoise 预测噪声M2.8
  • 35RAG 能否定制风格M4.7
  • 36开源大模型的技术门槛M9.2
  • 37any-to-any 多模态M2.9
  • 38深度学习自动提取特征M2.12
  • 39ZeRO-3 与模型并行M3.5
  • 40Continuous BatchingM5.5
  • 41Prompt Tuning 原理M4.2
  • 42模型排行榜适用任务M9.2
  • 43Transformer 计算效率优化重点M5.5
  • 44Few-Shot / Zero-Shot CoTM4.5
  • 45语用分析M2.1
  • 46指令微调是否有监督M4.5
  • 47HF/DeepSpeed 能否跑昇腾M3.7
  • 48并行训练框架作用M3.7
  • 49知识库挂载后模型的作用M6.3
  • 50prompt 对图像生成的影响M2.8
  • 51分布式存储组网三张网M8.4
  • 52Atlas 900 PoD A2 与 DX511M8.2
  • 53并行策略切换方向M3.4
  • 54相似度度量方法M6.2
  • 55大模型的定义范围M1.2
  • 56行业模型 vs 场景模型M1.2 / M9.4
  • 57填空:RAG附录C
  • 58填空:Reduce附录C
  • 59填空:CANN附录C
  • 60填空:MoE附录C

D.2 第 2 套(偏方案架构与流程)

  • 1AI 发展阶段(感知和理解)M1.1
  • 2AI 编程助手能力边界M1.6
  • 3自注意力建模长距依赖M2.5
  • 4智能客服所需核心能力M9.2
  • 5LLM 训练阶段(SFT)M3.1
  • 6PFC 作用M8.3
  • 7结构化数据判别M8.5
  • 8外部知识库的价值M6.4
  • 9MCP 底层协议M7.4
  • 10对话应用核心时延指标M5.4
  • 11INT8 量化后尺寸比例M5.2
  • 12容器化技术的作用M9.3
  • 13ZeRO-1 分片对象M3.5
  • 14模型并行的特点M3.4
  • 15推理延迟最大的微调技术M4.3
  • 16语言模型发展历程M2.3
  • 17Transformer 相比 RNN/CNN 的优势M2.6
  • 18GPT-o3 改进方向M2.11
  • 19RAG 技术描述M6.1
  • 20大模型训练难点与影响因素M3.9
  • 21低预算 + 定制风格的选型策略M9.2
  • 22集合通信冲突流后果M3.8
  • 23AI 存储关键能力M8.4
  • 24大模型 vs 传统模型数据集M3.3
  • 25RAG 评估方法M6.5
  • 26AI Agent 在代码开发的优势M7.2
  • 27推理优化方式M5.5
  • 28量化带来的好处M5.2
  • 29降低推理时延的手段M5.5
  • 30模型压缩的作用M5.1
  • 31MindSpore 核心特性M8.1
  • 32P-Tuning v2 改进点M4.2
  • 33深度学习与小样本场景M1.8
  • 34智驾属辅助驾驶M1.7
  • 35预训练是否学特定任务M3.1
  • 36BERT vs GPT 建模策略M2.7
  • 37扩散模型生成方向M2.8
  • 38模型蒸馏 vs 剪枝M5.1
  • 39开源协议约束M9.2
  • 40微调数据相关性的价值M4.6
  • 41P-tuning v2 推理开销M4.2
  • 42出柜率 SUE 与 PUE 的关系M8.6
  • 43Atlas 900 A2 PoD 散热方式M8.2
  • 44CANN 的定位M8.1
  • 45非结构化数据的定义M8.5
  • 46零样本提示M4.5
  • 47RAG 向量化的核心M6.2
  • 48LangChain Retrieval Q&A ChainM6.6
  • 49vLLM 与 PagedAttentionM5.3 / M5.6
  • 50云端部署与数据安全M9.3
  • 51KV Cache 内存线性增长M5.3
  • 52int8 vs FP32 访问速度M5.2
  • 53混合精度策略M5.2
  • 54CANN 迁移方向M8.1
  • 55MindFormers 定位M8.1
  • 56SFT 与 RLHF 的人工参与M3.1
  • 57填空:Ascend附录C
  • 58填空:Tensor + AllReduce附录C
  • 59填空:Checkpoint附录C
  • 60填空:梯度显存附录C

D.3 第 3 套(偏华为产品与工程落地)

  • 1DeepSeek-V3 显存优化技术(MLA)M2.10
  • 2训练调优核心目标M3.10
  • 3量化感知训练 QAT 特点M5.2
  • 4PFC 作用M8.3
  • 5CKPT 文件的主要作用M3.10
  • 6蒸馏版模型的优势M5.7
  • 7奖励建模所需数据类型M3.10
  • 8MindSpeed 与 DeepSpeed 的区别M3.7
  • 9不属于昇腾训练方案的组件M8.1
  • 10增量预训练冻结策略M3.2
  • 11INT8 相比 FP32 减少的尺寸M5.2
  • 12不属于模型压缩的技术M5.1
  • 13减少首 token 时延的并行方案M3.4 / M5.4
  • 14HuggingFace 推理框架 TGIM5.6
  • 15不属于 Agent 核心功能的项M7.1
  • 16鸿蒙智行智驾核心技术M1.7
  • 17Transformer 输入处理流程M2.6
  • 18DeepSeek-V3 结构创新M2.10
  • 19训练调优关键超参数M3.10
  • 20压缩量化主要技术M5.1
  • 21端云协同典型场景M9.3
  • 22NVMe over RoCE 优势M8.4
  • 23OceanStor Pacific 混合负载均衡M8.4
  • 24大模型 vs 传统模型数据集M3.3
  • 25Ascend C 算子开发优势M8.1
  • 26高效微调的核心方向M4.1
  • 27QLoRA 的核心优势M4.4
  • 28MindIE-Service 支持的接口M9.3
  • 29降低时延的优化方式M5.5
  • 30LangChain 索引组件M6.6
  • 31AI Agent 在代码开发的优势M7.2
  • 32AI 软件演进模式M1.5
  • 33AI 在金融行业的应用M9.5
  • 34盘古气象大模型M9.4
  • 35图文联合编码M2.9
  • 36Stable Diffusion 文本编码器M2.8
  • 37多模态数据类型范围M2.9
  • 38学习率越高越好?M3.10
  • 39云端部署优劣M9.3
  • 40CANN 的定位M8.1
  • 41参数面网络是否有损M8.3
  • 42智能无损技术硬件层M8.3
  • 43DeepSeek 一体机是否含推理M9.4
  • 44结构化 vs 非结构化存储效率M8.5
  • 45MindFormers 定位M8.1
  • 46微调是否重训全部参数M4.1
  • 47SFT 与 RLHF 的人工参与M3.1
  • 48Prompt Tuning 原理M4.2
  • 49Service 部署 vs SDK 部署M9.3
  • 50容器化技术的作用M9.3
  • 51知识蒸馏原理M5.1
  • 52Pipeline Parallel 与首 token 时延M5.4
  • 53LangChain 记忆模块M6.6
  • 54Retrieval Q&A ChainM6.6
  • 55AI Agent 的四项核心能力M7.1
  • 56MAS 的适用场景M7.3
  • 57填空:昇腾智城 AI 平台层附录C
  • 58填空:词嵌入 + 位置编码附录C
  • 59填空:4096附录C
  • 60填空:检索 Retrieval附录C
E5 节

附录 E 应试策略

E.1 时间分配(90 分钟 / 60 题)

阶段时间做法
第一轮:判断题(24 题)约 20 分钟先做判断题。语感强、单题 50 秒即可,先把 384 分锁进口袋
第二轮:单选题(15 题)约 20 分钟单题 80 秒,拿不准的标记后跳过
第三轮:填空题(4 题)约 8 分钟分值最高(每题 18 分),注意题干要求「英文缩写 / 英文全称 / 首字母大写」
第四轮:多选题(17 题)约 30 分钟最难,放最后。逐项判断,宁可按「明确正确的才选」
第五轮:复核约 12 分钟回看标记题 + 检查填空拼写与大小写

E.2 判断题的五个「必错信号词」

  • 绝对化:唯一、必然、所有、完全、一定、无需考虑、全部 → 见到基本判错
  • 方向颠倒:把 A 的定义安到 B 头上(CANN↔MindSpore、Service↔SDK、正向扩散↔反向去噪、Few-Shot↔Zero-Shot)
  • 真前提 + 假结论:前半句完全正确,后半句加一个「因此……」的错误推论(深度学习与小样本、P-Tuning v2 降低开销)
  • 因果错配:结论对但理由错(BERT 强是因为「自回归」)
  • 范围缩小:把通用能力说成「仅支持 / 只能用于 / 主要限于」某一狭窄场景

E.3 多选题策略

  • 本考试多选多选、少选、错选均不得分,无部分分,所以「宁缺毋滥」是错的——少选同样零分,必须精确。
  • 大多数多选题的答案是 3 个(ABD、ACD、ABC 居多),四选全对的情况也常见(尤其「以下哪些能力重要」类的开放式题)。
  • 识别干扰项的三个特征:① 与其他三项不在同一层次(如推理优化里混入「数据增强」);② 带有反向词(「更短的上下文」「串行解码」「降低算力成本」);③ 杜撰的名词(DeepSpeed Adapter、进阶模型、Script 模式)。
  • 若四个选项中有三个明显互相呼应、一个突兀,突兀的那个通常就是要排除的。

E.4 填空题注意事项

  • 严格看括号提示:「填写英文缩写」→ RAG / CANN;「填入英文全称,首字母大写」→ Reduce / Checkpoint;「填写英文」→ Ascend / Tensor。
  • 数字题直接写阿拉伯数字(4096),不要写「16×16×16」。
  • 有两个空的题目要看清是「两个不同答案」(词嵌入 + 位置编码;Tensor + AllReduce)。

E.5 三轮练习的正确姿势

轮次做法目标正确率
第 1 轮闭卷限时 90 分钟做完第 1 套,全程不查资料。做完立刻用附录 D 定位每道不确定题所属模块,回读该节60%–70%
第 2 轮隔一天做第 2 套。重点观察「同一考点换了问法」是否还能答对(PFC、CANN、MindFormers、SFT/RLHF 在多套中重复出现)75%–85%
第 3 轮做第 3 套,并把三套的所有错题抄成一张单页错题卡,考前只看这张卡 + 附录 A≥ 85%
继续