📅 建议时间:综合知识 150 分钟 / 案例分析 90 分钟 / 论文 120 分钟
📚 难度:中等
第一部分:综合知识(75 分)
单项选择题(每题 1 分,共 75 分)
1. 在计算机系统中,虚拟存储器的主要作用是 ( )。
A. 提高存储速度 B. 扩大存储容量 C. 降低存储成本 D. 简化存储管理
答案:B
解析:虚拟存储器的主要作用是扩大存储容量,使程序可以使用比物理内存更大的地址空间。通过将部分数据存储在磁盘上,按需调入内存。
2. 某浮点数采用 IEEE 754 单精度格式,其阶码偏移量为 ( )。
A. 127 B. 128 C. 1023 D. 1024
答案:A
解析:IEEE 754 单精度浮点数阶码为 8 位,偏移量为 127;双精度阶码为 11 位,偏移量为 1023。
3. 在多处理器系统中,NUMA 架构的特点是 ( )。
A. 均匀内存访问 B. 非均匀内存访问 C. 共享内存 D. 分布式内存
答案:B
解析:NUMA(Non-Uniform Memory Access,非均匀内存访问)架构中,处理器访问本地内存快于访问远程内存。SMP 是均匀内存访问。
4. 某指令流水线由 4 段组成,各段所需时间均为Δt。连续输入 n 条指令时的吞吐率为 ( )。
A. 1/4Δt B. 1/(n+3)Δt C. n/(n+3)Δt D. 1/Δt
答案:A
解析:流水线吞吐率 TP=n/[(k+n-1)Δt],当 n 很大时,TP≈1/kΔt=1/4Δt。k 为流水线段数。
5. 采用 RAID 0 技术,若有 4 块磁盘,则磁盘利用率为 ( )。
A. 25% B. 50% C. 75% D. 100%
答案:D
解析:RAID 0 是条带化,没有冗余,所有磁盘容量都可用于存储数据,利用率=100%。
6. 某计算机系统的 Cache 采用 4 路组相联映射,Cache 容量为 64KB,块大小为 16B,则 Cache 被分为 ( ) 组。
A. 256 B. 512 C. 1024 D. 2048
答案:C
解析:4 路组相联,Cache 容量 64KB,块大小 16B。Cache 块数=64KB/16B=4096 块。组数=4096/4=1024 组。
7. 在进程调度中,时间片轮转算法适用于 ( )。
A. 批处理系统 B. 分时系统 C. 实时系统 D. 分布式系统
答案:B
解析:时间片轮转算法适用于分时系统,每个进程分配一个时间片,保证响应时间。
8. 某系统采用 Clock 页面置换算法,分配给某进程 3 个物理块。页面访问序列为 1,2,3,4,1,2,5,1,2,3,缺页次数为 ( )。
A. 6 B. 7 C. 8 D. 9
答案:C
解析:Clock 算法是改进的 FIFO,使用引用位。访问序列 1,2,3,4,1,2,5,1,2,3,3 个物理块,缺页次数约为 8 次。
9. 给定关系模式 R(A,B,C,D) 和函数依赖集 F={AB→C, C→D, D→A},则 R 的候选码有 ( ) 个。
A. 1 B. 2 C. 3 D. 4
答案:C
解析:求候选码:AB→C,C→D,D→A。候选码有 AB、BC、BD 共 3 个。
10. 某关系 R(A,B,C,D),其函数依赖集 F={AB→CD, C→A},则 R 最高属于 ( )。
A. 1NF B. 2NF C. 3NF D. BCNF
答案:B
解析:AB→CD,C→A。候选码为 AB 和 BC。存在部分依赖 C→A(C 是候选码 BC 的一部分),所以最高属于 2NF。
11. 在 SQL 中,用于创建索引的命令是 ( )。
A. CREATE TABLE B. CREATE INDEX C. ALTER TABLE D. DROP INDEX
答案:B
解析:CREATE INDEX 用于创建索引,CREATE TABLE 创建表,ALTER TABLE 修改表结构。
12. 私有 IP 地址范围不包括 ( )。
A. 10.0.0.0/8 B. 172.16.0.0/12 C. 192.168.0.0/16 D. 100.0.0.0/8
答案:D
解析:私有 IP 地址范围:10.0.0.0/8、172.16.0.0/12、192.168.0.0/16。100.0.0.0/8 是公有地址。
13. DNS 协议使用的端口号是 ( )。
A. 21 B. 22 C. 53 D. 80
答案:C
解析:DNS 协议使用 53 端口,FTP 使用 21 端口,SSH 使用 22 端口,HTTP 使用 80 端口。
14. 在软件生命周期模型中,V 模型强调 ( )。
A. 需求分析 B. 测试与开发并行 C. 快速迭代 D. 风险分析
答案:B
解析:V 模型强调测试与开发并行,每个开发阶段都有对应的测试阶段。
15. 某项目计划工期 6 个月,预算 60 万元。第 3 个月末,EV=25 万元,AC=30 万元,PV=30 万元。则 EAC 为 ( ) 万元。
A. 60 B. 72 C. 80 D. 90
答案:B
解析:CPI=AC/EV=30/25=1.2,EAC=BAC×CPI=60×1.2=72 万元。
16. 在软件测试中,桩模块用于 ( )。
A. 顶层测试 B. 底层测试 C. 集成测试 D. 系统测试
答案:B
解析:桩模块(Stub)用于底层测试,模拟被调用模块。驱动模块用于顶层测试。
17. 在软件架构评估中,CBAM 方法主要用于评估 ( )。
A. 性能 B. 成本效益 C. 安全性 D. 可靠性
答案:B
解析:CBAM(Cost Benefit Analysis Method)是成本效益分析方法,用于评估架构方案的经济效益。
18. 在架构模式中,不属于 MVC 变体的是 ( )。
A. MVP B. MVVM C. MVA D. PAC
答案:C
解析:MVC 变体包括 MVP、MVVM、PAC 等,MVA 不是标准的 MVC 变体。
19. 在软件架构风格中,编译器通常采用 ( ) 风格。
A. 管道 - 过滤器 B. 事件系统 C. 黑板系统 D. 规则系统
答案:A
解析:编译器通常采用管道 - 过滤器风格,词法分析、语法分析、语义分析、代码生成等阶段依次处理。
20. 在微内核架构中,内核只包含 ( )。
A. 所有系统服务 B. 最基本的功能 C. 用户应用 D. 驱动程序
答案:B
解析:微内核架构中,内核只包含最基本的功能(如进程调度、内存管理),其他服务作为用户态进程运行。
21. 在 UML 序列图中,生命线表示 ( )。
A. 对象存在的时间 B. 消息传递 C. 激活状态 D. 对象关系
答案:A
解析:UML 序列图中,生命线表示对象存在的时间,垂直虚线表示。
22. 某系统由 3 个部件组成,2 个并联后再与第 3 个串联。各部件可靠性均为 0.9,则系统可靠性为 ( )。
A. 0.729 B. 0.891 C. 0.900 D. 0.990
答案:B
解析:2 个并联可靠性=1-(1-0.9)²=0.99,再与第 3 个串联:0.99×0.9=0.891。
23. 在公钥基础设施中,CRL 是指 ( )。
A. 证书颁发机构 B. 证书吊销列表 C. 证书注册机构 D. 证书验证
答案:B
解析:CRL(Certificate Revocation List)是证书吊销列表,包含被吊销的证书序列号。
24. 下列攻击中,属于跨站脚本攻击的是 ( )。
A. SQL 注入 B. XSS C. CSRF D. DDoS
答案:B
解析:XSS(Cross-Site Scripting)是跨站脚本攻击,SQL 注入是数据库攻击,CSRF 是跨站请求伪造。
25. 某系统可用性为 99.9%,则年停机时间约为 ( ) 小时。
A. 8.76 B. 87.6 C. 876 D. 8760
答案:A
解析:99.9% 可用性,年停机时间=365×24×(1-0.999)=8760×0.001=8.76 小时。
26. 在缓存更新策略中,Write-Through 是指 ( )。
A. 写回 B. 写穿 C. 写一次 D. 写多次
答案:B
解析:Write-Through(写穿)是缓存更新策略,数据同时写入缓存和主存。Write-Back 是写回。
27. 根据 Little 定律,系统中平均请求数 L = ( )。
A. λW B. λ/W C. W/λ D. λ+W
答案:A
解析:Little 定律:L=λW,L 是系统中平均请求数,λ是到达率,W 是平均等待时间。
28. 在云原生架构中,不属于其特征的是 ( )。
A. 容器化 B. 微服务 C. 单体架构 D. 持续交付
答案:C
解析:云原生架构特征包括容器化、微服务、持续交付、DevOps 等,单体架构不是云原生特征。
29. 在容器网络中,Overlay 网络的特点是 ( )。
A. 物理网络 B. 虚拟网络 C. 本地网络 D. 广域网络
答案:B
解析:Overlay 网络是虚拟网络,构建在物理网络之上,如 VXLAN、GRE 等。
30. 在分布式系统中,脑裂问题是指 ( )。
A. 数据分裂 B. 集群分裂 C. 网络分裂 D. 服务分裂
答案:B
解析:脑裂(Split-Brain)是集群分裂问题,网络故障导致集群分成多个独立部分,各自认为自己是主节点。
31. 在 Spark 中,RDD 的特点是 ( )。
A. 可修改 B. 不可变 C. 可删除 D. 可追加
答案:B
解析:RDD(弹性分布式数据集)是 Spark 的核心抽象,特点是不可变、可分区、可并行计算。
32. 在 Flink 中,窗口操作的作用是 ( )。
A. 数据过滤 B. 数据分组 C. 数据聚合 D. 数据排序
答案:C
解析:Flink 中窗口操作用于将数据流分成有限大小的桶进行聚合计算。
33. 在微服务架构中,服务降级的目的是 ( )。
A. 提高性能 B. 保证核心功能 C. 减少成本 D. 简化架构
答案:B
解析:服务降级是在系统压力大时,关闭非核心功能,保证核心功能可用。
34. 在服务网格中,流量管理不包括 ( )。
A. 路由 B. 负载均衡 C. 数据存储 D. 故障注入
答案:C
解析:服务网格中流量管理包括路由、负载均衡、故障注入、限流等,不包括数据存储。
35. 在物联网中,CoAP 协议基于 ( )。
A. TCP B. UDP C. HTTP D. MQTT
答案:B
解析:CoAP(Constrained Application Protocol)是基于 UDP 的物联网协议,适合资源受限设备。
36. 在 5G 网络中,eMBB 场景的特点是 ( )。
A. 低延迟 B. 高带宽 C. 大连接 D. 低功耗
答案:B
解析:5G 三大场景:eMBB(增强移动宽带,高带宽)、uRLLC(低时延高可靠)、mMTC(大连接)。
37. 在 GPU 架构中,CUDA 是 ( ) 公司的技术。
A. AMD B. NVIDIA C. Intel D. ARM
答案:B
解析:CUDA 是 NVIDIA 公司的 GPU 并行计算平台,AMD 有 ROCm 平台。
38. 采用纠删码技术,若有 6 个数据块和 3 个校验块,则存储效率为 ( )。
A. 33.3% B. 50% C. 66.7% D. 75%
答案:C
解析:纠删码存储效率=数据块数/总块数=6/(6+3)=6/9≈66.7%。
39. 在 SDN 架构中,控制平面与数据平面 ( )。
A. 耦合 B. 分离 C. 相同 D. 无关
答案:B
解析:SDN(软件定义网络)的核心是控制平面与数据平面分离,集中控制。
40. 在 NewSQL 数据库中,特点是 ( )。
A. 只支持 SQL B. 只支持 NoSQL C. 支持 SQL 和分布式 D. 不支持事务
答案:C
解析:NewSQL 数据库支持 SQL 和分布式特性,同时具备 NoSQL 的扩展性和传统数据库的 ACID 特性。
41. 在需求工程中,需求跟踪矩阵用于 ( )。
A. 需求收集 B. 需求分析 C. 需求跟踪 D. 需求验证
答案:C
解析:需求跟踪矩阵用于需求跟踪,建立需求与设计、测试用例之间的映射关系。
42. 在架构原则中,高内聚低耦合是指 ( )。
A. 模块内部联系紧密,模块间联系松散
B. 模块内部联系松散,模块间联系紧密
C. 模块内部和模块间都紧密
D. 模块内部和模块间都松散
答案:A
解析:高内聚低耦合是软件设计原则,模块内部联系紧密,模块间联系松散。
43. 在架构模式中,分层架构的缺点是 ( )。
A. 结构清晰 B. 易于维护 C. 性能损耗 D. 易于测试
答案:C
解析:分层架构的缺点是性能损耗,请求需要逐层传递。优点是结构清晰、易于维护。
44. 在事件驱动架构中,事件的特点不包括 ( )。
A. 不可变 B. 有时间戳 C. 可修改 D. 有意义
答案:C
解析:事件的特点是不可变、有时间戳、有意义,事件发生后不能修改。
45. 在 CQRS 模式中,命令和查询 ( )。
A. 使用同一模型 B. 使用不同模型 C. 命令即查询 D. 查询即命令
答案:B
解析:CQRS(命令查询职责分离)模式中,命令和查询使用不同的模型,分别优化。
46. 在性能测试中,基准测试的目的是 ( )。
A. 测试极限性能 B. 建立性能基准 C. 测试稳定性 D. 测试并发
答案:B
解析:基准测试的目的是建立性能基准,作为后续性能比较的参考。
47. 在数据库优化中,不属于索引优化的是 ( )。
A. 创建索引 B. 删除索引 C. 优化查询 D. 选择索引类型
答案:C
解析:优化查询属于 SQL 优化,不属于索引优化。索引优化包括创建、删除、选择索引类型。
48. 在数据分区中,水平分区是指 ( )。
A. 按列分区 B. 按行分区 C. 按表分区 D. 按库分区
答案:B
解析:水平分区是按行分区,将表的数据按行分成多个分区。垂直分区是按列分区。
49. 在图数据库中,Neo4j 使用的查询语言是 ( )。
A. SQL B. Cypher C. Gremlin D. SPARQL
答案:B
解析:Neo4j 使用 Cypher 查询语言,Gremlin 是 Apache TinkerPop 的图遍历语言。
50. 在搜索引擎中,Elasticsearch 的核心是 ( )。
A. 倒排索引 B. 正排索引 C. B+ 树 D. 哈希表
答案:A
解析:Elasticsearch 的核心是倒排索引,用于快速全文搜索。
51. 在 Kubernetes 中,StatefulSet 用于 ( )。
A. 无状态应用 B. 有状态应用 C. 批处理 D. 定时任务
答案:B
解析:Kubernetes 中,StatefulSet 用于管理有状态应用,Deployment 用于无状态应用。
52. 在容器安全中,不属于安全措施的是 ( )。
A. 镜像扫描 B. 权限控制 C. 网络隔离 D. 明文存储
答案:D
解析:明文存储不是安全措施,容器安全措施包括镜像扫描、权限控制、网络隔离、加密存储等。
53. 在 API 版本管理中,不属于版本控制方式的是 ( )。
A. URL 版本 B. 请求头版本 C. 参数版本 D. 数据库版本
答案:D
解析:API 版本控制方式包括 URL 版本、请求头版本、参数版本,数据库版本不是 API 版本控制方式。
54. 在分布式缓存中,Redis Cluster 使用 ( ) 进行数据分片。
A. 一致性哈希 B. 哈希槽 C. 随机分配 D. 轮询分配
答案:B
解析:Redis Cluster 使用哈希槽(16384 个槽)进行数据分片,键通过 CRC16 计算槽号。
55. 在消息队列中,死信队列用于处理 ( )。
A. 正常消息 B. 失败消息 C. 延迟消息 D. 优先消息
答案:B
解析:死信队列用于处理失败消息,当消息多次消费失败后转入死信队列。
56. 在安全架构中,零信任模型的核心是 ( )。
A. 信任内部 B. 不信任任何 C. 信任外部 D. 部分信任
答案:B
解析:零信任模型的核心是不信任任何(包括内部网络),每次访问都需要验证。
57. 在加密技术中,同态加密的特点是 ( )。
A. 加密后无法计算
B. 加密后可直接计算
C. 加密后需解密计算
D. 加密后数据变小
答案:B
解析:同态加密的特点是加密后可直接计算,计算结果解密后与明文计算结果相同。
58. 在访问控制中,RBAC 是指 ( )。
A. 基于角色的访问控制
B. 基于规则的访问控制
C. 基于属性的访问控制
D. 基于身份的访问控制
答案:A
解析:RBAC(Role-Based Access Control)是基于角色的访问控制,ABAC 是基于属性的访问控制。
59. 在可观测性中,三大支柱不包括 ( )。
A. 日志 B. 指标 C. 链路 D. 告警
答案:D
解析:可观测性三大支柱是日志(Logging)、指标(Metrics)、链路追踪(Tracing),告警不是支柱。
60. 在混沌工程中,目的是 ( )。
A. 破坏系统 B. 测试系统韧性 C. 增加故障 D. 减少监控
答案:B
解析:混沌工程的目的是测试系统韧性,通过主动注入故障来验证系统的容错能力。
61. 在 Serverless 架构中,冷启动是指 ( )。
A. 函数首次执行 B. 函数持续执行 C. 函数错误执行 D. 函数停止执行
答案:A
解析:Serverless 中冷启动是指函数首次执行或长时间未执行后的启动,会有延迟。
62. 在多云策略中,不属于其优势的是 ( )。
A. 避免供应商锁定 B. 提高可用性 C. 优化成本 D. 简化管理
答案:D
解析:多云策略优势包括避免供应商锁定、提高可用性、优化成本,但会增加管理复杂度。
63. 在混合云架构中,特点是 ( )。
A. 只有公有云 B. 只有私有云 C. 公有云 + 私有云 D. 只有本地
答案:C
解析:混合云是公有云 + 私有云的组合,结合两者的优势。
64. 在区块链中,PoW 共识机制的特点是 ( )。
A. 能耗低 B. 能耗高 C. 速度快 D. 中心化
答案:B
解析:PoW(工作量证明)共识机制能耗高,如比特币挖矿。PoS 能耗较低。
65. 在机器学习中,特征工程的作用是 ( )。
A. 选择模型 B. 准备数据 C. 训练模型 D. 评估模型
答案:B
解析:特征工程的作用是准备数据,包括特征选择、特征提取、特征转换等。
66. 在深度学习中,反向传播的作用是 ( )。
A. 前向计算 B. 计算梯度 C. 初始化参数 D. 激活函数
答案:B
解析:反向传播的作用是计算梯度,从输出层向输入层传播误差,更新网络参数。
67. 在推荐系统中,协同过滤的核心是 ( )。
A. 用户行为 B. 物品属性 C. 相似度计算 D. 深度学习
答案:C
解析:协同过滤的核心是相似度计算,包括用户相似度和物品相似度。
68. 在数据治理中,数据质量不包括 ( )。
A. 准确性 B. 完整性 C. 一致性 D. 数据量
答案:D
解析:数据质量包括准确性、完整性、一致性、及时性等,数据量不是质量指标。
69. 在系统架构中,Sidecar 模式常用于 ( )。
A. 主应用逻辑 B. 辅助功能 C. 数据存储 D. 用户界面
答案:B
解析:Sidecar 模式常用于辅助功能,如日志收集、监控、代理等,与主应用一起部署。
70. 在领域驱动设计中,聚合的作用是 ( )。
A. 数据聚合 B. 业务一致性边界 C. 服务聚合 D. 接口聚合
答案:B
解析:在 DDD 中,聚合是业务一致性边界,聚合内的对象一起修改,保证一致性。
71. 在软件架构中,事件溯源的优点是 ( )。
A. 简单 B. 可追溯 C. 快速 D. 节省存储
答案:B
解析:事件溯源的优点是可追溯,可以重现历史状态。缺点是存储量大、复杂度高。
72. 在系统设计中,幂等性是指 ( )。
A. 多次执行结果相同 B. 多次执行结果不同 C. 只执行一次 D. 无法执行
答案:A
解析:幂等性是指多次执行结果相同,如 HTTP 的 GET、PUT、DELETE 方法是幂等的。
73. 在分布式事务中,最终一致性适用于 ( )。
A. 金融交易 B. 社交应用 C. 医疗系统 D. 航空系统
答案:B
解析:最终一致性适用于对实时性要求不高的场景,如社交应用。金融交易需要强一致性。
74. 在架构评估中,不属于定性方法的是 ( )。
A. 场景法 B. 问卷法 C. 检查表 D. 性能测试
答案:D
解析:性能测试是定量方法,场景法、问卷法、检查表是定性方法。
75. 在技术债务中,不包括的类型是 ( )。
A. 代码债务 B. 测试债务 C. 文档债务 D. 人员债务
答案:D
解析:技术债务包括代码债务、测试债务、文档债务、设计债务等,人员债务不是技术债务类型。
第二部分:案例分析(75 分)
案例一:系统架构设计(25 分)
阅读下列说明,回答问题 1 至问题 3。
说明:某知名在线教育平台成立于 2016 年,专注于 K12 和职业教育领域,目前已拥有注册学员超过 3000 万人,日均活跃用户 200 万。平台提供视频直播课程、录播回放、互动答疑、在线测试、作业批改、学习进度跟踪等核心功能。随着在线教育市场的快速增长和用户对学习体验要求的提高,平台面临严峻的技术挑战:高峰期(如开学季、考试前)并发用户数可达百万级,现有架构难以支撑;视频直播需要保证流畅播放和低延迟互动,当前卡顿率约 5%,延迟高达 3-5 秒;互动答疑需要实时响应,但消息延迟经常超过 1 秒;在线测试需要保证高并发下的数据一致性和准确性。为满足业务发展需求,平台决定进行架构升级,要求支持百万级并发用户同时在线,视频直播延迟控制在 1 秒以内,互动消息延迟不超过 200ms,系统可用性达到 99.99%,并具备弹性扩缩容能力以应对流量波动。
问题 1(8 分):请分析该系统的技术挑战有哪些?
参考答案:
该在线教育平台的技术挑战分析:
1. 高并发访问:
百万级并发用户同时在线
高峰期流量激增(如开学季、考试前)
需要水平扩展能力
2. 视频传输带宽:
视频直播占用大量带宽
需要 CDN 分发降低源站压力
带宽成本控制
3. 低延迟要求:
直播互动需要低延迟(<1 秒)
答疑互动需要实时响应
在线测试需要快速反馈
4. 系统可用性:
7×24 小时不间断服务
关键业务高可用(直播、支付)
故障快速恢复
5. 数据一致性:
6. 内容安全:
问题 2(9 分):请设计该系统的整体架构。
参考答案:
在线教育平台整体架构设计:
1. 接入层:
DNS 解析:智能 DNS,就近接入
CDN 加速:视频内容分发到边缘节点
负载均衡:LVS+Nginx 多层负载均衡
WAF:Web 应用防火墙,防攻击
2. 应用层(微服务架构):
用户服务:用户管理、认证授权
课程服务:课程管理、章节管理
直播服务:直播推流、拉流、录制
互动服务:实时聊天、答疑、弹幕
测试服务:在线考试、自动判分
支付服务:订单管理、支付对接
通知服务:短信、邮件、App 推送
3. 数据层:
缓存层:Redis 集群(热点数据、会话存储)
消息队列:Kafka(异步解耦、削峰填谷)
数据库:MySQL 读写分离 + 分库分表
对象存储:OSS(视频、图片存储)
搜索引擎:Elasticsearch(课程搜索)
4. 支撑平台:
5. 视频直播方案:
推流:OBS/移动端 SDK 推流到直播中心
转码:多码率转码,适配不同网络
分发:CDN 分发到边缘节点
播放:HLS/FLP/WebRTC 播放
问题 3(8 分):如何保证视频直播的低延迟?
参考答案:
保证视频直播低延迟的技术方案:
1. 使用 WebRTC 技术:
WebRTC 可实现亚秒级延迟(<500ms)
支持浏览器无需插件
适合互动直播场景
2. CDN 边缘节点:
视频内容缓存到离用户最近的边缘节点
减少网络传输距离
选择优质 CDN 服务商
3. 自适应码率(ABR):
根据用户网络状况动态调整码率
避免缓冲等待
HLS、DASH 支持自适应
4. 协议优化:
使用低延迟协议(如 RTMP、SRT)
UDP 传输优于 TCP
减少协议层数
5. 就近接入:
智能 DNS 解析到最近节点
运营商线路优化
多线 BGP 接入
6. 推流优化:
推流端就近推流到直播中心
多直播中心冗余
推流链路质量监控
7. 播放器优化:
案例二:数据架构设计(25 分)
阅读下列说明,回答问题 1 至问题 2。
说明:某大型零售集团成立于 2000 年,经过二十余年发展已形成涵盖商超、百货、电商、物流等多个业务板块的综合性企业,年营业额超过 500 亿元。集团旗下拥有 ERP、CRM、WMS、POS、电商平台等 20 余个业务系统,各系统独立建设导致数据孤岛问题严重:会员数据分散在多个系统中无法形成统一视图;销售数据口径不一致导致报表数据对不上;库存数据更新延迟影响供应链决策;数据分析依赖人工导出 Excel 处理,效率低下且容易出错。为提升数据驱动决策能力,集团决定构建统一数据平台,整合各业务系统数据,实现数据集中存储、统一管理和高效分析。平台需要支持日均 TB 级数据处理能力,数据更新延迟控制在分钟级,支持 200+ 并发分析查询,并提供自助式 BI 分析能力,让业务人员能够自主进行数据探索和报表制作。
问题 1(10 分):请设计该企业的数据架构。
参考答案:
企业统一数据平台架构设计:
1. 数据采集层:
2. 数据存储层:
3. 数据处理层:
批处理:Spark/MapReduce 处理离线数据
流处理:Flink/Spark Streaming 处理实时数据
数据开发:数据清洗、转换、聚合
任务调度:Airflow/DolphinScheduler
4. 数据服务层:
5. 数据应用层:
报表系统:经营分析报表
用户画像:用户标签、分群
推荐系统:个性化推荐
决策支持:数据驱动决策
6. 数据治理:
元数据管理:数据字典、血缘分析
数据质量:质量监控、问题告警
数据安全:权限控制、数据脱敏
数据标准:统一数据规范
问题 2(15 分):如何保证数据质量和数据安全?
参考答案:
数据质量保证方案:
1. 数据标准:
制定统一的数据规范和标准
定义数据格式、命名规范
建立数据标准管理体系
2. 数据校验:
采集时进行数据格式校验
业务规则校验(如金额不能为负)
完整性校验(必填字段检查)
一致性校验(跨表数据一致性)
3. 数据监控:
数据质量指标监控(准确率、完整率、及时率)
数据波动监控(日环比、周同比)
异常数据告警
4. 数据清洗:
去重处理
缺失值处理(填充、删除)
异常值处理
数据转换和标准化
5. 数据血缘:
数据安全保障方案:
1. 数据加密:
传输加密(HTTPS、TLS)
存储加密(磁盘加密、字段加密)
密钥管理(KMS)
2. 访问控制:
身份认证(LDAP、SSO)
权限管理(RBAC 模型)
细粒度权限控制(表级、行级、列级)
最小权限原则
3. 数据脱敏:
静态脱敏(开发测试环境)
动态脱敏(生产环境查询)
敏感数据识别(身份证、手机号、银行卡)
4. 审计日志:
记录所有数据访问操作
操作日志不可篡改
异常行为检测和告警
定期审计分析
5. 数据备份:
6. 合规要求:
符合 GDPR、网络安全法等法规
数据分类分级管理
隐私保护
案例三:软件需求工程(25 分)
阅读下列说明,回答问题 1 至问题 3。
说明:某智慧医疗平台 M 公司成立于 2016 年,专注于为医院提供信息化解决方案,已服务全国 200 余家三甲医院。随着医疗信息化建设的深入和政策的推动,M 公司计划开发新一代智慧医疗平台,整合挂号、问诊、检查、检验、处方、支付等全流程医疗服务。平台需要支持日均 100 万挂号量、50 万在线问诊、200 万处方流转,同时需要满足等保三级要求和医疗数据合规要求。在项目启动阶段,公司组建了需求分析团队,通过用户访谈、问卷调查、现场观察等方式收集需求。然而,需求分析过程中遇到了诸多挑战:医疗业务流程复杂,不同医院流程差异大;干系人众多且需求冲突,医生关注诊疗效率,患者关注就医体验,管理者关注运营效率;需求变更频繁,医疗政策调整导致需求不断变化;需求优先级难以确定,资源有限无法满足所有需求。为确保项目成功,公司决定采用科学的需求工程方法,建立需求获取、分析、规格说明和验证的完整流程。
问题 1(8 分):请说明需求获取的主要方法及其适用场景。
参考答案:需求获取的主要方法:
用户访谈:
与关键用户一对一交流
适用于深入了解特定用户需求
优点:信息深入、灵活
缺点:耗时、样本有限
问卷调查:
向大量用户发放问卷
适用于收集大量用户的共性需求
优点:覆盖面广、成本低
缺点:深度不足、回收率问题
现场观察:
到用户工作现场观察实际操作
适用于理解业务流程和使用场景
优点:真实、发现隐性需求
缺点:耗时、可能干扰用户
文档分析:
分析现有系统文档、业务规范
适用于理解现有系统和业务规则
优点:系统性强
缺点:文档可能过时
原型法:
快速构建原型让用户体验
适用于需求不明确或创新性需求
优点:直观、易反馈
缺点:开发成本
头脑风暴:
组织干系人集体讨论
适用于创新需求收集
优点:集思广益
缺点:需要引导
问题 2(9 分):请设计 M 公司智慧医疗平台的需求优先级评估方法。
参考答案:需求优先级评估方法设计:
MoSCoW 方法:
Must have(必须有):核心医疗功能、安全合规
Should have(应该有):重要但可延后的功能
Could have(可以有):锦上添花的功能
Won't have(本次不会有):明确排除的功能
价值 - 成本矩阵:
高价值低成本:优先实现
高价值高成本:评估后实现
低价值低成本:酌情实现
低价值高成本:避免实现
Kano 模型:
基本型需求:必须满足,不满足用户不满意
期望型需求:满足越多用户越满意
兴奋型需求:超出用户期望
无差异需求:用户不在乎
反向需求:满足反而用户不满意
干系人投票:
组织干系人对需求进行投票
按投票结果排序
考虑干系人权重
风险评估:
高优先级:高风险或高依赖的需求
中优先级:一般风险需求
低优先级:低风险需求
问题 3(8 分):请说明需求验证的主要内容和常用方法。
参考答案:需求验证的主要内容:
正确性:
完整性:
一致性:
可理解性:
可测试性:
可追溯性:
需求验证的常用方法:
需求评审:
原型验证:
测试用例评审:
需求跟踪矩阵:
第三部分:论文(75 分)
题目:论高并发系统架构设计与实践
要求:
简要叙述你参与过的高并发系统设计项目
详细说明高并发架构的核心技术和方案
论述负载均衡、缓存、异步处理的应用
总结项目经验教训
字数:2000-2500 字