大数据架构理论与实践章节练习及答案

大数据架构理论与实践

章节练习及答案

第一节 传统数据处理系统存在的问题

1.在传统数据处理系统中,当用户访问量急剧增加时,最直接导致的问题是()。

  1. A.数据库服务器无法及时响应用户请求,出现超时错误
  2. B.数据存储空间不足,无法保存新增数据
  3. C.网络带宽占用过高,影响其他系统运行
  4. D.应用程序内存溢出,导致系统崩溃

解析:正确答案A

选项A正确,根据系统架构设计师知识体系,传统应用直接访问数据库系统,当用户访问量增加时,数据库无法支撑日益增长的用户请求负载,从而导致数据库服务器无法及时响应用户请求,出现超时错误,这是数据过载问题的典型症状。选项B描述的是存储容量问题,不是访问量增加直接导致的问题。选项C涉及网络层面,虽然可能受影响,但不是数据过载的直接表现。选项D描述的是应用层问题,而数据过载主要体现在数据库层面的响应能力不足。

2.在大数据利用过程中,将原始数据转换为可用于分析的标准化数据格式,去除重复、错误和不完整数据的阶段是()。

  1. A.采集
  2. B.清洗
  3. C.统计
  4. D.挖掘

解析:正确答案B

根据系统架构设计师知识体系,大数据利用过程包含采集、清洗、统计和挖掘四个阶段。选项A'采集是指从各种数据源收集原始数据的过程;选项B'清洗是指对采集到的原始数据进行预处理,包括去除重复数据、纠正错误数据、处理缺失值、标准化数据格式等操作,使数据变得可用于后续分析,这正是题目描述的功能;选项C'统计是指对清洗后的数据进行描述性分析和统计计算;选项D'挖掘是指运用算法和模型从数据中发现隐藏的模式和知识。因此正确答案是选项B。

3.在现代大数据处理技术中,()主要用于实现数据传输消息队列功能?

  1. A.Hadoop分布式文件系统
  2. B.Spark数据处理引擎解析:正确答案
  3. C.Kafka消息队列
  4. D.Map/Reduce计算框架

解析:正确答案C

选项A Hadoop分布式文件系统主要用于大数据的分布式存储,不是消息队列技术;选项B Spark数据处理引擎 是用于大数据计算处理的框架,提供内存计算能力;选项C Kafka消息队列是专门设计的分布式流处理平台,主要用于构建实时数据管道和流应用程序,实现数据传输消息队列功能,符合题意;选项D Map/Reduce是一种编程模型和计算框架,用于大数据的并行 处理计算。根据系统架构设计师知识体系,Kafka作为高吞吐量的分布式发布订阅消息系统,是现代大数据处理技术栈中专门负责数据传输消息队列的核心组件。

4.关于大数据的基本特点,以下描述最准确的是()。

  1. A.大数据主要关注数据间的因果关系分析,通过逻辑推理实现科学决策
  2. B.大数据具有体量大、时效性强、类型多样等特征,重在发掘数据间的相关性
  3. C.大数据处理主要依赖传统关系型数据库的ACID特性保证数据一致性
  4. D.大数据的核心价值在于数据存储容量的扩展和查询性能的优化

解析:正确答案B

选项A错误,大数据应用重在发掘数据间的相关性,而非传统逻辑上的因果关系;选项B正确,准确概括了大数据的三个核心特征(体量大、时效性强、类型多样)以及其核心应用理念(发掘相关性);选项C错误,大数据处理通常采用分布式计算架构如Hadoop、Spark等,而非依赖传统关系型数据库;选项D错误,大数据的核心价值在于发现新知识、洞悉规律并进行科学决策,而非仅仅是存储和查询优化。

5.关于大数据的特点,以下描述不正确的是()。

  1. A.大数据具有体量大、时效性强的特征
  2. B.大数据的类型单一,主要为结构化数据
  3. C.大数据的处理需要采用新式计算架构和智能算法
  4. D.大数据应用重在发掘数据间的相关性,而非传统逻辑上的因果关系

解析:正确答案B

A选项正确,大数据确实具有体量大、时效性强的特征。B选项错误,大数据并非类型单一,而是类型多样。C选项正确,处理大数据时需要采用新式计算架构和智能算法等新技术。D选项正确,大数据应用重在发掘数据间的相关性,而非传统逻辑上的因果关系。因此,正确答案是B。

6.某公司的电子商务平台面临用户访问量激增导致的数据库响应缓慢问题。以下哪种方法最适合解决该问题,同时保持数据一致性和系统可扩展性()。

  1. A.增加异步处理队列
  2. B.建立数据库水平分区
  3. C.引入读写分离技术
  4. D.实施分库分表技术

解析:正确答案C

A.增加异步处理队列主要用于处理数据修改请求,不能直接解决读取性能问题。B.建立数据库水平分区可以分散数据存储,但不能有效解决读写分离的问题。C.引入读写分离技术是最适合的解决方案。它通

过将读请求分发到从数据库,写请求由主数据库处理,可以有效提高系统的读取性能,同时保持数据一致性。D.分库分表技术虽然可以拆分单数据库压力,但实施复杂度高,不是首选方案。因此,引入读写分离技术是最适合解决该问题的方法,既能提高系统性能,又能保持数据一致性和系统可扩展性。

第二节  大数据处理系统架构分析

1.在Lambda架构的大数据平台中,()存储系统最适合用于存储批处理层的持续增长的批量离线数据?

  1. A.Redis
  2. B.HDFS
  3. C.OpenTSDB
  4. D.Tair

解析:正确答案B

选项A Redis是内存数据库,适合存储实时视图数据,不适合大规模批量数据的持久化存储。选项B HDFS是分布式文件系统,具有高容错性和可扩展性,专门设计用于存储大规模数据集,是批处理层存储持续增长批量离线数据的理想选择。选项C OpenTSDB是时序数据库,主要用于存储时间序列指标数据。选项D Tair是分布式缓存系统,主要用于实时计算场景的数据缓存,不适合大规模批量数据的长期存储。

2.在基于Kappa架构的实时日志分析平台中,Flink计算框架的主要作用是()。

  1. A.实时采集日志并推送给Katka缓存
  2. B.实时读取Kafka消息并进行清洗解析:正确答案
  3. C.将处理结果存储到ElasticSearch日志库
  4. D.提供HTTP接口对外服务

解析:正确答案B

选项A描述的是日志采集阶段的功能,通常由Filebeat等工具完成;选项B正确,Flink作为基于大数据计算集群的实时计算框架,其主要职责是实时读取Katka中的消息并进行数据清洗、解析:正确答案和转换处理;选项C描述的是数据存储阶段的功能;选项D描述的是服务层的功能。在Kappa架构的数据处理流程中,Flink承担着核心的实时数据处理任务。

3.在大数据处理系统架构设计中,关于系统应具备的关键属性,以下描述正确的是()。

  1. A.横向扩展是指通过增强单台机器的CPU和内存性能来提升系统处理能力
  2. B.即时查询要求系统必须预先定义所有可能的查询模式和数据访问路径
  3. C.低延迟特性主要通过减少数据存储量和限制并发访问数来实现
  4. D.系统应支持用户按照自己的需求进行灵活的数据查询和分析

解析:正确答案D

选项A错误,横向扩展是指通过增加机器数量来扩展系统能力,而非增强单台机器性能;选项B错误,即时查询的核心特点是支持用户临时性、灵活性的查询需求,无需预先定义查询模式;选项C错误,低延迟主要通过优化数据处理流程、缓存机制和并行处理等技术手段实现;选项D正确,即席查询正是指用户可以按照自己的要求进行灵活的数据查询,这是大数据处理系统的重要特征之一。

4.在大数据处理系统的属性和特征中,允许用户根据自己的需求进行灵活查询的特性是指()。

  1. A.鲁棒性
  2. B.低延迟
  3. C.横向扩展
  4. D.即席查询

解析:正确答案D

A.鲁棒性是指系统的稳定性和容错能力,不是指查询灵活性。B.低延迟是指系统响应速度快,也不涉及查询灵活性。C.横向扩展是指通过增加机器数量来提升系统性能,与查询方式无关。D.即席查询正是允

许用户按照自己的要求进行灵活查询的特性,符合题目描述。因此,正确答案是D.即席查询。这个特性使得用户能够根据自己的需求定制查询,而不局限于预定义的查询方式,增加了大数据处理系统的灵活性和实用性。

5.在大数据处理系统面临的挑战中,以下哪一项不属于主要挑战()。

  1. A.处理非结构化和半结构化数据
  2. B.探索大数据复杂性和不确定性特征描述的刻画方法
  3. C.研究数据异构性与决策异构性的关系对知识发现与管理决策的影响
  4. D.提高系统的计算速度和存储容量

解析:正确答案D

选项A、B、C都是教材中明确列出的大数据处理系统面临的主要挑战。选项D虽然也是大数据处理系统需要考虑的问题,但不属于教材中提到的主要挑战。正确答案是D,因为它不在教材列出的主要挑战中。选项A涉及处理非结构化和半结构化数据的挑战;选项B关于探索大数据复杂性和不确定性特征;选项C涉及数据异构性与决策异构性的关系研究。这些都是教材中明确提到的主要挑战。

6.关于数据仓库和数据湖的区别,以下说法正确的是()。

  1. A.数据仓库存储原始数据,数据湖存储经过ETL处理的数据
  2. B.数据仓库在数据存储前定义数据模式,数据湖在数据存储后定义数据模式
  3. C.数据仓库主要支持非结构化数据,数据湖主要支持结构化数据
  4. D.数据仓库通常使用NoSQL接口,数据湖使用标准SQL接口

解析:正确答案B

数据仓库和数据湖在数据处理和存储方面有显著区别。数据仓库通常在数据存储之前定义数据模式,进行ETL处理,而数据湖则在数据存储之后定义数据模式,存储原始数据。数据仓库主要处理结构化数据,而数据湖可以存储结构化、半结构化和非结构化数据。数据仓库通常使用标准SQL接口,而数据湖可能使用各种查询语言和分析工具。因此,选项B最准确地描述了数据仓库和数据湖的一个关键区别。

第三节  Lambda架构

1.在Lambda架构中,负责存储主数据集并周期性执行批处理生成批视图的是()。

  1. A.批处理层
  2. B.加速层
  3. C.服务层
  4. D.数据访问层

解析:正确答案A

批处理层是Lambda架构的核心组成部分,其主要职责是存储具有原始、不可变、真实特征的主数据集,并周期性地将增量数据转储至主数据集,在主数据集上执行批处理生成批视图,因此选项A正确。加速层主要处理增量实时数据生成实时视图,服务层负责响应用户请求并合并批视图和实时视图,数据访问层不是Lambda架构的标准组成部分,因此其他选项均不符合题意。

2.在Lambda架构中,服务层的核心功能是()。

  1. A.存储主数据集并执行批处理生成批视图
  2. B.处理增量实时数据并生成实时视图
  3. C.响应用户请求,合并批视图和实时视图的结果数据集
  4. D.提供数据备份和容灾恢复功能

解析:正确答案C

选项A描述的是批处理层的功能,负责存储主数据集并周期性执行批处理;选项B描述的是加速层的功能,专门处理实时数据流;选项C正确描述了服务层的核心功能,即接收用户请求,通过索引访问批视图,直接访问实时视图,然后合并两个视图的结果生成最终数据集响应用户;选项D不属于Lambda架构三层中任何一层的核心功能。服务层作为Lambda架构的最终输出层,其关键作用就是整合批处理和实时处理的结果为用户提供统一的数据服务。

3.在Lambda架构中,加速层的核心功能是()。

  1. A.存储主数据集并执行周期性批处理
  2. B.处理增量实时数据并生成实时视图
  3. C.响应用户请求并合并批视图和实时视图
  4. D.创建可查询的索引视图并提供数据访问接口

解析:正确答案B

选项A描述的是批处理层的功能,批处理层负责存储主数据集并周期性执行批处理生成批视图;选项B正确,加速层专门处理增量实时数据,生成实时视图,并支持快速即席查询功能;选项C描述的是服务层的功能,服务层负责响应用户请求,台并批视图和实时视图的结果;选项D描述的是服务层的具体实现方式,通过索引加速访问和创建可查询视图来提供服务。

4.在Lambda架构中,批处理层的主要职责是()。

  1. A.处理增量实时数据并生成实时视图
  2. B.存储具有原始、不可变、真实特征的主数据集并周期性执行批处理生成批视图
  3. C.响应用户请求并合并批视图和实时视图的结果数据集
  4. D.提供索引加速访问和直接访问实时视图的功能

解析:正确答案B

选项A描述的是加速层的功能,加速层负责处理增量实时数据生成实时视图;选项B正确描述了批处理层的核心职责,即存储主数据集(具有原始、不可变、真实特征)并周期性执行批处理生成批视图;选项C描述的是服务层的功能,服务层负责响应用户请求并合并两个视图的结果;选项D也是服务层的部分功能特征。根据Lambda架构的三层设计,批处理层专门负责主数据集的存储和批处理操作。

5.关于Lambda架构的优点,以下说法不正确的是()。

  1. A.容错性好
  2. B.查询灵活度高
  3. C.弹性伸缩
  4. D.部署成本低

解析:正确答案D

Lambda架构的优点包括容错性好、查询灵活度高、弹性伸缩和易于扩展。选项A、B、C都是Lambda架构的优点,符合知识点。选项D部署成本低是错误的,因为Lambda架构的缺点之一是重新部署和迁移成本高。因此,正确答案是D。

6.在Lambda架构中,哪一层负责处理增量实时数据并生成实时视图()。

  1. A.批处理层
  2. B.加速层
  3. C.服务层
  4. D.存储层

解析:正确答案B

A.批处理层负责存储主数据集并执行周期性批处理,生成批视图,不符合题目描述。B.加速层的核心功能是处理增量实时数据,生成实时视图,符合题目描述。C.服务层负责响应用户请求,合并批视图和实时

视图,不符合题目描述。D.存储层不是Lambda架构的三层结构之一,属于干扰项。因此,正确答案是B.加速层。

7.Lambda架构中负责实时数据处理的是()。

  1. A.加速层
  2. B.批处理层
  3. C.服务层
  4. D.展示层

解析:正确答案A

Lambda架构将数据处理分为批处理层、速度层与服务层;其中速度层(又称实时层或加速层)专责低延迟的实时数据处理,通过流式计算引擎对新到达的数据即时分析并更新视图。它与批处理层协同工作,确保系统同时具备高吞吐、强一致与低延迟能力;速度层通常基于Kafka+Flink或Kafka+Storm构建,以支撑窜秒级响应的实时决策场景。

8.Lambda架构在数据存储方面的特点是()。

  1. A.可变数据存储
  2. B.不可变数据存储
  3. C.全部数据存储
  4. D.部分数据存储

解析:正确答案B

Lambda架构分为三层:

·批处理层:负责对全部历史数据进行离线批量计算。其核心特征为数据不可变、逐次追加,计算结果具有高度准确性,但存在较大的时间延迟。

·速度层:负责对近期增量数据进行实时处理。其核心特征为低延迟、高吞吐,能够在数据到达后即时产出近似结果。由于仅覆盖部分数据,其输出存在一定偏差,需依赖批处理层的结果进行修正。

·服务层:服务层不参与数据计算,仅负责合并批处理层与速度层的输出结果,并对外提供统一的查询接口。用户所获取的最终结果,即为批处理层的精确值与速度层的实时值之和。

第四节  Kappa架构架构分析

1.关于Kappa架构的特点,以下描述正确的是()。

  1. A.通过批处理层和实时层的双重保障提高了数据处理的可靠性
  2. B.将离线和实时处理代码进行了统一,方便维护
  3. C.采用多层架构设计有效避免了消息中间件的性能瓶颈
  4. D.通过保留批处理层确保了离线计算的高可靠性

解析:正确答案B

选项A错误,Kappa架构删除了批处理层,只保留实时层,不存双重保障;选项B正确,这是Kappa架构的主要优点,通过统一离线和实时处理代码简化了系统维护;选项C错误,Kappa架构仍然依赖消息中间件,存在性能瓶颈问题;选项D错误,Kappa架构的缺点之一就是抛弃了离线计算的可靠性。

2.在Kappa架构的实时层中,用于逐条处理输入数据生成实时视图的典型技术组合是()。

  1. A.Apache Kafka+Flink或Spark Streaming
  2. B.Apache Storm+Redis
  3. C.Apache Pulsar+Hadoop MapReduce
  4. D.RabbitMQ+Apache Beam

解析:正确答案A

选项A正确,根据Kappa架构设计原理,实时层采用Apache Kafka作为消息队列回访数据,然后 使用Flink或Spark Streaming等流式处理引擎逐条处理输入数据生成实时视图,这是标准的技 术组合。选项B中Redis主要用于缓存而非流式处理引擎。选项C中Hadoop MapReduce属于批处理技术,不符合实时流式处理的要求。选项D中Apache Beam虽然支持流处理,但RabbitMQ+Apache Beam的组合不是Kappa架构实时层的典型实现方式。

3.Kappa架构相比Lambda架构的主要改进是()。

  1. A.删除了BatchLayer,将数据通道以消息队列进行替代
  2. B.增加了缓存层,提高了数据访问速度
  3. C.采用了分布式存储,增强了数据可靠性
  4. D.引入了机器学习算法,提升了数据处理智能化水平

解析:正确答案A

选项A正确,Kappa架构的核心改进就是删除了Lambda架构中的BatchLayer(批处理层),将数据通道以消息队列进行替代,简化了架构复杂度。选项B错误,Kappa架构并非通过增加缓存层来改进,而是通过统一流处理来优化。选项C错误,分布式存储不是Kappa架构相比Lambda架构的主要改进点。选项D错误,引入机器学习算法不是Kappa架构的核心改进,其主要改进在于架构层面的简化和统一。

4.在Kappa架构的实时数据处理中,以下哪个步骤通常不属于其主要流程()。

  1. A.数据采集
  2. B.数据清洗解析:
  3. C.数据存储
  4. D.批量处理

解析:正确答案:D

A.数据采集:正确,是Kappa架构的第一步,用于实时收集数据。B.数据清洗解析:正确答案:正确,是Kappa架构中的重要步骤,用于处理和转换原始数据。C.数据存储:正确,是Kappa架构的组成部分,用于保存处

理后的数据。D.批量处理:错误,Kappa架构专注于实时流处理,不包含批量处理步骤。Kappa架构主要包括数据采集、清洗解析:正确答案、存储和监控等步骤,其核心是实时处理流数据。批量处理通常是Lambda架构的特征,而不是Kappa架构的主要组成部分。因此,正确答案是D。

5.关于Kappa架构的优缺点,以下说法正确的是()。

  1. A.优点是消息中间件性能高,缺点是离线和实时处理代码难以统一
  2. B.优点是将离线和实时处理代码统一,缺点是消息中间件有性能瓶颈
  3. C.优点是数据关联时处理开销小,缺点是抛弃了实时计算的可靠性
  4. D.优点是保留了离线计算的可靠性,缺点是维护成本高

解析:正确答案 B

A.错误。Kappa架构的优点是将离线和实时处理代码统一,而不是消息中间件性能高。B.正确。根据教材原文,Kappa架构的优点是将离线和实时处理代码进行了统一,方便维护;缺点之一是消息中间件有性

能瓶颈。C.错误。Kappa架构的缺点之一是数据关联时处理开销大,而不是小。另外,Kappa架构抛弃的是离线计算的可靠性,而不是实计算的可靠性。D.误。Kappa架构抛弃了离线计算的可靠性,而不是保留了离线计算的可靠性。

6.Kappa架构主要由哪两层组成()。

  1. A.批处理层和服务层
  2. B.实时层和服务层
  3. C.批处理层和实时层
  4. D.存储层和查询层

解析:正确答案B

Kappa架构是Lambda架构的优化版本,删除了BatchLayer(批处理层)。根据教材原文,Kappa架构主要由实时层和服务层两部分组成。实时层负责处理输入数据并生成实时视图,服务层则使用实时视图中的结果数据集响应用户请求。选项A中的批处理层在Kappa架构中已被移除。选项C错误地包含了批处理层。选项D中 的存储层和查询层不是Kappa架构的标准术语。因此,正确答案是选项B:实时层和服务层。

第五节  Lambda架构与Kappa架构的对比和设计选择

1.关于Lambda架构与Kappa架构的特性对比,以下说法正确的是()。

  1. A.Lambda架构的复杂度低于Kappa架构
  2. B.Kappa架构的历史数据处理能力强于Lambda架构
  3. C.Lambda架构的计算开销小于Kappa架构
  4. D.Kappa架构维护一套系统,开发维护成本较低

解析:正确答案D

A.错误。Lambda架构维护两套系统(引擎),复杂度高于Kappa架构。B.错误。Lambda架构通过批式全量处理,历史数据处理能力强于Kappa架构。C.错误。Lambda架构需要周期性批处理计算和持续实时

计算,计算开销大于Kappa架构。D.正确。Kappa架构维护一套系统(引擎),复杂度低,开发维护成本较低。因此,正确答案是D。Kappa架构维护一套系统,开发维护成本较低,这符合系统架构设计师知识体系中对Kappa架构特性的描述。

第六节  大数据架构设计案例分析

1.在Lambda架构的大数据平台中,离线计算部分主要负责处理批量数据。关于离线计算部分的技术选型和数据流向,下列描述正确的是()。

  1. A.使用Spark和Map/Reduce进行批处理,结果存储在HDFS中,并通过Impala或Hive建立数据仓库
  2. B.使用Spark Streaming进行实时处理,结果存储在Redis中,并通过HBase建立数据仓库
  3. C.使用Flink进行流处理,结果存储在Elasticsearch中,并通过Katka建立数据仓库
  4. D.使用Storm进行批处理,结果存储在MongoDB中,并通过Cassandra建立数据仓库

解析:正确答案A

选项A正确,Lambda架构的离线计算部分专门处理批量数据,使用Spark和Map/Reduce等批处理框架进行数据处理,处理结果存储在HDFS分布式文件系统中,然后通过Impala或Hive等工具建立数据仓库进行查询分析。选项B错误,Spark Streaming是实时处理技术,属于Lambda架构的实时计算部分,不是离线计算部分的技术选型。选项C错误,Flink主要用于流处理,ElasticSearch主要用于搜索和日志分析,这些技术组合更适合实时处理场景。选项D错误,Storm是流处理框架,MongoDB和Cassandra是NoSQL数据库,这种组合不符合Lambda架构离线计算部分的典型技术栈。

2.关于Kappa架构的特点,下列描述正确的是()。

  1. A.采用批处理和流处理两套独立的数据处理引擎解析:正确答案
  2. B.使用统一的数据处理引擎进行实时流数据处理
  3. C.必须同时维护批视图和实时视图两套数据存储
  4. D.只能处理离线批量数据,无法处理实时数据

解析:正确答案B

选项A描述的是Lambda架构的特点,Lambda架构需要维护批处理和流处理两套不同的处理引擎;选项B正确,Kappa架构的核心特点就是使用统一的数据处理引擎(如Flink)来处理所有数据,简化了架构复杂度;选项C描述的也是Lambda架构的特征,需要同时维护批视图和实时视图;选项D完全错误,Kappa架构专门用于实时流数据处理。从教材案例可以看出,证券公司和电商平台都基于Kappa架构使用Flink作为统一处理引擎实时处理流数据。

3.在Lambda架构的大数据处理平台中,数据计算层通常包含()三个主要部分。

  1. A.离线计算、实时计算、合并计算
  2. B.数据采集、数据清洗、数据存储
  3. C.批处理层、加速层、服务层
  4. D.数据输入、数据处理、数据输出

解析:正确答案A

选项A正确,Lambda架构的数据计算层确实包含离线计算、实时计算、合并计算三个部分,其中离线计算处理批 量历史数据,实时计算处理增量流数据,合并计算将两者结果整合。选项B描述的是数据处理的通用流程步骤,不是Lambda架构数据计算层的特定组成。选项C描述的是Lambda架构的整体分层结构,而非专指数据计算层的内部组成。选项D过于宽泛,是任何数据处理系统的基本流程,不符合Lambda架构数据计算层的具体划分。

4.在Lambda架构中,负责处理实时增量数据并提供低延迟查询响应的是()。

  1. A.批处理层(Batch layer)
  2. B.加速层(Speed layer)
  3. C.服务层(Serving layer)
  4. D.存储层(Storage layer)

解析:正确答案B

加速层(Speed layer)是Lambda架构的核心组件之一,专门负责处理实时增量数据,通过流处理技术(如Spark Streaming、Flink等)提供低延迟的实时计算能力,将处理结果更新到实时视图中。批处理层主要处理历史批量数据,提供高吞吐量但延迟较高的处理能力。服务层负责合并批视图和实时视图的结果,对外提供统一的查询接口。存储层不是Lambda架构标准三层结构的组成部分。

5.在Lambda架构的大数据平台中,实时计算部分采用Spark Streaming处理实时增量数据的主要目的是()。

  1. A.将处理结果更新到实时视图
  2. B.将处理结果写入HDFS存储
  3. C.对历史批量数据进行周期性处理
  4. D.合并批视图和实时视图生成最终数据集

解析:正确答案A

选项A正确,在Lambda架构中,实时计算部分采用Spark Streaming专门处理实时增量数据,其主要目的就是将处理后的结果更新到实时视图中,以提供近实 时的数据查询能力。选项B错误,将结果写入HDFS是批处理层的职责,用于存储批处理结果。选项C错误,对历史批量数据进行周期性处理是离线计算部分使用Spark和MapReduce的功能。选项D错误,合并批视图和实时视图生成最终数据集是合并计算部分的职责,通常将结果写入HBase等数据库中响应用户查询。

6.在Lambda架构中,哪个部分负责处理实时增量数据并更新实时视图()。

  1. A.离线计算部分
  2. B.实时计算部分
  3. C.合并计算部分
  4. D.批处理部分

解析:正确答案B

Lambda架构包含三个主要部分:离线计算、实时计算和合并计算。其中,实时计算部分专门用于处理实时增量数据,并将处理后的结果更新到实时视图。选项A(离线计算部分)负责处理批量离线数据,不符合题目要求。选项C(合并计算部分)负责合并批视图和实时视图的结果,也不符合题目描述。选项D(批处理部分)不是Lambda架构的标准组成部分,属于干扰项。因此,正确答案是选项B(实时计算部分)。

  1. 试题五(共25分)

请详细阅读有关Web架构设计方面的叙述,在答题纸上回答问题1至问题3。

【说明】阅读以下关于Web应用设计开发的描述,在答题纸上回答问题1至问题3.

【说明】某电商公司拟开发一个可以支持亿级流量的系统。公司架构师张工认为应该采用B/S技术立现系统开发,王工认为采用当前主流的效服务架构可以更好的支持高并发的场暴应用。公司经过讨论分析最终采用了王工的建议。其系统的架构如下图所示的设计。

【问题1】(12分)

分析该系统架构,从下列选项中选择对应的选项填入(1)-(6)中。

A.LVS B.HTTP/HTTPS C.DUBB解析:正确答案D.Quartz E.MongDB F.ES Client

参考答案:

(1)A;(2)B;(3)C;(4)D;(5)F;(6)E。

8.试题五(25分)

阅读以下关于Web系统架构设计的叙述,在答题纸上回答问题1~3。

【说明】

某公司自主研发的网络教学平台因业务扩展,导致系统访问量不断增大,现有系统访问速度蝶慢,有时甚至出现系统故障庭疾等现象,面对这情况,公司召开项目组讨论会议,寻求该商务平台的改进方室。讨论会上,王工提出可以利用筑像站点、CDN内容分发等方式解决并发访问量带来的问题,而李工认为,仅仅依靠上述外网加速技术不能完全解决系统现有问题,如果访问星持续增加,系统仍存在肺法的可能。李工提出应同时结合 webp内网加速技术优化系统改进方案,如综合应用负载均衡、经存服务器、WweD应用服务器分布式文件系统、分布式数据库等。经过讨论,公司最终决定采用李工的思路,完成改进系统的设计方案。

【问题1】(10分)

针对李工提出的改进方案,从a~j中分别选出各技术的相关描述和对应常见支持软件填入表5-1中的(1)~(10)处。

表5-1 技术描述与常见支持软件

a)保存静态文件,减少网络交换量,加速响应请求

b)可采用软件级和硬件级负载均衡实现分流和后台减压

c)文件存储系统,快速查找文件

d)FastDFS

e)HAProxy

f)JBoss

g)Hadoop Distributed File System(HDFS)

h)Apache Tomact

)Squid

j)MongoDB

参考答案:

(1)(b)(2)(e)(3)(a)(4)(i)(5)(c)(6)(d)(7)(9)(8)(f)(9)(h)(10)(j)

(6)和(7)、((8)和(9)的答案可互换。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

奋进学堂

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值