大数据项目之电商数仓、数据仓库概念、项目需求及架构设计

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

1.数据仓库概念

  数据仓库( Data Warehouse ),是为企业制定决策,提供数据支持的。可以帮助企业,改进业务流程、提高产品质量等。
数据仓库的输入数据通常包括:业务数据、用户行为数据和爬虫数据
  业务数据:就是各行业在处理事务过程中产生的数据。比如用户在电商网站中登录、下单、支付等过程中,需要和网站后台数据库进行增删改查交互,产生的数据就是业务数据。业务数据通常存储在MySQL、Oracle等数据库中。
  用户行为数据:用户在使用产品过程中,通过埋点收集与客户端产品交互过程中产生的数据,并发往日志服务器进行保存。比如页面浏览、点击、停留、评论、点赞、收藏等。用户行为数据通常存储在日志文件中。
  爬虫数据:通常是通过技术手段获取其他公司网站的数据。不建议去做。

在这里插入图片描述
数据仓库,并不是数据的最终目的地,而是为数据最终的目的地做好准备。这些准备包括对数据的:备份、清洗、聚合、统计等。

2. 项目需求及架构设计

2.1 项目需求分析

2.1.1 采集平台

(1)用户行为数据采集平台搭建
(2)业务数据采集平台搭建

2.1.2 离线需求

在这里插入图片描述

2.1.3 实时需求

在这里插入图片描述

2.1.4 思考题

1、项目技术如何选型?
2、框架版本如何选型(Apache、CDH、HDP)
3、服务器使用物理机还是云主机?
4、如何确认集群规模?(假设每台服务器8T硬盘)

2.2 项目框架

2.2.1 技术选型

在这里插入图片描述

2.2.2 系统数据流程设计

在这里插入图片描述

2.2.3 框架版本选型

1)如何选择Apache/CDH/HDP版本?
(1)Apache:运维麻烦,组件间兼容性需要自己调研。(一般大厂使用,技术实力雄厚,有专业的运维人员) (建议使用)
(2)CDH:国内使用最多的版本,但CM不开源,今年开始收费,一个节点1万美金/年。
(3)HDP:开源,可以进行二次开发,但是没有CDH稳定,国内使用较少
2)云服务选择
(1)阿里云的EMR、MaxCompute、DataWorks
(2)亚马逊云EMR
(3)腾讯云EMR
(4)华为云EMR

2.2.3.1 Apache框架版本
框架新版本
Hadoop3.1.3
Zookeeper3.5.7
MySQL5.7.16
Hive3.1.2
Flume1.9.0
Kafka3.0.0
Spark3.0.0
DataX3.0.0
Superset1.3.2
DolphinScheduler2.0.3
Maxwell1.29.2
Flink1.13.0
Redis6.0.8
Hbase2.0.5
ClickHouse20.4.5.36-2

注意事项:框架选型尽量不要选择最新的框架,选择最新框架半年前左右的稳定版。

2.2.4 服务器选型

服务器选择物理机还是云主机?

2.2.4.1 物理机:

以128G内存,20核物理CPU,40线程,8THDD和2TSSD硬盘,戴尔品牌单台报价4W出头。一般物理机寿命5年左右。
需要有专业的运维人员,平均一个月1万。电费也是不少的开销。

2.2.4.2 云主机:

云主机:以阿里云为例,差不多相同配置,每年5W。
很多运维工作都由阿里云完成,运维相对较轻松

2.2.4.3 企业选择

金融有钱公司和阿里没有直接冲突的公司选择阿里云
中小公司、为了融资上市,选择阿里云,拉倒融资后买物理机。
有长期打算,资金比较足,选择物理机。

2.2.5 集群规模

1)如何确认集群规模?(假设:每台服务器8T磁盘,128G内存)

(1)每天日活跃用户100万,每人一天平均100条:100万*100条=1亿条
(2)每条日志1K左右,每天1亿条:100000000 / 1024 / 1024 = 约100G
(3)半年内不扩容服务器来算:100G*180天=约18T
(4)保存3副本:18T*3=54T
(5)预留20%~30%Buf=54T/0.7=77T
(6)算到这:约8T*10台服务器

2)如果考虑数仓分层?数据采用压缩?需要重新再计算

2.2.6 集群资源规划设计

在企业中通常会搭建一套生产集群和一套测试集群。生产集群运行生产任务,测试集群用于上线前代码编写和测试。

2.2.6.1 生产集群

(1)消耗内存的分开
(2)数据传输数据比较紧密的放在一起(Kafka 、Zookeeper)
(3)客户端尽量放在一到两台服务器上,方便外部访问
(4)有依赖关系的尽量放到同一台服务器(例如:Hive和mysql)

MasterMastercorecorecorecommoncommoncommon
nnnndndndnJournalNodeJournalNodeJournalNode
rmrmnmnmnm
zkzkzk
hivehivehivehivehive
kafkakafkakafka
sparksparksparksparkspark
dataxdataxdataxdataxdatax
Ds-masterDs-masterDs-workerDs-workerDs-worker
maxwell
supset
mysql
flumeflume
flinkflink
clickhouse
redis
hbase
2.2.6.2 测试集群服务器规划
服务名称子服务服务器hadoop102服务器hadoop103服务器hadoop104
HDFSNameNode
HDFSDataNode
HDFSSecondaryNameNode
YarnNodeManager
YarnResourcemanager
ZookeeperZookeeper Server
Flume(采集日志)Flume
KafkaKafka
Flume(消费Kafka日志)Flume
Flume(消费Kafka业务)Flume
Hive
MySQLMySQL
DataX
Spark
DolphinSchedulerApiApplicationServer
DolphinSchedulerAlertServer
DolphinSchedulerMasterServer
DolphinSchedulerWorkerServer
DolphinSchedulerLoggerServer
SupersetSuperset
Flink
ClickHouse
Redis
Hbase
服务数总计201112
商数项目总结 一、项目整体架构 二、数据说明 2.1 用户行为数据 1、启动日志数据 是一个单 json 数据 2、事件日志数据 组成:时间戳、公共字段、事件日志 事件: (1) 商品列表 (2) 商品点击 (3) 商品详情 (4) 广告 (5) 消息通知 (6) 用户后台活跃 (7) 评论 (8) 收藏 (9) 点赞 (10) 错误日志 2.2 业务数据 1、订单表 2、订单详情表 3、sku 商品表 4、... 阅读详情

相关推荐

数据仓库商数-- 3.1、商数库系统(ODS层、DIM层、DWD层)

目录一、数分层1.1 为什么要分层1.2 数据集市与数据仓库概念1.3 数命名规范1.3.1 表命名1.3.2 脚本命名1.3.3 表字段类型二、数理论2.1 范式理论2.1.1 范式概念2.1.2 函数依赖2.1.3 三范式区分2.2 关系建模与维度建模2.2.1 关系建模2.2.2 维度建模⭐️2.3 维度表和事实表⭐️2.3.1 维度表2.3.2 事实表2.4 维度模型分类2.5 数据仓库建模⭐️????2.5.1 ODS层2.5.2 DIM层和DWD层2.5.3 DWS层与DWT层2.5.4

FunnyPrince_的博客 1万+

电子商务网站需求分析文档

非常完整的电子商务网站需求分析文档,非常完整的数据库,ER图,包括类库

大数据项目商数一(用户行为采集)

是为企业所有决策制定过程,提供所有系统数据支持的战略集合。

2301_79478575的博客 1475

电子商务详细的需求分析文档

商 品 交 易 管 理 系 统 【摘要】本文简要介绍了本商品管理系统的开发情况,基本设计思想、系统开发环境及目前的应用情况。 关键词 订单 代理商 销售查询 备份 目 录: 第一章 引言 第二章 数据库应用系统开发简介 2.1 数据库 2.2 数据库管理系统 2.3 创建数据库 第三章 应用系统开发工具 3.1 DELPHI简介 3.2 DELPHI数据库访问方法与数据库组件介绍 第四章 商品销售管理系统目标分析 4.1 任务分析 4.2 系统目标 第五章 商品销售管理系统的数据库设计 5.1 常见应用程序数据表 5.2 DELPHI中的数据文件路径管理 第六章 试题库系统应用程序界面设计 6.1 用户登录窗体 6.2 主窗体 6.3 系统设置窗体 6.4 权限管理窗体 6.5 操作员信息设置窗体 6.6 代理商进/退货录入窗口 6.7 订单进货数据录入窗口 6.8 代理商销售数据查询窗口 6.9 商品分布查询窗口 第七章 结束语 致谢 主要参考文献 附录程序清单及注释 一 引 言 随着大学教学改革进一步的深入和大学本科课程建设的逐步完善,对学生掌握每一课程内容程度的考试必须规范化,系统化,科学化,现代化;教学管理必须现代化、规范化。我们知道,传统的出试卷方法是由教师个人组卷,这样往往造成试题难度和知识覆盖面难以把握,不能达到对学生的科学而又全面的考核。针对这一情况,我们研制了计算机类学科试题库与自动组卷系统。一方面,自动组卷系统避免了手工出试卷造成的试卷不规范,不易集中管理;另一方面,避免教师每次考试时手工组卷及平时为学生组织练习时的重复劳动,将教师从简单、重复的环节中解脱出来,以更多的精力投入到教学与科研中去。 高校教务管理工作中一项非常重要的工作就是考试管理工作,每学期各专业考试,从组织出卷到试卷的印制及试卷的管理等工作非常繁琐且工作量很大,这种组织管理方式不仅工作任务繁重而且试卷的标准化程度、难易程度、题量大小等各方面难以控制,难以形成有效的试题库,不利于充分发挥历年来的优秀试题及试卷的作用,给试题和试卷的管理带来很多问题和困难。鉴于这种情况,利用计算机进行试卷的自动生成并逐步积累形成有效的试题库,对试题和试卷的管理将变的高效而便捷,对提高工作效率,使试卷管理逐步走向正规化自动化将起到十分重要的作用。 在试题库的制作方面,通过自动组卷系统对每次考试的实现,可以不断地对试题库的内容进行完善。在每一次组卷时,可以进一步对每题的内容进行分析,发现细微的问题,对试题库的内容作进一步地修改。这样避免了传统出试卷时,考试一次结束一次的缺点。由于试题库的建设具有继承性,规范性,可以不断积累考试经验,丰富试题库的内容。 二 数据库应用系统开发简介 在数据库应用系统开发之前,对开发数据库的基本概念应当了解,对数据库的结构、开发数据库应用程序的步骤、开发体系及方法都应当有相当清晰的了解和认识。 数据库应用系统开发的目标是建立一个满足用户长期需求的产品。开发的主要过程为:理解用户的需求,然后,把它们转变为有效的数据库设计。把设计转变为实际的数据库,并且这些数据库带有功能完备、高效能的应用。 数据库技术在计算机软件邻域研究中一直是非常重要的主题,产生于60年代,30多年来数据库技术得到了迅速发展,并已形成较为完整的理论体系和一大批实用系统。并且,近年来,随着World Wide Web(WWW)的猛增及Internet技术的迅速发展,使得数据库技术之时成为最热门技术之一。 §2.1 数据库 数据库由DBMS(数据库管理系统)处理,DBMS则由开发人员和用户通过应用程序直接或间接地使用。它主要包括四个要素:用户数据、元数据、索引和应用元数据。 用户数据: 目前,大多数主流数据库管理系统把用户数据表示为关系。现在把关系看作数据表。表的列包含域或属性,表的行包含对应业务环境中的实体的记录。并非所有的关系都同样符合要求,有些关系比其它关系更结构化一些。 元数据: 数据库是自描述的,这就意味着它自身包含了它的结构的描述,这种结构的描述称作元数据。因为DBMS产品是用来存储和操纵表的,所以大多数产品把元数据以表的形式存储,有时称作系统表。这些系统表存储了数据库中表的情况,指出每一个表中有多少列,那一列是主关键字,每一列的数据类型的描述,它也存储索引、关键字、规则和数据库结构的其他部分。在表中存储元数据不仅对DBMS是有效的,对用户也是方便的,因为他们可以使用与查询用户数据同样的查询工具来查询元数据。本文介绍的SQL语言可以同时用于元数据和用户数据。

电子商务系统需求分析数据库设计)

电子商务系统需求分析数据库设计,。。。

基于商数据的用户行为分析之需求分析

商用户行为分析需求分析说明书 项目名称: 商用户行为分析 修订时间: 2021-05-28 修订版本: 1.0 一、引言 1.目的 通过编写需求分析文档,对基于商数据的用户行为分析系统进行介绍,使得文档的目标阅读人员能够对需求有一个清晰的认知。同时,方便开发人员为接下来的系统设计与实现打下基础。 本文档的预期读者是:需求分析人员、设计人员、开发人员、测试人员、目标用户。 2.项目信息 项目的名称:商用户行为分析 项目的提出者:小组成员 开发者:TOP10小组 用户:商用户分析人员 3.缩写说

wangwangnvzi的博客 4万+

小型商平台系统需求分析文档

随着子信息行业的不断发展,网络通信以及信息技术在人类生活中的普及,利用计算机技术、网络通信技术和Internet实现商务活动的国际化、信息化,已成为各国商务发展的一大趋势, 传统模式的购物已经逐渐被方便快捷的网络购物所取代,电子商务正是为了适应市场需求而蓬勃发展起来,网上购物也随之很快成为一种时尚的购物方式,并为广大网民所接受,随着近年来电子商务的不断发展,大大小小的网络商城都逐渐涌现出来,比较成功的案例有:苏宁易购、淘宝网、卓越网、当当网等,本文将以苏宁易购作为参考,进行小型电子商务网站的开发。 ...

花有重开日,人无再少年。 4万+

大数据商数分析项目

项目大数据商数分析项目项目目前具体分为两大部分,第一部分:模拟常规商数分析流程,利用hadoop相关生态mapreduce、spark等进行数据清洗,再通过hive、spark统计对用户行为日志及区域热门商品进行统计,支持数据导出及可视化,最终支持用户决策。第二部分:依据业务数据实现离线业务数导入及分层实现离线数搭建,统计相关业务指标,实时数部分后续更新。 .........

专注大数据与人工智能技术分享,欢迎私信加群互相学习! 1万+

尚硅谷大数据项目商数5.0】学习笔记

尚硅谷大数据项目商数5.0】学习笔记

yiluohan0307的专栏 3961

在线购物系统需求分析

在线购物系统需求分析 目录 1. 用户需求 2 1.1顾客 2 1.2 管理员 2 2 功能需求 3 2.1 面向用户的功能 3 2.1.1 登录 3 2.1.2 浏览商品 3 2.1.3 注册 3 2.1.4 更新个人信息 4 2.1.5 购物车管理 4 2.1.6 订单查询 4 2.1.7结账 4 2.2后台管理功能 4 2.2.1商品数据维护 5 2.2.2订单数据维护 5 2.2.3会员数据维护 6 2.2.4权限维护 6 2.2.5管理员数据维护 6 3.数据流图 7 3.1顶层数据流图 7 3.2 0层数据流图 7 3.3 1层数据流图 8 3.3.1登录系统 8 3.3.2注册系统 8 3.3.3商品浏览系统 8 3.3.4购买商品 8 3.3.5会员管理 9 3.3.6商品管理 9 3.3.7订单管理 10 3.3.8权限管理 10 3.3.9管理员管理 10 4.数据字典 11 4.1数据流 11 4.2数据项 13

大数据商数项目--实战(一)数据准备

Hive 引擎包括:默认MR ,tez ,sparkHive on Spark 既作为 存储 元数据 又负责 SQL的解析优化 语法是HQL语法Spark on Hive :Hive只作为存储元数据,Spark 负责SQL解析优化 语法是Spark SQL语法什么是拉链表:拉链表,记录每条信息的生命周期,一旦一条记录的生命周期结束,就重新开始一条新的记录,并把当前日期放入生效开始日期。

m0_73745224的博客 2185

大数据项目商数(用户行为数据仓库

第1章 数分层概念 1.1 为什么要分层 1.2 分层结构图 数据分层原理 1、ODS层(原始数据层) 原始数据层,存放原始数据,直接加载原始日志、数据,数据保持原貌不做处理。 2、DWD层(明细数据层) 结构和粒度与ODS层保持一致,对ODS层数据进行清洗(去除空值,脏数据,超过极限范围的数据),也有公司叫DWI。 3、DWS层(服务数据层) 以DWD为...

魔法革1996 4057

大数据商数项目

本文仅供参考学习,转发自https://blog.csdn.net/a1786742005/article/details/105833521 一、项目整体架构 二、数据说明 2.1 用户行为数据 1、启动日志数据 是一个单 json 数据 2、事件日志数据 组成:时间戳、公共字段、事件日志 事件: (1) 商品列表 (2) 商品点击 (3) 商品详情 (4) 广告 (5) 消息通知 (6) 用户后台活跃 (7) 评论 (8) 收藏 (9) 点赞 (10) 错误日志 2.2 业务数据 1、订

专注大数据与人工智能技术分享,欢迎私信加群互相学习! 4324

2 大数据商数项目——项目需求架构设计

2 大数据商数项目——项目需求架构设计 2.1 项目需求分析 用户行为数据采集平台搭建。 业务数据采集平台搭建。 数据仓库维度建模(核心):主要设计ODS、DWD、DWS、AWT、ADS等各个层的具体功能与实现方法。 分析设备、会员、商品、地区 、活动等商核心主题,统计的报表指标近100个。 采用即席查询工具,随时进行指标分析。 对集群性能进行监控,发生异常需要报警。 元数据管理:最常用的是hive元数据以及存于MySQL中的,能够帮助实现任务调度中的可视化实现。 数据质量监控:主要是监控数据的变

Flowers_的博客 2940

【亲测免费】 大数据项目商数-代码

大数据项目商数-代码 【下载地址】大数据项目商数-代码 欢迎来到“大数据项目商数”代码库。本库是专为那些对大数据处理、数据仓库建设以及商领域数据分析感兴趣的开发者准备的实践资源。项目聚焦于构建一个商行业的数据仓库,旨在通过实际的代码案例,展示如何在大数据环境下整合、清洗、存储及分析商数据,从而...

gitblog_09769的博客 801

大数据开发之商数(hadoop、flume、hive、hdfs、zookeeper、kafka)

1、数据需求:用户分析日志log、业务数据db2、采集需求:日志采集系统(flume)、业务数据同步系统(Maxwell,datax)3、数据仓库建模:维度建模4、数据分析:对设备、会员、商品、地区、活动等商核心主题进行统计,统计的报表指标接近100个。5、即席查询:用户在使用系统时,根据自己当时的需求定义的查询,通常使用即席查询工具。6、集群监控:对集群性能进行监控,发生异常及时报警。7、元数据管理:存储所有表对象的详细信息,通过元数据管理有助于开发人员理解管理数据。

key_honghao的博客 4060

大数据商数项目课程推荐

大数据商数项目课程推荐 去发现同类优质开源项目:https://gitcode.com/ 大数据商数项目课程:帮助互联网企业深入挖掘数据价值,优化业务流程。 项目介绍 在数字化浪潮席卷而来的今天,数据已经成为企业宝贵的资产。大数据商数项目课程正是为了帮助企业高效管理和分析海量数据而精心设计的一套课程。它专注于数据仓库的构建、管理和应用,旨在帮助企业实现数据驱动的决策过程。 项目技术分...

gitblog_06784的博客 1008

构建商数大数据项目实战代码解析

数据仓库(Data Warehouse,DW)是支持企业进行数据分析和决策的重要系统之一。商行业的数据仓库尤其关键,因为它能够整合和管理大规模的业务数据,为商企业提供有关客户、产品、交易和市场趋势的深入见解。这些见解对于提高运营效率、改善客户服务、增强市场竞争力以及开拓新的商业机会至关重要。在本章节中,我们深入了解了数据源的分类、特点和数据治理与质量管理的重要性。下一章,我们将探讨数据集成流程的重要性以及ETL/ELT技术和实际案例,敬请期待。

weixin_42097508的博客 1158

尚硅谷大数据项目商数6.0学习记录----数据仓库(上)

学习视频路径: 尚硅谷大数据项目商数6.0】企业数据仓库项目大数据实战_哔哩哔哩_bilibili上传hive到linux的/opt/software解压hive 重命名hive 添加环境变量 更新环境变量 进入/opt/module/hive/lib,解决日志Jar包冲突 Hive元数据配置到MySQL 将MySQL的JDBC驱动拷贝到Hive的lib目录下 新建hive-site.xml文件 启动hive 登录MySQL 新建hive元数据

weixin_64286561的博客 2663
上一篇: Hadoop中的Yarn的Tool接口案例、Yarn 案例实操(四)
下一篇: 大数据项目之电商数仓、用户行为日志
Redamancy_06
Redamancy_06 新星创作者: 大数据技术领域 新星创作者: 大数据技术领域
博客等级 码龄5年 4万+粉丝 241原创
评论 86
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Redamancy_06

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值