闯闯桑
码龄5年
求更新 关注
提问 私信
  • 博客:56,682
    56,682
    总访问量
  • 58
    原创
  • 267
    粉丝
  • 71
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:广东省
加入CSDN时间: 2021-10-23
博客简介:

m0_63322122的博客

查看详细资料
个人成就
  • 获得657次点赞
  • 内容获得3次评论
  • 获得542次收藏
  • 博客总排名536,735名
  • 原力等级
    原力等级
    3
    原力分
    332
    本月获得
    0
创作历程
  • 57篇
    2025年
  • 1篇
    2022年
成就勋章
TA的专栏
  • Spark
    1篇

TA关注的专栏 4

TA关注的收藏夹 0

TA关注的社区 4

TA参与的活动 0

创作活动更多

芯创视界・嵌入式视频创作征集大赛

嵌入式工程的价值,藏在每一次硬件调试、代码迭代与项目落地之中。 让我们因热爱相聚,用镜头与一众开发者互通心得、彼此启发,记录下探索的每一步,分享思路与经验。 让更多人看见嵌入式开发的魅力,也让每一次创作成为推动技术传播与社区成长的力量。 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/0d445ffce72b42f997aaf1b030a652aa.png#pic_center)

196人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 资源
  • 代码仓
  • 问答
  • 帖子
更多
  • 最近

  • 文章

  • 专栏

  • 资源

  • 代码仓

  • 问答

  • 帖子

  • 社区

  • 视频

  • 课程

  • 关注/订阅/互动

  • 收藏

搜索 取消

Spark mapreduce 的一个用法

/ 处理系统日志,每个会话只保留最后一条日志.values数据去重:去除重复记录,保留最新版本状态聚合:合并多个状态更新,获取最终状态日志处理:处理重复日志条目这种模式在大数据处理中非常常见且实用。
原创
博文更新于 2025.09.07 ·
289 阅读 ·
9 点赞 ·
0 评论 ·
1 收藏

toDF(columns: _*) 语法

是一种方便的 Scala 语法,用于:将存储在序列中的列名展开为单独的参数重命名 DataFrame 的所有列使代码更加灵活和可维护,特别是在列名需要动态确定或重用时这种语法不仅限于 Spark,它在任何接受可变参数(varargs)的 Scala 方法中都适用。
原创
博文更新于 2025.09.06 ·
489 阅读 ·
5 点赞 ·
0 评论 ·
6 收藏

Spark 中spark.implicits._ 中的 toDF和DataFrame 类本身的 toDF 方法

特性中的toDFDataFrame类的toDF方法本质隐式转换(为Seq"添加"方法)类的实例方法作用对象本地集合(SeqList等)已存在的DataFrame对象主要用途创建DataFrame重命名DataFrame的列是否需要是否返回值一个新的DataFrame一个列名被修改的新DataFrame等效代码。
原创
博文更新于 2025.09.06 ·
740 阅读 ·
8 点赞 ·
0 评论 ·
9 收藏

Spark mapGroups 函数详解与多种用法示例

/ 收集所有数据// 排序// 计算统计量} else {// 创建自定义摘要summary|summary |
原创
博文更新于 2025.08.30 ·
379 阅读 ·
4 点赞 ·
0 评论 ·
4 收藏

var maxScore = Int.MinValue 详解

是一种常见的编程模式,用于初始化一个变量以便在后续的比较中找到最大值。它确保第一个比较的元素一定会更新这个变量的值,是寻找最大值算法中的标准做法。
原创
博文更新于 2025.08.30 ·
373 阅读 ·
3 点赞 ·
0 评论 ·
9 收藏

spark.sparkContext.broadcast() 与 org.apache.spark.sql.functions.broadcast 的区别

用于在分布式计算中分发数据到集群节点:用于给Spark SQL优化器提供性能优化提示简单来说:第一个是"真的"广播数据第二个是"建议"Spark使用广播join理解这个区别对于编写高效的Spark应用程序非常重要,因为它们解决的是完全不同的问题。
原创
博文更新于 2025.08.30 ·
420 阅读 ·
3 点赞 ·
0 评论 ·
9 收藏

Scala中 元组(Tuple)和数组(Array)的区别

当你需要存储相同类型的元素集合,并且可能需要修改时,使用数组当你需要将几个不同类型的值组合在一起作为一个整体传递时,使用元组。
原创
博文更新于 2025.08.30 ·
298 阅读 ·
7 点赞 ·
0 评论 ·
4 收藏

Pandas 中的 Period 对象

在 Pandas 中,Period对象用于表示(如某个月、某个季度),而不是时间点(后者用Timestamp它是处理时间序列数据的重要工具,尤其适合需要按固定周期(如月度、季度)分析的场景。
原创
博文更新于 2025.06.18 ·
651 阅读 ·
3 点赞 ·
0 评论 ·
3 收藏

Pyspark中的int

范围(±21亿),PySpark 会自动升级为。PySpark 主要使用 IntegerType。)与 Python 或 Pandas 中的。:固定 32 位,类似 C/Java 的。(64位)表示整数,对应 SQL 中的。如果处理 ID、时间戳或不确定范围,用。在 PySpark 中,可以通过。之间,PySpark 会使用。如果数据范围明确且较小,优先用。(32位)和 LongType。如果超出范围,会自动转为。有所不同,因为它基于。:在 64 位系统上是。
原创
博文更新于 2025.06.18 ·
578 阅读 ·
4 点赞 ·
0 评论 ·
5 收藏

PySpark数据透视表操作指南

在 PySpark 中,可以使用pivot()方法实现类似 Excel 数据透视表的功能。
原创
博文更新于 2025.04.28 ·
500 阅读 ·
5 点赞 ·
0 评论 ·
3 收藏

Spark 从HDFS读取时,通常按文件块(block)数量决定初始partition数,这是怎么实现的?

通过这一机制,Spark 天然适配 HDFS 的分布式存储特性,实现。例如:一个 1GB 的文件(128MB/block)会生成。(如 128MB/256MB)决定了文件的物理存储分布。读取 HDFS 数据时,会使用 Hadoop 的。每个 HDFS 文件块(block)默认生成一个。的分片(split)策略实现的。是用户指定的最小分区数(默认不指定时等于。(假设文件未被压缩且未手动指定分区数)。(如 BZip2)仍按 block 切分。(如 GZIP),整个文件会被视为。,会调用 Hadoop 的。
原创
博文更新于 2025.03.27 ·
941 阅读 ·
9 点赞 ·
0 评论 ·
11 收藏

Airflow 的上下文对象Context

【代码】Airflow 的上下文对象Context。
原创
博文更新于 2025.03.24 ·
1062 阅读 ·
20 点赞 ·
0 评论 ·
14 收藏

Spark 优化作业性能以及处理数据倾斜问题

通过自定义分区器(Partitioner),将数据均匀分布到各个分区。
原创
博文更新于 2025.03.17 ·
891 阅读 ·
5 点赞 ·
0 评论 ·
7 收藏

Spark 中的Shuffle过程

Shuffle是Spark中一个非常重要的概念,但它也是一个昂贵的操作。以下是对Shuffle过程的详细解释以及它为什么昂贵的原因。Shuffle是Spark中重新分配数据的过程,通常发生在需要对数据进行重新分组或聚合的操作中,例如:在这些操作中,数据需要根据某个键(Key)重新分布到不同的节点上,以便进行后续的计算。Shuffle过程可以分为两个阶段:Map阶段(Shuffle Write):每个Task(Mapper)会将其输出的数据根据Key进行分区(Partition)。数据会被写入本地磁盘(Shu
原创
博文更新于 2025.03.17 ·
1069 阅读 ·
10 点赞 ·
0 评论 ·
11 收藏

Airflow 中Operator

【代码】Airflow 中Operator。
原创
博文更新于 2025.03.17 ·
933 阅读 ·
12 点赞 ·
0 评论 ·
6 收藏

Spark 中的窗口函数

窗口函数通过Window分区(Partitioning):将数据分为多个组(类似于GROUP BY排序(Ordering):在每个分区内对数据进行排序。窗口范围(Frame):定义窗口的大小(如当前行及其前后若干行)。.partitionBy("column1", "column2") // 按列分区.orderBy("column3") // 按列排序.rowsBetween(start, end) // 定义窗口范围(可选):指定分区的列。orderBy:指定排序的列。:定义窗口的范围(如。
原创
博文更新于 2025.03.15 ·
1711 阅读 ·
40 点赞 ·
0 评论 ·
11 收藏

Spark 中agg的用法

【代码】Spark 中agg的用法。
原创
博文更新于 2025.03.15 ·
1332 阅读 ·
14 点赞 ·
0 评论 ·
4 收藏

Spark 报错解析_value show is not a member of org.apache.spark.sql.RelationalGroupedDataset groupedDF

【代码】Spark 报错解析_value show is not a member of org.apache.spark.sql.RelationalGroupedDataset groupedDF。
原创
博文更新于 2025.03.15 ·
498 阅读 ·
9 点赞 ·
0 评论 ·
3 收藏

Spark 中explode用法

【代码】Spark 中explode用法。
原创
博文更新于 2025.03.15 ·
1384 阅读 ·
7 点赞 ·
0 评论 ·
8 收藏

Spark 中创建 DataFrame 的2种方式对比

适合简单场景,自动推断模式。:适合复杂场景,显式定义模式。根据数据结构和需求选择合适的方式即可!如果还有其他问题,欢迎继续提问。
原创
博文更新于 2025.03.15 ·
1066 阅读 ·
26 点赞 ·
0 评论 ·
16 收藏
加载更多