数据分析 | 第67页

前言在大数据计算领域，Spark已经成为了越来越流行、越来越受欢迎的计算平台之一。Spark的功能涵盖了大数据领域的离线批处理、SQL类处理、流式/实时计算、机器学习、图计算等各…

大数据 2021年7月19日

0

前言继基础篇讲解了每个Spark开发人员都必须熟知的开发调优与资源调优之后，本文作为《Spark性能优化指南》的高级篇，将深入分析数据倾斜调优与shuffle调优，以解决更加棘手…

大数据 2021年7月19日

0

Spark调优由于大部分Spark计算都是在内存中完成的，所以Spark程序的瓶颈可能由集群中任意一种资源导致，如：CPU、网络带宽、或者内存等。最常见的情况是，数据能装进内存，…

大数据 2021年7月19日

0

Spark 作为一个基于内存的分布式计算引擎，其内存管理模块在整个系统中扮演着非常重要的角色。理解 Spark 内存管理的基本原理，有助于更好地开发 Spark 应用程序和进行性能…

大数据 2021年7月19日

0

一简介 1.1 Spark概述 Apache Spark是一个快速且通用的集群计算系统。它提供Java，Scala，Python和R中的高级API以及支持通用执行图的优化引擎。是U…

大数据 2021年7月19日

0

一简介 Elasticsearch是一个高度可扩展的开源全文搜索和分析引擎。它允许您快速，近实时地存储，搜索和分析大量数据。它通常用作支持具有复杂搜索功能和需求的应用程序的底层引…

大数据 2021年7月19日

0

一 Kafka概述 1.1 Kafka是什么在流式计算中，Kafka一般用来缓存数据，Storm通过消费Kafka的数据进行计算。 1）Apache Kafka是一个开源消息系统…

大数据 2021年7月19日

0

7.7 日志清洗案例 7.7.1 简单解析版 1）需求：去除日志中字段长度小于等于11的日志。 2）输入数据 194.237.142.21 – – [18/Sep/2013:06…

大数据 2021年7月19日

0

7.10 压缩/解压缩案例 7.10.1 对数据流的压缩和解压缩 CompressionCodec有两个方法可以用于轻松地压缩或解压缩数据。要想对正在被写入一个输出流的数据进行压缩…

大数据 2021年7月19日

0

7.9 找博客共同好友案例 1）需求：以下是博客的好友列表数据，冒号前是一个用户，冒号后是该用户的所有好友（数据中的好友关系是单向的） A:B,C,D,F,E,O B…

大数据 2021年7月19日

0