数据湖
-
协调服务之Zookeeper3.4.10详解大数据
一 Zookeeper概述 1.1 概述 Zookeeper是Google的Chubby一个开源的实现。它是一个针对大型分布式系统的可靠协调系统,提供的功能包括:配置维护、名字服务…
-
Hadoop集群群启脚本详解大数据
一 启动服务 zookeeper hadoop hbase 二 脚本 1 启动集群脚本start-cluster.sh #!/bin/bash echo “************…
-
CentOS7.5之Sqoop1.4.7的安装使用详解大数据
一 Sqoop简介 Apache Sqoop(TM)是一种旨在有效地在 Apache Hadoop 和诸如关系数据库等结构化数据存储之间传输大量数据的工具。 Sqoop 于 201…
-
大数据数据库之HBase1.2.6详解大数据
一 HBaes 介绍 1.1 HBase 的起源 HBase 的原型是 Google 的 BigTa…
-
Spark性能优化指南—基础篇详解大数据
前言 在大数据计算领域,Spark已经成为了越来越流行、越来越受欢迎的计算平台之一。Spark的功能涵盖了大数据领域的离线批处理、SQL类处理、流式/实时计算、机器学习、图计算等各…
-
Spark性能优化指南—高级篇详解大数据
前言 继基础篇讲解了每个Spark开发人员都必须熟知的开发调优与资源调优之后,本文作为《Spark性能优化指南》的高级篇,将深入分析数据倾斜调优与shuffle调优,以解决更加棘手…
-
Spark官方调优文档翻译详解大数据
Spark调优 由于大部分Spark计算都是在内存中完成的,所以Spark程序的瓶颈可能由集群中任意一种资源导致,如:CPU、网络带宽、或者内存等。最常见的情况是,数据能装进内存,…
-
Spark内存管理详解大数据
Spark 作为一个基于内存的分布式计算引擎,其内存管理模块在整个系统中扮演着非常重要的角色。理解 Spark 内存管理的基本原理,有助于更好地开发 Spark 应用程序和进行性能…
-
CentOS7.5之spark2.3.1安装详解大数据
一简介 1.1 Spark概述 Apache Spark是一个快速且通用的集群计算系统。它提供Java,Scala,Python和R中的高级API以及支持通用执行图的优化引擎。是U…
-
ELK6.2.4集群安装使用详解大数据
一 简介 Elasticsearch是一个高度可扩展的开源全文搜索和分析引擎。它允许您快速,近实时地存储,搜索和分析大量数据。它通常用作支持具有复杂搜索功能和需求的应用程序的底层引…