会议介绍
重庆 Cloudera 授权大数据培训基地Cloudera 数据分析师培训班开班通知
为发展大数据行业和提高各企事业单位员工的技术,现定于6月13---16日在重庆渝北区仙桃数据谷进行Cloudera 数据分析师培训,届时将邀请您到现场进行大数据行业的学习和交流。
课程简介
Cloudera 大学提供的为期四天的数据分析培训课程专注于Apache Pig、 Hive 和Cloudera Impala,将教会您如何将传统的数据分析和商业智能技术应 用到大数据领域。Cloudera 为数据专业人员提供了基于SQL 和其它熟悉的脚 本编程语言的工具,用来访问、操作、转换和分析复杂数据集。
证书介绍
CCA数据分析师
CCA数据分析师需具备在基于Cloudera CDH部署的大数据平台上使用Hive和Impala 进行分析并产生报告的技能。结束本课程培训后,我们建议学员准备并注册参加Cloudera CCA 数据分析师认证考试。通过并获得该证书是向公司及客户证明个人在Hadoop数据分析领域的技术和专长的有力依据。
培训地点
重庆渝北区仙桃数据谷(数据谷东路19号)
时间 | 课程安排 |
6月13日08:00 | 签到 |
6月13日08:30-11:30 | Hadoop 基础知识 · Hadoop 动机 · Hadoop 概览 · 数据存储:HDFS · 分布式数据处理:YARN、MapReduce和Spark · 数据处理与分析:Pig、Hive 和Impala · 数据集成:Sqoop · 其它的Hadoop 数据工具 · 练习分析场景说明 Pig 简介 · Pig 是什么? · Pig 的特点 · Pig 使用案例 · 与Pig 的交互 |
6月13日13:00-17:30 | Pig 基本数据分析 · PigLatin 语法 · 加载数据 · 简单数据类型 · 字段定义 · 数据输出 · 架构查看 · 数据筛选和排序 · 常用函数 使用Pig 处理复杂的数据 · 数据存储格式 · 复合/ 嵌套数据类型 · 数据分组 · 复杂数据内置函数 · 遍历分组数据 |
6月14日08:30-11:30 | Pig 多数据集操作 · 数据集合并技术 · 在Pig 中联接数据集 · 集合运算 · 拆分数据集 Pig 故障诊断和性能优化 · Pig 故障排除 · 日志 · 使用Hadoop 的Web UI · 数据采样及调试 · 性能概述 · 了解执行计划 · 提高Pig 作业性能的技巧 |
6月14日13:00-17:30 | Hive 和Impala 简介 · 什么是Hive ? · 什么是Impala ? · 为什么使用Hive 和Impala · 架构和数据存储 · Hive 及Impala 与传统数据库的比较 · Hive 使用案例 使用Hive 和Impala 进行数据查询 · 数据库和表 · 基本的Hive 和Impala 查询语言语法 · 数据类型 · 使用Hue 来执行查询 · 使用Beeline(Hive Shell) · 使用Impala Shell |
6月15日08:30-11:30 | Hive 及Impala 数据管理 · 数据存储 · 创建数据库和表 · 加载数据 · 修改数据库和表 · 使用视图简化查询 · 存储查询结果 数据存储和性能 · 对表进行分区 · 分区表的数据加载 · 何时使用分区 · 文件格式的选取 · 使用Avro 及Parquet 文件格式 |
6月15日13:00-17:30 | 使用Hive 和 Impala 进行关系数据分析 · 连接数据集 · 常见的内置函数 · 聚合和窗口函数 复杂数据类型 · 在Hive 里使用复杂数据 · 在Impala 里使用复杂数据 |
6月16日08:30-11:30 | 使用Hive 及Impala 分析文本数据 · 在Hive 及Impala 里使用正则表达式 · 在Hive 里通过SerDe 加载处理文本 · 情感分析及n-gram Hive 优化 · 了解查询性能 · Bucketing(分桶) · 索引数据 · Hive on Spark Impala 优化 · Impala 如何执行查询 · 改善Impala 性能 |
6月16日13:00-17:30 | 扩展Hive 及Impala · 使用SerDe 加载特殊格式文件 · 通过定制脚本来转换数据 · 用户自定义函数 · 参数化查询 选择最佳工具 · 比较Pig、Hive、Impala 和关系数据库 · 该选择哪一个? |
课程大纲:Cloudera 数据分析师培训
Hadoop 基础知识
· Hadoop 动机
· Hadoop 概览
· 数据存储:HDFS
· 分布式数据处理:YARN、MapReduce 和Spark
· 数据处理与分析:Pig、Hive 和Impala
· 数据集成:Sqoop
· 其它的Hadoop 数据工具
· 练习分析场景说明
Pig 简介
· Pig 是什么?
· Pig 的特点
· Pig 使用案例
· 与Pig 的交互
Pig 基本数据分析
· PigLatin 语法
· 加载数据
· 简单数据类型
· 字段定义
· 数据输出
· 架构查看
· 数据筛选和排序
· 常用函数
使用Pig 处理复杂的数据
· 数据存储格式
· 复合/ 嵌套数据类型
· 数据分组
· 复杂数据内置函数
· 遍历分组数据
Pig 多数据集操作
· 数据集合并技术
· 在Pig中联接数据集
· 集合运算
· 拆分数据集
Pig 故障诊断和性能优化
· Pig 故障排除
· 日志
· 使用Hadoop 的Web UI
· 数据采样及调试
· 性能概述
· 了解执行计划
· 提高Pig 作业性能的技巧
Hive 和Impala 简介
· 什么是Hive ?
· 什么是Impala ?
· 为什么使用Hive和Impala
· 架构和数据存储
· Hive及Impala 与传统数据库的比较
· Hive 使用案例
使用Hive 和Impala 进行数据查询
· 数据库和表
· 基本的Hive 和Impala 查询语言语法
· 数据类型
· 使用Hue 来执行查询
· 使用Beeline(Hive Shell)
· 使用Impala Shell
Hive及Impala数据管理
· 数据存储
· 创建数据库和表
· 加载数据
· 修改数据库和表
· 使用视图简化查询
· 存储查询结果
数据存储和性能
· 对表进行分区
· 分区表的数据加载
· 何时使用分区
· 文件格式的选取
· 使用Avro及Parquet文件格式
使用Hive 和 Impala 进行关系数据分析
· 连接数据集
· 常见的内置函数
· 聚合和窗口函数
复杂数据类型
· 在Hive里使用复杂数据
· 在Impala里使用复杂数据
使用Hive及Impala分析文本数据
· 在Hive及Impala里使用正则表达式
· 在Hive里通过SerDe加载处理文本
· 情感分析及n-gram
Hive 优化
· 了解查询性能
· Bucketing(分桶)
· 索引数据
· Hive on Spark
Impala优化
· Impala如何执行查询
· 改善Impala性能
扩展Hive及Impala
· 使用SerDe加载特殊格式文件
· 通过定制脚本来转换数据
· 用户自定义函数
· 参数化查询
选择最佳工具
· 比较Pig、Hive、Impala 和关系数据库
· 该选择哪一个?
总结
讲师介绍
韩涛 大数据架构师&大数据运维高级讲师
精通hadoop平台设计、运维,熟悉yarn、hdfs/HA、mapreducev1/v2、flume、sqoop、pig、impala、hive、zookeeper、等相关组件,擅长集群搭建和维护管理。参与众多项目的大数据平台设计、开发和实施。设计和搭建过大量项目的数据整合解决方案和架构。参与过众多大型数据仓库、ODS、数据交换平台及数据治理项目,具有丰富的hadoop/data warehouse/Oracle DB/ETL的开发和部署的经验,帮助解决过很多项目中的棘手问题。对于信息全生命周期的管理具有深入的研究和丰富的实践经验。技术领域:Hadoop, DW, Oracle DB, Informatica等。具有多年关系数据库系统管理和支持经验,具有多年hadoop集群规划、建设、维护经验,具有多年丰富的教学经验。
教授课程
1.Cloudera Administrator Training for Apache Hadoop
2.Cloudera Data Analyst Training: Using Pig, Hive, and Impala
3.Cloudera Developer Training for Spark and Hadoop
【会议门票】课程培训班学费:12000元(含:课程费 9200 元,认证考试费 2800 元)
课程费含培训费、教材费、午餐(数据谷)、实验费、交通费、住宿费自理(推荐数据谷窝趣单间、双人间)


