Дата курса
21.04.2025 - 25.04.2025 02.06.2025 - 06.06.2025
25.08.2025 - 29.08.2025
22.09.2025 - 26.09.2025
20.10.2025 - 24.10.2025
17.11.2025 - 21.11.2025
22.12.2025 - 26.12.2025
Тренинг предназначен для системных администраторов Hadoop, которые хотят получить знания по продуктам экосистемы Hadoop и продвинутые навыки по установке, конфигурированию, обслуживанию, восстановлению и управлению кластером Hadoop с использованием дистрибутива Arenadata Hadoop и системы управления Arenadata Cluster Manager
Программа
Введение в экосистему Hadoop
- История возникновения Hadoop:
- Понятия BigData, Data Lake. История проекта.
- Основные компоненты и экосистема.
- Основные проекты Hadoop:
- HDFS, MR, YARN, Hive, Tez, HBase, Phoenix, Solr, Spark, Zookeeper. Описание и основные компоненты.
- Дистрибутивы Hadoop:
- Проект ODPi. Arenadata Hadoop. Проект Ambari. ADCM.
- Архитектура кластера Hadoop:
- HDFS. YARN. Отказоустойчивость
Подготовка окружения к установке Hadoop
Планирование кластера:
- Типы узлов. Профили нагрузки. Аппаратное обеспечение. Примеры кластеров.
- Настройка параметров окружения:
- Подготовка к установке. Настройка сети и DNS. Лабораторная работа.
- Монтирование и настройка файловой системы:
- Лабораторная работа
Введение в Arenadata Cluster Manager
- Основные понятия и компоненты
- Развертывание системы управления:
- Лабораторная работа.
- Подготовка и настройка инфраструктуры с использованием бандла:
- Лабораторная работа.
- Планирование и первичная конфигурация кластера Hadoop
- Установка и настройка мониторинга:
- Лабораторная работа.
- Установка кластера Hadoop:
- Лабораторная работа.
- Мониторинг. Работа с метриками в Grafana.
- Подходы к конфигурированию сервисов экосистемы Hadoop.
Основные конфигурационные файлы и описание:
- HDFS+YARN (hdfs-site, yarn-site, hadoop-env).
- Hive+Tez (hive-site, tez-site, hive-env).
- HBase (hbase-site, hbase-env).
- Spark (spark-env).
- Zookeeper (zoo.cfg).
- Работа с логами сервисов, поиск и выявление проблем работы с сервисами.
- Интерпретация статусов тестов, сервисов в системе управления ADCM.
Обзор возможностей ADCM:
- Аутентификация. RBAC.
- Configuration groups.
- API.
- Логирование аудита.
- Удаление кластера
Пост-настройка кластера Hadoop: HDFS, YARN
- Файловая система HDFS
- Основные операции в HDFS:
- Работа с файлами и каталогами. Balancer.
- Распределенное копирование. HttpFS.
- Лабораторные работы.
- Обслуживание и дианостика HDFS:
- DataNodes, NameNodes, HA. HDFS UI. Лабораторная работа.
- Политики хранения и размещения в HDFS:
- Политики хранения. Tiering. Erasure Coding. Rack Awareness.
- Лабораторные работы
- Компрессия и форматы файлов
- Парадигма Map Reduce:
- Лабораторная работа (опционально).
- Архитектура YARN, HA-режим. Работа с YARN UI.
- Scheduler YARN:
- Лабораторная работа
Проверка работоспособности кластера
- ZooKeeper. Основные понятия и операции. Работа с Zookeeper CLI.
- HBase. Основные понятия и примеры операций. Установка и конфигурирование (GC, Memstore, Compression, Load balancing, Flush). High Availability. Работа с утилитами HBase (check, repair).
- Phoenix. Основные операции с данными. Примеры запросов Hive. Основные понятия и примеры операций. Установка и конфигурирование. High Availability HiveServer.
- Работа с утилитами Hive (schema-tool). Работа с Tez UI.
- Оптимизация запросов Hive:
- Лабораторная работа
- Spark. Основные понятия и операции.
- Установка и конфигурирование. Работа со Spark UI. Примеры кода.
- Работа с Livy сервером (REST API)
- Zeppelin. Основные интерпретаторы и примеры кода