Курсы BI


Эксплуатация Arenadata Hadoop


Эксплуатация Arenadata Hadoop
Дата курса
21.04.2025 - 25.04.2025
02.06.2025 - 06.06.2025
25.08.2025 - 29.08.2025
22.09.2025 - 26.09.2025
20.10.2025 - 24.10.2025
17.11.2025 - 21.11.2025
22.12.2025 - 26.12.2025

Тренинг предназначен для системных администраторов Hadoop, которые хотят получить знания по продуктам экосистемы Hadoop и продвинутые навыки по установке, конфигурированию, обслуживанию, восстановлению и управлению кластером Hadoop с использованием дистрибутива Arenadata Hadoop и системы управления Arenadata Cluster Manager

Программа

Введение в экосистему Hadoop
  • История возникновения Hadoop:
  • Понятия BigData, Data Lake. История проекта.
  • Основные компоненты и экосистема.
  • Основные проекты Hadoop:
    • HDFS, MR, YARN, Hive, Tez, HBase, Phoenix, Solr, Spark, Zookeeper. Описание и основные компоненты.
  • Дистрибутивы Hadoop:
    • Проект ODPi. Arenadata Hadoop. Проект Ambari. ADCM.
  • Архитектура кластера Hadoop:
    • HDFS. YARN. Отказоустойчивость

Подготовка окружения к установке Hadoop

Планирование кластера:

  • Типы узлов. Профили нагрузки. Аппаратное обеспечение. Примеры кластеров.
  • Настройка параметров окружения:
  • Подготовка к установке. Настройка сети и DNS. Лабораторная работа.
  • Монтирование и настройка файловой системы:
  • Лабораторная работа
Введение в Arenadata Cluster Manager
  • Основные понятия и компоненты
  • Развертывание системы управления:
  • Лабораторная работа.
  • Подготовка и настройка инфраструктуры с использованием бандла:
  • Лабораторная работа.
  • Планирование и первичная конфигурация кластера Hadoop
  • Установка и настройка мониторинга:
  • Лабораторная работа.
  • Установка кластера Hadoop:
  • Лабораторная работа.
  • Мониторинг. Работа с метриками в Grafana.
  • Подходы к конфигурированию сервисов экосистемы Hadoop.
Основные конфигурационные файлы и описание:
  • HDFS+YARN (hdfs-site, yarn-site, hadoop-env).
  • Hive+Tez (hive-site, tez-site, hive-env).
  • HBase (hbase-site, hbase-env).
  • Spark (spark-env).
  • Zookeeper (zoo.cfg).
  • Работа с логами сервисов, поиск и выявление проблем работы с сервисами.
  • Интерпретация статусов тестов, сервисов в системе управления ADCM.
Обзор возможностей ADCM:
  • Аутентификация. RBAC.
  • Configuration groups.
  • API.
  • Логирование аудита.
  • Удаление кластера
Пост-настройка кластера Hadoop: HDFS, YARN
  • Файловая система HDFS
  • Основные операции в HDFS:
  • Работа с файлами и каталогами. Balancer.
  • Распределенное копирование. HttpFS.
  • Лабораторные работы.
  • Обслуживание и дианостика HDFS:
  • DataNodes, NameNodes, HA. HDFS UI. Лабораторная работа.
  • Политики хранения и размещения в HDFS:
  • Политики хранения. Tiering. Erasure Coding. Rack Awareness.
  • Лабораторные работы
  • Компрессия и форматы файлов
  • Парадигма Map Reduce:
  • Лабораторная работа (опционально).
  • Архитектура YARN, HA-режим. Работа с YARN UI.
  • Scheduler YARN:
  • Лабораторная работа
Проверка работоспособности кластера
  • ZooKeeper. Основные понятия и операции. Работа с Zookeeper CLI.
  • HBase. Основные понятия и примеры операций. Установка и конфигурирование (GC, Memstore, Compression, Load balancing, Flush). High Availability. Работа с утилитами HBase (check, repair).
  • Phoenix. Основные операции с данными. Примеры запросов Hive. Основные понятия и примеры операций. Установка и конфигурирование. High Availability HiveServer.
  • Работа с утилитами Hive (schema-tool). Работа с Tez UI.
  • Оптимизация запросов Hive:
  • Лабораторная работа
  • Spark. Основные понятия и операции.
  • Установка и конфигурирование. Работа со Spark UI. Примеры кода.
  • Работа с Livy сервером (REST API)
  • Zeppelin. Основные интерпретаторы и примеры кода
Итоговое тестирование




« Предыдущий курс     Следующий курс»

Возврат к списку


Подпишитесь на новости