Курсы Big Data,Arenadata,Greenplum, Kafka и Spark

08Окт
2022

Ад зависимостей для Python-разработчика: 4 библиотеки для визуализации графа

Python для инженеров данныхданных примеры курсы обучение, обучение Data Science Python на примерах, Python зависимости граф, анализ графов примеры курсы обучение, Школа Больших Данных Учебный Центр Коммерсант

Практически каждый Python-разработчик и Data Scientist использует в своем коде сторонние библиотеки и внешние решения, которые хранятся в разных репозиториях и связаны со множеством других файлов. Этот открытый код настолько распределен, что возникает «ад зависимостей», что сильно осложняет разработку. Читайте, как справиться с этой проблемой, используя методы анализа графов. Проблема...

07Окт
2022

Профилирование данных и повышение качества DAG-конвейеров Apache AirFlow с Whylogs

Автор Анна Вичуговав категории AirFlow, Блог

Whylogs логирование Apache Airflow, Apache AirFlow примеры курсы обучение, обучение дата-инженеров, инженер данных курсы примеры обучение, DAG airflow example, инженерия данных с Apache AirFlow пример, обучение большим данным, Школа Больших Данных Учебный центр Коммерсант

Как повысить качество данных и пакетных конвейеров с их обработки в Apache AirFlow с Python-библиотекой Whylogs. Что это за средство регистрации и профилирования, как оно работает, каким образом совместимо с DAG-графом задач Apache AirFlow и чем полезно дата-инженеру. Что такое Whylogs и зачем это Apache AirFlow Apache AirFlow активно используется...

04Окт
2022

От Apache Hive к Iceberg и Spark: модернизация озера данных в Airbnb

Автор Анна Вичуговав категории Hive, Spark, Блог

обучение SQL-on-Hadoop, Apache Hive примеры курсы обучение, Apache Spark примеры курсы обучение, обучение дата-инженеров, озеро данных Hive HDFS Hadoop S3 Spark примеры курсы обучение, Школа Больших Данных Учебный Центр Коммерсант

Рассмотрим, как дата-инженеры Airbnb делятся своим опытом перевода корпоративного Data Lake на Apache HDFS в облачное объектное хранилище AWS S3. Почему пришлось переводить аналитические нагрузки с Apache Hive на Iceberg и Spark, и какие результаты это принесло. Предыстория: Data Lake на HDFS и Apache Hive Будучи крупнейшей онлайн-площадкой для размещения...

03Окт
2022

Мониторинг Machine Learning в production: полезные советы и MLOps-инструменты

Автор Анна Вичуговав категории Machine Learning, Блог

MLOps курсы примеры обучение, обучение Data Science примеры курсы, обучение инженеров Machine Learning, Школа Больших Данных Учебный Центр Коммерсант

Специально для обучения ML-разработчиков сегодня разберем проблемы развертывания моделей Machine Learning в производстве и способы их решения с помощью MLOps-инструментов. А также поговорим про дрейф данных и его обнаружение методами математической статистики. Жизненный цикл ML-моделей и MLOps Каждый проект машинного обучения начинается с данных, подготовка которых занимает большую часть жизненного...

01Окт
2022

Оптимизация аналитических рабочих нагрузок в транзакционных системах с Data Mesh

Автор Анна Вичуговав категории Блог, Цифровая трансформация

аналитика больших данных примеры курсы обучение, архитектура данных, Data Mesh примеры курсы обучение, курсы ИТ-архитекторов, обучение архитекторов Big Data, Школа Больших Данных Учебный Центр Коммерсант

Чтобы добавить в наши курсы для ИТ-архитекторов и дата-инженеров еще больше полезных материалов, сегодня рассмотрим, как модернизировать аналитические рабочие нагрузки в транзакционных системах с помощью гибридной архитектуры Data Mesh. А также поговорим о том, как реализовать этот подход с организационной и технической точек зрения. Аналитика и транзакции: versus или вместе?...

30Сен
2022

Как ускорить чтение из JDBC-источников для Apache Spark: 3 метода

Автор Анна Вичуговав категории Spark, Блог

курсы Apache Spark SQL для инженеров данных и разработчиков, разработка Spark, Apache Spark JDBC для разработчиков, Spark JDBC инженерия больших данных, обучение разработчиков Apache Spark, Школа Больших Данных Учебный Центр Коммерсант

Сегодня разберем тему, важную для обучения дата-инженеров и разработчиков распределенных Spark-приложений. Почему чтение данных из реляционных баз в Apache Spark может быть медленным и как его ускорить, изменив SQL-запрос или структуру таблицы. JDBC-источники данных для Apache Spark Apache Spark является средством обработки, а не хранения больших данных. Поэтому, чтобы использовать...

29Сен
2022

Потоковый CEP и CDC с Apache Flink SQL: JDBC-коннектор от GetIndata

Автор Анна Вичуговав категории Flink, Блог

CDC CEP Flink SQL примеры курсы обучение, потоковая обработка цепочек событий в Flink приложениях, библиотека CEP Apache Flink, Apache Flink для разработчиков и дата-инженеров примеры курсы обучение, потоковая обработка данных Flink, обучение дата-инженеров и разработчиков курсы примеры, Школа Больших Данных Учебный Центр Коммерсант

Мы уже писали про поиск сложных событий при их потоковой обработке средствами Apache Flink. Продолжая эту важную для обучения дата-инженеров тему, сегодня рассмотрим, как CDC-коннектор от GetIndata упрощает запуск распознавание шаблонов на потоках данных из многих источников. Проблемы захвата измененных данных из реляционной базы с помощью JDBC-драйвера и способы их...

28Сен
2022

Сине-зеленое развертывание ETL-процессов с группами задач Apache AirFlow

Автор Анна Вичуговав категории AirFlow, Блог

DAG AirFlow, ETL, DWH, инженерия данных, дата-инженер примеры курсы обучение AirFlow, инженерия данных примеры курсы обучение, ETL-процессы курсы, Apache AirFlow примеры курсы кейсы обучение, обучение большим данным, Школа Больших Данных Учебный Центр Коммерсант

В этой статье для обучения дата-инженеров рассмотрим, как крупнейший медиа-банк Storyblocks добился обновления данных в корпоративном хранилище без простоев с помощью DevOps-идеи сине-зеленого развертывания и механизма TaskGroup в Apache Airflow. Проблемы ETL при массовой загрузке данных в Data Lake и DWH Storyblocks – это крупнейший в мире банк данных, включающий...

26Сен
2022

Знакомство с aiokafka: асинхронный Python-клиент для Apache Kafka

Автор Анна Вичуговав категории Kafka, Блог

обучение Kafka, курсы по Apache Kafka, тренинг Kafka, Apache Kafka курсы для разработчиков больших данных в Москве, обучение разработчиков Big Data Kafka Python, Apache Kafka и Python, примеры Kafka Python, Школа Больших Данных Учебный центр Коммерсант

Мы уже писали о Python-клиентах Apache Kafka, которые позволяют разрабатывать приложения потоковой передачи события, используя популярный Python вместо сложных языков Java и Scala. Сегодня познакомимся с еще одной Python-библиотекой, которая представляет асинхронный клиент для Kafka. Что такое aiokafka и чем это отличается от kafka-python: краткий обзор для обучения инженеров данных...

25Сен
2022

Тонкости потоковой обработки данных в Apache Spark: проблемы Structured Streaming

Автор Анна Вичуговав категории Spark, Блог

обучение Spark SQL примеры курсы обучение, анализ данных Spark, Spark Structured Streaming разработка конфигурирование приложений для разработчика примеры курсы обучение, Spark Streaming примеры курсы обучение, конфигурация приложения Spark, Apache Spark разработчик примеры курсы обучение, обучение большим данным, курсы дата-инженер аналитик Big Data, Школа Больших Данных Учебный Центр Коммерсант

Сегодня рассмотрим важную тему для обучения дата-инженеров и разработчиков распределенных Spark-приложений. Как устроена потоковая обработка данных в Apache Spark Structured Streaming, зачем нужны водяные знаки и с какими сложностями при этом можно столкнуться. Как работают водяные знаки в потоковой передача событий Apache Spark Библиотека потоковой обработки событий Structured Streaming основана...