Курсы Big Data,Arenadata,Greenplum, Kafka и Spark

30Сен
2022

Как ускорить чтение из JDBC-источников для Apache Spark: 3 метода

Автор Анна Вичуговав категории Spark, Блог

курсы Apache Spark SQL для инженеров данных и разработчиков, разработка Spark, Apache Spark JDBC для разработчиков, Spark JDBC инженерия больших данных, обучение разработчиков Apache Spark, Школа Больших Данных Учебный Центр Коммерсант

Сегодня разберем тему, важную для обучения дата-инженеров и разработчиков распределенных Spark-приложений. Почему чтение данных из реляционных баз в Apache Spark может быть медленным и как его ускорить, изменив SQL-запрос или структуру таблицы. JDBC-источники данных для Apache Spark Apache Spark является средством обработки, а не хранения больших данных. Поэтому, чтобы использовать...

29Сен
2022

Потоковый CEP и CDC с Apache Flink SQL: JDBC-коннектор от GetIndata

Автор Анна Вичуговав категории Flink, Блог

CDC CEP Flink SQL примеры курсы обучение, потоковая обработка цепочек событий в Flink приложениях, библиотека CEP Apache Flink, Apache Flink для разработчиков и дата-инженеров примеры курсы обучение, потоковая обработка данных Flink, обучение дата-инженеров и разработчиков курсы примеры, Школа Больших Данных Учебный Центр Коммерсант

Мы уже писали про поиск сложных событий при их потоковой обработке средствами Apache Flink. Продолжая эту важную для обучения дата-инженеров тему, сегодня рассмотрим, как CDC-коннектор от GetIndata упрощает запуск распознавание шаблонов на потоках данных из многих источников. Проблемы захвата измененных данных из реляционной базы с помощью JDBC-драйвера и способы их...

28Сен
2022

Сине-зеленое развертывание ETL-процессов с группами задач Apache AirFlow

Автор Анна Вичуговав категории AirFlow, Блог

DAG AirFlow, ETL, DWH, инженерия данных, дата-инженер примеры курсы обучение AirFlow, инженерия данных примеры курсы обучение, ETL-процессы курсы, Apache AirFlow примеры курсы кейсы обучение, обучение большим данным, Школа Больших Данных Учебный Центр Коммерсант

В этой статье для обучения дата-инженеров рассмотрим, как крупнейший медиа-банк Storyblocks добился обновления данных в корпоративном хранилище без простоев с помощью DevOps-идеи сине-зеленого развертывания и механизма TaskGroup в Apache Airflow. Проблемы ETL при массовой загрузке данных в Data Lake и DWH Storyblocks – это крупнейший в мире банк данных, включающий...

26Сен
2022

Знакомство с aiokafka: асинхронный Python-клиент для Apache Kafka

Автор Анна Вичуговав категории Kafka, Блог

обучение Kafka, курсы по Apache Kafka, тренинг Kafka, Apache Kafka курсы для разработчиков больших данных в Москве, обучение разработчиков Big Data Kafka Python, Apache Kafka и Python, примеры Kafka Python, Школа Больших Данных Учебный центр Коммерсант

Мы уже писали о Python-клиентах Apache Kafka, которые позволяют разрабатывать приложения потоковой передачи события, используя популярный Python вместо сложных языков Java и Scala. Сегодня познакомимся с еще одной Python-библиотекой, которая представляет асинхронный клиент для Kafka. Что такое aiokafka и чем это отличается от kafka-python: краткий обзор для обучения инженеров данных...

25Сен
2022

Тонкости потоковой обработки данных в Apache Spark: проблемы Structured Streaming

Автор Анна Вичуговав категории Spark, Блог

обучение Spark SQL примеры курсы обучение, анализ данных Spark, Spark Structured Streaming разработка конфигурирование приложений для разработчика примеры курсы обучение, Spark Streaming примеры курсы обучение, конфигурация приложения Spark, Apache Spark разработчик примеры курсы обучение, обучение большим данным, курсы дата-инженер аналитик Big Data, Школа Больших Данных Учебный Центр Коммерсант

Сегодня рассмотрим важную тему для обучения дата-инженеров и разработчиков распределенных Spark-приложений. Как устроена потоковая обработка данных в Apache Spark Structured Streaming, зачем нужны водяные знаки и с какими сложностями при этом можно столкнуться. Как работают водяные знаки в потоковой передача событий Apache Spark Библиотека потоковой обработки событий Structured Streaming основана...

24Сен
2022

Под капотом Process Mining: графовая аналитика для анализа бизнес-процессов

Автор Анна Вичуговав категории Блог, Цифровая трансформация

PM4Py Data Science примеры курсы обучение, PM4Py Google Colab пример, PM4Py Process Mining Примеры курсы обучение, процессная аналитика, аналитика бизнес-процессов средствами Data Science, Data Mining Process Mining, обучение анализу данных, графовая аналитика больших данных, графовые алгоритмы в бизнесе, Школа Больших Данных Учебный Центр Коммерсант

Сегодня рассмотрим тему анализа и оптимизации бизнес-процессов средствами графовой аналитики больших данных. Как устроены информационные системы класса Process Mining, где еще применяются эти идеи и другие приложения теории графов в бизнесе на примере Python-библиотеки PM4Py. Что такое Process Mining Чтобы понять, как выполняется процесс, бизнес-аналитик строит его схему в виде подробной EPC...

23Сен
2022

Безопасность архитектуры данных: проблемы Data Mesh и их решения

Автор Анна Вичуговав категории Блог, Цифровая трансформация

Data Mesh cybersecurity архитектура данных примеры курсы обучение, безопасность архитектуры данных, безопасность озера данных, безопасность Data Lake Mesh DWH, обучение ИТ-архитекторов Big Data, Школа Больших Данных Учебный Центр Коммерсант

Data Mesh воплощает децентрализованный подход к построению распределенной архитектуры данных. При всех достоинствах этой модели, которая совмещает потоковую и пакетную парадигмы обработки данных, она еще довольно незрелая и имеет ряд недостатков. Одним из них является проблема с информационной безопасностью, что мы и рассмотрим далее для обучения ИТ-архитекторов и дата-инженеров. Безопасность...

22Сен
2022

7 причин не использовать Pickle-формат в MLOps для сохранения ML-моделей

Автор Анна Вичуговав категории Machine Learning, Блог

MLOPS примеры курсы обучение, курсы Data Science, вывод ML в production, ML MLOps Pickle, курсы Data Scince, Machine Learning обучение примеры, машинное обучение MLOps, Machine Learning курсы Spark, Школа Больших Данных Учебный Центр Коммерсант

Мы уже рассказывали про важность переносимости ML-моделей, что является одним из аспектов MLOps-концепции. Сегодня разберем, почему популярный формат Pickle не лучший выбор для сохранения модели Machine Learning и что использовать вместо него. Пара достоинств и 7 главных недостатков формата Pickle Согласно концепции MLOps, направленной на сокращение разрыва между различными специалистами,...

20Сен
2022

Сбалансированная изоляция данных в мультиарендном кластере Apache HBase: опыт Flipkart

Автор Анна Вичуговав категории HBase, Блог

курсы HBase примеры обучение, Apache HBase Hadoop администратор кластера курс, администрирование Apache HBase, NoSQL курсы примеры обучение, Школа Больших Данных Учебный центр Коммерсант

Для практического обучения дата-инженеров и архитекторов Big Data систем сегодня рассмотрим трудности изоляции и распределения в кластере Apache HBase и способы их обхода. С какими проблемами изоляции и сбалансированного распространения данных столкнулись инженеры индийской e-commerce компании Flipkart при организации мультиарендного кластера Apache HBase и как их решили. Изоляция данных и...

19Сен
2022

Абсолютно безопасно: 3 security-кита в Apache Hive

Автор Анна Вичуговав категории Hive, Блог

безопасность Apache Hive администрирование, SQL-on-Hadoop Hive администратор кластера примеры курсы обучение, Hive обучение администрирование примеры курсы Hadoop, Hadoop Hive кластер администратор примеры курсы обучение SQL Hadoop, Школа Больших Данных Учебный Центр Коммерсант

В этой статье для обучения дата-инженеров и администраторов SQL-on-Hadoop рассмотрим способы обеспечения информационной безопасности и защиты данных от несанкционированного доступа в Apache Hive. Классический security-набор: аутентификация, авторизация и шифрование. Авторизация и аутентификация в Apache Hive Будучи популярным инструментом стека SQL-on-Hadoop, Apache Hive поддерживает все механизмы обеспечения информационной безопасности, поддерживаемый базовой...