Курсы Big Data,Arenadata,Greenplum, Kafka и Spark

24Май
2019

Сложно, дорого, универсально: 3 мифа о Hadoop и их опровержения

Автор Анна Вичуговав категории Hive, Kafka, Spark, Блог, Статьи

Большие данные, Big Data, Hadoop, Apache, Cloudera, Hortonworks, администрирование, инфраструктура

Сегодня мы поговорим о заблуждениях насчет базового инфраструктурного понятия хранения и обработки больших данных – экосистеме Hadoop и развеем 3 самых популярных мифа об этой технологии. А также рассмотрим применение Cloudera, Hortonworks, Arenadata, MapR и HDInsight для проектов Big Data и машинного обучения (Machine Learning). Миф №1: Hadoop – это...

26Ноя
2018

Оптимизация запросов JOIN в Apache HIVE

Автор Nikolay Komissarenkoв категории Hive, Блог, Статьи

В последних версиях Apache HIVE пытается внедрить CBO (cost based optimizer) и оптимизация операций JOIN одна из главных его составляющих. Поэтому понимание сценариев оптимизации применения операций JOINs (объединений) является одним из ключевых факторов настройки производительности HiveQL. Рассмотрим каждый вид объединений на практических примерах и определим их различия: Shuffle Join (Common...