A B C D E F G H I J K L M N O P Q R S T V W Y Z А Б В Г Е И К М О П С Т Ц
Copy on First Access

  COFA (Copy on First Access) - это стратегия управления памятью, при которой данные копируются только при первом обращении к ним, что позволяет отложить накладные расходы и снизить избыточное копирование по сравнению с немедленным дублированием данных. COFA (Copy on First Access) - это аппаратный алгоритм отложенного копирования блоков данных на уровне...

CRISP-DM

CRISP-DM (от английского Cross-Industry Standard Process for Data Mining) — межотраслевой стандартный процесс исследования данных. Это проверенная в промышленности и наиболее распространённая методология, первая версия которой была представлена в Брюсселе в марте 1999 года, а пошаговая инструкция опубликована в 2000 году [1]. CRISP-DM описывает жизненный цикл исследования данных, состоящий из...

Cursor

    Cursor — это интеллектуальная интегрированная среда разработки (IDE), созданная на основе VS Code, которая использует передовые большие языковые модели (LLM) для глубокого анализа, написания и отладки программного кода. Cursor позиционируется не как дополнение, а как самостоятельный инструмент с нативной поддержкой ИИ1. Главная особенность редактора заключается в его способности...

DAG

    DAG (Directed Acyclic Graph) - это ориентированная ацикличная структура, используемая для формального описания зависимостей и упорядочивания вычислительных процессов таким образом, чтобы исключить циклы и обеспечить строго определённую последовательность выполнения. В отличие от простых списков дел, DAG позволяет моделировать сложные нелинейные процессы, где одни задачи могут выполняться параллельно, а...

Dagster

  Dagster — это оркестратор данных, предназначенный для разработки, выполнения и мониторинга пайплайнов обработки данных на основе DAG, с акцентом на типизацию данных, тестируемость и прозрачность выполнения. Главная цель этого инструмента состоит в управлении активами данных. Активы включают таблицы, файлы и модели машинного обучения. Традиционные оркестраторы фокусируются исключительно на порядке...

Dask

  Dask — это гибкая библиотека для параллельных вычислений на Python, которая позволяет масштабировать привычные инструменты, такие как NumPy, Pandas и Scikit-learn, для работы с большими данными.   Dask: Что это такое Привет! Сегодня поговорим о Dask. Если ты хоть раз сталкивался с ситуацией, когда твой любимый Pandas падал с...

Data Contract

Data contract (Контракт данных) это машиночитаемое соглашение между поставщиком и потребителем набора данных, где зафиксированы схема, типы полей, правила качества и сроки поставки. Ключевое слово здесь машиночитаемое. Страница в корпоративной вики о том, что сумма заказа обязана быть числом, никому не мешает поменять тип колонки на текстовый в ближайший вторник....

Data Fabric

Data Fabric (data fabric) это архитектурная концепция управления данными, которую как отдельную категорию ввела аналитическая компания Gartner. Концепция описывает архитектуру, где непрерывно собираемый и анализируемый слой активных метаданных (active metadata) автоматически связывает разрозненные источники данных в гибридных, мультиоблачных и edge-средах, не перемещая сами данные физически в единое хранилище.   Что...

Data flow

Dataflow, или поток данных, представляет собой концепцию, важную для понимания того, как данные перемещаются и обрабатываются в программном коде. Эта концепция играет ключевую роль в различных областях программирования, включая параллельное программирование, асинхронное выполнение и обработку событий. В программировании поток данных представляет собой направление перемещения данных от одного участка кода к...

Data Governance

  Data Governance (DG) — это организация стратегического управления данными в компании. На практике она реализуется через фреймворк, который включает в себя систему правил, процессов, политик и зон ответственности. Этот фреймворк определяет, как организация управляет своими данными на протяжении всего их жизненного цикла — от создания до архивации или удаления...

Data Lake

    Data Lake (озеро данных) — это логическая совокупность репозиториев данных, предназначенных для хранения и анализа больших данных в их исходном формате. В отличие от традиционного понимания централизованного хранилища, Data Lake может быть распределенным по множеству физических местоположений, включая облачные платформы, on-premises инфраструктуру или гибридные среды. Концепция озера данных...

Data lineage

Data Lineage (линейность данных) — это процесс отслеживания, визуализации и понимания пути данных от их источника до конечного потребителя. Он включает в себя все точки остановки и трансформации на этом пути, отвечая на ключевые вопросы: откуда пришли данные, что с ними произошло и куда они направляются. Если представить все данные...

Data Mesh

  Data Mesh (дословно «сетка данных») это архитектурный и организационный подход к управлению корпоративными данными. Ответственность за аналитические данные здесь распределяется между бизнес-доменами, а не концентрируется в одной центральной команде. Термин ввела Zhamak Dehghani в 2019 году. С тех пор Data Mesh остаётся одним из самых обсуждаемых и одновременно самых...

Data Mining

Data Mining - процесс поиска в сырых необработанных данных интересных, неизвестных, нетривиальных взаимосвязей и полезных знаний, позволяющих интерпретировать и применять результаты для принятия решений в любых сферах  человеческой деятельности. Представляет собой совокупность методов  визуализации, классификации, моделирования и прогнозирования, основанные на применении деревьев решений, искусственных нейронных сетей, генетических алгоритмов, эволюционного программирования, ассоциативной памяти, нечёткой логики.   Дополнительно о...

Data observability

Data observability (Наблюдаемость данных) это практика непрерывного сбора метаданных о датасетах и конвейерах, при которой состояние витрины оценивается не по фиксированному порогу, а по её собственной истории. Термин пришёл из наблюдаемости в эксплуатации приложений, где по метрикам, логам и трассировкам восстанавливают поведение системы, которую нельзя остановить и разобрать. С данными...

Data Product

Data Product (дата-продукт) это самостоятельная единица данных, которую домен-производитель отдаёт другим командам через явный интерфейс с гарантиями качества, а не сырой выгрузкой из таблицы. Подход вырос из архитектуры Data Mesh, но применяется и там, где никакого mesh нет, везде, где команда хочет, чтобы её данные находили, понимали и использовали без...

Data provenance

Data Provenance (происхождение данных) — это документированная история данных с момента их создания до текущего состояния. Она включает в себя все метаданные, описывающие источники, процессы, преобразования и перемещения, которые данные претерпели. Представьте себе родословную ценного произведения искусства: она подтверждает его подлинность, описывает всех владельцев и реставрации. Точно так же Data...

Data Quality

Data quality (Качество данных) это степень пригодности данных для конкретной задачи, будь то аналитический отчёт, обучение модели или работа AI-агента. Плохое качество редко видно сразу. Оно проявляется позже, когда отчёт расходится с реальностью, модель обучается на противоречивых примерах или агент принимает решение на основе пустого поля.   Что такое качество...

Data Science

Data Science – это наука о данных, объединяющая разные области знаний: информатику, математику и системный анализ. Сюда входят методы обработки больших данных (Big Data), интеллектуального анализа данных (Data Mining), статистические методы, методы искусственного интеллекта, в т.ч машинное обучение (Machine Learning). DS включает методы проектирования и разработки баз данных и прикладного...

Data vault

    Data Vault (DV)  — это современная методология моделирования, архитектура и набор практик для создания корпоративных хранилищ данных (DWH). Важно понимать: DV — это не программный продукт, который можно "купить" или "установить". Это подход, стандарт проектирования. Его главная цель — решить две основные проблемы традиционных DWH: нехватку гибкости при изменениях...