PageIndex это движок поиска по документам для LLM-приложений, который обходится без векторной базы и без нарезки текста на чанки. Вместо эмбеддингов он строит из документа иерархическое дерево (document tree), похожее на оглавление, и заставляет модель ходить по этому дереву рассуждением. Разработку выпустила компания Vectify AI в сентябре 2025 года,...
Pandas - это высокопроизводительная библиотека с открытым исходным кодом для обработки и анализа данных на языке Python. Она предоставляет удобные структуры данных для работы с таблицами и временными рядами. Инструмент де-факто является стандартом в индустрии Data Science и машинного обучения. Библиотека построена поверх NumPy. Это обеспечивает ей высокую...
Apache Parquet - это бинарный, колоночно-ориентированный формат хранения больших данных, изначально созданный для экосистемы Hadoop, позволяющий использовать преимущества сжатого и эффективного колоночно-ориентированного представления информации. Паркет позволяет задавать схемы сжатия на уровне столбцов и добавлять новые кодировки по мере их появления [1]. Вместе с Apache Avro, Parquet является очень популярным форматом...
Pi agent является минималистичным фреймворком и агентным CLI-инструментом с открытым исходным кодом. Лицензия MIT гарантирует свободное использование и модификацию продукта. Инструмент предназначен для автоматизации процессов написания кода, рефакторинга и управления проектами. Разработчики выполняют все операции непосредственно через терминал. Pi Agent реализует архитектурную концепцию тонкого ядра. Программа предоставляет языковой модели...
Polars - это высокопроизводительная библиотека для обработки и анализа данных, написанная на языке Rust, реализующая колоночную модель вычислений и поддерживающая ленивые (lazy) и eager-вычисления, ориентированная на эффективную работу с большими объёмами данных и предоставляющая интерфейс для Python. В отличие от традиционных инструментов, Polars изначально проектировался для параллельной обработки данных и...
Prefect - это современная система оркестрации потоков данных (workflow orchestration), позволяющая превратить обычный Python-код в надежный, наблюдаемый и устойчивый к сбоям конвейер. Если классические инструменты вроде Apache Airflow требуют изучения сложного DSL (предметно-ориентированного языка), то Prefect исповедует философию "просто пиши на Python". Главная "фишка" Prefect - концепция Negative...
Prompt (промпт) — это текстовая инструкция или запрос, который человек вводит в систему искусственного интеллекта. Это делается, чтобы получить нужный ответ, изображение, код или другое действие. От качества и точности Prompt зависит, насколько полезным и релевантным будет результат. Можно рассматривать Prompt как техническое задание. Оно дается большой языковой модели...
Prompt engineering (инженерия запросов) - это процесс проектирования, формулирования и итеративной оптимизации текстовых инструкций (промптов), направленных к большим языковым моделям (LLM) для получения точных, релевантных и контролируемых ответов. Prompt Engineering (PE) включает в себя глубокое понимание того, как модель интерпретирует контекст, структурирует информацию и следует инструкциям. Как следствие,...
Apache Spark. PySpark может использоваться для распределенных вычислений на Python в рамках анализа и обработки больших данных (Big Data), а также машинного обучения (Machine Learning).
Qdrant (читается «квадрант») это векторная база данных с открытым исходным кодом, написанная на Rust. Она хранит эмбеддинги вместе с произвольными метаданными и отдаёт по запросу список ближайших по смыслу объектов. Проект начинался как движок семантического поиска, а сегодня чаще всего стоит под RAG-системами, рекомендательными сервисами и поиском по картинкам....
Qwen - открытое семейство больших языковых и мультимодальных моделей от компании Alibaba Cloud. Фундаментально система базируется на архитектуре трансформеров с применением механизма разреженных экспертов. Данный подход позволяет моделям нативно обрабатывать текст, программный код, изображения и видео. Алгоритмы динамически распределяют вычислительную нагрузку при инференсе. В результате пользователи получают высокую производительность...
RAFT — это алгоритм распределённого консенсуса, обеспечивающий согласованную репликацию журнала операций между узлами кластера и выбор лидера для координации изменений состояния системы. Он решает фундаментальную проблему надежной синхронизации данных. Представьте группу полностью независимых серверов в сети. Они должны всегда работать как единый слаженный механизм. Если один сервер внезапно сломается,...
Ray — это распределённый фреймворк для параллельных и распределённых вычислений, предназначенный для масштабируемого выполнения задач и управления состоянием в кластере, широко используемый в задачах машинного обучения и обработки данных. Он имеет открытый исходный код. Инструмент создан специально для масштабирования приложений на Python. Код на этом языке часто работает довольно...
RBAC (Role-Based Access Control), или Управление доступом на основе ролей, - это фундаментальный отраслевой стандарт для управления правами доступа в IT-системах. Суть RBAC проста: вместо того чтобы назначать права доступа (например, "чтение таблицы X") напрямую каждому отдельному пользователю ("Ивану", "Петру", "Сервисному-Аккаунту-1"), вы сначала создаете Роль (например, "Аналитик"). Вы даете все...
RCFile (Record Columnar File) – гибридный многоколонный формат записей, адаптированный для хранения реляционных таблиц на кластерах и предназначенный для систем Big Data, использующих MapReduce. Этот формат для записи больших данных появился в 2011 году на основании исследований и совместных усилий Facebook, Государственного университета Огайо и Института вычислительной техники Китайской академии...
Real-time analytics (Аналитика в реальном времени) это архитектурный подход к работе с данными, при котором система принимает, обрабатывает и делает доступным для запроса каждое новое событие в течение секунд, а не часов после того, как оно произошло. Термин описывает не отдельный продукт с версией и релизным циклом, а категорию решений,...
Redis (Remote Dictionary Server) - это высокопроизводительное in-memory хранилище данных типа key-value, поддерживающее различные структуры данных и используемое для кэширования, очередей, сессий и real-time-сценариев благодаря низкой задержке и горизонтальному масштабированию. В мире больших данных и веб-разработки скорость отклика часто является критическим фактором успеха. Традиционные дисковые базы данных не...
Redis Persistence - это комплекс механизмов, отвечающих за сохранение данных из оперативной памяти на долговечный носитель (жесткий диск или SSD). Redis — это in-memory база данных. Это означает, что по умолчанию все данные живут исключительно в оперативной памяти. Это обеспечивает феноменальную скорость, но создает критический риск: при любом...
Requests - это мощная библиотека для выполнения синхронных HTTP-запросов. Инструмент позволяет программному коду обмениваться данными с удаленными серверами. Библиотека полностью скрывает сложную низкоуровневую реализацию сетевых протоколов. Разработчик получает максимально удобный высокоуровневый интерфейс для работы. Главная философия создателей проекта звучит как HTTP для людей. Это означает интуитивную понятность архитектуры даже для...
REST API — это интерфейс программирования приложений, который соответствует принципам архитектурного стиля REST (Representational State Transfer). Важно понимать, что REST не является протоколом или стандартом. Это набор архитектурных ограничений и принципов для построения распределенных систем. Когда веб-сервис разработан с соблюдением этих принципов, его называют RESTful. Главная цель REST...



















