
Студенты университета Синергия регулярно проходят тестирование по предмету Системы обработки больших данных (Big Data). Иногда задания требуют знания теории и внимательности. Наш сервис помогает пройти тест быстро и получить высокий балл. Работа выполняется оперативно, конфиденциально и без предоплаты. Стоимость — 300 рублей.
Технология, позволяющая обрабатывать данные, которые не помещаются в оперативную память одного сервера, распределяя вычисления между множеством узлов, называется:
Параллельные базы данных
Распределенные вычисления +
OLAP-кубы
Индексация B-деревьями
Какой принцип организации данных подразумевает, что вся информация хранится в виде необработанных файлов, а схема чтения применяется только в момент анализа данных?
Schema-on-read +
Schema-on-write
ACID-транзакции
ETL-процесс
Для решения задачи быстрой записи потоковых данных в распределенное хранилище с возможностью их последующего пакетного анализа чаще всего используется архитектурный паттерн:
Lambda-архитектура +
Kappa-архитектура
Zeta-архитектура
Монолитная архитектура
Какая файловая система является стандартом для экосистемы Hadoop и обеспечивает отказоустойчивое хранение блоков данных на серверах-джейнерах?
NTFS
ext4
HDFS (Hadoop Distributed File System) +
ZFS
Что подразумевается под термином «вычислительное смещение» (data locality) в распределенных системах обработки данных?
Перемещение больших объемов данных между дата-центрами
Перемещение кода вычислений (задачи) к узлу, где уже хранятся данные +
Хранение всех резервных копий на одном физическом сервере
Шифрование данных на лету
Какой инструмент экосистемы Hadoop отвечает за управление кластерными ресурсами и планирование заданий (является «операционной системой» для кластера)?
HDFS
Hive
YARN +
Pig
Формат хранения данных, который предлагает эффективную колоночную компрессию и поддержку вложенных структур, часто используемый в Big Data системах, называется:
CSV
JSON
XML
Parquet +
В модели распределенных вычислений MapReduce фаза, которая агрегирует и объединяет промежуточные данные из разных узлов для выдачи итогового результата, называется:
Mapping
Partitioning
Shuffling
Reducing +
Какой язык запросов является стандартным для Apache Hive, позволяя анализировать большие данные в HDFS с помощью SQL-подобного синтаксиса?
HiveQL +
Pig Latin
Scala
Python Pandas
Какая технология обработки потоковых данных в реальном времени использует понятия «топики», «партиции» и «брокеры» для передачи сообщений между приложениями?
Apache Hadoop
Apache Kafka +
Apache Spark Streaming
MongoDB
Что такое «эффект узкого места» (straggler problem) в распределенных системах?
Отсутствие сетевого соединения между узлами
Ситуация, когда один узел работает аномально долго, замедляя выполнение всей задачи +
Невозможность распараллелить простые вычисления
Ошибка сериализации данных
Какая из перечисленных систем является распределенной In-Memory базой данных, оптимизированной для обработки графовых связей?
HBase
Redis Graph +
Apache Cassandra
CouchDB
Какой принцип BASE расшифровывается в контексте NoSQL баз данных, противопоставляя себя ACID?
Basically Available, Soft state, Eventual consistency +
Binary Atomic, Sequential, Encrypted
Big-data Analytics, Streaming, Events
Backup, Archive, Snapshot, Erasure
Для какой задачи лучше всего подходит Apache Spark по сравнению с классическим Hadoop MapReduce?
Пакетная обработка с промежуточной записью на диск
Многократные итеративные вычисления (машинное обучение / графовые алгоритмы) в оперативной памяти +
Прямая потоковая запись бинарных логов
Управление ресурсами кластера
Какая шкала измерений используется для данных, где определены операции «равно» и «не равно», но нет понятия «больше» или «меньше» (например, пол или национальность)?
Порядковая шкала
Интервальная шкала
Номинативная шкала +
Шкала отношений
Алгоритм кластеризации DBSCAN отличается от алгоритма k-средних тем, что:
Требует заранее задать количество кластеров
Способен выделять кластера произвольной формы и находить шумы (выбросы) +
Работает только с категориальными данными
Не масштабируется на большие объемы данных
Что представляет собой «Data Lake» в архитектуре Big Data?
Стандартный SQL-движок для реляционных таблиц
Хранилище необработанных данных в их нативном формате без предварительной обработки +
Инструмент для удаления дубликатов
Протокол передачи данных между серверами
Какая проблема характерна для метода выборки (Sampling) при анализе больших данных?
Высокая стоимость хранения выборки
Потеря редко встречающихся аномалий или важных выбросов, не попавших в выборку +
Невозможность распараллеливания процесса выборки
Обязательное использование транзакций
В контексте трех Vs Big Data, параметр «Velocity» описывает:
Разнообразие типов данных (текст, видео, JSON)
Скорость накопления данных и необходимость их быстрой обработки +
Физический объем хранилищ
Степень доверия к источнику данных
Какой протокол и порт по умолчанию используются веб-интерфейсом NameNode в Hadoop для мониторинга состояния кластера HDFS?
HTTP 50070 +
RPC 9000
HTTPS 443
SSH 22
Вопрос
Большие данные – это:
Объём накопленных человечеством цифровых данных на 2023 год измеряется:
Кто создал первую модель искусственных нейронных сетей?
Определите правильную последовательность модели распределенных вычислений MapReduce:
Установите соответствие целей инфраструктуры Hadoop и их определений:
Не верно утверждение о том, что:
Не верно, что Variety в контексте характеристик Big Data означает:
Услуги по построению архитектуры системы базы данных, обустройству и оптимизации инфраструктуры, и обеспечению безопасности хранения данных относятся к…
Определите правильную последовательность термина «Big Data»:
Сколько Петабайт в Зеттабайте?
Найдите соответствие между понятием и его описанием
Не верно, что технология Web Mining применяет Data Mining для анализа:
Установите соответствие между функциями и их определениями:
Какой пакет позволяет загружать данные из листа Excel файла?
Data Mining — это процесс обнаружения в сырых данных…
Не верно, что закономерности, определенные с использованием технологии Data Mining должны обладать такими свойствами:
Интервальная шкала – это шкала…
Такие данные как температура воздуха относятся к …
Для какой шкалы применимы только такие операции как равно и не равно?
Деревья решений относятся к группам …
Регрессионный и дискриминантный анализ относятся…
Большинство методов Data mining были разработаны в рамках …
Классификация относится к стратегии:
Алгоритм k-средних предназначен для решения задачи:
Кластер можно охарактеризовать как …
Найдите соответствие между функцией в R и еe описанием:
Найдите соответствие между функцией в R и еe описанием:
Установите соответствие между функциями и их определениями:
Какой пакет позволяет загружать данные из листа Excel файла?
Какие типы данных используются в R:
Другие тесты Синергии, МТИ, МОСАП:
Целевые аудитории и таргетирование в рекламе и PR
