Онлайн тесты на тему "ИДО Технологии анализа больших данных и машинное обучение - ММА [ID 66789]"

Эта работа представлена в следующих категориях:

Тестовое задание на тему: ИДО Технологии анализа больших данных и машинное обучение
Тест был выполнен на зачет. Отчёт набранных баллов предоставляю в демо работах. Верные ответы будут отмечены +.
В купленном тесте будут вопросы и ответы которые размещены ниже.
Так же могу выполнять данную работу индивидуально. Делайте индивидуальный заказ.

Демо работы

Описание работы

Тест 1

Какой объем данных генерирует самолет Боинг-787 за один полет согласно лекции?
500 Гбайт
100 Гбайт
300 Тбайт
2.9·10²⁰ байт

Какова вычислительная сложность алгоритма Штрассена для умножения матриц?
O(n) = n²·⁸¹
O(n) = n log n
O(n) = n²
O(n) = n³

К каким типам данных относится заработная плата, население страны, артериальное давление согласно классификации в лекции?
Бинарные данные
Текстовые данные
Категориальные данные (Categorical Data)
Числовые данные (Numerical Data)

Какой метод регрессионного анализа характеризуется относительно низкой устойчивостью к отдельным сочетаниям данных и большой вычислительной сложностью?
Метод сопряженных градиентов
Метод Ньютона
Численное решение
Аналитическое решение

Что из перечисленного является признаком переобученности (overfitting) в регрессионном анализе?
Функция прогноза недостаточно хорошо аппроксимирует имеющийся набор данных
Высокое значение функции штрафа на тестовой выборке
Общая тенденция проявляется слабо
Аппроксимация идеально описывает выборку данных, но способность к обобщению потеряна

Какой метод бинарной классификации НЕ упоминается в лекции?
Логистическая регрессия
Дерево решений
"Наивный" байесовский классификатор
Метод опорных векторов

Как вычисляется F-критерий для оценки качества классификации?
F = 2 × (precision × recall) / (precision + recall)
F = precision / recall
F = (precision + recall) / 2
F = precision × recall

Какой алгоритм обучения исторически первым был предложен для искусственных нейронных сетей?
Алгоритм RPROP
Алгоритм обратного распространения ошибки
Алгоритм к-средних
Алгоритм QPROP

Что из перечисленного является способом избежания эффекта недообученности в нейронных сетях?
Увеличение функции штрафа
Уменьшение числа нейронов в скрытом слое
Увеличение числа нейронов в скрытом слое
Уменьшение числа скрытых слоев

Какой метод используется для определения оптимального количества кластеров в методе к-средних?
Метод градиентного спуска
Метод наименьших квадратов
Метод Ньютона
Метод локтя (Elbow Method)

Тест 2

Какое из перечисленных направлений НЕ находится на стыке с Data Science согласно лекции?
Машинное обучение (ML)
Квантовая физика
Глубокое обучение (DL)
Искусственный интеллект (AI)

Какой уровень архитектуры хранилища данных (LSA) отвечает за преобразование данных к структурам, удобным для анализа?
Стейджинг (Primary Data Layer)
Аналитические витрины (Data Mart Layer)
Ядро хранилища (Core Data Layer)
Сервисный слой (Service Layer)

Какой тип данных характеризуется как "информация, которую трудно категоризировать или структурировать, не имеющая определенной формы"?
Традиционные данные
Неструктурированные данные
Структурированные данные
Слабоструктурированные данные

Какая из перечисленных моделей проектирования хранилищ данных предполагает, что данные из источников поступают в хранилище после процесса ETL?
Модель OLAP
Модель Кимбалла (Kimball)
Модель LSA
Модель Инмона (Inmon)

Какой тип NoSQL-СУБД использует узлы и рёбра для отображения и хранения данных?
Документно-ориентированное хранилище
Колоночное хранилище
Графовое хранилище
Ключ-значение (Key-value)

Что означает цветовая кодировка "белый" в Qlik Sense?
Исключенное значение
Возможное значение
Альтернативное значение
Выбранное значение

Какой этап работы с данными включает разведочный анализ (EDA) для поиска закономерностей и отклонений?
Подготовка данных
Составление требований к данным
Поиск решения
Построение модели

Какая из характеристик Big Data относится к "постоянному увеличению и ускорению потока получаемой информации"?
Объем (Volume)
Достоверность (Veracity)
Скорость (Velocity)
Разнообразие (Variety)

Какой вид диаграммы используется для визуализации распределения данных в рамках непрерывного интервала?
Гистограмма
Диаграмма размаха (ящик с усами)
Пузырьковая диаграмма
Диаграмма рассеяния

Какой процесс в машинном обучении подразумевает "маркировку информации в зависимости от ее категории"?
Распределение данных
Маркировка классов
Маскировка данных
Очистка данных

Тест 3

Какое свойство обнаруживаемых знаний в Data Mining подразумевает, что результаты анализа должны отражать неочевидные, неожиданные закономерности?
Практическая полезность
Доступность для понимания
Нетривиальность
Новизна

Какое направление Web Mining занимается обнаружением закономерностей в поведении пользователей Web-узлов?
Web Content Mining
Web Usage Mining
Text Mining
Sequential Mining

К какому типу задач Data Mining относится сегментация потребителей в маркетинге?
Классификация
Кластеризация
Поиск ассоциативных правил
Регрессия

Какой из перечисленных методов относится к обучению с учителем (Supervised Learning)?
Деревья решений
Кластерный анализ
Сиквенциальный анализ
Поиск ассоциативных правил

В какой области Data Mining применяется для анализа генетических текстов и последовательностей ДНК?
Биоинформатика
Фильтрация спама
Кредитный скоринг
Web Usage Mining

Какой тип моделей Data Mining описывает функциональные зависимости между переменными в понятной человеку форме?
Модели исключений
Регрессионные модели
Модели классификации
Ассоциативные модели

Что является основным недостатком статистических методов в Data Mining?
Невозможность обработки категориальных данных
Отсутствие формальной математической основы
Усреднение значений, приводящее к потере информативности данных
Высокая вычислительная сложность

Какой метод Data Mining был разработан специально для обработки лингвистической неопределенности?
Деревья решений
Нечеткая логика
Генетические алгоритмы
Нейронные сети

Какой алгоритм классификации в Oracle Data Mining использует теорию вероятности для классификации объектов?
Decision Trees
Adaptive Bayes Networks (ABN)
Support Vector Machines
Naive Bayes (NB)

Какой этап процесса обнаружения знаний следует после применения методов Data Mining?
Интерпретация моделей человеком
Понимание и формулировка задачи анализа
Проверка построенных моделей
Подготовка данных для автоматизированного анализа

Тест 4

Какое из перечисленных определений наиболее точно описывает машинное обучение?
Набор алгоритмов для программирования искусственного интеллекта
Технология создания человеко-машинных интерфейсов
Методы обработки больших данных без использования алгоритмов
Совокупность методов искусственного интеллекта для создания самообучающихся систем

Какой из перечисленных компонентов НЕ является необходимым для обучения машины согласно лекции?
Функции
Алгоритм
Наборы данных (датасеты)
Графический интерфейс пользователя

К какому типу машинного обучения относится метод, когда система учится на собственном опыте через систему поощрений?
Обучение с учителем (supervised learning)
Обучение без учителя (unsupervised learning)
Обучение с частичным участием учителя (semi-supervised learning)
Обучение с подкреплением (reinforcement learning)

Какая задача машинного обучения заключается в распределении объектов по категориям без заранее известных классов?
Кластеризация
Регрессия
Классификация
Уменьшение размерности

Какой алгоритм машинного обучения использует систему правил «Если... то...» и применяется для выявления аномалий?
Метод опорных векторов (SVM)
Наивный Байес
Деревья решений
Логистическая регрессия

Какой тип обучения предполагает, что специалист размечает только часть данных?
Глубинное обучение (deep learning)
Обучение с частичным участием учителя (semi-supervised learning)
Обучение без учителя (unsupervised learning)
Обучение с учителем (supervised learning)

Какой алгоритм основан на теореме Байеса и исторически использовался для фильтрации спама?
Метод опорных векторов (SVM)
Деревья решений
Логистическая регрессия
Наивный Байес

Какой класс алгоритмов машинного обучения работает через многослойные нейронные сети?
Обучение с учителем (supervised learning)
Обучение без учителя (unsupervised learning)
Обучение с подкреплением (reinforcement learning)
Глубинное обучение (deep learning)

Какая задача машинного обучения заключается в анализе зависимостей между величинами?
Классификация
Регрессия
Кластеризация
Уменьшение размерности

Какой алгоритм строит гиперплоскость для разделения данных на классы и используется для распознавания лиц?
Логистическая регрессия
Метод опорных векторов (SVM)
Деревья решений
Наивный Байес

Тест 5

Кто впервые употребил термин "Озеро данных" (Data Lake) согласно лекции?
Ларри Эллисон
Питер Друкер
Билл Гейтс
Джеймс Диксон

Какой тип пользователя Озера данных может формировать статические выборки и динамические потоки данных, но не может выполнять выгрузку данных вовне?
Разработчик правил
Поставщик данных
Потребитель данных
Администратор данных

Какой основной принцип отличает Озеро данных от Хранилища данных в подходе к преобразованию данных?
Обязательное преобразование данных перед загрузкой
Преобразование данных становится "постпроцессингом по запросу"
Полное отсутствие преобразования данных
Использование только ETL-процессов

Какой уровень архитектуры Озера данных отвечает за размещение, хранение, поиск и перемещение данных?
Уровень хранения
Уровень предоставления
Уровень сбора
Уровень безопасности

Какой тип пользователя Озера данных имеет доступ ко всем метаданным и может выполнять их редактирование?
Поставщик данных
Аналитик данных
Администратор данных
Потребитель данных

Что из перечисленного является одним из ключевых требований при создании Озера данных?
Защита персональных данных и конфиденциальной информации
Ограничение хранения данных сроком до 1 года
Использование только реляционных баз данных
Обязательная структуризация всех данных перед загрузкой

Какой режим работы с данными НЕ характерен для уровня сбора в Озере данных?
Только потоковый режим сбора данных
Пакетный режим сбора данных
Идентификация данных с помощью метаданных
Потоковый режим сбора данных

Какой компонент уровня предоставления отвечает за хранение типовых схем подготовки данных?
Интерпретатор данных
Магазин представлений
Архив данных
Магазин данных

Какое из перечисленных свойств характерно для Хранилища данных в отличие от Озера данных?
Обработка очень больших массивов данных
Гибкая схема чтения и комбинирования данных
Хранение неструктурированных данных
Высокая эффективность исполнения типовых запросов

Какой принцип Озера данных предполагает, что данные должны храниться неопределённо долго с минимальными издержками?
Поддержка доверия
Безопасность данных
Качество данных
Минимальная стоимость хранения

Тест 6

Какой метод BIG DATA позволяет обрабатывать и анализировать данные в реальном времени в телекоммуникационной отрасли?
Аналитика потока данных (Stream Analytics)
Аналитика клиентов (Customer Analytics)
Аналитика трафика (Traffic Analytics)
Аналитика местоположения (Location Analytics)

Какой основной недостаток HDFS связан с работой с малыми файлами?
Низкая безопасность данных
Сложность масштабирования системы
Низкая эффективность работы с файлами меньше размера стандартного блока
Зависимость от главного узла

Какой компонент архитектуры HDFS отвечает за управление пространством имён и хранение метаданных файловой системы?
Главный узел (NameNode)
Узел данных (DataNode)
Клиент
Вторичный главный узел (Secondary NameNode)

Какой основной элемент интерфейса Orange является точкой обработки любых действий с данными?
Окно данных (Data Window)
Рабочий процесс (Workflow)
Панель инструментов (Toolbar)
Виджет (Widget)

Какой размер стандартного блока данных в HDFS согласно лекции?
128 МБ
64 МБ
256 МБ
512 МБ

Какова основная функция Secondary NameNode в архитектуре HDFS?
Непосредственно работает с блоками данных
Обеспечивает взаимодействие пользователя с системой
Ускоряет работу системы при перезапуске, обновляя собственный файл FSImage
Является резервной копией NameNode

Какой метод BIG DATA используется телекоммуникационными операторами для создания новых продуктов и услуг на основе анализа данных?
Аналитика трафика
Прогнозирование спроса
Монетизация данных (Data Monetization)
Аналитика социальных медиа

Какой виджет Orange является одним из самых популярных для визуализации данных?
Box Plot
Scatter Plot
File
Data Table

Какой основной принцип работы HDFS обеспечивает отказоустойчивость системы?
Репликация данных на несколько узлов
Интеграция с экосистемой Hadoop
Работа в формате потока данных
Разделение данных на блоки

Какой пример применения BIG DATA в производстве привела компания Intel согласно лекции?
Сокращение избыточных тестов процессоров с экономией 30 миллионов долларов
Мониторинг состояния оборудования на производстве
Оптимизация работы насосов после аварийных отключений
Анализ производственных процессов для уменьшения брака

Тест 7

Хранилище данных, в которое поступают непрерывные потоки структурированных, полуструктурированных и неструктурированных «больших данных», данные в нём собираются из различных источников и просто хранятся, они не модифицируются под определённую цель и не преобразуются в какой-либо формат, называется ....... (в ответе на русском языке основное слово указано в именительном падеже, слова отделяются одним пробелом)

Для работы с большими данными применяются следующие инструменты:
Комплекс алгоритмов и инструментов Weka
Язык программирования и программная среда R
Инструментальная среда MS Visual Studio и язык программирования C#
Язык программирования Python
Язык программирования Java

Категории задач, решаемых с помощью машинного обучения:
Задача оптимизации
Задача классификации
Задача кластеризации
Задача идентификации
Задача регрессии
Задача верификации

Если коэффициент парной корреляции rxy = 0,97 это означает:
Отсутствие связи между переменными x и y
Наличие между переменными x и y сильной прямой связи
Полную связь между переменными x и y
Наличие между переменными x и y сильной обратной связи

Задача машинного обучения, решение которой заключается в построении формальной модели, распределяющей объекты, имеющие одинаковую структуру по заранее известным группам (классам) в зависимости от похожести атрибутов объектов, называется ...., в результате решения задачи получают категориальный ответ на основе набора признаков:
Задача уменьшения размерности
Задача кластеризации
Задача регрессии
Задача классификации
Задача выявления аномалий

Для работы с большими данными применяются следующие инструменты:
Автоматизированная информационная система «1С ERP: Управление предприятием»
Инструментальная среда Netbeans
Пакетный клиент-серверный продукт SAS Enterprise Miner
Инструмент для решения задач преобразования данных Rapidminer
Комплекс программных продуктов Cognos

Что можно сказать об обработке данных в Data Lake и целях этой обработки:
Предиктивная аналитика, машинное обучение, ИИ, BI, аналитика больших данных
ELT — данные извлекаются из источника, хранятся в озере данных и затем трансформируются при необходимости
Визуализация, отчетность, BI
ETL — данные извлекаются из источника, очищаются, структурируются, на финальном этапе готовы к анализу

Упорядочите этапы проведения кластер-анализа данных:
1
2
3
4
5

Уравнение .................. регрессии имеет вид: Y = 1/(1+ exp(-(a1*X1 + a2*X2^2 + a3*X3^3 +....... + an*Xn^n + b))) где ai (i меняется от 1 до n) --- это коэффициенты уравнения, Xi --- переменные и b --- смещение. (В ответе укажите тип регрессии по контексту фразы)

Уравнение множественной .................. регрессии имеет вид: Y = a1*X1 + a2*X2 + a3*X3 ....... an*Xn + b где ai (i меняется от 1 до n) --- это коэффициенты уравнения, Xi --- переменные и b --- смещение. (В ответе укажите тип регрессии по контексту фразы)

Установите соответствие между системами хранения больших данных:
Совокупность информационных систем, включая базы данных и справочники, реализующих функциональность по описанию метаданных, по сбору, очистке, обогащению, консолидации первичной информации из транзакционных систем, а также по построению витрин данных
Это программная система для централизованного хранения и управления большим объёмом структурированных данных, собранных из различных источников для последующего использования их в аналитике и отчётности, прогнозировании и принятии бизнес-решений
Это просто хранилище всевозможных типов данных (структурированных, полуструктурированных и неструктурированных) без какого-либо нативного вычислительного приложения для обработки, данные сохраняются из источников в исходном формате без трансформаций, такой подход ещё называется «schema-on-read»

При обработке массивов информации с применением технологии Data Mining наиболее часто задействуются следующие методы:
Кластерный анализ (иерархический и неиерархический)
Байесовские сети
Поиск явных и неявных ассоциаций
Метод быстрой сортировки
Метод Бэтчера

Какие виды регрессий могут наблюдаться при анализе больших данных:
Сигмоидальная регрессия
Выпуклая регрессия
Экспоненциальная регрессия
Логистическая регрессия
Гребневая (ридж) регрессия

Поставьте в соответствие названию метрик, применяемых для объединения кластеров, методы (алгоритмы) кластеризации, их использующие:
В этом методе расстояние между двумя кластерами определяется расстоянием между двумя наиболее близкими объектами (ближайшими соседями) в различных кластерах. Результирующие кластеры имеют тенденцию объединяться в цепочки
Метод идентичен методу невзвешенного попарного среднего, за исключением того, что при вычислениях размер соответствующих кластеров (т.е. число объектов, содержащихся в них) используется в качестве весового коэффициента
В этом методе расстояние между двумя кластерами определяется как расстояние между их центрами тяжести
В этом методе расстояния между кластерами определяются наибольшим расстоянием между любыми двумя объектами в различных кластерах (т.е. наиболее удаленными соседями). Этот метод обычно работает очень хорошо, когда объекты происходят из отдельных групп
Этот метод идентичен более простому центроидному методу, за исключением того, что при вычислениях используются веса для учета разницы между размерами кластеров
В этом методе расстояние между двумя различными кластерами вычисляется как среднее расстояние между всеми парами объектов в них

Ассоциативные правила, деревья решений, нечеткая логика, генетические алгоритмы относятся к ..................... анализа больших данных с применением технологии методов Data Mining (ответ указать по контексту фразы)

Если значение коэффициента детерминации D=0,9, то это означает:
Построенное уравнение регрессии значимое и его можно использовать для дальнейших исследований
Построенное уравнение регрессии незначимое и его нельзя использовать для дальнейших исследований
О построенном уравнении регрессии ничего нельзя сказать

Основная проблема применения метода машинного обучения с подкреплением (Reinforcement Learning):
Нужно собрать и разметить очень большой объём обучающих данных
Обучение требует множества реальных примеров и длительного времени обучения
Некачественное обучение, приводящее к ошибкам в работе нейросети
Подходит не для всех видов данных

Отдельные значения временного ряда, которые сильно отличаются от большей части его значений, называются ........
Пороговые значения
Аномальные уровни
Исключаемые варианты
Пиковые значения

Данные от источника (-ов) хранятся в исходном формате без трансформаций, такой подход называется «schema-on-read», он характеризует систему хранения больших данных .......... (ответ указать на русском языке в именительном падеже)

К методам и технологиям обработки больших данных относятся:
Метод отсечений Гомори
Краудсорсинг
Метод смешения и интеграции данных
Метод визуализации аналитических данных
Метод множителей Лагранжа

Похожие работы


Строительство
Онлайн тесты
Автор: Majya

Астрономия
Онлайн тесты
Автор: Pyotr

Менеджмент
Онлайн тесты
Автор: Rodion

Информационные системы
Онлайн тесты
Автор: Anastasiya1

Другие работы автора


Социальная психология
Онлайн тесты
Автор: Majya

Маркетинг
Онлайн тесты
Автор: Majya

НЕ НАШЛИ, ЧТО ИСКАЛИ? МОЖЕМ ПОМОЧЬ.

СТАТЬ ЗАКАЗЧИКОМ