Вводная часть
1. Как выстроена работа с данными и как мы их обрабатываем?
Техническая часть — SQL
Hive
2. Что вы знаете про Hive?
3. Чем отличаются External и Internal таблицы в Hive и как с ними работать?
4. Какие есть особенности, нюансы работы и индексы на такие таблицы?
5. Где располагается location таких таблиц и как с ним работать?
6. Как будет вести себя SELECT запрос в Hive до начала подливания данных, в процессе подливания и после?
7. Какие у Hive есть движки?
8. Какие форматы файлов и форматы данных вообще есть в Big Data?
9. Какие форматы являются родными для каких фреймворков?
10. Почему формат Parquet более востребован, чем ORC?
Spark
11. Какие есть структуры данных в…