Задачи BigData:
- Обработка большого объема данных. Получить информацию из данных, либо структурировать неструктурированное. Решение: парадигма MapReduce.
- Сырье – неструктурированные даные;
- Кузнец - MapReduce;
- Изделие – информация или структурирование неструктурированного;
Задачи BigData:
2) Извлечение ничтожно малого объема данных из огромного колличества информации с низкой предсказуемой задержкой. Достать иголку из стога сена и очень быстро.
Решение: парадигма NoSQL.
-
Обработка большого объема данных. Получить информацию из данных, либо структурировать неструктурированное(построение инвертированного индекса). Решение: парадигма MapReduce. Hadoop = распределенная файловая система + MapReduce обработчик файловой системы
-
Извлечение ничтожно малого объема данных из огромного колличества информации с низкой предсказуемой задержкой. Достать иголку из стога сена и очень быстро(поисковый запрос в google). Решение: парадигма NoSQL. Oracle NoSQL Database – база данных типа NoSQL (key-value)
Hadoop Distributed File System (HDFS) |Oracle NoSQL Database
1.Пакетная обработка |1.Real-Time
2.Подготавливает данные для дальнейшего |2.Предоставляет сервис (frontend)
использования (backend) |
3.Пакетные запросы |3.Быстрый доступ к конкретной строке
4.Один раз записано, читается многократно |4.Read, write, delete update
5.Файловая система |5.База данных
6.Параллельное сканирование |6.Индексный доступ
7.Нет структуры |7.Простая модель данных
8.Последовательное чтение |8.Произвольный доступ
9.select /*+ FULL(tab) */
sum(tab.a),b
from big_table tab
where
….
group by b
9.select /*+ index(tab tab_i) */ * from big_table tab where pk_col=123
Hadoop это:
- Среда распределенных вычислений MapReduce.
- Распределенная файловая система.
(одна файловая система на множество физических серверов) HDFS
Дано:
- Файлы, генерируемые “черным ящиком” Файлы без единого переноса строки, размером несколько сотен Мб. Суммарный объем десятки Тб.
- Мета-описание этих файлов (Excel). Примечание: формат файлов меняется раз в несколько недель.
Необходимо:
- Хранить всю первичную информацию в течении нескольких лет.
- Загружать часть полей в РСУБД Oracle (~ 50 из 1000).
- Список полей, необходимых для загрузки в РСУБД постоянно меняется.
- MapReduce преобразует файлы в json (или другой полуструктурированный формат).
- Hive получаем выборку данных, которую загружаем в Oracle RDBMS.
В случае изменения формата входных данных:
- Меняем формат таблицы в РСУБД Oracle (alter table add column …).
- Обновляем файл описания формата. (hadoop fs –put new.file /hadoop_dir/).
- Меняем HQL. select col1,col3 from table -> select col1, col3, col_new from table
Система HDFS разбивает входящие данные на несколько пакетов и распределяет их по разным серверам, подключенным в кластеры. Таким образом, каждый сервер хранит фрагмент всего набора данных, и все такие фрагменты реплицируются на более чем один сервер для обеспечения отказоустойчивости.