MicroDrill

Simple Apache Drill alternative using PySpark inspired by PyDAL

Setup

Run terminal command pip install microdrill

Dependencies

PySpark was tested with Spark 1.6

Usage

Defining Query Parquet Table

ParquetTable(table_name, schema_index_file=file_name)

table_name: Table referenced name.
file_name: File name to search for table schema.

Using Parquet DAL

ParquetDAL(file_uri, sc)

file_uri: It can be the path to files or hdfs:// or any other location
sc: Spark Context (https://spark.apache.org/docs/1.6.0/api/python/pyspark.html#pyspark.SparkContext)

Connecting in tables

parquet_conn = ParquetDAL(file_uri, sc)

parquet_table = ParquetTable(table_name, schema_index_file=file_name)

parquet_conn.set_table(parquet_table)

Queries

Returning Table Object

parquet_conn(table_name)

Returning Field Object

parquet_conn(table_name)(field_name)

Basic Query

parquet_conn.select().where(field_object=value) for select all

parquet_conn.select(field_object, [field_object2, ...]).where(field_object=value)

parquet_conn.select(field_object1, field_object2).where(field_object1==value1 & ~field_object2==value2)

parquet_conn.select(field_object1, field_object2).where(field_object1!=value1 | field_object1.regexp(reg_exp))

Grouping By

parquet_conn.groupby(field_object1, [field_object2, ...])

Ordering By

parquet_conn.orderby(field_object1, [field_object2, ...])

parquet_conn.orderby(~field_object)

Limiting

parquet_conn.limit(number)

Executing

df = parquet_conn.execute() execute() returns a PySpark DataFrame.

Returning Field Names From Schema

parquet_conn(table_name).schema()

Developers

Install latest jdk and run in terminal make setup

Name		Name	Last commit message	Last commit date
Latest commit History 50 Commits
microdrill		microdrill
tests		tests
.gitignore		.gitignore
CHANGES.log		CHANGES.log
LICENSE		LICENSE
Makefile		Makefile
README.rst		README.rst
setup.py		setup.py
test_requirements.txt		test_requirements.txt

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

MicroDrill

Setup

Dependencies

Usage

Defining Query Parquet Table

Using Parquet DAL

Connecting in tables

Queries

Returning Table Object

Returning Field Object

Basic Query

Grouping By

Ordering By

Limiting

Executing

Returning Field Names From Schema

Developers

About

Releases

Packages

Contributors 3

Languages

License

globocom/MicroDrill

Folders and files

Latest commit

History

Repository files navigation

MicroDrill

Setup

Dependencies

Usage

Defining Query Parquet Table

Using Parquet DAL

Connecting in tables

Queries

Returning Table Object

Returning Field Object

Basic Query

Grouping By

Ordering By

Limiting

Executing

Returning Field Names From Schema

Developers

About

Resources

License

Stars

Watchers

Forks

Releases

Packages 0

Contributors 3

Languages

Packages