Estudiante de dos licenciaturas simultáneas en la UNAM (FES Acatlán): Ciencia de Datos y Matemáticas Aplicadas y Computación. Séptimo semestre de ambas, graduación prevista en junio de 2027.
Busco prácticas profesionales o una posición de becario en datos. Lo que sé hacer lo aprendí construyendo — abajo está el código.
Clasificación binaria sobre el Yelp Open Dataset (150,346 negocios) con PySpark y MLlib. Gradient Boosted Trees con AUC de 0.8225 y 84.4% de exactitud, tras subir el AUC 0.12 puntos mediante ingeniería de variables. Incluye nueve mapas coropléticos y una app en Streamlit.
PySpark · MLlib · Parquet · Folium · Streamlit
Once implementaciones propias: filtros de Bloom, MinHash, LSH, HNSW, muestreo de reservorio, MapReduce y k-medias. Cada cuaderno explica la intuición del algoritmo, su implementación y su análisis de complejidad.
Python · PySpark · NumPy
El mismo dominio implementado en PostgreSQL, MongoDB, Neo4j, BigQuery y Prolog, con 250 mil registros y cinco consultas equivalentes. PostgreSQL gana las agregaciones planas por 16×; Neo4j gana los recorridos de grafo por 1.7×; BigQuery pierde en todo a esta escala.
SQL · MQL · Cypher · BigQuery · Prolog
Modelo estrella de cinco dimensiones sobre SQL Server, poblado por ETL desde una base operativa normalizada. Regresión sobre 40,005 registros con R² de 0.9092 en prueba y validación cruzada de 0.9073 ± 0.0048.
SQL Server · pyodbc · SQLAlchemy · scikit-learn
Cuatro casos con problemas distintos, incluido uno de un millón de registros donde el análisis distingue significancia estadística de tamaño de efecto. Regresión de precios de vehículos con R² de 0.59 y MAE de 5,907 USD.
Pandas · scikit-learn · SciPy
Aplicación con interfaz gráfica que carga Excel hacia PostgreSQL, con modelo de datos normalizado en diez tablas y resolución automática de claves foráneas desde valores legibles.
Python · PostgreSQL · psycopg2 · CustomTkinter
Servicio web en Java que resuelve partidas buscando en un diccionario de 93,937 palabras, y ejecuta la misma búsqueda en paralelo y en secuencial para medir la ganancia real. El pool de hilos se dimensiona según los núcleos disponibles en tiempo de ejecución.
Java · Undertow · Maven · java.util.concurrent
Cálculo de intereses moratorios conforme a la legislación mexicana, consultando la API SIE del Banco de México para obtener la tasa oficial de cada mes del periodo. Incluye glosario de 240 términos y clasificador de perfil de riesgo del inversionista.
Python · Streamlit · API SIE de Banxico · Pandas
Datos — Python, PySpark, Pandas, NumPy, scikit-learn, MLlib, SciPy Bases de datos — PostgreSQL, SQL Server, MongoDB, Neo4j, BigQuery, SQL Visualización — Matplotlib, Seaborn, Plotly, Folium, Streamlit Otros — R, Java, Git, Jupyter, LaTeX
jaramilloarturo87@gmail.com · Ciudad de México · Bilingüe español/inglés