Skip to content
View ARJASA67's full-sized avatar
  • Ciudad de México
  • 19:53 (UTC -12:00)
  • Joined Aug 28, 2026

Block or report ARJASA67

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
ARJASA67/README.md

Arturo Jaramillo Salmerón

Estudiante de dos licenciaturas simultáneas en la UNAM (FES Acatlán): Ciencia de Datos y Matemáticas Aplicadas y Computación. Séptimo semestre de ambas, graduación prevista en junio de 2027.

Busco prácticas profesionales o una posición de becario en datos. Lo que sé hacer lo aprendí construyendo — abajo está el código.


Proyectos

Clasificación binaria sobre el Yelp Open Dataset (150,346 negocios) con PySpark y MLlib. Gradient Boosted Trees con AUC de 0.8225 y 84.4% de exactitud, tras subir el AUC 0.12 puntos mediante ingeniería de variables. Incluye nueve mapas coropléticos y una app en Streamlit.

PySpark · MLlib · Parquet · Folium · Streamlit

Once implementaciones propias: filtros de Bloom, MinHash, LSH, HNSW, muestreo de reservorio, MapReduce y k-medias. Cada cuaderno explica la intuición del algoritmo, su implementación y su análisis de complejidad.

Python · PySpark · NumPy

El mismo dominio implementado en PostgreSQL, MongoDB, Neo4j, BigQuery y Prolog, con 250 mil registros y cinco consultas equivalentes. PostgreSQL gana las agregaciones planas por 16×; Neo4j gana los recorridos de grafo por 1.7×; BigQuery pierde en todo a esta escala.

SQL · MQL · Cypher · BigQuery · Prolog

Modelo estrella de cinco dimensiones sobre SQL Server, poblado por ETL desde una base operativa normalizada. Regresión sobre 40,005 registros con R² de 0.9092 en prueba y validación cruzada de 0.9073 ± 0.0048.

SQL Server · pyodbc · SQLAlchemy · scikit-learn

Cuatro casos con problemas distintos, incluido uno de un millón de registros donde el análisis distingue significancia estadística de tamaño de efecto. Regresión de precios de vehículos con R² de 0.59 y MAE de 5,907 USD.

Pandas · scikit-learn · SciPy

Aplicación con interfaz gráfica que carga Excel hacia PostgreSQL, con modelo de datos normalizado en diez tablas y resolución automática de claves foráneas desde valores legibles.

Python · PostgreSQL · psycopg2 · CustomTkinter

Servicio web en Java que resuelve partidas buscando en un diccionario de 93,937 palabras, y ejecuta la misma búsqueda en paralelo y en secuencial para medir la ganancia real. El pool de hilos se dimensiona según los núcleos disponibles en tiempo de ejecución.

Java · Undertow · Maven · java.util.concurrent

Cálculo de intereses moratorios conforme a la legislación mexicana, consultando la API SIE del Banco de México para obtener la tasa oficial de cada mes del periodo. Incluye glosario de 240 términos y clasificador de perfil de riesgo del inversionista.

Python · Streamlit · API SIE de Banxico · Pandas


Stack

Datos — Python, PySpark, Pandas, NumPy, scikit-learn, MLlib, SciPy Bases de datos — PostgreSQL, SQL Server, MongoDB, Neo4j, BigQuery, SQL Visualización — Matplotlib, Seaborn, Plotly, Folium, Streamlit Otros — R, Java, Git, Jupyter, LaTeX


Contacto

jaramilloarturo87@gmail.com · Ciudad de México · Bilingüe español/inglés

Pinned Loading

  1. algoritmos-datos-masivos algoritmos-datos-masivos Public

    Implementaciones desde cero de filtros de Bloom, MinHash, LSH, HNSW, muestreo de reservorio, MapReduce y k-medias, con su análisis de complejidad.

    Jupyter Notebook

  2. benchmark-multimotor-bd benchmark-multimotor-bd Public

    Benchmark de PostgreSQL, MongoDB, Neo4j, BigQuery y Prolog sobre el mismo dominio y 250 mil registros, con cinco consultas equivalentes.

    Jupyter Notebook

  3. datawarehouse-ventas-sqlserver datawarehouse-ventas-sqlserver Public

    Modelo estrella en SQL Server con ETL desde una base operativa y regresión sobre 40 mil ventas con R² de 0.909 y validación cruzada.

    Jupyter Notebook

  4. willitthrive-yelp-pyspark willitthrive-yelp-pyspark Public

    Clasificación binaria sobre el Yelp Open Dataset (150K negocios) con PySpark y MLlib. Gradient Boosted Trees con AUC de 0.82 y 84% de exactitud.

    Jupyter Notebook

  5. wordle-solver-paralelo wordle-solver-paralelo Public

    Servicio web en Java que resuelve Wordle sobre 93,937 palabras comparando búsqueda paralela contra secuencial, con medición en nanosegundos.

    Java

  6. finanzas-cuantitativas finanzas-cuantitativas Public

    Cálculo de intereses moratorios con la API SIE de Banxico, glosario de 240 términos financieros y clasificador de perfil de riesgo.

    Python