Carga de estudios de caso de Climate-ADAPT hasta la base de datos. Lista ordenada de pasos; el detalle de cada uno está en el README del proyecto correspondiente.
- Tener un CSV con URLs — Primera columna "About" con la URL de cada caso. La fuente por defecto es
pipeline/data-5.csv. Verpipeline/README.md. - Descargar HTML — Ejecutar
fetch_html.py; lee el CSV y guarda el HTML enpipeline/source_html/. Verpipeline/README.md. - Generar esquema de extracción — Opcional si ya tienes
extraction_schema_generated.json. Scriptgenerate_extraction_schema.py. Verpipeline/README.md. - Extraer JSON desde HTML — Ejecutar
extract_from_html.py; produce un JSON por página enpipeline/extracted/. Verpipeline/README.md. - Aumentar con IA — Ejecutar
augment_with_ai.py; geocodificación, años, campos preprocesados. Salida enpipeline/augmented/. Verpipeline/README.md. - Traducir — Ejecutar
translate_augmented.py; genera archivos de traducción (p. ej.*_es.json) enpipeline/augmented/. Verpipeline/README.md. - Cargar en la base de datos — Desde
packages/db:pnpm db:push. Leepipeline/augmented/, inserta o actualiza documentos y genera embeddings. Verpackages/db/README.md.
Dos casos:
- Base de datos ya existe (tu caso: cargar 100 ítems en vez de 10): solo necesitas los pasos 1–6 para los nuevos ítems y luego el paso 7 (
db:push). No hace faltadb:create. - Base de datos nueva: antes del paso 7 ejecuta una vez
pnpm db:createenpackages/dbpara crear el esquema; despuésdb:push.
- Carpeta
0_source_datasets: no se usa en el código actual; solo está en.gitignorecomo carpeta de datos fuente opcional.