### ¿Qué genera este script?

Para cada sitio y fecha, el total de usuarios registrados (usuarios.usuariosRegistrados)

In [705]:
from elasticsearch import Elasticsearch, helpers
from ssl import create_default_context
import pandas as pd
import numpy as np
from datetime import datetime, timedelta
import parametros
import re
import random

## Conectando a ElasticSearch

La ultima línea se utiliza para garantizar la ejecución de la consulta
* timeout es el tiempo para cada ejecución
* max_retries el número de intentos si la conexión falla
* retry_on_timeout para activar los reitentos

In [706]:
context = create_default_context(cafile=parametros.cafile)
es = Elasticsearch(
    parametros.servidor,
    http_auth=(parametros.usuario_EC, parametros.password_EC),
    scheme="https",
    port=parametros.puerto,
    ssl_context=context,
    timeout=60, max_retries=3, retry_on_timeout=True
) 

### Calculando fechas para la ejecución

* Se calculan las fechas para asociar al nombre del indice
* fecha_hoy es usada para concatenar al nombre del indice principal previa inserción

In [707]:
now = datetime.now()
fecha_hoy = str(now.strftime("%Y.%m.%d"))

### Definiendo indice principal con fecha de hoy e indice de control

In [708]:
indice = parametros.usuarios_tablero12_index
indice_control = parametros.tableros_mintic_control

### Función para generar JSON compatible con ElactiSearch

In [709]:
def filterKeys(document):
    return {key: document[key] for key in use_these_keys }

### leyendo indice semilla-inventario

En el script que ingesta semilla, trae la información de los centros de conexión administrados. Para el indice principal se requiere:

* site_id como llave del centro de conexión.
* Datos geográficos (Departamento, municipio, centro poblado, sede, energía, latitud, longitud, COD_ISOid_Beneficiario).

In [710]:
total_docs = 10000
try:
    response = es.search(
        index= parametros.semilla_inventario_index,
        body={
               "_source": ['site_id','nombre_municipio', 'nombre_departamento', 'nombre_centro_pob', 'nombreSede' 
                           , 'energiadesc', 'latitud', 'longitud','COD_ISO','id_Beneficiario']
        },
        size=total_docs
    )
    #print(es.info())
    elastic_docs = response["hits"]["hits"]
    fields = {}
    for num, doc in enumerate(elastic_docs):
        source_data = doc["_source"]
        for key, val in source_data.items():
            try:
                fields[key] = np.append(fields[key], val)
            except KeyError:
                fields[key] = np.array([val])

    datos_semilla = pd.DataFrame(dict([ (k,pd.Series(v)) for k,v in fields.items() ])) #pd.DataFrame(fields)
except:
    print("fecha:",now,"- Error en lectura de datos semilla")
    #exit()
    

* Se valida latitud y longitud. Luego se calcula campo location
* Se renombran los campos de semilla

In [711]:
def get_location(x,y='lat'):
    patron = re.compile('^(\-?\d+(\.\d+)?),\s*(\-?\d+(\.\d+)?)$') #patrón que debe cumplir
    if (not patron.match(x) is None) and (str(x)!=''):
        return x.replace(',','.')
    else:
        #Código a ejecutar si las coordenadas no son válidas
        return '4.596389' if y=='lat' else '-74.074639'

In [712]:
datos_semilla['latitud'] = datos_semilla['latitud'].apply(lambda x:get_location(x,'lat'))
datos_semilla['longitud'] = datos_semilla['longitud'].apply(lambda x:get_location(x,'lon'))
datos_semilla['usuarios.location'] = datos_semilla['latitud'] + ',' + datos_semilla['longitud']
datos_semilla['usuarios.location']=datos_semilla['usuarios.location'].str.replace('a,a','')
datos_semilla.drop(columns=['latitud','longitud'],inplace=True)

datos_semilla = datos_semilla.rename(columns={'lugar_cod' : 'usuarios.centroDigitalUsuarios'
                                            , 'nombre_municipio': 'usuarios.nombreMunicipio'
                                            , 'nombre_departamento' : 'usuarios.nombreDepartamento'
                                            , 'nombre_centro_pob': 'usuarios.localidad'
                                            , 'nombreSede' : 'usuarios.nomCentroDigital'
                                            , 'energiadesc' : 'usuarios.sistemaEnergia'
                                            , 'COD_ISO' : 'usuarios.codISO'
                                            , 'id_Beneficiario' : 'usuarios.idBeneficiario'})
datos_semilla.fillna('', inplace=True)

### Trae la ultima fecha para control de ejecución

Cuando en el rango de tiempo de la ejecución, no se insertan nuevos valores, las fecha maxima en indice mintic no aumenta, por tanto se usa esta fecha de control para garantizar que incremente el bucle de ejecución

In [713]:
total_docs = 1
try:
    response = es.search(
        index= indice_control,
        body={
               "_source": ['usuarios.fechaControl'],
              "query": {
                "bool": {
                  "filter": [
                  {
                    "exists": {
                      "field":"jerarquia-tablero12"
                    }
                  }
                  ]
                }
              }
        },
        size=total_docs
    )
    #print(es.info())
    elastic_docs = response["hits"]["hits"]
    fields = {}
    for num, doc in enumerate(elastic_docs):
        fecha_ejecucion = doc["_source"]['usuarios.fechaControl']
except:
    fecha_ejecucion = '2021-05-01 00:00:00'
if response["hits"]["hits"] == []:
    fecha_ejecucion = '2021-05-01 00:00:00'
print("ultima fecha para control de ejecucion:",fecha_ejecucion)

ultima fecha para control de ejecucion: 2021-06-01 10:50:00


### Asociando datos de usuarios

* Se realiza lectura por día procesado
* lugar_cod se usa para cruzar con semilla por site_id
* creado es la fecha de creación del usuario
* tipodoc y documento corresponden a datos del usuario. Se usa para calcular totales

In [714]:
def traeRegistros(fecha_max,fecha_tope):
    total_docs = 10000
    response = es.search(
        index= parametros.ohmyfi_d_u_index,
        body={
                "_source": ['lugar_cod','tipodoc', 'documento', 'creado']
                  , "query": {
                  "range": {
                    "creado": {
                      "gte": fecha_max.split(' ')[0]+' 00:00:00',
                      "lt": fecha_tope.split(' ')[0]+' 23:59:59'
                      #"gte": "2021-05-26 10:00:00",
                      #"lt": "2021-05-26 15:00:00"  
                    }
                  }
              }
        },
        size=total_docs
    )
    #print(es.info())
    elastic_docs = response["hits"]["hits"]
#    fields = {}
#    for num, doc in enumerate(elastic_docs):
#        source_data = doc["_source"]
#        for key, val in source_data.items():
#            try:
#                fields[key] = np.append(fields[key], val)
#            except KeyError:
#                fields[key] = np.array([val])

#    return pd.DataFrame(dict([ (k,pd.Series(v)) for k,v in fields.items() ]))
    return pd.DataFrame([x["_source"] for x in elastic_docs])

### Se realiza consulta de datos

* Se calcula rango en base a la fecha de control. Para este caso es de un día.
* Se ejecuta la función de consulta con el rango de fechas.
* Si no retorna datos se incrementa el rango y se ejecuta nuevamente. Este proceso se repite hasta conseguir datos o hasta que el rango de ejecución alcance la fecha actual.

In [715]:
fecha_max_mintic = fecha_ejecucion
fecha_tope_mintic = (datetime.strptime(fecha_max_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(days=1)-timedelta(seconds=1)).strftime("%Y-%m-%d %H:%M:%S")
datos_registro = traeRegistros(fecha_max_mintic,fecha_tope_mintic)

if datos_registro is None or datos_registro.empty:
    while (datos_registro is None or datos_registro.empty) and ((datetime.strptime(fecha_max_mintic[0:10], '%Y-%m-%d').strftime("%Y-%m-%d %H:%M:%S")) < str(now.strftime("%Y-%m-%d %H:%M:%S"))):
        fecha_max_mintic = (datetime.strptime(fecha_max_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(days=1)).strftime("%Y-%m-%d %H:%M:%S")
        fecha_tope_mintic = (datetime.strptime(fecha_tope_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(days=1)).strftime("%Y-%m-%d %H:%M:%S")
        datos_speed = traeRegistros(fecha_max_mintic,fecha_tope_mintic)
else:
    pass

# leyendo indice cambium-devicedevices

De esta formas se asocia las MAC de dispositivos de red INDOOR y OUTDOOR

site_id para cruzar con las misma llave de semilla.
datos del dispositivo: mac, status, ip.
ap_group para identificar si la conexión es indoor/outdoor

In [716]:
total_docs = 30000
try:
    response = es.search(
        index= parametros.cambium_d_d_index,
        body={
                    "_source": ["site_id","mac","status","ip","ap_group"]
                  , "query": {
                    "match_all": {}
                  }
        },
        size=total_docs
    )
    #print(es.info())
    elastic_docs = response["hits"]["hits"]
    fields = {}
    for num, doc in enumerate(elastic_docs):
        source_data = doc["_source"]
        for key, val in source_data.items():
            try:
                fields[key] = np.append(fields[key], val)
            except KeyError:
                fields[key] = np.array([val])

    datos_dev = pd.DataFrame(dict([ (k,pd.Series(v)) for k,v in fields.items() ])) #pd.DataFrame(fields)
except:
    exit()

Se descartan registros con site_id vacios ya que no cruzarán en el merge y se limpian los NaN del dataframe

In [717]:
datos_dev.dropna(subset=['site_id'], inplace=True)
datos_dev.fillna('', inplace=True)
datos_dev = datos_dev.drop(datos_dev[(datos_dev['site_id']=='')].index)

Se corrigen datos de ap group con formato no valido

In [718]:
datos_dev['ap_group'] = datos_dev['ap_group'].str.split("-", n = 1, expand = True)[0]
datos_dev['ap_group'] = datos_dev['ap_group'].str.split("_", n = 1, expand = True)[0]
datos_dev = datos_dev.drop(datos_dev[(datos_dev['ap_group']=='')].index)

Se toman solo los datos con site_id y mac unicos

In [719]:
#datos_dev.drop_duplicates(subset=['site_id','mac'],inplace=True)
datos_dev = datos_dev.drop_duplicates('mac')

Se cambia el nombre a la mac del dispositivo de red para no confundir con la de dispositivos de usuario

In [720]:
datos_dev= datos_dev.rename(columns={'mac' : 'usuarios.macRed','ap_group' : 'usuarios.apGroup'})

# Se lee información de Ohmyfi consumos

Apartir de esta lectura se toma el valor del tiempo promedio de sesión en minutos. Se toma de referencia los campos:

fecha_inicio a partir de la cual se calcula fecha control
tiempo_sesion_minutos
mac_usuario
lugar_cod

In [721]:
def traeSesiones(fecha_max,fecha_tope):
    total_docs = 500000
    response = es.search(
        index= parametros.ohmyfi_consumos_index,
        body={
                  "_source": ["lugar_cod", "tiempo_sesion_minutos","mac_ap","fecha_inicio"]
                , "query": {
                      "range": {
                            "fecha_inicio": {
                            "gte": fecha_max,
                            "lt": fecha_tope
                            }
                        }
                  }
        },
        size=total_docs
    )
    elastic_docs = response["hits"]["hits"]
    fields = {}
    for num, doc in enumerate(elastic_docs):
        source_data = doc["_source"]
        for key, val in source_data.items():
            try:
                fields[key] = np.append(fields[key], val)
            except KeyError:
                fields[key] = np.array([val])

    return pd.DataFrame(dict([ (k,pd.Series(v)) for k,v in fields.items() ])) 

# Se ejecuta consulta de datos

Se calcula rango en base a la fecha de control. Para este caso es de 10 minutos.
Se ejecuta la función de consulta con el rango de fechas.
Si no retorna datos se incrementa el rango y se ejecuta nuevamente. Este proceso se repite hasta conseguir datos o hasta que el rango de ejecución alcance la fecha y hora actual.

In [722]:
fecha_max_mintic = fecha_ejecucion

fecha_tope_mintic = (datetime.strptime(fecha_max_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(minutes=50)-timedelta(seconds=1)).strftime("%Y-%m-%d %H:%M:%S")
datos_consumos = traeSesiones(fecha_max_mintic,fecha_tope_mintic)

if datos_consumos is None or datos_consumos.empty:
    #while (datos_consumos is None or datos_consumos.empty) and ((datetime.strptime(fecha_max_mintic[0:50], '%Y-%m-%d %H:%M:%S').strftime("%Y-%m-%d %H:%M:%S")) < str(now.strftime("%Y-%m-%d %H:%M:%S"))):
    while (datos_consumos is None or datos_consumos.empty) and ((datetime.strptime(fecha_max_mintic[0:50], '%Y-%m-%d %H:%M:%S').strftime("%Y-%m-%d %H:%M:%S")) < str(now.strftime("%Y-%m-%d %H:%M:%S"))):
        fecha_max_mintic = (datetime.strptime(fecha_max_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(minutes=50)).strftime("%Y-%m-%d %H:%M:%S")
        fecha_tope_mintic = (datetime.strptime(fecha_tope_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(minutes=50)).strftime("%Y-%m-%d %H:%M:%S")
        datos_consumos = traeSesiones(fecha_max_mintic,fecha_tope_mintic)
else:
    pass

# Total registros  a indice

la lista use_these_keys se usa para referenciar cuales campos del dataframe irán al indice final. si los datos no se declaran en este, no se insertarán

In [723]:
use_these_keys = ['usuarios.fecha'
                  ,'usuarios.siteID'
                  ,'usuarios.usuariosRegistrados'
                  , 'usuarios.anyo'
                  , 'usuarios.mes'
                  , 'usuarios.dia'
                  , 'usuarios.nomCentroDigital'
                  , 'usuarios.codISO'
                  , 'usuarios.localidad'
                  , 'usuarios.nombreDepartamento'
                  , 'usuarios.sistemaEnergia'
                  , 'usuarios.nombreMunicipio'
                  , 'usuarios.idBeneficiario'
                  , 'usuarios.location'
                  , 'usuarios.macRed'
                  , 'usuarios.fechaControl'
                  , 'usuarios.tiempoPromedioSesionSitio'
                  , 'usuarios.apGroup'
                  #, 'usuarios.hora'
                  #, 'usuarios.minuto'
                  , 'ip'
                  , 'status'
                  , 'nombreDepartamento'
                    , 'nombreMunicipio'
                    , 'idBeneficiario'
                    , 'fecha'
                    , 'anyo'
                    , 'mes'
                    , 'dia'
                  , '@timestamp']

def doc_generator(df):
    df_iter = df.iterrows()
    for index, document in df_iter:
        document = document.rename(index={ 'usuarios.fecha_x': 'usuarios.fecha','usuarios.anyo_x': 'usuarios.anyo','usuarios.mes_x':'usuarios.mes','usuarios.dia_x':'usuarios.dia','usuarios.nomCentroDigital_x':'usuarios.nomCentroDigital', 'usuarios.codISO_x':'usuarios.codISO', 'usuarios.localidad_x':'usuarios.localidad', 'usuarios.nombreDepartamento_x':'usuarios.nombreDepartamento', 'usuarios.sistemaEnergia_x':'usuarios.sistemaEnergia', 'usuarios.nombreMunicipio_x':'usuarios.nombreMunicipio', 'usuarios.idBeneficiario_x':'usuarios.idBeneficiario', 'usuarios.location_x':'usuarios.location', 'nombreDepartamento_x':'nombreDepartamento', 'nombreMunicipio_x':'nombreMunicipio', 'idBeneficiario_x':'idBeneficiario', 'fecha_x':'fecha', 'anyo_x':'anyo', 'mes_x':'mes', 'dia_x':'dia', '@timestamp_x':'@timestamp'})
        
        #print(document)
        #print("=========================")
        yield {
                "_index": indice, 
                "_id": f"{'UsuRegistro-'+ str(document['usuarios.siteID']) + '-' + str(document['usuarios.fecha']) + str(random.randrange(1000))}",
                "_source": filterKeys(document),
            }

Para cada sitio y fecha, se cuentan los documentos de usuario. Esto resulta en el total de usuarios registrados para esa fecha

In [724]:
def invalid_values(df, values=['']):
    return df.loc[df['usuarios.location'].isin(values)]

In [725]:
try:
    
    datos_registro['creado'] = datos_registro['creado'].str[0:10]
    datos_registro['tipo_mas_doc'] = datos_registro['tipodoc'] + datos_registro['documento']
    datos_registro= datos_registro.rename(columns={'creado' : 'usuarios.fecha'
                                                  ,'lugar_cod':'site_id'})

    datos_registro = datos_registro[["usuarios.fecha","site_id","tipo_mas_doc"]].groupby(["usuarios.fecha","site_id"]).agg(['count']).reset_index()
    datos_registro.columns = datos_registro.columns.droplevel(1)
    datos_registro= datos_registro.rename(columns={'tipo_mas_doc' : 'usuarios.usuariosRegistrados'})
    datos_registro["usuarios.anyo"] = datos_registro["usuarios.fecha"].str[0:4]
    datos_registro["usuarios.mes"] = datos_registro["usuarios.fecha"].str[5:7]
    datos_registro["usuarios.dia"] = datos_registro["usuarios.fecha"].str[8:10]
    datos_registro = pd.merge(datos_registro,  datos_semilla, on='site_id', how='inner')
    datos_registro.rename(columns={'site_id': 'usuarios.siteID'
                               }, inplace=True)
    
    datos_registro['nombreDepartamento'] = datos_registro['usuarios.nombreDepartamento']
    datos_registro['nombreMunicipio'] = datos_registro['usuarios.nombreMunicipio']
    datos_registro['idBeneficiario'] = datos_registro['usuarios.idBeneficiario']
    datos_registro['fecha'] = datos_registro['usuarios.fecha']
    datos_registro['anyo'] = datos_registro['usuarios.anyo']
    datos_registro['mes'] = datos_registro['usuarios.mes']
    datos_registro['dia'] = datos_registro['usuarios.dia']
    
    datos_registro['@timestamp'] = now.isoformat()
    #salida = helpers.bulk(es, doc_generator(datos_registro))
    #print("Fecha: ", now,"- Datos Registro usuarios en indice principal:",salida[0])
except Exception as e:
    print("Fecha: ", now,"- Nada que insertar en indice principal",e)

In [726]:
datos_registro.head()

Unnamed: 0,usuarios.fecha,usuarios.siteID,usuarios.usuariosRegistrados,usuarios.anyo,usuarios.mes,usuarios.dia,usuarios.nomCentroDigital,usuarios.codISO,usuarios.localidad,usuarios.nombreDepartamento,...,usuarios.idBeneficiario,usuarios.location,nombreDepartamento,nombreMunicipio,idBeneficiario,fecha,anyo,mes,dia,@timestamp
0,2021-06-01,10501-ZZZY338,16,2021,6,1,I. E. R. CAMPESTRE NUEVO HORIZONTE,CO-ANT,LA CHAPA,ANTIOQUIA,...,10501,"6.040555556,-75.91194444",ANTIOQUIA,EL CARMEN DE VIBORAL,10501,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
1,2021-06-02,10501-ZZZY338,4,2021,6,2,I. E. R. CAMPESTRE NUEVO HORIZONTE,CO-ANT,LA CHAPA,ANTIOQUIA,...,10501,"6.040555556,-75.91194444",ANTIOQUIA,EL CARMEN DE VIBORAL,10501,2021-06-02,2021,6,2,2021-08-09T13:00:47.616387
2,2021-06-01,10835-ZGYO372,2,2021,6,1,E.U. SIETE DE AGOSTO,CO-ANT,CALLE 115 # 06 - 60,ANTIOQUIA,...,10835,"10.88307108,-75.077732850",ANTIOQUIA,TURBO,10835,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
3,2021-06-02,10835-ZGYO372,4,2021,6,2,E.U. SIETE DE AGOSTO,CO-ANT,CALLE 115 # 06 - 60,ANTIOQUIA,...,10835,"10.88307108,-75.077732850",ANTIOQUIA,TURBO,10835,2021-06-02,2021,6,2,2021-08-09T13:00:47.616387
4,2021-06-01,11107-ZGYO062,5,2021,6,1,MARIA INMACULADA,CO-ATL,CALLE 15 12 - 20,ATLÁNTICO,...,11107,"10.504888,-74.816395",ATLÁNTICO,BARANOA,11107,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387


In [727]:
datos_registro.info()

<class 'pandas.core.frame.DataFrame'>
Int64Index: 639 entries, 0 to 638
Data columns (total 22 columns):
 #   Column                        Non-Null Count  Dtype 
---  ------                        --------------  ----- 
 0   usuarios.fecha                639 non-null    object
 1   usuarios.siteID               639 non-null    object
 2   usuarios.usuariosRegistrados  639 non-null    int64 
 3   usuarios.anyo                 639 non-null    object
 4   usuarios.mes                  639 non-null    object
 5   usuarios.dia                  639 non-null    object
 6   usuarios.nomCentroDigital     639 non-null    object
 7   usuarios.codISO               639 non-null    object
 8   usuarios.localidad            639 non-null    object
 9   usuarios.nombreDepartamento   639 non-null    object
 10  usuarios.sistemaEnergia       639 non-null    object
 11  usuarios.nombreMunicipio      639 non-null    object
 12  usuarios.idBeneficiario       639 non-null    int64 
 13  usuarios.location   

In [728]:
try:
    datos_consumos = datos_consumos.rename(columns={'lugar_cod' :'site_id'})
    datos_consumos['mac_ap'] = datos_consumos['mac_ap'].str.replace('-',':')
    datos_consumos['fecha_control'] = datos_consumos["fecha_inicio"].str[0:-4] + '0:00'
    tiempoPromedioSesionSitio=datos_consumos[['site_id','mac_ap','fecha_control','tiempo_sesion_minutos']].groupby(['site_id','mac_ap','fecha_control']).agg(['mean']).reset_index()
    tiempoPromedioSesionSitio.columns = tiempoPromedioSesionSitio.columns.droplevel(1)
    tiempoPromedioSesionSitio = tiempoPromedioSesionSitio.rename(columns={'tiempo_sesion_minutos' : 'usuarios.tiempoPromedioSesionSitio'})
    tiempoPromedioSesionSitio['usuarios.tiempoPromedioSesionSitio'] = round(tiempoPromedioSesionSitio['usuarios.tiempoPromedioSesionSitio'],6)
    tiempoPromedioSesionSitio = tiempoPromedioSesionSitio.rename(columns={'mac_ap' : 'usuarios.macRed'
                                                                     , 'fecha_control' : 'usuarios.fechaControl'})
    tiempoPromedioSesionSitio = pd.merge(tiempoPromedioSesionSitio,datos_semilla, on ='site_id', how='inner')
    tiempoPromedioSesionSitio = pd.merge(tiempoPromedioSesionSitio, datos_dev, on=['site_id','usuarios.macRed'], how='left')
    tiempoPromedioSesionSitio.fillna({'usuarios.apGroup':'No identificado'},inplace=True)
    
    tiempoPromedioSesionSitio = tiempoPromedioSesionSitio.rename(columns={'site_id' : 'usuarios.siteID'})
    tiempoPromedioSesionSitio["usuarios.fecha"] = tiempoPromedioSesionSitio["usuarios.fechaControl"].str[0:10]
    tiempoPromedioSesionSitio["usuarios.anyo"] = tiempoPromedioSesionSitio["usuarios.fecha"].str[0:4]
    tiempoPromedioSesionSitio["usuarios.mes"] = tiempoPromedioSesionSitio["usuarios.fecha"].str[5:7]
    tiempoPromedioSesionSitio["usuarios.dia"] = tiempoPromedioSesionSitio["usuarios.fecha"].str[8:10]
    tiempoPromedioSesionSitio["usuarios.hora"] = tiempoPromedioSesionSitio["usuarios.fechaControl"].str.split(" ", n = 1, expand = True)[1].str.split(":", n = 2, expand = True)[0]["usuarios.hora"] = tiempoPromedioSesionSitio["usuarios.fechaControl"].str.split(" ", n = 1, expand = True)[1].str.split(":", n = 2, expand = True)[0]
    tiempoPromedioSesionSitio["usuarios.minuto"] = tiempoPromedioSesionSitio["usuarios.fechaControl"].str.split(" ", n = 1, expand = True)[1].str.split(":", n = 2, expand = True)[1]
    
    tiempoPromedioSesionSitio['nombreDepartamento'] = tiempoPromedioSesionSitio['usuarios.nombreDepartamento']
    tiempoPromedioSesionSitio['nombreMunicipio'] = tiempoPromedioSesionSitio['usuarios.nombreMunicipio']
    tiempoPromedioSesionSitio['idBeneficiario'] = tiempoPromedioSesionSitio['usuarios.idBeneficiario']
    tiempoPromedioSesionSitio['fecha'] = tiempoPromedioSesionSitio['usuarios.fecha']
    tiempoPromedioSesionSitio['anyo'] = tiempoPromedioSesionSitio['usuarios.anyo']
    tiempoPromedioSesionSitio['mes'] = tiempoPromedioSesionSitio['usuarios.mes']
    tiempoPromedioSesionSitio['dia'] = tiempoPromedioSesionSitio['usuarios.dia']
    
    tiempoPromedioSesionSitio['@timestamp'] = now.isoformat()
    #salida = helpers.bulk(es, doc_generator(tiempoPromedioSesionSitio))
    #print("Fecha: ", now,"- Tiempo promedio sesion en sitio insertado en indice principal:",salida[0])
except Exception as e:
    print("Fecha: ", now,"- Nada para insertar en indice principal",e)

In [729]:
tiempoPromedioSesionSitio.head()

Unnamed: 0,usuarios.siteID,usuarios.macRed,usuarios.fechaControl,usuarios.tiempoPromedioSesionSitio,usuarios.nomCentroDigital,usuarios.codISO,usuarios.localidad,usuarios.nombreDepartamento,usuarios.sistemaEnergia,usuarios.nombreMunicipio,...,usuarios.hora,usuarios.minuto,nombreDepartamento,nombreMunicipio,idBeneficiario,fecha,anyo,mes,dia,@timestamp
0,16733-ZZZY574,BC:E6:7C:5B:AF:87,2021-06-01 10:50:00,0.12,CENTRO EDUCATIVO RURAL ARROYO ARENA,CO-SUC,CORREG. LA PE¥ATA,SUCRE,RED INTERCONECTADA,SINCELEJO,...,10,50,SUCRE,SINCELEJO,16733,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
1,16733-ZZZY574,BC:E6:7C:5B:AF:BE,2021-06-01 10:50:00,1.78,CENTRO EDUCATIVO RURAL ARROYO ARENA,CO-SUC,CORREG. LA PE¥ATA,SUCRE,RED INTERCONECTADA,SINCELEJO,...,10,50,SUCRE,SINCELEJO,16733,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
2,18988-ZGYO386,BC:E6:7C:4E:3D:4D,2021-06-01 10:50:00,0.4,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,RED INTERCONECTADA,ARBOLETES,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
3,18988-ZGYO386,BC:E6:7C:4E:3D:D4,2021-06-01 10:50:00,1.07,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,RED INTERCONECTADA,ARBOLETES,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
4,19560-ZZZY119,BC:E6:7C:E7:FC:35,2021-06-01 10:50:00,0.565,E U LA ILUSION,CO-ANT,CORREG. LA ILUSIÓN,ANTIOQUIA,RED INTERCONECTADA,CAUCASIA,...,10,50,ANTIOQUIA,CAUCASIA,19560,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387


In [730]:
tiempoPromedioSesionSitio.info()

<class 'pandas.core.frame.DataFrame'>
Int64Index: 142 entries, 0 to 141
Data columns (total 29 columns):
 #   Column                              Non-Null Count  Dtype  
---  ------                              --------------  -----  
 0   usuarios.siteID                     142 non-null    object 
 1   usuarios.macRed                     142 non-null    object 
 2   usuarios.fechaControl               142 non-null    object 
 3   usuarios.tiempoPromedioSesionSitio  142 non-null    float64
 4   usuarios.nomCentroDigital           142 non-null    object 
 5   usuarios.codISO                     142 non-null    object 
 6   usuarios.localidad                  142 non-null    object 
 7   usuarios.nombreDepartamento         142 non-null    object 
 8   usuarios.sistemaEnergia             142 non-null    object 
 9   usuarios.nombreMunicipio            142 non-null    object 
 10  usuarios.idBeneficiario             142 non-null    int64  
 11  usuarios.location                   142 non-n

In [731]:
try:
    #result=pd.merge(datos_registro, tiempoPromedioSesionSitio,on=['usuarios.siteID'],how='outer')
    result=pd.merge(datos_registro, tiempoPromedioSesionSitio,on=['usuarios.siteID'],how='inner')
    #salida = helpers.bulk(es, doc_generator(result,use_these_keys))
    result.fillna('', inplace=True)
    #result['usuarios.fechaControl'] = fecha_ejecucion
    result['usuarios.fecha_x'] = fecha_ejecucion[0:4] + '-' + fecha_ejecucion[5:7] + '-' + fecha_ejecucion[8:10]
    #result['usuarios.location_x'] = "0.0000000,0.0000000"
    
    salida = helpers.bulk(es, doc_generator(result))
    print("Fecha: ", now,"- Tiempo promedio sesion en sitio insertado en indice principal:",salida[0])
except Exception as e:
    print(e)
    print("Fecha: ", now,"- Nada para insertar en indice principal")

Fecha:  2021-08-09 13:00:47.616387 - Tiempo promedio sesion en sitio insertado en indice principal: 197


In [732]:
#salida = helpers.bulk(es, doc_generator(result))

In [733]:
result.head()

Unnamed: 0,usuarios.fecha_x,usuarios.siteID,usuarios.usuariosRegistrados,usuarios.anyo_x,usuarios.mes_x,usuarios.dia_x,usuarios.nomCentroDigital_x,usuarios.codISO_x,usuarios.localidad_x,usuarios.nombreDepartamento_x,...,usuarios.hora,usuarios.minuto,nombreDepartamento_y,nombreMunicipio_y,idBeneficiario_y,fecha_y,anyo_y,mes_y,dia_y,@timestamp_y
0,2021-06-01,18988-ZGYO386,3,2021,6,1,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
1,2021-06-01,18988-ZGYO386,3,2021,6,1,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
2,2021-06-01,18988-ZGYO386,2,2021,6,2,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
3,2021-06-01,18988-ZGYO386,2,2021,6,2,E R ANTONIO NARIÑO,CO-ANT,VILLANUEVA,ANTIOQUIA,...,10,50,ANTIOQUIA,ARBOLETES,18988,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387
4,2021-06-01,19695-ZZZY031,6,2021,6,1,C. E. R. LAS CRUCES,CO-ANT,LAS CRUCES,ANTIOQUIA,...,10,50,ANTIOQUIA,COCORNÁ,19695,2021-06-01,2021,6,1,2021-08-09T13:00:47.616387


In [734]:
result.info()

<class 'pandas.core.frame.DataFrame'>
Int64Index: 197 entries, 0 to 196
Data columns (total 50 columns):
 #   Column                              Non-Null Count  Dtype  
---  ------                              --------------  -----  
 0   usuarios.fecha_x                    197 non-null    object 
 1   usuarios.siteID                     197 non-null    object 
 2   usuarios.usuariosRegistrados        197 non-null    int64  
 3   usuarios.anyo_x                     197 non-null    object 
 4   usuarios.mes_x                      197 non-null    object 
 5   usuarios.dia_x                      197 non-null    object 
 6   usuarios.nomCentroDigital_x         197 non-null    object 
 7   usuarios.codISO_x                   197 non-null    object 
 8   usuarios.localidad_x                197 non-null    object 
 9   usuarios.nombreDepartamento_x       197 non-null    object 
 10  usuarios.sistemaEnergia_x           197 non-null    object 
 11  usuarios.nombreMunicipio_x          197 non-n

## Actualiza fecha control

* Se actualiza la fecha de control. Si el calculo supera la fecha actual, se asocia esta ultima.

In [738]:
fecha_ejecucion= (datetime.strptime(fecha_max_mintic, '%Y-%m-%d %H:%M:%S')+timedelta(minutes=10)).strftime("%Y-%m-%d %H:%M:%S")[0:15] + '0:00'    

if fecha_ejecucion > str(now.strftime('%Y-%m-%d %H:%M:%S'))[0:15] + '0:00':
    fecha_ejecucion = str(now.strftime('%Y-%m-%d %H:%M:%S'))[0:15] + '0:00'
response = es.index(
        index = indice_control,
        id = 'jerarquia-tablero12',
        body = { 'jerarquia-tablero12': 'jerarquia-tablero12','usuarios.fechaControl' : fecha_ejecucion}
)
print("actualizada fecha control de ejecucion:",fecha_ejecucion)

actualizada fecha control de ejecucion: 2021-06-01 11:00:00
