SF-1 Reglas para archivos Excel utilizados por el Creador de DataFrames (DFC)

DataFrame Creator (DFC) de la biblioteca Datalytics está diseñado para ser el objeto principal para incorporar datos al modelo de manera batchwise (por lotes). Las fuentes típicas de datos son archivos Excel (datos de planta descargados mediante Historian o módulos DCS) o archivos CSV, y se prevé agregar mayor soporte para bases de datos durante el segundo semestre de 2025.

Cuando se crea un nuevo DFC, la configuración predeterminada obliga a indicar la ubicación del archivo de datos. Recomendamos almacenar los datos en una subcarpeta llamada “\Datasets” (un nivel por debajo de donde se encuentra el modelo). El objeto recuerda la ruta relativa, por lo que, al transferir el modelo a otra persona, este seguirá funcionando siempre que el archivo de datos también sea transferido y se mantenga en la misma ubicación relativa.

Screenshot of DFC dialog showing the default settings

Después de seleccionar el archivo, DFC detecta los nombres de las hojas y llena la lista desplegable con las hojas disponibles. Debe seleccionar la hoja correcta y pulsar “Update”, seguido de “Read Data”.

Si la hoja seleccionada no contiene datos en las primeras 5 columnas consecutivas o en las primeras filas, DFC dejará de buscar más datos y devolverá un rango modificado a A1:A1 en lugar del valor predeterminado A1:IV200000.

Una vez seleccionada una hoja válida y leídos los datos, el detector automático de datos de DFC sigue las siguientes reglas:

  1. Busca los nombres de las columnas (headers) en la primera fila no vacía. Recomendamos no dejar filas en blanco al inicio de la hoja. También recomendamos encarecidamente utilizar encabezados descriptivos (se permiten espacios) que no sean demasiado largos, ya que estos textos se utilizarán para poblar diversos objetos de análisis y listas desplegables de SharpBot. Encabezados muy largos pueden dificultar la diferenciación entre variables durante el análisis.
  2. DFC lee hasta 200.000 filas (incluyendo filas vacías si el conjunto de datos contiene menos de 200.000 filas). A partir de una selección aleatoria de filas, intenta identificar el tipo de dato de cada columna (por ejemplo: fecha/hora, número, texto o booleano).
  3. Una vez determinados los tipos de datos, comienza desde la fila inmediatamente debajo de los encabezados y busca datos válidos dentro de las siguientes 20 filas. Esto permite incluir filas con resúmenes, estadísticas u otra información en Excel, siempre que la primera fila de datos reales esté completa y sin valores faltantes. En el ejemplo mostrado en la imagen de referencia, los encabezados se capturan desde la fila 1 comenzando en la columna D. Las columnas A, B y C son ignoradas porque están vacías. La primera fila real de datos fue correctamente identificada como la fila 19, ya que las filas 2 a 17 de la primera columna de datos contenían textos mientras que DFC esperaba una fecha. De no haber sido así, DFC podría haber interpretado incorrectamente que los datos comenzaban en la fila 2 o en cualquier otra fila entre la 2 y la 19.
  4. Si existiera un número en la fila 18, DFC podría confundirlo con una fecha y, para empeorar la situación, asumir que dicho valor representa la marca de tiempo inicial (starting timestamp).
  5. Una vez determinada la fila inicial de datos, DFC leerá hasta el final de los datos o hasta la fila 2000.

Durante la primera ejecución, DFC identificará automáticamente la cantidad correcta de columnas y el número válido de filas. Si el conjunto de datos real supera las 2000 filas, puede ajustar manualmente el valor de la fila final.

Una vez confirmada la lectura correcta del rango de datos en la hoja adecuada, puede seguir ajustando el rango para definir qué parte de los datos desea utilizar.

  • Si los datos contienen múltiples pares de columnas fecha–valor (deben estar organizadas obligatoriamente en pares), DFC tratará correctamente los datos como series temporales.
  • Recomendamos no dejar columnas vacías entre columnas con datos válidos.
  • Se permiten datos incompletos o irregulares (jagged data). Puede optar por rellenar los valores faltantes mediante alguno de los métodos disponibles en DFC.

Confirme que DFC ha leído los datos correctamente revisando la tabla “Sample Data” en la pestaña Outputs. Esta tabla contiene una muestra de los datos: comienza con las primeras filas y termina con las últimas filas detectadas. Si DFC se ha confundido al identificar el inicio de los datos, los errores serán evidentes en las filas superiores o inferiores de esta muestra.

Para una operación más confiable

  • Proporcione datos de Excel sin columnas ni filas vacías a la izquierda ni en la parte superior.
  • Utilice encabezados descriptivos pero breves en la primera fila.
  • Los datos faltantes son aceptables.
  • Defina manualmente el rango de datos cuando sea posible. La detección automática es un buen punto de partida, pero es preferible especificar explícitamente los nombres de las columnas dentro de los rangos. El número de filas se ajusta automáticamente según la cantidad real de filas leídas.

Resolución de problemas

En caso de que DFC falle al leer los datos, revise los registros de errores (error logs).

Si el archivo queda bloqueado por Excel debido a errores, utilice el Administrador de tareas para finalizar el proceso “Excel”.

Deja un comentario