Operadores integrados en Lakeflow Designer

Lakeflow Designer incluye operadores integrados para tareas comunes de preparación y transformación de datos. Abra el menú del operador en el panel lateral de la izquierda para examinar operadores por categoría o use Buscar un operador... en la parte superior del panel. La búsqueda de operadores sugiere operadores en función de la intención. Por ejemplo, escribir average by month devuelve el operador Aggregate . Para configurar un operador después de agregarlo al lienzo, haga doble clic en él o mantenga el puntero sobre él y haga clic en Icono de lápiz. (Operador Editar) para abrir el panel de configuración.

Menú del operador LFD que muestra el cuadro de búsqueda del operador y los operadores agrupados por categoría.

Cada operador muestra una descripción generada por ia de lo que hace. La descripción también actúa como editor para el operador: la edición de la descripción vuelve a configurar el operador para que coincida con la descripción.

Para obtener información sobre cómo crear sus propios operadores definidos por el usuario, consulte Operadores definidos por el usuario en Lakeflow Designer.

Origen y salida

Source

Importa datos en el Diseñador desde una tabla de catálogo de Unity u otro origen compatible. Para seleccionar un origen, busque una tabla o un archivo por nombre, o busque por catálogo y esquema. También puede crear una nueva tabla desde este panel.

Después de seleccionar una tabla, el panel muestra el nombre, el propietario y la hora de la última actualización de la tabla. Haga clic en Seleccionar un nuevo origen de datos para cambiar el origen. Al cambiar el origen, se invalida la memoria caché de salida para todos los operadores de bajada.

También puede usar una vista de métricas del catálogo de Unity como origen. Al seleccionar una vista de métricas, seleccione las dimensiones y medidas que se van a incluir y el Diseñador genera la consulta agregada automáticamente.

Para obtener toda la gama de opciones de ingesta de datos, incluido el destino de un volumen o carpeta completo del catálogo de Unity, consulte Ingesta de datos en Lakeflow Designer.

Escribir datos

Crea una tabla escribiendo valores en un editor de estilo de hoja de cálculo. Use este operador para agregar pequeñas cantidades de datos de referencia, como valores de búsqueda o datos de prueba, sin crear una tabla de origen independiente.

Campo Description
Datos de tabla Escriba los datos como una tabla. La primera fila define los encabezados de columna y las filas restantes son los datos. El diseñador deduce el tipo de datos de cada columna a partir de sus valores.

Salida

Exporta datos fuera del Diseñador. El operador Output puede escribir resultados en una tabla de catálogo de Unity, publicarlos como una vista materializada o escribirlos en un archivo en un volumen de catálogo de Unity. Seleccione el destino con tipo de salida.

Tipo de salida Description
Table Escribe los resultados en una tabla de catálogo de Unity administrada. Establezca un nombre de tabla y una ubicación de salida (catálogo y esquema) y, a continuación, seleccione un modo de escritura.
Vista materializada Publica los resultados como una vista materializada en el Catálogo de Unity que se actualiza cuando se ejecuta la preparación de datos visuales.
File Escribe los resultados en un archivo en un volumen de catálogo de Unity. Seleccione un tipo de archivo CSV, Excel o JSON y, a continuación, establezca el volumen de destino y el nombre de archivo.

Para una salida de tabla o archivo , seleccione cómo cada ejecución escribe en el destino con el modo de escritura:

Modo de escritura Description
Sobrescribir Reemplaza el contenido existente por los resultados de la ejecución actual. Este es el valor predeterminado.
Append Agrega los resultados de la ejecución actual a las filas existentes.
Merge Upserats se empieza en la tabla objetivo haciendo coincidencia con las claves de fusión que especifiques. Disponible para las salidas de tabla.

Haga clic en Ejecutar para ejecutar la preparación de datos visuales y escribir los resultados. Para una salida de tabla, si la tabla no existe, el operador lo crea. Las ejecuciones programadas escriben en el destino con el mismo modo de escritura.

Función ai

Ejecuta una operación de inteligencia artificial integrada en los datos. En el panel de configuración, abra Seleccionar una función y seleccione una de las funciones de la tabla siguiente. Cada función expone opciones en el panel para las entradas (por ejemplo, columnas, avisos, etiquetas o idiomas) y salidas.

Function Description
ai_analyze_sentiment Realiza análisis de sentimiento en el texto de entrada.
ai_classify Clasifica el texto o los documentos analizados mediante etiquetas que proporcione.
ai_extract Extrae datos estructurados de texto o documentos analizados mediante campos definidos.
ai_fix_grammar Corrige errores gramaticales en el texto.
ai_forecast Prevé datos de series temporales hasta un horizonte que especifique. ai_forecast es una función con valores de tabla que procesa toda la tabla de entrada.
ai_gen Responde a un mensaje proporcionado por el usuario en la entrada.
ai_mask Enmascara las entidades especificadas en el texto (por ejemplo, para la desidentificación).
ai_parse_document Extrae texto, tablas y diseño de documentos no estructurados.
ai_prep_search Transforma la salida del documento analizado en fragmentos listos para búsqueda para canalizaciones de búsqueda de vectores y generación aumentada por recuperación (RAG).
ai_query Responde a una solicitud con cualquier modelo de base compatible, para la flexibilidad del modelo y la tarea de uso general.
ai_similarity Compara dos cadenas y devuelve una puntuación de similitud semántica.
ai_summarize Genera un resumen del texto.
ai_translate Traduce el texto en un idioma de destino que especifique.

Para más detalles sobre cada función, véase Transformar datos no estructurados usando funciones de IA.

Transformations

Los operadores siguientes realizan transformaciones en los datos.

Aggregate

Resume las filas mediante la agrupación de datos y los valores agregados informáticos.

Campo Description
Agregar por Seleccione una columna, seleccione una función de agregación y proporcione un nombre para la columna de salida. Haga clic en + Agregar agregación para agregar más. Funciones soportadas: AVG, COUNT, COUNT DISTINCT, MAXMEAN, MEDIAN, , MIN, PERCENTILE, STDDEVSUM. VARIANCE
Agrupar por Seleccione las columnas por las que agrupar. Haga clic en + Agregar agrupación para agregar más. Las columnas usadas en Group by se incluyen automáticamente en la salida.

Combine

Combina datos de varias tablas con esquemas coincidentes en una única salida.

Campo Description
Establecer operación Seleccione Unión, Intersección o Excepto.
Estrategia de combinación Seleccione Distinct (Distinct) para excluir filas duplicadas de la salida o All (Todo ) para mantener todas las filas, incluidos los duplicados.

Unique

Elimina filas duplicadas de los datos de entrada. Por defecto, el operador desduplica en todas las columnas. En su lugar, puedes elegir un subconjunto de columnas como clave y ordenar las filas para controlar qué duplicado se mantiene.

Campo Description
Único por Selecciona Todas las columnas para eliminar filas idénticas en cada columna, o Seleccionadas para eliminar filas que son duplicadas solo en las columnas que elijas como clave.
Ordenar por Opcional: seleccionar una o más columnas y una dirección de ordenación para controlar qué fila se mantiene para cada conjunto de duplicados. Si no configuras un orden, el operador se queda con la primera fila que se encuentre.

Filter

Divide las filas en función de si cumplen una o varias condiciones mediante un generador gráfico de condiciones.

Campo Description
Condition Para cada condición, seleccione una columna, un tipo de condición y un valor para que coincida condicionalmente. Tipos de condición admitidos:
  • Es igual a / No es igual a
  • Es una de / no es una de
  • Contains /Does not contains
  • Comienza con / No comienza con
  • Termina con / No termina con
  • Mayor que /Menor que
  • Es null / No es null

En el caso de las condiciones de las columnas de fecha, el selector de fechas admite la navegación entre años y meses.
Cuando una condición coincide con los valores de una columna (por ejemplo, Es uno de), la lista de valores muestra una muestra de los valores distintos de la columna basada en la entrada. Selecciona Cargar más para obtener valores adicionales bajo demanda.

El operador Filter tiene dos salidas para poder bifurcar los datos en función de si cumple las condiciones:

Salida Description
Included Filas que cumplen las condiciones de filtro.
Excluido Filas que no cumplen las condiciones de filtro, incluidas las filas en las que la condición se evalúa como NULL.

Join

Vincula dos tablas en una clave mediante la combinación de dos conjuntos de datos de entrada basados en valores de columna coincidentes.

Campo Description
Tablas de entrada Seleccione las dos tablas de entrada que se van a combinar.
Condición de combinación Especifique al menos una condición de combinación seleccionando las columnas coincidentes de las dos tablas. Haga clic en + Agregar expresión de combinación para agregar más condiciones. Opcional: haga clic en la flecha entre las tablas izquierda y derecha para agregar una condición de combinación personalizada y, a continuación, edite la descripción generada por IA o escriba SQL.
Coincidencia de mayúsculas y minúsculas Cuando está desactivado (valor predeterminado), las claves de combinación de cadenas coinciden con mayúsculas y minúsculas (y omiten el espacio en blanco inicial y final). Active Coincidir mayúsculas y minúsculas para que coincidan exactamente con las claves de cadena. Esta opción se aplica a las claves de combinación, no a las condiciones de combinación personalizadas.
Tipo de combinación Seleccione el tipo de combinación. De forma predeterminada, el operador Join divide sus resultados en tres salidas (consulte la sección siguiente). Seleccione Combinación completa, Combinación interna, Unión izquierda o Combinación derecha para generar una única salida combinada en su lugar.
Columnas de salida Opcional: seleccione las columnas que se van a incluir. De forma predeterminada, se incluyen todas las columnas de ambas tablas. Los nombres de columna duplicados reciben un prefijo de nombre de tabla.
Columnas de expresiones personalizadas Opcional: agregue columnas de expresión personalizadas basadas en el resultado combinado.

De forma predeterminada, el operador Join tiene tres salidas para que pueda bifurcar un flujo de trabajo en función de los resultados de la combinación:

Salida Description
Izquierda sin coincidencia Filas de la entrada izquierda que no tienen ninguna coincidencia en la entrada derecha.
Coincidente Filas que coinciden entre ambas entradas.
No coincide con la derecha Filas de la entrada derecha que no tienen ninguna coincidencia en la entrada izquierda.

Al seleccionar un tipo de combinación específico (completo, interno, izquierdo o derecho), el operador genera una única salida combinada en lugar de las tres salidas divididas.

Limit

Restringe el recuento de filas pasando solo hasta el número máximo de filas que especifique.

Campo Description
Número máximo de filas Especifique el número máximo de filas que se van a pasar.

Dinamización

Vuelve a dar forma a los datos tabulares en dos direcciones. Use las pestañas de la parte superior del panel de configuración para seleccionar el modo.

Filas → columnas (dinamización)

Convierte valores distintos en una columna en nuevos encabezados de columna, rellenados con valores agregados de otra columna.

Campo Description
Columna dinámica Seleccione la columna cuyos valores distintos se convierten en los nuevos encabezados.
Valor y agregación Seleccione la columna cuyos valores rellenan las celdas dinamizadas y seleccione una función de agregación (por ejemplo, SUM, AVG, COUNT, MINo MAX). Configure cómo se controlan los valores que faltan (por ejemplo, null o cero), si están disponibles en el panel.

Columnas → filas (anulación de dinamización)

Plega una o varias columnas en filas.

Campo Description
Anular la dinamización de columnas Seleccione las columnas para anular la dinamización.
Columnas clave y valor Establezca nombres para las columnas de clave y valor de salida.

Incluir columnas

Para cualquiera de los modos, seleccione las columnas que permanecen en la salida junto con los valores dinamizados o sin dinamizar y quite las columnas que no necesite antes de la transformación. El diseñador deduce columnas fijas (agrupación) de las columnas que no se asignan a roles dinámicos, de valor o despivote.

Sort

Ordena filas en una o varias columnas.

Campo Description
Criterio de ordenación Seleccione ASC (ascendente) o DESC (descendente) para cada columna. Haga clic en + Agregar expresión de ordenación para ordenar por columnas adicionales. La ordenación sigue el orden léxico estándar.

SQL

Escribe código SQL personalizado para cualquier transformación no cubierta por los demás operadores.

Campo Description
Editor de SQL Escriba una instrucción SQL SELECT . Para hacer referencia a la salida de un operador de entrada, use el nombre de ese operador como nombre de tabla en la consulta. Por ejemplo:
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1
Haga clic en el icono Código. Para abrir el panel de código SQL completo y vea cómo encaja la instrucción en el flujo de trabajo completo.
Parameters Para hacer referencia a un parámetro de preparación de datos visuales, use la sintaxis de marcador de parámetros con nombre, como :environment. El diseñador muestra un ejemplo encima del editor al abrir el operador para su edición. Consulte Parámetros.

Seleccionar

Selecciona, cambia el nombre y reordena las columnas de los datos de entrada.

Campo Description
Incluir o excluir columnas Seleccione Iniciar con todas las columnas o Iniciar sin columnas y, a continuación, use las casillas para incluir o excluir columnas individuales. Arrastre columnas para reordenarlas.
Cambio del nombre de una columna Escriba un nuevo nombre en el campo Cambiar nombre junto a cualquier columna.
Seleccionar columnas dinámicamente En lugar de elegir columnas individualmente, selecciona columnas mediante una regla para que la salida se adapte a medida que cambia el esquema de entrada. Elige si quieres mantener las columnas coincidentes o eliminar las columnas coincidentes, y luego emparejar columnas mediante:
  • Tipo de dato columna: Seleccione uno o más tipos, como Booleano, Entero, Float/Doble, Decimal, Cadena, Fecha, Hora o Binario.
  • Nombre de columna: Coincide con nombres que empiecen con, terminan con, contienen o coinciden con una expresión regular. Activa la distinción de mayúsculas y minúsculas para que coincida exactamente.
  • Fórmula: Escribe una expresión booleana que se evalúe para cada columna en relación con sus metadatos, usando campos como Name, Type, y IsNumeric. Por ejemplo, IsNumeric AND Name LIKE '%_id' coincide con columnas numéricas cuyo nombre termina en _id.

Preparación

Limpia y deriva columnas mediante la encadenamiento de una o varias acciones en los datos de entrada. Haga clic en + Agregar acción y seleccione una acción. Agregue tantas acciones como necesite. Se aplican en orden.

Action Description
Fórmula Cree una nueva columna o sobrescriba una columna existente mediante lenguaje natural o una expresión SQL.
Tipo de cambio Convierta una columna en otro tipo de datos.
Reemplazar valor Busque y reemplace los valores de una columna.
Rellenar valores NULL Reemplace los valores NULL por una constante.
Mayúsculas y minúsculas de texto Cambie mayúsculas y minúsculas a inferior, superior o título.
Recorte Quite el espacio en blanco de uno o ambos extremos.
Reemplazo de regex Reemplace el texto que coincide con un patrón regex.
extraer Extraiga una subcadena que coincida con un grupo de expresiones regulares.
Fecha de análisis Analice una cadena en una fecha o marca de tiempo.

Para quitar una acción, mantenga el puntero sobre su fila y haga clic en Icono dash..

Columnas personalizadas

La acción Fórmula abre el editor de expresiones, donde puede crear una nueva columna o sobrescribir una columna existente mediante el lenguaje natural o el código SQL. El editor tiene dos cuadros de entrada y es bidireccional:

  • Descripción: escriba una descripción del lenguaje natural de lo que desea que haga la columna. El diseñador usa Genie para generar la expresión de código correspondiente a continuación.
  • Expresión: si prefiere escribir o editar código directamente, haga clic en el botón Editar expresión. La edición de la expresión genera automáticamente una descripción del lenguaje natural.

En el editor de expresiones, escribe @ para abrir un menú con las columnas de entrada del operador y las funciones SQL integradas. Escribe después @ para filtrar la lista, luego selecciona una entrada para insertarla: una columna inserta su nombre y una función inserta su llamada con el cursor colocado entre paréntesis. El mismo @ menú está disponible en los editores de expresiones de otros operadores, como condiciones personalizadas de Filtro y Unión.

Python

Ejecuta Python personalizados (PySpark) en los datos de entrada.

Campo Description
result Asigne un único DataFrame a result, que se convierte en la salida del operador.
inputs["data"] Lista de dataframes de entrada, en orden ascendente. El panel de detalles del operador muestra el nombre de cada entrada, en orden. Por ejemplo: Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).
Parameters Llame a dbutils.widgets.get(), como dbutils.widgets.get("environment"), para hacer referencia a un parámetro de preparación de datos visuales. El diseñador muestra un ejemplo encima del editor al abrir el operador para su edición. Consulte Parámetros.

Un patrón mínimo es usar la primera entrada cuando está presente o un DataFrame vacío de lo contrario:

# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

Desde allí, puede encadenar operaciones dataframe (por ejemplo, , , o combinaciones) en select antes de que finalice la asignación o reemplazar por filter un nuevo DataFrame compilado a partir de withColumn. resultresultinputs["data"]

Durante una vista previa, la salida del operador fluye hacia el panel de salida a medida que se produce, incluyendo cualquier cosa con display() la que renderizes y el texto que imprimas, para que puedas ver los resultados antes de que termine la ejecución.

Modo de vista previa de Python

Mientras construyes una preparación visual de datos, Designer previsualiza continuamente la salida de cada operador en una muestra de tus datos. Estas vistas previas ejecutan tu código en Python igual que una ejecución completa. Eso es un problema cuando tu código tiene efectos secundarios, como llamar a una API externa, enviar una notificación o escribir en un sistema fuera de Unity Catalog. Normalmente no quieres que esos efectos secundarios se activen en cada vista previa.

Para que tu código distinga los dos, lee config["is_preview"], un Diseñador booleano te asigna:

  • True Durante una partida de previsualización, así que puedes saltarte los efectos secundarios.
  • False durante una ejecución completa, como cuando haces clic en Ejecutar o en una ejecución programada.

Por ejemplo, guarda efectos secundarios para que solo funcionen fuera de los avances:

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
    write_results_to_external_system(result)

Organización

Note

Agrega una nota en el lienzo para que pueda documentar el propio flujo de trabajo: su finalidad, suposiciones, advertencias o contexto de entrega para cualquier persona que abra la preparación de datos visuales más adelante.

Campo Description
Contenido Edite el contenido de la nota insertado en el lienzo con un editor de texto enriquecido. Puede agregar encabezados, estilos de texto, vínculos, imágenes y tablas donde el texto sin formato no es suficiente. Las notas no afectan a cómo fluyen los datos a través de operadores.

Group

Agrupa visualmente los operadores en el lienzo sin cambiar cómo fluyen los datos entre ellos, lo que resulta útil cuando una preparación de datos visuales crece de gran tamaño o desea reflejar las fases lógicas.

Campo Description
Agregar al grupo Arrastre uno o varios operadores a un grupo para agregarlos a él.
Crear a partir de la selección Seleccione uno o varios operadores, abra el menú contextual (haga clic con el botón derecho) y seleccione Crear nuevo grupo para ajustar la selección en un nuevo grupo.
Name Asigne al grupo un nombre descriptivo.
Minimizar o expandir Haga clic en minimizar o expandir para mostrar u ocultar el contenido del grupo en el lienzo.
Activar / desactivar Haz clic derecho en la cabecera del grupo y selecciona Desactivar para excluir a todos los operadores del grupo de las ejecuciones, o Habilitar para incluirlos de nuevo. Los operadores deshabilitados no producen filas de salida, por lo que los operadores posteriores reciben un resultado vacío hasta que los habilitas. También puedes activar o desactivar a un operador individual. Consulta Habilitar o desactivar operadores.

Visualization

Crea una visualización a partir de los datos de entrada y la representa directamente en el lienzo. Conecte un operador De visualización a cualquier operador que genere datos tabulares para trazar los resultados sin salir del Diseñador.

Para configurar la visualización, abra el operador y seleccione un tipo de visualización y, a continuación, asigne las columnas al gráfico.

Campo Description
Visualization Tipo de gráfico que se va a representar, como Barra, Área o Contador.

Recursos adicionales