Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
La arquitectura de macrodatos a menudo necesita un almacén de datos analíticos que sirve datos procesados en un formato estructurado. Puede consultar esos datos mediante herramientas analíticas. Los almacenes de datos analíticos que admiten la consulta de datos de ruta de acceso activa y de ruta de acceso en frío se conocen colectivamente como capa de servicio o almacenamiento de servicios de datos.
La capa de presentación controla los datos procesados de la ruta rápida y la ruta fría. En la arquitectura lambda, la capa de servicio se subdivide en dos capas. La capa de servicio de velocidad contiene los datos procesados incrementalmente. La capa de servicio por lotes contiene la salida procesada por lotes.
Aunque la capa de servicio general requiere una gran compatibilidad con lecturas aleatorias que tienen baja latencia, el almacenamiento de datos para la capa de velocidad también debe admitir escrituras aleatorias porque la carga por lotes de datos en este almacén presenta retrasos no deseados. Por el contrario, el almacenamiento de datos para la capa de lote debe admitir escrituras por lotes, no escrituras aleatorias.
Ninguna solución de administración de datos única se ajusta a todas las tareas de almacenamiento de datos. Las diferentes soluciones son óptimas para tareas específicas. La mayoría de las aplicaciones en la nube del mundo real y los procesos de macrodatos tienen varios requisitos de almacenamiento de datos y, a menudo, usan una combinación de soluciones de almacenamiento.
Las soluciones analíticas modernas, como Microsoft Fabric, proporcionan una plataforma completa que integra varios servicios de datos y herramientas para satisfacer diversas necesidades analíticas. Fabric incluye OneLake, que es un lago de datos lógico y unificado para toda la organización. OneLake está diseñado para almacenar, administrar y proteger todos los datos de la organización en una sola ubicación. Esta flexibilidad permite a su organización abordar una amplia gama de requisitos de procesamiento y almacenamiento de datos.
Elección de un almacén de datos analíticos
Microsoft ofrece varias opciones para el almacenamiento de servicios de datos, en función de sus necesidades:
- Tejido, en concreto:
- Azure Databricks
- Azure SQL Database
- SQL Server en una máquina virtual de Azure
- Azure Analysis Services
- Azure Cosmos DB
Los diferentes modelos de base de datos se adaptan a diferentes tipos de tareas:
Los almacenes de datos clave-valor contienen un único objeto serializado para cada valor de clave. Pueden administrar grandes volúmenes de datos cuando la recuperación se basa en una clave específica, sin necesidad de consultar otras propiedades de elemento.
Los almacenes de datos de documentos son almacenes de datos clave-valor en los que los valores son documentos. En este contexto, un documento es una colección de campos y valores con nombre. El almacén de datos normalmente almacena los datos en un formato como XML, YAML, JSON o JSON binario, pero podría usar texto sin formato. Los almacenes de datos de documentos pueden consultar campos que no son clave y definir índices secundarios para mejorar la eficacia de las consultas. Esta funcionalidad hace que una base de datos de documentos sea más adecuada para las aplicaciones que necesitan recuperar datos en función de criterios más complejos que el valor de la clave de documento. Por ejemplo, podría consultar campos como el identificador de producto, el identificador de cliente o el nombre del cliente.
Los almacenes de datos de la familia de columnas son almacenes de datos clave-valor que mantienen cada columna por separado en el disco. Un almacén de columnas ancho almacena familias de columnas, no solo columnas únicas. Por ejemplo, una base de datos del censo podría tener una familia de columnas independiente para cada uno de los atributos de una persona:
- Nombre, segundo nombre y apellidos
- Dirección de correo postal
- Información del perfil, como la fecha de nacimiento o el sexo
El almacén de datos puede almacenar cada familia de columnas en una partición independiente, a la vez que mantiene todos los datos de una persona relacionada con la misma clave. Una aplicación puede leer una sola familia de columnas sin examinar todos los datos de una entidad.
Los almacenes de datos de grafos contienen información como una colección de objetos y relaciones. Un almacén de datos de grafos puede realizar consultas de forma eficaz que atraviesan la red de objetos y las relaciones entre ellos. Por ejemplo, los objetos podrían ser los empleados en una base de datos de recursos humanos y puede desear facilitar consultas como "buscar todos los empleados que trabajan directa o indirectamente para Scott".
Las bases de datos de telemetría y de serie temporal son una colección de objetos que solo se anexan. Las bases de datos de telemetría indexan de forma eficaz los datos en varios almacenes de columnas y estructuras en memoria. Esta funcionalidad las convierte en la opción óptima para almacenar y analizar grandes cantidades de datos de telemetría y series temporales.
Fabric admite varios modelos de base de datos, como clave-valor, documento, almacén de columnas, grafos y bases de datos de telemetría. Esta flexibilidad garantiza la escalabilidad de una amplia gama de tareas analíticas. Para elegir el almacén de datos Fabric adecuado para las cargas de trabajo analíticas, consulte Fabric guía de decisión: elegir un almacén de datos.
Principales criterios de selección
Para refinar el proceso de selección, tenga en cuenta los siguientes criterios:
¿Necesita almacenamiento de servicios que pueda servir como ruta de acceso activa para los datos? Si es así, elija opciones que sean óptimas para una capa de servicio de velocidad.
¿Necesita compatibilidad con el procesamiento paralelo masivo, donde las consultas se distribuyen automáticamente entre varios procesos o nodos? Si es así, seleccione una opción que admita el escalado horizontal de consultas.
¿Prefiere usar un almacén de datos relacional? Si lo hace, elija opciones que tengan un modelo de base de datos relacional. Sin embargo, algunos almacenes no relacionales admiten sintaxis SQL para las consultas, y pueden usar herramientas como puntos de conexión de análisis SQL para consultar almacenes de datos no relacionales como OneLake.
¿Recopila datos de series temporales? ¿Se usan datos que solo se anexan? OneLake admite varios motores analíticos, incluidos Analysis Services, T-SQL y Apache Spark. Eventhouse es adecuado para diversas necesidades de procesamiento y consulta de datos de serie temporal.
Matriz de funcionalidades
En las tablas siguientes se resumen las diferencias clave en las funcionalidades entre estos servicios administrados.
Funcionalidades generales
| Capacidad | Lakehouse | Almacén de datos | Eventhouse | Base de datos SQL Fabric | Azure SQL Database | Azure Cosmos DB | Servicios de Análisis |
|---|---|---|---|---|---|---|---|
| Modelo de la base de datos principal | lago de datos unificado, relacional y administrado por el usuario en formato Delta Lake mediante Apache Parquet | Lago de datos unificado, formato relacional y de lago delta administrado por el sistema mediante Apache Parquet | Almacén de datos orientado a anexos de series temporales, gráfico, vector | Relacional (formato de almacén de columnas al usar índices de almacén de columnas) | Relacional (formato de almacén de columnas al usar índices de almacén de columnas) | Almacenamiento de documentos, almacenamiento de grafos, almacenamiento clave-valor, almacenamiento de columnas anchas | Modelos semánticos tabulares |
| Compatibilidad con lenguaje SQL | Sí1 | Sí | Sí2 | Sí | Sí | Sí | No |
| Optimizado para la capa de servicio rápido | Sí | Sí | Sí3 | Sí4 | Sí5 | Sí | No |
[1] T-SQL a través del punto de conexión de SQL Analytics.
[2] El lenguaje de consulta kusto (KQL) tiene compatibilidad parcial con el lenguaje T-SQL.
[3] Admite la ingesta en cola y la ingesta de streaming.
[4] Admite la precisión transaccional con acceso de baja latencia y actualizaciones en tiempo real.
[5] Mediante el uso de tablas optimizadas para memoria y índices hash o no agrupados.
Funcionalidades de escalabilidad
| Capacidad | Lakehouse | Almacén de datos | Eventhouse | Base de datos SQL Fabric | Azure SQL Database | Azure Cosmos DB | Servicios de Análisis |
|---|---|---|---|---|---|---|---|
| Servidores regionales redundantes para lograr alta disponibilidad | Sí1,2 | Sí1,2 | Sí | Sí | Sí | Sí | Sí |
| Admite el escalado horizontal de consultas | Sí3 | Sí4 | Sí5 | Sí | No | Sí | Sí |
| Escalabilidad dinámica (escalado hacia arriba) | Sí3 | Sí4 | Sí5 | Sí | Sí | Sí | Sí |
| Admite el almacenamiento en caché en memoria de datos | Sí6 | Sí6 | Sí7 | Sí | Sí | Sí | No |
Los puntos de conexión SQL se dirigen a través de gestores globales de tráfico, pero la región de capacidad de Fabric asignada es la que siempre procesa los datos.
[2] Lakehouse y Warehouse almacenan datos en OneLake en el formato Delta Parquet, que admite consultas y replicación entre motores.
[3] Lakehouse admite el escalado horizontal basado en Spark para datos no estructurados y estructurados.
[4] El almacenamiento usa T-SQL y admite transacciones multitable, administración de cargas de trabajo autónomas y procesamiento de consultas distribuidas (DQP). DQP actúa como un administrador de clústeres, asignando dinámicamente recursos de proceso en función de la complejidad de las consultas.
[5] Eventhouse admite la federación de KQL y SQL para el análisis en tiempo real en múltiples orígenes y para ampliar los recursos de proceso si el uso de la caché en caliente supera el ~95 %.
[6] Caché inteligente para trabajos de Spark, caché en memoria, caché del conjunto de resultados para endpoints de SQL Analytics.
[7] Los datos a los que se accede con frecuencia se almacenan en una caché activa que incluye almacenamiento SSD y en memoria.
Funcionalidades de seguridad
| Capacidad | Lakehouse | Almacén de datos | Eventhouse | Base de datos SQL Fabric | Azure SQL Database | Azure Cosmos DB | Servicios de Análisis |
|---|---|---|---|---|---|---|---|
| Autenticación | Microsoft Entra ID | Microsoft Entra ID | Microsoft Entra ID | Microsoft Entra ID | SQL o Microsoft Entra ID | Usuarios de base de datos o identidad de Microsoft Entra mediante la gestión de identidades y acceso (control de acceso) | Microsoft Entra ID |
| Cifrado de datos en reposo | Sí | Sí | Sí | Sí | Sí1 | Sí | Sí |
| Seguridad a nivel de fila | Sí | Sí | Sí | Sí | Sí | No | Sí |
| Admite cortafuegos | Sí2 | Sí2 | Sí3 | Sí | Sí | Sí | Sí |
| Enmascaramiento de datos dinámicos | Sí4 | Sí4 | No | Sí | Sí | No | No |
[1] Requiere que use el cifrado de datos transparente para cifrar y descifrar los datos en reposo.
[2] Use Vínculos privados y Acceso condicional de Microsoft Entra para restringir el acceso a los recursos de Fabric.
[3] Fabric Eventhouse y cargas de trabajo de inteligencia de Real-Time pueden ingerir datos de orígenes seguros como Kafka, Azure Event Hubs y AMQP, con enrutamiento a través de puntos de conexión seguros.
[4] Aplíquelo en el nivel de punto de conexión de SQL Fabric.
Colaboradores
Microsoft mantiene este artículo. Los colaboradores siguientes escribieron este artículo.
Autor principal:
- Mohit Agarwal | Arquitecto principal de soluciones en la nube
Para ver los perfiles no públicos de LinkedIn, inicie sesión en LinkedIn.
Pasos siguientes
- Guía de decisiones de Fabric: elegir un almacén de datos
- Inicio rápido: Introduje datos en OneLake
- Creación de un almacén en Fabric
- Creación de un centro de eventos
- Creación de una base de datos única en SQL Database
- Introducción a Azure Databricks
- Explore la arquitectura y los servicios de Azure
- Consulta de datos en Azure Cosmos DB para NoSQL
- Casos de uso del extremo de análisis SQL de Lakehouse