UMA Procedimento ETL em três etapas (Extração, Transformação e Carregamento) e algumas Ferramentas ETL a implementação adequada deste conceito, são a solução para as necessidades que as instituições têm para gerir adequadamente os seus dados.

Créditos fotográficos: viking75
É sobre armazenar informação de forma eficiente. Os dados não classificados geram problemas quando se tenta encontrá-los. O utilizador precisa de saber que dados gere, onde se encontram e como os extrair.. Pode parecer que o difícil é tomar decisões baseadas nos dados, mas não, a procura dos dados em si costuma ser muito mais complicada.
Mas mesmo assim, As ferramentas ETL são a solução para este problema.
O que é um ETL?
O acrónimo ETL vem de Extracting, Transforming, Loading, que descreve muito bem a ideia do que é um ETL. o Ferramentas ETL Foram criadas para impulsionar e facilitar o armazenamento de dados.
Para saber o que é um ETL, o melhor é rever como é um procedimento ETL. Trata-se dos seguintes passos:
- Começar
- Construir dados de referência
- Extrair de fontes
- Validar
- Transformar
- Carregar em tabelas
- Realizar relatórios de auditoria
- Para postar
- procedimentos
- Limpo
As vezes, estes passos são supervisionados e realizados de forma indireta, mas exigem muito tempo e é possível que o resultado não seja exato. O objetivo de usar ferramentas ETL é poupar tempo e tornar todo o procedimento mais confiável.
Quais são as características chave tradicionais das ferramentas ETL?
As ferramentas ETL automatizam as operações de extração de dados dos sistemas de origem, la transformación para usos analíticos y de procesamiento y la posterior carga en el destino. sea cual sea el sistema seleccionado e independientemente del tipo de entorno que sea. Su intervención simplifia el procedimiento ETL en comparación con los scripts de integración manual en SQL u otros lenguajes de programación.
Para saber o que é um ETL, es necesario comprender la configuración interna, las capacidades y las características de las herramientas ETL.. Entre los más importantes, cabe resaltar los siguientes:
- Compatibilidade con la integración de datos almacenados en sistemas locais y en la nube, incluidos los entornos de nube híbrida.
- Capacidad para conectar y extraer datos de una gama de fuentes. tales como aplicaciones, bases de dados, sistemas de big data basados en tecnologias como Hadoop y Spark y repositorios de archivos planos, entre outros.
- Funciones de creación de perfiles de datos, que posibilitan realizar un análisis de la consistencia de los datos ya en origen y antes de iniciar el procedimiento ETL, pudiendo examinar además la existencia de dependencias y otros atributos de los datos.
- Capacidades de desarrollo basados en equipos que posibilitan una colaboración eficaz en iniciativas de integración.
- Funciones de limpieza de calidad y datos, que aumentan su fiabilidad.
- Capacidades para la sincronización de datos para mantener la coerência entre los sistemas.
- Capacidades de transformación de datos, que puede incluir todo, desde el reformateo hasta la conversión y desde la orquestación del flujo de trabajo hasta el mapeo de datos.
- Soporte de administración de metadatos.
No confunda ETL con una definición equivalente, ELT, que invierte las etapas finales del procedimiento, realizando la carga antes de la transformación. Una opción que se encarga de la manipulación de los datos una vez que ya están en el sistema de destino.
Es una capacidade especialmente recomendado para aplicaciones de big data donde a menudo se carregan grandes volúmenes de dados sin processar en Hadoop, Spark u otros repositórios, y depois se filtran conforme las necesidades de los diferentes usos analíticos.
¿Pueden los macrodatos hacer desaparecer las herramientas ETL?
A corto plazo, As ferramentas ETL não irão desaparecer, mas a abordagem das ferramentas ETL mudará do “sítio para os dados”.. Continuará a haver espaço para as ferramentas ETL, seja como ferramentas ETL independentes ou, con menos frequência, como ferramentas ETL residuais de nível intermédio.
Cada vez mais, este modelo emergente necessita de um repositório central único para toda a informação empresarial. Em outras palavras, um lugar para armazenamento em massa. Isto pode ser Hadoop, Cassandra ou Spark, funcionando como um Sistema de arquivos distribuídoUm sistema de arquivos distribuído (DFS) Permite armazenamento e acesso a dados em vários servidores, facilitando o gerenciamento de grandes volumes de informações. Esse tipo de sistema melhora a disponibilidade e a redundância, à medida que os arquivos são replicados para locais diferentes, Reduzindo o risco de perda de dados. O que mais, Permite que os usuários acessem arquivos de diferentes plataformas e dispositivos, promovendo colaboração e..., ou na realidade, serviço de armazenamento na nuvem como S3. Além disso, é necessário acentuar o movimento de conjuntos de dados derivados mais pequenos, deste repositório, para os sistemas fonte que o compõem.
O papel das ferramentas ETL continuará a crescer, não apenas em proporção ao volume de dados, mas também Además debería abarcar la explosión de variedad de datos que están causando los datos generados por máquinas.. Ao mesmo tempo, con la necesidad de incrementar la velocidad de la toma de decisiones basada en análisis, la canalización de herramientas ETL debe pasar de la operación por lotes a lo más cerca factible del tiempo real.
Las herramientas ETL tradicionales y los proveedores de integración de datos como Informatica están adaptando sus productos y adaptando sus motores para utilizar Hadoop, Spark y otras plataformas de Big Data, y agregar la capacidad de mover dados dentro y fuera de Hadoop.



