AWS Glue
Servicio de integración de datos sin servidores: descubre esquemas, transforma datos y los deja listos para analizar.
En palabras simples
Es el equipo que recibe cajas de proveedores distintos, revisa qué trae cada una, la etiqueta y la deja ordenada en el estante correcto para que cualquiera la encuentre.
Cuándo aplicarlo
Cuando los datos llegan crudos y desordenados de varias fuentes y hay que catalogarlos, limpiarlos y convertirlos a un formato analítico.
- ▸Registrar el esquema de los archivos de S3 para poder consultarlos con Athena
- ▸Convertir CSV a Parquet particionado para abaratar las consultas
- ▸Unir datos de RDS, S3 y una API en un mismo conjunto analítico
- ▸Ejecutar transformaciones periódicas sin administrar un clúster de Spark
Vocabulario mínimo
- Catálogo de datos
- El registro central de tablas y esquemas. Lo comparten Athena, Redshift Spectrum y EMR.
- Rastreador (crawler)
- El proceso que recorre una fuente, deduce su esquema y crea o actualiza las tablas del catálogo.
- Trabajo (job)
- La transformación en sí, escrita en PySpark o Scala, que Glue ejecuta sin que tú operes el clúster.
- DynamicFrame
- La estructura de Glue parecida a un DataFrame de Spark, pero tolerante a esquemas irregulares.
- Glue Studio
- El editor visual que arma la transformación arrastrando pasos y genera el código correspondiente.
Costo y capa gratuita
- Cómo se cobra
- Por unidad de procesamiento de datos y por segundo de ejecución de los trabajos y rastreadores, con un mínimo por ejecución. El catálogo cobra por objeto almacenado y por petición, con un nivel gratuito amplio.
- Capa gratuita
- El primer millón de objetos almacenados y de peticiones al catálogo son gratuitos. Los trabajos y rastreadores se cobran desde el primer segundo.
Cuidado con los créditos
- ⚠Trabajos con más unidades de procesamiento de las necesarias: el costo escala directamente con ellas.
- ⚠Rastreadores programados cada hora sobre datos que cambian una vez al día.
- ⚠Trabajos que fallan y se reintentan solos sin límite: cada intento se cobra completo.
Descripción
En cualquier proyecto de datos, la parte que consume el tiempo no es el análisis sino lo anterior: averiguar qué contiene cada archivo, unificar formatos, corregir tipos y dejar todo en un lugar consultable. Glue es el servicio que AWS dedica a ese trabajo.
Tiene dos mitades que conviene distinguir. El catálogo de datos es un registro de esquemas que comparten Athena, Redshift y EMR: es lo que permite escribir SQL sobre archivos sueltos de S3. Los trabajos son transformaciones en Spark que Glue ejecuta sin que nadie administre un clúster.
Cómo funciona
- Un rastreador recorre los datos —S3, RDS, DynamoDB— y deduce su esquema.
- El esquema se registra en el catálogo, y desde ese momento Athena puede consultarlo.
- Un trabajo lee esas tablas, aplica la transformación y escribe el resultado, normalmente en Parquet particionado.
- El trabajo se dispara por horario, por evento o desde un flujo de Step Functions.
- Los marcadores de trabajo recuerdan qué se procesó ya, para no repetir el mismo dato.
Manos a la obra
- Sube unos cuantos CSV a una carpeta de S3 y lanza un rastreador sobre ella.
- Revisa la tabla que creó en el catálogo y consúltala con Athena sin haber escrito ningún esquema.
- Crea en Glue Studio un trabajo visual que convierta esos CSV a Parquet particionado por fecha.
- Consulta la tabla nueva con Athena y compara los datos escaneados con los de la consulta original.
- Programa el trabajo con horario diario y activa los marcadores para no reprocesar lo ya hecho.
Ejemplo visual
Ese salto de CSV a Parquet particionado parece un detalle de formato y es, en la práctica, la diferencia entre un análisis que cuesta centavos y uno que cuesta decenas de dólares.
Cuándo NO es la mejor opción
- Amazon EMR — si necesitas control fino del clúster de Spark o bibliotecas que Glue no incluye.
- AWS Lambda — si la transformación es pequeña y por evento, arrancar Spark es desproporcionado.
- Amazon MWAA — si lo que falta es orquestar muchos pasos dependientes y el equipo ya usa Airflow.
Se usa junto con
Aparece en certificaciones
- AWS Certified Solutions Architect – Associate
- AWS Certified Data Engineer – Associate
- AWS Certified Data Analytics – Specialty
Para profundizar