Saltar al contenido
← Catálogo
AnalíticaAvanzado

Amazon EMR

Clústeres administrados de Apache Spark, Hive y Presto para procesar volúmenes grandes de datos.

Cuándo aplicarlo

Cuando el procesamiento excede lo que resuelve una consulta de Athena y hace falta código distribuido en Spark.

Descripción

EMR levanta el clúster, instala el ecosistema de Hadoop y Spark, y lo apaga al terminar el trabajo. Se integra con S3 como almacenamiento, lo que separa el cómputo del dato y permite escalar cada uno por su lado.

Combinado con Spot Instances es la forma habitual de procesar terabytes con un presupuesto acotado.