AnalíticaAvanzado
Amazon EMR
Clústeres administrados de Apache Spark, Hive y Presto para procesar volúmenes grandes de datos.
Cuándo aplicarlo
Cuando el procesamiento excede lo que resuelve una consulta de Athena y hace falta código distribuido en Spark.
Descripción
EMR levanta el clúster, instala el ecosistema de Hadoop y Spark, y lo apaga al terminar el trabajo. Se integra con S3 como almacenamiento, lo que separa el cómputo del dato y permite escalar cada uno por su lado.
Combinado con Spot Instances es la forma habitual de procesar terabytes con un presupuesto acotado.
Para profundizar