Saltar al contenido
← Catálogo
Bases de datosAvanzado

Amazon Redshift

Almacén de datos para analizar miles de millones de filas con SQL, organizado por columnas en vez de por filas.

En palabras simples

Una base transaccional es un archivador de fichas de clientes; Redshift es la hoja de cálculo gigante donde sumas una columna entera de un vistazo sin abrir ficha por ficha.

Cuándo aplicarlo

Cuando las consultas dejan de ser "dame este registro" y pasan a ser "suma, promedia y agrupa millones de registros", y una base transaccional se ahoga.

  • ▸Informes y paneles sobre el histórico completo de una organización
  • ▸Unir datos de varias fuentes para analizarlos con un mismo SQL
  • ▸Consultar datos que viven en S3 sin cargarlos previamente
  • ▸Alimentar QuickSight u otra herramienta de visualización con datos ya agregados

Vocabulario mínimo

Almacenamiento por columnas
Guarda cada columna junta en disco, así una consulta que usa tres columnas no lee las otras cincuenta.
Nodo líder y nodos de cómputo
El líder planifica la consulta y la reparte; los de cómputo procesan su porción en paralelo.
Clave de distribución
Decide cómo se reparten las filas entre nodos. Elegirla mal es la causa más común de consultas lentas.
Redshift Spectrum
Consulta datos que siguen en S3, sin cargarlos al clúster, usando el mismo SQL.
Redshift Serverless
Modalidad sin clúster que cobra por capacidad usada, pensada para cargas intermitentes.

Costo y capa gratuita

Cómo se cobra
Por hora de nodo en la modalidad aprovisionada, o por unidad de capacidad consumida en la modalidad sin servidores. Spectrum cobra aparte por terabyte escaneado en S3.
Capa gratuita
No forma parte de la capa gratuita general, aunque suele haber una prueba gratuita para cuentas nuevas. Conviene confirmar la oferta vigente antes de crear un clúster.

Cuidado con los créditos

  • ⚠Un clúster aprovisionado encendido todo el mes para consultas que se hacen dos veces por semana: la modalidad sin servidores encaja mucho mejor.
  • ⚠Consultas de Spectrum sin particionar los datos en S3: se escanean y cobran terabytes innecesarios.
  • ⚠Dimensionar el clúster por el pico y no por el uso habitual.

Descripción

Una base de datos transaccional está optimizada para leer y escribir filas completas: la ficha de un cliente, un pedido, una inscripción. Un almacén de datos como Redshift está optimizado para lo contrario: recorrer columnas enteras de millones de filas y resumirlas.

La diferencia técnica está en cómo se guarda el dato en disco. Al almacenar por columnas, una consulta que solo mira tres campos no lee los cincuenta restantes, y como los valores de una misma columna se parecen entre sí, se comprimen mucho mejor. A eso se suma el procesamiento en paralelo entre nodos.

Cómo funciona

  1. Los datos llegan al clúster desde S3, desde bases operativas replicadas con DMS o transformados con Glue.
  2. Al crear cada tabla se define su clave de distribución y su orden, que determinan cómo se reparten y ordenan las filas entre nodos.
  3. Una consulta llega al nodo líder, que arma el plan y lo reparte entre los nodos de cómputo.
  4. Cada nodo procesa su porción en paralelo y devuelve resultados parciales que el líder combina.
  5. Con Spectrum, parte de los datos puede seguir en S3 y consultarse en la misma sentencia.

Manos a la obra

  • Crea un espacio de trabajo de Redshift Serverless, que evita dimensionar nodos para una práctica.
  • Carga un conjunto de datos público desde S3 con el comando COPY.
  • Ejecuta una agregación sobre varios millones de filas y observa el tiempo de respuesta.
  • Repite la consulta cambiando la clave de distribución de la tabla y compara los planes de ejecución.
  • Elimina el espacio de trabajo al terminar y revisa el gasto en Cost Explorer al día siguiente.

Ejemplo visual

De los datos crudos al panel de indicadorescatalogacargaconsultaAmazon S3datos crudosAWS GluetransformaAmazon RedshiftanalizaQuickSightpaneles
De los datos crudos al panel de indicadoresLos datos crudos aterrizan en Amazon S3, donde AWS Glue los cataloga y los transforma a un formato analítico. Desde ahí se cargan en Amazon Redshift, que los almacena por columnas y responde consultas de agregación en paralelo entre sus nodos. Amazon QuickSight se conecta a Redshift para construir los paneles que consulta el resto de la organización. Cada pieza hace una cosa: S3 guarda, Glue prepara, Redshift analiza y QuickSight muestra.

La pregunta previa a montar un almacén de datos siempre es la misma: ¿cuántas veces al día se va a consultar? Si la respuesta es «unas pocas», Athena sobre S3 resuelve lo mismo sin clúster.

Cuándo NO es la mejor opción

  • Amazon Athena — si los datos ya están en S3 y las consultas son ocasionales, Athena no exige mantener ningún clúster.
  • Amazon RDS — si el volumen es moderado y las consultas son transaccionales, una base relacional normal basta y sobra.
  • Amazon EMR — si el procesamiento necesita código distribuido en Spark y no encaja en SQL.

Se usa junto con

Aparece en certificaciones

  • AWS Certified Solutions Architect – Associate
  • AWS Certified Data Engineer – Associate
  • AWS Certified Data Analytics – Specialty