Saltar al contenido
← Catálogo
Machine learningIntermedio

Amazon Rekognition

Análisis de imágenes y video por API: detecta objetos, texto, rostros y contenido inapropiado sin entrenar nada.

En palabras simples

Es preguntarle a alguien que ya sabe mirar: le enseñas la foto y te dice qué hay en ella, sin que tengas que enseñarle antes qué es un perro.

Cuándo aplicarlo

Cuando hay que extraer información de imágenes o video y la tarea es común — reconocer objetos, leer texto, moderar contenido — sin necesidad de un modelo propio.

  • ▸Etiquetar automáticamente las fotos de los eventos del club
  • ▸Leer el texto que aparece dentro de una imagen o de un cartel
  • ▸Moderar contenido subido por usuarios antes de publicarlo
  • ▸Buscar en una colección de fotos aquellas en las que aparece una persona concreta

Vocabulario mínimo

Etiqueta
Cada objeto, escena o concepto detectado, con su nivel de confianza en porcentaje.
Umbral de confianza
El mínimo por debajo del cual se descarta una detección. Ajustarlo es la decisión de diseño principal.
Colección
El índice de vectores faciales que permite buscar coincidencias entre imágenes.
Moderación de contenido
La detección de material inapropiado, con categorías jerárquicas para decidir qué se bloquea.
Análisis de video
El procesamiento asíncrono de un video de S3, que devuelve las detecciones con su marca de tiempo.

Costo y capa gratuita

Cómo se cobra
Por imagen procesada y por minuto de video analizado, con el precio bajando por volumen. Almacenar vectores faciales en una colección tiene un costo mensual pequeño.
Capa gratuita
5.000 imágenes al mes y 1.000 unidades de vectores faciales almacenados, durante los primeros 12 meses.

Cuidado con los créditos

  • ⚠Analizar cada foto varias veces por no guardar el resultado: cada llamada se factura de nuevo.
  • ⚠Procesar video largo completo cuando bastaría con muestrear fotogramas.
  • ⚠Llamar a varias API distintas —etiquetas, texto, moderación— sobre la misma imagen sin necesitarlas todas.

Descripción

Rekognition es un buen ejemplo de la diferencia entre construir y consumir aprendizaje automático. Entrenar un modelo capaz de reconocer miles de objetos exige datos, cómputo y meses de trabajo; llamar a esta API son tres líneas de código y unos centavos.

La contrapartida es que solo sabe lo que ya aprendió. Reconoce categorías generales — personas, vehículos, animales, texto — pero no distingue el modelo de una pieza industrial concreta. Cuando el dominio es específico, el camino es entrenar un modelo propio.

Cómo funciona

  1. Envías la imagen, o indicas su ubicación en un bucket de S3.
  2. Eliges la operación: etiquetas, texto, rostros, moderación, comparación entre caras.
  3. La respuesta llega en segundos, con cada detección acompañada de su confianza.
  4. Tu código decide qué hacer según el umbral: aceptar, descartar o enviar a revisión humana.
  5. En video, el análisis es asíncrono: se lanza el trabajo y el resultado llega por SNS.

Manos a la obra

  • Sube una foto de un evento del club a un bucket y llama a la detección de etiquetas desde la CLI.
  • Observa el JSON con las etiquetas y sus porcentajes de confianza.
  • Conecta una función Lambda al evento de objeto creado del bucket para etiquetar cada foto nueva y guardar el resultado en DynamoDB.
  • Prueba la lectura de texto sobre la foto de un cartel.
  • Sube algo borroso o ambiguo y observa cómo caen los porcentajes: ahí se entiende por qué el umbral importa.

Ejemplo visual

Etiquetar automáticamente las fotos de un eventosubeobjeto nuevoanalizaguardaClubsube fotoAmazon S3fotosAWS LambdaorquestaRekognitionetiquetaAmazon DynamoDBguarda
Etiquetar automáticamente las fotos de un eventoAlguien del club sube una foto al bucket de Amazon S3. El objeto nuevo dispara una función de AWS Lambda que envía la imagen a Amazon Rekognition, el cual devuelve las etiquetas detectadas con su nivel de confianza. La función guarda esas etiquetas en una tabla de Amazon DynamoDB, junto a la ruta de la foto, de modo que después se puede buscar por contenido sin volver a analizar la imagen. Analizar una vez y guardar el resultado es lo que mantiene bajo el costo.

Para la galería de eventos de este sitio, el patrón permitiría buscar «stand», «charla» o «pizarra» sin que nadie haya etiquetado una sola foto a mano.

Cuándo NO es la mejor opción

  • Amazon Textract — si lo que hay que leer son documentos con formularios y tablas, no texto suelto dentro de una foto.
  • Amazon SageMaker AI — si hay que reconocer objetos específicos de un dominio que un modelo general no conoce.
  • Amazon Bedrock — si además de detectar hace falta razonar o describir la imagen en lenguaje natural.

Se usa junto con

Aparece en certificaciones

  • AWS Certified Cloud Practitioner
  • AWS Certified AI Practitioner
  • AWS Certified Machine Learning – Specialty