Amazon Rekognition
Análisis de imágenes y video por API: detecta objetos, texto, rostros y contenido inapropiado sin entrenar nada.
En palabras simples
Es preguntarle a alguien que ya sabe mirar: le enseñas la foto y te dice qué hay en ella, sin que tengas que enseñarle antes qué es un perro.
Cuándo aplicarlo
Cuando hay que extraer información de imágenes o video y la tarea es común — reconocer objetos, leer texto, moderar contenido — sin necesidad de un modelo propio.
- ▸Etiquetar automáticamente las fotos de los eventos del club
- ▸Leer el texto que aparece dentro de una imagen o de un cartel
- ▸Moderar contenido subido por usuarios antes de publicarlo
- ▸Buscar en una colección de fotos aquellas en las que aparece una persona concreta
Vocabulario mínimo
- Etiqueta
- Cada objeto, escena o concepto detectado, con su nivel de confianza en porcentaje.
- Umbral de confianza
- El mínimo por debajo del cual se descarta una detección. Ajustarlo es la decisión de diseño principal.
- Colección
- El índice de vectores faciales que permite buscar coincidencias entre imágenes.
- Moderación de contenido
- La detección de material inapropiado, con categorías jerárquicas para decidir qué se bloquea.
- Análisis de video
- El procesamiento asíncrono de un video de S3, que devuelve las detecciones con su marca de tiempo.
Costo y capa gratuita
- Cómo se cobra
- Por imagen procesada y por minuto de video analizado, con el precio bajando por volumen. Almacenar vectores faciales en una colección tiene un costo mensual pequeño.
- Capa gratuita
- 5.000 imágenes al mes y 1.000 unidades de vectores faciales almacenados, durante los primeros 12 meses.
Cuidado con los créditos
- ⚠Analizar cada foto varias veces por no guardar el resultado: cada llamada se factura de nuevo.
- ⚠Procesar video largo completo cuando bastaría con muestrear fotogramas.
- ⚠Llamar a varias API distintas —etiquetas, texto, moderación— sobre la misma imagen sin necesitarlas todas.
Descripción
Rekognition es un buen ejemplo de la diferencia entre construir y consumir aprendizaje automático. Entrenar un modelo capaz de reconocer miles de objetos exige datos, cómputo y meses de trabajo; llamar a esta API son tres líneas de código y unos centavos.
La contrapartida es que solo sabe lo que ya aprendió. Reconoce categorías generales — personas, vehículos, animales, texto — pero no distingue el modelo de una pieza industrial concreta. Cuando el dominio es específico, el camino es entrenar un modelo propio.
Cómo funciona
- Envías la imagen, o indicas su ubicación en un bucket de S3.
- Eliges la operación: etiquetas, texto, rostros, moderación, comparación entre caras.
- La respuesta llega en segundos, con cada detección acompañada de su confianza.
- Tu código decide qué hacer según el umbral: aceptar, descartar o enviar a revisión humana.
- En video, el análisis es asíncrono: se lanza el trabajo y el resultado llega por SNS.
Manos a la obra
- Sube una foto de un evento del club a un bucket y llama a la detección de etiquetas desde la CLI.
- Observa el JSON con las etiquetas y sus porcentajes de confianza.
- Conecta una función Lambda al evento de objeto creado del bucket para etiquetar cada foto nueva y guardar el resultado en DynamoDB.
- Prueba la lectura de texto sobre la foto de un cartel.
- Sube algo borroso o ambiguo y observa cómo caen los porcentajes: ahí se entiende por qué el umbral importa.
Ejemplo visual
Para la galería de eventos de este sitio, el patrón permitiría buscar «stand», «charla» o «pizarra» sin que nadie haya etiquetado una sola foto a mano.
Cuándo NO es la mejor opción
- Amazon Textract — si lo que hay que leer son documentos con formularios y tablas, no texto suelto dentro de una foto.
- Amazon SageMaker AI — si hay que reconocer objetos específicos de un dominio que un modelo general no conoce.
- Amazon Bedrock — si además de detectar hace falta razonar o describir la imagen en lenguaje natural.
Se usa junto con
Aparece en certificaciones
- AWS Certified Cloud Practitioner
- AWS Certified AI Practitioner
- AWS Certified Machine Learning – Specialty