1. Libros y videos
  2. Arquitectura AWS
  3. Monitoring y gestión del rendimiento
Extrait - Arquitectura AWS Diseñe infraestructuras cloud robustas, seguras y evolutivas
Extractos del libro
Arquitectura AWS Diseñe infraestructuras cloud robustas, seguras y evolutivas Volver a la página de compra del libro

Monitoring y gestión del rendimiento

Introducción

Garantizar el buen funcionamiento de una arquitectura en la nube no se limita a diseñarla e implementarla. En un entorno distribuido como AWS, donde los servicios interactúan constantemente, los flujos de datos circulan a través de decenas de componentes y las cargas de trabajo cambian continuamente, la verdadera dificultad radica en la supervisión continua y la gestión proactiva del rendimiento.

La nube ofrece una elasticidad y una resiliencia extraordinarias, pero esta flexibilidad hace que los sistemas sean más complejos de comprender y controlar. ¿Cómo saber si una aplicación sigue funcionando correctamente cuando se basa en microservicios distribuidos entre varias zonas de disponibilidad? ¿Cómo detectar que un problema de latencia proviene de una llamada externa y no de la infraestructura interna? ¿Cómo asegurarse de que todas las acciones realizadas en una cuenta de AWS quedan registradas y cumplen con las normas de seguridad?

La respuesta a estas preguntas radica en la implementación de una estrategia de monitoring completa, que combine la observación de métricas, el análisis de registros, el seguimiento de los flujos de aplicaciones, la trazabilidad de las acciones administrativas y, por último, la automatización de las correcciones. Para ello, AWS ofrece un conjunto de servicios integrados, cada uno con una función...

CloudWatch, X-Ray y OpenSearch: supervisar y analizar

1. CloudWatch: la piedra angular del monitoring de AWS

Amazon CloudWatch es el primer servicio en el que se piensa cuando se trata de la supervisión en AWS. Recopila automáticamente las métricas generadas por los servicios de AWS: el consumo de CPU de una instancia de EC2, el número de solicitudes recibidas por un Application Load Balancer, los mensajes en cola en una cola SQS o incluso el tiempo de respuesta de un API Gateway. Sin embargo, no todas las métricas están disponibles de forma predeterminada: algunas requieren una activación explícita o una configuración adicional (métricas detalladas de EC2, métricas personalizadas, Container Insights). 

Pero CloudWatch no se limita a estos indicadores técnicos. El usuario también puede publicar sus propias métricas, por ejemplo, el número de pedidos validados por minuto o la tasa de conversión de un sitio de comercio electrónico. Esta capacidad de integrar métricas "de negocio" permite acercar la infraestructura a los retos empresariales.

CloudWatch incluye además un componente esencial: CloudWatch Logs. Las aplicaciones pueden enviar allí sus registros en tiempo real, lo que evita que se dispersen por cientos de instancias. Una vez centralizados, estos registros se pueden consultar, archivar y también analizar...

AWS CloudTrail y Security Hub: realizar un seguimiento de las acciones y proteger

1. CloudTrail: el registro de las acciones en AWS

No basta con supervisar el estado de los recursos; también hay que saber quién hace qué en un entorno en la nube. Gran parte de los incidentes de seguridad se deben a acciones humanas, ya sean intencionadas o accidentales. Por eso, AWS ofrece CloudTrail, el servicio que registra todas las llamadas al API realizadas en una cuenta.

Cada vez que un usuario, una aplicación o un servicio de AWS realiza una acción (como crear una instancia de EC2, modificar una regla de seguridad o eliminar un bucket de S3), se genera un evento que se almacena en CloudTrail. Estos eventos incluyen detalles esenciales: identidad del autor de la llamada, dirección IP de origen, servicio afectado, operación realizada y resultado obtenido.

CloudTrail actúa como una caja negra. En caso de incidente, es posible reconstruir con precisión la cronología de los eventos. De este modo, una auditoría puede demostrar que un bucket se hizo público por error el 12 de marzo a las 15:42, por parte de un usuario interno, desde una dirección IP concreta.

Los registros de CloudTrail se suelen exportar a S3, donde se pueden conservar a largo plazo y analizar mediante Amazon Athena o Amazon OpenSearch Service. Esto abre la puerta a análisis de seguridad exhaustivos y a controles...

Automatizar la corrección con AWS Systems Manager

1. De la detección a la acción

Supervisar y detectar los problemas es un primer paso. Pero en la nube, la velocidad a la que se puede propagar un incidente obliga a reducir al máximo el tiempo que transcurre entre la detección y la corrección. Es lo que se conoce como MTTR (Mean Time To Recovery), un indicador clave de la resiliencia de un sistema.

Tradicionalmente, cuando se activa una alarma, un ingeniero debe intervenir manualmente: conectarse a un servidor, analizar los registros y aplicar una corrección. Este modelo es lento, costoso y propenso a errores. AWS ofrece, con Systems Manager (SSM), un servicio completo que permite automatizar estas tareas e industrializar la corrección.

2. Un acceso gestionado y seguro

El primer pilar de Systems Manager es Session Manager, que sustituye al acceso SSH tradicional a los servidores. Con Session Manager, ya no es necesario abrir el puerto 22 ni gestionar claves SSH distribuidas entre varios equipos. Las conexiones se realizan a través de la consola de AWS o de la API, de forma segura y con seguimiento.

Cada sesión se registra en CloudTrail, lo que garantiza una auditabilidad total. Esto reduce considerablemente los riesgos de intrusión y simplifica la gestión de los accesos.

Ejemplo concreto

Una empresa prohíbe ahora cualquier conexión SSH directa a sus instancias EC2. Todos...

Resumen del capítulo

La supervisión y la gestión del rendimiento en AWS se basan en una estrategia integrada.

  • CloudWatch, X-Ray y OpenSearch proporcionan las herramientas necesarias para la observación de métricas, trazas y registros.

  • CloudTrail y Security Hub garantizan la trazabilidad de las acciones y el cumplimiento normativo de los entornos.

  • Por último, Systems Manager permite automatizar la corrección de incidencias, unificar la gestión e implementar prácticas de administración modernas. 

Al combinar estos servicios, una organización pasa de una postura reactiva, en la que cada incidente se detecta y se corrige manualmente, a una postura proactiva, en la que las anomalías se detectan, analizan y corrigen automáticamente. Se trata de un paso esencial para alcanzar la madurez operativa en la nube.