Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
El panorama de la observabilidad con IA
- De los paneles de control a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
- Capacidades de LLM relevantes para la observabilidad: resumen, razonamiento y coincidencia de patrones.
- Patrones de arquitectura: integrar IA en pilas de observabilidad existentes.
Consulta de telemetría en lenguaje natural
- De texto a PromQL: traducir lenguaje natural a consultas de monitoreo.
- Consultas en NL para almacenes de registros Elasticsearch, OpenSearch y Loki.
- Generación de SQL a partir de lenguaje natural para telemetría estructurada.
- Construcción de un agente asistente de consultas con uso de herramientas y conciencia contextual.
Análisis de registros potenciado por LLM
- Análisis y estructuración automática de registros con LLM.
- Detección de anomalías en flujos de registros utilizando similitud de incrustaciones (embeddings).
- Agrupamiento de registros y descubrimiento de patrones a gran escala.
- Generación de explicaciones legibles por humanos a partir de secuencias de registros crudas.
Alertas inteligentes y enriquecimiento de incidentes
- Correlación y deduplicación de alertas con comprensión semántica.
- Recolección automática del contexto del incidente a partir de manuales de operación, incidentes anteriores y documentación.
- Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
- Reducción de la fatiga por alertas con reducción de ruido impulsada por IA.
Análisis de causas raíz asistido por IA
- Generación de hipótesis a partir de la correlación de telemetría multifuente.
- Cadenado de evidencias: conectar síntomas entre métricas, registros y trazas.
- Resolución de problemas guiada con sesiones interactivas de diagnóstico por IA.
- Construcción de un agente de análisis de causas raíz con investigación progresiva.
Respuesta automática a incidentes y comunicación
- Generación de resúmenes de incidentes y actualizaciones de estado a partir de la telemetría.
- Borrado automático de post-mortem con reconstrucción de la línea de tiempo.
- Comunicación con partes interesadas adaptada a audiencias técnicas y ejecutivas.
- Sugerencia de manuales de operación y recomendaciones de remediación automatizadas.
Machine Learning para observabilidad
- Pronóstico de series temporales para planificación de capacidad y predicción de anomalías.
- Modelos fundamentales para detección de anomalías zero-shot en métricas.
- Mapeo de dependencias de servicios basado en incrustaciones y descubrimiento de topología.
- Entrenamiento y despliegue de modelos ligeros de ML junto a los pipelines de observabilidad.
Despliegue en producción y ética
- Consideraciones de latencia y costo para la observabilidad con IA en tiempo real.
- Privacidad de datos: garantizar que los LLM no filtren telemetría sensible.
- Supervisión humana: cuándo el diagnóstico por IA necesita validación por operadores.
- Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia.
Requerimientos
- Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
- Conocimiento de conceptos de gestión de registros y métricas.
- Escritura básica de scripts en Python para procesamiento de datos.
Público objetivo
- Ingenieros de SRE y observabilidad que adopten herramientas mejoradas con IA.
- Ingenieros de plataforma que construyen pipelines de monitoreo de próxima generación.
- Líderes de DevOps que evalúan la integración de LLM en flujos de trabajo de incidentes.
14 Horas