Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Infraestructura como Código para EXO
- Visión general de los patrones de despliegue de EXO: clústeres de un solo nodo, multi-nodo y con RDMA
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) mediante gestión de configuración
- Uso de flakes de Nix para construcciones reproducibles de EXO y entornos de desarrollo
- Escritura de playbooks de Ansible o scripts de shell para la provisión no supervisada del clúster
Construcciones Reproducibles e Integración con CI
- Fijación de dependencias y construcción del tablero de control en pipelines de CI
- Ejecución de pruebas iniciales de EXO en ejecutores de GitHub Actions o GitLab CI
- Creación de imágenes base (golden images) y flujos de reversión basados en instantáneas para máquinas virtuales macOS y Linux
- Versionado de tarjetas de modelos personalizados junto con el código de la aplicación
Descubrimiento de Clústeres y Automatización de Redes
- Configuración de mDNS y DNS estático para un descubrimiento fiable de nodos libp2p
- Automatización de la creación de perfiles de red y gestión del puente Thunderbolt en macOS
- Uso de namespaces personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
- Reglas de firewall y segmentación de red para entornos multiinquilino
Gestión del Ciclo de Vida de Modelos y Almacenamiento
- Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
- Montaje de comparticiones NFS o SAN como repositorios de solo lectura para modelos rápidos en la provisión
- Garbage collection (eliminación) de cachés obsoletos y políticas de retención de pesos versionados
- Automatización de descargas previas de modelos y verificaciones de salud antes de actualizaciones progresivas
Monitoreo y Alertas
- Envío de logs de EXO a sistemas de registro centralizados (ELK, Loki o Splunk)
- Construcción de tableros Grafana a partir de la salida de EXO_TRACING_ENABLED
- Configuración de alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia
- Correlación de telemetría de hardware macmon con regresiones en el rendimiento del modelo
Actualizaciones, Reversión y Recuperación ante Desastres
- Preparación de actualizaciones de binarios EXO en un nodo canario antes del despliegue masivo
- Reversión a nivel de modelo: cambio entre versiones cuantizadas sin volver a descargar
- Copias de seguridad y restauración del estado del clúster, namespaces personalizados y pesos en caché
- Documentación de playbooks de recuperación para escenarios de reconstrucción total del clúster
Acondicionamiento de Seguridad y Cumplimiento Normativo
- Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el tablero de control y la API
- Implementación de límites de velocidad de API y listas blancas de IPs para los endpoints de EXO
- Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero (zero-trust)
- Auditoría de accesos y mantenimiento de un inventario de modelos desplegados y sus versiones
Requerimientos
- Experiencia con prácticas DevOps (CI/CD, IaC, orquestación de contenedores)
- Familiaridad con la administración del sistema y gestión de paquetes en macOS o Linux
- Comprensión de conceptos de redes, DNS y almacenamiento
Audiencia Objetivo
- Ingenieros DevOps
- Arquitectos de infraestructura
- Ingenieros SRE responsables de cargas de trabajo de IA on-premise
21 Horas
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación