Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción al escalamiento de Ollama

  • Arquitectura de Ollama y consideraciones de escalabilidad
  • Cuellos de botella comunes en despliegues de múltiples usuarios
  • Buenas prácticas para la preparación de la infraestructura

Asignación de recursos y optimización de GPU

  • Estrategias para una utilización eficiente de CPU/GPU
  • Consideraciones de memoria y ancho de banda
  • Restricciones de recursos a nivel de contenedor

Despliegue con contenedores y Kubernetes

  • Contenerización de Ollama con Docker
  • Ejecución de Ollama en clústeres de Kubernetes
  • Balanceo de carga y descubrimiento de servicios

Autoescalamiento y lote (batching)

  • Diseño de políticas de autoescalamiento para Ollama
  • Técnicas de inferencia por lotes para optimizar el rendimiento
  • Compromisos entre latencia y rendimiento (throughput)

Optimización de la latencia

  • Perfilado del rendimiento de inferencia
  • Estrategias de caché y calentamiento de modelos
  • Reducción de la sobrecarga de E/S y comunicación

Monitoreo y observabilidad

  • Integración de Prometheus para métricas
  • Creación de paneles con Grafana
  • Alertas y respuesta a incidentes para la infraestructura de Ollama

Gestión de costos y estrategias de escalabilidad

  • Asignación de GPU con conciencia de costos
  • Consideraciones de despliegue en la nube vs. en las instalaciones
  • Estrategias para un escalamiento sostenible

Resumen y próximos pasos

Requerimientos

  • Experiencia en administración de sistemas Linux
  • Comprensión de la contenerización y orquestación
  • Familiaridad con el despliegue de modelos de aprendizaje automático

Audiencia

  • Ingenieros de DevOps
  • Equipos de infraestructura de ML
  • Ingenieros de confiabilidad de sitios

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas