Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos del uso productivo de Tencent Hunyuan
- Visión general de los escenarios de servicio con modelos Tencent Hunyuan.
- Características productivas de los modelos grandes y MoE.
- Bottlenecks comunes en latencia, throughput y costos.
- Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia.
Arquitectura de despliegue y flujo de servicio
- Componentes centrales de un stack de inferencia productivo.
- Elegir entre modelos de despliegue con contenedores, on-premise o en la nube.
- Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU.
- Diseño orientado a confiabilidad y simplicidad operativa.
Optimización práctica de la latencia
\r- Uso de motores de inferencia optimizados como TensorRT, cuando sea aplicable.
- Conceptos del KV-cache y ajuste práctico del caché.
- Reducción de la sobrecarga en el inicio, calentamiento (warmup) y respuesta.
- Medición del tiempo hasta el primer token y la velocidad de generación de tokens.
Throughput, agrupación de solicitudes (batching) y eficiencia de GPU
- Estrategias de batching continuo y por solicitud.
- Gestión de concurrencia y comportamiento de colas.
- Mejora del aprovechamiento de la GPU sin afectar la experiencia del usuario.
- Manejo de solicitudes de contexto largo y cargas de trabajo mixtas.
Cuantización y control de costos
- Por qué la cuantización es importante para el servicio productivo.
- Trade-offs prácticos entre FP16, INT8 y otras opciones comunes de precisión.
- Equilibrio entre calidad del modelo, latencia y costos de infraestructura.
- Elaboración de una lista de verificación sencilla para optimización de costos.
Operaciones, monitoreo y revisión de preparación
- Disparadores (triggers) de autoescalado para servicios de inferencia.
- Monitoreo de latencia, throughput, uso de caché y salud de la GPU.
- Fundamentos de registro (logging), alertas y respuesta a incidentes.
- Revisión de un despliegue de referencia y creación de un plan de mejora.
Requerimientos
- Comprensión básica de los flujos de trabajo de despliegue e inferencia de modelos de lenguaje grande (LLM).
- Experiencia con contenedores, infraestructura en la nube o on-premise y servicios basados en APIs.
- Conocimientos prácticos de Python o tareas de ingeniería de sistemas.
Público objetivo
- Ingenieros de ML que despliegan LLMs en entornos productivos.
- Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
- Arquitectos de soluciones que diseñan plataformas de servicio de IA escalables.