Ponte en Contacto

Temario del curso

Fundamentos del uso productivo de Tencent Hunyuan

  • Visión general de los escenarios de servicio con modelos Tencent Hunyuan.
  • Características productivas de los modelos grandes y MoE.
  • Bottlenecks comunes en latencia, throughput y costos.
  • Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia.

Arquitectura de despliegue y flujo de servicio

  • Componentes centrales de un stack de inferencia productivo.
  • Elegir entre modelos de despliegue con contenedores, on-premise o en la nube.
  • Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU.
  • Diseño orientado a confiabilidad y simplicidad operativa.

Optimización práctica de la latencia

\r
  • Uso de motores de inferencia optimizados como TensorRT, cuando sea aplicable.
  • Conceptos del KV-cache y ajuste práctico del caché.
  • Reducción de la sobrecarga en el inicio, calentamiento (warmup) y respuesta.
  • Medición del tiempo hasta el primer token y la velocidad de generación de tokens.

Throughput, agrupación de solicitudes (batching) y eficiencia de GPU

  • Estrategias de batching continuo y por solicitud.
  • Gestión de concurrencia y comportamiento de colas.
  • Mejora del aprovechamiento de la GPU sin afectar la experiencia del usuario.
  • Manejo de solicitudes de contexto largo y cargas de trabajo mixtas.

Cuantización y control de costos

  • Por qué la cuantización es importante para el servicio productivo.
  • Trade-offs prácticos entre FP16, INT8 y otras opciones comunes de precisión.
  • Equilibrio entre calidad del modelo, latencia y costos de infraestructura.
  • Elaboración de una lista de verificación sencilla para optimización de costos.

Operaciones, monitoreo y revisión de preparación

  • Disparadores (triggers) de autoescalado para servicios de inferencia.
  • Monitoreo de latencia, throughput, uso de caché y salud de la GPU.
  • Fundamentos de registro (logging), alertas y respuesta a incidentes.
  • Revisión de un despliegue de referencia y creación de un plan de mejora.

Requerimientos

  • Comprensión básica de los flujos de trabajo de despliegue e inferencia de modelos de lenguaje grande (LLM).
  • Experiencia con contenedores, infraestructura en la nube o on-premise y servicios basados en APIs.
  • Conocimientos prácticos de Python o tareas de ingeniería de sistemas.

Público objetivo

  • Ingenieros de ML que despliegan LLMs en entornos productivos.
  • Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
  • Arquitectos de soluciones que diseñan plataformas de servicio de IA escalables.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas