Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Conceptos y métricas de rendimiento
- Latencia, rendimiento (throughput), consumo de energía, uso de recursos
- Cuellos de botella a nivel de sistema vs. modelo
- Perfilado para inferencia vs. entrenamiento
Perfilado en Huawei Ascend
- Uso de CANN Profiler y MindInsight
- Diagnóstico de kernels y operadores
- Patrones de descarga (offload) y mapeo de memoria
Perfilado en GPU de Biren
- Funciones de monitoreo de rendimiento del SDK de Biren
- Fusión de kernels, alineación de memoria y colas de ejecución
- Perfilado consciente de la potencia y temperatura
Perfilado en MLU de Cambricon
- Herramientas de rendimiento de BANGPy y Neuware
- Visibilidad a nivel de kernel e interpretación de registros (logs)
- Integración del perfilador MLU con frameworks de despliegue
Optimización a nivel de grafo y modelo
- Estrategias de poda (pruning) y cuantización de grafos
- Fusión de operadores y reestructuración del grafo de computación
- Normalización del tamaño de entrada y ajuste de lotes (batch tuning)
Optimización de memoria y kernels
- Optimización del diseño de memoria (layout) y su reutilización
- Gestión eficiente de búferes en distintos juegos de chips (chipsets)
- Técnicas de ajuste a nivel de kernel por plataforma
Mejores prácticas multiplataforma
- Portabilidad de rendimiento: estrategias de abstracción
- Construcción de pipelines de ajuste compartidos para entornos de múltiples chips
- Ejemplo: ajuste de un modelo de detección de objetos en Ascend, Biren y MLU
Resumen y próximos pasos
Requerimientos
- Experiencia en el trabajo con pipelines de entrenamiento o despliegue de modelos de IA
- Comprensión de los principios de cómputo de GPU/MLU y de la optimización de modelos
- Conocimientos básicos de herramientas de perfilado de rendimiento y métricas
Público objetivo
- Ingenieros de rendimiento
- Equipos de infraestructura de aprendizaje automático
- Arquitectos de sistemas de IA
21 Horas