Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Soberanía de IA y Despliegue Local de LLM
- Riesgos de los LLMs en la nube: retención de datos, entrenamiento con las entradas, jurisdicción extranjera.
- Arquitectura de Ollama: servidor de modelos, registro y API compatible con OpenAI.
- Comparación con vLLM, llama.cpp y Text Generation Inference.
- Licenciamiento de modelos: términos de Llama, Mistral, Qwen y Gemma.
Instalación y Configuración de Hardware
- Instalación de Ollama en Linux con soporte CUDA y ROCm.
- Fallo solo a CPU y optimización AVX/AVX2.
- Despliegue con Docker y mapeo de volúmenes persistentes.
- Configuración de múltiples GPUs y estrategias de asignación de VRAM.
Gestión de Modelos
- Descarga de modelos desde el registro de Ollama: ollama pull llama3.
- Importación de modelos GGUF desde HuggingFace y TheBloke.
- Niveles de cuantización: compromisos entre Q4_K_M, Q5_K_M, Q8_0.
- Cambio de modelos y límites de carga concurrente de modelos.
Modelfiles Personalizados
- Escritura de sintaxis Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajuste de temperatura, top_p y repeat_penalty.
- Ingeniería de instrucciones del sistema para comportamiento específico por rol.
- Creación y publicación de modelos personalizados al registro local.
Integración de API
- Endpoint /v1/chat/completions compatible con OpenAI.
- Respuestas en streaming y modo JSON.
- Integración con LangChain, LlamaIndex y aplicaciones personalizadas.
- Autenticación y limitación de velocidad con proxy inverso.
Optimización del Rendimiento
- Tamaño de la ventana de contexto y gestión de KV cache.
- Inferencia por lotes y manejo paralelo de solicitudes.
- Asignación de hilos de CPU y conciencia de NUMA.
- Monitoreo del uso de GPU y presión de memoria.
Seguridad y Cumplimiento
- Aislamiento de red para endpoints de servicio de modelos.
- Filtrado de entradas y pipelines de moderación de salidas.
- Auditoría del registro de instrucciones y completados.
- Procedencia del modelo y verificación de hash.
Requerimientos
- Administración intermedia de Linux y contenedores.
- Comprensión de modelos de aprendizaje automático y transformadores a un alto nivel.
- Conocimiento de APIs REST y JSON.
Público Objetivo
- Ingenieros de IA y desarrolladores que reemplazan APIs de LLM en la nube.
- Organizaciones con sensibilidad de datos que impide el uso de modelos en la nube.
- Equipos gubernamentales y de defensa que requieren modelos de lenguaje aislados (air-gapped).
14 Horas