Propósito del puesto
Diseñar, desarrollar y operar la infraestructura que sostiene soluciones de IA y Machine Learning en producción.
Asegurar estabilidad, eficiencia y calidad desde el aprovisionamiento hasta la detección de deriva y el reentrenamiento.
Hacer que modelos y agentes escalen, sean confiables y evolucionen de forma continua en un entorno bancario regulado.
Responsabilidades
- Provisionar y gestionar GPU/CPU y Kubernetes para entrenamiento, fine-tuning y servicio de modelos.
- Mantener pipelines end-to-end de ML e IA: ingesta, evaluación, registro, despliegue y versionado.
- Optimizar costos cloud mediante batching, caching, cuantización y monitoreo presupuestario.
- Diseñar redes y entornos cloud para IA: VPCs, endpoints privados, balanceadores y seguridad de inferencia.
- Definir SLAs de disponibilidad y latencia, alertas y gestión de incidentes.
- Garantizar continuidad y copias de seguridad de modelos, datasets, experimentos y configuraciones.
- Operar MLflow, Weights & Biases o equivalentes, registros de modelos, CI/CD y monitoreo de deriva.
- Optimizar frameworks de servicio, parámetros de sampling y colas de solicitudes para LLMs.
- Aplicar controles de acceso, cifrado, auditoría y cumplimiento junto con Riesgo y Ciberseguridad.
Conocimientos específicos
- Python para automatización, testing, monitoreo y gestión de artefactos.
- MLflow, Weights & Biases, Azure ML, Databricks o equivalentes.
- vLLM, TensorFlow Serving, Triton Inference Server, TorchServe o equivalentes.
- AKS, EKS o GKE; autoscaling, GPUs, monitoreo de nodos y Terraform/Helm.
- Arquitecturas de inferencia, KV cache, batching dinámico, observabilidad y latencia P95/P99.