← Todos los rolesPerfil de puesto

Ingeniero de Plataforma

Opera la infraestructura segura, observable y eficiente que sostiene modelos y agentes en producción.

InfraestructuraCiudad de PanamáMachine Learning, IA, MLOps, GenAIOps, Ingeniería de Software e Infraestructura Cloud
Postularme a este rol
01

Propósito del puesto

Diseñar, desarrollar y operar la infraestructura que sostiene soluciones de IA y Machine Learning en producción.

Asegurar estabilidad, eficiencia y calidad desde el aprovisionamiento hasta la detección de deriva y el reentrenamiento.

Hacer que modelos y agentes escalen, sean confiables y evolucionen de forma continua en un entorno bancario regulado.

02

Responsabilidades

  • Provisionar y gestionar GPU/CPU y Kubernetes para entrenamiento, fine-tuning y servicio de modelos.
  • Mantener pipelines end-to-end de ML e IA: ingesta, evaluación, registro, despliegue y versionado.
  • Optimizar costos cloud mediante batching, caching, cuantización y monitoreo presupuestario.
  • Diseñar redes y entornos cloud para IA: VPCs, endpoints privados, balanceadores y seguridad de inferencia.
  • Definir SLAs de disponibilidad y latencia, alertas y gestión de incidentes.
  • Garantizar continuidad y copias de seguridad de modelos, datasets, experimentos y configuraciones.
  • Operar MLflow, Weights & Biases o equivalentes, registros de modelos, CI/CD y monitoreo de deriva.
  • Optimizar frameworks de servicio, parámetros de sampling y colas de solicitudes para LLMs.
  • Aplicar controles de acceso, cifrado, auditoría y cumplimiento junto con Riesgo y Ciberseguridad.
03

Conocimientos específicos

  • Python para automatización, testing, monitoreo y gestión de artefactos.
  • MLflow, Weights & Biases, Azure ML, Databricks o equivalentes.
  • vLLM, TensorFlow Serving, Triton Inference Server, TorchServe o equivalentes.
  • AKS, EKS o GKE; autoscaling, GPUs, monitoreo de nodos y Terraform/Helm.
  • Arquitecturas de inferencia, KV cache, batching dinámico, observabilidad y latencia P95/P99.