Workcofy
← Todas las oportunidades

Site Reliability Engineer (SRE)

Secretaria de Gobierno Digital

EmpleoPresencialSeniorIngeniería
Ubicación
Chile
Salario
USD 3,800 – 4,100
Publicada
Hace 6 días
Fuente
Get on Board
Ver oportunidad en Get on BoardLa postulación se realiza en el sitio original.

Requerimientos del cargo En términos de stack: • Linux en ambientes productivos. • Cloud pública, preferentemente AWS (también consideramos Azure o GCP). • Contenedores y orquestación: Docker y Kubernetes o equivalentes. • Infraestructura como Código: Terraform, Ansible, CloudFormation o equivalentes. • Observabilidad y logs: Prometheus, Grafana, ELK/OpenSearch, CloudWatch, Datadog, New Relic o equivalentes. • CI/CD: GitLab CI/CD, GitHub Actions, Jenkins, Argo CD, Azure DevOps o equivalentes. • Programación y scripting: como Python, Java, Go, Bash, PowerShell. • Gestión de incidentes en alta disponibilidad: diagnóstico de fallas, análisis de causa técnica y recuperación de servicios. • Práctica real de SRE: confiabilidad, observabilidad, automatización y mejora continua como forma de trabajo. Requisito formal del cargo público: título profesional de una carrera de ingeniería en computación, informática, telecomunicaciones, electrónica o afín, de al menos 8 semestres de duración.

Funciones del cargo • Medir y mantener SLOs, SLIs y error budgets de los servicios críticos de la SGD, y usarlos para decidir cuándo se despliega y cuándo se frena. • Diseñar y operar la observabilidad de las plataformas — métricas, logs y trazas — con dashboards y alertas orientadas a síntomas, no a ruido. • Automatizar aprovisionamiento, despliegue y operación de la infraestructura con Infraestructura como Código. • Participar en el ciclo completo de gestión de incidentes: detección, mitigación, comunicación, turnos on-call y postmortems sin culpa. • Identificar y eliminar el toil: todo trabajo manual repetitivo que hoy consume tiempo y mañana debería ser código. • Trabajar con los equipos de desarrollo para que los servicios nazcan confiables, escalables y operables, incluyendo production readiness reviews antes de que algo llegue a producción. • Gestionar capacidad y rendimiento: anticipar la demanda, optimizar recursos y controlar costos. • Implementar y asegurar alta disponibilidad, recuperación ante desastres, respaldos y continuidad operativa. • Fortalecer la seguridad operacional. • Mantener y mejorar los pipelines de CI/CD. • Documentar arquitecturas, runbooks y estándares técnicos.

Opcionales • Certificaciones vigentes: CKA, HashiCorp Terraform Associate, AWS Certified SysOps Administrator – Associate, AWS Certified DevOps Engineer – Professional, LFCS, ITIL 4 Foundation o superior. • Conocimiento de gestión de bases de datos y su operación en producción. • Gestión de secretos y seguridad operacional (Vault o similar). • Arquitecturas de microservicios.

site reliability engineeringlinuxawskubernetesterraformobservabilityci/cdpythonincident managementhigh availability