Senior Site Reliability Engineer SRE Azure - AWS

Aviso de fuente externaen Confidencial USQ

🎯 Buscamos un perfil senior, con experiencia demostrable liderando iniciativas de confiabilidad, monitoreo e incidentes. El foco estará principalmente en estructurar, operar, madurar y e...

Fuente externa - sin verificaranteayerVigente hasta: 9 oct 2026

Salario

No especificado

Ubicación

Bogotá, Colombia

Tipo de empleo

Tiempo completo

Modalidad

No especificado

Senior Site Reliability Engineer SRE Azure - AWS

Bogotá, Colombia

Descripción del empleo

🎯 Buscamos un perfil senior, con experiencia demostrable liderando iniciativas de confiabilidad, monitoreo e incidentes. El foco estará principalmente en estructurar, operar, madurar y evolucionar el sistema de observabilidad, más que en desarrollo de software.
📍 Ubicación: Medellín, Colombia💻 Modalidad: Remoto📄 Contrato: Indefinido💰 Salario: A convenir 🌎 Inglés: Avanzado B2 – C2⏰ Disponibilidad para trabajar alineado con horario PST.
🎯 Tu retoFortalecer y evolucionar el sistema de monitoreo y observabilidad, prevenir incidentes y establecer indicadores que permitan mejorar continuamente la confiabilidad de los servicios.
🛠️ Requisitos• Experiencia senior en SRE, Observability, Cloud Operations, Production Engineering o roles similares.• Experiencia comprobable implementando y madurando sistemas de monitoreo.• Experiencia en gestión integral de alertas e incidentes, RCA y mejora continua.• Experiencia liderando equipos técnicos u operativos.• Azure Cloud como experiencia principal. AWS es deseable.• Kubernetes / AKS, Grafana, Prometheus, Elasticsearch y Azure Monitor.• APM y plataformas de gestión de incidentes como OpsGenie.• Python, Bash y/o PowerShell para automatización.• Inglés C1 – C2.
🔧 Principales funciones• Liderar la implementación, organización y maduración del sistema de monitoreo y observabilidad.• Gestionar métricas, logs, trazas, alertas, dashboards y APM.• Definir y hacer seguimiento a SLIs, SLOs y Error Budgets.• Liderar la gestión de incidentes críticos, escalamiento, resolución y análisis de causa raíz (RCA).• Identificar incidentes recurrentes y establecer acciones preventivas y correctivas.• Diseñar y mejorar SOPs, runbooks, procesos e indicadores de confiabilidad.• Optimizar el sistema de alertas y sus rutas de escalamiento.• Liderar equipos responsables de la gestión y atención de incidentes.• Elaborar y presentar reportes de disponibilidad, incidentes, confiabilidad y avances.• Participar en iniciativas de planificación de capacidad y optimización del rendimiento.• Trabajar transversalmente con equipos de Ingeniería, Desarrollo y Operaciones.
🎁 Beneficios✔️ Póliza de salud prepagada✔️ Bono de conectividad y seguro de vida✔️ Capacitación y certificaciones en Azure✔️ Acceso a O’Reilly, Platzi y Codely✔️ Vacaciones y horarios flexibles✔️ Días libres adicionales por cumpleaños✔️ Trabajo remoto✔️ Posibilidad de traslado a Canadá
📩 Si cuentas con la experiencia y estás listo(a) para asumir un reto internacional en SRE y Cloud Reliability, postúlate o comparte esta oportunidad.

¿Es tuya esta vacante?

Reclámala gratis y recibe candidatos con video en CazVid.

Empleos similares