SRE Kubernetes(100% 远程工作)
SRE Kubernetes (100% teletrabajo)
在Logicalis Spain,我们正在寻找一名专注于Kubernetes的Site Reliability Engineer(SRE),加入我们的Managed Services团队,参与容器平台和CI/CD生态系统的运营、演进和自动化,为关键的企业环境提供支持。
我们希望找到一位在Kubernetes和自动化平台方面拥有扎实技术经验的人才,在混合环境中(包括本地和云环境)工作,确保平台的可用性、性能、安全性和稳定性,并推动持续改进以及自动化和运维最佳实践的采用。
职责
- 基于Kubernetes、OpenShift、AKS和/或EKS的容器平台的管理、运营和演进,应用GitOps方法论
- 维护和优化通过Azure DevOps、Jenkins、GitHub Actions、Argo CD或类似工具实现的持续集成和部署流水线
- 管理平台的部署、升级、配置、迁移、备份和维护活动
- 在分布式和高可用性环境中进行高级故障排查和复杂问题解决
- 监控生产环境的健康状况、容量、性能和可用性,主动识别改进机会
- 参与操作标准、可观测性、安全性和自动化的定义和实施
- 通过Ansible和Helm实现操作任务、部署和基础设施的自动化
- 使用Python和Shell脚本开发自动化脚本和工具
- 与开发、基础设施、安全、架构和运维团队合作
要求
- 有可证明的Kubernetes SRE经验, preferably 在托管服务和多客户环境中
- 在生产环境中具有Kubernetes和/或OpenShift平台的管理和运营经验
- 具备高级CI/CD流程知识,并有使用Azure DevOps、Jenkins、GitHub Actions、Argo CD或类似工具的实际经验
- 有使用GitOps方法的经验
- 能够在分布式、容器化和微服务架构中诊断和解决复杂问题
- 有Day 2运维自动化和基础设施即代码管理经验
- 精通Ansible和
查看英文原文
En Logicalis Spain queremos incorporar un/a Site Reliability Engineer (SRE) especializado/a en Kubernetes para unirse a nuestro equipo de Servicios Gestionados, participando en la operación, evolución y automatización de plataformas de contenedores y ecosistemas CI/CD que dan soporte a entornos empresariales críticos.
Buscamos un perfil con sólida experiencia técnica en plataformas Kubernetes y automatización, que trabajará en entornos híbridos, tanto on-premise como cloud, garantizando los niveles de disponibilidad, rendimiento, seguridad y estabilidad de las plataformas e impulsando la mejora continua y la adopción de buenas prácticas de automatización y operaciones.
RESPONSABILIDADES
- Administración, operación y evolución de plataformas de contenedores basadas en Kubernetes, OpenShift, AKS y/o EKS, aplicando metodologías GitOps
- Mantenimiento y optimización de pipelines de integración y despliegue continuo mediante Azure DevOps, Jenkins, GitHub Actions, Argo CD o herramientas equivalentes
- Gestión de despliegues, upgrades, configuraciones, migraciones, backups y actividades de mantenimiento de las plataformas
- Troubleshooting avanzado y resolución de incidencias complejas en entornos distribuidos y de alta disponibilidad
- Monitorización de la salud, capacidad, rendimiento y disponibilidad de los entornos productivos, identificando oportunidades de mejora de forma proactiva
- Participación en la definición e implantación de estándares de operación, observabilidad, seguridad y automatización
- Automatización de tareas operativas, despliegues e infraestructura mediante Ansible y Helm
- Desarrollo de scripts y utilidades de automatización utilizando Python y Shell Script
- Colaboración con equipos de Desarrollo, Infraestructura, Seguridad, Arquitectura y Operaciones
REQUISITOS
- Experiencia demostrable como SRE Kubernetes, preferiblemente en entornos de servicios gestionados y multicliente
- Experiencia sólida en la administración y operación de plataformas Kubernetes y/o OpenShift en entornos productivos
- Conocimientos avanzados de procesos CI/CD y experiencia práctica con Azure DevOps, Jenkins, GitHub Actions, Argo CD o herramientas similares
- Experiencia trabajando con metodologías GitOps
- Capacidad para diagnosticar y resolver incidencias complejas en arquitecturas distribuidas, contenerizadas y de microservicios
- Experiencia en automatización de operaciones Day 2 y gestión de infraestructura como código
- Dominio de Ansible y Helm
- Experiencia en desarrollo de automatizaciones mediante Python y/o Shell Script
- Conocimientos sólidos de Git y de prácticas de integración y despliegue continuo
- Experiencia trabajando en entornos híbridos, cloud y on-premise
- Capacidad de organización, comunicación y trabajo colaborativo con equipos multidisciplinares
VALORABLE
- Experiencia administrando entornos cloud en AWS, Microsoft Azure y/o Google Cloud Platform
- Experiencia en Infraestructura como Código utilizando Terraform
- Conocimientos de observabilidad y monitorización con Prometheus, Grafana, Alertmanager u OpenTelemetry
- Experiencia con plataformas de logging y análisis como Elastic Stack
- Conocimientos de seguridad aplicada a Kubernetes y contenedores, incluyendo hardening, RBAC, políticas de seguridad, gestión de secretos y escaneo de vulnerabilidades
- Experiencia con soluciones de backup y recuperación para entornos Kubernetes
- Certificaciones relacionadas con Kubernetes, OpenShift, Cloud o DevOps como CKA, CKAD, RHCSA, RHCE, AWS o Azure
- Experiencia en plataformas de orquestación de automatizaciones como Rundeck, AWX o Ansible Automation Platform
¿Qué ofrecemos en Logicalis Spain?
Logicalis Spain somos un grupo internacional con más de 20 años de experiencia en el sector IT, vinculados a proyectos y servicios de gran envergadura en Data Centers, Ciberseguridad y Analytics.
- Puesto de trabajo estable.
- Disponibilidad para realizar intervenciones puntualmente
- Teletrabajo 100%
- Jornada intensiva todos los viernes, julio y agosto.
- Festivo el día de tu cumpleaños + día de asuntos propios.
- Posibilidad de acceder a planes de retribución flexible (tarjeta restaurante, tarjeta transporte).
- Nos importa tu bienestar, tendrás acceso a Seguro Médico Privado y Wellhub (Gympass).
- Importantes descuentos en diferentes servicios y formaciones por ser empleado/a de Logicalis, (retail, electrónica, viajes..)
- Formación y certificaciones adaptadas a tu puesto de trabajo.
- Desarrollo profesional con proyectos punteros y tecnologías actuales en el mercado.
Originally posted on Himalayas