基础设施可靠性工程师
Ingénieur fiabilité des infrastructures
认识到远程工作的优势对员工福祉和环境的积极影响,包括员工士气、生产力以及减少通勤时间,我们自豪地成为一家优先考虑远程工作的公司。我们投资的技术和项目为此奠定了坚实的基础。我们以远程工作为特色的环境,加上位置优越的办公室和协作式办公空间,为我们的团队提供了自由和灵活性,让他们以最有效的方式工作。
关于Tecsys
Tecsys是一家快速增长的创新公司,为大型医疗系统、医院、药房、分销商、零售商和3PL提供供应链解决方案。我们与行业领导者合作,通过技术转变他们的供应链。如果您喜欢迎接有趣的挑战并有持续学习的机会,请加入我们!
关于职位
我们正在寻找一名基础设施可靠性工程师加入我们的网络运营中心(NOC),该团队是SaaS关键环境平台可靠性的核心。您将帮助维护、优化并确保支持我们在AWS和Kubernetes上的云基础设施系统的可靠性和性能,重点在于自动化、可观测性和持续改进。
该职位结合了可靠性工程与事件管理,让您真正负责可用性、性能和创新。您将加入一个高素质的团队,重视创造性解决问题、卓越的运营和通过自动化和弹性工程实现的持续改进。
您的职责
- 与其他工程团队合作,在服务上线前通过系统设计咨询、平台和软件框架开发、容量规划和发布评审等活动提供支持。
- 持续创新,识别弱点,提出创意解决方案,并推动简化、升级和强化平台的举措。
- 维护
查看英文原文
Ayant reconnu les avantages du travail à distance sur le bien-être des employés et l'environnement, notamment le moral des employés, la productivité, la réduction des trajets domicile-travail, nous sommes fière d'être une entreprise privilégiant le travail à distance. Les technologies et les programmes dans lesquels nous avons investi ont fourni une base fantastique à cette fin. Notre environnement qui privilégie le travail à distance, ainsi que nos bureaux bien situés et nos espaces de travail collaboratifs, offrent à notre équipe la liberté et la flexibilité de travailler de la manière qui rend nos employés les plus productifs.
À propos de Tecsys
Tecsys est un innovateur à croissance rapide qui offre des solutions de chaîne d'approvisionnement aux principaux systèmes de soins de santé, aux hôpitaux, aux pharmacies, aux distributeurs, aux détaillants et aux 3PL. Nous travaillons avec les leaders du secteur pour transformer leurs chaînes d'approvisionnement grâce à la technologie. Si vous aimez relever des intéressants avec des opportunités d'apprentissage continu joignez-vous à nous!
À propos du poste
Nous recherchons un ingénieur fiabilité des infrastructures pour rejoindre notre Centre des opérations réseau et de sécurité (NOC), une équipe au cœur de la fiabilité des plateformes pour les environnements SaaS critiques. Vous aiderez à maintenir, optimiser et assurer la fiabilité et la performance des systèmes qui alimentent notre infrastructure infonuagique sur AWS et Kubernetes, avec un fort accent sur l’automatisation, l’observabilité et l’amélioration continue.
Ce poste combine l’ingénierie de la fiabilité avec la gestion des incidents, vous donnant une véritable responsabilité sur la disponibilité, la performance et l’innovation. Vous ferez partie d’une équipe hautement qualifiée qui valorise la résolution créative de problèmes, l’excellence opérationnelle et l’amélioration continue grâce à l’automatisation et à l’ingénierie de la résilience.
Vos responsabilités
- Collaborer avec d’autres équipes d’ingénierie pour soutenir les services avant leur mise en service à travers des activités telles que la consultation en conception de systèmes, le développement de plateformes et de cadres logiciels, la planification des capacités et les revues de lancement.
- Innover continuellement en identifiant les points faibles, en proposant des solutions créatives et en menant des initiatives qui simplifient, font évoluer et renforcent la plateforme.
- Maintenir les services une fois qu’ils sont en ligne en mesurant et en surveillant la disponibilité, la latence et l’état général du système.
- Assurer une observabilité optimisée : améliorer et élargir la surveillance et l’alerte à l’aide de Datadog; définir les SLO/SLI et créer des tableaux de bord exploitables qui génèrent des résultats de fiabilité.
- Développer et favoriser l’automatisation : améliorer les outils internes, les cadres IaC et les pipelines (Terraform, GitLab CI/CD) afin de réduire les interventions manuelles et permettre des systèmes d’auto-réparation.
- Faire évoluer les systèmes de façon durable par l’automatisation et en favorisant des changements qui améliorent la fiabilité et la rapidité.
- Mettre en pratique une gestion durable des incidents et des analyses post-incident sans reproche. Diriger les examens post-incident (RCA) et identifier les correctifs à long terme qui améliorent la stabilité, la fiabilité et l’expérience des développeurs.
- Mettre en œuvre la surveillance, la journalisation, l’alerte et le signalement des SLA.
- Créer et maintenir une documentation technique.
- Mettre en œuvre, maintenir et faire évoluer les meilleures pratiques SRE.
- Agir comme commandant d’incident lors des incidents; coordonner la réponse interéquipes, gérer les communications et assurer une restauration rapide des services.
Autres exigences :
- Rotation en cas d’escalade d’incidents
- Voyages occasionnels (visites trimestrielles sur les lieux, conférences - moins de 10 %)
Chez Tecsys, nous nous engageons à favoriser un milieu de travail diversifié et inclusif où tous les employés se sentent valorisés, respectés et autonomes. Nous croyons que la diversité stimule l'innovation et renforce notre capacité à offrir des solutions exceptionnelles. Nous accueillons et encourageons les candidatures de personnes de tous horizons, expériences et perspectives à rejoindre notre équipe.
Tecsys est un employeur offrant l'égalité des chances. Des accommodements sont disponibles pour les candidats sélectionnés pour une entrevue. L’usage du masculin dans ce document a pour unique but d’alléger le texte.
NB: Si vous postulez, vous devez être citoyen canadien ou résident permanent du Canada, OU avoir un permis de travail canadien valide.
***
Note concernant notre processus d'embauche : Nous n’utilisons pas l’IA pour filtrer ou rejeter automatiquement les candidatures. Toutefois, nous utilisons certaines questions de présélection afin de prioriser les candidatures les plus pertinentes pour un examen humain.
Note sur l'utilisation de l'IA
Nous encourageons l’utilisation d’outils d’IA pour vous aider à préparer votre candidature, par exemple pour améliorer la clarté, organiser votre CV ou pratiquer vos réponses d’entrevue. Toutefois, nous vous demandons que toutes les informations fournies reflètent votre véritable expérience et que toute évaluation ou soumission écrite représente votre propre travail et votre façon de penser.
Lors des entrevues, nous nous attendons à ce que les candidats participent sans utiliser d’outils d’IA, de scripts ou d’assistance en temps réel. Une conversation authentique et directe nous permet de mieux comprendre votre façon de de réfléchir, de collaborer et de communiquer. L’IA peut soutenir votre préparation, mais ne devrait ni parler ni agir à votre place. C'est réellement vous qu'on veut apprendre à connaitre.
Originally posted on Himalayas