Votre mission
Vous définirez les standards de fiabilité d’une plateforme où les workloads sont dynamiques et les dépendances multiples.
Ce que vous ferez
- Définir SLO, budgets d’erreur et stratégies de capacité.
- Automatiser déploiement, reprise et réponse aux incidents.
- Construire une observabilité utile aux équipes produit et plateforme.
- Mener les post-mortems et éliminer les classes d’incident récurrentes.
Ce qui vous aidera à réussir
- Expérience Kubernetes, Linux et infrastructure as code.
- Très bonne maîtrise de l’observabilité et du diagnostic distribué.
- Approche pragmatique de l’automatisation et de l’astreinte.
- Capacité à faire progresser la culture de fiabilité.
Nous apprécierons aussi
Nix/NixOSeBPFChaos engineeringCloud souverain