Opérateur télécom B2B. Équipe SRE de sept personnes responsable de tout le socle technique — cloud OpenStack privé réparti sur 3 datacenters, serveurs, baies de stockage, 13 clusters Kubernetes et plateforme de livraison. Objectif de disponibilité : 99 %.
- Exploitation de tout le socle technique du groupe, du matériel aux applications : cloud OpenStack privé réparti sur 3 datacenters (Kolla, bare metal via Bifrost/Ironic), baies Pure Storage et 13 clusters Kubernetes totalisant 250 nœuds et 200 applications.
- Conception et maintien du chart Helm plateforme qui déploie toutes les applications du groupe, et de la couche données : 72 clusters RabbitMQ, 127 bases PostgreSQL sous CNPG, 60 instances Redis/Valkey, un cluster Cassandra de 3 To sur 18 nœuds, et MySQL.
- Migration de 110 applications et serveurs de l'IT interne vers le cloud OpenStack/Kubernetes privé, sans interruption sur le périmètre critique.
- Initiative et livraison de la plateforme d'agents LLM on-premise (vLLM, llm-d, GAIE, KServe, Hermes) avec RBAC et base vectorielle Milvus/RagFlow : triage automatisé des alertes, temps de qualification des incidents réduit d'environ 80 %.
- Migration des 13 clusters de Kubespray vers Talos — build 1 heure → 5 minutes — et rédaction puis répétition du plan de reprise : restauration d'etcd, recréation complète, sauvegardes, RTO et RPO par périmètre.
- Standardisation du GitOps (Argo CD, Helm, Kustomize), de la conformité policy-as-code (Kyverno) et de l'élasticité (KEDA sur les files RabbitMQ) ; automatisation des accès (Boundary), de l'identité (Keycloak/OIDC via Terraform) et des mises à jour (Renovate).