Date et heure de dépôt : 12/08/2026 15:16:29
Référence : 224244
DÉBUT DE MISSION
14/09/2026
BUDGET
450 € HT / jour
DURÉE
12 mois
LIEU
Saint jean de braye
Hybride
CATÉGORIE TECHNIQUE
Systèmes (Infras, Cloud, DevOps, ...), réseaux, sécurité
supervision
Confirmé
prometheus grafana splunk
Confirmé
Votre mission consiste à garantir la disponibilité, la performance, la résilience et l'observabilité du Système d'Information.
Vous interviendrez sur les activités suivantes :
- Dispositif 24/7 : En astreinte du lundi au vendredi de 18h30 à 0h30 et le samedi et dimanche de 8h à 19h (1 semaine sur 5)
- Assurer le maintien en conditions opérationnelles des services, infrastructures et plateformes conformément aux objectifs de disponibilité et de qualité de service ;
- Participer au dispositif d'astreinte selon un roulement d'une semaine toutes les cinq semaines, incluant les soirs, week-ends et jours fériés ;
- Surveiller et analyser les événements, alertes et incidents de production, assurer leur diagnostic, leur traitement et leur coordination avec les équipes concernées ;
- Anticiper les incidents par l'analyse des tendances, des capacités, des signaux faibles et des risques identifiés sur les plateformes ;
- Réaliser les analyses post-incidents, identifier les causes racines et piloter les plans d'actions de fiabilisation ;
- Maintenir et faire évoluer les tableaux de bord, indicateurs, et alertes d'observabilité ;
- Réduire le bruit opérationnel en optimisant les règles d'alerting et en réduisant le volume d'alertes non pertinentes ;
- Participer aux cellules d'incident, de crise et aux démarches d'amélioration continue de la production ;
- Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités d'exploitation ;
- Maintenir et enrichir la documentation, les procédures et les référentiels de l'activité.
Les compétences suivantes constituent des prérequis :
- Maîtrise des concepts et pratiques Site Reliability Engineering (SRE) ;
- Très bonne maîtrise des outils de supervision, monitoring, gestion des logs, trace, métriques et alerting ;
- Aisance dans les environnements conteneurisés et orchestrés (Docker, Kubernetes ou technologies équivalentes) ;
- Bonne compréhension des architectures distribuées, microservices et infrastructures modernes ;
- Expérience de l'automatisation et des pratiques DevOps ;
- Capacité à diagnostiquer et résoudre des incidents complexes ;
- Aptitude à travailler en coordination avec plusieurs équipes techniques.
Environnement Technique :
Outils de Supervision (Prometheus, Grafana, Splunk)
Environnements Conteneurisés : Kubernetes
Système : Linux, Windows
SGBD : PostGreSQL, MariaDB
Socle applicatif : Jboss / Springboot
Scripting Python
Scripting Shell Linux
Architectures distribuées et infrastructures Cloud/Hybrides
Communication :
Capacités rédactionnelles : documentation technique, cahier des charges, communication et compte-rendu
Capacités relationnelles, écrites et orales (sens de l’écoute et du dialogue, conduite de réunion, négociation).
Environnement Méthodologie :
Gestion des événements, incidents et problèmes (ITIL / SRE)
Observabilité et fiabilité des systèmes
Agile / DevOps
Gestion de crise et incidents majeurs
Autonomie, travail collaboratif et partage de connaissances
Force de proposition et amélioration continue.
Grafana
Kubernetes
Linux
MariaDB
PostgreSQL
Prometheus
Python
Splunk
Windows
shell linux
Jboss