Solution de référence Mellentaane

Exploitation et continuité Mellentaane

Des services possédant des équipes, des procédures, des sauvegardes vérifiées et des exercices de reprise réellement exécutés.

Organisation

Exploiter est une fonction de souveraineté

Installer des outils ne suffit pas. Chaque service doit avoir un propriétaire, une équipe, un niveau de service, des procédures, un inventaire, un plan de continuité et un transfert de compétences.

Boîte à outils

Outils d’exploitation proposés

DomaineProduit open sourceRôle
Centre de servicesGLPIIncidents, demandes, changements, actifs et niveaux de service
Source de vérité réseauNetBoxSites, racks, équipements, IP, câblage et automatisation
SupervisionZabbix + PrometheusInfrastructure, services, capacité et alertes
Sauvegarde génériqueResticCopies chiffrées, dédupliquées et vérifiées
KubernetesVeleroRessources, configurations et volumes persistants
PostgreSQLpgBackRestSauvegarde complète, incrémentale, WAL et restauration temporelle

Clarifier les concepts

Haute disponibilité, sauvegarde et reprise ne sont pas synonymes

Haute disponibilité

Maintient le service malgré la panne d’un composant, mais peut répliquer une corruption.

Réplication

Copie rapidement l’état vers un autre site; elle ne remplace pas un historique de sauvegardes.

Sauvegarde

Conserve des versions restaurables avec isolation et rétention.

Reprise après sinistre

Rétablit un service complet sur une infrastructure alternative.

La preuve par l’exercice

Tests obligatoires

TestFréquence indicativeRésultat attendu
Restauration d’un fichier ou objetMensuelleObjet lisible, métadonnées et droits corrects
Restauration PostgreSQL à un instant donnéTrimestrielleRPO atteint et cohérence applicative
Reconstruction d’un clusterSemestriellePlateforme redéployée depuis le code
Bascule de siteAnnuelle ou selon criticitéRTO atteint et utilisateurs reconnectés
Perte de fournisseurAnnuelle pour les composants critiquesSubstitution ou continuité démontrée

Responsabilités nationales

Équipes du modèle d’exploitation

Centre d’exploitation

01

Supervision, capacité, changements et continuité.

Centre de sécurité

02

Détection, réponse, vulnérabilités et exercices.

Équipe cloud et plateforme

03

OpenStack, Ceph, Kubernetes et automatisation.

Équipe données

04

PostgreSQL, registres, qualité, sauvegarde et performance.

Équipe identité

05

Keycloak, PKI, secrets et comptes privilégiés.

Centre de services

06

Support utilisateurs, incidents, demandes et connaissance.