Aller au contenu
Genevois Informatique
Monitoring

Surveillez votre infrastructure cloud en temps réel

Surveillez vos infrastructures cloud en temps réel avec des alertes proactives.

Le cadre de la prestation
1000 € HT / jour1000 CHF HT / jour
Taux journalier
AWS, Azure, GCP
OpenStack et OVHcloud
À distance
France et Suisse

Une panne signalée par vos clients avant vos écrans

Le lundi matin, plus personne n'enregistre de document. La plateforme répond, les sessions s'ouvrent, mais l'écriture échoue : le volume système est plein depuis le samedi après-midi. Il se remplissait pourtant à un rythme parfaitement lisible depuis six semaines, et il aurait suffi de regarder la courbe pour prévoir la date. Personne ne regardait, parce qu'il n'y avait rien à regarder. C'est la forme la plus courante de l'incident évitable : une tendance mesurable que rien ne mesurait.

Le symptôme inverse est tout aussi répandu. Une supervision a bien été installée, mais elle envoie des centaines de messages par jour, personne ne les lit plus, et l'alerte utile se noie dans le reste. Une console pleine de rouge permanent produit le même résultat qu'une absence totale de surveillance, avec en plus la conviction fausse que le sujet est traité. Dans les deux cas, la panne est découverte par un utilisateur, et le temps d'arrêt commence bien avant que quiconque en soit informé.

Ce que nous branchons, et ce que nous refusons d'alerter

Nous posons une règle avant toute sonde : si une alerte n'appelle aucun geste concret, ce n'est pas une alerte, c'est une mesure que l'on consulte dans un graphique. Chaque notification doit désigner sans ambiguïté la ressource et le service concernés, porter un niveau de gravité qui détermine qui est prévenu et à quelle heure, et se refermer automatiquement quand la valeur revient à la normale. Nous déployons Zabbix, la télémétrie native du fournisseur, ou les deux, selon ce qui existe déjà chez vous.

Le périmètre de cette offre est celui de vos plateformes cloud et de vos serveurs applicatifs, en France comme en Suisse. La surveillance des postes de travail, des imprimantes et du réseau de bureau relève d'un autre cadre, celui de la supervision et du support en infogérance, qui s'accompagne d'interventions sur site dans le Bassin Genevois. Nous distinguons les deux dès le cadrage, parce que les seuils, les destinataires et les horaires de traitement n'ont rien de comparable entre un portail public et un poste bureautique.

Ce que couvre la supervision d'une plateforme cloud

  • Nous inventorions les ressources et les services que vos utilisateurs consomment vraiment, y compris ceux hébergés chez un tiers.
  • Nous déployons les sondes sur les serveurs, les bases, les files et les services exposés, avec un contrôle depuis l'extérieur.
  • Nous surveillons l'exécution des sauvegardes et la taille produite, ainsi que les échéances de certificats et de noms de domaine.
  • Nous ajoutons des alertes de budget et de quota fournisseur, pour qu'une dérive se voie avant le relevé mensuel.
  • Nous construisons des tableaux de bord de tendance, destinés aux arbitrages de capacité plutôt qu'à la décoration d'un comité.
  • Nous définissons les niveaux de gravité, les destinataires et les horaires, puis nous apaisons les seuils sur des mesures réelles.
  • Nous produisons un relevé périodique : incidents, temps d'indisponibilité, tendances de remplissage et écarts à surveiller.

Trois règles qui séparent une alerte d'un message ignoré

Une alerte correspond à un geste

Nous supprimons celles qui ne déclenchent aucune action et nous les transformons en courbes consultables. Ce tri est la seule façon de garder une console dont le rouge signifie encore quelque chose.

La tendance vaut mieux que le seuil

Un avertissement du type cette partition sera pleine dans sept jours arrive quand l'intervention se planifie encore. Un seuil franchi à quatre-vingt-quinze pour cent arrive quand il ne reste plus de marge.

Une alerte sans destinataire ne sert à rien

Un message envoyé à trois heures du matin vers une boîte consultée à neuf heures ne raccourcit pas la panne. Nous définissons avec vous ce qui justifie une intervention nocturne et ce qui attend le lendemain.

Des alertes actionnables, pas un mur de rouge

Nous branchons Zabbix ou la stack native du cloud, puis nous réduisons le bruit : une alerte = un runbook. Grafana sert à voir la tendance, pas à impressionner en comité.

Outils et délai

ZabbixGrafanaCloudWatch

Socle de supervision en 1 à 2 semaines sur un compte déjà en place.

Ce que nous mesurons sur une plateforme cloud, et à quel seuil

Le stockage se surveille d'abord par sa vitesse de remplissage, avec un avertissement autour de quatre-vingts pour cent d'occupation et une alerte prioritaire au delà, mais la projection de la date de saturation reste l'information la plus utile. Le processeur et la mémoire ne s'alertent jamais sur un pic, puisqu'une sauvegarde nocturne sature normalement les ressources : nous alertons sur la durée, par exemple une charge élevée maintenue plus d'un quart d'heure en journée. Nous appliquons systématiquement un écart entre le seuil de déclenchement et le seuil de retour au calme, faute de quoi une valeur qui oscille envoie une alerte toutes les cinq minutes.

La disponibilité se contrôle au niveau du service et non de la machine, car une instance peut répondre au réseau pendant que son application est arrêtée. Nous interrogeons donc la base de données, le serveur web, la file de messages ou l'interface applicative elle-même, et l'alerte ne part qu'après plusieurs contrôles négatifs consécutifs, ce qui élimine les fausses alertes dues à une micro-coupure. Une sonde externe complète le dispositif : elle vérifie le code de réponse et le temps de chargement depuis l'extérieur, et détecte des pannes qu'aucune mesure interne ne voit.

Deux sondes n'ont rien de spectaculaire et évitent les arrêts les plus longs. La première porte sur les sauvegardes : nous n'attendons pas le message de fin de tâche, parce qu'une tâche qui ne s'exécute plus du tout n'envoie rien. Nous alertons sur l'absence de rapport au delà du délai attendu et nous comparons la taille produite à celle de la veille, car une copie soudainement dix fois plus petite signale un périmètre modifié, comme l'explique notre article sur les sauvegardes qui ne suffisent pas. La seconde porte sur l'expiration des certificats, sujet de notre article sur le certificat qui expire.

Sur une plateforme cloud, deux dimensions s'ajoutent à la supervision d'un serveur classique. La première est la consommation : une ressource créée en dehors des règles ou un environnement de recette resté allumé se voient dans les mesures avant de se voir sur le relevé, et nous branchons donc des alertes de budget en même temps que les sondes techniques, dans la logique de notre article sur une facture cloud qui augmente. La seconde est le quota du fournisseur : une limite de compte atteinte bloque une mise à l'échelle au pire moment, et cette valeur se surveille comme un disque qui se remplit.

Nous automatisons le déploiement des sondes, parce qu'un agent posé à la main sur une machine créée hier sera oublié demain : la supervision fait partie de la description d'infrastructure, méthode détaillée dans notre article sur Terraform et Ansible. Reste manuel ce qui demande un jugement : le réglage des seuils sur des mesures réelles, la déclaration des fenêtres de maintenance, et les dépendances entre équipements afin qu'une coupure de lien ne génère pas quarante messages. Une supervision ne rend pas votre plateforme plus solide : elle constate un symptôme, elle ne voit pas ce qui n'est pas déclaré, et elle suppose une organisation capable de traiter la notification, sujet développé dans notre article sur le helpdesk 24/7.

Ce qui rend une supervision inutilisable en trois mois

  • Tout activer par défaut

    Les modèles livrés avec un outil surveillent des dizaines de valeurs sans lien avec votre activité. La console devient illisible en quelques semaines et les équipes referment les notifications sans les lire.

  • Superviser la machine et pas le service

    Une instance qui répond au réseau rassure alors que l'application est arrêtée depuis une heure. Le contrôle doit porter sur la base, le serveur web ou l'interface que vos utilisateurs consomment réellement.

  • Envoyer les alertes dans une boîte partagée

    Une notification adressée à tout le monde n'est traitée par personne, et l'incident nocturne se découvre à l'ouverture des bureaux. Chaque niveau de gravité doit désigner un destinataire et une plage horaire.

De l'inventaire aux seuils apaisés

  1. Cartographie

    sous 5 jours après la demande

  2. Déploiement sondes

    1 semaine

  3. Dashboards

    sous 7 jours

  4. Alertes & runbooks

    en continu

Les plateformes que nous surveillons

Cette offre s'adresse aux entreprises dont une application métier, un portail client ou une plateforme de données tourne chez un fournisseur cloud ou sur un cloud privé, et dont l'indisponibilité se compte en chiffre d'affaires ou en retard de production. Elle convient aussi aux équipes internes qui veulent déléguer la surveillance en dehors des heures de bureau. Le parc bureautique, lui, se traite dans un contrat d'infogérance de proximité.

Zone d'intervention

Dashboards pour des équipes à Genève et dans le Genevois français, y compris quand les machines tournent à Zurich, Paris ou Dublin.

Demander un devis

Ce que disent nos clients

Des PME et des indépendants du Bassin Genevois, suivis dans la durée.

« Très très compétent, très réactif. Lors d'une attaque de notre site a restauré la situation en 1 heure, donc peu d'interruption à un moment critique. Recommande vivement. »
Gilles Loffel 2024
« Les services proposés par Mickael sont tout bonnement parfait. Réactif, soucieux du détail et proactif dans les propositions, collaborer avec Genevois informatique est un gage de qualité et de confiance. Le début de cette collaboration n'est qu'une première étape 😉 Merci à toi ! »
PIKOTY EVENT 9 juillet 2025
« Merci énormément pour la création du site de notre association très pro force de proposition et à l'écoute !! Je recommande. »
Anthony Correia 8 juillet 2025

Questions fréquentes

En quoi cette supervision diffère-t-elle de celle de l'infogérance ?

Le périmètre n'est pas le même. Ici, nous surveillons vos plateformes cloud et vos serveurs applicatifs, avec des seuils liés à la disponibilité d'un service. La surveillance des postes, des imprimantes et du réseau de bureau appartient au contrat d'infogérance, qui inclut des interventions sur site dans le Bassin Genevois.

Utilisez-vous vos outils ou ceux du fournisseur cloud ?

Les deux, selon votre existant. Zabbix nous sert de socle commun quand plusieurs environnements doivent être vus au même endroit, et la télémétrie native du fournisseur reste pertinente pour les services managés qu'elle seule mesure. Nous n'imposons pas d'outil, nous imposons qu'une alerte corresponde à un geste.

Combien de temps faut-il pour obtenir une supervision utile ?

Le socle se pose en une à deux semaines sur un compte déjà en place. La phase la plus importante vient ensuite : deux à trois semaines d'ajustement sur des mesures réelles, pendant lesquelles nous supprimons les alertes sans conséquence et configurons les dépendances entre ressources.

Proposez-vous une astreinte en dehors des heures de bureau ?

Oui, lorsque vos services ne peuvent pas attendre le lundi matin. Nous définissons alors avec vous ce qui justifie un appel nocturne, ce qui attend le lendemain matin et ce qui se traite dans la semaine. Cette conversation appartient à la direction, car elle traduit un coût d'arrêt.

Comment cette prestation est-elle facturée ?

La mise en place se facture au taux journalier de 1000 HT. Une fois les seuils stabilisés et les procédures écrites, la surveillance courante se poursuit dans un forfait de run que nous discutons à ce moment-là.

Commençons ensemble

Un projet, une panne, un rendez-vous.

Choisissez un créneau, ou décrivez votre besoin : nous répondons avec un périmètre clair, un prix hors taxes, et un interlocuteur nommé.