Zum Hauptinhalt springen

Anleitungen / Monitoring-Begriffe erklärt

Nachprüfungsstrategien: einen neuen Status vor dem Alarm bestätigen

Eine Nachprüfung ist die zweite Meinung, die ein Monitoring-System einholt, bevor es einer Statusänderung glaubt: Die fehlgeschlagene oder neu erfolgreiche Prüfung wird von anderen Standorten wiederholt, damit ein einzelner schlechter Beobachtungspunkt nicht allein einen Vorfall auslösen kann. HostTracker prüft eine Website nach dem in ihrer Monitoring-Konfiguration festgelegten Zeitplan, und ein neu erkanntes Erreichbar oder Nicht erreichbar gilt als Kandidat, bis die Nachprüfung es bestätigt.

Warum eine fehlgeschlagene Prüfung kein Ausfall ist

Ein Prüfergebnis beschreibt eine Anfrage, von einem Ort, in einem Moment. Jeder dieser drei Punkte kann für die Website als Ganzes falsch liegen. Das Netzwerk zwischen einem einzelnen Prüfpunkt und Ihrem Server kann gestört sein, während jede andere Route einwandfrei funktioniert. Ein DNS-Eintrag kann sich in einer Region noch verbreiten, während er in der nächsten schon korrekt ist. Die eigene Umgebung eines Prüfpunkts kann mit etwas unverträglich sein, das Ihr Server tut.

Würde ein Monitoring-System auf jedes erste Ergebnis reagieren, würde es Sie bei all diesen Fällen alarmieren und dabei auch Ihre Uptime-Statistik verfälschen, da der erfasste Ausfall für Ihre Nutzer nie stattgefunden hat. Deshalb gilt der erkannte Status, Erreichbar oder Nicht erreichbar, als unbestätigt, bis er bestätigt ist, und erst dann geschieht etwas Nachgelagertes: ein Alarm geht raus, eine Episode öffnet sich, die Uptime-Zahl bewegt sich.

Was eine Nachprüfung abfängt

Nachprüfungen von anderen Standorten sind es, was eine echte, websiteweite Änderung von einem lokalen Artefakt unterscheidet. Am häufigsten filtern sie folgende Fälle heraus:

  • Kurze Ausfallzeit während eines neuen Deployments, bei der die Website wieder erreichbar ist, bevor eine zweite Prüfung läuft
  • DNS-Nichterreichbarkeit, während eine Konfigurationsänderung sich verbreitet, sodass manche Resolver antworten und andere nicht
  • Eine lokale Blacklistung der Website oder der Adresse des Prüfpunkts, sichtbar nur von einem Netzwerk aus
  • Ein Prüf-Agent, dessen Umgebung mit den vom Server verwendeten Technologien unverträglich ist
  • Routing- oder Peering-Probleme auf dem Pfad zwischen einem einzelnen Prüfpunkt und dem Server

Die bestätigenden Prüfungen stammen aus der für die Monitoring-Aufgabe konfigurierten Geo-Region, sodass die zweite Meinung aus demselben Teil der Welt kommt, in dem Ihre Nutzer sich befinden, statt von einem beliebigen Standort, der gerade frei ist.

Die drei Nachprüfungsstrategien

HostTracker unterstützt drei Arten zu entscheiden, ob ein neuer Status echt ist.

1. Mehrheitsentscheidung. Meldet eine Prüfung einen neuen Status, weist das System bis zu 7 neue Standorte aus der Geo-Region der Monitoring-Aufgabe zu, um ihn zu bestätigen. Die zurückgemeldeten Ergebnisse werden nach Status gruppiert, und die größere Gruppe gewinnt. Meldet etwa eine Prüfung aus Miami Nicht erreichbar, und die Nachprüfungen aus New York, Boston und Chicago melden Erreichbar, Nicht erreichbar, Erreichbar, ist das Nicht erreichbar unbestätigt und wird verworfen, und Miami wird bestraft: Es wird für Prüfungen dieser Website nicht mehr verwendet. Läuft dasselbe Beispiel andersherum, mit Miami, das nach einem Nicht erreichbar wieder Erreichbar meldet, und New York und Chicago bestätigen Erreichbar, wird der Übergang von Nicht erreichbar zu Erreichbar registriert.

2. Eine feste Anzahl bestätigender Standorte für Nicht erreichbar. Hier legen Sie die Mindestanzahl an Nachprüfungen fest, die ein Nicht erreichbar bestätigen müssen, während für Erreichbar weiterhin die Mehrheitsentscheidung gilt. Ist diese Zahl auf 1 gesetzt, genügt im selben Beispiel Boston allein mit einer Nicht erreichbar-Meldung, um Miamis Nicht erreichbar zu bestätigen, selbst wenn New York und Chicago widersprechen.

3. Keine Nachprüfung. Der neue Status gilt sofort als bestätigt, sobald er erkannt wird. Das setzt vollständiges Vertrauen in den Server und in die Umgebungen der Überwachungsstandorte voraus. Es passt zu einigen wenigen speziellen Monitoring-Bedürfnissen und sollte mit Bedacht gewählt werden, denn jedes vorübergehende Netzwerkproblem an einem einzelnen Prüfpunkt wird zu einem Fehlalarm und einer Delle in der Uptime-Zahl.

Eine Strategie wählen

  1. Beginnen Sie mit der Mehrheitsentscheidung. Sie ist die ausgewogene Vorgabe: Sie kostet ein paar Sekunden zusätzliche Bestätigungszeit und entfernt fast das gesamte Rauschen einzelner Prüfpunkte.
  2. Senken Sie die Nicht-erreichbar-Bestätigungsschwelle, wenn ein schneller Alarm mehr wert ist als ein ruhiges Postfach. Ein regionaler Ausfall, den nur zwei Standorte sehen können, erreicht Sie dann trotzdem, auf Kosten von mehr Fehlalarmen.
  3. Behalten Sie die Mehrheitsentscheidung für Erreichbar-Übergänge bei, unabhängig davon, wie Sie Nicht erreichbar einstellen. Ein verfrühtes Erreichbar schließt einen Vorfall, der noch läuft, und verbirgt das Ende des Ausfalls in Ihrer Statistik.
  4. Reservieren Sie Keine Nachprüfung für Ziele, die Sie vollständig selbst kontrollieren, bei denen Sie lieber einen falschen Alarm untersuchen, als auf eine Bestätigung zu warten.

Welche Strategie Sie auch wählen, Sie können eine Abweichung selbst von zwei verschiedenen Netzwerken aus nachstellen und vergleichen, was jedes davon sieht:

curl -sS -o /dev/null -w '%{http_code} %{time_total}s\n' https://example.com/

Ein 503 von einem Netzwerk und ein 200 von einem anderen ist genau das Muster, das die Nachprüfung auflösen soll. Ist der fehlgeschlagene Status ein 5xx statt eines Timeouts, hat der Server geantwortet, was ein anderes Problem ist: siehe 503 Service Unavailable.

Was Bestätigung Ihnen bringt

Nachprüfungen sind es, die es einem Monitoring-System erlauben, häufige Prüfungen von vielen Orten aus laufen zu lassen, ohne diese Empfindlichkeit zu Rauschen werden zu lassen. HostTracker prüft von über 300 Prüfpunkten in 158 Städten, sodass für die zweite Meinung stets unabhängige Standorte verfügbar sind, und nur ein bestätigter Übergang löst einen Alarm per E-Mail, SMS, Sprachanruf, Slack, Telegram und mehr aus. Die oben genannten Strategien sind nicht die gesamte mögliche Menge, und der Support kann eine neue für eine künftige Version in Betracht ziehen, wenn Ihr Monitoring einen Bedarf hat, den keine davon abdeckt. Wie das Prüfpunktnetzwerk genutzt wird, sehen Sie unter verteiltes Verfügbarkeits-Monitoring, und die dahinterstehenden Begriffe im übrigen Bereich Monitoring-Konzepte.

Jetzt prüfen

Führen Sie die kostenlose Prüfung für Ihre eigene Website aus - ganz ohne Konto.

Distributed availability monitoring

Dauerhaft überwachen

Werden Sie benachrichtigt, sobald etwas ausfällt: HostTracker prüft von über 300 Standorten aus und benachrichtigt Sie per E-Mail, SMS, Slack, Telegram und mehr.

HostTracker Funktionen

Mehr in diesem Bereich: Monitoring-Begriffe erklärt