Přejít na hlavní obsah

Návody / Pojmy z monitoringu vysvětlené

Strategie opětovných kontrol: potvrzení stavu před upozorněním

Opětovná kontrola je druhé stanovisko, o které monitorovací systém požádá, než uvěří změně stavu: zopakuje neúspěšnou nebo nově úspěšnou kontrolu z jiných lokalit, aby jediné špatné stanoviště nemohlo samo otevřít incident. HostTracker kontroluje web podle plánu nastaveného v konfiguraci monitoringu a nově zjištěný stav UP nebo DOWN se považuje za kandidáta, dokud ho opětovná kontrola nepotvrdí.

Proč jedna neúspěšná kontrola není výpadek

Výsledek kontroly popisuje jeden požadavek, z jednoho místa, v jednom okamžiku. Kterákoli z těchto tří věcí může o webu jako celku vypovídat mylně. Síť mezi jediným kontrolním bodem a vaším serverem může být přerušená, zatímco každá jiná trasa je v pořádku. DNS záznam se stále může šířit v jednom regionu a v sousedním už být správný. Prostředí kontrolního bodu samo o sobě může být neslučitelné s něčím, co váš server dělá.

Kdyby monitorovací systém jednal podle prvního výsledku, upozorňoval by vás na všechny tyto případy a zároveň by kazil statistiku dostupnosti, protože zaznamenaný výpadek se pro vaše uživatele vůbec nestal. Zjištěný stav, UP nebo DOWN, se proto drží jako nepotvrzený, dokud se nepotvrdí, a teprve pak se spustí cokoli navazujícího: odejde upozornění, otevře se epizoda, posune se číslo dostupnosti.

Co opětovná kontrola zachytí

Opětovná kontrola z jiných lokalit je to, co odliší skutečnou, celosvětovou změnu od lokálního artefaktu. Nejčastěji odfiltruje tyto případy:

  • Krátký výpadek během nasazení nové verze, kdy je web zpátky dřív, než proběhne druhá kontrola
  • Nedostupnost DNS během šíření změny konfigurace, kdy některé resolvery odpovídají a jiné ne
  • Lokální zablokování webu nebo adresy kontrolního bodu, viditelné jen z jedné sítě
  • Kontrolní agent, jehož prostředí je neslučitelné s technologiemi, které server používá
  • Problém se směrováním nebo peeringem na trase mezi jediným kontrolním bodem a serverem

Potvrzující kontroly se vybírají z geografické oblasti nastavené pro danou monitorovací úlohu, takže druhé stanovisko přichází ze stejné části světa, kde jsou vaši uživatelé, ne odkudkoli, kde zrovna bylo volno.

Tři strategie opětovných kontrol

HostTracker podporuje tři způsoby, jak rozhodnout, zda je nový stav skutečný.

1. Hlasování většinou. Když kontrola vrátí nový stav, systém přidělí až 7 nových lokalit z geografické oblasti monitorovací úlohy, aby ho potvrdily. Vrácené výsledky se seskupí podle stavu a vyhrává větší skupina. Řekněme, že kontrola z Miami hlásí DOWN a opětovné kontroly z New Yorku, Bostonu a Chicaga se vrátí jako UP, DOWN, UP. DOWN zůstává nepotvrzený a zahodí se, a Miami je penalizováno: pro kontroly tohoto webu se nadále nepoužije. Stejný příklad naopak, kdy Miami po DOWN hlásí UP a New York s Chicagem potvrzují UP, znamená, že přechod DOWN-UP se zaznamená.

2. Pevný počet lokalit potvrzujících DOWN. Zde nastavíte minimální počet opětovných kontrol potřebných k potvrzení DOWN, zatímco UP stále vyžaduje hlasování většinou. S tímto počtem nastaveným na 1 ve stejném příkladu stačí, aby DOWN vrátil samotný Boston, a Miami je potvrzeno jako DOWN, i když New York s Chicagem nesouhlasili.

3. Bez opětovné kontroly. Nový stav se potvrdí okamžitě, jakmile je zjištěn. To předpokládá úplnou důvěru v server i v prostředí monitorovacích lokalit. Hodí se pro několik konkrétních potřeb monitoringu a mělo by se volit uvážlivě, protože každý přechodný síťový problém na jediném kontrolním bodě se stane falešným poplachem a šrámem na čísle dostupnosti.

Jak vybrat strategii

  1. Začněte hlasováním většinou. Je to vyvážená výchozí volba: stojí pár vteřin navíc na potvrzení a odstraní téměř veškerý šum z jediného kontrolního bodu.
  2. Snižte práh potvrzení DOWN, když je rychlé upozornění cennější než klidná schránka. Regionální výpadek, který vidí jen dvě lokality, se k vám i tak dostane, za cenu více falešných poplachů.
  3. Pro přechody UP ponechte hlasování většinou bez ohledu na to, jak nastavíte DOWN. Předčasný UP uzavře incident, který ještě běží, a skryje konec výpadku z vaší statistiky.
  4. Volbu bez opětovné kontroly vyhraďte pro cíle, které máte plně pod kontrolou od začátku do konce, kde raději prošetříte falešný poplach, než abyste čekali na potvrzení.

Ať zvolíte kteroukoli strategii, můžete si neshodu sami reprodukovat ze dvou různých sítí a porovnat, co vidí každá z nich:

curl -sS -o /dev/null -w '%{http_code} %{time_total}s\n' https://example.com/

503 z jedné sítě a 200 z druhé je přesně ten vzorec, který má opětovná kontrola řešit. Pokud je selhávající stav 5xx a ne timeout, server odpověděl, což je jiný problém: viz 503 Service Unavailable.

Co vám potvrzení přináší

Opětovné kontroly jsou to, co umožňuje monitorovacímu systému spouštět časté kontroly z mnoha míst, aniž by se tato citlivost změnila v šum. HostTracker kontroluje z více než 300 kontrolních bodů ve 158 městech, takže pro druhé stanovisko jsou vždy k dispozici nezávislé lokality, a upozornění e-mailem, SMS, hlasovým hovorem, přes Slack, Telegram a další spustí jen potvrzený přechod. Výše uvedené strategie nejsou úplně vyčerpávající množina a podpora může do budoucí verze zvážit novou, pokud váš monitoring má potřebu, kterou žádná z nich nepokrývá. Jak se síť kontrolních bodů využívá, popisuje distribuovaný monitoring dostupnosti, a pojmy, na kterých to stojí, pokrývá zbytek sekce o pojmech z monitoringu.

Zkontrolovat hned

Spusťte bezplatnou kontrolu na svém webu - bez registrace.

Distributed availability monitoring

Sledovat trvale

Dostanete upozornění ve chvíli, kdy něco přestane fungovat: HostTracker kontroluje z více než 300 lokalit a upozorní vás e-mailem, SMS, přes Slack, Telegram a další.

Funkce HostTracker

Více v této sekci: Pojmy z monitoringu vysvětlené