Monitorizarea cu Prometheus poate genera date incomplete, alerte eronate, interogări lente sau costuri de stocare neașteptat de mari atunci când colectarea, etichetele, regulile de alertă sau perioada de păstrare nu sunt controlate. Aceste probleme pot afecta și tablourile de bord Grafana, deoarece acestea și alertele depind de metricile și etichetele stocate de Prometheus.
Analiza site-urilor web arată cum sunt utilizate datele de măsurare pentru a înțelege vizitatorii, sursele de trafic, vizitele pe pagini, timpul petrecut pe site și acțiunile finalizate. Același principiu se aplică și metricilor de infrastructură: o monitorizare utilă depinde de colectarea datelor potrivite și de prezentarea acestora cu o semnificație clară. Metricile cheie ar trebui analizate în context, mai degrabă decât tratate ca niște cifre izolate.
Cuprins
1. Proiectare deficitară a etichetelor
Etichetele identifică dimensiunile unei metrici. O proiectare necorespunzătoare a etichetelor îngreunează compararea seriilor temporale similare și poate determina panourile Grafana sau regulile de alertă să genereze un amestec confuz de rezultate.
Verificați etichetele utilizate de fiecare indicator important. Păstrați etichetele care susțin o vizualizare reală a tabloului de bord sau o decizie de alertă. Eliminați etichetele care nu ajută utilizatorii să interpreteze indicatorul. Folosiți aceleași denumiri și semnificații ale etichetelor pentru indicatorii corelați.
2. Valori nelimitate ale etichetelor
Cardinalitatea nelimitată apare atunci când o etichetă poate genera un flux continuu de valori noi. Acest lucru produce mai multe serii temporale pe măsură ce trece timpul și poate crește volumul de lucru al interogărilor și utilizarea spațiului de stocare.
Verificați care etichete pot crește fără o limită fixă. Nu utilizați un model de etichetă care permite extinderea necontrolată a numărului de valori. Înlocuiți dimensiunile necontrolate cu un set mai mic și stabil de categorii, care să răspundă în continuare nevoilor de monitorizare.
3. Etichete care fac ca indicatorii să fie înșelători
O metrică poate părea precisă, în timp ce etichetele sale modifică semnificația fiecărei serii. Un panou Grafana poate combina astfel valori care ar trebui vizualizate separat sau poate împărți un singur semnal operațional în mai multe rezultate mici.
Pentru fiecare panou și alertă, identificați indicatorul exact și dimensiunile etichetelor pe care le utilizează. Asigurați-vă că seriile afișate reprezintă același concept operațional. Dacă o etichetă modifică semnificația unui rezultat, grupați sau filtrați datele în mod consecvent înainte de a le utiliza pentru a lua o decizie.
4. Setări incorecte de extragere
Setările incorecte de colectare pot lăsa lacune în datele colectate. Eșantioanele lipsă pot face ca un tablou de bord să pară inactiv și pot împiedica o regulă de alertă să evalueze condiția pe care ar trebui să o detecteze.
Verificați setările de colectare pentru țintele care furnizează metricile afectate. Asigurați-vă că țintele dorite sunt incluse și că setările corespund cerințelor de colectare a datelor. Verificați intervalul de timp rezultat în Grafana după efectuarea unei modificări.
5. Acoperire incompletă a țintelor
O implementare poate părea funcțională, chiar dacă din datele colectate lipsesc sisteme importante. În acest caz, un tablou de bord poate afișa doar o parte a mediului, iar o alertă poate să nu reprezinte serviciul în întregime.
Corelați fiecare panou și alertă importantă din Grafana cu țintele care furnizează metricile respective. Comparați lista respectivă cu sistemele care ar trebui monitorizate. Adăugați colectarea pentru orice țintă necesară care nu este reprezentată, apoi verificați dacă metricile acesteia apar în panourile relevante.
6. Eliminați setările care generează date zgomotoase
Setările de colectare afectează, de asemenea, cantitatea și regularitatea datelor disponibile pentru tablourile de bord și alerte. O potrivire necorespunzătoare poate face ca graficele să conțină zgomot sau poate determina o alertă să reacționeze la schimbări de scurtă durată în loc de un semnal operațional util.
Analizați comportamentul de colectare pentru metricile utilizate de alerte. Comparați graficul rezultat cu condiția pe care alerta ar trebui să o reprezinte. Ajustați abordarea de colectare astfel încât datele să susțină un semnal stabil și ușor de înțeles.
7. Reguli de alertă prea generale
O regulă de alertă generală poate corespunde multor serii și poate genera mai multe notificări decât poate gestiona echipa. Acest lucru face ca alertele să fie zgomotoase și poate ascunde semnalele care necesită atenție.
Verificați metrica și etichetele utilizate de fiecare alertă prea generală. Limitați regula la serviciul, resursa sau condiția care necesită o acțiune. În Grafana, asigurați-vă că rezultatul alertei corespunde unei vizualizări clare a tabloului de bord și că fiecare notificare are o semnificație specifică.
8. Reguli de alertă care nu corespund metricii
O alertă poate fi validă din punct de vedere tehnic, dar totuși înșelătoare atunci când utilizează o metrică sau o grupare de etichete greșită. Rezultatul poate fi o alertă care nu reprezintă condiția afișată în tabloul de bord corespunzător.
Comparați fiecare regulă de alertă cu panoul Grafana corespunzător. Utilizați aceeași definiție a metricii și același sens al etichetelor în ambele locuri. Testați alerta în raport cu datele afișate de panou și eliminați orice grupare care modifică interpretarea dorită.
9. Interogări prea costisitoare
Interogările lente pot rezulta din date metrice voluminoase sau foarte variate, mai ales când etichetele generează numeroase serii temporale. Panourile lente întârzie investigația, iar evaluările lente ale alertelor reduc valoarea notificărilor trimise la timp.
Începeți cu panourile și alertele care necesită cel mai mult timp pentru a afișa rezultatele. Simplificați selecția metricilor și gruparea etichetelor. Evitați să solicitați mai multe serii decât are nevoie tabloul de bord sau alerta. Verificați din nou panoul după fiecare modificare, astfel încât rezultatul să rămână util, nu doar mai mic.
10. Lipsa controalelor de retenție
Fără controale de retenție, metricile stocate pot crește peste nivelul preconizat. Acest lucru poate duce la costuri de stocare neașteptat de mari și poate determina, de asemenea, ca interogările să se aplice asupra unui volum de date istorice mai mare decât are nevoie utilizatorul.
Stabiliți o strategie de păstrare a datelor care să corespundă scopului monitorizării. Păstrați perioada istorică necesară pentru tablourile de bord, revizuirea alertelor și analiza operațională. Verificați creșterea volumului de stocare după aplicarea măsurii de control și asigurați-vă că istoricul selectat rămâne disponibil pentru utilizarea prevăzută.
Cum se diagnostichează simptomele
Utilizați simptomul pentru a alege prima zonă de inspectat:
- Indicatori lipsă sau lacune: verificați mai întâi setările de extragere a datelor și acoperirea țintă.
- Rezultate înșelătoare în tabloul de bord: verificați proiectarea etichetelor, semnificația acestora și gruparea.
- Alerte zgomotoase: inspectați regulile generale și confirmați că alerta corespunde semnalului din tabloul de bord.
- Interogări lente: revizuiți datele cu cardinalitate ridicată și simplificați panourile sau alertele costisitoare.
- Costuri ridicate de stocare: revizuiți valorile nelimitate ale etichetelor și controalele de retenție.
Efectuați câte o modificare specifică pe rând, apoi verificați rezultatul în tabloul de bord Grafana și în alerta afectate. O metrică utilă trebuie să fie suficient de completă pentru a susține decizia, etichetată suficient de clar pentru a putea fi interpretată și suficient de limitată pentru a putea fi interogată și stocată în mod previzibil.