Architecture Decision Record

Active theme: Light

← Mifano ya rekodi za maamuzi

Vipimo, ufuatiliaji, tahadhari

Yaliyomo:

Muhtasari

Suala

Tunataka kutumia vipimo, ufuatiliaji, na tahadhari, kwa sababu tunataka kujua jinsi programu zetu zinavyofanya kazi vizuri, na kujua kuna tatizo wakati gani.

Uamuzi

Kazi inaendelea.

Hali

Tunakusanya taarifa. Tunaanza na ncha zinazowezekana za wigo: zana ya zamani ya bure inayopendekezwa zaidi (Nagios) na zana mpya ya kulipia inayopendekezwa zaidi (New Relic).

Undani

Dhana

Tunataka kuunda programu za wavuti ambazo ni za kisasa, za haraka, za kuaminika, zinazojibu haraka, n.k.

Tunataka kununua badala ya kujenga.

Vikwazo

Tunataka zana zinazofanya kazi vizuri na mfereji wetu wa devops na wingu zetu za uwekaji.

Misimamo

Tunafanya utafiti wa misimamo sasa.

  • AlertManager

  • AppDynamics

  • AppOptics

  • Azure Monitor/Analytics/Insights/Dashboards

  • Bosun

  • Checkly

  • Circonus

  • Cloudwatch

  • EFK

  • ELK

  • Grafana

  • Grafana

  • Graphite

  • Graylog

  • Healthchecks.io

  • Heroku

  • icinga2

  • InfluxDB

  • Instana

  • Kafka

  • Logagent

  • Logz.io

  • Loki

  • Monitis

  • Nagios

  • Nagios

  • Nagiosgraph

  • NewRelic

  • OpsGenie

  • Outlyer

  • PagerDuty

  • Pagerduty

  • PagerDuty

  • Papertrail

  • Prometheus

  • Rollbar

  • Scalyr

  • Sematext Metrics, Logs, Experience, Tracing

  • Sensu

  • SignalFX

  • Slack

  • Splunk

  • Stackdriver

  • Stackstorm

  • Telegraf

  • Telegraf

  • Thanos

  • VictorOps

  • Wavefront

  • Zabbix

Hoja

Hadi sasa, Nagios na New Relic ni ncha za wigo. Nagios ndiyo ya zamani zaidi, rahisi zaidi, ya bure, zana inayowezekana. New Relic ndiyo yenye vipengele vipya zaidi, kamili zaidi, ya kulipia, zana inayowezekana. Tutaanza na tathmini za hizi. Kadri inavyohitajika, tutahamia ndani ya wigo.

Hadi sasa, Zabbix ina mapendekezo bora zaidi, na pia inatoa uwezo kamili zaidi.

Hadi sasa, ELK ina umaarufu bora wa chanzo huria wa jenga-badala-ya-nunua.

Hadi sasa, Prometheus + Graphana zina umaarufu bora.

Athari

Kufanya.

Yanayohusiana

Maamuzi yanayohusiana

Chaguo zitaathiri uwezo wa kujaribiwa, telemetria, na pengine mifumo mingine kama ya huduma kwa wateja, uhandisi wa kuegemewa kwa tovuti, n.k.

Mahitaji yanayohusiana

Kufanya.

Vielelezo vinavyohusiana

Kufanya.

Kanuni zinazohusiana

Inayoweza kurudishwa kwa urahisi.

Haja ya kasi.

Maelezo ya ziada

Rundo zuri la chanzo huria ni:

  • Prometheus kwa vipimo na tahadhari zinazotegemea vipimo

  • Grafana kuonyesha vipimo

  • Elasticsearch/Logstash/Kibana (ELK) kwa kumbukumbu na matukio yaliyopangwa

  • Pushover kwa arifa za simu

Ujumbe wa maandishi huru dhidi ya ujumbe wa matukio uliopangwa

Ujumbe wa maandishi huru: kwa mfano, aina ya vitu vya nasibu ungevipata katika /var/log/messages, na kitu kinachozalishwa kwa makusudi na programu. Ujumbe huu ni muhimu kutambua mambo mengine yanayotokea kwenye mashine kama kuishiwa na kumbukumbu au makosa ya maunzi, lakini una takataka nyingi.

Ujumbe wa matukio uliopangwa: unaozalishwa na programu, wenye seti isiyobadilika au inayobadilika ya sifa, mf. kumbukumbu ya ombi la HTTP, kumbukumbu ya uhasibu, kuingia kwa mtumiaji.

Kwa ujumla, ni vizuri kurekodi maelezo kuhusu kila ombi kwa njia unayoweza kuchimba kwa undani kulingana na sifa. Kwa hivyo kuongeza mf. userid au sessionid kwa kila kitu hukuruhusu kufuatilia. Ufuatiliaji wa wazi pia ni mzuri, bila shaka. Kutumia ELK kwa hili ni kama toleo la maskini la https://www.honeycomb.io/

Graylog ni rahisi zaidi

Graylog ni rahisi zaidi kuiinua kulingana na uzoefu wangu.

Prometheus inahitaji urekebishaji

Kwa ujumla nimeridhika na Prometheus kwa vipimo. Tahadhari zinahitaji urekebishaji fulani, lakini ni nzuri kabisa. Inategemea programu yako. Nadhani ni bora kutoa tahadhari kwa hali zinazoonekana na mtumiaji wa mwisho, si sababu za msingi. Kwa mfano, muda wa kupakia ukurasa ni mzuri, idadi ya maombi kwa sekunde sivyo. Ingawa maombi sifuri kwa sekunde yanaonyesha kuna kitu kibaya.

Faida ya huduma ni kwamba hutoa akili ya ziada tayari. Kwa ujumla napenda Datadog. Huduma zinaweza kuwa ghali kwa kutisha ukiwa na data nyingi, na wakati mwingine huwa na modeli za bei ambazo si rafiki kwa wingu, mf. kutoza kwa kila tukio wakati matukio ni yanayobadilika. Pia kuna tofauti kati ya huduma ambapo kila ombi linatoka kwa mtumiaji anayelipa na zile zinazohusiana na matangazo, ambapo ni asilimia ndogo tu ya maombi hukupatia pesa. Unaweza kuishia na data nyingi na bajeti isiyo kubwa hivyo.

Ninafanya kazi kwenye huduma zinazopokea maombi bilioni 1 kwa siku, kwa hivyo ni jambo la busara kupangisha ufuatiliaji na kumbukumbu zetu wenyewe. Ikiwa kiasi chako ni kidogo zaidi, basi huduma zilizopangishwa ni rahisi zaidi.

Huduma za AWS zimechanganyika

Uzoefu wangu na huduma za AWS umechanganyika. Huduma yao ya Elasticsearch imekuwa si thabiti, kwa hivyo tunaendesha matukio yetu wenyewe kwa hilo. Vipimo vya CloudWatch ni ghali, kwa hivyo kwa ujumla tunavitumia tu kwa vipimo vya kiwango cha "miundombinu" badala ya programu, yaani vipimo vinavyohusiana na afya ambapo AWS inaweza kujua vizuri zaidi kinachoendelea kuliko programu inayoendeshwa kwenye tukio. CloudWatch Logs inaweza kuwa polepole kusasisha na haina metadata nyingi hivyo. Kuendesha ELK husaidia na hilo. Ikiwa kweli nataka data ya wakati halisi, basi kutumia Kafka kama usafirishaji wa kumbukumbu ni bora zaidi. Hilo linaungwa mkono vizuri kabisa na Logstash. Kusimamia kundi la Kafka si kwa mioyo dhaifu, hata hivyo, kuna mabomba mengi yaliyo wazi.

Kafka

Maoni: Kafka inaweza kuwa gumu sana nyakati fulani, au Kafka inaweza kuwa imara kama mwamba na karibu unasahau kuwa iko pale ikifunga kila kitu pamoja.

Maoni: Kafka imekuwa imara, lakini ilikuwa kazi nyingi ya kushangaza kuiweka kwenye kazi. Naifikiria kama hifadhidata ya uhusiano lakini unafanya kazi tu kwenye tabaka "halisi", mf. nafasi za jedwali, faili na sehemu. Kulikuwa na nyakati mwanzoni ambapo zana za usimamizi zilikuwa pungufu, na tulilazimika kuandika programu mf. kuweka upya kundi la walaji. http://howfuckedismydatabase.com/nosql/

Maoni: Tunatumia Kafka kama "bafa" ya ujumbe wa kumbukumbu na mahali ambapo tunaweza kufanya usindikaji wa mtiririko wa wakati halisi kwenye data inayotoka seva nyingi. Tukipata shambulio la DDOS, basi tunahitaji njia ya kuchambua data katika matukio mengi. Ikiwa tunarekodi moja kwa moja kutoka seva hadi ELK, mzigo unaweza kulipua kundi la Elasticsearch.

Maoni: Kafka ni nzuri kwetu kwa sababu tukipata shambulio la DDOS, basi tunahitaji njia ya kuchambua data katika matukio mengi. Ikiwa tunarekodi moja kwa moja kutoka seva hadi ELK, mzigo unaweza kulipua kundi la Elasticsearch.

Maoni: Kafka hufanya kazi kidogo na ina ufanisi zaidi, kwa hivyo inaweza kushughulikia mzigo vizuri zaidi. Na tunapanga foleni kazi ya Kafka na kujaribu tena. Na Kafka kuzidiwa hakuathiri watumiaji wanaojaribu kufanya kazi shirikishi na Kibana, kama ingekuwa hivyo ikiwa Elasticsearch inatatizika.

Maoni: Usindikaji wa mtiririko kwa kiasi kikubwa hutafuta matumizi mabaya, mf. trafiki nyingi mno kutoka anwani moja ya IP katika kundi lote, na kisha kushiriki kizuizi katika kundi lote.

Maoni: Programu-jalizi ya logstash-output-kafka si ya kuaminika kabisa kwa sasa. Nimeumwa na masuala kadhaa kwenye ukurasa wake wa masuala wa GitHub, ambayo hayaonekani kamwe kurekebishwa. Ninataka kuacha kuitumia, na kutuma moja kwa moja kutoka programu zetu hadi Kafka.

Maoni: Sasa tunatuma matukio yaliyopangwa moja kwa moja kutoka programu hadi Kafka. Motisha kuu ilikuwa kugusa data ya kumbukumbu mara chache zaidi na kuepuka kusoma na kuandika diski mara nyingi. Katika mifumo ya kiasi kikubwa, kurekodi kunaweza kuchukua kazi zaidi kuliko programu yenyewe. Ninafikiria kufanya journald itume kumbukumbu moja kwa moja pia, kutoka programu ya C.

Loki

Weka jicho la karibu kwa Loki. Haiko tayari bado lakini itakapokuwa tayari ninatarajia kuwa itafaa zaidi katika rundo hili. Loki ni mkusanyaji wa kumbukumbu ulioundwa na grafana labs, hutumia ukusanyaji na sintaksia ya lebo inayofanana na Prometheus.

Prometheus + alertmanager + Rollbar + Graylog + Grafana

Prometheus + alertmanager kwa vipimo. <3 Prometheus.

Rollbar/Graylog kwa kurekodi/kuripoti makosa (kuna mwingiliano hapa; huduma ndogo huenda haihitaji zote mbili).

Kwa sasa, tahadhari huenda tu kwenye mojawapo ya chaneli chache za Slack ambazo wahusika wenye nia wamewasha arifa. Ikiwa tungekuwa makini zaidi kuhusu zamu za simu zingeenda PagerDuty/VictorOps/n.k.

Grafana kwa grafu na dashibodi. Pia nasubiri kwa hamu kuona kama vifaa vyao vijavyo vya kurekodi vitaifanya Graylog isihitajike.

Thanos

Tunatumia Thanos kama sehemu ya mbele ya usanidi wetu wa HA. Inajua jinsi ya kuondoa nakala rudufu za jozi za HA.

Kwa sasa tunahifadhi miezi 6 ya data ya Prometheus ya ndani. Hii inafanya kazi vizuri kiasi kwetu. Lakini niko katikati tu ya kutoa uhifadhi wa ndoo kwa usanidi wetu wa Thanos kwa uhifadhi wa data wa muda mrefu. Kinadharia, uhifadhi wa GCS utakuwa nafuu kwa takriban 30% kuliko diski ya kawaida ya kudumu ya GCE tunayotumia sasa.

Hatuchukui nakala rudufu ya data ya Prometheus kwa sasa. Data haiwi muhimu sana kwetu zaidi ya kuwa na ya kutosha kwa tahadhari. Uwekaji wetu wa jumla wa kundi hubadilika sana mwaka hadi mwaka kiasi kwamba data ya kihistoria ya zaidi ya miezi michache haivutii sana. Inaweza kuwa ya kuvutia kuwa na takwimu chache za msingi mwaka hadi mwaka, naweza kusanidi seti ya kanuni za kurekodi za takwimu za msingi na kuzihifadhi kwa Federation au kuiacha Thanos ilishughulikie.

HARIRI: Kanusho dogo, mimi ni mwundaji wa Prometheus.

Prometheus HA

HA katika Prometheus hufanywa kwa nakala unaendesha vichota vingi kuna njia za kupigia kura vingi na kuondoa nakala za data

Upanuzi ni kwa kuamua mtandao na kuwa na Prometheus tofauti zikipigia kura sehemu tofauti za mtandao

Uhifadhi wa muda mrefu si kipaji cha prom lakini huhamishwa kwa kitu kama influx au timescaledb (ambayo kiufundi pia huweka alama ya HA) makala niliyosoma kuhusu hilo https://blog.timescale.com/prometheus-ha-postgresql-8de68d19b6f5?gi=7df160f10e07

Sijajaribu mambo ya muda mrefu bado kwa kuwa bado nafanya majaribio tu na kuitumia kwa grafu za muda mfupi wakati librenms inafuatilia mtandao wangu kwa muda mrefu

Datadog + PagerDuty + Threat Stack

Tunatumia Datadog (pamoja na PagerDuty) na Threat Stack na hatuwezi kuwa na furaha zaidi. Lalamiko langu pekee kuhusu DD ni gharama ya juu kiasi ya uhifadhi wa vipimo.

Zabbix

Zabbix na hati maalum za kufuatilia karibu kila kitu. Inafanya kazi kama hirizi.

Outlyer

Ninatumia Outlyer, lakini lazima nitoe kanusho kwamba ninafanya kazi hapa, na kutumia bidhaa yetu wenyewe ni lazima.

Bado nahitaji Graylog, Sentry na Statuscake kuiboresha.

Inasikika kuwa na upendeleo, lakini baada ya kuendesha Nagios na mifumo mingine ya ufuatiliaji ndani ya nyumba kwa furaha, ningenunua suluhisho lililopangishwa katika kazi yoyote mpya na kuondoa maumivu hayo.

Nagios + Nagiosgraph

Tunaendesha Nagios kwa ufuatiliaji wote na tahadhari. Tahadhari hutokea kupitia barua pepe (maonyo na arifa muhimu) na arifa zinazosikika za programu (kwa tahadhari muhimu).

Nagiosgraph hutumika kwa taswira.

Usanidi huu umekuwa na ufanisi mkubwa katika kutuweka tukijulishwa kikamilifu kuhusu kinachotokea katika mazingira yetu. Tunaendesha na kufuatilia takriban seva 110 muhimu kwa dhamira na takriban pointi 760 za data, na tumekuwa na mfumo huu wa asubuhi kwa zaidi ya miaka saba.

Ningependa pia kukusanya kumbukumbu kwa Graylog au ELk wakati fulani.

Prometheus + Grafana + AlertManager

Prometheus + Grafana + AlertManager kupitia chati nzuri ya helm ya Prometheus Operator. Kumbukumbu bado zinaenda kwa mpango wa birch wa LogDNA kwa sababu tuligundua ELK ni nzito mno kwa nodi zetu duni za chini 3 juu 5 kwenye GKE.

DataDog + Sentry + PagerDuty.

Nilikuwa nikiendesha suluhisho zangu zote za ufuatiliaji nikitumia aina zote za programu ikiwa ni pamoja na Nagios, Icinga, Zabbix, ELK, Greylog2, Influx, na zana nyingine nyingi, lakini ukweli ni kwamba kuna juhudi nyingi mno katika kuendesha miundombinu yako ya ufuatiliaji, hasa unapoweza kumlipa mtu mwingine viwango vya chini hivyo ili mtu mwingine akufanyie!

Kulipa wengine kuendesha miundombinu ya ufuatiliaji huwaachia wateja wangu uhuru wa kuzingatia kuendesha majukwaa yao badala ya kufuatilia ufuatiliaji, maana yake thamani wanayopata kutokana na uthabiti wa jukwaa lao inazidi mbali gharama zozote za Ufuatiliaji kama Huduma.

Sensu + Graphite + ELK

Kampuni yangu inapenda sana vitu vilivyopangishwa wenyewe.

Sensu -> PagerDuty

Graphite/Grafana

ELK (Elasticsearch, Logstash, Kibana)

Prometheus + Alertmanager

Prometheus + Alertmanager kwa tahadhari, timu yangu inaamini kwamba ufuatiliaji rahisi ni ufuatiliaji mzuri.

Mifumo mingine kama kurekodi na ufuatiliaji wa safari hutoa muktadha tajiri wa kutambua mtu wa zamu anapopokea tahadhari, lakini hatujengi kamwe tahadhari juu ya hizi.

Sensu + Grafana + Graylog + Kibana + NewRelic.

Sensu, grafana, graylog, kibana, newrelic.

Prometheus + Circonus

Huduma zilizopimwa kwa Prometheus => uchanganuzi na taswira ya Circonus

icinga2 + VictorOps + NewRelic + Sentry + Slack

Tunatumia huduma zifuatazo:

icinga2 kwa ufuatiliaji na VictorOps kwa tahadhari

NewRelic kwa ufuatiliaji wa kina wa huduma

Sentry kwa ufuatiliaji wa makosa katika huduma

Slack/Barua pepe ni sehemu ya tahadhari inayoanzishwa kutoka NewRelic au icinga2

AppDynamics + Papertrail + PagerDuty + Healthchecks.io + Stackdriver

AppDynamics

Papertrail

PagerDuty

Healthchecks.io

Stackdriver

icinga2 + elasticsearch

icinga2 na ujumuishaji wa elasticsearch kwa uchanganuzi na ujumuishaji wa graphite+grafana kwa grafu.

kutokana na unyumbufu wa kanuni za apply katika icinga2, waundaji wanaweza kuona tu huduma wanazopokea arifa zake.

na kupitia icinga2 director, waprogramu wanaweza kwa urahisi kufafanua ukaguzi wao wenyewe (ambao hufanya, kila baada ya siku chache - ukaguzi 100 hutoka, ukaguzi mwingine 100 huingia) kwa kiwango kikubwa bila usumbufu wowote.

DataDog + New Relic + ELK + EFK + Sentry + Alertmanager + VictorOps

Tulicho nacho sasa:

DataDog kwa vipimo

New Relic kwa ufuatiliaji wa programu

ELK (Elastic Search + Logstash + Kibana) kwa kumbukumbu

Sentry (iliyopangishwa wenyewe) kwa kurekodi vighairi

Barua pepe + Slack + VictorOps kwa tahadhari (kulingana na ukali)

Tunachotaka kuwa nacho:

Prometheus kwa vipimo (Grafana kwa taswira)

New Relic (pengine Elastic Search APM) kwa ufuatiliaji wa programu

EFK (elastic search + fluentd + kibana) kwa kurekodi. Pengine, Loki na Grafana itakuwa tayari kwa uzalishaji kufikia wakati tutakapofika hapa

Sentry kwa vighairi

Alertmanager + barua pepe + VictorOps kwa tahadhari

Wavefront + Scalyr + PagerDuty + Stackstorm + Slack

Wavefront + Scalyr + PagerDuty + Stackstorm + Slack (Kanusho: nafanya kazi VMware)

Telegraf + Prometheus + InfluxDB + Grafana

Telegraf kwa vipimo vya seva kama CPU, Diski, Kumbukumbu na Mtandao. Pia tunatumia Telegraf kwa ufuatiliaji wa SNMP wa vifaa vyetu vya mtandao.

Prometheus kwa vipimo vya programu. Tunaweka ukaguzi wa afya kwenye msimbo wa programu yetu ambao Prometheus huvuna.

InfluxDB kwa uhifadhi wa mfululizo wa wakati. Hapa ndipo data yetu ya Telegraf hutumwa.

Grafana kwa dashibodi na tahadhari. Injini ya tahadhari si imara sana, lakini inafanya kazi. Pia tunatuma tahadhari kwenye Slack.

Tusichonacho sasa ni suluhisho la kati la kurekodi. ELK ina nguvu lakini ni ngumu kusanidi na kusimamia, na sijui njia mbadala yoyote ya bure iliyo karibu vya kutosha kuangalia.

Sematext + Logagent + Experience

Sematext kwa vipimo, kwa kumbukumbu, kwa ufuatiliaji wa safari, hivi karibuni kwa ufuatiliaji wa watumiaji halisi pia. Rahisi/nafuu zaidi kuliko kutumia N zana/huduma tofauti, kwa maoni yangu.

Kwa kusafirisha kumbukumbu tulikuwa tukitumia rsyslog kisha tukahamia Logagent.

Kwa kuripoti ajali za sehemu ya mbele tunatumia Sentry, lakini tutahamia Experience hivi karibuni.

Kanusho: Mimi ni Sematextan.

Azure Monitor/Analytics + OpsGenie

Natamani Log Analytics ingekuwa na kiolesura bora zaidi. Tunahama kutoka splunk, ambayo ilikuwa rahisi zaidi kuabiri.

Prometheus + Alertmanager + Grafana + Splunk + PagerDuty

Prometheus, Alertmanager, Grafana, Splunk, PagerDuty

Kwa kweli hutaki kuendesha mfumo wako wa arifa. Unaweza kubadilisha Splunk na ELK isipokuwa timu yako ya Usalama inapendelea Splunk.

Telegraf + Prometheus + Grafana + Alertmanager

Telegraf kama mkusanyaji, Prometheus + Alertmanager kwa ufuatiliaji na tahadhari, vimeunganishwa na chaneli za slack na pagerduty kwa tahadhari muhimu. Grafana kwa taswira ya vipimo vya mwenyeji.

Prometheus + Grafana + Cloudwatch + sentry + kibana + elasticsearch

Prometheus kwa vipimo + tahadhari

Grafana kwa dashibodi za Prometheus

Cloudwatch inafuatilia matukio ya Prometheus

sentry kwa ufuatiliaji wa vighairi

kibana + elasticsearch

graylog

prometheus Push Gateway kwa kazi za kundi/cron

SOP https://github.com/rapidloop/sop "kusukuma/kusambaza" vipimo kutoka tukio 1 la Prometheus hadi jingine

wateja aidha hutumia wateja wa Prometheus. Tunajaribu kutumia opencensus.io upande wa mteja

PagerDuty + Monitis

PagerDuty + Monitis. Pia baadhi ya Azure Functions maalum za kupima afya ya baadhi ya huduma.

Tunatazamia kuanzisha Prometheus na Grafana mwaka huu

Prometheus + Grafana + Bosun

Prometheus kwa kuhifadhi data ya mfululizo wa wakati. Grafana kwa taswira. Bosun kwa usimamizi wa tahadhari.

Azure Monitor/Analytics/Insights/Dashboards

Duka la Azure pekee, Azure Monitor, Log Analytics, App Insights, Azure Dashboards + Pager Duty

Grafana + Monitis + OpsGenie + Slack

Grafana kwa kufuatilia huduma za kontena katika Kubernetes kupitia Prometheus

Monitis kwa ufuatiliaji wa huduma mwanzo-hadi-mwisho hasa kwa API za wavuti na programu za wavuti

OpsGenie kwa usimamizi wa tahadhari

Slack kwa kupata taarifa za hali kutoka kwa mifumo yetu

Checkly + AppOptics + Cloudwatch + Heroku + Pagerduty + Papertrail

Mhandisi wa (dev)ops wa muda mrefu hapa. Nilikulia Nagios. Ningependa maoni kuhusu SaaS yangu iliyojengwa kwa mtaji wangu https://checklyhq.com. Tunafanya ufuatiliaji wa API na ufuatiliaji wa miamala ya tovuti kwa tahadhari za kina kabisa.

Nilianzisha Checkly kwa sababu ufuatiliaji hai / bandia katika eneo la API ulikuwa na mipaka kiasi (na ghali). Ufuatiliaji unaotegemea kivinjari / wa hati ni wa umiliki zaidi na ghali zaidi. Tunatumia Puppeteer na kuweka bei chini iwezekanavyo.

Rundo letu la ufuatiliaji:

Checkly (kutumia bidhaa yetu wenyewe...)

AppOptics (grafu maalum)

AWS Cloudwatch & SNS kwa ujumbe wa SMS.

tahadhari zilizojengewa ndani za Heroku.

Pagerduty

Papertrail

Instana + Logz.io + slack

Instana hutuarifu kwenye slack kuhusu matatizo ya miundombinu au kushuka kwa utendaji, na tumesanidi logz.io kutahadharisha kwenye slack kwa kiasi fulani cha kumbukumbu za kiwango cha kosa kutoka tabaka la programu.

SignalFX + Splunk + PagerDuty + Slack

Kwa sasa tunatumia: SignalFX, Splunk, PagerDuty na Slack. Sipendi sana SignalFX ingawa timu yao ya usaidizi ni rafiki sana na inajibu haraka. Napenda Splunk (inafaa ikiwa unaweza kulipia), PagerDuty na Slack.

Nilikuwa nikitumia rundo la TICK ambapo C nyingi zilikuwa kwa kweli G, yaani Grafana ingawa nilitumia Chronograf kidogo. Hilo lilikuwa la kustaajabisha lakini lilikuwa usumbufu kusimamia. Mtanziko wa kawaida wa SaaS dhidi ya kujipangishia.

Nimetumia DataDog, New Relic, Graylog, ELK na BugSnag. Napenda DataDog na New Relic sana, Graylog ni nzuri kabisa. Mimi si shabiki mkubwa wa ELK. BugSnag ni nzuri, kwa kweli nahisi kufuatilia makosa/vighairi ni mbadala mzuri kabisa wa ufuatiliaji kamili wa kumbukumbu, katika visa vingi.

ELK + Prometheus + Grafana

Kama wengine, tunatumia ELK kwa kumbukumbu na Prometheus+Grafana kwa kila kitu kingine.

Kudumisha usanidi huu ni rahisi ukijipa ruhusa ya kupoteza data mara kwa mara. Kwa mfano, ikiwa hifadhidata yetu ya ElasticSearch itaingia kwenye hali mbaya (ambayo hutokea kila baada ya miezi 2-3 kwetu kwa bahati mbaya) hatujisumbui na HA na badala yake tunatupa data na kuendelea na maisha yetu. Ikiwa lazima kabisa uwe na HA au uhifadhi wa muda mrefu, bahati njema.

Datadog + Prometheus + Grafana

Nilisanidi Datadog kwa mwezi hadi mwezi kwa sababu nilipofika hapa, hakukuwa na ufuatiliaji na hakuna tahadhari. Tovuti chache tu zetu zilikuwa zikifuatiliwa kila dakika 5 kwa upatikanaji. Datadog bila shaka ndiyo rahisi zaidi kusanidi. Nitakapomaliza kushughulikia masuala mengine yote, nitabadilisha kwenda Prometheus+Grafana. Sijaamua 100% bado kuhusu usimamizi wa kumbukumbu.

Nagios + ELK

Tuna bidhaa zaidi ya 100+ tunazosaidia.

Kwa ndani ya majengo, ni zaidi Nagios na ELK. Kwa wingu, tunahama kutoka DataDog kwenda NewRelic.

Datadog dhidi ya Site24x7 + StatusCake + PagerDuty + SumoLogic + Slack

Tulikuwa tukitumia datadog lakini tuligundua ni ghali mno kwa mahitaji yetu. Usinielewe vibaya ni nzuri sana lakini, ina gharama kubwa. Tuliweza kusanidi site24x7.com kwa usajili wa kila mwaka kwa takriban miezi 2-3 ya gharama kutoka DD.

Rundo letu la ufuatiliaji:

Site24x7 - APM, ufuatiliaji wa URL za nje, ufuatiliaji wa mtiririko wa barua za SMTP, kuisha kwa muda wa ssl na ufuatiliaji wa michakato.

StatusCake - kwa ufuatiliaji na uthibitisho wa URL - Ni nakala yetu ya akiba endapo site24x7 itakosa kitu (haikosi) lakini SC ni rahisi kunyumbulika zaidi kwa ufuatiliaji wa milango ya nje na huduma kwa mahitaji yetu.

Zana zote mbili hupandisha ngazi hadi PagerDuty, kisha tunapata ngazi zetu za kupanda kwenye slack.

SumoLogic - kwa ufuatiliaji wa kumbukumbu (ni zana nzuri sana lakini changamano kidogo kwa mahitaji yetu)

Kutoka slack tunaweza kukiri, au kurekebisha tahadhari.

Kisha tuna otomatiki nyingi za site24x7 ambazo kisha huunganisha na commando.io kwa 'BedOps' kama tunavyoiita - ambapo tahadhari inapoanzishwa, tunaanzisha hati chache au otomatiki kama jaribio la kurekebisha hali (99% ya wakati otomatiki + hati zetu hutuweka mbali na matatizo)

Tuna miongozo ya ndani ya kazi (runbooks) katika KB yetu kwa wakati otomatiki zinaposhindwa au kama kuna kitu nje ya wigo kinachohitaji kurekebishwa.

Prometheus + AlertManager + Grafana + Stackdriver

Prometheus (Operator) / AlertManager / Grafana kwa vipimo katika makundi yetu ya GKE na VM.

Google Stackdriver kwa Kumbukumbu (kwa kuwa imejumuishwa na inatumika kwa chaguomsingi na kwa sasa inatosha mahitaji yetu).

Zabbix

Zabbix kwa kila kitu. Hakuna programu ya ziada inayohitajika.