Vipimo, ufuatiliaji, tahadhari
Yaliyomo:
- Muhtasari
- Undani
- Yanayohusiana
- Maelezo ya ziada
- Ujumbe wa maandishi huru dhidi ya ujumbe wa matukio uliopangwa
- Graylog ni rahisi zaidi
- Prometheus inahitaji urekebishaji
- Huduma za AWS zimechanganyika
- Kafka
- Loki
- Prometheus + alertmanager + Rollbar + Graylog + Grafana
- Thanos
- Prometheus HA
- Datadog + PagerDuty + Threat Stack
- Zabbix
- Outlyer
- Nagios + Nagiosgraph
- Prometheus + Grafana + AlertManager
- DataDog + Sentry + PagerDuty.
- Sensu + Graphite + ELK
- Prometheus + Alertmanager
- Sensu + Grafana + Graylog + Kibana + NewRelic.
- Prometheus + Circonus
- icinga2 + VictorOps + NewRelic + Sentry + Slack
- AppDynamics + Papertrail + PagerDuty + Healthchecks.io + Stackdriver
- icinga2 + elasticsearch
- DataDog + New Relic + ELK + EFK + Sentry + Alertmanager + VictorOps
- Wavefront + Scalyr + PagerDuty + Stackstorm + Slack
- Telegraf + Prometheus + InfluxDB + Grafana
- Sematext + Logagent + Experience
- Azure Monitor/Analytics + OpsGenie
- Prometheus + Alertmanager + Grafana + Splunk + PagerDuty
- Telegraf + Prometheus + Grafana + Alertmanager
- Prometheus + Grafana + Cloudwatch + sentry + kibana + elasticsearch
- PagerDuty + Monitis
- Prometheus + Grafana + Bosun
- Azure Monitor/Analytics/Insights/Dashboards
- Grafana + Monitis + OpsGenie + Slack
- Checkly + AppOptics + Cloudwatch + Heroku + Pagerduty + Papertrail
- Instana + Logz.io + slack
- SignalFX + Splunk + PagerDuty + Slack
- ELK + Prometheus + Grafana
- Datadog + Prometheus + Grafana
- Nagios + ELK
- Datadog dhidi ya Site24x7 + StatusCake + PagerDuty + SumoLogic + Slack
- Prometheus + AlertManager + Grafana + Stackdriver
- Zabbix
Muhtasari
Suala
Tunataka kutumia vipimo, ufuatiliaji, na tahadhari, kwa sababu tunataka kujua jinsi programu zetu zinavyofanya kazi vizuri, na kujua kuna tatizo wakati gani.
Uamuzi
Kazi inaendelea.
Hali
Tunakusanya taarifa. Tunaanza na ncha zinazowezekana za wigo: zana ya zamani ya bure inayopendekezwa zaidi (Nagios) na zana mpya ya kulipia inayopendekezwa zaidi (New Relic).
Undani
Dhana
Tunataka kuunda programu za wavuti ambazo ni za kisasa, za haraka, za kuaminika, zinazojibu haraka, n.k.
Tunataka kununua badala ya kujenga.
Vikwazo
Tunataka zana zinazofanya kazi vizuri na mfereji wetu wa devops na wingu zetu za uwekaji.
Misimamo
Tunafanya utafiti wa misimamo sasa.
AlertManager
AppDynamics
AppOptics
Azure Monitor/Analytics/Insights/Dashboards
Bosun
Checkly
Circonus
Cloudwatch
EFK
ELK
Grafana
Grafana
Graphite
Graylog
Healthchecks.io
Heroku
icinga2
InfluxDB
Instana
Kafka
Logagent
Logz.io
Loki
Monitis
Nagios
Nagios
Nagiosgraph
NewRelic
OpsGenie
Outlyer
PagerDuty
Pagerduty
PagerDuty
Papertrail
Prometheus
Rollbar
Scalyr
Sematext Metrics, Logs, Experience, Tracing
Sensu
SignalFX
Slack
Splunk
Stackdriver
Stackstorm
Telegraf
Telegraf
Thanos
VictorOps
Wavefront
Zabbix
Hoja
Hadi sasa, Nagios na New Relic ni ncha za wigo. Nagios ndiyo ya zamani zaidi, rahisi zaidi, ya bure, zana inayowezekana. New Relic ndiyo yenye vipengele vipya zaidi, kamili zaidi, ya kulipia, zana inayowezekana. Tutaanza na tathmini za hizi. Kadri inavyohitajika, tutahamia ndani ya wigo.
Hadi sasa, Zabbix ina mapendekezo bora zaidi, na pia inatoa uwezo kamili zaidi.
Hadi sasa, ELK ina umaarufu bora wa chanzo huria wa jenga-badala-ya-nunua.
Hadi sasa, Prometheus + Graphana zina umaarufu bora.
Athari
Kufanya.
Yanayohusiana
Maamuzi yanayohusiana
Chaguo zitaathiri uwezo wa kujaribiwa, telemetria, na pengine mifumo mingine kama ya huduma kwa wateja, uhandisi wa kuegemewa kwa tovuti, n.k.
Mahitaji yanayohusiana
Kufanya.
Vielelezo vinavyohusiana
Kufanya.
Kanuni zinazohusiana
Inayoweza kurudishwa kwa urahisi.
Haja ya kasi.
Maelezo ya ziada
Rundo zuri la chanzo huria ni:
Prometheus kwa vipimo na tahadhari zinazotegemea vipimo
Grafana kuonyesha vipimo
Elasticsearch/Logstash/Kibana (ELK) kwa kumbukumbu na matukio yaliyopangwa
Pushover kwa arifa za simu
Ujumbe wa maandishi huru dhidi ya ujumbe wa matukio uliopangwa
Ujumbe wa maandishi huru: kwa mfano, aina ya vitu vya nasibu ungevipata katika /var/log/messages, na kitu kinachozalishwa kwa makusudi na programu. Ujumbe huu ni muhimu kutambua mambo mengine yanayotokea kwenye mashine kama kuishiwa na kumbukumbu au makosa ya maunzi, lakini una takataka nyingi.
Ujumbe wa matukio uliopangwa: unaozalishwa na programu, wenye seti isiyobadilika au inayobadilika ya sifa, mf. kumbukumbu ya ombi la HTTP, kumbukumbu ya uhasibu, kuingia kwa mtumiaji.
Kwa ujumla, ni vizuri kurekodi maelezo kuhusu kila ombi kwa njia unayoweza kuchimba kwa undani kulingana na sifa. Kwa hivyo kuongeza mf. userid au sessionid kwa kila kitu hukuruhusu kufuatilia. Ufuatiliaji wa wazi pia ni mzuri, bila shaka. Kutumia ELK kwa hili ni kama toleo la maskini la https://www.honeycomb.io/
Graylog ni rahisi zaidi
Graylog ni rahisi zaidi kuiinua kulingana na uzoefu wangu.
Prometheus inahitaji urekebishaji
Kwa ujumla nimeridhika na Prometheus kwa vipimo. Tahadhari zinahitaji urekebishaji fulani, lakini ni nzuri kabisa. Inategemea programu yako. Nadhani ni bora kutoa tahadhari kwa hali zinazoonekana na mtumiaji wa mwisho, si sababu za msingi. Kwa mfano, muda wa kupakia ukurasa ni mzuri, idadi ya maombi kwa sekunde sivyo. Ingawa maombi sifuri kwa sekunde yanaonyesha kuna kitu kibaya.
Faida ya huduma ni kwamba hutoa akili ya ziada tayari. Kwa ujumla napenda Datadog. Huduma zinaweza kuwa ghali kwa kutisha ukiwa na data nyingi, na wakati mwingine huwa na modeli za bei ambazo si rafiki kwa wingu, mf. kutoza kwa kila tukio wakati matukio ni yanayobadilika. Pia kuna tofauti kati ya huduma ambapo kila ombi linatoka kwa mtumiaji anayelipa na zile zinazohusiana na matangazo, ambapo ni asilimia ndogo tu ya maombi hukupatia pesa. Unaweza kuishia na data nyingi na bajeti isiyo kubwa hivyo.
Ninafanya kazi kwenye huduma zinazopokea maombi bilioni 1 kwa siku, kwa hivyo ni jambo la busara kupangisha ufuatiliaji na kumbukumbu zetu wenyewe. Ikiwa kiasi chako ni kidogo zaidi, basi huduma zilizopangishwa ni rahisi zaidi.
Huduma za AWS zimechanganyika
Uzoefu wangu na huduma za AWS umechanganyika. Huduma yao ya Elasticsearch imekuwa si thabiti, kwa hivyo tunaendesha matukio yetu wenyewe kwa hilo. Vipimo vya CloudWatch ni ghali, kwa hivyo kwa ujumla tunavitumia tu kwa vipimo vya kiwango cha "miundombinu" badala ya programu, yaani vipimo vinavyohusiana na afya ambapo AWS inaweza kujua vizuri zaidi kinachoendelea kuliko programu inayoendeshwa kwenye tukio. CloudWatch Logs inaweza kuwa polepole kusasisha na haina metadata nyingi hivyo. Kuendesha ELK husaidia na hilo. Ikiwa kweli nataka data ya wakati halisi, basi kutumia Kafka kama usafirishaji wa kumbukumbu ni bora zaidi. Hilo linaungwa mkono vizuri kabisa na Logstash. Kusimamia kundi la Kafka si kwa mioyo dhaifu, hata hivyo, kuna mabomba mengi yaliyo wazi.
Kafka
Maoni: Kafka inaweza kuwa gumu sana nyakati fulani, au Kafka inaweza kuwa imara kama mwamba na karibu unasahau kuwa iko pale ikifunga kila kitu pamoja.
Maoni: Kafka imekuwa imara, lakini ilikuwa kazi nyingi ya kushangaza kuiweka kwenye kazi. Naifikiria kama hifadhidata ya uhusiano lakini unafanya kazi tu kwenye tabaka "halisi", mf. nafasi za jedwali, faili na sehemu. Kulikuwa na nyakati mwanzoni ambapo zana za usimamizi zilikuwa pungufu, na tulilazimika kuandika programu mf. kuweka upya kundi la walaji. http://howfuckedismydatabase.com/nosql/
Maoni: Tunatumia Kafka kama "bafa" ya ujumbe wa kumbukumbu na mahali ambapo tunaweza kufanya usindikaji wa mtiririko wa wakati halisi kwenye data inayotoka seva nyingi. Tukipata shambulio la DDOS, basi tunahitaji njia ya kuchambua data katika matukio mengi. Ikiwa tunarekodi moja kwa moja kutoka seva hadi ELK, mzigo unaweza kulipua kundi la Elasticsearch.
Maoni: Kafka ni nzuri kwetu kwa sababu tukipata shambulio la DDOS, basi tunahitaji njia ya kuchambua data katika matukio mengi. Ikiwa tunarekodi moja kwa moja kutoka seva hadi ELK, mzigo unaweza kulipua kundi la Elasticsearch.
Maoni: Kafka hufanya kazi kidogo na ina ufanisi zaidi, kwa hivyo inaweza kushughulikia mzigo vizuri zaidi. Na tunapanga foleni kazi ya Kafka na kujaribu tena. Na Kafka kuzidiwa hakuathiri watumiaji wanaojaribu kufanya kazi shirikishi na Kibana, kama ingekuwa hivyo ikiwa Elasticsearch inatatizika.
Maoni: Usindikaji wa mtiririko kwa kiasi kikubwa hutafuta matumizi mabaya, mf. trafiki nyingi mno kutoka anwani moja ya IP katika kundi lote, na kisha kushiriki kizuizi katika kundi lote.
Maoni: Programu-jalizi ya logstash-output-kafka si ya kuaminika kabisa kwa sasa. Nimeumwa na masuala kadhaa kwenye ukurasa wake wa masuala wa GitHub, ambayo hayaonekani kamwe kurekebishwa. Ninataka kuacha kuitumia, na kutuma moja kwa moja kutoka programu zetu hadi Kafka.
Maoni: Sasa tunatuma matukio yaliyopangwa moja kwa moja kutoka programu hadi Kafka. Motisha kuu ilikuwa kugusa data ya kumbukumbu mara chache zaidi na kuepuka kusoma na kuandika diski mara nyingi. Katika mifumo ya kiasi kikubwa, kurekodi kunaweza kuchukua kazi zaidi kuliko programu yenyewe. Ninafikiria kufanya journald itume kumbukumbu moja kwa moja pia, kutoka programu ya C.
Loki
Weka jicho la karibu kwa Loki. Haiko tayari bado lakini itakapokuwa tayari ninatarajia kuwa itafaa zaidi katika rundo hili. Loki ni mkusanyaji wa kumbukumbu ulioundwa na grafana labs, hutumia ukusanyaji na sintaksia ya lebo inayofanana na Prometheus.
Prometheus + alertmanager + Rollbar + Graylog + Grafana
Prometheus + alertmanager kwa vipimo. <3 Prometheus.
Rollbar/Graylog kwa kurekodi/kuripoti makosa (kuna mwingiliano hapa; huduma ndogo huenda haihitaji zote mbili).
Kwa sasa, tahadhari huenda tu kwenye mojawapo ya chaneli chache za Slack ambazo wahusika wenye nia wamewasha arifa. Ikiwa tungekuwa makini zaidi kuhusu zamu za simu zingeenda PagerDuty/VictorOps/n.k.
Grafana kwa grafu na dashibodi. Pia nasubiri kwa hamu kuona kama vifaa vyao vijavyo vya kurekodi vitaifanya Graylog isihitajike.
Thanos
Tunatumia Thanos kama sehemu ya mbele ya usanidi wetu wa HA. Inajua jinsi ya kuondoa nakala rudufu za jozi za HA.
Kwa sasa tunahifadhi miezi 6 ya data ya Prometheus ya ndani. Hii inafanya kazi vizuri kiasi kwetu. Lakini niko katikati tu ya kutoa uhifadhi wa ndoo kwa usanidi wetu wa Thanos kwa uhifadhi wa data wa muda mrefu. Kinadharia, uhifadhi wa GCS utakuwa nafuu kwa takriban 30% kuliko diski ya kawaida ya kudumu ya GCE tunayotumia sasa.
Hatuchukui nakala rudufu ya data ya Prometheus kwa sasa. Data haiwi muhimu sana kwetu zaidi ya kuwa na ya kutosha kwa tahadhari. Uwekaji wetu wa jumla wa kundi hubadilika sana mwaka hadi mwaka kiasi kwamba data ya kihistoria ya zaidi ya miezi michache haivutii sana. Inaweza kuwa ya kuvutia kuwa na takwimu chache za msingi mwaka hadi mwaka, naweza kusanidi seti ya kanuni za kurekodi za takwimu za msingi na kuzihifadhi kwa Federation au kuiacha Thanos ilishughulikie.
HARIRI: Kanusho dogo, mimi ni mwundaji wa Prometheus.
Prometheus HA
HA katika Prometheus hufanywa kwa nakala unaendesha vichota vingi kuna njia za kupigia kura vingi na kuondoa nakala za data
Upanuzi ni kwa kuamua mtandao na kuwa na Prometheus tofauti zikipigia kura sehemu tofauti za mtandao
Uhifadhi wa muda mrefu si kipaji cha prom lakini huhamishwa kwa kitu kama influx au timescaledb (ambayo kiufundi pia huweka alama ya HA) makala niliyosoma kuhusu hilo https://blog.timescale.com/prometheus-ha-postgresql-8de68d19b6f5?gi=7df160f10e07
Sijajaribu mambo ya muda mrefu bado kwa kuwa bado nafanya majaribio tu na kuitumia kwa grafu za muda mfupi wakati librenms inafuatilia mtandao wangu kwa muda mrefu
Datadog + PagerDuty + Threat Stack
Tunatumia Datadog (pamoja na PagerDuty) na Threat Stack na hatuwezi kuwa na furaha zaidi. Lalamiko langu pekee kuhusu DD ni gharama ya juu kiasi ya uhifadhi wa vipimo.
Zabbix
Zabbix na hati maalum za kufuatilia karibu kila kitu. Inafanya kazi kama hirizi.
Outlyer
Ninatumia Outlyer, lakini lazima nitoe kanusho kwamba ninafanya kazi hapa, na kutumia bidhaa yetu wenyewe ni lazima.
Bado nahitaji Graylog, Sentry na Statuscake kuiboresha.
Inasikika kuwa na upendeleo, lakini baada ya kuendesha Nagios na mifumo mingine ya ufuatiliaji ndani ya nyumba kwa furaha, ningenunua suluhisho lililopangishwa katika kazi yoyote mpya na kuondoa maumivu hayo.
Nagios + Nagiosgraph
Tunaendesha Nagios kwa ufuatiliaji wote na tahadhari. Tahadhari hutokea kupitia barua pepe (maonyo na arifa muhimu) na arifa zinazosikika za programu (kwa tahadhari muhimu).
Nagiosgraph hutumika kwa taswira.
Usanidi huu umekuwa na ufanisi mkubwa katika kutuweka tukijulishwa kikamilifu kuhusu kinachotokea katika mazingira yetu. Tunaendesha na kufuatilia takriban seva 110 muhimu kwa dhamira na takriban pointi 760 za data, na tumekuwa na mfumo huu wa asubuhi kwa zaidi ya miaka saba.
Ningependa pia kukusanya kumbukumbu kwa Graylog au ELk wakati fulani.
Prometheus + Grafana + AlertManager
Prometheus + Grafana + AlertManager kupitia chati nzuri ya helm ya Prometheus Operator. Kumbukumbu bado zinaenda kwa mpango wa birch wa LogDNA kwa sababu tuligundua ELK ni nzito mno kwa nodi zetu duni za chini 3 juu 5 kwenye GKE.
DataDog + Sentry + PagerDuty.
Nilikuwa nikiendesha suluhisho zangu zote za ufuatiliaji nikitumia aina zote za programu ikiwa ni pamoja na Nagios, Icinga, Zabbix, ELK, Greylog2, Influx, na zana nyingine nyingi, lakini ukweli ni kwamba kuna juhudi nyingi mno katika kuendesha miundombinu yako ya ufuatiliaji, hasa unapoweza kumlipa mtu mwingine viwango vya chini hivyo ili mtu mwingine akufanyie!
Kulipa wengine kuendesha miundombinu ya ufuatiliaji huwaachia wateja wangu uhuru wa kuzingatia kuendesha majukwaa yao badala ya kufuatilia ufuatiliaji, maana yake thamani wanayopata kutokana na uthabiti wa jukwaa lao inazidi mbali gharama zozote za Ufuatiliaji kama Huduma.
Sensu + Graphite + ELK
Kampuni yangu inapenda sana vitu vilivyopangishwa wenyewe.
Sensu -> PagerDuty
Graphite/Grafana
ELK (Elasticsearch, Logstash, Kibana)
Prometheus + Alertmanager
Prometheus + Alertmanager kwa tahadhari, timu yangu inaamini kwamba ufuatiliaji rahisi ni ufuatiliaji mzuri.
Mifumo mingine kama kurekodi na ufuatiliaji wa safari hutoa muktadha tajiri wa kutambua mtu wa zamu anapopokea tahadhari, lakini hatujengi kamwe tahadhari juu ya hizi.
Sensu + Grafana + Graylog + Kibana + NewRelic.
Sensu, grafana, graylog, kibana, newrelic.
Prometheus + Circonus
Huduma zilizopimwa kwa Prometheus => uchanganuzi na taswira ya Circonus
icinga2 + VictorOps + NewRelic + Sentry + Slack
Tunatumia huduma zifuatazo:
icinga2 kwa ufuatiliaji na VictorOps kwa tahadhari
NewRelic kwa ufuatiliaji wa kina wa huduma
Sentry kwa ufuatiliaji wa makosa katika huduma
Slack/Barua pepe ni sehemu ya tahadhari inayoanzishwa kutoka NewRelic au icinga2
AppDynamics + Papertrail + PagerDuty + Healthchecks.io + Stackdriver
AppDynamics
Papertrail
PagerDuty
Healthchecks.io
Stackdriver
icinga2 + elasticsearch
icinga2 na ujumuishaji wa elasticsearch kwa uchanganuzi na ujumuishaji wa graphite+grafana kwa grafu.
kutokana na unyumbufu wa kanuni za apply katika icinga2, waundaji wanaweza kuona tu huduma wanazopokea arifa zake.
na kupitia icinga2 director, waprogramu wanaweza kwa urahisi kufafanua ukaguzi wao wenyewe (ambao hufanya, kila baada ya siku chache - ukaguzi 100 hutoka, ukaguzi mwingine 100 huingia) kwa kiwango kikubwa bila usumbufu wowote.
DataDog + New Relic + ELK + EFK + Sentry + Alertmanager + VictorOps
Tulicho nacho sasa:
DataDog kwa vipimo
New Relic kwa ufuatiliaji wa programu
ELK (Elastic Search + Logstash + Kibana) kwa kumbukumbu
Sentry (iliyopangishwa wenyewe) kwa kurekodi vighairi
Barua pepe + Slack + VictorOps kwa tahadhari (kulingana na ukali)
Tunachotaka kuwa nacho:
Prometheus kwa vipimo (Grafana kwa taswira)
New Relic (pengine Elastic Search APM) kwa ufuatiliaji wa programu
EFK (elastic search + fluentd + kibana) kwa kurekodi. Pengine, Loki na Grafana itakuwa tayari kwa uzalishaji kufikia wakati tutakapofika hapa
Sentry kwa vighairi
Alertmanager + barua pepe + VictorOps kwa tahadhari
Wavefront + Scalyr + PagerDuty + Stackstorm + Slack
Wavefront + Scalyr + PagerDuty + Stackstorm + Slack (Kanusho: nafanya kazi VMware)
Telegraf + Prometheus + InfluxDB + Grafana
Telegraf kwa vipimo vya seva kama CPU, Diski, Kumbukumbu na Mtandao. Pia tunatumia Telegraf kwa ufuatiliaji wa SNMP wa vifaa vyetu vya mtandao.
Prometheus kwa vipimo vya programu. Tunaweka ukaguzi wa afya kwenye msimbo wa programu yetu ambao Prometheus huvuna.
InfluxDB kwa uhifadhi wa mfululizo wa wakati. Hapa ndipo data yetu ya Telegraf hutumwa.
Grafana kwa dashibodi na tahadhari. Injini ya tahadhari si imara sana, lakini inafanya kazi. Pia tunatuma tahadhari kwenye Slack.
Tusichonacho sasa ni suluhisho la kati la kurekodi. ELK ina nguvu lakini ni ngumu kusanidi na kusimamia, na sijui njia mbadala yoyote ya bure iliyo karibu vya kutosha kuangalia.
Sematext + Logagent + Experience
Sematext kwa vipimo, kwa kumbukumbu, kwa ufuatiliaji wa safari, hivi karibuni kwa ufuatiliaji wa watumiaji halisi pia. Rahisi/nafuu zaidi kuliko kutumia N zana/huduma tofauti, kwa maoni yangu.
Kwa kusafirisha kumbukumbu tulikuwa tukitumia rsyslog kisha tukahamia Logagent.
Kwa kuripoti ajali za sehemu ya mbele tunatumia Sentry, lakini tutahamia Experience hivi karibuni.
Kanusho: Mimi ni Sematextan.
Azure Monitor/Analytics + OpsGenie
Natamani Log Analytics ingekuwa na kiolesura bora zaidi. Tunahama kutoka splunk, ambayo ilikuwa rahisi zaidi kuabiri.
Prometheus + Alertmanager + Grafana + Splunk + PagerDuty
Prometheus, Alertmanager, Grafana, Splunk, PagerDuty
Kwa kweli hutaki kuendesha mfumo wako wa arifa. Unaweza kubadilisha Splunk na ELK isipokuwa timu yako ya Usalama inapendelea Splunk.
Telegraf + Prometheus + Grafana + Alertmanager
Telegraf kama mkusanyaji, Prometheus + Alertmanager kwa ufuatiliaji na tahadhari, vimeunganishwa na chaneli za slack na pagerduty kwa tahadhari muhimu. Grafana kwa taswira ya vipimo vya mwenyeji.
Prometheus + Grafana + Cloudwatch + sentry + kibana + elasticsearch
Prometheus kwa vipimo + tahadhari
Grafana kwa dashibodi za Prometheus
Cloudwatch inafuatilia matukio ya Prometheus
sentry kwa ufuatiliaji wa vighairi
kibana + elasticsearch
graylog
prometheus Push Gateway kwa kazi za kundi/cron
SOP https://github.com/rapidloop/sop "kusukuma/kusambaza" vipimo kutoka tukio 1 la Prometheus hadi jingine
wateja aidha hutumia wateja wa Prometheus. Tunajaribu kutumia opencensus.io upande wa mteja
PagerDuty + Monitis
PagerDuty + Monitis. Pia baadhi ya Azure Functions maalum za kupima afya ya baadhi ya huduma.
Tunatazamia kuanzisha Prometheus na Grafana mwaka huu
Prometheus + Grafana + Bosun
Prometheus kwa kuhifadhi data ya mfululizo wa wakati. Grafana kwa taswira. Bosun kwa usimamizi wa tahadhari.
Azure Monitor/Analytics/Insights/Dashboards
Duka la Azure pekee, Azure Monitor, Log Analytics, App Insights, Azure Dashboards + Pager Duty
Grafana + Monitis + OpsGenie + Slack
Grafana kwa kufuatilia huduma za kontena katika Kubernetes kupitia Prometheus
Monitis kwa ufuatiliaji wa huduma mwanzo-hadi-mwisho hasa kwa API za wavuti na programu za wavuti
OpsGenie kwa usimamizi wa tahadhari
Slack kwa kupata taarifa za hali kutoka kwa mifumo yetu
Checkly + AppOptics + Cloudwatch + Heroku + Pagerduty + Papertrail
Mhandisi wa (dev)ops wa muda mrefu hapa. Nilikulia Nagios. Ningependa maoni kuhusu SaaS yangu iliyojengwa kwa mtaji wangu https://checklyhq.com. Tunafanya ufuatiliaji wa API na ufuatiliaji wa miamala ya tovuti kwa tahadhari za kina kabisa.
Nilianzisha Checkly kwa sababu ufuatiliaji hai / bandia katika eneo la API ulikuwa na mipaka kiasi (na ghali). Ufuatiliaji unaotegemea kivinjari / wa hati ni wa umiliki zaidi na ghali zaidi. Tunatumia Puppeteer na kuweka bei chini iwezekanavyo.
Rundo letu la ufuatiliaji:
Checkly (kutumia bidhaa yetu wenyewe...)
AppOptics (grafu maalum)
AWS Cloudwatch & SNS kwa ujumbe wa SMS.
tahadhari zilizojengewa ndani za Heroku.
Pagerduty
Papertrail
Instana + Logz.io + slack
Instana hutuarifu kwenye slack kuhusu matatizo ya miundombinu au kushuka kwa utendaji, na tumesanidi logz.io kutahadharisha kwenye slack kwa kiasi fulani cha kumbukumbu za kiwango cha kosa kutoka tabaka la programu.
SignalFX + Splunk + PagerDuty + Slack
Kwa sasa tunatumia: SignalFX, Splunk, PagerDuty na Slack. Sipendi sana SignalFX ingawa timu yao ya usaidizi ni rafiki sana na inajibu haraka. Napenda Splunk (inafaa ikiwa unaweza kulipia), PagerDuty na Slack.
Nilikuwa nikitumia rundo la TICK ambapo C nyingi zilikuwa kwa kweli G, yaani Grafana ingawa nilitumia Chronograf kidogo. Hilo lilikuwa la kustaajabisha lakini lilikuwa usumbufu kusimamia. Mtanziko wa kawaida wa SaaS dhidi ya kujipangishia.
Nimetumia DataDog, New Relic, Graylog, ELK na BugSnag. Napenda DataDog na New Relic sana, Graylog ni nzuri kabisa. Mimi si shabiki mkubwa wa ELK. BugSnag ni nzuri, kwa kweli nahisi kufuatilia makosa/vighairi ni mbadala mzuri kabisa wa ufuatiliaji kamili wa kumbukumbu, katika visa vingi.
ELK + Prometheus + Grafana
Kama wengine, tunatumia ELK kwa kumbukumbu na Prometheus+Grafana kwa kila kitu kingine.
Kudumisha usanidi huu ni rahisi ukijipa ruhusa ya kupoteza data mara kwa mara. Kwa mfano, ikiwa hifadhidata yetu ya ElasticSearch itaingia kwenye hali mbaya (ambayo hutokea kila baada ya miezi 2-3 kwetu kwa bahati mbaya) hatujisumbui na HA na badala yake tunatupa data na kuendelea na maisha yetu. Ikiwa lazima kabisa uwe na HA au uhifadhi wa muda mrefu, bahati njema.
Datadog + Prometheus + Grafana
Nilisanidi Datadog kwa mwezi hadi mwezi kwa sababu nilipofika hapa, hakukuwa na ufuatiliaji na hakuna tahadhari. Tovuti chache tu zetu zilikuwa zikifuatiliwa kila dakika 5 kwa upatikanaji. Datadog bila shaka ndiyo rahisi zaidi kusanidi. Nitakapomaliza kushughulikia masuala mengine yote, nitabadilisha kwenda Prometheus+Grafana. Sijaamua 100% bado kuhusu usimamizi wa kumbukumbu.
Nagios + ELK
Tuna bidhaa zaidi ya 100+ tunazosaidia.
Kwa ndani ya majengo, ni zaidi Nagios na ELK. Kwa wingu, tunahama kutoka DataDog kwenda NewRelic.
Datadog dhidi ya Site24x7 + StatusCake + PagerDuty + SumoLogic + Slack
Tulikuwa tukitumia datadog lakini tuligundua ni ghali mno kwa mahitaji yetu. Usinielewe vibaya ni nzuri sana lakini, ina gharama kubwa. Tuliweza kusanidi site24x7.com kwa usajili wa kila mwaka kwa takriban miezi 2-3 ya gharama kutoka DD.
Rundo letu la ufuatiliaji:
Site24x7 - APM, ufuatiliaji wa URL za nje, ufuatiliaji wa mtiririko wa barua za SMTP, kuisha kwa muda wa ssl na ufuatiliaji wa michakato.
StatusCake - kwa ufuatiliaji na uthibitisho wa URL - Ni nakala yetu ya akiba endapo site24x7 itakosa kitu (haikosi) lakini SC ni rahisi kunyumbulika zaidi kwa ufuatiliaji wa milango ya nje na huduma kwa mahitaji yetu.
Zana zote mbili hupandisha ngazi hadi PagerDuty, kisha tunapata ngazi zetu za kupanda kwenye slack.
SumoLogic - kwa ufuatiliaji wa kumbukumbu (ni zana nzuri sana lakini changamano kidogo kwa mahitaji yetu)
Kutoka slack tunaweza kukiri, au kurekebisha tahadhari.
Kisha tuna otomatiki nyingi za site24x7 ambazo kisha huunganisha na commando.io kwa 'BedOps' kama tunavyoiita - ambapo tahadhari inapoanzishwa, tunaanzisha hati chache au otomatiki kama jaribio la kurekebisha hali (99% ya wakati otomatiki + hati zetu hutuweka mbali na matatizo)
Tuna miongozo ya ndani ya kazi (runbooks) katika KB yetu kwa wakati otomatiki zinaposhindwa au kama kuna kitu nje ya wigo kinachohitaji kurekebishwa.
Prometheus + AlertManager + Grafana + Stackdriver
Prometheus (Operator) / AlertManager / Grafana kwa vipimo katika makundi yetu ya GKE na VM.
Google Stackdriver kwa Kumbukumbu (kwa kuwa imejumuishwa na inatumika kwa chaguomsingi na kwa sasa inatosha mahitaji yetu).
Zabbix
Zabbix kwa kila kitu. Hakuna programu ya ziada inayohitajika.