Kada prestane da radi društvena mreža, problem je neprijatan. Kada prestane da radi poslovni email, posledice mogu biti mnogo ozbiljnije. Microsoft Outlook je 31. avgusta pogodio veliki globalni prekid rada, pri čemu su korisnici imali probleme sa prijavljivanjem, slanjem i prijemom poruka, kao i sinhronizacijom poštanskih sandučića. Problem nije bio u samom Outlooku, već u njegovoj infrastrukturi iza scene, odnosno servisu Exchange Online.
Microsoft je incident evidentirao pod oznakom EX1464935 i potvrdio da istražuje probleme sa Exchange Online. Kompanija je navela da korisnici mogu imati degradirane funkcije servisa, dok su među prijavljenim simptomima bili problemi sa autentifikacijom i kašnjenje ili neuspešno slanje i primanje elektronske pošte.
Prema podacima Downdetectora, broj prijava problema sa Outlookom dostigao je više hiljada, dok su se problemi istovremeno prijavljivali i kod Microsoft 365 servisa. To je očekivano jer Outlook nije izolovana aplikacija: za poslovne korisnike predstavlja samo jedan od interfejsa prema Exchange Online infrastrukturi koja obrađuje njihove sandučiće i poruke.
Prve informacije ukazivale su na problem u Exchange Online infrastrukturi koji utiče na autentifikaciju i povezivanje sa serverima. Microsoft je pokrenuo analizu telemetrije i dijagnostičkih podataka kako bi izolovao uzrok i započeo sanaciju.
Pojedini izveštaji su ukazivali i na mogući problem sa isteklim sertifikatom, ali to u trenutku objave nije bilo zvanično potvrđeno kao konačan uzrok. Zbog toga bi takvu informaciju trebalo posmatrati kao mogući tehnički uzrok, a ne kao definitivno objašnjenje Microsoftovog incidenta.
Ono što je važno jeste da problem nije bio ograničen na jednu aplikaciju ili pojedinačne korisnike. Kada centralni cloud servis poput Exchange Online ima problem, simptomi mogu izgledati potpuno različito: jedan korisnik ne može da se prijavi, drugom poruke kasne, dok trećem Outlook aplikacija deluje kao da je potpuno zamrznuta.
Microsoft 365 je danas deo osnovne infrastrukture velikog broja kompanija. Email se koristi za komunikaciju sa klijentima, slanje računa, odobravanje dokumenata, resetovanje lozinki, korisničku podršku i čitav niz drugih poslovnih procesa.
Zbog toga cloud outage više nije samo problem dostupnosti jedne aplikacije. Kada ključni cloud servis otkaže, deo poslovne infrastrukture praktično nestaje u jednom trenutku.
Još veći problem nastaje kada zaposleni počnu da improvizuju. Ako poslovni email ne radi, korisnici mogu pokušati da pređu na privatne naloge, druge servise ili alternativne načine slanja dokumenata. Time se tokom samog incidenta mogu otvoriti novi bezbednosni i organizacioni problemi.
Zbog toga je ovakve incidente pogrešno posmatrati samo kroz pitanje „kada će Outlook ponovo proraditi“. Za kompanije je mnogo važnije pitanje šta se dešava ako njihov centralni cloud provajder ne bude dostupan nekoliko sati.
Posebno je zanimljivo što se kod ovakvih problema lako može stvoriti utisak da je nešto pogrešno sa računarom ili Outlook aplikacijom. Korisnik može pokušati da ponovo instalira aplikaciju, promeni lozinku ili obriše lokalne podatke, iako je pravi problem na Microsoftovoj strani.
U slučaju ovog incidenta problem je bio serverske prirode, pa takve intervencije nisu rešavale osnovni uzrok. Pored toga, korisnicima je savetovano da ne pokušavaju više puta ručno da šalju poruke koje izgledaju kao neuspešne, jer bi nakon normalizacije servisa moglo doći do njihovog višestrukog slanja.
To je važna praktična lekcija za korisnike i administratore: kada veliki cloud servis počne masovno da otkazuje, prvo treba proveriti status servisa, a tek onda tražiti problem na lokalnom računaru.
Microsoftov incident dolazi u trenutku kada kompanije sve veći deo infrastrukture prebacuju u cloud. Prednost je očigledna: nema potrebe da svaka kompanija sama održava sopstvenu email infrastrukturu, servere i redundantne sisteme.
Ali druga strana medalje je koncentracija rizika.
Ako Microsoft, Google ili neki drugi veliki cloud provajder ima ozbiljan problem, veliki broj organizacija može istovremeno ostati bez dela infrastrukture na koju se svakodnevno oslanja. Veliki cloud sistemi jesu projektovani sa ogromnim nivoom redundanse, ali redundansa ne znači da je prekid rada nemoguć.
Upravo zato ovaj incident nije posebno zanimljiv samo korisnicima kojima Outlook juče nije radio. On je još jedan podsetnik da cloud ne uklanja potrebu za planom kontinuiteta poslovanja. Samo menja mesto na kojem se nalazi infrastruktura.
Microsoft je nakon prijave incidenta radio na sanaciji i postepenom vraćanju funkcionalnosti, ali u početku nije dao precizan rok za potpunu normalizaciju.
Za milione korisnika poruka je zato prilično jednostavna: ako vam Outlook nije radio 31. avgusta, vrlo verovatno nije problem bio u vašem računaru, internetu ili lozinki. Problem je bio mnogo dalje, u Microsoftovom oblaku, prenosi Mashable .
Izvor: benchmark