Amazons skrivefeil på $150 millioner er en lynavleder for et stort skyproblem

Hvis du skal legge alle dataene dine i skyen, vil du at det skal være en godt bygget sky. Denne uken viste Amazon – verdens største leverandør av slik infrastruktur – at byggeferdigheter fortsatt mangler.





Tirsdag sluttet store deler av Internett rett og slett å fungere. Slack ville ikke la folk kommunisere med kolleger, Trello ville ikke la deg administrere et prosjekt, og dessverre MIT Technology Review nettstedet lar deg ikke lese om nye teknologier. Det var også klager på at maskinvare for smarthjem ikke fungerte som det skal.

Grunnen: Amazons S3 skylagringssystem mislyktes . Amazon er verdens største cloud computing-leverandør, så mange tjenester som er avhengige av det, var heller ikke i stand til å fungere ordentlig. Og dette var ikke bare en blip: problemet tok minst fire timer å fikse.

Det er vanskelig å nøyaktig kvantifisere den sanne kostnaden ved et slikt strømbrudd. Men, ifølge Wall Street Journal , har analysefirmaet Cyence anslått at det kostet S&P 500-selskaper minst 150 millioner dollar. Og trafikkovervåkingsfirmaet Apica hevder at 54 av de 100 beste nettforhandlerne så en nedgang på nettstedets ytelse med minst 20 prosent. Så det er ingen vei utenom det faktum at det var dyrt.



Det gjør grunnen til at det skjedde desto mer pinlig. I en uttalelse som beskriver hva som gikk galt , har Amazon innrømmet at grunnårsaken til strømbruddet var en feil kommando utført av en medarbeider ved anlegget i Nord-Virginia under rutinemessig vedlikehold. Dessverre resulterte det i en katastrofal kaskade av hendelser.

Arbeideren skulle ta et lite antall servere offline, men gjorde en feil og tok ut flere servere enn tiltenkt – inkludert to som ble brukt til å drive grunnleggende prosesser som ble brukt på tvers av hele systemet. Feilen utslettet i hovedsak anleggets evne til å behandle brukerforespørsler.

Amazon driver flere skyområder spredt rundt i verden, og kunder av tjenestene deres kan lagre filer og kjøre kode på mer enn én av dem. Men det er dyrere og som registeret bemerker , selv selskaper som driver sine tjenester på tvers av en rekke av de forskjellige geografiene, fant at systemene deres falt om, sannsynligvis på grunn av kapasitetsproblemer.



Bare fire dager før strømbruddet beskrev vi den iboende risikoen ved sentraliserte nettjenester og spekulerte i hvilken innvirkning vi ville merke hvis Amazons skytjeneste mislyktes. På det tidspunktet advarte vi om at innsatsen er høy, og argumenterte for at sikkerhet, pålitelighet og kompetanse er avgjørende – og kanskje underrepresentert – for selskaper som tilbyr sentraliserte webtjenester.

Amazon ser ut til å være enig. Det er allerede satt på plass sikkerhetstiltak slik at hendelser som den forårsaket av den ham-fisted-medarbeider ikke kan stenge ned så mange servere like raskt i fremtiden.

Det er en start. Men det er klart på dette tidspunktet at skytjenester trenger ekstra forsikringer hvis de skal være robuste. Amazon, for eksempel, burde ikke engang vært i stand til å havne i en situasjon der hele anlegget i Nord-Virginia kunne svikte på en gang – i stedet skulle det deles opp i separate undersystemer som fungerer uavhengig.



Selv da kan sentraliserte webtjenester fortsatt være sårbare. Hvis en hacker utfører et enormt angrep mot en enkelt leverandør – for eksempel ved å bruke et botnett – kan han fortsatt tvinge store deler av nettet offline igjen. Men det ville i det minste ikke være et resultat av en skrivefeil.

(Les mer: Wall Street Journal , t han registrerer seg , AP , Amazon Web Services , Sentraliserte webtjenester er fantastiske – til de går galt , 10 banebrytende teknologier: Botnets of Things )

gjemme seg