Odcinek 92. Kiedy SLA a kiedy SLE, czyli obietnice i oczekiwania
Kiedy u Ciebie ostatnio zabrakło prądu? U mnie w tym tygodniu – dokładnie w chwili, gdy zaczynałem webinar dla zarządu banku. Szybki skok adrenaliny, ale wszystkie systemy, które miały zadziałać, zadziałały i webinar dojechał do końca.
Czy przywrócenie funkcjonowania jakiejś usługi powinno być objęte twardą obietnicą? Pewnie tak. A jak zbudować zdrowe przedziały takich czasów reakcji, czy obietnic? A co z pomysłami czy potrzebami, gdzie nie wszystko jest po stronie „naprawiającego”? Bierzemy na warsztat popularne terminy: SLA i SLE, a także mniej popularny, czyli SLO. Czy Ty i Twoi Klienci i współpracownicy mówią o tym samym?
Stresująca sytuacja nasunęła mi pytanie: czy operator energetyczny był zobowiązany przywrócić zasilanie w ciągu godziny, albo ośmiu? Jeśli tak, to w naszej umowie jest coś, co nazywamy SLA. A jeśli operator tylko publikuje na stronie informację, że „zasilanie wróci w ciągu dwóch godzin”, to nie jest to twarda obietnica, tylko zarządzanie oczekiwaniami.
Bardzo podobna rozmowa odbywa się za każdym razem, gdy ktoś przychodzi do zespołu i pyta: „Na kiedy to będzie?”. Czy odpowiedź to twarda obietnica, czy raczej zarządzanie oczekiwaniem? W tym odcinku rozkładam na części trzy skróty: SLA, SLO i SLE – czym są, jak je mierzyć i jak z nich korzystać, niezależnie od tego, czy usługę dostarczasz, czy zamawiasz.
SLA, Service Level Agreement, czyli twarda obietnica
SLA (Service Level Agreement) to umowa o poziomie usług – tu wstawiam myślik, ale serio sam 😉 zobowiązanie, np. do przywrócenia działania usługi w określonym czasie. To najtwardsze z dzisiejszych podejść: rozwiązanie w praktyce prawne, bardzo często obwarowane konsekwencjami za niedotrzymanie.
Jakie cechy ma zwykle SLA?
- Nie obejmuje każdego klienta. Sieci energetyczne, dostawcy internetu czy chmury zwykle nie dają SLA klientom indywidualnym ani małym firmom, byłoby to trudne do utrzymania i nieekonomiczne. SLA zwykle negocjują więksi gracze, często za wyższą opłatę. Spotkamy je też w umowach wewnętrznych, np. z działem odpowiedzialnym za pocztę, czy chmurę.
- Może mieć kilka poziomów. Na przykład: godzina na pierwszą odpowiedź, cztery godziny na znalezienie obejścia (workaroundu), 1-2 dni robocze na pełne przywrócenie usługi razem z parametrami niefunkcjonalnymi, np. prędkością łącza.
- Dotyczy usług krytycznych. Najczęściej infrastrukturalnych – tych, których ciągłość chce zapewnić sobie klient i którą usługodawca jest w stanie dotrzymać. Jeśli ktoś prosi o nową funkcjonalność w aplikacji, to raczej nie jest moment na wytaczanie armaty, jaką jest SLA.
- Wiąże się z karami. Za każdy przypadek niedotrzymania usługodawca może płacić określoną kwotę albo dostać niższe wynagrodzenie. Często rozlicza się to w cyklu miesięcznym: czy wszystkie zgłoszenia zostały podjęte, rozwiązane i udokumentowane w ustalonym czasie, opcjonalnie z dodatkowym progiem procentowym.
Jak mierzyć SLA?
Z perspektywy Kanbanu SLA jest najbliższe Customer Lead Time, czyli czasowi realizacji widzianemu oczami klienta: od momentu wystąpienia incydentu lub zgłoszenia do momentu przywrócenia usługi. Cała siła sprawcza leży tu po stronie usługodawcy. Klient może najwyżej zrestartować modem czy przesłać logi.
W kanbanowych klasach usług SLA łączy w sobie dwie z nich:
- Expedite – koszt opóźnienia jest natychmiastowy, trzeba zareagować od razu;
- Fixed Date – po przekroczeniu ustalonego terminu koszt zaczyna ponosić także usługodawca: finansowo, prawnie i wizerunkowo.
Czy SLA ma sens?
Z perspektywy usługobiorcy? Jak najbardziej! To usługa krytyczna, którą chcemy otrzymywać z wysoką pewnością, że w razie incydentu problem zostanie rozwiązany. Z perspektywy usługodawcy trzeba uważać: jeśli usługa nie jest stabilna i wysoko dostępna, spisanie jej w formie SLA może nam po prostu zaszkodzić.
SLO, Service Level Objective, czyli nasz własny cel
Jak firmy dochodzą do SLA, którego są w stanie dotrzymać? Tu pojawia się SLO (Service Level Objective) – cel, który organizacja wyznacza sama sobie w zakresie poziomu i dostępności usługi.
Jeśli zetknęliście się z SRE (Site Reliability Engineering) – podejściem znanym m.in. z Google’a czy Netflixa – to wiecie, że takie firmy określają procentowy poziom dostępności swoich usług. W telekomunikacji przez lata mówiło się o „pięciu dziewiątkach”, czyli 99,999% dostępności w skali roku.
Ambitne firmy, które chcą przyciągać klientów i dotrzymywać SLA, często same poddają się stresowi – celowo wprowadzają chaotyczne zaburzenia po swojej stronie, żeby sprawdzić, czy np. mechanizmy przywracania kopii zapasowych rzeczywiście działają.
Kluczowa zasada: SLO powinno być ambitniejsze niż SLA. Jeśli klientowi obiecujemy 99,9% dostępności, to wewnętrznie celujemy wyżej. Dzięki temu mamy margines na incydenty albo po prostu ograniczamy ich liczbę do poziomu, który nie irytuje klienta i nie uruchamia twardych zapisów umowy.
Moje domowe SLO 🙂
Wracając do awarii prądu: router i światłowód mam podłączone do UPS-a. Może zgasnąć zewnętrzny monitor czy inne akcesoria, ale laptop z Wi-Fi i internet muszą działać. To, jak duży UPS postawię, wyznacza granicę, jak długo mogę być niedostępny podczas szkolenia online czy webinaru. (Mam też agregat na benzynę – mimo że mieszkam w bloku. Testuję go na balkonie raz w roku.)
I tak, mam też alternatywę łącza światłowodowego, ale wróćmy do prądy.
Załóżmy, że moim celem jest maksymalnie ok. 8 godzin niedostępności w roku, a to daje mniej więcej 99,9% przy 365 dniach. Ale uwaga na okres rozliczeniowy. Jeśli ten sam poziom 99,9% miałby obowiązywać w każdym miesiącu, to na przerwę zostaje zaledwie ok. 43 minut, i jedna ośmiogodzinna awaria łamie cel. Cele dostępności warto więc definiować w mniejszych jednostkach czasu.
Zastanów się, jakie usługi świadczone w Twojej firmie mają takie wewnętrzne SLO. Mogą nazywać się zupełnie inaczej, ale profesjonalne organizacje takie cele sobie stawiają.
SLE, Service Level Expectation, czyli zarządzanie oczekiwaniami
Trzeci skrót jest najbardziej kanbanowy i pewnie najbliższy Tobie, jeśli budujesz produkty, pracujesz przy oprogramowaniu albo po prostu odpowiadasz na pytanie „na kiedy?”, czy to w marketingu, dziale prawnym czy dowolnej innej pracy intelektualnej.
SLE (Service Level Expectation) to oczekiwanie co do czasu realizacji, połączone z prawdopodobieństwem. Zamiast obiecywać datę, zespół mówi np.:
„W 85% przypadków takie rzeczy realizujemy w ciągu 5 dni lub szybciej od momentu podjęcia.”
To trochę jak komunikat operatora energetycznego: „wiemy o awarii, prawdopodobnie przywrócimy zasilanie w ciągu dwóch godzin”.
Od kiedy liczymy czas?
To najważniejsza różnica względem SLA. SLE liczymy nie od zgłoszenia potrzeby, ale od punktu zobowiązania (point of commitment), czyli momentu, w którym obie strony rzeczywiście się dogadały. Do tego potrzebny jest wkład strony zamawiającej:
- Kampania? Świetnie, ale czy wiemy już do kogo ma trafić, jakich materiałów użyć, czy są gotowe?
- Nowa funkcjonalność? Czy jest opisana, czy ma prototyp albo punkt odniesienia, i czy zespół miał czas porozmawiać z Tobą lub zrobić refinement?
Dopiero od tego momentu budujemy prognozę. W praktyce SLE jest bliskie temu, co wiele organizacji nazywa Cycle Time, a Kanban – System Lead Time: czasowi od punktu zobowiązania do przekazania pracy klientowi (albo utraty nad nią kontroli – bo to, czy klient zdecyduje się ją wdrożyć, to już osobna sprawa).
Podobnie jak przy SLA, różne typy pracy mogą mieć różne SLE.
SLE to nie obietnica
Operujemy prawdopodobieństwem i zwykle nie ma zapisu prawnego z karą za niedotrzymanie. Konsekwencje są raczej emocjonalne i czasowe – trzeba się wytłumaczyć i porozmawiać. I nie ma w tym nic złego: rozmowa na początku i na końcu to podstawa. Ten margines świadomie sobie dajemy, bo wiemy, że część zadań zawsze wyląduje w „ogonie” rozkładu.
Lekcja z drukarni
Te wakacje były dla mnie wyjątkowo intensywne, było sporo wyjazdów na szkolenia i warsztaty, a więc i sporo materiałów drukowanych w zaprzyjaźnionej wrocławskiej drukarni. Zauważyłem, że w branży poligraficznej zwraca się ogromną uwagę na to, by klient potwierdził ostateczną wersje, najlepiej pisemnie, czyli mailem.
Czasem zbywam to śmiechem, bo materiały warsztatowe i tak zostaną popisane i pogniecione. Ale widzę, jak ważny jest ten moment: umawiamy się, wtedy zdążymy, a praca natychmiast rusza do realizacji. To właśnie punkt zobowiązania w czystej postaci.
Pytaj o apetyt na ryzyko
Klient raczej nie powie wprost, jaki ma apetyt na ryzyko ani jakim prawdopodobieństwem operuje. Ale można to z niego wyciągnąć rozmową:
- Dlaczego tego potrzebujesz?
- Skąd ta data w Twojej głowie? Jakie będą konsekwencje?
- Czy wiesz, że zanim uruchomimy zegar, będziemy musieli jeszcze razem popracować?
Wiele problemów da się rozwiązać, po prostu bardziej angażując klienta.
SLA vs SLO vs SLE – porównanie
| SLA – Service Level Agreement | SLO – Service Level Objective | SLE – Service Level Expectation | |
|---|---|---|---|
| Czym jest | Umowa, twarda obietnica | Wewnętrzny cel organizacji | Oczekiwanie wyrażone prawdopodobieństwem |
| Kto ustala | Usługodawca i usługobiorca (negocjacja) | Sam usługodawca | Zespół dostarczający, na podstawie danych historycznych |
| Typowa forma | Czas reakcji / obejścia / rozwiązania, często z progiem procentowym | Procent dostępności (np. 99,9%) | Czas + prawdopodobieństwo (np. 85% w ≤ 5 dni) |
| Od kiedy liczymy | Od incydentu / zgłoszenia do rozwiązania | Okres rozliczeniowy (rok, miesiąc) | Od punktu zobowiązania do dostarczenia |
| Metryka kanbanowa | Customer Lead Time | Dostępność usługi | System Lead Time (Cycle Time) |
| Konsekwencje | Kary umowne, straty finansowe, prawne i wizerunkowe | Wewnętrzne – sygnał do poprawy niezawodności | Rozmowa i wyjaśnienia, bez kar |
| Typowe zastosowanie | Usługi krytyczne, infrastruktura, incydenty | Niezawodność systemów (SRE), margines dla SLA | Rozwój produktu, marketing, praca intelektualna |
| Relacja | Najsłabszy poziom, który musimy utrzymać | Poprzeczka ustawiona wyżej niż SLA | Niezależne od SLA – dotyczy nowej pracy, nie awarii |
W skrócie:
- SLA – najsilniejsze zobowiązanie, zwykle z karą, liczone od zgłoszenia do rozwiązania problemu.
- SLO – nasz własny, najczęściej procentowy cel dostępności usługi, ambitniejszy niż SLA.
- SLE – czas powiązany z prawdopodobieństwem, liczony od wspólnej decyzji „tak, teraz, lecimy” do momentu, w którym oddajemy klientowi to, o co prosił.
Wszystkie trzy narzędzia są bardzo przydatne – pod warunkiem, że używamy ich do właściwych rzeczy. I to zarówno po stronie zamawiających, jak i dostarczających.
Podziel się swoją historią
A w Twojej branży? Znasz dobre lub złe przykłady używania SLA, SLO albo SLE? Może nie u siebie, ale gdzieś w organizacji? Chętnie posłucham, jak to pomaga (albo przeszkadza). Zostaw komentarz pod odcinkiem na Spotify, pod tym wpisem, w social mediach albo napisz bezpośrednio do mnie.
Kolejny odcinek pojawi się w granicach miesiąca. Tylko czy to było SLA, SLO, czy SLE? 😉 Daj znać, co myślisz.
