Wyjaśnij zadanie i decyzję
Ten przewodnik przekształca umowę sla i reakcję na incydenty w możliwy do sprawdzenia przepływ pracy operacyjnej. Łączy decyzje dotyczące domeny, własność, dowody i akceptację, dzięki czemu wynik nadal sprawdza się w produkcji.
Zdefiniuj mierzalną dostępność, poziomy priorytetów, cele reagowania i przywracania, obowiązki komunikacyjne i środki zaradcze.
Praktyczny proces
- 1
Narysuj przepływ danych od gromadzenia poprzez przetwarzanie, dzienniki, pamięć podręczną, wsparcie, tworzenie kopii zapasowych i usuwanie.
- 2
Sklasyfikuj każdą kategorię danych i powiąż ją z celem, rolą prawną, lokalizacją, odbiorcą i przechowywaniem.
- 3
Żądaj dowodów dotyczących architektury, umów, operacyjnych i testów w przypadku każdego istotnego roszczenia.
- 4
Oceń ryzyko i zapisz wymagane kontrole, właścicieli, dowody akceptacji i ryzyko resztkowe.
- 5
Zatwierdzaj tylko udokumentowaną konfigurację, a następnie monitoruj podprocesorów, incydenty, zmiany i dowody usunięcia.
Przykład lub narzędzie
Tabela incydentów porównuje wpływ użytkownika, potwierdzenia, częstotliwość aktualizacji, przywracanie i przegląd po incydencie. W narzędziu zapisz także punkt odniesienia, właściciela, decyzję, dowody, otwartą kwestię i datę zatwierdzenia. Użyj prawdziwej strony lub transakcji, aby zespół mógł zobaczyć zależności, wyjątki i prace konserwacyjne następujące po wydaniu.
| Punkt decyzji | Nagrywać | Kryterium akceptacji |
|---|---|---|
| Linia bazowa | Zaobserwowany stan obecny | Źródło i data zapisu |
| Decyzja | Wybrana opcja i uzasadnienie | Uwzględniono ryzyko i odbiorców |
| Dowód | Testuj, dokumentuj lub mierz | Możliwość przeglądu i specyficzna dla wersji |
| Aprobata | Imię i nazwisko, rola i data | Wszystkie obowiązkowe kryteria spełnione |
Zdefiniuj mierzalną granicę usług
Określ, które produkcyjne punkty końcowe, interfejsy użytkownika, zadania wsadowe i zależności obejmuje docelowy poziom dostępności. Zdefiniuj pomyślną usługę z perspektywy klienta, w tym prawidłowe uwierzytelnianie i użyteczne odpowiedzi, zamiast liczyć serwer, który zwraca błędy jako dostępne.
Użyj jednego opublikowanego wzoru: dostępne minuty podzielone przez zaplanowane minuty serwisowe, po wyłączeniu uzgodnionych wyłączeń. Przed porównaniem wartości procentowych ustaw źródło pomiaru, strefę czasową, interwał raportowania, metodę zaokrąglania, zasady konserwacji i sposób leczenia częściowej degradacji.
Nazwij każdy objęty komponent i krytyczną podróż.
Obiektywnie zdefiniuj awarię i degradację.
Ustal źródło pomiaru i metodę obliczeń.
Ogranicz wykluczenia i okna planowanej konserwacji.
Ustaw priorytety, zegary i cele przywracania
Zdefiniuj priorytet incydentu na podstawie wpływu użytkownika, ryzyka danych, zasięgu i obejścia, a nie wewnętrznej etykiety technicznej dostawcy. Rozróżnij uznanie, kwalifikowaną reakcję, łagodzenie, przywrócenie i trwałą korektę, ponieważ każde z nich reprezentuje inny wynik.
Określ, kiedy zegary mają się uruchamiać, wstrzymywać i zatrzymywać. Uwzględnij noce, weekendy, kanały powiadomień, zależności od klientów i eskalację. W przypadku krytycznych usług publicznych połącz cele reakcji dostawcy z wewnętrznymi celami odzyskiwania i sprawdzoną instrukcją lub alternatywną trasą.
- 1
Twórz przykłady dla każdego poziomu priorytetu.
- 2
Ustaw cele w zakresie potwierdzania, aktualizacji, łagodzenia skutków i przywracania.
- 3
Wymień role klientów i dostawców w zakresie eskalacji.
- 4
Przetestuj proces w ćwiczeniu czasowym.
Komunikuj się jasno i wyciągaj wnioski z incydentów
Aktualizacja incydentu powinna zawierać potwierdzony wpływ, dotknięte funkcje i regiony, godzinę rozpoczęcia, bieżące działanie, obejście, godzinę następnej aktualizacji i kontakt. Oddziel fakty od hipotez. Zachowaj stabilny identyfikator zdarzenia na stronie stanu, w wiadomości e-mail, w pomocy technicznej i w raporcie końcowym.
Wymagaj raportu po zdarzeniu dotyczącego poważnych zdarzeń, zawierającego harmonogram, warunki przyczyniające się do tego, lukę w wykrywaniu, zabezpieczenie, odzyskiwanie, wpływ na klienta, działania naprawcze, właścicieli i terminy. Sprawdź, czy podjęte działania ograniczają powtarzalność problemów, czy jedynie poprawiają sformułowania przyszłych raportów.
Użyj wstępnie zatwierdzonego szablonu aktualizacji.
Publikuj aktualizacje w obiecanej częstotliwości.
Śledź działania naprawcze aż do zweryfikowanego zakończenia.
Podziel się odpowiednimi lekcjami z właścicielami usług i użytkownikami.
Zarządzaj środkami zaradczymi i dowodami serwisowymi
Kredyty na usługi powinny być automatyczne lub łatwe do uzyskania i powinny być skalowane wraz z wpływem, ale nie zastępują odporności. Zarezerwuj silniejsze środki zaradcze na wypadek powtarzających się awarii, zaniedbań w zakresie obowiązków związanych z bezpieczeństwem, przedłużających się przestojów lub niewykonania działań naprawczych.
Przejrzyj miesięczny pakiet dowodów zawierający surową dostępność, wykluczone minuty, incydenty, docelową wydajność, powtarzające się przyczyny, zapotrzebowanie na wsparcie, zmiany i ryzyko związane z wydajnością. Porównaj dane dostawców z monitorowaniem klientów. Korzystaj z trendów, aby uruchamiać plany ulepszeń, zmiany architektury lub przygotowania do wyjścia.
- 1
Co miesiąc uzgadniaj pomiary dostawców i klientów.
- 2
Podważ każde wykluczenie za pomocą dowodów.
- 3
Konsekwentnie stosuj kredyty i eskalację.
- 4
Automatycznie wyzwalaj progi poprawy lub wyjścia.
Przygotuj wspólną reakcję, zanim nastąpi incydent
Utwórz wspólną matrycę reakcji, która odwzorowuje typy incydentów na obowiązki dostawcy i klienta. Obejmuje awarię dostępności, uszkodzone dane wyjściowe, nieautoryzowany dostęp, podejrzenie naruszenia danych osobowych, utracone zapisy audytu, regresję modelu, nadmierne opóźnienia, wyczerpanie przydziału i nieudane dostarczenie partii. Dla każdego zdarzenia określ źródło wykrycia, właściciela wstępnej selekcji, dowody do zachowania, uprawnienia do wyłączenia usługi, właściciela oceny prawnej, osobę zatwierdzającą komunikację, drogę odzyskiwania i kryteria powrotu do usługi.
Synchronizuj zegary operacyjne i prawne. Krytyczny cel wsparcia dostawcy nie zastępuje ustawowych lub umownych obowiązków powiadamiania. Klient potrzebuje wystarczającej ilości zweryfikowanych informacji, aby ocenić dane, ludzi, systemy, okres, zabezpieczenie, prawdopodobne konsekwencje i środki łagodzące, których to dotyczy. Wymagaj od dostawcy przedstawiania faktów na bieżąco w miarę rozwoju dochodzenia, zamiast czekać na raport końcowy, wyraźnie zaznaczając niepewność i późniejsze korekty.
Ćwicz matrycę z realistycznymi zastrzykami przynajmniej raz w roku i po większych zmianach w architekturze. Uwzględnij niedostępne kontakty, niekompletne dzienniki, brak zgody co do priorytetu, zapytanie publiczne i nieudaną pierwszą próbę odzyskania danych. Rejestruj czasy podejmowania decyzji, brakujące informacje, ręczne obejścia, wpływ na użytkowników i działania usprawniające. Ćwiczenie powinno sprawdzić przywództwo i komunikację, a także przywrócenie stanu technicznego. Zamknij każde działanie dowodami i zaktualizuj SLA, jeśli udokumentowany proces nie może dotrzymać swoich własnych terminów.
Mapuj obowiązki techniczne, dotyczące prywatności, bezpieczeństwa, usług i komunikacji.
Dostosuj cele reakcji dostawców do zegarów prawnych i organizacyjnych.
Ćwicz niekompletne informacje, eskalację, obejście i nieudane odzyskiwanie.
Weryfikuj działania doskonalące i rewiduj nieosiągalne zobowiązania.
Role, dowody i zatwierdzenie
Przeglądy bezpieczeństwa i prywatności muszą opisywać konfigurację produkcyjną, a nie ogólnego dostawcę. Zapisz dokładną usługę, region, flagi funkcji, opcjonalną telemETRię, dostęp do pomocy technicznej, podprocesory, granice szyfrowania, ustawienia przechowywania i obowiązki klienta. Dokonaj ponownej oceny po zmianie architektury materiału, umowy, dostawcy lub celu i powiąż decyzję z zweryfikowanymi dowodami.
Eksploatacja i konserwacja
Praca nie kończy się w momencie publikacji. Połącz wersję językową lub konfigurację ze źródłem, monitoruj jakość i miary usług oraz zdefiniuj konkretne wyzwalacze przeglądu. Wyzwalacze obejmują zmiany źródła, zmiany prawne, nowe potrzeby odbiorców, powtarzające się pytania dotyczące pomocy, zmiany techniczne i incydenty. Nazwany właściciel ocenia wyzwalacz, w razie potrzeby otwiera nową wersję i rejestruje ponowne zatwierdzenie.
Lista kontrolna przed publikacją
Pełna ścieżka przetwarzania jest udokumentowana.
Uzgodniono role administratora i podmiotu przetwarzającego.
Udokumentowano lokalizacje i podprocesory.
Wyraźnie uwzględniono szkolenia i wtórne zastosowania.
Weryfikuje się kontrolę dostępu, szyfrowania, rejestrowania i incydentów.
Przechowywanie i usuwanie są definiowane dla każdej kategorii danych.
Przelewy międzynarodowe i zabezpieczenia są dokumentowane.
Przypisuje się zmiany, audyty, wyjścia i własność dowodów.