שישי, 21:30. שלום, בעל רשת מסעדות עם 4 סניפים, מתקשר אליי לא מנומס. "דניאל, השרת הראשי קרס. כל מערכת הקופות לא עובדת בארבעת הסניפים. אנחנו בשיא של ערב שישי. תעזור".

איפה התוכנית? אין תוכנית. מי הספק של מערכת הקופות? לא בטוח. יש להם מספר טלפון? "אולי". מי הטכנאי שמתחזק את השרת? "פלוני, אבל הוא בשבת אצל אמא שלו".

זה הרגע שאני מנסה לעצב פנים של אופטימיות במצב שאני יודע שאנחנו על מסלול ארוך הביתה. סוף סוף הוא מצא את הספק, הספק טס עם משפחתו בחו"ל, ואת הטכנאי המקומי שכנעו לקום לשם השם. עד שמישהו הגיע פיזית למשרד עם דיסק חלופי, היו 2 בלילה. השרת חזר לחיים ב-7 בבוקר שבת. סך הכל 10 שעות של מערכות מושבתות בערב הכי חזק של השבוע. הפסד מוערך: 65 אלף שקל. ועוד 200 לקוחות מאוכזבים שראו "מערכת לא זמינה" וקמו והלכו.

ירידת שרת ראשי בלי תוכנית - 10 שעות מערכות מושבתות וכאב ראש למנהל

מה זה תוכנית התאוששות מאסון ולמה היא לא יכולה לחיות בארון

תוכנית התאוששות מאסון (Disaster Recovery Plan, DRP) זה לא מסמך של 80 עמודים שיועץ כתב לפני 3 שנים ושמישהו שמר ב-Drive שכבר לא ברור מי הבעלים שלו. תוכנית אמיתית עונה על 4 שאלות:

  • מה קריטי? איזה מערכות אם נופלות, העסק נפגע כלכלית בתוך השעה הראשונה?
  • כמה זמן יכולים לסבול בלי? זה ה-RTO, Recovery Time Objective. עבור מערכת קופות של רשת מסעדות, זה דקות. עבור מערכת ניהול מסמכים פנימית, אולי שעות או יום.
  • כמה מידע מותר לאבד? זה ה-RPO, Recovery Point Objective. אם אתה מגבה כל לילה, יכול להיות שתאבד יום שלם של נתונים. אם אתה מגבה כל 15 דקות, תאבד עד 15 דקות.
  • מי עושה מה ומתי? רשימה מסודרת של אנשים, מספרי טלפון, סדר פעולות.

אצל שלום, אם הייתה תוכנית, היה כתוב בה: שרת ראשי קורס, רוץ אוטומטית לשרת חלופי בענן Azure, המערכת חוזרת תוך 6 דקות במקום 10 שעות.

למה לרוב העסקים אין תוכנית בכלל

כי שלום, כמו רוב בעלי העסקים, חי בעולם של "כשזה יקרה אז נטפל". זה גישת ניהול חוקית בעולם של בנק שיש לו 3 שרתים מיותרים, צוות סיסטם של 12 איש, ויועץ סייבר במשרה מלאה. זה לא חוקי בעולם של עסק עם 50 עובדים ושרת אחד שיושב על דעת אדם אחד.

הסיכוי שתחווה אסון IT אמיתי בשנה? נמוך. הסיכוי בעיני 5 שנים? גבוה. ובדיוק כשזה יקרה, לא יהיה לך זמן לבנות תוכנית.

איך אנחנו בונים DR עם לקוח חדש

אצלנו ב-SecureOps זה תהליך של 3 שלבים.

ראשון. ישיבה של שעה עם המנהל ושני אנשים שמכירים את התשתית הטכנית. לא יועצים. לא הצגות. שעה ופלייליסט של שאלות: מה הקריטי? כמה זמן אפשר לסבול? מי יודע מה? המוצר של הישיבה זה מסמך של 3-5 עמודים, לא 80.

שני. הקמת תשתית. בדרך כלל זה רפליקציה ל-Azure או ל-AWS, עם RTO של פחות מ-15 דקות עבור המערכות הקריטיות. עלות חודשית: בערך 800-1,500 שקל למערכת קריטית אחת, תלוי בגודל. זה מצחיק ביחס לעלות של ערב שישי מושבת.

שלישי, תרגיל שחזור. בתיאום מראש מדמים השבתה של מערכת, מפעילים את התוכנית ומודדים את זמני החזרה. התדירות נקבעת לפי רמת הסיכון והדרישות העסקיות, והממצאים משמשים לעדכון התוכנית.

תוכנית התאוששות מאסון: מה שאנשים שוכחים

הם שוכחים שהתוכנית עצמה צריכה תחזוקה. אם הסיסטם עזב לפני שנה, מספר הטלפון בתוכנית כבר לא רלוונטי. אם החלפת ספק ענן, נתיב ה-failover שונה. אם הוספת מערכת קריטית חדשה, היא לא בתוכנית.

תוכנית התאוששות מאסון זה לא מסמך, זה תהליך. ואם זה לא מתורגל לפחות פעם ברבעון, זה לא תוכנית. זה משאלה.

לפני שבונים DRP, ודאו שהעותקים נמצאים במקום הנכון: מדריך לאחסון גיבויים לעסק. לתכנון מלא עברו אל שירותי גיבוי, שחזור והתאוששות מאסון.

מתי בפעם האחרונה מישהו אצלך בעסק תרגל מה קורה כשהשרת המרכזי קורס?