אשכולות GPU משנים את פרופיל העומס, את צפיפות ההספק ואת קצב ההתרחבות של מרכז הנתונים. התשובה ההנדסית אינה רכיב יחיד אלא שרשרת חשמל מתואמת מן הרשת ועד השבב.
מאת אמיתי רוט, מנכ״ל
עומסי הבינה המלאכותית אינם רק גדולים יותר. הם משתנים מהר יותר, מרוכזים בצפיפות גבוהה יותר ומתקדמים מדור חומרה אחד לבא אחריו בקצב שמקצר את חלון התכנון. מרכז נתונים שנבנה סביב עומסי מחשוב יציבים יחסית עלול לגלות שהקיבולת הנומינלית שלו מספיקה, אך שרשרת החשמל אינה מגיבה נכון לקפיצות עומס, אינה ניתנת להרחבה ללא השבתה או מאבדת יעילות בנקודות העבודה האמיתיות.
מכאן נובעת מסקנה תכנונית חשובה: אי אפשר לבחור UPS, לוח, פס צבירה או ארון כוח כפריטים עצמאיים. התכנון חייב לבדוק את המסלול המלא של האנרגיה, מן החיבור לרשת ועד ספקי הכוח של השרתים, יחד עם מערכת הקירור, ההגנות, הבקרה ותרחישי התחזוקה. גישת Grid to Chip אינה סיסמה; היא שיטת עבודה שמונעת מצב שבו שיפור ברכיב אחד רק מעביר את צוואר הבקבוק לרכיב הבא.
עומסי AI משנים את כללי הבחירה
באימון ובהסקה של מודלים גדולים, אלפי מאיצים עשויים לעבור באופן מסונכרן בין המתנה, חישוב ושיא. השינוי יכול להתרחש בתוך אלפיות שנייה ולחזור שוב ושוב. כאשר הוא מופיע באשכול גדול, הוא מורגש לאורך השרשרת כולה: בספקי הכוח, בארונות, בפסי הצבירה, ב־UPS, בשנאים ואף במקור ההזנה.
לכן הספק ממוצע אינו מספיק לתכנון. יש לתאר לפחות ארבעה מאפיינים: ההספק הרציף, גובה השיא, משך השיא ותדירות החזרה שלו. שני אולמות בעלי אותו עומס ממוצע יכולים לדרוש תשתיות שונות לחלוטין אם באחד השינויים מתונים ובאחר הם חדים ומתואמים. במבחני קבלה יש לשחזר את פרופיל העבודה הצפוי, ולא להסתפק בעומס נגדי קבוע שמוכיח רק שהמערכת מסוגלת לשאת מספר מסוים של קילוואטים.

פרופיל עומס AI כולל עומס בסיס, שיאים קצרים וקצב שינוי מהיר מקור Schneider Electric
בחירת UPS מתחילה בפרופיל העומס
הספק לוחית הנתונים הוא רק נקודת פתיחה. מערכת אל פסק לעומסי AI צריכה לשמור על מתח מוצא יציב בזמן שינויי מדרגה, להתמודד עם עומסי יתר קצרים במסגרת המעטפת המאושרת, להימנע ממעבר לא מתוכנן למעקף ולשמור על היתירות גם כאשר מודול או יחידה אינם זמינים. בזמן הפסקת רשת, המצברים מספקים את הגשר הקצר הדרוש עד כניסת הגנרטור או מקור חלופי; זמן הגיבוי הוא דרישת תכנון, אך אינו הנושא שמגדיר לבדו את התאמת ה־UPS לעומס AI.
הבדיקה צריכה לכלול גם את נקודת העבודה בעומס חלקי. תשתית חדשה אינה מתחילה בדרך כלל בקיבולת הסופית שלה, ומערכת שמתוכננת לעתיד פועלת במשך שנים בטווחי עומס שונים. עקומת הנצילות, מספר המודולים הפעילים, אסטרטגיית היתירות והאפשרות להוסיף קיבולת בלי להשבית את העומס משפיעים יחד על העלות ועל הזמינות.
- להגדיר עומס רציף, שיאים, משך ותדירות ולא להסתפק בערך ממוצע
- לבדוק תגובה לעומס דינמי ואת התנאים המדויקים שבהם מותר עומס יתר
- לחשב קיבולת זמינה גם בתרחיש תחזוקה או תקלה ולא רק במצב שכל המודולים פועלים
- לבחון נצילות לאורך עקומת העומס הצפויה ואת השפעתה על עומס הקירור
- לכלול בבדיקות הקבלה את רצף ההזנה, ההגנות, הגנרטורים והבקרה כמערכת אחת
מצברי עופרת מול ליתיום בעומסי AI
בעומס IT רגיל המצבר נדרש בעיקר כאשר מקור ה־AC אינו זמין. בפרופיל AI, שיאים חדים עלולים להביא את ה־UPS לנקודת עבודה שבה נדרשת תמיכה רגעית מצד המצברים, בהתאם לטופולוגיה, למצב העבודה ולמעטפת שאישר היצרן. לכן ההשוואה בין VRLA לבין Lithium-ion צריכה לכלול לא רק דקות גיבוי, אלא גם הספק פריקה, קצב טעינה חוזרת, מספר אירועים חוזרים, טמפרטורה, ניטור והזדקנות.
מצברי VRLA מבוססי עופרת הם פתרון מוכר, זמין ובעל עלות רכישה נמוכה יחסית. תכנון ותחזוקה שלהם מוכרים לצוותי מתקנים רבים, והם מתאימים היטב כאשר תרחיש העבודה הוא גיבוי נדיר וקצר. החסרונות מתחדדים במתקן צפוף או חם: הם תופסים יותר שטח ומשקל עבור דרישה נתונה, רגישים לטמפרטורה, וזמן השירות שלהם מתקצר כאשר הפריקות תכופות או עמוקות. במערכת AI שבה השיאים חוזרים, יש לאמת במפורש שכושר הפריקה והמחזוריות של המערך מתאימים לפרופיל ולא להסתמך על חישוב זמן גיבוי בלבד.
פתרונות Lithium-ion ייעודיים ל־UPS מציעים בדרך כלל צפיפות הספק ואנרגיה גבוהה יותר, שטח ומשקל נמוכים יותר, טעינה מהירה יותר ועמידות טובה יותר למספר גדול של מחזורים. מערכת BMS מספקת נראות ברמת מודול או תא ומשפרת את היכולת לזהות חריגות לפני שהן הופכות לכשל. מנגד, ההשקעה הראשונית גבוהה יותר, התאימות בין ה־UPS, הכימיה וה־BMS חייבת להיות מאושרת, ונדרשים תכנון בטיחות, הגנות, ניתוק ותגובה תרמית התואמים למוצר ולדרישות האתר. יתרון טכני אינו פוטר מבדיקה של שרשרת אספקה, זמינות חלפים וסוף החיים.
| שיקול | VRLA עופרת | Lithium-ion |
| השקעה ראשונית | נמוכה יותר | גבוהה יותר |
| שטח ומשקל | גדולים יותר | נמוכים יותר |
| טעינה מחדש | איטית יותר | מהירה יותר |
| ניטור | ניטור מערכתי או חיצוני | BMS משולב |
| רגישות לטמפרטורה | חיי השירות מושפעים מאוד מחום | עמידות טובה יותר |
| בטיחות ואינטגרציה | טכנולוגיה ותיקה; נדרשים אוורור, הגנות ותחזוקה | נדרשים BMS,, הגנות |
| עלות מחזור חיים | עלות כניסה נמוכה אך יותר החלפות ותחזוקה | עשויה להיות נמוכה יותר לאורך זמן אם תנאי האתר מנצלים את יתרונותיה |
מבחינת עומסי AI, היתרון של ליתיום בולט כאשר נדרשים שיאי הספק חוזרים, זמן טעינה קצר, צפיפות גבוהה וניטור מפורט. VRLA נשאר פתרון סביר כאשר האירועים נדירים, יש די שטח, תנאי הטמפרטורה מבוקרים והעלות הראשונית היא אילוץ מרכזי. ההחלטה אינה צריכה להתבסס על הכימיה בלבד: יש לאמת את פרופיל העומס מול עקומות הפריקה והטעינה, לשמור על היתירות הנדרשת ולבדוק שהיצרן מאשר את השילוב המלא של UPS, מצברים ובקרה.
Galaxy VXL כמקרה מבחן למערכת מודולרית
Galaxy VXL של Schneider Electric מדגים כיצד יצרנים מתאימים UPS תלת פאזי לעולם של הספקים גבוהים וצמיחה מדורגת. בתצורת 400 V מציגהElectric Schneider הספק של עד 1.25 MW, מודולי הספק של 125 kW במארז 3U ושטח רצפה של כ־1.2 m². הנתונים מרשימים, אך המשמעות ההנדסית החשובה יותר היא היכולת לקשור בין קיבולת, מודולריות, יתירות ותחזוקה בתוך אותה מעטפת.
מערכת מודולרית מאפשרת להתקין קיבולת קרובה יותר לצורך הראשוני ולהוסיף מודולים עם גידול העומס. בכך היא מצמצמת השקעה מוקדמת והפסדים הנובעים מתפעול מערכת גדולה מדי. אולם מודולריות לבדה אינה מבטיחה זמינות. התכנון צריך להגדיר כמה מודולים נדרשים לעומס, כמה נשמרים ליתירות, מה קורה בעת הוצאת מודול לשירות והאם ניתן לבצע את הפעולה בלי לעבור למסלול פחות מוגן.
יתירות ותחזוקה נמדדות בזמן אמת
סימון N+1 בתרשים אינו סוף הבדיקה. היתירות צריכה להתקיים גם ביום חם, בשעת שיא ובזמן שמודול נמצא בטיפול. יש לבדוק את המסלול הפיזי של ההזנה, את נקודות הכשל המשותפות, את הקיבולת לאחר כשל ואת זמן התיקון הצפוי. כאשר המודולים נגישים מן החזית וניתנים להחלפה בתהליך מאושר בזמן שהמערכת ממשיכה לפעול, התחזוקה הופכת לחלק מארכיטקטורת הזמינות ולא לאירוע חריג שמחייב חלון השבתה.
היכולת להוסיף או להחליף מודול תחת עומס אינה מבטלת נהלי בטיחות, תכנון מעקפים או צורך במיומנות. היא כן משנה את השאלה התפעולית: במקום לבחור בין תחזוקה לבין רציפות, ניתן לתכנן מראש מסלול שירות שמגן על שתיהן. לשם כך נדרשים גישה פיזית, מלאי חלפים, ניטור מצב, הרשאות עבודה ותרחיש ברור של חזרה לתצורה מלאה.
Double Conversion מול eConversion
במצב Double Conversion האנרגיה עוברת מ־AC ל־DC ולאחר מכן בחזרה ל־AC. הטופולוגיה מבודדת את העומס מהפרעות רבות ברשת ומספקת איכות הספק צפויה, אך כל שלב המרה יוצר הפסדים וחום. במצב eConversion , כאשר תנאי הרשת נמצאים בתחום המותר, המערכת פועלת במסלול יעיל יותר תוך שמירה על פונקציות איכות הספק ומעבר רציף להמרה כפולה כאשר התנאים מחייבים זאת. זהו מצב עבודה מבוקר של ה־UPS, לא עוקף תחזוקה.
Schneider Electric מציינת עבור Galaxy VXL נצילות של עד 97.5% ב־Double Conversion ועד 99% ב־eConversion. אלה ערכי שיא ותוצאות הפרויקט תלויות בעומס, בתצורה ובאיכות הרשת. עם זאת, גם פער קטן באחוזים מצטבר במתקן שפועל 8,760 שעות בשנה.
| נתון בדוגמה | Double Conversion | eConversion |
| הספק לעומס | 1,000 kW | 1,000 kW |
| נצילות מונחת | 97.5% | 99% |
| הפסדי UPS | 25.64 kW | 10.10 kW |
| אנרגיית הפסדים בשנה | כ־224.6 MWh | כ־88.5 MWh |
בדוגמה הפשוטה ההפרש הוא כ־15.54 kW, או כ־136 MWh בשנה לכל 1 MW של עומס רציף. נוסף על עלות החשמל, ההפסדים הופכים לחום שיש לפנות מחדר החשמל. ההשוואה הנכונה לפרויקט צריכה להשתמש בעקומות הנצילות המלאות, בשעות העבודה בכל מצב, במחיר החשמל בפועל ובביצועי הקירור. היא צריכה לכלול גם את מדיניות איכות ההספק והזמינות, ולא להעדיף מצב עבודה רק מפני שהוא מציג את המספר הגבוה ביותר בקטלוג.
צפיפות ארון של מאות קילוואטים משנה את הפיזיקה
כאשר ארון AI מתקרב ל־400 kW ובהמשך ל־1 MW, מגבלת המקום והזרם נעשית מוחשית. בהמחשה אידאלית של הספק DC, העברת 1 MW ב־54 V דורשת זרם של כ־18.5 kA, ואילו ב־800 V הזרם הוא כ־1.25 kA. החישוב אינו קובע לבדו חתך מוליכים, מספר הזנות או אמצעי הגנה, אך הוא מסביר מדוע העלאת המתח משנה את היתכנות ההולכה: עבור אותו הספק, זרם נמוך יותר מצמצם את דרישות הנחושת, את נפח המחברים ואת הפסדי ההולכה.
ארכיטקטורת 800 VDC מעבירה את ההמרה מ־AC ל־DC אל מחוץ לארון המחשוב ומוליכה מתח ישר גבוה אל סביבת השרתים. Schneider Electric מציגה פוטנציאל לשיפור של עד 5% בנצילות מקצה לקצה ולהפחתה של עד 45% בדרישת הנחושת, בהתאם לארכיטקטורה. אלו אינם מספרים אוניברסליים; יש לאמת אותם מול מרחקים, מספר שלבי ההמרה, רמות היתירות, חתכי המוליכים וציוד הקצה בפרויקט המסוים.

אפשרויות למיקום ההמרה מ־AC ל־DC ארון כוח סמוך הוא מסלול מעבר מעשי מקור Schneider Electric White Paper 213
Sidecar יוצר מסלול מעבר מעשי
המעבר ל־800 VDC אינו מחייב להפוך מיד את כל המתקן לרשת DC מרכזית. Power Rack או Sidecar הסמוך לארון המחשוב יכול לקבל AC מן התשתית הקיימת, לבצע המרה, הגנה ובקרה ולספק DC לארון AI. הפתרון משאיר חלק גדול משרשרת ה־AC במקומה, מפחית את המרחק שבו זורם DC במתח גבוה ומאפשר לפרוס את הטכנולוגיה באשכול מוגדר לפני הרחבה.
היתרון הזה משמעותי במיוחד בשדרוג מתקן קיים, אך הוא אינו הופך את ה־Sidecar למוצר שמוסיפים ללא תכנון מערכתי. יש להגדיר את שיטת ההארקה, אופן הבידוד, התנהגות זרם התקלה, נקודות הניתוק, הגישה לתחזוקה, תקשורת הבקרה והממשק עם מערכת הקירור. ככל שההמרה נעה במעלה השרשרת, ניתן להפחית שלבים ולרכז ציוד, אך גדלים גם היקף ההשפעה של תקלה ומורכבות ההגנה.
הגנה וסלקטיביות ב־DC דורשות תכנון חדש
מערכת 800 VDC אינה גרסת DC של לוח AC קיים. בזרם ישר אין מעבר טבעי דרך אפס בכל מחזור, ולכן כיבוי קשת, בחירת מפסקים וזמני ניתוק מקבלים משמעות אחרת. גם זרם התקלה מושפע מממירי ההספק, מקיבולי הקישור ומטופולוגיית ההארקה. העתקה של הגדרות הגנה ממערכת AC עלולה להוביל לניתוק איטי מדי, לניתוק אזור גדול מדי או לאי־תיאום בין אמצעי ההגנה.
תכנון הסלקטיביות צריך להתחיל במודל של מקורות התקלה ובגבולות האזור המוגן. יש לקבוע איזה התקן מנתק תקלה ברמת ספק, ארון, Sidecar או פס חלוקה; מהו זרם הקצר הזמין בכל נקודה; כיצד נשמר בידוד בין מסלולים יתירים; ואיך מבוצעת עבודה בטוחה לאחר ניתוק. ניתוח DC arc flash, זמני פריקה של קיבולים, שילוט ונהלי אימות היעדר מתח הם חלק מתכנון התפעול ולא מסמכים שמוסיפים בסוף הפרויקט.

חמישה עקרונות לתכנון 800 VDC ובהם ארכיטקטורה, הגנה וסלקטיביות, מוכנות לביצוע ותפעול מקור Schneider Electric White Paper 213
שדרוג מתקן קיים מול הקמה חדשה
ההבדל בין Retrofit ל־Greenfield אינו רק תקציבי. במתקן קיים, ההחלטה מוכתבת על ידי קיבולת החיבור, מצב השנאים והלוחות, מרחב פיזי, מסלולי כבלים, יכולת הקירור וזמן ההשבתה המותר. לעיתים נכון להתחיל באשכול AI תחום, לשלב UPS מודולרי ולהוסיף Sidecar ליד הארונות. כאשר היעד הוא מאות קילוואטים לארון בקנה מידה רחב, ייתכן שהמגבלות במעלה השרשרת יחייבו שינוי יסודי יותר.
| שיקול | מתקן קיים | מתקן חדש |
| מסלול ההרחבה | פריסה מדורגת סביב מגבלות קיימות | תכנון קיבולת ושלבים מראש |
| מיקום ההמרה | Sidecar או Power Rack עשויים לצמצם שינויי תשתית | ניתן לבחור בין ארכיטקטורה ריכוזית לרמת הארון |
| הגנות | נדרש תיאום עם ציוד קיים ומגבלות זרם קצר | ניתן לתכנן סלקטיביות והארקה כמערכת אחת |
| תחזוקה | חלונות עבודה וגישה פיזית מגבילים את הביצוע | אפשר להטמיע נתיבי שירות והפרדה מראש |
| קירור | יש לאמת יכולת קיימת ומסלולי צנרת | אפשר לתאם חשמל וקירור נוזלי מתחילת התכנון |
במתקן חדש ניתן להקצות מקום, פתחים ונתיבי תחזוקה לדורות חומרה שעדיין אינם מותקנים. הערך של התכנון המוקדם אינו רק בקיבולת גבוהה יותר; הוא מצמצם אילתורים בזמן ההרחבה ומונע מצב שבו תוספת ארונות מחייבת שינוי יקר בלוחות, בפסי הצבירה או בקירור. מצד שני, תכנון עתידי אינו הצדקה להתקנת ציוד גדול מדי ביום הראשון. מודולריות אמורה לאפשר מסלול גדילה ולא לבטל את הצורך בתחזית עומס אמינה.
תכנון Grid to Chip מחבר את ההחלטות
שרשרת ההספק של AI כוללת את החיבור לרשת, מתח בינוני, שנאים, לוחות מתח נמוך, פסי צבירה, UPS, חלוקה לארון, המרה ברמת הארון וספקי הכוח של המאיצים. לכל שכבה יש קיבולת, נצילות, תגובה דינמית, הגנות ומגבלות תחזוקה. תכנון Grid to Chip מחבר את הנתונים האלה למודל אחד ומכריח את צוותי החשמל, ה־IT והקירור לעבוד עם אותן הנחות.
- מפת עומסים לפי אולם, שורה וארון הכוללת שיאים וקצב שינוי
- מאזן קיבולת בכל מצב תפעולי לרבות תחזוקה וכשל יחיד
- מודל נצילות והפסדים לאורך נקודות העבודה ולא רק בעומס מלא
- תיאום הגנות מן המקור ועד הארון כולל תרחישי תקלה ב־DC
- תיאום בין צפיפות החשמל, הקירור הנוזלי, חלוקת המקום ונתיבי השירות
- תוכנית בדיקות קבלה שמדמה את פרופיל העומס ואת המעברים בין מצבי עבודה
- ניטור שמציג קיבולת זמינה, איכות הספק ומגמות ולא רק אזעקות רכיב
המודל המערכתי גם מבהיר היכן להשאיר גמישות. ייתכן שהיום נכון להפעיל עומסים ב־AC עם UPS מודולרי, אך לשמור מקום, הגנות וממשקים ל־Sidecar עתידי. במתקן אחר, יעד הצפיפות כבר מצדיק 800 VDC מן היום הראשון. אין ארכיטקטורה אחת שמתאימה לכל אתר; יש תהליך עקבי שמחבר את יעד המחשוב למגבלות הפיזיות ולסיכון התפעולי.
המבחן הוא היכולת לגדול בלי לאבד שליטה
מרכז נתונים לעומסי AI אינו נמדד רק במספר המגה־ואטים שהוא מסוגל לספק ביום ההפעלה. הוא נמדד ביכולת לספוג שינויי עומס, להוסיף קיבולת, לבצע תחזוקה ולשנות ארכיטקטורה בלי לפגוע בעומס הקריטי. UPS בעל תגובה דינמית ומבנה מודולרי, בחירה מושכלת בין Double Conversion ל־eConversion, תכנון מוקדם לצפיפויות גבוהות ומסלול ברור ל־800 VDC הם החלטות שמתחברות זו לזו.
העבודה ההנדסית החשובה מתרחשת בחיבורים שבין הרכיבים: בין פרופיל ה־GPU ליכולת ה־UPS, בין היתירות לתרחיש התחזוקה, בין מתח החלוקה להגנות ובין ההספק לקירור. כאשר החיבורים האלה נבדקים מראש, אפשר לבנות תשתית שמשרתת את דור החומרה הנוכחי ונשארת פתוחה לדור הבא בלי להמר על הזמינות.
מקורות מקצועיים
- Schneider Electric Galaxy VXL product range
- Schneider Electric Galaxy VXL VX VL Series AI Load Tolerant UPS Application Note
- Schneider Electric 800 VDC Power Architecture
- Schneider Electric White Paper 213 Five Principles for 800 VDC in AI Data Centers
- Schneider Electric Galaxy VXL Technical Specifications
- Schneider Electric Galaxy Lithium ion Battery Systems
Schneider Electric AI tolerant UPSs and battery type for AI applications









