מבוא לעומסי עבודה של AI/ML ב-GKE

בדף הזה יש סקירה כללית של Google Kubernetes Engine ‏ (GKE) לעומסי עבודה של AI/ML. ‫GKE הוא הטמעה מנוהלת של Google של פלטפורמת תזמור הקונטיינרים Kubernetes בקוד פתוח.

‫Google Kubernetes Engine מספק פלטפורמה גמישה, ניתנת להתאמה וחסכונית להרצת כל עומסי העבודה שלכם במכולות, כולל אפליקציות של בינה מלאכותית (AI) ולמידת מכונה (ML). בין אם אתם מאמנים מודלים גדולים בסיסיים, משרתים בקשות הסקה בהיקף גדול או בונים פלטפורמת AI מקיפה, GKE מציע את השליטה והביצועים שאתם צריכים.

הדף הזה מיועד למומחי נתונים ו-AI, לארכיטקטים של Cloud, לאופרטורים ולמפתחים שמחפשים פתרון Kubernetes מנוהל, אוטומטי וניתן להרחבה להרצת עומסי עבודה של AI/ML. מידע נוסף על תפקידים נפוצים זמין במאמר תפקידים נפוצים של משתמשים ומשימות ב-GKE.

איך מתחילים להשתמש בעומסי עבודה של AI/ML ב-GKE

אפשר להתחיל להשתמש ב-GKE תוך דקות באמצעות התוכנית החינמית של GKE, שמאפשרת להתחיל להשתמש ב-Kubernetes בלי לשלם על ניהול האשכול.

  1. איך מתחילים לעבוד עם Google Cloud המסוף

  2. אפשר לנסות את המדריכים הבאים להתחלה מהירה:
    • הסקת מסקנות ב-GKE: פריסת מודל שפה גדול (LLM) של AI ב-GKE להסקת מסקנות באמצעות ארכיטקטורה מוגדרת מראש.
    • אימון ב-GKE: פריסת מודל לאימון AI ב-GKE ואחסון התחזיות ב-Cloud Storage.
  3. מומלץ לקרוא את המאמר מידע על אפשרויות השימוש במאיצים לעומסי עבודה של AI/ML, שכולל הנחיות ומקורות מידע לתכנון ולקבלת מאיצים (GPU ו-TPU) לפלטפורמה שלכם.
  4. אתם יכולים להשתמש ב-Gemini במסוף Google Cloud כדי לקבל עזרה מבוססת-AI בתכנון ובעיצוב של התשתית עבור אשכולות GKE. מידע נוסף זמין במאמר תכנון ואופטימיזציה של אשכולות GKE באמצעות Compute Advisor.

תרחישים נפוצים לדוגמה

‫GKE מספק פלטפורמה מאוחדת שיכולה לתמוך בכל עומסי העבודה (workloads) של AI.

  • פיתוח פלטפורמת AI: צוותי פלטפורמה בארגונים יכולים להשתמש ב-GKE כדי לפתח פלטפורמה סטנדרטית עם מספר דיירים, שתענה על מגוון רחב של צרכים.
  • הצגה אונליין עם זמן אחזור נמוך: למפתחים שיוצרים אפליקציות מבוססות-AI גנרטיבי, ‏ GKE עם Inference Gateway מספק את הניתוב המותאם ואת ההתאמה האוטומטית של קנה המידה שנדרשים כדי לספק חוויית משתמש רספונסיבית תוך שליטה בעלויות.

בחירת הפלטפורמה המתאימה לעומס העבודה של AI/ML

Google Cloud מציעה מגוון מוצרים של תשתית AI כדי לתמוך בתהליך הלמידה שלכם, החל ממוצרים מנוהלים לחלוטין ועד למוצרים שניתנים להגדרה מלאה. הבחירה בפלטפורמה הנכונה תלויה בצרכים הספציפיים שלכם מבחינת שליטה, גמישות ורמת ניהול.

שיטה מומלצת:

כדאי לבחור ב-GKE כשרוצים שליטה מלאה, ניידות ויכולת ליצור פלטפורמת AI מותאמת אישית עם ביצועים גבוהים.

  • שליטה בתשתית וגמישות: אתם צריכים רמה גבוהה של שליטה בתשתית, להשתמש בצינורות נתונים בהתאמה אישית או לבצע התאמות אישיות ברמת ליבת מערכת ההפעלה.
  • אימון והסקת מסקנות בקנה מידה גדול: אתם רוצים לאמן מודלים גדולים מאוד או להפעיל מודלים עם זמן אחזור מינימלי, באמצעות יכולות ההתאמה של GKE והביצועים הגבוהים שלו.
  • יעילות עלויות בהיקף גדול: אתם רוצים לתעדף אופטימיזציה של עלויות באמצעות השילוב של GKE עם מכונות וירטואליות מסוג Spot ומכונות וירטואליות מסוג Flex-start כדי לנהל את העלויות בצורה יעילה.
  • ניידות ותקנים פתוחים: אתם רוצים להימנע מנעילת ספק ולהריץ את עומסי העבודה שלכם בכל מקום באמצעות Kubernetes, וכבר יש לכם מומחיות ב-Kubernetes או אסטרטגיה מרובת עננים.

אפשר גם לנסות את האפשרויות הבאות:

שירותGoogle Cloud מתאים במיוחד בשביל
Vertex AI פלטפורמה מנוהלת מקצה לקצה שמאיצה את הפיתוח ומפחיתה את הצורך בניהול התשתית. מתאים במיוחד לצוותים שמתמקדים ב-MLOps ובקיצור הזמן להפקת ערך. מידע נוסף זמין בסרטון בחירה בין GKE באירוח עצמי לבין מודלים של AI באירוח מנוהל ב-Vertex AI.
Cloud Run פלטפורמה ללא שרת (serverless) לעומסי עבודה (workloads) של הסקת מסקנות בקונטיינרים, שאפשר להגדיל את הקיבולת שלהם עד לאפס. מתאים לאפליקציות מבוססות-אירועים ולהרצת מודלים קטנים יותר בצורה חסכונית. למידע נוסף על ההבדלים בין GKE לבין Cloud Run, אפשר לעיין במאמר GKE ו-Cloud Run.

איך GKE מפעיל עומסי עבודה של AI/ML

‫GKE מציע חבילה של רכיבים ייעודיים שמפשטים ומאיצים כל שלב במחזור החיים של AI/ML, החל מהדרכה בקנה מידה גדול ועד להסקת מסקנות עם השהיה נמוכה.

בתרשים הבא, GKE נמצא ב- Google Cloudויכול להשתמש באפשרויות שונות של אחסון בענן (כמו Cloud Storage FUSE ו-Managed Lustre) ובאפשרויות שונות של תשתית ענן (כמו Cloud TPU ו-Cloud GPU). ‫GKE גם עובד עם תוכנות ועם מסגרות קוד פתוח ללמידה עמוקה (כמו JAX או TensorFlow), לניהול ML (כמו Jupyter או Ray) ולהיקש של LLM (כמו vLLM או NVIDIA Dynamo).
איור 1: GKE כפלטפורמה מנוהלת וניתנת להרחבה לעומסי עבודה של AI/ML.

בטבלה הבאה מפורטות תכונות GKE שתומכות בעומסי העבודה של AI/ML או ביעדים התפעוליים שלכם.

עומס עבודה או פעולה של AI/ML איך GKE תומך בכם תכונות עיקריות
הסקת מסקנות והצגת מודעות אופטימיזציה להצגת מודלים של AI באופן גמיש, עם זמן אחזור נמוך, תפוקה גבוהה ויעילות בעלויות.
  • גמישות של מאיצים: ‏ GKE תומך ב-GPU‏וב-TPU למסקנות.
  • ‫GKE Inference Gateway: שער שמודע למודלים ומספק ניתוב חכם ואיזון עומסים במיוחד לעומסי עבודה של הסקת מסקנות מ-AI.
  • ‫GKE Inference Quickstart: כלי שמספק קבוצה של פרופילים עם מדדי ביצועים למודלים פופולריים של AI, כדי לפשט את ניתוח הביצועים והפריסה.
  • ‫GKE Autopilot: מצב הפעלה של GKE שמבצע אוטומציה של פעולות באשכולות ושל התאמת גודל הקיבולת, וכך מצמצם את התקורה.
אימון ושיפור השירות מספק את יכולות ההרחבה והתיאום שנדרשות כדי לאמן ביעילות מודלים גדולים מאוד, תוך מזעור העלויות.
  • הפעלה מהירה יותר של צמתים: אופטימיזציה שנועדה במיוחד לעומסי עבודה של GPU, שמקצרת את זמני ההפעלה של הצמתים בעד 80%.
  • מצב הקצאת משאבים עם התחלה גמישה שמבוסס על Dynamic Workload Scheduler: משפר את היכולת שלכם להקצות מאיצי GPU ו-TPU נדירים לעומסי עבודה של אימון לפרקי זמן קצרים.
  • ‫Kueue: מערכת תורים של משימות ב-Kubernetes, שמנהלת הקצאת משאבים, תזמון, ניהול מכסות ותעדוף של עומסי עבודה באצווה.
  • ‫TPU multislice: ארכיטקטורת חומרה ורשת שמאפשרת לכמה חלקי TPU לתקשר ביניהם ברשת של מרכז הנתונים (DCN) כדי לבצע אימון בקנה מידה גדול.
פיתוח מאוחד של AI/ML תמיכה מנוהלת ב-Ray, ‏ framework של קוד פתוח להתאמה לעומס (scaling) של אפליקציות Python מבוזרות.
  • ‫Ray on GKE add-on: מפשט את תשתית Kubernetes, ומאפשר לכם לשנות את גודל עומסי העבודה כמו עיבוד מקדים של נתונים בקנה מידה גדול, אימון מבוזר ומילוי בקשה באופן מיידי עם שינויים מינימליים בקוד.

המאמרים הבאים