Standard PayGo

תשלום לפי שימוש Standard (Standard PayGo) הוא אפשרות צריכה לשימוש בחבילת מודלי ה-AI הגנרטיבי של Gemini Enterprise Agent Platform, כולל משפחת מודלי Gemini.

במסגרת התשלום הרגיל לפי שימוש, אתם משלמים רק על המשאבים שאתם צורכים, בלי שתצטרכו להתחייב מראש להוצאות כספיות. כדי לספק ביצועים צפויים יותר לעומסי עבודה שניתנים להרחבה, תוכנית התשלום הרגילה לפי שימוש כוללת מערכת של רמות שימוש. Agent Platform מתאימה באופן דינמי את קיבולת התפוקה הבסיסית של הארגון, על סמך ההוצאה הכוללת על שירותים כשירים של Agent Platform במהלך תקופה מתגלגלת של 30 יום. ככל שההוצאות של הארגון גדלות, הוא עובר אוטומטית לרמות גבוהות יותר שמספקות גישה מוגברת למשאבים משותפים וסף ביצועים גבוה יותר. אם אתם צריכים ביצועים עקביים יותר מאלה של תמחור רגיל לפי שימוש, כדאי לכם לשקול להשתמש בתמחור לפי שימוש עם עדיפות. למידע על הקצאת משאבים לפי התפוקה שנקבעה, ראו הקצאת משאבים לפי התפוקה שנקבעה.

רמות שימוש ותפוקה

כל רמת שימוש בתמחור הרגיל לפי שימוש נועדה לספק תפוקה בסיסית, שנמדדת בטוקנים לדקה (TPM), ומשמשת כרף ביצועים צפוי לתנועה של הארגון. מגבלות התפוקה מבוססות על בקשות שנשלחות לנקודת הקצה הגלובלית. שימוש בנקודת הקצה הגלובלית הוא שיטה מומלצת, כי היא מספקת גישה למאגר גדול יותר של קיבולת תפוקה במספר אזורים, ומאפשרת לנתב את הבקשות למיקום עם הזמינות הגבוהה ביותר כדי למקסם את הביצועים.

התנועה שלכם לא מוגבלת באופן מוחלט למגבלת קצב העברת הנתונים הבסיסי. Agent Platform מאפשרת לתעבורת נתונים לחרוג מהמגבלה הזו על בסיס האפשרות הטובה ביותר. עם זאת, בתקופות של ביקוש גבוה בפלטפורמת הסוכנים, יכול להיות שהביצועים של תנועת הגולשים העודפת הזו יהיו פחות יציבים. כדי לשפר את הביצועים ולצמצם את הסיכוי לקבלת השגיאות האלה, מומלץ גם לפזר את תנועת הגולשים בצורה אחידה ככל האפשר במהלך כל דקה. לא לשלוח בקשות בזינוקים חדים ברמה השנייה. תנועה גבוהה ומהירה עלולה להוביל לוויסות נתונים (throttle) גם אם השימוש הממוצע שלכם לדקה נמוך מהמגבלה. חלוקה שווה יותר של קריאות ה-API עוזרת למערכת לנהל את העומס בצורה צפויה ומשפרת את הביצועים הכוללים.

החבילות הבאות זמינות בתוכנית Standard PayGo:

משפחה שנקראת רמה הוצאות של לקוחות (30 ימים) מודל TPM לתנועה (ברמת הארגון)
מודלים של Gemini Pro רמה 1 ‫10$ – 250$ 500,000
קבוצה 2 ‫250$ – 2,000$ 1,000,000
רמה 3 > $2000 ‫2,000,000
מודלים של Gemini Flash ו-Flash-Lite רמה 1 ‫10$ – 250$ ‫2,000,000
קבוצה 2 ‫250$ – 2,000$ 4,000,000
רמה 3 > $2000 ‫10,000,000

שימו לב: מגבלת התפוקה שמוצגת למשפחת מודלים חלה בנפרד על כל מודל במשפחה הזו. לדוגמה, לקוח ברמה 3 נהנה מרוחב פס בסיסי של 10,000,000 TPM עבור Gemini 2.5 Flash. השימוש באחת מהמגבלות האלה לא משפיע על קצב העברת הנתונים של מודלים אחרים. אין מגבלה נפרדת על מספר הבקשות לדקה (RPM) לכל רמה. עם זאת, חלה מגבלת המערכת של 30,000 בקשות לדקה לכל מודל בכל אזור. בקשות ל-Gemini עם קלט רב-אופני כפופות למכסות השימוש המתאימות במערכת, כולל תמונה, אודיו, סרטון ומסמך.

איך פועלות רמות השימוש

רמת השימוש נקבעת באופן אוטומטי לפי ההוצאה הכוללת של הארגון על שירותים כשירים של Agent Platform במהלך תקופה של 30 יום. ככל שההוצאות של הארגון שלכם גדלות, המערכת מעבירה אתכם לרמה גבוהה יותר עם תפוקה גבוהה יותר.

חישוב ההוצאות

החישוב הזה כולל מגוון רחב של שירותים, החל מחיזויים בכל משפחות מודלי Gemini ועד למעבדי CPU, מעבדי GPU ומופעי TPU של Agent Platform, וגם מק"טים שמבוססים על התחייבות, כמו הקצאת משאבים לפי התפוקה שנקבעה.

אפשר ללחוץ כדי לקבל מידע נוסף על המק"טים שכלולים בחישוב ההוצאות.

בטבלה הבאה מפורטות הקטגוריות של Google Cloud המק"טים שנכללים בחישוב ההוצאה הכוללת.

קטגוריה תיאור של מק"טים כלולים
המודלים של Gemini כל משפחות מודלי Gemini (למשל, 2.0,‏ 2.5,‏ 3.0 בגרסאות Pro,‏ Flash ו-Lite) לחיזויים בכל המודלים (טקסט, תמונה, אודיו, וידאו), כולל וריאציות של אצווה, הקשר ארוך, כוונון ו'חשיבה'
התכונות של המודלים של Gemini כל המק"טים הרלוונטיים של Gemini לתכונות כמו שמירת נתונים במטמון, אחסון במטמון ורמות עדיפות, בכל האופנים ובכל גרסאות המודלים
Agent Platform CPU תחזיות אונליין ותחזיות באצווה בכל קבוצות המכונות שמבוססות על CPU (למשל, C2,‏ C3,‏ E2,‏ N1,‏ N2 והווריאציות שלהן)
Agent Platform GPU תחזיות אונליין ותחזיות באצווה בכל המקרים שבהם נעשה שימוש ב-GPU של NVIDIA להאצת הביצועים (לדוגמה, סדרות A100,‏ H100,‏ H200,‏ B200,‏ L4,‏ T4,‏ V100 ו-RTX)
Agent Platform TPU תחזיות אונליין ותחזיות באצווה בכל המכונות שמבוססות על TPU (למשל, TPU-v5e,‏ v6e)
ניהול ועמלות כל המק"טים של 'דמי ניהול' שמשויכים למופעים שונים של תחזיות בפלטפורמת הסוכנים
Provisioned Throughput כל המק"טים של התחייבות לשימוש ב-הקצאת משאבים לפי התפוקה שנקבעה
שירותים נוספים שירותים ייעודיים כמו 'LLM Grounding for Gemini... with Google Search tool'

אימות רמת השימוש

כדי לבדוק את רמת השימוש בארגון, עוברים אל לוח הבקרה של Agent Platform במסוף Google Cloud . כדי לראות את רמת השימוש בלוח הבקרה, צריך את התפקיד Agent Platform Viewer (roles/aiplatform.viewer) בפרויקט ואת התפקיד Billing Account Viewer (roles/billing.viewer) בחשבון לחיוב.

מעבר ללוח הבקרה של Agent Platform

אימות ההוצאות

כדי לבדוק את ההוצאות ב-Agent Platform, נכנסים לחיוב ב-Cloud במסוףGoogle Cloud . ההוצאות נצברות ברמת הארגון.

כניסה לחיוב ב-Cloud

שגיאות של עומס על משאבים (429)

אם מופיעה השגיאה 429, זה לא אומר שהגעתם למכסה קבועה. היא מציינת שיש תחרות זמנית גבוהה על משאב משותף ספציפי. מומלץ להטמיע אסטרטגיית ניסיון חוזר עם השהיה מעריכית לפני ניסיון חוזר (exponential backoff) כדי לטפל בשגיאות האלה, כי הזמינות בסביבה הדינמית הזו יכולה להשתנות במהירות. בנוסף לאסטרטגיה לניסיונות חוזרים, מומלץ להשתמש בנקודת הקצה הגלובלית. בניגוד לנקודת קצה אזורית (לדוגמה, us-central1), נקודת הקצה הגלובלית מנתבת את הבקשות באופן דינמי לאזור עם הקיבולת הזמינה הגדולה ביותר באותו רגע. כך האפליקציה יכולה לגשת למאגר גדול יותר של קיבולת משותפת בכמה אזורים, מה שמגדיל משמעותית את הסיכוי להצלחת השימוש בקיבולת עודפת ומקטין את הסבירות לשגיאות 429.

כדי לקבל את התוצאות הטובות ביותר, מומלץ לשלב בין השימוש בנקודת הקצה הגלובלית לבין החלקת התנועה. מומלץ להימנע משליחת בקשות בעומסים חדים ברמה השנייה, כי עומס גבוה ומידי עלול להוביל לוויסות, גם אם השימוש הממוצע לדקה נמצא במסגרת מגבלת התפוקה הבסיסית. פיזור אחיד יותר של קריאות ה-API עוזר למערכת לנהל את העומס בצורה צפויה ומשפר את הביצועים הכוללים. מידע נוסף על טיפול בשגיאות של מיצוי משאבים זמין במאמרים פיתוח אפליקציות LLM עמידות והפחתת שגיאות 429 וקוד שגיאה 429.

מודלים נתמכים

המודלים הבאים של Gemini שזמינים לכלל המשתמשים (GA) והמודלים שלהם שעברו התאמה עדינה מפוקחת תומכים בתשלום לפי שימוש רגיל עם רמות שימוש:

לחצו כדי להרחיב את רשימת המודלים הנתמכים

המודלים הבאים של Gemini ו-GA, וגם המודלים שעברו כוונון עדין בפיקוח, תומכים בשיטת התשלום הרגילה לפי שימוש, אבל רמות השימוש לא חלות על המודלים האלה:

חשוב לזכור שהרמות האלה לא רלוונטיות למודלים בגרסת טרום-השקה (Preview). כדי לקבל את המידע הכי מדויק ועדכני, מומלץ לעיין במסמכי התיעוד הרשמיים של כל מודל.

מעקב אחרי קצב העברת הנתונים והביצועים

כדי לעקוב אחרי צריכת הטוקנים בזמן אמת בארגון, עוברים אל Metrics Explorer ב-Cloud Monitoring.

לדף Metrics Explorer

מידע נוסף על מעקב אחר תנועת נתונים בנקודות קצה של מודלים זמין במאמר מעקב אחר מודלים.

שימו לב: רמות השימוש חלות ברמת הארגון. מידע על הגדרת היקף הנראות כדי לשרטט את התפוקה בכמה פרויקטים בארגון זמין במאמר הגדרת היקפי נראות לשאילתות בכמה פרויקטים.

המאמרים הבאים

Resource

מכסות ומגבלות שקשורות ל-Agent Platform, לא כולל מגבלות ספציפיות למוצרים.

סקירה כללית

במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.