אופטימיזציית עלויות וזמני תגובה עם Prompt Caching ב-Bedrock
מדריך

אופטימיזציית עלויות וזמני תגובה עם Prompt Caching ב-Bedrock

שיטות עבודה, תמחור ותרחישי יישום ב-Converse API להפחתת עלויות טוקנים וזמני תגובה

3 דקות קריאה
מבוסס על כתבה שלAWS Machine Learningתרגום וסיכום באמצעות מערכת חדשות בליווי AIאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • שמירת פרומפטים במטמון ב-Amazon Bedrock יכולה להפחית עד 90% מעלויות טוקני הקלט בפגיעות במטמון ולקצר את זמן ה-TTFT.

  • מודלי Anthropic Claude Sonnet 4.5 ו-4.6 דורשים סף מינימלי של 1,024 טוקנים להפעלת המטמון, בעוד שמודלי Opus דורשים 4,096 טוקנים.

  • תחביר cachePoint ב-Converse API אחיד עבור משפחות מודלים שונות דוגמת Claude ו-Amazon Nova.

  • בידוד דיירים במערכות מרובות משתמשים מתבצע באמצעות תחילית גיבוב SHA-256 בתוספת תקורה של כ-16 טוקנים.

אופטימיזציית עלויות וזמני תגובה עם Prompt Caching ב-Bedrock

  • שמירת פרומפטים במטמון ב-Amazon Bedrock יכולה להפחית עד 90% מעלויות טוקני הקלט בפגיעות במטמון ולקצר...
  • מודלי Anthropic Claude Sonnet 4.5 ו-4.6 דורשים סף מינימלי של 1,024 טוקנים להפעלת המטמון, בעוד...
  • תחביר cachePoint ב-Converse API אחיד עבור משפחות מודלים שונות דוגמת Claude ו-Amazon Nova.
  • בידוד דיירים במערכות מרובות משתמשים מתבצע באמצעות תחילית גיבוב SHA-256 בתוספת תקורה של כ-16 טוקנים.

בפוסט שפורסם על ידי דניאל אביב (Daniel Abib), ארכיטקט פתרונות מומחה לתחום ה-Generative AI ב-AWS, מוסבר כיצד שימוש במנגנון ה-Prompt Caching ב-Amazon Bedrock מאפשר להפחית את עלויות טוקני הקלט בעד 90 אחוזים כאשר שולחים שוב ושוב את אותו הקשר למודלי תשתית, וכן לצמצם את זמן התגובה לטוקן הראשון (TTFT). לפי הפוסט, ללא שמירה במטמון, שליחת חוזה באורך 10,000 טוקנים יחד עם 50 שאלות שונות מביאה לחיוב של 500,000 טוקני קלט במחיר מלא עבור תוכן שהמודל כבר עיבד.

המחבר מציין כי דרכים חלופיות להתמודדות עם עלויות כוללות קיצור פרומפטים (שעלול לפגוע באיכות ההקשר), הקטנת חלונות הקשר (הפוגעת ביכולת המודל להסיק מסקנות ממידע מלא), ושמירת תשובות במטמון (Response Caching), אשר אינה מועילה כאשר אותו הקשר משמש לשאלות שונות. שמירת פרומפטים ברמת התשתית מאפשרת למודל לקרוא טוקנים שמורים במקום לעבד אותם מחדש, מבלי לשנות את המודל או את איכות הפרומפט.

כיצד פועל מנגנון ה-Prompt Caching ותמחורו

כאשר בקשה ל-Converse API כוללת סמן מסוג cachePoint, שירות Amazon Bedrock בודק האם התוכן שקודם לסמן תואם לרשומת מטמון קיימת. במקרה של פגיעה במטמון (cache hit), המודל מדלג על עיבוד מחדש ומתחיל ביצירת הפלט ממצב שמור. במקרה של החמצה (cache miss), המודל מעבד את מלוא התוכן וכותב את התוצאה למטמון עבור בקשות עתידיות.

ארבעה עקרונות מגדירים את התנהגות המטמון:

  1. היקף המטמון (Cache scope): הרשומות מוגבלות לחשבון AWS ולאזור (AWS Region) ספציפיים.
  2. ספי טוקנים מינימליים: כל נקודת בדיקה חייבת לעמוד בסף מינימלי להפעלת המטמון. למשל, Anthropic Claude Sonnet 4.5 ו-Sonnet 4.6 דורשים לפחות 1,024 טוקנים לנקודת בדיקה, בעוד מודלי Opus דורשים לפחות 4,096 טוקנים.
  3. זמן חיים (TTL): רשומות פגות לפי ה-TTL המוגדר בבקשה. ברירת המחדל היא 5 דקות, כאשר מודלים מסוימים תומכים בעד שעה אחת.
  4. תחביר בלתי תלוי במודל: תחביר ה-cachePoint ב-Converse API זהה בכל משפחות המודלים הנתמכות, כולל Anthropic Claude ו-Amazon Nova.

מבחינת תמחור, נוספות שתי קטגוריות טוקנים:

  • cacheWriteInputTokens: טוקנים שנכתבים למטמון בבקשה הראשונה, בעלות הגבוהה ב-25 אחוזים מטוקן קלט רגיל. בעת שימוש ב-TTL של שעה אחת, העלות גבוהה ב-100 אחוזים (פי שניים) מקלט רגיל.
  • cacheReadInputTokens: טוקנים שנקראים מהמטמון בבקשות עוקבות, בעלות הנמוכה ב-90 אחוזים מטוקן קלט רגיל.

עבור עומסי עבודה עם הקשר חוזר, החיסכון הכולל בעלויות טוקני הקלט מגיע לכ-75 אחוזים (למשל, מסמך של 10,000 טוקנים עם 10 שאלות שונות בתוך חלון ה-TTL).

תרחישי שימוש ב-Converse API

הפוסט מציג שישה תרחישי יישום מעשיים בקוד Python באמצעות Converse API:

  1. שמירת תוכן הודעות ומסמכים ארוכים: הצבת סמן cachePoint לאחר תוכן המסמך הסטטי ולפני השאלה הדינמית. בתרחישי RAG או ניתוח קוד, שירות Amazon Bedrock שומר את המסמך במטמון בקריאה הראשונה ועשוי לעשות בו שימוש חוזר בקריאות עוקבות. במודלי Claude נתמך ניהול מטמון מפושט שבו סמן יחיד בודק התאמות עד כ-20 מקטעי תוכן קודמים.
  2. שמירת פרומפט מערכת (System Prompt): הגדרות אישיות, הנחיות מפורטות ומאגרי ידע המוטמעים בפרומפט המערכת נשמרים באמצעות הצבת cachePoint בתוך פרמטר ה-system, בנפרד מהודעות המשתמש.
  3. שמירת הגדרות כלים (Tool Definitions): ביישומים מבוססי סוכנים (Agentic workflows), סכמות JSON רבות של כלים עשויות לכלול אלפי טוקנים. הוספת cachePoint בסוף מערך הכלים ב-toolConfig מאפשרת שימוש חוזר ללא עיבוד מחדש בכל סיבוב שיחה.
  4. שילוב זמני חיים שונים (Mixed TTL): הקצאת זמני תפוגה שונים לשכבות תוכן שונות באותה בקשה — למשל שעה אחת לחומרי ייחוס והגדרות כלים, ו-5 דקות להקשר שיחה רגעי. הממשק מחייב סדר שבו זמני TTL ארוכים יותר מופיעים לפני זמני TTL קצרים יותר.
  5. בידוד דיירים במערכות Multi-Tenant: כדי למנוע קריאת מטמון בין דיירים שונים באותו חשבון ואזור AWS, מוצמדת תחילית גיבוב SHA-256 של מזהה הדייר לתוכן השמור. פעולה זו יוצרת רשומת מטמון נפרדת לכל דייר בתוספת תקורה של כ-16 טוקנים בלבד (64 תווים).
  6. אינטגרציה עם LangChain: שימוש במחלקה ChatBedrockConverse ובפונקציה create_cache_point ליצירת נקודות מטמון ישירות במבני הודעות או בתוך תבניות ChatPromptTemplate ושרשראות LCEL.

השוואה בין Converse API ל-InvokeModel API והמלצות יישום

המחבר משווה בין הממשקים ומציין כי בעוד שב-Converse API התחביר אחיד לכל המודלים, סמן המטמון מוצב כמקטע עצמאי ונתמך פירוט cacheDetails בתגובה, ב-InvokeModel API התחביר שונה עבור מודלי Anthropic (שימוש ב-cache_control מסוג ephemeral בתוך מקטע התוכן, ללא פירוט cacheDetails בתגובה). לכן מומלץ להשתמש ב-Converse API ביישומים חדשים.

לסיום, מומלץ לבצע פרופילינג לפרומפטים לזיהוי רכיבים סטטיים, לוודא עמידה בסף הטוקנים הנדרש בכל מודל, לבחור זמני TTL מתאימים, לנטר מדדי מטמון בלוגים, לשלב מנגנוני סינון ובקרה כמו Amazon Bedrock Guardrails, ולשלב שמירה בו-זמנית של הודעות, פרומפט מערכת והגדרות כלים באותה בקשה.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה באמצעות מערכת בליווי בינה מלאכותית לתרגום, סיכום ובקרות איכות אוטומטיות מתוך פרסום מקורי של AWS Machine Learning. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

קבלו עדכוני AI שימושיים למייל

תקציר ממוקד ממערכת החדשות שלנו.

עוד מ־AWS Machine Learning

כל הכתבות מ־AWS Machine Learning
Amazon Quick זמין כעת באופן כללי למחשב השולחני
מוצר חדש
4 דקות
מ־AWS Machine Learning

Amazon Quick זמין כעת באופן כללי למחשב השולחני

אפליקציית הדסקטופ של Amazon Quick זמינה כעת באופן כללי למשתמשי macOS ו-Windows, ובמקביל נוסף פיד פעילות למובייל ב-iOS וב-Android. המערכת מרכזת נתונים מדואר אלקטרוני, מיומן פגישות, ממערכות CRM ומהודעות לתצוגה מתועדפת אחת, כאשר סוכני AI מטפלים במשימות שגרתיות ברקע. Quick פועל על גבי תשתיות AWS ושומר על נתוני הארגון בסביבתו המקומית, כולל תמיכה במעקב ביקורת דרך CloudWatch ו-CloudTrail והסמכות תאימות דוגמת HIPAA, FedRAMP, SOC 2 ו-ISO 27001. לקוחות בארגונים כמו Southwest Airlines, LabCorp ו-PGA TOUR משתמשים בכלי להשלמת משימות, סינתזת מידע ופיתוח אבות-טיפוס.

קרא עוד
אחזור סוכני ארגוני ב-Amazon Bedrock עם ניטור והערכה מלאים
חדשות
4 דקות
מ־AWS Machine Learning

אחזור סוכני ארגוני ב-Amazon Bedrock עם ניטור והערכה מלאים

פוסט טכני של מהנדסי AWS מציג ארכיטקטורה לאחזור מידע מבוסס סוכנים (Enterprise Agentic Retrieval) ב-Amazon Bedrock, המשלבת בסיסי ידע מנוהלים (Managed Knowledge Bases) ו-AgentCore. המערכת כוללת ניתוב סמנטי בין בסיסי ידע שונים, אחזור איטרטיבי באמצעות API ייעודי (AgenticRetrieveStream), שבע שכבות של ניטור ועקבות ב-CloudWatch וב-X-Ray, ומנגנוני הערכת איכות לפי דרישה ובאופן רציף. כלל הרכיבים נפרסים באופן אוטומטי באמצעות שרשרת של ארבע מחסניות AWS CloudFormation.

קרא עוד
חיבור Amazon Quick ו-fal לבניית תהליכי עבודה יצירתיים עם סוכנים
מדריך
4 דקות
מ־AWS Machine Learning

חיבור Amazon Quick ו-fal לבניית תהליכי עבודה יצירתיים עם סוכנים

פוסט טכני מאת מומחי AWS מציג מסגרת עבודה מבוססת סוכנים המשלבת בין מרחב העבודה Amazon Quick לבין פלטפורמת המדיה הגנרטיבית fal באמצעות תקן Model Context Protocol (MCP). השילוב מאפשר לצוותי קריאייטיב לתזמר תהליכי הפקה מורכבים תחת סביבה אחידה, תוך שמירה על הקשר בין השלבים ושילוב שערי אישור אנושיים. הפוסט מדגים את המערך באמצעות שני תהליכי עבודה מעשיים: הפקת סטוריבורד בן שמונה פריימים עם מודל FLUX.1 Kontext ושמירתו כ-Skill לשימוש חוזר, ויצירת אב-טיפוס לקליפ מוזיקלי הכולל בדיקת סנכרון שפתיים (lip-sync). בנוסף, מפורטים שלבי ההגדרה ושיקולים תפעוליים כגון אבטחת מפתחות API וניהול עלויות.

קרא עוד
Amazon OpenSearch Service מציגה תמיכה ביישומי MCP
מוצר חדש
4 דקות
מ־AWS Machine Learning

Amazon OpenSearch Service מציגה תמיכה ביישומי MCP

לפי פרסום של שירות Amazon OpenSearch Service, השירות תומך כעת ביישומי MCP (או MCP Apps). יכולת זו מרחיבה את פרוטוקול Model Context Protocol ומאפשרת לסוכני AI להחזיר תגובה כפולה: סיכום טקסטואלי מובנה לצד ויזואליזציות אינטראקטיביות, כגון מפל עקבות ומפות שירותים, המוצגות ישירות בחלון השיחה בסביבת הפיתוח. הוויזואליזציות מופקות באמצעות הרצת קוד שרת מול מקורות הנתונים המחוברים של OpenSearch, ומספקות תוצאות דטרמיניסטיות ללא צורך ביציאה מה-IDE או בפתיחת דפדפן נפרד לאימות.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
15 דרכים לשימוש בסוכני AI לניהול רשתות חברתיות לפי Salesforce
מדריך
4 דקות
מ־Salesforce Blog

15 דרכים לשימוש בסוכני AI לניהול רשתות חברתיות לפי Salesforce

מדריך של חברת Salesforce מפרט 15 דרכים שבהן סוכני בינה מלאכותית לרשתות חברתיות מסייעים לעסקים קטנים ובינוניים. הכלים האוטונומיים מאפשרים יצירת תוכן בקול המותג, תזמון פוסטים בזמנים מותאמים אישית, מענה אוטומטי לשאלות נפוצות 24/7, ניתוב פניות מורכבות לנציגים אנושיים, ניטור אזכורים וסנטימנט, וחיבור מעורבות ישירות למערכות ה-CRM לצורך יצירת לידים. בנוסף מובאת דוגמת חברת reMarkable, שטיפלה ביותר מ-18,000 שיחות שירות באמצעות סוכני AI.

קרא עוד
חיבור Amazon Quick ו-fal לבניית תהליכי עבודה יצירתיים עם סוכנים
מדריך
4 דקות
מ־AWS Machine Learning

חיבור Amazon Quick ו-fal לבניית תהליכי עבודה יצירתיים עם סוכנים

פוסט טכני מאת מומחי AWS מציג מסגרת עבודה מבוססת סוכנים המשלבת בין מרחב העבודה Amazon Quick לבין פלטפורמת המדיה הגנרטיבית fal באמצעות תקן Model Context Protocol (MCP). השילוב מאפשר לצוותי קריאייטיב לתזמר תהליכי הפקה מורכבים תחת סביבה אחידה, תוך שמירה על הקשר בין השלבים ושילוב שערי אישור אנושיים. הפוסט מדגים את המערך באמצעות שני תהליכי עבודה מעשיים: הפקת סטוריבורד בן שמונה פריימים עם מודל FLUX.1 Kontext ושמירתו כ-Skill לשימוש חוזר, ויצירת אב-טיפוס לקליפ מוזיקלי הכולל בדיקת סנכרון שפתיים (lip-sync). בנוסף, מפורטים שלבי ההגדרה ושיקולים תפעוליים כגון אבטחת מפתחות API וניהול עלויות.

קרא עוד
מדריך Salesforce: כיצד להרחיב צוות מכירות ברבעון אחד
מדריך
4 דקות
מ־Salesforce Blog

מדריך Salesforce: כיצד להרחיב צוות מכירות ברבעון אחד

מדריך של Salesforce מציג תוכנית רבעונית להרחבת צוות מכירות ללא שחיקה, באמצעות הגדרת תהליך מכירות ברור, אוטומציה של מעקבים ושימוש בבינה מלאכותית. לפי המדריך, 76% מעסקי ה-SMB פועלים מתצוגת CRM משותפת, ו-88% כבר משתמשים ב-AI לניהול לידים ותובנות עסקה. המדריך מפרט צעדים חודשיים הכוללים הגדרת יעדים, קליטת עובדים מבוססת מערכת והדרכה שוטפת.

קרא עוד
בניית מערכת ניהול ידע מבוססת אווטאר ו-AI בענן AWS
מדריך
4 דקות
מ־AWS Machine Learning

בניית מערכת ניהול ידע מבוססת אווטאר ו-AI בענן AWS

בפוסט הנדסי של AWS הוצג פתרון מבוסס ענן לשימור ידע ארגוני, המשלב אווטאר אינטראקטיבי המופעל בדיבור וטקסט עם ארכיטקטורת RAG מנוהלת. המערכת עושה שימוש ב-Amazon Bedrock Knowledge Bases, ב-Amazon S3, במאגר וקטורים של OpenSearch Serverless, ובמנגנון מטמון דו-שכבתי הכולל את DynamoDB. הפתרון מאפשר לעובדים לגשת לנהלים ומדיניות בשפה טבעית, ומסייע לארגונים לשמר מומחיות לפני פרישת עובדים ותיקים. המערכת ניתנת לפריסה מהירה באמצעות CloudFormation, ומציגה הפחתה בעלויות הסקת מודלי בינה מלאכותית בזכות שימוש במטמון חכם לשאלות חוזרות.

קרא עוד