בפוסט שפורסם בבלוג של AWS, הוצג פתרון מבוסס ענן בעל מנגנון מטמון חכם, שנועד ללכוד, לתחזק ולהנגיש ידע ארגוני מצטבר באמצעות מערכת אווטאר חכמה המופעלת על גבי שירותי AWS. לפי מחברי הפוסט, ארגונים בתעשיות שונות מתמודדים עם הקושי בשימור ידע ארגוני וניסיון שנצברו לאורך שנים, שלעתים קרובות אובדים כאשר עובדים מרכזיים עוזבים. שיטות תיעוד מסורתיות מתגלות במקרים רבים כבלתי מספקות ומותירות מידע לא מעודכן או לא נגיש.
קהלי היעד ומקרי השימוש במערכת
לפי הפוסט, ארגונים ממגוון תעשיות יכולים להשתמש במערכת כדי לשמר ידע קריטי. בארגוני ייצור, למשל, ניתן ללכוד נהלי ייצור ופרוטוקולי תחזוקה לפני פרישתם של טכנאים מנוסים. בנוסף, מתקני בריאות, חברות שירותים פיננסיים, חברות אנרגיה וסוכנויות ממשלתיות יכולים להתאים את הפתרון לצרכיהם. עובדי ידע יכולים לגשת לנהלים ולמדיניות באמצעות שאילתות בשפה טבעית במקום חיפוש בריבוי מאגרים, ומומחי תוכן או עובדים לקראת פרישה יכולים להעלות תיעוד כדי לשמר את מומחיותם לדורות הבאים.
המערכת ניתנת לפריסה עם גישה דרך דפדפן שולחני למחקר מפורט, אינטראקציה קולית להפעלה ללא שימוש בידיים, ושאילתות טקסטואליות לעיון מהיר בהתאם להקשר התפעולי של כל תעשייה.
ארכיטקטורת הפתרון ומרכיבי הענן
בבסיס הפתרון עומד ממשק מבוסס דפדפן התומך באינטראקציות קוליות וטקסטואליות, ומתחבר למערכת אווטאר הניתנת להגדרה ועובדת עם פתרונות אווטאר של צד שלישי (במימוש זה מבוסס על DeepBrain AI).
מאחורי הקלעים פועלים שירותי AWS הבאים:
- Amazon Cognito מאבטח את ניהול הגישה ובקרת המשתמשים.
- Amazon API Gateway מספק נקודות קצה מנוהלות ומנוטרות לתקשורת בין רכיבי המערכת.
- Amazon Bedrock Knowledge Bases משמש כליבת עיבוד הידע עבור Retrieval Augmented Generation (RAG) מנוהל: המידע המאוחסן ב-Amazon S3 משמש כמקור הנתונים, ו-Bedrock מבצע חלוקה למקטעים (chunking), יצירת וקטורים (embedding) באמצעות המודל Amazon Titan Text Embeddings ושליפה מבוססת מסמכים.
- Amazon OpenSearch Serverless משמש כמאגר וקטורי (vector store) עבור בסיס הידע של Bedrock.
- Amazon DynamoDB מספק שכבת מטמון (cache) לתשובות.
- פונקציות AWS Lambda מתזמרות את זרימת הבקשות והתגובות.
- Amazon Transcribe ממיר קלט קולי לטקסט.
- Amazon Polly ממיר תגובות טקסט לקול טבעי.
- הזרמת הווידאו של האווטאר פועלת מעל WebRTC יחד עם חיבורי WebSocket לשליטה בתגובות.
לגבי עלויות, בפוסט צוין כי מאגר הווקטורים של OpenSearch Serverless מחויב לפי יחידות מחשוב (OCU) עם סף מינימום פעיל קבוע שאינו תלוי בנפח השאילתות, המהווה עלות בסיס קבועה של כמה מאות דולרים בחודש בתצורת ברירת המחדל, ועליה מתווספות עלויות משתנות של מודלי שפה, אותן מנגנון המטמון נועד לצמצם.
שלבי היישום של הפתרון
תהליך ההקמה מתואר בשלושה שלבים עיקריים:
- הקמת תשתית הידע (Knowledge Foundation): מסמכים מועלים למאגר ב-Amazon S3 בפורמטים נתמכים כגון Word, PDF, טקסט פשוט, Markdown או JSON (כאשר Markdown ו-JSON מומלצים לביצועי שליפה מיטביים). ניתן להשתמש אופציונלית בתהליך ETL של AWS Glue להמרת מסמכים מפורמטים אחרים לפני העלאתם.
- פריסת התשתית (Infrastructure Deployment): פריסת תשתית באמצעות תבניות AWS CloudFormation, הכוללת הגדרת Amazon Cognito לאימות משתמשים ובקרת גישה, הגדרת נקודות קצה ב-API Gateway, הקמת מאגרי S3 לאחסון ידע, והטמעת DynamoDB למטמון תגובות.
- אינטגרציית בינה מלאכותית (AI Integration): הגדרת Amazon Bedrock, קישור פונקציות Lambda לתזמור, הגדרת צינור עיבוד האודיו עם Transcribe ו-Polly, וחיבור מערכת האווטאר.
לצורך הפריסה הראשונית נדרשות הרשאות מתאימות ב-AWS IAM עבור כל השירותים המעורבים. מודלי היסוד שבהם נעשה שימוש במימוש הם Amazon Titan Text Embeddings לקידוד מסמכים, וכן Amazon Nova Pro ו-Anthropic Claude 3 Sonnet כמודלים לבחירה ליצירת תשובות. לפי הפוסט, Amazon Bedrock מספק גישה אוטומטית למודלים חסרי שרת בבעלות אמזון, כך ש-Amazon Nova Pro ו-Amazon Titan Text Embeddings זמינים כברירת מחדל ללא הפעלה ידנית; לעומת זאת, מודלי Anthropic Claude אינם מכוסים בגישה אוטומטית בכל האזורים, ולפני הבקשה הראשונה למודל Claude יש להשלים בקשת גישה חד-פעמית למודל בקונסולת Bedrock ולוודא קיום הרשאות מנוי מתאימות ב-AWS Marketplace.
אופטימיזציית ביצועים ומנגנון המטמון
המערכת מיישמת אסטרטגיית מטמון דו-שכבתית:
- מטמון בצד הדפדפן (Browser-side cache) המשתמש באלגוריתם LRU בזיכרון הדפדפן לתשובות מיידיות על שאלות שחוזרות על עצמן.
- מטמון בצד השרת ב-DynamoDB עם זמני תפוגה (TTL) חכמים המותאמים לסוג התוכן: שמירה ארוכה יותר לידע בסיסי, בינונית לנהלים תפעוליים, וקצרה למידע רגיש לזמן.
במימוש הנוכחי התאמת המטמון מתבצעת לפי התאמת טקסט מדויקת של השאילתה. בבדיקות של AWS, עבור עומסי עבודה עם 50 עד 70 אחוז שאלות חוזרות, שיעור הפגיעה במטמון הביא להפחתה בשיעור דומה בעלויות ההסקה המשתנות של מודלי השפה.
עדכון ידע ושיקולי דיוק ומגבלות
לשמירה על עדכניות המערכת, מוגדרות התראות אירועים ב-Amazon S3: הוספה או הסרה של מסמך מפעילה פונקציית Lambda שמאתחלת סנכרון ואינדוקס מחדש ב-Bedrock Knowledge Bases ללא צורך בהתערבות ידנית.
מבחינת דיוק, Bedrock מבסס את התשובות על פסקאות שנשלפו מתוך המסמכים המאומתים של הארגון ומסוגל להחזיר ציטוטי מקור לאימות. עם זאת, בפוסט מודגש כי ביסוס זה מצמצם אך אינו מעלים לחלוטין את הסיכון לתשובות שגויות, ולכן בהחלטות בעלות השלכות כבדות או נגיעה לבטיחות יש להשאיר גורם אנושי בתהליך (human in the loop) ולהתייחס למערכת ככלי תומך החלטה ולא כמקור סמכותי בלעדי.
בנוסף, מדובר בארכיטקטורה התלויה בחיבור ענן רציף, שאינה כוללת יכולת פעולה במצב לא מקוון באב-טיפוס זה, ולכן היא מתאימה לסביבות מקושרות (כגון חדרי הדרכה, מעבדות איכות וחדרי בקרה) ולא לרצפות ייצור מנותקות מרשת. בבדיקות שבוצעו הוערך כי התצורה בברירת המחדל עשויה לתמוך בכ-50 עד 100 משתמשים בו-זמנית, כאשר הנתונים מהווים הערכות אינדיקטיביות בלבד ואינם ערובה, ותלויים באזור (Region), בבחירת המודל, בגודל המסמכים, בשיעור הפגיעה במטמון ובמכסות השירות; הרחבה להיקף ארגוני של מעל 5,000 משתמשים ניתנת להשגה באותה ארכיטקטורה אך דורשת הגדלה יזומה מראש של מכסות השירות.