בפוסט שפורסם בבלוג של AWS, הציג מייקל הסייה (Michael Hsieh), ארכיטקט פתרונות GenAI ראשי ב-AWS, אוסף של 38 מיומנויות סוכן (Agent Skills) בקוד פתוח המשתרעות על פני 11 תחומים במדעי החיים ובריאות (HCLS). לפי הפוסט, סוכני AI הבנויים על מודלי תשתית (Foundation Models) שוגים לעיתים קרובות ביישום מסגרות קבלת החלטות בתחום הבריאות, גם כאשר הם נחשפו להנחיות באימון ובפרומפט המערכת. כאשר סוכן מתבקש לסווג מוטציית TP53 missense באמצעות קריטריוני ACMG/AMP, הוא עשוי לצטט את המסגרת הנכונה אך ליישם באופן שגוי קטגוריות ראיות, לדלג על ספי שכיחות באוכלוסייה או להמציא ציוני חיזוי חישוביים. הפער הזה יוצר כשלים שקטים בפענוח וריאנטים, יישוב תביעות, תכנון ניסויים קליניים וניתוח דימות, כאשר הפלטים נראים תקינים אך מיישמים קריטריונים שגויים עם השלכות רגולטוריות ובטיחותיות למטופלים.
סקירת הפתרון ומבנה המיומנויות
המיומנויות באוסף HCLS Agent Skills הן מסמכי Markdown מובנים (SKILL.md) המקודדים תהליכי החלטה לתבנית שסוכני AI יכולים לצרוך בזמן הסקת מסקנות (Inference) באמצעות חשיפה הדרגתית (Progressive Disclosure). לפי תקן ה-Agent Skills הפתוח, כל מיומנות מצהירה על טריגרים, תלויות ומטא-דאטה ב-YAML Frontmatter, ולאחריהם מופיעות מסגרות החלטה, טבלאות פרמטרים, תבניות קוד וקריטריוני אימות. כל 38 המיומנויות משוחררות תחת רישיון MIT-0 ומכסות 11 תחומים, כולל גנומיקה, גילוי תרופות, תפעול תביעות ודימות רפואי.
המיומנויות במאגר מסווגות לשני סוגים:
- מיומנויות הסקה (Reasoning skills): מקודדות מתודולוגיה ומסגרות קבלת החלטות המנחות את אופן החשיבה של הסוכן. לדוגמה, המיומנות genomic-variant-interpretation מקודדת את מלוא מסגרת הסיווג של ACMG/AMP, כולל קטגוריות ראיות, ספי שכיחות באוכלוסייה וספי ניבוי חישוביים.
- מיומנויות צינור (Pipeline skills): מקודדות פקודות ספציפיות לכלים, פרמטרים מאומתים ותבניות קוד המייצרות תוצרים הניתנים להרצה. לדוגמה, המיומנות variant-calling מספקת פקודות GATK4 HaplotypeCaller עם קבוצות אנוטציה נכונות, יעדי רגישות VQSR tranche והגדרות Mutect2 לגידול מול רקמה תקינה.
שלושה מאפיינים מבדילים מיומנויות מגישות אחרות להתמחות תחומית: הן ניתנות לביקורת (Auditable), ניידות (Portable) ופשוטות לתחזוקה. כל קריטריון החלטה קריא לבני אדם בפורמט Markdown ואינו מוסתר במשקולות המודל. מיומנות פועלת ביותר מ-20 שירותים (כולל Amazon Bedrock AgentCore, AWS Strands Agents SDK, Kiro, Amazon Quick Desktop, Claude Code, OpenAI Codex ועוד) ללא התאמה ייעודית לכל שירות. שינויי מדיניות רפואית שנתיים או קריטריוני ניסוי חדשים יכולים להשתקף בעריכת קובץ טקסט, ללא צורך באימון מחדש של המודל.
דרישות קדם ודפוסי פריסה
כדי להשתמש במיומנויות נדרש אחד מהשירותים הנתמכים של AWS (כגון Kiro או Kiro CLI, AWS Strands Agents SDK עם גישה למודלי תשתית ב-Amazon Bedrock, AgentCore harness, או Amazon Quick Desktop) או סוכן קידוד לבחירה (כמו Claude Code או OpenAI Codex), לצד Python 3.10 ומעלה עם כלי הניהול uv, ו-Git לשכפול המאגר. התקנת המיומנויות בלבד מתאפשרת באמצעות הפקודה npx skills add awslabs/hcls-agent-skills.
בפוסט מוצגים שלושה דפוסי פריסה:
- שימוש בסוכן יחיד ב-Amazon Quick Desktop: הסוכן מפעיל מיומנויות רלוונטיות באופן סלקטיבי על בסיס דפוסי טריגר בשאלת המשתמש. לדוגמה, שאלה לגבי השפעת RAF בקידוד קוד E11.9 לעומת E11.42 מפעילה את מיומנות risk-adjustment ומחזירה מיפויי HCC, פתרון היררכיות ושינויי RAF כמותיים במקום הצעה גנרית לעיין בתיעוד.
- ארכיטקטורת ריבוי סוכנים ב-Kiro CLI: טעינת כל 38 המיומנויות לתוך סוכן בודד צורכת כ-80,000 טוקנים, מה שיוצר אתגר הנדסת הקשר (Context Engineering) שבו תוכן לא רלוונטי מתחרה על תשומת הלב. Kiro CLI פותר זאת בעזרת סוכן מתאם קל-משקל (ללא מיומנויות טעונות) שמנתב שאילתות לשמונה סוכנים מומחים תחומיים, כאשר כל מומחה טוען רק את המיומנויות הרלוונטיות לו (כ-15,000 טוקנים למומחה).
- שילוב עם AWS Strands SDK ופריסה ב-Amazon Bedrock AgentCore: ה-SDK מספק טעינת מיומנויות מובנית בקוד Python. סביבת AgentCore מאפשרת להזריק מיומנויות ברמת הסביבה לסוכנים מתארחים ומספקת אירוח מנוהל, הרחבה אוטומטית, גבולות אבטחה ויכולות ניטור ללא ניהול תשתית.
דוגמאות שימוש מעשיות
הפוסט מציג שלוש דוגמאות שימוש מתוך מערך ההערכה:
- הערכת מועמדים לשימוש חוזר בתרופות עבור מחלה פיברוטית נדירה (IPF): חוקרים המעוניינים להעריך תרופות מאושרות המווסתות איתות TGF-β1 דרך TGFBR1. לפני המיומנויות, הסוכן מספק סקירת ספרות כללית ללא קריטריוני דירוג מובנים. לאחר הצטיידות במיומנויות drug-repurposing ו-translational-research, הסוכן מיישם את מסגרת השאילתות של DGIdb, מדרג מועמדים לפי היררכיית ראיות שבה קישור ישיר למטרה גובר על ראיות ברמת מסלול וגובר על אסוציאציה פנוטיפית, ממפה עיכוב TGFBR1 לתהליכים פתולוגיים של IPF, ומעריך יכולת תרגום קליני לפי קריטריוני T0→T1.
- הקמת צינור התאמת סיכונים CMS-HCC בתפעול תביעות בריאות: עבור תוכנית Medicare Advantage עם 12,000 חברים לחישוב ציוני RAF באמצעות מקדמי CMS-HCC Model V28. סוכן ללא מיומנויות מחמיץ פתרון היררכיות או משתמש במקדמי V24 ישנים. עם מיומנויות risk-adjustment ו-claims-billing-rules, הסוכן מייצר שאילתות SQL מותאמות עם הסרת כפילויות, מיישם פתרון היררכיות V28 (לדוגמה HCC 18 גובר על HCC 19, ו-HCC 326 גובר על HCC 327), מבצע פילוח דמוגרפי ומסביר שדילוג על היררכיות מנפח ציונים ומייצר חשיפת ביקורת לפי ביקורות CMS RADV.
- עיבוד מקדים של סריקות MRI משוקללות T1w למחקר דימות: במחקר עם 45 מבוגרים בריאים הדורש הכנה לניתוח מורפומטריה מבוססת ווקסלים (VBM) בסביבת FSL/ANTs. ללא מיומנויות, הסוכן עלול למקם תיקון שדה הטיות (Bias field correction) לאחר הפשטת גולגולת (Skull-stripping), דבר המטה את מסכות המוח. עם מיומנויות radiology-preprocessing ו-imaging-study-design, הסוכן מפרט את סדר הפעולות הנכון ומסביר כי אי-הומוגניות בעוצמה בגבולות המוח גורמת לאלגוריתם להסיר רקמה עודפת או מועטה אם התיקון אינו מבוצע קודם לכן, ומספק סקריפט Bash מלא עם בדיקות שגיאה ובקרת איכות.
תוצאות הערכה אמפיריות
נערכה הערכה השוואתית בין זוגות על פני 410 פרומפטים תחומיים (380 למיומנות בודדת ו-30 רב-תחומיים) בשתי תצורות: Kiro CLI (באמצעות מודל Auto) ו-Strands SDK (עם מודל Claude Sonnet 4.6 ב-Bedrock). שני התנאים קיבלו כלי חשיבה (Think tool), ונבדק סוכן בסיס לעומת סוכן עם גישה לכל 38 המיומנויות בטעינה הדרגתית. מודל Claude Opus 4.7 ב-Amazon Bedrock שימש כשופט LLM בחמישה ממדים: דיוק מדעי, לכידות, רלוונטיות, חשיבה ביקורתית וישימות (Actionability).
הממצאים העיקריים מההערכה:
- שיעור ניצחון כולל: המיומנויות ניצחו ב-69.5% מההשוואות ב-Kiro CLI (גודל אפקט d = 0.39 של כהן) וב-85.9% ב-Strands Agent (גודל אפקט d = 0.97).
- חשיבה ביקורתית: השיפור החזק ביותר נרשם בממד החשיבה הביקורתית, עם שיעור ניצחון של 78.0% ב-Kiro CLI (גודל אפקט d = 0.65) ו-85.1% ב-Strands (גודל אפקט d = 1.03).
- דיוק מדעי: שיעור ניצחון של 69.3% ב-Kiro CLI (גודל אפקט d = 0.34) ו-86.2% ב-Strands (גודל אפקט d = 0.85).
- ישימות: שיעור ניצחון של 68.0% ב-Kiro CLI (גודל אפקט d = 0.37) ו-77.3% ב-Strands (גודל אפקט d = 0.56).
- מתאם לתפקוד הבסיס: נמצא מתאם שלילי של r = -0.59 ב-Kiro CLI ו-r = -0.61 ב-Strands בין איכות תגובת הבסיס לגודל התועלת מהמיומנויות. בפרומפטים שבהם סוכן הבסיס התקשה (ציון נמוך מ-80), המיומנויות השיגו שיעור ניצחון של 87% ב-Kiro (תוספת של 8.7 נקודות) ו-96% ב-Strands (תוספת של 7.9 נקודות).
- צמצום שונות: המיומנויות הפחיתו את סטיית התקן של ציוני התגובות בעד 61.9% ב-Kiro CLI ועד 52.1% ב-Strands. לדוגמה, בתחום הנתונים הקליניים ב-Kiro CLI סטיית התקן ירדה מ-6.8 ל-3.3 (ירידה של 51%), מה שמצביע על עקביות גבוהה יותר בתפוקות.
התאמה אישית והרחבת מיומנויות
המאגר כולל שלושה מדריכים להתאמה ולבניית מיומנויות חדשות:
CUSTOMIZING.md: עוסק בהתאמה, הרחבה ויצירת מיומנויות מאפס, כולל הוספת חוקים ארגוניים ייעודיים כגון קודי LCD או פרוטוקולים פנימיים.SKILL_DESIGN_GUIDE.md: מתעד תבניות מבוססות ראיות לכתיבת מיומנויות יעילות, כולל עצי החלטה, טבלאות ספים, רשימות תקלות נפוצות ומבני תגובה.QUALITY_CHECKLIST.md: רשימת בדיקות איכות לפני מיזוג המכסה Frontmatter, מבנה ואיכות תוכן.
כמו כן, המאגר מספק מסגרת הערכה המאפשרת לייצר 30 פרומפטים לכל מיומנות ולהריץ הערכה השוואתית מקבילית המפיקה לוח מחוונים ב-HTML לבחינת הציונים והתפלגותם. המיומנויות הן קובצי טקסט מקומיים שאינם מייצרים משאבי AWS בעצמם, ולכן אינם דורשים תהליך מחיקה (Teardown) מיוחד בסיום השימוש.