בעידן הדיגיטלי שבו מאגרי נתונים רפואיים מכילים כמויות עצומות של מידע, מערכות טקסט-ל-SQL מאפשרות למשתמשים ללא ידע SQL לבצע שאילתות בשפה טבעית. אולם, נטייתן של המערכות הללו לייצר קוד SQL שנראה תקין עבור שאלות עמומות, מחוץ להיקף או ללא תשובה יוצרת סיכון מוסתר ומסוכן, במיוחד בתחום הרפואי שבו דיוק הוא חובה. חוקרים מציגים כעת את Query Carefully – צינור עיבוד חדשני המשלב יצירת SQL מבוססת מודלי שפה גדולים (LLM) עם זיהוי מפורש של קלטים בלתי פתירים.
המערכת בנויה על רכיב OncoMX ממאגר ScienceBenchmark ומציגה את OncoMX-NAQ, קבוצת 80 שאלות ללא תשובה המכסה 8 קטגוריות: שאלות שאינן SQL, מחוץ לסכמה או לתחום, וסוגי עמימות שונים. Query Carefully משתמשת במודל llama3.3:70b עם הנחיות מודעות לסכמה, כללי No-Answer Rules (NAR) מפורשים, ודוגמאות few-shot משאלות עם ובלי תשובה. תהליך זה מבטיח שהמערכת לא רק מייצרת SQL אלא גם מזהה מתי להימנע מכך.
בבדיקות על חלק הפיתוח של OncoMX, שימוש בדוגמאות few-shot משאלות פתירות שיפר את דיוק התוצאות, והוספת דוגמאות ללא תשובה לא פגעה בביצועים. על OncoMX-NAQ, הנחיות מאוזנות השיגו דיוק גבוה ביותר בזיהוי שאלות ללא תשובה (0.8). התוצאות מושלמות כמעט בקטגוריות מובנות מבחינה מבנית כמו שאלות שאינן SQL, חוסר עמודות או מחוץ לתחום, אך מאתגרות יותר בשאלות עם ערכים חסרים (0.5) ועמימות עמודות (0.3).
המשמעות של Query Carefully גדולה במיוחד בתחומים רפואיים כמו אונקולוגיה, שבהם שגיאה בשאילתה עלולה להוביל להחלטות שגויות. המערכת מציעה אלטרנטיבה בטוחה יותר למערכות קיימות, ומדגישה את הצורך באיזון בין נוחות לדיוק. בישראל, שבה חברות כמו טבע וסטארט-אפים רפואיים משתמשים במאגרי נתונים גדולים, פתרון כזה יכול לשפר תהליכי ניתוח נתונים.
לסיום, Query Carefully כוללת ממשק משתמש קל משקל שמציג את ה-SQL הזמני, תוצאות הביצוע והימנעותים, ומבטיח שקיפות ואמינות. מנהלי עסקים בתחום הבריאות צריכים לשקול אימוץ גישות כאלה כדי למנוע סיכונים. מה תהיה ההשפעה על כלי AI הבאים?