בעידן פיתוח התרופות המואץ, יצירת מולקולות שמקיימות מגבלות מספריות מדויקות על פני תכונות פיזיקו-כימיות מרובות היא אתגר מרכזי. דגמי שפה גדולים (LLMs) מבטאים כוח רב, אך מתקשים בשליטה מדויקת רב-מטרות ובחשיבה מספרית ללא מבנה חיצוני ומשוב. כעת מוצגת MolGen – מסגרת דו-שלבית ברמת פרגמנטים, מועשרת בחיפוש, שמשלבת סוכנים מרובים להפקת מולקולות אופטימליות. המחקר, שפורסם ב-arXiv, מדגים שיפורים משמעותיים בתוקף ובדיוק. (72 מילים)
בשלב הראשון של MolGen, מנגנון חשיבה רב-סוכנים מבצע עריכות ברמת פרגמנטים, עוגנות בחיפוש, לייצור אבטיפוס ראשוני באזור ישים. השיטה מתמקדת בעריכות חלקיות של חלקי המולקולה, תוך שימוש במידע מחיפושים רלוונטיים כדי להתקרב לאזור המגבלות הרצויות. גישה זו מאפשרת חשיבה מובנית ומדויקת יותר מאשר שיטות מבוססות LLM טהורות, ומבטיחה מועמדות איכותית להתקדמות. (85 מילים)
בשלב השני, אופטימיזר ברמת פרגמנטים, מאומן עם Group Relative Policy Optimization (GRPO), מבצע השבחות עדינות – עריכה אחת או רב-קפיצות – כדי למזער שגיאות בתכונות לכיוון היעדים, תוך ויסות מורכבות העריכה וסטייה מהאבטיפוס. השימוש בלמידה מחוזקת מאפשר שליטה גמישה ומדויקת, עם פיקוח נקבע וניתן לשחזור. (82 מילים)
המסגרת נשענת על מערך נתונים גדול, שנאסף אוטומטית, הכולל שרשראות חשיבה של עריכות פרגמנטים ודלתות תכונות מודדות. בניגוד לעבודות קודמות, MolGen מנמק טוב יותר על מולקולות דרך פרגמנטים ומאפשרה השבחה נשלטת לכיוון יעדים מספריים. זה רלוונטי במיוחד לחברות ישראליות בפארמה ובביוטק, שמחפשות כלים AI יעילים. (88 מילים)
ניסויים על שני סטים של מגבלות תכונות – QED, LogP ומשקל מולקולרי, ו-HOMO, LUMO – מראים עלייה עקבית בתוקף ובקיום מדויק של יעדים רב-תכונות, עם עליונות על LLM חזקים ואלגוריתמים מבוססי גרפים. עבור מנהלי עסקים, MolGen מבטיחה האצת גילוי תרופות ופיתוח חומרים. מה תכונות התרופה הבאה שלכם? (78 מילים)