דמיינו כמות עצומה של מכתבים קליניים ודוחות פתולוגיה, כתובים כטקסט חופשי, מלאים במידע רפואי חשוב שנשאר נעול ולא ניתן לניתוח שיטתי. רופאים עמוסים אינם יכולים לתעד הכל בצורה מובנית, ושיטות ממוחשבות מסורתיות לכריית טקסט רפואי מתקשות להתמודד עם ההקשר הקליני המורכב, או דורשות אימון ייעודי ומייגע לכל משימה. השאלה שעולה היא האם ניתן לרתום את היכולות של מודלי שפה גדולים, המבינים הקשר טבעי כמעט כבני אדם, כדי לחלץ מידע קליני מובנה מתוך טקסט חופשי, בלי לפגוע בפרטיות המטופלים ובלי לדרוש ידע תכנותי מהצוות הרפואי?
מאמר זה מציג כלי בשם LLM-AIx, פתרון תוכנה בקוד פתוח שמריץ מודלי שפה גדולים באופן מקומי בתוך תשתית בית החולים, ומאפשר לכל משתמש להגדיר בעצמו אילו ישויות קליניות לחלץ, ללא צורך באימון מודל מיוחד. הכלי נבחן במספר מקרי בוחן, כולל מכתבים קליניים בדויים של מטופלים עם תסחיף ריאתי לבחינת אנונימיזציה וזיהוי תסמינים, וכמאה דוחות פתולוגיה של חולי סרטן המעי הגס מתוך מאגר TCGA, שמהם נדרש לחלץ את דירוג ה-TNM המורכב. המחברים בדקו גם מודלים מכווננים בגודל קטן יותר לבחינת החיסכון במשאבי מחשוב, והשוו את הביצועים לשיטת חיפוש מילות מפתח מסורתית. כיצד עמד הכלי במשימות הללו, ואילו אתגרים וטעויות אפייניות התגלו בדרך? על כך במאמר המלא.






