סוכרת היא אחת ממחלות הכרוניות הנפוצות והמורכבות ביותר בעולם, עם תת-סוגים שונים וסיבוכים מסוכנים כמו נפרופתיה, רטינופתיה ואירועים קרדיווסקולריים. אבחון מוקדם וניהול נכון של המחלה תלויים ביכולת לזהות דפוסים קליניים מורכבים, ובשנים האחרונות למידת מכונה הופכת לכלי מבטיח למשימה זו. אלא שכדי לפתח ולאמת מודלים כאלה, יש צורך במאגרי מידע עשירים, מגוונים ומבוססי מטופלים אמיתיים, וכאן מתגלה בעיה: מאגרי המידע הקיימים בתחום הסוכרת סובלים ממגבלות משמעותיות, בין אם בהיקף המדדים הקליניים שהם כוללים, בגודל מדגם המטופלים, או בחסר במידע חשוב כמו היסטוריה רפואית וסיבוכים.
המאמר מציג מאגר מידע דו-מודלי חדש, המבוסס על נתונים אמיתיים שנאספו ממחלקת סוכרת ואנדוקרינולוגיה בבית חולים מוביל בסין, הכולל כמעט 6,000 מטופלים ו-190 מאפיינים קליניים מגוונים, מגלוקוז בדם ועד תפקודי כבד וכליות, היסטוריה רפואית, אורח חיים וסיבוכים. כיצד נבנה מאגר כזה, אילו שיקולים הנחו את איסופו ועיבודו, ובאילו דרכים ניתן לאמת את אמינותו ואת התאמתו למחקר עתידי בתחום הסוכרת? המאמר מתאר את תהליך בניית המאגר משלב איסוף הנתונים ועד עיבודם, ואת תהליכי האימות הסטטיסטיים והקליניים שנועדו להבטיח שהמאגר משקף נאמנה מציאות רפואית מגוונת ומורכבת. מאגר זה עשוי לשמש בסיס למחקרים עתידיים באבחון מוקדם, חיזוי סיבוכים וניתוח השוואתי של סוכרת, ולפתוח אפשרויות חדשות לשילוב בין רפואה קלינית ולמידת מכונה.






