רקע: דלקת לבלב חריפה חמורה — Severe Acute Pancreatitis, או SAP — היא מצב רפואי בעל סיכון משמעותי לסיבוכים, כשל איברים ותמותה. זיהוי מוקדם של מטופלים בסיכון גבוה הוא אתגר קליני מרכזי. כלי ניקוד מסורתיים כגון Ranson, BISAP ו־APACHE II מסייעים בהערכת חומרה, אך חלקם דורשים נתונים לאורך 24–48 שעות ואינם תמיד מותאמים לשילוב אוטומטי במערכות מידע רפואיות.
מטרה: לבחון באופן חקרני את התאמתם של מודלי Gradient-Boosted Decision Trees — ובפרט XGBoost, LightGBM ו־CatBoost — לחיזוי מוקדם של SAP על בסיס מאגרי נתונים ציבוריים של דלקת לבלב חריפה.
שיטות: בוצע ניתוח משני של שני מאגרי נתונים ציבוריים שמקורם המדווח הוא Second Affiliated Hospital of Guilin Medical University. המאגר הראשון כלל 1,289 מטופלים, מהם 204 מקרי SAP, והמאגר השני כלל 722 מטופלים, מהם 137 מקרי SAP. לאחר הסרת מזהים ישירים, אומנו מודלי GBDT ונבדקו ביצועים באמצעות תחזיות out-of-fold. בנוסף, בוצע סינון חקרני לפי p_max_gbdt, כלומר ההסתברות הגבוהה ביותר מבין שלושת מודלי GBDT, תוך כיול הסף ליעד רגישות של לפחות 98%.
תוצאות: במאגר multiml, מודל XGBoost השיג AUC של 0.8471. במאגר lnn, שלושת מודלי GBDT השיגו AUC קרוב ל־0.88. כיול סף לפי יעד רגישות ≥98% אפשר להסיר כ־36% מהמקרים בעלי סיכון נמוך יחסית, תוך החמצת 4 מתוך 204 מקרי SAP במאגר multiml ו־2 מתוך 137 מקרי SAP במאגר lnn.
מסקנות: מודלי GBDT מציגים פוטנציאל מחקרי לניתוח נתונים טבלאיים של דלקת לבלב חריפה. עם זאת, מדובר בניתוח חקרני בלבד על מאגרים ציבוריים, ללא ולידציה חיצונית, ללא מחקר פרוספקטיבי וללא אישור קליני. אין להשתמש במודלים או בספי הסינון לצורך החלטות רפואיות.
דלקת לבלב חריפה היא מחלה דלקתית של הלבלב, הנעה בין מחלה קלה וחולפת לבין מחלה חמורה עם כשל איברים, נמק לבלבי וסיבוכים סיסטמיים. במקרים חמורים, זיהוי מוקדם של המטופלים בסיכון הוא קריטי לצורך ניטור, טיפול נוזלים, העברה לטיפול נמרץ, הדמיה, אנטיביוטיקה במקרים מתאימים, ומעקב אחר סיבוכים.
בפרקטיקה הקלינית קיימים מספר כלי ניקוד להערכת חומרת דלקת לבלב חריפה, ובהם Ranson, BISAP, APACHE II, Glasgow/Imrie ו־CT Severity Index. כלים אלו חשובים, אך לחלקם מגבלות: חלקם דורשים מדידות חוזרות לאחר 24–48 שעות, חלקם אינם מותאמים לעיבוד אוטומטי בזמן אמת, וחלקם תלויים במידע שאינו תמיד זמין בזמן הקבלה.
התפתחות התיקים הרפואיים הממוחשבים, זמינות בדיקות מעבדה דיגיטליות ויכולת להריץ מודלי למידת מכונה מאפשרות לבחון גישה משלימה: חיזוי מוקדם של SAP על בסיס נתונים טבלאיים זמינים.
הפרויקט PenuX-AP-Severity בוחן כיוון זה כאב־טיפוס מחקרי בלבד.
PenuX-AP-Severity הוא פרויקט מחקרי ומתודולוגי. המערכת אינה מאושרת לשימוש קליני, אינה כלי אבחוני, אינה כלי טריאז׳ מאושר, ואינה מחליפה שיקול דעת רפואי.
הניתוח במאמר זה מבוסס על מאגרי נתונים ציבוריים. הנתונים לא נאספו על ידי מחברי PenuX, לא התקבלו ישירות מבית חולים במסגרת שיתוף פעולה קליני של PenuX, ולא נאספו במסגרת מחקר פרוספקטיבי של הפרויקט.
לפיכך, כל התוצאות המוצגות במאמר זה הן תוצאות חקרניות של ניתוח משני בלבד. אין לראות בהן ולידציה קלינית, הוכחה לבטיחות, או ראיה לביצועים בסביבת בית חולים אמיתית.
הניתוח מבוסס על שני מאגרי נתונים ציבוריים בתחום חיזוי חומרת דלקת לבלב חריפה. בשני המאגרים הוסרו מזהים ישירים לפני השימוש במסגרת PenuX.
| קובץ בפרויקט | מקור ציבורי | רישיון | שנים | מטופלים | SAP | מאפיינים |
|---|---|---|---|---|---|---|
| ap_multiml_sanitized.csv | longshike/Predicting-acute-pancreatitis-severity-with-multi-machine-learning-models | MIT | 2016–2024 | 1,289 | 204 (15.8%) | 60 |
| ap_lnn_sanitized.csv | longshike/LNN-for-SAP-Prediction | Apache-2.0 | 2020–2024 | 722 | 137 (19.0%) | 107 |
במסגרת הניתוח, התווית נורמלה כך ש־ 1 = SAP, 0 = non-SAP. יש לציין שבקבצי מקור מסוימים כיוון התווית הגולמית עשוי להיות הפוך, ולכן יש לוודא תמיד התאמה בין הקוד, הטבלאות וההגדרה הקלינית.
לפני הרצת המודלים בוצעו שלבי הכנה: הסרת מזהים ישירים (שם, מספר מזהה, מספר סידורי), הגדרת עמודת יעד אחידה, טיפול בערכים חסרים, שמירת גרסה מסוננת בתיקיית data/public_sanitized, הרצת מודלי baseline ו־GBDT, והפקת תחזיות out-of-fold להערכת ביצועים פנימית.
במאמר זה הודגשו שלושה מודלי GBDT:
| מודל | תיאור | יתרון עיקרי |
|---|---|---|
| XGBoost | Gradient boosting עם רגולריזציה | ביצועים חזקים בנתונים טבלאיים |
| LightGBM | Gradient boosting בצמיחה לפי עלים | אימון מהיר ויעיל |
| CatBoost | Boosting עם ordered boosting | עמידות יחסית להטיות מסוימות והתאמת יתר |
מודלי GBDT מתאימים במיוחד לנתונים טבלאיים רפואיים, משום שהם אינם מניחים סדר זמן מלאכותי בין המשתנים. זאת בניגוד למודלים רצפיים כגון LSTM, המתאימים יותר למדידות סדרתיות לאורך זמן.
הטבלה הבאה מציגה את ביצועי מודלי GBDT על שני המאגרים, לפי סף שנבחר למקסום F1 במסגרת הניתוח החקרני.
| מאגר | מודל | AUC | AUPRC | F1 | רגישות | סגוליות | PPV | NPV |
|---|---|---|---|---|---|---|---|---|
| multiml | XGBoost | 0.8471 | 0.5718 | 0.5584 | 59.8% | 89.8% | 52.4% | 92.2% |
| multiml | CatBoost | 0.8402 | 0.5354 | 0.5470 | 61.3% | 88.2% | 49.4% | 92.4% |
| multiml | LightGBM | 0.8386 | 0.5688 | 0.5401 | 54.4% | 91.2% | 53.6% | 91.4% |
| lnn | XGBoost | 0.8805 | 0.6616 | 0.6337 | 70.1% | 88.0% | 57.8% | 92.6% |
| lnn | CatBoost | 0.8801 | 0.6580 | 0.6221 | 67.9% | 88.2% | 57.4% | 92.1% |
| lnn | LightGBM | 0.8795 | 0.6732 | 0.6333 | 69.3% | 88.4% | 58.3% | 92.5% |
במאגר multiml, XGBoost השיג את ה־AUC הגבוה ביותר: 0.8471. במאגר lnn, שלושת המודלים היו דומים מאוד, עם AUC סביב 0.88. עם זאת, סף F1 מיטבי אינו בהכרח מתאים לשימוש רפואי, משום שבתרחיש של סינון מוקדם של SAP חשוב יותר לצמצם false negatives.
לאחר בחינת הסף הקבוע P≥0.30, נמצא כי הוא מחמיץ שיעור גבוה מדי של מקרי SAP. לכן בוצע כיול סף לפי יעד רגישות של לפחות 98%.
| מאגר | סף p_max_gbdt | רגישות שהושגה | הוסרו | SAP שהוחמצו | NPV בקבוצת ההסרה |
|---|---|---|---|---|---|
| multiml | 0.14149 | 98.04% | 468/1,289 (36.3%) | 4/204 | 99.15% |
| lnn | 0.09751 | 98.54% | 261/722 (36.1%) | 2/137 | 99.23% |
כלומר, לאחר כיול הסף ליעד רגישות גבוה, ניתן היה להסיר כ־36% מהמקרים כבעלי סיכון נמוך יחסית, תוך החמצת מספר קטן יחסית של מקרי SAP. עם זאת, גם החמצה של 4 מקרי SAP או 2 מקרי SAP עשויה להיות בלתי קבילה קלינית, תלוי בהקשר. לכן אין לפרש את הסף ככלל שלילה קליני.
כאופציה שמרנית יותר, נבחן סף אחיד לשני המאגרים: p_max_gbdt ≥ 0.09751
| כלל אחיד | רגישות | הוסרו | SAP שהוחמצו | NPV |
|---|---|---|---|---|
| p_max_gbdt ≥ 0.09751 | 98.24% | 598/2,011 (29.7%) | 6/341 | 99.00% |
סף אחיד מאפשר ניסוח פשוט יותר, אך מסיר פחות מקרים. יתרונו הוא שמרנות גבוהה יותר כאשר משלבים מאגרים שונים.
התוצאות מצביעות על כך שמודלי GBDT מסוגלים לזהות דפוסים הקשורים ל־SAP במאגרים הציבוריים שנבדקו. עם זאת, אין להסיק מכך שהמודלים מתאימים לשימוש קליני, מהסיבות הבאות:
| סוג סף | מטרה | יתרון | חסרון |
|---|---|---|---|
| סף F1 מיטבי | איזון בין precision ו־recall | טוב להשוואת מודלים | עלול להחמיץ יותר מדי מקרי SAP |
| סף רגישות ≥98% | צמצום false negatives | מתאים יותר לחשיבה של screening | יוצר יותר false positives ומצריך ולידציה |
במחלה שעלולה להיות חמורה, כמו SAP, סף רגישות גבוהה מתאים יותר לשלב של סינון ראשוני. עם זאת, סף כזה חייב להיבדק חיצונית לפני כל שימוש רפואי.
במודלי עצים ניתן להפיק חשיבות מאפיינים. בפרויקט PenuX-AP-Severity, מאפיינים בעלי משמעות קלינית אפשרית כוללים בין היתר:
| מאפיין | משמעות אפשרית |
|---|---|
| סידן (Calcium) | היפוקלצמיה עשויה להיות קשורה למחלה חמורה |
| LDH | סמן לנזק רקמתי |
| D-dimer | עשוי לשקף הפעלת קרישה או דלקת סיסטמית |
| לקטט (Lactate) | עשוי לשקף היפופרפוזיה או עומס מטבולי |
| המטוקריט (Hematocrit) | עשוי לשקף המוקונצנטרציה |
| קריאטינין (Creatinine) | משקף תפקוד כלייתי |
| אלבומין (Albumin) | עשוי לשקף מצב דלקתי ותזונתי |
יש להדגיש כי חשיבות מאפיין במודל אינה הוכחה לסיבתיות. היא מצביעה רק על כך שהמאפיין תרם לתחזית בתוך המאגר המסוים.
אחד מכיווני ההמשך של PenuX-AP-Severity הוא בחינת שילוב אפשרי במערכות מידע רפואיות באמצעות תקנים כגון FHIR R4, HL7 v2.x, ORU^R01, FHIR Observation, FHIR RiskAssessment, ומערכות HIS מקומיות כגון Camelion. עם זאת, שילוב כזה הוא כיוון עתידי בלבד. כל אינטגרציה רפואית תדרוש: אישור מוסדי, אישור ועדת הלסינקי / IRB, בדיקת אבטחת מידע, הערכת פרטיות, ולידציה קלינית, ניטור הטיות, ואישור רגולטורי כתוכנה רפואית.
שני המאגרים שבהם נעשה שימוש פורסמו תחת רישיונות קוד פתוח (MIT ו־Apache-2.0). במסגרת PenuX: הוסרו מזהים ישירים, לא בוצע ניסיון לזיהוי מחדש, לא נשמרו שמות מטופלים או מספרי מזהה ישירים, הנתונים משמשים למחקר בלבד, ואין להפיץ נתונים גולמיים בניגוד לרישיון המקורי או להשתמש במערכת לצורך טיפול רפואי.
לפני כל שימוש קליני, יש לבצע שלבים נוספים: בניית פרוטוקול מחקר מסודר, הגשה לוועדת הלסינקי / IRB, איסוף נתונים מקומי דה־מזוהה, בדיקה על אוכלוסייה ישראלית, ולידציה חיצונית, מחקר פרוספקטיבי, השוואה ישירה ל־BISAP/Ranson/APACHE II, כיול ספי החלטה לפי תרחיש קליני, בדיקת calibration, בדיקת subgroup performance, הערכת bias, בדיקת השפעה על החלטות רופאים, ואישור רגולטורי כתוכנה רפואית.
PenuX-AP-Severity מציג מסגרת מחקרית לניתוח מאגרי דלקת לבלב חריפה באמצעות מודלי GBDT. בהרצה חקרנית על שני מאגרים ציבוריים, XGBoost, LightGBM ו־CatBoost הציגו ביצועים עקביים, עם AUC של 0.8471 במאגר multiml וכ־0.88 במאגר lnn.
כיול סף לפי יעד רגישות ≥98% אפשר לזהות תת־קבוצה בעלת סיכון נמוך יחסית ולהסיר כ־36% מהמקרים בכל מאגר, תוך החמצת מספר קטן של מקרי SAP. עם זאת, מאחר שגם בסף זה הוחמצו מקרי SAP, אין להשתמש בכלל הסינון ככלל קליני.
התרומה המרכזית של העבודה היא בהצגת pipeline מחקרי, קוד פתוח, ניתוח מודלי GBDT, וסף סינון חקרני המכויל לרגישות גבוהה. השלב הבא הנדרש הוא ולידציה חיצונית ופרוספקטיבית במסגרת מחקר קליני מאושר.