← penux.uk Review (EN) — 9-Model Comparison ניתוח משני · מאגרים ציבוריים · 2026
מאמר סקירה וניתוח חקרני · למידת מכונה רפואית · מאגרי נתונים ציבוריים

PenuX-AP-Severity: ניתוח משני של מאגרי דלקת לבלב חריפה ציבוריים באמצעות מודלי GBDT לחיזוי מוקדם של SAP

ללא ולידציה קלינית — ניתוח חקרני בלבד
📅 יולי 2026 🔬 קבוצת המחקר PenuX 📊 מאגרים ציבוריים: multiml (n=1,289) · lnn (n=722)

תקציר

רקע: דלקת לבלב חריפה חמורה — Severe Acute Pancreatitis, או SAP — היא מצב רפואי בעל סיכון משמעותי לסיבוכים, כשל איברים ותמותה. זיהוי מוקדם של מטופלים בסיכון גבוה הוא אתגר קליני מרכזי. כלי ניקוד מסורתיים כגון Ranson, BISAP ו־APACHE II מסייעים בהערכת חומרה, אך חלקם דורשים נתונים לאורך 24–48 שעות ואינם תמיד מותאמים לשילוב אוטומטי במערכות מידע רפואיות.

מטרה: לבחון באופן חקרני את התאמתם של מודלי Gradient-Boosted Decision Trees — ובפרט XGBoost, LightGBM ו־CatBoost — לחיזוי מוקדם של SAP על בסיס מאגרי נתונים ציבוריים של דלקת לבלב חריפה.

שיטות: בוצע ניתוח משני של שני מאגרי נתונים ציבוריים שמקורם המדווח הוא Second Affiliated Hospital of Guilin Medical University. המאגר הראשון כלל 1,289 מטופלים, מהם 204 מקרי SAP, והמאגר השני כלל 722 מטופלים, מהם 137 מקרי SAP. לאחר הסרת מזהים ישירים, אומנו מודלי GBDT ונבדקו ביצועים באמצעות תחזיות out-of-fold. בנוסף, בוצע סינון חקרני לפי p_max_gbdt, כלומר ההסתברות הגבוהה ביותר מבין שלושת מודלי GBDT, תוך כיול הסף ליעד רגישות של לפחות 98%.

תוצאות: במאגר multiml, מודל XGBoost השיג AUC של 0.8471. במאגר lnn, שלושת מודלי GBDT השיגו AUC קרוב ל־0.88. כיול סף לפי יעד רגישות ≥98% אפשר להסיר כ־36% מהמקרים בעלי סיכון נמוך יחסית, תוך החמצת 4 מתוך 204 מקרי SAP במאגר multiml ו־2 מתוך 137 מקרי SAP במאגר lnn.

מסקנות: מודלי GBDT מציגים פוטנציאל מחקרי לניתוח נתונים טבלאיים של דלקת לבלב חריפה. עם זאת, מדובר בניתוח חקרני בלבד על מאגרים ציבוריים, ללא ולידציה חיצונית, ללא מחקר פרוספקטיבי וללא אישור קליני. אין להשתמש במודלים או בספי הסינון לצורך החלטות רפואיות.

1. מבוא

דלקת לבלב חריפה היא מחלה דלקתית של הלבלב, הנעה בין מחלה קלה וחולפת לבין מחלה חמורה עם כשל איברים, נמק לבלבי וסיבוכים סיסטמיים. במקרים חמורים, זיהוי מוקדם של המטופלים בסיכון הוא קריטי לצורך ניטור, טיפול נוזלים, העברה לטיפול נמרץ, הדמיה, אנטיביוטיקה במקרים מתאימים, ומעקב אחר סיבוכים.

בפרקטיקה הקלינית קיימים מספר כלי ניקוד להערכת חומרת דלקת לבלב חריפה, ובהם Ranson, BISAP, APACHE II, Glasgow/Imrie ו־CT Severity Index. כלים אלו חשובים, אך לחלקם מגבלות: חלקם דורשים מדידות חוזרות לאחר 24–48 שעות, חלקם אינם מותאמים לעיבוד אוטומטי בזמן אמת, וחלקם תלויים במידע שאינו תמיד זמין בזמן הקבלה.

התפתחות התיקים הרפואיים הממוחשבים, זמינות בדיקות מעבדה דיגיטליות ויכולת להריץ מודלי למידת מכונה מאפשרות לבחון גישה משלימה: חיזוי מוקדם של SAP על בסיס נתונים טבלאיים זמינים.

הפרויקט PenuX-AP-Severity בוחן כיוון זה כאב־טיפוס מחקרי בלבד.

2. הצהרת סטטוס ושימוש

PenuX-AP-Severity הוא פרויקט מחקרי ומתודולוגי. המערכת אינה מאושרת לשימוש קליני, אינה כלי אבחוני, אינה כלי טריאז׳ מאושר, ואינה מחליפה שיקול דעת רפואי.

הניתוח במאמר זה מבוסס על מאגרי נתונים ציבוריים. הנתונים לא נאספו על ידי מחברי PenuX, לא התקבלו ישירות מבית חולים במסגרת שיתוף פעולה קליני של PenuX, ולא נאספו במסגרת מחקר פרוספקטיבי של הפרויקט.

לפיכך, כל התוצאות המוצגות במאמר זה הן תוצאות חקרניות של ניתוח משני בלבד. אין לראות בהן ולידציה קלינית, הוכחה לבטיחות, או ראיה לביצועים בסביבת בית חולים אמיתית.

3. מקורות הנתונים

הניתוח מבוסס על שני מאגרי נתונים ציבוריים בתחום חיזוי חומרת דלקת לבלב חריפה. בשני המאגרים הוסרו מזהים ישירים לפני השימוש במסגרת PenuX.

קובץ בפרויקטמקור ציבורירישיוןשניםמטופליםSAPמאפיינים
ap_multiml_sanitized.csvlongshike/Predicting-acute-pancreatitis-severity-with-multi-machine-learning-modelsMIT2016–20241,289204 (15.8%)60
ap_lnn_sanitized.csvlongshike/LNN-for-SAP-PredictionApache-2.02020–2024722137 (19.0%)107

במסגרת הניתוח, התווית נורמלה כך ש־ 1 = SAP, 0 = non-SAP. יש לציין שבקבצי מקור מסוימים כיוון התווית הגולמית עשוי להיות הפוך, ולכן יש לוודא תמיד התאמה בין הקוד, הטבלאות וההגדרה הקלינית.

4. הכנת הנתונים

לפני הרצת המודלים בוצעו שלבי הכנה: הסרת מזהים ישירים (שם, מספר מזהה, מספר סידורי), הגדרת עמודת יעד אחידה, טיפול בערכים חסרים, שמירת גרסה מסוננת בתיקיית data/public_sanitized, הרצת מודלי baseline ו־GBDT, והפקת תחזיות out-of-fold להערכת ביצועים פנימית.

python scripts/run_baseline.py \ --data data/public_sanitized/ap_lnn_sanitized.csv \ --target-column "严重程度" \ --outdir outputs/lnn

5. מודלים

במאמר זה הודגשו שלושה מודלי GBDT:

מודלתיאוריתרון עיקרי
XGBoostGradient boosting עם רגולריזציהביצועים חזקים בנתונים טבלאיים
LightGBMGradient boosting בצמיחה לפי עליםאימון מהיר ויעיל
CatBoostBoosting עם ordered boostingעמידות יחסית להטיות מסוימות והתאמת יתר

מודלי GBDT מתאימים במיוחד לנתונים טבלאיים רפואיים, משום שהם אינם מניחים סדר זמן מלאכותי בין המשתנים. זאת בניגוד למודלים רצפיים כגון LSTM, המתאימים יותר למדידות סדרתיות לאורך זמן.

6. תוצאות GBDT — סף F1 מיטבי

הטבלה הבאה מציגה את ביצועי מודלי GBDT על שני המאגרים, לפי סף שנבחר למקסום F1 במסגרת הניתוח החקרני.

מאגרמודלAUCAUPRCF1רגישותסגוליותPPVNPV
multimlXGBoost0.84710.57180.558459.8%89.8%52.4%92.2%
multimlCatBoost0.84020.53540.547061.3%88.2%49.4%92.4%
multimlLightGBM0.83860.56880.540154.4%91.2%53.6%91.4%
lnnXGBoost0.88050.66160.633770.1%88.0%57.8%92.6%
lnnCatBoost0.88010.65800.622167.9%88.2%57.4%92.1%
lnnLightGBM0.87950.67320.633369.3%88.4%58.3%92.5%

במאגר multiml, XGBoost השיג את ה־AUC הגבוה ביותר: 0.8471. במאגר lnn, שלושת המודלים היו דומים מאוד, עם AUC סביב 0.88. עם זאת, סף F1 מיטבי אינו בהכרח מתאים לשימוש רפואי, משום שבתרחיש של סינון מוקדם של SAP חשוב יותר לצמצם false negatives.

7. סינון לפי יעד רגישות ≥98%

לאחר בחינת הסף הקבוע P≥0.30, נמצא כי הוא מחמיץ שיעור גבוה מדי של מקרי SAP. לכן בוצע כיול סף לפי יעד רגישות של לפחות 98%.

p_max_gbdt = max(P_XGBoost, P_LightGBM, P_CatBoost) # כלל הסינון: נשאר מקרה אם p_max_gbdt >= threshold מוסר מקרה אם p_max_gbdt < threshold

8. תוצאות סינון לפי יעד רגישות ≥98%

מאגרסף p_max_gbdtרגישות שהושגההוסרוSAP שהוחמצוNPV בקבוצת ההסרה
multiml0.1414998.04%468/1,289 (36.3%)4/20499.15%
lnn0.0975198.54%261/722 (36.1%)2/13799.23%

כלומר, לאחר כיול הסף ליעד רגישות גבוה, ניתן היה להסיר כ־36% מהמקרים כבעלי סיכון נמוך יחסית, תוך החמצת מספר קטן יחסית של מקרי SAP. עם זאת, גם החמצה של 4 מקרי SAP או 2 מקרי SAP עשויה להיות בלתי קבילה קלינית, תלוי בהקשר. לכן אין לפרש את הסף ככלל שלילה קליני.

9. סף אחיד לשני המאגרים

כאופציה שמרנית יותר, נבחן סף אחיד לשני המאגרים: p_max_gbdt ≥ 0.09751

כלל אחידרגישותהוסרוSAP שהוחמצוNPV
p_max_gbdt ≥ 0.0975198.24%598/2,011 (29.7%)6/34199.00%

סף אחיד מאפשר ניסוח פשוט יותר, אך מסיר פחות מקרים. יתרונו הוא שמרנות גבוהה יותר כאשר משלבים מאגרים שונים.

10. פרשנות קלינית זהירה

התוצאות מצביעות על כך שמודלי GBDT מסוגלים לזהות דפוסים הקשורים ל־SAP במאגרים הציבוריים שנבדקו. עם זאת, אין להסיק מכך שהמודלים מתאימים לשימוש קליני, מהסיבות הבאות:

  1. הנתונים מקורם במאגרים ציבוריים ולא במחקר פרוספקטיבי של PenuX.
  2. שני המאגרים מדווחים על מקור ממוסד יחיד.
  3. לא בוצעה ולידציה חיצונית על בית חולים אחר.
  4. לא נבדקה התאמה לאוכלוסייה ישראלית או מערבית.
  5. לא נבדקה השפעה על החלטות רופאים.
  6. לא נבדקו תוצאים קליניים.
  7. לא בוצע אישור רגולטורי.
  8. אפילו בסף רגישות ≥98% עדיין הוחמצו מקרי SAP.
"סף p_max_gbdt מכויל ליעד רגישות ≥98% הגדיר תת־קבוצה בעלת סיכון נמוך יחסית במסגרת ניתוח חקרני פנימי, אך אינו מתאים ככלל שלילה קליני ללא ולידציה חיצונית ופרוספקטיבית."

11. השוואה בין F1 מיטבי לבין סף רגישות גבוהה

סוג סףמטרהיתרוןחסרון
סף F1 מיטביאיזון בין precision ו־recallטוב להשוואת מודליםעלול להחמיץ יותר מדי מקרי SAP
סף רגישות ≥98%צמצום false negativesמתאים יותר לחשיבה של screeningיוצר יותר false positives ומצריך ולידציה

במחלה שעלולה להיות חמורה, כמו SAP, סף רגישות גבוהה מתאים יותר לשלב של סינון ראשוני. עם זאת, סף כזה חייב להיבדק חיצונית לפני כל שימוש רפואי.

12. חשיבות מאפיינים

במודלי עצים ניתן להפיק חשיבות מאפיינים. בפרויקט PenuX-AP-Severity, מאפיינים בעלי משמעות קלינית אפשרית כוללים בין היתר:

מאפייןמשמעות אפשרית
סידן (Calcium)היפוקלצמיה עשויה להיות קשורה למחלה חמורה
LDHסמן לנזק רקמתי
D-dimerעשוי לשקף הפעלת קרישה או דלקת סיסטמית
לקטט (Lactate)עשוי לשקף היפופרפוזיה או עומס מטבולי
המטוקריט (Hematocrit)עשוי לשקף המוקונצנטרציה
קריאטינין (Creatinine)משקף תפקוד כלייתי
אלבומין (Albumin)עשוי לשקף מצב דלקתי ותזונתי

יש להדגיש כי חשיבות מאפיין במודל אינה הוכחה לסיבתיות. היא מצביעה רק על כך שהמאפיין תרם לתחזית בתוך המאגר המסוים.

13. שילוב עתידי במערכות מידע רפואיות

אחד מכיווני ההמשך של PenuX-AP-Severity הוא בחינת שילוב אפשרי במערכות מידע רפואיות באמצעות תקנים כגון FHIR R4, HL7 v2.x, ORU^R01, FHIR Observation, FHIR RiskAssessment, ומערכות HIS מקומיות כגון Camelion. עם זאת, שילוב כזה הוא כיוון עתידי בלבד. כל אינטגרציה רפואית תדרוש: אישור מוסדי, אישור ועדת הלסינקי / IRB, בדיקת אבטחת מידע, הערכת פרטיות, ולידציה קלינית, ניטור הטיות, ואישור רגולטורי כתוכנה רפואית.

14. פרטיות, אתיקה ורישוי

שני המאגרים שבהם נעשה שימוש פורסמו תחת רישיונות קוד פתוח (MIT ו־Apache-2.0). במסגרת PenuX: הוסרו מזהים ישירים, לא בוצע ניסיון לזיהוי מחדש, לא נשמרו שמות מטופלים או מספרי מזהה ישירים, הנתונים משמשים למחקר בלבד, ואין להפיץ נתונים גולמיים בניגוד לרישיון המקורי או להשתמש במערכת לצורך טיפול רפואי.

15. מגבלות

  1. ניתוח משני בלבד — הנתונים לא נאספו על ידי PenuX.
  2. מאגרים ציבוריים בלבד — לא מדובר במחקר קליני עצמאי.
  3. מקור מוסדי יחיד מדווח — Second Affiliated Hospital of Guilin Medical University.
  4. היעדר ולידציה חיצונית — אין בדיקה על בית חולים אחר.
  5. היעדר מחקר פרוספקטיבי — אין שימוש בזמן אמת.
  6. אי־ודאות לגבי איכות התוויות — תוויות SAP תלויות במאגר המקורי.
  7. חוסר איזון מחלקות — SAP הוא מיעוט בשני המאגרים.
  8. סיכון להתאמת יתר — במיוחד במודלים מורכבים.
  9. NPV תלוי שכיחות — ביצועי סינון ישתנו באוכלוסיות עם שכיחות SAP שונה.
  10. אין אישור רגולטורי — המערכת אינה SaMD מאושרת.

16. כיווני המשך

לפני כל שימוש קליני, יש לבצע שלבים נוספים: בניית פרוטוקול מחקר מסודר, הגשה לוועדת הלסינקי / IRB, איסוף נתונים מקומי דה־מזוהה, בדיקה על אוכלוסייה ישראלית, ולידציה חיצונית, מחקר פרוספקטיבי, השוואה ישירה ל־BISAP/Ranson/APACHE II, כיול ספי החלטה לפי תרחיש קליני, בדיקת calibration, בדיקת subgroup performance, הערכת bias, בדיקת השפעה על החלטות רופאים, ואישור רגולטורי כתוכנה רפואית.

17. מסקנות

PenuX-AP-Severity מציג מסגרת מחקרית לניתוח מאגרי דלקת לבלב חריפה באמצעות מודלי GBDT. בהרצה חקרנית על שני מאגרים ציבוריים, XGBoost, LightGBM ו־CatBoost הציגו ביצועים עקביים, עם AUC של 0.8471 במאגר multiml וכ־0.88 במאגר lnn.

כיול סף לפי יעד רגישות ≥98% אפשר לזהות תת־קבוצה בעלת סיכון נמוך יחסית ולהסיר כ־36% מהמקרים בכל מאגר, תוך החמצת מספר קטן של מקרי SAP. עם זאת, מאחר שגם בסף זה הוחמצו מקרי SAP, אין להשתמש בכלל הסינון ככלל קליני.

התרומה המרכזית של העבודה היא בהצגת pipeline מחקרי, קוד פתוח, ניתוח מודלי GBDT, וסף סינון חקרני המכויל לרגישות גבוהה. השלב הבא הנדרש הוא ולידציה חיצונית ופרוספקטיבית במסגרת מחקר קליני מאושר.

18. הצהרת שימוש
PenuX-AP-Severity הוא אב־טיפוס מחקרי בלבד. אין להשתמש בו לצורך אבחנה, טריאז׳, החלטה על אשפוז, החלטה על שחרור, קביעת טיפול או כל החלטה רפואית אחרת. כל החלטה קלינית חייבת להתבצע על ידי צוות רפואי מוסמך בלבד.

19. מקורות נתונים

  1. Longshike et al. Predicting-acute-pancreatitis-severity-with-multi-machine-learning-models. Original file: data_V7.0-non-normalize.xlsx. License: MIT. Source reported by dataset authors: Second Affiliated Hospital of Guilin Medical University, 2016–2024.
  2. Longshike et al. LNN-for-SAP-Prediction. Original file: zhenglishuju_v1.0.xlsx. License: Apache-2.0. Source reported by dataset authors: Second Affiliated Hospital of Guilin Medical University, 2020–2024.
  3. PenuX Research Group. PenuX-AP-Severity. Review and exploratory secondary analysis page.
20. אזהרה סופית לפרסום באתר
הניתוח המוצג באתר זה מבוסס על מאגרי נתונים ציבוריים בלבד. לא נאספו נתונים קליניים מקוריים על ידי מחברי PenuX, לא בוצעה ולידציה חיצונית, והמערכת אינה מאושרת לשימוש קליני. התוצאות מיועדות למחקר, סקירה והדגמה מתודולוגית בלבד.