Table of Contents

पिछले दशक में, मशीन लर्निंग नेफ्रोलोजी में एक परिवर्तनकारी उपकरण के रूप में उभरा है, विशेष रूप से मधुमेह रोगियों में दीर्घकालिक गुर्दे की क्षति की भविष्यवाणी के लिए। मधुमेह के साथ दुनिया भर में 537 मिलियन से अधिक वयस्कों को प्रभावित करता है और लगभग 40% पुरानी गुर्दे की बीमारी (CKD) विकसित करता है, सटीक, प्रारंभिक भविष्यवाणी की आवश्यकता कभी भी अधिक तत्काल नहीं रही है। पारंपरिक जोखिम स्तरीकरण - अनुमानित ग्लोमेरुलर निस्पंदन दर (eGFR), मूत्र एलबमिन-टू-क्रिटाइन अनुपात (UACR) की भविष्यवाणी करने से पहले, और रक्तचाप-डिटेट पर्याप्त नेफ्रॉन हानि के बाद नुकसान। मशीन लर्निंग एल्गोरिदम, इसके विपरीत, इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड, जेनोमिक डेटा की लगातार पहचान करने से सैकड़ों चरों को एकीकृत कर सकते हैं।

मधुमेह के रोग में प्रारंभिक भविष्यवाणी के मामले क्यों

मधुमेह सबसे विकसित देशों में अंत-चरण गुर्दे रोग (ESRD) का प्रमुख कारण है। रोग अक्सर चुपचाप प्रगति करता है: रोगियों में सामान्य ईजीएफआर और कुछ वर्षों तक कोई एलबमिन्यूरिया नहीं हो सकता है जबकि अंतर-स्थाई फाइब्रोसिस और ग्लॉमरुलर क्षति जमा हो जाती है। समय तक ईजीएफआर 60 एमएल / मिनट / 1.73 m2 से नीचे गिर जाता है, गुर्दे की कार्यक्षमता का अपरिवर्तनीय नुकसान हुआ है। वर्तमान में अध्ययन करने वाले रोगियों की प्रारंभिक पहचान नैदानिक प्रक्रिया में सुधार करने के लिए, हालांकि, प्रारंभिक जांच प्रक्रिया में 30FR अध्ययन प्रक्रिया को नियंत्रित करने की अनुमति देती है।

कैसे मशीन लर्निंग पारंपरिक मॉडल पर भविष्यवाणी को बढ़ाता है

पारंपरिक सांख्यिकीय तरीकों, जैसे कि लॉजिस्टिक रिग्रेशन और कॉक्स आनुपातिक खतरों के मॉडल, पूर्वानुमानकर्ताओं के बीच रैखिक संबंधों और स्वतंत्रता को मानते हैं। मशीन लर्निंग मॉडल इन सीमाओं को गैर-रेखीय बातचीत पर कब्जा करके, उच्च-आयामी डेटा को संभालने और स्वचालित रूप से जटिल पैटर्न की खोज करके दूर कर सकते हैं। उदाहरण के लिए, एक मशीन लर्निंग मॉडल सीख सकता है कि सिस्टिन सी में एक सूक्ष्म वृद्धि का संयोजन, हीमोग्लोबिन में एक छोटी बूंद, एक उच्च HbA1c परिवर्तनशीलता, और एएसएसआरडी संकेतों का एक पारिवारिक इतिहास गुर्दे की हानि को बाधित करता है, भले ही प्रत्येक व्यक्ति का मूल्य सामान्य रेंज में रहता है।

प्रमुख मॉडल आर्किटेक्चर

  • ]ग्रेडींट बूस्टिंग मशीन (XGBoost, LightGBM, CatBoost) इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से संरचित सारणीबद्ध डेटा हावी है। वे लापता मूल्यों को अच्छी तरह से संभालते हैं, सुविधा महत्व स्कोर प्रदान करते हैं, और अक्सर मधुमेह में CKD की शुरुआत की भविष्यवाणी के लिए 0.85 और 0.92 के बीच अत्याधुनिक AUC मूल्यों को प्राप्त करते हैं।
  • Deep learning neural network[ का उपयोग बिना संरचित डेटा के लिए किया जाता है: convolutional तंत्रिका नेटवर्क (CNNs) गुर्दे बायोप्सी हिस्टोपैथोलॉजी स्लाइड का विश्लेषण करके फाइब्रोसिस और स्केलेरोसिस को मापने के लिए कर सकते हैं; आवर्तक तंत्रिका नेटवर्क (RNs) और ट्रांसफार्मर सीरियल लैब माप से अनुदैर्ध्य ईजीएफआर ट्रेजेक्टरी को मॉडल कर सकते हैं।
  • ]Random अस्तित्व जंगल [ समय-समय पर विश्लेषण के लिए यादृच्छिक जंगलों का विस्तार, गैर-पर्मेट्रिक खतरे का अनुमान है कि Cox मॉडल को बेहतर बनाने के लिए जब आनुपातिक खतरों की धारणा का उल्लंघन किया जाता है।
  • Deep उत्तरजीविता नेटवर्क (जैसे, डीपसुरव, कॉक्सटाइम) ने उत्तरजीविता विश्लेषण में गहरी शिक्षा, उच्च-आयामी डेटा से जटिल जोखिम कार्यों को सीखना शामिल किया।

कई आर्किटेक्चर को जोड़ती है - उदाहरण के लिए, एक तंत्रिका नेटवर्क के साथ एक ढाल बूस्टर को स्टैक करना - अक्सर पूर्वाग्रह और परिवर्तन को कम करके सर्वश्रेष्ठ प्रदर्शन पैदा करता है।

डेटा स्रोत और सुविधा इंजीनियरिंग

किसी भी मशीन लर्निंग मॉडल का प्रदर्शन महत्वपूर्ण रूप से इनपुट डेटा की चौड़ाई और गुणवत्ता पर निर्भर करता है। DKD भविष्यवाणी के लिए सामान्य स्रोतों में शामिल हैं:

  • ]इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड (EHR): जनसांख्यिकीय, निदान, दवा, प्रयोगशाला मान (creatinine, सिस्टैटिन सी, HbA1c, एल्बमिनूरिया), महत्वपूर्ण संकेत और प्रक्रिया कोड।
  • Medical इमेजिंग: गुर्दे अल्ट्रासाउंड छवियों (रेनल लंबाई, कॉर्टिकल मोटाई) और बायोप्सी से पूरे स्लाइड हिस्टोपैथोलॉजी छवियों।
  • ]Genomic डेटा: मधुमेह नेफ्रोपैथी के लिए बहुजनीय जोखिम स्कोर, जीन में एकल-न्यूक्लियोटाइड पॉलीमोर्फिज्म जैसे UMOD], ACE], और ]NPHS2]]]].
  • Wearable device streams: सतत ग्लूकोज निगरानी (CGM) समय श्रृंखला, एम्बुलरी रक्तचाप निगरानी, और भौतिक गतिविधि डेटा।

फ़ीचर इंजीनियरिंग एक महत्वपूर्ण कदम बनी हुई है। "पिछले 24 महीनों में EGFR ढलान" जैसे विभिन्नता के HbA1c गुणांक, "70 mg/dL (hypoglycemia आवृत्ति) से नीचे समय" और "संचार पालन स्कोर" अक्सर कच्चे मूल्यों की तुलना में अधिक पूर्वानुमान शक्ति लेते हैं। स्वचालित सुविधा उत्पादन उपकरण (जैसे, फीचरटूल) हजारों उम्मीदवार सुविधाओं का निर्माण कर सकते हैं, लेकिन डोमेन विशेषज्ञता नैदानिक रूप से सार्थक लोगों का चयन करने और कई परीक्षणों से शानदार सहसंबंधों से बचने के लिए आवश्यक है।

हाल ही में अनुसंधान और नैदानिक सत्यापन

2020 से 2024 के बीच प्रकाशित कई उच्च-प्रभाव अध्ययनों ने विभिन्न आबादी में DKD भविष्यवाणी के लिए मशीन लर्निंग मॉडल की श्रेष्ठता का प्रदर्शन किया है।

2023 में अध्ययन ]]Journal of Nephrology]] UK Biobank से 180,000 मधुमेह रोगियों पर एक गहरी सीखने का मॉडल प्रशिक्षित किया, जिसमें ईजीएफआर ट्रेजेक्टरी, यूएसीआर, आयु, सेक्स, एचबीए 1 सी, और सिस्टोलिक रक्तचाप शामिल थे। मॉडल ने एक सामान्य प्रदर्शन के 0.89 के एयूसी को पांच वर्षों में सीकेडी चरण 3 के लिए प्रगति की भविष्यवाणी करने के लिए हासिल किया, 12% तक किडनी विफलता जोखिम समीकरण (KFRE) को बेहतर बनाने के लिए।

से एक अन्य लैंडमार्क अध्ययन नेफ्रोलॉजी की अमेरिकन सोसाइटी (2024) ने EMPA-REG OUTCOME परीक्षण के टाइप 2 मधुमेह रोगियों में घटना CKD की भविष्यवाणी करने के लिए gradient बूस्टिंग (XGBoost) का इस्तेमाल किया। मॉडल ने 0.92 के AUC को निरंतर ईजीएफआर के 3 साल के जोखिम के लिए ≥30% की गिरावट हासिल की, जो पारंपरिक जोखिम स्कोर (AUC 0.78) से काफी बेहतर था। महत्वपूर्ण बात, मॉडल ने उच्च जोखिम वाले रोगियों के 38% की पहचान की जो यूएसीआर आधारित स्क्रीनिंग से याद किए गए थे।

2024 मेटा-विश्लेषण प्रकाशित ]]Diabetes Care]] 47 अध्ययनों की समीक्षा की और पाया कि मशीन लर्निंग मॉडल ने पारंपरिक रसद प्रतिगमन पर 10-15% की औसत से DKD प्रगति के लिए भेदभाव में सुधार किया, जिसमें 0.88 (95% CI 0.85-0.91) का AUC को पूल किया गया। विश्लेषण ने यह भी उल्लेख किया कि मॉडल अनुदैर्ध्य डेटा (छूटने वाले उपायों) को शामिल करने वाले मॉडलों ने केवल आधार रेखा मूल्यों का उपयोग करके उन लोगों को बेहतर बनाया।

एक बहु केंद्रीय चीनी अध्ययन में 50,000 रोगियों के प्रकार 2 मधुमेह के साथ 10 साल बाद, एक XGBoost मॉडल ने ESRD की भविष्यवाणी के लिए 0.88 का AUC हासिल किया, जिसमें अंशांकन भूखंड पूर्वानुमानित और देखे गए जोखिम के बीच उत्कृष्ट समझौता दिखाते थे। मॉडल को स्थानीय अस्पताल के EHR प्रणाली में एकीकृत किया गया था और बाहरी इलाकों में वास्तविक समय में जोखिम स्कोरिंग के लिए इस्तेमाल किया गया था, जो संसाधन-सीमित सेटिंग में व्यवहार्यता का प्रदर्शन करता था।

चुनौतियां और सीमाएं

इन आशाजनक परिणामों के बावजूद, मशीन लर्निंग से पहले कई बाधाओं को दूर किया जाना चाहिए, डीकेडी भविष्यवाणी के लिए एक नियमित नैदानिक उपकरण बन सकता है।

डेटा गुणवत्ता और हेटेरोजेनिटी

EHR डेटा नॉटोरी रूप से शोर हैं: लापता मान, अनियमित माप अंतराल और प्रयोगशाला में अंतर संस्थानों के बीच सभी degrade मॉडल प्रदर्शन के बीच होता है। उदाहरण के लिए, सिस्टैटिन सी को समान रूप से केंद्र में मापा नहीं जाता है, और क्रिएटिनिन assays में अंशांकन विविधताएं होती हैं। अक्सर प्रयोगशाला निगरानी के साथ अकादमिक चिकित्सा केंद्रों से डेटा पर प्रशिक्षित एक मॉडल समुदाय के क्लीनिकों को सामान्य नहीं कर सकता जहां रोगियों के पास कम माप होते हैं। इम्पुटेशन रणनीति, जैसे एकाधिक इम्पुटेशन या अंतिम अवलोकन आगे चलकर पूर्वाग्रह करना। मानकीकृत डेटा संग्रह और सामान्य डेटा मॉडल को अपनाने (जैसे, ओएमओपी सीडीएम) मदद कर सकता है, लेकिन व्यापक रूप से गोद लेने में धीमी गति से मदद मिलती है।

पारस्परिकता और ट्रस्ट

दीप लर्निंग मॉडल, विशेष रूप से तंत्रिका नेटवर्क या पहनावा विधियों का उपयोग करने वाले लोगों को अक्सर काले बक्से के रूप में वर्णित किया जाता है। चिकित्सकों को तर्कसंगत समझे बिना जोखिम स्कोर पर कार्य करने के लिए जानबूझकर अनिच्छुक होते हैं। एसएपी (शेपली एडिटिव एक्सप्लानेशन) और एलवाईएमई (स्थानीय व्याख्यात्मक मॉडल-एग्नोस्टिक व्याख्या) ऐसे हाइलाइट कर सकते हैं जो किसी व्यक्तिगत भविष्यवाणी के लिए सबसे योगदान देते हैं। हालांकि, इन तरीकों में सीमाएं हैं: एसएपी मूल्यों को बड़े मॉडलों के लिए अनिवार्य रूप से महंगा हो सकता है, और एलवाईएमई के स्थानीय अनुमान अस्थिर हो सकता है। इसके अलावा, स्पष्टीकरण के साथ, कुछ चिकित्सकों को नैदानिक विकास की सिफारिशों की आवश्यकता होती है।

बायस और फेयरनेस

यदि कुछ जनसांख्यिकीय समूहों का प्रशिक्षण डेटा अतिरेकित है तो मॉडल निर्विवाद आबादी के लिए खराब प्रदर्शन कर सकता है। ]Nature Digital Medicine(FLT:2]]]](23) में प्रकाशित एक अध्ययन में पाया गया कि एक EHR प्रशिक्षित DKD भविष्यवाणियों के लिए एक झूठी सकारात्मक दर 18% अधिक है, क्योंकि काले रोगियों को प्रशिक्षण के लिए उचित मूल्य (KDgin) की कमी के लिए जिम्मेदार ठहराया गया है।

क्लिनिकल वर्कफ़्लो में एकीकरण

एक सटीक भविष्यवाणी मॉडल बेकार है अगर यह नैदानिक वर्कफ़्लो को बाधित करता है। कई शोध ग्रेड मॉडलों को कभी लाइव ईएचआर वातावरण में तैनात नहीं किया गया है। सफल एकीकरण की आवश्यकता है: (1) मिडलवेयर जो ईएचआर से वास्तविक समय में डेटा खींचता है, (2) जोखिम स्कोर एक रोगी के मुठभेड़ के सेकंड के भीतर गणना की जाती है, (3) नैदानिक निर्णय समर्थन (सीडीएस) अलर्ट जो गैर-अवरुद्ध हैं, और (4) उपयोगकर्ता के अनुकूल डैशबोर्ड जो समय के साथ जोखिम ट्रेजेक्टरी प्रदर्शित करते हैं। कैसर परमानेंट और मेयो क्लिनिक में पायलट कार्यान्वयन से पता चला है कि जब वे एक्शनेबल सिफारिशों (जैसे, "एक निष्क्रिय सीमा पर काम करने वाली बाधाएं") शामिल हैं।

भविष्य निर्देश

DKD के लिए भविष्य की भविष्यवाणी मॉडल की अगली पीढ़ी अधिक सटीक, व्याख्यात्मक और आसानी से देखभाल वितरण में एकीकृत हो जाएगा।

गोपनीयता संरक्षण बहु साइट प्रशिक्षण के लिए Federated लर्निंग

संवेदनशील रोगी डेटा को केंद्रीकृत किए बिना मजबूत मॉडल को प्रशिक्षित करने के लिए, federated लर्निंग अस्पतालों को डेटा को स्थानीय रखने के दौरान एक मॉडल को प्रशिक्षित करने की अनुमति देती है। केवल मॉडल अपडेट (ग्रेडिएंट) साझा किए जाते हैं, गोपनीयता को संरक्षित करते हैं। Federated किडनी रोग भविष्यवाणी Consortium (2024) से प्रारंभिक परिणाम यह दर्शाता है कि 12 अस्पतालों में प्रशिक्षित एक संघीय मॉडल ने सीकेडी भविष्यवाणी के लिए 0.86 का AUC हासिल किया, जो लगभग एक केंद्रीय प्रशिक्षित मॉडल (AUC 0.87) के समान है जबकि डेटा हस्तांतरण से बचने के लिए। यूरोपीय स्वास्थ्य डेटा स्पेस और क्रॉस-इंस्टीट्यूशनल डेटा-एसआरिंग एप्पोप्स जैसे नियामक ढांचे को आगे बढ़ाया गया है।

बहु-Omics एकीकरण

जीनोमिक्स, प्रोटेमिक्स और मेटाबोमिक्स में एडवांस उच्च-आयामी आणविक प्रोफाइल का उत्पादन कर रहे हैं जो डीकेडी भविष्यवाणी में काफी सुधार कर सकते हैं। हार्वर्ड किडनी इनिशिएटिव से एक 2024 अध्ययन ने 120 किडनी से संबंधित लक्षणों के लिए बहुजनीय जोखिम स्कोर के साथ ईएचआर डेटा को संयुक्त किया और 5-वर्षीय ईएसआरडी जोखिम (source)] की भविष्यवाणी के लिए 0.94 का एक एयूसी हासिल किया। प्रोटेमिक पैनल 50 बायोमार्कर (KIM-1, NGAL, और SUPAR सहित) को मापने वाले मॉडल जो नैदानिक, आनुवंशिक और प्रोटेमिक केयर में नियमित डेटा को एकीकृत करते हैं।

पहनने योग्य के साथ वास्तविक समय जोखिम निगरानी

सतत ग्लूकोज मॉनिटर (CGM) और एम्बुलेटरी रक्तचाप मॉनिटर उच्च आवृत्ति डेटा धारा उत्पन्न करते हैं जो गतिशील जोखिम मूल्यांकन के लिए मशीन लर्निंग मॉडल में फ़ीड कर सकते हैं। उदाहरण के लिए, एक मॉडल यह पता लगा सकता है कि एक रोगी के nocturnal सिस्टोलिक रक्तचाप में वृद्धि हुई है 15 mmHg दो सप्ताह से अधिक, बढ़ती ग्लूकोज परिवर्तनशीलता के साथ संयुक्त, और मूत्र एलबमाइन की जांच के लिए एक चेतावनी ट्रिगर करें। प्रारंभिक प्रूफ-ऑफ-अवधारणा अध्ययनों से पता चलता है कि CGM-घुड़सवार समय-in-range और ग्लाइसेमिक परिवर्तनशीलता मीट्रिक 8-10% तक तेजी से eGFR गिरावट की भविष्यवाणी में सुधार करते हैं।

उपचार मार्गदर्शन के लिए कासल मशीन लर्निंग

वर्तमान भविष्यवाणी मॉडल का जवाब है "जो जोखिम पर है? लेकिन "हम इसके बारे में क्या करना चाहिए?" कासल मशीन लर्निंग (जैसे, कासल वन, डबल / डिबाइस मशीन लर्निंग) का उद्देश्य हस्तक्षेपों के विषम उपचार प्रभाव का अनुमान लगाना है - जैसे कि SGLT2 अवरोधक, GLP-1 रिसेप्टर एगोनिस्ट, या गहन रक्तचाप कम करना - DKD प्रगति पर। उदाहरण के लिए, एक कारण मॉडल यह पहचान सकता है कि उच्च HbA1c परिवर्तनशीलता वाले रोगियों को लेकिन कम बेसलाइन eGFR स्थिर HbA1c के रोगियों की तुलना में SGLT2 अवरोधक से अधिक लाभ प्राप्त करता है।

निष्कर्ष

मशीन लर्निंग तेजी से मधुमेह रोगियों में दीर्घकालिक गुर्दे की क्षति की भविष्यवाणी करने की क्षमता को आगे बढ़ा रही है, जो नैदानिक, इमेजिंग, जीनोमिक और पहनने योग्य डेटा में जटिल पैटर्न को कैप्चर करने के लिए पारंपरिक जोखिम कारकों से परे बढ़ रहा है। हाल के अध्ययनों में लगातार 0.85 से ऊपर AUC की रिपोर्ट करते हैं, जिसमें कुछ मॉडल 10-15% तक किडनी विफलता जोखिम समीकरण को बेहतर बनाने के लिए हैं। हालांकि, वास्तविक दुनिया की तैनाती में डेटा की गुणवत्ता, व्याख्या, निष्पक्षता और वर्कफ़्लो एकीकरण में आने वाली चुनौतियों की आवश्यकता होती है। उभरते हुए समाधान - थक गए सीखने, बहु-आधुनिक एकीकरण, वास्तविक समय पहनने योग्य डेटा, और प्रारंभिक सीखने की तकनीक भी होती है।