Use this URL to cite this ETD: https://hdl.handle.net/20.500.12512/260496
Sergamumo širdies ir kraujagyslių ligomis tikimybės prognozavimas taikant mašininio mokymosi metodus
Resource Type (COAR)
TextThesisMaster thesis
Title
Sergamumo širdies ir kraujagyslių ligomis tikimybės prognozavimas taikant mašininio mokymosi metodus
Other Title
Predicting the Probability of Cardiovascular Diseases Using Machine Learning Methods
Author
Fedotovaitė, Radvilė |
Advisor
Other(s)
Recenzentas / Reviewer | |
Konsultantas / Consultant |
Extent
49 p.
Thesis Defence Date
2026-06-08
Science / Art Area
Medicinos ir sveikatos mokslai / Medical and health sciences (M)
Field of Science
Medicina / Medicine (M001)
Abstract (lt)
Radvilė Fedotovaitė: „Sergamumo širdies ir kraujagyslių ligomis tikimybės prognozavimas taikant mašininio mokymosi metodus“. Darbo tikslas. Sukurti logistinės regresijos, sprendimų medžių, atsitiktinių miškų bei XGBoost modelius, skirtus prognozuoti sergamumą širdies ir kraujagyslių ligomis bei įvertinti šių modelių prognostinį tikslumą. Uždaviniai.
- Įvertinti pacientų, nesergančių ir sergančių širdies kraujagyslių ligomis, demografinius, anamnestinius ir laboratorinių tyrimų duomenis.
- Sudaryti logistinės regresijos modelį, skirtą širdies ir kraujagyslių ligų sergamumo prognozei.
- Sudaryti sprendimų medžių modelį, skirtą širdies ir kraujagyslių ligų sergamumo prognozei.
- Sudaryti atsitiktinių miškų modelį, skirtą širdies ir kraujagyslių ligų sergamumo prognozei.
- Sudaryti XGBoost modelį, skirtą širdies ir kraujagyslių ligų sergamumo prognozei.
- Įvertinti gautų mašininio mokymosi modelių tikslumą. Metodai. Retrospektyviai analizuotas duomenų rinkinys iš UAB „Saulės šeimos medicinos centro“ elektroninės duomenų bazės TriNetX. Duomenų rinkinį sudarė 2201 pacientas, kurie buvo vyresni nei 40 metų. Šis rinkinys buvo padalintas į dvi grupes: sergančiųjų širdies ir kraujagyslių ligomis (ŠKL) (n = 959) ir nesergančiųjų ŠKL (n = 1242). Į sergančiųjų grupę pateko pacientai, kuriems diagnozuotas persirgtas arba ūmus miokardo infarktas, smegenų išeminis insultas, aterosklerozė ar atlikta vainikinių arterijų stentavimo procedūra, o į nesergančiųjų grupę pateko pacientai, kurie neserga šiomis ligomis, tačiau savo ligos istorijose turi kitas ligas, tyrimų pakitimus galimai didinančius riziką sirgti ŠKL. Analizuoti 25 kintamieji, apimantys lėtines ligas, vartojamus vaistus, laboratorinių tyrimų rezultatus bei demografinius rodiklius. Kadangi duomenų rinkinyje vyravo nesergančiųjų grupė, disbalansas buvo pašalintas taikant grupinį agregavimą, dominuojančios klasės mažinimą ir dvinarį grupavimą. Vėliau gautų modelių tikslumas buvo vertinamas preciziškumo bei F1-score metrikomis bei šių metrikų aritmetiniu, makro ir svertiniu vidurkiais. Rezultatai ir išvados. Duomenų bazėje iš 2021 paciento, ŠKL sergančiųjų buvo statistiškai reikšmingai daugiau vyrų, taip pat šių pacientų amžius buvo didesnis (abi gautos p < 0,001). Sergančiųjų grupėje statistiškai reikšmingai dažniau diagnozuota krūtinės angina 61,6 % lyginant su 12,6 %, antro tipo cukrinis diabetas (CD) 25 % lyginant su 8,5 %, lėtinė inkstų liga 12,2 % lyginant su 3,4 % bei reikšmingai dažniau vartojami visi tirti ŠKL vaistai (visos gautos p < 0,001). ŠKL grupėje nustatyta reikšmingai žemesnė bendro cholesterolio mediana 4,88 mmol/l lyginant su 5,44 mmol/l, mažo tankio lipoproteinų (MTL) cholesterolio mediana 2,87 mmol/l lyginant su 3,27 mmol/l, didelio tankio lipoproteinų (DTL) cholesterolio mediana 1,28 mmol/l lyginant su 1,45 mmol/l, tačiau aukštesnė trigliceridų mediana 1,40 mmol/l lyginant su 1,25 mmol/l (visos gautos p < 0,001). Visuose modeliuose statistiškai reikšmingi ŠKL prognozei kintamieji buvo: amžius, krūtinės angina, lytis, lipidų apykaitos rodikliai. Logistinės regresijos modelyje didžiausią šansų santykį turėjo krūtinės anginos kintamasis (ŠS = 4,736, p < 0,001), sprendimų medžių modeliuose šis kintamasis buvo pradinis skaidymo kintamasis, o atsitiktinių miškų modelyje dominavo kintamieji: amžius (svarba – 0,634) ir krūtinės angina (svarba – 0,232). XGBoost modelyje kintamųjų svarbos pasiskirstymas buvo tolygus. Geriausią modelio tikslumą pademonstravo XGBoost (makro preciziškumas 0,8229, makro F1-score – 0,8239), po jo sekė logistinė regresija, atsitiktiniai miškai ir sprendimų medis.
Abstract (en)
Radvilė Fedotovaitė: “Predicting the Probability of Cardiovascular Diseases Using Machine Learning Methods.” Aim of the study. To develop logistic regression, decision tree, random forest, and XGBoost models for predicting the incidence of cardiovascular disease and to evaluate the predictive accuracy of these models. Objectives.
- To evaluate the demographic, medical history, and laboratory test data of patients with and without cardiovascular disease.
- To develop a logistic regression model for predicting the incidence of cardiovascular disease.
- Develop a decision tree model for predicting the incidence of cardiovascular disease.
- Develop a random forest model for predicting the incidence of cardiovascular diseases.
- Develop an XGBoost model for predicting the incidence of cardiovascular diseases.
- Evaluate the accuracy of the machine learning models obtained. Methods. A retrospective analysis of a data set from the electronic database TriNetX of UAB “Saulės šeimos medicinos centras” was performed. The data set consisted of 2201 patients who were older than 40 years. This set was divided into two groups: patients with cardiovascular diseases (CVD) (n = 959) and patients without CVD (n = 1242). The group with CVD included patients who had been diagnosed with a previous or acute myocardial infarction, ischemic stroke, atherosclerosis, or had undergone coronary artery stenting, while the group without CVD included patients who did not have these diseases but had other diseases in their medical histories, test abnormalities that potentially increased the risk of CVD. 25 variables were analyzed, including chronic diseases, medications used, laboratory test results, and demographic indicators. Since the data set was dominated by the non-diseased group, imbalance was removed by applying group aggregation, dominant class reduction and binary clustering. The accuracy of the resulting models was subsequently assessed by precision and F1-score metrics and arithmetic, macro and weighted averages of these metrics. Results and conclusions. Out of 2021 patients in the database, there were statistically significantly more men with CVD, and these patients were also older (both p < 0.001). In the group of patients, angina pectoris was diagnosed statistically significantly more often (61.6% compared to 12.6%), type 2 diabetes mellitus 25% compared to 8.5%, chronic kidney disease 12.2% compared to 3.4%, and all tested CVD medications were used significantly more often (all p < 0.001). In the CVD group, a significantly lower median total cholesterol of 4.88 mmol/l compared to 5.44 mmol/l, a median low-density lipoprotein (LDL) cholesterol of 2.87 mmol/l compared to 3.27 mmol/l, a median high-density lipoprotein (HDL) cholesterol of 1.28 mmol/l compared to 1.45 mmol/l, but a higher median triglycerides of 1.40 mmol/l compared to 1.25 mmol/l (all p < 0.001). In all models, the following variables were statistically significant for the prediction of CVD: age, angina pectoris, gender, and lipid metabolism indicators. In the logistic regression model, the angina variable had the highest odds ratio (OR = 4.736, p < 0.001), in the decision tree models this variable was the initial decomposition variable, and in the random forest model the variables: age (importance – 0.634) and angina (importance – 0.232) dominated. In the XGBoost model, the distribution of the importance of the variables was uniform. The best model accuracy was demonstrated by XGBoost (macro precision 0.8229, macro F1-score – 0.8239), followed by logistic regression, random forests and decision tree.
Language
Lietuvių / Lithuanian (lt)
Defended
Taip / Yes
Access Rights
Atviroji prieiga / Open Access