GASTROENTEROLOJİ’YE ÖZGÜ YAPAY ZEKA DİL MODELİNİN KLİNİK PRATİKTE KULLANIMI

dc.contributor.authorAli Berkcan Bozdoğan
dc.contributor.departmentİç Hastalıkları
dc.date.accessioned2026-09-10T06:22:20Z
dc.date.issued2026-04-20
dc.description.abstractBozdoğan Ali B.: Clinical Use of a Gastroenterology-Specific Artificial Intelligence Language Model; Hacettepe University Adult Hospital Residency Thesis, Department of Internal Medicine, Hacettepe University Faculty of Medicine, Ankara, 2026. Objective: This study aimed to evaluate the clinical decision support capacity of GastroGPT, a retrieval-augmented generation (RAG)-based artificial intelligence language model developed specifically for gastroenterology, and to perform a comparative analysis with general-purpose large language models. Materials and Methods: In this retrospective, multicenter comparative model evaluation study, 200 standardized clinical cases selected from the archives of Hacettepe University Faculty of Medicine, Department of Gastroenterology were utilized. Cases were stratified to represent the following subspecialty areas: general gastroenterology (50%), hepatology (26%), pancreatic diseases (9%), inflammatory bowel diseases (6%), gastrointestinal oncology (5%), and endoscopy (4%). A total of eight AI language models were evaluated, comprising four GastroGPT variants (Deeplake, Faiss, Chroma, and 16K) and four general-purpose models (GPT-4, Claude, Bard/Gemini, You.com). Model responses were scored by two independent expert gastroenterologists in a blinded fashion using a 5-point Likert scale across five criteria: diagnostic accuracy, appropriateness of recommended investigations, guideline concordance of treatment recommendations, applicability of patient management strategies, and overall performance. Additionally, hallucination rates, source attribution quality, and response consistency were assessed. Results: GastroGPT-Deeplake achieved the highest overall performance score (53.8±5.9; maximum 60 points), significantly outperforming GPT-4 (50.1±6.8, p=0.028) and Claude (49.3±7.2, p=0.012). GastroGPT variants demonstrated marked superiority over general-purpose models in hallucination rates (4.2–6.8% vs. 8.3– 12.1%, p=0.018) and source attribution quality (62.8–78.3% vs. 23.5–34.7%). In the vector database comparison, Deeplake significantly outperformed Faiss and Chroma (p<0.001). GastroGPT's mean scores across the five evaluation criteria ranged from 4.00 to 4.21, with the highest performance observed in guideline concordance (4.21±0.63). Case complexity had a significant effect on diagnostic accuracy (F=7.361, p=0.0008); diagnostic accuracy scores in high-complexity cases (3.81±0.83) were significantly lower compared to low-complexity cases (4.43±0.70; Cohen's d=0.803). No significant performance differences were observed across disease prevalence categories or subspecialty areas. Inter-rater reliability was excellent (ICC>0.99, Pearson r=0.814, Cronbach's α=0.802). ROC analysis yielded an AUC of 0.908 for the overall performance criterion. Conclusion: GastroGPT-Deeplake demonstrated superiority over general-purpose large language models in both overall performance and safety parameters through domain-specific RAG integration. The advantages of RAG technology in reducing hallucination risk and ensuring source traceability are of critical importance for the safety of medical AI applications. Our findings support the preferential use of domainspecific approaches over general-purpose models in developing AI-assisted clinical decision support systems for gastroenterology practice. Keywords: Artificial intelligence, large language model, gastroenterology, GastroGPT, retrieval-augmented generation, clinical decision support system, hallucination, vector database
dc.description.ozetBozdoğan Ali B.: Gastroenteroloji'ye Özgü Yapay Zeka Dil Modelinin Klinik Pratikte Kullanımı; Hacettepe Üniversitesi Tıp Fakültesi (HÜTF) İç Hastalıkları Anabilim Dalı Uzmanlık Tezi; Ankara, 2026. Amaç: Bu çalışma, gastroenteroloji alanına özgü olarak geliştirilen retrievalaugmented generation (RAG) tabanlı bir yapay zeka dil modeli olan GastroGPT'nin klinik karar destek kapasitesini değerlendirmeyi ve genel amaçlı büyük dil modelleri ile karşılaştırmalı analizini yapmayı amaçlamaktadır. Gereç ve Yöntem: Retrospektif, çok merkezli bu karşılaştırmalı model değerlendirme çalışmasında, Hacettepe Üniversitesi Tıp Fakültesi Gastroenteroloji Bilim Dalı arşivinden seçilen 200 standardize klinik vaka kullanılmıştır. Vakalar; genel gastroenteroloji (%50), hepatoloji (%26), pankreatik hastalıklar (%9), inflamatuvar barsak hastalıkları (%6), gastrointestinal onkoloji (%5) ve endoskopi (%4) alt uzmanlık alanlarını temsil edecek şekilde stratifiye edilmiştir. Çalışmada dört GastroGPT varyantı (Deeplake, Faiss, Chroma ve 16K) ile dört genel amaçlı model (GPT-4, Claude, Bard/Gemini, You.com) olmak üzere toplam sekiz yapay zeka dil modeli değerlendirilmiştir. Model yanıtları, iki bağımsız uzman gastroenterolog tarafından körleştirilmiş olarak; tanısal doğruluk, önerilen tetkiklerin uygunluğu, tedavi önerilerinin kılavuzlara uygunluğu, hasta yönetimi stratejilerinin uygulanabilirliği ve genel performans olmak üzere beş kriter üzerinden 5'li Likert ölçeği ile puanlanmıştır. Ek olarak halüsinasyon oranları, kaynak atfı kalitesi ve yanıt tutarlılığı değerlendirilmiştir. Bulgular: GastroGPT-Deeplake, genel performansta en yüksek puanı elde etmiştir (53.8±5.9; maksimum 60 puan) ve GPT-4 (50.1±6.8, p=0.028) ile Claude (49.3±7.2, p=0.012) modellerini istatistiksel olarak anlamlı düzeyde geride bırakmıştır. GastroGPT varyantları, halüsinasyon oranları (%4.2-6.8'e karşı %8.3- 12.1, p=0.018) ve kaynak atfı kalitesi (%62.8-78.3'e karşı %23.5-34.7) açısından genel amaçlı modellere göre belirgin üstünlük göstermiştir. Vektör veri tabanı karşılaştırmasında Deeplake, Faiss ve Chroma'ya göre anlamlı düzeyde üstün performans sergilemiştir (p<0.001). GastroGPT'nin beş değerlendirme kriterindeki ortalama puanları 4.00 ile 4.21 arasında değişmiş olup, en yüksek performans kılavuz uyumu kriterinde (4.21±0.63) elde edilmiştir. Vaka karmaşıklığı tanısal doğruluk üzerinde anlamlı bir etkiye sahip bulunmuş (F=7.361, p=0.0008); yüksek karmaşıklıktaki vakalarda tanısal doğruluk puanı (3.81±0.83) düşük karmaşıklıktaki vakalara (4.43±0.70) kıyasla anlamlı düzeyde düşük saptanmıştır (Cohen's d=0.803). Hastalık görülme sıklığı ve alt uzmanlık alanları açısından anlamlı performans farklılığı gözlenmemiştir. Değerlendiriciler arası güvenilirlik yüksek düzeyde bulunmuştur (ICC>0.99, Pearson r=0.814, Cronbach α=0.802). ROC analizinde genel performans kriteri için AUC değeri 0.908 olarak hesaplanmıştır. Sonuç: GastroGPT-Deeplake, alan-spesifik RAG entegrasyonu sayesinde genel amaçlı büyük dil modellerine göre hem genel performans hem de güvenlik parametreleri açısından üstünlük göstermiştir. RAG teknolojisinin halüsinasyon riskini azaltma ve kaynak izlenebilirliği sağlama konusundaki avantajları, tıbbi yapay zeka uygulamalarının güvenliği için kritik öneme sahiptir. Bulgularımız, gastroenteroloji pratiğinde yapay zeka destekli klinik karar destek sistemlerinin geliştirilmesinde alan-spesifik yaklaşımların genel amaçlı modellere tercih edilmesi gerektiğini desteklemektedir. Anahtar Kelimeler: Yapay zeka, büyük dil modeli, gastroenteroloji, GastroGPT, retrieval-augmented generation, klinik karar destek sistemi, halüsinasyon, vektör veri tabanı
dc.embargo.lift2026-09-10T06:22:20Z
dc.embargo.termsAcik erisim
dc.identifier.urihttps://hdl.handle.net/11655/39224
dc.language.isotr
dc.publisherTıp Fakültesi
dc.rightsinfo:eu-repo/semantics/openAccess
dc.subjectYapay zeka, büyük dil modeli, gastroenteroloji, GastroGPT, retrieval-augmented generation, klinik karar destek sistemi, halüsinasyon, vektör veri tabanı
dc.subtypemedicineThesis
dc.titleGASTROENTEROLOJİ’YE ÖZGÜ YAPAY ZEKA DİL MODELİNİN KLİNİK PRATİKTE KULLANIMI
dc.typeinfo:eu-repo/semantics/masterThesis

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
Ali Berkcan Bozdogan Tez Dosyası.pdf
Size:
937.26 KB
Format:
Adobe Portable Document Format

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.89 KB
Format:
Item-specific license agreed upon to submission
Description: