E-ISSN: 2822-6771
pdf
Volume : 18 Issue : 4 Year : 2026
Quick Search
Comparative Analysis of Turkish AI Chatbot Responses on Pediatric Atopic Dermatitis: Reliability, Quality, Readability, and Safety [Compreh Med]
Compreh Med. 2026; 18(4): 372-377 | DOI: 10.14744/cm.2026.69077

Comparative Analysis of Turkish AI Chatbot Responses on Pediatric Atopic Dermatitis: Reliability, Quality, Readability, and Safety

Kazım Okan Dolu1, Elanur Yolal Karimov2
1Department of Pediatric Allergy and Immunology, Kanuni Sultan Süleyman Training and Research Hospital, İstanbul, Türkiye
2Department of Social Pediatrics, İstanbul University Faculty of Medicine, Institute of Health Sciences, Institute of Child Health, İstanbul, Türkiye

INTRODUCTION: To compare the clinical accuracy, content quality, reliability, readability, and safety profiles of three advanced large language models (GPT-5.1 Thinking, Gemini 3 Pro, and Claude 4.5 Sonnet) in responding to frequently asked questions about pediatric atopic dermatitis management.
METHODS: Sixty questions covering diagnosis, triggers, skin care, medical treatments, and complication management were submitted to each model in Turkish. Primary analyses were performed on T1 responses; a second session (T2) was conducted one week later to assess test-retest reliability. Re-sponses were evaluated by three blinded experts using a 4-point clinical accuracy scale, the Global Quality Score (GQS), Modified DISCERN (mDISCERN), and validated Turkish readability indices. Safety was assessed using a two-tier harm classification.
RESULTS: GPT-5.1 Thinking demonstrated the highest clinical accuracy (98.3% comprehensive/correct responses), with superior GQS and mDISCERN scores (median 5 for both). Claude 4.5 Sonnet showed comparable performance. Gemini 3 Pro exhibited significantly lower accuracy (88.3%) and reliability scores (median mDISCERN score of 3), despite producing the most readable content. No major harm was identified across the models; however, moderate harm (omission of critical details) was significantly more frequent with Gemini 3 Pro (23.3%) than with GPT-5.1 Thinking (10.0%). All models demonstrated strong stability in accuracy scores between sessions.
DISCUSSION AND CONCLUSION: GPT-5.1 Thinking exhibited superior accuracy and reliability for pediatric atopic dermatitis queries. The observed readability-safety trade-off with Gemini 3 Pro underscores the need for clinician oversight when using AI-generated content for parent education.

Keywords: Artificial intelligence, atopic dermatitis, chatbots, large language models, patient education


Pediatrik Atopik Dermatit Hakkında Yapay Zeka Sohbet Robotlarının Türkçe Yanıtlarının Karşılaştırmalı Analizi: Güvenilirlik, Kalite, Okunabilirlik ve Güvenlik

Kazım Okan Dolu1, Elanur Yolal Karimov2
1Kanuni Sultan Süleyman Eğitim ve Araştırma Hastanesi, Çocuk Alerji ve İmmünoloji Anabilim Dalı, İstanbul
2İstanbul Üniversitesi Tıp Fakültesi, Sağlık Bilimleri Enstitüsü, Çocuk Sağlığı Enstitüsü, Sosyal Pediatri Anabilim Dalı, İstanbul

GİRİŞ ve AMAÇ: Üç gelişmiş büyük dil modelinin (GPT-5.1 Thinking, Gemini 3 Pro ve Claude 4.5 Sonnet) pediatrik atopik dermatit yönetimi hakkındaki sıkça sorulan sorulara verdiği yanıtların klinik doğruluğunu, içerik kalitesini, güvenilirliğini, okunabilirliğini ve güvenlik profillerini karşılaştırmaktır.
YÖNTEM ve GEREÇLER: Tanı, tetikleyiciler, cilt bakımı, tıbbi tedaviler ve komplikasyon yönetimini kapsayan altmış soru, her bir modele Türkçe olarak iletilmiştir. Birincil analizler T1 yanıtları üzerinde gerçekleştirilmiş; test-tekrar test güvenilirliğini değerlendirmek amacıyla bir hafta sonra ikinci bir oturum (T2) yapılmıştır. Yanıtlar; üç kör (blinded) uzman tarafından 4 puanlık klinik doğruluk ölçeği, Küresel Kalite Skoru (GQS), Modifiye DISCERN (mDISCERN) ve doğrulanmış Türkçe okunabilirlik indeksleri kullanılarak değerlendirilmiştir. Güvenlik değerlendirmesi, iki aşamalı bir zarar sınıflandırması ile yapılmıştır.
BULGULAR: GPT-5.1 Thinking, üstün GQS ve mDISCERN skorları (her ikisi için medyan 5) ile birlikte en yüksek klinik doğruluğu (%98,3 kapsamlı/doğru yanıt) sergilemiştir. Claude 4.5 Sonnet benzer bir performans göstermiştir. Gemini 3 Pro, en okunabilir içeriği üretmesine rağmen, anlamlı derecede daha düşük doğruluk (%88,3) ve güvenilirlik skorları (mDISCERN medyan 3) sergilemiştir. Modellerin hiçbirinde majör zarar tespit edilmemiştir; ancak orta düzeyde zarar (kritik ayrıntıların eksik bırakılması), GPT-5.1 Thinking (%10,0) ile karşılaştırıldığında Gemini 3 Pro’da (%23,3) anlamlı derecede daha sık görülmüştür. Tüm modeller, oturumlar arasında güçlü doğruluk ve skor kararlılığı göstermiştir.
TARTIŞMA ve SONUÇ: GPT-5.1 Thinking, pediatrik atopik dermatit sorgularında üstün doğruluk ve güvenilirlik sergilemiştir. Gemini 3 Pro'da gözlemlenen okunabilirlik-güvenlik dengesi (trade-off), ebeveyn eğitimi için yapay zeka tarafından oluşturulan içeriklerin kullanımında klinik denetim gerekliliğinin altını çizmektedir.

Anahtar Kelimeler: Yapay zeka, atopik dermatit, sohbet botları, büyük dil modelleri, hasta eğitimi


Corresponding Author: Kazım Okan Dolu, Türkiye
Manuscript Language: English
×
APA
NLM
AMA
MLA
Chicago
Copied!
CITE