INTRODUCTION: To compare the clinical accuracy, content quality, reliability, readability, and safety profiles of three advanced large language models (GPT-5.1 Thinking, Gemini 3 Pro, and Claude 4.5 Sonnet) in responding to frequently asked questions about pediatric atopic dermatitis management.
METHODS: Sixty questions covering diagnosis, triggers, skin care, medical treatments, and complication management were submitted to each model in Turkish. Primary analyses were performed on T1 responses; a second session (T2) was conducted one week later to assess test-retest reliability. Re-sponses were evaluated by three blinded experts using a 4-point clinical accuracy scale, the Global Quality Score (GQS), Modified DISCERN (mDISCERN), and validated Turkish readability indices. Safety was assessed using a two-tier harm classification.
RESULTS: GPT-5.1 Thinking demonstrated the highest clinical accuracy (98.3% comprehensive/correct responses), with superior GQS and mDISCERN scores (median 5 for both). Claude 4.5 Sonnet showed comparable performance. Gemini 3 Pro exhibited significantly lower accuracy (88.3%) and reliability scores (median mDISCERN score of 3), despite producing the most readable content. No major harm was identified across the models; however, moderate harm (omission of critical details) was significantly more frequent with Gemini 3 Pro (23.3%) than with GPT-5.1 Thinking (10.0%). All models demonstrated strong stability in accuracy scores between sessions.
DISCUSSION AND CONCLUSION: GPT-5.1 Thinking exhibited superior accuracy and reliability for pediatric atopic dermatitis queries. The observed readability-safety trade-off with Gemini 3 Pro underscores the need for clinician oversight when using AI-generated content for parent education.
Keywords: Artificial intelligence, atopic dermatitis, chatbots, large language models, patient education
GİRİŞ ve AMAÇ: Üç gelişmiş büyük dil modelinin (GPT-5.1 Thinking, Gemini 3 Pro ve Claude 4.5 Sonnet) pediatrik atopik dermatit yönetimi hakkındaki sıkça sorulan sorulara verdiği yanıtların klinik doğruluğunu, içerik kalitesini, güvenilirliğini, okunabilirliğini ve güvenlik profillerini karşılaştırmaktır.
YÖNTEM ve GEREÇLER: Tanı, tetikleyiciler, cilt bakımı, tıbbi tedaviler ve komplikasyon yönetimini kapsayan altmış soru, her bir modele Türkçe olarak iletilmiştir. Birincil analizler T1 yanıtları üzerinde gerçekleştirilmiş; test-tekrar test güvenilirliğini değerlendirmek amacıyla bir hafta sonra ikinci bir oturum (T2) yapılmıştır. Yanıtlar; üç kör (blinded) uzman tarafından 4 puanlık klinik doğruluk ölçeği, Küresel Kalite Skoru (GQS), Modifiye DISCERN (mDISCERN) ve doğrulanmış Türkçe okunabilirlik indeksleri kullanılarak değerlendirilmiştir. Güvenlik değerlendirmesi, iki aşamalı bir zarar sınıflandırması ile yapılmıştır.
BULGULAR: GPT-5.1 Thinking, üstün GQS ve mDISCERN skorları (her ikisi için medyan 5) ile birlikte en yüksek klinik doğruluğu (%98,3 kapsamlı/doğru yanıt) sergilemiştir. Claude 4.5 Sonnet benzer bir performans göstermiştir. Gemini 3 Pro, en okunabilir içeriği üretmesine rağmen, anlamlı derecede daha düşük doğruluk (%88,3) ve güvenilirlik skorları (mDISCERN medyan 3) sergilemiştir. Modellerin hiçbirinde majör zarar tespit edilmemiştir; ancak orta düzeyde zarar (kritik ayrıntıların eksik bırakılması), GPT-5.1 Thinking (%10,0) ile karşılaştırıldığında Gemini 3 Pro’da (%23,3) anlamlı derecede daha sık görülmüştür. Tüm modeller, oturumlar arasında güçlü doğruluk ve skor kararlılığı göstermiştir.
TARTIŞMA ve SONUÇ: GPT-5.1 Thinking, pediatrik atopik dermatit sorgularında üstün doğruluk ve güvenilirlik sergilemiştir. Gemini 3 Pro'da gözlemlenen okunabilirlik-güvenlik dengesi (trade-off), ebeveyn eğitimi için yapay zeka tarafından oluşturulan içeriklerin kullanımında klinik denetim gerekliliğinin altını çizmektedir.
Anahtar Kelimeler: Yapay zeka, atopik dermatit, sohbet botları, büyük dil modelleri, hasta eğitimi