Ürolojik Ameliyatlarda İş Sağlığı ve Güvenliği: Yapay Zeka Tabanlı Büyük Dil Modellerinin (ChatGPT, Gemini, Perplexity, DeepSeek) Performanslarının Karşılaştırılması
Endoüroloji Bülteni, cilt.18, sa.2, ss.73-79, 2026 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 18 Sayı: 2
- Basım Tarihi: 2026
- Doi Numarası: 10.54233/endourolbull-1792399
- Dergi Adı: Endoüroloji Bülteni
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.73-79
- Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
- Van Yüzüncü Yıl Üniversitesi Adresli: Evet
Özet
Amaç: Bu çalışma, yapay zeka (YZ) tabanlı büyük dil modellerinin (ChatGPT, Gemini, Perplexity, DeepSeek) ürolojik ameliyatlarda iş sağlığı ve güvenliği (İSG) ile ilgili sorulara verdikleri yanıtların bilgi düzeyi, rehberlerle uyumu, kapsamı ve tutarlılığını karşılaştırmalı olarak değerlendirmeyi amaçlamaktadır. Gereç ve Yöntemler: Literatür ve uluslararası kılavuzlar (EAU, WHO, OSHA vb.) temel alınarak biyolojik, kimyasal, fiziksel, ergonomik, çevresel ve psikososyal riskleri kapsayan 10 standart soru hazırlanmıştır. Bu sorular dört farklı modele aynı gün ve aynı formatta yöneltilmiş, yanıtlar üç bağımsız uzman tarafından DISCERN ve GQS kriterleriyle kör olarak değerlendirilmiştir. Bulgular: ChatGPT ve Gemini, hem DISCERN hem de GQS skorlarında en yüksek performansı sergilemiştir. Perplexity orta düzeyde, DeepSeek ise en düşük kalite ve tutarlılığı göstermiştir. ChatGPT, Perplexity ve DeepSeek’ten anlamlı derecede daha yüksek skor alırken (p<0,01), Gemini de Perplexity ve DeepSeek’ten anlamlı şekilde üstündür (p<0,05). ChatGPT ile Gemini arasında anlamlı fark bulunmamıştır. Sonuç: YZ tabanlı büyük dil modelleri, ürolojik ameliyatlarda İSG konusunda bilgi desteği sağlayabilmektedir; ancak modeller arasında önemli kalite farklılıkları mevcuttur. ChatGPT ve Gemini daha güvenilir ve kapsamlı içerikler sunarken, Perplexity ve özellikle DeepSeek’in sınırlılıkları belirgindir. Bu nedenle YZ araçları, klinik karar desteğinde tek başına kullanılmamalı, uzman denetimi ve kılavuz temelli doğrulamalarla desteklenmelidir.
Objective: This study aims to comparatively evaluate the knowledge level, guideline compliance, scope, and consistency of responses provided by artificial intelligence-based large language models (ChatGPT, Gemini, Perplexity, DeepSeek) to questions related to occupational health and safety (OHS) in urological surgeries. Materials and Methods: Based on the literature and international guidelines (EAU, WHO, OSHA, etc.), 10 standardized questions covering biological, chemical, physical, ergonomic, environmental, and psychosocial risks were developed. These questions were presented to four different models on the same day and in the same format. The responses were blindly evaluated by three independent experts using DISCERN and Global Quality Score (GQS) criteria. Statistical analyses were performed using ANOVA/Kruskal–Wallis tests and Fleiss’ kappa. Results: ChatGPT and Gemini achieved the highest performance in both DISCERN and GQS scores. Perplexity demonstrated moderate performance, while DeepSeek showed the lowest quality and consistency. ChatGPT scored significantly higher than Perplexity and DeepSeek (p<0.01), and Gemini was also significantly superior to Perplexity and DeepSeek (p<0.05). No significant difference was found between ChatGPT and Gemini. Conclusion: AI-based large language models can provide supportive information on OHS in urological surgeries; however, there are notable quality differences among models. While ChatGPT and Gemini deliver more reliable and comprehensive content, the limitations of Perplexity and especially DeepSeek are evident. Therefore, AI tools should not be used as standalone decision-makers in clinical practice but should be supported by expert oversight and guideline-based validation.