Technology
Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği
Kaynağa bağlanmamış sıradan bir sohbet botunun güvenlik kritik mühendisliğe ne kattığını kontrollü bir deneyle ölçtüm.
Zorluk
Güvenlik kritik sistemler gereksinimleriyle ayakta durur: sonraki tüm mühendislik çalışmasının dayandığı, kesin ve tek anlamlı şartnameler. Büyük dil modelleri bu iş akışlarına girmeye başladıkça yaygın bir refleks doğdu - ekiplere bir sohbet botu açıp "kullanın" demek.
Sorulmayan soru şuydu: bu en yalın kurulum, yani hiçbir kaynağa bağlanmamış genel amaçlı bir asistan, güvenlik kritik bir işte gerçekte ne yapıyor? Yayımlanmış değerlendirmelerin çoğu kıyaslama puanlarında duruyor; modelin çıktısını ölçüyorlar, model sürece girdiğinde insanın ne yaptığını değil. Oysa asıl risk orada: NASA'nın konuyla ilgili raporunun belirttiği gibi otomasyon insan hatasını ortadan kaldırmıyor, onu denetim rolüne taşıyor. Bunu yanıtlamak bir sıralama tablosu değil, insanlı kontrollü bir deney gerektiriyordu.
Yaklaşımım
TUM'daki yüksek lisans tezim kapsamında, Fraunhofer IKS iş birliğiyle bu çalışmayı baştan sona kendim tasarladım ve yürüttüm: deney tasarımı, etik onay başvurusu, yazılım geliştirme, veri toplama ve istatistiksel analiz.
- Deney platformunu sıfırdan geliştirdim. Python ve Streamlit ile, katılımcıları onam formundan demografik ankete, iki göreve ve NASA-TLX yük ölçümlerine kadar taşıyan bir web uygulaması yazdım. Platform her adımı ve her sohbet mesajını zaman damgasıyla kaydetti; ölçüm beyana değil kayda dayandı.
- Test edilen kurulum bilinçli olarak en yalın olanıydı. Yapay zekâ grubuna, deney sayfasının yanına gömülü bir sohbet paneli açıldı - kurumsal bir arayüz üzerinden GPT-4o. Burada özel bir yapay zekâ sistemi kurulmadı: model, görevin dayandığı referans belgeye bağlı değildi, dosya okuyamıyordu, hiçbir araca ya da veri kaynağına erişimi yoktu. Katılımcılara bu açıkça bildirildi. Ölçülen şey buydu: bir ekibin eline hazır bir sohbet botu vermek.
- İki fazlı, gruplar arası tasarım. Faz 1'de katılımcılar bir şerit takip sistemi (LKA) için yedi güvenlik gereksinimi yazdı - bir grup sohbet paneliyle, diğeri desteksiz. Faz 2'de hiç kimse yapay zekâ kullanmadı: herkes önceden hazırlanmış 10 gereksinimi inceleyip hatalıları bulmaya ve düzeltmeye çalıştı. Asıl bulguyu bu ikinci faz ortaya çıkardı.
- Kalite gözle değil, rubrikle ölçüldü. Yazılan gereksinimler iki alan uzmanı tarafından yedi ağırlıklı ölçütte bağımsız puanlandı: yapı, açıklık, doğruluk, test edilebilirlik, kapsam uyumu.
- Etik ve veri koruma. Çalışma TUM Etik Kurulu'nun tıbbi olmayan alt komisyonundan onay aldı (2025-108-NM-BA). Hiçbir kişisel veri saklanmadı; katılımcılar rastgele kimliklerle temsil edildi.
Bulgular. Bağlantısız sohbet paneli gereksinim kalitesini ölçülebilir biçimde iyileştirmedi (p = 0,96) ve zaman kazandırmadı (p = 0,52). Bunun yerine üç şey oldu:
Bilişsel kayma. Botu kullananlar işi daha az zihinsel yük (50,8'e karşı 61,3) ve daha az çaba (36,7'ye karşı 49,5) ile yaptıklarını bildirdi - ama daha yüksek hayal kırıklığı yaşadılar (43,8'e karşı 30,7). Yük azalmadı, yer değiştirdi: boş sayfa yazma zahmeti gitti, yerine çıktıyı doğrulama yükü geldi. Kabul anketinde en düşük puanı alan madde de bunu doğruluyor: katılımcılar aracı "esnek" bulmadı (5 üzerinden 2,83).
Düşük güven. "Yapay zekâ asistanına güvenerek ilerlemekte kendimi rahat hissettim" ifadesi 5 üzerinden 2,00 aldı; buna karşılık çıktıyı kontrol etme oranı yüksekti. Güvenlik kritik bir bağlamda bu iyi haber: körü körüne güven otomatik bir sonuç değil. Kullanıcılar, kaynağını gösteremeyen bir araca hak ettiği kadar güveniyor.
Öğrenme açığı - çalışmanın ana bulgusu. Faz 2'de, bot herkesten alındığında, Faz 1'de onu kullanmış grup 190 üzerinden ortalama 54,7 aldı; hiç kullanmamış grup 75,5. Faz 1'de botla birinci olan katılımcı, desteksiz görevde on birinciliğe düştü. Desteksiz çalışmak zorunda kalan grup referans belgeyi elle okuyarak konuyu öğrenmişti; diğer grup işi araca devretmiş ve araç çekilince elinde bilgi kalmamıştı.
Sonucun doğru okunuşu. Bu çalışma yapay zekânın güvenlik kritik işlerde yararsız olduğunu göstermiyor. Gösterdiği şey daha dar ve daha kullanışlı: bir sohbet botunu iş akışının yanına koymak, tek başına bir yapay zekâ çözümü değildir. Modele işin dayandığı belgeyi vermezseniz, kaynağını göstermesini sağlamazsanız ve bilmediğinde durmasını şart koşmazsanız, elde ettiğiniz şey ölçülebilir bir kazanç değil; yer değiştirmiş bir yük ve zamanla aşınan bir bilgi birikimi oluyor. Tezin gelecek çalışma bölümünde test edilmemiş asıl değişken olarak işaret ettiği de tam olarak bu: kaynağa bağlama (grounding / RAG).
Bu sonuç, sonraki işlerimin yönünü belirledi: modeli kendi belleğine bırakmak yerine, soruyu alıp kaynağı o anda okuyan, cevabı maddesiyle veren ve bulamadığında bunu söyleyen sistemler kurmak.
Dürüst sınır: güç analizine göre hedef katılımcı sayısı 72'ydi; kurumsal ve zaman kısıtları nedeniyle 12'de kalındı. Bu, çalışmanın istatistiksel gücünü düşürüyor. Sonuçlar bu yüzden kesin kanıt değil, keşifsel bulgu olarak sunulmalıdır - tezde de böyle sunuldu.
Teknoloji: Python, Streamlit, GPT-4o (Fraunhofer FhGenie üzerinden), NASA-TLX ve Teknoloji Kabul Modeli ölçekleri, bağımsız örneklem t-testleri.
Projeniz için benzer sonuçlar mı istiyorsunuz?
Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.
Keşfetmeye devam edin
Daha fazla proje.
Demiryolu katener direği yerleşimi otomasyonu
Haftalar süren uzman mühendislik işi, saniyelere indi.
D-Risk - Yapay Zeka Destekli Şirket Profillemesiyle MedTech Pazaryeri
Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.
Entegre LoRa Sensör İzleme ve Analitik Sistemi
Ağaçlara takılı LoRa sensörlerinden gelen ham veriyi, bir hafta içinde sulama ve büyüme kararına dönüşen canlı panolara çevirdik.
Gelir İdaresi MCP Sunucusu
Türk vergi mevzuatını soru anında resmi kaynağından okuyup cevabı maddesiyle veren asistan - bir mali müşavirin günlük işinde kullandığı bir sistem.
DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu
Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.
Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı
PDF yığınlarını, her cevabı kaynak belgeye dayanan aranabilir bir bilgi tabanına çeviren RAG asistanı.
Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu
Kullanım Koşulları maddelerini sınıflandırmada, modeli hiç yeniden eğitmeden yalnızca prompt'u otomatik optimize ederek F1'i 0,62'den 0,76'ya çıkaran karşılaştı
NLP ile Akıllı Sözleşme Analizi
Siemens hukuk ekibinin geçmiş sözleşme revizyonlarından öğrenip yeni bir sözleşmede aynı maddeleri işaretleyen, daha önce yapılmış düzeltmeyi öneren bir sistem.
Futbolcu Potansiyeli Tahmin Modeli
Gözlemcilerin verdiği 39 nitelik puanından bir oyuncunun "öne çıkan" olarak işaretlenip işaretlenmeyeceğini tahmin eden, ROC-AUC 0,86 alan sınıflandırma modeli.
Futbolcu Sıralama Sistemi
Bir oyuncuyu toplam puanına göre değil, kaç nitelikte kendi mevkisinin istatistiksel ortalamasının üstüne çıktığına göre sıralayan puanlama motoru.
Futbolcu Mevki Öneri Sistemi
Bir oyuncunun nitelik profilini diğer mevkilerin profilleriyle karşılaştırıp, başka bir rolde daha değerli olabilecek oyuncuları öne çıkaran öneri sistemi.
Otomatik Aktarma Uçuşu Optimizasyonu
Bir uçuşun saati kaydırıldığında hub üzerinden kurulabilecek tüm bağlantıları, gün gün ve yolcu sayısıyla birlikte yeniden hesaplayan araç.
Uçuş Yolcu Sayısı Tahmini
Tek aktarmalı rotalarda rezerve yolcu sayısını uçuşun kendi özelliklerinden tahmin eden, 11 regresyon modelinin karşılaştırılmasıyla seçilmiş bir talep modeli.
MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması
MS COCO'nun tamamı için insan doğrulamalı Türkçe altyazı veri seti ve üzerinde eğitilen beş modelle Türkçe görsel altyazılamada yeni bir referans noktası.
ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu
Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.
Otomatik ESG Puanlama Sistemi - HackBoğaziçi
Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.