Tüm projeler

Technology

Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği

Kaynağa bağlanmamış sıradan bir sohbet botunun güvenlik kritik mühendisliğe ne kattığını kontrollü bir deneyle ölçtüm.

Fraunhofer IKS, Munich Yapay Zekâ Araştırması ve İnsan-Döngüde Değerlendirme
Gereksinim Mühendisliği LLM Streamlit Yapay Zekâ Araştırması Yapay Zekâ Güvenliği İnsan-Döngüde
Güvenlik Kritik Süreçlerde LLM Güvenilirliği

Zorluk

Güvenlik kritik sistemler gereksinimleriyle ayakta durur: sonraki tüm mühendislik çalışmasının dayandığı, kesin ve tek anlamlı şartnameler. Büyük dil modelleri bu iş akışlarına girmeye başladıkça yaygın bir refleks doğdu - ekiplere bir sohbet botu açıp "kullanın" demek.

Sorulmayan soru şuydu: bu en yalın kurulum, yani hiçbir kaynağa bağlanmamış genel amaçlı bir asistan, güvenlik kritik bir işte gerçekte ne yapıyor? Yayımlanmış değerlendirmelerin çoğu kıyaslama puanlarında duruyor; modelin çıktısını ölçüyorlar, model sürece girdiğinde insanın ne yaptığını değil. Oysa asıl risk orada: NASA'nın konuyla ilgili raporunun belirttiği gibi otomasyon insan hatasını ortadan kaldırmıyor, onu denetim rolüne taşıyor. Bunu yanıtlamak bir sıralama tablosu değil, insanlı kontrollü bir deney gerektiriyordu.

Yaklaşımım

TUM'daki yüksek lisans tezim kapsamında, Fraunhofer IKS iş birliğiyle bu çalışmayı baştan sona kendim tasarladım ve yürüttüm: deney tasarımı, etik onay başvurusu, yazılım geliştirme, veri toplama ve istatistiksel analiz.

  1. Deney platformunu sıfırdan geliştirdim. Python ve Streamlit ile, katılımcıları onam formundan demografik ankete, iki göreve ve NASA-TLX yük ölçümlerine kadar taşıyan bir web uygulaması yazdım. Platform her adımı ve her sohbet mesajını zaman damgasıyla kaydetti; ölçüm beyana değil kayda dayandı.
  2. Test edilen kurulum bilinçli olarak en yalın olanıydı. Yapay zekâ grubuna, deney sayfasının yanına gömülü bir sohbet paneli açıldı - kurumsal bir arayüz üzerinden GPT-4o. Burada özel bir yapay zekâ sistemi kurulmadı: model, görevin dayandığı referans belgeye bağlı değildi, dosya okuyamıyordu, hiçbir araca ya da veri kaynağına erişimi yoktu. Katılımcılara bu açıkça bildirildi. Ölçülen şey buydu: bir ekibin eline hazır bir sohbet botu vermek.
  3. İki fazlı, gruplar arası tasarım. Faz 1'de katılımcılar bir şerit takip sistemi (LKA) için yedi güvenlik gereksinimi yazdı - bir grup sohbet paneliyle, diğeri desteksiz. Faz 2'de hiç kimse yapay zekâ kullanmadı: herkes önceden hazırlanmış 10 gereksinimi inceleyip hatalıları bulmaya ve düzeltmeye çalıştı. Asıl bulguyu bu ikinci faz ortaya çıkardı.
  4. Kalite gözle değil, rubrikle ölçüldü. Yazılan gereksinimler iki alan uzmanı tarafından yedi ağırlıklı ölçütte bağımsız puanlandı: yapı, açıklık, doğruluk, test edilebilirlik, kapsam uyumu.
  5. Etik ve veri koruma. Çalışma TUM Etik Kurulu'nun tıbbi olmayan alt komisyonundan onay aldı (2025-108-NM-BA). Hiçbir kişisel veri saklanmadı; katılımcılar rastgele kimliklerle temsil edildi.

Bulgular. Bağlantısız sohbet paneli gereksinim kalitesini ölçülebilir biçimde iyileştirmedi (p = 0,96) ve zaman kazandırmadı (p = 0,52). Bunun yerine üç şey oldu:

Bilişsel kayma. Botu kullananlar işi daha az zihinsel yük (50,8'e karşı 61,3) ve daha az çaba (36,7'ye karşı 49,5) ile yaptıklarını bildirdi - ama daha yüksek hayal kırıklığı yaşadılar (43,8'e karşı 30,7). Yük azalmadı, yer değiştirdi: boş sayfa yazma zahmeti gitti, yerine çıktıyı doğrulama yükü geldi. Kabul anketinde en düşük puanı alan madde de bunu doğruluyor: katılımcılar aracı "esnek" bulmadı (5 üzerinden 2,83).

Düşük güven. "Yapay zekâ asistanına güvenerek ilerlemekte kendimi rahat hissettim" ifadesi 5 üzerinden 2,00 aldı; buna karşılık çıktıyı kontrol etme oranı yüksekti. Güvenlik kritik bir bağlamda bu iyi haber: körü körüne güven otomatik bir sonuç değil. Kullanıcılar, kaynağını gösteremeyen bir araca hak ettiği kadar güveniyor.

Öğrenme açığı - çalışmanın ana bulgusu. Faz 2'de, bot herkesten alındığında, Faz 1'de onu kullanmış grup 190 üzerinden ortalama 54,7 aldı; hiç kullanmamış grup 75,5. Faz 1'de botla birinci olan katılımcı, desteksiz görevde on birinciliğe düştü. Desteksiz çalışmak zorunda kalan grup referans belgeyi elle okuyarak konuyu öğrenmişti; diğer grup işi araca devretmiş ve araç çekilince elinde bilgi kalmamıştı.

Sonucun doğru okunuşu. Bu çalışma yapay zekânın güvenlik kritik işlerde yararsız olduğunu göstermiyor. Gösterdiği şey daha dar ve daha kullanışlı: bir sohbet botunu iş akışının yanına koymak, tek başına bir yapay zekâ çözümü değildir. Modele işin dayandığı belgeyi vermezseniz, kaynağını göstermesini sağlamazsanız ve bilmediğinde durmasını şart koşmazsanız, elde ettiğiniz şey ölçülebilir bir kazanç değil; yer değiştirmiş bir yük ve zamanla aşınan bir bilgi birikimi oluyor. Tezin gelecek çalışma bölümünde test edilmemiş asıl değişken olarak işaret ettiği de tam olarak bu: kaynağa bağlama (grounding / RAG).

Bu sonuç, sonraki işlerimin yönünü belirledi: modeli kendi belleğine bırakmak yerine, soruyu alıp kaynağı o anda okuyan, cevabı maddesiyle veren ve bulamadığında bunu söyleyen sistemler kurmak.

Dürüst sınır: güç analizine göre hedef katılımcı sayısı 72'ydi; kurumsal ve zaman kısıtları nedeniyle 12'de kalındı. Bu, çalışmanın istatistiksel gücünü düşürüyor. Sonuçlar bu yüzden kesin kanıt değil, keşifsel bulgu olarak sunulmalıdır - tezde de böyle sunuldu.

Teknoloji: Python, Streamlit, GPT-4o (Fraunhofer FhGenie üzerinden), NASA-TLX ve Teknoloji Kabul Modeli ölçekleri, bağımsız örneklem t-testleri.

Projeniz için benzer sonuçlar mı istiyorsunuz?

Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.

Keşfetmeye devam edin

Daha fazla proje.

Other · Bir demiryolu altyapı mühendislik firması

Demiryolu katener direği yerleşimi otomasyonu

Haftalar süren uzman mühendislik işi, saniyelere indi.

Görüntüle
Healthcare · DECOTO INTERNATIONAL

D-Risk - Yapay Zeka Destekli Şirket Profillemesiyle MedTech Pazaryeri

Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.

Görüntüle
Technology · OTTRONIC E-Systems (TUM 1000+ Project Week)

Entegre LoRa Sensör İzleme ve Analitik Sistemi

Ağaçlara takılı LoRa sensörlerinden gelen ham veriyi, bir hafta içinde sulama ve büyüme kararına dönüşen canlı panolara çevirdik.

Görüntüle
Finance & Fintech · Bir mali müşavir

Gelir İdaresi MCP Sunucusu

Türk vergi mevzuatını soru anında resmi kaynağından okuyup cevabı maddesiyle veren asistan - bir mali müşavirin günlük işinde kullandığı bir sistem.

Görüntüle
Technology · Fraunhofer IKS, Munich

DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu

Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.

Görüntüle
Technology · Bağımsız proje

Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı

PDF yığınlarını, her cevabı kaynak belgeye dayanan aranabilir bir bilgi tabanına çeviren RAG asistanı.

Görüntüle
Technology · Technical University of Munich

Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu

Kullanım Koşulları maddelerini sınıflandırmada, modeli hiç yeniden eğitmeden yalnızca prompt'u otomatik optimize ederek F1'i 0,62'den 0,76'ya çıkaran karşılaştı

Görüntüle
Technology · Siemens

NLP ile Akıllı Sözleşme Analizi

Siemens hukuk ekibinin geçmiş sözleşme revizyonlarından öğrenip yeni bir sözleşmede aynı maddeleri işaretleyen, daha önce yapılmış düzeltmeyi öneren bir sistem.

Görüntüle
Other · Scoutium

Futbolcu Potansiyeli Tahmin Modeli

Gözlemcilerin verdiği 39 nitelik puanından bir oyuncunun "öne çıkan" olarak işaretlenip işaretlenmeyeceğini tahmin eden, ROC-AUC 0,86 alan sınıflandırma modeli.

Görüntüle
Other · SCOUTIUM

Futbolcu Sıralama Sistemi

Bir oyuncuyu toplam puanına göre değil, kaç nitelikte kendi mevkisinin istatistiksel ortalamasının üstüne çıktığına göre sıralayan puanlama motoru.

Görüntüle
Other · Scoutium

Futbolcu Mevki Öneri Sistemi

Bir oyuncunun nitelik profilini diğer mevkilerin profilleriyle karşılaştırıp, başka bir rolde daha değerli olabilecek oyuncuları öne çıkaran öneri sistemi.

Görüntüle
Other · Turkish Airlines

Otomatik Aktarma Uçuşu Optimizasyonu

Bir uçuşun saati kaydırıldığında hub üzerinden kurulabilecek tüm bağlantıları, gün gün ve yolcu sayısıyla birlikte yeniden hesaplayan araç.

Görüntüle
Other · Turkish Airlines

Uçuş Yolcu Sayısı Tahmini

Tek aktarmalı rotalarda rezerve yolcu sayısını uçuşun kendi özelliklerinden tahmin eden, 11 regresyon modelinin karşılaştırılmasıyla seçilmiş bir talep modeli.

Görüntüle
Technology · İstanbul Bilgi Üniversitesi

MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması

MS COCO'nun tamamı için insan doğrulamalı Türkçe altyazı veri seti ve üzerinde eğitilen beş modelle Türkçe görsel altyazılamada yeni bir referans noktası.

Görüntüle
Finance & Fintech · CFA Poland (hackathon)

ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu

Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.

Görüntüle
Other · Boğaziçi Üniversitesi Bilişim Kulübü (hackathon)

Otomatik ESG Puanlama Sistemi - HackBoğaziçi

Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.

Görüntüle