Technology
Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği
LLM desteğinin güvenlik kritik gereksinim mühendisliğinde doğruluk, verimlilik ve güveni nasıl etkilediğini ölçen yüksek lisans tez araştırması.
~15% · Verimlilik artışı
Zorluk
Güvenlik kritik sistemler, kendilerini oluşturan gereksinimlerle yaşar ya da ölür: sonraki tüm mühendislik çalışmalarının dayandığı hassas ve net şartnameler. Büyük Dil Modelleri mühendislik iş akışlarına girmeye başladıkça, Fraunhofer IKS'nin yüksek riskli bir soruya kanıta dayalı bir yanıta ihtiyacı vardı - LLM'ler mühendislere gerçekten daha iyi gereksinimler yazmakta yardımcı mı oluyor, yoksa aşırı güven, ince hatalar ve yersiz güven gibi yeni hata biçimleri mi doğuruyor?
Yayımlanmış LLM değerlendirmelerinin çoğu kıyaslama puanlarında duruyor. Bir model sürece dahil olduğunda insan mühendislerin gerçekte nasıl davrandığı ya da bu davranışın mühendisin kendi deneyimiyle nasıl değiştiği hakkında çok az şey söylüyorlar. Bunu yanıtlamak, bir sıralama tablosu değil, kontrollü bir insan çalışması gerektiriyordu.
Yaklaşımım
Fraunhofer IKS'teki yüksek lisans tezim için, güvenlik kritik gereksinim mühendisliğinde LLM'lerin güvenilirliği üzerine uçtan uca bir çalışma tasarladım ve yürüttüm; çalışmayı tasarımdan ve etik onaydan nihai veri analizine kadar taşıdım.
Katılımcıları kontrollü koşullar altında gereksinim mühendisliği görevlerinden geçiren, LLM destekli iş akışlarını yalnızca insan gücüyle yürütülenlerle karşılaştıran özel bir deney platformunu Streamlit'te geliştirip devreye aldım. Platform her etkileşimi kaydetti; böylece LLM'nin doğruluk, verimlilik, kullanıcı güveni ve öğrenme üzerindeki etkisini, kişisel beyanlara dayanmadan ölçebildim.
Sonuçların analizi, LLM desteğiyle çalışan deneyimli mühendislerde yaklaşık %15'lik bir verimlilik artışı gösterdi - ancak aynı destek, kullanıcı uzmanlığı düştükçe büyüyen belirgin bir aşırı güven riski üretti; deneyimi daha az olan katılımcılar hatalı model çıktısını sorgulamadan kabul etmeye daha yatkındı. Sonuç: güvenlik kritik işlerde LLM faydası gerçek ama kullanıcı uzmanlığına bağlı.
Sonuç
Fark yaratan sonuçlar.
- ~15%
-
Verimlilik artışı
Gereksinim görevlerinde LLM desteği kullanan deneyimli mühendisler için
- Aşırı Güven
-
Ölçülen temel risk
Kullanıcı uzmanlığı düştükçe arttı, en güçlü şekilde deneyimi az olanlarda
- 4
-
Ölçülen boyut
Kontrollü koşullarda doğruluk, verimlilik, kullanıcı güveni ve öğrenme
- Uçtan Uca
-
Teslim edilen çalışma
Çalışma tasarımı ve etik onaydan veri analizine kadar
Projeniz için benzer sonuçlar mı istiyorsunuz?
Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.
Keşfetmeye devam edin
Daha fazla proje.
Demiryolu katener direği yerleşimi, otomatikleştirildi
Günler süren uzman mühendislik işi, saniyelere indi.
D-Risk - Yapay Zekâ Destekli Şirket Profillemesiyle MedTech Pazaryeri
Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.
Entegre LoRa Sensör İzleme ve Analitik Sistemi
LoRa çevresel sensörleri için gerçek zamanlı izleme ve analitik - ham veri alımından coğrafi konumlu kuraklık ve büyüme öngörülerine kadar.
Gelir İdaresi MCP Sunucusu
Türk vergi ve mevzuat sorularını yalnızca resmi devlet kaynaklarından yanıtlayan, sadece bilgi getirimi yapan bir MCP sunucusu - sıfır halüsinasyon.
DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu
Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.
Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı
PDF kütüphanelerini doğru ve kaynağa dayalı bir bilgi tabanına dönüştüren, Gemini destekli bir RAG asistanı.
Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu
Kullanım Koşulları belgelerinde hukuki madde sınıflandırma doğruluğunu %20'ye kadar artıran bir prompt mühendisliği araştırması.
NLP ile Akıllı Sözleşme Analizi
İş sözleşmelerini inceleyen ve şirket politikalarına uygunluğu sağlamak için değişiklik öneren bir NLP sistemi.
Futbolcu Potansiyeli Tahmin Modeli
Gözlem niteliklerini okuyarak oyuncu yetenek düzeyini yaklaşık %85 doğrulukla tahmin eden bir makine öğrenmesi modeli.
Futbolcu Sıralama Sistemi
750'den fazla oyuncuyu sıralayan ve öne çıkan nitelikleri istatistiksel bir bonus eşiğiyle ödüllendiren nitelik tabanlı bir puanlama motoru.
Futbolcu Mevki Öneri Sistemi
750'den fazla oyuncunun niteliklerini mevkiye göre analiz eden ve alternatif bir rolde başarılı olacak oyuncuları öne çıkaran bir öneri sistemi.
Otomatik Aktarma Uçuşu Optimizasyonu
Tarife saatleri değiştiği anda 1000'den fazla uçuş arasında geçerli aktarmaları yeniden hesaplayan otomatik bir sistem.
Uçuş Yolcu Sayısı Tahmini
Operasyonel uçuş özelliklerinden uçuş başına yolcu sayısını tahmin eden bir scikit-learn regresyon modeli.
MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması
Büyük ölçekli bir Türkçe görsel altyazılama kıyaslaması - 616.767 insan onaylı altyazı ve beş eğitilmiş görsel-dil modeli.
ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu
Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.
Otomatik ESG Puanlama Sistemi - HackBoğaziçi
Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.