Technology
Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu
Kullanım Koşulları belgelerinde hukuki madde sınıflandırma doğruluğunu %20'ye kadar artıran bir prompt mühendisliği araştırması.
%20'ye kadar · Metrik iyileştirmesi
Zorluk
Kullanım Koşulları belgeleri, birbirinden çok farklı hukuki ağırlığa sahip maddelerle doludur ve bunları doğru şekilde sınıflandırmak, insanların neyi kabul ettiğini anlamalarına yardımcı olacak her aracın temelini oluşturur. Hazır LLM prompt'ları bu görevi dengesiz bir şekilde yerine getiriyordu - bazı madde türlerinde güçlü, bazılarında zayıftı - bu da sonuçlara ne ölçüde güvenilebileceğini sınırlıyordu.
Araştırma sorusu pratikti: altta yatan modeli yeniden eğitmeden veya ince ayar yapmadan, yalnızca özenli prompt tasarımı sınıflandırma kalitesini ne kadar iyileştirebilir?
Yaklaşımım
Technical University of Munich'te, Kullanım Koşulları belgelerindeki hukuki maddeleri sınıflandırmak için doğruluk, kesinlik (precision), duyarlılık (recall) ve F1 skorunu iyileştirecek LLM prompt'ları optimize ettim. Modeli değiştirmek yerine prompt-stratejisi optimizasyonuna ve yinelemeli geri bildirim döngülerine odaklandım.
Çalışmayı ölçülebilir, geri bildirime dayalı bir döngü olarak yürüttüm: bir prompt stratejisini metriklere karşı test et, nerede başarısız olduğunu analiz et, prompt'u iyileştir ve tekrarla. İyileştirmelerin görevin tek bir çerçevelemesine aşırı uyum sağlamak yerine genellenebilir olduğundan emin olmak için hem ikili hem de çok etiketli sınıflandırma kurulumlarında değerlendirme yaptım.
Bu yinelemeli yaklaşım, hem ikili hem de çok etiketli görevlerde temel metriklerde %20'ye varan bir iyileştirme sağladı; bu da herhangi bir model değişikliğine gerek kalmadan disiplinli prompt mühendisliğinin ne kadar alan açabileceğini gösterdi.
Sonuç
Fark yaratan sonuçlar.
- %20'ye kadar
-
Metrik iyileştirmesi
Madde sınıflandırmasında doğruluk, kesinlik, duyarlılık ve F1 genelinde
- İkili + çok etiketli
-
Optimize edilen görevler
Kazanımlar her iki sınıflandırma kurulumunda da geçerliydi
- Yinelemeli
-
Prompt-stratejisi döngüsü
Model yeniden eğitimi yerine geri bildirime dayalı prompt iyileştirme
Projeniz için benzer sonuçlar mı istiyorsunuz?
Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.
Keşfetmeye devam edin
Daha fazla proje.
Demiryolu katener direği yerleşimi, otomatikleştirildi
Günler süren uzman mühendislik işi, saniyelere indi.
D-Risk - Yapay Zekâ Destekli Şirket Profillemesiyle MedTech Pazaryeri
Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.
Entegre LoRa Sensör İzleme ve Analitik Sistemi
LoRa çevresel sensörleri için gerçek zamanlı izleme ve analitik - ham veri alımından coğrafi konumlu kuraklık ve büyüme öngörülerine kadar.
Gelir İdaresi MCP Sunucusu
Türk vergi ve mevzuat sorularını yalnızca resmi devlet kaynaklarından yanıtlayan, sadece bilgi getirimi yapan bir MCP sunucusu - sıfır halüsinasyon.
Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği
LLM desteğinin güvenlik kritik gereksinim mühendisliğinde doğruluk, verimlilik ve güveni nasıl etkilediğini ölçen yüksek lisans tez araştırması.
DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu
Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.
Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı
PDF kütüphanelerini doğru ve kaynağa dayalı bir bilgi tabanına dönüştüren, Gemini destekli bir RAG asistanı.
NLP ile Akıllı Sözleşme Analizi
İş sözleşmelerini inceleyen ve şirket politikalarına uygunluğu sağlamak için değişiklik öneren bir NLP sistemi.
Futbolcu Potansiyeli Tahmin Modeli
Gözlem niteliklerini okuyarak oyuncu yetenek düzeyini yaklaşık %85 doğrulukla tahmin eden bir makine öğrenmesi modeli.
Futbolcu Sıralama Sistemi
750'den fazla oyuncuyu sıralayan ve öne çıkan nitelikleri istatistiksel bir bonus eşiğiyle ödüllendiren nitelik tabanlı bir puanlama motoru.
Futbolcu Mevki Öneri Sistemi
750'den fazla oyuncunun niteliklerini mevkiye göre analiz eden ve alternatif bir rolde başarılı olacak oyuncuları öne çıkaran bir öneri sistemi.
Otomatik Aktarma Uçuşu Optimizasyonu
Tarife saatleri değiştiği anda 1000'den fazla uçuş arasında geçerli aktarmaları yeniden hesaplayan otomatik bir sistem.
Uçuş Yolcu Sayısı Tahmini
Operasyonel uçuş özelliklerinden uçuş başına yolcu sayısını tahmin eden bir scikit-learn regresyon modeli.
MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması
Büyük ölçekli bir Türkçe görsel altyazılama kıyaslaması - 616.767 insan onaylı altyazı ve beş eğitilmiş görsel-dil modeli.
ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu
Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.
Otomatik ESG Puanlama Sistemi - HackBoğaziçi
Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.