Technology
Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu
Kullanım Koşulları maddelerini sınıflandırmada, modeli hiç yeniden eğitmeden yalnızca prompt'u otomatik optimize ederek F1'i 0,62'den 0,76'ya çıkaran karşılaştı
Zorluk
Kimse Kullanım Koşulları'nı okumuyor - ama içlerinde gerçekten önemli maddeler var: tek taraflı değişiklik hakkı, tahkim zorunluluğu, sorumluluk sınırlaması, hesabınızın habersiz kapatılabilmesi. Bu maddeleri otomatik ayırt edebilen bir sistem, insanların neye "kabul ediyorum" dediğini görmesini sağlar.
Doğal çözüm bir dil modeline sormaktır, ama hazır prompt'larla sonuç dengesizdi: bazı madde türlerinde iyi, bazılarında zayıf. Modeli bu iş için yeniden eğitmek ise pahalı ve her kurumun yapabileceği bir şey değil.
Araştırma sorusu buradan çıktı: modele hiç dokunmadan, yalnızca prompt'u sistematik biçimde optimize ederek ne kadar yol alınabilir?
Yaklaşımım
Münih Teknik Üniversitesi'ndeki uygulamalı araştırma dersi kapsamında, hukuki madde sınıflandırmasında otomatik prompt optimizasyon yöntemlerini karşılaştırmalı olarak değerlendirdim.
- Gerçek bir hukuki veri seti. CLAUDETTE üzerinde çalıştım - Kullanım Koşulları maddelerinin adil/adil olmayan biçiminde etiketlendiği akademik bir veri seti. İki kurulum kurdum: ikili (adil / adil değil) ve dokuz sınıflı çok etiketli - tahkim, tek taraflı değişiklik, içerik kaldırma, yargı yetkisi, hukuk seçimi, sorumluluk sınırlaması, tek taraflı fesih, kullanımla sözleşme.
- Önce dürüst referans noktaları kurdum. Prompt optimizasyonunun gerçekten bir şey kattığını iddia edebilmek için neyi geçmesi gerektiğini bilmek gerekiyordu: klasik TF-IDF + SVM, hukuk alanına özel eğitilmiş LegalBERT, ve sıfır/az örnekli düz prompt'lama.
- Dört otomatik optimizasyon yöntemini karşılaştırdım. PromptAgent (prompt uzayında Monte Carlo ağaç araması), EvoPrompt (evrimsel arama), metinsel gradyan yaklaşımı (modelin kendi hata analizinden prompt'u iyileştirme) ve OPRO. Hepsi aynı veri, aynı bölünme ve aynı metriklerle değerlendirildi.
- Çıktıyı ölçülebilir hale getirdim. Model, serbest metin yerine şemaya bağlı JSON döndürecek biçimde çalıştırıldı: sınıf etiketi ve gerekçe. Böylece sonuçlar elle yorumlanmadan doğruluk, kesinlik, duyarlılık ve F1 olarak otomatik puanlanabildi.
Sonuç: en iyi otomatik optimize edilmiş prompt, başlangıç prompt'una göre doğruluğu 0,650'den 0,755'e, F1'i 0,622'den 0,755'e taşıdı - F1'de yaklaşık %21 bağıl iyileşme. Modele tek bir eğitim adımı uygulanmadan.
Pratik çıkarım şu: bir dil modelinden aldığınız sonucun kalitesi büyük ölçüde nasıl sorduğunuza bağlı ve bu "nasıl", sezgiyle değil ölçümle bulunabilir. Aynı yaklaşım, modeli değiştirmeye bütçesi olmayan her sınıflandırma işine uygulanabilir.
Teknoloji: Python, Llama-3.3-70B ve 3.1-8B (API), PromptAgent, EvoPrompt, OPRO, LegalBERT, scikit-learn, şemalı JSON çıktı.
Projeniz için benzer sonuçlar mı istiyorsunuz?
Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.
Keşfetmeye devam edin
Daha fazla proje.
Demiryolu katener direği yerleşimi otomasyonu
Haftalar süren uzman mühendislik işi, saniyelere indi.
D-Risk - Yapay Zeka Destekli Şirket Profillemesiyle MedTech Pazaryeri
Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.
Entegre LoRa Sensör İzleme ve Analitik Sistemi
Ağaçlara takılı LoRa sensörlerinden gelen ham veriyi, bir hafta içinde sulama ve büyüme kararına dönüşen canlı panolara çevirdik.
Gelir İdaresi MCP Sunucusu
Türk vergi mevzuatını soru anında resmi kaynağından okuyup cevabı maddesiyle veren asistan - bir mali müşavirin günlük işinde kullandığı bir sistem.
Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği
Kaynağa bağlanmamış sıradan bir sohbet botunun güvenlik kritik mühendisliğe ne kattığını kontrollü bir deneyle ölçtüm.
DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu
Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.
Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı
PDF yığınlarını, her cevabı kaynak belgeye dayanan aranabilir bir bilgi tabanına çeviren RAG asistanı.
NLP ile Akıllı Sözleşme Analizi
Siemens hukuk ekibinin geçmiş sözleşme revizyonlarından öğrenip yeni bir sözleşmede aynı maddeleri işaretleyen, daha önce yapılmış düzeltmeyi öneren bir sistem.
Futbolcu Potansiyeli Tahmin Modeli
Gözlemcilerin verdiği 39 nitelik puanından bir oyuncunun "öne çıkan" olarak işaretlenip işaretlenmeyeceğini tahmin eden, ROC-AUC 0,86 alan sınıflandırma modeli.
Futbolcu Sıralama Sistemi
Bir oyuncuyu toplam puanına göre değil, kaç nitelikte kendi mevkisinin istatistiksel ortalamasının üstüne çıktığına göre sıralayan puanlama motoru.
Futbolcu Mevki Öneri Sistemi
Bir oyuncunun nitelik profilini diğer mevkilerin profilleriyle karşılaştırıp, başka bir rolde daha değerli olabilecek oyuncuları öne çıkaran öneri sistemi.
Otomatik Aktarma Uçuşu Optimizasyonu
Bir uçuşun saati kaydırıldığında hub üzerinden kurulabilecek tüm bağlantıları, gün gün ve yolcu sayısıyla birlikte yeniden hesaplayan araç.
Uçuş Yolcu Sayısı Tahmini
Tek aktarmalı rotalarda rezerve yolcu sayısını uçuşun kendi özelliklerinden tahmin eden, 11 regresyon modelinin karşılaştırılmasıyla seçilmiş bir talep modeli.
MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması
MS COCO'nun tamamı için insan doğrulamalı Türkçe altyazı veri seti ve üzerinde eğitilen beş modelle Türkçe görsel altyazılamada yeni bir referans noktası.
ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu
Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.
Otomatik ESG Puanlama Sistemi - HackBoğaziçi
Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.