Tüm projeler

Technology

Hukuki Madde Sınıflandırması için LLM Prompt Optimizasyonu

Kullanım Koşulları maddelerini sınıflandırmada, modeli hiç yeniden eğitmeden yalnızca prompt'u otomatik optimize ederek F1'i 0,62'den 0,76'ya çıkaran karşılaştı

Technical University of Munich NLP Araştırması ve Prompt Mühendisliği
Hukuk Teknolojisi LLM Metin Sınıflandırma NLP Prompt Mühendisliği Yapay Zekâ Araştırması
Hukuki Madde Sınıflandırması

Zorluk

Kimse Kullanım Koşulları'nı okumuyor - ama içlerinde gerçekten önemli maddeler var: tek taraflı değişiklik hakkı, tahkim zorunluluğu, sorumluluk sınırlaması, hesabınızın habersiz kapatılabilmesi. Bu maddeleri otomatik ayırt edebilen bir sistem, insanların neye "kabul ediyorum" dediğini görmesini sağlar.

Doğal çözüm bir dil modeline sormaktır, ama hazır prompt'larla sonuç dengesizdi: bazı madde türlerinde iyi, bazılarında zayıf. Modeli bu iş için yeniden eğitmek ise pahalı ve her kurumun yapabileceği bir şey değil.

Araştırma sorusu buradan çıktı: modele hiç dokunmadan, yalnızca prompt'u sistematik biçimde optimize ederek ne kadar yol alınabilir?

Yaklaşımım

Münih Teknik Üniversitesi'ndeki uygulamalı araştırma dersi kapsamında, hukuki madde sınıflandırmasında otomatik prompt optimizasyon yöntemlerini karşılaştırmalı olarak değerlendirdim.

  1. Gerçek bir hukuki veri seti. CLAUDETTE üzerinde çalıştım - Kullanım Koşulları maddelerinin adil/adil olmayan biçiminde etiketlendiği akademik bir veri seti. İki kurulum kurdum: ikili (adil / adil değil) ve dokuz sınıflı çok etiketli - tahkim, tek taraflı değişiklik, içerik kaldırma, yargı yetkisi, hukuk seçimi, sorumluluk sınırlaması, tek taraflı fesih, kullanımla sözleşme.
  2. Önce dürüst referans noktaları kurdum. Prompt optimizasyonunun gerçekten bir şey kattığını iddia edebilmek için neyi geçmesi gerektiğini bilmek gerekiyordu: klasik TF-IDF + SVM, hukuk alanına özel eğitilmiş LegalBERT, ve sıfır/az örnekli düz prompt'lama.
  3. Dört otomatik optimizasyon yöntemini karşılaştırdım. PromptAgent (prompt uzayında Monte Carlo ağaç araması), EvoPrompt (evrimsel arama), metinsel gradyan yaklaşımı (modelin kendi hata analizinden prompt'u iyileştirme) ve OPRO. Hepsi aynı veri, aynı bölünme ve aynı metriklerle değerlendirildi.
  4. Çıktıyı ölçülebilir hale getirdim. Model, serbest metin yerine şemaya bağlı JSON döndürecek biçimde çalıştırıldı: sınıf etiketi ve gerekçe. Böylece sonuçlar elle yorumlanmadan doğruluk, kesinlik, duyarlılık ve F1 olarak otomatik puanlanabildi.

Sonuç: en iyi otomatik optimize edilmiş prompt, başlangıç prompt'una göre doğruluğu 0,650'den 0,755'e, F1'i 0,622'den 0,755'e taşıdı - F1'de yaklaşık %21 bağıl iyileşme. Modele tek bir eğitim adımı uygulanmadan.

Pratik çıkarım şu: bir dil modelinden aldığınız sonucun kalitesi büyük ölçüde nasıl sorduğunuza bağlı ve bu "nasıl", sezgiyle değil ölçümle bulunabilir. Aynı yaklaşım, modeli değiştirmeye bütçesi olmayan her sınıflandırma işine uygulanabilir.

Teknoloji: Python, Llama-3.3-70B ve 3.1-8B (API), PromptAgent, EvoPrompt, OPRO, LegalBERT, scikit-learn, şemalı JSON çıktı.

Projeniz için benzer sonuçlar mı istiyorsunuz?

Yukarıdaki her proje bir görüşmeyle başladı. Sizinkinin neye ihtiyacı olduğunu birlikte bulalım.

Keşfetmeye devam edin

Daha fazla proje.

Other · Bir demiryolu altyapı mühendislik firması

Demiryolu katener direği yerleşimi otomasyonu

Haftalar süren uzman mühendislik işi, saniyelere indi.

Görüntüle
Healthcare · DECOTO INTERNATIONAL

D-Risk - Yapay Zeka Destekli Şirket Profillemesiyle MedTech Pazaryeri

Medtech girişimlerini yatırımcılar ve uzman freelancer'larla buluşturan üç taraflı pazaryeri - eşleştirme yapay zekâ belge profillemesiyle yapılıyor.

Görüntüle
Technology · OTTRONIC E-Systems (TUM 1000+ Project Week)

Entegre LoRa Sensör İzleme ve Analitik Sistemi

Ağaçlara takılı LoRa sensörlerinden gelen ham veriyi, bir hafta içinde sulama ve büyüme kararına dönüşen canlı panolara çevirdik.

Görüntüle
Finance & Fintech · Bir mali müşavir

Gelir İdaresi MCP Sunucusu

Türk vergi mevzuatını soru anında resmi kaynağından okuyup cevabı maddesiyle veren asistan - bir mali müşavirin günlük işinde kullandığı bir sistem.

Görüntüle
Technology · Fraunhofer IKS, Munich

Güvenlik Kritik Gereksinim Mühendisliğinde LLM'lerin Güvenilirliği

Kaynağa bağlanmamış sıradan bir sohbet botunun güvenlik kritik mühendisliğe ne kattığını kontrollü bir deneyle ölçtüm.

Görüntüle
Technology · Fraunhofer IKS, Munich

DSGENAI - Yapay Zekâ Güvenlik Gereksinimleri Mühendisliği Platformu

Yapay zekâ destekli güvenlik gereksinimleri platformunu modernize etme - Flask'tan Streamlit'e, GPT-5.1 ve kritik veri sızıntısı düzeltmeleri.

Görüntüle
Technology · Bağımsız proje

Retrieval-Augmented Generation (RAG) Dokümantasyon Asistanı

PDF yığınlarını, her cevabı kaynak belgeye dayanan aranabilir bir bilgi tabanına çeviren RAG asistanı.

Görüntüle
Technology · Siemens

NLP ile Akıllı Sözleşme Analizi

Siemens hukuk ekibinin geçmiş sözleşme revizyonlarından öğrenip yeni bir sözleşmede aynı maddeleri işaretleyen, daha önce yapılmış düzeltmeyi öneren bir sistem.

Görüntüle
Other · Scoutium

Futbolcu Potansiyeli Tahmin Modeli

Gözlemcilerin verdiği 39 nitelik puanından bir oyuncunun "öne çıkan" olarak işaretlenip işaretlenmeyeceğini tahmin eden, ROC-AUC 0,86 alan sınıflandırma modeli.

Görüntüle
Other · SCOUTIUM

Futbolcu Sıralama Sistemi

Bir oyuncuyu toplam puanına göre değil, kaç nitelikte kendi mevkisinin istatistiksel ortalamasının üstüne çıktığına göre sıralayan puanlama motoru.

Görüntüle
Other · Scoutium

Futbolcu Mevki Öneri Sistemi

Bir oyuncunun nitelik profilini diğer mevkilerin profilleriyle karşılaştırıp, başka bir rolde daha değerli olabilecek oyuncuları öne çıkaran öneri sistemi.

Görüntüle
Other · Turkish Airlines

Otomatik Aktarma Uçuşu Optimizasyonu

Bir uçuşun saati kaydırıldığında hub üzerinden kurulabilecek tüm bağlantıları, gün gün ve yolcu sayısıyla birlikte yeniden hesaplayan araç.

Görüntüle
Other · Turkish Airlines

Uçuş Yolcu Sayısı Tahmini

Tek aktarmalı rotalarda rezerve yolcu sayısını uçuşun kendi özelliklerinden tahmin eden, 11 regresyon modelinin karşılaştırılmasıyla seçilmiş bir talep modeli.

Görüntüle
Technology · İstanbul Bilgi Üniversitesi

MS COCO 2014 Üzerinde Türkçe Görsel Altyazılama Kıyaslaması

MS COCO'nun tamamı için insan doğrulamalı Türkçe altyazı veri seti ve üzerinde eğitilen beş modelle Türkçe görsel altyazılamada yeni bir referans noktası.

Görüntüle
Finance & Fintech · CFA Poland (hackathon)

ESG Çeşitlilik ve Duygu Analizi Çözümü - CFA Poland Hackathonu

Cinsiyet çeşitliliğini ve haber duygu durumunu puanlayan bir ESG prototipi - 28 üniversiteden 44 takım arasında 2.'lik.

Görüntüle
Other · Boğaziçi Üniversitesi Bilişim Kulübü (hackathon)

Otomatik ESG Puanlama Sistemi - HackBoğaziçi

Dört kazınmış veri kaynağından geliştirilen otomatik bir ESG puanlama motoru - 14 hackathon takımı arasında 2.'lik.

Görüntüle