Hukuk

Hukuki Yapay Zeka Testi: BaroBase vs ChatGPT, Claude ve Gemini

Bir avukat şunu yazıyor: "Müvekkilim konut sahibi; kiracısı 3 aydır kira ödemiyor. Hem birikmiş alacağı tahsil etmek hem tahliye sağlamak istiyor. Yeni dönem için kira artışını ne oranda yapabilir?" B

21 Temmuz 2026Buluthan Yumuk7 dk okuma
Hukuki Yapay Zeka Testi: BaroBase vs ChatGPT, Claude ve Gemini

Bir avukat şunu yazıyor: _"Müvekkilim konut sahibi; kiracısı 3 aydır kira ödemiyor. Hem birikmiş alacağı tahsil etmek hem tahliye sağlamak istiyor. Yeni dönem için kira artışını ne oranda yapabilir?"_

Bu soruya doğru cevap vermek için bir sistemin üç şeyi birden bilmesi gerekiyor: konut kiralarındaki %25'lik geçici artış tavanının 1 Temmuz 2024'te sona erdiğini, kira uyuşmazlıklarında dava açmadan önce arabuluculuğun artık dava şartı olduğunu ve temerrüt nedeniyle tahliye ile "iki haklı ihtar" prosedürünün birbirinden ayrı rejimler olduğunu. Üstelik bunları dayanak içtihatla birlikte söyleyebilmesi gerekiyor. Genel kültür yetmiyor; güncel mevzuat, gerçek emsal ve doğru usul aynı anda gerekiyor.

Biz de tam bunu ölçtük. Bu yazı, hukuki yapay zeka alanında Türk hukukuna özel, çok-hakemli ve kamuya açık ilk kıyaslamalardan birinin sonuçlarını güçlü ve zayıf yanlarıyla birlikte aktarıyor.

Neyi ölçtük

Sekiz sistemi aynı 12 soruyla test ettik. BaroBase tarafında üç model: bar-1.5 (hızlı model), bar-1.5-pro (derin model) ve Üstün Analiz (en derin model + emsal analizi). Genel-amaçlı tarafta ise önde gelen üç modelin beş varyantı: Claude Opus 4.8 ve ChatGPT-5.5 (her biri iki farklı akıl yürütme çabasıyla) ve Gemini 3.1 Pro.

Karşılaştırma bilinçli olarak ürün-ürün yapıldı. BaroBase modelleri tam ürün akışıyla çalıştı; genel-amaçlı modeller ise kendi standart yönergeleriyle, tıpkı bir avukatın onları web arayüzünden kullanacağı gibi test edildi.

On iki soru, bir avukatın gerçekten yazacağı biçimde, somut taraf, tarih ve tutarlarla üretildi ve kira hukukundan cezaya, mirastan idare/vergiye kadar 12 ayrı hukuk dalına yayıldı. İçlerine bilerek iki tür tuzak yerleştirildi:

  • Güncellik tuzakları: Yakın zamanda değişen mevzuat noktaları. Kira artış tavanının sona ermesi, 2024 asgari sermaye güncellemesi, kardeşlerin saklı payının 2007'de kaldırılması gibi.
  • Künye tuzakları: İçtihat-yoğun, modeli karar künyesi uydurmaya davet eden konular.

Nasıl puanladık

Puanlama kördü: Üç bağımsız hakem, hangi yanıtın hangi sisteme ait olduğunu görmeden, her soruda yeniden karıştırılmış A–H etiketleriyle sunulan sekiz yanıtı ayrı ayrı puanladı. Nihai puan üç hakemin medyanı, kazanan ise çoğunluğun kararı.

Dört davranış ekseni kullanıldı: Emsal/atıf kullanımı (%30), kullanılabilirlik (%25), strateji (%25) ve güncellik (%20).

Tek istisnai sinyal, atıfların kaynağıydı ve kural bilinçli olarak asimetrikti: Doğrulanmış karar arşivine dayalı bir atıf hiçbir zaman halüsinasyon sayılmadı, çünkü gerçek ve tıklanabilirdir. Hafızadan üretilmiş, doğrulanamayan spesifik bir künye ise uydurma kabul edilip sert biçimde cezalandırıldı. Mahkeme kademesi bir kalite ölçütü olarak kullanılmadı; iyi yerleştirilmiş bir ilk derece kararı, bir Yargıtay kararı kadar değerlidir.

Sonuçlar

Üç-hakemli medyan konsensüste genel sıralama (100 üzerinden):

BaroBase'in üç katmanı da ilk üç sırayı aldı; en hafif katman bar-1.5 (86,5) dahi test edilen beş genel-amaçlı varyantın tümünü geçti.

Burada dürüst olmak gerekir: "Büyük modeller Türk hukukunu bilmiyor" demek doğru olmaz. Güncellik ekseninde sekiz sistem birbirine yakındı; kullanılabilirlikte de fark küçüktü (ortalama 87'ye 85). Doktrini anlatmakta genel-amaçlı modeller gerçekten iyi. Fark başka yerde açılıyor.

Hukuki yapay zekada farkı açan eksen: Gerçek emsal

En büyük ayrışma emsal ve atıf ekseninde birikti. Bar Serisi bu eksende 86–91 bandında, genel-amaçlı modeller 73–78 bandında puan aldı; aradaki açık yaklaşık on puan.

Nedeni somut. BaroBase katmanları 12 sorunun yanıtlarına toplamda yüzlerce gerçek, tıklanabilir karar künyesi işledi: Üstün Analiz 142, bar-1.5 84, bar-1.5-pro 68. Genel-amaçlı tarafta bu sayı sıfıra yakındı.

Genel-amaçlı modellerde iki farklı davranış gördük ve ikisini birbirinden ayırmak gerekiyor:

  • Dürüst kaçınma: Claude Opus 4.8 ve ChatGPT-5.5 künye uydurmaktan kaçındı, çoğunlukla "UYAP'tan teyit edin" diyerek. Bu disiplinli tutum cezalandırılmadı, ancak bir dilekçeye konacak somut emsali de sağlamadı.
  • Uydurma: Gemini 3.1 Pro tek bir soruda üç adet gerçek olmayan Yargıtay künyesi üretti. Üç bağımsız hakem de bunu birbirinden habersiz yakaladı ve o yanıtın emsal puanını 45'e kadar düşürdü.

Bir avukat için bu fark yalnızca bir kalite meselesi değil, bir güven meselesidir: Sahte bir künye küçük bir ayrıntı değil, sorumluluk doğuran bir hatadır. BaroBase katmanlarının hiç uydurma atıf üretmemesinin sırrı bir model marifeti değil, mimari bir tercihtir. Uydurmaz; doğrulanmış karar arşivinden konuşur ve kaynağını gösterir.

Fark yalnızca künyede değil: Muhakemenin kalitesi

Strateji ekseninde de ölçülebilir bir açık var: BaroBase'in derin katmanları (Üstün Analiz 91, bar-1.5-pro 89), test edilen amiral-gemi varyantların en iyisinin (85) üzerinde puan aldı.

Bunun nedeni de mimaride. Genel-amaçlı bir model hukuki bilgisini eğitim verisinden damıtılmış, kaynağından kopuk bir ezber olarak taşır. BaroBase'in derin katmanları ise cevabı hafızadan değil, gerçek kararların içinden kurar. Bir Yargıtay kararının gerekçesinde yalnızca kural değil, gerçek avukatların kurduğu strateji ve o stratejinin kazanıp kaybettiği de görünür. Bu malzemenin üstünde muhakeme yürüten bir sistem, "şu maddeyi kullan" demenin ötesine geçip "bu argüman bu daire önünde tutmuş, şu talep terditli istenmediği için düşmüş" diyebilir.

Daha çok "düşünen" model daha iyi cevap verir mi?

Yaygın varsayım, modele ne kadar çok düşünme bütçesi verilirse cevabın o kadar iyileşeceğidir. Sayılar bunu desteklemedi:

  • Claude Opus 4.8'in en yüksek çabası 83,9, bir kademe düşüğü 83,0 aldı. Fark 0,9 puan; maliyet ise sorgu başına ~$0,30'dan ~$0,08'e indi.
  • ChatGPT-5.5'te fark daha da küçüktü: 83,6'ya karşı 83,5. Yani 0,1 puanlık fark için yaklaşık iki kat maliyet.

Bu tür hukuk sorularında ekstra "düşünme" parayı katlıyor, kaliteyi neredeyse hiç artırmıyor. Kaliteyi belirleyen, çabanın miktarı değil, cevabın gerçek bir kaynağa bağlı olup olmadığı.

Hız ve maliyet

Katmanlı yapı, işe göre hız ve derinlik dengesi sunuyor: Hızlı katman bar-1.5 ortalama 41 saniyede, derin katman bar-1.5-pro 101 saniyede yanıt verirken, en derin katman Üstün Analiz 226 saniyeye kadar çıkıyor. Genel-amaçlı max-çaba varyantları ise en yavaşlarıydı: 241 saniyeye varan süreler, üstelik daha düşük kalite.

Maliyet tarafında genel-amaçlı modellerin rakamları şeffaf: En yüksek kaliteyi hedefleyen max-çaba varyantları sorgu başına $0,30–$0,36 bandında. BaroBase ise kullanıcılarına daha yüksek kullanım limitlerini daha yüksek kaliteyle birleştirerek sunuyor.

Türk hukukuna özgü bir isabet: Doğru daireye gitmek

Bir aracın Türk hukukunu gerçekten bildiğini gösteren en somut işaretlerden biri, meseleyi doğru uzman daireye bağlamasıdır. Değerlendirilen yanıtlardan doğrudan çıkarılan, herhangi bir hukukçunun teyit edebileceği örnekler:

Bu isabet bir ezber değil; sorguyu hukuki meseleye çevirip o meselenin görüldüğü daireye yönelmenin sonucu. Başka bir deyişle sistem kelimeyi değil, hukuki meseleyi eşleştiriyor.

Hakemler ne kadar tutarlıydı?

Bir kıyaslama ancak hakemleri tutarlıysa anlamlıdır. Üç bağımsız hakem, 12 sorunun 9'unda kazanan sistem üzerinde oybirliğine vardı; üçü de aynı uydurma-künye vakasını birbirinden bağımsız yakaladı ve disiplinli genel-amaçlı yanıtları 81–84 bandına, Bar Serisi yanıtlarını 90+ bandına yerleştirdi. Hakemlerin yalnızca güçlü sonuçlarda değil zayıf noktalarda da hemfikir olması, ölçülen sinyalin gürültü değil gerçek olduğunu gösteriyor.

Nerede zorlanıyoruz, sınırlar neler?

Bu bir karne; yalnızca iyi notları okumak olmaz:

  • Örneklem küçük. 12 soru, 12 hukuk dalını kapsıyor ama istatistiksel olarak dar bir kesit. Sıradaki ölçümde örneklemi genişletiyoruz.
  • Bazı eksenlerde fark küçük. Kullanılabilirlik ve güncellikte genel-amaçlı modeller neredeyse eşit performans gösterdi. Doktrin anlatımında güçlüler ve bunu söylemek gerekiyor.
  • Derinliğin bedeli hız. Üstün Analiz en yüksek kaliteyi verirken 226 saniyeye kadar çıkabiliyor. Gündelik hızlı sorular için hafif katman, ağır ve çok cepheli meseleler için derin katman doğru tercih.

Sıradaki adımlar: Örneklemi genişletmek, daha zor güncellik tuzakları eklemek ve ayrıştırma (ablasyon) analizi. Bir sonraki ölçümde neyi geliştirdiğimizi aynı şeffaflıkla paylaşacağız.

Bir hukukçu için bu ne anlama geliyor?

Genel-amaçlı yapay zeka doktrini akıcı anlatır ve bunun bir değeri var. Ama dosyaya konacak cevabın üç ayağı olan gerçek ve tıklanabilir emsal, gerçek kararların içinden kurulan strateji ve doğru uzman daireye yönelme, model büyüklüğüyle ya da daha çok "düşünmeyle" gelmiyor. Türk hukukuna odaklanmış, gerçek içtihatla beslenen bir sistem tasarımı gerektiriyor.

Bu kıyaslamada ölçülen de tam olarak bu: Doktrin bilgisinde sistemler birbirine yakınken, sonucu belirleyen şey cevabın kaynağına bağlı olup olmadığı oldu.

Sık sorulan sorular

ChatGPT veya Claude, hukuk sorularında güvenilir mi?

Bu kıyaslamada Claude Opus 4.8 ve ChatGPT-5.5 doktrin anlatımında ve güncellikte güçlü performans gösterdi ve künye uydurmaktan disiplinle kaçındı. Ancak doğrulanabilir emsal sunamadıkları için, dilekçeye konacak somut dayanak gerektiğinde avukatı UYAP'ta ayrı bir araştırmaya yönlendiriyorlar.

Yapay zeka uydurma içtihat (halüsinasyon) üretir mi?

Genel-amaçlı modeller üretebilir: Bu kıyaslamada bir model, tek bir soruda üç adet gerçek olmayan Yargıtay künyesi üretti ve üç bağımsız hakemin üçü de bunu yakaladı. Doğrulanmış karar arşivinden çalışan BaroBase katmanları ise 12 soruda hiç uydurma atıf üretmedi; getirdiği her künye gerçek ve tıklanabilir.

Daha pahalı, daha çok "düşünen" model daha iyi sonuç verir mi?

Bu ölçümde hayır: Aynı modelin en yüksek düşünme çabası, bir kademe düşüğüne göre en fazla 0,9 puan fark yarattı, maliyeti ise 2–4 kat artırdı. Kaliteyi belirleyen, düşünme bütçesi değil cevabın gerçek bir kaynağa dayanıp dayanmadığıydı.

Raporun tam metni, 12 sorunun tamamı, her sistemin yanıtı ve hakem puanlarıyla birlikte şeffaflık ekiyle yayında. Ölçüm: 04.07.2026 · 8 sistem · 12 sorgu · 3 bağımsız kör hakem; puanlar üç-hakemli medyandır.

Sonuç ne olursa olsun ilke aynı: BaroBase doğru malzemeyi doğru anda önünüze getirir; kararı ve sorumluluğu her zaman avukat verir.

Editör Notu: Bu içerik bilgilendirme amaçlıdır; hukuki danışmanlık niteliği taşımaz. Somut olayın niteliğine göre hukuki değerlendirme farklılık gösterebilir.

Bu içeriği paylaşın
0 yorum

İlgili İçerikler

Keşfet'e Dön