Ana Sayfa/HukukBERT

HukukBERT: Türk hukuku için alana özel dil modeli.

21 GB eğitim verisi üzerinde, hibrit alana uyarlanmış ön eğitim (DAPT) yöntemiyle eğitilmiş bir BERT modeli.

Mehmet Utku Öztürk · Tansu Türkoğlu · Buse Buz-Yalug

HukukBERT: Domain-Specific Language Model for Turkish Law

Journal of Computational Law and Legal Technology · 4 Ağustos 2026 · s. 1-15

Ön baskı: arXiv:2604.04790 · 6 Nisan 2026 · cs.CL, cs.LG

Hakemli dergi
JCLLT · Bon View Publishing
Yayın
4 Ağustos 2026
arXiv
2604.04790
Kategori
cs.CL · cs.LG
Eğitim verisi
21 GB
Tokenizer
48K WordPiece
Ön eğitim
Hibrit DAPT
Uzunluk
15 sayfa

Türkçe hukuk için alana özel bir dil modeli.

Doğal dil işlemedeki (NLP) gelişmeler hukuk teknolojisi uygulamalarını giderek mümkün kılsa da, alana özgü veri ve modellerin kıtlığı nedeniyle Türk hukukuna özel çalışmalar sınırlı kalmıştır. İngilizce hukuk metinleri için LEGAL-BERT gibi kapsamlı modeller geliştirilmiş olsa da, Türk hukuk alanı yüksek hacimli, alana özel bir karşılıktan yoksundu.

HukukBERT, 21 GB eğitim verisi üzerinde; Whole-Word Masking, Token Span Masking, Word Span Masking ve hedefli Keyword Masking tekniklerini birleştiren hibrit bir Domain-Adaptive Pre-Training (DAPT) yöntemiyle eğitilmiş, alana özel bir Türkçe hukuk dil modelidir. 48K WordPiece tokenizer ve DAPT yaklaşımı; genel amaçlı ve mevcut alana özel Türkçe modellerle sistematik olarak karşılaştırılmıştır.

Türk mahkeme kararları için tasarlanan yeni bir Legal Cloze Test ölçütünde model, %84,40 Top-1 doğrulukla en iyi (state-of-the-art) sonucu elde etmiş ve mevcut modellerin belirgin biçimde üzerine çıkmıştır. Ayrıca resmi Türk mahkeme kararlarının yapısal segmentasyonu görevinde %92,8 belge geçiş oranına ulaşarak yeni bir en iyi sonuç ortaya koymuştur. Model; adlandırılmış varlık tanıma, karar tahmini ve hukuki belge sınıflandırması gibi Türkçe hukuk NLP görevlerinde gelecekteki araştırmaları desteklemek üzere yayımlanmaktadır.

Hibrit alana uyarlanmış ön eğitim.

HukukBERT, Türkçe hukuk külliyatı üzerinde 48K WordPiece tokenizer ile alana uyarlanmış ön eğitimden (DAPT) geçirilir. Ön eğitim, dört maskeleme stratejisini bir arada kullanarak modeli hukuk diline uyarlar.

  • 21 GB eğitim verisi
  • 48K WordPiece tokenizer
  • Genel amaçlı ve alana özel modellerle sistematik kıyaslama
Maskeleme Stratejileri4 teknik
  • Whole-Word Masking

    Tüm kelimenin maskelenmesi

  • Token Span Masking

    Bitişik token dizilerinin maskelenmesi

  • Word Span Masking

    Bitişik kelime dizilerinin maskelenmesi

  • Keyword Masking

    Hedefli hukuk terimlerinin maskelenmesi

İki görevde de en iyi sonuç.

HukukBERT, hem Legal Cloze Test ölçütünde hem de resmi Türk mahkeme kararlarının yapısal segmentasyonunda mevcut modellerin belirgin biçimde üzerine çıkarak her iki görevde de yeni bir state-of-the-art ortaya koyar.

  • Legal Cloze Test — %84,40 Top-1 doğruluk
  • Yapısal segmentasyon — %92,8 belge geçiş oranı
DeğerlendirmeSOTA
  • Legal Cloze TestTop-1 doğruluk%84,40
  • Yapısal segmentasyonBelge geçiş oranı%92,8
Yeni state-of-the-art

Başlıca katkılar.

  • Alana özel, yüksek hacimli bir Türkçe hukuk dil modeli — 21 GB eğitim verisi.

  • Hibrit DAPT: Whole-Word, Token Span, Word Span ve hedefli Keyword Masking.

  • 48K WordPiece tokenizer; genel amaçlı ve alana özel Türkçe modellerle sistematik karşılaştırma.

  • Yeni ölçüt: Legal Cloze Test — mahkeme kararları için maskeli hukuk terimi tahmini.


Natural language processing (NLP) advances have powered a generation of LegalTech systems, but Turkish law remains under-served by domain-specific data and models. English has legal encoders such as LEGAL-BERT; no comparable high-volume Turkish counterpart exists. We introduce HukukBERT, a Turkish legal language model trained on a 21 GB cleaned corpus using a hybrid domain-adaptive pre-training (DAPT) recipe that mixes Whole-Word Masking, Token Span Masking, Word Span Masking, and targeted Keyword Masking. We compared our 48K WordPiece tokenizer and DAPT pipeline against general-purpose and existing domain-specific Turkish models. On the Legal Cloze Test — a masked legal term prediction benchmark over Turkish court decisions — HukukBERT reaches 84.40% Top-1 accuracy and beats every baseline we tested. The Legal Cloze Test is synthetically constructed, so its passages are absent from the pre-training corpus by construction, eliminating train-test contamination. On the downstream task of structural segmentation of official Turkish court decisions, it reaches a 92.8% document pass rate. We release HukukBERT to support Turkish legal NLP work in named entity recognition, judgment prediction, and document classification.

Bu çalışmaya atıf verin.

Atıf için dergi sürümünü kullanın; arXiv ön baskısı aynı çalışmanın açık erişimli kopyasıdır.

Dergi sürümü · Journal of Computational Law and Legal Technology

@article{ozturk2026hukukbert,
  title   = {HukukBERT: Domain-Specific Language Model for Turkish Law},
  author  = {Öztürk, Mehmet Utku and Türkoğlu, Tansu and Buz-Yalug, Buse},
  journal = {Journal of Computational Law and Legal Technology},
  year    = {2026},
  pages   = {1--15},
  doi     = {10.47852/bonviewJCLLT620210346},
  url     = {https://doi.org/10.47852/bonviewJCLLT620210346}
}

Öztürk, M. U., Türkoğlu, T., & Buz-Yalug, B. (2026). HukukBERT: Domain-Specific Language Model for Turkish Law. Journal of Computational Law and Legal Technology, 1-15. https://doi.org/10.47852/bonviewJCLLT620210346

Ön baskı · arXiv

@misc{ozturk2026hukukbertarxiv,
  title         = {HukukBERT: Domain-Specific Language Model for Turkish Law},
  author        = {Öztürk, Mehmet Utku and Türkoğlu, Tansu and Buz-Yalug, Buse},
  year          = {2026},
  eprint        = {2604.04790},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CL},
  url           = {https://arxiv.org/abs/2604.04790}
}

Öztürk, M. U., Türkoğlu, T., & Buz-Yalug, B. (2026). HukukBERT: Domain-Specific Language Model for Turkish Law. arXiv:2604.04790. https://arxiv.org/abs/2604.04790

Modelin yayımı ve erişim ayrıntıları makalede belirtilmiştir.


Bu çalışmadan bahseden yayınlar.

IEEE Access · Aydoğan, Yıldırım, Dalyan

Leveraging Task-Adaptive Continual Pre-Training to Enhance the Classification Ability of Language Models

HukukBERT [42] applied a hybrid DAPT procedure on a large Turkish legal corpus.

22 Temmuz 2026

Erken Kullanım Başvurusu

Erken kullanım başvurusu yaparak lansmana özel fırsatlardan faydalanabilir, TurkHukuk.ai Platformu'nu yakından tanıyabilirsiniz.

Bireysel Avukat

Hukuk Bürosu