Türkçe Sağlık BPE Tokenizer

Türkçe sağlık metinleri için sıfırdan eğitilmiş ByteLevel BPE tokenizer. Sözlük boyutu 32.000'dir.

Kullanım

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("seali/turkce-saglik-bpe-tokenizer")
tokenizer.tokenize("Hipoglisemi belirtileri nelerdir?")

Performans

Kelime başına düşen token sayısı (fertility) Türkçe tıbbi cümlelerde ölçülmüştür. Düşük değer, aynı bağlam penceresine daha çok metin sığdığı anlamına gelir.

Tokenizer Fertility Sözlük
Bu tokenizer 1.24 32.000
Qwen3-4B-Instruct 2.74 151.643
bert-base-multilingual-cased 2.61 119.547
GPT-2 3.93 50.257

Tıbbi terimler tek token olarak temsil edilir:

Terim Bu tokenizer Qwen3-4B
hipoglisemi 1 4
hipertansiyon 1 5
bağışıklık 1 5
enfeksiyon 1 5
antibiyotik 1 5

Eğitim

105 MB'lık Türkçe korpus üzerinde eğitilmiştir:

  • ituperceptron/turkish_medical_reasoning — tıbbi soru-cevap ve muhakeme
  • T.C. Sağlık Bakanlığı HSGM sağlık kitapları
  • AhmetSemih/Turkish-Medical-Notes — klinik notlar
  • ytu-ce-cosmos/Cosmos-Turkish-Corpus-v1.0 — genel Türkçe kapsam için bir dilim

Korpusun yaklaşık üçte ikisi tıbbi metindir.

Tasarım

  • ByteLevel BPE: Türkçe karakterler ve beklenmedik girdiler bayt düzeyinde temsil edilir, bilinmeyen token üretilmez.
  • NFC normalizasyonu: PDF kaynaklı metinlerde ayrışmış karakterler tek koda indirgenir.
  • Küçük harfe çevirme yapılmaz: KOAH, HIV, Tip 1 gibi kısaltmalar anlam taşır.
  • Sohbet şablonu için özel token'lar sözlüğe eklenmiştir: <|im_start|>, <|im_end|>, <|system|>, <|user|>, <|assistant|>, <|think|>, </|think|>.

Katkı ve İletişim

seali tarafından hazırlanmıştır.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using seali/turkce-saglik-bpe-tokenizer 1