You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

kaz-qwen-morphology-0.5b

Қазақ сөздерін талдайтын LoRA адаптері · LoRA-адаптер для анализа казахских слов · LoRA adapter for Kazakh word analysis

Қазақша · Русский · English


Қазақша

kaz-qwen-morphology-0.5b — қазақ сөзінің lemma, сөз табы және морфологиялық белгілерін болжауға арналған 20.2 МБ LoRA адаптері. Ол Qwen/Qwen2.5-0.5B-Instruct үстіне жүктеледі және бір сөзді мәтіндік сұрау арқылы талдайды.

Құрылымы мен оқыту деректері

Сипаттама Мәні
Негізгі модель Qwen/Qwen2.5-0.5B-Instruct
Адаптер LoRA
Rank 8
Alpha 16
Кітапхана PEFT 0.18.0

Fine-tune материалына 50,000-нан астам морфологиялық таңбаланған сөз және 7 сөз табы кірген. Ашық үлгі kaz-morphology-sample репозиторийінде; оқыту графында kazakh-morpho-grammar да көрсетілген.

Талдау нәтижесі генерацияланған мәтін түрінде қайтарылады.

Қалай іске қосады

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)

inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Адаптер жеке толық модель емес: inference кезінде негізгі Qwen салмақтары мен PEFT бірге қажет.

Қолжетімділік

Карточка мен файлдар тізімі ашық көрінеді. Адаптер мен tokenizer файлдары «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін жүктеледі.

Байланысты репозиторийлер

Оқыту көздері — kazakh-morpho-grammar және kaz-morphology-sample. Туыстас грамматикалық адаптер — kaz-qwen-grammar-final.


Русский

kaz-qwen-morphology-0.5b — LoRA-адаптер объёмом 20.2 МБ, который предсказывает lemma, часть речи и морфологические признаки казахского слова. Он загружается поверх Qwen/Qwen2.5-0.5B-Instruct и получает отдельное слово в текстовом запросе.

Устройство и обучающие материалы

Характеристика Значение
Базовая модель Qwen/Qwen2.5-0.5B-Instruct
Тип адаптера LoRA
Rank 8
Alpha 16
Библиотека PEFT 0.18.0

Для fine-tune использовали свыше 50,000 морфологически размеченных слов по 7 частям речи. Публичный образец размещён в kaz-morphology-sample; в графе обучения также указан kazakh-morpho-grammar.

Как запустить

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)

inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Адаптер не содержит полную базовую модель: для inference нужны веса Qwen и библиотека PEFT.

Доступ

Карточка и перечень файлов видны всем посетителям. Скачивание адаптера и tokenizer открывается после одобрения формы «Request access» командой TilQazyna.

Связанные репозитории

Источники обучения — kazakh-morpho-grammar и kaz-morphology-sample. Родственный грамматический адаптер — kaz-qwen-grammar-final.


English

kaz-qwen-morphology-0.5b is a 20.2 MB LoRA adapter that predicts the lemma, part of speech, and morphological features of a Kazakh word. It loads on top of Qwen/Qwen2.5-0.5B-Instruct and analyzes one word supplied through a text prompt.

Architecture and training material

Property Value
Base model Qwen/Qwen2.5-0.5B-Instruct
Adapter type LoRA
Rank 8
Alpha 16
Library PEFT 0.18.0

Fine-tuning used more than 50,000 morphologically annotated words across 7 parts of speech. A public sample is available in kaz-morphology-sample, and the training graph also identifies kazakh-morpho-grammar.

How to run

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base_id = "Qwen/Qwen2.5-0.5B-Instruct"
adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b"
base = AutoModelForCausalLM.from_pretrained(base_id)
tokenizer = AutoTokenizer.from_pretrained(adapter_id)
model = PeftModel.from_pretrained(base, adapter_id)

inputs = tokenizer("Сөзді талда: барды", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(output[0], skip_special_tokens=True))

The adapter does not contain the complete base model. Inference requires the Qwen weights together with PEFT.

Access

The card and repository file list remain publicly visible. Adapter and tokenizer downloads are enabled after the TilQazyna team approves a “Request access” submission.

Related repositories

Training sources are kazakh-morpho-grammar and kaz-morphology-sample. The related grammar adapter is kaz-qwen-grammar-final.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/kaz-qwen-morphology-0.5b

Adapter
(726)
this model

Dataset used to train TilQazyna/kaz-qwen-morphology-0.5b

Collection including TilQazyna/kaz-qwen-morphology-0.5b