You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
kazakh-morpho-qwen-unified
Қазақ сөздерін морфологиялық талдау моделі · Модель морфологического анализа казахских слов · Kazakh morphological analysis model
Қазақша
kazakh-morpho-qwen-unified — қазақ сөздеріне құрылымдалған морфологиялық JSON талдауын жасайтын көлемі 35.5 МБ LoRA артефактілері мен тәжірибе кодтарының жинағы. Модель морфология, семантика, лексика және сөзжасам белгілерін бір жауапқа біріктіреді.
Құрылымы
Репозиторийде 28 файл бар. Fine-tune үшін Qwen2.5 негізі, LoRA адаптері және грамматикалық дерек system prompt ретінде қолданылған.
| Сипаттама | Мәні |
|---|---|
| Негізгі модель | Qwen/Qwen2.5-4B-Instruct |
| Әдіс | LoRA |
| LoRA рангі | 32 |
| LoRA alpha | 64 |
| Ең ұзын тізбек | 2048 токен |
| Нысана модульдер | q, k, v, o, gate, up, down проекциялары |
qwen_2.5_05B_model/ бумасында адаптер мен tokenizer файлдары бар. qwen-new/ және fine-tune ноутбуктары модельді дайындау тәжірибелерін сақтайды.
Қалай жүктеуге болады
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))
Код рұқсат берілген репозиторийді Hugging Face кэшіне түсіріп, адаптер бумасындағы файлдарды көрсетеді. Нақты inference ортасы негізгі Qwen моделін осы LoRA адаптерімен бірге жүктеуі керек.
Қолжетімділік
Карточка мен файлдар тізімі жалпыға көрінеді. Артефактілерді жүктеу «Request access» арқылы берілген өтінім мақұлданғаннан кейін ашылады; өтінімді TilQazyna командасы қарайды.
Байланысты репозиторийлер
Модель kazakh-morpho-grammar және kazakh-morpho-corpus деректеріне сүйенеді. Бір бағыттағы модельдер: kazakh-morpho-pipeline және kazakh-morpho-qwen-ensemble.
Русский
kazakh-morpho-qwen-unified — набор LoRA-артефактов и экспериментального кода объёмом 35.5 МБ для структурированного морфологического разбора казахских слов в JSON. Модель объединяет морфологические, семантические, лексические и словообразовательные признаки в одном ответе.
Устройство
В репозитории 28 файлов. Для fine-tune использованы основа Qwen2.5, адаптер LoRA и грамматические данные в роли system prompt.
| Характеристика | Значение |
|---|---|
| Базовая модель | Qwen/Qwen2.5-4B-Instruct |
| Метод | LoRA |
| Ранг LoRA | 32 |
| LoRA alpha | 64 |
| Максимальная длина | 2048 токенов |
| Целевые модули | Проекции q, k, v, o, gate, up, down |
Каталог qwen_2.5_05B_model/ содержит адаптер и tokenizer. В qwen-new/ и ноутбуках fine-tune сохранён код экспериментов и подготовки данных.
Как загрузить
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))
Скрипт помещает разрешённую копию репозитория в кеш Hugging Face и выводит файлы адаптера. Среда inference должна загружать базовую модель Qwen вместе с этим LoRA-адаптером.
Доступ
Карточка и перечень файлов видны всем посетителям. Артефакты скачиваются после одобрения формы «Request access» командой TilQazyna.
Связанные репозитории
Для модели использованы kazakh-morpho-grammar и kazakh-morpho-corpus. К тому же направлению относятся kazakh-morpho-pipeline и kazakh-morpho-qwen-ensemble.
English
kazakh-morpho-qwen-unified is a 35.5 MB collection of LoRA artifacts and experiment code for producing structured morphological JSON analyses of Kazakh words. The model combines morphology, semantics, lexical information, and word formation in a single response.
Architecture and training setup
The repository contains 28 files. Its fine-tune setup uses a Qwen2.5 base, a LoRA adapter, and grammar data supplied as the system prompt.
| Property | Value |
|---|---|
| Base model | Qwen/Qwen2.5-4B-Instruct |
| Method | LoRA |
| LoRA rank | 32 |
| LoRA alpha | 64 |
| Maximum length | 2048 tokens |
| Target modules | q, k, v, o, gate, up, and down projections |
The qwen_2.5_05B_model/ directory stores the adapter and tokenizer files. The qwen-new/ directory and fine-tune notebooks retain the experiment and data-preparation code.
Loading the artifacts
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))
The script downloads the approved repository snapshot into the Hugging Face cache and lists the adapter files. An inference environment should load the Qwen base model together with this LoRA adapter.
Access
The card and file listing are visible to everyone. Artifact downloads become available after the TilQazyna team approves a submission through the “Request access” form.
Related repositories
Training material comes from kazakh-morpho-grammar and kazakh-morpho-corpus. Related systems include kazakh-morpho-pipeline and kazakh-morpho-qwen-ensemble.
Лицензия · License: apache-2.0 · TilQazyna