You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

kazakh-morpho-qwen-unified

Қазақ сөздерін морфологиялық талдау моделі · Модель морфологического анализа казахских слов · Kazakh morphological analysis model

Қазақша · Русский · English


Қазақша

kazakh-morpho-qwen-unified — қазақ сөздеріне құрылымдалған морфологиялық JSON талдауын жасайтын көлемі 35.5 МБ LoRA артефактілері мен тәжірибе кодтарының жинағы. Модель морфология, семантика, лексика және сөзжасам белгілерін бір жауапқа біріктіреді.

Құрылымы

Репозиторийде 28 файл бар. Fine-tune үшін Qwen2.5 негізі, LoRA адаптері және грамматикалық дерек system prompt ретінде қолданылған.

Сипаттама Мәні
Негізгі модель Qwen/Qwen2.5-4B-Instruct
Әдіс LoRA
LoRA рангі 32
LoRA alpha 64
Ең ұзын тізбек 2048 токен
Нысана модульдер q, k, v, o, gate, up, down проекциялары

qwen_2.5_05B_model/ бумасында адаптер мен tokenizer файлдары бар. qwen-new/ және fine-tune ноутбуктары модельді дайындау тәжірибелерін сақтайды.

Қалай жүктеуге болады

from pathlib import Path
from huggingface_hub import snapshot_download

repo_dir = Path(snapshot_download(
    repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))

Код рұқсат берілген репозиторийді Hugging Face кэшіне түсіріп, адаптер бумасындағы файлдарды көрсетеді. Нақты inference ортасы негізгі Qwen моделін осы LoRA адаптерімен бірге жүктеуі керек.

Қолжетімділік

Карточка мен файлдар тізімі жалпыға көрінеді. Артефактілерді жүктеу «Request access» арқылы берілген өтінім мақұлданғаннан кейін ашылады; өтінімді TilQazyna командасы қарайды.

Байланысты репозиторийлер

Модель kazakh-morpho-grammar және kazakh-morpho-corpus деректеріне сүйенеді. Бір бағыттағы модельдер: kazakh-morpho-pipeline және kazakh-morpho-qwen-ensemble.


Русский

kazakh-morpho-qwen-unified — набор LoRA-артефактов и экспериментального кода объёмом 35.5 МБ для структурированного морфологического разбора казахских слов в JSON. Модель объединяет морфологические, семантические, лексические и словообразовательные признаки в одном ответе.

Устройство

В репозитории 28 файлов. Для fine-tune использованы основа Qwen2.5, адаптер LoRA и грамматические данные в роли system prompt.

Характеристика Значение
Базовая модель Qwen/Qwen2.5-4B-Instruct
Метод LoRA
Ранг LoRA 32
LoRA alpha 64
Максимальная длина 2048 токенов
Целевые модули Проекции q, k, v, o, gate, up, down

Каталог qwen_2.5_05B_model/ содержит адаптер и tokenizer. В qwen-new/ и ноутбуках fine-tune сохранён код экспериментов и подготовки данных.

Как загрузить

from pathlib import Path
from huggingface_hub import snapshot_download

repo_dir = Path(snapshot_download(
    repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))

Скрипт помещает разрешённую копию репозитория в кеш Hugging Face и выводит файлы адаптера. Среда inference должна загружать базовую модель Qwen вместе с этим LoRA-адаптером.

Доступ

Карточка и перечень файлов видны всем посетителям. Артефакты скачиваются после одобрения формы «Request access» командой TilQazyna.

Связанные репозитории

Для модели использованы kazakh-morpho-grammar и kazakh-morpho-corpus. К тому же направлению относятся kazakh-morpho-pipeline и kazakh-morpho-qwen-ensemble.


English

kazakh-morpho-qwen-unified is a 35.5 MB collection of LoRA artifacts and experiment code for producing structured morphological JSON analyses of Kazakh words. The model combines morphology, semantics, lexical information, and word formation in a single response.

Architecture and training setup

The repository contains 28 files. Its fine-tune setup uses a Qwen2.5 base, a LoRA adapter, and grammar data supplied as the system prompt.

Property Value
Base model Qwen/Qwen2.5-4B-Instruct
Method LoRA
LoRA rank 32
LoRA alpha 64
Maximum length 2048 tokens
Target modules q, k, v, o, gate, up, and down projections

The qwen_2.5_05B_model/ directory stores the adapter and tokenizer files. The qwen-new/ directory and fine-tune notebooks retain the experiment and data-preparation code.

Loading the artifacts

from pathlib import Path
from huggingface_hub import snapshot_download

repo_dir = Path(snapshot_download(
    repo_id="TilQazyna/kazakh-morpho-qwen-unified",
))
adapter_dir = repo_dir / "qwen_2.5_05B_model"
print(adapter_dir)
print(sorted(path.name for path in adapter_dir.iterdir()))

The script downloads the approved repository snapshot into the Hugging Face cache and lists the adapter files. An inference environment should load the Qwen base model together with this LoRA adapter.

Access

The card and file listing are visible to everyone. Artifact downloads become available after the TilQazyna team approves a submission through the “Request access” form.

Related repositories

Training material comes from kazakh-morpho-grammar and kazakh-morpho-corpus. Related systems include kazakh-morpho-pipeline and kazakh-morpho-qwen-ensemble.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/kazakh-morpho-qwen-unified