You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

kazakh-morpho-pipeline

Қазақ сөздерін морфологиялық талдау коды · Код морфологического анализа казахских слов · Kazakh word morphology pipeline code

Қазақша · Русский · English


Қазақша

kazakh-morpho-pipeline — қазақ сөздерін морфологиялық, семантикалық, лексикалық және сөзжасамдық тұрғыдан өңдеуге арналған 0.6 МБ код пен дерек репозиторийі. Мұнда оқыту, бағалау, inference және FastAPI deployment скрипттері бар; дайын модель салмақтары жарияланбаған.

Репозиторий құрамы

Pipeline Qwen/Qwen2.5-4B-Instruct және LoRA оқытуына бағытталған. Ол зат есім, сын есім, сан есім, етістік, есімдік, үстеу, шылау, одағай және еліктеуіш сөздерді өңдейді.

Бөлік Файлдар
Дерек all_kazakh_grammar_data.json, test_data.json
Оқыту train.sh, create_train_split.py
Бағалау evaluate.py, check_data.py
Inference және deployment inference.py, deployment.py
Нұсқаулық QUICKSTART.md, TRAIN_EVAL_GUIDE.md

Ескі сипаттамада LoRA параметрлері r=32, alpha=64, ең ұзын кіріс 2048 токен және оқыту материалы 1.7M мысал деп көрсетілген.

Қалай жүктейді

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-morpho-pipeline"))
for name in ("QUICKSTART.md", "inference.py", "deployment.py", "test_data.json"):
    print(root / name)

Бұл код нұсқаулықтарды, скрипттерді және сынақ дерегін бір бумаға жүктейді. Inference үшін бөлек оқытылған модель жолы керек.

Қолжетімділік

Карточка мен файл атаулары көпшілікке көрінеді. Код пен деректерді жүктеу үшін «Request access» формасын жіберу қажет; өтінімді TilQazyna командасы қарайды.

Байланысты репозиторийлер

Оқыту көздері — kazakh-morpho-grammar және kazakh-morpho-corpus. Байланысты модельдер: kazakh-morpho-qwen-unified, kazakh-morpho-qwen-ensemble және kazakh-morpho-qazcorpora.


Русский

kazakh-morpho-pipeline — репозиторий кода и данных объёмом 0.6 МБ для морфологического, семантического, лексического и словообразовательного анализа казахских слов. Он содержит сценарии обучения, оценки, inference и FastAPI deployment; готовых весов модели в репозитории нет.

Что внутри

Pipeline рассчитан на Qwen/Qwen2.5-4B-Instruct и обучение LoRA. Он обрабатывает существительные, прилагательные, числительные, глаголы, местоимения, наречия, служебные слова, междометия и звукоподражания.

Часть Файлы
Данные all_kazakh_grammar_data.json, test_data.json
Обучение train.sh, create_train_split.py
Оценка evaluate.py, check_data.py
Inference и deployment inference.py, deployment.py
Инструкции QUICKSTART.md, TRAIN_EVAL_GUIDE.md

Старая карточка указывает LoRA с r=32, alpha=64, максимальную длину 2048 токенов и 1.7M обучающих примеров.

Как загрузить

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-morpho-pipeline"))
for name in ("QUICKSTART.md", "inference.py", "deployment.py", "test_data.json"):
    print(root / name)

Код загружает инструкции, сценарии и тестовые данные в один каталог. Для inference требуется путь к отдельно обученным весам.

Доступ

Карточка и имена файлов доступны для просмотра. Код и данные скачиваются после одобрения заявки, отправленной через «Request access»; решения принимает команда TilQazyna.

Связанные репозитории

Источники обучения — kazakh-morpho-grammar и kazakh-morpho-corpus. Связанные модели: kazakh-morpho-qwen-unified, kazakh-morpho-qwen-ensemble и kazakh-morpho-qazcorpora.


English

kazakh-morpho-pipeline is a 0.6 MB repository of code and data for morphological, semantic, lexical, and word-formation analysis of Kazakh words. It provides training, evaluation, inference, and FastAPI deployment scripts, but does not publish trained model weights.

Repository contents

The pipeline targets Qwen/Qwen2.5-4B-Instruct with LoRA training. It covers nouns, adjectives, numerals, verbs, pronouns, adverbs, particles, interjections, and onomatopoeia.

Component Files
Data all_kazakh_grammar_data.json, test_data.json
Training train.sh, create_train_split.py
Evaluation evaluate.py, check_data.py
Inference and deployment inference.py, deployment.py
Guides QUICKSTART.md, TRAIN_EVAL_GUIDE.md

The previous card records LoRA settings of r=32 and alpha=64, a maximum length of 2048 tokens, and 1.7M training examples.

How to download

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-morpho-pipeline"))
for name in ("QUICKSTART.md", "inference.py", "deployment.py", "test_data.json"):
    print(root / name)

This downloads the guides, scripts, and test data into one local directory. Running inference requires a separately trained model path.

Access

The card and filenames remain publicly visible. Code and data downloads require a “Request access” submission reviewed by the TilQazyna team.

Related repositories

Training sources are kazakh-morpho-grammar and kazakh-morpho-corpus. Related models are kazakh-morpho-qwen-unified, kazakh-morpho-qwen-ensemble, and kazakh-morpho-qazcorpora.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/kazakh-morpho-pipeline