--- language: - kk license: apache-2.0 base_model: Qwen/Qwen2.5-0.5B-Instruct library_name: peft pipeline_tag: text-generation tags: - kazakh - morphology - lora - peft - text-generation - agglutinative datasets: - TilQazyna/kaz-morphology-sample extra_gated_prompt: >- Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application. extra_gated_fields: Аты-жөні / ФИО / Full name: text Ұйым / Организация / Affiliation: text Мақсаты / Цель использования / Intended use: text --- # kaz-qwen-morphology-0.5b Қазақ сөздерін талдайтын LoRA адаптері · LoRA-адаптер для анализа казахских слов · LoRA adapter for Kazakh word analysis **[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)** --- ## Қазақша **kaz-qwen-morphology-0.5b** — қазақ сөзінің lemma, сөз табы және морфологиялық белгілерін болжауға арналған 20.2 МБ LoRA адаптері. Ол `Qwen/Qwen2.5-0.5B-Instruct` үстіне жүктеледі және бір сөзді мәтіндік сұрау арқылы талдайды. ### Құрылымы мен оқыту деректері | Сипаттама | Мәні | |---|---| | Негізгі модель | `Qwen/Qwen2.5-0.5B-Instruct` | | Адаптер | LoRA | | Rank | 8 | | Alpha | 16 | | Кітапхана | PEFT 0.18.0 | Fine-tune материалына 50,000-нан астам морфологиялық таңбаланған сөз және 7 сөз табы кірген. Ашық үлгі [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample) репозиторийінде; оқыту графында [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar) да көрсетілген. Талдау нәтижесі генерацияланған мәтін түрінде қайтарылады. ### Қалай іске қосады ```python from peft import PeftModel from transformers import AutoModelForCausalLM, AutoTokenizer base_id = "Qwen/Qwen2.5-0.5B-Instruct" adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b" base = AutoModelForCausalLM.from_pretrained(base_id) tokenizer = AutoTokenizer.from_pretrained(adapter_id) model = PeftModel.from_pretrained(base, adapter_id) inputs = tokenizer("Сөзді талда: барды", return_tensors="pt") output = model.generate(**inputs, max_new_tokens=64) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` Адаптер жеке толық модель емес: inference кезінде негізгі Qwen салмақтары мен PEFT бірге қажет. ### Қолжетімділік Карточка мен файлдар тізімі ашық көрінеді. Адаптер мен tokenizer файлдары «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін жүктеледі. ### Байланысты репозиторийлер Оқыту көздері — [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar) және [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample). Туыстас грамматикалық адаптер — [kaz-qwen-grammar-final](https://huggingface.co/TilQazyna/kaz-qwen-grammar-final). --- ## Русский **kaz-qwen-morphology-0.5b** — LoRA-адаптер объёмом 20.2 МБ, который предсказывает lemma, часть речи и морфологические признаки казахского слова. Он загружается поверх `Qwen/Qwen2.5-0.5B-Instruct` и получает отдельное слово в текстовом запросе. ### Устройство и обучающие материалы | Характеристика | Значение | |---|---| | Базовая модель | `Qwen/Qwen2.5-0.5B-Instruct` | | Тип адаптера | LoRA | | Rank | 8 | | Alpha | 16 | | Библиотека | PEFT 0.18.0 | Для fine-tune использовали свыше 50,000 морфологически размеченных слов по 7 частям речи. Публичный образец размещён в [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample); в графе обучения также указан [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar). ### Как запустить ```python from peft import PeftModel from transformers import AutoModelForCausalLM, AutoTokenizer base_id = "Qwen/Qwen2.5-0.5B-Instruct" adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b" base = AutoModelForCausalLM.from_pretrained(base_id) tokenizer = AutoTokenizer.from_pretrained(adapter_id) model = PeftModel.from_pretrained(base, adapter_id) inputs = tokenizer("Сөзді талда: барды", return_tensors="pt") output = model.generate(**inputs, max_new_tokens=64) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` Адаптер не содержит полную базовую модель: для inference нужны веса Qwen и библиотека PEFT. ### Доступ Карточка и перечень файлов видны всем посетителям. Скачивание адаптера и tokenizer открывается после одобрения формы «Request access» командой TilQazyna. ### Связанные репозитории Источники обучения — [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar) и [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample). Родственный грамматический адаптер — [kaz-qwen-grammar-final](https://huggingface.co/TilQazyna/kaz-qwen-grammar-final). --- ## English **kaz-qwen-morphology-0.5b** is a 20.2 MB LoRA adapter that predicts the lemma, part of speech, and morphological features of a Kazakh word. It loads on top of `Qwen/Qwen2.5-0.5B-Instruct` and analyzes one word supplied through a text prompt. ### Architecture and training material | Property | Value | |---|---| | Base model | `Qwen/Qwen2.5-0.5B-Instruct` | | Adapter type | LoRA | | Rank | 8 | | Alpha | 16 | | Library | PEFT 0.18.0 | Fine-tuning used more than 50,000 morphologically annotated words across 7 parts of speech. A public sample is available in [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample), and the training graph also identifies [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar). ### How to run ```python from peft import PeftModel from transformers import AutoModelForCausalLM, AutoTokenizer base_id = "Qwen/Qwen2.5-0.5B-Instruct" adapter_id = "TilQazyna/kaz-qwen-morphology-0.5b" base = AutoModelForCausalLM.from_pretrained(base_id) tokenizer = AutoTokenizer.from_pretrained(adapter_id) model = PeftModel.from_pretrained(base, adapter_id) inputs = tokenizer("Сөзді талда: барды", return_tensors="pt") output = model.generate(**inputs, max_new_tokens=64) print(tokenizer.decode(output[0], skip_special_tokens=True)) ``` The adapter does not contain the complete base model. Inference requires the Qwen weights together with PEFT. ### Access The card and repository file list remain publicly visible. Adapter and tokenizer downloads are enabled after the TilQazyna team approves a “Request access” submission. ### Related repositories Training sources are [kazakh-morpho-grammar](https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar) and [kaz-morphology-sample](https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample). The related grammar adapter is [kaz-qwen-grammar-final](https://huggingface.co/TilQazyna/kaz-qwen-grammar-final). --- Лицензия · License: apache-2.0 · [TilQazyna](https://huggingface.co/TilQazyna)