--- license: apache-2.0 language: - kk library_name: transformers pipeline_tag: text-generation tags: - kazakh - kazakh-language - qwen2 - morpheme-bpe - til-core - tilqazyna - instruct - sft base_model: TilQazyna/Til-Core-0.5B datasets: - AmanMussa/kazakh-instruction-v2 extra_gated_prompt: >- Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application. extra_gated_fields: Аты-жөні / ФИО / Full name: text Ұйым / Организация / Affiliation: text Мақсаты / Цель использования / Intended use: text --- # Til-Core-0.5B-Instruct Қазақша нұсқауларды орындайтын тіл моделі · Модель для инструкций на казахском языке · Instruction-following model for Kazakh **[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)** --- ## Қазақша **Til-Core-0.5B-Instruct** — қазақ тіліндегі нұсқауларға жауап беретін 498M параметрлі модель. Репозиторий көлемі — 2.02 ГБ; модель [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B) негізінде supervised fine-tune әдісімен бейімделген. Модель Alpaca пішіміндегі бір айналымды тапсырмаларға арналған. Ол қазақша мәтін құрастырады және берілген жауап пішімін ұстанады, бірақ дәл дерек қажет міндеттерде қате мәлімет шығаруы мүмкін. ### Құрылымы мен үйрету | Сипаттама | Мәні | |---|---| | Архитектура | Qwen2ForCausalLM | | Параметр саны | 498M | | Жасырын қабат өлшемі | 896 | | Қабат саны | 18 | | Attention басы | 14 | | Сөздік | 256000 токен | | Контекст ұзындығы | 32768 токен | | Үйрету мысалы | 52,201 | | Epoch | 3 | | Қорытынды train loss | 3.12 | Үйретуде жауап бөлігіне ғана loss есептелген. Бұл нұсқа RLHF немесе DPO кезеңінен өтпеген және көп айналымды chat үшін бапталмаған. Нәтижені факті көзі ретінде қолданар алдында тексеру қажет. ### Сұрау пішімі Модель нұсқауды `### Нұсқаулық:` белгісінен кейін, ал жауаптың басталуын `### Жауап:` белгісімен күтеді. Қосымша кіріс болса, ол `### Кіріс:` бөлігіне жазылады. ### Іске қосу ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-Core-0.5B-Instruct" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ).eval() prompt = "### Нұсқаулық:\nДені сау болу үшін үш кеңес беріңіз.\n\n### Жауап:\n" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=120, do_sample=True, temperature=0.7, top_p=0.9) answer = output[0][inputs["input_ids"].shape[1]:] print(tokenizer.decode(answer, skip_special_tokens=True)) ``` ### Қолжетімділік Репозиторий карточкасы мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін «Request access» батырмасы арқылы өтінім жіберіледі; оны TilQazyna командасы қарайды. ### Байланысты репозиторийлер Базалық checkpoint — [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B). Supervised fine-tune деректерінің TilQazyna жинағы — [Til-Instruct](https://huggingface.co/datasets/TilQazyna/Til-Instruct). --- ## Русский **Til-Core-0.5B-Instruct** — модель на 498M параметров для выполнения инструкций на казахском языке. Репозиторий занимает 2.02 ГБ; модель получила supervised fine-tune поверх [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B). Модель рассчитана на одношаговые задания в формате Alpaca. Она генерирует казахский текст и соблюдает заданный формат ответа, но может ошибаться в задачах, где нужна точная фактическая информация. ### Устройство и обучение | Характеристика | Значение | |---|---| | Архитектура | Qwen2ForCausalLM | | Параметров | 498M | | Размер скрытого слоя | 896 | | Слоёв | 18 | | Голов attention | 14 | | Словарь | 256000 токенов | | Длина контекста | 32768 токенов | | Обучающих примеров | 52,201 | | Epoch | 3 | | Итоговый train loss | 3.12 | Loss при обучении считался только по ответу. Версия не проходила RLHF или DPO и не настроена на многошаговый chat. ### Формат запроса Инструкция ставится после маркера `### Нұсқаулық:`, а начало ответа обозначается строкой `### Жауап:`. Если у задания есть дополнительный ввод, он размещается в блоке `### Кіріс:`. ### Как запустить ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-Core-0.5B-Instruct" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ).eval() prompt = "### Нұсқаулық:\nДені сау болу үшін үш кеңес беріңіз.\n\n### Жауап:\n" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=120, do_sample=True, temperature=0.7, top_p=0.9) answer = output[0][inputs["input_ids"].shape[1]:] print(tokenizer.decode(answer, skip_special_tokens=True)) ``` ### Доступ Карточка репозитория и список файлов открыты для просмотра. Скачивание доступно после одобрения заявки, отправленной кнопкой «Request access»; заявки проверяет команда TilQazyna. ### Связанные репозитории Базовый checkpoint — [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B). Набор TilQazyna с данными для supervised fine-tune — [Til-Instruct](https://huggingface.co/datasets/TilQazyna/Til-Instruct). --- ## English **Til-Core-0.5B-Instruct** is a 498M-parameter model for following instructions in Kazakh. The repository is 2.02 GB; the checkpoint was produced by supervised fine-tuning [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B). The model targets single-turn Alpaca-style tasks. It can generate Kazakh responses and follow the expected answer format, although factual prompts may produce inaccurate information. ### Architecture and training | Property | Value | |---|---| | Architecture | Qwen2ForCausalLM | | Parameters | 498M | | Hidden size | 896 | | Layers | 18 | | Attention heads | 14 | | Vocabulary | 256000 tokens | | Context length | 32768 tokens | | Training examples | 52,201 | | Epochs | 3 | | Final train loss | 3.12 | Training applied loss only to completion tokens. This checkpoint has no RLHF or DPO stage and is not tuned for multi-turn chat. Its output should be checked before use as a factual reference. ### Prompt format The instruction follows the `### Нұсқаулық:` marker, and generation begins after `### Жауап:`. Tasks with a separate input place it under a `### Кіріс:` section. ### Usage ```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer repo = "TilQazyna/Til-Core-0.5B-Instruct" tokenizer = AutoTokenizer.from_pretrained(repo) model = AutoModelForCausalLM.from_pretrained( repo, dtype=torch.bfloat16, device_map="auto" ).eval() prompt = "### Нұсқаулық:\nДені сау болу үшін үш кеңес беріңіз.\n\n### Жауап:\n" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=120, do_sample=True, temperature=0.7, top_p=0.9) answer = output[0][inputs["input_ids"].shape[1]:] print(tokenizer.decode(answer, skip_special_tokens=True)) ``` ### Access The repository card and file list are visible to everyone. File downloads become available after the TilQazyna team approves a request submitted with the “Request access” button. ### Related repositories The base checkpoint is [Til-Core-0.5B](https://huggingface.co/TilQazyna/Til-Core-0.5B). TilQazyna's supervised fine-tuning data collection is [Til-Instruct](https://huggingface.co/datasets/TilQazyna/Til-Instruct). --- Лицензия · License: apache-2.0 · [TilQazyna](https://huggingface.co/TilQazyna)