πŸ’¨πŸ“Ÿ Vikhr-Qwen-2.5-0.5B-Instruct

RU

Π˜Π½ΡΡ‚Ρ€ΡƒΠΊΡ‚ΠΈΠ²Π½Π°Ρ модСль Π½Π° основС Qwen-2.5-0.5B-Instruct, обучСнная Π½Π° русскоязычном датасСтС GrandMaster-PRO-MAX. Π’ 4 Ρ€Π°Π·Π° эффСктивнСС Π±Π°Π·ΠΎΠ²ΠΎΠΉ ΠΌΠΎΠ΄Π΅Π»ΠΈ, ΠΈ идСально ΠΏΠΎΠ΄Ρ…ΠΎΠ΄ΠΈΡ‚ для запуска Π½Π° слабых ΠΌΠΎΠ±ΠΈΠ»ΡŒΠ½Ρ‹Ρ… устройствах.

EN

Instructive model based on Qwen-2.5-0.5B-Instruct, trained on the Russian-language dataset GrandMaster-PRO-MAX. It is 4 times more efficient than the base model, making it perfect for deployment on low-end mobile devices.

GGUF

ΠžΡΠΎΠ±Π΅Π½Π½ΠΎΡΡ‚ΠΈ:

  • πŸ“š Основа / Base: Qwen-2.5-0.5B-Instruct
  • πŸ‡·πŸ‡Ί БпСциализация / Specialization: RU
  • πŸ’Ύ ДатасСт / Dataset: GrandMaster-PRO-MAX

ΠŸΠΎΠΏΡ€ΠΎΠ±ΠΎΠ²Π°Ρ‚ΡŒ / Try now:

Open In Colab

ОписаниС:

RU

Vikhr-Qwen-2.5-0.5B-instruct β€” это компактная языковая модСль, обучСнная Π½Π° датасСтС GrandMaster-PRO-MAX, ΡΠΏΠ΅Ρ†ΠΈΠ°Π»ΡŒΠ½ΠΎ доучСнная для ΠΎΠ±Ρ€Π°Π±ΠΎΡ‚ΠΊΠΈ русского языка. Π­Ρ„Ρ„Π΅ΠΊΡ‚ΠΈΠ²Π½ΠΎΡΡ‚ΡŒ ΠΌΠΎΠ΄Π΅Π»ΠΈ Π² 4 Ρ€Π°Π·Π° ΠΏΡ€Π΅Π²Ρ‹ΡˆΠ°Π΅Ρ‚ Π±Π°Π·ΠΎΠ²ΡƒΡŽ модСль, Π° Π΅Ρ‘ Ρ€Π°Π·ΠΌΠ΅Ρ€ составляСт 1Π“Π‘ , Ρ‡Ρ‚ΠΎ Π΄Π΅Π»Π°Π΅Ρ‚ Π΅Ρ‘ ΠΎΡ‚Π»ΠΈΡ‡Π½Ρ‹ΠΌ Π²Ρ‹Π±ΠΎΡ€ΠΎΠΌ для запуска Π½Π° слабых ΠΌΠΎΠ±ΠΈΠ»ΡŒΠ½Ρ‹Ρ… устройствах.

EN

Vikhr-Qwen-2.5-0.5B-instruct is a compact language model trained on the GrandMaster-PRO-MAX dataset, specifically designed for processing the Russian language. Its efficiency is 4 times higher than the base model, and its size is 1GB, making it an excellent choice for deployment on low-end mobile devices.

ΠžΠ±ΡƒΡ‡Π΅Π½ΠΈΠ΅ / Train:

RU

Для создания Vikhr-Qwen-2.5-0.5B-Instruct использовался ΠΌΠ΅Ρ‚ΠΎΠ΄ SFT (Supervised Fine-Tuning). ΠœΡ‹ ΠΎΠ±ΡƒΡ‡ΠΈΠ»ΠΈ модСль Π½Π° синтСтичСском датасСтС Vikhrmodels/GrandMaster-PRO-MAX (150k инструкций) с ΠΏΠΎΠ΄Π΄Π΅Ρ€ΠΆΠΊΠΎΠΉ CoT (Chain-Of-Thought), ΠΈΡΠΏΠΎΠ»ΡŒΠ·ΡƒΡ ΠΏΡ€ΠΎΠΌΠΏΡ‚Ρ‹ для GPT-4-turbo.

EN

To create Vikhr-Qwen-2.5-0.5B-Instruct, the SFT (Supervised Fine-Tuning) method was used. We trained the model on a synthetic dataset Vikhrmodels/GrandMaster-PRO-MAX (150k instructions) with support for CoT (Chain-Of-Thought), utilizing prompts for GPT-4-turbo.

ΠŸΡ€ΠΈΠΌΠ΅Ρ€ ΠΊΠΎΠ΄Π° для запуска / Sample code to run:

РСкомСндуСмая Ρ‚Π΅ΠΌΠΏΠ΅Ρ€Π°Ρ‚ΡƒΡ€Π° для Π³Π΅Π½Π΅Ρ€Π°Ρ†ΠΈΠΈ: 0.3 / Recommended generation temperature: 0.3.

from transformers import AutoModelForCausalLM, AutoTokenizer

# Π—Π°Π³Ρ€ΡƒΠ·ΠΊΠ° ΠΌΠΎΠ΄Π΅Π»ΠΈ ΠΈ Ρ‚ΠΎΠΊΠ΅Π½ΠΈΠ·Π°Ρ‚ΠΎΡ€Π°
model_name = "Vikhrmodels/Vikhr-Qwen-2.5-0.5B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

# ΠŸΠΎΠ΄Π³ΠΎΡ‚ΠΎΠ²ΠΊΠ° Π²Ρ…ΠΎΠ΄Π½ΠΎΠ³ΠΎ тСкста
input_text = "Напиши ΠΎΡ‡Π΅Π½ΡŒ ΠΊΡ€Π°Ρ‚ΠΊΡƒΡŽ Ρ€Π΅Ρ†Π΅Π½Π·ΠΈΡŽ ΠΎ ΠΊΠ½ΠΈΠ³Π΅ Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€."

messages = [
    {"role": "system", "content": "Π’Ρ‹ - Vikhr, ΠΏΠΎΠΌΠΎΡ‰Π½ΠΈΠΊ с искусствСнным ΠΈΠ½Ρ‚Π΅Π»Π»Π΅ΠΊΡ‚ΠΎΠΌ, созданный ΠΊΠΎΠΌΠΏΠ°Π½ΠΈΠ΅ΠΉ Vikhr models, Ρ‡Ρ‚ΠΎΠ±Ρ‹ Π±Ρ‹Ρ‚ΡŒ ΠΏΠΎΠ»Π΅Π·Π½Ρ‹ΠΌ, Π±Π΅Π·ΠΎΠ±ΠΈΠ΄Π½Ρ‹ΠΌ ΠΈ чСстным."},
    {"role": "user", "content": input_text},
]

# ВокСнизация ΠΈ гСнСрация тСкста
input_ids = tokenizer.apply_chat_template(messages, truncation=True, add_generation_prompt=True, return_tensors="pt")
output = model.generate(
    input_ids,
    max_length=1512,
    temperature=0.3,
    num_return_sequences=1,
    no_repeat_ngram_size=2,
    top_k=50,
    top_p=0.95,
)

# Π”Π΅ΠΊΠΎΠ΄ΠΈΡ€ΠΎΠ²Π°Π½ΠΈΠ΅ ΠΈ Π²Ρ‹Π²ΠΎΠ΄ Ρ€Π΅Π·ΡƒΠ»ΡŒΡ‚Π°Ρ‚Π°
generated_text = tokenizer.decode(output[0], skip_special_tokens=True)
print(generated_text)

ΠžΡ‚Π²Π΅Ρ‚ ΠΌΠΎΠ΄Π΅Π»ΠΈ / Model response:

Книга "Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€" – это сСрия ΠΊΠ½ΠΈΠ³, написанных британским писатСлСм Π”ΠΆΠΎΠ°Π½ Π ΠΎΡƒΠ»ΠΈΠ½Π³. Π­Ρ‚ΠΎ ΠΎΠ΄Π½ΠΎ ΠΈΠ· самых извСстных ΠΏΡ€ΠΎΠΈΠ·Π²Π΅Π΄Π΅Π½ΠΈΠΉ Π² ΠΌΠΈΡ€Π΅ Π»ΠΈΡ‚Π΅Ρ€Π°Ρ‚ΡƒΡ€Ρ‹ ΠΈ популярного дСтского творчСства.

ΠžΡΠ½ΠΎΠ²Π½Ρ‹Π΅ Ρ‡Π΅Ρ€Ρ‚Ρ‹ сСрии:

  1. Π‘ΡŽΠΆΠ΅Ρ‚: Бобытия Ρ€Π°Π·Π²ΠΎΡ€Π°Ρ‡ΠΈΠ²Π°ΡŽΡ‚ΡΡ Π²ΠΎΠΊΡ€ΡƒΠ³ ΠΌΠ°Π»ΡŒΡ‡ΠΈΠΊΠ° ΠΏΠΎ ΠΈΠΌΠ΅Π½ΠΈ Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€, ΠΊΠΎΡ‚ΠΎΡ€Ρ‹ΠΉ учится Π² Π¨ΠΊΠΎΠ»Π΅ Π²ΠΎΠ»ΡˆΠ΅Π±ΡΡ‚Π²Π° ΠΈ философии Π² УнивСрситСтС Π₯огвартс. Он сталкиваСтся с Ρ€Π°Π·Π»ΠΈΡ‡Π½Ρ‹ΠΌΠΈ прСпятствиями, Π²ΠΊΠ»ΡŽΡ‡Π°Ρ Π±ΠΎΡ€ΡŒΠ±Ρƒ со Π·Π»ΠΎΠΌ, поиск Π΄Ρ€ΡƒΠ·Π΅ΠΉ ΠΈ самопознаниС.

  2. ΠŸΠ΅Ρ€ΡΠΎΠ½Π°ΠΆΠΈ: Π’ ΠΊΠ½ΠΈΠ³Π΅ прСдставлСны мноТСство пСрсонаТСй, ΠΊΠ°ΠΆΠ΄Ρ‹ΠΉ ΠΈΠ· ΠΊΠΎΡ‚ΠΎΡ€Ρ‹Ρ… ΠΈΠΌΠ΅Π΅Ρ‚ свои ΡƒΠ½ΠΈΠΊΠ°Π»ΡŒΠ½Ρ‹Π΅ Ρ‡Π΅Ρ€Ρ‚Ρ‹ Ρ…Π°Ρ€Π°ΠΊΡ‚Π΅Ρ€Π°, ΠΌΠΎΡ‚ΠΈΠ²Π°Ρ†ΠΈΠΈ ΠΈ ΠΏΡ€ΠΎΡˆΠ»ΠΎΠ΅. Π“Π»Π°Π²Π½Ρ‹ΠΉ Π³Π΅Ρ€ΠΎΠΉ, Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€, являСтся ΠΏΡ€ΠΈΠΌΠ΅Ρ€ΠΎΠΌ Π΄ΠΎΠ±Ρ€ΠΎΠ³ΠΎ ΠΈ смСлого Ρ‡Π΅Π»ΠΎΠ²Π΅ΠΊΠ°, Π° Ρ‚Π°ΠΊΠΆΠ΅ Π½Π΅ΠΎΠ±Ρ‹Ρ‡Π½ΠΎΠΉ Π»ΠΈΡ‡Π½ΠΎΡΡ‚ΡŒΡŽ.

  3. Π’Π΅ΠΌΡ‹ ΠΈ ΠΈΠ΄Π΅ΠΈ: Рассказы ΠΊΠ½ΠΈΠ³ΠΈ Π·Π°Ρ‚Ρ€Π°Π³ΠΈΠ²Π°ΡŽΡ‚ Ρ‚Π΅ΠΌΡ‹ любви, Π΄Ρ€ΡƒΠΆΠ±Ρ‹, справСдливости, ΠΌΠΎΡ€Π°Π»ΠΈ, чСловСчСской нСповиновСнности ΠΈ ваТности обучСния Ρ‡Π΅Ρ€Π΅Π· ΠΏΡ€ΠΈΠΊΠ»ΡŽΡ‡Π΅Π½ΠΈΡ.

  4. Π˜ΡΡ‚ΠΎΡ€ΠΈΡ ΠΈ Ρ€Π°Π·Π²ΠΈΡ‚ΠΈΠ΅ пСрсонаТСй: Π§Π΅Ρ€Π΅Π· события ΠΈ взаимодСйствиС с Π΄Ρ€ΡƒΠ³ΠΈΠΌΠΈ пСрсонаТами ΠΊΠ½ΠΈΠ³Π° исслСдуСт Π³Π»ΡƒΠ±ΠΎΠΊΠΈΠ΅ психологичСскиС ΠΈ философскиС вопросы.

  5. ВлияниС Π½Π° ΠΊΡƒΠ»ΡŒΡ‚ΡƒΡ€Ρƒ: "Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€" ΠΎΠΊΠ°Π·Π°Π» ΠΎΠ³Ρ€ΠΎΠΌΠ½ΠΎΠ΅ влияниС Π½Π° ΠΌΠΈΡ€ΠΎΠ²ΡƒΡŽ Π»ΠΈΡ‚Π΅Ρ€Π°Ρ‚ΡƒΡ€Ρƒ, ΠΏΡ€Π΅Π²Ρ€Π°Ρ‚ΠΈΠ²ΡˆΠΈΡΡŒ Π² ΠΊΡƒΠ»ΡŒΡ‚ΠΎΠ²Ρ‹ΠΉ ΠΆΠ°Π½Ρ€ ΠΈ символ Π·Π½Π°Π½ΠΈΠΉ ΠΈ мудрости.

  6. Π”ΠΎΡΡ‚ΡƒΠΏΠ½ΠΎΡΡ‚ΡŒ: Книги сСрии доступны для ΡˆΠΈΡ€ΠΎΠΊΠΎΠΉ Π°ΡƒΠ΄ΠΈΡ‚ΠΎΡ€ΠΈΠΈ ΠΈ ΠΏΠΎΠ»ΡŒΠ·ΡƒΡŽΡ‚ΡΡ большим спросом, Ρ‡Ρ‚ΠΎ Π΄Π΅Π»Π°Π΅Ρ‚ ΠΈΡ… популярным Π²Ρ‹Π±ΠΎΡ€ΠΎΠΌ срСди Ρ‡ΠΈΡ‚Π°Ρ‚Π΅Π»Π΅ΠΉ всСх возрастов.

  7. Π Π°Π·Π²ΠΈΡ‚ΠΈΠ΅ ΠΆΠ°Π½Ρ€Π°: НСсмотря Π½Π° Ρ‚ΠΎ Ρ‡Ρ‚ΠΎ "Π“Π°Ρ€Ρ€ΠΈ ΠŸΠΎΡ‚Ρ‚Π΅Ρ€" являСтся Ρ‡Π°ΡΡ‚ΡŒΡŽ сСрии, ΠΎΠ½ ΠΏΡ€ΠΎΠ΄ΠΎΠ»ΠΆΠ°Π΅Ρ‚ Π±Ρ‹Ρ‚ΡŒ Π»ΡŽΠ±ΠΈΠΌΡ‹ΠΌ ΠΈ Π°ΠΊΡ‚ΡƒΠ°Π»ΡŒΠ½Ρ‹ΠΌ, Ρ‚Π°ΠΊ ΠΊΠ°ΠΊ ΠΏΡ€ΠΎΠ΄ΠΎΠ»ΠΆΠ°Π΅Ρ‚ ΡƒΠ΄ΠΈΠ²Π»ΡΡ‚ΡŒ Ρ‡ΠΈΡ‚Π°Ρ‚Π΅Π»Π΅ΠΉ Π½ΠΎΠ²Ρ‹ΠΌΠΈ историями ΠΈ пСрсонаТами.

Π­Ρ‚Π° сСрия ΠΊΠ½ΠΈΠ³ остаСтся ΠΎΠ΄Π½ΠΎΠΉ ΠΈΠ· самых Π·Π½Π°Ρ‡ΠΈΡ‚Π΅Π»ΡŒΠ½Ρ‹Ρ… ΠΈ Π²Π»ΠΈΡΡ‚Π΅Π»ΡŒΠ½Ρ‹Ρ… Π² истории Π»ΠΈΡ‚Π΅Ρ€Π°Ρ‚ΡƒΡ€Ρ‹, ΠΎΠΊΠ°Π·Π°Π² влияниС Π½Π° Ρ€Π°Π·Π²ΠΈΡ‚ΠΈΠ΅ ΠΌΠΈΡ€ΠΎΠ²ΠΎΠΉ ΠΊΡƒΠ»ΡŒΡ‚ΡƒΡ€Ρ‹ ΠΈ ΠΎΠ±Ρ€Π°Π·ΠΎΠ²Π°Π½ΠΈΠ΅.

Авторы / Authors

@article{nikolich2024vikhr,
  title={Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian},
  author={Aleksandr Nikolich and Konstantin Korolev and Sergey Bratchikov and Nikolay Kompanets and Artem Shelmanov},
  journal={arXiv preprint arXiv:2405.13929},
  year={2024},
  url={https://arxiv.org/pdf/2405.13929}
}
Downloads last month
556
Safetensors
Model size
0.5B params
Tensor type
F16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for Vikhrmodels/Vikhr-Qwen-2.5-0.5b-Instruct

Finetuned
(925)
this model
Finetunes
4 models
Quantizations
5 models

Dataset used to train Vikhrmodels/Vikhr-Qwen-2.5-0.5b-Instruct

Spaces using Vikhrmodels/Vikhr-Qwen-2.5-0.5b-Instruct 2

Paper for Vikhrmodels/Vikhr-Qwen-2.5-0.5b-Instruct