--- license: apache-2.0 base_model: GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking datasets: - t-tech/T-Wix language: - ru library_name: transformers pipeline_tag: text-generation tags: - merge - lora - russian - thinking - tool-calling - gguf - experimental --- # MiniCPM5-1B-Fable5-Thinking-T-Wix-ru > ⚠️ **Экспериментальный merge.** Не обучалась как единое целое: это LoRA-адаптер, обученный на другой модели, применённый к дистилляту. Известные дефекты описаны ниже. Метрики не снимались. Не для продакшена. Экспериментальное объединение двух моделей: - **[GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking](https://huggingface.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking)** — дистиллят Claude Opus/Fable5 (thinking, tool calling) на базе MiniCPM5-1B - **T-Wix LoRA (r=32)** из [kaufkino/MiniCPM5-1B-T-Wix-ru](https://huggingface.co/kaufkino/MiniCPM5-1B-T-Wix-ru) — русификация на ~461k диалогов [t-tech/T-Wix](https://huggingface.co/datasets/t-tech/T-Wix) Метод: LoRA-адаптер, обученный на базовой `openbmb/MiniCPM5-1B`, применён к дистилляту через `PeftModel.from_pretrained` + `merge_and_unload()` (адаптер и дистиллят имеют общую базу и архитектуру `LlamaForCausalLM`). ## Наблюдаемое поведение (ручной смоук-тест, не бенчмарк) **Что перенеслось:** - Беглый русский с хорошей структурой (наследие T-Wix LoRA) - Простая математика с пошаговым решением — заметно лучше, чем у чистой T-Wix-версии (наследие дистиллята) - Tool calling: корректно выбирает функцию и аргументы **Известные дефекты:** - Склонность к зацикливанию — **обязательно используйте `repetition_penalty=1.1–1.3`** - ``-режим дистиллята после merge в явном виде почти не проявляется - Фактология на русском слабая (модель 1B + языковой перенос): для фактов используйте RAG - Перевод EN→RU нестабилен ## Структура репозитория | Путь | Содержимое | |---|---| | `/` | merged-модель, bf16 safetensors | | `/gguf` | GGUF: F16, Q8_0 | ## Запуск ```python from transformers import AutoModelForCausalLM, AutoTokenizer repo = "kaufkino/MiniCPM5-1B-Fable5-Thinking-T-Wix-ru" model = AutoModelForCausalLM.from_pretrained(repo, dtype="bfloat16", device_map="auto") tokenizer = AutoTokenizer.from_pretrained(repo) messages = [{"role": "user", "content": "Реши: 17 * 23 = ?"}] inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt", return_dict=True).to(model.device) out = model.generate(**inputs, max_new_tokens=512, temperature=0.7, top_p=0.95, do_sample=True, repetition_penalty=1.15) print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True)) ``` Chat template (включая tools-формат) унаследован от дистиллята. ## Инфраструктура Собрано на облачном GPU-сервере [Selectel](https://selectel.ru/?ref_code=d71285bdb8) *(реферальная ссылка)*. --- **EN:** Experimental merge: T-Wix Russian LoRA (r=32, trained on base MiniCPM5-1B) applied onto a Claude Opus/Fable5 distill of the same base. Russian fluency + improved math/tool-calling vs the plain T-Wix tune; known issues: repetition loops (use repetition_penalty≥1.1), suppressed think-mode, weak Russian factual recall. Research artifact.