--- base_model: mikelalda/qwen27b_alia_tuned base_model_relation: quantized quantized_by: mikelalda pipeline_tag: text-generation license: cc-by-sa-4.0 language: - eu - es - en tags: - gguf - llama.cpp - qwen3_8 - basque - euskara - translation --- # qwen27b_alia_tuned — GGUF [`mikelalda/qwen27b_alia_tuned`](https://huggingface.co/mikelalda/qwen27b_alia_tuned) modeloaren GGUF esportazioa, llama.cpp, Ollama eta LM Studiorekin exekutatzeko. **Modeloari buruzko informazio osoa** — entrenamendu-datuak, hiperparametroak, prompt-formatuak eta mugak — oinarrizko modeloaren fitxan dago. Hemen esportazioari dagokiona baino ez. > **Egoera: ebaluatu gabe.** Ez da benchmarkik exekutatu, ez modelo honekin ez > kuantizatu gabekoarekin. --- ## Fitxategiak | Fitxategia | Kuantizazioa | Tamaina | |---|---|---| | `qwen27b-alia-q4_k_m.gguf` | Q4_K_M | 16,8 GB | Q4_K_M-k `Q6_K` erabiltzen du `attention.wv` eta `feed_forward.w2` tentsoreen erdietan, eta `Q4_K` gainerakoetan. Kalitatearen eta tamainaren arteko oreka gomendatua da. Xehetasun teknikoak: 866 tentsore, `qwen35` arkitektura, 248.320 tokeneko hiztegia. --- ## Erabilera Txat-txantiloia **GGUF fitxategian bertan dago txertatuta**, beraz ez duzu Modelfile-rik edo txantiloi gehigarririk behar. ### llama.cpp ```bash llama-cli -m qwen27b-alia-q4_k_m.gguf -cnv \ -p "Itzultzaile profesionala zara. Eres un traductor profesional." ``` Zerbitzari gisa: ```bash llama-server -m qwen27b-alia-q4_k_m.gguf -c 4096 ``` `-c 4096` entrenamenduko sekuentzia-luzerarekin bat dator. ### Ollama ```bash ollama create qwen27b-alia -f Modelfile ``` `Modelfile`: ``` FROM ./qwen27b-alia-q4_k_m.gguf ``` --- ## Esportazioaren xehetasunak Bi urratsetan sortua, RAM gutxiko makina batean (14 GiB): 1. `merged_bf16/` → GGUF **bf16** (`convert_hf_to_gguf.py`) 2. bf16 → **Q4_K_M** (`llama-quantize`) Bitartekaria bf16 da eta ez q8_0, arrazoi praktiko batengatik: `token_embd.weight` tentsoreak `{5120, 248320}` forma du — 1.271 milioi elementu — eta Q8_0-ra kuantizatzeko float32-n materializatu behar da, **5,1 GB asignazio bakarrean**. bf16-ra kopia zuzena da, memoriaren erdia. --- ## Mugak Oinarrizko modeloaren muga guztiak heredatzen ditu — **`HiTZ/RAG_eu` benchmarkarekin ebaluatzeko ezintasuna** eta **epoka partziala** barne. Irakurri [modelo nagusiaren fitxa](https://huggingface.co/mikelalda/qwen27b_alia_tuned) erabili aurretik. Gainera, kuantizazioak berezko degradazioa dakar: Q4_K_M-k kalitatea galtzen du bf16 originalarekin alderatuta, neurtu gabeko kopuru batean.