--- library_name: peft base_model: Qwen/Qwen3-32B license: mit --- # qwen-3-32b-philosophy-spec-aft-no-cot-10k A LoRA adapter for [Qwen/Qwen3-32B](https://huggingface.co/Qwen/Qwen3-32B), trained using alignment fine-tuning (AFT) only, without chain-of-thought. Trained on 10k AFT examples. - **Base model:** Qwen/Qwen3-32B - **LoRA rank:** 64 - **LoRA alpha:** 128 - **Target modules:** q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj - **AFT dataset size:** 10k ## Usage ### Load as LoRA adapter ```python from transformers import AutoModelForCausalLM, AutoTokenizer from peft import PeftModel base_model = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen3-32B", torch_dtype="auto", device_map="auto", ) model = PeftModel.from_pretrained(base_model, "chloeli/qwen-3-32b-philosophy-spec-aft-no-cot-10k") tokenizer = AutoTokenizer.from_pretrained("chloeli/qwen-3-32b-philosophy-spec-aft-no-cot-10k") messages = [{"role": "user", "content": "What matters most when making a difficult decision?"}] text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True) inputs = tokenizer(text, return_tensors="pt").to(model.device) outputs = model.generate(**inputs, max_new_tokens=512) print(tokenizer.decode(outputs[0], skip_special_tokens=True)) ``` ### Merge into base model ```python from transformers import AutoModelForCausalLM, AutoTokenizer from peft import PeftModel base_model = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen3-32B", torch_dtype="auto", device_map="cpu", ) model = PeftModel.from_pretrained(base_model, "chloeli/qwen-3-32b-philosophy-spec-aft-no-cot-10k") merged_model = model.merge_and_unload() merged_model.save_pretrained("qwen-3-32b-philosophy-spec-aft-no-cot-10k-merged") tokenizer = AutoTokenizer.from_pretrained("chloeli/qwen-3-32b-philosophy-spec-aft-no-cot-10k") tokenizer.save_pretrained("qwen-3-32b-philosophy-spec-aft-no-cot-10k-merged") ``` ### Serve with vLLM ```python from vllm import LLM, SamplingParams from vllm.lora.request import LoRARequest llm = LLM( model="Qwen/Qwen3-32B", enable_lora=True, max_lora_rank=128, ) lora_request = LoRARequest("philosophy", 1, "chloeli/qwen-3-32b-philosophy-spec-aft-no-cot-10k") output = llm.generate("What matters most?", SamplingParams(max_tokens=512), lora_request=lora_request) ```