How to use from
Docker Model Runner
docker model run hf.co/shikunpunk/Qwen3.8-27B-Haizi-KTO
Quick Links

Qwen3.8-27B Haizi KTO LoRA Adapter(海子风格 KTO 后训练)

基于 Qwen/Qwen3.8-27B + 海子 SFT LoRA adapter 的 KTO 后训练 adapter。

模型说明

  • 基座模型:Qwen/Qwen3.8-27B
  • 训练方法:KTO(单模型,替代标准 DPO 双模型以解决 27B + 40GB 显存 OOM)
  • 训练数据:标注一致偏好数据(desirable=真实诗人诗歌,undesirable=非诗文本),64 条(128 样本)
  • LoRA 配置:r=16, alpha=32, dropout=0.05
  • 训练 3 epochs:train_loss 0.080 → 0.039(final 0.127),KTO rewards/margins=30.05

使用方法

from transformers import AutoModelForCausalLM, AutoProcessor, BitsAndBytesConfig
from peft import PeftModel
import torch

base = "Qwen/Qwen3.8-27B"
adapter = "shikunpunk/Qwen3.8-27B-Haizi-KTO"

quant = BitsAndBytesConfig(load_in_4bit=True, bnb_4bit_compute_dtype=torch.bfloat16,
                           bnb_4bit_quant_type="nf4", bnb_4bit_use_double_quant=True)
model = AutoModelForCausalLM.from_pretrained(base, trust_remote_code=True,
                                             torch_dtype=torch.bfloat16, device_map="auto",
                                             quantization_config=quant)
model = PeftModel.from_pretrained(model, adapter, is_trainable=False)
processor = AutoProcessor.from_pretrained(base, trust_remote_code=True)
model.eval()

说明

  • 该 adapter 是风格保真 KTO 后训练产物,配合 SFT 风格 adapter 使用(SFT 先学风格,KTO 强化偏好对齐)。
  • 相关代码与数据见项目 GitHub 仓库。
Downloads last month
8
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for shikunpunk/Qwen3.8-27B-Haizi-KTO

Base model

Qwen/Qwen3.8-27B
Adapter
(44)
this model