Qwen3.5-4B Ariadna GRPO — GGUF Q4_K_M

Квантованные GGUF-модели для доменного эксперта по ML/AI-терминологии.

🔗 Исходная safetensors-модель: qwen3.5-4b-ariadna-grpo-v1 — GRPO v10, KAT 3-level + GRM reward, полный пайплайн CPT→SFT→GRPO.

Доступные версии

Файл Версия Описание
qwen35-4b-ariadna-grpo-v10.Q4_K_M.gguf v10 GRPO с KAT 3-level + GRM-наградой
model-Q4_K_M.gguf v1 SFT-базовый уровень (без GRPO)

Результаты сравнительного тестирования (2026-07-17)

Базовый тест: 50 фундаментальных терминов ML/AI

Метрика v1 (SFT) v10 (GRPO)
Осмысленных ответов 40/50 (80%) 43/50 (86%)
Средняя длина ответа 98 слов 106 слов
Среднее время ответа 2781 мс 2584 мс

📄 gguf_v1_vs_v10_comparison.pdf

Хард-тест: 50 редких/специализированных терминов (из библиотеки статей)

Метрика v1 (SFT) v10 (GRPO)
Осмысленных ответов 36/50 (72%) 34/50 (68%)
Средняя длина ответа 74 слов 73 слов
Среднее время ответа 2712 мс 2876 мс

📄 gguf_v1_vs_v10_hard_comparison.pdf

Ключевые выводы

  • v10 (GRPO) лучше на базовых понятиях (+6 п.п.) — быстрее, структурнее ответы
  • v1 (SFT) лучше на редких терминах (+4 п.п.) — меньше катастрофического забывания от GRPO

Механизм катастрофического забывания в GRPO: group-relative advantage даёт частотным паттернам систематически более высокие преимущества в группе, вытесняя редкие знания из policy. Это известный и подтверждённый феномен GRPO-посттренинга (верифицировано через доменного субагента, 2026-07-17).

Роль GRM: GRM (Generative Reward Model) — это модель награды, а не механизм памяти. Она обеспечивает качественный сигнал для policy optimization, но не предотвращает catastrophic forgetting сама по себе. Без GRM ручные правила дают нестабильный сигнал (−10 п.п. в ранних версиях). С GRM награда стабильна, но forgetting редких терминов сохраняется.

Открытая проблема: конфликт между оптимизацией популярных паттернов и сохранением редких знаний не имеет полного решения в GRPO и RLHF. Текущие методы (KL-регуляризация, curriculum learning, knowledge distillation) смягчают, но не устраняют проблему.

Рекомендация: v10 для оперативных запросов, v1 для глубоких доменных вопросов по редким концептам.

Использование

# llama-server
llama-server -m qwen35-4b-ariadna-grpo-v10.Q4_K_M.gguf -ngl 99 -c 4096 --jinja --host 127.0.0.1 --port 8080

# llama-cli
llama-cli -m qwen35-4b-ariadna-grpo-v10.Q4_K_M.gguf -ngl 99 -p "Объясни: что такое Governed Memory в контексте AI-агентов?"

Связанные репозитории

Downloads last month
394
GGUF
Model size
4B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support