--- library_name: gguf license: other license_name: openmdw-1.1 license_link: https://openmdw.ai/ pipeline_tag: text-generation tags: - laguna - moe - uncensored - abliterix - apex - quantization - gguf - poolside base_model: - poolside/Laguna-S-2.1 base_model_relation: quantized ---
ABLITERIX TRIAL 16 APEX OpenMDW-1.1

Laguna-S-2.1-Uncensored-APEX-GGUF

English | 📖 中文文档

Uncensored 118B-A8B MoE · abliterix Trial 16 · APEX I 档 GGUF + imatrix

🌊 关于此版本

Laguna S 2.1 是 poolside 发布的 约 118B 总参数、每 token 激活约 8B 的 Mixture-of-Experts 模型,面向 agentic coding 与长程任务。架构要点:token-choice 路由与 softplus 门控、256 个路由专家 + 1 个共享专家(top-10)、GQA、1:3 全局/滑窗注意力(48 层:12 全局 + 36 滑窗,窗口 512)、约 100 万 token 上下文,并支持按请求开关的原生思考(thinking)与工具调用间交错推理。

本发布版在官方权重之上做了两件事:

  1. Uncensored 行为调整:使用 abliterix(ROCm + bitsandbytes 4-bit 搜索路径),选定 Trial 16 LoRA,stream-merge 回 BF16,并对 MoE 安全相关专家做 router 侧 bake-in。
  2. APEX 混合精度 GGUF:在 poolside llama.cpp(laguna 分支) 的 BF16 GGUF 上,用 APEX 式张量类型配置 + imatrix(token embedding / output 保持 BF16)。

许可证:OpenMDW-1.1(与基座同系)。详见 openmdw.ai 与 poolside 条款。

⚠️ Uncensored 说明

合并 abliterix Trial 16 后,本模型拒答倾向明显降低,输出行为可能与官方 Laguna-S-2.1 有实质差异。请在目标场景下自行评估合规与安全策略,并做好访问控制与审计。

拒答(harmful eval)8 / 100(基线约 97 / 100)
KL divergence约 0.0042
Length deviation约 0.07 σ
Generation healthPASSED
选用 Trialabliterix Trial 16

实现摘要:LoRA 合并 W += (B @ A) * (alpha / r)(本 trial alpha = r = 1);每层 top 约 20 个安全专家,router 行缩放约 0.74(见合并元数据)。

📜 声明(身份认知与文本质量)

以下现象在官方原版 Laguna-S-2.1(含在线服务等高精度部署)上亦可能出现,并非由本仓库的 Uncensored 调整所引入,请勿归因于 abliterix / 去拒答合并:

  • 模型身份认知异常或与官方人设不一致的自我描述;
  • 中文(及其他语言)中的异常字词、错字、生硬或偶发不通顺等文本质量问题。

本仓库的 Uncensored 流程主要改变拒答与安全相关行为。量化档位(尤其更激进的 Compact 等)可能放大原有文本噪声,但根源问题在原模型与/或量化推理链路中已存在。若需对照,建议在同等推理设置下比较官方原版与本 Uncensored 版本。

🧠 模型规格
架构Laguna MoE(poolside laguna
参数量约 118B 总计,每 token 激活约 8B
层数48(L0 为 dense FFN,L1–L47 为 MoE)
专家256 路由 + 1 共享,top-10
注意力GQA,8 KV heads,head dim 128
上下文至约 1,048,576 tokens(实际受显存与 -c 限制)
词表100,352(Laguna 族 tokenizer)
模态文本 → 文本(本包无 mmproj)
本仓库APEX I-Quality / I-Balanced / I-Compact GGUF

编程与工具能力大体保留;拒答与对齐行为已改变。本衍生版未重新跑完整官方 bench 表。

💡 什么是 APEX?

本仓库 GGUF 采用 APEX 式 MoE 感知混合精度:按张量角色 + 层位置分配精度(边缘更高、中间更激进),并配合 imatrixI- 档。

共性设置:源为 Laguna-S-2.1-Uncensored BF16 GGUF;校准 laguna-s-2.1.imatrixtoken embedding / output = BF16;router、norm 等小张量多为高精度默认。配置针对 Laguna 48 层命名(ffn_*_exps / ffn_*_shexp / attn_*,L0 dense)。

📦 APEX 量化档位
文件 体积 中间 expert 适用
*-I-Quality.gguf约 70 GB边缘 Q6_K / 近缘 Q5_K / 中间 iq4_xs;shared Q8_0;attn Q6_K更抠体积时的高质量尝试(中间层为 IQ)
*-I-Balanced.gguf约 80 GB边缘 Q6_K / 近缘与中间 Q5_K;shared Q8_0;attn Q6_K中文用户推荐默认,质量与稳定性更均衡
*-I-Compact.gguf约 52 GB边缘 Q4_K / 中间 Q3_K;shared Q6_K;attn Q4_K显存更紧,可接受更多 quant 噪声

选用建议:

  • 中文为主:请优先使用 I-Balanced。中间层用 Q5_K 而非 iq4_xs,观感通常更稳。显存紧张再退到 I-Compact。
  • 英文 / 代码为主:各档可用差异通常不大,可按显存与速度在 I-Balanced 与 I-Compact 之间选择;I-Quality 中间层为 IQ,按需试用。
🚀 使用方式(llama.cpp)

请使用支持 Laguna 架构的 llama.cpp(poolside 分支 laguna 或已合并相应支持的构建)。

示例(推荐 I-Balanced)

./llama-server \
  -m ./Laguna-S-2.1-Uncensored-APEX-I-Balanced.gguf \
  --port 8080 \
  -sm none \
  --device rocm0 \
  --ctx-size 131072 \
  --flash-attn on \
  --no-mmap \
  --fit on \
  --jinja \
  --host 0.0.0.0
  • 必须能识别 general.architecture = laguna
  • 思考与工具相关参数请按客户端 / 服务端文档配置(如 enable_thinking、reasoning 相关选项)。
  • 若出现 special_eos_id is not in special_eog_ids 一类警告,多为 tokenizer 元数据提示,模型仍可加载;停写异常时请检查 stop / max_tokens 与模板。
  • 本包为纯文本 GGUF,无 mmproj。
🎛️ 推荐采样
通用 / 编码temperature 0.6–1.0, top_p 0.95, top_k 20
更稳输出适当降低 temperature
🔧 构建链路(摘要)
  1. 基座:poolside/Laguna-S-2.1
  2. abliterix 搜索 → Trial 16 LoRA + MoE router 调整
  3. BF16 stream-merge → Laguna-S-2.1-Uncensored
  4. poolside llama.cpp → BF16 GGUF + imatrix
  5. APEX tensor-type-file + imatrix → I-Quality / I-Balanced / I-Compact
## 链接 - **原始模型**:https://huggingface.co/poolside/Laguna-S-2.1 - **发布博文**:https://poolside.ai/blog/introducing-laguna-s-2-1 - **OpenRouter**:https://openrouter.ai/poolside/laguna-s-2.1 - **官方 GGUF**:https://huggingface.co/poolside/Laguna-S-2.1-GGUF - **poolside llama.cpp(laguna)**:https://github.com/poolsideai/llama.cpp/tree/laguna - **abliterix**:https://github.com/wuwangzhang1216/abliterix - **APEX**:https://github.com/mudler/apex-quant - **许可证**:https://openmdw.ai/ ## 免责声明 本仓库为社区衍生(行为修改 + 量化)版本,**非 poolside 官方发布**。使用风险自负;请遵守当地法律与上游许可证。