Configuration Parsing Warning:In config.json: "architectures" must be an array

YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

MiniMind-YuHua-AR-v2(104M,余华风格 AR 模型,纯余华数据从头训练)

余华风格生成模型 V2:MiniMind 104M AR,从余华 13 册 18793 段随机初始化预训练(无任何迁移学习),再 CoT v2 SFT(826 条通用题面、防人物泄漏)。

  • 训练:3 epochs pretrain + 5 epochs SFT
  • 加载:MiniMindForCausalLM,config + tokenizer + 权重
  • 生成:scripts/gen_yuhua_compare.py --model ar --weight full_sft_yuhua_cot_v2

V2 关键修正:V1 曾用顾城诗歌预训练权重做迁移学习,造成严重风格污染(具名人物乱入如"许三观/家珍/一乐")。V2 改为纯余华 13 册 18793 段从头预训练 + SFT,数据过滤 2222 段含具名人物的段落,CoT 模板改为通用题面("请用余华的风格写一段…",不出现具体书名/章节)。

V2 核心验证:具名人物泄漏归零(AR/Linear/dLM 三架构均 0/30)。详细对比见 GitHub ChineseHardJudgePoem/doc/COT_YUHUA_EXPERIMENTS_REPORT.md 第 6 节。

V2 局限:AR V2 通过率 86% 略低于 V1 的 100%(因 3 epochs 余华数据不足以让 104M 学够中文基础,少数样本出现乱码人名);dLM V2 通过率 16% 暴跌(迭代去噪机制不适合本规模本数据);Linear V2 通过率 100% 优于 V1。

Downloads last month
409
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support