# Confucius4
中文 | English
## 📑 Confucius4:基于迭代式SFT-RL交互与紧凑思维链共同优化的多模态推理大模型
**基于 Qwen3.5-27B | 协议:Apache 2.0**
图1:子曰4在多个视觉数理基准上达到同规模模型中最佳水平
图2:子曰4在多个视觉数理基准上大幅降低了输出token的数量
## 快速导航
- [1 模型下载](#1-模型下载)
- [2 模型介绍](#2-模型介绍)
- [3 性能表现](#3-性能表现)
- [4 模型推理](#4-模型推理)
## 1 模型下载
| **模型** | **HuggingFace** | **ModelScope** |
| :------: | :------------: | :----------: |
| Confucius4 | [🤗 HuggingFace](https://huggingface.co/netease-youdao/Confucius4) | [ModelScope](https://modelscope.cn/models/netease-youdao/Confucius4) |
## 2 模型介绍
Confucius4 是网易有道 AI 团队基于 Qwen3.5 架构开发的开源多模态大语言模型,专为数学推理设计。核心亮点:
✅ **1. 通过构建高性价比多模态训练集,与 SFT-RL 迭代训练框架相结合,有效提高模型在全场景下的解题能力,在同尺寸模型中取得了 SOTA 水平。**
- 利用图像增益筛选剔除低价值视觉冗余,构建高性价比多模态训练集。
- 采用「监督微调(SFT)+ 强化学习(RL)」的迭代训练范式,持续拉高模型在纯文本、图形题等全场景下的解题能力。
✅ **2. 纯文本推理数据增强 SFT,加强多模态模型 "推理底座",显著提升纯文本难题解题能力,在内部 Math-Hard-500 上实现 23.2% 提升**
- SFT 阶段注入纯文本推理数据,加固多模态模型推理底座。
- 构建「纯文本推理 + 多模态解题」的混合训练范式,实现 "推理能力" 与 "多模态感知" 的协同提升。
✅ **3.「重写思维链 SFT + 长度感知 RL」双管齐下,解决推理过程 Overthink 问题,实现准确率与推理效率双优,整体思维链减少 43.2%**
- SFT 阶段:对思维链进行重构优化,剔除冗余推理步骤,构建 "简洁、高效、关键信息无遗漏" 的高质量思维链。
- RL 阶段:引入 Length-Aware Advantage 强化学习机制,在优势计算中加入 explore-exploit tradeoff,对非难题推理长度进行约束,有效避免 "过度思考"。
此外,通过针对性的中文数据优化,模型的输出更符合国人习惯。
## 3 性能表现
| 评测基准 | Confucius3-Math | Qwen3.5-27B | Qwen3.5-35B-A3B | Qwen3.6-27B | Confucius4 |
|-------------------|--------------------|-------------|-----------------|-------------|---------------|
| Math-Hard-500 | 0.626 | 0.582 | 0.614 | 0.756 | 0.814 |
| Math-Figure | - | 0.866 | 0.834 | 0.865 | 0.907 |
| MathVision (testmini) | - | 0.651 | 0.625 | 0.648 | 0.724 |
| logicVista | - | 0.734 | 0.741 | 0.743 | 0.779 |
| MathVerse | - | 0.866 | 0.859 | 0.865 | 0.876 |
| MathVista (testmini) | - | 0.874 | 0.864 | 0.871 | 0.874 |
| DynaMath | - | 0.877 | 0.889 | 0.856 | 0.893 |
| We-Math | - | 0.913 | 0.906 | 0.907 | 0.912 |
**说明:**
- `Math-Figure` 为内部收集的闭源多模态解题数据集,共 664 条样本。
- `Math-Hard-500` 为闭源数据集,聚焦于初高中较难与困难题目,以及部分竞赛题,共 500 条样本。
- `Confucius3-Math` 为纯文本模型,因此仅测试了 Math-Hard-500 数据集。
## 4 模型推理
Confucius4 的运行环境要求与 Qwen3.5 模型完全一致。你可以方便地使用 Transformers 或 vLLM 加载并运行模型进行推理,并部署你的服务。
唯一需要注意的是,请使用下面提供的预定义系统消息和用户消息模板来请求模型。其他模板可能也能使用,但我们尚未进行测试。
```python
SYSTEM_PROMPT_TEMPLATE = """You are a helpful assistant."""
```
然后,你可以按以下方式创建 `messages` 并用其请求模型结果。多模态输入时,将图像编码为 base64 与文本问题一起传入。
```python
import base64
from transformers import AutoModelForCausalLM, AutoProcessor
model_name = "netease-youdao/Confucius4"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True
)
processor = AutoProcessor.from_pretrained(model_name)
# 读取并编码图像
image_path = "path/to/your/image.jpg"
with open(image_path, "rb") as f:
image_bytes = f.read()
image_base64 = base64.b64encode(image_bytes).decode("utf-8")
messages = [
{"role": "system", "content": SYSTEM_PROMPT_TEMPLATE},
{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": f"data:image;base64,{image_base64}"}},
{"type": "text", "text": "请你仔细观察图像中的题目,并回答对应的问题。"},
]},
]
text = processor.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
inputs = processor(text=text, return_tensors="pt").to(model.device)
generated_ids = model.generate(
**inputs,
max_new_tokens=16384,
temperature=0.6,
top_p=0.95,
top_k=20,
do_sample=True
)
generated_ids = [
output_ids[len(input_ids):] for input_ids, output_ids in zip(inputs.input_ids, generated_ids)
]
response = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
```
> [!NOTE]
> **生成参数**:建议使用 Temperature=0.6, TopP=0.95, TopK=20 进行采样。
获取模型结果后(如通过 vLLM API),你可以按如下方式解析推理过程和答案。
```python
res = response.json()['choices']
for index in range(len(res)):
content = res[index]['message']['content'] # summary
reasoning = res[index]['message']['reasoning'] # thinking
```
## 致谢
特别感谢 [ms-swift](https://github.com/modelscope/ms-swift) 团队提供的高效、可扩展的微调框架,极大地促进了本模型的训练工作。同时感谢通义千问团队提供的基座模型。
## 模型说明
本项目基于 **Qwen3.5-27B** 二次开发、微调与部署优化。
## 开源协议
本项目整体遵循 **Apache License 2.0** 开源协议
- 可免费商用、修改、分发
- 二次修改需标注变更来源
- 衍生作品需保留原始开源声明
## 引用
如果您觉得我们的工作有帮助,欢迎引用。
```
@misc{confucius4,
title = {Confucius4: Advancing Multimodal Reasoning with Iterative SFT-RL Optimization and Compact Chain-of-Thought},
author = {NetEase Youdao AI Team},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/netease-youdao/Confucius4}}
}
```