--- title: Chinese Classical Bench Leaderboard emoji: 🏛️ colorFrom: yellow colorTo: red sdk: gradio app_file: app.py pinned: false license: mit short_description: 中国古典语言能力评测基准排行榜 (5 tasks × 100 questions) tags: - leaderboard - chinese-classical - 文言文 - evaluation - llm --- # Chinese Classical Bench — Leaderboard 中国古典语言能力评测基准排行榜。5 个任务 × 100 题 = 500 道(古译今 / 断句加标点 / 字义解释 / 典故出处 / 字词填空),测国产开源 LLM 在中国古典文献理解上的横向对比。 - 评测集: [`gujilab/chinese-classical-bench`](https://huggingface.co/datasets/gujilab/chinese-classical-bench) - 配套语料 (CC0): [`gujilab/chinese-classical-corpus`](https://huggingface.co/datasets/gujilab/chinese-classical-corpus) - 评测代码 & runner: [github.com/gujilab/chinese-classical-bench](https://github.com/gujilab/chinese-classical-bench) ## 更新排行榜 本 Space 读取 `results/*.json`(与 GitHub 仓库 `results/` 同格式)。新增模型结果后,把对应 `.json` 复制到本 Space 的 `results/` 并重新部署即可。`app.py` 里的 `HEADLINE` 字典控制每个任务取哪个 headline metric(与 `scripts/aggregate.py` 一致)。