xVITA-Embed-300M-zhTW

云碩科技(xCloudinfo)自製繁體中文檢索 Embedding 模型。

以 Google EmbeddingGemma-300m 為底模(非中國血統、Gemma 授權可商用), 使用台達 DRCD 繁體中文閱讀理解資料集之 26,936 組 QA、經困難負例挖掘(hard negative mining)擴增為 80,808 組三元組, 以 CachedMultipleNegativesRankingLoss(batch 256、bf16)對比學習微調;v2 再經 8192 長上下文擴展與教師模型蒸餾強化。 目標場景:繁體中文 RAG 檢索(知識管理、企業文件問答)。

v2(本版,2026-07-18)重點

  • 最大長度 2048 → 8192 tokens(原生 rope_theta 1M 全域層,免 RoPE scaling,長文續訓)
  • 短文檢索 hit@1 85.4 → 86.0(教師蒸餾強化)
  • 向量維度 768 不變;與 v1 向量空間不相容,升級需全庫重嵌(v1 權重仍可由 git revision 取得)

短段落檢索評測(DRCD test:3,493 查詢 / 1,000 段落庫)

排名 模型 參數 hit@1 hit@5 hit@10
1 Qwen3-Embedding-8B(參考組) 8B 86.5 97.9 99.0
2 xVITA-Embed-300M-zhTW v2(本模型) 0.3B 86.0 97.4 98.7
3 xVITA-Embed-300M-zhTW v1 0.3B 85.4 97.4 98.4
4 multilingual-e5-large 0.56B 82.8 95.3 97.0
5 BAAI/bge-m3 0.57B 82.2 95.6 97.2
6 google/embeddinggemma-300m(原版底模) 0.3B 82.1 94.9 96.7
7 snowflake-arctic-embed-l-v2.0 0.57B 80.9 94.2 96.4
  • 以 0.3B 參數超越所有 0.5B 級多語模型,距 8B 級開源第一名僅 0.5 個百分點(hit@1)。
  • 誠實聲明:本評測與訓練資料同為 DRCD 分布(維基百科型知識問答),跨領域表現請以實際語料實測為準。

長文整篇檢索評測(DRCD test:378 篇完整文章 / 3,493 查詢)

模型 hit@1 hit@5 hit@10
xVITA-Embed-300M-zhTW 長文特化版(GGUF,見下) 84.7 94.5 96.6
xVITA-Embed-300M-zhTW v1(2048 截斷) 80.6 91.6 94.1
xVITA-Embed-300M-zhTW v2(本模型,8192) 79.2 91.2 94.3
BAAI/bge-m3(8k 原生) 77.5 90.3 93.4
  • 誠實聲明:v2 的蒸餾強化以短文檢索為主要目標,長文整篇檢索相對長文特化版有取捨。 若你的檢索單位是整份長文件(法規、報告全文),請改用 GGUF repo長文特化版(hit@1 84.7); 一般段落級 RAG(chunk ≤ 2048 tokens)用本模型即可,短文分數最佳。

用法(sentence-transformers)

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("xCloudinfo/xVITA-Embed-300M-zhTW")

# 查詢端與文檔端必須使用 EmbeddingGemma 規格的 prompt:
q = model.encode("台灣最高的山是哪一座?",
                 prompt="task: search result | query: ")
d = model.encode(["玉山主峰海拔 3,952 公尺,為台灣第一高峰。"],
                 prompt="title: none | text: ")
print((q @ d.T))

為什麼 0.3B 夠用——模型大小與檢索品質的取捨

Embedding 與生成模型的規律不同:參數容量買的是知識廣度與推理能力,而檢索要的是語意空間的排列品質。 把語意相近的文字映射到相近的向量位置,任務複雜度的天花板遠低於文字生成——這也是 MTEB 排行榜長年由 0.1B-0.6B 模型霸榜(e5、bge、GTE 皆是)的原因。

本模型的實測數字說明了邊際效益:26 倍的參數差(8B vs 0.3B),在 3,493 題繁中檢索上只換到 0.5 個百分點的 hit@1(86.5 vs 86.0)。而 0.3B 換來的是:

  • 推理成本約 1/26,單張消費級 GPU、純 CPU 甚至邊緣裝置(Jetson 等)即可部署
  • 全庫重嵌(RAG 換模型的一次性成本)快一個數量級
  • 查詢延遲低,適合線上服務

大容量模型真正的優勢在 zero-shot 廣度:數十種語言、冷門領域、程式碼檢索、指令式查詢。若你的場景是 單一語言、領域收斂的 RAG(如繁中企業文件問答),領域特化的小模型是成本效益最高的選擇;若場景高度 跨域跨語言,仍建議評估更大的模型。

誠實的限制:非中文查詢與跨領域冷僻術語未特化;長文整篇檢索請用長文特化版。上線前建議以自有語料做 A/B 實測驗收。

版本歷史

版本 日期 最大長度 短文 hit@1 長文 hit@1 取得方式
v2(本版) 2026-07-18 8192 86.0 79.2 main
v1 2026-07-06 2048 85.4 80.6(截斷) git revision(2026-07-18 前之 commit)

訓練細節

項目 設定
底模 google/embeddinggemma-300m
資料 DRCD train 26,936 QA → 困難負例三元組 80,808 組;v2 增長文對與蒸餾資料
損失 CachedMultipleNegativesRankingLoss;v2 蒸餾階段以教師模型排序打分
批次 256(in-batch negatives + 3 hard negatives)
精度 bf16
硬體 NVIDIA RTX 6000 Ada(云碩地端 GPU 機群)

授權

底模依 Gemma Terms of Use 授權,本微調模型之使用同受其約束。

Gemma 合規聲明

Gemma is provided under and subject to the Gemma Terms of Use found at ai.google.dev/gemma/terms

  • 本模型為 Google EmbeddingGemma-300m 的修改版本(Model Derivative),已於繁體中文檢索語料上微調,並擴充上下文長度至 8192。
  • 使用者再散布本模型或其衍生物時,須一併傳遞 Gemma Terms of Use 第 3.2 節之使用限制。 訓練資料 DRCD 為台達電子公開釋出之繁體中文閱讀理解資料集(CC BY-SA 3.0)。

云碩科技股份有限公司(xCloudinfo Corp. Limited)

Downloads last month
222
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for xCloudinfo/xVITA-Embed-300M-zhTW

Finetuned
(265)
this model
Quantizations
1 model

Collection including xCloudinfo/xVITA-Embed-300M-zhTW