--- license: apache-2.0 language: - ja - en library_name: transformers pipeline_tag: text-generation base_model: llm-jp/llm-jp-4-8b-base base_model_relation: finetune tags: - llm-jp - japanese - chatml - reasoning - unsloth - trl datasets: - llm-jp/llm-jp-4-thinking-sft-data - nvidia/Nemotron-SFT-Agentic-v2 - nvidia/Nemotron-SFT-ARC-AGI-v1 - nvidia/Nemotron-SFT-Instruction-Following-Chat-v3 - nvidia/Nemotron-SFT-Multilingual-v2 - nvidia/Nemotron-SFT-Science-v2 - nvidia/Open-SWE-Traces - nri-ai/nri-fin-reasoning - OpenResearcher/OpenResearcher-Dataset - SousiOmine/codeqa-agent-distill-260703-ja - SousiOmine/codeqa-agent-distill-260704-ja - SousiOmine/codeqa-agent-distill-260705-ja - SousiOmine/codeqa-agent-distill-260709-ja --- # Lumi-v2-llm-jp-4-8b Lumi-v2-llm-jp-4-8b は、[llm-jp/llm-jp-4-8b-base](https://huggingface.co/llm-jp/llm-jp-4-8b-base) に対し、ChatML ベースのチャットテンプレートを用いて、約 1.7B トークンの事後学習データを用いて SFT を実施したモデルです。 ## 学習データ SFTには、次の公開データセットおよび自作データを用いました。 | データセット | ライセンス | |---|---| | [llm-jp/llm-jp-4-thinking-sft-data](https://huggingface.co/datasets/llm-jp/llm-jp-4-thinking-sft-data) | 複数(データセットカード参照) | | [nvidia/Nemotron-SFT-Multilingual-v2](https://huggingface.co/datasets/nvidia/Nemotron-SFT-Multilingual-v2)(日本語サブセット) | データセットカード参照 | | [nvidia/Nemotron-SFT-Agentic-v2](https://huggingface.co/datasets/nvidia/Nemotron-SFT-Agentic-v2) | CC BY 4.0 | | [nvidia/Nemotron-SFT-ARC-AGI-v1](https://huggingface.co/datasets/nvidia/Nemotron-SFT-ARC-AGI-v1) | CC BY 4.0 | | [nvidia/Nemotron-SFT-Science-v2](https://huggingface.co/datasets/nvidia/Nemotron-SFT-Science-v2) | CC BY-SA 4.0 | | [nvidia/Open-SWE-Traces](https://huggingface.co/datasets/nvidia/Open-SWE-Traces) | CC BY 4.0 | | [nvidia/Nemotron-SFT-Instruction-Following-Chat-v3](https://huggingface.co/datasets/nvidia/Nemotron-SFT-Instruction-Following-Chat-v3) | CC BY 4.0 / ODC-BY | | [nri-ai/nri-fin-reasoning](https://huggingface.co/datasets/nri-ai/nri-fin-reasoning) | CC BY 4.0 | | [OpenResearcher/OpenResearcher-Dataset](https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Dataset) | MIT | | SousiOmine/codeqa-agent-distill-ja シリーズ([260703](https://huggingface.co/datasets/SousiOmine/codeqa-agent-distill-260703-ja) / [260704](https://huggingface.co/datasets/SousiOmine/codeqa-agent-distill-260704-ja) / [260705](https://huggingface.co/datasets/SousiOmine/codeqa-agent-distill-260705-ja) / [260709](https://huggingface.co/datasets/SousiOmine/codeqa-agent-distill-260709-ja)) | Apache 2.0 | ## 謝辞 ベースモデルを公開している [LLM-jp](https://llm-jp.nii.ac.jp/) と、学習データを公開している各組織に感謝します。学習は千葉工業大学の GPGPU 計算環境を利用して実施しました。