--- tags: - uv-script - text-classification - hf-jobs base_model: LiquidAI/LFM2.5-Encoder-350M datasets: - librarian-bots/arxiv-new-datasets-v2 pipeline_tag: text-classification library_name: transformers --- # lfm25-arxiv-new-dataset-classifier [LiquidAI/LFM2.5-Encoder-350M](https://huggingface.co/LiquidAI/LFM2.5-Encoder-350M) fine-tuned for single-label text classification on [librarian-bots/arxiv-new-datasets-v2](https://huggingface.co/datasets/librarian-bots/arxiv-new-datasets-v2). - **Labels (2)**: `new_dataset`, `not_new_dataset` - **Date**: 2026-07-29 08:25 UTC > [!NOTE] > This model uses a custom classification head (mean pooling over a backbone without a native sequence-classification class), so loading requires `trust_remote_code=True`. vLLM serving requires a standard architecture. ## Evaluation | Metric | Value | |--------|-------| | accuracy | 0.7850 | | f1_macro | 0.6441 | ## Usage ```python from transformers import AutoModelForSequenceClassification, AutoTokenizer model = AutoModelForSequenceClassification.from_pretrained("davanstrien/lfm25-arxiv-new-dataset-classifier", trust_remote_code=True) tokenizer = AutoTokenizer.from_pretrained("davanstrien/lfm25-arxiv-new-dataset-classifier", trust_remote_code=True) inputs = tokenizer("your text here", return_tensors="pt", truncation=True) print(model.config.id2label[model(**inputs).logits.argmax().item()]) ``` ## Reproduction Produced on [Hugging Face Jobs](https://huggingface.co/docs/huggingface_hub/guides/jobs) (`gpu`) with the [`train-classifier.py`](https://huggingface.co/datasets/uv-scripts/classification/raw/main/train-classifier.py) recipe from [uv-scripts](https://huggingface.co/uv-scripts). Run it yourself: ```bash hf jobs uv run --flavor gpu --secrets HF_TOKEN \ https://huggingface.co/datasets/uv-scripts/classification/raw/main/train-classifier.py \ librarian-bots/arxiv-new-datasets-v2 davanstrien/lfm25-arxiv-new-dataset-classifier --label-column labels ```