File size: 1,658 Bytes
d25fcad
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
---
language: ru
license: cc-by-4.0
tags:
- text-classification
- pytorch
- multi-task-learning
- rubert-tiny2
---

# Russian Multi-Task Toxicity Classifier 

Модель классификации токсичности комментариев по трем классам:
1. `profanity` — ненормативная лексика.
2. `threat` — угрозы безопасности/жизни.
3. `illegal` — призывы к нарушению законов.

Построена на базе `cointegrated/rubert-tiny2` с тремя независимыми классификационными слоями.

## Метрики F1-score на валидации (сбалансированный гибридный датасет):
- **PROFANITY**: 0.8466 (порог 0.90)
- **THREAT**: 0.7888 (порог 0.90)
- **ILLEGAL**: 0.9489 (порог 0.70)

## Графики и визуализация обучения

### 1. Распределение классов в датасете
![Распределение классов](class_distribution.png)

### 2. Матрица корреляции классов
![Корреляция классов](correlation_matrix.png)

### 3. Зависимость F1-меры от порога
![Пороги классификации](f1_vs_thresholds.png)

### 4. Распределение предсказанных вероятностей по категориям
![Распределение вероятностей](class_probabilities.png)

### 5. Анализ ложных тревог и пропусков для класса THREAT
![Анализ ошибок](threat_errors.png)