RuModernBERT Tagger (FineWeb‑Tuned)
Модель для мульти‑лейбл теггирования русскоязычных текстов
Дообучена на базе deepvk/RuModernBERT-base с использованием синтетических тегов,
сгенерированных Qwen3‑235B‑A22B‑Instruct‑2507 для выборки из 140 000 текстов из датасета FineWeb (русскоязычный подкорпус rus_Cyrl).
Задача
Модель решает задачу мульти‑лейбл классификации и возвращает вектор логитов длины 788, где каждый элемент соответствует одному из заранее заданных тегов.
Архитектура
| Параметр | Значение |
|---|---|
| Базовый трансформер | deepvk/RuModernBERT-base |
| Тип задачи | Multi‑label classification |
| Количество тегов | 788 |
Словарь {индекс: название} тега хранится в конфиге модели (id2label).
Данные для обучения
- Источник: подмножество русскоязычных текстов из датасета FineWeb2
- Объём: 140 000 текстов
- Разметка: изначальные теги сгенерированы моделью Qwen3‑235B‑A22B‑Instruct‑2507 (каждый текст содержит 5 тегов)
- Стратегия: теги кластеризовались и объединялись в категорию, название которой генерировал Qwen3‑235B‑A22B‑Instruct‑2507
Особенность второй версии
В данной версии модель обучалась на тегах от LLM, а также был удален тег, который содержал в себе различные аббревиатуры.
- Downloads last month
- 3
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support