whisper-small-darija-combined

Fine-tuning de openai/whisper-small pour la reconnaissance automatique de la parole (ASR) en darija (dialecte marocain), sur un ensemble combiné de 7 datasets publics.

Résultats finaux

Métrique Valeur
WER (Word Error Rate) 0.1057 (10.57%)
CER (Character Error Rate) 0.1170 (11.70%)
Train loss (moyenne sur tout l'entraînement) 0.1113
Train loss (dernier step, epoch 10) 0.11129

Hyperparamètres d'entraînement

Hyperparamètre Valeur
Modèle de base openai/whisper-small
Époques 10
Batch size (par device) 2
Gradient accumulation 16
Batch effectif 32
Learning rate 5e-5
Weight decay 0.005
Optimiseur AdamW (par défaut Trainer)
Précision fp16
Gradient checkpointing Oui (use_reentrant=False)
Feature encoder gelé (freeze_feature_encoder)
Attention dropout 0.1
Hidden dropout 0.1
Feat proj dropout 0.0
Mask time prob 0.05
LayerDrop 0.1
Durée d'entraînement 4:47:22.11
Vitesse 23.27 samples/s, 0.727 steps/s

Datasets utilisés

  • adiren7/darija_speech_to_text
  • mohamedmou/moroccan-darija-asr-dataset-split
  • afyfbadreddine77/darija-asr-dataset
  • ntariklk/darija-merged-asr
  • atlasia/Moroccan-Darija-Wiki-Audio-Dataset
  • Datasmartly/moroccan_darija_audio (accès refusé — dataset privé, non inclus dans l'entraînement)
  • RHEZLOUNE/darija-restaurant-audio
  • anaszil/Segmented-Moroccan-Darija-Wiki-Audio-Dataset

Filtre appliqué : durée audio ≤ 15s.

Utilisation

Note : ce modèle (~317M paramètres, ~1,2 Go) peut être trop volumineux pour le widget d'inférence gratuit de la page Hugging Face (souvent limité en mémoire/temps pour les modèles de cette taille). Si le widget affiche une erreur ou ne charge pas, teste-le directement en local avec le code ci-dessous, ou via des Inference Endpoints dédiés.

from transformers import WhisperProcessor, WhisperForConditionalGeneration
import librosa
import torch

processor = WhisperProcessor.from_pretrained("amineouaki/whisper-small-darija-combined")
model = WhisperForConditionalGeneration.from_pretrained("amineouaki/whisper-small-darija-combined")

speech, sr = librosa.load("audio.wav", sr=16000)
inputs = processor(speech, sampling_rate=16000, return_tensors="pt")

with torch.no_grad():
    predicted_ids = model.generate(inputs["input_features"])

transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)
print(transcription[0])

Auteur

Amine Ouakib

Downloads last month
161
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for amineouaki/whisper-small-darija-combined

Finetuned
(3784)
this model

Datasets used to train amineouaki/whisper-small-darija-combined

Evaluation results