Architecture
Vision Transformer
Fine-tuning depuis
google/vit-base-patch16-224-in21k.
Un Vision Transformer fine-tuné pour reconnaître trois états d'une feuille de haricot : tache angulaire, rouille et feuille saine.
Vision Transformer
Fine-tuning depuis
google/vit-base-patch16-224-in21k.
Beans
Images de feuilles de haricot avec des splits train, validation et test.
3 classes
Tache angulaire, rouille du haricot et feuille saine.
4 époques
Learning rate 5e-5 · Batch size 16.
Le projet suit un cycle complet : préparation des données, fine-tuning, évaluation et publication du modèle sur le Hugging Face Hub.
Chargement de beans avec les splits train,
validation et test.
Redimensionnement, normalisation et augmentation avec
torchvision.
Entraînement du ViT avec Trainer et sélection du
meilleur checkpoint.
Calcul de l'accuracy sur le split test indépendant.
Envoi des poids, labels et image processor avec
push_to_hub().
Le modèle retourne un score de confiance pour chacune des trois classes.
Tache angulaire
Maladie provoquant des lésions angulaires visibles sur les feuilles.
Rouille du haricot
Maladie souvent reconnaissable par des pustules brun-orangé.
Feuille saine
Feuille ne présentant pas les symptômes des deux maladies ciblées.
Après le fine-tuning, ajoute ici la valeur exacte de
eval_accuracy affichée par
trainer.evaluate(dataset["test"]).
Accuracy sur le jeu de test
À compléter
Exemple : 0.9870 ou 98.70%.
| Paramètre | Valeur |
|---|---|
| Modèle de base | google/vit-base-patch16-224-in21k |
| Nombre de classes | 3 |
| Époques | 4 |
| Learning rate | 5e-5 |
| Batch size | 16 |
| Métrique | Accuracy |
Dans le notebook, le modèle publié est rechargé via une pipeline Hugging Face, puis reçoit une image brute du jeu de test.
from transformers import pipeline
classifier = pipeline(
"image-classification",
model="EliasMeh/vit-beans-demo"
)
predictions = classifier(image)
Le dépôt du modèle contient les poids fine-tunés, le fichier
config.json, les labels et le processeur d'images
nécessaires pour l'inférence.