J’ai conçu et déployé des modèles LLM spécialisés sur des domaines métier (par exemple la médecine préventive), via fine-tuning de LLaMA/Qwen avec LoRA et un déploiement autonome combinant Hugging Face et une infrastructure locale Ollama.
- Modèle Hugging Face : https://huggingface.co/fknguedia/qwen_2.5_coder_sqlagent_pilot
- Spécialisation métier : adaptation d’un modèle généraliste à un vocabulaire et des tâches spécifiques par fine-tuning LoRA, sans réentraîner l’intégralité des poids.
- Déploiement hybride : publication sur Hugging Face pour le partage et exécution locale via Ollama pour la confidentialité et la maîtrise des coûts.
- Industrialisation : pipeline complet de la curation des données jusqu’au déploiement sécurisé.
1. Le défi : un modèle généraliste ne suffit pas pour un métier critique
- Contexte : les LLM généralistes connaissent mal le vocabulaire, les contraintes réglementaires et les cas d’usage propres à un domaine métier (santé, finance, droit).
- Limites : réponses imprécises, hallucinations sur des termes techniques, absence d’alignement avec les processus internes.
- Objectif : disposer d’un modèle spécialisé, léger et déployable localement, capable de raisonner dans le contexte métier.
2. La solution : fine-tuning LoRA et déploiement autonome
- Fine-tuning paramétrique efficace (PEFT) avec LoRA : seuls quelques adaptateurs sont entraînés, ce qui réduit drastiquement le coût mémoire et le temps d’entraînement.
- Entraînement accéléré avec Unsloth : entraînement environ 2× plus rapide grâce à la bibliothèque Unsloth et à la TRL de Hugging Face.
- Quantification : modèle dérivé d’une base
Qwen2.5-Coder-0.5B-Instructquantifiée en 4 bits (bnb-4bit) pour une exécution légère.
3. Le pipeline complet : de la donnée au déploiement
- Curation des données : collecte, nettoyage et formatage des exemples métier au format instruction/réponse.
- Entraînement : fine-tuning LoRA avec suivi des métriques de perte et d’overfitting.
- Tests qualité : évaluation des réponses sur un jeu de validation métier.
- Déploiement sécurisé : publication gated sur Hugging Face + exécution locale via Ollama.
4. Stack technique
- Modèle de base : Qwen2.5-Coder-0.5B-Instruct (variante quantifiée 4-bit)
- Méthode : LoRA / PEFT, librairie Unsloth + TRL
- Frameworks : Transformers, Safetensors
- Déploiement : Hugging Face Hub (model card, gating) + Ollama en local
- Licence : Apache-2.0
5. Lien avec le poste
Ce projet démontre une expérience concrète dans la définition et la mise en œuvre d’architectures IA distribuées, la maîtrise des environnements cloud et on-premises ainsi que le déploiement sécurisé de modèles critiques — des compétences directement transférables à un poste de Data Scientist orienté MLOps et industrialisation.