Les petits modèles remportent la course à l'IA en périphérie pour les entreprises

La majeure partie du trafic d'IA des entreprises en 2026 ne frappe plus les modèles frontier de classe GPT-5 ou Claude. Elle frappe des modèles de 1 à 13 milliards de paramètres, s'exécutant sur un rack de serveurs dans le centre de données de l'entreprise ou directement sur un appareil au sol d'usine. Gartner prévoit que les petits modèles spécifiques aux tâches surpasseront en nombre les modèles frontier généralistes dans un rapport de 3:1 dans les déploiements d'entreprise d'ici 2027, et l'inférence IA sur site est déjà passée de 12% des charges de travail en 2023 à 55% en 2025 — un changement de 4,6x en deux ans. La raison n'est pas que les petits modèles ont eu de la chance. C'est que 80% des tâches de NLP en entreprise — classification, extraction, routage, résumé structuré — n'ont jamais eu besoin d'un modèle de 500 milliards de paramètres en premier lieu, et qu'il existe maintenant de petits modèles assez bons pour le prouver.
Les modèles réellement déployés
Quatre familles dominent les déploiements réels en entreprise en 2026, et chacune a un créneau distinct :
- Microsoft Phi-4-mini et Phi-4-Reasoning (3.8B–14B) — le choix par défaut pour les charges de travail lourdes en mathématiques et en code. Phi-4-mini obtient 67,3% sur MMLU (5-shot), 88,6% sur GSM8K, et 64,0% sur MATH — devant Llama 3.2 3B avec 63,4% MMLU / 77,7% GSM8K, le modèle que la plupart des équipes utilisent encore comme référence. Phi-4-Reasoning, à 14B paramètres, a montré qu'il surpassait des modèles cinquante fois plus grands sur des problèmes de mathématiques de niveau olympiade.
- Google Gemma 4 E4B (4,5B paramètres effectifs) — le choix pour le travail en périphérie multimodal. Il atteint 69,4% sur MMLU-Pro et prend en charge l'entrée d'image, c'est pourquoi les fabricants l'exécutent sur des cartes NVIDIA Jetson Orin pour l'inspection visuelle en temps réel sur les lignes de production.
- Alibaba Qwen3-4B et Qwen3.5-9B — les raisonneurs généralistes les plus puissants dans cette classe de taille. Qwen3-4B rivalise avec Qwen2.5-72B, un modèle dix-huit fois plus grand, sur plusieurs benchmarks. Qwen3.5-9B obtient 82,5% sur MMLU-Pro et 81,7% sur GPQA Diamond, et est le choix standard pour les déploiements dans le commerce de détail et sur le marché chinois traditionnel où la connectivité en périphérie n'est pas fiable.
- Variantes Meta Llama 3.2/3.3 (3B–11B) — toujours le choix par défaut lorsque la maturité de l'écosystème et le support des outils importent plus que d'extraire les derniers points de benchmark, surtout avec une couche RAG ajoutée.
L'économie : 5–20x, pas une erreur d'arrondi
L'écart de coût entre l'exécution d'un petit modèle sur votre propre infrastructure et l'appel à une API de modèle frontier n'est pas marginal. Les données de coût de l'industrie pour 2026 placent un endpoint SLM privé gérant 10 000 requêtes par jour à 500–2 000 $ par mois en coût d'infrastructure. Le volume équivalent contre une API de modèle frontier coûte 5 000–50 000 $ par mois. C'est un écart de 5x à 20x, et il se cumule : plus une charge de travail d'entreprise monte en échelle, plus l'économie de l'API frontier se dégrade, tandis que le coût matériel fixe du SLM reste à peu près stable.
La quantification est ce qui fait fonctionner le côté sur appareil de ce calcul. Un modèle de 3,8B paramètres nécessite environ 7,6 Go de mémoire en FP16 — trop pour la plupart des appareils périphériques pour le transporter avec tout le reste qui s'exécute dessus. En quantification 4 bits, le même modèle tient dans moins de 2 Go avec une perte de qualité minimale. C'est la différence entre « a besoin d'un serveur GPU » et « s'exécute sur une carte Jetson boulonnée à une ligne de production ».
Pourquoi la conformité en matière de confidentialité est le vrai moteur, pas seulement le coût
Le coût fait la une des journaux, mais la conformité est ce qui fait vraiment bouger les budgets des entreprises. 44% des entreprises citent la confidentialité des données comme leur principal obstacle à l'adoption des LLM — pas la performance, pas le coût, la confidentialité. Lorsqu'une équipe de conformité décrète que les données ne peuvent pas toucher une API tierce, un petit modèle fonctionnant entièrement sur site cesse d'être un « nice-to-have » et devient la seule architecture qui passe la revue juridique.
La santé en est l'exemple le plus clair. Un déploiement de radiologie combinant Llama 3.2 11B avec une couche RAG a réduit les taux d'hallucination de 8% à 0% lors des tests rapportés, tout en gardant chaque dossier patient dans l'infrastructure de l'hôpital — une exigence stricte selon HIPAA et GDPR qu'une API de modèle frontier hébergée ne peut satisfaire quels que soient ses résultats. Les réductions de charge de travail administratif signalées dans les déploiements de santé utilisant ce modèle tournent autour de 60%. Dans les services financiers, les modèles de sécurité open source fine-tunés de Capital One auraient amélioré les taux de détection d'attaques de plus de 50%, là encore sans envoyer de données de transaction à une API externe.
Là où les petits modèles perdent encore
Tout cela ne signifie pas que les modèles frontier sont obsolètes pour un usage professionnel — cela signifie que la répartition des charges de travail est devenue beaucoup plus spécifique. Les petits modèles restent à la traîne sur :
- Raisonnement multi-étapes et mathématiques de type preuve — l'écart est le plus large sur les problèmes GSM8K et MATH de haute difficulté et sur la génération de code complexe multi-fichiers, où les modèles plus petits manquent de « capacité » de travail en milieu de chaîne de pensée.
- Généralisation en contexte long et multilingue — les SLM se dégradent plus vite que les modèles frontier à mesure que le contexte s'allonge, et les recherches actuelles signalent encore le raisonnement multilingue comme un point faible même pour les modèles sub-10B les plus forts.
- Tâches ouvertes et faiblement spécifiées — tout ce qui se rapproche plus de « écris-moi quelque chose de bien » que de « extrais ces cinq champs » favorise encore un modèle plus large avec une connaissance du monde plus étendue.
Le modèle pratique sur lequel les entreprises ont convergé n'est pas « remplacer le modèle frontier » — c'est le routage : un petit modèle gère la partie étroite, à volume élevé et sensible à la confidentialité de la charge de travail, et un modèle frontier (souvent via API, parfois le plus gros modèle du même fournisseur) est appelé sélectivement pour la queue la plus difficile des requêtes qui en ont réellement besoin.
Comment décider réellement : une véritable checklist d'évaluation
Avant de par défaut à une API de modèle frontier pour une nouvelle fonctionnalité d'IA d'entreprise, une équipe d'ingénierie doit faire passer la charge de travail à travers quatre questions :
- La tâche est-elle étroite et répétable ? La classification, l'extraction, le routage, le résumé structuré et la génération basée sur des modèles sont exactement là où les modèles 3B–9B comblent la majeure partie de l'écart avec les modèles frontier. Les tâches créatives ou stratégiques ouvertes ne le sont pas.
- La conformité exclut-elle le transfert de données à un tiers ? Si oui, cela seul peut décider de l'architecture indépendamment de l'écart de benchmark — un modèle sur site à 90% d'efficacité bat un modèle hors site à 100% que le service juridique n'approuvera pas.
- Quel est le volume réel de requêtes ? En dessous de quelques centaines de requêtes par jour, les coûts de l'API frontier peuvent être négligeables et ne pas valoir la surcharge d'ingénierie de l'auto-hébergement. Au-dessus de quelques milliers par jour, l'écart de coût de 5–20x devient un poste budgétaire, pas une erreur d'arrondi.
- Une couche RAG peut-elle combler le fossé des connaissances ? Le cas de radiologie avec Llama 3.2 11B montre que l'association d'un petit modèle avec la récupération peut combler la majeure partie de l'écart de précision que le nombre brut de paramètres laisserait autrement ouvert — souvent à moindre coût que de passer à un modèle de base plus grand.
Points à retenir
Lancez un pilote de deux semaines comparant un modèle 4B–9B (Phi-4-mini, Gemma 4 E4B ou Qwen3-4B, selon que la charge de travail nécessite des compétences en mathématiques/code, une entrée multimodale ou un raisonnement général) contre le modèle frontier actuellement en production, sur la tâche de production exacte — pas sur un benchmark générique. Mesurez la précision sur vos propres exemples étiquetés, pas sur MMLU. Quantifiez la différence de coût par requête à votre volume réel. Et traitez toute charge de travail pour laquelle la conformité a signalé un transfert de données à un tiers comme un candidat par défaut au petit modèle, indépendamment des chiffres de benchmark, car cette contrainte ne disparaîtra pas et l'écart entre les modèles continue de se réduire.