PrismML intègre un modèle d'IA de 27 milliards de paramètres dans 3,9 Go — assez petit pour un iPhone

PrismML a publié Bonsai 27B, un modèle basé sur Qwen3.6 27B qui représente selon l'entreprise le premier modèle d'IA de 27 milliards de paramètres à tenir confortablement sur un téléphone. Cette prouesse est obtenue grâce à une quantification extrême des poids : au lieu de stocker chaque paramètre sous forme de flottant 16 bits, Bonsai 27B utilise des poids binaires {−1, +1} — un seul bit par paramètre — pour compresser un modèle qui nécessiterait autrement 54 Go de mémoire à seulement 3,9 Go, assez petit pour fonctionner dans les limites de mémoire d'un iPhone 17 Pro.
Jusqu'à présent, la catégorie des modèles à 27 milliards de paramètres était solidement ancrée dans le territoire des ordinateurs portables ou serveurs. Même une quantification agressive sur 4 bits d'un modèle 27B donne environ 18 Go — trop volumineux pour n'importe quel smartphone actuel. L'approche de PrismML pousse la compression bien plus loin sans perte catastrophique de qualité, en s'appuyant sur des techniques que l'entreprise avait déjà démontrées avec des versions antérieures à 1 bit et ternaires à plus petite échelle.
Deux variantes, deux cas d'usage
Bonsai 27B est disponible en deux configurations :
- Bonsai 27B ternaire (5,9 Go) : Utilise des poids ternaires {−1, 0, +1} à 1,71 bits effectifs par poids. C'est la variante orientée qualité, destinée aux ordinateurs portables classiques, conservant 95 % des performances en pleine précision sur la suite de 15 Benchmark de PrismML.
- Bonsai 27B 1-bit (3,9 Go) : Utilise des poids binaires {−1, +1} à 1,125 bits effectifs par poids. Cette variante cible les téléphones et tient dans les limites de mémoire de l'iPhone 17 Pro, conservant 90 % des performances en pleine précision.
Les deux variantes incluent un support multimodal, avec le module vision livré dans un format compact 4 bits. Elles offrent une fenêtre de contexte complète de 262K Token, prennent en charge le décodage spéculatif pour une inférence plus rapide, et gèrent les appels d'outils multi-étapes ainsi que les boucles agentiques — le type de charges de travail soutenues sur lesquelles les modèles embarqués ont historiquement trébuché.
Le tableau des Benchmark
PrismML a testé les deux variantes sur 15 tests en mode réflexion. Les scores en mathématiques et en codage sont quasiment inchangés : le modèle ternaire obtient 93,4 en maths contre 95,3 pour la référence, et le modèle 1-bit tient 91,7. Les tâches d'appel d'outils et agentiques montrent un impact plus marqué de la compression — le modèle 1-bit obtient 66,0 contre 80,0 pour la référence — mais PrismML note qu'ils surpassent toujours les constructions conventionnelles 4 bits du même modèle de base tout en occupant 2,5 fois moins de mémoire.
L'entreprise présente cela en termes de « densité d'intelligence » — performance par gigaoctet — où le Bonsai 27B 1-bit atteint 0,53 par Go, soit environ 10 fois la référence en pleine précision et 2,7 fois la meilleure alternative conventionnelle à faible nombre de bits.
Pourquoi c'est important pour l'IA Agent
La conséquence pratique est que les tâches nécessitant un modèle de raisonnement capable — analyse de documents, extraction structurée de données, génération de code multi-étapes — peuvent désormais être exécutées entièrement sur l'appareil, sans envoyer de données à une API cloud. Cela compte pour les workflows sensibles à la vie privée, les applications critiques en latence, et tout scénario où la connectivité réseau est peu fiable.
Bonsai 27B est disponible dès maintenant sous licence Apache 2.0, ce qui le rend gratuit pour un usage commercial. Selon PrismML, il s'agit d'une étape importante dans la volonté continue de rendre les capacités des grands modèles accessibles sans infrastructure cloud.
Originally reported by PrismML. Read the original article for additional details.
View original source