Thinking Machines publie Inkling Small, au niveau de son modèle phare avec un quart de la puissance de calcul

Thinking Machines Lab, la startup d'IA fondée par l'ancienne directrice technique d'OpenAI Mira Murati, a publié Inkling-Small mercredi — un modèle open-source de 276 milliards de paramètres qui se place à un point de son prédécesseur de 975 milliards de paramètres sur l'Artificial Analysis Intelligence Index, tout en ne faisant appel qu'à 12 milliards de paramètres actifs par token.
Cette publication intervient deux semaines seulement après les débuts d'Inkling, ce qui fait de Thinking Machines l'un des laboratoires les plus rapides à proposer une variante efficace d'un modèle phare avec des performances quasi identiques. Inkling-Small repose sur une architecture Mixture-of-Experts (MoE) — seule une partie de ses 276 milliards de paramètres au total s'active à chaque passage avant, ce qui réduit le coût de calcul et la latence d'inférence sans subir pleinement la pénalité de performance d'un modèle dense réellement plus petit.
Ce que sait faire Inkling Small
Le modèle accepte des entrées texte, image et audio et génère des sorties textuelles. Il prend en charge une fenêtre de contexte allant jusqu'à un million de tokens — comme Inkling — et intègre le même mécanisme d'effort de réflexion variable qui permet aux développeurs d'arbitrer entre vitesse de réponse et profondeur de raisonnement. Inkling-Small a été entraîné sur des systèmes NVIDIA GB300 NVL72 et obtient des scores compétitifs face aux autres modèles open-weight au niveau de 12 milliards de paramètres actifs sur Terminal-Bench 2.1 (utilisation d'outils agentique), HLE (raisonnement) et IFBench (suivi d'instructions).
Les poids complets sont disponibles sur Hugging Face sous licence Apache 2.0, qui autorise l'utilisation commerciale, la modification et la redistribution sans redevances. Thinking Machines a également ajouté la prise en charge du fine-tuning via son API Tinker et propose une remise de 50 % sur l'API au lancement, via l'interface Tinker Playground.
Pourquoi les entreprises doivent y prêter attention
L'Inkling original, avec ses 975 milliards de paramètres au total (41 milliards actifs), exige une infrastructure GPU conséquente. Inkling-Small ramène le nombre de paramètres actifs à 12 milliards par token — soit une réduction de 70 % du calcul par inférence — tout en préservant une grande partie des performances de codage, de raisonnement et multimodales du modèle phare. Le modèle reste trop volumineux pour une station de travail grand public, mais il devient tout à fait accessible aux entreprises qui disposent d'une certaine capacité GPU sans avoir à déployer une infrastructure hyperscale.
La réduction de l'écart entre 975 milliards et 276 milliards de paramètres, avec des scores de benchmark qui bougent à peine, témoigne également d'une tendance plus large vers l'efficacité dans le développement de l'IA : les laboratoires prouvent de plus en plus que les architectures MoE peuvent offrir des capacités de niveau flagship à un coût de service nettement inférieur. Cette dynamique met la pression tant sur les fournisseurs d'API fermés que sur les autres laboratoires open-weight. Thinking Machines a été fondée début 2025 par Murati après son départ d'OpenAI et a attiré d'importants financements en capital-risque.
Originally reported by Thinking Machines Lab. Read the original article for additional details.
View original source