PrismML coloca un modelo de IA de 27 mil millones de parámetros en 3.9 GB — lo suficientemente pequeño para un iPhone

PrismML ha lanzado Bonsai 27B, un modelo basado en Qwen3.6 27B que representa lo que la compañía denomina el primer modelo de IA de 27 mil millones de parámetros que cabe cómodamente en un teléfono. El logro se debe a una cuantización extrema de pesos: en lugar de almacenar cada parámetro como un float de 16 bits, Bonsai 27B utiliza pesos binarios {−1, +1} —solo un bit por parámetro— para comprimir un modelo que de otro modo consumiría 54 GB de memoria hasta 3.9 GB, lo suficientemente pequeño para ejecutarse dentro del presupuesto de memoria de un iPhone 17 Pro.
Hasta ahora, el escalón de 27B parámetros se situaba firmemente en territorio de portátiles o servidores. Incluso una cuantización agresiva de 4 bits de un modelo de 27B da alrededor de 18 GB, demasiado grande para cualquier smartphone actual. El enfoque de PrismML lleva la compresión mucho más lejos sin una pérdida catastrófica de calidad, basándose en técnicas que la compañía demostró con lanzamientos anteriores de 1 bit y ternarios a escalas menores.
Dos variantes, dos casos de uso
Bonsai 27B se distribuye en dos configuraciones:
- Ternary Bonsai 27B (5.9 GB): Utiliza pesos ternarios {−1, 0, +1} con 1.71 bits efectivos por peso. Esta es la variante orientada a la calidad y está dirigida a portátiles de uso diario, reteniendo el 95% del rendimiento de precisión completa en el conjunto de 15 benchmarks de PrismML.
- 1-bit Bonsai 27B (3.9 GB): Utiliza pesos binarios {−1, +1} con 1.125 bits efectivos por peso. Esta variante está dirigida a teléfonos y cabe dentro del presupuesto de memoria del iPhone 17 Pro, reteniendo el 90% del rendimiento de precisión completa.
Ambas variantes incluyen soporte multimodal, con la torre de visión enviada en un formato compacto de 4 bits. Cuentan con una ventana de contexto completa de 262K tokens, soportan decodificación especulativa para una inferencia más rápida y manejan llamadas a herramientas multi-paso y loops agentic — el tipo de cargas de trabajo sostenidas donde los modelos en el dispositivo han tropezado históricamente.
El panorama de benchmarks
PrismML evaluó ambas variantes en 15 pruebas en modo de pensamiento. Las puntuaciones de matemáticas y código apenas se ven afectadas: el modelo ternario obtiene 93.4 en matemáticas frente al 95.3 de la línea base, y el modelo de 1 bit mantiene 91.7. Las tareas de llamada a herramientas y agentic muestran un mayor impacto de compresión — el modelo de 1 bit puntúa 66.0 frente al 80.0 de la línea base — pero PrismML señala que aún superan a las construcciones convencionales de 4 bits del mismo modelo base, ocupando 2.5 veces menos memoria.
La compañía enmarca esto en términos de "intelligence density" — rendimiento por gigabyte — donde Bonsai 27B de 1 bit alcanza 0.53 por GB, aproximadamente 10 veces la línea base de precisión completa y 2.7 veces la mejor alternativa convencional de baja precisión.
Por qué es importante para la IA agentic
La conclusión práctica es que las tareas que requieren un modelo de razonamiento capaz — análisis de documentos, extracción estructurada de datos, generación de código multi-paso — ahora pueden ejecutarse completamente en el dispositivo, sin enviar datos a una API en la nube. Esto es importante para flujos de trabajo sensibles a la privacidad, aplicaciones críticas en latencia y cualquier escenario donde la conectividad de red sea poco fiable.
Bonsai 27B ya está disponible bajo la licencia Apache 2.0, lo que lo hace gratuito para uso comercial. Según informa PrismML, este es un hito en el esfuerzo continuo por hacer accesible la capacidad de modelos grandes sin infraestructura en la nube.
Originally reported by PrismML. Read the original article for additional details.
View original source