PrismML encaixa um modelo de IA de 27 bilhões de parâmetros em 3,9 GB — pequeno o suficiente para um iPhone

A PrismML lançou o Bonsai 27B, um modelo baseado no Qwen3.6 27B que representa o que a empresa chama de primeira IA de 27 bilhões de parâmetros a caber confortavelmente em um telefone. A conquista vem por meio de quantização extrema de pesos: em vez de armazenar cada parâmetro como um float de 16 bits, o Bonsai 27B usa pesos binários {−1, +1} — apenas um bit por parâmetro — para comprimir um modelo que, de outra forma, consumiria 54 GB de memória para 3,9 GB, pequeno o suficiente para rodar dentro do orçamento de memória de um iPhone 17 Pro.
Até agora, a categoria de 27B de parâmetros estava firmemente no território de laptops ou servidores. Mesmo a quantização agressiva de 4 bits de um modelo 27B produz cerca de 18 GB — muito grande para qualquer smartphone atual. A abordagem da PrismML leva a compressão muito além sem perda catastrófica de qualidade, baseando-se em técnicas que a empresa demonstrou com lançamentos anteriores de 1 bit e ternários em escalas menores.
Duas variantes, dois casos de uso
O Bonsai 27B é disponibilizado em duas configurações:
- Ternary Bonsai 27B (5,9 GB): Usa pesos ternários {−1, 0, +1} a 1,71 bits efetivos por peso. Esta é a variante orientada à qualidade e tem como alvo laptops do dia a dia, retendo 95% do desempenho de precisão total no conjunto de 15 Benchmarks da PrismML.
- Bonsai 27B de 1 bit (3,9 GB): Usa pesos binários {−1, +1} a 1,125 bits efetivos por peso. Esta variante tem como alvo telefones e cabe no orçamento de memória do iPhone 17 Pro, retendo 90% do desempenho de precisão total.
Ambas as variantes incluem suporte multimodal, com a torre de visão fornecida em um formato compacto de 4 bits. Elas carregam uma janela de contexto completa de 262 mil Tokens, suportam decodificação especulativa para inferência mais rápida e lidam com chamadas de ferramentas em várias etapas e loops agentivos — o tipo de carga de trabalho sustentada onde modelos no dispositivo historicamente tropeçavam.
O panorama dos Benchmarks
A PrismML avaliou ambas as variantes em 15 testes em modo de pensamento. As pontuações de matemática e codificação quase não foram afetadas: o modelo ternário obtém 93,4 em matemática contra 95,3 da linha de base, e o modelo de 1 bit mantém 91,7. Chamadas de ferramentas e tarefas agentivas mostram mais impacto da compressão — o modelo de 1 bit pontua 66,0 contra 80,0 da linha de base — mas a PrismML observa que eles ainda superam as construções convencionais de 4 bits do mesmo modelo base, ocupando 2,5x menos memória.
A empresa enquadra isso em termos de "densidade de inteligência" — desempenho por gigabyte — onde o Bonsai 27B de 1 bit atinge 0,53 por GB, aproximadamente 10x a linha de base de precisão total e 2,7x a melhor alternativa convencional de baixo bit.
Por que isso importa para IA agentiva
A consequência prática é que tarefas que exigem um modelo de raciocínio capaz — análise de documentos, extração estruturada de dados, geração de código em várias etapas — agora podem rodar inteiramente no dispositivo, sem enviar dados para uma API na nuvem. Isso é importante para fluxos de trabalho sensíveis à privacidade, aplicações críticas de latência e qualquer cenário onde a conectividade de rede não é confiável.
O Bonsai 27B está disponível agora sob a licença Apache 2.0, tornando-o gratuito para uso comercial. Conforme relatado pela PrismML, este é um marco no esforço contínuo de tornar a capacidade de modelos grandes disponível sem infraestrutura de nuvem.
Originally reported by PrismML. Read the original article for additional details.
View original source