AIO APEX

Thinking Machines lança o Inkling Small, igualando o carro-chefe com um quarto do poder computacional

Thinking Machines Lab
Compartilhar:
Thinking Machines lança o Inkling Small, igualando o carro-chefe com um quarto do poder computacional

A Thinking Machines Lab, startup de IA fundada pela ex-diretora de tecnologia da OpenAI, Mira Murati, lançou o Inkling-Small nesta quarta-feira — um modelo open-source de 276 bilhões de parâmetros que fica a apenas um ponto de seu antecessor, de 975 bilhões de parâmetros, no Artificial Analysis Intelligence Index, usando apenas 12 bilhões de parâmetros ativos por token.

O lançamento vem duas semanas após a estreia do Inkling, o que faz da Thinking Machines um dos laboratórios mais rápidos a entregar uma variante eficiente de um modelo carro-chefe com desempenho quase equivalente. O Inkling-Small usa uma arquitetura Mixture-of-Experts (MoE) — apenas um subconjunto de seus 276 bilhões de parâmetros totais é ativado a cada forward pass, reduzindo o custo computacional e a latência de inferência sem o impacto total de desempenho de um modelo denso genuinamente menor.

O que o Inkling Small é capaz de fazer

O modelo aceita entradas de texto, imagem e áudio e gera saída de texto. Ele suporta uma janela de contexto de até um milhão de tokens — assim como o Inkling — e conta com o mesmo mecanismo de esforço de pensamento variável, que permite aos desenvolvedores trocar velocidade de resposta por profundidade de raciocínio. O Inkling-Small foi treinado em sistemas NVIDIA GB300 NVL72 e obtém pontuações competitivas em relação a outros modelos de pesos abertos no nível de 12 bilhões de parâmetros ativos no Terminal-Bench 2.1 (uso de ferramentas por agentes), HLE (raciocínio) e IFBench (seguimento de instruções).

Os pesos completos estão disponíveis no Hugging Face sob a licença Apache 2.0, que permite uso comercial, modificação e redistribuição sem royalties. A Thinking Machines também adicionou suporte a fine-tuning por meio de sua API Tinker e está oferecendo 50% de desconto na API no lançamento, pela interface Tinker Playground.

Por que as empresas devem prestar atenção

O Inkling original, com 975 bilhões de parâmetros totais (41 bilhões ativos), exige uma infraestrutura robusta de GPUs. O Inkling-Small reduz a contagem de parâmetros ativos para 12 bilhões por token — uma redução de 70% no poder computacional por inferência — preservando boa parte do desempenho do modelo carro-chefe em codificação, raciocínio e multimodalidade. O modelo ainda é grande demais para uma workstation de consumo, mas está ao alcance de empresas que possuem certa capacidade de GPUs sem precisar rodar infraestrutura de hiperescala.

A redução da distância entre 975 bilhões e 276 bilhões de parâmetros, com pontuações em benchmarks que mal se alteram, também sinaliza uma tendência mais ampla de eficiência no desenvolvimento de IA: os laboratórios estão cada vez mais provando que arquiteturas MoE podem entregar capacidade de nível carro-chefe a um custo de inferência significativamente menor. Essa dinâmica pressiona tanto os provedores de APIs fechadas quanto outros laboratórios de pesos abertos. A Thinking Machines foi fundada no início de 2025 por Murati, após sua saída da OpenAI, e atraiu um aporte significativo de capital de risco.

Originally reported by Thinking Machines Lab. Read the original article for additional details.

View original source
Compartilhar: