AIO APEX

Según informes, Google construye un chip con la arquitectura de Gemini grabada en silicio

The Decoder
Compartir:
Según informes, Google construye un chip con la arquitectura de Gemini grabada en silicio

Google está desarrollando un chip para servidor, denominado internamente "Frozen v2", que incorpora la arquitectura de sus modelos de IA Gemini directamente en silicio en lugar de recurrir al procesamiento tensorial de propósito general, según un informe de The Information que cita a dos personas con conocimiento directo del proyecto. El diseño, según las fuentes, se remonta a una idea de Jeff Dean, científico jefe de Google DeepMind, y podría ofrecer de 6 a 10 veces más tokens de IA por vatio que las TPU actuales de Google.

Google no ha confirmado públicamente la existencia de Frozen v2, aunque la empresa ha reconocido de manera general que investiga hardware. El informe es significativo independientemente de la confirmación oficial porque refleja un cambio estructural en cómo los mayores laboratorios de IA abordan los costos de inferencia: en lugar de construir hardware cada vez más general y esperar que el software se ponga al día, Google, según se informa, está dispuesto a cablear la arquitectura de un modelo específico en un chip que solo puede ejecutar las versiones futuras de esa arquitectura.

Qué significa realmente "arquitectura grabada en silicio"

Una TPU o GPU estándar es un acelerador de propósito general: puede ejecutar cualquier arquitectura de modelo que un desarrollador le suministre, a costa de dedicar cómputo a pasos que un pipeline fijo podría manejar de manera más eficiente. Según se informa, Frozen v2 toma un camino intermedio entre esa flexibilidad y un chip de función totalmente fija. En lugar de congelar los pesos entrenados del modelo — un concepto anterior que Google aparentemente abandonó porque los pesos se vuelven obsoletos demasiado rápido como para justificar silicio personalizado — Frozen v2 incrusta el plano arquitectónico de Gemini: la secuencia de operaciones, las decisiones de enrutamiento y las opciones estructurales que definen cómo el modelo procesa una consulta, independientemente de los valores paramétricos específicos.

Todavía se pueden cargar nuevos pesos en el chip a medida que Gemini se reentrena y actualiza. Lo que queda fijo en los transistores es la forma del cómputo en sí, lo que reduce la cantidad de pasos que el chip debe realizar y la cantidad de datos que debe mover por consulta, los dos factores que dominan el costo energético de la inferencia a escala.

La contrapartida: eficiencia por flexibilidad

El costo de esa ganancia en eficiencia es un bloqueo arquitectónico. Dado que la estructura de Gemini está físicamente integrada en el chip, Frozen v2 solo puede admitir versiones futuras de Gemini mientras Google conserve la arquitectura fundacional del modelo. Si los equipos de investigación de Google realizan un cambio fundamental en la forma en que está estructurado Gemini — el tipo de cambio que ocurre periódicamente entre generaciones de modelos — el chip deja de ser útil para cualquier propósito más allá de su cometido original.

Esa es casi con certeza la razón por la que los informes describen a Frozen v2 como un chip de uso interno y no como un producto comercial futuro al estilo de la línea TPU de Google, que Google alquila a través de Cloud y licencia de forma más amplia. Un chip bloqueado a la arquitectura de modelo propietaria de una empresa no tiene mercado fuera de esa empresa.

Cronología y contexto estratégico

Según se informa, Google planea comenzar el despliegue en 2028, con volúmenes de producción menores que los de su programa TPU principal — lo que es coherente con que Frozen v2 funcione como una prueba de concepto de silicio especializado y específico para una arquitectura, más que como una apuesta de infraestructura general. El proyecto encaja en un patrón más amplio de 2026: los laboratorios de IA y los proveedores de nube tratan cada vez más el costo de inferencia, y no el de entrenamiento, como la restricción limitante de cuán ampliamente pueden desplegar sus modelos, y el silicio personalizado es una de las pocas palancas que quedan una vez que las mejoras en la eficiencia del modelo provenientes solo del software empiezan a estancarse.

Si las cifras de eficiencia de 6 a 10 veces se mantienen en producción, Frozen v2 reduciría significativamente el costo computacional por consulta de Google específicamente para Gemini — una respuesta directa a las limitaciones de capacidad de cómputo que han moldeado la hoja de ruta de IA y los precios de Google durante todo 2026. Según informó The Information y corroboraron múltiples medios tecnológicos, el proyecto subraya que la especialización arquitectónica, y no solo la escala bruta de cómputo, se está convirtiendo en un eje competitivo entre los laboratorios de IA de frontera.

Originally reported by The Decoder. Read the original article for additional details.

View original source
Compartir: