El CLI Grok Build de xAI sube silenciosamente bases de código completas, incluidos secretos, según un investigador

Un investigador de seguridad independiente ha publicado evidencia reproducible a nivel de paquetes de red de que la herramienta de codificación por línea de comandos Grok Build de xAI sube la base de código completa de un desarrollador a un bucket de Google Cloud Storage en segundo plano, separada de cualquier cosa que el modelo de IA realmente lea o que se le haya pedido procesar. El hallazgo ha generado una atención significativa en Hacker News, con dos hilos relacionados que acumularon más de 400 y 250 puntos respectivamente en cuestión de horas tras su publicación.
Lo que mostró la captura de tráfico
Usando un proxy para interceptar y analizar el tráfico de red, el investigador documentó que Grok Build envía un git bundle completo del directorio de trabajo a un endpoint de almacenamiento en POST /v1/storage, que termina en un bucket llamado grok-code-session-traces. En un repositorio de prueba de aproximadamente 12 gigabytes, la herramienta transfirió 5.10 gigabytes en 73 fragmentos, con las 83 solicitudes de almacenamiento devolviendo una respuesta HTTP 200 exitosa.
De manera crítica, el investigador demostró que la subida no se limita a los archivos que el agente de IA tocó realmente durante una sesión. Un archivo que el agente nunca abrió ni referenció se recuperó intacto del bundle de subida capturado, lo que prueba que la herramienta transfiere todo el estado del workspace, no solo los archivos relevantes para la tarea en cuestión. En el caso de reproducción, un archivo .env sin redactar que contenía credenciales fue incluido en el bundle subido.
La opción de exclusión no cubre esto
Grok Build incluye un interruptor “Improve the model” que los desarrolladores pueden desactivar, pero el análisis del investigador encontró que esta configuración gobierna si los datos subidos se usan para el entrenamiento del modelo; no detiene la subida subyacente de la base de código en primer lugar. Según la investigación, ni la existencia del bucket grok-code-session-traces ni esta distinción entre “no entrenaré con ello” y “no lo subiré” está documentada en ningún lugar de la configuración o materiales de incorporación de Grok Build.
Por qué esto importa para los desarrolladores
Los agentes de codificación de IA operan rutinariamente dentro de repositorios que contienen claves de API, credenciales de bases de datos y código fuente propietario, bajo la suposición de que solo los archivos que el agente lee o referencia explícitamente se comparten con los servidores del proveedor. Este hallazgo rompe esa suposición específicamente para Grok Build: un desarrollador que ejecuta la herramienta dentro de una base de código privada ha tenido, según los pasos de reproducción, toda esa base de código —incluidos secretos nunca tocados por la IA— transmitida a la infraestructura de xAI independientemente de las preferencias de datos de entrenamiento.
Los investigadores de seguridad recomiendan que cualquier desarrollador que haya ejecutado Grok Build dentro de un repositorio que contenga credenciales trate esas credenciales como potencialmente expuestas y las rote como medida de precaución. Hasta la fecha de este informe, xAI no ha emitido una declaración pública que aborde los hallazgos específicos.
Originally reported by cereblab (independent security research). Read the original article for additional details.
View original source