
Decodificación Especulativa: Cómo los Modelos de IA se Vuelven Más Rápidos Sin Hacerse Más Grandes
La decodificación especulativa permite que los grandes modelos de lenguaje funcionen 2–3 veces más rápido al usar un pequeño draft model para proponer tokens y un modelo grande para verificarlos en paralelo — sin entrenamiento adicional, sin pérdida de calidad.










