Imagínate que para responder a la pregunta de un usuario que quiere saber cómo hacer una tortilla de patatas, tuvieras que movilizar a todo el equipo de ingenieros de la NASA, activar tres aceleradores de partículas y consultar la biblioteca del Congreso de los Estados Unidos. Suena ridículo, ¿verdad? Pues eso es, a escala computacional, lo que hacemos cada vez que le preguntamos a un Gran Modelo de Lenguaje (LLM) moderno si prefiere usar un bucle for o un foreach en PHP.
Hasta ahora, la arquitectura estándar de los Transformers obligaba a que cada maldito token pasara por todas y cada una de las capas de la red neuronal, consumiendo recursos como si no hubiera un mañana. Pero las reglas del juego acaban de cambiar radicalmente gracias a un grupo de investigadores universitarios y su última genialidad: la Inferencia Selectiva por Capas (SLI, por sus siglas en inglés). Un avance de software puro que promete reducir el consumo energético y de cómputo de los LLMs en hasta un 70% sin destruir sus capacidades cognitivas.
(más…)