Seguro que te ha pasado. Estás tranquilamente en una cena familiar, comentas que trabajas en desarrollo de software y alguien, con una mirada entre condescendiente y apocalíptica, te suelta: «Aprovecha ahora, que con ChatGPT y los agentes autónomos os quedan dos telediarios». Es el mantra del momento. La narrativa pública insiste en que las Inteligencias Artificiales Generativas avanzan tan rápido que escribir código se convertirá en una reliquia del pasado, similar a operar una centralita telefónica manual. Para quienes pasamos el día peleando con punteros, arquitecturas distribuidas y dependencias rotas, esta afirmación no solo resulta molesta, sino que demuestra un profundo desconocimiento de lo que realmente significa programar. El verdadero problema no es que una máquina aprenda a escribir sintaxis; el problema es confundir el acto de teclear líneas de código con el arte de resolver problemas complejos de ingeniería.
(más…)Etiqueta: codigo abierto
-

El milagro de la cuantización extrema: Cómo meter un LLM gigante en la CPU de tu patinete eléctrico (o casi)
Imaginas que mañana decides montar un centro de datos en tu propia casa para correr una Inteligencia Artificial de última generación. Vas a tu tienda de hardware de confianza, miras el precio de un clúster de GPUs de nivel empresarial y, de repente, vender un riñón ya no te parece una mala idea financiera. Hasta hace dos días, si querías ejecutar un modelo de lenguaje (LLM) con cara y ojos de manera local, o tenías una tarjeta gráfica que consumías más energía que una pequeña ciudad del norte de España, o estabas condenado a ver cómo tu ordenador procesaba un token cada tres minutos. La dependencia de las API de pago y de los servidores en la nube parecía el único camino para los mortales. Sin embargo, la comunidad del open source se ha cansado de pedir permiso (y créditos bancarios) a las grandes tecnológicas.
El cuello de botella de la IA generativa local nunca ha sido únicamente la potencia de cálculo bruta, sino algo mucho más mundano: la memoria RAM y el ancho de banda. Cuando descargamos un modelo de lenguaje convencional, nos encontramos con gigabytes y gigabytes de coeficientes numéricos llamados «parámetros». Originalmente, estos pesos se guardan en formatos de alta precisión, como FP16 (punto flotante de 16 bits). Hagan las matemáticas conmigo, queridos desarrolladores: un modelo modesto de 70.000 millones de parámetros (70B) en FP16 requiere algo más de 140 GB de VRAM solo para cargarse en memoria. Eso descarta automáticamente al 99% de los ordenadores del planeta. Durante el proceso de inferencia paralela, la CPU o la GPU tienen que mover continuamente todos esos gigabytes desde la memoria de almacenamiento hasta los registros del procesador. Es el clásico problema informático donde la autopista es demasiado estrecha para tanto tráfico.
(más…)
