Artículo
A menudo, cuando hablamos de Inteligencia Artificial, la narrativa nos lleva automáticamente a imaginar centros de datos colosales y presupuestos millonarios. Existe esa idea persistente de que, para que la IA sea realmente útil, necesitas una super-computadora que ocupe media habitación. Pero hoy quiero romper ese mito: la IA potente ya no es un privilegio exclusivo de las grandes corporaciones.
La clave para democratizar este acceso reside en dos pilares técnicos: los Small Language Models (SLMs) y la cuantización.
En lugar de intentar ejecutar modelos gigantescos que exigen una infraestructura masiva, estamos viendo un auge en modelos compactos pero increíblemente capaces. Aquí es donde entra la cuantización como el "truco" maestro: básicamente, reducimos la precisión de los pesos del modelo (pasando, por ejemplo, de 32 bits a 4 u 8 bits). Esto nos permite recortar drásticamente el tamaño y los requisitos de memoria sin sacrificar una precisión sorprendente para la gran mayoría de las tareas que nos importan en el día a día.
Para que lo entiendas de una manera sencilla, sino te acostumbras a hablar de 0 y 1s, imagina que tenemos un número muy grande, y lo acortamos dividiéndolo por 10, 100, 1000, donde nos quedamos solo con u parte decimal, por ejemplo, piensa en el valor 123456789, si lo recortamos entre 1000, 123456.789, para después convertirlo en su parte entera 123456 (redondeos a parte, es un ejemplo ilustrativo), el peso almacena un valor mucho más compacto. ¿que ocurre? que para gran parte de las tareas del día a día, quedarnos con esta precisión es suficiente.
Como convenio, se ha aceptado, (viene de pruebas realizadas y documentada en diversos bancos de pruebas), que la cuantización Q4_K_M es el mínimo aceptable, a partir de ahí el modelo degrada de forma impredecible. Dependerá de la tarea supongo. Si te sirve, en mi caso, con gemma4-e4b para tareas de redacción documental, (este mismo blog), si he encontrado una apreciable diferencia entre esta cuantización y Q4_K_XL, que me ha funcionado mejor. Puede ser percepción subjetiva, no lo tomes como norma, eso si, si tu tarea es programación, realizar código fuente, se recomiendan modelos con cuantizaciones en 8 bits, y lo vas a comprender muy rápido. Si tu modelo tiene que escribir código fuente, equivocarse al escribir un punto y coma, colocar un punto o una coma, confundirse en una palabra reservada, etc... puede suponer que tu código ya no solo no haga la tarea para la cual lo solicitaste, sino que tenga fallos de compilación, genere excepciones, etc... por tanto Q8 sería, si puedes hacerlo funcionar, tu mejor elección. En mi caso he usado de forma bastante fluida, Qwen3.5-4B-Q8 en mi tarjeta de 6GB de VRAM, el modelo cabe casi en su totalidad (3-4 capas quedan descargadas a RAM), en memoria.
Lo mejor de todo es que esto cambia las reglas del juego para nosotros. No necesitas un servidor de la NASA para empezar a experimentar gracias a estas optimizaciones. Ahora que ya dimensionas qué es esto de la cuantización, te diré que un modelo en 32 bits FP32 representa cada peso usando 32 bits de información, normalmente como un número decimal en coma flotante (número decimal). Al cuantizarlo a Q4, cada peso pasa a representarse aproximadamente con 4 bits, reduciendo muchísimo el tamaño del modelo
La reducción es descomunal, sin perder para la mayor parte de casos de uso, mucha precisión, y, como parece lógico, si el modelo ocupa menos, también necesitarás menos memoria y menos capacidad de cómputo para utilizarlo.
Luego hay otro concepto que debes, si no conocer en profundidad, al menos dimensionar: el concepto de los parámetros de un modelo. Cuando decimos que un modelo tiene 3B parámetros, estamos diciendo que tiene aproximadamente 3 mil millones de valores internos aprendidos durante el entrenamiento. Dicho de forma simple, son números que el modelo utiliza para procesar la información y generar respuestas. Esos valores se representan con los bits que explicamos antes: en FP32 ocuparían 32 bits por parámetro, mientras que en formatos cuantizados como Q4 se aproximan usando unos 4 bits por parámetro.
Puedes ejecutar modelos potentes en hardware bastante modesto, y con solo los dos párrafos anteriores ya deberías de poder dimensionar intuitivamente la envergadura de un modelo, ahora si lees mis hallazgos, ya podrás situarte, sobre qué modelos podrías probar ya en tu local:
Es fundamental entender que estamos ante dos mundos distintos. Si tu objetivo es ofrecer un servicio a cientos o miles de usuarios simultáneos, la infraestructura en la nube (como AWS) sí implicará costes elevados, pudiendo rondar los 2.000€ al año en los grandes servicios cloud (AWS,Azure,Google Cloud...) siendo muy generoso, la verdad es que se acercará más al coste mes, o coste quincena.
Sin embargo, si lo que buscas es experimentar, investigar o automatizar tus propias tareas, o proveer a tu equipo de desarrolladores de servidores locales de IA, la barrera de entrada hoy es mínima. No tiene sentido pagar precios de "Ferrari" cuando puedes tener un "Seat Ibiza amarillo reprogramado calamar edition" totalmente funcional para tus necesidades diarias. En resumen: la IA ya no es un privilegio de pocos. Con los modelos adecuados y el hardware que ya tienes a mano (o uno muy económico), puedes empezar a construir tu propio ecosistema de inteligencia hoy mismo.