Artículo

Laboratorio de SMLs: El "Stack" de la victoria

Jesús Manuel Nieto Carracedo etani.es AgentesIA OrquestaciónIA StackIALocal

Hemos llegado al final de este viaje técnico, pero es solo el comienzo de tu propia aventura con la inteligencia artificial. La gran noticia es clara: usar modelos de IA locales, con costes asequibles es posible.

La democratización de la IA ha roto las barreras que antes solo estaban al alcance de las grandes corporaciones. Gracias a la explosión de modelos open source y la accesibilidad del hardware actual, ya no necesitas presupuestos locos, disparados, o simplemente desconocidos, para construir soluciones potentes y privadas.

Hemos descubierto que un camino prometedor lo tenemos en:

  • Hardware modesto, de fondo de trastero, ya sea propio o de segunda mano
  • Herramientas basadas en software libre.

En realidad hay una verdad incómoda, una regla no escrita, donde cuando el humano que pilota a un modelo de lenguaje tiene suficiente conocimiento y experiencia experta en la tarea que pretende realizar, más sencillo debería resultarle acotar las tareas en trozos muy pequeños, para que un modelo suficientemente reducido y por ende más rápido, podrá hacer dos cosas importantes:

  • Completar la tarea correctamente
  • Equivocarse rápidamente, pero empezar antes a iterar un bucle bien definido, para buscar auto-corregirse.

Hemos descubierto que, nos vendieron una IA profesional, trabajando por nosotros sin supervisión, la realidad es que la IA no puede funcionar en piloto automático, si quien pilota manual, no es capaz de comprender la tarea a realizar.

Esto es especialmente importante cuando hablamos de tareas de desarrollo de código, si ya antes de existir estos modelos, podíamos automatizar pruebas de caja negra/blanca, hacer test con scripts vía API, nada nos impide acotar suficientemente las tareas técnicas para que actúen en bucle, hasta que sean capaces de analizar y encontrar soluciones a nuestras pruebas, haciendo uso de la misma tecnología que los humanos, herramientas (MCPs).

Además hemos visto que, es necesario trabajar más allá del prompt sencillo en un web chat. ¿Recuerdas como no hace más de un año, nos vendían que el futuro era ser experto en diseño de prompts? Ese era el empleo del futuro, las empresas se habían vuelto locas buscando este perfil, jamás te faltará el trabajo... (Estoy evidentemente siendo sarcástico) Ahora resulta que los mismos modelos de lenguaje, como es lógico, te estructuran los prompts, ya que ellos saben lo que a ellos les funciona.

Por tanto hemos visto que saber crear un buen proyecto a nivel documental, como ocurría antes de la irrupción de estos modelos, sigue siendo la base previa para ejecutar un proyecto grande. Si alguien quiere enseñarte programación agéntica, desconfía si, para realizar un proyecto grande, no ves como planifica ficheros y tareas, con modelos, y plantillas, asignando roles y comportamientos a agentes, siguiendo diferentes patrones, como pizarras, bases de datos de embeddings, etc.. Es decir, esta nueva tecnología no viene a sustituirnos, más bien a retarnos para que hagamos un uso eficiente. Seguramente el futuro cercano, si es que alguien lo conoce, esté en usar modelos de lenguaje comerciales grandes para planificaciones de grano fino con un gasto del 20% del uso de IA generativa, mientras que el otro 80% se lo lleven modelos locales pequeños, instalados en infraestructura propia. Esta es mi opinión.

Tienes que ser consciente que todos los modelos que podrás usar en local, estará a una distancia abismal, sideral, de los modelos comerciales más potentes en tareas generales. Con el precio actual de los chips de memoria, sobre todo RAM, hay que pensar mucho donde ponemos nuestro dinero. Si para ejecutar un modelo de 120B, necesito tener una tarjeta gráfica descomunal de 3k euros, más el hardware que hace que el sistema funcione (procesador, RAM DDR5, etc...), usar modelos locales para el común de los desarrolladores deja de tener sentido, para corporaciones grandes que juegan en otra liga, es probablemente una buena decisión si esto suple tener que adquirir licencias individuales, pero no es el objetivo de nuestro laboratorio.

Otra de las diferencia entre un modelo grande y otro pequeño, es la cantidad de información con la que han sido entrenados, recuerda bien este mantra, que repito en bucle n veces: los modelos pequeños, al igual que tú también pueden usar herramientas, desde un Qwen3.5-2b ya las pueden usar. ¿Que sentido tiene que el modelo que utilizo para programar, esté entrenado con tratamientos específicos para dolencias de riñón, o cáncer, recetas de cocina, o planes de entrenador personal?

Recuerda que no usan base de datos, luego su conocimiento engrosa el número de capas y parámetros que van a necesitar. Por este motivo modelos como los Gemma 4 aún en sus tamaños e2b y e4b se han mostrado mejores en redacción que el mismísimo ChatGPT 5.5. No son mejores que un modelo comercial en general, pero en tareas muy específicas pueden estar altamente especializados.

Es buena idea tener un modelo pequeño que razone o analice bien, que sea pequeño, y si necesita conocimiento específico, que tenga versiones destiladas para tareas específicas, así como herramientas (MCPs) para poder hacer lo mismo que tu y que yo, buscar en internet, conectarse a sitios en línea, acceder a documentación en repositorios, disco, bases de datos, correo electrónico, o nubes privadas. Parece que tiene más sentido que tener un modelo descomunal. Simplemente piensa en un libro corto de 22 páginas, frente a una colección enciclopédica de 22 tomos. ¿Crees que cada vez que tengas que acceder a la información, lo harás igual de rápido en el primero que en el segundo? Si ya sabes pronto que no dispones de la información, irás a buscarla a una fuente común, internet, el modelo pequeño no hará tanta inferencia entre capas y capas, sino que delegará en una herramienta externa de programación imperativa de toda la vida, la búsqueda de esta información, y se dedicará a otras cosas.

Además, al tener modelos más "curries", más "gregarios", te obliga a tener que pensar, diseñar, corregir, vigilar, etc... Tu flujo de trabajo no se diferencia mucho al modelo que usas en la vida real, luego, es más saludable en este aspecto disponer de este tipo de modelos pequeños porque obtienes mucho más control sobre lo que hacen. El eterno dilema de la IA como caja negra, el gran problema actual de entender el concepto de qué es la IA Explicable.

Si tu PLAN.md, TASK.md contienen microtareas de "grano fino", podrás llevar un control en tu herramienta de gestión de proyectos, del mismo modo que lo hacías hace 2-3 años. La idea tampoco es que tengas que revisar línea a línea, pero podrás controlar mucho más cada decisión tomada en el proyecto. Si delegas en un gran modelo comercial, cuando entrega "el monstruo" a partir de un prompt de 5-10 líneas, será una caja bastante oscura, un pozo complicado de tiempo, poder abrir el capó y revisar cada tubería en busca de la fuga-error.

El "Stack" elegido de bajo coste

Llega el final de este blog, momento de tomar decisiones y conclusiones, creo que te vas a sorprender, porque mi opción ha sido comprar hardware nuevo, bueno, no exactamente nuevo, que tiene lo mejor de todos los mundos y algunos de sus inconvenientes.

Empezaré por detallarte mi stack, y posteriormente defenderé mis decisiones, no espero que estés de acuerdo, sino que abra tu mente y te ayude a elegir el tuyo propio:

  • Hardware:

    • Mini-PC: !(Zotac Magnus EN153060C-BE - Barebone i5-11400H RTX 3060)[https://www.neobyte.es/zotac-magnus-en153060c-be-barebone-i5-11400h-rtx-3060-14784.html?srsltid=AfmBOoqUuWtCfFTQfWe-Wg8z6je-WbrO318ptx1ma1jB-pmNuTrxr3dC] En su web oficial sin memoria RAM, ni almacenamiento persistente, nuevo 1.398,75€ con iva, su precio final. Equipo de segunda mano comprado en Ebay, con 2x8GB DDR4 a 3200mhz en configuración dual Channel, y disco M.2 256 GB, con poco uso, (tuve bastante suerte), ventiladores, radiadores y placas sin rastro de polvo, después de un mes de uso, perfecto, precio 360€ con gastos de envío incluidos.
    • VPS: Empresa OVH, con un coste aproximado de 80,15€ al año, 8GB de RAM DDR4 sospecho pero sin información, 4 vCPU, y 75GB de almacenamiento de disco. Para usarlo como "puente" o gestor de VPN. IP fija.
    • Zigbee: Un hub que usa el protocolo Zigbee, para poder conectar a mi router de casa, para controlar el paso de tensión con un dispositivo ubicado entre enchufe y ordenador, permite controlar remotamente el equipo. Por menos de 20€ en aliexpress, podrás controlar el encendido y apagado, además tendrás un monitor para saber el consumo instantáneo de electricidad. Es un segundo sistema de seguridad redundante, si el equipo se congela o no responde vía VPN-RDP, tendremos un mecanismo de control para reiniciarlo y apagar de forma controlada.
  • Software:

    • Ubuntu 24.06 desktop: Con interfaz gráfica, para poder usarlo como estación de trabajo. Si quieres usarlo solo como servidor, mejor sin entorno gráfico, te dará algo más de potencia disponible. (Como apagar el aire acondicionado, en un coche con pocos cvs..)
    • Llama.cpp: Servidor de modelos, Open Source.
    • Wireguard: VPN para soportar conexiones ssh,rdp, etc... cifradas y desde cualquier punto en internet.
    • DNS: Mi propio dominio !(https://etani.es)[https://etani.es] y subdominios gestionados a través de OVH, por 8,46€/año.
    • Modelos: Descarga los modelos que mejor se ajusten a tu trabajo, los dos modelos más versátiles, las navajas suizas podrían ser Qwen3.5-4b y Gemma4-e2b/Gemma4-e4b. Aunque he de decirte que a fecha de revisión de este documento, los nuevos modelos Bonsai 27b cuantizados a solo 1 y 2 bits, han irrumpido de forma magistral o el ultimísimo Agents-A1-4B un finetunning de Qwen3.5-4b que dicen se acerca bastante a Qwen3.6.
    • Opencode/Qwencode ...

Una vez estudiadas las distintas soluciones, en mi caso particular, que me muevo bastante entre ubicaciones, quería una máquina que pudiese transportar. Además quería una máquina que mimara la gestión de la electricidad, un recurso valioso, junto a control de temperatura, a un precio razonable. Seguramente mi siguiente paso será comprar una Nvidia RTX 3060 de 12GB de VRAM, para mi desktop, con una actualización de RAM a 32 GB DDR4.

Siguiente Entrada