Artículo

Laboratorio de SMLs: El Ecosistema Libre, recuperando el Control de la IA

La democratización de la Inteligencia Artificial ya no es una promesa lejana; es una realidad que se está forjando en este preciso momento gracias al movimiento Open Source. Durante mucho tiempo, el acceso a modelos de lenguaje avanzados pareció estar bloqueado por las barreras de entrada de las grandes nubes. Configurar una infraestructura en servicios como AWS, por ejemplo, puede disparar los costes anuales hasta superar fácilmente los 2.000€ (como vimos anuales o incluso mensuales), convirtiendo lo que debería ser una herramienta de innovación en un lujo reservado para unos pocos.

Este es el problema que debatimos en todos los foros (charlas, congresos, vídeos, blogs...) a los que acudí, cuando se hablaba del "hype" de la IA. Todos los responsables de prototipar soluciones eficientes en coste, porque no disponemos de presupuestos altamente inflamados, veíamos como se aumentaba la brecha entre aquellos que podían jugar más allá de la en ocasiones, miserables, capas gratuitas, en otras in-existentes. A esto hay que sumar que ha evolucionado tan rápido esta tecnología, y se ha llenado internet en particular y los centros de formación en general, de cursos basura, donde se vende la palabra IA, pero realmente fuera de la demo WoW comercial, no encuentras ejemplos, o plataformas de pruebas.

Sin embargo, el ecosistema abierto está cambiando, se dice que empresas como Openai, con el paso de los meses (¡aún no podemos hablar de años!) fue presionada por la comunidad para a liberar soluciones open source, como su modelo GPT-oss-120B, aunque otras fuentes indican que este exitoso modelo formó (forma) parte de su estrategia comercial, mención como no especial a los modelos chinos Deepseek, Qwen de Alibaba, o los maravillosos Gemma de Google, sobre todo su versión 4.. La verdadera revolución reside en la capacidad de ejecutar modelos potentes en hardware accesible, ya sea en tu propia máquina o en servidores privados (VPS) con costes mensuales mínimos.

gpt-oss-120b es un potente modelo de inteligencia artificial de pesos abiertos publicado por OpenAI. Cuenta con 117.000 millones de parámetros (128 expertos, 4 activos por token) y destaca por su razonamiento avanzado, su ventana de contexto de 128k y su gran capacidad para tareas agénticas y programación. (openai)

Pero, espera, te preguntarás cómo es posible que modelos tan complejos quepan en equipos tan "de andar por casa". El secreto técnico detrás de esto es la cuantización. Piénsalo como el "truco" maestro del sector: un proceso que reduce drásticamente el tamaño y los requisitos de memoria de un modelo sin sacrificar una calidad aceptable. Al reducir la precisión de los pesos (pasando, por ejemplo, de 32 bits a 4 u 8 bits), logramos que modelos que antes exigían estaciones de trabajo masivas ahora funcionen en equipos domésticos o servidores sencillos. En un lenguaje mucho más sencillo, para mantener el carácter introductorio del artículo, imagina que tienes un número muy largo y lo acortas. Mantiene gran parte de su información, y quizá nunca llegues a usar la información recortada, o quizá en algunas consultas la uses demasiado, para determinados usos del modelo, como ocurre con el caso concreto de la programación, donde para el modelo, a la hora de decidir que token es el siguiente, entre un punto, una coma o un espacio, escoge mal, genera un error de sintaxis. En sucesivos artículos ampliaremos este concepto y te daré mis humildes recomendaciones en base a las pruebas que realicé.

Además, y por suerte para nosotros, en este momento la tendencia no consiste simplemente en construir modelos cada vez más grandes, sino también en hacerlos más inteligentes, eficientes y, en algunos casos, más compactos, es decir, más pequeños o menos pesados en GB. Para conseguirlo, disponemos de dos estrategias complementarias: la destilación y el auge de los modelos MoE (Mixture of Experts).

  • Destilación: permite entrenar modelos más pequeños para que aprendan a comportarse de forma parecida a modelos mucho más grandes. Dicho de forma sencilla, un modelo grande puede actuar como “maestro” y ayudar a entrenar a un modelo más pequeño, más ligero y más manejable.

    • Por ejemplo, si quiero usar un modelo principalmente para programar, quizá no necesito que tenga la misma amplitud de conocimientos que un modelo generalista capaz de hablar de cocina, literatura, deporte, derecho o medicina. En ese caso, tiene sentido entrenar o ajustar un modelo más pequeño y especializado en código fuente. El objetivo no es que “sepa de todo”, sino que resuelva muy bien una tarea concreta usando menos recursos. Y es aquí donde cobran mucho sentido los modelos de IA en local. Es mejor tener en nuestro disco duro 4-5 modelos y usarlos para que colaboren en tareas específicas, que uno grande, pesado, lento generalista que haga lo de todos los demás, porque requerirá un hardware empresarial muy potente, no una tarjeta gráfica barata (en términos de arquitectura de servidor)
  • MoE (Mixture of Experts): este enfoque funciona de otra manera. En lugar de activar todo el modelo para cada consulta, activa solo algunas partes internas, llamadas “expertos”, según el tipo de tarea que se quiere resolver. No todos los expertos participan siempre; el sistema selecciona cuáles tienen más sentido para cada caso.

    • Por poner un ejemplo de la vida real, imagina el servicio de urgencias de un hospital. Cuando entra un paciente, no acude todo el personal médico en masa a atenderlo. Primero se hace una valoración inicial, después se clasifica el caso y, según el problema, intervienen los profesionales adecuados: traumatología, cardiología, pediatría, neurología, enfermería, etc. Si cada vez que alguien cruzara la puerta del hospital acudiera todo el personal a la vez, habría un enorme desperdicio de recursos y una gran dificultad de coordinación. Al final, quizá se llegaría a una solución, pero sería una forma muy poco eficiente de trabajar. No tendría sentido que un pediatra atendiera de entrada a una persona mayor con un problema cardíaco, ni que un cardiólogo fuera el responsable principal de una contusión en el brazo de un ciclista accidentado. Un modelo MoE funciona, a grandes rasgos, de forma parecida: ante una consulta, no pone en marcha todo el modelo completo, sino solo una parte de sus expertos internos. Así puede manejar tareas complejas de forma más eficiente que si tuviera que activar toda su capacidad en cada respuesta.

Estos ejemplos son una simplificación para acercar conceptos complejos de los modelos de lenguaje a situaciones más fáciles de imaginar. No explican todos los detalles técnicos, pero ayudan a entender la idea general: "no siempre gana quien usa más fuerza bruta; muchas veces gana quien organiza mejor sus recursos."

A menudo nos han vendido la idea de que necesitamos pagar suscripciones elevadas por el último modelo de razonamiento gigante disponible. Pero después de leer las líneas anteriores, espero que comiences a comprender, que el movimiento del mundo open source es precisamente hacia el lado contrario. Para la gran mayoría de las aplicaciones prácticas, los SLMs (Small Language Models) son la verdadera clave de la eficiencia actual. Estos modelos pequeños están diseñados para ser rápidos y funcionales: ofrecen velocidades de respuesta usables incluso en CPU y son ideales para automatizaciones recurrentes con plataformas como Make ó n8n.

En definitiva, el ecosistema Open Source nos devuelve algo fundamental: el control. Nos permite elegir, ajustar y ejecutar nuestra propia IA, respetando nuestro presupuesto y adaptándonos a nuestras necesidades reales, sin depender de infraestructuras industriales que no necesitamos, o de decisiones que toman personas (o máquinas ya) en una oficina en la otra punta del mundo, como cambiar una interfaz, recortar el número de tokens, o eliminar el modelo que realmente nos funcionaba para una tarea concreta, sin previo aviso.

Entrada Anterior Siguiente Entrada