Artículo
En este artículo os expongo mis conclusiones trabajando con hardware de bajo rendimiento. Tras experimentar con diversas arquitecturas y configuraciones, he generado una tabla con mis hallazgos, por si a alguien le puede servir para orientarse. A mi me habría venido bien, cuando hace unas semanas empecé a experimentar con toda esta tecnología:
Comparativa de Rendimiento por Escenario
| Escenario | Hardware / Configuración | Modelos Probados | Velocidad de Generación | Sensación de Uso |
|---|---|---|---|---|
| Local con GPU | Desktop i5 7ª Gen + Nvidia 1050 Ti (4GB VRAM) | Modelos pequeños (3B-4B), modelos hasta 7B | Alta: 100 tokens/segundo si el modelo cabe en VRAM | Fluida y rápida; ideal para uso intensivo de modelos pequeños. Colocaría en 6GB de VRAM lo mínimo hasta 4B. |
| Local sin GPU / iGPU | Portátil i7 8ª Gen (32GB RAM) + Intel UHD Graphics | Modelos pequeños (3B-4B), Qwen1.5-0.5B | Usable: 10-20 tokens/segundo, poco contexto. | Aceptable para tareas simples, pero ralentiza en contextos largos o modo agéntico. |
| VPS (OVH) | VPS-1: 8GB RAM, 4 vCPU | Modelos pequeños (3B-4B) | Limitado: 3-5 tokens/s. | Solo modelos de 2B son realmente usables |
Análisis de Hardware: El equilibrio entre coste y eficiencia
A menudo, la tentación es buscar el modelo más grande posible, pero la realidad del hardware nos obliga a ser más prácticos.
Desktop (La opción de rendimiento): Es el punto de partida ideal. Muchos equipos de segunda mano están prácticamente regalados porque su volumen dificulta el transporte, pero ofrecen una base sólida. Por poco más de 100€ puedes montar una torre funcional. El truco está en la GPU: una GTX 1050 Ti (que se encuentra en plataformas de segunda mano por unos 60-70€) ya te permite jugar con modelos pequeños. Si quieres dar un salto de calidad, una Nvidia RTX 3060 de 12 GB de VRAM es ideal para modelos de 12b densos y 26B mezcla de expertos, permitiéndote refrigerar y gestionar cargas pesadas con eficiencia, añadiría 32 GB de RAM para poder hacer offload. Esta configuración será la más básica y funcional, es probable que necesites un presupuesto de entre 300-450€ para adquirir uno. Además, si ya tienes un VPS, puedes usar Wireguard para crear una VPN gratuita y conectar tu torre con el mundo, usándola como un servidor de inferencia remoto vía RDP o SSH, de forma segura, sin tener que abrir puertos en el router. Esta plataforma permite fáciles ampliaciones, pero ojo al consumo eléctrico y a la fuente de alimentación, que tenga la potencia necesaria.
Portátil (Uso puntual): Siendo realistas, ejecutar modelos en arquitecturas Intel sin GPU dedicada es un reto de paciencia. A menos que uses contextos muy cortos, la experiencia suele ser frustrante. Si buscas algo portátil, intenta encontrar una unidad con una Nvidia 3060 (6GB VRAM) y memoria en configuración dual-channel, 2x16GB DDR4 a 3200mhz es lo más sensato con 6GB de VRAM, no vas a notar mucha diferencia con una RAM más potente. Las opciones con APU Ryzen son interesantes, solo si cuentan con DDR5, y en general aunque no tendrán mala velocidad de generación de token, busca alguna prueba real, porque en codificación (lectura de prompts) mata su rendimiento. Un problema que debes tener en cuenta, es que no es ideal adquirir un portátil de segunda mano, y tenerlo 24/7 con su GPU al máximo, irradiando calor. Acabará por reventar el chip gráfico por buena ventilación que tenga, además del ruido que emite. Además, si quieres una tarjeta gráfica potente, cuenta con que a parte de que tu equipo será mucho más pesado, su transformador ocupará casi lo mismo que el propio ordenador, y la batería durará bastante poco.
VPS (La opción de conveniencia): Al principio parece la solución lógica, pensamos que lo ponemos en la nube y listo, ni refrigeración, siempre disponible, ni coste de electricidad. Sin embargo, hay un límite claro. Si solo ejecutas modelos pequeños, muy pequeños (2B), es una forma excelente de tener un modelo de IA privado. Es importante considerar el almacenamiento: los modelos grandes consumen gigabytes rápidamente y los VPS suelen tener límites ajustados. De hecho, no se espera ejecutar nada por encima de 1.5-2B en modelos densos. Además, existe otro factor crítico: normalmente un VPS económico utiliza recursos compartidos; en lugar de CPUs físicas, emplea vCPUs (unidades de procesamiento virtual), lo que significa que estás en un entorno virtualizado. El coste es tan barato, porque varios usuarios comparten un mismo hardware físico, luego puedes obtener resultados variables de rendimiento, dependiendo del uso que hagan tus vecinos "en el instante t de tiempo".
Android (IA en movimiento): Fuera del laboratorio, pero con un potencial enorme. Con aplicaciones como Off Grid AI y una tablet potente (como mi Boox Tab Ultra C Pro), puedes ejecutar modelos como Gemma 4 liteRT de forma totalmente offline a cerca de 10 tokens/segundo, en modo chat. Es un recurso interesante en aquellos pocos lugares donde actualmente no se dispone de conexión a internet (aunque hoy en día resulta difícil encontrarlos). Un parámetro importante es la cantidad de RAM de tu dispositivo, por debajo de 6GB de RAM, aparte del espacio en disco, es difícil ejecutar modelos más allá de los 0.8b, 0.5b y similares. Con un procesador algo más potente tipo snapdragon, ya puedes probar modelos y divertirte, pero debes ser consciente de que la batería sufrirá; es básicamente como jugar a un videojuego exigente de alto rendimiento en tu bolsillo. En esta arquitectura te diría que es casi más determinante la RAM que el procesador. He probado en mi Samsung A16 con 4GB de RAM modelos que mi Xiaomi Mi Mix 2s de 6GB de RAM los ha ejecutado a velocidades parecidas. Si es cierto que hay muchos años entre uno y otro, pero mi Xaomi equipa un snapdragon con una GPU potente en su época para juegos.
Todas las opciones tienen sus casos de uso, sus pros y sus contras, cada uno tenemos que decidir que podemos asumir, que podemos y queremos pagar o usar. Verás que mi opción tras este laboratorio fue adquirir una solución diferente a las anteriores.
Análisis de Modelos Específicos
Te doy algunos detalles sobre los que pude probar:
Qwen2.5-1.5B: Una joya para CPU. Alcanza velocidades excelentes siendo perfecto para respuestas directas y tareas rápidas. Ahora, no esperes un Gpt-5.6-Sol. Es rápido para probar esta tecnología con un hardware muy básico, pero ya es antiguo, actualmente su familia está en la versión 3.6. Existe un modelo Qwen3.5-0.8b y Qwen3.5-3b que diría que han heredado su filosofía de modelos rápidos para entornos móviles y CPU. La familia Qwen3.6 ya no dispone de modelos en esos tamaños. Con tan pocos parámetros entrenables, tampoco podrás usarlos para tareas complicadas, resúmenes, traducciones, generar plantillas, proponer código o texto predictivo, sin ser precisos obviamente.
Gemma4-e2B: Mi recomendación para un equilibrio sólido en chat, documentación y redacción. Es el modelo ideal para CPU/VPS o equipos locales con recursos limitados. No pierdas de vista el nuevo Gemma 4 liteRT, que es una sorpresa técnica por su optimización. Google lanzó esta familia de modelos, muy capaces para su tamaño, y además actualizados.
Modelos de 7B a 8B: Aquí la regla es clara: hoy por hoy, necesitas una GPU dedicada si quieres fluidez. En entornos sin ella, el rendimiento se desploma porque el sistema empieza a intercambiar capas con la memoria RAM o el disco (swap). A menos que uses arquitecturas de mezcla de expertos como Gemma4-e2B/Gemma4-e4B o modelos similares, la experiencia en modelos mayores a 2B sin aceleración de hardware no pasará del "anda si esto habla"...
Los modelos por debajo de los 4B, exceptuando, como siempre, gemma4-e2b, son ciertamente inútiles para el uso de herramientas. Las herramientas son programas que siguen el protocolo MCP y permiten a los modelos conectarse a internet, abrir un navegador o leer ficheros y directorios, entre otras funciones. Las herramientas son en esencia, las librerías y rutinas que hacen tareas cerradas, repetitivas, y predecibles, para los cuales no tiene sentido que gastemos tokens, por ejemplo, leer un fichero, de no existir estas herramientas, el modelo tendría que programar un script (una rutina corta) para poder leer el contenido del fichero, perdiendo un tiempo precioso.
Conclusiones