Ejecutar modelos de imagen en tu propio hardware en 2026: qué está usando realmente la comunidad local

Pregunta en r/StableDiffusion qué ejecutar localmente este mes y obtendrás una respuesta más larga de lo que esperas. El subreddit siempre ha sido la primera línea de la generación local, pero las últimas semanas muestran una comunidad con un ánimo inusualmente generoso: nuevas herramientas, cursos universitarios completos, runtimes portados y una nueva ola de modelos abiertos que caben en el hardware que la mayoría de la gente ya tiene.
Esto es lo que revelan los hilos reales.
El stack de modelos se ha diversificado
Z-Image Turbo no deja de aparecer como punto de entrada. Un recién llegado con una RTX 5070 Ti y 16 GB de VRAM preguntó esta semana a qué dar el salto desde él, lo que indica que se ha convertido en el modelo de partida asumido para una configuración local nueva. Rápido, ligero e indulgente con la memoria, es el modelo que la gente instala primero mientras averigua qué quiere en realidad.
Qwen Image 2.1 es el nuevo peso pesado que aún cabe en máquinas de consumo. Los ports de la comunidad aparecieron casi de inmediato: una build GGUF en TensorSharp con edición y soporte para LoRA, un runtime nativo para Apple Silicon que produce una imagen de 512x512 en una M1 Max en unos 24 segundos, y una interfaz Gradio al estilo Fooocus con máscaras, outpainting y referencias de pose. Una comparación lado a lado de 192 imágenes contra Krea 2, ordenada por categoría, dio a la gente algo concreto de lo que discutir. Para renderizado de texto y edición, está atrayendo a muchos usuarios lejos de checkpoints más antiguos.
Krea 2, Flux 2 Klein y LTX-2.5 completan la alineación. Una publicación de lanzamiento de EasyAI los enumeraba todos como opciones de primera clase en una GUI de escritorio para principiantes, lo que es un buen índice de lo que la gente carga en realidad.
La brecha de herramientas se está cerrando
La brecha de herramientas ha sido la queja persistente sobre la generación local, y en concreto sobre el grafo de nodos de ComfyUI. Dos proyectos la atacaron desde ángulos distintos este mes. EasyAI es una aplicación de escritorio PySide6 que se sitúa delante de ComfyUI y reduce la experiencia a una caja de prompt y un botón, dirigida a quienes chocan con los nodos personalizados. El estudio Qwen al estilo Fooocus adopta el enfoque opuesto: mantener la complejidad, pero exponerla como un estudio de una sola página con valores predeterminados sensatos. Entre ambos, cubren la división de audiencia que siempre ha definido a esta comunidad: la gente que quiere el grafo oculto y la gente que quiere que esté organizado.
Incluso hay una curiosidad de nicho que vale la pena mencionar. Un ingeniero logró ejecutar generación de imágenes en un microcontrolador RP2350, que genera imágenes del tamaño de un sello postal en un chip de dos dólares. Nadie se está cambiando a eso para trabajo de producción, pero dice algo sobre lo mucho que se han comprimido estos modelos que una comunidad celebre un port para microcontrolador como antes celebraba nuevos checkpoints.
Los recursos de aprendizaje se tomaron en serio
Un curso universitario gratuito de catorce lecciones sobre IA generativa publicó su segunda lección este mes: construir un flujo de trabajo de ComfyUI desde cero con Z-Image Turbo, cubriendo la gestión de dependencias, los archivos de modelo y el seguimiento de cada etapa de un flujo de trabajo empaquetado. AI Horde, el servicio de inferencia gratuito basado en crowdsourcing que funciona desde 2022, lanzó una nueva interfaz, un nuevo backend y documentación, lo que importa discretamente para cualquiera sin GPU que aún quiera probar cosas.
Cómo se ven las cuentas de hardware
Los hilos de hardware de Reddit dan un piso del mundo real. La pregunta de entrada citada a menudo esta semana vino de alguien con una RTX 5070 Ti y 16 GB de VRAM que preguntaba qué ejecutar más allá de Z-Image Turbo, y las respuestas mapearon el espacio sin drama: casi todo el catálogo abierto actual cabe en 16 GB si aceptas cuantización en las partes pesadas. En el otro extremo, un propietario de una 5090 ejecutó el denoiser BF16 completo de Qwen Image 2.1 sin cuantizar, necesitando un codificador de texto cuantizado solo como optimización de memoria. Apple Silicon cerró la brecha de otra manera: 32 GB de memoria unificada ejecutando un runtime nativo de Qwen a aproximadamente 24 segundos por imagen de 512x512.
El hardware más antiguo y humilde tampoco queda excluido. La publicación de EasyAI y AI Horde existen para quienes sus máquinas no pueden ejecutar los modelos actuales en absoluto, y un hilo de larga data del subreddit sobre un portátil con una GPU de clase MX500 muestra que el extremo inferior todavía se las ingenia para alcanzar resultados aceptables con derivados de SD1.5. El mensaje realista es que el piso ha subido a "una PC gamer de los últimos tres años" y el techo se ha quedado exactamente donde estaba, que es lo contrario de cómo van la mayoría de las tendencias de software.
Elegir una configuración, en la práctica
Si estás armando un equipo local ahora, el consenso de la comunidad se divide en tres niveles. VRAM baja, 8 a 12 GB: Z-Image Turbo o variantes cuantizadas de Qwen, con la velocidad como contrapartida. Gama media, 16 GB como esa RTX 5070 Ti: la mayor parte del catálogo abierto actual funciona bien, y la pregunta pasa a ser qué funciones de edición necesitas. Gama alta, 24 GB o más, o Apple Silicon con 32 GB de memoria unificada: Qwen Image 2.1 a precisión completa con edición, LoRAs y flujos de trabajo con múltiples referencias.
El almacenamiento es la restricción subestimada de la que nadie te advierte. Los archivos de modelo para esta generación van desde unos pocos gigabytes para las variantes rápidas hasta más de veinte para precisión completa, y el patrón de flujo de trabajo de ComfyUI de mantener varios modelos instalados se multiplica rápido. La segunda lección del curso universitario dedica un segmento completo a actualizar archivos de modelo sin reiniciar el servidor, lo que te dice que la fricción del flujo de trabajo es lo bastante real como para enseñarla.
Una advertencia honesta de esos mismos hilos: las variantes sin censura y sin restricciones circulan ampliamente, y un lanzamiento con muchas interacciones de uno de esos modelos, Nanosaur 2, atrajo cientos de votos positivos y casi cien comentarios en días. La generación local implica responsabilidad local. Sea lo que sea que ejecutes, eres dueño del resultado, incluida la exposición legal. La propia etiqueta de la comunidad refuerza esto; el fotorrealismo no declarado es vigilado por otros usuarios de forma más fiable que por cualquier plataforma.
Por qué lo local sigue importando
Sería fácil preguntar por qué algo de esto persiste cuando los servicios alojados están a un clic. Los acontecimientos del mes dan la respuesta tres veces. Un producto independiente en torno al cual la gente se había integrado, DALL·E, fue retirado a finales de agosto y absorbido por ChatGPT Images, migrando a todos según el calendario de otro. Los planes gratuitos de las herramientas alojadas fluctúan con decisiones de facturación que los usuarios no controlan. Y AI Horde demostró el tercer camino: una red de inferencia colaborativa gestionada por voluntarios, lo bastante antigua como para haber sobrevivido a varios giros comerciales.
La generación local es la única opción cuyo roadmap tú controlas. Los modelos se ejecutan a la misma velocidad el año que viene que hoy, los pesos no cambian bajo un prompt y las herramientas mejoran en público. Con un modelo de 7B que se mide cerca de sistemas frontera y front ends de un clic que reemplazan la arqueología de grafos de nodos, la pregunta ha cambiado. Antes era "¿mi máquina puede ejecutar esto?". Ahora es "¿cuál de estos quiero en realidad?"
Artículos relacionados
Generar imágenes con IA en casa: una guía realista para 2026
La generación local de imágenes con IA por fin funciona en hardware corriente. Esta es la guía realista para 2026: tarjetas, modelos, herramientas y los costes de los que nadie habla.
Veinte nuevos modelos de imagen al mes, y mis prompts siguen funcionando: el caso del prompting centrado en la estructura
Por qué los prompts centrados en la estructura sobreviven a la rotación de modelos, y qué conservar y qué descartar en tu biblioteca de prompts.
Hacer una microserie animada con IA en solitario: proceso completo del guion al montaje final
Desglose completo en cinco pasos: guion, storyboard, generación de imágenes, voces y montaje. Incluye consejos para mantener la consistencia de los personajes y una guía para evitar errores; tú solo también puedes crear una microserie animada con IA.
Guizang PPT Skill: crea impresionantes presentaciones HTML directamente en Claude Code
Guizang PPT Skill convierte cualquier artículo en una presentación HTML pulida, con estilo revista o suizo, imágenes por IA, herramientas de presentador e instalación mediante npx o git clone.